Qwen3.8-Max-0902:不是换架构,而是继续 Post-training,发布时 Code Arena 从 1669 升到 1691
Qwen3.8-Max-0902 是 Qwen3.8-Max 的日期快照升级,不是一次新架构发布。阿里云官方文档把重点放在工程级 Coding、长程自主开发、多工具协作与端到端交付;发布时 Code Arena WebDev 从 1669 升到 1691,但实时榜单随后已经变化。
阿里云在 2026 年 9 月 2 日上线 qwen3.8-max-0902,别名 qwen3.8-max-2026-09-02。官方把它定义为 Qwen3.8-Max 的升级快照,而不是一次新的模型架构发布。Alibaba Cloud Model Studio 更新记录
这次升级的重点很明确:更复杂的工程级 Coding、long-horizon autonomous development、collaborative agents、多工具调度、端到端交付,以及更强的图表推理、文档解析和多模态理解。换句话说,0902 更像是在同一个大模型核心上继续把“能写代码”训练成“能把复杂工程任务持续做完”。
0902 首先是一个可锁定的 Dated Snapshot
Qwen3.8-Max 官方模型页保留了基础模型的主要系统规格:1,000,000 token context window,最大输入 991,808,最大输出 131,072;thinking mode 下最大 chain-of-thought length 为 262,144。输入支持 Image / Text / Video,Function Calling、Structured Outputs、Context Cache 等能力仍然可用。
qwen3.8-max-0902 的意义之一,是开发者现在可以显式锁定 9 月 2 日这个版本,而不是只依赖可能继续变化的 qwen3.8-max 浮动别名。对生产 Agent 来说,这一点并不比 benchmark 次要:
- 固定模型版本后,更容易复现同一套任务结果;
- Prompt / Harness / Tool 兼容性可以围绕一个稳定目标做回归;
- 后续
qwen3.8-max再升级时,不必让生产流程被动跟着改变。
因此,0902 更像一次能力升级 + 部署边界冻结。
Post-training 的方向:Coding、Cowork 和长程交付
阿里云官方文档没有把 0902 描述成参数量或架构变化,而是直接强调结果:编码深度进一步突破,可以处理更复杂的工程级项目与长程自主开发;协作 Agent 能力增强,在 multi-tool orchestration 与 end-to-end task delivery 中更稳定;视觉理解也覆盖 chart reasoning、document parsing 和 multimodal perception。Model Studio 更新说明
TechNode 对 Qwen 发布信息的报道进一步指出,这个版本围绕 Coding 与 Cowork 任务做了进一步 post-training。
这类更新的价值不在“某个代码补全题更高”,而在于一个 Agent 能否:
- 把开放需求拆成多步计划;
- 在中途根据工具结果重新规划;
- 调用终端、浏览器、文件系统和测试工具;
- 生成完整应用而不是只输出代码片段;
- 最后验证界面、交互和工程结果是否可交付。
发布时 Code Arena 从 1669 升到 1691,但“第一”不是永久状态
Qwen 在 9 月 2 日发布时称,Qwen3.8-Max-0902 在 Code Arena WebDev 从 1669 提升到 1691,并在当时登上榜首;Arena 官方也在同日确认了这一发布时点结果。Arena.ai Code Arena

但这种榜单最需要注意的就是时间戳。在 9 月 2 日之后,Claude Fable 5.1 等新模型进入,Arena 排名和分数已经继续变化。因此,更准确的写法是:
0902 发布时把 Qwen3.8-Max 的 Code Arena WebDev 分数从 1669 推到 1691,并在当时登顶。
而不是把“当前世界第一”写成一个不会变化的长期事实。
另外,Code Arena 是社区投票型 WebDev 评测,分数会随着样本和投票变化。它很适合观察真实前端开发偏好,却不能替代固定 benchmark 或企业自己的代码库测试。
价格没有因为快照升级而突然变成一个全球统一数字
Alibaba Cloud Model Studio显示,Qwen3.8-Max 在不同部署区域存在不同定价。例如新加坡 International 区的原始 API 价格为每百万输入 token 2 美元、输出 6 美元;美国、东京等 Global 区页面当前显示约 1.65 / 4.951 美元。QwenCloud 与 Code Arena 常见的展示则是 2 / 6 美元。
因此,如果拿它和其他模型做价格对比,必须先统一区域和价格口径。Arena 的 blended $5/MToken 还是另一种把输入 / 输出价格混合后的比较指标,也不等于“API 每百万 Token 固定收 5 美元”。
1M Context 只是空间,长程 Agent 还需要 Harness 把空间用起来
0902 保留 1M context、thinking mode 和完整工具生态,这为长项目提供了足够大的上下文空间。但上下文窗口大并不意味着 Agent 自动就能稳定工作十几个小时。
真正影响长程结果的还包括:
- 什么时候压缩历史上下文;
- 文件和工具结果如何进入当前上下文;
- 是否把状态放进外部 memory / workspace;
- 中断后能否恢复;
- 多工具调用失败时如何重试;
- 长任务里如何持续做 browser / test / terminal 验证。
这也是为什么 0902 的“multi-tool orchestration / end-to-end delivery”比单纯的 1M 参数更值得关注:模型容量只是基础,Harness 决定这些容量能否变成持续执行能力。
这次升级更像“把 Max 磨成一个更成熟的工程 Agent”
Qwen3.8-Max-0902 没有带来一个全新的模型家族,但它提供了一个很典型的 2026 年模型演进方式:基础架构不换,通过持续 post-training、Agent 环境训练、工具协作和版本快照,把同一个旗舰模型不断推向更复杂的真实工作。
对企业和开发团队来说,0902 的价值可以拆成三层:版本可锁定、Coding / Cowork 长程能力升级、价格仍处在较有竞争力的区间。 至于它是否真的比其他头部模型更适合你的代码库,仍然应该拿真实项目、真实 Harness 和真实验收标准做 A/B,而不是只看发布当天的 1691。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
17GB对100GB:Qwen3.8-27B与Flash-Next做同一批任务,省下的容量换来了什么?
同做89项终端任务,17GB的27B首轮完成35项,100GB的Flash-Next完成45项;最多两次是46对53,最多四次是48对60。本文追到9月13日后续结果,区分模型能力、环境故障和返工时间;测试为苹果MLX四位量化,不是GSQ-RCO IQ3_S,也不能套到16GB显卡。
Qwen3.8-Flash-Next每秒70词元?本地加速之前,先看模型究竟改了什么
同样叫Flash-Next,70词元/秒背后可能是另一条计算路径:每词元激活专家从10减到5,再训练共享专家补偿。本文对照单台DGX Spark的两套原始资料,拆开量化、MTP、输入速度、输出速度和并发吞吐,不把128GB统一内存结果套到16GB显卡。
NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”
可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。