Qwen3.8-27B 评测观察:官方对比多项反超 Opus 4.6 Max,终端编码与硬推理仍落后

2026-08-14 阿里开源 Qwen3.8-27B:27B 稠密原生多模态模型,Apache 2.0,262K 上下文可扩至 1M,量化后单张 24GB 消费级显卡可跑。官方模型卡全表显示,与 Opus 4.6 Max 可直接对比的 17 项中 13 项领先(SWE-bench Pro 61.7 vs 53.4、OSWorld 84.3 vs 72.7),但 Terminal Bench 2.1、NL2Repo、GPQA、HLE 四项落后;第三方追踪榜单处于中游偏上,无单项进前三。本文对照 GLM-5.3、GPT-5.6 Sol、DeepSeek-V4-Pro 等热门模型给出选型观察,全部数据可溯源,未做独立实测。

浏览 180
Qwen3.8-27B 评测观察:官方对比多项反超 Opus 4.6 Max,终端编码与硬推理仍落后封面

2026 年 8 月 14 日晚间,阿里千问团队通过"千问大模型"公众号宣布 Qwen3.8-27B 正式开源,权重同步上架 Hugging Face 与魔搭社区,许可证为 Apache 2.0。这是一个 27B 参数的稠密(Dense)原生多模态模型,支持图片与视频输入,原生 262K 上下文、经 YaRN 可扩展至 1M。由于量化后单张 24GB 消费级显卡即可整卡装载,发布当天即引发 Reddit r/LocalLLaMA 社区刷屏,网友用其复刻的俄罗斯方块、贪吃蛇等 demo 广泛传播(量子位报道)。

本文是一篇评测观察:把 Qwen 官方模型卡的对比全表、第三方追踪榜单的跨模型口径放在一起读,回答两个问题——它到底比 Opus 4.6 Max 强在哪、弱在哪;放到当前热门模型里它处于什么位置。本文全部数据来自厂商公布与第三方追踪口径,未做独立实测。

先说结论

  • 官方口径下,Qwen3.8-27B 与 Opus 4.6 Max 可直接对比的 17 项中 13 项领先、4 项落后。领先集中在软件工程、Agent 办公与全部多模态项;落后集中在 Terminal Bench 2.1、NL2Repo、GPQA 与 HLE——即终端长程编码与硬推理。
  • 第三方追踪口径(AI Release Tracker,截至 8 月 15/16 日)中,它没有单项进入前三,最接近的是 LiveCodeBench(90.3,第 4);与 GPT-5.6 Sol、Claude Fable 5 等前沿闭源模型在长程任务上仍有 15~30 分差距。
  • 它的真正卖点不在"跑分第一",而在部署组合:Apache 2.0 + 27B 单卡可跑 + 原生多模态 + 262K 上下文,这是当前本地 Agent 开发者最难在别处同时拿到的东西。

模型本体:架构没换,训练换了

对照 NxCode 的架构核对,Qwen3.8-27B 的 config.json 与上一代 Qwen3.6-27B 完全一致:64 层、隐藏维度 5120、Gated DeltaNet 线性注意力与 Gated Attention 混合布局、多 token 预测(MTP),继续使用 qwen3_5 实现。也就是说,这一代的提升来自训练与后训练,而非新架构。

推理控制方面:思考模式默认开启,reasoning_effort 分 xhigh(默认)/ medium / low 三档,preserve_thinking 可跨轮保留推理上下文。官方最佳实践提示,调低 effort 不一定缩短总任务时间——分析不足会导致更多重试,Agent 场景应保留充足的输出预算。

部署侧,Ollama 已上架 18GB 标准包与 Apple Silicon MLX 包;官方同时发布面向 vLLM / SGLang / Transformers / TokenSpeed 的 FP8 权重。社区反馈 RTX 3090 / 4090(24GB)量化后可整卡装载,16GB 显存卡也能以更低量化档运行;API 侧 OpenRouter 定价为每百万 token 输入 $0.45 / 输出 $3.20

单独对比:与 Opus 4.6 Max 的官方全表

先界定对比对象:Qwen 官方图表中的对手标注为 "Opus4.6 Max",即 Anthropic 2026 年 2 月 5 日发布的 Claude Opus 4.6(API 定价 $5 / $25,1M 上下文)在最高推理档的成绩。需要注意,第三方追踪站显示 Anthropic 此后已发布更新的 Opus 型号,因此这组对比并非"对阵 Anthropic 最新旗舰"。

文本能力(官方表,12 项):

基准Qwen3.8-27BOpus 4.6 Max结果
Terminal Bench 2.173.078.2落后 5.2
SWE-bench Pro61.753.4领先 8.3
NL2Repo-Bench42.347.6落后 5.3
DeepSWE 1.142.2--无对比
QwenSWEBench79.063.8领先 15.2
CoWorkBench70.768.2领先 2.5
JobBench33.4--无对比
Agents' Last Exam(Pass@1)20.4--无对比
IFBench79.562.5领先 17.0
GPQA Diamond89.291.3落后 2.1
HLE30.840.0落后 9.2
LiveCodeBench v690.388.8领先 1.5

多模态能力(官方表):OSWorld-Verified 84.3 vs 72.7(领先 11.6)、AndroidWorld 81.9 vs 62.0(领先 19.9)、SWE-MM 38.6 vs 27.1、开启 CI 后 MathVision 94.6 vs 65.5、CharXiv 90.2 vs 85.9、OmniDocBench 1.5 91.1 vs 86.6、ClawEval-MM Pass@3 57.4 vs 52.5——凡 Opus 4.6 Max 有成绩的 VL 项,Qwen3.8-27B 全部领先;WebArena-Verified(64.8)与 Vision2Web(62.9)对方未提供数据。

两点值得展开。其一,媒体报道与全表的差异:中文社区传播最广的"反超 Opus"(SWE-bench Pro +8.3、QwenSWEBench +15.2)都是真实数字,但同一张官方表里 Terminal Bench 2.1、NL2Repo、GPQA、HLE 四项落后并未被同等传播——完整读表,它是一个"多数项领先、终端与硬推理落后"的格局,而非全面碾压。其二,一代跃迁的幅度确实惊人:对比 Qwen3.6-27B,DeepSWE 1.1 从 13.3 升至 42.2(约 3.2 倍)、QwenSWEBench 从 49.3 升至 79.0、OSWorld 从 63.9 升至 84.3、WebArena 从 48.8 升至 64.8,并在多数编程与办公项上反超更大规模的 Qwen3.7-Plus(GPQA 与 HLE 除外),这也是官方宣传"编程、办公场景超越 Qwen3.7-Plus"的依据。

与其他热门模型的对比:第三方追踪口径

把镜头拉远,AI Release Tracker 的跨模型榜单(截至 8 月 15/16 日)给出了另一个坐标系:

基准Qwen3.8-27B(排名)榜单最好成绩保持者
SWE-bench Pro61.7(#8/20)80.3Claude Fable 5
DeepSWE 1.142.2(#13/18)73.0GPT-5.6 Sol
LiveCodeBench90.3(#4/7)93.5DeepSeek-V4-Pro
Terminal-Bench 2.173.0(#18/25)88.8GPT-5.6 Sol
GPQA Diamond89.2(#17/50)94.4GPT-5.4-Pro
HLE(无工具)30.8(#13/19)56.3Claude Opus 5
Agents' Last Exam20.4(#3/3)28.5GLM-5.3
JobBench33.4(#4/5)54.7Muse Spark 1.1

解读:一个 27B 开源模型能在 SWE-bench Pro 挤进前十、LiveCodeBench 距榜首 3 分以内,已经是尺寸上的超额表现;但 DeepSWE(差距 30.8 分)、Terminal-Bench(差距 15.8 分)、HLE(差距 25.5 分)说明在长程硬任务上,闭源前沿仍有明显身位差——这与官方表中"TB2.1 / HLE 落后"互相印证。

同期开源竞品的定位差异更值得注意:

  • GLM-5.3(智谱,8 月 14 日同日发布):744B MoE 基座不变、纯后训练升级,官方口径 Terminal Bench 3.0 28.3 为开源 SOTA、DeepSWE v1.1 66.9、CyberGym 84.5%,权重预计 8 月 28 日后放出。它的 DeepSWE 与 ALE 成绩都明显高于 Qwen3.8-27B——但那是 744B 对 27B 的对比,部署生态位完全不同。
  • DeepSeek-V4-Pro(8 月 13 日 GA):LiveCodeBench 93.5 榜首,本站已在前文覆盖;API 形态强、暂未开源权重。
  • Muse Glimmer-30B(Meta,8 月 10 日,Apache 2.0):最直接的尺寸竞品,但在 Qwen 官方表中全面被压制(TB2.1 51.7 vs 73.0、SWE-bench Pro 51.2 vs 61.7、OSWorld 65.9 vs 84.3)。
  • NVIDIA Nemotron 3.5 Lightning(8 月 11 日):30B-A3B MoE 走速度与效率路线,与本文主角的"稠密全能"路线形成互补。

口径与限制:怎么读这些数字

  1. 官方表全部为 Qwen 自报口径;其中 QwenSWEBench、CoWorkBench、ClawEval-MM 为 Qwen 自有基准,跨厂商可比性有限。
  2. 部分多模态软件工程基准(如 SWE-bench 多模态变体)由其他前沿模型参与评分而非确定性测试,第三方分析均提示应视为"待验证信号"。
  3. 本地部署的量化档位会改变 Agent 行为,官方分数基于原始权重与特定 harness;第三方榜单为追踪站汇总口径,会随后续复测变动。
  4. 本文未做独立实测;所有结论均为对公开口径的整理与对照。

选型建议

  • 适合:本地常驻 Agent(隐私 / 数据驻留要求)、UI 驱动型 Agent(原生视觉输入 + OSWorld / AndroidWorld 领先正是这类任务的画像)、高频低成本调用(OpenRouter 定价约为 Opus 4.6 的 1/11~1/8)、需要 262K 长上下文装下代码库切片的本地循环。
  • 不适合:追求绝对最强终端编码与深度推理(GPT-5.6 Sol、Claude Fable 5 等闭源前沿仍领先 15~30 分)、没有本地 GPU 与运维意愿的团队。
  • 与 GLM-5.3 怎么选:要"今天就能在单卡上跑的权重"选 Qwen3.8-27B;能等 8 月 28 日权重放出并有数据中心资源、追求开源最强编码,再评估 GLM-5.3。

一句话总结:Qwen3.8-27B 不是"本地 Opus 平替"——它在终端与硬推理上还没到那个位置;但它可能是目前"一张消费级显卡上最完整的多模态 Agent 模型",官方表中那 4 个落后项,恰好就是下一步选型时需要用你自己任务集去验证的地方。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

浏览 180
AI 基础设施 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化”封面 NVIDIA PAIR:把家里的 RTX、DGX Spark 和 Mac 变成本地 AI 请求集群,但它不是“显存池化” 可以把 NVIDIA PAIR 理解成家里本地 AI 的“派单前台”:RTX 主机、DGX Spark、Mac 就像几名能力不同的员工,PAIR 看谁在线、谁装了对应模型、谁现在最空闲,就把下一份 AI 工作交给谁。它特别适合多 Agent 并发,但不会把 16GB + 24GB 显存拼成 40GB,也不会把一个大模型拆到多台机器上。 49