Claude Opus 5.5 资料评测:单价比 Astra 低 60%,任务成本也更低吗?

从第三方编码与知识工作评测、标准 API 价格、思考档位和输出用量,判断 Opus 5.5 的真实取舍。它的输入与输出单价比 Astra 低 60%,但实际工作是否省钱,还要看思考、重试与交付质量。

浏览 36
Claude Opus 5.5 资料评测:单价比 Astra 低 60%,任务成本也更低吗?封面

2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5。它面向长时间运行的编码智能体和知识工作,标准 API(应用程序接口,读音 ay-pee-eye)价格降到每百万输入 token 4 美元、输出 token 20 美元。与 GPT-6 Astra 的标准输入、输出价格相比,两项都低 60%。单看价目表,这次更新已经值得关注;问题是,便宜的模型调用,是否一定能换来便宜的工作成果?Anthropic 模型规格和 Astra 模型文档给出了计算依据。

答案不能只靠价格表。模型每次想多久、生成多少内容、失败后重试几次,以及最后交出来的东西能不能用,都会进入账单。本文依据截至 2026 年 9 月 27 日的官方资料与第三方评测,分别讨论能力和成本;没有把公开数据包装成本站调用实测。

这次的 Opus,首先是一个长任务模型

官方文档列出的能力边界很清楚:文字和图片输入,文字输出;上下文窗口为 1M,常规最大输出为 128K;自适应思考始终开启,默认采用 medium 中档。这里的 token(模型处理与计费单元,读音 toh-kuhn)不是汉字数,1M 也不能直接换算成“能准确理解一百万个汉字”。完整规格与限制

这些规格意味着它可以接收大量工作材料,却不自动证明它在所有长文任务里都更准确。读进一整个项目,与找对其中那个决定需求边界的句子,是两件事。同样,支持图片不等于已经证明它能稳定识别密集后台页面里的每个数字。

因此,评价 Opus 5.5 不宜只看聊天答案是否流畅,更该看它能否带着材料完成工作:查阅文件、调用工具、形成交付物,再根据反馈继续修改。下面的独立评测,正好提供了几种不同观察角度。

编码和知识工作有竞争力,但不是每项都领先

Artificial Analysis(独立模型评测机构,读音 ar-tuh-fish-uhl uh-nal-uh-sis)的发布评测中,Opus 5.5 最高思考档在其综合指数获得 58 分;同一发布系列比较页列出的 Astra 最高档为 53 分。这是该版评测指数的结果,不是“智能高出 9.4%”,也不能和几个月前换过测试组合的指数直接画成进步曲线。同系列比较

比总分更有用的是拆开看。

AA 的 Opus 5.5 综合指数和任务成本比较原图
AA 的 Opus 5.5 综合指数和任务成本比较原图

*图:Artificial Analysis 9 月 22 日发布评测,综合指数图标注 v4.3;下半部分费用横轴为对数刻度。图中的思考档位、回退标记和测试集合均应保留,不能把柱高解释为所有任务的胜率。*

观察方向第三方结果能说明什么
终端与编码任务Terminal-Bench 4.0 为 59.6%;评测方称与 Astra 的 xhigh 档表现相当在该执行体系下,两者均能处理较难的终端工作;不能据此宣称 Opus 在所有代码任务上胜出
专业知识工作GDPval-AA v2.1 为 1846 Elo,比 Fable 5.1 高 111对专业任务交付有较强竞争力;这里的对照是 Fable,不是 Astra
专业交付物AA-Briefcase v1.1 为 1822 Elo评测方同时观察到分析质量和呈现质量的优势

这些结果来自 AA 的原始评测说明。Elo 是相对比较评分,不是正确率;AA-Briefcase 使用其参考智能体执行框架 Stirrup,成绩包含模型与执行环境共同作用。该次评测还开启了 Anthropic 默认回退机制,不能将它解释为完全脱离产品机制的裸模型能力。

AA-Briefcase 专业交付物评测原图
AA-Briefcase 专业交付物评测原图

*图:AA 的专业交付物相对评分。原图保留不同思考档位和回退标记;发布文字与图表对 Fable 5.1 的差值存在 1 分出入,本文不合并修正该差值,也不据此作精确提升比例判断。*

同一份评测也保留了没有领先的地方:CritPt、AA-LCR 和 GDP.pdf 等项目仍落后。这个信息与 1M 上下文规格放在一起看,尤其重要。容量很大,不等于长材料中的检索、判断和文档理解已经没有短板。AA 对优势与落后项目的说明

对需要写需求分析、研究报告或方案的人,这些证据足以让 Opus 5.5 进入候选名单;但不能把专业交付物评分进一步改写成“已经证明中文 PRD 最准确”或“做出的界面最好看”。那需要对应材料、验收标准和实际产物,而不是再换一张总分图。

“低 60%”算的是单价,不是完整任务

先把价格条件摆出来。下表单位为美元/每百万 token,采用标准处理价格;Astra 对应输入不超过 272K 的请求,不包含加速、批处理、工具和地区附加费用。

模型非缓存输入缓存读取输出
Claude Opus 5.54.000.2020.00
GPT-6 Astra10.001.0050.00

价格来自 Anthropic 规格页与 OpenAI 模型文档。据此计算,Opus 的非缓存输入、输出单价各低 60%,缓存读取低 80%。

假设两个模型各使用 10 万非缓存输入 token、1 万计费输出 token,且没有其他费用:Astra 为 1.50 美元,Opus 为 0.60 美元。这是用相同计费量做的算术比较,不是“完成同一份需求文档”的实测账单。同一文本在不同分词器下可能得到不同 token 数,更不用说模型的思考长度并不相同。

缓存也不能只看最便宜的一栏。Opus 的五分钟缓存写入价是 5 美元,一小时为 8 美元;只有实际命中后,读取才按 0.20 美元计算。把第一次装入项目材料也算成缓存读取,会高估节省。缓存价格与条件

一个容易被忽略的变量:最高档会写多少

AA 的发布评测补充了一项比“便宜 60%”更值得注意的数据:最高档 Opus 5.5 在每项综合指数任务中平均使用约 119K 输出 token,而 Astra 最高档约为 27K。Opus 5.5 的输出量也约为前代 Opus 5 的 1.6 倍;AA 因而观察到,虽然单价降低,它相对前代的每任务成本仍大致相当。输出用量与任务成本说明

只取这组平均输出量,按标准输出单价计算,输出部分约为:Opus 2.38 美元,Astra 1.35 美元。这不是完整任务费用,因为尚未计入输入、缓存、回退或其他成本;它只是说明,一个单价较低的模型,完全可能因为用了更多计费输出,在某一费用项上反而更高。

所以,真正应该比较的不是“每百万 token 便宜多少”,而是“达到同一验收要求,最终花了多少”。如果多花的思考能减少返工,它可能值得;如果只是把已经明确的任务反复推演,更高的档位就未必划算。

不要把最高档成绩配上最低档成本

同一个 Opus 5.5,档位不同,表现和费用也会变化。AA 页面在本次核对时给出以下快照:

思考档位综合指数每项指数任务平均成本
low,低档420.55 美元
medium,中档511.34 美元
high,高档541.82 美元

来源分别是 低档、中档和 高档评测页。这些费用针对评测集合,不能当作一次网站修改的报价。

从这组数据可以提出一个工作假设:材料整理、格式转换、明确范围的小修改,不必默认使用最高档;复杂约束、多文件修改、容易漏条件的分析,再考察提高档位是否带来足够收益。这是需要在具体任务中验证的使用策略,不是这三行数据已经证明的通用最优配置。

更稳妥的选择过程,是先固定一组真实任务和验收清单,再观察中档在哪些地方失败。只有提高档位确实减少这些失败,额外思考才有可解释的价值。

旧智能体接入时,有几处不能只改模型名

价格和能力之外,兼容性也是采用成本。官方概览列出了几项会影响旧客户端的变化:不能关闭思考;旧的强制工具选择方式会报错;思考块与模型、会话绑定;在 Claude API 和 Google Cloud 上,旧版电脑操作工具需要迁移。另一个容易误判的问题是,默认显示设置下,工具调用之间的部分文本可能不再作为可见进度消息返回。官方接入变化

这意味着“界面一段时间没有输出”与“模型没有继续工作”未必是同一回事,也意味着一个只适配旧版消息结构的客户端,可能无法正确展示过程。迁移时,应分别检查请求参数、工具定义、会话状态和进度展示,而不是拿到一条成功回答就宣布全部兼容。

值得比较的不是谁赢了所有题,而是谁更适合这项工作

综合目前证据,Opus 5.5 的亮点可以概括为:标准输入与输出单价显著低于 Astra,编码和知识工作有较强第三方结果,中高档之间也存在可选择的成本空间。它不是仅靠低价吸引注意的模型。

另一方面,最高档较大的输出用量、部分长材料与专业推理项目的短板,以及旧客户端的接入变化,都应计入判断。对中文需求、复杂界面理解和长期多轮执行,现有公开测试还不能代替自己的验收。

一份有意义的对照记录,至少应同时保留任务是否通过、完整调用费用、人工返工时间和使用档位。把这几项放在一起,才能回答开头的问题:Opus 5.5 的单价确实更低,但对某一项实际工作而言,便宜多少,要等交付物通过验收之后再算。

本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。

浏览 36