Claude Opus 5.5 资料评测:单价比 Astra 低 60%,任务成本也更低吗?
从第三方编码与知识工作评测、标准 API 价格、思考档位和输出用量,判断 Opus 5.5 的真实取舍。它的输入与输出单价比 Astra 低 60%,但实际工作是否省钱,还要看思考、重试与交付质量。
2026 年 9 月 22 日,Anthropic 发布 Claude Opus 5.5。它面向长时间运行的编码智能体和知识工作,标准 API(应用程序接口,读音 ay-pee-eye)价格降到每百万输入 token 4 美元、输出 token 20 美元。与 GPT-6 Astra 的标准输入、输出价格相比,两项都低 60%。单看价目表,这次更新已经值得关注;问题是,便宜的模型调用,是否一定能换来便宜的工作成果?Anthropic 模型规格和 Astra 模型文档给出了计算依据。
答案不能只靠价格表。模型每次想多久、生成多少内容、失败后重试几次,以及最后交出来的东西能不能用,都会进入账单。本文依据截至 2026 年 9 月 27 日的官方资料与第三方评测,分别讨论能力和成本;没有把公开数据包装成本站调用实测。
这次的 Opus,首先是一个长任务模型
官方文档列出的能力边界很清楚:文字和图片输入,文字输出;上下文窗口为 1M,常规最大输出为 128K;自适应思考始终开启,默认采用 medium 中档。这里的 token(模型处理与计费单元,读音 toh-kuhn)不是汉字数,1M 也不能直接换算成“能准确理解一百万个汉字”。完整规格与限制
这些规格意味着它可以接收大量工作材料,却不自动证明它在所有长文任务里都更准确。读进一整个项目,与找对其中那个决定需求边界的句子,是两件事。同样,支持图片不等于已经证明它能稳定识别密集后台页面里的每个数字。
因此,评价 Opus 5.5 不宜只看聊天答案是否流畅,更该看它能否带着材料完成工作:查阅文件、调用工具、形成交付物,再根据反馈继续修改。下面的独立评测,正好提供了几种不同观察角度。
编码和知识工作有竞争力,但不是每项都领先
Artificial Analysis(独立模型评测机构,读音 ar-tuh-fish-uhl uh-nal-uh-sis)的发布评测中,Opus 5.5 最高思考档在其综合指数获得 58 分;同一发布系列比较页列出的 Astra 最高档为 53 分。这是该版评测指数的结果,不是“智能高出 9.4%”,也不能和几个月前换过测试组合的指数直接画成进步曲线。同系列比较
比总分更有用的是拆开看。

*图:Artificial Analysis 9 月 22 日发布评测,综合指数图标注 v4.3;下半部分费用横轴为对数刻度。图中的思考档位、回退标记和测试集合均应保留,不能把柱高解释为所有任务的胜率。*
| 观察方向 | 第三方结果 | 能说明什么 |
|---|---|---|
| 终端与编码任务 | Terminal-Bench 4.0 为 59.6%;评测方称与 Astra 的 xhigh 档表现相当 | 在该执行体系下,两者均能处理较难的终端工作;不能据此宣称 Opus 在所有代码任务上胜出 |
| 专业知识工作 | GDPval-AA v2.1 为 1846 Elo,比 Fable 5.1 高 111 | 对专业任务交付有较强竞争力;这里的对照是 Fable,不是 Astra |
| 专业交付物 | AA-Briefcase v1.1 为 1822 Elo | 评测方同时观察到分析质量和呈现质量的优势 |
这些结果来自 AA 的原始评测说明。Elo 是相对比较评分,不是正确率;AA-Briefcase 使用其参考智能体执行框架 Stirrup,成绩包含模型与执行环境共同作用。该次评测还开启了 Anthropic 默认回退机制,不能将它解释为完全脱离产品机制的裸模型能力。

*图:AA 的专业交付物相对评分。原图保留不同思考档位和回退标记;发布文字与图表对 Fable 5.1 的差值存在 1 分出入,本文不合并修正该差值,也不据此作精确提升比例判断。*
同一份评测也保留了没有领先的地方:CritPt、AA-LCR 和 GDP.pdf 等项目仍落后。这个信息与 1M 上下文规格放在一起看,尤其重要。容量很大,不等于长材料中的检索、判断和文档理解已经没有短板。AA 对优势与落后项目的说明
对需要写需求分析、研究报告或方案的人,这些证据足以让 Opus 5.5 进入候选名单;但不能把专业交付物评分进一步改写成“已经证明中文 PRD 最准确”或“做出的界面最好看”。那需要对应材料、验收标准和实际产物,而不是再换一张总分图。
“低 60%”算的是单价,不是完整任务
先把价格条件摆出来。下表单位为美元/每百万 token,采用标准处理价格;Astra 对应输入不超过 272K 的请求,不包含加速、批处理、工具和地区附加费用。
| 模型 | 非缓存输入 | 缓存读取 | 输出 |
|---|---|---|---|
| Claude Opus 5.5 | 4.00 | 0.20 | 20.00 |
| GPT-6 Astra | 10.00 | 1.00 | 50.00 |
价格来自 Anthropic 规格页与 OpenAI 模型文档。据此计算,Opus 的非缓存输入、输出单价各低 60%,缓存读取低 80%。
假设两个模型各使用 10 万非缓存输入 token、1 万计费输出 token,且没有其他费用:Astra 为 1.50 美元,Opus 为 0.60 美元。这是用相同计费量做的算术比较,不是“完成同一份需求文档”的实测账单。同一文本在不同分词器下可能得到不同 token 数,更不用说模型的思考长度并不相同。
缓存也不能只看最便宜的一栏。Opus 的五分钟缓存写入价是 5 美元,一小时为 8 美元;只有实际命中后,读取才按 0.20 美元计算。把第一次装入项目材料也算成缓存读取,会高估节省。缓存价格与条件
一个容易被忽略的变量:最高档会写多少
AA 的发布评测补充了一项比“便宜 60%”更值得注意的数据:最高档 Opus 5.5 在每项综合指数任务中平均使用约 119K 输出 token,而 Astra 最高档约为 27K。Opus 5.5 的输出量也约为前代 Opus 5 的 1.6 倍;AA 因而观察到,虽然单价降低,它相对前代的每任务成本仍大致相当。输出用量与任务成本说明
只取这组平均输出量,按标准输出单价计算,输出部分约为:Opus 2.38 美元,Astra 1.35 美元。这不是完整任务费用,因为尚未计入输入、缓存、回退或其他成本;它只是说明,一个单价较低的模型,完全可能因为用了更多计费输出,在某一费用项上反而更高。
所以,真正应该比较的不是“每百万 token 便宜多少”,而是“达到同一验收要求,最终花了多少”。如果多花的思考能减少返工,它可能值得;如果只是把已经明确的任务反复推演,更高的档位就未必划算。
不要把最高档成绩配上最低档成本
同一个 Opus 5.5,档位不同,表现和费用也会变化。AA 页面在本次核对时给出以下快照:
| 思考档位 | 综合指数 | 每项指数任务平均成本 |
|---|---|---|
| low,低档 | 42 | 0.55 美元 |
| medium,中档 | 51 | 1.34 美元 |
| high,高档 | 54 | 1.82 美元 |
来源分别是 低档、中档和 高档评测页。这些费用针对评测集合,不能当作一次网站修改的报价。
从这组数据可以提出一个工作假设:材料整理、格式转换、明确范围的小修改,不必默认使用最高档;复杂约束、多文件修改、容易漏条件的分析,再考察提高档位是否带来足够收益。这是需要在具体任务中验证的使用策略,不是这三行数据已经证明的通用最优配置。
更稳妥的选择过程,是先固定一组真实任务和验收清单,再观察中档在哪些地方失败。只有提高档位确实减少这些失败,额外思考才有可解释的价值。
旧智能体接入时,有几处不能只改模型名
价格和能力之外,兼容性也是采用成本。官方概览列出了几项会影响旧客户端的变化:不能关闭思考;旧的强制工具选择方式会报错;思考块与模型、会话绑定;在 Claude API 和 Google Cloud 上,旧版电脑操作工具需要迁移。另一个容易误判的问题是,默认显示设置下,工具调用之间的部分文本可能不再作为可见进度消息返回。官方接入变化
这意味着“界面一段时间没有输出”与“模型没有继续工作”未必是同一回事,也意味着一个只适配旧版消息结构的客户端,可能无法正确展示过程。迁移时,应分别检查请求参数、工具定义、会话状态和进度展示,而不是拿到一条成功回答就宣布全部兼容。
值得比较的不是谁赢了所有题,而是谁更适合这项工作
综合目前证据,Opus 5.5 的亮点可以概括为:标准输入与输出单价显著低于 Astra,编码和知识工作有较强第三方结果,中高档之间也存在可选择的成本空间。它不是仅靠低价吸引注意的模型。
另一方面,最高档较大的输出用量、部分长材料与专业推理项目的短板,以及旧客户端的接入变化,都应计入判断。对中文需求、复杂界面理解和长期多轮执行,现有公开测试还不能代替自己的验收。
一份有意义的对照记录,至少应同时保留任务是否通过、完整调用费用、人工返工时间和使用档位。把这几项放在一起,才能回答开头的问题:Opus 5.5 的单价确实更低,但对某一项实际工作而言,便宜多少,要等交付物通过验收之后再算。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Meta Muse:给 AI 一台云端电脑,它能替你处理多少事务?
Meta 在 Connect 2026 继续扩展 Muse 的连接器、语音与眼镜计划。从专属云端电脑、持续任务到独立权限检查,看看个人智能体怎样从回答问题走向代办事务,以及哪些能力仍不能当作已经全面开放。
GLiNER2.5-Decide:哪些选择题,不必再让大模型长篇推理?
Fastino 发布可本地运行的结构化决策模型。它怎样给候选答案打分、让多个判断遵守共同约束?结合英文测试、CPU 与 GPU 延迟,以及多语言版本的区别,解释它适合分担哪些工作、不能替代什么。
GPT-6 Sol、Luna 能力与成本评测:接近哪些旗舰,做完工作能省多少?
一张表按综合能力从高到低比较国内外主流模型,一张表按统一用量费用从高到低比较九家厂商的官方价格。最后给出我们对旗舰选择、日常主力和低成本任务的判断,看清 Sol、Luna 的位置与取舍。