GPT-6 Sol、Luna 能力与成本评测:接近哪些旗舰,做完工作能省多少?
以当前官方供售型号为范围,统一比较九家厂商的模型能力与按量价格,再从编程执行、长文档、事实可靠性和响应速度四个角度解读公开测评。剔除旧代与已替代接口,给出 Sol、Luna 如何分工的判断。
Sol 和 Luna 值不值得用,不能只看价目表,也不能只看一个总分。OpenAI 将 Sol 放在能力与成本的平衡位置,将 Luna 面向成本敏感的大批量任务;真正需要判断的是,它们能否把代码改好、把资料读明白,以及省下的钱会不会又花在等待和返工上。OpenAI 当前模型目录
本文按 2026 年 9 月 28 日的官方供售资料与公开评测更新。两张主表采用同一组 14 个当前可选型号,覆盖 9 家厂商,排除旧代对照、已被替代的接口和未核清对应费率的型号。这里不是销量榜;下面的成绩来自评测机构,费用按官方费率计算,场景取舍则是我们的判断,并非本站调用实测。
当前主流模型能力对比:从高到低
采用 Artificial Analysis 的智能指数 v4.3.2,按综合指数降序排列,不把不同版本的榜单拼在一起。分数相同不代表每项能力相同,也不等于在相同计算预算下打平。当前综合榜及评测口径
| 模型 | 评测配置 | 综合指数 |
|---|---|---|
| Claude Opus 5.5 | max,默认回退 | 58 |
| GPT-6 Astra | max | 53 |
| Claude Fable 5.1 | max,默认回退 | 53 |
| GPT-6 Sol | max | 48 |
| Grok 4.7 | xhigh | 46 |
| GLM-5.3 | max | 45 |
| Qwen3.8-Max(0902) | 推理版,原评测配置 | 45 |
| Kimi K3 | max | 44 |
| GLM-5.3-Flash | 推理版,原评测配置 | 42 |
| Gemini 3.8 Flash | high | 41 |
| DeepSeek V4.1 Flash | max | 39 |
| Claude Sonnet 5 | max | 38 |
| GPT-6 Luna | max | 37 |
| MiniMax-M3 | 推理版,原评测配置 | 29 |
max、xhigh、high 是来源中的思考档位标签;没有明确标签的型号不自行补成最高档。Qwen 固定到 0902 版本;MiniMax 使用当前 v4.3.2 分数,而不是发布时旧指数的成绩。综合指数不是正确率,不能用两个分数相除计算“保留了多少旗舰能力”。旗舰配置对照、Qwen 当前版本与MiniMax 当前结果
当前主流模型价格对比:从高到低
输入、输出单价均为美元/每百万 token(模型计量单元,读音 toh-kuhn)。按“10 万非缓存输入+1 万计费输出”的基础费用降序排列,公式为:0.1×输入单价+0.01×输出单价。
最后一列是上述假设用量的 API(应用程序接口,读音 ay-pee-eye)费用,不是包月价格,也不是做完一个项目的报价;不含额外缓存写入、存储、工具与税费。模型相同而时段不同的费率分行显示,其他型号与能力表一一对应。
| 模型/计价条件 | 输入单价 | 输出单价 | 10万输入+1万输出费用(美元) |
|---|---|---|---|
| GPT-6 Astra · 标准档 | 10.00 | 50.00 | 1.5000 |
| Claude Fable 5.1 · 标准档 | 10.00 | 50.00 | 1.5000 |
| Claude Opus 5.5 · 标准档 | 4.00 | 20.00 | 0.6000 |
| Kimi K3 · 官方美元接口 | 3.00 | 15.00 | 0.4500 |
| GPT-6 Sol · 标准档 | 2.00 | 10.00 | 0.3000 |
| Claude Sonnet 5 · 标准档 | 2.00 | 10.00 | 0.3000 |
| Grok 4.7 · us-east-1,≤200K | 2.00 | 6.00 | 0.2600 |
| Qwen3.8-Max(0902) · 新加坡/国际 | 2.00 | 6.00 | 0.2600 |
| GLM-5.3 · 官方按量 | 1.40 | 4.40 | 0.1840 |
| Gemini 3.8 Flash · 年底前优惠 | 0.75 | 3.75 | 0.1125 |
| DeepSeek V4.1 Flash · 高峰 | 0.30 | 1.20 | 0.0420 |
| MiniMax-M3 · 标准档,≤512K | 0.30 | 1.20 | 0.0420 |
| DeepSeek V4.1 Flash · 非高峰 | 0.15 | 0.60 | 0.0210 |
| GLM-5.3-Flash · 官方按量 | 0.15 | 0.50 | 0.0200 |
| GPT-6 Luna · 标准档 | 0.10 | 0.50 | 0.0150 |
Gemini 优惠截至 2026 年 12 月 31 日。DeepSeek 高峰为非中国法定节假日的周一至周五,UTC+8 的 09:00—12:00、14:00—18:00,其余时间为非高峰;本文只比较官方当前推荐的 deepseek-flash 所对应的 V4.1 Flash,不再把旧兼容接口当成另一款独立在售模型。Qwen 使用新加坡国际部署美元价,MiniMax 已是折扣后的标准价。长上下文、加速档和其他地区不能直接套用这张表。DeepSeek 型号迁移公告
总分之外,四种实际表现更值得看
编程与工具执行:会写代码,不等于能把活干完
修改一个原型页面,生成代码只是开头,还要找到相关文件、处理报错、运行检查。终端任务评测考察的正是这类执行能力,而不只是能否写出一段看起来正确的答案。在 Terminal-Bench 4.0(终端任务评测,读音 ter-muh-nuhl bench)中,Astra max 为 59%,Sol max 为 44%,GLM-5.3 max 为 42%,GLM-5.3-Flash 为 33%,Luna max 为 13%。Sol 与 Astra 分项、GLM 分项及Luna 分项
业务自动化的差距又不一样:Sol 与 GLM-5.3 在 AutomationBench-AA 中均为 62%,Luna 为 53%。因此我们的倾向是:让 Sol、GLM-5.3 先承担需要连续使用工具的工作,难题再升级;Luna 可以从结果易核对的步骤开始,而不是因为单价低就接管整个代码仓库。这里给的是试用顺序,不是保证一次完成。自动化分项对照与Luna 自动化结果
长文档:放得进去,与读得准确是两回事
读长需求文档时,Luna 未必像综合分差距表现得那么弱。AA-LCR v1.1 长上下文推理中,Sol、Luna、Astra 分别为 84%、83%、81%。这说明 Luna 值得进入长文处理候选名单,但 1~3 个百分点的小差距不足以宣布谁稳定领先。这项测试使用约 1 万到 10 万 token 的文档,也不能证明将百万级上下文装满后仍然同样可靠。长文分项结果、Astra 对照与文档长度及方法
换成专业 PDF 文档推理,结果就变成 Astra 31%、Sol 25%、Luna 20%。GDP.pdf 使用严格的全项通过口径,这不是“只认对了三成文字”的意思,也不能与前面的长文百分比直接横比。对照材料中的条款、核对复杂表格、形成可交付结论,与把长文压缩成摘要不是同一难度;我们的判断是,Luna 可以先做材料整理,重要结论仍需要更强模型或人工复核。PDF 评测定义、Sol 与 Astra及Luna 结果
事实可靠性:答得顺,不代表可以直接引用
写方案、做选题和补充背景知识,还要看模型是否会在不知道时编出一个答案。AA 的知识可靠性指数会奖励正确回答、惩罚错误回答,对拒答不扣分;分数范围为 -100 到 100,并不是幻觉率。知识可靠性评测方法
在这项评测中,Astra max 为 43 分,Sol max 为 27 分,Luna max 为 1 分。这里的 1 分不是“只有 1% 的错误”。我们的判断是:Luna 更适合围绕给定材料做有约束的处理,不宜默认承担需要自行补全大量事实的最终稿;Sol 也仍需对关键数字、引文和外部来源逐项检查。这个知识问答指标不直接等于忠实摘要测试,因此不能反过来断言 Luna 会错误改写所有输入资料。Sol 与 Astra 的可靠性结果及Luna 的可靠性结果
响应速度:输出快,不一定更早拿到答案
查阅时的性能快照中,Luna max 约每秒输出 167 个 token,Sol max 约 89 个;但相应测试的首个答案等待时间分别约为 96 秒和 138 秒。两种数字衡量的不是一件事:一个是开始输出之后的速度,一个包含模型在给出答案之前的等待。输出速度与首答案时间
模型配置也会改变体验。AA 当前对照中,Sol high 的综合指数为 43,而主表使用的是 Sol max 的 48 分,不能把最高档成绩当成所有档位都能达到的能力。我们不建议日常交互默认把思考档拉满:先用适中的档位处理常规工作,遇到困难再升级。上述时间是该评测条件下的快照,不是每次请求的固定耗时;输入、服务状态和部署都会影响结果。Sol 配置与性能对照与速度测量方法
我们的判断:主力看均衡,便宜模型要用在合适的位置
追求能力上限,我们会先试 Opus 5.5,再按具体难题比较 Astra、Fable。Opus 在本组选定配置中的综合成绩更高、基础单价也低于后两者,但这只是优先测试它的理由,不是所有工作都由它胜出的保证。旗舰评测对照
日常开发、需求分析和多步骤执行,我们更看好 Sol 作为主力候选。它不是市场最低价,却在本组综合成绩、终端执行与价格之间形成了较好的平衡。GLM-5.3 和 Qwen3.8-Max(0902)也应该放进同一轮试用,而不是因为 OpenAI 降价就把已经稳定的工作流全部换掉。具体到编程收尾与重要资料判断,本文的分项证据比“只差几个总分”更有参考价值。
压低批量成本时,Luna 是本表最便宜的选项,但我们不建议让它无审核地负责最终事实判断和复杂执行。需要更多工具操作时,我们会把 GLM-5.3-Flash、DeepSeek V4.1 Flash 一起列入候选;MiniMax-M3 则保留为低价接口的实测备选,不因单价相近就假设能力相同。先用一批真实任务检查通过率,再决定是否扩大使用。
一句话概括我们的结论:Sol 值得做主力候选,Luna 值得做低成本助手,但两者都不该只凭总分或单价包办全部工作。模型选型要同时看执行、文档、可靠性和等待时间;少一次返工,有时比再省一点调用费更有价值。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Meta Muse:给 AI 一台云端电脑,它能替你处理多少事务?
Meta 在 Connect 2026 继续扩展 Muse 的连接器、语音与眼镜计划。从专属云端电脑、持续任务到独立权限检查,看看个人智能体怎样从回答问题走向代办事务,以及哪些能力仍不能当作已经全面开放。
GLiNER2.5-Decide:哪些选择题,不必再让大模型长篇推理?
Fastino 发布可本地运行的结构化决策模型。它怎样给候选答案打分、让多个判断遵守共同约束?结合英文测试、CPU 与 GPU 延迟,以及多语言版本的区别,解释它适合分担哪些工作、不能替代什么。
Claude Opus 5.5 资料评测:单价比 Astra 低 60%,任务成本也更低吗?
从第三方编码与知识工作评测、标准 API 价格、思考档位和输出用量,判断 Opus 5.5 的真实取舍。它的输入与输出单价比 Astra 低 60%,但实际工作是否省钱,还要看思考、重试与交付质量。