Kimi K3 冲进全球前四:游戏、3D 与编码很强,但还没有全面超过 Fable 5 与 GPT-5.6
Kimi K3 以 2.8 万亿参数、原生视觉和 100 万上下文切入长程编码,在游戏开发、3D 推理和 GPU 编程上展示出鲜明优势;官方与独立测评同时表明,它已进入第一梯队,但综合体验仍未全面超过 Claude Fable 5 和 GPT-5.6 Sol。
月之暗面在 2026 年 7 月 17 日发布 Kimi K3。它不是一次常规参数升级,而是一个 2.8 万亿参数的稀疏 MoE 模型:原生支持视觉输入,提供 100 万 token 上下文,并把长程编码、知识工作和复杂推理放在同一套 Agent 能力里。Kimi K3 官方技术博客称其为首个开放的 3T 级模型,同时也坦率写明:K3 的综合表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。
这句话给出了更准确的测评结论。K3 已经进入全球第一梯队,在部分编码与视觉任务上能赢过两个美国旗舰模型;但它还不是所有任务都更强,也没有足够独立证据证明厂商展示的游戏和 3D 效果能稳定复现。
2.8 万亿参数不等于每次都调用 2.8 万亿参数
K3 建立在 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE 之上。总参数量达到 2.8 万亿,但每个 token 只激活 896 个专家中的 16 个。官方称,这套结构相较 Kimi K2 带来约 2.5 倍的整体扩展效率。它的意义不是单纯把模型做大,而是尝试在超大模型容量、推理成本和长上下文之间找到新的平衡。
K3 已上线 Kimi.com、Kimi Work、Kimi Code 与 API;完整权重计划在 7 月 27 日前发布,技术报告也要到后续才公开。API 的缓存命中输入、未命中输入和输出价格分别为每百万 token 0.30、3 和 15 美元。官方建议自部署使用至少 64 张加速卡组成的超节点,这意味着“开放权重”不等于普通团队可以低成本本地运行。
编码测评不是横扫,而是互有胜负
官方完整基准里,K3 在 Program Bench 得到 77.8,略高于 Fable 5 的 76.8 和 GPT-5.6 Sol 的 77.6;在 SWE Marathon 上得到 42.0,也高于二者的 35.0 和 39.0。Terminal Bench 2.1 中,K3 的 88.3 接近 GPT-5.6 Sol 的 88.8,高于 Fable 5 的 84.6;但在 DeepSWE 上,K3 的 67.5 低于 Fable 5 的 70.0 和 GPT-5.6 Sol 的 73.0。在 FrontierSWE 上,K3 的 81.2 高于 GPT-5.6 Sol 的 71.3,却落后 Fable 5 的 86.6。
| 任务侧重点 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| 长程仓库与终端执行 | 第一梯队,部分项目领先 | 稳定性和整体体验仍占优 | 终端与 Codex 工具链很强 |
| GPU 内核与编译器 | 厂商自测尤其突出 | 接近 K3,但部分测试可能回退 Opus | 在 Kimi 的专项测试中落后 |
| 游戏、前端与 CAD | 原生视觉闭环是鲜明卖点 | UI 与游戏编码已有成熟口碑 | 代码与视觉质量均衡 |
| 综合体验 | 能力强,但更慢、更啰嗦 | 官方定位仍高于 K3 | 官方定位仍高于 K3 |

*图:Kimi K3 官方技术博客给出的模型基准对比。不同模型使用 KimiCode、Claude Code 或 Codex 等不同 Agent harness,不能把每个分数都理解为完全同条件实验。*
官方还展示了更接近真实工程的专项任务:K3 在相同沙箱中连续运行最多 24 小时优化 GPU 内核,表现与可能触发回退的 Fable 5 接近,并明显超过 Opus 4.8、GPT-5.6 Sol 和 GPT-5.5;它还从零开发了 MiniTriton 编译器,在支持的 roofline 测试上达到或超过 Triton 与 torch.compile。这些案例证明 K3 能完成跨文件、跨工具、可验证的复杂工程,但数据仍主要来自发布方测试。

*图:Kimi 官方公布的 MiniTriton CUDA Core roofline。图中展示的是官方限定任务和硬件环境下的结果,能够说明长程编码与性能优化能力,但不能替代第三方在更多算子、硬件和工程约束下的复测。*
游戏开发与 3D 能力,强在“看见结果再改代码”
K3 的游戏与 3D 能力并不是独立的“3D 生成模型”,而是编码、视觉理解和长程 Agent 执行的组合。它可以读取概念图、截图或视频,生成可运行场景,再通过实时截图观察布局、光照、碰撞和交互结果,继续修改代码。官方把它称为 “vision in the loop”。这比只根据文字写一轮代码更适合游戏原型、WebGL 场景、交互式数据可视化、前端页面和 CAD 辅助任务。

*图:Kimi 官方案例中的浏览器 3D 开放世界。官方称该项目使用 Three.js WebGPU、GPU compute 和程序化环境生成,并调用外部 3D 资产工具制作骑手与马匹模型;这是厂商案例截图,不是独立游戏质量测评。*

*图:Kimi 官方展示的 1930 年代机械打字机 Web 应用。官方称 K3 用 4 个子 Agent 构建 Vite、TypeScript、React 与 Three.js 项目,并实现 242 个独立动画部件和 OOXML 导出,用于说明其 3D、前端与长程编码的组合能力。*
视觉基准也显示它确实有竞争力:MMMU-Pro 为 81.6,略高于 Fable 5 的 81.2、低于 GPT-5.6 Sol 的 83.0;OmniDocBench 为 91.1,高于二者的 89.8 和 85.8;PerceptionBench 为 58.5,介于 Fable 5 的 57.2 和 GPT-5.6 Sol 的 59.7 之间。但这些通用视觉分数不能直接等价为“游戏更好玩”或“3D 资产更专业”。游戏和 CAD 的可靠性仍要看复杂项目中的持续迭代、帧率、资产规范、物理系统和人工美术验收。
独立测评确认它很强,也暴露速度和成本问题
Artificial Analysis 的独立模型页目前给 K3 的 Intelligence Index 评分为 57,在 189 个同类模型中排第 4;输出速度约 62 token/秒,排名第 90。该机构同时指出,K3 输出明显偏长,同类任务的价格也不算低。这与官方列出的局限一致:K3 对完整思考历史比较敏感,中途从其他模型切换过来可能明显掉质;它在模糊任务中还可能过度主动,替用户做出未授权决定。
与竞品相比,Anthropic 的 Fable 5 页面强调长期自主工作、视觉和大型代码迁移,API 价格为每百万 token 10 美元输入、50 美元输出;OpenAI 的 GPT-5.6 发布说明则把 Sol 定位为高端通用与 Agent 模型,输入和输出价格分别为 5 和 30 美元。K3 的标价更低,缓存命中时优势更大,但更慢、更啰嗦会抵消一部分成本优势。
最适合先试的,是可验收的游戏原型和复杂编码任务
如果要验证 K3,优先选择三类任务:第一,给定参考图和明确交互规则,做一个可玩的 2D/3D 小型原型;第二,在真实仓库里完成跨文件功能、测试和修复;第三,让它针对 GPU 内核、数据处理或科学计算给出可运行实现。验收时不要只看最终截图,应同时检查代码结构、依赖、性能、测试、资源许可和是否越权改动。
现阶段最稳妥的判断是:Kimi K3 已经把中国开放模型推到与 Fable 5、GPT-5.6 Sol 正面竞争的位置,游戏、3D 视觉闭环和长程编码是它最值得关注的三项能力;但“专项领先”还不能写成“综合超越”。等完整权重、技术报告和更多独立复测公布后,才能判断它的惊艳演示究竟有多少能变成稳定生产力。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。
MCP 2026-07-28 转向无状态:GitHub Server 提前适配了什么
MCP 2026-07-28 稳定规范移除了协议会话与 initialize 握手,把连接上下文放回每次请求;GitHub MCP Server 的提前适配展示了无状态服务的工程收益,也说明兼容仍依赖版本协商、旧协议回退和一致性测试。
Copilot App 使用数据进入标准报表:能衡量采用,不能直接证明 ROI
GitHub 把 Copilot App 活动纳入企业、组织和用户级标准使用度量,新增用户活跃、会话、请求、Token、模型、语言与代码活动拆分;这些指标适合观察采用与覆盖,不应单独解释为生产力或 ROI。