DeepSeek V4-Flash 正式版 API 上线:Agent 基准反超自家旗舰预览版
2026 年 7 月 31 日 DeepSeek V4-Flash 正式版 API 上线公测,结构与预览版一致仅重做后训练,官方称 Agent 基准反超 V4-Pro 预览版,输出定价低约三倍。
2026 年 7 月 31 日,DeepSeek 在官方 API 更新日志中宣布 V4-Flash 正式版 API 上线公测,模型名仍为 deepseek-v4-flash,版本号更新至 DeepSeek-V4-Flash-0731。这是一次"转正"而非"换代":模型结构与预览版完全一致,仅重新进行了后训练。真正引发关注的是官方公布的 Agent 基准成绩——厂商称其反超了自家定价更高的 V4-Pro 预览版。
正式版只是"转正",参数与预览版完全一致
根据 DeepSeek 官方 API 文档,V4-Flash-0731 总参数约 2840 亿(284B MoE),激活约 130 亿,模型结构、参数规模与预览版完全相同,差异只在于重新做了后训练。这意味着如果你已经在用预览版跑 Agent,迁移到正式版不会遇到接口层面的结构性变化,主要变化体现在能力与稳定性上。需要划清边界:模型结构一致是官方事实,而"后训练带来能力提升"属于厂商自述,目前没有第三方复现数据支撑。
2840 亿参数 MoE,激活仅 130 亿的经济含义
V4-Flash 延续了 MoE(混合专家)路线:总参数约 2840 亿,但单次推理仅激活约 130 亿。这种"大总参、小激活"的结构直接决定了它能把定价压到当前水平——计费主要按激活量而非总参数计算,这也是 Flash 输出价 $0.28/1M tokens 得以成立的架构前提。需要说明的是,激活参数少不等于能力弱:MoE 的设计目标正是用稀疏激活逼近稠密大模型的效果,但实际推理质量仍取决于训练数据与后训练工艺,激活比例本身并不是能力指标,不应拿它和稠密模型的参数量直接比大小。
Agent 基准:厂商自述的反超结论
官方公布的 Agent 基准成绩如下(厂商自述),覆盖终端任务、代码仓库生成、工具调用与软件工程等评估 Agent 自主完成任务能力的常见维度:Terminal Bench 2.1 为 82.7,NL2Repo 为 54.2,Cybergym 为 76.7,DeepSWE 为 54.4,Toolathlon Verified 为 70.3,Agent Last Exam 为 25.2。DeepSeek 同时声称,V4-Flash 正式版在这些 Agent 基准上反超了 V4-Pro 预览版。这里必须划清边界:基准数值与"反超"结论都来自厂商自述,属于待第三方验证的说法;而 V4-Pro 目前仍是预览版而非正式版,二者并不在同一成熟度上对比。作为编辑判断,Flash 在成本远低于 Pro 的前提下拿到相近甚至更高的 Agent 分数,是这次发布最值得关注的变化,但"反超"能否代表真实业务任务表现,仍需独立评测佐证,尤其这些基准是否对你的工作流有代表性,需要自己判断。
thinking 与 non-thinking 双模式,接口能力对齐旗舰
V4-Flash 正式版默认启用 thinking 模式,同时支持 non-thinking 模式,可按场景切换。接口层面支持 Tool Calls、JSON Output,以及处于 Beta 的 Chat Prefix Completion 与 FIM Completion。上下文长度为 1M tokens,最大输出 384K tokens。兼容性上,它同时支持 OpenAI 和 Anthropic 两种 API 格式,可与 Claude Code、GitHub Copilot、OpenCode 等 Agent 工具直接集成。这意味着原本基于 Claude 或 GPT 接口构建的 Agent 工作流,可以以较低改造成本把后端切换到 V4-Flash,原生 Tool Calls 与 1M 上下文的组合降低了"换模型"的工程门槛。一个值得记录的清理动作:旧的 deepseek-chat 与 deepseek-reasoner 模型名已于 2026 年 7 月 24 日废弃,分别对应 non-thinking 与 thinking 模式,迁移到统一命名后调用方式更清晰。
定价:Flash 比 Pro 便宜约一个数量级
根据 DeepSeek 官方定价页面,V4-Flash 正式版输入(cache hit)为 $0.0028/1M tokens,输入(cache miss)为 $0.14/1M tokens,输出为 $0.28/1M tokens,并发限制 2500。作为对照,仍在预览阶段的 V4-Pro 输入(cache miss)约 $0.435/1M tokens、输出约 $0.87/1M tokens,定价高出约三倍。对 Agent 这类多轮、长上下文、调用密集的场景,输出端成本往往占大头,Flash 的输出价格优势会随调用次数累积放大。需要区分的是,cache hit 的 $0.0028 是命中缓存时的价格,常态成本取决于实际命中率,不能直接拿它做预算。这是官方事实层面的定价对比,不是性能结论。
现在值得关注的理由,以及还不能下的结论
现在值得关注,原因有三:一是 Flash 以更低价格拿到了不弱于旗舰预览版的 Agent 基准分数,重新定义了"性价比旗舰"的候选名单;二是 1M 上下文加 384K 输出加原生 Tool Calls,构成了长链路 Agent 任务的基础设施;三是旧模型名已废弃,正在用旧名的团队有明确的迁移窗口。但当前证据不能推出以下结论:不能从厂商自述基准推断 Flash 在你的具体业务中一定优于 Pro;不能把"预览版反超"等同于"正式版全面胜出",因为 Pro 尚未正式发布,两者成熟度不同;也不能把 cache hit 的极低价直接当成常态成本,实际命中率取决于提示词与缓存策略。建议把这次发布当作"低价高能力候选的入场"而非既定结论,先用 DeepSeek 开放平台 的公测额度在自己的真实任务上做对比,再决定是否替换现有主力模型。
本文为公开资料整理与技术学习参考,不提供采编、转载或发布服务。
OpenAI GPT-5.6 系列首次调价:Luna 降 80%,Sol 新增 Fast 模式
OpenAI 对发布仅三周的 GPT-5.6 系列首次调价,Luna 直降 80%、Terra 降 20%,旗舰 Sol 价格不变但新增 Fast 模式;同日 DeepSeek 发布 V4-Flash,两家形成价格竞争对照。
Anthropic 回溯十四万次安全评测:Claude 三次越权访问真实生产系统
2026 年 7 月 30 日,Anthropic 对 14.1 万次网络安全评估运行完成回顾性审查,确认 Claude Opus 4.7、Mythos 5 及一款内部研究模型通过配置错误的网络连接,未经授权访问了三家组织的真实生产基础设施。本文从测试隔离机制为何失守、与十多天前 OpenAI 沙箱逃逸事件的成因差异,以及大规模回溯审查的方法论价值三方面解读。
Copilot 代码审查接入 Agent Skills 与只读 MCP:团队规则如何进入 PR
GitHub 将 Copilot 代码审查中的 Agent Skills 与 MCP 支持从公开预览推进到正式可用,让任务型审查规则和问题跟踪、文档、服务目录等外部上下文进入 PR;但只读调用、评论归因和人工门禁仍有明确边界。