刚刚 DeepSeek V4 Pro 0813正式发布:Pro终于把旗舰位置拿回来了

📅 2026/8/14 17:31:53
刚刚 DeepSeek V4 Pro 0813正式发布:Pro终于把旗舰位置拿回来了
就在刚刚DeepSeek V4 Pro 正式版上线底层版本号为DeepSeek-V4-Pro-0813。这次不只是 API 页面换了一个日期。DeepSeek 随后放出的正式版跑分显示0813 在代码 Agent、工具调用和自动化任务上都有明显提升。7 月底参数更小的 V4 Flash 0731 曾在九项 Agent 测试中全面超过 Pro 预览版不到两周Pro 又把差距拉了回来。先说结论V4 Pro 0813 在 DeepSeek 自家模型中重新坐稳旗舰位置也进入了当前 Agent 模型的第一梯队。不过它没有全面超过 Kimi K3、Opus 4.8 和 Fable 5。图DeepSeek 官方公布的 V4 Pro 0813 模型对比成绩2026 年 8 月 13 日。这次正式发布了什么DeepSeek 官方 API 文档已经将deepseek-v4-pro指向DeepSeek-V4-Pro-0813。原有用户不需要改模型名也不需要更换 Base URL重新请求时会直接使用新版本。DeepSeek API 文档目前确认的规格如下项目DeepSeek V4 Pro 0813API 模型名deepseek-v4-pro底层版本DeepSeek-V4-Pro-0813模型结构MoE总参数量1.6T每 Token 激活参数49B上下文长度1M Token最大输出384K Token推理模式非思考、思考默认API 支持Chat Completions、Responses、Anthropic 兼容接口其他能力JSON Output、Tool Calls、前缀续写、FIM输入模态文本其中版本号、上下文、输出上限和接口能力来自当前 API 页面1.6T 总参数、49B 激活参数来自 DeepSeek V4 Pro 模型卡。官方暂未说明 0813 是否调整了基础架构从跑分变化的位置看这轮升级的重点显然落在了后训练和 Agent 能力上。DeepSeek 模型与价格V4 Pro 官方模型卡Pro 预览版到 0813有几项几乎换了一个模型先看 DeepSeek 内部的纵向对比。除 HLE 外下面的分数均为单项成绩越高越好HLE 分别列出不使用工具和使用工具的成绩。BenchmarkV4 Pro 0813V4 Flash 0731V4 Pro Preview0813 相比 Pro PreviewHLE不用/使用工具42.7 / 60.037.8 / 51.537.7 / 48.25.0 / 11.8Terminal Bench 2.187.982.772.115.8NL2Repo61.554.238.523.0Cybergym83.376.752.730.6DeepSWE62.754.412.849.9Toolathlon-Verified74.170.355.918.2Agents’ Last Exam25.725.216.59.2AutomationBenchPublic31.825.112.819.0DSBench-FullStack71.168.741.829.3DSBench-Hard67.259.631.136.1最夸张的是 DeepSWE12.8 涨到 62.7增加了 49.9 分。Cybergym、DSBench-FullStack 和 DSBench-Hard 也分别提高 30.6、29.3 和 36.1 分。这几项都涉及较长链路的代码修改、环境操作或工具调用刚好也是 V4 Pro 预览版最容易掉链子的地方。这组变化很难用“多想一会儿”解释。更合理的判断是0813 进行了面向代码 Agent 的大规模后训练补齐了预览版在工具使用和长任务执行上的短板。相比 V4 Flash 0731Pro 0813 在表中所有项目也都领先但差距没有它对预览版那么夸张Terminal Bench 高 5.2 分DeepSWE 高 8.3 分DSBench-FullStack 只高 2.4 分Agents’ Last Exam 更是只高 0.5 分。所以 Flash 0731 并没有突然失去价值。它仍是更便宜、更快的选择Pro 的优势主要出现在更难、更长、失败成本更高的任务里。和 GLM、Kimi、Claude 放在一起V4 Pro 到了什么位置官方图同时列出了 GLM 5.2、Kimi K3、Opus 4.8以及带 fallback 的 Fable 5。完整成绩如下BenchmarkV4 Pro 0813GLM 5.2Kimi K3Opus 4.8Fable 5含 fallbackHLE不用/使用工具42.7 / 60.040.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0Terminal Bench 2.187.981.088.385.088.0NL2Repo61.548.9—69.7—Cybergym83.3—80.078.383.1DeepSWE62.746.267.558.070.0Toolathlon-Verified74.159.976.576.277.9Agents’ Last Exam25.723.827.625.7—AutomationBenchPublic31.812.930.827.229.1DSBench-FullStack71.161.873.771.677.2DSBench-Hard67.254.563.071.768.3V4 Pro 0813 有两个明确的单项第一Cybergym 83.3略高于 Fable 5 的 83.1AutomationBench Public 31.8高于 Kimi K3 的 30.8、Fable 5 的 29.1 和 Opus 4.8 的 27.2。Terminal Bench 2.1 的 87.9 也已经贴近最高水平比 Opus 4.8 高 2.9 分距离 Kimi K3 只有 0.4 分距离 Fable 5 只有 0.1 分。短板同样很清楚。HLE 不使用工具时V4 Pro 0813 只有 42.7落后 Opus 4.8 的 49.8 和 Fable 5 的 53.3DeepSWE、Toolathlon 和 DSBench-FullStack 也没有拿到第一。NL2Repo 则以 61.5 落后 Opus 4.8 的 69.7。这不是一张“DeepSeek 全面碾压”的表。更准确的说法是V4 Pro 0813 在终端操作、安全和自动化工作流上已经能和头部闭源模型正面对打但在纯知识推理与部分复杂软件工程任务上仍有差距。这张跑分表还要注意三件事第一数据来自 DeepSeek 官方并非第三方独立复测。厂商跑分适合判断模型升级方向最后是否好用仍要看同一套 Agent 框架和真实项目里的复现结果。第二Fable 5 一栏明确写有w/ fallback说明部分任务可能触发后备模型。它和单一模型的直接比较需要留一点余地。第三DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 自有测试集。它们能反映内部优化成果但外部目前无法像公开 Benchmark 那样完整核验。真正值得优先看的是 Terminal Bench、DeepSWE、Toolathlon、HLE 等公开项目。截至发稿Artificial Analysis 的 V4 Pro 页面仍显示 4 月版本尚未明确标注完成 0813 重测。此前“Flash 0731 综合分高于 Pro”的第三方结论现在只能视为旧版 Pro 的历史成绩不能再拿来代表 0813。Artificial AnalysisV4 Pro价格没变Pro 仍然便宜但不再是 Flash 的平替DeepSeek 当前的人民币 API 价格如下每百万 TokenV4 Flash 0731V4 Pro 0813输入缓存命中0.02 元0.025 元输入缓存未命中1 元3 元输出2 元6 元并发上限2500500Pro 的缓存命中价只比 Flash 高 0.005 元但缓存未命中输入和输出都是 Flash 的三倍。对于会反复读取同一个代码仓库、长文档或系统提示词的 Agent缓存命中价格很有吸引力普通聊天、批量生成和高并发接口Flash 依旧更划算。DeepSeek 官方价格页需要留意的是官方已经在价格页提示近期计划整体上调 API 定价而且“预计涨幅较大”。因此当前 3 元输入、6 元输出的 Pro 价格不一定会维持很久。已接入的项目不用改代码DeepSeek 继续使用滚动模型名deepseek-v4-pro。原来的 Java、Python 或 Node.js 项目不需要迁移接口只要正常发起请求就会访问最新的 0813 版本。{model:deepseek-v4-pro,messages:[{role:user,content:阅读这个代码仓库定位订单重复扣款的原因并提交修复方案}],thinking:{type:enabled},reasoning_effort:max,stream:true}OpenAI 兼容接口仍是https://api.deepseek.comAnthropic 兼容接口为https://api.deepseek.com/anthropic。滚动升级虽然省事生产环境仍建议保留版本切换前后的回归样例。0813 对 Agent 行为改动很大同一条提示词的工具选择、思考长度和输出格式都可能变化。至少应重新测试函数调用、JSON 输出、超时设置和 Token 上限不要只看接口是否返回 200。最后说几句V4 Pro 0813 最重要的变化是把预览版“题做得不错但 Agent 容易翻车”的印象扭了回来。DeepSWE 从 12.8 到 62.7Cybergym 从 52.7 到 83.3Terminal Bench 从 72.1 到 87.9。这不是边角修补。虽然 DeepSeek 还没有公布 0813 的完整训练细节但从提升集中的项目看代码 Agent 显然是这轮更新的主线。Flash 0731 先展示了后训练带来的跃升Pro 0813 随后又把上限往前推了一截。当然官方跑分只是第一张成绩单。V4 Pro 0813 能否在不同 Agent 框架、真实代码库和长时间任务中保持稳定还要等第三方复测。至少从今天这张表看DeepSeek 已经回答了一个最直接的问题Pro 为什么叫 Pro这次终于有一组说得过去的答案了。资料来源DeepSeek 官方发布的 V4 Pro 0813 跑分对比图2026 年 8 月 13 日DeepSeek首次调用 APIDeepSeek模型与价格DeepSeek更新日志DeepSeek V4 Pro 官方模型卡DeepSeek V4 Flash 0731 官方模型卡Artificial AnalysisDeepSeek V4 Pro信息核验时间2026 年 8 月 13 日。模型版本、价格和第三方榜单可能继续更新。