DeepSeek-V4-Pro 正式版突袭上线:Agent 能力暴涨,DeepSWE 直接干翻 Claude Opus 4.8 📅 2026/8/14 2:40:44 DeepSeek-V4-Pro 正式版突袭上线Agent 能力暴涨DeepSWE 直接干翻 Claude Opus 4.88 月 12 日深夜DeepSeek 悄悄在 API 文档里上架了一个新版本号——DeepSeek-V4-Pro-0813。第二天13 日这个版本被确认为V4 Pro 正式版。没有发布会没有预热只改了版本号就把整个 AI 圈的注意力又抢了过去。一、发生了什么一次改版本号式的正式发布事情的开场很DeepSeek没有直播、没有 keynote最先泄露风声的是官方 API 文档的模型 价格页面。眼尖的开发者发现deepseek-v4-pro的模型版本一栏从预览版悄悄变成了DeepSeek-V4-Pro-0813。紧接着官方群放出的评测对比表开始流传各媒体跟进报道正式版的身份才被坐实。关键点调用方式完全没变。你不需要改任何代码只要继续用deepseek-v4-pro这个模型名API 返回的就是最新版。这对存量用户来说等于一次零迁移成本的免费升级。二、最炸裂的数字DeepSWE 从个位数飙到 62.7这次正式版最值得说的一件事是Agent智能体能力的质变。在长周期、高复杂度的真实软件工程智能体基准测试DeepSWE上预览版V4-Pro-Preview得分仅12.8正式版V4-Pro-081362.7接近 5 倍的提升而且直接超越了 Claude Opus 4.858.0。DeepSWE 是什么含金量它是一个无污染的软件工程基准使用严格验证器误报率仅 0.3%比传统的 SWE-bench 更接近让 AI 真正在一个代码库里干活的真实场景。能在这个测试上拿到 62.7说明 DeepSeek 这次不是堆参数而是在专门训练模型当工程师。三、和自家 Flash 掰手腕贵 3 倍到底强在哪这是很多开发者最纠结的问题DeepSeek 自家的两个正式版到底该用哪个先看核心指标对比指标V4-Flash-0731V4-Pro-0813DeepSWE54.462.7输入缓存命中0.02 元 / M0.025 元 / M输入缓存未命中1 元 / M3 元 / M输出2 元 / M6 元 / M并发限制2500500结论很清晰Flash 是性价比之王输入未命中 1 元、输出 2 元只有 Pro 的三分之一价格但 DeepSWE 也有 54.4 分同样是从预览版的 7.3 暴涨上来的。日常任务、高频调用、预算敏感的场景Flash 完全够用。Pro 是旗舰深度版DeepSWE 62.7 压过 Flash 一头整体能力尤其复杂 Agent 任务、长上下文深度推理更强适合对质量要求更高的生产场景。一句话总结默认用 Flash 跑量复杂任务上 Pro。两者价格差 3 倍能力差距没那么悬殊按需切换是最聪明的用法。四、到底什么水平官方 10 项基准原表全解析这是大家最关心的问题V4-Pro-0813 到底处于什么水平官方放出的 Agent 相关评测对比表对标本家预览版/Flash 版 Claude Opus 4.8 Fable 5数据如下基准测试Pro-0813Flash-0731Pro-PreviewOpus 4.8Fable 5HLE (wo/w tools)42.7/60.037.8/51.537.7/48.249.8/57.953.3/63.0Terminal Bench 2.187.982.772.185.088.0NL2Repo61.554.238.569.7—CyberGym83.376.752.778.383.1DeepSWE62.754.412.858.070.0Toolathlon-Verified74.170.355.976.277.9Agents’ Last Exam25.725.216.525.7—Automation-Bench31.825.112.827.229.1DSBench-FullStack71.168.741.871.677.2DSBench-Hard67.259.631.171.768.3四个关键结论1. Agent 能力和 Opus 4.8 同档逼近 Fable 510 项基准里Pro-0813 在 4 项上超过 Opus 4.8DeepSWE、Terminal Bench 2.1、CyberGym、Automation-Bench3 项打平Agents’ Last Exam 同为 25.7、DSBench-FullStack 71.1 vs 71.6 几乎没差3 项落后HLE、NL2Repo、DSBench-Hard。整体看就是 Opus 4.8 同级选手。对 Fable 5CyberGym 打平83.3 vs 83.1、Automation-Bench 反超31.8 vs 29.1但 DeepSWE62.7 vs 70、HLE、DSBench 落后明显。能打但旗舰之座还没抢到。2. 相比预览版全面碾压所有 10 项全部大幅上涨不是单项突破。DeepSWE 从 12.8 → 62.7、Automation-Bench 从 12.8 → 31.8、CyberGym 从 52.7 → 83.3。说明这次正式版是整体后训练质量跃迁不是某个测试集上的特调。3. 短板很明确知识推理和复杂代码库HLE人类最后考试纯知识推理42.7 vs Opus 49.8、NL2Repo自然语言建仓61.5 vs 69.7、DSBench-Hard 67.2 vs 71.7。复杂推理仍是 DeepSeek 的软肋和 Claude 系旗舰有 6-8 分的稳定差距。4. 性价比维度这才是真正的碾压注意上面这些对比对象的价格Opus 4.8 输出约 $25/M 级别Fable 5 更是顶级定价。而 Pro-0813 输出只要6 元人民币/M。性能同一档价格差几十倍——这才是性价比屠夫的完整含义。五、能力清单一个能动手的模型正式版在接口能力上几乎拉满核心规格如下项目规格模型版本DeepSeek-V4-Pro-0813上下文长度1M tokens最大输出384K tokens思考模式支持非思考 思考模式默认JSON Output支持Tool Calls工具调用支持Responses API支持Anthropic API 兼容支持FIM 补全Beta支持仅非思考模式并发限制500几个值得单独说的地方1M 上下文 384K 输出在国产模型里属于头部水平处理大型代码库、超长文档、多步骤 Agent 任务基本不用再手动切分上下文了。双格式兼容同时提供 OpenAI 格式https://api.deepseek.com和 Anthropic 格式https://api.deepseek.com/anthropic。这意味着你从 Claude 迁移过来几乎可以无缝切换。思考模式可开关默认开思考但支持关闭。对 Agent 类请求思考强度会被自动推到最高档这是为工具调用和复杂推理专门设计的。六、价格白菜价还能维持多久价格永远是 DeepSeek 的杀手锏。官方定价单位元 / 百万 tokens项目价格输入缓存命中0.025 元输入缓存未命中3 元输出6 元对比一下国际上的参考价OpenRouter输入约 $0.435 / M输出约 $0.87 / M。DeepSeek 官方的这个定价尤其是缓存命中只要 0.025 元配合 1M 上下文对长文档、长对话场景的成本优势是碾压级的。但有一个必须注意的预警官方定价页明确标注——“计划近期整体上调 DeepSeek API 服务的定价预计涨幅较大”。也就是说这个白菜价是窗口期不是常态。要上车的话现在是性价比最高的阶段。七、这波更新对开发者意味着什么总结成三句话如果你在做 AI Agent / 自动化编程DeepSWE 62.7 的成绩说明这个模型是真的能上手干活了值得认真评测进生产链路。如果你在用 Claude / OpenAI 的 APIAnthropic 格式兼容 1M 上下文 价格优势是一个值得评估的替换或降本选项。如果你想赶在涨价前囤量官方已明确预告涨价当前价格是明确的窗口期。八、怎么用一行代码的事模型名不变直接调POST https://api.deepseek.com/chat/completions { model: deepseek-v4-pro, messages: [...] }想用 Anthropic 格式的把 base URL 换成https://api.deepseek.com/anthropic即可。数据来源DeepSeek 官方 API 文档模型 价格页、DeepSeek 官方 Agent 评测对比表、快科技、澎湃新闻、网易、新浪财经、凤凰网科技、36氪、财联社等公开报道截至 2026 年 8 月 13 日。