DeepSeek V4 Flash正式版发布

📅 2026/8/2 15:15:32
DeepSeek V4 Flash正式版发布
大家好我是程序员天天困。10 天前写 Qwen3.8 那篇的时候我提过一句DeepSeek V4 满血版最快 7 月 20 号上线。昨天晚上刷朋友圈看到有朋友说 deepseek-v4-flash-0731 官方上线了这次是真来了——不过先到场的不是 Pro是DeepSeek V4 Flash 正式版API 直接上线公测没有发布会就悄悄更新了一条日志。官方也同步预告了V4-Pro 正式版会尽快发布只是具体时间没给。这篇我把这件炸圈的事拆成四块讲官方成绩单写了什么、成绩为什么这么离谱、白菜价有多白菜、后端开发怎么切换。看完你再决定要不要把 API 换过去。一、官方成绩单9 项 Agent 基准远超 V4-Pro 预览版DeepSeek V4 Flash 正式版这次最狠的不是便宜是 Agent 成绩单。官方更新日志里的原话是「Agent 能力大幅增强基准测试远超 V4-Pro-Preview」后面跟了一串数字Terminal Bench 2.1: 82.7NL2Repo: 54.2Cybergym: 76.7DeepSWE: 54.4Toolathlon verified: 70.3Agent Last Exam: 25.2Automation Bench (Public): 25.1DSBench-FullStack: 68.7DSBench-Hard: 59.6Terminal Bench让 AI 在真实终端环境里完成任务的基准测试从改配置、跑脚本到修 bug考的是「让 AI 自己去操作系统」的本事。你可以理解为 AI 界的现场实操考试。其中 Terminal Bench 2.1 是被引用最多的一个82.7 分已经把自家 V4-Pro 预览版甩在身后。不过有个细节我得说清楚官方注明了这些分数是在 DeepSeek 自研 Harness 极简模式还没发布下跑的max 档位、topp0.95、temperature1.0。自研框架测自家模型分数先打个折这点上我站理性派。二、第三方也盖章了智能指数反超自家 Pro官方自测可以打折听但这次第三方评测跟官方数字对上了这是我说「碾压」不心虚的原因。Artificial AnalysisAA独立第三方 AI 评测机构用统一测试集给各家模型排智能指数Intelligence Index相当于大模型圈的第三方验货。AA 在发布当天2026-07-31就把 Flash-0731 放上了榜单智能指数 50 分比 4 月发布的 Flash 预览版高 10 分比自家 V4-Pro 还高 6 分只比 OpenAI 最便宜款 GPT-5.6 Luna51 分低 1 分GLM-5.2、Muse Spark 1.1 同为 51 分开源榜第一的 Kimi K3 为 57 分。而且它跑完整套测试用的 token 比上一版还少了 12%——效率和分数一起涨。一个激活参数只有 130 亿的轻量模型把参数规模大得多的自家旗舰预览版反超了。三个月前没人信这个。三、最离谱的一条结构没动只重做了后训练Flash 正式版真正炸圈的不是分数是官方日志角落里那句话模型的结构、尺寸和预览版一模一样只把后训练整个重做了一遍。284B 总参数、13B 激活参数一个数都没改。4 月预览版发布时官方还自己承认「高难度 Agent 任务和 Pro 有差距」三个月后同一个身子把 Pro 反超了。MoE混合专家架构把一个大模型拆成很多个「专家子模型」每次推理只点亮其中一小部分参数用更少的算力干活。284B 是仓库里全部的货13B 是每次实际搬出来的。打个比方这就好比同一台发动机参数规模是排量排量定了极速上限后训练是变速箱调校决定你实际开起来是肉还是跟脚。Flash 这次相当于没换发动机光把调校重做了一遍加速直接快了一档——说明它之前压根没摸到自己的上限。四、白菜价2 元 vs 6 元 vs 12 美元价格这块不用算太细也能看懂Flash 的单价是自家 Pro 的三分之一输出价只有 OpenAI 最便宜型号 Luna 的四分之一左右。官方定价页写得明明白白每百万 token美元按 1:7.2 折算模型输入缓存命中输入未命中输出DeepSeek V4 Flash 正式版0.02 元1 元2 元DeepSeek V4 Pro 预览版0.025 元3 元6 元GPT-5.6 Luna刚降 80%$0.02$0.2$1.2GPT-5.6 Terra刚降 20%$0.2$2$12这里有个背景值得说道OpenAI 就在 Flash 上线前一天7 月 30 日宣布 GPT-5.6 降价Luna 直接降了 80%。结果降完价Luna 的输出价$1.2依然是 Flash 的 4 倍多Terra 更是它的 40 多倍$12 vs 2 元。「白菜价」三个字不是修辞——官方定价页就是这么标的。可能有人会问这么便宜是不是在烧钱抢市场早晚要涨价以 2026 年 8 月初为准官方定价页已经写明「即将采用峰谷定价」高峰时段北京时间 9:0012:00、14:0018:00价格翻倍——涨价机制已经在路上了但不等于整体涨价。另外 AA 的数据显示Flash-0731 跑同样测试用的 token 还少了 12%说明低价有一部分是效率撑起来的不全是补贴。真要在生产环境长期跑盯住官方定价页比听任何人的推测都靠谱。五、后端开发怎么看切换成本几乎为零最后说点实际的。对后端开发这次更新最容易被忽略的一条是换到 Flash 正式版的成本几乎为零。API 调用方式不变把模型名改成deepseek-v4-flash就行。官方还原生支持 OpenAI 的 Responses API 格式并且针对性适配了 Codex——不用改 Base URL 就能切模型# 官方示例只改 model 参数即可切换到 V4 Flash 正式版fromopenaiimportOpenAI clientOpenAI(api_key你的key,base_urlhttps://api.deepseek.com)respclient.chat.completions.create(modeldeepseek-v4-flash,# 之前是 deepseek-v4-promessages[{role:user,content:帮我看看这段代码的 bug}],)print(resp.choices[0].message.content)Responses APIOpenAI 推出的新一代 API 接口格式把对话、工具调用、推理过程统一进一个响应对象里专门给 Agent 类应用用。你可以理解成「给 AI 干活的接口比聊天接口更粗的管道」。不过我也得泼盆冷水Flash 不支持视觉输入知识密集型任务和 Pro 还有差距——官方自己说过 Flash 的世界知识「稍逊一筹」代码里 API 文档、库行为这类事实问题最好人工复核。我的用法是跑量任务全给 Flash卡壳的难题再切 Pro 或别的旗舰各干各的活。以 2026 年 8 月初为准DeepSeek V4 Flash 正式版交出的答案是后训练做到位便宜的小模型照样能把旗舰预览版拉下马。另外官方更新日志里也写了一句V4-Pro 正式版将会尽快发布定价页还注明 8 月初会给 Pro 接入 Responses API——想等旗舰正式版的留意官方更新日志就好。真正的问题留给行业——当 13B 激活参数已经够用的时候旗舰模型的护城河还剩多少。我是程序员天天困持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊Flash 正式版这个成绩和价格你准备切过去当主力 API 吗还是继续观望