DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了

📅 2026/8/2 18:43:21
DeepSeek 的便宜模型跑赢了自家旗舰——AI 进步最快的地方,已经不是堆参数了
一个 284B 的廉价版没换架构、没加参数只靠重新训练就在 9 项 Agent 测试里整体超过了自家 1.6T 的旗舰。这件事正在改写一个你以为理所当然的判断贵的不一定是对的。7 月 31 日DeepSeek 做了一件反直觉的事。他们把自家 V4 系列里最便宜的 Flash 模型重新训练了一遍——没换架构没加参数连模型尺寸都没动。然后这个只有 284B 总参数的廉价版在 9 项 Agent 能力测试里整体超过了自家 1.6T 参数的旗舰 V4-Pro 预览版。知名 AI 博主宝玉在 X 上的原话是「便宜的那个模型Flash经过后训练调优之后在编程和工具调用任务上反超了贵的那个模型Pro的预览版。」到底发生了什么DeepSeek-V4-Flash 正式版 API 在 7 月 31 日上线公测版本号 0731。这次更新最特殊的地方在于模型本身没变变的是训练方式。Flash 还是那个 Flash——284B 总参数、13B 激活的混合专家架构MoE和 4 月份的预览版一模一样。变的是后训练环节用新的指令数据、强化学习和工具使用轨迹重新教模型怎么在实际任务里动手。相当于同一个人去集训了一圈脑容量没变但出手突然变老练了。DeepSeek 官方一口气公布了 9 项 Agent 基准成绩并明确表示正式版 Flash 在这些测试上整体超越了 V4-Pro-Preview。9 项测试数字有多离谱最直观的冲击来自一个叫 DeepSWE 的基准——它专门测试 AI 能不能像真正的工程师一样在一个真实代码仓库里定位 bug、改代码、跑测试、提交结果。Flash 预览版的成绩是7.3。正式版直接跳到了54.4——涨幅645%。这不是提升了一点是从不太会变成了真的能干。其他几项同样值得注意Terminal Bench 2.1终端操作能力82.7。V4-Pro 预览版是 72.1Flash 预览版只有 61.8。这个测试衡量的是 AI 能不能在真实的命令行环境里完成多步骤任务——不是写一个命令给你看而是自己跑命令、看反馈、处理报错、继续修复。Toolathlon工具编排能力70.3。测试的是 AI 能不能从一堆工具里选对工具、按对参数、串成一条完整流程。DSBench-Hard高难度开发任务59.6。全栈开发任务前端后端 API 测试一起改。这个便宜模型不只是在写代码而是在跑环境。最反常的地方进步不靠堆参数靠训练方法过去两年AI 行业有一个近乎共识的直觉模型越大越强。参数翻倍能力上一台阶。但这次 DeepSeek 做的事情恰好相反。284B 的 Flash总参数只有 1.6T 旗舰 V4-Pro 的不到五分之一。每次推理只激活 13B 参数成本大约只有 Pro 的一个零头——API 定价 $0.14/百万输入 token、$0.28/百万输出 token。按传统逻辑它应该在旗舰面前被碾压。但后训练改变了一切。同一个基础模型本来可能已经知道Git 怎么用、Linux 怎么操作但如果没经过足够的工具使用训练它就会反复执行失败的命令、选对工具但传错参数。后训练解决的不是知不知道而是会不会用。这对开发者意味着什么选模型的逻辑要变了以前团队选模型的默认动作是先用最贵最大的跑不动了再找便宜的降级。如果 Flash 正式版的能力可以持续验证更合理的做法可能是反过来大部分日常任务用 Flash 跑反复失败或需要密集知识推理时才升级到 Pro。这直接影响 Agent 产品的账本。一个 Agent 任务往往涉及几十轮模型推理、工具调用和错误纠正——成本不是聊一轮多少钱而是成功交付一个任务总共花多少钱。一个单价低但老出错的模型算下来未必便宜一个单价更低但一次就做对的模型才是真的省钱。这正是我们「AI 落地账本」系列一直在追的主线AI 的成本竞赛已经从谁的模型更便宜变成谁的便宜模型更能干活。对普通人意味着什么你为 AI 付的钱正在被重新定价如果你不是开发者这件事和你仍然有关。AI 公司正在用两种方式压低成本一是把模型做小Flash 只激活 13B二是把训练做精后训练提升效率。两条路叠加的效果是同样能力的 AI 服务价格正在快速下降。你用的 AI 写作工具、代码助手、客服系统背后的推理成本在变低。这意味着更多免费额度、更低的订阅价格、更多原本收费的功能变成标配。但也别急着欢呼。DeepSeek 官方也承认Flash 在复杂运动物理合理性、极多主体交互等场景上仍有短板。Agent 基准跑分高不等于在生产环境里一定可靠——第三方复测、真实仓库任务成功率、单任务综合成本这些数据还需要时间验证。现在可以怎么做开发者把deepseek-v4-flash接进你的 Codex 或 Agent 工作流试跑。Flash 正式版原生兼容 Responses APIVS Code 和 Codex CLI 可直接配置。建议先在非关键任务上对比 Flash 和 Pro 的交付成功率再决定默认模型。创业者如果你的产品重度依赖 AI 执行能力而不只是对话Flash 的成本结构值得重新算一遍账。便宜模型 好的训练可能比贵模型 粗放调用更划算。普通用户不用纠结用哪个模型。但记住一个判断——贵好在 AI 领域正在失效选工具时别被我们用的是最贵的大模型这种话术唬住。结语DeepSeek 这次做的事情本质上是给整个行业提了个醒你可能不需要一个更大的大脑而是需要一个训练得更好的大脑。当 284B 的便宜模型在 Agent 任务上跑赢了 1.6T 的旗舰参数军备竞赛就不再是唯一主线了。下一个值得关注的不是谁的模型又大了多少倍而是谁用同样的模型训练出了更强的执行力。