同夜双响!DeepSeek V4 Pro 正式版对决 Grok 4.6:都押注 Agent,价格差了近 7 倍

📅 2026/8/16 23:47:32
同夜双响!DeepSeek V4 Pro 正式版对决 Grok 4.6:都押注 Agent,价格差了近 7 倍
同夜双响DeepSeek V4 Pro 正式版对决 Grok 4.6都押注 Agent价格差了近 7 倍文章目录同夜双响DeepSeek V4 Pro 正式版对决 Grok 4.6都押注 Agent价格差了近 7 倍一、同一夜两家公司同时摊牌二、DeepSeek V4 Pro 0813这是一次夺回王位三、Grok 4.6马斯克押注长任务 Agent四、正面对比把两个模型摆在一起五、上手体验两边都是十行代码的事六、上手前四个坑要先知道七、到底怎么选给你一张速查表八、写在最后8 月 12 日这一夜两家公司先后出手DeepSeek 把 V4 Pro 0813 转正SpaceXAI 发布 Grok 4.6押注方向出奇一致——Agent。本文把两款模型的成绩单、定价、生态和坑点摆到一起对比数据全部来自官方公告、API 文档与第三方媒体交叉验证附上手代码和选型速查表。一、同一夜两家公司同时摊牌8 月 12 日晚上AI 圈有点热闹。先是 DeepSeek 悄悄更新了 API 文档deepseek-v4-pro背后的模型切换成了正式版DeepSeek-V4-Pro-0813结束了将近四个月的预览期。没有发布会没有倒计时预热就是文档页面上多了一行版本号。要不是 IT之家盯着很多人可能压根没注意到。几个小时后大洋彼岸的 SpaceXAI前身 xAI正式发布Grok 4.6。马斯克在 X 上亲自吆喝就一个词“banger”炸场了。有意思的是两家押注的方向高度一致——Agent。DeepSeek 这次的更新说明里全是代码 Agent、工具调用、自动化任务Grok 4.6 的官方公告开篇第一句就是长时间运行的 Agent以及更有野心的交互式与视觉工作。模型比拼聊天能力的时代过去了现在拼的是干活能力。二、DeepSeek V4 Pro 0813这是一次夺回王位想看懂这次发布的分量得先回顾 7 月底的那场小尴尬。当时 DeepSeek 先把参数更小的V4 Flash 0731转正顺手晒了组成绩Flash 在九项 Agent 测试里全面超过了 Pro 预览版。气氛一度很微妙——小弟当众抢了大哥的位子。Pro 预览版的问题在哪题做得不错但一上手干活就翻车。DeepSWE 只有 12.8 分惨不忍睹。两周后0813 来了直接把场子找了回来基准测试V4 Pro 预览版V4 Pro 0813提升DeepSWE12.862.749.9Cybergym52.783.330.6Terminal Bench 2.172.187.915.8NL2Repo38.561.523.0Toolathlon-Verified55.974.118.2DSBench-Hard31.167.236.1HLE使用工具48.260.011.8DeepSWE 从 12.8 干到 62.7这种涨幅用多想一会儿是解释不通的合理的解释只有一个针对代码 Agent 做了大规模后训练。规格方面0813 延续了 V4 系列的底子MoE 架构1.6 万亿总参数每 token 激活 490 亿1M 上下文最大输出 384K。官方说法是靠着两种压缩注意力机制单 token 推理算力降到 V3.2 世代的 27%KV 缓存占用降到 10%——这也是 1M 上下文敢卖白菜价的底气。那这成绩放在行业里算什么水平看 DeepSeek 官方的横向对比注意厂商自测Cybergym 83.3 分险胜 Fable 583.1全表第一AutomationBench 31.8 分全表第一Terminal Bench 2.1 87.9 分离 Fable 588.0只差 0.1离 Kimi K388.3差 0.4短板也很清楚HLE 不用工具只有 42.7落后 Opus 4.849.8和 Fable 553.3纯知识推理还是差口气模型卡还披露了最大推理模式V4-Pro-Max的一组成绩SWE-bench Verified 80.6%、GPQA Diamond 90.1%、LiveCodeBench 93.5%、Codeforces 评分 3206。单项数字都挺能打但 0813 还没有第三方独立复测建议先当参考。对开发者有个实惠消息API 模型名没变deepseek-v4-pro直接指向 0813老项目一行代码不用改。不过 App 和网页端暂时还用不上新版目前只上了 API。三、Grok 4.6马斯克押注长任务 AgentGrok 4.6 距离 Grok 4.57 月发布只隔了几周迭代速度快得有点不讲理。这次的重点很明确长时间运行的 Agent。官方的说法是它能在很多个步骤里始终咬住复杂任务——研究陌生领域、分析信息、跨代码库干活把一个想法变成一个能跑的应用。成绩也确实在往这个方向走。看 SpaceXAI 官方给的四模型对比表基准测试Grok 4.5Grok 4.6GPT-5.6 SolFable 5AA 智能指数56616162GDPVal-AA v2Elo1526175317281741DeepSWE v1.154%65.9%73%70%APEX-Agents47.1%57.5%56.7%59.2%AA-BriefcaseElo1313157715021574Harvey LAB12.9%15.8%2.5%11.3%几个值得咂摸的点第一代际提升非常大。GDPVal-AA 的 Elo 涨了 227 分DeepSWE 涨 11.9 个点APEX-Agents 涨 10.4 个点几乎是全线抬升。马斯克那句banger不算空口说白话。第二真有拿第一的项目。GDPVal-AA真实世界职业任务Elo 1753、AA-Briefcase长程知识工作Elo 1577、Harvey LAB 15.8%都压过了 GPT-5.6 Sol 和 Fable 5。其中 Harvey LAB 这项GPT-5.6 Sol 只拿到 2.5%有点意外。第三短板也摆着。Terminal-Bench v3.0 只有 26%GPT-5.6 Sol 和 Fable 5 都在 34% 以上DeepSWE 落后 GPT-5.6 Sol 7.1 个点。终端操作和硬核软件工程暂时还不是 Grok 的舒适区。第四第三方榜单站得住。Artificial Analysis 的综合智能指数Grok 4.6 拿到 61 分与 GPT-5.6 Sol Max 打平超过 Kimi K3仅次于 Claude Opus 5 和 Fable 5。还有个容易被忽略的细节Artificial Analysis 的测试显示Grok 4.6 完成 AA-Briefcase 任务平均用53 轮对话、约 5 亿输入 token而 Claude Opus 5 Max 要 103 轮、20 亿 token。一半的轮数、四分之一的 token——单价虽贵总账单未必输。这正是 SpaceXAI 想卖的观念别光看每百万 token 的单价看完成一件事要花多少钱。训练细节官方没讲太多比 Grok 4.5 更长的补充训练用 Grok 4.5 自己重新生成并过滤 SFT 数据再来一轮覆盖内核优化、Web 开发、CAD 等场景的 Agent 强化学习。官方特意提到4.6 在长任务里会表现出更多自测自检行为视觉和交互类项目的首次产出质量也明显更高。四、正面对比把两个模型摆在一起把两款模型摆到一起差异比共同点更值得看对比项DeepSeek V4 Pro 0813Grok 4.6发布节点8 月 12 日预览转正8 月 12 日新品发布主打方向代码 Agent、自动化、长上下文长程 Agent、视觉交互应用、知识工作架构MoE1.6T 总参数 / 49B 激活未公开闭源上下文1M tokens500K tokens最大输出384K tokens官方标注无文本输出限制开放性MIT 开源预览版权重0813 权重待定闭源输入价格$0.435约 3 元$2≥200K 上下文翻倍输出价格$0.87约 6 元$6≥200K 上下文 $12生态入口OpenAI / Anthropic 兼容 APICursor、Grok Build、OpenRouter、Vercel、Cloudflare价差是最大看点。输出单价 Grok 4.6 是 DeepSeek V4 Pro 的6.9 倍输入也差 4.6 倍。但价格这事得看细节DeepSeek 缓存命中输入只要 0.025 元/百万 token。反复读同一个代码库、同一份长文档的 Agent成本能压到近乎为零Grok 4.6 的提示词低于200K token 是 $2/$6超过200K 整个请求按 $4/$12 计费直接翻倍DeepSeek 的 Pro 端点并发上限 500大批量高并发场景要提前掂量另一个绕不开的差异是路线开源对闭源。DeepSeek 延续开放权重 低价 API的打法预览版权重 4 月就能下载Hugging Face 上单月下载量超过 140 万次Grok 4.6 则完全闭源但 SpaceXAI 给它配了一整套产品矩阵——被 SpaceX 收购的 Cursor、Grok Build30 美元/月的 SuperGrok 订阅自带还有前一天刚发布的 Grok Bot120 美元/月让 AI 当虚拟员工。一个卖水电一个卖精装房选哪个取决于你要干什么活。这里必须说句公道话DeepSeek 用的是 Terminal Bench2.1Grok 用的是 Terminal-Benchv3.0版本不同、难度不同数字不能直接互比。谁要是拿87.9 对 26说 DeepSeek 碾压 Grok 的终端能力别信。五、上手体验两边都是十行代码的事两个模型的 API 都兼容 OpenAI 格式接入成本很低。DeepSeek V4 Pro模型名不用改直接指向 0813fromopenaiimportOpenAI clientOpenAI(api_keyyour_api_key,base_urlhttps://api.deepseek.com)respclient.chat.completions.create(modeldeepseek-v4-pro,# 滚动模型名自动指向 0813messages[{role:user,content:阅读这个代码仓库定位订单重复扣款的原因并提交修复方案}],reasoning_effortmax# 最大推理档位适合 agent 场景)print(resp.choices[0].message.content)Grok 4.6官方模型名grok-4.6推理力度有 low / medium / high / xhigh 四档。多轮 Agent 场景记得带会话标识让请求命中提示词缓存fromopenaiimportOpenAI clientOpenAI(api_keyyour_xai_key,base_urlhttps://api.x.ai/v1)respclient.chat.completions.create(modelgrok-4.6,messages[{role:system,content:你是一个全栈开发 Agent},{role:user,content:把这个产品想法变成一个能跑的网页应用原型}],extra_headers{# 官方强烈建议同一会话带同一标识命中缓存避免全价计费x-grok-conv-id:task-2026-0813-001})print(resp.choices[0].message.content)两个省钱的小提醒DeepSeek 缓存命中价是未命中价的约 1/120。系统提示词、知识库这类复用内容值得围绕如何命中缓存设计计费结构SpaceXAI 官方强烈建议给 Grok 4.6 设置prompt_cache_keyChat Completions 用x-grok-conv-id请求头否则请求可能落到缓存冷启动的服务器上输入全价计费光看单价不直观拿一个典型的代码 Agent 任务算笔账按两家刊例价单位美元# 任务画像读 200K token 代码库跑 10 轮累计输出 30K tokendefcost(inp_price,out_price,cache_priceNone,cache_hit_ratio0.0):输入 2M token200K x 10 轮 输出 30K token 的总成本inp_tokens,out_tokens2_000_000,30_000cachedinp_tokens*cache_hit_ratio# 命中缓存的部分freshinp_tokens-cached# 全价计费的部分inp_costfresh/1e6*inp_price(cached/1e6*cache_priceifcache_priceelse0)out_costout_tokens/1e6*out_pricereturnround(inp_costout_cost,2)# DeepSeek V4 Pro$0.435/$0.87缓存命中价约 $0.00360.025 元/百万 tokenprint(cost(0.435,0.87,cache_price0.0036,cache_hit_ratio0.9))# ≈ $0.37# Grok 4.6单轮 200K 以内按 $2/$6print(cost(2.0,6.0))# ≈ $4.18# 结论同一个任务差价超过 10 倍缓存命中率是 DeepSeek 的成本杠杆数字会随定价调整变化尤其 DeepSeek 已预告涨价但量级关系短期内不会变高频复用上下文的 Agent 场景DeepSeek 的成本优势是结构性的。六、上手前四个坑要先知道坑一厂商跑分别全信。本文两张成绩单都是厂商自测。Fable 5 那一栏标着 “w/ fallback”部分任务可能触发后备模型DSBench 是 DeepSeek 自家测试集。公开基准Terminal Bench、DeepSWE、HLE还得等第三方复测——截至发稿Artificial Analysis 的 V4 Pro 页面还停在 4 月版本。坑二DeepSeek 滚动升级生产环境必须回归。模型名没变但 0813 的 Agent 行为改动很大同一条提示词的工具选择、思考长度、输出格式都可能变。函数调用、JSON 输出、超时设置、token 上限都要重测别只盯着接口是不是返回 200。坑三Grok 4.6 的标题价不能直接套用。$2/$6 只适用于 200K token 以内的提示词超了之后整单翻倍$4/$12而且对整条请求的所有 token 生效。长上下文场景的预算要单独算。坑四别把 DeepSeek 的低价当长期假设。官方价格页已经挂了预告近期计划整体上调 API 定价“预计涨幅较大”。做长期成本测算时把这个变量算进去。另外 0813 的开源权重还没放出想本地部署的再等等。七、到底怎么选给你一张速查表别问哪个更强问哪个更适合你的活。我的建议选 DeepSeek V4 Pro如果你主力场景是代码 Agent、终端自动化、长文档批处理对成本敏感且会反复读同一个代码库缓存命中价是真便宜需要 1M 超长上下文或 384K 长输出想自托管部署等 0813 权重开源选 Grok 4.6如果你想把想法直接变成视觉化、可交互的应用官方说首版产出质量明显提升做长程知识工作、研究类任务AA-Briefcase 和 Harvey LAB 的成绩很能打已经是 Cursor 用户或者愿意为 Grok Build 付费首周双倍免费额度都不选的话简单任务、高并发接口DeepSeek V4 Flash$0.14/$0.28更划算追求单点最强、不在乎价格继续盯 Fable 5 和 GPT-5.6 Sol。八、写在最后这次同夜发布的两款模型说明了一件事前沿模型的主战场已经从聊天彻底转向干活。DeepSeek 用后训练补齐 Agent 短板把旗舰位置夺了回来SpaceXAI 押注长程 Agent 和知识工作连定价都在围绕单任务成本做文章。对普通开发者来说这是好事。竞争越狠价格越低工具越强。唯一要留神的是变化太快——今天用的版本下个月可能被原地升级今天享受的低价下个月可能收到涨价通知。参考资料SpaceXAI 官方公告https://x.ai/news/grok-4-6DeepSeek API 文档与定价https://api-docs.deepseek.com/quick_start/pricingDeepSeek V4 Pro 官方模型卡https://huggingface.co/deepseek-ai/DeepSeek-V4-ProVentureBeatSpaceXAI debuts Grok 4.6Unite.AIDeepSeek Ships V4 Pro as Its Flagship Model Leaves PreviewIT之家DeepSeek V4 Pro 正式版 API 更新上线本文数据均来自官方公告、API 文档与第三方媒体交叉验证数字有出处可查发现错漏欢迎评论区直接指出。互动一下DeepSeek V4 Pro 和 Grok 4.6你会先试哪个还是准备等第三方复测出来再动手评论区聊聊你的选择——觉得有用的话点赞、收藏、关注走一波下一篇准备实测 0813 的代码 Agent 全流程。