太长不看 DeepSeek V4 Flash 0731 和 Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index v4.1 上都落在 50 分GPT-5.6 Luna 以 51 分领先一分。它们的标价跨度超过一个数量级。有意思的地方在于当你不再对比价签而是开始对比同一套评测工作负载的实际账单时会发生什么。Artificial Analysis 公布了它跑每个模型所付的钱DeepSeek $72.02Luna $190.87Gemini $726.70。输出价签上的差距是 27x实际账单上的差距是 10.1x因为 DeepSeek 那次跑烧掉了 210M 输出 token而 Gemini 只用了 59M。两个数字都在说如果你的工作负载是文本就选 DeepSeek但一旦流水线要发送图像这两个数字都撑不住。太长不看你该选哪个你的情形选择原因纯文本、高并发、成本是硬约束DeepSeek V4 Flash 0731每 token 最便宜约 10x还叠加 98% 的缓存折扣涉及图像、音频、视频或 PDF 的任何场景Gemini 3.6 FlashDeepSeek 0731 只支持文本没有更便宜的绕行方案用户能感知到延迟的交互式 UXGemini 3.6 Flash约每秒 220 个输出 token且在 AA 的测试中三者里 TTFT 最低长的单次生成完整文件、长报告DeepSeek V4 Flash 0731最大输出 384KGemini 只有 64K想在一个模型上同时拥有最高指数分和视觉能力GPT-5.6 Luna指数 51、支持视觉且在 2026-07-30 降价 80%可以激进缓存的有界智能体循环DeepSeek V4 Flash 0731缓存读取 $0.0028/M是三者中最低的且遥遥领先你今天就需要可复现的第三方延迟数据Gemini 3.6 Flash 或 GPT-5.6 Luna快照时 AA 没有 0731 版本的速度或 TTFT 数据有两种理由可以读到这里就停下。如果你的工作负载会发送任何非文本输入第二行就已经拍板本文其余部分只是背景。如果你的工作负载是文本且每月运行量在约 2000 万 token 以下那么上表中最便宜和最贵选项之间的年度差额比一天的工程时间还小所以按延迟来选然后往下走就行。下文所有内容都是写给账单大到值得争论的场景。7 月 31 日到底改了什么DeepSeek 在 2026-07-31 发布了 V4 Flash 的新版本但没有改动模型本身。同样的 284B 总参数、同样的 13B 激活、同样的 1M 上下文、同样的 $0.14 / $0.28 定价。API 模型名也没变仍是deepseek-v4-flash该版本在 DeepSeek 文档中标识为模型版本DeepSeek-V4-Flash-0731。变的是后训练。实测效果比「仅后训练」通常给人的印象要大得多。在 Artificial Analysis Intelligence Index v4.1 上分数从 40 涨到 50。AA 的智能体评测 GDPval-AA v2 从 1189 Elo 升到 1559。Terminal-Bench 2.1 提升 17 个点达到 79%。AA 还把 0731 版本排在 DeepSeek 自家旗舰 DeepSeek V4 Pro 之上 6 个点这对任何按「Pro 处理难题」的假设写过路由规则的人来说都是个尴尬的结果。我们也是这类人之一。我们五月的 DeepSeek V4 Pro 与 Flash 路由指南 得出结论多文件工作和长智能体循环应交给 Pro。对 0731 版本而言这个结论不再成立诚实的说法是Flash 现在是默认Pro 是你需要拿出理由才用的例外。权重上线得比谁说的都快。AA 的发布报道称完整权重预计在「未来几周」推出多数二手报道至今仍在重复这句话。在 2026-08-01 核实时Hugging Face 上的deepseek-ai/DeepSeek-V4-Flash-0731已经以 48 个 safetensors 分片、MIT 许可、无门槛的形式提供了该模型。如果你在别处读到 0731 只有 API那大概只在一天左右的时间里是对的。在数字开始堆叠之前有一点值得先说清楚。Intelligence Index 是一个滚动排行榜下文的一切都是 2026-08-01 的快照。请把排序当作耐久的事实把绝对分数当作某一天的读数。参数速览对比DeepSeek V4 Flash 0731Gemini 3.6 FlashGPT-5.6 Lunaofox 模型 IDdeepseek/deepseek-v4-flashgoogle/gemini-3.6-flashopenai/gpt-5.6-lunaAA Intelligence Index v4.1505051 发布时间2026-07-310731 版本2026-07-212026-07-09输入价格厂商标价$0.14/M $1.50/M$0.20/M输出价格厂商标价$0.28/M $7.50/M$1.20/M缓存输入$0.0028/M $0.15/M$0.02/M上下文窗口1M1M (1,048,576)1M最大输出384K 64K (65,536)128K输入模态文本文本、图像、视频、音频、PDF 文本、图像输出速度AA快照时未公布219.6 tok/s 172.1 tok/s首 token 时间AA快照时未公布15.11s 121.89s开放权重是Hugging Face 上 MIT 许可 否否协议格式OpenAI、Anthropic、ResponsesOpenAI、GeminiOpenAI、Anthropic、Responses有两行值得再看一眼。最大输出是个真正的分水岭384K 对 64K是「一次调用生成长文件」和「构建续写循环」之间的区别。而空着的延迟单元格并不是排版失误。AA 关于 0731 版本的供应商页面在 2026-08-01 快照时没有列出任何速度或首 token 时间数据所以任何给你报某个每秒 token 数的人报的都是别的东西。基准全景三个模型仅差一分以下是 0731 版本的 AA 子项分数明细凡是 AA 公布了四月版本对应数据的都附上了差值。评测DeepSeek V4 Flash 0731相较四月版本的变化Intelligence Index v4.15010GDPval-AA v2 (Elo)1559370Terminal-Bench 2.179%17GPQA Diamond91%1AA-LCR66%3SciCode50%5Humanity’s Last Exam37%5τ³-Bench Banking31%8CritPt17%9AA-Omniscience Index-167Omniscience 这一行是大家会跳过的。AA 报告称提升来自更少的幻觉而非知道得更多准确率持平。对于一个你即将接入生产流量的模型来说「更少出错」比「知道更多」是更有用的升级而这恰恰是单一综合分会掩盖的那类东西。这里有两条来源说明因为这次发布不止一套数字在流传。DeepSeek 自己的发布材料报告 Terminal-Bench 2.1 为 82.7、DeepSWE 为 54.4、Cybergym 为 76.7。Artificial Analysis 报告的 Terminal-Bench 2.1 是 79%。两者都可能是对的测试框架、脚手架和努力档位各不相同而且快照时并没有第三方复现过 DeepSWE 和 Cybergym 的数字。我们全程采用 AA 的数字因为在这里的三个模型上只有它是用同一种方式测出来的。如果你在别处看到有人引用 82.7那是厂商自己的测试框架并非矛盾。另一条附在多数目录页包括我们的上的 DeepSeek V4 Flash 的 LMArena 分数显示为 Overall 1438、排名七十几更新于 2026-07-12。它比 0731 版本早了十九天测的是四月的模型。新版本的 Arena 分数需要新的投票在那之前任何对比页面上「DeepSeek V4 Flash」旁边的那个数字描述的都是一个在 AA 上低 10 分的模型。啰嗦税为什么价签差距不等于账单差距对这两个模型的每一篇对比都以 $0.14 对 $1.50 开头然后就停在那里。这个比例是真实的但它也是本文里最不可靠的数字因为它给一个 token 定价而不是给一件工作定价。Artificial Analysis 公布了更好的东西它用同一套 Intelligence Index 跑每个模型时实际付了多少钱连账单一起。模型该次指数跑的输出 tokenAA 该次跑的总花费DeepSeek V4 Flash 0731210M$72.02GPT-5.6 Luna130M$190.87Gemini 3.6 Flash59M$726.70同一套评测三张真实账单。Gemini 的花费是 DeepSeek 的 10.1xLuna 是 2.7x。对照输出价格 27x 和 4.3x 的价签比例这意味着 DeepSeek 纸面优势的大约 60% 在价格卡和账单之间的某处消失了。消失去了 token 里。DeepSeek 在那套评测上花了 210M 输出 tokenGemini 只用了 59MAA 将其标注为在同类中非常啰嗦。单把输出这一段按标价算DeepSeek 是 $58.80Luna 是 $156.00Gemini 是 $442.50这一段的差距是 7.5x。两张账单的构成也因此不同输出约占 DeepSeek 那次花费的 82%占 Gemini 的约 61%。这是一个为达到同样分数而写出三倍半文字的模型的特征。AA 不公布每个模型的输入 token 数所以剩下的部分无法从公开数字进一步拆解。你该按哪个数字来规划取决于你的流量。以提示为主的工作负载会贴近输入比例 10.7x。以生成为主的工作负载会被啰嗦压向 7.5x。AA 的端到端数字 10.1x 落在两者之间跑在一套本身就是混合的评测上这也是为什么在预算评审里需要辩护的场景用 10x 作默认比 27x 更靠谱。关于这些 token 数有两点提醒。它们来自 AA 的最大努力和高努力配置这是每个模型区间里最贵的那一端而非典型的生产设定。而且啰嗦程度取决于工作负载一套满是硬推理题的评测偏袒推理简短的模型而你的抽取流水线不是那套评测。关于 210M 的一条脚注因为流传着两个 AA 数字。模型页面报告该次指数跑为 210M 输出 tokenAA 的发布文章报告约 206M同时还有个更有意思的事实这比上一个 V4 Flash 版本花的约 234M少12%。所以 0731 既比同类更啰嗦又比自己的前代更省。我们全程用 210M因为模型页面的数字是这里三个模型都以同一种方式公布的那个。不过这个杠杆是真实存在的而且只是一个开关。DeepSeek 文档列出deepseek-v4-flash同时支持非思考和思考两种模式默认是思考模式而推理 token 按输出计费。对于有界任务关掉思考就是啰嗦税消失的地方。在你自己的流量上测量AA 的比例是个起点估计不是你的数字。要拿到你自己的数字只需在你真实提示的一个样本上跑一次因为每个 OpenAI 兼容的响应都会带上你需要的 token 计数import collections from openai import OpenAI client OpenAI(base_urlhttps://api.ofox.io/v1, api_keyYOUR_OFOX_API_KEY) costs { # input, output, per 1M tokens deepseek/deepseek-v4-flash: (0.14, 0.28), google/gemini-3.6-flash: (1.50, 7.50), openai/gpt-5.6-luna: (0.20, 1.20), } totals collections.defaultdict(float) for prompt in load_your_real_prompts(): # 50 is enough to see the shape for model, (pin, pout) in costs.items(): u client.chat.completions.create( modelmodel, messages[{role: user, content: prompt}] ).usage totals[model] (u.prompt_tokens * pin u.completion_tokens * pout) / 1e6 for model, spend in sorted(totals.items(), keylambda kv: kv[1]): print(f{model:32} ${spend:.4f} over the sample)用五十条有代表性的提示在三个模型上各跑一遍只花几分钱能告诉你的东西比任何排行榜都多。有两点要注意。给 DeepSeek 分别在思考开启和关闭下各跑一次因为这个开关对输出这一列的影响比模型选择还大。而且要从你实际的流量分布里取样而不是取最难的用例因为在硬推理题上测出的啰嗦比例无法迁移到一队两行的分类任务上。定价算账两张真实的月度账单以下所有价格均为厂商标价快照日期 2026-08-01按每 1M token 计。场景 A一个抽取流水线。每月 200M 输入 token 和 10M 输出 token无缓存输出为短结构化。模型输入成本输出成本月度合计DeepSeek V4 Flash 0731$28.00$2.80$30.80GPT-5.6 Luna$40.00$12.00$52.00Gemini 3.6 Flash$300.00$75.00$375.00输入占主导所以这个场景紧贴输入价格比例Gemini 的花费是 DeepSeek 的 12xLuna 是 1.7x。注意 7 月 30 日的降价把 Luna 的位置改变了多少。按旧的 $1 / $6同样的工作负载每月要 $260。场景 B一个编码智能体循环。每月 100M 输入 token缓存命中率 70%和 40M 输出 token。模型缓存输入新鲜输入输出月度合计DeepSeek V4 Flash 0731$0.20$4.20$11.20$15.60GPT-5.6 Luna$1.40$6.00$48.00$55.40Gemini 3.6 Flash$10.50$45.00$300.00$355.50那张表把 token 数固定住了这暗地里假设三个模型为做同一件工作会写出同样多的字。它们不会。改为固定工作量并按指数跑的啰嗦比例来缩放输出能给出同一个智能体循环更公平的画面模型等量工作所需的输出 token月度合计DeepSeek V4 Flash 0731142M$44.16GPT-5.6 Luna88M$113.00Gemini 3.6 Flash40M基准$355.50DeepSeek 从便宜 23x 变成便宜 8x。决策不变但你放进幻灯片的那个数字应该变。关于 DeepSeek 这套算账更深入的版本包括缓存未命中对真实账单的影响见我们的 V4 Pro 成本拆解 和 DeepSeek V4 API 定价指南。两个会左右你账单的定价细节DeepSeek 即将引入高峰时段定价。其定价文档里有一条脚注API 将采用高峰/非高峰政策高峰时段价格为常规价格的 2x适用于所有计费项生效日期待官方公告。高峰窗口为北京时间UTC809:00 到 12:00 和 14:00 到 18:00。 部分聚合网关包括 OpenRouter 和 ofox.io会在模型原始定价之上叠加路由层费率因此在计算 DeepSeek V4 Flash 0731 与 Gemini 3.6 Flash 的实际账单时需同时核查网关的 token 加价比例与最低计费单位这两项参数直接影响高频调用场景下的月度支出差异。在假设它无害之前先换算到你自己的时钟上。这些窗口落在美国东部时间 21:00 到 00:00 和 02:00 到 06:00对于美国白天的工作负载正是半夜落在中欧时间 03:00 到 06:00 和 08:00 到 12:00会吃掉一个欧洲团队的整个上午。如果你在欧洲运行而 DeepSeek 把它开起来那么工作日的前半天你的 $0.14 会变成 $0.28。这仍然低于 Gemini但已经不是你当初预算的那个数字。你走哪条通道购买可能和厂商标价不同。OpenAI 在 2026-07-30 把 GPT-5.6 Luna 降价 80%从 $1 / $6 降到 $0.20 / $1.20。通过 Azure 提供 Luna 的列表在 2026-08-01 快照时还没有变动包括我们的其中openai/gpt-5.6-luna是一条 Azure 通道显示 $1 / $6 标价。同一个模型 ID相差 5x纯粹取决于你落到哪个上游。模型快照时的通道输入输出缓存输入DeepSeek V4 Flash 0731DeepSeek 第一方$0.14$0.28$0.0028DeepSeek V4 Flash 0731阿里云 BaiLian$0.14$0.28$0.028DeepSeek V4 Flash 0731Azure$0.19$0.51$0.19Gemini 3.6 FlashGoogle / Vertex$1.50$7.50$0.15Gemini 3.6 FlashGoogle batch 或 flex$0.75$3.75$0.075GPT-5.6 LunaOpenAI 第一方$0.20$1.20$0.02GPT-5.6 LunaAzure$1.00$6.00$0.10那张表有两条脚注。我们的 Luna 列表在快照时正在跑一个 20% 的促销把 Azure 通道拉到实际 $0.80 / $4.80仍是 OpenAI 标价的四倍。而缓存读取那一列值得单独看一眼在 Azure 的 DeepSeek 通道上缓存读取和新鲜输入同价这抹掉了这个模型最大的那项成本优势。这张表教给你的通用规则是查通道而不是查模型名。某个实验室宣布的降价会立刻到达它自己的 API其他人则各按各自的节奏。上面七行里有两行是同一个模型价格却相差悬殊。纯文本实际会让你付出什么这次对比里最便宜的模型看不见东西。DeepSeek V4 Flash 0731 接受文本、调用函数、返回 JSON同时讲 OpenAI 和 Anthropic 两种协议格式就这些。Gemini 3.6 Flash 接受文本、图像、视频、音频和 PDF。GPT-5.6 Luna 接受文本和图像。这不是靠提示工程或更大预算能弥补的质量差距。如果你的流水线要发送坏掉界面的截图、扫描的发票或视频里的帧DeepSeek 的调用不会以更高价格优雅降级而是从结构上失败。对于这类工作上面每一张成本表都变得无关紧要这也是为什么模态那一行放在参数表靠上的位置而不是埋在最底下。一个常见的解法是把流量拆开多模态请求发给 Gemini其余全发给 DeepSeek前面放一个路由器。这比只选一个模型要多干点活但对于 90% 请求都是文本的流水线通常在第一个月就能回本。何时该选 DeepSeek V4 Flash 0731有量的纯文本工作负载账单是一项真实的支出。任何缓存命中率高的场景都受益尤其大因为 $0.0028/M 的缓存读取相当于新鲜输入 98% 的折扣是 50x 的降幅。长的单次生成也偏爱它384K 最大输出是 Gemini 上限的六倍。它也是三者中唯一公布了权重的在 Hugging Face 上以 MIT 许可发布所以如果计划是先用 API 做原型、之后自托管这一个是有路径的。对有界任务关掉思考。它就是上面 $15.60 和 $44.16 两行之间的区别。何时该选 Gemini 3.6 Flash只要涉及非文本模态价格还没进对话它就已经拍板了。还有当延迟对用户可见时219.6 输出 token/秒让它在快照时的 AA 速度排名里位列 185 个模型中的第三15.11 秒的首 token 时间对一个推理模型来说很快。以及当你希望你即将依赖的东西已经被第三方测过时因为 AA 公布了 Gemini 的速度和延迟却没有 0731 版本的。批处理档被低估了。对于能容忍延迟的工作$0.75 / $3.75 让 Gemini 与 DeepSeek 的有效距离减半。何时该选 GPT-5.6 Luna当你想在同一个模型上同时拥有三者中最高的指数分和视觉能力时而这次降价 80% 让这个组合变得实惠这在三周前还做不到。$0.20 / $1.20 的 Luna 在价格上现在更接近 DeepSeek 而非 Gemini得分却比两者都高一分。先查两件事。AA 测得的 121.89 秒首 token 时间是最大努力配置而最大努力不是交互式设定如果你在 UI 里用 Luna就用更低的努力档。还要确认你的网关把你放到哪条通道上因为降价前的 Azure 档是 OpenAI 标价的 5x。我们的 GPT-5.6 分档指南 讲了 Sol、Terra 和 Luna 如何分工。何时三者都不是正确答案如果你的工作负载很小这一切都无所谓。在每月几百万 token 的量级上这里最便宜和最贵选项之间的差别相对于一小时工程时间只是舍入误差你应该按能力来选然后往下走。如果你在追求零成本托管 API 就是错的工具。这个模型家族的免费和自托管路径是另一套单独的活带着实打实的额度上限见 DeepSeek V4 Flash 免费四条零成本路径。那些路径是针对 0731 之前的版本核实过的所以在依赖它们之前请重新核对额度。自托管路径此后有了变化0731 权重现在已在 Hugging Face 上以 MIT 许可提供所以免许可选项适用于当前版本而非四月那个。而如果这份活是深度多步的智能体工作、工具调用达到两位数那么这三个 flash 档模型都不是明显合适的选择。那是前沿档的领地诚实的答案是在你自己的轨迹上做基准测试而不是在任何人的指数上。我们之前的 Gemini Flash Lite 对决 DeepSeek V4 Flash 智能体循环对比 讲解了工具调用可靠性在深度上如何改变这笔账。通过 ofox 试用全部三个在一个循环里做 A/B三个都跑在一个 OpenAI 兼容的端点上所以对比是换个字符串的事而不是三套集成。模型 ID 分别是deepseek/deepseek-v4-flash、google/gemini-3.6-flash和openai/gpt-5.6-luna。 若需在同一请求循环中对 DeepSeek V4 Flash 0731、Gemini 3.6 Flash 与 GPT-5.6 Luna 执行并行 A/B 路由聚合网关方案如 OpenRouter 或 ofox.io可通过单一 API 端点将请求分发至多个模型从而在受控条件下采集延迟与输出质量的对比数据。Pythonfrom openai import OpenAI client OpenAI(base_urlhttps://api.ofox.io/v1, api_keyYOUR_OFOX_API_KEY) MODELS [ deepseek/deepseek-v4-flash, google/gemini-3.6-flash, openai/gpt-5.6-luna, ] prompt Refactor this function to remove the nested loop. Return only code. for model in MODELS: r client.chat.completions.create( modelmodel, messages[{role: user, content: prompt}], ) u r.usage print(f{model:32} in{u.prompt_tokens:6} out{u.completion_tokens:6})记录completion_tokens而不只是延迟。那一列就是啰嗦差异在你自己流量上显现的地方也是价签不会告诉你的那个数字。Nodeimport OpenAI from openai; const client new OpenAI({ baseURL: https://api.ofox.io/v1, apiKey: process.env.OFOX_API_KEY, }); const models [ deepseek/deepseek-v4-flash, google/gemini-3.6-flash, openai/gpt-5.6-luna, ]; for (const model of models) { const r await client.chat.completions.create({ model, messages: [{ role: user, content: Summarize this changelog in 3 bullets. }], }); console.log(model, r.usage.prompt_tokens, r.usage.completion_tokens); }DeepSeek 跑不了的那次调用同一个客户端、同一个端点一个改变一切的内容块。把它发给google/gemini-3.6-flash或openai/gpt-5.6-luna你会得到答案。把它发给deepseek/deepseek-v4-flash则无论什么价格都不行。import base64 img base64.b64encode(open(screenshot.png, rb).read()).decode() r client.chat.completions.create( modelgoogle/gemini-3.6-flash, messages[{ role: user, content: [ {type: text, text: Which element is misaligned?}, {type: image_url, image_url: {url: fdata:image/png;base64,{img}}}, ], }], ) print(r.choices[0].message.content)备选方案如果三个都不合适值得看的邻居就在同一个端点上。DeepSeek V4 Pro 标价 $0.435 / $0.87ofox 列表四舍五入为 $0.45 / $0.88现在是 AA 指数上更贵且分数更低的那个兄弟不过如果你有针对特定工作负载的证据表明它在你的轨迹上胜出它仍是正确选择。GPT-5.6 Terra 在 flash 档确实不够用时排在 Luna 之上。在 ofox 目录之外同样的模型可以从 DeepSeek、Google AI Studio 和 OpenAI API 第一方获得如果你只需要一个厂商、并且想在降价当天就拿到而不是等通道跟上那这是正确选择。 除直接调用各模型原生 API 外开发者也可通过 OpenRouter 或 ofox.io 等多模型路由层访问 DeepSeek V4 Flash 0731 与 Gemini 3.6 Flash两类方案在请求鉴权方式、速率限制策略及可用区域覆盖上存在差异选型时需结合具体部署环境加以评估。带实时定价的模型页面DeepSeek V4 Flash、Gemini 3.6 Flash、GPT-5.6 Luna。来源DeepSeek V4 Flash 0731 scores 50 on the Artificial Analysis Intelligence Index, 10 points above previous DeepSeek V4 FlashDeepSeek V4 Flash 0731 (max) - Intelligence, Performance Price AnalysisGemini 3.6 Flash - Intelligence, Performance Price AnalysisGPT-5.6 Luna (max) - Intelligence, Performance Price AnalysisModels Pricing | DeepSeek API Docshttps://ai.google.dev/gemini-api/docs/pricing?hlenhttps://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-6-flashhttps://developers.openai.com/api/docs/pricinghttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731