Flash 不再是“次旗舰”:Gemini 3.6 Flash 与 DeepSeek V4-Flash-0731 的 Agent 成本战

📅 2026/8/15 12:01:07
Flash 不再是“次旗舰”:Gemini 3.6 Flash 与 DeepSeek V4-Flash-0731 的 Agent 成本战
目录一、DeepSeek对Google的冲击力二、Google 的三层产品策略一Gemini 3.6 Flash不是冲顶而是压缩完成任务的路径二Gemini 3.5 Flash-Lite面向流水线和子智能体三Gemini 3.5 Flash Cyber垂直模型开始形成受控溢价四托管 Agent 是 Google 溢价的重要组成部分三、DeepSeek 0731后训练成为成本战武器四、两条技术路线的本质差异一Google模型只是系统的一层二DeepSeek把模型结构和部署权交给市场五、跑分解读不要把不同 benchmark 拼成一张排行榜六、单位任务经济学价格战真正打在哪里一裸 token 单价DeepSeek 的冲击是数量级的二但“每百万 token”不是最终成本三Google 的溢价要靠什么兑现七、行情面模型商业模式正在分层一Flash 层成为生产主力而不是过渡产品二开放模型正在设置全球价格地板三模型路由将成为默认架构四行业估值逻辑也会变化八、Gemini 3.5 Pro 延期意味着什么九、企业选型混合路由比“唯一冠军”更现实十、采购与上线的指标体系一六个必须量化的指标二采购表里最重要的一行十一、结论数据口径与计算说明参考资料干货分享感谢您的阅读2026 年 7 月 21 日Google 发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite并宣布 Gemini 3.5 Flash Cyber 将通过 CodeMender 向政府和可信合作伙伴开展限量试点。3.6 Flash 与 Flash-Lite 是正式可用于生产的 GA 模型并非“只发布 API”它们同时进入 Gemini API、AI Studio、企业 Agent 平台等渠道。[1][3]十天后的 7 月 31 日DeepSeek 对 V4-Flash 做了后训练升级并将最新版 API 置于公开测试。这里最容易被误读的一点是V4-Flash 并不是 7 月 31 日首次出现DeepSeek V4 预览版早在 4 月 24 日就已经上线并同步开源0731 更像一次“同架构、换后训练”的 Agent 能力跃迁。[5][6]如果只看标准输出单价Gemini 3.6 Flash 为 7.50 美元/百万 tokenDeepSeek V4-Flash 官方价为 2 元人民币/百万 token独立评测采用约 0.28 美元的换算口径二者表面差距约 26.8 倍。[4][7][10] 但在 Artificial Analysis 的同一智能指数中两者均为 50 分Gemini 生成约 5900 万输出 token、总评测成本 726.70 美元DeepSeek 生成约 2.10 亿 token、总成本 72.02 美元。也就是说在这个特定评测里实际总成本差约为 10.1 倍而不是裸单价显示的 26.8 倍。[9][10]这组数据揭示了 2026 年 Agent 市场最重要的变化模型厂商开始从“能力峰值”转向“任务经济性”。Flash 不再只是旗舰模型的廉价替代品而是在大量生产工作流中承担主模型、路由模型和子智能体的核心层级。一、DeepSeek对Google的冲击力过去两年行业习惯用“旗舰模型—小模型”理解产品线旗舰负责智力天花板小模型负责省钱。但 Agent 工作流改变了这一结构。一个真实 Agent 任务通常不是一次问答而是连续的规划、检索、工具调用、环境观察、修正和重试。即便单次模型调用不贵只要一个任务循环几十次模型的输出冗长度、工具选择准确率和失败重试率就会被放大。生产系统真正需要的不是偶尔答出难题而是以稳定延迟和可预算成本完成大量中高难度任务。Google 对 3.6 Flash 的官方定位不是旗舰而是 “workhorse model”即工作马型主力模型发布说明重点也不是更大的参数规模而是 17% 更少的输出 token、更少的推理步骤和工具调用以及更低的输出价格。[1] 这说明 Flash 已经从“降级版本”转为生产 Agent 的默认执行层。DeepSeek 的路线更激进。V4-Flash 本身就是 284B 总参数、13B 激活参数的 MoE 模型0731 没改架构和模型大小主要通过后训练提升终端、代码、工具调用与自动化任务表现。[6][8] 它证明了一个对行业定价极具冲击力的命题在基座模型已经足够强之后Agent 能力的边际提升可以大量来自后训练、工具框架适配和推理策略而不必每次都依赖更昂贵的预训练扩张。这也是所谓“Agent 斩杀线”更合理的技术解释它不是某个单一分数而是当模型同时满足以下三点时企业采用速度会突然加快任务成功率足够接近前沿模型不再需要每一步人工兜底工具调用和多轮规划足够稳定能形成闭环单位成功任务成本低到可以接受重试、并行探索和大规模调用。DeepSeek 在第三点上形成明显冲击Google 则试图用第一、第二点以及多模态和平台能力让更高价格变得可解释。二、Google 的三层产品策略一Gemini 3.6 Flash不是冲顶而是压缩完成任务的路径Gemini 3.6 Flash 基于 3.5 Flash支持文本、图片、音频和视频输入1M 上下文最大 64K 文本输出。[2] Google 公布的核心提升包括DeepSWE 从 37% 提升至 49%MLE-Bench 从 49.7% 提升至 63.9%OSWorld-Verified 从 78.4% 提升至 83.0%Artificial Analysis 口径下输出 token 用量下降 17%标准价格从 3.5 Flash 的 1.50/9.00 美元调整为 1.50/7.50 美元输入/输出每百万 token。[1][2][4]这里最值得关注的是“token 效率”而不是单一跑分。假设一个任务在 3.6 上确实比 3.5 少用 17% 输出 token且重试率、输入长度和质量保持不变那么输出侧成本相对 3.5 Flash 的理论比例为0.83 × 7.50 ÷ 9.00 ≈ 0.692也就是输出费用理论上下降约 30.8%。这不是 Google 公布的独立指标而是根据官方 token 降幅和价格做出的推算实际业务还会受到工具调用、缓存、失败重试和思考档位影响。这种优化对 Agent 的意义远大于普通聊天。模型每少一次无效思考、重复解释或错误工具调用都可能同时降低 token、延迟和外部 API 费用。换句话说3.6 Flash 的产品逻辑不是“用更强模型做同样的回答”而是“用更短的执行路径完成同样的工作”。二Gemini 3.5 Flash-Lite面向流水线和子智能体Flash-Lite 的定位更明确350 输出 token/s、0.30 美元输入与 2.50 美元输出适合高吞吐的搜索后台、文档处理、翻译、分类、抽取和子智能体任务。[1][4]在多 Agent 架构中最昂贵的错误之一是“所有步骤都调用最强模型”。一个主 Agent 可能只负责拆解和验收而几十个并行子任务只需要完成查找、转换、摘要或候选生成。Flash-Lite 的价值不在于替代主模型解决最难问题而在于把系统中大量可标准化步骤迁移到更低成本层。这也是 Google 产品线开始“计算机系统化”的信号模型不再只按大、中、小排列而是按主 Agent、子 Agent、批处理与垂直任务分工。三Gemini 3.5 Flash Cyber垂直模型开始形成受控溢价Flash Cyber 基于 3.5 Flash针对发现、验证和修复代码漏洞进行微调并与 CodeMender 的多 Agent 编排结合。Google 明确表示考虑到网络安全能力的双重用途该模型只面向政府和可信合作伙伴开展限量试点而不是公开 API。[1]这一安排对行业有两层含义。第一垂直模型的竞争不只发生在模型参数上还发生在专用数据、评测环境、工具链和部署权限上。Cyber 模型离开 CodeMender 的扫描、验证、补丁和报告协作流程商业价值会明显下降。第二未来高价值模型未必都以“公共 API 每百万 token”定价。安全、医疗、法律、金融等领域更可能以席位、任务、托管环境、审计与责任边界打包收费。Flash Cyber 是这种垂直化商业模式的早期信号。四托管 Agent 是 Google 溢价的重要组成部分Google 的 Managed Agents API 可以通过一次 API 调用创建托管式自主智能体在隔离沙盒内进行推理、规划、代码执行、网络搜索和文件读写。但该服务目前仍是预览版官方明确提示不应用于生产或敏感工作流。[11]这意味着 Google 的竞争单位正在从“一个模型端点”扩大为“模型 执行环境 身份权限 数据连接 安全治理 观测”。对于缺乏 Agent 基础设施团队的企业这些能力可能抵消一部分 token 单价差对于已有成熟编排平台、需要私有部署或希望避免供应商锁定的团队这种溢价则未必划算。三、DeepSeek 0731后训练成为成本战武器DeepSeek 官方把 7 月 31 日版本描述为 V4-Flash API 的正式版本进入公开测试并强调 Agent 能力显著增强。其官方数据包括 Terminal Bench 2.1 82.7、DeepSWE 54.4、CyberGym 76.7、Toolathlon Verified 70.3 等。[6]更关键的是官方备注0731 与 V4-Flash 预览版保持相同架构和规模只做后训练更新。[6] 这把行业关注点从“谁能训练更大模型”进一步转向“谁能让既有基座在工具环境中学会更有效地行动”。V4 技术报告披露V4-Flash 是 284B 总参数、13B 激活参数的 MoE 模型支持 1M 上下文整个 V4 系列采用混合压缩/稀疏注意力、超连接和新的优化方法并经历大规模预训练与综合后训练。[8] 与闭源 Gemini 不同DeepSeek 提供 MIT 开放权重企业可以在满足资源条件时进行本地部署、量化、蒸馏或深度定制。[5][10]当前 API 价格为缓存命中输入 0.02 元、缓存未命中输入 1 元、输出 2 元均按百万 token 计支持 1M 上下文、最长 384K 输出、工具调用、Responses API 与 Anthropic API。[7]DeepSeek 的战略优势并不只是“便宜”而是三种自由度的叠加价格自由度低 API 单价允许更激进的并行探索与重试部署自由度开放权重让企业可以在私有环境中部署工程自由度团队可以自行修改推理栈、缓存、路由、量化和安全策略。它的短板同样明确当前主模型是文本输入/文本输出多模态能力不与 Gemini 位于同一层级开放部署还意味着企业要自行承担推理基础设施、扩缩容、监控、安全和模型更新成本。[9][10]四、两条技术路线的本质差异一Google模型只是系统的一层Gemini 3.6 Flash 的公开资料没有披露总参数、激活参数或具体 MoE 路由细节因此不宜把“某种 MoE 改进、KV 缓存压缩、Agent 专项 RL”写成已证实事实。官方能够确认的是它基于 3.5 Flash原生支持多模态输入减少输出 token、推理步骤和工具调用并在代码、知识工作和计算机操作上提升。[1][2]Google 的基础设施方向与这种生产型模型高度一致。第八代 TPU 被拆分为面向大规模预训练的 TPU 8t以及面向后训练、高并发推理和推理链的 TPU 8i。TPU 8i 配置更大的片上 SRAM 和更高 HBM 带宽目标是容纳更大的 KV Cache、降低长上下文解码等待并提高大型 MoE 的推理性价比。[12]但需要强调公开资料并未证明 Gemini 3.6 Flash 的所有线上请求都运行在 TPU 8i 上。更稳妥的判断是Google 正在让芯片、编译器、模型与 Agent 平台围绕同一类高并发工作负载协同设计这是其成本和延迟优势的潜在来源也是闭源生态最难被简单复制的部分。Gemini Omni Flash 进一步强化了这一系统路线。它支持文本、图片、音频和视频输入输出带音频的视频并提供对话式视频编辑API 于 6 月 30 日进入公开预览。[3][13] 因此Gemini 的多模态优势不是 3.6 Flash 单点能力而是模型家族、媒体生成和 Google 产品分发共同构成的能力面。二DeepSeek把模型结构和部署权交给市场DeepSeek V4-Flash 的技术路线更透明MoE、284B/13B、1M 上下文、开放权重以及针对长上下文效率的结构创新都有技术报告支撑。[8] 0731 则展示了后训练和 Agent harness 的重要性模型结构没变但通过新的训练与适配可以显著改变工具环境中的任务完成能力。[6]这类路线特别适合代码、终端、文档和结构化业务流程因为任务可被清晰定义、工具输出可验证、奖励信号相对明确。它也有利于企业自行搭建“模型—工具—验证器—回退”闭环。两条路线并非简单的先进与落后而是不同商业组织方式Google 把复杂性封装在云、平台和产品里向客户出售“少建设基础设施”的便利DeepSeek 把权重和价格交给客户向市场释放“自行优化与部署”的自由。前者更像完整操作系统后者更像高性能开放内核。五、跑分解读不要把不同 benchmark 拼成一张排行榜原始材料把 Gemini 的 OSWorld 83.0 与 DeepSeek 的 82.7 并列容易产生“两者电脑操作能力几乎相同”的印象。实际上DeepSeek 82.7 是 Terminal-Bench 2.1。Google 也公布了自己的 Terminal-Bench 2.1 成绩 78.0但使用 Terminus-2 harnessDeepSeek 使用即将发布的 DeepSeek Harness minimal mode并设置 max effort、top_p 0.95、temperature 1.0。[2][6]这说明即便 benchmark 名称相同执行框架、工具协议、提示模板、采样参数和重试策略也会改变结果。Agent 跑分尤其容易被 harness 放大因为“模型如何行动”与“框架允许模型如何行动”密不可分。DeepSWE 的 49.0 与 54.4 也只能作为方向性参考。两家公司都给出官方自报结果但测试环境不完全统一。更可靠的做法是使用同一独立机构、同一评测管线的结果作为补充Artificial Analysis 当前给 Gemini 3.6 Flash high 与 DeepSeek V4-Flash-0731 max 都打出 50 分。[9][10]然而即便统一指数相同也不能得出“能力完全相同”。Gemini 支持多模态输入DeepSeek 当前为文本模型Gemini 在独立测试中更简洁、更快DeepSeek 更便宜但输出更长。一个综合指数会压缩这些结构性差异。企业评测应至少分成四类任务质量是否最终完成、结果是否正确过程可靠性工具调用错误、循环、幻觉操作和人工接管效率输入、思考、输出 token首 token 延迟与尾延迟业务约束多模态、数据边界、审计、部署方式与供应商锁定。跑分是诊断模型能力的仪器而不是代替采购决策的合同。六、单位任务经济学价格战真正打在哪里一裸 token 单价DeepSeek 的冲击是数量级的Gemini 3.6 Flash 标准价格为 1.50 美元输入、7.50 美元输出Batch 和 Flex 可降至 0.75/3.75 美元。Gemini 3.5 Flash-Lite 为 0.30/2.50 美元。[4] DeepSeek V4-Flash 为 1 元人民币输入、2 元人民币输出缓存命中输入仅 0.02 元。[7]采用 Artificial Analysis 的美元换算DeepSeek 为 0.14/0.28 美元Gemini 3.6 标准输出单价约高 26.8 倍即使使用 Gemini Batch/Flex输出单价仍约高 13.4 倍。[4][10]对于纯文本、可异步、可验证的代码或批处理 Agent这种差距足以重塑架构开发团队可以让多个 DeepSeek Agent 并行探索方案再由规则或更强模型验收过去因为成本过高而无法部署的反复尝试也可能变得可行。二但“每百万 token”不是最终成本一个更完整的公式是每任务成本 输入成本 推理/输出成本 工具成本 重试成本 编排成本 基础设施与延迟成本再进一步采购真正应该看每成功任务成本 全部任务总成本 ÷ 最终成功任务数如果一个低价模型输出更长、重试更多、调用更多外部工具裸价优势会被部分消耗如果一个高价模型依赖昂贵的搜索、地图、浏览器或视频工具其真实成本也可能明显高于 token 账单。Artificial Analysis 的同一指数提供了一个很有启发性的样本两者均为 50 分Gemini 生成 59M 输出 token总评测成本 726.70 美元DeepSeek 生成 210M token总成本 72.02 美元。[9][10]由此可以得到三个重要数字DeepSeek 输出 token 数约为 Gemini 的3.56 倍Gemini 原始输出单价约为 DeepSeek 的26.8 倍最终评测总成本差约为10.1 倍。这并不能直接代表任何企业业务但它说明成本差距会被模型行为改变DeepSeek 的低价依然形成巨大优势只是“每任务”差距没有裸单价那么夸张Gemini 的简洁和速度确实有经济价值但在该测试中尚不足以抵消价格差。三Google 的溢价要靠什么兑现Gemini 3.6 Flash 的溢价只有在以下场景更容易成立任务需要图片、音频、视频和复杂文档原生理解Google Search、Maps、Workspace 或 Gemini Enterprise 集成能显著减少工程建设托管沙盒、身份权限、审计和合规降低了企业运维成本更短输出、更少工具循环或更低失败率能够明显减少全链路成本对延迟和吞吐的业务价值高于 token 差价。反过来如果任务是文本/代码为主、结果可自动验证、团队具备推理基础设施能力并且需要私有部署或高度定制DeepSeek 的成本优势更难被闭源系统溢价抵消。七、行情面模型商业模式正在分层一Flash 层成为生产主力而不是过渡产品Google 把 3.6 Flash 称为主力工作模型把 Flash-Lite 定义为高吞吐子智能体DeepSeek 则用 Flash 型号承接 1M 上下文、思考模式、Responses API 和高强度代码 Agent。[1][6][7] 这说明“Flash”已经不再等于低智力而是代表经过任务经济性优化的生产层。未来模型产品线更可能按执行角色划分旗舰模型解决极难、低频、价值高的任务主力 Flash承担大部分中高难度 Agent 工作Lite/小模型分类、抽取、路由、候选生成和批处理垂直模型在安全、医疗、法律等领域与专用工具和权限结合。二开放模型正在设置全球价格地板DeepSeek 的价格不只是争夺自身 API 份额它还会影响所有闭源厂商的议价方式。当文本/代码 Agent 的可用能力以极低价格出现闭源厂商不能只用“更强一点”解释几十倍单价而必须把多模态、服务稳定性、治理、数据连接、分发与生产支持打包为系统价值。因此价格战不一定导致所有厂商同步降到同一水平更可能导致市场分层通用文本与代码推理价格继续下探多模态、搜索、实时数据、托管执行和企业治理维持溢价高风险垂直能力以受控准入和服务合同定价开源自部署市场围绕推理优化、硬件和运维形成新的利润池。三模型路由将成为默认架构单一模型很难同时在多模态、代码、成本、延迟、隐私和治理上最优。随着价格和能力差异扩大企业最合理的选择不是押注唯一供应商而是建设模型路由层。典型组合可能是DeepSeek 处理大规模文本、代码、终端与内部批处理Gemini 处理图片、视频、音频、搜索和 Google 生态工作流Flash-Lite 承担分类、抽取、候选生成和子 Agent规则引擎、小模型或人工审批负责高风险动作和最终校验。这种架构会把竞争从“模型排行榜”推向“路由、评测、观测和数据闭环”。厂商能否被安全替换逐渐与模型本身能力同样重要。四行业估值逻辑也会变化当 Agent 能力趋近、token 单价快速下降模型公司的价值不再只由基准分数决定而会更多取决于是否拥有低成本推理基础设施是否掌握高频分发入口和企业数据连接是否形成稳定的任务闭环与开发者生态是否能在安全、审计和责任边界上获得企业信任是否能把模型调用转化为可持续的应用收入。Google 的优势偏向基础设施、产品分发和企业平台DeepSeek 的优势偏向训练效率、开放生态和价格冲击。两者并不是在同一张损益表上比赛。八、Gemini 3.5 Pro 延期意味着什么Gemini 3.5 Pro 的延期确实削弱了 Google 在“前沿旗舰叙事”上的节奏。I/O 2026 时Google 表示 Pro 预计次月推出到 7 月 21 日官方措辞变成与合作伙伴继续测试、准备好后再广泛开放。[1][14]但从产品策略看Google 并没有因为 Pro 延期而停止推进模型商业化反而迅速推出 3.6 Flash、Flash-Lite 和 Cyber。这可能说明 Google 把生产收入、Agent 吞吐和开发者反馈放在比“按期发布旗舰”更高的位置。媒体报道显示团队在延期期间继续收集真实用例反馈并调优编码竞争压力也是市场关注焦点。[15] 但在没有官方技术说明的情况下不能把“代码能力未达到内部标准”写成确定原因。延期带来的风险主要有三点品牌风险市场会怀疑 Google 是否在最难的代码和长程 Agent 任务上落后产品线风险Flash 过强而 Pro 缺位可能让高价值工作负载流向其他旗舰模型定价风险如果 DeepSeek 等低价模型继续逼近主流闭源模型Pro 上线时需要更清晰地证明高价价值。但它也可能带来一个正面信号Google 愿意先修复真实用户反馈中的 verbosity、工具循环和任务成本再扩大旗舰发布。对于企业客户稳定性往往比发布会时间表更重要。Google 同时确认已经启动 Gemini 4 的最大规模预训练。[1] 这意味着 3.5 Pro 的延迟不代表下一代训练停滞但也带来产品节奏并行管理的挑战团队必须同时维护 3.5 Pro、3.6 Flash 和 Gemini 4 的研发与商业化路径。九、企业选型混合路由比“唯一冠军”更现实下面是一套更实用的场景判断。场景优先方向原因主要风险大规模文本与代码 AgentDeepSeek V4-FlashAPI 低价、开放权重、终端/代码适配强输出偏长需自建治理和多模态补充图片、音频、视频、复杂文档Gemini 3.6 Flash原生多模态、1M 上下文、Google 工具与平台token 和工具成本高闭源锁定搜索后台、抽取、翻译、分类Gemini 3.5 Flash-Lite 或小模型高吞吐、低延迟、适合作为子 Agent复杂推理和高风险决策能力有限私有数据与本地部署DeepSeek 开放权重模型和推理栈可控需要硬件、运维、安全和升级能力Google Workspace / Cloud 深度集成Gemini数据连接、权限、治理与平台协同平台迁移成本与价格不透明性网络安全漏洞发现与修复Flash Cyber符合准入时或自建安全栈专用模型与 CodeMender 编排非公开调用双重用途和责任风险高高价值、不可逆动作混合架构 人工审批模型互审、规则校验、权限隔离系统复杂度和延迟增加企业路由层至少要具备任务分类、成本预算、上下文压缩、模型回退、超时控制、工具权限、审计日志、A/B 测试和版本锁定。只有把这些能力放在模型之外企业才不会因为一次模型升级或价格调整被迫重写整个系统。十、采购与上线的指标体系建议在正式采购前用自有数据进行至少两周的影子流量或离线回放。评测集不能只包含“模型容易成功的标准样本”还要覆盖长上下文、工具失败、权限不足、网页变化、模糊需求和错误输入。一六个必须量化的指标任务成功率区分一次成功、重试后成功和最终失败不要只看回答是否“像对的”。重试与人工接管率模型便宜但需要频繁重试可能比高价模型更贵人工接管也是成本。延迟分布记录首 token 时间、P50、P95 与超时而不是只看平均输出速度。长尾延迟会直接影响交互体验和并发容量。单位任务 token分别记录输入、思考和输出 token观察上下文是否持续膨胀、模型是否冗长以及缓存是否有效。工具可靠性记录函数参数错误、权限失败、网页/终端状态误判、重复调用和不可逆动作。很多 Agent 事故并不是模型不会推理而是工具层缺乏约束。治理与可迁移性验证数据保留、训练使用、区域、审计、密钥、供应商切换、提示模板和工具协议是否可迁移。二采购表里最重要的一行最终决策应围绕每成功任务成本 模型 工具 计算 重试 人工÷ 最终成功任务数在此基础上再用业务价值校正高价值、强实时、多模态或受监管任务可以接受更高成本低价值、高频、可验证任务应优先压缩价格。这套指标会让“Gemini 贵几十倍”或“DeepSeek 能力差不多”从口号变成可验证的问题。某些业务中DeepSeek 可能以数量级优势胜出另一些业务中Gemini 的多模态、平台集成和更短执行路径可能降低总拥有成本。答案必须由真实任务数据决定。十一、结论Google 7 月发布的不是传统意义上的新旗舰而是一套围绕生产 Agent 的分层产品3.6 Flash 做主力执行3.5 Flash-Lite 做高吞吐子任务Flash Cyber 探索受控垂直能力Managed Agents 与 TPU/Cloud 体系负责把模型扩展为完整平台。DeepSeek 7 月 31 日也不是从零发布 V4-Flash而是用后训练升级证明不改变模型架构和大小也可以显著提高 Agent 表现。配合开放权重和极低 API 价格它正在重设文本与代码 Agent 的成本底线。因此所谓“正面交锋”不应被简化为一张 49 对 54.4、83 对 82.7 的表格。真正的竞争是Google 能否让多模态、托管执行、治理和生态带来的系统价值持续覆盖 token 溢价DeepSeek 能否在保持低价和开放的同时减少冗长、提高多模态能力并让大规模部署更稳定企业能否建立自己的评测和路由层不被任何一家厂商的跑分叙事绑架。**最终判断**DeepSeek 赢得了“开放 Agent 的成本底线”Gemini 仍然掌握“多模态与托管系统的溢价空间”。短期内不会出现单一赢家最可能胜出的企业架构是混合模型、按任务路由、以每成功任务成本为核心指标。数据口径与计算说明价格均为截至 2026-08-05 的公开页面价格后续可能变化。DeepSeek 的美元单价采用 Artificial Analysis 页面显示值官方计价货币为人民币。26.8 倍 7.50 ÷ 0.2813.4 倍 3.75 ÷ 0.28。10.1 倍 726.70 ÷ 72.023.56 倍 210 ÷ 59。Gemini 3.6 相对 3.5 的理论输出成本比例 0.83 × 7.50 ÷ 9.00约为 0.692该值为推算不是官方业务承诺。官方 benchmark 结果来自各自厂商测试 harness 和参数可能不同文中不把它们视作严格同口径排名。所有速度数据均受推理模式、上下文、并发和服务区域影响不是固定 SLA。参考资料[1] Google, “Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber,” 2026-07-21.https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/[2] Google DeepMind, “Gemini 3.6 Flash - Model Card,” 2026-07.Gemini 3.6 Flash - Model Card — Google DeepMind[3] Google AI for Developers, “Gemini API Release Notes.”https://ai.google.dev/gemini-api/docs/changelog[4] Google AI for Developers, “Gemini Developer API Pricing.”https://ai.google.dev/gemini-api/docs/pricing[5] DeepSeek, “DeepSeek-V4 预览版迈入百万上下文普惠时代,” 2026-04-24.DeepSeek-V4 预览版迈入百万上下文普惠时代 | DeepSeek API Docs[6] DeepSeek API Docs, “Change Log: DeepSeek-V4-Flash Update,” 2026-07-31.Change Log | DeepSeek API Docs[7] DeepSeek API Docs, “模型 价格.”模型 价格 | DeepSeek API Docs[8] DeepSeek-AI et al., “DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence,” arXiv:2606.19348.[2606.19348] DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence[9] Artificial Analysis, “Gemini 3.6 Flash (high) - Intelligence, Performance Price Analysis.”Gemini 3.6 Flash - Intelligence, Performance Price Analysis[10] Artificial Analysis, “DeepSeek V4 Flash 0731 (max) - Intelligence, Performance Price Analysis.”DeepSeek V4 Flash 0731 (max) - Intelligence, Performance Price Analysis[11] Google Cloud, “Agent Platform 上的 Managed Agents API 概览.”https://docs.cloud.google.com/gemini-enterprise-agent-platform/build/managed-agents?hlzh-cn[12] Google Cloud, “TPU 8t and TPU 8i Technical Deep Dive.”https://cloud.google.com/blog/products/compute/tpu-8t-and-tpu-8i-technical-deep-dive[13] Google DeepMind, “Gemini Omni Flash - Model Card.”Gemini Omni Flash - Model Card — Google DeepMind[14] Google Cloud, “2026 Google I/OGoogle Cloud 重点精华,” 2026-05-20.https://blog.google/intl/zh-tw/products/cloud/2026-google-io-google-cloud-highlights/[15] Business Insider, “Googles Gemini 3.5 Pro Release Slips to July,” 2026-06.https://www.businessinsider.com/google-3-5-pro-july-release-tokens-ai-agents-model-2026-6