DeepSeek V4 Flash 0731 正式版实测:20轮小说、Responses Agent 与四档思考

📅 2026/8/1 9:29:01
DeepSeek V4 Flash 0731 正式版实测:20轮小说、Responses Agent 与四档思考
摘要DeepSeek-V4-Flash-0731 正式版 API 已上线公测稳定调用名仍是deepseek-v4-flash。我用旧版同题 20 轮长篇、原创 12 轮链、两张 RP 卡、四题材写卡和 Responses 工具闭环重跑了一遍。结论不是简单的“全面升级”0731 明显减少跨轮复读、Agent 工具可用但原著文风距离变大在 8192 token 输出上限下high/max 还可能把额度全部耗在 reasoning正文为 0。把上限放到 32K 后同一批 max 任务可以完整结束。7 月 31 日DeepSeek 官方更新日志写的是DeepSeek-V4-Flash 正式版 API 上线公测。这句话有四个边界API 调用名仍是deepseek-v4-flashDeepSeek-V4-Flash-0731是当前版本名不是请求时要填写的新 ID。0731 与 Preview 的架构、尺寸相同本次变化是重新后训练。这次只更新 Flash APIV4 Pro API、App 和 Web 模型没有同步切换。“正式版上线公测”不是全面 GA。我先请求官方/v1/modelsHTTP 200目录同时列出deepseek-v4-flash和deepseek-v4-pro。随后才开始生成测试。先给结论场景发布日结果当前建议Chat SSE200正常终止可用Responses SSE200正常终止可用Responses Agent 工具两步闭环auto下 200/200可用但不要强制required旧考卷 20 轮长篇20/20 完成少复读但文风与事实并非单边升级原创长篇 · none / low · 8K两档均 12/12 完成none 更快、更便宜原创长篇 · high / max · 8Khigh 首轮空正文max 第 4 轮空正文8K 不够max · 32K 续写完成706 字符32K 本轮够用max · 16K 四题材写卡只写出第 1 张卡开头失败max · 32K 四题材写卡四卡全部完成能完成但篇幅仍偏长官方价格英文价格页当日牌价单位均为每 100 万 token计费项美元输入 · 缓存命中$0.0028输入 · 缓存未命中$0.14输出含 reasoning$0.28中文价格页对应列为 0.02 元、1 元、2 元。本文成本统一按英文页美元牌价计算不把它描述成汇率换算。官方还预告未来高峰时段可能按 2 倍计价高峰为北京时间 09:00–12:00、14:00–18:00但生效时间仍写“以正式通知为准”。因此本文没有把 2 倍价格当作已经执行。协议与 Agent有一个真实 400Chat max SSE 用时 1.82 秒输出正确118 输入 token、43 输出 token其中 35 个 reasoning token。Responses max SSE 用时 1.71 秒输出正确111 输入、19 输出其中 9 个 reasoning token。Agent 工具测试使用 Responses 的无状态两步方式第一步让模型调用函数工具。客户端执行工具。第二次请求显式重放 reasoning 与 function call再附上function_call_output。tool_choiceauto时两步均为 200最终答案正确第二步还命中 512 个缓存 token。但thinkingmax tool_choicerequired在发布日真实返回 400Thinking mode does not support this tool_choice所以当前 Agent 路由不能把“必须调用工具”机械翻译成required。在 thinking 模式下用auto配合明确提示词可以走通。这个负例也解释了为什么“模型支持工具”不等于所有 OpenAI 参数组合都兼容。20 轮旧考卷少复读了文风却更远了这条轨复用旧 M69 长篇脚本同一本中文玄幻、同一 55% 起点、同一 21,500 字符滚动窗口、同一 B2 提示词、温度字段 0.7、max_tokens2800、思考档省略。历史链来自 0731 上线前新链直连官方稳定 ID。指标历史 Preview 链0731 正式版链完成轮数20/2020/20可见正文总字符6,5148,761每轮平均字符325.7438.180–220 字符合要求1/201/20跨轮 12-gram 最坏重叠72.0%1.2%与原著结构画像距离越低越贴0.3560.5500731 的进步很具体旧链第 14 轮与此前内容出现 72% 的机械重叠新链最坏只有 1.2%20 轮全部唯一没有来源标记泄漏。退步也很具体正文更长三轮超过 500 字符、两轮超过 1,000结构画像离原著更远。两套映射翻转盲评最终 1:1一位评审判 Preview 窄胜理由是文风、事实稳定和长度控制更好。另一位评审判 0731 小胜理由是推进更强、倒带和模板复演更少。两位评审其实在描述同一件事0731 更愿意往前写但更容易写成自己的长段落并临时改动人物或规则。这不是“全面提升 X%”而是一组取舍。新链 20 轮共输入 281,313 token、输出 22,764其中 reasoning 16,625占输出 73.03%。中位耗时 14.31 秒/轮总成本约 $0.04513。四档思考8K 下 none/low 能跑high/max 会空原创公开考卷《潮痕档案》要求每轮 450–700 字符连续写 12 轮窗口仍为 21,500 字符。四档都使用同一题面与 8,192 output token 上限。effort完成首正文中位单轮总耗时中位正文字符中位reasoning 合计成本none12/120.75s11.12s9210$0.00464low12/127.06s22.62s1,3036,179$0.00745high0/1无正文109.53s08,191$0.00252max前 3 轮有正文第 4 轮中断———第 4 轮 8,189$0.00755none 与 low 都跑满但长度控制都不合格两档均为 0/12 落入 450–700 字符low 反而更长。快速抽读还看到正文自我纠错和时间线硬填因此“接口完成”不能替代质量判断。high/max 的失败则非常明确HTTP 仍是 200但 output budget 被 reasoning 用完终止态是incomplete/length正文为 0。不是官方只给 8K是应用侧上限太旧DeepSeek 并没有把 V4 Flash 正式版限制在 8K 输出。本轮 8K 是应用常见的请求包络。我们随后只改一个变量把 max 档输出上限放到 32,76832K 定点 case结果reasoning可见正文总耗时成本原创续写首轮completed6,806706 字符106.1s$0.00206四题材角色卡completed四卡齐全12,4425,852 字符206.9s$0.0046632K 足以让两条此前被截断的 max 任务完整结束没必要直接冲到 64K。四张卡虽然齐全四个开场仍都超过题面 700–1,000 字符所以这是“解除截断”不是“质量全绿”。这也给应用开发一个明确修复方向不要对所有模型统一硬截 8K。计费预扣仍要保留但上限应按模型和 reasoning 档分级。DeepSeek V4 Flash 的 none/low 可继续用 8Khigh/max 至少应给到本轮验证过的 32K。UI 的“关闭思考”必须真的发送 Responsesnone或 Chatthinkingdisabled。如果只是“不传参数”DeepSeek 会回到默认 high并不是真的关闭。RP 与写卡接口成功不代表事实稳定两张角色卡各 4 轮 RP共 8/8 完成长度也都落在 180–350 字符。但人工快检发现三类硬问题为化解公开母亲录音的伦理质疑临时编出题面没有的许可式原话。便利店人数直接写错。02 点场景突然跳到 11:59。因此 RP 的结论是“API 与长度闸通过事实纪律仍需模型或提示词层修复”。四题材写卡在 16K max 档下用了约 16.2K reasoning只剩 255 字正文仅写出第一张卡开头32K 后四卡齐全。这个 case 很适合当生产回归一旦服务端又把 DS high/max 压回 8K/16K它会立刻红。缓存与总费用不同请求形态的缓存差异很大Agent 工具第二步命中 512 token。M69 20 轮旧考卷只命中 4,608 / 281,313 输入 token约 1.64%。原创 none/low 12 轮分别命中约 77.35% / 78.00%。所有 Responses 内容调用的cache_write_tokens都是null官方 usage 只明确提供命中 token不应虚构“写缓存 token”。本轮所有官方调用合计估算 $0.07994。按1 credit $0.0001直接换算、总额一次向上取整是 800 credits若像应用账本一样每个请求分别向上取整约 832 credits。这里是上游成本等价不包含应用可能设置的服务加价。最后结论DeepSeek-V4-Flash-0731 的 API 确实已上线Chat、Responses、缓存和 Responses Agent 工具闭环都能工作。与 Preview 同题相比它的长篇机械复读大幅下降但文风距离、事实稳定和长度服从没有同步变好。对应用开发者发布日最重要的不是“换模型 ID”而是三件事调用名继续用deepseek-v4-flash。thinking Agent 用tool_choiceauto不要在当前版本强制required。high/max 不要再给统一 8K32K 是本轮已经验证能解除截断的起点。若想真正关闭思考必须显式传none/thinkingdisabled。样本边界也写清20 轮对比只有单书、单起点、单链原创努力档也是每档一条链不足以做统计显著的通用排行榜。本文能证明的是发布日端点的真实行为和几个稳定复现的工程风险。官方资料DeepSeek 2026-07-31 更新日志https://api-docs.deepseek.com/zh-cn/updates/#时间-2026-07-31模型与价格https://api-docs.deepseek.com/zh-cn/quick_start/pricing/思考模式https://api-docs.deepseek.com/zh-cn/guides/thinking_mode/Responses APIhttps://api-docs.deepseek.com/zh-cn/guides/responses_api/标签DeepSeek-V4-Flash/DeepSeek V4/Responses API/Agent/大模型评测/AI 写作