deepseek-v4-flash 为什么适配 Codex 这么好,以及deepseek的Harness

📅 2026/8/12 21:25:20
deepseek-v4-flash 为什么适配 Codex 这么好,以及deepseek的Harness
deepseek-v4-flash跑在codex里不是简单的换一个模型否则deepseek也不会用心提供专门的适配安装了。使用codex不要使用cc-switch去接deepseek-v4-flash那样的话效果会大打折扣上一篇《gpt没额度了我用deepseek-v4-flash 连续跑两天花了 14 亿 token40人民币》把 Codex 主力模型换成 deepseek-v4-flash 跑了 48 小时真实工作结论是「值得」。但那篇文章只回答了”便宜又稳”没回答”为什么它能在 Codex 里被用好”。这篇翻到适配层去看两样东西本机~/.codex/models.json这个 76KB 的模型目录文件到底写了什么、为什么里面那段 1.77 万字符的instructions_template对工作效率影响这么大以及 DeepSeek 更新日志里反复提到的 Harness 是什么、走到哪一步了。前半是本地配置的逐字段拆解后半是公开资料的整理官方确认和社区猜测我会分开标注。适配一个 Agent 客户端光有 API 兼容不够Codex 不是一个”把消息发给模型”的薄客户端它是一个复合体通信协议、工具系统、系统提示三层叠在一起。模型要进来三件事缺一不可协议层客户端用 OpenAI Responses API 和模型对话模型得原生支持这个格式否则要在中间套一层转换代理元数据层客户端要”知道”模型的上下文窗口、推理档位、工具调用格式等能力才能决定怎么规划上下文、要不要开并行工具、能不能派子代理——这部分由~/.codex/models.json声明行为层模型要按 Codex 的代理工作流说话——什么时候发中间更新、什么时候收尾、怎么用 apply_patch 改文件、什么操作不能做——这部分由instructions_template注入。deepseek-v4-flash 强的地方恰好是这三层都有官方动作7 月 31 日正式版原生支持 Responses API 并针对性适配 Codex官方更新日志原话官方文档提供写入 models.json 的配置脚本而模型的 agent 后训练让它能稳定执行那段行为模板。下面逐层看。models.jsonCodex 怎么知道一个模型能干什么~/.codex/models.json是 Codex 的模型目录官方文档的说法是向 Codex 声明模型的元数据——上下文窗口长度、支持的推理强度档位、工具调用格式等使 Codex 能像使用内置模型一样使用第三方模型。本机这份文件是 8 月 3 日生成的76KB里面有两个模型deepseek-v4-flashpriority 1和deepseek-v4-propriority 2。deepseek-v4-flash 的完整配置拆开看是这样的字段值影响context_window/max_context_window1,048,576告诉客户端上下文预算决定长会话什么时候该压缩effective_context_window_percent95客户端按 95% 的有效窗口做规划留出工具调用和输出的余量truncation_policytokenslimit 10000超限时的截断策略压缩后保留的余量supports_parallel_tool_callstrue允许并行工具调用多文件搜索、并行命令能同时发multi_agent_versionv2支持子代理机制长任务可以拆给子代理并行apply_patch_tool_typefreeform使用自由格式的 apply_patch 工具做文件编辑web_search_tool_typetext搜索工具以文本形态接入default_reasoning_levelhigh默认推理强度就是 high配合 low/high/max 三档supported_reasoning_levelslow / high / max客户端可以按任务切换档位reasoning_summary_formatexperimentalreasoning summary 走实验格式default_reasoning_summarynone默认不要求模型输出思考摘要input_modalities[“text”]纯文本模型不支持图像输入识图正在灰度visibilitylist模型出现在模型选择列表里minimal_client_version0.144.0要求 Codex 客户端不低于这个版本priority1flash 排在前pro 排在后shell_typeshell_command命令以 shell_command 形态执行这些字段不是摆设它们直接改变客户端的行为方式。举三个最典型的上下文预算决定长会话怎么活1M 的窗口声明加上 95% 的有效比例客户端才敢让会话一直往后跑而不早早压缩。上一篇文章里三个线程连续跑 46~48 小时没有一次因为上下文溢出中断窗口声明是前提。truncation_policy规定了压缩后保留 token 的余量这决定了每轮重发上下文时”稳定前缀”的长度——而稳定前缀正是缓存命中的必要条件。并行和子代理决定工具效率supports_parallel_tool_calls: true让客户端可以把互不依赖的工具调用并行发出而不是一串串排队multi_agent_version: v2打开子代理通道多仓库、多任务串行时可以拆出去并行。这些都是”客户端敢不敢用”的开关声明了能力Codex 才会把对应功能打开。推理档位决定成本曲线官方价格里缓存命中 0.02 元/百万 token、未命中 1 元、输出 2 元元/百万。reasoning 档位直接决定输出里有多少思考 token——上一篇文章统计的 57.3% reasoning 占比就是这么来的。default_reasoning_level: high意味着默认就是”多想一步”的配置不需要每次手动调。把这三层串起来看就是下面这张图models.json 声明能力Codex 客户端据此决定怎么开功能、怎么注入系统提示模型侧再用后训练过的指令跟随能力接住。适配不是”能通 API”就完事是这一整条链路。instructions_template1.77 万字符的”岗位说明书”models.json 里除了能力元数据还有一块容易被忽略的内容model_messages.instructions_template一共 168 行、约 1.77 万字符。它是 Codex 客户端注入给模型的系统提示等于给接入的模型发了一份”岗位说明书”。我把它整段读了一遍结构是五块章节内容对工作的作用Personality代理人格、写作风格、技术沟通方式让模型用”协作对象”而不是”问答机器”的方式对话Working with the usercommentary/final 双通道、中间更新与最终回答的规范保证长任务里有持续可见的进度而不是憋到最后才输出Rules for getting work donerg 优先、并行化、apply_patch 编辑、自主性与持久性让模型按工程习惯干活先搜再改、能并行就并行Destructive Actions删除、覆盖、危险命令的边界让模型对破坏性操作保持谨慎先确认再动手Using skillsskill 的发现、读取、使用规则让模型遇到匹配任务时调用仓库技能而不是自由发挥模板本身没有任何 deepseek 字样它是 Codex 通用的模型侧提示。真正有意思的是它和效率的关系我认为有三条稳定前缀直接喂给缓存。这段模板是每一轮请求开头完全相同的固定文本。上一篇文章统计的 99.4% 缓存命中率靠的正是”系统提示稳定 会话开头稳定”这个前缀结构。模板越长、越固定可复用前缀就越稳定——当然缓存命中的前提还是模型服务端实现了前缀缓存。行为契约减少返工。模板里写清楚了”什么时候发 commentary、什么时候该 final先 rg 再改、用 apply_patch破坏性操作要先确认”。模型照做就省掉了大量”客户端规范 vs 模型习惯”不匹配造成的返工。比如不写这个模板模型可能全程闷头跑不给中间更新或者用 shell 重定向直接覆写文件而不是 apply_patch。长会话不跑偏的锚点。48 小时的长会话里每一轮都在重复加载这 1.77 万字符的规则。指令跟随能力弱的模型会在几小时后开始”遗忘”行为规范而 deepseek-v4-flash 的 0731 版本专门重新做了后训练来对齐 agent 任务——官方更新日志原话是”重新做后训练Agent 能力大幅增强”。模板是纸面上的契约能不能守住取决于模型本身的指令跟随能力。另外model_messages里还有instructions_variables带三套人格预设default/friendly/pragmatic对应客户端可切换的人格参数。这说明模板不只是静态文本它和客户端的行为开关是联动的。诚实地说instructions_template 不解决”模型会不会推理”的问题它解决的是”模型能不能按 Codex 的规矩干活”的问题。适配层做得再完整模型指令跟随不行一切归零反过来模型再强没有这层模板它也只是个”便宜的 API”不是一个”好用的 Codex 代理”。DeepSeek Harness模型之外的那层正从”部门”变成”产品”如果说 models.json 是 deepseek-v4-flash 在 Codex 里的适配现状那 Harness 就是 DeepSeek 官方正在做的下一件事。两件事在官方更新日志里其实是一起出现的正式版 V4-Flash 用”DeepSeek Harness 极简模式即将发布“作为框架跑公开基准。下面按时间线和事实/猜测分开整理。Model Harness Agent这个公式是 DeepSeek Harness 团队招聘时写下的核心定义百度百科、多家媒体引用了同一口径模型负责理解需求、推理和生成方案Harness 负责把模型能力落到真实环境——上下文管理、工具调用、文件读写、终端执行、错误处理、任务规划也就是”除模型本身以外的所有工作”。换句话说Agent 模型 执行系统Harness 是模型和真实软件工程环境之间的那一层。时间线从组团队到内测招募时间事件2026-03崔添翼加入 DeepSeek任 Harness 团队负责人2026-05Harness 团队开始公开招聘核心定义 Model Harness Agent2026-07-31V4-Flash 正式版 API 公测 权重开源更新日志首次点名 Harness“即将发布”Code Agent 基准用 Harness 极简模式max 档位、topp0.95、temperature1.0测试2026-08-01崔添翼发文招募 Harness 内测人员要求参与过开源 Agent 项目的建立和维护提交 GitHub 仓库作为代表作2026-08-03内测招募帖演变成”开源 Agent 路演”769 位报名者、去重后 712 个仓库、合计超 120 万 stars横跨 18 个赛道社区统计来源见文末媒体预测 Harness 会随 V4 Pro 正式版一起在 8 月初亮相——这是推测官方只说了”即将发布”。官方基准与”极简模式”根据 DeepSeek 更新日志和公开报道V4-Flash 正式版跑的是五组偏”长任务执行”的基准Terminal Bench终端操作、Cybergym安全攻防、Toolathlon多工具调用、DSBench-FullStack 和 DSBench-Hard全栈开发。媒体和券商报告引用的关键数字是Terminal Bench 得分 82.7预览版 61.8、Toolathlon Verified 70.3九项 Agent 基准全面反超自家 V4-Pro 预览版整体追平 GLM-5.2、逼近 Opus-4.8。注意这些成绩是”模型 Harness 极简模式”一起测出来的不是裸模型成绩——这正是 Harness 被反复强调的原因。一条招募帖变成开源生态大摸底招募条件本身很窄要维护过开源 Agent 项目结果评论区涌进来 769 位报名者、712 个仓库。社区统计显示智能体框架和编程智能体是最大两个方向合计 242 个项目记忆与上下文相关项目 56 个累计 194k stars研究与评测、安全治理各 24 个。长任务执行、上下文/记忆管理、评测与安全正好是 Agent 从”能跑”到”敢用”的三道坎。也有开发者直接用 DeepSeek 模型自研运行时做实测——akashic-agent 的作者在 V4-Flash max 档下跑 TerminalBench 2.1 拿到 70.8%。社区猜测哪些还没被官方确认目前流传的几点都标一下来源状态Harness 定位对标 Claude Code / Codex 的 AI Coding Agent——多家媒体称”社区流传”未获官方确认可能围绕长周期 Agent 工作流加入 Memory、项目仓库感知Repo Awareness——同样是社区猜测识图模式正在灰度补代码 Agent 理解架构图、报错截图的能力——官方更新日志提到灰度但 V4-Flash 本机声明仍是纯文本输入“DeepSeek Harness”是否作为最终品牌名——官方未定媒体也在猜。我的判断强在哪边界在哪把三层适配和 Harness 放在一起看deepseek-v4-flash 在 Codex 上的强项可以概括成一句话协议原生、元数据完整、行为模板可执行而且便宜到可以当主力用。前面两条是 DeepSeek 主动做的Responses API 原生支持 官方 models.json 配置第三条一半靠模型后训练、一半靠 Codex 客户端注入的模板第四条是定价策略。四者缺一个“5 毛钱能干大活”和”40 块钱跑两天”都不会成立。边界也要说清楚models.json 只是声明不是能力。字段再全模型指令跟随不行就是白搭。它说明的是”DeepSeek 愿意把适配做完整”不代表任何模型都能照抄这份配置获得同样效果。Harness 还没发布。基准成绩、内测招募都是真的但产品形态、命名、发布时间全是推测。现在用 Codex deepseek-v4-flash 的经验不能直接平移成对官方 Harness 的预期。纯文本模型的短板在补。本机声明input_modalities: [text]识图还在灰度。等视觉输入开放models.json 里的字段会跟着变——到时候适配层是不是还这么干净值得再看一眼。参考来源DeepSeek API 官方文档接入 Codexmodels.json 声明元数据、Responses API、更新日志正式版 V4-Flash、Harness 极简模式说明deepseek-ai/awesome-deepseek-agent · docs/codex.md原生适配前的代理层接入方式智东西 2026-08-04《120万星开发者排队”投简历”DeepSeek一条内测帖变成了Agent开源大摸底》快科技 2026-08-02DeepSeek Harness 内测报道开源证券计算机行业点评报告东方财富数据平台转载V4-Flash 正式版基准数据OSCHINA 2026-08-03DeepSeek Harness 内测报道社区统计仓库github.com/Octo-o-o-o/deepseek-harness-applicants文中本机配置均来自~/.codex/models.json与本地 Codex 会话时间为 2026-08-05。未确认信息均已标注”猜测/未证实”。