小白 0 基础 Agent 开发实战 03:上下文工程与 Agent Harness 竞品分析

📅 2026/8/20 9:16:11
小白 0 基础 Agent 开发实战 03:上下文工程与 Agent Harness 竞品分析
小白 0 基础 Agent 开发实战 03上下文工程与 Agent Harness 竞品分析关于作者半旧FDE专注垂类 Agent 开发。做过运动损伤康复、有色金属财报、跨国企业安全月报、小语种新闻自动打标、古文拼音标注、软著申请、模拟演习、智能采购等领域的智能体项目。阿里云专家博主、CSDN 内容合伙人、腾讯云创作之星获 VibeFriends 首届黑客松大赛社区热度 TOP 1。科技向善 OPC 社区创始人之一倡导科技向善创业向实永续发展。坐标佛山希望结识更多朋友一起交流学习。欢迎联系合作与交流。这个教程适合谁这套教程主要面向没有 Agent 开发经验的同学编程基础较少但愿意动手尝试的同学已经理解 Runtime、Framework 和 Harness希望继续认识 Deep Agents 的同学想知道 Deep Agents、Claude Agent SDK 和 Codex SDK 有什么区别的同学。本篇不会堆砌复杂参数而是从我们每天都在使用的“提示词”讲起逐步认识提示词工程、上下文和上下文工程最后比较三种 Agent Harness 的定位。系列简介这是一个面向零基础学习者的 Agent 开发系列。我们会先用通俗的语言讲清 AI 与 Agent 的基本概念再通过实际操作带你从环境搭建开始一步步运行并开发自己的 Agent。前两篇内容《小白 0 基础 Agent 开发实战 01先把环境跑起来》《小白 0 基础 Agent 开发实战 02看懂 Agent 开发的三个层次》。这是系列第 03 篇主题是Context Engineering 与 Agent Harness 竞品分析主要包含两部分从提示词到上下文工程理解提示词、提示词工程、上下文窗口以及 Deep Agents 如何管理信息Agent Harness 竞品分析比较 Deep Agents、Claude Agent SDK 和 Codex SDK 的定位与选择思路。参考教程从 Agent Framework 到 Agent Harness——Deep Agents 的诞生逻辑今天会学到什么完成本篇后你将能够区分提示词、提示词工程、上下文和上下文工程理解为什么只靠提示词工程无法支撑复杂 Agent说清 Deep Agents 为什么需要虚拟文件系统对 RAG、Memory、Skills、MCP 等后续技术有一个基本认识根据自己的任务选择合适的 Agent Harness。第一部分从提示词到上下文工程1. 什么是提示词我们在聊天框里输入的“帮我写一份市场分析”就是一条最简单的Prompt提示词。提示词不是什么神秘的“咒语”。它本质上就是我们交给大模型的指令或问题。可以把大模型想象成一位聪明助手。我们递给他一张任务纸条这张纸条就是提示词。一条比较清楚的提示词通常包含任务具体要做什么背景为什么做、给谁使用要求必须包含什么、不能做什么输出格式希望得到文章、表格、代码还是清单。例如任务分析佛山中小制造企业应用 AI 的主要场景。 读者没有技术背景的企业管理者。 要求列出 3 个适合先落地的场景并说明价值和风险。 输出使用 Markdown 表格最后给出简短的行动建议。在 Agent 应用中我们还会见到系统提示词System Prompt像岗位说明书定义 Agent 的角色、原则和边界用户提示词User Prompt像当天收到的任务说明用户这次想做什么。2. 什么是提示词工程Prompt Engineering提示词工程就是围绕目标设计、测试和改进提示词让模型更稳定地理解任务。常见做法包括把任务和成功标准说清楚补充真正需要的背景写明限制条件和输出格式必要时提供一个参考示例用不同问题测试再根据结果修改。提示词工程主要解决的是怎样把话说清楚。但复杂 Agent 不只是回答一次问题。它还要搜索资料、读取文件、调用工具、记录进度连续工作很多步。此时只依靠提示词工程会遇到下面的问题问题为什么提示词解决不了缺少最新或内部资料写上“请查询最新政策”不会让模型自动获得搜索和数据库能力资料太多把所有文件塞进提示词会超过上下文窗口或淹没重点任务不断变化搜索结果、工具输出和任务进度都是运行后才出现的需要长期记忆当前提示词不能可靠保存跨会话的用户偏好和项目经验涉及高风险操作“不要误删文件”只是一句要求不能代替权限、沙箱和人工审批可以用一句话总结提示词工程负责把任务说清楚但不能独自提供知识、管理过程、保存记忆或建立安全边界。所以我们需要把视线从一张“任务纸条”扩大到模型面前的整张“工作桌面”。3. 什么是上下文如果提示词是桌面上的任务纸条那么Context上下文就是模型当前能够看到的全部材料。它可能包括上下文 提示词 对话历史 检索到的资料 工具说明和工具结果 当前任务状态 相关记忆与 Skills模型一次能够处理的信息有上限这个范围通常称为上下文窗口其中的信息量一般使用 Token 计算。把所有资料都塞进去可以吗早期一种直接做法是把能找到的材料全部拼进 Prompt这也被称为Prompt StuffingSystem你是一名研究助手。 User请分析这 20 份报告。 [后面附上 20 份报告的全部内容……]这种做法看起来简单却有三个明显问题放不下上下文窗口有上限文件一多就可能超出抓不住重点无关内容太多关键信息容易被淹没无法扩展资料从 20 份变成 2 万份时不可能全部塞进去。即使未来模型的上下文窗口继续变大信息是否相关、成本是否合理、重点是否突出仍然需要管理。4. 什么是上下文工程Context Engineering上下文工程就是围绕任务选择、组织和管理模型当前需要的信息与工具。它关心的不是“怎样塞入最多的信息”而是在正确的时候用合适的形式把真正需要的信息交给模型。提示词工程与上下文工程的区别可以用一张表说明对比提示词工程上下文工程主要问题怎样把任务说清楚模型当前应该看到什么关注范围角色、任务、要求和格式提示词、资料、工具、状态、记忆和历史通俗比喻写清楚任务纸条整理工作桌面和文件柜提示词工程并没有过时。它是上下文工程的一部分任务纸条仍然要写清楚只是我们还要管理纸条之外的资料。5. Deep Agents 怎样管理上下文Deep Agents 的核心做法是引入虚拟文件系统让 Agent 像人一样按需处理资料当前需要哪个文件就读取哪个文件中间结果太长就先写入文件需要查找内容就搜索文件名或关键词不需要的内容不一直堆在模型上下文里。可以把它理解成**模型的上下文是一张面积有限的桌面虚拟文件系统则是旁边的文件柜。**桌面上只摆当前需要的材料其余资料放进文件柜需要时再取。虚拟文件系统还可以连接不同的存储位置开发测试时可以暂存在内存中处理真实项目时可以连接本地文件需要跨会话保存时可以连接持久化存储需要安全执行代码时可以连接远程沙箱。这就是参考教程所强调的重点上下文工程不是把所有信息都喂给大模型而是为它建立一套高效获取和管理信息的基础设施。6. 一个简单的研究任务示例例如我们让 Agent 调研“佛山制造业如何应用 AI”接收任务 ↓ 确定需要调查的问题 ↓ 按问题搜索资料 ↓ 把较长结果保存到文件系统 ↓ 只读取当前小节需要的内容 ↓ 整理证据并撰写报告Agent 不需要一次记住所有网页而是一边工作一边决定什么留在桌面、什么放进文件柜、什么只保留摘要。第二部分Agent Harness 竞品分析1. 为什么不同 Agent Harness 看起来很像研究助手、编程助手和数据分析助手的业务不同但只要任务足够复杂往往都需要读写和搜索文件把大任务拆成小步骤把部分工作交给子 Agent管理不断增长的上下文在高风险操作前设置权限或人工确认。Agent Harness 的价值就是把这些被反复验证的能力提前组织好让开发者不用每次从零实现。2. Deep Agents、Claude Agent SDK 与 Codex SDK三者都属于 Agent Harness也都能覆盖文件操作、命令执行、任务规划、子任务和外部工具连接等常见需求。真正需要关注的是它们的定位。产品主要定位模型支持方式更适合谁Deep Agents通用 Agent也可以处理编程任务通过 LangChain 将多模型接入作为核心设计希望开发研究、数据分析或垂类 Agent并经常比较、切换模型的团队Claude Agent SDK把 Claude Code 的 Agent 循环和工具作为 SDK 使用原生面向 Claude可通过 Anthropic、Bedrock、Google Cloud、Microsoft Foundry 或网关部署看重 Claude Code 的工具、Hooks、权限和会话能力的团队Codex SDK将 Codex 编程 Agent 嵌入应用和工作流默认使用 OpenAI也支持自定义模型提供商以及 Ollama、LM Studio 等本地方案看重 Codex 的编程流程、线程和沙箱能力的团队3. 三者真正的差异在哪里Deep AgentsDeep Agents 的优势可以概括为在“开箱即用”和“灵活扩展”之间取得了平衡。例如开发一个企业研究助手时我们可以先使用成本较低的模型复杂任务再换成更强的模型搜索结果太长时写入虚拟文件系统任务较大时交给子 Agent需要上线时再接入 LangGraph 的持久化能力和 LangSmith 的运行追踪。它主要有四个特点模型选择灵活可以通过 LangChain 接入不同模型减少对单一厂商的依赖上下文管理完整文件系统、结果转存、摘要和子 Agent 可以共同处理长任务用途更加通用不仅能处理代码也适合研究、数据分析和其他垂直领域便于逐步走向生产底层基于 LangGraph并可结合 LangSmith 管理状态和观察运行过程。因此Deep Agents 并不是“功能最多就一定最好”。它更突出的特点是把多模型抽象、通用任务和上下文管理放在核心位置。其他 Harness 也可能接入不同模型但模型兼容不只是“接口能调用”工具格式、上下文处理和 Agent 行为是否稳定仍需要实际测试。业务数据、工具、权限和长期记忆也需要开发者根据项目配置。Claude Agent SDK重点是复用 Claude Code 的 Agent 循环和工作方式。它提供文件、命令、搜索、子 Agent、MCP、权限和 Hooks也支持通过多种云平台及网关部署 Claude。这里不能简单写成“只能调用一个 API”但也不宜说它与 Deep Agents 的多模型抽象完全相同。Anthropic 官方支持的模型重点仍是 Claude通过兼容网关转发非 Claude 模型可能在技术上实现但不属于官方支持范围部分工具或上下文能力也可能不兼容。Codex SDK重点是把 Codex 编程 Agent 嵌入应用和工作流。它支持连续线程与不同沙箱权限适合代码修改、测试和 CI 修复等编程任务。Codex 也不等于“只能使用 OpenAI 模型”。官方配置支持自定义模型提供商并内置 Ollama、LM Studio 等本地模型入口。需要注意的是模型能够连接并不代表能完整复现默认模型下的 Agent 效果工具调用和复杂编码任务仍需单独验证。4. 零基础应该怎样选择不要急着问“谁最好”先问自己的项目需要什么把多模型切换、通用任务和可插拔存储放在首位优先了解 Deep Agents看重 Claude Code 的工具体系、Hooks、权限和会话能力优先了解 Claude Agent SDK再根据部署环境选择 Anthropic 或云平台看重 Codex 的编程流程、线程和沙箱能力可以考虑 Codex SDK再按需使用 OpenAI、自定义提供商或本地模型目前只是跟随本系列学习先使用 Deep Agents不需要同时学习三套 SDK。选型时不要只问“能不能接入某个模型”还要实际验证模型是否能稳定调用工具、处理长任务以及 Harness 的关键功能是否在兼容层下完整可用。5. 拓展了解DSH 与 Pi Agent SDK除了前面的三种方案还有两种设计思路值得简单了解。DSHDeepSeek HarnessDSH 是 DeepSeek 开源的 Agent Harness目前处于开发者预览阶段。它强调“Everything is a Plugin”模型、工具、Skills、会话、沙箱、存储、Agent 循环和界面都可以通过插件替换或组合。可以把它理解成一套“高度可拆装的 Agent 工作台”更适合希望深入定制 Harness 本身的开发者。Pi Agent SDKPi 是一个保持核心精简的终端编程 Agent。它默认提供读取、写入、编辑文件和执行命令等基础工具再通过 Extensions、Skills 和自定义工具扩展能力。Pi Agent SDK 可以把这些能力嵌入其他应用用来创建 Agent 会话、切换模型、管理历史、压缩上下文、监听执行事件或者搭建自己的界面和自动化流程。它更像一套“先提供简单核心再由开发者按需组装”的方案。这两种方案不用现在就学习。记住它们代表的思路即可DSH 强调一切皆插件Pi 强调核心精简和高度可扩展。Agent 产品迭代很快模型支持、功能、价格和开源协议都可能变化。真正选型前应重新查阅各产品的官方文档并通过一个小型真实任务进行测试。学习资料参考教程从 Agent Framework 到 Agent Harness——Deep Agents 的诞生逻辑Deep Agents 官方概览Deep Agents OverviewDeep Agents 上下文工程Context Engineering提示词工程入门Anthropic Prompt Engineering OverviewClaude Agent SDKAgent SDK Overview · LLM GatewayCodex SDKOpenAI Codex SDK · Custom Model ProvidersDSHDeepSeek HarnessPi Agent SDKPi SDK DocumentationMCP 官方介绍What is the Model Context Protocol?今日小结今天我们沿着一条清晰的路线从提示词走到了上下文工程提示词负责告诉模型要做什么提示词工程负责把任务说明写得更清楚上下文包含模型当前能够看到的全部信息上下文工程负责在正确的时候提供真正需要的信息Deep Agents 使用虚拟文件系统等能力让复杂任务不必把所有资料一次塞进 Prompt不同 Agent Harness 的共同能力相似选择时更应该关注模型生态、任务类型和团队需求。下一篇我们将正式进入实操运行第一个 Deep Agent。