从“文字接龙”到办事助手:一文看懂 LLM、Tool、MCP 与 Agent

📅 2026/8/12 23:33:01
从“文字接龙”到办事助手:一文看懂 LLM、Tool、MCP 与 Agent
摘要大模型为什么会说话却不能天然查询天气Tool、MCP、Agent 和 Skill 又分别解决什么问题本文用一个“出门助手”的例子串起从 Token 到 Agent 的完整技术链路。关键词大语言模型Token上下文工具调用AI Agent当我们对 AI 说“看看今天会不会下雨。如果下雨帮我找附近卖雨伞的店并告诉我出门要带什么。”屏幕上可能很快出现天气、商店位置和物品清单。这看起来像一个聪明助理在独立办事背后却不是某个无所不能的“大脑”而是一套分工明确的系统大语言模型负责理解和生成Tokenizer 把文字转换成模型能处理的符号Context 提供当前任务的信息Prompt 说明目标Tool 连接外部世界MCP 提供标准化接口Agent 负责规划和推进Skill 则保存某类任务的成熟做法。理解这些组件如何协作也就理解了一个“会聊天”的模型怎样变成“会办事”的 Agent。一、LLM负责理解和生成的“大脑”大语言模型Large Language ModelLLM要解决的基本问题是根据前面的内容判断接下来可能出现什么。为了便于理解可以把它想成一个规模极大的“文字接龙”系统。看到“今天出门记得带”模型会结合当前上下文和训练中学到的语言规律为许多候选 Token 计算分数再产生下一个 Token。新内容又成为后续生成的依据如此循环直到回答结束。但它远不只是普通输入法。现代 LLM 大多建立在 Transformer 架构之上能够分析长文本中不同信息之间的关系因此可以总结材料、比较方案、改写文章和规划步骤。“文字接龙”解释的是它逐步生成内容的方式不代表它只会机械背诵模型也不一定总选分数最高的 Token还可能通过采样增加表达的多样性。LLM 擅长理解语言、推理和组织表达却有天然边界。训练完成后它不会自动知道此刻是否下雨也不能仅凭生成文字就在地图上搜索商店。语言流畅也不等于事实可靠模型可能生成听起来合理、实际却不存在的内容。实时信息、精确数据和外部操作需要交给工具完成。二、Token文字进入模型前的编码模型内部进行的是数字计算不是直接看着汉字思考。人类语言进入模型前要先经过分词器Tokenizer。Token 是模型处理文本时使用的基本单位可能是一个汉字、一个单词、词的一部分、标点甚至空格与字符的组合。Tokenizer 先把文字切成 Token再将每个 Token 映射为 Token ID这些 ID 随后会转成向量供模型计算。模型生成结果后Tokenizer 再将输出的 Token ID 解码成人类可读的文字。例如“今天会下雨吗”可能被示意性地切成“今天会下雨吗”也可能采用其他组合。不同模型使用的词表和切分算法不同所以同一句话交给不同 Tokenizer结果可能不一样。精确切分必须使用对应模型的 Tokenizer 实测。Token 也不能按固定比例换算成汉字或单词。中文、英文、代码、数字、生僻字和标点的编码效率各不相同。之所以需要关注 Token是因为上下文容量、API费用和部分计算开销通常都以它为基础。三、Context模型当前任务的“办公桌”如果 LLM 是大脑那么上下文Context就是它此刻摊在办公桌上的全部材料。这里可能包括用户问题、此前的对话、系统规则、工具说明、检索到的资料、工具返回的结果以及模型已经生成的内容。上下文窗口Context Window是这张办公桌能够容纳的信息上限通常用 Token 数量表示。窗口越大一次能放入的对话和资料越多但大窗口不等于永久记忆。会话结束后是否保存、以后能否重新找回取决于产品的记忆和检索机制。信息“放进去了”也不等于模型一定能用好。材料太多时关键内容可能被无关信息淹没还会增加成本和延迟。因此AI 系统需要管理上下文而不是把所有资料一股脑塞进去。检索增强生成RAG就是一种常见办法不把整座图书馆搬上桌而是先根据问题找出最相关的几页再交给模型阅读。四、Prompt本次任务说明书Prompt 是交给模型的任务信息与指令。用户提示User Prompt是我们直接输入的问题系统提示System Prompt则由系统或开发者设置用来规定角色、规则、权限边界和输出方式。同样一句“今天适合跑步吗”健身助手可能关注运动强度过敏人群助手会查看空气质量儿童出行助手则会采用更严格的安全标准。用户问题没变但系统规则改变了判断重点。好的 Prompt 通常会说明目标、必要背景、约束、输出格式和验收标准。模型理解能力再强也不能代替清楚的任务定义。目标越含糊它就越需要猜测用户真正想要什么。五、Tool让模型连接外部世界工具Tool让 AI 系统能够查询实时信息或执行具体动作例如查天气、使用计算器、读文件、搜索地图或发送消息。这里最容易产生一个误解通常不是模型自己打开网站或执行函数。模型负责判断需要什么工具并生成结构化的调用请求Agent 运行平台负责检查参数和权限真正调用外部服务工具执行完毕后平台再把结果放回 Context供模型继续判断。以天气查询为例完整过程是用户询问是否下雨平台把问题和可用工具说明交给模型模型提出调用天气工具并给出地点参数平台执行调用把天气数据放回上下文模型读取结果组织成自然语言回答。工具越强权限管理越重要。查天气通常只是读取信息发送邮件、付款和删除文件却会改变外部世界。成熟系统需要设置参数校验、授权范围和人工确认不能因为 Agent 会规划就给它无限权限。六、MCP能力接入的“统一接口”如果每个 AI 应用都用自己的方式连接每一种工具开发者就要重复编写大量适配代码。模型上下文协议Model Context ProtocolMCP试图用标准化方式降低这种成本。可以把它类比为 Type-C工具是具体设备MCP Server 按统一方式暴露工具或数据AI 应用通过 MCP Client 发现能力、发送请求并接收结果。MCP 不只是连接可执行工具也可以提供文件、数据库记录等上下文资源。不过MCP 不是工具本身。它负责描述、连接和通信真正查询天气的仍是天气服务。它也不能保证“一次开发在所有平台无条件通用”因为不同平台在协议版本、权限和认证方面仍可能存在差异。它的价值是减少适配成本而不是消灭所有差异。七、Agent围绕目标持续行动普通聊天往往是一问一答Agent 则会围绕一个目标持续运行分析任务、选择工具、观察结果再决定下一步直到完成任务、达到停止条件或者需要用户介入。这可以概括为“判断—行动—观察—再判断”的闭环。Agent 并不是某一种模型而是一套运行系统通常包含 LLM、上下文管理、工具、权限、循环控制、错误处理和评估机制。模型做关键判断平台则决定它能看到哪些工具、最多执行多久、何时必须请用户确认。Agent 与固定工作流也不完全相同。固定工作流事先写好每一步适合规则稳定的任务Agent 会根据中间结果动态选择下一步适合路径不确定的问题。实际系统常把高风险环节写成固定流程只在需要灵活判断的地方使用 Agent。八、“出门助手”是怎样完成任务的现在回到开头的请求“看看今天会不会下雨。如果下雨帮我找附近卖雨伞的店并告诉我出门要带什么。”Prompt 给出了目标和条件。Tokenizer 把文字转成 Token IDLLM 在 Context 中读取问题、系统规则和工具说明。它发现缺少位置与天气信息于是 Agent 先请求定位再调用天气 Tool。平台真正执行这些调用把位置、降雨概率和气温等结果放回 Context。LLM 判断是否满足“下雨”的条件。如果成立Agent 再调用地图或商户搜索工具寻找附近且营业中的雨具店最后由 LLM 把多项结果整理成天气提示、店铺信息和携带清单。如果这些工具通过 MCP 接入MCP 负责能力的发现与通信地图和天气服务仍负责实际查询。整个过程中LLM负责理解条件、判断和组织答案Context保存当前规则与每一步结果Prompt说明本次要完成什么Tool执行定位、天气和商户查询MCP标准化部分外部能力的接入Agent安排顺序并根据结果决定下一步。九、Skill给 Agent 的可复用操作手册Skill 可以理解为交给新员工的标准作业指导书。它不会重新训练模型而是在特定任务出现时告诉 Agent 应该遵循什么步骤和规则。例如“出门助手 Skill”可以规定先取得位置授权天气数据过旧时重新查询达到某个降雨条件才搜索雨具店推荐商户时显示距离和营业状态无法确认实时信息时明确说明限制。在一些 Agent 系统中Skill 会把名称、用途、操作步骤、工具方法、风险边界和输出格式写入结构化目录。系统可以先读取简短描述任务匹配时再加载详细说明以减少上下文占用。具体文件结构和加载方式取决于平台不能把某一种实现当作所有 Agent 的通用标准。五个容易混淆的概念由此可以分开Prompt 说明“这一次做什么”Tool 表示“系统能做什么”MCP 解决“外部能力如何接入”Agent 负责“围绕目标持续规划和执行”Skill 规定“这一类任务应该怎么做”。十、一张完整的技术地图可以把整套系统想成一家公司LLM 是负责理解、推理和表达的大脑Tokenizer 是语言编码员Context 是当前任务的办公桌Prompt 是任务单Tool 是能真正查询或操作的设备MCP 是连接部分设备和数据源的标准接口Agent 是协调资源、持续推进的项目负责人Skill 是某类工作的标准作业手册。从 LLM 到 Agent 的关键变化不是模型突然拥有了意识而是工程系统为它补上了现场信息、外部工具、权限控制和执行循环。理解这张地图后再看到“函数调用”“MCP Server”“自主 Agent”或“安装 Skill”就能判断它位于哪一层、解决什么问题以及真正执行动作的究竟是谁。核心概念速查LLM根据上下文理解、推理并生成内容的大语言模型。Token模型处理文本时使用的基本符号单位。Tokenizer在文字、Token 与 Token ID 之间编码和解码的组件。Context模型本次处理时可以接触的全部信息。Prompt交给模型的任务和指令。Tool查询外部数据或执行实际动作的能力。MCP标准化AI应用与外部能力连接方式的协议。Agent围绕目标持续判断、行动和调整的运行系统。Skill指导Agent完成某类任务的可复用操作说明。参考资料Vaswani 等《Attention Is All You Need》2017。OpenAI《Tokenizer》。OpenAI《Function calling》。Model Context Protocol《Architecture overview》。Agent Skills《Specification》。