AI Agent 是什么?从单模型到智能体的完整进化

📅 2026/8/14 12:31:50
AI Agent 是什么?从单模型到智能体的完整进化
前言AI Agent是 2026 年技术圈出现频率最高的词之一但聊的人越多概念反而越模糊ChatGPT 是 Agent 吗调一次大模型就算 Agent 吗多智能体又是什么这篇文章先讲清概念再用 30 行可运行的代码亲手做一个最小 Agent从想到做一次打通。一、概念篇先搞清楚 Agent 是什么1.1 起点大模型LLM强在哪、弱在哪大模型本质是文本预测器给它一段输入它预测下一个词以此类推生成回答。它擅长理解和生成自然语言、推理总结、翻译写码。但单靠模型本身它有三块明显短板短板表现没有手不能调 API、不能操作文件、不能打开网页没有记忆只认当前这段对话重开对话就失忆不会规划你说一句它回一句不会主动拆解任务这三点正是模型进化为智能体的突破口。1.2 什么是 AI Agent模型 三件套AI Agent智能体大模型 工具 记忆 规划让它不仅能想还能做工具Tools让模型调用函数、API、浏览器、代码执行器——解决没有手。记忆Memory短期记忆对话历史 长期记忆向量数据库——解决会失忆。规划Planning把大任务拆成小步骤、循环执行——解决不主动。1.3 单智能体 vs 多智能体单智能体Single-Agent多智能体Multi-Agent结构一个 Agent 完成全部多个分工 Agent 协作场景单一、中等复杂度任务复杂、需多角色协作的任务例子一个会搜索写稿的 Agent调研员写作员审稿员流水线1.4 一个生活化类比大模型≈ 聪明但没有手脚、过目就忘、随叫随答的顾问。单智能体≈ “全能员工”有电脑工具、有笔记本记忆、会列计划规划。多智能体≈ “小团队”产品经理拆需求、工程师写代码、测试员验收。1.5 怎么判断它到底是不是 Agent三连问自测① 能自己调用工具吗② 有跨轮次记忆吗③ 会主动规划下一步吗三个是才配叫 Agent如果只是会说话那它还是个模型。1.6 Agent 能做什么、不能做什么能写代码并执行调试、查资料整理报告、自动处理数据、搭建自动化工作流、拆解多步骤任务。不能现阶段完全替代人类决策、处理模糊到没边界的任务、保证 100% 正确——落地关键是人工审核 明确边界。二、实战篇30 行代码做一个最小 Agent概念清楚了接下来用代码亲手实现。用一个 OpenAI 兼容接口示例用 DeepSeek就能跑。2.1 环境准备Python 3.10依赖pip install requests环境变量DEEPSEEK_API_KEY或在代码里直接填 Key2.2 Step 1一个只会说的模型importrequests API_KEYsk-你的Key# 或从环境变量读BASE_URLhttps://api.deepseek.com/v1defcall_llm(messages:list,system:str)-str:统一大模型调用OpenAI 兼容接口可换 OpenAI/Ollamapayload{model:deepseek-chat,messages:[]}ifsystem:payload[messages].append({role:system,content:system})payload[messages]messages resprequests.post(f{BASE_URL}/chat/completions,headers{Authorization:fBearer{API_KEY}},jsonpayload,timeout60,)resp.raise_for_status()returnresp.json()[choices][0][message][content]# 纯模型只能猜拿不到实时信息print(call_llm([{role:user,content:现在几点钟}]))2.3 Step 2给模型装上手——最小 Agent给模型加两个工具取时间、计算再套一个思考→行动→观察循环importrefromdatetimeimportdatetimedefget_current_time()-str:工具1获取当前时间returndatetime.now().strftime(%Y-%m-%d %H:%M:%S)defcalculate(expr:str)-str:工具2计算表达式演示用生产环境不要用 evalreturnstr(eval(expr))TOOLS{get_current_time:get_current_time,calculate:calculate}SYSTEM(你是一个会调用工具的 Agent。需要工具时只输出一行fACTION: 工具名(参数)可用工具{, .join(TOOLS)}。不需要工具时直接给出答案。)defagent(task:str,max_steps:int3)-str:最小 ReAct 循环思考 → 行动 → 观察 → 再思考messages[{role:user,content:task}]for_inrange(max_steps):replycall_llm(messages,systemSYSTEM)# 思考print(思考:,reply)mre.search(rACTION: (\w)\(([^)]*)\),reply)ifnotm:# 没有工具调用 → 直接输出答案returnreply name,argm.group(1),m.group(2)resultTOOLS[name](arg)# 行动执行工具print(f观察:{name}({arg}) {result})messages[{role:assistant,content:reply},{role:user,content:f工具返回:{result}},]return已达最大步数结束。print(agent(现在几点帮我算一下再过3小时是几点))2.4 完整代码上面两段合起来就是最小可运行的 Agent 演示核心三件事工具ToolsTOOLS字典——让模型有手。记忆Memorymessages逐步累积——让模型记得自己做过什么。规划Planningmax_steps循环 SYSTEM 提示词——让模型主动拆步骤。2.5 运行效果 纯模型 我无法获取实时时间建议您查看设备时钟。模型只能猜 最小 Agent 思考: ACTION: get_current_time() 观察: get_current_time() 2026-08-13 14:05:21 思考: ACTION: calculate(143) 观察: calculate(143) 17 思考: 再过3小时是17:05。 最终答案: 再过3小时是17:05。看到区别了吗模型会说Agent 会做——查了真实时间、又算了结果这就是三件套的威力。总结模型负责想工具负责做记忆负责记规划负责拆。本文用 30 行代码实现了最小 Agent理解了它后面学框架会顺很多。落地提醒Agent 现阶段仍需人工审核 明确边界。下一篇预告《一文搞懂 ReAct让大模型边想边做》深入循环的细节与优化。收藏 追更本系列从零到实战一篇不落。标签AI Agent、大模型、智能体、Function Calling、Python