沙利文 Agent 报告拆解:五年 20 万亿的账,B 端九成收入背后的四个技术方向

📅 2026/8/15 14:27:15
沙利文 Agent 报告拆解:五年 20 万亿的账,B 端九成收入背后的四个技术方向
一、报告发布与核心数字2026 年 8 月 5 日,沙利文联合头豹研究院在 GIL 2026 大会上,发布了《2026 年中国智能体(AI Agent)最佳应用实践》报告。报告第一次用市场规模与商业模式的框架,把智能体产业算成了一本账,而不是停留在产品演示层面。它预计,中国 AI Agent 市场规模将由 2025 年的 2.6 万亿元增至 2030 年的 20.1 万亿元。这个复合年增长率高达 50.4%。报告还给出一个结构性判断:B 端是驱动市场增长的主体变量,长期贡献约九成收入。企业场景有明确交付物与可验证的投入产出比,每替代一次人工操作都能换算成金额。相比之下,C 端智能体的付费意愿与客单价都低得多。这解释了头部厂商为何都在扎堆做企业级平台。报告对 AI Agent 给出了工程化定义:以大模型为核心认知引擎,在无需持续人工干预的情况下,自主完成感知、记忆、决策、交互与执行。传统 RPA 是预先画好流程图,机器按图执行。智能体则是给定目标,由模型自行拆解步骤、调用工具、验证结果。定义的差异,直接决定了技术栈的差异与评估方式。报告指出,当前智能体产品的创新集中在四个方向:交互界面消隐化、多智能体协同、垂直场景深耕与架构轻量化。界面消隐化解决用户怎么用,多智能体协同解决任务怎么分,垂直场景解决价值在哪落地,架构轻量化解决成本怎么降。四者环环相扣,缺一环都会卡壳。这四件事其实是同一场演进。商业模式层面,报告判断行业将在未来一到三年内,从单一的过程收费演进至动态混合制。过程收费保障基础收入,结果收费绑定业务价值,两种模式按任务性质动态组合。按过程收费比拼调用量,按结果收费比拼完成率。技术团队必须预判自己的商业模式走哪条路。报告还给出了四维评估框架:市场需求、落地价值、商业能力与产品创新,最终形成五个方向的 TOP10 榜单。榜单覆盖最受欢迎、最具全球发展潜力、最实用、最具创新与最具商业价值五个维度,入选对象按拼音首字母排序。榜单本身不是重点,评估维度才是。它们基本等同于企业采购智能体的决策清单。二、方向一:交互界面消隐化交互界面消隐化,指用户不再通过对话框操作智能体,而是直接说出目标,让智能体自行调用系统、填写表单、完成交易。它最接近用户对智能体的终极想象,不是又一个聊天窗口,而是把界面从工作流里拿掉。智能购物助手就是典型。用户不必输入关键词,直接描述需求即可完成选品与下单。界面消隐化的工程本质,是把交互从表单驱动变成意图驱动。传统界面是给人类设计的,字段与校验规则让操作可预测。智能体界面则是给模型设计的,上下文、工具描述与权限边界决定了任务能否完成。前端团队的重心正从设计页面转向意图解析与工具暴露,工具描述越清楚,体验越可靠。消隐化不是取消界面,而是把界面移到模型与系统的边界上。智能体需要读取遗留系统屏幕、理解企业软件表单、操作浏览器网页,这些能力统称环境交互。报告提到 GUI Agent 与网页浏览智能体正从通用走向专业化。专业化的浏览智能体访问更多上下文,决策质量显著更高。界面消隐化的最大工程挑战是可验证性。传统界面每一步都有反馈,用户看得见进度;界面消失后,智能体在后台做了什么、做到哪一步,用户都看不见。因此,认真做消隐化的团队都会配套任务可视化与操作审计日志。任务可视化把内部动作翻译成人能理解的步骤,审计日志把工具调用记录成可回放证据。对开发者而言,消隐化意味着新的性能指标。传统软件衡量页面加载时间与点击路径,智能体应用衡量意图解析准确率、工具调用成功率与任务完成耗时。这些指标必须从第一天就埋点,因为优化消隐化体验,本质上就是优化这些指标。报告给出的是产业判断,落到工程上每一项都对应可观测性设计。三、方向二:多智能体协同多智能体协同解决任务怎么分的问题。单个智能体再强,也难以同时完成资料收集、方案设计与质量检查。把任务拆给多个各司其职的智能体协作完成,是当前主流的架构选择。报告引用 ChatDev 的例子,智能体扮演项目经理、工程师与测试等角色,用户给出目标后自主完成拆解与互查。多智能体协同的工程基础是协议。智能体之间需要标准化通信方式,报告点名的 A2A 协议,正是为跨厂商智能体协作设计的开放标准。A2A 负责智能体发现彼此、交换任务与传递结果;MCP 负责智能体调用工具与数据。两者分工明确:MCP 管能力接入,A2A 管智能体互联,搭建系统前必须先分清。多智能体协同有三种常见拓扑,适用场景完全不同。第一种是主管-员工模式,规划智能体负责任务拆解,多个执行智能体并行干活。第二种是流水线模式,任务按固定顺序传递,适合流程稳定的场景。第三种是对等协商模式,多个智能体地位相同,通过讨论达成共识。选错拓扑,是协同系统最常见的失败原因。协同系统的核心难点是状态一致性。多个智能体共享任务状态,谁更新、何时更新、冲突怎么解决,都需要明确规则。实践中常用的做法,是把任务状态外置到共享存储,每次更新先读后写,冲突时按优先级裁决。这与分布式系统的乐观锁如出一辙。但智能体场景多了一层不确定性:模型输出不保证一致,必须允许重试与回滚。报告把多智能体协同列为四大方向之一,隐含判断是:单一智能体的能力增长已现瓶颈,协作成为提升完成度的主要杠杆。对开发者来说,这意味着架构设计要从单体思维转向系统思维。每个智能体负责什么、依赖什么、失败怎么隔离,都要事先定清楚。协同不是堆智能体,而是把不确定性管理做到每个边界上。四、方向三:垂直场景深耕垂直场景深耕解决价值在哪落地的问题。报告显示,医疗保健与金融服务在智能体公司中占比约 19%。其中 32% 的垂直化智能体已积极部署,另有 45% 处于新兴验证阶段。高度监管行业成为垂直智能体的主要目标,是因为这些行业流程标准化程度高、采购标准清晰,更容易形成可复制的国际化路径。金融是最典型的垂直场景。沙利文报告评选出的十款产品中,有连云麒麟大模型是唯一聚焦金融垂直领域的产品,被定位为企业级金融 Agent 平台。它的入选理由是金融垂域场景与跨境 AI 的探索,配套原生金融、多语言适配、跨境云端架构等标签。金融场景对数据合规要求极高,智能体必须适配本地合规要求,这本身就是一道很高的准入门槛。垂直场景的工程含义是领域知识前置。通用智能体靠提示词理解业务,垂直智能体则把领域规则与业务流程内建到系统里。同样一个订单处理任务,通用方案需要人工解释业务背景,垂直方案开箱即用。这种差异决定了部署周期与客户买单意愿。垂直化不是限制场景,而是把场景做深。内容创作与营销是另一个快速成熟的垂直方向。报告指出,内容创作、营销、金融与智能汽车等场景交付物明确,更容易形成可复制的国际化路径。全球已有 47% 的零售企业高管报告在客户服务中采用了智能体。智能体正在从辅助工具变成业务流程的一部分,而不是可有可无的插件。垂直化与通用化的取舍,是每个团队都要做的选择。通用平台市场大但竞争激烈,垂直产品市场小但毛利高、壁垒深。报告的判断倾向后者:平台型产品虽然占了榜单一半,但真正具备全球发展潜力的,大多是垂直场景的深耕者。对中小团队来说,垂直场景几乎是唯一可行的入场路径。五、方向四:架构轻量化架构轻量化解决成本怎么降的问题,这是规模化落地的前提条件。报告引用了一组关键数据:AI 模型推理成本两年内下降超过 95%,这使得每个业务流程部署一个智能体在经济上真正可行。成本曲线拐点的出现,让智能体从演示走向大规模试用成为可能。轻量化不是性能妥协,而是商业可行性的必要条件。轻量化的第一条路径是模型分层。不是所有任务都需要旗舰大模型,简单任务交给小模型,复杂任务才动用大模型,这是当前最主流的降本手段。垂直 Agent 里已有不少把专用小模型嵌入业务流程,例如 30B 执行模型承担高频重复动作。模型分层的核心是路由准确,路由错了,省钱就变成了降质。轻量化的第二条路径是上下文瘦身。长上下文是成本与延迟的主要来源,减少输入 token 是每个智能体系统的必修课。检索增强、摘要压缩、缓存复用是三种常见手段,它们的目标都是让模型只看到完成任务所需的最小上下文。多模态场景里,视觉 token 的冗余剪枝同样能带来显著收益,已有团队通过核心集剪枝减少八成 token 而保持效果。轻量化的第三条路径是基础设施优化。推理引擎的批处理、投机采样、KV Cache 复用等技术,正在持续压低单次推理成本。报告没有展开技术细节,但产业数字背后全是这些工程改进的累积。轻量化意味着成本预算是架构设计的一等公民,成本模型要写进设计文档。轻量化与质量是一对需要平衡的矛盾。过度压缩上下文会牺牲准确性,过度复用缓存会引入陈旧信息,小模型路由不当会拉低任务完成率。实践中的做法,是为不同任务设定不同的成本预算,并配套质量门禁。质量门禁的作用,是在成本优化的同时守住下限。轻量化是系统工程,不是单点优化。六、商业模式:从过程收费到动态混合制报告判断,智能体商业模式将在未来一到三年内,从单一过程收费演进至动态混合制。过程收费按调用量或订阅计费,收入稳定可预测,但无法体现智能体创造的真实价值。结果收费按任务完成或业务效果计费,价值感强,但收入波动大、结算复杂。两种模式各有优劣,单独使用都无法支撑健康的商业模型。动态混合制的思路,是按任务性质选择计费方式。标准化高频任务适合过程收费,例如合同审核;高价值低频任务适合结果收费,例如销售线索转化。混合制的好处是收入结构更稳健:过程收费提供基本盘,结果收费提供增长弹性。报告预计这种模式将成为主流,因为它同时对齐了买卖双方的激励。商业模式的选择会反向影响技术架构。过程收费模式需要精确计量每次调用,计费与配额体系是核心组件。结果收费模式需要可验证的任务完成证据,评估与审计体系成为核心组件。如果团队打算走向结果收费,架构上必须提前预留评估与审计能力,否则商业转型时技术会拖后腿。代理式支付是商业模式演进的另一条线索。支付巨头 Stripe 已推出代理式支付 API,并与 OpenAI 共同推出代理式商业协议,为买家、智能体与企业提供标准化通信框架。这意味着智能体能代表用户完成购买,支付链路从人机交互变成机机交互。代理式支付会强化结果收费的可行性,因为交易闭环可以直接验证。对开发者来说,商业模式不是财务部门的议题,而是架构决策的输入。报告判断动态混合制将成为主流,评估与计量能力必须前置建设。把评估体系当作事后补丁的团队,会在转型时付出重构代价。先想清楚怎么收费,再决定怎么架构,顺序不能反。七、给开发者的工程清单从报告四个方向里,可以提炼出一份工程清单,它比任何架构图都更贴近落地。第一,工具接入标准化,用 MCP 统一能力入口,避免为每个系统写适配代码。第二,智能体协作协议化,用 A2A 打通跨厂商协作。第三,任务状态外置,把共享状态从提示词里拿出来。第四,评估与计量前置,让每次任务完成都可验证、可计费。工具接入层最值得先动手。报告里的大量案例,本质上都是工具调用能力的胜利,智能体的价值取决于它能触达多少系统。用 MCP 统一接入后,新增一个数据源只是配置一个服务器,而不是开发一套集成。下表给出 MCP 与 A2A 的分工,这两者经常被混淆,但它们解决的是不同层面的问题。维度MCPA2A连接对象智能体与工具、数据智能体与智能体核心职责能力接入与调用任务发现与协作典型场景数据库、API、文件系统跨厂商任务委托表格之外还有一层容易被忽略:安全边界。报告虽然没有单独成章,但金融与医疗案例都绕不开权限管控。智能体访问企业系统时,权限粒度应当细化到单次动作,而不是整个会话。一次动作一次授权,用完即失效,这是防止越权操作的基础设计。权限模型写进架构第一天,比事后打补丁便宜得多。可观测性同样是工程清单的必选项。智能体的不确定性决定了它不能像传统程序一样靠日志排错,需要更完整的轨迹记录。每个任务应记录意图、工具调用序列、中间结果与最终结论。出问题时,按轨迹回放定位,而不是靠猜。报告把评估与验证当作商业能力的前提,工程上对应就是这一整套观测体系。评估体系要从第一版就开始建。没有评估,智能体优化就是盲人摸象,改一个提示词不知道变好还是变坏。最小可用的评估集,应当覆盖典型任务、边界输入与失败样例三类用例。每次迭代跑一遍评估集,对比通过率与耗时,用数据决定是否上线。评估集要随业务增长持续扩充,它会成为团队最值钱的资产之一。下面这段代码是一个最小可运行的智能体任务循环,演示状态流转与失败隔离。它不依赖任何第三方库,直接保存为 Python 文件即可执行,输出结果是结构化的任务状态列表。真实的智能体系统比它复杂得多,但核心骨架一致:先规划,再执行,最后验证。每一步执行都会记录状态,方便回放与排错。from enum import Enum class State(Enum): PENDING 0 RUNNING 1 DONE 2 FAILED 3 def execute(name): # 模拟一次工具调用,返回是否成功 return name ! fail def run(tasks): results [] for t in tasks: state State.RUNNING ok execute(t) state State.DONE if ok else State.FAILED results.append((t, state.name)) return results print(run([collect, summarize, fail, send]))这段代码把任务状态机固化在循环里,每个任务都经历运行、成功或失败三种终态。失败的任务不会中断整批处理,而是以失败状态返回,由上层决定重试还是跳过。这正是多智能体系统里失败隔离的雏形。真实系统会加入重试上限、超时与人工介入通道,但状态机骨架不变。八、落地节奏与风险报告对落地节奏的判断值得冷静对待:企业级智能体的成熟应用集中在 2026 年至 2028 年,原生应用生态还需要三到五年。这与智能手机的历史节奏类似,基础设施先行,生态随后爆发。当前处在范式革命的序章,过早押注单一形态与过晚入场都有风险。对技术团队来说,现在正是打基础的最佳窗口。基础设施先行意味着两件事:一是推理成本还在快速下降,二是工具生态还在快速演进。过早固化技术选型,可能被下一轮变化淘汰;完全不投入,又会错过窗口。折中的做法,是选择协议层与接口层做标准化投入,把具体实现留给演进。MCP 与 A2A 这类开放协议,正是适合长期押注的稳定层,因为它们绑定的是标准而不是厂商。风险的第一项是幻觉与错误执行。智能体完成任务时可能自信地给出错误结果,这在业务场景里代价极高。应对方案是让关键动作必须经过验证门,例如读取数据后核对行数,写入前确认目标表。验证门不一定复杂,但必须存在。没有验证门的智能体,只适合演示,不适合生产。风险的第二项是安全与越权。智能体拿到工具权限后,可能执行超出预期的操作,尤其是联网与文件类工具。实践做法是把权限收敛到最小集,敏感动作单独审批,所有操作留痕。报告提到的治理框架与风险管控机制,正是企业部署时绕不开的环节。安全不是上线后的加固,而是架构约束的一部分。风险的最后一项是成本失控。虽然推理成本两年降了九成以上,但智能体调用量可能呈数量级增长,总账未必更便宜。团队必须为每个任务设定成本预算,监控单任务平均成本与失败重试成本。当成本超出预期时,优先检查路由是否把小任务送给了大模型。成本治理与质量治理,是同一套机制的两面。对个人开发者来说,行动路径要短平快。先选一个自己熟悉的垂直场景,把流程中最痛的一步用智能体做深,而不是追求通用能力。其次,优先接入标准协议,让系统保持可迁移性。最后,从第一天就记录任务完成率,用数据说话。报告的结论是产业级的,但行动可以是个人级的,两者并不矛盾。对团队负责人来说,排序更重要。先解决工具接入与权限,再建设评估与观测,最后才谈规模化推广。顺序反了,规模越大,返工越贵。报告的四个方向对应四个阶段,也可以当作团队路线图的四个里程碑。每个里程碑都配一个可量化指标,通过后再进入下一阶段,这是把产业判断变成工程节奏的正确方式。回到开头那本账:2.6 万亿到 20.1 万亿的增长,不会自动发生,它要靠每个团队把报告里的方向翻译成具体系统。方向已经写得很清楚,剩下的就是工程执行。这篇文章不提供捷径,只提供一张地图。地图上的路,需要自己一步步走完,未来的行业排名就藏在今天的架构决策里。