大模型智能体如何突破规模化应用瓶颈,核心在于Agentic ROI 📅 2026/7/29 17:08:56 上海交通大学联合中科大在本文中指出现阶段大模型智能体的主要障碍不在于模型能力不足而在于其「Agentic ROI」尚未达到实用化门槛。本文第一作者为上海交通大学计算机学院副教授刘卫文研究方向为大模型智能体大语言模型个性化算法等。近年来随着大语言模型的快速发展基于其构建的大模型智能体LLM Agents正逐步从技术演示走向实际应用部署。然而真正实现规模化应用仍面临诸多瓶颈。使用范围主要集中于专业领域如代码生成、科研辅助等。在大众、高频、日常的应用场景如电商、个人助理中普及率依然较低。这一现象引发了一个关键问题当前制约大模型智能体实际可用性的真正原因是什么上海交通大学联合中科大在本文中指出现阶段大模型智能体的主要障碍不在于模型能力不足而在于其「Agentic ROI」尚未达到实用化门槛。论文题目The Real Barrier to LLM Agent Usability is Agentic ROI论文链接https://arxiv.org/pdf/2505.17767Agentic ROI大模型智能体实现规模化应用的关键瓶颈研究团队提出 Agentic ROIAgentic Return on Investment这一核心指标用于衡量一个大模型智能体在真实使用场景中所带来的「信息收益」与其「使用成本」之间的比值Information Quality指智能体所生成的信息质量包括准确性、完整性等。Quality Threshold指最低可接受的信息质量阈值注根据上下文推断。Human Time和 Agent Time分别指人类与智能体完成对应任务所需的时间。Interaction Time指用户与智能体交互所需要的时间如用户进行任务描述、验证结果过程中所消耗的时间。Expense指用户经济成本如模型调用、API 使用的开销。只有当信息质量超过一定阈值且智能体所节省的时间和成本之比足够高时智能体才真正具备可用性。如上图所示当前大部分 LLM 智能体集中应用于人类任务时间成本高的信息密集型场景如科研、编程此类任务本身就需要大量人力投入因此即便智能体部分替代也能显著提高效率。然而在用户量庞大的日常场景中如电商、搜索、助理等任务本身较为简单交互成本低如点击、下滑操作智能体提升的边际价值不明显反而可能引入额外的交互成本和延迟从而导致 Agentic ROI 较低。因此当前高用户需求与低 Agentic ROI 之间的矛盾反映了智能体在日常应用中的实用性不足需进一步优化信息价值、智能体任务完成时间、及交互时间以填补市场空白。优化 Agentic ROI 智能体发展的「之字形」轨迹研究团队提出LLM 智能体的发展路径并非线性增长而是呈现出一种「先规模化、后轻量化」的「之字形」发展模式首先规模化scaling up参数规模、训练数据、推理能力以提升信息质量之后在保证信息质量的前提下轻量化scaling down进行模型压缩、蒸馏、推理优化以减少智能体所用时间与调用成本。我们正处于智能体规模化发展的高峰阶段优先提升信息质量。基础模型如 OpenAI 系列模型的发展也体现了这一「之字形」发展趋势同系列模型如 o1-mini 到 o1 模型表现显著增强而新一代小模型如 o3-mini 则在持平 o1 性能的同时显著降低了推理费用和延迟。规模化提升信息质量Scaling Up预训练规模化Pre-training Scaling预训练阶段通过扩大模型规模、数据量和计算资源使智能体在语言理解、推理和世界知识等基础能力方面获得稳步提升。而规模化使用包含任务结构和操作流程的文档数据如操作手册、工作流程指南能够帮助模型学习实际任务的分解逻辑和执行顺序。此外随着上下文窗口的扩展和记忆机制的引入智能体可以处理更长的交互历史和用户偏好从而提升多轮任务执行的能力。后训练规模化Post-training Scaling后训练阶段如监督微调和强化学习使智能体更贴近人类的需求与价值观。同时智能体性能提升还依赖于大规模复杂环境网页、API 接口交互轨迹数据使用外部工具进行操作决策。此外在真实部署中积累的用户反馈、任务完成记录和错误修复数据构成了智能体持续学习与演化的基础形成智能体的数据飞轮使其在真实使用中不断优化行为。推理时规模化Test-time Scaling推理时规模化包括规模化推理步骤Scaling reasoning process以应对复杂任务并生成更可靠的输出规模化多智能体系统Scaling multi-agent system通过协作完成任务分解与执行扩展工具调用Scaling tool calling通过多次工具调用使智能体能够逐步验证中间结果扩展推理时训练Scaling test-time training通过利用无标签测试数据实时更新快速适应新任务或用户需求有约束条件下直接优化 Agentic ROIScaling towards Agentic ROI under budget constraints智能体可在给定预算约束如时间、API 成本下动态评估每一步操作信息收益直接整体优化 Agentic ROI。构建世界模型Building World Model构建真实的「世界模型」对于实现真正规模化数据合成、智能体评估至关重要。世界模型应支持多模态交互语言、图像、文档、音频具备处理多步骤、长时程任务的能力并能模拟用户的多样化偏好与反馈机制。此外它还应反映现实世界中的不确定性例如信息不完全、用户意图变化、环境干扰等。确保鲁棒性与安全性Ensuring Robustness Security确保智能体行为的稳健性与安全性也是提升信息质量的重要一环。鲁棒性方面智能体应防止奖励机制被利用避免出现「奖励黑客」现象安全性方面需要防范训练数据污染、防止反馈被篡改和后门攻击等。在运行过程中智能体应配备异常检测和事实核查能力确保输出内容的准确性与一致性。同时构建行为审计机制和可解释性工具可以提升智能体的可控性和可靠性。轻量化降低智能体时间与成本Scaling Down减少智能体任务完成时间引入记忆机制引入记忆机制是提高效率的重要手段。具备记忆能力的智能体可以跳过重复计算直接调用以往任务中积累的知识从而加快处理速度。这种方式模拟人类专家的行为依靠经验而非实时推理来完成任务。模型压缩通过模型压缩或蒸馏来减少计算资源和推理延迟是另一个核心方向。借助模型蒸馏等技术可以将大模型的能力迁移到更小的模型中从而在不显著降低性能的前提下显著缩短响应时间、减少部署成本。优化推理策略智能体的时间消耗不仅来源于计算还受到推理链条长度的影响。如果推理过程过于复杂或冗余例如频繁的自我反思、递归规划等可能会延长任务完成时间而未带来质的提升。因此更高效的智能体应具备「少而精」的思维能力能够通过最短路径达成最优解。基础设施优化硬件层面的升级如 Groq 和 Cerebras 等新型 AI 芯片以及软件层面的优化如 vLLM 和 FlashAttention 等推理引擎都能显著提升模型运行速度。只有软硬件协同进化才能真正满足低延迟、实时响应的实际需求从而提升智能体的整体可用性。降低成本降低交互时间当前的智能体往往要求用户提供冗长、明确的指令这带来了较高的使用门槛与认知负担。为此智能体的交互方式应从被动解析输入转向主动理解用户意图具备一定程度的目标推理与任务自完成能力。这种转变不仅可以减少用户的操作负担也有助于提升整体使用体验。此外产品设计上的新范式也有助于进一步降低用户交互时间。降低开销智能体的运行费用可能因模型规模、推理深度、调用外部工具等因素而迅速上升。尤其在大规模部署或持续运行场景下成本问题尤为突出。因此未来的智能体需要更智能地管理上下文合理控制推理复杂度与工具调用频率确保在保证性能的前提下尽可能降低资源消耗与使用开销。Agentic ROI 提供了一个衡量智能体真实可用性的系统框架帮助我们超越模型性能的单一维度转向「实际效益」导向的设计与评价逻辑。智能体的「可用性」不应仅以模型性能定义而应以综合效益衡量。在实际部署中Agentic ROI 为我们提供了一个更贴近真实世界的评价维度帮助我们识别系统中被忽视的「隐藏成本」并指导我们构建真正高效、可用、可负担的智能体系统。