别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架

📅 2026/7/29 14:45:11
别急着把AI Agent当员工!天工产品总监Phoebe拆解三维度量与六维“实习生”度量框架
分享嘉宾| Phoebe 整理 | 张红月出品 | CSDNIDCSDNnews传统的业务指标正在让 AI Agent 产品经理陷入“打地鼠”式的优化困境。在大模型与 Agent 框架高频迭代的当下如何定义一个 Agent“好不好”在由 CSDN 与奇点智能研究院举办的 2026 奇点智能产品大会上昆仑万维天工 AI 高级产品总监 Phoebe 带来了她的实战思考。Phoebe 在奇点智能产品大会分享现场她指出当前的 Agent 处境更像是一个“顶尖实习生”而非真正的“员工”。Phoebe 基于天工 Skywork 的迭代实战系统拆解了 Agent 在度量上的“三角困境”分享了团队踩过的交付质量、速度、成本等三大深坑并首次公开了六维“顶尖实习生”度量框架为行业提供了一份硬核的 Agent 产品感知与评估指南。Agent 度量的现实困境单一指标的“打地鼠”游戏做过 Agent 产品的 PM手头大概都攥着一堆指标任务完成率、任务耗时、用户赞踩、Token 效率、成功步长、正确率……截图自 Phoebe PPT但在实际业务中你会发现单一指标往往是割裂且彼此冲突的任务完成率高并不代表产出质量达标结果对错依然无法判断任务耗时缩短了但多长算快基准不同耗时如何定义好坏用户点赞点踩数据极为稀疏显式指标与隐式指标经常发生矛盾极难归因Token 效率提高了成本降下来了但往往以牺牲产出质量为代价。在这种状态下团队很容易陷入“打地鼠”式的循环优化这个月保速度发现成本上升了下个月砍成本发现体验和质量下降了再去专注优化质量速度又变慢了。究其原因是因为短期指标只描述了 Agent 的当下截面却没有告诉我们它最终应该去往哪里。我们需要一个能够描述 Agent “终态”的参照系。实战中的三次认知升级在天工 Skywork 从 2025 年 5 月发布至今的迭代过程中Phoebe 分享了他们经历了三次关键的认知转折。认知升级 1别把一次性需求当成 Agent 的舒适区在 Skywork 上线初期产品策略非常传统通过赠送大量新用户积分、提供低额会员来降低门槛期望用户在深入使用后转化为大额会员。但数据揭示了一个让我们困惑的规律新用户大多只购买小额 SKU且呈现出“候鸟式”特征有需求时订阅没需求时退订过段时间又回来。这说明用户只是把 Agent 当成临时工具来解决一次性需求双方并未建立起持续的“雇佣关系”。事实上一次性需求如写单篇报告、做单个 PPT目标明确、交付边界清晰但它很难发挥 Agent 的核心价值上下文沉淀、偏好记忆等极易被后续的模型升级所内化产品难以建立起差异化壁垒。Agent 的真正潜力在于服务“成长型任务”——即围绕长期项目持续推进、能够产生“复利”的任务。随着用户持续使用信息积累产生效应后续的解释与返工成本不断下降同时Agent 越来越懂用户收益增长与成本下降之间形成正向的“剪刀差”。在优化过程中Phoebe 他们曾发现有 20% 的用户在给出质量好、速度快的评价后依然会选择点踩但点完踩之后他们还会跑去充值。分析后发现用户点踩的不是质量而是“积分消耗”。在用户的实际感知里每一次任务都有一个性价比感知产品团队往往容易陷入自我感动的盲区产物质量高、任务效率快就是好产品但用户在算账这个产出虽然好但花这么多积分值不值产品经理不能只做评测人而要带着真实任务、自费去使用产品。只有当成本真正落在自己身上时你才能敏锐地捕捉到用户的三个关键瞬间付费冲动、想切换、想分享。认知升级 2从“产物交付”思维转向“任务闭环”思维早期Skywork 按照产物类型划分入口试图引导用户精准表达需求评估指标也放在“有没有做出完美的产物”上。但在终态 Agent 视角下评估标准应该从关注“产物质量”转向关注“任务推进”。为什么因为 Agent 的能力边界是呈“水波纹效应”动态扩张的。内圈当前稳定完成的任务静态指标已覆盖。中圈潜在迁移圈失败过但用户在持续尝试的任务。外圈未来方向性扩展圈需要新工具和新大模型能力才能完成的任务。随着模型演进、工具调用加强以及访问权限的拓展Agent的边界在不断外扩。PM必须比用户更早感知到下一圈层的边界及时调整评估标准否则静态的指标度量终将失效。认知升级 3功能的成败在于能否顺利嵌入用户的工作流我们曾对标行业竞品在 PPT 生成上同时做了“在线演示”和“兼容导出”两个功能。但在上线初期80% 的用户选择了直接导出演示功能几乎无人问津。调研后发现用户多是企业员工他们并不希望别人知道方案是 AI 生成的更不可能在公司投影仪上直接用 AI 界面进行演示。这表明功能的成败有时不在于功能本身而在于它能不能顺利嵌入用户当前的工作流。然而这种工作流环境也是动态变化的。2025 年组织尚未 AI 化员工倾向于“隐藏AI痕迹”。2026 年随着组织加速 AI 化善用 AI 成为加分项在线演示功能便会重获其价值。六维“顶尖实习生”度量框架基于对 Agent“成长性”、“边界动态性”和“工作流嵌入性”这三大终态特征的理解我们发现一个理想的 Agent其特征表现高度类比于一位“优秀的实习生”。传统的度量在评价“任务完成情况”而优秀的管理者在评价实习生的“工作能力”。据此我们提炼出了六维“顶尖实习生”度量框架1. 基础学识主动识别信息缺口并合理应用优秀的 Agent 不只是被动执行指令而是能识别 自己不知道什么主动补齐关键信息并在推理中真正用上它。衡量的不是信息量多少而是信息是否影响了最终判断。2. 悟性理解力听懂字面是及格推理语义背景才是优秀及格是听懂用户说了什么优秀是听懂用户没说出来的意思。例如收到给小朋友科普最近火爆的龙虾——及格的 Agent 做了份餐桌龙虾 PPT优秀的 Agent 推理出OpenClaw项目并在执行前主动确认。线索 × 语境 × 推理 真正的理解力。3. 长记忆记忆必须影响行动否则只是静态数据库真正的长记忆需要三步记录偏好、历史、决策依据理解区分稳定偏好与临时上下文应用在下一次任务中主动调用并改变交付结果记而不用等于没记。4. 任务拆解落地把模糊目标转化为清晰路径“命令型需求大多数 Agent 都能完成拉开差距的是 “祈愿型需求”如帮我做份竞品分析”。优秀 Agent 先反推目标再拆解为确定范围 → 收集证据 → 对比维度 → 提炼机会 → 输出建议。5. 自主纠错复盘纠错以做对为目标而非仅仅完成链路阻塞时Agent 需要寻找替代路线但新路线必须服务于用户真实需求。如果生图服务失败不沟通就盲目路由、花大代价画出一张不合要求的图——任务状态是完成了体验却是极差的。必要时应暂停并请示用户。6. 边界自知明确何时请示何时自行决断信息不足、权限不足或能力不足时Agent 应明确承认不确定性而不是编造答案。判断原则改动只影响局部细节 → 推断执行并透明告知假设改动会导致整体方向跑偏 → 停下来获得用户授权。总结Agent 度量的“三个不要”在定义和迭代 Agent 产品时PM 需要牢记以下三点不要过度依赖单一指标完成率好看不等于 Agent 好用单指标只能解释局部不要忽视用户的心理成本用户点踩的原因可能不是产出质量而是“这一单不值”成本感知直接影响复购不要用静态指标度量动态能力边界Agent 能力边界在持续外扩今天有效的指标明天可能只能解释次要问题。把 Agent 当成一个“实习生”去培养。当你不仅关注它单次任务的成败更愿意信任它、将更复杂的任务交付给它时你的 Agent 便真正走在了正确的进化轨道上。现场问答实录Q1您在演讲最后提到AI 未来的发展方向是主动性加上环境感知。我们公司也一直在思考如何让 Agent 更聪明。想请问在天工对于 Agent 在主动获取信息和环境感知方面有没有一些最佳的实践探索Phoebe环境感知是我们很早就关注并开始布局的一个方向。我们之所以在产品大盘里推出硬件这条产品线最核心的原因在于软件层面的信息获取存在天然的瓶颈。在最早期的一版产品中我们让用户上传大量文档关联笔记本和各种参考材料。后续我们支持了关联用户的本地电脑文件。但我们发现所有这些方式都无法避开一个前置条件——需要用户“主动提交”。这个主动提交的动作其实就是阻碍 Agent 无缝感知环境的一个巨大门槛。因此我们推出了智能背夹这类硬件。它贴在手机背面配有麦克风阵列能够高保真地记录你所有的会议、通话和日常沟通并支持声纹识别。当它是开启状态时只要你听到了什么它就能同步采集并回传到云端 Agent 中。后续我们还会推出带有视觉摄像头的挂件设备。硬件的本质是帮 Agent 去“看你所看听你所听”以此来自动、隐式地补全上下文。至于主动性我个人认为在当前的算力与 Token 成本下主动性功能在产品化落地上面临很大挑战。因为 Agent 执行任何主动动作都需要消耗Token也就是成本。除非这个主动动作的准确率能达到 99.9% 以上否则对用户而言频繁的主动打扰大概率会变成一种高成本的噪音。只有当未来整体算力与调用成本降到极低水平时AI 的主动性才会迎来真正的爆发。Q2天工这款超级智能体产品在定位上是 To C 还是 To B 的另外如果未来 AI PC 等本地算力能够支持本地处理用户是在本地 PC 端使用更多还是依然会更倾向于云端Phoebe我们这款超级智能体产品核心定位是面向 C 端用户的特别是目前定位在“超级个体”和“自由职业者”等高频需要生产力工具的群体帮助他们进行日常办公、写作、研究和全栈式任务的处理。关于本地 PC 处理与云端处理的选择这其实代表了两种不同用户群体的诉求。目前我们依然更看好云端的端到端闭环。原因在于超级个体和移动办公人群的核心诉求是“随时随地、多端无缝地让任务持续运行”。如果依赖本地运行首要面临的物理限制就是设备的待机与网络环境。比如我在执行一些需要长达数小时运行的复杂工作流时我不能要求我的本地电脑一直开着、不能锁屏。云端沙盒能够完美解决设备离线、网络中断等物理限制让用户在手机、平板、电脑等不同终端上都能实时同步并控制任务进度。因此尽管本地 AI PC 能够分担部分端侧感知和轻量推理的任务但复杂的长链路 Agent 任务其终态依然会是在云端沙盒中闭环运行。Q3当 Agent 收集的环境数据和上下文越来越多、维度越来越复杂时如何能够保证高效、准确的知识检索你们在底层是如何组织和索引这些海量非结构化数据的Phoebe在海量环境数据的组织上行业目前的演进趋势已经逐渐明确未来的知识库形态可能不再是简单地堆砌和上传原始的非结构化文件而是走向知识的“解构与重构”。我们非常认同的一个理念是未来面向 Agent 的知识库其底层应该是以“大模型可读”的结构化网络形式存在的例如将数据提炼为更紧凑的、带有丰富语义关联的索引网络如 Graph RAG 或高维向量索引体系。信息在被捕获的第一时间就会通过后台的常驻 Agent 进行自动清洗、打标、关联和摘要化转化为结构化的记忆片段。这样当 Agent 需要调用某项记忆时它不需要在冗长的大文本中进行盲目搜索而是可以直接根据语义关联网精准定位到目标数据块。数据量大本身并不是技术瓶颈核心在于你的信息架构层是否能实现高度的结构化与语义关联。