蚂蚁15亿押注具身大脑,机器人竞争从硬件转向模型

📅 2026/8/27 3:18:30
蚂蚁15亿押注具身大脑,机器人竞争从硬件转向模型
蚂蚁灵波拟募资15亿元的消息出来后很多人的第一反应是蚂蚁也要下场造机器人了这个理解不算错但不够精确。更值得关注的细节是蚂蚁下注的方向并不是“机器人的身体”而是“机器人的大脑”——也就是行业里正在快速升温的“具身大脑”赛道。如果只看新闻标题容易把这件事理解成一家互联网公司追赶机器人风口但如果把视角拉长你会发现这其实是具身智能产业内部一次重要的价值迁移从比硬件参数转向比模型能力、数据工程和场景落地。这篇文章不打算只复述融资新闻。我会从三个层面展开先讲清楚“具身大脑”这个概念到底指什么边界在哪里再分析蚂蚁做这件事的优势、短板和可能的路径最后落到开发者视角聊聊如果团队或个人现在想切入具身智能哪些方向更值得做哪些坑可以提前避开。1. 为什么“具身大脑”突然成为融资焦点先回到事件本身。根据公开报道蚂蚁集团旗下的上海蚂蚁灵波科技有限公司拟募集约15亿元资金计划投向具身智能基础模型研发、人形机器人研发以及行业场景应用。这家公司是蚂蚁集团在智能机器人领域的重要布局经营范围覆盖智能机器人研发与销售、服务消费机器人制造与销售等。注意这里的关键词是“拟募资”。这意味着融资还在推进中最终金额、估值和投资方结构都可能变化。但从市场反应来看资本对这个方向的态度明显比两三年前积极原因主要有三点。第一人形机器人本体的融资热潮已经持续了一段时间。从创业公司到传统制造企业大家都在做电机、减速器、灵巧手、整机集成。硬件层面的竞争已经非常拥挤同质化严重单靠“把机器人做出来”已经很难形成壁垒。资本需要新的叙事而“大脑”是当前最大的空白。第二大模型技术让“给机器人装大脑”这件事第一次有了可行路径。过去机器人只能执行预先写好的脚本换一个物体、换一个环境就失效。现在多模态大模型和视觉-语言-动作VLA模型让机器人可以直接理解自然语言指令、识别场景、生成动作序列通用性大幅提升。这是“具身大脑”能够成立的底层技术前提。第三互联网科技公司看到了场景优势。造机器人本体需要机械、电机、供应链能力这不是大厂的传统强项。但让机器人理解用户意图、执行任务、对接数字化服务需要的是AI算法、数据工程、云平台和商业场景这些恰好是互联网公司的核心能力。所以蚂蚁灵波拟募资15亿这件事真正的信号不是“蚂蚁要造人形机器人”而是“具身智能的竞争正在从硬件层转向模型层和场景层”。在这个阶段入场比拼的是算法、数据和场景而不是工厂产能。2. 具身大脑到底是什么概念边界与技术分层“具身大脑”并不是一个严格的学术术语而是产业界对具身智能系统中“决策与认知部分”的形象化称呼。要理解它可以先做一个类比。自动驾驶系统通常分为感知、决策、执行三层。传感器负责“看”决策模块负责“判断”底盘和转向负责“动”。具身智能系统也有类似的划分环境感知负责理解周围世界大脑负责理解任务、制定计划、生成动作意图小脑负责控制电机完成具体动作。如果把机器人比作人的身体具身大脑对应的就是“负责思考、计划、判断”的那部分而不是“负责肌肉收缩”的那部分。具体来说具身大脑通常包含以下几个分层。第一层是感知与理解。它并不只是做目标检测而是要把视觉、语音、文本等多模态信息融合形成对当前场景的语义理解。比如机器人看到“桌上有水杯、书和遥控器”它需要知道这些东西分别是什么、位置关系如何、哪些属于用户指令中的对象。第二层是任务规划与推理。这是大脑的核心能力。接到一句“帮我把水杯拿过来”之后大脑需要把它拆解成子任务定位水杯、规划抓取路径、决定用哪只手臂、考虑是否需要先挪开障碍物。这部分可以基于大语言模型的推理能力实现也可以结合符号规划器或者强化学习策略。第三层是记忆与世界模型。大脑需要知道物品的长期存放位置需要记住用户偏好需要在没有直接观测到目标物时推测它可能在哪里。这种能力传统机器人很弱但大模型引入后机器人可以从过往对话、历史记录和场景语义中获得更强的泛化能力。传统机器人控制方案的短板在于能力高度绑定具体任务。一条机械臂在装配线上能精准完成固定动作但换一个产品型号、换一种零件摆放方式就需要工程师重新调试。具身大脑要解决的是相反的问题让机器人在“任务开放、环境变化、对象不固定”的条件下也能工作。对比维度传统机器人方案具身大脑驱动方案任务来源工程师写死脚本自然语言或视觉指令环境适应性固定环境、固定对象环境变化时重新理解决策方式规则和状态机大模型推理与规划扩展成本新增任务需重新开发新增任务靠数据与微调技术门槛控制算法为主模型、数据、工程并重所以具身大脑本质上不是某一个模型而是一整套“让机器人拥有理解和决策能力”的软件系统。这也是为什么蚂蚁这类公司会选择从这里切入它不是做一款机器人产品而是想成为机器人背后的“认知基础设施”。3. 具身大脑与“具身小脑”的边界别把运动控制都归给大脑在讨论具身大脑时一个很容易出现的误区是把机器人所有的智能都归给大脑认为只要模型足够强机器人就能完成所有动作。这是不对的。业界在讨论具身智能时经常会提到“大脑”和“小脑”的分工。小脑负责的是运动控制比如关节角度规划、力矩输出、平衡保持、步态调整、末端力控。这些任务要求极高的实时性控制周期通常在毫秒级依赖的是动态模型、状态估计器和控制算法而不是大模型的推理能力。如果把毫秒级的运动控制也交给大模型处理延迟就会成为致命问题。一个目标检测和语言推理往往需要几百毫秒到数秒机器人在这个时间里可能已经撞上障碍物或者抓取失败。那么大脑和小脑如何协同更合理的架构是大脑承担慢节奏的认知决策生成高层动作意图小脑负责把动作意图转化为具体的电机指令。中间通过“动作原语”或“技能库”进行衔接。所谓动作原语可以理解为一组已经封装好的基础动作能力比如“走过去”“抓取”“放下”“推开”“转身”。大脑只需要决定“调用哪个原语、以什么顺序调用、参数是什么”不需要逐毫秒计算关节角度。原语内部的控制逻辑由小脑完成。这种分工对工程架构有直接影响。大脑部分通常跑在服务器端或者高算力边缘设备上使用深度学习框架和推理引擎小脑部分则运行在机器人主控板上往往采用实时操作系统逻辑严谨、延迟确定。两者的通信需要设计好数据协议、频率和超时处理机制。从材料来看当前具身智能的成熟度还不足以让大脑直接输出底层电机指令。更现实的路径是用大模型增强机器人的任务理解能力而运动控制仍然依赖成熟的运动规划和控制算法。这也是为什么“具身大脑”赛道中很多公司并不自己造机器人本体而是和本体厂商合作。对工程师来说理解这个边界非常重要。如果团队想切入具身智能不必一上来就挑战“端到端全自主”而是可以先在“大脑输出动作序列小脑负责执行”的架构上跑通场景。这个架构对算力要求更低落地更快也更容易控制风险。4. 蚂蚁做具身大脑的优势与短板蚂蚁入局具身智能容易被低估也容易被高估。先看它真正的优势。第一场景理解能力。蚂蚁旗下有支付、本地生活、数字政务等大量服务场景。具身智能如果落地到实际服务中机器人需要理解复杂的人类指令、处理多轮交互、与数字化系统对接。这些能力最接近的不是“更会走路的机器人”而是“更会理解场景的AI系统”。蚂蚁在可信AI、知识图谱、意图理解和多轮对话方面积累较深这个能力可以直接迁移。第二数据与工程能力。做具身大脑的核心难点之一是数据需要海量、高质量、结构化的人机交互数据。蚂蚁多年处理支付级高并发业务在数据采集、清洗、标注、回流、质量监控方面有成熟方法论。这比单纯在实验室里堆算力更接近真实需求。第三商业落地的路径更丰富。具身大脑不一定非要“装在机器人上”才能商业化。它也可以作为API或云服务提供给机器人厂商、物业公司、商场和工厂。蚂蚁有成熟的云服务和商业化体系把技术能力封装成产品对外输出是它的传统强项。再看短板也很明显。首先蚂蚁没有具身硬件基因。虽然灵波公司的经营范围包含智能机器人研发和销售但蚂蚁本身并不生产伺服电机、减速器、传感器这类核心零部件。如果未来要做整机它大概率需要依靠代工或生态合作而不是自建供应链。其次机器人场景数据积累不足。蚂蚁在线上服务场景有海量数据但“机器人在物理世界中移动、抓取、操作”的数据它并没有明显积累。具身智能最终需要从线上走向线下物理空间的数据采集和积累需要时间不是靠大模型压缩就能补齐的。更稳妥的判断是蚂蚁大概率不会走“自己做一台机器人然后去卖”的重模式而是会优先考虑两条路一是做通用的具身大脑基础模型开放给行业使用二是先找一两个自身有优势的垂直场景做深度落地跑通后再横向扩展。这种路径选择提醒我们具身智能的产业格局不会是所有公司都来做机器人本体。未来更可能出现的情况是少数公司提供大脑和模型底座一批硬件公司提供本体另一批集成商负责场景落地。蚂蚁想占的位置是前两者之间的“模型层”。5. 技术视角具身大脑的关键模块与工程难点如果站在工程师视角拆解一个具身大脑系统通常会看到以下几个关键模块。第一多模态感知模块。负责把视觉、语音、深度信息、位置信息统一成一个场景表示。它既要保证实时性又要保留语义信息。当前常用做法是使用视觉语言模型做场景理解但真实机器人场景中有遮挡、光照变化、动态物体比静态图片识别难得多。第二推理与规划模块。这是“大脑思考”的部分。输入是任务描述和当前场景状态输出是高层动作序列。基于大语言模型的任务规划已经能做简单的“拆解步骤”但离复杂物理世界的可靠规划还有距离尤其需要处理约束条件比如“杯子易碎不能捏太紧”“柜门没开不能直接拉”。第三记忆模块。负责保存任务上下文和长期知识。短期记忆用于多轮指令追踪长期记忆保存物品位置、环境布局、用户习惯等信息。当前多数机器人记忆方案还比较初级通常用向量数据库 知识图谱组合实现。第四技能库模块。相当于大脑可以调用的“函数集合”。每个技能封装一个完整的动作能力包含参数接口和适用条件。大脑做规划时会从技能库中选择合适的技能并按参数调用。第五安全与可控模块。这个模块最容易在开发初期被忽略但却是落地时最关键的部分。包括动作安全边界检查、敏感指令过滤、紧急停止机制、权限管理。尤其是面向家庭或商业场景时安全不是加分项而是准入条件。配合这个架构下面给一个高度简化的概念示例用于说明任务规划链路的工作方式。这个例子不是为了对接真实产品API而是帮助理解模块之间的数据流。# 概念示例具身大脑任务规划链路伪代码非真实产品API class EmbodiedBrain: def __init__(self, perception, planner, skills, memory): self.perception perception self.planner planner self.skills skills self.memory memory def handle_task(self, instruction: str): # 1. 通过多模态感知获取当前场景状态 scene_state self.perception.understand_scene() # 2. 结合记忆和场景状态规划高层动作序列 task_plan self.planner.plan( instructioninstruction, scenescene_state, memoryself.memory.get_relevant_context(instruction) ) # 3. 将动作序列映射到技能库中的可执行技能 executable_skill self.skills.match(task_plan) if not executable_skill.is_safe(scene_state): return 安全校验失败已停止执行 # 4. 将技能和参数下发给运动控制层小脑 result executable_skill.execute(parameterstask_plan.parameters) return result训练这样的系统最大的成本不是模型本身而是数据。具身智能需要“感知-决策-动作-结果”闭环数据获取方式包括遥操作采集、真实场景录制、仿真合成等。仿真环境可以在早期承担大量训练和评测任务但仿真与真实世界之间始终有迁移差异。下面是一份仿真环境配置的示意片段用来展示评测一个具身大脑任务时环境层面需要关注哪些内容。这里使用的是通用场景描述不绑定任何具体商业产品。# 概念示例具身大脑评测环境配置示意非真实产品配置 environment: name: tabletop_pick_and_place physics_engine: bullet render_mode: rgb_depth task_variants: - id: pick_cup_from_table objects: - type: cup position: random fragility: high - type: obstacle position: random count: 2 success_condition: - cup_in_target_zone security_policy: force_limit: 30 collision_check: true emergency_stop: true evaluation: episodes: 500 metrics: - success_rate - avg_completion_time - safety_violations这个配置想说明一个核心观点具身大脑的评测不能只看“成功率”还要看“在什么条件下成功”“有没有安全违规”“任务变化后是否仍然稳定”。这几项指标合在一起才是衡量具身大脑真实能力的标准。6. 行业落地场景什么任务真正需要“大脑”并不是所有机器人场景都需要具身大脑。对开发者来说先判断“场景是否需要大脑”比急着上大模型更重要。先说不那么需要大脑的场景。固定轨迹的工业搬运、流水线重复装配、仓库货架间的标准路径拣选这些任务环境封闭、动作固定、状态有限。传统控制算法和预设脚本完全能够胜任而且成本更低、故障率更小。给这类场景硬塞一个具身大脑反而会引入不稳定因素得不偿失。真正需要具身大脑的场景通常具备三个特征任务多样、环境非结构化、交互方式自然。家庭服务是典型的例子。今天让机器人“把客厅茶几上的纸巾放到垃圾桶里”明天可能让它“去厨房拿一瓶酱油”后天可能是“打扫掉在地上的碎纸”。这些任务的对象、位置、路径都不固定而且用户是通过自然语言下指令。没有认知能力机器人只能做固定动作无法应对这种开放变化。商用服务场景同样适用。商场里的导览机器人用户会问“洗手间怎么走”“哪个店有儿童套餐”这些问题的表达方式千差万别背后的空间语义和业务逻辑也很复杂。机器人需要理解问题、结合商场地图和人流实况做决策这正是具身大脑的用武之地。工业柔性制造是一个正在增长的需求点。小批量、多品类的生产线需要频繁切换任务传统自动化方案每次切换都要重新调试成本极高。具身大脑让机器人可以通过自然语言或视觉示例快速切换任务减少工程投入。场景是否需要具身大脑原因固定工位装配不需要环境固定、动作重复、规则清晰标准托盘搬运不需要可预先定义路径和触发条件家庭清扫与收纳需要物体位置变化、任务开放、交互自然商场导览与服务需要多轮对话、语义理解、空间推理小批量柔性制造强烈需要任务切换频繁、对象多样性高从材料和市场现状来看具身大脑最先落地的未必是最酷炫的类人服务机器人而是“场景封闭但任务开放”的领域。比如一个限定区域的零售门店、一个固定工位但产品频繁更换的车间。这些场景数据可控、安全边界清晰适合作为具身大脑走向商业化的第一站。7. 开发者的切入路径与实践建议具身大脑赛道看起来很热但真正适合开发者切入的方向和自媒体渲染的并不完全一样。如果团队或个人想进入这个领域可以考虑四条路径。第一条路径是做数据工程。具身智能最大的瓶颈是数据不是模型。围绕数据采集、清洗、标注、仿真合成、评测集构建有大量工程机会。尤其是有机器人硬件经验、同时又懂数据处理的团队可以在这一层建立很强的护城河。第二条路径是做模型微调与适配。直接在基础大模型上做开发门槛非常高需要大量算力和团队。但基于开源视觉语言动作模型做垂直场景的领域微调是可行的切入点。比如针对“厨房操作”“门店导览”“桌面整理”等特定场景用少量高质量数据让模型更稳定这已经是许多创业公司的实际打法。第三条路径是做中间层和工具链。把具身大脑能力封装成统一的API、SDK或者低代码工作流让下游机器人厂商不需要懂模型就能接入。这不是最性感的环节但商业模式清晰也是互联网公司最有优势的位置。第四条路径是做垂直场景落地。选一个具体场景定义边界做一套完整解决方案。比如“餐厅收盘机器人”“实验室助手”“巡检任务调度”。这类项目体量不大但用户付费意愿明确适合验证真实价值。这里给一个很简单的概念示例演示中间层服务如何向外提供能力。它说明的是具身大脑对外暴露给应用的往往是任务级接口而不是底层模型输出。# 概念示例具身大脑服务调用示意非真实产品API import requests # 用户通过App或语音助手发起任务 payload { instruction: 把红色水杯放到厨房台面上, scene_id: home_kitchen_001, robot_id: robot_01 } # 中间层把用户意图转成具身大脑的任务请求 resp requests.post( https://brain.example.com/v1/tasks, jsonpayload, timeout30 ) if resp.status_code 200: task_id resp.json()[task_id] print(任务下发成功任务ID:, task_id) else: print(任务下发失败错误码:, resp.status_code)开发者在实践时最好按“仿真优先、小步验证、安全兜底”的节奏推进。先在仿真环境跑通核心逻辑再逐步引入真实机器人每次只增加一个不确定性变量不要同时挑战任务复杂度和真实环境。评测指标在一个阶段内固定避免边做边加指标导致结果无法对比。任何涉及真实机器人动作的测试都要有急停和物理隔离措施。如果团队在组建建议配置以下能力组合有自然语言处理和视觉模型经验的人做感知与规划有机器人运动控制经验的人做小脑衔接有后端工程经验的人做数据管道和服务封装再加上一个懂具体业务场景的人负责定义问题和验收标准。这样才是一个完整的具身大脑团队。8. 常见误区与风险清单具身大脑目前还处在早期行业内存在大量认知误区。如果不提前识别很容易把预算和人力投到错误的方向上。第一个误区是“具身大脑 人形机器人的全部”。实际上机器人的可靠性来自硬件、控制、软件、数据、工程多个环节的合力。大脑只是其中的一部分。很多团队过度投入模型能力忽略了机械和控制层面的稳定性最终机器人“很聪明但动不起来”。第二个误区是“有了大模型机器人什么都能干”。大模型擅长语义理解和常识推理但物理世界的操作需要精确的空间计算、力控制和长时间稳定性。在封闭场景里表现不错不代表到了开放环境还可靠。真实的具身大脑系统需要大量约束条件和安全兜底机制。第三个误区是“只买硬件不建软件”。不少企业打算直接采购人形机器人整机回来接上大模型就开始用。但当前机器人整机在软件开放性和开发工具上都不成熟没有内部软件团队的项目往往卡在数据获取和接口对接环节。硬件只是载体软件和数据才决定效果。第四个误区是“评测只看Demo视频”。短视频里的机器人成功案例往往是精心挑选的完整记录。真实环境中一次任务可能需要尝试十次才有一次成功。开发者判断一个具身大脑方案是否可用要看成功率、失败原因、极限条件和响应时间而不是只看高光片段。常见误区真实情况建议具身大脑等于机器人全部大脑只是决策层控制与硬件同样关键用系统思维评估整体能力大模型能解决一切任务复杂物理操作仍依赖精确控制与大量约束从封闭场景逐步扩展采购整机就能快速落地软件开放性和数据管道仍不成熟提前评估软件工程投入只看Demo视频下判断成功率和边界条件才反映真实水平建立统一评测指标风险方面有几点需要特别提出来。安全风险排第一位。机器人在真实环境里执行物理动作如果决策错误可能造成人员伤害或财产损失。任何具身大脑系统在生产环境部署前都必须经过充分的仿真验证并配备急停机制、权限控制、动作限幅等措施。数据隐私风险同样不能被忽视。具身大脑采集的数据往往包含家庭环境、人员形象、行为习惯等敏感信息。数据采集需要明确告知用户并获得授权存储和传输要加密模型训练和部署环境也要严格管控。对涉及用户数据的使用务必遵循最小必要原则。成本风险是隐性但致命的。具身大脑研发涉及算力、数据、硬件、人才每一项投入都不低。如果公司没有清晰的商业化路径很容易在技术验证阶段消耗大量资金。团队在立项时应该设置阶段性的验证节点每到一个节点就评估一次投入产出比。当前行业还面临评测标准不统一的问题。不同团队用不同数据集、不同指标、不同场景评估自己的系统导致“彼此无法横向比较”。这个问题短期内很难解决建议团队在实际操作中建立自己的固定评测集和基线指标保证项目内部的纵向可比性。9. 总结具身大脑的价值判断与后续观察点回到蚂蚁灵波拟募资15亿这件事本身。站在更长的周期看具身智能赛道正在从“硬件军备竞赛”转向“模型和数据能力竞争”。蚂蚁想押注的是后者这正是“具身大脑”吸引力提升的底层原因。对行业来说具身大脑的商业化还处于早期技术路线、产品形态和商业模式都没有定型。从材料来看蚂蚁在这件事上的潜力不在于它能多快做出一个会干活的机器人而在于它能否把模型能力、数据工程和场景资源转化为机器人行业的通用基础设施。这个方向一旦打通价值会比单独卖几台机器人大得多。未来一段时间值得观察的信号有三个。第一蚂蚁是否会发布自己的具身智能基础模型或者开放可用的大脑API。第二蚂蚁是否会与机器人本体厂商建立深度合作形成“大脑本体”的落地组合。第三训练数据从哪里来是否具备可持续的数据回流机制。这三个问题决定了蚂蚁的具身大脑是停留在战略叙事还是真正进入工程化阶段。对普通开发者来说现在其实是进入这个领域比较合适的窗口期。模型层还在快速演进硬件层仍未定型数据、评测、中间层和垂直场景都存在大量空白。如果等到基础模型和硬件生态都稳定了再入场竞争门槛会高得多。技术领域常常高估一两年的变化却低估三到五年的变化。具身大脑现在恰好处于那个“被高估当下、被低估未来”的阶段。对这个赛道保持关注并且从自己能落地的环节切入是更稳妥的选择。