清华大学等推出“MAESTRO“:一个4B小模型,凭什么把GPT-5比下去?

📅 2026/8/12 14:56:17
清华大学等推出“MAESTRO“:一个4B小模型,凭什么把GPT-5比下去?
清华大学、浙江大学、香港中文大学、南洋理工大学以及同济大学联合完成了这项研究, 该研究于2026年5月21日以预印本形式发布, 其论文编号为arXiv:2605.22177, 感兴趣的读者能够凭借此编号检索完整论文, 是这样吧。一、故事的起点一个让人抓狂的老问题你是否曾有过这般经历: 手头有着各式各样的专家朋友, 其中有精于数学的, 有通晓医学的, 有擅长看图表的, 不过每逢碰见复杂问题时, 却通通只能去找同一位“万金油”朋友来摆平所有事情? 这位朋友虽说知识渊博, 然而碰到那些真正专业性的问题的时候, 始终都差那么一点儿火候。现下处于面对如此这般困境的正是当前的AI系统, 各种大型语言模型、可将其理解为会思考的超级助手以及专用工具多到无法计数, 然而现有的AI框架老是倾向于把所有事情都交付给同一个“大模型”去处理, 无论它是否擅长, 这恰似一家大型餐厅仅仅雇佣了一名厨师, 不管是粤菜、川菜还是法式甜点, 全都悉由他一人来做, 其结果不言而喻, 每样都能够做, 可是每样都不精通。被研究团队称作“协调瓶颈”的这个问题出现了, 在AI生态当中, 越来越多的专用模型以及工具不断涌现出来, 怎样才能够让它们进行高效配合, 并且发挥出各自的长处, 这已然成为了一个急需去解决的核心难题。研究团队提出这一系统, 是为了解决这个问题, 其全称是“面向专家技能的多模态智能体强化编排系统”Agent for -Skill。这个名字听起来繁杂, 但其核心思想类似经验丰富的乐团指挥, 即无需自己演奏每种乐器, 只需知晓何时让哪位演奏家上场, 使得整个乐团演奏出美妙之音。二、是什么一位不亲自演奏的指挥家具有的核心设计理念, 将传统AI框架的逻辑予以了颠覆, 传统框架所采用的做法, 是把所有能力都塞入一个巨型模型当中, 使其独自去承担全部, 然而其做法却是, 训练出一个轻量级的“指挥官”, 让这个“指挥官”负责去统筹调度一批专门的“演奏家”。这个负责指挥的官员本来仅仅只有四十亿个参数, 按照人工智能领域的通行说法来讲, 这是一个被称作“4B模型”的东西, 其规模相对来说十分短小精悍。和之相互比较, 像GPT - 5这样处于顶尖水平的模型据估算拥有数千亿甚至还要更多的参数。然而它的厉害所在之处是, 它掌控着一个由多个专门用途的模型所构成的“乐团”, 以及一层经过精心设计规划的两层技能储备库。在这个乐团中, 存在着五位“首席演奏家”, 其中一位是擅长科学推理的 -S1-mini90亿参数, 还有一位长于数学和通用感知的GLM-4.6V-Flash90亿参数, 另外有专精计数任务的Qwen3-VL-8B-80亿参数, 再者是在图表分析上独具一格的Chart-R180亿参数, 最后是专门处理医学图像的-1.5-4b-it40亿参数。每一位演奏家都在各自的领域里经过了专门训练, 其能力远远超过一个什么都懂却什么都不精的通才。在同一时间, 还配备了一个具备两层结构的技能库 , 第一层为五个领域不同的类别技能, 涵盖几何题目求解器, 图表题目求解器分别是计数题目的求解器, 视觉感觉题目求解器和对科学知识有关题目的求解用器 每领域之下各类大技能 , 同时再继续细分开出更具专业性, 更擅长细分专门的小一种技能 , 总计有八个。这样的两层形式的设计 , 似如餐厅的菜单: 大分类可帮助你在其中能够迅速进行位置确定 中式餐美食。西式餐美食, 日本料理 , 小分类用来让你在范围之内特别准确进行适合实际情况地挑选, 能够有正确合理地选择北京烤鸭, 红烧的猪肉块制作的肉, 宫保鸡丁。三、指挥棒的逻辑每一步都是一个决策的工作形式如同一场经过精细编排的多轮对话游戏, 当一个问题处于眼前之时, 指挥官会不断评估当下态势, 进而做出一连串连续的决策。这位指挥官, 每走一步, 都要面对三种选择。其一为“自己想”, 即在内心静静推理, 梳理思路, 恰似指挥家于心里轻哼旋律, 谋划下一步该让哪一声部入场。其二是“调兵遣将”, 朝着某个专家模型发出搜索请求, 同时明确使用何种技能, 此请求格式固定, 仿若指挥棒的手势, 格式是“模型名称技能名称: 具体问题”。其三乃“交卷作答”, 待积累了充足信息后, 便给出最终答案。每逢专家模型给出返回结果, 该结果会被置于特定标签当中, 进而注入对话历史, 指挥官依照此情形变更自己对于局势的判断, 决断是否还要更多信息, 又或者已然能够下结论了。整件事情至多开展四轮, 从而构成一环“感知—思考—行动”的闭环。此套机制的精妙所在之处在于, 指挥官并非仅仅是单纯地去“挑选一个工具来使用使用”, 而是于每一步的时候都需要同时去做出决定, 这个决定包括: 选用哪一个模型, 选用哪一个技能, 提出什么样的问题。这三个决定相互捆绑在一起, 进而构成了一个“组合搜索动作”。研究团队运用数学语言将其撰写成一个三元组, 然而通俗来讲, 就是在指挥棒落下的那一时刻, 同时确定了这些内容: 让哪一个上场也就是模型选择, 采用什么样的方式去演奏即技能选择, 演奏什么样的曲目也就是具体的查询内容。四、如何训练这位指挥家强化学习让它在实战中成长有种训练指挥家的方式存在两种途径, 其一, 是逐个动作地去教导他, 比如说“第一小节你得依从这般的挥棒形式, 第二小节则要采取那样的”, 其二, 是让他不断地进行指挥, 仅仅告知他每场演出最终呈现的结果究竟是成功, 亦或是失败, 从而促使其凭借自身去探寻出最为适宜的指挥方式。所要采纳的是第二种途径, 换而言之, 就是所谓的“基于结果的强化学习”。研究团队不会给出任何有关“应当调整的模型是哪一个, 所应用的技能是哪一种”的具体标注数据, 仅仅会出具最终答案是不是正确的反馈 , 这类降低数据收集成本的行为十分显著 , 原因在于进行了这样的操作 , 你无需让专家耗用大量时间去对每一步的正确决策路径进行标注 , 只需要具备问题以及与之相对应的正确答案就行了。叫做GRPO组相对策略优化的是具体的训练方式, 每道题会同时生成八条不同的解题轨迹, 接着比较这八条轨迹彼此之间的表现差异, 表现高于平均水平的轨迹会获得正向激励, 低于平均水平的则获得负向惩罚, 这恰似让八个学生同时解同一道题, 随后依据他们相对于班级平均分的状况来给予奖惩, 而非依照一个固定的满分标准。另外, 在训练期间存在一项关键设计, 即在进行“训练误差”计算之际, 针对盘算范畴而言, 仅纳入指挥官自身所产出的那一部分内容涵盖思考层面的内容以及行动指令等方面, 而要将专家模型反馈回来的那个结果部分予以忽略不计。之所以要这么处理呢? 其背后有着实际道理, 原因就在于, 指挥官此方面没有办法去对专家模型的输出起到控制作用, 倘若将专家反馈回来的这些内容也顺势算入到训练误差之中的话, 这就等于是对指挥官本不应承担责任的事情施加了惩罚举措——这样做既不符合公平原则, 同时还会使得训练朝着偏离正轨的方向发展。如下这样来改写: 由两部分构建而成奖励机制, 其中的第一部分是结果奖励并且呢是这样规定规则的。若最终答案正确的话, 那就授予1分要是答案不正确的话, 那就给予0分。另外的第二部分, 则是格式奖励, 具体是这样的情况, 就是只要对话格式出现了各种各样的问题, 像标签未闭合, 在一步里居然有双对思考标签, 搜索次数和信息块数量居然不匹配, 选了不存在的模型或者技能, 或者并没有以答案块结尾, 这样的情况下就会被扣1分。格式奖励之所以要这样设计, 目的在于确保多轮对话的结构完整性, 这就如同要确保乐谱上的符号都是依据标准来的, 如此一来演奏家才能够准确无误地读谱。核心领域由图表理解、几何推理、高分辨率感知、与物体计数组成六个, 此外还有像医学问答以及科学推理这样的, 总共九个样本来自于七个不一样的数据集, 训练数据总计有9200个。训练是在四块A100显卡之上开展的, 总共持续了大约三天半长的时间。五、战绩如何一个小指挥如何击败顶级模型研究团队评估了表现, 是在十个多模态基准测试上进行的评估, 这些测试有涉及多个维度啊, 包括数学推理, 图表理解以及医学分析, 还有高分辨率感知与目标计数等方面。结果着实十分令人意想不到, 使用仅有40亿参数的指挥官再添加上几个80至90亿参数的专家, 于十项测试的平均准确度上达成了70.1%, 超越了GPT - 569.3%以及谷歌的 - 2.5 - Pro68.7%, 这犹如同一个由数位各自身怀独特技艺的小提琴家、钢琴家和大提琴家组合成为的室内乐团, 在整体的音乐表现方面胜过了规模要庞大许多的交响乐团。详细来说, 于几何推理这个数据集上所呈现的表现特别突出, 精准率达成77.4%, 然而GPT - 并不4o只有34.1%并且GLM - 更是4.6V也仅有60.4%。在图表问答方面, 凭借86.8%的精准率与最优的基准线处于持平状态。在医学问答也就是Slake上所占比例达到66.2%, 可是大多数有关“思考图像”这类方法通常是在57%至66%这个区间当中。从未见过的“域外测试”, 那是训练的时候完全没接触过的数据相关测试, 在其上同样表现得稳健, 而且在高分辨率视频理解测试VStar上达到了88.0%, 在-4 k这个测试上达到了79.6%, 这两个数据均超过了同类专用方法中的最优者。更值得予以关注的是效率, 其平均推理延迟仅仅为2.88秒 , 平均每一次推理消耗648个词语单元 , 在所有进行对比的方法当中都是处于最低水平的。这也就意味着 , 尽管已然调用了多个专家模型 , 然而整体速度反倒更快——因指挥官能够精准判断何时需要进行调兵 、调哪个兵 , 并避免了那些低效的反复尝试以及无用功。六、插上翅膀无需重新训练随时扩充新专家那最具备实用价值的特性, 便是它有着“即插即用”的扩展能力。于完成基础训练之后, 研究团队朝着系统之中增添了两个额外的专家模型, 分别是Step3-VL-10B和Qwen3.5-9B, 以及四个全新的一级技能, 包括具身场景求解器、OCR求解器、图表推理技能和代码生成器, 将技能库从五个一级技能、八个二级技能扩充到了九个一级技能、二十四个二级技能, 而全程都是不对指挥官作任何重新训练的哦。扩展后的系统被叫做*, 在四个全新的专项测试上, 也就是具身推理ERQA、OCR识别、合成图表推理, 跟视觉代码生成这些测试上, 其平均准确率从52.7%提高到了59.5%, 超过了所有的对比模型, 这些对比模型里包含-2.5-Pro它的准确率是55.6%和Kimi-K2.5它的准确率是59.2%。这种扩展能力得以成立, 原因在于指挥官学到的并非是“面对某个特定数据集该如何做”的死记硬背内容。而是一套通用的调度逻辑, 具体指向根据问题的语义特征去判断哪类工具最为合适, 哪个模型的特长最为匹配。当新工具以自然语言描述的形式加入系统以后, 指挥官能够读懂这些描述, 并且据此做出合理的调度决策, 哪怕它在训练的时候从未见过这些工具。即便在没有任何新技能扩充之时, 使用默认的五个专家以及五个一级技能在四个全新测试上去测试已然以52.7%的平均准确率超越了所有“思考图像”类方法, 其中最好的仅有45.0%, 并且与顶级闭源模型不相上下, 这表明那些通用技能捕捉的是跨领域普遍适用的视觉推理能力, 而非专门为某个测试设计的取巧方案。七、现实世界的压力测试工具调用和客服对话研究团队进行了评估, 其目的在于验证, 并非仅仅在学术测试集上表现得好看, 同样还在两个测试平台上进行了该评估, 而这两个测试平台是更贴近实际部署的。首先要说的是BFCL-V4, 也就是伯克利函数调用排行榜的第四版, 它是用来专门去测试AI系统在单轮、以及此外的多轮对话当中调用外部工具时候所具备的准确性这个指标因素。在综合评分方面, 它的最终得分达到了78.09, 而且这个分数超过了GPT-5.2的68.58, 还有-2.5-Flash的72.88, 以及-Opus-4.5的72.14。最明显取得进步的地方是在“实时动态”测试, 也就是Live分项, 其数据是82.38比76.02 , 还有多轮对话测试, 数据为44.62比43.75 , 这两项测试有着这样的要求, 即系统要能够伴随对话的不断进展, 动态地去适应持续变化的API接口以及状态。首先是tau2-bench, 其一有着这般意味, 即它属于一种模拟真实客服情景模样的多方轮转对话测试, 其二涵盖零售行业场景、航空行业场景、电信行业场景以及银行行业场景这个四个方面, 其三有着这般规定或要求, 就是AI代理得依照繁杂的业务规则去行事、得跨越轮次来有效管理对话状态, 其四在恰当的时候去调用工具进而达成用户提出的请求这一情况。于四个场景里的平均分数达到72.9, 此分数超过了-Opus-4.5数值为70.2、GPT-5.2数值是55.5以及-2.5-Flash数值为48.1。这样的一些结果表明, 于静态题目测试集之上所学到的调度策略, 于动态的、多轮次的、工具密集型的真实交互场景当中同样具备有效性, 而这是诸多学术模型难以跨越过去的一道关卡。八、解剖一下成功哪些部分真的有用研究团队开展了一系列消融实验, 对各个组件逐一进行拆解, 探究去掉哪一个部分会造成多大程度的损失。这类似于检验一道菜肴中何种调料起着关键作用, 即逐个去除调料, 观察味道会发生怎样的变化。不保留分层技能, 去掉技能库, 仅维持专家模型池后, 平均准确率出现了下降的情况, 下降幅度为2.7%。将专家模型池去除, 仅留存40亿参数的指挥官以及技能库, 不存在其他专家, 平均准确率降低了12.1%, 并且在推理密集型任务方面损失格外惨重, 从43.4%急剧下跌至27.6%, 从77.4%猛然下降至22.3%。这表明, 基础的40亿模型全然无法取代那些领域专家的能力。两者都去除退化为基础模型直接作答, 平均准确率掉到55.8%, 不过依旧比没有任何系统框架的直接回答54.7%要高, 这表明技能库自身就算没有专家模型协同, 也具备一定价值。照此情形来看, 专家模型池跟技能库是相辅相成关联着的, 专家模型给予领域深度方面的支持, 技能库提供具备结构化特点的感知以及解析能力。仅仅这两者共同发力, 才能够施展发挥出最大程度的协同效应, 其中专家宛如乐团的那种大脑, 技能恰似乐团的手和眼。在奖励机制当中, 把格式奖励去掉所导致的损失, 平均下降幅度为13.1%, 这比去掉结果奖励造成的损失要大很多, 去掉结果奖励平均下降幅度是8.8%。出现这令人反直觉的发现, 是因为人们可能会认为, “答对了才奖励”这种结果信号是最为关键重要的。然而实际上来讲, 如果格式处于混乱状态, 则对话框的搭建就会破碎开来。如此一来, 系统断然无法正常运转以便借此调用外部的工具, 这就等同于直接退化成为了一个根本不会运用工具的普通模型, 相应的损失自然而然就会更大。格式奖励对多个流程的通信可靠性给予了保障, 而结果奖励针对此项, 又在该基础之上把选择的质量进一步地进行了优化。九、技能库的内部构造二十四把专用工具其技能库的设计本身, 也是值得去细细地品味一番的 , 有着九个一级技能, 它们是各自存在着分工的 , 并且在每个一级技能之下, 又有着若干的二级子技能 , 会借助关键词匹配或者是专家模型分类的方式 , 来自动地进行路由, 使其导向到最为合适的子技能那儿去。几何题求解器S1之下仅有一个子技能, 该子技能着重于从图像里提取诸如点、线、角、圆、标注等相关的结构化几何元素, 随后再联合图像描述以及OCR识别出来的文字信息以此来开展多步推理验证。图表题求解器S2之下存在三个子技能, 其中一个子技能专门用于处理柱状图, 它借助OCR去解析标题、坐标轴、图例, 并依据柱高来进行比较计算第二个子技能专门处理折线图, 它经由线型或者颜色去区分数据系列, 进而识别趋势转折点第三个子技能专门处理饼图, 它提取扇区标签以及百分比文字, 据此建立部分与整体之间的关系。目标检测工具与 -7B 辅助模型被整合于计数题求解器S3之中, 它会为每个目标批注大约坐标, 以此来避免发生重复计数或者遗漏掉被遮住的物体的情况。感知题求解器S4里存在两个分技能, 一个分技能是专门针对颜色感知展开处理的实现放大相关区域、区分相近色度、筛除阴影和反光干扰, 另一个分技能则是处理相对位置和一般感知的同时处理原来图画跟放大后的图画, 判定拓扑关系。科学题求解器S5把图像描述、OCR 以及 -7B 用来解析实验图示归拢运用在一起, 通过融合视觉与文字方面的证据去推导出科学结论。具有扩展性质的四个技能范畴涵盖了S6至S9这几个级别, 它们各自有着不同的针对性, 其中之一针对具身场景推理, 这一推理包含五种路线, 分别是轨迹结果、动作调整、空间力学、指向定位以及多视角对应, 另外还针对OCR任务, 该任务有五种类型, 即文字识别、关键信息提取、场景文字问答、文档图表问答以及公式识别, 以及合成图表推理, 此推理又包含五种子任务, 分别是圆的接触与重叠判断、交叉点与路线计数、网格结构解析、高亮字符识别以及几何形状计数, 还有代码生成, 其要求是从视觉示例中推断函数逻辑并生成可运行代码, 如果失败则自动进行迭代修复。十、放大镜下的训练过程系统如何学会何时出手关于奖励所产生的变化以及涉及策略熵的变化, 研究团队针对整个训练过程展开了监测。奖励曲线自训练伊始便呈现出稳定上升的态势, 最终在较高程度上趋向于平稳的状态策略熵却是从处于高位的状况持续向下有所降低, 最终安然稳定在一个相较很低的水平之上。有两条曲线, 其共同讲述了一个成长方面的故事, 在训练的初期阶段, 也就是大约前50步的时候, 指挥官尚处于“探索阶段”, 在每一道题目之上会频繁地发出多次搜索请求, 并且有时还会生出格式混乱的动作序列, 所有的一切全部都很随机, 因而熵是很高的, 奖励则是很低的。经历大概50步训练以后, 指挥官渐渐掌握基本格式规范技能, 可以为那些相对而言比较简单的任务生成格式无误、仅调用一次工具的解题轨迹, 格式奖励由此趋于稳定。训练步至后期, 即大约100步之后, 出现了有趣现象, 此现象被研究团队称作涌现行为: 指挥官习得了选择性多种策略步, 则一轮即可搞定简单任务, 针对真正模糊的情况诸如高分辨率图像中尚得进一步放大方可确认的细节, 则会发起后续查询, 此行为未被显式编程至系统, 完全起源于关乎结果定向的奖励之信号且自然为之涌现而出的。有关于从pass1也就是单次采样的准确率, 此为通常意义里的模型表现向pass16即16次采样当中至少存在一次正确的比例的对比, 这也揭示出了重要信息。在pass16上, 其平均准确率已然达到84.9%部分任务像在某些情况下达到94.0%, VStar达到92.7%, 然而pass1却仅仅只有70.1%。这14.8个百分点的差距表明, 对于多数问题而言, 正确的模型 - 技能组合在现有的系统之内是能够被找到的, 只是当前的一次性调度不能每一次都精准地命中。这为未来进一步改进指挥官的选择精度留下了明确的上升空间。十一、技能从何而来不是凭空设计而是有据可依做出一个合理的质疑, 这个质疑是, 设计以及维护这一套技能库究竟需要多少花费在人工方面的成本呢? 针对此项, 研究团队给出了坦诚的说明。每个一级技能, 以及其下子技能, 皆直接从既有的基准测试方法论、开源工具链当中, 系统性推导得来, 并非从零开始发明。几何求解器参考了可解释几何求解协议图表求解器的设计基础源于和Chart - R1已建立的强基准方法计数求解器借用了检测辅助枚举范式, 以及基于缩放的定位策略感知和科学求解器分别沿用了VTOOL - R1的分层视觉锚定工作流, 和Thyme的图像描述加OCR融合策略。能进行扩展的技能, 是直接从与之对应的基准测试的任务定义那里移植过来的, 也是从评估协议当中移植过来的。基于此情形, 每个一级技能的主要活儿就俩: 把基准测试所推荐的解题步骤归拢成结构化的多步提示用语, 再依据基准测试作者早已给出的问题类型分类去确定二级子技能的关键词路由准则。研究小组估摸, 五个默认技能S1至S5的提示工程工作量大概是三到五个人时, 四个扩展技能S6至S9额外还需一到两个人时。跟从头着手设计一整个AI系统相比, 这成本极其有限。当然, 研究团队也承认, 随着技能库规模增大, 人工维护成本依旧是切实存在的限制, 自动化技能生成是他们明确列为未来工作方向的事项。十二、不完美的地方系统的局限和失败案例不存在任何一个堪称完美的系统, 这也并不属于例外情形。研究团队以诚实的态度, 将两类典型的失败模式列举了出来。第一类问题出现在那些跨越两个技能类别界限的情形里, 像一道既得借助图表解析又要用领域专业知识的题目。于此种状况下, 指挥官往往倾向于选定一个一级技能后便坚守下去, 在许可的轮次之内不会再度思考更换技能, 致使任务推进不顺利。第二类失败聚焦于视觉代码生成测试, 此测试的难点不存在于技能挑选方面, 而是在于从视觉示例里推断编程逻辑自身所具备的固有难度, 系统需要借助看图去推测出一段代码理应达成何种功能, 这对于所有现存模型而言均是充满极大挑战性的任务。由pass1与pass16之间的差距能够看出, 当下系统较主要的瓶颈在于路由精度 , 也就是一次能不能选对模型以及技能, 但并非在于覆盖范围, 即系统内部是不是有可以解决这一问题的能力。针对绝大多数问题而言, 正确答案在现有的模型 - 技能组合空间当中是能够触及到的, 然而指挥官还没有彻底学会每次都精确命中。那么说到底, 所做之事能用一句话概括, 即, 与其耗费宛如天文数字一般的成本去训练一个能够对万事一概通晓的超级庞大模型, 反倒不如着手训练一位伶俐的调度统筹的官员人士, 使其学会恰当时候寻找到合适的专业行家。此思路本身并非具备神奇之处, 然凭借严密谨慎的实验以及好看亮眼的数字证实了其具备可行性, 即, 一个容量为4B的小型指挥操控者, 再加上数位各自身怀独特本领的专业行家, 能够在十项测试的均值表现方面超越取代GPT - 5, 而且在时间速度之上更为快捷, 在成本耗费之上更为低廉。归结到根本上, 这项研究最为有意思的启示并非在于那百分之之一二的准确率得到提高, 却是在于它开拓出了一条全新的技术路线, 人工智能能力的进步不一定非要没完没了地堆积参数, 有时候, 更加明智的协调方法便是答案。当系统出现错误时, 问题常常不是“这里面不存在会解答这道题的专家”, 而是“指挥官还没学会在这种状况下寻找那位专家”——这恰恰指向了未来最值得深入钻研的方向。或许你会更进一步去想, 要是技能库自身能够自行开展生成以及扩展, 且并非依靠人工进行维护那样子又会出现什么状况? 要是指挥官于部署进程里能够持续实施学习、做到实时施行调整, 这又将会带来多么大的进步余地? 对于这些问题, 研究团队已然明确地将其列为了接下来探索的方向。要是这些问题获得了解答, 我们说不定将会目睹一个具备真正意义的“自我进化”的AI协作生态系统。对于此项研究怀有兴趣的读者, 能够借助arXiv编号2605.22177去查阅完整的论文, 或者访问项目主页来获取开源代码。QAQ1是什么模型是由清华大学等高校联合提出来的, 一种AI编排框架, 其核心是一个, 仅有 40 亿参数的“指挥官”模型, 它负责动态调度, 多个专用专家模型, 以及分层技能库, 能协同用来解决复杂多模态任务, 而不是用单一大模型, 去包揽一应事无巨细的事务。Q2为什么能用4B小模型打败GPT-5A: 由于的4B指挥官并不需要自身去解题, 它所要做的是判定该让哪一个专家登场, 采用哪一种技能。每一个专家模型在其自身的领域历经专门的训练, 几何方面、图表方面、医学方面各有各的长处, 组合而成的整体能力超越了通才型大模型的表现了。Q3扩充新模型需要重新训练吗A: 不需要, 扩展实验证明, 不对指挥官进行任何重新训练, 往系统中直接加入新的专家模型和技能, 指挥官借着读取新技能的自然语言描述来学会调用它们, 在四个全新测试中的平均准确率从52.7%提升到了59.5%。