字节被曝训练超 5 万亿参数大模型:一场关于算力、数据与耐心的豪赌

📅 2026/8/8 2:58:25
字节被曝训练超 5 万亿参数大模型:一场关于算力、数据与耐心的豪赌
title8 月 6 日晚间《晚点 LatePost》独家放出一条消息字节跳动正在内部讨论训练一个参数规模超过五万亿的大语言模型。这条消息很快在国内的 AI 圈子里传开讨论的焦点从参数数字一路延伸到字节的技术路线选择说明市场对字节的期待一直很高。五万亿这个具体数字一旦落地将同时压过阿里 Qwen 3.8-Max 的两点四万亿参数以及月之暗面 Kimi K3 的二点八万亿参数。它将成为国内已知参数规模最大的模型这个地位本身就具有很强的话题性也直接回应了外界对字节语言模型能力落后的质疑。报道同时强调这项计划目前仍处在非常早期的讨论阶段模型最终并不一定会发布参数规模也只是一个方向性的粗略目标。距离真正定稿和立项还有很长的路要走任何把它当成既定事实的解读都高估了这则消息的确定性。即便如此这条消息依然值得认真地拆解一遍因为它的价值远不止一个数字。背后藏着一整条关于算力、数据、组织与耐心的账本需要一层层剥开才看得见全貌而这一层层的细节恰恰是普通新闻标题不会告诉你的事情。我拆这条线的立场保持克制不替任何一方站队只把事件的来龙去脉、团队背景与真实的工程代价逐条摆上台面。最终怎么看留给你自己判断我只负责把信息整理到可以支撑判断的程度。先说报道给出的核心信息链新模型由种子基础模型团队的负责人主导与整个大模型预训练数据方向的人共同推进。两人在各自的位置上各负责一个环节一个管模型本身一个管喂给模型的数据分工非常清晰。继续追这条人物线两位负责人其实都出身于搜索、广告、推荐这套被反复验证过的推荐系统基础设施。这是理解这次选择的一块关键拼图说明字节挑人时更看重在真实业务里验证过的大规模系统工程能力而不是纯学术背景。主导的这位负责人本科毕业于中国科学技术大学曾获该校本科生最高荣誉奖学金随后保送中国科学院自动化研究所继续攻读博士学位学术基础相当扎实。他的学术起点和工程履历都是字节内部少数同时具备两条腿的人。这名负责人早年先后在两家知名互联网公司里负责视频推荐系统的研究与开发后来还做过二手车平台的首席科学家。他写了一部在业界流传很广的推荐系统入门书许多从业者的第一本推荐系统读物就是这本影响力一直持续到今天。再后来他正式加入字节带过的团队早期为火山引擎的智能推荐服务提供支撑之后他又被调到豆包的大模型基础研究团队任负责人。从推荐系统一路做到大模型基础研究这条路径在字节内部相当典型也解释了他为什么被委以重任。另一位后来成为预训练数据负责人的搭档本科毕业于清华大学同一年加入字节。他主管语言模型大规模训练所需数据的组织与清洗这是训练大模型最关键也最容易被低估的环节数据质量直接决定了模型能力的上限。把两人的求学与职业轨迹拼在一起可以看出字节推动超大模型的主要底气来自对被验证过的机器学习与数据调度的整体链路的高度信任。这不是实验室里拍脑袋的豪赌而是建立在既有工程资产之上的延续性动作。字节想做大参数模型并非一时的冲动友商们已经把开源和闭源的参数上限抬到了万亿量级整个行业的竞争格局在最近一年里被彻底改写。任何还停留在千亿参数时代的团队都会在基准榜单和用户体验上感受到越来越大的压力。月之暗面在七月开源了 Kimi K3参数规模达到国内迄今最大的二点八万亿多项第三方评测认为它已经接近海外闭源旗舰模型的能力水平。这个开源动作直接拉高了国内开源模型的天花板也让字节感受到明显的时间紧迫感。马斯克把 xAI 的 Grok 底座从五千亿参数一路扩到一点五万亿并且公开表示下一代要做到六万亿参数。他将军备竞赛的油门一次又一次踩到底这让超大规模训练在舆论上彻底与头部公司绑定也成了别人很难回避的参考坐标。OpenAI 与 Anthropic 两家海外巨头此前也陆续传出要训练更大尺寸的模型把加大模型尺寸当成了整个行业阶段的共识。当几乎所有头部玩家都往大参数方向挤的时候字节如果不跟上就会被这条快速演进的曲线直接甩在后面。在语言模型这条赛道上暂时落后的字节想用几乎相同的办法赌一把弯道超车这就是五万亿参数计划最直白的外部动机。与其在已有差距上被动追赶不如换一条赛道搏更高的上限这是字节在战略层面相当真实的逻辑。要理解这场博弈的分量得先把超大规模训练背后的工程账单算清楚否则所有讨论都只会落在口号与情绪这一层。算清账之后才能看清字节押注的到底是什么它要付出多大的沉没成本以及这笔投入到底值不值。第一步先确定模型参数量从参数出发能倒推出吞吐量、显存与集群规模这几个最核心的约束条件。大模型训练的所有工程取舍本质上都是从这几个约束反推出来的参数越大每一个环节的边际难度就越高。业界对训练总计算量有一个相对成熟的经验式估算一次完整的预训练需要的浮点运算次数大约等于六乘以参数量再乘以训练数据的总 Token 数。这个式子虽然只是粗略的量级估计却足以把五万亿规模的真实开销框出一个范围来。上面的代码挂出了一个可以直接调用的估算函数先只认参数与 Token 两个输入返回的是训练所需浮点运算的量级。它把繁复的硬件换算折叠成一行公式方便我们在没有集群细节的前提下先给这场豪赌一个量级上的体感。把五万亿参数和二十万亿 Token 代进这个式子得到的量级大概在千万亿次浮点运算的档位上折算成主流训练芯片需要的规模是以万台集群来计。这是最粗糙的上限估算真实值只会随着通信与容错开销进一步放大。更关键的是显存墙五万亿参数哪怕只按最保守的权重精度计算一次前向加反向就需要把整套参数加梯度全部塞进显存。实际训练必须借助张量并行、流水线并行加数据并行的三维组合把参数切到上千块才能勉强放下。显存账还会引出集群规模账因为并行切分之后要维持合理的计算利用率网络带宽与同步吞吐就成了决定性的瓶颈。这正是字节能被高看一眼的地方它手里握着的网络基础设施与集群调配能力是许多后来者不具备的。带宽之外还有故障恢复这个隐性难题千卡量级的集群里单卡故障几乎是常态而非意外。因此超大规模训练要求整套调度系统能自动丢弃坏卡、保存快照并在断点续训这套工程能力才是看不见却又决定成败的护城河。算力账算到这一步五万亿参数的物理开销已经相当夸张可参数量只是明面上的第一道门槛。真正让这场博弈变得更复杂的是数据规模这一层几乎同步出现的硬约束它甚至比算力更难以用钱直接堆出来。def estimate_flops(params: float, tokens: float) - float: 估算一次预训练所需浮点运算量(FLOPs)。 args: params 参数量, tokens 训练 Token 数 per_token_cost 6.0 * params # MoE 与激活重算的粗略放大 return per_token_cost * tokens params 5.0e12 #五万亿参数approx_tokens 2.0e13 # 按 20T token 假设 flops estimate_flops(params, approx_tokens) flops_in_e flops / 1e18 print(f预期 FLOPs ≈ {flops_in_e:.1f} exaflop)数据这道墙有多高直接看字节的准备动作就清楚。为了给语言模型清洗高质量的训练数据字节的数据审核团队今年已经从约一千五百人扩到了三千多人专门为编程等方向清洗语料这个规模本身就说明缺口有多大。业内有公开信息透露字节为了训练数据已经组织数千人的审核与标注力量这样的重投入并不是所有公司都愿意负担的。数据从采集、清洗到结构化这是一条完整流水线任何一个环节掉链子都会直接反映到最终模型质量上。所以五万亿参数真正的压力从来不是把模型做大那一下而是把喂给它的数据做成干净且足够多样。参数可以靠算力堆出来数据质量却只能靠长期的组织和制度去打磨这也是为什么字节会把预训练数据负责人单独拿出来的原因。数据之外还有一个常被低估的工程量度那就是规模放大之后通信与调度的复杂度。五万亿模型必然要跨几十个数据中心、几十万张卡协同任何一张卡延迟都会拖住整条流水线稳定性的要求比小规模训练高出一个数量级。因此真正的瓶颈不在单卡算力而在集群之间的内部网络与调度韧性。字节长期做推荐系统积累下来的大规模分布式经验恰好在这里能被复用把视频模型的分布式方法迁移过来是这个团队手里相对确定的工程底牌。但把所有工程底牌叠到一起也不能绕过一个清楚的事实超大参数训练的天花板是边际收益递减。参数加到某个量级之后智能的提升会明显放缓而算力与数据的投入却几乎线性甚至超线性上涨这条曲线会让很多人重新算账。业界并不是没人质疑这种路线不少工程师就公开讨论过一味堆参数最后得到的可能是算力换智能的笨办法。可字节在语言模型上本来就落后常规尺寸下它追不上先发者把注押在别人还没跑通的超大尺寸上反而成了一种可选策略。更微妙的是组织层面的选择字节高层正在 Seed 内部极力推动取消赛马机制把一个方向上的资源尽量收拢。即使团队之间存在工作重合字节也明确划分职责试着打破部门墙让不同部门的人协同合作为超大项目攒一个统一班底。这种组织上的收拢与字节过去的打法相比几乎是方向性的变化。过去字节更习惯用赛马让多个团队内部竞争跑出最好成绩现在换成集中资源押单一大方向说明高层对这件事的重视程度已经上升到战略最顶层。一个曾在 Seed 工作过的人做过很准确的总结字节的文化不适合创新但极擅长解题。Seedance 已经解开了第一道题字节现在想用近似的工程化方法去解一道更大的、关于通用智能的基础模型题。这种解题型思路也解释了为什么字节要选一项在自己手上赢过的事情去加杠杆。把已经验证过的分布式训练能力平移到语言模型上是它能在兵力与时间都不占优的前提下仍然敢赌五万亿的关键依据。要理解字节为什么这么拼命还得回到当下语言模型市场的处境上来。豆包虽然坐拥超过两亿日活的用户量给字节提供了一个别人很难复制的数据与产品支点但用户规模大并不等于模型能力自动领先口碑与评测上的短板是实打实的。今年二月豆包大模型推出了 Seed 2.0 版本市场反馈却相对平淡没能激起预期的波澜。几乎同一时间智谱开源了 GLM-5被不少内行当成国内第一个能够与海外主流旗舰模型同台竞技的作品。到了七月月之暗面开源了 Kimi K3多项第三方评测认为它的表现已经逼近海外闭源旗舰。同样的时间窗口里字节迄今没有一个语言模型能在评分上盖过这两个名字这种落差直接放大了字节内部的紧迫感。也正是这种对比摆在眼前字节高层才下定决心在模型尺寸上堵一把。高层的理由是常规尺寸下已经很难拉开与先发者的差距而把参数规模一次推到同行数倍才有可能用尺寸在绝对量级上实现反超。科学家出身的高层带头人吴永辉执掌 Seed 之后确立了追求智能上限的基调。他在内部不断强调模型一段时间内可以落后于行业但一定要把追求智能上线当作长期目标宁可慢一点也不要被短期的榜单排名牵着鼻子走。把上面各家的参数量横向摆在一起就能看出博弈的全貌。五万亿如果真落地会成为国内已知参数量最大的模型可同一张表里也能看到海外头部玩家比如 Grok 的下一代目标甚至定到了六万亿字节并不孤单。表格里真正值得注意的不是谁的数字最大而是开源与闭源两条路线的分界。字节被传闻要做的这块还说不准开源还是闭源而阿里与月之暗面已经用开源把能力门槛推高这等于在商业与技术两个维度同时施压。换个角度想即便字节把五万亿跑出来落在开源生态里也未必能立刻赢回开发者心智因为开源拼的不只是参数还有周边工具链与文档成熟度。这就是超大参数与商业成功之间容易被忽视的最后一公里。模型参数规模开源/闭源备注字节五万亿(传闻)5T未定单一讨论阶段未定型阿里 Qwen 3.8-Max2.4T开源国产商用旗舰月之暗面 Kimi K32.8T开源国内最大开源权重Grok(传闻下一代)6T闭源/开源部分马斯克规划目标围绕这场豪赌字节创始人张一鸣的表态同样值得拆解。他在内部明确反对模型蒸馏认为蒸馏只是短期内改善模型表现的手段本质上仍然是在复制别人已经拥有的能力沿着这条路走最多只能逼近很难实现真正的超越。这个判断相当有意思因为它实际上是在给团队上一道长期主义的技术路线课。反对蒸馏等于要求团队只能去追求那些需要自己重头积累、别人难以复制的真能力而不是靠搬运来填补短期差距。张一鸣还强调编程是当前的关键方向但他同时提醒团队别被短期的编程热点带偏节奏。编程只是通往智能上限的一条路径真正难的是让模型在更广阔的场景里获得通用能力这种取舍背后是对路线选择的清醒认识。更温和的是他安抚团队的态度在一次内部会上他明确表示训大模型本就是一件很难的事不必过度焦虑。他给出的预期是一段时间内可接受模型落后于行业这给承担压力的工程团队卸下了不少心理包袱。这些表态加在一起勾勒出一个愿意为长期确定性买单的决策者的侧写。字节愿意为智能上限投入天文数字的算力同时也愿意承受短期与同行存在差距的代价这种耐心在今天的 AI 资本叙事里并不多见。可耐心不等于零风险五万亿模型的执行不确定性依然很高。它涉及跨团队的长期攻坚、计划阶段就充满变数哪怕技术路线完全正确只要中间哪一环拖延或推挤整个项目都可能被重新评估甚至搁置。对开发者而言这件事带来的真正启示不是押注某家公司而是看懂超大参数的商业与技术边界。参数是最显眼的参数却不是模型能否好用、能否赚到钱的充分条件工程、数据、生态与商业模型决定的维度其实更多。如果你的业务强依赖长上下文与大模型能力五万亿一旦真的落地可能会一次性把通用能力的基准抬高一大截。反过来如果你做的是轻量在线应用超大参数未必是最好选择中小尺寸反而更容易满足实时成本约束。这场讨论本身已经足够提醒我们重新思考模型竞争力的本质。真正的护城河从来不只是参数数字而是数据、工程、组织与商业形成的完整体系单点堆参能否持续获胜最终还是要交给市场和时间去验证。字节是否真的会把五万亿跑到底现在谁也说不准计划仍处早期一切都还有变数。但对整个行业来说它已经用行动把超大模型的思考摆到了桌面上也给后来者留下了一条值得认真观察的技术路径。以上就是我对字节讨论五万亿参数模型这件事的完整梳理从事件的起因、团队背景一路讲到工程、数据与组织层面的博弈。希望这篇拆解能帮你把散落的碎片拼成一张清晰的图剩下的交给时间与市场去给答案。字节愿意为这场豪赌买单的底气还来自它已经验证过的商业化节奏。业内公开的信息显示字节的视频生成模型年化收入已经达到二十亿美元的量级单月收入超过十亿元差不多可以抵消豆包整体的算力成本。把视频生成模型训练成本在数亿元、毛利率约七成的数据摆在一起看字节的商业造血能力确实比外界印象里要强。语言模型的训练成本通常是视频模型的三到五倍可只要商业化能跟上去这笔账就有机会被慢慢摊平。这正是字节与纯烧钱的创业公司之间最大的不同它手里有多个已经能赚钱的业务来回输血。即便五万亿模型中途需要追加投入字节也未必会被资金问题卡住真正卡住它的只会是技术执行与数据质量本身。当然规模越大越要警惕收益递减五万亿训练周期很长期间模型演进的节奏很可能追不上友商的迭代速度。把参数推到某个阈值之后边际收益快速收缩工程成本却非线性上升规模红利有明显的天花板存在。