走出WAIC,AI的下一场硬仗在吉瓦级AIDC

📅 2026/7/21 21:46:43
走出WAIC,AI的下一场硬仗在吉瓦级AIDC
AI的竞争已经从算法和模型逐渐延伸到了全栈级的算力基础设施的底层。文白 鸽编王一粟今年的WAIC结束了展馆里的声浪似乎还在回响。和往年一样大模型和机器人依旧是最热闹的阵地观众排队体验多模态对话、围观机器人递水跳舞社交媒体上的打卡照片大多出自那里。但如果拐进旁边的算力基础设施馆却俨然有着不同的氛围。围观的人群并不少但相比较各种花里胡哨的交互这里的严肃感和技术密度反而更高。百度、华为、摩尔线程等企业把数据中心的“微缩版”搬进了展馆一排排黑色机柜、密密麻麻的线缆、嗡嗡作响的液冷系统、超节点架构的实物展示等等。而这些沉默的“钢铁巨物”或许才是今年WAIC真正值得盯住的暗流。因为它们正指向一个被大多数人忽略却决定产业生死的问题如果它们真的在产业里跑起来需要多少电怎么冷却多少网络多少储能多少工程交付而这也正是7月17日下午在WAIC人工智能与能源双向赋能论坛上百度集团副总裁侯震宇和南方电网、中核、中石油、金风、华为、复旦等专家学者坐在一起聊的核心。百度集团副总裁侯震宇这场论坛像一道冷峻的转场把WAIC表面的热闹和AI产业真正要打的硬仗一下子连了起来。侯震宇点出了本质“算力的尽头是电力。”新时代的AIDC不再是传统IDC的简单扩容而是AI Infra与能源系统深度协同的新型基础设施。显然进入吉瓦GW时代后有卡就行的逻辑失效而算力竞争已从堆卡的军备竞赛转向每度电产出多少智能的效率比拼没有底层基建系统性优化再先进的芯片也只是耗电的摆设。而这套逻辑百度在两个月前就已经明确表态。今年5月百度执行副总裁百度智能云总裁沈抖在2026百度Create大会上提出了AI Infra的建设目标“在AI Infra上百度将提供每瓦性能更强、性价比更高的AI算力让每一次训练和推理都转化成更好的智能体效果。”可以看到展厅里的那些机柜不会说话但它们正在无声地诉说一个被大多数人忽略的真相AI的竞争已经从算法和模型逐渐延伸到了全栈级的算力基础设施的底层。吉瓦级AIDC算电协同是根本今年逛完WAIC后其实可以很明显的感受到AI算力赛道的风向变了。过往大家会更看重单芯片能力潜台词更多是AI的竞争模型的竞争≈芯片的竞争只要卡够多、模型够大就能跑赢。但今年行业开始意识到一件事即芯片或服务器只是AI基础设施的一部分。真正进入产业后芯片和服务器要放进数据中心和供电、制冷、网络、储能、调度、运维一起工作。AI的算力基础设施竞争不是把服务器摆出来而是要满足AI的大规模训练推理需求、要稳定、要安全可控而这需要的是一整套基建能力。美国银行的一份下一代AI数据中心的成本分析说得很直白AI数据中心的钱不是只花在GPU上而是分布在IT设备、供电设备、冷却设备和工程建设里。这说明AIDCAI Data Center智能数据中心从来不是单一硬件采购而是一整套基础设施工程。而这套系统级算力基建随着规模不断扩大已经开始进入吉瓦级时代。吉瓦GW是什么概念简单的说它就是一个功率的单位衡量具体的用电量。1GW的用电规模差不多是一座特大城市的居民用电总量。业内都知道训练一个大模型、运行一个推理集群本质上是在驱动数以万计的GPU/AI芯片持续高负荷运转。而这些芯片功率密度极高导致数据中心的耗电量惊人。用个比喻来说如果说算力FLOPS是“脑力”那么电力GW就是“饭量”。越聪明的脑子吃得越多。当一群“超级大脑”聚在一起万卡/百万卡集群它们的“饭量”就会从兆瓦MW飙升到吉瓦GW级别。这已经不是一个普通变电站能喂饱的需要专门配套发电设施或接入主干电网。但从中国电力国情来看其实并不缺“电”这个原料缺的更多的是如何把电高效转化为有效算力的系统工程能力。而这背后所考验的其实就是“算电协同”能力就是需要算力和电力同步规划一起建设、一起运营不能各干各的。这也就意味着做算力基建的企业不仅要懂芯片和算法还得懂电网、储能、光伏、液冷甚至地方能源政策。今年3月的《政府工作报告》中明确提出“打造智能经济新形态实施超大规模智算集群、算电协同等新基建工程加强全国一体化算力监测调度支持公共云发展。”这是“算电协同”首次被写入政府工作报告标志着其从地方试点、行业概念正式升格为国家级新基建战略。随后的5月《关于促进人工智能与能源双向赋能的行动方案》的发布则将算电协同从政策定调推进到落地实施阶段。如果没有系统级规划算力基建的云厂商在下半场的AI竞争中会比较难受。就像侯震宇提到的算力的尽头是电力双向赋能必须从底层基础设施的重构开始。而百度智能云也从两方面入手打造系统级的AI算力基建能力。简单来说百度AIDC的核心打法就两条第一条“让AI来管电”把大模型塞进数据中心的能源管理系统里相当于给数据中心配了个智能管家。这个管家能毫秒级地感知哪里热、哪里耗电自动调节空调和供电把电用到刀刃上。第二条“用全栈AI云省电”靠自研的昆仑芯万卡集群和整套AI云平台从根子上把算力的“饭量”降下来。同样干一个活别人的机器吃十碗饭百度可能只需要吃八碗。AI越往后发展电费账单越吓人这条路走通了长期运营成本就能压下来一大截。“这样不仅能解决我们数据中心的能源问题还能够让我们的AI能力进一步深入到能源行业中去。从IT到电力双向运营从底层基础设施上共同做出东西来。”侯震宇说道。这样才能真正推动算电协同的实质性落地。AIDC的新尺子每瓦多少Token一般来说传统IDC建设的逻辑是堆面积、堆机柜、堆服务器算力自然就会增长。这套逻辑在CPU时代是成立的因为负载稳定、功率密度低且系统复杂度有限。但AI时代这一切都发生了变化。AIDC如果按照此思路进行建设堆GPU会导致耗电量暴增、散热崩溃最终名义上算力是增高的但实际Token产出却很低。背后的核心矛盾就在于AI负载与传统云计算存在根本区别大模型训练、推理、智能体调用会带来更高的功率密度、更复杂的网络通信和更强的调度需求。举例来说一般AI负载的功率密度已达100kW以上每机柜远超传统风冷极限的30到40kW。单纯放大不是建设数据中心而是热力学灾难。所以AI时代好的AIDC不是更大的“用电大户”而是能把每一度电尽可能转化为有效AI产出的智能节点。长期以来PUE一直是衡量数据中心能效的核心指标之一。它是数据中心总能耗与IT设备能耗之比数值越接近1说明用于制冷、供配电等辅助设施的能源占比越低更多电力真正进入了服务器。进入AI时代PUE的重要性并没有下降反而变得更加突出。大模型训练、推理和智能体调用持续推高算力需求而数据中心能够获得的总供电容量往往存在上限。此时每减少一部分制冷和供配电损耗就意味着可以为GPU释放出更多功率空间。但PUE只能回答“有多少电进入了IT设备”还不能回答这些电最终产出了多少有效智能。因此百度提出衡量它先进性的标尺关键还要看每瓦能跑出多少Token。那么数据中心的能耗与Token效率之间怎么转化PUE与Token产出之间存在一层直接的功率转换关系。在同等条件下PUE降低10%最终输出的Tokens能增加11.1%。换句话说在传统数据中心里降低PUE主要是一笔节能账AIDC里它同时也是一笔产能账。为了实现每度电更多Token产出全球巨头们也在为了电力、冷却、选址去重构基础设施布局。如微软签约三里岛核电站20年是为了锁定基荷电源保障Token连续产出。xAI在孟菲斯建20万卡全液冷集群说明散热决定能不能装、能不能跑满。Meta在北极圈建数据中心因为自然冷却等于免费释放热边界。中国推东数西算训练去西部、推理留东部因为能源成本直接决定Token成本。而一旦“每瓦Token”成为核心指标所有技术动作都有了统一的标尺。也正是在这个标尺上百度智能云围绕“每瓦Token产出”形成了一套贯穿AIDC建设与运行的系统方案。比如在供电层百度自研瀚海800V直流电源将端到端电力传输效率从传统的80%-85%提升至90%在GW级体量下相当于节省一座中型电站。储能的角色也在改变。传统数据中心的电池主要用于断电备份是一种低频应急资产但在吉瓦级AIDC中GPU负载可能在毫秒级剧烈波动需要储能高频参与功率调节。当前行业正在探索“储备一体”即在保障备电安全的同时承担一定的削峰填谷功能百度智能云也在推进相关研究。另外制冷层则采用风液兼容架构可满足未来单机柜600kW超高功率密度制冷需求同时兼容风冷与液冷服务器部署灵活应对芯片供应链不确定性实现数据中心向液冷架构的平滑演进。网络层则以“网络向心布局”替代传统供配电中心布局最大限度缩短计算节点与网络节点的距离提升集群算力利用率交付层则通过工厂预制化与现场并行施工实现3.2万卡集群4个月极速交付。这套系统级的全栈能力构成了百度在AI算力基础设施领域的核心竞争力不仅有卡更能将每一度电高效转化为有效算力。AI云的全栈协同最贵也最难吉瓦级AIDC时代对系统级能力的考验来到了一个新高度。想要做好算电协同要跨部门、跨行业、跨市场的系统协同。它也不是一日之功需要在真实项目里把电力、网络、散热、调度磨合出来这对于任何一个云厂商来说都是巨大的挑战。这也是为什么今天能拿出吉瓦级AIDC建设能力和三万卡国产集群交付记录的厂商值得被认真对待它证明的不是“我有资源”而是“我把系统真的跑通了”。百度智能云就是目前国内云厂商中首个把这套系统跑通了的玩家。放眼整个行业他们最先意识到这件事的重要性并提出了系统性的解决方案并率先在这个方向做出了突破。就像前文所说百度智能云从供电、制冷、储能、网络、交付等多个层面已经完成了从传统IDC向新时代吉瓦级AIDC的变革。在这个体系里百度自研的昆仑芯P800完成规模化交付并直接用于训练文心5.1重要版本的训练超节点产品天池256超节点相比上一代吞吐性能提升了25%。单点的算力再强也需要整体的集群优化同样的GPU功率如果网络拓扑设计得好数万乃至数十万张芯片间的通信延迟低GPU就不会“空等”。围绕这一瓶颈百度智能云将集群网络由单口400G接入升级为双口400G冗余接入并通过多平面架构增强故障容错能力同时采用全二层组网方案将端到端时延优化50%。升级后的高性能网络HPN 5.0架构可以支撑从数十万卡向百万卡规模演进让更多芯片能够在同一集群中高效协同减少算力因通信等待而产生的损耗。同时如果模型并行策略优化得好大规模集群的扩展效率就高如果推理做了量化压缩、投机解码单次请求的算力消耗就更少。于是在数据中心之上百度智能云全面升级了面向大规模智能体应用的新一代全栈AI云AI Infra与Agent Infra两层同步提速。未来AI产业的大部分算力消耗将来自推理和智能体调用。在推理层面百度百舸AI计算平台通过分层池化架构将KV Cache命中率提升至90%以上搭配AFD分离、PD分离等深度优化长链路Agent推理性能较主流开源引擎提升3倍。可以看到从底层的国产算力芯片昆仑芯到吉瓦级AIDC建设的全自研、全优化再到云平台的百度百舸、百度千帆以及最终落到AI应用层的百度搭子等智能体产品百度智能云已经实现了从芯片到云平台再到AI应用端到端打通。这几条线拼起来对应的不是某一个产品而是从芯、云、模、体的全栈AI云架构出发打造AIDC的系统级全栈AI算力建设能力——它懂AI负载自己跑大模型、跑搜索、跑智能体也有云入口还能把供电/制冷/网络/储能/调度这一整盘和AI负载一起设计。这种贯穿全栈的协同也将直接影响AI长期运行的能源效率和成本。显然这是“拼装型”云厂商做不到的。相关数据显示在中国自研GPU云市场百度智能云以40.4%的市场份额位居第一在算力规模、产品能力和重点行业落地方面形成明显领先优势。财报数据更加清晰今年第一季度百度智能云AI云收入同比增长79%其中GPU云收入同比增长184%增速持续攀升。而这也是众多行业客户为百度智能云买单的关键原因之一。2026年上半年百度智能云AI云中标金额14亿元、位居第一。在统计的五家主要厂商中占比超60%断层领先。据IDC数据显示百度智能云以29.55%的市场份额位居第一持续领跑中国具身智能云市场。百度智能云的客户覆盖中国联通、中国银联、中汽创智等头部机构集中在金融、通信、大交通、具身智能等商业化门槛最高、对供应商要求最严苛的行业。走出WAIC展馆热闹终会散去。但AI产业真正要回答的问题不会因为展会结束而消失。当大模型参数从千亿走向万亿当智能体从实验室走向千行百业当AI应用从“能用”走向“好用”支撑这一切的不是某一块更强的芯片而是能把电力、算力、网络、制冷、储能和调度协同起来的新型AIDC。这个转变正在重新定义AI基础设施的竞争格局。WAIC上机器人跳舞很精彩但别忘了它们背后那座看不见的新时代的吉瓦级AIDC才是决定AI能走多远的真正战场。