AI竞争的下半场:从模型能力走向基础设施与现实世界

📅 2026/8/11 6:30:52
AI竞争的下半场:从模型能力走向基础设施与现实世界
模型没死但已经不重要了上周我干了件蠢事。让三个AI Agent同时复现一篇ICML 2026的论文。OpenAI那个跑了一半告诉我额度用完了账单20美元。DeepSeek那个花了2美分就跑完了结果全是错的。还有一个开源的跑是跑完了结果也对但中间断线了三次每次得我手动重连。慢慢的我就想清楚了一个事儿我们现在根本不是在比谁更聪明。跑分时代已经过去了GPT-5.6 Sol发布了OpenAI说它同时管即时回答和深度推理Plus和Pro用户能用免费用户也能不限量地用Luna聊天。你看连OpenAI都不再强调“我比5.5强了多少分”了。以前一个模型出来大家第一件事是查MMLU、GSM-8K、HumanEval。现在呢没人关心了。因为GPT-4级别的能力已经遍地都是免费用户都能随便用。模型从“奢侈品”变成了“自来水”——谁家水龙头出水快、水流稳、不突然停水才是关键。OpenAI想明白了与其让大家抢着用Pro不如把基础版放开把人留住然后靠工具调用、生态绑定、响应速度赚钱。这跟Google当年把搜索做成免费的逻辑一模一样。DeepSeek的尴尬V4-Flash发布的时候大家都觉得“国产之光又来炸场了”价格低到离谱。结果没几天平台说API要涨价涨幅不小。OpenCode团队有个人说了句大实话他们拿租赁GPU算了一下DeepSeek现在的定价自己也能做出来。涨价可能真不是成本问题是服务被挤爆了只能靠价格赶人。这就是低价策略的代价。你卖得越便宜Agent调用得越疯狂——Coding Agent跑一次任务几十万Token连续几十分钟不间断。你以为是好事峰值流量一来机房扛不住调度崩了用户全在骂。价格战谁都会打但价格打完了还能把服务稳住那才是真本事。DeepSeek现在卡在中间便宜是便宜了但便宜带来的用户量它接不住。涨价吧口碑受损不涨吧服务瘫痪。这个问题比模型跑分难搞一百倍。Google选了一条更聪明的路Demis Hassabis去当董事长和首席科学家了不管日常了。很多人觉得这是“升职”我倒觉得这是Google在Chat产品上认输了——反正追不上OpenAI和Anthropic干脆让Demis去搞他真正擅长的东西科学。Google DeepMind一直以来的差异化从来不是聊天聊得多好而是AlphaFold、数学推理、药物研发。这些东西有明确的对错标准——蛋白质结构预测得准不准实验能不能复现结果是客观的不需要用户打分。WeatherNext就是个典型。气旋路径预测比原来多争取了24小时预警时间。24小时是什么概念你ChatGPT回答快一秒用户感觉不出来。但气象预警多一天可能意味着几千人的疏散、几亿的物资调动。这个价值不需要吹算得出来。而且Google还把代码和权重都开源了让各国气象部门自己做本地化。这是在铺基础设施不是在抢用户。科研复现的那点事再说回HuggingFace那个AI Agent复现论文的事。这件事被很多人解读为“AI要取代科学家了”。别扯了。复现论文本质上是个体力活——配环境、调参数、跑代码、对结果。AI干这个确实在行而且不会因为熬夜而崩溃。但真正难的是两件事第一这个方向值不值得研究第二结果怎么解释这两件事AI现在还做不了。所以AI Agent在科研里的真实角色就是个超级实验员。人类提方向、定标准、解释意义AI负责把那些重复劳动干掉。科研不会因此“自动化”但迭代速度会快很多。这已经很了不起了。值得怀疑的那些“大饼”MatrAIx搞了个社会模拟号称能覆盖83亿虚拟角色。83亿听着就吓人。但你仔细想想就知道不可能——83亿个大模型Agent同时跑全地球的算力加起来都不够。它更可能是个统计学抽样系统按年龄、地区、职业生成一些虚拟样本用来做政策推演或者消费行为研究。这个方向本身有价值但千万别被“数字孪生地球”这类话术忽悠了。模型输出的东西来自训练数据训练数据有偏见出来的结果就是放大版的偏见。规模越大看起来越精确其实可能错得越离谱。NVIDIA的MotionBricks也是类似道理。35万段动作素材能生成动画也能控制机器人听着很酷。但它解决的是“基础动作怎么生成”解决不了“这个动作符不符合角色性格”或者“物理上到底能不能站稳”。动画师和机器人专家不会失业他们只是不用再调那些重复的骨骼绑定了。最后说两句每次AI有进展你就会看到一堆夸张的标题。“100倍速度提升”“完全不需要反向传播”“83亿人社会模拟”。别信。去看原文看它跟什么比的测试条件是什么代码开没开源第三方复现过没有。这些话说出来很扫兴但比记住一个跑分有用得多。