Kimi K3 登陆阿里云:2.8T 参数的开源模型,离闭源天花板还有多远?

📅 2026/8/24 14:52:24
Kimi K3 登陆阿里云:2.8T 参数的开源模型,离闭源天花板还有多远?
早上刷到一条消息阿里云上线了 Kimi K3。2.8T 参数、原生百万上下文、开源。三个词摆在一起说实话我愣了一下。2.8T 参数的开源模型——搁一年前这话说出来自己都不信。我第一反应是去翻技术文档。K3 不是月之暗面第一次放卫星但 2.8T 这个数字太扎眼了。之前开源模型最大也就到万亿级别K3 直接把天花板掀到了 3 万亿档。而且它不是在画饼——模型权重已经放了阿里云 Model Studio 上就能直接调还送了 100 万 token 的免费额度。有意思的是你仔细看 K3 的定位会发现它压根没想跟 GPT 和 Claude 比聊天。它瞄准的是三个场景仓库级代码工程、视觉创作、自主规划 agent。翻译成人话就是——它想干的是复杂活不是陪聊。2.8T 参数的 2.8T不是堆出来的先说说这个参数规模到底意味着什么。K3 是 MoE 架构总参数 2.8T但每个 token 只激活 104B。这个激活/总参数的比例大概在 1:27 左右——也就是用了 27 组专家每次只叫 1 组干活。相比之下DeepSeek-V4 的激活比例是 1:16总参数 1.2T激活 74BQwen3.8-27B 是 1:12总参数 27B 满激活。比例越大意味着模型储备的知识越多但推理成本可控。K3 把比例拉到 1:27是一个挺大胆的选择——这要求路由机制必须足够准不然叫错专家就是灾难。但 K3 真正值得聊的不是参数数量而是架构。它用了自研的 KDAKimi Delta Attention混合线性注意力机制。传统 Transformer 的注意力复杂度是 O(n²)上下文一长就扛不住。K3 的上下文窗口是 100 万 token——处理一本《三体》三部曲绰绰有余——如果还用传统注意力推理成本会爆炸。KDA 的思路是把注意力拆成两个部分一部分用线性注意力处理长距离依赖一部分用标准注意力处理局部精度。说白了就是远亲用快车道近邻用精确制导。这个思路在学术圈讨论了好几年K3 是第一个在 3T 参数规模上把它落地的。成本是另一个维度的突破参数说得再多不如看价格。根据交银国际的拆解报告K3 的单任务推理成本大约是 0.86 美元。对比一下GPT-5.6 Sol 单任务成本大概 3-5 美元Claude Opus 5 也在 4 美元以上。K3 的成本只有闭源模型的 1/4 到 1/5。你可能会说开源模型本来就便宜这不稀奇。但差别在于以前开源模型便宜是因为能力不够没人用。K3 在 Artificial Analysis 综合智能指数上拿了 57 分——GPT-5.6 Sol 是 59 分Claude Opus 5/Fable 5 是 60 分。差距不到 5%。换句话说K3 不是在低价卖劣质品而是在用 1/4 的价格提供 95% 的能力。而且别忘了——它是开源的。你可以下载权重自己部署也可以基于它做微调、做私有化。闭源模型再便宜也做不到这一点。开源模型走到哪一步了最近半年开源模型的发展速度肉眼可见地在加速。7 月 Kimi K3 发布技术报告8 月 Qwen3.8-27B 登顶 HuggingFace同月 DeepSeek-V4-Flash 正式版连续三周调用量全球第一。中国大模型周调用量已经连续十七周超过美国——不是一周两周的偶然是四个月的持续领先。但这里有个问题容易被忽略调用量领先不等于能力领先。OpenRouter 的调用量数据很大程度上受免费/低价 API驱动。中国模型价格低、开源多开发者拿来跑实验、做 demo 的成本几乎为零。美国模型调用量下滑可能不是因为它们变弱了而是因为太贵了——Claude 和 GPT 的 API 价格摆在那里小团队根本跑不起。K3 的出现让这个局面有了微妙的变化。以前开源和闭源的差距是能不能用——闭源能用开源凑合。现在 K3 把差距压缩到了差点意思在一些特定场景长代码理解、多步推理、视觉创作甚至有来有回。如果这个趋势继续明年这个时候开源模型可能真的会跟闭源站在同一道起跑线上。一个值得追问的问题看完 K3 的技术文档我脑子里冒出一个问题开源模型追上闭源到底是技术突破了还是闭源自己停下来了过去两年OpenAI 和 Anthropic 的迭代节奏明显在放缓。GPT-5.6 和 GPT-5.5 的差距不大Claude Opus 4 到 5 的提升也不像 GPT-3 到 GPT-4 那种跨越式的。不是说闭源不进步了而是边际收益在递减。当模型能力逼近某个临界点继续堆算力带来的提升越来越小。开源这边正好相反——底子薄起点低每一步提升都肉眼可见。加上 MoE、混合注意力、长上下文这些技术逐渐成熟开源模型正在用自己的方式逼近同一个天花板。你觉得这一步什么时候会跨过去或者说当开源真正追上闭源的那一天整个 AI 产业的游戏规则会怎么变