阿里把顶配 AI 大脑开源了,它还自己给自己写了 16 天代码

📅 2026/8/5 6:17:32
阿里把顶配 AI 大脑开源了,它还自己给自己写了 16 天代码
你印象里的开源大模型可能是够用就行的平价替代。8 月 3 日阿里正式发布 Qwen 家族最高一档的旗舰 Max 版并宣布下周开源权重——这个对标 Claude、GPT 顶配的模型API 价格只有对手的几分之一。更扎心的是一个真实案例它连续 16 天自己给自己写代码、派任务、审 PR全程没有人插手。7 月 19 日阿里在上海世界 AI 大会上第一次亮出 Qwen3.8-Max 的预览版那时候只说了一句仅次于 Claude Fable 5没给数据。两周过去正式版带着完整的测评表格、正式定价和一个让程序员后背发凉的真实案例一起来了。还有一个信号被很多人忽略了阿里第一次宣布要开源 Max 级别的权重下周就放。以前开源的都是够用的中小杯这次要开源的是那个对标 Claude 最贵旗舰的超大杯。发生了什么三个没人帮忙的真实案例这次最值得看的不是又一个刷榜分数而是 Qwen 官方放出的三个长任务案例——全程零人工介入每个结果都要靠模型自己真的去写代码、跑代码、改代码才能挣到。案例一AI 连续 16 天自己建了一个软件项目。阿里让 Qwen3.8-Max 从零开始搭建一个叫oh-my-cli的命令行工具。关键在于——没人帮忙。它自己把用户反馈变成 GitHub Issue自己认领任务自己写代码自己跑测试自己合并 PR。整套流程跑下来截至 7 月 30 日连续自主运转约 16 天仓库里积累了265 次提交、127 个合并请求、151 个 Issue。这不是 AI 帮你补一个函数。这是 AI 自己当产品经理、当程序员、当测试、当代码审查员把一个项目从空文件夹跑到能交付。案例二5 天复现一篇论文还顺手超越了原方法。阿里给了它一篇关于大模型训练数据筛选的论文要求是先复现实验再想办法超过原作者。它从只有论文和一堆 GPU 开始——没有现成代码。用了大约 5 天累计约 125 小时自己写了7600 行代码跑了33 轮 GPU 训练先花 37 小时完整复现了论文的六个核心结论又花 88 小时进入自己提假设→写代码→跑实验→分析→再试的循环试了 18 个改进点子最后在竞赛级数学基准 AIME24 上比原论文方法高出 2.7 个百分点从约 49.6% 提升到 52.3%——在数学竞赛题里这是肉眼可见的差距。案例三24 小时打赢 87% 的人类参赛队。天池平台上一场多模态对话识别比赛526 支人类队伍参赛。Qwen3.8-Max 在 24 小时内独立完成方案自己微调了 BERT、RoBERTa、Qwen2.5-VL 等好几个模型自己搭了一套加权投票系统。45 次提交后准确率从 0.60 爬到 0.853——赢了 458 支人类队伍超过 87% 的参赛队伍。为什么值得关注模型值钱的部分正在变成免费最高一档的旗舰要开源了以前开源的模型和闭源旗舰之间总差着一代。这道坎正在被填平。阿里这次要开源的是 Max 级——自家能力档位里最高那一档对标的是 Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 这一层的顶配大脑。以前只能按 token 付费调用下周可以自己下载、自己部署。当你可以用自己的 GPU 部署一个接近顶配的模型时闭源 API 的高溢价就很难守住了。调用成本只要对手的几分之一就算你不自己部署只走 API价格也已经被打下来了。Qwen3.8-Max 的 API 定价输入 2 美元 / 百万 token输出 6 美元 / 百万 token。作为参照Anthropic 最新一代的 Claude Opus 5与上一代 Opus 4.8 同价是输入 5 美元、输出 25 美元。粗算下来Qwen 的输入价格是对方的 40%输出价格是对方的 24%——输出成本低出整整一个数量级。对中小团队和独立开发者来说这意味着用不到四分之一的钱就能拿到接近顶配的能力。这不是够用就行的平价替代是旗舰能力的平价通道。当最高一档的模型变成基础设施真正的壁垒就不再是模型本身而是你能不能用它把一件真实的事做完。对普通人、程序员、创业者意味着什么对程序员AI 不只写代码了它开始自己管项目那个 16 天自主编码的案例真正的信号不是AI 写代码更快了——这件事你早就知道了。信号是AI 开始自己做那些你以为只有你才需要操心的决策。什么时候开新 Issue、先做哪个、测试不过要不要回滚、PR 达标了该不该合并。一个初级程序员日常干的活它已经能闭环跑完了。当然要诚实说这些案例都来自官方自己的展示第三方独立复现还没出现。但 oh-my-cli 这个仓库是公开的任何人可以去 GitHub 上查看每一次提交——它至少让这个能力从宣传片变成了可检查的作业。对创业者和选型者旗舰能力正在变成水电煤你以前不用顶级模型不是因为不需要是因为贵。现在有两件事在同时发生第一能力档位追到了第一梯队阿里自己的测评里多个编码和智能体项目与 Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 互有胜负不过这是官方数据第三方独立测评还没出来第二价格打到对手几分之一下周还能自己部署。模型本身正在快速变成基础设施这个速度比大多数公司调整预算的速度还快。谁先用这套廉价旗舰能力把一个真实的业务流程跑通谁就先拿到红利。对普通职场人你得开始问AI 替不了我什么阿里官方还晒了一组跨职业的案例法律合规、UI 设计、餐饮菜单开发、结构工程、运动数据分析……每个都是以前要团队做几周的活现在一次交付。你可以对这些展示打一个折扣——官方案例总是挑最好看的。但方向感是清楚的能被标准化成多步骤、有明确验收标准的工作正在被 AI 闭环接管。反过来想真正难被替代的是那些需要你去判断这件事值不值得做这个客户值不值得跟的决策——AI 能帮你算得更快但替不了你拍板。现在可以怎么做想直接试能力Qwen Studiochat.qwen.ai已经可以免费用 Qwen3.8-Max 对话先拿你的真实工作任务跑一遍别只看排行榜。想接 API阿里云百炼 / QwenCloud 已开放OpenAI 兼容改个模型 ID 就能切过来先用小流量 A/B 测试别急着全量替换。想自己部署等下周权重放出后再评估。2.4T 总参数是数据中心级别的中小团队更现实的选择是同步开源的 Qwen3.8-27B那个能塞进普通显卡。想判断趋势盯一个指标——第三方独立测评机构如 Artificial Analysis的横向对比什么时候出来。官方分数总是挑最好看的第三方分数出来才是真正的起跑线。结语Qwen3.8-Max 这次的真正看点不是又一个国产模型冲上榜。是阿里把旗舰最贵闭源这套逻辑撬松了——最高一档的模型也要开源了调一次还只要对手几分之一的钱。再加上那个 16 天自己写完一个项目的案例它在提醒所有人一件事AI 不只是帮你写代码的工具了它正在变成能自己接管一个完整项目的同事。