刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

📅 2026/8/3 20:52:05
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude
就在刚刚阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。用四个字概括就是「能打」「便宜」。总参数量达到2.4万亿在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。不er你告诉我现在搁哪儿还有便宜还好用的模型啊……真心发问.jpg)说时迟那时快友友们这不就来了嘛就在刚刚阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。用四个字概括就是「能打」「便宜」。总参数量达到2.4万亿在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。就在今天最新放榜的权威第三方榜单Arena中Qwen3.8-Max更是一路冲到全球大模型第一梯队表现直逼Anthropic的Claude系列模型△Text Arena文本能力榜单包含数学、代码、创业写作等领域在编程表现上Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本确实有亿点不简单△编程能力前端榜单考察多步骤推理及工具调用的编程智能体能力等性能能打是一方面关键是吧人家连价格也一块打了下来——国内每百万Tokens输入12元、输出36元隐式缓存命中仅1.5元输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。性价比高能力还强那还了得瞧嘛此前抢先体验Qwen3.8-Max预览版的网友已经火速交上第一批实测反馈看下面这位老哥直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》直言价格很合适一周使用下来额度消耗不到九成赞还有网友只用一条提示词就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集最后给出的评价也相当言简意赅《夯》哦对了还有一堆网友们已经针对模型「超能打」的表现开始聊得火热朝天了下面这位友友表示已经迫不及待想把Qwen3.8-Max用起来了顺便还不忘祝A社、O社IPO好运夺笋啊下面这位网友还提到Qwen3.8-Max基准测试都把5.6-Sol给KO了大家对A社和OpenAI的期待恐怕也得跟着变——毕竟又贵又闭源门槛确实摆在那儿......还有朋友实测后感慨Qwen3.8-Max的表现甚至超过了Fable 5这波能力属实有点超出预期了奥真·有口皆碑了也是。既然Qwen3.8-Max来都来了我们也直接实测一波看看模型到底能不能打编程、专业工作、长程任务、多模态分析统统梭哈说实话阿里Qwen的前几代模型我几乎是发了一个测一个零零散散测下来最大的感受就是——确实夯也确实能打……而这次到了Qwen3.8-Max感觉又不一样了因为面对真实世界里的复杂问题这模型已经能一路拆解、执行直到交付最终成果了。在具体评测表现中Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5在编程、终端Agent和专业工作也稳居行业头部——贴心的我也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力让大家一睹为快编程能力能把复杂任务端到端地自主交付理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是它能从一个空文件夹出发、在无人干预下自主推进十多天最终交付一个真实可用的完整项目。长线程任务具备系统级自主规划与执行能力在数千轮超长程交互里也不迷失目标。专业工作能一次交付需要返修3到5轮的APP原型也能在一小时内处理数百份法律文档完成上千个条款标注。多模态智能体几百页的复杂材料、上百小时的视频内容都能消化还能顺手整理成直接可用的成果。我如此之能干如此之务实还有这好事儿那我可就直接狠狠一个大测特测Vibe一下编程能力大考验既然Qwen3.8-Max如此擅长AI Coding那我们直接上来就考察一下这模型的「编程本事」。好巧不巧的是最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚做成一份能给领导交差的分享。这下好了我索性把这事儿交给Qwen3.8-Max鬼点子生成中不过光用一句提示词搭个网页多少有点太简单了于是乎——我直接化身产品经理喂给了Qwen3.8-Max整整一大页产品需求让它「从零」开发一个可运行的AI资讯网页。在具体需求上我不仅明确要求了网页需要具备的核心功能还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束主打一个狠狠刁难大概过了5分钟。我的这位产品经理Qwen3.8-Max就直接给我端上来了一份接近正式产品交付水准的全链路解决成果——整个交付过程页面我从头拉到尾说实话确实有点让我震惊。需求拆解、技术选型、项目结构、功能实现该有的环节一个没落完全是一套真实项目从开发到交付的完整流程。然后我再定眼一看发现Qwen3.8-Max还专门整理了一份「问题与解决记录」开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的它全给列得明明白白。而作为提出需求的那个人我真的全程一次手都没插甚至直到看见这份记录我才知道中间居然还冒出过这么多麻烦不是我说这模型是真·有问题自己解决啊Qwen3.8-Max事情交给我您放心哈此外在检查模型作业的过程中我又发现了点我属实没料到的东西……Qwen3.8-Max在交付前还给整个项目来了一轮正儿八经的「功能验收」从安装依赖、本地启动到生产构建和预览它把项目能不能跑起来逐项过了一遍。甚至连数据量、分类覆盖范围、搜索清空后的页面恢复它都一项项列进了验收清单最后统一打上「通过」。别说整个从零搭建项目的全过程真有点真实工程内味儿了be like真的就几分钟。我写下的一整页产品需求就这么被Qwen3.8-Max直接交付成了一个能跑的项目。我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页没有报错也没有哪项功能突然掉链子。页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样交互也没有问题原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程就这么全让模型一个人干了。我只想说Qwen3.8-Max你这是真·端到端啊……长长长长文本分析也来探一探能搞定编程项目的全流程交付确实不亿般。But在日常学习工作场景中我们很多时候未必有那么多需要Coding的场合。很多时候真正想让我们口吐芬芳的反倒是一些《蛮基础》的工作场景就比如啊——长文本分析。doge估计有友友该说了这有啥难的啊直接喂给AI资料然后坐享其成得了呗单纯的文本分析当然不难but让AI对几十页复杂文档进行「交叉分析」那事情就不一样了。之前我就喂给过GPT一份包含几十页的技术文档让AI总结内容还行但涉及跨章节、细节对比的事儿就宕机了…于是灵机一动的我这回也给Qwen3.8-Max上点难度。这次我喂给它的是AI大神卡帕西参与撰写的一篇几十页的论文正文、图表、附录一个不少。这篇论文复盘了2010—2014年ImageNet大赛讲清楚AI看图能力是怎么一步步逼近人类的以及这背后数据、算法和评测规则各自起了多大的作用。而我向AI发起的问题是论文拿ILSVRC和PASCAL VOC这两套“AI看图考卷”做了比较结合正文、表3和附录B的图16来看哪套题更难为什么看平均值和看困难类别会得到不同答案这个题难就难在AI光搜关键词还真答不了因为答案散落在正文、表格、图表和附录里AI得把几组数据全部对上并且进行交叉分析得出结论才行。大概33秒的时间Qwen3.8-Max就直接给了我一个明确答案——只看整体平均值PASCAL VOC似乎更难但看可比类别和ILSVRC的困难子集ILSVRC在很多方面并不比 PASCAL VOC简单甚至更难。为了确认这份回答是否准确我又对照原文的表3、图16和附录B逐一定位发现这AI确实说的是「对的」——比如在原论文中图16上排比较全部1000个ILSVRC类别下排则筛出随机定位成功率最低的200个类别。可以看到进入困难子集后ILSVRC在多项定位难度指标上确实已经接近或超过PASCALAI说的完全正确哪怕是在几十页文档资料里对跨章节内容进行图标图片和文字的联合分析也没难倒这个AI此外Qwen3.8-Max为了告诉我它为什么得出这样的结论还给我生成了一篇超有理有据的「分析报告」。从物体大小、位置变化、定位难度、画面杂乱度几个维度对ILSVRC和PASCAL VOC两套考卷进行了分析。哦对了它还把原文中的表格直接1:1单拎出来作为证据定位找得那叫个《稳准狠》……我只能说还在苦啃论文、资料文档的友友们这下我们的好日子可能真的要来了。。。多模态内容理解任务也安排上上面两轮实测说到底考察的主要还是Qwen3.8-Max对文本的分析、理解和执行能力。但我们的日常学习工作里还有一块更难啃、也非常刚需的硬骨头场景多模态内容分析。对AI来说理解某一个画面或者总结一个视频内容确实不是难事儿。真正麻烦的是当素材被拉长到几十分钟甚至几小时它还能不能理清其中的人物、事件和观点关系并根据一个具体问题精准定位到原片段。于是这次我直接把手头一个亟待处理的「实录烂摊子」交给了Qwen3.8-Max——一期接近70分钟的视频播客在播客里山姆·奥特曼从AI创业一路聊到OpenAI战略和未来社会话题多、跨度大想从头捋清楚并定位原片段少说也得折腾半天。△播客来源「Relentless」Youtube账号对此我交代给Qwen3.8-Max的任务也可以说非常复杂艰巨——请为这期播客生成一份完整的主题时间轴并按「话题观点」定位原始片段。对于AI来说这不仅要求它能准确识别人物、事件与观点之间的关联关系还要能重建整期播客的叙事结构并把每个观点精准映射回原始片段。大概也就两三分钟Qwen3.8-Max就给我吐出来了一份按照核心观点划分的播客内容。更贴心的是每个话题都采用「先总结、再展开」的结构前面提炼核心观点后面逐段捋清具体内容还一一标出了对应的时间戳对我来说最大的好处嘛那就是看到哪段感兴趣直接点进原视频精准空降就行简直不要太太太太方便好用是真的用得起也是真的哪怕AI Coding发展到今天海外主流模型三天两头迭代得飞起。我们依旧不得不承认一个事实落到用户的实际体验里似乎始终很难真正做到「既要、又要、还要」。换句话说模型能力、场景覆盖和价格这三件事儿似乎总不能同时兼得。Coding能力很能打到了其他场景里交付效果却未必同样稳定就算效果足够好价格也经常让人望而却步各种Plan和Token费用长期用下来确实烧不起。但这次实测完Qwen3.8-Max我可能得重新下一个结论那就是全球头部模型——也是能用得爽还用得起的。每百万Tokens输入12元、输出36元隐式缓存命中仅1.5元输入和输出价格真的只有Opus 5的40%和24%。这意味着大家不用承担高昂的Token费用也能获得高性能模型带来的完整体验。而在真实场景中Qwen3.8-Max所完成的工作也早已超出「生成」这一步。它真的可以从零开始帮我推进一项完整工程再把过程中冒出来的实际问题一个个解决掉最终把能运行、能检查的成果交到我手里。这种兼顾放眼整个模型圈里都算得上稀缺。而Qwen之所以敢把能力、场景和价格一起next level实际上背后靠的也远不止一款Max模型。从2023年开源至今阿里已经累计开源400多个模型衍生模型已经超过20万个累计下载量突破10亿次一路下来Qwen也成为了全球规模最大、覆盖最全的开源大模型家族。更值得注意的是Qwen这条更新进度条过去一年几乎就没停过。从Qwen3到Qwen3.5再到如今的Qwen3.8几乎每一次迭代都对应着一批新场景真正变得可用——从基础推理延伸到编程、专业工作、多模态理解、长程Agent再到这次的端到端交付。这种日拱一卒的节奏放眼全球也没几家跟得上。于是我们或许真的可以下一个结论。那就是真正「好用」的模型未必一定昂贵真正「便宜」的模型也未必需要在能力上做取舍。而Qwen3.8-Max恰好把这两件事放在了一起。对了。目前Qwen3.8的API已上线千问AI平台还接入了阿里今日同步推出的Agent产品「千问办公」感兴趣的朋友不妨直接上手试试