【AI大模型】235B参数,119种语言,Qwen3却连“Strawberrrrry“都数不清?

📅 2026/8/27 14:37:30
【AI大模型】235B参数,119种语言,Qwen3却连“Strawberrrrry“都数不清?
介绍终于千呼万唤中Qwen 3 登场了。这次发布了2 个 MoE 模型6 个 稠密dense模型从0.6B到235B所有的尺寸都集全了。它们最顶尖的模型Qwen3-235B-A22B在 benchmark 上的表现达到了业界顶尖的水平与 DeepSeek-R1Gemini-2.5-Pro, Grok-3 水平相当。小模型方面即使是Qwen3-4B的水平也基本超过了前一代的Qwen2.5-72B。详细的跑分成绩可以参考如下两张图还有一些关键的特点Qwen 3 支持混合思考模式来解决问题如果问题需要很复杂的思考则模型会通过思考模式进行深度思考后再回答。如果问题相对比较简单则模型会快速回答。和 Claude 3-7 Sonnet Gemini 2.5 Flash 实现的类似多语言的支持 Qwen 3 支持 多达119 种语言Qwen 3 不仅代码推理方面的能力得到增强对 MCP 支持也进一步得到优化。下面分享一些测试 case对开启thinking 模式和关闭 thinking 模式都做了对比 测试推理能力Prompt一头被 10 米绳子拴住的老虎要如何吃到 20 米外的草典型的thinking 模式下出现了过度思考的问题。查看 thinking 的过程是可以发现模型其实考虑到“老虎不吃草”这一点但是最后仍然没回答出来。PromptStrawberrrrry 有几个r既然现在的模型能够正确回答“Strawberry有几个 r”这种问题那我多加几个 r 试试呢两种模式下模型都回答错了。感觉模型还是在背题特别是我故意把“strawberry”这个词打错它就分辨不出来了,它列举的时候都列举少了一个“r”。Prompt最小整数的平方在 15 到 30 之间这个最小整数是几终于有一个测试是在thinking 模式下回答正确非 thinking 模式下回答错误的。正确答案是-5。 这个题目其实还是有难度的测试过很多模型哪怕是深度思考模型也未必都能回答对。Prompt一个长五点五米的竹竿能否穿过一扇高四米宽三米的门请考虑立体几何这里可以看到对于这道非常经典的问题thinking 模式下是回答正确了但是非 thinking 模式下回答错误的。说明开启 thinking 模式对做难题还是有用的。代码能力先做一题经典的小球测试Prompt使用 p5.js无需 HTML创建 10 个彩色球在旋转六边形内弹跳的效果考虑重力弹性摩擦和碰撞。一眼看的出thinking 模式下的效果会更好。但是 这个效果吧确实也一言难尽。整体的效果我觉得甚至不如之前出的豆包Doubao-1.5-thinking-pro**。**我把豆包的测试效果放在下面了可以对比一下看看Prompt创建一个贪吃蛇的网页游戏实现玩家控制游戏。在游戏过程中屏幕上需要清晰地显示玩家当前得分。这个 case 表现的非常差贪吃蛇的游戏是玩不了的水准。我把同样测试过的Doubao-1.5-thinking-pro的效果放在下面可以对比看看基本是被豆包爆杀的状态。Prompt在单个 HTML 文件中创建一个视觉效果惊艳的吃豆人游戏。先说结论thinking 模式明显比非 thinking 模式好但确实也好的有限存在很明显的bug。我在这个 case 里同样也拿豆包进行对比测试了一下同样是 thinking 模型明显豆包这个效果好太多至少没有出现“能够穿墙而过”这种明显的错误而且积分板摆放的位置也更加合理。Prompt创建一个梦幻的低多边形漂浮岛屿场景包含动态照明和柔和的动画效果并将其整合在一个单独的HTML文件中。这个 case 里我先说结论Qwen3-235B-A22B在豆包和 DeepSeek-V3 的比较中完败。先放Qwen3-235B-A22B的结果对没错纯纯两张什么都没有的图片。再来看豆包的。然后是 DeepSeek 的看到这个 case 真的不得不感叹一句DeepSeek 还是太强了越来越期待 R2的到来。MCP 调用测试现在 MCP 越来越火但是大家可能潜意识里都认为所有模型调用 MCP 的效果是一样的但其实不然。而且这次 Qwen 3 又特意增强了模型 agent 的能力。所以我也在 chatwise 上配置了 MiniMAX 和 Exa Search 的服务来简单测试下 Qwen3 。Prompt请分析Sam Altman和Logan Kilpatrick在XTwitter上的15条最新推文。创建一份全面报告重点突出这些推文中提到的OpenAI和Google的重要发展。将这些信息以交互式HTML页面的形式呈现包含数据可视化并嵌入一段讨论主要发现的音频摘要。能够正确判断调用哪些工具然后完成要求这方面其实比我之前测试 DeepSeek 感觉要好一些。除了界面写的确实有点丑陋也没啥毛病。当然也可以说我的提示词写的很烂写在最后本文着重探讨测试了 Qwen 3 的最新发布以及对它的旗舰模型进行了测试。从测试感受来看我个人认为没有说的那么厉害。大家在应用到实际业务的时候还是要谨慎选择呀当然测试存在着一定的偏差所以这个测试并不能完全说明 Qwen 3 的真实水平。希望大家有机会也可以去多测试一下呀最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】