Qwen 3.8 max干了20分钟没干完,免费模型3分17秒搞定,问题出在哪? 📅 2026/8/9 9:47:16 大家好我是老刘前两天老刘花了一杯咖啡的钱买了千问token plan的最低档准备测试一下Qwen 3.8 max在我的Flutter项目里能不能当主力。任务很简单我已经开发完了三个独立的数据处理和业务逻辑模块现在只需要把它们接入主流程让主流程能调用它们。就这么个活儿Qwen 3.8 max干了20分钟直接把我的5小时额度烧光了然后工作还没完成。停在了一半的地方。我换成opencode的免费模型同样的任务3分17秒顺利完成。不可思议是不是这完全不是一个对标顶级模型应该有的表现。今天老刘就来聊聊这20分钟里到底发生了什么以及我们选主力模型时最容易踩的那个坑。先说句公道话Qwen 3.8 max的跑分是真能打这里要先说明白老刘说的测评数据不是那种公开题目可以刷榜的测评。那种测评我基本已经不看了因为吃过几次亏评分很高但实际工作能力很差。我现在主要看题目不公开的比如LiveBench。Qwen 3.8 max在这类测评中得分很高说明真实能力还是可圈可点的。可以看到Qwen 3.8 max的综合能力仅次于claude fable 5和gpt-5.6这样的顶级模型。单看编程能力也非常好闭源题目的测评具有比较高的参考意义在一定程度上能体现模型在指定科目上的泛化能力。但要注意这个是参考价值因为测评和真实项目之间还是存在着比较大的差异的。跑分为啥救不了你的项目场景对不上老刘主要写Flutter代码但目前主流编程能力测评里基本没有用Flutter的。你拿一个考Python和Web的分数去预测它写Flutter的水平这就像拿驾照科目一的成绩去判断一个人会不会开山路。用法对不上老刘的日常开发流程是这样的先用顶级模型把一个需求拆成多个功能点再用中档的主力模型逐个开发每个功能点的代码。这个用法其实介于LiveBench的coding和agentic coding之间。也就是说我这个功能点的开发用测评里的哪个维度去选模型都不合适。即使用平均分偏差也很大。所以测评的分数主要还是一个参考最终还是要放到项目里实际跑一跑。老刘这次就是真刀真枪地跑了。Qwen 3.8 max还是是干活太认真了如果用一个字总结Qwen 3.8 max在我项目里的表现就是啰嗦。看它的思考过程就能发现问题思考链路特别长如果每一轮都把上一轮的思考加入输入token很快就消耗光了。这一点从LiveBench的性价比排名中也能得到印证单看简单编程的性价比Qwen 3.8 max的排名并不靠前。所以老刘的结论是Qwen 3.8 max的能力确实不错但代价是需要消耗大量的token才能完成同样的任务。这就好比招了一个能力很强的员工但他干一个小时的活儿要烧别人一天的工资。从测评看它在逻辑思考、数据处理等方面的性价比明显比编程方面高。让它当编程主力可能属于专业不对口。有意思的是当前这篇文章的错字修改、排版优化、文章头尾固定内容的添加、发布到github等工作都是老刘用token plan中仅剩的额度通过Qwen 3.8 max完成的。总体消耗远小于开发任务。这也从侧面证明了老刘的观点Qwen 3.8 max似乎更适合非编程类任务。一杯咖啡的钱买了个教训说实话这次测试老刘自己也有点尴尬。我买这个最低档的token plan本来是想横向测试一下各家订阅哪个更好用后续也会给大家汇报其他厂商订阅的使用效果。结果千问这边第一轮长对话还没跑完额度就阵亡了。这里还是要吐槽一句虽然最低档只要一杯咖啡的钱但如果5小时的限额连一轮长对话都无法完成那它在实际工作中就没有任何意义。特别是在agnes、商汤、Openrouter、opencode等很多厂商都提供了慷慨的免费额度的时候这种低档位订阅完全不具备在开发场景中的实用价值。最后说两句这次翻车让老刘更加确信一件事跑分是给外人看的账单是给自己看的。选主力模型的时候除了要看榜单的能力排名还要看一看完成每个任务需要花多少钱。把这个问题想清楚了再去看跑分顺序千万别反了。最后老刘也想问问大家你有没有被跑分骗过你现在选主力模型最看重的是什么欢迎评论区聊聊。 如果看到这里的同学对客户端或者Flutter开发感兴趣欢迎联系老刘我们互相学习。 私信免费领老刘整理的《Flutter开发手册》覆盖90%应用开发场景。可以作为Flutter学习的知识地图。 : laoliu_dev 老刘也把自己历史文章整理在GitHub仓库里方便大家查阅。 https://github.com/lzt-code/blog