实测Qwen3.8‑Max编程能力:打破偏见,国产代码模型追上来了

📅 2026/8/6 10:43:16
实测Qwen3.8‑Max编程能力:打破偏见,国产代码模型追上来了
文章目录1 我本来真不想测这模型1.1 老印象害死人1.2 免费羊毛不薅白不薅2 先说清楚这次怎么比的2.1 三个前提免得抬杠2.2 三个测试场景3 三个场景跑下来水平到底咋样3.1 视频工作台功能打平细节超了3.2 票务系统真后端不是玩具Demo3.3 驾驶小游戏手感赢了颜值输了4 最让我意外的一点跑分表里根本看不到5 最后说句实在话P.S. 挖到宝藏AI教程全程通俗易懂风趣幽默零基础轻松入门 传送门https://blog.csdn.net/qq_344193121 我本来真不想测这模型1.1 老印象害死人说出来你们可能不信Qwen 3.8 Max发布那天我扫了一眼消息就划走了。没兴趣真的。我对Qwen编程能力的刻板印象少说也存了大半年。就像老家亲戚总觉得你在大城市吃不饱饭——印象焊死了更新不了。每次有人提Qwen写代码我心里都默默飘过一句就这久到我都忘了这印象到底是哪次测出来的。1.2 免费羊毛不薅白不薅本来这事就翻篇了直到我刷到Qoder一周年送免费调用。800次还不算登录送的300次新用户加起来1100次。哦免费的那没事了。程序员的原则是什么收费的我挑三拣四免费的我来者不拒。反正不要钱跑一遍试试也不吃亏。2 先说清楚这次怎么比的2.1 三个前提免得抬杠为了公平我也懒得搞新花样直接把上次测Kimi K3的三个场景原封不动搬过来。一样的考卷谁行谁不行跑一遍就知道。先说好三个前提免得后面有人杠我不公平。第一这次我把需求一次性说全了不像上次测K3是挤牙膏似的一轮轮加。相当于Qwen拿到的是完整题干这点它占了便宜后面说打平的时候你们自己心里打个折。第二这不是裸模型跑分是模型加自家IDE的工作流对比。Qwen配QoderKimi配Kimi Code都是全家桶上阵。说实话现在裸模型分数参考价值越来越小上班干活谁裸用模型啊第三这次没拿真实老项目测。800次调用刚好用完手头也没合适的私活要干。真实遗留系统能不能打这篇说不全。2.2 三个测试场景就三个场景都是实打实能跑的项目不是嘴炮题。一个对标剪映的纯前端视频工作台一个带完整后台的实时选座票务系统还有一个仿Drive Mad的物理驾驶小游戏。全程开YOLO模式我不插手装依赖、改代码、调环境它自己折腾。交付之后我亲手测所有功能。3 三个场景跑下来水平到底咋样3.1 视频工作台功能打平细节超了第一个场景视频工作台。素材库、多轨时间轴、片段预览、撤销重做、本地持久化该有的功能全列清楚了。跑下来结论功能层面和K3版打平该有的一个不少。但有两点超出预期。一是界面没那么浓的AI味。深色编辑器配色信息层级清楚不像有些AI生成的界面花里胡哨全是特效干活的时候晃眼睛。二是多了不少实用小功能轨道锁定静音、片段边缘精细修剪、方向键逐帧定位还有窄屏只读审片模式。都是实际剪辑能用得上的东西不是花架子。当然也有别扭的设计。调片段速度的时候它是片段长度不变从源素材里夹内容。不像K3是速度变了片段长度跟着变。第一次用得反应两秒属于设计思路差异不算bug。工程质量更没的说28个单元测试全过TypeScript类型检查零报错。就这一点已经比很多刚入职的实习生交的活强了。3.2 票务系统真后端不是玩具Demo第二个场景是最重的实时选座票务系统。消费者端选座购票运营后台管场馆演出中间锁座、支付、出票、退款、候补、核销一整套状态流转。我本来以为会给整个前端Demo糊弄事结果人家直接上了真后端。PostgreSQL存业务数据Redis传实时事件座位状态用SSE推到前端外加Worker处理锁座过期和候补派位Docker Compose一键就能拉起来。我测了支付、退款刷新页面、换全新浏览器重登数据全对得上没出幺蛾子。细节上甚至比K3版还讲究。锁座是原子操作一个座不可售整批都失败不会出现半卖半不卖的尴尬支付接口带幂等键手抖点两下也不会生成两笔订单重复核销直接返回409候补还有24小时防饿死机制普通用户等满一天自动升级优先级不会一直被会员插队。后台九个模块我全点了一遍建场馆、上演出、开会员、核销门票订单、候补、审计日志的数据全能对上整个过程浏览器控制台零报错。说真的这东西套个皮小商家直接就能用。3.3 驾驶小游戏手感赢了颜值输了第三个场景仿Drive Mad的物理驾驶小游戏。只用前进后退控制车辆越障五个主题关卡一批即死机制。上次K3的短板我记得很清楚关卡长得都差不多难度偏低我甚至怀疑它到底用没用正经物理引擎。这次Qwen直接把短板补上了。明确用了planck.js正经Box2D系的物理引擎不是摆样子。悬挂弹簧、碰撞冲量判定、低重力和冰面摩擦每关参数都是调过的。五个关卡主题和上次一样但机制密度高多了。工地关要推箱子垫路冰原关有相位旋转杆卡时机火山关是落石区加连续断桥步步是坑。即死机制我挨个试了托底、被旋转杆扫中、被落石砸中、掉出边界、碰到熔岩全真实触发没一个掺水的。难度也真上去了冰原和火山那两关我自己玩死了好几次。它还带了23个测试全过甚至包括五个关卡的无头仿真通关脚本模拟输入自动跑完全程。当然K3也不是全输。K3版画面色彩更花哨结算界面也更俏皮。Qwen版走的是朴素实用风赢在手感和玩法输在卖相。4 最让我意外的一点跑分表里根本看不到三个场景跑下来我发现它耗时都比K3长一点。一开始我以为是模型推理慢翻了下过程记录根本不是。它慢是因为它写完代码会自己开浏览器做验收。而且验得特别较真比我司不少测试岗都细。做视频工作台的时候它发现后台标签页里预览会因为浏览器rAF节流卡住自己把播放循环改成了rAF加setInterval双驱动发现Delete键删片段没生效自己模拟键盘事件排查出了问题。做票务系统的时候它先检查环境发现Docker没启动自己给拉起来跑完25个测试还自己进浏览器把完整支付核销流程走了一遍。换句话说它多花的时间全用在自己给自己质检上了。就这点跑分表上你半毛钱都看不到。但恰恰是这点才是程序员最关心的它交出来的东西到底是能跑的Demo还是能交付的成品三个项目全自带测试、控制台零报错、幂等和审计这些细节都想到了。能做到这一步已经不只是会写代码了它知道正经交付物长什么样。5 最后说句实在话跑完这三个场景我之前对Qwen的偏见基本碎干净了。功能上和K3打平工程严谨度甚至还略胜一筹。当然折扣还是要打它拿到的需求更完整占了便宜也没经过真实老项目的毒打复杂遗留系统表现怎么样还不好说。但就算扣完这些分结论也很明确人家早就不是当年那个编程不行的Qwen了。今年这种打脸我已经经历三次了GLM 5.2一次K3一次这次是Qwen。一次是巧合三次就是趋势。国产大模型这波是真的追上来了。最近也刷到不少相反的说法有人说这是PPT模型有人就留一句“拉胯”。我也不知道他们到底测没测反正我这三个场景跑下来体验是真还行。最后给你们个最实在的建议别信跑分别全信我这篇也别信网上没头没尾的一句评价。现在Qoder新用户能领一千多次免费调用你自己下个软件拿你手头真实的需求跑一遍。你自己的活能不能干你自己最有发言权。P.S. 挖到宝藏AI教程全程通俗易懂风趣幽默零基础轻松入门传送门https://blog.csdn.net/qq_34419312