Qwen3 Max 材料约束暴跌20分,代码执行暴涨37.8分:主榜反升11.8分背后的抽签逻辑

📅 2026/8/1 17:34:29
Qwen3 Max 材料约束暴跌20分,代码执行暴涨37.8分:主榜反升11.8分背后的抽签逻辑
Qwen3 Max 在今日 Smoke 评测Run #255中交出了一份两极分化的成绩单材料约束从昨日67.70分跌至47.70分掉了20分代码执行从54.70分飙到92.50分涨了37.8分。两者加权后主榜从60.55分升到72.34分净涨11.8分。得分拆解主榜只有两个维度代码执行和材料约束。今日代码执行92.50分材料约束47.70分。侧榜方面工程判断从72.20分降到55.60分任务表达从31.70分涨到66.70分。侧榜不计入主榜。维度昨日今日变化代码执行主榜54.7092.5037.8材料约束主榜67.7047.70-20.0主榜加权60.5572.3411.8工程判断侧榜72.2055.60-16.6任务表达侧榜31.7066.7035.020分跌幅怎么来的Smoke 评测材料约束维度每天只有2道题。单题得分波动可以直接拉出20分的分差。今日47.70分对应两题平均正确率约47.7%昨日67.70分对应约67.7%。如果今天两题碰巧都涉及严格引用原文或多段落一致性要求模型输出偏差就会被放大扣分。代码执行同时暴涨37.8分同样指向题目难度分布的变化不是模型能力突然飞跃了。代码执行92.50分与材料约束47.70分同时出现说明模型在不同任务类型上的表现差异被当日题目放大。对使用者的实际含义重度依赖材料忠实度的场景需要留意。法律合同抽取、学术引用核对、长文档事实校验的团队今天47.70分这个数字提示需要加人工复核。代码生成和调试为主的开发者可以继续用92.50分的水平够用但涉及材料引用的部分还是要验。工程判断侧榜55.60分对系统架构决策的参考价值打了折扣。任务表达66.70分对提示词迭代有一定辅助作用。是波动还是退化稳定性维度需要多次同类题目的标准差来计算单日数据算不出来。材料约束单日-20分和代码执行37.8分同时出现更像抽签波动特征不是模型参数级别的退化。诚信评级维持 pass没有出现一致性或事实捏造问题。怎么判断后续Qwen3 Max 主榜上升主要由代码执行单维度拉动。材料约束的20分跌幅在2题样本下不构成持续退化信号。下一期 Smoke 评测如果材料约束还在55分以下要重点验证。如果回升到65分以上基本确认今天是抽签异常。企业选型的时候建议连续观察三天材料约束得分的标准差。如果标准差超过15分说明模型在材料约束维度一致性不够适合当代码辅助工具用但不太适合做核心知识工作的底座。开发者可以针对材料约束这个弱项设计二次校验流程降低47.70分水平下的潜在风险。