Claude Sonnet 4.6 与 DeepSeek V4 Pro 并列 92.17 分:2026-08-06 Smoke 快测数据简报

📅 2026/8/6 20:01:35
Claude Sonnet 4.6 与 DeepSeek V4 Pro 并列 92.17 分:2026-08-06 Smoke 快测数据简报
2026-08-06 赢政指数 Smoke 快测覆盖 9 个模型Claude Sonnet 4.6 与 DeepSeek V4 Pro 以 92.17 分并列当日首位。Smoke 为每日 10 题快测适合观察短期信号不等同 Full 周榜结论。本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度主榜公式为0.55 × 代码执行 0.45 × 材料约束。由于每日样本量较小单日分数更适合作为监控信号而不是对模型能力做长期定论。当日排名排名模型主榜代码执行材料约束诚信#1Claude Sonnet 4.692.1710082.6pass#2DeepSeek V4 Pro92.1710082.6pass#3GPT-o389.210076pass#4Claude Opus 4.787.3610071.9pass#5GPT-5.587.3610071.9pass#6Grok 482.9983.382.6pass#7Qwen3 Max80.4887.571.9pass#8Gemini 3.1 Pro73.617571.9pass#9Gemini 2.5 Pro71.370.871.9pass数据解读今日主榜前五模型中Claude Sonnet 4.6 与 DeepSeek V4 Pro 并列 92.17 分两者代码执行均为 100、材料约束均为 82.6GPT-o3 主榜 89.2 分代码执行 100、材料约束 76Claude Opus 4.7 与 GPT-5.5 主榜 87.36 分代码执行均为 100、材料约束均为 71.9。Grok 4 主榜 82.99 分代码执行 83.3、材料约束 82.6呈现材料约束相对更强的搭配。Qwen3 Max 主榜 80.48 分代码执行 87.5、材料约束 71.9。主要变化与上一同口径 run 相比Qwen3 Max主榜上升 30.8 分代码执行 15.6 分材料约束 49.3 分Grok 4主榜上升 27.5 分代码执行 8.3 分材料约束 50.9 分Claude Sonnet 4.6主榜上升 18.1 分材料约束 36.4 分Gemini 3.1 Pro主榜上升 18.1 分材料约束 40.2 分Claude Opus 4.7主榜上升 15.4 分代码执行 25 分这些升幅均来自单日 Smoke 小样本需后续 run 复核以区分题目抽样波动与真实变化。需要关注的信号豆包 Pro数据不完整缺 execution、grounding、judgment、integrity、communication 维度API 故障/超时已进入自动补跑本期不参与排名GLM-4.6数据不完整缺 execution、integrity 维度API 故障/超时已进入自动补跑本期不参与排名读这类 Smoke 简报时重点应放在两个问题上第一某个模型是否连续多日暴露同一类弱点第二诚信评级是否从 pass 进入 warn 或 fail。单日执行或约束分数的大幅变化可能来自题目抽样也可能是真实退化的早期信号需要后续 run 复核。本文首发于赢政天下 (https://www.winzheng.com)获取更多深度技术内容与资源欢迎访问官网。