Ornith-1.5-35B-A3B vs Qwen3.5-397B vs Gemma-4-31B:15项基准测试完整对比解析

📅 2026/8/23 15:42:08
Ornith-1.5-35B-A3B vs Qwen3.5-397B vs Gemma-4-31B:15项基准测试完整对比解析
Ornith-1.5-35B-A3B vs Qwen3.5-397B vs Gemma-4-31B15项基准测试完整对比解析【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B是 ornith-ai 开源的MoE 混合专家推理大模型总参数 35B每个 token 仅激活约 3B 参数主打编码Coding与智能体Agentic能力。本文基于官方模型卡 README.md将它与Qwen3.5-397B、Gemma-4-31B放在同一张表格中逐项拆解15 项基准测试的得分差异帮你看懂为什么一个 35B 的小模型能在编码任务上正面击败 11 倍参数量的 Qwen3.5-397B 快速认识 Ornith-1.5-35B-A3B自我改进的 MoE 推理模型在对比数据之前先花 30 秒了解这位主角的体质架构细节见 config.json关键特性说明架构类型MoE 混合专家256 个专家每个 token 只激活 8 个参数规模总参数 ~35B激活参数~3B/token推理成本接近 3B 小模型注意力设计40 层混合注意力线性注意力为主每 4 层插入一次全注意力上下文窗口原生 262,144 tokens可用 YaRN 扩展至约 100 万模态能力内置视觉塔支持图像/视频输入config 中含 image/video token 定义训练方式端到端自我改进模型自生成训练任务、自发现解题策略再用强化学习迭代它的定位很清晰用接近小模型的推理成本换取大模型的编码与智能体表现。官方称 Ornith-1.5 将自我改进闭环从脚手架 轨迹优化扩展为任务生成 脚手架构建 解题轨迹的联合优化——训练数据不再依赖人工标注任务而是模型自己出题、解题、自我强化。 15 项基准测试完整对比表以下为官方模型卡公布的完整数据Ornith-1.5 结果均为 5 次独立运行平均评测温度 1.0复现细节见 README.mdCoding 编码9 项基准测试Ornith-1.5-35B-A3BQwen3.5-397BGemma-4-31BTerminal-Bench 2.1 (Terminus-2)67.853.542.1Terminal-Bench 2.1 (Claude Code)68.548.6-SWE-bench Verified79.076.452.0SWE-bench Pro59.651.635.7SWE-bench Multilingual71.469.351.7DeepSWE22.01.0-Frontier-Bench v0.15.11.4-NL2Repo46.236.815.5SWE Atlas - QnA39.820.4-Reasoning 推理3 项基准测试Ornith-1.5-35B-A3BQwen3.5-397BGemma-4-31BHLE无工具25.628.719.5HLE带工具33.448.326.5GPQA Diamond89.288.484.3Agentic 智能体5 项基准测试Ornith-1.5-35B-A3BQwen3.5-397BGemma-4-31BMCP-Atlas70.272.355.0Toolathlon-Verified48.738.340.8WideSearch67.874.054.2BrowseComp67.678.6-ClawEval72.570.748.5 数据解读三场对决的胜负手编码能力35B 对 397B 的全场压制 这是本次对比最有冲击力的结论——编码 9 项测试Ornith-1.5-35B-A3B 全胜SWE-bench Verified 79.0 vs 76.4真实 GitHub issue 修复任务上35B MoE 反超 397B 大模型 2.6 分SWE-bench Pro 59.6 vs 51.6更难的变体上优势扩大到 8 分DeepSWE 22 vs 1深度软件工程任务上 Qwen3.5-397B 几乎失效Ornith 拉开 22 倍差距Frontier-Bench 5.1 vs 1.4前沿难题上同样是 3 倍以上的领先。而 Gemma-4-31B 在同尺寸对决中处于明显下风SWE-bench Pro 35.7、NL2Repo 仅 15.5说明编码智能体能力与参数量并非线性关系训练方法自我改进 RL是决定性变量。推理能力Qwen3.5-397B 仍是天花板 HLE人类终极考试两项上Qwen3.5-397B 以28.7 / 48.3稳居第一且带工具调用时优势扩大到 14.9 分——大规模参数在开放式知识检索与多步推理上仍有规模红利。但注意 GPQA Diamond科学研究生级问答Ornith 以89.2微弱反超 88.4Gemma-4-31B 也有 84.3——三者在这个维度上其实非常接近。智能体任务各有所长 ⚔️搜索类WideSearch 74.0、BrowseComp 78.6、MCP-Atlas 72.3Qwen3.5-397B 占优工具调用与代码执行类Toolathlon-Verified 48.7、ClawEval 72.5Ornith-1.5 更胜一筹。这符合两者的优化方向Ornith 的自我改进循环专门针对生成任务 → 调用工具 → 执行轨迹闭环做了强化学习。 为什么 3B 激活参数能打赢 397B三个核心原因MoE 的按需计算256 个专家中每 token 只激活 8 个实际计算量约为 3B 稠密模型却保留了 35B 的知识容量bf16 权重约 70GB2 张 80GB 显卡即可部署 256K 上下文自我改进闭环不依赖固定的人工任务集模型持续自出新题并优化策略编码轨迹质量随训练轮次复利式提升RL 奖励对齐针对任务生成、脚手架构建、解题轨迹分别设计了奖励函数让模型学会如何完成工程任务而不只是背出答案。⚙️ 快速部署最低配置与推荐参数Ornith-1.5-35B-A3B 是推理模型默认回答前会先输出think…/think思考块服务端需开启推理解析器。运行环境要求详见 README.mdTransformers ≥ 5.8.1/vLLM ≥ 0.19.1/SGLang ≥ 0.5.9推荐采样参数日常使用temperature0.6, top_p0.95, top_k20与 generation_config.json 一致本地轻量场景可通过 Ollama / llama.cpp 加载 GGUF 量化版ornith-ai/Ornith-1.5-35B-A3B-GGUF单卡即可体验对话模板参考 chat_template.jinja权重分片索引见 model.safetensors.index.json共 16 个分片✅ 选型建议你应该选哪个模型你的场景推荐理由自托管编码智能体 / SWE 修复助手Ornith-1.5-35B-A3B编码 9 项全胜成本仅为 397B 的零头终极推理、深度搜索、MCP 多工具协作Qwen3.5-397BHLE 与搜索类基准全面领先边缘设备 / 多模态轻量部署Gemma-4-31B稠密 31B 部署最简单但编码智能体能力明显较弱硬件有限但要能干活的 AgentOrnith-1.5-35B-A3BGGUF 量化3B 激活参数消费级显卡也可跑一句话总结如果你的目标是在自有显卡上跑一个编码/智能体 AgentOrnith-1.5-35B-A3B 用 15 项测试中的 12 项第一证明了小而精路线的成立如果你的预算允许部署超大模型、且任务偏重开放式推理与信息检索Qwen3.5-397B 依然是更稳的选择。【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考