HRM-Text基准成绩大揭秘1B小模型为何能在GSM8k等8大榜单击败更大模型【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-TextHRM-Text 是一个基于 HRM 分层递归架构的1B 文本生成模型通过任务完成 隐空间推理双重强化仅需约 1500 美元、16 块 H100 训练 46 小时就在 GSM8k、MATH、DROP、MMLU、ARC-C 等8 大基准榜单上拿到了 84.7% 等亮眼成绩整体基准均分甚至反超参数量更大的 2B~7B 模型。今天就带大家拆解这份以小博大的基准成绩单 一张图看懂HRM-Text 1B 的基准均分 vs 更大模型上面的散点图是整个项目的含金量所在左右两图分别以训练 FLOPs和训练 Token 数为横轴、8 大基准的平均分为纵轴模型参数量训练算力相对 HRM-Text 1BGemma3 4B4B130x ~ 230xLlama3.2 3B3B约 230xQwen3.5 2B2B约 600xOlmo3 7B7B约 350xGPT-3.5约 175B约 44,000x估算HRM-Text 1B1B1x16 GPU1.9 天40B 唯一 Token可以看到HRM-Text 1B 用1x 的算力就追平乃至超过了那些花费 130~600 倍算力训练的 2B~7B 模型——这就是130-600x 更少算力、150-900x 更少数据说法的由来。8大榜单成绩详解GSM8k 84.7% 是怎么来的以下是官方参考运行XL1B 参数在 8 个基准上的成绩来自 README.md 的基准表榜单考察能力L (0.6B)XL (1B)GSM8k 小学数学推理77.6%84.7%MATH竞赛级数学51.2%56.5%DROP 阅读理解 算术78.6%82.3%MMLU通用知识56.6%60.7%ARC-C科学常识推理75.9%81.9%HellaSwag常识推理52.7%63.4%Winogrande指代消解67.6%72.4%BoolQ常识问答85.0%86.2%几个值得注意的对比来自项目基准图DROP 阅读与算术HRM-Text 1B 拿到82.2超过 Olmo3 7B71.5和 GPT-3.564.1MMLU 通用知识60.7与 Qwen3.5 2B64.7、Olmo3 7B65.8相比略有差距——小模型的知识广度仍是弱项这是客观存在的 trade-offMATH56.5已超过 Gemma3 4B56.2评测本身完全开源可复现8 个基准的提示词、few-shot 设置与评分逻辑都在 evaluation/benchmarks.py 中评测配置见 evaluation/config/hrm_benchmarking.yamlGSM8k/MATH 用链式推理条件其余用直接生成条件。为什么 1B 小模型能打赢大模型3 个关键原因1️⃣ HRM 分层递归架构用思考循环换参数HRM 的核心思路是递归计算不把所有参数堆宽堆高而是让较少的层反复循环使用H 模块做高层推理、L 模块做低层处理。在 config/arch/net/hrm.yaml 中可以看到 H_cycles2、L_cycles3 的循环配置完整架构实现位于 models/baselines/hrm_nocarry_bp_warmup.py。同样的 FLOPs 预算下递归让模型想得更多而非记得更多这正好契合推理型任务。2️⃣ 隐空间推理 任务完成训练模型不是在显式文本中逐步推理而是在隐空间latent space内完成多轮推理再配合任务完成task completion目标强化端到端解题能力。这也是它在 GSM8k、MATH 这类推理榜单上格外突出的原因。3️⃣ 极致的训练效率工程PrefixLM 序列打包dataset_new.py 构建双向前缀 因果响应的批处理models/flash_attention_prefixlm_v2.py 实现两遍注意力路径LPT 分布式批采样multipack_sampler.py 均衡二次方注意力开销提升 Token 槽利用率FlashAttention 3 PyTorch FSDP2pretrain.py 负责分布式训练、优化器与断点保存这些工程优化共同把1B 模型预训练的门槛从数千美元拉到了约 800~1500 美元量级。如何自己复现 HRM-Text 基准评测评测只需1 块 80GB 显存的 GPU完整步骤见 evaluation/README.md克隆仓库git clone https://gitcode.com/gh_mirrors/hr/HRM-Text拉取官方 Docker 镜像内含 FlashAttention 3 等完整环境训练完成后一键评测python -m evaluation.main ckpt_pathcheckpoints/...如需只跑部分榜单追加run_only[MATH,DROP,ARC,MMLU]即可若显存不足可加generation_config.batch_size16降低批次大小。总结小模型 递归推理 预训练新范式HRM-Text 证明了一件事模型智能不一定靠堆参数和堆算力。1B 的 HRM-Text 用 1x 算力在 8 大基准上打出与 2B~7B 大模型掰手腕的成绩把基础模型预训练的入场券压到了 ~$1000 级别。对于想从零预训练、或研究递归架构的开发者来说这个项目从 config/ 配置、models/ 架构到 evaluation/ 评测的全链路开源都是很好的学习起点 【免费下载链接】HRM-TextHRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.项目地址: https://gitcode.com/gh_mirrors/hr/HRM-Text创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考