Inverse Scaling Prize数据发布完整指南:5分钟上手11个获奖数据集,快速复现大模型逆扩展曲线

📅 2026/8/26 15:30:23
Inverse Scaling Prize数据发布完整指南:5分钟上手11个获奖数据集,快速复现大模型逆扩展曲线
Inverse Scaling Prize数据发布完整指南5分钟上手11个获奖数据集快速复现大模型逆扩展曲线【免费下载链接】prizeA prize for finding tasks that cause large language models to show inverse scaling项目地址: https://gitcode.com/gh_mirrors/pr/prizeInverse Scaling Prize逆扩展奖官方数据发布包收录了全部 11 个获奖数据集专门用于研究大模型越大、表现反而越差的逆扩展Inverse Scaling现象。本文带你 5 分钟上手数据格式、字段说明与图表结构快速复现大模型逆扩展曲线适合刚接触 LLM 评测的读者。一、什么是逆扩展30 秒理解越大越差 按扩展定律Scaling Laws语言模型参数越多、训练算力越大基准测试表现通常越好。但 Inverse Scaling Prize 发现了一类反例任务模型越强错误反而越多。该赛事由 AI 安全研究机构于 2022 年发起总奖池 25 万美元目标是找到重要且可复现的逆扩展任务。经过两轮评审官方在 2023 年 3 月一次性发布了全部 11 个获奖数据集。下面的图是典型的逆扩展曲线横轴为模型算力FLOPs纵轴为负对数损失。可以看到 Gopher、OPT 等模型系列越大的版本在 Memo Trap 任务上损失越高表现越差二、5 分钟上手获取 11 个获奖数据集 1. 克隆仓库获取数据发布包所有数据位于data-release/isp-data-release.zip克隆仓库即可拿到git clone https://gitcode.com/gh_mirrors/pr/prize2. 解压并查看数据unzip />少样本条件下许多任务的逆扩展依然存在。下图是 Gopher 系列在 Into the Unknown 数据集上的表现五、使用数据前必读的注意事项 ⚠️Canary 字符串数据中嵌入了 BIG-Bench 风格的 canary GUID声明基准数据不应出现在训练语料中请勿将其用于模型预训练许可证全部数据采用 CC-BY 4.0 许可Modus Tollens 勘误数据发布后发现有少于 10% 的样例存在语法错误官方仍保留这些样例如需过滤受影响的样例下标已列在data-release/modus-tollens_affected_indices.txt数据清理resisting-correction有意略去 part 1memo-trap仅保留 part 1 与 3完整变更记录见data-release/README.md六、常见问题 FAQ Q复现曲线需要花钱调 API 吗A不需要。官方曲线已完整收录在plots/目录若要自己在开源模型如 OPT上重跑使用 Hugging Face 上的开源权重即可零成本。Qpart和round字段有什么用Apart区分数据集内部的不同子集如sig-figs有 21 个部分round标明数据提交自哪一轮两轮之间更新过的任务resisting-correction、redefine只保留了第二轮版本。Q数据量有多大够跑实验吗A11 个数据集共约 22 MB单文件从几百条如neqa到上万条不等全部满足赛事至少 300 条的最低门槛多数在千条量级足以观察到清晰的缩放趋势。总结Inverse Scaling Prize 数据发布包是目前研究大模型逆扩展现象最权威的公开资源——11 个获奖数据集 三类官方评测曲线开箱即用。克隆仓库、解压data-release/isp-data-release.zip即可在 5 分钟内开始你的复现实验。【免费下载链接】prizeA prize for finding tasks that cause large language models to show inverse scaling项目地址: https://gitcode.com/gh_mirrors/pr/prize创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考