人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX是一个开源的 AI 推理性能研究平台README.md持续自动化地为 vLLM、SGLang、TensorRT-LLM 等主流推理框架做端到端基准测试并把结果发布到公开的实时排行榜。本文将用最少术语讲清楚排行榜背后最关键的两个概念E2E 归一化交互性E2E normalized interactivity和北星North StarPareto 前沿帮你 3 分钟看懂 AI 推理性能排行榜。一、InferenceX 是什么一张不断刷新的推理性能排行榜传统的推理基准测试是某时间点的一次性快照而推理软件SGLang、vLLM 等几乎每天都在优化、每天都在变快静态榜单很快就会过时。InferenceX 的定位是实时性能晴雨表持续基准在官方 GPU 集群GB200/GB300 NVL72、B200/B300、MI300X/MI355X、H100/H200 等上周期性跑同一套工作负载软件更新即重测框架版本升级后榜单随之刷新记录真实的性能进步曲线真实负载核心场景是AgentX——基于真实流量 trace 的多轮、长上下文 agentic 编程负载回放而非简单的固定长度压测。一次结果从配置声明 → 自动调度 → 结果聚合 → 发布到看板的完整链路可以在架构文档 inferencex-e2e/docs/architecture.md 中按阶段查看每次配置变更都会追加记录到 perf-changelog.yaml保证榜单的每一次变化都有据可查。二、E2E 归一化交互性一个指标同时衡量排队和打字速度为什么需要它在看板上比较两个推理配置时常见的坑有两个输出长短不一AgentX 负载里每条请求生成的 token 数差异很大。请求 A 生成了 3000 个 token、请求 B 只生成了 300 个直接比总耗时会冤枉生成更多内容的请求首字慢但吐字快一个配置 TTFT首 token 延迟很高但解码很快另一个反之。只看1/TPOT解码交互性会漏掉用户干等第一个字的痛苦。E2E 归一化交互性把这两件事合进一个用户视角的交付速率。完整定义见 inferencex-e2e/docs/MODELS.md 的 E2E normalized interactivity and Pareto-frontier policy 一节计算分三步第 1 步每条请求算每个输出 token 花了多少时间r_i E2EL_i / OSL_i秒 / 输出token其中E2EL_i是这条请求的端到端总延迟含 TTFT 生成时间OSL_i是它的输出长度。第 2 步对全体请求取百分位看板默认 P90先对r_i取 P90而不是先把延迟和长度各自聚合再相除——这样保留了慢尾最慢的那 10% 请求的含义。第 3 步取倒数变成越高越好的速率E2E 归一化交互性 1 / P90(r_i)单位输出 token/s/用户直观理解在请求级别这个指标近似等于OSL / E2EL ≈ 1 / (TPOT TTFT / OSL)可以把它理解成给解码交互性TPOT加了一个排队预填充惩罚的速率。输出越短TTFT 被摊薄得越少惩罚越重——这正是用户真实感受到的体验等待首字的时间一分一秒都算数。优点与局限官方原文摘要维度说明✅ 消除长度偏差生成了更多内容的请求不会因为总时间长被判为更慢✅ 一体两面同时约束 TTFT 和解码节奏防止只快解码、拖慢整体完成的取巧配置✅ 越高越好单位是熟悉的 token/s/用户方向直观⚠️ 不是1/TPOT绝对值与传统解码交互性不可直接互比通常数值更低因为包含 TTFT⚠️ 短输出罚得更重比较必须基于同一份 trace 分布和同一套方法⚠️ 无法定位病因回归到底出在 TTFT 还是解码需要看单独的 E2E 延迟 / 交互性 / TTFT 视图三、北星 Pareto 前沿排行榜的防作弊机制3.1 先用大白话理解 Pareto 前沿假设横轴是用户数并发压力纵轴是性能指标。如果配置 A 在同样的并发下性能更高就说 A支配了 B。所有不被任何其他配置支配的点连成的那条左上角边界线就是Pareto 前沿——它代表在当前对比维度下最不差的一组配置。3.2 北星规则先定冠军再看其他视角问题在于看板支持多个 x 轴视角E2E 延迟、传统交互性、TTFT……。如果每个视角各自独立挑前沿就会出现某配置靠牺牲端到端体验、单刷一个次要指标挤上公开前沿。InferenceX 的解法见 MODELS.md 的 North-star Pareto policy先算北星前沿对每个 y 轴指标和对比组以E2E 归一化交互性为 x 轴算出的 Pareto 前沿是唯一的官方canonicalAgentX 北星前沿其他视角受冠军集门禁E2E 延迟、传统交互性、TTFT 等视图显示的是北星前沿 ∩ 该视角下的真实 Pareto 前沿——双重条件缺一不可被支配的点不消失它们仍保留在未过滤散点图中供诊断只是不进入公开前沿。一句话总结一个点想上任何一张公开前沿曲线必须先是用户体验最优组北星冠军再在当前图表坐标下不被支配。这从根本上杜绝了单项数据漂亮、整体体验变差的配置混进榜单。3.3 前沿质量也有门禁发布前还有一道自动检查每条受影响曲线建议至少 5 个前沿点RECOMMENDED_POINTS 5见 pareto_coverage.py。前沿点数据中会携带isOnNormalizedInteractivityFrontier标志位北星门禁生效时只有带该标志的点才能留在前沿上。评审侧的要求写在 PR_REVIEW_CHECKLIST.mdReported measured throughput/E2EL Pareto counts ≥ 5 per affected curve。四、5 步看懂 InferenceX 推理排行榜先看横纵轴确认当前视图的 x 轴是不是北星视角E2E 归一化交互性。其他视角的曲线是北星冠军集的子集天然更保守只比较前沿点曲线上的点才是各并发档位下不被支配的最佳配置散点图里的被支配点仅用于诊断别被输出长度误导归一化交互性已经把生成了多少内容归一掉了可以直接横向比较但前提是同模型、同硬件、同一 trace 分布看趋势不看单点榜单价值在时间维度——同一个配置在软件迭代下的性能曲线可对照 perf-changelog.yaml 查看每次变更内容比单点数字更有意义留意场景覆盖模型支持矩阵MODELS.md 的 Model support matrix标明了每个模型当前活跃/已弃用的场景比较前确认两边跑的是同一类负载。 提示新模型上架后Day 0即可上榜并持续刷新如 DeepSeek V4、Kimi K3、MiniMax M3 均从发布首日连续追踪这正是实时晴雨表与传统评测的本质区别。五、延伸阅读从策略文档到结果管道想了解去哪里看指标与北星策略的完整定义inferencex-e2e/docs/MODELS.md前沿点自动检查逻辑infx/workflows/pareto_coverage.py文档总入口任务路由表inferencex-e2e/docs/index.md结果产物 schema 与入库契约inferencex-e2e/docs/results-and-ingestion.md端到端流水线架构inferencex-e2e/docs/architecture.md如果你想动手验证或参与贡献仓库提供完整的本地工具链克隆后git clone https://gitcode.com/gh_mirrors/in/InferenceX进入inferencex-e2e/用uv sync --locked安装依赖即可运行矩阵生成与结果处理工具入口说明见 inferencex-e2e/README.md。六、常见疑问 FAQQ为什么不用1/TPOT传统解码交互性当北星指标A1/TPOT只反映解码阶段节奏完全忽略 TTFT。归一化交互性把用户从发请求到收到全部输出整条路径都算进去才接近真实交互体验。Q被踢出前沿的配置是不好吗A不一定。它可能只是在该对比维度下被支配或者不是北星冠军。未过滤散点图里仍可看到它用于定位具体瓶颈TTFT 回归还是解码回归需切到对应诊断视图。Q不同模型的数值能直接互比吗A不能。该指标依赖 trace 分布输出长度、多轮结构官方明确比较要求相同的 trace 分布与基准方法。跨模型对比请看各自模型页的同配置曲线。Q投机解码MTP/EAGLE3/DSpark会影响榜单公平性吗A策略允许开或关投机解码以产出最佳 Pareto 点无投机解码的普通结果同样有资格进入北星前沿Valid non-spec-decode results stay eligible前沿上两种配置可以混合出现。看懂了这两个概念你就掌握了 InferenceX 排行榜的游戏规则E2E 归一化交互性定义了用户体验怎么量化北星 Pareto 前沿定义了谁有资格上榜。剩下的就是持续跟踪那条不断向右上方推进的曲线了。赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐贝叶斯优化多目标优化Pareto前沿求解完整指南贝叶斯优化多目标优化Pareto前沿求解完整指南 贝叶斯优化Bayesian Optimization是一种强大的全局优化方法特别适用于高成本函数优化场机器学习5分钟看懂2025大模型性能排行榜LLaMA/千问/ChatGLM全面对决5分钟看懂2025大模型性能排行榜LLaMA/千问/ChatGLM全面对决 你还在为选择大模型发愁训练效果与推理速度如何平衡量化后性能会下降多少本文通人工智能大模型微调预训练强化学习RLHFLoRA模型推理服务本地部署模型评测从SAT到优化Z3定理证明器MaxSAT、MaxCore与Pareto前沿优化完全指南从SAT到优化Z3定理证明器MaxSAT、MaxCore与Pareto前沿优化完全指南 Z3 定理证明器Z3 Theorem Prover不仅擅长回答可开发工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考