Inkling 975B 说明“开放权重“与“普通开发者本地运行“已经分离,内容重点应是部署容量和运行时边界

📅 2026/7/23 18:13:11
Inkling 975B 说明“开放权重“与“普通开发者本地运行“已经分离,内容重点应是部署容量和运行时边界
Inkling 975B开放权重与可部署性的基础设施鸿沟Thinking Machines 2026-07-15 容量与运行时拆解TL;DR场景Thinking Machines Lab 2026-07-15 在 huggingface.co/blog/thinkingmachines-inkling 与 thinkingmachines.ai/news/introducing-inkling 同时发布 Inkling975B 总参 / 41B 激活的多模态稀疏 MoE许可证 Apache 2.0权重已开源到 Hugging Face。结论开放权重只解决访问和修改权重存储、KV Cache、并行通信、运行时成熟度、集群成本与生态支持共同决定是否真正可部署。A6000×8 / H100×8 都不是官方 NVFP4 路径官方验证配置是 8×B300 或 16×H200BF16以及 4×B300 W4A4 或 8×H200 W4A16NVFP4。产出可下载部署矩阵、官方 vs 理论容量对照、6 个评测指标、12 条错误速查卡与 7 步实施 / 实验方案目标是让开放权重和普通开发者本地运行两条线不再被混在一起讲。版本矩阵功能 / 事实状态说明Inkling 许可证为 Apache 2.0✅ 已验证原文 S13 / S14thinkingmachines.ai/news/introducing-inkling / thinkingmachines.ai/model-card/inkling/2026-07-15输入文本 图像 音频输出文本✅ 已验证原文 S14 模型卡预训练还含视频 token但目前没有视频输出975B 总参 / 41B 激活 / 1M 上下文✅ 已验证原文 S13 / S14 文字描述Hugging Face 模型卡显示 952B parameters⚠️ 数字异常HF 列表页 summary 写 952B原文 S13 / S14 文字与架构描述均用 975B本文按原文文字取 975B但提示读者去 HF 卡 957B 字段二次核验45T token 预训练含文本 / 图像 / 音频 / 视频✅ 已验证原文 S13在 NVIDIA GB300 NVL72 系统上训练✅ 已验证原文 S13 “The making of Inkling” 段超过 30M RL rollouts2 次长稳态训练✅ 已验证原文 S13 图表数据Szymon Tworkowskiaggregate eval reward 0.264 → 0.356BF16 最低配置8×B300 或 16×H200✅ 已验证原文 S14 模型卡NVFP4 配置4×B300 W4A4 或 8×H200 W4A16✅ 已验证原文 S14 模型卡运行时Transformers / SGLang / vLLM / llama.cpp✅ 已验证原文 S15huggingface.co/blog/thinkingmachines-inkling实际部署通常需要多节点 SLURM✅ 已验证原文 S15远程推理音频支持在发布时仍在进行中✅ 已验证原文 S15“remote inference audio support in progress at release”A6000 单卡 48 GB✅ 已验证原文 S16nvidia.com/en-us/products/workstations/rtx-a6000/8×H100 聚合 640 GB✅ 已验证原文 S17NVIDIA DGX H100/H2008×H200 聚合 1,128 GB✅ 已验证原文 S178×B200 聚合 1,440 GB✅ 已验证原文 S18NVIDIA DGX B200B300 单卡 288 GB✅ 已验证原文 S19NVIDIA DGX B3002026-01-20 更新Tinker 平台提供 64K / 256K 上下文选项✅ 已验证原文 S13 “Inkling availability” 段Tinker 首发 50% 折扣 Playground✅ 已验证原文 S13部署合作伙伴Together AI / Fireworks / Modal / Databricks / Baseten✅ 已验证原文 S13 “Inkling availability” 段SGLang 与 Miles 由 RadixArk 维护vLLM 由 Inferact 维护TokenSpeed 由 Lightseek 维护llama.cpp 由 Unsloth 维护✅ 已验证原文 S13StrongREJECT 98.6%表格 vs “above 99%”正文⚠️ 文档冲突原文 S13 注释明确kept per v7 verbatim但已留 OPEN ITEMS本文以表格 98.6% 为准Inkling-Small 276B 总参 / 12B 激活✅ 已验证原文 S13 “Inkling-Small” 段“preview”Inkling-Small 完整权重will be released once testing is complete⚠️ 待发布原文 S13 明确finishing the testing现在仍是 Preview1-bit GGUF / 4-bit / FP8 等社区量化的可装下硬件⚠️ 非官方用户原文提1-bit GGUF原文未做官方背书任何集成方结果都需独立核Inkling 是否在所有任务上优于闭源模型✅ 立场原文 S13 明确not the strongest overall model available today, open or closed本文不评价训练数据 / 训练代码完全开源✅ 立场用户原文风险段已写明开放权重 ≠ 训练数据和训练代码完全开源本文保留该立场文章正文Inkling 975B开放权重与可部署性的基础设施鸿沟**一句话核心论点**开放权重只解决访问和修改权重的问题权重存储、KV Cache、并行通信、运行时成熟度和集群成本决定模型是否真正可部署。摘要Inkling 是 975B 总参数、41B 激活的多模态稀疏 MoE许可证为 Apache 2.0。虽然每个 Token 只激活部分专家全部权重仍需存储官方 BF16 配置至少 2 TB 聚合显存NVFP4 至少 600 GB。该模型说明开放权重与普通开发者本地运行已经分离。内容重点应是部署容量和运行时边界而不是厂商 Benchmark 排名。读者问题总参数与激活参数分别影响存储和计算什么为什么 41B 激活仍需要存储 975B 权重A6000×8、H100×8、B200×8 到底处于什么容量边界1M 上下文为什么不能只看权重显存已核验事实Inkling 许可证为 Apache 2.0输入文本、图像和音频输出文本975B 总参数、41B 激活、1M 上下文。S13、S14官方 BF16 最低配置为 8×B300 或 16×H200NVFP4 为 4×B300 W4A4 或 8×H200 W4A16。S14Hugging Face 文章确认 Transformers、SGLang、vLLM 和 llama.cpp 路径并指出实际通常需要多节点和 SLURM远程推理音频支持在发布时仍在进行中。S15A6000 单卡 48 GB8×H100 共 640 GB8×H200 共 1,128 GB8×B200 共 1,440 GBB300 单卡 288 GB。S16—S19技术机制容量必须分开计算权重存储975B × 2 Byte ≈ 1.95 TB接近官方 2 TB BF16 要求。4-bit 理论权重975B × 0.5 Byte ≈ 487.5 GB官方要求 600 GB反映量化元数据、布局和运行时开销。激活41B Active 主要影响每 Token 计算量不代表其余专家权重可以不加载。KV Cache随并发、上下文长度、层数、KV 头数和精度增长公开模型卡不足以精确计算 1M Token 满上下文配置。并行通信Tensor/Expert/节点并行需要高带宽互联聚合显存满足不代表吞吐可接受。工程含义路由器在选择 Inkling 端点前必须确认精度格式、模态支持、最大上下文、节点健康、并发和队列。A6000×8 无法容纳官方 NVFP4 权重H100×8 虽有 640 GB 原始容量但缺少足够余量且不是官方 NVFP4 路径B200×8 容量足够放 600 GB 权重但未被模型卡列为验证配置H200×8 和 B300×4才是官方 NVFP4组合。实现或实验方案先按权重格式计算理论容量再保留 Runtime、KV Cache、通信缓冲和碎片余量。把官方验证配置与理论可装下配置分表展示。对 1M 上下文设置实际max-model-len按并发和业务需要逐步放大。分别验证文本、图像、音频和工具调用不因模型原生多模态就假设所有服务端均完整支持。比较托管 Endpoint、专用集群和蒸馏/小模型路线的每成功任务成本。记录运行时版本、并行策略、量化格式、吞吐、P95、显存峰值和质量回归。评测指标Weight Fit Margin聚合显存减去权重和静态开销后的余量。KV Headroom目标上下文和并发下可用 KV Cache 余量。Tokens/s per Dollar集群或 Endpoint 的有效吞吐成本。Inter-node Efficiency跨节点后相对理想线性扩展的效率。Modality Coverage服务端实际支持的文本、图像和音频能力。Quality Delta量化后在目标任务上的质量变化而非单一综合 Benchmark。反方观点与替代解释1-bit GGUF 可能让权重在更小硬件上运行但质量、速度、CPU 内存、模态和工具支持需要独立验证。开放权重仍具有审计、微调、蒸馏和自托管价值不能因部署昂贵就称其没有开放意义。托管推理降低进入门槛却引入数据驻留、成本锁定和供应商可用性问题。适用边界本章讨论容量与部署不评价 Inkling 是否在所有任务上优于闭源或其他开放模型。未实测配置只作理论边界不给出吞吐承诺。风险与误读点把激活参数当成需要加载的全部权重。把聚合显存等于权重大小视为可运行。把 B200 写成官方支持配置。把 1-bit 集成方结果写成官方质量保证。把开放权重等同于训练数据和训练代码完全开源。参考来源S13Inkling: Our open-weights modelThinking Machines Lab2026-07-15。S14Inkling Model CardThinking Machines Lab2026-07-15。S15Welcome Inkling by Thinking MachinesHugging Face2026-07-15。S16NVIDIA RTX A6000 specificationsNVIDIA持续更新。S17Introduction to NVIDIA DGX H100/H200 SystemsNVIDIA2026-01-26 更新。S18Introduction to NVIDIA DGX B200 SystemsNVIDIA持续更新。S19Introduction to NVIDIA DGX B300 SystemsNVIDIA2026-01-20 更新。错误速查卡症状根因定位修复团队以为开放权重 任何人都能本地跑把可下载和可部署混在一起算一下聚合显存 vs 权重区分两件事开放权重解决访问可部署性由容量 / KV / 通信 / 集群成本决定算容量时只算 BF16 权重大小没有把 Runtime、KV Cache、通信缓冲、碎片余量算进去检查显存占用曲线理论容量 权重 Runtime KV 通信缓冲 碎片余量官方 2 TB BF16 不是上限而是起点把 41B 激活当成只需要 41B 显存MoE 推理仍要加载全部专家权重监控 GPU 显存峰值激活参数只影响每 Token 计算不影响权重加载1M 上下文按权重显存计算 KV 预算KV Cache 随层数、KV 头数、并发、精度放大拉一次 1M 压测用 Runtime 报告的 KV Cache 占用乘并发上界A6000×8 装不下 NVFP4 还想硬装把理论可装当可运行跑一次加载脚本改 H200×8 或 B300×4A6000 路径没官方背书H100×8 跑 BF16 通过但吞吐极低BF16 没官方验证路径 跨节点通信开销大检查 Inter-node Efficiency切到官方 NVFP4 路径或 B200/H200/B300B200×8 跑 NVFP4 出现精度异常B200 不是模型卡验证配置对比官方 BF16 路径输出改 B300×4 或 8×H200远程音频推理失败发布时远程音频仍在进行中看 SGLang / vLLM / llama.cpp changelog改走官方伙伴或本地服务发布前用 Audio MC / MMAU / VoiceBench 验收用 1-bit GGUF 后质量掉很多1-bit 量化不是官方背书是社区方案对比 BF16 输出把它当作硬件容量解而不是质量等效用 Quality Delta 指标Tokens/s per Dollar 远低于托管自建集群利用率不足 / 多租户分摊过高看集群平均利用率用 Tinker / Together / Fireworks 等托管做经济性对照不是直接替代把 B200 写成官方支持看到容量够就写支持看模型卡 GPU 列表改回理论可装、未被模型卡列为验证评估指标只看综合 Benchmark综合分掩盖 Quality Delta加 Rubric 分解用专家 Rubric Quality Delta 在目标任务上单独看