注意文中调用示例均跑在147AI上价格数据全部公开浏览器看网页版https://147ai.com/pricing程序抓 JSON 接口https://147ai.com/api/pricing两者同源同数据可实时核验。文末附换用其他网关复现本文的方法欢迎试验。为什么蒸馏的第一笔账是数据生成模型蒸馏distillation的流程大家都熟拿一个强的教师模型批量生成高质量问答/推理数据再用这批数据 SFT 一个小的学生模型。GPU 训练的账好算但很多人第一次做蒸馏时低估的是教师模型的调用费——生成 10 万条数据token 消耗轻松上亿。这篇把这笔账算透真实价格真实公式可复现代码。一、先定场景以一个典型的中文指令蒸馏任务为例目标生成100,000 条SFT 样本每条样本prompt 平均 600 tokens含 few-shot 示例与生成指令教师输出平均 900 tokens总消耗输入 60M tokens输出 90M tokens你的场景可以按比例缩放公式在下面。二、价格怎么算公式可自行核验147AI基于 new-api计价公式是公开的输入价$/1M tokens model_ratio × 2 × group_ratio 输出价$/1M tokens 输入价 × completion_ratio三个系数全部公开两种方式任选想肉眼浏览开网页版https://147ai.com/pricing可视化价格表无需登录想脚本核验抓 JSON 接口https://147ai.com/api/pricing原始结构化数据同样无需认证写作本文时共 220 个模型。两者同源本文表格用的是后者。充值汇率 1$ ¥1.0所以下面的美元数字就是人民币数字。关于分组要先说清楚同一个模型在147AI中通常挂在多个分组下分组对应不同的上游渠道和倍率group_ratio价格可能差好几倍。没有默认哪个组最好的说法——低倍率组通常是特价渠道例如标注企业勿选的特价组稳定性预期就该打折扣高倍率组是官方直连/企业级渠道。做蒸馏这种大批量离线任务你可以自己权衡任务可重试、对单次失败不敏感特价组的性价比就有意义要是流水线一断就要人工介入多花的钱就是买稳定。三、成本实测表2026-07-22 实抓价格快照按上面 60M 输入 / 90M 输出的场景各教师模型的总成本同一模型给出全部分组的价格区间低→高一个分组都不排除教师模型输入价区间 $/1M输出价区间 $/1M10 万条总成本deepseek-v3.21.602.40$312gemini-3-flash-preview2.0012.00$1,200claude-sonnet-4-62.40 ~ 18.0012.00 ~ 90.00$1,224 ~ $9,180deepseek-r13.2012.80$1,344gpt-5.42.50 ~ 12.5015.00 ~ 75.00$1,500 ~ $7,500kimi-k2.53.2016.80$1,704glm-54.8017.76$1,886gpt-5.2-chat-latest5.25 ~ 8.7542.00 ~ 70.00$4,095 ~ $6,825claude-opus-4-64.00 ~ 30.0020.00 ~ 150.00$2,040 ~ $15,300这里说明一下 claude 系区间为什么这么宽claude-sonnet-4-6 / claude-opus-4-6 分别挂着 8 个和 9 个计价分组区间下限是特价渠道group_ratio 低上限是 openroutergroup_ratio 4.5和官方直连group_ratio 6这两个最贵的分组。做离线批量蒸馏大概率你不会选官方直连档但区间必须把它们算进去——不然你自己抓/api/pricing一算就会发现对不上。实测过程中我的几个比较直观的结论输出占大头。蒸馏是输出密集型任务表中模型的 completion_ratio 从 1.5deepseek-v3.2到 8gpt-5.2-chat-latest不等旗舰档普遍 4~8——输出单价全线高于输入单价教师输出 token 是成本主项控制生成长度比压 prompt 更省钱。教师模型选型跨度接近 50 倍$312 vs $15,300。常见做法不是全用旗舰先用旗舰模型如 claude-opus / gpt-5.4生成 5%~10% 的种子数据校准质量标准剩下的量产交给 deepseek/gemini-flash 档位再用旗舰做质量抽检。同一模型不同分组价差可达 7.5 倍如 claude-sonnet-4-6 输入价 $2.40 ~ $18.00这正是离线批量任务和在线服务的选型逻辑不同的地方——请根据自己的失败容忍度选别抄别人的作业。推理模型会偷吃你的输出预算别只看 completion_tokens 总量。gemini-3-flash-preview 这类隐藏推理模型以及其他标-preview/ 推理档的模型reasoning token 和正文共享同一个max_tokens预算——我们实测用max_tokens1200生成 500-800 字正文时reasoning token 占掉约 60% 预算正文在句子中间被硬截断finish_reason: length。而且 reasoning token 照样按 completion 价计费钱花了数据却不达标。对策给这类模型单独调大max_tokens质检时逐条检查finish_reason是否为stop、看reasoning_tokens占比——这比数字数更可靠。deepseek-v3.2 / gpt-5.4 实测无此问题。四、可复现代码一个 key 切换所有教师模型OpenAI 兼容格式换base_url即可换网关fromopenaiimportOpenAIimportjson,time clientOpenAI(base_urlhttps://147ai.com/v1,# 换任何 OpenAI 兼容网关都行api_keysk-xxx,)TEACHERS[deepseek-v3.2,gemini-3-flash-preview,claude-sonnet-4-6]# 推理模型如 gemini-3-flash-preview的 reasoning token 与正文共享 max_tokens 预算# 需预留余量否则正文会被截断见上文结论 4MAX_TOKENS{gemini-3-flash-preview:3000}# 其余模型用默认 1200PROMPT_TMPL你是数据标注专家。请针对下面的指令写一个高质量回答 要求步骤清晰、无编造事实、字数 500-800。 指令{instruction}defgen_one(model,instruction):rclient.chat.completions.create(modelmodel,messages[{role:user,content:PROMPT_TMPL.format(instructioninstruction)}],max_tokensMAX_TOKENS.get(model,1200),temperature0.7,)assertr.choices[0].finish_reasonstop,f输出被截断:{model}# 质检第一道关return{model:model,instruction:instruction,output:r.choices[0].message.content,usage:r.usage.model_dump(),# 留着对账}# 对账跑完一批后把 usage 累加乘上实抓价格表和后台账单核对这里强烈建议保留每条请求的usage字段做本地对账——这是检验任何网关计费是否透明的最简单办法对我们也一样适用。五、动手前的几个事实在147AI中目前没有免费试用额度最低充值 ¥100。按上表折算¥100 大约够跑 3 万条 deepseek-v3.2 档位的数据——正好当一次完整的试水跑通流程、核对账单再决定要不要上量。本文所有价格都来自公开定价网页版https://147ai.com/pricing/ JSON 接口https://147ai.com/api/pricing和公开公式不需要你百分百相信本文内容——建议你发布任务前自己抓一遍实时价格进行核验公式对不上可以在评论区指出我们来进一步修正。六、如何用别家网关复现本文把代码里的base_url换成任意 OpenAI 兼容网关用同一批 instruction 跑同样的量对比三个东西①实际账单和标价是否一致 ②输出质量可用旗舰模型盲评③失败率与重试成本。欢迎在评论区贴复现结果有问题的也可以在评论区贴出我们会进行解答。价格为 2026-07-22 快照以https://147ai.com/api/pricing实时数据为准。