决策模型选型指南Jev、Kev、Laya 三层怎么排才不花冤枉钱【免费下载链接】layaNon-autoregressive System 1 decision engine. Typed choice, score and yes/no decisions over any text in a single forward pass, in 100 languages, with a router that picks the right checkpoint per request.项目地址: https://gitcode.com/gh_mirrors/lay/laya2026 年下半年System 1 决策模型从实验室概念变成了生产选型问题。先是 TypeSafe 推出闭源的 Jev——一个不聊天的 AI 模型号称比通用大模型快两个数量级随后开源社区用不到 48 小时密集复刻出以 Laya 为代表的一批方案智源、36Kr、53AI 等媒体连续报道33 毫秒比 Jev 快 4 倍零成本替代专有 API。热度之下真正困扰工程师的不是哪个模型更强而是这一层快判断究竟该由谁来做、做到什么程度才够用。社区讨论中反复出现的 Jev、Kev、Laya 三层说法本质上是一套决策成本分层通用 Agent 模型Jev 所代表的闭源 System 1 API→ 领域定制模型Kev 级可微调、可私有化→ 本地轻量决策引擎Laya 级单次前向、毫秒级。本文以 Laya 仓库laya/、docs/、BENCHMARKS.md的真实代码与实测数据为主线把三层链路、选型成本模型和 LoRA 微调的启动信号讲清楚。一、三层链路从通用到专用的决策成本光谱所谓三层不是三个并列产品而是一条随决策成本递增的链路。理解这条链路先看 Laya 自己的分层——它把快判断拆成了三个检查点由Router按请求动态选择见 laya/router.py检查点编码器参数量上下文定位englishModernBERT-large421M512纯英文快决策multilingualmmBERT-base322M1024可扩至 8192100 语言速度翻倍typed-decisionsModernBERT-large421M1024在四个 typed-decisions 工作流上微调关键在router.py的注释与BENCHMARKS.md的实测英文检查点离开英语后不是温和退化而是直接崩塌——20 选项 MASSIVE intent 上它对印地语只有 0.100、韩语 0.103随机基线 0.050并且崩塌时依然高置信原始 ECE 0.855。因此路由必须发生在前向之前且以脚本检测为主要信号from laya import Router router Router() # 首次使用才下载检查点Router(preloadTrue) 一次加载全部三个 state Hi, we were billed twice for March. Please refund the duplicate today or we will cancel our plan. questions { department: {type: choice, instructions: Which department should handle this?, criteria: {billing: invoices, payments, refunds, technical: bugs, outages, system errors, other: everything else}}, urgency: {type: score, instructions: How urgent is this?, criteria: [not urgent, soon, blocking]}, churn_risk: {type: noul, instructions: Does the user threaten to cancel or leave?}, } result router.predict(state, questions) print(result[answers][department][choice]) # billing print(result[routing][model]) # english这套模型内路由本身就是三层链路的第一层答案最便宜、最快的模型能搞定就不上贵的。路由带来的收益是量化的MASSIVE 意图识别上英文检查点英语 0.783、非英语 0.306laya-multilingual反之 0.657 / 0.451XNLI 非英语更是 21 分0.521 → 0.731。51 语言全量扫描里路由在 48/51 种语言上把准确率推到 3 倍随机以上。把视野从仓库拉远Kev 级对应的是在 Laya 这样可微调的基础模型上做领域定制——本质是决策成本光谱的中间段。三层排布逻辑可以这样概括Jev 层通用 System 1 API开箱即用、零样本多类泛化强但按调用计费、数据出境、延迟受网络支配。适合验证期和长尾冷启动。Kev 层领域定制模型在你的数据上微调出的专用决策头一次部署、多次推理成本从每次调用变成一次训练 每次推理私有偏好与术语都沉淀在权重里。Laya 层本地轻量引擎单次前向、无文本生成、32.8 ms 单题T4 实测见 BENCHMARKS.mdApache 2.0 完全开源最适合高频、低延迟、可接受的判定任务。二、基于决策成本的选型方法论先把钱花在不训练上三层链路最容易踩的坑是跳过提示词与链路优化直接上微调。仓库文档 docs/staged-adoption.md 给出了比训练更优先的落地顺序影子运行shadow→ 对比compare→ 策略policy→ 有界放量promote。这套方法论换算成成本模型就是四个递进台阶第一步零成本台阶——提示词与问题设计。Laya 的三种决策原语choice/score/noul把判定问题压缩进一次前向见 laya/structured.py。但docs/benchmarks.md与examples/README.md反复强调措辞和选项顺序会改变答案score是最弱原语noul可能跟随选项标签而非状态。先改问题、验证措辞成本为零。第二步链路升级台阶——路由、短名单、置信门控。高基数标签是 Laya 架构性的弱项Banking7777 标签只有 0.425而 Jev 发布数据是 0.870原因是选项共享固定的head_max_len预算77 个标签每个只剩约 4 个 token。仓库给出的解法不涉及训练——predict_shortlist先用嵌入召回 top-k或predict_tournament把标签分成 16 个一组打锦标赛后者把 Banking77 从 0.430 提到 0.610、CLINC150 从 0.625 提到 0.876README.md Honest limits 一节。置信门控同理min_confidence基于answer_confidence做戒断阈值本身是应用策略而非模型属性必须先拟合温度再谈阈值docs/staged-adoption.md。第三步微调台阶——明确到必须训练才动手。何时算必须社区共识收敛到三类信号格式强制决策必须输出严格受控的结构提示词无法保证、术语适配领域黑话、内部缩写导致语义漂移、私有偏好只有你的业务规则能定义对错提示词写不出权重。这三类之外先回到第一、二步。第四步部署台阶——量化与容器化。微调产物经 llama.cpp 转 GGUF、接 Ollama 或laya-serveHTTP 服务即可私有化推理参见 docs/fast-backends.md 与 docs/docker.md 的多后端与容器说明。这套方法论还有一个硬约束来自校准calibration。README 与 docs/finetune.md 反复强调出厂检查点高置信laya-multilingual甚至没有拟合温度ECE 必须在你自己的数据上拟合后才有意义。Jev 之所以被复刻潮盯上社区共识恰恰是它的护城河不在推理速度而在 RLCD 训练下的置信度校准——而校准依赖私有数据管线。Laya 把这层能力开源出来laya/calibrate.py的fit_temperature_map、fit_abstention_thresholds、fit_binning_map同时诚实标注需要在自己数据上验证这正是成本可控的前提没有校准的数字阈值与门控全是伪参数。三、LoRA 微调的启动信号三类信号到底指什么选型链条的终端是微调。仓库把微调做成了一行命令 一个 Python 循环laya/train_cli.py 的laya-train可以直接从 CSV/JSONL 出发laya-train --data tickets.csv --text-column body --label-column department \ --base english --out ./tickets-checkpoint微调的核心目标函数是 RLCDreinforcement learning against strictly proper scoring rulesGRPO 风格的策略梯度项每项 4 个采样探索噪声 0.4→0.1用 proper scoring rules 奖励 对教师分布的全权软交叉熵见 laya/train.py。它学习的是分布而非硬标签所以数据质量直接决定效果上限。回到那三类启动信号用仓库数据逐条锚定信号一格式强制。typed-decisions 基准是最好样本零样本时基础检查点接近随机0.362 / 0.352随机基线 0.318、多数类基线 0.461而微调后的laya-typed-decisions达到 0.766超过 Jev 发布值 0.727也超过教师自洽 0.735 的上限docs/finetune.md。必须把 6 类字段判定成严格 schema本身就是格式强制——提示词在这里补不上 0.4 个点的差距。注意 laya/router.py 的设计typed-decisions不会自动选中必须显式modeltyped-decisions或auto_task_detectionTrue因为它只在四个特定工作流上微调过不该成为静默默认——这同样是成本纪律。信号二术语适配。领域专用词会让零样本模型读不懂选项描述。仓库的例证是英文检查点在非英语上高置信地崩塌Khmer 0.000 准确率、0.952 原始置信见 BENCHMARKS.md——虽然那是语言问题而非术语但机制相同模型对不认识的分布自以为是。解决路径是微调而非继续堆提示词。--freeze-encoder仅训决策头适合小显存与--shuffle-options随机打乱选项顺序、对抗位置先验是两个针对性的旋钮实测shuffle-options在 20 选项任务上把准确率从 0.936 提到 0.941、顺序翻转敏感度从 0.187 压到 0.026docs/finetune.md。信号三私有偏好。只有你的业务规则能定义对错的判定信贷策略、合规分、内部路由既无公开数据也无提示词可描述。此时微调是把策略写进权重的唯一方式。仓库给出的落地约束很具体校准切片在训练前从数据中扣出最多 400 条或 10%只够拟合三个逐类型温度标量--eval在训练前后各评估一次写入train_report.json样本太少会触发温度停在 1.0和塌缩到类先验两类显式告警laya/train.py、docs/finetune.md。这些告警本身就是别浪费钱的信号灯。微调前必须做的事按顺序① 用--dry-run检查数据与跳过原因② 验证提示词与问题措辞改问题零成本③ 尝试短名单/锦标赛处理高基数④ 只有确认格式强制、术语适配、私有偏好三者至少占一才进入训练。训练后别忘校准与持出评估——微调报告了学到了什么你才有资格把它上线。四、结语三层排布的终极判断标准Jev、Kev、Laya 不是品牌选择题而是一条按边际成本递进的流水线能用提示词解决的不用模型能用路由解决的不用微调能用本地前向解决的不用 API 调用。Laya 的仓库价值不在于比 Jev 快 4 倍这个单一数字而在于它把三层链路的每一环都做成了可测量、可校准、可回滚的工程构件——从 51 语言路由的量化收益到 Honest limits 里每一条边界的明文标注再到微调循环内置的校准与告警。选型方法论的最后一条建议来自 docs/staged-adoption.md 的边界划分模型提供判定、概率、置信与 hook 事件应用拥有既有动作、放量策略、评审边界与回滚。钱花在让每一层各司其职上而不是花在让一个模型包办一切上——这才是三层链路真正的成本账。【免费下载链接】layaNon-autoregressive System 1 decision engine. Typed choice, score and yes/no decisions over any text in a single forward pass, in 100 languages, with a router that picks the right checkpoint per request.项目地址: https://gitcode.com/gh_mirrors/lay/laya创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考