Laya官网
Laya 是一款面向开发者与智能体系统的开源 System One(快系统)决策模型,由 Convai Innovations 创始人 Nandakishor Mukkunnuth 开发,2026 年 9 月以 Apache 2.0 协议开源,官网为 laya.convaiinnovations.com。它切入的是一个被长期忽视的环节:业务系统里大量「只要一个判断」的任务——这条工单该分给谁、这段文本有没有风险、这轮对话值不值得存进知识库——过去都被交给自回归大模型逐字生成,单次要等 1.5 秒以上,而且模型给的置信度往往是拍脑袋的数字。
Laya 的解法是彻底放弃文本生成能力。它接收一段状态数据(邮件、工单、JSON 记录)搭配一组结构化问题,在单次前向传播中直接输出带校准概率的类型化判断,单条问题在单张 Tesla T4 显卡上的中位延迟约 32.8 毫秒,批量 50 个问题时整体吞吐可达每秒 103 至 332 次判断。
Laya 官网首页:项目由 Convai Innovations 创始人单人开发,站内公开了完整基准测试与训练细节
Laya的主要功能
- 三种结构化决策原语:choice 做候选选项选择,输出选中项、每个选项概率与整体置信度,适合工单分派、意图分类;score 在有序等级标尺上打分,输出期望分值与概率分布,适合紧急度分级、风险等级评估;noul 输出经过校准的 P(true) 真实概率,适合垃圾邮件识别、提示注入检测、流失风险判断。同一次请求中的所有问题会并行算完,不需要逐个调用;
- Router 多语言自动路由:内置路由组件用纯 Python 检测输入语种与字符脚本,耗时低于 0.5 毫秒,再自动选择最合适的权重并返回判定理由。官方文档解释了这个设计的必要性:英文版主干遇到非拉丁文字时表现会塌陷,在高棉语上曾出现置信度 0.952、准确率 0.000 的极端情况,模型对自己的错误依然自信;
- 概率经过数学校准:训练算法 RLCD 把强化学习的奖励函数换成概率论中的严格真评分规则。这类规则在数学上已被证明——汇报诚实的后验概率是收益最大化的唯一策略。按业务数据重拟合温度系数后,平均 ECE(概率校准误差,越低越好)可降至 0.081,而同类闭源方案为 0.246;
- 四套开箱即用的业务预设:模型路由、提示词护栏、内容安全审核、客服工单分诊,安装后可直接调用,不必从零设计问题结构;
- 三套权重与懒加载策略:英文原版、多语言版、业务微调版共用一个安装包,权重在首次调用时按需从 Hugging Face 拉取,不会一次性占满磁盘。
官方对比图:公开数据集准确率、单条时延、概率校准与多语言覆盖度,Jev 一方数据来自第三方公开基准
如何使用Laya
使用流程如下:
- 安装依赖:本地准备好 Python 环境后执行 pip install laya,包内同时包含三套权重,不需要额外下载;
- 初始化路由与定义问题:导入 laya 与 Router,用 Router(preload=True) 初始化服务。把业务数据放进 state,再按 choice、score、noul 三类描述要问的问题。例如一封重复扣费的客诉邮件,可以一次性问出「该由哪个团队处理」(choice)、「紧急程度」(score)、「是否存在流失风险」(noul),三问共用一次前向计算;
- 按业务阈值编写控制流:模型只输出概率,是否自动放行、是否转人工由调用方代码定义。典型写法是把置信度门槛设在 0.85,高于门槛直接路由,低于门槛升级人工复核,避免模型自行决定处置方式;
- 上线前做好两项设置:一是开启预加载,官方文档指出 checkpoint 冷启动重建在 CPU 上约 7.4 秒、GPU 上约 10.3 秒,默认懒加载策略下多语言流量交替出现时会每换一次语言就重建一次模型;二是用自有业务数据按「问题类型—选项数量」重新拟合温度系数,否则出厂校准误差偏高,概率不能直接采信;
- 先在线试用再决定部署:官方在 Hugging Face 提供了 Demo 空间,不用配置本地环境就能输入文本、定义问题、查看返回的选项与概率分布,适合先验证思路。
Hugging Face 上的 Laya 模型主页:三套权重均以 Apache 2.0 开放,并提供在线试用入口
Laya的使用场景
- 客服与工单系统:工单自动分派、紧急程度打分、用户流失风险预判。这类判断量大、单次价值低但对响应速度敏感,正是 System One 模型最划算的位置;想做大范围智能体调度,可参考文心智能体平台 AgentBuilder这类平台的组织方式;
- 安全与合规审核:安全分级、告警路由、违规内容识别、提示注入检测。由于概率经过数学校准,可以直接用阈值兜底,不必担心模型自信地判错——这是它相对普通大模型最实际的价值;
- 智能体路由:在请求进入主模型之前先完成分层判断,决定交给轻量模型还是前沿模型,让在主模型还没开始生成时就并行预热环境与权限校验,把等待时间压平;
- 知识与记忆过滤:作为前置哨兵判断一段对话是否值得沉淀进知识库。官方实测中对纯进度汇报类内容的提炼概率低至 0.0016,过滤率约 99.8%,非常适合长期运行的智能体做记忆管理。同类落地可参考WeKnora(腾讯开源知识库平台);
- 专业记录定级:公开实践记录中,有开发者把它接入药品生产过程记录的合规审核,对现场记录做严重/主要/一般定级并判断是否转人工复核。对比关键词规则(遇到口语化描述会漏判)与传统大模型方案(单次 1.8 至 2.3 秒、置信度无法量化),Laya 把单次判断压到 150 至 230 毫秒并给出可量化的复核概率;
- 本地 AI 智能体集成:作为轻量决策层嵌进本地智能体流程,替代那部分只做分类判断的大模型调用。如果你正在搭本地智能体,OpenClaw 本地 AI 智能体是一个可以对照的组合方案。
官方基准测试:51 种语言的准确率分布、单张 T4 显卡时延、与闭源方案在公开数据集上的对比、温度重拟合前后的校准误差
Laya与同类工具的对比
Laya 最直接的对照物是 TypeSafe 的闭源商业方案 Jev,两者做的都是 System One 结构化决策,提问原语也基本对齐,差别集中在开放性、速度和成本三个维度。
- 权重与部署方式:Jev 只提供闭源 API、没有本地权重;Laya 以 Apache 2.0 开放全部权重,支持私有化部署,单张 T4 甚至消费级显卡即可运行;
- 响应速度:官方实测 Laya 单条问题中位延迟 32.8 毫秒,Jev 被第三方测得为 236 至 276 毫秒,前者快约 7.8 倍;
- 公开数据集准确率:typed-decisions(2000 次决策)上 Laya 0.766 对 Jev 0.727;AG News 四分类 0.950 对 0.910;DAIR Emotion 六分类 0.595 对 0.480;
- 概率校准:Laya 重拟合温度后 ECE 为 0.081,Jev 为 0.246。官方指出在 DAIR Emotion 测试集上,Jev 对 16% 的样本给正确标签输出了 0 概率,这对任何依赖置信度做分支的业务都是硬伤;
- 多语言能力:Laya 在 51 种语言中有 45 种可用,Jev 未发布多语言基准;
- 成本结构:Jev 按每百万输入 Token 0.042 美元计费且不可微调;Laya 自托管零 Token 成本,并支持业务侧用自有数据二次微调。
同时也要客观说明 Jev 仍然领先的地方:在超过 20 个选项的高基数标签任务上(如 Banking77 上 0.870 对 0.425),在软标签分布匹配上(0.580 对 0.471),以及在未经温度重拟合的出厂原始校准上(0.144 对 0.213)。Laya 官方在文档中主动承认了这些差距,并建议高基数选项场景下调整标记预算或继续使用闭源方案。
Laya:产品价格与版本
- 开源版本(免费):全部权重、代码、基准测试脚本与训练 notebook 均以 Apache 2.0 协议开放,可免费商用,本地部署不产生任何按量计费;
- laya(英文原版):主干为 ModernBERT-large,421M 参数,上下文窗口 512,适合纯英文业务场景;
- laya-multilingual(多语言版):主干为 mmBERT-base,322M 参数,上下文窗口 1024,覆盖 100 多种语言,推理速度约为英文版两倍,是参数最轻、时延最低的一套;
- laya-typed-decisions(业务微调版):在英文版基础上针对工单流转、安全、客服分流、链路观测四类业务流程做过专项微调,官方推荐的生产首选权重;
- 硬件门槛:单张 Tesla T4 即可运行,纯 CPU 环境单条问题约 193 至 464 毫秒,适合轻量后台任务;作为参照,闭源方案按每百万输入 Token 0.042 美元计费。
Laya的常见问题解答
- Laya 和普通大模型的区别是什么?
- 最根本的区别是 Laya 不生成文本。大模型即使只回答一个是非题也要走完整的自回归生成流程并输出 JSON,Laya 则是单次前向传播直接给出结构化结果。带来的差异是三方面的:速度快一个数量级、不存在生成类幻觉与格式解析失败、概率输出经过数学校准因而具备统计意义。代价是它不具备写作、摘要、对话等任何生成能力。
- Laya 能直接拿来上线生产吗?
- 不建议零样本直接使用。官方在模型说明中写明,基础权重在 typed-decisions 数据集上的零样本准确率仅 0.362,接近随机基线;宣传中的 0.766 来自针对该基准训练集微调过的权重。项目对自身的定位是「适合继续二次微调的快速底座,而不是开箱即用的零样本决策引擎」,生产落地建议使用 typed-decisions 权重并完成温度校准。
- Laya 的选项数量有上限吗?
- 有,且这是它相对闭源方案明显落后的一项。所有候选选项共享固定的标记预算,选项过多时每个标签分到的 Token 太少,准确率会快速衰减。官方建议 choice 类问题的候选控制在 20 个以内,超出时应拆成粗选与精选两级流程。在 Banking77 这类 70 多个标签的任务上,Laya 的 0.425 明显落后于闭源方案的 0.870。
- Laya 需要什么硬件才能跑?
- 门槛不高。官方数据在单张 Tesla T4 上单条问题中位延迟 32.8 毫秒,批量 50 个问题时吞吐可达每秒 103 至 332 次判断;消费级显卡同样可以运行,纯 CPU 环境下单条约 193 至 464 毫秒,适合对时延不敏感的轻量后台任务。
Laya官网网址
Laya官网入口网址:https://laya.convaiinnovations.com/
相关资源:项目源码托管在 GitHub 的 NandhaKishorM/laya 仓库;权重发布在 Hugging Face 的 convaiinnovations 组织下,分为 laya、laya-multilingual、laya-typed-decisions 三个仓库;Python 包名为 laya,可通过 PyPI 安装;在线试用入口位于 Hugging Face Spaces 的 laya-demo 空间。想先了解开源模型生态,可以看魔搭ModelScope开源模型即服务平台;需要完整的本地部署流程参考,清华开源模型ChatGLM-6B可本地是很好的入门起点。
Laya值得用吗
判断 Laya 值不值得用,关键看你的业务里有没有「判断量已经大到开始心疼 API 费用」的场景。如果只是偶尔调用,自建一套本地服务并不划算;但当工单分流、内容审核、提示注入防护这类判断每天要跑十万次以上时,用 33 毫秒、零 Token 成本的本地模型替换掉部分大模型调用,节省的是实打实的持续成本,同时数据也不必出机器。
它的短板同样清楚:零样本能力弱,必须先微调再上线;选项数量受标记预算限制,高基数分类仍需拆分流程;小语种存在置信度虚高现象,需要 Router 前置校验输入有效性。所以它更适合作为大模型栈外围的决策层,而不是替代品——把它放在主模型前面做路由和初筛,把拿不准的交给大模型和人工,这个分工是它设计时就规划好的。
从项目本身来看,一个人用一年时间做出并开源完整的决策模型家族,把权重、代码、基准测试和训练 notebook 全部公开,每一项性能声明都可以被复现和检验,这种透明度在当前的技术发布环境里并不多见,也让评估成本变得很低——装个包、跑一次基准,就能知道它在你的数据上到底行不行。
数据统计
数据评估
本站Home提供的Laya决策模型都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由Home实际控制,在2026年 9月 21日 上午9:16收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,Home不承担任何责任。


