2026年10月10日
Jev AI 与 Laya、CLM-8B 等:2026 决策模型实地指南
八款 System One 风格决策模型横向对比:许可证、托管方式、成本交叉点,以及我们在 Jev 线上网关上实测的延迟数据。
全景一览
自 TypeSafe 在 2026 年 9 月发布 Jev 决策模型以来,一个由 System One 风格决策模型组成的小型生态已经出现 — 开放权重、托管 API,以及介于两者之间的各种形态。我们运营着 Jev 的托管网关,本指南是一张替代方案的实地地图:它们各自是什么、运行成本多少,以及什么时候托管路线更胜一筹。
- Jev(TypeSafe)— 托管 API;基于 /v1/systemone 契约,为每个答案提供校准概率。你通过 Optio 这类网关调用它。
- Laya(Convai Innovations)— 构建在 ModernBERT/mmBERT 之上的 Apache-2.0 编码器头部;你可以把它托管在 CPU、GPU 或 Apple Silicon 上;多语言 checkpoint 覆盖的不止英语。
- OpenJev — 开放、自托管;DiffusionGemma 版本除文本外还能回答关于图像的问题。
- SemIf(TheoLeeCJ)— MIT 许可证;从冻结的开源 LLM 的 logits 中读取类型化决策,温度参数按工作负载自行拟合。(该项目曾用名是 OpenJev。)
- AnyJev(Nokia Applied Research)— Apache-2.0;从基础 LLM 的隐藏状态中获得免训练决策,由你自己部署服务。
- Kev(Jared Palmer)— Apache-2.0 的 Qwen 微调模型,说同样的 /v1/systemone 请求,从 0.8B 的 Mac 尺寸 checkpoint 起步。
- CLM-8B(Contrastive-LM)— 构建在冻结的 Qwen3-8B 编码器之上的 Apache-2.0 对比学习头部;对候选打分并排序,最多可达约一千个。
- Liquid d1(LiquidAI)— 边缘尺寸的决策模型(600M 全模态含视觉与音频,3B 文本+视觉),从 LFM2.5 基座微调而来;提供 llama.cpp 用的 GGUF 构建。
真实调用下的延迟
我们在一个工作日从单一客户端区域对托管的 Jev 网关进行了实测:16 次连续线上调用,覆盖单问题和多问题请求。报告的 latency_ms 集中在 400–560 ms,中位数接近 445 ms;空闲后的首次调用偶现 ~3 s 的冷启动。请根据你自己区域的 p99 设计超时,而不是任何单次测量 — 包括我们的。
成本交叉点
托管积分按用量计费:每 1,000 输入 token 1 积分,每次请求最低 1 积分,输出 token 免费 — Starter 上是 $0.0001 量级,即 $10 买 100,000 永不过期的积分。自托管开源模型的成本是算力加运维:过了常驻 GPU 这一关,边际成本接近零,外加你的模型家族所要求的标注或校准工作。
比较过两条路线的团队得出一条经验法则:每天低于几千次决策,托管几乎总是赢。交叉点位于每天持续数万次之上,而且是在你的验证集完成之后才谈得上。数据驻留要求会移动这条线 — 如果数据不能离开你的机器,无论托管多便宜,它都直接出局。
需要谨慎看待的声明
- CLM-8B 的发布方基准显示:与 Jev 零样本打平的同时延迟最高低 9×;在约 1,000 个候选下配合状态/动作缓存达到 13×;在 DeepSWE(81.6%)和 Terminal-Bench 2.1(87.6%)上以 4–6× 于 Jev 的速度拿到微调验证器的 SOTA。数字是真的 — 但缓存收益需要你运营热缓存,SOTA 成绩需要在你的任务上微调头部。
- Liquid d1 的权重在 Hugging Face 上的许可证字段是 "other",不是标准开源许可证。在用它上线产品之前,先读一遍实际条款。
- AnyJev 的答案继承你基础 LLM 的盲区:每次更换基础模型都会重新打开校准问题。
- 在你用自己的标签微调之前,Laya 的零样本基座无法在你的任务上顶替托管的 Jev。
无论选哪个,切换模型前先在你自己的十个真实案例上重新验证阈值 — 发布方的基准测的是别人的任务。
一个下午如何做选择
- 想要零运维、密钥、积分加一个仪表盘?通过网关使用托管 Jev。
- 需要权重待在你的 VPC 里,或者对上千个候选做排序?CLM-8B 或开放编码器家族。
- 在边缘需要视觉或音频输入?Liquid d1 是小模型的那个细分答案;Jev 只做文本。
- 已经在全天候运行一个开源 LLM?SemIf 或 AnyJev 无需引入新供应商就能加上类型化决策。
CLM-8B 比 Jev 好吗?
在其发布方的基准上,打平的同时延迟低得多 — 这是关于他们的任务和硬件的声明。对你而言,用十个真实案例同时跑两个模型,比较低置信率。
哪个决策模型最便宜?
每天低于几千次决策,托管积分 $10 起。在你已有的硬件上持续高负载运行时,开放权重接近零边际成本 — 前提是先完成运维和校准工作。
这份指南与 TypeSafe 有关系吗?
没有。Optio 是一个独立运营的 Jev 调用网关,与 TypeSafe 或本文涉及的任何模型均无关联;关于第三方模型的事实信息来自它们自己的文档。
试试 Jev AI Playground ,读完这篇指南就发出你的第一次免费决策。