CLM-8B — 用打分而非生成的开放决策模型
CLM-8B(Contrastive-LM v0.1)是构建在冻结 Qwen3-8B 编码器之上的 Apache-2.0 决策模型:Noul、Choice 与 Score 问题、候选排序,以及在其自设基准上比 Jev 低数倍的已公布延迟数字。它是什么、如何运行、以及该对什么保持怀疑。
CLM-8B 是什么
CLM(Contrastive Language Model)是 Contrastive-LM 组织于 2026 年 9 月 21 日前后在 Hugging Face 上发布的决策模型家族 — 模型卡列出了 Jacky Kwok、Hangoo Kang、Tarun Suresh、Jon Saad-Falcon、Marco Pavone、Christopher Ré 与 Azalia Mirhoseini。CLM-v0.1-8B 是装在冻结 Qwen3-8B 编码器之上的两个小型投影头(状态头与动作头),以双向 InfoNCE 对比目标训练。Apache-2.0 许可,它在 Hugging Face 上的标签为 text-ranking、verifier 与 reranker。
它做打分;从不生成
与 Jev 一样,CLM 讲 System One 问题词汇 — Noul(yes/no)、Choice(从带标签的选项中挑选)与 Score(放到量表上)— 外加一个 rank() 调用,用于在大集合上做自由候选排序(模型卡引用最多约 1k 候选)。输出是在你所提供候选之上的概率分布。不做任何生成,这正是 temperature 在其文档里从不出现的原因。
已公布数字的审慎解读
模型卡声称:在 computer-use、gaming 与 tool-calling 负载上与 Jev zero-shot 持平、延迟最多低 9×;配合 state 与 action 缓存及约一千候选时快 13×;微调成 verifier 后在 DeepSWE(81.6%)与 Terminal-Bench 2.1(87.6%)上取得 SOTA、速度为 Jev 的 4–6×。引用这些数字之前有两个提醒:SOTA verifier 数字需要对那些头做微调,而缓存加速依赖保持温热的嵌入缓存 — 那是你自建服务要解决的问题,不是随权重附带的属性。
如何运行它
用 pip 安装 contrastive-lm,用 vLLM 承载冻结的 Qwen3-8B 编码器(一个 --runner pooling 服务),再运行 clm-serve,它会在 8700 端口提供 API 与本地 playground。社区已有适用于 Apple Silicon 与 llama.cpp 的 GGUF 与 MLX 量化。在实践中你运营的是一个推理栈:GPU 时间、容量、模型版本与值班都是你的,换来的是拥有权重与数据路径。
值得指名的局限
CLM-8B 与编码器绑定 — 它需要 Qwen3-8B 的 last-token-pooled 嵌入,换基础模型意味着重做整个栈。它不生成文本。它的头牌 verifier 成绩是微调得来的,不是 zero-shot。多模态的 CLM-35B 已宣布将于十月上旬发布。并且和每个决策模型一样,它的概率需要先在你自己的案例上验证,才能让任何东西自动批准。
常见问题
- CLM-8B 与 Jev 有关系吗?
- 两者瞄准同一问题 — 带有界答案空间的类型化决策 — 且 CLM 发布方对标了 Jev,但它们是相互独立的模型:CLM-8B 是 Apache-2.0 开放权重、装在冻结 Qwen3-8B 编码器之上、对候选本地打分;Jev 是 TypeSafe 的托管决策模型。
- 能免费运行 CLM-8B 吗?
- 权重可免费下载(Apache-2.0),8B 检查点可经社区 MLX/GGUF 构建在 Apple Silicon 上运行。真正不免费的是运营它:配合 clm-serve 的 vLLM 嵌入服务栈、容量规划,以及任何改动之后的重新校准核查。
- Optio 托管 CLM-8B 吗?
- 不托管。Optio 调用 Jev。这个页面存在是因为 CLM-8B 讲相同的决策词汇,而比较类型化决策模型的人值得得到诚实的描述,而不是一张营销页。
- CLM-8B 对比 Jev — 我该用哪个?
- 若要求是零运维、带 key 与积分的托管决策:通过 Optio 用 Jev。若你想把权重放进自己的环境、在大集合上做候选排序、或在自有硬件上追求最低延迟:CLM-8B。在切换任何东西之前,用你自己的十个案例比较两者。