2026/10/10
Jev AI と Laya、CLM-8B など:2026 年の意思決定モデル実地ガイド
System One 系の意思決定モデル 8 種を比較:ライセンス、ホスティング、コストの損益分岐点、そして公開中の Jev ゲートウェイで実測したレイテンシ数値。
全体像をひと目で
TypeSafe が 2026 年 9 月に Jev 意思決定モデルを出荷して以来、System One 系の意思決定モデルを中心とする小さなエコシステムが登場しました — オープンウェイト、ホステッド API、そしてその中間のさまざまな形態です。私たちは Jev のホステッドゲートウェイを運用しており、このガイドは代替手段のフィールドマップです:それぞれが何で、実行コストはいくらか、そしていつホステッド選択が有利になるか。
- Jev(TypeSafe)— ホステッド API。/v1/systemone 契約に基づき、回答ごとにキャリブレーション済みの確率を返します。Optio などのゲートウェイ経由で呼び出します。
- Laya(Convai Innovations)— ModernBERT/mmBERT の上に載る Apache-2.0 エンコーダヘッド。CPU、GPU、Apple Silicon のいずれにも自己ホストできます。多言語チェックポイントは英語以外もカバーします。
- OpenJev — オープンでセルフホスト。DiffusionGemma ビルドはテキストに加えて画像に関する質問にも答えられます。
- SemIf(TheoLeeCJ)— MIT ライセンス。凍結したオープン LLM の logits から型付きの決定を読み取り、温度はワークロードごとに自分で合わせます。(このプロジェクトの旧名は OpenJev でした。)
- AnyJev(Nokia Applied Research)— Apache-2.0。ベース LLM の隠れ状態から学習不要の決定を行い、提供はあなた自身が行います。
- Kev(Jared Palmer)— 同じ /v1/systemone リクエストを話す Apache-2.0 の Qwen ファインチューン。0.8B の Mac サイズのチェックポイントから上位へと展開します。
- CLM-8B(Contrastive-LM)— 凍結した Qwen3-8B エンコーダ上の Apache-2.0 対照学習ヘッド。候補にスコアを付け、最大約 1,000 件までランク付けできます。
- Liquid d1(LiquidAI)— エッジサイズの意思決定モデル(ビジョンとオーディオ対応の 600M オムニ、テキスト+ビジョンの 3B)。LFM2.5 ベースからファインチューンされ、llama.cpp 向け GGUF ビルドを提供。
実呼び出しの実レイテンシ
ある営業日に、単一のクライアントリージョンからホステッド Jev ゲートウェイを測定しました:1 問と複数問のリクエストをカバーする 16 回の連続ライブ呼び出しです。報告された latency_ms は 400–560 ms に集中し、中央値は 445 ms 付近でした。アイドル後の最初の呼び出しでは、~3 s のコールドスタートがたまに発生しました。タイムアウトは単発の測定値(私たちの測定を含みます)からではなく、自分のリージョンの p99 から設計してください。
コストの損益分岐点
ホステッドクレジットは従量制です:入力トークン 1,000 につき 1 クレジット、リクエストごとに最低 1 クレジット、出力トークンは無料 — Starter では $0.0001 スケールで、これは失効しない 100,000 クレジットが $10 ということです。オープンモデルの自己ホストは計算資源と運用のコストです:常時稼働の GPU を用意してしまえば限界コストはほぼゼロ、加えてモデルファミリーが求めるラベリングやキャリブレーションの作業が発生します。
両者を比較したチームからの実用的な経験則:1 日数千件未満の決定なら、ほぼ常にホステッドが勝ちます。損益分岐点は 1 日あたり数万件の継続的な量を超えたあたりにあり、しかも検証セットが完成した後でしか到達しません。データレジデンシ要件はこの境界線を動かします — データをマシンから出せないなら、ホステッド経路はコストにかかわらず失格です。
主張に注意が必要な点
- CLM-8B の公開元ベンチマークでは、Jev とゼロショットで同等ながら最大 9× 低レイテンシ、約 1,000 候補での状態/アクションキャッシュにより 13×、そして DeepSWE(81.6%)と Terminal-Bench 2.1(87.6%)で Jev の 4–6× の速度によるファインチューン済み検証器の SOTA を達成としています。実数値です — しかしキャッシュの利得は自分で運用するウォームキャッシュが前提で、SOTA の数字は自分のタスクでのヘッドのファインチューニングが前提です。
- Liquid d1 のウェイトは Hugging Face でライセンス欄が "other" になっており、標準的なオープンライセンスではありません。製品に組み込む前に実際の条件を読んでください。
- AnyJev の回答はベース LLM の盲点を引き継ぎます:ベースモデルを入れ替えるたびに、キャリブレーションの問題が再度開きます。
- 自分のラベルでファインチューニングするまで、Laya のゼロショットベースは自分のタスクでホステッド Jev の代わりにはなりません。
どれを選ぶ場合でも、モデルを切り替える前に自分の 10 件の実案件でしきい値を再検証してください — 公開元のベンチマークは他人のタスクです。
ひと午後での選び方
- 運用ゼロ、キー、クレジット、ダッシュボードが必要ですか?ゲートウェイ経由のホステッド Jev。
- ウェイトを自分の VPC 内に置きたい、または 1,000 件超の候補のランク付けが必要ですか?CLM-8B かオープンエンコーダファミリー。
- エッジでビジョンやオーディオ入力が必要ですか?Liquid d1 が小規模モデルのニッチです。Jev はテキスト専用のままです。
- すでにオープン LLM を 24 時間体制で提供していますか?SemIf か AnyJev なら新しいベンダーを増やさずに型付き決定を追加できます。
CLM-8B は Jev より優れていますか?
公開元のベンチマーク上では、はるかに低いレイテンシで同等 — これは彼らのタスクとハードウェアについての主張です。あなた自身は、10 件の実案件を両方に通し、低確信率を比較してください。
最も安い意思決定モデルはどれですか?
1 日数千件未満なら、$10 からのホステッドクレジット。すでに稼働しているハードウェアでの継続的な高負荷なら、オープンウェイトは限界コストほぼゼロに近づきます — 運用とキャリブレーションの作業を終えた後で。
このガイドは TypeSafe と関係がありますか?
いいえ。Optio は Jev を呼び出すための独立運営のゲートウェイであり、TypeSafe にもここで扱ういずれのモデルとも提携していません。サードパーティモデルに関する事実は、それぞれのドキュメントに基づいています。
Jev AI Playground を試す。このガイドを読み終えたら、最初の無料の判断を送ってみましょう。