10 de out. de 2026

Jev AI vs Laya, CLM-8B e os demais: um guia de campo 2026 de modelos de decisão

Oito modelos de decisão no estilo System One comparados: licenças, hospedagem, pontos de virada de custo e os números de latência que medimos no gateway do Jev em produção.

O panorama de relance

Desde que a TypeSafe lançou o modelo de decisão Jev em setembro de 2026, surgiu um pequeno ecossistema de modelos de decisão no estilo System One — pesos abertos, APIs hospedadas e tudo entre os dois. Operamos um gateway hospedado para o Jev, e este guia é um mapa de campo das alternativas: o que cada uma é, quanto custa para rodar e quando o caminho hospedado vence.

  • Jev (TypeSafe) — API hospedada; probabilidades calibradas por resposta sobre o contrato /v1/systemone. Você o chama por gateways como o Optio.
  • Laya (Convai Innovations) — cabeças de encoder Apache-2.0 sobre ModernBERT/mmBERT; você hospeda em CPU, GPU ou Apple Silicon; um checkpoint multilíngue cobre mais que inglês.
  • OpenJev — aberto, auto-hospedado; o build DiffusionGemma responde perguntas sobre imagens além de texto.
  • SemIf (TheoLeeCJ) — MIT; decisões tipadas lidas dos logits de um LLM aberto congelado, com uma temperatura que você ajusta por carga de trabalho. (Um nome anterior do projeto era OpenJev.)
  • AnyJev (Nokia Applied Research) — Apache-2.0; decisões sem treinamento a partir dos estados ocultos de um LLM base, servidas por você.
  • Kev (Jared Palmer) — fine-tunes Qwen Apache-2.0 que falam a mesma requisição /v1/systemone, de um checkpoint de 0.8B tamanho Mac para cima.
  • CLM-8B (Contrastive-LM) — cabeças contrastivas Apache-2.0 sobre um encoder Qwen3-8B congelado; pontua candidatos e ranqueia até cerca de mil deles.
  • Liquid d1 (LiquidAI) — modelos de decisão de tamanho edge (600M omni com visão e áudio, 3B texto+visão) afinados a partir de bases LFM2.5; builds GGUF para llama.cpp.

Latência real de chamadas ao vivo

Medimos o gateway hospedado do Jev a partir de uma única região de cliente em um dia útil: 16 chamadas ao vivo sucessivas cobrindo requisições de uma pergunta e de várias perguntas. A latency_ms reportada se concentrou entre 400–560 ms com mediana perto de 445 ms; a primeira chamada após um período ocioso mostrou uma partida a frio ocasional de ~3 s. Projete seu timeout a partir do p99 da sua própria região, não de uma medição isolada — inclusive a nossa.

O ponto de virada de custo

Créditos hospedados são por uso: 1 crédito por 1,000 tokens de entrada, mínimo 1 por requisição, tokens de saída grátis — escala de $0.0001 no Starter, que é $10 por 100,000 créditos que nunca expiram. Auto-hospedar modelos abertos é computação mais operações: custo marginal quase zero depois de uma GPU sempre ligada, mais o trabalho de rotulagem ou calibração que a sua família de modelos exige.

Uma regra prática de equipes que compararam os dois: abaixo de alguns milhares de decisões por dia, o hospedado vence quase sempre. O ponto de virada fica acima de dezenas de milhares por dia de forma sustentada, e só depois que o seu conjunto de validação estiver pronto. Requisitos de residência de dados movem a linha — se os dados não podem sair das suas máquinas, o caminho hospedado está desclassificado não importa o custo.

Onde os claims pedem cuidado

  • Os benchmarks do publicador do CLM-8B mostram paridade zero-shot com o Jev a até 9× menos latência, 13× com cache de estado/ação a cerca de 1,000 candidatos, e estado da arte de verificador afinado no DeepSWE (81.6%) e Terminal-Bench 2.1 (87.6%) a 4–6× a velocidade do Jev. Números reais — mas os ganhos de cache exigem caches quentes que você opera, e as linhas SOTA exigem afinar as cabeças na sua tarefa.
  • Os pesos do Liquid d1 trazem um campo de licença "other" no Hugging Face, não uma licença aberta padrão. Leia os termos reais antes de lançar um produto sobre ele.
  • As respostas do AnyJev herdam os pontos cegos do seu LLM base: cada troca de modelo base reabre a questão da calibração.
  • A base zero-shot do Laya não vai substituir o Jev hospedado na sua tarefa até você afiná-lo com seus próprios rótulos.

Escolha o que escolher, revalide os limiares nos seus dez casos reais antes de trocar de modelo — benchmarks de publicador são a tarefa de outra pessoa.

Como escolher em uma tarde

  • Precisa de zero operações, chaves, créditos e um dashboard? Jev hospedado por um gateway.
  • Precisa dos pesos dentro da sua VPC, ou de ranking sobre mil candidatos? CLM-8B ou uma família de encoders aberta.
  • Precisa de entradas de visão ou áudio na borda? Liquid d1 é o nicho do modelo pequeno; o Jev continua só texto.
  • Já serve um LLM aberto 24 horas por dia? SemIf ou AnyJev adicionam decisões tipadas sem um novo fornecedor.

O CLM-8B é melhor que o Jev?

Nos benchmarks do publicador dele, paridade com latência muito menor — uma afirmação sobre as tarefas e o hardware deles. Para você, rode dez casos reais pelos dois e compare as taxas de baixa confiança.

Qual modelo de decisão é o mais barato?

Abaixo de alguns milhares de decisões por dia, créditos hospedados a partir de $10. Em volume alto sustentado em hardware que você já roda, pesos abertos se aproximam do custo marginal zero — depois do trabalho de operações e calibração.

Este guia tem vínculo com a TypeSafe?

Não. O Optio é um gateway operado de forma independente para chamar o Jev, sem vínculo com a TypeSafe nem com nenhum modelo coberto aqui; os fatos sobre modelos de terceiros vêm da documentação deles.

Teste o playground do Jev AI para enviar sua primeira decisão gratuita depois de terminar este guia.