10 de out. de 2026
Jev AI vs Laya, CLM-8B e os demais: um guia de campo 2026 de modelos de decisão
Oito modelos de decisão no estilo System One comparados: licenças, hospedagem, pontos de virada de custo e os números de latência que medimos no gateway do Jev em produção.
O panorama de relance
Desde que a TypeSafe lançou o modelo de decisão Jev em setembro de 2026, surgiu um pequeno ecossistema de modelos de decisão no estilo System One — pesos abertos, APIs hospedadas e tudo entre os dois. Operamos um gateway hospedado para o Jev, e este guia é um mapa de campo das alternativas: o que cada uma é, quanto custa para rodar e quando o caminho hospedado vence.
- Jev (TypeSafe) — API hospedada; probabilidades calibradas por resposta sobre o contrato /v1/systemone. Você o chama por gateways como o Optio.
- Laya (Convai Innovations) — cabeças de encoder Apache-2.0 sobre ModernBERT/mmBERT; você hospeda em CPU, GPU ou Apple Silicon; um checkpoint multilíngue cobre mais que inglês.
- OpenJev — aberto, auto-hospedado; o build DiffusionGemma responde perguntas sobre imagens além de texto.
- SemIf (TheoLeeCJ) — MIT; decisões tipadas lidas dos logits de um LLM aberto congelado, com uma temperatura que você ajusta por carga de trabalho. (Um nome anterior do projeto era OpenJev.)
- AnyJev (Nokia Applied Research) — Apache-2.0; decisões sem treinamento a partir dos estados ocultos de um LLM base, servidas por você.
- Kev (Jared Palmer) — fine-tunes Qwen Apache-2.0 que falam a mesma requisição /v1/systemone, de um checkpoint de 0.8B tamanho Mac para cima.
- CLM-8B (Contrastive-LM) — cabeças contrastivas Apache-2.0 sobre um encoder Qwen3-8B congelado; pontua candidatos e ranqueia até cerca de mil deles.
- Liquid d1 (LiquidAI) — modelos de decisão de tamanho edge (600M omni com visão e áudio, 3B texto+visão) afinados a partir de bases LFM2.5; builds GGUF para llama.cpp.
Latência real de chamadas ao vivo
Medimos o gateway hospedado do Jev a partir de uma única região de cliente em um dia útil: 16 chamadas ao vivo sucessivas cobrindo requisições de uma pergunta e de várias perguntas. A latency_ms reportada se concentrou entre 400–560 ms com mediana perto de 445 ms; a primeira chamada após um período ocioso mostrou uma partida a frio ocasional de ~3 s. Projete seu timeout a partir do p99 da sua própria região, não de uma medição isolada — inclusive a nossa.
O ponto de virada de custo
Créditos hospedados são por uso: 1 crédito por 1,000 tokens de entrada, mínimo 1 por requisição, tokens de saída grátis — escala de $0.0001 no Starter, que é $10 por 100,000 créditos que nunca expiram. Auto-hospedar modelos abertos é computação mais operações: custo marginal quase zero depois de uma GPU sempre ligada, mais o trabalho de rotulagem ou calibração que a sua família de modelos exige.
Uma regra prática de equipes que compararam os dois: abaixo de alguns milhares de decisões por dia, o hospedado vence quase sempre. O ponto de virada fica acima de dezenas de milhares por dia de forma sustentada, e só depois que o seu conjunto de validação estiver pronto. Requisitos de residência de dados movem a linha — se os dados não podem sair das suas máquinas, o caminho hospedado está desclassificado não importa o custo.
Onde os claims pedem cuidado
- Os benchmarks do publicador do CLM-8B mostram paridade zero-shot com o Jev a até 9× menos latência, 13× com cache de estado/ação a cerca de 1,000 candidatos, e estado da arte de verificador afinado no DeepSWE (81.6%) e Terminal-Bench 2.1 (87.6%) a 4–6× a velocidade do Jev. Números reais — mas os ganhos de cache exigem caches quentes que você opera, e as linhas SOTA exigem afinar as cabeças na sua tarefa.
- Os pesos do Liquid d1 trazem um campo de licença "other" no Hugging Face, não uma licença aberta padrão. Leia os termos reais antes de lançar um produto sobre ele.
- As respostas do AnyJev herdam os pontos cegos do seu LLM base: cada troca de modelo base reabre a questão da calibração.
- A base zero-shot do Laya não vai substituir o Jev hospedado na sua tarefa até você afiná-lo com seus próprios rótulos.
Escolha o que escolher, revalide os limiares nos seus dez casos reais antes de trocar de modelo — benchmarks de publicador são a tarefa de outra pessoa.
Como escolher em uma tarde
- Precisa de zero operações, chaves, créditos e um dashboard? Jev hospedado por um gateway.
- Precisa dos pesos dentro da sua VPC, ou de ranking sobre mil candidatos? CLM-8B ou uma família de encoders aberta.
- Precisa de entradas de visão ou áudio na borda? Liquid d1 é o nicho do modelo pequeno; o Jev continua só texto.
- Já serve um LLM aberto 24 horas por dia? SemIf ou AnyJev adicionam decisões tipadas sem um novo fornecedor.
O CLM-8B é melhor que o Jev?
Nos benchmarks do publicador dele, paridade com latência muito menor — uma afirmação sobre as tarefas e o hardware deles. Para você, rode dez casos reais pelos dois e compare as taxas de baixa confiança.
Qual modelo de decisão é o mais barato?
Abaixo de alguns milhares de decisões por dia, créditos hospedados a partir de $10. Em volume alto sustentado em hardware que você já roda, pesos abertos se aproximam do custo marginal zero — depois do trabalho de operações e calibração.
Este guia tem vínculo com a TypeSafe?
Não. O Optio é um gateway operado de forma independente para chamar o Jev, sem vínculo com a TypeSafe nem com nenhum modelo coberto aqui; os fatos sobre modelos de terceiros vêm da documentação deles.
Teste o playground do Jev AI para enviar sua primeira decisão gratuita depois de terminar este guia.