10 oct 2026

Jev AI frente a Laya, CLM-8B y el resto: guía de campo 2026 de modelos de decisiones

Ocho modelos de decisiones al estilo System One comparados: licencias, alojamiento, cruces de costos y las cifras de latencia que medimos en la pasarela de Jev en producción.

El panorama de un vistazo

Desde que TypeSafe lanzó el modelo de decisiones Jev en septiembre de 2026, ha aparecido un pequeño ecosistema de modelos de decisiones al estilo System One — pesos abiertos, API alojadas y todo lo intermedio. Operamos una pasarela alojada para Jev, y esta guía es un mapa de campo de las alternativas: qué es cada una, qué cuesta ejecutarla y cuándo gana la vía alojada.

  • Jev (TypeSafe) — API alojada; probabilidades calibradas por respuesta sobre el contrato /v1/systemone. La llamas a través de pasarelas como Optio.
  • Laya (Convai Innovations) — cabezas de encoder Apache-2.0 sobre ModernBERT/mmBERT; las alojas tú en CPU, GPU o Apple Silicon; un checkpoint multilingüe cubre más que inglés.
  • OpenJev — abierto, autoalojado; la build DiffusionGemma responde preguntas sobre imágenes además de texto.
  • SemIf (TheoLeeCJ) — MIT; decisiones tipadas leídas de los logits de un LLM abierto congelado, con una temperatura que ajustas por carga de trabajo. (Un nombre anterior del proyecto fue OpenJev.)
  • AnyJev (Nokia Applied Research) — Apache-2.0; decisiones sin entrenamiento a partir de los estados ocultos de un LLM base, servidas por ti.
  • Kev (Jared Palmer) — fine-tunes de Qwen Apache-2.0 que hablan la misma petición /v1/systemone, desde un checkpoint de 0.8B tamaño Mac hacia arriba.
  • CLM-8B (Contrastive-LM) — cabezas contrastivas Apache-2.0 sobre un encoder Qwen3-8B congelado; puntúa candidatos y clasifica hasta aproximadamente mil de ellos.
  • Liquid d1 (LiquidAI) — modelos de decisiones de tamaño edge (600M omni con visión y audio, 3B texto+visión) afinados desde bases LFM2.5; builds GGUF para llama.cpp.

Latencia real de llamadas en vivo

Medimos la pasarela alojada de Jev desde una única región de cliente en un día laborable: 16 llamadas en vivo sucesivas que cubrían peticiones de una pregunta y de varias. La latency_ms reportada se agrupó en 400–560 ms con una mediana cercana a 445 ms; la primera llamada tras un periodo de inactividad mostró un arranque en frío ocasional de ~3 s. Diseña tu timeout a partir del p99 de tu propia región, no de una medición aislada — incluida la nuestra.

El cruce de costos

Los créditos alojados son por uso: 1 crédito por cada 1,000 tokens de entrada, mínimo 1 por petición, tokens de salida gratis — escala de $0.0001 en Starter, que son $10 por 100,000 créditos que nunca caducan. Autoalojar modelos abiertos es cómputo más operaciones: costo marginal casi nulo una vez encendido un GPU las 24 horas, más el trabajo de etiquetado o calibración que exija tu familia de modelos.

Una regla práctica de equipos que compararon ambas vías: por debajo de unos pocos miles de decisiones al día, lo alojado gana casi siempre. El cruce queda por encima de decenas de miles diarios sostenidos, y solo después de terminar tu conjunto de validación. Los requisitos de residencia de datos mueven la línea — si los datos no pueden salir de tus máquinas, la vía alojada queda descartada sin importar el costo.

Dónde conviene cuidado con las afirmaciones

  • Los benchmarks del editor de CLM-8B muestran paridad zero-shot con Jev a hasta 9× menos latencia, 13× con caché de estado/acción a unos 1,000 candidatos, y estado del arte de verificador afinado en DeepSWE (81.6%) y Terminal-Bench 2.1 (87.6%) a 4–6× la velocidad de Jev. Números reales — pero las ganancias de caché exigen cachés calientes que operas tú, y las cifras SOTA exigen afinar las cabezas en tu tarea.
  • Los pesos de Liquid d1 llevan un campo de licencia "other" en Hugging Face, no una licencia abierta estándar. Lee los términos reales antes de lanzar un producto sobre él.
  • Las respuestas de AnyJev heredan los puntos ciegos de tu LLM base: cada cambio de modelo base reabre la cuestión de la calibración.
  • La base zero-shot de Laya no sustituirá a Jev alojado en tu tarea hasta que la afines con tus propias etiquetas.

Elijas lo que elijas, revalida los umbrales en tus propios diez casos reales antes de cambiar de modelo — los benchmarks del editor son la tarea de otro.

Cómo elegir en una tarde

  • ¿Necesitas cero operaciones, llaves, créditos y un panel? Jev alojado a través de una pasarela.
  • ¿Necesitas los pesos dentro de tu VPC, o ranking sobre un millar de candidatos? CLM-8B o una familia de encoders abierta.
  • ¿Necesitas entradas de visión o audio en el borde? Liquid d1 es el nicho del modelo pequeño; Jev sigue siendo solo texto.
  • ¿Ya sirves un LLM abierto las 24 horas? SemIf o AnyJev añaden decisiones tipadas sin un proveedor nuevo.

¿Es CLM-8B mejor que Jev?

En los benchmarks de su editor, paridad con mucha menos latencia — una afirmación sobre sus tareas y su hardware. Para ti, pasa diez casos reales por ambos y compara las tasas de baja confianza.

¿Qué modelo de decisiones es el más barato?

Por debajo de unos pocos miles de decisiones al día, créditos alojados desde $10. A volumen alto sostenido en hardware que ya operas, los pesos abiertos se acercan al costo marginal cero — después del trabajo de operaciones y calibración.

¿Esta guía está afiliada a TypeSafe?

No. Optio es una pasarela operada de forma independiente para llamar a Jev, sin afiliación con TypeSafe ni con ningún modelo tratado aquí; los datos sobre modelos de terceros provienen de su propia documentación.

Prueba el playground de Jev AI para enviar tu primera decisión gratis cuando termines esta guía.