CLM-8B — el modelo de decisiones abierto que puntúa en vez de generar

CLM-8B (Contrastive-LM v0.1) es un modelo de decisiones Apache-2.0 construido sobre un codificador Qwen3-8B congelado: preguntas Noul, Choice y Score, ranking de candidatos y latencias publicadas varias veces menores que Jev en sus propios benchmarks. Qué es, cómo ejecutarlo y qué conviene mirar con escepticismo.

Qué es CLM-8B

CLM (Contrastive Language Model) es una familia de modelos de decisiones publicada en Hugging Face alrededor del 21 de septiembre de 2026 por la organización Contrastive-LM — la model card cita a Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré y Azalia Mirhoseini. CLM-v0.1-8B son dos pequeñas cabezas de proyección (una de estados y otra de acciones) sobre un codificador Qwen3-8B congelado, entrenadas con un objetivo contrastivo InfoNCE bidireccional. Es Apache-2.0, y sus etiquetas en Hugging Face son text-ranking, verifier y reranker.

Puntúa; nunca genera

Como Jev, CLM habla el vocabulario de preguntas System One — Noul (sí/no), Choice (elegir entre opciones etiquetadas) y Score (situar en una escala) — más una llamada rank() para ranking libre de candidatos sobre conjuntos grandes (la card cita hasta ~1k candidatos). La salida es una distribución de probabilidad sobre los candidatos que enviaste. No se genera nada, y por eso la temperatura no aparece en ninguna parte de su documentación.

Los números publicados, leídos con cuidado

La model card afirma paridad cero-shot con Jev en tareas de computer-use, gaming y tool-calling con hasta 9× menos latencia; con caché de estados y acciones y cerca de mil candidatos, 13× más rápido; y, una vez afinado como verificador, resultados de estado del arte en DeepSWE (81.6%) y Terminal-Bench 2.1 (87.6%) a 4–6× la velocidad de Jev. Dos advertencias antes de citar nada: los resultados SOTA de verificador requieren afinar las cabezas, y las aceleraciones por caché dependen de cachés de embeddings calientes — un problema operativo tuyo, no una cualidad que venga con los pesos.

Cómo ejecutarlo

Instala contrastive-lm con pip, sirve el codificador Qwen3-8B congelado con vLLM (un servidor --runner pooling) y lanza clm-serve, que expone una API y un playground local en el puerto 8700. Existen cuantizaciones GGUF y MLX de la comunidad para Apple Silicon y llama.cpp. En la práctica operas una pila de inferencia: tiempo de GPU, capacidad, versionado del modelo y guardia son tuyos, a cambio de poseer los pesos y la ruta de datos.

Limitaciones que conviene nombrar

CLM-8B está anclado al codificador — necesita los embeddings de último token de Qwen3-8B, así que cambiar la base implica rehacer la pila. No genera texto. Sus resultados destacados de verificador están afinados, no son cero-shot. Un CLM-35B multimodal fue anunciado para principios de octubre. Y como todo modelo de decisiones, sus probabilidades hay que validarlas en tus propios casos antes de que nada se auto-apruebe.

FAQ

¿Está CLM-8B relacionado con Jev?
Abordan el mismo problema — decisiones tipadas con espacios de respuesta acotados — y los publicadores de CLM lo compararon con Jev, pero son modelos independientes: CLM-8B son pesos abiertos Apache-2.0 sobre un codificador Qwen3-8B congelado que puntúa candidatos en local; Jev es el modelo de decisiones alojado de TypeSafe.
¿Puedo ejecutar CLM-8B gratis?
Los pesos se descargan gratis (Apache-2.0), y el checkpoint de 8B corre en Apple Silicon mediante builds MLX/GGUF de la comunidad. Lo que no es gratis es operarlo: una pila de serving de embeddings con vLLM más clm-serve, planificación de capacidad y re-verificar la calibración cada vez que cambias algo.
¿Aloja Optio CLM-8B?
No. Optio llama a Jev. Esta página existe porque CLM-8B habla el mismo vocabulario de decisiones, y quien compara modelos de decisiones tipados merece una descripción honesta en vez de una página de marketing.
CLM-8B vs Jev — ¿cuál usar?
Si el requisito son decisiones alojadas sin operaciones, con claves y créditos: Jev a través de Optio. Si quieres los pesos en tu propio entorno, ranking de candidatos sobre conjuntos grandes o la latencia más baja en hardware que controlas: CLM-8B. Compara ambos en tus próprios diez casos antes de cambiar nada.