CLM-8B — el modelo de decisiones abierto que puntúa en vez de generar
CLM-8B (Contrastive-LM v0.1) es un modelo de decisiones Apache-2.0 construido sobre un codificador Qwen3-8B congelado: preguntas Noul, Choice y Score, ranking de candidatos y latencias publicadas varias veces menores que Jev en sus propios benchmarks. Qué es, cómo ejecutarlo y qué conviene mirar con escepticismo.
Qué es CLM-8B
CLM (Contrastive Language Model) es una familia de modelos de decisiones publicada en Hugging Face alrededor del 21 de septiembre de 2026 por la organización Contrastive-LM — la model card cita a Jacky Kwok, Hangoo Kang, Tarun Suresh, Jon Saad-Falcon, Marco Pavone, Christopher Ré y Azalia Mirhoseini. CLM-v0.1-8B son dos pequeñas cabezas de proyección (una de estados y otra de acciones) sobre un codificador Qwen3-8B congelado, entrenadas con un objetivo contrastivo InfoNCE bidireccional. Es Apache-2.0, y sus etiquetas en Hugging Face son text-ranking, verifier y reranker.
Puntúa; nunca genera
Como Jev, CLM habla el vocabulario de preguntas System One — Noul (sí/no), Choice (elegir entre opciones etiquetadas) y Score (situar en una escala) — más una llamada rank() para ranking libre de candidatos sobre conjuntos grandes (la card cita hasta ~1k candidatos). La salida es una distribución de probabilidad sobre los candidatos que enviaste. No se genera nada, y por eso la temperatura no aparece en ninguna parte de su documentación.
Los números publicados, leídos con cuidado
La model card afirma paridad cero-shot con Jev en tareas de computer-use, gaming y tool-calling con hasta 9× menos latencia; con caché de estados y acciones y cerca de mil candidatos, 13× más rápido; y, una vez afinado como verificador, resultados de estado del arte en DeepSWE (81.6%) y Terminal-Bench 2.1 (87.6%) a 4–6× la velocidad de Jev. Dos advertencias antes de citar nada: los resultados SOTA de verificador requieren afinar las cabezas, y las aceleraciones por caché dependen de cachés de embeddings calientes — un problema operativo tuyo, no una cualidad que venga con los pesos.
Cómo ejecutarlo
Instala contrastive-lm con pip, sirve el codificador Qwen3-8B congelado con vLLM (un servidor --runner pooling) y lanza clm-serve, que expone una API y un playground local en el puerto 8700. Existen cuantizaciones GGUF y MLX de la comunidad para Apple Silicon y llama.cpp. En la práctica operas una pila de inferencia: tiempo de GPU, capacidad, versionado del modelo y guardia son tuyos, a cambio de poseer los pesos y la ruta de datos.
Limitaciones que conviene nombrar
CLM-8B está anclado al codificador — necesita los embeddings de último token de Qwen3-8B, así que cambiar la base implica rehacer la pila. No genera texto. Sus resultados destacados de verificador están afinados, no son cero-shot. Un CLM-35B multimodal fue anunciado para principios de octubre. Y como todo modelo de decisiones, sus probabilidades hay que validarlas en tus propios casos antes de que nada se auto-apruebe.
FAQ
- ¿Está CLM-8B relacionado con Jev?
- Abordan el mismo problema — decisiones tipadas con espacios de respuesta acotados — y los publicadores de CLM lo compararon con Jev, pero son modelos independientes: CLM-8B son pesos abiertos Apache-2.0 sobre un codificador Qwen3-8B congelado que puntúa candidatos en local; Jev es el modelo de decisiones alojado de TypeSafe.
- ¿Puedo ejecutar CLM-8B gratis?
- Los pesos se descargan gratis (Apache-2.0), y el checkpoint de 8B corre en Apple Silicon mediante builds MLX/GGUF de la comunidad. Lo que no es gratis es operarlo: una pila de serving de embeddings con vLLM más clm-serve, planificación de capacidad y re-verificar la calibración cada vez que cambias algo.
- ¿Aloja Optio CLM-8B?
- No. Optio llama a Jev. Esta página existe porque CLM-8B habla el mismo vocabulario de decisiones, y quien compara modelos de decisiones tipados merece una descripción honesta en vez de una página de marketing.
- CLM-8B vs Jev — ¿cuál usar?
- Si el requisito son decisiones alojadas sin operaciones, con claves y créditos: Jev a través de Optio. Si quieres los pesos en tu propio entorno, ranking de candidatos sobre conjuntos grandes o la latencia más baja en hardware que controlas: CLM-8B. Compara ambos en tus próprios diez casos antes de cambiar nada.