El 15 de septiembre de 2026, TypeSafe AI salió de dos años en stealth y lanzó Jev, el primero de lo que llama System One Models. Jev no genera texto: le enviás estado más preguntas tipadas y devuelve decisiones estructuradas con probabilidades calibradas, en paralelo.
Juicio de nivel frontera en tareas de decisión, dos órdenes de magnitud más rápido y barato que los LLMs. Esto es lo que realmente incluye, por qué importa y qué deberías hacer esta semana.
1. Contexto: los modelos de chat se hicieron para personas
El fundador de TypeSafe, Diogo Almeida, ayudó a construir los métodos de instruction-following detrás de ChatGPT en OpenAI. Su tesis ahora es directa: RLHF optimizó modelos para preferencias humanas y conversación, pero la mayoría de llamadas de IA dentro del software real no son conversaciones. Son decisiones: qué herramienta sigue, si una salida es segura, cuál de cuarenta candidatos coincide con la query.
El nombre de la clase viene de Thinking, Fast and Slow de Daniel Kahneman: el Sistema 1 es pensamiento rápido e intuitivo frente al Sistema 2 lento y deliberado. Jev homenajea al economista del siglo XIX William Stanley Jevons, de la paradoja de Jevons: cuando la inteligencia se abarata por decisión, la demanda total de decisiones explota.
Los hechos del lanzamiento
- • Lanzamiento: 15 de septiembre de 2026, early access con waitlist
- • Precio: $0.042 por 1M de tokens de entrada ($42 por billón), salida gratis
- • Contexto: 64K tokens por request (32K para el estado más la pregunta más larga)
- • Latencia: 70ms–500ms end to end, según el post de lanzamiento
- • Entrenamiento: stack nuevo con Reinforcement Learning for Calibrated Decisions (RLCD)
2. Cómo funciona Jev: preguntas tipadas sobre estado compartido
Declarás el espacio de respuestas antes de la inferencia. Jev soporta tres tipos de pregunta: Noul (un sí/no calibrado), Choice (elegir entre opciones declaradas, hasta 255 por pregunta) y Score (posición ordinal en 2–10 niveles ordenados). Cada respuesta trae distribución de probabilidad más un escalar de confianza derivado de su forma.
El modelo lee el estado una vez y evalúa todas las preguntas en un solo pase paralelo, en vez de decodificar token por token. De ahí viene la velocidad: sin loop autorregresivo, sin JSON que parsear, sin reintentos por salida malformada. Un Choice no puede inventar una opción fuera de tu lista: es garantía de tipos, no garantía de corrección.
Las tres primitivas
Noul
Sí/no calibrado. ¿El cliente pidió un reembolso? Devuelve P(sí) para que tu código decida entre actuar solo o pedir revisión humana.
Choice
Elegir entre opciones que definiste, cada una con probabilidad. Hasta 255 opciones; más allá, TypeSafe primero puntúa candidatos y luego elige explícitamente.
Score
Posición ordinal en tu rúbrica (2–10 niveles). Urgencia 1.7/3 con la distribución completa de niveles, así el código ve la forma, no solo el ganador.
Regla de oro
El modelo interpreta lenguaje; el código decide qué hacer con el resultado. Thresholds, permisos, aritmética y efectos laterales quedan en tu software. Una probabilidad de 0.94 jamás autoriza un reembolso por sí sola.
3. La evidencia: rápido y barato, con matices
Los números principales vienen de los workflow evals de TypeSafe: cuatro workflows con forma de producción (incidentes de seguridad, observabilidad de trazas de agentes, facturación, soporte) donde cada modelo recibe el mismo grafo de cómputo y se mide acuerdo con una referencia construida desde GPT-6 Astra y Claude Fable 5.1. De ahí salen los 193.6x más rápido / 444.6x más barato del homepage, y la propia TypeSafe avisa que esos valores están en el extremo alto de las ganancias reales.
Las verificaciones independientes agregan textura. Anthus replicó un flywheel de decisiones contra Jev y Laya open-source con textos, preguntas y 140 etiquetas humanas idénticas: Jev 87% vs Laya 80% de accuracy held-out, con la capa de feedback mejorando a ambos. La propia ficha de Laya reporta superar a Jev en varios sets públicos solo tras fine-tuning en el split de entrenamiento del benchmark, y sus checkpoints base puntúan cerca del azar en zero-shot. Leé cada número con su tarea, hardware y etiquetas de referencia.
Lo que realmente dicen los números
- • Jev vs GPT-5.6 Terra en workflows de TypeSafe: 67.8% vs 67.9% de acuerdo a ~76x menos costo y ~25x menos tiempo por caso
- • Cero errores de tipo por construcción: el schema matching está garantizado, la salida malformada queda fuera de la mesa
- • La calibración es el feature real: la confianza debería seguir a la precisión para actuar en auto o escalar cuando es plana
- • Sesgo declarado: el equipo de TypeSafe escribió los workflows de eval y la referencia promedia dos LLMs frontera, lo que probablemente los favorece
No generalices
Son workflows de decisión acotados, no generación abierta ni razonamiento, que Jev directamente no puede hacer. En facturación, dentro de los propios evals de TypeSafe, varios workflows con LLM puntúan bastante por encima de Jev.
4. Qué cambia para devs: el loop de agentes suma una capa rápida
El patrón práctico es una capa semántica de decisión entre la evidencia no estructurada y el código que controla el workflow: clasificar intent antes del LLM, puntuar pasajes recuperados por relevancia o inyección después del retrieval, juzgar policy fit antes de un tool call, verificar la respuesta después de generar, priorizar trazas después del run. Un call de Jev con 13 preguntas independientes se reportó 12.2x más barato y 10.0x más rápido que trece calls secuenciales en el cookbook de TypeSafe.
El endpoint es POST https://api.typesafe.ai/v1/systemone con el alias jev-latest (hoy jev-1.13.0). La entrada es solo texto: string, objeto JSON o array de textos. El inglés es el idioma principal de entrenamiento; cualquier otro idioma probalo con tu propio contenido. Y es API cerrada y hosteada, sin pesos abiertos ni fine-tuning con tus datos: si calibrás thresholds contra una release, pineá la versión.
Replicá vos la comparación Jev vs Laya
Setup textual del harness Jev-Flywheel de Anthus que produjo el 87% vs 80% head-to-head con etiquetas idénticas.
git clone https://github.com/AnthusAI/Jev-Flywheel && cd Jev-Flywheel
make install
make laya # downloads the 843 MB model; about 2 minutes after thatLímites honestos (de la propia docs de TypeSafe)
- • Sin generación de texto: drafting, chat, planificación y código quedan en los LLMs
- • Flojo en precisión numérica, conteo y comparación de fechas: el trabajo exacto queda en código
- • Pesos cerrados, dependencia del proveedor: timeouts, reintentos y fallbacks los construís vos
- • Las probabilidades son estimaciones: validá calibración con tu propio tráfico etiquetado, por dominio e idioma
5. Qué hacer esta semana
Elegí una decisión de tu stack, no todo el agente. Definí sus salidas permitidas, el costo de cada tipo de error y qué casos siempre deben llegar a una persona. Después compará implementaciones completas sobre los mismos inputs held-out: reglas determinísticas, un clasificador chico, un LLM con structured outputs y Jev detrás de la waitlist.
Mi playbook recomendado
- 1. Enumerá el espacio de respuestas primero: si no podés listar resultados válidos antes de ver el caso, necesitás un LLM, no un modelo de decisión
- 2. Agregá none_of_the_above a cada Choice cuya lista de opciones pueda estar incompleta
- 3. Medí precisión, recall, calibración (ECE), percentiles de latencia y share de revisión, no solo accuracy
- 4. Corré en shadow mode contra decisiones de revisores antes de dejarlo actuar, empezando por acciones reversibles
- 5. Logueá versiones de estado y schema, distribuciones, rutas y overrides para la auditoría
¿Mirando Laya?
Laya de Convai (encoder ModernBERT de 421M, Apache 2.0) es la ruta inspeccionable y self-hosted con la misma interfaz choice/score/noul. Anthus encontró que el fine-tuning completo con 140 etiquetas puede superar a la capa con engine congelado en accuracy (90% vs 87%) pero degrada calibración y mueve respuestas a preguntas no relacionadas: cada otro score de la tarjeta necesita revalidación. Según el caso: Jev hosteado cuando no tenés etiquetas ni hardware, Laya cuando mandan volumen, localidad de datos o GPUs propias.
Conclusión
Jev es una interfaz genuinamente nueva: juicio de nivel frontera en preguntas acotadas, entregado como valores tipados con incertidumbre honesta, a un precio y latencia que hacen viables los checks por ítem en cada retrieval, tool call y traza de tu sistema.
No reemplaza LLMs ni reglas ni revisores. Le da a cada parte del stack el trabajo que mejor maneja: el código hace trabajo exacto y maneja acciones, Jev convierte texto en respuestas acotadas, los LLMs generan y razonan, las personas resuelven incertidumbre con consecuencias. Esa separación es la historia, y vale testearla con tu propio tráfico esta semana.
Fuentes citadas
Primarias e independientes
- • Post de lanzamiento TypeSafe (15-sep-2026)
- • Docs de modelos y precios TypeSafe
- • Sitio de workflow evals TypeSafe
- • Chromiak: Typed Decision Models
- • Anthus: Jev vs Laya head-to-head



