AI DevelopmentTutorial

Jev-Flywheel: capa de feedback sobre Jev o Laya, y luego fine-tune

22 de septiembre de 2026
11 min de lectura
Ciclo de feedback humano mejorando decisiones de clasificación IA
Compartir:

Los clasificadores alojados como Jev responden desde el día uno pero pagás por ítem para siempre y nunca podés tocar los pesos. Los pesos abiertos como Laya son gratis y locales pero arrancan atrás. Anthus construyó Jev-Flywheel, una pequeña capa de feedback con humano en el loop, y probó ambos motores con exactamente las mismas 140 etiquetas para ver qué opción conviene.

En este deep-dive te muestro qué hace la capa, cómo replicar el experimento vos mismo, y los números honestos: Jev con capa llega a 0.870, Laya con capa a 0.802, y Laya con fine-tune total salta a 0.896 — todo medido por Anthus en su propio corpus, no verdades universales.

1. El Problema: un buen clasificador que nunca aprende de vos

Un modelo de decisiones ordena, puntúa o etiqueta tus textos y devuelve una confianza por respuesta. Cuando discrepa con tu equipo, ese desacuerdo se evapora: el siguiente ítem recibe el mismo trato. Con Jev no podés arreglarlo con gradientes — TypeSafe sirve los mismos pesos a todos. Con Laya sí, pero el fine-tune total con unos cientos de etiquetas trae sus riesgos: deriva de calibración y cambios silenciosos en todas las demás preguntas del scorecard.

Jev-Flywheel toma el camino del medio. El motor queda congelado. Un pequeño decision head logístico vive sobre sus respuestas tipadas, y un humano aprueba cada adaptación: o refitear el head (cambiar cuánto pesa cada respuesta) o una steering round donde un analista IA lee los desacuerdos y propone una pregunta nueva. El sistema aprende tus convenciones sin reentrenar jamás el modelo de abajo.

Leé bien los números

Cada cifra de este post viene de un único estudio de Anthus sobre un corpus construido de 8.801 ítems de sentimiento con sesgo plantado (deportes sesga positivo, trabajo sesga negativo). Son números de Anthus sobre datos de Anthus — útiles para comparar enfoques, no garantías para tu scorecard. Tus etiquetas, tus plantillas, tus resultados van a diferir.

2. Conceptos Mínimos: head, refit, steering round, calibración

Cuatro ideas sostienen todo el diseño. Con estas, tanto el tutorial como las tablas de resultados se leen en lenguaje llano.

🧠

Decision head

Un pequeño modelo logístico sobre las respuestas tipadas del motor. Convierte respuestas en un veredicto más una confianza calibrada. Barato de ajustar, legible en unos pocos coeficientes.

🔁

Refit

Reajustar el head con las etiquetas acumuladas. Nada cambia en el motor — solo cuánto pesa cada respuesta en el veredicto.

🧭

Steering round

Un analista IA lee los desacuerdos recientes, nombra el factor oculto en lenguaje llano y propone una pregunta nueva (en la corrida registrada: topic_domain tras leer 43 desacuerdos). Una persona la aprueba.

📏

ECE, Brier, auto-accept

ECE mide si 90% de confianza significa acertar el 90% de las veces. Brier premia tener confianza y razón. Auto-accept @95% es la métrica de producción: cuánto tráfico supera una barra de 95% de precisión sin humano.

Los dos motores, en un párrafo

Jev (TypeSafe, alojado, jev-1.13.0 en el estudio) lee el ítem una vez y todas las preguntas viajan en el mismo request, con ventana de 64k tokens. Laya (Convai, Apache 2.0, encoder ModernBERT-large de 421M) corre local pero codifica el ítem una vez por pregunta (~8 ms extra por pregunta en M1 Max), trunca en silencio pasando 512 tokens, y flojea con muchas opciones (Convai reporta 0.425 en Banking77 vs 0.870 de Jev). El adaptador del flywheel rechaza preguntas choice con más de 20 opciones.

3. Tutorial: replicá la comparación pareada vos mismo

El repo es deliberadamente chico: un score, un head logístico, sin base de datos. Estos son los comandos exactos del post de Anthus, verificados contra el estudio. Para la pata Laya necesitás Apple silicon (el port es build MLX); la pata Jev necesita API key de TypeSafe.

Paso 1

Clonar e instalar

git clone https://github.com/AnthusAI/Jev-Flywheel && cd Jev-Flywheel
make install

Paso 2

Traer la pata Laya (descarga de 843 MB)

make laya    # descarga el modelo de 843 MB; unos 2 minutos después

Paso 3

Revisar las filas paper-600

Re-ejecutá la corrida pareada: mismas 140 etiquetas, mismos puntos de refit, misma propuesta del analista, mismos 600 ítems held-out. La última fila paper-600 de cada motor debería dar 0.870 para Jev y 0.802 para Laya. Si tus números coinciden, tu harness es fiel a la grabación.

Lo que deberías ver (cifras Anthus, 600 ítems held-out)

SistemaAccuracyECEBrier
Jev solo0.7680.151 (crudo)0.188
Jev + capa flywheel0.8700.0300.093
Laya solo0.7220.107 (crudo)0.189
Laya + capa flywheel0.8020.0150.130
Laya fine-tune total (3 seeds)0.896 (0.887–0.903)0.087*0.089
DistilBERT fine-tune (baseline)0.835 (0.818–0.848)0.0800.125

* Leé el 0.087 del fine-tune como algo entre 0.05 y 0.12: la temperatura se ajustó una vez por brazo sobre sustitutos de cross-validation, y reentrenar los mismos seeds movió el ECE de 0.116 a 0.046 con accuracy estable dentro de un punto.

Por qué importa este diseño de replay

Nada sobre el adaptador del motor sabe qué motor respondió, así que la comparación cambia exactamente una variable. La capa levantó ambos motores (Jev +10.2 pts, Laya +8.0 pts) y calibró ambos — pero la brecha de 4.7 puntos en crudo se ensanchó a 6.8 con capa. La capa ayuda a los dos y aun así deja atrás al motor más débil.

AnthusAI/Jev-Flywheel · anth.us/blog/jev-vs-laya/

4. Errores Comunes (la mayoría míos, algunos de Anthus)

El estudio es inusualmente honesto sobre lo que salió mal, incluyendo dos predicciones pre-registradas que fallaron. Robate estas lecciones en vez de reaprenderlas.

⚠️

Esperar que el motor débil gane más

Anthus predijo que Laya ganaría más con la pregunta de tópico. Ganó +7.2 puntos vs +10.5 de Jev. Además el gate promovió refits con distinta cantidad de etiquetas (52 vs 87), así que los dos steering steps no parten del mismo lugar.

⚠️

Asumir que Laya sale sobreconfiado

Tomado del ECE crudo 0.466 del model card, Anthus predijo ECE crudo de Laya sobre 0.15. Dio 0.107 — el port trae las temperaturas de calibración de Convai. Medí el checkpoint publicado, no la ablación del card.

⚠️

Fine-tune solo-head con learning rate agresivo

El brazo B (encoder congelado) dio 0.659, debajo de Laya sin entrenar — pero la grilla pre-registrada (1e-4, 1e-3) era muy caliente, y las tasas exploratorias suaves (1e-5, 2e-5) tampoco lo rescataron. En esta tarea el aprendizaje pasa en el encoder. Leé B como brazo mal sintonizado, no como prueba de que congelar falla.

⚠️

Confiar a ciegas en la confianza del fine-tune

El fine-tune gana accuracy (0.896) pero su calibración es inestable (ECE ~0.05–0.12 según seed) y su auto-accept @95% oscila 59–82% entre seeds vs un estable 72% de Jev con capa. Recalibrá tras el fine-tune con datos held-out — y con 140 etiquetas no hay margen para un split de calibración.

⚠️

Olvidar la deriva bajo las otras preguntas

Ajustar Laya sobre el veredicto movió las respuestas top en 8 preguntas no entrenadas entre 9–75% (42% promedio; la propia topic_domain se movió 35%). Cambiado no es errado — no hay answer key para esas — pero cada otro score del scorecard necesita revalidarse. Un motor congelado jamás deriva.

⚠️

Citar 0.896 como victoria universal

Corpus templateado, cue léxica plantada, 600 ítems held-out (±1.4 pts), port FP16 no oficial, etiquetador scripteado, sin documentos largos. El resultado del fine-tune es el más expuesto a todo esto. Anthus lo dice claro: las convenciones de un set real de feedback no se leen tan fácil en las palabras.

5. ¿Cuál Deberías Usar?

La tabla de decisión de Anthus, condensada. Mismo estudio, mismas salvedades — elegí por tus restricciones, no por el número más grande.

Sin etiquetas todavíaJev

0.768 vs 0.722 zero-shot aquí; el card de Convai dice que sus checkpoints base necesitan fine-tune en su propio benchmark.

Sin hardware donde correr un modeloJev

Alojado vs servilo-vos. Laya es gratis pero el serving, batching y cold starts son tu problema.

Inputs de más de 512 tokens / decenas de opcionesJev

Laya trunca en silencio pasando 512 tokens (Jev lista 64k); las preguntas estilo Banking77 son un miss documentado de Laya.

Querés la capa de feedbackCualquiera

Calibró ambos motores (ECE 0.030 / 0.015) y levantó ambos (+10.2 / +8.0 pts). Sin deriva, coeficientes legibles.

Volumen, localidad de datos o hardware libreLaya

Gratis y local, arrancando varios puntos atrás — la capa achica la brecha de costo aunque no cierre la de accuracy.

Unos cientos de etiquetas, accuracy sobre explicaciónFine-tune Laya

0.896 aquí con 140 etiquetas — después rehacé calibración y revalidá cada otra pregunta por deriva.

El experimento que nadie corrió todavía

Ajustar Laya solo sobre las preguntas de observación (como topic_domain) y dejar el veredicto en el head legible. Evidencia más filosa sin perder el relato escrito — Anthus lo lista como trabajo futuro, y es la puerta abierta más interesante de todo el post.

Conclusión

El flywheel es el default seguro: funciona con el motor que ya pagás, funciona con el motor que podés hostear gratis, calibra ambos, y nunca mueve los pesos bajo tus otras preguntas. El fine-tune total es la carta alta para cuando el accuracy importa más que la explicación — pero se paga con trabajo de calibración y revalidación.

Si te llevás un hábito de este estudio, que sea el pre-registro: Anthus escribió sus predicciones, publicó las dos que erró, y el paper es más fuerte por eso. Cloná el repo, replicá los 600 ítems, y fijate si tu scorecard se comporta como el de ellos antes de apostar producción a cualquiera de estos números.

Fuentes

  • Anthus — Jev vs Laya: Same Labels, Same Questions, One Variable (21 Sep 2026)
  • Anthus — Can You Trust Jev’s Confidence? (Sep 2026)
  • Convai Innovations — Laya model card (Hugging Face, Apache 2.0)
  • AnthusAI/Jev-Flywheel — repo, studies/PREREGISTERED.md
Diego Rodriguez

Diego Rodriguez

Ingeniero Senior Full-Stack & AI

Diego tiene mas de 9 anos de experiencia construyendo aplicaciones potenciadas por IA de produccion, desde orquestacion de LLMs y pipelines RAG hasta deteccion de riesgos con ML y sistemas de trading algoritmico.

Conoce mas sobre Diego