Si le pides a un modelo de lenguaje que sume una lista de compras, es posible que responda con total seguridad y esté equivocado. En el gremio, a esto lo llaman alucinación, y las soluciones propuestas habían sido hasta ahora medidas contundentes: usar un modelo más grande o entrenarlos con más ejercicios resueltos. Una clase reciente en Stanford expuso un camino distinto, y sus resultados son difíciles de ignorar. Consiste en entrenar a un segundo modelo para una tarea muy específica: juzgar si la solución del primero es correcta, para luego cribar una pila de borradores y encontrar la que sobrevive al análisis. En el examen estándar de matemáticas para primaria, este esquema igualó a un modelo treinta veces más grande. Los nuevos evaluadores ni siquiera esperan al resultado final; califican paso a paso, aprenden de etiquetas baratas y ruidosas en vez de datos perfectos, y se comprimen en un solo modelo lo suficientemente ligero para operar junto al resolutor que vigila.
La brecha entre resolver y supervisar
Los modelos de lenguaje intentan resolver aritmética de varios pasos con absoluta confianza, por lo que el campo creó un examen de problemas escolares para atraparlos en el error.
El fallo no es la duda. Cuando se le presenta un problema matemático de varios pasos, el modelo suele generar una solución impecable, segura y errónea: cada renglón parece sensato, pero el cálculo se rompe en algún punto. Los autores del estándar de la industria lo señalaron formalmente en 2021: los modelos de vanguardia aún batallan para ejecutar razonamientos matemáticos robustos en varios pasos.
Los modelos de lenguaje pueden alucinar y presentar con confianza soluciones falsas a los usuarios.
Esta oportunidad tiene nombre propio: la brecha entre generación y verificación. Si pides a un modelo que resuelva un problema muchas veces, la solución correcta suele estar en el montón, incluso cuando el modelo no logra producirla de forma fiable bajo demanda. La tarea deja de ser conocimiento y se vuelve clasificación: hallar la respuesta correcta entre los borradores. Ese es el trabajo de un segundo modelo.
Un segundo modelo, pagado para dudar
El trabajo del verificador se reduce a una cifra: la probabilidad de que una solución sea correcta. Bien entrenado, convierte un montón de borradores en una respuesta.
El método, propuesto en 2021 por Karl Cobbe y sus colaboradores en OpenAI, es mecánico. Se muestrea al generador muchas veces ante el mismo problema, se entrena a un verificador para puntuar cada candidato y se conserva el que obtiene la mayor calificación. La salida del verificador es un número: la probabilidad de que la solución que tiene enfrente sea acertada. El generador piensa, el verificador juzga.
La ganancia fue sorprendente. Frente al ajuste fino convencional —es decir, entrenamiento adicional con soluciones resueltas—, este esquema de verificación aportó el equivalente a aumentar treinta veces el tamaño del modelo. Y donde las mejoras del ajuste fino se estancan, la verificación escala con mayor eficacia a medida que aumenta la cantidad de datos. Una pila más grande de borradores sigue siendo rentable.
Las ablaciones en este campo giran en torno a una duda de diseño: ¿qué tan fina debe ser la duda? Un verificador puede leer la solución completa y puntuarla una vez, hacerlo oración por oración o incluso fragmento a fragmento —un «token» es la unidad mínima que el modelo procesa—. Cada opción se prueba como experimento independiente. Pero antes de la precisión, está la cuestión presupuestaria: ¿qué tan inteligente debe ser el juez?
Gastar el cómputo en el resolutor
Si fijamos el presupuesto, un resolutor grande con un juez pequeño supera a la combinación inversa. La alternativa sin entrenamiento, el voto mayoritario, tiene un límite.
La intuición sugiere que el juez debería ser tan inteligente como el resolutor. Los experimentos comparan directamente esto: mantener el cómputo total fijo y compensar el tamaño del generador frente al del verificador. El resultado es desigual.
Usar un generador grande con un verificador pequeño rinde significativamente mejor que usar un generador pequeño con un verificador grande.
El método rival no requiere entrenamiento. La votación mayoritaria muestrea el modelo muchas veces y elige la respuesta que más se repite. Funciona, hasta que deja de hacerlo. El fallo aparece alrededor de los cincuenta muestreos por problema: después de eso, más borradores ya no suman respuestas correctas. La ventaja del verificador es que lee los borradores en lugar de contarlos.
Al conjuntar los hallazgos, emerge una doctrina de presupuesto: invierta en el generador, muestree con generosidad y deje que un verificador pequeño y barato haga la selección. La verificación convierte el muestreo económico en una precisión que, de otro modo, exigiría un modelo mucho más grande. Lo que aún no hace es ver dentro del razonamiento: el verificador lee una solución terminada y no puede decir en qué punto falló.
Calificar los pasos, no la respuesta
La supervisión por resultado solo califica la respuesta final. La supervisión por proceso califica cada paso, y descubrir si eso importa costó ochocientas mil etiquetas.
Un verificador que solo puntúa resultados es un modelo de recompensa por resultados (ORM); ve el final, nunca el camino. Un modelo de recompensa por procesos (PRM) califica cada paso, lo que permite señalar la línea exacta donde un argumento coherente se descarrila. Además, las notas paso a paso educan. Si se usan como recompensa en el entrenamiento mediante PPO —el algoritmo estándar de aprendizaje por refuerzo que empuja al modelo a lo que obtiene mayor puntaje—, moldean cómo razona, no solo lo que concluye.
El precio de la supervisión informativa se paga en etiquetas. Para el estudio de 2023 de Lightman y sus colegas, evaluadores humanos calificaron pasos individuales, creando el conjunto PRM800K: 800,000 etiquetas a nivel de paso en 12,000 problemas matemáticos. Para mantener el costo manejable, el equipo usó aprendizaje activo: el sistema elige los pasos donde la nota humana enseñará más, en lugar de etiquetar al azar. Esa decisión hizo el esfuerzo 2.6 veces más eficiente en el uso de datos que el muestreo aleatorio.
La supervisión por proceso es más eficaz que la de resultado, pero la recompensa por resultado también escala con más datos.
La supervisión por proceso ganó el duelo: la retroalimentación por paso supera a la de respuesta con el mismo presupuesto. Pero la salvedad es importante. Las recompensas por resultado mejoran a medida que crecen los datos y las etiquetas de respuesta son casi gratuitas. Las de paso no, a menos que alguien las fabrique. Los siguientes dos diseños hacen precisamente eso, desde extremos opuestos.
Un comité de evaluadores débiles
Dos estudios atacan el costo de las etiquetas de paso desde extremos opuestos: fabricarlas automáticamente o agrupar evaluadores demasiado débiles para confiar en uno solo.
La primera vía de escape al gasto de etiquetado vino de Wang y sus colegas en 2023. Su sistema Math-Shepherd genera etiquetas de paso automáticamente, eliminando al evaluador humano y uniendo la supervisión cara con la barata. Las etiquetas resultantes son más ruidosas que el oro, pero la apuesta de los trabajos recientes es que, bien agrupado, el ruido es suficiente.
Weaver, de Saad-Falcon y su equipo en 2025, lleva esa premisa al extremo. Sus verificadores son deliberadamente débiles y no se confía en ninguno por separado; al agruparlos, el conjunto califica soluciones lo suficientemente bien como para reducir de forma medible la brecha entre generación y verificación. Después llega el paso que lo hace práctico: la destilación. Se entrena un modelo compacto para imitar los juicios del comité, de modo que el discernimiento de la multitud funcione al precio de un solo modelo.
Los resultados apuntan a una conclusión: las estrategias de verificación ofrecen ganancias reales de desempeño y entregan más precisión por unidad de cómputo que simplemente agrandar el resolutor. Lo que queda abierto es la competencia entre los dos tipos de supervisión, algo que los datos aún no resuelven: las recompensas por resultado escalan con los datos y las etiquetas de respuesta siempre serán más baratas, así que el evaluador de procesos deberá seguir justificando su precio. Lo importante a observar es el tamaño del juez. En cada etapa de esta historia, el juez se ha hecho más pequeño, y la brecha que vigila, también.