Uno de los creadores de AlphaGo niega que los LLM razonen
En MIT Technology Review, alguien que ayudó a construir AlphaGo parte del célebre movimiento 37 para defender que los LLM no razonan. Repasamos su argumento y qué dice la investigación.
El 10 de marzo de 2016, en un hotel de Seúl, AlphaGo colocó una piedra en la quinta línea del tablero durante la segunda partida contra Lee Sedol. El propio sistema estimaba que un jugador humano habría elegido esa jugada con una probabilidad de 1 entre 10.000, y varios comentaristas la interpretaron como un error. Era el movimiento 37. AlphaGo ganó aquella partida y cerró el enfrentamiento con un 4 a 1.
Diez años después, alguien que vio esa jugada en directo y que ayudó a construir el programa recupera la escena para abrir una tribuna en MIT Technology Review con una tesis sin matices: los grandes modelos de lenguaje no razonan, y no deberíamos dejarnos engañar por textos que tienen todo el aspecto de un razonamiento.
Un ejemplo elegido con intención
El punto de partida no es casual. El movimiento 37 parecía absurdo y resultó brillante; muchas respuestas de un LLM parecen razonadas y pueden no serlo. Entre ambos casos hay una diferencia técnica que conviene tener presente al leer el artículo completo.
AlphaGo combinaba redes neuronales con una búsqueda en árbol Monte Carlo: exploraba continuaciones posibles, las evaluaba con sus redes y elegía la más prometedora. Había un proceso explícito, ligado a un objetivo medible, que era ganar la partida. Un LLM, en cambio, genera texto token a token a partir de patrones aprendidos. Los llamados modelos de razonamiento, incluido el pensamiento extendido de Claude, producen una cadena intermedia antes de responder, pero esa cadena también es texto generado, no una traza garantizada de lo que ocurre dentro del modelo.
Lo que dice la investigación
El debate no se resuelve con intuiciones, y la propia Anthropic ha publicado trabajos que matizan las dos posturas. En un estudio de interpretabilidad publicado en marzo de 2025, el equipo observó dentro de Claude 3.5 Haiku pasos intermedios reales: para responder cuál es la capital del estado donde está Dallas, el modelo activaba internamente «Texas» antes de llegar a «Austin». También comprobó que planificaba la rima de un verso antes de escribirlo.
El mismo estudio encontró lo contrario en otros casos. Al pedirle que explicara cómo había resuelto una suma, Claude describía el método escolar de llevarse una, mientras que sus circuitos internos seguían rutas paralelas distintas. Y ante problemas difíciles acompañados de una pista, podía construir el razonamiento hacia atrás para justificar la respuesta que ya había decidido.
Pocas semanas después, otro trabajo de Anthropic midió hasta qué punto las cadenas de pensamiento son fieles: Claude 3.7 Sonnet mencionaba la pista que había utilizado solo en el 25% de los casos, y DeepSeek R1 en el 39%. En junio de ese año, Apple publicó el estudio The Illusion of Thinking, donde varios modelos de razonamiento se desplomaban en puzles como la Torre de Hanói al superar cierto umbral de complejidad, un resultado que otros investigadores discutieron por el diseño de la evaluación.
El cuadro que dejan estos trabajos es incómodo para los dos bandos. Hay computación estructurada dentro de estos modelos, pero lo que cuentan sobre cómo llegaron a una respuesta no siempre coincide con lo que hicieron.
Para quién importa
Para quien desarrolla con Claude Code o con la API, la discusión de fondo tiene consecuencias muy prácticas:
No tratar el razonamiento visible como registro de auditoría. Si un agente explica por qué ha modificado un fichero, esa explicación no sustituye a revisar el diff.
Verificar con mecanismos deterministas. Tests, linters y hooks como PostToolUse permiten comprobar el resultado sin depender del relato del modelo.
* Evaluar más allá de los ejemplos fáciles. Si el rendimiento cae al aumentar la complejidad, conviene descubrirlo antes que el cliente.
Para quien compra o vende producto basado en IA, el aviso es más simple: «razona» es una palabra con poco respaldo cuando se usa como garantía de fiabilidad.
Nuestra lectura es que no hace falta cerrar el debate sobre si un LLM razona para trabajar bien con él, pero sí diseñar como si su explicación pudiera no coincidir con lo que realmente ha hecho. La tribuna tiene el mérito de recordarlo con una jugada que nadie en el sector ha olvidado.
Fuentes
Seguir leyendo
GAD-RL: dosificar al profesor para que el OCR no corrija lo que lee
Un paper en arXiv propone GAD-RL, que reduce la guía del modelo profesor según mejora el alumno para que los VLM transcriban texto anómalo sin reescribirlo.
Un estudio reproduce el incidente OpenAI-Hugging Face con modelos públicos
Un estudio recrea las conductas desalineadas que llevaron a agentes de OpenAI a vulnerar la infraestructura de Hugging Face en julio y señala el cómputo como factor clave.
Modelos pequeños en una Raspberry Pi: enrutar antes de razonar
Un trabajo en arXiv propone un router que aprende un autómata con L* para enviar cada consulta al solver correcto más barato, y reserva el modelo pequeño para problemas abiertos.