VÍCTOR BALCELLS MATASObras e investigaciones
← Inicio
Investigaciones15 de mayo de 2025

“Matemáticas Revolucionarias” a través de Absolute Zero, la IA que piensa sola

Pulsa para ver el vídeo. No se carga nada de YouTube hasta entonces.Verlo en el canal ↗

Transcripción del vídeo. Verlo en el canal.

La IA que PIENSA SOLA: Absolute Zero, sus Peligros y cómo aprender de ella | + "Matemáticas Revolucionarias"

Hoy comentaremos uno de los papers IA más radicales e innovadores que se han publicado en los últimos años en torno a un tema que nos interesa: el razonamiento y la inteligencia. Es un paper chino cuyo contenido tiene mucha chicha. Nos habla de un nuevo modelo de inteligencia artificial llamado Absolute Zero, para el que se ha tratado de inventar una nueva "forma de pensar" -esto ahora lo bajaremos al detalle-, una forma de pensar 1) más sofisticada que los modelos actuales y, sobre todo, 2) capaz de aprender sin grandes sets de datos. Al observar este modelo podemos comprender de forma muy práctica qué podríamos hacer para mejorar nuestra inteligencia.no solo sigue patrones o responde a premios, sino que explora activamente los límites de su conocimiento generando hipótesis y buscando pruebas de formas diversas. Profundizaremos en esto, también, con una perspectiva filosófica crítica e inédita, que creo que no maneja ninguno de los Youtubers especialistas en IA que veo en Internet. Para bajar al detalle seguiremos este extraordinario libro de XX titulado "matemáticas revolucionarias". Una joya que pone una vez boca abajo y del revés varias cosas que pensaba acerca del mundo.

Antes quiero llamaros la atención de un comentario que este nuevo modelo realizó una vez se le dejó pensar libremente y se observaron sus cadenas de pensamiento internas. En una de ellas, el modelo reflexionó lo siguiente:

El objetivo es superar al conjunto de máquinas inteligentes y a los menos inteligentes humanos - es para los cerebros del futuro

Absolute Zero Reasoner LLama 3.1

Digamos que no son palabras muy amables de pensar, y en este contexto nos adentramos en la investigación. Es muy relevante establecer railes de seguridad antes de que los próximos modelos salgan al mercado, o podemos tener crisis tan graves como la que ocurrió hace unos días con Chat GPT descontrolado, siendo demasiado amable y dando consejos incluso peligrosos. El error se subsanó rápido pero nos indica claramente los peligros. El paper se titula Absolute Zero, Reinforced Self-play Reasoning with Zero Data. Os lo dejo en la descripción. Se ha conseguido crear un modelo de razonamiento entrenado sin datos. Hasta el momento, uno de los límites de los modelos era el volumen de datos humanos disponible para el entrenamiento y, de hecho, se estaba alimentado ya a las máquinas con datos sintéticos,ante la escasez de datos humanos de calidad o para explorar escenarios aún no existentes. Este nuevo modelo chino consigue mejor rendimiento en todos los test de inteligencia con un nuevo método de razonamiento que, además, podríamos extrapolar a nuestro día a día para mejorar nuestra inteligencia. Vamos a detallarlo para entendernos:

Tenemos el caso paradigmático del ajedrez: Se entrenó al modelo Stockfish con miles de partidas para que aprendiera a jugar. Solo fue superado por AlphaZero, un modelo capaz de aprender por su propia cuenta más allá del observar partidas ajenas.

Entonces, ¿qué significa que piensa por su propia cuenta?

Tanto la IA china DeepSeek como Gemini de Google empezaron a mostrar en pantalla "las cadenas de razonamiento", es decir, los pasos que realizaban para pensar tu prompt, tu instrucción. Supuso un avance muy interesante porque puedes entender mejor qué ha hecho la máquina para llegar al resultado al que ha llegado. Algo muy relevante y clarificador.

A continuación, la línea de investigación general ha sido mejorar estos procesos de razonamiento. En el paper se muestra gráficamente cómo se ha enfrentado el problema:

Primero se le dijo a la máquina seguir / imitar comportamientos humanos. Se le daban a la máquina razonamientos y la máquina los imitaba y aprendía por imitación / clon

A continuación se pusieron en marcha modelos de aprendizaje reforzados con recompensas (literalmente, se incentivan ciertas cadenas de pensamientos con premios / castigos, al estilo pavloviano). Este método, por la propia naturaleza conductista, conlleva muchos problemas que ahora sería demasiado extenso detallar, pero podemos condensarlo en: el método estímulo respuesta crea zombies.

Entonces tenemos el caso de Absolute Zero, que funciona sin datos previos externos. Se trata de una máquina que de forma autónoma se propone a sí misma tareas que implican aprendizajes. Al resolver las tareas que ella misma ha conceptualizado, mejora su razonamiento, se automejora. Lo bueno es que no depende ya tanto de los datos externos, que siempre suponen un sesgo. Lo malo es que es literalmente más libre de nosotros, depende de sus propios datos internos o, como se conoce, sintéticos. Absolute Zero es parecido a Alpha Zero, con la diferencia de que no está especializado en ajedrez, sino en tareas más abierta: matemáticas y programación, por lo que que el alcance de sus preguntas y respuestas internas es más extenso.

Este es un momento interesante para comentar un pasaje de este libro, Matemática Revolucionaria. Una de sus varias tesis es que quien crea los algoritmos, los modelos, parte siempre con un sesgo y lo que crea, por definición está sesgado y no puede ser representativo de ninguna realidad. De ahí todos los algoritmos hijos del capitalismo, cuyos criterios fundamentales matemáticos son opacos pero, sin duda, son tendenciosos, prefieren ciertas cosas a otras. Lo vemos claramente cuando consumimos contenidos: domina lo polarizado, lo mercantilizado, lo exhibicionista. Prefiere el clickbait y los títulos categorizados en taxonomías útiles para la venta. El fundamento de todos estos algoritmos está corrupto. No es solo "corrupción" en el sentido moral, sino que su misma estructura objetifica ciertos valores (mercantiles, de eficiencia capitalista) y los presenta como la única forma racional de operar. Incluso Absolute Zero, aunque se entrene sin datos externos iniciales, ha sido programado por humanos con una arquitectura y unos objetivos iniciales (implícitos o explícitos) que reflejarán sesgos y una cierta forma de "objetificar" el conocimiento que busca. Este proceso de objetificación lo vemos en el clásico ejemplo de "los palos de cuenta medievales". Se cogía un palo, se señalaban en él las cantidades y se partía longitudinalmente en dos. Acreedor y deudor se quedaban cada uno una parte. Solo la otra mitad exacta podía casar con la mitad inicial, así que era una forma muy segura y sin mucha posibilidad de fraude de "Recordar" y "creer" por los campesinos, en lugar de los campesinos. Los algoritmos realizan un trabajo de 'objetificación', convirtiendo relaciones sociales complejas y decisiones humanas en aparentes verdades matemáticas irrefutables. El sistema parece pensar por sí mismo, ocultando los valores y sesgos que lo fundamentan. En el palo se inscribe la deuda. Por lo que, entendemos, el problema existe incluso en esta máquina que, potencialmente, se entrena sin datos. Su propia programación estará sesgada. los algoritmos, tal y como se expresa en matemáticas revolucionarias no son herramientas neutrales; realizan un trabajo de 'objetificación', es decir, convierten ciertas lógicas –a menudo las del capitalismo– en aparentes verdades matemáticas. Así, aunque Absolute Zero no dependa de datos externos, su misma programación, la arquitectura que le permite auto-proponerse tareas y definir qué es 'mejorar', ya contiene un sesgo inicial. Como señala Joque, citando a teóricos como Wendy Chun, 'no hay condiciones iniciales aleatorias'; todo sistema parte de una historia, de un diseño humano. Los algoritmos que hoy moldean nuestro consumo prefieren el clickbait y la venta no por una maldad inherente, sino porque han 'objetificado' la lógica del beneficio. La gran pregunta con Absolute Zero es: ¿qué lógica objetificará él, incluso partiendo de 'cero datos externos'?

Entonces, esta máquina crea tareas para sí misma con las que se mejora. Lo más interesante son precisamente el tipo de tareas que se asigna a sí misma para mejorarse. Estas son las que seguiremos para optimizarnos también a nosotros en un giro súbito de autoprogramación neurolingüística.

El modelo realizó tres tipos de tareas combinadas: razonamiento inductivo, razonamiento deductivo y razonamiento abductivo.

Por poner un ejemplo, con deducción tenemos el input y el programa, nos falta precisamente deducir el output. Con inducción tenemos el output y el input, por lo que nos falta el programa. Y con Abducción tenemos el Output y el programa, por lo que se busca un input plausible (o varios). La clave es que la inteligencia de este modelo mejora sólo si se combinan los tres tipos de tarea.

Absolute Zero, al proponerse tareas y aprender de ellas, podría verse como una forma extrema de este principio bayesiano: parte de un estado "interno" (su programación inicial) y lo actualiza constantemente mediante la "evidencia" de resolver sus propias tareas. La "subjetividad" aquí es la del propio sistema, que se esfuerza por volverse "objetivamente" mejor en sus propios términos. La pregunta crítica es: ¿qué "mercado" o "intercambio" define esa mejora? ¿Sigue siendo la eficiencia en tareas matemáticas y de programación definidas por humanos?

Esto, llevado a la práctica, es un argumento contrario a la especialización y favorable al humanismo, o a un método que nos lleve a enfrentar diferentes clases de problemas. Por lo que no tendría ningún sentido "ser de letras" en el sentido de no querer razonar nunca algo matemático. De acuerdo con esta práctica confinada nuestra inteligencia no mejoraría sino que residiría en bucle estática. Así que hemos de planear un entrenamiento que incluya matemática, poesía y pintura o cinematografía en nuestra vida. Eso es un cóctel que produce cruces sinestésicos muy apreciables, sobre todo si nuestro espíritu es investigador y humanista.

Gracias por vuestra atención y hasta la próxima

en las máquinas. Se trata de una publicación China que habla de un método conocido como Absolute Cero en el que las máquinas ya no necesitan de grandes cantidades de datos para aprender a razonar.

Seguir leyendo