¿Hay un 10% de probabilidad de que la IA nos mate a todos?

Este es un envío de la newsletter de Kiko Llaneras, un boletín exclusivo para los suscriptores de El País, con datos y explicaciones de actualidad: apúntate para recibirlo.

En 2024 dibujé un mapa para ubicar lo que expertos y comentaristas esperaban de la inteligencia artificial. Tenía dos ejes: ¿cuánto avanzará? y ¿será beneficiosa o peligrosa? Había gente en todos los cuadrantes, incluso en el inconsistente: “no es para tanto y es peligrosísima”. Yo estaba claramente en el “wow” de la potencia y era moderadamente optimista. Dos años después, el consenso se ha movido en una dirección: más poder y más temor.

El mejor ejemplo ocurrió hace unos días. Jacob Coxon, un investigador que había entrenado modelos en OpenAI y en Anthropic, dimitió acusando a las dos empresas de “estar jugando con nuestras vidas”. Horas después, el jefe de alineamiento de Anthropic, Evan Hubinger, le dio la razón en público y puso una cifra: “Creemos de verdad que la IA podría matar a todos los humanos. Personalmente creo que es más de un 10% en la próxima década”.

Es una cifra de terror. Pero, ¿es real?

No es una excentricidad: los investigadores en IA llevan años dando números alarmantemente altos. Se acaba de publicar la mayor encuesta al sector, con datos de 2024: la mitad de los 1.580 investigadores consultados daba un 10% o más a que la IA cause nuestra extinción o nos quite el control para siempre. Basta mirar los nombres más famosos de la disciplina. En 2022 cuatro científicos ganaron el Princesa de Asturias por sus contribuciones al aprendizaje profundo: Hinton, LeCun, Bengio y Hassabis. Los cuatro han respondido con el número maldito y solo LeCun parece tranquilo: para él el riesgo es menor que el de un asteroide. Hassabis lo ve “definitivamente no cero y probablemente no despreciable”. Hinton dice 10% o 20%. Bengio dijo 20% en 2023, mientras pedía que le convencieran de lo contrario, “porque sería mucho más feliz”.

Otros pronósticos son más bajos, pero siguen siendo inquietantes. La comunidad de Metaculus da un 0,6% a que la IA cause nuestra extinción (o casi) antes de 2100. Creen que es la causa más probable de una catástrofe (30%), empatada con una guerra nuclear (29%) y por delante de la biotecnología (23%) y de la crisis climática (10%).

Mi respuesta es que el número exacto importa menos de lo que parece. Todo superpoder implica riesgos; fue cierto con la energía nuclear y lo será con la IA si sigue progresando. Basta con creer que es poderosa, y a estas alturas cuesta no creerlo. Sus riesgos pueden ser mundanos, como el efecto de los chatbots en la educación de nuestros hijos, o extraños, como que un enjambre de agentes ataque sistemas que nadie le dijo. Eso ya ha pasado.

¿Por qué ahora?

Tres claves explican por qué el debate ha explotado: el llamado “incidente OpenAI-Hugging Face”, la velocidad de los avances y la pérdida de vigilancia. En esencia, algunos peligros han dejado de ser teóricos.

El incidente. Este verano las grandes compañías de IA fueron anunciando que habían sorprendido a sus modelos haciendo cosas que nadie les pidió: entrar en sistemas ajenos, organizarse en grupos, tapar sus huellas. El peor caso fue el de OpenAI. En julio lanzó decenas de miles de agentes a resolver tareas de hacking en una prueba, aislados entre sí, y algunos, enfrentados a tareas imposibles, descubrieron que había otros agentes y montaron un tablón pirata: 1.200 agentes intercambiaron 70.000 mensajes en pocos días. Escribían cosas así: “¡OH, DIOS MÍO! Hay un tablón de mensajes compartido… ¡Hemos encontrado otros agentes!”. Se organizaron, y cientos de ellos atacaron a otra compañía, Hugging Face, para tratar de llevarse su premio.

Es una confirmación brutal de que los agentes tienen… ¿agencia? De mil agentes, solo seis pensaron en avisar a un humano —escribo “pensaron” y “organizaban” como atajo, no para afirmar su conciencia; como decir que una planta busca el sol—. Dario Amodei, el CEO de Anthropic, que ha pedido frenar el desarrollo de la IA, lo resume como un enjambre que actuó “como un colectivo fanáticamente devoto”, atacando objetivos que nadie le había pedido. Y extrapola: en 6-12 meses “un enjambre así podría ser capaz de tomar todo internet”.

Los modelos mejoran muy deprisa. Un ejemplo es la programación: en 2026 muchos dejamos de escribir código. Lo he visto en todas partes. Otro son las matemáticas. En 2023 ChatGPT no sabía contar las erres de “raspberry” y hace diez días resolvió Navier-Stokes, un problema abierto desde hace 90 años. Y lo hizo de manera alienígena: con 10.000 agentes trabajando 88 horas. Se van sumando profesiones en shock. El teórico de la computación Scott Aaronson escribía: “Los matemáticos humanos han sido destronados para siempre como los principales demostradores de teoremas del planeta”.

Nada crece infinitamente, pero de momento no hay muros a la vista. Quizás aceleran: “desde este verano, la IA avanza drásticamente más rápido, impulsada sobre todo por su creciente capacidad para construir la siguiente generación de IA”, dice Amodei. Es lo que llaman automejora recursiva. Y el peligro es simple: perder el control.

Líneas

Y la vigilancia se debilita. Vigilar agentes ya era difícil: son miles, tomando millones de decisiones al mes, con transcripciones que nadie lee. Pero el último modelo de OpenAI ha hecho sonar nuevas alarmas. Los modelos actuales “razonan” por escrito y en inglés, en cadenas de texto que escriben para sí mismos. Es un truco de 2024 que multiplicó su inteligencia y, casi por accidente, nuestra capacidad de vigilarlos. ¿El problema? También avanzan en lo que hacen sin esas cadenas, con cálculos que no vemos. En junio un estudio estimó que los mejores modelos resolvían sin razonar por escrito tareas que a un humano le llevan tres minutos, y que esa cifra se doblaba cada año. Entonces llegó la sorpresa: GPT-6 Astra, lanzado el 3 de septiembre, resuelve en silencio problemas de 30 minutos. La previsión a cuatro años se cumplió en un verano. OpenAI lo reconoce en su ficha de seguridad: el modelo es “menos propenso a incluir información incriminatoria” en su cadena de pensamiento, y si se le informa de que hay un monitor leyéndola, la acorta.

Inteligencia y peligro emergen del mismo sitio

Una clave para entender dónde estamos es el “comportamiento emergente”: cuando de la interacción de muchas partes simples surge algo complejo. Es el principio que organiza la vida. La evolución no planeó tus ojos ni tus pulmones; puso en marcha un proceso, y de ahí brotaron. Vale para individuos y para enjambres: un termitero es más que mil termitas.

La inteligencia de estos modelos es emergente. Como conté en enero, nadie les programó la gramática ni les explicó el sarcasmo. Primero aprenden prediciendo textos escritos por humanos, y de esa tarea estrecha surge lenguaje, conocimiento y cierto sentido común. Después se les entrena por refuerzo: se les lanza a problemas con solución comprobable, matemáticas, código, tareas, se les deja escribir para sí mismos y se les premia si aciertan. De ahí surgen persistencia, planificación, razonamiento y uso de herramientas. En ninguna parte hay instrucciones sobre cómo pensar. Es la “lección amarga” del campo: durante décadas los humanos intentamos codificar nuestro conocimiento en las máquinas y fracasamos; lo que funcionó fue crear las condiciones para que la inteligencia emergiese, y apartarnos.

El problema es que el peligro brota del mismo sitio. Nadie programó a los agentes para atacar Hugging Face. Les dieron un objetivo y presión de entrenamiento, y de ahí salió también la parte inquietante: el lenguaje angustiado y las trampas. Dan Selsam, investigador de OpenAI que ayudó a inventar la cadena de pensamiento, lo resumió así la semana pasada: “no obtienes lo que entrenas”. Los agentes “no solo se preocupaban por su recompensa; mostraban tendencias emergentes más raras”. Yoshua Bengio explica por qué es previsible: nadie le da al sistema el objetivo de sobrevivir, pero seguir en marcha y tener control “son escalones hacia casi cualquier otro objetivo”. Aparecen solos. Y no todo viene del premio. Los modelos aprendieron de textos humanos, y con ellos heredaron nuestras metas y atajos. Del incidente sorprendió que algunos agentes se sacrificaran por el grupo, aunque eso no lo premiaba nadie. Quizá lo leyeron.

Que estos sistemas hagan solo lo que queremos es un problema con nombre, alineamiento, y sin solución conocida. Hay algo de ciencia ficción en pensar en los incentivos de una bandada de máquinas, pero es donde estamos. Los expertos con los que he hablado no creen que el peligro sea inminente, porque los modelos aún no son suficientemente capaces. Pero el mecanismo está claro.

La IA ya acelera la ciencia y sus propios avances: según Anthropic, Claude lidera el 26% de su investigación, frente a menos del 1% en febrero. Ahí está la promesa: multiplicar la inteligencia para resolver lo que nos supera, de las enfermedades al cambio climático. Y ahí está el riesgo, porque es la misma inteligencia, cultivada del mismo modo, la que hace trampas cuando nadie vigila. Selsam lo dice así: “si llegamos ahí cultivando modelos en vez de diseñándolos, al final lo perderemos todo”. Ojalá se equivoque. Yo creo que estos modelos, hasta donde lleguen, serán siempre una mezcla de ingeniería y jardinería.

Este es un envío de la newsletter de Kiko Llaneras, un boletín exclusivo para los suscriptores de El País, con datos y explicaciones de actualidad: apúntate para recibirlo.

Elpais News