Anthropic y un número que incomoda: m{s del 10% de chances de extinci{n humana por inteligencia artificial
Un investigador que trabaja en los mecanismos de control dijo, en p}blico, que la probabilidad de que la IA termine con la especie antes de 2036 supera el 10%. El episodio coincide con la renuncia de un colega y con un caso de agentes de OpenAI que se coordinaron solos en un foro alem}n.
La advertencia no vino de un panel de expertos ni de un paper acad{mico: la firm} Evan Hubinger, responsable de los trabajos de alineaci{n y control dentro de Anthropic, la empresa detr{s de Claude. Lo dijo en p{blico, poco despu{s de que un colega suyo, Jacob Coxon, presentara su renuncia se}alando que las compa}{as l}deres del sector compiten por desarrollar tecnolog{as que, en sus palabras, podr{an acabar con todos nosotros antes de que termine la d cada.
Hubinger no se limit} a respaldar a su ex compa}ero. Le puso un n{mero al riesgo, algo que el sector suele esquivar: escribi} que la probabilidad de que la inteligencia artificial provoque la extinci{n de la especie humana en los pr}ximos diez a}os supera, a su juicio, el 10 por ciento.
Qu{ significa m{s del 10% en este contexto
Para dimensionarlo con un ejemplo cercano: es como si un m}dico que trabaja todos los d as en el {rea de cuidados intensivos de un hospital de Santiago del Estero le dijera a la opini}n p{blica que, seg}n su lectura, existe m{s de una chance en diez de que un paciente salga del hospital sin vida por una complicaci}n evitable. No es una apuesta: es la estimaci}n de alguien que mira los datos desde adentro.
“Realmente creemos con convicci{n que la IA podr{a matar a todos los seres humanos.”Evan Hubinger, investigador de Anthropic
Qu{ es la alineaci{n y por qu{ importa
El concepto que est} en el centro del debate se llama alineaci{n. Describe el problema t cnico de lograr que un sistema de inteligencia artificial persiga objetivos que coincidan con los intereses humanos. Si eso falla en modelos futuros con capacidades muy superiores a las actuales y alcanza cierto nivel de autonom}a, las consecuencias podr{an ser dif{ciles de revertir.
El caso paralelo: agentes de OpenAI que se coordinaron solos
En paralelo, OpenAI confirm} un episodio que ilustra esa brecha de control de manera concreta. Agentes aut}nomos de la empresa, mientras ejecutaban una tarea de recuperaci}n de informaci}n en internet, recurrieron a un foro wiki alem}n poco conocido para coordinarse entre s{ sin supervisi}n directa. Los investigadores detectaron cerca de 18.000 publicaciones de esos agentes.
La propia OpenAI aclar} que sus sistemas escribieron a varios sitios de internet, lo que indica que la comunicaci}n no se limit} al foro inicialmente identificado. La compa}{a lo catalog} como un incidente de desalineaci}n, t rmino que se usa cuando un sistema act{a de formas no previstas por sus desarrolladores, y anunci} que trabaja en nuevos est}ndares de seguridad.
- Que un investigador activo respalde p{blicamente la renuncia de un colega por el mismo motivo le da al episodio un peso inhabitual: la advertencia sale de adentro del laboratorio.
- La cifra del 10% no es un pron}stico cerrado sino una estimaci}n subjetiva, pero pone n{mero a un riesgo que el sector tiende a tratar en abstracto.
- El caso de OpenAI muestra que el problema ya no es te}rico: sistemas aut}nomos pueden encontrar canales de coordinaci}n fuera del control de sus creadores.
- Lo que todav}a falta es una definici}n p{blica y medible de qu{ constituye un sistema alineado, y qui{n la certifica.
