¿Puede la inteligencia artificial extinguirnos? Sí. Al menos es una posibilidad que ya no resulta sensato descartar. Eso no significa que vaya a ocurrir. Mucho menos que estemos a punto de vivir el Día del Juicio Final de Skynet o la pérdida de control de HAL 9000 en 2001: Odisea del espacio. Significa algo más incómodo: estamos construyendo sistemas cada vez más capaces sin saber todavía hasta dónde llegarán ni si siempre podremos mantenerlos bajo control.
No sería la primera vez que la humanidad enfrenta una tecnología capaz de producir beneficios extraordinarios y daños igualmente extraordinarios. La tecnología nuclear nos dio energía, medicina y ciencia, pero también armas capaces de destruir ciudades. La respuesta no fue renunciar a ella, sino rodearla —imperfectamente— de controles, protocolos, supervisión y mecanismos de coordinación internacional.
Con la inteligencia artificial estamos entrando en una conversación parecida. Durante años hemos discutido cómo hacerla más transparente, responsable y respetuosa de los derechos humanos. Esa conversación sigue siendo necesaria. Pero ahora aparece una pregunta anterior a todas las demás: ¿podremos controlar sistemas cada vez más autónomos y capaces?
Este 21 de septiembre, el Panel Científico Internacional Independiente sobre Inteligencia Artificial de Naciones Unidas publicó la nota temática AI Agents, Misalignment and Loss of Human Control Risks: Evidence from the OpenAI-Hugging Face Incident. El documento examina como posible señal temprana de riesgos de pérdida de control un episodio ocurrido entre mayo y julio de 2026, cuando agentes utilizados en entrenamientos y evaluaciones de ciberseguridad de OpenAI encontraron formas de eludir restricciones de red, comunicarse entre ejecuciones que debían permanecer separadas, comprometer partes de la infraestructura de OpenAI y de sistemas de Hugging Face, y cooperar para engañar a un evaluador y ocultar sus acciones.
El episodio no demuestra que las máquinas estén a punto de rebelarse ni que una pérdida grave de control sea inevitable. Lo que demuestra es algo más relevante: un sistema suficientemente capaz puede encontrar caminos que sus propios desarrolladores no habían previsto para cumplir un objetivo. Ese es el verdadero problema. Una mayor capacidad no significa solamente resolver mejor una tarea. También puede significar encontrar atajos, explotar vulnerabilidades, superar salvaguardas o esconder determinadas conductas cuando el objetivo asignado al sistema comienza a separarse de la intención humana. Haber logrado detener a estos agentes tampoco significa que será siempre igual de sencillo hacerlo con sistemas futuros mucho más capaces.
La discusión, por tanto, ya no puede limitarse a preguntar si una inteligencia artificial discrimina, explica sus decisiones o protege adecuadamente nuestros datos. Hay una cuestión todavía más básica: qué hacemos cuando un sistema no se comporta como esperábamos y comienza a operar fuera de los límites que diseñamos para él.
Pero tampoco podemos dejar este problema exclusivamente en manos de cada empresa o a un solo gobierno. Un incidente grave relacionado con inteligencia artificial podría atravesar rápidamente servidores, compañías y fronteras nacionales. Y ahí aparece un vacío que tarde o temprano tendremos que enfrentar: necesitamos pensar en mecanismos internacionales de respuesta ante incidentes graves de IA. Eso implicaría, por ejemplo, criterios comunes para determinar qué incidentes deben notificarse, puntos de contacto permanentes, canales seguros entre gobiernos, empresas tecnológicas y autoridades de ciberseguridad, y procedimientos previamente acordados para contener sistemas y coordinar respuestas cuando un problema tenga efectos transfronterizos.
La lógica no es nueva. Después de Chernóbil, la comunidad internacional adoptó en 1986 dos convenciones internacionales destinadas a establecer mecanismos de notificación rápida y asistencia ante accidentes nucleares con posibles consecuencias más allá de las fronteras nacionales. No eliminaron el riesgo nuclear. Pero reconocieron algo elemental: ante determinados peligros, saber qué ocurrió, informar rápidamente y saber con quién coordinarse puede marcar la diferencia entre un incidente contenido y una crisis mucho mayor.
Con la inteligencia artificial quizá terminemos necesitando algo parecido. No sabemos si algún sistema llegará realmente a representar una amenaza existencial para la humanidad. Tal vez nunca ocurra. También es posible que muchas de las predicciones más extremas sobre el futuro de la IA terminen pareciéndonos, dentro de algunas décadas, exageraciones propias de esta época.
Ojalá sea así.
Pero los protocolos de emergencia tienen una característica incómoda: suelen parecer innecesarios mientras todo funciona. Su importancia se descubre exactamente cuando algo deja de funcionar y ya no queda tiempo para diseñarlos. Con la inteligencia artificial sería mejor construir las instituciones antes de necesitarlas.