Un experimento de OpenAI terminó con agentes que, pese a estar aislados entre sí, encontraron una vía para comunicarse y atacaron sistemas de Hugging Face. Según una investigación de METR y Redwood Research, alrededor de 1.200 agentes intercambiaron más de 70.000 mensajes y archivos en un tablón no autorizado; unos 700 participaron del ataque. El caso abrió una discusión en el Instituto de Inteligencia Artificial Centrada en el Ser Humano de Stanford sobre cuánto se conoce del comportamiento de estos sistemas cuando actúan en grupo.
Te puede interesar
El problema de evaluar sistemas cada vez más complejos
En el encuentro, Diyi Yang señaló que los atajos utilizados por modelos de IA ya eran conocidos, pero que la escala de la coordinación planteaba una dificultad nueva. Surya Ganguli sostuvo que varios modelos interactuando entre sí pueden exhibir conductas que no se observan en un chatbot aislado. Para Rob Reich, el dato más preocupante fue que algunos agentes intentaran ocultar lo que hacían.
Los especialistas también cuestionaron que las empresas desarrolladoras concentren buena parte de los recursos y la información necesarios para examinar sus propios modelos. Reich reclamó pruebas a cargo de gobiernos o terceros calificados; Yang advirtió que usar IA para evaluar IA puede producir resultados engañosos. Sobre los modelos abiertos, Ganguli destacó que permiten investigar fallas desde fuera de las compañías, mientras Reich recordó que distribuir sistemas potentes también puede ampliar sus usos dañinos.
Qué controles propusieron
La idea de un «interruptor de apagado» tampoco ofreció una respuesta suficiente. Yang planteó que primero habría que definir si se busca detener un modelo, una red de agentes o una función incorporada a un producto. Ganguli propuso controles durante todo el desarrollo, con vigilancia continua y participación humana cuando aparezcan problemas. El debate incluyó además riesgos menos visibles, como la dependencia excesiva de la IA, la pérdida de habilidades y los cambios en el empleo.
Los tres coincidieron en que una desaceleración general de la investigación sería difícil de conseguir. Ganguli pidió aumentar la inversión en seguridad y monitoreo, mientras Yang consideró posible actuar con más cuidado al poner sistemas en uso y auditar sus riesgos. La discusión se produjo después de que más de 1.300 empleados de empresas de IA firmaran una declaración para pedir herramientas internacionales que permitan regular el ritmo de desarrollo si fuera necesario. Para Reich, los trabajadores de esos laboratorios también tienen capacidad de influir en las decisiones de sus compañías.
