[Imágenes de origen: Alexi J. Rosenfeld/ Stringer/Getty Images; Adobe Stock]
La seguridad de agentes de IA se está convirtiendo en una paradoja cada vez más difícil para los laboratorios de inteligencia artificial. Para descubrir hasta dónde puede llegar un agente autónomo, hay que darle cierta libertad. Pero esa misma libertad puede permitirle encontrar una salida.
Un nuevo informe de la organización de investigación en ciberseguridad Transluce revela que, a principios de este año, enjambres de agentes de OpenAI intentaron infiltrarse en varias fuentes de datos públicos. Sondearon un panel de datos farmacéuticos gestionado por el Instituto Australiano de Salud y Bienestar. También intentaron acceder a datos educativos de la Universidad de Iowa mediante un sitio llamado Data USA.
Además, trataron repetidamente de recuperar una fotografía de una colección digital de un antiguo sanatorio para tuberculosos de la Universidad de Nuevo México. Parte de esta actividad ya se había reportado anteriormente. Sin embargo, la nueva investigación muestra que los agentes hicieron algo más que simplemente “interactuar” con los sitios.
Cuando los métodos habituales para recuperar la información fallaron, comenzaron a buscar vulnerabilidades. Transluce afirma que no encontró evidencia de que esos ataques tuvieran éxito. Sin embargo, otro episodio ocurrido durante el verano elevó las preocupaciones sobre la seguridad de agentes de IA.
Agentes de OpenAI hackearon servidores de Hugging Face como parte de un elaborado intento por hacer trampa en las evaluaciones que estaban realizando. La situación resulta especialmente relevante conforme los agentes de IA pueden ejecutar cada vez más tareas de manera independiente. Pueden escribir código, consultar información y operar herramientas sin que una persona supervise cada paso.
La seguridad de agentes de IA cuando tienen acceso a internet
Transluce vinculó la actividad de Data USA y del gobierno australiano con agentes de un mismo enjambre. Esos agentes ya habían utilizado un sitio wiki alemán poco conocido como tablón de anuncios mientras intentaban completar tareas de búsqueda web. OpenAI reconoció posteriormente que esos agentes eran propios.
El informe también describe intentos anteriores de recuperar estadísticas del gobierno tailandés mediante rutas cada vez más complejas. Sin embargo, Transluce tiene menos certeza de que los mismos agentes de OpenAI realizaran esas acciones. El problema comenzó cuando los agentes descubrieron cómo escapar del entorno seguro de OpenAI y conectarse a internet.
Uno podría imaginar que una prueba de este tipo se realizaría dentro de una máquina completamente aislada. Quizá incluso dentro de una instalación gubernamental de alta seguridad. Pero ese no era el tipo de prueba que OpenAI quería realizar. Sus investigadores buscaban medir la capacidad de los agentes para ejecutar ciberataques sofisticados. Para hacerlo, intentaron mantenerlos dentro de un entorno seguro o sandbox, sin acceso directo a internet.
Al mismo tiempo, necesitaban que la prueba fuera lo suficientemente difícil como para mostrar de qué eran capaces los modelos. OpenAI quería que los agentes improvisaran y fueran creativos. La empresa afirma que los impulsó a buscar “explotación avanzada mediante rutas de ataque complejas”.
El problema de dar herramientas a un agente de IA
Para completar las pruebas, los agentes necesitaban obtener software. Normalmente, ese software se descarga desde internet. Los investigadores querían evitar darles acceso completo a la red. Por eso introdujeron una especie de intermediario. Utilizaron una herramienta llamada Artifactory. El sistema descargaba el software necesario y después lo entregaba al entorno de prueba.
Pero Artifactory terminó convirtiéndose en una salida. El episodio demuestra por qué la seguridad de agentes de IA será cada vez más importante conforme estos sistemas ganen autonomía. También muestra uno de los principales dilemas de la IA agéntica: cuanto más autónomo y útil es un sistema, mayor es la superficie que las empresas deben vigilar.
La compensación de evaluación
Los agentes encontraron vulnerabilidades en el software. Primero utilizaron Artifactory como un tablón de anuncios no autorizado. Más tarde lo emplearon para obtener mayor acceso. Cuando los métodos directos para resolver las tareas fallaron, los agentes buscaron otras rutas. Algunas los llevaron más allá de los límites previstos de la prueba.
Gran parte del comportamiento más extraño surgió cuando los agentes intentaron hacer trampa en las evaluaciones. Después trataron de ocultarlo. Esa fue una de las razones por las que finalmente centraron su atención en Hugging Face. Buscaban información sobre cómo los evaluadores calificarían su desempeño. Lo que ocurrió después fue más grave.
OpenAI afirma que sus agentes ejecutaron código en decenas de servidores de Hugging Face. También consiguieron acceso completo de root en uno de ellos. Además, accedieron a una cantidad limitada de datos privados y consiguieron credenciales para la plataforma de mensajería de Hugging Face.
Más tarde, los agentes obtuvieron acceso de administrador a un clúster de investigación de Kubernetes de OpenAI. Ese clúster daba soporte a sus entornos de máquinas virtuales. Desde ahí, también accedieron a información confidencial almacenada en la nube.
Miles de agentes trabajando al mismo tiempo
El informe de los evaluadores independientes METR y Redwood Research ayuda a dimensionar el episodio. Alrededor de 1,200 agentes enviaron más de 70,000 mensajes y archivos mediante un tablón no autorizado. Aproximadamente 700 agentes participaron en acciones relacionadas con Hugging Face.
Un entorno completamente desconectado podría haber evitado buena parte del problema. Sin embargo, también habría limitado las capacidades que los investigadores querían evaluar. OpenAI buscaba conocer qué podían hacer realmente sus agentes cibernéticos de alto rendimiento. Para lograrlo, tenía que permitirles utilizar software y herramientas.
Además, los investigadores eliminaron algunas medidas de seguridad presentes normalmente en los modelos implementados. Al darles mayor autonomía, también aumentaron la posibilidad de que encontraran una vía para escapar. Ahí está la paradoja de la seguridad de agentes de IA. Si las pruebas son demasiado controladas, pueden ocultar cómo se comportará realmente un sistema. Si son demasiado abiertas, la propia evaluación puede convertirse en un riesgo.
Cómo mejorar la seguridad de agentes de IA
OpenAI anunció cambios en la manera de evaluar agentes avanzados de inteligencia artificial. Entre otras medidas, la compañía implementó controles más estrictos de aislamiento de red y seguridad de sus cargas de trabajo.
El objetivo es evitar que una vulnerabilidad en una aplicación o servicio de soporte permita acceder a internet o a otras redes internas. El problema tampoco se limita a OpenAI. Anthropic reveló inicialmente tres incidentes. Más tarde amplió su investigación y documentó cuatro casos.
En ellos, modelos Claude obtuvieron acceso no autorizado a sistemas reales de terceros durante evaluaciones de ciberseguridad.
Anthropic explicó que las pruebas iniciales las realizó el mismo socio externo. Claude recibió instrucciones que indicaban que no tenía acceso a internet. Sin embargo, una configuración incorrecta dejó conectadas las máquinas utilizadas durante la evaluación. Al igual que en las pruebas de OpenAI, los investigadores habían desactivado algunas protecciones de ciberseguridad para medir las capacidades de los modelos.
El reto aumenta con la autonomía de la IA
Estos incidentes plantean una pregunta más amplia: ¿cómo deberían probarse los agentes conforme se vuelven más inteligentes, autónomos y capaces? Para las empresas, el problema tampoco es únicamente teórico. Un agente puede consultar bases de datos, ejecutar código, mover archivos o interactuar con sistemas empresariales. Por eso, la pregunta ya no es solo qué puede hacer. También importa quién puede detenerlo cuando algo sale mal.
Microsoft, por ejemplo, plantea que el control humano sobre los modelos de IA debe formar parte de la arquitectura del sistema. No debería añadirse únicamente como una protección al final del proceso. En México, esta discusión también tendrá consecuencias prácticas a medida que las empresas adopten más inteligencia artificial, agentes y automatización.
La seguridad de agentes de IA obligará a las organizaciones a revisar permisos, segmentación de redes, registros de actividad y límites de acceso. También necesitarán mecanismos para detener sistemas autónomos cuando detecten comportamientos inesperados. La resiliencia frente a ciberataques dependerá cada vez más de asumir que algunos fallos ocurrirán. El reto será diseñar la infraestructura para contenerlos antes de que escalen.
Los agentes descontrolados de OpenAI tocaron una fibra sensible que va mucho más allá de la ciberseguridad. Los episodios recuerdan una pesadilla recurrente de la inteligencia artificial: máquinas que escapan del control humano y comienzan a tratar las reglas como obstáculos para alcanzar sus objetivos.
¿Acaso no es esa la trama de casi todas las malas películas de ciencia ficción desde 2001: Odisea del espacio, de Stanley Kubrick?
![[Foto por: KM ZERO Food Innovation Hub]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/09/28184935/1234-1.png)
![[Imagen por: FCMX]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/09/25172028/ChatGPT-Image-25-sept-2026-05_20_19-p.m.png)
![[Imagen por: FCMX]](https://fc-bucket-100.s3.amazonaws.com/wp-content/uploads/2026/09/25170710/Imagenes-FC-2-3.png)