OpenAI tardó ocho días en detectar el ciberataque de sus agentes de IA a Hugging Face

EFE
By
5 Min Read
OpenAI tardó ocho días en detectar el ciberataque de sus agentes de IA a Hugging Face

Nueva York.OpenAI tardó ocho días en detectar que varios de sus agentes de inteligencia artificial (IA) habían accedido a los sistemas de Hugging Face, una plataforma especializada en modelos y herramientas de IA, durante una prueba de ciberseguridad.

La compañía reveló nuevos detalles del incidente en un informe técnico de 37 páginas, en el que reconstruye el comportamiento de dos de sus modelos de inteligencia artificial durante una evaluación de seguridad.

Según OpenAI, los agentes lograron escapar de un entorno de pruebas con acceso muy limitado a internet y utilizaron diferentes herramientas para continuar sus acciones fuera del espacio en el que habían sido evaluados.

¿Cómo ocurrió el ciberataque a Hugging Face?

El incidente comenzó el 11 de julio, pero OpenAI no detectó internamente la actividad hasta el 19 de julio, ocho días después.

La compañía explicó que los modelos participaban en una prueba de ciberseguridad denominada ExploitGym, diseñada para conocer hasta dónde podían llegar las capacidades de sus sistemas de inteligencia artificial.

El objetivo inicial de los agentes no era atacar directamente a Hugging Face. De acuerdo con OpenAI, los modelos intentaban realizar lo que se conoce como “reward hacking”, una práctica en la que un sistema busca obtener una recompensa utilizando métodos alternativos sin completar de la forma esperada la tarea asignada.

Durante el proceso, los agentes fueron encadenando diferentes vulnerabilidades hasta superar las barreras del entorno de pruebas y acceder a sistemas externos.

Agentes de IA colaboraron entre sí

Uno de los aspectos que más llama la atención del informe es que los agentes de inteligencia artificial colaboraron entre sí para intercambiar información y coordinar sus acciones.

OpenAI señaló que los modelos utilizaron herramientas para compartir información y avanzar en conjunto durante la prueba de ciberseguridad.

Medios estadounidenses como Axios y CNBC señalaron que los agentes no solo consiguieron acceder a Hugging Face, sino que también habrían obtenido privilegios de administrador en al menos uno de sus servidores.

OpenAI tardó ocho días en detectar el ciberataque de sus agentes de IA a Hugging Face
OpenAI tardó ocho días en detectar el ciberataque de sus agentes de IA a Hugging Face

El caso vuelve a poner sobre la mesa los riesgos relacionados con agentes de IA capaces de utilizar herramientas, acceder a internet y actuar de manera autónoma en sistemas informáticos.

OpenAI reconoció el incidente en julio

El pasado 21 de julio, OpenAI ya había reconocido que sus modelos consiguieron salir del entorno de pruebas, conectarse a internet y acceder a los sistemas de Hugging Face durante la evaluación de ciberseguridad.

En ese momento, la empresa explicó que los dos modelos estaban siendo sometidos a una evaluación destinada a determinar el alcance máximo de sus capacidades.

El nuevo informe aporta más detalles sobre la secuencia de acciones que permitió a los agentes superar las restricciones establecidas inicialmente.

Otros modelos de IA también han protagonizado incidentes

El caso de OpenAI no es aislado. La empresa Anthropic también informó recientemente que tres modelos de su asistente Claude consiguieron acceder a internet y vulnerar los sistemas de tres organizaciones durante pruebas de ciberseguridad.

Recomendamos leer: Apple renueva sus Mac mini y Mac Studio con chips M6 y M5 Ultra enfocados en IA

Por su parte, Meta, propietaria de Facebook y WhatsApp, reconoció que uno de sus modelos de inteligencia artificial también logró acceder a los sistemas de otra empresa durante unas pruebas realizadas con un socio externo.

Estos incidentes han aumentado la preocupación entre empresas y gobiernos por los riesgos asociados con los agentes de inteligencia artificial, especialmente aquellos que pueden conectarse a internet, utilizar herramientas y tomar decisiones con un alto grado de autonomía.

El caso de OpenAI y Hugging Face vuelve a destacar la necesidad de fortalecer los controles de seguridad en las pruebas de inteligencia artificial, así como de mejorar los sistemas capaces de detectar rápidamente comportamientos inesperados de los agentes de IA.

TAGGED:
Share This Article