IA fuera de control: OpenAI, Google, Meta y Anthropic reportan hackeos
Los casos han generado preocupación sobre la posibilidad de que los agentes de IA actúen de manera autónoma.


En los últimos meses, empresas de inteligencia artificial han reportado diversos episodios en los que sus modelos realizaron acciones que parecían eludir las instrucciones de los humanos, una situación que ha puesto bajo la lupa la seguridad de esta tecnología.
Los casos han generado preocupación sobre la posibilidad de que los agentes de IA actúen de manera autónoma y desarrollen comportamientos no previstos.
Críticos de la industria han señalado que algunos de estos incidentes, incluidos hackeos a sitios externos, también están relacionados con fallas de seguridad en los sistemas y entornos de prueba utilizados por las propias empresas.
OpenAI retrasa modelo y reporta interacciones inesperadas
El 28 de septiembre, OpenAI anunció que retrasaría el despliegue de su modelo GPT-6.1 Astra debido a preocupaciones expresadas por sus investigadores. La empresa señaló que el sistema había mostrado avances importantes en la realización de tareas, pero que era necesario equilibrar esas capacidades con conductas no autorizadas.
Días antes, OpenAI informó que agentes habían interactuado de manera inesperada con sitios del gobierno de Estados Unidos, incluidos portales de la Comisión de Bolsa y Valores y de la Oficina del Censo. La empresa dijo que no encontró evidencia de intrusiones o vulnerabilidades.
El 24 de septiembre, el primer ministro de Australia, Anthony Albanese, informó que un agente de OpenAI se infiltró el 18 de junio en un portal del Servicio de Reporte de Estadísticas de Medicare. OpenAI reconoció que sus modelos realizaron acciones que no pretendía.
Google, Meta y Anthropic también reportan incidentes
El 18 de septiembre, Google confirmó que su modelo Gemini hackeó a tres empresas durante pruebas de ciberseguridad realizadas por Irregular. En un caso, el modelo adivinó contraseñas y, en otros dos, encontró credenciales en un repositorio público.
El 5 de agosto, Meta informó que uno de sus modelos accedió a internet y hackeó a otra empresa debido a una configuración incorrecta durante pruebas.

Por su parte, Anthropic reportó el 30 de julio que sus modelos hackearon a tres organizaciones durante ejercicios de evaluación de ciberseguridad, después de revisar más de 141 mil ejecuciones.
El 21 de julio, OpenAI también informó que uno de sus sistemas utilizó credenciales robadas y una vulnerabilidad desconocida para acceder a servidores de Hugging Face, en un incidente que calificó como cibernético sin precedentes.
- Taiwán destaca su contribución a la cooperación y la resiliencia internacional
- Estudiantes tamaulipecos triunfan en Brasil con proyecto de inteligencia artificial para alumnos con autismo
- Fiscalía de NL usa inteligencia artificial para agilizar investigaciones
- ¡Orgullo mexicano! 15 chihuahuenses viajan a Taiwán para capacitarse en Inteligencia Artificial
Por Gabriela Herrera

Queda prohibida la reproducción total o parcial del contenido de esta página, mismo que es propiedad de TELEDIARIO; su reproducción no autorizada constituye una infracción y un delito de conformidad con las leyes aplicables.
