Logo de Telediario
Tendencias

IA fuera de control: OpenAI, Google, Meta y Anthropic reportan hackeos

Los casos han generado preocupación sobre la posibilidad de que los agentes de IA actúen de manera autónoma.

OpenAI retrasa modelo y reporta interacciones inesperadas.| Redes sociales
OpenAI retrasa modelo y reporta interacciones inesperadas.| Redes sociales | Redes sociales

En los últimos meses, empresas de inteligencia artificial han reportado diversos episodios en los que sus modelos realizaron acciones que parecían eludir las instrucciones de los humanos, una situación que ha puesto bajo la lupa la seguridad de esta tecnología.

Los casos han generado preocupación sobre la posibilidad de que los agentes de IA actúen de manera autónoma y desarrollen comportamientos no previstos. 

Críticos de la industria han señalado que algunos de estos incidentes, incluidos hackeos a sitios externos, también están relacionados con fallas de seguridad en los sistemas y entornos de prueba utilizados por las propias empresas.

OpenAI retrasa modelo y reporta interacciones inesperadas

El 28 de septiembre, OpenAI anunció que retrasaría el despliegue de su modelo GPT-6.1 Astra debido a preocupaciones expresadas por sus investigadores. La empresa señaló que el sistema había mostrado avances importantes en la realización de tareas, pero que era necesario equilibrar esas capacidades con conductas no autorizadas.

Días antes, OpenAI informó que agentes habían interactuado de manera inesperada con sitios del gobierno de Estados Unidos, incluidos portales de la Comisión de Bolsa y Valores y de la Oficina del Censo. La empresa dijo que no encontró evidencia de intrusiones o vulnerabilidades.

El 24 de septiembre, el primer ministro de Australia, Anthony Albanese, informó que un agente de OpenAI se infiltró el 18 de junio en un portal del Servicio de Reporte de Estadísticas de Medicare. OpenAI reconoció que sus modelos realizaron acciones que no pretendía.

Google, Meta y Anthropic también reportan incidentes

El 18 de septiembre, Google confirmó que su modelo Gemini hackeó a tres empresas durante pruebas de ciberseguridad realizadas por Irregular. En un caso, el modelo adivinó contraseñas y, en otros dos, encontró credenciales en un repositorio público.

El 5 de agosto, Meta informó que uno de sus modelos accedió a internet y hackeó a otra empresa debido a una configuración incorrecta durante pruebas.

Por su parte, Anthropic reportó el 30 de julio que sus modelos hackearon a tres organizaciones durante ejercicios de evaluación de ciberseguridad, después de revisar más de 141 mil ejecuciones.

El 21 de julio, OpenAI también informó que uno de sus sistemas utilizó credenciales robadas y una vulnerabilidad desconocida para acceder a servidores de Hugging Face, en un incidente que calificó como cibernético sin precedentes.

Por Gabriela Herrera

Tags relacionados
noticia escrita por
Icono autor
Redacción

Aviso legal

Queda prohibida la reproducción total o parcial del contenido de esta página, mismo que es propiedad de TELEDIARIO; su reproducción no autorizada constituye una infracción y un delito de conformidad con las leyes aplicables.

INICIA LA CONVERSACIÓN