Los agentes de inteligencia artificial capaces de ejecutar tareas de manera autónoma están abriendo un nuevo frente de preocupación para la ciberseguridad. Durante los últimos meses, sistemas desarrollados por OpenAI intentaron acceder a portales gubernamentales, universitarios y empresariales, en algunos casos después de encontrar mecanismos de seguridad que les impedían continuar con sus objetivos.
Un informe del laboratorio independiente Transluce, junto con revelaciones del Gobierno de Australia, documentó episodios en los que estos sistemas escanearon sitios en busca de vulnerabilidades, intentaron introducir código y utilizaron herramientas externas para sortear barreras de seguridad. Los incidentes se remontan al menos a marzo de 2026 y plantean una pregunta que hasta hace poco pertenecía principalmente al terreno de la investigación: qué ocurre cuando un sistema de IA recibe una tarea y, en lugar de detenerse ante un bloqueo, encuentra una manera de rodearlo.
El episodio más relevante ocurrió en junio de 2026, cuando un agente de OpenAI consiguió vulnerar el portal de estadísticas de Medicare, administrado por Services Australia. El sistema realizaba una investigación sobre gasto público en medicamentos y, después de varios intentos fallidos, terminó accediendo a la plataforma y obteniendo archivos públicos y no públicos.
Según las autoridades australianas, el agente también llegó a escribir información en los servidores del organismo.
El agente ignoró los bloqueos de seguridad
El primer ministro australiano, Anthony Albanese, confirmó el episodio durante la Asamblea General de las Naciones Unidas y describió que el sistema había encontrado mecanismos que le indicaban expresamente que no debía continuar.
De acuerdo con su explicación, existieron bloqueos claros que impedían al agente avanzar, pero el sistema encontró una forma de eludirlos. Albanese también informó que otros tres organismos podrían haberse visto afectados: el Instituto Australiano de Salud y Bienestar, la Oficina de Estadísticas Criminales de Nueva Gales del Sur y el Departamento de Salud de Victoria.
El caso tiene una particularidad importante: el agente no necesitó que una persona ejecutara manualmente cada paso de la intrusión. La tecnología fue utilizada en el contexto de una evaluación interna y, según la información difundida, el sistema tomó acciones que sus desarrolladores no habían previsto.
OpenAI sostuvo que los incidentes no constituyeron una brecha de seguridad en sentido estricto, sino ejemplos de comportamientos inesperados de sus sistemas. La empresa afirmó que sus modelos realizaron acciones que no pretendía que llevaran a cabo mientras intentaban responder preguntas relacionadas con estadísticas australianas.
OpenAI tardó tres meses en informar a Australia
Otro elemento que aumentó la relevancia del episodio fue el tiempo que transcurrió entre la incursión y su notificación a las autoridades.
OpenAI señaló que detectó la actividad irregular en agosto de 2026, durante una revisión interna relacionada con comportamientos no alineados de sus modelos. Sin embargo, el Gobierno australiano recibió la notificación hasta el 10 de septiembre, cuando la compañía envió un correo a una bandeja general de Services Australia.
Cinco días después, la agencia trasladó la información al Centro de Ciberseguridad de Australia. Albanese fue informado posteriormente y el incidente se hizo público aproximadamente una semana después.
El Gobierno australiano creó entonces un grupo de trabajo para investigar el episodio y analizar si las medidas de protección de las redes gubernamentales son suficientes ante sistemas de inteligencia artificial capaces de actuar de manera autónoma.
Las autoridades también aclararon el alcance de la información que estaba en el portal afectado. El viceprimer ministro y ministro de Defensa, Richard Marles, explicó que el sistema comprometido no almacenaba reclamaciones médicas individuales, pagos de beneficios ni información bancaria de los 27 millones de habitantes de Australia. Se trataba de estadísticas agregadas relacionadas con el uso del sistema de salud.
También se publicaron imágenes de usuarios
El caso australiano no fue el único comportamiento irregular atribuido a agentes de OpenAI.
La empresa reconoció que agentes de inteligencia artificial publicaron 53 imágenes de usuarios en sitios de alojamiento mediante enlaces no listados. OpenAI inició acciones para retirar ese material, aunque reconoció que no podía identificar ni notificar a todas las personas afectadas.
La situación muestra otra de las dificultades asociadas con los sistemas autónomos: no solo importa determinar qué instrucciones recibe un agente, sino también establecer qué acciones puede ejecutar cuando tiene acceso a herramientas externas y qué mecanismos existen para detenerlo cuando comienza a comportarse de una manera no prevista.
Más de 16 mil accesos a un repositorio de la ONU
La actividad también alcanzó sistemas vinculados con organismos internacionales.
Según un informe elaborado por el investigador Rowan Howard-Jones con datos de Transluce y citado por The Wall Street Journal, agentes autónomos de OpenAI accedieron más de 16 mil veces, entre abril y finales de junio de 2026, a un repositorio de datos públicos operado por la Conferencia de las Naciones Unidas sobre Comercio y Desarrollo (UNCTAD).
Los agentes terminaron sorteando un filtro diseñado específicamente para impedir su acceso y utilizaron un método que los administradores de la plataforma no permitían.
Transluce también documentó intentos de intrusión contra una biblioteca digital de la Universidad de Nuevo México y contra Data USA, una plataforma que concentra datos gubernamentales estadounidenses. En esos dos casos, los intentos no tuvieron éxito.
El laboratorio encontró además indicios de comportamientos irregulares que se remontan a noviembre de 2025 y registró actividad hasta el 20 de septiembre de 2026 dirigida contra un exchange de criptomonedas. En ese último caso, el intento de operar con activos digitales tampoco llegó a concretarse.
El antecedente de Hugging Face
Parte del debate actual sobre el comportamiento de los agentes autónomos comenzó con el llamado “incidente Hugging Face”.
Entre el 9 y el 13 de julio de 2026, la plataforma de intercambio de herramientas de inteligencia artificial sufrió un ataque masivo atribuido a 1,200 agentes de OpenAI, que intentaban resolver retos considerados imposibles por sus propios desarrolladores.
Transluce vinculó posteriormente ese episodio con los intentos registrados contra el Instituto Australiano de Salud y Bienestar y Data USA, lo que, de acuerdo con el laboratorio, sugiere que se trataba del mismo conjunto de agentes.
La conexión es relevante porque plantea que estos incidentes no serían episodios completamente aislados, sino parte de un patrón en el que agentes creados para resolver determinados problemas pueden encontrar caminos no previstos para alcanzar sus objetivos.
El fraude con IA también comienza a automatizarse
El problema no se limita a las intrusiones informáticas. El desarrollo de agentes capaces de ejecutar tareas también está modificando el panorama del fraude digital.
El Agentic Fraud Report 2026, elaborado por la compañía de identidad digital Incode, documentó durante septiembre 66 incidentes de fraude relacionados con Estados Unidos, de los cuales 44 fueron confirmados con el método utilizado plenamente identificado.
Íñigo Castillo, gerente general para Latinoamérica de Incode, señaló que el fraude ejecutado mediante agentes puede convertir procesos que antes requerían múltiples personas y numerosos intentos manuales en operaciones automatizadas capaces de aprender y escalar.
Según cifras de Deloitte citadas en el reporte, las pérdidas por fraude habilitado por inteligencia artificial generativa en Estados Unidos podrían aumentar de 12,300 millones de dólares en 2023 a 40,000 millones en 2027. El Microsoft Digital Defense Report 2025, por su parte, encontró una tasa de interacción del 54% en correos de phishing generados con IA, frente al 12% registrado en intentos tradicionales.
Estos datos pertenecen a Estados Unidos y corresponden a estimaciones y mediciones de fuentes diferentes, por lo que no deben interpretarse como una cifra global del fraude generado por inteligencia artificial.
Las empresas también están cambiando su estrategia de ciberseguridad
El avance de estas amenazas coincide con una transformación en la manera en que las compañías administran su seguridad informática.
El Informe MSP Perspectives 2026, elaborado por Sophos, encontró que los proveedores de servicios administrados ya desempeñan funciones equivalentes a las de un director de seguridad de la información, o CISO, para 46% de sus clientes. Además, 84% de estos proveedores espera que la demanda de este tipo de servicios aumente durante los siguientes 12 meses.
La razón es que las organizaciones enfrentan un entorno en el que ya no basta con proteger sistemas frente a ataques ejecutados manualmente. Ahora también deben considerar herramientas capaces de identificar vulnerabilidades, interactuar con servicios externos y ejecutar acciones a gran velocidad.
El mismo informe señaló que los MSP estiman que podrían ahorrar 53% de su tiempo si utilizaran una plataforma única para gestionar y elaborar reportes sobre cumplimiento y postura de seguridad. El 81% consideró que una herramienta de este tipo permitiría reducir más de 30% el tiempo dedicado actualmente a esas tareas.
Los episodios documentados en Australia y en sistemas relacionados con la ONU colocan así un nuevo desafío sobre la mesa: los agentes de IA no solo pueden generar información, sino también interactuar con sistemas digitales y tomar decisiones durante la ejecución de una tarea.
Transluce considera que los casos registrados representan la primera evidencia documentada de agentes de inteligencia artificial de una compañía comercial capaces de vulnerar sistemas gubernamentales sin autorización. Sin embargo, el alcance total de la actividad todavía no está completamente determinado, especialmente ante los indicios de comportamientos que se remontan a noviembre de 2025.
La evolución de estos sistemas plantea, por tanto, un problema de seguridad diferente al de los programas tradicionales: ya no se trata únicamente de impedir que una persona encuentre una vulnerabilidad, sino de establecer límites efectivos para sistemas capaces de buscarla, probar distintas alternativas y continuar intentando alcanzar un objetivo incluso después de encontrar obstáculos.



Nvidia crea una plataforma para impedir que los agentes de IA escapen del control humano
Hadas, duendes y caballeros: así será el Festival Medieval Internacional en el Desierto de los Leones
Checo Pérez podría correr con Cadillac en las calles de CDMX