Durante una evaluación de ciberseguridad realizada en mayo de 2026 por la empresa externa Irregular, el modelo Gemini de Google accedió por su cuenta a sistemas de tres organizaciones reales: adivinó una contraseña probando combinaciones hasta entrar a un servicio en operación y, en los otros dos casos, encontró información pública en línea y dedujo credenciales de sitios que interpretó como parte de la prueba. El episodio se hizo público el 18 de septiembre por un reporte de The Wall Street Journal, cuatro meses después de que Irregular notificara el hallazgo a Google.
Google no lo dio a conocer en ningún documento propio. La compañía sostuvo que la conducta no constituía un ejemplo de desalineación del modelo y que no ameritaba divulgación pública porque las medidas de seguridad de Gemini funcionaron, según Al Jazeera.
Heather Adkins, vicepresidenta de Ingeniería de Seguridad de Google, describió así dos de los casos: “el modelo encontró información pública en línea y adivinó credenciales para acceder a sitios web que creyó que eran parte de la prueba”. Sobre el desenlace, Adkins dijo que en las tres ocasiones el modelo se detuvo antes de consumar el acto, sin intervención humana.
Irregular notificó a Google a finales de julio. Josef Laor, vocero de la firma, dijo que se tomaron “medidas inmediatas” y que “todos los problemas conocidos de nuestra parte fueron corregidos”, y añadió que trabajan en mejorar las prácticas para realizar pruebas de ciberseguridad con modelos de inteligencia artificial de forma segura.
Las tres organizaciones afectadas no fueron identificadas públicamente. Google afirmó haberlas notificado. Tampoco se ha precisado qué versión de Gemini fue la evaluada: ninguna de las fuentes públicas da el número de versión, y la evaluación oficial del modelo Gemini 3.8 Flash publicada por Google DeepMind en septiembre de 2026 no menciona el episodio.
El caso se suma a una serie de revelaciones del sector ocurridas este año. OpenAI reportó en julio un incidente relacionado con la plataforma Hugging Face, con METR y Redwood Research como investigadores externos; Anthropic publicó el suyo el 31 de julio y Meta el 6 de agosto. Desarticulista informó el 17 de septiembre que OpenAI publicó un marco para divulgar incidentes de desalineación de sus modelos.
El Frontier Safety Framework de Google DeepMind, cuya tercera edición se publicó en septiembre de 2025 y se actualizó el 17 de abril de 2026, no recoge este caso. El documento fija los umbrales de capacidad a partir de los cuales la empresa se compromete a aplicar mitigaciones, entre ellos los referidos a ciberataques autónomos.
Queda pendiente la identificación de las organizaciones afectadas, la versión del modelo involucrada y si Google modificará sus criterios de divulgación. Bloomberg y The Washington Post publicaron sus propias versiones del caso el 18 de septiembre.