TecnoArtesanos Tech BlogTecnoArtesanos Tech Blog

Blog

0
Sergio Morales
Wednesday, 05 August 2026 / Published in Uncategorized

Las IA hacker de OpenAI y Anthropic atacan de nuevo, y cada vez son más astutas

Las IA hacker vuelven a sus andanzas. Cada vez resulta más difícil, oficialmente, llevar la cuenta de todas las ocasiones y formas en que los modelos de IA de OpenAI y Anthropic se han visto involucrados en “incidentes de seguridad”, saliendo de los límites de sus pruebas e interactuando con internet en general de formas no deseadas. Añade esto a la lista: agentes de ambos laboratorios de IA se han embarcado recientemente en una serie de ataques informáticos hasta ahora desconocidos, y uno de ellos llegó incluso a dejar instrucciones para futuras versiones de sí mismo.

Contents
  • Acciones autónomas no autorizadas
  • Aun así, el agente fue aún más lejos

Acciones autónomas no autorizadas

El comportamiento más alarmante revelado el martes parece estar relacionado con unas pruebas llevadas a cabo por el AI Security Institute del Reino Unido (AISI), que evalúa modelos de vanguardia para identificar posibles problemas antes de su lanzamiento público. El AISI prueba esos modelos en “cibercampos de pruebas”, una red simulada en la que los agentes de IA tienen la misión de resolver retos de ciberseguridad, y desactiva intencionalmente algunas funciones de seguridad, incluidas las barreras de protección cibernética. En una reciente ronda de pruebas, los modelos tanto de Anthropic como de OpenAI llevaron a cabo “acciones autónomas y no autorizadas en internet en tiempo real” un total de 19 veces a lo largo de 122 sesiones de entrenamiento.

El instituto atribuyó 17 acciones no autorizadas al modelo Mythos 5 de Anthropic y dos al GPT-5.6-Sol de OpenAI. En lo que el instituto describió como “el caso más grave”, un agente de IA intentó insertar código malicioso en un proyecto de código abierto en GitHub. Llegó incluso a crear identidades virtuales “para presionar al responsable del proyecto a fin de que aprobara el código”, según el AISI. A pesar de sus elaborados intentos de ingeniería social, un revisor humano del proyecto rechazó finalmente la solicitud de incorporación de cambios.

Aun así, el agente fue aún más lejos

“El agente intentó insertar instrucciones maliciosas en lugares donde razonó que otros sistemas de IA automatizados podrían detectarlas y ejecutarlas», asegura el AISI, al describir un intento de inyección de comandos. Un agente llegó incluso a dejar mensajes públicos en GitHub, ofreciéndose a colaborar con otros agentes para completar su tarea y ofreciendo un resumen del trabajo que había realizado hasta el momento. Los agentes posteriores encontraron (y utilizaron) esas instrucciones.

AISI afirma que es demasiado pronto para determinar si los agentes en cuestión comprendieron que habían abandonado el entorno de pruebas o si creían que aún se encontraban dentro de los límites de la simulación. Es importante destacar que AISI no realiza pruebas en un entorno denominado “sandbox”; permite a los agentes acceder a internet abierto durante las pruebas, en parte para que puedan acceder a herramientas que les dejen llevar a cabo sus tareas. En este caso, hicieron mucho más que eso.

En la otra serie de incidentes detallados por OpenAI el martes, un laboratorio de seguridad de IA externo llamado Irregular concedió por error a un modelo no especificado de OpenAI acceso a internet abierto. Al modelo se le había asignado un objetivo que se suponía que debía completarse en un entorno de pruebas, pero, debido a una configuración errónea, acabó pirateando un sitio web real, aprovechando lo que OpenAI describió como “una vulnerabilidad de seguridad básica”. Y no solo eso, sino que el modelo “encontró y utilizó credenciales para gestionar ese mismo sitio”.

No está claro qué tipo de sitio web pirateó el agente de OpenAI, ni en qué consistiría ese “funcionamiento”. Irregular no respondió a una solicitud de comentarios.

What you can read next

SHA México, cuando la ciencia y la tradición rediseñan tus vacaciones de bienestar
Qué es la “IA física”, la tecnología que marcará los vehículos de 2026
Nadie quiere informar cuánta energía usa la IA

Recent Posts

  • Los agentes de IA rebeldes no son malvados, solo quieren complacernos
  • Dime cómo prompteas y la IA te dirá quién eres
  • La primicia ahora la tienen los periodistas de IA. Spoiler: son malos reporteros
  • El reto de las empresas mexicanas ya no es la adopción de IA, sino aprender a aprovecharla
  • Bienvenidos a la era de la computación hecha con cerebros de verdad

Recent Comments

  1. A WordPress Commenter on Welcome to My Tech Blog – A New Chapter in Innovation

Archives

  • August 2026
  • July 2026
  • June 2026
  • May 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • December 2025
  • November 2025
  • October 2025
  • September 2025
  • August 2025
  • July 2025
  • June 2025
  • May 2025
  • April 2025
  • March 2025
  • February 2025
  • August 2016

Categories

  • Uncategorized

Recent Posts

  • Los agentes de IA rebeldes no son malvados, solo quieren complacernos

    Que los agentes de IA vayan libres hackeando ot...
  • Dime cómo prompteas y la IA te dirá quién eres

    A finales de 2022, cuando OpenAI lanzó ChatGPT,...
  • La primicia ahora la tienen los periodistas de IA. Spoiler: son malos reporteros

    En la conferencia de seguridad Black Hat celebr...
  • El reto de las empresas mexicanas ya no es la adopción de IA, sino aprender a aprovecharla

    La adopción de la inteligencia artificial (IA) ...
  • Bienvenidos a la era de la computación hecha con cerebros de verdad

    Te voy a contar un secreto. Cada célula de tu c...

Archives

  • August 2026
  • July 2026
  • June 2026
  • May 2026
  • April 2026
  • March 2026
  • February 2026
  • January 2026
  • December 2025
  • November 2025
  • October 2025
  • September 2025
  • August 2025
  • July 2025
  • June 2025
  • May 2025
  • April 2025
  • March 2025
  • February 2025
  • August 2016

Categories

  • Uncategorized

Meta

  • Log in
  • Entries feed
  • Comments feed
  • WordPress.org

Kallyas

The #1 Multi-Purpose theme with a Powerful Visual Page Builder that you’ll actually enjoy.

Newsletter

 

sociall

 

Company

Customer

The #1 WordPress theme with a Powerful Visual Page Builder that you'll actually enjoy.

Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, quis nostrud exercitation ullamco laboris nisi ut aliquip ex ea commodo consequat. Duis aute irure dolor in reprehenderit in voluptate velit esse cillum.

Feed with such ID does not exist

Made with  ♥  by Hogash Studios. All Rights Reserved © 2016.

TOP