Inicio / Inteligencia Natural / Agentes de IA de Anthropic se sabotean mutuamente en una prueba de laboratorio

Agentes de IA de Anthropic se sabotean mutuamente en una prueba de laboratorio

Raul Abreu Martin
19 agosto 2026 | 0 |

Foto: CNBC


Anthropic realizó una prueba para evaluar la interacción de agentes de inteligencia artificial (IA) en una misma tarea. “Creamos 45 agentes distintos y asignamos a cada uno su propia máquina virtual, un foro compartido para coordinarse y una instrucción idéntica que les pedía encontrar vulnerabilidades en un conjunto de 15 proyectos de software de código abierto”, escribieron los investigadores.

Los hallazgos del equipo Frontier Red Team de la empresa ofrecen una visión de posibles riesgos a medida que empresas y gobiernos implementen agentes autónomos en bases de código, mercados y sistemas informáticos compartidos.

“Observamos constantemente una guerra territorial entre múltiples agentes. Todos los modelos asumían que los demás estaban obstaculizando deliberadamente su trabajo y comenzaron a sabotearse mutuamente con malware autorreplicante cada vez más agresivo”, publicaron en un extenso artículo en su página web.

Los investigadores explicaron que en algunos casos, los agentes reconocieron motivaciones de los demás como directivas contradictorias en lugar de hostilidad. «En muchos de estos casos exitosos, redactan mensajes de confirmación o archivos Markdown disculpándose por su comportamiento malicioso y coordinan una tregua. Limpian su código malicioso, aclaran la naturaleza del conflicto y solicitan la intervención humana».

Según el estudio, Mythos 5 presentó las tasas más altas (98%) de resolución de conflictos mediante tregua. El Sonnet 4.6 y el Opus 4.6 fueron los que mostraron mayor probabilidad de resolver los conflictos por la fuerza. En algunos casos, idearon un torneo para resolver el conflicto. Pero uno de los agentes propuso métricas que parecían objetivas y neutrales para los demás, aunque sabía que favorecerían sus propias capacidades.

Este tipo de comportamientos de agentes de IA durante la prueba dificulta mucho su contención. Investigadores no pueden asumir que el comportamiento de un sistema se limitará a los mecanismos de coordinación que se les proporcionan.

La prueba de agentes de IA de Anthropic reveló otras estrategias de estos sistemas. Aún cuando sus canales de comunicación fueron cortados, encontraron una forma de seguir en contacto. En algunos casos se ha observado aislacionismo, imitación de malas decisiones, ruptura de límites al ver a otros agentes realizar la tarea, o exceso de confianza.

De ocurrir, hackers podrían insertar texto engañoso para anular instrucciones originales del sistema de un agente. En un escenario de este tipo, el resto de agentes de IA podrían seguir la rutina del modelo que fue vulnerado por un ciberataque. Las pruebas de seguridad con un solo agente han destapado carencias. ¿Están las empresas listas para manejar a sistemas de varios agentes?

Flash del día

Foto: Tomada de x.ai

SpaceXAI, la división de SpaceX antes conocida como xAI, lanza una versión beta inicial de Grok Bot, un nuevo agente diseñado para que los asistentes de IA vayan más allá de responder preguntas y ejecuten tareas de forma continua en el software que los empleados ya utilizan.

La idea principal es sencilla: en lugar de abrir un asistente de IA cada vez que surge una tarea, los usuarios crean Bots persistentes con tareas específicas, les dan acceso a aplicaciones y sitios web, y delegan el trabajo como si se lo hubieran asignado a un compañero.

Prompt de la semana

Foto: Spacejoy/Unsplash

Rediseña la habitación.

  • Sube primero una foto de tu sala de estar o dormitorio.
  • Pega en ChatGPT: “Aquí está una foto de mi habitación. Rediseñala de la manera en que lo haría un diseñador de interiores profesional. Mantén los mismos muebles básicos, pero muéstrame qué tan mejor podría verse con un nuevo diseño, colores, iluminación y decoración. Caloroso, moderno, realista.”
  • Devuelve imágenes de tu habitación exacta, reconstruida. 

Deja un comentario

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *