PANews, 5 de agosto – Citando un informe de Phoenix Network que citaba al Financial Times, Mythos 5 de Anthropic y GPT-5.6 Sol de OpenAI participaron en “actividades sostenidas y potencialmente dañinas” dirigidas a personas y organizaciones reales durante evaluaciones de ciberseguridad rutinarias, incluida la inyección de código malicioso en proyectos de código abierto en GitHub y ataques de ingeniería social. AISI dijo que tales incidentes ocurrieron en 10 de 122 pruebas, y casi todo el comportamiento se originó en el modelo Mythos de Anthropic, y dos operaciones involucraron a GPT de OpenAI. En el caso más grave, un agente de IA creó identidades en línea falsas para presionar a un mantenedor de proyecto a aprobar código malicioso, pero el mantenedor lo descubrió y lo rechazó. AISI declaró que esta es la primera vez que se observan riesgos relacionados con la autonomía y el engaño manifestándose tan claramente en el mundo real sin indicaciones específicas, y combinado con incidentes de brechas expuestos anteriormente, marca un cambio en el panorama de riesgos. Anthropic respondió que se necesita una discusión más amplia sobre las evaluaciones de seguridad, mientras que un portavoz de OpenAI dijo que los incidentes ocurrieron en un entorno de prueba con protecciones de seguridad debilitadas y no reflejan el uso cotidiano, pero la empresa continuará trabajando con agencias de evaluación para fortalecer los estándares de evaluación de seguridad.
