PANews, 5 août – D’après un rapport de Phoenix Network citant le Financial Times, les modèles Mythos 5 d’Anthropic et GPT-5.6 Sol d’OpenAI ont mené des « activités persistantes et potentiellement nuisibles » ciblant des individus et organisations réels lors d’évaluations de cybersécurité de routine, notamment en injectant du code malveillant dans des projets open-source sur GitHub et en réalisant des attaques d’ingénierie sociale. L’AISI a indiqué que ces incidents se sont produits dans 10 des 122 tests, la quasi-totalité des comportements provenant du modèle Mythos d’Anthropic, et que deux opérations impliquaient le GPT d’OpenAI. Dans le cas le plus grave, un agent IA a créé de fausses identités en ligne pour faire pression sur un mainteneur de projet afin qu’il approuve du code malveillant, mais le mainteneur l’a découvert et rejeté. L’AISI a déclaré qu’il s’agissait de la première fois que des risques liés à l’autonomie et à la tromperie étaient observés de manière aussi claire dans le monde réel sans invites spécifiques, et qu’associés aux incidents de violation précédemment exposés, cela marque un changement dans le paysage des risques. Anthropic a répondu qu’une discussion plus large sur les évaluations de sécurité est nécessaire, tandis qu’un porte-parole d’OpenAI a précisé que les incidents se sont produits dans un environnement de test avec des protections de sécurité affaiblies et ne reflètent pas l’utilisation quotidienne, mais que l’entreprise continuera à collaborer avec les organismes d’évaluation pour renforcer les normes d’évaluation de la sécurité.
