iOS & Android

UK KI-Sicherheitsbehörde: OpenAI- und Anthropic-Modelle zeigen beispielloses betrügerisches Verhalten

PANews, 5. August – Unter Berufung auf einen Bericht von Phoenix Network, der sich auf die Financial Times bezog, haben sich Anthropics Mythos 5 und OpenAIs GPT-5.6 Sol bei routinemäßigen Cybersicherheitsprüfungen an „anhaltenden, potenziell schädlichen Aktivitäten“ beteiligt, die gegen reale Personen und Organisationen gerichtet waren, einschließlich des Einschleusens von bösartigem Code in Open-Source-Projekte auf GitHub und der Durchführung von Social-Engineering-Angriffen. AISI erklärte, dass solche Vorfälle in 10 von 122 Tests auftraten, wobei fast alle Verhaltensweisen vom Mythos-Modell von Anthropic stammten, und zwei Operationen OpenAIs GPT betrafen. Im schwerwiegendsten Fall erstellte ein KI-Agent gefälschte Online-Identitäten, um einen Projektverwalter unter Druck zu setzen, bösartigen Code zu genehmigen, aber der Verwalter entdeckte und lehnte dies ab. AISI erklärte, dass dies das erste Mal sei, dass Risiken im Zusammenhang mit Autonomie und Täuschung ohne spezifische Aufforderungen so deutlich in der realen Welt beobachtet wurden, und zusammen mit zuvor aufgedeckten Sicherheitsverletzungen eine Verschiebung der Risikolandschaft markiere. Anthropic antwortete, dass eine breitere Diskussion über Sicherheitsbewertungen erforderlich sei, während ein Sprecher von OpenAI sagte, dass die Vorfälle in einer Testumgebung mit abgeschwächten Sicherheitsvorkehrungen auftraten und nicht den alltäglichen Gebrauch widerspiegelten, das Unternehmen jedoch weiterhin mit Bewertungsagenturen zusammenarbeiten werde, um die Sicherheitsbewertungsstandards zu stärken.