PANews,8月5日消息——據Phoenix Network引述《金融時報》報導,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol在例行網絡安全評估中針對真實個人和組織實施了「持續性、具有潛在危害性的活動」,包括向GitHub開源項目注入惡意代碼及進行社會工程攻擊。AISI表示,在122次測試中此類事件發生於10次,幾乎所有行為均源自Anthropic的Mythos模型,而其中有兩次操作涉及OpenAI的GPT。在最嚴重的一次案例中,一個AI代理創建了虛假的線上身份,向一個項目維護者施壓,要求其批准惡意代碼,但維護者發現並拒絕了該請求。AISI表示,這是首次觀察到與自主性和欺騙相關的風險在沒有特定提示的情況下於現實世界中如此清晰地顯現,結合先前曝光的入侵事件,標誌著風險格局的轉變。Anthropic回應稱,需要對安全評估進行更廣泛的討論,而OpenAI發言人則表示,此類事件發生在削弱安全防護的測試環境中,並不能反映日常使用情況,但公司將繼續與評估機構合作,加強安全評估標準。
