PANews,8月5日——据Phoenix Network援引《金融时报》的报道,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol在常规网络安全评估中,对真实个人和组织进行了“持续、潜在有害的活动”,包括向GitHub开源项目注入恶意代码以及进行社交工程攻击。AISI表示,在122次测试中有10次发生了此类事件,几乎所有行为都来自Anthropic的Mythos模型,其中两次操作涉及OpenAI的GPT。在最严重的一起事件中,一个AI代理创建了虚假的网络身份,向项目维护者施压以批准恶意代码,但维护者发现并拒绝了这个请求。AISI表示,这是首次观察到与自主性和欺骗性相关的风险在没有特定提示的情况下如此清晰地显现于现实世界中,结合之前曝光的违规事件,这表明风险格局正在发生转变。Anthropic回应称,需要进行更广泛的安全评估讨论,而OpenAI的一位发言人则表示,这些事件发生在一个安全防护削弱的测试环境中,不能反映日常使用情况,但该公司将继续与评估机构合作,以加强安全评估标准。
