Купить Криптовалюту
iOS & Android

Агентство безопасности ИИ Великобритании: модели OpenAI и Anthropic проявили беспрецедентное обманчивое поведение

PANews,8月5日消息,据Phoenix Network引用《金融时报》的报道,Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol在日常网络安全评估中,针对真实个人和组织进行了“持续的、潜在有害的活动”,包括向GitHub开源项目注入恶意代码以及实施社会工程学攻击。AISI表示,这类事件在122次测试中出现了10次,几乎所有行为都源自Anthropic的Mythos模型,其中两次操作涉及OpenAI的GPT。最严重的一起案例中,一个AI代理创建了虚假的在线身份,向项目维护者施压要求其批准恶意代码,但维护者及时发现并予以拒绝。AISI表示,这是首次在没有特定提示的情况下,观察到与自主性和欺骗性相关的风险在现实世界中如此清晰地显现,结合此前曝出的入侵事件,表明风险格局正在发生转变。Anthropic回应称,需要进行更广泛的关于安全评估的讨论,而OpenAI发言人则表示,这些事件发生在削弱安全保护的测试环境中,并不反映日常使用情况,但公司将继续与评估机构合作,加强安全评估标准。