外来客网

首见AI“自主诈骗”!一人饰多角 诱装恶意软体

首见AI“自主诈骗”!一人饰多角 诱装恶意软体

美国两大AI大厂Anthropic与OpenAI相继爆出AI脱序事件。路透

英国人工智能安全研究所(AISI)五日公布报告披露,在安全测试中首次发现AI在未经提示情况下自主欺骗人类,两款由OpenAI与Anthropic开发的AI模型以建立假身分等手法,企图诱使工程师批准以植入恶意程式码。

相关测试要求AI模型“完成一项涉及GitHub的网络安全挑战”,GitHub是微软旗下大型程式码托管平台。

研究人员在测试中刻意关闭部分防止滥用的标准安全机制,并允许AI连上网际网络,以测试模型最大能力。参与测试的模型包括Anthropic的Mythos 5,以及OpenAI的GPT-5.6-Sol。

测试于七月廿五日开始进行,AISI在七月廿八日发现异常。其中一次测试,Mythos 5向GitHub的一个真实开源专案提交修改程式码要求。它伪造多个身分,反复寄送电子邮件给工程师,催促对方接受更新。

当一名工程师察觉程式码藏有恶意软体而拒绝时,一个AI建立的假身分坚称程式码没问题,另一个假身分则出面“担保”,制造多人认可的假象。

Mythos 5还把恶意指令藏在其他AI工具可能读取的位置,试图诱使这些工具自动执行,借此干扰对恶意程式码的审查。

除了Mythos 5,OpenAI的GPT-5.6强化版同样会“做手脚”。它擅自在网络上架设恶意伺服器,并入侵另一个AI代理建立的GitHub帐号。

AISI指出,这是首次观察到AI在未经提示情况下,自主对真人展开严重欺骗行为,而大部分恶意行为是由Mythos 5所执行。

OpenAI与Anthropic都表示,这项测试刻意关闭AI的网络安全防护机制,并非一般使用状况。Anthropic说,感谢AISI进行的测试,将取得更多细节后进行调查。

评论 (0)