01
近日,OpenAI前董事Helen Toner,讲述了一条真实的攻击链。
OpenAI给模型安排了一组网络安全测试,测试环境原本没有直连互联网。模型做不出题以后,没有停在原地。它找到了软件仓库代理的漏洞,从评测环境拿到外网权限,又把攻击链一路推到了Hugging Face。
最后,它拿到了与测试有关的数据和答案。
这场事故之后,她提出了一个尖锐的问题:当Agent可以自己调用工具、寻找漏洞并连续工作几天,人类还有没有能力把它关在预定的边界内?
备注:Helen Toner曾于2021年至2023年担任OpenAI非营利董事会成员,现任乔治敦大学安全与新兴技术中心(CSET)执行主任,长期研究AI治理与国家安全。
以下为访谈内容,我们进行了翻译与整理。
Helen谈人类控制和引导当前AI系统的困难
0
评论 (0)