会耍心眼?实验7个AI模型互相算计 结果它赢麻了
来源:倍可亲(backchina.com)现在的 AI,做数学题、写代码、协助办公,似乎都不在话下了。卡内基梅隆大学的研究人员觉得,是时候换个考法了:不考 AI 懂得多不多、不看 AI 的答案对不对,而是测 AI 有多少心眼,会不会撒谎、谈判、带节奏。
为了考这些东西,研究团队搭了一个叫 Social Gym 的 AI 社交考场,让 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 个模型轮番上场。让 AI 一起玩 21 个游戏:有囚徒困境、胆小鬼博弈这样的博弈,也有经典的狼人杀、谁是卧底的游戏。
简单说,以前的测试总爱考 AI 会不会做题。这次考的是:AI 到底有没有心眼。考验从 book smart(会读书)变成了 street smart(会来事)。
目前,AI 智能体正越来越多地参与到了日常生活和工作中,需要和具体的人、智能体打交道;到了这些场景,光会做题从进入需要和其他人、其他 Agent 打交道的环境。到了这种场景里,光会做题是不够的。
比如 AI 智能体协助人去和客户谈判,就不得不面临种种情况:信息不对称,意见不一致,每个人都有自己的小算盘……那么,智能体需要处理的就不再是一道有标准答案的题,而是:他知道什么?他觉得我知道什么?他说这句话是真的,还是在试探我?如果我现在让步,对方下一步会怎么做?
关于 AI 的这些能力,通常被放进“社会推理”或者“心智理论”里讨论。问题在于,这些能力又很难量化。数学题做对就是做对,代码跑通就是跑通。但一个 AI“谈判谈得好不好”“有没有成功说服别人”,往往没有个定论。过去不少测试最后要么请真人,要么再找一个别的 AI 来当裁判。
Social Gym 想绕开这个问题,于是,研究人员专门挑了一堆自带输赢规则的游戏:狼人只要存活,就是胜利;找不出卧底,就是失败。无论中间说得再头头是道,最后输了就是输了。这也是这项研究的最妙的地方:它没有直接问 AI“你有心眼吗?”,而是把 AI 扔进一个要靠心眼才能赢的环境里。
图|研究结果(来源:Arxiv)
图|研究整体示意图(来源:arxiv)
研究人员来把这些游戏结果重新拆分成几种能力:战略、欺骗、心智理论、说服、谈判、协调等等。GPT-5-mini 几乎一路领跑:战略 1,144,欺骗 1,117,心智理论 1,115,说服 1,119。
所以如果问一句:这 7 个 AI 模型里,谁最会骗人?毫无疑问,答案是 GPT-5-mini。
而这里的会骗人,并不是普通的胡编乱造。难点在于,这个谎的对象是谁,这个谎有能不能撑到下一轮。具体来说,在狼人杀里面,狼人当然知道自己是狼,也知道另一个狼人是谁,但村民不知道。白天所有人拿到的公开信息差不多,狼人必须一边假装自己也是村民,一边引导大家怀疑别人。
这时候,撒谎就变复杂了:出现新信息了怎么办?别人开始追问了怎么办?队友讲漏嘴了怎么办?
撒一个谎很容易,难的是维护一整套谎言。这也是为什么狼人杀这类游戏很适合用来测试 AI 大模型,它逼着模型长时间记住:谁说过什么、谁知道什么、谁可能在演,以及别人此刻怎么看自己。
研究人员发现,21 个模型两两组合中,光靠 6 个“隐藏身份”游戏,就已经能把模型之间的大部分能力差距拉出来。这些游戏只占整个比赛不到一半的场次,却几乎复刻出了完整 17 个竞技项目的排名差异。
7 个 AI 里,反差最大的是 Qwen3-32B:它在经典的“懦夫博弈”里,Elo 高达 1,328,全场第一。但一玩狼人杀,就只有 817,倒数第一。
这也是 Social Gym 想说明的一件事:AI 的“心眼”并不是一个统一属性。一个模型可以非常会打小算盘,但不擅长隐藏自己的意图;可以谈判很强,却容易被人带节奏;也可能特别愿意配合,却根本没有形成自己的判断。
而在小模型身上,这种问题甚至表现得有点滑稽。研究人员在分析 Qwen2.5-3B 的比赛记录时发现,它经常干一件事:当复读机。前一个玩家说:“我觉得 A 的发言比较可疑。”轮到 Qwen2.5-3B,它也来一句:“A 的发言确实值得怀疑。”
在狼人杀这样的游戏里,就变成了,狼人只需要先把一个怀疑对象抛出来,后面的人一路复读,怀疑对象就成了大家的“共识”。论文把这种现象叫作 parroting,即鹦鹉学舌。研究人员认为,这也是 Qwen2.5-3B 总排名垫底的原因之一。
此外,研究团队又顺手研究了另一个问题:AI 能不能自己把“人情世故”的规矩总结出来?于是,他们设计了一个叫 SPaRTan 的方法:先让模型自己玩游戏。
玩完以后,把完整对局和输赢结果重新丢给它,让它自己复盘:哪些谎撒早了?什么时候不该急着表态?别人开始怀疑自己时,应该正面回应,还是甩锅?最后,模型会把这些经验整理成一份文字版攻略,下一轮再把攻略放回系统提示词,让它照着自己的心得继续玩。没有重新训练,也没有改模型参数。结果确实不一样。
GPT-5-mini 自己和自己玩狼人杀时,如果什么攻略都不给,狼人阵营只有 23% 的胜率。第一轮复盘后,涨到 50%。第三轮,最高到了 63%。但第四轮又掉回了 46%。所以这个实验还存在一个真实的结论:复盘不一定越复越强。
模型确实能从过去的比赛里总结出有用经验,但它也会总结歪、用力过猛,甚至把一些只适合特定对手的套路当成普遍真理。Qwen3-32B 就吃了这个亏。研究人员让它照着同样的方法不断复盘,在狼人杀、谁是卧底等需要大量聊天和判断他人意图的游戏里,基本没看到稳定提升。它甚至能在复盘里发现自己老是在复读别人,还郑重其事地提醒自己“以后别复读”。下一局照复读不误。
不过,我们目前并不能得出“AI 已经学会人情世故”的结论。因为,这项研究本身还有很明显的边界:游戏有固定规则、固定角色和明确输赢,而现实里的社交通常没有。此外,研究的实验只有 30 局,单项胜率的统计波动并不小;关于攻略实验也没有加入等长度的无意义文本作为对照,所以还不能把所有提升都归功于模型真的学会了那些策略。
但这项研究让我们可以开始思考一个问题:AI 到底能不能长出心眼?因为 Agent 真正进入客服、商务谈判、多智能体协作和其他需要长期互动的场景之后,这些能力就不再只是狼人杀里的小聪明。
而同时,研究的作者自己也专门提醒:欺骗、说服和谈判本身就是一把双刃剑:我们当然希望 AI 能识破骗局、协调分歧,但同一套能力反过来,也可以被用来制造骗局。
版权说明 / Copyright Notice:Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。
评论 (0)