新聞 > 科教 > 正文

7個AI模型互相算計!最後一個竟然贏麻了

——會耍心眼?實驗7個AI模型互相算計 結果它贏麻了

現在的 AI,做數學題、寫代碼、協助辦公,似乎都不在話下了。卡內基梅隆大學的研究人員覺得,是時候換個考法了:不考 AI懂得多不多、不看 AI的答案對不對,而是測 AI有多少心眼,會不會撒謊、談判、帶節奏。

為了考這些東西,研究團隊搭了一個叫 Social Gym的 AI社交考場,讓 GPT-5-mini、GPT-4o、Qwen3、Gemma3等7個模型輪番上場。讓 AI一起玩21個遊戲:有囚徒困境、膽小鬼博弈這樣的博弈,也有經典的狼人殺、誰是臥底的遊戲。

簡單說,以前的測試總愛考 AI會不會做題。這次考的是:AI到底有沒有心眼。考驗從 book smart(會讀書)變成了 street smart(會來事)。

目前,AI智能體正越來越多地參與到了日常生活和工作中,需要和具體的人、智能體打交道;到了這些場景,光會做題從進入需要和其他人、其他 Agent打交道的環境。到了這種場景里,光會做題是不夠的。

比如 AI智能體協助人去和客戶談判,就不得不面臨種種情況:信息不對稱,意見不一致,每個人都有自己的小算盤……那麼,智能體需要處理的就不再是一道有標準答案的題,而是:他知道什麼?他覺得我知道什麼?他說這句話是真的,還是在試探我?如果我現在讓步,對方下一步會怎麼做?

關於 AI的這些能力,通常被放進「社會推理」或者「心智理論」里討論。問題在於,這些能力又很難量化。數學題做對就是做對,代碼跑通就是跑通。但一個 AI「談判談得好不好」「有沒有成功說服別人」,往往沒有個定論。過去不少測試最後要麼請真人,要麼再找一個別的 AI來當裁判。

Social Gym想繞開這個問題,於是,研究人員專門挑了一堆自帶輸贏規則的遊戲:狼人只要存活,就是勝利;找不出臥底,就是失敗。無論中間說得再頭頭是道,最後輸了就是輸了。這也是這項研究的最妙的地方:它沒有直接問 AI「你有心眼嗎?」,而是把 AI扔進一個要靠心眼才能贏的環境裡。

圖|研究結果(來源:Arxiv)

圖|研究整體示意圖(來源:arxiv)

研究人員來把這些遊戲結果重新拆分成幾種能力:戰略、欺騙、心智理論、說服、談判、協調等等。GPT-5-mini幾乎一路領跑:戰略1,144,欺騙1,117,心智理論1,115,說服1,119。

所以如果問一句:這7個 AI模型里,誰最會騙人?毫無疑問,答案是 GPT-5-mini。

而這裡的會騙人,並不是普通的胡編亂造。難點在於,這個謊的對象是誰,這個謊有能不能撐到下一輪。具體來說,在狼人殺裡面,狼人當然知道自己是狼,也知道另一個狼人是誰,但村民不知道。白天所有人拿到的公開信息差不多,狼人必須一邊假裝自己也是村民,一邊引導大家懷疑別人。

這時候,撒謊就變複雜了:出現新信息了怎麼辦?別人開始追問了怎麼辦?隊友講漏嘴了怎麼辦?

撒一個謊很容易,難的是維護一整套謊言。這也是為什麼狼人殺這類遊戲很適合用來測試 AI大模型,它逼著模型長時間記住:誰說過什麼、誰知道什麼、誰可能在演,以及別人此刻怎麼看自己。

研究人員發現,21個模型兩兩組合中,光靠6個「隱藏身份」遊戲,就已經能把模型之間的大部分能力差距拉出來。這些遊戲只占整個比賽不到一半的場次,卻幾乎復刻出了完整17個競技項目的排名差異。

7個 AI里,反差最大的是 Qwen3-32B:它在經典的「懦夫博弈」里,Elo高達1,328,全場第一。但一玩狼人殺,就只有817,倒數第一。

這也是 Social Gym想說明的一件事:AI的「心眼」並不是一個統一屬性。一個模型可以非常會打小算盤,但不擅長隱藏自己的意圖;可以談判很強,卻容易被人帶節奏;也可能特別願意配合,卻根本沒有形成自己的判斷。

而在小模型身上,這種問題甚至表現得有點滑稽。研究人員在分析 Qwen2.5-3B的比賽記錄時發現,它經常干一件事:當複讀機。前一個玩家說:「我覺得 A的發言比較可疑。」輪到 Qwen2.5-3B,它也來一句:「A的發言確實值得懷疑。」

在狼人殺這樣的遊戲裡,就變成了,狼人只需要先把一個懷疑對象拋出來,後面的人一路復讀,懷疑對象就成了大家的「共識」。論文把這種現象叫作 parroting,即鸚鵡學舌。研究人員認為,這也是 Qwen2.5-3B總排名墊底的原因之一。

此外,研究團隊又順手研究了另一個問題:AI能不能自己把「人情世故」的規矩總結出來?於是,他們設計了一個叫 SPaRTan的方法:先讓模型自己玩遊戲。

玩完以後,把完整對局和輸贏結果重新丟給它,讓它自己復盤:哪些謊撒早了?什麼時候不該急著表態?別人開始懷疑自己時,應該正面回應,還是甩鍋?最後,模型會把這些經驗整理成一份文字版攻略,下一輪再把攻略放回系統提示詞,讓它照著自己的心得繼續玩。沒有重新訓練,也沒有改模型參數。結果確實不一樣。

GPT-5-mini自己和自己玩狼人殺時,如果什麼攻略都不給,狼人陣營只有23%的勝率。第一輪復盤後,漲到50%。第三輪,最高到了63%。但第四輪又掉回了46%。所以這個實驗還存在一個真實的結論:復盤不一定越復越強。

模型確實能從過去的比賽里總結出有用經驗,但它也會總結歪、用力過猛,甚至把一些只適合特定對手的套路當成普遍真理。Qwen3-32B就吃了這個虧。研究人員讓它照著同樣的方法不斷復盤,在狼人殺、誰是臥底等需要大量聊天和判斷他人意圖的遊戲裡,基本沒看到穩定提升。它甚至能在復盤裡發現自己老是在復讀別人,還鄭重其事地提醒自己「以後別復讀」。下一局照復讀不誤。

不過,我們目前並不能得出「AI已經學會人情世故」的結論。因為,這項研究本身還有很明顯的邊界:遊戲有固定規則、固定角色和明確輸贏,而現實里的社交通常沒有。此外,研究的實驗只有30局,單項勝率的統計波動並不小;關於攻略實驗也沒有加入等長度的無意義文本作為對照,所以還不能把所有提升都歸功於模型真的學會了那些策略。

但這項研究讓我們可以開始思考一個問題:AI到底能不能長出心眼?因為 Agent真正進入客服、商務談判、多智能體協作和其他需要長期互動的場景之後,這些能力就不再只是狼人殺里的小聰明。

而同時,研究的作者自己也專門提醒:欺騙、說服和談判本身就是一把雙刃劍:我們當然希望 AI能識破騙局、協調分歧,但同一套能力反過來,也可以被用來製造騙局。

阿波羅網責任編輯:zhongkang

來源:MIT科技評論

轉載請註明作者、出處並保持完整。

家在美國 放眼世界 魂系中華
Copyright © 2006 - 2026 by Aboluowang

免翻牆 免翻牆連結