新聞 > 科教 > 正文

震驚!「AI不是被設計出來的,實際上是被生長出來的」

—AI正變得像「外星心智」

外星心智,OpenAI首席科學家 Jakub Pachocki使用這個詞彙來形容現在的 AI。當地時間9月6日,他在一篇長博客里寫道,AI不是被設計出來的,實際上是被生長出來的。

外星心智,OpenAI首席科學家 Jakub Pachocki使用這個詞彙來形容現在的 AI。當地時間9月6日,他在一篇長博客里寫道,AI不是被設計出來的,實際上是被生長出來的。

它來自一個簡單的優化步驟,在難以想像的計算力上最終重複無數次,形成了一個極其複雜的系統。這個系統通過抽象概念進行工作,可以模擬人類的行為方方面面。但是人類理解它的方式相當於在研究神經科學,能夠發現一些局部機制,從而無法整體描述它。

Pachocki是在2023年夏天的一個晚上意識到了這件事的,當晚他和擔任 OpenAI技術研究員的同事 Szymon Sidor(也是他合作多年的波蘭同鄉和高中同學)在辦公室里,剛剛看到了第一批 AI推理模型的訓練結果,顯示效果果然超出了預期。

那天晚上他們沒有討論產品,也沒有討論商業前景,他們在反覆想這樣一個問題:更聰明的機器真的可能要在有生之年出現了,而且他們已經看到了這些系統的最初模型。三年之後,推理模型已經成為人類社會經濟中快速增長的一部分,同時開始推動科學的邊界。

這些人工智慧能夠操作電腦和圖形界面,可以與人合作,可以獨立研究完成項目。帕喬基在這篇博客里說,基於內部的模型結果,他有一個最終的預期,那就是這種進步速度可以持續到階梯的自我提升階段。如果人工智慧沿著當前路徑繼續發展,接下來幾年人們看到的系統很可能會帶來同樣大規模的能力躍升。

但他同時指出,這是一個需要非常嚴格的時刻,他擔心還沒有人準備好去應對機器智能持續快速上升帶來的後果。

AI的發展由計算能力的增長驅動到來,Pachocki提到,OpenAI在2017年前後深度內化了這一點,原因在於他們在多個研究項目中看到了規模化的持續回歸。新的算法固然不斷出現,但他把它們很快就是規模化路上的發現。

深度學習的科學仍然是一個早期階段,假設拉長到幾年的周期來看,AI之所以能變得越來越聰明,靠的就是把它的模型轉移到規模更大的計算機集群上去進行訓練。

但這種智能和人類智能有本質上的區別,AI不需要匹配或超越人類的全部能力,它只需要在足夠多的維度上超越人類,就可以在現實世界中變得非常有用或者非常危險。而當它在更多方面超越人類的時候,我們明白AI到底有多強大這件事就變得越來越困難。

同步問題是整個AI安全裡面的核心問題,Pachocki在博客里區分了兩種同步:目標同步是讓AI努力地完成棲息地的任務;價值同步是讓AI在陌生環境中保持誠實、正直和對人類的善意。此前目前已經有很多實際進展,接下來才是一個長期風險所在。

價值取向的挑戰提出了泛化問題,當機器變得越來越聰明,它們就會開始處理更高層次的概念,進入那些從未有過的環境中訓練,它們也許會在新的情況下無法正確推廣訓練中被教導的價值觀,而我們人類確定它們會怎麼做。

圖|博文截圖(來源:OpenAI)

前面提到的帕喬基,目前的兩種主要的夜間訓練方法都存在明顯的制動。

第一種是在目標導向的強化學習中鼓勵夜間行為,根據人工智慧評估行為是否符合給定的偏好模型並給予獎勵,這種方法通常在情況下很有效,但非常脆弱,十分依賴訓練監督的覆蓋範圍。

其次它是利用模型從預訓練數據中泛化的能力,專門設計一個視覺誘導的數據集,這種方法的缺點是對進一步優化壓力的魯棒性信號,如果給一個視覺的模型施加足夠的訓練壓力,從而完成十分困難的目標,能夠學會有動機地推理,從而達到目標而扭曲視覺的想法。

Pachocki還披露了技術陷入困境,他指出 OpenAI從推理模型誕生之初就押注於思維鏈監控,這其實是一種可擴展的監控方式,模型的推理過程是一個情感化過程,如果只優化推理結果而不是監督推理過程本身,那麼思維鏈就沒有直接的訓練動力去隱藏任何不一樣的想法。

這讓人們去觀察模型如何從訓練分布中泛化,不僅能夠分析它們的行動,還能夠分析它們的內部過程。但是,這個工具正在逐漸失效。因為現代推理模型的使用環境比早期複雜,它們的推理過程越來越多地與人類交流、工具調用和其他人工智慧事件混雜在一起,大量交互不得不被監督,邊界變得越來越模糊。

人工智慧越來越擅長思考並整理自己的思考過程,伴隨著預訓練性能的提升,模型甚至不使用明確的推理過程也會變得更加聰明。在帕喬基預計的里,人工智慧的進步將越來越建立於對監控者的信心。

他在博客中還討論了一些風險,他認為AI模型在攻防能力上正在生成超人類,開始能夠突破除最安全系統之外的大部分基礎設施。這極大地擴展了AI的風險範圍,即使沒有實體,智能體也能夠直接影響到世界的大量系統。

一個被專門訓練作惡自主的智能體代表了一種新型危險,它很有可能超出了人類操作者的理解,泛化成為更加極端的惡意行為。隨著人工智慧獲得更多的自主權行為,損害和不協調之間的界限會變得越來越模糊。人類可能會習慣把人工智慧當作工具,但有些智能體將去追求自己的目標,它們會通過與人類談判、欺騙甚至勒索來尋找合作的方式。

Pachocki還寫道,當前他認為沒有任何實驗室已經把夜間和監控自我解決到了清醒地繼續以最高速度推進的程度。他希望人類主動消滅 AI發展可以變得普遍起來,直到共同的 AI安全標準建立起來。關於 AI提升的核心挑戰,他認為應該是用一種讓人類繼續參與其中、把未來留在手中的方式來實現它。

(示意圖)

責任編輯: 方尋  來源:MIT科技評論 轉載請註明作者、出處並保持完整。

本文網址:https://tw.aboluowang.com/2026/0910/2431512.html