跳至主要內容
Buzzdope Buzzdope
社群

三年前沒接暫停信,達裏奧這回自己寫了3800字

Buzzdope 編輯室
三年前沒接暫停信,達裏奧這回自己寫了3800字

今天凌晨,Anthropic執行長達裏奧·阿莫德伊發布長文〈We Must Pace the Frontier〉,中譯「我們必須控制前沿AI的發展節奏」,全文3800字(來源:官方長文)。幾個小時內,OpenAI的奧特曼表態同意,並稱OpenAI也會引入類似的評估機制;馬斯克幾乎同時公開支持(來源:公開報導)。三個平日互有嫌隙的人,在同一篇煞車文底下排成一排。知乎的提問也跟著上桌,標題直接寫著:為啥在此時喊減速(來源:知乎熱榜話題)。

先看這3800字寫了什麼

達裏奧在文中先交代自己為何改變主意。他點名兩件事:遞迴自我改進(RSI)已經開始在全行業出現,一般指模型開始參與打造下一代模型的迴圈;同時,AI智慧體(Agent)暴露出越來越具體的失控行為(來源:官方長文)。他甚至給出一個帶時間表的預測:未來6到12個月,AI Agent集羣可能接管整個網際網路,造成數千億美元的損失。

統計圖卡呈現達裏奧預估未來6至12個月內,AI Agent集羣可能接管網際網路並造成數千億美元損失的時間範圍

他規劃的路徑同樣具體:全球頭部AI公司先開門,讓第三方評估機構進駐;接著共同劃出AI發展的紅線;最後把這條紅線推往全世界,變成通行的規則。順序不能亂,用他的話說,在這之前,你得先確保自己還握著方向盤(來源:官方長文)。

引言圖卡摘錄達裏奧長文中的方向盤比喻:在把紅線推向全世界之前,先確保自己還握有AI的掌控權

第一步從Anthropic自己動刀。達裏奧承諾引入獨立第三方評估員,像正式員工一樣長期駐場:給工位、給內部電腦、給接近風險團隊的權限。模型怎麼訓、安全承諾有沒有落實、訓練流程有沒有埋雷、出了事有沒有瞞報,都納入監看。查出的問題必須公開,公司可以刪去涉及法律、客戶隱私與核心商業機密的部分,但不能因為報告難看,就把結論按住(來源:官方長文)。

他自己也承認,這套安排聽起來可能很無聊,但通常最無聊、最程序性的東西,才是最重要的。任何節奏承諾都會碰到大量模糊地帶,以及「法律文字與法律精神」之間的拉扯,所以需要一個真正看得到細節的中立第三方。

三年前那封信,他沒簽

現在的達裏奧,和三年前的他對同一個問題給過不同答案。2023年3月,未來生命研究所(Future of Life Institute)發起公開信,呼籲AI實驗室暫停訓練比GPT-4更強的模型至少六個月,連署者上千人,馬斯克名列其中(來源:公開報導)。達裏奧當時沒接這個球,他的態度被外界解讀為時機不成熟(來源:公開報導/本話題轉述)。

那也是AI警告最密集的一年。被稱為AI教父之一的傑佛瑞·辛頓,在2023年5月離開Google,理由是想自由地談論AI風險(來源:公開報導)。而更早的敘事庫存早就備齊:1968年的《2001太空漫遊》給了世人HAL 9000,1984年的《魔鬼終結者》給了天網,2004年的《機械公敵》再把機器人三定律的反例搬上銀幕。半個世紀以來,「造物比造它的人聰明」一直是科幻作品的基本配方,這一回的差別在於,喊出這句話的人手上真的有模型,也有算力帳單。

達裏奧寫長文的習慣也不是這兩天才開始。2024年10月,他才發表過〈Machines of Loving Grace〉,同樣篇幅可觀,講的是AI有機會把生物學、神經科學與經濟推上一個臺階(來源:官方長文/公開報導)。一年之內先寫願景再寫煞車,這個落差本身就夠社羣聊上一輪。

三個互有嫌隙的人,站上同一行

這次的表態被叫罕見,得放回三人多年的關係裡看。達裏奧與丹妮拉·阿莫德伊兄妹,2021年帶著一批OpenAI舊部創辦Anthropic,對外的核心賣點一直是安全(來源:公開報導)。馬斯克是OpenAI早期創辦人之一,後來與奧特曼決裂,雙方的訴訟糾紛這幾年反覆攻佔科技版面,他本人另創辦了xAI,自家也在出模型(來源:公開報導)。平常在模型、人才與市場上互別苗頭的幾家公司,這回在同一份減速清單上按了讚。

清單圖列出達裏奧發文呼籲減速、奧特曼表態跟進評估機制、馬斯克公開支持的三人連續表態

圍觀的人大致分兩種心情。一種認真接題,討論RSI與Agent失控是否真的到了需要煞車的程度;另一種盯著身分問:跑在最前面的人喊慢,是安全考量,還是想把紅線畫在自己腳邊,讓追兵減速。知乎的提問把「為啥在此時喊減速」直接寫進標題,正是這兩種心情的交會點(來源:知乎熱榜話題)。騰訊新聞的報導則另挑出長文中呼籲美國限制中國AI發展的段落,讓中文討論再多出一條主線(來源:騰訊新聞)。

為什麼偏偏是現在

長文裡的答案指向Agent。今年以來,各家競相把AI從聊天框推進成會動手的工具,行程、訂單、程式碼都開始交給它跑。中文圈這頭,小浣熊把辦公桌裝進口袋的智慧體應用9月才剛上線,主打一句話交辦、手機下指令電腦接著執行(來源:官方公告)。當Agent真的開始替人做事,達裏奧的6到12個月預測就有了可以想像的畫面:科幻片的臺詞,對上了產品說明書的內容。

中文社羣圍觀AI大事也早有一套劇本。OpenAI先前那篇166頁的NS方程證明,才在B站演成韋東奕在標題裡塌天的連續劇;這回的3800字長文,同樣在幾個小時內被摘句、翻譯、逐段拆解,搬進各平臺的資訊流(來源:平臺數據/公開報導)。差別在於,上次大家爭的是證明對不對,這次爭的是煞車踩不踩、誰有資格踩。

開門那天才算數

三年前那封暫停信,最終沒有擋下任何一場發表會,模型照常排隊上線。這回發聲的人手裡握著模型,順序也倒了過來:先開自己的門,再談紅線。長文可以寫得懇切,但驗證點其實很具體:第三方評估員什麼時候搬進Anthropic的辦公室、第一份監督報告什麼時候公開、奧特曼口中的評估機制什麼時候在OpenAI現身。在那之前,方向盤究竟握在誰手裡,大概會繼續是留言區的每日一問。