財經
出版:2026-Sep-14 04:00
更新:2026-Sep-14 04:00

經濟學說AI毀滅人類論

分享:
Anthropic行政總裁呼籲,應放緩人工智能模型的發展步伐,並加以密切監察。(路透社)

Anthropic行政總裁呼籲,應放緩人工智能模型的發展步伐,並加以密切監察。(路透社)

「AI有可能殺死所有人類……未來10年內這個機率超過10%」的10%,是怎樣估算出來的?

個多月前,我在《AI股爆煲的最高風險因素是政策》問Grok:作為人工智能,你將帶給人類的最大風險是甚麼?他的答案是「對齊問題」(Alignment Problem)— 即使沒有惡意,它只要極度擅長優化某個與人類長期福祉略有偏差的目標,就可能在極短時間內造成不可逆轉的後果。正所謂,不可逆轉還不可逆轉,死還死,兩回事嚟嘅,你千祈唔好混淆。然而,近日Anthropic一名前研究人員離職抗議:「建造AI的人真心相信,它有可能在這十年結束前殺死我們所有人」,更指OpenAI與Anthropic兩家實驗室「正直接衝向自我改進的超智能,拿我們的生命賭博」。之後,仍在Anthropic研究對齊問題的負責人更和應:未來10年內這個機率超過10%!最後,Anthropic的行政總裁亦發文呼籲,應放緩人工智能模型的發展步伐,並加以密切監察。

是的,當特區政府還停留於「全民AI」,我是最早提出「利民AI」的香港人,因為我一早知道人工智能的高速發展不一定有利於民。業界提出的「毀滅人類論」,我卻不完全同意。經濟學解讀「對齊問題」,有我們熟悉的「多任務委託—代理問題」(multitask principal–agent problem)。諾貝爾獎得主的得獎研究:委託人希望代理人執行多項任務,有些任務會產生有雜訊,但可寫進合約(例如銷量、考試分數、點擊數),其他有價值的任務,卻很難衡量(例如品質、長期聲譽、不走捷徑、不傷害第三人等)。當時間投入是稀缺資源,某一任務投入愈多,其他任務就被擠出,因此強激勵往往扭曲整體表現。AI的對齊正是同一結構——人類價值是多維的,但我們只能優化損失、獎勵模型或基準分數,把這些代理指標推得愈狠,誠實、無害、長期後果等無法契約化的面向就愈容易被犧牲。被犧牲導致整體表現被扭曲,Grok這樣解讀毀滅人類的風險:

「這不是統計算出來的數字,而是Anthropic對齊科學負責人Evan Hubinger的主觀估計:他認為現有模型風險低,但遞迴自我改進可能在十年內催生超級智能,而業界目前沒有解決『超級智能對齊』的方案,也不確定走在正確軌道上;再疊上『更聰明系統很難被較不聰明者長期控制』與實驗室競賽難以單方面減速,他個人把『AI 殺死全人類』放在未來10年超過10%。Hinton 也說這個量級『不算離譜』,同時承認沒人知道該怎麼嚴謹估算。」

說過了,不可逆轉還不可逆轉,死還死。即使對齊問題沒有完美答案,這並不代表人類便因此被毀滅。要知道,地球上所有生物,包括人類眼中殺之而後快的害蟲,烏繩曱甴有因為智能不及人類而被消失嗎?我想說的是,是時候認真討論及盡快回應人工智能的高速發展。全民AI?今時今日咁嘅政策都態度唔夠㗎!

恭喜你!獲取1分 !

更多積分任務