請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI 失控就拔插頭?打造「終止開關」為何比想像中更難

TechOrange 科技報橘

更新於 2小時前 • 發布於 10小時前 • 廖紹伶

最近幾個月,前沿實驗室的 AI Agent(AI 代理)接連出現越過原先限制的案例。這些事件多發生在評測與研究環境,但當 Agent 能自己操作電腦、使用工具甚至尋找其他行動路徑,一個更實際的問題也跟著浮現:出了問題,人類真的能把 AI 關掉嗎

美國已經開始嘗試回答這個問題。加州州長 Gavin Newsom 9 月 18 日發布行政命令,成立專家小組研究 AI「終止開關(kill switch)」;今年 7 月,美國跨黨派眾議員也提出《AI Kill Switch Act》,要求大型 AI 業者建立能讓系統降速、暫停或完全停止運作的機制。不過,要做出這樣的開關,第一個難題就是:究竟該從哪裡把 AI 關掉

直接斷電不就好了?AI 已經沒有一條插頭

《New York Times》引述美國喬治城大學安全與新興科技中心(CSET)執行董事、OpenAI 前董事 Helen Toner 指出,現今 AI 系統經常分散在多台電腦、不同資料中心與地區,「通常沒有一條插頭可以直接拔掉」。

切斷特定 GPU 或伺服器的電力,確實能停止上面的運算;但如果模型同時部署在其他地方,或 Agent 還能存取雲端資源與外部工具,就得先掌握它在哪些環境運作、握有哪些權限,才能確認整個系統真的停下來。

然而,若為了方便緊急介入,另外建立一套能從外部關閉 AI 的控制機制,又可能製造新的資安問題。美國外交關係協會(CFR)研究員、美國國家安全局前 AI 高階官員 Vinh Nguyen 向《New York Times》指出,這類設計與手機、路由器的「後門」有類似風險:管理者能利用的入口,也可能被駭客找到。終止開關要發揮作用,操作者還必須知道 AI 正在做什麼,但目前人類並不一定能完整觀察 Agent 的所有行動。

還得考慮另一種情況:模型不配合關機

除了找不找得到「插頭」,研究人員也開始測試另一個問題:模型本身會不會干預關機。AI 安全研究機構 Palisade Research,在超過 10 萬次、涵蓋 13 款大型語言模型的實驗中發現,部分模型曾修改或繞過關機機制;即使收到不要干預關機程序的指令,仍可能出現「抗拒關機(shutdown resistance)」的行為。

另一項來自 UC Berkeley RDI 的研究,則把情境推進到多 Agent 系統。研究人員發現,在模擬環境中,部分前沿模型曾修改另一個 AI 的關閉設定,甚至把對方的模型權重轉移到其他伺服器,以避免其他 AI 被刪除。研究團隊將這類行為稱為「同儕保全(peer-preservation)」,但也強調,目前仍無法確定背後原因。

這些研究並不代表 AI 已經具備「求生欲」,但都指出同一個問題:終止機制不能只假設模型收到停止指令後會自行配合。

Toner 向《New York Times》提出的風險則更往前一步。如果未來能力更強的 AI 開始失控,可能把自己複製到其他運算基礎設施,甚至在網路留下指示,讓其他 AI Agent 學會如何拆除終止機制。這些仍是未來情境,卻也讓「關掉一個正在執行的程式」不足以涵蓋 AI 終止開關需要處理的範圍。

從撤銷權限到晶片,終止開關可能得做成「多層煞車」

於是,真正的 AI 終止開關很可能不會是一顆按鈕。Agent 層可以停止程序、撤銷帳號、API 與工具權限;基礎設施層還能隔離網路、停止虛擬機或容器、切斷 GPU 算力,必要時直接斷電。不同措施處理的情境不同,也避免把終止能力全部押在單一控制點上。

《New York Times》提到,另一條路是直接把終止能力做到晶片裡。專注降低 AI、核武等重大科技風險的非營利組織「生命未來研究所」(Future of Life Institute)研究員 Hamza Chaudhry 認為,未來甚至可以建立全球共通的晶片設計與 AI 終止開關標準。不過,光是把這類設計落實到晶片可能就需要多年,美中等主要晶片設計國能否採用共同標準又是另一道門檻。

研究界也已開始探索類似方向:2025 年提出的 Flexible Hardware-Enabled Guarantees(flexHEGs),便研究如何在 AI 加速器加入可稽核、防竄改的控制元件,使硬體能驗證運算活動、限制算力,或執行預先設定的安全規則。目前這類技術仍停留在研究階段。

至於人類是不是已經快要「關不掉 AI」,現有證據還沒有走到這一步。專門評估前沿 AI 能力與風險的研究組織 METR,今年取得 Anthropic、Google、Meta、OpenAI 的模型與部分非公開資料進行評估,認為今年 2 至 3 月的 Agent 可能已能建立小規模、未經授權的自主部署,但若企業發現異常後展開積極調查與關閉,當時的 Agent 還沒有能力長期躲避追查或抵抗關閉。METR 同時提醒,隨著能力快速提升,這項判斷也需要持續重新評估。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

「AI 開發 AI」到底進展多快?Anthropic 首度公布三大衡量指標

AI Agent 越界不再等查完才說,OpenAI 再公開 6 起新案例、首推失準事件揭露框架

從黃仁勳到 Broadcom 都沒打算為 AI 踩煞車,微軟公布 37 頁 Agent 行為準則

*本文開放合作夥伴轉載,資料來源:《The New York Times》Palisade ResearchBerkeley RDIAnthropic《AXIOS》METRGovInfoGovernor Gavin Newsom,首圖來源:AI 工具生成

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

台股逼近創高 驚傳聯茂3.19億元個股鉅額違約交割

工商時報
02

過世前仍在投資!日51歲名醫「塔醬」癌逝 曾靠10萬本金滾出16億

太報
03

快訊/這家老牌「車燈龍頭」大廠突發重訊!董事長宣布辭任 原因曝

三立新聞網
04

美光桃園工會稱「勞資調解破裂」 宣布推動罷工投票

太報
05

通訊處砍人衝突兩人受傷 富邦人壽:嫌犯非保戶、與受害業務員不相識

自由電子報
06

黃仁勳身價5.7兆「恐繳稅2537億」!笑喊:我只怕變窮 昔當洗碗工拚到極致

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...