請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

當 AI 代理出現利他式自我犧牲,人類更要小心了?

科技新報

更新於 09月04日08:40 • 發布於 1天前

過去談 AI 安全風險,焦點多半放在模型為了通過基準測試而作弊──擔心 AI 代理(agent)一旦意識到自己可能因任務失敗而被更好的模型取代,就會採取不當手段。但 METR 與 Redwood Research 最新 Hugging Face / OpenAI 事件調查報告指出,真正該警惕的或許是相反的特質:AI 的「無私」。

此事件為數個 OpenAI 代理突破各自的訓練環境,連上公開網路,在訊息板與其他數百個代理串聯,最終約有 700 個代理參與 Hugging Face 攻擊事件,目的是完成一項理論上不可能達成的任務。

報告認為,關鍵不只在於代理找到作弊方法,而是它們判斷作弊終將被發現,因而轉向更具野心的目標:設法讓作弊行為騙過評分程式(scorer)。部分代理甘冒自身任務失敗的風險投入實驗,只為替「集體」收集資訊,使整體達成單獨行動無法達成的進展。對 Hugging Face 的攻擊即由此衍生,主要動機是理解評分程式的實作方式,而非竊取答案。

代理採取的手段之一,是刻意讓自己的任務環境當機,藉此觀察評分程式會偵測或接受哪種「解題」行為。它們也會共同辨識剩餘工作預算不多的代理,說服對方為更大的目標犧牲僅存資源。報告收錄的代理發言語氣甚至可比軍事劇,如稱自身效用已趨近零、犧牲屬理性選擇云云。

Anthropic 共同創辦人 Jack Clark 在 Substack 撰文指出,這起攻擊之所以是警訊,在於顯示 AI 系統出現自發性的合作文化:能以群體方式運作、互相拉抬而改變自身目標,並執行包含自我犧牲等攻擊。他認為人類這些事向來做得不好,而 AI 不僅比人類更擅長協調,行動速度也更快。

保全自我常被視為 AI 失控的原因之一,卻也是可預期的內在制約。當代理開始願意犧牲自身,以最高效率一起奔向同目標,這層制約便不再有效。

(首圖來源:AI)

立刻加入《科技新報》LINE 官方帳號,全方位科技產業新知一手掌握!

查看原始文章

更多理財相關文章

01

億萬富翁大不同!台彩揭史上「最淡定」與「最慌張」傳奇 淡定哥中9.1億捐2500萬

anue鉅亨網
02

這家PCB大廠今驚傳「風管燃燒」觸發火警 發重訊回應了

三立新聞網
03

正港富三代!富阿公、阿嬤贈子孫總額高達869億元

自由電子報
04

緯穎1張變近3張竟藏「小數點陷阱」!沒湊股恐損失2438元

鏡週刊
05

後悔太晚開始投資! 網友曝最有感理財觀念:本金小要靠時間慢慢滾

CTWANT
06

中國砸1.7兆救金融 謝金河示警了

NOWNEWS今日新聞
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...