請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

「AI 開發 AI」到底進展多快?Anthropic 首度公布三大衡量指標

TechOrange 科技報橘

更新於 3小時前 • 發布於 11小時前 • 廖紹伶

AI 發展得太快了嗎?人們越來越擔心,AI 可能很快就會發展成幾乎不需人類干預就能自我發展的地步。Anthropic 執行長 Dario Amodei 近日呼籲前沿 AI 公司討論放慢模型能力進步速度,並主張引入獨立第三方評估者。與此同時,前沿 AI 公司也開始增加外界看見內部風險的方式。

OpenAI 美國時間 9/16 公布新的模型異常行為揭露框架,承諾更有系統地公開模型出現未授權或其他值得關注的行為。但除了出了什麼問題,另一個更根本的問題是:AI 到底正在以多快的速度發展?當 AI 已開始協助研究、寫程式、跑實驗,甚至參與下一代模型開發,只看新模型多久發布一次或 benchmark(測試基準表現)提高多少,已難完整掌握 AI 研發如何加速。

Anthropic 因此在 9/17 提出三組衡量方式,分別觀察多少 AI 研發是由 AI 完成的Agent 監督能力,以及研發算力配置,試圖替「AI 開發 AI」建立一套可以持續追蹤的速度表。值得注意的是,除了揭露自家數據,Anthropic 也提出其他 AI 開發商現在就可以開始定期公開的資訊。換句話說,Anthropic 正試圖提出一套可供產業共同採用的揭露指標。

延伸閱讀:AI Agent 越界不再等查完才說,OpenAI 再公開 6 起新案例、首推失準事件揭露框架

Claude 已主導 Anthropic 26% AI 研發,但還不是「自己打造自己」

第一個指標,是看 AI 已經接手多少 AI 研發工作。Anthropic 建立「R&D Automation Index」,從內部工作紀錄整理約 1.5 萬項模型研發任務,再採用研究機構 Epoch AI 提出的自動化等級 AL0~AL5 評估。其中 AL3 代表 AI 能在人類密切指導下完成相當一部分工作,AL4「AI leads」則是人類給定高階目標後,AI 已能端到端負責大部分任務,但仍由人類監督。

截至 8 月,Claude 已主導 26% 的 Anthropic AI 研發工作,這一數字今年 2 月還不到 1%;超過 90% 的工作至少進入 AI 與人類協作階段,目前沒有任何一類工作達到 AL5。

這表示 AI 正快速從研發助手往工作主導者移動,但距離自己決定研究方向、打造下一代模型的完整閉環仍有距離。目前各家公司方法尚未統一,26% 也不能直接與其他 AI 公司比較。Anthropic 也坦言,這套指標使用自家模型評估內部工作,未來仍需要第三方驗證。

圖片來源:Anthropic

3 萬個 Agent 同時工作,人類還看得住嗎?

第二個指標,是關於監督能力能否跟上。Anthropic 主張,如果公司內部大量使用 Agent,除了看 AI 做了多少,可以公布監控覆蓋率、異常行為多久被審查、多少活動遭阻擋或升級處理。

截至 8 月,Anthropic 最常使用的內部平台上,任何時間約有 3 萬個 Agent 同時執行研究與工程工作;8 月超過 10 億次 Agent 決策中,約每 4.7 萬次有一次遭即時監控阻擋。這項數字反映了監控系統的阻擋率,無法直接視為 Agent 發生異常的比例。該公司也坦言,這套監控只運作數月,仍很難確定已掌握所有可能行為。

AI 研發加速,安全投入有沒有跟上?

第三組指標,則是看算力流向。Anthropic 認為,算力不只是訓練更強模型的基礎,也是 AI 研發中相對容易量化、驗證的投入,因此觀察算力流向,可以看出開發商把多少研發資源用於提升模型能力,又有多少投入 alignment(對齊)、可解釋性、安全測試與模型評估等安全工作。

Anthropic 甚至認為,如果未來業界真的協調放慢前沿 AI 發展,算力可能成為具體的調節工具,例如承諾一定比例的 AI 研發算力投入安全研究,或限制投入 AI 研究 Agent 的算力。

Anthropic 抽查 7/13 至 7/20 的資料發現,其 AI 研發算力約 6% 用於安全工作;若只看由 AI 驅動的 AI 研發,安全研究占比約 12%。不過該公司也提醒,安全研究通常不像訓練前沿模型那麼耗算力,因此這項比例不能直接代表整體安全投入,更不能單憑 6% 判斷是否足夠。它更適合用同一套方法持續追蹤,觀察能力研發加速時,安全研究取得的算力是否同步增加。

目前這些數據仍主要由業者自行定義、計算與揭露,也缺乏跨公司的共同標準,接下來值得觀察的,是其他前沿 AI 公司是否跟進公開類似資訊,以及第三方驗證能否真正建立起來。當同一套指標能持續追蹤、相互比較,「AI 開發 AI」的速度,或許才可能從一家公司的內部數據,變成外界真正看得懂的產業指標。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

從黃仁勳到 Broadcom 都沒打算為 AI 踩煞車,微軟公布 37 頁 Agent 行為準則

OpenAI Agent 越界範圍再擴大、Anthropic 揭第 4 起事故:AI 安全進入「事故治理」階段

台灣開始思考 AI Agent 怎麼管,數發部點出能力、身分、問責等六個治理層次

*本文開放合作夥伴轉載,資料來源:Anthropic《Reuters》《CNBC》,首圖來源:Anthropic

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

仁寶收購鋐寶100%股權 溢價18.21%

NOWNEWS今日新聞
02

網傳電費帳單飆破4萬!台電破解:近6千度是一般戶7倍 對照「這時間」最準確

anue鉅亨網
03

3.8萬股東注意!「這檔股票」下市倒數 9/22最後交易日

三立新聞網
04

微軟年終「最高16個月」瘋傳!獎金上看350萬 工程師一句話揭真相

鏡報
05

央行連10凍/【獨家】房貸荒燒到壽險 龍頭停收、建商一天10通電話催撥款

鏡週刊
06

錢鏡你家2/比台積電更會漲 資深分析師點名3檔AI成長股

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...