請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI模型職場任務實測失靈 頂尖技術通過率僅24%

商傳媒

更新於 17小時前 • 發布於 9小時前 • service@sunmedia.tw (商傳媒 SUN MEDIA)
圖/本報資料庫

商傳媒|林昭衡/綜合外電報導

最新研究指出,儘管人工智慧(AI)技術發展迅速,但前沿 AI 模型在實際職場任務中的表現仍遠不及預期。一項由柏克萊加州大學發布的報告揭露,即使是頂尖的 AI 工具,在涵蓋多種職業的測驗中,最高整體通過率也僅有 24%。

這項研究來自柏克萊加州大學的 Center for Responsible, Decentralized Intelligence,旨在評估前沿 AI 工具在各種職場任務上的「就業準備度」。研究人員設計了一套名為「代理人最終考試」(Agents’ Last Exam,簡稱 ALE)的評估工具,其中包含超過 1,500 項由專家制定的任務,涵蓋 55 種不同職業。這些任務不僅包括軟體工程與平面設計等常見的 AI 應用領域,也擴及海事工程、農業、音訊製作及公共衛生營運等。

研究測試了 Anthropic’s Fable 5、OpenAI 的 GPT-5.5、Cursor’s Composer 2.5 及谷歌的 Gemini 3.1 Pro 等先進閉源模型,以及兩款中國開發的開源模型。結果顯示所有模型表現皆不佳,其中 OpenAI 的 GPT-5.5 取得最高分,整體通過率為 24%。然而,在 ALE 最困難的任務層級上,包含 Fable 5 在內的所有前沿代理,成功率均為 0%。值得注意的是,Anthropic’s Fable 5 在任務完成度上與 GPT-5.5 及 Composer 2.5 表現相似,但每完成一項任務的成本卻高出 4 到 12 倍。

研究人員指出,儘管目前的 AI 代理已能解決相當部分的專業任務,但對於需要持續推理、深厚領域專業知識以及長期可靠執行的困難任務,其表現仍與人類水準相去甚遠。柏克萊電腦科學研究員宋曉冬(Dawn Song)表示,即使目前的通過率相對較低,那些由例行性、明確定義程序主導的職業,仍可能率先受到 AI 的衝擊,而需要大量決策的角色則能維持較長時間的韌性。她強調:「關鍵因素不在於產業本身,而在於工作的性質。」

這項研究表明,儘管 AI 產業迄今已投入 1.6 兆美元,但要讓前沿 AI 模型在複雜的現實職場任務中達到人類水準的表現,仍有漫長的路要走。對於台灣企業而言,這項研究結果提供了重要啟示:導入 AI 應著重於自動化例行性工作,而對於需要高度判斷與專業的任務,仍需輔以人類智慧,避免過度期待。

查看原始文章

更多理財相關文章

01

Pi拍錢包350萬用戶個資外洩 每戶補償500優惠券被罵翻

民視新聞網
02

影音|台廠赴美是被迫?黃仁勳:沒必要用槍指著台灣的頭,這是自願選擇

數位時代
03

Google新制將上路!未改手機1設定 雲端空間恐被吃

三立新聞網
04

台股震盪崩盤也不怕!黃大米點名散戶「入手這2檔」

民視新聞網
05

群聯脫困新布局1/97名投資人求償群聯7億大翻盤 高院開庭竟只剩5人原因曝光

鏡週刊
06

金融股人氣大洗牌!退休只存金融股夠嗎? 達人曝「報酬差距」關鍵:不能只看股息

Newtalk
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...