請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

AI Agent 操作電腦準確率衝上 85%,為何企業真正難題仍是如何「可靠地把工作做完」?

TechOrange 科技報橘

更新於 08月13日11:26 • 發布於 08月13日07:00 • 李昀蔚

在過去一年,電腦操作 AI Agent(Computer Use Agent)已經正式跨越單純展示的階段,開始在特定的、可重複的企業工作流程中進行正式部署。這些日常任務包括更新系統紀錄、跨入口網站搬移資料、處理工單,以及操作那些原本缺乏乾淨 API 的舊軟體介面。

轉變的背後,是因為模型操作電腦的能力正在快速飆升。根據 OSWorld-Verified,也就是一項在實體電腦桌面上測試 Agent 跨 Windows、macOS 和 Ubuntu 執行任務的標準檢測的數據顯示,最頂尖的 AI 模型在一年之內,其任務完成率從原本的 42% 上升至 85%,甚至超越人類測試者平均約 72% 的完成率。

然而,創投機構 a16z 提醒,即使在基準測試中達到 85% 的成績,仍代表每 100 個任務中有 15 個以失敗告終。對於要求高度準確、且每個步驟都必須完整銜接的企業流程來說,「會操作電腦」與「能可靠地完成工作」,仍是完全不同的兩回事。

每月 2,000 萬次操作,AI Agent 已開始規模化接手企業流程

儘管如此,部分企業已經開始體會到規模化自動化的威力。在 a16z 的訪談中,一家消費品(CPG)數據平台每月透過自動化系統完成約 1,500 萬至 2,000 萬次入口網站操作(portal interactions)。在這些流程中,這家企業將 AI Agent 作為傳統手寫網頁爬蟲的「自動故障修護備援」,每當零售商網站更動介面、導致原有爬蟲程式碼出錯時,Agent 就會自主診斷問題並搶修自動化流程,在工程師甚至還沒發現錯誤前,就讓重要數據恢復流動。導入此方案後,該公司將專門負責維護網頁爬蟲的工程團隊縮減一半,並成功將這些工程人力重新調配到其他工作流程上。

同時,另一家全球系統整合商也在生產環境中部署 27 個使用電腦操作 Agent 的正式工作流程,每天穩定處理約 1,500 至 2,100 張 IT 工單,最終目標是將低利潤託管服務合約中約 20% 到 25% 的人力重新配置,實現營運優化。

a16z 觀察,目前最適合部署這類 Agent 的場景,依然是那些高頻率、重複、業務規則穩定,且過去需要人工在舊系統上點擊或缺乏 API 的「窄型工作流程」,例如 CRM 資料更新、軟體測試與 QA、政府與保險入口網站操作、零售訂單與合約處理,以及 ServiceNow 上的 IT 工單處理等。

AI 新創 Prentis 押注電腦操作 Agent,任務成本僅前沿模型十分之一

電腦操作 Agent 的商業潛力,也開始吸引創業者與資本投入。由連續創業家 Ritankar Das、LinkedIn 共同創辦人 Reid Hoffman 與 Zynga 創辦人 Mark Pincus 共同成立的 AI 研究實驗室 Prentis,正訓練模型學習辦公室員工如何跨文件與企業系統完成日常工作,目標是打造能直接控制電腦、完成端到端流程自動化的 AI Agent。

Prentis 瞄準的白領工作場景包括保險理賠處理,以及自動處理關稅退款中的例外狀況,進而減少員工為了完成任務而在大量文件中搜尋資訊的時間。截至目前,Prentis 已與醫療管理服務機構、製造商,以及商品與服飾製造商等客戶簽下總價值近 5,000 萬美元的合約。

此外,Prentis 稱其自行研發的 Hive-32B 模型在 WindowsAgentArena 和 ScreenSpot-v2 兩大電腦操作基準測試中,表現皆超越 OpenAI 的 GPT-5.4 與 Anthropic 的 Claude Opus 4.6 等前沿大模型。Prentis 強調,其競爭優勢在於運行更小、更便宜的模型,每項任務成本約只有直接調用前沿模型 API 的十分之一,讓電腦操作 Agent 在大規模日常辦公室應用中更具經濟效益。

隱性錯誤、非同步斷點,AI Agent 為何一遇複雜流程就失靈?

在技術能力突飛猛進的同時,實際部署時的挑戰也隨之浮現。a16z 深度訪談多個企業團隊後發現,現行 AI 最擅長處理的,依然是那些步驟明確、有標準協議可循,且結果容易透過機器自動驗證的標準化任務;一旦工作流程變得複雜,或無法立即驗證結果是否正確,系統就更容易出現問題。

這類落地痛點主要可以歸納為兩大類。第一種是「難以自動勾稽的隱性錯誤」。舉例來說,當 Agent 奉命將合約中的付款條件提取並輸入 ERP 系統時,如果不小心將「付款期限 60 天(net 60)」誤讀為「30 天(net 30)」,這筆不正確的輸入不論在視覺上還是格式上都完全符合規範,也代表它可能順利通過常規的自動化防呆檢驗。最終,這個錯誤可能一路被放行,直到公司發出錯誤發票給客戶時,才會被發現。

第二種則是「與真實世界脫節的非同步斷點」。這種狀況通常發生在無法於操作當下立即確認成功訊號的任務中。例如,當 Agent 在保險網站上送出理賠申請後,網頁畫面跳出「已收到」的提示,對 AI 來說便代表任務已經結束。然而,保險承辦人員可能在兩天後才打電話到辦公室要求確認保單編號。這類線下突發狀況,人類只要花 30 秒接聽電話就能解決,Agent 卻無法感知這項線下事件,導致整筆申請流程可能因此中斷。

對此,a16z 點出一個關鍵的認知盲區:當一項業務的「最終事實(ground truth)」必須在幾天甚至一週後,透過線下渠道才會有結果時,單靠提升模型能力,並無法解決這類問題。企業如果想在生產環境中真正防範這些非同步例外,就必須從 Agent 周邊的系統架構、驗證與例外處理機制著手,從一開始就為這些邊緣狀況設計好應對方案。

AI Agent 採購關鍵轉向可靠性、資安與 ROI

這也帶動企業買家的採購思維出現明顯轉變。在 a16z 的訪談中,企業買家坦言,底層究竟使用哪一家模型,很少是採購電腦操作解決方案時的決定性因素,因為當前的模型能力其實已經足以應付部分工作。相較之下,企業更在乎系統能否在大規模運行下保持穩定、通過嚴格的資安審查,並證明投資報酬率(ROI)。

因此,企業真正需要評估的重點,逐漸轉向環繞模型外圍的基礎設施。這包括工作流程脈絡(context)、權限管理(permissions)、企業專屬知識、結果驗證、人工升級處理機制(escalation),以及異常與錯誤處理能力,而不是單純追逐電腦操作基準測試的排名。

a16z 更訪談到一位管理每月數百萬次自動化任務的企業營運者,他甚至不知道,也不在意系統底層目前使用的是哪個模型。對他而言,技術供應商會像雲端服務商更換伺服器硬體一樣,在後台替換模型;他真正關心的,只有「Agent 是否能穩定可靠地把工作完成」。

面對當前趨勢,a16z 指出,企業目前已經能從高頻率、重複、規則穩定且缺乏 API 的窄型工作流程中,透過部署電腦操作 Agent 獲得效率與成本收益。然而,在現階段,這些部署最好滿足幾個先決條件:具有能立即由機器觀察的成功訊號、失敗後果在可承受範圍內,並且具備清晰的人工接手機制。

隨著「點擊正確按鈕」與「在欄位輸入文字」等基本電腦操作逐漸成為模型的標準能力,電腦操作 Agent 的競爭焦點也正在改變:從一年前的「AI 能不能操作電腦」,轉向更實際的商業問題:AI 能不能可靠地把這份工作完成?

【推薦閱讀】
【工程師薪資新變數】AI 推論成本進入薪資結構,token 消耗開始成為工程師談判籌碼

4 成銷售被 AI 書拿走:一份 1.4 萬本小說研究,揭開市場「稀釋效應」

【阿布達比的 AI 原生政府】不只是政務 App,TAMM 把 AI 嵌入每一項日常行政服務

*本文開放合作夥伴轉載,資料來源:a16z《TechCrunch》,首圖來源:Unsplash

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

男離職移居鄉下「月花1.6萬」!3年後資產飆破千萬元

民視新聞網
02

主計總處揭低薪門檻:年薪39萬 2024年約126萬人低於標準

中央廣播電臺
03

00919配息1.1元創高!9/16除息、9/15最後買進日,想月領1萬要買幾張?

數位時代
04

他未成年卻能買5,600萬豪宅被盯上!國稅局抓包下場出爐

經濟日報
05

跟黃仁勳提離職會怎樣? 前員工揭「2小時震撼教育」

CTWANT
06

AI股大淘汰開始?營收創高只剩162家 法人:下一波只剩這種股票能漲

鏡週刊
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...