請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

Google 研究:AI 有幻覺是因為「想不起來」!增加規模無助提取問題,靠思考才能找回答案

TechOrange 科技報橘

更新於 2026年9月29日18:00 • 發布於 7小時前 • Min

當大型語言模型產生「幻覺」,開發人員通常會假設,該 AI 模型本身缺乏必要的「知識事實」,也就是 AI 所理解的資料與參數不足,因此改進措施就是增加模型規模、擴充訓練數據,或是建立起複雜的檢索架構。

然而,來自 Google Research 與以色列理工學院(Technion)研究人員,近期共同發表的一項研究結果表明,產生幻覺的 AI 模型本身不一定是由於缺乏知識,而是在生成答案的過程中,AI 模型無法將過去所內化的資訊,重新「回憶」並「提取」出來。

實驗顯示,即便是像 OpenAI GPT-5 或 Gemini 3 這類尖端模型,雖然能夠「編碼(encode)」或吸收高達 95% 到 98% 的事實知識,但回應出正確答案的主要瓶頸,卻在於 AI 模型的檢索能力不足,而非其本身具備的知識量。

AI 模型「知道」不代表「能回答」

在深入研究結果前,不妨先理解 Google Research 與以色列理工學院,究竟是如何進行測試。

研究人員認為,與其單純評分大型語言模型,對於單一提示詞的回答是否正確,透過「事實層級的剖析」——即針對單一基礎資訊在多種條件下進行測試,以評估某件事實是否確實儲存於 AI 模型參數中,其能否透過不同角度與表述方式進行查詢,以及測量檢索該事實所需的運算成本為何,反而才是更有意義的地方。

測試框架中,研究人員將 AI 模型對某件知識的理解,區分成「已編碼」與「已認知」;若模型在被提供原始訓練情境作為提示詞時,能夠準確重現某件知識,則認定該模型已經將知識進行「編碼」;而若模型可以針對某件知識,在各種不同的表述方式與提問方向下,皆能可靠回答相關問題,則會認定模型將該知識視為「認知」的事實。

AI 處理資訊的 5 種模式

舉例來說,當今天人類教導 AI 模型一項新知識,如「綠洲合唱團的首場公開演出,地點在 Boardwalk 俱樂部」,那麼當 AI 模型處理此類資訊時,該知識就會歸類成 5 種截然不同的類型,包括:

  • 直接性提取:即 AI 模型成功將知識進行編碼,並可以直接調用知識回答使用者提問,不需要額外的推論運算。
  • 編碼失敗(空資料):即 AI 模型既未編碼該知識,也不了解該知識,無法回答關於該事件的任何問題,這表明人類需要向 AI 模型投入更多訓練資料,或者進一步提升模型容量。
  • 提取失敗(遺失關鍵資訊):即 AI 模型雖然已經編碼了知識,但卻無法存取該資訊。在這種情況下,AI 模型可以借助提示詞,流暢補全訓練資料原始文本,但即使給予思考時間,仍無法回答出「綠洲合唱團首場公開演出地點在哪裡?」等類似問題。
  • 推論期提取:即知識被 AI 成功編碼,但模型無法透過直接生成方式取得,唯有應用推論運算,比方思維鏈(CoT)技術,一步步建構思考過程推導出答案後,才能成功給出解答。
  • 未經編碼的推論猜測:即 AI 模型從未明確編碼過任何相關知識,但可以根據推論,或者其他已經理解的知識進行推理,接著成功回答問題;比方說 AI 已知綠洲合唱團成立於曼徹斯特,而曼徹斯特有家著名的音樂俱樂部 Boardwalk,所以推測出綠洲合唱團的首場公開演出在 Boardwalk。

當 AI 想不起來,只能靠思考突破

在理解 AI 模型是如何處理並反映知識之後,研究人員開始對 13 款大型語言模型進行評估。研究人員對 AI 模型投入具備 2150 項事實知識的 WikiProfile 基準數據集,並且針對每項知識,以從精確語境補全,直到多選題驗證等各種格式進行測試。

對於 GPT-5 和 Gemini 3 等前沿模型來說,研究人員發現,它們的編碼能力早就接近飽和,即模型本身就具備足夠知識,編碼成功率亦達 95% 至 98%;然而,若不開啟思考功能,那麼這些尖端 AI 模型將無法直接提取其中 26% 到 34% 的已編碼知識。

由此可見,推論階段的思考過程扮演著十分重要的角色,透過為 AI 模型提供額外運算資源,研究人員成功找回了 AI 模型最初無法直接提取的 40% 到 65% 的已編碼知識。

面對這種現象,研究人員將其比喻為「話到嘴邊了卻想不起來」狀態,而該狀態下,人類可以透過有意識的努力,例如在腦海中重現情境,最終回憶起相關資訊,對於 AI 模型來說,這個過程就會被轉化為思考。

知識越多越混亂,放大規模幫助有限

不僅如此,研究人員還發現提升模型規模,並不能直接彌補「AI 模型需要思考才能正確回答問題」的差距,因此過去許多企業往往試圖透過微調更大的內部模型,來解決 AI 無法提取特定知識的問題,這在本質上是一種代價高昂的架構失誤。

舉例而言,研究人員將 Gemma 3 模型的參數規模從 10 億擴增至 270 億,雖然編碼失敗率確實從 85% 降至 23%,很大程度上填補了「知識的空缺」,但與此同時回答失敗的比例也隨之上升,即若不允許 AI 模型主動思考,回答出錯率甚至會飆升到 40%。

換句話說,擴大 AI 模型規模僅解決了知識不足的問題,無法解決 AI 難以提取知識的問題;隨著 AI 模型記憶的知識數量大幅增加,越來越多的知識被困在「已編碼但無法存取」的狀態中,同時模型發生幻覺的主因,亦從「資料遺漏」變成了「提取失敗」。

研究人員同時強調,AI 模型的提取能力,跟學習知識時的條件密切相關,只要使用者的提問模式,偏離了訓練當下的模式,那麼 AI 的提取能力就會下降,例如 AI 模型在處理反向問題時,往往就難以給出答案。

當前的 AI 可以輕鬆回答「綠洲合唱團在 Boardwalk 俱樂部舉行了首場公開演出」,但卻無法回答「誰的首場公開演出在 Boardwalk 俱樂部舉辦」;另外,當以選擇題形式提出相同問題時,AI 模型的回答正確率亦會上升。

RAG 不是萬能解,推理要選擇性運用

歸納 Google Research 與以色列理工學院的研究結果,當今的 AI 開發者與企業組織,其實得到了 5 大面向的重要提醒。

首先,企業與開發者不該將每一次的 AI 幻覺都視為檢索問題,尤其企業面對模型產生虛構內容時,預設的反應往往是部署「檢索增強生成(RAG)」技術、擴展向量資料庫,或是導入更多知識文件。

雖然對於全新資料或內部資料而言,直接採用 RAG 是正確的選擇,但若將其作為解決虛構內容問題的萬能解方,就會讓 AI 模型本身就擁有、可以回答的知識事實,徒增無謂的延遲及 API 呼叫成本。

其次,AI 開發者跟使用者應該「選擇性」使用推論功能。雖然透過思維鏈等技術,可以讓 AI 成功找回無法直接回憶起來的已編碼事實,但是在大多數情境下,真正需要動用 AI 思考的問題,大概只佔了 10% 到 20%,所以若全面啟用思考功能將會浪費運算資源,真正挑戰其實在於如何部署動態路由查詢。

再者,AI 開發者應部署「先生成、後驗證」工作流程,因為模型在判斷知識的正確性方面,其實會比從零開始生成解答更為擅長。換句話說,開發人員可以建立起一種架構迴圈,先讓 AI 模型生成回應,接著透過提示詞,使 AI 明確反思並驗證自身答案。

接著,當今的 AI 開發者要懂得測試模型的語義存取能力,嘗試以不同的表述方式、語境及方向進行探測,區分出模型「知道什麼」與「能夠回答什麼」之間的差異。

最後,開發者要善用查詢重構與重試機制,因為查詢框架決定了 AI 模型的回應成功率,同時更高度依賴上下文。

無論是改變提示詞結構、生成相關的中間上下文,或是引導 AI 模型在回答前先生成推理鏈,本質上都是有效的可靠機制,允許 AI 挖掘提示詞中遺漏的資訊,給予更精確、正確的事實解答。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ Gemini 3.8 Flash 軟體工程測試勝 Fable 5?Google 新模型上線:定價不變但 token 用量增
◆ 能自主跑 38 小時、成本最多省 45%:Anthropic 推出 Fable 5.1,預告 EFS 架構秋季上線
◆ 【情境工程人才缺口】不只是寫提示詞,企業需要能設計 AI 運作環境的人

*本文開放合作夥伴轉載,參考資料:VentureBeat、arXiv,首圖來源:Nano Banana 2

(責任編輯:鄒家彥)

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

史上最大!輝達庫藏股加碼1500億美元,黃仁勳在盤算什麼,台廠有甜頭嗎?

數位時代
02

金牌名廚合作夥伴爆欠債 食品公司老闆「七期豪宅遭法拍」

ETtoday新聞雲
03

輝達新房東誕生!凱壽206億入主潤泰南港玉成廣場 創昆陽商圈新天價

工商時報
04

昔奪釜山美食5金牌!食品名店爆欠鉅債 台中七期豪宅淪法拍

三立新聞網
05

AI熱潮誰真正賺到錢?輝達宣布2350億美元股票回購

anue鉅亨網
06

台股收盤》聯發科、台達電等992家跳水 指數收跌392點

自由電子報
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...