Google 研究:AI 有幻覺是因為「想不起來」!增加規模無助提取問題,靠思考才能找回答案
當大型語言模型產生「幻覺」,開發人員通常會假設,該 AI 模型本身缺乏必要的「知識事實」,也就是 AI 所理解的資料與參數不足,因此改進措施就是增加模型規模、擴充訓練數據,或是建立起複雜的檢索架構。
然而,來自 Google Research 與以色列理工學院(Technion)研究人員,近期共同發表的一項研究結果表明,產生幻覺的 AI 模型本身不一定是由於缺乏知識,而是在生成答案的過程中,AI 模型無法將過去所內化的資訊,重新「回憶」並「提取」出來。
實驗顯示,即便是像 OpenAI GPT-5 或 Gemini 3 這類尖端模型,雖然能夠「編碼(encode)」或吸收高達 95% 到 98% 的事實知識,但回應出正確答案的主要瓶頸,卻在於 AI 模型的檢索能力不足,而非其本身具備的知識量。
AI 模型「知道」不代表「能回答」
在深入研究結果前,不妨先理解 Google Research 與以色列理工學院,究竟是如何進行測試。
研究人員認為,與其單純評分大型語言模型,對於單一提示詞的回答是否正確,透過「事實層級的剖析」——即針對單一基礎資訊在多種條件下進行測試,以評估某件事實是否確實儲存於 AI 模型參數中,其能否透過不同角度與表述方式進行查詢,以及測量檢索該事實所需的運算成本為何,反而才是更有意義的地方。
測試框架中,研究人員將 AI 模型對某件知識的理解,區分成「已編碼」與「已認知」;若模型在被提供原始訓練情境作為提示詞時,能夠準確重現某件知識,則認定該模型已經將知識進行「編碼」;而若模型可以針對某件知識,在各種不同的表述方式與提問方向下,皆能可靠回答相關問題,則會認定模型將該知識視為「認知」的事實。
AI 處理資訊的 5 種模式
舉例來說,當今天人類教導 AI 模型一項新知識,如「綠洲合唱團的首場公開演出,地點在 Boardwalk 俱樂部」,那麼當 AI 模型處理此類資訊時,該知識就會歸類成 5 種截然不同的類型,包括:
- 直接性提取:即 AI 模型成功將知識進行編碼,並可以直接調用知識回答使用者提問,不需要額外的推論運算。
- 編碼失敗(空資料):即 AI 模型既未編碼該知識,也不了解該知識,無法回答關於該事件的任何問題,這表明人類需要向 AI 模型投入更多訓練資料,或者進一步提升模型容量。
- 提取失敗(遺失關鍵資訊):即 AI 模型雖然已經編碼了知識,但卻無法存取該資訊。在這種情況下,AI 模型可以借助提示詞,流暢補全訓練資料原始文本,但即使給予思考時間,仍無法回答出「綠洲合唱團首場公開演出地點在哪裡?」等類似問題。
- 推論期提取:即知識被 AI 成功編碼,但模型無法透過直接生成方式取得,唯有應用推論運算,比方思維鏈(CoT)技術,一步步建構思考過程推導出答案後,才能成功給出解答。
- 未經編碼的推論猜測:即 AI 模型從未明確編碼過任何相關知識,但可以根據推論,或者其他已經理解的知識進行推理,接著成功回答問題;比方說 AI 已知綠洲合唱團成立於曼徹斯特,而曼徹斯特有家著名的音樂俱樂部 Boardwalk,所以推測出綠洲合唱團的首場公開演出在 Boardwalk。
當 AI 想不起來,只能靠思考突破
在理解 AI 模型是如何處理並反映知識之後,研究人員開始對 13 款大型語言模型進行評估。研究人員對 AI 模型投入具備 2150 項事實知識的 WikiProfile 基準數據集,並且針對每項知識,以從精確語境補全,直到多選題驗證等各種格式進行測試。
對於 GPT-5 和 Gemini 3 等前沿模型來說,研究人員發現,它們的編碼能力早就接近飽和,即模型本身就具備足夠知識,編碼成功率亦達 95% 至 98%;然而,若不開啟思考功能,那麼這些尖端 AI 模型將無法直接提取其中 26% 到 34% 的已編碼知識。
由此可見,推論階段的思考過程扮演著十分重要的角色,透過為 AI 模型提供額外運算資源,研究人員成功找回了 AI 模型最初無法直接提取的 40% 到 65% 的已編碼知識。
面對這種現象,研究人員將其比喻為「話到嘴邊了卻想不起來」狀態,而該狀態下,人類可以透過有意識的努力,例如在腦海中重現情境,最終回憶起相關資訊,對於 AI 模型來說,這個過程就會被轉化為思考。
知識越多越混亂,放大規模幫助有限
不僅如此,研究人員還發現提升模型規模,並不能直接彌補「AI 模型需要思考才能正確回答問題」的差距,因此過去許多企業往往試圖透過微調更大的內部模型,來解決 AI 無法提取特定知識的問題,這在本質上是一種代價高昂的架構失誤。
舉例而言,研究人員將 Gemma 3 模型的參數規模從 10 億擴增至 270 億,雖然編碼失敗率確實從 85% 降至 23%,很大程度上填補了「知識的空缺」,但與此同時回答失敗的比例也隨之上升,即若不允許 AI 模型主動思考,回答出錯率甚至會飆升到 40%。
換句話說,擴大 AI 模型規模僅解決了知識不足的問題,無法解決 AI 難以提取知識的問題;隨著 AI 模型記憶的知識數量大幅增加,越來越多的知識被困在「已編碼但無法存取」的狀態中,同時模型發生幻覺的主因,亦從「資料遺漏」變成了「提取失敗」。
研究人員同時強調,AI 模型的提取能力,跟學習知識時的條件密切相關,只要使用者的提問模式,偏離了訓練當下的模式,那麼 AI 的提取能力就會下降,例如 AI 模型在處理反向問題時,往往就難以給出答案。
當前的 AI 可以輕鬆回答「綠洲合唱團在 Boardwalk 俱樂部舉行了首場公開演出」,但卻無法回答「誰的首場公開演出在 Boardwalk 俱樂部舉辦」;另外,當以選擇題形式提出相同問題時,AI 模型的回答正確率亦會上升。
RAG 不是萬能解,推理要選擇性運用
歸納 Google Research 與以色列理工學院的研究結果,當今的 AI 開發者與企業組織,其實得到了 5 大面向的重要提醒。
首先,企業與開發者不該將每一次的 AI 幻覺都視為檢索問題,尤其企業面對模型產生虛構內容時,預設的反應往往是部署「檢索增強生成(RAG)」技術、擴展向量資料庫,或是導入更多知識文件。
雖然對於全新資料或內部資料而言,直接採用 RAG 是正確的選擇,但若將其作為解決虛構內容問題的萬能解方,就會讓 AI 模型本身就擁有、可以回答的知識事實,徒增無謂的延遲及 API 呼叫成本。
其次,AI 開發者跟使用者應該「選擇性」使用推論功能。雖然透過思維鏈等技術,可以讓 AI 成功找回無法直接回憶起來的已編碼事實,但是在大多數情境下,真正需要動用 AI 思考的問題,大概只佔了 10% 到 20%,所以若全面啟用思考功能將會浪費運算資源,真正挑戰其實在於如何部署動態路由查詢。
再者,AI 開發者應部署「先生成、後驗證」工作流程,因為模型在判斷知識的正確性方面,其實會比從零開始生成解答更為擅長。換句話說,開發人員可以建立起一種架構迴圈,先讓 AI 模型生成回應,接著透過提示詞,使 AI 明確反思並驗證自身答案。
接著,當今的 AI 開發者要懂得測試模型的語義存取能力,嘗試以不同的表述方式、語境及方向進行探測,區分出模型「知道什麼」與「能夠回答什麼」之間的差異。
最後,開發者要善用查詢重構與重試機制,因為查詢框架決定了 AI 模型的回應成功率,同時更高度依賴上下文。
無論是改變提示詞結構、生成相關的中間上下文,或是引導 AI 模型在回答前先生成推理鏈,本質上都是有效的可靠機制,允許 AI 挖掘提示詞中遺漏的資訊,給予更精確、正確的事實解答。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ Gemini 3.8 Flash 軟體工程測試勝 Fable 5?Google 新模型上線:定價不變但 token 用量增
◆ 能自主跑 38 小時、成本最多省 45%:Anthropic 推出 Fable 5.1,預告 EFS 架構秋季上線
◆ 【情境工程人才缺口】不只是寫提示詞,企業需要能設計 AI 運作環境的人
*本文開放合作夥伴轉載,參考資料:VentureBeat、arXiv,首圖來源:Nano Banana 2
(責任編輯:鄒家彥)