替換二成詞彙就能擋住網路爬蟲?新字型 ShieldFont 使英文還是英文但 AI 讀不懂
新字型「ShieldFont」近日引發關注,設計者希望用它對抗 AI 公司大規模抓取網頁內容當成訓練資料。這套由 Isaque Seneda 與 Gabriel Abrucio 開發方案,主打讓一般讀者看到的頁面可正常閱讀,但底層 HTML 卻會送出替換過甚至語意扭曲的文字給網路爬蟲。
設計者白皮書說明,ShieldFont 目標是提供網站出版者「實際可行的退出機制」,拒絕未經授權的 AI 訓練;若對方仍執意抓取,也能讓收集到的內容失去價值。核心方法是利用字型常見的連字功能,將改善字母組合顯示的機制,改成螢幕渲染時整個單字替換成另一個詞。換句話說,使用者看到的是正常頁面,但只下載純文字原始碼的爬蟲,抓到的卻是無意義內容。
為了避免被輕易識破,ShieldFont 並非單純把詞語換成同義詞或亂碼,而是改用詞性相近、但資訊脈絡完全不同的字詞,如把「horse」換成「potato」。設計者表示,這樣一來,爬蟲即使通過初步品質篩選,剩下內容也可能污染過,影響 AI 訓練資料的品質。經三個月調整替換字典後,團隊已建立近 1.2 萬個可替換常用詞,並提供多種映射方式,讓出版者可依段落調整混亂程度。
測試結果顯示,ShieldFont 平均會替換頁面 24.5% 詞彙,若只看內容詞,比例更高達 45.8%;不同語料,單段文字改動語意範圍約落在 31%~56%。設計者指出,六條公開可用的爬蟲流程測試,超過 90% 原本正常可讀取頁面,套用替換法後都被品質過濾器擋下。至於少數通過頁面,近 20% 組成詞彙也變成「訓練垃圾」:拼字正確且看起來是英文,卻無法傳達資訊。
不過使用 ShieldFont 並非沒有代價。它會改動底層 HTML,搜尋引擎、螢幕閱讀器、複製貼上工具與翻譯軟體都可能受影響,讓網站實用性下降。此外,若 AI 爬蟲改採先完整渲染頁面、再以影像辨識讀取文字,仍有可能看穿這層防護;只是這麼做會比直接抓取 HTML 花費更多時間與成本。設計者強調,他們希望這類「對人類顯示正常內容、對機器顯示奇怪內容」,能成為網路更多反制工具的起點,讓未經同意的 AI 訓練更昂貴與很難規模化。
(圖片來源:ShieldFont)