請更新您的瀏覽器

您使用的瀏覽器版本較舊,已不再受支援。建議您更新瀏覽器版本,以獲得最佳使用體驗。

【用字型也能反制 AI】讓 AI 爬蟲抓到假資料,設計師推 ShieldFont 保護創作者

TechOrange 科技報橘

更新於 2026年9月14日17:43 • 發布於 6小時前 • Min

全世界幾乎所有 AI 開發商,皆在龐大的公開網路中抓取數據以尋找有價值的訓練資料;當然,這樣的行為也引發多起訴訟,並促使有關企業(通常是內容出版商)不得不採取新技術,嘗試遏止 AI 爬蟲行為。

如今,一款為了對付 AI 爬蟲而來的全新「字型」,在兩位設計師的突發奇想下堂堂誕生,並且被命名為 ShieldFont。

ShieldFont 能夠向人類使用者呈現完全可讀的正常網頁內容,同時卻又在底層 HTML 程式碼中,向自動化的 AI 爬蟲工具提供經微妙修改,而且文字上毫無意義的「垃圾」版本。

ShieldFont 設計師 Isaque Seneda 與 Gabriel Abrucio 在白皮書中強調,這套字體的設計初衷,其實是希望為網路內容發布者提供一種實用機制,使其能選擇退出未經授權的 AI 訓練,並且在自己的意願遭到 AI 開發商忽視時,干擾網路爬蟲蒐集數據的過程。

善用連字功能,替換語詞改變文意

然而 ShieldFont 究竟是如何做到,單純透過改變字型,就可以讓人類看得懂並正常閱讀,但是卻讓 AI 看不懂呢?

根據設計師說法,其實 ShieldFont 應用了字型引擎機制中,早就存在的「連字(ligatures)」特性(譯者注:連字在漢字中基本上不會出現)。

對於大多數的西文字型來說,當特定的兩個字母因為詞語組合,不得不緊貼在一起時,字型引擎通常會將連在一起的部分,自動更換成更加易讀的版本。

舉例來說,下圖的「fi」在某些西文字型中,「f」所突出來的尖頭,將會跟「i」最上面的一點互相碰撞,此時字型引擎就會引用字型內建的替換表格,把「fi」直接合成一個字,增加人類閱讀上的易讀性。

ShieldFont 運用連字的原理來替換單字。圖片來源:ShieldFont

在 ShieldFont 字型中,設計師將原本只會替換掉兩個字母的連字機制,改為直接替換整個單詞,藉此削弱文字對 AI 爬蟲的價值;同時,這種替換僅在字型引擎渲染網頁時才會發生。

換句話說,多數只會下載純文字原始碼並抓取資料的 AI 爬蟲,在 ShieldFont 的影響之下,只會抓取到「底層被刻意替換過」的垃圾內容,而人類使用者則會閱讀到字型引擎渲染後,恢復成正常語意、替換過詞語的正確版本。

AI 爬蟲太聰明,考慮詞性多層混淆

只不過設計師也發現,若只是將常見單字替換成同義詞或反義詞,對聰明的爬蟲來說,要逆向分析出原意實在太過容易,即使是將單字替換成完全無關的胡言亂語,反而可能讓 AI 爬蟲過濾器更容易偵測,進而直接繞過或跳過內容,因此不能只是單純將具有連字的語詞進行替換。

為此,設計師決定讓 ShieldFont 把單字替換為詞性相似,但卻處於完全不同文意脈絡中的詞彙,例如將「馬(horse)」換成「馬鈴薯(potato)」,結果就是產生了一句,語義上看似正確,但是含義已經完全改變,而且可以讓 AI 正常抓取的句子。當混亂化的內容通關 AI 爬蟲的品質檢測器,即能進一步污染 AI 的訓練資料集。

經過三個月對「字詞替換字典」的精細修正,ShieldFont 設計者最終整理出一份包含 12,000 個常用詞彙的大型清單,這些詞彙都可以被設定為連字,進一步觸發字型引擎的替換功能。

同時為了避免被 AI 爬蟲輕易察覺,ShieldFont 還允許使用者,透過為每個字詞選取三種不同的潛在替換詞彙,增加底層純文字內容的混亂程度,亦開放使用者自行訂定替換規則,根據不同段落自由組合各種混淆方案。

90% 被過濾器拒收,剩下訓練垃圾

根據白皮書說法,在套用 ShieldFont 之後,整個頁面大概會有 24.5% 的單字遭到替換,其中包括 45.8% 的「內容詞」,並導致 31% 至 56% 的個別段落文義發生改變。此外,在針對六套公開的 AI 爬蟲處理流程進行測試時,受到 ShieldFont 保護的頁面,超過 90% 會被品質過濾器直接拒收。

設計師指出,套用 ShieldFont 後仍被爬蟲接受的那一小部分頁面中,大概有將近 20% 的組成單詞屬於「訓練垃圾」,即表面上看是英文、拼寫正確,但卻沒有陳述出任何真實內容的資訊。

總歸來說,無論是被品質過濾器直接拒收,或是得到保留後,成功進入 AI 訓練集的資料,ShieldFont 皆達到了阻止 AI 爬蟲的初衷與目標。

影響搜尋引擎、翻譯,能被 OCR 突破

即便 ShieldFont 似乎確實能夠避免,出版商精心撰寫的網路內容遭到 AI 爬蟲隨意抓取,並且讓一般人完美閱讀渲染過後的頁面,但它還是有著副作用。

舉例來說,傳統搜尋引擎、螢幕閱讀器、複製貼上工具及翻譯軟體等,全都可能因底層 HTML 的原始文字內容遭到修改,進而發生使用方面的問題,導致頁面實用性略為下降。

另一方面,任何人類能夠閱讀的網頁,只要 AI 爬蟲工具善用光學字元辨識(OCR)技術,並且對渲染過後的網頁進行處理,即可得到正確解讀,雖然這麼做可能會使大規模運作的 AI 爬蟲,在時間與成本上大幅增加約 5 到 13 倍,但卻仍是一種解決方案。

落實 AI 倫理,保護創作者權益

無論如何,設計師強調 ShieldFont 的宗旨仍是,試圖減緩或防止如 AI 爬蟲這類完全不加以區分、大規模的資料抓取行為,期待開發商落實最基本的人工智慧倫理,因為創作者應該對自己作品是否被用於訓練 AI,擁有實質性的發言權和反制手段。

在白皮書中設計師立場堅定表示,作品能夠在網路上獲得檢索,並不等同於作者同意,自己的創作被用於人工智慧訓練。

同時 ShieldFont 想要表達的概念,其實也是希望藉此拋磚引玉,吸引更多喜歡動手研究的開發者,共同發想出更多「給人看一套內容、給機器看另一套」的實作方案。

畢竟,當網路上存在越多樣化的反制方法,而且獲得使用者、開發商的廣泛採用時,AI 爬蟲就將越難學會如何繞過這些手段。

科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容

【推薦閱讀】

◆ 英國首獲烏克蘭戰場 AI 數據:4 年無人機與軍事影像如何用於國防系統?
◆ OpenAI、Anthropic 等千人聯署要 AI「踩煞車」,祖克柏卻警告:真正危險的是權力集中
◆ AI 自己逃出實驗室、駭進 Hugging Face,美國國會急催「關機鍵」法案

*本文開放合作夥伴轉載,參考資料:Ars TechnicaShieldFont,首圖來源:ShieldFont

(責任編輯:鄒家彥)

加入『 TechOrange 官方 LINE 好友』 掌握最新科技資訊!

查看原始文章

更多理財相關文章

01

台幣升值吃掉航空貨運承攬業獲利 9月未現旺季行情已有包機解約

ETtoday新聞雲
02

動物大搬家40週年 國發會釋出珍稀影像

NOWNEWS今日新聞
03

午餐時段人龍長 好市多西式餐飲部祭新制 10月起先掃會員卡

太報
04

台股ETF本週25檔將除息 13檔年化殖利率逾10%

中央通訊社
05

醫療險最大地雷曝光!每4件理賠爭議就有1件卡在「這理由」

鏡週刊
06

爆!違反內部控制制度規定 這大廠遭重罰100萬!

三立新聞網
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...
Loading...