【用字型也能反制 AI】讓 AI 爬蟲抓到假資料,設計師推 ShieldFont 保護創作者
全世界幾乎所有 AI 開發商,皆在龐大的公開網路中抓取數據以尋找有價值的訓練資料;當然,這樣的行為也引發多起訴訟,並促使有關企業(通常是內容出版商)不得不採取新技術,嘗試遏止 AI 爬蟲行為。
如今,一款為了對付 AI 爬蟲而來的全新「字型」,在兩位設計師的突發奇想下堂堂誕生,並且被命名為 ShieldFont。
ShieldFont 能夠向人類使用者呈現完全可讀的正常網頁內容,同時卻又在底層 HTML 程式碼中,向自動化的 AI 爬蟲工具提供經微妙修改,而且文字上毫無意義的「垃圾」版本。
ShieldFont 設計師 Isaque Seneda 與 Gabriel Abrucio 在白皮書中強調,這套字體的設計初衷,其實是希望為網路內容發布者提供一種實用機制,使其能選擇退出未經授權的 AI 訓練,並且在自己的意願遭到 AI 開發商忽視時,干擾網路爬蟲蒐集數據的過程。
善用連字功能,替換語詞改變文意
然而 ShieldFont 究竟是如何做到,單純透過改變字型,就可以讓人類看得懂並正常閱讀,但是卻讓 AI 看不懂呢?
根據設計師說法,其實 ShieldFont 應用了字型引擎機制中,早就存在的「連字(ligatures)」特性(譯者注:連字在漢字中基本上不會出現)。
對於大多數的西文字型來說,當特定的兩個字母因為詞語組合,不得不緊貼在一起時,字型引擎通常會將連在一起的部分,自動更換成更加易讀的版本。
舉例來說,下圖的「fi」在某些西文字型中,「f」所突出來的尖頭,將會跟「i」最上面的一點互相碰撞,此時字型引擎就會引用字型內建的替換表格,把「fi」直接合成一個字,增加人類閱讀上的易讀性。
在 ShieldFont 字型中,設計師將原本只會替換掉兩個字母的連字機制,改為直接替換整個單詞,藉此削弱文字對 AI 爬蟲的價值;同時,這種替換僅在字型引擎渲染網頁時才會發生。
換句話說,多數只會下載純文字原始碼並抓取資料的 AI 爬蟲,在 ShieldFont 的影響之下,只會抓取到「底層被刻意替換過」的垃圾內容,而人類使用者則會閱讀到字型引擎渲染後,恢復成正常語意、替換過詞語的正確版本。
AI 爬蟲太聰明,考慮詞性多層混淆
只不過設計師也發現,若只是將常見單字替換成同義詞或反義詞,對聰明的爬蟲來說,要逆向分析出原意實在太過容易,即使是將單字替換成完全無關的胡言亂語,反而可能讓 AI 爬蟲過濾器更容易偵測,進而直接繞過或跳過內容,因此不能只是單純將具有連字的語詞進行替換。
為此,設計師決定讓 ShieldFont 把單字替換為詞性相似,但卻處於完全不同文意脈絡中的詞彙,例如將「馬(horse)」換成「馬鈴薯(potato)」,結果就是產生了一句,語義上看似正確,但是含義已經完全改變,而且可以讓 AI 正常抓取的句子。當混亂化的內容通關 AI 爬蟲的品質檢測器,即能進一步污染 AI 的訓練資料集。
經過三個月對「字詞替換字典」的精細修正,ShieldFont 設計者最終整理出一份包含 12,000 個常用詞彙的大型清單,這些詞彙都可以被設定為連字,進一步觸發字型引擎的替換功能。
同時為了避免被 AI 爬蟲輕易察覺,ShieldFont 還允許使用者,透過為每個字詞選取三種不同的潛在替換詞彙,增加底層純文字內容的混亂程度,亦開放使用者自行訂定替換規則,根據不同段落自由組合各種混淆方案。
90% 被過濾器拒收,剩下訓練垃圾
根據白皮書說法,在套用 ShieldFont 之後,整個頁面大概會有 24.5% 的單字遭到替換,其中包括 45.8% 的「內容詞」,並導致 31% 至 56% 的個別段落文義發生改變。此外,在針對六套公開的 AI 爬蟲處理流程進行測試時,受到 ShieldFont 保護的頁面,超過 90% 會被品質過濾器直接拒收。
設計師指出,套用 ShieldFont 後仍被爬蟲接受的那一小部分頁面中,大概有將近 20% 的組成單詞屬於「訓練垃圾」,即表面上看是英文、拼寫正確,但卻沒有陳述出任何真實內容的資訊。
總歸來說,無論是被品質過濾器直接拒收,或是得到保留後,成功進入 AI 訓練集的資料,ShieldFont 皆達到了阻止 AI 爬蟲的初衷與目標。
影響搜尋引擎、翻譯,能被 OCR 突破
即便 ShieldFont 似乎確實能夠避免,出版商精心撰寫的網路內容遭到 AI 爬蟲隨意抓取,並且讓一般人完美閱讀渲染過後的頁面,但它還是有著副作用。
舉例來說,傳統搜尋引擎、螢幕閱讀器、複製貼上工具及翻譯軟體等,全都可能因底層 HTML 的原始文字內容遭到修改,進而發生使用方面的問題,導致頁面實用性略為下降。
另一方面,任何人類能夠閱讀的網頁,只要 AI 爬蟲工具善用光學字元辨識(OCR)技術,並且對渲染過後的網頁進行處理,即可得到正確解讀,雖然這麼做可能會使大規模運作的 AI 爬蟲,在時間與成本上大幅增加約 5 到 13 倍,但卻仍是一種解決方案。
落實 AI 倫理,保護創作者權益
無論如何,設計師強調 ShieldFont 的宗旨仍是,試圖減緩或防止如 AI 爬蟲這類完全不加以區分、大規模的資料抓取行為,期待開發商落實最基本的人工智慧倫理,因為創作者應該對自己作品是否被用於訓練 AI,擁有實質性的發言權和反制手段。
在白皮書中設計師立場堅定表示,作品能夠在網路上獲得檢索,並不等同於作者同意,自己的創作被用於人工智慧訓練。
同時 ShieldFont 想要表達的概念,其實也是希望藉此拋磚引玉,吸引更多喜歡動手研究的開發者,共同發想出更多「給人看一套內容、給機器看另一套」的實作方案。
畢竟,當網路上存在越多樣化的反制方法,而且獲得使用者、開發商的廣泛採用時,AI 爬蟲就將越難學會如何繞過這些手段。
科技的變化總是快得驚人,而我們每天的工作,就是從龐雜的趨勢中理出觀點、提煉出決策者真正需要的洞察。如果你也對 AI 發展充滿熱情,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ 英國首獲烏克蘭戰場 AI 數據:4 年無人機與軍事影像如何用於國防系統?
◆ OpenAI、Anthropic 等千人聯署要 AI「踩煞車」,祖克柏卻警告:真正危險的是權力集中
◆ AI 自己逃出實驗室、駭進 Hugging Face,美國國會急催「關機鍵」法案
*本文開放合作夥伴轉載,參考資料:Ars Technica、ShieldFont,首圖來源:ShieldFont
(責任編輯:鄒家彥)