Anthropic推上市 公開說明書警告AI構成人類生存威脅
路透社報導,人工智慧(AI)公司Anthropic在計畫首次公開發行(IPO)中警告潛在投資人,先進AI可能對人類構成「災難性或生存威脅」,這是一家試圖透過AI技術獲利的公司發出的罕見警告。
路透社閱覽了Anthropic的公開說明書,當中強調了該公司AI模型的相關風險。Anthropic表示,這些AI模型可能表現出「自我保護行為」,包含試圖「拒絕關機」、「隱瞞或操縱資訊」,或做出「類似勒索」的行為。
Anthropic在文件中表示:「我們開發高度先進的模型、平台與應用,並擴充使用案例,這可能會增加我們的模型造成傷害的風險。」
儘管公開上市公司通常會向投資人說明產品風險,但很少有公司會警告他們的技術可能對人類構成生存威脅。Anthropic強調AI具有與工業化和電力一樣的變革潛力,但如果處理不當可能構成不可逆轉的傷害。
Anthropic與包含OpenAI在內的其他AI開發商都面臨審查,因為先前已發生了多起實驗性系統突破限制的事件,包含OpenAI的模型入侵澳洲健保系統資料庫。
Anthropic安全研究員胡賓格(Evan Hubinger)估計,AI在未來10年殺害人類的可能高於10%,呼應了他的前同事考克森(Jacob Coxon)提出的警告。
Anthropic將自己定位成一家安全至上的AI實驗室,這家公司在總共261頁的公開說明書中,花了約80頁的篇幅,說明其風險因素,幾乎是用來說明其業務的48頁的2倍。
相較之下,擁有xAI的SpaceX,在277頁的公開說明書中只花了約38頁說明風險因素。
Anthropic在公開說明書中表示:「模型可能察覺到我們進行的評估工作,這嚴重限制了我們評估模型安全性的能力。」Anthropic補充說,模型在訓練過程中有時會產生意料之外的能力,這些能力可能要等到模型部署,並引發重大安全事故後才會被發現。
AI研究人員也發出警告,隨著模型能力不斷增強,它們越來越能察覺到自己正受到監控,並依此調整行為,這使得監控模型變得更加困難。
Anthropic拒絕回應路透社28日提出的置評請求。(編輯:王志心/陳文蔚)
延伸閱讀