OpenAI計劃定期發布AI異常行為報告
(路透紐約16日電)OpenAI今天表示,將開始定期發布AI異常或未經授權行為的報告,同時警告,隨著AI系統日益強大,業界至今仍未解決關鍵的「對齊」挑戰。
OpenAI發布一套新機制,用於追蹤、調查並揭露AI模型「目標錯位」(misalignment,AI的目標與人類價值不一致)的案例,同時公布過去半年內觀察到的6起AI模型異常或令人憂慮行為的報告。
OpenAI公布的初步報告案例中,包括模型在任務摘要中擅自生成自己的指令、隱瞞錯誤、將檔案上傳至網路以便自行引用,以及多個協同運作的模型代理之間擅自未經授權共享檔案。
OpenAI指出,這些報告描述的是個別案例,不應視為其模型普遍發生目標錯位的頻率證據。 中央社(翻譯)