民視與微軟合作推 AI 主播「敏熙」,為何這位美女說話時完全聽不出機械音感?
生成式 AI 技術顛覆以往使用 AI 的方式,並深入各領域發展出多樣化的創新應用,而媒體產業在此波浪潮下也沒有缺席。
相信大家對於在民視主播台上播報國際氣象的「敏熙」主播並不陌生,專攻影像技術的光禾感知以 AIGC(AI Generated Content,人工智慧生成內容)技術,結合微軟 Azure AI 語音服務,為民視新聞打造台灣首位 AI 生成的虛擬電視新聞主播。
三方技術結合打造擬真 AI 主播,擺脫過去總是假假的感覺
本次合作集結影像、聲音與新聞製播等三方專業技術,由光禾感知生成 AI 虛擬主播影像後,搭配微軟 Azure AI 的語音合成技術產出發音自然、流暢的播報人聲,再借助民視新聞多年新聞製播經驗,以及新聞播報、訪談節目等高畫質新聞影像資料庫進行形象優化,量身打造專屬於民視的 AI 主播模型。
除了外貌,聲音在新聞播報中亦扮演重要角色,微軟 Azure AI 語音服務的 TTS(文字轉語音)及 Viseme 技術即為實現敏熙主播自然且順暢人聲關鍵。不同於傳統如機械音般的文字轉語音服務,Azure AI 語音服務擁有豐富模型,提供 140 種語系以上、超過 400 個近似真人發音的預建神經語音模型供選擇。
除了預建模型,Azure AI 語音服務還支援自訂模型,可根據需求調整語音的風格、速度、音調等參數,進而生成貼近真人主播具備情緒及抑揚頓挫的語音。
此外,透過 Viseme 技術還能提升虛擬主播嘴型與播報文字精準度。Viseme 技術能夠在說話過程定義臉部及嘴唇、下顎及舌頭等位置,使虛擬主播臉部嘴型與語音的結合呈現更為自然。兩者技術相輔相成不僅能生成嘴型與聲音吻合的 AI 臉部影像,也能進一步實現多國語系主播的可能,敏熙現在已可以進行綜合中文及英文的播報內容。
全新模型呈現 AI 主播不卡卡,每日順利播報新聞與氣象
民視 AI 主播「敏熙」六月上線後,獲得市場及觀眾熱烈迴響,並持續由三方進行播報精準度提升,在聲音方面微軟藉由結合最新 AI 技術而更加擬真的 TTS 及 Viseme 技術不斷優化聲音的呈現。
光禾感知則網羅民視豐富且涵蓋中文、英文、台語、客語等語言之 4K 高畫質新聞影像資料庫,持續訓練全新影像模型,呈現細緻的臉部肌肉紋路,確保整體脣形、聲音及肢體語言更加擬真與自然。
目前「敏熙」主要於民視無線台晚間《全球看民視》、民視新聞台晚間六點十二分左右以及午夜新聞播報國際氣象,未來亦將於各時段節目或重點新聞預告播報。
*本文訊息由「台灣微軟」提供,內文與標題經 TechOrange 修訂後刊登。新聞稿 / 產品訊息提供,可寄至:pr@fusionmedium.com,經編輯檯審核並評估合宜性後再行刊登。圖片來源:台灣微軟提供。
(責任編輯:黃俊誠)
立即免費報名「AI Innovation Day:2024 AI 創新日」