理財

Google發布Gemini 2.0!AI助手Astra大升級:可聽懂晶晶體、看圖辨位⋯還能兼電玩教練?

數位時代
更新於 12月11日10:38 • 發布於 12月11日15:45

Google的招牌AI模型Gemini,經歷了近一年的1.5版本發展,終於在台灣時間12月11日深夜宣布推出最新的Gemini 2.0 Flash實驗版,為新一代Gemini 2.0系列打頭陣

Google執行長桑德爾.皮蔡(Sundar Pichai)在部落格文章中稱它為「我們所有尖端技術的縮影」。

廣告(請繼續閱讀本文)

Gemini 2.0 Flash雖然是輕量版,表現卻超出上一代的最高版本1.5 Pro,產出速度還更快,性能大幅升級,Google也同步分享了智慧助手Project Astra和新的網頁助手Project Mariner的應用,在多模態能力、反應速度、對外蒐集資料能力上,都展現新一代Gemini的力量。

Google推出全新模型Gemini 2.0 Flash,同時展示助手能力升級版的應用。

Gemini 2.0 Flash有多強?

廣告(請繼續閱讀本文)

Gemini 2.0 Flash是由非常受開發者歡迎的1.5 Flash模型的升級版產品,延續了Flash反應速度極快的特性,根據Google的測試,2.0 Flash身為「輕量版」,關鍵標準測試的表現,除了長文字處理外,其他所有相簿都贏過上一代的「專業版」1.5 Pro。例如,2.0 Flash寫程式的能力得到92.9的高分,1.5 Pro在這個項目中只得到85.4分,速度還快了一倍。

Google Gemini 2.0 Flash和1.5版本相比,在多方面能力都拿到更高的分數。

開放時間
Google已於上月先向部分開發者分享了Gemini 2.0的早期實驗版本,即日起開發者可透過Google AI Studio和Vertex AI平台正式選用Gemini 2.0 Flash的實驗模型, 明年一月將全面開放使用,並推出更多不同大小的模型版本。

智慧助手升級:Project Astra

隨著新版本模型的登場,AI助手也跟著升級。Google在今年5月登場的I/O大會中首次公開Google未來的人工智慧助手—— Project Astra,具備「多模態」能力,能解讀文字、語音、動態畫面,因此能夠在看到動態畫面時快速思考和反應,甚至擁有記憶力。

而加入Gemini 2.0後,Project Astra有了四大能力升級。

升級一:多語言對話能力

Astra語言能力升級,現在可支援多語言及混合語言對話,並更能理解口音及少見詞彙。例如,在說話時使用中應大量混雜的「晶晶體」,或者和法國人好友同時對Astra下指令,都能快速理解並完成任務。

升級二:使用更多工具輔助

Astra現在可以上網使用Google搜尋、Lens與地圖,解鎖更多應用場景,例如拍攝路上的裝置藝術,Astra可以知道位置之外,還可以透過網路上的說明資訊,告訴你裝置藝術的涵義。

升級三:記憶力變強了

Astra在初登場時最讓人印象深刻的是記憶力,當時Demo的人員詢問Astra「記不記得我的眼鏡放在哪裡?」Astra馬上分析這幾分鐘內經過的所有畫面,找到眼鏡所在的影格並分析畫面中的資訊,最後得出結論;「放在一顆蘋果旁邊。」

這次Google把Astra的記憶力保留時間拉長到10分鐘,並能想起更多過去的對話內容作為補充資訊,以更個性化地服務使用者,比如可以請Astra幫忙記住一組密碼,離開去泡杯咖啡聊聊天,回來後再請Astra幫忙說出密碼內容。

升級四:降低延遲自然對話

根據Google的說明,新版本Astra的語言理解速度已經接近真人對話,因此當你Astra問問題時,不會讓人感覺「卡卡」,互動更自然。

網頁搜尋幫手:Project Mariner

而這一次Google也揭露全新計畫內容,稱為Project Mariner,可以視為Google打造未來全新網頁使用體驗的決心, Project Mariner就像一個助手,或者擴充功能,幫你瀏覽各種網頁蒐集到需要的資訊,它可以理解並分析瀏覽器畫面中的資訊,包括像素、文字、程式碼、圖片及表單等元素。

比如Google展示了一項應用,打開一個Google試算表文件,表格裡面有好幾家公司的名字, 可以在一旁的Project Mariner視窗中打下「幫我找到這些公司的招牌產品和他們的聯絡方式」,Mariner就會開始自己開始搜尋、尋找資訊,而且這些過程都展示給你看,讓你看見Mariner在滑動這些公司的官網、理解圖片的過程,接著在幾秒鐘後整理好資訊、告訴你答案。

因為可以看到蒐集答案的過程,而不是直接提供結果,把人的監管加入流程中,雖然速度比起直接生成答案更慢,卻也提高了一部分的可信度。

在WebVoyager基準測試中,可以評估AI在真實世界網頁裡工作的表現,Project Mariner達到了83.5分的成績,根據Google的說法,這是業界領先的成果,「雖然Project Mariner目前的執行速度稍慢且偶爾不夠準確,但隨著技術進步,這些問題將迅速改善。」Google Labs產品管理總經理潔克琳.康傑曼(Jaclyn Konzelmann)指出。

遊戲領域「外掛」:Gemini for Games

Gemini 2.0的另一項新應用是在遊戲方面,像是一個師傅,幫助玩家在遊戲的虛擬世界中快速針對規則、角色等內容產生理解,甚至可以邊玩邊詢問「我忘記現在是要完成甚麼任務才能通關,你可以告訴我嗎?」

而Gemini就會告訴玩家「你必須蒐集到200顆寶石,建議你選擇XX角色更快達成任務。」代表可以根據螢幕上的行動進行遊戲推理,並透過即時對話提供下一步建議。

未來玩遊戲時,也許可以讓Gemini助手提供策略上的建議。

總結:Google持續嘗試在謹慎中創新

隨著微軟、OpenAI等公司提出AI代理(AI Agent)新概念和應用,能夠在用戶授權下主動執行任務的代理式AI,成為明年最重要的競爭方向,代表AI從一個口令一個動作,進入下一個階段。

Google這次在Astra和Mariner都展現類似的野心,不過很明顯在產品設計上更加小心翼翼,甚至依舊保留了人類監管或控制的選項,似乎還沒打算讓AI脫離掌控主動工作。

對此,Google DeepMind 產品管理總經理圖席.道許(Tulsee Doshi)在受訪時坦言,Google確實有感受到業界對於放鬆AI行動限制的發展方向,不過這代表著更多的問題可能會隨之發生,因此Google還是抱持的謹慎地態度面對,先從部分授權開始,同時找來一群信任的測試人員,進行試用並提供回饋,確保AI提供的服務不會出問題。

Google似乎將延續「負責任AI」的口號,在衝刺的AI領域中自踩剎車,先求穩再求好的模式,會在明年的AI代理戰中脫穎而出還是落後,值得觀察。

延伸閱讀:Google發布量子晶片Willow!5分鐘搞定「10的25次方年」計算:將解鎖AI、核融合難題

責任編輯:李先泰

延伸閱讀

2024年終行情出爐!金融業近3個月連霸12年、上班族平均1.3個月⋯科技業只排第3?
黃仁勳、Google都來了!科技巨頭為何狂投資越南?設資料中心有哪些挑戰?
「加入《數位時代》LINE好友,科技新聞不漏接」

查看原始文章