Google準備打造一套適用於各家人型機器人的「大腦」系統。路透社
說到 Google 的 AI 模型,很多人心裡大概都有一句抱怨:「到底為甚麼Gemini越來越落後了。」
原本說好六月的 Gemini 3.5 Pro 沒有下文;九月底,萬眾矚目的旗艦模型 Gemini 4終於推出了,結果呢?Google 並沒有向大眾開放大腦,而是優先鎖起來,只交給資安防守方使用。
大家等半天,依然是「看得到、吃不到」。
有趣的是,就在 Gemini 4 發布的前幾天,DeepMind 新任執行長 Koray Kavukcuoglu 在接受《The Information》專訪時,面對外界對 Gemini 4 進度的追問,順勢交底了 Google 在另一個領域的戰略:機器人。
機器人界的 Android
今年八月 DeepMind 換帥,Kavukcuoglu 接任。在這場專訪中,雖然Google未來不排除自己做人形機器人,但他明確點出了 Google 現階段的優勢與重心:在模型,不在機體。
相較於 Tesla Optimus 或新創公司 Figure 追求機體極限、甚至讓機器人表演「後空翻」,Google 現階段不想在硬體工廠裡燒錢。
骨架、馬達這些苦力活,他們更傾向於交給 Boston Dynamics、Apptronik 等合作夥伴去做。
Google 真正想做的,是把自家的 AI 模型裝進別人的機器人裡。
這套劇本是不是很眼熟?這其實和當年 Android 十分相似。
事實上,Google 執行長 Sundar Pichai 過去在整合旗下機器人軟體公司 Intrinsic 時,也用過類似的概念:不自己造手機,只做作業系統,讓全天下都來用。
Tesla 和 Figure 拚的是「誰能造出一台最驚艷的機器」;而 Google 拚的是「未來有多少台機器,願意裝上 Google 的大腦」。
藏在「大腦」裡的一半開放、一半封閉
Google 準備塞進各大機器人裡的這顆大腦,叫做 Gemini Robotics(你可以把它視為 Gemini 的機器人擴充包)。
一般的 Gemini 會看圖、寫程式;而 Gemini Robotics 則多學了一項技能:把理解到的指令,變成手腳的實際動作。
但最有意思的是,這顆大腦跟剛發布的 Gemini 4 一樣,目前只開放了一半。
如果說 Gemini 4 鎖起來是出於「安全考量」的分階段開放,那麼 Gemini Robotics 的「不公開」,則是基於技術壁壘的刻意分層。
Gemini Robotics 其實分為兩層:
1. 規劃層(負責想): 例如思考「先走到桌邊、再拿起杯子」。這一層已經放上開發者平台,大家可以拿去測試,但模型本身並未開源。
2. 執行層(VLA,負責動): 負責把步驟轉譯成每一根手指的微小動作。這是真正的核心,目前死死捏在手裡,只交給少數幾家頂級合作夥伴使用。
Google 的邏輯很清楚:用規劃層吸引開發者建立生態,但把最核心的物理執行能力留在自己手裡。
物理世界的硬仗,比開車難多了
當然,這套戰略目前還是說得比做得多。
DeepMind 自己也承認,機器人五指的靈巧度與動作速度仍有待加強。同屬 Alphabet 旗下的無人車 Waymo 雖然證明了 AI 能自動駕駛,但「開車」和「做家事」完全是兩碼子事。
馬路上有車道和紅綠燈,大家照著規則走;但家裡是亂糟糟的:衣服可能丟在沙發上,杯子可能壓在一疊書旁邊。要機器人在這種沒有標準規則的物理世界中把事情做好,難度遠超自駕車。
對 Google 來說,機器人短期內不會變成財報上的一門新生意。但它真正的意義,是 Gemini 從螢幕裡走出來,開始碰到真實的世界。
本文由「
Fomo研究院」官網提供