AI 由識傾變成識郁:Gemini Robotics 2 控全身兼識叫機械人幫手
Tech News

AI 由識傾變成識郁:Gemini Robotics 2 控全身兼識叫機械人幫手

圖片:via iThome — https://www.ithome.com.tw/news/177784
TechLab 編輯部(譯)·

全身控制、多步驟規畫同裝置端運算齊升級,實際部署仲有段距離

今次最大升級係全身控制

iThome 報道,Google DeepMind 新一代 Gemini Robotics 2 已經可以由視像同文字指令直接產生動作,控制人形機械人行路、踎低、彎身、伸手同搬嘢。上一代示範集中喺上半身同枱面操作,今次就用 Apptronik Apollo 2 示範由枱面拎起水壺,再行到層架前放入指定位置。AI 開始要同時處理平衡、移動、視覺定位同雙手動作,複雜度高過坐定定夾件物件好多。

一個家庭,三種腦力分工

Gemini Robotics 2 系列分成幾個角色:VLA 動作模型接收畫面同指令,再輸出關節控制;基於 Gemini 3.5 Flash 嘅 Robotics ER 2 負責理解環境、拆工作步驟同判斷完成咗未;On-Device 2 就主打直接喺機械人硬件上運算。呢種分工幾重要,因為識得「執好間房」同準確控制手指、腳步,本身係兩個唔同尺度嘅難題,硬塞入同一個反應迴路,延遲同除錯都會麻煩得多。

幾分鐘任務,多機協作靠規畫層串起

DeepMind 話 Robotics ER 2 可以追蹤維持幾分鐘、牽涉數百次判斷嘅工作,某一步失手之後亦可以改計畫。多機協作同樣由呢個高層模型統籌,例如人形機械人同雙臂平台分開執拾工具。概念上,呢條路幾啱倉庫同工場:輪式平台負責運貨,機械臂處理精細工序,人形機械人就去應付樓梯或者為人而設嘅工作空間。不過官方公開材料主要得示範同能力描述,未見長任務或多機協作嘅完整成功率、失敗次數同復原時間

官方數字顯示部分精細動作仍然唔穩定

DeepMind 公布嘅受控測試顯示,Apollo 2 喺枱面、地面同層架取物,平均成功率分別係 68.4%、45.7% 同 76.3%;Franka Duo 配雙指夾爪做取放、工具整理同精準插入,就錄得 74.2% 至 89.6%。五指手差距更明顯:扭出燈泡有 92%,但裝燈泡、綁垃圾袋、用垃圾鏟同封密實袋只得 32% 至 44%。呢啲數據由官方提供,測試項目亦唔同,唔適合直接當成真實工作場地嘅可靠度。

On-Device 2 減少駁網,硬件門檻仍然係問號

On-Device 2 基於裝置端 Gemma 模型,官方定位係遇到網絡延遲甚至冇網上連線時,都可以直接喺機械人上執行。DeepMind 又話,適配新雙臂平台通常用少過 200 個示例同幾小時資料。不過 model card 冇列出推理所用處理器、RAM、功耗或者速度,現階段亦只開放畀 Trusted Testers。文件仲承認模型處理訓練分佈以外工作同高自由度機械人時有限制,評估重點係企定嘅雙臂操作,流動平台同全身控制風險未包喺呢輪測試入面。

安全限制令家用同安老場景仲要行多幾步

Robotics ER 2 加入拒絕危險動作、判斷工作做唔做到,同唔肯定時搵人介入等機制;官方亦用 ASIMOV-Agentic benchmark 測試呢類能力。不過 ER 2 model card 明講,放入生產、商業或公眾環境之前要審慎評估,亦唔建議用喺醫療、交通等出錯會傷人嘅關鍵工作。物流、零售、工業自動化甚至安老服務長遠都有相關工作,但而家較實際嘅做法,仍然係先喺封閉場地試,同埋安排人手睇實低風險工序。

下一步要睇真實場地點樣跌撞

就算單一取物動作成功率唔低,串成多步任務之後,每次失誤都可能拖低整體成功率,關鍵係復原機制救唔救得返。Gemini Robotics 2 呢次證明咗同一套 AI 架構可以開始兼顧規畫、全身動作同多機調度,但距離成熟產品仍欠幾項關鍵證據:獨立測試、長時間成功率、有人行過時嘅反應、換燈光同雜亂環境後嘅表現,仲有裝置端硬件成本。等呢批數字公開,先較容易判斷佢可以行出實驗室幾遠。


參考來源

本文根據原文及公開資料整理;資料有出入時,以原文及官方資料為準。

分享:WhatsAppThreadsTelegramFacebook