新聞

Google DeepMind發表Gemini Robotics 2系列模型,將機器人控制範圍從原本的上半身與桌面操作,擴大至人形機器人的全身動作,並加入精細操作、持續數分鐘的多步驟任務規畫及多機器人協作能力。其中Gemini Robotics On-Device 2可直接在機器人裝置上執行,減少對網路連線的依賴。

主要模型Gemini Robotics 2會接收攝影機影像和自然語言指令,再轉換成機器人的動作控制訊號。除了雙臂與機械手,也能控制人形機器人走路、蹲下、彎腰、伸手及搬運物品。Google以人形機器人公司Apptronik的Apollo 2示範,讓機器人依指示拿起澆水壺,走向置物架,再將物品放入指定位置。

Google公布的測試結果顯示,Apollo 2從桌面、地面及架上取物的成功率介於45.7%至76.3%,而使用雙指夾爪的Franka Duo執行物品取放、工具整理及精密插入時,成功率介於74.2%至89.6%。五指機械手的表現較不穩定,多數測試成功率僅32%至44%,顯示需要多根手指協調的細部動作仍有改善空間。

Gemini Robotics ER 2負責理解環境及安排工作步驟,能夠觀察現場、拆解使用者交付的任務、指揮動作模型執行,並持續確認進度。Google表示,該模型可處理持續數分鐘、涉及數百次判斷的工作,在步驟失敗後調整計畫,也能協調不同類型的機器人分工完成任務。

Gemini Robotics On-Device 2則可直接在機器人硬體上執行,適合無法穩定連網或要求低延遲的環境。Google宣稱,開發者通常可用不到200個操作範例,在數小時內讓模型適應外型、感測器及關節配置不同的新型雙臂機器人。

Google另提出ASIMOV-Agentic測試基準,用來檢查模型能否拒絕動作模型要求執行的不安全操作、判斷任務是否可行,並在無法確定時要求人員介入。Gemini Robotics ER 2已在Google AI Studio開放使用,並於Gemini Enterprise Agent Platform進行私人預覽,Gemini Robotics 2與Gemini Robotics On-Device 2則僅向早期合作夥伴提供。