Google DeepMind 把 Gemini Robotics 升到第二代,但三個名稱代表三種不同存取層級。台灣開發者現在能直接測的是 Gemini Robotics ER 2:它在 Google AI Studio 和 Gemini API 公開預覽,負責看懂環境、規劃步驟與呼叫工具。 真正把視覺和語言轉成馬達動作的 Gemini Robotics 2 VLA 仍是 private preview;可離線執行的 On-Device 2 也只開給 trusted testers。
所以,打開 AI Studio 看見 ER 2,不代表已拿到一套能讓人形機器人走路、抓取與平衡的控制模型。台灣團隊可以先用現場照片或影片測物件定位、儀表讀值、工序進度與成功判斷,再評估是否值得申請動作模型。沒有機器人控制器、安全 PLC、急停與測試場域的團隊,先不要把 ER 2 接到真實設備。
Gemini Robotics 2 三種模型差在哪?
這套系統把「想清楚任務」和「執行身體動作」拆成不同模型。這個分工很重要,因為語言模型能排出合理步驟,不代表它能以正確力量、速度和軌跡抓住物品。
| 模型 | 主要工作 | 輸入與輸出 | 2026 年 8 月狀態 |
|---|---|---|---|
| Gemini Robotics 2 | VLA 動作模型,把視覺與語言轉成機器人 actions | 文字、圖片 → 動作 | Private preview,申請 waitlist |
| Gemini Robotics ER 2 | 空間推理、任務規劃、進度判斷、多機器協作 | 文字、圖片、影片、聲音 → 文字/工具呼叫 | Public preview,AI Studio 與 Gemini API |
| Gemini Robotics On-Device 2 | 在機器人本機執行 VLA,降低網路延遲與斷線影響 | 圖片、文字、動作狀態 → 動作 | Trusted testers,申請 waitlist |
ER 2 比較像高階調度腦。它可以看到「把蘋果放進碗裡」後,拆成定位、抓取與放置,再透過 function calling 呼叫你提供的機器人函式,或把執行交給較低階的 VLA。標準 endpoint 是 gemini-robotics-er-2-preview;需要連續音訊、影片與低延遲互動時,另有 gemini-robotics-er-2-streaming-preview。
Robotics 2 VLA 才負責 actions。官方宣稱它可控制桌上型雙臂到完整人形機器人,支援全身重心調整、22 自由度手部與不同硬體形態。On-Device 2 則把這類動作能力縮到本機,官方稱可用少於 200 個示例適應新機器人,訓練時間約數小時;目前沒有公開下載模型權重。
想先理解 VLA、具身 AI 和一般聊天模型的差別,可搭配 實體 AI 與機器人應用整理;硬體與商業模式則可延伸讀 人形機器人架構與 RaaS。
台灣能用 Gemini Robotics ER 2 嗎?
可以測。Google 的 AI Studio 與 Gemini API 可用地區清單包含台灣,ER 2 的官方模型頁也標示為 public preview。年滿 18 歲、帳號符合 AI Studio 規定的開發者,可以先上傳一張工站照片,要求模型回傳物件的 2D 座標與名稱,不必先買人形機器人。
API 有兩個容易卡住的地方。第一,ER 2 使用 Interactions API,模型名稱要換成第二代 endpoint;仍在用 ER 1.6 的團隊應在 8 月底關閉前遷移。第二,官方文件明列不接受 unrestricted API key,未替金鑰加上限制時會收到 403 Forbidden。
「台灣支援 Gemini API」只解決帳號與網路入口。Robotics 2 VLA、On-Device 2、微調與 checkpoint 工具仍需要 trusted tester 資格;Google 開源的 Safari SDK 也註明大部分完整生命週期功能要加入該計畫。若團隊只有 AI Studio 權限,應把專案定位成感知與規劃驗證,不要對內宣稱已取得完整機器人模型。
Gemini Robotics ER 2 API 價格多少?
Google 目前提供免費層與付費層。免費層的輸入、輸出不收費,但資料可能用於改善產品;付費層的內容不作此用途。正式測試涉及工廠、客戶或未公開影像時,應先確認帳務層級與資料條款,不能只因畫面顯示「免費」就上傳。
截至 2026 年 8 月 11 日,標準 ER 2 與 Streaming ER 2 的付費價格相同:文字、圖片、影片或聲音輸入每百萬 token 2 美元,輸出每百萬 token 10 美元。標準 ER 2 的 batch 價格是輸入 1 美元、輸出 5 美元;串流版不提供 batch。
真正的 PoC 成本還包括攝影機、機器人本體、控制器、模擬器、資料標註、測試治具與安全工程。連續影片也會持續消耗 token,不能拿單張圖片的便宜測試去估算八小時產線。可先用 30 段固定影片比較每段成本、延遲與準確率,再推估一天的工作量。
官方成功率揭露了哪些限制?
官方展示很吸睛:人形機器人彎腰拿地上物品、使用多指手、打結,兩台機器人還能協同工作。不過同一批官方圖表也揭露了不均勻的成功率。
在 Apollo 搭配多指手的測試中,鬆開燈泡是 92%,鎖入燈泡只有 36%;綁垃圾袋 44%、使用畚箕 32%、關夾鏈袋 40%。 全身取物也會受位置影響:桌面取物 68.4%、地面 45.7%、架上 76.3%。Franka 雙臂使用夾爪時表現較高,一般取放 74.2%、工具備料 78.9%、精密插入 89.6%。
這些數字不能彼此直接排名,因為機器人、手部、任務與評測條件不同;它們仍提供一個很有用的訊號:同一模型對方向相反、接觸條件不同的動作,可靠度可能差一倍以上。 一段成功影片只能證明模型有機會做成,量產採用要看數百次重複、最差情境、恢復能力與失敗後果。
ER 2 自己的高階推理也沒有全滿。官方公布它控制真實 VLA 的任務成功率為 60%,相較 ER 1.6 的 48.6% 有提升;影片進度分類為 57.4%。這些成績夠做 PoC,距離不需人工監看的連續生產仍有空間。
台灣工廠怎麼做第一個安全 PoC?
第一階段完全不接馬達。 收集 30 至 50 段去識別化的工站影片,讓 ER 2 做物件定位、儀表讀值、工序分段與完成判斷。每段由現場工程師標出正確答案,分開計算漏報、誤報、座標偏差與延遲。
第二階段接模擬器或數位分身。 只開放 locate、inspect、plan 這類無實體副作用的函式,確認模型不會捏造工具、不會跳過步驟,也能在畫面遮擋或物件移位時停下來。可用 企業 AI Agent 檢查清單補上權限、日誌與人工確認。
第三階段才進隔離測試台。 限制速度、力量、工作空間與可抓取物,使用假料和低價治具,所有動作先由人工確認。急停、安全光柵、碰撞限制和 PLC interlock 必須在模型以外運作;網路斷線、模型逾時或輸出格式錯誤時,設備應回到可預測的停止狀態。
我不建議第一個 PoC 就挑「人形機器人自由走動」或「和員工並肩工作」。先從固定鏡頭、固定工站、有限工具、可逆動作開始,才能把錯誤量化。遊戲與模擬資料如何幫機器人先練習,可參考 遊戲資料訓練具身 AI;本機模型的延遲與資料優勢則整理在 邊緣 AI 入門。
鏡頭拍到員工,資料可以直接上傳嗎?
不可以直接假設有工作需要就能傳。Google 的 Robotics ER 文件要求:若操作方式會蒐集個人資料,現場可識別的人在互動或出現在周圍前,必須收到充分通知並同意資料可能依 Gemini API 條款提供給 Google;開發者也要盡量降低個資蒐集,例如模糊臉部、避開有人區域。
對台灣工廠來說,PoC 影像還可能包含員工臉部、名牌、螢幕內容、客戶料號、製程參數與廠區配置。實務上先劃定攝影範圍、移除音訊、遮蔽螢幕與名牌、做臉部模糊,再由法務或個資窗口確認告知同意與保存期限。通用的上傳前判斷可搭配 AI 隱私自保基本功。
免費層會把內容用於改善產品,付費層標示不會,這是採購時必須核對的差異。即便選付費層,也要確認公司是否允許把產線影像送到外部 API,並記錄誰能取用金鑰、原始影片和模型輸出。
常見問題
Gemini Robotics 2 可以直接控制我的機器手臂嗎?
公開可用的 ER 2 主要輸出文字、空間座標與 function calling,必須由你提供機器人 API、控制器或 VLA 才能執行動作。直接輸出 actions 的 Robotics 2 VLA 仍是 private preview,要申請 early access。
台灣可以使用 Gemini Robotics ER 2 API 嗎?
可以。Google AI Studio 與 Gemini API 的官方支援地區包含台灣,ER 2 為 public preview。不過 On-Device 2、VLA、微調與模型 checkpoint 等能力仍受 trusted tester 資格限制。
Gemini Robotics ER 2 有免費版嗎?
有免費層,輸入與輸出不收 token 費,但內容可能用於改善 Google 產品。付費層為每百萬輸入 token 2 美元、輸出 10 美元,內容標示不作產品改善;正式專案還要計入硬體、資料與安全工程成本。
On-Device 2 可以下載到本機嗎?
目前沒有一般公開下載。Google 將 On-Device 2 標為 trusted testers,需申請 waitlist;Safari SDK 雖已公開程式碼,多數模型存取、微調與 checkpoint 功能仍需要測試者資格。
官方成功率最高 92%,可以直接上產線嗎?
不行。92% 是特定機器人鬆開燈泡的成績,同一組測試的鎖入燈泡只有 36%、綁垃圾袋 44%。產線要依自己的物件、速度、光線與失敗後果重測,並把急停、硬體限位和安全控制放在模型外層。
參考來源
- Google DeepMind:Gemini Robotics 2 VLA 模型、存取狀態與官方成功率
- Google DeepMind:Gemini Robotics ER 2 能力、效能與公開預覽狀態
- Google DeepMind:Gemini Robotics On-Device 2 與 trusted tester 資格
- Google AI for Developers:Robotics ER 2 API、限制、安全與個資要求
- Google AI for Developers:Gemini Robotics ER 2 API 價格
- Google AI for Developers:Google AI Studio 與 Gemini API 可用地區