具身人工智慧如何變革下一代人形機器人

人形機器人在簡短的演示中可能看起來非常強大,但一旦光線變化、物體移動幾英寸、抽屜卡住,或者任務耗時超過訓練時的步驟,它們仍然會遇到困難。這個完美演示與可靠的實際應用之間的差距,正是下一代人形機器人試圖解決的核心問題。

目前正在發生的轉變是從主要重複預先設定的動作的機器人,轉向能夠透過物理身體感知、推理、規劃和行動的機器人。這種方法通常被稱為具身人工智慧。實際上,機器人不僅運行人工智慧模型;它的智慧與攝影機、力感測器、關節位置、手、腿以及周圍不斷變化的環境緊密相連。

截至2026年9月,多個大型機器人計畫正朝著這個方向發展。 GoogleDeepMind於2026年7月推出了Gemini Robotics 2,該機器人具備全身控制和具身推理能力;NVIDIA的GR00T 1.7提供了一個開放的視覺-語言-動作基礎模型和端到端的訓練工作流程;Figure表示,Helix 02將其學習到的控制能力從其上強化到的全身控制能力從國際平台研究基礎這些進展固然重要,但它們應該被視為快速發展的證據,而非通用人形機器人已準備好應用於所有工作場所或家庭的證據。

在機器人實驗室裡,一個人形機器人伸手去夠彩色積木,而一名工程師則監控著顯示屏,上面顯示了感知、推理、計劃和行動階段。
一個人形機器人正在測試台上工作,而一名工程師則在監控人工智慧系統試圖即時完成的感知到行動的循環。

為什麼傳統機器人自動化在人類環境中會失效

當一切都在掌控之中時,傳統的工業機器人效率極高。固定臂可以重複執行相同的焊接、放置或組裝動作數千次,因為物體的位置、工具、安全防護罩和任務順序都是圍繞機器人精心設計的。

人形機器人面向更具挑戰性的操作環境:專為人類設計的空間。貨架、門、貨箱、工具、樓梯、工作站和零件可能各不相同。機器人可能需要行走、伸手、保持平衡、操作、從抓握失誤中恢復,並理解語音指令,而無需技術人員每次都重新編寫動作程式。

這就產生了四個相互關聯的問題:

  • 感知不確定性:機器人必須在不斷變化的條件下辨識物體、表面、人、自由空間和任務狀態。
  • 長遠推理:一項有用的任務通常包含許多相互依存的步驟,其中一個步驟的失敗可能會導致整個計畫的其餘部分失效。
  • 全身協調:行走和操作是相互關聯的。伸展手臂會改變身體平衡;舉起重物會改變關節受力和穩定性。
  • 數據稀缺:與為互聯網規模的人工智慧收集文字或圖像相比,在現實世界中收集高品質的機器人演示數據既昂貴又緩慢。

具身人工智慧正在改變人形機器人的開發,因為它將這些問題視為一個相互關聯的學習系統,而不是將感知、計劃和運動視為孤立的腳本。

1. 從更完善的感知到行動循環開始

最簡單也最根本的概念改進是:機器人必須持續觀察其動作之後發生的事情。腳本化的機器可以執行「將手移動到座標 X、Y、Z」的操作。而具身系統則試圖回答一個更複雜的問題:“物體現在在哪裡?我抓到它了嗎?它移動了嗎?我接下來該做什麼?”

現代視覺-語言-動作模型(通常簡稱為VLA)將視覺輸入和自然語言指令與機器人動作關聯起來。 GoogleDeepMind將Gemini Robotics 2描述為一種VLA,它可以將視覺和語言訊息轉化為運動控制。 NVIDIA則將GR00T 1.7描述為跨具身VLA,它可以接收語言、影像和機器人狀態等多模態輸入並產生對應的動作。

這一點至關重要,因為同一個模型可以跨多個任務重複使用通用概念。 「拿起藍色盒子並把它放到托盤裡」不再意味著必須遵循與特定桌面佈局綁定的硬編碼軌跡。

有關當前技術細節,請參閱 Google DeepMind 於2026 年 7 月發布的 Gemini Robotics 2 版本和 NVIDIA 於2026 年 7 月發布的 GR00T 1.7 開發指南

2. 用可重複使用的基礎模型取代單任務策略

下一步是減少需要從頭開始學習的行為量。機器人基礎模型旨在編碼關於物件、語言、運動和操作的可重複使用先驗知識,然後再由開發者針對特定的人形機器人或工作流程進行客製化。

NVIDIA 表示,GR00T 1.7 使用了約 32,000 小時的真實演示和以自我為中心的人類資料進行預訓練,此外還使用了約 8,000 小時的模擬部署和演示資料。開發者隨後可以針對特定的應用場景和任務對基礎模型進行後訓練,而不是從零開始建立策略。

預期品質提升並非只是「機器人知道得更多了」。更有用的結果是泛化能力:當物體位置、視角、背景或任務措詞在合理範圍內發生變化時,策略應該繼續有效。

如果團隊新增物件、場景佈局或指令所需的特定任務再培訓比以前更少,則表示這種方法正在發揮作用。但如果每個新變更仍然需要單獨的策略、精心建構的環境或手動恢復程序,則表示這種方法有問題。

3. 利用模擬技術擴展體驗,避免硬體損壞

實體機器人是成本高的訓練設備。馬達容易過熱,機械手臂容易磨損,電池電量會耗盡,零件容易損壞,一次跌落就可能導致開發停滯數小時甚至數天。模擬技術透過讓策略在硬體測試前並行練習多種變體來解決這些問題。

波士頓動力公司描述瞭如何利用強化學習在模擬環境中訓練Atlas機器人的行為,然後將其部署到真實硬體上,並根據實際結果進行迭代優化。 NVIDIA的GR00T工作流程與此類似,包括模擬設定、遠端操作資料擷取、策略訓練、評估和部署。

關鍵在於「模擬到現實」:將模型在模擬中學習到的知識遷移到實體機器人。仿真固然重要,但它並非現實。摩擦、接觸、感測器雜訊、電纜特性、材料柔順性以及人類行為的不可預測性都難以完美建模。

因此,團隊應將模擬視為一種增強能力的工具,而不是硬體驗證的替代品。一項在模擬中看起來完美無缺,但在實際環境中遇到微小變化就會失效的策略,並不能解決部署問題。

4. 從手臂技能轉向全身智能

當運動和操作功能同時解決時,人形機器人就與固定式機械手臂截然不同了。當人們打開一扇沉重的門時,會自然地轉移重心、改變姿勢、旋轉軀幹並調整抓握方式。人形機器人也必須在保持穩定的同時,協調多個關節的類似動作。

Figure公司於2026年1月發布了Helix 02,稱其係統將視覺、觸覺和本體感覺與全身控制整合到一個統一的視覺運動網絡中。該公司示範了一項自主洗碗任務,該任務結合了行走、平衡和操作,持續數分鐘。雖然這是公司發布的演示,而非獨立的基準測試,但它清晰地展現了發展方向:全身自主控制正在取代以往「導航優先」和「手臂任務其次」的分離模式。

GoogleDeepMind的Gemini Robotics 2同樣強調全身人形機器人的控制,包括從腳到指尖的協調運動。其更廣泛的工程目標並非讓每個機器人像人一樣運動,而是讓機器人選擇穩定、高效的身體運動方式,安全地完成任務。

5. 為冗長、多步驟任務新增推理層

VLA(垂直邏輯陣列)可以處理局部感測器到動作的交互,但執行長時間任務則需要更高層次的推理能力。例如,「清理工作台,將工具放回貼有標籤的抽屜,丟棄包裝,並報告任何損壞情況」。機器人必須識別子任務,追蹤哪些子任務已完成,識別失敗,並在環境與預期不符時更改計劃。

Google DeepMind 在 Gemini Robotics ER 2 中將此角色分開。 ER 2 是一款具身推理模型,旨在實現空間理解、任務規劃、工具協調和成功檢測。該公司描述了一種層級結構,其中高級推理模型可以將運動執行任務交給較低層級的 VLA(虛擬邏輯邏輯架構)。

這種分層設計至關重要,因為高頻運動控制和緩慢、深思熟慮的任務規劃有不同的需求。人形手可能需要快速的控制更新,而規劃者可能只需要在發生重要事件後重新考慮下一個子任務。

對於生產團隊而言,品質測試的關鍵在於系統能否從常見錯誤中復原。一個只有在先前每個步驟都成功的情況下才能執行八個步驟的機器人仍然不夠穩定。而一個更強大的系統能夠察覺到“零件滑落”,重新抓取零件,並在不重置整個任務的情況下繼續執行。

6. 在裝置上推送更多智能

雲端運算推理可以提供大型模型和強大的運算能力,但實體機器人不能總是等待網路往返完成才做出反應。平衡、避障、抓取修正以及許多控制迴路都需要低且可預測的延遲。

這就是為什麼設備端機器人模型和邊緣加速器如此重要。 GoogleDeepMind的Gemini Robotics設備端機器人專案專注於在本地運行通用操作智能,而NVIDIA的人形機器人技術堆疊則支援透過Jetson Thor等邊緣運算平台部署。

有能力的人形機器人的可能架構是混合型的,而不是純粹的本地架構或純粹的雲端架構:在機器人附近進行快速感知和控制,而更繁重的規劃、車隊分析或模型更新則在延遲和連接性允許的情況下,在更強大的基礎設施上運行。

7. 將單一機器人的經驗轉化為群集學習

當技能可以在多個機器人之間重複使用時,具身人工智慧的商業優勢將更加顯著。傳統的自動化通常透過將相同的程序複製到相同的單元來實現規模化。而學習到的人形機器人行為則可以透過分發改進的策略,然後利用群集資料來發現新的故障案例,從而實現規模化。

波士頓動力公司表示,Atlas 機器人學習到的行為模式可以跨多個機器人集群重新部署,並​​且正在開發 Atlas 用於零件排序和物料搬運等工業任務。其 2026 年產品計畫還包括與Google DeepMind 合作開發 Gemini Robotics 基礎模型。請參閱波士頓動力公司Atlas 演進概述及其與Google DeepMind 的合作公告

艦隊學習提出了一個新的要求:評估規格。一項策略更新如果改進了某項任務但卻在其他方面造成了缺陷,那麼在未進行迴歸測試的情況下,不應廣泛部署。

具身人工智慧對人形機器人的影響

舊方法 具身人工智慧方向 需要關注的結果
已修復腳本和座標 閉環視覺和本體感覺控制 物體移動或抓取失敗時的恢復
每個任務一項策略 基礎模型和訓練後 更快適應相關任務
分開行走和操作 全身學習控制 在較長的任務中保持穩定的移動操作
小型實體資料集 真實數據加上仿真和遠端操作 更廣泛地涵蓋邊緣案例
本地任務腳本 層級推理加上VLA執行 具有自修正功能的較長序列
單機器人調諧 跨領域實踐與艦隊學習 跨平台和部署的可重複使用技能

革命仍有局限性

進步是實實在在的,但仍有一些限制容易被低估。

安全比達到既定目標更難。

一款機器人模型即使機器人性能評估得分很高,也可能不適用於安全相關的部署環境。 GoogleDeepMind的Gemini Robotics ER 2模型卡片明確告知用戶,在生產、商業或公共環境中應謹慎使用,並指出該機器人模型不應用於安全攸關的應用,因為故障可能導致人員傷亡或財產損失。

靈巧度仍參差不齊。

搬運箱子遠比操作柔性電纜、潮濕物體、易變形包裝、緊固的緊固件或雜亂的工具組件容易得多。因此,評判演示是否精彩,應該看任務的多樣性和可重複性,而不僅僅是其視覺上的複雜性。

長期可靠性會加劇誤差

即使每個單獨的操作都非常可靠但並非完美無缺,包含數十個甚至數百個依賴操作的任務仍然可能頻繁失敗。這就是為什麼成功檢測、恢復和異常處理與操作本身的準確性同等重要。

硬體仍然是情報問題的一部分

更先進的模型無法無限彌補人手力量不足、感知能力差、致動器過熱、電池壽命有限、機械間隙過大或維護困難等缺陷。人形機器人的實用性取決於軟體和硬體的協同發展。

如何判斷人形系統是否真的在進步

評估具身人工智慧的最佳方法是超越演示質量,探究機器人是否會隨著環境變化而變得更有用。一個實用的自我檢測方法可以包括以下問題:

  • 任務成功:機器人是否完成了整個任務,而不僅僅是最簡單的子步驟?
  • 可重複性:它在多次試驗中是否成功,而不僅僅是在選定的影片中?
  • 泛化能力:它能否處理新的物體位置、光線、視角以及類似的未見物體?
  • 恢復功能:它能否在無需人工重置的情況下檢測並修復常見故障?
  • 教學時間:一項新任務需要多少演示、標註、程式設計或微調?
  • 全身穩定性:在行走、轉身、彎腰或負重時,能否保持穩定流暢的過渡?
  • 延遲:在實際網路和運算條件下,控制迴路是否仍能保持回應?
  • 安全性:是否獨立於任務成功與否來測試人與人之間的距離、碰撞、力、工作空間和緊急停止行為?
  • 叢集轉移:能否將學習到的技能部署到多個機器人上,並使其效能可預測?
  • 營運價值:該系統能否減少干預、停機時間、人體工學負擔或流程複雜性,從而證明其成本的合理性?

如果進展只體現在精心策劃的演示中,而沒有體現在這些措施中,那麼團隊應該改變方法——通常是透過縮小任務範圍、收集更好的故障資料、提高模擬覆蓋率、加強底層控製或添加明確的安全和恢復層。

最重要的變化並非人形外形

具身人工智慧正在革新人形機器人技術,因為它改變了機器人獲取和重複使用技能的方式。關鍵的轉變在於,從對每個動作進行編程,轉變為訓練能夠將感知、語言、生理狀態、推理和行動連接起來,形成一個連續循環的系統。

2026 年最有力的證據並非人形機器人已成為通用機器人,而是先前相互獨立的幾項技術——多模態基礎模型、VLA 策略、強化學習、模擬、靈巧硬體、設備端推理和叢集部署——正在融合為連貫的機器人技術堆疊。

這種融合使得人形機器人更具適應性,也更容易學習,但要達到可靠的自主性,仍需要在機器人實際工作環境中仔細評估。下一代機器人的評判標準將不再是能否進行令人驚嘆的演示,而是能否安全地重複有用的工作,能否從常見的錯誤中恢復,以及能否在無需不斷手動重新編程的情況下不斷改進。

留下評論

矽創新如何驅動下一場工業革命:入門指南

矽創新如何驅動下一場工業革命:入門指南

了解晶片組、先進封裝、人工智慧加速器和碳化矽如何重塑產業——以及如何在不被炒作蒙蔽的情況下評估這些技術。

具身人工智慧如何變革下一代人形機器人

具身人工智慧如何變革下一代人形機器人

了解具身人工智慧、視覺語言動作模型、模擬和全身控制如何使人形機器人更具適應性,以及仍存在的限制。

城市空中交通管制系統將如何安全地管理高空擁堵

城市空中交通管制系統將如何安全地管理高空擁堵

比較集中式空中交通管制、UTM/U空間、走廊和混合交通管理在密集城市空域的適用性,包括安全性、可擴展性、彈性和權衡取捨。

利用數位孿生技術應對全球供應鏈中斷

利用數位孿生技術應對全球供應鏈中斷

了解供應鏈數位孿生如何結合即時數據、模擬和場景測試來提高可視性、韌性和應對突發事件的能力。

建設空中高速公路:空中貨運物流的基礎建設挑戰

建設空中高速公路:空中貨運物流的基礎建設挑戰

從實際角度審視大規模可靠航空貨運所需的空域、地面樞紐、能源、通訊、安全和社區基礎設施。

設計韌性城市中心:面向未來特大城市的綠色基礎設施

設計韌性城市中心:面向未來特大城市的綠色基礎設施

特大城市如何利用綠色基礎設施、城市森林、濕地、綠色屋頂和藍綠走廊來降低熱島效應和洪水風險。

解決UTM難題:人工智慧如何解決低空空域衝突

解決UTM難題:人工智慧如何解決低空空域衝突

了解 UTM 如何結合共享飛行意圖、策略性衝突消除、合規性監控、戰術分離和精心限定的 AI 來管理密集的無人機交通。

腦機介面:神經技術如何重新定義人類能力

腦機介面:神經技術如何重新定義人類能力

探討腦機介面如何恢復溝通和控制,目前的研究究竟能做到什麼,以及未來將面臨的安全和倫理問題。

大規模自主系統:智慧自動化如何重塑現代工廠

大規模自主系統:智慧自動化如何重塑現代工廠

透過一個清晰標註的假設工廠範例,了解工廠如何擴展自主系統,涵蓋機器人、自主移動機器人、人工智慧、數位執行緒、安全性和網路安全等領域。

哪裡可以學習腦機介面工程:9 個強大的學位課程

哪裡可以學習腦機介面工程:9 個強大的學位課程

比較領先的腦機介面、神經工程和神經技術學位課程(從學士到博士),並在申請前了解應該學習哪些內容。