|

【當Physical AI遇上Agentic AI】下一波AI革命:Embodied Agent!

   

Agent 不再只是聊天,而是開始操作真實世界,具身智慧(Embodied Intelligence)正成為 AI 發展的新主戰場。

2023 年以來,大型語言模型(LLM)掀起生成式 AI 浪潮,讓 AI 從搜尋、寫作到程式開發全面改變人機互動模式。2024 年,市場開始聚焦於 Agentic AI,各大科技公司紛紛推出具備自主規劃(Planning)、推理(Reasoning)、工具調用(Tool Use)及工作流程執行能力的 AI Agent,讓 AI 不只是回答問題,而是能完成複雜任務。

然而,Agentic AI 目前多半仍停留在數位世界(Digital World),它能搜尋網頁、操作 API、管理文件、撰寫程式,卻無法真正影響現實世界。

另一方面,隨著 NVIDIA、Google DeepMind、Figure AI、Hugging Face、Physical Intelligence 等企業積極投入Physical AI(具身智慧)的發展與應用,讓 AI 開始具備感知環境、控制機器人、操作工具及執行實體任務的能力。

當 Agentic AI 與 Physical AI 兩條技術路線開始融合,一種新的 AI 架構正在形成──Embodied Agent(具身代理)

未來 AI 的核心競爭,不再只是「誰最會回答問題」,而是「誰能真正完成工作」。

Agentic AI + Physical AI:重新定義 AI 的工作模式

過去的 AI 多半依照固定流程運作。例如:「辨識物件 → 規劃路徑 → 控制手臂 → 執行任務」,每一個步驟都需要獨立演算法。

如今,Agentic AI 的加入,使 AI 能先理解整體任務,再自主拆解步驟,例如:

「請到倉庫找到指定零件,送到第三號工作站。」

AI 會自行規劃:

  • 如何找到物品
  • 是否需要避開障礙物
  • 是否需要重新規劃路徑
  • 若物品不存在如何處理
  • 是否通知其他 Agent 協助

而真正負責控制機器人完成搬運工作的,就是 Physical AI。AI 的能力開始從 Thinking AI(會思考),進一步演變成 Acting AI(會行動)

VLA成為具身智慧的核心模型

目前最受矚目的技術之一,就是 Vision-Language-Action(VLA)。它將:Vision(視覺)、Language(語言)、Action(動作)整合成單一模型。

相較於傳統機器人需要「影像辨識 → 任務規劃 → 運動控制」等多個模組串接,VLA 可直接根據相機畫面與自然語言指令輸出動作,大幅簡化系統架構,也提升泛化能力。

近年代表性 VLA 模型包括:

  • NVIDIA GR00T
  • OpenVLA
  • WorldVLA
  • SmolVLA
  • Hugging Face LeRobot
  • π0(Physical Intelligence)

VLA 被視為 Robot Foundation Model 的重要技術基礎,也象徵機器人控制逐漸從傳統規則式程式設計,轉向大型基礎模型驅動。

》延伸閱讀:開源vs.閉源VLA模型,2026同步推動機器人智慧上身

世界模型(World Model):讓 AI 能先「想像」再行動

即使具備 VLA,AI 若無法預測後果,仍難以安全地在真實環境中工作。因此,「世界模型(World Model)」正成為 Physical AI 的另一項關鍵技術。

世界模型的核心概念,是讓 AI 建立對外部世界的內部表示(Internal Representation),並能模擬不同動作可能造成的結果。簡單來說,AI 不必每次都靠真實操作學習,而是能先在「腦中」完成演練。

例如,當機器人準備搬起一個紙箱時,世界模型會先推測:

  • 箱子是否過重?
  • 是否容易傾倒?
  • 是否會碰撞周圍物體?
  • 是否有更安全的搬運方式?

近年代表性技術包括:

  • NVIDIA Cosmos
  • Google DeepMind Genie
  • Dreamer 系列
  • Meta JEPA

世界模型的重要性,就像人類在行動前會先預想可能結果,因此也有人形容:

Simulation is the new reasoning.(模擬,將成為新的推理。)

》延伸閱讀:讓機器也懂「趨吉避凶」:打造AI內在的世界模型 (World Model)

Robot Foundation Model:打造機器人的「GPT 時刻」

大型語言模型改變了自然語言處理,而 Robot Foundation Model 則希望改變機器人產業。其目標是建立可跨不同任務、不同品牌、不同硬體平台的通用機器人模型。

代表性平台包括:

平台 發展方向
NVIDIA GR00T 通用人形機器人模型
Figure Helix 人形機器人自主操作
OpenVLA 開放式 VLA Foundation Model
Hugging Face LeRobot 開源機器人訓練平台
π0 通用操作(General Manipulation)模型

未來開發流程也可能因此改變。開發者不再從零開始撰寫控制程式,而是下載基礎模型,再依照物流、工廠、餐飲、醫療等不同情境進行微調(Fine-tuning),如同今日開發 LLM 應用一般。

多 Agent 協作:從單機器人走向智慧團隊

另一項快速發展的方向,是 Multi-Agent Robotics。未來工廠可能不是一台機器人完成所有工作,而是多個 Agent 各司其職,共同協作。

例如:

  • 倉儲 Agent 負責盤點
  • 搬運 Agent 負責物流
  • 品檢 Agent 負責檢測
  • 生產 Agent 負責組裝
  • 人類主管則負責最終決策

Agent 彼此共享任務、環境資訊與記憶,形成具有協同能力的 Robot Team。

隨著 MCP(Model Context Protocol)、A2A(Agent-to-Agent)等通訊協定逐漸成熟,未來跨機器人、跨雲端、跨企業的 Agent 協作將更加普遍。

Sim2Real:真實世界資料不足,模擬成為最佳老師

相較於 LLM 擁有數兆 Token 可供訓練,機器人最大的限制在於缺乏高品質操作資料。因此,大量學習必須先在模擬環境完成,再部署至真實世界,也就是 Sim2Real(Simulation to Reality)。

目前主要平台包括:

  • NVIDIA Isaac Sim
  • MuJoCo
  • Genesis
  • NVIDIA Omniverse
  • Cosmos World Foundation Models

透過 Digital Twin(數位分身)技術,AI 可先在虛擬工廠、倉庫或家庭環境中反覆學習,再部署至實體設備,大幅降低成本與風險。

Physical AI × Agentic AI 的代表性技術版圖

技術領域 代表性技術或平台 主要功能
Agent Framework OpenAI Agents SDK、Google ADK、AutoGen、CrewAI 任務規劃、工具調用、自主決策
Agent 通訊 MCP、A2A、ANP Agent 與 Agent 間協作
Vision-Language-Action GR00T、OpenVLA、WorldVLA、SmolVLA 感知與動作整合
World Model Cosmos、Genie、Dreamer、JEPA 環境預測、模擬推演
Robot Foundation Model GR00T、Helix、LeRobot、π0 通用機器人技能
Simulation Isaac Sim、Genesis、MuJoCo Sim2Real 訓練
Edge AI Runtime TensorRT、CUDA、OpenVINO、ExecuTorch 邊緣推論與部署

五大挑戰仍待突破

雖然技術快速成熟,但 Physical AI 與 Agentic AI 的融合仍面臨不少瓶頸。

1. 長鏈任務(Long-Horizon Tasks):

真實工作往往需要數十個甚至上百個連續步驟,只要其中一步失敗,整體任務便可能中斷,因此長時間規劃、錯誤恢復與動態重規劃仍是研究重點。

2. 高品質機器人資料不足:

相較於文字資料,機器人操作資料昂貴且難以取得,促使模擬環境、遙操作(Teleoperation)、合成資料與 Robot Fleet Learning 成為重要補充來源。

3. 泛化能力不足:

AI 今天學會拿馬克杯,明天面對玻璃杯、紙杯、保溫杯時是否仍能成功完成任務,仍考驗模型的跨場景適應能力。

4. 安全與可信賴性:

LLM 回答錯誤可能只是資訊不精確,但機器人若判斷失誤,可能造成設備損壞甚至人身安全問題,因此安全規劃、風險評估、人機協作與即時監控將成為商業化部署的必要條件。

5. 邊緣端算力限制:

Agent 需要同時完成推理、規劃、感知與控制,而邊緣裝置的算力與功耗仍有限,因此模型量化、混合式推論、小型語言模型(SLM)、Mixture of Experts(MoE)及異質運算架構,將是未來 Edge AI 發展的重要方向。

結語

如果說生成式 AI 解決的是「知識生產」,那麼 Physical AI 與 Agentic AI 的融合,則試圖解決「工作執行」。

未來的 AI 不只是回答問題,也不只是呼叫工具,而是能理解任務、規劃流程、預測風險、控制設備,最終在真實世界完成工作。這代表 AI 正從數位世界邁向物理世界,從軟體代理(Software Agent)進化為具備感知、推理與行動能力的 Embodied Agent。

可以預見,未來三到五年,競爭焦點將不再只是「誰擁有更大的模型」,而是「誰能整合 Agent、世界模型、VLA、Robot Foundation Model、Sim2Real 與 Edge AI 運算平台,建立完整的 Physical AI 生態系」。

(責任編輯:歐敏銓)

MakerPro

訂閱MakerPRO知識充電報

與40000位開發者一同掌握科技創新的技術資訊!

Author: MakerPro

MakerPRO為華人圈最專注於Edge AI開發者社群最新技術趨勢、解決方案評測及產業動態報導的專業媒體,在華文科技媒體領域具有重要的影響力。

Share This Post On

Submit a Comment

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *