Agent 不再只是聊天,而是開始操作真實世界,具身智慧(Embodied Intelligence)正成為 AI 發展的新主戰場。
2023 年以來,大型語言模型(LLM)掀起生成式 AI 浪潮,讓 AI 從搜尋、寫作到程式開發全面改變人機互動模式。2024 年,市場開始聚焦於 Agentic AI,各大科技公司紛紛推出具備自主規劃(Planning)、推理(Reasoning)、工具調用(Tool Use)及工作流程執行能力的 AI Agent,讓 AI 不只是回答問題,而是能完成複雜任務。
然而,Agentic AI 目前多半仍停留在數位世界(Digital World),它能搜尋網頁、操作 API、管理文件、撰寫程式,卻無法真正影響現實世界。
另一方面,隨著 NVIDIA、Google DeepMind、Figure AI、Hugging Face、Physical Intelligence 等企業積極投入Physical AI(具身智慧)的發展與應用,讓 AI 開始具備感知環境、控制機器人、操作工具及執行實體任務的能力。
當 Agentic AI 與 Physical AI 兩條技術路線開始融合,一種新的 AI 架構正在形成──Embodied Agent(具身代理)。
未來 AI 的核心競爭,不再只是「誰最會回答問題」,而是「誰能真正完成工作」。
Agentic AI + Physical AI:重新定義 AI 的工作模式
過去的 AI 多半依照固定流程運作。例如:「辨識物件 → 規劃路徑 → 控制手臂 → 執行任務」,每一個步驟都需要獨立演算法。
如今,Agentic AI 的加入,使 AI 能先理解整體任務,再自主拆解步驟,例如:
「請到倉庫找到指定零件,送到第三號工作站。」
AI 會自行規劃:
- 如何找到物品
- 是否需要避開障礙物
- 是否需要重新規劃路徑
- 若物品不存在如何處理
- 是否通知其他 Agent 協助
而真正負責控制機器人完成搬運工作的,就是 Physical AI。AI 的能力開始從 Thinking AI(會思考),進一步演變成 Acting AI(會行動)。
VLA成為具身智慧的核心模型
目前最受矚目的技術之一,就是 Vision-Language-Action(VLA)。它將:Vision(視覺)、Language(語言)、Action(動作)整合成單一模型。
相較於傳統機器人需要「影像辨識 → 任務規劃 → 運動控制」等多個模組串接,VLA 可直接根據相機畫面與自然語言指令輸出動作,大幅簡化系統架構,也提升泛化能力。
近年代表性 VLA 模型包括:
- NVIDIA GR00T
- OpenVLA
- WorldVLA
- SmolVLA
- Hugging Face LeRobot
- π0(Physical Intelligence)
VLA 被視為 Robot Foundation Model 的重要技術基礎,也象徵機器人控制逐漸從傳統規則式程式設計,轉向大型基礎模型驅動。
》延伸閱讀:開源vs.閉源VLA模型,2026同步推動機器人智慧上身
世界模型(World Model):讓 AI 能先「想像」再行動
即使具備 VLA,AI 若無法預測後果,仍難以安全地在真實環境中工作。因此,「世界模型(World Model)」正成為 Physical AI 的另一項關鍵技術。
世界模型的核心概念,是讓 AI 建立對外部世界的內部表示(Internal Representation),並能模擬不同動作可能造成的結果。簡單來說,AI 不必每次都靠真實操作學習,而是能先在「腦中」完成演練。
例如,當機器人準備搬起一個紙箱時,世界模型會先推測:
- 箱子是否過重?
- 是否容易傾倒?
- 是否會碰撞周圍物體?
- 是否有更安全的搬運方式?
近年代表性技術包括:
- NVIDIA Cosmos
- Google DeepMind Genie
- Dreamer 系列
- Meta JEPA
世界模型的重要性,就像人類在行動前會先預想可能結果,因此也有人形容:
Simulation is the new reasoning.(模擬,將成為新的推理。)
》延伸閱讀:讓機器也懂「趨吉避凶」:打造AI內在的世界模型 (World Model)
Robot Foundation Model:打造機器人的「GPT 時刻」
大型語言模型改變了自然語言處理,而 Robot Foundation Model 則希望改變機器人產業。其目標是建立可跨不同任務、不同品牌、不同硬體平台的通用機器人模型。
代表性平台包括:
| 平台 | 發展方向 |
|---|---|
| NVIDIA GR00T | 通用人形機器人模型 |
| Figure Helix | 人形機器人自主操作 |
| OpenVLA | 開放式 VLA Foundation Model |
| Hugging Face LeRobot | 開源機器人訓練平台 |
| π0 | 通用操作(General Manipulation)模型 |
未來開發流程也可能因此改變。開發者不再從零開始撰寫控制程式,而是下載基礎模型,再依照物流、工廠、餐飲、醫療等不同情境進行微調(Fine-tuning),如同今日開發 LLM 應用一般。
多 Agent 協作:從單機器人走向智慧團隊
另一項快速發展的方向,是 Multi-Agent Robotics。未來工廠可能不是一台機器人完成所有工作,而是多個 Agent 各司其職,共同協作。
例如:
- 倉儲 Agent 負責盤點
- 搬運 Agent 負責物流
- 品檢 Agent 負責檢測
- 生產 Agent 負責組裝
- 人類主管則負責最終決策
Agent 彼此共享任務、環境資訊與記憶,形成具有協同能力的 Robot Team。
隨著 MCP(Model Context Protocol)、A2A(Agent-to-Agent)等通訊協定逐漸成熟,未來跨機器人、跨雲端、跨企業的 Agent 協作將更加普遍。
Sim2Real:真實世界資料不足,模擬成為最佳老師
相較於 LLM 擁有數兆 Token 可供訓練,機器人最大的限制在於缺乏高品質操作資料。因此,大量學習必須先在模擬環境完成,再部署至真實世界,也就是 Sim2Real(Simulation to Reality)。
目前主要平台包括:
- NVIDIA Isaac Sim
- MuJoCo
- Genesis
- NVIDIA Omniverse
- Cosmos World Foundation Models
透過 Digital Twin(數位分身)技術,AI 可先在虛擬工廠、倉庫或家庭環境中反覆學習,再部署至實體設備,大幅降低成本與風險。
Physical AI × Agentic AI 的代表性技術版圖
| 技術領域 | 代表性技術或平台 | 主要功能 |
|---|---|---|
| Agent Framework | OpenAI Agents SDK、Google ADK、AutoGen、CrewAI | 任務規劃、工具調用、自主決策 |
| Agent 通訊 | MCP、A2A、ANP | Agent 與 Agent 間協作 |
| Vision-Language-Action | GR00T、OpenVLA、WorldVLA、SmolVLA | 感知與動作整合 |
| World Model | Cosmos、Genie、Dreamer、JEPA | 環境預測、模擬推演 |
| Robot Foundation Model | GR00T、Helix、LeRobot、π0 | 通用機器人技能 |
| Simulation | Isaac Sim、Genesis、MuJoCo | Sim2Real 訓練 |
| Edge AI Runtime | TensorRT、CUDA、OpenVINO、ExecuTorch | 邊緣推論與部署 |
五大挑戰仍待突破
雖然技術快速成熟,但 Physical AI 與 Agentic AI 的融合仍面臨不少瓶頸。
1. 長鏈任務(Long-Horizon Tasks):
真實工作往往需要數十個甚至上百個連續步驟,只要其中一步失敗,整體任務便可能中斷,因此長時間規劃、錯誤恢復與動態重規劃仍是研究重點。
2. 高品質機器人資料不足:
相較於文字資料,機器人操作資料昂貴且難以取得,促使模擬環境、遙操作(Teleoperation)、合成資料與 Robot Fleet Learning 成為重要補充來源。
3. 泛化能力不足:
AI 今天學會拿馬克杯,明天面對玻璃杯、紙杯、保溫杯時是否仍能成功完成任務,仍考驗模型的跨場景適應能力。
4. 安全與可信賴性:
LLM 回答錯誤可能只是資訊不精確,但機器人若判斷失誤,可能造成設備損壞甚至人身安全問題,因此安全規劃、風險評估、人機協作與即時監控將成為商業化部署的必要條件。
5. 邊緣端算力限制:
Agent 需要同時完成推理、規劃、感知與控制,而邊緣裝置的算力與功耗仍有限,因此模型量化、混合式推論、小型語言模型(SLM)、Mixture of Experts(MoE)及異質運算架構,將是未來 Edge AI 發展的重要方向。
結語
如果說生成式 AI 解決的是「知識生產」,那麼 Physical AI 與 Agentic AI 的融合,則試圖解決「工作執行」。
未來的 AI 不只是回答問題,也不只是呼叫工具,而是能理解任務、規劃流程、預測風險、控制設備,最終在真實世界完成工作。這代表 AI 正從數位世界邁向物理世界,從軟體代理(Software Agent)進化為具備感知、推理與行動能力的 Embodied Agent。
可以預見,未來三到五年,競爭焦點將不再只是「誰擁有更大的模型」,而是「誰能整合 Agent、世界模型、VLA、Robot Foundation Model、Sim2Real 與 Edge AI 運算平台,建立完整的 Physical AI 生態系」。
(責任編輯:歐敏銓)
- 【當Physical AI遇上Agentic AI】下一波AI革命:Embodied Agent! - 2026/07/28
- 迎戰超高齡社會 以科技力量建構共好共融新願景 - 2026/07/27
- 【Podcast】人形機器人的最後一哩路:走上手術台的 AI 醫療革命 - 2026/07/23
訂閱MakerPRO知識充電報
與40000位開發者一同掌握科技創新的技術資訊!




