|

從NVIDIA Cosmos認識世界基礎模型WFM

   

當大型語言模型(LLM)讓 AI 學會了人類的文字與語言,AI 的下一步是什麼?答案是物理 AI(Physical AI)與具身智能(Embodied AI)—— 讓 AI 走出數位世界,具備理解真實物理規律、適應三維空間並與實體環境互動的能力。

然而,訓練能夠在真實世界安全運行的機器人或自動駕駛系統,長期面臨著數據採集成本高昂、極端狀況(Edge Cases)難以重現,以及虛擬模擬與真實世界存在落差(Sim2Real Gap)等巨大挑戰。為了破解這一難題,全球先進AI研發單位正致力於開發世界基礎模型(World Foundation Model, WFM),其中又以NVIDIA 推出的開放式平台 —— NVIDIA Cosmos最接地氣,本文且來做一剖析介紹。

什麼是 NVIDIA Cosmos?

NVIDIA Cosmos 是專為具身智能、機器人與自動駕駛打造的開放式世界模型。如果說大型語言模型(LLM)學會了人類的「文字與語言」,那麼 Cosmos 這類世界模型學習的就是「物理世界的規律與時空動態」。

它的主要使命是解決自動駕駛、機器人和工業自動化在開發過程中真實世界數據不足、測試成本高昂且具危險性的痛點。它能模擬真實物理法則,協助 AI 進行「預測、推理與生成模擬」。

1.預測未來狀態(World Predictor / Video2World)

給定當前畫面與動作指令,Cosmos 能預測並生成符合物理規律的下一步影像。例如:機器人推倒杯子後水會如何流散、車利急煞時周圍車輛的動態。

2.多模態物理推理(Visual Reasoner)

結合視覺與語言理解,讓 AI 代理(AI Agent)具備時空感官,能理解周遭環境中的物件關係、潛在風險與操作意圖。

3.高品質合成數據生成(Synthetic Data Generation)

能夠生成極其逼真且符合真實物理限制的多視角影片與感測器數據,補足邊緣極端狀況(Edge Cases)數據(如極端天氣、突發車禍等)。

它不只是一套影片生成工具,而是能夠理解物理法則、空間幾何與時空動態的底層架構。藉由預測「給定當前狀態與動作後,未來物理世界會如何變化」,Cosmos 讓 AI 代理(AI Agent)能夠在進入真實世界前,先在虛擬環境中進行深刻的物理推理與預測。

主要應用場景

領域 Cosmos 扮演的角色
人形與服務機器人 作為「世界行動模型(WAM)」的骨幹,讓機器人在虛擬模擬環境(如 Isaac Sim)中先試錯、學習策略,再部署至實體。
自動駕駛(AV) 模擬各種複雜路況、不同天氣光照與突發事件,構建封閉迴圈的端到端模擬測試平台。
智慧工廠與工業 AI 與 NVIDIA Omniverse 數位雙生結合,分析工廠即時攝影機串流,提供安全警示與物流流程優化。

核心技術架構與功能亮點

Cosmos 的技術架構融合了生成式 AI 的最新突破與嚴格的物理約束,主要包含四大亮點:

1.雙引擎 Transformer 架構:

結合擅長長時序動態預測的自迴歸模型(Autoregressive, AR)與擅長高保真細節生成的擴散模型(Diffusion Models)。最新的 Cosmos 3 更採用 Mixture-of-Transformers 架構,實現推理與運算的並行處理。

2.因果視訊標記器(Causal Video Tokenizer):

在 Latent 空間進行高倍率壓縮的同時,嚴格遵守「當前計算不依賴未來資訊」的因果法則,完美貼合真實世界的即時決策需求。

3.多模態幾何約束控制(Conditioned Control):

支援文字、圖片、鏡頭軌跡(Camera Trajectory)與動作指令輸入。更重要的是,它能吃進模擬器輸出的深度圖(Depth)、語意分割圖(Segmentation)等幾何特徵,確保生成的畫面絕不脫離真實空間幾何。

4.完整工具鏈生態:

提供 GPU 加速的數據過濾工具 Cosmos Curator、模型評估器 Cosmos Evaluator,以及確保輸出符合物理安全常理的*Cosmos Guardrail 防護網。

打通 Sim2Real:Cosmos 與 Omniverse、Isaac Sim 的黃金三角

在 NVIDIA 的物理 AI 生態系中,Omniverse、Isaac Sim 與 Cosmos 構成了密不可分的開發三要素:

透過這套管線,開發者能在 Isaac Sim 中提取粗糙但精確的幾何骨架,再由 Cosmos 生成具備真實光影折射、天氣變化與豐富材質的高保真影片。這不僅提供了自動化標註(Ground Truth)的合成數據(SDG),更讓機器人在「數位雙生」環境中歷練相當於數百年的試錯,大幅填補了 Sim2Real 的鴻溝。

在訓練人形機器人抓取玻璃杯的互補場景中,整體流程展現了極高的協同效應。首先,工程師會在 Omniverse 中建構出精確的廚房 3D 數位雙生場景,定義好桌子與牆壁等幾何材質與 USD 數據。接著,機器人手臂於 Isaac Sim 中利用 PhysX 引擎進行幾何碰撞計算與運動學模擬,展開抓取杯子的動作嘗試。

為了打破虛擬與現實的藩籬,Cosmos 為此過程賦予了極致的真實感與無限變體。Isaac Sim 產生的深度圖與邊緣圖會傳送給 Cosmos,由其生成帶有真實玻璃折射、光線反射乃至水滴遺留的高保真影片數據;同時,Cosmos 還能預測杯子滑落碎裂或水流散開等動態,並進一步擴增出磨砂玻璃、不鏽鋼杯等不同材質與極端情境,藉此大幅強化機器人的視覺政策。

最終,機器人的感知模型從中掌握了真實世界的視覺特徵,其動作政策也在 Isaac Sim 與 Cosmos 共同產生的合成數據中順利完成訓練,讓無縫部署至實體機器人成為可能。

Cosmos 如何跨越 Sim2Real 鴻溝?

Sim2Real 鴻溝主要包含 「視覺鴻溝(Visual Gap)」 與 「物理鴻溝(Physics Gap)」,Cosmos 針對這兩者提供了精準的解決方案。

在填補視覺鴻溝方面,Cosmos 展示了極為優異的領域泛化能力。當機器人於虛擬環境中練習物件抓取時,Cosmos 能一舉生成包含雜亂背景、鏡面反光與複雜陰影等數千種具備真實風格的視覺場景;透過讓 AI 深度適應這些由系統產生的無數擬真變體,機器人得以學會主動忽略無關緊要的視覺細節,即便日後部署至真實房間,也不會因為牆壁顏色更換或地毯花紋差異而失去方向感。

作為世界行動模型(WAM),Cosmos 同樣大幅縮小了虛擬與現實之間的物理鴻溝。不同於一般影片生成 AI,Cosmos 在訓練階段便注入了真實物理數據,因而能深刻理解重力、碰撞以及流體與剛體的動態變化;在封閉迴圈模擬機制下,當機器人發出如「向前推推車」等動作指令時,Cosmos 能即時預測推車受力後的下一個幾何與動態狀態,使機器人的控制策略可以在這個預測出的物理未來中持續進行強化學習。

此外,Cosmos 能與 Isaac Lab 及 GR00T 進行無縫整合。透過 Isaac Lab 利用 GPU 加速進行大規模平行強化學習,系統能在短短數秒之內模擬數萬隻機器人的動作訓練;同時,結合 GR00T 與 MimicGen 的手勢與軌跡遷移技術,Cosmos 可以將少量的人類遙控(TeleOp)或示範數據,大規模擴展為數萬小時符合真實物理情境的訓練示範。

Cosmos與傳統方式的比較總結如下:

解決方案 傳統方式 NVIDIA Cosmos 模式
數據來源 手動實地拍攝與標註,耗時且危險 Cosmos 生成符合物理法則的高擬真合成影片
極端狀況 難以在真實世界重現與測試 透過 Prompt 快速擴增千種極端環境與氣候
Sim2Real 轉移 虛擬到現實訓練誤差大,需要大量實體微調 幾何約束 + 多模態生成,確保運動軌跡與真實感官一致

市場定位與同類技術比較

Cosmos 與市場上其他模型的定位比較如下:

模型 / 平台 開放程度 核心特點與差異
NVIDIA Cosmos 開源權重 物理精確度高,深層整合 Omniverse 與 GPU 算力生態,專為工業/機器人數據擴增打造。
Meta V-JEPA 2 開源權重 著重於非生成式的抽象特徵預測,計算速度極快,但不直接輸出擬真影像。
World Labs Marble 閉源 由李飛飛團隊打造,專注於生成強幾何一致性的 3D 空間世界。
Google Genie 3 閉源 強調即時互動性與 Reinforcement Learning Agent 的模擬訓練。
Sora / Runway 閉源 影視級視覺導向生成,缺乏精確的相機軌跡控制與微小物理作用力約束。

結語

NVIDIA Cosmos 的推出,標誌著 AI 訓練從「海量網路圖文數據」正式跨入「物理規律合成數據」的新紀元。透過開放源碼與多種規格(包含適合雲端運算的 Super、輕量化的 Nano 以及邊緣端推論的 Edge),NVIDIA 正大幅降低建構具身智能系統的門檻。

目前 Cosmos 模型權重已於 Hugging Face 開放申請,主專案與工具鏈亦已上架 GitHub。開發者可透過標準的 PyTorch 與 Diffusers 庫快速體驗 Video2World 的物理生成魅力,邁出進入物理 AI 世界的第一步。

平台資源名稱 連結 / 說明 詳細介紹
GitHub 主專案 nvidia/cosmos 主代碼庫,包含模型推理、鏈接與快速範例。
GitHub 指南 Cosmos Cookbook 官方手冊,涵蓋 Predict、Transfer 與 Reason 等實作腳本。
Hugging Face nvidia/Cosmos 系列 存放模型的開源權重與 Diffusers 集成。

》延伸閱讀:

下載 Cosmos 3: Omnimodal World Models for Physical AI白皮書

NVIDIA Blog: How Cosmos 3 Helps Physical AI Think Before It Acts

owenou

訂閱MakerPRO知識充電報

與40000位開發者一同掌握科技創新的技術資訊!

Author: owenou

歐敏銓(Owen)曾投身IT、電子科技媒體報導十多年,因認同Maker運動的創新實作精神,創立MakerPRO社群媒體平台,致力結合媒體、產業與PRO Maker、開發者的社群力量,共同推展科技創造力。

Share This Post On

Submit a Comment

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *