常青指南P1 常青技術頁Google DeepMind、NVIDIA 與官方技術文件 + 編輯室技術判斷

VLA 是什麼?AI 如何從看懂指令走到機器人動作?

VLA 把視覺、語言與動作放進同一個模型脈絡。本文拆解 VLA、VLM、LLM 的差別、硬體需求、用途與安全邊界。

直接答案

VLA 是 Vision-Language-Action model,輸入可包含影像、語言與機器狀態,輸出則是動作或動作序列。它讓機器人不只辨識畫面或回答問題,而能把指令轉成抓取、移動、操作工具等行為。VLA 仍不是完整機器人系統,也不能取代感測器、運動控制、碰撞限制、急停與人工接管。

本文重點

  • LLM 主要處理語言,VLM 連接視覺與語言,VLA 再把結果連到動作。
  • VLA 輸出可能是高階技能、軌跡片段或控制相關命令,實作方式不只一種。
  • 模型需要看見機器本身的狀態與環境,而不只是使用者指令。
  • 裝置端 VLA 可降低網路延遲並支援斷網,但模型、記憶體與功耗會受到限制。
  • VLA 必須和低階控制、安全機制、評估與人工接管組合。

直接答案:VLA 把看懂和行動接起來

VLA 是 Vision-Language-Action model,中文常寫成視覺-語言-動作模型。它接收的資訊可能包括相機畫面、文字或語音指令、機器關節狀態和歷史動作,再輸出下一步動作、動作序列或可交給控制器執行的表示。

Google DeepMind 對 Gemini Robotics 的描述是把視覺資訊和指令轉成 motor commands;NVIDIA GR00T 則把 VLA 放進資料、模擬、訓練、部署與機器人平台的完整流程。兩者都提醒一件事:VLA 是模型層,不是全部機器人系統。

LLM、VLM、VLA 怎麼分?

模型類型常見輸入常見輸出主要用途物理風險
LLM文字、程式碼、工具結果文字、程式碼、工具呼叫問答、摘要、規劃、agent通常間接
VLM影像、影片、文字描述、答案、位置或高階判斷場景理解、視覺問答、檢查若只輸出資訊,通常間接
VLA影像、語言、機器狀態與歷史動作動作 token、技能、姿態、軌跡或控制相關命令抓取、移動、操作工具與多步任務會直接影響真實設備

同一個機器人可能同時使用三種模型:LLM 負責長期任務規劃,VLM 理解場景,VLA 產生動作,而傳統控制器負責穩定執行。

VLA 怎麼把指令變成動作?

一個簡化流程是:

  1. 相機看到桌面、物件與機械手臂位置。
  2. 使用者說「把紅色盒子放進左邊籃子」。
  3. 模型把語言、畫面和機器狀態放在同一個上下文。
  4. VLA 產生抓取、移動或一連串動作表示。
  5. 運動控制器把高階動作轉成符合機械限制的軌跡。
  6. 安全層檢查速度、範圍、碰撞、人員與急停狀態。
  7. 馬達執行,感測器重新回饋,模型或控制器再修正。

真正系統可能更複雜,但重點是 VLA 前後都有其他層,不是模型一輸出就直接讓馬達無限制動作。

VLA 為什麼受到關注?

傳統機器人常為特定任務寫固定流程。環境、物件或步驟改變後,可能要重新程式設計。VLA 希望利用大規模視覺、語言和動作資料,讓模型能:

  • 理解自然語言指令。
  • 把新任務拆成多個步驟。
  • 在不同物件、位置和背景下泛化。
  • 根據新的感測資訊調整動作。
  • 用少量示範適應新任務。

但「可以泛化」不等於「所有場景都可靠」。不同機器結構、夾具、負載、光線與安全要求仍需要測試。

訓練 VLA 需要什麼資料?

常見資料包括:

  • 相機、深度或其他感測器資料。
  • 使用者指令與任務描述。
  • 關節、位置、速度、力道和夾具狀態。
  • 遙操作或人工示範的動作軌跡。
  • 任務成功、失敗、介入與回復紀錄。
  • 模擬產生的變化和失敗案例。

NVIDIA 的 sim-to-real 教學以相機、語言命令、關節回饋和馬達位置示範一條 VLA 工作流,也強調模擬與真實環境仍有差距。

裝置端 VLA 有什麼價值?

把 VLA 放在機器或場域端,可能帶來:

  • 減少網路往返延遲。
  • 在不穩定或無網路環境維持基本能力。
  • 讓敏感影像與場域資料留在本地。
  • 降低每次動作都依賴雲端服務的風險。

代價是模型要配合有限算力、記憶體、功耗和散熱。Google DeepMind 的 Gemini Robotics On-Device 正是這類方向,但官方也把它定位為特定機器人模型與開發者計畫,不能直接推論所有設備都能執行。

VLA 為什麼不能取代安全控制?

生成式模型可能遇到看錯、聽錯、超時、分布外情境或不合理規劃。即使模型平均表現很好,真實設備仍要處理最差情況。

因此需要:

  • 動作範圍、速度、負載和碰撞限制。
  • 獨立的急停、安全區與人員偵測。
  • 模型超時或感測器失效時的受控降級。
  • 人工接管與回安全位置。
  • 模型、控制軟體與設備版本記錄。
  • 上線前的代表性、邊界與對抗測試。

Google DeepMind 也把 VLA 與低階安全機制組合,並明確說研究功能不等於保證安全等級。

評估 VLA 不要只看 Demo

至少要問:

  1. 測試涵蓋哪些物件、背景、光線與機器結構?
  2. 成功率如何定義?失敗和人工介入有沒有算進去?
  3. 最差延遲和控制週期是多少?
  4. 遇到沒看過的情境會拒絕、停止還是繼續猜?
  5. 模型輸出到馬達中間有哪些限制與安全層?
  6. 需要多少示範、模擬與真實資料才能適應新任務?
  7. 模型更新後如何回歸測試與快速回復?

最後記住:

VLA 讓 AI 從「看懂」往「做到」跨一步;真正能上線,還要把模型、控制、安全與維運接成完整系統。

常見問題

VLA 和 VLM 差在哪?

VLM 主要把影像與語言連起來,可描述、問答或理解場景;VLA 進一步把場景與指令轉成動作或動作序列。

VLA 是機器人的大腦嗎?

可以作為高階能力的一部分,但完整機器人還需要感測器、定位、控制器、致動器、安全機制、作業系統、電力與維運。把 VLA 單獨稱為完整大腦容易誤導。

VLA 可以直接輸出馬達命令嗎?

不同架構做法不同。有些輸出動作 token、姿態或軌跡,再交給控制器;即使模型輸出接近低階命令,也必須受機械限制與安全層約束。

VLA 一定要連網嗎?

不一定。Google DeepMind 已公布裝置端 Gemini Robotics 模型,強調低延遲與不穩定網路環境;但裝置端模型仍受算力、記憶體、功耗與支援硬體限制。

VLA 訓練只需要影片嗎?

通常不夠。除了影像,還需要語言或任務標註、機器狀態、動作軌跡、成功失敗結果與不同環境資料;模擬和遙操作常用來補資料。

來源與查證

  1. Google DeepMind:Gemini Robotics
  2. Google DeepMind:Gemini Robotics On-Device
  3. Google DeepMind:Responsibly advancing AI and robotics
  4. NVIDIA Developer:Isaac GR00T
  5. NVIDIA:Train an SO-101 Robot From Sim-to-Real
  6. NVIDIA:Physical AI Learning

下一步閱讀