本文重點
- LLM 主要處理語言,VLM 連接視覺與語言,VLA 再把結果連到動作。
- VLA 輸出可能是高階技能、軌跡片段或控制相關命令,實作方式不只一種。
- 模型需要看見機器本身的狀態與環境,而不只是使用者指令。
- 裝置端 VLA 可降低網路延遲並支援斷網,但模型、記憶體與功耗會受到限制。
- VLA 必須和低階控制、安全機制、評估與人工接管組合。
直接答案:VLA 把看懂和行動接起來
VLA 是 Vision-Language-Action model,中文常寫成視覺-語言-動作模型。它接收的資訊可能包括相機畫面、文字或語音指令、機器關節狀態和歷史動作,再輸出下一步動作、動作序列或可交給控制器執行的表示。
Google DeepMind 對 Gemini Robotics 的描述是把視覺資訊和指令轉成 motor commands;NVIDIA GR00T 則把 VLA 放進資料、模擬、訓練、部署與機器人平台的完整流程。兩者都提醒一件事:VLA 是模型層,不是全部機器人系統。
LLM、VLM、VLA 怎麼分?
| 模型類型 | 常見輸入 | 常見輸出 | 主要用途 | 物理風險 |
|---|---|---|---|---|
| LLM | 文字、程式碼、工具結果 | 文字、程式碼、工具呼叫 | 問答、摘要、規劃、agent | 通常間接 |
| VLM | 影像、影片、文字 | 描述、答案、位置或高階判斷 | 場景理解、視覺問答、檢查 | 若只輸出資訊,通常間接 |
| VLA | 影像、語言、機器狀態與歷史動作 | 動作 token、技能、姿態、軌跡或控制相關命令 | 抓取、移動、操作工具與多步任務 | 會直接影響真實設備 |
同一個機器人可能同時使用三種模型:LLM 負責長期任務規劃,VLM 理解場景,VLA 產生動作,而傳統控制器負責穩定執行。
VLA 怎麼把指令變成動作?
一個簡化流程是:
- 相機看到桌面、物件與機械手臂位置。
- 使用者說「把紅色盒子放進左邊籃子」。
- 模型把語言、畫面和機器狀態放在同一個上下文。
- VLA 產生抓取、移動或一連串動作表示。
- 運動控制器把高階動作轉成符合機械限制的軌跡。
- 安全層檢查速度、範圍、碰撞、人員與急停狀態。
- 馬達執行,感測器重新回饋,模型或控制器再修正。
真正系統可能更複雜,但重點是 VLA 前後都有其他層,不是模型一輸出就直接讓馬達無限制動作。
VLA 為什麼受到關注?
傳統機器人常為特定任務寫固定流程。環境、物件或步驟改變後,可能要重新程式設計。VLA 希望利用大規模視覺、語言和動作資料,讓模型能:
- 理解自然語言指令。
- 把新任務拆成多個步驟。
- 在不同物件、位置和背景下泛化。
- 根據新的感測資訊調整動作。
- 用少量示範適應新任務。
但「可以泛化」不等於「所有場景都可靠」。不同機器結構、夾具、負載、光線與安全要求仍需要測試。
訓練 VLA 需要什麼資料?
常見資料包括:
- 相機、深度或其他感測器資料。
- 使用者指令與任務描述。
- 關節、位置、速度、力道和夾具狀態。
- 遙操作或人工示範的動作軌跡。
- 任務成功、失敗、介入與回復紀錄。
- 模擬產生的變化和失敗案例。
NVIDIA 的 sim-to-real 教學以相機、語言命令、關節回饋和馬達位置示範一條 VLA 工作流,也強調模擬與真實環境仍有差距。
裝置端 VLA 有什麼價值?
把 VLA 放在機器或場域端,可能帶來:
- 減少網路往返延遲。
- 在不穩定或無網路環境維持基本能力。
- 讓敏感影像與場域資料留在本地。
- 降低每次動作都依賴雲端服務的風險。
代價是模型要配合有限算力、記憶體、功耗和散熱。Google DeepMind 的 Gemini Robotics On-Device 正是這類方向,但官方也把它定位為特定機器人模型與開發者計畫,不能直接推論所有設備都能執行。
VLA 為什麼不能取代安全控制?
生成式模型可能遇到看錯、聽錯、超時、分布外情境或不合理規劃。即使模型平均表現很好,真實設備仍要處理最差情況。
因此需要:
- 動作範圍、速度、負載和碰撞限制。
- 獨立的急停、安全區與人員偵測。
- 模型超時或感測器失效時的受控降級。
- 人工接管與回安全位置。
- 模型、控制軟體與設備版本記錄。
- 上線前的代表性、邊界與對抗測試。
Google DeepMind 也把 VLA 與低階安全機制組合,並明確說研究功能不等於保證安全等級。
評估 VLA 不要只看 Demo
至少要問:
- 測試涵蓋哪些物件、背景、光線與機器結構?
- 成功率如何定義?失敗和人工介入有沒有算進去?
- 最差延遲和控制週期是多少?
- 遇到沒看過的情境會拒絕、停止還是繼續猜?
- 模型輸出到馬達中間有哪些限制與安全層?
- 需要多少示範、模擬與真實資料才能適應新任務?
- 模型更新後如何回歸測試與快速回復?
最後記住:
VLA 讓 AI 從「看懂」往「做到」跨一步;真正能上線,還要把模型、控制、安全與維運接成完整系統。
常見問題
VLA 和 VLM 差在哪?
VLM 主要把影像與語言連起來,可描述、問答或理解場景;VLA 進一步把場景與指令轉成動作或動作序列。
VLA 是機器人的大腦嗎?
可以作為高階能力的一部分,但完整機器人還需要感測器、定位、控制器、致動器、安全機制、作業系統、電力與維運。把 VLA 單獨稱為完整大腦容易誤導。
VLA 可以直接輸出馬達命令嗎?
不同架構做法不同。有些輸出動作 token、姿態或軌跡,再交給控制器;即使模型輸出接近低階命令,也必須受機械限制與安全層約束。
VLA 一定要連網嗎?
不一定。Google DeepMind 已公布裝置端 Gemini Robotics 模型,強調低延遲與不穩定網路環境;但裝置端模型仍受算力、記憶體、功耗與支援硬體限制。
VLA 訓練只需要影片嗎?
通常不夠。除了影像,還需要語言或任務標註、機器狀態、動作軌跡、成功失敗結果與不同環境資料;模擬和遙操作常用來補資料。