模型、checkpoint、adapter、容器、benchmark、場景與硬體堆疊一起留,避免只剩模型名稱。
免費工具VLA/機器人CSV/JSON
VLA 評估紀錄產生器
把一個成功率,還原成可重跑、可查錯的評估證據
免費建立可重現的 VLA 評估紀錄:保存模型、benchmark、場景、版本、種子、成功定義、停止規則與逐次證據,匯出 CSV 或 JSON。
WHY THIS MANIFEST
同一個「成功率」可能不是同一場測試
VLA 評估容易把模型、benchmark、依賴、環境與判定規則壓成一個數字;其中任一項不同,都可能讓結果無法直接比較。
先寫 seed、任務切分、上限、成功與終止規則,再執行;不在看到結果後改分母。
每個 episode 掛回影片、telemetry、JSONL 或 hash,保留失敗、逾時、介入與安全停止。
模擬適合回歸與擴大案例,真機補上摩擦、校正、延遲與場域差異;兩者不能偷換。
PRIMARY EVIDENCE
欄位怎麼來的?
- AllenAI vla-evaluation-harness 把模型服務與 benchmark 隔離,保存 benchmark、種子、episode 組成與執行設定;2026-07 的 v0.4.0 是本頁複查時的最新正式 release。
- VLA-Arena(ICML 2026) 用 170 個任務和 L0–L2 難度,分開看 Safety、Distractor、Extrapolation 與 Long Horizon,提醒單一平均分會隱藏能力差異。
- VLA-REPLICA 公開低成本真機平台、校正、參考場景和 ID/OOD 評估流程,說明真機重現還需要固定 fixture 與場景。
- SimplerEnv 用模擬和視覺匹配補足可擴展評估;它是實機測試的補充,不是把 sim 成績直接當 real-world truth。
- PhAIL 評估方法 將測試隨機化並保存多視角影片與 telemetry,凸顯每次 rollout 證據和介入紀錄的重要性。
FAQ
常見問題
VLA 評估至少要跑幾次才夠?
沒有適用所有任務的固定次數。先依結果變異、失敗後果、任務分層與決策用途訂樣本計畫,再完整揭露分母。本工具不預填最低次數,也不會把少量試跑包裝成穩定結論。
模擬成功率可以代表真機成功率嗎?
不可以直接畫等號。模擬適合擴大案例、重現條件與測回歸,但真實感測雜訊、摩擦、延遲、校正、物件差異和安全事件仍要在真機驗證。輸出會保留 SIMULATION、REAL_WORLD 或 HYBRID 模式。
為什麼人工介入不算成功?
介入可能保住設備或完成任務,但它改變了自主能力的證據。工具把 OPERATOR_ASSIST、SAFETY_STOP 與 TIMEOUT 分開保存;團隊可另做營運判斷,不能偷偷併入 SUCCESS。
顯示 READY_FOR_REVIEW 就代表模型通過嗎?
不代表。它只表示方法欄位與逐次證據足以交給人審查,不是效能門檻、安全認證或上線許可。成功定義、門檻與風險接受仍由測試和場域負責人決定。
我填的評估資料會上傳嗎?
不會。計算、複製與匯出都在瀏覽器本機完成,本站不接收輸入。敏感模型、場域與影片仍應依組織政策保存。