模型、checkpoint、adapter、容器、benchmark、場景與硬體堆疊一起留,避免只剩模型名稱。
VLA 評估紀錄產生器
記下機器人每次測試的條件與結果,取得缺漏提醒、評估摘要,以及可下載的 CSV/JSON 紀錄。
WHY THIS MANIFEST
同一個「成功率」可能不是同一場測試
要讓 VLA 結果可重現,至少要一起保存模型與 checkpoint、benchmark/環境版本、任務與場景、種子、回合上限、成功和停止定義,以及每一次結果的原始證據。模擬與真機要分開,未記錄不能填成 0,人工介入與安全停止不能藏進成功率。
VLA 評估容易把模型、benchmark、依賴、環境與判定規則壓成一個數字;其中任一項不同,都可能讓結果無法直接比較。
先寫 seed、任務切分、上限、成功與終止規則,再執行;不在看到結果後改分母。
每個 episode 掛回影片、telemetry、JSONL 或 hash,保留失敗、逾時、介入與安全停止。
模擬適合回歸與擴大案例,真機補上摩擦、校正、延遲與場域差異;兩者不能偷換。
每一份 run 都要選它是在回答 benchmark、延遲 trace、真機試驗或 PoC 驗收;它不能自動補成下一層的證明。
RECOVERY ACCOUNTING · 2026-09-08
重試、復位與人工救援,怎麼保留不同證據?
例如抓取滑落、物件狀態不符、動作空轉或對準偏差。failureMode 是本站的初步標記,可留 UNCLASSIFIED;不是從影片就診斷感測器、模型或伺服壞掉。多重失敗要在備註和 trace 列出。
同一回合內,原任務繼續嘗試是 retry;先恢復物件/場景到可執行狀態再繼續是 reset。誰執行、允許幾次、總耗時怎麼算,都須在測試前約定。超出原停止規則就不能事後改成成功。
人工扶正工件、遙操作或重設場景後即使完成任務,也記 OPERATOR_ASSIST/HUMAN_ASSIST。停止本身不代表系統不好;安全要求優先,工具不提供重新啟動機器的指令。
本工具按 episode 計算完成路徑。一回合可能有多次失敗;若要算「成功回復事件/全部回復機會」,必須另留每個事件的時間戳、回復行為與證據,不能拿回合數代替。
純教學算例,非本站實測:五個已記錄回合中,兩次無回復完成、一次自主重試後完成、一次人工介入、一次逾時。無回復完成率是 2/5=40%,自主完成率是 3/5=60%,自主回復後完成占全部回合是 1/5=20%;不能把人工介入也算進去而報 80%。若還有一筆 SUCCESS 的路徑未知,三個比率先留 unavailable,不刪掉那筆來美化分母。
這套欄位與分母是本站公開的紀錄方法,不是任何論文的官方評分器。FLARE v1(2026-08-27) 提出 Retry/Reset 的研究區分;SO-101 failure/recovery 研究 v1(2026-06-07) 把任務成功與逐事件回復分開。兩者是特定研究條件下的證據,本頁不移植其效能數字、工廠安全或跨硬體結論。LeRobot benchmark 文件 則說明 episode、task、suite 與整體的分層彙整;不同 task 不宜只剩一個未說明權重的總平均。以上三項來源於 2026-09-08 複查。
SAFETY ACCOUNTING · 2026-09-22
先完成任務,仍可能是不安全的成功
把距離、接觸、力矩、禁入區、速度或其他任務適用限制寫成可追溯規格 ID,並固定判定訊號與閾值。沒有規格與 evidence,就保留 NOT_ASSESSED。
SUCCESS 只說任務結果;若過程違反任一適用規格,仍記 VIOLATION_OBSERVED。工具用四格保存安全成功、不安全成功、安全未完成與不安全未完成。
VIOLATION_OBSERVED 必須填 violatedSafetySpecIds;NO_VIOLATION_OBSERVED 不能同時填違規 ID。最嚴重違規值沿用團隊自訂單位,不在不同規格間硬湊成通用分數。
本站只做逐回合紀錄與透明分母。真機仍需獨立安全功能、風險評估、負責人審查及適用標準;模型評估不能替代安全控制器。
方法來源與邊界:SafeVLA-Bench(論文 v1 於 2026-05-30 提交,本站於 2026-09-22 複查)把原生任務成功與事後的 Safety、Succ-But-Unsafe、Violation Severity Index 分開;它使用 LIBERO/RoboCasa、Signal Temporal Logic 與模擬器,不能直接變成真機安全認證。ForesightSafety-VLA 也把成功/失敗與安全/不安全交叉記錄。本站借用「不要把成功當安全」的判讀問題,但不移植論文分數或效能結論。
PRIMARY EVIDENCE
原有欄位怎麼來的?
以下沿用 2026-08-30 的來源紀錄,本次更新不代表全部來源或版本重新查證。
- AllenAI vla-evaluation-harness 把模型服務與 benchmark 隔離,保存 benchmark、種子、episode 組成與執行設定;2026-07 的 v0.4.0 是本頁複查時的最新正式 release。
- VLABench 提供語言條件機器人操作 benchmark、標準評估 episode 與評估流程;因此本站把 benchmark/模擬結果定位為指定條件下的模型證據,不把它改寫成真機或場域結果。
- VLA-Perf 分開建模模型結構、硬體、網路與部署拓樸的 VLA 推論延遲;本站將這類分析結果當作量測規劃,目標堆疊仍需留下實際 trace。
- VLA-Arena(ICML 2026) 用 170 個任務和 L0–L2 難度,分開看 Safety、Distractor、Extrapolation 與 Long Horizon,提醒單一平均分會隱藏能力差異。
- VLA-REPLICA 公開低成本真機平台、校正、參考場景和 ID/OOD 評估流程,說明真機重現還需要固定 fixture 與場景。
- SimplerEnv 用模擬和視覺匹配補足可擴展評估;它是實機測試的補充,不是把 sim 成績直接當 real-world truth。
- PhAIL 評估方法 將測試隨機化並保存多視角影片與 telemetry,凸顯每次 rollout 證據和介入紀錄的重要性。
FAQ
常見問題
VLA 評估至少要跑幾次才夠?
沒有適用所有任務的固定次數。先依結果變異、失敗後果、任務分層與決策用途訂樣本計畫,再完整揭露分母。本工具不預填最低次數,也不會把少量試跑包裝成穩定結論。
模擬成功率可以代表真機成功率嗎?
不可以直接畫等號。模擬適合擴大案例、重現條件與測回歸,但真實感測雜訊、摩擦、延遲、校正、物件差異和安全事件仍要在真機驗證。輸出會保留 SIMULATION、REAL_WORLD 或 HYBRID 模式。
為什麼人工介入不算成功?
介入可能保住設備或完成任務,但它改變了自主能力的證據。工具把 OPERATOR_ASSIST、SAFETY_STOP 與 TIMEOUT 分開保存;團隊可另做營運判斷,不能偷偷併入 SUCCESS。
顯示 READY_FOR_REVIEW 就代表模型通過嗎?
不代表。它只表示方法欄位與逐次證據足以交給人審查,不是效能門檻、安全認證或上線許可。成功定義、門檻與風險接受仍由測試和場域負責人決定。
任務成功,可以直接算安全嗎?
不可以。SUCCESS 只描述任務結果;安全要依測試前固定的規格 ID、訊號、閾值與證據另行判讀。未判讀就保留 NOT_ASSESSED,工具不會把它自動補成沒有違規。
我填的評估資料會上傳嗎?
不會。計算、複製與匯出都在瀏覽器本機完成,本站不接收輸入。草稿暫存於本瀏覽器分頁,清空重來會移除草稿;正式留存請下載檔案。敏感模型、場域與影片仍應依組織政策保存。