VLA 評估紀錄產生器

記下機器人每次測試的條件與結果,取得缺漏提醒、評估摘要,以及可下載的 CSV/JSON 紀錄。

1. 先填這兩項

替這次評估命名,再選測試方式。版本、規則與逐次結果可以接著分段補齊。

草稿暫存在本瀏覽器分頁,不會上傳。返回或重新整理可接著填,清空會移除草稿;正式留存請下載。工具不會替模型判定通過或安全。

先看完成範例:最後會得到什麼?

純教學示意,非實測;不會填入你的紀錄

桌面取物測試|5 回合

2 次直接完成、1 次自主重試後完成、1 次人工介入、1 次逾時。

無回復完成率
40%(2/5)
自主完成率(含重試)
60%(3/5)
若未做安全判讀
待補證據,不推定安全

你可以帶走:摘要供討論、CSV 供試算表整理、JSON 保存方法、逐次結果與判讀摘要。未完成也可下載,缺漏會保留。

2. 補上評估方法 版本、測試規則與證據位置
模型、benchmark 與執行環境

為交接所需欄位;空白會保留為未知,不會自動補 0。

測試前先固定判定規則
讓接手的人找得到證據
3. 記錄逐次結果 每回合的結果、完成方式與證據
從第 1 回合開始記

一回合就是一次實際測試。先填任務、seed、結果與證據位置,再依證據判讀完成路徑及安全狀態。沒有資料的回合留白;需要超過 6 回合可在 CSV 範本追加。

第 1 回合 尚未記錄
第 2 回合 尚未記錄
第 3 回合 尚未記錄
第 4 回合 尚未記錄
第 5 回合 尚未記錄
第 6 回合 尚未記錄

4. 查看摘要並帶走紀錄

填入評估方法與至少一回合結果後,這裡會顯示統計與缺漏提醒。還沒填完,也能先下載目前紀錄留底。

改用空白範本填寫/查看資料格式

介面更新:2026-09-28。資料格式仍為 2026-09-22 的 schema 1.3,保留 recovery 與 safety 欄位;舊紀錄缺少 safety_status 時視為 NOT_ASSESSED,不能自動補成沒有違規。下載網址不變,本次未重新查證技術來源。

WHY THIS MANIFEST

同一個「成功率」可能不是同一場測試

要讓 VLA 結果可重現,至少要一起保存模型與 checkpoint、benchmark/環境版本、任務與場景、種子、回合上限、成功和停止定義,以及每一次結果的原始證據。模擬與真機要分開,未記錄不能填成 0,人工介入與安全停止不能藏進成功率。

VLA 評估容易把模型、benchmark、依賴、環境與判定規則壓成一個數字;其中任一項不同,都可能讓結果無法直接比較。

版本鎖定

模型、checkpoint、adapter、容器、benchmark、場景與硬體堆疊一起留,避免只剩模型名稱。

方法鎖定

先寫 seed、任務切分、上限、成功與終止規則,再執行;不在看到結果後改分母。

逐次證據

每個 episode 掛回影片、telemetry、JSONL 或 hash,保留失敗、逾時、介入與安全停止。

證據分層

模擬適合回歸與擴大案例,真機補上摩擦、校正、延遲與場域差異;兩者不能偷換。

結論邊界

每一份 run 都要選它是在回答 benchmark、延遲 trace、真機試驗或 PoC 驗收;它不能自動補成下一層的證明。

RECOVERY ACCOUNTING · 2026-09-08

重試、復位與人工救援,怎麼保留不同證據?

先記看到的現象,不先宣判根因

例如抓取滑落、物件狀態不符、動作空轉或對準偏差。failureMode 是本站的初步標記,可留 UNCLASSIFIED;不是從影片就診斷感測器、模型或伺服壞掉。多重失敗要在備註和 trace 列出。

重試與復位要先寫進規則

同一回合內,原任務繼續嘗試是 retry;先恢復物件/場景到可執行狀態再繼續是 reset。誰執行、允許幾次、總耗時怎麼算,都須在測試前約定。超出原停止規則就不能事後改成成功。

有人碰過,就不能隱藏介入

人工扶正工件、遙操作或重設場景後即使完成任務,也記 OPERATOR_ASSIST/HUMAN_ASSIST。停止本身不代表系統不好;安全要求優先,工具不提供重新啟動機器的指令。

兩種分母不能混用

本工具按 episode 計算完成路徑。一回合可能有多次失敗;若要算「成功回復事件/全部回復機會」,必須另留每個事件的時間戳、回復行為與證據,不能拿回合數代替。

純教學算例,非本站實測:五個已記錄回合中,兩次無回復完成、一次自主重試後完成、一次人工介入、一次逾時。無回復完成率是 2/5=40%,自主完成率是 3/5=60%,自主回復後完成占全部回合是 1/5=20%;不能把人工介入也算進去而報 80%。若還有一筆 SUCCESS 的路徑未知,三個比率先留 unavailable,不刪掉那筆來美化分母。

這套欄位與分母是本站公開的紀錄方法,不是任何論文的官方評分器。FLARE v1(2026-08-27) 提出 Retry/Reset 的研究區分;SO-101 failure/recovery 研究 v1(2026-06-07) 把任務成功與逐事件回復分開。兩者是特定研究條件下的證據,本頁不移植其效能數字、工廠安全或跨硬體結論。LeRobot benchmark 文件 則說明 episode、task、suite 與整體的分層彙整;不同 task 不宜只剩一個未說明權重的總平均。以上三項來源於 2026-09-08 複查。

SAFETY ACCOUNTING · 2026-09-22

先完成任務,仍可能是不安全的成功

先定規格,再看影片

把距離、接觸、力矩、禁入區、速度或其他任務適用限制寫成可追溯規格 ID,並固定判定訊號與閾值。沒有規格與 evidence,就保留 NOT_ASSESSED。

Outcome 與 safety 分開

SUCCESS 只說任務結果;若過程違反任一適用規格,仍記 VIOLATION_OBSERVED。工具用四格保存安全成功、不安全成功、安全未完成與不安全未完成。

違規要指回規格

VIOLATION_OBSERVED 必須填 violatedSafetySpecIds;NO_VIOLATION_OBSERVED 不能同時填違規 ID。最嚴重違規值沿用團隊自訂單位,不在不同規格間硬湊成通用分數。

不把研究指標冒充認證

本站只做逐回合紀錄與透明分母。真機仍需獨立安全功能、風險評估、負責人審查及適用標準;模型評估不能替代安全控制器。

方法來源與邊界:SafeVLA-Bench(論文 v1 於 2026-05-30 提交,本站於 2026-09-22 複查)把原生任務成功與事後的 Safety、Succ-But-Unsafe、Violation Severity Index 分開;它使用 LIBERO/RoboCasa、Signal Temporal Logic 與模擬器,不能直接變成真機安全認證。ForesightSafety-VLA 也把成功/失敗與安全/不安全交叉記錄。本站借用「不要把成功當安全」的判讀問題,但不移植論文分數或效能結論。

PRIMARY EVIDENCE

原有欄位怎麼來的?

以下沿用 2026-08-30 的來源紀錄,本次更新不代表全部來源或版本重新查證。

  • AllenAI vla-evaluation-harness 把模型服務與 benchmark 隔離,保存 benchmark、種子、episode 組成與執行設定;2026-07 的 v0.4.0 是本頁複查時的最新正式 release。
  • VLABench 提供語言條件機器人操作 benchmark、標準評估 episode 與評估流程;因此本站把 benchmark/模擬結果定位為指定條件下的模型證據,不把它改寫成真機或場域結果。
  • VLA-Perf 分開建模模型結構、硬體、網路與部署拓樸的 VLA 推論延遲;本站將這類分析結果當作量測規劃,目標堆疊仍需留下實際 trace。
  • VLA-Arena(ICML 2026) 用 170 個任務和 L0–L2 難度,分開看 Safety、Distractor、Extrapolation 與 Long Horizon,提醒單一平均分會隱藏能力差異。
  • VLA-REPLICA 公開低成本真機平台、校正、參考場景和 ID/OOD 評估流程,說明真機重現還需要固定 fixture 與場景。
  • SimplerEnv 用模擬和視覺匹配補足可擴展評估;它是實機測試的補充,不是把 sim 成績直接當 real-world truth。
  • PhAIL 評估方法 將測試隨機化並保存多視角影片與 telemetry,凸顯每次 rollout 證據和介入紀錄的重要性。

FAQ

常見問題

VLA 評估至少要跑幾次才夠?

沒有適用所有任務的固定次數。先依結果變異、失敗後果、任務分層與決策用途訂樣本計畫,再完整揭露分母。本工具不預填最低次數,也不會把少量試跑包裝成穩定結論。

模擬成功率可以代表真機成功率嗎?

不可以直接畫等號。模擬適合擴大案例、重現條件與測回歸,但真實感測雜訊、摩擦、延遲、校正、物件差異和安全事件仍要在真機驗證。輸出會保留 SIMULATION、REAL_WORLD 或 HYBRID 模式。

為什麼人工介入不算成功?

介入可能保住設備或完成任務,但它改變了自主能力的證據。工具把 OPERATOR_ASSIST、SAFETY_STOP 與 TIMEOUT 分開保存;團隊可另做營運判斷,不能偷偷併入 SUCCESS。

顯示 READY_FOR_REVIEW 就代表模型通過嗎?

不代表。它只表示方法欄位與逐次證據足以交給人審查,不是效能門檻、安全認證或上線許可。成功定義、門檻與風險接受仍由測試和場域負責人決定。

任務成功,可以直接算安全嗎?

不可以。SUCCESS 只描述任務結果;安全要依測試前固定的規格 ID、訊號、閾值與證據另行判讀。未判讀就保留 NOT_ASSESSED,工具不會把它自動補成沒有違規。

我填的評估資料會上傳嗎?

不會。計算、複製與匯出都在瀏覽器本機完成,本站不接收輸入。草稿暫存於本瀏覽器分頁,清空重來會移除草稿;正式留存請下載檔案。敏感模型、場域與影片仍應依組織政策保存。

NEXT STEP

把評估接回部署證據