免費工具VLA/機器人CSV/JSON

VLA 評估紀錄產生器

把一個成功率,還原成可重跑、可查錯的評估證據

免費建立可重現的 VLA 評估紀錄:保存模型、benchmark、場景、版本、種子、成功定義、停止規則與逐次證據,匯出 CSV 或 JSON。

版本:1.0最後更新:2026-08-24輸入只留在瀏覽器不提供通用門檻或安全認證

RUN MANIFEST

先鎖定方法,再開始算結果

1. 模型、benchmark 與執行環境

為交接所需欄位;空白會保留為未知,不會自動補 0。

2. 逐次結果與原始證據

每列是一個實際 episode。結果不是只有成功/失敗:逾時、安全停止與人工介入要分開。若需要更多列,先下載範本或匯出後在資料工具追加。

#任務/案例*Seed/抽樣 ID*Outcome*耗時秒證據檔/URI*失敗原因/備註
1
2
3
4
5
6

EVIDENCE READINESS

這份評估現在能不能被重查?

0已記錄
0成功
0失敗/逾時
0停止/介入

描述性成功率:unavailable(只用已記錄列,不能當安全或上線門檻)

紀錄未完成:方法欄位與 episode 證據尚未填寫。

先鎖定方法,至少記一個有 task、seed、outcome 與證據位置的 episode。

WHY THIS MANIFEST

同一個「成功率」可能不是同一場測試

VLA 評估容易把模型、benchmark、依賴、環境與判定規則壓成一個數字;其中任一項不同,都可能讓結果無法直接比較。

版本鎖定

模型、checkpoint、adapter、容器、benchmark、場景與硬體堆疊一起留,避免只剩模型名稱。

方法鎖定

先寫 seed、任務切分、上限、成功與終止規則,再執行;不在看到結果後改分母。

逐次證據

每個 episode 掛回影片、telemetry、JSONL 或 hash,保留失敗、逾時、介入與安全停止。

證據分層

模擬適合回歸與擴大案例,真機補上摩擦、校正、延遲與場域差異;兩者不能偷換。

PRIMARY EVIDENCE

欄位怎麼來的?

  • AllenAI vla-evaluation-harness 把模型服務與 benchmark 隔離,保存 benchmark、種子、episode 組成與執行設定;2026-07 的 v0.4.0 是本頁複查時的最新正式 release。
  • VLA-Arena(ICML 2026) 用 170 個任務和 L0–L2 難度,分開看 Safety、Distractor、Extrapolation 與 Long Horizon,提醒單一平均分會隱藏能力差異。
  • VLA-REPLICA 公開低成本真機平台、校正、參考場景和 ID/OOD 評估流程,說明真機重現還需要固定 fixture 與場景。
  • SimplerEnv 用模擬和視覺匹配補足可擴展評估;它是實機測試的補充,不是把 sim 成績直接當 real-world truth。
  • PhAIL 評估方法 將測試隨機化並保存多視角影片與 telemetry,凸顯每次 rollout 證據和介入紀錄的重要性。

FAQ

常見問題

VLA 評估至少要跑幾次才夠?

沒有適用所有任務的固定次數。先依結果變異、失敗後果、任務分層與決策用途訂樣本計畫,再完整揭露分母。本工具不預填最低次數,也不會把少量試跑包裝成穩定結論。

模擬成功率可以代表真機成功率嗎?

不可以直接畫等號。模擬適合擴大案例、重現條件與測回歸,但真實感測雜訊、摩擦、延遲、校正、物件差異和安全事件仍要在真機驗證。輸出會保留 SIMULATION、REAL_WORLD 或 HYBRID 模式。

為什麼人工介入不算成功?

介入可能保住設備或完成任務,但它改變了自主能力的證據。工具把 OPERATOR_ASSIST、SAFETY_STOP 與 TIMEOUT 分開保存;團隊可另做營運判斷,不能偷偷併入 SUCCESS。

顯示 READY_FOR_REVIEW 就代表模型通過嗎?

不代表。它只表示方法欄位與逐次證據足以交給人審查,不是效能門檻、安全認證或上線許可。成功定義、門檻與風險接受仍由測試和場域負責人決定。

我填的評估資料會上傳嗎?

不會。計算、複製與匯出都在瀏覽器本機完成,本站不接收輸入。敏感模型、場域與影片仍應依組織政策保存。

NEXT STEP

把評估接回部署證據