我们用 RDA 对 11 个公开 LeRobot 格式数据集、共 4,909 条 episode 做了完整审计——覆盖仿真与真机、脚本与人工遥操作、科研机械臂和百元级爱好者硬件。结果汇总:
| 数据集 | 类型 | 集数 | 判定 P / R / E | 动作尖峰 | 空闲中位数 | 空闲 p5 |
| aloha_sim_insertion_human | 仿真·人工 | 50 | 5 / 45 / 0 | 1,338(100% 集) | 70.7% | 65.1% |
| aloha_sim_transfer_cube_scripted | 仿真·脚本 | 50 | 5 / 45 / 0 | 2,489(100% 集) | 64.0% | 44.2% |
| aloha_sim_insertion_scripted | 仿真·脚本 | 50 | 1 / 49 / 0 | 1,633(100% 集) | 63.7% | 53.7% |
| droid_100 | 真机 Franka | 100 | 34 / 66 / 0 | 1,428(99% 集) | 70.7% | 55.7% |
| pusht | 仿真 | 206 | 43 / 163 / 0 | 1,148(97% 集) | 81.7% | 59.5% |
| HuggingFaceVLA/libero | 仿真 | 1,693 | 0 / 3 / 1,690 | 34(3 集) | 76.5%(3 集) | 74.6% |
| bridge_orig_lerobot(抽样) | 真机 WidowX | 25 | 4 / 21 / 0 | 91(84% 集) | 93.3% | 20.5% |
| xarm_lift_medium | 真机 xArm | 800 | 767 / 33 / 0 | 6(1% 集) | 20.8% | 12.5% |
| xarm_push_medium | 真机 xArm | 800 | 238 / 562 / 0 | 845(62% 集) | 83.3% | 16.7% |
| svla_so101_pickplace | 真机 SO-100 | 50 | 5 / 45 / 0 | 260(100% 集) | 86.7% | 59.5% |
| jaco_play | 真机 Jaco | 1,085 | 390 / 695 / 0 | 11,958(77% 集) | 74.1% | 52.7% |
说明:所有数据集的完整性层(NaN/Inf、时间戳合法性、丢帧、schema)全部干净。libero 的 1,690/1,693 集读到 0 帧——是数据集本身的 meta/布局不匹配问题,RDA 会标记 EXCLUDE 而不是静默通过(这类问题不测根本发现不了)。bridge 为抽样 25 集,其余 10 个全量审计。aloha_sim_transfer_cube_human 现在是受限仓库拉不下来,用的是 v0.5.1 时的实测值:1/49/0、1,535 尖峰、71.2% 空闲。
训练之前值得知道的五个模式
1. 空闲率中位数从 20.8% 到 93.3%,11 个里有 8 个超过 65%。 在一个 75% 帧都在"发呆"的分布上训练,损失函数会结构性偏向预测"什么都不做"——除非你做加权或课程学习。Bridge 数据更是冲到 93%。这个数应该在烧 GPU 之前测,不是烧完之后。
2. 同一款机器人、同一个实验室,空闲率差 4 倍。 xarm_lift_medium:空闲 20.8%,767/800 集直接 PASS。xarm_push_medium:空闲 83.3%,562/800 集待复核。平台一样,差别只在任务难度(抓起 vs 推平物)。高空闲不一定是 bug,它是你必须知道并设计进去的任务属性——RDA 两边都会如实报告,不会为了制造焦虑逢数据必报。
3. 动作尖峰跟的是控制器,不是数据集的名气。 仿真 ALOHA 和 SO-100 爱好者设备在 100% 的集里都有大幅动作跳变;xArm lift 数据 800 集总共只有 6 个尖峰。如果你的策略用了平滑正则,或者要做 sim-to-real 的动作统计对齐,这个数字直接决定你的训练方案。
4. "完整性干净" ≠ "训练数据好"。 11 个数据集完整性层全部通过——零 NaN、零时间戳倒流、零丢帧。但行为层仍在多数数据集里给 45%–98% 的集打出了待复核(REVIEW)。两层都得查,而大多数流水线两层都没查。
5. 最便宜的硬件产出最贵的数据。 社区 SO-100 抓放数据集:空闲中位数 86.7%,外加每集都有动作尖峰。如果你在用爱好者上传的数据做微调,这就是你继承到的起点。
复现
pip install robot-data-audit rda audit <任意 lerobot 数据集> -v rda recommend <数据集> --policy temporal # 或 frame-wise;--lang en 出英文报告
工具:GitHub - liesliy/rda: Robot Data Audit (RDA) - Quality auditing + optimization recommendations for robot manipulation datasets (LeRobot format) · GitHub · PyPI:robot-data-audit · 可视化界面:rda ui(中英文切换)
免责声明:RDA 标记的是统计异常,不是真值错误。REVIEW 的意思是"训练前先看一眼",不是"扔掉"。所有阈值都欢迎来 issue 讨论。

1751

被折叠的 条评论
为什么被折叠?



