跳转至

Physics 指标调研

这是一页 survey,不是已经冻结的 evaluator 合同。 它先解释已有论文在量什么,再讨论哪些指标适合 ArtHOI4D。当前可执行口径见 Physics 评测指标,尚未通过的正式实验 gate 见 Paper Readiness

1. 我们到底要评什么

以“人把烤箱门从 \(0^\circ\) 打开到 \(60^\circ\)”为例。只看人体是否贴近参考动作不够:人可能动作很像, 门却没开;门也可能被错误身体部位撞开。一次 Physics rollout 因此需要回答五个不同问题。

问题 常用术语 通俗解释
门开了吗? Task outcome / articulation success 物体关节是否完成了目标运动
人还在正常执行吗? Human tracking 仿真人体与 reference 相差多远,是否跌倒
门的运动正确吗? Object / articulation tracking 门轴角度、抽屉位移和物体 root 是否正确
是人用正确部位推动的吗? Contact 指定手或身体部位是否接触了指定 moving part
整段运行可靠吗? Completion / failure / coverage 是否跑完整段,是否 crash、NaN、超时或提前终止

这些问题不能压成一个“综合误差”。论文应先用一个 primary endpoint 判断任务完成,再用 tracking、 contact 和 failure 指标解释结果。

三个容易混淆的词

  • Outcome:只回答门或抽屉是否完成目标运动。
  • Success wrapper:在 outcome 外再要求“整段没失败”或“正确部位确实接触”。
  • Coverage:真实有效帧数占计划帧数的比例。例如计划 10 秒、5 秒时跌倒,则 coverage 为 50%; 它不是 success,也不能把这次失败从分母删掉。

全部预先安排的 case 都进入成功率分母。这种做法称为 intention-to-treat(ITT):crash、NaN、 timeout、缺结果和算法提前终止都记为 Fail。连续误差只在失败前真实运行过的 valid prefix 上计算,并和 coverage 一起报告。

2. 指标按功能分类

2.1 任务结果:门或抽屉到底动了多少

设关节起点为 \(q_s\),reference 目标为 \(q_g\),rollout 状态为 \(q_t\)。正式存储与聚合中,revolute 关节用 rad,prismatic 关节用 m;可在人类可读例子中附带 degree/cm 换算。两类关节的绝对误差不能混在一列平均。

为避免“失败之后仍用计划帧填数”,对每个 scheduled case×seed 定义真实有效前缀 \(V=\{1,\ldots,T_v\}\)。结束保持窗口 \(W\) 和任务阶段 \(P\) 都必须先与 \(V\) 取交集。若完整的 保持窗口不存在,该二元 outcome 记 Fail;前缀内连续误差仍可报,但必须同时报 \(C=T_v/T_{\rm sched}\)

指标名称 定义 优点 风险
Absolute joint displacement \(D_{\rm abs}=\operatorname{median}_{t\in W}\lvert \tilde q_t-\tilde q_s\rvert\) 直观;可和 ArtiGrasp 的固定角度口径对照 同一个角度或距离对不同物体不一定公平;绝对值会容忍反向运动
Normalized articulation progress 每个 movement phase 在 final 附近窗口取方向性最大进度并 clip 到 \([0,1]\),再按 phase 帧数加权 按每个任务目标归一化,门和抽屉都能解释 依赖可靠的起点、目标和运动方向;\(\lvert q_g-q_0\rvert\) 过小的 case 必须预先判为不适用
Endpoint error \(e_{\rm end}=d_{\rm type}(q_{\max(P\cap V)},q_g)\) 直接回答最后是否到达目标 对 noisy reference 或存在多种合理终点的任务可能过严
Trajectory RMSE (e_{\rm traj}=\sqrt{ P\cap V ^{-1}\sum_{t\in P\cap V}d_{\rm type}(q_t,q_t^{\rm ref})^2})
Threshold sweep / AUC 在预注册阈值网格 \(\Theta\) 上计算 ITT success curve,再用梯形积分的归一化面积 不被单个阈值支配 sweep 范围仍需预注册,正文解释不如单一 endpoint 直接

这里 \(\tilde q\) 表示预先冻结方向/分支后的关节坐标:prismatic 保留有符号线位移;有限行程 revolute 在 manifest 冻结的方向上做 wrapped difference;连续转动关节先冻结 unwrapped branch。 误差函数 \(d_{\rm type}\) 则始终非负:prismatic 取线位移绝对值,revolute 取角度 geodesic/该分支上的绝对差。 不能把 rad 和 m 放进同一个平均数。

对进度阈值 \(\theta\),建议把曲线写成

\[ R(\theta)=\frac{1}{N_{\rm case}}\sum_i\frac{1}{|\mathcal S_i|} \sum_{s\in\mathcal S_i}\mathbf 1[P_{{\rm hold},i,s}\geq\theta], \]

其中任何 crash、NaN、timeout、missing 或不完整保持窗口都令指示函数为 0。AUC 必须在预注册的 \([\theta_{\min},\theta_{\max}]\) 上归一化;先在 case 内跨 seed 平均,再跨 case 聚合,避免某些 case 因 seed 更多而获得更大权重。

2.2 人体、接触和物理质量

Metric 常见计算 单位 在本项目中的角色
H-MPJPE \(\frac1J\sum_j\lVert x_j-x_j^{\rm ref}\rVert_2\) mm Key secondary;同时给 world-space 与 pelvis-relative
Root translation / orientation error root 位置 L2;旋转 geodesic distance mm、degree Key secondary
Object-root drift object base 相对初始或 reference 的位姿误差 mm、degree Secondary;检查“把整个柜子推走”shortcut
Inactive-joint drift 非目标关节相对初值的误差 degree 或 mm Secondary;检查错误部件被带动
Pairwise contact rate 指定 body collider × target-link collider 满足接触的有效帧比例 % Contact-qualified success 的前置条件
Contact distance 指定人体点到指定物体 link surface 的最近距离 mm Secondary;距离近不等于产生有效力
Contact graph error predicted/simulated body–object edge 与 reference edge 的差 0–1 或 % Diagnostic;依赖可靠的 reference contact graph
Penetration depth / volume 人体点进入物体 SDF 的最大深度或体积 mm、cm³ Physics-quality diagnostic
Support / float / fall 无人体或地面支撑的帧比例;跌倒/禁止接触事件 % Failure explanation
Jerk / action saturation / power 三阶差分;\(\lvert a\rvert>0.99\) 比例;(\sum \tau\dot q )

接触指标必须知道“谁接触了谁”。只有手部总力、物体总力或手到整个物体的最短距离,不能证明指定手接触了 指定 moving part;它们最多是 diagnostic。

3. 相关论文实际用了什么

下面只记录原论文自己的任务和统计口径。原论文的阈值是 source precedent,不是 ArtHOI4D 默认值。

3.1 直接评 articulated manipulation 的工作

工作 原论文 task / embodiment 原论文指标、公式与阈值 能借用什么;不能照搬什么
ArtiGrasp ARCTIC 双 MANO 手;抓取、搬运和 1-DoF articulation Grasp success:物体抬高超过 0.1 m 且保持到结束。Articulation success:关节运动超过 0.3 rad 且 moving part 不滑落到结束。另报 articulation angle error [rad]、object-base displacement [m];组合 task 要求 PE < 0.05 m、AE < 0.2 rad、AAE < 0.5 rad Appendix sensitivity:提供“固定关节位移 + 保持到结束”的先例。0.3 rad 来自它的手部任务,不能直接作为门、抽屉和全身任务的统一阈值
DragMesh-2 51-DoF floating SMPL-X hand;GAPartNet 被动关节,只能由 hand–handle contact 驱动 \(q_{done}=q_{min}^{traj}+\rho(q_{max}^{traj}-q_{min}^{traj})\)\(p_t=\max(0,(q_t-q_{start})/(q_{goal}-q_{start}))\)。报告 success/progress、action saturation clip099、detachment failure,并在 damping ×1/×2/×4 下报告平均与 worst-case Main primary candidate precedent:最接近 normalized progress 和 passive articulation。\(\rho=0.5\) 只能作 reported comparison / sensitivity,不能自动成为我们的 primary threshold
CHORD Sharpa 双机器人手;附加实验是 Unitree G1 + Dex3 whole-body robot;rigid、articulated、multi-object manipulation Primary 是 completion ratio:未触发 object-centric termination 的成功 rollout / 全部 rollout;position error >15 cm 或 rotation error >40° 时终止,completion ratio >0.7 才称 task success Main full-horizon precedent:提供“完整 rollout + object-centric termination”设计。15 cm、40°衡量其机器人 object-pose tracking,不是我们 passive joint 的阈值
DexMachina ARCTIC human demo → 多种双机器人手;长时 articulated functional retargeting 训练 reward 为 \(e^{-\beta_p d_p}e^{-\beta_R d_R}e^{-\beta_q d_q}\),其中 \(d_p\) 为 object translation error [m]、\(d_R\) 为 quaternion geodesic error [rad]、\(d_q\) 为 joint-angle error [rad]。正式汇总使用 part-wise ADD-AUC:各刚体 part 先算 ADD,再平均并对阈值曲线求 AUC。1 cm / 最多 50 点只用于 demo contact approximation Secondary / appendix:支持 surface trajectory + threshold AUC。contact 的 1 cm 不是 success threshold;robot-hand 统计预算也不能直接搬到本项目

3.2 Full-body Physics / video-to-physics 工作

工作 原论文 task / embodiment 原论文怎样评 对本项目的启示与局限
RePHO 单目视频 rigid HOI;SMPL-H/full-body physics repair SR-B:完整序列从头到尾无失败;SR-F:最长连续成功片段 / 总时长,原文不纳入长度 <2 s 的 rollout。另报 PA Chamfer [cm]、GT-contact-frame recall(hand–object <1 cm)、contact distance、penetration [cm]、object float、object jerk Main failure coverage + diagnostics:提供完整序列先例。但连续指标只在成功 rollout、甚至方法共同成功的 intersection 上算,会产生 survivorship bias;我们不采用这种删失败口径
OmniGrasp full-body humanoid 抓取并跟随 rigid-object trajectory \(E_{pos}\) [mm]、\(E_{rot}\) [rad]、\(E_{vel}\) [mm/frame]、\(E_{acc}\) [mm/frame²];grasp success 要持物 ≥0.5 s;TTR 是误差 <12 cm 的时间比例,但只在成功轨迹上算;任一时刻 object 偏离 >25 cm 则 trajectory failure Secondary:支持 hold、full-trajectory failure 和 object tracking。TTR 的 success-only denominator 不适合作为我们的正式连续指标
DeVI synthetic video → SMPL-X humanoid + rigid object physics Body/hand/all MPJPE [mm]、root translation [mm]、object translation [mm]、object orientation(原表未标单位);success 定义为 all-joint MPJPE <0.2 m 且 object translation <0.2 m。论文比较时只评双方都成功的场景 Human/object tracking secondary:说明 video-derived noisy reference 仍需 tracking。对象只有 rigid SE(3),且 intersection-only 口径不能迁移
PhysHOI whole-body rigid HOI imitation;SMPL-X humanoid 逐帧 success 要同时满足 object position error <0.2 m、body position error <0.1 m、contact-graph edge 正确,再跨帧平均;另报 human/object MPJPE [mm] 和 contact-graph MSE Secondary / diagnostic:支持将 tracking、object outcome 和 contact graph 分开查看。它的 coarse graph 与 rigid thresholds 不能证明指定手推动指定 articulated link
InterMimic imperfect MoCap rigid HOI;teacher–student full-body tracker Success Rate:每条 reference 是否至少有一次成功;Duration [s]:触发 interaction early termination 前持续多久;human per-joint error [cm]、object per-point error [cm] 在 best-performing trial 的有效时长内平均 Diagnostic:支持 duration 和 early-termination audit。best trial 会高估稳定性,我们的 common protocol 不取 best trial
HDMI monocular video → Unitree G1;rigid 与 articulated/fixed/floating object rollout 从 reference 开头启动,完成且未触发 termination 即 success;4096 parallel environments 上报均值和标准差。论文 termination 包括 robot/object tracking 0.5 m、1.2 rad,以及 contact loss(距离 0.2 m 且力 1 N,最少 25 steps);另报真实机器人连续完成次数 Main wrapper / secondary precedent:最接近 video-derived articulated whole-body control。其 G1、安全阈值和 4096 env 口径不是 SMPL-X passive-object evaluator 合同
VLM-RMD language-conditioned 15-body/28-joint physical humanoid;static、dynamic 与 articulated multi-stage tasks Completion Rate:完成全部 substeps 并回到自然站姿,root 距结束点 <20 cm;另报 sub-step completion ratio、task success(不同 task 使用 20 cm root/target heuristic)、成功 trial 上的 body-part-to-target precision [cm]。内部 stage transition 用 reward >0.9,这是控制逻辑,不是论文 primary Diagnostic / appendix:适合借用 reach/contact/actuate/complete 失败阶段定位;20 cm heuristic 和 success-only precision 不适合作为 articulation primary

3.3 主要评价 generation、不能当 Physics controller 指标的工作

工作 原论文指标 为什么不进 Physics 主表
CoDA FID、R-Precision@3、Diversity、foot skating;所谓 IV 实际是穿透的 hand-vertex 数,ID 是最大穿透深度(表中单位未明示),CR 是距 object surface <5 mm 的 hand vertices 平均比例;16-person user study 它的核心任务是生成 full-body、hand 和 articulated-object motion。FID、文本匹配和 Diversity 评价分布质量,不判断 simulator 中是否靠接触完成 passive articulation;penetration/contact 可作附录 diagnostic
OpenHOI Hand MPJPE、final object location error(final object center 到 target 的 Euclidean distance)、FID、Diversity、Multimodality;appendix 另报 Physical realism 和 IV。原文未明示 MPJPE/FOL/IV 单位,也未给 Physical realism 可复现公式 评价 open-world HOI generation;不能替代 rollout success、failure denominator 或 passive joint outcome;定义不足的 physical-realism 项也不可直接迁移

3.4 原论文的统计口径与幸存者偏差账本

这张表只记录一手来源明确写出的统计单位。NR 表示论文在对应指标段没有报告可迁移的 seed/repeat 口径,不表示“没有做”,也不允许我们补猜。

工作 原论文的评测单位/聚合 要避免的偏差
ArtiGrasp 8 objects,488/257 train/test hand-pose references;image-based 评测用 60 references;组合 task 约 7,500 trials 7,500 是随机组合后的 trial 数,不能误写成每个 reference 的重复数
DragMesh-2 资源含 277 trajectories;主评测用 7 objects(5 revolute, 2 prismatic);每 method×object×damping×mode 为 20 episodes;先报分 object 值,再求 7-object 平均 单 cell 只有 20 episodes;强 damping 下的小差异不宜排名过度
CHORD 发布 benchmark 含 4,739 tasks,主定量结果评 1,831 tasks;特定 contact ablation 为 3 seeds×4,096 env/seed;whole-body 子集为 12 hand-reference tasks + 5 TPV tasks 不能把特定 ablation 的 3 seeds×4,096 env 写成所有 1,831 tasks 的统一口径
DexMachina benchmark 涵盖 6 hands/5 articulated objects,主比较是 4 hands×7 demos;每 method×task 用 5 seeds;每 seed 依 cumulative task reward 选 best checkpoint,再跑 20 episodes;part 先等权平均后求 ADD-AUC “best checkpoint”是 model selection,迁移时必须冻结 checkpoint rule,不能从 test 挑最佳
RePHO BEHAVE/InterCap 分别评 35/38 clips;SR-B/SR-F 按 sequence/rollout;SR-F 不纳入 <2 s rollout;与 kinematic baseline 的 3D 误差使用成功 clip/frame intersection;seed 口径 NR 删除短失败和共同成功 intersection 会同时引入 survivorship/collider bias
OmniGrasp GRAB 主表含 140 cross-object 序列与 92 cross-subject 序列;模拟随机性下所有实验运行 10 次后平均 TTR 仅在 successful trajectories 上算,不能与全分母误差直接比
DeVI 16 个 <7 s 的 GRAB HOI motions;与 baseline 比较时只保留两方都成功的 scenarios;seed/repeat 口径 NR 共同成功 intersection 会排除方法各自最难的失败
PhysHOI 5 whole-body grasping cases + 8 BallPlay skills;所有序列重复 10 次并报平均 逐帧 success 平均不等于整段 rollout success
InterMimic success 先判每条 reference 是否“至少一次成功”,tracking error 只在 best-performing trial 的有效时长聚合;一小部分无法修复的 MoCap 被丢弃 best-of-trials 和丢弃不可修复 case 都会高估稳定性
HDMI simulation ablation 含 8 tasks,从 reference 起点开始,4,096 parallel environments 上报 mean±std;另有 5 个 real-robot tasks 其 env-level dispersion 不是跨 CAD/object 的不确定性
VLM-RMD single-task 指标在 4,096 trials 上评估;precision 只用 successfully completed trials precision 的 success-only 分母会掩盖 failure coverage
CoDA ARCTIC test 随机取每 object category 4 sequences;GRAB 用最后一个 subject 测试;user study 为 16 人;seed/repeat 口径 NR 它的采样单位是 generated motion,不是 passive-physics rollout
OpenHOI GRAB/ARCTIC 各按 80% train / 20% unseen-test;主表报 mean±dispersion,但对应重复/采样定义 NR 不应把未说明的“±”自动解释为跨 seed 置信区间

4. Articulation 指标的四种候选(A–D)

为与审查清单对齐,保留 A/B/C/D 代号;每次使用时都同时写出名称,避免读者背代号。

假设目标是开门 \(60^\circ\),rollout 最高到 \(50^\circ\),结束前稳定在 \(45^\circ\)

候选 在例子中的值 推荐位置 主要优缺点
A:固定关节位移 45°;若候选阈值为 30°则成功 Appendix sensitivity 最直观,但固定角度/距离跨 CAD 不公平,且需另做反向运动 audit
B:final-window 归一化进度 \(45/60=75\%\) 独立连续指标 跨任务可比;只在 final 附近窗口取最大值,不接受整段早期的瞬时峰值
C:终点 / 轨迹容差 终点误差 15°;轨迹误差逐帧计算 Endpoint 为 secondary;trajectory 为 diagnostic 有物理解释,但 noisy reference 未必是唯一合理轨迹
D:阈值曲线 / AUC 在 40%、50%、60%…候选阈值上分别算 SR 后积分 Appendix robustness 减少单阈值敏感性,但 sweep 仍需预注册

四种候选中 A/C/D 可用于 sensitivity 或二值化研究;B 在当前实现中保持为独立连续 metric, 不通过 progress threshold 生成 Success A/B。final window 和 phase 分段参数仍需在可见验证集上冻结。

当前实现选择 final-window normalized progress 作为独立连续结果,因为 CAD、关节类型和目标行程不同; 同时保留固定位移、endpoint/trajectory error 与 AUC 作为 sensitivity。它不参与 Success A/B。

5. Outcome 与 success wrapper 分开

报告层级 额外要求 能支持的表述
Outcome-only 只要求 target joint 达到候选 outcome 物体关节完成了目标运动
Contact-qualified Outcome + 指定 body collider 与指定 target link 的成对接触,在预注册 actuation/hold window 内达到持续时长或帧比要求 正确接触与 outcome 在时间上共现;不会被无关的瞬时碰触轻易投机,但还不能自动称为因果
Full-horizon strict 所有预声明 phase 完成,且无 crash、NaN、timeout、early termination 或禁止的 object actuation 整段任务执行成功
Valid-duration report 报告 valid time / scheduled time 解释运行到哪里失败;它不是成功率替代品

当前实现把 Progress、Success A 和 Success B 作为三个独立 metric;Success A/B 不读取 Progress。 若 pairwise contact telemetry 未通过 positive/negative replay,contact proxy 只放 diagnostic; 通过后,contact-qualified 仍只能作为独立 secondary。必须分报 wrong-hand、wrong-link、 environment-contact 和 forbidden active-drive 审计。只有在预注册干预实验中禁用目标接触或相应 impulse,才可以讨论 causal effect。

6. 完整候选目录与论文位置

Family 候选指标 Provisional 位置
Task / articulation final-window frame-weighted normalized progress 独立连续指标
Task / articulation fixed displacement;endpoint error Secondary / sensitivity
Task / articulation trajectory error;threshold sweep / AUC Diagnostic / appendix
Human tracking world/pelvis H-MPJPE;root translation/orientation Main secondary
Contact pairwise contact rate、sustain、contact distance Secondary;telemetry 未过 gate 前只作 diagnostic
Physics quality penetration、support/float/fall、object-root drift、inactive-joint drift Appendix / failure explanation
Shortcut audit wrong-hand、wrong-link、environment-contact、forbidden active drive Required appendix audit
Control quality jerk、action saturation、power/energy、torque limit Appendix
Robustness damping/friction/mass perturbation;reference noise;initial-state perturbation Main robustness 或 appendix,取决于篇幅
Efficiency wall time、GPU-hours、environment transitions、training samples Appendix / efficiency table
Recon / generation only Object CD、Moving-part CD、FID、R-Precision、Diversity、Multimodality 不进 Physics 主表

7. 还需要人签字的选择

待冻结项 Provisional recommendation 冻结方法
Progress final-window frame-weighted normalized progress;与 Success A/B 解耦 冻结 phase、起点、目标、窗口和权重定义
Primary wrapper full-horizon,不加 contact qualification;contact-qualified 是 claim-triggered secondary positive/negative replay + shortcut audit 只决定是否激活 contact secondary/claim
Progress threshold \(\rho\) 不进入 Success A/B;阈值 sweep 只作 sensitivity 不得根据 method ranking 选择
Final window 以 phase final 为中心的可配置奇数窗口;当前模板为 5 帧 检查不同 FPS 和标注重复性
Endpoint tolerance / AUC grid revolute 与 prismatic 分别冻结 measurement resolution、任务语义和盲评一致性
Formal statistics 全 scheduled-case ITT;连续误差同时报 coverage;按真实 CAD/object cluster 求 paired CI manifest 与 aggregator end-to-end test

冻结阈值时先隐藏 method identity,再检查标注重复性和人类对“任务是否完成”的一致性。不能选择“让 Ours 赢得 最多”的阈值。formal test 解封后,不再修改 primary、threshold、failure policy 或聚合方式。