跳转至

ArtHOI4D 物理追踪与抓取修复方案报告,2026-04-28

0. 给无上下文 LLM Agent 的项目背景

这份报告讨论的是 ArtHOI4D 的物理追踪和抓取修复方案。不要把本项目理解成“给一段现成视频做物理化”,也不要把它简化成“在 InterMimic 里调 reward”。更准确的目标是:构建一条 scalable articulated HOI 数据生成 pipeline,从 video prior / videogen 或真实视频出发,重建 human motion、articulated object pose、part articulation 和 contact,再把这条 reference 转成 simulation-ready 的物理交互数据。

项目主线可以概括成:

video prior / videogen / real video
  -> monocular 4D articulated HOI reconstruction
  -> passive articulated-object validation
  -> strong tracker / motion prior tracking
  -> conditional grab/contact repair
  -> simulation-ready articulated HOI data

当前压力测试 case 是 open-oven。它的难点不是“门角度曲线看起来对”,而是:人体在物理仿真里通过手和 handle / door contact 推动 passive hinge door,使 oven door 的 articulated joint qpos 和 moving-part pose 接近重建 reference,同时 full-body motion 保持自然。

0.1 现在代码已经实现的步骤

仓库里已经有从视频到重建、再到物理回放/诊断的基本链路:

  • videogen / asset 侧:已有 object asset、render input、canonical articulated asset 等接口,用来服务 video generation 和后续 recon / mimic。
  • recon 侧:configs/methods/recon/ours_global_opt.yaml 默认使用 motion.model: "sam3d_body",即当前更强的 SAM3D-Body HMR/4D body motion 路线;同时跑 segmentation、depth、human-depth alignment、point tracks 和 object global optimization。
  • recon 输出:pipeline/reconstruction/optimization/run.py 会写 result.pt,里面包含 human 的 SMPL-X 参数、object.poseobject.joint_valuesobject.scale、camera/world transform 和 loss 信息。
  • physics 侧:以 case JSON + result.pt 为唯一公共输入,PHC-X、InterMimic、RePHO 与 ours 各自只保留 method-local native adapter。
  • 所有正式 rollout 都转换成 exact common_rollout.npz;二元 evaluator、common renderer 和 Viser 不读取 native 输出。旧 MuJoCo phys_refine、dynamic replay 与 noop optimizer 已删除。

0.2 重建阶段已有的约束

重建不是裸 HMR replay。现在 recon optimization 已经实现了多种观测和几何约束,主要在 pipeline/reconstruction/optimization/solver/losses.pyconfigs/methods/recon/ours_global_opt.yaml

  • 2D / tracking:track_2d,以及 mask Dice/BCE、mask center、可选 RGB tracking。
  • depth:object rendered depth 和 monocular metric depth 对齐。
  • contact:手部点到 object/contact region 的距离约束,支持 contact window / dilation / top-k region 等设定。
  • penetration:人体/手与 object mesh 的穿透惩罚。
  • support plane:地面/支撑面约束、object z anchor。
  • human-facing:hfacing,用于减少物体朝向不合理的初始化/优化结果。
  • temporal smoothness:smooth_rotsmooth_transsmooth_joint
  • no-contact motion:在非交互窗口惩罚 hinge/slider 乱动。
  • joint limit:hinge / slider 的关节范围惩罚。

这些 loss 对 object pose、articulation、scale、mask/depth alignment 很重要,也能提供 contact cue;但它们仍然不是一个 object-centric grab controller。也就是说,recon 阶段可以让“画面和轨迹更对”,不能保证手一定以正确抓取姿态贴到 oven handle 上。

0.3 当前进展

目前比较明确的进展是:

  • SAM3D-Body 路线已经接入为默认 human motion provider,比早期 GVHMR / hand-refine 路线更适合做全身 motion reference。
  • 对 open-oven 这类序列,full-body human motion 大体已经可用,适合作 strong tracker / motion prior 的 reference。
  • object root pose、object scale、hinge/slider joint values 已通过 recon optimization 输出,能作为 passive object validation 的目标。
  • Isaac / InterMimic 侧已经能跑 passive articulated-object replay / dynamic replay,适合检查 asset、joint axis、scale、contact region 和 qpos 曲线是否闭环。

0.4 当前主要问题

现在失败的核心不是“没有一个更慢的全局 optimizer”,而是 reference 和 tracker 之间缺少 object-centric grab 修复:

  • 即使 SAM3D-Body 是很强的 HMR 方法,单目视频下 hand/world 对齐仍可能有 10-20cm 误差;对 open-oven 来说,这已经足以让手碰不到 handle。
  • 手在交互时经常被物体遮挡,HMR/hand prior 可以让手形更自然,但不一定知道 oven handle 的可抓取区域和正确相对姿态。
  • 如果 reference 里的手已经偏离 handle,后面的 tracker 只会忠实跟踪这个错误 reference;没有显式 grab/contact target 时,很难“自动优化回来”。
  • 当前 RL / InterMimic tracking 方案没有真正的 object-centric grasp supervision:没有稳定的 handle contact anchor、没有 T_handle_to_hand / no-slip 约束、没有针对 active hand 的抓取姿态修复。
  • 因此现在 RL 部分失败是预期的:它可以追人体、追 object qpos,但如果没有先把手放到能产生 contact force 的位置,passive hinge door 不会被正确打开。

0.5 给下一个 LLM Agent 的分析重点

后续分析不要从“每条视频训练 PPO”或“全序列 test-time optimization”开始。更合理的方向是:

  • 首先判断:当前 reference 在 passive object 下能不能被强 tracker 复现?如果能复现,说明 video prior / reconstruction / contact 已经足够好,不需要额外修 grab。
  • 如果失败,先做 failure diagnosis:是 asset/joint axis/collider/scale/friction 错,还是 hand-handle contact 错。
  • 如果定位到 hand contact,再做局部 grab repair:只改 active hand、wrist、forearm 和接触窗口,保留 SAM3D-Body / tracker 给出的全身自然 motion。
  • grab repair 应显式使用 object/handle 局部坐标:active hand、handle/contact surface、T_handle_to_hand、contact window、no-slip、penetration、joint qpos/moving-part target。
  • motion naturalness 应主要由强 tracker / motion prior 保证,例如 OmniGrasp、PULSE-X、ProtoMotions 或 InterMimic teacher,而不是靠全身 CEM/MPPI 从零搜索。

关键判断标准是:如果 reference 本身正确,passive articulated-object validation 能复现就是强证据;如果复现不了,不要盲目加大 RL,而应优先修复 grab/contact reference。

1. 一句话结论

本项目不应该被定义成“把现成视频物理化”,也不应该被定义成“复现 InterMimic tracking”。更准确的目标是:从 video prior / videogen 生成或获得视频,重建 articulated HOI 的 4D reference,再通过抓取修复和物理控制把它转成 simulation-ready 的人-可动部件物体交互数据

当前更合理的方案不是全序列从零优化 motion,也不是为每条视频训练 PPO。假设 video prior / reconstruction reference 已经足够好,那么第一目标应该是:用强 tracker / motion prior 在 passive articulated object 下复现这条 reference。如果能复现,说明 reference、asset、contact 和 tracker 在这条序列上已经闭环,不需要额外修 grab。只有当复现失败,并且失败定位到手部 contact/grab 时,才进入局部抓取修复。

strong tracker / motion prior
  -> passive articulated-object validation
  -> failure diagnosis
  -> optional local grab/contact repair
  -> lightweight residual physics adaptation

也就是 tracker-first, grab-repair-if-needed:用 OmniGrasp、PULSE-X、ProtoMotions 或同类强 tracker / motion prior 保住整体 motion naturalness,先直接验证 passive object 是否能被正确复现;若不行,再只在手、手腕、前臂和接触窗口内修 grab。

2. 项目目标分析

2.1 最终目标

系统最终要完成一条 scalable pipeline:

video prior / videogen
  -> monocular 4D articulated HOI reconstruction
  -> grasp-aware tracking and physics adaptation
  -> simulation-ready articulated HOI data

这条 pipeline 需要同时证明:

  • 重建有效:能恢复 human motion、hand pose、object root pose、articulated joint values、moving-part pose、contact/camera/world metadata。
  • 动作自然:full-body motion 不应被黑盒优化破坏,应该由 reference tracker / motion prior 保持自然性。
  • 抓取正确或可验证:如果 reference 里 hand-object contact 已经正确,passive rollout 复现本身就是强证据;如果复现失败,才需要显式估计 grab pose 并修复手部 contact。
  • 物理可执行:humanoid 不能只是逐帧 teleport,而要通过 PD/action-space control 与 passive articulated object 接触,并在仿真中产生合理的 hinge/prismatic motion。
  • 可扩展:方法要能服务大量 videogen/recon 序列,不能默认每条视频跑很久的从零 RL training。

2.2 open-oven 的意义

open-oven 不是最终任务定义,而是 stress test。它要求:

  • hand/wrist 在正确时间到达 handle 或 door contact region;
  • fingers/palm/wrist 相对 handle 的姿态像一个合理抓取,而不是只靠近;
  • 抓住后 hand-handle relative pose 不乱滑;
  • object root/cabinet 不乱动;
  • oven door hinge qpos 是被手接触推开的,而不是从 reference 直接写进去;
  • final hinge angle 和 moving-part pose 接近重建 reference;
  • action trace 平滑,没有明显穿透、摔倒或不合理力。

因此,只看 replay video 像不像是不够的。成功标准必须包含 motion naturalness、passive physics rollout、contact stability、object joint 和 action diagnostics。grab pose supervision 是失败修复工具,不是所有成功样本都必须额外施加的约束。

3. 当前 Baseline 分析

3.1 当前本仓默认路径:dynamic replay / noop

当前 physics method config 默认接近 noop + dynamic_replay。这条路径可以做诊断,但不能作为最终方法。

优点:

  • 快;
  • 能验证 asset/import/reference 是否基本对齐;
  • 能读出一些 object joint qpos、moving-part proxy 等诊断信息;
  • 适合作 preflight classifier。

问题:

  • human root 仍逐帧 teleport;
  • 当前路径更像“半物理 replay”,不是完整 action-space tracking;
  • 如果物体能打开,可能来自 reference 或 replay 语义,不一定证明 humanoid 通过 contact 真实打开;
  • 如果物体打不开,也不能直接判断是 tracker 不行,可能是 asset、joint axis、collider、scale、handle geometry 或 friction 问题;
  • 它不修手部 grab pose。

结论:保留 replay,但只作为 diagnostics。

3.2 InterMimic tracker / teacher

InterMimic tracker 可以提供一个真实 policy inference 参考,但它不是完整答案。

优点:

  • 有现成 IsaacGym/InterMimic env;
  • 使用 PD/action-space control;
  • 代码里已有 teacher/tracker runner,可作为环境构建参考。

问题:

  • pretrained policy 不一定覆盖我们的 articulated HOI / open-oven distribution;
  • object/contact reward 偏乘法链,容易一项差就整体信号归零;
  • teacher inference 不是针对单条视频修复 hand-object grab;
  • 对 passive articulated object 的 qpos/moving-part 目标不够直接。

结论:可作为 policy baseline 或 tracker prior,不应单独作为主方法。

3.3 InterMimic trainer / per-video PPO

完整 InterMimic trainer 理论上可以学到主动接触,但不适合项目主线。

优点:

  • 是真正 action-space learning;
  • 如果训练充分,可能学到 contact force。

问题:

  • 默认是长 horizon、大 env 数、长迭代 PPO;
  • 对每条 generated/reconstructed video 都跑完整 PPO 不 scalable;
  • 乘法 reward 和 early termination 对困难 contact exploration 不友好;
  • open-oven 的关键是已知 reference 的局部 grab/contact repair,不是从零学习泛化 policy。

结论:PPO 只能作为可选 fine-tune,不应作为第一版默认。

3.4 OmniGrasp / PULSE-X / ProtoMotions 类强 tracker

这类方法最应该被当成 motion prior / tracker,而不是被替代掉。

它们的价值:

  • 保住 full-body motion naturalness;
  • 给出更稳定的 PD/action-space tracking;
  • 减少 test-time search 的变量维度;
  • 避免 CEM/MPPI 把全身动作优化得不自然;
  • 有些方法本身就包含 residual PD action 或 tracking prior。

它们仍然可能不够的地方:

  • 如果 reference 的手部 contact 本身错了,tracker 会忠实跟踪错误抓取;
  • generic tracker 不一定知道 oven handle 的可抓取区域和正确相对姿态;
  • 只跟踪 body/object 不等于学会 grab;但如果 video prior 的 hand-object contact 已经正确,tracker 能在 passive object 下复现,就已经足够;
  • articulated object 的 door hinge 需要 hand-handle contact 产生 generalized force,不是靠 object pose reward 自动得到。

结论:主方案应该先用强 tracker / motion prior 复现 reference;只有复现失败且失败来自手部 contact 时,再单独修 grab。

3.5 OmniGrasp / PHC 的 residual PD action

OmniGrasp/PHC 中最有用的工程接口是 residual PD action:

pd_target = q_ref + scale * action

这和本仓已有 resAction 思路一致。它适合做 small residual correction,而不是把 motion 从零搜出来。

结论:residual PD action 是正确接口,但搜索空间应限制在 grab/contact 修复,而不是全序列全身 motion 重优化。

3.6 PhysHOI / InterMimic reward

PhysHOI 和 InterMimic 的 reward 都偏乘法链,例如 body、object、interaction graph、contact graph 相乘。

优点:

  • reward component 覆盖了 body/object/contact/interaction;
  • 可作为 diagnostics 拆项参考。

问题:

  • 一项很差会让整体 reward 塌掉;
  • 对 articulated-object contact exploration 非常脆弱;
  • 不直接监督 object-centric grab pose;
  • 不直接针对 object joint qpos 和 moving-part pose。

结论:组件可借鉴,乘法形式不要照搬。

3.7 HOI-FHLI

HOI-FHLI 有 physics tracking,但主要针对 free rigid objects,不是 articulated hinge/prismatic object。

可借鉴:

  • wrist/finger 相对 object 的 tracking reward;
  • hand/finger/body 权重设计;
  • contactable link / bad contact termination;
  • acceleration / smoothness penalty;
  • 把 hand-object relative relation 显式放进 reward,而不是只看全局 tracking。

局限:

  • object 是 free rigid boxes;
  • 没有 object joint qpos / moving-part hinge target;
  • 训练仍是长 PPO/AMP 风格。

结论:hand-object relative reward 和 grab supervision 思想值得借鉴,整体路线不适合直接迁移。

3.8 EmbodMocap / ArtHOI

EmbodMocap 和 ArtHOI 更像 reconstruction / kinematic optimization 参考,不是 physics controller。

可借鉴:

  • staged single-sequence optimization;
  • additive loss logging;
  • contact alignment diagnostics;
  • video-prior 4D reconstruction 的 paper framing。

不能直接解决:

  • action-space control;
  • contact force;
  • passive articulated-object dynamics;
  • simulation-ready rollout。

结论:它们支持我们的 reconstruction 主线,但物理控制和抓取修复需要另做。

4. 最终方案设计

4.1 方法定位

推荐方法名:

tracker-first grasp-aware physics validation

或者更 paper-friendly:

tracking and conditional grasp repair for simulation-ready articulated HOI

核心思想:

  • reference 来自 reconstruction,且假设 full-body motion 基本可信;
  • 强 tracker / motion prior 负责保持人体整体动作自然,并优先尝试直接复现 reference;
  • 如果 passive object 成功复现,不额外修改 hand/grab;
  • 如果复现失败,并且诊断显示是手部 contact/grab 问题,再显式估计或生成 object-centric grab pose;
  • 修复只限制在 hand/wrist/finger/contact window;
  • articulated object 是 passive;
  • object joint / moving part 必须由 contact 和 physics 产生;
  • CEM/MPPI 只作为局部接触窗口的轻量 fallback,不作为全序列全身主优化器。

4.2 总体流程

推荐流程:

1. Reference tracking
   用 OmniGrasp / PULSE-X / ProtoMotions / InterMimic teacher 类强 tracker
   跟踪 reconstruction reference,保住 full-body naturalness。

2. Passive validation
   object 不写 reference qpos,检查 tracker rollout 是否能让 passive articulated
   object 复现 reference joint / moving-part motion。

3. Failure diagnosis
   如果成功,直接接受;如果失败,判断是 reference、asset、tracker/control,
   还是 hand-object grab/contact 问题。

4. Conditional grab pose extraction
   仅当失败来自 grab/contact 时,从 reference、object geometry 或 grasp prior
   中得到 T_handle_to_hand。

5. Kinematic grab repair
   用 IK / hand pose optimization 修 wrist/finger,使手在 contact frames 中对齐 grab pose。

6. Local residual physics adaptation
   只在 contact/manipulation window 优化 arms/hands residual PD action。

7. Physical validation
   rollout passive articulated object,检查 hinge qpos、moving-part pose、contact/no-slip。

这比“全序列 CEM/MPPI overfit”更快,也更能保证动作自然。更重要的是,它不会在 reference 已经正确时过度修正。

4.3 Grab Pose 从哪里来

grab pose 不是无条件必须监督。它是当 passive validation 失败,并且失败原因是手部 contact/grab 时才启用的局部修复信号。不一定需要人工标注,但需要显式构造 supervision。

来源 A:从重建 reference 提取

在 object joint qpos 开始变化附近,找到离 handle 最近、运动方向最相关的 hand,计算:

T_handle_to_hand = inv(T_world_handle) @ T_world_hand

然后在若干接触帧上做 robust average / clustering,得到 sequence-specific grab pose。

适用情况:reference 手部大体接近,但 passive validation 显示 contact 或 finger pose 不够准。

来源 B:从 object geometry / affordance 生成

对 oven handle,可以从 handle mesh 上采样 grasp candidates:

  • palm 朝向 handle;
  • wrist 位于 handle 外侧;
  • fingers 能包围 handle;
  • hand approach direction 与开门方向一致;
  • 选择最接近 reference hand pose 的 candidate。

适用情况:reference 手接触明显错位,但 object geometry 清楚。

来源 C:借鉴 HOI-FHLI / OmniGrasp 风格 prior

不是直接迁移整套训练,而是借鉴 object-centric hand-object relation:

  • hand relative to object / handle;
  • contactable finger/palm links;
  • no-slip relation;
  • finger curl / grasp shape;
  • contact timing。

适用情况:reference 手姿态弱,tracker 无法直接复现,需要一个 grab prior 补全。

4.4 Motion Naturalness 怎么保证

自然性不能靠裸 CEM/MPPI 保证,必须靠 tracker / prior 和小变量空间。

具体约束:

  • full-body 由强 tracker / motion prior 产生,不从零优化;
  • residual action 只允许小幅修正;
  • action mask 限制在 shoulder、elbow、wrist、hand;
  • pelvis、torso、legs 强 tracking;
  • foot contact / foot sliding 保持;
  • hand repair 先做 kinematic IK,再做轻量 physics adaptation;
  • loss 中保留 pose prior、velocity prior、action smoothness、joint limit、acceleration penalty。

推荐原则:

motion naturalness 由 tracker/prior 负责;
如果 reference contact 正确,grasp correctness 由 passive validation 证明;
如果 reference contact 不足,grasp correctness 由 grab pose/contact repair 补足;
physics executability 由 passive rollout 和 local residual adaptation 验证。

4.5 动作空间

使用本仓已有 resAction 思路:

pd_target_t = q_ref_t + s * a_t

其中:

  • q_ref_t 是强 tracker / reconstruction 输出的人体 reference DOF;
  • a_t 是待优化 residual action;
  • s 是 per-joint action scale;
  • 第一版只开放 arms、wrists、hands;
  • pelvis/lower body/root 保持强 tracking 或由 tracker policy 控制。

关键原则:

  • 不直接优化 object joint。object joint 必须由 contact force 产生。
  • 不全身重优化 motion。否则会慢,而且会破坏 naturalness。
  • 只有 grab/contact 失败时才修 grab pose。否则 optimizer 会过度改动本来正确的 reference。

4.6 优化器

第一版不建议全序列 CEM/MPPI。更合适的是:

第一步不是优化器,而是强 tracker 直接验证。只有失败定位到 grab/contact 后,才进入以下局部修复:

  1. IK / kinematic hand repair
  2. 变量:wrist pose、finger pose、少量 arm joints;
  3. 目标:对齐 T_handle_to_hand,减少 penetration,保持 reference 接近。

  4. Local CEM/MPPI

  5. 只在 contact/manipulation window 运行;
  6. 只优化 arms/hands residual action;
  7. population 和 iterations 可以小很多;
  8. 输出 action trace 和 per-term loss。

  9. Optional PPO / BC fine-tune

  10. 只有当局部优化能找到可行接触但动作仍不稳时启用;
  11. 不从零 PPO,使用 repaired reference / CEM trace 做 behavior cloning 或 mean-action initialization。

4.7 Loss 设计

必须使用 additive loss:

L =
  w_prior   * L_motion_prior
+ w_body    * L_body_tracking
+ w_grab    * L_relative_grab_pose
+ w_contact * L_contact
+ w_slip    * L_no_slip
+ w_finger  * L_finger_grasp
+ w_joint   * L_object_joint_qpos
+ w_part    * L_moving_part_pose
+ w_action  * L_action_l2
+ w_smooth  * L_action_smoothness
+ w_safe    * L_safety

每项含义:

  • L_motion_prior:保持接近 tracker / reconstruction reference,保证自然性;
  • L_body_tracking:root/body/key joint tracking;
  • L_relative_grab_pose:hand 相对 handle 的 pose 接近 grab pose;
  • L_contact:contact frames 内 finger/palm 到 handle/contact region 的距离;
  • L_no_slip:grasp phase 内 hand-handle relative pose/velocity 不乱滑;
  • L_finger_grasp:finger curl / hand shape 合理;
  • L_object_joint_qpos:hinge/prismatic qpos error;
  • L_moving_part_pose:door/panel moving-part world pose error;
  • L_action_l2:避免 residual 过大;
  • L_action_smoothness:避免动作抖动;
  • L_safety:fall、penetration、joint-limit violation、bad ground contact、过大 force。

不要用乘法 reward 作为主目标。乘法 reward 可以保留为对比或 diagnostics。

4.8 open-oven 分阶段 schedule

Stage A: Preflight diagnostics

  • reference hand 是否到 handle 附近;
  • handle mesh / contact region 是否存在;
  • object joint axis / limit / initial qpos 是否正确;
  • moving-part FK 是否和 visual reference 对齐;
  • collider、mass、friction 是否合理;
  • passive object 是否能被力推动。

Stage B: Tracker rollout

用强 tracker / motion prior 跟踪 full-body reference。
如果这一步 body tracking 都不自然,先修 tracker;不要进入 grab repair。

Stage C: Failure diagnosis

如果 tracker rollout 已经复现 passive object joint / moving-part motion,就直接接受这条序列。只有失败时才判断原因:

  • reference hand/contact 是否不合理;
  • handle/contact collider 是否不合理;
  • tracker/PD 是否无法产生足够接触;
  • object asset 物理参数是否错误。

Stage D: Conditional grab extraction / generation

生成 T_handle_to_hand 和 contact schedule:

  • approach phase;
  • grasp phase;
  • manipulate phase;
  • release phase,可选。

Stage E: Kinematic grab repair

先用 IK / hand pose optimization 修 wrist/finger,使接触窗口内手和 handle 对齐。

Stage F: Local residual physics adaptation

只在 grasp/manipulate 窗口优化 arms/hands residual PD action,检查 passive hinge 是否真的打开。

Stage G: Optional polish

只在必要时做少量 CEM/MPPI 或 BC/PPO fine-tune,目标是 smooth 和稳定,不是从零找 motion。

5. 诊断与指标建议

5.1 每条序列必须输出

  • physical rollout;
  • tracker output / repaired reference;
  • residual action trace;
  • per-frame body tracking error;
  • per-frame hand-to-handle distance;
  • relative grab pose error;仅在启用 grab repair 时必需
  • no-slip error;仅在启用 grab repair 时必需
  • finger grasp / curl diagnostics;仅在启用 grab repair 时必需
  • object joint qpos curve;
  • moving-part pose error;
  • contact success frames;
  • action magnitude / smoothness;
  • penetration / fall / bad contact flags;
  • failure reason。

5.2 open-oven 成功标准

至少满足:

  • full-body motion natural,不因 optimization 变形;
  • hand 在正确时间接近 handle;
  • 如果没有启用 grab repair,则 passive rollout 能复现 door motion 本身就是 reference contact 正确的证据;
  • 如果启用 grab repair,则 fingers/palm/wrist 相对 handle 的 grab pose 合理;
  • 如果启用 grab repair,则 grasp phase 内 hand-handle relative pose 稳定,不明显滑动;
  • passive hinge qpos 由 contact 推动变化;
  • final hinge angle 接近 reference;
  • moving-part pose 接近 reference;
  • humanoid 没有明显摔倒或穿透;
  • residual action 不异常大,不高频抖动。

5.3 failure taxonomy

建议把失败分成六类:

  • reference_error:重建的 body/object/contact 本身不合理;
  • grab_error:手到 handle 了,但相对姿态不对,无法抓取;
  • asset_error:joint axis、limit、scale、collider、mass/friction 不合理;
  • contact_geometry_error:handle collider 不可用,或 hand/contact region 对不上;
  • control_error:tracker、PD gain、action mask、root handling 不合理;
  • optimizer_error:local repair / CEM budget、loss weights、window schedule 不够。

这样每次失败都能指导下一步,而不是只得到“物理没成功”。

6. Baseline / Ablation 建议

论文和工程验证可以设置这些 baseline:

方法 用途 预期结论
Kinematic replay 上限可视化 / reference sanity 只能说明 reference 是否像
Passive rollout asset/contact sanity 看 object 是否能被接触影响
Dynamic replay 半物理 debug human DOF 有 PD,但 root 仍 teleport
Strong tracker only 主验证 baseline 若能复现,说明 reference/tracker/contact 已闭环
Tracker + grab IK repair 条件抓取修复 baseline 只在 tracker-only 失败且定位到 grab 时使用
Tracker + grab-aware residual physics 条件主方法 保自然、局部修 grab、验证 passive articulation
Per-video PPO heavy RL baseline 可能有效但慢

关键 ablation:

  • with / without strong tracker prior;
  • tracker-only success vs grab-repair-needed cases;
  • with / without grab pose supervision;只在失败子集上评估
  • with / without no-slip loss;只在失败子集上评估
  • kinematic grab repair only vs physics residual adaptation;
  • residual action vs absolute PD action;
  • additive loss vs multiplicative reward;
  • upper-body-only action mask vs full-body action;
  • with / without moving-part pose loss;
  • local contact-window search vs full-sequence search;
  • local CEM/MPPI vs PPO fine-tune。

7. Paper 定位建议

建议主线不要写成:

Fast Physicalization of ...

因为这会让读者以为贡献主要在物理化,而忽略 videogen/reconstruction。

也不要只写成:

Reconstructing ... from Videos

因为这会削弱 simulation-ready physics data 的贡献。

更合适的定位是:

Generating Simulation-Ready Articulated Human-Object Interaction Data from Video Priors

或:

Reconstructing and Grasp-Aware Physical Adaptation of Articulated Human-Object Interactions from Video Priors

核心贡献可以写成三点:

  1. scalable video-prior / videogen based articulated HOI data generation;
  2. monocular reconstruction of human, object articulation, moving part and contact state;
  3. tracker-first physical validation with conditional hand-object grab repair, turning reconstructed reference into executable simulation data。

8. 实施建议

优先级建议:

  1. 不要先做全序列 CEM/MPPI 或从零 PPO。
    如果 reference 已经好,慢优化会破坏 naturalness,也是不必要的。

  2. 先接强 tracker / motion prior。
    OmniGrasp、PULSE-X、ProtoMotions 或同类 tracker 的作用是保住自然 full-body motion。

  3. 先做 passive validation。
    object 不写 qpos,只看 tracker rollout 是否能让 hinge/moving part 复现 reference。

  4. 只有失败定位到 grab/contact 时,才做 open-oven 的 handle/grab 表示。
    明确 handle contact region、T_handle_to_hand、approach/grasp/manipulate schedule。

  5. 再做 kinematic grab repair。
    用 IK / hand pose optimization 修 wrist/finger,让手真的抓住 handle。

  6. 再做局部 residual physics adaptation。
    只在接触窗口、只对 arms/hands 搜小 residual,验证 passive hinge 是否打开。

  7. 每次 rollout 必须保存 validation diagnostics;grab diagnostics 只在修复分支必需。
    tracker-only 成功样本主要看 passive object joint/moving-part/contact;修复样本再看 relative grab pose / no-slip / contact frame。

  8. PPO 只放在后面。
    如果 local repair 已经可行但动作仍不稳,再考虑 BC/PPO smooth 或 distill;不要把 per-video PPO 当主路径。

  9. 论文叙事要同时强调 reconstruction、tracker-first validation 和 conditional grasp repair。
    我们的差异点不是“比 ArtHOI 多一个物理后处理”,而是把 video-prior 4D HOI 变成可执行的 articulated interaction data。

9. 当前结论

本项目目前最清晰的技术路线是:

video/videogen
  -> articulated HOI reconstruction
  -> strong tracker / motion prior
  -> passive articulated-object validation
  -> if success: accept simulation-ready rollout
  -> if grab/contact failure: object-centric grab pose extraction
  -> local hand/contact repair
  -> residual PD action physics adaptation on contact windows
  -> simulation-ready rollout + action trace + validation/grab diagnostics

这条路线比 per-video PPO 更快,比裸 residual action overfit 更自然,也比 replay 更符合最终目标。关键不是“重新优化整段 motion”,而是:reference 已经够好时,先直接用强 tracker + passive object 验证;只有验证失败且问题来自 hand-object contact 时,才修 grab。