ArtHOI4D 物理追踪与抓取修复方案报告,2026-04-28¶
0. 给无上下文 LLM Agent 的项目背景¶
这份报告讨论的是 ArtHOI4D 的物理追踪和抓取修复方案。不要把本项目理解成“给一段现成视频做物理化”,也不要把它简化成“在 InterMimic 里调 reward”。更准确的目标是:构建一条 scalable articulated HOI 数据生成 pipeline,从 video prior / videogen 或真实视频出发,重建 human motion、articulated object pose、part articulation 和 contact,再把这条 reference 转成 simulation-ready 的物理交互数据。
项目主线可以概括成:
video prior / videogen / real video
-> monocular 4D articulated HOI reconstruction
-> passive articulated-object validation
-> strong tracker / motion prior tracking
-> conditional grab/contact repair
-> simulation-ready articulated HOI data
当前压力测试 case 是 open-oven。它的难点不是“门角度曲线看起来对”,而是:人体在物理仿真里通过手和 handle / door contact 推动 passive hinge door,使 oven door 的 articulated joint qpos 和 moving-part pose 接近重建 reference,同时 full-body motion 保持自然。
0.1 现在代码已经实现的步骤¶
仓库里已经有从视频到重建、再到物理回放/诊断的基本链路:
videogen/ asset 侧:已有 object asset、render input、canonical articulated asset 等接口,用来服务 video generation 和后续 recon / mimic。recon侧:configs/methods/recon/ours_global_opt.yaml默认使用motion.model: "sam3d_body",即当前更强的 SAM3D-Body HMR/4D body motion 路线;同时跑 segmentation、depth、human-depth alignment、point tracks 和 object global optimization。recon输出:pipeline/reconstruction/optimization/run.py会写result.pt,里面包含human的 SMPL-X 参数、object.pose、object.joint_values、object.scale、camera/world transform 和 loss 信息。physics侧:以case JSON + result.pt为唯一公共输入,PHC-X、InterMimic、RePHO 与 ours 各自只保留 method-local native adapter。- 所有正式 rollout 都转换成 exact
common_rollout.npz;二元 evaluator、common renderer 和 Viser 不读取 native 输出。旧 MuJoCophys_refine、dynamic replay 与 noop optimizer 已删除。
0.2 重建阶段已有的约束¶
重建不是裸 HMR replay。现在 recon optimization 已经实现了多种观测和几何约束,主要在 pipeline/reconstruction/optimization/solver/losses.py 和 configs/methods/recon/ours_global_opt.yaml:
- 2D / tracking:
track_2d,以及 mask Dice/BCE、mask center、可选 RGB tracking。 - depth:object rendered depth 和 monocular metric depth 对齐。
- contact:手部点到 object/contact region 的距离约束,支持 contact window / dilation / top-k region 等设定。
- penetration:人体/手与 object mesh 的穿透惩罚。
- support plane:地面/支撑面约束、object z anchor。
- human-facing:
hfacing,用于减少物体朝向不合理的初始化/优化结果。 - temporal smoothness:
smooth_rot、smooth_trans、smooth_joint。 - no-contact motion:在非交互窗口惩罚 hinge/slider 乱动。
- joint limit:hinge / slider 的关节范围惩罚。
这些 loss 对 object pose、articulation、scale、mask/depth alignment 很重要,也能提供 contact cue;但它们仍然不是一个 object-centric grab controller。也就是说,recon 阶段可以让“画面和轨迹更对”,不能保证手一定以正确抓取姿态贴到 oven handle 上。
0.3 当前进展¶
目前比较明确的进展是:
- SAM3D-Body 路线已经接入为默认 human motion provider,比早期 GVHMR / hand-refine 路线更适合做全身 motion reference。
- 对 open-oven 这类序列,full-body human motion 大体已经可用,适合作 strong tracker / motion prior 的 reference。
- object root pose、object scale、hinge/slider joint values 已通过 recon optimization 输出,能作为 passive object validation 的目标。
- Isaac / InterMimic 侧已经能跑 passive articulated-object replay / dynamic replay,适合检查 asset、joint axis、scale、contact region 和 qpos 曲线是否闭环。
0.4 当前主要问题¶
现在失败的核心不是“没有一个更慢的全局 optimizer”,而是 reference 和 tracker 之间缺少 object-centric grab 修复:
- 即使 SAM3D-Body 是很强的 HMR 方法,单目视频下 hand/world 对齐仍可能有 10-20cm 误差;对 open-oven 来说,这已经足以让手碰不到 handle。
- 手在交互时经常被物体遮挡,HMR/hand prior 可以让手形更自然,但不一定知道 oven handle 的可抓取区域和正确相对姿态。
- 如果 reference 里的手已经偏离 handle,后面的 tracker 只会忠实跟踪这个错误 reference;没有显式 grab/contact target 时,很难“自动优化回来”。
- 当前 RL / InterMimic tracking 方案没有真正的 object-centric grasp supervision:没有稳定的 handle contact anchor、没有
T_handle_to_hand/ no-slip 约束、没有针对 active hand 的抓取姿态修复。 - 因此现在 RL 部分失败是预期的:它可以追人体、追 object qpos,但如果没有先把手放到能产生 contact force 的位置,passive hinge door 不会被正确打开。
0.5 给下一个 LLM Agent 的分析重点¶
后续分析不要从“每条视频训练 PPO”或“全序列 test-time optimization”开始。更合理的方向是:
- 首先判断:当前 reference 在 passive object 下能不能被强 tracker 复现?如果能复现,说明 video prior / reconstruction / contact 已经足够好,不需要额外修 grab。
- 如果失败,先做 failure diagnosis:是 asset/joint axis/collider/scale/friction 错,还是 hand-handle contact 错。
- 如果定位到 hand contact,再做局部 grab repair:只改 active hand、wrist、forearm 和接触窗口,保留 SAM3D-Body / tracker 给出的全身自然 motion。
- grab repair 应显式使用 object/handle 局部坐标:active hand、handle/contact surface、
T_handle_to_hand、contact window、no-slip、penetration、joint qpos/moving-part target。 - motion naturalness 应主要由强 tracker / motion prior 保证,例如 OmniGrasp、PULSE-X、ProtoMotions 或 InterMimic teacher,而不是靠全身 CEM/MPPI 从零搜索。
关键判断标准是:如果 reference 本身正确,passive articulated-object validation 能复现就是强证据;如果复现不了,不要盲目加大 RL,而应优先修复 grab/contact reference。
1. 一句话结论¶
本项目不应该被定义成“把现成视频物理化”,也不应该被定义成“复现 InterMimic tracking”。更准确的目标是:从 video prior / videogen 生成或获得视频,重建 articulated HOI 的 4D reference,再通过抓取修复和物理控制把它转成 simulation-ready 的人-可动部件物体交互数据。
当前更合理的方案不是全序列从零优化 motion,也不是为每条视频训练 PPO。假设 video prior / reconstruction reference 已经足够好,那么第一目标应该是:用强 tracker / motion prior 在 passive articulated object 下复现这条 reference。如果能复现,说明 reference、asset、contact 和 tracker 在这条序列上已经闭环,不需要额外修 grab。只有当复现失败,并且失败定位到手部 contact/grab 时,才进入局部抓取修复。
strong tracker / motion prior
-> passive articulated-object validation
-> failure diagnosis
-> optional local grab/contact repair
-> lightweight residual physics adaptation
也就是 tracker-first, grab-repair-if-needed:用 OmniGrasp、PULSE-X、ProtoMotions 或同类强 tracker / motion prior 保住整体 motion naturalness,先直接验证 passive object 是否能被正确复现;若不行,再只在手、手腕、前臂和接触窗口内修 grab。
2. 项目目标分析¶
2.1 最终目标¶
系统最终要完成一条 scalable pipeline:
video prior / videogen
-> monocular 4D articulated HOI reconstruction
-> grasp-aware tracking and physics adaptation
-> simulation-ready articulated HOI data
这条 pipeline 需要同时证明:
- 重建有效:能恢复 human motion、hand pose、object root pose、articulated joint values、moving-part pose、contact/camera/world metadata。
- 动作自然:full-body motion 不应被黑盒优化破坏,应该由 reference tracker / motion prior 保持自然性。
- 抓取正确或可验证:如果 reference 里 hand-object contact 已经正确,passive rollout 复现本身就是强证据;如果复现失败,才需要显式估计 grab pose 并修复手部 contact。
- 物理可执行:humanoid 不能只是逐帧 teleport,而要通过 PD/action-space control 与 passive articulated object 接触,并在仿真中产生合理的 hinge/prismatic motion。
- 可扩展:方法要能服务大量 videogen/recon 序列,不能默认每条视频跑很久的从零 RL training。
2.2 open-oven 的意义¶
open-oven 不是最终任务定义,而是 stress test。它要求:
- hand/wrist 在正确时间到达 handle 或 door contact region;
- fingers/palm/wrist 相对 handle 的姿态像一个合理抓取,而不是只靠近;
- 抓住后 hand-handle relative pose 不乱滑;
- object root/cabinet 不乱动;
- oven door hinge qpos 是被手接触推开的,而不是从 reference 直接写进去;
- final hinge angle 和 moving-part pose 接近重建 reference;
- action trace 平滑,没有明显穿透、摔倒或不合理力。
因此,只看 replay video 像不像是不够的。成功标准必须包含 motion naturalness、passive physics rollout、contact stability、object joint 和 action diagnostics。grab pose supervision 是失败修复工具,不是所有成功样本都必须额外施加的约束。
3. 当前 Baseline 分析¶
3.1 当前本仓默认路径:dynamic replay / noop¶
当前 physics method config 默认接近 noop + dynamic_replay。这条路径可以做诊断,但不能作为最终方法。
优点:
- 快;
- 能验证 asset/import/reference 是否基本对齐;
- 能读出一些 object joint qpos、moving-part proxy 等诊断信息;
- 适合作 preflight classifier。
问题:
- human root 仍逐帧 teleport;
- 当前路径更像“半物理 replay”,不是完整 action-space tracking;
- 如果物体能打开,可能来自 reference 或 replay 语义,不一定证明 humanoid 通过 contact 真实打开;
- 如果物体打不开,也不能直接判断是 tracker 不行,可能是 asset、joint axis、collider、scale、handle geometry 或 friction 问题;
- 它不修手部 grab pose。
结论:保留 replay,但只作为 diagnostics。
3.2 InterMimic tracker / teacher¶
InterMimic tracker 可以提供一个真实 policy inference 参考,但它不是完整答案。
优点:
- 有现成 IsaacGym/InterMimic env;
- 使用 PD/action-space control;
- 代码里已有 teacher/tracker runner,可作为环境构建参考。
问题:
- pretrained policy 不一定覆盖我们的 articulated HOI / open-oven distribution;
- object/contact reward 偏乘法链,容易一项差就整体信号归零;
- teacher inference 不是针对单条视频修复 hand-object grab;
- 对 passive articulated object 的 qpos/moving-part 目标不够直接。
结论:可作为 policy baseline 或 tracker prior,不应单独作为主方法。
3.3 InterMimic trainer / per-video PPO¶
完整 InterMimic trainer 理论上可以学到主动接触,但不适合项目主线。
优点:
- 是真正 action-space learning;
- 如果训练充分,可能学到 contact force。
问题:
- 默认是长 horizon、大 env 数、长迭代 PPO;
- 对每条 generated/reconstructed video 都跑完整 PPO 不 scalable;
- 乘法 reward 和 early termination 对困难 contact exploration 不友好;
- open-oven 的关键是已知 reference 的局部 grab/contact repair,不是从零学习泛化 policy。
结论:PPO 只能作为可选 fine-tune,不应作为第一版默认。
3.4 OmniGrasp / PULSE-X / ProtoMotions 类强 tracker¶
这类方法最应该被当成 motion prior / tracker,而不是被替代掉。
它们的价值:
- 保住 full-body motion naturalness;
- 给出更稳定的 PD/action-space tracking;
- 减少 test-time search 的变量维度;
- 避免 CEM/MPPI 把全身动作优化得不自然;
- 有些方法本身就包含 residual PD action 或 tracking prior。
它们仍然可能不够的地方:
- 如果 reference 的手部 contact 本身错了,tracker 会忠实跟踪错误抓取;
- generic tracker 不一定知道 oven handle 的可抓取区域和正确相对姿态;
- 只跟踪 body/object 不等于学会 grab;但如果 video prior 的 hand-object contact 已经正确,tracker 能在 passive object 下复现,就已经足够;
- articulated object 的 door hinge 需要 hand-handle contact 产生 generalized force,不是靠 object pose reward 自动得到。
结论:主方案应该先用强 tracker / motion prior 复现 reference;只有复现失败且失败来自手部 contact 时,再单独修 grab。
3.5 OmniGrasp / PHC 的 residual PD action¶
OmniGrasp/PHC 中最有用的工程接口是 residual PD action:
这和本仓已有 resAction 思路一致。它适合做 small residual correction,而不是把 motion 从零搜出来。
结论:residual PD action 是正确接口,但搜索空间应限制在 grab/contact 修复,而不是全序列全身 motion 重优化。
3.6 PhysHOI / InterMimic reward¶
PhysHOI 和 InterMimic 的 reward 都偏乘法链,例如 body、object、interaction graph、contact graph 相乘。
优点:
- reward component 覆盖了 body/object/contact/interaction;
- 可作为 diagnostics 拆项参考。
问题:
- 一项很差会让整体 reward 塌掉;
- 对 articulated-object contact exploration 非常脆弱;
- 不直接监督 object-centric grab pose;
- 不直接针对 object joint qpos 和 moving-part pose。
结论:组件可借鉴,乘法形式不要照搬。
3.7 HOI-FHLI¶
HOI-FHLI 有 physics tracking,但主要针对 free rigid objects,不是 articulated hinge/prismatic object。
可借鉴:
- wrist/finger 相对 object 的 tracking reward;
- hand/finger/body 权重设计;
- contactable link / bad contact termination;
- acceleration / smoothness penalty;
- 把 hand-object relative relation 显式放进 reward,而不是只看全局 tracking。
局限:
- object 是 free rigid boxes;
- 没有 object joint qpos / moving-part hinge target;
- 训练仍是长 PPO/AMP 风格。
结论:hand-object relative reward 和 grab supervision 思想值得借鉴,整体路线不适合直接迁移。
3.8 EmbodMocap / ArtHOI¶
EmbodMocap 和 ArtHOI 更像 reconstruction / kinematic optimization 参考,不是 physics controller。
可借鉴:
- staged single-sequence optimization;
- additive loss logging;
- contact alignment diagnostics;
- video-prior 4D reconstruction 的 paper framing。
不能直接解决:
- action-space control;
- contact force;
- passive articulated-object dynamics;
- simulation-ready rollout。
结论:它们支持我们的 reconstruction 主线,但物理控制和抓取修复需要另做。
4. 最终方案设计¶
4.1 方法定位¶
推荐方法名:
或者更 paper-friendly:
核心思想:
- reference 来自 reconstruction,且假设 full-body motion 基本可信;
- 强 tracker / motion prior 负责保持人体整体动作自然,并优先尝试直接复现 reference;
- 如果 passive object 成功复现,不额外修改 hand/grab;
- 如果复现失败,并且诊断显示是手部 contact/grab 问题,再显式估计或生成 object-centric grab pose;
- 修复只限制在 hand/wrist/finger/contact window;
- articulated object 是 passive;
- object joint / moving part 必须由 contact 和 physics 产生;
- CEM/MPPI 只作为局部接触窗口的轻量 fallback,不作为全序列全身主优化器。
4.2 总体流程¶
推荐流程:
1. Reference tracking
用 OmniGrasp / PULSE-X / ProtoMotions / InterMimic teacher 类强 tracker
跟踪 reconstruction reference,保住 full-body naturalness。
2. Passive validation
object 不写 reference qpos,检查 tracker rollout 是否能让 passive articulated
object 复现 reference joint / moving-part motion。
3. Failure diagnosis
如果成功,直接接受;如果失败,判断是 reference、asset、tracker/control,
还是 hand-object grab/contact 问题。
4. Conditional grab pose extraction
仅当失败来自 grab/contact 时,从 reference、object geometry 或 grasp prior
中得到 T_handle_to_hand。
5. Kinematic grab repair
用 IK / hand pose optimization 修 wrist/finger,使手在 contact frames 中对齐 grab pose。
6. Local residual physics adaptation
只在 contact/manipulation window 优化 arms/hands residual PD action。
7. Physical validation
rollout passive articulated object,检查 hinge qpos、moving-part pose、contact/no-slip。
这比“全序列 CEM/MPPI overfit”更快,也更能保证动作自然。更重要的是,它不会在 reference 已经正确时过度修正。
4.3 Grab Pose 从哪里来¶
grab pose 不是无条件必须监督。它是当 passive validation 失败,并且失败原因是手部 contact/grab 时才启用的局部修复信号。不一定需要人工标注,但需要显式构造 supervision。
来源 A:从重建 reference 提取
在 object joint qpos 开始变化附近,找到离 handle 最近、运动方向最相关的 hand,计算:
然后在若干接触帧上做 robust average / clustering,得到 sequence-specific grab pose。
适用情况:reference 手部大体接近,但 passive validation 显示 contact 或 finger pose 不够准。
来源 B:从 object geometry / affordance 生成
对 oven handle,可以从 handle mesh 上采样 grasp candidates:
- palm 朝向 handle;
- wrist 位于 handle 外侧;
- fingers 能包围 handle;
- hand approach direction 与开门方向一致;
- 选择最接近 reference hand pose 的 candidate。
适用情况:reference 手接触明显错位,但 object geometry 清楚。
来源 C:借鉴 HOI-FHLI / OmniGrasp 风格 prior
不是直接迁移整套训练,而是借鉴 object-centric hand-object relation:
- hand relative to object / handle;
- contactable finger/palm links;
- no-slip relation;
- finger curl / grasp shape;
- contact timing。
适用情况:reference 手姿态弱,tracker 无法直接复现,需要一个 grab prior 补全。
4.4 Motion Naturalness 怎么保证¶
自然性不能靠裸 CEM/MPPI 保证,必须靠 tracker / prior 和小变量空间。
具体约束:
- full-body 由强 tracker / motion prior 产生,不从零优化;
- residual action 只允许小幅修正;
- action mask 限制在 shoulder、elbow、wrist、hand;
- pelvis、torso、legs 强 tracking;
- foot contact / foot sliding 保持;
- hand repair 先做 kinematic IK,再做轻量 physics adaptation;
- loss 中保留 pose prior、velocity prior、action smoothness、joint limit、acceleration penalty。
推荐原则:
motion naturalness 由 tracker/prior 负责;
如果 reference contact 正确,grasp correctness 由 passive validation 证明;
如果 reference contact 不足,grasp correctness 由 grab pose/contact repair 补足;
physics executability 由 passive rollout 和 local residual adaptation 验证。
4.5 动作空间¶
使用本仓已有 resAction 思路:
其中:
q_ref_t是强 tracker / reconstruction 输出的人体 reference DOF;a_t是待优化 residual action;s是 per-joint action scale;- 第一版只开放 arms、wrists、hands;
- pelvis/lower body/root 保持强 tracking 或由 tracker policy 控制。
关键原则:
- 不直接优化 object joint。object joint 必须由 contact force 产生。
- 不全身重优化 motion。否则会慢,而且会破坏 naturalness。
- 只有 grab/contact 失败时才修 grab pose。否则 optimizer 会过度改动本来正确的 reference。
4.6 优化器¶
第一版不建议全序列 CEM/MPPI。更合适的是:
第一步不是优化器,而是强 tracker 直接验证。只有失败定位到 grab/contact 后,才进入以下局部修复:
- IK / kinematic hand repair
- 变量:wrist pose、finger pose、少量 arm joints;
-
目标:对齐
T_handle_to_hand,减少 penetration,保持 reference 接近。 -
Local CEM/MPPI
- 只在 contact/manipulation window 运行;
- 只优化 arms/hands residual action;
- population 和 iterations 可以小很多;
-
输出 action trace 和 per-term loss。
-
Optional PPO / BC fine-tune
- 只有当局部优化能找到可行接触但动作仍不稳时启用;
- 不从零 PPO,使用 repaired reference / CEM trace 做 behavior cloning 或 mean-action initialization。
4.7 Loss 设计¶
必须使用 additive loss:
L =
w_prior * L_motion_prior
+ w_body * L_body_tracking
+ w_grab * L_relative_grab_pose
+ w_contact * L_contact
+ w_slip * L_no_slip
+ w_finger * L_finger_grasp
+ w_joint * L_object_joint_qpos
+ w_part * L_moving_part_pose
+ w_action * L_action_l2
+ w_smooth * L_action_smoothness
+ w_safe * L_safety
每项含义:
L_motion_prior:保持接近 tracker / reconstruction reference,保证自然性;L_body_tracking:root/body/key joint tracking;L_relative_grab_pose:hand 相对 handle 的 pose 接近 grab pose;L_contact:contact frames 内 finger/palm 到 handle/contact region 的距离;L_no_slip:grasp phase 内 hand-handle relative pose/velocity 不乱滑;L_finger_grasp:finger curl / hand shape 合理;L_object_joint_qpos:hinge/prismatic qpos error;L_moving_part_pose:door/panel moving-part world pose error;L_action_l2:避免 residual 过大;L_action_smoothness:避免动作抖动;L_safety:fall、penetration、joint-limit violation、bad ground contact、过大 force。
不要用乘法 reward 作为主目标。乘法 reward 可以保留为对比或 diagnostics。
4.8 open-oven 分阶段 schedule¶
Stage A: Preflight diagnostics
- reference hand 是否到 handle 附近;
- handle mesh / contact region 是否存在;
- object joint axis / limit / initial qpos 是否正确;
- moving-part FK 是否和 visual reference 对齐;
- collider、mass、friction 是否合理;
- passive object 是否能被力推动。
Stage B: Tracker rollout
用强 tracker / motion prior 跟踪 full-body reference。
如果这一步 body tracking 都不自然,先修 tracker;不要进入 grab repair。
Stage C: Failure diagnosis
如果 tracker rollout 已经复现 passive object joint / moving-part motion,就直接接受这条序列。只有失败时才判断原因:
- reference hand/contact 是否不合理;
- handle/contact collider 是否不合理;
- tracker/PD 是否无法产生足够接触;
- object asset 物理参数是否错误。
Stage D: Conditional grab extraction / generation
生成 T_handle_to_hand 和 contact schedule:
- approach phase;
- grasp phase;
- manipulate phase;
- release phase,可选。
Stage E: Kinematic grab repair
先用 IK / hand pose optimization 修 wrist/finger,使接触窗口内手和 handle 对齐。
Stage F: Local residual physics adaptation
只在 grasp/manipulate 窗口优化 arms/hands residual PD action,检查 passive hinge 是否真的打开。
Stage G: Optional polish
只在必要时做少量 CEM/MPPI 或 BC/PPO fine-tune,目标是 smooth 和稳定,不是从零找 motion。
5. 诊断与指标建议¶
5.1 每条序列必须输出¶
- physical rollout;
- tracker output / repaired reference;
- residual action trace;
- per-frame body tracking error;
- per-frame hand-to-handle distance;
- relative grab pose error;仅在启用 grab repair 时必需
- no-slip error;仅在启用 grab repair 时必需
- finger grasp / curl diagnostics;仅在启用 grab repair 时必需
- object joint qpos curve;
- moving-part pose error;
- contact success frames;
- action magnitude / smoothness;
- penetration / fall / bad contact flags;
- failure reason。
5.2 open-oven 成功标准¶
至少满足:
- full-body motion natural,不因 optimization 变形;
- hand 在正确时间接近 handle;
- 如果没有启用 grab repair,则 passive rollout 能复现 door motion 本身就是 reference contact 正确的证据;
- 如果启用 grab repair,则 fingers/palm/wrist 相对 handle 的 grab pose 合理;
- 如果启用 grab repair,则 grasp phase 内 hand-handle relative pose 稳定,不明显滑动;
- passive hinge qpos 由 contact 推动变化;
- final hinge angle 接近 reference;
- moving-part pose 接近 reference;
- humanoid 没有明显摔倒或穿透;
- residual action 不异常大,不高频抖动。
5.3 failure taxonomy¶
建议把失败分成六类:
reference_error:重建的 body/object/contact 本身不合理;grab_error:手到 handle 了,但相对姿态不对,无法抓取;asset_error:joint axis、limit、scale、collider、mass/friction 不合理;contact_geometry_error:handle collider 不可用,或 hand/contact region 对不上;control_error:tracker、PD gain、action mask、root handling 不合理;optimizer_error:local repair / CEM budget、loss weights、window schedule 不够。
这样每次失败都能指导下一步,而不是只得到“物理没成功”。
6. Baseline / Ablation 建议¶
论文和工程验证可以设置这些 baseline:
| 方法 | 用途 | 预期结论 |
|---|---|---|
| Kinematic replay | 上限可视化 / reference sanity | 只能说明 reference 是否像 |
| Passive rollout | asset/contact sanity | 看 object 是否能被接触影响 |
| Dynamic replay | 半物理 debug | human DOF 有 PD,但 root 仍 teleport |
| Strong tracker only | 主验证 baseline | 若能复现,说明 reference/tracker/contact 已闭环 |
| Tracker + grab IK repair | 条件抓取修复 baseline | 只在 tracker-only 失败且定位到 grab 时使用 |
| Tracker + grab-aware residual physics | 条件主方法 | 保自然、局部修 grab、验证 passive articulation |
| Per-video PPO | heavy RL baseline | 可能有效但慢 |
关键 ablation:
- with / without strong tracker prior;
- tracker-only success vs grab-repair-needed cases;
- with / without grab pose supervision;只在失败子集上评估
- with / without no-slip loss;只在失败子集上评估
- kinematic grab repair only vs physics residual adaptation;
- residual action vs absolute PD action;
- additive loss vs multiplicative reward;
- upper-body-only action mask vs full-body action;
- with / without moving-part pose loss;
- local contact-window search vs full-sequence search;
- local CEM/MPPI vs PPO fine-tune。
7. Paper 定位建议¶
建议主线不要写成:
因为这会让读者以为贡献主要在物理化,而忽略 videogen/reconstruction。
也不要只写成:
因为这会削弱 simulation-ready physics data 的贡献。
更合适的定位是:
或:
Reconstructing and Grasp-Aware Physical Adaptation of Articulated Human-Object Interactions from Video Priors
核心贡献可以写成三点:
- scalable video-prior / videogen based articulated HOI data generation;
- monocular reconstruction of human, object articulation, moving part and contact state;
- tracker-first physical validation with conditional hand-object grab repair, turning reconstructed reference into executable simulation data。
8. 实施建议¶
优先级建议:
-
不要先做全序列 CEM/MPPI 或从零 PPO。
如果 reference 已经好,慢优化会破坏 naturalness,也是不必要的。 -
先接强 tracker / motion prior。
OmniGrasp、PULSE-X、ProtoMotions 或同类 tracker 的作用是保住自然 full-body motion。 -
先做 passive validation。
object 不写 qpos,只看 tracker rollout 是否能让 hinge/moving part 复现 reference。 -
只有失败定位到 grab/contact 时,才做 open-oven 的 handle/grab 表示。
明确 handle contact region、T_handle_to_hand、approach/grasp/manipulate schedule。 -
再做 kinematic grab repair。
用 IK / hand pose optimization 修 wrist/finger,让手真的抓住 handle。 -
再做局部 residual physics adaptation。
只在接触窗口、只对 arms/hands 搜小 residual,验证 passive hinge 是否打开。 -
每次 rollout 必须保存 validation diagnostics;grab diagnostics 只在修复分支必需。
tracker-only 成功样本主要看 passive object joint/moving-part/contact;修复样本再看 relative grab pose / no-slip / contact frame。 -
PPO 只放在后面。
如果 local repair 已经可行但动作仍不稳,再考虑 BC/PPO smooth 或 distill;不要把 per-video PPO 当主路径。 -
论文叙事要同时强调 reconstruction、tracker-first validation 和 conditional grasp repair。
我们的差异点不是“比 ArtHOI 多一个物理后处理”,而是把 video-prior 4D HOI 变成可执行的 articulated interaction data。
9. 当前结论¶
本项目目前最清晰的技术路线是:
video/videogen
-> articulated HOI reconstruction
-> strong tracker / motion prior
-> passive articulated-object validation
-> if success: accept simulation-ready rollout
-> if grab/contact failure: object-centric grab pose extraction
-> local hand/contact repair
-> residual PD action physics adaptation on contact windows
-> simulation-ready rollout + action trace + validation/grab diagnostics
这条路线比 per-video PPO 更快,比裸 residual action overfit 更自然,也比 replay 更符合最终目标。关键不是“重新优化整段 motion”,而是:reference 已经够好时,先直接用强 tracker + passive object 验证;只有验证失败且问题来自 hand-object contact 时,才修 grab。