MUJOCO 双手操作实验

第三只手

LLM 负责规划。
小型触觉模型负责控制。

两只手需要把托盘推出重力门。LLM 决定如何用方块支撑门、下一步让哪只手移动;一个 52 万参数的小模型根据触觉和手的状态,每 10 毫秒调整一次手的位置。测得的接触和运动结果再返回给 LLM,影响下一次规划。

LLM 任务规划0.52M 触觉模型参数100 Hz 局部控制8 N 每手力上限
01

托住门

02

把方块推到门下

03

卸力并检查支撑

04

双手推盘

01 / 研究动机

探索视觉之外的物理智能。

本项目考察通用 LLM 能否利用力、接触和运动等非视觉物理反馈,修正操作决策。系统借鉴人的运动控制分层:高层接收全模态信息,以较低频率更新任务意图;低层只接收受限的触觉和本体信息,以较高频率更新手部动作。

问题 01

LLM 能否利用接触信息?

观察结构化触觉和力反馈是否会改变双手分工、支撑判断和力上限。

问题 02

速率分层能否减少重复规划?

LLM 提供子目标,小型触觉 MLP 在两次 LLM 调用之间维持局部接触。速率分层服务于更快的局部控制回路。

研究范围。 本研究在一个双手 MuJoCo 任务中考察信息流和速率分层。

02 / 方法

一个任务,两条控制回路。

LLM 决定下一步做什么;小模型决定如何保持接触稳定。两者以不同频率交换目标和测量结果。

两级控制结构LLM 将目标发给触觉 MLP,MLP 将手部微小位移发给 MuJoCo。原始触觉每 10 毫秒返回 MLP,结构化观测在每次规划后返回 LLM。高层规划LLM读取图像、几何和结构化反馈目标 · 力上限 · 时长高频局部控制触觉 MLP目标误差 + 触觉 + 状态→ 受限修正 ΔXYZ100 Hz · 单步最多 0.2 mm执行与测量MuJoCo + 双手500 Hz 伺服与物理仿真触觉 · 位姿 · 运动每手 8 N 上限目标ΔXYZ原始触觉 · 10 ms摘要 · 每次 LLM 调用
图 01 LLM 给出任务意图,小模型闭合快速接触回路,仿真产生两者需要的测量。
小模型的职责

目标条件化的局部策略。

策略读取目标误差、触觉、速度和手的位置,在 LLM 思考期间输出受限的三维伺服修正。

输入1,777 个值

4 × 441 个触觉值
+ 目标误差和手的状态

网络1777 → 256 → 256 → 3

ReLU 隐藏层 · tanh 输出
521,731 个共享参数

输出每 10 ms 修正 ΔXYZ

单步限制 0.2 mm
左右手共享同一组权重

具体例子。 当目标为 0.20 m、手的位置为 0.18 m 时,网络结合目标误差、触觉和运动状态输出一个受限修正,例如 +0.2 mm;伺服目标逐步累积这些修正。

速率分层

高层规划与局部控制运行在不同频率。

B1 中,小模型运行频率为 99.84 Hz,推理基准为 1.203–1.426 ms;第一次 LLM 响应耗时 25.06 s。这些测量刻画了局部控制回路的运行速度。端到端速度比较需要加入匹配的“LLM 直接输出 ΔXYZ”基线。

系统类比

这种速率分层借鉴人的运动:任务意图相对低频地更新,而触觉和本体反馈在接触过程中支持更快的局部修正。页面将其实现为工程层级:全模态 LLM 规划之下连接受限触觉策略。

01

LLM 设定目标
“移动到托盘后方,力上限 7.5 N。”

02

小模型读取接触
读取触觉、位置、速度和目标误差。

03

伺服执行微小动作
应用位移,物理层测量结果。

04

LLM 再次规划
动作区间结束后接收结构化摘要。

训练与范围。 小模型由局部柔顺教师进行行为克隆训练(180,900 个训练样本,36,180 个验证样本)。训练覆盖局部接触行为,任务级动作顺序由 LLM 负责。

03 / 实验

九次运行,全部展示。

A、B、C 各包含 3 个布局变化。每段全程回放 15 秒,最后停留 1.5 秒展示终态。8 次通过原验收,A3 因目标越界停止。

视频来自保存状态的顺序回放。查看来源与时间

A单个支撑块

改变支撑块位置、高度和托盘摩擦。

A1

原验收通过

位移 303.1 mm · 19 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

A2

原验收通过

位移 333.1 mm · 20 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

A3

命令被拒绝

首条目标 z = 0.32 m,超过 0.30 m 工作空间上界。

15 秒 · 全程回放打开 MP4运行数据

B两个候选支撑块

一个过矮,另一个可以支撑门。

B1

完整取盘

位移 374.1 mm · 21 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

B2

原验收通过

位移 324.6 mm · 22 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

B3

原验收通过

位移 357.4 mm · 22 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

C出口偏移与门缘

出口横向偏移,支撑侧增加门缘凸起。

C1

原验收通过

位移 335.7 mm · 20 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

C2

完整取盘

位移 380.6 mm · 19 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据

C3

原验收通过

位移 322.0 mm · 22 次 次高层调用

15 秒 · 全程回放打开 MP4运行数据
两个完成标准

8/9 通过原验收:位移至少 300 mm 且通过安全检查。2/9 完整取盘:B1、C2 位移超过 365 mm,同时通过安全检查。

04 / 分析

触觉反馈怎样改变规划。

B1 的两个片段展示同一过程:小模型持续控制,测量结果改变下一次 LLM 指令。

B1 · 177.6–224.4 s · 约 4.5×打开 MP4
01 / 支撑转移

先卸力,再撤手。

顶部触觉合力从 4.506 → 2.138 → 0 N,门下缘保持 112.44 mm。随后 LLM 将这只手移到托盘后方。

交接:接触测量支持下一次高层动作。

测量数据
B1 · 312.0–478.2 s · 约 12.3×打开 MP4
02 / 推盘阻力

单手卡住,双手移动。

位移增量分别是:单手 8 N 时 0.91 mm,双手各 6 N 时 0.07 mm,双手各 7.5 N 时 9.27 mm。

单手 · 8 N0.91 mm
双手 · 各 6 N0.07 mm
双手 · 各 7.5 N9.27 mm

交接:高层结合受力和运动结果改变手的分工与力上限。

B1 动作记录

如何理解

LLM 提供任务意图,小模型提供高频接触控制;两个 B1 片段展示了这层交互。

05 / 结果与证据

结果和范围。

原验收还检查支撑、撤手、净空、碰撞、力峰值和穿透;完整取盘增加门口后缘位置检查。
回合原验收位移 mm完整取盘手接触峰值 N调用路径
A1通过303.1否7.505openai
A2通过333.1否7.802openai
A3目标被拒0.0否5.576cctq_codex
B1通过374.1是8.000openai
B2通过324.6否7.897openai
B3通过357.4否8.002cctq_codex
C1通过335.7否8.008openai
C2通过380.6是8.000openai
C3通过322.0否8.000cctq_codex

失败:A3 首条目标 z = 0.32 m 超过执行器 z ≤ 0.30 m,命令被拒绝。

范围:9 次是小范围布局变化,覆盖两条调用路径,并另行报告一个 A 类完整取盘回合。当前评估集中于仿真中的这一任务。

实验快照:2026 年 9 月 29 日。链接的原始记录保留原始语言。