具身智能与 VLA 技术全景
具身智能与 VLA 技术全景:动作表征、RL 后训练与世界模型
本文总结自一份具身智能研究归档:三个 VLA 训练代码库(HEAT、OpenVLA-OFT、Qwen0.8VLA)、43 篇 2025–2026 年 arXiv 论文、一套双机械臂遥操作采集管线,以及一个自建评测平台。文章试图回答一个问题:要做出一个能干活、能学习、能部署的 VLA(视觉-语言-动作)模型,今天的技术栈长什么样?
一、VLA 的完整技术栈:从示教采集到真机部署
动手做 VLA 的第一课不是读论文,而是认识到这是一个全链路工程。一套可用的系统包含五个环节,缺一不可:
1.1 数据采集:主从遥操作
数据是一切的基础。归档中的采集方案基于两台 Piper 机械臂 + 两个 USB-CAN 适配器 + 双摄像头(第三视角 + 腕部),运行在原生 Ubuntu 20.04 上:
- 主从模式:主臂切到
0xFA示教输入模式,从臂切到0xFC运动输出模式,通过 SocketCAN(1 Mbit/s)实时跟随。人类拖主臂示教,从臂同步执行,保证采集到的轨迹本身物理可行。 - 多模态记录:双路 RGB 视频 + 机械臂关节/夹爪状态,以 HDF5 逐 episode 落盘,每条 episode 绑定一条语言指令(
--prompt),天然形成”语言-视觉-动作”三元组。 - 数据转换:采集脚本支持把 HDF5 转成两种动作格式——关节增量(
joint_delta)或末端位姿增量(eef_delta),再导出为 Zarr/LeRobot parquet 供训练使用。
工程细节同样重要:相机预热、回零保护、CAN 接口枚举确认、急停兜底……真实世界的采集系统一半代码在处理这些”非算法”问题。
1.2 动作表征:VLA 的第一个核心抉择
连续控制信号如何喂给序列模型,是所有 VLA 工作的分水岭。归档代码库给出了一个完整的动作表征谱系,可概括为三类:
- 纯离散 token:每维 binning(离散化)、VQ-VAE(VQBET)、频域变换后离散化(FAST)、有序离散(OAT)——把动作完全变成语言模型的词表,可用纯 AR 生成。
- 纯连续:ACT 的 CVAE 风格、Diffusion Policy、Flow Matching Policy——保持动作的连续本质,但需要独立的生成式动作头。
- 混合表征(HEAT 路线):下面重点展开。
1.3 HEAT:事件自适应混合动作表征
归档中的核心工作 HEAT(Hybrid Event-Adaptive Action Representations for Robot Learning)提出了一个关键洞察:纯离散 token 同时承担”运动身份”与”精细度量修正”两种职责,量化压力过大。它的解法是三层结构:
- 事件发现(Event Discovery):动作编码器从一段连续动作轨迹中发现 K 个有序”事件”,每个事件有边界 + 可学习的时长(straight-through 可微训练)。把”时序切分”本身变成显式的预测变量,而非固定步长的动作块。
- HEAT(离散版):每个事件 = FSQ 离散 token(身份)+ 有界连续残差(用 tanh 严格限制在 ±0.5,精细修正)+ 时长,供自回归策略逐事件生成。
- Continuous-HEAT(连续版):连续事件 latent + 时长,直接条件化一个流匹配动作专家(Flow Action Expert),再配上 Qwen3.5-0.8B VLM 骨干构成约 1B 的完整 VLA。
训练细节同样考究:分词器训练用动作导出的 teacher 目标(梯度 detach),推理时无动作泄漏;执行采用事件级滑窗闭环——执行事件的前缀后重新观测、重新规划,把开环动作块拉回闭环。
代码库中的 heat_a_vla_full 给出了完整实现:Observation Encoder + EventFormer Planner + HEAT-A Tokenizer + Flow Action Decoder。策略头输出三个量:事件 token logits、时长预测、以及经 rectified flow + 显式 Euler ODE 采样还原的连续动作块。训练采用两阶段:先训分词器,再训策略。同时提供了 ACT / Diffusion / Flow / FAST / BIN / QUEST / VQBET / OAT 八种基线在同一骨架下的公平对比——这种”统一骨架 + 换动作接口”的实验设计,本身就是动作表征研究的正确姿势。
1.4 两条业界路线:OpenVLA-OFT 与 Qwen0.8VLA
归档中的另外两个代码库代表了 VLA 的两条主流工程路线:
OpenVLA-OFT(7B):基于 Prismatic 代码库微调 OpenVLA-7B——VLM 骨干 + 离散动作 token,动作头支持 L1 回归(直接回归连续动作)或离散 token 解码。OFT(open-vocabulary fine-tuning)的精髓是把预训练 VLM 的推理能力通过少量机器人数据”迁移”成控制能力,是”大模型 + 轻微调”路线的代表。
Qwen0.8VLA:把 HEAT 的事件表征装进 Qwen3.5-0.8B(或 MiniMind-3B)骨干,架构为 HEATEventEncoder → Qwen 骨干 → FlowActionExpert,训练分三阶段推进:
- t2a(text-to-action):先对齐文本与动作
- cpt(continuous pretrain):大规模预训练
- sft:下游任务微调
骨干用 LoRA 微调,支持 12 节点 × 8 GPU 的多机训练。更重要的是 piper_deploy/ 给出了真机部署的完整参考:推理服务器(heat/qwen inference server)与机械臂执行端(piper_local_execution)通过 TCP 客户端/服务器架构分离——模型推理与运动控制解耦,是 VLA 落地的标准姿势。
1.5 评测:从仿真到自建平台
评测覆盖 LIBERO、MetaWorld、RoboCasa、robomimic 四类仿真环境(代码库中各有对应的 env runner),并且归档中还有一个自建的 benchmark 平台前端(studio.evomind.tech/benchmarks),聚合了 LIBERO、LIBERO-Plus、Meta-World、CALVIN、RoboChallenge、RoboCasa-GR1-Tabletop、RoboCasa365、RoboTwin 2.0 八个榜单,支持区分官方论文成绩与平台实测、开源/闭源、SFT/RL 训练方式筛选——把”复现别人的数字”变成系统化的工作。
二、核心命题:动作到底该怎么表示?
2025–2026 年最集中的研究焦点,是对动作接口本身的重新设计。从”如何解码动作”到”动作空间本身长什么样”,是这一阶段最重要的范式演进。
2.1 极端方案:单 token 与体素热图
- VOTE(2507.05116):把整个动作块压缩成一个特殊 token
<ACT>,一次生成取代多 token 顺序解码,推理比 OpenVLA 快 39 倍(Jetson Orin 上 46Hz);再用”集成投票”——当前步与历史步的预测组成委员会按累积票数表决,找回精度。 - ActionMap(2606.06904):指出 VLA 动作解码器长期是”单点预测”。换成体素动作热图:对平移/旋转/夹爪各预测一个三维热图,每个体素存概率,Gaussian-blob 目标训练,top-k soft-argmax 解码。仅换动作头,LIBERO 平均 +8.2%(97.3 vs 89.1),10% 数据时 93.2% vs 67.2%,真机 20/30 vs 7/30。
2.2 流形观点:直接预测干净动作
- AML(动作流形学习),2602.11236 与 2605.11832 两篇:主张 DiT 应直接预测动作流形上的干净动作序列,把学习目标从”拟合噪声”(ϵ/v-prediction)改为”投影到可行动作流形”,提升解码速度与稳定性。
- ACoT-VLA(2601.11404):把思维链从语言/图像空间搬进动作空间——显式动作推理器用 flow matching 合成粗粒度参考轨迹,隐式动作推理器从 VLM 各层 KV cache 提取动作先验,双路交叉注意力融合。LIBERO 98.5%,零样本 LIBERO-Plus 86.6%。
2.3 统一动作空间:跨本体的终极答案
- Being-H0.5(2601.12993):Unified Action Space 把 30 种机器人的异构控制映射到语义对齐的 slots,配合 Mixture-of-Transformers/Mixture-of-Flow 解耦共享运动基元与本体专属专家,用 35,000+ 小时人类+机器人数据训跨本体基础模型。
- UCAG-P(2608.26058):更激进的答案——相机中心统一动作几何:共享动作 = 相机坐标系下腕部/末端 + 抓取中心的 3D 轨迹(anchor motion),几何条件动作翻译器再转成各本体的可执行指令。人类手、机械臂、人形机器人共用一套动作空间,人类示范数据免重定向直接入训,单 checkpoint 免微调跑通 LIBERO 98.3%、RoboTwin 88.7。
2.4 无动作视频里的动作
- ALAM(2605.10819):从无动作视频学”代数一致”的潜在动作——潜在转移满足可加性 z_ac≈z_ab+z_bc 与可逆性 z_ba≈−z_ab,再与机器人动作在联合 flow matching 下协同生成。MetaWorld MT50 从 47.9% → 85.0%。这是把海量人类视频转化为动作先验的优雅路线。
2.5 小结:动作接口的三要素
综合这一批工作,一个良好的动作接口需要同时回答三个问题:
| 要素 | 问题 | 代表方案 |
|---|---|---|
| 身份 | 动作”是什么”(类别/意图) | 离散 token、事件 token、热图 argmax |
| 度量 | 动作”是多少”(精确值) | 连续残差、流形上的干净动作、体素概率 |
| 时序 | 动作”持续多久、怎么衔接” | 可变时长事件、动作块 horizon、异步分块 |
HEAT 的”FSQ 身份 + 有界残差 + 可变时长”是同时显式回答三者的代表;VOTE 放弃度量换速度;UCAG-P 则把三者统一到一个几何空间里。
三、后训练:VLA 的 RL 时代
2026 年 VLA 领域最确定的趋势:RL 后训练从”锦上添花”变成”标准范式”。演进脉络清晰得可以写成教科书:
3.1 自回归 VLA 的 RL:SimpleVLA-RL → RLinf-VLA
- SimpleVLA-RL(2509.09674)把 DeepSeek-R1 式范式迁移到 VLA:基于 veRL 实现闭环交互 rollout(多环境并行、温度采样动作 token),轨迹级 0/1 成功奖励均匀传播到每个动作 token,GRPO 优化。惊人结果:单条轨迹 SFT 仅 17.3% 的任务,经 RL 提升到 91.7%(+74.4pp);更发现 RL 能涌现训练数据中不存在的新动作模式(pushcut:先推后切)。
- RLinf-VLA(2510.06710)指出这类工作的系统短板,把 VLA-RL 平台化:统一支持多仿真器(LIBERO/ManiSkill/RoboTwin)、多架构(OpenVLA/OFT/π0)、多算法(PPO/GRPO),并提出 hybrid 细粒度 GPU 流水线分配解决渲染/推理/训练争抢 GPU 的问题,整体 2.27 倍加速。
3.2 流匹配 VLA 的 RL:πRL
πRL(2510.25889)攻克了流匹配 VLA 无法直接算动作对数似然的难题:
- Flow-Noise:把去噪过程建模为离散时间 MDP,引入可学习噪声网络,实现精确对数似然;
- Flow-SDE:把去噪 ODE 转成保持边缘分布的 SDE,构建”去噪-交互”两层 MDP 增强探索。
SFT+RL 在 LIBERO-Long 达 94.0%(one-shot SFT 仅 43.9%)。至此,”预训练 → SFT → RL”三段式范式对自回归与流匹配两条技术路线都成立了。
3.3 奖励与推理的进化:SRPO、LaST-R1、PRTS
- SRPO(2511.15605):批评 0/1 奖励浪费失败轨迹信息。以批次内模型自己的成功轨迹为参照,用世界模型的潜在表征度量行为相似度,给失败轨迹分配”进度奖励”。one-shot SFT 48.9% → 200 步 RL 后 LIBERO 99.2%。
- LaST-R1(2604.28192):对”先潜在推理后行动”的 VLA 做 RL——潜在 CoT 嵌入与动作生成按统一 step-level 似然比联合优化(LAPO),自适应调节推理步数。LIBERO 99.9%,真机 4 任务超 SFT 基线 22.5pp。
- PRTS(2604.27472):把预训练本身重构为目标条件强化学习——state-action 嵌入与语言目标嵌入的内积 ≈ log 折扣目标占用度,从离线轨迹无奖励标注提取稠密可达性监督,单次前向同时做 BC + CRL。167B tokens 训练,长程、接触丰富、零样本指令场景增益最大。
一个贯穿性发现:世界模型的表征是 RL 奖励塑造的优质原料(SRPO),而可达性对比学习让 VLM 天然”知道目标在哪儿”(PRTS)——感知、预测与决策的边界正在消失。
四、世界模型与视频基础模型:VLA 的新底座
如果说 2024–2025 年的 VLA 以 VLM 为底座,那么 2026 年的最大变数就是视频生成模型:”视频模型蕴含的时空物理先验优于静态 VLM 先验”成为一批工作的共同信念。
4.1 三种融合范式
- 单模型统一(Cosmos Policy),2601.16163:把动作块、本体状态、未来状态图像、价值全部编码为 latent frames 插入视频扩散序列,不改任何架构单阶段微调 Cosmos-Predict2-2B,一个模型同时当策略 + 世界模型 + 价值函数,支持 best-of-N 规划(采样 N 个候选 → 世界模型预测 → 价值打分 → 执行最优)。LIBERO 98.5%,真机双手 93.6%,加规划再 +12.5%。
- 双 DiT 联合(DiT4DiT),2603.10448:视频 DiT 预测未来帧,动作 DiT 用视频 DiT去噪过程中的中间特征作时间对齐条件,双 flow matching 联合训练。先验证”视频生成目标显著优于对象 grounding 与 FLARE 式潜在建模两种代理任务”,收敛快至 7×、数据效率高至 10×。
- 自回归因果(LingBot-VA),2601.21998:批评 chunk 级双向注意力破坏因果,改用视频 token 与动作 token 交错的自回归序列 + KV cache 持久记忆,先预测未来视觉状态再经逆动力学解码动作,配合视频稀疏化与 noisy history 增强。10 条演示时 81.7%(基线 60/61),数据效率突出。
4.2 工程共识:”训练重、推理轻”
世界模型系方法最大的工程创新是非对称设计——训练时用世界模型做稠密监督,推理时丢弃全部辅助支路:
- GaussianDream(2605.20752):训练时 3D 高斯重建 + 未来预测双头做监督,推理时只留 prefix 条件动作,无高斯渲染、无视频 rollout。
- LaWAM(2606.15768):在 DINOv3 潜在空间训练 230M 的潜在世界模型,蒸馏进 2.3B VLA,测试时单次前向,比像素级 WAM 快至 24 倍、参数少 95%。
- ST-WAM(2607.28993):发现视频生成 WAM 的 Training-Distribution Hallucination(180 个 OOD 预测中 70.6% 漂移),解法是用 DINOv3 语义特征替代 VAE 像素作为未来表征(同态稳定性 0.904 vs 0.686),零样本 LIBERO-Plus 比 Fast-WAM 高 21.3pp。
- DreamWAM(2608.04996):问”WAM 该想象什么样的未来”——联合去噪 RGB + 光流,门控残差分支预测深度 + 语义,四视图未来表征,部署时可回退 RGB-only。
- InternVLA-A1.5(2607.04988):用冻结的 Wan2.2-5B 视频模型把未来压成 foresight token,继承动力学先验而不学像素生成,视频支路仅训练时存在。
- W2-VLA(2608.05369):把未来预测聚焦到腕部局部——冻结 V-JEPA 2.1 编码腕部历史,预测任务条件的未来腕部潜在,>80Hz 实时动作生成。
- 4D-WAM(2608.08023):模型无关的训练策略,用 3D 轨迹场做表征对齐(motion alignment + destination alignment),在两个既有骨架上 OOD 全面提升。
- WLA(2606.05979):AR Transformer 同时输出文本子任务 + 子目标图像 + 动作,轻量 World Expert 承担像素预测,meta-query 让世界预测在推理时可选开关,开启即 test-time scaling。2B 激活参数,RTX 5090 上 40ms。
- MemoryVLA++(2606.09827):认知科学式的”全时序建模”——感知-认知记忆库存过去,视频生成世界模型部分去噪产生”想象 token”,融合后条件扩散动作专家。真机三类任务 +9/+26/+28pp。
- MIRTH(2606.31167):双尺度时序 hub + 互信息目标对齐潜在推理 token + 向量级并行解码,同时解决时序近视、推理鸿沟与解码速度。
4.3 小结
世界模型路线的共同答案:未来状态的形态(像素 / 潜在 / 语义 / 3D 高斯 / 轨迹场 / 腕部局部)比世界模型本身更值得研究;而”训练时想象、推理时丢弃”的非对称设计,让世界模型终于可以不拖累实时性。
五、基础模型与数据工程
5.1 交错预训练与多模态统一
- EO-1(2508.21112):统一架构无差别处理图像/文本/视频/动作四种模态,自回归解码与流匹配去噪协同训练;自建 1.5M+ 样本的 EO-Data,用 VLM + 人工为真机轨迹标注具身时空 QA(物理常识、任务规划、物体定位、affordance 指向、多视角对应)——“推理-动作”交错是它区别于纯模仿学习的关键。
5.2 跨具身异质性
- X-VLA(2510.10274):为每个数据源学一组独立可学习 embedding 作为具身专属软提示,按数据集 ID 注入;消融显示它优于域专属动作投影头、HPT 式输入投影和语言描述三种常规方案。0.9B 模型在 6 个仿真 + 3 台真机上多基准 SOTA,适应新机器人只需微调 1% 参数 + LoRA。
- Being-H0.5 / UCAG-P / ABot-M0:前者用统一动作空间 + MoT 专家;UCAG-P 用相机中心几何;ABot-M0(2602.11236)则用数据工程路线——UniACT 数据集整合 6 个开源数据集(6M+ 轨迹、9500+ 小时、20+ 本体),统一 LeRobot v2 格式、末端系 delta action、旋转向量,配合双流特征交互(VLM 语义 + 即插即用 3D 感知)。三者的消融共同说明:统一动作空间 + 标准化数据管线,是跨本体训练的入场券。
5.3 工业配方
- 小米 Robotics-0(2602.12684):两步预训练——先用 Choice Policies(预测 N 个候选动作块 + 打分,winner-takes-all)让 VLM 学动作生成,同时混入 80M+ 视觉语言数据(1:6 比例)防灾难遗忘;再冻结 VLM 训 16 层 DiT 动作专家。这个 1:6 的配比是”既要有通用语义又要会控制”的量化答案。
- MolmoAct2(2605.02881):全开源路线的代表——Molmo2-ER 骨干、720 小时最大开源双手数据集、FAST 分词器跨 5 种构型(1 秒 32 维动作压成离散序列),离散 token VLM 经逐层 KV 条件接入 flow-matching 连续动作专家。
六、更小、更快、更稳:微调与部署
6.1 小模型与训练配方的胜利
- VLA-Adapter(2509.09372):首次系统回答”VL 表征如何桥接到动作”——哪一层 VLM 特征、Raw 特征 vs ActionQuery 对动作生成最有效。0.5B 骨干 LIBERO 97.1%(OpenVLA-OFT 为 97.3%,骨干小 1/14),吞吐 219Hz,单张消费级 GPU 8 小时训完。
- SimVLA(2602.18224):极简 0.5B baseline,核心主张发人深省:数据 shuffle、动作/本体归一化、学习率调度、动作块 horizon 这些”沉默的性能驱动因素”常比架构差异更重要。LIBERO 98.6%,训练 VRAM 仅 9.3GB。
- ROCKET(2602.17951):给 2D 预训练 VLA 注入 3D 理解——多层对齐 VGGT 表征,理论证明逐层独立投影器导致梯度干扰、单一共享投影器实现 cone-to-cone 映射梯度相干,配 Matryoshka 式稀疏激活。LIBERO 98.5%,仅需 Spatial Forcing 约 4% 训练算力。
6.2 LoRA 从压缩手段到终身学习
CORAL(2603.09298):每任务一个 rank-16 LoRA 专家,冻结单一 backbone;语言指令本身就是任务路由,动态 merge/unmerge 权重切换 <100ms、零推理开销;单个专家仅 26MB。对照实验触目惊心:联合全量微调平均仅 24.5%(任务干扰),顺序全量微调旧任务掉到 0%(灾难遗忘)——参数隔离是廉价且有效的终身学习。CORAL-SimVLA LIBERO 99.3%。
6.3 感知注入与实时部署
- 3D-CAVLA(2505.05800):三个即插即用组件——CoT 式叙事提示、工作空间点云深度特征、任务导向 ROI 池化,可叠加在任意预训练 VLA 上;未见任务 +8.8%,收敛快 3 倍。
- ConsisVLA-4D(2605.05126):仅用 1/8 视觉输入的三层一致性(VL 对齐器 + 几何融合器 + 时空思考器),LIBERO +21.6%,推理加速 2.3–2.4 倍。
- SaiVLA-0(2603.08124):神经科学启发的”大脑-脑桥-小脑”三层——冻结大 VLM 低频运行(每 5 块调用一次),Pons 把多层特征压成意图 token,高频小 Transformer 做**三元分类 delta(±1/0×固定步长)**并行解码 20 步;两阶段特征缓存训练把训练时间从 7.5h 压到 4.5h。
- 小米的 Λ-mask(2602.12684):异步分块执行的关键 trick——近端 token 可见动作前缀保证平滑衔接,远端 token 不可见前缀强制关注视觉/语言保持反应性;RoPE 位置偏移区分 clean/noisy token;按在线预测误差重加权 loss。4090 上 80ms 推理,执行与推理重叠。
- GTA-VLA(2605.13632):把”人”接回环路——空间提示(点/框/轨迹)作为可选先验注入空间-视觉 CoT,一次视觉交互即可纠正 OOD 失败,配套提出 SimplerEnv-Plus(相机/光照/物体/语言 OOD + 人工干预)基准。
七、评测生态:从数字竞赛到可复现科学
归档论文反复揭示:VLA 领域评测协议比模型本身更混乱。几个关键进展:
- 基准矩阵已成型:LIBERO 三件套(基础 / Plus 七类扰动 / PRO)、CALVIN(长程链)、RoboTwin 2.0(双臂 + 强域随机化)、RoboCasa(家庭长程)、MetaWorld、SimplerEnv(+Plus)构成标准组合;新基准还在涌现(RoboChallenge、RoboCasa365、GR-1)。
- 评测协议标准化:RLinf-VLA 呼吁统一 RL 评测协议;SimVLA 把”训练配方”显式化以支持公平归因;自建平台把”官方论文数字 vs 平台实测”分开标注——只有这样才能区分真实进步与报告偏差。
- OOD 鲁棒成为分水岭:LIBERO-Plus 的七类扰动成为检验世界模型/4D/3D 方法的试金石,一批方法在 Clean 上分不出差距、在 Plus 上差出 20pp。
八、趋势总结:五个正在发生的范式转移
- 动作表征多元化:从”离散 token vs 连续”的二元争论,走向”身份 + 度量 + 时序”三要素的精细设计(HEAT、ActionMap、AML、UCAG-P 各答一题)。
- RL 后训练标准化:”预训练 → SFT → RL”三段式对自回归与流匹配都成立(SimpleVLA-RL、πRL),RL 基础设施平台化(RLinf-VLA),奖励从 0/1 走向自参照与世界模型表征(SRPO、PRTS)。
- 世界模型基础化:视频模型的物理先验成为 VLA 新底座(Cosmos Policy、DiT4DiT),”训练重、推理轻”的非对称设计是工程共识(GaussianDream、LaWAM、ST-WAM)。
- 数据工程系统化:统一动作空间(UCAG-P、Being-H0.5)+ 标准化管线(ABot-M0 UniACT)+ 人类视频利用(ALAM)+ 防遗忘混训配方(小米 1:6)。
- 部署实时化:从”能不能训出来”转向”能不能跑起来”——单 token(VOTE)、异步分块(Λ-mask)、层级调度(SaiVLA-0)、LoRA 专家热切换(CORAL)、test-time scaling 开关(WLA)。
回到开头的问题:今天的 VLA 技术栈,是示教采集 → 动作分词 → 两/三阶段训练 → 仿真评测 → 真机部署的完整闭环,而 2026 年的增量全部发生在表征层——动作空间的结构、未来状态的形态、预训练目标的设计。谁能把这三件事做对,谁就能在下一个版本的技术栈里占据位置。
附录:论文索引
| arXiv | 标题 | 标签 |
|---|---|---|
| 2505.05800 | 3D-CAVLA | 3D 感知 / 微调 |
| 2507.05116 | VOTE | 动作分词 / 推理时投票 |
| 2508.21112 | EO-1 | 基础模型 / 交错预训练 |
| 2509.09372 | VLA-Adapter | 桥接范式 / 小模型 |
| 2509.09674 | SimpleVLA-RL | RL 后训练 / GRPO |
| 2510.06710 | RLinf-VLA | RL 基础设施 |
| 2510.10274 | X-VLA | 跨具身 / 软提示 |
| 2510.25889 | πRL | 流匹配 RL |
| — | HEAT (Hybrid Event-Adaptive) | 动作表征 / 事件自适应 |
| 2511.15605 | SRPO | RL / 自参照奖励 |
| 2601.11404 | ACoT-VLA | 动作 CoT |
| 2601.12993 | Being-H0.5 | 跨本体 / 数据扩展 |
| 2601.16163 | Cosmos Policy | 世界模型 / 视频基础模型 |
| 2601.21998 | LingBot-VA | 世界模型 / 因果建模 |
| 2602.11236 | ABot-M0 | 数据扩展 / 动作流形 |
| 2602.12684 | Xiaomi-Robotics-0 | 实时部署 / 防遗忘预训练 |
| 2602.17951 | ROCKET | 3D 对齐 / 训练效率 |
| 2602.18224 | SimVLA | 评测基线 / 训练配方 |
| 2603.08124 | SaiVLA-0 | 层级架构 / 实时部署 |
| 2603.09298 | CORAL | LoRA 专家 / 终身学习 |
| 2603.10448 | DiT4DiT | 视频模型 / 联合训练 |
| 2603.25406 | MMaDA-VLA | 离散扩散 / 统一多模态 |
| 2604.27472 | PRTS | 目标条件表示 / 预训练范式 |
| 2604.28192 | LaST-R1 | 潜在 CoT / RL 后训练 |
| 2605.02881 | MolmoAct2 | 开源基础模型 / 动作分词 |
| 2605.05126 | ConsisVLA-4D | 3D/4D 感知 |
| 2605.10819 | ALAM | 无动作视频预训练 |
| 2605.11832 | Action Manifold (Multi-view) | 3D 感知 / 动作流形 |
| 2605.13632 | GTA-VLA | 人机交互 / 空间提示 |
| 2605.20752 | GaussianDream | 3D 高斯世界模型 |
| 2606.05979 | WLA | 世界-语言-动作 / test-time scaling |
| 2606.06904 | ActionMap | 体素热图动作头 |
| 2606.09827 | MemoryVLA++ | 时序记忆 / 想象 |
| 2606.15768 | LaWAM | 潜在世界模型 |
| 2606.31167 | MIRTH | 时序 hub / 互信息推理 |
| 2607.00678 | ABot-M0.5 | 移动操作 WAM |
| 2607.04988 | InternVLA-A1.5 | 世界模型蒸馏 / 语义保持 |
| 2607.28993 | ST-WAM | 语义未来表征 / OOD 鲁棒 |
| 2608.04996 | DreamWAM | 四视图未来表征 |
| 2608.05369 | W2-VLA | 腕部未来建模 |
| 2608.08023 | 4D-WAM | 轨迹场对齐 |
| 2608.26058 | UCAG-P | 跨 embodiment / 统一动作几何 |
(mGBDT, NIPS 2018 作历史对照:不可微决策树模型的多层堆叠与目标传播,提醒我们”表示学习”并非神经网络独享——这一思想在今天的动作表征讨论中依然回响。)