2026-08-13

28 篇
Learning-Based Behavior Planning for Automated Driving: Real-World Integration and Deployment Figure 1
2026-08-13cs.RO

Learning-Based Behavior Planning for Automated Driving: Real-World Integration and Deployment

Jean-Pierre Busch, Guido Linden, Jan Bergmann, Lutz Eckstein

Thanks: Both authors are doctoral researchers at the Institute for Automotive, and is now with the Chair of Automotive Technology (FTM), Technical University of Munich., Thanks: Lutz Eckstein is head of the Institute for Automotive Engineering (ika).

2026-08-13强化学习规划控制

针对自动驾驶中纯规则规划难扩展、学习式规划又难解释和安全验证的问题,论文提出将深度网络行为建议与优化式监督层结合的混合规划架构,用显式可行性和安全约束筛选轨迹。系统在真实城市数据上做开环评估,并集成到研究车 karl. 进行测试场部署,结果显示方案具备可运行性和定性安全守护效果,但公开片段中对闭环量化增益说明仍有限。

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing Figure 1
2026-08-13cs.RO

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

2026-08-13机器人视觉感知数据集/基准

该文针对灵巧手遥操作数据昂贵、而第一视角人手视频难以因外观、运动学和视角差异直接用于机器人学习的问题,提出 HandEdit:面向人手/手臂到机器人灵巧手图像编辑的 URDF 条件化大规模数据集与基准,覆盖 5 个来源数据集、26 种机器人形态和 2 亿级编辑实例,并设置 Hand-only 与 Hand-Arm 两条评测轨道。实验比较 11 个通用图像编辑模型,显示现有方法在机器人形态一致性与接触合理性上仍不足,主要贡献可能主要来自 scaling / data 与专门评测协议。

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL Figure 1
2026-08-13cs.RO

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam

RAI Institute, Technical University of Munich

2026-08-13机器人强化学习模仿学习规划控制

这篇论文针对腿足机器人全身移动操作中稀疏奖励难探索、密集奖励调参慢的问题,提出用仿真中的采样式 MPC 快速生成大规模专家数据,再进行离线到在线的 off-policy RL,并接低层稳定控制器实现 sim-to-real。实验在带机械臂 Spot 和 G1 上完成推箱、滚胎、扶胎等任务,策略可部署到真实硬件,并在若干指标上超过 SMPC 教师;但最优性仍受示范分布限制,增益可能主要来自 scaling / data。

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements Figure 1
2026-08-13cs.RO

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

Shanghai Jiao Tong University

2026-08-13机器人视觉感知数据集/基准

DaViNCi针对现有户外视觉语言导航数据集依赖离散拓扑、缺少动态交通要素而难以贴近真实车辆场景的问题,基于CARLA构建6张地图、6933条连续轨迹,并引入实时视觉、车辆和行人等动态因素及LLM生成指令。实验显示,在离散设置下成功率较既有数据集下降超过10%,连续动态环境中降幅更大,说明动作粒度和动态元素显著增加任务难度。

Scalable Multi-Agent Maze Traversal with Local Communication Figure 1
2026-08-13cs.RO

Scalable Multi-Agent Maze Traversal with Local Communication

Julian Rau, Jahir Argote-Gerald, Grace McFassel, Genki Miyauchi, Paul Trodden, Roderich Groß

2026-08-13机器人

面向管道、洞穴等未知迷宫环境中的多机器人到达任务,论文关注局部通信、避碰与未知目标带来的协同难题。其核心是让群体保持连通的领导者-跟随者结构,仅由当前头机器人运行单机器人搜索,并在潜在冲突时切换领导者以适配含环图。作者证明算法完备,makespan 随机器人数量渐近等价于全知识最优策略,并在最多 625 个机器人仿真中优于各自独立搜索的基线,燃料总耗随规模增加下降。

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics Figure 1
2026-08-13cs.RO

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics

Anh Duc Do, Volodymyr Scherbyna, Tai Duc Nguyen, Spaarsh Thakkar, Zhengcheng Shen, Teham Buiyan, Archan Misra, Linh Kästner

Singapore Management University, Technical University Berlin, Max Planck Institute, Technical University Braunschweig [0.2em]

2026-08-13机器人强化学习三维

面向社交机器人训练,论文针对现有三维仿真环境难兼顾真实感、物理可交互性与领域语义的问题,提出 D3D-GEN:用领域代理自动收集规范知识并构建数据库,再以 RAG 生成楼层布局和物体摆放,输出可导入 Isaac Sim/Gazebo 的交互世界。实验生成住宅、办公、医院共 450 个场景,并在物体密度、视觉评分、VQA 准确率和场景评分上优于多类基线,但部分增益可能来自领域数据与生成规模。

Enhancing Visual Domain Robustness in Behaviour Cloning via Saliency-Guided Augmentation Figure 1
2026-08-13cs.RO

Enhancing Visual Domain Robustness in Behaviour Cloning via Saliency-Guided Augmentation

Zheyu Zhuang, Ruiyu Wang, Nils Ingelhag, Ville Kyrki, Danica Kragic

KTH Royal Institute of Technology

2026-08-13安全鲁棒

视觉行为克隆常因训练数据缺少光照、阴影、干扰物和背景多样性而在域外场景失效。论文提出 RoboSaGA,用由策略视觉特征反传得到的显著性图逐像素控制叠加增强强度,在保留任务关键区域的同时更激进地扰动无关区域,且不改模型结构。仿真和真实实验中,它相较随机叠加进一步降低性能差距,分别降至 0.14 和 0.05。

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence Figure 1
2026-08-13cs.RO

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

Chaeyeon Jung, Juyoun Park

Center for Humanoid Research, Korea Institute of Science and Technology (KIST), Republic of Korea.

2026-08-13机器人强化学习三维

这篇论文针对人形双臂 VLA 策略在固定初始姿态评测中可能掩盖的失效,指出初始手臂构型会诱导“用哪只手”的策略先验,而非只影响轨迹细节。作者用 HandPriorScore、腕部相机遮挡和关节交换干预诊断该偏置,发现不同策略与 17 种初始姿态存在强交互,局部右臂关节可因果性地诱发或抑制错手偏好;扩大初始姿态覆盖和针对弱姿态增广能显著提升鲁棒性,单点成功率由 30% 升至 75%。

G0.5: One Autoregressive Stream for Robot Reasoning and Action Figure 1
2026-08-13cs.RO

G0.5: One Autoregressive Stream for Robot Reasoning and Action

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

2026-08-13机器人

这篇论文针对当前VLA把预训练VLM降为上下文编码器、动作由独立专家生成的问题,重新押注单一自回归流。G0.5用跨本体动作tokenizer压缩异构机器人动作,把任务分解、目标定位、动作提示与动作码放进同一解码目标,并加入视觉记忆。实验称其在真实双臂微调、BEHAVIOR、DROID迁移、LIBERO等7类评测超过π0.5、GR00T等基线,但增益中 scaling / data 的贡献仍需警惕。

ContactIPM: A Structure-Exploiting Interior-Point Solver for Contact-Implicit Trajectory Optimization Figure 1
2026-08-13cs.RO

ContactIPM: A Structure-Exploiting Interior-Point Solver for Contact-Implicit Trajectory Optimization

Yucheng Chen

2026-08-13规划控制优化算法

这篇论文针对接触隐式轨迹优化中互补约束导致内点法退化、而现有接触专用方法又难以利用最优控制时序结构的问题,提出 ContactIPM:将互补对做阶段局部的弹性内点松弛,并消去局部松弛与对偶变量,用 Riccati 递推求解约化牛顿系统。实验显示其在 CRISP 基准上快 2.17–8.87 倍且鲁棒性更高,相比 IMPACT 在 Push T 和 Cart Transport 更快,但在 Push Box 更慢;闭环 Push Box 50 次扰动滚动均成功,中位求解 2.08 ms。

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models Figure 1
2026-08-13cs.RO

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

Siyu Xu, Yunke Wang, Zijian Wang, Dihao Zhu, Chenghao Xia, Chengbin Du, Daochang Liu, Tao Huang, Chang Xu

2026-08-13视觉语言视觉感知模仿学习

StellaVLA针对VLA在场景、视角或物体变化下易失效的问题,将检索到的单条演示从原始轨迹改写为包含任务计划、子目标和3D运动语言化描述的结构化上下文,并用动作与语言双目标训练把“为什么这样做”内化到策略中,推理时移除语言专家以保持实时控制。实验显示其在VLA-Arena得分0.63居首,在LIBERO达98.8%平均成功率,并能利用跨本体演示提升真实机器人OOD适应。

Energy-Aware Wind-Resilient Routing for Truck-Assisted Multi-UAV Delivery under Wind Uncertainty Figure 1
2026-08-13eess.SY

Energy-Aware Wind-Resilient Routing for Truck-Assisted Multi-UAV Delivery under Wind Uncertainty

Tianshun Li, Yanggang Sheng, Hongliang Lu, Zhongzhen Wang, Haoang Li, Xinhu Zheng

2026-08-13安全鲁棒

这篇论文针对卡车协同多无人机配送中风场不确定导致能耗低估和返航失败的问题,提出 EWR 在线风险敏感路由框架,把延迟噪声风估计、载荷状态和保守安全裕度纳入时变能量图,并在每次决策中检查前进路径与返航可行性。实验使用合成配送图和公开数据集风日志回放,显示任务成功率提高、风致返航失败减少,但真实外场验证和增益来源仍文中未充分说明。

IoT-Enabled Autonomous Maritime Navigation in Smart Ports: A Curriculum-Guided Shared Policy Learning Framework Figure 1
2026-08-13cs.RO

IoT-Enabled Autonomous Maritime Navigation in Smart Ports: A Curriculum-Guided Shared Policy Learning Framework

Yuqing Lin, Rangya Zhang, Kum Fai Yuen

2026-08-13机器人强化学习

面向智慧港口中通信受限、交通密集且部分可观测的自主水面设备,论文将问题建模为POMDP,并用离线集中训练、 onboard 执行的共享循环PPO策略配合课程学习,逐步增加会遇复杂度,同时把COLREGs约束纳入环境和奖励。仿真显示该框架较常规基线提升避碰可靠性、训练稳定性,并能泛化到未见高密度港口场景,但具体增益来源仍可能部分来自课程规模与场景数据。

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems Figure 1
2026-08-13cs.RO

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

2026-08-13视觉感知强化学习

这篇论文针对封闭场测试过度依赖标准规程和预设轨迹、难以复现真实道路交互的问题,提出 Video2Track:用 VLM 抽取公开视频中的交互语义,经 RAG 对齐封闭场拓扑,再用条件扩散生成多车轨迹,并以 Stackelberg 博弈调节对抗强度。封闭场实验显示其能保持源场景语义,同时生成风险等级和交互风格可控的可执行测试变体。

RoadWeaver: Large-Scale Lane-Level HD Map Generation from Scratch for Autonomous Driving Simulation Figure 1
2026-08-13cs.RO

RoadWeaver: Large-Scale Lane-Level HD Map Generation from Scratch for Autonomous Driving Simulation

Yueyuan Li, Zexi Chen, Weijie Xi, Mingyang Jiang, Songan Zhang, Hanyang Zhuang, Ming Yang

2026-08-13机器人

面向自动驾驶长时程闭环评测,论文指出现有手工、重建或局部生成地图难以同时满足大规模、多拓扑、车道级连通和仿真可用性。RoadWeaver采用由粗到细流程,先生成全局道路布局,再扩展连通路网并构造拓扑一致的车道几何,可导出OSM/OpenDRIVE。实验报告可达性99.8%、死胡同比10.7%、端点对齐误差0.24米,较SOTA误差降94.4%,单图生成约1.39–3.50秒。

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision Figure 1
2026-08-13cs.CV

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

2026-08-13视觉感知

本文面向夜间、雨雨等恶劣条件下机器人热成像深度估计,针对热图纹理稀疏和RGB基础模型层级表征利用不足的问题,提出RGB-HS:以冻结RGB教师分支对热学生编码器做多层token对齐,并用验证模块按RGB质量加权监督。在MS2基准上取得有竞争力结果,说明分层监督能更有效迁移RGB基础模型知识。

Keep the Future, Drop the Rollout: RIFT for World Action Models Figure 1
2026-08-13cs.RO

Keep the Future, Drop the Rollout: RIFT for World Action Models

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

2026-08-13强化学习

论文针对世界动作模型依赖迭代视频 rollout 导致机器人部署延迟高的问题,提出先用闭环干预证明动作主要依赖未来 K/V cache 的内容与位置,而非其逐步生成轨迹;据此设计 Rift,用 anticipation tokens 一次前向生成完整未来 cache。实验在 LIBERO 达到 98.8% 成功率,并将动作块延迟降低 68.2% 至 89.1%,RoboTwin 2.0 上也取得最高观测成功率。

Koopman Representation of Nonlinear Virtual Environments in Kinesthetic Haptic Systems Figure 1
2026-08-13cs.RO

Koopman Representation of Nonlinear Virtual Environments in Kinesthetic Haptic Systems

Yanting Zhou, Jozsef Kövecses, James Richard Forbes

2026-08-13机器人

面向手术训练等需高保真力反馈的动觉触觉系统,论文针对非线性虚拟环境建模和闭环稳定性分析困难,引入 Koopman 算子将 Duffing 振子类非线性环境提升为线性表示,从而复用线性系统工具。仿真、实验和多用户研究显示该表示能有效重建非线性动力学,并支持比传统无源性方法更少保守的稳定性分析。

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards Figure 1
2026-08-13cs.RO

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

2026-08-13安全鲁棒

论文针对端到端自动驾驶在长尾场景中会违反显而易见交通安全约束的问题,提出在已训练策略的最终控制接口外接神经符号安全守卫:用显式物理与交通规则约束油门、刹车和转向,只在命令越界时投影到最近安全动作,无需重训且可追溯。以 TFv6 评测显示,Fail2Drive 成功率提升 15%,安全关键碰撞最多减少 53%,Driving Score 基本保持不变。

Locomotion Variability and User Experience in Smart Wheelchair Human-Robot Interaction Figure 1
2026-08-13cs.RO

Locomotion Variability and User Experience in Smart Wheelchair Human-Robot Interaction

Sean Kille, Adina M. Panchea, Balint Varga, Sören Hohmann

Affiliation: Karlsruhe Institute of Technology (KIT), Institute of Control Systems (IRS), Karlsruhe, 76131, Germany, Affiliation: Université de Sherbrooke, Interdisciplinary Institute for Technological Innovation (3IT), Sherbrooke, J1N 3C6, Canada

2026-08-13机器人

这篇论文针对共享控制轮椅中常见辅助策略把人的运动变异性当作噪声压制、可能削弱控制感的问题,提出保留任务无关变异性、仅在任务关键区域提供约束的辅助模式。用户研究显示,该模式在端点误差等任务表现上与传统辅助相当,同时更接近自然轨迹变异,并显著提高感知能动性和有用性。

From Self-Normal-Positioning to Omni-Directional Tracking: Real-Time Surface Modeling Enabled Probe Tilt Control for Robotic Ultrasound Imaging Figure 1
2026-08-13cs.RO

From Self-Normal-Positioning to Omni-Directional Tracking: Real-Time Surface Modeling Enabled Probe Tilt Control for Robotic Ultrasound Imaging

Xihan Ma, Haichong Zhang

Xihan Ma and Haichong K. Zhang are with the Department of Robotics, Engineering, Worcester Polytechnic Institute, 100 Institute Road, Worcester

2026-08-13机器人视觉感知规划控制

这篇论文针对机器人超声常见的“只保持探头垂直皮肤”限制,面向心超等需要非垂直入射角的场景,提出双RGB-D点云融合与二次曲面实时建模,并将期望成像方向编码为相对表面法向的任意倾角进行任务空间控制。实验覆盖平面、心脏模型和在体呼吸跟踪,平均角度误差为1.06±0.66°,可恢复约44.39±2.59°非正常倾角并获得目标心腔视图。

Top-down Traffic Scenario Generation via Joint Initial-Goal Diffusion and Trajectory Infilling Figure 1
2026-08-13cs.RO

Top-down Traffic Scenario Generation via Joint Initial-Goal Diffusion and Trajectory Infilling

Da Saem Lee, Yash Vardhan Pant, Sebastian Fischmeister

The authors are with the Department of Electrical and Computer Engineering, University of Waterloo, Waterloo, Canada.

2026-08-13生成模型规划控制

这篇论文针对自动驾驶仿真中先给初始状态再生成轨迹带来的场景多样性受限和意图不透明问题,提出 TrafficDiffuser:先用扩散模型联合生成多车初始-目标状态,再把轨迹生成化为目标条件补全。其关键洞察是起终点联合建模可显式表达智能体意图并约束可达路径。Argoverse 2 实验显示,相比次优初始化方法,速度分布距离降低 55.3%,越野率降低 2.8%,但给定起终点下轨迹多样性仍受确定性补全限制。

Adaptation of Generalist Robot Policies with Minimal Data Figure 1
2026-08-13cs.RO

Adaptation of Generalist Robot Policies with Minimal Data

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

Affiliation: Carnegie Mellon University, Additional real-world videos and rollouts are available on the website:

2026-08-13机器人

针对通用机器人策略零样本探索弱、稀疏奖励下难以自主改进的问题,论文提出最小数据适应设定与 MiDAS:先用一到少量示范对预训练 VLA 做行为克隆锚定任务,再冻结骨干并用残差价值型在线 RL 学纠偏。结果显示其在 LIBERO、RoboCasa 中一示范即可显著恢复性能并优于基线,且在双臂 YAM 上经约 6 小时交互提升鲁棒性。

Self-Evolving Embodied Agents via Skill-Harness Evolution Figure 1
2026-08-13cs.CL

Self-Evolving Embodied Agents via Skill-Harness Evolution

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

Northeastern University

2026-08-13机器人

针对具身智能在新环境中通常依赖微调、强化学习或可编程机器人 API 才能适配的问题,论文提出 SHAPER:冻结模型参数,让同一 VLM 既做规划器又做外部技能与上下文代码 harness 的优化器,根据少量 rollout 反馈迭代可复用程序性指导。实验在 VLABench 和 ESI-Bench 上显示,该方法在不同底层动作接口下优于纯执行、同数据 SFT 和部分测试时采样/投票基线,但真实机器人验证仍未覆盖。

Towards the Harness of Embodied Agents Figure 1
2026-08-13cs.AI

Towards the Harness of Embodied Agents

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

Eastern Institute of Technology, Ningbo, robot capabilities, each wrapped as a callable tool. It inherits

2026-08-13机器人

这篇论文把机器人长程操作的瓶颈从“更强模型”转向“可闭环的执行框架”:物理世界不像代码环境那样天然可读、可验证,因此 Thea 将导航、操作等能力封装为工具,并用场景图提供持久符号上下文、用评估器模拟退出码来判断动作终止、成败和失败原因。论文在 Unitree G1、Astribot S1、AgileX Cobot Magic 三个平台上验证,展示该框架可组合工具完成取饮料、找充电宝、整理桌面等真实长程任务。

Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version) Figure 1
2026-08-13cs.AI

Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)

Jack Mirenzi, Henny Admoni

2026-08-13学习理论

论文针对偏好式奖励学习中“人只回答机器提问”导致教师目标知识被浪费的问题,将其改写为人机团队中的信念同步任务:教师按其对学习者的模型设计查询,学习者用二阶心智理论生成偏好约束来修正教师的过时模型。仿真显示,知情教师优于学习者主导查询,优势随特征维度增大;多教师切换会造成模型漂移,而理解陈述可恢复性能,ToM-2 在方向性误差下优于均值报告。

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling Figure 1
2026-08-13cs.CV

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

2026-08-13强化学习

本文针对VLA缺少显式时序动态监督、而WAM在线视频推理代价高的问题,提出训练期使用视频世界模型的World Tokens。其关键是World Adapter把VLM特征压缩为固定世界token,并强制动作专家只能使用这些token,使未来视频去噪梯度直接塑造控制表征;部署时移除视频分支。实验显示2B模型在LIBERO达98.2%,SIMPLER取得71.5%/82.1%,真实R1 Pro成功率由59.4%升至76.0%,但训练成本仍较高。

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift Figure 1
2026-08-13cs.CV

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

Dipesh Tharu Mahato, Rachel Ren

New York University

2026-08-13强化学习

这篇论文关注视觉分布偏移下 VLA 机器人策略失败难以及时诊断的问题,固定 OpenVLA 策略并从执行过程中的前馈激活训练轻量线性监测器,核心洞察是近未来失败信号可在部分层中线性解码且具有层依赖性。遮挡使 LIBERO 成功率从 57% 降至 17%,第 16 层 logistic probe 在 15 步失败预警上达 AUROC 0.972、AUPRC 0.352,并对相机抖动有有限迁移;但因相关轨迹样本和缺少任务外验证,因果机制与可部署恢复能力文中未充分说明。

2026-08-12

40 篇
Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning Figure 1
2026-08-12cs.RO

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

2026-08-12机器人强化学习

针对手术机器人中带动作标注的遥操作轨迹稀缺、而内窥镜视频相对丰富的问题,论文提出基于 Cosmos Policy 的 Surgical WAM,先用无动作视频学习视觉动力学,再在固定动作标注预算上微调,并以滚动时域闭环输出动作块。四个 SurRoL 仿真任务中,视频预训练将平均成功率从 63.5% 提升到 77.8%,PegTransfer 增益 20 个百分点,收益主要出现在接触丰富和双臂任务。

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments Figure 1
2026-08-12cs.RO

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments

Sachin Sunil Kelkar, Tanmay Dokania, Yashwanth Kumar Nakka

2026-08-12机器人规划控制安全鲁棒

面向月球/行星车在未知地形动力学、感知和障碍边界不确定下的安全导航,本文把学习残差动力学的不确定性用 conformal prediction 量化,并将 CVaR 风险同时嵌入 AO-RRT 边代价与 SCP 轨迹优化。仿真和 Leo rover 硬件实验显示,风险中性初值经 SCP 可降约 69% 联合碰撞风险,风险感知 AO-RRT 初值可在相近控制代价下降低约 97% 风险。

VIScore: Diagnosing Planning-Relevant Quality in Latent World Models Figure 1
2026-08-12cs.RO

VIScore: Diagnosing Planning-Relevant Quality in Latent World Models

Haiyu Wu, Randall Balestriero, Morgan Levine

Altos Labs, Brown University[0.4em]

2026-08-12强化学习规划控制

论文针对潜在世界模型中“表示质量好”与“规划成功”脱节的问题,先用 SIGReg/VISReg 对照说明自监督正则的灵活性不必然带来控制收益,OOD 改善更依赖分布匹配精度。核心创新是提出 VIScore,从可达性、动作影响力和规划器幻觉三方面联合诊断编码器、预测器与搜索规划。实验显示其与跨任务成功率的 Spearman 相关通常超过 0.75,且校准误差优于常数基线,但作者也强调它是诊断指标而非成功率预测器。

Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads Figure 1
2026-08-12cs.RO

Deployment Is Not Destiny: Robot Recomposition in the Field with Unseen Software, Hardware, and Compute Payloads

Steven Swanbeck, Jonathan Salfity, Jeffery Gunawan, Corrie Van Sice, Mitch Pryor, Robert Blake Anderson

The authors are with Texas Robotics and the Walker Department of Mechanical Engineering, The University of Texas at Austin, Austin, TX 78712, USA.

2026-08-12机器人

本文针对机器人部署后配置僵化、现场新增能力常需专家集成和重启的问题,提出运行时“重组合”框架,将未知的软件、硬件与算力载荷抽象为自包含组件,自动发现、管理、共享并编入目标任务计划。结果显示,该方法可把重配置从数小时人工集成缩短到数分钟,并在核设施放射源定位和黑暗空间热成像搜救两类灾害响应场景中完成验证。

Seeing above the waves: A modular sensing framework for data acquisition at sea Figure 1
2026-08-12cs.RO

Seeing above the waves: A modular sensing framework for data acquisition at sea

Jonathan E. Schmidt, Julius Wirbel, P. Nicholas Hansen, Morgan Louédec, Christian L. H. Westerdahl, Dimitrios Dagdilelis, Roberto Galeazzi

2026-08-12机器人

海上自主航行缺少可复现、可比较的多模态数据,且传感器安装、天气海况和长时采集都难以标准化。论文提出面向不同船型的模块化传感平台蓝图,将雷达、LiDAR、相机、AIS、IMU/GNSS和气象传感器接入ROS2数据框架,并用MCAP统一记录。主要结果是该平台已在渡轮、港口巴士和USV等场景中长期部署,展示了跨船型采集、同步回放和硬件在环验证的可行性,但算法性能增益仍未充分量化。

Aerial Layouting: Design and Control of a Compliant and Actuated End-Effector for Precise In-flight Marking on Ceilings Figure 1
2026-08-12cs.RO

Aerial Layouting: Design and Control of a Compliant and Actuated End-Effector for Precise In-flight Marking on Ceilings

Christian Lanegger, Marco Ruggia, Marco Tognon, Lionel Ott, Roland Siegwart

Autonomous Systems Lab, ETH Zurich, Switzerland

2026-08-12规划控制

面向施工现场天花板放样中毫米级标记需求,论文指出单靠飞行器精控或复杂全身控制难以稳定接触。其核心是将柔顺、多接触点和顶部平移执行集成到经稳定性优化的 Gough-Stewart 末端执行器中,用机械设计吸收扰动并校正位置误差。消融和轨迹实验显示,该系统可在无需精确飞行器建模的情况下可靠绘制天花板线条并达到毫米级精度。

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes Figure 1
2026-08-12cs.CV

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

∗ Equal contribution. 1 Department of Robotics, Perception and Learning, KTH Royal Institute of Technology, Sweden.

2026-08-12机器人

这篇论文针对服务机器人难以回答“物体被谁在何时如何使用”等回溯问题,提出 GESTO:在持久 4D 场景图上加入原子人-物交互与高层目标事件的两级活动记忆,并自动从 RGB-D 流中抽取、分组和接地。实验显示其在标准问答类别得分约 0.70-0.75,接近使用真值接地的方法,并在新增空间-事件查询上保持类似水平。

Robust Safety Filtering for Input-Constrained Underactuated Linear Systems Figure 1
2026-08-12eess.SY

Robust Safety Filtering for Input-Constrained Underactuated Linear Systems

Muhamad Rausyan Fikri

2026-08-12安全鲁棒

这篇论文针对欠驱动线性系统在扰动、输入饱和和多安全约束并存时,传统 H∞ 控制难以保证瞬态安全的问题,提出将扰动观测器、H∞ 基准控制和鲁棒高阶 CBF 安全滤波结合。核心洞察是用扰动估计及其瞬态误差界同时修正名义输入并收紧安全约束;对单输入情形给出精确可行输入区间和可行裕度。仿真表明,两轮平衡机器人中位置与俯仰约束会竞争同一受限轮矩,方法能刻画这种安全-性能权衡。

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility Figure 1
2026-08-12cs.RO

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

◆ University of Washington, ‡ Allen Institute for AI

2026-08-12强化学习

该文针对现有世界-动作模型主要预测 RGB latent、缺少操控所需几何与物体语义信号的问题,提出 Flex-π:用同一冻结视频 VAE 近乎无损编码 RGB 与 3D pointmap,并结合 DINO 语义,在 Mixture-of-Transformers 中多流联合去噪;流 dropout 与跨模态 forcing 让单 checkpoint 可在动作-only到全模态间切换。实验显示其在 RoboTwin、LIBERO 和真实双臂精细操作上优于强基线,真实任务成功率提升约 2-7 倍,动作-only 模式还更快。

Enabling Scalable Kinesthetic Teaching via Observer-based Hand-guiding with Active Support Figure 1
2026-08-12cs.RO

Enabling Scalable Kinesthetic Teaching via Observer-based Hand-guiding with Active Support

Anna Tuma, Giuseppe Monetti, Jochen J. Steil, Niels Dehio

2026-08-12机器人

面向示教学习中长时间手把手采集易疲劳、现有方案要么只做重力补偿要么依赖腕部力/力矩传感器的问题,论文提出 RHOAS,将手引导视为人主动控制的交互,利用关节力矩与模型观测估计外力,并按人体运动带宽、奇异位形置信度和重力误差投影来生成主动支持。16 人 KUKA iiwa 实验显示体力消耗显著下降,精细与快速任务的可操纵性和用户偏好均优于基线。

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models Figure 1
2026-08-12cs.RO

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

Zhijie Wu, Kento Kawaharazuka, Kei Okada

2026-08-12视觉语言视觉感知

这篇论文针对 VLA 实时控制中视觉 token KV-cache 复用虽能省算力、但在模型不确定或长程操作时会因陈旧缓存累积动作误差的问题,提出无需训练的 Gated VLA-Cache:用动作解码时 top-1/top-2 logit margin 作为模型自省信号,低置信时触发全量重算。LIBERO 上结合 OpenVLA/OpenVLA-OFT 评测显示,它在 Goal 和 Long 任务中恢复超过全部因盲目缓存损失的准确率,同时保留约 80% 计算节省。

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation Figure 1
2026-08-12cs.RO

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

2026-08-12机器人

AECNav针对开放词汇零样本ObjectNav中感知链路重复、目标确认易受相似物干扰、探索缺少证据收益建模的问题,把导航重构为证据积累决策:共享C-RADIOv4编码并按证据触发分割,用3D簇级log-odds融合正负证据,再按信息增益和代价选前沿。其在HM3D-v2、HM3D-OVON、MP3D上成功率达84.7%、57.3%、51.3%,实机四足机器人40次试验成功率95%、约5Hz。

Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation Figure 1
2026-08-12cs.RO

Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation

Jamil Chahine, Wenqi Cai, John Abanes, Anthony Tzes

Department of Mechanical Engineering, American University of Beirut (AUB), Robotics and Intelligent Systems Control Laboratory, New York University Abu Dhabi (NYUAD), Department of Electrical and Computer Engineering, New York University, Center for Artificial Intelligence and Robotics /

2026-08-12机器人规划控制安全鲁棒

针对传统运行时导航安全监测主要依赖距离、碰撞时间等几何量、难以反映控制器实际避险难度的问题,本文提出从安全约束 MPC 已计算的 KKT 乘子中构造“dual stress”信号,刻画维持安全所需的边际控制代价。实验在物理仿真和预注册场景中表明,该信号能补充15个几何检测器,覆盖69%的可刹停碰撞,高于几何基线的47%,且联合后可提示约四分之三相关碰撞。

JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation Figure 1
2026-08-12cs.RO

JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

2026-08-12机器人强化学习

这篇论文针对现有 VLA/WAM 只隐式或短视地建模任务进展的问题,提出把机器人操作的未来拆成短期物理演化与阶段级语义目标。JEPA-WAM 用冻结 V-JEPA2 和目标条件 JEPA 预测下一阶段潜表示,再通过门控注入 Motus 式 WAM 以指导视频和动作生成;在 50 个 RoboTwin 2.0 任务上总体成功率达 90.25%,成功轨迹步数较最强基线减少 5.97%。

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting Figure 1
2026-08-12cs.RO

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology, The Hong Kong University of Science and Technology (Guangzhou) Guangzhou Guangdong China, The Hong Kong University of Science and Technology Hong Kong China

2026-08-12机器人视觉语言三维

本文针对移动操作中仅靠2D视觉语言线索易受遮挡、杂乱和照片诱骗影响,且底盘站位会限制抓取可行性的问题,提出以可刷新Semantic-3DGS为共享接口,将主动多视角建图、开放词汇3D定位、避障推理、可达性站位和扩散VLA后层语义注入串联起来。真实机器人50次评测中,长程成功率达60%,高于PointVLA的40%和DexVLA的28%,重杂乱场景达74%,并在75 cm高度变化下保持75%成功率。

TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4 Figure 1
2026-08-12cs.RO

TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4

Guangrui Shen, Zhili He, Shigang Wang, Yuanjun Sun, Qing Yu

2026-08-12机器人

这篇技术报告面向服装上料中单层分离、变形搬运、领口对齐和表面抚平难以自主完成的问题,提出TCAM闭环系统:通过定制夹爪、腕部四视角感知、UMI与真机混合示教,以及基于失败归因的定向重采样来收窄策略需学习的交互分布。系统在WBCD 2026 Track 4中平均约23秒处理一件T恤,25件中22件达到平整要求并获第一。

Robust Sliding Mode and Admittance Control of Underactuated Aerial Manipulators for Contact-Based Inspection Figure 1
2026-08-12cs.RO

Robust Sliding Mode and Admittance Control of Underactuated Aerial Manipulators for Contact-Based Inspection

Tareq Aziz Alqutami, Yvan Petillot, Matthew W. Dunnigan, Mustafa Suphi Erden

2026-08-12规划控制安全鲁棒

面向无损检测等需要持续接触的空中作业,本文针对欠驱动六旋翼在接触力与姿态耦合下难以稳压的问题,提出积分滑模轨迹控制、导纳力调节和接触力到姿态前馈的组合框架,并用1自由度机械臂补偿机体倾斜以保持端部对准。SITL结果显示其相较PID有更好的跟踪和耦合抑制,力控RMSE为0.12 N,可稳定施加20 N;但验证主要停留在仿真,实机鲁棒性文中未充分说明。

OAA: Three Phases of Vocal Guidance in Human-Drone Teleoperation Figure 1
2026-08-12cs.RO

OAA: Three Phases of Vocal Guidance in Human-Drone Teleoperation

Allan Henry (LPNC, GIPSA-COPERNIC, LIG, GETALP), Christian Graff (LPNC), Solange Rossato (LIG, José-Ernesto Gomez-Balderas (GIPSA-COPERNIC), Sylvain Huet (GIPSA-COPERNIC)

GIPSA-Lab, 2LIG, 3LPNC, Univ. Grenoble Alpes, Grenoble, France, corpus [10], a publicly available resource for research on

2026-08-12机器人

这篇论文针对语音无人机遥操作中“把口令当作平稳命令流”的问题,提出从轨迹变化自动识别人类指导的 Orientation、Approach、Adjustment 三阶段。作者用人指引人与人指引无人机两组数据验证,发现三阶段在运动速度、平滑性和词汇使用上显著不同,且跨执行界面复现,说明相位结构更可能来自人类空间指导策略,而非特定无人机动力学。

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks Figure 1
2026-08-12cs.CV

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

Wenbo Dong, Dipankar Bhattacharya, Akinari Kobayashi, Akira Seino, Fuyuki Tokuda, Xuzhao Huang, Kai Tang, Norman C. Tien, Kazuhiro Kosuge

2026-08-12视觉感知

这篇论文面向布料拆垛中的顶层布料分割问题,动机是层间边界细弱、纹理颜色相近会直接影响机器人抓取、展开和后续缝制。方法在编码器-解码器分割骨干训练中加入边缘感知与形状感知两条监督分支,分别强化轮廓定位,并用 CAD 参考掩码约束整体形状;推理时仅保留骨干网络。真实布料数据集实验显示其优于 UNet、GSCNN 等基线,消融也支持两类辅助监督带来增益。

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis Figure 1
2026-08-12cs.RO

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis

Christian Lanegger, Helen Oleynikova, Roland Siegwart, Michael Pantic

2026-08-12机器人

这篇论文针对机器人在野外运行时状态估计器可能因传感器混叠、分布外噪声等未建模扰动而失效、且协方差常过度自信的问题,提出只观察近期速度估计频谱功率分布的黑盒自省检测方法。其核心洞察是故障会在高频功率中留下更明显痕迹;在飞行机器人视觉/激光/雷达惯性里程计数据上,可检出51%–58%的标注故障,精度为60%–84%,但平滑漂移和低速场景仍较难识别。

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent Figure 1
2026-08-12cs.RO

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

Zitong Shan (1), Baichuan Lou (1), Yanxin Zhou (1), Shuge Wu (1), Xianqi He (1), Bolin Zhao (1), Sheng Zhao (1), Zhouheng Li (1), Chee Kiong Ong (2), King Ho Holden Li (1), Chen Lv (1) ((1) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore, (2) K2 Holding, L.L.C, Abu Dhabi, United Arab Emirates)

2026-08-12强化学习

论文以自动赛车作为具身智能在极端工况下认知与物理边界耦合的测试场,动机是现有系统多在保守安全裕度内评估,难以刻画能力极限。其核心是以世界模型同时预测交互演化、自车动力学与可行动作边界,并用闭环失败数据持续细化策略。实车数据最高约256.3 km/h、横向加速度26.8 m/s²,仿真全尺寸竞速交互成功率达88.3%。

BooST: Bridging Semantics and Motions for Efficient Skill Transfer Figure 1
2026-08-12cs.RO

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

2026-08-12机器人

机器人技能迁移常在“语义意图”和“运动动态”之间取舍,导致跨任务、跨本体泛化与部署效率难以兼顾。BooST 的核心是用跨模态 VQ-VAE 将视觉语言语义和动作轨迹共同量化到共享技能码本,再蒸馏为轻量策略用于下游少样本适配。实验显示其在仿真和真实 UR3 任务中优于多类技能基线,五个示范即可完成多任务适配,并在动态视觉干扰下保持更稳健的迁移表现。

Nonlinear Model Predictive Control via Sequential Convex Programming for Drone-to-Drone Docking Figure 1
2026-08-12cs.RO

Nonlinear Model Predictive Control via Sequential Convex Programming for Drone-to-Drone Docking

Neeraj Balachandar, Shriram Hari, Vishnu R. Unni

2026-08-12规划控制优化算法

面向受风扰、目标运动和感知噪声影响下的多旋翼空中对接,论文将任务建模为含扰动状态的有限时域非线性最优控制,并用序列凸规划嵌入NMPC在线重规划,统一处理动力学、对接锥、避障和目标预测约束。MuJoCo仿真显示其在静止与匀速目标上可收敛到接口,10度对接锥下违规很小,风扰标准差至0.5时仍保持有界速度和控制,但结果主要限于仿真验证。

JitTrack: Onboard Multi-Object Tracking Against Viewpoint Jitter for Agile UAVs Figure 1
2026-08-12cs.RO

JitTrack: Onboard Multi-Object Tracking Against Viewpoint Jitter for Agile UAVs

Yachun Shan, Feitian Zhang

2026-08-12视觉感知

针对敏捷无人机机载多目标跟踪中相机自运动导致的视角抖动和身份关联失效,JitTrack在查询式Transformer跟踪器中加入语义查询增强、运动感知查询校正和模拟抖动的去噪训练,并接入感知-规划-控制闭环。公开UAV MOT基准较基线稳定提升,实机飞行验证了在抖动条件下的跟踪与主动跟随可行性。

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models Figure 1
2026-08-12cs.RO

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

Carnegie Mellon University

2026-08-12视觉语言视觉感知三维

这篇论文指出,现有VLA把动作离散化主要当作轨迹重建问题,可能丢失动词所依赖的运动方式信息。作者发现动作轨迹本身含有视觉终态之外的语言 grounding 信号,并提出SALT,在VQ-VAE动作tokenizer中加入由冻结VLM从量化动作恢复指令的语义目标。实验中SALT在SimplerEnv达71.9%成功率,高于重建式VQ-VAE的42.7%和FAST的31.2%,但真实机器人和更大规模模型上的泛化仍文中未充分说明。

PBD-AG: Persistent Baseline-Delta Active Graphs with Uncertainty-Aware Inspection for Long-Horizon Service Robots Figure 1
2026-08-12cs.RO

PBD-AG: Persistent Baseline-Delta Active Graphs with Uncertainty-Aware Inspection for Long-Horizon Service Robots

Shuo Bao, Wei Dong, Shuyue Zhang, Ming Shang, Yuchen Huang, Han Yu, Chengjie Xu, Yiheng Bi, Kai Sun, Fuchun Sun, Xinzhou Wang

2026-08-12机器人安全鲁棒

这篇论文针对长期服务机器人在动态家庭/办公环境中难以持续维护对象身份、存在性和支撑关系的问题,提出 PBD-AG:先由机器人自主探索并验证稳定设施形成基线,再把可变物体变化记录为事件增量,并用几何可见性门控避免因遮挡或漏检误删对象。实验显示其在多场景中提升粗粒度设施 F1,并改善身份连续性与事件召回;实体机器人演示说明可接入机载 RGB-D 感知。

Elbow Angle Guidance System Based on Surface Haptic Sensations Elicited by Lightweight Wearable Fabric Actuator Figure 1
2026-08-12cs.HC

Elbow Angle Guidance System Based on Surface Haptic Sensations Elicited by Lightweight Wearable Fabric Actuator

Kenta Yokoe, Tadayoshi Aoyama, Yuki Funabora, Masaru Takeuchi, Yasuhisa Hasegawa

2026-08-12机器人

面向康复、VR遥操作等场景中肘部触觉设备笨重、干扰运动且反馈不直观的问题,论文提出用带两根 McKibben 人工肌肉的轻量织物执行器,通过实时调节气压在皮肤表面产生屈伸提示来引导肘角。人体实验显示其绝对误差中位数为22.8度,低于随机响应的39.1度,但精度仍有限,个体触觉敏感性和抗重力方向引导影响效果。

Automatic Field-of-View Adjustment for a View-Expansive Microscope via LSTM-Based Gaze and Pipette Motion Interpretation Figure 1
2026-08-12cs.HC

Automatic Field-of-View Adjustment for a View-Expansive Microscope via LSTM-Based Gaze and Pipette Motion Interpretation

Kenta Yokoe, Takuya Hara, Tadayoshi Aoyama

Center for One Medicine Innovative Translational Research, Gifu University, Yanagido 1-1, Gifu, Gifu 501-1193, Japan

2026-08-12机器人

针对 ICSI 显微操作中频繁切换视野和亮度会打断流程、拖慢新手操作的问题,论文将可同时获取大视野与高分辨率图像的显微镜同 LSTM 意图预测结合,利用操作者注视点及移液管位置、速度自动选择视野大小。基于专家数据训练后,在微珠模拟实验中使新手平均完成时间由 60.5 秒降至 48.0 秒,并接近专家速度。

Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models Figure 1
2026-08-12cs.AI

Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models

Jiahui Han, Yuhui Yao, Xin Wang, Jiafei Cao, Mingxuan Zhang, Danfeng Shan, Huiqi Deng, Guanchu Wang, Xia Hu

2026-08-12机器人视觉语言视觉感知生成模型

论文关注VLA机器人在真实部署中易受视觉补丁攻击的问题,指出既有方法常依赖白盒访问且补丁显眼。作者提出DURA,在预训练扩散模型的潜在轨迹中优化自然外观补丁,并可仅用动作输出做黑盒方向估计,将策略推向指定动作。在OpenVLA、π0-FAST、LIBERO和Franka实机上,DURA达到79.3–100%攻击成功率,并优于目标基线,显示现有VLA防护仍不足。

Hip Energized Monopedal Hopping Figure 1
2026-08-12cs.RO

Hip Energized Monopedal Hopping

Shane Rozen-Levy, Griffon McMahon, Daniel Koditschek

1 affiliationmark: GRASP Lab, Department of Mechanical Engineering and Applied Mechanics, University of Pennsylvania, Philadelphia, PA, USA, 2 affiliationmark: GRASP Lab, Department of Electrical and Systems Engineering, University of Pennsylvania, Philadelphia, PA, USA

2026-08-12机器人

这篇论文针对腿式机器人是否必须依赖高自由度腿部驱动的问题,研究仅用髋部执行器为单足跳跃补能。核心洞察是把俯仰稳定控制产生的反作用力矩转化为质心能量输入,并用非对称落脚策略调配径向与角向能量。作者给出混合平均分析的稳定性和定点表达式,并在5连杆仿真与Penn Jerboa实机上实现1.02至1.77 m/s的稳定跳跃。

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving Figure 1
2026-08-12cs.LG

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

Tongji University

2026-08-12强化学习

针对自动驾驶强化学习真实交互成本高、世界模型又易积累模型偏差的问题,论文提出 Dreamer-SAC:在 RSSM 潜空间中引入离策略 SAC,混合真实经验与短视距想象轨迹,并用 n-step 目标改进价值学习。MetaDrive 实验显示其优于 DreamerV3、SAC、PPO,且揭示 rollout 长度存在倒 U 型效应,短视距生成数据在样本效率与偏差之间更合适。

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations Figure 1
2026-08-12cs.RO

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

(No. 2025YFHZ0084). 1 Ziming Li and Jiaqi Zhang are with the School of Computer Science, The University of Auckland, Auckland 1010, New Zealand, College of Computer Science, Chongqing University, Chongqing 401331, China, Southwest University, Chongqing 400715, China

2026-08-12强化学习

这篇工作针对大物体难以由单只灵巧手稳定抓取、现有双手方法多停留在仿真且依赖完整三维模型的问题,提出面向真实双臂灵巧手的抓取框架:用遥操作采集含视觉、关节和力觉的多模态数据,并以DDPM从单视角分割点云生成双臂双手关节配置,再结合运动规划和在线接触修正执行。真实机器人实验显示其能在未见过的不同形状和姿态物体上取得较高成功率,消融也支持各模块有效。

A Neural Network Based Teleoperation for Remote Controlled Vehicles Figure 1
2026-08-12cs.RO

A Neural Network Based Teleoperation for Remote Controlled Vehicles

Ning Ding, Azim Eskandarian

2026-08-12规划控制

这篇论文针对车辆直接遥操作中的随机通信延迟和未建模道路/车辆扰动,提出面向单向车辆遥操作的波变量通信加自适应RBFN控制框架,并将纵向、横向不确定性解耦补偿。仿真中相较PID、LQR、MPC、NMPC表现出更强扰动鲁棒性,计算时间接近PID且显著低于预测控制;1/10实车在4G网络下验证了轨迹跟踪可行性。

Wind-Informed Rapid Flight-Planning in Complex Urban Topologies via Machine Learning and Experimental Validation Figure 1
2026-08-12cs.RO

Wind-Informed Rapid Flight-Planning in Complex Urban Topologies via Machine Learning and Experimental Validation

Peter I. Renn, Alejandro A. Stefan-Zavala, Julian Humml, Sabera Talukder, Aysha AlMazrouei, Kresna Aji, Debashisha Mishra, Emanuele Panizio, Jennifer Simonjan, Yisong Yue, Morteza Gharib

2026-08-12规划控制

面向城市低空飞行中建筑诱发强风、湍流导致航迹偏离的问题,论文用U-Net代理模型从建筑几何和来流快速预测三维风场,并构造结合速度梯度、TKE和障碍距离的飞行挑战代价场,再用最小代价搜索规划航迹。风洞微型无人机实验显示,相比不感知风场的最短路径,流场感知路径明显降低横向偏移并提升稳定性,平均偏差约从18.8 cm降至7.4–7.7 cm。

FACT: Failure-Aware Causal Training for World-Action Models Figure 1
2026-08-12cs.RO

FACT: Failure-Aware Causal Training for World-Action Models

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

University of California San Diego

2026-08-12强化学习

这篇论文针对现有世界-动作模型主要从成功示范学习、容易在坏动作下幻想成功未来的问题,提出先生成动作、再以执行动作为条件预测未来视频和任务进度的 FACT。其关键是屏蔽失败轨迹的动作模仿损失,但保留失败后果和低进度作为监督。实验显示该方法在仿真与真实双臂操作中优于多类基线,加入失败数据后效果提升,并减少成功偏置的未来预测。

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References Figure 1
2026-08-12cs.RO

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

Carlos Gonzalez, Luis Sentis

Authors are with the Department of Aerospace Engineering and Engineering, Mechanics, The University of Texas at Austin, TX 78712, USA.

2026-08-12机器人规划控制

这篇论文针对人形机器人在狭窄、非凸空间中易陷入碰撞约束局部最优、且需长时域多接触可行运动的问题,提出三阶段全身规划框架:先在运动学可达的刚体体积上生成带可微碰撞约束的几何参考,再优化为动态一致轨迹,并用其训练残差强化学习跟踪策略。在 Unitree G1 的三个超过 NIST 标准的受限场景中,方法生成 12–18 秒可行手足接触轨迹,基线规划器未能收敛,策略在仿真随机化下可稳定跟踪;硬件验证仍文中未充分说明。

Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds Figure 1
2026-08-12cs.RO

Navigating the Proximity-Safety Balance: Constraint Decomposition for Human Following in Pedestrian Crowds

Shiting Gong, Jianpeng Yao, Jinfeng Wang, Marco Pavone, Jiachen Li

2026-08-12优化算法安全鲁棒

这篇论文针对拥挤人群中机器人跟随目标行人时“靠得近”与“避碰安全”难以同时调节的问题,提出将任务奖励与跟随距离、人群安全、障碍物安全等约束分解,并用具有行为含义的阈值通过 PPO-Lagrangian 优化,同时引入行人运动预测不确定性。实验覆盖分布内外场景、不同密度和布局,并在 ROS 2 真机上验证,显示其相较基线有更高成功率和更低碰撞率。

Immersive Micromanipulation Integrating Pipette and Injector Operations with McKibben-Based Haptic Sensations for Workload Reduction Figure 1
2026-08-12cs.HC

Immersive Micromanipulation Integrating Pipette and Injector Operations with McKibben-Based Haptic Sensations for Workload Reduction

Kenta Yokoe, Sumiwa Saito, Yuki Funabora, Tomoko Isomura, Tadayoshi Aoyama

Department of Micro–Nano Mechanical Science and Engineering, Nagoya University, Nagoya, Aichi, 464-8603, Japan, Department of Information and Communication Engineering, Nagoya University, Nagoya, Aichi, 464-8603, Japan, Department of Cognitive and Psychological Sciences, Nagoya University, Nagoya, Aichi, 464-8603, Japan

2026-08-12机器人

本文面向 ICSI 等显微操作中过度依赖视觉、深度感知困难且需在移液管移动与吸排注射器间切换的问题,提出将手部追踪式 VR 操作、吸排控制和 McKibben 人工肌肉触觉反馈整合到单手界面中,用触觉表示吸取、排出及卵母细胞接触等隐性状态。新手受试实验显示,该沉浸式界面缩短任务时间并降低认知负荷,触觉反馈进一步提升系统可用性,但真实临床 ICSI 成功率增益仍文中未充分说明。

The Impact of Operational-Data Fidelity when Assessing Safety-Critical Autonomous-Vehicle Software Figure 1
2026-08-12cs.RO

The Impact of Operational-Data Fidelity when Assessing Safety-Critical Autonomous-Vehicle Software

Kizito Salako, Rabiu Tsoho Muhammad

K. Salako and R. Muhammad are with the Centre for Software Reliability, City St. George’s, University of London, Northampton Square EC1V 0HB, U.K.

2026-08-12安全鲁棒

本文关注自动驾驶安全关键软件评估中常见的低保真运行数据问题:日志只记录成败而缺少失效类型时,可靠性声明可能被系统性高估。作者扩展保守贝叶斯推断,将评估者对失效细节的未知显式纳入先验约束,并给出后验置信下界的保守估计。结果显示,即使有意保守使用粗粒度数据,所得安全可靠性结论仍可能危险乐观,数据保真度本身是评估鲁棒性的关键限制。

Protection Levels for Vision-Based Pose Estimation Figure 1
2026-08-12cs.RO

Protection Levels for Vision-Based Pose Estimation

Olivia Beyer Bruvik, Romeo Valentin, Marc R. Schlichting, Don Walker, Mykel J. Kochenderfer

2026-08-12视觉感知三维

这篇论文面向视觉辅助飞机进近中姿态估计难以认证的问题,把 GNSS/RAIM 的保护水平概念扩展到基于跑道关键点的非线性 PnP,给出覆盖位置与姿态 6 自由度、且考虑未检出故障的概率误差上界。分析显示保护水平随关键点噪声近似线性增大,随关键点数增加而下降;案例中 1 km 距离下沿航向保护水平由 4 个关键点时超 400 m 降至 20 个关键点约 32 m,但完整 6-DOF 的界限比仅位置估计大约一个数量级。

2026-08-11

116 篇
XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment Figure 1
2026-08-11cs.RO

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

Website: https://xpolicylab.github.io/

2026-08-11机器人强化学习数据集/基准

这篇论文针对机器人策略评测与部署中依赖、观测/动作格式和运行接口碎片化的问题,提出 XPolicyLab:用统一观测、动作、轨迹 schema、最小策略适配器和依赖隔离的客户端/服务器架构,把策略到环境的集成从 O(NM) 降为 O(N+M)。系统已接入 42 个策略,并在 RoboTwin、RoboDojo 仿真和真实机器人评测中复用同一接口;受控实验显示单个策略接入时间从五小时以上降至两小时,配合 agent skills 可降至三十分钟。

RoSE: A Robotic Soft Esophagus for Endoprosthetic Stent Testing Figure 1
2026-08-11cs.RO

RoSE: A Robotic Soft Esophagus for Endoprosthetic Stent Testing

Dipankar Bhattacharya, Sherine Jesna V. A., Leo K. Cheng, Weiliang Xu

Department of Mechanical Engineering, The University of Auckland, Auckland 1010, New Zealand., Riddet Institute, Palmerston North 4442, New Zealand., Auckland Bioengineering Institute, The University of Auckland, Auckland 1010, New Zealand, Medical Technologies Centre of Research Excellence, Auckland 1010, New Zealand., This is the author accepted manuscript (AAM). The Version of Record is available at:

2026-08-11机器人

针对食管支架临床试验受限、支架迁移与吞咽效率机制不清的问题,论文构建仿生软体机器人食管 RoSE,用可控蠕动、管腔直径和内镜测压在体外评估不同刚度支架。实验显示,高刚度支架径向力更大、迁移更少,但若发生屈曲会显著降低高浓度食团下的吞咽效率并可能诱发复发性吞咽困难。

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning Figure 1
2026-08-11cs.RO

Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning

Yapeng Liu, Yuanzhao Zhai, Bo Ding, Huaimin Wang, Lin Wang

2026-08-11强化学习规划控制

这篇论文针对开放环境中几何可行路径不一定满足机器人动力学约束的问题,提出将能量、动量、耗散与控制端口显式写入潜在世界模型 ELWM,并用 PC-NTF 把短时物理预测接入神经到达时间场。实验显示,相比通用潜在模型和 ANTF,方法降低运动预测误差与碰撞率,导航成功率由 81.3% 提升到 89.7%,但真实场景迁移仍文中未充分说明。

Entanglement-Free Trajectory Planning for Tethered Mobile Robots with a Slack Tether Figure 1
2026-08-11cs.RO

Entanglement-Free Trajectory Planning for Tethered Mobile Robots with a Slack Tether

Gianpietro Battocletti, Dimitris Boskos, Bart De Schutter

2026-08-11机器人规划控制

这篇论文针对松弛系绳机器人在障碍环境中易因系绳动力学和轨迹历史产生缠绕的问题,提出把防缠绕约束贯穿规划流程:先构建无缠绕配置空间的拓扑模型,筛选同伦类候选路径,再做同伦约束轨迹优化。仿真显示该方法能避免缠绕约束违背,生成更安全可靠的动态可行轨迹。

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy Figure 1
2026-08-11cs.RO

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

Pacific Northwest National Laboratory, Advanced Computing, Math, and Data Division, Richland, Washington

2026-08-11机器人

这篇论文针对机器人自治中规划模型可能生成危险、违背伦理或受攻击诱导的动作,而现有系统偏重执行、缺少运行时核验的问题,提出在规划模块与 MCP/低层控制之间加入 LLM-as-a-Judge 集成验证层,对计划作接受、拒绝重写或人工升级。实验显示三类决策加权精度约 85%,综合测试无接受/拒绝的灾难性混淆,对对抗计划约 97% 可被拦截,但升级边界仍是主要误差来源。

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance Figure 1
2026-08-11cs.RO

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

2026-08-11机器人

这篇论文针对通用机器人强化学习中奖励监督难扩展的问题,提出用“到语言目标的时间距离”替代偏好或归一化进度来训练价值基础模型。RynnValue从时间戳构造标签,并用乱序采样、价值隔离注意力抑制捷径,在7000小时、约300万片段上训练;无需偏好标注即在OOD排序上超过偏好监督SOTA,并将真实策略成功率提升到72.5%/82.5%。

Hierarchical Fast--Slow ReAct Agent for Zero-Shot Object-Goal Navigation Figure 1
2026-08-11cs.RO

Hierarchical Fast--Slow ReAct Agent for Zero-Shot Object-Goal Navigation

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

2026-08-11机器人

这篇论文针对零样本目标导航中反应式 value map 控制器只看当前地图、遇到远前沿或漏检等结构性僵局时缺少回溯推理的问题,提出快慢分层代理:底层持续导航并写入坐标锚定的语义网格与关键帧,上层 ReAct 仅在僵局触发时受预算地读取记忆、必要时调取图像,并用 VLM 预验证目标检测。系统在 HM3D v1 val 达到 68.75% SR、MP3D val 达到 47.29%,远前沿场景中相对 argmax 决策带来 3.40 个成功率点增益。

WRAP: Wasserstein-Robust Adaptive Plug-in for Robot Localization Figure 1
2026-08-11cs.RO

WRAP: Wasserstein-Robust Adaptive Plug-in for Robot Localization

Minhyuk Jang, Astghik Hakobyan, Jungjin Lee, Naira Hovakimyan, Insoon Yang

2026-08-11机器人安全鲁棒

机器人在 GNSS 多径、UWB 非视距等条件变化下会出现噪声均值偏移和协方差失配,导致 EKF/ESKF 定位偏差与过度自信。WRAP 将因果噪声统计适配器与均值保持的 Wasserstein 鲁棒局部更新解耦,在不改传播、残差和状态表示的情况下计算最不利协方差与鲁棒增益。18 条留出 UWB-IMU 序列中,相比 nominal ESKF 的 3D 位置 RMSE 降低 27.4%,优于仅适配的 19.8%;GNSS-INS 结果表明精度主要来自均值适配,DR 更多改善一致性。

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera Figure 1
2026-08-11cs.RO

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

Zhaochen Lan, Mengxiang Lin

Zhaochen Lan and Mengxiang Lin are with the School of Mechanical Engineering and Automation, Beihang University, Beijing 100191, China

2026-08-11机器人三维

机器人操作需要知道把手、壶嘴等可执行部件,而不是只识别物体或点云。RoboSeg的核心是用VLM先生成部件提示,再把RGB-D在线TSDF重建、SAM3关键帧分割和体素投票融合成稳定的部件级3D地图,并用它索引AnyGrasp候选。实验显示其手工标注对象部件mIoU为83.4%,24次真实操作中均接触目标部件,综合任务成功21次,但物体规模和试验数量仍较有限。

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation Figure 1
2026-08-11cs.RO

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

Fudan University, Beijing Academy of Artificial Intelligence, Tsinghua University, Renmin University of China

2026-08-11机器人

这篇论文针对大型 VLA 每步控制都依赖重型多模态骨干、像素级世界模型又浪费算力预测无关视觉细节的问题,提出 0.5B 参数的 SLIM。其核心是用自监督掩码轨迹预测在潜空间同时学习动作重建和未来表征预测,让动作与观测变化显式对齐,再用 MoT 与 flow matching 生成语言条件动作。实验显示其在仿真和真实操作中达到或超过多种 VLA/世界动作模型,并显著降低参数量、延迟和显存。

Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition Figure 1
2026-08-11cs.RO

Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

Changhao Li, Yifang Zhang, Heng Zhang, Davide Torielli, Damiano Gasperini, Arturo Laurenzi, Luca Muratore, Arash Ajoudani, Nikos Tsagarakis

2026-08-11机器人强化学习

这篇论文针对真实机器人在线强化学习在大随机化场景下样本效率低、混合动作训练不稳定的问题,将机械臂位姿与夹爪控制拆成两个 actor,并用 CTDE 共享多头 critic,再以任务奖励和抓取势能奖励分解价值估计。实验覆盖两种真实机械臂和仿真人形任务,在更大域随机化下相较基线把多项成功率从 60%/25% 提升到 80%/90%/95%,但增益中架构、奖励设计与系统调参各自贡献仍需消融进一步厘清。

TAMS: Task-Aware Multi-View Adaptive Streaming for Wireless Telerobotic Manipulation Figure 1
2026-08-11cs.RO

TAMS: Task-Aware Multi-View Adaptive Streaming for Wireless Telerobotic Manipulation

Zexin Deng, Zhenhui Yuan, Lu Tian, Subhash Lakshminarayana, Longhao Zou

School of Engineering, University of Warwick, Pengcheng Laboratory &

2026-08-11机器人

这篇论文针对无线遥操作中多路视频共享受限且波动上行带宽的问题,指出不同操作阶段对相机视角的价值并不相同。TAMS用末端位姿和夹爪事件推断任务阶段,并按阶段重分配三路视频码率,在保留次要视角基础可见性的同时强化关键视角。6-DoF实机实验显示,在最受限带宽下相较均分策略,平均完成时间由68.9秒降至43.9秒,成功率由48%升至71%。

Removing Infrastructure Barriers in Human-Robot Collaboration Through Wireless Reconfigurable Cells Figure 1
2026-08-11cs.RO

Removing Infrastructure Barriers in Human-Robot Collaboration Through Wireless Reconfigurable Cells

Emma Takács, Mátyás Hajós, Ádám Juniki, Ádám Fischer, Zoltán Komáromi, Kristóf Abai, Dániel Horváth, Sándor Máthé, Konstantinos Kousias, Bence Tipary

Removing Infrastructure Barriers in Human-Robot Collaboration, Human-Robot Collaboration (HRC) plays a vital, real-time perception and safe collaboration are greatly limited, in availability. This paper presents a highly flexible, wire-, Human-Robot Collaboration (HRC) is increasingly vital, HUN-REN Institute for Computer Science and Control (HUN-REN, E¨otv¨os Lor´and University (ELTE), Budapest, Hungary, University of Oslo, Norway, A supplementary video demonstrating the workcell is available at, as industrial collaborative robot (cobot) arms and their sensor, cells offers a solution, yet commercially available wireless, unavailable. Current industrial implementations still heavily

2026-08-11机器人

面向重制造等高混合、低批量场景中协作机器人频繁重构受电源和数据线束限制的问题,论文提出电池供电的机器人挂载多传感器平台,结合5G边缘卸载与具备手部感知的视觉检测/位姿估计管线。系统在匈牙利和挪威多类5G网络中验证,视觉模型mAP@50–95达97.74%、推理约12.5 ms,兼容网络下往返响应低至12 ms,但也暴露了当前5G互操作性限制。

Predictive safety filter enhanced curriculum learning control for efficient vehicle dynamics controller Figure 1
2026-08-11cs.RO

Predictive safety filter enhanced curriculum learning control for efficient vehicle dynamics controller

Baocong Zhang, Siliang Lu, Chenyang Li

2026-08-11规划控制安全鲁棒

针对车辆动力学控制中传统方案标定成本高、学习控制缺少安全保证的问题,论文提出用数据自动校准的可微7自由度白盒模型作为预测安全滤波器,约束课程学习控制器的制动指令,使其尽量保留AI策略输出同时纠正不符合物理或安全约束的动作。实验在Python-CarSim平台的多种机动工况中验证,报告了稳定性、敏捷性和可扩展性改进,但具体增益来源仍可能部分来自模型校准与数据覆盖。

Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance Figure 1
2026-08-11cs.LG

Satellite Trajectory Optimization via Proximal Policy Optimization for Space Debris Avoidance

Logan Luna (Georgia Institute of Technology), Juan Ortiz Couder (Embry-Riddle Aeronautical University), Raul Alejandro Vargas-Acosta (Embry-Riddle Aeronautical University)

Department of Electrical Engineering and Computer Science, Embry-Riddle Aeronautical University, Daytona Beach, FL 32114 USA, Present address: School of Computer Science, College of Computing, Georgia Institute of Technology, Atlanta, GA 30332 USA

2026-08-11强化学习规划控制优化算法

面向轨道拥挤和碎片增长导致的人工/规则避碰难以扩展问题,论文将PPO用于GEO卫星自主轨迹优化,并构建含二体动力学、日月摄动、燃料相关推力和可配置碎片场的开源仿真环境,通过课程学习和奖励塑形同时约束安全、轨道稳定与Δv消耗;在1000个确定性GEO回合中避碰成功率达97.5%,显著高于规则基线20.7%和脉冲Δv规划27.5%。

A Semantic Communication Approach to Fiducial Marker Processing in 5G-Enabled Edge SLAM Figure 1
2026-08-11cs.NI

A Semantic Communication Approach to Fiducial Marker Processing in 5G-Enabled Edge SLAM

Boris Radovanovic, Vukan Ninkovic, Katarina Vidojevic, Buda Bajic Papuga, Dejan Vukobratovic

2026-08-11机器人

这篇论文针对5G边缘SLAM中机器人上传原始图像或固定中间结果带来的带宽与时延压力,将DeepTag式标记关键点网络按不同层切分,把中间特征视为面向任务的语义信息在机器人与边缘间传输。其贡献在于把通信开销纳入标记处理流水线设计,并在ROS2与真实5G测试床上评估。结果显示,在保持关键点和位姿估计可用精度的同时,可显著降低5G链路通信负载,并揭示不同切分点的计算-通信权衡。

Nonlinear Model Predictive Control of a Robotic Soft Esophagus Figure 1
2026-08-11cs.RO

Nonlinear Model Predictive Control of a Robotic Soft Esophagus

Dipankar Bhattacharya, Ryman Hashem, Leo K. Cheng, Weiliang Xu

financially by Riddet Institute, Palmerston North, New Zealand, which is a national center of research excellence. (Corresponding author:, D. Bhattacharya, R. Hashem and W. Xu are with the Department of Mechanical, Engineering, University of Auckland, Auckland 1010, New Zealand, L. K. Cheng is with Auckland Bioengineering Institute, University

2026-08-11机器人规划控制

本文面向食管癌狭窄支架测试中难以在体实验、原RoSE软食管又缺少传感反馈的问题,构建带TOF位移与压力传感的RoSEv2.0,并用SINDYC从数据辨识非线性离散模型嵌入MPC,实现闭环蠕动与气压控制。实验生成了20 mm/s、75 mm波长、5/7.5/10 mm幅值的蠕动波,并用于不同食团黏度下的支架迁移测试;模型失配与长期弹性变化仍需后续在线更新处理。

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving Figure 1
2026-08-11cs.RO

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

Southeast University, Tsinghua University, Peking University

2026-08-11规划控制

针对自动驾驶 VLM 规划推理常停留在语义描述、固定模板难适配场景且缺少推理路径优化的问题,FactorDrive用规划关键因素组织PCF-CoT,将车道、可行驶区域、交通约束和交互体运动等空间物理证据纳入多步推理,并用MCTS结合轨迹奖励搜索更优推理路径后以GRPO训练。文中称其在nuScenes与NAVSIM上达到SOTA,但具体增益中数据构造与后训练各自贡献仍需看消融确认。

GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association Figure 1
2026-08-11cs.CV

GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association

Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft, Leon Bodenhagen

*SDU Robotics, University of Southern Denmark, detection matching approach is introduced to enhance scalability with increasing target numbers while supporting, sented to address this issue but exhibited poor scalability as the, dating scheme and velocity regression. However, scalability, for temporal and scalable numbers of targets. Section 3 evalu-, Xi,t = (ui,t, vi,t, wi,t, hi,t), characterized by center (ui,t, vi,t) and, posed track-detection matching for scalable numbers of targets.

2026-08-11视觉感知

针对遮挡、非线性运动和目标数量变化下的身份保持难题,GenTrack3把粒子式不确定性建模与确定性轨迹管理结合,用每目标粒子集估计匹配代价,并通过聚类感知的轨迹-检测分组降低全局关联复杂度、支持群组跟踪。论文在MOT17、MOT20上验证该框架,但给定片段未充分说明具体指标幅度,主要结果可概括为在拥挤场景中提升可扩展性与关联稳健性。

TDMA Based Communications Control Co-Design for Cooperative Carrying: Delay Calibration and Sampling-Rate Optimization Figure 1
2026-08-11cs.RO

TDMA Based Communications Control Co-Design for Cooperative Carrying: Delay Calibration and Sampling-Rate Optimization

Zahra Seifaei, Maximilian Luebke, Torsten Reissland, Danial Dehghani, Norman Franchi

2026-08-11规划控制优化算法

面向多机器人协同搬运中无线时延、丢包与固定领导者占用信道导致的稳定性和公平性矛盾,论文将TDMA下的延迟感知自适应采样与轮换领导者联合评估,并用FF+PI调节广播周期。MuJoCo与 realistic MAC 仿真显示,自适应采样最多降低39%丢包且不损害力跟踪,轮换领导者将Jain公平指数由0.33提升到0.91,任务性能代价低于2%。

Model-Based Systems Engineering Framework for SysML-Driven Design of Autonomous UAVs Figure 1
2026-08-11cs.RO

Model-Based Systems Engineering Framework for SysML-Driven Design of Autonomous UAVs

Deekshitha Angadi, Naveena Budda, Vikas Agarwal, Mohamed Samshad, Bharath Kumar Suryadevara, Narsimlu Kemsaram

2026-08-11机器人

针对自主无人机早期开发中需求、架构与 ROS 2 实现割裂导致的接口不一致和可追踪性弱问题,论文提出四层 MBSE-SysML 框架,将需求、功能分解、逻辑架构映射到 ROS 2 节点、话题、服务和动作。结果展示了起飞、航点导航、避障、返航等场景的设计级建模与验证规划,但尚未完成 Gazebo、硬件在环或实飞验证,实际工程增益仍需后续实验说明。

Robotic Fabric Alignment System for Sewing Using Global Local Weighted ICP Figure 1
2026-08-11cs.RO

Robotic Fabric Alignment System for Sewing Using Global Local Weighted ICP

Wenbo Dong, Dipankar Bhattacharya Member, Kai Tang, Akinari Kobayashi, Fuyuki Tokuda, Akira Seino, Norman C. Tien, Kazuhiro Kosuge

2026-08-11机器人

面向缝纫前布片对齐高度依赖人工、边缘误差会导致缝线偏移的问题,论文提出结合视觉位姿估计与滚轮末端执行器的自动对齐系统。核心在于 GLW-ICP 同时利用裁片外缘的全局信息和缝线的局部信息,并剔除遮挡区域的不可靠匹配。真实布片实验显示,在有无遮挡情况下均可达到毫米级对齐精度。

A Height-Constrained 2-Point Minimal Solver for Pose Estimation from Active LED Markers with Event Cameras Figure 1
2026-08-11cs.CV

A Height-Constrained 2-Point Minimal Solver for Pose Estimation from Active LED Markers with Event Cameras

Runze Yuan, Alexander Kappler, Jun Zhang, Kuangyi Chen, Fabio Morbidi, Pascal Vasseur, Cédric Demonceaux, Friedrich Fraundorfer

Institute of Visual Computing, Graz University of Technology 2 MIS laboratory, University of Picardie Jules Verne 3 ICB laboratory, University of Burgundy Europe

2026-08-11优化算法三维

面向室内、隧道等 GNSS 受限场景中低延迟定位需求,本文针对事件相机与主动 LED 标记提出仅需两个标记的位姿最小解法,利用机载 IMU/高度计可得的倾角与相机高度约束,给出闭式解和线性最小二乘形式,并分析退化情形。合成与真实动捕数据表明,该方法较现有 P2P 精度更高,尤其在远距离观测下位置估计更稳健,性能接近 P3P 且无需额外标记消歧。

HarnessWAM: Bridging Prediction and Deliberation in World Action Models Figure 1
2026-08-11cs.RO

HarnessWAM: Bridging Prediction and Deliberation in World Action Models

Zhaopeng Gu, Bingke Zhu, Tianxi Lin, Guibo Zhu, Yingying Chen, Kai Wang, Tingyu Yuan, Chaoyang Zhao, Zhaowen Li, Peng Su, Jinqiao Wang

Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China, Yinwang Intelligent Technology Co., Ltd., Shenzhen, Beijing Institute of Technology, Beijing, China

2026-08-11强化学习

论文针对世界动作模型只擅长短程预测与局部执行、难以处理长程任务状态维护和失败恢复的问题,提出模型外的 HarnessWAM 运行框架:用 VLM 任务管理器维护证据化场景信念与任务图,将语义计划约束到可执行技能空间,并通过双时间尺度反馈进行验证、重规划和恢复。在 RoboMemArena 上达到 59.6% 全任务成功率、69.9% 子任务成功率,在 RoboCerebra Ideal 上 SR 为 23.7%。

Tether-Inertial Localization for Planetary Drones Figure 1
2026-08-11cs.RO

Tether-Inertial Localization for Planetary Drones

Dielof van Loon, Anton Bredenbeck, Lennart Puck, Martin Azkarate, Salua Hamaza

Biomorphic Intelligence Laboratory, Dept. of Control & Operations, Faculty of Aerospace Engineering, TU Delft, The Netherlands., Planetary Robotics Lab, European Space Agency, Noordwijk, The Netherlands.

2026-08-11机器人

面向行星无人机在弱纹理、GNSS 不可用且机载算力/电量受限场景中的定位问题,论文把系缆从供能通信介质进一步用作无漂移定位传感器,结合解析悬链线模型与方差门控 GP 残差补偿,利用长度、角度和张力估计相对位置。实飞圆形、三角和 8 字轨迹共 37 分钟、最长 4.5 米系缆下,仅靠系缆反馈即可闭环控制,RMSE 从 7.4 厘米降至 5.2 厘米,显著优于既有米级或分米级方法。

Rethink Before You Execute: Adaptive Execution for World Action Models Figure 1
2026-08-11cs.RO

Rethink Before You Execute: Adaptive Execution for World Action Models

Feng Ye, Yiming Zhao, Yong Yu, Hongxu Zhou, Yong Pan, Yuan Xue, Peng Jia, Chuanmin Jia

2026-08-11强化学习

论文针对世界动作模型执行动作块时固定重规划步长不适配不同任务阶段的问题,提出 TempoWAM:用轻量循环进度监测器估计当前观测、指令、剩余动作和历史对应的任务进展,再由自适应协议决定继续执行或重规划,并用在线校准缩小部署偏差。在 LIBERO、RoboTwin 和真机实验中,该方法改善成功率与推理次数权衡,真机简单任务减少 26.9% WAM 调用,困难任务成功率提升 13.3 个百分点。

Graph-Guided Safe Diffuser: Topological Graph Guidance for Safe Diffusion Planning Figure 1
2026-08-11cs.RO

Graph-Guided Safe Diffuser: Topological Graph Guidance for Safe Diffusion Planning

Nakgyu Yang, KwangBin Lee, SooJean Han

School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)

2026-08-11生成模型规划控制安全鲁棒

这篇论文针对扩散规划中安全梯度在采样时强行改轨、可能造成轨迹脱离运动学数据流形的问题,提出 G2SD:先用 VQ-VAE 从示范中学习潜在拓扑图并剪除不安全节点,再用最短路给低层扩散模型提供分段端点条件。其核心洞察是把安全约束前移到结构化图搜索,可减少“manifold rupture”和长时域漂移。实验中 Maze2D 无碰撞到达率由约 40-50% 提升到 98%,并在 locomotion 得到更高任务分数。

Trajectory-Induced Self-Calibration for Hidden-Target Localization Through an Unknown-Pose Range-Bearing Relay Figure 1
2026-08-11eess.SY

Trajectory-Induced Self-Calibration for Hidden-Target Localization Through an Unknown-Pose Range-Bearing Relay

Yash Bagla

Michigan State University

2026-08-11规划控制三维

本文针对车辆无法直接观测目标、只能接收未知位置与航向中继给出的局部距离-方位包这一定位场景,说明单一姿态会留下连续标定歧义,而车辆轨迹提供的两个不同相对观测已足以闭式恢复中继航向、位置并锚定隐藏目标。其核心洞察是把运动激励视为自标定实验,并用轨迹扩展度解释可辨识性与估计条件数;仿真中目标 RMSE 达 5.5 mm,显著优于朴素 EKF,且鲁棒损失在 10% 离群下仍保持毫米级精度。

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction Figure 1
2026-08-11cs.RO

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

The Chinese University of Hong Kong, Shenzhen, Beijing University of Posts and Telecommunications, Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Li Auto Inc.

2026-08-11视觉语言视觉感知

这篇论文针对VLA机器人策略在部署时无标签适应不稳定的问题:共享提示会混合不同任务的修正,在线更新也可能在后果未验证前破坏闭环控制。VANE用上下文路由的潜在提示、未来视觉表征预测和影子更新验证机制,只在后续观测支持时提交更新。实验中在SimplerEnv WidowX较TTT基线提升约3.2个百分点,结论也指出Google Robot上的收益依赖任务和本体,泛化性仍受限制。

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation Figure 1
2026-08-11cs.RO

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

2026-08-11机器人

这篇论文针对VLA机器人策略只看当前观测、难以处理需长期记忆的非马尔可夫操作任务,提出HyMeS:将低层运动技能保留在模型权重中学习,把计数、目标绑定和阶段切换等记忆逻辑写成可执行代码,并用多模态完成验证闭环更新记忆。在RoboMemArena上,HyMeS相较π0.5将CSR从52.5%提升到66.2%、TSR从41.3%提升到60.1%,且优于PrediMem。

Beyond the Plane: Coupling Planar Vehicle Dynamics with Three-Dimensional Road Geometry Figure 1
2026-08-11cs.RO

Beyond the Plane: Coupling Planar Vehicle Dynamics with Three-Dimensional Road Geometry

Simon Sagmeister, Phillip Pitschi, Nico Haja, Markus Lienkamp

S. Sagmeister and M. Lienkamp are with the Technical University of Munich, Germany, School of Engineering & Design, Department of Mobility Systems Engineering, Institute of Automotive Technology.P. Pitschi is with the Technical University of Munich, Germany

2026-08-11机器人

针对自动驾驶仿真中二维车辆模型难以反映真实三维道路载荷变化的问题,论文提出一种黑盒耦合方法:将平面车辆状态映射到三维道路,并把道路几何诱发的力和力矩反馈给原模型。合成赛道与拉斯维加斯倾斜赛道实车数据表明,该方法显著降低垂向、横向加速度和横摆角速度误差,且单步约9.5微秒,适合实时仿真。

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling Figure 1
2026-08-11cs.RO

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

2026-08-11视觉语言视觉感知强化学习

针对现有VLA策略只隐式建模状态转移、视频生成式WAM部署成本高的问题,JEPA-WAM在预训练V-JEPA空间中学习密集的当前-未来联合转移目标,并用共享预测器把转移监督直接作用到动作生成表征。其在LIBERO-Plus无大规模机器人策略预训练下达79.2%,接入π0.5后达86.3%,并在RoboTwin 2.0和真实双臂任务中表现出更好的视觉与空间分布外泛化。

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving Figure 1
2026-08-11cs.RO

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

2026-08-11视觉语言

针对单车感知受限、遮挡场景决策不稳以及车端部署大模型成本高的问题,DH-VLM将路侧全局语义推理与自车局部规划解耦,通过HLA压缩多层隐状态并以IDLE在潜空间指导自车推理,同时保持自车自治。实验显示其规划L2误差较前SOTA降14.6%、碰撞率降26.9%,通信量和显存也分别降低57.3%与25.5%。

SAFE-CHEM: Uncertainty-Aware Policy Switching for Robust Robotic Chemistry Figure 1
2026-08-11cs.RO

SAFE-CHEM: Uncertainty-Aware Policy Switching for Robust Robotic Chemistry

Laura Jones, Shazil Shahzad, Ayesha Sana, Gabriella Pizzuto

2026-08-11机器人强化学习安全鲁棒

面向化学实验室中学习型机器人因分布外状态而过度自信、可能造成泼洒或碰撞的问题,SAFE-CHEM用循环网络模仿学习策略集成的动作方差在线估计认知不确定性,并以KDE校准阈值,在高风险时切换到规则备份控制器。三类基础操作实验显示,该混合控制提高成功率并减少关键安全违规,且在Franka机械臂上展示了零样本仿真到现实迁移。

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation Figure 1
2026-08-11cs.RO

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

2026-08-11机器人强化学习

这篇论文针对机器人动作条件世界模型常被视觉质量或任务成功率粗略评估、难以判断是否真能充当物理模拟器的问题,提出 Observable Simulator Contract 与 WorldSimProbe,用五类受控测试追踪动作到运动再到环境响应的因果链。作者在 RoboTwin、ManiSkill、LIBERO 上评测六个开源模型、超过 1.8 万实例,发现现有 ACWM 普遍存在动作实现退化、交互 grounding 和动力学错误,且诊断信号与人类判断和下游表现一致。

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation Figure 1
2026-08-11cs.AI

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

2026-08-11机器人

本文针对“看起来像 CAD”并不等于可工程使用的问题,提出 CADEngBench,将参数化零件生成/编辑与装配推理分成两条评测轨道,加入 B-Rep 有效性、DFM、参数扰动、FEA 和精确配合实体/运动验证。结果显示,现有多模态代码模型编辑已有 CAD 明显易于从零生成,复杂编辑、结构响应匹配和装配实体恢复仍是主要短板。

Real-Time Nonlinear MPC via Sequential Quadratic Programming with Structure-Exploiting ADMM and Interior-Point Methods for Underactuated Double-Pendulum Swing-Up Figure 1
2026-08-11eess.SY

Real-Time Nonlinear MPC via Sequential Quadratic Programming with Structure-Exploiting ADMM and Interior-Point Methods for Underactuated Double-Pendulum Swing-Up

Nick Karydakis, Konstantinos Chatzilygeroudis

Laboratory of Automation and Robotics (LAR) in the Department of Electrical & Computer Engineering, University of Patras, GR-26504 Patras, Greece

2026-08-11规划控制

面向 AI Olympics 真实 CloudPendulum 中欠驱动双摆在模型参数未知、硬件交互受限下的摆起与稳定问题,论文采用逆动力学形式的实时非线性 MPC,并用 SQP 将问题转为结构化 QP,结合时序稀疏的 ADMM 或 HPIPM 求解以满足实时性。实验在 Pendubot 与 Acrobot 上显示平均摆起成功率超过 90%,且可从力矩扰动中恢复;但 Acrobot 可靠性仍依赖摩擦补偿,在线辨识尚属未来工作。

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm Figure 1
2026-08-11cs.RO

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou

tasks. Additional scalability simulations further verify its appli-, School, University, ied, as it effectively enhances collaboration efficiency [5]., collaboration methods for this task can be categorized into two, an MRS comprising four robots, which limits its scalability

2026-08-11强化学习

本文针对防御机器人在机动性弱于攻击群且对方策略未知时,难以实时选择合适围堵队形的问题,提出用五个低维参数连续表示队形,并由强化学习策略在线调节这些参数,上层决定队形、下层执行避碰控制。结果显示该方法优于三个直接控制机器人基线,可扩展到数十机器人仿真,并在3个攻击者、7个防御者实物平台验证可行性。

Ultra-Low-Impedance Robotic Gripper for High-Bandwidth and Transparent Physical Interaction Figure 1
2026-08-11cs.RO

Ultra-Low-Impedance Robotic Gripper for High-Bandwidth and Transparent Physical Interaction

Joon Lee, Ari Choi, Seokhwan Jeong

2026-08-11机器人

面向灵巧抓取中高减速传动带来的摩擦、惯量和力感知复杂度问题,论文提出三指9自由度差分直驱夹爪,用1:2低速比差分机构把电机集中在基座,并在MCP屈曲时并联两电机放大扭矩。原型实现约18 N名义抓力、4.7 N指尖力,电机惯量贡献0.236%,断电被动阻抗最高50.1 N/m,关节闭环带宽约8.1–13.91 Hz。

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot Figure 1
2026-08-11cs.RO

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot

Yuhao Cao, Xiao Liu, Yang Xie, Lu Liu, Haoyao Chen

2026-08-11机器人视觉语言

这篇论文针对真实移动机器人中“找那把椅子”等模糊指令难以直接导航的问题,提出 SAIN:把主动问答得到的信息、路线提示和实例确认转成持久的目标证据、走廊记忆与候选物标签,而非一次性文本上下文。其零样本策略在 VL-LN IIGN 上将 SR 从 20.2 提升到 25.4、SPL 从 13.07 提升到 14.17,并展示了实机运行;但失败分析显示高相似实例的最终确认仍是主要瓶颈。

Intuitive Directional Sense Presentation to the Torso Using McKibben-Based Surface Haptic Sensation in Immersive Space Figure 1
2026-08-11cs.HC

Intuitive Directional Sense Presentation to the Torso Using McKibben-Based Surface Haptic Sensation in Immersive Space

Kenta Yokoe, Tadayoshi Aoyama, Yuki Funabora, Masaru Takeuchi, Yasuhisa Hasegawa

2026-08-11机器人

针对沉浸式空间中视觉信息过载、用户容易错过目标的问题,论文提出用穿戴式织物执行器和 McKibben 人工肌肉在躯干表面产生方向性触觉,通过基于当前视线与目标方向的气压调节诱导躯干姿态变化,从而间接引导注视。受试实验表明该方法可将目标带入中央视野并评估了触觉感知速度,混合现实微操作演示显示其具备遥操作应用潜力。

Intuitive Hand Positional Guidance Using McKibben-Based Surface Tactile Sensations to Shoulder and Elbow Figure 1
2026-08-11cs.HC

Intuitive Hand Positional Guidance Using McKibben-Based Surface Tactile Sensations to Shoulder and Elbow

Kenta Yokoe, Yuki Funabora, Tadayoshi Aoyama

2026-08-11机器人

面向沉浸式环境和远程操作中视觉通道受限、手部设备易干扰跟踪的问题,论文用McKibben人工肌肉驱动衣物在肩肘产生表面触觉,直接诱发六类关节运动,并以心理物理模型调节强度。实验显示肩部动作诱发准确率约92%,无明显方向偏置;手部定位较语音更快、较振动触觉在无需预先说明映射关系时速度更高且精度相当。

Particle-Based Conformal Prediction for Contact-Aware Uncertainty Calibration in Stratified Configuration Spaces Figure 1
2026-08-11cs.RO

Particle-Based Conformal Prediction for Contact-Aware Uncertainty Calibration in Stratified Configuration Spaces

Luís Marques, Kristian Popov, Dmitry Berenson

\addr Department of Robotics, University of Michigan, Ann Arbor, MI, 48109, USA, \addr Department of Aerospace Engineering, University of Michigan, Ann Arbor, MI, 48109, USA

2026-08-11安全鲁棒

面向接触丰富机器人任务中不确定性会随碰撞、滑动和接触模式突变而改变的问题,本文提出 CaPTURe,将粒子动力学预测、分层构型空间几何和 Mondrian 式保形校准结合,生成不落入不可行区域的跨维预测集,并给出单步有限样本覆盖保证。在迷宫滚球和机械臂插孔仿真中,它在接触/非接触情形均达到指定覆盖率,任务成功率较最佳基线最高提升约 30 个百分点。

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning Figure 1
2026-08-11cs.RO

SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning

David D. Yuan, Tony Z. Zhao, Kaylee Burns, Chelsea Finn

Stanford University

2026-08-11强化学习

这篇论文针对模仿学习机器人策略常受示教速度和硬件约束、部署时执行偏慢的问题,提出在已有任务策略之上训练轻量级强化学习“速度策略”,按状态为动作块动态选择执行倍率,而不重新采集示教数据。实验覆盖倒水、投掷、抓取等仿真与真实任务,报告相对原始模仿策略超过2.4倍加速,并比固定倍率插值更能维持任务成功率。

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing Figure 1
2026-08-11cs.RO

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing

Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo, Rohit Satishkumar, Hongyi Chen, Jeffrey Ichnowski, Dan Ding, Zackory Erickson, Nancy S. Pollard

School of Computer Science, Carnegie Mellon University 2 School of Health and Rehabilitation Sciences, University of Pittsburgh ∗ Denotes equal contribution

2026-08-11机器人模仿学习三维

面向护理洗浴这类持续、动态且富接触的人机交互,现有机器人缺少来自真实照护示范的细粒度数据支撑。论文以接触区域为核心处理单元,联合重建运动、人体/手形、接触与力,采集3名临床人员对6名受试者的128段、25.7万帧数据,并据此设计软体灵巧手、实现开环/闭环控制和机械臂重定向,在假人洗浴任务上验证了示范迁移的可行性。

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation Figure 1
2026-08-11cs.RO

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

* Equal contribution 1 Department of Electronic Engineering

2026-08-11机器人规划控制

这篇论文针对手术 VLA 策略固定长度开环执行容易在组织形变、滑移和场景变化中累积误差的问题,提出 TDHD:在测试时用微小噪声扰动下两条 flow-matching 轨迹的分歧估计逐步可靠性,并用双阈值截断动作触发重规划。作者还搭建真实达芬奇式双臂基准,采集 600 次遥操作示教;硬件实验中针操作成功率由 55% 提至 60%,组织操作由 55% 提至 80%,说明自适应执行时域对末段操作可靠性更关键。

ROEVO: Robust Organized Edge Feature-based Visual Odometry Using RGB-D Cameras Figure 1
2026-08-11cs.RO

ROEVO: Robust Organized Edge Feature-based Visual Odometry Using RGB-D Cameras

Mingrui Liu, Xingxing Zuo, Renlang Huang, Minglei Zhao, Jiming Chen, Liang Li

2026-08-11生成模型安全鲁棒

ROEVO针对现有边缘视觉里程计把边缘当作离散像素、难以保留结构信息和跨帧关联的问题,提出“organized edges”表示,将边缘像素序列化成簇,并基于边级残差、跨帧边关联、形状保持拟合和面向边缘的BA构建RGB-D VO系统。实验显示其在室内与低纹理场景中具备较好精度和鲁棒性,整体优于或接近现有方法。

UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes Figure 1
2026-08-11cs.RO

UnsDrive: Towards Robust End-to-End Autonomous Driving in Unstructured Scenes

Nanxin Zeng, Ruiqi Song, Xiangyu Guo, Baiyong Ding, Yunfeng Ai

University of Chinese Academy of Sciences, Institute of Automation, Chinese Academy of Sciences, Waytous Inc., University of Chinese Academy of Sciences Beijing China, Institute of Automation, Chinese Academy of Sciences Beijing China, Waytous Inc. Beijing China

2026-08-11安全鲁棒

本文面向矿区等非结构化场景中道路弱约束、遮挡和未知区域导致端到端驾驶规划失效的问题,提出 UnsDrive:显式区分可通行、占用与未知空间,并将其约束到 flow matching 多模态轨迹生成、轨迹一致性损失和不确定性感知打分中。作者还构建 MineLoop 闭环仿真;实验显示其在轨迹精度、避碰和长时程鲁棒性上优于基线,但实车验证仍缺失。

Latent World Models with Monotone Planning Costs for Image-Goal Navigation Figure 1
2026-08-11cs.RO

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

Amirhosein Chahe, Siwei Cai, Lifeng Zhou

Drexel University

2026-08-11机器人视觉感知强化学习规划控制

这篇论文针对图像目标导航中 latent world model 虽能预测未来、但规划代价未必能正确排序候选动作的问题,提出用自回归 rollout 缩小训练与 CEM 多步规划的错配,并用 Monotone Cost Ranking 直接塑造余弦代价的单调性。实验显示其在 GNM 上优于 NWM、DINO-WM、OmniVLA 和 NoMaD,较同编码器 DINO-WM 将朝向误差降低 2.7 倍,并完成真实机器人零样本部署。

Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization Figure 1
2026-08-11cs.RO

Personalized Lower-limb Exoskeleton Assistance via Preference-based Bayesian Optimization

Xiao-Yin Liu, Guotao Li, Weiqun Wang, Zeng-Guang Hou

2026-08-11优化算法

这篇论文针对下肢外骨骼个体化调参中用户交互成本高、偏好目标难以显式建模的问题,提出将高斯过程偏好学习与贝叶斯优化结合的 PbBO,并用候选集采样分布与改进采集函数提升样本效率。六维髋关节力矩参数在约 20 次迭代内达到 90.7%偏好验证准确率;跑台和户外实验中,相比无助力行走,代谢率降低 14.5%至15.4%,心率降低 6.3%至7.6%,肌肉激活降低 6.7%至31.5%。

From Operational Design Domain to Action: A Systematic Behavioral Taxonomy for Autonomous Driving Figure 1
2026-08-11cs.RO

From Operational Design Domain to Action: A Systematic Behavioral Taxonomy for Autonomous Driving

Chaitanya Shinde, Hadi Hajieghrary, Miguel Hurtado

2026-08-11机器人

本文针对自动驾驶 ODD 只界定“能在哪运行”、却缺少“在其中必须会做什么”的验证缺口,提出从 PEGASUS 六层 ODD 系统推导行为能力的分类框架。核心是将 21 类行为按高速、城市、Hub 三域组织,并以纵横向控制及安全、合规、舒适、效率四属性描述,再把 ODD 参数与行为规格交叉生成可测试场景族。结果显示该框架可作为 SOTIF 覆盖证据和规则约束轨迹优化的操作层,但 Hub 域仍明显欠规范。

Estimation of Spacecraft Inertia Tensor Using Attitude-Only Data from Torque-Free Motion Figure 1
2026-08-11cs.RO

Estimation of Spacecraft Inertia Tensor Using Attitude-Only Data from Torque-Free Motion

Daigo Kobayashi, Vakhtang Putkaradze

Daigo Kobayashi 1 1 1 Assistant Professor, Department of Aerospace Engineering and Mechanics, Hardaway Hall, Tuscaloosa, Alabama 35487-0350, USA., Vakhtang Putkaradze 2 2 2 Professor, Department of Mathematics, Gordon Palmer Hall, Tuscaloosa, Alabama 35487-0350, USA.

2026-08-11机器人

针对非合作航天器难以获得陀螺和控制力矩数据的问题,本文从无外力矩姿态序列估计归一化惯量张量;核心是用KKT线性初始化结合欧拉方程Jacobi椭圆精确解与Magnus四元数映射做非线性射击优化。仿真和图像测姿实验显示,其误差显著低于KKT+EKF且计算更快,单弧图像案例仍可支撑10小时姿态预测,但效果依赖足够旋转激励。

SHRIMP: Iterative Refinement of Robot Task Plans Figure 1
2026-08-11cs.RO

SHRIMP: Iterative Refinement of Robot Task Plans

Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

Department of Computer Sciences, University of Wisconsin–Madison, University of Wisconsin–Madison Madison Wisconsin USA

2026-08-11机器人

这篇论文针对非机器人专家用自然语言编程协作机器人时的语义歧义和计划不可见问题,提出 SHRIMP:先由 LLM 生成分层机器人原语计划,再让用户在物理仿真中逐步回放、重提示或显式修改参数,满意后再上真机执行。35 人桌面厨房任务消融实验显示,相比不可见且不可编辑计划的基线,该界面提升了用户感知控制感和透明度。

Hierarchical Topology-Aware Planning and Control of Underwater Vehicle-Manipulator Systems in Confined Environments Figure 1
2026-08-11cs.RO

Hierarchical Topology-Aware Planning and Control of Underwater Vehicle-Manipulator Systems in Confined Environments

Mohamed Abdelwahab, Ruggero Carli, Damiano Varagnolo, Alberto Dalla Libera

2026-08-11规划控制

面向洞穴、管道等受限水下环境中 UVMS 容易因窄通道、臂车耦合和跟踪误差陷入不可恢复状态的问题,论文提出 MANTA:先在降维基座空间做拓扑通道筛选,再联合优化基座与机械臂轨迹,并用 MC-PILCO 学习保持与跟踪控制。实验中 120 组规划查询较全状态采样基线成功率更高、间隙更大、手臂运动更少,跟踪位置和偏航误差也下降。

Preview-Based Relative-Motion Control of an Insertion Tool for Neural-Thread Placement in Pulsating Tissue Figure 1
2026-08-11eess.SY

Preview-Based Relative-Motion Control of an Insertion Tool for Neural-Thread Placement in Pulsating Tissue

Yongyan Cao

2026-08-11规划控制

针对神经柔性电极植入时脑组织随心跳和呼吸脉动导致的相对深度误差与横向剪切风险,论文将任务从实验室坐标跟踪改写为相对运动调节,利用带延迟估计的短时预览和 offset-free MPC 预测组织表面并约束横向速度。MuJoCo 中其 1-DOF 接触 RMS 误差降至 1.9 微米,3-DOF 横向剪切由 1.34 降至 0.50 mm/s;但研究仍限于刚性接触点仿真,力学与生物损伤阈值未验证。

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models Figure 1
2026-08-11cs.RO

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

2026-08-11强化学习

SG-WAM针对现有世界-动作模型主要依赖视觉线索、语言指令与预测视频语义易错位的问题,引入VLM语义规划器,先预测文本落地与空间感知的未来语义,再作为高层指导注入视频与动作生成。实验称其在LIBERO、LIBERO-Plus及真实机器人上达到SOTA或更高鲁棒性,但具体增益中数据与模型规模影响文中未充分说明。

PEEL: Parallel Extraction for Long-Horizon Disassembly Planning via Scale-Invariant Sampling Figure 1
2026-08-11cs.RO

PEEL: Parallel Extraction for Long-Horizon Disassembly Planning via Scale-Invariant Sampling

Servet B. Bayraktar, Andreas Orthey, Zachary Kingston, Marc Toussaint

2026-08-11规划控制

这篇论文面向多零件机器人拆解中顺序搜索指数爆炸、狭窄通道难以规划的问题,提出 PEEL:用并行 MAB-RRT 对候选零件“竞速”规划,让几何可拆性直接决定拆解顺序,并用尺度不变采样提升单件脱出效率。实验中 MAB-RRT 在 76 个单件装配体上达到 100% 成功率,PEEL 在 4 个含 10–17 个零件的装配体上完成规划并由 Fetch 仿真执行。

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies Figure 1
2026-08-11cs.RO

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

Zhongxi Chen, Shenqi Zong

2026-08-11机器人

长时程机器人操作中,预训练 VLA 策略容易忘记已完成子任务或关键接触事件,导致重复动作和阶段判断错误。OnEvoMemory 的核心是用价值信号学习“该记什么”:结合短期缓存、高价值经验库和转折事件库,并用成功/失败在线 rollout 在冻结基座策略下更新记忆写入与读取。实验称其在长时程操作基准上优于基础策略,但具体增益幅度和消融细节在给定文本中未充分说明。

WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models Figure 1
2026-08-11cs.RO

WA-SpecDec: World-Aware Speculative Decoding for Vision-Language-Action Models

Zikang Wen, Yuning Zhang, Dong Yuan

The University of Sydney

2026-08-11视觉语言视觉感知强化学习

论文针对 VLA 自回归动作解码的闭环延迟,以及现有宽松 speculative decoding 忽略场景物理风险的问题,提出在 prefill 阶段注入世界模型导出的空间偏置,让草稿与目标验证共享物理感知状态而不改接受规则。在 LIBERO 等任务上,该方法在更宽松接受下保持更高成功率,匹配成功率时约 1.5 倍加速,并平均降低近接触失败 18.6%。

Anchor-Based AI Approach for Pre-Crash Object Detection Utilizing Micro-Doppler Signatures in Automotive Radar Figure 1
2026-08-11cs.RO

Anchor-Based AI Approach for Pre-Crash Object Detection Utilizing Micro-Doppler Signatures in Automotive Radar

Patrick Zaumseil, Rainer Engert, Dagmar Steinhauser, Jonathan Wache, Soumya Dewangan, Thomas Brandmeier

meier are with the Center of Automotive Research on Integrated Safety, vehicle. Due to this arrangement, the lack of labeled radar frames, limits the availability of µD signatures of rotating vehicle wheels, for labels is limited to single-frame-oriented bounding boxes (OBBs).

2026-08-11视觉感知

面向预碰撞安全系统中近场目标需在单个雷达周期内可靠识别的问题,论文利用车轮等微多普勒特征构建锚框式AI检测模型,并通过雷达图像膨胀增强稀疏点云中的局部模式。作者还采集量产雷达预碰撞数据集,与传统跟踪方法比较,结果显示该模型在动态场景的目标参数估计和漏检控制上更优,但具体增益来源可能受数据集与场景设置影响。

RAG-Based Auto-Configuration for Industrial Fieldbus Devices Figure 1
2026-08-11cs.RO

RAG-Based Auto-Configuration for Industrial Fieldbus Devices

Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi

2026-08-11机器人

面向工业现场总线设备调试中人工查手册、抄参数耗时且易出错的问题,论文提出 CLARITY:用稠密/稀疏混合检索、 ontology 图增强、重排序、低温本地 LLM 生成 JSON-LD,并以拒答门控、SHACL 校验和协议适配器降低错误写入风险。小规模五设备基准上检索 HitRate@10 为 0.96,生成字段级 F1 为 0.87,端到端 2.6–6.6 秒且无不安全写入;UR5e 仿真案例达 F1=1.0,但基准偏小且 OPC-UA 生成仍有系统性失败。

Knowledge-Distilled End-to-End Reinforcement Learning for Smooth 6-DOF Thrust Control and Rapid Adaptation to Ocean Currents in Remotely Operated Vehicles Figure 1
2026-08-11cs.RO

Knowledge-Distilled End-to-End Reinforcement Learning for Smooth 6-DOF Thrust Control and Rapid Adaptation to Ocean Currents in Remotely Operated Vehicles

Tiankuang Wen, Huiping Li, Gang Liu, Yong Jiang

2026-08-11强化学习规划控制

面向ROV在海流扰动下同时控制精度、响应速度、能耗与推力平滑性的难题,论文提出TSRCA-PPO,将端到端6自由度推力控制与两阶段知识蒸馏结合,并通过奖励设计和特权多编码器架构提升快速适应能力。仿真和消融显示其优于级联P-PID,稳态位置误差、姿态误差、调节时间、能耗和平滑性指标分别降至基线的42.7%、76.5%、10.6%、93.5%和15.9%。

Vid2WAM: Distilling Video Diffusion Priors into World Action Models Figure 1
2026-08-11cs.RO

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

2026-08-11视觉感知生成模型强化学习

该文针对 WAM 依赖昂贵目标任务专家轨迹、难以扩展到新任务的问题,提出将视频扩散基础模型离线蒸馏为紧凑世界动作模型:生成未来视频直接监督预测分支,IDM 恢复伪动作监督控制,并用源感知残差适配缓解伪标签噪声。实验称其在仿真和真实机器人中提升少量示范下的数据效率与新任务成功率,同时推理阶段无需视频教师,保持低延迟。

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies Figure 1
2026-08-11cs.RO

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

Prishita Ray

Cornell University, This research was conducted while the author was affiliated with Cornell University.

2026-08-11机器人安全鲁棒

针对机器人导航策略在曲率、障碍、摩擦、坑洞和坡度等连续环境变化下泛化不足的问题,论文提出对结构化环境参数边界进行重参数化的梯度式课程生成,并加入分布偏移正则以改善多模态表征。在改造的 Car Racing 与 Bipedal Walker 上,五个随机种子结果显示其优于随机采样、手工课程、SPRL、ALP-GMM 等基线;但正则项收益具有环境依赖性。

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim Figure 1
2026-08-11cs.RO

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

2026-08-11视觉语言

事件相机在机器人中有低延迟和高动态范围优势,但真实传感器和集成仿真工具不足限制了开发。EsaacSim将可配置事件相机作为 Isaac Sim 插件,支持灰度与 Bayer RGGB 事件、RGB/APS/深度/IMU 同步输出和 ROS 2 接口,并用运动引导帧间合成提高有效时间分辨率。实验显示其在多种场景和五种分辨率下可在线生成 240–960 Hz 事件流,RTX 4060 上单帧间隔处理约 7–29 ms,额外显存低于 400 MB。

Stochastic Physics-Informed Neural Networks on Lie Groups for Learning Underwater Vehicle Dynamics Figure 1
2026-08-11cs.RO

Stochastic Physics-Informed Neural Networks on Lie Groups for Learning Underwater Vehicle Dynamics

Evan F. Palmer, Ross L. Hatton, Geoffrey A. Hollinger

Oregon State University, Corvallis OR 97331, USA

2026-08-11机器人

面向水下机器人在扰动、流体作用和数据稀缺下难以获得可靠动力学模型的问题,论文将随机物理信息神经网络与 Lie 群上的欧拉-庞加莱结构结合,用保持几何约束的随机积分、矩匹配和有限维匹配学习动力学。在仿真和港口绕桩航行实验中,该方法相较基线提升预测稳定性与鲁棒性,并支持带不确定性的模型控制。

MPPI Planning with Gaussian Based Human Cost Function for Social Navigation Figure 1
2026-08-11cs.RO

MPPI Planning with Gaussian Based Human Cost Function for Social Navigation

Chinmay Mundane

2026-08-11机器人规划控制三维

面向拥挤场景中机器人只把行人当作当前位置障碍而低估未来碰撞风险的问题,论文在 MPPI 中引入 PGIF:将行人预测轨迹编码为随速度前向扩展、沿运动方向各向异性的高斯排斥场,使代价更强调进入行人未来路径的轨迹。300 个随机走廊场景中,PGIF-MPPI 在三种密度下均报告 0% 碰撞率,显著优于 vanilla MPPI,但高密度下更保守、到达效率受影响。

Diminishing Returns of Intelligence: The Non-Linear Relationship Between LLM Scale and User Perception in Short-Duration Open-Ended Social Human-Robot Interactions Figure 1
2026-08-11cs.RO

Diminishing Returns of Intelligence: The Non-Linear Relationship Between LLM Scale and User Perception in Short-Duration Open-Ended Social Human-Robot Interactions

Amanda Rasille Røn Volf, Morten Roed Frederiksen

2026-08-11机器人

本文针对社交机器人中“更大 LLM 是否带来更好短时互动体验”的部署问题,比较 Qwen3-VL 4B、8B、30B 驱动的机器人脸在开放式两分钟对话中的用户感知。核心洞察是模型规模与感知智能、自然度和愉悦感并非线性关系;19人被试结果显示30B相对小模型无显著总体优势,4B在感知智能上仍具竞争力,体验差异可能更多受对话流畅性、响应性、幽默和社交行为影响。

Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects Figure 1
2026-08-11cs.LG

Machine-Learning-Based Diagnostic Framework for Passive Ultrasonic Detection of Railway Wheel Defects

Aashish Shaju, Steve Southward, Mehdi Ahmadian

Department of Mechanical Engineering, Virginia Tech, defect label based on the feature value. MI values were standardized using a permutation-derived z-score (z-MI) to allow fair

2026-08-11视觉感知

针对传统轮轨检测难以非接触、高通量区分多类车轮缺陷的问题,论文用被动空气耦合超声声发射信号构建诊断流程,将Kruskal-Wallis/Dunn-Sidak统计检验、互信息特征排序与随机森林分类结合,发现衰减率、RMS能量、峭度等少量可解释特征最有判别力;在11个轮对、9类健康状态上,模型平衡准确率约0.66、Macro-F1约0.65,3到4个特征即可保持全模型98%以上性能。

Scalable High-Speed Lateral Control for Single-Body and Articulated Autonomous Vehicles Figure 1
2026-08-11cs.RO

Scalable High-Speed Lateral Control for Single-Body and Articulated Autonomous Vehicles

Aashish Shaju, Steve Southward, Mehdi Ahmadian

Scalable High-Speed Lateral Control for Single-Body and, Center for Vehicle Systems and Safety (CVeSS), Virginia Tech, Blacksburg, VA 24060, USA, tracking, Scalable control framework., This paper presents a scalable lateral control framework designed to enable robust path tracking for both single-, configurations while maintaining stability at high speeds. This paper addresses this need by presenting a scalable, scalable lateral control frameworks for diverse configurations at high speeds. This paper presents such a framework, scalability., . Scalable High-Speed Lateral Control Framework

2026-08-11规划控制

面向高速自动驾驶尤其是牵引车-挂车等铰接车辆,论文针对传统横向控制在曲直过渡和高速度下易振荡、固定预瞄不适配的问题,扩展 clothoid 路径跟踪:引入切向一致性检查、轨迹段分类和双自适应预瞄调节,并用跟踪点选择与曲率-转角 LUT 支持不同车型。TruckSim 仿真显示其在双移线和弯道场景中降低振荡、提升跟踪精度,并将横向加速度保持在安全范围内。

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System Figure 1
2026-08-11cs.CV

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand

FPV Labs

2026-08-11机器人

面向VLA/机器人学习中真实交互数据难以低成本规模化采集的问题,Ego-OSCAR把硬件同步全局快门RGB双目、120Hz IMU、板端录制与看门狗做成约200美元的开源头戴系统,并配套校准、同步与标注流程。论文用550小时/相机、1462段会话验证部署可行性,报告96%可用会话率、0.4px极线误差、约700微秒视觉-惯性残差,但尚未证明这些数据能带来端到端策略增益。

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios Figure 1
2026-08-11cs.AI

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen, Roberto Galeazzi

2026-08-11机器人强化学习

这篇论文关注海事自主航行中如何把LLM用于COLREG规则与“良好船艺”约束下的态势理解和决策解释。作者基于丹麦海域AIS数据构建50个真实多船会遇场景,标注规则、责任与推荐动作,用于评估在线和离线模型的分类、责任判断和机动建议。结果显示,未经微调的通用LLM仍难可靠处理真实航行场景,小模型常依赖僵化模式,大模型虽推理更细但存在保守或偏置倾向。

Action- and Language-Conditioned Video Assessment for Embodied Control Figure 1
2026-08-11cs.RO

Action- and Language-Conditioned Video Assessment for Embodied Control

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

Robotics Program, Korea Advanced Institute of Science and Technology (KAIST), Daejeon 34141, School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)

2026-08-11视觉感知规划控制

这篇论文针对语言指令下具身控制难以仅凭最终画面判断任务进展的问题,提出 ALVA:先用视觉语言模型结合动作序列概括帧间状态变化,再依据指令给出离散轨迹进度评分。实验在 ALFRED/AI2-THOR 模拟家居任务中显示,其误报率接近零,作为闭环策略优化的终端反馈优于静态图文匹配和嵌入相似度基线,但结论主要限于所测环境与 VLM 骨干。

Spatiotemporal Context-dependent Personalized Movement Compensation in Delayed Telemanipulation Figure 1
2026-08-11cs.RO

Spatiotemporal Context-dependent Personalized Movement Compensation in Delayed Telemanipulation

Sai Jiang, Zonghe Chua

2026-08-11机器人

针对遥操作/手术机器人中通信延迟导致的过冲和精度下降,本文不再使用统一运动缩放增益,而是按操作者、延迟、运动方向和距离拟合个性化补偿参数。20名受试者的仿真到dVRK实机评估显示,缩放补偿在长延迟下最明显,可带来关键指标约20–25%提升;个性化在部分短距离内向运动条件下进一步改善精度,但从仿真迁移到真实任务时效果减弱。

Multi-modal Interactive Control of Robotic Arm based on Offline Large Language Models Figure 1
2026-08-11cs.RO

Multi-modal Interactive Control of Robotic Arm based on Offline Large Language Models

Hanxiao Chen

University of Tokyo, Tokyo, Japan.

2026-08-11机器人规划控制

论文针对在线闭源LLM在机器人交互中依赖网络、成本高的问题,提出将本地部署的ChatGLM2-6B接入OpenAI式API,并与ViLD视觉检测、CLIPort执行器串联,在PyBullet中为UR5生成语言条件代码策略。实验称在堆叠、角落放置、颜色匹配等任务上达到80%-90%评分和接近100%完成率,但基线设置与增益来源文中未充分说明。

Event-Time Hybrid Optimal Control for Robotic Table Tennis Serves Figure 1
2026-08-11cs.RO

Event-Time Hybrid Optimal Control for Robotic Table Tennis Serves

Thomas Gossard, Till Köpff, Andreas Ziegler

2026-08-11机器人规划控制

这篇论文针对机器人乒乓发球中高速、旋转、先己方落台再过网以及机械臂力矩约束耦合带来的规划难题,提出按弹跳、过网、落点事件时间直接优化的混合最优控制,并串接硬约束动力学轨迹规划。相比固定步长加根定位基线,中位求解时间提升4.1倍;KUKA实机实现落点控制和多种旋转,平均落点误差13.1±7.3厘米,最高约30 rps。

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios? Figure 1
2026-08-11cs.AI

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

2026-08-11视觉语言安全鲁棒

这篇论文关注具身视觉语言模型能否用于应急疏散等安全关键场景,动机在于现有模型的空间记忆与决策可靠性仍缺少系统检验。作者将 Theory of Space 扩展为 EMRD 流程,从探索、建图、记忆到决策评估七个模型。结果显示,模型常按文本先验选择集合点而非依据实际探索,低光显著削弱空间推理,且记忆模式与人类认知规律不一致。

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning Figure 1
2026-08-11cs.RO

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

University of Macau, National University of Singapore, Xiamen University

2026-08-11视觉感知强化学习规划控制数据集/基准

现有手术视频理解偏重阶段识别或视频生成质量,难以判断世界模型是否真的支持器械运动规划。SurgWMBench以真实机器人辅助手术视频和2D器械轨迹构建短视野视觉-运动基准,并用局部转移、闭环滚动和扰动恢复评估动态一致性。结果表明,较好的视觉生成质量不必然带来准确、稳定的运动预测。

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets Figure 1
2026-08-11cs.RO

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

the Key Laboratory of Target, Aerospace Information Research Institute, Chinese Academy of Sciences, School of Artificial Intelligence, Shanghai Jiaotong University, Space Engineering University

2026-08-11视觉感知三维

这篇论文针对单图生成可仿真的 3D 资产时“看起来像”但缺少尺度、部件关系、材料和关节等物理可执行信息的问题,提出 PhysX-CoT:把 VLM 输出改为可解析、可监督的部件级物理推理链,并用 3D 框表示位置、局部代码表示形状以解耦放置与几何。实验在统一骨干、数据和冻结解码器下优于最接近基线,消融和 UE5 测试显示中间状态确实被使用而非装饰。

Parameter-Dependent LMI Synthesis for Semi-Global Differential ISS Trajectory Tracking of Nonholonomic Mobile Robots Under Multiplicative Wheel Slip Figure 1
2026-08-11eess.SY

Parameter-Dependent LMI Synthesis for Semi-Global Differential ISS Trajectory Tracking of Nonholonomic Mobile Robots Under Multiplicative Wheel Slip

Mohammad Sabouri

2026-08-11机器人视觉感知规划控制

面向移动机器人在湿滑、变地形等场景下的轨迹跟踪失稳问题,论文将乘性轮滑显式转化为 Kanayama 误差坐标中的有界加性扰动,并用依赖参考速度的 LMI/LPV 增益调度统一处理收敛率、极点区域和输入增益约束。仿真显示在严重滑移下轨迹保持率更稳,变地形测试峰值误差较固定增益 LMI 降低 12%、较手调基线降低 49%,但主要验证仍是数值实验。

Compiling and Benchmarking Task-State Horizons for Embodied Agents Figure 1
2026-08-11cs.RO

Compiling and Benchmarking Task-State Horizons for Embodied Agents

Meiqi Wang, Shichao Li

2026-08-11数据集/基准

这篇论文指出,现有具身机器人长程基准多用动作长度或子任务数量衡量难度,却忽略智能体需要持续维护、探索和更新任务相关世界状态。作者提出任务状态视野 TSH,并用 RoboGraph 将空间、时间和动态干预依赖编译为可执行任务图,构建 84 个场景、588 个 episode 的 RoboGraphBench。对 15 个模型的闭环评测显示,高 TSH 下普遍出现记忆冗余、探索不足和状态更新迟滞,说明长程具身规划的瓶颈不只是行动序列,而是动态状态管理。

DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea Figure 1
2026-08-11cs.RO

DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea

Jiaming Chen, Juntao Yang, Zhentao Zou, Qi Ming, Yi Yu, Zhihang Zhong, Xue Yang, Xue Jiang, Yue Zhou

2026-08-11三维

面向海上船舶三维重建,论文指出传统 NBV 只记录体素是否被看见,忽略从哪些方向观察,容易在船体遮挡和海浪姿态变化下留下盲区。DA-NBV 将方向观测统计、可学习 PAF、局部动作空间和覆盖奖励结合,引导无人机补充缺失视角;在 SeaShip-3D 与海况仿真中,完整度约提升 3 个百分点,Chamfer 距离降低 43%,路径效率也更高。

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields Figure 1
2026-08-11cs.RO

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

2026-08-11强化学习规划控制

这篇论文针对现有 World Action Models 主要在 2D 像素空间建模、难以对应机器人执行所需 3D 动态的问题,提出 4D-WAM:用 3D 轨迹场提供时空监督,并通过运动对齐与目标对齐把局部运动和长程目标信息注入中间表征。实验在 LIBERO、RoboTwin 及 OOD 设置中显示,其可提升空间理解、执行精度、鲁棒性和泛化,并能适配不同 WAM 骨干。

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning Figure 1
2026-08-11cs.AI

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

Beijing Academy of Artificial Intelligence, Beijing, China., Beijing Key Laboratory of Research on Large Models and Intelligent Governance, Beijing, China., Department of Computer Science and Technology, Tsinghua University, Beijing 100084, China., Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China.

2026-08-11规划控制

GraphThink针对具身长程任务中LLM规划易产生物理幻觉、泛化弱且重规划缺少环境记忆的问题,引入任务图约束初始规划、迭代校验和GRPO奖励设计,并用场景图维护任务相关记忆以触发闭环重规划。论文称其在ALFRED排行榜达到最优,高层规划器在验证集、长程保留任务及跨环境设置中超过多种API式LLM。

Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations Figure 1
2026-08-11cs.RO

Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations

Simon Holk, Ryosuke Takanami, Tatsuya Matsushima, Yusuke Iwasawa, Yutaka Matsuo, Yueh-Hua Wu, Kei Ota

Laboratory, Graduate School of Engineering, The University of Tokyo

2026-08-11机器人视觉语言模仿学习规划控制

这篇论文关注机器人示范数据中“轨迹正确但语言指令错误”的隐蔽噪声,指出它会破坏 VLA 策略的语言到行为映射。作者提出无需训练的 MMPF,将多视角视觉、状态等模态视为专家,用邻域一致性、原型相似度和熵加权融合来检测并校正任务标签。在 LIBERO 注入错标和真实机器人数据上,方法取得更好的 ITM 检测与标签修正效果,并在依赖语言消歧的任务中提升下游策略表现。

A Mixed-Stiffness Anthropomimetic Fingertip Broadens the Operating Range for Coin Grasping Figure 1
2026-08-11cs.RO

A Mixed-Stiffness Anthropomimetic Fingertip Broadens the Operating Range for Coin Grasping

Kaigen Go, Yinlai Jiang, Hiroshi Yokoi, Shunta Togo

Graduate School of Informatics and Engineering, The University of Electro-Communications, Tokyo, Japan, Center for Neuroscience and Biomedical Engineering, The University of Electro-Communications, Tokyo, Japan

2026-08-11机器人

论文针对硬表面上硬币等薄片物体难以无需插入底部完成抓取的问题,提出在仿生指尖软垫中引入“软中心、硬两侧”的混合刚度分布,把材料边界作为额外几何约束。实验显示,该设计在接近距离、下压量和旋转角变化下比均匀软指尖有更宽成功范围,但在硬币沿指轴位置变化时反而较弱;调参后两类指尖均能抓取六种日元硬币,说明收益主要来自容差扩展而非峰值性能提升。

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control Figure 1
2026-08-11cs.LG

V-Simba: Unleashing the Architectural Potential of RL in Visual Continuous Control

Donghu Kim, Youngdo Lee, Hojoon Lee, Johan Obando-Ceron, Byungkun Lee, Aaron Courville, Pablo Samuel Castro, Jaegul Choo, Clare Lyle

2026-08-11强化学习规划控制

视觉强化学习在机器人等连续控制场景中样本采集昂贵,而常用 DrQ-v2 式浅层卷积架构存在尖锐损失、休眠单元和特征塌缩等训练不稳定。V-Simba 的核心洞察是把状态式 Simba 的归一化、权重约束和分布式 critic 迁移到视觉输入,并用早期降采样、点卷积降低开销。实验显示其在 DMC、Adroit、Meta-World 共 29 个任务上匹配或超过多种强基线,同时模型更小、训练更快。

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain Figure 1
2026-08-11cs.RO

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain

Shreyam Gupta (1), P. Agrawal (2), Priyam Gupta (3), R. Gautam (1) ((1) Robotics Research Group, Indian Institute of Technology (BHU), Varanasi, India, (2) University of Colorado, Boulder, USA, (3) Intelligent Field Robotic Systems (IFRoS), University of Girona, Spain)

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in, Robotics Research Group, Indian Institute of Technology (BHU), Varanasi, India, University of Colorado, Boulder, USA, Erasmus Mundus — Intelligent Field Robotic Systems (IFRoS), University of Girona, Spain, This paper presents a collaborative UAV-UGV nav-, Collaboration, ception to a collaborative, mixed air-ground approach. By, map. [Northern Robotics Laboratory, 2020] Thermal imag-, The field of UAV-UGV collaboration has matured signif-, retical principles of heterogeneous collaboration, engineered, Node, and the Collaborative Communication Bridge.

2026-08-11机器人

雪地高海拔环境会抹除道路纹理并导致UGV打滑,使地面感知和里程计不可靠。论文的核心思路是让UAV承担俯视语义建图与UGV视觉跟踪,结合轻量U-Net、合成雪增强、GPS/IMU EKF和动态代价地图规划。仿真中道路分割达96.5%,UAV定位最大误差约±0.5米,UGV可在被雪遮挡场景中低偏差导航,但实车验证与极端白化条件下鲁棒性文中未充分说明。

CoCoNav: Conformal Control for Safe Robot Navigation in Crowds Figure 1
2026-08-11cs.RO

CoCoNav: Conformal Control for Safe Robot Navigation in Crowds

Cheng Guo, Mingzhe Ni, Zheng Liang, Yihu Ling, Yuan Hu, Michele Caprio, Daniele Pucci, Wei Pan

2026-08-11机器人规划控制安全鲁棒

针对人群导航中行人预测误差会随场景漂移、而保守不确定性硬约束易使 MPC 不可行的问题,CoCoNav 将在线保形校准与运行时验证解耦:分时域 PI 校准误差界,软约束 MPC 先生成候选轨迹,再验证名义轨迹和应急动作。仿真与四足机器人实验显示,其在碰撞规避、任务成功率和效率之间优于所评基线。

LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation Figure 1
2026-08-11cs.LG

LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation

Cheng Guo, Mingzhe Ni, Angelo Cangelosi, Arash Ajoudani

2026-08-11机器人规划控制

面向人形机器人长时程移动操作中脚本切换难以处理多物体连续任务的问题,LUCID将低层潜技能控制器冻结,并在宏观技能层学习世界模型,用想象 rollout 训练高层策略以预测技能选择对后续子任务的影响。仿真多物体重排实验显示,其完整成功率和部分完成率优于基线;但仍依赖特权状态,真实迁移与更广任务泛化文中未充分说明。

Enhancing Autonomous Vehicle Navigation with a Clothoid-Based Lateral Controller Figure 1
2026-08-11cs.RO

Enhancing Autonomous Vehicle Navigation with a Clothoid-Based Lateral Controller

Aashish Shaju, Steve Southward, Mehdi Ahmadian

Department of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061, USA, referred to as the lookahead distance. Carnegie Mellon University pioneered the

2026-08-11机器人规划控制

面向自动车在弯道、变道和车队场景中横向跟踪误差、转向突变与稳定性风险并存的问题,论文将回旋线用于局部路径生成与横向控制,并按车辆动态和道路几何自适应调整前视距离,同时用超前滤波补偿横向动态滞后。TruckSim/Simulink 联合仿真显示其在多种工况下降低跟踪误差、改善转向平顺性和稳定性,但高速扩展及铰接车辆离轨误差仍需进一步优化。

Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity Figure 1
2026-08-11cs.RO

Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity

William Zhang, Tzvika Geft, Jingjin Yu, Kostas Bekris

2026-08-11机器人规划控制安全鲁棒

这篇论文面向无巷道、高密度仓储中“满容量存储后按序取回”的多机器人调度难题,动机是在不牺牲存储密度的情况下提升取回吞吐。核心做法是利用 StoRMR/R-StoRMR 零搬移布局的不变量,设计在线优先级 MAPF,使解耦规划仍能保证完备并避免死锁。实验在最高 30×30 网格、30 台机器人上显示,makespan 随机器人数量近线性下降至 m=C,且鲁棒布局处理出库顺序扰动几乎不带来执行速度损失。

Hölder Signed Distance: A Differentiable, Signed, Parallelizable Metric for Robotics Figure 1
2026-08-11cs.RO

Hölder Signed Distance: A Differentiable, Signed, Parallelizable Metric for Robotics

Felipe Bartelt, Ali Umut Kaypak, Anthony Tzes, Farshad Khorrami, Luciano C. A. Pimenta, Vinicius M. Gonçalves

2026-08-11机器人

机器人规划与安全控制需要带梯度的有符号距离,但欧氏 SDF 在多重最近点等情形不可微,已有光滑距离又常缺少符号或依赖迭代。本文用 Hölder min/max 替换经典 SDF 的硬 min-max,并通过整形函数消除零水平集处不可微,得到凸多面体间闭式、可并行的 HD-SDF。实验比较显示其运行效率和梯度平滑性优于若干基线,并在机械臂控制中展示了可用性;但该度量偏保守,近接触时可能给出假阳性。

A Reconfigurable Tracked Robot for Enhanced Obstacle Traversal Through Movable Articulation Point and Internal Mass Relocation Figure 1
2026-08-11cs.RO

A Reconfigurable Tracked Robot for Enhanced Obstacle Traversal Through Movable Articulation Point and Internal Mass Relocation

Yuki Uda, Yasutaka Nakashima, Motoji Yamamoto, Ayato Kanada

Y. Uda, Y. Nakashima, and M. Yamamoto are with the Department, of Mechanical Engineering, Kyushu University, 744 Motooka, Nishi-ku, Fukuoka 819-0395, Japan., A. Kanada is with the Graduate School of Informatics and Engineering, The University of Electro-Communications, 1-5-1 Chofugaoka, Chofu-shi, Tokyo, 182-8585, Japan.

2026-08-11机器人

针对履带机器人越障中前端够高与重心稳定相互牵制的问题,论文提出 TRASER:用可沿机身移动的弯折单元同时改变铰接点和内部质量位置,并以成对 tape spring 抑制大弯曲时的机身下垂。模型分析了铰接点、重心对台阶和沟槽通过性的影响;实验中其可跨越相当于机身长度 74% 的台阶、66% 的悬空平台和 59% 的沟槽。

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models Figure 1
2026-08-11cs.AI

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

Hsu-kuang Chiu, Stephen F. Smith

2026-08-11视觉语言视觉感知数据集/基准

针对现有 VLA 自动驾驶多聚焦单车、缺少协同感知与闭环多车评测的问题,论文提出 CMU-Drive 基准,将 Bench2Drive 扩展到含背景交通与弱势道路参与者的 2–16 辆 CAV 场景,并提出 V2V-VLA,在一次前向中联合生成控制、轨迹、语言推理和通信策略。实验给出首个协同 VLA 闭环基线,报告其相较基线有更高驾驶分数和成功率。

GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning Figure 1
2026-08-11cs.RO

GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning

Yanping Zhao, Hang Yu, Yiwei Wang, Chen Ye, Siyu Tian, Di Zhang, Qingjun Wang, Qian Chen, Junqiao Zhao, Guang Chen

2026-08-11视觉语言视觉感知强化学习

这篇论文针对 VLA 机器人策略在视角、光照、背景和物体布局变化下易退化的问题,提出用 VGGT-Ω 聚合多视角几何状态,并在潜空间预测目标视角下一步 patch token,同时让潜在动作同时服务世界模型和流匹配动作头。实验显示其在 LIBERO 达到 97.1% 成功率,在 LIBERO-Plus 鲁棒性基准达 76.9%,较机器人数据版 VLA-JEPA 高 14.0 个百分点,真实 SO-101 也有优势。

Enhanced Real-Time 6-DOF Extended Reality Catheter Tracking for Evaluating Potential Improvement in Efficiency, Precision, and Depth Perception for Cardiac Interventions Figure 1
2026-08-11cs.RO

Enhanced Real-Time 6-DOF Extended Reality Catheter Tracking for Evaluating Potential Improvement in Efficiency, Precision, and Depth Perception for Cardiac Interventions

Mohsen Annabestani, Sandhya Sriram, Andrew Kuzemczak, S. Chiu Wong, Alexandros Sigaras, Bobak Mosadegh

. Dalio Institute of Cardiovascular Imaging, Department of Radiology, Weill Cornell Medicine, NY, USA, . Englander Institute for Precision Medicine, Department of Systems and Computational Biomedicine, Weill Cornell Medicine, . AI-XR Lab, Department of Systems and Computational Biomedicine, Weill Cornell Medicine, NY, USA, . Division of Cardiology, Department of Medicine, Weill Cornell Medicine, NY, USA, visualization or a conventional 2D cathlab-style view. Participants in the 3D condition completed, advantages such as scalability, lower costs, realistic simulation capabilities, and the ability to

2026-08-11视觉感知

针对心脏介入中二维影像导致深度感知弱、导管姿态难以实时理解的问题,本文构建了兼容 Meta Quest 3 的 XR 导管导航平台:双目视觉重建 5-DOF 形状,并用 3D 打印机电编码器补足滚转角,实现 6-DOF 可视化。20 名新手实验中,3D 模式较 2D 显著缩短完成时间和导管行程,并提升精度与操作稳定性,但结论仍主要限于训练场景和小样本概念验证。

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion Figure 1
2026-08-11cs.RO

AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion

Xirui Liang, Jiaqi Liang, Jingkai Xu, Yuran Wang, Ruochong Li, Yuanpei Chen, Masayoshi Tomizuka, Wei Zhan, Ruihai Wu

2026-08-11三维

面向仅依赖视觉规划的灵巧抓取在接触后难以纠偏、对复杂或未见物体鲁棒性不足的问题,AdaDexGrasp将物体三维几何与带手指/掌部身份的触觉接触信号对齐融合,用于初始抓取生成、可行性判断和触觉引导的姿态自适应修正。论文在IsaacGym触觉仿真环境和真实机器人上验证,报告了更高抓取成功率与跨物体泛化能力。

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding Figure 1
2026-08-11cs.RO

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

2026-08-11视觉语言视觉感知

这篇论文关注 VLA 模型中 VLM 中间层特征如何进入动作解码器的问题,指出只用末层或一一对齐层会限制跨深度证据利用。LIRA 的核心是让每个并行融合块在保持深度对齐的同时,聚合相邻 VLM 层的 Query 特征,形成局部跨层路由,且不改变骨干、解码器和训练流程。实验在 LIBERO、LIBERO-Plus、CALVIN 和真实机器人上优于 VLA-Adapter,其中 LIBERO-Plus 零样本成功率从 59.1% 提升到 78.0%。

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects Figure 1
2026-08-11cs.CV

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects

Felix Schaller

2026-08-11强化学习安全鲁棒

面向自动驾驶中闭集检测器会把未见道路物体误判或漏检的安全问题,论文将层级分类抽象机制接到类别无关区域提议上,并用 CLIP 叶节点质量聚合、分支安全下限和未知障碍标记来避免过度具体化。留出 7 个 COCO 类的真实框评测显示,平坦分类头 100% 自信误标,而该层级方法自信错误为 0%,安全处理 94%,但代价是 69% 保守拒识,说明收益主要在降低危险误判而非提升细粒度识别。

Reconfigurable Structural Robotic Assembly: Interlocking 3D Aggregations with Self-Aligning Compound Nested Lattice Modules Figure 1
2026-08-11cs.RO

Reconfigurable Structural Robotic Assembly: Interlocking 3D Aggregations with Self-Aligning Compound Nested Lattice Modules

Alexander Htet Kyaw, Miana Smith, Paul Richard, Neil Gershenfeld

2026-08-11机器人强化学习三维

这项工作针对机器人建造中材料系统与机器人控制分离的问题,提出把抓取、对准、连接和三维聚合逻辑编码进可重构晶格模块。其核心是由立方八面体—八面体单元组成的自对准复合嵌套模块,带可螺钉释放的卡扣连接,可沿 x/y/z 方向互锁扩展。实验展示了机械臂和移动机器人装配座椅、长凳、桌面与门框;单模块压缩刚度为 4,556 N/mm、最大载荷 3,445 N,组件可拆解并重组。

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion Figure 1
2026-08-11cs.CV

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

2026-08-11视觉语言

针对皮肤镜图像中类别不均衡、病灶相似和少数类易误判的问题,论文将 Swin Transformer 图像特征与年龄、性别、部位等临床元数据融合,并加入温度缩放校准、不确定性估计和可解释性分析。在 HAM10000 上报告 92.55% 准确率、91.33% macro F1,少数类表现较强,但外部验证和相对单模态增益来源仍未充分说明。

Projection-Retraction MPPI: Exact Constraint-Manifold Control for Manipulators Figure 1
2026-08-11cs.RO

Projection-Retraction MPPI: Exact Constraint-Manifold Control for Manipulators

Seulchan Lee, Leesai Park, Minhyeong Kang, Sanghyun Kim

2026-08-11规划控制优化算法

这篇论文针对传统 MPPI 只能用软惩罚近似处理闭链、关节限位和避障等硬约束的问题,提出 PR-MPPI:在每步采样动力学中把速度嵌套投影到等式约束切空间和不等式半空间,并对最终命令做回缩以消除有限步长漂移。实验在 14 自由度双臂仿真和 Unitree H1-2 实机上显示,闭链等式可达数值容差,同时保持关节限位与避障裕度。

The Field Knows: Cross-Dimensional Geometry from Navigation to Black Holes Figure 1
2026-08-11cs.AI

The Field Knows: Cross-Dimensional Geometry from Navigation to Black Holes

Chenghao Xu

2026-08-11机器人

论文动机是将机器人运动规划中的几何表示从离散障碍生成器推进到处处定义的连续度量场。核心做法是用场景编码器生成对称矩阵基系数,经李代数装配和指数映射得到黎曼或洛伦兹度量,并用同一个因果对比损失训练。结果显示,该场在2D导航和6-DOF机械臂中具备零样本泛化,并在3D/4D时空实验中形成类黑洞视界,但机器人任务的实际增益来源仍需更充分消融说明。

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning Figure 1
2026-08-11cs.RO

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang

2026-08-11机器人

这篇综述针对接触敏感操作中仅靠视觉和语言难以处理遮挡、变形与力控的问题,提出 TF-ART 分类框架,把力觉/触觉机器人学习统一映射到多模态观测、表征融合、动作生成、动作修正和底层控制流程。主要结果是梳理了相关方法在感知接入位置、策略分阶段设计、合规控制接口及任务/硬件需求上的差异,指出该领域的关键挑战不只是使用触觉或力觉,而是如何让接触反馈进入实时可控的学习管线。

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization Figure 1
2026-08-11cs.RO

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

Peng Xu, Chengcheng Wang, Shaohua Wan

2026-08-11机器人优化算法

面向无人机视觉语言导航的边缘部署瓶颈,AeroDPO指出高保真视觉感知比扩大语言模型更关键:2B模型配合高分辨率输入即可接近7B基线,但行为克隆在OOD场景易碰撞。方法用仿真状态回滚定位致因错误,结合特权干预自动生成DPO偏好对并过滤歧义;在TravelUAV未建图场景成功率提升至49.16%,同时显著降低碰撞率。

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement Figure 1
2026-08-11cs.RO

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement

Hang Yu

2026-08-11机器人强化学习

本文针对机器人策略改进外循环仍依赖人工选实验、盯训练和判定噪声结果的问题,提出 AgenticRobotics:由 LLM 控制器调度一次性 worker,将策略、训练、评测等都封装为可记录、可失效的工具,并用提交键事务和证据门控保证可恢复与可审计。实验显示其主要价值是降低误提升、支持中断恢复和防篡改验证;但在已测谱系中并未选出优于最终 checkpoint 的策略。

Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models Figure 1
2026-08-11cs.CV

Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models

Eduardo de los Santos, Andre S. Kelbouscas, Ricardo B. Grando, Bruna V. Guterres

2026-08-11视觉感知数据集/基准

面向机载边缘设备上的无人机山火早期检测,论文不再强调新检测器,而是用紧凑 YOLO 作为统一验证器,比较真实、增强、真实+AI合成及其增强四类训练集。核心洞察是数据规模扩张不必然提升部署效果;实验中真实未增强数据在召回率和 mAP 间取得最佳权衡,合成混合与常规增强均未成为更优选择,说明域一致性比单纯扩充样本更关键。

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation Figure 1
2026-08-11cs.RO

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation

Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

2026-08-11机器人模仿学习

这篇论文针对机器人操作中人工示教、标注和相机外参标定成本高的问题,提出让机械臂围绕目标位姿自动采集腕部 RGB 图像与相对位姿标签,并用粗到细控制学习三维接近和二维精修。仿真中平面离散度由 9.69 mm 降至 5.38 mm,真实 UR5e 抓取在两类物体无旋转时达 66.6% 和 63.6%,但对深度、物体形状与旋转仍敏感。

Exact Contraction Rates via the Berkson--Porta Representation: A Sharp Threshold and Its Herglotz-Kernel Obstruction Figure 1
2026-08-11math.CV

Exact Contraction Rates via the Berkson--Porta Representation: A Sharp Threshold and Its Herglotz-Kernel Obstruction

Soumic Sarkar

2026-08-11机器人

本文关注全纯自映射半群在单位圆 Kobayashi 度量下何时达到由固定点线性化给出的精确收缩率,动机是避免辅助度量带来的保守稳定性估计。核心做法是用 Berkson–Porta 表示把问题化为表示函数的点态不等式,并借 Herglotz 表示解释失效机制。主要结果包括一类非线性函数的尖锐阈值、显式反例及其由测度集中导致的结构性障碍;与机器人操作的直接关系文中未充分说明。

Contraction Analysis of Holomorphic Dynamical Systems via the Intrinsic Kobayashi Metric Figure 1
2026-08-11math.DS

Contraction Analysis of Holomorphic Dynamical Systems via the Intrinsic Kobayashi Metric

Soumic Sarkar

2026-08-11机器人

本文针对复杂解析状态空间中传统收缩分析依赖外加坐标度量的问题,改用内禀 Kobayashi 度量刻画全纯动力系统的增量稳定性。核心贡献是把 Dini 导数收缩条件与可检验的 Hermitian 矩阵不等式连接起来,并用于 Laplacian 耦合全纯网络的前向不变性、反馈控制和轨道收敛分析;振子网络实验验证了保守保证,但实际同步速率更快,其网络增益机制文中未完全解决。

SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments Figure 1
2026-08-11cs.RO

SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments

Xuan Yao, Yuze Zhu, Junyu Gao, Zongmeng Wang, Changsheng Xu

2026-08-11机器人视觉感知强化学习

这篇论文针对 VLN-CE 中开放环推理易累积状态漂移的问题,提出用世界模型的前瞻预测构造内部反馈,在执行前修正潜在状态,并在反馈显示模型不足时进行测试时世界模型自适应。实验称其在标准 VLN-CE 基准和真实部署中提升了导航鲁棒性与泛化,但具体增益来源仍需结合消融细节判断。

Generalizing deep reinforcement learning across cable-driven parallel robot configurations with actuator-level policies Figure 1
2026-08-11cs.RO

Generalizing deep reinforcement learning across cable-driven parallel robot configurations with actuator-level policies

Abir Bouaouda, Mohamed Boutayeb (CRAN, UIR), François Charpillet (LARSEN), Dominique Martinez (LORIA, ISM), Rémi Pannequin (CRAN)

cInternational University of Rabat, Rabat, 11103, Morocco, the end-effector position—which is often unavailable without

2026-08-11机器人强化学习

这篇论文针对缆索并联机器人中深度强化学习策略难以跨构型、跨执行器数量复用的问题,提出把控制对象从整机末端位置下放到单个执行器:共享的 actuator-level policy 只跟踪目标缆长,并借助逆运动学协调各电机。实验显示,该策略在仿真中较传统整机 RL 更稳健、更精确,并能从二维四电机训练迁移到真实八电机三维机器人,但算法间比较受手工调参影响,增益来源仍不完全清晰。

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop Figure 1
2026-08-11cs.AI

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu

2026-08-11机器人

这篇论文针对LLM驱动的自动研究循环容易追逐指标、偏离原始假设的问题,在四足机器人导航仿真中引入不可变实验卡、受限分工子代理和记录研究偏好的kkanbu oracle。结果显示,结构化记录本身已能避免漂移,两组都否定约四分之三假设;oracle不提升训练分数,但改变探索方向,提出测试时碰撞锥速度过滤器,使冻结策略得分从87.54升至92.43。

Emotion in an active inference model of human driving Figure 1
2026-08-11cs.AI

Emotion in an active inference model of human driving

Julian F. Schumann, Johan Engström, Ran Wei, Jens Kober, Martijn Wisse, Arkady Zgonnikov

2026-08-11机器人

这篇论文针对现有主动推理驾驶模型忽略驾驶员情绪的问题,将效价和唤醒从离散玩具任务推广到连续状态、多步规划的驾驶模型,并把未来预测结果纳入情绪估计。作者在横向侵入和路口优先权违规两类交互场景中仿真,结果显示生成的情绪信号与既有驾驶情绪模式相符。

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation Figure 1
2026-08-11cs.CV

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation

Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao

2026-08-11三维安全鲁棒

面向自动驾驶和移动机器人在复杂环境中的稳健定位,DAP-Pose针对多传感器深度融合常受浅层拼接、时序不同步和物理约束缺失影响的问题,提出端到端融合相机、IMU与GNSS的框架,通过潜空间时序对齐、双层跨模态融合和SO(3)/尺度约束建模运动一致性。在KITTI上报告平均平移误差1.31%、旋转误差0.46°,并在人工时延扰动下保持较强鲁棒性。

2026-08-10

40 篇
Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model Figure 1
2026-08-10cs.RO

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

2026-08-10视觉语言视觉感知规划控制

这篇论文针对驾驶VLA中大语言模型解码器带来的控制延迟,分析单个planning token在32层中的信息形成过程。核心洞察是:导航语义第1层后已可线性读出,但与冻结轨迹规划器兼容的表示需随深度逐步成形。实验在ORION和Bench2Drive上显示,最终层Avg-L2最低为2.11米;按planning token角度变化剪去8/32层,可在约5%开环误差增幅内获得1.33倍解码器加速,但结论不证明闭环安全且限于该检查点。

Learning Fault-Tolerant Locomotion with Adaptive Gait Timing Figure 1
2026-08-10cs.RO

Learning Fault-Tolerant Locomotion with Adaptive Gait Timing

Giovanbattista Gravina, Luca Rossini, Carlo Rizzardo, Arturo Laurenzi, Nikos Tsagarakis

2026-08-10机器人

面向野外部署中四足机器人关节失效或执行器掉电后仍需保持移动的问题,论文用非对称 actor-critic 训练控制器,让部署端仅凭本体感觉历史重建含故障状态的潜变量,并把步态频率作为可学习动作以自适应调整落脚节奏。仿真在不平地形、实机在 68 kg Kyon 平地实验中验证了潜变量对齐、观测历史和步频调节对容错行走的作用。

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models Figure 1
2026-08-10cs.RO

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

Ziheng Liu, Quantao Yang

School of Computer Science and Technology, Zhejiang Gongshang University, Hangzhou

2026-08-10视觉语言视觉感知强化学习

TEMPO针对VLA模型在下游操作中仅靠SFT易受分布偏移影响、而现有RL后训练又把语义与动作模块统一更新的问题,提出冻结视觉语言骨干、分别用TD3优化语义投影层和低层动作专家的两时间尺度策略:前者低频更新以减少潜在动作漂移,后者高频更新以吸收在线控制反馈。实验显示其在CALVIN和两项真实操作任务上优于预训练VLA及RL后训练基线,并能维持更高奖励。

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN Figure 1
2026-08-10cs.AI

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

Institute of Artificial Intelligence, China Telecom, 2Zhejiang University, 3Tongji University, Shanghai Jiao Tong University, continuous navigation: every action changes the viewpoint and, consequently, the visual evidence available

2026-08-10机器人强化学习三维

本文针对连续视觉语言导航中仅预测动作、缺少对视角随运动变化建模的问题,提出 WNM-3D:从单目历史观测中提取几何感知特征,经 3D Scene-to-Token Adapter 转为场景前缀,联合约束未来视觉与动作生成。模型结合监督学习、DAgger 与 DanceGRPO 训练,在 GN-Bench 上优于强 VLM 导航策略和 2D 条件版本,并提升近目标场景的流-动作一致性、降低视觉运动误差。

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation Figure 1
2026-08-10cs.RO

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

2026-08-10机器人

这篇论文针对语言指令驱动的实验室移动操作难以从感知和任务描述稳定落到安全动作的问题,提出把系统集成拆成一系列“表示交接”:将指令约束为已注册技能调用,将感知落到地图、物体位姿和角色先验,再绑定为运动目标。结果主要来自干运行、启动检查和模拟感知轨迹,显示该框架能暴露标定、物体资产和真实场景视觉 grounding 的部署阻塞,但尚未充分证明真实机器人任务成功率。

Identifying the Key Biomechanical Features of Movement Adaptation during Exoskeleton-Assisted Locomotion Figure 1
2026-08-10cs.RO

Identifying the Key Biomechanical Features of Movement Adaptation during Exoskeleton-Assisted Locomotion

Peter Seungjune Lee, Katja Mombaur

2026-08-10机器人

这篇论文针对外骨骼辅助行走中“人如何随时间适应”仍被群体均值和稳态假设掩盖的问题,跟踪9名受试者在无外骨骼、主动踝助力和零力矩条件下的运动学、关节协同与代谢变化。核心洞察是适应并非统一收敛过程,而是个体化、异步且步态相位相关;摆动期波动更大,代谢反应也常不收敛,提示个体级时间演化分析比终点平均更关键。

Synthetic LiDAR Data Generation and Deterministic Downsampling for Point Cloud Classification on the Edge Figure 1
2026-08-10cs.LG

Synthetic LiDAR Data Generation and Deterministic Downsampling for Point Cloud Classification on the Edge

Niclas Meyer, Stefan Reitmann

2026-08-10三维

面向自动驾驶和机器人导航中边缘设备难以实时处理密集 LiDAR 点云的问题,本文用 BLAINDER 将 ModelNet 生成带传感器噪声的合成 LiDAR,并把 Critical Point Layer 集成进 PointNet 做确定性关键点下采样。结果显示噪声训练提升跨噪声泛化,但静态与旋转扫描分布迁移会崩溃;在 Raspberry Pi 5 上点数与延迟近线性,128 点约 21ms、约 47 FPS,是精度与实时性的较优边界。

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation Figure 1
2026-08-10cs.RO

LifelongCrossNav: Persistent 3D Semantic Memory for Cross-Floor Multi-Object Navigation

Zehui Li, Zihao Sun, Jiawei Xu, Zheqi He, Xiaoqiang Zhang, Jing-Shu Zheng, Lu Liu, Dahui Gao, Xiuwan Chen

2026-08-10机器人三维

这篇论文针对现有 ObjectNav 往往将多目标持续导航与跨楼层导航割裂处理的问题,提出 LifelongCrossNav:在单次任务中维护稀疏 3D 语义体素记忆,结合可通行性建图、楼梯感知与历史语义检索来复用已探索信息。作者同时构建 HM3D-MFMON 基准;实验显示其优于平面持久语义地图基线,尤其在需跨楼层的多目标序列中更有效。

Detection and Ranging of Transient Extrinsic Contacts Based on 6D Dynamic Tactile Sensing Figure 1
2026-08-10cs.RO

Detection and Ranging of Transient Extrinsic Contacts Based on 6D Dynamic Tactile Sensing

Haowen Zheng, Yinghao Wu, Fuyuan Liu, Yichen Li, Yitian Shao

2026-08-10视觉感知

这篇论文针对遮挡或狭窄环境中,机器人仅靠视觉难以感知抓持物与外界瞬时接触的问题,提出 TECDAR:在夹爪指尖嵌入单个 6D IMU,用加速度触发碰撞事件,并由陀螺仪瞬态旋转信号结合机器人位姿通过 EKF 估计外部接触位置。系统以 7 kHz、84 KB/s 数据流实现低负载感知,线接触和点接触平均定位误差约 7 mm,约 180 ms 达到毫米级,并支持 20 ms 周期的轨迹修正和触觉建图。

M2-SMap: Memory-Efficient Semantic Mapping with Hierarchical Multi-Model Representation Figure 1
2026-08-10cs.RO

M2-SMap: Memory-Efficient Semantic Mapping with Hierarchical Multi-Model Representation

QiYing Deng, ZhongLai Wang, Yuan Gao, Wei Dong

2026-08-10机器人

这篇论文针对资源受限机器人中稠密点云地图随场景扩展而内存膨胀、单一模型表达不足的问题,提出 M2-SMap:先将 RGB-D 点云分解为高斯组件,再用投影到图像的实例掩码约束融合,并按平面、语义对象和复杂残差分别采用有界平面、超二次曲面和 GMM 表示。三段 RGB-D 序列实验显示其最低运行 29.37 Hz,原语数量较最佳基线平均减少 18.7%,跨物体粘连从每帧 2.808 降至 0。

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies Figure 1
2026-08-10cs.RO

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies

Jinhe Tang, Weiming Zhi

School of Computer Science and 2 Australian Center For Robotics, The University of Sydney, Australia, College of Connected Computing, Vanderbilt University, TN, USA

2026-08-10模仿学习

这篇论文针对动作分块模仿策略部署时因感知误差或执行漂移离开示范分布、却仍输出平滑但无效动作的问题,提出 AutoIntervene:用成功轨迹构建视觉-动作支持记忆,并分别以阶段局部支持和全局支持校准接管与恢复阈值。实验覆盖九个真实双臂任务,显示其在迭代适应后比人工切换获得更高成功率,并减少操作者控制时间。

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video Figure 1
2026-08-10cs.RO

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao

∗ Equal contribution. 1 Nanjing University, Nanjing, China. 2 China Mobile Research Institute, Beijing, China. † Corresponding author: Xiao-Xiao Long

2026-08-10机器人视觉感知三维

C2Dex针对单目人类视频到灵巧手操作中接触抖动、穿透和跨手型重定向失真的问题,提出在物体规范空间聚合稳定物体侧接触,并将其同时用于HOI重建约束和灵巧手接触迁移,结合拉普拉斯交互优化与残差强化学习。在DexYCB和TACO上端到端成功率达57.78%和26.67%,明显高于最强基线17.78%和10.00%,并通过真实机器人回放验证可执行性。

Real-time Whole-Body Motion Planning for Mobile Manipulators Carrying Arbitrarily Shaped Payloads via Kinematically-Coupled SVSDF Figure 1
2026-08-10cs.RO

Real-time Whole-Body Motion Planning for Mobile Manipulators Carrying Arbitrarily Shaped Payloads via Kinematically-Coupled SVSDF

Yisheng Li, Longji Yin, Tingrui Zhang, Ruize Xue, Haoda Zhu, Nan Chen, Siqi Liang, Yuxi Liu, Fu Zhang

2026-08-10规划控制

针对移动机械臂搬运大尺寸、非凸载荷时,球体近似会压缩可行空间、逐链节 SVSDF 又忽略运动学耦合的问题,论文提出前端链分解核碰撞检测、中端轨迹预处理与后端 KC-SVSDF 优化的实时全身规划框架。其关键在于保留真实几何并沿运动链传播避障梯度;消融、基准比较和实机实验显示,该方法能在狭窄杂乱环境中搬运异形载荷。

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems Figure 1
2026-08-10cs.RO

Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems

Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa

2026-08-10规划控制数据集/基准

本文针对现有 LLM 控制器设计评测多停留在线性单自由度、且依赖云端大模型的问题,提出覆盖 132 个复杂动力系统配置的 CoDyControlBench,并比较推理蒸馏与答案蒸馏。结果显示 GPT 成功率最高为 94.8%,性能差异主要来自增益选择和瞬态限制等控制知识应用;1.5B 推理蒸馏模型优于基线并在气动肌肉机械臂实测中完成跟踪。

A Haptic Robot Finger Designed for Guqin Instrument Playing Figure 1
2026-08-10cs.RO

A Haptic Robot Finger Designed for Guqin Instrument Playing

Tianwei Zhang, Hanming Yan, Yang Yang. Ziya Wang

2026-08-10机器人

古琴演奏要求左手精确控压、滑音和泛音,传统乐器机器人多依赖开环位置控制,难以处理这类触觉密集任务。论文设计了仿人软指腹与指甲结构的多模态触觉手指,同时感知静态压力和高频振动,并在双臂古琴系统中验证。结果显示其可稳定完成空弦、按音、泛音调节和触觉触发双手协同等接触任务,但文中明确未实现完整古琴演奏。

Automated Terminal-to-Housing Assembly System for Flat Ribbon Cable Harness Figure 1
2026-08-10cs.RO

Automated Terminal-to-Housing Assembly System for Flat Ribbon Cable Harness

Eunkyu Choi, Joonho Seo, Seungmin Lee, Seokhwan Jeong

2026-08-10机器人

面向扁平排线端子插壳仍依赖人工的问题,论文指出其难点不在单个 peg-in-hole,而在柔性排线耦合下多端子无法独立校正、易干涉且锁止前不稳定。作者提出少传感、无视觉的机械流程,用对齐、倾斜滑入、摆动编织和夹紧逐步消除误差;80 次实验端到端成功率为 83.75%,半速周期 33 秒,但仍主要是实验室原型。

Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models Figure 1
2026-08-10cs.RO

Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models

Xiangkai Ma, Yue Ma, Junjie Wang, Sheng Xu, Mingyang Li, Han Zhang, Yuzheng Zhuang, Wenzhong Li, Zhihao Yuan

Joy Future Academy, JD

2026-08-10强化学习规划控制

论文针对现有世界动作模型偏重静态未来图像预测、难以把物理状态演化转化为可执行轨迹的问题,提出 PILOT 与表征演绎机制,将状态转移压缩为 Motion-CoT 语义 token,并用因果动力学监督解耦高层意图和低层轨迹。实验报告其在 LIBERO、RoboCasa-GR1 和真实任务上分别达到 97.9%、62.6% 与 83.1% 成功率,并降低推理延迟,但具体增益与数据规模、基线设置的关系仍需进一步核查。

Exact Thrust-Reversal Limits of Bidirectional Propellers under Bounded Motor Inputs Figure 1
2026-08-10cs.RO

Exact Thrust-Reversal Limits of Bidirectional Propellers under Bounded Motor Inputs

Ahmed Ali, Chiara Gabellieri, Antonio Franchi

2026-08-10学习理论

本文针对双向螺旋桨在推力换向时常被误当作理想有符号推力源的问题,指出推力与转速呈有符号二次关系,过零处输入增益消失。论文建立归一化推力坐标模型,并用期望推力过零阶数给出有界电机输入下可精确复现的充要条件;结果表明线性换向需无界电流/电压,高阶平坦换向可避免奇异命令,实验验证了相应峰值与跟踪退化。

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies Figure 1
2026-08-10cs.RO

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

Tsinghua University, Informatics Institute, University of Amsterdam

2026-08-10视觉语言视觉感知安全鲁棒

这篇论文针对VLA在固定相机微调后遇到相机位姿变化就动作漂移的问题,提出用同一物理状态的名义/扰动视角构造动作等价对,并直接约束流式动作头在同一流坐标处的速度场一致,而非只做特征不变。LIBERO-Plus相机扰动成功率达87.2%,比同数据FM-only高7.4个百分点;真实机器人隐蔽相机从53.3%升至74.4%,但方法依赖真实动作等价配对。

Vernata: Self-Supervised Learning of LiDAR Point Representations Figure 1
2026-08-10cs.CV

Vernata: Self-Supervised Learning of LiDAR Point Representations

Oliver Lemke, Alexander Liniger, Abel Gawel, Marco Hutter

2026-08-10机器人

这篇论文针对户外机器人 LiDAR 点云标注昂贵、监督语义理解难以扩展的问题,将 Sonata 自监督框架改造成 Vernata:通过稀疏视图增强适应距离导致的密度变化,用 memory bank 稳定受限算力下的训练,并引入高分辨率 2D 特征做跨模态蒸馏。线性探测结果显示,其在 TartanGround 和 Waymo 上分别比 Sonata 提升 5.9 和 7.3 mIoU,缺少颜色或法向量时仍保持较强表现。

Spatiotemporal Agility: Time-Constrained Reinforcement Learning for Vision-Guided Dynamic Quadrupedal Interception Figure 1
2026-08-10cs.RO

Spatiotemporal Agility: Time-Constrained Reinforcement Learning for Vision-Guided Dynamic Quadrupedal Interception

Yidong Zhu, Zibo Dai, Tongning Zhang, Leixin Chang, Hua Chen

Zhejiang University, Hangzhou, China, LimX Dynamics Technology Co., Ltd., Shenzhen, China

2026-08-10视觉感知强化学习

这篇论文面向四足机器人在约一秒时间窗内截获动态目标的问题,指出传统速度跟踪策略难以同时满足到达位置和到达时刻。其核心做法是用多相机视觉预测球的落点与落地时间,并将位置与时间直接作为强化学习策略条件,构成闭环实机系统。实验中,在2米内落点、0.8至1.2秒飞行时间的接球任务上,该方法相对速度跟踪和瞬时球状态基线成功率更高,且仿真到实机性能落差更小。

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Figure 1
2026-08-10cs.RO

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

Eric Nichols, Alva Markelius, Hatice Gunes

Robotics , a workshop at IEEE RO-MAN 2026, Kitakyushu, Japan. 1 Honda Research Institute Japan, Wako, Japan.

2026-08-10机器人数据集/基准

该文针对社交机器人选用基础模型时公共榜单与真实具身互动需求脱节、直接真人机器人评测成本高的问题,提出以对话能力、安全性、具身角色、场景有效性和受众适配为五个维度,并用静态基准、模拟交互、机器人专用评测构成三级漏斗。主要结果是给出现有基准覆盖图和缺口清单,论证可先低成本筛选再投入高成本实测;未报告新模型或实证增益。

Rigid-Covert GNSS Spoofing of UAV Swarms: A Structural Blind Spot, Its Detection Limit, and Absolute-Anchor Defenses Figure 1
2026-08-10cs.CR

Rigid-Covert GNSS Spoofing of UAV Swarms: A Structural Blind Spot, Its Detection Limit, and Absolute-Anchor Defenses

Minseok Park, Joon Soo Yoo

Jeonbuk National University, Jeonbuk National University Dept. of Electronic Engineering Jeonju Republic of Korea, Jeonbuk National University Dept. of Advanced Defense Technology and Industry Jeonju Republic of Korea

2026-08-10视觉感知

面向无人机蜂群依赖相对几何交叉校验 GNSS 的安全假设,论文指出共同缓慢平移会保留机间距离,使相对检测存在规范自由度盲区;核心做法是引入可信绝对锚点,推导检测下限并用鲁棒配准恢复全群位置。仿真、ArduPilot SITL 与 Gazebo 视觉锚点中,在约 10.1 m 漂移下非锚机中位误差 0.39 m,但所有验证均为仿真,无 RF 硬件或实物蜂群。

Are Visual Place Recognition Models Recognizing Places or Conditions? Distractor-Augmented Evaluation and Condition Suppression Figure 1
2026-08-10cs.RO

Are Visual Place Recognition Models Recognizing Places or Conditions? Distractor-Augmented Evaluation and Condition Suppression

Beomsu Kim, Minwoo Jung, Giseop Kim

B. Kim and G. Kim are with the Department of Robotics and Mecha-, M. Jung is with the Department of Mechanical Engineering, Seoul National

2026-08-10视觉感知数据集/基准

这篇论文针对众包地图在多光照、天气和季节条件下混合后,VPR 模型可能按“条件相似”而非“地点相同”检索的问题,提出加入受控干扰样本的 DAR/RSR 评估,并将 INLP、LEACE 等概念擦除用于描述子条件抑制。实验覆盖 11 种方法和 6 个数据集,显示 DAR@1 排名可明显不同于传统 R@1,且条件抑制通常提升 DAR@1而基本不损害 R@1。

Unordered Landmark Visual Navigation Figure 1
2026-08-10cs.RO

Unordered Landmark Visual Navigation

Hao Ren, Junzhe Zhu, Yihan Li, Zetong Bi, Le Zheng, Zhi Li, Yiqing Yuan, Zhaoliang Wan, Dizhe Zhang, Lu Qi, Hui Cheng

Sun Yat-sen University, Guangzhou, China, restrict scalability, especially when deploying robots using crowd-sourced

2026-08-10机器人

这篇论文针对现有视觉导航依赖有序视频、深度/LiDAR或里程计而难以利用众包无序照片的问题,提出仅用RGB无序图像的ULVN框架:先用校准几何验证与最大生成森林构建可靠2D拓扑图,再用熵自适应信念传播定位并动态重规划。仿真和真实机器人实验显示,其在感知混淆、偏航和重定位场景下优于现有方法。

When Coordination Becomes a Threat: Communication Attacks in LLM-Controlled Multi-Robot Systems Figure 1
2026-08-10cs.RO

When Coordination Becomes a Threat: Communication Attacks in LLM-Controlled Multi-Robot Systems

Zhen Huang, Zhihuang Liu, Weijia Shi, Yifan Yang, Weishang Wu, Zhiping Cai

2026-08-10机器人规划控制

这篇论文针对 LLM 多机器人协作中“通信内容被当作可信状态”带来的安全风险,系统比较 DMAS、HMAS-1、HMAS-2 下外部入口与内部特权两类攻击。核心洞察是危险不只来自直接指令,还会通过伪装成进度、观察或授权声明的消息传播并转化为物理动作;实验显示三类架构均高比例触发不安全行为,CPV Gate 将违规率从 70.0% 降至 36.6%。

R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim Figure 1
2026-08-10cs.RO

R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim

Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen

The Hong Kong Polytechnic University

2026-08-10机器人

论文针对稀疏实景采集下机器人真实到仿真场景中,人工拍摄视角与机器人执行视角不匹配导致的支持缺口。R2S-EGO用仿真 rollout 得到可执行自我视角查询,再用采集锚定的几何代理约束生成视图,并作为低权重伪观测迭代细化资产和碰撞面。实验中六视图设置在G1视角PSNR达19.062 dB,高于基线14.226 dB,真实G1坐下成功率33/40对4/40。

Ising Acceleration for Multi-Robot Multi-Target Planning Figure 1
2026-08-10cs.ET

Ising Acceleration for Multi-Robot Multi-Target Planning

Ahmet Efe, Recep B. Uludag, Chris H. Kim, Ulya R. Karpuzcu

University of Minnesota, University of Minnesota Minneapolis Minnesota USA

2026-08-10机器人规划控制

这篇论文关注多机器人多目标规划在机载低功耗场景中的组合优化开销,评估小规模 CMOS Ising 芯片是否真能嵌入规划栈。核心做法是把目标分配、路径排序和局部寻路拆成芯片可承载的子问题,并用自旋合并、系数量化、分支映射生成候选。实验显示目标分配最适配硬件,最高省能 8000 倍;端到端路线比强经典基线长约 9%,能耗低 130 倍,但巡回构造受系数范围限制。

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models Figure 1
2026-08-10cs.RO

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

2026-08-10视觉语言强化学习

本文针对 JEPA 世界模型仅做前向预测时,潜变量未必可辨识机器人自身物理状态与状态变化的问题,提出 PSG-JEPA:在训练中用本体状态约束单帧潜变量、用多时域关节角变化约束潜变量对,推理时不增加开销。实验覆盖探针辨识、冻结潜变量规划、仿真与真实机器人策略学习,结果显示其相较 LeWM 等基线在三类评估中均有提升。

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models Figure 1
2026-08-10cs.RO

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

2026-08-10视觉语言视觉感知强化学习

AtlasVLA针对腕部单相机VLA在遮挡和长时序任务中容易遗忘物体位置与执行进度的问题,引入持续的World-Ego状态:用4D体素哈希世界记忆融合历史观测,并用Ego-Working记忆跟踪任务进展,再条件化DiT生成动作。实验称其在LIBERO、RLBench和真实任务中达到SOTA,仅用腕相机仍优于多视角基线,LIBERO-Long和真实长程任务成功率分别提升9.4%和17.5%。

Hoverflie: An empirical investigation of rotor shrouds to transform micro air vehicles into multi-modal hovercraft Figure 1
2026-08-10cs.RO

Hoverflie: An empirical investigation of rotor shrouds to transform micro air vehicles into multi-modal hovercraft

Mrinmoy Modak, Daniel S. Drew

2026-08-10机器人

这篇论文针对微型旋翼机室内续航短、近地飞行效率低的问题,把 Crazyflie 2.1 加装轻量旋翼罩,系统测试导管、进气口和喷嘴几何对地效升力、自由飞行推力及中间高度吸附效应的影响,并提出能描述 suckdown 的经验模型。优化结构在近地工况下升力接近提升三倍、续航增加约 60%,同时自由飞行续航下降约 30%,展示了近地气垫与空中飞行切换的可行性。

Scalable Long-Horizon Planning with Staggered Updates for Lifelong MAPF Figure 1
2026-08-10cs.MA

Scalable Long-Horizon Planning with Staggered Updates for Lifelong MAPF

Vaibhav Sanjay, Jiaoyang Li

Vaibhav Sanjay and Jiaoyang Li are with the Robotics Institute, Carnegie Mellon University.

2026-08-10规划控制

面向仓储等终身多智能体路径规划中,反应式方法缺少长时域预判、RHCR又难扩展的问题,论文提出PUSH:用错位规划窗口只重规划部分智能体,同时保留全局安全备用路径,并引入类似EPIBT的优先级继承、回溯和anytime局部优化。实验在任务停留和复杂走廊场景中显示,其可扩展到约1万智能体,并比PIBT/EPIBT、RHCR等基线获得更高吞吐。

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting Figure 1
2026-08-10cs.RO

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

2026-08-10机器人

这篇论文针对VLA导航常忽略机器人形态差异的问题:同一语义路径对轮式和足式平台未必都可执行。核心做法是用归一化图像平面轨迹作为语义推理与物理约束之间的接口,先由VL-Tracer生成初始轨迹,再由结合机器人身份、可通行视觉线索和交叉注意力的CE-Adapter预测残差修正,并用CE-RRT*自动生成监督轨迹。实验在NaviTrace上得分45.68,比Gemini-2.5-Pro高10.01分,真实轮式/足式部署也显示成功率和效率提升。

SoRoMoX: Fast, Differentiable, and Parallelizable Soft Robot Models Figure 1
2026-08-10cs.RO

SoRoMoX: Fast, Differentiable, and Parallelizable Soft Robot Models

Maximilian Stölzle, Solange Gribonval, Daniel Feliu-Talegon, Vito Daniele Perfetta, Michele Martini, Chuhan Zhang, Kiwan Wong, Mohammed Tarnini, Anup Teejo Mathew, Federico Renda, Daniela Rus, Cosimo Della Santina

Models in JAX), a fully numerical, JIT-compilable Python/JAX, Zhang, and C. Della Santina are with Delft University of Technology, Delft, M. St¨olzle, K. Wong, and D. Rus are with the Massachusetts Institute of, M. Martini is also with the Italian Institute of Technology, Genoa, Italy., M. Tarnini, A. T. Mathew, and F. Renda are with Khalifa University, Abu, remain largely unavailable for soft robots. Existing imple-, MATLAB, SoRoSim [15] implements GVS models in MATLAB but, Access to the tool: The SoRoMoX package is available

2026-08-10机器人

这篇论文针对软体机器人已有 Cosserat 杆降阶模型难以接入可微优化、GPU 并行和控制工作流的问题,提出基于 JAX 的 SoRoMoX,把 PCS、GVS 和关节式软体模型统一到可 JIT、可端到端求导的控制接口中。结果显示其 CPU rollout 最多快 18.1 倍、GPU 批量吞吐最高提升 234.6 倍,并在辨识、残差学习、计算力矩控制、安全约束控制和并行强化学习中带来显著误差或训练效率改进。

Plan-and-Avoid: Real-Time Aircraft Trajectory Coordination in a Multi-Agent Environment Figure 1
2026-08-10cs.RO

Plan-and-Avoid: Real-Time Aircraft Trajectory Coordination in a Multi-Agent Environment

Huseyin Emre Tekaslan, Ella M. Atkins, Natasha Neogi

H. Emre Tekaslan is with the Kevin T. Crofton Department of Aerospace and Ocean Engineering, Virginia Polytechnic Institute and State University, Blacksburg, VA 24060, USA, Virginia Polytechnic Institute and State University

2026-08-10规划控制

针对应急降落、任务优先等场景中单架飞机的优先航迹会扰动周边交通的问题,论文提出 Plan-and-Avoid 框架:先评估优先航迹的概率化失去间隔风险,再为受影响飞机生成满足载具约束的单边避让建议,以把优先事件作为系统级协调问题处理。在华盛顿 ADS-B 数据的 900 多个迫降案例中,方法解决全部 575 个冲突遭遇,最坏端到端耗时 5.7 秒,93.5% 建议满足 35 秒 DAA 时间阈值。

SyncSBC: Decentralized Swarm Behavior Prediction for Synchronized Autonomous Control Figure 1
2026-08-10cs.RO

SyncSBC: Decentralized Swarm Behavior Prediction for Synchronized Autonomous Control

Varun Raveendra, Connor Mattson, Daniel S. Brown

Kahlert School of Computing, University of Utah, Salt Lake City, USA

2026-08-10规划控制

这篇论文针对群体机器人只能依赖局部感知、又需要判断全局行为和故障变化的问题,提出 SyncSBC:用共享学习分类器从单个机器人观测预测群体行为,并结合事件触发通信与分布式共识同步各机器人决策。仿真和真实机器人实验显示,该方法能保持较高分类准确率、降低同步延迟,并支持异常检测与实时行为切换。

A Disturbance in the Force: Force Actuation on the RAVEN II Surgical Robot with Parallel Motor-Cable Units Figure 1
2026-08-10cs.RO

A Disturbance in the Force: Force Actuation on the RAVEN II Surgical Robot with Parallel Motor-Cable Units

Haonan Peng, Dun-Tin Chiang, Jordan Hendricks, Andrew Lewis, Jared Shing, Haokun Feng, Yun-Hsuan Su, Blake Hannaford

Haonan Peng, Dun-Tin Chiang, Jordan Hendricks, Andrew Lewis, Jared Shing, Haokun Feng, and Blake Hannaford, are with the University of Washington, Seattle, WA 98195, USA.

2026-08-10机器人

针对外科机器人缺少末端触觉反馈、学习式力估计又难获得带真实外力的训练数据的问题,本文为 RAVEN II 搭建六组并联电机-缆索单元,通过张力优化、双层反馈、定位与仿真,在不干涉机械臂运动的情况下施加任意方向外力。初步实验显示三轴平均绝对误差约 0.80、0.79、0.44 N,可用于后续无传感器力估计数据采集。

LyEvO: Lyapunov-Guided Evolutionary Optimization for Safe and Robust Sim-to-Real Policy Learning Figure 1
2026-08-10cs.RO

LyEvO: Lyapunov-Guided Evolutionary Optimization for Safe and Robust Sim-to-Real Policy Learning

Riccardo Curcio, Hongpeng Cao, Marco Caccamo

2026-08-10强化学习优化算法安全鲁棒

论文针对仿真训练控制器在真实部署前缺少安全运行域评估的问题,提出 LyEvO:用 Lyapunov 稳定域初始化并指导采样,将约束进化优化与统计模型检验闭环结合,边训练边验证并扩展可认证区域。Cartpole 与 3D 四旋翼仿真及少量实机实验显示,其稳定域和扰动鲁棒性优于多种 DRL 基线,但实机规模仍有限。

Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection Figure 1
2026-08-10cs.RO

Fast and Accurate: An Adaptive VLA Inference Framework through Environment-aware Model Selection

Yuewei Sun, Lang Qin, Zechuan Tian, Jingwen Li, Guiqin Wang, Shengzeng Huo, Wenxin Ren, Tao Fang, Xiaochen Zhang, Guanqing Deng, Xiang Wang, Xiaowen Dong, Qinghai Guo, Yuxin Ma

2026-08-10机器人

这篇论文针对大规模 VLA 推理慢、难以实时闭环控制的问题,提出 EMS:将慢速规划模型与快速反应模型完全解耦,只在动作层交互,并用强化学习切换器根据环境反馈决定何时调用大模型。其关键价值在于避免快慢系统特征绑定,支持模块替换和稀疏慢模型调用;在 LIBERO 上保持接近大模型的成功率,同时有效动作频率提升到 93.4 Hz,并在真实双臂任务中缩短完成时间。

Beyond Visibility: Real-Time Surface Accessibility Fields from Sparse LiDAR Figure 1
2026-08-10eess.IV

Beyond Visibility: Real-Time Surface Accessibility Fields from Sparse LiDAR

Bradley Scott, Sam Schofield, Richard Green

University of Canterbury

2026-08-10机器人

这篇论文针对移动机器人仅有可见性或几何重建仍无法判断工具能否实际接触表面的问题,提出从稀疏流式 LiDAR 实时生成逐点“可达性场”。核心做法是用扫描中心 TSDF 结合 GPU 上的工具几何核,显式检查碰撞和进近通道 clearance。实验显示其在混合可达几何上 F1 为 90.8,高于 HPR 可见性基线 69.8,并在松树模型中识别出 56.8% 虽可见但不可达的枝条表面。

2026-08-07

42 篇
$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation Figure 1
2026-08-07cs.RO

$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang

2026-08-07机器人强化学习

本文针对人形机器人家务中“边移动边操作”的全身协同难题,指出将行走、平衡和操作拆分会限制擦桌、拖地、取放物等连续接触任务。ω-0的核心是不用生成未来视频,而是在潜空间预测未来观测嵌入,并与扩散式全身动作 latent 联合训练,直接输出可由控制器执行的动作。作者还构建40小时ω-HOME数据集,并在11个真实任务中优于模仿学习、VLA、Humanoid和WAM基线,但具体增益中数据规模与模型设计的相对贡献仍需更多拆解。

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation Figure 1
2026-08-07cs.RO

DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation

Junfeng Li, Junjie He, Zhide Zhong, Yangyang Zheng, Pingyue Sheng, Jiayu Dong, Ruixin Li, Haodong Yan, Jiaguan Zhu, Tianran Zhang, Runze Yu, Wen Chen, Liuqing Yang, Yuxiang Gao, Haoang Li

2026-08-07机器人规划控制

该文针对跨机器人形态 VLA 难以同时共享操作规律并保留本体控制差异的问题,提出 DyPES-VLA:用未来帧预测在异构人/机器人视频中学习物体运动、接触和场景变化等共享动力学先验,再由按本体划分的 MoE 动作头直接输出各机器人原生动作,避免手工统一动作空间。单一联合模型在 LIBERO、RoboCasa-GR1、RoboTwin 2.0 分别达到 98.0%、59.25%、89.02% 成功率,并报告真实多本体任务平均 75.6%。

A Master-Salve Robot Manipulator for Needle-Based Teleoperation in MRI Chamber Figure 1
2026-08-07cs.RO

A Master-Salve Robot Manipulator for Needle-Based Teleoperation in MRI Chamber

Omar Curiel, Jing-Yuan Huang, Po-Chih Chen, Ji Ma, Qing Dai, Wenqi Zhou, David Lu, Holden H. Wu, Tsu-Chin Tsao

2026-08-07机器人

针对MRI腔内经皮针介入受空间、磁兼容与力反馈限制的问题,本文提出台面安装的MR安全主从针操作器,用流体传动分担角度调节与进针,并结合人工、数字和协作控制模式。初步结果显示其对MR图像噪声和畸变影响较小,可在60 cm孔径内完成活体猪实验的床旁手动操作验证。

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions Figure 1
2026-08-07cs.RO

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Zhi Wang

Shenzhen International Graduate School, Tsinghua University, The Hong Kong University of Science and Technology, Shenzhen Technology University

2026-08-07机器人强化学习

GeniWorld针对真实机器人学习与评测难以覆盖复杂未见场景、数值动作条件又缺乏空间约束的问题,将URDF渲染的机器人运动作为视觉动作条件,结合自回归视频世界模型解耦本体运动与环境动态。实验显示其在固定场景少量数据训练下仍能零样本泛化到随机化环境,并可作为较可靠的策略评估器与数据生成器提升下游策略鲁棒性。

Robot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation Figure 1
2026-08-07cs.RO

Robot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation

Alperen Kenan, Paul Bremner, Manuel Giuliani

2026-08-07机器人模仿学习数据集/基准

针对现有模仿学习多重空间轨迹、少建模书写中的力与时间动态且缺少人类感知评估的问题,论文构建了52个大小写字母的触屏遥操作示范数据集,并将GMM+GMR扩展到力、归一化时间和多笔段轨迹。21人评估中生成轨迹人类相似度均值为71.50,几何位置与书写顺序被认为最影响观感。

Design and Evaluation of a Touchscreen-Based Teleoperation Interface for Robotic Manipulators Figure 1
2026-08-07cs.RO

Design and Evaluation of a Touchscreen-Based Teleoperation Interface for Robotic Manipulators

Juan José García Cárdenas, Alperen Kenan, Hamidreza Raei, Paul Bremner, Manuel Giuliani, Arash Ajoudani, Adriana Tapus

2026-08-07机器人数据集/基准

面向核设施擦拭等需同时控轨迹与接触力的遥操作任务,论文提出把摄像画面与触屏连续手指运动直接映射到机械臂切向运动,并用混合阻抗控制维持法向力。20人跨国远程实验显示,相比摇杆,触屏完成时间中位数降53.5%,路径覆盖更高、越界更少,NASA-TLX从52降至43;一键自主负荷最低但人机信任与适用边界仍需进一步验证。

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations Figure 1
2026-08-07cs.RO

VIDP: Variable Impedance Diffusion Policy for Compliant Robot Manipulation from Diverse Demonstrations

Hisham Khalil, Neil Fernandes, Thomas M. Kwok, Hsiu-Chin Lin, Yue Hu

Collaborative robots performing contact-rich manipula-, Canada (NRC), Canada-Japan 3+2 collaborative funding reference number, H. Khalil, T. M. Kwok, and Y. Hu are with the Department, of Mechanical and Mechatronics Engineering, University of Water-, N. Fernandes is with the Department of Electrical and Com-, puter Engineering, University of Waterloo, Waterloo, ON, Canada, H.-C. Lin is with the School of Computer Science and the Department, of Electrical and Computer Engineering, McGill University, Montreal, QC, severely limiting scalability across unstructured environments., measurements, which most commercial collaborative robots, specialized interactive hardware that limits scalability. For, instance, [20] extracts compliance labels via a dedicated

2026-08-07机器人生成模型强化学习模仿学习

面向接触丰富操作中固定阻抗难以同时兼顾跟踪精度与柔顺性的矛盾,VIDP从仅含位姿的多样化示教中学习可变阻抗。其关键是用TP-DAMM区分几何布局变化与有意柔顺,将任务参数化、方向一致的轨迹方差映射为刚度,再由扩散策略联合预测位姿和柔顺性。真实机器人实验显示,相比固定阻抗基线,方法提高任务成功率,并在高刚度控制器的交互力和低刚度基线的跟踪误差之间取得更好折中。

ErgoSurf: Ergodic Control for the Coverage of Unknown Surfaces Figure 1
2026-08-07cs.RO

ErgoSurf: Ergodic Control for the Coverage of Unknown Surfaces

Stefan Schneyer, Timo Bachmann, Maged Iskandar, Korbinian Nottensteiner, Alin Albu-Schäffer, Freek Stulp, João Silvério

1 affiliationmark: German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RM), Münchener Str. 20, 82234 Weßling, Germany, 2 affiliationmark: Technical University of Munich (TUM), School of Computation, Information and Technology

2026-08-07规划控制

面向清洁、打磨、检测等需贴触覆盖但缺少CAD或预扫描模型的任务,论文把遍历控制与在线表面重建耦合:用触觉接触更新GPIS全局隐式面,并以局部切平面点云作为快速规划域,通过热扩散势场把用户给定目标映射到当前表面。仿真和真机实验显示,机器人可在覆盖未知表面的同时学习几何,重建误差接近真值。

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments Figure 1
2026-08-07cs.RO

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter

Giorgio Tonetti, Laurent Kneip, Abel Gawel, and Marco Hutter are with the RAI Institute. Additionally, Giorgio Tonetti and Marco Hutter are with ETH Zurich.

2026-08-07视觉感知

Prior-SG针对开放式或任意结构环境中,传统场景图依赖房间墙体等几何假设、难以按任务划分功能区域的问题,将生成过程建模为观测图与LLM生成先验图的概率对齐。其用多尺度开放词汇特征融合RGB-D实例图,并以MRF/图割融合视觉、几何、物体和拓扑先验。实验显示其在模拟住宅和真实开放场景中提升语义区域分割精度,可在无物理边界时推断功能边界,并支持零样本任务相关重划分。

Visual Grounding in Zero-Shot Vision-Language Control Figure 1
2026-08-07cs.RO

Visual Grounding in Zero-Shot Vision-Language Control

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

2026-08-07视觉语言视觉感知规划控制

本文针对零样本视觉语言控制中“跑得好是否真的看见了”的问题,提出输入消融、盲图、重复输入与车道轴反射等测试来区分视觉 grounding 与保守动作先验。结果显示多数 VLM 直接控制近乎图像不变,无法同时满足纵向危险和横向左右一致性;但经对称共识约束后,可作为选择性纵向危险助手达到约 0.954 平衡准确率,而不宜作为端到端控制器。

IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation Figure 1
2026-08-07cs.RO

IcFuzz: Fuzzing Isaac Sim with Semantic Stage Guidance and Multi-level Mutation

Zhixiang Chen, Zhuangbin Chen, Ruoxi Jia, Zeqin Liao, Wei Li, Jinyang Liu, Zibin Zheng

Sun Yat-sen University, Nanyang Technological University, Chinese University of Hong Kong, Sun Yat-sen University Zhuhai China, Nanyang Technological University Singapore Singapore, Chinese University of Hong Kong Hong Kong China

2026-08-07机器人

这篇论文针对 Isaac Sim 在具身智能开发中日益关键但复杂度高、易因仿真器缺陷影响可靠性的问题,提出 IcFuzz 作为面向 Isaac Sim 的专用模糊测试方法。其核心思路是用 LLM 做语义阶段划分,保留对象上下文与执行顺序,再结合多层级变异和多臂老虎机调度探索状态空间。实验显示其覆盖率约为基线的 190%–205%,12 小时测试中平均发现 3.7 个独特崩溃,并在四个月内发现 11 个缺陷,其中 9 个已被确认或修复。

Topometric Autonomous Vehicle Localization by Combining Visual Embeddings and Feed-Forward 3D Models Figure 1
2026-08-07cs.RO

Topometric Autonomous Vehicle Localization by Combining Visual Embeddings and Feed-Forward 3D Models

Eulogio Quemada-Torres, Alberto Jaenal, Francisco-Angel Moreno, Javier Gonzalez-Jimenez

2 affiliationmark: Robotics, Computer Vision and Artificial Intelligence Group (RoPeRT), Aragon Institute for Engineering Research (I3A), University of Zaragoza, Zaragoza, Spain

2026-08-07三维

这篇论文针对纯视觉地点识别在长期定位中虽紧凑、抗外观变化但度量精度不足的问题,提出把VPR嵌入构建的拓扑-度量地图与前馈3D几何模型结合:离线用HDBSCAN自动形成地点并选代表图像,在线用粒子滤波的地点信念约束FF3D精修位姿。在COLD、4Seasons和RobotCar上相较外观定位与直接VPR+FF3D基线提升定位精度,并显示序列信念可缓解感知混淆。

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features Figure 1
2026-08-07cs.RO

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Sining Ang, Yuguang Yang, Yan Wang

2026-08-07视觉感知生成模型强化学习规划控制

这篇论文针对自动驾驶世界动作模型部署时仍需完整视频扩散推理、成本过高的问题,指出轨迹规划对视频噪声步不敏感,但可从中间 DiT 层解码出高质量轨迹。Adaptive-WAM在Wan2.2-5B上设置多出口轨迹头,并用轻量质量评分器决定是否提前退出,避免生成未来视频。结果在NAVSIM达90.8 PDMS,64提案固定出口达92.6 PDMS,nuScenes零微调下平均L2为0.88米,延迟较全深度约降47%。

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation Figure 1
2026-08-07cs.RO

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang

2026-08-07机器人

这篇论文针对VLA机器人策略在长程、多阶段操作中只依赖全局指令、难以显式跟踪任务进展的问题,提出HiRoC:用高层规划器生成可执行子目标,并先做规划器-执行器对齐,再用带子目标进度信号的层次化GRPO强化低层执行。实验称在多类操作基准上稳定优于强基线,平均提升10.06%,但真实物理不确定性下的分解鲁棒性仍待进一步验证。

Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control Figure 1
2026-08-07cs.LG

Observation-Grounded Self-Predictive Reinforcement Learning for Visual Continuous Control

Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen

2026-08-07强化学习规划控制

针对像素输入下连续控制样本效率不足、单独依赖潜在自预测或观测预测各有缺口的问题,本文提出 OG-SPR,在 actor-critic 中结合多步潜在自预测、下一观测预测和短期价值预测,并用轻量适配器避免自预测过度约束共享表征。DMControl 28 个视觉控制任务显示其总体优于强自预测和观测预测基线,dog、humanoid 等困难域增益更明显。

TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions Figure 1
2026-08-07cs.RO

TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions

Taehyeon Kong, Woojin Kim, Jemin Hwangbo

2026-08-07机器人

这篇论文针对腿式机器人在打滑、软地面和足端滚动等不可靠接触下,仅靠 IMU 与关节传感器进行里程计估计易累积漂移的问题。TRACE 用端到端网络直接预测相对位姿和机体系速度,并通过足端感知交叉注意力、物理启发辅助损失、策略随机化预训练与部分真实数据微调,减少对接触阈值和滤波后端的依赖。实验显示其在多种室内外地形上相对 IEKF、混合学习滤波和纯学习基线持续降低位置漂移,软地面案例 ATE 降低约 53.8%。

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation Figure 1
2026-08-07cs.RO

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tang, Jiwen Lu

Shenzhen International Graduate School, Tsinghua University, Department of Automation, Tsinghua University, Nanyang Technological University, Beijing Normal University

2026-08-07机器人

这篇论文针对机器人操作数据稀缺下长程任务难以组合泛化的问题,提出 SkillMemo:用 MoE 路由隐式把演示轨迹分解为原子技能,并将技能级表征写入可检索的情景记忆,推理时融合相关技能先验来修正动作预测。实验称其在仿真和真实 UR5e 任务中同时提升 DP 与 VLA 骨干,达到 98.0% 成功率,较 π0.5 高 1.2%,但具体增益中记忆、MoE 与训练规模的相对贡献仍需看消融是否充分。

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models Figure 1
2026-08-07cs.AI

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models

Shuai Wang, Yaxin Feng, Xuekun Jiang, Shihan Tian, Ningyu Yan, Xing Shen, Chaoyang Lyu, Hui Wang, Yunsong Zhou, Hanqing Wang, Jiangmiao Pang, Yang Xiang, Xing Gao, Chunhua Shen, Weinan Zhang

2026-08-07视觉感知强化学习数据集/基准

GAUGE针对仿真器和视频世界模型常以视觉相似度评估、难定位具体物理错误的问题,构建了基于真实测量的诊断基准,覆盖22类刚体、线缆、织物和软体任务,并提供校准参数、轨迹和不确定性。实验显示,Isaac Sim、Genesis、Newton各有适用域但无一全局可靠;视频模型虽能生成符合法律形式的轨迹,却常在加速度、动量传递和振荡时序上出错。

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models Figure 1
2026-08-07cs.CV

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

2026-08-07生成模型强化学习安全鲁棒

这篇论文针对基于视频生成模型的世界-动作模型在VAE潜空间中过度保留纹理、光照等外观细节,导致机器人策略在视觉分布外条件下脆弱的问题。Robust-WAM不重建语义潜空间,而是在保留VAE生成分支和大规模预训练动态先验的同时,用带时间位置编码的可学习查询将动作流对齐到未来帧的DINOv3语义CLS特征。实验显示该后训练方法在RoboTwin、LIBERO-Plus和真实机器人上提升多个WAM基线的OOD成功率,且基本不损失分布内表现。

Shape-Aware Oriented Bounding Box (OBB) to Horizontal Bounding Box (HBB) Conversion Figure 1
2026-08-07cs.CV

Shape-Aware Oriented Bounding Box (OBB) to Horizontal Bounding Box (HBB) Conversion

Badha Rathna Sabhapathy, Gotam Dahiya, Vishesh Vatsal

2026-08-07学习理论

本文针对遥感船舶检测中 OBB 输出需转为 HBB 时易引入背景或裁掉目标的问题,提出用超椭圆船体模型刻画船形、丰满度与朝向,再投影得到更贴合船体的水平框。实验在 ShipRSImageNet 和自建 Sentinel-2 数据上对比 OuterHBB、AreaEquivalentHBB、GBB MarginalizedHBB,报告更高 mean IoU 和更少过包围/欠包围;但方法依赖参数校准,跨船型泛化仍需进一步验证。

Coordinated Multi-Robot Disassembly for Makespan Optimization of Large-Scale Assemblies Figure 1
2026-08-07cs.RO

Coordinated Multi-Robot Disassembly for Makespan Optimization of Large-Scale Assemblies

Niklas Hargus, Andreas Orthey, Marc Toussaint

2026-08-07机器人优化算法

面向回收、维修等场景中大型装配体拆解,多机器人需在狭窄空间同时满足依赖顺序、避碰和低完工时间。论文提出 CoMuDi,将依赖图驱动的任务队列、广义拆解任务、时间约束传播和 ST-RRT* 时空规划结合,尽量减少等待并处理未知到达时间。六类装配实验显示其可协调最多 9 台机器人、49 个部件,机器人增多时 makespan 下降,且相比固定时间窗 RRT* 成功率和完工时间更稳定。

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments? Figure 1
2026-08-07cs.RO

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

2026-08-07机器人强化学习

本文针对机器人动作条件世界模型常只在已见本体上评测、难以判断是否学到真实物理动力学的问题,提出 XEWorld 跨本体测试床,在相同场景和任务中隔离机器人形态变量。实验显示,现有模型泛化主要受视觉相似性而非运动学相似性支配,更像二维外观匹配器;零样本迁移依赖像素级动作和显式时空对齐,少样本适配虽可恢复外观却会遗忘已见本体。

Acoustic-driven millimetric helical robot: ultrasonic synergistic manipulation in confined fluidic environment Figure 1
2026-08-07cs.RO

Acoustic-driven millimetric helical robot: ultrasonic synergistic manipulation in confined fluidic environment

Hanlin Wang, Xin Wang, Xinwei Wei, Jiaxu Liu, Le Wang, Shengze Cai, Chao Xu

2026-08-07机器人

这篇论文针对声场操控在受限生物流体中难以高效驱动毫米级机器人这一瓶颈,提出多声场协同方案,将声辐射力与声流共同用于螺旋机器人推进,并用多物理场模型解释其耦合机制。实验显示机器人可完成平面导航、爬坡和垂直运动,半自主路径跟踪机动性提升,在猪静脉体外环境中实现单向与往复的亚毫米级运动控制。

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use Figure 1
2026-08-07cs.RO

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

2026-08-07视觉语言视觉感知

本文针对VLA中行为克隆难以理解语言、自由形式CoT又会引入未接地推理、目标冲突和控制延迟的问题,提出VLA-Talker:让模型只消费由检测、深度和VLM工具生成的结构化空间证据,并通过in-context后训练与GRPO对齐工具使用。实验在RoboCasa-GR1、SimplerEnv、LIBERO及8个真实任务上优于CoT基线,推理效率约提升4.6倍。

Near-sensor Computing for Rapid Visuotactile Perception Figure 1
2026-08-07cs.RO

Near-sensor Computing for Rapid Visuotactile Perception

Zhengying Zhu, Ruilin Zhang, Runze Hu, Chenxi Xiao

School of Information Science and Technology, ShanghaiTech University

2026-08-07机器人

这篇论文针对视觉触觉传感器在主机端做三维重建带来的传输延迟、功耗和调度抖动问题,将谱 Poisson 求解器做成近传感端全流式硬件流水线,在 128×128 深度重建中实现固定 0.211 ms 首值延迟和约 347 mW 功耗;15 种接触形状误差为峰值深度的 0.17%,并把机器人保护反射闭环从 169.9 ms 降至 28.3 ms。

ATP: Anatomical Torque with Passivity-based Control Framework for Safe Upper-Limb Exoskeleton Assistance Figure 1
2026-08-07cs.RO

ATP: Anatomical Torque with Passivity-based Control Framework for Safe Upper-Limb Exoskeleton Assistance

Yu Chen, Gong Chen, Xiang Li

the Institute for Guo Qiang, Tsinghua University, and in part by the National Natural Science Foundation of China under Grant U21A20517 and 52075290.

2026-08-07规划控制安全鲁棒

面向上肢外骨骼在复杂、非周期运动中难以预设轨迹且需保证交互安全的问题,ATP用肌骨仿真和强化学习生成解剖参考力矩,再通过在线力矩修正抑制肌腱尖峰并结合能量罐无源控制实现安全跟踪。仿真与实机结果显示其可跟踪长时序动作并保持无源性,5名受试者EMG实验中目标肌群活动最高降低48%。

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots Figure 1
2026-08-07cs.RO

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara

2026-08-07机器人视觉语言规划控制

这篇论文关注VLM作为机器人规划器后带来的新风险:场景中的纸条文字可绕过软件与网络层,直接改写机器人任务理解。作者将物理提示注入划分为间接标识、任务重定义、权威冒充和冲突注入,并在真实工作台照片的分拣任务中系统测试20类攻击。结果显示GPT-4o、Gemini 2.5 Flash和Qwen3-VL-32B攻击成功率分别为27.0%、29.4%和5.0%,简单的提示防御、二阶段验证和文本遮罩可显著降险。

Nonvisual Classification of Ground-Condition by Artificial Proprioception in an Amoeba-Inspired Autonomous Walking Robot Figure 1
2026-08-07cs.RO

Nonvisual Classification of Ground-Condition by Artificial Proprioception in an Amoeba-Inspired Autonomous Walking Robot

Hyoto Yamaguchi, Zenji Yatabe, Seiya Kasai

RCIQE and Graduate School of IST, Hokkaido University, a commercially available small micro-controller, although

2026-08-07机器人

针对小型腿式机器人在低可见环境中难以依赖视觉、且算力受限的问题,本文在仿变形虫四足机器人上结合三轴加速度、足底压力与储备池计算实现非视觉地面识别。核心发现是足压多模态信息显著优于单纯加速度:单步准确率由约54%升至82%,10步历史离线达97%,精简到FR2、FL1和AccY后现场平均约79%,并可据此切换平地/崎岖地步态,但现场判别耗时仍较长。

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment Figure 1
2026-08-07cs.RO

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

JoyAI-RA Team

Joy Future Academy, JD

2026-08-07机器人

针对机器人示教稀缺、人体视频/仿真/机器人数据动作标注不一致且直接混训易负迁移的问题,JoyAI-RA 0.5提出VLWA框架,用隐式潜在动作从视觉转移学习动力学,用显式规范动作对齐可标注轨迹,并结合内外环强化学习适配。AgiBot真实平台实验显示其在已见任务和未见变化上表现较强,且随人体第一视角预训练数据规模增大持续提升,可能主要来自scaling与数据对齐共同作用。

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots Figure 1
2026-08-07cs.RO

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

and in part by the Self-Planned Task of State Key Laboratory of Robotics and Systems (HIT) under Grant 2023FRFK01001.

2026-08-07机器人视觉语言安全鲁棒

KILVO针对人形机器人在复杂地形、动态步态和传感器退化下里程计易漂移或失效的问题,将关节编码器、IMU、LiDAR与相机纳入异步-顺序混合ESIKF,并复用运动学、惯性和地图线索估计接触状态以减少额外硬件依赖。实验覆盖公开数据集、真实机器人、多步态和传感器故障场景,显示其可实现1 kHz状态输出,并在精度、效率和失效鲁棒性上优于或接近现有融合方法。

Transcutaneous Spinal Cord Stimulation Disrupts Conscious Ankle Proprioception and Produces a More Constrained Locomotor Pattern in Unimpaired Adults Figure 1
2026-08-07q-bio.NC

Transcutaneous Spinal Cord Stimulation Disrupts Conscious Ankle Proprioception and Produces a More Constrained Locomotor Pattern in Unimpaired Adults

Christopher A. Johnson, Andria J. Farrens, Parastoo Ali Pour, Arjan Gillan, Hui Zhong, David J. Reinkensmeyer, Alexandra S. Voloshina

mediolateral center-of-mass (CoM) excursion measures., approved by the University of California, Irvine Institutional

2026-08-07机器人

本文关注 tSCS 作为脊髓神经调控手段时,是否会在改善运动输出之外改变本体感觉与步态控制。研究用机器人化 Crisscross 踝关节定位评估结合跑台步态分析,显示急性刺激会显著增加踝本体感觉误差、但不改变背屈力量,并使步态更窄、质心侧向摆动更受限;持续带刺激训练后,本体感觉误差下降且停刺激后仍保留,提示神经系统可适应被扰动的传入输入。

JTA: Joint Testability Architecture for Scenario-Based Validation of Safety-Critical Software Figure 1
2026-08-07cs.SE

JTA: Joint Testability Architecture for Scenario-Based Validation of Safety-Critical Software

Wenyao Xue, Jiandi Wang, Yichen Wang

Beihang University, Beijing, China

2026-08-07安全鲁棒

这篇论文针对安全关键软件场景验证中“有测试脚本但未必能充分验证”的问题,提出 JTA,把场景、测试系统和被测系统作为联合对象,用可控性、可观测性和可隔离性分析验证能力,并通过场景契约、能力评估和三类桥接设计定位盲区。ArduPilot 示例显示,链路丢失验证较成熟,而状态估计异常因证据对齐和归因语义较弱仍更难验证。

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations Figure 1
2026-08-07cs.RO

Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations

He Jiang, Jingtian Yan, Yulun Zhang, Yimin Tang, Tanishq Duhan, Rishi Veerapaneni, Guillaume Sartoretti, Jiaoyang Li

2026-08-07强化学习安全鲁棒

面向仓储等高密度终身多智能体路径规划,论文指出常见学习方法忽略安全间距与原地旋转会放大执行落差,并提出 LMAPF-R2 与 SJRL:用 Causal PIBT 为神经策略做单步搜索避碰,同时联合学习局部智能体策略和全局边代价引导。实验显示其在多种高密度地图上优于 Causal-PIBT,并在 8 台实体机器人加 248 台虚拟机器人的混合仓库中验证。

PathCover: A Fast Convex Decomposition along a Path via Randomized Iterative Space Partitioning (RISP) on Point Clouds Figure 1
2026-08-07cs.RO

PathCover: A Fast Convex Decomposition along a Path via Randomized Iterative Space Partitioning (RISP) on Point Clouds

Kunal S. Narkhede, Abhijeet M. Kulkarni, Guoquan Huang, Ioannis Poulakakis

School of Mechanical Engineering, National Technical University of Athens, Greece, HERON–Center

2026-08-07优化算法三维

本文针对机器人实时导航中安全走廊生成难以跟上传感器频率的问题,提出 PathCover:用随机迭代空间划分直接在点云上构造无碰撞凸多面体,并沿参考路径形成重叠走廊。作者给出有限终止与路径覆盖证明,RISP 在概率消除条件下具期望线性时间;合成、真实 LiDAR、四旋翼仿真和四足机器人实验显示其较现有方法快一个数量级,但走廊更保守。

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models Figure 1
2026-08-07cs.RO

ARGUS: Aligning Robot Scene Geometry Under Shifting Views with Large 3D Vision Models

Rishik Sathua, Haonan Chen, Katherine Driggs-Campbell

University of Illinois at Urbana-Champaign, Harvard University

2026-08-07机器人视觉感知三维

机器人视觉模仿学习常把物体几何与相机视角绑定,导致多视角数据利用低效、换视角泛化差。ARGUS用大型3D视觉模型从RGB重建点云,经尺度恢复和机器人坐标系对齐后渲染到规范视角,再交给下游策略学习。实验显示其在固定和多变视角训练下均优于对比方法,并在多视角数据上以约4–6倍更快速度达到高成功率。

Sliding Sensors: Configurable Confidence in State Estimation for Continuum Robots Figure 1
2026-08-07cs.RO

Sliding Sensors: Configurable Confidence in State Estimation for Continuum Robots

Ella Walsh, Spencer Teetaert, Eric Diller, Timothy D. Barfoot, Jessica Burgner-Kahrs

2026-08-07机器人

连续体机器人在任务关注区域变化时,固定传感器难以保证局部状态估计置信度。论文提出将小型5-DOF电磁传感器沿机器人骨架主动滑动,并把时变测量位置纳入因子图估计,从而重配置高置信区域。实物和仿真显示传感器位置会对应不确定性收缩,往复滑动相对固定末端传感器将位置RMSE最多降8.4%、姿态RMSE降3.8%,但实验仍限于静态/准静态场景。

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation Figure 1
2026-08-07cs.RO

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

The Hong Kong University of Science and Technology, National University of Singapore, Nanyang Technological University, Wuhan University, Sun Yat-sen University, Xidian University, Southeast University

2026-08-07机器人强化学习

这篇论文针对多视角 VLA 将主视角和腕部视角并列融合、忽略腕部对接触细节更敏感的问题,提出用任务条件化接口连接全局语义与腕部历史,预测未来腕部潜变量再辅助动作生成,并用结构化 CoT 标注监督该接口。实验在 LIBERO、RoboTwin 2.0 和真实单臂/双臂任务上提升成功率,且推理无需 CoT、保持 80Hz 以上实时控制。

Unified Planning-Learning Framework for Robust UUV Navigation Under Partial Observability Figure 1
2026-08-07cs.RO

Unified Planning-Learning Framework for Robust UUV Navigation Under Partial Observability

Md Ether Deowan, Eleni Kelasidi

Department of Mechanical and Industrial Engineering, Faculty of Engineering, NTNU, Trondheim, Norway.

2026-08-07机器人规划控制安全鲁棒

面向水下机器人在声呐受限、GPS 缺失和动态障碍下的部分可观测导航问题,本文将持久占据栅格、带间隙约束的全局规划、风险感知强化学习局部控制和行为树蒸馏统一到观察-only流程中,并用潜在状态不确定性调节监督强度。Isaac Sim 多种子评测显示,其相较 BT-only 和标准 RL 基线在动态场景中提升安全性与鲁棒性,但真实水下部署效果文中未充分说明。

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection Figure 1
2026-08-07cs.CV

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng

Western Australia Machine Intelligence Group Pty Ltd, Department of Computer Science and Software Engineering, School of Electrical Engineering, Computing and Mathematical Sciences, Western Australia Machine Intelligence Group Pty Ltd Nedlands WA Australia, Department of Computer Science and Software Engineering The University of Western Australia Crawley WA Australia, School of Electrical Engineering, Computing and Mathematical Sciences Curtin University Bentley WA Australia

2026-08-07视觉语言视觉感知数据集/基准

面向自动驾驶和智慧城市中高清三维地图的长期维护,论文指出现有 LiDAR 变化检测多停留在点级、阈值化结果,难以给出可观测性约束下的对象级更新。LoDA 将配准不确定性、局部密度和粗糙度转化为空间变化的检测限,并结合几何代理、语义实例和高度/体积/法向位移判断新增、移除、增大、减小或不变;同时发布 Subiaco 双时相多模态基准。方法在 LoDA 上达到 95.0% ACC、90.8% mF1、83.0% mIoU,在 Urb3DCD-V2 上也超过既有基线。

Failing Gracefully: Mitigating Impact of Inevitable Robot Failures Figure 1
2026-08-07cs.RO

Failing Gracefully: Mitigating Impact of Inevitable Robot Failures

Duc M. Nguyen, Saad A. Ghani, Andrew Marshall, Allison Andreyev, Gregory J. Stein, Xuesu Xiao

2026-08-07机器人

面向家用服务机器人不可避免的掉落、失控或传感/执行故障,论文主张安全规划不能只防故障,还要评估故障发生后的伤害。其核心是把机器人与人、宠物、物体的交互概率和后果严重度合成失败影响指标,并提供 MuJoCo 基准 FailBench 注入多类故障。实验表明该指标能区分不同场景和规划策略下的潜在后果,但真实部署增益仍需进一步验证。

A System for Train Condition Monitoring and Structural Health Assessment of Rail Vehicles Figure 1
2026-08-07cs.RO

A System for Train Condition Monitoring and Structural Health Assessment of Rail Vehicles

Maximilian Posner, Martin Dazer, Daniela Lauer, Robert Winkler-Höhn, Mathilde Laporte, Tobias Herrmann, Martin Köppel

2026-08-07机器人

面向干线铁路自动化中摄像头、雷达、激光难以可靠识别碰撞、碾压和结构损伤的问题,论文将加速度、应变、气压、定位等车载结构传感与AI分析结合,并在advanced Train Lab及摆锤、准静态变形、前罩冲击等实验中采集数据。结果显示该系统可生成可复现实测数据,支持事件检测、FE模型验证和状态维修,但实际运营中的量化检测精度文中未充分说明。

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances Figure 1
2026-08-07cs.RO

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

Jihoon Oh, Kento Kawaharazuka, Kei Okada

The authors are with the University of Tokyo, Japan.

2026-08-07视觉语言视觉感知

本文针对人类视频难以直接迁移到机器人、且现有可供性学习多停留在单一模态的问题,提出从第一视角视频中抽取交互区域、手部抓取和运动轨迹,并用统一的视觉语言模型 VLAff 联合建模。作者构建 EgoAffordance 大规模数据集,实验显示其在视觉可供性预测达到 SOTA,并可用于零样本操作和可供性引导的机器人学习;但具体增益可能主要来自 scaling / data。

2026-08-06

37 篇
AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance Figure 1
2026-08-06eess.IV

AI-based single-shot structured-light depth reconstruction for real-time laparoscopic surgical guidance

Wayne Wonseok Rodgers, Xiangyi Le, Seonghoon Jang, Shuwen Wei, Justin Opfermann, Michael Kam, Axel Krieger, Jin U. Kang

Johns Hopkins University, Department of Electrical and Computer Engineering, Baltimore, Maryland, United States, Johns Hopkins University, Laboratory for Computational Sensing and Robotics, Baltimore, Maryland, United States, Johns Hopkins University, Department of Mechanical Engineering, Baltimore, Maryland, United States, Johns Hopkins University, School of Medicine, Baltimore, Maryland, United States

2026-08-06三维

面向机器人腹腔镜手术中实时、可标定的术野深度感知,论文用LED照明的被动二值掩膜替代需同步的DMD多帧结构光,并以VQ-VAE离散潜表示加U-Net从单帧重建深度。在SSLE-Zivid配准的仿体数据上,MAE为3.70毫米、AbsRel为0.0326,优于MaskNet+DepthNet的MAE和通用单目模型,推理约26Hz;但验证仍限于仿体,数据规模与跨相机标定误差是主要不确定性。

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control Figure 1
2026-08-06cs.LG

Learning When to Stop: Prefix-Optimal Dynamic Diffusion Policies for Continuous Control

Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis

2026-08-06生成模型规划控制

这篇论文针对扩散策略在连续控制中每次动作都固定执行完整去噪链、推理开销高且中间动作未被优化的问题,提出 POGP:用 Bellman 式递推训练每个去噪前缀的价值函数,使中间动作可执行,并用相邻前缀价值差作为早停信号。实验在四个 MuJoCo 环境和 12 个基线中显示,其约减少 2.7 倍去噪计算,同时保持接近全链性能,并较动态扩散基线提升约 3.5% 至 4.6%。

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies Figure 1
2026-08-06cs.RO

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

2026-08-06机器人安全鲁棒

本文针对具身导航在视觉扰动下易退化、且密集 ANN 策略计算开销大的问题,提出 SpikingNav,将脉冲感知编码器与基于膜电位积分、阈值和重置的脉冲循环策略结合。结果显示其在 PointNav/ObjectNav 上保持干净场景竞争力,以更少参数和 FLOPs 将 ObjectNav 成功率从 31.05% 提至 34.12%,扰动平均成功率从 8.45% 提至 13.71%,并在 Thruster–V2 芯片上验证了感知模块部署。

Exact Model-Free Policy Iteration for Co-safe LTL Planning Figure 1
2026-08-06eess.SY

Exact Model-Free Policy Iteration for Co-safe LTL Planning

Zetong Xuan, Yu Wang

2026-08-06强化学习规划控制安全鲁棒

这篇论文针对未知随机动力学下的 co-safe LTL 规划,指出将任务转为可达性后,直接用无折扣 TD/Q-learning 会因 Bellman 方程非收缩和解不唯一而失效。核心做法是先用折扣值函数识别导致非唯一性的 clamp set,再在剩余状态上做无折扣策略评估与贪心改进。文中证明评估几乎必然收敛、策略迭代有限步到达最优,并在随机网格世界验证理论。

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation Figure 1
2026-08-06cs.RO

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

2026-08-06机器人视觉语言视觉感知三维

针对现有3D VLA数据需求高、分布外泛化弱且缺少历史记忆的问题,BridgeVLA++在BridgeVLA的2D热图对齐动作表示上加入统一时空记忆:时间记忆保留交互阶段,空间记忆恢复被遮挡几何。实验覆盖五个仿真基准和两类真实机器人,在记忆依赖任务、双臂操作与跨平台场景中取得SOTA或显著提升,同时基本保持原有样本效率和泛化能力。

Optimal Constrained sc-LTL Planning in MDPs via Switching Policies Figure 1
2026-08-06cs.RO

Optimal Constrained sc-LTL Planning in MDPs via Switching Policies

Zetong Xuan, Yu Wang

2026-08-06规划控制

这篇论文针对机器人等自治系统中“完成时序任务”和“满足概率安全约束”可能冲突的问题,研究MDP上的受约束sc-LTL规划。核心洞察是,虽然最优策略通常需随机且非马尔可夫,但可由混合、乐观和保守三类定常策略组成的切换策略达到最优。作者将问题化为扩展模型上的受约束可达性,并用线性规划求解;网格世界实验验证了任务成功率与安全约束之间的最优权衡和可计算性。

DreamWAM: Beyond RGB Future Prediction for World Action Models Figure 1
2026-08-06cs.RO

DreamWAM: Beyond RGB Future Prediction for World Action Models

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

2026-08-06强化学习

DreamWAM针对现有世界动作模型只预测RGB未来、易把动作相关状态与光照背景等干扰纠缠的问题,提出在训练中同时建模外观、运动、几何和语义未来状态,并通过共享注意力影响动作分支,部署时仍保持RGB输入。实验显示其在LIBERO小幅提升成功率,在LIBERO-Plus未见扰动和真实场景扰动下增益更明显,真实扰动平均成功率由55.6%升至74.4%。

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments Figure 1
2026-08-06cs.RO

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong

2026-08-06视觉语言

长时程具身任务中,智能体常在局部可观测下遗忘物体状态或混淆子目标进度。Mimir 的关键在于把世界记忆与任务记忆显式分离,并在每次动作前将当前目标与可回忆的物体位置、状态和证据动态绑定。实验显示其在 EB-ALFRED 与 EB-Habitat 多个骨干上稳定提升,最高成功率增益 42.5%,平均增益 23.0%,长时程子集达到 86.0%。

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3 Figure 1
2026-08-06cs.RO

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3

Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps, Fangyuan Wang, Yuhong Cao, Jiankai Sun, Ge Sun, Mac Schwager, Guillaume Sartoretti

2026-08-06模仿学习

PRIMAL3针对多机器人路径规划中瓶颈、死胡同和持续冲突下学习策略易犹豫、阻塞的问题,核心在于把地图拓扑特征、同向跟随/异向冲突双图通信、LaCAM3选择性模仿干预与带持久优先级的PIBT执行修正结合起来。实验显示其优于现有学习式MAPF基线,并可扩展到超大规模实例和真实机器人;但训练仍依赖手工拓扑特征且LaCAM3调用开销较高。

RORA: Realistic Object Reconstruction with Articulation Figure 1
2026-08-06cs.RO

RORA: Realistic Object Reconstruction with Articulation

Hyesung Lee, Youngseon Lee, Kyutae Lee, Dongjun Lee, Yongseok Lee

2026-08-06三维

RORA针对真实物体导入机器人仿真时难以同时获得高保真外观、可物理交互几何和准确关节的问题,提出从单个静态视频重建可动资产的半自动流程:用3DGS与网格混合表示,结合凸分解、人工分组和基于局部边界几何的关节候选建议。实验在PartNet-Mobility和真实物体上显示较高关节精度,并可部署到Unreal Engine与Isaac Sim进行灵巧手操作,但对细小/非凸出部件及反光透明表面仍受限。

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation Figure 1
2026-08-06cs.RO

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

2026-08-06机器人视觉感知

这篇论文针对无人机看见目标后仍难以稳定接近并可靠停下的问题,指出直接把视觉语言特征映射到动作会造成语义与控制错位。DBFly在生成航点前加入目标方向锚定、空间诊断和机动决策,并用隐式飞行走廊与终端收敛判据约束路径和停止。实验在已见、未见物体和未见场景中较SOTA平均成功率提升25.07个百分点,但具体增益中各模块贡献需看消融细节。

From Transparent Labware Segmentation to Collision Avoidance: A Real-Time Edge-Aware Perception Pipeline Figure 1
2026-08-06cs.RO

From Transparent Labware Segmentation to Collision Avoidance: A Real-Time Edge-Aware Perception Pipeline

Shijun Ding, Chen Qian, Weiwei Shang, Junlin Xiong

2026-08-06视觉感知

论文针对透明实验室玻璃器皿因折射、反光和弱纹理导致深度感知与分割不稳定、进而影响机器人避障的问题,提出利用相对可靠的边界轮廓,在实时实例分割骨干中加入轻量边缘分支、边缘引导融合和 SimAM,并构建 LabGlass-IS 数据集。模型在边界 F-score 上达 97.80,推理约 7.1 ms/帧,结合多视角质心三角化与保守包围盒后,真实机器人避障成功率为 93.3%。

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Figure 1
2026-08-06cs.RO

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

Houze Xu, Jizhong Li, Ziyi Ye

Fudan University

2026-08-06视觉语言视觉感知规划控制

这篇论文针对长程机器人任务中 VLA 只看当前观测易丢失阶段历史、跳步或重复执行的问题,提出将任务进展维护为可递归更新的显式语言记忆,并把高层 VLM 的语义状态跟踪与低层 VLA 连续控制解耦。仿真与真实机器人实验显示,该记忆机制能提高阶段成功率、减少相位混淆,并提供可解释的决策轨迹;但接触精度等低层控制失败仍无法由语言记忆弥补。

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control Figure 1
2026-08-06eess.SY

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

2026-08-06规划控制安全鲁棒

这篇论文针对安全 actor-critic 控制中安全过滤、经验回放和不确定性估计各自独立设计导致数据分布不一致的问题,提出把在线估计结果用于更新 CBF 障碍几何,并用过滤干预与估计残差共同决定回放优先级,同时让 critic 学习实际执行动作。在二维机器人避障实验中,集成方案在极端感知噪声下 5 个种子均无碰撞并到达目标,成本和障碍估计误差优于主要消融;但结论仍限于该基准,安全与收敛泛化文中未充分说明。

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations Figure 1
2026-08-06cs.RO

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations

Martin Köppel, Tobias Cronauer, Zekiye Ilknur-Öz, Sebastian Dubiel, Patrick Naumann, Philipp Neumaier

2026-08-06机器人

面向 GoA3/GoA4 自动铁路运行,论文针对多传感器标注数据在版本、溯源和合规管理上的高开销问题,提出以 GitOps、Data-as-Code、CI/CD 和静态站点生成构建轻量级标注目录,将 MARV 传感器元数据与 GitLab 中的 railLabel 标注同步校验并发布为可检索 SPA。结果显示页面加载约 138-414 ms、构建约 20-49 分钟,相比 Amundsen、DataHub、MLflow 主要降低运行时基础设施和文档漂移,但实际业务增益仍依赖具体团队流程。

A Vision-based Control Framework for Real-time Autonomous UUV Operations Figure 1
2026-08-06cs.RO

A Vision-based Control Framework for Real-time Autonomous UUV Operations

Erik Tjærand Frøland, Marco Job, Md Ether Deowan, Eleni Kelasidi

2026-08-06视觉感知规划控制

面向海水养殖网箱中 GNSS 不可用、声学定位易受鱼群和柔性网衣干扰的问题,论文将 FFT 稀疏网格深度、TRUDepth 稠密深度、相对/全局位姿估计与 wavemap 3D 建图整合为 ROS 机载实时管线,并融合 DVL 与视觉估计。合成数据和真实 UUV 网箱自主导航实验表明系统可实时运行,定位建图更稳健,但各模块对增益的具体贡献文中未充分说明。

Enabling Urgency-aware Robot Swarm Intralogistics using Smart IoT Tags Figure 1
2026-08-06cs.RO

Enabling Urgency-aware Robot Swarm Intralogistics using Smart IoT Tags

Youssef Alboraei, Murray Groves, Shane Wen, Wenda Zhao, Senhui Qiu, Mohammud J. Bocus, Robert Piechocki, Sabine Hauert, Kerstin Eder

School of Engineering Mathematics and Technology, Bristol Robotics Laboratory, University of Bristol, UK, School of Computer Science, Trustworthy Systems Laboratory, School of Electrical, Electronic and Mechanical Engineering

2026-08-06机器人

面向缺少固定自动化基础设施的仓储场景,论文指出去中心化机器人群常把货物同质化处理,难以及时服务易腐、医药等高优先级物品。其核心做法是把紧急度写入随货移动的低功耗 IoT 标签,并由机器人通过 BLE 本地读取,将紧急度与距离共同用于取货选择。实机实验中优先级对齐从 0.41 提升到 0.64,吞吐量基本持平;仿真扩展规模后,P95 延迟下降 5.2% 至 11.8%,优先级对齐提升 41.7% 至 51.6%。

A Multi-Sensor Dataset for Monitoring the Operational Environment of Rail Vehicles Figure 1
2026-08-06cs.CV

A Multi-Sensor Dataset for Monitoring the Operational Environment of Rail Vehicles

Claudio Diotallevi, Rodrigo Gudiño, Zaharia Pachalieva, Philipp Neumaier, Patrick Naumann, Erik Bochinski, Volker Eiselein, Martin Köppel

2026-08-06数据集/基准

面向GoA2到GoA4自动化铁路对实时环境感知和风险检测的需求,本文发布由DB InfraGO与understandAI构建的铁路多传感器数据集,覆盖GAF养护车和BR472通勤车的摄像头、红外、LiDAR、雷达等数据,并以3D标注投影到多模态传感器。数据集包含88.2分钟记录、21类目标和超过700万条标注,配套多级质量控制,但文中未充分说明其对下游模型性能的实际增益。

Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies Figure 1
2026-08-06cs.RO

Suppression Sticks, Locality Is Fragile: A Closed-Loop Target-and-Control Audit of Task-Vector Negation in VLA Policies

Shaoguang Wang, Weiyu Guo, Rushi Dai, Yiren Zhao, Yandong Guo, Hui Xiong

2026-08-06规划控制

面向多任务 VLA 机器人策略中“删除某个技能但不破坏其他技能”的需求,论文把任务向量减法从静态模型编辑推到闭环 rollout 审计,逐一评估目标技能和控制技能。结果显示该编辑虽可快速压制部分目标技能,但局部性很脆弱:LIBERO-Goal 中 5 个技能可分离、3 个抗拒删除、2 个导致全局崩溃,保留控制技能平均仅约 52%,说明闭环行为评估比静态损失更关键。

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors Figure 1
2026-08-06cs.CV

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors

Yueqiang Zhang, Liang Deng, Yi Zhang, Baoqiong Wang, Wenjun Chen, Shuixin Pan, Yulan Guo, Qifeng Yu

2026-08-06三维

面向机器人操作、结构监测等微小平台运动中外参标定误差容易淹没真实位移的问题,论文将6-DOF位姿估计改写为帧间图像位移与已知3D点之间的微分几何约束,在se(3)一阶近似下直接求平台运动,而非分别估计两帧绝对相机位姿。核心结果是平移外参误差一阶严格抵消,旋转外参误差有界;实验中五点、0.5像素噪声下单目约3.70 mm、10.09角秒且0.34 ms,双目约3.91 mm、10.58角秒且0.27 ms。

Overcoming Statistical Bias in Action-Controllable World Models Figure 1
2026-08-06cs.CV

Overcoming Statistical Bias in Action-Controllable World Models

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

2026-08-06强化学习规划控制

论文指出,动作可控世界模型容易利用视觉惯性和数据共现规律,即使预测视频逼真,也可能对不同动作不敏感。作者提出 CoCo,用多步反事实一致性约束逆动作、零动作回滚,并用镜像场景与动作变换约束空间等变性,同时给出 ARC、DE 和 Mini-SSMB 评测。结果显示 CoCo 降低零动作漂移,Mini-SSMB 上提升动作响应一致性,并在 VP2 视觉规划中达到 73.1% 平均成功率。

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models Figure 1
2026-08-06cs.RO

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

Nanjing University, Nanjing, China, Institute of Automation, Chinese Academy of Sciences, Beijing, China, University of Chinese Academy of Sciences, Beijing, China

2026-08-06视觉语言视觉感知

Mind-VLA针对现有3D感知VLA把整场景统一对齐、忽略语言指令目标物的问题,提出只在训练阶段用目标物三视图VAE潜变量预测和VGGT多层特征对齐来强化指令相关的3D表征,推理时不增加额外输入。345M骨干在LIBERO达93.9%、CALVIN达4.47,真实遮挡任务平均成功率54%,较最佳无指令感知对齐方法高32个百分点。

GASP: GPU-Accelerated Safe Planner for Real-Time Collision-Aware Motion Generation with Latent Trajectory Sampling Figure 1
2026-08-06cs.RO

GASP: GPU-Accelerated Safe Planner for Real-Time Collision-Aware Motion Generation with Latent Trajectory Sampling

Colin Merk, Stefanos Charalambous, Peter Dürr, Farshad Khadivar

2026-08-06规划控制安全鲁棒

面向闭环操作和强化学习中频繁变化的起终状态,GASP试图在碰撞安全与近毫秒级规划之间折中。其关键做法是用边界条件解析约束的夹持B样条固定端点导数,只学习内部控制点残差,并在GPU上并行采样、解码和碰撞验证多条候选轨迹。实验显示其成功率接近解析规划并具备碰撞感知,相比cuRobo推理更快且方差更低;但方法仍依赖机器人特定训练和静态几何碰撞表示。

Static Timing Orchestration for Tree-Structured Robot Control Firmware Figure 1
2026-08-06cs.RO

Static Timing Orchestration for Tree-Structured Robot Control Firmware

Wang Xi, Feiran Wei, Mo Deng, Weiheng Lin, Pangkit Fong, Jianping He

2026-08-06机器人规划控制

本文针对由 URDF/xacro 等结构描述生成机器人控制固件时,树形设备依赖会放大感知到决策延迟的问题,提出 FineMote:将设备逻辑对象化并拆成 Update/Handle 两阶段,利用编译期树结构静态编排执行顺序。作者证明其满足截止期与前后依赖约束,并给出树内决策延迟上界;真实控制平台实验显示时序行为和运行响应性改善,但具体增益幅度需看完整实验数据。

Retrieve in Time, Correct in Frequency Figure 1
2026-08-06cs.RO

Retrieve in Time, Correct in Frequency

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

Research Institute of Tsinghua University in Shenzhen, Everwise-Tech Co., Ltd., Tongji University, Fudan University, Tsinghua Shenzhen International Graduate School, Tsinghua University

2026-08-06机器人

这篇论文针对冻结式 VLA 在长程操作中因阶段视觉混淆和误差累积而失效的问题,提出 RTCF:先用渐进记忆对齐从成功轨迹中找出与当前执行进度一致的位置,再只在动作低频系数上施加有界残差,避免直接回放覆盖策略反应性。在 LIBERO 四套件上成功率由 86.4% 提至 88.4%,LIBERO-Long 从 61.6% 提至 68.6%,且无需训练、额外 GPU 或重复推理。

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs Figure 1
2026-08-06cs.RO

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

tion tasks and embodiments (Open X-Embodiment Collabo-, ing labeled success and failure rollouts is impractical (Gu

2026-08-06视觉语言视觉感知生成模型安全鲁棒

本文针对扩散式视觉语言动作策略在分布外任务中可能生成看似合理但缺乏视觉/语言依据的动作这一安全问题,提出 GUARD:在测试时消融 VLM 最终 KV cache 中关键视觉和语言 token,比较动作去噪响应来衡量动作是否真正依赖任务证据,并用时序分类与保形阈值给出在线告警。跨 Pi0、SmolVLA、Alpamayo-1.5 及多个基准的任务留出实验中,GUARD 在 5 个未见任务设置中 4 个 ROC-AUC 最优,平均较最强运行时监测器提升 5.73 个百分点。

SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling Figure 1
2026-08-06cs.RO

SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling

Yupu Lu, Shuang Wu, Sihan Chen, Ruihua Han, Yichen Zhang, Marcus Kalander, Jia Pan

School of Computing and Data Science, The University of Hong Kong, HKSAR, Artificial Intelligence Laboratory (Leibniz), HKSAR

2026-08-06机器人

面向长时程双臂操作中子任务标签难以同时兼顾可读性、结构化和自动校验的问题,论文提出SSC表示:用SST记录动作语法字段、条件、底盘运动和后状态场景图,并通过查询级联补全缺失信息、用四类状态转移不变量做一致性检查。在BEHAVIOR-1K的50个任务、2357个动作单元上,13个视觉语言模型被评估为校验器,结果显示部分模型可用于L3补全/验证,集成有小幅提升,规则检查还能发现单步准确率遗漏的标注异常。

SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification Figure 1
2026-08-06cs.RO

SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

2026-08-06规划控制三维安全鲁棒

这篇论文针对未知三维环境中机载有限视场传感器无法仅靠“朝前看”保证安全的问题,提出把导航建模为在线安全体积认证:先用乐观图指向目标,再用认证图限制真实执行,并把首个未认证体积转化为主动观测任务递归清除。实验在3类场景60个任务中全部到达目标,几乎不进入未认证膨胀空间,预览机制使平均任务时间降低27%,并给出实机验证。

Approximate Multi-Objective Search Under Rulebooks Figure 1
2026-08-06cs.RO

Approximate Multi-Objective Search Under Rulebooks

Omar Muhammetkulyyev, Oren Salzman, Tichakorn Wongpiromsarn

2026-08-06机器人

面向机器人规划中安全、法规、效率等目标既有层级又有不可比关系的场景,论文将 rulebooks 下的多目标搜索做近似化,提出 ε-rule-dominance 与 RA*pex,在保留规则优先级的同时用维度约简和分层闭集压缩解集。理论上保证每个 rulebook 最优解被返回解近似支配,实验显示相较精确求解可快两个数量级以上。

Design and Flight of an Ion-propelled Micro Hovercraft Leveraging Ground Proximity Effects Figure 1
2026-08-06cs.RO

Design and Flight of an Ion-propelled Micro Hovercraft Leveraging Ground Proximity Effects

C. Luke Nelson, Grant Nations, Mrinmoy Modak, Daniel S. Drew

2026-08-06机器人

面向室内微型机器人中旋翼噪声和碰撞脆弱性问题,论文探索用静音、无运动部件的电空气动力推进替代旋翼。核心洞察是把离子推进器贴近地面并配合被动裙边,将下洗气流转化为压力支撑升力。作者实测裙边几何和中心板位置后制成掌大小悬浮器,实现系留持续飞行、反复起降和无闭环的扰动恢复,效率达16 mN/W,并可额外携带约1.5克载荷。

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals Figure 1
2026-08-06cs.RO

Structured LLM Reasoning for Zero-Shot Human--Robot Coordination Under Hidden Goals

Dong Hae Mangalindan, Anand Gokhale, Francesco Bullo, Vaibhav Srivastava

the Center for Control, Dynamical Systems, and Computation, UC Santa

2026-08-06机器人

论文关注人机协作中目标信息不对称导致的零样本协调难题:机器人既要从人类动作和对话推断隐藏目标,又要保证搭建动作物理可行。其核心做法是用 Dec-POMDP 结构约束 LLM,把心智推断、层级规划、对话理解、动作验证和失败后重规划拆开。真人实验中,该方法相比无 ToM 消融和离线多智能体强化学习基线,需要更少交互步骤,并获得更高信任评分。

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration Figure 1
2026-08-06cs.RO

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

University of Southern California, Thomas Lord Department of Computer Science

2026-08-06视觉感知安全鲁棒

这篇论文针对 VLA 机器人在杂乱、光照变化、指令改写等部署分布偏移下容易失效、且现有隐藏状态风险探针依赖匹配校准数据的问题,提出 SAFECAST:用视觉与语言对比集轨迹同时增强探针训练和保形校准。实验显示其在 DROID 真实数据和 LIBERO 仿真、多种 VLM backbone 上显著提升失效检测 ROC-AUC,联合视觉-语言扰动优于单模态,并支持仿真到真实校准。

Feasibility of Embedded Photoplethysmography Sensing in Short-Duration Tactile Interactions With Pocket-Sized Robots Using IMU- and Confidence-Based Filtering Figure 1
2026-08-06cs.RO

Feasibility of Embedded Photoplethysmography Sensing in Short-Duration Tactile Interactions With Pocket-Sized Robots Using IMU- and Confidence-Based Filtering

Turjja Datta, Morten Roed Frederiksen

2026-08-06机器人

这篇论文面向儿童焦虑辅助场景中外置心率穿戴不便的问题,将 PPG 与 IMU 嵌入掌上触觉机器人 AffectaPocket,并用运动方差剔除和置信度平滑处理握持、挤压带来的伪影。26 名受试者对比腕戴参考传感器显示,过滤后 MAPE 从 29.14% 降至 22.72%,在 ±5 BPM 内达到统计等效;但短时交互和单次状态估计仍不稳定,心率区间分类仅 48%。

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation Figure 1
2026-08-06cs.RO

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

2026-08-06机器人视觉感知

针对大规模第一视角人类视频中大量样本与灵巧操作任务无关、盲目混训会引入噪声的问题,SiMDex把VLA后训练的人类数据选择建模为推荐检索,用召回、排序、重排三阶段从3200万样本中按每条机器人示范挖掘相似片段,且不改模型结构。实验在三项真实灵巧操作上用少于5%的样本将总体成功率从47.7%提升到61.1%,但Drill任务下降,说明效果依赖人类视频池覆盖度。

Interpretable Fuzzy Inference for UAV Target Tracking Using Bounding-Box Geometry Figure 1
2026-08-06cs.RO

Interpretable Fuzzy Inference for UAV Target Tracking Using Bounding-Box Geometry

Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Nicholas Edmond, Hossein Z. Saghazadeh, Olusola Odeyomi, Parham Kebria, Abdollah Homaifar

2026-08-06视觉感知学习理论

面向无人机仅凭机载视觉跟踪地面目标时的偏航控制难题,论文用 YOLO 边界框的中心、面积和长宽比构造可解释模糊推理,而非依赖重型深度模型或显式几何重建;其核心是训练集量化得到的 27 条 Takagi-Sugeno 规则。VICON 数据上 MAE 约 0.140°、±1° 内准确率 99.676%,但真实飞行泛化仍需更多说明。

Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays Figure 1
2026-08-06cs.LG

Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays

Abdul Basit Tonmoy

2026-08-06视觉感知

本文针对低成本压力阵列触觉传感器长期缺少开放词汇识别模型的问题,提出 Tactus,将32×32压力帧映射到冻结多模态文本嵌入空间,用文本查询完成物体识别而非训练闭集分类头。关键洞察是小数据下数据路径比架构更重要,传感器标定归一化、同传感器MAE预训练和抓取窗口采样带来主要增益。其在STAG 27类上top-1达0.771±0.062、top-3达0.935,基本持平或略超监督CNN基线。

Kitchen Robotic Manipulation utilizing Foundation Models Figure 1
2026-08-06cs.RO

Kitchen Robotic Manipulation utilizing Foundation Models

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

2026-08-06机器人

面向家庭厨房中杂乱、遮挡且不断变化的餐具操作场景,论文提出可替换模块的感知流水线,将开放词汇检测、多视角分割、实例级3D重建和2D-3D特征融合串联到6D位姿估计与抓取规划中。作者系统评估24种基础模型组合,最佳配置在20场景基准上ADI达89.12%,并在真实机器人上完成水槽到洗碗机转移和杯子堆叠,无需环境特定再训练。

2026-08-05

55 篇
Stochastic Multiple Shooting Trajectory Optimization via Sequential Local Policy Evaluation Figure 1
2026-08-05cs.RO

Stochastic Multiple Shooting Trajectory Optimization via Sequential Local Policy Evaluation

Ashwin Gupta, Joseph Moore

Johns Hopkins University Whiting School of Engineering

2026-08-05强化学习规划控制优化算法数据集/基准

针对 MPPI/CEM 等随机单射击轨迹优化在长时域终端约束上采样效率低、收敛困难的问题,本文把轨迹分段优化,并用局部时变反馈策略的可达/不变集合替代传统缺陷等式约束;同时从 rollout 估计近似雅可比,适配黑箱和神经网络动力学。在 cartpole 与 VTOL 后失速着陆等任务中,相比单射击基线表现出更好的样本效率和终端集合收敛。

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson Figure 1
2026-08-05cs.RO

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

2026-08-05机器人

这篇论文针对双臂模仿学习长期依赖工作站 GPU、难以真正边缘部署的问题,在 8GB Jetson Orin Nano 上实现 SO-101 双臂系统。核心洞察是零拷贝三相机感知并非为省内存,而是释放 CPU 峰值负载和尾延迟;同时将 ACT 转 TensorRT 做 FP16/INT8 推理。结果显示 ACT 在豆袋抓放中达 19/20 成功,Diffusion Policy 在参考预算下 0/10,FP16/INT8 将推理从 114ms 降至 17.9/12.7ms 且基本保留成功率。

ETA: A New Agentic Paradigm for Embodied Tasks Figure 1
2026-08-05cs.RO

ETA: A New Agentic Paradigm for Embodied Tasks

Yitong Chen, Zezheng Huai, Sixian Li, Yubang Wang, Haozhe Zhang, Yifei Zhang, Hechang Chen, Jingjing Gong, Yu-Gang Jiang, Xipeng Qiu

Shanghai Innovation Institute, Fudan University, Jilin University, Nanjing University, Zhejiang University

2026-08-05机器人

论文针对当前具身系统过度依赖端到端观测到动作模型、长程任务难以检查和控制的问题,提出 ETA:由 Planner 每次只发起一个受接口约束的工具调用,再依据世界反馈继续决策,并将轨迹沉淀为可审计经验。其开源实现 OpenETA 在不使用 VLA 或任务专用策略工具的情况下,gpt-5.6-Sol 在 130 个 LIBERO 任务上达到 Pass@5 90.0%,但真实机器人泛化增益仍需更多验证。

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning Figure 1
2026-08-05cs.RO

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

are with the National Elite Institute of Engineering, Chongqing University, Chongqing 401135, China.Tongtong Cheng and Kai Liu are with the College of Computer Science, Chongqing University, Chongqing 400044, China.Jinzhuo Peng is with the College of Mechanical and Vehicle Engineering, Chongqing University, Chongqing 400044, China.Jia Pan is with the Department of Computer Science, The University of, Hong Kong, Hong Kong, China.This work was conducted in collaboration with industry partner Chengdu

2026-08-05生成模型强化学习优化算法安全鲁棒

EvoHIL针对人类在环机器人强化学习部署后奖励分类器受场景变化失准、逐步采样动作不连贯、视觉策略对光照漂移敏感的问题,提出分阶段框架:用人工确认自演化奖励,用流匹配生成动作块,并用重光照回放做保留约束离线适应。六个真实操作任务中,其相较HIL和模仿基线提升成功率、人类标签一致性、运动平滑度和完成时间,但泛化结论主要限于受控光照变化。

Designing Social Robots for Inclusive Child Wellbeing Assessment: Insights from Communities Supporting Developmental Language Disorder and Forced Migration Figure 1
2026-08-05cs.RO

Designing Social Robots for Inclusive Child Wellbeing Assessment: Insights from Communities Supporting Developmental Language Disorder and Forced Migration

Fethiye Irmak Dogan, Yue Lou, Alva Markelius, Emma Geijer-Simpson, Gustaf Gredebäck, Tamsin Jane Ford, Ginevra Castellano, Hatice Gunes, Georgina Warner, Jenny L. Gibson

Department of Computer Science & Technology, University of Cambridge, Department of Information Technology, Uppsala University, Department of Public Health and Caring Sciences, Uppsala University, Department of Psychology, Uppsala University, Department of Psychiatry, University of Cambridge, Faculty of Education, University of Cambridge, Department of Computer Science & Technology, University of Cambridge Cambridge UK, Department of Information Technology, Uppsala University Uppsala Sweden, Department of Public Health and Caring Sciences, Uppsala University Uppsala Sweden, Department of Psychology, Uppsala University Uppsala Sweden, Department of Psychiatry, University of Cambridge Cambridge UK, Faculty of Education, University of Cambridge Cambridge UK

2026-08-05机器人

针对发育性语言障碍和强迫迁移背景儿童在传统自评问卷中面临的语言与文化障碍,本文用候选儿童-机器人互动活动作为设计探针,访谈家长和专业人员。结果提炼出机器人角色边界、互动细节、个体差异与儿童自主性四类设计要点,并指出DLD更需沟通支持与成人协助,迁移儿童更需文化语言敏感、信任建立和创伤/归属感考量。

Design and Evaluation of an AI-Enabled Cloud-Edge Architecture for Connected Precision Agriculture Farms Figure 1
2026-08-05cs.RO

Design and Evaluation of an AI-Enabled Cloud-Edge Architecture for Connected Precision Agriculture Farms

Deckshitha Angadi, Koteshwar Goud Surga, Nagaraju Lakkaraju, Naveena Budda, Vikas Agarwal, Giridhara Venkata Ram Raj Mulasa, Ravi Killamsetty, Chandrasekhara Sarma Mallubhotla, Narsimlu Kemsaram

AI, IoT and Robotics Lab (AIR Lab), UAVs Group, Autonomous Robotics Systems Limited, Hyderabad, India, Department of Microelectronics and VLSI Design, University of Hyderabad, Hyderabad, India, Department of Artificial Intelligence, ThoughtGreen Technologies Private Limited, Hyderabad, India, Department of Internet of Things, Ideabytes Software India Private Limited, Hyderabad, India, School of Computer Science, Georgia Institute of Technology, Atlanta, GA, USA, Department of Genetics and Plant Breeding, Kaveri University, Gowraram, India, Department of Artificial Intelligence, University of Malaya, Kuala Lumpur, Malaysia, diseases. For training and validation, we used publicly available, farms and remains highly labor-intensive, error-prone, and, scalable disease diagnosis [11], [12]. Deep neural networks, results are made available to farmers and agronomists through, that supports scalable analytics, farmer feedback, and timely

2026-08-05数据集/基准

针对大规模番茄田人工巡检难以及时发现病害的问题,论文提出将UAV影像、地面IoT传感器、Raspberry Pi边缘推理、Azure IoT Hub云分析和移动/网页端统一起来的云边架构。其重点不是新模型,而是多平台实时部署与数据闭环;在PlantVillage/Kaggle等数据上报告92–95%检测效果、端到端延迟低于8秒,但实地泛化和相对基线增益来源仍未充分说明。

GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation Figure 1
2026-08-05cs.RO

GORDON: Graph-based Object-centric Rewards for Decomposition of Long-Horizon Manipulation

Andrea Protopapa, Davide Buoso, Francesca Pistilli, Georgia Chalvatzaki, Giuseppe Averta

Interactive Robot Perception & Learning (PEARL) Lab, Computer Science Dept., TU Darmstadt, Germany., Robotics Institute Germany (RIG).

2026-08-05机器人强化学习

GORDON针对长时程机器人操作中奖励稀疏、人工分段成本高且像素级视频奖励易受背景和机器人运动干扰的问题,将场景表示为物体及空间关系图,用自监督GNN学习任务进展嵌入,并通过活动感知池化突出关键物体、抑制机器人运动;其奖励曲线还能自动暴露子任务边界。MAGICAL和ManiSkill3七个任务实验显示,方法提升短时程RL,并在长时程任务平均成功率达74.4%,显著高于学习式基线和手工oracle。

Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies Figure 1
2026-08-05cs.RO

Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies

Chenyi Wang, Xinkai Wang, Bokai Lin, Jialin Tian, Fucheng Zhang, Cewu Lu, Lixin Yang

2026-08-05视觉语言视觉感知强化学习三维

这篇论文针对 VLA 只学习动作标签、缺少动作如何改变三维场景的监督这一问题,提出在训练时用冻结的 Track4World 从动作对齐视频片段中提取三维运动、可见性和相机变化特征,并蒸馏到当前观测策略的 track queries 中,部署时不依赖 tracker。实验显示其在 zero-shot LIBERO-Plus 达 82.3%,RoboTwin 2.0 清洁/随机分割达 80.44%/81.48%,真实双臂任务平均成功率 67.5%。

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation Figure 1
2026-08-05cs.RO

LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation

Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing

Tianjin University, Shenzhen University of Advanced Technology, Ministry of Natural Resources Information Center, Sangfor Technologies Inc.

2026-08-05机器人强化学习

这篇论文针对世界-动作模型训练和推理开销过高的问题,认为像素级未来预测和大型视觉语言/视频骨干把容量耗在与控制弱相关的细节上。LiLa-WAM把未来状态预测与动作生成放入同一紧凑潜空间,并用视觉转移Token以特征方向表达任务,避免测试时依赖语言或目标图像。在RoboTwin 2.0的50个任务上报告90.48%成功率,并在LIBERO和真实机器人实验中与更大模型保持竞争力。

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud Figure 1
2026-08-05cs.AI

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Tianyue Zhang, Weikai Xie, Xiyuan Tan, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Ziqi Guo

2026-08-05机器人

这篇论文针对具身策略在评测、云端 RL rollout、边缘服务和机载部署中各自维护推理链路的问题,提出 PhyAI:用模型适配器保留条件、求解器和动作语义,用统一运行时共享图执行、内存、内核和并行服务。实验显示其在多种 VLA/WAM 策略上相对官方实现提速 1.40–4.65 倍,并用 control-time Roofline 指出部分任务已受环境而非推理限制。

Active Stiffness Control of a Supportive Continuum Robot Figure 1
2026-08-05cs.RO

Active Stiffness Control of a Supportive Continuum Robot

Rana Danesh, Farrokh Janabi-Sharifi, Farhad Aghili

Department of Mechanical, Industrial, and Mechatronics Engineering, Toronto Metropolitan University, Toronto, ON, Canada. b Farhad Aghili is with the Department of Mechanical, Industrial and Aerospace Engineering, Concordia University

2026-08-05机器人规划控制

针对支撑型连续体机器人被动刚度随结构固定、难以适应载荷变化的问题,论文将闭链动力学投影到满足约束的运动子空间,结合投影滑模位置控制与基于虚拟笛卡尔弹簧的主动表观刚度调节。仿真和实验证明,提高刚度增益可减少外载引起的末端偏移,并在不同构型下提升方向表观刚度和定位鲁棒性。

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions Figure 1
2026-08-05cs.RO

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

Zhenyang Feng, Unnat Jain

Zhenyang Feng and Unnat Jain are with the Department of Computer Science, University of California, Irvine.

2026-08-05机器人

论文针对VLA微调中“让语义丰富的VLM直接预测低层机器人动作”这一目标错配问题,提出UVT:用轻量多模态VAE把动作片段与LAM提取的视觉状态转移离散码融合成32维潜变量,再监督策略预测该目标并解码为动作。该方法不改架构、不加数据,在VLA-Adapter和π0.5上提升收敛、成功率与鲁棒性,LIBERO-Plus Spatial 10k步从34.0%升至81.5%,真实双臂任务也有明显增益。

Human Centric Embodied Intelligence for Soft Wearable Robotics Figure 1
2026-08-05cs.RO

Human Centric Embodied Intelligence for Soft Wearable Robotics

Rainier Natividad, Raye Chen-Hua Yeow

Department of Biomedical Engineering, National University of Singapore, collaboration, and accelerate the translation of next-generation soft wearable robots toward, Wearable robotics has matured into a principal response to human needs that fixed laboratory

2026-08-05机器人

面向康复、职业辅助和人体增强中的长期佩戴需求,本文指出软体可穿戴机器人瓶颈已从材料和驱动转向感知、智能与人体适应的整合。核心洞察是提出以人为中心的具身智能 HCEI,并用 PCAA 框架把感知、认知、驱动和增强串联起来,重排传统“先做执行器”的设计逻辑。主要结果是形成一篇叙事综述,整合软材料、传感、AI、数字孪生、临床转化和伦理监管,并给出面向个性化部署的挑战与路线图;文中未充分说明定量性能增益。

Tired Actor: Fatigue-Informed Character Control Figure 1
2026-08-05cs.RO

Tired Actor: Fatigue-Informed Character Control

Shengyuan Zhang, Xinpeng Liu, Muchun Niu, Yulong Chen, Lizhuang Ma, Yue Gao, Cewu Lu, Yong-Lu Li

2026-08-05规划控制

这篇论文针对物理角色控制中“无限体力”假设导致动作不自然的问题,引入行为能量学视角,用疲劳作为有限能量代理,并以 3CC 模型限制可用关节力矩训练 Tired Actor。结果显示,该控制器在保持较广运动覆盖的同时,可产生减小动作幅度、转弯抄近路、单腿摆动等更自然的补偿行为,并提升多样性、泛化与扰动鲁棒性;但等待恢复等策略较少出现,外域泛化和摔倒后行为仍有限。

Pivot-Centric Trajectory Prediction: Bridging Long Horizons via Dynamical Guidance Figure 1
2026-08-05cs.RO

Pivot-Centric Trajectory Prediction: Bridging Long Horizons via Dynamical Guidance

Xiucong Zhao, Jindong Tian, Hao Miao

Xi’an Jiaotong University, East China Normal University, Hong Kong Polytechnic University

2026-08-05规划控制

面向自动驾驶长时域轨迹预测中单终点指导不足、全轨迹迭代易累积误差的问题,论文提出 PCTP:先预测多尺度关键枢轴点以表达全局意图和交互,再围绕枢轴细化局部轨迹。该解码策略可作为插件接入现有模型,在 Argoverse I/II 上提升精度;结合 QCNet 时在 Argoverse II 提交时优于已发表非集成方法,且模型规模影响较小。

Principles of Robot Autonomy Figure 1
2026-08-05cs.RO

Principles of Robot Autonomy

Daniele Gammelli, Joseph Lorenzetti, Katie Luo, Gioele Zardini, Marco Pavone

This material will be published by Cambridge University Press as Principles of Robot Autonomy by Daniele Gammelli, Posted on arXiv with the written permission of Cambridge University Press. The definitive version will be published, by Cambridge University Press.

2026-08-05机器人

面向自动化与具身 AI 之间日益扩大的真实机器人需求,本文/书稿将机器人自主性定义为在不确定环境中基于感知持续决策并闭环行动的能力。核心洞察是用 See–Think–Act 统一组织传感、感知、估计、定位建图、规划、强化学习与控制,并强调模块化软件如 ROS 是落地自治栈的关键。主要结果是形成覆盖运动规划控制、感知、SLAM 与决策的系统教材和配套交互式练习;文中未充分说明新的实证性能增益。

Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation Figure 1
2026-08-05cs.RO

Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation

Quoc Cuong Ninh, Huy Xuan Pham, Anh Tung Nguyen, Dinh Hoan Trinh

2026-08-05视觉感知三维

面向车载和机器人端侧部署,论文针对激光雷达三维检测中高精度模型计算开销过大的问题,提出以多分支 Mamba 作为教师、通过框感知体素空间对齐和 Mamba 投影向轻量学生传递对象级特征。实验在 nuScenes 和真实数据上显示,学生模型在显著降低模型规模与推理延迟的同时保持接近教师的检测精度;但该蒸馏依赖训练时真实框,部署外泛化仍需进一步验证。

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution Figure 1
2026-08-05cs.RO

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo

2026-08-05强化学习

这篇论文针对动作分块 VLA 中固定执行步长导致重规划时机与关键操作阶段错位的问题,提出冻结基座模型的 BCP,将每个 chunk 的执行长度建模为连续的“继续或重规划”伯努利决策,并用轨迹级强化学习和兼顾成功率与调用成本的奖励训练。在 RoboTwin 2.0、LIBERO/PRO 和真实机器人上均提升成功率,低成功任务与真实任务增益尤其明显。

A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition Figure 1
2026-08-05cs.RO

A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition

Nitin Kumar Singh, Arie Rachmad Syulistyo, Yuichiro Tanaka, Hakaru Tamukoh

2026-08-05视觉感知

针对深度学习手语识别训练开销大、难部署到边缘设备的问题,论文用 MediaPipe 提取手部和身体关键点,再以结合深层与双向结构的混合储备计算建模时序,仅读出层用岭回归训练。在 WLASL100 上 Top-1/5/10 准确率为 61.12%、86.05%、92.56%,训练时间降至数秒;但相对增益中有多少来自架构而非关键点前端或参数规模,文中未充分说明。

SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing Figure 1
2026-08-05cs.CV

SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing

Zhijian Fang, Weicheng Zheng, Yijun Yuan, Weibang Wang, Zhuoguang Chen, Chang Sun, Junhao Huang, Kenan Li, Minghui Qin, Hang Zhao

IIIS, Tsinghua University

2026-08-05学习理论

针对现有 Transformer 单目 SLAM 要么受训练尺度限制、要么只做位姿优化而几何未同步修正的问题,SLAMFormer-∞ 用记忆条件建立可变坐标锚点,并通过 PGGO 在同一 Transformer 内联合细化长程轨迹和稠密几何。实验显示其在大规模数据集上重建质量提升、定位性能有竞争力,并能处理超过 17 km 的序列。

Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration Figure 1
2026-08-05cs.RO

Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration

Minghui Liwang, Wenhan Jia, Xinlei Yi, Wenbo Zhu, Yuhan Su, Xianbin Wang

2026-08-05规划控制三维

本文针对低空多无人机协同感知中兴趣点动态变化、突发任务和噪声/安全等社会成本难以统一优化的问题,提出 FORTUNE:将 PoI 区分为持久、可预测和突发三类,并结合 Transformer 预测、改进麻雀搜索离线路径规划与在线轨迹微调。实验称其在真实交通与合成场景中优于现有基线,体现了动态适应性和可扩展性,但具体增益中预测、启发式搜索与在线修正各自贡献仍需消融进一步说明。

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation Figure 1
2026-08-05cs.RO

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

2026-08-05机器人视觉感知

RoboReact针对类人机器人全身灵巧操作依赖昂贵示教、难以泛化的问题,提出从单帧第一视角RGB-D出发生成操作视频,再通过深度3D重建提取交互关键帧、重定向到高自由度机器人,并用物体中心在线重定位和VLM校准循环修正几何偏差。真实机器人四个长程双手任务中平均终端成功率达81.3%,优于ReKep和YOTO,且无需任务级遥操作或真人示范。

Shaping Wind-Tunnel Airflow for Unmanned Aerial Vehicles using Online Learning Figure 1
2026-08-05cs.RO

Shaping Wind-Tunnel Airflow for Unmanned Aerial Vehicles using Online Learning

Ghadeer Elmkaiel, Michael Muehlebach

Systems group at Max Planck Institute for Intelligent Systems, T¨ubingen, wise. The last motor is positioned at the center. The motors

2026-08-05生成模型

面向无人机与被动滑翔机器人测试,论文试图解决多风扇垂直风洞中气流湍流、非对称且难以重复的问题。核心做法是用低复杂度物理先验提供学习方向,并结合真实力测量在线迭代调节各风扇,无需高保真 CFD 或离线大数据训练。实验生成均匀、高斯和抛物线气流,并在约 6–7 次迭代内收敛;为滑翔设计的抛物线剖面提升了机器人飞行表现,且在关闭中央风扇时仍可工作。

PLS-Calib: A Partial Least Squares Framework for Event Camera and Odometry Calibration under Ground Motion Constraints Figure 1
2026-08-05cs.RO

PLS-Calib: A Partial Least Squares Framework for Event Camera and Odometry Calibration under Ground Motion Constraints

Guangyu Li, Xiao Li, Yujie Wu, Changshuo Wang, Prayag Tiwari, Jiang Cai, Fangwen Yu, Mingkun Xu

2026-08-05优化算法

针对地面机器人难以提供完整 6DoF 激励、事件相机与里程计外参旋转标定易退化的问题,PLS-Calib 用偏最小二乘在异步异构轨迹间建模潜在运动相关性,并结合极性感知事件表示增强圆形靶检测,给出避免 CCA 协方差奇异的闭式解。合成与真实实验显示其在受限平面运动下较 CCA 和神经基线更稳、更准。

GraspMeanFlow: SE(3)-Equivariant MeanFlow for Few-Step 6-DoF Grasp Generation Figure 1
2026-08-05cs.RO

GraspMeanFlow: SE(3)-Equivariant MeanFlow for Few-Step 6-DoF Grasp Generation

Jiyong Kwon, Yikun Bai, Amirhossein Mollaali, Guang Lin

2026-08-05生成模型

面向实时抓取中生成模型采样需多次网络评估的问题,GraspMeanFlow将MeanFlow扩展到SE(3)抓取位姿,在李群上用时间有序指数定义有限区间平均速度,并保持点云条件下的等变性;同时给出JVP与半群一致性两种训练形式。ACRONYM实验显示,单次评估即可接近基线五步EMD,少步设置下模拟抓取成功率最高提升24.3个百分点。

Learning Context-Aware Motion Priors for Humanoid Control Figure 1
2026-08-05cs.RO

Learning Context-Aware Motion Priors for Humanoid Control

Yunyang Mo, Yi Gu, Yangchen Zhou, Hanyang Cao, Renjing Xu

2026-08-05机器人规划控制

这篇论文针对通用运动先验在异构示范数据上只判断“动作是否自然”、却不判断“是否适合当前任务”的问题,提出 CMP:用高优势策略轨迹学习任务上下文与参考动作的相关性,并以示范约束稳定重加权,再训练轻量上下文适配器。实验在五个仿真人形控制任务、AMP 与 SMP 两类先验上提升性能和样本效率,并显示对参考分布失衡更稳健。

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking Figure 1
2026-08-05cs.RO

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

2026-08-05机器人视觉语言视觉感知安全鲁棒

本文针对 VLA 机器人在真实物理贴片攻击下易失效的问题,指出关键机制是动作查询对视觉区域的注意力被局部贴片劫持。作者提出 AGSD 用于暴露这种跨任务、跨架构攻击,并用 SARF 仅微调视觉编码器,通过特征锚定、动作注意力校正和语言引导几何一致性提升鲁棒性。实验显示,SARF 在 LIBERO 上将 OpenVLA 受攻失败率从 100% 降至平均 28.6%,真实 PiPER 成功率由 23.0% 提升到 65.0%,且基本保持干净任务表现。

PFM-HR: Pose Flow Matching for Humanoid Robots Figure 1
2026-08-05cs.RO

PFM-HR: Pose Flow Matching for Humanoid Robots

Yukang Gao, Yi Gu, Yangchen Zhou, Xingyu Chen, Zhaorui Wang, Fanghai Zhang, Hanyang Cao, Zhengyang Shen, Ji Ma, Runhan Zhang, Lei Han, Renjing Xu

2026-08-05机器人生成模型三维

PFM-HR针对人形机器人强化学习中姿态先验可复用但缺少关节协同变化指导、时序先验又依赖有序动作片段的问题,提出用无序大规模姿态训练的Flow Matching先验,并以去噪器Jacobian定义Pose Geometry Score来评估 rollout 中相邻姿态变化是否符合局部协方差结构。该分数冻结后调制跟踪奖励,在单动作与通用动作跟踪中提升样本效率和精度,动态和杂技类动作收益更明显。

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction Figure 1
2026-08-05cs.CV

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

2026-08-05视觉感知强化学习

本文针对母镜-子镜 ERCP 中双内镜视角不同步、非对称且无固定几何关系的问题,指出单视角或对称多视角融合难以预测协同手术未来视频。CrossScope 保留两路专家,并用角色相关的几何残差路由:母镜轨迹指导子镜运动,子镜外观仅在空间对齐有效时反向辅助母镜。论文构建同步 phantom 与真实数据基准,结果显示其在画质、结构保持、目标定位和运动一致性上优于多种视频生成基线。

Bridging Online and Offline Handwriting via Differentiable Physical Rendering Figure 1
2026-08-05cs.CV

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

2026-08-05机器人

论文针对在线轨迹方法缺少笔触纹理、离线图像方法丢失书写顺序且难以用于机器人执行的问题,提出以六参数物理笔刷模型和可微渲染器连接轨迹运动与像素外观,并结合文本到轨迹生成、风格参数估计和扩散细化形成统一框架。实验与真实机器人书法演示表明,该方法能同时生成较一致的手写图像和可执行轨迹,但物理参数仍需额外校准,长文本生成能力文中未充分说明。

Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation Figure 1
2026-08-05cs.RO

Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation

Byeong-Il Ham, Hyun-Bin Kim, Kyung-Soo Kim

2026-08-05机器人生成模型规划控制

面向人机共处场景中非冗余机械臂难以同时满足末端位姿、避障与自碰撞约束的问题,论文用 RRT/RRT* 生成可行轨迹数据训练条件扩散模型,并通过一致性蒸馏加速采样、加入关节加权 jerk 正则提升平滑性。仿真中一致性模型可在 100 ms 内生成 150 条候选轨迹,保持较高成功率,并显著降低关节与末端 jerk。

POMDPs for Autonomous Science Exploration Figure 1
2026-08-05cs.RO

POMDPs for Autonomous Science Exploration

Daniel Guirguis, Nathan Wallace, Hanna Kurniawati, Salah Sukkarieh

2026-08-05机器人

面向低带宽、高时延的行星/地质机器人探索,论文试图让机器人在传感不确定和计算受限下自主重规划。核心做法是将科学假设图嵌入 POMDP,在推断出的物理属性而非高维原始观测上分支,同时保留观测似然更新信念。实验中在扩展 RockSample 上奖励提升 18.6%、单步计算降 32.9%,在 Cuprite 高光谱任务中信息增益达最佳信息论基线的 2.5 倍。

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation Figure 1
2026-08-05cs.CV

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

2026-08-05机器人视觉感知

这篇论文针对 VLN 中“走到哪一步”和“怎么执行这一步”被统一动作监督混在一起的问题,提出 Route2Step,将语义进度跟踪与局部动作生成拆成显式接口,并用 E-SPA 从路线示范中对齐子指令与轨迹片段。结果显示在 R2R-CE 上 SR 从 48.1% 提升到 55.3%,SPL 从 43.3% 到 48.2%,且直接动作监督样本较少。

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units Figure 1
2026-08-05cs.RO

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units

Haoyu Gu, Haotian Lu, Jingrun Du, Xiao-Ping Zhang

2026-08-05机器人

论文针对手部动作常用连续参数难以按手指索引、编辑和约束解剖合法性的问题,提出 DigitCode:沿骨骼、手指、整手层级重设符号 token 的覆盖单元,并在手指 token 下叠加骨级残差。核心洞察是单元选择比量化器类型更关键;在相近码率下,误差由 HL-26 的 14.71° 降至 3.26°,且可用于畸形手指修复和机器人重定向。

Shooting for Contact: Contact-Implicit Multiple Shooting for Dynamic Motion Retargeting Figure 1
2026-08-05cs.RO

Shooting for Contact: Contact-Implicit Multiple Shooting for Dynamic Motion Retargeting

Sergio A. Esteban, Jason H. K. Siu, Derrick Mach, Junheng Li, Vince Kurtz, Joel W. Burdick, Aaron D. Ames

The authors are with the Department of Mechanical and Civil, Engineering, California Institute of Technology, Pasadena, CA, USA.

2026-08-05机器人

本文针对运动重定向常只追求运动学相似、导致接触丰富动作在机器人上动力学不可行的问题,提出将可微仿真器嵌入非线性规划的接触隐式多重射击框架,在不预设接触序列的情况下处理摩擦、碰撞、自碰和力矩限制。实验显示其生成的参考能加速模仿强化学习并降低跟踪误差,并在 Unitree G1 上实现爬行和 180 度跳转的零样本实机迁移。

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis Figure 1
2026-08-05cs.CV

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

Jiakai Lin, Zijun Li, Guoyu Lu

Jiakai Lin, Zijun Li and Guoyu Lu are with the Intelligent Vision and Sensing (IVS) Lab at Indiana University Bloomington.

2026-08-05视觉语言三维

针对根系低纹理、交叠复杂且标注数据稀缺导致三维表型分析难解释、难泛化的问题,论文把机器人三维点云的无监督 W-LBC 骨架提取与 Evidence-First 语言微调结合,用根数、长度、分枝角和密度等量化证据约束 GPT 推理。实验覆盖 12 种植物,显示该框架能生成较稳健、可解释的根系形态分析,但具体相对增益和消融贡献仍需更多细节支撑。

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces Figure 1
2026-08-05cs.RO

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

Realization of Robotic Systems Lab (RROS), University of Southern California, Los Angeles, CA, USA

2026-08-05机器人模仿学习

这篇论文针对凿削、撬动、剥离等接触丰富拆解任务中,扩散策略推理慢、动作分块又开环而难以及时响应力突变的问题,提出 DPA-FTG:高层以 5Hz 扩散模型选择潜在任务原语,低层以 60Hz 力条件循环策略实时生成轨迹,相当于把分块从动作空间移到意图空间。作者在双臂电池/柔性片材分离实验中报告其优于标准扩散策略和 RDP,但具体增益在多大程度来自层级结构、力反馈或数据设置仍需看完整实验细节。

Passively Safe Convex Guidance for Cislunar Rendezvous and Proximity Operations Figure 1
2026-08-05cs.RO

Passively Safe Convex Guidance for Cislunar Rendezvous and Proximity Operations

Ian M. Down, Connor Plaks, Matthew Bolliger, Michael Caudill

2026-08-05优化算法安全鲁棒

面向月地空间 NRHO 中通信延迟、三体非线性和导航/执行误差下的自主交会安全需求,论文将被动安全约束、Gates 机动误差的保守凸化、STM 相对运动和 SOCP 结合,避免连续凸化的复杂迭代。CAPSTONE 02 高保真闭环蒙特卡洛显示,在远月点和近月点场景均能满足接近、到达、终止和对接几何约束。

How Should Vision-Language-Action Models Use Proprioceptive State? Figure 1
2026-08-05cs.RO

How Should Vision-Language-Action Models Use Proprioceptive State?

Yiren Zhao, Ziyang Chen, Ziyang Rao, Pengteng Li, He Zhang, Weiyu Guo, Yandong Guo, Rushi Dai

2026-08-05视觉语言视觉感知

这篇论文针对 VLA 中本体状态虽被广泛使用但接入方式混乱、作用缺乏可比证据的问题,在固定骨干、数据、动作表示和评测协议下比较离散提示、VLM 前缀、动作前缀、状态专家和特征调制,并系统扫描 1 到 96 帧历史。结果显示,当前状态只在部分任务上有益,短历史的收益来自真实时间变化而非槽位增加,长原始历史会伤害性能;单帧更适合进 VLM,短历史更适合直接进动作头。

CUDA MPC: A GPU-Native Solver for Model Predictive Control Figure 1
2026-08-05cs.RO

CUDA MPC: A GPU-Native Solver for Model Predictive Control

Babak Akbari, Melissa Greeff

Robora Lab, Department of Electrical and Computer Engineering, Queen’s University, Kingston, ON, Canada

2026-08-05规划控制优化算法

针对MPC在快动态、高维模型和长预测 horizon 下在线优化过慢的问题,CudaMPC把并行ADMM、CUDA线程块映射和共享内存驻留计算一起设计,用单个融合kernel完成迭代,并以相邻块原子标志同步减少主机调度和全局内存开销。在六个非线性机器人基准中,它支持比CPU求解器长一到两个数量级的实时horizon,10智能体集中避障中28.22ms内求解并避免碰撞,而acados/CasADi未能实时可行。

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning Figure 1
2026-08-05cs.RO

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang

2026-08-05规划控制

PACE针对具身规划中推理模型先想完再执行导致机器人长时间等待的问题,提出将推理与动作执行流水线重叠的 Interleaved Think-Act,并用 Dynamic Budget Allocator 按动作执行窗口动态分配思考 token。Robotouille 上用 Qwen3-8B-AWQ 获得 10% 成功率,较 ReAct+Think 提升 67%,思考时间相对无限制推理加速 6.9 倍,并隐藏 66.8% 推理时间。

Forbidden Region Dynamic Active Constraints in Robot-Assisted Minimally Invasive Surgery Figure 1
2026-08-05cs.RO

Forbidden Region Dynamic Active Constraints in Robot-Assisted Minimally Invasive Surgery

Zejian Cui, Ferdinando Rodriguez y Baena

Imperial College London, Exhibition Road, London, SW7 2AZ, UK

2026-08-05机器人优化算法

面向微创机器人手术中软组织随呼吸变形、禁入区约束需兼顾精度、实时性和能量耗散的问题,论文提出用深度相机更新细三角网格FRDAC,并以TEASER++仿射配准和耗散控制替代简单几何约束。体外虚拟医生轨迹实验中,方法在122,806个多边形表示下以43.48Hz运行,所有试次保持预设安全距离,且相比球等简单表示更稳健、时间成本相当或更低。

A Wearable Stiffness-Rendering Haptic Device with a Honeycomb Jamming Mechanism for Bilateral Teleoperation Figure 1
2026-08-05cs.RO

A Wearable Stiffness-Rendering Haptic Device with a Honeycomb Jamming Mechanism for Bilateral Teleoperation

Thomas M. Kwok, Bohan Zhang, Wai Tuck Chow

School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore 639798, highlighted in Follmer’s user interfaces [26] and Stanley’s controllable surface [27] with

2026-08-05机器人

针对双边遥操作中传统力反馈易受时延、力/位移分离和手部外骨骼关节错位影响的问题,论文提出佩戴在拇指上的 HJ-Haptic,用蜂窝层阻塞结构直接渲染物体刚度。装置仅 20 g,可在 30 kPa 负压下将刚度从 1.15 N/mm 提升到 2.64 N/mm,并接入两指夹爪遥操作框架。三点弯曲与抓取实验显示运动、刚度渲染和交互力反馈 RMSE 较小且相关性强,但主观用户规模与复杂任务泛化仍需更多说明。

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning Figure 1
2026-08-05cs.AI

Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning

Subrat Prasad Panda, Blaise Genest, Arvind Easwaran

2026-08-05强化学习

这篇论文针对稀疏奖励、长程任务中层次强化学习需先充分探索、样本效率低的问题,提出用可更新的符号世界模型承载增量知识,高层随低层神经策略执行反馈重规划,并用 BWTS 在结构先验约束下对可能世界做规划。导航实验显示,相比非增量知识的神经符号 HRL,该方法显著提升样本效率。

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation Figure 1
2026-08-05cs.RO

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

2026-08-05机器人视觉感知生成模型规划控制

面向机器人操作世界模型,现有自然场景 VAE 难兼顾高压缩与动作可控,影响扩散模型训练和精细控制。EmbodiedVAE 将视频解耦为机械臂运动与背景潜变量,采用双编码器单解码器、非对称时空压缩和基于最优传输的运动一致性约束。实验显示其在高压缩下提升重建质量,并在动作条件控制中较先进视频 VAE 平均提高约 2dB PSNR。

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies Figure 1
2026-08-05cs.RO

ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies

Inkyu Sa, Konstantin Stulov, Rajat Bhageria

2026-08-05视觉语言视觉感知

本文针对行为克隆训练的VLA策略缺少可读进度与在线失误信号的问题,提出ValueFormer:在冻结DINOv3特征上用紧凑因果Transformer同时预测平滑MC价值和尖锐二值失败信号。关键洞察是标签形状比架构更重要,失败轨迹需保留故障前阶段进度并平滑衰减。在1427个真实双臂三明治装配回合中,价值加权训练将完成率由70%提高到85%,但n=20下统计把握有限。

DeRP: An Algorithm for Self-Assembly of Power-Delivery Networks using Recursive Branching in Information-Limited Environments Figure 1
2026-08-05cs.RO

DeRP: An Algorithm for Self-Assembly of Power-Delivery Networks using Recursive Branching in Information-Limited Environments

Mohammadali Rashidioun, Sangwoo Park, Petras Swissler

2026-08-05机器人

这篇论文针对野外分布式设备长期供电中,电池续航有限、预铺线缆成本高且全局地图常不可得的问题,提出 DeRP:机器人仅依赖局部通信和指向负载的方位感知,通过递归直线生长与局部枢轴分叉自组装供电树。其洞察是用局部枢轴近似 Steiner 分支点,换取无需全局规划的可扩展部署。仿真显示网络长度稳定在 GeoSteiner 最优的约 1.04–1.25 倍,但功率损耗低于 MST/Steiner,最多约为 Steiner 的 65%,100 个负载内完成时间呈次线性增长。

Contact-Driven Localization in a Freeform Robotic Self-Assembled Structure Figure 1
2026-08-05cs.RO

Contact-Driven Localization in a Freeform Robotic Self-Assembled Structure

Mohammadali Rashidioun, Michael Sosa, Petras Swissler

Industrial and Mechanical Engineering Department, New Jersey Institute of Technology.

2026-08-05机器人

这篇论文针对群体/模块化机器人在无外部定位设施、低成本传感条件下难以完成3D自由形态自组装的问题,提出只利用二值接触关系的定位方法:已连接的接口产生吸引,未连接但邻近的接口产生排斥,并结合 FireAntV3 的固定接口、离散翻转和高度约束收缩可行位姿。仿真中,塔形结构基线最终 RMSE 约 1.64 个机器人半径,部分配置可到 0.7;消融显示 Z 估计和全局断连排斥对精度重要,但结果仍主要限于仿真验证。

Control Barrier Functions via Minkowski Operations for Safe Navigation among Polytopes Figure 1
2026-08-05cs.RO

Control Barrier Functions via Minkowski Operations for Safe Navigation among Polytopes

Yi-Hsuan Chen, Shuo Liu, Wei Xiao, Calin Belta, Michael Otte

2026-08-05机器人规划控制安全鲁棒

论文针对多面体机器人在多面体障碍间导航时,常用 CBF 需用球/椭球等光滑近似而带来保守性的问题,提出基于 Minkowski 运算的精确 SDF 与非光滑 CBF 框架,通过成对凸规划处理无碰撞和碰撞状态,并解析推导 SDF 梯度,揭示旋转几何与非完整运动学耦合导致的局部极小。实验显示其可实现更不保守的避障、从不安全初始碰撞中恢复,并优于若干近似基线。

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles Figure 1
2026-08-05cs.RO

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles

Peter Werner, Tobia Marcucci, Daniela Rus

Massachusetts Institute of Technology Computer Science and Artificial Intelligence Laboratory, University of California Santa Barbara

2026-08-05优化算法

面向仓储、无人机和操作任务中既要避障又要最短时间的平滑运动规划,本文将时间目标和任意阶导数约束通过变量变换联合凸化,并用随时间变化的分离平面处理凸障碍,形成交替求解的双凸规划。实验显示其在无人机导航和双臂卸箱中能生成高质量轨迹,耗时接近分解式规划器,同时对差初始化更稳健。

Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study Figure 1
2026-08-05cs.RO

Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study

Elizabeth Dietrich, Hanna Krasowski, Emir Cem Gezer, Roger Skjetne, Asgeir Johan Sørensen, Murat Arcak

verify when only limited data is available due to real-world, University, wegian University of Science and Technology {emir.cem.gezer, are unavailable, and system behavior can only be observed

2026-08-05安全鲁棒

面向真实机器人在扰动和数据受限条件下仍需满足安全/任务规约的问题,本文将 pacSTL 与数据驱动可达集结合,用少量实船实验估计扰动支持并校准高保真仿真,离线生成带 PAC 保证的可达集,在线实时评估海事交通规则。仿真和硬件实验显示,该方法较 STL 与 TCPA 更早检测会遇风险、降低碰撞率,并在波浪扰动下保持约 1-2Hz 的实时监控能力。

Toward Certified Functional Safety for Industrial Humanoid Robots: The Fail-Passive Gap and a Feasibility Study Figure 1
2026-08-05cs.RO

Toward Certified Functional Safety for Industrial Humanoid Robots: The Fail-Passive Gap and a Feasibility Study

Caiwu Ding, Tao Cui, Lingyun Wang, Chengtao Wen

2026-08-05机器人安全鲁棒

这篇论文针对工业人形机器人难以按现有功能安全标准认证的问题,指出关键不在运动能力,而在双足机器人断电会跌倒,传统 fail-passive 安全假设失效。作者用光幕、急停、安全 PLC 和无线 PROFIsafe 构成可量化外部安全链,把不可认证部分精确定位到机器人侧“受控停稳”反应链,并在 Unitree G1 单元中验证时延预算与安全边界;结果表明方案能标准化接口和暴露缺口,但并未实现端到端 PL e / SIL 3 认证。

Semantic Haptic Feedback Enhances Dexterous Robotic Teleoperation Figure 1
2026-08-05cs.RO

Semantic Haptic Feedback Enhances Dexterous Robotic Teleoperation

Bingjian Huang, Sahar Aseeri, Jonas Schmidtler, Joseph Zhang, Sonny Chan, Andrew Doxon, Jom Preechayasomboon, Evan Pezent, Alberto Rigo, Amir Memar, Nicholas Colonnese, Chase Tymms

2026-08-05机器人

针对遥操作中高保真触觉复现受传感与反馈硬件限制、还可能增加操作者负担的问题,论文提出“语义触觉”:用抽象触觉模式传达稳定抓取、滑移预警等关键状态,而非连续还原原始力觉。系统将状态分为确认与异常,并通过气动、振动腕带呈现。三项实验显示,该方法在单手任务中与视觉或感知触觉相近,但在双手任务中表现更好,降低工作负荷并提升态势感知和用户偏好。

Quo Vadis, World Modeling? Figure 1
2026-08-05cs.CV

Quo Vadis, World Modeling?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan

2026-08-05强化学习

面对真实环境交互成本高、风险大且难并行的问题,论文主张将世界模型从预测物理状态转向面向智能体的信息代理。核心洞察是按动力学、空间、执行、记忆、技能、奖励/验证六类反馈,以及推理指导、训练优化、代理-智能体共演三层作用组织设计空间;主要结果是给出综述式框架和研究路线,但未报告具体实验增益。

Light-Loco-Parkour: Versatile Perceptive Whole-Body Locomotion via Multi-Skill Distillation Figure 1
2026-08-05cs.RO

Light-Loco-Parkour: Versatile Perceptive Whole-Body Locomotion via Multi-Skill Distillation

Hongming Chen, Zhuoran Li, Hongxi Wang, Jiangpeng Hu, Ziliang Li, Peize Liu, QingRui Zhao, Xuhao Liu, Liang Pan, Ximin Lyu, Yuntao Ma, Tingxiang Fan

2026-08-05机器人

这篇论文针对人形机器人在杂乱地形中要同时感知、行走并调用手臂/躯干/膝部接触的问题,提出 LightLP:用少量种子动作扩展为地形配对参考,经多技能蒸馏和奖励学习,把行走、攀爬、下台阶、跨越等整合进单一深度感知策略。仿真与真实机器人实验显示其能在基准和未见障碍上保持较高成功率,并可零样本迁移到室内外硬件。

2026-08-04

118 篇
Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data Figure 1
2026-08-04cs.RO

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Ye Wang, Pei Lin, Xiong-Hui Chen, Haoqi Yuan, Zhixuan Liang, Yiyang Huang, Anzhe Chen, Zixing Lei, Jie Zhang, Tao Zhang, Haoyang Li, Tong Zhang, Chenxi Xiao, Ziyuan Jiao, Qin Jin

AIM3 Lab, Renmin University of China, Qwen Team, Alibaba Inc., ShanghaiTech University, Beijing Institute for General Artificial Intelligence (BIGAI), Beijing University of Aeronautics and Astronautics

2026-08-04机器人

机器人示教数据昂贵且多样性不足,限制 VLA 操作策略的泛化。Ego2Robot 的核心思路是把大规模第一视角人类操作视频经动作重定向、机器人手臂视觉合成和质量筛选,转成覆盖 15 种构型的机器人训练数据。实验表明,与真实机器人数据联合预训练可提升 OOD 泛化,尤其在视觉、构型和任务语义扰动下更明显,并在真实机器人任务中得到验证。

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs Figure 1
2026-08-04cs.RO

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su

2026-08-04强化学习

针对双臂操作中 WAM 预测未来虽可发现失败、却不足以直接替换原策略动作的问题,CoWAM 将同步、角色兼容和碰撞收敛写成协调契约,用类型化检查、事件条件验证和校准门控决定保留、改写或弃权。在八个 RoboTwin 双臂任务中,它较契约-only 选择提升 16.7 个百分点,闭环成功率较最强选择性基线提升 9.6 个百分点,且有害干预低于 1%。

Situation Aware Frontier Prioritization for Quadruped Search and Rescue Figure 1
2026-08-04cs.RO

Situation Aware Frontier Prioritization for Quadruped Search and Rescue

Kevin Farias, Santiago Martin, Barbara Flores, Vinicio Melgar, Igor Nunes, Hiago Sodre, Pablo Moraes, Ricardo B. Grando

2026-08-04机器人

面向室内搜救中四足机器人不能只追求覆盖率的问题,论文把前沿探索的候选点按信息增益、观测缺口、搜救相关性、地形惩罚和行程代价联合排序,使探索偏向更可能发现受困者的区域。Gazebo 两个场景显示,简单环境各方法接近,复杂拥挤且分支多的场景中该方法完成率和受害者找回数最高,但验证仍限于仿真。

Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? Figure 1
2026-08-04cs.RO

Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?

Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

2026-08-04机器人规划控制

本文针对机器人行为克隆中动作分块为何有效这一经验现象,系统排查时间一致性、视野缩短和表征学习等常见解释,指出关键在于非马尔可夫表达、降低累积误差以及隐式集成。实验显示,延迟单步策略和随机延迟集成可在仿真与真实任务中匹配动作分块,显式延迟策略集成还在多个场景超过原方法。

Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training Figure 1
2026-08-04cs.RO

Probabilistic Reachable-Action Verification of Visuomotor Policies via Set-Based Training

Yanliang Huang, Zhuocheng Zhang, Peng Xie, Zhen Zhang, Wenyuan Wu, Majid Khadiv, Zhuoqi Zeng, Amr Alanwar

2026-08-04机器人

针对固定相机在部署中因标定残差、安装漂移等导致视觉运动策略动作偏移的问题,论文将视觉编码器冻结,在低维瓶颈处校准相机扰动集合,并只对下游策略做 zonotope 集传播和集合训练,再用分割保形校准给出概率可达动作半径。LIBERO 操作实验显示,该方法在基本保持闭环任务能力的同时缩小动作偏移半径,优于行为克隆、观测一致性和点式对抗训练对照。

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models Figure 1
2026-08-04cs.RO

Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models

Zhaokai Yin, Zhipeng Zhang

AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University, 2Research Lab, Anyverse Dynamics, §: https://github.com/AutoLab-SAI-SJTU/GSR-ParaVLA, * Work was done during the internship at AutoLab, SAI, SJTU.

2026-08-04视觉语言视觉感知学习理论安全鲁棒

这篇论文针对VLA模型在等价改写指令下成功率大幅下降的问题,指出失败并非语义未被理解,而是视觉与语言联合编码引入特征偏移,动作策略无法稳定利用语义。作者提出GSR,用冻结T5提取任务语义并与原生视觉特征重绑定,重训动作专家;在LIBERO-Para上最高提升44.6个百分点,并提出解耦式ParaVLA,显示小模型也可获得接近无损的改写鲁棒性。

Certifying Plans under Model Mismatch: A Trilemma for Reachability from Scarce Data Figure 1
2026-08-04cs.RO

Certifying Plans under Model Mismatch: A Trilemma for Reachability from Scarce Data

Yanliang Huang, Zhen Zhang, Ahmad Hafez, Wenyuan Wu, Peng Xie, Zhuoqi Zeng, Amr Alanwar

2026-08-04机器人

这篇论文针对机器人 sim-to-real 中只有少量一步真实转移数据时,如何在执行前认证固定动作序列的安全性。核心洞察是:若计划进入未观测区域,仅靠数据无法同时保证轨迹包络正确、宽度有限且模型误差不受约束;因此提出 ForeReach,在外部给定 Lipschitz 误差界条件下构造集合包络和 zonotope 可达管。实验显示,相关位置的数据可恢复认证,而缺少支撑或误差界错误时方法会拒绝认证。

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving Figure 1
2026-08-04cs.CV

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

Ambarish Govindarajulu Kaliamurthi (San Jose State University), Kaikai Liu (San Jose State University)

2026-08-04视觉语言

MoRAL针对车端算力受限下VLM难以进行可靠度量空间推理的问题,将LiDAR距离、目标形态和雷达多普勒速度显式编码进BEV图像,把感知负担前移到输入表示,再用两阶段LoRA训练2B模型先读懂BEV词汇、再做驾驶问答推理。在nuScenes留出集上,它以远小于8B零样本基线的规模赢下八类问题中的七类,紧急制动召回率由10.8%升至47.8%,并可在8GB GPU上运行;但结果主要相对零样本基线,泛化到闭环驾驶仍文中未充分说明。

Human-Centered Reflections on Care Robots: A Comparative Study of Caregiver Perspectives Figure 1
2026-08-04cs.RO

Human-Centered Reflections on Care Robots: A Comparative Study of Caregiver Perspectives

Laura Londoño, Klaus Baumann, Abhinav Valada, Markus Langer

2026-08-04机器人

本文针对护理机器人研究中过度依赖单一文化与单一任务场景的问题,比较美国、墨西哥、智利298名护理者对运送物资、上床辅助、生命体征监测和移动辅助四类机器人的接受度与伦理判断。核心洞察是接受度受任务性质与文化语境共同塑造:低社交、减负或体力型任务更易被接受,主要顾虑集中在可靠性、人类监督、岗位替代与患者自主性等方面。

Environmental resilience via morphological diversity within machines Figure 1
2026-08-04cs.RO

Environmental resilience via morphological diversity within machines

Alice Hein, Josh Bongard

Department of Computer Science, University of Vermont, Burlington VT & 05405, USA.

2026-08-04机器人

这篇论文针对机器人和工程系统在新环境中易失效的问题,提出“机器内部的形态多样性”可像生物体内多层级异质部件一样预训练韧性。作者用可学习弹簧连接器把不同形态的运动智能体松耦合起来,让连接器先学会调和内部扰动;结果显示,在无需额外适应的多种新环境中,由更多或更异质部件组成、且经多样性训练的集体运动更稳健。

StableMimic: Smooth Human-Like Recovery for Humanoid Motion Tracking - Learning Beyond the Tracking Distribution for Structured Post-Fall Behavior Figure 1
2026-08-04cs.RO

StableMimic: Smooth Human-Like Recovery for Humanoid Motion Tracking - Learning Beyond the Tracking Distribution for Structured Post-Fall Behavior

Weihao Wu, Ming Huang, Ruofei Liu, Jinglei Nie, Shuxiang Guo, Chunying Li

All authors are with the Southern University of Science and Technology (SUSTech), Shenzhen, China. ∗ Corresponding authors: Shuxiang Guo and Chunying Li.

2026-08-04机器人视觉感知

StableMimic针对人形机器人运动跟踪中跌倒后进入低高度、强接触状态时,单纯追踪参考会产生大幅危险修正的问题。其核心是在同一部署策略中用本体感知门控混合跟踪与恢复双专家,并用训练期扰动起身参考和隐藏后继状态目标学习无需恢复命令的类人恢复。实验中在LAFAN1舞蹈跟踪四项指标均优于五种方法,100次推倒测试全部恢复,且多数跌倒后运动与载荷指标最低。

Faster-WAM: Do World Action Models Need Deep Action Modules? Figure 1
2026-08-04cs.AI

Faster-WAM: Do World Action Models Need Deep Action Modules?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

Huawei Noah’s Ark Lab, Department of Foundation Model, 2012 Labs

2026-08-04强化学习

这篇论文针对WAM把动作模块深度绑定到视频骨干、导致推理延迟高的问题,提出DoT框架:把预训练视频Transformer作为表示枢纽,通过KV-Fusion和视频-动作RoPE对齐,让单层动作头访问30层视频骨干的信息。Faster-WAM在无额外具身预训练下,LIBERO达98.50%、RoboTwin 2.0达89.17%、LIBERO-Plus达75.0%,单次32步动作块延迟66.5 ms,比Fast-WAM快3.2倍。

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation Figure 1
2026-08-04cs.RO

ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation

Yuzhi Huang, Weijue Bu, Ziyi Xiong, Jie Wu, Fanding Huang, Jingyan Jiang, Zhi Wang

2026-08-04机器人视觉语言视觉感知

长时程机器人操作中,分块 VLA 反复重规划会丢失已完成任务证据和上一段动作的未执行延续。ChainVLA 的核心是把观察得到的进度记忆与 Motion Tail 统一为可修正执行状态,跨查询传递但仍按最新观测重生成动作。在 RMBench 达 62.8% 成功率、LIBERO 四套件达 98.8%,去掉任一状态后性能大幅下降。

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks Figure 1
2026-08-04cs.RO

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

Arnold Network-based framework for fast, scalable, and inter-, environments, reliable and scalable traversability analysis, Department of Information Engineering, University of Padova, Italy., for scalable terrain traversability analysis. Based on hand-, rection toward transparent and scalable decision-making, map the predicted semantic classes to traversability labels.

2026-08-04机器人

面向非结构化环境中机器人通行性估计的实时性与可解释性需求,TravKAN 用 Kolmogorov-Arnold Network 建模激光雷达手工特征的非线性交互,并加入反射率描述子,训练后可抽取为解析式 Lite-TravKAN。实验覆盖城市与越野公开数据集,性能优于常规深度模型、接近 XGBoost;符号版模型小于 1KB,CPU 每帧约 0.16 ms,但完整 TravKAN 推理并不快。

Residual-Based Adaptive Kalman Filtering for Legged Robot State Estimation Figure 1
2026-08-04cs.RO

Residual-Based Adaptive Kalman Filtering for Legged Robot State Estimation

Mihaela Popescu, Dennis Mronga, Shivesh Kumar, Frank Kirchner

2026-08-04机器人

这篇论文针对腿式机器人状态估计中固定卡尔曼噪声参数难以适应步态、地形和足端滑移的问题,将基于创新与残差的在线协方差自适应引入 InEKF,融合 IMU 与腿部运动学,并比较足力传感方案。实验显示仅自适应测量噪声 R 已足够,在 Unitree Go2 室内外数据上总体误差降低约 15%,小跑步态提升约 25%,且无需额外足力数据或手工调参。

TRACE: Ergodic Trajectory Optimization for Active Scene Reconstruction Figure 1
2026-08-04cs.RO

TRACE: Ergodic Trajectory Optimization for Active Scene Reconstruction

Ziyue Zheng, Linli Shi, Bingkun He, Wen Jiang, Ziyun Wang

2026-08-04规划控制优化算法三维

针对高斯泼溅主动重建中逐点选择 NBV 导致轨迹割裂、途中感知浪费且难满足动力学约束的问题,TRACE 将任务改写为遍历覆盖式轨迹优化:从在线地图的不确定性与可见性生成信息分布,并用核遍历规划、梯度流和足迹耗减联合优化可执行路径。在 Replica 八个场景上,相同 mapper 和预算下较 ActiveGS 平均提升约 1.5 dB PSNR,并展示可直接部署到四足和机械臂轨迹执行。

TS-MAMP: A Remanufactured Agricultural Robot Powered by Second-Life EV Components and NMS-Free On-Device Weed Detection Figure 1
2026-08-04cs.RO

TS-MAMP: A Remanufactured Agricultural Robot Powered by Second-Life EV Components and NMS-Free On-Device Weed Detection

Weijie Shi, Zicheng Xu, Zhenbang Cheng, Haoran Xuan, Mingbo Duan, Gan Ge

School of Mechanical and Automotive Engineering, West Anhui University, Lu'an, 237000, China, School of Automation, Nanjing University of Information Science and Technology, Nanjing, 210000, China, School of Engineering, Westlake University, Hangzhou, 310030, China, transportation, screening labor, and fabrication overhead

2026-08-04机器人视觉感知

面向小农户难以承担高成本农业机器人、退役低速电动车部件又常被低值回收的问题,TS-MAMP将筛选后的48V轮毂电机和60%–80%健康度铅酸电池重制造为可调距模块化底盘,并结合无NMS的YOLOv10n端侧除草检测。原型底盘与动力系统成本降至450美元以下、约降60%,承载≥200kg、5分钟内换模块,Jetson Nano上检测达到80.87% mAP@0.5。

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation Figure 1
2026-08-04cs.RO

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

2026-08-04机器人

这篇工作针对移动双臂操作中示教难以同时协调底盘与双臂、局部相机视野不足导致空间状态丢失的问题,提出用单一 VR 全身遥操作采集数据,并在 VLA 中加入全景专用编码器与 MoT 全景专家来融合机器人中心的全局上下文。其在 5.5 小时、800 条真实轨迹上训练,四个真实任务中阶段完成率 91.3%、端到端成功率 73.4%,明显高于仅用局部视角的基线。

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models Figure 1
2026-08-04cs.RO

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

2026-08-04视觉语言视觉感知

本文针对 VLA 在精细操作中视觉表征不够空间可靠的问题,指出具身后训练会使任务相关空间信息溢入低信息 patch,造成注意力伪影。AtVLA 通过 register token 承载全局/空间信息,并在动作不确定时用注意力定位局部区域高分辨率重编码。实验在 LIBERO、SimplerEnv 和真实单视角任务上提升成功率,LIBERO 由 94.2% 到 98.4%,真实任务由 46.5% 到 69.0%,代价约为 π0 的 1.4–1.6 倍。

Dynamic UAV-based search operations using probabilistic diffusion modeling of Man Overboard incident victims Figure 1
2026-08-04cs.RO

Dynamic UAV-based search operations using probabilistic diffusion modeling of Man Overboard incident victims

Dimosthenis Angelis, Evangelos Boukas

Technical University of Denmark, Kgs. Lyngby, Denmark, 2800, Denmark, the simulation environment and the evaluation of the methods is available on

2026-08-04生成模型

针对落水人员搜救常因响应延迟和漂移不确定性导致搜索范围迅速扩大的问题,论文将 Leeway 漂移模型与扩展卡尔曼滤波结合,在线生成随风流不确定性扩张的概率搜索椭圆,并让无人机在其中执行五类动态覆盖策略,尤其是概率引导与改进版 IPIS。仿真结果显示,在起飞延迟 20 分钟且单次检测成功率仅 30% 的设定下,IPIS 平均搜寻成功率仍超过 80%。

Toward Geometry-Scalable Whole-Body Touch for Humanoids: A 3D-Printed Conformal EIT Skin Figure 1
2026-08-04cs.RO

Toward Geometry-Scalable Whole-Body Touch for Humanoids: A 3D-Printed Conformal EIT Skin

Haofeng Chen, Carson Kohlbrenner, Jiri Kubik, Lukas Rustler, Alexander Dickhans, Karel Bartunek, Alessandro Roncone, Hyosang Lee, Matej Hoffmann

2026-08-04机器人三维

这篇论文针对仿人机器人全身触觉在大面积、曲面和机体特定几何上难以布线与复用的问题,提出一种可随几何打印的贴合式 EIT 触觉皮肤:用导电 TPU 连续感知层、低阻接触增强贴片和结构层组成传感域,再用模型化 EIT 重建接触位置。实验显示材料电阻、厚度和孔隙率显著影响灵敏度;平面与 U 形原型均能定位接触,曲面 18 个位置平均误差约 6 mm,并展示了 iCub 脸部几何适配。

TANGO-VIO: Triangulation-Aware Navigation with Guaranteed Feature-Observability for Visual-Inertial Odometry Figure 1
2026-08-04cs.RO

TANGO-VIO: Triangulation-Aware Navigation with Guaranteed Feature-Observability for Visual-Inertial Odometry

Ege C. Altunkaya, Abdülbaki Şanlan, Emre Koyuncu, İbrahim Özkol

Faculty of Aeronautics and Astronautics, Istanbul Technical University, İstanbul, Türkiye.Ege C. Altunkaya is with the Aviation Institute, Istanbul Technical, University, 34467 İstanbul, Türkiye.Hasan T. Bagci is with the Aerospace Research Center, Istanbul, Technical University, 34467 İstanbul, Türkiye.

2026-08-04机器人

这篇论文针对VIO在纯旋转、低速或低视差运动中三角化退化、特征可观性下降的问题,提出TANGO-VIO:用特征堆叠bearing矩阵的log-det信息量构造控制障碍函数,在速度命令层加入最小偏离的视差生成修正。SITL和真实飞行显示,该方法能在低视差区间维持更多新三角化与持续特征,但硬约束会带来更大轨迹和终端偏差。

Open-DiffLoco: Open-Source Differentiable Learning for Deployable Blind Quadruped Locomotion Figure 1
2026-08-04cs.RO

Open-DiffLoco: Open-Source Differentiable Learning for Deployable Blind Quadruped Locomotion

Martin Opat

University of Groningen, Netherlands

2026-08-04机器人

针对传统强化学习训练四足盲行走依赖复杂奖励且耗时的问题,Open-DiffLoco在MJX中开源实现可微仿真的SHAC流程,并加入JAVE用价值函数雅可比监督改善早期梯度训练;其关键洞察是解析梯度可减少步态奖励和参考轨迹需求。Unitree Go2实机可跟踪全向速度,RMSE低于0.2 m/s、速度超过1 m/s,并在单卡约20至60分钟内完成训练。

MANGO-Grasp: Mahalanobis Fields over Geometry-Oriented 3D Gaussians for Cross-Embodiment Dexterous Grasping Figure 1
2026-08-04cs.RO

MANGO-Grasp: Mahalanobis Fields over Geometry-Oriented 3D Gaussians for Cross-Embodiment Dexterous Grasping

Heng Zhang, Kevin Yuchen Ma, Mike Zheng Shou, Weisi Lin, Yan Wu

2026-08-04三维

针对多指灵巧手跨本体抓取中物体几何表达粗糙、手部描述缺少形态与运动耦合的问题,MANGO-Grasp用面向局部几何的3D高斯表示物体,并以形态-运动关键点描述手,在关键点与高斯基元间学习各向异性的Mahalanobis场来指导统一优化。其在CMAP和MultiGripperGrasp上较最强基线最高提升8.24个百分点,对未见SharpaWave零样本最高提升16.57个百分点,真实实验成功率为86%。

Adaptive Human-Robot Collaborative Painting Combining Preference-Based Optimization and Dynamic Motion Primitives Figure 1
2026-08-04cs.RO

Adaptive Human-Robot Collaborative Painting Combining Preference-Based Optimization and Dynamic Motion Primitives

C. Cella, M. Ristic, M. Faroni, A. M. Zanchettin, P. Rocco

2026-08-04机器人优化算法

针对人工喷涂中笨重工件带来的疲劳、姿态受限和传统机器人缺少操作者偏好反馈的问题,论文把偏好优化与改造后的动态运动基元结合,让机器人持件并按手部姿态实时调节方向,同时用 GLISp 迭代优化执行时间、响应性和旋转放大等参数。真实协作喷涂实验显示,该方法降低了操作者用力和活动范围,提升主观舒适度,且未明显牺牲喷涂质量。

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis Figure 1
2026-08-04cs.RO

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei Zhu, Qingxin Xiao, Pan Liu, Shenghui Huang, Yun Hao, Juntong Li, Qingyao Wu

2026-08-04三维

Roomer针对3D室内布局生成中常见的局部碰撞、越界、遮挡开口和阻塞通行等残余错误,主张将修复视为对象级、可验证的局部状态编辑,而非整场景重生成。其以RoState/RoReview定位责任对象,由视觉语言规划器生成StatePatch并经确定性求解与全局复核后提交;在3D-FRONT及外部生成器结果上,提升物理有效性和实用可用性,同时尽量保留原有有效区域。

FRA-NBV: A Fast and Reflectivity-Aware Next-Best-View Strategy Figure 1
2026-08-04cs.RO

FRA-NBV: A Fast and Reflectivity-Aware Next-Best-View Strategy

G. F. Preziosa, E. Setti, M. Faroni, A. M. Zanchettin, P. Rocco

2026-08-04机器人

针对工业场景中反光金属件会让低成本深度传感器产生缺测、进而削弱传统 NBV 重建的问题,FRA-NBV 从缺失深度的空间分布中在线识别疑似反光区域,并用椭球化物体估计定位其范围,再通过改变传感器入射角选择恢复视角。实验显示,在高反光物体上覆盖率较投影法最高提升31%、较熵法最高提升56%,非反光物体上性能基本相当。

World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment Figure 1
2026-08-04cs.RO

World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment

Motubrain Team

2026-08-04强化学习

这篇论文关注世界动作模型在机器人实时部署中的高延迟问题:固定动作块推理会造成卡顿、陈旧动作和块边界抖动。作者系统比较同步、纯异步、动作加权、推理期引导和前缀条件训练等策略,核心洞察是时间对齐是平滑执行的前提,错误对齐无法靠后处理弥补。实验显示,前缀条件方法在精度与平滑性间最好,动作加权更平滑但损失精度,速度引导在其平台上未能约束延迟区。

RADAR Perception for Dynamic Obstacle Avoidance onboard small-scale Quadrotor UAVs Figure 1
2026-08-04cs.RO

RADAR Perception for Dynamic Obstacle Avoidance onboard small-scale Quadrotor UAVs

Dnyandeep Mandaokar, Bernhard Rinner

Dnyandeep Mandaokar and Bernhard Rinner are with the Institute of Networked and Embedded Systems, University of Klagenfurt, 9020 Klagenfurt, Austria

2026-08-04机器人

这篇论文针对小型四旋翼在弱光、烟雾等视觉感知不可靠场景下的高速动态避障问题,提出将77–81GHz mmWave FMCW雷达、IMM轻量跟踪与控制障碍函数加速度控制结合,并从感知距离、相对速度和控制延迟推导可避障条件。系统在树莓派4B上实现约14 ms端到端延迟,在390次投掷实验中保持分米到米级位置误差,显示雷达方案具备实时机载避障可行性。

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills Figure 1
2026-08-04cs.RO

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das

KAPIL WANASKAR, San Jose State University, USA, AMITAVA DAS, Pragya Lab, BITS Pilani Goa, India, Kapil Wanaskar, San Jose State University, USA, Amitava Das, Pragya Lab, BITS Pilani Goa

2026-08-04机器人

机器人学习正分化为“冻结权重”的VLA策略与可执行、可自改进的代码技能。本文动机是厘清这两条路线及机器人技能市场的落差,核心洞察是按自改进程度重排code-as-policy,并区分“skill”的五种含义。主要结果是梳理77个代表系统、覆盖六类技术,指出真正同时具备执行反馈、技能记忆和进化搜索的闭环系统仍很少,现有商用技能多停留在静态回放。

Teleopit: A Full-Embodiment Humanoid Teleoperation System Figure 1
2026-08-04cs.RO

Teleopit: A Full-Embodiment Humanoid Teleoperation System

Bingqian Wu, Zicheng Xu, Xianghui Fan, Dayu Li, Xiangru Huang

Westlake University, Shanghai Innovation Institute

2026-08-04机器人

Teleopit针对人形遥操作数据采集中全身平衡、灵巧手连续控制与视角协同难以统一的问题,提出以VR同时获取身体、手和头部意图的完整系统:历史编码与失败回放增强全身跟踪,归一化手指方向等优化目标支持跨手型重定向且无需逐手调参。实机任务验证了全身、手和视角联动,并用96条成功示教训练ACT和GR00T,在瓶子放置任务上分别达到90.0%和95.0%成功率。

Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies Figure 1
2026-08-04cs.RO

Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies

Jiarui Yang, Yehao Lu, Yuning Su, Yufeng Xie, Yu Zhong, Haiyu Lan, Tianjing Hao, Kaixiang Lu, Peiwen Lin, Chuang Wang, Enyu Li, Junwei Liang

2026-08-04机器人

这篇论文针对多摄像头 VLA 仅拼接视角 token 时缺乏度量深度和跨视角一致性的问题,提出 MVUCF:只在训练阶段用坐标查询深度监督和预处理感知的重投影对应监督,塑形动作模块实际使用的隐藏表征,部署仍保持 RGB-only、无额外 FLOPs。结果显示其显著提升深度恢复和跨视角匹配,并在 LIBERO、LIBERO-Plus、RoboTwin 及真实人形机器人实验中带来成功率增益。

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction Figure 1
2026-08-04cs.RO

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

2026-08-04机器人

ReTouch针对灵巧手接触丰富操作中视觉难以感知局部接触、一次性触觉预测易随滑移和执行误差失效的问题,将触觉按手指与接触区域编码为结构化patch,并在动作执行中用最新触觉反馈持续修正未来触觉状态和动作块。其XHT数据集含7类真实任务900条示范,实机实验较最强基线在标准和挑战条件下平均成功率分别提升18.4和23.8个百分点。

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning Figure 1
2026-08-04cs.AI

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

2026-08-04机器人

面向只给目标外观与环境描述的空中 VLN,单机低空无人机难以同时完成全局搜索和近距避障,既有双机方案又依赖特权信息。CoNav-UAV 将高空检索者与低空执行者建模为 Stackelberg 博弈,用记忆式上下文学习更新 VLM 领航者、用 DAgger 蒸馏更新 VLA 跟随者。其在 AerialVLN 三个城市场景优于单双机基线,学习场景成功率最高提升 30.8 点,跨场景提升 9.0 点且适配数据少约 3 倍。

Hybrid Impedance-Admittance Control with Multi-Link Aerial Robot for Contact-Rich Surface Sliding Task Figure 1
2026-08-04cs.RO

Hybrid Impedance-Admittance Control with Multi-Link Aerial Robot for Contact-Rich Surface Sliding Task

Zicheng Luo, Maolin Lei, Jinjie Li, Yicheng Chen, Zicen Xiong, Moju Zhao

* Corresponding authors. All authors are with the Department of Mechanical-Engineering, The University of Tokyo, Bunkyo-ku, Tokyo 113-8656, Japan.

2026-08-04机器人规划控制

面向多连杆空中机器人在未知、不平整表面上持续接触滑动时同时需要抗扰和顺应的问题,论文利用其转子与关节两类执行源分工:转子调制实现阻抗控制以稳定质心滑动,关节角调节实现导纳行为以适应接触几何变化。实机对比实验表明,该混合策略能在未建模表面上保持接触并完成鲁棒、顺应的轨迹滑动。

A Tilt-Rotor UAV with a Gripper for Stable Contact-Based Tasks via Environmental Anchoring Figure 1
2026-08-04cs.RO

A Tilt-Rotor UAV with a Gripper for Stable Contact-Based Tasks via Environmental Anchoring

Joshua Taylor, Nursultan Imanberdiyev, Wei-Yun Yau, Guillaume Sartoretti, Efe Camci

National University of Singapore (NUS), Singapore. 2 Institute for Infocomm Research (I 2 R), A*STAR, Singapore.

2026-08-04机器人

面向树枝钻孔、传感器安装等需要接触施力的空中作业,论文将可倾转多旋翼与欠驱动绳索驱动棱柱夹爪结合,使无人机能以非零俯仰稳定悬停并锚定不规则目标。真实飞行实验显示,环境锚定相较自由飞行将位置漂移 RMSE 降低超过 95%,在有风条件下仍有效,可承受最高 75 N 纵向反作用力,且多种目标几何与姿态下漂移 RMSE 不超过 3 mm。

TWINS: A Tactile Wearable Isomorphic Arm Networked System for Contact-Rich Manipulation Learning Figure 1
2026-08-04cs.RO

TWINS: A Tactile Wearable Isomorphic Arm Networked System for Contact-Rich Manipulation Learning

Takahide Kitamura, Masaki Murooka, Natsuki Yamanobe, Yukiyasu Domae

2026-08-04机器人

面向需要手臂、胸部等身体表面参与的接触丰富操作,TWINS用与执行机器人同构的可穿戴双臂装置采集示教,并同步记录分布式触觉与关节运动,减少人机形态映射误差。作者在四类任务上训练模仿学习策略并部署到同构机器人,结果显示策略能依据身体接触事件切换阶段并完成操作,但稳定夹持仍受接触顺应性和力矩控制限制。

Bridging the Sim-to-Real Gap in Parallel-Link Leg Mechanisms via Simulator-Side Dynamics Normalization Figure 1
2026-08-04cs.RO

Bridging the Sim-to-Real Gap in Parallel-Link Leg Mechanisms via Simulator-Side Dynamics Normalization

Jinsong Hong, Jangho Kim, Jihwan Lee, Donghyun Kim, Sehoon Oh

Department of Robotics and Mechatronics Engineering, DGIST

2026-08-04机器人

这篇论文针对并联腿机构在仿真中被简化为串联树模型时产生的动力学 sim-to-real 偏差,指出仅做 Jacobian 状态和力矩映射会漏掉执行器惯量、阻尼重分布及连杆残余惯量。作者提出 S3N,在仿真端用辨识得到的执行器级和整腿频响恢复这些动力学项。实验显示,S3N-Full 在2自由度验证中将位置和力矩 RMSE 分别降低80.9%和82.1%,并在地面反力和圆周运动迁移中缩小仿真到实机差距。

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions Figure 1
2026-08-04cs.RO

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

2026-08-04机器人

这篇论文针对湿实验协议常省略常规操作、状态条件和参数,难以直接驱动机器人执行的问题,提出 ProtoAct:先把自由文本解析为监测条件和细粒度子任务,再经检错修订与 ActSchema 约束映射为 JSON 动作序列。作者还标注 BioP2E 数据集,并在七个大模型、消融、仿真和真实机器人上验证,结果显示检索、后验检查和 schema 约束均有贡献,生成子任务可支持示教采集、VLA 训练与执行。

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction Figure 1
2026-08-04cs.RO

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao Li, Qiuzhen Lin, Liang Wang, Ka-Chun Wong

2026-08-04机器人

这篇论文针对动态多智能体任务中 LLM 协调在实时性、自适应和同步依赖之间的矛盾,提出 SyncPlan:一次生成长程结构化动作链,并用显式等待原语、死锁检测和计划过期检测器在执行中按需纠偏。实验在 Overcooked 和 Honor of Kings 上显示其成功率优于既有 LLM 协调器,同时运行时间降到对比方法的 0.05% 以下,但具体收益中训练数据与 RL 微调的贡献仍需更细消融支撑。

A Forward-Inverse Dynamic Game Framework for Enhanced Multi-Agent Trajectory Planning Figure 1
2026-08-04cs.RO

A Forward-Inverse Dynamic Game Framework for Enhanced Multi-Agent Trajectory Planning

Tianle Liu, Youcheng Niu, Jing Zeng, Shuo Li, Jinming Xu

2026-08-04规划控制

针对多智能体轨迹规划中交互强度随状态变化、他人目标未知且完全理性假设不现实的问题,论文提出前向-逆向动态博弈框架:用状态相关 KL 正则在最优控制与行为先验间自适应权衡,并以最大熵 IRL 和物理规则正则从示范中估计代价参数。作者给出局部博弈良定性与权重 Lipschitz 性证明,仿真和多机器人实验显示在意图推断与轨迹精度上优于若干基线,但示范主要来自前向仿真,真实数据泛化仍有限。

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation Figure 1
2026-08-04cs.RO

AffordTrajDP: Dynamic Affordance-Guided Visuomotor Policy Learning for Robotic Manipulation

Gaoyuan Wu, Ziyu Shan, Haoyang Du, Yuyao Jiang, Ziwei Wang

Nanyang Technological University, Singapore

2026-08-04机器人强化学习

这篇论文针对机器人操作中静态 affordance 在接触后随物体运动失配、导致精密插入等任务轨迹漂移的问题,提出 AffordTrajDP:先检索语义接触锚点,再借助预测的物体 SE(3) 位姿轨迹将其传播为动态 affordance 轨迹,用时变约束条件化扩散策略。方法在 ManiSkill3 六项任务平均成功率达 70.0%,较 DP3、AffordDP 等基线提升明显,并在两种真实机械臂的多项任务和消融中验证了接触语义与轨迹传播的互补性。

Perception-and-action system for humanoid robot task execution in construction Figure 1
2026-08-04cs.RO

Perception-and-action system for humanoid robot task execution in construction

Yanxi Liu, Yizhi Liu

a Department of Civil and Environmental Engineering, Syracuse University, 158 Link Hall, Syracuse, NY 13244, USA, b Department of Civil and Environmental Engineering, Syracuse University, 151J Link Hall, Syracuse, NY 13244, USA, dominated workplaces, like those in civil and construction engineering, where they could collaborate with, This work provides an early step toward deploying humanoid collaborators in construction., environments, requiring labor-intensive tasks and posing significant, safety risks (Hu et al., 2025). According to the International Labor Or­, ganization (International Labour Organization, 2015), construction ac­, bination of rising infrastructure demands and a shortage of skilled labor, of Labor Statistics (U.S. Bureau of Labor Statistics, 2025) projects that, series of robots that collaborate with workers to perform specific tasks in, (SAM) robot has been deployed to the construction field to collaborate, labor-intensive workloads, and enhancing workplace safety. In parallel

2026-08-04机器人

面向工地高风险、劳动力紧缺且现有施工机器人多偏单任务的问题,论文提出视觉感知-动作系统,让人形机器人从工人示范中学习施工动作:Humanoid-PoseNet将人体姿态重定向为机器人可行姿态,Humanoid-ActionNet学习保持稳定的全身控制。实验中Unitree机器人完成8类施工相关动作,平均跟踪误差为82.45 mm MPJPE。

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models Figure 1
2026-08-04cs.RO

Uncovering and Mitigating Positional Blind Spots in Vision-Language-Action Models

Dongdong An, Pengjie Zhao, Yihao Huang, Wenbing Tang, Ziming He, Jiayi Zhu, Jifeng Ning, Qin Zhao

Shanghai Normal University, East China Normal University, Northwest A&F University, Xidian University

2026-08-04视觉语言视觉感知

这篇论文针对VLA机器人操作评测只看平均成功率、忽视空间位置差异的问题,提出“位置盲区”概念:无关干扰物仅因摆放位置变化就会诱发局部高失败率。方法以黑盒方式网格化工作空间,用单侧LLR检验定位高风险区域,再用这些区域的示范数据进行LoRA微调。五个VLA模型、两个基准上的实验显示盲区普遍存在,最高失败率0.58;搜索F1达0.678,针对性微调使总体失败率下降40.00%–85.19%。

Learning Smooth SE(3) Trajectories under Left-Invariant Riemannian Metrics Figure 1
2026-08-04cs.RO

Learning Smooth SE(3) Trajectories under Left-Invariant Riemannian Metrics

Yuwei Wu, Vijay Kumar

2026-08-04机器人

针对 SE(3) 刚体轨迹在一般左不变黎曼度量和任意边界条件下求解代价高、难以实时应用的问题,论文用高阶多项式参数化 body-twist,由神经网络预测部分系数和时长,其余系数解析补全以满足边界,并用欧拉-拉格朗日与度量加权损失约束平滑性。数值实验显示其轨迹接近数值优化解且推理达毫秒级,可用于运动基元生成和四旋翼轨迹细化。

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision Figure 1
2026-08-04cs.CV

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

2026-08-04视觉语言视觉感知

本文针对驾驶场景中 VLM 缺少真实单位运动理解的问题,提出用车载雷达的距离与 Doppler 信号作为免标注监督,将雷达点投影到图像并构造运动/径向速度问答来训练 STAR-VLM。实验显示其在运动分类和公制径向速度估计上达到 SOTA,并超过部分任务专用模型;但方法仍限于相对径向速度,完整速度估计尚未解决。

Rapid Embodiment Adaptation for Quadrupedal Locomotion Figure 1
2026-08-04cs.RO

Rapid Embodiment Adaptation for Quadrupedal Locomotion

Dichen Li, Bo Ai, Nico Bohlinger, Jan Peters, Hao Su, Henrik I. Christensen

Stanford University, German Research Center for AI (DFKI) & Robotics Institute Germany

2026-08-04机器人

这篇论文针对四足机器人部署时关节受限、负载变化等硬件状态未知会导致学习控制器失效的问题,提出将控制拆成跨 embodiment 策略与轻量在线适应模块,由短时交互历史显式估计关节范围缩放和躯干质量偏移。实验显示该模块约 0.4 秒内完成识别,在仿真中优于长历史隐式适应基线,并在 Unitree Go2 上支撑锁腿和 5 kg 负载下的稳定行走。

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration Figure 1
2026-08-04cs.RO

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration

Haoran Liao, Pengyue Wang, Shuoyu Chen, Kehan Cheng, Xuhang Chen, Yuhao Lin, Mu Lin, Zhizhao Liang, Xiaoyi Fan, Chengyi Xing, Dan Niu, Yi-Lin Wei, Wei-Shi Zheng

Sun Yat-sen University, Stanford University, Southeast University

2026-08-04机器人模仿学习

DynamicManip 面向动态操作中数据采集组合爆炸和低延迟控制难题,核心做法是从单条静态示范重建场景、编辑物体运动并规划机器人轨迹,合成动态示范,再用阶段感知策略自适应调整推理频率。仿真与真实实验显示平均成功率提升 18.4 个百分点、策略查询延迟降低 32.9%,但具体增益中数据扩增与策略自适应的相对贡献仍需看消融细节。

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents Figure 1
2026-08-04cs.RO

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su

2026-08-04规划控制

这篇论文指出,具身智能体频繁重规划时,上下文不断累积会让 LLM/VLA 规划调用出现长尾延迟,即使任务成功率很高也可能持续错过实时 SLO。作者提出 BRACE,把是否重规划、重规划模式、token 预算和延迟目标纳入逐次调用的预算控制,并用 E-RECAP 做代价感知的渐进 token 剪枝。实验显示在 Meta Habitat、RoboFactory 和 AirSim 上,组合方法将重规划 token 减少 62–92%,SLO 违规率从 85.5–100.0% 降至 4.7–50.0%,困难 RoboFactory 设置下达到 80.0% 成功率。

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking Figure 1
2026-08-04cs.RO

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

2026-08-04机器人视觉感知

这篇论文针对零样本人形机器人跟踪依赖海量具身动作库、且人类/重定向动作未必可由机器人稳定执行的问题,提出 GenTrack:让文本到动作生成器与跟踪器在线交替训练,用闭环物理执行反馈对生成器做相对奖励对齐,并用新生成参考扩展跟踪器覆盖,同时以锚定和回放抑制漂移。在 Unitree G1、ProtoMotions 和 SONIC 上,方法相比静态生成回放或单向过滤提升了生成动作可执行性、语义保持和零样本跟踪覆盖,尤其在分布外参考上更明显。

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them Figure 1
2026-08-04cs.RO

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

Stanford University

2026-08-04机器人

这篇论文针对VLA在插接、擦拭等接触丰富操作中易失败的问题,指出故障不只是缺少力觉,而包含流匹配训练在低噪声精细修正阶段信号不足导致的精度失败,以及力信号时序结构未被利用导致的力失败。作者提出FACT,用定向噪声调度和时间感知力注入分别处理两类问题;在五个真实任务、约2500次rollout中,平均成功率66%,高于最佳基线41%。

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space Figure 1
2026-08-04cs.RO

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E.H. Tay, Marcelo H. Ang Jr., Haiyue Zhu

2026-08-04强化学习

SG-WAM针对现有世界动作模型在像素空间预测负担重、潜空间目标又可能与动作策略表征脱节的问题,提出在策略自身表征中学习带几何约束的动作条件动态:用可学习动态 token、EMA 策略目标和几何监督共同组织 VLM 表征,并以 flow matching 生成动作。文中报告其在未用大规模具身预训练的 0.9B 模型上,LIBERO 平均成功率达 98.5%,LIBERO-Plus 达 73%,且在真实分布内外评测优于强基线。

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation Figure 1
2026-08-04cs.RO

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

2026-08-04机器人强化学习规划控制

移动操作中底盘与机械臂需在视角变化和接触扰动下协同,直接预测整段全身动作容易缺少任务空间意图且开环误差累积。DreamTrajectory将末端轨迹与动作块联合生成,并用轻量轨迹世界模型在测试时搜索、预测、打分以对齐计划与执行。在MS-HAB上成功率由32.3%提升至54.8%,真实平台三类任务由63.3%提升至90.0%。

Rake-Compress Riccati Recursions for Parallel Scenario-Tree Model Predictive Control Figure 1
2026-08-04math.OC

Rake-Compress Riccati Recursions for Parallel Scenario-Tree Model Predictive Control

João Sousa-Pinto

2026-08-04规划控制

针对场景树 MPC 中树形 Riccati 递推虽线性工作量但受树高依赖链限制、难以利用并行的问题,论文把 rake-compress 树收缩引入分支 LQR/KKT 求解,在节点与边的条件二次函数上定义可逆消元与组合。结果证明其与原 KKT 系统代数等价,在固定维度和可复用拓扑计划下每次求解保持 O(N) 工作与存储、O(log N) span,并用 JAX 实现、稠密 KKT 对比、加速器基准和自动驾驶约束例子验证。

Hermite Curves as Trajectory Priors for Vision-Language-Action Models Figure 1
2026-08-04cs.RO

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

Qi Lv, Zhao Yang, Mingyuan Yao, Yinan Shi, and Yawei Jueluo are with Jiangsu Cytoderm Intelligent Technology Co., Ltd., China, 215334.

2026-08-04视觉语言视觉感知规划控制

这篇论文针对 VLA 动作块按时间步扁平预测导致的抖动和块间不连续问题,将动作块改写为由端点位置与速度定义的分段三次 Hermite 曲线,并比较离散 token、连续 scaffold 与训练期正则三种接入方式。结果显示,仅作为辅助目标的 Hermite Regularization 最有效,在 LIBERO、LIBERO-plus 和真实机器人任务上均提升成功率,且不增加推理开销,说明轨迹先验更适合作为学习归纳偏置而非部署时硬约束。

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation Figure 1
2026-08-04cs.RO

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

Jinsong Lin, Zikang Pan, Wanhao Liu, Chi Kit Ng, Liangjing Shao, Zihang Yu, Ziyu Wang, Yin Wang, Jiaxi Wang, Jeremy Yuen-Chun Teoh, Zhiyong Xiong, Huxin Gao, Hongliang Ren

2026-08-04机器人强化学习

内镜自主导航受组织形变、遮挡和视角快速变化影响,单帧反应式策略难以可靠控制。EndoWAM将视频世界模型的中间去噪表征与动作专家共享,并用“未来目标区域”进行 grounding,以显式学习目标随时间的演化;同时构建EndoMotion多术式数据集。物理仿真实验中其平均成功率达80.2%,较最强基线高53.1个百分点,并在未见环境和目标上实现90.1%零样本成功率,7.5Hz单步去噪支持实时控制。

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning Figure 1
2026-08-04cs.RO

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning

Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger

University of Tübingen, Bosch Center for Artificial Intelligence, Coburg University, Tübingen AI Center

2026-08-04视觉感知规划控制

PRISM针对端到端自动驾驶规划只在输出端监督、隐层梯度和表示约束偏弱的问题,指出VLP的收益主要来自将模型潜变量与真实未来轨迹对齐,而非语言模型语义能力;据此用可重参数化概率潜变量和ELBO直接从GT构造深监督。在nuScenes/VAD-Tiny上,规划L2误差降约8%,碰撞率降约3%,且额外计算开销很小。

Complete Motion Planning using Workspace-Fibered Decomposition for nR-Planar Manipulator Figure 1
2026-08-04cs.RO

Complete Motion Planning using Workspace-Fibered Decomposition for nR-Planar Manipulator

Aayush Rath, Antony Thomas

2026-08-04规划控制

面向冗余平面机械臂的完备运动规划,论文针对高维构型空间分解难扩展、采样法又难证明不可行的问题,提出从低维非冗余子链的障碍约束可达工作空间出发,再沿冗余姿态纤维递归提升,并用雅可比行列式连续性保持逆解分支一致。实验显示该表示能保留无碰连通结构,并相比直接构型空间推理减少碰撞检测复杂度。

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity Figure 1
2026-08-04cs.RO

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

2026-08-04机器人

这篇论文针对多机器人深度估计中平台、环境和深度范围差异导致联邦学习退化的问题,指出真实客户端分布往往重叠而非可硬划分。FeDepth用描述符驱动的软聚类让客户端参与多个簇,并构造HPE、BMR两类非IID评测场景;实验显示其在多种深度网络上较标准FL和硬聚类FL更稳健。

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation Figure 1
2026-08-04cs.RO

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

ShanghaiTech University, Beihang University, Beijing Institute for General Artificial Intelligence, Zhejiang University

2026-08-04机器人

这篇论文针对接触丰富操作中触觉信号只在少量接触阶段真正关键、却容易被大量非接触观测淹没的问题,提出 CAAT:用接触状态显式调节视觉/触觉注意力读出,并通过动态触觉遮蔽过滤静态背景。该方法可接入 ACT、Diffusion Policy 和 π0;在 UniVTAC 上较直接融合提升 18 个百分点,真实任务平均成功率 60.0%,较最强基线高 21.1 个百分点。

Sparse Meets Dense: Correspondence Guided Robotic Manipulation with Rigid-Deformable Interactions Figure 1
2026-08-04cs.RO

Sparse Meets Dense: Correspondence Guided Robotic Manipulation with Rigid-Deformable Interactions

Ziyu Zhu, Yue Chen, Xirui Liang, Hojin Bae, Yuran Wang, Zhen Yuan, Ruihai Wu, Hao Dong

CFCS, School of Computer Science, PKU, School of EECS, PKU

2026-08-04机器人

面向挂衣、辅助穿衣等刚体与柔性体接触丰富且形变复杂的操作,论文认为单纯6D位姿或稀疏结构点难以表达任务相关接触。其核心是把交互感知的稀疏关键点与柔性物体上的稠密对应结合,用前者生成约束、后者在形变和遮挡中跟踪关键点。作者在4类仿真与真实场景中报告了更好的泛化和少样本迁移效果。

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation Figure 1
2026-08-04cs.RO

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

Savindu Dilshan Wickramasinghe (University of Moratuwa)

Department of Electronic and Telecommunication Engineering, University of Moratuwa, Department of Electronic and Telecommunication Engineering, University of Moratuwa Moratuwa Sri Lanka

2026-08-04视觉感知

VespaSeg面向机器人等受延迟和显存约束的语言指代分割场景,将任务拆成紧凑视觉语言模型先定位框、MobileSAM再出掩码,并支持缓存图像嵌入与LoRA适配。实验中Florence-2-base管线在特定RefCOCO验证协议上达73.64 mIoU、84.60 IoU@0.5,22.8 cached-query/s且约2.20GB显存;但评测仅取每条记录首个表达,和标准完整划分不可直接比较。

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation Figure 1
2026-08-04cs.RO

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

2026-08-04机器人安全鲁棒

OC-VLA++针对VLA机器人策略在少量固定相机示教下对视角变化敏感的问题,指出仅把动作表达到相机坐标系仍可能过拟合训练视角。其核心做法是用单目几何合成成对近邻视图,并约束两视图的相机系动作在机器人坐标系中等价,从动作层面监督跨视角变换。实机与仿真实验显示,它在未见视角和更大相机位姿偏移下较OC-VLA更稳,同时基本保持训练视角性能。

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA Figure 1
2026-08-04cs.RO

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

2026-08-04生成模型

这篇论文针对自动驾驶 VLA 自回归解码带来的高延迟和曝光偏差,以及从零训练扩散策略任务窄的问题,提出 WAM-Diff2:用块因果注意力和三阶段层级蒸馏,将预训练自回归驾驶通才逐步转成离散扩散模型。其核心洞察是先保留语义能力再放松因果约束,并通过跨尺度蒸馏压缩到 2B。实验覆盖理解、感知和规划,性能接近或优于自回归基线,解码加速 2.8 倍,结合 FlashInfer 与 CUDA Graphs 达 15.1 倍。

Diffusion-Based Body Schema Learning Enabling Abnormal-State Adaptation in Musculoskeletal Robots Figure 1
2026-08-04cs.RO

Diffusion-Based Body Schema Learning Enabling Abnormal-State Adaptation in Musculoskeletal Robots

Kento Kawaharazuka, Shuhei Ikemoto

The author is with the Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, 7230, Hibikino 2-4, Wakamatsu, Kitakyushu, Fukuoka, 808-0135, Japan.

2026-08-04机器人生成模型

面向肌骨机器人在肌肉断裂、执行器卡滞等异常下仍需维持身体图式一致性的需求,论文将身体图式适配表述为带梯度引导的扩散去噪过程,直接在高维传感器与执行器空间估计肌长和肌张力,而非依赖AE/VAE的低维潜空间。仿真中的二关节六肌肉模型显示,该方法在多种故障场景下无需故障标注或再训练即可保持较一致的姿态估计,并优于AE/VAE基线,但结果仍主要限于仿真验证。

VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks Figure 1
2026-08-04cs.RO

VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks

Dongfu Yin, Jinquan Zhang

2026-08-04机器人视觉语言视觉感知

这篇论文针对VLA机器人在无线传感网络边缘部署时易被物理补丁诱导注意力偏移的问题,提出“动作到视觉注意力劫持”这一机制级脆弱性,并用VASA生成可打印攻击补丁进行压力测试;防御端APFT通过只微调视觉编码器来约束空间、时间注意力和几何一致性,且不增加推理开销。实验显示,在LIBERO中OpenVLA失败率由100.0%降至25.9%,2000次真实试验中强攻击下成功率由23.0%升至67.4%。

Sampling-Based Visibility Task Planning Figure 1
2026-08-04cs.RO

Sampling-Based Visibility Task Planning

Stav Ashur, Avishai Sintov

2026-08-04规划控制

这篇论文针对相机、手电、定向天线等可见性工具的任务规划问题,指出传统 PRM/RRT 的距离度量和可达目标假设难以处理细长 FOV 与目标不可达的情形。核心创新是形式化 TVMP,并用可见性完整性树引导 VisPRM 采样、用专门 IK 让 VisRRT 主动朝目标“瞥视”。仿真和实体手电实验显示,相比改造版 PRM、RRT 和 VIR,成功率更高、运行更快。

Stress-Relief Annealing: Polynomial-Time Simulation-Free Layout Optimization for Automated Warehouses Figure 1
2026-08-04cs.MA

Stress-Relief Annealing: Polynomial-Time Simulation-Free Layout Optimization for Automated Warehouses

Xiangjie Luo, Yulun Zhang, Miyuki Koshimura, Makoto Yokoo, Jiaoyang Li

2026-08-04优化算法

面向多机器人仓库中布局优化依赖大量仿真、难以扩展的问题,论文提出 SRA:用货架需求生成逐点“压力场”预测拥堵,并以模拟退火移动货架降低峰值压力,无需多机器人仿真。实验显示其将人工布局可承载机器人数约从 175 提升到 300–350,并在单核 19 分钟内达到或超过需 64 核 25 小时、2.5 万次仿真的进化基线。

KING: Embodiment-Aware Kinematic Graph Neural Network for Unified Motion Representation of Legged and Wheeled Robots Figure 1
2026-08-04cs.RO

KING: Embodiment-Aware Kinematic Graph Neural Network for Unified Motion Representation of Legged and Wheeled Robots

Taku Okawara, Aoki Takanose, Kenji Koide, Shuji Oishi, Masashi Yokozuka

Human Factors, the National Institute of Advanced Industrial Science and

2026-08-04机器人

论文针对特征稀少环境中外感知退化、IMU 漂移而运动学里程计又难跨机器人泛化的问题,提出将轮式与足式接触运动统一解释为机械臂运动学,并用包含 URDF 几何、编码器与 IMU 信息的异构图输入 GNN。实验显示,KING 可在多种仿真实体上学习统一运动表示,对未见形态经约一分钟数据微调后适配,并在真实机器人里程计上优于模型式基线。

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment Figure 1
2026-08-04cs.RO

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

2026-08-04机器人强化学习

本文针对新型线驱并联机器人缺少本体示范数据时 VLA 难以适配的问题,尝试用仿真中的密集几何奖励对 OpenVLA-OFT 做纯强化学习引导:先用 PPO 学方向运动,再用 GRPO 扩展到目标物指令。结果显示四类方向指令成功率从 34.25% 提升到 53.50%,但目标物任务严格成功率仅 9.75%,说明方法可作为零示范本体对齐的启动阶段,尚未达到稳健操作。

FreqNav: Stage-Wise Frequency Routing for Object-Oriented Aerial Vision-Language Navigation Figure 1
2026-08-04cs.RO

FreqNav: Stage-Wise Frequency Routing for Object-Oriented Aerial Vision-Language Navigation

Yin Tang, Jiawei Ma, Jiahao Li, Hao Zhang, Zhemin Sun, Jianqiao Sun, Deyu Zhang

2026-08-04机器人视觉语言视觉感知

这篇论文针对无人机在开放场景中先搜索目标、再精确降落时感知需求变化的问题,提出将航行阶段建模为从低频空间结构到高频目标细节的偏好迁移。FreqNav通过频率Token路由、阶段依赖grounding和Diffusion Transformer,在固定计算预算下动态筛选双视角视觉信息。TravelUAV上成功率和SPL均优于强基线,并将128个视觉token压缩到50个,实现约3倍推理加速,真实无人机部署延迟为0.17秒/步。

MixedComplementarityProblems.jl: A Fast, Batched, Open-Source Interior Point Solver for Mixed Complementarity Problems Figure 1
2026-08-04cs.GT

MixedComplementarityProblems.jl: A Fast, Batched, Open-Source Interior Point Solver for Mixed Complementarity Problems

David Fridovich-Keil

2026-08-04优化算法

面向多智能体轨迹规划中需要反复求解参数化混合互补问题的瓶颈,论文提出开源 Julia 内点求解器 MixedComplementarityProblems.jl,将求解循环与线性代数后端解耦,支持批量 CPU/GPU 并行和对参数的自动微分。实验显示其可靠性接近或优于 PATH,在车道变换博弈批处理上多线程 CPU 约比顺序 PATH 快 100 倍,GPU 仅在单实例 KKT 系统足够大时占优。

Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction Figure 1
2026-08-04cs.CV

Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction

Minseong Kweon, Junaed Sattar

The authors are with the Department of Computer Science & Engineering, and the Minnesota Robotics Institute (MnRI), University of

2026-08-04三维

水下图像的散射、衰减会破坏特征匹配,使传统 SfM 初始化和 3DGS/NeRF 重建在浑浊场景中不稳定。Swimm3R 将 MASt3R-SfM 的空中几何先验经 LoRA 蒸馏到水下域,并用物理头估计介质参数、位姿和恢复点云,再以 Beta splatting 和散射感知梯度优化几何。Barbados 数据集上相对 WaterSplatting 提升 1.47 dB PSNR,定位 RRA@15/RTA@15 分别提高 2.0/2.4 个百分点。

GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors Figure 1
2026-08-04cs.RO

GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors

Jibao Yuan, Yuhui Zhao, Yinzhen Lv, Chao Xu, Shun Li, Chenxi Deng, Shaofei Chen

2026-08-04机器人

GraRe关注一个常被忽视的问题:冻结的6-DoF抓取检测器往往已生成可成功执行的候选抓取,却因置信度排序不准而被排在后面。论文将候选重排序独立出来,利用抓取属性、分层局部几何和物体上下文估计质量,再与原置信度融合排序。在GraspNet-1Billion上对三种冻结检测器均提升,Average AP最高增加13.60点,并在真实杂乱场景中验证了抓取稳定性。

VertiAKD: Adaptive Off-Road Kinodynamics on Vertically Challenging Terrain Figure 1
2026-08-04cs.RO

VertiAKD: Adaptive Off-Road Kinodynamics on Vertically Challenging Terrain

Tong Xu, Chenhui Pan, Francesco Cancelliere, Xuesu Xiao

2026-08-04机器人

面向越野机器人在陡坡、起伏和语义复杂地形中跨车型部署困难的问题,VertiAKD将车辆配置、轨迹转移与局部高程/语义特征编码到共享机动性表示,用函数编码器生成地形感知动力学先验,并用RLS在线更新而非梯度重训。实验在Verti-Bench和五种实车配置上显示,仅1分钟新数据即可将长时域预测误差较直接迁移最多降低34.52%、较基线最多降低94.43%,并支持MPPI闭环跟踪。

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking Figure 1
2026-08-04cs.RO

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking

Kilian Northoff, Mateo de Mayo, Daniel Cremers

2026-08-04视觉感知三维

Stipple针对机器人和XR中3DGS需离线SfM与长时间训练、难以实时重建的问题,将Basalt视觉惯性跟踪与基于Brush的增量高斯训练并行耦合,利用VIO提供的位姿、双目深度、关键帧筛选和回环同步来替代部分重预处理。实验在EuRoC与MSD上显示其跟踪帧率显著高于PhotoSLAM和CaRtGS,并在多数室内/头显序列取得更好重建质量,但Machine Hall场景因过密化导致画质和显存表现较弱。

Bicycle Acrobatics with Reinforcement Learning Figure 1
2026-08-04cs.RO

Bicycle Acrobatics with Reinforcement Learning

Shamel Fahmi, Arianna Ilvonen, Samuel Zapolsky, Yu-Ming Chen, Ravi Boggavarapu, Paul Drews, Ashwin Khadke, Dean Molinaro, Kaiyu Zheng, Alfred Rizzi, Gabriel Nelson

2026-08-04强化学习

这篇论文针对自行车机器人速度高、能效好但欠驱动、非完整约束导致难以越障的问题,提出用多种强化学习任务形式分别学习跳跃、翻转、抬轮、kip 等技能,并用状态触发的编排器串联专用策略。UMV 在仿真和实机中可反复跨越最高 1 米桌面、连续完成 15 次以上自主跳跃和 20 次以上组合特技,显示模块化 RL 能把轮式平台推进到接近腿式机器人的敏捷性,但多桌精确落点和策略切换仍依赖启发式边界。

Minute-Scale Training for Microrobot Navigation Figure 1
2026-08-04cs.RO

Minute-Scale Training for Microrobot Navigation

Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China, Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Hong Kong, China, Shenzhen Loop Area Institute, Shenzhen, China, Research Institute of Intelligent Control and Systems, Harbin Institute of Technology, Harbin, China, Research Centre for Deep Space Explorations, The Hong Kong Polytechnic University, Hong Kong, China, Research Institute for Advanced Manufacturing, The Hong Kong Polytechnic University, Hong Kong, China, PolyU-PUTH Medicine-Engineering Collaborative Innovation Research Laboratory, The Hong Kong Polytechnic University, Hong Kong, China

2026-08-04机器人

针对微机器人导航中深度强化学习训练常需数小时到数天、难以快速迭代的问题,论文将血管环境、动力学、类 LiDAR 感知和可行性检查全面向量化,并提出 TSR 奖励框架区分任务、塑形与正则作用。结果显示仿真吞吐约 19 万 transitions/s,策略可在 10 分钟内训练完成,并在不同微机器人和场景上零样本部署;但收益可能主要来自大规模并行仿真与数据。

GeminiPainter's sequence-formed pipeline comprised of perception, cognition, planning, and action stages Figure 1
2026-08-04cs.RO

GeminiPainter's sequence-formed pipeline comprised of perception, cognition, planning, and action stages

Miguel Altamirano Cabrera, Aleksey Fedoseev, Iana Zhura, Dzmitry Tsetserukou

Intelligent Space Robotics Lab, Skolkovo Institute of Science and Technology, Moscow, Russian Federation.

2026-08-04规划控制

该文面向实时人机互动中的机器人肖像绘制,试图克服传统边缘检测画风生硬、对噪声敏感的问题。核心做法是用 Gemini 将人脸抽象为稀疏单线稿,再结合笔画排序、轨迹平滑和 6 自由度协作臂执行。实验显示端到端延迟约 8.5 秒,主要瓶颈在 Gemini API,10 人用户评分中体验、执行感和画稿质量均高于 4.3 分。

RIT*: Riemannian Informed Trees for Cost-Adaptive Optimal Motion Planning Figure 1
2026-08-04cs.RO

RIT*: Riemannian Informed Trees for Cost-Adaptive Optimal Motion Planning

Muhayy Ud Din, Ahmed Nadar, Jan Rosell, Irfan Hussain

2026-08-04规划控制

该文针对BIT*等知情采样规划仍以欧氏距离定义采样集、近邻和边代价,难以适配各向异性或空间变化成本的问题,提出RIT*:用黎曼度量替换批量知情搜索中的关键几何原语,并通过CARM从碰撞反馈在线学习障碍邻近代价场。实验覆盖2D到14D任务,显示其在低维或常度量场景与基线相当,在高维空间变化度量下取得更低路径成本,14自由度双臂任务相对BIT*提升24.8%至63.5%。

LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts Figure 1
2026-08-04cs.RO

LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts

Boyi Liu, Qijin Li, Tianqi Yu, Qinrui Yan, Xingxing Zuo

2026-08-04机器人视觉感知

论文针对 FastSAC 在人形机器人全身跟踪中训练快但精度低于 PPO 的问题,提出 LooperMuscle:用按关节组门控的 MoE actor、与专家结构对齐的分布式 critic,以及按专家贡献路由的 replay/延迟课程,缓解单体策略和粗粒度价值分配的瓶颈。实验称其约 45 分钟收敛,较 FastSAC 奖励高 47.5%,40 序列上达到 PPO 约 72% 归一化奖励并快约 8 倍,且展示 Unitree G1 实机跟踪。

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation Figure 1
2026-08-04cs.RO

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation

Yunfan Lou, Hewen Gao, Xiyu Zhu, Zhuoran Qiao, Xuan Han, Yifan Yang, Yifan Ye, Boxian Yao, Zhibo Pang

2026-08-04机器人强化学习

这篇论文针对动态抓取中单帧观测无法判定目标运动、动作块执行又会滞后的问题,提出在 WAM 中同时加入历史光流与位移、时长、速度、加速度等运动学 token,使视觉预测获得空间运动结构,动作专家获得尺度和时序信息。模型在 DOMINO 上成功率从静态 WAM 的 22.7% 提升到 38.2%,真实 12 任务平均成功率 46.7%,较最强基线高 22.9 个百分点。

StochSIPP: Safe Interval Path Planning in Stochastic Dynamic Environments Figure 1
2026-08-04cs.RO

StochSIPP: Safe Interval Path Planning in Stochastic Dynamic Environments

Ajith Kemisetti, Shahaf S. Shperberg, Yoonchang Sung

2026-08-04规划控制安全鲁棒

这篇论文针对动态环境中障碍状态随时间不确定、单一路径规划要么冒险要么过保守的问题,提出 StochSIPP:用 SIPP 生成可证明安全的宏动作,并在动作—观测图上做有界 AND/OR 搜索,为不同局部观测结果选择策略。实验显示它在保持安全固定路径基线成功率的同时降低平均到达时间,并能处理保守方法无解的门控场景,但多状态同时观测时扩展很快。

SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction Figure 1
2026-08-04cs.RO

SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction

Feifei Liu, Zejun Wei, Haozhe Wang, Yazhi Ye, Yuying Zhang, Jintao Cheng, Chi Man Vong, Xieyuanli Chen, Xiaoyu Tang

2026-08-04规划控制

SIPTraj针对自动驾驶无高清地图场景下,BEV特征缺少显式车道/可行驶区域先验且轨迹易违背运动学约束的问题,提出分层Agent-Scene编码器逐步将智能体运动与局部BEV场景相互 grounding,并用物理引导迭代解码器把速度、加速度、曲率等状态注入内部表示。实验称其在nuScenes和Argoverse 2 Sensor上超过既有无图方法,并可媲美或优于部分有图基线。

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality Figure 1
2026-08-04cs.RO

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

§ Intelligent Space Robotics Lab, Skolkovo Institute of Science and Technology, Moscow, Russian Federation, ‡ R&D Center, MWS, Moscow, Russian Federation

2026-08-04机器人视觉语言

针对实体机器人编程成本高、试错风险大且语言控制输出不确定的问题,ORCESTRA把混合现实数字孪生作为执行前验证层,统一无代码路点示教与VLM语言指令,将模型输出转为可预览、可编辑、需确认的类型化计划。系统在Quest 3上覆盖UR3、KUKA、Scout V2和Unitree G1等异构机器人,但文中未充分说明真实部署效果和相对传统示教的量化增益。

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems Figure 1
2026-08-04cs.RO

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

School of Informatics, Computing, and Cyber Systems, Northern Arizona University, Flagstaff, USA, Department of Software Science, Tallinn University of Technology, Tallinn, Estonia

2026-08-04机器人规划控制

这篇论文关注LLM进入机器人规划控制后,提示注入可能从文本指令或感知模块转化为真实物理风险。作者以LLaMAR和AI2-THOR厨房任务系统评估单/多机器人攻击,关键洞察是共享提示结构会让污染跨智能体传播。252次实验显示攻击会降低任务完成率,并可诱导非被注入智能体执行对抗动作;按智能体分离LLM调用能减少交叉污染,但共享记忆仍可能被绕过。

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories Figure 1
2026-08-04cs.RO

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang Dong, Yi Cheng, Houde Liu

2026-08-04机器人三维

针对黏性污渍易被普通擦拭扩散、刷洗又可能损伤表面的难题,Push-Wiper将清洁重写为“先聚拢再收尾”的拓扑聚合问题,用扩散策略生成分段推动动作,并由ASPI与混合力位控制映射到任意曲面执行。实验显示其清洁得分较基线最高提升130%,且可零样本迁移到固体残渣、液体、未知黏性污渍和曲面。

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control Figure 1
2026-08-04cs.RO

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

2026-08-04机器人强化学习规划控制

SelfWAM针对现有世界动作模型的未来预测常只学到任务流程、未显式对应具体动作后果的问题,加入只供视觉分支访问的干净示范动作,并用机器人自掩码预测突出由动作引起的可见运动。实验显示其在RoboTwin 2.0和真实操作中提升策略表现、未来预测保真度与动作敏感性,同时保持快速的纯动作推理路径。

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction Figure 1
2026-08-04cs.RO

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction

Nikita Kuzmin, Yuhua Jin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Ivan Valuev, Nikolai Lutsenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

§ Intelligent Space Robotics Lab, Skolkovo Institute of Science and Technology, ‡ School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen

2026-08-04机器人

这篇论文针对无人机在人类环境中缺少空间化、可读视觉交互的问题,提出 OmniAI:在机载小屏与墙面投影间自适应切换的空中投影界面。系统用 RGB-D 与 RANSAC 在线找平面,结合可转向 MEMS 投影、语音和手势控制呈现 LLM 检索生成内容。主要结果是实现了可工作的原型和对显示表面、输入方式、组件可靠性的初步评估,但文中未充分说明相对单一显示方案的量化增益。

Staged Multi-Agent Training (SMAT) for Hip Exoskeletons: Metabolic and Biomechanical Validation of a Simulation-Trained Co-Adaptive Controller Figure 1
2026-08-04cs.RO

Staged Multi-Agent Training (SMAT) for Hip Exoskeletons: Metabolic and Biomechanical Validation of a Simulation-Trained Co-Adaptive Controller

Yifei Yuan, Jakob Wolf, Ghaith Androwis, Xianlian Zhou

Yifei Yuan, Jakob Wolf and Xianlian Zhou are with the Department of Biomedical, Engineering, New Jersey Institute of Technology, Newark, NJ 07102, USA

2026-08-04规划控制

针对髋外骨骼中人体会随助力改变步态、使控制目标非平稳的问题,论文用四阶段多智能体训练把人体肌骨模型与双侧外骨骼策略逐步协同学习,再将单一仿真策略直接部署到硬件。8名健康受试者实验显示,相比被动穿戴净代谢率下降19.7%,相比无外骨骼下降9.1%,且髋关节机械功率几乎全为正并能跨速度和地形保持助力。

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance Figure 1
2026-08-04cs.RO

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance

Amir Belder, Gonçalo Dias Pais, Refael Vivanti, Omri Carmi, Daniel DeTone, Oren Shrout, Ido Gattegno, Ayellet Tal

2026-08-04数据集/基准

本文针对机器人辅助放置中“应放在哪里才符合人的意图”缺少数据的问题,将任务定义为虚拟放置:预测场景中所有合理目标位置,而非单一坐标。核心贡献是基于 Aria 合成与真实室内场景构建首个自我中心 VP 基准,覆盖面板放置、坐姿建议和电视放置,含 2D/3D 标注与文本描述。实验显示现有检测和分割模型在该基准上表现有限,Sitting Suggestion IoU 不超过 0.46,说明人类偏好、遮挡和全局几何推理仍是主要瓶颈。

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation Figure 1
2026-08-04cs.RO

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

2026-08-04机器人生成模型强化学习

FlowPilot针对高速无人机在未知密集环境中既要低延迟感知又要输出可跟踪轨迹的矛盾,提出用流匹配联合建模未来深度与动作,并以双流MoT共享注意力耦合场景预测和轨迹生成;部署时只生成由状态约束的7阶Bernstein轨迹,保证平滑性和解析导数。实验显示其在更高障碍密度和最高8 m/s仿真速度下优于规划与学习基线,实机在Jetson Orin NX上低于18 ms运行,并在室内和森林中达到5.5 m/s。

bFaaaP: An Inclusive, Head-Angle Piano-Pedal Interaction that Quantitatively Reproduces a Pianist's Intended Pedalling -- Foot-Free, for Acoustic and Electronic Pianos Figure 1
2026-08-04cs.HC

bFaaaP: An Inclusive, Head-Angle Piano-Pedal Interaction that Quantitatively Reproduces a Pianist's Intended Pedalling -- Foot-Free, for Acoustic and Electronic Pianos

Tomoyuki Shishido (1 and 2), Masahiro Ootaki (3), Hiroyuki Narusawa (4) ((1) Shishido & Associates, Hachioji, Tokyo, Japan, (2) SeemeData Labs, Inc., Nakano-ku, (3) Ootaki & Architects, Sayama, Saitama, (4) Naru Science Software, Fujimi-shi, Japan)

SeemeData Labs, Inc., 2-19-2 3F Nakano, Nakano-ku, 164-0001, Tokyo, Japan

2026-08-04机器人

这篇论文面向无法用脚踩钢琴延音踏板的演奏者,提出用手机 AR 追踪头部角度并经 BLE 控制声学或电子钢琴踏板的 bFaaaP。核心不在头控踏板本身,而在可调死区和倍率的定量控制律,使少量头部运动映射为可表达的踏板动作。15 人 APEE 评估显示其显著提升延音能量,效果与演奏者用脚踩踏板无显著差异,并已在公开音乐会中使用。

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms Figure 1
2026-08-04cs.RO

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

Zongyuan Shen 1 , Shalabh Gupta 2 , Shancheng Zhao 1 , Dehua Zhou 1 , Gao Wang 1 , Rui Cheng 3

2026-08-04规划控制

这篇综述针对动态环境中机器人需在移动障碍、不确定预测和多智能体交互下实时重规划的问题,梳理2015至2025年学习式运动规划如何继承或改造经典规划。核心洞察是按“学习在规划管线中的角色”划分为直接策略、学习增强经典规划、混合规划和训练增强,并比较其机制、优势与局限。主要结果是给出统一分类框架,指出安全可认证、仿真到现实、密集人群导航和感知规划耦合仍是关键瓶颈。

From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning Figure 1
2026-08-04cs.RO

From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning

Hao Yuan, Yuxin Wang, Lei Ji, Zhiwei Yu

University of Chinese Academy of Sciences, Beijing Academy of Artificial Intelligence (BAAI)

2026-08-04视觉感知规划控制安全鲁棒

面向长时程具身任务中环境变化、执行失败会使原计划失效的问题,论文提出 DynamicEnvPlan,将扰动和失败状态转化为可监督的恢复轨迹,并结合记忆增强规划、可控扰动与特权纠错进行两阶段微调。在104个任务-场景组合上,基础规划器成功率由33.3%提升到76.2%,安全性和可供性等七项指标也同步改善。

Grasp Execution Without a Planner: Configuration-Space Grasp Distance Fields with Certified Safety & Guaranteed Quality Figure 1
2026-08-04cs.RO

Grasp Execution Without a Planner: Configuration-Space Grasp Distance Fields with Certified Safety & Guaranteed Quality

Clinton Enwerem, John S. Baras, Calin Belta

The authors are with the Department of Electrical and Computer Engineering and the Institute for Systems Research (ISR), University of Maryland, College Park, MD, USA. Emails:

2026-08-04安全鲁棒

针对多指抓取中“先规划再跟踪”易因物体位姿扰动失效、重规划代价高的问题,论文把候选抓取集表示为关节空间中的平滑抓取距离场,并用固定梯度反馈结合 CBF-CLF QP 约束碰撞、工作空间和抓取质量。仿真中该方法在固定臂和 Unitree G1 上完成 46/50 个物体抓取,成功抓取保留中位 94% 合成质量裕度,QP 求解约 0.09 ms/步。

Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization Figure 1
2026-08-04cs.RO

Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization

Daojie Peng, Fulong Ma, Bingtao Wang, Sheng Wang, Jun Ma

2026-08-04视觉语言视觉感知

这篇论文针对大规模VLA难以上机器人本体、而云端推理又会引入延迟和抖动的问题,提出CloudEdgeVLA:让云端输出较稳定的任务级特征,边缘端用当前视觉做状态校正,并通过当前/延迟帧共享动作监督促成表征分工。在LIBERO四套任务中,40步随机延迟下仍保持63.8%至78.0%成功率,显著高于VLASH和单路径基线。

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation Figure 1
2026-08-04cs.RO

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

Xiaoyang Chen, Shengcheng Luo, Haoran Guo, Jiaming Jiang, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

2026-08-04机器人

针对灵巧旋转中频繁换指接触会影响后续可旋转性的难题,DexMani不直接复刻人手轨迹,而是从人类视觉触觉示范中学习“接触条件下可操作性如何演化”的能量先验,并用其引导不同机械手的强化学习。在拧盖、转物体和水龙头任务上,它在Shadow、Allegro、XHand及LEAP等平台取得最高成功率,LEAP平均57.5%,且运动更平滑;但每个任务-手型仍需单独训练策略。

Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models Figure 1
2026-08-04cs.RO

Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models

Zihang Yao (1), Chaoyue Ding (2), Yingying Yu (2) ((1) Brigham Young University, (2) Beijing Academy of Science and Technology)

2026-08-04强化学习

论文关注接触丰富操作中“未来视觉—触觉信息”即使预测正确也未必能被策略有效利用的问题。作者用仿真成功轨迹构造 OVTF,固定未来提供者以隔离接口因素,并提出 AFM:让触觉记忆读取同阶段视觉未来、同时阻断跨触觉混合。七个 UniVTAC 任务上 AFM 平均成功率 32.0%,高于 IFM 的 23.7% 和 UniVTAC-ACT 的 14.9%,说明收益主要来自更可行动的相位对齐视觉—触觉路由。

SSTG-Nav: Metric-Grounded Spatial-Semantic Topological Graphs for Reusable Object Navigation Figure 1
2026-08-04cs.RO

SSTG-Nav: Metric-Grounded Spatial-Semantic Topological Graphs for Reusable Object Navigation

Daojie Peng, Bingtao Wang, Jun Ma

2026-08-04机器人

这篇论文针对长期服务机器人反复在同一环境执行 ObjectNav 时仍从零探索的问题,指出“看见物体的位置”不等于可停靠的导航目标。SSTG-Nav 用一次无目标巡检构建可复用的度量-语义拓扑图,将多视角 RGB-D/VLM 证据投影为可达候选停靠点并融合、排序、到达后验证;在 HM3D-v2 1000 个任务上,目标无关拓扑几何成功上限达 99.4%,度量 grounding 将 SR 从 0.835 提至 0.920,融合与 Top-3 恢复最高达 0.975。

First Deployable Dynamic-CoM: A Unified Policy and Method-Agnostic Benchmark for Humanoid Single-Leg Balance Figure 1
2026-08-04cs.RO

First Deployable Dynamic-CoM: A Unified Policy and Method-Agnostic Benchmark for Humanoid Single-Leg Balance

Yikai Zhou, Xingyun Wang, Jieming Cui, Bozhou Chen, Yikai Fan, Yixin Zhu, Wenxin Li

2026-08-04机器人强化学习数据集/基准

这篇论文针对通用人形机器人策略能做复杂动作却难以干净单脚站立的问题,指出关键不在跌倒后恢复,而在提前利用动态质心/捕获点防止失衡。作者通过支撑脚相对坐标消去硬件不可观测的基座线速度,使 dynamic-CoM 可直接进入部署策略,并配合人类姿态控制启发的奖励与方法无关 sim2sim 基准。结果显示 FDDC 在90个保留动作中完成86个干净单脚平衡,8个公开视频策略为0/90,并可迁移到Unitree G1。

From Digital to Physical Reservoir Computing: Co-Optimizing Soft Robotic Reservoirs via Dynamics Matching Figure 1
2026-08-04cs.RO

From Digital to Physical Reservoir Computing: Co-Optimizing Soft Robotic Reservoirs via Dynamics Matching

Nicola Visentin, Maximilian Stölzle, Mariano Ramírez Montero, Francesco Braghin, Daniela Rus, Cosimo Della Santina

2026-08-04机器人

针对软体机器人物理储备池常被直接使用、性能落后于数字储备池的问题,论文提出先用高性能数字随机振荡器网络作为参考,在动力学层面联合优化软体形态、状态映射和前馈-反馈控制,并用加速度方程误差避免完整时域展开。仿真实验显示,在分类与预测任务上较未优化软体储备池平均提升33.7%,保留数字参考约90.9%性能;但结果仍限于低维仿真,硬件鲁棒性文中未充分说明。

Learning to Predict Contact Force Distributions from Vision Leveraging Object Geometry Priors Figure 1
2026-08-04cs.RO

Learning to Predict Contact Force Distributions from Vision Leveraging Object Geometry Priors

Ryo Hanai, Yukiyasu Domaea, Ixchel G. Ramirez-Alpizar, Abdullah Mustafa, Floris Erich, Tetsuya Ogata

2026-08-04视觉感知

这篇论文针对杂乱堆叠物体中接触力难以从视觉直接估计的问题,主张机器人不必预测精确点接触力,而应学习对操作有用的平滑三维力分布。核心创新是把刚体仿真的点力监督经统计平滑转为分布目标,并引入接触物体几何先验约束平滑方向,减少不合理扩散。仿真和真实抓取/提取实验显示,该方法提升力预测精度与下游取物表现,并在仅用仿真训练时具备一定 sim-to-real 泛化能力。

LOCUS-DT: Localization via Observation-Conditioned Uncertainty Scoring with Digital Twins Figure 1
2026-08-04eess.SP

LOCUS-DT: Localization via Observation-Conditioned Uncertainty Scoring with Digital Twins

Haozhe Lei, Roberto Bomfin, Marwa Chafii, Sundeep Rangan

2026-08-04安全鲁棒

室内机器人导航和搜救需要的不只是发射源单点定位,而是能表达遮挡、多径导致的多峰不确定性。LOCUS-DT利用已知布局的射线追踪数字孪生,为候选位置生成多径签名,并用学习到的观测条件评分函数与实测信道匹配,形成后验热图;在Sionna仿真中较高斯和高斯混合基线更能刻画尖锐、多峰、布局相关的定位后验,但真实场景和更强数字孪生失配仍未充分验证。

Embodied Passive Aeroacoustic Perception Enables Relative Sensing and Pursuit Between Aerial Robots Figure 1
2026-08-04cs.RO

Embodied Passive Aeroacoustic Perception Enables Relative Sensing and Pursuit Between Aerial Robots

Yanbaihui Liu, Ravi Prakash, Li-Yu Lo, Nils Roede, Boyuan Chen

Department of Mechanical Engineering and Materials Science, Duke University, Durham, 27708, USA., Department of Electrical and Computer Engineering, Duke University, Durham, 27708, USA., Department of Computer Science, Duke University, Durham, 27708, USA.

2026-08-04机器人

这篇论文针对无人机编队在无 GPS、无通信或视觉受限场景下的相对感知问题,提出利用飞行本身产生的被动气动声学信号。SonicFly 通过四麦克风阵列、旋翼声学特征、神经方位-距离估计和置信门控滤波,让跟随机仅凭领飞机声实现闭环追踪;户外多轨迹实验中,声学追踪的平均距离保持误差为 1.34 米,并分析了谐波结构、频谱可分性和空间声学线索对可观测性的作用。

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping Figure 1
2026-08-04cs.RO

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping

Qi Luo, Shuaijun Liu, Hao Zhao, Kunlin Li, Xiaobo Wang, Ningxing Su, Dongsheng Wang, Yun Chen

2026-08-04学习理论

这篇论文关注训练免费 VLA 视觉 token 跳过在闭环机器人控制中为何会失效:问题不主要在缓存复用或删除机制,而在 gate 若来自上一轮稀疏前向,会逐步看不见已跳过 token 并累积错误。作者提出在机器人执行动作块的空闲期无条件做一次密集刷新,提供干净 gate 和 KV 基座;在 LIBERO/Object 等任务中将高跳过率下的成功率从 0.68/0.31 恢复到约 0.98,并保持较 dense 低 18–22% 的服务延迟。

A Robotic System for Automated Manufacturing of Dielectric Elastomer Actuators Figure 1
2026-08-04cs.RO

A Robotic System for Automated Manufacturing of Dielectric Elastomer Actuators

Van Remenar, Anatol Gogoj, Ang Li, Tomas Verardi, Matei Mandoiu, Victor Jimenez Santiago, Mihai Duduta

2026-08-04机器人

多层介电弹性体执行器的制备仍高度依赖人工搬运、对准和电极沉积,导致一致性和吞吐受限。本文将点胶、旋涂、UV固化与CNT电极压印整合到可编程机器人平台,并用带角度归零的自制旋涂模块和掩膜-滤膜一体压印 cartridge 保持层间对准与电极转移。系统制备20个12层DEA,介电层厚度为55.37±2.04微米,CNT转移率95.29±1.47%,总工时降低14.2%,人工参与时间减少56.1%。

Action Chunk Scheduling for Batched Robot Policy Serving Figure 1
2026-08-04cs.RO

Action Chunk Scheduling for Batched Robot Policy Serving

Rohan Bansal, David He, Nadun Ranawaka Arachchige, Zhenyang Chen, Soobum Kim, Kexin Rong, Danfei Xu

Georgia Institute of Technology

2026-08-04机器人强化学习

这篇论文关注多机器人共享远程 GPU 部署 VLA 等大模型策略时的批处理服务问题:传统批量推理虽提升 GPU 利用率,却会增加闭环控制延迟并导致动作块过期或机器人“饥饿”。作者将动作块服务建模为调度问题,提出 Armory 系统和基于前瞻仿真的 Lookahead 调度器,根据各机器人动作队列、执行窗口和通信延迟选择批次。仿真与 10 台真实机器人实验显示,同质任务下简单调度已足够,但异质反应需求下该方法最高提升真实系统吞吐 18%。

Belief-Space Perception Routing under Coupled Sensor Faults and Compute Contention Figure 1
2026-08-04cs.RO

Belief-Space Perception Routing under Coupled Sensor Faults and Compute Contention

Sparsh Roy, Vihan Aggarwal, Davin Yin

2026-08-04机器人

面向户外机器人相机退化与机载算力波动同时出现时的感知超时问题,论文把传感器故障信念和计算竞争信念用 HMM 估计,并以 noisy-OR 耦合来选择不同 YOLO 配置。结果显示在人工施加耦合的条件下漏截止率降低 1.1–9.4 个百分点,但真实 RADIATE 序列中未检出自然耦合,因此更像是机制验证而非已证明的现场收益。

Towards General Language-Conditioned Latent Safety Filters Figure 1
2026-08-04cs.RO

Towards General Language-Conditioned Latent Safety Filters

Ihab Tabbara, Yuxuan Yang, Hussein Sibai

Department of Computer Science and Engineering, Washington University in St. Louis, MO 63130, USA, Open X-Embodiment Collaboration et al. 2024, failure set is determined by obstacle labels or user-defined

2026-08-04安全鲁棒

这篇论文针对通用 VLA 机器人在部署时难以可靠遵守新安全约束的问题,提出把自然语言安全要求作为条件输入,训练 Hamilton-Jacobi 潜在安全 actor-critic,在名义动作可能违规时接管。实验覆盖抓取放置、擦桌和堆叠,显示该过滤器能减少约束违反,并对同类未见约束有一定迁移,但泛化仍是部分的。

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals Figure 1
2026-08-04cs.AI

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

Lihao Wang, Linlu Gao, Jiacan Yu, Yanyu Lin, Yifan Yin, Jianxin Wang, Tianmin Shu, Renjie Zhao

Johns Hopkins University, Johns Hopkins University Baltimore Maryland USA

2026-08-04机器人

RF-HOI针对视觉HOI在隐私、弱光和相似物体区分上的部署瓶颈,提出仅用射频信号识别人-物交互:以毫米波雷达捕捉动作、RFID识别目标,并用跨模态融合和合成RF数据缓解真实标注稀缺。实验显示其优于RF基线、接近视觉模型,合成数据能提升真实场景泛化。

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head Figure 1
2026-08-04cs.RO

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

2026-08-04机器人

面向社交人机交互中机器人需感知用户注意并做出可见反馈的问题,论文在 InMoov 表情机器人头上结合高频几何头姿/人脸感知与低频 VLM 语义观察,并用有限状态机驱动启动、暂停、恢复等行为。10名参与者40次试验中交互均成功启动,干扰条件下10/10触发暂停、9/10恢复,且几何与语义输出存在非冗余差异,但样本规模较小。

Localization in Spatiotemporal Fields via Environmental PDEs Figure 1
2026-08-04cs.RO

Localization in Spatiotemporal Fields via Environmental PDEs

Jose Fuentes, Abdullah Al Redwan Newaz, Ana Cavalcanti, Leonardo Bobadilla

with the University of New Orleans, New Orleans, LA 70148, USA, Institute of Environment at Florida International University.

2026-08-04机器人

面向水下等 GPS 受限场景,论文把随时间变化的水体环境场作为定位参照,用浅水方程和对流扩散方程预测多通道场,并在 RBPF 中将非线性位姿采样与传感器偏置 Kalman 更新分离。仿真显示其较标准粒子滤波在 RMSE 和最终误差上更低、所需粒子更少;ASV 实测盐度、温度和溶氧也表明这类 PDE 场具备可用空间辨识度。

Compliant Sphere Lattice Contact: Distributed Contact Modeling for Sphere-Based Robot Representations Figure 1
2026-08-04cs.RO

Compliant Sphere Lattice Contact: Distributed Contact Modeling for Sphere-Based Robot Representations

Nataliya Nechyporenko, Ava Abderezaei, Alessandro Roncone

2026-08-04机器人

这篇论文针对球体机器人表示虽便于实时碰撞检测和可微规划、却常退化为不真实点接触的问题,提出 CSLC:用锚定弹簧和横向弹簧连接表面球,形成可变形顺应晶格,使接触斑块、载荷分布、旋转刚度和摩擦力矩在球表示上自然产生。作者在两个求解器中验证,并给出初步抓取实验,显示相比点接触可形成接触斑块并提升受扰动时的抓取稳定性。

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving Figure 1
2026-08-04cs.CV

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

Rochester Institute of Technology, 2 NVIDIA

2026-08-04机器人

这篇论文针对端到端自动驾驶 VLA 模型在路口等关键场景对导航指令不敏感的问题,将其解释为回归训练下的条件策略坍缩:视觉先验压过语言信号。作者把 CFG 引入轨迹回归,并提出单次前向的 Latent-Centroid Steering,用预计算指令类中心在潜空间做稳定 steering,避免两次推理。实验称其在 Bench2Drive 成功率相对提升 8%,nuScenes 轨迹误差相对降低 5.6%,同时约减半 CFG 推理延迟。

Developing Combined Manipulation and Locomotion Skills with Interaction Representation and Skill Composition Figure 1
2026-08-04cs.RO

Developing Combined Manipulation and Locomotion Skills with Interaction Representation and Skill Composition

Fanxing Meng, Jing Xiao

Robotics Engineering Department, Worcester Polytechnic Institute, Worcester, MA, USA

2026-08-04机器人

面向类人机器人将抓取与起身行走串成连续行为的需求,论文提出用距离场结合三次谐波加权空间卷积表示手-物关系,并以发展式课程解耦手指关节,再用交互分数在已学策略间分配关节控制。实验显示未见物体抓取零样本成功率为93%,持物起身成功率达96–100%,同时指出策略组合需在同一完整机器人身体上训练。

Motion Planning for Mobile Manipulators Navigating Doorways via Model Predictive Control Figure 1
2026-08-04cs.RO

Motion Planning for Mobile Manipulators Navigating Doorways via Model Predictive Control

Kasra Sinaei, Kasun Weerakoon, Christopher Bradley, Seyed Abolfazl Fakoorian, Donald Ebeigbe

AlphaZ Inc.

2026-08-04规划控制

面向移动操作机器人在办公、仓储等人类环境中自主开门并通过门洞的需求,论文将底盘运动与门角度建模为耦合动力系统,并用非线性 MPC 联合规划推门/拉门过程;其关键取舍是用机械臂可达性的软惩罚替代完整臂运动学,从而保持低维优化。仿真和一次硬件实验显示该方法能生成动态可行、避碰的门洞穿越轨迹。

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning Figure 1
2026-08-04cs.RO

Track-Guided Hierarchical Reinforcement Learning for Autonomous Vehicle Drifting with Minimum-Lap-Time Planning

Sheng Zhao, Bolin Zhao, Xiaodong Wu, Chen Lv

2026-08-04强化学习规划控制

这篇论文瞄准低附着赛道中“既要稳定漂移、又要最短圈速”的控制矛盾,提出先用最小圈速最优控制生成漂移规划轨迹,再以赛道引导的分层强化学习逐步训练漂移控制、弯道策略和整圈策略。其核心在于把轨迹先验和圈速目标写入奖励,降低大侧偏角漂移的探索难度;仿真显示车辆控制性能可保持,同时圈速得到降低,但真实车验证与具体增益来源文中未充分说明。

2026-08-03

36 篇
Diagnosing Compositional Generalization in Sequential Robot Tasks Figure 1
2026-08-03cs.RO

Diagnosing Compositional Generalization in Sequential Robot Tasks

Yixiao Wang, Cheng-En Wu, Lingfeng Sun, Pengcheng Wang, Xiang Ji, Boyuan Liang, Guojian Zhan, Masayoshi Tomizuka

University of California, Berkeley, Tsinghua University

2026-08-03机器人学习理论

面向顺序机器人任务中组合指令空间爆炸、稀疏示教难以泛化的问题,本文从指令空间覆盖角度分解泛化差距为边缘指令偏移、指令组合偏移和上下文-动作偏移,指出关键不是枚举全部任务,而是覆盖会影响动作的依赖结构。实验显示,结构化的四分之一任务子集即可取得较强 OOD 表现;稀疏训练失败多因指令 steering 不足,单任务一条示教微调可将 OOD 成功率从 0.4% 提升到 54.7%。

Bootstrapping Self-Supervised Learning of Binary Classification Using Error Bounds: A Case Study on a Robotic Insertion Task Figure 1
2026-08-03cs.RO

Bootstrapping Self-Supervised Learning of Binary Classification Using Error Bounds: A Case Study on a Robotic Insertion Task

Zebin Duan, Norbert Krüger, Juan Heredia, Thorbjørn Mosekjær Iversen, Frederik Hagelskjær

All authors are with the Mærsk Mc-Kinney Møller Institute, University of Southern Denmark, 5230 Odense M, Denmark.

2026-08-03机器人学习理论

面向柔性制造中机器人插入任务上线慢、可靠验证耗时的问题,论文提出在线数据引擎:用力数据经 UMAP 与半径邻居分类做快速判别,并以 Wilson Score 给出错误率置信界,不足时回退到昂贵高度检查并继续收集标签。真实系统结果显示,模型可逐步减少昂贵验证调用,同时维持设定错误率上界。

Balancing of Humanoid with Object Mass: Trade-off Analyses and Lifting Control Figure 1
2026-08-03cs.RO

Balancing of Humanoid with Object Mass: Trade-off Analyses and Lifting Control

Hyunjong Song, William Z. Peng, Joo H. Kim

whole-body dynamics with distributed contact wrenches and centers of pressure at the stance contacts, their nonlinear, the construction of the balanced state basin/boundary (BSB), a partition of the center-of-mass state space for a biped, interrelations among the available momenta, required joint, Department of Mechanical and Aerospace Engineering, New York, University (NYU), New York, USA, NYU Center for Robotics and Embodied Intelligence (CREO), New, NYU Center for Urban Science and Progress (CUSP), New York, USA, Joo H. Kim, Department of Mechanical and Aerospace Engineering, New, York University, 5 MetroTech Center, #116, Brooklyn, NY 11201, USA, use common stability criteria such as the center-of-mass, Featherstone, 2017), center of pressure

2026-08-03机器人规划控制

本文针对人形机器人搬运或举升重物时,传统 CoM、CoP、ZMP 等稳定性准则难以量化物体质量影响的问题,将物体质量纳入全身动力学与接触约束,并用平衡状态盆/边界刻画可保持接触的状态空间。核心洞察是额外质量并非越轻越好:存在使平衡能力最大的临界质量,以及触发不同限制因素的转变质量。作者进一步把 BSB 作为轨迹优化约束,在仿真和实机举升任务中展示了更稳定的 lift-and-hold 与 lift-and-release 控制。

RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning Figure 1
2026-08-03cs.RO

RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning

Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann

Karlsruhe Institute of Technology, Germany, University of Leeds, United Kingdom

2026-08-03模仿学习安全鲁棒

视觉模仿学习依赖RGB图像时容易把动作策略绑定到特定相机视角,摄像机轻微移动就会退化。RayViT的关键做法是把相机内外参编码为Plücker ray map,并通过门控交叉注意力生成几何感知CLS token,同时把射线特征作为patch级位置嵌入,再用跨视角余弦一致性约束稳定表征。实验覆盖RoboCasa仿真和真实机器人任务,在相机扰动下相对基线提升约13个百分点,真实多任务平均完成阶段数提升1.78。

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Figure 1
2026-08-03cs.RO

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

Tongji University, Shanghai Innovation Institute, Fudan University

2026-08-03视觉语言视觉感知强化学习

论文针对VLA强化学习中critic常只看单帧、难以处理机器人操作部分可观测性的问题,指出关键瓶颈在于缺少显式时序状态建模。WCM将未来潜在状态预测与价值估计联合训练,使critic学习可预测的历史表征,并可接入on/off-policy流程。实验覆盖4个仿真基准149项任务和7个真实机器人任务,在IND/OOD设置下普遍优于PPO、GRPO、Flow-SDE等基线,尤其提升泛化表现。

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation Figure 1
2026-08-03cs.RO

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

2026-08-03机器人视觉感知

长程零样本视觉语言导航的瓶颈在于历史图像或稠密地图会持续膨胀,且难以显式记录任务进展和失败分支。HAM-VLN将导航决策与记忆写入绑定,用深度接地的世界图组织地点、物体、进展和反思,并按相关性、近因和显著性检索上下文。无需训练时,在R2R-CE、RxR-CE和ObjectNav上分别达到61.0%、52.7%和79.7%成功率,同时上下文长度减少约65%以上。

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling Figure 1
2026-08-03cs.RO

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

2026-08-03视觉语言视觉感知

FibVLA针对长时程机器人任务中历史视觉与本体状态有用但会造成VLA推理开销过高的问题,提出按斐波那契/对数间隔回看采样,并用通道级时序编码过滤重复背景,再结合flow matching动作分布和可复用上一动作块的递归推理。实验称其在仿真和含15类真实任务的数据上提升成功率与动作平滑性,同时比视频式历史编码更适合实时闭环控制。

Safe Vision Language Action Models via Barrier Enhanced Flow Matching Figure 1
2026-08-03cs.RO

Safe Vision Language Action Models via Barrier Enhanced Flow Matching

Kasra Sinaei, Hung-Chieh Wu, Donald Ebeigbe

The authors are with the Department of Electrical Engineering, The Pennsylvania State University

2026-08-03视觉感知生成模型安全鲁棒

针对VLA在真实机器人操作中缺少形式化安全约束、后处理安全滤波又可能造成分布偏移的问题,论文把控制屏障函数嵌入Flow Matching去噪过程,并用Log-Sum-Exponential聚合屏障一次约束整段动作块,在较低开销下保持语义意图。理论上给出生成分布与目标分布的2-Wasserstein距离有界条件,实验在两类机械臂平台和2D导航中显示安全性提升且成功率基本不下降。

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware Figure 1
2026-08-03cs.RO

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

2026-08-03机器人

这篇论文面向透明且盛液实验器皿的机器人操作,动机是边界、深度和抓取各模块独立优化会放大误差并导致倾斜抓取或洒液。TransGraspNet的核心在于把几何一致性和物理稳定性贯穿感知到执行:用边界约束改善轮廓与深度重建,再用质心对齐和 wrench-space 稳定性筛选抓取。实验显示其在遮挡、反光场景下抓取成功率达86.0%,高速搬运液体零洒漏。

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback Figure 1
2026-08-03cs.AI

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo Cangelosi

2026-08-03强化学习

这篇论文针对多目标强化学习在机器人等真实任务中难以手工定义各目标奖励的问题,提出 LEMUR:从多个教师的偏好反馈分别学习目标特定奖励模型,再用多目标 RL 优化权衡策略,避免把异质偏好压成单一标量。实验覆盖连续控制和机器人操作基准,显示其优于聚合式和偏好式基线,并在标签噪声、反馈预算受限和更多目标下较稳健;但评估主要依赖脚本教师,真实人类反馈效果仍需验证。

STAGE: STyle-controllable Action GEneration for personalized autonomous driving Figure 1
2026-08-03cs.RO

STAGE: STyle-controllable Action GEneration for personalized autonomous driving

Zihao Liu, Xing Liu, Yizhai Zhang, Panfeng Huang

2026-08-03规划控制

这篇论文针对自动驾驶行为与用户习惯不一致会降低信任、增加接管的问题,提出 STAGE:在模仿学习的 Transformer 策略中加入动作模态编码,并用偏好学习把“激进程度”约束为连续、单调的风格值,用户推理时可像滑杆一样调节轨迹与控制。实验显示其在典型道路场景中能生成更符合预期风格的动作,并相较多种基线体现出风格可控性、连续性、对齐能力和安全性。

Homotopy-Aware Corridor Generation without Predefined Reference Paths Figure 1
2026-08-03cs.RO

Homotopy-Aware Corridor Generation without Predefined Reference Paths

Haoze Dong, Minghan Li, Meng Guo, Zhongkui Li

2026-08-03机器人

针对传统安全走廊生成依赖预设参考路径、易把轨迹几何偏差和同伦类别限制带入优化的问题,本文在凸集图上直接搜索凸集序列,并把可见性变形扩展到走廊层面以合并拓扑冗余;同时用细/粗两级自适应GCS支持局部更新。数值与地面、空中机器人实验显示其能更高效构建与维护走廊,并获得更短时长的同伦感知轨迹。

Tri-Space Operational Control of Redundant Multilink and Hybrid Cable-Driven Parallel Robots Using an Iterative-Learning based Reactive Approach Figure 1
2026-08-03cs.RO

Tri-Space Operational Control of Redundant Multilink and Hybrid Cable-Driven Parallel Robots Using an Iterative-Learning based Reactive Approach

Dipankar Bhattacharya, Yin Pok Chan, Siqi Shang, Yuen Shan Chan, Ying Tan, Darwin Lau

manipulability. On the other hand, by finding an optimal parameter, Department, Engineering, The Chinese University of Hong Kong, Hong Kong SAR., ogy, The University of Melbourne, Parkville, VIC 3010, Australia (e-mail:, situations such as cable-link interference, loss of manipulability, and, to handle constraints, such as lack of manipulability [23], joint limits, avoid cable-link interference, prevent loss of manipulability

2026-08-03机器人规划控制

面向多连杆与混合缆驱并联机器人,论文针对作业、关节、驱动三空间中冗余与正缆力、干涉、可操作性等约束难以同时满足的问题,提出将反应式控制与迭代学习结合的三空间操作控制框架,并用空空间参数化降低重复任务优化成本。仿真和硬件实验显示,该方法可在不同CDPR架构上实时跟踪轨迹,同时保持可行缆力并规避关键约束。

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration Figure 1
2026-08-03cs.RO

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

Dylan Miller, Martin Jagersand

Dylan Miller and Martin Jagersand are with Department of Computing Science, University of Alberta, Canada {djm2

2026-08-03机器人强化学习模仿学习

这篇论文针对扩散/流匹配策略从高斯噪声生成机器人动作带来的长传输路径和高推理延迟,提出 Temporal Policy:用机器人近期状态历史初始化随机插值生成过程,将过去状态与未来动作序列显式耦合,从而缩短传输距离、拉直向量场。实验覆盖 Robomimic 和真实 Barrett WAM 7DoF 平台,报告传输成本近一数量级下降、RTX 4080 上 19.1 ms 推理延迟,同时成功率接近现有强基线。

Automated Straight-line Sewing of Stretchable Fabrics with Different Lengths Figure 1
2026-08-03cs.RO

Automated Straight-line Sewing of Stretchable Fabrics with Different Lengths

Bingchen Jin, Akinari Kobayashi, Dipankar Bhattacharya, Akira Seino, Fuyuki Tokuda, Norman Chihnan Tien, Kazuhiro Kosuge

2026-08-03机器人

针对服装生产中“短布拉伸对齐长布并直线缝合”的自动化难题,论文提出DLRoSS机器人缝纫系统:用6自由度机械臂配合双主动滚轮、被动压紧滚轮和实际送料速度传感,在卷绕、缝制、收尾与释放四阶段中同步控制两层弹性布料。实验表明,该系统可在不同材料和长度组合上稳定完成较高质量缝合。

AquaJEPA: Action-Conditioned Multimodal Predictive Representations for Underwater Robot Dynamics Figure 1
2026-08-03cs.RO

AquaJEPA: Action-Conditioned Multimodal Predictive Representations for Underwater Robot Dynamics

Alan-Barsag Gazzaev, Alexey Gavrilov, Sergey Muravyov

All authors are with ITMO University.This work has been submitted to the IEEE for possible publication.

2026-08-03机器人视觉语言

水下机器人在浑浊水体、视角变化和 DVL 失锁时多传感器可靠性不稳定,传统完整观测动力学模型容易失效。AquaJEPA 将相机、前视声呐和本体感知做带有效性掩码的融合,用八推进器动作条件化的 JEPA 预测未来潜表示,并以动作间隔、模态 dropout 和物理辅助头服务滚动规划。Stonefish 配对评测中其达成 74/120 个目标、平均终点误差 0.906 m,优于多种动作条件预测基线,但相对 state-only 的优势文中仍称统计上未充分确定。

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning Figure 1
2026-08-03cs.RO

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

Muhayy Ud Din, Irfan Hussain

KU Center for Autonomous Robotic Systems (KUCARS), Khalifa University, Corresponding Author: Irfan Hussain, KU Center for Autonomous Robotic Systems (KUCARS), Khalifa University, United Arab Emirates

2026-08-03视觉语言规划控制

这篇论文针对几何抓取只保证力学可行、却可能抓杯沿或刀刃等功能上错误的位置的问题,提出用粗粒度区域作为 VLM 语义推理与几何规划之间的接口。SAGP 先用 PCA 和 DBSCAN 将点云划分为顶部、中部、侧面、突出部等区域,再让预训练 VLM 零样本评估区域可抓性,并与几何、可达性和任务对齐信号融合重排序抓取候选。在 YCB/PyBullet/Franka Panda 实验中,它基本保持几何规划成功率,同时提升非对称、带把手物体的功能合适性。

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning Figure 1
2026-08-03cs.RO

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning

BWM Team

Model: huggingface.co/BLM-Lab/Boundless-World-Model

2026-08-03机器人强化学习

针对真实机器人数据昂贵、物理仿真存在 sim-to-real 差距且视频模型难以精确响应动作的问题,BWM 将通用视频先验做领域化后训练,并通过轨迹重放、重叠采样、初始观测增强及动态历史、高精度动作条件生成可控 rollout。实验显示其在 WorldArena 综合排名第一,物理机器人数据增强成功率达 71.00%,闭环评估与真实结果相关系数达 0.908。

TRACT: Temporally Routed Action Chunks with Chronological Phase Authority for Contact-Rich Manipulation Figure 1
2026-08-03cs.RO

TRACT: Temporally Routed Action Chunks with Chronological Phase Authority for Contact-Rich Manipulation

Jiahao Liu, Kento Kawaharazuka, Tasuku Makabe, Kei Okada

2026-08-03机器人

TRACT针对接触丰富长时操作中动作块跨阶段时“当前阶段”被错误套用到整个未来轨迹的问题,将当前阶段确认与未来阶段边界路由解耦,并用时序图约束合法转移、用响应缺口积分器补偿接触下的运动不足。在单一真实机器人擦拭任务中,完整方法达10/10成功、零阶段歧义和零停滞;但路由包相对平坦包的增益为包级比较,增益来源不清,跨任务泛化也文中未充分说明。

MDIR: A Task-Manifold Impedance Retargeting Method for Contact-Rich Teleoperation Figure 1
2026-08-03cs.RO

MDIR: A Task-Manifold Impedance Retargeting Method for Contact-Rich Teleoperation

Liu Jiahao, Kento Kawaharazuka, Tasuku Makabe, Kei Okada

2026-08-03机器人

这篇论文针对接触丰富遥操作中固定笛卡尔阻抗难以同时保证任务推进与降低冲击的问题,提出 MDIR:把单次示教的固定阻抗控制器分解为工作、施力、支撑等任务流形通道,并在保持局部任务响应的约束下优化可执行的变阻抗控制。Franka Panda 上擦拭、抓放、推动三类任务共 15 次闭环实验均通过任务检查,并相对原示教降低腕部力峰值、冲量、力波动和名义功率,但验证规模仍较小。

CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation Figure 1
2026-08-03cs.CV

CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation

Minh-Quan Dao, Yancong Lin, Julie Stephany Berrio Perez, Holger Caesar

University of Nottingham, University of Queensland

2026-08-03生成模型

论文针对 LiDAR 场景流方法过度依赖相似深度架构和自监督损失、在稀疏远距或快速运动目标上共同失效的问题,提出无需训练的 CorrelationFlow:将点云投影为 BEV 占据图,用连通域分离时空目标并通过归一化互相关峰值估计刚体位移,还提供单帧对的稀疏关键点版本。在 Argoverse 2 2026 多域无监督赛道中排名第二,且远距离退化更平缓,说明部分场景流可由经典几何有效解决。

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution Figure 1
2026-08-03cs.RO

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

Peize Li, Ruimeng Zhang, Ru Zhang, Cong Huang, Kai Chen, Shanghang Zhang

2026-08-03生成模型强化学习

这篇论文针对世界-动作模型长时程执行中预测状态会随滚动逐步漂移、而现有按 chunk 更新观测反馈过粗的问题,提出无需训练的 FBFM:在 flow matching 采样过程中用动态掩码和伪逆校正,把已执行动作和新观测到的图像状态约束到正在生成的下一段轨迹中。结果显示,RoboTwin2.0 上成功率提升约 3.0 个百分点,LIBERO 总体仅增 0.6 点且不同套件效果不均,真实机器人记录预测的状态跟踪也有所改善。

TacPrint: A Wearable Fingertip Tactile Sensor for Human-to-Robot Contact Reproduction Figure 1
2026-08-03cs.RO

TacPrint: A Wearable Fingertip Tactile Sensor for Human-to-Robot Contact Reproduction

Yongxi Liu, Chaofan Zhang, Xingyu Zhang, Xiangyin Bao, Boyue Zhang, Shaowei Cui, Shuo Wang

Institute of Automation, Chinese Academy of Sciences, Beijing Academy of Artificial Intelligence

2026-08-03机器人

面向接触丰富操作中的人到机器人示教迁移,论文针对现有采集流程缺少自然、低成本且细粒度指尖触觉的问题,提出可穿戴 TacPrint:用 24 个电容 taxel 与硅胶凸点对齐,并通过 real-to-sim-to-real 学习从稀疏信号重建 35×26 接触深度图。实验显示其中心深度误差约 0.085 mm、位置误差约 0.250 mm,并在重放中将抓取和擦拭成功率从 0% 提升到 91.67% 和 90%,闭环抓取也优于原始 taxel 反馈。

Event-Based Upper-Body Humanoid Teleoperation Under Challenging Illumination Figure 1
2026-08-03cs.RO

Event-Based Upper-Body Humanoid Teleoperation Under Challenging Illumination

Haoyu Fu, Zhou Ge, Chengze Li, Chenzhao Sun, Ze Cui, Wenjing Zhou, Xulei Qin

2026-08-03机器人

这篇论文针对 RGB/深度相机在强背光、低照度和快速动作下易丢失跟踪的问题,将事件相机引入上半身人形机器人遥操作闭环。核心不是提出新骨干网络,而是把事件累积、重力对齐惯性融合和因果运动重定向整合到嵌入式实时系统中,并用控制相关指标评估。实验在 NVIDIA Booster T1 和 18 自由度上半身平台上达到 23–34 ms 端到端延迟,在低光、HDR 背光和快速运动中优于 RGB 基线;但文中也承认静态良好光照下 RGB 或混合方案可能更合适。

MROPE: A Multi-Robot Safe Cooperative Strategy via combined Predictive Safety Filters and Ellipse-based Constraint Compression Figure 1
2026-08-03cs.RO

MROPE: A Multi-Robot Safe Cooperative Strategy via combined Predictive Safety Filters and Ellipse-based Constraint Compression

Alice Rosetti, Lorenzo Pichierri, Domenico Cappello, Fabrizio Schiano, Giuseppe Notarstefano

2026-08-03机器人优化算法安全鲁棒

面向无人机群在障碍密集环境中跟踪动态目标时安全约束计算量随障碍和机器人数量膨胀的问题,MRoPE将高层分布式协同优化与低层安全解耦,引入去中心化预测安全滤波,并把多面体障碍约束压缩为每机一个自适应安全椭圆,使局部MPC复杂度基本不依赖障碍密度。仿真、蒙特卡洛和实机实验显示,其相比集中式方案具备更好的实时性与可扩展性。

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning Figure 1
2026-08-03cs.RO

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

2026-08-03机器人

这篇论文关注闭源机器人基础模型只能通过托管 SFT API 适配时,如何让人形机器人在接触丰富、敏捷操作中突破纯模仿学习上限。CLIFT 的核心做法是把真实部署回合中的奖励反馈转成带优势标记的监督微调样本,在不访问权重、梯度或损失的情况下形成闭环迭代。实验显示,GROD 直接 SFT 已优于同数据开放 VLA,但仍不够稳定;经过两轮 CLIFT 后接近满成功率,并出现示教中没有的行为。

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency Figure 1
2026-08-03cs.RO

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu

2026-08-03安全鲁棒

ActFovea面向VLA机器人策略在运行时遭遇视觉遮挡、反馈延迟、动作漂移或观测重放时的闭环失配问题,核心洞察是用视觉、关节状态与动作历史的一致性判断风险和可恢复性。方法以动作条件化的焦点区域保留交互相关证据,并对候选观测诱导的动作块做验证;在LIBERO上将局部遮挡成功率由49.3%提升至90.3%,对延迟和漂移分别提升9.8和7.0个百分点,重放场景触发安全失败。

VSTaI: Design and Characterization of Variable-Stiffness Tactile Interfaces Based on 3D-Printed Structured Fabrics Figure 1
2026-08-03cs.RO

VSTaI: Design and Characterization of Variable-Stiffness Tactile Interfaces Based on 3D-Printed Structured Fabrics

Yiting Mo, Xinyuan Mao, Jashan Preet Singh, Fernando Bello

2026-08-03三维

面向临床触诊训练中软组织硬度变化难以真实、紧凑呈现的问题,论文提出将3D打印结构织物封装在真空层并夹于硅胶之间,通过堵塞效应调节触觉界面刚度。作者比较4类链甲/多面体织物拓扑,发现抽真空可将等效模量提升至亚MPa到MPa量级,最高刚度增幅约140%,圆形链甲更均匀,致密结构峰值刚度更高且具备贴合曲面能力。

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving Figure 1
2026-08-03cs.RO

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun

Stony Brook University, USA, Rutgers University, USA, Sunrise Technology Inc., USA

2026-08-03视觉语言

面向端到端自动驾驶中黑箱决策、复杂场景泛化弱以及VLM推理标注成本高的问题,论文提出结果引导的教师-学生蒸馏:教师用真实动作反思生成任务相关推理,学生继承该能力,并用独立航点解码器把文本推理转为连续轨迹以提升几何精度。在Waymo评测中,该方法优于推理式基线;相同模型加入推理后航点表现约提升24%,但长期闭环安全性仍需更多验证。

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving Figure 1
2026-08-03cs.RO

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

2026-08-03强化学习

本文针对自动驾驶世界模型常要密集预测未来视频、占据或多智能体轨迹而计算重、且容易建模无关细节的问题,提出用未来自车轨迹潜表示作为连续驾驶意图,通过 JEPA 从视觉、历史运动和导航指令预测该意图,再从固定轨迹库检索并排序可执行轨迹。结果在 NAVSIM v1/v2 达到 91.3 PDMS 和 89.1 EPDMS,遮挡实验显示模型对影响规划的动态目标更敏感。

DART: Dual-Axis Airborne Reachability-Gated Torque-Reaction for Off-Road Vehicle Jumps Figure 1
2026-08-03cs.RO

DART: Dual-Axis Airborne Reachability-Gated Torque-Reaction for Off-Road Vehicle Jumps

Yu Hu, Fangzhou Zhao, Mingyuan Sang, Cheng Min, Liang Chen, Wei Li, Wenyu Kuang, Shican Chen, Jinwei Li, Baolei Chen

2026-08-03机器人

本文针对越野车辆高速越过坡脊、沟坎后空中姿态几乎不可控、错误落地易失稳的问题,指出轮胎角动量而非电机峰值扭矩才是俯仰修正上限,并将落地约束反推为起跳可达集合,用于起跳前限速/放行和空中俯仰-横滚反作用控制。BeamNG 全尺寸仿真中,预起跳调速使触地速度降 36%、目标落地从 0/30 提升到 30/30,空中控制在陡坡场景达 29/30 安全落地;但结果均为仿真,硬件验证仍未完成。

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments Figure 1
2026-08-03cs.RO

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments

Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo zhu, Xin Zhou, Yuze Wu, Fei Gao

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous, Zhejiang University, Hangzhou, China, Beihang University, Beijing, China, cution through parallel collaboration and complementary, information sharing, capability aware collaboration, and a, through parallel collaboration (Dorigo, Theraulaz, and Tri-, ing (Yin et al. 2025), and collaborative mapping (Lajoie, laboration according to task semantics, enabling multi-robot, jects, regions, and their spatial relationships and to collabo-, rely on centralized decision making, synchronized collabo-, efficient heterogeneous collaboration and closed-loop exe-, Collaborative Exploration

2026-08-03机器人视觉语言视觉感知

这篇论文针对异构多机器人在未知环境中依赖中心化决策、已知地图和同步协作而难以执行开放语义任务的问题,提出 D-VLC:让各机器人用 VLM 进行去中心化异步感知-推理-行动,并通过轻量 mini-map、结构化消息、能力约束协作和统一高层动作接口连接免学习执行专家。仿真中跨家庭、医院、灾后废墟及多种 VLM 的成功率均超过 70%,最佳配置相对几何贪心基线将完成时间降低 55.8%。

Receding-Horizon Next-Best-View Planner for Autonomous Leaf Surface Reconstruction Figure 1
2026-08-03cs.RO

Receding-Horizon Next-Best-View Planner for Autonomous Leaf Surface Reconstruction

Arif Ahmed, Sajal K. Das, Parikshit Maini

2026-08-03三维

这篇论文面向田间无人机叶片三维重建,动机是传统 NBV 多按可见点数或熵增益选视角,计算重且忽略叶面空间覆盖对重建质量的影响。作者提出基于点云质心的 CIG 信息增益,并用 receding-horizon 在行程预算内同时考虑后续视角。LAST-STRAW 草莓多生长期实验显示,该方法在遮挡更强时更稳定降低叶面重建误差,相比注意力驱动 NBV 最高约提升 10%。

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts Figure 1
2026-08-03cs.RO

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

2026-08-03机器人强化学习安全鲁棒

论文针对视频生成式 WAM 在背景、光照、视角变化下会把未来预测拉回训练域的“训练分布幻觉”,指出像素/VAE 未来监督会混入任务无关视觉因素。ST-WAM 用 DINOv3 同时做未来语义预测和近期历史检索,并保留 VAE 动态细节;无需额外具身预训练,在 LIBERO 达 98.7%、RoboTwin 2.0 达 92.8%,LIBERO-Plus 零样本较 Fast-WAM 提升 21.3 个百分点,真实视觉偏移成功率从 25.8% 升至 61.5%。

Advances, challenges, and opportunities for legged robots Figure 1
2026-08-03cs.RO

Advances, challenges, and opportunities for legged robots

Jonas Frey, Matías Mattamala, Hae-Won Park, Mayank Mittal, Georg Martius, Maike Osborne, Robert Sparrow, Marco Hutter

Robotic Systems Lab

2026-08-03机器人

本文关注腿式机器人从实验室走向物流、救援和人机共处场景时仍缺哪些能力。核心洞察是将硬件执行器与传感器进步、强化学习控制、仿真与开源生态、自治和数据闭环放在同一框架评估。主要结果表明,四足与人形机器人已具备更强动态运动和户外自主性,但可靠操作、泛化、安全伦理、成本和政策治理仍是规模化落地瓶颈。

Mirror Learning Figure 1
2026-08-03cs.LG

Mirror Learning

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

University of British Columbia

2026-08-03机器人

本文针对机器人/自动驾驶中第一人称示范采集昂贵且第三人称观察难以直接用于行为克隆的问题,提出 Mirror Learning:用微调视频扩散模型把观察者视角转成示范者第一人称视频,再由逆动力学模型补全动作,合成可训练的 mirror data。实验显示该数据单独可训练有效策略,加入真实第一人称数据还能提升 CARLA 开环指标,并在合成到真实 robotaxi 视频上有零样本视角生成效果。

2026-07-31

32 篇
PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball Figure 1
2026-07-31cs.RO

PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball

Lizhi Yang, Junheng Li, Aaron D. Ames

2026-07-31机器人强化学习安全鲁棒

这篇论文针对人形机器人在高速来球下仅凭机载视觉实现全身避障且保持平衡的问题,提出 PAC-MAN,将训练期的全身 CBF 安全引导、分割掩码深度观测和 AMP 动作先验结合。核心洞察是屏障结构能否内化取决于威胁可观测性:Joint-CBF 依赖准确球状态或运行时滤波,固定相机下轻量 Link-CBF 更稳。仿真中其接近特权状态 oracle,真实 Unitree G1 零样本部署躲避成功率达 95%。

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation Figure 1
2026-07-31cs.RO

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen

Shanghai Jiao Tong University, Shanghai Innovation Institute, Noematrix Ltd.

2026-07-31机器人生成模型强化学习

这篇论文针对接触丰富操作中“接触前需保留多模态轨迹、接触后需快速响应力反馈”的频率取舍,提出 FA-RDP:用共享视觉-力 Transformer 支持多频动作块,并由多模态指标在低频多步采样和高频一步蒸馏采样间切换;MCD 进一步提升高频推理稳定性。三项任务中平均成功率达 81.7%,较基线高 30 个百分点,同时保留接触前轨迹多样性。

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching Figure 1
2026-07-31cs.RO

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

Fudan University, Shanghai AI Laboratory, Sun Yat-sen University, Tsinghua University

2026-07-31机器人生成模型强化学习

这篇论文针对模仿学习式导航扩散策略依赖全局 oracle 轨迹、难以适应局部观测、失败恢复和不同机器人形态的问题,提出 GQRM 后训练框架:用自举轨迹扰动保持预训练先验并扩展探索,再用组内 Q-score 归一化进行重加权 score matching。X-NavDP 在仿真中成功率由 61.20% 提升到 84.28%,真实复杂场景由 10% 提升到 65%,但更大场景和更多形态上的泛化仍待验证。

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation Figure 1
2026-07-31cs.RO

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

2026-07-31机器人视觉感知

论文针对农业VLN-CE中“能否通行”随机器人形态和作物场景而变得模糊的问题,在AgriVLN上加入TEA模块:先估计相机视野的可通行区域,再在动作决策与通行图不一致时触发重新思考。A2A实验中SR由0.47升至0.54,NE由2.91m降至2.70m;消融显示分割、机器人身份建模和告警机制均有贡献,但真实部署泛化仍文中未充分说明。

Machines that know they are aging: a framework for hardware-aware autonomous intelligence Figure 1
2026-07-31cs.RO

Machines that know they are aging: a framework for hardware-aware autonomous intelligence

Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar

Faculty of Science, Agriculture, and Engineering, Newcastle University Singapore, Singapore 828608, School of Information and Control Engineering, Qingdao University of Technology, Qingdao 266520, China, Department of EEE, Amrita School of Engineering, Amrita Vishwa Vidyapeetham, Chennai, India

2026-07-31机器人

这篇论文针对长期部署机器人中电池衰减、传感器漂移和计算硬件老化被AI规划忽略的问题,提出“老化感知自主智能”框架,将硬件健康估计接入推理、任务规划与寿命分配。核心洞察是失效常来自能力逐步错配而非单点故障;论文给出三支柱架构和海洋机器人情景论证,认为可提升韧性并延长任务寿命,但缺少系统实验,实际增益幅度文中未充分说明。

One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA Figure 1
2026-07-31cs.RO

One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

Alan-Barsag Gazzaev, Alexey Garvilov, Sergey Muravyov

The authors are with ITMO University, Saint Petersburg, Russia.

2026-07-31机器人

这篇论文针对群体机器人只能依赖局部观测和有限通信、却需要判断同一个未来群体状态的问题,提出去中心化 CS-JEPA:让每个机器人预测共享的未来潜表示,而非重建原始未来状态。实验显示,在少量全局标签、拓扑变化和更大规模群体下,它比匹配的重建基线有更低预测误差、更高机器人间一致性,并改善四步候选计划的价值估计;但验证仍限于模拟器,硬件与闭环控制优势文中未充分说明。

FasTac: A Curved Multispectral Vision-Based Tactile Sensor for High-Speed High-Precision 3D Shape and Force Perception Figure 1
2026-07-31cs.RO

FasTac: A Curved Multispectral Vision-Based Tactile Sensor for High-Speed High-Precision 3D Shape and Force Perception

Xiaofan Lu, Kaiji Huang, Jiahui Chen, Yuankai Lin, Hua Yang, Zhouping Yin

2026-07-31视觉感知三维

面向灵巧手在曲面小接触区同时感知细微几何、法向/切向载荷和瞬态信号的需求,FasTac 将单传感器 RGB-NIR 多光谱光度立体、带边界先验的快速 Poisson 深度重建、位置感知动态卷积三轴力估计与 FPGA 部署结合。实验中深度 MAE 降至 0.0415 mm,法向/剪切力 NMAE 为 2.74%/2.39%,图像到 Fz 延迟为 1.09 ms,并在多物体重建、反馈抓取和振动测量中验证效果。

QQWorld: Quantile-Quantile Matching for World Model Regularization Figure 1
2026-07-31cs.LG

QQWorld: Quantile-Quantile Matching for World Model Regularization

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

Xi’an Jiaotong University

2026-07-31强化学习

这篇论文针对 LeWM 用 Epps–Pulley 正则化潜变量时尾部样本梯度快速消失、导致重尾潜空间影响多步规划的问题,提出以分位数-分位数匹配直接对齐投影潜变量与高斯分位数,并用跨 batch 排序缓解小批量估计。实验显示 QQWorld 在四个控制环境中提高平均规划成功率,同时降低 QQ RMSE 和径向尾部概率。

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction Figure 1
2026-07-31cs.RO

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

2026-07-31强化学习

TacWAM针对接触丰富操作中视觉未来难以监督力、形变、剪切和滑移的问题,将触觉外观、稠密力场和形变流对齐融合,并用触觉历史与AGT注意力让未来触觉只作为训练监督而非动作输入。四个真实任务中平均成功率75.0%,较最强基线高37.5个百分点,消融支持触觉历史和未来目标隔离的作用。

SemAnCorr: Semantic Anchored Correspondence for Zero-Shot Manipulation Skill Transfer Figure 1
2026-07-31cs.RO

SemAnCorr: Semantic Anchored Correspondence for Zero-Shot Manipulation Skill Transfer

Xiaoxiang Dong, William Baron, Hongyi Chen, Uksang Yoo, Jeffrey Ichnowski, Weiming Zhi

2026-07-31机器人

这篇论文针对机器人在形状差异很大的同功能物体间迁移操作技能时,现有特征最近邻匹配语义可用但几何不连贯、难以恢复交互姿态的问题。SemAnCorr不训练新模型,而是通过语义锚点选择、联合位姿-对应优化和函数映射传播建立稠密表面对应,同时约束“在哪里操作”和“如何操作”。在PartNet-Mobility基准上达到90.8%语义准确率,并在真实铰接物体单示范零样本迁移中优于已有对应方法。

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras Figure 1
2026-07-31cs.CV

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras

Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo

2026-07-31视觉感知

面向可穿戴机器人在嵌入式端实时完成 affordance segmentation 的需求,论文关注 RGB-D 深度信息如何在能耗、模型大小和精度约束下真正发挥作用。核心做法是为 RGB-D 设计硬件感知 NAS 搜索空间,并提供将预训练 RGB 网络扩展到深度输入的轻量微调方案。UMD、IIT 实验显示所得模型多数位于精度与 FLOPs/参数量的 Pareto 前沿,并在 Jetson Nano 与 RealSense 原型上实现电池预算内实时推理。

When Robots Exchange Meaning: A Demo of Goal-Oriented Semantic Communications for Collaborative Robotics Figure 1
2026-07-31cs.RO

When Robots Exchange Meaning: A Demo of Goal-Oriented Semantic Communications for Collaborative Robotics

Peizheng Li, Xinyi Lin, Sajida Gufran, Adnan Aijaz

2026-07-31机器人

面向6G协作机器人中通信质量应服务任务执行而非只看包传输的问题,论文搭建了机器人到边缘的语义通信演示平台:机器人侧用VQ-VAE将RGB帧压成语义token,边缘侧重建并结合深度、位姿、LiDAR和RTAB-Map生成可交互语义地图。结果显示320×240图像可降至5400字节、约42.67倍压缩,重建PSNR约21.7–21.9 dB,足以支持粗粒度场景理解和操作员监督,但仍属WIP演示,检测与任务收益评估文中未充分说明。

UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis Figure 1
2026-07-31cs.RO

UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis

Hui Zhang, Julian Ferchow, Jie Song, Mirko Meboldt

2026-07-31机器人

针对灵巧操作中抓取、搬移、手内旋转和平移长期被分别建模、难以连续组合的问题,UniCross从手-物相对运动出发,把四类技能统一到共享状态、动作和目标结构中,并用手中心物体表示支撑跨形状交互。实验显示,单一跨技能策略在各技能上优于专门基线,可泛化到未见物体与不同手形,并在扰动下保持稳定、支持长时序技能衔接。

RaDiVe: Robust 4D Radar Odometry with Distance-Bounded NDT and Velocity-Discrepancy Point Uncertainty Figure 1
2026-07-31cs.RO

RaDiVe: Robust 4D Radar Odometry with Distance-Bounded NDT and Velocity-Discrepancy Point Uncertainty

Sangwoo Jung, Dongjae Lee, Chiyun Noh, Ayoung Kim

2026-07-31学习理论安全鲁棒

针对4D雷达点云稀疏、噪声大且位置精度有限导致配准里程计不稳的问题,RaDiVe将NDT对应限制在近距离体素对,并用多普勒径向速度与自车速度预测的偏差估计点不确定性,同时借助SDF表面提取构建低噪局部子图。在多个公开数据集上,相比次优基线平均降低平移ATE 44.4%、旋转ATE 21.3%,且保持实时运行。

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow Figure 1
2026-07-31cs.LG

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

2026-07-31生成模型强化学习

ODEWorld针对离散时间世界模型难以处理连续物理动态、 irregular sampling 和长时预测的问题,提出PT-Flow:在解耦出的动态潜空间中学习物理时间上的ODE速度场,用ODE求解器完成前后向预测。实验覆盖LIBERO、AgiBot-World等仿真与真实机器人数据,显示其在长程视频重建、任意时间分辨率生成和下游策略学习中优于离散式基线。

Learning Social Robot Navigation By Sensing Human Legs Figure 1
2026-07-31cs.RO

Learning Social Robot Navigation By Sensing Human Legs

Alberto Vaglio, Andrea Garulli, Antonio Giannitrapani, Renato Quartullo, Tommaso Van Der Meer

2026-07-31机器人

这篇论文针对低位2D激光雷达在行人环境中实际只能看到腿部而非整个人体、传统圆形行人近似会放大仿真到现实差距的问题,提出NSG步态模型、LegNav仿真器和结合1D卷积、时序注意力与MLP的CALF策略,直接从连续雷达帧学习腿部运动特征。实验显示,CALF在未见动态场景中兼顾成功率、低主动碰撞和让行合规性,并可零样本部署到TurtleBot 4,实现较平滑的社会化导航。

Static In, Dynamic Out: Counterfactual Action Augmentation for Moving Object Manipulation Figure 1
2026-07-31cs.RO

Static In, Dynamic Out: Counterfactual Action Augmentation for Moving Object Manipulation

Woo Chul Shin, Zhenyang Chen, Alfred Cueva, Nadun Ranawaka Arachchige, Yingyan Celine Lin, Benjamin Joffe, Shreyas Kousik, Danfei Xu

Georgia Institute of Technology

2026-07-31机器人

这篇论文针对静态演示训练的视觉运动策略在传送带、摆动果实等动态目标上失效的问题,提出 SIDO:把移动物体操作拆成未来位姿预测与到达该位姿,并用反事实位移重塑静态演示动作块以保持手-物相对位姿。仿真三任务、五种运动模式和两个真实任务中,SIDO 相比当前位姿输入、动作补偿等基线提升动态成功率,同时基本保持静态性能。

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents Figure 1
2026-07-31cs.RO

RoboBRIDGE: A Modular Framework for Bridging Policies to Robust Real-World Robotic Agents

Sihyung Yoon, Minjong Yoo, Sanghyun Ahn, Seojeong Choi, Honguk Woo

IITP-ITRC (Information Technology Research Center) grant funded by the Korea government (MSIT) (IITP-2025-RS-2024-00437633)., Department of Computer Science and Engineering, Sungkyunkwan University ∗ Equal contribution. † Honguk Woo is the corresponding author.

2026-07-31机器人强化学习安全鲁棒

论文针对 VLA 作为单步动作预测器部署时缺少失败恢复、长程一致性和域外鲁棒性的问题,提出 RoboBRIDGE:用监控、感知、规划、控制和机器人接口五个模块包装任意策略,并结合异步场景更新、偏离触发重规划、分层恢复和面向原语的 LoRA 微调。作者在 LIBERO、RoboCasa 及多平台真实机器人实验中报告其相对独立 VLA 和已有增强部署均有稳定提升。

DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection Figure 1
2026-07-31cs.RO

DexDirect: Direct Kinesthetic Arm Guidance for Efficient Dexterous Demonstration Collection

Beom Jun Kim, Shiu-Jen Wang, Jonathan Liu, Alvin Zhu, Quanyou Wang, Hanzhang Fang, Feng Xu, Mingzhang Zhu, Yuchen Cui, Dennis W. Hong

2026-07-31模仿学习

面向灵巧手模仿学习中示教采集慢、硬件成本高、操作者负担重的问题,DexDirect将机械臂端的直接动觉牵引与单摄像头手指重定向结合,避免臂侧外部跟踪和重定向误差。10人5任务实验中,其成功示教数显著高于AnyTeleop和TeleDex,并降低总体NASA-TLX负荷;用其数据训练的扩散策略在方块抓取放置上达到90%成功率。

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy Figure 1
2026-07-31cs.RO

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

The Hong Kong University of Science and Technology

2026-07-31生成模型强化学习

这篇论文针对流匹配 VLA 策略在部署分布偏移下易累积错误、离线 RL 又难以利用失败轨迹的问题,提出 RedFlow:从相似执行上下文中为失败动作片段匹配成功替代动作,并用自适应目标同时强化成功、抑制坏动作、重定向可恢复失败。在 LIBERO 与三项真机任务上,RedFlow 超过 AWR/DPO 等离线基线,真机成功率由 56.7% 提升到 74.7%,并以约少一个数量级样本接近在线 RL 表现。

Articulated Object Reconstruction from Rest-State Observation Figure 1
2026-07-31cs.CV

Articulated Object Reconstruction from Rest-State Observation

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

2026-07-31三维

这篇论文针对现有铰接物体重建依赖多状态或显式运动观察的问题,提出从关闭静止状态推断家具等物体的部件几何与关节参数。核心做法是以显式网格作为跨模型校验载体,融合 VLM、SAM 分割与视频扩散生成的运动假设,并用几何一致性约束关节估计。实验显示 Rest2Art 在部件分解和关节估计上可与观察运动的重建方法及生成式基线竞争,但结果仍依赖预训练模型先验质量。

Write-Safe Flow Field Mapping under Ambiguous Onboard Sensing and Localization Drift Figure 1
2026-07-31cs.RO

Write-Safe Flow Field Mapping under Ambiguous Onboard Sensing and Localization Drift

Linhao Jin, Qimin Feng, Peter Gunnarson, Qiang Zhong

2026-07-31生成模型安全鲁棒

这篇论文针对水下/流场机器人在局部传感存在混淆、定位漂移时把“看似合理”的局部流速补丁写错到全局地图、形成幽灵结构的问题,提出将在线建图显式表述为写入安全性判断:模型同时预测局部速度补丁、信息量和写入安全分数,并用地图参考感知的连续门控保守融合不确定更新。实验显示,在合成射流与横流场景中平均幽灵污染较无门控降低42%,真实推进器尾流零样本回放降低39%,同时保留81%地图覆盖。

LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents Figure 1
2026-07-31cs.RO

LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents

Jingya Wang, Yuyang Gao, Liuzhenghao Lv, Yonghong Tian, Yuyang Liu

School of AI for Science, Peking University, School of Electronic and Computer Engineering, Peking University, School of Computer Science, Peking University

2026-07-31安全鲁棒

面向湿实验室机器人难以在动态环境中安全执行、且每次任务近似冷启动的问题,LabEvolver提出无需训练的双循环框架:内循环用实验状态、LabSkill动作和三层安全门做在线规划与校验,外循环将完成轨迹蒸馏为技能、策略和安全经验复用。实机配液任务中,pH调节完成时间降48.2%、安全拦截降60.0%;ALFWorld 500个连续任务20步内成功率由ReAct的76.2%升至91.4%,但跨真实实验场景的泛化范围仍有限。

HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution Figure 1
2026-07-31cs.AI

HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution

Taewoo Park, Kyeonghyun Yoo, Kiseok Kim, Seunghyun Yoo, Hwangnam Kim

2026-07-31安全鲁棒

这篇论文针对智能体输出包含通知、请求和外部动作时的运行时状态漂移问题:整包拒绝会丢掉仍有效内容,逐项检查又可能破坏依赖。HALO的核心是把一次响应拆成带前置条件的组件,在接入时保留依赖一致的最大有效子集,并在动作真正下发前重新校验,只允许被阻塞动作以新候选形式恢复。实验中其通过96项接入预期和20项协议测试,在回放中保留全部248个受支持组件,PX4/Gazebo中阻断所有测试过期路线并完成新鲜恢复。

Arm2Air: Cross-Embodiment Skeleton Transfer for 3D Relay Formation Figure 1
2026-07-31cs.RO

Arm2Air: Cross-Embodiment Skeleton Transfer for 3D Relay Formation

Dohun Lee, Kyeonghyun Yoo, Seokmin Kim, Byongho Lee, Seungjoo Oh, Hwangnam Kim

2026-07-31三维

这篇论文针对灾后或城市高遮挡场景中无人机中继链的三维部署难题:传统直接搜索既要避障又要满足视距、跳距、容量和时延约束,计算代价高。Arm2Air 的核心洞察是把机械臂运动中的有序避障骨架迁移为无人机中继骨架,并用 Transformer、LoRA 和通信感知优化细化位置。实验显示其在高杂波地图上显著缩短规划时间,并提升瓶颈容量、稳定跳距与少样本适配效率。

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models Figure 1
2026-07-31cs.AI

World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models

Xiangcheng Zhang, Yilun Du

Harvard University

2026-07-31强化学习

这篇论文针对端到端模仿学习在新场景、长程组合任务和物体位置变化下泛化差的问题,提出 World Action Planner:由 VLM 生成初始动作,再用姿态图像条件的多视角动作世界模型想象 rollout,并通过反馈优化与局部搜索修正计划。实验显示其在组合任务、新布局和零样本测试中优于 VLA、WAM 等策略,但结果主要来自仿真环境,真实机器人迁移与数据规模影响文中未充分说明。

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response Figure 1
2026-07-31cs.RO

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

2026-07-31视觉语言视觉感知

面向灾害分诊中无人机数据流和ICS协同带来的操作员负担,论文提出以MBSE建模的VLM协调代理框架,把自然语言交互、任务分配和UAV任务控制接入软件在环流程,而非仅做决策建议。初步7人实验显示AI辅助条件下降低心理需求、努力和挫败感,并获得较高信任与沟通清晰度评分;但样本很小,实机、多机和复杂场景验证仍不足。

Cross-Embodiment Transfer via Behavior-Aligned Representations Figure 1
2026-07-31cs.RO

Cross-Embodiment Transfer via Behavior-Aligned Representations

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

2026-07-31机器人

这篇论文针对跨机器人本体模仿学习中观测和动作空间难以对齐、迁移收益不稳定的问题,提出用行为对齐表征作为隐式桥梁,如末端执行器轨迹、语言运动描述和目标框,并与 VLA 动作预测联合训练。实验在新建 RoboCasa-X 基准和真实机器人上比较不同表征,发现末端轨迹最有效,表征在更大预训练数据和无动作数据下更有价值,仿真到真实迁移任务进度提升 28%。

Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling Figure 1
2026-07-31cs.RO

Failure Detection for Surgical Robot Imitation Policies via Flow-Matching World Modeling

Zhefeng Huang, Yilin Cai, Ankit Patel, Mohammad Hajiha, Brendan Browne, Yue Chen

2026-07-31机器人视觉感知生成模型强化学习模仿学习

面向手术机器人模仿策略部署中失败样本稀缺、误报代价高的问题,论文提出 FoMo-FD:用动作条件 flow-matching 世界模型学习成功执行的短时视觉潜在动力学,并以观测终点 latent 的逆传输非一致性做窗口级报警,经成功轨迹保形校准阈值。在仿真和真实 dVRK 的4类任务、20种失败模式上,腕部相机视角达到96.6%检测率、1.3%误报率,优于逐帧异常和预测误差基线。

Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response Figure 1
2026-07-31cs.RO

Corrigible Assistance in One Round: Pragmatic-Pedagogic Best Response

Elle Lazarski, Jaime Fernández Fisac

Department of Electrical and Computer Engineering, Princeton University, USA, Abstract. Assistance games formalize human–robot collaboration un-, collaborative block-building example., pose the problem as a dynamic two-player collaboration between a human user, collaborative block-building domain, comparing IOC against PPBR under a

2026-07-31机器人

论文针对辅助博弈中机器人需从人类动作推断目标、但完整 POMDP 规划难以在线求解的问题,指出在动作可分的一类任务里,务实—教学式推理可让人类一步消除目标歧义。作者提出 PPBR,用一轮最佳响应直接求得全时域最优均衡,并证明其可突破传统 IOC/IRL 的后验推断上限;积木协作实验显示该策略在多种初始信念下比 IOC 更能让人纠正机器人行为。

Simulation of Surgical Suturing Using Position-Based Dynamics and the Material Point Method for Robot Reinforcement Learning Figure 1
2026-07-31cs.RO

Simulation of Surgical Suturing Using Position-Based Dynamics and the Material Point Method for Robot Reinforcement Learning

Tleukhan Mussin, Yafei Ou, Mahdi Tavakoli

2026-07-31机器人强化学习

面向手术机器人强化学习,论文针对缝线、针具与可变形软组织接触难以同时高效仿真的问题,将PBD缝线与MPM软组织耦合,并加入摩擦、拖曳等双向接触建模,在GPU并行场景中构建缝合子任务训练环境。实验显示,ML-Agents在针插入和拔出任务上能稳定学习,严格阈值下成功率分别为80%和68%,但完整缝合与真实迁移仍未充分验证。

It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation Figure 1
2026-07-31cs.RO

It's Not Just More Demos: Counterfactual Action Sensitivity Coverage for Data-Efficient Robust Robot Imitation

Giovanni D'urso, Kaushik Roy, Nicholas Lawrance, Brendan Tidd

2026-07-31机器人模仿学习安全鲁棒

这篇论文针对视觉模仿学习在光照、颜色、干扰物等任务无关变化下容易失效的问题,提出 CFNBC:用保持专家动作不变的反事实图像对测量策略的 action drift,并按高敏感且响应多样的样本选择少量修复数据。实验显示 action drift 与扰动下失败率高度相关,在两个仿真操作任务中仅用 20–30 个候选样本微调,就明显优于同预算随机选择,并接近更大随机数据预算的鲁棒性。

2026-07-30

43 篇
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Figure 1
2026-07-30cs.CV

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

Huazhong University of Science and Technology, 2 Huawei Technologies Co. Ltd, China

2026-07-30视觉语言视觉感知

TurboVLA针对现有VLA以大语言模型为执行核心导致推理慢、显存高的问题,主张执行级操控不必依赖开放式语言生成,而是将视觉与指令分别编码后直接进行轻量双向交互,并用紧凑解码器预测连续动作块。在LIBERO上,其以0.2B参数、0.9GB显存和31.2ms延迟达到97.7%成功率,显示实时部署潜力,但高层规划与复杂语义能力仍受限。

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion Figure 1
2026-07-30cs.CV

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys

Microsoft Spatial AI Lab

2026-07-30视觉感知

VidMap面向机器人和可穿戴视频中常见的长序列、未知标定、快速或退化运动等问题,试图弥合SLAM因因果跟踪易漂移失效与SfM忽略时序易受视觉对称干扰的缺口。其核心是把视频时序作为全局SfM的一等约束,结合密集宽基线匹配、区分局部跟踪与回环,并引入度量单目深度先验抑制尺度漂移。实验显示,在含极端运动和视觉歧义的数据集上,相比经典及学习式SLAM/SfM在已知或未知内参下更鲁棒、更准确。

HumanCLAW: Can Vision-Language Models Act Through a Body? Figure 1
2026-07-30cs.CV

HumanCLAW: Can Vision-Language Models Act Through a Body?

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

2026-07-30视觉语言视觉感知

论文针对VLM具身评测中“决策错误”和“低层控制失败”难以区分的问题,提出HumanCLAW:让冻结VLM输出原子全身技能,由运动生成器和半物理仿真执行,从而隔离行动决策能力。基于1218个室内长程找寻-导航-交互任务评测9个前沿VLM,最佳成功率仅16.8%,说明瓶颈不在目标识别,而在缺乏对自身位置、到达状态和碰撞后果的具身自我感知。

DLAM: Distributional Latent Actions with Temporal Constraints Figure 1
2026-07-30cs.RO

DLAM: Distributional Latent Actions with Temporal Constraints

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

2026-07-30优化算法

这篇论文针对 VLA 机器人策略缺少动作标注数据、而视频 latent action 容易只学到重建相关变化的问题,提出 DLAM:把帧间转移从确定性点扩展为对角高斯,并用等间隔三帧上的归一化组合与反转约束同时规范均值和方差;下游只用冻结编码器的均值作为流匹配策略的辅助目标。在持出视频上其时间一致性和重建优于 LAM/ALAM,迁移到 MetaWorld、LIBERO 和真实任务也提高成功率,但方差是否为校准不确定性文中未充分说明。

Controlled Experiments on Lane Changing by Transitional Autonomous Vehicle: Dataset and Behavioral Insights Figure 1
2026-07-30cs.RO

Controlled Experiments on Lane Changing by Transitional Autonomous Vehicle: Dataset and Behavioral Insights

Abhinav Sharma, Md Abdullah Al Hasan, Danjue Chen, George F. List

2026-07-30规划控制数据集/基准

针对具备自主变道能力的过渡型自动驾驶车辆缺少系统实证数据的问题,论文构建NC-tALC公开道路受控数据集,记录78次强制变道并分析完整过程。结果显示,不同初始间隙会在跨线附近收敛到较窄的前后间隙范围,碰撞风险随变道推进上升、在进入目标车道附近峰值,且主要来自目标车道前车,变道结束后风险仍可能存在。

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations Figure 1
2026-07-30cs.LG

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

Kaizhen Tan (1 and 2), Xin Xu (2), Siru Tao (2), Hanzhe Hong (2), Yang Feng (3), Heqing Du (3) ((1) New York University, (2) Carnegie Mellon University, (3) Columbia University)

New York University, New York, NY, USA, Carnegie Mellon University, Pittsburgh, PA, USA, Columbia University, New York, NY, USA

2026-07-30视觉语言强化学习

这篇论文追问潜在世界模型是否真的在预测中学到机器人操作所需的物理量。作者用可控 PokeWorld 和“可恢复性证书”区分环境不可观测与表征未学习,并系统改变输入模态、预测目标和预测时域。结果显示:输入决定上限,预测目标决定保留;触觉刚度只有在预测触觉时进入 latent,视觉单步预测会丢弃可见状态;阻力虽可从观测恢复,却几乎不被测试的确定性预测目标学到。RH20T 实验进一步表明,缺少信息或预测压力时,增加数据也基本无效。

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models Figure 1
2026-07-30cs.RO

RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

Derek Ming Siang Tan, Shailesh Shailesh, Srikrishna Iyer, William Wei Jie Teo, Yuanliang Ju, Qiao Gu, Guillaume Sartoretti

National University of Singapore, University of Toronto

2026-07-30视觉语言视觉感知强化学习

针对VLA在困难和分布外操作任务中易退化、现有测试时 steering 样本多样性不足且干预不分场景的问题,RL2-VLA用VLA潜变量训练轻量离线RL策略,并在推理时与冻结VLA的flow velocity组合;其关键洞察是失败状态下多样性有益、成功状态下可能扰动正确动作,因此仅在预测失败时启用steering。SIMPLER、PolaRiS及真机实验显示,分布外成功率最高提升17.3%,真机平均提升17.5%。

SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception Figure 1
2026-07-30cs.RO

SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception

Gabe Everett, Brice Gunter, Ryan Vander Stelt, Cleiver Ruiz-Martinez, Blake Hull, Juan Rojas

EECE, Lipscomb University, Nashville, TN, USA

2026-07-30机器人

针对真实机器人在线强化学习训练耗时长、少量交互难以快速部署的问题,SymmGrid 将轨迹级状态-动作对组织为对称树/网格,通过并行分支仿射变换扩充回放数据,并用指针和单应性分别处理自我/外部视觉。实机插孔、走线和搬移任务中,相比 SOTA 收敛提速 1.37-2.17 倍、成功率提升 1.09-1.27 倍,nAUC 最高提升 2.59 倍,增益可能主要来自 scaling / data。

Dense Soft Weighting for Radar Ego-Velocity Estimation Figure 1
2026-07-30cs.RO

Dense Soft Weighting for Radar Ego-Velocity Estimation

Atar Babgei, Chenyu Zhao, Michael Breza, Julie A. McCann

Imperial College London

2026-07-30机器人

这篇论文针对视觉退化场景下单芯片毫米波雷达自运动估计过度依赖 CFAR 稀疏检测、丢弃弱多普勒线索的问题,提出 Dense Soft Weighting:为每个距离-多普勒单元分配连续置信度,并用鲁棒加权最小二乘同时输出速度和协方差。实验覆盖两个公开数据集和自采数据,在相同惯性后端下相对最强 CFAR 点云基线将平均绝对位姿误差降低 31–45%,且可在嵌入式硬件实时运行。

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method Figure 1
2026-07-30cs.LG

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

Graduate School of Engineering, The University of Tokyo, Tokyo, Japan

2026-07-30强化学习

这篇论文针对 LeWorldModel 在多任务机器人操作中用边际 SIGReg 会压缩任务相关潜在簇间距、造成状态混淆的问题,提出把 SIGReg 施加到时间中心化残差而非完整潜变量上,以保留抗坍塌同时减少对多模态任务结构的破坏。在 LIBERO 上,TC-LeWM 将四套件平均成功率从 53.2% 提升到 73.6%,40 任务联合训练也达 73.5%,显示改进主要来自更适合多任务结构的正则化目标。

BioVLN: A Simulation Platform for Visual Language Navigation in Biomedical Laboratories Figure 1
2026-07-30cs.RO

BioVLN: A Simulation Platform for Visual Language Navigation in Biomedical Laboratories

Zhe Liu, Quan Lu, Zhaohui Du, Zhe Wang, Huanbo Jin, Jiaming Gu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

2026-07-30机器人

这篇论文针对实验室机器人导航不能只到达仪器附近、还必须从可操作面安全接近的问题,提出 BioVLN 仿真平台,用仪器本体、周边安全间隙和前方操作区三区域统一建模目标、场景生成、评测与安全分析。平台包含程序生成和人工标注场景,共 47 个场景、1667 个任务;实验显示在操作区采样多个有效目标点可将成功率提升到 83.3–92.5%,并降低不安全近距离接触。

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence Figure 1
2026-07-30cs.AI

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

Jia Luo

2026-07-30视觉感知

本文针对机器人操作数据难规模化、人体视频又受形态差异限制的问题,提出 Pegasus:先从人类视频抽取任务图,再结合 affordance、约束图和机器人规划图生成可学习示教,并用层级 affordance latent 与闭环物理校验约束可执行性。实验称在 GTEA Gaze+、EPIC-KITCHENS-100 等基准上提升任务正确性、可执行性、状态一致性和策略学习效果,但具体增益来源仍需看完整实验细节。

Convex Collision-Free Regions Figure 1
2026-07-30cs.GR

Convex Collision-Free Regions

Tomoyo Kikuchi, Takashi Kanai

Kyoto University, The University of Tokyo, Kyoto University Japan, The University of Tokyo Japan

2026-07-30优化算法

论文针对可变形体仿真中碰撞约束常被隐式处理、易产生二次碰撞且依赖特定非线性优化的问题,提出按顶点构造局部凸无碰撞可行域,将几何非穿透投影与排斥、摩擦响应解耦。方法覆盖 VF、EE 等接触并适配 XPBD,在布料、头发、线体、粒子和余维接触场景中展示了更可并行、无需 Hessian 或刚度调参的碰撞处理效果。

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction Figure 1
2026-07-30cs.GR

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction

Gahye Lee, Gyoonseo Kim, Wonjong Jang, Jooeun Son, Seungyong Lee

2026-07-30三维

StructureGS针对铰接物体重建中几何、外观与运动参数相互纠缠的问题,在3D Gaussian Splatting中为每个部件引入定向包围盒,并用部件拟合与接触损失约束空间紧致性和物理连接关系。实验显示其相比主要依赖光度监督的方法获得更清晰的部件分解、更准确的运动估计,并在稀疏视角下更稳定,但弱视觉变化场景仍可能失败。

NeoRacer: An Open, Standardized 1:12 Scale Autonomous Race Car for Benchmarking and Education Figure 1
2026-07-30cs.RO

NeoRacer: An Open, Standardized 1:12 Scale Autonomous Race Car for Benchmarking and Education

Koneshka Bandyopadhyay, Ansh Mehta, Bassel El Mabsout, Renato Mancuso

2026-07-30数据集/基准

论文针对自主赛车与机器人教育缺少开放、低成本且可复现实验硬件的问题,提出预装配的 1:12 NeoRacer 平台,以 Jetson Orin Nano、270° LiDAR、120 fps 全局快门相机、IMU 和 ROS2 软件栈组成标准化基准。主要结果是其以约 2699 美元提供高于同类平台的算力、低于预装替代方案一半以上的成本,并在 MIT 与 BU 小规模教学部署中验证了可用性。

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching Figure 1
2026-07-30cs.RO

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang

2026-07-30安全鲁棒

针对室内视觉平面图定位中相似走廊、对称房间导致的多峰位姿不确定性,论文将问题改写为直接估计条件位姿分布,而非先预测射线再穷举匹配。CF2Loc用图像条件扩散模型生成全局候选,再在候选局部裁剪上回归亚米级残差,避免离线地图预处理和查表;在S3D full与ZInD上报告达到SOTA精度、鲁棒性和效率。

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations Figure 1
2026-07-30cs.RO

Practice Makes Policies: Bootstrapping and Consolidating Robotic Capabilities from Zero Human Demonstrations

Jialiang Li, Yuhan Wang, Haojun Li, Gaojing Zhang, Yangtian Ye, Qipeng Liu, Haotian Liang, Wenzhao Lian

2026-07-30机器人模仿学习

面向开放环境中的长程机器人操作,论文指出现有方法要么依赖静态技能和人工示范,要么难以把交互经验转化为高效闭环控制。HERO 将启发式推理、样例复用和反射式视觉运动策略置于分层调度框架中,从零人工示范自主采集、迁移并固化经验。实验显示其可减少数据收集中的人工介入,并在多类操作任务上保持较稳健执行,但对深度感知、VLM 推理延迟和预定义原语仍有依赖。

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA Figure 1
2026-07-30cs.RO

Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

2026-07-30机器人

这篇论文针对 MoE-VLA 在机器人操作中仅凭视觉语言输入路由专家、却需要区分不同动作运动学模式的问题,提出 KinRT:先用示教轨迹做运动学聚类,把簇 ID 作为路由监督,再在推理时仅由观察预测专家分配。其核心洞察是许多语义不同任务会塌缩到少数运动学原型。实验称在 RoboTwin 和自建低成本 DIYRobot 平台上分别较 dense 与 MoE VLA 提升 23.26% 和 20.27%,但具体增益是否部分来自平台数据设置仍需看完整实验细节。

Risk-Aware Motion Planning with Learned Trajectory Primitives and Probabilistic Safety Assessment Figure 1
2026-07-30cs.RO

Risk-Aware Motion Planning with Learned Trajectory Primitives and Probabilistic Safety Assessment

Marc Kaufeld, Dian Zhuang, Johannes Betz

ensuring safety and interpretability. The code is available as, Systems, Technical University of Munich, 85748 Garching, Germany, Munich Institute of Robotics and Machine Intelligence (MIRMI)., The author is with the School of Engineering and Design, Technical, University of Munich, 85748 Garching, Germany

2026-07-30规划控制安全鲁棒

面向城市自动驾驶中不确定交通参与者带来的碰撞风险与优化规划计算负担,本文将RBFN学习的jerk最小运动基元、解析碰撞概率评估和MPC轨迹细化串联起来,把候选探索与安全验证从优化中拆开。实验显示,该混合框架相比解析采样或纯优化基线具有更低碰撞率、较少车辆约束违规,MPC细化后可行率达到96%,但真实场景和分布外鲁棒性仍待验证。

CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation Figure 1
2026-07-30cs.RO

CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation

Yushan Liu, Peibo Sun, Xintao Chao, Zhenyang Yang, Yifan Xie, Lingfeng Zhang, Shoujie Li, Chenyu Tang, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

2026-07-30机器人强化学习

这篇论文针对长时程移动操作中 VLA 分块开环执行易在中途偏离、且置信度或纯观测异常难以及时发现的问题,提出用冻结的动作条件世界模型把已提交动作视为对未来观测的可检验预测,并用保形校准阈值触发带延迟约束的后缀修复与关键帧记忆。在 RoboCasa365 上,CheckVLA 平均成功率为 36.1%,较同调用预算的周期重规划高 8.5 个百分点,动作条件检测的及时召回也明显优于无动作条件对照。

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic Figure 1
2026-07-30cs.RO

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang

2026-07-30视觉感知规划控制

这篇论文针对时序逻辑机器人规划中常依赖精确物体几何、回避视觉到符号绑定的问题,提出 Vision-TL-Action:用无坐标 TL 语法图、多视角视觉 token 与双向交叉注意力生成轨迹,并以训练期谓词到区域监督促进 grounding。Panda 上 Success@1024 达 67.45%,高于 oracle-state 基线 59.11%;AntMaze 上 96.35% 接近 oracle 96.88%,但单样本较弱,增益可能主要来自候选采样覆盖。

Global Sensitive-Based Input Shaping for UAV-Payload Precision Motion Control Figure 1
2026-07-30eess.SY

Global Sensitive-Based Input Shaping for UAV-Payload Precision Motion Control

Karan Baker, Sanjay Maharjan, Tariq Hlayel, Oladapo Ogunbodede, Dutch Dunphy, Adrian Stein

2026-07-30规划控制

面向无人机吊载运输中负载摆动易被绳长、载荷质量不确定性放大的问题,论文将全局敏感性分析和 Shapley 值约束引入输入整形器设计,用于降低控制器对未知参数的敏感度。仿真对比非鲁棒、鲁棒与 minimax 方案,显示 GSA/Shapley 输入整形可改善残余摆动与鲁棒性且不增加机动时间;但实验验证尚未完成,计算开销和多目标权衡仍是限制。

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games Figure 1
2026-07-30cs.RO

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

2026-07-30强化学习规划控制

本文针对开放世界游戏中潜在世界模型虽能预测相似未来、却对不同动作序列不敏感的“Context Collapse”问题,提出 ActSWM,将动作敏感性作为滚动预测约束,并要求局部转移可恢复对应动作。实验显示其在 Minecraft 闭环规划中较 LeWM 在采石、搭柱任务上最高提升 45% 和 30%,动作相关 rollout 间隔约为最强基线 380 倍,并提升跨游戏离线视频动作恢复效果。

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control Figure 1
2026-07-30cs.RO

Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Yichao Yan

Shanghai Jiao Tong University, South China University of Technology, Qilu University of Technology (Shandong Academy of Sciences)

2026-07-30强化学习规划控制

这篇论文针对机器人控制中世界生成模型推理开销高、常需显式生成未来视频的问题,提出 Enfold:用训练时生成器处理真实未来时的多层中间状态监督当前观测和语言条件编码器,将“生成未来的计算”折叠为可直接用于动作预测的表征。结果显示其在 LIBERO、RoboTwin2.0 和真机任务上保持高成功率,并相对 Fast-WAM 将动作延迟降低 3.7 倍,Flash 版达 10.1 倍。

ContactFlow: A video action conditioning that transfers across embodiments Figure 1
2026-07-30cs.RO

ContactFlow: A video action conditioning that transfers across embodiments

Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum

University of Bonn, Lamarr Institute

2026-07-30视觉感知生成模型

这篇论文针对视频世界模型在机器人操作中常忽略接触物理、且动作条件绑定特定手爪或关节的问题,提出 Contact Flow:用演员与目标物体之间 3D 接触点轨迹作为跨人手与机器人共享的动作表示。作者将其用于条件视频生成,并接入“提出-想象-验证-执行”流程;在 DROID、未见操作基准和真实桌面任务中展示了跨 embodiment、场景和物体的零样本迁移,但实时性和对深度、标定、分割质量的依赖仍是限制。

Semi-Decentralized Multi-Spacecraft Collision Avoidance under Communication Constraints Figure 1
2026-07-30cs.RO

Semi-Decentralized Multi-Spacecraft Collision Avoidance under Communication Constraints

Grace Ra Kim, Mahdi Al-Husseini, Duncan Eddy, Mykel J. Kochenderfer

PhD Candidate, Aeronautics and Astronautics, Stanford University, 496 Lomita Mall, Stanford, CA 94305, Post-Doctoral Researcher, Aeronautics and Astronautics, Stanford University, 496 Lomita Mall, Stanford, CA 94305, Professor, Aeronautics and Astronautics, Stanford University, 496 Lomita Mall, Stanford, CA 94305

2026-07-30优化算法

面向低轨卫星数量增长下多运营方避碰需在延迟、间歇通信中协同的问题,本文将多航天器避碰建模为由地面站可见窗口驱动的半去中心化 POMDP,并用近似 RS-SDA* 求联合机动策略。仿真显示其在代表性会合场景中接近集中式机动质量,同时比连续协调少 28.5% 同步事件,且较规则启发式更稳定满足安全距离并减少不必要轨迹偏移。

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots Figure 1
2026-07-30cs.RO

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

∗Equal contribution. 1University of California San Diego, 2VinMotion, Hanoi University of Science and Technology, 4VinUniversity, 5University, level distillation with pseudo-label supervision from the

2026-07-30机器人视觉感知

论文针对人形机器人抓取中语音比文本更自然、但ASR级联易误识别且延迟高的问题,提出Speech2Grasp:用Whisper语音编码器加轻量MLP投影器,将语音表示对齐到冻结ALBEF的图文联合空间,并以小规模语音数据完成迁移。诊断实验显示该对齐能保留语义区分和跨说话人鲁棒性;仿真与真实人形机器人实验中,其抓取检测率达到或优于ASR管线,同时降低推理延迟。

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models Figure 1
2026-07-30cs.RO

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

Zhejiang University, Hangzhou, China, Shanghai Innovation Institute, Shanghai, China, Fudan University, Shanghai, China, Westlake University, Hangzhou, China, Shanghai Jiao Tong University, Shanghai, China

2026-07-30视觉语言视觉感知

这篇论文针对VLA模型过度依赖2D观测、缺少物体运动学与结构先验而导致精细操作泛化差的问题,提出SAGE框架,用Concept Expert从3D视觉基础模型初始化并动态跟踪Analytic Concepts,将其转化为空间约束和密集奖励来指导SFT/RL微调。实验显示其在多类操作任务中提升成功率与样本效率,尤其适用于铰接物体,但具体增益中视觉模型初始化与奖励设计各自贡献仍需更多消融说明。

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning Figure 1
2026-07-30cs.RO

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

Shuhang Wang, Ziming Li, Hui Cheng

2026-07-30机器人生成模型强化学习

RLMM-Flow针对移动操作中基座与机械臂需同时满足避障、运动学约束和平滑性的难题,试图突破仅靠示范预训练的流策略受数据分布限制的问题。其核心是在冻结的点云条件流生成器上,用潜空间强化学习调节初始噪声,并通过动作 critic 预热、粗到细潜变量控制和基座先于手臂的级联结构稳定训练。实验声称在仿真和真实场景中相较模仿式流策略及后训练基线提升成功率、减少碰撞并改善轨迹质量,同时保持较快推理。

Global Exponential Stabilization of the Kinematic Bicycle Model of a Car in Polar Coordinates Figure 1
2026-07-30eess.SY

Global Exponential Stabilization of the Kinematic Bicycle Model of a Car in Polar Coordinates

Velimir Todorovski, Kwang Hak Kim, Alessandro Astolfi, Miroslav Krstic

and Engineering Division, King Abdullah University of Science and

2026-07-30机器人

针对类汽车机器人低速泊车中,笛卡尔坐标下受 Brockett 条件限制、平滑静态反馈难以全局稳定且轨迹不够像真实泊车的问题,论文将运动学自行车模型变换到极坐标,并引入距离归一化坐标,把系统整理为 strict-feedback 结构以做非传统 backstepping。结果给出平滑反馈律和控制 Lyapunov 函数,实现变换坐标下全局指数稳定、极坐标输出全局指数稳定,并生成近似人类驾驶的泊车轨迹。

Reinforcement Learning on Cost-Constrained Quadrupedal Hardware Figure 1
2026-07-30cs.RO

Reinforcement Learning on Cost-Constrained Quadrupedal Hardware

Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus

B. P. Ölveczky is with the Department of Organismic and Evolutionary Biology, Harvard University, Cambridge, MA 02138 USA., S. A. Baccus is with the Department of Neurobiology, Stanford University School of Medicine, Stanford, CA 94305 USA.Code and models: github.com/baccuslab/SpotDMouse

2026-07-30强化学习

这篇论文针对低价四足机器人因舵机通信延迟、反馈噪声和状态缺失导致的 sim-to-real 失败,指出问题本质是高延迟下的部分可观测控制。作者在 Mini Pupper 2 上用校准延迟执行器模型比较 MLP、LSTM、GRU 和 Transformer,核心洞察是应按控制层时间尺度选择架构:LSTM 的线性记忆通道能形成类似 CPG 的自主节律。结果显示 LSTM 可在 76 ms 延迟硬件上用较少调参部署,并对额外 320 ms 延迟和地形扰动更稳健,而 MLP 依赖手工 PD 桥,GRU/Transformer 表现或成本不适合。

FleetScape: A Mixed Reality Sandtable for Spatial Supervision and Control of Scalable Drone Fleets Figure 1
2026-07-30cs.HC

FleetScape: A Mixed Reality Sandtable for Spatial Supervision and Control of Scalable Drone Fleets

Peisen Xu, Jérémie Garcia, Peter Cleveland, Ooi Wei Tsang, Christophe Jouffrais

National University of Singapore, IPAL, University of Toulouse, Fédération ENAC ISAE-SUPAERO ONERA, National University of Singapore, School of Computing, University of Toulouse, Fédération ENAC ISAE-SUPAERO ONERA Toulouse France, CNRS, IPAL, Singapore National University of Singapore, Augmented Human Lab Singapore, National University of Singapore, School of Computing Singapore

2026-07-30视觉感知规划控制

针对多无人机从单机遥控扩展到集群监督后,传统2D界面难以维持空间态势和控制切换的问题,FleetScape将机群监管重构为MR三维沙盘交互,叠加任务、安全与环境数据,并支持自动巡检、手动接管和半自动路线编辑。6名专业飞手实验显示,5到10架无人机仍可保持较好态势感知,规模继续增大后认知负荷上升,操作者转向异常驱动的反应式监控。

Sensor-Placement-Agnostic Sonomyography: Toward Continuous High-Dimensional Control by Users with Tetraplegia Figure 1
2026-07-30cs.HC

Sensor-Placement-Agnostic Sonomyography: Toward Continuous High-Dimensional Control by Users with Tetraplegia

Gavin Sueltz, Vikram Athithan, Emma Ferran, Maria Herrera, Carson J. Wynn, Laura A. Hallock

2026-07-30规划控制

面向四肢瘫痪用户控制机械臂等高自由度辅助设备时校准慢、传感器位置敏感的问题,本文用B超肌形图中的稀疏光流跟踪构建位置无关的连续控制:1自由度仅需3个姿态标定,并扩展到单探头2自由度。9名受试者、6个身体位置实验中,所有人均能完成1D连续控制,最佳位置误差低于5.5%,且均可调制2D光标,部分完成绘图任务,但2D控制能力差异较大。

Time-delay Control Using a New Nonlinear Adaptive Law for Cable-Driven Robots Figure 1
2026-07-30eess.SY

Time-delay Control Using a New Nonlinear Adaptive Law for Cable-Driven Robots

Wenbo Gao, Yaoyao Wang, Jiawang Chen, Wenliang Zhang, Hanzhuo Wang

2026-07-30机器人规划控制

面向绳驱机器人在低刚度、迟滞和轨迹反向时易受时变扰动影响的问题,论文将时延估计与分数阶非奇异终端滑模结合,并提出带自适应指数项的非线性增益更新,以在平稳跟踪时抑制抖振、反向运动时保持增益响应。实验相较基线在两关节上降低约31%至35% RMSE,并减少ITAE和控制抖振指标,载荷测试也显示一定鲁棒性。

Self-Adaptive Learning and Model Predictive Control for Tracking Unknown Dynamics with No Regret Figure 1
2026-07-30cs.RO

Self-Adaptive Learning and Model Predictive Control for Tracking Unknown Dynamics with No Regret

Atharva Navsalkar, Hongyu Zhou, Vasileios Tzoumas

The authors are with the Department of Aerospace Engineering, University of Michigan, Ann Arbor, MI 48109 USA

2026-07-30视觉感知规划控制学习理论

面向移动机器人在追踪行人、目标或动态地标时常遇到的未知且会切换的运动模式,论文将多预测器的自监督在线学习、Hedge 自适应选择与 MPC 结合,使系统能边观测边预测并规划控制。理论上给出期望意义下的有限时近最优/无遗憾保证,遗憾随学习误差和目标动力学切换频率平滑退化;Crazyflie 仿真和硬件实验显示其在结构化、随机和对抗轨迹上优于若干在线学习基线。

MetaKoopman: Bayesian Meta-Learning of Koopman Operators for Modeling Structured Dynamics under Distribution Shifts Figure 1
2026-07-30cs.LG

MetaKoopman: Bayesian Meta-Learning of Koopman Operators for Modeling Structured Dynamics under Distribution Shifts

Mahmoud Selim, Sriharsha Bhat, Karl H. Johansson

2026-07-30机器人

面向自动驾驶和机器人在冰雪、载荷变化等分布转移下动力学失配的问题,MetaKoopman将Koopman线性潜空间与贝叶斯元学习结合,学习MNIW先验并用近期轨迹闭式更新,同时给出预测不确定性并接入采样规划。仿真和37.5吨卡车实测显示,其多步预测、校准和极限附着下避障规划优于静态或非自适应基线。

Reeling It In: Flexible Needle Pick Up via Thread Manipulation for Autonomous Suturing Figure 1
2026-07-30cs.RO

Reeling It In: Flexible Needle Pick Up via Thread Manipulation for Autonomous Suturing

Emma Huang, Zih-Yun Chiu, Neelay Joglekar, Shanglei Liu, Michael C. Yip

2026-07-30机器人

针对自主缝合中针可能掉落、被遮挡或无法直接接近的问题,本文提出不直接夹针,而是利用缝线“钓起并收回”针的完整流程:重建缝线与组织,按可靠性选择安全抓取点,并用双臂沿线追踪稳定夹针。在 dVRK 实验中,简单/中等场景成功率超过 95%,复杂环绕为 70%,遮挡场景为 65%,且抓线成功率提升 53.33%,减少组织夹伤与拖针。

Learning Implicit Causal World Models from Multi-Agent Demonstrations Figure 1
2026-07-30cs.LG

Learning Implicit Causal World Models from Multi-Agent Demonstrations

Jasorsi Ghosh

Department of Computer Science, Purdue University

2026-07-30强化学习模仿学习

多智能体离线示范中,世界模型容易把环境动力学与其他智能体意图的相关性混为因果,导致策略分布变化时失效。本文提出 ICWM,用带策略方差的软干预和序列后门条件,从轨迹中发现隐式因果结构而无需预设图。在 Two-Door、Navigation、Giveway 等任务上,因果发现误差随干预强度单调下降,OOD 评估误差在对抗策略下最多降低两个数量级,但部分收益可能主要来自更强干预数据。

MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization Figure 1
2026-07-30cs.RO

MoMo: Dial Motion Mode in Robot Manipulation with Spatiotemporal Action Tokenization

Yuhan Hu, Hugues Thomas, Peide Huang, Mouli Sivapurapu, Benoit Landry, Arto Kivila

2026-07-30机器人

这篇论文关注机器人不仅要完成操作任务,还要能按场景调节执行方式的问题。MoMo 将动作块拆成空间与时间两路残差 VQ token,并用带任务标识和连续 motion-mode 条件的克隆 Transformer 预测动作,从而把“做什么”和“怎么做”部分解耦。六个真实机器人任务中,模型能在稳健与动态模式间插值,并在未见任务-模式组合上迁移请求的运动风格,同时基本保持任务成功;但作者也承认解耦仍不完全,评估规模较窄。

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework Figure 1
2026-07-30cs.CV

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework

Armin Maleki, Hayder Radha

Electrical and Computer Engineering, Michigan State University

2026-07-30机器人

这篇论文针对车路/多车协同感知中传感器、模型和训练域不一致导致的 BEV 特征域偏移,以及现有方法需重训或依赖私有元数据的问题,提出 HeteroPROMPT:冻结原有编码器、融合与检测头,仅用低秩视觉提示和 FiLM 模块对新模态特征做轻量对齐,并用自编码器压缩特征来无元数据识别模态和路由模块。在 OPV2V-H 与 V2XSet 上,方法较异构协同感知基线提升 AP,同时将平均训练开销降低 96%,部署时模态分类准确率超过 99.99%。

Multi-Objective Compliance-Integrated Coevolution For Simulated And Real-World Deployment Of Multi-Robot Marine Autonomy Figure 1
2026-07-30cs.RO

Multi-Objective Compliance-Integrated Coevolution For Simulated And Real-World Deployment Of Multi-Robot Marine Autonomy

Everardo Gonzalez, Tyler M. Paine, Manuel Agraz Vallejo, Gaurav Dixit, Michael R. Benjamin, Kagan Tumer

2026-07-30机器人强化学习

面向海上搜救等多机器人任务,论文关注稀疏团队目标与COLREGs等安全规范之间的冲突。其核心做法是将学习到的协同策略与规定式合规行为解耦,并用连续权重混合,再由CBF安全过滤。实船8艇和仿真12艇实验显示,该框架在保持较高救援效率的同时减少碰撞风险,且无需重训即可调节任务性能与合规性的取舍。

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation Figure 1
2026-07-30cs.RO

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

Australian Institute for Machine Learning, Adelaide University, Responsible AI Research Centre, The University of Queensland

2026-07-30机器人视觉感知规划控制

本文针对具身智能中感知、行动、验证和纠错长期循环仍依赖手工流程或训练策略的问题,提出让通用模型直接掌控交互循环的 agentic embodied control。作者用仅含单目 RGB 与离散动作的零样本 VLN 测试发现,最小接口已达 70.7% 成功率,最高 78%;可选 waypoint 工具可提效,但长程任务、延迟和上下文增长仍限制持续自主。

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels Figure 1
2026-07-30cs.RO

Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels

Xinyu Yang, Tianxing Chen, Honghao Su, Minxuan Wang, Chenze Yu, Zhangzheng Tu, Yue Chen, Yuxiao Huo, Lingfeng Zhang, Yan Huang, Yan Qin, Shaolong Zhu, Qiwei Liang, Hekun Tian, Shujia Liu, Guangyu Chen, Junhao Gong, Zixuan Li, Wenwei Lin, Zijian Lin, Wenxuan Zhu, Eric J Chen, Yue Yuan, Qize Yu, Jiaqi Liang, Haowen Yan, Hengfei Zhao, Weijie Wan, Zikun Xiao, Junyuan Tang, Baijun Chen, Kai-Chong Lei, Kaixuan Wang, Kailun Su, Zanxin Chen, Yao Mu, Renjing Xu, Chuqiao Lyu, Qi Xiong, Ping Luo, Wenbo Ding

2026-07-30机器人

论文针对具身智能从实验室任务成功走向真实部署时,错误会直接造成物理伤害且基准分数不足以证明可信的问题,提出“持续安全成功”概念,并用模型、系统、证据、部署四层框架刻画风险传播与治理责任;主要结果是给出T0-T5非规范可信等级,用于界定有边界的部署声明、比较评估和后续标准化。

2026-07-29

41 篇
INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models Figure 1
2026-07-29cs.RO

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

Junhan Sun, Hao Zhao, Guofeng Zhang

State Key Laboratory of CAD&CG, Zhejiang University, Institute for AI Industry Research (AIR), Tsinghua University, RoboParty Lab, collapse and preserves a unified multi-task intent space. Center: one shared, JEPA that turns action-labeled, reward-free trajectories into a deployable, sampling remains available for diversity or optional verification rather than, centered on the Direct plan reaches 96.86% macro success using 384 instead of

2026-07-29强化学习

这篇论文针对潜在世界模型在目标控制时仍需用 CEM/MPPI 反复搜索动作的问题,提出 INTACT:利用离线轨迹中“状态变化意图—动作”的天然配对,将局部物理意图和未来目标意图映射到同一个动作条件算子,使模型可直接输出动作块。实验在 LeWM 四任务上报告零搜索成功率 85.78%/100.00%/97.67%/97.89%,直接推理仅 2.9–5.5ms,并用少量局部验证将宏平均成功率提升到 96.86%。

$π\mathbf{R}^2$: Reactive Real-time Flow Policies Figure 1
2026-07-29cs.RO

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

Sungjae Park, Shubham Tulsiani

Carnegie Mellon University

2026-07-29生成模型

本文针对机器人基础模型中动作分块流策略反应慢的问题:大视觉语言骨干和多步去噪使重规划延迟高,执行中观测容易过时。πR²的关键做法是把条件拆成高频本体感知快通道和异步视觉语言慢通道,并用延迟自适应的 diffusion forcing/flow 调度在单次调用中更新动作。基于 GR00T-N1.7 微调后,系统在 A5000 上以约 25Hz 闭环重规划,比基线快约 4 倍,仿真和真实任务成功率最高分别提升 23% 和 30%。

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information Figure 1
2026-07-29cs.RO

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

Kyoto University, Kyoto University, RIKEN, RIKEN, Institute of Science Tokyo

2026-07-29机器人模仿学习

这篇论文针对视觉模仿学习在遮挡、外观相同物体或内部状态不可见时难以确定操作目标的问题,引入需要声源位置与音色判断的 acoustic-aware manipulation 任务,并提出 S2A2,将基于 MUSIC 的声学空间图、Spotforming 频谱与视觉特征接入 ACT、Diffusion Policy 等策略。仿真显示其在同时依赖位置和音色的任务上最有效,真实机器人实验也优于纯视觉基线,但泛化到复杂多声源环境仍未充分验证。

Pictura: Perspective-View Self-Play at Scale for Driving Figure 1
2026-07-29cs.CV

Pictura: Perspective-View Self-Play at Scale for Driving

Yuan Yin, Elias Ramzi, Marc Lafon, Valentin Charraut, Victor Bares, Yihong Xu, Éloi Zablocki, Alexandre Boulch, Thibault Buhet, Andrei Bursuc, Matthieu Cord

2026-07-29机器人

这篇论文针对自动驾驶自博弈训练长期依赖特权向量状态、与真实车载相机观测存在表示鸿沟的问题,提出 Pictura:在 GPU 上为每个智能体实时渲染第一视角栅格图像,并用 PPO 直接训练图像输入策略 Alberti。实验显示其在 500K agent-steps/s 规模下完成 50B 步训练,性能接近特权向量策略,并在 WOMD 重渲染布局上零样本迁移优于特权基线。

Untangling Co-Drift: Proactive Multi-Intent Failure Prediction and Root-Cause Disambiguation for Self-Driving Networks Figure 1
2026-07-29cs.NI

Untangling Co-Drift: Proactive Multi-Intent Failure Prediction and Root-Cause Disambiguation for Self-Driving Networks

Md. Kamrul Hossain, Walid Aljoby

Md. Kamrul Hossain is with Information and Computer Science Department, King Fahd University of Petroleum and Minerals, Dhahran 31261, Saudi Arabia.

2026-07-29机器人

这篇论文针对自驾驶网络中监控、分析与执行等多个意图相互耦合时,单点故障会扩散成共漂移、导致根因与症状难区分的问题,提出 MILD:用教师增强的 Mixture-of-Experts 联合预测失败、归因根因,并结合 SHAP 与多时间窗估计紧急度。实验覆盖统计基准、微服务与 SDN 边云测试床,显示其能提前预警并保持较高检测率和意图级根因识别准确性。

Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics Figure 1
2026-07-29cs.RO

Physics-Aware End-to-End Deep Reinforcement Learning for Quadcopter Control with Actuator Dynamics

Ya-Chia Shen, Woei-Leong Chan

a Department of Computer Science and Information Engineering, National Cheng Kung University, b Department of Aeronautics and Astronautics, National Cheng Kung University, due to their underactuated dynamics—only four available control inputs must govern six degrees of freedom., high-fidelity Simulink environment. Our simulator integrates a 12-state rigid-body model (MATLAB Level-2, MATLAB/Simulink with a Level-2 S-Function plant.

2026-07-29强化学习规划控制

针对四旋翼强化学习常忽略电机滞后、桨叶力矩与分配非线性而削弱仿真到实机可信度的问题,本文把体坐标推力/力矩动作接入 Simulink 刚体模型、Action2RPM 分配和一阶执行器动态,并用两阶段悬停课程比较 DDPG、TD3、PPO、SAC。结果显示物理保真度会增加训练难度,TD3进展最快、SAC评估更稳定,DDPG和PPO较弱;但完整三维耦合控制未成功,方法可扩展性仍未充分说明。

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models Figure 1
2026-07-29cs.RO

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

2026-07-29视觉感知强化学习

DC-WAM针对世界-动作模型中RGB未来预测容易把容量耗在纹理、光照和背景重建上的问题,主张视觉分支应学习与控制更相关的交互动态。其做法是在不增加部署时输入或额外预测模态的前提下,用时序差分流匹配、轨迹引导加权和DynaRoute动态相关性注意力,把监督与计算转向夹爪、物体和接触区域的运动。实验显示该方法在LIBERO-Plus和真实操作中提升成功率,尤其改善光照、外观和背景扰动下的OOD鲁棒性,同时说明PSNR较低并不必然意味着控制性能差。

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models Figure 1
2026-07-29cs.RO

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

Zonghe Liu (1), Shanyuan Jie (2), Xiaoquan Sun (3), Chen Cao (1), Zetian Xu (1), Zongsheng Liu (4), Jiayu Chen (1 and 5) ((1) University of Hong Kong, (2) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, (3) Huazhong University of Science and Technology, (4) Beijing University of Aeronautics and Astronautics, (5) Infiforce)

University of Hong Kong, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Huazhong University of Science and Technology, Beijing University of Aeronautics and Astronautics

2026-07-29视觉语言视觉感知三维

针对RGB型VLA在遮挡、姿态变化和精细空间交互中缺少目标物体3D理解的问题,本文用冻结SAM3D在训练期提取任务相关物体的三维表征,并将其对齐到π0中间视觉特征,推理时仍只需RGB和语言。实验在LIBERO达99.1%、CALVIN平均长度4.11,真实桌面长程任务也显示收益,但依赖自动子任务分解和掩码质量。

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone Figure 1
2026-07-29cs.RO

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

Simple AI : Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li

2026-07-29机器人

这篇论文针对机器人操作中真实机器人遥操作数据精确但难以规模化、UMI 数据易采集但通常只能预训练的问题,提出 HiFi-UMI,通过离线双目惯性 SLAM、原生双手相对位姿、微秒级硬件同步和超广角多视角采集提升无机器人数据保真度。结果显示,仅用 HiFi-UMI 后训练即可在三类 VLA/WAM 骨干上接近或匹配场景内遥操作基线,最强策略在精密插入任务达 85%,并且更大规模预训练进一步降低动作误差、提升真实机器人成功率。

Modular Robotic Catheters for Endovascular Aneurysm Repair Figure 1
2026-07-29cs.RO

Modular Robotic Catheters for Endovascular Aneurysm Repair

Alex Ranne, Jinshi Zhao, Ali Anil Demircali, Songli Moey, Ayhan Aktas, Burak Temelkuran, Nassir Navab, Ferdinando Rodriguez y Baena

Centre, The Chinese University of Hong Kong. Jinshi Zhao is supported by Cancer Research UK under the grant

2026-07-29机器人

针对FEVAR/BEVAR中分支血管插管困难、手术时间和辐射暴露增加的问题,论文提出热拉制多腔管结合激光软化的双段腱驱动可转向导管,并配套可扩展的模块化手持驱动手柄。有限元用于选择降刚度轮廓,台架最大弯曲约72°,体外腹主动脉模型中可进入需保护的主要分支,但摩擦、muscling和旋转偏移等临床部署问题仍未充分解决。

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design Figure 1
2026-07-29cs.RO

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

Huy Ha, C. Karen Liu, Shuran Song

Stanford University, Columbia University

2026-07-29机器人

这篇论文从机器人操作性能受本体形态强烈制约出发,研究给定人类末端轨迹和用户奖励时如何自动生成机器人设计。核心是用 RoboTokens 统一表示本体、状态和动作,并用一个扩散 Transformer 同时承担生成、动力学评估和跨本体控制,通过 Dynamics Self-Guidance 在推理时适配未见奖励。实验覆盖固定基座、四足和移动双臂设计空间,优于进化基线;实物 ALOHA 改型将轨迹误差降低 73%、最大关节速度降低 30%。

Motion-Acceleration Calibration and Compensation in IMUs without External Equipment for Attitude Estimation Filters Figure 1
2026-07-29cs.RO

Motion-Acceleration Calibration and Compensation in IMUs without External Equipment for Attitude Estimation Filters

Fabian Arzberger, Andreas Nüchter

2026-07-29机器人

针对IMU偏离旋转中心时加速度计把向心、切向加速度误当作重力、导致姿态滤波漂移的问题,论文提出无需外部设备的内外参联合标定,并用陀螺仪在线预测和扣除运动加速度。仿真、半合成与球形移动测图实测表明,该补偿能提升依赖重力方向的Madgwick、Mahony等滤波器精度,单个偏心IMU场景改善最明显。

Tripody: An Overconstrained 3-SPR-like Parallel Robot for High-Reach Construction Tasks Figure 1
2026-07-29cs.RO

Tripody: An Overconstrained 3-SPR-like Parallel Robot for High-Reach Construction Tasks

Julien Kindle, Jakub Raczy, Riccardo Balbi, Andrea Alessandretti, Cesar Cadena, Marco Hutter

2026-07-29机器人

面向室内高处天花板钻孔、标记等任务,论文提出 33 kg 轮式 3 自由度并联机器人 Tripody,用万向节替代传统 3-SPR 基座球铰,借结构柔顺吸收过约束以提升抗扭刚度并保持平移定位。系统可升至 3.4 m、连续承载 32 kg;实验显示相对球铰方案扭转刚度最高提升 454%,闭环定位误差低于 0.6 mm,并完成 15 孔天花板钻孔,最大相对孔位误差 4.5 mm。

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning Figure 1
2026-07-29cs.RO

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

Yu Su, Nabil Aouf

2026-07-29机器人强化学习

该文针对复杂受限环境中多无人机协同导航易陷入局部最优、奖励稀疏和智能体学习不均衡的问题,提出将访问记忆与方向新颖性惩罚、分层示范行为克隆、安全课程调度及结构感知专家门控结合的多智能体深度强化学习框架。仿真显示其在协作成功率、导航鲁棒性、零样本跨场景泛化和动态障碍适应上优于对照,但具体增益在各模块间的归因仍需实验充分支撑。

Tri-Manual Visuomotor Imitation Learning of Robot Policies Figure 1
2026-07-29cs.RO

Tri-Manual Visuomotor Imitation Learning of Robot Policies

James Zhao, Mingyuan Ba, Weiming Zhi

2026-07-29机器人模仿学习

这篇论文针对三臂机器人示教中“机器人可三臂并行、单人却只能双臂连续控制”的错配问题,指出行为克隆会学到模式切换带来的伪延迟。作者提出 TriManPolicy 与 DATS,将示教片段按人工审核的依赖图离线重定时,使独立动作可重叠,再训练同步三臂策略。六个真实任务中,DATS 在成功率相当或更高的同时将成功试次平均完成时间降低约 42.5%。

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller Figure 1
2026-07-29cs.RO

Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller

Thomas Hickling, Dylan Wynne, Yu Su, Nabil Aouf

2026-07-29规划控制

面向GNSS受限、遮挡和多机避障耦合的室内无人机导航难题,本文将多机LiDAR融合到共享世界系体素图,再转为自机对齐BEV裁剪供MASAC分散控制使用,核心在于把一致地图融合与自机坐标决策解耦。仿真走廊任务成功率达90.3%,优于A*、势场和既有方法,并经离线模仿微调后在双机真实室内实验中稳定运行,但扩展到更多无人机的效果文中仍未充分说明。

When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning Figure 1
2026-07-29cs.RO

When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning

Tao Wang, Hudson Hou, Yingdong Hu, Yufeng Liu, Qinghai Li, Yingjie Jiang, Yingzhi Wang, Cheng Ma, Richard Wang, Yang Gao

2026-07-29机器人

论文关注机器人硬件升级后,旧传感器和夹爪配置下采集的示范数据何时还能帮助新平台学习。核心洞察是旧数据并非越早加入越好,而是在新硬件策略跨过任务相关“迁移阈值”后才出现突增收益,低能力阶段无效、高能力阶段收益递减。实机结果显示花朵插入从10.0%到10.0%无增益,但跨阈值后由23.3%提升到86.7%,并用梯度对齐和残余不确定性解释这一三阶段规律。

P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning Figure 1
2026-07-29cs.RO

P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning

Liyun Yan, Jianming Ma, Yang Zhang, Shengcheng Fu, Zhanxiang Cao, Keqi Zhu, Yizhi Chen, Yue Gao

2026-07-29机器人生成模型强化学习

论文针对 VAE+PPO 机器人学习中随机潜变量与 PPO 概率比/KL 估计不匹配的问题,指出单样本潜变量会给替代损失带来偏差和高方差,导致剪切错误与训练不稳。P3 通过将潜变量分布传播到策略,结合矩匹配的低噪优化和采样校准。实验称数据效率由 64.6% 提升到超过 96%,收敛步数减少超过 20%,并在类人跑酷任务上验证迁移效果。

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models Figure 1
2026-07-29cs.RO

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

Beijing Institute of Technology, AInnovation Co. Ltd., Beijing Innovation Center of Humanoid Robotics

2026-07-29机器人

这篇论文针对 VLA 机器人操作中视觉、语言与本体感知重要性会随阶段变化、但冻结模型难以动态调节的问题,提出训练免费的 IDR 测试时适配框架:通过事实/反事实视觉输入估计视觉对当前动作的因果效应,并用门控残差融合修正动作。实验覆盖多个 VLA 骨干、仿真基准和真实任务,报告整体成功率提升;主要代价是每步需三次前向推理,带来延迟。

Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring Figure 1
2026-07-29cs.RO

Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring

Adam Scicluna, Gavin Paul, Alen Alempijevic

2026-07-29机器人

这篇论文针对零样本 ObjectNav 中直接用视觉语言嵌入衡量物体相似度难以反映真实空间共现的问题,提出先把目标和已见物体映射到房间概率向量,再用分布重叠估计共处概率,并通过测地 flood-fill 将语义信号传播到可通行空间来给 frontier 打分。该方法无需训练、保持开放词表,在 HM3D 验证集上相对图像整体式基线将成功率提升约 3%、SPL 提升约 1.3%。

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations Figure 1
2026-07-29cs.RO

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations

Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

2026-07-29生成模型模仿学习规划控制三维

面向长时程、接触丰富的双臂操作,论文指出端到端模仿学习难以覆盖组合式技能序列,而传统 TAMP 又依赖脆弱建模。DR-LfD 按接触关系把演示分解为原子技能,并将视觉运动策略、物体中心基元和约束统一接入 TAMP 以重组规划。实验显示其在真实与仿真多步、未见布局和物理约束任务中优于主流模仿学习方法,且每类技能仅需少量演示。

HOME: Robust Hough-space Matching Method for Structured and Textureless Videos Figure 1
2026-07-29cs.CV

HOME: Robust Hough-space Matching Method for Structured and Textureless Videos

Masaki Satoh

2026-07-29视觉感知安全鲁棒

面向机器人定位中走廊、柱面等强线结构或少纹理场景下 ORB 易失配、传统线特征又过重的问题,HOME 将图像映射到 Hough 空间,把全局线结构转为稳定极值点,并用一维径向描述子做高效匹配,避免显式方向估计。实验以单应估计验证,在 TUM 结构/纹理视频上低纹理结构场景失败率降至 0%,RMSE 也优于 ORB、AKAZE 与 LSD/LBD,但完整 3D 位姿估计仍未验证。

SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing Figure 1
2026-07-29cs.RO

SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

Zhouheng Li, Fangguo Zhao, Mattia Piccinini, Baha Zarrouki, Yuan Gao, Zitong Shan, Johannes Betz, Chen Lv, Lei Xie

2026-07-29规划控制

面向多车自动赛车中近距离攻防既要策略多样又要实时可行的难题,SGTP将迭代最佳响应改写为GPU并行控制采样、动力学展开和轨迹排序,并用博弈感知代价结合显式赛道边界与碰撞可行性筛选来切换超车、防守等行为。仿真显示其在强交互赛道上达到95.24%胜率、99.35%完成率,平均规划耗时0.095秒,并扩展到最多10车场景。

Critical slowing down for predicting controller induced loss of control in quadrotors Figure 1
2026-07-29eess.SY

Critical slowing down for predicting controller induced loss of control in quadrotors

Jasper J. van Beers, Prashant Solanki, Erik-Jan van Kampen, Coen C. de Visser

Jasper J. van Beers 1 1 1 PhD Candidate, Faculty of Aerospace Engineering, Delft University of Technology, 2629 HS Delft, The Netherlands, Prashant Solanki 2 2 2 PostDoc, Faculty of Aerospace Engineering, Delft University of Technology, 2629 HS Delft, The Netherlands, Erik-Jan van Kampen 3 3 3 Associate professor, Faculty of Aerospace Engineering, Delft University of Technology, 2629 HS Delft, The Netherlands, and Coen C. de Visser 4 4 4 Associate professor, Faculty of Aerospace Engineering, Delft University of Technology, 2629 HS Delft, The Netherlands

2026-07-29规划控制

本文针对四旋翼在无硬件故障时仍可能因控制器不稳定、输入输出延迟或飞逸而失控的问题,提出用临界减速现象构造无模型早期预警器,将自相关等通用指标转化为失控倒计时预测。实飞数据覆盖4种四旋翼和91次失控,最多提前0.9秒预警,并在检测准确率、对失控样本依赖和跨平台泛化上优于循环神经网络基线。

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control Figure 1
2026-07-29cs.CL

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

Jiaxin Bai, Jiaxuan Xiong

Hong Kong Baptist University, Hong Kong Baptist University Hong Kong China

2026-07-29强化学习规划控制

这篇论文针对 JEPA 世界模型在离线示范中只学短期潜变量预测、却在 MPC 中依赖欧氏距离排序长期目标进展的错位。TD-JEPA 从无奖励轨迹中挖掘有方向的时间距离代价,用同轨迹顺序、跨轨迹负例和 rollout 一致性对齐规划视角;结果显示 Two-Room 成功率达 100.0%(LeWM 为 97.4%),OGB-Cube 提升 14.2 点,并改善 Push-T/Reacher。

Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction Figure 1
2026-07-29cs.RO

Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction

Ye-Ji Mun, Mahsa Golchoubian, Shahabedin Sagheb, Yan Bai, Tianhao Ji, Dylan P. Losey, Katherine Driggs-Campbell

2026-07-29机器人

这篇论文针对重复人机交互中人会随机器人行为更新信念、进而利用过度可预测策略的问题,提出 BAIT 控制器:用分层粒子滤波同时估计短期策略变化和长期感知信念,并在 MPPI 规划中显式权衡影响力与信任,同时约束即时任务表现。仿真、真人实验和 GEM 车辆并线部署显示,BAIT 在保持接近影响力基线任务表现的同时显著提升用户信任。

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning Figure 1
2026-07-29cs.CL

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

Jiaxin Bai, Jiaxuan Xiong

Hong Kong Baptist University, Hong Kong Baptist University Hong Kong China

2026-07-29强化学习规划控制

这篇论文针对神经世界模型不透明、手写物理引擎难扩展的问题,提出 VisualPatchWorld:先用主动探测选择动力学草图,再用多步 rollout 损失拟合参数,把世界模型表示为可检查、可执行的代码并用于 MPC。实验中 VPW 平均规划成功率 69.0%,比最强代码基线高 23.5 个百分点,在导航和抓取控制上接近真实物理引擎,但接触丰富的推动任务仍有明显差距。

SONG: A Photorealistic 3D Gaussian Simulation Platform for Benchmarking Social Navigation Figure 1
2026-07-29cs.RO

SONG: A Photorealistic 3D Gaussian Simulation Platform for Benchmarking Social Navigation

Weiqi Huang, Dianyi Yang, Jiaxin Li, Shuangyi Dong, Hao Xu, Zan Wang, Wei Liang

School of Computer Science & Technology, Beijing Institute of Technology

2026-07-29机器人数据集/基准三维

面向仅凭机载视觉实现社会导航的机器人,现有仿真常缺少真实外观、动态行人或语义化行为。SONG 用 3D Gaussian 构建千级真实场景和 500 个动态人形,由 LLM 生成语义轨迹并用生成模型合成全身动作,同时提出分难度的 SONG-Bench 与效率、安全、社交合规指标。实验显示主流方法在真实社交场景中成功率很低,安全问题先于礼仪问题,且用其数据微调可提升 Unitree Go2 的真实环境成功率。

Leveraging Semantic Maps for City-Scale Cross-View Localization Figure 1
2026-07-29cs.RO

Leveraging Semantic Maps for City-Scale Cross-View Localization

Ethan Fahnestock, Erick Fuentes, Philip R Osteen, Nicholas Roy

CSAIL, MIT 2 DEVCOM Army Research Laboratory (ARL)

2026-07-29机器人

这篇论文针对机器人在无 GNSS 或先验位姿很弱时,难以把地面全景观测与大规模 OSM 等语义地图对齐的问题。核心思路是用 VLM 从全景中抽取可映射地标,并将 VLM 的地标匹配能力蒸馏为轻量分类器,再作为观测似然并入贝叶斯滤波。实验显示该方法可在最大 628 平方公里区域内加速定位收敛,并能从单城晴天训练泛化到夜间、雪storm、雨雾和环境变化等场景。

Decentralized Scalable Exploration via Emergent Adaptive Lévy Walks on Minimal-Sensing Platforms Figure 1
2026-07-29cs.RO

Decentralized Scalable Exploration via Emergent Adaptive Lévy Walks on Minimal-Sensing Platforms

Wai Lun Leong, Teo Swee Huat Rodney

2026-07-29机器人

这篇论文面向传感、算力和续航都很受限的掌上级 nano-UAV 覆盖探索,提出无需地图和通信的传感驱动 Lévy walk:各机器人随机采样 Lévy 指数,并用四向测距经 von Mises 分布偏向开阔方向,在保持常数计算量和超扩散特性的同时降低碰撞。仿真相对均匀航向 Lévy walk 在开放、房间走廊和杂乱环境中分别提升覆盖率 79.6%、43.1%、13.6%,碰撞分别降低 13.0%、7.1%、1.4%,但结果仍主要停留在仿真验证。

Reactive 3D Motion Planning for a Franka Arm via Star-World Workspace Reshaping Figure 1
2026-07-29cs.RO

Reactive 3D Motion Planning for a Franka Arm via Star-World Workspace Reshaping

Gia Dcosta, Saayuj Deshpande, Samhitha Vedire

2026-07-29强化学习规划控制三维

这篇论文针对安全膨胀后障碍物重叠会破坏调制式反应规划“互不相交星形世界”假设的问题,将相交障碍聚类并重塑为星形代理,再结合动力系统末端控制和零空间势场避障用于 Franka 三维操作。PyBullet 六个场景中,重塑方法成功 5/6,高于未重塑的 4/6,并能处理重叠墙案例;但路径更长,部分场景出现近似平衡点,过度合并还会封闭可通行走廊。

Input Shaping for Point-to-Point Motion with a Continuum Robot Arm Figure 1
2026-07-29cs.RO

Input Shaping for Point-to-Point Motion with a Continuum Robot Arm

Rodolfo Hdz. Ibarra, Karan Baker, Parsa Molaei, Adrian Stein, Hunter B. Gilbert

2026-07-29机器人

这篇论文针对缆驱连续体机械臂在点到点、开环速度控制中易激发残余振动的问题,将基于线性辨识模型的时延滤波器用作输入整形,并比较普通与鲁棒设计。实验显示,两类整形均能降低超调和整定时间,鲁棒滤波器在不同位移和拉缆速度下总体更稳,即使大变形下线性模型位移预测不准,振动周期仍足以支撑整形有效。

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning Figure 1
2026-07-29cs.RO

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning

Khadija Rais, Abdelmadjid Benmachiche, Imene Soualmia

Laboratory of Mathematics, Informatics and Systems (LAMIS), Echahid Cheikh Larbi Tebessi University, Tébessa, Algeria, Department of Computer Science, LIMA Laboratory, Chadli Bendjedid University, El-Tarf, Algeria

2026-07-29规划控制

面向AUV在复杂、受限水下环境中的实时避障与能耗约束,论文将人工势场的局部反应能力与时空Transformer的全局轨迹建模结合,并把13类规划器放在高分辨率地形的5个场景中比较。结果显示各方法均完成任务,但混合APF+ST-Transformer在平均路径长度943.15、碰撞率0.031和0.96秒计算时间上取得较均衡表现;不过真实海试与增益来源仍未充分说明。

Motion Generation With Environmental Constraints Figure 1
2026-07-29cs.RO

Motion Generation With Environmental Constraints

Előd Páll, Oliver Brock

2026-07-29优化算法

论文针对高维构型空间和执行不确定性下传统避碰规划计算量大、鲁棒性弱的问题,主张把与环境的有意接触作为可利用约束。核心洞察是接触可降低搜索维度并通过触觉/几何约束削减状态不确定性,作者将 ECE 融入 CERRT 与 Contingency CERRT,并用 ECE 图引导探索。实验显示该思路能减少无关搜索、提升复杂环境中的规划可行性与执行鲁棒性,并在真实 bin-picking 抓取中验证了实用价值。

FIRMGrasp: A Friction-Informed Risk Margin for Robust Grasp Synthesis Figure 1
2026-07-29cs.RO

FIRMGrasp: A Friction-Informed Risk Margin for Robust Grasp Synthesis

Clinton Enwerem, John S. Baras, Calin Belta

The authors are with the Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA. Emails:

2026-07-29安全鲁棒

这篇论文针对传统 Ferrari-Canny 抓取质量只假设单一摩擦系数、难以预测执行时低摩擦失效的问题,引入基于 CVaR 的摩擦风险裕度,用不利摩擦尾部分布评估力闭合并给出概率证书。实验显示,在 1599 个 LEAP/Allegro 抓取中,名义指标认证的抓取有 53% 在不利摩擦下失去闭合;该指标对 shake/pick 成功排序更准,低摩擦侧拉仿真成功率为 70%,高于被其拒绝但名义指标接受的 25%。

Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming Figure 1
2026-07-29cs.HC

Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming

Jens Grubert, John Dudley, Eyal Ofek, Per Ola Kristensson

Coburg University of Applied Sciences and Arts, University of Cambridge, University of Birmingham

2026-07-29机器人规划控制

论文针对动态人机协作中机器人计划虽可行却可能不合情境、且多模态指令易歧义的问题,提出将 XR 视为“情境化人类控制”的双向中介层。其核心洞察是让 XR 不只展示机器人意图,还支持约束、授权、中断、交接与恢复。文中通过床旁护理、多机械臂监管和协作装配三类场景归纳四类中介功能与六个设计维度,但未给出系统实现或实证效果,主要结果是设计框架与研究议程。

Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning Figure 1
2026-07-29cs.LG

Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning

Luc McCutcheon, Evangelos Chatzaroulas, Saber Fallah

2026-07-29强化学习

这篇论文针对持续强化学习中网络可塑性下降、二值神经元重置易引发策略崩溃的问题,提出 Calibrated Partial Resets:按神经元效用将低效单元部分拉回初始化,而非完全重置或全局衰减。实验显示 CPR 在 SlipperyAnt 400M 步中唯一避免全部种子的策略崩溃,并在 SlipperyHumanoid、Continual MetaWorld 与 MinAtar 上优于既有重置/衰减方法。

Amortising Trajectory Optimisation for Residual MPC via Implicit Contact Differentiation Figure 1
2026-07-29cs.RO

Amortising Trajectory Optimisation for Residual MPC via Implicit Contact Differentiation

Daniel Layeghi, Thomas Corbères, Calum Arnott, Aditya Kamireddypalli, Hashim Al-Obaidi, Steve Tonneau, Michael Mistry

2026-07-29规划控制

这篇论文针对接触丰富轨迹优化中反向传播需展开迭代接触求解器、显存随迭代和接触数快速增长的问题,提出基于 IFT 的 MJX 正则化接触隐式导数,并用全时域 iLQR 教师蒸馏策略来指导短时域 residual MPC。结果显示其梯度精度接近收敛 AD/有限差分,显存随迭代几乎不变,在多接触和高自由度下显著省内存,并在 Finger、Franka、Unitree 上将六步成功率提高 28-98 个百分点。

Steeringless Drifting: Differential-Torque Control of a Four-Wheel Independently Driven Vehicle Figure 1
2026-07-29cs.RO

Steeringless Drifting: Differential-Torque Control of a Four-Wheel Independently Driven Vehicle

Sheng Zhao, Zexin Wu, Dongyang Zhou, Bolin Zhao, Xiaodong Wu

2026-07-29规划控制

面向取消机械转向后的四轮独立驱动车辆,论文关注如何仅靠左右轮差动扭矩在轮胎饱和附近产生并稳定漂移。核心在于把差动扭矩同时影响横摆力矩、纵向力和各轮组合滑移这一耦合关系纳入双轨模型,求解无转向漂移平衡,并用 pulse-hold 闭环控制切入和维持漂移。仿真与 1:10 实车实验实现约 20° 侧偏角圆周漂移和八字漂移跟踪,但泛化到不同速度、路面附着和实车尺度仍文中未充分说明。

Egocentric Station Holding of Robotic Fish in Unknown Turbulent Background Flow Figure 1
2026-07-29cs.RO

Egocentric Station Holding of Robotic Fish in Unknown Turbulent Background Flow

Xiaozhu Lin, Xu Huang, Hongru Dai, Xiaopei Liu, Junzhi Yu, Yang Wang

2026-07-29机器人生成模型

面向自然水域中未知湍流对仿生鱼定点悬停的扰动,论文提出 SWiFT,将自由游动水槽、GPU 加速 LBM-CFD 仿真、少量实测校准的 sim-to-real 与 SAC 强化学习结合,直接从自我感知映射到关节角。实验显示该策略在成功率、距离 RMSE 和接近时间上优于 MPC、Koopman 等基线,并支持“无需显式流场感知也可实现类似趋流定向”的洞察。

Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits Figure 1
2026-07-29cs.CV

Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits

Behnam Asadi

2026-07-29三维

这篇论文关注无人机/摄影测量重建在缺少外部测量点时能否自评可靠性。作者提出按图像轨迹隔离的留出重定位协议,避免被测视角使用自己参与生成的3D点;关键洞察是该指标主要测内部几何一致性而非绝对精度。实验显示置信度常饱和到1.00,却对应RTK/激光真值下数米到百米级误差,只能在破坏内部一致性的碎片化失败中提供定性信号,不能替代控制点精度评估或通用失败门控。

2026-07-28

69 篇
Data Pyramid for Embodied Manipulation Figure 1
2026-07-28cs.RO

Data Pyramid for Embodied Manipulation

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

2026-07-28机器人

面向具身操作中“该用什么数据训练基础模型”的问题,本文从数据而非模型角度梳理领域:提出由真实机器人、UMI、人类第一/三视角、仿真和通用视觉语言数据组成的数据金字塔,用可扩展性与机器人对齐性的张力解释各层取舍,并补充质量、多样性、可复用性和物理保真度维度。主要结果是系统比较数据集和近年具身基础模型的数据配方,指出训练正从单一真实轨迹转向异构混合;文中未充分说明量化性能增益。

Development of a Handheld Actuation Mechanism for a Tendon-driven Robotically Steered Guidewire Figure 1
2026-07-28cs.RO

Development of a Handheld Actuation Mechanism for a Tendon-driven Robotically Steered Guidewire

Saima Chavenet, Timothy A. Brumfiel, Revanth Konda, Jaydev P. Desai

Medical Robotics and Automation (Robomed) Laboratory, Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology, driver gear is 29:6. The spool is attached in the center of, The guidewire is passed from the spool through the center, Biologics Inc., CA, USA). The experimental setup for, part by the National Heart, Lung, And Blood Institute of, the National Institutes of Health under Award Number, views of the National Institutes of Health., pp. 77–78. [Online]. Available: https://arxiv.org/abs/2512.13477

2026-07-28机器人

针对血管介入中手动导丝在弯曲血管内导航困难、尖端可控性不足的问题,本文将紧凑绕线机构集成到0.836 kg手持执行器中,使医生可通过摇杆和瞬时开关控制最长1.5 m腱驱动机器人导丝的进给、旋转与弯曲。该装置在仿真假体主动脉中完成从左股动脉跨分叉到右髂动脉的定性导航,且无需先前系统所需的手动干预;但实验仍以定性演示为主,临床可用性如灭菌、换丝和舒适性尚未充分验证。

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation Figure 1
2026-07-28cs.RO

NEO: NeRF It Once, Edit It Many Times for Continuous Object Manipulation

Mikołaj Zieliński, David Hall, Dominik Belter, Peyman Moghadam

and Machine Intelligence, Poznan University of Technology, 61-131 Poznań

2026-07-28机器人三维

机器人连续操作会不断改变场景,使一次扫描得到的 NeRF 很快失效,反复重建又代价高。NEO 的核心思路是直接编辑 NeRF 权重:用语言场定位目标,通过避开目标体积的重采样和多视角渐进补全移除物体,再以教师学生蒸馏把物体重插入新位置,使编辑可持久迭代。实验显示其在物体移除、拾放和多阶段装配中比现有 NeRF 编辑基线更少伪影,几何与视角一致性更好,并发布了 NEO-Dataset。

KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation Figure 1
2026-07-28cs.RO

KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation

Yaping Li, Zhaxizhuoma, Qiaojun Yu, Jia Zeng, Dahua Lin, Jiangmiao Pang

The Chinese University of Hong Kong, Shanghai AI Laboratory, Shanghai Jiao Tong University

2026-07-28机器人

论文针对门、抽屉等关节物体操作中示教数据昂贵、端到端策略难以从少量数据学到运动约束的问题,提出 KAI 作为显式运动学中间表示,用运动部件关键点及其未来位移轨迹为策略注入几何先验。实验显示其在六个仿真任务平均成功率 82.9%,用约一半示教即可追平或超过基线,并能迁移到未见背景和干扰场景;真人视频共训练在真实杂乱环境中超过 70% 成功率。

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision Figure 1
2026-07-28cs.RO

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

Ning Cheng, Jinan Xu, Wanlin Li, Yangzhi Chen, Jing Gao, Yiqun Wang, Kelan Peng, Wenjuan Han

2026-07-28视觉语言视觉感知

面向视觉主导 VLA 在插拔、按压、擦除等接触密集任务中难以感知力和形变的问题,τ 将视觉式触觉编码进预训练 VLA 的语义空间,并用 JEPA 式训练分支根据当前触觉和后续动作预测未来视觉特征变化,推学习时的时序触觉表征,推理阶段不增加开销。TacAura 实验显示其优于视觉 VLA 和既有触觉策略,并能泛化到部分新物体与场景,但 USB 插入等精细任务迁移仍受限。

Distributed Coordination for Resilient Multi-UAV Remote Sensing: A Photovoltaic Inspection Case Study Figure 1
2026-07-28cs.RO

Distributed Coordination for Resilient Multi-UAV Remote Sensing: A Photovoltaic Inspection Case Study

Guillermo GP-Lenza, Miguel Fernandez-Cortizas, Martin Molina, Pascual Campoy

2026-07-28机器人

针对多无人机光伏巡检中固定预分配任务难以应对失联、平台故障和图像质量退化的问题,论文提出非侵入式 SwarmLink 通信层,并把初始分配、故障恢复和质量触发重分配统一为剩余目标与可用无人机之间的分布式再拍卖。结果显示该方案可在不修改 Aerostack2 核心、无需地面站介入的情况下完成运行时协调,但实机验证、最优性和网络分区处理仍文中未充分说明。

ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm Figure 1
2026-07-28cs.RO

ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm

Praveen Selvaraj, Lorenzo Uttini, Ville Kuosmanen

2026-07-28机器人强化学习数据集/基准

面向真实机器人操作评测成本高、样本少且难复现的问题,ArmnetBench 用低成本 SO-101 机械臂农场并行运行统一容器化策略评测,覆盖单臂和双臂 12 个任务、7 类策略,并采用三档人工评分。v0.1 产出 2518 次策略 rollout 和 600 个参考示范,发布带质量标签的数据与检查点;其榜单只是共享训练预算下的初始比较,跨单元复现性和绝对性能上限文中未充分说明。

Accuracy potential of visual localization exploiting high-end street-level imagery Figure 1
2026-07-28cs.CV

Accuracy potential of visual localization exploiting high-end street-level imagery

Jonas Meyer, Stephan Nebiker, Pascal Theiler, Norbert Haala

2026-07-28视觉感知

针对城市环境中 GNSS 受遮挡且现有视觉定位缺少测绘级精度评估的问题,论文用高精度地理配准的街景影像作为场景表示,结合先验检索、在线局部 SfM 与 PnP 位姿估计,并发布含亚厘米真值的 FHNW Muttenz 数据集。实验显示平移中位误差约 1–5 厘米、旋转 0.05–0.1 度,条件有利时可到 1 厘米和 0.03 度,说明视觉定位有望补充测绘级 GNSS。

Model Predictive Planner for UAV Navigation in Non-Convex Air Corridors Figure 1
2026-07-28cs.RO

Model Predictive Planner for UAV Navigation in Non-Convex Air Corridors

Henrique Silva Jr., Marcelo A. Santos, Guilherme V. Raffo

Department of Management, Information and Production Engineering, University of Bergamo, Dalmine, BG, Italy, Department of Electronic Engineering, Universidade Federal de Minas Gerais, Belo Horizonte, MG, Brazil

2026-07-28机器人优化算法

面向城市低空走廊中受保护区域导致的非凸约束,论文希望避免传统“先全局路径、再局部跟踪”在动态可行性和实时适应上的割裂。其核心做法是在混合整数 tracking MPC 中同时编码走廊可行性、无人机动力学和基于最短路径代理的 offset cost,并加入几何 warm start 以缓解局部极小。Matlab/CasADi/Bonmin 仿真表明,该方法能在四段非凸走廊内生成满足速度、力和空间约束的轨迹并收敛到目标,但结果主要是数值仿真,真实飞行和大规模实时性仍未充分说明。

Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform Figure 1
2026-07-28cs.RO

Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform

Joel Siegert, Edoardo Ghignone, Michele Magno

*This work was not supported by any organization 1 Center for Project-Based Learning, D-ITET, ETH Zurich

2026-07-28强化学习学习理论

针对真实机器人赛车中仿真难覆盖新赛道与地面、实车样本又极少的问题,论文把SAC改造成带Continual Backpropagation的持续强化学习框架,用多条真实赛道顺序预训练,再在未知赛道快速微调;同时与IQL离线预训练比较。结果显示CBP方案15分钟微调后圈速优于MPC/MAP等经典控制器,并比离线RL和非持续基线适应更快,主要洞察是保持网络可塑性比单纯扩大离线数据更关键。

A note on the motion representation and configuration update in time stepping schemes for the constrained rigid body Figure 1
2026-07-28cs.RO

A note on the motion representation and configuration update in time stepping schemes for the constrained rigid body

A. Müller

Institute of Robotics, Johannes Kepler University, Altenbergerstr. 69, 4040 Linz, Austria

2026-07-28机器人

论文针对多体动力学中将刚体构型写成 SO(3)×R3 时约束积分易漂移的问题,从李群几何解释约束保持性:若约束流形是所选构型空间的子群,时间步进可精确保持约束。作者指出常见关节约束更自然地属于 SE(3) 子群,并用球铰、转动副、圆柱副等 RK4 数值例子显示,SE(3) 更新约束误差接近机器精度,而直接积表示误差随步长精度残留。

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG Figure 1
2026-07-28cs.IR

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

2026-07-28机器人

针对水下长期监测受电量、带宽和回收成本限制的问题,论文提出由低功耗 MAX78000/78002 哨兵节点常开监测、Jetson Orin NX 按需唤醒的分层架构,并把本地多模态 RAG、物种识别和多智能体调度结合起来。视觉与声学案例显示系统可在端侧生成检测、索引和报告,压缩传输负担;但定量节能增益文中未充分说明。

PAC-DP: PAC-Bayesian Diffusion Policy Learning Figure 1
2026-07-28cs.RO

PAC-DP: PAC-Bayesian Diffusion Policy Learning

Mohammad Hasan Yeganegi, Dian Yu, Andrea Del Prete, Majid Khadiv, Matteo Saveriano

2026-07-28生成模型强化学习

PAC-DP针对机器人扩散策略在示范数据有限时易过拟合、泛化缺少理论约束的问题,将扩散策略建模为贝叶斯神经网络,并从PAC-Bayes泛化界推导出“去噪损失+后验/先验KL正则”的训练目标。实验显示其在多个操作基准和Franka实机上提升去噪质量、降低变分负对数似然,并在低数据和复杂任务中取得更高成功率。

Learning Adaptive Multi-Task Guidance, Navigation, and Control via Hypernetworks Figure 1
2026-07-28cs.RO

Learning Adaptive Multi-Task Guidance, Navigation, and Control via Hypernetworks

Ricard Marsal I Castan, Aman Arora, Antoine Richard, Andrej Orsula, Cédric Pradalier, Miguel A. Olivares-Méndez

2026-07-28机器人规划控制

面向空间自由飞行机器人需在有限算力下切换多类 GNC 任务的问题,论文提出 Hyper-GNC:用物理语义任务嵌入驱动超网络生成共享 actor-critic 权重,把速度跟踪、对接、巡检和避障导航放入连续任务空间中组合。实验显示其样本效率接近单任务专家,并在惯量扰动、外力矩及实体卫星模拟平台上保持跨任务可用性。

FeelWorld: Visuo-Tactile World Model for Hierarchical Contact Prediction and Planning Figure 1
2026-07-28cs.RO

FeelWorld: Visuo-Tactile World Model for Hierarchical Contact Prediction and Planning

Wenxuan Ma, Chaofan Zhang, Chao Xue, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

Institute of Automation, Chinese Academy of Sciences, Beijing Academy of Artificial Intelligence

2026-07-28强化学习规划控制

针对接触丰富操作中视觉世界模型容易生成“看起来合理但触觉物理不一致”的未来,FeelWorld 将触觉分解为接触、3D触觉潜变量和滑移三层,并用接触门控非对称注意力只在接触时融合触觉。芯片抓取、果蔬抓取和USB插入实验中,10步LPIPS由0.084降至0.058,80步滚动误差较视觉基线低61%,零样本规划成功率达81.7%。

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation Figure 1
2026-07-28cs.CV

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

Robotics Research Center (RRC), IIIT HyderabadProject Page - https://silica-mirage.github.io/ Code - https://github.com/rtarun1/Silica Dataset - Mirage18k

2026-07-28视觉感知生成模型

SILICA面向机器人在玻璃门、隔断等透明表面上深度传感失效的问题,核心思路是把玻璃分割与深度估计联合建模,并通过Stable Diffusion的CLIP条件与交叉注意力在真实分割数据和合成深度数据间传递信息,避免依赖成对真实玻璃深度标注。文中还发布Mirage 18k数据集,并称在未见室内环境中零样本优于现有方法近20%,用于更可靠的建图与避障。

Quality-Adaptive Multi-UAV 3D Reconstruction with Sparse Workload Redistribution Figure 1
2026-07-28cs.RO

Quality-Adaptive Multi-UAV 3D Reconstruction with Sparse Workload Redistribution

Benjamin Sportich, Kenza Boubakri, Olivier Simonin, Alessandro Renzaglia

2026-07-28三维

针对多无人机在未知环境三维重建中难以同时兼顾覆盖效率、表面精度与在线协同的问题,论文将 TSDF 置信度引入 NBV 视点评分,把重建保真度设为可调目标,并用局部分散惩罚与按需触发的聚类任务再分配减少冗余。仿真显示其相较 RACER、FAME 获得更短路径和更高覆盖、精度,消融表明稀疏再分配主要改善路径长度与完成时间。

FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning Figure 1
2026-07-28cs.RO

FloAff-Kitchen: Bridging Navigation and Manipulation via Canonical and Progressive Floor Affordance Learning

Ping Zhong, Manling Teng, Tao Wu, Bolei Chen, Jiazhi Xia, Jianxin Wang

2026-07-28机器人

本文针对移动操作中“走到哪里才利于后续操作”的基座放置问题,指出地面可供性主要由目标附近的规范化局部交互几何决定,而非完整场景。方法用 CFAR 消除视角、朝向和无关上下文带来的表示歧义,并用 PFAL 先学习可迁移放置先验再适配不同厨房操作技能。作者还构建跨场景、多视角 FloAff-Kitchen 基准,实验显示在三类设置下优于强基线,消融支持两项组件的贡献。

Surgical Re-enactment for Operating Room Workflow Datasets Figure 1
2026-07-28cs.RO

Surgical Re-enactment for Operating Room Workflow Datasets

Jana Nina Friedrich, Andrea Karin Maria Ross, Angelo Henriques, Mario Peter Martin Weisser, Ling Zhang, Mohammad Ali Nasseri

2026-07-28生成模型数据集/基准

这篇论文针对真实手术室多视角工作流数据难以采集的问题,提出在重建手术室中复演完整手术流程的八阶段方法,把专家咨询、流程形式化、角色训练、实地观察、导演记录和逐次复盘结合起来。作者在机器人辅助眼科手术中录制了10次完整复演,覆盖六人七角色、30至44分钟流程,后期记录更接近真实OR动态,可用于活动识别、场景图和BPMN流程建模,但量化验证仍是未来工作。

Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim Figure 1
2026-07-28cs.RO

Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim

Steve Aschenbrenner, Marcel Heisler, Thomas Sievers, Christian Becker-Asano

Stuttgart Media University, Germany

2026-07-28机器人数据集/基准

针对LLM驱动社交机器人跨会话失忆会破坏关系连续性的动机,论文在 humanoid robot head Kim 上实现轻量级个性化情景记忆,将Qdrant向量检索、余弦相似度与记忆强度混合打分接入对话提示。43人被试视频实验显示,该机制显著提升感知社交性,尤其是可信度和温暖感,同时未增加感知打扰,说明适度个人回忆可改善具身HRI的关系质量。

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning Figure 1
2026-07-28cs.RO

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

University of California, Irvine, Georgia Institute of Technology

2026-07-28机器人视觉感知强化学习

DeVA针对VLA静态预训练难以提供物理动态与时序因果先验、现有视频-动作模型又在共享表征或信息传递上受限的问题,采用解耦的视频专家与动作专家,通过多层视频特征跨注意力和桥接token传递时空信息,并用可供性与相对深度监督突出操作相关物理线索。实验显示其在RoboCasa、LIBERO系列和真实双臂任务中以较少示范取得更强或相当表现,收敛快于统一架构,物理引导带来明确增益。

A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces Figure 1
2026-07-28cs.RO

A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces

Marcel Heisler, Luca Randecker, Christian Becker-Asano

All authors are with Stuttgart Media University, Germany

2026-07-28机器人

本文关注高度拟人机器人头在真实公共服务场景中的接受度,而非实验室内的单点交互。作者将语音识别、RAG 对话、多语言合成、唇形同步与情绪表情整合到机器人 Kim,并在旅游信息处、建筑管理部门和图书馆连续部署。TAM2 结果显示用户总体认为其有用且易用,旅游与图书馆更适配,建筑管理场景互动意愿较低;多语言受欢迎,但约五分之一用户认为响应过慢。

Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation Figure 1
2026-07-28cs.LG

Learning Reusable Hybrid Motion Priors for Humanoid Locomotion from Motion Imitation

Valerio Belli (UNIROMA, UCL), Valerio Modugno (UCL), Enrico Mingo Hoffman (HUCEBOT), Fabio Amadio (HUCEBOT)

stages modulates the available gait patterns. We further show, The author is with Sapienza University of Rome, Rome, Italy., The authors are with University College London, London, UK., available through a reusable hybrid motion prior and training, available to downstream policies. The codebook is trained, available to the policy at time t:

2026-07-28机器人模仿学习

论文针对人形机器人强化学习每个任务都需重新设计奖励和训练、而模仿学习控制器又停留在参考轨迹跟踪的问题,提出将模仿专家蒸馏为冻结的混合运动先验:本体感知编码器加 RVQ 离散码本和动作解码器,下游策略只选择码本项。结果显示同一 HMP 可支持速度跟踪、目标导航和跌倒恢复,并在 Unitree G1 上零样本实机部署;旋转技巧改善码本组织并减少跌倒,但硬件步态仍有振荡。

Effective Parameters, Real Behavior: Renormalization for Robotics -- From Infinite Electron Mass to Sim-to-Real Gap Figure 1
2026-07-28cs.RO

Effective Parameters, Real Behavior: Renormalization for Robotics -- From Infinite Electron Mass to Sim-to-Real Gap

Youran Sun, Jiaxuan Guo, Xingyu Ren, Chugang Yi, Haizhao Yang

University of Maryland, College Park, Stanford University, The Chinese University of Hong Kong

2026-07-28机器人

这篇论文针对机器人仿真到现实差距中“参数越物理越好”的默认假设,提出用重整化视角选择随仿真分辨率变化的有效参数,让未建模的执行器、接触、柔性体或流体效应被少量参数吸收。文中解析说明有限频率 PD 控制会使比例增益改变有效阻尼、微分增益改变有效惯量,并用绳索操作和水下游动案例说明,行为匹配的参数可偏离实测物理值。

HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent Figure 1
2026-07-28astro-ph.IM

HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent

An-yi Huang

State Key Laboratory of Astronautic Dynamics

2026-07-28规划控制优化算法

这篇论文针对低推力深空轨迹优化中间接法推导繁琐、动力学模型变化导致代码重写、射击法初值敏感等问题,提出由 LLM 驱动的 HELIOS 代理,从自然语言任务自动完成 PMP 符号推导、SymPy 校验、C++ 射击代码生成与求解。核心在于统一约束形式、自动处理约束自由参数,并用四模块架构适配太阳帆、J2 摄动等动力学。11 个场景中最佳编译成功率达 100%,部分结果与参考解一致,但高维问题收敛仍依赖随机初值,稳定性仍有限。

WARL: Wrench-Augmented Reinforcement Learning for Task-Agnostic Learning in Legged Robots Figure 1
2026-07-28cs.RO

WARL: Wrench-Augmented Reinforcement Learning for Task-Agnostic Learning in Legged Robots

Keita Yoneda, Kento Kawaharazuka, Kei Okada

The author is with the AI Center, Graduate School of Information Science and Technology, The University of Tokyo, Japan.

2026-07-28机器人强化学习

本文针对足式机器人强化学习中关节空间探索效率低、任务依赖奖励和课程设计成本高的问题,提出在动作空间加入作用于机身的六维力/力矩,并用成功率驱动课程逐步移除该辅助,使最终策略仍为关节控制。四足机器人实验显示,WARL能在多地形和运动任务上更稳健学习,减少地形特定调参;但也可能诱导不充分利用身体结构的动作,真实迁移与增益边界仍需进一步说明。

A Cyclic Adaptation-Generalization Framework with Uncertainty-Guided Self-Paced Learning for Long-Term Brain-Machine Interfaces Figure 1
2026-07-28cs.AI

A Cyclic Adaptation-Generalization Framework with Uncertainty-Guided Self-Paced Learning for Long-Term Brain-Machine Interfaces

Jiyu Wei, Di Hong, Zhanjie Zhang, Dazhong Rong, Qinming He, Yueming Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China, Nanhu Brain-Computer Interface Institute, Hangzhou, China

2026-07-28学习理论安全鲁棒

针对侵入式脑机接口长期使用中神经漂移导致解码器频繁重校准的问题,论文提出 UnSPC,将域适应与域泛化放入循环优化,并用不确定性引导的自步伪标签筛选可靠目标会话样本,以同时处理全局和子域分布漂移。多组神经解码数据实验显示其优于现有 DA/DG 基线,但具体增益在多大程度来自伪标签排序、循环训练或预训练解码器仍需看消融细节。

Moving-Horizon Estimation and Nonlinear Model Predictive Control of Cable-Driven Soft Manipulators Figure 1
2026-07-28cs.RO

Moving-Horizon Estimation and Nonlinear Model Predictive Control of Cable-Driven Soft Manipulators

Lingxiao Xun, Haihong Li, Gang Zheng

2026-07-28规划控制

软体机械臂难以在真实硬件上兼顾可计算的物理建模、状态估计和约束控制。本文基于降阶 Cosserat 动力学,将缆长驱动中的张力-松弛互补关系平滑化,使系统无需直接测张力即可做 MHE 状态重构与 NMPC 任务空间控制。仿真覆盖位姿和应变调节,四缆原型实验显示该方案可实时运行并实现较准确的末端位置跟踪。

Self-Supervised Consistency Enhanced Disentangled Learning for Neural Decoding Generalization in Brain-Machine Interface Figure 1
2026-07-28cs.AI

Self-Supervised Consistency Enhanced Disentangled Learning for Neural Decoding Generalization in Brain-Machine Interface

Jiyu Wei, Di Hong, Zhanjie Zhang, Dazhong Rong, Qinming He, Yueming Wang

College of Computer Science and Technology, Zhejiang University, Hangzhou, China, Nanhu Brain-Computer Interface Institute, Hangzhou, China

2026-07-28学习理论

这篇工作针对侵入式脑机接口中神经漂移导致跨天解码性能下降的问题,指出传统方法把速度作为统一目标会忽略方向、速度等运动参数上的漂移差异。作者提出SSCDL:用教师-学生一致性和扰动模拟学习稳健表征,再将解码拆为速度、方向、速率三个专用分支并互补融合。实验称在多个iBMI数据集上取得更好的跨天稳定性和细粒度预测表现,但具体增益来源仍需结合完整实验细节判断。

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking Figure 1
2026-07-28cs.RO

FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking

Hai Jiang, Yixian Zou, Binbin Liang, Boqian Liu, Fanman Meng, Shuaicheng Liu

2026-07-28机器人

FutureRTC针对VLA机器人实时部署中异步动作块会用过期观测和状态决策、造成执行错位与块间抖动的问题,提出不改底层策略的插件式适配器,同时校正本体状态并基于机器人运动预测执行时视觉特征,再用策略一致性损失对齐预测上下文。仿真和真实任务显示其在推理延迟下提升轨迹平滑性、完成速度和成功率。

Co-planning of Flight Corridors and Communication Infrastructure for Urban Drone Logistics Networks Figure 1
2026-07-28cs.RO

Co-planning of Flight Corridors and Communication Infrastructure for Urban Drone Logistics Networks

Yingjie He, Yikang Wang, Zhenyu Gao

2026-07-28规划控制

面向城市无人机物流中通信覆盖与航路规划相互制约的问题,论文将基站部署和飞行走廊联合建模,在3D射线追踪无线电地图上用覆盖感知组合多臂老虎机搜索基站组合,并借信道互易性动态扩展候选点。案例实验显示,CR-CMAB在中等计算时间内比基线部署更有策略、航路更短,在相同基础设施成本下取得更好的总飞行距离效率。

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments Figure 1
2026-07-28cs.RO

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

2026-07-28强化学习

这篇论文针对现有世界动作模型依赖像素级视频生成、容易把容量浪费在纹理和背景上的问题,提出把世界建模转到 JEPA 预测语义潜空间:用 ISAE 将非高斯预测特征整理为适合扩散的流形,再用非对称 MoT 让重型 Anchor DiT 只在训练时蒸馏动力学。实验称其在 LIBERO 的预测模型中达到 SOTA,在 RoboTwin 2.0 接近顶级生成式 WAM,并提升零样本视觉鲁棒性和真实迁移。

Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping Figure 1
2026-07-28eess.SY

Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping

Stefan Richter, Alberto Giammarino, Guillem Torrente, Sam Blakeman, Peter Dürr

2026-07-28强化学习规划控制

本文针对受约束机器人控制中 RL 难保安全、OC/MPC 难处理长时域非凸任务的问题,提出 FAOC:将策略输出的静态抽象动作,通过可逆的可行行动映射转为当前状态相关的 OCP 可行参数,从而把约束满足交给最优控制、把策略选择交给强化学习。仿真机器人乒乓实验显示,其相较现有 RL-MPC 基线在样本效率、闭环表现和可控性上更优。

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception Figure 1
2026-07-28cs.CV

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception

Goodarz Mehr, Sepideh Gohari, Montasir Abbas, Azim Eskandarian

the SimBEV2X dataset, and CoBEVFusion are available at, Autonomous Robots and Vehicles Laboratory (ARVL), College of Engineer-, ing, Virginia Commonwealth University (VCU), Richmond, Virginia, United, Montasir Abbas is with the Charles E. Via, Jr. Department of Civil, ‡ Labels for sky, train, and rock are supported by SimBEV2X but not present in the dataset., extensive labor required for data annotation [12], [13]. Because, To demonstrate the scalability and utility of SimBEV2X, • We introduce SimBEV2X, a highly scalable and user-

2026-07-28数据集/基准

本文针对V2X协同感知缺少大规模、多模态、多任务数据的问题,提出基于CARLA的SimBEV2X生成工具,通过随机化场景、天气、交通和多车/路侧单元配置,自动产出3D框、HD地图、BEV分割与3D占用标注。其数据集含258个场景、10.22万帧、58.85万点云和2700万级框,并用CoopDet3D与加入FAX注意力的CoBEVFusion建立基线;性能提升可能主要来自数据规模与特征融合设计。

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling Figure 1
2026-07-28cs.LG

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

2026-07-28生成模型强化学习

WorldDiT针对机器人策略依赖大规模预训练VLM、难以区分规模与架构贡献的问题,提出用单一扩散Transformer同时学习连续动作块和未来相机RGB patch预测;视觉预测只作训练监督,推理时走动作路径。在四个LIBERO套件中,399M参数模型位于参数量—成功率Pareto前沿,表明无需大型VLM动作骨干也能取得强基线,但单一配置不足以证明scaling规律。

SHARE: Towards Head-Mounted AR with User-Centric SLAM in Shared Human-Robot Workspaces Figure 1
2026-07-28cs.HC

SHARE: Towards Head-Mounted AR with User-Centric SLAM in Shared Human-Robot Workspaces

Tianyuan Du, Tianyi Hu, Hanting Ye, Maria Gorlatova

Duke University, Duke University Department of Electrical and Computer Engineering Durham North Carolina United States

2026-07-28机器人

SHARE针对AR人机协作中多智能体SLAM把机器人与头显用户同等调度、导致AR交互延迟过高的问题,提出以用户体验为中心的异构QoE模型,并结合实时精度估计、PID传输优先级调度和共享场景视觉特征冗余来降低边缘处理开销。实机测试中AR平均延迟降至13.22毫秒、较基线降低43.3%,同时保持亚2厘米跟踪精度,用户研究也显示主观感知显著改善。

Embodied GPT-5.1: Evidence of a World Model? Figure 1
2026-07-28cs.RO

Embodied GPT-5.1: Evidence of a World Model?

Roberto Spinelli, Thiago C. Martins

2026-07-28强化学习

论文动机是检验未经历具身训练或仿真的多模态大模型,是否能在真实机器人闭环中表现出类似世界模型的物理理解。其核心做法是让 GPT-5.1 仅凭低分辨率第一视角图像、离散动作和历史上下文控制差速小车完成找物并接触目标。结果显示模型能记住离屏物体、预测自身动作后果并形成连贯动作序列,但对齐低效、会误认干扰物;证据仍偏探索性,增益来源不清,可能主要来自 scaling / data。

Cost-Aware Recovery-Pathway Identification and Bayesian Optimization for Autonomous Materials Discovery Figure 1
2026-07-28cs.AI

Cost-Aware Recovery-Pathway Identification and Bayesian Optimization for Autonomous Materials Discovery

Debajyoti Ray, Niranjan Srinivas

were developed by the authors at the California Institute of Technology.

2026-07-28优化算法

面向自动化材料发现中“先选哪条回收路径、再优化参数”的高成本决策问题,论文将路径识别和路径内贝叶斯优化统一为带成本的两阶段策略:先按单位成本的后验判别收益选择诊断,再用 GP-UCB 优化。结果基于 CICERO 启发的合成基准而非湿实验,显示其接近 oracle/分板基线,并在 NdFeB 场景中避免错误先提交带来的模拟成本惩罚。

BC-NMPC: Battery-Constrained NMPC with Propulsion Prediction and Replanning for High-Speed Flight Figure 1
2026-07-28cs.RO

BC-NMPC: Battery-Constrained NMPC with Propulsion Prediction and Replanning for High-Speed Flight

Parakh M. Gupta, Matej Mihulka, Matej Novosad, Robert Penicka, Martin Saska

The authors are with the Multi-robot Systems Group, Czech Technical University in Prague, Czech Republic ( https://mrs.fel.cvut.cz ).

2026-07-28规划控制

本文针对高速无人机在电池放电后最大推力下降、原定赛道轨迹中途变得不可行的问题,将电池与推进系统的多项式预测模型嵌入NMPC,并按实时推力约束在线重规划。实飞验证了电压、电流、功率和推力预测,仿真中相较未补偿控制实现无碰撞飞行,跟踪RMSE降至约1/6,飞行距离提升46%,飞行时间提升100%。

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map Figure 1
2026-07-28cs.RO

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map

Dibyendu Ghosh

2026-07-28视觉感知

本文针对动态环境中机器人地图很快过期的问题,指出行为记忆用于全局绕行收益有限,真正价值在有限感知预算下决定“该重新看什么”。论文将语言条件重感知建模为按重要性与变化率分配注意力,并用VLMM结合开放词汇相关性和实例变化历史;在AI2-THOR 951个物体上,历史调度接近oracle,优于按类别的VLM先验,重要物体收益更集中,并在取物任务中减少无效往返。

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis Figure 1
2026-07-28cs.RO

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

University of Washington, Massachusetts Institute of Technology

2026-07-28机器人强化学习

本文针对端到端 VLA 机器人策略难解释、难纠错且适应新场景成本高的问题,提出 ARCHITECT:让 LLM 编码代理合成可执行的模块化机器人程序,并用执行轨迹把人类自然语言纠正定位到代码和工具调用,再沉淀为持久技能库。在 Franka Panda 的 8 类长程操作任务中,该方法优于 π0、π0.5 和 Code as Policies,且随技能库积累减少后续人工干预。

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation Figure 1
2026-07-28cs.RO

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

NeoteAI Team, Fudan TEAI Team

2026-07-28机器人强化学习

面向拧螺丝、剥离杯子等由指尖接触决定成败的操作,论文认为仅靠视觉动作回归难以预判接触变化。N0-TWAM把触觉作为世界-动作模型的原生预测目标,用视频、触觉、动作三专家MoT联合生成未来视觉和接触,并结合NeoForce与触觉事件推进长程任务。实验显示其在UniVTAC、NeoSim和8个真机任务上优于VLA及视觉世界模型,消融表明预测触觉和观测触觉均带来收益。

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens Figure 1
2026-07-28cs.RO

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

NeoteAI Team, Fudan TEAI Team

2026-07-28视觉感知

这篇论文针对现有 VLA 模型缺少触觉、在接触密集操作中容易滞后的问题,提出 N0-VTLA:不把触觉当作额外视觉上下文,而是预测未来动作块带来的触觉变化,并用 latent tactile tokens 直接条件化动作专家;同时用大规模 NeoData 预训练和 ALTER 离线优势标注改进策略。结果显示其在 9 个真实 NeoReal 任务全胜,仿真 20 任务平均成功率 63.8%,高于最强基线 44.0%。

Learning Traversability-Aware Global Planners for Long Horizon Off-Road Navigation Figure 1
2026-07-28cs.RO

Learning Traversability-Aware Global Planners for Long Horizon Off-Road Navigation

Kasi Viswanath, Jason M. Gregory, Shaunak Kolhe, Srikanth Saripalli

2026-07-28机器人

这篇论文针对越野长距离导航中车载感知视野短、缺少可用道路网络的问题,提出从卫星图像、航空 LiDAR 和矢量地图中学习连续可通行性图,并用人类 GPS 轨迹的正-未标注学习结合 LiDAR 几何先验来对齐物理可行性与驾驶偏好。作者还发布覆盖 299 个场景、约 1244 km² 和 1130 km 驾驶轨迹的数据集;实车测试中路径长度距人类基线 3.66%,相较仅局部规划减少约 85% 人工干预。

Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning Figure 1
2026-07-28cs.RO

Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning

Zahra Abdalla Elashaal, Afef Hfaiedh, Nahla Khraief, Issmail Ellabib, Giansalvo Cirrincione

\addr Lab. of Robotics, Informatics and Complex Systems, National Engineering School of Tunis, University of Tunis El Manar, \addr Faculty of Information Technology, University of Tripoli, University of Tripoli, \addr Laboratory of Novel Technologies, University of Picardie Jules Verne

2026-07-28强化学习

该文针对稀疏奖励、长时域连续控制中探索困难和信用分配滞后的问题,提出两层 HRL-SAC:高层负责子目标/策略规划,低层用最大熵 SAC 执行动作,并在层级策略中引入熵正则以维持探索。实验在 SAR-2 搜救数据集上显示,相比扁平 SAC,成功率、覆盖效率和收敛表现更好;但具体结构细节和增益来源仍文中未充分说明。

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories Figure 1
2026-07-28cs.RO

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

2026-07-28机器人数据集/基准

面向化学自驱实验室中失误代价高、真实故障数据稀缺且评测粗糙的问题,论文提出 LabRobFail:用仿真在控制、物理和语义层自动注入故障,构建 2 万余条轨迹、5 类/11 种故障,并评测检测、定位、严重度和修正等能力。其专用 VLM 在已见环境达到 92.58% 故障检测和 85.58% 时间定位准确率,并使下游 VLA 成功率提升 10–20 个百分点;但训练主要依赖合成数据,sim-to-real 泛化仍是限制。

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization Figure 1
2026-07-28cs.RO

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

† Corresponding author. 1 Tsinghua University.

2026-07-28机器人

这篇论文针对带隐藏内部状态的物体操作中“每次重遇都要重新试探”的低效问题,提出实例导向记忆 IOM:首次接触后将探索轨迹蒸馏成去冗余操作程序,并按物体可识别特征存储,后续作为软偏置调用以避免盲从错误记忆。仿真与真实机器人四类任务中,oracle 记忆在成功率不退化下减少 16–30% 操作,免训练 VLM 实现恢复了 69–88% 的节省。

Towards Ultrafast Depth Sensing Via Active Event-based Stereo Vision Figure 1
2026-07-28cs.RO

Towards Ultrafast Depth Sensing Via Active Event-based Stereo Vision

Jianing Li, Yunjian Zhang, Haiqian Han, Kangyao Huang, Xiangyang Ji

2026-07-28视觉感知

面向高速机器人场景中传统主动双目帧率不足、被动事件双目在弱纹理/暗光下不稳的问题,论文提出“主动事件双目”范式,将双目事件相机与红外二维散斑投影结合,并构建真实与合成稠密标注数据集。方法上用轻量 ActiveEventNet+、动态交互代价体和时间一致性结构利用事件流时序信息;实验显示其精度优于现有事件双目方法且计算量更低,原型可达最高 150 FPS 实时深度估计。

RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes Figure 1
2026-07-28cs.CV

RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes

Junyue Li, Ye Zheng, Yifan Chen, Zhe Sun, Xuelong Li

2026-07-28视觉感知三维安全鲁棒

RRTrack针对机器人动态场景中快速运动、完全遮挡和目标重现导致6D位姿跟踪中断的问题,将记忆式视频分割与CAD/RGB-D位姿细化做成2D–6D闭环,并用渲染掩码一致性约束记忆更新;丢失后再通过DINOv2双模板库检索恢复。其合成RGB-D基准含遮挡重现场景,相比FoundationPose的ADD-S AR/AUC分别提升66.3%/65.7%,速度55.2 FPS,真实实验验证但规模细节有限。

Observer-Assisted Relative-Velocity Compensation with LPV-$H_\infty$ Robust Correction for 3D Trajectory Tracking of Underactuated Non-Minimum-Phase AUVs under Ocean Currents Figure 1
2026-07-28eess.SY

Observer-Assisted Relative-Velocity Compensation with LPV-$H_\infty$ Robust Correction for 3D Trajectory Tracking of Underactuated Non-Minimum-Phase AUVs under Ocean Currents

Mohammad Sabouri

2026-07-28视觉感知规划控制三维安全鲁棒

针对欠驱动、非最小相位鱼雷型AUV在未知洋流下难以做三维轨迹跟踪的问题,论文将三阶段状态-洋流观测器、相对速度前馈补偿与LPV-H∞鲁棒校正结合,并给出补偿何时优于绝对速度方案的残差层面条件。REMUS仿真显示洋流估计误差降低89%-96%,平移残差约降99%,RMS误差由4.04 m降至0.24 m。

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models Figure 1
2026-07-28cs.RO

Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models

Liangyu Li, Qingwen Liu, Mingqing Liu

Tongji University

2026-07-28强化学习

论文指出,基于世界模型的采样控制在扩大候选动作池时,残余预测误差会让不可行动作以异常低代价胜出,形成“proposal overgeneration”。作者提出 ASAR:在低代价候选中按早期动作前缀寻找相邻集,并加权重构新动作序列,而非直接选最低代价。Cube Carry and Release 实验中,ASAR 在 72/144/288 个候选下相较匹配选择提升事件完成率约 18.7–28.0 个百分点,但效果主要验证于单一模拟域。

Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter Figure 1
2026-07-28cs.RO

Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter

Yuchao Mei, Guohao Zhang, Luxia Ai, Haopeng Chen, Wenbing Tao

2026-07-28强化学习安全鲁棒

这篇论文针对动态杂乱环境中四旋翼仅靠瞬时深度感知容易做出滞后避障的问题,提出用仿真特权状态构造基于 CPA 的方向化未来碰撞风险图,并通过非对称 actor-critic 让视觉策略自预测风险,从深度序列中学习运动线索而不依赖显式跟踪。仿真和实机结果显示,该方法相比基线提升了安全间距与飞行效率,并实现零样本 Sim-to-Real 迁移。

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric Figure 1
2026-07-28cs.CR

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

Nikolaos Kekatos, Stylianos Basagiannis, Panagiotis Katsaros, Alexios Lekidis, Tom Nianios

2026-07-28机器人

这篇论文针对LLM辅助ISR机器人群在对抗通信中可能出现的“单机合规、整体违规”问题,提出平台、分队、任务三级运行时验证框架,并用带安全性与证据完整性的判定代数和可验证消息织构区分违规与证据缺失。仿真中,跨四个平台拆分的提示注入攻击被组合监控检出且给出来源,而普通集中监控在丢包和干扰下会给出错误全清。

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks Figure 1
2026-07-28cs.RO

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

∗ detonates equal contribution, 1 The University of Texas at Austin

2026-07-28机器人强化学习

长时程机器人操作中,稀疏奖励让强化学习探索成本很高,而自动课程学习又常依赖人工定义任务参数和难度。LEACL的关键做法是让LLM先分解子任务并生成各子任务的元任务规格,再交给ACL在稀疏奖励下生成课程,避免手写 dense reward。在LIBERO五个任务上,其收敛后成功率优于人工密集奖励基线,但具体增益中LLM分解与ACL各自贡献仍需消融支撑。

PRISM: Polynomial Representations for Interaction-Structured Motor Control Figure 1
2026-07-28cs.RO

PRISM: Polynomial Representations for Interaction-Structured Motor Control

Seung Hyun Lee, Stella X. Yu

University of Michigan, Ann Arbor

2026-07-28规划控制

这篇论文针对机器人策略默认用 MLP 处理一阶观测变量、难以直接表达功率、滑移、接触冲量等乘性物理关系的问题,提出 PRISM:用因子化多项式模块紧凑地显式建模观测变量间的高阶交互,并可嵌入强化学习策略或替换 Diffusion Policy 的线性本体感知条件层。实验显示其在类人行走和接触丰富操作中优于标准及等容量大 MLP,并在无力觉、触觉或接触标签时产生一定传感器缺失下的柔顺行为。

Semantic Semi-Incremental Data-Association-Free Object SLAM Figure 1
2026-07-28cs.RO

Semantic Semi-Incremental Data-Association-Free Object SLAM

Yihao Zhang, Jungseok Hong, John J. Leonard

2026-07-28机器人

这篇论文针对 Object SLAM 中地标观测与对象变量难以可靠关联、且对象数量未知的问题,扩展 DAF-SLAM,将位置观测与类别标签或视觉特征向量一起用于联合估计位姿、地标、语义和数据关联,并用半增量分块策略降低长轨迹漂移与计算量。实验覆盖合成、真实和水下数据,结果显示其 skid-SLAM/skill-SLAM 相比原 kSLAM 和强基线更准确,skill-SLAM略优。

Sling2Sim2Real: One-Shot Elastic System Identification for Non-Destructive Slingshot Policy Learning Figure 1
2026-07-28cs.RO

Sling2Sim2Real: One-Shot Elastic System Identification for Non-Destructive Slingshot Policy Learning

Wonjae Kang, Geonwoo Kim, Minseok Song, Daehyung Park

2026-07-28强化学习

这篇论文针对弹性物体操作中真实试错成本高、视觉难以辨别材料参数的问题,以弹弓发射为任务提出 Sling2Sim2Real:仅用一次不发射的视觉-力觉交互,结合参数协方差引导的多起点系统辨识来校准仿真,再在仿真中训练强化学习策略并零样本迁移到真实 Franka 机械臂。实验显示其在多种橡皮筋和目标距离上降低落点误差,优于基线,但结果集中在弹弓场景,跨任务泛化文中未充分说明。

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot Figure 1
2026-07-28cs.RO

Low-Latency Turn-Taking via Context-Aware Preface Generation in a Real-World Dialogue Robot

Yuki Okafuji, Koji Inoue, Yoshiki Ohira

The University of Osaka, Graduate School of Informatics, The University of Osaka Osaka Japan, Graduate School of Informatics Kyoto University Kyoto Japan

2026-07-28机器人强化学习

这篇论文针对级联式 ASR-LLM-TTS 机器人在等到最终识别后才生成回复导致接话迟缓的问题,提出把“前置短回应”的准备与实际发声时机解耦:意图可预测时由检测器触发上下文前言生成,再由 VAP 决定何时插入。商场导览机器人实验证明,固定填充语和上下文前言都能降低首响延迟;上下文前言较慢于固定填充语,但显著缩短到主回答的间隔,主观评分无显著差异。

The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation Figure 1
2026-07-28cs.RO

The Curse of Precision: A Data Scaling Law for High-Precision Robotic Manipulation

Cuijie Xu, Yuanfan Xu, Min Xue, Jianjie Lin, Jian Wang, Xudong Zhang, Yu Wang, Jincheng Yu

2026-07-28机器人

这篇论文针对装配等封闭场景中“精度而非泛化”如何随示教数据扩展的问题,提出高精度操作的数据缩放律:达到固定成功率所需数据量在目标精度逼近系统极限 c 时呈超指数增长。实验覆盖插孔、堆叠和滚球任务,显示 c 不是任务常数,而受传感器、专家策略和数据质量影响;加入腕部相机或改进专家可降低 c,说明盲目加数据不如定位并提升系统瓶颈。

Stress-testing large language model agents in a robotic chemistry laboratory Figure 1
2026-07-28cs.AI

Stress-testing large language model agents in a robotic chemistry laboratory

Lulu Guo, Yingkai Sun, Xiaobo Li, Luyao Ge, Ziming Wang, Haitao Zheng, Jingyu Li, Huijuan Zhang, Bingxu Chen, Daobin Liu, Yuebo Liu, Jie Li, Xiaohui Li, Linjiang Chen, Yi Luo, Jun Jiang

Stress-testing large language model agents in a robotic chemistry laboratory, State Key Laboratory of Precision and Intelligent Chemistry, Hefei National Research Center for Physical Sciences, at the Microscale, School of Chemistry and Materials Science, University of Science and Technology of China, Center for Scientific Intelligence Innovation, Hefei, China, School of Chemistry, School of Computer Science, University of Birmingham, Birmingham, UK, physical action and adaptation to evidence. Here, we use a robotic chemistry laboratory as a physical-world, laboratory constraints, laboratories. This capability extends beyond generating plausible hypotheses and experimental, laboratories have enabled automated and closed-loop physical experimentation (6–13), while, convert scientific intent into executable action in a robotic laboratory (19, 20). This challenge is, particularly pronounced in modular robotic laboratories that integrate heterogeneous capabilities, powered by large language models in a modular robotic chemistry laboratory, evaluating their

2026-07-28机器人

论文针对LLM智能体能否从科学意图真正落到机器人实验操作这一缺口,构建含45个模块化工位、机器可读技能与约束的化学实验室压力测试框架。结果显示,4608次试验中仅3.3%生成专家判定可执行流程,最佳系统也只有28.1%;反馈可促成局部参数调整,但未形成流程级重规划,说明当前瓶颈在物理约束下的长程执行与证据驱动适应。

Actuator-Aware Spatiotemporal Tube Synthesis for Temporal Reach-Avoid-Stay Tasks Figure 1
2026-07-28eess.SY

Actuator-Aware Spatiotemporal Tube Synthesis for Temporal Reach-Avoid-Stay Tasks

Keshab Patra, K Madhava Krishna

Robotics Research Center, International Institute of Information Technology - Hyderabad Hyderabad, Telangana, India, corporates actuator constraints directly into the tube synthesis process. The STT centerline and width are, ized as nominal center trajectory c(t) with width w(t), where, along a centerline trajectory c(t). The half-width of the bound, is represented by w(t). Both the centerline and the width are, STTs. We use the same polynomial degree for the centerline

2026-07-28机器人

这篇论文针对时空管方法在机器人到达-避障-保持任务中常先生成管、再处理执行器饱和的问题,把输入约束提前并入管合成。作者用 Bernstein 多项式表示管中心线和宽度,并从 PPC 跟踪误差推导出关于控制点的线性可行性约束。全向移动机器人仿真显示,该方法在不在线重优化或改控制器的情况下满足执行器上限,控制 effort 相比既有 STT 方法约降 50%。

WCM: World-Cognition Model for Generalizable Human-Robot Interaction Figure 1
2026-07-28cs.RO

WCM: World-Cognition Model for Generalizable Human-Robot Interaction

Yuzhen Chen, KC Zhou

2026-07-28机器人强化学习

这篇论文针对现有语言条件机器人多偏向执行指令、缺少可解释交互和在线纠错的问题,提出 WCM:用 SLAK 将感知、推理、动作与记忆显式分层,并以异步运行支持边执行边对话,还把人工教学与自主轨迹蒸馏为 CoT 监督。系统在低成本移动操作平台的九个真实 HRI 任务上平均成功率为 73.8%,但评测规模和对比控制仍有限。

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline Figure 1
2026-07-28cs.RO

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

Beijing Institute of Technology

2026-07-28机器人视觉语言视觉感知

面向实体智能中VLA操控对仿真、训练和边缘部署的高迭代需求,论文将Sim2Real、语言目标选择、3DGS实景重建到Genesis仿真数据生成及强化学习基准统一到AMD ROCm/PyTorch栈。结果显示SmolVLA可在Radeon平台数分钟微调并迁移到Franka抓取,Real2Sim能生成更贴近真实场景的数据,部分RL任务在统一内存边缘硬件上具竞争力;但论文更像系统展示,算法增益来源未充分说明。

Pose-Aware Modeling to Mitigate Pose-Related Artifacts in Tactile Gloves Figure 1
2026-07-28cs.RO

Pose-Aware Modeling to Mitigate Pose-Related Artifacts in Tactile Gloves

Tianhong Catherine Yu, Ziyi Kou, Mia Huang, Taylor Niehues, Yiyue Luo, Li Guan, Dingtian Zhang

* Work done during an internship at Meta Reality Labs 1 Cornell Univeristy, 2 Meta Reality Labs, and 3 University of Washington

2026-07-28三维

柔性触觉手套在低力接触中容易把手部姿态引起的传感器形变误判为真实触碰,限制示教学习、遥操作等应用。论文的核心洞察是将手姿态作为可获得的辅助模态,用残差分支显式估计并校正姿态相关伪影,无需改造手套硬件。作者在3种手套、15名用户上验证,最低可检测力分别降低10.4%、12.2%和18.3%,其他指标也一致改善。

Physical AI Governance: From Theory to Practice Across Life Cycle Figure 1
2026-07-28cs.AI

Physical AI Governance: From Theory to Practice Across Life Cycle

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

Case Western Reserve University, Shanghai Jiao Tong University, Massachusetts Institute of Technology, Columbia University, University of California, Riverside, Nanyang Technological University, New York University, Harvard University, Stanford University

2026-07-28学习理论

这篇综述的动机是现有 AI 治理多面向数字系统,难以覆盖具身系统的实时物理安全、人机共处和生命周期适应问题。作者提出 PAL-GF 治理原则框架,并映射到研究、设计、数据、模型开发和部署五阶段生命周期,主要结果是把抽象治理要求转化为可执行的工程实践与标准对照。

A Replay-Constrained Simulation Framework for Personalization of Powered Knee--Ankle Prosthesis Controllers Figure 1
2026-07-28cs.RO

A Replay-Constrained Simulation Framework for Personalization of Powered Knee--Ankle Prosthesis Controllers

Duong Le, Ryan Posh, Shihao Cheng, Maani Ghaffari, Robert D. Gregg

the U.S. National Institutes of Health (NIH), National Institute of Child Health and Human Development (NICHD), under Award Number 1F32HD116414-01A1 (R. Posh)

2026-07-28规划控制

面向动力膝踝假肢控制难以在硬件上高维个性化的问题,论文提出“回放约束”仿真:用个人步行数据回放髋部运动和地反力边界,只仿真假肢动力学,从而避开人体神经肌肉建模,并用强化学习同时调节双关节相位相关阻抗参数。3名经股截肢者实验显示仿真排序与硬件表现高度相关,最优硬件策略均落在仿真前五,仿生奖励较基线提升42–59%。

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots Figure 1
2026-07-28eess.IV

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots

Hiu Ching Cheung, Wenchao Yue, Zhengran Han, Mingcong Chen, Guanglin Cao, Hongbin Liu, Hongliang Ren

Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong, China, Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom, Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China, SLAI Shenzhen Loop Area Institute, China

2026-07-28机器人模仿学习

本文针对气管切开中切口定位依赖触诊和超声操作者经验的问题,提出面向机器人超声的层级气管解剖理解框架:先用YOLOv8n定位甲状软骨与软骨环声影,再以稀疏提示驱动SAM2分割并按解剖顺序推断目标间隙。实验显示该YOLOv8n+SAM2方案在受控与泛化数据上平均DSC为0.777,优于U-Net类基线,速度达6.92 FPS。

Multi-Domain Physics-Based MDO of Multirotor UAVs: A Deterministic Framework for Discrete COTS Sizing Figure 1
2026-07-28cs.CE

Multi-Domain Physics-Based MDO of Multirotor UAVs: A Deterministic Framework for Discrete COTS Sizing

Akshay Gupta Burela, P. B. Sujit

Department of Electronics and Communication Engineering, International Institute of Information Technology, Hyderabad, India, Department of Electrical Engineering and Computer Science, Indian Institute of Science Education and Research, Bhopal, India

2026-07-28机器人

本文针对多旋翼无人机用COTS部件选型时结构、电池、气动与运动学强耦合导致的“质量滚雪球”问题,提出AeroEval物理约束MDO框架,用Banach不动点质量迭代、热-电池模型、任务质量递减和离散硬件搜索把连续最优映射到可购买部件。商业机型盲测MTOW误差为7.2% MAPE,单电池质量误差7.9%,典型50ms内收敛;但多电池企业平台存在系统性低估,部分增益可能主要来自scaling / data。

Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance Figure 1
2026-07-28cs.AI

Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance

Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris, Roberto Galeazzi, Ioannis Kyriakides

2026-07-28强化学习

面向港口小船持续监视中多相机、LiDAR全开成本高且在线期望信息增益搜索昂贵的问题,论文将粒子滤波的后验信念作为PPO策略输入,用实现的熵下降训练单传感器调度策略,把决策成本转移到离线学习。仿真显示,该方法每步只启用一个传感器,却在主要区域达到接近全开感知、与EIG基线相当的跟踪效果,并降低在线计算负担。

2026-07-27

31 篇
Robot-Factored World Models via Robot Rendering Figure 1
2026-07-27cs.RO

Robot-Factored World Models via Robot Rendering

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

Seoul National University

2026-07-27机器人强化学习

这篇论文针对机器人视频世界模型中动作条件难以跨本体泛化、直接用日志状态又会泄漏交互结果的问题,提出先用控制器和运动学把动作转成部署时可得的名义轨迹,再通过 URDF 渲染为带深度的机器人几何条件,让模型专注预测物体响应。实验显示该接口优于向量动作条件基线,并能在未见机器人和人类演示重定向场景中生成操作视频。

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction Figure 1
2026-07-27cs.CV

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, Yuqi Wu, Jie Zhou, Jiwen Lu

Intelligent Vision Group, Tsinghua University

2026-07-27三维

SM4RT针对单目视频4D重建中点级位移缺乏物体运动结构的问题,将场景运动分解为少量SE(3)运动基及时间共享的像素分配权重,使同一物体点共享刚体轨迹;模型用并行运动几何编码/解码器一次前向联合预测几何、世界坐标运动和运动结构,在运动重建基准上取得较强表现,并支持更一致的插值与未来状态预测。

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation Figure 1
2026-07-27cs.RO

ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation

Yunao Huang, Shiyu Sang, Haotao Lu, Suting Ni, Shijie Wu, Ziyang Guo, Ye Shi, Jingya Wang

ShanghaiTech University

2026-07-27机器人强化学习

ViTacWorld瞄准接触丰富操作中视觉难以观测接触状态、真实触觉数据昂贵且多样性不足的问题,将动作条件世界模型扩展到视觉-触觉联合生成,把触觉视作额外视角,并用真实公开数据、仿真数据和真实策略 rollout 分阶段训练。实验显示其生成的时序对齐视觉/触觉 rollout 可用于增强下游触觉策略,并支持按给定动作评估策略结果,但增益可能主要来自 scaling / data。

Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance Axes Figure 1
2026-07-27cs.RO

Plug, Play, and Comply: A Modular Framework for Online Variable Impedance with Arbitrarily Oriented Compliance Axes

Mihael Simonič, Xiaocong Li

College of Information Science and Technology, Eastern Institute of Technology, Ningbo, Ningbo 315200, China 2 Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin

2026-07-27机器人

面向接触丰富操作中高层策略难以直接落到稳定柔顺执行的问题,论文提出基于 ROS 2 的机器人无关柔顺控制框架,用 wrapper–plugin 分离部署与控制律,并用标准接口在线更新位姿、刚度、阻尼、零空间和前馈项,支持任意方向的任务相关柔顺轴。实验显示同一控制器可迁移到不同机械臂,且在曲面跟随和连接器装配中能随任务几何调整柔顺方向。

Robot Learning to Communicate through Projected Visual Abstractions Figure 1
2026-07-27cs.RO

Robot Learning to Communicate through Projected Visual Abstractions

Danyang Yan, Boyuan Wang, Jiaxun Liu, Boyuan Chen

Department of Electrical and Computer Engineering, Duke University, Department of Mechanical Engineering and Materials Science, Duke University, Department of Computer Science, Duke University

2026-07-27机器人

这篇论文关注机器人如何不只通过本体动作,而是通过阴影等投影视觉抽象进行交流。作者结合带软皮肤的21自由度灵巧手、可微阴影自模型、梯度优化与碰撞感知仿真,使机器人从目标图像或视频反推出可执行手势,并用表达区域、时序平滑和关键帧优化处理动态表演。实验展示其可生成手语、手影戏和动物运动阴影,说明投影表征可成为机器人表达与叙事的新通道。

Conformal Constraint Tightening for Chance-Constrained Motion Planning with Unknown Dynamics Figure 1
2026-07-27cs.RO

Conformal Constraint Tightening for Chance-Constrained Motion Planning with Unknown Dynamics

Shubham Natraj, Bruno Sinopoli, Yiannis Kantaros

2026-07-27规划控制优化算法

这篇论文针对机器人在真实动力学未知、只有近似名义模型时规划保证失效的问题,提出用保形预测估计名义轨迹到真实轨迹的最坏偏差,并据此收紧自由空间和目标约束,使任意现有规划器在名义模型上求解确定性问题即可获得指定概率的真实系统到达-避障保证。Dubins 车和学习模型四旋翼实验验证了概率保证,并相较不考虑不确定性的名义规划显著提高任务完成率。

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education Figure 1
2026-07-27cs.RO

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education

Stephan Vonschallen, Karim Kaufmann, Dominique Oberle, Friederike Eyssel, Theresa Schmiedel

2026-07-27机器人生成模型数据集/基准

论文针对LLM驱动社交机器人在高校辅导中易产生误导、缺乏透明性和迎合错误回答的问题,将知识型设计要求落实到Reachy Mini,通过系统提示、RAG和有状态提示编排构建Teachy Mini。24人预实验显示,其负责任辅导行为感知显著优于对照,个性化、基于课件解释、苏格拉底提问等更一致,但接受度、动机和学习效果主效应未显著,学习增益证据仍偏探索性。

Geometric 2D Scene Graph Generation Figure 1
2026-07-27cs.CV

Geometric 2D Scene Graph Generation

Christoph Jahn, Urs Waldmann, Bastian Goldluecke

Department of Computer and Information Science, University of Konstanz, Konstanz, Germany

2026-07-27机器人

面向机器人装配中零件如何连接、按何顺序组装的问题,本文将语义标签缺失且数据很少的场景图生成改写为几何结构推断:先由 Faster R-CNN 提取零件几何表示,再用 Transformer 预测邻接矩阵,并通过带注意力 GCN 的孪生网络刻画连接关系。实验在玩具车辆小数据集上训练于三类车辆、测试未见车型,显示可生成装配结构与序列;但规模偏概念验证,泛化增益可能主要来自几何原语增强,文中未充分说明其在真实装配场景中的稳健性。

A Monolithic Hand with Asymmetric Origami Bending and Dual-chamber Actuators Figure 1
2026-07-27cs.RO

A Monolithic Hand with Asymmetric Origami Bending and Dual-chamber Actuators

Nan Huang, Yuming Zhu, Zicong Zhang, Jianhui Liu, Xiaohuang Liu, Dihan Liu, Jiansheng Dai, Sicong Liu

a Department of Mechanical and Energy Engineering, Southern University of Science and, b Sino-German College of Intelligent Manufacturing, Shenzhen Technology University, c University of Pennsylvania, Philadelphia, PA 19104, USA.

2026-07-27机器人

针对软体机械手难以兼顾大输出、灵巧运动与单材料一体制造的问题,论文提出非对称折纸弯曲 AOB 与非对称双腔 ADC 结构,用几何非对称产生手指和掌部弯曲并支持 12 自由度气动驱动。SLS 单材料制成的 OSOR 手指、掌最大弯曲约 203° 和 40°,输出力 6.3 N 和 16 N,可完成捏取纸巾、水瓶抓握、掌部抓握等任务。

Design and Human Evaluation of Tactile Withdrawal Reflexes for a Skin-Covered Robot Arm Figure 1
2026-07-27cs.RO

Design and Human Evaluation of Tactile Withdrawal Reflexes for a Skin-Covered Robot Arm

Laura Babayeva, Lukas Rustler, Matej Hoffmann

2026-07-27机器人数据集/基准

这篇论文针对协作机器人近距离接触中仅靠急停不足、触觉反应还需让人看懂的问题,在带皮肤的UR10e机械臂上把压力变化映射为“痛觉”增益,并比较固定关节回撤、类人位置相关回撤和沿接触面法向回撤三种反射。15人实验显示,最仿生的策略并未胜出;固定回撤因可预测性更强,在安全感、自然性和类人感上更受偏好,而笛卡尔回撤被认为最符合触碰反应。

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments Figure 1
2026-07-27cs.RO

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments

Ali Salmasi, Xianjia Yu, Tomi Westerlund

connectivity is unavailable and reliable metric goal localization is, are unavailable. Finally, we integrated these advances into, (TIERS) Lab, University of Turku, Turku, Finland.(e-mail:{ali.a.salmasi, .20 m. When reliable LiDAR observations are unavailable, geometric information becomes available.

2026-07-27机器人视觉语言视觉感知

针对户外视觉语言导航依赖云端模型、延迟高且断网不可用,同时语义目标难以转成可靠度量坐标的问题,论文提出 Edge-BehAV:系统评测 17 个可边缘部署小语言模型,并将开放词汇检测、提示分割与 LiDAR 几何融合做目标定位。实验中最佳离线 SLM 指令分解接近最强云 API 且约快 9 倍,目标距离误差由 2.05 m 降至 0.20 m,实车闭环成功 31/32 次。

Safe Learning Predictive Control for Ego-World Robotic Systems Figure 1
2026-07-27cs.RO

Safe Learning Predictive Control for Ego-World Robotic Systems

Davide Valenti, Giuseppe Notarstefano

Authors are with the Department of Electrical, Electronic and, Information Engineering, University of Bologna

2026-07-27机器人强化学习规划控制安全鲁棒

面向共享动态环境中未知他车/机器人行为带来的安全导航问题,本文提出 SOWL-MPC:用 SVGP 在线从噪声状态观测学习外部机器人潜在反馈策略,并将预测均值与不确定性传播到非线性动力学后接入鲁棒 MPC。结果在 ROS 2 大规模蒙特卡洛实验和室内真实机器人平台上展示了实时可行性与安全避障效果。

JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision Figure 1
2026-07-27cs.CV

JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision

Wooyung Yun, Dongwook Kim, Soomok Lee

Wooyung Yun and Dongwook Kim are with the Department of Artificial Intelligence, Ajou University, Suwon 16499, Republic of Korea, Soomok Lee is the Corresponding author † and is the Faculty of Department of Computer Science, Kennesaw State University, Marietta GA, 30060, United States

2026-07-27视觉感知

面向自动驾驶中雷达稀疏噪声、相机缺乏尺度且现有雷达-相机深度估计流程复杂延迟高的问题,JustDepth 将雷达点压成固定宽度 1D 表示,用高度融合块与图网络传播深度,并用仅训练阶段的置信度头稳定学习。其只需单帧 LiDAR 监督、无辅助标注,在 nuScenes 上保持相近精度,同时推理延迟降低 39.7 倍,条纹伪影按 VHGR 降低 66%。

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability Figure 1
2026-07-27cs.RO

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

Yi Liu, Hongda Zhang, Leyao Zou, Chunlei Meng, Ziqing Zhou, Yuning Chen, Zhuo Zou, Lida Xu, Zhongxue Gan, Chun Ouyang

aCollege of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, 200433, China, bSchool of Information Science and Technology, Fudan University, Shanghai, 200433, China, cDepartment of Information Technology, Old Dominion University, Norfolk, 23529, VA, USA, tion is unavailable. Recent learning-based path-planning, ten rely on globally available environmental information.

2026-07-27规划控制

本文针对局部可观测路径规划中全局信息缺失导致搜索冗余、短视决策的问题,提出 ImiPath:从专家轨迹中学习可复用的时空决策先验,并用 STAPNet 将局部障碍、目标方向和历史运动编码为对传统规划器的方向引导。实验显示其在多尺度与动态场景中保持相近路径质量,同时减少节点扩展,并在磁控微机器人平台验证了部署可行性。

Flight-Ready LiDAR-Inertial Odometry for Embedded Drone Platforms Figure 1
2026-07-27cs.RO

Flight-Ready LiDAR-Inertial Odometry for Embedded Drone Platforms

Alvaro J. Gaona, David Perez-Saura, Francisco J. Anguita, Pascual Campoy

Computer Vision and Aerial Robotics Group at Centre for Automation and Robotics C.A.R. (UPM-CSIC)

2026-07-27机器人

面向无人机闭环控制中现有 LIO 只追求基准精度、输出频率和速度信息不足的问题,论文将 FAST-LIO2 类 IESKF 系统的估计器保持不变,改造发布与并发架构:以 IMU 频率前向传播、补全机体系速度、加入 EMA/SLERP 平滑、隔离 IMU 执行线程并修复同步竞争。实机 Livox Mid-360/Pixhawk 平台验证显示,里程计由 10 Hz 提升到稳定 200 Hz,并在短时 LiDAR 丢失时保持连续输出。

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation Figure 1
2026-07-27cs.RO

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation

Ziyu Wan, Lin Zhao

2026-07-27机器人

这篇论文针对深度视觉惯性里程计常把视觉、IMU和6DoF位姿统一建模,难以表达深度结构、姿态先验以及旋转/平移不同动态的问题,提出DB-VIO:用Metric3D深度增强视觉特征,用陀螺积分姿态先验增强IMU表示,并将时序估计拆成旋转和平移双分支。在KITTI和EuRoC上相对基线分别提升20%和33%,EuRoC旋转指标提升65.7%,但外部深度模型对增益的贡献占比文中仍需更细分说明。

One Hand Watches The Other: Dynamic Multi-Agent Cooperation for Sample-Efficient Bimanual Manipulation in Dynamic Environments Figure 1
2026-07-27cs.RO

One Hand Watches The Other: Dynamic Multi-Agent Cooperation for Sample-Efficient Bimanual Manipulation in Dynamic Environments

Jan Ole von Hartz, Abhinav Valada, Joschka Boedecker

2026-07-27机器人

这篇论文针对多流模仿学习默认参考系外生、因而在移动物体和双臂协作中会失效的问题,提出 DynaMAC:从示范中推断机器人与物体的运动学连接,把另一只手或动态物体作为任务参数来选择和融合策略流。作者还构建 DynaBench 评测动态操作;在仿真和真机任务中,DynaMAC 相比概率与生成式基线提升超过 35 个百分点,并声称用少 20 倍样本即可从静态示范零样本迁移到动态场景。

Constraint-Driven Synthesis of Hyper Petri Nets Figure 1
2026-07-27eess.SY

Constraint-Driven Synthesis of Hyper Petri Nets

Maksym Figat, Alessandro Pinto

2026-07-27优化算法

面向航天等安全关键机器人中多约束难以手工编码且验证易受状态爆炸影响的问题,论文提出从布尔不变式直接合成 Hyper Petri Nets,将可观察满足约束的标记与底层可执行迁移语义分离。两个月球车启发场景显示,该方法能构造所有可观察状态均满足约束的标准 Petri 网,并揭示逻辑可行状态未必可执行可达;规模随变量和约束线性增长,但实验仍偏概念验证。

Impedance Control of Ship-Borne Manipulators via Optimization-based Task-Space Inverse Dynamics Figure 1
2026-07-27cs.RO

Impedance Control of Ship-Borne Manipulators via Optimization-based Task-Space Inverse Dynamics

Lingxiao Meng, Bi-Ke Zhu, Xuheng Gao, Zhe Zhang, Jiankun Yang, Jiankun Wang, Haibo Lu, Max Q.-H. Meng

2026-07-27规划控制优化算法

面向船载机械臂在波浪基座运动下难以兼顾轨迹精度与接触安全的问题,论文将任务空间逆动力学写成QP,在扭矩层同时补偿基座运动的运动学与动力学耦合,并用融合IMU和末端位姿的ESKF估计基座状态。7自由度机械臂与Stewart平台实验显示,末端位置误差较最佳基线降低25.7%以上,1 mm间隙插孔任务成功率提升且平均接触力降低45%。

Embodying Multi-Hand Manipulation Policies by Searching the Assignment and Null Spaces Figure 1
2026-07-27cs.RO

Embodying Multi-Hand Manipulation Policies by Searching the Assignment and Null Spaces

Yorai Shaoul, Jiaoyang Li, Maxim Likhachev

2026-07-27机器人

这篇论文针对多手策略只给末端轨迹、未指定机械臂分配且易发生臂间碰撞的执行缺口,提出Ω-CBSA:在冲突搜索框架中同时搜索轨迹到机械臂的离散分配和冗余机械臂的雅可比零空间,用保持末端位姿的冗余运动避碰。作者给出分辨率完备性分析,并在最多六臂、450个问题上显示成功率高于IK跟踪、采样和图搜索基线,平均规划约640毫秒。

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents Figure 1
2026-07-27cs.AI

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

University of Technology Nuremberg

2026-07-27数据集/基准

这篇论文针对现有航拍具身评测多停留在路径跟随或单项能力、难以衡量冻结 MLLM 能否完成完整无人机任务的问题,提出 MissionBench:在五个 3D 仿真环境中用 120 个任务闭环评估规划、视角选择、控制与报告。22 个模型实验显示最强模型成功率仍低于 35%,远低于人类 84.4%,但性能随模型规模提升,说明零样本航拍任务能力可能主要来自 scaling。

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping Figure 1
2026-07-27cs.RO

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping

Bibhutibhusan Nayak, Hyoseok Ju, Giseop Kim

2026-07-27数据集/基准

针对现有 SLAM 基准缺少户外地磁模态、难以系统评估磁感知定位的问题,Mag4D-SLAM 提供四足机器人采集的 14 段、18 公里同步 LiDAR/相机/IMU/三轴磁力计/GNSS 与 6DoF 真值数据,并以昼夜、正反向重复路线构成 4D 地磁地图。实验主要验证地磁信号在跨时段具有可重复性,可用于无累计漂移的全局航向估计和跨会话地点识别,为偏航漂移抑制、磁回环与长期定位提供基准。

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset Figure 1
2026-07-27cs.RO

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

1 affiliationmark: School of Computing, National University of Singapore, 3 affiliationmark: George Mason University, 5 affiliationmark: University of Michigan, 6 affiliationmark: University of Bonn, 7 affiliationmark: Keio University, 8 affiliationmark: Carnegie Mellon University, 9 affiliationmark: NUS Smart Systems Institute, 10 affiliationmark: Ewha Womans University

2026-07-27机器人数据集/基准

这篇论文针对社会导航数据集在文化、地域、机器人形态和真实人机互动上覆盖不足的问题,提出 ACME 多模态数据集,汇集 5 个国家 8 个地点、7 种机器人形态的数据,并包含语音触发的机器人-人群交互、机载传感器、俯视行人轨迹和人工校验标注。实验分析表明,ACME 相比既有数据集包含更复杂场景和更宽的人群行为分布,并用于评测导航与轨迹预测模型,但性能增益可能主要来自 scaling / data。

Adaptive Undulatory Locomotion of Snake-like Robots in Dynamic Viscous Environments via Deep Reinforcement Learning Figure 1
2026-07-27cs.RO

Adaptive Undulatory Locomotion of Snake-like Robots in Dynamic Viscous Environments via Deep Reinforcement Learning

Tsuyoshi Kimoto, Akio Yamano, Kohei Honda, Takashi Iwasa

2026-07-27机器人强化学习

这篇论文针对蛇形机器人在黏度随时间和空间变化的流体中难以依靠固定波形或在线建模保持推进效率的问题,将运动控制建模为部分可观测强化学习任务,并用带特权信息的非对称 actor-critic 将仿真中的黏度和速度知识蒸馏到只依赖本体感知的策略。仿真显示,该策略能生成非正弦自适应步态,在 10^-7 到 10^-2 m^2/s 的黏度范围内提升速度和运输效率,但结果仍主要停留在仿真验证。

Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound Figure 1
2026-07-27cs.RO

Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound

Siqi Fan, Mingcong Chen, Ran Liu, Zixuan Yang, Xiaoyu Fu, Xiaoqing Gao, Yunhui Liu, Hongbin Liu

Mingcong Chen is with the Department of Biomedical Engineering, City University of Hong Kong, Hong Kong SAR, Zixuan Yang, Xiaoyu Fu, Xiaoqing Gao and Hongbin Liu are with the Institute of Automation, Chinese Academy of Sciences, China, Hongbin Liu is with the Department of Surgical and Interventional Engineering, King’s College London, United Kingdom

2026-07-27机器人强化学习

这篇论文针对机器人超声中专家轨迹难收集、显式仿真难刻画接触变形和声学伪影的问题,提出用动作条件潜在扩散世界模型预测探头运动后的超声图像,并把冻结世界模型作为内部模拟器,为目标条件时序 Transformer 提供感知奖励来学习标准切面导航。自采颈部数据和真实闭环实验显示,模型能较好保持动作相关解剖结构,颈动脉与甲状腺引导成功率分别为70.0%和65.0%。

StARS: Socially Appropriate Robot Actions via a Recommender System-Driven Approach Figure 1
2026-07-27cs.RO

StARS: Socially Appropriate Robot Actions via a Recommender System-Driven Approach

Erencem Ozbey, Fethiye Irmak Dogan, Jin Huang, Hatice Gunes

E. Ozbey is with Bogazici University, Istanbul, Turkiye

2026-07-27机器人

论文针对社交机器人动作“是否合适”因人而异的问题,将动作选择改写为推荐系统中的偏好预测:把标注者视为用户、场景视为物品、动作适切性评分作为目标,并用协同过滤/矩阵分解叠加到不同场景编码器和骨干模型上。实验在 MannersDB+ 与 SocNav1 上显示,StARS 在多种模型和稀疏反馈设置下更贴近个体标注者判断,但实际部署中的在线适应与真实用户长期效果文中未充分说明。

Addressing the Orchestration Gap in Generalist Robots via Physical Agency Figure 1
2026-07-27cs.RO

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

Liane Galanti, Dhruv Shah, Tri Dao

2026-07-27机器人

这篇论文针对通用机器人把感知、规划、验证、恢复和控制都压进单一 VLA 策略后难以处理复杂指令的问题,提出 Pigey:在推理时用高层 VLM 编排器把目标分解为可执行子目标,选择冻结的 VLA 或参数化技能执行,并闭环检查结果与失败恢复。核心洞察是许多失败并非运动能力不足,而是缺少任务级编排。实验中,Pigey 在 LIBERO-PRO 将冻结策略成功率从 12.8% 提升到 53.3%,真实机器人推理受限任务从近零提升到 90% 以上。

Ordered Action Tokens for Visuomotor Policy Learning Figure 1
2026-07-27cs.RO

Ordered Action Tokens for Visuomotor Policy Learning

Chaoqi Liu, Yue Zhao, Haonan Chen, Xiaoshen Han, Jiawei Gao, Ehsan Adeli, Yilun Du

Harvard University, Stanford University, enization shapes learning dynamics, model capacity, scalability, and downstream performance (Sen-

2026-07-27强化学习

这篇论文针对机器人动作 token 化在压缩率、任意输出可解码性和序列结构之间难以兼顾的问题,提出 OAT:用寄存器式 Transformer、有限标量量化和前缀重建训练,让早期 token 表达粗粒度可执行动作、后续 token 逐步细化。实验覆盖三类策略骨干、五个仿真基准及真实场景的 60 多个任务,显示其在自回归控制和 token 协同训练中保持较强性能,并支持按推理预算灵活解码。

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation Figure 1
2026-07-27cs.RO

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation

Leesai Park, Jiho HOng, Sanghyun Kim

2026-07-27机器人生成模型优化算法

这篇论文针对扩散策略在部署时难以处理碰撞检测、关节限制等不可微约束的问题,提出 GRACE:在每个反向扩散步以扩散均值为中心做一次 MPPI 采样,用前向代价加权估计条件后验均值,从而无需重训或代价梯度即可引导动作生成。仿真中其成功率高于扩散与采样基线,并在真实 7 自由度机械臂上避开了未见障碍。

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey Figure 1
2026-07-27cs.RO

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

Jianshu Zhang, Keliang Wu, Haoran Lu, Anbang Liu, Ce Zhang, Weijie Yin, Chengxuan Qian, Xiyuan Yang, Zhenyu Pan, Guo Ye, Han Liu

2026-07-27机器人强化学习

这篇综述针对机器人学习中终端成功信号过于稀疏、难以刻画长程任务进展的问题,梳理“进度奖励模型”这一方向。核心洞察是用统一接口、构建机制、数据与评测三层框架比较不同方法,区分它们到底在估计进度、生成奖励还是验证下游效用。主要结果是给出分类法、监督来源和评测维度,并指出现有工作仍碎片化,跨方法可比性和闭环控制适用性文中未充分说明。

Learning Diverse Humanoid Tasks via Synthetic Video Scenarios without Real World Data Figure 1
2026-07-27cs.RO

Learning Diverse Humanoid Tasks via Synthetic Video Scenarios without Real World Data

Yun-Hao Tsai, Cong-Thanh Vu, Yen-Chen Liu

2026-07-27机器人视觉感知强化学习

这篇论文针对人形机器人学习复杂任务时真实示范采集昂贵、动作风格单一的问题,提出用文本提示驱动视频生成模型合成人体动作,再经姿态提取、重定向和动作链式拼接生成机器人参考轨迹,并用强化学习进行跟踪。实验在 Unitree G1 的四个仿真场景中验证,机器人能完成任务并适应同一任务的多种动作变化;但结果仍主要限于仿真,合成视频质量与策略增益的具体来源文中未充分说明。

2026-07-24

35 篇
AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation Figure 1
2026-07-24cs.RO

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

University of California, Berkeley, Georgia Institute of Technology, Texas A&M University, Johns Hopkins University, University of Pennsylvania, University of Michigan, National University of Singapore, Nanyang Technological University

2026-07-24机器人

AXIS针对机器人操作数据收集依赖专用硬件、中心化团队且难持续扩展的问题,提出社区驱动的数据引擎:用浏览器遥操作、自动任务生成与验证、轨迹清洗平滑及仿真增强,形成可版本化增长的数据快照。其207个任务、5万余轨迹用于VLA评测与预训练,使π0.5成功率提升5.8%,较RoboCasa365预训练高37.3%,但收益可能主要来自scaling / data。

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation Figure 1
2026-07-24cs.RO

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L.S. Wong

Northeastern University

2026-07-24机器人学习理论数据集/基准

论文针对机器人语言操作中“数据变多但未必真正理解指令”的问题,指出预训练策略会偏向颜色、物体等显著因素而忽视动词、尺寸等因素。其核心创新是把指令拆成颜色、动作、物体、尺寸、空间等因子,并用 FDR/FDH 量化因子偏置。六个基础策略上呈现一致层级:颜色最强,动词和尺寸最弱;据此重分配示范数据,在仿真和真实机器人中以更少数据提升组合泛化。

Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering Figure 1
2026-07-24cs.RO

Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering

Zikui Cai, Kaushal Janga, Tan Dat Dao, Seungjae Lee, Shivin Dass, Mingyo Seo, Kaiyu Yue, Mintong Kang, Nandhu Pillai, Monte Hoover, Aadi Palnitkar, Ruchit Rawal, Ruijie Zheng, Bo Li, Yuke Zhu, Roberto Martín-Martín, Tom Goldstein, Furong Huang

2026-07-24数据集/基准

这篇论文针对传统 EQA 按单题重置评测、难以反映机器人连续运行的问题,提出 Sequential-EQA,将同一场景中的多轮问题串联并保留记忆,以检验不同记忆架构的真实复用能力。核心洞察是“保留状态”不等于“积累知识”:2D 占据图缺少视觉语义证据,短视野 VLA 又会遭遇时序分布错配;只有绑定到度量 3D 几何的空间视觉记忆能稳定复用场景信息。实验显示该类记忆在序列设置下同时提升答题准确率并降低导航成本,文中报告最高约 33.3% 准确率增益和 53.3% 导航成本下降,并在真实移动机器人上验证趋势。

GS-Agent: Creating 4D Physical Worlds With Generative Simulation Figure 1
2026-07-24cs.RO

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

University of Massachusetts Amherst 2 Genesis AI

2026-07-24生成模型强化学习

这篇论文针对文本到4D世界生成中物理可信度和可控性不足的问题,提出GS-Agent:用多智能体把3D资产、材质、布局、运动、相机和灯光等步骤转化为可执行代码,并把物理引擎反馈纳入迭代。实验显示其在液体、柔体和刚体交互场景中,相比Sora2、Wan2.2及智能体基线有更好的物理合理性、指令一致性和控制精度。

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections Figure 1
2026-07-24cs.LG

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

Gil Lifshits, Igal Bilik, Gilad Katz

Ben-Gurion University of the Negev

2026-07-24机器人

本文针对无信号交叉口中多车强化学习常受动作组合爆炸、依赖特权信息和泛化差限制的问题,提出 MAPS:由中心 Master 生成连续 proto-plan 协调嵌入,Worker 结合本地观测执行控制,从而把全局协调与单车动作解耦。在 HighwayEnv 的 72 种路口配置中实现评估零碰撞,平均通行时间降至 7.8 步,并在三车训练到五车零样本部署时达到 94% 成功率。

GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition Figure 1
2026-07-24cs.RO

GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition

Panagiotis Mermigkas, Argyris Manetas, Petros Maragos

2026-07-24生成模型三维

GLAM-SLAM针对现有高斯泼溅单目SLAM难以在长序列室外场景中兼顾实时性、显存与重建质量的问题,将ORB-SLAM2式稀疏跟踪与并行3DGS建图解耦,并用光流加极线约束补密锚点、空间分区与局部MLP适应大尺度变化。在KITTI、Oxford RobotCar和Málaga上,文中报告重建质量较次优方法提升约15%,同时保持实时并可扩展到更长序列。

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method Figure 1
2026-07-24cs.RO

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

Beihang University, Beijing 100191, China, Hangzhou International Innovation Institute, Beihang University, Hangzhou 311115, China

2026-07-24机器人视觉感知数据集/基准

论文针对传统 VLN 在航线指令中隐含方向、距离和全局结构先验的问题,提出仅以目标视图和局部场景线索驱动的长航程导航范式 VoLN,并构建含 7,210 个无人机任务的 VoLN-UAV 基准。其 VoLN-MLLM 通过视觉-语义对齐与短程航点预测闭环规划,但在未见环境 Easy/Normal/Hard 成功率仅 7.4%/4.5%/1.8%,说明跨视角目标匹配、线索筛选和误差累积仍是主要瓶颈。

Grasp, Handover, Rotate: Bimanual Object Reorientation via Compositional Diffusion and Energy-Based Optimization Figure 1
2026-07-24cs.RO

Grasp, Handover, Rotate: Bimanual Object Reorientation via Compositional Diffusion and Energy-Based Optimization

Wun Lam Yeung, Wenjun Liu, Yui Cheung Yu, Zhengyan Lambo Qin, Qijin She, Heng Li, Ziqi Wang, Ping Tan

The Hong Kong University of Science and Technology, Shenzhen Loop Area Institute

2026-07-24生成模型优化算法

该文针对双臂重定向中初始抓取难以直接满足放置姿态、碰撞与运动学约束相互冲突的问题,提出 BiCompoDiff,将预训练抓取扩散模型与能量函数组合,在反向扩散和退火 MCMC 中联合优化抓取、交接、再抓取和运动平滑,并用可微 IK 提供梯度约束。仿真任务成功率较强基线提升超过 20%,关节位移最高降低 37%,且给出真实机器人验证,但仍假设物体位姿和几何已知。

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar Figure 1
2026-07-24cs.RO

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

All authors are with the Dalle Molle Institute for Artificial Intelligence

2026-07-24三维

本文面向服务机器人仅配备全向平面 LiDAR 和有限算力时的人体检测与朝向估计难题,提出将扫描射线上的空间卷积与跨帧时间卷积分解的轻量 ST-Block,并用窄视场 RGB-D 人体跟踪器在重叠视野内进行掩码跨模态自监督,避免人工 LiDAR 标注。实验显示其相对同参数基线降低距离、位置和朝向误差 38%、28%、15%,且可在 CPU 上实时运行。

HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors Figure 1
2026-07-24cs.CV

HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors

Siyu Li, Kunyu Peng, Di Wen, Beiping Hou, Zhiyong Li, Kailun Yang

2026-07-24机器人

这篇论文针对自动驾驶拓扑建图中车道中心线缺少直接视觉标记、导致检测和连接关系推理不稳的问题,提出 HGeo-TopoMap:一方面用逆透视得到的道路结构图作为显式几何先验并通过掩码注意力筛选有效区域,另一方面利用中心线直线、曲线及平行垂直关系做几何一致性约束。OpenLane-V2 上在中心线、车道段和鲁棒性基准中均优于多个基线,但具体增益对各模块和不同场景的依赖仍需看消融细节。

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor Figure 1
2026-07-24cs.RO

FORGE-plus: Force-Budgeted Recovery for Contact-Rich Assembly with a Frozen LLM Supervisor

Kyupaeck Jeff Rah, Midum Oh

2026-07-24机器人

这篇论文针对接触丰富装配中“力上限由谁设定、失败后如何恢复”的问题,提出冻结文本 LLM 只根据物体身份设定保守力预算,并用力信号选择固定恢复动作,实际力安全由控制环硬限幅保证。仿真中统一策略在易碎与坚固物体上实现零破损通过,滑移卡滞恢复率达 40%/64%,同时显示“继续加力”要么无效要么导致大量破损,但结论受限于刚体仿真和简化破坏模型。

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy Figure 1
2026-07-24cs.RO

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

Xiang Li and Jian Liu are with the Second Hospital of Dalian Medical University, Dalian 116024, China (e-mail:, Zhenzhi Ying and Pengfei Zhang are with the Department of Mechanical Engineering, The University of Tokyo, Tokyo 113-8656, Japan (e-mail:

2026-07-24机器人视觉语言强化学习

针对自主开颅中切削温度被遮挡、骨质时变导致力热安全与效率难以同时闭环调节的问题,RL-MACRO将力声融合的CNN-LSTM隐温度观测器、隐式状态分类与离线IQL双头Actor结合,联合调节进给、转速和切深,并通过在线轨迹重规划执行。实验在牛肋骨和6个离体羊颅上验证,温度重构达到R²=0.939、MAE=1.717°C,并能从力/温越界中恢复、适应不规则表面。

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects Figure 1
2026-07-24cs.CV

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, College of Design and Innovation, Tongji University, Shanghai Institute for Intelligent Autonomous Systems, Tongji University, School of Software and Engineering, Huazhong University of Science and Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology Wuhan China, College of Design and Innovation, Tongji University Shanghai China, Shanghai Institute for Intelligent Autonomous Systems, Tongji University Shanghai China, School of Software and Engineering, Huazhong University of Science and Technology Wuhan China

2026-07-24强化学习数据集/基准

面向自驱动生物实验室中透明塑料耗材难以识别、定位和抓取的问题,TransBiolab把重复实例、遮挡杂乱和标定多视角采集合在同一真实RGB-D数据集中,并按类别、物体数量和视角刻画难度。数据含98个场景、16万余帧和103万实例标注,覆盖分割、深度补全、6D位姿及机器人操作评测;结果显示现有方法在透明物体、对称结构、拥挤与视角变化下仍有明显缺口。

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment Figure 1
2026-07-24cs.RO

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

Zhenzhi Ying and Pengfei Zhang are with the Department of Mechanical Engineering, The University of Tokyo, Tokyo 113-8656, Japan (e-mail:

2026-07-24机器人视觉语言规划控制

针对开颅术中人工操作依赖经验、开放环机器人难以应对配准误差和骨组织变形的问题,论文提出闭环自主开颅框架:用内外颅骨轮廓融合规划螺旋轨迹,并融合力觉与声学信号进行突破检测,触发原位投影式轨迹修正以清除残余骨。牛肋实验达到97%突破预测准确率、0.048±0.097秒延迟、最大超切0.29毫米,4例离体颅骨实验均未损伤硬脑膜。

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning Figure 1
2026-07-24cs.RO

GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning

Masaki Murooka, Ryoichi Nakajo, Keisuke Shirai, Tomohiro Motoda, Hanbit Oh, Ryo Hanai, Yukiyasu Domae

This work was supported in part by JST CREST, Japan, Grant Number JPMJCR2553 and JSPS KAKENHI Grant Number 22K17984. 1 CNRS-AIST JRL (Joint Robotics Laboratory), IRL, National Institute of Advanced Industrial Science and Technology (AIST)

2026-07-24机器人模仿学习安全鲁棒

这篇论文针对端到端视觉模仿策略难以解释和纠正视觉关注、在分布外场景易失焦的问题,提出 GuidedAttention:用任务相关关键点作为显式中间注意表示,并让扩散动作策略以其为条件;用户只需在执行初始时选择性修正关键点,后续由跟踪模块传播。仿真和真实机器人实验显示,该机制在位置和外观 OOD 条件下稳定提升操作成功率。

A Real-Time Generalized Nash Equilibrium Framework for Interaction-Aware Autonomous Driving in Mixed Traffic Figure 1
2026-07-24cs.RO

A Real-Time Generalized Nash Equilibrium Framework for Interaction-Aware Autonomous Driving in Mixed Traffic

Nouhed Naidja, Mohamed-Cherif Rahal, Steve Pechberti, Stéphane Font, Guillaume Sandou (L2S), Marc Revilloud

Laboratoire des Signaux et Syst`emes (L2S), [5] better capture these collaborative aspects by allowing, the best response available to optimize its own utility [10]. Let

2026-07-24机器人

面向混合交通中自动车与人类驾驶员相互影响、单车优化难以处理共享安全约束的问题,论文将交互驾驶建模为广义纳什均衡,把安全区、道路几何与运动约束显式耦合到双方可行策略中,并用粒子群求解非凸均衡。实车 Renault Zoé 与人驾车在无信号交叉口测试中能生成较舒适、类人轨迹,求解收敛低于 50 ms。

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments Figure 1
2026-07-24cs.RO

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

2026-07-24机器人

ZONDA针对现有零样本目标导航多局限于单楼层静态场景、且低层控制依赖特定机器人训练的问题,构建了结合高度差可通行地图的启发式跨楼层规划、多视角VLM目标核验和行人轨迹预测避障的框架。论文在HM3D、MP3D、HM3D-DYNA及真实TITA双足机器人上报告了优于基线的导航表现,尤其提升了动态与多楼层环境下的鲁棒性。

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation Figure 1
2026-07-24cs.RO

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun

2026-07-24机器人强化学习数据集/基准

面向通用桌面操作,论文指出现有文本生成或程序化场景常过于稀疏且物理不可信,难以支撑可泛化策略训练。TableVerse 将野外单视角图像确定性重建为 Real2Sim 场景,通过资产拆解、尺度/位姿对齐、LCCR 几何纠错、MuJoCo 稳定化和自动轨迹生成,构建了含 10 万物理一致桌面环境、近百万物体实例和专家 pick-and-place 轨迹的数据集;实际策略增益文中未充分说明,价值可能主要来自 scaling / data。

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization Figure 1
2026-07-24cs.RO

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

Haejoon Lee, Xinyi Wang, Taekyung Kim, Dimitra Panagou

All authors are with the Robotics Department, University of Michigan, Ann Arbor, MI, USA

2026-07-24机器人生成模型规划控制优化算法

这篇论文针对多机器人轨迹优化中集中式 MBD 随机器人数量增长而采样效率下降、且需汇总所有动力学与约束的问题,提出 DMBD:由服务器聚合并广播其他机器人当前轨迹,各机器人在本地控制空间做条件反向扩散去噪。文中还给出全局与局部条件 score 差异界,并在换位、多层覆盖、停车和拥堵场景中显示亚秒级求解与优于基线的扩展性。

Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing Figure 1
2026-07-24cs.RO

Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing

Yufei Xi, Yijie Liao, Tulga Ersal

College of Engineering, University of Michigan, Ann Arbor, MI, USA.

2026-07-24规划控制

该文面向自动驾驶赛车中防止更快对手超车的防守控制问题,将其从单纯圈速优化转为赛道空间占用调节;核心做法是用 SAC 在 Frenet 坐标中生成防守参考,并嵌入受摩擦约束的非线性 MPC。仿真中平均被超时间由 8.8 秒增至 14.6 秒,轮胎力利用率达 83.4%,求解均值 33.3 ms;判断受限于 PDF 文本抽取质量。

Interaction Dynamics Modeling and Predictive Control for Safe Steerable Catheter--Tissue Interaction Figure 1
2026-07-24eess.SY

Interaction Dynamics Modeling and Predictive Control for Safe Steerable Catheter--Tissue Interaction

Yongyan Cao

2026-07-24规划控制安全鲁棒

这篇论文面向心脏介入中可转向导管既要贴近运动组织又不能超过穿孔风险力限的问题,将单腱导管化为尖端法向一维交互动力学,用部分物理前馈、扰动增广卡尔曼估计和带硬约束的预测控制统一处理跟踪、摩擦/滞后补偿与力安全。MuJoCo仿真显示,自由空间误差可降约90%,且只有显式力约束控制能在相近跟踪下把接触力从0.60N压到0.47N,硬件验证仍未完成。

URF: A Unified Robot Control-Policy Framework for Stable Contact Aware Manipulation Figure 1
2026-07-24cs.RO

URF: A Unified Robot Control-Policy Framework for Stable Contact Aware Manipulation

Jiyou Shin, Youngjin Seo, Jaeseog Won, Sungwon Seo, Hyunjun Kim, Seokmin Yoon, Tuan Luong, Hyungpil Moon

(Corresponding author: Hyungpil Moon.) 1 1 : The authors are with the Faculty of Mechanical Engineering, Sungkyunkwan University, Suwon 2066, South Korea, 2 : The authors are with the Faculty of Intelligent Robotics, Sungkyunkwan University, Suwon 2066, South Korea

2026-07-24机器人强化学习规划控制

这篇论文关注接触操作中“策略预测”和“底层控制”脱节导致的刚性接触不稳定问题。URF让策略同时输出虚拟目标、刚度和阻抗-导纳切换比例,并用接触力构造监督信号来学习何时偏向跟踪或稳接触。在翻箱和压线任务中,它相比纯导纳执行提高成功率,并减少力突增、振荡、工具损坏和安全停机等失败。

Robostral Navigate Figure 1
2026-07-24cs.RO

Robostral Navigate

Arjun Majumdar, Avinash Sooriyarachchi, Benjamin Tibi, Chris Bamford, Elliot Chane-Sane, Guillaume Lample, Khyathi Raghavi Chandu, Ludovic Ho Fuh, Mathieu Poiree, Olivier Duchenne, Rosalie Millner, Srijan Mishra, Theo Cachet, Thomas Chabal

2026-07-24机器人

本文针对现有语言导航系统依赖深度、多相机或地图而难以低成本跨平台部署的问题,提出只用单目 RGB 的 8B 视觉语言模型 Robostral Navigate,以图像空间“指向”预测航点,并用位移回退、仿真大规模轨迹、prefix-caching 和强化学习提升训练效率与鲁棒性。在 R2R-CE 上成功率 77.4%,RxR-CE 上 75.1%,超过单目及部分多传感器基线。

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination Figure 1
2026-07-24cs.RO

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

Matthew M. Sato, Kincho H. Law

Department of Civil and Environmental Engineering, Stanford University, robots to collaboratively build a social graph of established routes, which enforces path

2026-07-24机器人规划控制

这篇论文针对多机器人在人类环境中仅靠局部避障容易产生短视、不可预测路径的问题,提出将全局路径规划与轨迹协调解耦:用改造 A* 把靠右、路径一致性、缓冲等社会规范写入代价函数,并通过共享社会图维持车队级一致路径;再利用这种结构把冲突协调转化为混合整数凸规划。仿真和硬件演示表明,该方法能生成更可预期、符合社会习惯的无碰轨迹,并改善大规模车队协调的可扩展性。

Emergent Compositional Skills in Mixture-of-Experts VLAs Figure 1
2026-07-24cs.RO

Emergent Compositional Skills in Mixture-of-Experts VLAs

Shlok Shah, Rhiaan Jhaveri, Tharun Kumar Tiruppali Kalidoss, Chirayu Nimonkar, Ishaan Javali

2026-07-24机器人

这篇论文针对 VLA 机器人策略通常是黑盒单体、难以复用和解释技能的问题,在动作头中引入一次性路由的 LoRA Mixture-of-Experts,让路由器按视觉、语言和状态上下文选择贯穿整次前向的专家。实验显示专家会自发对应抓取、搬运、释放等低层行为,并跨任务复用、组合完成较长流程,同时性能接近单体微调基线;但证据以定性分析为主,部分专家仍任务特异且映射不完全清晰。

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation Figure 1
2026-07-24cs.RO

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation

Martín Gallegos, Francisco Leiva, Patricio Loncomilla, Michelle Cortés, Javier Ruiz-del-Solar

2026-07-24视觉感知三维

针对矿山破碎锤仍依赖远程人工、易受视野差和多设备调度限制的问题,论文提出面向自主作业的实时 RGB-D 感知流水线:先自过滤机械臂与遮挡,再结合图像实例分割和点云几何聚类识别格筛上的岩块,并基于表面法向、运动学可达性和作业约束生成优先级破碎位姿。系统在缩比实景平台和 Jetson AGX Orin 上约 10 Hz、总延迟约 675 ms,并完成与控制系统的闭环验证。

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance Figure 1
2026-07-24cs.RO

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance

Miroslav Krupa, Miroslav Cibula, Kristína Malinovská

2026-07-24机器人规划控制

针对采样式运动规划在高维、障碍密集场景中计算开销大且运行时间不稳定的问题,论文将仿生自监督轨迹规划扩展到含障碍环境,用前向模型和逆模型作为内部监督来修正轨迹模型输出,并在7自由度工业机械臂仿真中验证可行性;结果显示方法能生成避障轨迹,但也会利用监督信号的漏洞,作者进一步测试了缓解训练策略。

Decentralized UAV Swarms for Ground Target Protection in GPS- and Communication-Denied Environments Figure 1
2026-07-24cs.RO

Decentralized UAV Swarms for Ground Target Protection in GPS- and Communication-Denied Environments

Dimitria Silveria, Paulo Ricardo Marques de Araujo, Tiago Nascimento, Sidney Givigi

D. Silveria is with the Department of Electrical and Computer Engineering, and the Ingenuity Labs Research Institute, Queen’s University, Kingston, ON, Canada

2026-07-24机器人

面向战场中 GPS 失效、通信受阻时地面目标易受无人机攻击的问题,论文提出去中心化 UAV 群保护流程:仅用机载相对测量,通过不变扩展卡尔曼滤波估计目标状态、离散卡尔曼滤波估计队形相位,并用可随目标运动自适应的环绕控制完成监视、转向入侵机和收缩拦截。真实机器人实验用三架 UAV 和一辆地面车验证了检测、环绕与拦截流程的可行性。

FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation Figure 1
2026-07-24cs.RO

FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation

Zinan Li, Yiyang Ling, Yuming Gu, Binghao Huang, Chenhao Liang, Sharfin Islam, Hisham Bedri, John Chirikjian, Yunzhu Li, Stefanos Nikolaidis, Daniel Seita

Viterbi School of Engineering, University of Southern California, Columbia University

2026-07-24机器人视觉感知

FELT针对触觉数据采集昂贵、传感器脆弱且难以规模化的问题,利用RGB中可见的夹爪、物体和接触区域线索,学习从视觉生成双指压力触觉图像或潜在触觉特征,并用分支解码器匹配左右触觉面板拓扑。四个接触丰富操作任务显示,生成触觉和潜在特征均优于纯视觉策略,后者在训练和部署时可不依赖真实触觉传感器。

Towards Capability-Aware Traversability Navigation for Unstructured Environments Figure 1
2026-07-24cs.RO

Towards Capability-Aware Traversability Navigation for Unstructured Environments

Gianluca Capezzuto, Felipe Tommaselli, Matheus P. Angarola, Ricardo V. Godoy, Marcelo Becker

2026-07-24机器人

针对同一地形对不同机器人可通行性不同、现有方法多在后处理中过滤不可行路径的问题,论文提出 CAT,将机器人能力向量直接调制语义地形图,并通过 SPADE 解码器与机器人原型学习形成能力条件化特征空间。实验显示其在轨迹对齐和人类标注评测上优于 WayFAST、W-RIZZ,实机在四足与轮式平台上以 4.8Hz 展示了具身相关避障。

Safe and Scalable Multi-Drone Payload Transport via CBF-based Reinforcement Learning with Zero-Shot Sim-to-Real Transfer Figure 1
2026-07-24cs.RO

Safe and Scalable Multi-Drone Payload Transport via CBF-based Reinforcement Learning with Zero-Shot Sim-to-Real Transfer

Jaeyoun Choi, Oswin So, Songyuan Zhang, Cooper Taylor, Chuchu Fan

Jaeyoun Choi, Oswin So, Songyuan Zhang, and Chuchu Fan are with the Reliable Autonomous Systems Lab, Massachusetts Institute of Technology, Cambridge, MA, USA.

2026-07-24强化学习安全鲁棒

这篇论文针对多无人机吊载在真实动态环境中难以同时保证安全与规模化的问题,提出用最小二维耦合抽象训练分布式策略,并以离散图控制屏障函数强化学习连接到连续执行安全。实验证明同一策略可零样本迁移到 Crazyflie,支持最多六机和多编队移动障碍场景,但方法仍限于平面运输与规则挂点。

Scalable Low-Cost Laboratory Automation: A Digital Twin-Integrated Robotic Platform for Autonomous Liquid Handling (RAINBOTTM) Figure 1
2026-07-24cs.RO

Scalable Low-Cost Laboratory Automation: A Digital Twin-Integrated Robotic Platform for Autonomous Liquid Handling (RAINBOTTM)

Mohamed Rami Ayeche, Souhil Sid, Ahyen Mostofa, Rehaan Hussain, Ali Shayesteh, Fadwa El Mellouhi

2026-07-24机器人

这篇论文针对自驱实验室中液体处理设备昂贵、封闭且难以远程监管的问题,将消费级3D打印机改造成低成本移液机器人,并接入浏览器数字孪生与CEID闭环优化,实现实时镜像、远程干预和应急停止。彩色溶液混合实验显示RYB响应与预期平均误差约2个百分点,整机成本约1263美元,证明了可复现的低成本物理-虚拟实验自动化方案。

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics Figure 1
2026-07-24cs.RO

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

Georgia Institute of Technology

2026-07-24强化学习

面向机器人操作中可变形物体材料难观测、逐物体标定慢且纯学习模型易失物理一致性的问题,PhysCoRe把可微MPM模拟器与两个前馈模块结合:MfM从短时视觉运动估计逐粒子材料和置信度,RfD在模拟内部补偿残差误差。真实弹性/弹塑性操作序列上,其预测精度优于物理和学习基线,置信度也能指示材料估计较可靠的区域。

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation Figure 1
2026-07-24cs.LG

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

Eni Solomon Laughter

School of Transportation Engineering, Chang’an University, Xi’an 710064, China, we call the severity-controllability gap: existing generators can produce rare, This paper addresses the severity-controllability gap through SevDiff, a, trajectory data, producing clean, always-defined ITTC labels through internal

2026-07-24生成模型规划控制

针对ADAS测试中高风险车辆冲突样本稀缺、现有生成器难以按指定TTC精度生成场景的问题,SevDiff将目标最小TTC作为标量条件注入DDPM,直接学习12维运动学特征中的严重度约束,并用命中率衡量可控性。在468个交互窗口上,0.5–1.5秒TTC目标±0.5秒命中率达100%,2.0–2.5秒为97–99%,但5.0秒降至39%,显示其更擅长生成危险长尾场景。

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections Figure 1
2026-07-24cs.RO

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

Md Monzurul Islam, Subasish Das

Department of Civil Engineering, Texas State University

2026-07-24机器人

该文针对信号交叉口冲突预测中过度依赖成对指标或扁平特征、难以保留多主体交互拓扑的问题,提出 HERMES,将车辆与行人建成异构时序图,并把 TTC、DRAC 等 SSM 嵌入多头关系注意力与节点-边更新。实验显示其在 109,028 条轨迹序列上 AUC-ROC 达 0.9898,5% 误报率下召回 95.7% 冲突,跨路口零样本 AUC-ROC 仍有 0.9752,但增益中数据与场景相似性的贡献仍需进一步辨析。

2026-07-23

34 篇
Towards Miniature Humanoid Tele-Loco-Manipulation Using Virtual Reality and Reinforcement Learning Figure 1
2026-07-23cs.RO

Towards Miniature Humanoid Tele-Loco-Manipulation Using Virtual Reality and Reinforcement Learning

Nicolas Kosanovic, Jordan Dowdy, Jean Chagas Vaz

2026-07-23机器人强化学习

针对全尺寸人形机器人遥操作成本高、微型平台缺少全身移动操作能力的问题,本文为 DYNAMIXEL 微型人形构建 VR 上肢遥操作、强化学习下肢平衡/行走和自定义力矩控制的整套框架,并在 ROBOTIS OP3 上验证。系统可在手臂运动独立时最高约 0.45 m/s 行走,端到端手臂延迟约 220 ms;方块搬运实验平均 10 分钟内搬运 2 个 40 g 方块、行走约 5 m,但任务成功率有限,主要受步态抬脚不足、操作姿态和线缆限制影响。

Distributed Acoustic Localization Array Deployed Using a Soft Everting Vine Robot Figure 1
2026-07-23cs.RO

Distributed Acoustic Localization Array Deployed Using a Soft Everting Vine Robot

Sebastian Lorca Godoy, Ciera McFarland, Michael Val, Antonio Alvarez Valdivia, Nathaniel Hanson, Margaret McGuinness

© 2026 Massachusetts Institute of Technology.

2026-07-23机器人

面向灾后狭窄、无结构环境中的受困者声源定位,论文将分布式麦克风阵列沿软体外翻藤蔓机器人部署,并用动态 SRP-PHAT 同时处理远场到达方向和近场三维定位。实验比较五麦克风在不同安装位置、机器人形态、信噪比、接近方向和声源距离下的误差;结果显示,随机器人外翻展开、阵列孔径增大,定位峰值更集中,近场声源在仅展开三个麦克风后即可达到较高精度。

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats Figure 1
2026-07-23cs.RO

Distributed Motion Planning with Safety Guarantees for Self-Reconfiguring Robotic Boats

Alejandro Gonzalez-Garcia, Wei Wang, Wei Xiao, Wilm Decre, Jan Swevers, Carlo Ratti, Daniela Rus

2026-07-23机器人规划控制安全鲁棒

面向水面自重构机器人在并行组装中既要成形又要避免碰撞的问题,论文将ADMM分布式MPC用于长时域协同规划,再用分布式CBF在控制层实时过滤以补足非凸优化的安全缺口。仿真中4至25个体均达到100%成功与无碰撞,四台实体船完成多形状重构;但64个体需要更长预测 horizon,实时性明显受限。

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids Figure 1
2026-07-23cs.RO

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

Department of Engineering Technology, Technical University of Denmark, Denmark

2026-07-23机器人

论文针对VLA人形机器人从实验室基准到商超补货部署的可靠性落差,提出DEED框架,强调频率对齐、数据筛选、视觉高亮、降低VLA依赖,并用RECAP式经验驱动微调和潜空间分布诊断做闭环。结果显示无需改模型,少量高质量数据可将GR00T策略从不可用提升到32%成功率,一轮经验微调到42%,但继续迭代因自生成数据导致分布漂移而退化。

Courteous Anticipation: Improving Long-Lived Task Planning in Persistent Shared Environments Figure 1
2026-07-23cs.RO

Courteous Anticipation: Improving Long-Lived Task Planning in Persistent Shared Environments

Md Ridwan Hossain Talukder, Roshan Dhakal, Elizabeth Phillips, Gregory J. Stein

2026-07-23规划控制

这篇论文针对多机器人长期共享环境中“只完成当前任务”会留下不利终态、抬高后续任务成本的问题,提出 courteous anticipatory planning:在模型规划生成候选方案后,用按机器人分解训练的未来成本估计器,综合当前代价与所有机器人预期后续代价选 plan,避免联合 rollout 爆炸。实验在家庭和餐厅 PDDL 场景中,相比短视规划分别降总成本 10.43% 和 17.41%,也优于只考虑自身未来的 anticipatory baseline。

DINS-IO: Learned Inertial Odometry via Differentiable INS Consistency Figure 1
2026-07-23cs.RO

DINS-IO: Learned Inertial Odometry via Differentiable INS Consistency

Hao Qiao, Yan Wang, Jian Kuang, Xiaoji Niu

2026-07-23机器人

DINS-IO针对学习式惯性里程计依赖昂贵高精度位置标签、难以扩展到更多场景的问题,将捷联INS速度递推转化为可微的一致性约束:网络预测IMU频率的机体系速度,再通过滑窗最小二乘闭式残差进行无标签预训练,并用少量标注轨迹和LoRA校准到公制速度。实验称其在标准基准上用少量标签即可匹配或超过全监督基线。

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments Figure 1
2026-07-23cs.RO

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

University of Toronto, Vector Institute, University of British Columbia

2026-07-23机器人

面向杂乱多物体场景中按语言意图抓取且需适配不同末端执行器的问题,SeededGrasp 将 VLM 的语义判断压缩为点云中的任务种子点,再由轻量 flow-matching 抓取模型生成具体姿态,从而解耦语义定位与几何执行。作者还构建含 2.56M 抓取、3 类夹爪的数据集;实验报告仿真成功率 72%、真实场景 78%,优于对比方法,但部分增益可能主要来自 scaling / data。

Extreme-RGMT: Continual Learning of Highly Dynamic Skills for Robust Generalist Humanoid Control Figure 1
2026-07-23cs.RO

Extreme-RGMT: Continual Learning of Highly Dynamic Skills for Robust Generalist Humanoid Control

Yubiao Ma, Han Yu, Kai Guo, Changtai Lv, Zhengquan Mao, Boyang Xing, Xuemei Ren, Dongdong Zheng

School of Automation, Beijing Institute of Technology, Beijing 100081, China.

2026-07-23机器人规划控制安全鲁棒

针对通用人形控制器难以执行空翻、腾空转体等高动态动作,而专项训练又会破坏已有运动能力的问题,论文提出两阶段持续学习框架 Extreme-RGMT:先训练多源动作通用跟踪策略,再用 PACE 约束已掌握动作的策略漂移,并用 STAR 重采样高优势困难片段。实验显示其在仿真和 Unitree G1 硬件上提升高动态动作完成率,并支持固定参考与在线惯性动捕输入跟踪。

ReferTrack: Referring Then Tracking for Embodied Visual Tracking Figure 1
2026-07-23cs.RO

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

RCV Laboratory, SUSTech, Peking University, Futian Laboratory

2026-07-23视觉感知

针对具身视觉跟踪中VLA把目标识别压进抽象空间、难以监督且与图像检测弱对齐的问题,ReferTrack将识别改成在前视相机的索引bbox中先指代再规划,并用历史bbox队列与TVBI token保留运动线索。其在EVT-Bench单视角三类任务成功率达89.4%、73.3%、74.1%,部分识别密集场景接近或超过多相机基线,并在腿式与人形机器人上验证迁移。

Robots Acquire Manipulation Skills in Seconds from a Single Human Video Figure 1
2026-07-23cs.RO

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

2026-07-23机器人视觉感知

针对机器人学习新操作仍依赖遥操作采集与微调、耗时且易遗忘旧技能的问题,论文提出 HOST,将单个人类视频作为推理时技能条件,通过任务进度流形耦合预测目标,并以“定位进度—预测机器人未来观测—生成动作”的自接地级联弥合人机视频与执行差异。实验称其在 50 个新任务上平均 29 秒获得技能、成功率 62%,较零样本基线高约 45%,并优于每任务 50 条机器人示范微调基线且保持旧技能。

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training Figure 1
2026-07-23cs.RO

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

2026-07-23规划控制

这篇论文面向拥挤场景中的移动机器人导航,关注预测周围行人与规划自车轨迹在紧凑共享编码器中相互干扰的问题。作者提出“Skill Conflict”并用 DPT 将预测、规划的关键参数区域分离训练,再通过稀疏模型合并保留各自核心参数。实验在 JRDB 和 JTA 上显示,该方法在统一模型内同时改善轨迹预测与安全规划指标,适合资源受限部署。

Optimal Placement of Docking Stations and Resident AUVs for Subsea Pipeline Inspection Figure 1
2026-07-23math.OC

Optimal Placement of Docking Stations and Resident AUVs for Subsea Pipeline Inspection

Gabrielė Kasparavičiūtė, Pasquale Grippa, Kjetil Skaugset, Asgeir J. Sørensen, Martin Ludvigsen

2026-07-23机器人

面向海底油气管线异常后依赖ROV响应慢、成本高的问题,论文将驻留式AUV数量分配与水下对接站选址联合建模为两阶段MILP:先压低最坏往返巡检时间,再在该上界内优化平均时间,并用管线离散点表示泄漏位置不确定性。在挪威Johan Sverdrup案例中,33条管线、9个候选站的结果显示,少量布设得当的对接站已接近最优响应表现,帕累托分析给出成本与响应时间的取舍。

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction Figure 1
2026-07-23cs.RO

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

2026-07-23机器人生成模型

论文针对机器人长时序扩散预测中早期片段一旦低噪声收敛就难以被后续约束修正的问题,提出 Diffusion ReRoll:用调度矩阵和线性噪声块在去噪过程中选择性重新加噪,使不同时间段可反复互相修订。实验覆盖规划、动作预测和视频-动作建模,在 PointMaze/AntMaze、LIBERO-10 与 OOD 评测中均提升成功率和一致性;但仍只在仿真中验证,调度参数依赖任务。

Digital Twin Modeling of a Highly Automated Agricultural Tractor Figure 1
2026-07-23cs.OH

Digital Twin Modeling of a Highly Automated Agricultural Tractor

Clay Hallman, Lukas Pindl, Timo Oksanen

Technical University of Munich, Germany, Munich Institute of Robotics and Machine Intelligence (MIRMI)

2026-07-23机器人

本文面向农业拖拉机数字孪生研究不足、实车测试受场地天气和安全成本限制的问题,构建了AMX G-trac的Mevea多体动力学模型,并重点复用真实拖拉机的CAN/ISOBUS通信与执行控制链路。实车与仿真直线、转向测试表明,横向动力学通常可控制在5%到10%差异内,但纵向加速受传动、惯量等数据不足影响仍不稳定,增益可能主要来自更完整的参数标定。

What Matters in Humanoid General Motion Tracking? An Empirical Study Figure 1
2026-07-23cs.RO

What Matters in Humanoid General Motion Tracking? An Empirical Study

Fabio Amadio (HUCEBOT), Enrico Mingo Hoffman (HUCEBOT)

the Unitree G1, built on top of mjlab [17]. Within YAHMP, available at https://github.com/hucebot/yahmp, available when required by the training pipeline.

2026-07-23机器人视觉感知

本文针对人形机器人通用全身动作跟踪中设计选择难以单独评估的问题,构建开源 YAHMP 框架,在 Unitree G1 上控制比较运动命令、历史观测、残差动作、驱动配置、手部受力随机化和训练方式等因素。结果显示,部分选择直接影响跟踪精度,另一些主要改变力矩开销、训练复杂度或交互能力,并实现零样本实机部署、抗扰动和有力交互。

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness Figure 1
2026-07-23cs.RO

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

Zhejiang University, Wuhan University, Hunan University, Zhejiang University Hangzhou Zhejiang China, Wuhan University Wuhan Hubei China, Hunan University Changsha Hunan China

2026-07-23机器人安全鲁棒

这篇论文针对仅凭视觉导航难以适配不同机器人尺寸和可通行性的动作歧义问题,提出在模仿学习中显式注入 embodiment geometry:预训练用互联网第一视角视频构建跨形体数据并加入几何条件 token,微调阶段用高风险轨迹增强分别训练空间感知和风险校正模块。实验显示该方法在不同形体设置下提升导航性能和安全性,但更复杂运动约束仍未充分建模。

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding Figure 1
2026-07-23cs.RO

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

2026-07-23视觉语言强化学习数据集/基准

本文针对具身世界模型评测中过度依赖逆动力学模型导致失败归因不清的问题,提出 KineBench:用分割、深度估计和 CAD 约束 6D 位姿跟踪直接恢复末端执行器运动,并在 ManiSkill3 闭环验证。其还引入 SPARC 与操纵性指标,从3D运动平滑性和可行性诊断生成质量;在20个操作任务上发现前沿模型存在受任务复杂度限制的非线性 scaling,数据和算力增益会随难度上升而减弱。

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation Figure 1
2026-07-23cs.RO

SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

Xinyu Zhang, Zishuo Wang, Ling Xiao

2026-07-23机器人视觉语言视觉感知强化学习

本文面向大模型难以部署、轻量 VLM 又缺乏社会导航推理的问题,提出 SOPD-SocialNav:用教师模型的熵筛选更具社会决策价值的 token,弱化常规直行等低信息状态,并用温度控制的 JS 散度蒸馏学生模型。在 SNEI、MUSON 及 Scout Mini 实机测试中,方法相较 SFT、离线蒸馏和标准 OPD 提升了动作预测、感知一致性与推理一致性。

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards Figure 1
2026-07-23cs.RO

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

2026-07-23安全鲁棒

面向医院病房中机器人、可穿戴设备与智能医疗设备共存带来的安全风险,论文将临床路径从护理指南重释为可运行验证的安全规范。核心做法是用 STL 表达量测范围、时序、顺序和跨设备约束,并在机器人端 RSM 中结合预测、不确定性与约束检查,输出可解释的违规报告。主要结果是给出概念架构、监测流水线和三类安全事件 taxonomy;文中未充分说明实证验证效果。

V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits Figure 1
2026-07-23cs.RO

V2F: Vision-Informed Grasp Force Prediction for Damage-Aware Robotic Handling of Date Fruits

Shahd Shami, Obadah Wali, Eric Feron, Shinkyu Park

The work was supported by funding from King Abdullah University

2026-07-23机器人视觉感知

针对椰枣采摘中“需较大脱离力但易压伤”的矛盾,论文提出V2F:先做力学表征确定安全抓取范围,再用视觉分割、主动轮廓和几何特征结合Hertz接触模型残差网络预测预接触抓力。实验中跨品种验证R²约0.7,夹爪测试残余形变低于1毫米且未观察到损伤,但数据仍偏实验室规模。

Defer to Plan: Adaptive Multi-Agent Fusion for End-to-End V2X Driving Figure 1
2026-07-23cs.RO

Defer to Plan: Adaptive Multi-Agent Fusion for End-to-End V2X Driving

Nuoran Li, Zhang Zhang, Yueran Zhao, Tianze Wang, Chao Sun

2026-07-23机器人

这篇论文针对现有 V2X 协同驾驶多在感知阶段用固定权重融合、难以服务最终规划的问题,提出将多智能体融合推迟到规划阶段:用双流处理车端与路侧特征,结合路侧通道筛选、MoE tokenizer 和自回归解码器按场景自适应分配融合权重。在 V2Xverse 闭环评测中,方法驾驶分数达 79.72,高于 CoDriving 的 77.15,同时声称保持通信效率。

EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration Figure 1
2026-07-23cs.RO

EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration

Zuhao Ge, Yuchen Zhou, Weitao Zhou, Minglei Li, Xinyu Li, Chao Wu, Hanwen Zhao, Haotian Wang, Zuxuan Wu, Xiaosong Jia, Yu-Gang Jiang

2026-07-23模仿学习

论文针对机器人模仿学习中失败状态恢复数据昂贵且覆盖不足的问题,提出用第一视角人类恢复片段作为可扩展监督,并通过共享“纠正意图”瓶颈和恢复门控,而非直接迁移动作,缓解人机具身差异。实验显示,人类恢复数据采集效率约为机器人遥操作的10.5倍;在四个真实桌面任务中,完整 EgoRecovery 的平均失败恢复成功率达85.0%,优于机器人-only、直接混合人类恢复数据和无门控意图迁移等基线。

Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination Figure 1
2026-07-23cs.LG

Koopman Dreamer: Spectrally Constrained Latent Dynamics for Stable World-Model Imagination

Jiaqi Li, Xinglong Zhang, Haibin Xie, Yixing Lan, Wei Pan, Xin Xu

2026-07-23强化学习

这篇论文针对 Dreamer 类潜在世界模型长时想象中误差累积、模态持久性难调的问题,将确定性潜在转移改为带谱半径约束的 Koopman 式旋转缩放块,并加入线性/双线性动作项与教师、 rollout 训练目标。实验显示其在 DeepMind Control 多数本体任务和 UAV-LiDAR 导航中提升预测稳定性与闭环控制表现,但验证仍以仿真为主。

Morphing MILR: Design and control of a cable-driven limbless robot with rolling joints for maneuvering in complex environments Figure 1
2026-07-23cs.RO

Morphing MILR: Design and control of a cable-driven limbless robot with rolling joints for maneuvering in complex environments

Donoven Dortilus, Tianyu Wang, Galen Tunnicliffe, Matthew Fernandez, Daniel I. Goldman

2026-07-23机器人规划控制

这篇论文针对无肢机器人常被固定形态和单一步态限制的问题,提出 Morphing MILR:用双侧缆驱弯曲提供可编程顺应性,并通过滚转关节重定向各模块弯曲平面,实现形态快速切换且无需持续供电锁定。实验展示了侧向波动、侧绕、滚动和扭转等步态生成、障碍环境穿越及模式转换;但与专用前代平台的定量效率增益文中未充分说明。

Contact-Persistent Full Actuation for Aerial Physical Interaction Figure 1
2026-07-23cs.RO

Contact-Persistent Full Actuation for Aerial Physical Interaction

Abhimanyu Khadga, Abhinav Sinha, Shashi Ranjan Kumar

2026-07-23机器人

这篇论文针对全驱动无人机在持续接触任务中仅靠分配矩阵满秩认证不足的问题,提出“接触保持全驱动”框架:把执行器约束下的可行力/力矩集合建成多面体,并用任务载荷后的剩余裕度衡量稳定与抗扰能力。核心结果证明任务扳手位于可行多面体内部等价于存在非零六维剩余控制权,裕度半径就是到边界的距离;倾转六旋翼数值实验显示满秩仍可能推不动,适中或自适应倾角更能保留稳定裕度。

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation Figure 1
2026-07-23cs.RO

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

University of Michigan, Ann Arbor, Tsinghua University

2026-07-23机器人数据集/基准

现实机器人常需在楼内到街区的连续任务中导航,但现有基准多割裂室内/室外且弱化物理执行。NavVerse 用 Isaac Sim 构建含室内、室外和连通场景的物理基准,覆盖 ObjNav、VLN 与长程 PlaceNav,并以成功率、效率和安全指标评估可执行控制。零样本实验显示现有 RL、VLA 与模块化方法在出入口发现、边界穿越和跨场景适应上仍明显不足,VLA 成功率较高而模块化方法更安全。

Remote ID Spoofing-Aware Trajectory Planning for Small Unmanned Aerial Systems Figure 1
2026-07-23cs.RO

Remote ID Spoofing-Aware Trajectory Planning for Small Unmanned Aerial Systems

Jeremiah Webb, Bryce Bjorkman, Abel Diaz Gonzalez, Austin Coursey, Noah Dahle, Kailani Lemieux Mack, Filippos Fotiadis, Gautam Biswas, Bryan C. Ward, Abenezer Taye

2026-07-23规划控制

针对小型无人机依赖未认证 Remote ID 进行避障时易受位置欺骗、导致间隔丧失的问题,论文将 RID 视为不可信信号,利用邻机 RSSI 做欺骗检测与概率定位,再把定位不确定性转成机会约束下的风险禁区,并嵌入单机 MDP 规划。多机配送仿真显示,相比默认 RID 真实的规划器,该方法减少近空中碰撞事件,同时保持可实时运行的计算开销。

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter Figure 1
2026-07-23cs.RO

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

University of Pennsylvania

2026-07-23规划控制

这篇论文针对杂乱多物体场景中规划与控制随物体数、碰撞和干扰物快速变难的问题,提出 LENS:用多模态大模型按任务动态判断相关物体,通过剪枝和合并生成简化场景,并在失败后闭环重询以修正抽象。实验显示该前端可接入 TAMP、模型控制和 VLA,在拥挤桌面任务中提升成功率并降低或稳定计算时间,主要价值在于把手工场景抽象自动化。

CRB-Driven Beamforming and Trajectory Optimization for UAV-assisted ISAC System Figure 1
2026-07-23cs.IT

CRB-Driven Beamforming and Trajectory Optimization for UAV-assisted ISAC System

Yi Yang, Qianqian Zhang, Huaxia Wang

2026-07-23规划控制优化算法

面向6G ISAC中基站感知受功率与干扰约束限制的问题,论文把无人机作为可控人工噪声辅助源,而非空中基站,并以平均CRB驱动联合优化波束和轨迹;方法上用UAV-BS信道零空间投影抑制直达干扰,再结合凸优化与SAC轨迹控制。仿真显示平均CRB较无UAV方案降低超过10%,也优于固定轨迹和MRT波束基线。

A Splitting Architecture for Exact Reduced Coulomb Friction Figure 1
2026-07-23cs.GR

A Splitting Architecture for Exact Reduced Coulomb Friction

Hongcheng Song, Ye Fan, Uri M. Ascher, Dinesh K. Pai

University of British Columbia, Canada

2026-07-23机器人

这篇论文针对精确库仑摩擦在机器人/物理仿真中难以数值求解的问题:平滑会牺牲摩擦精度,凸松弛会在滑动接触中产生分离伪影。作者的关键洞察是把约化库仑律拆成锥约束线性响应和由切向速度引起的标量非关联耦合,用外层 FBF 迭代更新耦合、内层求强凸锥 QP。刚体堆叠、拱结构和转台 stick-slip 实验显示,该方法无需平滑或松弛即可接近精确互补残差,但全局收敛率仍文中未充分说明。

Learning Personalized Safety Interventions for Haptic Human-Robot Shared Control Figure 1
2026-07-23cs.RO

Learning Personalized Safety Interventions for Haptic Human-Robot Shared Control

Dawei Zhang, Roberto Tron

2026-07-23机器人规划控制安全鲁棒

针对触觉共享控制中安全干预依赖人工调参、难以适配不同操作者偏好的问题,论文提出 Learning from Haptics 框架,将 CBF-QP 作为可微优化层,从少量用户示范的力反馈中学习响应参数,而非端到端替换控制器。仿真、硬件在环和真实实验显示,该方法能生成更贴近示范偏好的个性化安全干预,并降低触觉反馈失配。

Milo, a Fully Autonomous Indoor/Outdoor Robotic Guide Dog Figure 1
2026-07-23cs.RO

Milo, a Fully Autonomous Indoor/Outdoor Robotic Guide Dog

Florian Golemo, Joanna Wolski, Joel Ruben Antony Moniz, Christopher Pal

Mila - Quebec AI Institute, Mila - Quebec AI Institute, Polytechnique, Polytechnique, Mila - Quebec AI Institute

2026-07-23机器人

针对传统导盲犬成本高、供给有限,而现有机器人导盲方案常依赖先验地图、外部计算或缺少对使用者动态建模的问题,Milo 将改装四足机器人、板载 RGB/LiDAR 感知、BEV 语义建图和仿真中训练的强化学习避障策略结合起来,在未知室内外环境中协同导航。实测障碍与行人场景显示,相比 costmap 基线,其轨迹更平滑并减少了使用者碰撞,但复杂城市过街、非平坦地形和社会化导航仍未解决。

Emergent Autonomous Drifting for Collision Avoidance in Real-World Winter Driving Scenarios Figure 1
2026-07-23cs.RO

Emergent Autonomous Drifting for Collision Avoidance in Real-World Winter Driving Scenarios

Elliot Weiss, Michael Thompson, Thomas Lew, John Subosits

The authors are with Toyota Research Institute. Corresponding email:

2026-07-23强化学习

本文针对冬季低附着路面中漂移是否真能提升避撞安全这一问题,构建基于真实事故数据的危险场景,并提出无需显式漂移轨迹或模式切换的漂移能力非线性 MPC。结果显示,高侧偏动作会在后轴遇冰或对向车侵入时自然出现;相比 ESC,其在多速度下中位车道误差更低,但高速长冰面仍有少量严重偏离风险。

ModPack: An Extensible Teleoperation Interface for Bimanual Mobile Manipulation Figure 1
2026-07-23cs.RO

ModPack: An Extensible Teleoperation Interface for Bimanual Mobile Manipulation

Joshua Citron, Renee Zbizika, Zeyi Liu, Shuran Song

Stanford University

2026-07-23机器人

ModPack针对现有遥操作系统常与特定机器人和任务绑定、扩展成本高的问题,提出以可穿戴背包为统一底座,将供电、计算、通信和存储与任务能力解耦,并通过可插拔模块支持双臂关节级控制、移动底盘、主动感知和触觉反馈。作者在两种机器人平台和真实双臂移动操作任务上收集示教并训练策略,结果表明该接口可复用地支撑数据采集和策略部署,但具体性能增益相对各模块的贡献仍需进一步拆分说明。

2026-07-22

39 篇
Masked Visual Actions for Unified World Modeling Figure 1
2026-07-22cs.CV

Masked Visual Actions for Unified World Modeling

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

Stanford University, University of Maryland, College Park, Harvard University

2026-07-22强化学习

这篇论文针对机器人世界模型中动作信号与视频模型视觉先验不对齐的问题,提出 Masked Visual Actions:把机器人或物体轨迹以像素空间的遮罩片段输入同一视频模型,从而在揭示机器人运动时做前向预测,在揭示目标物体运动时做逆向生成。作者用约 15 小时真实与仿真数据微调单一检查点,在多实体和未见机器人形态上提升视频保真与可控性,并用于策略评估、模型规划和动作提取。

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs Figure 1
2026-07-22cs.RO

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

Jason Stanley (1), Zhirui Dai (1), Qihao Qian (1), Tzu-Chin Ho (1), Tianxing Fan (1), Siddharth Saha (2), Christopher Barngrover (2), Ki Myung Brian Lee (1), Nikolay Atanasov (1) ((1) UC San Diego, La Jolla, USA, (2) Shield AI, San Diego, USA)

2026-07-22规划控制

这篇论文针对无人机在未知杂乱环境中需同时实时建图与安全规划的问题,主张用非截断 SDF 统一替代占据图接口。核心是 OREN 以八叉树先验加神经残差在线重建可微 SDF,Bubble* 直接利用距离生成无碰撞球廊并优化轨迹。实验显示 SDF 误差较基线降 22%,约 90 米轨迹规划用 1-3 秒,碰撞检查比 A* 少 91-99%,并在 Jetson Orin NX 四旋翼上闭环运行。

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation Figure 1
2026-07-22cs.CV

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

Shandong University, China University of Petroleum (East China)

2026-07-22机器人视觉语言

这篇论文针对无人机视觉语言导航中单次推理容易在复杂场景生成不安全或次优航迹的问题,提出无需训练的测试时扩展框架:先并行生成多条候选轨迹,再逐条自我修正,并用安全性、目标对齐和前进进展打分选择方案。实验称该方法优于传统基线和单一 sequential/parallel scaling,并显示成功率随推理 token 预算增加而提升,但具体增益可能主要来自 scaling。

Stochastic Multi-Objective Kinodynamic Planning Against Adversaries Figure 1
2026-07-22cs.RO

Stochastic Multi-Objective Kinodynamic Planning Against Adversaries

Thomas Marshall Vielmetti, Daniel Cherenson, Dimitra Panagou

2026-07-22规划控制

本文针对随机混合对抗者会随自车状态反应的场景,指出开环轨迹上的机会约束评估会高估风险并导致规划保守。核心做法是把搜索对象改为闭环策略序列,在RRT/SST建树时用蒙特卡洛粒子 rollout 估计风险并维护代价-违约概率的 Pareto 前沿。结果给出SMO-RRT的概率完备性、SMO-SST的稀疏化加速取舍,以及非高斯、状态相关不确定性下的有限样本安全违约概率界。

Eversion-based robots can enable safe access,steering and endoscopic imaging within the spinal subarachnoid space Figure 1
2026-07-22cs.RO

Eversion-based robots can enable safe access,steering and endoscopic imaging within the spinal subarachnoid space

Zicong Wu, Panagiotis Kalozoumis, S.M.Hadi Sadati, Aminul I. Ahmed, Jonathan Shapey, Christian Baker, Thomas Booth, Wenfeng Xia, Sebastien Ourselin, Panagiotis Vartholomeos, Christos Bergeles

Department of Computer Science & Biomedical Informatics, University of Thessaly, Lamia 35131, Greece, School of Engineering and Materials Science, Queen Mary University London, London E1 4NS, United Kingdom, Institute of Psychiatry, Psychology & Neuroscience, King’s College London, London WC2R 2LS, United Kingdom, School of Electrical and Computer Engineering, National Technical University of Athens, Zografou 15773, Greece

2026-07-22机器人安全鲁棒

针对脊髓蛛网膜下腔狭窄、柔软且易损,传统导管近端推送会积累摩擦和剪切力的问题,本文提出2 mm外翻生长式Vine4Spine机器人,将运动集中在远端并集成微型内镜。模型、仿体和完整人尸体验证显示,其平均/峰值交互力较推送式插入降低65.2%/48.0%,并实现150 mm腔内延伸和多模态成像,但临床转化仍需更大样本和生理条件验证。

Computing on the Fly: Navigating a Vision for the Future of Drone Computing Figure 1
2026-07-22cs.RO

Computing on the Fly: Navigating a Vision for the Future of Drone Computing

Kevin Butler, Christopher Stewart, Nils Aschenbruck, Alina Gerall, Weisong Shi, Deborah Silver, Ufuk Topcu

Kevin Butler, University of Florida, Christopher Stewart, The Ohio State University, Nils Aschenbruck, Osnabrück University, Weisong Shi, University of Delaware, Ufuk Topcu, University of Texas, Deborah Silver, Rutgers University, Sabine Brunswicker, Purdue University, Mike Kronander, Burgess & Niple, Inc., Srinivasan Parthasarathy, The Ohio State University, Shashi Shekhar, University of Minnesota

2026-07-22视觉感知

面向2035年非军事无人机大规模落地的计算能力缺口,本文基于47位产学政专家工作坊提出“飞行中计算”研究图景,核心洞察是无人机瓶颈不在单机硬件,而在百万级机群的AI可靠性、边云实时协同、安全信任、认证标准与监管协同。主要结果是梳理12类技术挑战,并给出数字孪生仿真到现实、物理+数字测试床、设备级身份密钥基础设施、实时感知的自主框架及2028年千机示范等路线图;文中未充分说明定量实验增益。

STL-GCS: A Planner-Controller Framework for Signal Temporal Logic via Graphs of Time-varying Convex Sets Figure 1
2026-07-22eess.SY

STL-GCS: A Planner-Controller Framework for Signal Temporal Logic via Graphs of Time-varying Convex Sets

Nicola De Carli, Gregorio Marchesini, Dimos Dimarogonas

2026-07-22规划控制优化算法

本文针对机器人在复杂时空任务中既要满足 STL 逻辑约束又要避免开环执行失效的问题,提出把 STL 谓词转化为时变凸集,并与 GCS 最短路规划、B 样条连续时间约束和 CBF 跟踪控制结合。其核心洞察是规划与控制共享同一组鲁棒时空集合,从而把任务满足、避障和平滑性统一到优化框架中;仿真和空间机器人实验证明了可行性,但相对基线的规模化增益文中未充分说明。

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency Figure 1
2026-07-22cs.RO

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

Zhongyao Yang (1 and 2), Haoyu Li (1 and 2), Yu Yan (1 and 2), Zhuangxuan Yu (1 and 2), Jiangfeng Nan (3), Jinrui Nan (1 and 2) ((1) School of Mechanical Engineering, Beijing Institute of Technology, Beijing, China, (2) National Engineering Research Center of Electric Vehicles, (3) School of Mechanical Engineering, Southeast University, Nanjing, China)

2026-07-22规划控制

针对自动驾驶高层规划中长尾场景推理不足、全量链式推理延迟高且理由与动作可能不一致的问题,论文提出结构化 S-CoT、视觉 Arbiter 快慢路由和规则验证结合 GRPO 的双过程框架。NAVSIM 人工验证集上规划准确率 80.14%、LCS 97.20%,较全慢推理延迟降 17.39%,但低能见度和交通标志长尾场景仍有退化。

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents Figure 1
2026-07-22cs.RO

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

University of British Columbia, Johns Hopkins University, National University of Singapore, Columbia University, University of California, Los Angeles

2026-07-22视觉语言视觉感知强化学习

机器人交互的 Real2Sim 仍依赖大量人工调参,难以把真实录像变成可复现实验的物理仿真。本文提出 Agentic Real2Sim,用视觉语言智能体串联视觉处理、物理先验推断、场景准备和仿真闭环优化,生成保留几何、状态、轨迹与物理参数的 episode twin。结果显示其可覆盖刚体、可变形物体和人体运动场景;在 DROID-100 上,开放 31B VLM 达到接近闭源模型的回放成功率,成本约为 GPT-5.4 的 3%。

Bayesian Retraction Optimization for Tissue Attachment Mapping in Surgical Dissection Figure 1
2026-07-22cs.RO

Bayesian Retraction Optimization for Tissue Attachment Mapping in Surgical Dissection

Shing-Hei Ho, Bao Thach, Toan Vo, James M. Ferguson, Alan Kuntz

Work was performed by authors at The Robotics Center and the Kahlert School of Computing at the University of Utah, Salt Lake City, UT, USA., Shing-Hei Ho is with the School of Computational Science and Engineering, Georgia Institute of Technology, GA, USA., James Ferguson and Alan Kuntz are with the Department of Electrical and Computer Engineering and Department of Computer Science, Vanderbilt University, TN, USA.

2026-07-22优化算法

这篇论文面向外科解剖中“牵拉后该切哪里”的不确定决策问题,将组织附着点识别建模为主动感知而非依赖手工策略或软组织仿真。核心做法是用序贯贝叶斯 Hilbert Map 融合多次牵拉下分类器的噪声观测,并用 BRO 在安全约束下选择信息量最大的下一次牵拉。仿真显示其优于随机采集且能抗分类器噪声,真实 dVRK 实验还展示了零样本迁移,但更复杂解剖几何下的适用性仍待验证。

Design and stability analysis of an underactuated hand with passively rotating fingers Figure 1
2026-07-22cs.RO

Design and stability analysis of an underactuated hand with passively rotating fingers

Léonie Plancoulaine (LS2N, LS2N - équipe RoMas), Sylvain Guégan (LGCGM), Franck Plestan (ECN, LS2N), Damien Chablat (LS2N

2026-07-22机器人

面向农业、物流等场景中低成本但适应性强的抓取需求,论文提出三指欠驱动手:每根两节手指在基部加入被动转动关节,并用弹簧滑块差动机构让单一驱动力分配到多指。其核心在于用接触力引起的基部力矩判定精密抓取与包络抓取稳定性,避免物体被挤出。机械原型验证了圆柱、球形、平行和包络等多种抓取,但自动化驱动与控制策略仍未充分展开。

The Twist Decomposition of Serial Robots Under Lower-Mobility Tasks Figure 1
2026-07-22cs.RO

The Twist Decomposition of Serial Robots Under Lower-Mobility Tasks

Luc Baron (IICiMed), Damien Chablat (LS2N - équipe RoMas, LS2N)

2026-07-22机器人

面向去毛刺、抛光等低机动任务,六自由度串联机器人会出现任务冗余,而传统基于雅可比零空间的方法在约束变化或平移、旋转分量选择性受限时不够直接。论文提出用几何定义的 twist 投影器把末端速度分解为任务相关与冗余分量,并嵌入紧凑逆运动学框架;平面 3R 与 Fanuc 去毛刺算例显示该方法可处理常量和时变约束,并结合关节限位回避等二级目标。

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion Figure 1
2026-07-22cs.RO

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

Sanket Sharma

2026-07-22视觉感知三维

面向无人机在城市峡谷、干扰或无 GPS 环境中的高空定位漂移问题,NGPS 将下视图像与地理配准卫星图像做深度特征匹配,并用匹配置信度自适应调节 UKF 噪声,结合速度预测搜索窗口和多速率时序队列融合 VIO/IMU。五段 60–150 m 飞行中定位 RMSE 为 2.94 m,较单目 VIO 提升约 3.5 倍,并支持实时 2.5D 正射重建。

Pose-Parameterized Motion Planning and CBF-QP Self-Collision Filtering for a Long-Reach Drilling Boom Figure 1
2026-07-22cs.RO

Pose-Parameterized Motion Planning and CBF-QP Self-Collision Filtering for a Long-Reach Drilling Boom

Mehdi Heydari Shahna, Tuomo Kivelä, Jouni Mattila

Faculty of Engineering and Natural Sciences, Tampere University, 33720 Tampere, Finland.

2026-07-22规划控制三维

面向地下长臂钻机从人工监看转向自主换孔时的自碰撞风险,论文把姿态参数化路点/绕行规划与基于胶囊模型的 CBF-QP 速度过滤接入测量状态 IK,使同一任务参数可串联生成轨迹而无需逐目标调参。在 SB60 Simscape 模型的两类钻孔任务中,数十万采样未出现 IK 失败或低于阈值的 CBF 间隙,末端平均定位达到毫米级;但结论仍主要是仿真与采样层面的安全证据。

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory Figure 1
2026-07-22cs.RO

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

2026-07-22强化学习

针对现有世界动作模型难以跟踪长程任务进度、细粒度指令 grounding 弱且多依赖文本控制的问题,论文提出 WorldScape Policy 2.0,将事件级进度记忆与短期视觉记忆结合,并用 ManipEvent-5M 和语义强制把子任务语义注入潜在规划。仿真与真实平台结果显示其在长程规划、细粒度执行和视觉提示适应上优于代表性 VLA/WAM 基线,但部分增益可能主要来自大规模事件数据。

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation Figure 1
2026-07-22cs.RO

Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation

Jiahong Zhang, Yifan Lin, Yandong Zhang, Sijun Shen, Kexin Wang, Yuqi Pan, Hongjuan Pei, Wei Wang, Guoqi Li

2026-07-22机器人强化学习

论文针对开放词汇目标导航中长时序部分可观测状态难以更新的问题,指出Transformer策略增加上下文长度并未带来稳定收益。作者将线性注意力作为策略骨干,并提出WSLA,通过多子状态扩展和可学习读出增强历史整合。在HM3D-OVON上成功率达36.4%,较Transformer基线高6.3个百分点,长距离任务、HSSD迁移及Unitree Go2实机50次试验中也显示较好泛化。

Koopman DCM: Unstable Eigenfunctions as Data-driven Representations for Legged Balancing Figure 1
2026-07-22cs.RO

Koopman DCM: Unstable Eigenfunctions as Data-driven Representations for Legged Balancing

Stéphane Caron

Institute for Intelligent Systems and Robotics, CNRS and Sorbonne University

2026-07-22机器人

论文针对传统 DCM 只适用于线性倒立摆且自然频率依赖模型假设的问题,将腿式平衡中的发散运动分量重新解释为 Koopman 不稳定特征函数,并用真实机器人闭环数据学习该表示。在一小时双足机器人数据上,学习到的 DCM 相比运动学基线降低 ZMP 跟踪误差,并可在 MPC 中作为可行性约束;但部分增益可能主要来自 scaling / data。

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition Figure 1
2026-07-22cs.RO

Motion Primitive Discovery in a Humanoid Robot via Self-Organising Maps for Phase Recognition

Radovan Gregor, Igor Farkaš

2026-07-22机器人视觉感知生成模型

面向人机协作中在线理解动作阶段的问题,论文用镜像神经元系统启发的两级结构,将手臂与手部运动分别映射到自组织映射中形成可复用运动基元,再由 ESN 整合基元序列识别当前阶段。结果显示,仅用 SOM 轨迹已达 93.86% 阶段识别率,加入动作身份、距离和接触等上下文只带来小幅提升,说明主要判别信息来自自组织的运动动态而非外部语境。

Correct-by-Construction Behavior Tree Synthesis from Signal Temporal Logic Specifications with Application to Robotic Missions Figure 1
2026-07-22cs.RO

Correct-by-Construction Behavior Tree Synthesis from Signal Temporal Logic Specifications with Application to Robotic Missions

Jiaheng Dong, Jingyi Huang, Liang Han

2026-07-22机器人

这篇论文针对行为树在机器人任务中易组合、可反应但缺少时间约束正确性保证的问题,将信号时序逻辑规格转化为可部署的行为树。核心做法是用定时转移系统和区域图构建增广状态,并通过分层不动点算法为安全、到达、响应、递归与持久性规格求胜集,再用运行时约束函数限制行为树执行。仿真和四旋翼实验证明多条 STL 规格可在扰动下满足,且具有正鲁棒性。

Confidence-Gated Vision-Only Heading Alignment for UAV-UGV Cooperative Systems Figure 1
2026-07-22cs.RO

Confidence-Gated Vision-Only Heading Alignment for UAV-UGV Cooperative Systems

Reza Ahmari, Vahid Hemmati, Parham Kebria, Olusola Odeyomi, Kaushik Roy, Abdollah Homaifar

2026-07-22视觉感知

这篇论文关注 UAV-UGV 协同中视觉航向预测“何时该被执行”的问题,而非重新训练预测器。核心做法是在固定视觉预测器上加入置信门控,用目标框面积和短窗航向波动作为可解释可靠性代理,并比较冻结 HOLD 与有界混合回退。实验显示,门控可提升被执行帧精度但会牺牲执行率;在稀疏执行时冻结策略易产生陈旧命令误差,有界混合能明显改善命令级精度与平滑性。

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation Figure 1
2026-07-22cs.RO

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

2026-07-22机器人强化学习

机器人数据往往采集昂贵、绑定具体本体,且缺少能支撑推理、控制和世界建模的细粒度时空标注。RoboInter1.5的核心是把中间表示从可解释标签提升为统一接口,构建含23万+操作片段、571场景和10余类逐帧标注的数据、VQA、VLA与世界模型套件。实验显示这些表示可改善具身时空推理、动作执行与可控未来状态预测,但部分增益可能主要来自scaling/data。

How defensive driving enhances driving safety: A driving simulator study on drivers' defensive driving behaviors Figure 1
2026-07-22cs.RO

How defensive driving enhances driving safety: A driving simulator study on drivers' defensive driving behaviors

Xinzheng Wu, Junyi Chen, Shaolingfeng Ye, Yong Shen

2026-07-22安全鲁棒

本文针对防御性驾驶虽被广泛倡导但缺少清晰定义和实证机制的问题,将潜在风险点与实际风险点区分开来,并用82名被试的模拟驾驶与眼动数据分析防御性行为。结果显示,高防御驾驶能力者更早识别风险并采取制动、转向等动作,平均速度更低、TTC/PET风险指标更安全;低能力组在重复试次中习得类似行为后碰撞率下降,说明安全增益主要来自提前风险识别与主动规避。

MVP-Tac: A Miniaturized Dual-Modal Vision and Photoelastic Tactile Sensor for Robot-Assisted Minimally Invasive Surgery Figure 1
2026-07-22cs.RO

MVP-Tac: A Miniaturized Dual-Modal Vision and Photoelastic Tactile Sensor for Robot-Assisted Minimally Invasive Surgery

Md Rakibul Islam Prince, Jaeeun Kim, Yuhao Zhou, Mason Vrshek, Shivani Reddy Sama, Adyaa Khera, Sheeraz Athar, Zijie Xu, Jiabin Liu, Shaoting Lin, Wei Li, Yu She

*This work was supported in part by the Department of the Air Force under Contract FA857126C0002

2026-07-22机器人视觉感知

面向机器人微创手术中视觉导航不可牺牲、但触诊反馈缺失的问题,MVP-Tac将半透明膜、反射式光弹成像和微型偏振光路集成到同一传感头,通过切换照明在视觉与触觉模式间共用相机。实验在0–2 N内完成力标定,并在组织仿体肿瘤硬度分类中达到暴露肿瘤97%、皮下肿瘤92%准确率,还展示了模拟结肠镜中的3D腔壁映射与原位硬度识别。

Fabric Pneumatic Artificial Muscles Based on the Drawstring Principle Figure 1
2026-07-22cs.RO

Fabric Pneumatic Artificial Muscles Based on the Drawstring Principle

Chendong Liu, Dapeng Yang, Yiming Dai, Li Jiang, Hong Liu

State Key Laboratory of Robotics and Systems, Harbin Institute of Technology, contraction, which severely wastes available working space. Inspired by the widely adopted, excellent scalability. Two representative application scenarios, bionic robots and industrial, elaborately engineered structures, pneumatic soft actuators can achieve bending (44, 45)

2026-07-22机器人

针对传统气动人工肌肉轴向收缩时伴随径向膨胀、占用空间并限制并联集成的问题,论文借鉴纺织品抽绳结构,提出由内层气囊、外层织物和抽绳通道组成的 DPAM,将充气体积变化转化为抽绳端收缩,从机制上消除额外径向变形。实验显示其最大收缩率 44%、载荷超自重 800 倍、功率密度 4.98 kW/kg,并在仿生机械臂、冲压装置和二维阵列中验证紧凑部署能力。

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation Figure 1
2026-07-22cs.RO

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

2026-07-22生成模型规划控制

面向自动驾驶闭环评测中长尾、安全关键交通交互难采集且仿真难兼顾真实与可控的问题,论文提出 E2E-CDiff:在前视视觉条件下用扩散模型联合生成背景车未来状态与底层控制,并用可微引导约束速度、可行驶区域和碰撞倾向,以缓解轨迹规划与控制执行脱节。Bench2Drive 实验显示其相较强化/模仿学习基线取得更好的真实性-可控性折中,碰撞引导版本还能构造更具挑战的压力测试场景。

On the Limits of Sampling-Based Reachability: Geometry, Dynamics, and Sample Complexity Figure 1
2026-07-22cs.RO

On the Limits of Sampling-Based Reachability: Geometry, Dynamics, and Sample Complexity

Jixian Liu, Ihab Tabbara, Hussein Sibai, Enrique Mallada

Department of Electrical and Computer Engineering, Johns Hopkins University, Department of Computer Science, Washington University in St. Louis

2026-07-22机器人

针对采样式可达集方法虽易扩展却缺少几何误差刻画的问题,本文把终点样本恢复可达集表述为流形畸变下的几何支撑估计。核心洞察是初始集补集的正 reach、动力学 Lipschitz 性与采样密度下界可把概率覆盖提升为 Hausdorff 精度保证。主要结果给出约 O((e^{3LT}R/r)^n) 的样本上界,并证明任意估计器存在约 Ω((e^{LT}R/r)^n) 下界,说明维度、时间跨度和精度带来的指数代价是内在限制。

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach Figure 1
2026-07-22cs.RO

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

2026-07-22机器人

面向高速多无人机在空天地一体网络中的航路规划,论文关注飞行动力学、避碰与频繁网络切换的耦合难题。其核心做法是用HAPS上的大型LLM做慢时标全局负载均衡,机载小LLM生成局部子目标并调节DDQN奖励,以兼顾语义规划和实时控制。仿真显示该框架相比基线降低碰撞率并提升系统吞吐,但增益对LLM推理成本和真实部署约束的敏感性文中未充分说明。

Bridging the Sim-to-Real Gap under Real-Time Constraints in Autonomous Racing Figure 1
2026-07-22cs.RO

Bridging the Sim-to-Real Gap under Real-Time Constraints in Autonomous Racing

Hossein Maghsoumi, Yaser P. Fallah

2026-07-22优化算法

本文针对自动驾驶赛车在高速、低稳定裕度和毫秒级延迟下仿真策略上车易失效的问题,将 sim-to-real 视为物理、感知估计与执行时延共同耦合的全栈实时系统问题。核心洞察是单层误差会经闭环放大,导致仿真排序与实车表现翻转;论文提出分层诊断、延迟/噪声敏感性、尾延迟直方图等指标,并给出面向部署的缓解与基准报告规范,但文中未充分说明具体硬件实验增益。

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models Figure 1
2026-07-22cs.RO

STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models

Kasra Torshizi, Anukriti Singh, Sidharth Mathur, Khuzema Habib, Leo Du, Pratap Tokekar

Department of Computer Science, University of Maryland

2026-07-22视觉感知

这篇论文针对 VLA 机器人难以可靠遵守语言中精确的空间、时间和逻辑约束的问题,提出 STeP:让 VLM 将任务分解并翻译为 STL 规格,再用于计划验证、MPC 优化、执行监控和失败重规划,同时在学习策略与 STL-MPC 间切换。真实桌面机械臂实验显示,该形式化接口在各类约束任务上提升安全成功率,时间约束增益最大,并能改善避障切换和少样本恢复。

Two-Stage Extrinsic Calibration of a Static Line-Scanning Lidar with a Rotary Platform Figure 1
2026-07-22cs.RO

Two-Stage Extrinsic Calibration of a Static Line-Scanning Lidar with a Rotary Platform

Vikram Shree, Hike Danakian, Long Nguyen, Rajanish Gokidi, Patrick Nercessian

2026-07-22机器人

针对静态线扫描激光雷达配合转台重建3D点云时,旋转轴外参误差会直接造成形变的问题,论文提出两阶段标定:先用目标几何约束做静态初始化,再以形状一致性或整周周期性目标做非线性动态细化。真实FMCW雷达与自制转台实验、蒙特卡洛初值扰动显示,周期性约束收敛域更清晰、对初始误差更稳健,细化后能减少多峰、面错位和角点拖影;平滑后立方体尺寸中位误差约0.3毫米。

Integrity-Gated Eco-CACC: Epistemic Admissibility for Cooperative Driving at Signalized Intersections Figure 1
2026-07-22eess.SY

Integrity-Gated Eco-CACC: Epistemic Admissibility for Cooperative Driving at Signalized Intersections

Lyes Saad Saoud, Moussa Ayyash

2026-07-22机器人

面向信号交叉口Eco-CACC依赖定位、SPaT和交互假设而易受传感中断或语义冲突破坏的问题,论文提出ERL完整性门控层,把位置创新、可观测性损失和语义/交互残差融合为信任分数,用于决定节能控制是否仍可采纳而非单纯做鲁棒优化。仿真显示,名义和有限GNSS退化下基本保持通行效率,而信号时序不一致、前车制动、优先通行等场景会提前撤销控制权并保守停车。

Recti-Q: Feature-Space Rectification for Out-of-Distribution-Robust Quantized Perception in Edge Robotics Figure 1
2026-07-22cs.CV

Recti-Q: Feature-Space Rectification for Out-of-Distribution-Robust Quantized Perception in Edge Robotics

Hamidreza Yaghoubi Araghi, Parastoo Pilevar, Ming C. Lin

Project Page and Code are available at Recti-Q

2026-07-22机器人安全鲁棒

论文关注边缘机器人中常用的后训练量化:它虽能保持干净数据精度,却会在噪声、天气和域迁移下放大鲁棒性损失。Recti-Q的核心做法是冻结4-bit量化骨干,仅在分类头加入小型LoRA特征校正器,用源域数据修复量化造成的特征偏移。实验在ImageNet-C和PACS上显示其可恢复相当一部分OOD鲁棒性,有时接近或超过FP32,同时参数开销低于1%、基本保留量化内存收益。

MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning Figure 1
2026-07-22cs.AI

MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning

Andrew B. Kahng, Sayak Kundu, Bodhisatta Pramanik

2026-07-22视觉语言

针对工业芯片宏单元布局仍依赖资深工程师反复手工修正的问题,MAGE把专家布局规则、视觉检查和多智能体迭代细化结合起来,而非依赖标注布局数据训练,并提出刻画“类人工”结构的四类指标。在NanGate45与GF12nm等九个设计上,它相对商业宏布局器取得11.1%–19.3% WNS和70.0%–74.0% TNS几何均值改进,类人工指标也提升6%–48%。

DASH Robot: Minimalistic Design and Optimal Aerial-Terrestrial Locomotion via Contact-Implicit Control Figure 1
2026-07-22cs.RO

DASH Robot: Minimalistic Design and Optimal Aerial-Terrestrial Locomotion via Contact-Implicit Control

Ryan Gomes Paiva, Conrad Ho, Jiarong Kang, Kunzhao Ren, Xiangru Xu, Xiaobin Xiong

∗ Equal contribution. 1 University of Wisconsin–Madison, WI, USA. 2 X. Xiong is now with the Shanghai Innovation Institute (SII), Shanghai, China

2026-07-22机器人规划控制

面向单一机器人难以同时兼顾地面效率与越障能力的问题,DASH 将涵道风扇同轴机身与弹簧腿结合,用同一推力矢量执行飞行和弹跳,并以接触隐式 MPC 自动决定接触、起跳和飞行时机。实验覆盖周期弹跳、飞行和障碍穿越,硬件中弹跳所需注入控制 effort 降至悬停的 26.78%。

Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds Figure 1
2026-07-22cs.RO

Beyond Fixed Goal Delivery: Online POMDP Planning for Target Interception in Crowds

Himanshu Gupta, Kelvin Aladum, Nisar Ahmed, Bradley Hayes, Zachary Sunberg

and by members of the Center for Autonomous Air Mobility and, University of Colorado Boulder, USA.

2026-07-22规划控制

面向机器人在人群中拦截移动目标而非到达固定投送点的问题,本文将目标拦截建模为含人类意图不确定性的在线 POMDP,并重点检验动作空间结构的影响。核心洞察是,固定路径上调速的 LSP 在高密度人群中会因空间受限而错失绕行与时空协同机会;联合搜索转向和速度的 ESP 虽分支更大,但更能保持机动性。仿真最多含 200 人,低密度下两者接近,高密度时 LSP 安全拦截率低 31 个百分点且耗时多 44%。

The Open Ant: A Robot Platform for Reinforcement Learning Research Figure 1
2026-07-22cs.RO

The Open Ant: A Robot Platform for Reinforcement Learning Research

Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil

2026-07-22机器人强化学习

这篇论文针对强化学习过度依赖仿真、真实机器人实验门槛高的问题,提出开源 Open Ant 平台:把常用 Gymnasium Ant 具身化,并配套 MuJoCo 仿真、可维修硬件和软件接口。核心价值在于让非机器人背景的 RL 研究者能较快开展实体实验。结果显示,SARSA(λ) 与 SAC 都能在约一小时真实机器人经验中学到行走策略,仿真策略也可迁移到实机,同时平台支持快速上手和硬件迭代。

Towards Torque-Driven Reinforcement Learning for Quadruped Locomotion Figure 1
2026-07-22cs.RO

Towards Torque-Driven Reinforcement Learning for Quadruped Locomotion

Jordan Dowdy, Jean Chagas Vaz

2026-07-22机器人强化学习

本文针对大型高扭矩四足机器人在崎岖地形中难以用传统位置式强化学习稳定控制的问题,提出面向 Unitree B1 的扭矩驱动全身 RL 框架,并强调通过观测与奖励设计而非复杂网络来适配大惯量动力学。在 Isaac Sim/Lab 仿真中,策略无需当前线速度观测或外感知传感器,可跟踪期望速度、上下楼梯,并达到约 3.5 m/s 线速度和 1.5 rad/s 角速度;但结果仍限于仿真,实机迁移效果文中未充分说明。

FARO: Feasibility-Aware Robot Motion Optimization Figure 1
2026-07-22cs.RO

FARO: Feasibility-Aware Robot Motion Optimization

Michal Ciebielski, Shafeef Omar, Aaron Johnson, Majid Khadiv

2026-07-22机器人优化算法

FARO针对人形机器人长时域、多接触操作中接触序列搜索组合爆炸、完整轨迹优化代价高的问题,提出按接触模式/边、运动学序列到完整轨迹优化逐级筛选并缓存可行性的框架。实验覆盖树搜索、LLM生成和人工给定接触计划,显示该剪枝能显著减少昂贵优化、扩大搜索范围,并以很少假阴性生成可由RL控制器跟踪的真实机器人动作。

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies Figure 1
2026-07-22cs.CV

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

2026-07-22视觉语言

面向搜救、工业安全等人机协作场景,论文指出二分类安全评测会混淆“异常”和“危险”。其核心做法是定义二者为独立维度,构建610图四类基准,并比较多种VLM与提示策略。结果显示,现有VLM常把情境异常当作物理危险,显式区分两类标签能更好暴露安全推理失准与校准问题。

2026-07-21

91 篇
Patch Policy: Efficient Embodied Control via Dense Visual Representations Figure 1
2026-07-21cs.RO

Patch Policy: Efficient Embodied Control via Dense Visual Representations

Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

Courant Institute, New York University, AMI Labs

2026-07-21强化学习规划控制

机器人视觉策略常把图像压成全局特征,丢失精细空间信息,而直接使用大型 VLA 又代价高。Patch Policy 的核心洞察是冻结预训练 ViT,直接把密集 patch token 输入轻量 Transformer,并用块因果注意力兼顾帧内空间交互和时间因果性。实验显示其在多套仿真与真实任务上较全局特征策略相对提升 40%,并以约 0.7% 参数量超过微调 OpenVLA-OFT 18%。

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation Figure 1
2026-07-21cs.RO

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo

Tsinghua University, Fudan University

2026-07-21机器人视觉语言视觉感知

这篇论文针对接触丰富操作中视觉记忆难以分辨遮挡、重复按压等非马尔可夫状态的问题,提出用力/力矩历史作为VLA的时间记忆。核心做法是先用VAE压缩长时程力信号,再将力记忆token与短期本体状态一起条件化动作专家。双臂机器人三类任务中平均成功率83.3%,明显高于无记忆、短期力输入和视觉记忆基线。

Optimization of sim-to-real transfer in the humanoid robot NICO Figure 1
2026-07-21cs.RO

Optimization of sim-to-real transfer in the humanoid robot NICO

Juraj Gavura, Igor Farkaš

2026-07-21机器人优化算法

论文针对NICO人形机器人从仿真到真实抓取时,微小定位误差会导致抓取失败的问题,将先前的触觉校准从2D到达扩展到桌面抓取。核心做法是结合YOLO物体/手部检测、低分辨率鱼眼双目定位、IK与校准修正,并加入抓取前视觉反馈对齐,无需RGB-D或外部跟踪。结果显示,非线性校准M3在校准区域成功率达96.7%,视觉反馈在全桌面总体成功率最高,为72.7%。

Learning Adaptive Safety Margins for Visual Navigation Figure 1
2026-07-21cs.RO

Learning Adaptive Safety Margins for Visual Navigation

Junyi Hu, Shuaihang Yuan, Geeta Chandra Raju Bethala, Anthony Tzes, Yi Fang

2026-07-21机器人安全鲁棒

本文针对视觉导航中固定安全距离难以兼顾避障与效率的问题,提出在扩散轨迹生成后用上下文条件安全 critic 选择候选轨迹,学习随场景变化的 clearance budget,并用 ESDF 教师到 RGB-D 学生蒸馏实现部署。HM3D、MP3D及跨数据集实验中 SR/SPL 优于 NavDP、iPlanner、RL 等基线,并展示了纯仿真训练到 Unitree G1 的室内迁移。

Imitation of Arm Gestures by the Semi-Humanoid Robot NICO Figure 1
2026-07-21cs.RO

Imitation of Arm Gestures by the Semi-Humanoid Robot NICO

Anastasiya Ihnatovich, Igor Farkaš

2026-07-21机器人模仿学习

面向自然人机交互中低成本、无需示教或训练的手臂动作模仿需求,本文将 MediaPipe 单目 RGB 姿态与手部关键点转为几何关节角,并适配到 NICO 的电机配置,包含前臂旋转和腕部屈伸估计。六名不同身高参与者的初步实验显示可复现多种代表性手势,但复杂姿态和腕部动作仍受遮挡、视角与机器人关节限制影响。

World Translation: Minimizing Sim-to-Real Gap with Backward Dynamics Extraction and Unpaired Domain Translation Figure 1
2026-07-21cs.RO

World Translation: Minimizing Sim-to-Real Gap with Backward Dynamics Extraction and Unpaired Domain Translation

Xinchen Yao, Leixin Chang, Hua Chen

Zhejiang University 2 LimX Dynamics

2026-07-21强化学习

这篇论文针对仿真训练策略落地时的部分可观测性问题:同一观测和动作可能因隐藏接触或外力产生不同转移,历史信息未必能恢复原因。作者的核心洞察是从已发生的转移中反向提取隐藏动力学特征,再用循环一致的非配对域翻译把仿真特征映射到真实域。实验覆盖人形、四足和机械臂,并在 Go2 真机上显示更准确的动力学建模和更好的策略迁移,但方法依赖仿真中至少存在相关物理效应。

Isaac Sim-to-Real: Reinforcement Learning based Locomotion for Quadrupeds Figure 1
2026-07-21cs.RO

Isaac Sim-to-Real: Reinforcement Learning based Locomotion for Quadrupeds

Jordan Dowdy, Jean Chagas Vaz

2026-07-21机器人强化学习

针对四足机器人强化学习策略在仿真中有效、上机后易受 sim-to-real gap 影响的问题,论文在 Isaac Sim/Isaac Lab 中训练端到端全身运动控制策略,重点依靠域随机化、地形课程、扰动注入和执行器建模实现零样本迁移。Unitree Go1 实机结果显示,其速度跟踪接近原厂控制器,但抗大扰动恢复更强,并达到 2.0 m/s 线速度和 1.8 rad/s 角速度。

Importance Sampling and PCA for Finding Failures in Commercial Autonomous Vehicles Figure 1
2026-07-21cs.RO

Importance Sampling and PCA for Finding Failures in Commercial Autonomous Vehicles

Hailey Warner, Duncan Eddy, Shreya Parjan, Caroline Cahilly, Harrison Delecki, Matthias Kleinstauber, Chaitanya Shinde, Jerry Lopez, Mykel J. Kochenderfer

2026-07-21机器人

这篇论文针对商用自动驾驶规划器中罕见碰撞难以靠蒙特卡洛仿真发现的问题,将AST与DiFS重要采样方法用于商业自动驾驶卡车栈,并用PCA从感知噪声轨迹中提取可解释的“特征失效”模式。结果显示,两类方法能在并线、切入场景中发现传统采样未发现的碰撞;AST更省样本但易模式坍缩,DiFS计算更重但发现的失效更可能且更多样。

Technical Design Review of Duke Robotics Club's Oogway & Crush: AUVs for RoboSub 2026 Figure 1
2026-07-21cs.RO

Technical Design Review of Duke Robotics Club's Oogway & Crush: AUVs for RoboSub 2026

Patrick Zheng, Saagar Arya, Hung Le, Mathew Chu, Nathanael Ren, Niko Weaver, Isabella Chen, Jill Wang, Raine Cheng, Siddharth Kini, Avrick Altmann, Srinath Iyer, Ivan Chen, Ian Suh, Parker Jones, Pierson Jones, Sebastian deSouza, Suhaani Sriram, Suvas Aggarwal

2026-07-21机器人

面向 RoboSub 2026 中有限池测时间与高故障代价,论文围绕 Oogway 与 Crush 的可靠自主竞赛运行做系统设计复盘。核心做法是把任务分为必做与备选,并同步强化机械、电气、声学和软件链路:Crush 增加垂直推进器、优化外壳阻力,声学 PCB 提升 pinger 检测,视觉、声呐、状态估计与双艇通信协同任务。结果显示外壳总阻力降低约 29%±16%,声学分类三次投票误判约 1.04%,但整体竞赛得分或端到端成功率文中未充分说明。

UniETP: Unifying Environments for Generalizable Embodied Task Planning Figure 1
2026-07-21cs.RO

UniETP: Unifying Environments for Generalizable Embodied Task Planning

Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu

Peking University

2026-07-21规划控制

UniETP针对具身任务规划中模拟器割裂、观测动作空间和评测协议不一致导致模型难以跨环境训练与比较的问题,统一AI2-THOR、VirtualHome、Habitat和BEHAVIOR,提供标准接口、场景图抽象、多粒度动作与自动任务生成,构建含138类模板、500余实例的基准;实验用于比较近期VLM规划能力并揭示其在复杂逻辑、实例 grounding 与长程任务上的瓶颈。

RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning Figure 1
2026-07-21cs.RO

RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning

Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang

Huawei Noah’s Ark Lab, University of British Columbia, University of Toronto, McGill University,, Department of Foundation model, 2012 Labs

2026-07-21机器人规划控制

长时程机器人任务往往跨越语义理解、闭环控制和几何规划等能力边界,单一策略难以稳定覆盖。RoboHarness将VLA、RL和TAMP等异构控制系统封装为可路由技能,用多模态执行记忆和在线证据判断适用性,并通过Memory Bridge缓解策略交接时的分布错配。实验覆盖公共基准、500个定制任务和135次真机实验,显示其在零样本长时程规划、OOD鲁棒性和交接稳定性上优于对照方法。

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation Figure 1
2026-07-21cs.RO

Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation

Peng Ren, Haoyang Ge, Jiang Zhao, Cong Huang, Yukun Shi, Pei Chi, Kai Chen

2026-07-21机器人三维

论文针对长程人形机器人移动操作中“用于行动的物体状态”和“用于验证的物体状态”不一致问题,提出POT:用角色索引的持续3D物体记录生成动作token,并由同一记忆支持几何谓词验证与恢复。在Unitree G1八类真实任务中,POT-VLA较同骨干直接基线从39/80提升到71/80,主要增益出现在需持续维护三维关系的任务。

Remote Awareness of Seafloor Images Collected by AUVs over Low-Bandwidth Communication Links Figure 1
2026-07-21cs.IR

Remote Awareness of Seafloor Images Collected by AUVs over Low-Bandwidth Communication Links

Adrian Bodenmann, Cailei Liang, Miquel Massot-Campos, Samuel Simmons, Alexander B. Phillips, Alberto Consensi, Matthew Kingsland, Rashiid Sherif, Stan Brown, Adam Riese, Blair Thornton

2026-07-21视觉感知

面向长航程 AUV 海底成像任务中原始图像无法经卫星或水声链路实时回传的问题,论文提出在艇端用视觉特征编码、聚类代表图选择和基于查询图的相似检索,仅发送压缩缩略图与元数据,让岸端获得近实时态势。三次海试覆盖不同 AUV 与相机系统,最高实现约 40 万倍数据量压缩,并将 2 小时 47 分钟任务摘要在约 34 分钟内传回。

Distilling Global Traversability Priors for Image-based Affordance Prediction in Off-road Environments Figure 1
2026-07-21cs.RO

Distilling Global Traversability Priors for Image-based Affordance Prediction in Off-road Environments

Matthew Sivaprakasam, Samuel Triest, Micah Nye, Deegan Atha, Shehryar Khattak, David Fan, Wenshan Wang, Sebastian Scherer

2026-07-21视觉感知

这篇论文针对越野长距离导航中局部 BEV/度量地图受感知范围限制、容易短视决策的问题,提出用卫星图生成车辆相关的全局可通行性先验,并把多条规划得到的可行路径蒸馏为第一视角图像的航向空间 affordance 监督,减少对人工示范、深度估计和点跟踪的依赖。离线基准中相对既有方法提升超过 10%,真实实验中也减少了人工干预,但效果仍依赖先验地图与实际地形的一致性。

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model Figure 1
2026-07-21cs.RO

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

2026-07-21机器人

论文针对具身模型难以把视觉语言理解转化为可执行机器人操作的问题,提出 RynnBrain 1.1 系列,并在预训练中加入接触点预测与显式 3D grounding,同时用统一动作空间和具身掩码训练 VLA。结果显示大模型在多项空间理解基准领先,真实机器人上优于 Qwen 初始化和代表性 VLA;但部分增益可能主要来自 scaling / data。

MEVION: Low-Cost Open-Source Data Collection System for Powerful and High-Speed Dual-Arm Manipulation Figure 1
2026-07-21cs.RO

MEVION: Low-Cost Open-Source Data Collection System for Powerful and High-Speed Dual-Arm Manipulation

Kento Kawaharazuka, Yoshiki Obinata, Hirokazu Ishida, Jihoon Oh, Temma Suzuki, Shintaro Inoue, Keita Yoneda, Ayumu Iwata, Kei Okada

2026-07-21机器人

MEVION针对ALOHA等低成本开源双臂采集系统力矩和速度不足、难以覆盖重物与快速操作数据的问题,提出可电商采购的桌面式leader-follower双臂平台,通过钣金焊接减少大型结构件数量,并用闭链肘部机构降低远端质量。系统单臂7.0 kg、60 Nm、约3500美元,整机约1.4万美元;实验展示了开瓶、煎锅、3.6 kg哑铃和达摩落等遥操作任务,并用ACT在毛巾和哑铃装箱上实现连续自主执行。

Does Robust VIO Need More Learning? Geometry-Verified Visual Measurements under Distribution Shift Figure 1
2026-07-21cs.RO

Does Robust VIO Need More Learning? Geometry-Verified Visual Measurements under Distribution Shift

Yangyang Ning, Shu Liang, Quanbo Ge, Tianchen Deng, Yuhua Qi, Shenghai Yuan

Y. Ning and S. Liang are with the Department of Control Science and Engineering, Tongji University, Shanghai 201804, China., Q. Ge is with the School of Automation, Nanjing University of Information Science and Technology, Nanjing, Jiangsu 210044, China., T. Deng is with Shanghai Jiao Tong University, Shanghai, China., Y. Qi is with Sun Yat-sen University, China., S. Yuan is with Nanyang Technological University, Singapore.

2026-07-21安全鲁棒

本文针对分布偏移下 VIO 是否需要更深学习这一问题,指出单纯扩大 learned pipeline 可能削弱可解释性与稳定性。方法仅用 SEA-RAFT 生成稠密双目匹配及不确定性,再经不确定性筛选、极线几何验证和协方差加权重投影因子进入滑窗估计,并传播到 3D Gaussian 建图。EuRoC、VIODE、4Seasons 实验与消融显示,鲁棒性增益主要来自学习匹配、几何验证和不确定性建模的组合,而非 learned flow 本身。

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control Figure 1
2026-07-21cs.CR

RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

2026-07-21规划控制

论文针对自托管计算机使用代理直接控制无人机时的时延、状态过期、授权和审计风险,提出将代理输出编译为带时间、状态、权限、降级和证据约束的 UAV 技能调用,并把语义推理与机载执行/安全执法分离。原型结果显示其能维持有界任务响应,支持降级处理、可信准入和可审计证据保存。

UMCP: A Unified Multi-Task Collaborative Perception Network for Luggage Trolley Pose Estimation Figure 1
2026-07-21cs.RO

UMCP: A Unified Multi-Task Collaborative Perception Network for Luggage Trolley Pose Estimation

Zhirui Sun, Zhihao Jiang, Yao Wang, Jianwei Peng, Jiankun Wang

2026-07-21三维

面向机场等动态拥挤场景中的行李车自主回收,论文认为级联检测、关键点与朝向估计模型会带来延迟、成本和误差累积。UMCP基于YOLOv12将三项任务统一到一个多任务网络中,并用关键点-朝向特征融合、OFEM和KL散度的环形方向分布建模提升朝向估计。实验显示其在总体精度保持竞争力的同时,显著降低模型复杂度和计算开销。

Value-Aware Prediction for Robust Multi-Agent Coordination Under Communication Loss Figure 1
2026-07-21cs.MA

Value-Aware Prediction for Robust Multi-Agent Coordination Under Communication Loss

Kemal Devrim Kafadar, Eren Özaltun, Mahmud Efnan Şanlı, Feyza Orak, Emirhan Gazi, Kubilay Kağan Kömürcü, Nazım Kemal Üre

∗ Equal Contribution 1 Department of Computer Engineering, Istanbul Technical University, Istanbul, Türkiye.

2026-07-21安全鲁棒

这篇论文针对多智能体强化学习在无人集群等场景中通信中断会导致协同失效的问题,指出普通预测器用均匀重构损失会浪费容量去拟合探索噪声和过时策略。其核心做法是在 MARO 中用 actor-critic 的优势估计动态加权预测损失,使缺失观测补全更关注高回报、对协同关键的状态转移。在 MPE 五个任务中,方法在通信可靠性低于 40% 时更稳健,部分高丢包场景平均回报提升超过 20%,方差平均降低 64.7%。

Manifold-Guided Motion Planning for Tight Assemblies Figure 1
2026-07-21cs.RO

Manifold-Guided Motion Planning for Tight Assemblies

Dror Livnat, Michael M. Bilevich, Michal Kleinbort, Dan Halperin

2026-07-21规划控制

面向刚体装配中必须穿过近零间隙、接触约束频繁变化的窄通道问题,论文提出 CMG-RRT:把有效路径视为位于接触“临界流形”附近,并用基于 SDF 的层次划分自适应把采样集中到该邻域,同时保留概率完备性证明。实验在旋转装配基准上报告全部实例 100% 成功,并自动解出 Elk 解环难题。

Leveraging Two Robotic Arms for Tight Assembly Performance Gains Figure 1
2026-07-21cs.RO

Leveraging Two Robotic Arms for Tight Assembly Performance Gains

Dror Livnat, Yuval Lavi, Michael M. Bilevich, Dan Halperin

2026-07-21机器人

面向紧装配中人工编程和单臂执行耗时的问题,论文提出从 CAD 模型生成双机械臂协同装配轨迹的端到端框架,并将连续路径逆运动学扩展为 CPW-IK、GPW-IK 等双臂规划算法。实验和实机验证显示,相比单臂基线平均执行时间降低超过 50%,轨迹精度和有效机器人放置搜索也有所改善。

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation Figure 1
2026-07-21cs.RO

ConceptTree: Bringing Semantic Transparency to Black-Box Decision Making for Robotic Manipulation

Yongyan Wen, Feifan Liu, Jinyi Chen, Bo An, Peng Liu, Siyuan Li

Harbin Institute of Technology, 2 Nanyang Technological University

2026-07-21机器人

面向长时程机器人操作中高层技能选择难以解释、失败难以定位的问题,ConceptTree将视觉观测映射为物体状态和空间关系等可读概念,再用决策树在概念空间中选择技能,使每次决策可追踪且可人工干预。实验覆盖四个真实操作任务,结果显示其总体完成率优于概念基线和黑盒VLM策略,复杂任务收益更明显,并可通过修改单个概念纠正错误而无需重训。

Lifelong Localization in Dynamic Indoor Environments Combining Odometry with Sparse Distance Sampling Figure 1
2026-07-21cs.RO

Lifelong Localization in Dynamic Indoor Environments Combining Odometry with Sparse Distance Sampling

Michael M. Bilevich, Tomer Buber, Dan Halperin

2026-07-21机器人

这篇论文针对动态室内环境中预建地图易被临时障碍破坏、完整 LiDAR 或视觉方案成本和隐私代价较高的问题,提出将里程计与稀疏距离采样融合的终身定位框架。核心思路是用少量距离约束确定全局候选位姿,再结合里程计随时间加权收敛,并通过学习动态障碍规律保留理论保证。实验显示仅约 16 个距离采样即可达到接近 SLAM 的定位效果,但极端动态遮挡下会暂时失定位。

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation Figure 1
2026-07-21cs.RO

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

Federico Biagi, Dario Onfiani, Simone Silenzi, Luigi Biagiotti

2026-07-21机器人

面向协作制造中不对称工具交接易导致别扭抓握和安全/效率问题,论文提出以接收者为中心的语音驱动交接系统:LLM仅做固定物体意图分类,MediaPipe跟踪3D手姿态,控制Franka动态调整末端姿态,以把手优先方式递交工具。15人被试实验显示,相比静态基线,该方法对扳手等方向敏感工具显著缩短抓握延迟,并提升运动可预测性和任务简单性等信任感知。

Task-Space Constrained Stochastic Trajectory Optimization for Time-Optimal Forestry Crane Motion Planning Figure 1
2026-07-21cs.RO

Task-Space Constrained Stochastic Trajectory Optimization for Time-Optimal Forestry Crane Motion Planning

Marc-Philip Ecker, Christoph Fröhlich, Bernhard Bischof, Wolfgang Kemmetmüller, Tobias Glück

Automation & Control Institute (ACIN), TU Wien, 1040 Vienna, Austria, AIT Austrian Institute of Technology GmbH, 1210 Vienna, Austria

2026-07-21规划控制优化算法

面向林业起重机在共享液压泵流量约束下既要避障又要缩短作业周期的问题,论文将 VP-STO 的固定末端关节约束改为任务空间约束,把冗余末端自由度与轨迹一起优化,从而利用不同逆解改善全程泵流量分配。多目标与不同 via-point 实验显示轨迹时长平均降低约 12–15%,泵利用更均衡,并在真实林业起重机含完整装木循环中验证可用性。

A2RL V\textsubscript{max}: The A2RL autonomous racing dataset for long-range, high-speed perception and multi-vehicle interaction Figure 1
2026-07-21cs.RO

A2RL V\textsubscript{max}: The A2RL autonomous racing dataset for long-range, high-speed perception and multi-vehicle interaction

Marvin Klemp, Dominic Ebner, Cornelius Schröder, Davide Malvezzi, László Turányi, Riccardo Donati, Ilia Schminik, Xia Ning, Yanxin Zhou, Matthew Flagg, Christoph Stiller, Markus Lienkamp, Marko Bertogna, Gergely Bári, Andreas Birk, Ren Jin, Chen Lv, Johannes Betz

Institute of Measurement and Control Systems, Karlsruhe Institute of Technology, Institute of Automotive Technology, Technical University of Munich, Professorship of Autonomous Vehicle Systems, Technical University of Munich, University of Modena and Reggio Emilia, Humda Lab, Széchenyi István University, Constructor University, Beijing Institute of Technology, Nanyang Technological University, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich.

2026-07-21强化学习数据集/基准

本文针对现有自动驾驶数据集多偏向城市低速场景、难以评估高速长距感知和多车交互的问题,发布 A2RL Vmax 数据集:来自 2024 A2RL 全尺寸赛车比赛,含八队数据、近 3 万帧专业标注 LiDAR 及 RADAR,并提供 3D 检测与跟踪基准。实验显示现有方法在 80 米内表现尚可,但远距离 AP 明显下降,实时性也受限,说明高速自动赛车仍需要专门感知方法。

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models Figure 1
2026-07-21cs.RO

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

University of Melbourne

2026-07-21视觉语言视觉感知安全鲁棒

本文针对VLA中“加入推理是否提升抗扰动安全性”的直觉,比较无推理、文本CoT和潜空间迭代三类架构,并在视觉、推理、动作阶段注入噪声与白盒攻击。核心发现是推理并非天然鲁棒:RD-VLA在高斯噪声和PGD下成功率显著崩塌,脆弱性更像结构性放大而非随迭代深度累积;文本推理虽可被监测,但计划-动作一致性与动作异常探针在自适应攻击和公平FPR校准下未能提升防御成功率。

Polar Coordinate-based Differential Evolution for Moving Target Search Using Vision Sensor on Unmanned Aerial Vehicles Figure 1
2026-07-21cs.RO

Polar Coordinate-based Differential Evolution for Moving Target Search Using Vision Sensor on Unmanned Aerial Vehicles

Thu Hang Khuat, Duy-Nam Bui, Thuy Ngan Duong, Manh Duong Phung

2026-07-21视觉感知

面向搜救“黄金时间”内移动目标难以快速发现的问题,论文将目标运动建模为马尔可夫过程,并把视觉传感器成像质量与观测能力纳入检测概率,再用贝叶斯适应度驱动极坐标差分进化规划无人机航迹。核心在于用极坐标表达同时嵌入机动约束并扩展连续搜索空间。仿真和真实无人机实验显示,PDE在检测概率与执行时间上优于对比方法。

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation Figure 1
2026-07-21cs.RO

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai

2026-07-21机器人视觉语言视觉感知

论文针对手语生成从离线人体动画落到人形机器人执行时的关键断点:SMPL-X 动作中的手-手、手-躯干穿插会导致 IK 不可行和不稳定轨迹。作者提出先用体素化 SMPL-X 做自碰撞缓解,再让 VLM 作为渲染动作的视觉评审触发任务空间修正。实验显示碰撞能量均值由 3.52 降至 0.94,8/9 序列改善,VLM 细化在定性上减少手部漂移和腕姿态偏差,但真实机器人闭环验证仍较有限。

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking Figure 1
2026-07-21cs.RO

VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking

Yijian Li, Xiangru Mu, Changze Li, Hantian Shi, Jiyuan Cai, Jia Cai, Xiaoxue Liu, Yajing Sun, Ming Yang, Tong Qin

and Tong Qin are with Shanghai Jiao Tong University, Shanghai, China. 2 Jiyuan Cai, Jia Cai, Xiaoxue Liu, and Yajing Sun are with

2026-07-21机器人视觉语言视觉感知

针对现有自主代客泊车依赖预建地图、难以处理开放语言目标的问题,VLN-AVP将BEV空间感知与VLM推理结合,并用短期语义记忆和长期拓扑记忆缓解单帧决策不稳、利用历史经验导航。论文还构建地下车库VLN基准;仿真中成功率较VLN方法提升超25%、较自动驾驶方法提升超15%,并在实车实验中取得领先成功率。

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning Figure 1
2026-07-21cs.LG

Generalize and Guide: Decomposing Rewards for Few-Shot Inverse Reinforcement Learning

Ziyi Liu, Grace Zhang

2026-07-21强化学习

这篇论文针对少量目标任务示范难以覆盖机器人操作中形状、布局和初始位姿变化的问题,提出 FM-IRL 设置,并用 MPG 将奖励分解为可跨相关任务迁移的判别器奖励和基于专家分布距离的纠偏奖励。实验覆盖导航、堆叠和 FactorWorld 操作任务,平均成功率 81.2%,较各任务最强基线平均提升 24.7 个百分点。

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking Figure 1
2026-07-21cs.RO

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking

Hye-Jung Yoon, Juno Kim, Yesol Park, Jun-Ki Lee, Byoung-Tak Zhang

2026-07-21安全鲁棒

面向动态、杂乱料箱中未知物体的吸取抓取,论文认为端到端方法在环境变化和新物体上泛化不足,提出将无类别实例分割、基于表面法线与掩码的吸取点估计、开放词汇分类拆成模块化流水线。真实机器人实验显示其在多料箱和相机配置下较既有端到端方法有更高成功率与适应性,但具体增益在各模块间的来源仍需更多消融支撑。

Lifelong Multi-Subsystem Pickup and Delivery with Buffer-Limited Handover Stations Figure 1
2026-07-21cs.RO

Lifelong Multi-Subsystem Pickup and Delivery with Buffer-Limited Handover Stations

Chuanlong Zang, Isabelle Barz, Anna Mannucci, Philipp Schillinger, Florian Lier, Wolfgang Hönig

2026-07-21机器人

这篇论文针对多机器人取送中多子系统只能通过有限缓存交接站传递载荷的问题,指出单独运行各区域 MAPD 会在接口处产生阻塞和饥饿。其核心是用 HARR 将子系统内 Token Passing 与共享 dock 预约、滚动缓存占用预测耦合,只接受不冲突且不越界的路线。仿真显示,在中等负载下相对固定 dock 方案吞吐最高提升 77%、积压降低 92%,且比全局站点感知 TP 规划更省时。

SLAM in Low-Light Environments: Project Report Figure 1
2026-07-21cs.RO

SLAM in Low-Light Environments: Project Report

Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan, Yaroslav Prytula

Applied Sciences Faculty, Ukrainian Catholic University, Ukrainian Catholic University, in collaboration with the UCU UGV Club.

2026-07-21机器人

这篇报告针对UGV在夜间、断电、烟尘等低照场景中仍需依赖SLAM定位建图的现实需求,系统比较ORB-SLAM3、DSO、Kimera-VIO、OpenVINS、DPVO和DPV-SLAM在LaMARia低光序列上的表现。核心洞察是,仅靠RGB视觉算法难以补足低照退化,稳定跟踪更依赖惯性融合与全局优化;Kimera-VIO唯一跑完全序列但仍有累计漂移,学习方法不易丢跟却出现约百米级绝对误差,传统单目和滤波方法在困难序列中多失败或发散。

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation Figure 1
2026-07-21cs.RO

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

Guanghu Xie, Mingxu Li, Shuo Zhang, Yonglong Zhang, Yifan Yang, Yang Liu, Zongwu Xie, Baoshi Cao

2026-07-21机器人生成模型强化学习

针对流/扩散策略能生成多种机器人动作但每步只能执行一个、而Q值排序易受评论器误差影响的问题,HCPG-Flow把候选动作选择改为接触阶段感知的物体中心几何进展:接触前靠近物体,接触后推动任务距离下降,并在 rollout 时软选择动作而不改 SAC-Flow 训练目标。实验称其在10个仿真任务上提升平均成功率,ManiSkill增益9.5个百分点,4个真实任务成功率升至98.3%且完成步数减少17.4%。

Configuration-Induced Passive Self-Rotation for Perception-Enhanced Autonomous Flight Figure 1
2026-07-21cs.RO

Configuration-Induced Passive Self-Rotation for Perception-Enhanced Autonomous Flight

Xurui Liu, Miao Wang, Tianyu He, Linrui Yang, Xiaobin Zhou

2026-07-21机器人

小型无人机在林地、车库等狭窄杂乱环境中受机载传感器视场限制,易漏看侧后方障碍。论文提出通过三旋翼后臂构型调节被动自旋工作点,用机体旋转扩展倾斜 LiDAR 的扫掠视场,并结合局部重规划、NMPC-INDI 控制和巡检引导点重规划。实机实验显示其可提升垂直感知覆盖,完成高速轨迹跟踪、抗扰和杂乱环境自主导航,但不同构型下覆盖与飞行性能权衡的普适性仍需更多验证。

Stability and Comfort in Mobile Robot-Pedestrian Interactions Figure 1
2026-07-21cs.RO

Stability and Comfort in Mobile Robot-Pedestrian Interactions

Alireza Jafari, Hong-Son Nguyen, Yen-Chen Liu

2026-07-21机器人

面向公共空间中非完整约束移动机器人穿行人群时“避障安全”不足以保证行人主观舒适的问题,论文将社会力模型及含投影碰撞时间的 TSFM 改造成可用于 NMR 的导航框架,并给出有界非被动行人假设下的稳定性分析。仿真用于舒适度与速度折中标定,真实人机交互实验和问卷统计显示,SFM/TSFM 相比遥控基线能提升行人舒适感并保持稳定通过人群。

Predictive Training with Latent Imagination for Visual Quadruped Navigation Figure 1
2026-07-21cs.RO

Predictive Training with Latent Imagination for Visual Quadruped Navigation

Yancheng Zhu, Wanli Ma, Chen Han, Irvin Haozhe Zhan, Bingfeng Qin, Yixin Xu

Anker Spatial Perception Lab

2026-07-21机器人

这篇论文针对四足机器人视觉导航在动态障碍中只按当前观测反应、容易避让过晚的问题,提出只在训练期加入 JEPA 式潜在预测与 SIGReg 正则,让 LSTM-SRU 隐状态学习短时障碍运动;部署时预测分支完全丢弃,不增加推理开销。实验显示该信号提升仿真静态与动态导航成功率、显著降低碰撞,并在 Unitree Go2 上实现零样本 sim-to-real。

COLIP-2: Olfaction-Vision-Language Embeddings Figure 1
2026-07-21cs.RO

COLIP-2: Olfaction-Vision-Language Embeddings

Kordel Kade France

2026-07-21视觉语言视觉感知

COLIP-2针对现有机器人基础模型缺少嗅觉与分子可解释性的问题,将分子结构、气体传感器读数、气味描述文本和图像对齐到同一嵌入空间,用文本气味描述作为桥接锚点,在缺少成规模气味-图像配对数据时仍可进行气味源区域排序与定位。文中称内部测试显示核心对齐已完成,并做了边缘端实时机器人优化,但详细架构封闭,具体基准与增益来源文中未充分说明。

Finite-Time Curvature-Constrained Vector Field for Saturation-Free Motion Planning of Nonholonomic Robots Figure 1
2026-07-21cs.RO

Finite-Time Curvature-Constrained Vector Field for Saturation-Free Motion Planning of Nonholonomic Robots

Zhouru Xiao, Sha Luo, Yang Lu, Héctor García de Marina, Zhenyang Xu, Chaosong Gong, Yaonan Wang, Weijia Yao

Automation & Robotics, and the Institute of Mathematics (IMAG), University

2026-07-21机器人规划控制

针对非完整移动机器人在曲率约束和执行器限幅下难以同时保证轨迹可行性、闭环稳定性与收敛时间的问题,论文提出有限时间曲率约束向量场 FT-C2VF 及无饱和控制律。其核心在于用互补增益构造连续、有界且随径向比单调下降的积分曲线曲率,并在不依赖雅可比信息的情况下保持输入不越界。理论上给出几乎全局有限时间稳定性,仿真和 Ackermann 车户外实验显示其相较代表性向量场方法具有更好的跟踪与鲁棒表现。

Predicting Grasping Compliance in Robotic Hands through Analytical-Model-Informed Neural Networks Figure 1
2026-07-21cs.RO

Predicting Grasping Compliance in Robotic Hands through Analytical-Model-Informed Neural Networks

Qianwen Zhao, Long Wang

2026-07-21机器人

这篇论文针对强接触工具使用中“抓住没掉”不足以衡量操作质量的问题,关注欠驱动机器人手在外载下的抓取顺应性和工具位移。作者提出 AMINN,将解析力学层嵌入两阶段学习流程,先判定稳定性,再预测稳定抓取下的手内工具位移。三指欠驱动手实验显示其预测能力较强,并相比黑箱 MLP 具有更好的基于能量的物理一致性。

GeoWorldAD: Geometry World Action Model for Autonomous Driving Figure 1
2026-07-21cs.RO

GeoWorldAD: Geometry World Action Model for Autonomous Driving

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

Nanyang Technological University, 2 Xiaomi EV, 3 Zhejiang University, 4 Harvard University

2026-07-21强化学习

GeoWorldAD针对视觉/视频动作模型缺少显式3D几何约束、在动态交通中易安全与效率失衡的问题,把规划建立在自车坐标系下的多尺度当前几何与短时未来几何 token 上,并通过迭代轨迹细化融合两类信息。在 NAVSIM v1/v2 上报告达到 SOTA,说明几何 grounding 与未来几何预测能提升闭环规划表现。

Disturbance-Aware Flight for Aerial Robots in Narrow Space Figure 1
2026-07-21cs.RO

Disturbance-Aware Flight for Aerial Robots in Narrow Space

Lei Qiang, Tianyu He, Chenyang Sun, Xurui Liu, Miao Wang, Xiaobin Zhou

Zhejiang Province, under Grant 2023YZ01, and in part by the State Key Laboratory, of Advanced Rail Autonomous Operation (Project No. RAO2026K09), Beijing Jiaotong University., The authors are with the School of Robotics and Automation, Nanjing University

2026-07-21机器人

狭窄隧道中近壁气动扰动和有限余量会让固定速度规划过保守或不安全。论文将在线六自由度扰动估计纳入规划控制闭环,用扰动风险函数动态调速,并结合带扰动补偿的电机动力学 NMPC。实机结果显示,0.39 米四旋翼可通过最窄 0.6 米的直、斜、弯隧道,成功率和效率优于人工飞手。

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation Figure 1
2026-07-21cs.RO

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z.Morley Mao

University of Michigan

2026-07-21强化学习数据集/基准

这篇论文针对机器人测试时扩展的计算分配问题:WAM虽能同时生成动作和未来图像,但并非每步都值得多采样。作者提出免训练的Gated GeoBoN,先用动作与预测视觉运动一致性作低成本门控,再在触发时用跨视角深度重投影一致性挑选rollout。实验显示GeoBoN在多个基准和骨干上稳定提升成功率,门控版仅约26.2%决策点额外采样,却保留约74.8%的always-on增益。

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception Figure 1
2026-07-21cs.AI

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception

Eli Goldenshluger, Barak Pinkovich, Chaim Baskin

Technion–Israel Institute of Technology, Ben-Gurion University of the Negev

2026-07-21机器人

面向自动驾驶中雷达阵列成本与多传感器感知性能的矛盾,DeeperRadar把MIMO接收通道选择与BEV多模态3D检测端到端联合优化,核心洞察是最优雷达布局取决于相机、LiDAR等融合栈而非单独硬件指标。RADIal实验显示,学习到的稀疏接收布局可用更少Rx达到或超过全阵列与启发式布局,在雷达-相机及完整雷达-相机-LiDAR设置中保持或提升AP。

Multi-Resolution Voxelized Map-Based Stereo Visual-Inertial Odometry Figure 1
2026-07-21cs.RO

Multi-Resolution Voxelized Map-Based Stereo Visual-Inertial Odometry

Shuyi Pan, Hangtian Wang, Zhaoxing Zhang, Chengliang Zhang, Zikang Yuan, Xin Yang

2026-07-21机器人

这篇论文针对先验地图辅助 VIO 在边缘设备上受地图体量、传输带宽和2D-3D关联计算限制的问题,提出多分辨率体素化 LiDAR 先验地图:每个体素仅保留一个结构显著点,并按特征深度对应的像素物理尺度选择分辨率,再用3D-DDA射线遍历检索地图点。系统结合两阶段 MSCKF 状态估计,在室内外两个公开数据集上报告了优于已有方法的位姿精度,同时显著降低云边传输需求。

Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints Figure 1
2026-07-21cs.LG

Rethinking the Suitability of Reinforcement Learning Algorithms Under Practical Transfer Constraints

Hany Hamed, Abhishek Naik, Colin Bellinger, A. Rupam Mahmood

2026-07-21强化学习优化算法

面向仿真到真实/跨动力学迁移,论文质疑仅用样本效率选择强化学习算法的做法,系统比较 PPO、SAC 与 TD-MPC2 在交互预算、墙钟时间和域随机化覆盖下的表现。结果显示 SAC/TD-MPC2 通常更省样本,但大规模并行 PPO 可能更快得到可用策略;域随机化的收益不稳定,更多取决于任务、覆盖范围和评估制度,而非算法范式本身。

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation Figure 1
2026-07-21cs.RO

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

University of São Paulo, São Carlos, Brazil

2026-07-21机器人

面向工业场景中机械臂遥操作易受深度感知不足、杂乱障碍和目标选择假设限制的问题,论文提出开放词汇共享自治框架:用自然语言经VLM/SAM2定位并持续跟踪目标抓取框,结合在线体素地图、GPU MPC避障和势场引导,在保留操作者主导权的同时辅助对准,也可手势触发自主抓取。实机四足移动操作验证中,遥操作位置RMSE为59毫米,避障保持至少18厘米间距;阀门操作和取放任务全流程均成功,自主模式每类任务5次中成功4次。

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion Figure 1
2026-07-21cs.RO

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

Shanghai Jiao Tong University, Shanghai Innovation Institute

2026-07-21视觉语言生成模型强化学习

这篇论文针对多模态机器人策略中视觉、力觉等信号频率和延迟不一致的问题,指出同步融合会让控制受最慢模态拖累。核心做法是把各模态扩散策略解耦运行,并用参考系重定位与延迟感知权重对异步去噪引导进行融合。在接触丰富操作实验中,LAG-Fusion相较同步组合和专门力觉基线提升了响应性与任务表现。

Retriever: Composing Closed-Loop Asynchronous Robot Programs Figure 1
2026-07-21cs.RO

Retriever: Composing Closed-Loop Asynchronous Robot Programs

Linfeng Zhao, Haojie Huang, Jiayuan Mao, Weiyu Liu, Mykel Kochenderfer, Lawson L.S. Wong

¶ {~{}^{\P}} Stanford University, ‡ {~{}^{\ddagger}} Northeastern University

2026-07-21机器人

这篇论文针对长时程机器人任务中感知、规划、技能和控制频率不一致、延迟不稳定导致行为难复现的问题,提出 Retriever:用显式时钟、同步/缓冲语义和有状态因果流函数来组合闭环异步程序,并支持确定性回放。实机实验中,完整管线在取袋任务达 100% 进度、调料搜索达 73%,消融显示重规划、信念记忆和进度预测对闭环表现关键。

VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model Figure 1
2026-07-21cs.RO

VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model

Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar, Fabien Bonardi

2026-07-21三维

这篇论文针对单目几何基础模型能生成稠密几何但尺度不稳定、传统 VIO 有米尺度位姿却缺少稠密地图的问题,提出 VIDAR 将 SVO+IMU 作为尺度和世界坐标锚点,与 Depth Anything 3 的稠密预测耦合,并比较位姿注入与后验对齐两种策略。在 EuRoC 上,位姿注入将尺度误差降至约 1%、F@0.10 为 0.463,解耦混合方案在无真值位姿下提升到 0.676,显示其主要价值在于用 VIO 约束基础模型的尺度与全局一致性。

BoxTwin: Learning Elastoplastic Articulated Object Dynamics from Videos Figure 1
2026-07-21cs.RO

BoxTwin: Learning Elastoplastic Articulated Object Dynamics from Videos

Heng Zhang, Gehan Zheng, Kaifeng Zhang, Jay Song, Shivansh Patel, Sonny Hu, Yunzhu Li, Changxi Zheng, Peter Yichen Chen

2026-07-21视觉感知

针对纸盒、铰链薄板等兼具弹性回弹、塑性折痕和损伤累积的可操作物体,BoxTwin从视频重建场景并辨识含非线性弹性、屈服阈值与损伤演化的关节本构模型。实验覆盖手工折叠和双臂操作,显示其能较准确跟踪关节轨迹,并在较长时域复现接触后的永久变形行为。

Move First, Commit Later: Selective LiDAR-to-BIM Global Initialization via Sequential Consensus with Symmetry-Aware Abstention Figure 1
2026-07-21cs.RO

Move First, Commit Later: Selective LiDAR-to-BIM Global Initialization via Sequential Consensus with Symmetry-Aware Abstention

Yujie Zhang, Yuxuan Guo, Jiashuo Zheng, Zeheng Fan, Xiaohui Jia, Jinyue Liu

2026-07-21机器人

针对室内重复结构中 LiDAR-to-BIM 初始化会“高置信错配”的问题,论文主张先移动收集多段子图证据,再决定是否提交位姿。核心是把候选映射到统一 SE(2) 锚点,用只统计各子图冠军的共识量避免候选数量膨胀,并区分 Defer、Ambiguous 与 Commit。实验在一个真实建筑和对称仿真中均能正确提交或有类型地拒绝,已提交位置误差约 0.02–0.36 m,但评估仅覆盖一个前端和建筑。

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation Figure 1
2026-07-21cs.RO

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation

Yuxuan Chen, Brook Du

2026-07-21机器人

这篇论文面向单目机器人导航中的尺度歧义和长程漂移问题,将轮速/IMU里程计作为持续的物理尺度锚点注入 DROID-SLAM 式循环框架:一方面用 LSTM 编码高频里程计并融合到更新算子,另一方面在 BA 后端以学习的不确定性权衡视觉重投影与里程计残差。TUM RGB-D 上相较 DROID-SLAM 明显降低 RMSE 和 AbsRel,但仍弱于 Depth Anything V3;实验规模较小,跨平台泛化和增益来源仍需更多验证。

SHAPE: Simultaneous Water Hydraulic Actuation and Position Estimation of a Sensorless Remote Actuator through a Thin and Long Flexible Tube Figure 1
2026-07-21cs.RO

SHAPE: Simultaneous Water Hydraulic Actuation and Position Estimation of a Sensorless Remote Actuator through a Thin and Long Flexible Tube

Yuki Nakamura, Shuto Yoshimura, Tomoyuki Noda, Yoshihiro Nakata

This work was partially supported by JSPS KAKENHI (Grant Number JP24K21325) and conducted in collaboration with Chugai Technos Corporation.

2026-07-21强化学习

面向核设施、灾害现场等传感器易失效且视觉受限的远程机器人,论文提出 SHAPE:用一根细长充水柔性管同时传递水液压动力和位置相关信息。其关键是从源端位移与压力建模管路膨胀、水伪压缩性及少量夹气造成的体积损失,并支持无执行端传感器的现场参数再识别。实验在最长 50 m 管路和变载条件下实现水液压缸稳定位置控制。

Articulated Humanoid Head for a Robot Receptionist Capable of Natural Human Interaction Figure 1
2026-07-21cs.RO

Articulated Humanoid Head for a Robot Receptionist Capable of Natural Human Interaction

Tharusha Fonseka, Charuka Bandara, Moshintha Hewavitharana, Melisa Arukgoda, Wageesha N. Manamperi, Udaya S. K. Perera Miriya Thanthrige, Peshala Jayasekara

2026-07-21机器人

面向接待等短时社交场景,论文针对现有人形头部成本高、机构复杂或交互能力不足的问题,设计了带硅胶皮肤的21自由度头部,用较少机构实现口、眼、眉、颈表情,并结合SCRFD、ArcFace、ByteTrack、Whisper和Llama支持边缘端识别与对话。实验量化了对话和重识别能力,用户研究中人类相似度均分为4.13/5。

Optimal Safety Control using High-Order Control Barrier Functions Figure 1
2026-07-21eess.SY

Optimal Safety Control using High-Order Control Barrier Functions

Neng Li, Zuodong Pan, Jiaxing Wang, Weiguo Xia, Wei Ren

N. Li, Z. Pan J. Wang, W. Xia and W. Ren are with the Key Labo-, Ministry of Education, Dalian University of Technology, Dalian 116024, while are not available for the so-called high-order cases., existing CLFs/CBFs are not available, since the Lie derivatives, of S. Given δ > 0 and x ∈Rn, the open ball centered at x, and the availability of dynamical systems. Hence, in this paper

2026-07-21规划控制安全鲁棒

针对高阶动力学系统中传统 CLF/CBF 因控制输入 Lie 导数为零而难以直接用于安全稳定控制的问题,论文提出两类新的高阶控制屏障函数和基于向量 Lyapunov 的 HOCLF,避免重构过小安全集以降低保守性,并给出显式安全、稳定及兼容条件下的最优控制器;四旋翼导航数值例验证了可行性。

ADMM-Based Safety-Critical Distributed NMPC for Cooperative Transportation by Quadrupedal Robots Figure 1
2026-07-21cs.RO

ADMM-Based Safety-Critical Distributed NMPC for Cooperative Transportation by Quadrupedal Robots

Ruturaj S. Sambhus, Kapi Ketan Mehta, Yicheng Zeng, Kaveh Akbari Hamed

2026-07-21机器人规划控制安全鲁棒

针对多足机器人刚性协同搬运中动力耦合、避障安全和实时求解难以兼顾的问题,本文将集中式 NMPC 用 ADMM 分解为局部子问题,并同时对载荷状态与交互力轨迹做一致性约束,显式纳入完整约束与 HOCBF 安全约束。仿真覆盖 2-4 台四足机器人,硬件实验验证 2/3 机器人在扰动、载荷不确定和障碍环境下可安全搬运;相比集中式 NMPC,平均 NLP 求解时间最多降低 23%,且消融显示载荷状态一致性显著改善跟踪。

User-Driven Learning from Demonstration: A Trajectory and Impedance Learning Method Figure 1
2026-07-21cs.RO

User-Driven Learning from Demonstration: A Trajectory and Impedance Learning Method

Zi-Qi Yang, Mehrdad R. Kermani

Authors are with the Department of Electrical and Computer Engineering, Western University, London, ON N6A 5B9, Canada.

2026-07-21模仿学习规划控制

针对传统示教学习需要多次演示、轨迹常按时间索引且缺少柔顺性的局限,论文提出将3D FDM与DS运动生成器结合,并用EKF修正速度场,同时在线学习方向相关阻尼/阻抗以维持接触。KUKA LWR IV+实验显示其可单次实时学习并较精确复现轨迹,对外部扰动有恢复能力,复杂书写路径也能执行;但相对基线的量化增益来源文中未充分说明。

Relative Entropy-Bounded Ambiguous Chance Constraints for Robust Planning in Nonlinear Systems Figure 1
2026-07-21math.OC

Relative Entropy-Bounded Ambiguous Chance Constraints for Robust Planning in Nonlinear Systems

Trevor N. Wolf, Jay W. McMahon

2026-07-21规划控制优化算法学习理论安全鲁棒

本文针对非线性随机系统中真实状态分布未知、Gaussian 假设易失效的问题,提出用相对熵界定分布歧义集,并借 Donsker-Varadhan 变分式给出风险概率上界;同时把歧义半径与参考协方差演化及二阶截断误差关联。航天器随机制导示例表明该界可用于保守评估碰撞等机会约束风险,但尚未完全落地为凸优化流程。

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation Figure 1
2026-07-21cs.RO

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

Yuwen Liao, Yihang Lan, Yizhuo Yang, Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

School of Electrical and Electronic Engineering, Nanyang Technological University

2026-07-21机器人视觉语言视觉感知

G2-Nav针对社交导航中VLM直接决策黑箱、不稳定且指令式方法难以自主部署的问题,将VLM对可通行区域与社交主体的语义判断映射为有界、可解释的视觉语言代价地图,并加入上游跟踪语义校验和高频安全反射区以缓解感知噪声与延迟。真实环境实验显示,该框架在非结构化人群场景中能同时提升安全性、效率和社交合规性。

SinD 2.0: A Multi-City UAV Dataset with Semantic Risk Annotations for SOTIF-Oriented Safety Validation at Signalized Intersections Figure 1
2026-07-21cs.RO

SinD 2.0: A Multi-City UAV Dataset with Semantic Risk Annotations for SOTIF-Oriented Safety Validation at Signalized Intersections

Yunwei Li, Shengjie Fu, Chunrong Chen, Chengxiang Zhao, Yuchen Fan, Mingyu Zhu, Yanchao Xu, Yuxin Zhang, Lan Yang, Chuzhao Li, Jie Ji, Yi He, Abhijit Sarkar, Akash Sonth, Hong Wang, Jun Li

2026-07-21数据集/基准安全鲁棒

面向自动驾驶在信号交叉口的 SOTIF 安全验证,本文指出现有自然驾驶数据地域单一、危险交互稀疏且缺少风险语义。SinD 2.0 用多城市无人机轨迹、HD 地图与信号相位数据,标注违规、遮挡、窄通行区等风险条件,并提供测试工具链;基准显示其存在明显跨城市域偏移,风险子集能暴露算法性能瓶颈。

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning Figure 1
2026-07-21cs.CV

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

Department of Computer Science and Information Systems, Birla Institute of Technology and Science, Pilani, India, Machine Intelligence, Interaction, and Imagination (Mi 3 ) Lab, University of California, Merced, United States

2026-07-21视觉语言视觉感知安全鲁棒

这篇论文关注自动驾驶 VLA/轨迹模型在复杂道路场景中究竟受哪些物体驱动,动机是避免模型给出合理轨迹却依赖错误视觉证据。作者提出 CVAA,用生成式修复逐个移除前视图物体,构建 Counter-nuScenes,并以轨迹分布偏移衡量因果影响。结果显示车、行人和交通灯具有稳定影响,但也存在对人类认为无关物体过度敏感的案例;白盒分析进一步表明影响会经多条内部路径传播,现有语言模型解释工具难以直接解释 VLA 表征。

PREFAIL: Identifying Precursors to Failures in Robotic Lift-and-Place Tasks to Improve Task Execution Performance Figure 1
2026-07-21cs.RO

PREFAIL: Identifying Precursors to Failures in Robotic Lift-and-Place Tasks to Improve Task Execution Performance

Zeyu Shangguan, Rajas Chitale, Rutvik Patel, Satyandra K. Gupta, Daniel Seita

Thomas Lord Department of Computer Science, University of Southern

2026-07-21机器人

面向高速非抓取式搬运中“快会滑落、慢会拖长节拍”的矛盾,PREFAIL将失败预兆建模为物体相对载具的异常运动,并引入最晚可干预时刻t_stop标注来判断预测是否仍可行动。方法融合多视角视觉、相对运动、机器人状态和历史风险,在仿真与真实数据上相较OOD基线提升了失败识别准确性与干预时机合理性。

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory Figure 1
2026-07-21cs.RO

A BIM-enabled, Agent-based Discrete-event Simulation Platform for Robotic Studies: A Method based on Graph Theory

Ping Xu, Xinghua Gao

Myers-Lawson School of Construction, Virginia Tech, Blacksburg, 24060, United States., *Corresponding Author, Myers-Lawson School of Construction, Virginia Tech, 320J Hitt Hall, As a result, the proposed approach provides a scalable foundation for extending indoor robotic

2026-07-21机器人学习理论

论文针对室内机器人仅依赖预设路径或SLAM、难以利用建筑构件语义和运维信息的问题,提出将BIM空间离散为网格图,并把节点区分为目标、障碍和普通节点、用边代价支持路径规划的智能体离散事件仿真平台。实验以清洁任务验证可生成避障且较高效的多目标路径,并指出粗网格会造成目标与障碍重叠,细化网格可改善空间精度和路径可行性。

Approximate Relative Entropy Constraints for Nonlinear Covariance Steering Under Distribution Ambiguity Figure 1
2026-07-21cs.RO

Approximate Relative Entropy Constraints for Nonlinear Covariance Steering Under Distribution Ambiguity

Trevor N. Wolf, Jay W. McMahon

Postdoctoral Associate, Department of Aerospace Engineering Sciences, University of Colorado Boulder, AAS Member., Associate Professor, University of Colorado Boulder, Department of Aerospace Engineering Sciences, and AAS Fellow.

2026-07-21优化算法

针对非线性航天器随机制导中,高斯线性化代理可能误判碰撞风险和均方误差的问题,论文用相对熵构造分布歧义集,并把Donsker-Varadhan上界与KLD变化率约束嵌入协方差引导和连续凸化求解。近直线晕轨道转移实验显示,该方法能约束真实分布偏离代理并给出更保守的风险性能界。

GLidE-SLAM: GL-Accelerated Indirect-Direct Embedded SLAM Figure 1
2026-07-21cs.RO

GLidE-SLAM: GL-Accelerated Indirect-Direct Embedded SLAM

Carlos A. Pinheiro de Sousa, Heiko Hamann, Oliver Deussen

2026-07-21机器人

面向无人机、机器人和XR等嵌入式平台上视觉SLAM前端算力紧张的问题,GLidE-SLAM将间接法用于关键帧建图、回环与重定位,将中间帧交给基于稀疏地图的姿态-only直接光度跟踪,并用OpenGL ES 3.1计算着色器实现跨厂商GPU加速。实验显示其在目标嵌入式平台上相对CPU基线最高提升约9倍帧率,同时基本保持轨迹精度。

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization Figure 1
2026-07-21cs.CV

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

Nikolaos Stathoulopoulos, George Nikolakopoulos

The authors are with the Robotics and AI Group, Department of Computer, Electrical and Space Engineering, Luleå University of Technology, 971 87, Additional material and the source code of this letter are available at our

2026-07-21视觉感知

面向异构 LiDAR 在视场、分辨率和扫描模式差异下的地点识别失效问题,InLiER 不直接依赖原始点云网格,而是将高度切片结构关键点编码为混合基 token,并用同一表示完成候选检索、偏航对齐和 6-DoF 验证。实验显示其在 HeLiPR 和真实跨传感器场景中达到手工方法最优,并在多数配置超过学习式 HeLiOS。

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation Figure 1
2026-07-21cs.RO

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

2026-07-21机器人视觉感知

本文针对动态视觉语言导航中“大模型推理慢、行人环境持续变化”导致的观测过时问题,提出 SPARK-VLN:在 VLM 逐 token 生成时抽取中间隐状态,经固定槽位桥接后实时条件化快速流匹配规划器。论文还构建行人持续运动的评测套件;实验显示该方法在成功率、社会合规性上优于主流方法,消融中 token 流式传递较等待式传递提升 10.0 个 SR 点,并将单次更新延迟从 0.788s 降至 0.185s。

Hybrid Machine Learning for Articulation Angle Estimation of Truck-Semitrailer Combinations Figure 1
2026-07-21cs.CV

Hybrid Machine Learning for Articulation Angle Estimation of Truck-Semitrailer Combinations

Qixuan Zhang, Jonas Boettcher, Simon F. G. Ehlers, Marvin Stuede

2026-07-21机器人

这篇论文面向重卡半挂车在量产场景中缺少铰接角传感器、又需适配未知挂车的问题,提出用后视CMS图像与车载运动学信号估计铰接角,并将CNN/Transformer视觉估计与运动学模型在EKF中融合,按不确定性自适应加权。真实四类挂车实验显示,混合方法在新挂车、颜色和光照变化下比纯学习模型或参数不匹配的运动学模型更稳健。

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution Figure 1
2026-07-21cs.RO

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

2026-07-21规划控制

论文针对具身智能中“执行结束”常被误判为“任务完成”的验证缺口,提出 PhyAgentOS:以会话为调度单位,用文件化状态协议解耦认知规划与物理执行,并把验证、记忆、安全和评测做成系统服务。实验覆盖规划基准、19种以上仿真/实体机器人及LIBERO等任务,显示可提升多种VLA模型的可用性与性能,但具体增益来源仍需进一步拆解。

AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations Figure 1
2026-07-21cs.RO

AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations

Luca Sportelli, Tyler Barr, Cagri Kilic, Di Wu

Tyler Barr 2 2 2 Undergraduate Student, Department of Aerospace Engineering, Embry–Riddle Aeronautical University, Daytona Beach, FL 32114., Cagri Kilic 3 3 3 Assistant Professor, Department of Aerospace Engineering, Embry–Riddle Aeronautical University, Daytona Beach, FL 32114., and Di Wu 4 4 4 Assistant Professor, Department of Aerospace Engineering, Embry–Riddle Aeronautical University, Daytona Beach, FL 32114.

2026-07-21规划控制安全鲁棒

面向对抗性轨道交会近距操作中追踪、安全与实时适应难以兼顾的问题,论文将受约束MPC作为内环,仅由数据驱动监督层调节权重、间隔和禁入区等可解释参数,而不直接输出推力。在KSPDG Capture-the-Satellite蒙特卡洛仿真中,相比固定参数MPC提升了闭环鲁棒性、机动适应性和交会表现,同时保持安全约束与实时可行性。

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation Figure 1
2026-07-21cs.RO

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

2026-07-21机器人生成模型

面向人、骑行者、车辆与机器人混行时仅做同质交互建模或几何避障不足的问题,SAGE将场景表示为有向异构图,用HGT刻画类型与方向相关的交互,并以扩散模型联合生成他体预测和机器人规划;推理阶段再用无需训练的安全-社会能量引导注入避碰、动力学、任务进展和社交距离约束。实验在ETH/UCY、SDD和合成数据上显示其降低碰撞与社交违规率,并可扩展到20个机器人。

An Indoor Navigation System for the Visually Impaired based on UWB Positioning and D* Lite Path Planning Algorithm Figure 1
2026-07-21cs.RO

An Indoor Navigation System for the Visually Impaired based on UWB Positioning and D* Lite Path Planning Algorithm

Thanh C. Vo, Dong LT. Tran, Huy HM. Le, Duyen N Ha, Tuan Anh Pham, Hai Thanh Dang, Hoang T. Tran

2026-07-21机器人规划控制

针对室内 GPS 失效下视障者难以获得从起点到目的地的连续安全引导,论文实现了头戴式导航原型:用 DWM1000 UWB 锚点三边定位结合 BNO055 姿态估计,并在栅格地图上用 D* Lite 做增量重规划和语音提示。实验在 5 个点各采样 50 次,UWB 平均 RMSE 为 11.9 cm,系统可低延迟运行;但动态避障收益与真实用户评测文中未充分说明。

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings Figure 1
2026-07-21cs.RO

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

2026-07-21视觉感知安全鲁棒

面向灾害响应、工业安全等高危场景中人类操作者易遗漏风险和信息过载的问题,论文提出将机器人在RIVR/VR环境中的视角经ROS送入VLM,自动识别危险并以POI弹窗和语音提示呈现。用户研究显示,带标注VR界面相较无标注基线更受偏好,参与者报告清晰度、实用性和舒适度较高,但样本仅27人且主要依赖单一VLM。

Differentiable Reinforcement Learning for Path Tracking by an Agile Fish-Like Robot Figure 1
2026-07-21cs.RO

Differentiable Reinforcement Learning for Path Tracking by an Agile Fish-Like Robot

Prashanth Chivkula, Kartik Loya, Venkata Ravindhra Reddy Varikuti, Phanindra Tallapragada

2026-07-21机器人视觉感知强化学习

针对仿鱼机器人受流固耦合难建模、欠驱动非线性强而难以用强化学习训练的问题,论文先构建经实验辨识的可微 Chaplygin sleigh 仿真器,再用 BPTT 和课程任务学习随状态变化的 PID 增益,同时控制航向与速度。仿真策略迁移到实体内转子鱼形机器人后,在不同曲率路径和参考速度下实现较准确的路径跟踪,但实验仍局限于平面游动。

Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models Figure 1
2026-07-21cs.RO

Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models

Yuhan Liu, Xinyu Zhang, Litao Liu, Abdeslam Boularias

The authors are with the Department of Computer Science, Rutgers, University. This work is supported by NSF award 2132972.Project website: jaysparrow.github.io/foresight-residual-rl .

2026-07-21机器人视觉语言视觉感知强化学习

这篇论文针对长时程接触式装配中子任务“局部成功但交接状态脆弱”的问题,指出独立残差强化学习只优化当前成功率会丢失未来可完成性。方法用离线视觉前瞻预测器估计终止状态带来的后续成功概率,并反向训练残差策略以重加权稀疏奖励。在 Isaac Gym 扳手拧螺母三阶段任务中,全任务成功率由标准子任务残差 RL 的 54.5% 提升到 85.6%,而单个子任务成功率基本不变。

Certifiable Safe Model-Based Reinforcement Learning with Control-Affine Dynamics Approximation Figure 1
2026-07-21cs.RO

Certifiable Safe Model-Based Reinforcement Learning with Control-Affine Dynamics Approximation

Hao Zhou, Yanze Zhang, Cameron Reid, Wenhao Luo

2026-07-21强化学习规划控制安全鲁棒

面向机器人安全强化学习中未知动力学会破坏 CBF 安全约束的问题,本文指出残差动力学常含控制仿射结构,若按状态项建模会带来保守性或失效保证。方法用控制仿射随机傅里叶特征学习动力学,并以自适应 conformal prediction 校准约束不确定性,嵌入乐观式 MBRL/MPPI 探索。车杆和三维四旋翼仿真显示其在任务性能与安全违规控制上优于基线,但真实平台验证仍未给出。

Linear Stability Analysis of an INDI Pitch-Rate Controller under Model Mismatch for a Tilt-Rotor VTOL UAV Figure 1
2026-07-21cs.RO

Linear Stability Analysis of an INDI Pitch-Rate Controller under Model Mismatch for a Tilt-Rotor VTOL UAV

Lorenzo Schenk, Guillaume Ducard, Christopher Onder

2026-07-21规划控制

本文针对倾转旋翼 VTOL 在过渡飞行中俯仰内环易受模型失配影响的问题,抽取 INDI 俯仰率/升降舵子通道,推导含执行器、滤波估计与控制分配的五阶闭环传函,并用 Routh-Hurwitz 给出参数化稳定区域。结果显示执行器滞后和惯量失配在标称增益下影响较小,控制效能失配尤其符号错误最易致不稳定,并据此给出偏鲁棒和偏性能的调参建议。

Back to the museum: Investigation of the acceptance of Android Andrea with and without emotion simulation in a museum Figure 1
2026-07-21cs.RO

Back to the museum: Investigation of the acceptance of Android Andrea with and without emotion simulation in a museum

Marcel Heisler, Christian Becker-Asano

2026-07-21机器人

本文针对类人机器人在博物馆公共场景中是否应加入情绪模拟这一问题,二次部署安卓机器人 Andrea 进行六天自主多语对话,并比较无情绪、由 ChatGPT 4.1 判定情绪与 WASABI 情绪动力学三种条件。73 名访客的 TAM2 问卷显示,当前两类情绪实现未提升主观接受度,甚至略有负面且难以被用户有意识察觉,提示真实公共交互中情绪表达的可见性与场景触发仍是关键瓶颈。

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments Figure 1
2026-07-21cs.RO

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

2026-07-21机器人视觉语言

面向崎岖、植被和松散地表中漫游车易打滑或受困的问题,PRISM将RGB、深度与热红外对齐采集,并用基于Vision Transformer的OmniUnet做多模态地形分割,再生成可通行性地图。论文在BASEPROD与LAENTIEC标注数据上验证,并在RAT实车、ROS2与嵌入式计算平台上完成外场导航实验,显示系统可实时支持GNC路径规划。

S.E.A.G.R: A Socially and Emotionally Aware Greeting Robot Framework with Dual-Layer Cultural and Affective Modulation Figure 1
2026-07-21cs.RO

S.E.A.G.R: A Socially and Emotionally Aware Greeting Robot Framework with Dual-Layer Cultural and Affective Modulation

Sajjad Hussain, Ranveer Bhura, Amandip Dutta, Shwetangshu Biswas

2026-07-21机器人

这篇论文针对公共场景中机器人问候常因忽略文化差异、情绪状态和人际距离而显得生硬的问题,提出 SEAGR 双层调制框架:先按文化身份选择问候形式,再用情绪线索调节动作执行,并纳入 proxemics。主要结果是完成了低成本 Sense–Think–Act 原型和规则化流程,但仍是系统设计与概念验证,用户研究效果文中未充分说明。

The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models Figure 1
2026-07-21cs.HC

The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models

Thomas Sievers

2026-07-21机器人视觉感知强化学习

面向日常社交机器人对话中仅靠语言难以消解指代、场景和社会情境的问题,论文将 Pepper 机器人头部摄像头的实时图像接入 Mistral Pixtral 等 VLM,使回复能引用机器人视角下的人、物和活动。五个场景显示视觉上下文能让对话更自然、主动,但评估规模较小;延迟仅中等增加,Mistral 视觉模式平均约 1.68 秒,快于 GPT-4o mini。

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data Figure 1
2026-07-21cs.CV

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

Usman M. Khan

2026-07-21机器人强化学习

本文针对真实户外机器人视频中光照、植被和地形变化使 JEPA 世界模型难以学到可迁移结构的问题,在 LeWorldModel 训练阶段加入深度对齐正则和可合并的过参数化预测器,用深度作为几何教师而推理仍只用 RGB。18M 模型在农业机器人数据上训练后,视觉里程计探针误差较基线降低 33%,惊讶分数区分度和跨域 TartanGround 多步 rollout 保真度均提升;但训练时过参数化的独立贡献文中未充分说明。

Generalist AI Control: Towards Multi-purpose Adaptive Algorithms Figure 1
2026-07-21cs.AI

Generalist AI Control: Towards Multi-purpose Adaptive Algorithms

Klinsmann Agyei, Pouria Sarhadi

School of Physics, Engineering and Computer Science, University of Hertfordshire

2026-07-21规划控制三维

传统控制器通常依赖精确模型并需为每个系统单独整定,限制了跨动态系统复用。本文将控制知识放在状态空间层面学习,用带掩码注意力的动态表示、多尺度时序处理和专家混合,使单一策略适配不同阶次 SISO 系统。基于 25 类系统的 31 万余条示范,仿真中性能接近专用 LQI,并能应对饱和、噪声、扰动和未见参考轨迹;但需系统标签,不能推广到训练外系统。

xperception -- Making Robotic Grasping Easier Figure 1
2026-07-21cs.CV

xperception -- Making Robotic Grasping Easier

Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

2026-07-21机器人

面向高混低量制造中频繁换件导致视觉系统需采集数据、标注和重训的问题,xperception将CAD模型与DINOv2、GeDi等基础模型特征结合,做零样本6D位姿估计并映射到抓取点。文中称其达到毫米级精度,可在Jetson Thor等边缘硬件运行,并在遮挡严重的bin picking和Automatica 2025笔抓取激光打标演示中验证,TRL接近6。

Real-Time sEMG-Based Telecontrol of an Assistive Robotic Arm Using a 1D Convolutional Neural Network Figure 1
2026-07-21cs.RO

Real-Time sEMG-Based Telecontrol of an Assistive Robotic Arm Using a 1D Convolutional Neural Network

Edgar Manacorda, Mena Samir Kama Abouseffien, Olivier Lecompte, Amandine Gesta, Abolfazl Mohebbi

Department of Mechanical Engineering

2026-07-21机器人规划控制

针对上肢运动障碍用户难以用传统接口自然控制辅助机械臂的问题,论文将四通道 sEMG 采集、滑窗预处理、肌肉激活检测与 1D CNN 手势分类整合进实时遥操作闭环,并比较静息检测、两阶段分类和统一分类策略。系统在仿真与 xArm7 实机上验证,测试准确率超过 90%,平均延迟约 0.32 秒,可用离散手腕/手部动作产生较平滑的机械臂运动。

Control Design for a Rideable Animatronic Two-Wheeled Robot with Quadruped Form Figure 1
2026-07-21cs.RO

Control Design for a Rideable Animatronic Two-Wheeled Robot with Quadruped Form

Tadashi Sumioka, Kazushi Akimoto, Takuya Tsujimura, Sho Takayanagi, Yuya Horiuchi

2026-07-21机器人规划控制

针对年轻人摩托车兴趣下降和可骑乘角色机器人需兼顾外观还原、安全与可操控性的需求,本文将四足动效与自平衡两轮底盘解耦:轮式底盘负责行驶,肢体用CPG随速度同步摆动,并用扰动观测与虚拟外力环增强稳定性。户外骑乘结果显示,机器人在肢体和颈部快速运动时仍能保持自平衡,并实现从小跑到奔跑感的自然动效。

Algorithmic Accuracy as a Motivational Driver in Robot-Mediated Learning: A Comparative Study of Cross-Correlation and CNN-Based Sound Detection in an Interactive Quiz Game Figure 1
2026-07-21cs.HC

Algorithmic Accuracy as a Motivational Driver in Robot-Mediated Learning: A Comparative Study of Cross-Correlation and CNN-Based Sound Detection in an Interactive Quiz Game

Rezaul Tutul, Ilona Buchem, Niels Pinkwart

Humboldt University of Berlin, Berlin, Germany, Berlin University of Applied Science, Berlin, Germany, university students. Participants were equally assigned to a CNN group (n =, hance student engagement, collaboration, and learning through natural multimodal in-, achieved excellent performance under controlled laboratory conditions but often expe-, university students, with 20 participants assigned to the CNN control group and 20

2026-07-21机器人视觉感知

这篇论文关注教育机器人中常被默认可靠的感知算法,考察其是否会影响学习动机。作者让 Pepper 主持抢答测验,将 CNN 与交叉相关声检测作为唯一变量对比,并提出 APMR 视角:算法精度会通过公平感、胜任感和参与感影响动机。40 名学生实验显示,交叉相关在课堂声学条件下检测更稳,且 IMI 各维度均显著优于 CNN。

HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes Figure 1
2026-07-21cs.RO

HyperDCM: Dynamic Cluster Memory Replay in Hyperbolic Space for Continual Robotic Navigation Across Scenes

Zhengfei Lu, Jian Yang, Muyu Wang, Shaowen Chen, Jinpeng Mi, Ke Li, Xiong You, Qi Wu, Xuan Tang, Xian Wei

Software Engineering Institute, East China Normal University, China, School of Geospatial Information, Information Engineering University, China, University of Shanghai for Science and Technology, China, Shanghai Jiao Tong University, China.

2026-07-21机器人

面向机器人在连续进入新室内外场景时易灾难性遗忘、扩散导航策略缺少结构记忆的问题,HyperDCM将RGB观测经视觉语言模型转为场景三元组,用R-GCN编码场景图并投影到双曲空间,再以动态聚类选择代表样本回放。实验显示其在多场景持续导航中比适配的持续学习基线和NoMaD更能保留旧场景能力并提升泛化。

2026-07-20

46 篇
Handroid: Bridging Dexterous Hand and Humanoid Figure 1
2026-07-20cs.RO

Handroid: Bridging Dexterous Hand and Humanoid

Ruogu Li, Chenyang Ma, Sikai Li, Zhenyu Wei, Yunchao Yao, Haochen Shi, C. Karen Liu, Shuran Song, Mingyu Ding

University of North Carolina at Chapel Hill, Stanford University

2026-07-20机器人

这篇论文针对灵巧手善于精细操作、类人机器人具备移动能力但两者长期分离的问题,提出 Handroid:用同一套 27 自由度桌面级机电本体在灵巧手和小型类人形态间重构,并共享遥操作、模仿学习、强化学习和步态生成控制栈。实验展示了抓取、手内方块重定向、行走/转身/下蹲及跨形态长程任务;结论显示其可作为研究形态复用与跨具身学习的平台,但规模较小,向真实人类环境扩展仍待验证。

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps Figure 1
2026-07-20cs.RO

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

Dibyendu Ghosh, Ayushi Shakya

2026-07-20视觉语言视觉感知三维安全鲁棒

这篇论文针对现有开放词汇三维地图只回答“是什么、在哪里”而缺少物体运动属性的问题,提出 VLMM:为对象级地图元素融合语言/视觉给出的可移动先验、跨帧几何观测运动和不确定性,并将自然语言运动查询转成属性过滤。AI2-THOR 精确标注实验显示各字段不可互相替代,语义特征难以回答真实运动;TUM/Bonn 动态 RGB-D 上,不确定性通道提升动静分类 AP、减少误检,但原始置信度未校准,查询路由仍较规则化。

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds Figure 1
2026-07-20cs.RO

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

Zhiyuan Wu, Zhuo Chen, Shan Luo

2026-07-20三维

这篇论文针对机器人只从单次触觉图像难以在三维物体表面定位接触点的问题,提出 VTLoc 将触觉特征与物体点云联合建模。核心做法是用几何多模态对齐重建伪点云以约束触觉-视觉空间一致性,再通过迭代定位更新器逐步细化接触坐标。作者在含 100 个真实物体的新基准上验证,结果显示其能降低局部触觉到全局点云匹配的歧义并提升单触接触定位精度。

A New Implementation of NeoSLAM and a Comparative Evaluation with RatSLAM Figure 1
2026-07-20cs.RO

A New Implementation of NeoSLAM and a Comparative Evaluation with RatSLAM

Joao Victor T. Borges, Fabio Coelho, Paulo Padrao, Jose Fuentes, Ramon R. Costa, Liu Hsu, Leonardo Bobadilla

Fabio Coelho, Joao Victor T. Borges, Ramon Romankevicius, and Liu Hsu are with the Department of Electrical Engineering, Federal University of Rio de Janeiro, Brazil

2026-07-20数据集/基准

面向未知、动态或无 GPS 环境中实时 SLAM 的数据吞吐瓶颈,论文将原 ROS 1/Python2 的 NeoSLAM 重写为 ROS 2 模块化架构,并以 htm.core 替代旧 NuPIC,减少同步阻塞和丢帧。三组数据集对比显示,新实现相较原版处理吞吐更适合实时运行,地图重建表现与 RatSLAM 大体相当,但性能增益主要来自工程架构与软件栈升级。

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference Figure 1
2026-07-20cs.RO

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

Aditya Kamireddypalli, Matias Mattamala, Joao Moura, Russell Buchanan, Sethu Vijayakumar, Subramanian Ramamoorthy

2026-07-20三维

针对插孔等接触丰富操作中仅靠深度视觉难以获得足够精确位姿、且学习方法常需为新几何重新训练的问题,BayesContact将力/力矩接触解释为几何条件下的贝叶斯证据:用渲染器和物理仿真分别为粒子位姿假设生成深度与接触似然,并可按信息增益主动探测。仿真和真机实验显示,相比纯视觉推断,位姿可观测性与插入成功率提升约30%。

Let the Body Follow: Coupled Egocentric Control for Whole-Body Robot Teleoperation Figure 1
2026-07-20cs.RO

Let the Body Follow: Coupled Egocentric Control for Whole-Body Robot Teleoperation

Tsung-Chi Lin, Yichen Xie, Chien-Ming Huang

2026-07-20机器人规划控制

面向全身机器人遥操作中视线、手臂、躯干和底盘需频繁切换控制而造成负担的问题,论文提出耦合自我中心控制:让躯干和底盘随操作者头部与末端执行器运动自动调整。TIAGo 家庭护理任务用户研究显示,该方法缩短物体抓放时间,减少按键操作和手臂奇异位形,并降低心理负荷、提升易用性与偏好。

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects Figure 1
2026-07-20cs.CV

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects

Leon Jungemeyer, Alejandro Magaña, Gautham Mohan, Matthias Karl, Daniel Werdehausen

2026-07-20三维

面向工业场景中仅有无纹理 CAD、实物存在装配缺陷且外观变化频繁的问题,PIXIE 将 6D 位姿估计转向纯几何线索:渲染深度与法线参考视图,用预训练跨模态匹配建立 2D-3D 对应并经 PnP 求解,避免对象级训练和纹理依赖。实验显示其在 BOP 无纹理物体上达到领先结果,并在含缺陷、纹理变化和遮挡的新数据集上保持可用,但对几何特征少或大偏差物体仍受限。

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction Figure 1
2026-07-20cs.CV

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

2026-07-20机器人

这篇论文针对机器人感知中ViT/VFM编码器虽强但密集预测解码器笨重的问题,提出DPNeXt用轻量多尺度融合和深度可分离倒瓶颈替代DPT,并用训练期边界监督缓解语义分割与深度估计的负迁移。Cityscapes和NYUv2上报告优于对比MTL方法,DPNeXt-S相较DPT减少78.6%可训练参数且在受限硬件上推理最快。

A Morphing-Designed Hexarotor Prototype combining Practical Resilience and Efficiency Figure 1
2026-07-20cs.RO

A Morphing-Designed Hexarotor Prototype combining Practical Resilience and Efficiency

Murat Bronz, Mahmoud Hamandi, Elgiz Baskaya, Chiara Gabellieri, Antonio Franchi

2026-07-20机器人

面向多旋翼在单桨失效后仍需安全降落的需求,论文指出六旋翼是否可靠不只取决于桨数,还取决于几何布置。作者构建开源可变形六旋翼,通过连续改变相邻旋翼夹角并结合功耗模型与失效飞行实验,找到一段几何可行区,使 Opti-Hexa 在保持接近星形六旋翼悬停能耗的同时,获得经实验验证的实用抗单桨失效能力。

Data and Learning Where it Matters for Contact-Rich Manipulation Figure 1
2026-07-20cs.RO

Data and Learning Where it Matters for Contact-Rich Manipulation

Oliver Hausdörfer, Linus Schwarz, Gabor Marko, Christian Dietz, Timo Class, Luka Hofer, Jim Yun-Jin Li, Johannes Hechtl, Ralf Römer, Angela P. Schoellig

2026-07-20机器人

针对高精度接触丰富操作中端到端策略易在关键接触阶段失败、OOD 泛化差且采数昂贵的问题,论文主张只在真正困难的接触段密集采集数据并训练离线 DRL 策略,自由空间运动交给位姿估计与传统规划。其自动采数和基于接触/Q 值的切换机制在四个真实任务中用约 2–2.5 小时数据达到平均 96% 成功率,显著高于最强基线 55%。

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection Figure 1
2026-07-20cs.RO

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection

Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza, Joni Pajarinen, Riad Akrour

2026-07-20机器人视觉感知

这篇论文针对机器人进入未知环境时目标检测易受域偏移影响、但导航时间和人工标注都有限的问题,将模型适配表述为具身批量主动学习。核心做法是用连续视角预测不一致性作为无需外部监督的困难样本信号,同时指导探索轨迹和图像选择。作者在 ProcTHOR/AI2-THOR 仿真和 Spot 机器人实测中比较多种策略,结果显示该空间不一致性准则在相同预算下带来最高的最终检测精度。

Vessel Trajectory Prediction using COLREGs-aware Optimal Planning Figure 1
2026-07-20eess.SY

Vessel Trajectory Prediction using COLREGs-aware Optimal Planning

David Kaikkonen, Fredrik Ljungberg, Erik Frisk

2026-07-20规划控制

面向拥挤水域中恒速外推和黑箱学习难以可靠预测避碰机动的问题,本文把他船轨迹预测改写为逐船视角的最优规划:先用考虑静态障碍的 A* 生成长短期暖启动,再在 OCP 中加入 CPA、禁行区和 COLREGs 约束。基于真实 AIS 重建场景的仿真显示,该方法能生成较符合实际航迹的可解释预测,但泛化范围和相对学习方法的速度/精度增益仍需更多量化说明。

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark Figure 1
2026-07-20cs.RO

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

Jonas Weihing, Shahram Eivazi

*Tübingen university

2026-07-20强化学习数据集/基准

本文针对现有机械臂 reach-avoid 强化学习基准多局限于简化桌面场景、难以反映真实碰撞与全工作空间复杂性的动机,构建了基于 MuJoCo MJX 与 Brax 的 GPU 向量化仿真和基准,支持端到端关节位置控制并显著加速训练。结果显示 reach 任务成功率达 UR5e 96.1%、Franka 98.8%,静态避障达 86.8% 和 95.2%,但也揭示简化场景中的强性能在真实设置下会明显退化。

Orbis 2: A Hierarchical World Model for Driving Figure 1
2026-07-20cs.CV

Orbis 2: A Hierarchical World Model for Driving

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

2026-07-20强化学习

本文针对自动驾驶世界模型只在单一抽象层级逐帧预测、难以兼顾长时空推理与视觉保真的问题,提出 Orbis 2:用压缩 DINO 表征做高层长时预测,用 VAE 潜空间做低层细节生成,并采用扩散强迫预训练、教师强迫微调的两阶段训练。实验显示其在长时生成 FVD、反事实转向响应以及语义分割/深度线性探测表征质量上达到或超过既有方法,但扩散强迫为何带来表征增益文中未充分说明。

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation Figure 1
2026-07-20cs.RO

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

2026-07-20机器人模仿学习学习理论

这篇论文针对模仿学习在少量示范和未见任务上容易过拟合、误读动作意图的问题,提出 DAMI:用元学习获得可快速微调的共享技能初始化,并通过 VMT 编码参考示范中的视觉-动作时序动态,结合 U2T/TCFM 融合语言、3D 观测和示范条件。实验覆盖 Meta-World、RLBench 与真实机器人,显示其在已见任务直接推理和未见任务少样本适应上优于多种基线,但仍依赖任务级微调和完整参考示范。

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture Figure 1
2026-07-20cs.CV

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

Meta Reality Labs

2026-07-20机器人

面向机器人示教、具身 AI 与 VR/AR 中真实交互数据难以大规模采集的问题,EgoExoMoCap 将多名佩戴智能眼镜的人同时作为被捕捉者和移动观察者,融合头/腕轨迹、外视角关键点射线与 DINOv3 上下文置信度,在遮挡和出视野时自适应权衡信号。两套野外数据实验显示其较 ego-only 和 exo-only 基线更稳健,但实时性、形状估计和长时遮挡仍有限。

Minimum Time Dubins Airplane Paths with Asymmetric Climb Rates Figure 1
2026-07-20cs.RO

Minimum Time Dubins Airplane Paths with Asymmetric Climb Rates

Jaeyoung Lim, Giuseppe Loianno

The authors are with Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA 94720, USA.

2026-07-20机器人

这篇论文针对固定翼/混合 VTOL 规划中常用 Dubins airplane 假设爬升与下降速率对称、导致保守和路径变长的问题,提出允许非对称爬升率的最短时间路径模型,并重新验证其极值解仍满足最优性。实验显示,随机状态连接的最短时间最多降低 71%,在崎岖地形采样规划中中位求解时间提升 2.8 倍,并通过真实飞行验证可跟踪性。

Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration Figure 1
2026-07-20cs.RO

Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration

Akash Kumbar, Abhinav Raundhal, Madhava Krishna

Robotics Research Center, IIIT-Hyderabad, India † \dagger Project page: https://beyondfrontiers.github.io

2026-07-20机器人

传统自主探索多按未知体积或 frontier 选点,容易把覆盖率与三维重建质量割裂,遗漏遮挡或稀疏采样的结构区域。本文提出 SCAGE,将探索改写为几何异常最小化:用基于 Point Transformer V3 的 Δ-Net 从局部点云学习室内结构先验,在线检测偏离先验的墙面、家具等异常并生成 6-DoF 观察位姿。实验显示其在场景中约达 90% 体积覆盖,相比基线覆盖提升约 15%,重建误差约减半。

Deployment-Ready UWB Localization for Industrial Ground Robots with Automatic Anchor Calibration and Terrain-Aware Fusion Figure 1
2026-07-20cs.RO

Deployment-Ready UWB Localization for Industrial Ground Robots with Automatic Anchor Calibration and Terrain-Aware Fusion

Alexander Raab, Giulio Delama, Roland Jung, Stephan Weiss

of Networked Systems Group, University of Klagenfurt, Austria

2026-07-20机器人

面向仓库和工厂中 AMR 对低成本、少人工定位部署的需求,论文将 UWB 锚点自动标定与面向地面车辆运动的多传感器 EKF 融合串成端到端流程,并在量测模型中显式估计标定不确定性、常值和距离相关偏差。商业物流 AMR 实测显示可单次轨迹完成锚点初始化,在室内及室外过渡场景保持较好精度和一致性;独立叉车数据也支持跨平台可迁移性。

SkillNav: Score-Level Skill Intervention for Zero-Shot Object Goal Navigation Figure 1
2026-07-20cs.RO

SkillNav: Score-Level Skill Intervention for Zero-Shot Object Goal Navigation

Ruijie Sang, Yiqun Duan, Pinhan Fu, Ruilin Wang, Wei Sui, Xianda Guo

HAI Center, University of Technology Sydney, School of Computer Science, Wuhan University

2026-07-20机器人

SkillNav针对零样本目标导航中VLM逐帧决策缺少跨步行为记忆的问题,指出卡死、房间内循环和看见目标后绕路等失败更适合用空间状态而非长提示记录。其核心是在已有好奇值地图上写入技能级干预,以soft scaling、lower-bound boost和hard override分层组合,无需训练并减少token开销。在MP3D和HM3D上取得SPL新高,较最强基线最高提升6.0点,HM3D成功率也最高。

Towards Artificial Nerves: Biomimetic Optical-Fiber Tactile Sensing for Robots Figure 1
2026-07-20cs.RO

Towards Artificial Nerves: Biomimetic Optical-Fiber Tactile Sensing for Robots

Laura E. Butcher, Chris J. Ford, Nathan F. Lepora, Efi Psomopoulou

2026-07-20机器人

面向机器人灵巧操作中大面积、柔顺且可解释触觉的需求,论文提出 OptiTac:将软皮肤内的每个机械针与一根光纤一一对应,把接触形变像“人工神经”一样传到远端相机。该结构用物理预处理形成局部强度变化,再用图像矩和 Hu 矩估计接触位置、尺寸与形状。原型在受控实验中实现亚光纤间距定位,约 1 mm RMSE,并以简单 GMM 对多种接触形状达到约 96% 分类表现,但长光纤路由和复杂环境鲁棒性仍文中未充分说明。

A Task-Space Receding Horizon Controller for Fast Collision Avoidance Figure 1
2026-07-20cs.RO

A Task-Space Receding Horizon Controller for Fast Collision Avoidance

Mattia Penzotti, Marco Controzzi

2026-07-20规划控制

面向动态杂乱场景中的机械臂避碰,论文试图在完整 MPC 的前瞻性和纯反应式方法的实时性之间折中。其核心是用短时接触一致 rollout 生成满足膨胀几何非穿透约束的终端参考,再只执行最小加速度过渡的首个控制量。实验在 40-DOF 仿真和 6-DOF 硬件上显示,中等预测 horizon 可兼顾避碰成功率、响应性和实时求解,相比动态优化 fabrics 与 MPC 基线在测试场景中成功率更高。

AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning Figure 1
2026-07-20cs.RO

AC-VLA: Robust Out-of-Distribution Action Execution via Compositional Learning

Xiaojiang Peng, Kai Peng, Jie Lu, Zheng Lian, Zitong YU, Xiaobo Wang

Shenzhen Technology University, Shenzhen University of Advanced Technology, Tongji University, Great Bay University

2026-07-20安全鲁棒

本文针对 VLA 在熟悉子任务被重新组合时容易轨迹过拟合、依赖腕部局部纹理捷径而导致 OOD 操作失败的问题,提出无需改架构的 AC-VLA:用 LLM 指令分解和本体轨迹对齐生成子任务监督,并在闭爪阶段遮蔽腕视角以强化全局空间 grounding。在 LIBERO-OOD 上,π0.5 版本较基线在 Spatial/Goal OOD 分别提升约 28.7/26.7 个百分点,同时基本保持分布内成功率。

Implicit Virtual Leader: Decentralized Vision-Only Relative Pose Estimation for Multi-Robot Formations Figure 1
2026-07-20cs.RO

Implicit Virtual Leader: Decentralized Vision-Only Relative Pose Estimation for Multi-Robot Formations

Shiyuan Yang, Zelin Wang, Zhijia Tao, Yilin Wang, Zhengyu Hou, Xiaosong Kong, Borong Zhang, Yip Fun Yeung, Yuankai Luo, Sharon Lee, Qingbiao Li

2026-07-20机器人视觉感知三维

这篇论文针对多机器人编队在 GPS 受限环境中依赖实体领导者和绝对定位带来的单点失效、误差传播问题,提出用单目视觉、机器人间通信和 Transformer-GNN 隐式学习一个非物理虚拟领导者坐标系,并估计各机器人相对 6DoF 位姿,同时建模偶然与认知不确定性。实验显示该方法在仿真和真实异构平台上有竞争性精度,可泛化到不同编队规模,但具体增益中有多少来自架构、数据覆盖或通信设定仍需更多消融说明。

RAVEN: Reinforcement-Adaptive Visibility-Graph Planning for Robust Humanoid Navigation with Collision-Free MPC Figure 1
2026-07-20cs.RO

RAVEN: Reinforcement-Adaptive Visibility-Graph Planning for Robust Humanoid Navigation with Collision-Free MPC

Ruochen Hou, Shiqi Wang, Beom Jun Kim, Hanzhang Fang, Mehak Singal, Dennis W. Hong

Robotics and Mechanisms Laboratory (RoMeLa), Department of Mechanical and Aerospace Engineering, University of California, Los Angeles, CA 90095, USA.

2026-07-20机器人规划控制安全鲁棒

RAVEN针对人形机器人在真实导航中因控制延迟、状态噪声和步态不确定性导致几何最优路径贴障、越界的问题,将强化学习用于自适应调整可视图的障碍膨胀等几何参数,而非直接输出控制或调MPC权重;再由带约束的MPC跟踪路径。仿真和硬件实验显示,其在窄通道、延迟和噪声下较手调可视图-MPC与纯RL更少贴障超调、导航更可靠。

A Generative Partially Specified Finite State Machine Approach to Complex Behaviour Planning Figure 1
2026-07-20cs.RO

A Generative Partially Specified Finite State Machine Approach to Complex Behaviour Planning

Kalana Ratnayake (1), Michael Pritchard (1), David Hinwood (2), Maleen Jayasuriya (1), Damith Herath (1) ((1) University of Canberra, (2) RMIT University)

2026-07-20生成模型规划控制

论文针对动态人机环境中机器人长时程行为规划依赖手写 BT/FSM、难以兼顾可解释性与自适应的问题,提出由 LLM 生成部分指定有限状态机的 GPSFSM/Fabric 框架,并结合 ROS2 Capabilities2 与 PromptTools 统一能力语义、事件链和参数注入。导航任务实验显示,其计划生成成功率整体高于 BTGenBot,零样本场景优势更明显,同时规划延迟相当或更低。

Continuously Stable Structure through Plastic Deformation Figure 1
2026-07-20cs.RO

Continuously Stable Structure through Plastic Deformation

Junlong Xiao (1), Yaoqiang Pan (1), Xuan Zhang (1), Michael Yu Wang (2), Chao Chen (1) ((1) Faculty of Engineering, Monash University, Clayton, VIC 3800, Australia, (2) Michael Yu Wang. School of Engineering, Great Bay University, Songshan Lake, Dongguan, Guangdong, China)

a Faculty of Engineering, Monash University, Clayton, VIC 3800, Australia, b Michael Yu Wang. School of Engineering, Great Bay University, Songshan Lake, Dongguan, Guangdong, available

2026-07-20机器人

针对软夹爪在高速运动或外扰下易失稳、且维持抓取常需持续供能的问题,论文提出在软指内嵌剪纸金属层,利用塑性变形形成连续无源稳定构型,并结合仿生爪垫补偿回弹、提升接触稳定性。实验显示夹爪可无能耗保持最高16 N被动抓持力,性能接近0.3 MPa气动驱动;与气动结合时可承受400 m/s²脉冲加速度,并实现树枝无源栖停。

Learning a System-Level Surrogate for Hydraulic Excavators: A Simulation-to-Real LSTM Approach Figure 1
2026-07-20cs.RO

Learning a System-Level Surrogate for Hydraulic Excavators: A Simulation-to-Real LSTM Approach

Shuai Wang, Shen Wang, Qiang Wang, Muguo Du, Donghai Shi, Chenyu Wang, Xiaofeng Tao

2026-07-20机器人

针对液压挖掘机实机稀缺、试验成本高且液压延迟和传感噪声难以建模的问题,论文将整机视为输入到响应的黑箱算子,用LSTM学习系统级替身,并以自适应卡尔曼滤波缓解角度与角速度不一致。结果显示该替身在MuJoCo和真实挖掘机上能较好复现角速度与长时序轨迹,可用于替代实机进行闭环算法开发。

Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer Figure 1
2026-07-20cs.RO

Difference-Based Relational Learning for Zero-Shot Object-Goal Visual Navigation With Direct Sim-to-Real Transfer

Guolei Qi, Feitian Zhang

2026-07-20机器人

本文针对零样本目标导航从仿真直接迁移到真实机器人时的外观差异和窄视场问题,提出 T-DRN:用孪生差分模块比较目标与视野内所有物体的关系差异,并用双帧时序缓存缓解目标短暂丢失。实验在 AI2-THOR 和 TurtleBot4 实机上验证,成功率优于多种基线,支持无需微调的直接 sim-to-real 迁移。

IMBench: A Benchmark for Intuitive Robotic Manipulation Figure 1
2026-07-20cs.RO

IMBench: A Benchmark for Intuitive Robotic Manipulation

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

scalable tools for generating diverse scenarios. Experiments reveal a consistent, Colosseum [26], VLABench [27], and OGBench [28] evaluate policy execution across diverse scenes

2026-07-20机器人数据集/基准

IMBench针对现有机器人基准将物理推理与执行割裂的问题,提出“理解-推断-行动”的直觉操作评测框架,覆盖35个robosuite任务、约1.4万条轨迹和多类物理约束。实验显示,VLM能部分识别约束但难生成可执行计划,VLA及微调策略在约束满足、精细接触和分布外泛化上仍明显失败。

Scalable Open-Source Visuotactile Sensor for 6-Axis Contact Wrench Estimation in Tensegrity Robots Figure 1
2026-07-20cs.RO

Scalable Open-Source Visuotactile Sensor for 6-Axis Contact Wrench Estimation in Tensegrity Robots

Wenzhe Tong, Jonathan Mi, Xili Yi, Nima Fazeli, Xiaonan Huang

2026-07-20机器人

针对张拉整体机器人缺少可靠地面接触测量、影响状态估计的问题,本文设计了可开源复现的视觉触觉端盖传感器,用弹性体、TPU接口、内置相机与LED环实现六轴接触力/力矩估计,并提出无胶 gyroid 填充互锁粘接工艺。实验中静态验证 MSE 为 0.1531,动态场景下力趋势仍可用,集成到 12 kg 机器人后能可靠识别接触端盖,但力矩预测稳定性仍有限。

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving Figure 1
2026-07-20cs.RO

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

2026-07-20视觉语言视觉感知

论文针对闭环驾驶中大视觉语言模型推理慢、只能跳帧复用旧控制的问题,提出快慢异步 VLA:冻结 7B 骨干低频更新分层 KV cache,337M 动作专家每 50ms 读取过期上下文与当前帧输出轨迹,并用随机滞后训练对齐部署。在 CARLA LangAuto-Short 上,路线完成率由 37.0 提升到 94.0,零样本城镇仍达 84–94%,单 tick 成本约 32ms。

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots Figure 1
2026-07-20cs.RO

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

Priyanka V.Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

2026-07-20机器人

面向自驱实验室中开源液体处理机器人“能运行但不一定实验正确”的风险,AEGIS把运行前的实验规则校验与运行中的视觉异常监控结合起来:用规则库+LLM检查OT-2协议代码的 assay 约束,再用摄像头轨迹模型/VLM发现漏吸、少分液、无枪头等故障。结果显示协议校验调整后F1达0.97,p1000运行监控AP为0.89、F1为0.71,并可在约13秒内暂停机器人,但透明液体和p20小量程仍是明显限制。

MemoGuard: An Adaptive Runtime for Guarding Against Memory Traps in Communication-Limited Robot Navigation Figure 1
2026-07-20cs.RO

MemoGuard: An Adaptive Runtime for Guarding Against Memory Traps in Communication-Limited Robot Navigation

Rajat Bhattacharjya, Hyeonjong Ju, Sing-Yao Wu, Eli Bozorgzadeh, Nikil Dutt

Department of Computer Science, University of California, Irvine, Department of Computer Science, Yonsei University, South Korea

2026-07-20机器人

这篇论文针对通信受限机器人在灾害巡检等任务中依赖历史经验时,语义相似记忆可能因拓扑变化、电量不足或结果不可靠而变成“记忆陷阱”的问题。MemoGuard 的核心是把记忆复用前置为合约校验,检查拓扑、资源和历史成败,只在校验失败时调用本地推理。仿真中相较相似度 top-1 复用减少 76.6% 电池安全违规,并比始终推理减少 21.4% fallback 调用。

A Model-Based Decoupling Strategy for Proprioception and Contact Sensing in an Architected Soft Manipulator Figure 1
2026-07-20cs.RO

A Model-Based Decoupling Strategy for Proprioception and Contact Sensing in an Architected Soft Manipulator

Francesco Stella, Annan Zhang, Cosimo Della Santina, Josie Hughes, Daniela Rus

2026-07-20机器人

软连续机械臂需要同时感知自身形变与外部接触,但稀疏柔性结构中传感集成困难。本文在ITH软段中布置6条局部之字形气道,用PCC模型与Huber回归利用冗余压力读数分离形状一致信号和接触异常。单段实验相对弯曲误差为0.11±0.02,178次试验接触检测率97%,并在8段Air-Helix上展示触觉示教、力调节和物体重建,但全臂结果仍偏探索性。

PACE: Persona Adaptation through Conversational Elicitation in Human-Robot Interaction Figure 1
2026-07-20cs.RO

PACE: Persona Adaptation through Conversational Elicitation in Human-Robot Interaction

Peizhen Li, Longbing Cao, Megani Rajendran, Timothy Liu, Aik Beng Ng, Simon See

2026-07-20机器人

论文针对人形机器人依赖静态人格提示、难以适配不同用户情境的问题,提出 PACE:先通过自然对话追问获取用户偏好与心理线索,再编译成结构化人格提示,并映射到 Ameca 的语音与面部表情行为。实体验证显示,相比通用静态基线,动态人格在信任、拟人感、一致性、个人相关性和交互质量上更高,但具体增益来源仍需更细分消融说明。

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting Figure 1
2026-07-20cs.CV

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting

Damani Mguni-Coker

2026-07-20三维

面向机器人和自主导航中的在线三维重建,原始 VBGS 虽能无回放持续学习,但每帧需遍历所有点与高斯分量,延迟过高。本文用 KD-tree 空间截断变分 E 步,并改造重分配流程以复用低 ELBO 候选、避免动态 JAX 重编译。在 NeRF Synthetic 上,RTX 3070 Ti 的平均单帧延迟由 84.0 秒降至约 0.050 秒,保持约 21 dB 级 PSNR。

CASAband: Easy-to-Wear Textile Wristband using Shape Memory Alloy Actuators for Spatial and Temporal Haptic Feedback Figure 1
2026-07-20cs.HC

CASAband: Easy-to-Wear Textile Wristband using Shape Memory Alloy Actuators for Spatial and Temporal Haptic Feedback

Baekgyeom Kim, Anoush Sepehri, Jessica Healey, Taeuk Oh, Hyungseok Seo, Je-Sung Koh, Tania K. Morimoto

2026-07-20机器人

针对手部触觉设备妨碍真实操作、传统腕戴方案在重量、噪声、管线或输出能力间难以平衡的问题,CASAband将柔顺放大型SMA执行器嵌入多层织物腕带,提供四通道时空压力反馈且完全无线。原型重63 g,单执行器可达1.7 N、3.2 mm、1.34-6.59 Hz;用户对位置和多种模式平均识别率超过90%,并在取放和户外导航演示中仅凭腕部触觉完成任务。

Multi-Objective Kinodynamic Motion Planning with Asymptotic Pareto Optimality Figure 1
2026-07-20cs.RO

Multi-Objective Kinodynamic Motion Planning with Asymptotic Pareto Optimality

Yusif Razzaq, Anne Theurkauf, Nisar Ahmed, Morteza Lahijanian

Authors are with the University of Colorado Boulder, CO, USA.

2026-07-20规划控制

面向真实机器人常见的多目标权衡,论文指出将代价简单标量化难以在连续动力学空间中给出正确性保证;核心做法是在 SST 的每个 witness 邻域保留局部 Pareto 最优代表集,并派生 lexSST、coSST、poSST 三类规划器。结果给出概率 δ-鲁棒完备性与渐近近优/近 Pareto 最优保证,并在多组案例中优于标量化基线。

Environment Design for Reliable Shared Autonomy with Probabilistic Guarantees Figure 1
2026-07-20cs.RO

Environment Design for Reliable Shared Autonomy with Probabilistic Guarantees

Yi-Shiuan Tung, Himanshu Gupta, Gyanig Kumar, Heyang Huang, Bradley Hayes, Alessandro Roncone

Department of Computer Science, University of Colorado Boulder

2026-07-20机器人

这篇论文针对共享自治中机器人在固定场景下难以从带噪人类输入中可靠判别目标的问题,提出把物体摆放本身作为可优化变量。核心洞察是工作空间几何会改变候选目标的可分性,并用基于边际的优化给出有界噪声下正确识别概率至少为1−α的保证。仿真和桌面实机示例显示,优化布局能提升意图推断准确性、降低歧义,复杂目标数增加时主要体现为鲁棒性提升。

Risk-Aware Preference Learning for Stochastic Outcomes Figure 1
2026-07-20cs.RO

Risk-Aware Preference Learning for Stochastic Outcomes

Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

Department of Computer Science, University of Colorado Boulder

2026-07-20安全鲁棒

这篇论文针对社会机器人导航中偏好学习常把随机结果按期望效用处理、从而忽略人类对低概率碰撞等高风险事件敏感的问题,将累积前景理论嵌入 Bradley-Terry 偏好模型,以区分用户真实奖励权重与风险加权方式。在二维导航仿真和合成偏好实验中,CPT 学习器在风险敏感教师下显著降低 held-out action regret;但结果仍属初步,尚未有人类实验验证。

VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation Figure 1
2026-07-20cs.RO

VTAP Gripper: Synergizing Fingertip Sensing and a Visuo-Tactile Active Palm for Dexterous In-Hand Manipulation

Yuhao Zhou, Sheeraz Athar, Zhixian Hu, Binghao Huang, Yunzhu Li, Juan Wachs, Yu She

and in part by the U.S. Department of Agriculture under Award 2023-67021-39072 and Award 2024-67021-42878.

2026-07-20机器人

面向真实环境中仅靠平行夹爪难以完成的抓取后重定位、对准和接触操作,论文提出 VTAP Gripper:在三指夹爪中加入可驱动的视觉-触觉主动掌面,并结合指尖触觉阵列与分阶段手势重定向,以弥合人手遥操作和非仿人结构的差异。实验覆盖 YCB/易碎物体抓取、注射器重定向与按压、3 mm 小物体分离及视觉-触觉插孔,显示无需高自由度仿人手也可通过指掌协同获得较强灵巧操作能力。

Robust Silicone Pour Casting and Sensor Embedding Procedures for Soft Robotic Actuators Figure 1
2026-07-20cs.RO

Robust Silicone Pour Casting and Sensor Embedding Procedures for Soft Robotic Actuators

Harshit Thakker, Paul Dela Cruz, Mostafa Mo. Massoud, Jacqueline Libby

reproducible and scalable fabrication of soft robots limit their, introduced, but many are labor-intensive and prone to human, repeatable, and scalable fabrication of soft pneumatic actuators, are with the Department of Mechanical Engineering, Stevens Insti-, Institute of Technology, 1 Castle Point Terrace, Hoboken, NJ, 07030, USA, and requires manual labor. Furthermore, the single-bladder, fiber wrapping, requiring less labor-intensive fabrication., challenges. Lost wax casting is a laborious process with, [28]–[30]. Low-volume cores (LVCs) are less laborious to, remains a faster, cleaner, and more scalable method than, clogging in the center. (b) Sectional view after dissection, tracking. Commercially-available flexible thin-film sensors

2026-07-20机器人安全鲁棒

针对软体气动执行器难以稳定、可重复制造的问题,论文把传统双模硅胶浇铸流程细化为防内腔堵塞的气密封合、薄膜弯曲传感器嵌入和织物限伸层集成步骤。作者在fPN执行器上结合FEM、PID气压驱动、图像标定与阶跃/正弦实验验证,报告两名操作者完成24次成功制备,实物与仿真弯曲角接近,阶跃响应可重复,正弦下仅呈现符合硅胶黏弹性的轻微滞回。

NeuroCommitSSM: Decision-Centric Shared Autonomy for Safe Assistive Manipulation via EEG-EMG-ET Commit Readiness Figure 1
2026-07-20cs.RO

NeuroCommitSSM: Decision-Centric Shared Autonomy for Safe Assistive Manipulation via EEG-EMG-ET Commit Readiness

Tipu Sultan, Param Sangani, Kody Cool, Pascal Sikorski, Guangping Liu, Hadi Akbarpour, Madi Babaiasl

Aerospace and Mechanical Engineering Department, Saint Louis University, St. Louis, MO, USA., *This work has been supported by SLU’s Research Institute under Award-01935, Clare Boothe Luce Foundation under Award-01281, and SLU’s AEME department under Proj-000480.

2026-07-20机器人安全鲁棒

这篇论文针对辅助机械臂中“何时执行”比单纯识别意图更容易引发误触发和安全风险的问题,提出用同步 EEG、EMG 与眼动预测连续 commit readiness,并通过 dwell/hysteresis 与 HOLD-ASSIST-COMMIT 监督器结合目标可见性、IK 和碰撞检查后才放行动作。在 32 名受试者、5 类 ADL 任务的 LOSO 与传感器缺失评估中,方法达到 0.950 平衡准确率、REST 误提交 0.75/千窗,Kinova Gen3 HIL 也显示可减少误启动和状态抖动。

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories Figure 1
2026-07-20cs.RO

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

Xiaomi Robotics Team : Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou

2026-07-20机器人视觉语言视觉感知强化学习

机器人基础模型受限于真实操作数据规模和标注成本,本文以小米 Robotics-1 探索 VLA 的 scaling 路径:用 10 万小时 UMI 真实轨迹预训练,并以 VLM 自动标注状态转移语言,再用跨本体数据对齐机器人动作和指令。结果显示数据与模型增大可降低动作误差并迁移到真实机器人泛化;在 RoboCasa365 达 57.6%,RoboDojo 得分 20.07,但增益可能主要来自 scaling / data。

Interactive 3D Tangible Display with a High-Speed Stiffness-Variable Jamming Module Figure 1
2026-07-20cs.HC

Interactive 3D Tangible Display with a High-Speed Stiffness-Variable Jamming Module

Chanyoung Ahn, Jaesung Lee, Donhyun Hwang

2026-07-20三维

该文针对艺术触觉交互中设备笨重、噪声大、刚度调节慢且难以实时固定形变的问题,提出基于磁性堵塞的三维有形显示模块,以低于25V的独立紧凑结构集成进韩国河回面具,实现视觉运动与鼻部、面颊触觉刚度变化联动。主要结果是系统可低噪、实时调节软硬并支持观众改变局部形态,但定量用户收益文中未充分说明。

2026-07-17

58 篇
RoboTTT: Context Scaling for Robot Policies Figure 1
2026-07-17cs.RO

RoboTTT: Context Scaling for Robot Policies

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

Stanford University, The University of Texas at Austin, research.nvidia.com/labs/gear/robottt

2026-07-17机器人

这篇论文针对机器人策略通常只能利用单步或短历史视觉运动上下文的问题,将测试时训练引入VLA式机器人基础模型,用可在推理中梯度更新的fast weights压缩长历史,并配合序列动作强制和TBPTT把上下文扩展到8K步且不增加推理延迟。真实双臂装配实验显示,RoboTTT带来视频一次模仿、在线改进和抗扰能力,整体任务表现较单步基线提升87%,8K上下文较1K预训练提升约62%。

BadWAM: When World-Action Models Dream Right but Act Wrong Figure 1
2026-07-17cs.LG

BadWAM: When World-Action Models Dream Right but Act Wrong

Qi Li, Xingyi Yang, Xinchao Wang

National University of Singapore, The Hong Kong Polytechnic University

2026-07-17强化学习

这篇论文针对世界-动作模型把“能想象未来”当作安全信号的假设,指出动作生成与未来预测可能被小幅视觉扰动解耦。作者提出 BadWAM 黑盒评测框架,包含直接破坏动作的攻击和保持想象近似不变的隐蔽攻击。实验在 LIBERO、RoboTwin 等闭环操控任务上显示成功率可从 96.5% 降至 43.1%,且简单检测难以覆盖,说明 WAM 安全应评估想象与执行是否同步。

Stigmergic Graph Memory: An Environment-Aware Approach for Many-to-Many Multi-Agent Pickup and Delivery Figure 1
2026-07-17cs.MA

Stigmergic Graph Memory: An Environment-Aware Approach for Many-to-Many Multi-Agent Pickup and Delivery

Aditya Dutta, Joon-Seok Kim

2026-07-17机器人

面向仓储机器人多对多取送任务,论文指出仅在目标确定后做路径引导无法避免端点选择造成的拥堵。其核心做法是用有界衰减的 Stigmergic Graph Memory 记录节点和有向边的近期执行痕迹,并把这些信号用于源点、终点排序及路由偏好。实验在5种布局、3种负载、25个种子上对比重构的 M2M 基线,吞吐量在15个条件下均提升20.5%至36.7%,消融显示主要收益来自记忆驱动的端点选择。

AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent Prediction Figure 1
2026-07-17cs.RO

AHEAD: Anticipatory Hand-Driven Teleoperation via Human Intent Prediction

Seok Joon Kim, Junho Lee, Federica Spinola, Taein Kwon, Mohsen Moghaddam

2026-07-17机器人

这篇论文针对拣放遥操作中“直接手控负担高、目标式控制反应慢”的矛盾,提出 AHEAD:在 VR 数字孪生中用手部和头部 3D 信号结合场景上下文预测抓取物体与放置槽位,并用状态机将不稳定预测转为提前运动目标。实验显示意图预测 Top1 约 76%,相较基线将物体与槽位反应时间分别缩短 0.6 秒和 1.4 秒,同时降低主观操作负荷。

Scaling Behavior Foundation Model for Humanoid Robots Figure 1
2026-07-17cs.RO

Scaling Behavior Foundation Model for Humanoid Robots

Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang

The Chinese University of Hong Kong, Shanghai Jiao Tong University, Zhejiang University, Peking University, Tsinghua University, Shanghai Artificial Intelligence Laboratory, and 3) the expressive and scalable model architec-, BFM as a principled and effective foundation for scalable and general-purpose humanoid control., paradigm, large-scale and diverse behavioral data, and an expressive yet scalable model architecture., Our framework identifies motion tracking [15] as a unified and scalable paradigm which reformulates di-

2026-07-17机器人

这篇论文针对人形机器人控制仍依赖任务特定奖励、难以泛化的问题,系统讨论行为基础模型如何有效扩展。核心洞察是把多类控制统一为全局坐标系下的全身运动跟踪,并同时扩展 PPO on-policy rollout 数量、参考动作多样性和 Humanoid Transformer 架构。仿真与实机结果显示,相比既有人形控制器,测试集 MPKPE 在局部模式降逾 10%、全局模式降 82%。

Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults Figure 1
2026-07-17cs.RO

Assessing Physical Frailty and Fall-Risk Indicators with Social Robots: An in situ Evaluation with Older Adults

Aniol Civit, Antonio Andriella, Alba Martínez, Joan Ars, Aida Ribera, Cristian Barrué, Guillem Alenyà

2026-07-17机器人数据集/基准安全鲁棒

老年虚弱与跌倒风险评估依赖人工执行且多只记录完成时间,难以高频、客观捕捉步态和平衡退化。本文提出由行为树协调感知、决策、交互和测量的社交机器人框架,用视觉骨架跟踪自主执行 SPPB、TUG 等标准测试,并在康复中心 6 个月、81 名老人中验证。机器人在多数完成时间和步态参数上与治疗师及临床仪器高度一致(ICC>0.9),SPPB 总分与治疗师达实质一致,显示其可减轻评估负担并补充常规量表之外的运动指标。

Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling Figure 1
2026-07-17cs.RO

Catch, Throw, Repeat: Planning for Human-Robot Partner Juggling

Jonathan Rainer Lippert, Kai Ploeger, Abir Chowdhury, Hermann Müller, Jan Peters, Alap Kshirsagar

Technical University of Darmstadt, Justus-Liebig University Gießen, German Research Center for AI (DFKI), Robotics Institute Germany, Indian Institute of Technology Delhi - Abu Dhabi.

2026-07-17机器人规划控制

这篇论文把人机动态抛接作为比静态交接更苛刻的协作操作问题,目标是在感知、时序和接触不确定下实现连续杂耍。方法上结合球轨迹预测、多重射击在线轨迹优化和状态机协调,使机器人可随人类节奏实时改接球与抛球决策。8人实验中系统完成共享三球级联,所有参与者在10分钟内超过既有最好结果,最高达到20次连续机器人接球;局限主要在时序余量、硬件运动学和球间碰撞。

Goal-Oriented Semantic Communication for Distributed ISAC-Enabled Vehicle Coordination Figure 1
2026-07-17cs.RO

Goal-Oriented Semantic Communication for Distributed ISAC-Enabled Vehicle Coordination

Wenjie Liu, Yansha Deng

2026-07-17机器人

面向无信号交叉口车辆协同,论文指出传统方案将感知、通信与控制分开优化,容易造成冗余传输、状态过期和控制不可靠。作者提出分布式 ISAC 场景下的目标导向语义通信框架,用 EKF 融合多路侧单元感知并预测车辆状态,再以 VoI 奖励驱动 MHPPO 联合决定何时感知、何时下发控制及控制内容,并结合不确定性感知波束成形和功率分配。仿真显示该方法在对比预测式 ISAC 和消融基线时实现 100% 无碰撞,同时显著降低信令开销。

DriftWorld: Fast World Modeling through Drifting Figure 1
2026-07-17cs.RO

DriftWorld: Fast World Modeling through Drifting

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

Massachusetts Institute of Technology, 2 Harvard University

2026-07-17强化学习

这篇论文针对机器人世界模型在规划中需要大量快速 rollout、而扩散模型多步采样过慢的问题,提出 DriftWorld:将 drifting 生成模型改造成动作条件视频预测,通过动作强化的漂移场、DINO 特征空间损失和逐帧动作条件 U-Net,实现单次前向生成未来帧。实验覆盖 Bridge-V2、RT-1、Language Table、Push-T 和 Robomimic,平均比扩散基线快 17 倍、达到 30+ fps,并在 rollout 质量、动作搜索提升和离线策略排序相关性上取得更好结果。

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment Figure 1
2026-07-17cs.CV

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

2026-07-17视觉感知

SUFLECA针对零样本CAD到图像9D对齐中,基础视觉特征偏外观、遇遮挡和仿真到真实迁移易失效的问题,将NOC监督扩展到12个真实与合成数据集的67.4万张图像,学习紧凑几何特征,并用互惠且几何一致的匹配替代普通近邻。ScanNet25k上类别/实例准确率达33.4%/42.3%,较最强零样本基线高10.3/12.2个百分点,且无需迭代细化、运行和显存更低。

Learning Agile Navigation in Crowded Environments for Quadruped Robots Figure 1
2026-07-17cs.RO

Learning Agile Navigation in Crowded Environments for Quadruped Robots

Shuyu Wu, Zeyu Liu, Tianbao Zhang, Fanxing Li, Fangyu Sun, Mingkang Xiong, Wei Xi, Wenxian Yu, Danping Zou

2026-07-17机器人

这篇论文针对四足机器人在人群密集、遮挡严重场景中既要避碰又要快速通行的问题,提出 VOP-Nav:用多帧 LiDAR 直接预测基于速度障碍思想的安全速度区域,并把该预测同时作为策略输入和训练奖励,避免显式检测与跟踪行人。Isaac Gym 实验显示其成功率高于基线且兼顾速度与碰撞率,并在 Unitree Go2 上零样本部署验证了室内外动态场景可行性。

Risk-Aware Belief Control Barrier Functions over Random Finite Sets Figure 1
2026-07-17cs.RO

Risk-Aware Belief Control Barrier Functions over Random Finite Sets

Shaohang Han, Gang Chen, Yixi Cai, Ignacio Torroba, Ivan Stenius, Patric Jensfelt, Javier Alonso-Mora, Jana Tumova

2026-07-17规划控制安全鲁棒

面向未知且动态环境中的安全控制,论文关注传统 BCBF 难以处理目标数量变化和数据关联不确定的问题。其核心做法是把 SMC-PHD 滤波得到的随机有限集粒子信念直接用于构造风险感知非光滑 BCBF,并给出连续预测与离散更新下的安全条件。仿真和水下机器人实验显示,该方法可在视场保持和避障任务中维持安全,控制计算平均低于 5 ms。

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking Figure 1
2026-07-17cs.RO

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

Northeast Normal University, Southern University of Science and Technology, Peking University, University of Hong Kong

2026-07-17视觉语言视觉感知

针对城市低空跟踪中目标被建筑、树木等长时间遮挡后易漂移的问题,CosFly-VLA把无人机跟踪建模为闭环重捕获任务,同时预测可见性、目标框和4-DoF航点动作,并用空间预训练、遮挡课程、CoT与闭环RL强化空间假设维护。相对OpenVLA,0.8B模型开环ADE在已见/未见地图降34.1%/35.3%,RL使闭环成功率分别提升17和2个百分点。

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight Figure 1
2026-07-17cs.RO

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

School of Automation, Beijing Institute of Technology, School of Mechanical Engineering, Beijing Institute of Technology

2026-07-17强化学习

这篇论文针对四旋翼按语言指令飞行时,离散动作、航点或瞬时速度难以刻画动作对未来第一视角观测影响的问题,提出 AeroAct:用视频扩散 Transformer 在训练时以未来图像作结果监督,部署时直接输出平滑的五阶局部轨迹块,并结合 DiffAero、Isaac Lab、3DGS 与手持采集数据构建多模态训练管线。仿真和真实机实验显示,时间视觉上下文提升目标跟踪与物体搜索表现,且 WAM 策略可在实体四旋翼上执行,但真实实验仍限于短程室内且依赖离线推理。

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control Figure 1
2026-07-17cs.RO

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

Jihoon Hong, Julian Skifstad, Qiyue Dai, Alice Chan, Glen Chou

Georgia Institute of Technology

2026-07-17强化学习规划控制安全鲁棒

针对世界动作模型在相机视角、夹爪初始状态和视觉噪声等分布外扰动下易失效的问题,论文用机制可解释性分析激活空间,发现鲁棒性相关特征在部分架构中呈低维线性可分,并据此提出无需微调的对比方向 steering 与闭环 WA-LQR 控制。结果显示 Cosmos-Policy、DiT4DiT 可被有效 steering,而 LingBot-VA 较弱;WA-LQR 在多类扰动上优于无 steering、提示 steering 和开环基线,最高成功率提升 41%。

Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol Figure 1
2026-07-17cs.RO

Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol

Jesus Moncada-Ramirez, Jose-Raul Ruiz-Sarmiento, Javier Gonzalez-Jimenez

2026-07-17机器人

这篇论文针对GenAI机器人中上层人机交互接口各自为政、难以复用和实时介入的问题,提出把原用于编程代理的ACP引入界面—代理层,并与执行层MCP组合成解耦的三层架构。实验在实体移动机器人Sancho上连接CLI、平板和网页三类客户端,验证可观测、授权和中断流程;ACP与MCP额外开销约171.6毫秒,占36.9秒交互循环不到0.5%。

OASIS-Map: Object-Level Change Detection in Multi-Session Mapping using Semantic Correspondence Matching Figure 1
2026-07-17cs.RO

OASIS-Map: Object-Level Change Detection in Multi-Session Mapping using Semantic Correspondence Matching

Haedam Oh, Yifu Tao, Nived Chebrolu, Maurice Fallon

Oxford Robotics Institute, Department of Engineering Science, University of Oxford, UK.

2026-07-17视觉感知

面向长期巡检中物体会移动、消失或被替换而静态地图失效的问题,OASIS-Map不依赖整物体描述子,而是在多次观测图像间建立基于DINOv3特征的密集patch级语义对应,用未匹配/低置信区域检测变化,并累计证据完成跨会话物体关联。在3RScan、停车场和市场实景中验证,停车场替换变化检测F1为0.783,3RScan移动物体关联F1为0.667。

Modeling and Validation of Quality of Control for Edge-Offloaded Collaborative Navigation Figure 1
2026-07-17cs.RO

Modeling and Validation of Quality of Control for Edge-Offloaded Collaborative Navigation

Neelabhro Roy, Mikael Hammarling, Victor Nan Fernandez-Ayala, Gourav Prateek Sharma, Mani H. Dhullipalla, Dimos V. Dimarogonas, James Gross

Neelabhro Roy2

2026-07-17机器人规划控制

本文针对边缘卸载协同导航中无线时延、抖动和丢包会破坏跟踪、避障与能耗控制的问题,将QoC框架从简化一致性模型扩展到含非完整约束的AGV/Nav2场景,并把通信可靠性、时延与控制参数纳入统一评估。仿真与私有5G测试床结果较一致,给出控制-通信协同设计的较优工作区间;在部分设置下,ROS 2 RELIABLE QoS的QoC比BEST-EFFORT高51.5%。

Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic Manipulation Figure 1
2026-07-17cs.RO

Towards Human-like Physical Intelligence: LifelongVision-Language-Action Learning for Robotic Manipulation

Yao He, Gan Sun, Wenqi Liang, Fazeng Li, Yang Cong

South China University of Technology, University of Trento

2026-07-17机器人视觉语言视觉感知

这篇论文针对VLA机器人在开放环境中连续学习新操作任务时易遗忘旧技能、全轨迹回放成本高的问题,提出LifelongVLA:用双时间尺度LoRA门控分别承担快速适应与长期巩固,并以紧凑缓存的随机回放替代完整历史数据。实验显示其在连续操作任务和xArm部署中提升最终成功率、降低遗忘率,并显著减少每任务回放存储开销。

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking Figure 1
2026-07-17cs.RO

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking

Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang

2026-07-17视觉感知三维

针对灵巧手操作中手指遮挡导致视觉6D位姿跟踪失效的问题,KineFuse将关节本体、力/扭矩和接触等稀疏触觉按手部运动学结构编码为指级token,并与冻结的FoundationPose融合。实验显示,逐帧指标难区分结构优劣,但序列跟踪和闭环重定向会放大差距;4-token指级表示优于平铺融合和关节级表示,且模型学到平移依赖视觉、旋转利用触觉的分工。

Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery Figure 1
2026-07-17cs.RO

Interventional Causal Circuits for Safe Robot Action Testing and Failure Recovery

Naren Vasantakumaar, Tom Schierenbeck, Michael Beetz

2026-07-17机器人安全鲁棒

论文针对机器人动作需先经安全测试而盲目重采样低效的问题,将用于参数采样的联合概率树扩展为满足 MdVtree 条件的因果线路,在失败后定位致因参数并给出一次性修正,同时拒绝训练支持外建议。ROS2 仿真中,高质量模型下失败尝试减少 10.3%,退化模型下减少 37%,但验证仍限于单一取放任务。

Curvature-Constrained and Constant-Speed Distributed Simultaneous Arrival Control for Multi-Robot Systems Figure 1
2026-07-17cs.RO

Curvature-Constrained and Constant-Speed Distributed Simultaneous Arrival Control for Multi-Robot Systems

Zhouru Xiao, Yang Lu, Weijia Yao, Min Liu, Yaonan Wang

2026-07-17机器人规划控制

本文针对多机器人在曲率受限、恒速且无中心协调条件下同时到达指定目标的问题,动机来自固定翼无人机等平台的实际机动约束。核心思路是把 Dubins 路径的几何最短时间性质与最大一致性协议结合,引入虚拟时间并用最优控制和饱和比例控制切换,使各机器人仅交换邻居虚拟时间即可同步。论文证明若干条件下可达到同时到达,部分情形具理论最优到达时间,并通过大规模仿真和多四旋翼实验验证鲁棒性与避碰能力。

Hybrid Rigid-Soft Robotic Gripper with Shape Adaptation, Uniform Force Distribution, and Self-Locking Capabilities Figure 1
2026-07-17cs.RO

Hybrid Rigid-Soft Robotic Gripper with Shape Adaptation, Uniform Force Distribution, and Self-Locking Capabilities

Xi Chen, Yun Wang, Lichao Yang, Haitao Li, Ya Xiong

2026-07-17机器人

面向农业采摘中柔顺适形、低损伤与高承载难以兼顾的问题,论文提出三指混合刚软夹爪,将分段薄膜气动腔与3D打印双棘轮棘爪自锁关节结合,使夹爪在贴合物体后无需持续供压即可保持姿态。实验显示其最大承载达4200 g,接触力分布差异降至1.75%–35.29%,单次抓取能耗由85.28 J降至42.6 J。

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios Figure 1
2026-07-17cs.CV

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

Institute of Automation, Chinese Academy of Sciences, Zhongguancun Academy, porting multimodal generation tasks such as images and labels, their limited durability and the laborious real-world acquisition, Label, labels, to address diverse tactile generation requirements., Overview. In this section, we elaborate on VQ-Touch, whose

2026-07-17机器人

针对触觉图像采集昂贵、易损且跨传感器数据稀缺的问题,VQ-Touch用带可变形卷积和多尺度融合的DM-VQGAN学习触觉离散表征,并结合传感器族聚类、少样本混合训练和统一离散扩散解码器,从视觉、触觉或标签条件生成触觉图像。实验显示其在重建与条件生成任务上优于既有方法,尤其改善少样本、跨传感器和视觉受限场景。

BridgeFlow: Fast and Robust SE(2)-Equivariant Motion Planning with Flow Matching Figure 1
2026-07-17cs.RO

BridgeFlow: Fast and Robust SE(2)-Equivariant Motion Planning with Flow Matching

Xinzhe Zhou, Xuyang Wang, Xiaoming Duan, Jianping He

2026-07-17生成模型规划控制安全鲁棒

BridgeFlow针对学习式运动规划在空间等变性与实时推理之间的矛盾:扩散/生成式方法要么不具备严格SE(2)泛化,要么依赖昂贵等变网络。其核心是用任务中心规范化实现严格等变,再结合Brownian bridge先验、上下文约束小批量OT和CFG环境条件化来拉直流场并减少测试时优化。实验在密集2D场景和7自由度Franka上报告最高15倍推理加速、有效轨迹率约2倍提升,并能泛化到未见环境和任意刚体变换。

Reinforcement Learning for the Full Strawberry Harvesting Process: Obstacle Separation, Detachment, and Placement Figure 1
2026-07-17cs.RO

Reinforcement Learning for the Full Strawberry Harvesting Process: Obstacle Separation, Detachment, and Placement

Changyou Miao, Teng Li, Ya Xiong

2026-07-17强化学习

面向遮挡严重、植株可变形导致传统草莓采摘流水线难以先清障再采摘的问题,本文将障碍分离、果实脱离和放置建模为连续决策任务,用共享强化学习策略生成笛卡尔动作,并以轻量启发式逻辑协调阶段与夹爪事件。策略经域随机化实现零样本迁移,仿真成功率89.7%,真实高架栽培环境成功率82.0%;但仅在单一平台和场景验证,跨品种、损伤评估与相对基线增益仍文中未充分说明。

Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color Figure 1
2026-07-17cs.RO

Lights, Camera, Malfunction: When Illumination Robustness Leaves VLA Models Blind to Color

Marino Watanabe, Takami Sato, Kentaro Yoshioka

Keio University

2026-07-17安全鲁棒

本文关注 VLA 机器人在真实部署中对细微光照变化的脆弱性,指出问题不只是高级安全攻击,也来自泛化不足。作者提出黑盒聚光灯评测框架 FLARE,并揭示朴素 HSV 增广会让模型把颜色当噪声丢弃,导致依赖颜色的任务失败;进一步提出保色保纹理的 ChromaGuard,在物理 6-DoF 平台上使颜色相关任务在正常和受攻击条件下分别达到 97.5% 和 92.5% 成功率。

Reflex: Real-Time VLA Control through Streaming Inference Figure 1
2026-07-17cs.RO

Reflex: Real-Time VLA Control through Streaming Inference

Yuanchun Guo, Bingyan Liu

2026-07-17规划控制

本文针对流匹配 VLA 在机器人实时控制中因迭代去噪、KV 缓存失效和同步等待导致的高延迟问题,提出 Reflex:利用感知编码器与去噪时间步解耦的时间步不变性,将注意力上下文划分为静态、滑动和动态区域,并结合 AdaRMSNorm 与异步流水线实现稳定流式推理。LIBERO 和 Kinetix 实验显示其推理加速 2.58 倍、可达 50Hz,反应延迟最高降低 54%。

MIND-CAVs: Multi-Intelligence Negotiation and Decision System for CAVs based on Intent-Driven Autonomy Figure 1
2026-07-17cs.RO

MIND-CAVs: Multi-Intelligence Negotiation and Decision System for CAVs based on Intent-Driven Autonomy

Mainak Mondal, Yihang Feng, Yangchao Luo, Han Song

2026-07-17机器人

这篇论文针对现有车联网多只共享位置速度、缺少高层机动意图协商的问题,提出 MIND-CAVs:车辆生成结构化意图,经 V2X 交给路侧 MEC 节点进行规则与学习结合的冲突仲裁,并由云端记录审计链路。CARLA 多车道与出口场景中,相比孤立自治、先到先服务和 MARL 基线,完成时间更短,不安全近距和无谓制动更少;但实验规模较小,LLM 仲裁缺少形式化安全保证。

An Intelligent-Cloud Edge Multimodal Interaction System for Robots Figure 1
2026-07-17cs.RO

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

Zihan Guo, Xiaoqi Li

Hainan University, China

2026-07-17机器人视觉语言

面向算力受限机器人在复杂场景中难以同时完成手势感知、语义理解与任务规划的问题,论文提出云边协同框架:云端集成加入CBAM与DIoU的YOLO-DC、VLM/LLM双智能体和规则/FSM校验,边端TonyPi负责采集与执行。实验显示公开/自建手势集精度达98.9%/95.0%,mAP@0.5为90.7%/92.7%,系统任务成功率为95%、88%、82%,但端到端泛化与云端依赖影响仍需更多说明。

NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation Figure 1
2026-07-17cs.RO

NavCMPO: Critic-Guided MeanFlow Policy Optimization for Adaptive Navigation

Junjie An, Yi Wu, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, You Wang, Guang Li

2026-07-17机器人生成模型强化学习优化算法

NavCMPO针对端到端视觉导航中扩散策略推理慢、纯行为克隆受示范质量限制的问题,将少步MeanFlow轨迹生成与障碍感知预训练、critic梯度轨迹修正和PPO微调结合起来,以弥补少步生成容易忽视障碍的缺陷。在InternVLA-N1上成功率达74.7%,较重训NavDP高6.4个百分点,延迟由85ms降至60ms,并在Unitree Go2上展示了仿真到真实迁移。

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling Figure 1
2026-07-17cs.RO

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling

Reon Tabata, Kenji Koide, Shuji Oishi, Masashi Yokozuka, Taku Okawara, Aoki Takanose, Jun Miura

2026-07-17视觉感知生成模型三维

针对图像到点云配准中模态差异大、监督配对数据昂贵且跨传感器泛化差的问题,论文把稀疏 LiDAR 扫描转成强度图像,并用条件 Rectified Flow 补全为稠密图,再借助预训练图像匹配器和 PnP-RANSAC 求 6DoF 位姿,避免显式学习 2D-3D 对应。在未用 R3LIVE 训练的设置下,平均误差达 4.89°/1.63m,单次约 0.68s;但非结构化环境性能下降。

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models Figure 1
2026-07-17cs.AI

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

Shanghai Qizhi Institute, The Chinese University of Hong Kong, Hong Kong Embodied AI Lab, Tsinghua University, University of California, Berkeley.

2026-07-17视觉语言视觉感知

本文关注VLA模型中动作监督对预训练多模态表征的反向塑形:直接用动作损失微调虽能形成动作相关特征,却会破坏语言理解和目标定位。作者提出Action QFormer,以指令条件查询作为动作侧接口,先重组视觉语言信息再生成动作,并缓和梯度对上游表征的扰动。在零样本仿真到真实导航中,任务成功率由18.8%升至56.3%,固定指令动作正确率由22.5%升至75.5%,分布外指令生成几乎消失。

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation Figure 1
2026-07-17cs.RO

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

Ruilin Chen, Jingkai Jia, Tong Yang, Xinyu Zhou, Qiao Sun, Jiangwei Zhong, Shizeng Zhang, Nuo Chen, Bailin He, Wei Li, Wenqiang Zhang

Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Nanyang Technological University

2026-07-17机器人视觉语言

这篇论文针对接触丰富操作中视觉难以观测滑移、压力和装配对齐等状态的问题,指出未来触觉预测不应随意作为辅助损失加入 VLA。作者用线性探针发现,中间动作专家特征最能预测未来触觉,并提出 LTP 在该表示上预测紧凑触觉潜变量。真实机器人五类任务中,该方法平均成功率达 74%,较 VLM 端和最终动作端监督分别高 16 和 12 个百分点。

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation Figure 1
2026-07-17cs.RO

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

Zhejiang University, 2 Shandong University

2026-07-17机器人视觉语言三维

这篇论文针对具身导航中3D场景信息被转写成文本后损失空间与语义结构的问题,提出SoftNav:将PQ3D提取的物体和frontier级连续3D表示经轻量投影器注入VLM隐藏空间。实验显示文本序列化存在显著表示鸿沟;在冻结3D编码器和VLM、仅用约1200样本训练约17M参数时,SoftNav在HM3D-OVON达到74.2%/68.3%/66.7%成功率,并可零样本迁移到GOAT-Bench、SG3D和真实机器人。

Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers Figure 1
2026-07-17cs.RO

Beyond Implicit Force: Evaluating Explicit Force-Torque Proxies in Action Chunking with Transformers

King Hang Wong, Lingqiao Liu, Feras Dayoub

The authors are with the Australian Institute for Machine Learning (AIML), Adelaide University, Adelaide, SA 5005, Australia.

2026-07-17机器人

这篇论文关注接触丰富操作中 ACT 是否真正学到“力感知”,还是依赖 ALOHA 式主从遥操作里的跟踪误差这一隐含接触线索。作者通过让 ACT 预测从臂未来关节状态来剥离该线索,并加入由电机电流/关节力矩得到的显式力矩代理。真实机器人四类任务显示,去掉隐含线索会使接触关键阶段严重失败,而力矩增强模型能恢复甚至提升表面跟随、插入、刚度判别和力控停止表现。

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents Figure 1
2026-07-17cs.RO

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

Beijing University of Posts and Telecommunications, Beijing, China, State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China

2026-07-17视觉语言数据集/基准安全鲁棒

本文针对具身智能中“任务完成但过程不安全”的问题,指出家庭操作风险常由支撑、容纳、邻近等空间关系和动作顺序触发。SafeRelBench 将安全前提检查嵌入507个可执行样本,并配对非空间控制任务。对7类VLM驱动代理的评测显示,空间关系场景下任务成功率与过程安全率存在明显落差,说明现有模型仍缺乏可靠的关系化安全推理。

Communication-Efficient Relative Pose Estimation with Vision Foundation Models for Ephemeral Collaborative Perception Figure 1
2026-07-17cs.RO

Communication-Efficient Relative Pose Estimation with Vision Foundation Models for Ephemeral Collaborative Perception

Qihang Li, Jo-Hao Huang, Jiewen Liu, Suyoung Kang, Hao Zhang, Peng Gao

2026-07-17视觉感知三维

这篇论文针对多机器人短暂相遇时带宽有限、视野重叠不稳定且缺少全局参考的问题,提出 CERPE:用固定长度视觉描述子先判断是否值得请求原始图像,再调用 VGGT 做跨机器人相对位姿估计,并用 Metric3Dv2 校准尺度;无重叠时则通过双方尺度化自运动在 SE(3) 上传播位姿。仿真和真实机器人实验显示,其相对所选基线最高降低约72%位置误差和90%旋转误差。

DRIFT: Drift and Aggregation for Motion Planning Figure 1
2026-07-17cs.RO

DRIFT: Drift and Aggregation for Motion Planning

Yining Xing, Zhiyuan Liu, Zehong Ke, Wenhao Yu, Jianqiang Wang

2026-07-17规划控制

DRIFT针对端到端自动驾驶规划中“多种可行驾驶意图”与实时单轨迹输出之间的矛盾,提出在紧凑PCA轨迹潜空间中一步漂移生成48个候选特征,再由场景感知聚合头结合视觉、导航和自车状态直接回归最终轨迹,无需轨迹质量标签或迭代采样。其在NAVSIM navtest上达到89.6 PDMS、90.4 EPDMS,生成与聚合耗时10.82 ms;但真实交互闭环表现和候选多样性的增益来源仍未充分说明。

Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments Figure 1
2026-07-17cs.RO

Safe Execution of RL Policies Via Acceleration-Based CBF-QP Constraint Enforcement for Real-World Robotic Deployments

Bastien Muraccioli, Alice Cariou, Pierre-Alexandre Leziart, Mathieu Celerier, Arnaud Demont, Gentiane Venture, Mehdi Benallegue

2026-07-17机器人强化学习优化算法安全鲁棒

针对强化学习策略在真实机器人上缺乏硬安全约束、遇到分布外状态易损坏硬件的问题,论文提出将任意预训练 RL 策略接入加速度层 CBF-QP 安全滤波器,在运行时统一约束关节位置、速度、力矩和碰撞,并用 TorqueTask/FDTask控制偏离原策略的方式。Kinova Gen3 实验中违规被消除,真实 H1 上违规率从 10.04 次/秒降至 0.80 次/秒,同时基本保持无违规区间的任务表现。

MIDAS Hand: Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand Figure 1
2026-07-17cs.RO

MIDAS Hand: Modular low-Impedance Direct-drive Anthropomorphic Sensing Hand

Alvin Zhu, Mingzhang Zhu, Beom Jun Kim, Quanyou Wang, Jose Victor S. H. Ramos, Dennis Hong

2026-07-17机器人

面向灵巧操作中硬件昂贵、难维护且触觉集成不足的问题,MIDAS Hand 提出低成本开源的人手尺度机械手,将直接驱动低阻抗关节、283 个三轴触觉单元、模块化 3D 打印结构与控制/仿真/遥操作工具链结合。实验显示其回驱力矩约 0.02 N·m,覆盖 32/33 类 GRASP 抓握,整手负载超过 9.5 kg,并完成 5000 次连续抓握,表明其更像可复现实验平台而非单一算法贡献。

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction Figure 1
2026-07-17cs.CV

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction

Dasong Gao, Vivienne Sze, Sertac Karaman

2026-07-17三维

面向机器人在线建图中少视角3DGS重建的速度、显存与几何精度矛盾,G²SR把问题拆成轻量神经前端的2D高斯检测/跨视角跟踪,以及解析几何后端的三角化,避免用大模型整体回归3D结构。在ScanNet、Replica、DTU上,其深度和网格精度达到或超过端到端方法,并以115–203MB显存实现69–89 RPS。

Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences Figure 1
2026-07-17cs.RO

Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences

Annette M. Masterson, Wonse Jo, Helena C. Sieh, Lionel P. Robert Jr., Dawn Tilbury

Department of Robotics, University of Michigan, Ann Arbor, MI 48109, United States, Department of Mechanical Engineering, University of Michigan, Ann Arbor, MI 48109, United States, Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, MI 48109, United States, School of Information, University of Michigan, Ann Arbor, MI 48109, United States

2026-07-17机器人

针对博物馆静态展陈和音频导览互动不足的问题,论文提出由实体机器人加背载投影虚拟代理组成的混合导览系统,用单一移动平台模拟双代理对话与展品指引。30人被试实验显示,不同配置下参与感和体验质量差异不大,但混合代理显著提升女性学习表现,且访谈中男女均更偏好混合代理;结果也提示娱乐性与知识保持之间存在张力。

Motion Planning with Model-Based Diffusion via Constraint Optimization and Adaptive Scheduling Figure 1
2026-07-17cs.RO

Motion Planning with Model-Based Diffusion via Constraint Optimization and Adaptive Scheduling

Zhilin He, Bowei Li, Jianlin Dou, Yuner Zhang, Changliu Liu

2026-07-17生成模型规划控制优化算法

针对单机器人在强非凸约束环境中既要保持扩散采样多样性又要满足碰撞与动力学约束的问题,论文提出 MD-COAS,将 iALM 软可行性先验与 CFS 硬投影统一到模型化扩散规划中,并随反向扩散自适应调度安全约束强度。实验显示其在随机 2D 场景和 7 自由度机械臂避障中,相比基线获得更高安全/成功率、更快收敛和更低最终代价。

Active Real-World Factor-Based Evaluation for Generalist Robot Policies Figure 1
2026-07-17cs.LG

Active Real-World Factor-Based Evaluation for Generalist Robot Policies

Andrew Liao, Hanchen Cui, Karthik Desingh, Aryan Deshwal

University of Minnesota Twin Cities

2026-07-17机器人强化学习数据集/基准

论文针对通用机器人策略真实评测成本高、因子组合空间大而窄测试易漏掉失效模式的问题,将评测建模为贝叶斯主动实验设计:用概率代理模型刻画任务因子到性能的分布,并自适应选择最有信息量的真实试验配置。在3个任务、2331次真实评测中,该方法通常比随机测试少用20%到40%的试验即可达到相近误差,并能定位更脆弱的因子区域。

ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation Figure 1
2026-07-17cs.RO

ConFlow: Constraints-Guided Learning with Flow Matching for Motion Generation

Nutan Chen, Jianxiang Feng, Marvin Alles, Botond Cseke

LS Wiiri Robot Innovation Center, Technical University of Munich

2026-07-17生成模型优化算法

本文针对机器人运动生成中“训练只拟合示范、部署再用约束引导”造成的训练—推理错配,提出 ConFlow:把碰撞等可微约束以 barrier/cost 形式并入 flow matching 训练,并用条件高斯过程源分布表达平滑性、边界和途经点约束,还利用不可行示范作负监督。双机器人导航实验显示,其碰撞率更低、轨迹质量高于标准 flow matching 及带推理引导的基线。

An offline approach to fNIRS-guided reinforcement learning for robot behavior Figure 1
2026-07-17cs.RO

An offline approach to fNIRS-guided reinforcement learning for robot behavior

Julia Santaniello, Madelaine Brower, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

2026-07-17机器人强化学习

这篇论文针对传统人机协同强化学习依赖显式语言、动作或界面反馈、容易增加认知负担并排除部分用户的问题,提出用离线 fNIRS 脑信号作为机器人学习的隐式反馈。核心做法是将神经信号解码为动作最优性,并用于增强奖励、Q 值和轨迹优先级而非替代原算法。仿真 Fetch Pick-and-Place 结果显示,增强 Q 值和优先级能提升成功率与回报,奖励增强作用不明显;但标签是否真实反映用户判断仍文中未充分说明。

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving Figure 1
2026-07-17cs.AI

Chat2Scenic: An Iterative RAG-Based Framework for Scenario Generation in Autonomous Driving

Yuan Gao, Wenting Miao, Mattia Piccinini, Haoyu Wang, Qunying Song, Johannes Betz

Munich Institute of Robotics and Machine Intelligence (MIRMI) 2 Q. Song is with University College London, London, United Kingdom ∗ Equal contribution.

2026-07-17机器人

面向自动驾驶仿真验证中法规场景难以自动转成可执行 DSL 脚本的问题,Chat2Scenic 将法规知识与 Scenic 语法检索引入多轮聊天式生成,并采用迭代的组件级脚本生成来兼顾可扩展性和可编译性。作者还构建了含 123 个法规场景的基准;实验中 CSR 达 76.42%、FA 达 58.17%,明显高于检索拼装和整脚本生成基线。

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution Figure 1
2026-07-17cs.RO

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

2026-07-17视觉感知数据集/基准

这篇论文针对现有抓取基准过度关注静态抓取位姿、难以评估真实执行中几何约束、拥挤场景和语言语义约束的问题,提出 GCA-Bench,将复杂抓取定义为从检测到轨迹执行的多阶段能力,并同时覆盖仿真与真实数据。实验比较传统检测流水线、基础模型和端到端方法,复杂场景成功率均低于 70%,说明当前方法的主要瓶颈在场景推理、语义对齐和执行鲁棒性,而不只是抓取检测精度。

DiMaS: Distribution Matching for Steering Vision-Language-Action Models Figure 1
2026-07-17cs.RO

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

2026-07-17视觉语言视觉感知

判断受限于 PDF 文本抽取质量。论文关注流匹配 VLA 在机器人操作中缺少细粒度行为控制的问题,指出传统线性表示 steering 虽能解码行为特征,却难以真正驱动视觉运动策略;DiMaS 改为在内部表征分布之间做匹配与传输。作者称其在两个先进 VLA 上可有效调控行为,并分析了跨任务差异增大时控制迁移会减弱。

Stochastic Filtering for Quorum Sensing in Robot Swarms under Anonymous Communication Figure 1
2026-07-17cs.RO

Stochastic Filtering for Quorum Sensing in Robot Swarms under Anonymous Communication

Fabio Oddi, Andreagiovanni Reina, Vito Trianni

2026-07-17机器人

这篇论文针对匿名通信下群体机器人法定人数感知的重复计数偏差:机器人无法识别消息来源,局部邻居的重复广播会扭曲全局承诺比例估计。作者提出受 k-priority sampling 启发的随机过滤协议,在估计时屏蔽临近过期的部分缓存消息。仿真显示,FIFO 匿名协议快但误差大,随机超时提高准确性却收敛慢,新过滤方法能降低短时误差并稳定估计,但错误恢复时间增加。

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning Figure 1
2026-07-17cs.RO

MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning

Zihao Yu, Xiu Yuan, Chongjie Zhang

2026-07-17视觉感知规划控制

MEMORA针对长程机器人规划仅依赖当前场景或检索片段难以处理熟悉环境中地点、物体状态和个人习惯的问题,提出具身动作记忆,将第一视角视频在线写入环境、实体、活动和推断知识四类存储,并通过编辑与离线巩固形成可检索的程序性经验。在45小时EPIC-KITCHENS扩展视频上,完整系统在四个开源模型中表现最佳,记忆评测最高提升20.5点,分布外机器人落地计划得分相对提升16.6%。

Information-Theoretic Adaptive Cooling for Deterministic MPPI via Entropy Feedback Figure 1
2026-07-17eess.SY

Information-Theoretic Adaptive Cooling for Deterministic MPPI via Entropy Feedback

Shuqi Wang, Wenrong Sun, Tao Han, Yue Gao, Xiang Yin

the School of Automation & Intelligent Sensing, Shanghai Jiao Tong University, The Hong Kong University of Science and Technology, Hong Kong S.A.R., China.

2026-07-17机器人

本文针对确定性 MPPI 中温度必须降至零但冷却过快会导致权重塌缩、过慢又拖慢收敛的矛盾,提出用重要性权重的 Shannon 熵作为在线反馈来自适应调节冷却速率。核心洞察是以熵阈值形成防止过早集中采样的平滑屏障,同时保留 MPPI 的无梯度特性。作者证明了渐近收敛到确定性最优,并在非光滑信号时序逻辑运动规划任务中报告最高约 73% 的收敛加速。

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection Figure 1
2026-07-17cs.RO

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

Shanghai Jiao Tong University, Shanghai Innovation Institute, Southern University of Science and Technology, Noematrix Ltd.

2026-07-17机器人

这篇论文针对预训练VLA在接触、遮挡和深度不确定时过度依赖视觉、难以及时纠偏的问题,提出LIFT:在后训练阶段为原动作专家旁接反应式动作专家,用6D末端力的因果记忆和零初始化交叉注意力注入接触反馈,并结合在线DAgger收集人类纠正。实机毛巾折叠、书本插入和汉诺塔放环实验显示,相比纯视觉后训练,LIFT通常以更少样本达到更高成功率,消融也表明力记忆与在线纠正均有贡献。

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination Figure 1
2026-07-17cs.AI

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

Tencent Robotics X Team × Futian Laboratory × Tencent Hy Team

2026-07-17机器人

这篇论文针对具身任务中“文字会规划但缺少物理状态、世界模型会想象但缺少因果决策”的断裂,提出 RxBrain 将语言推理与视觉想象编进同一规划序列,并用自动视频分解管线构造图文联合监督。实验显示其能同时生成文本计划、预测中间/最终视觉状态,并在少量动作数据条件下扩展到连续机器人动作,真实机器人结果有希望但规模化泛化增益来源仍需进一步说明。

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning Figure 1
2026-07-17cs.RO

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

2026-07-17机器人数据集/基准

面向具身学习中真实操作数据难以低成本规模化采集且缺少可直接训练结构标注的问题,Open-AoE将手机第一视角采集、动作分段、MANO手姿态、相机轨迹、语义标注与下游可视化、重定向和训练接口打通。首版发布约2000小时、500+贡献者、400+手机、8000+任务的数据,主要价值可能来自scaling / data与工具链一体化。

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control Figure 1
2026-07-17cs.RO

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

2026-07-17机器人规划控制

针对人形机器人表演多依赖预编排、难以随现场音频自主切换动作的问题,论文提出语义音频驱动的全身控制编排框架:先区分音乐、语音与无效片段,再用音频指纹、语义嵌入和语音 grounding 选择 imitation-learned 技能,并接入强化学习控制管线。实验在仿真和 Unitree G1 上展示了较稳定的音频条件策略选择与 sim-to-real 执行,但规模化泛化仍需更多验证。

Adaptive Control of Motor-Position-Controlled Flexible Joint Robots with Uncertain Joint Stiffness Figure 1
2026-07-17cs.RO

Adaptive Control of Motor-Position-Controlled Flexible Joint Robots with Uncertain Joint Stiffness

Annika Kirner, Grazia Zambella, Igor Kovacevic, Hannes Höppner, Jee-Hwan Ryu, Christian Ott

2026-07-17机器人规划控制

针对位置控制电机驱动的柔性关节机器人中关节刚度随工况、老化和滞回变化而难以精确建模的问题,本文提出在线自适应估计非线性力矩-挠度关系的链侧跟踪控制方法,关键在于采用隐式控制律和依赖控制输入的回归矩阵,并分析内环电机位置误差下的鲁棒性。实验在强非线性柔性关节上显示,自适应控制相比固定刚度模型能改善轨迹跟踪,但更大规模机器人验证仍有限。

2026-07-16

64 篇
PhysClaw-0: A Symbiotic Agentic System for Robot Autonomy via Language Corrections Figure 1
2026-07-16cs.RO

PhysClaw-0: A Symbiotic Agentic System for Robot Autonomy via Language Corrections

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

GigaAI 2 University of Chinese Academy of Sciences 3 Hong Kong University of Science and Technology, University of Leeds, Cornell University 6 Tsinghua University, Nanjing University of Science and Technology 8 The Chinese University of Hong Kong 9 FAWTD

2026-07-16机器人

这篇论文针对机器人长时自主采集中反复失败仍需人工重复介入的问题,提出 PhysClaw-0:把操作者的自然语言纠错解析为结构化规则,存入 Corrective Memory,并在后续采集、验证、复位循环中复用。实验显示其在桌面清理任务中以约 16% 的远程人工时间达到全人工遥操作相近的采集成功率,单次采集成功率由 12.5% 提升到 47.5%,用其数据微调的策略也达到与遥操作数据相当的 80% 成功率。

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation Figure 1
2026-07-16cs.RO

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

All authors are with Analog Devices, Inc., USA (e-mail:

2026-07-16机器人数据集/基准

面向数据中心线缆维护、汽车线束和齿轮装配等仍高度依赖人工的高精度接触操作,论文提出IDB工业灵巧操作基准板,并配套ROS2模仿学习框架DAG-ROS与融合RGB、点云、关节和腕部力信息的扩散策略AG-iDP3。在线缆清洁任务中,多视角RGB扩散策略以约每阶段100次遥操作示范达到78%抓取加插入成功率,高于单相机RGB基线的36%。

AeroMap3D: Anchoring Monocular UAV 6-DoF Localization to Visual-Geometric-Semantic Map Priors Figure 1
2026-07-16cs.RO

AeroMap3D: Anchoring Monocular UAV 6-DoF Localization to Visual-Geometric-Semantic Map Priors

Zhiyun Deng, Luis Sentis

2026-07-16三维

面向 GNSS 受限环境下无人机长航迹会因视觉里程计漂移而失去全局锚定的问题,AeroMap3D 尝试仅用公开卫星图、裸地 DEM 与 OSM 实现单目 6-DoF 定位。核心洞察是先用轻量尺度/航向适配器缓解 UAV 与地图视角差异,再用 OSM 剔除建筑区域,避免 DEM 将屋顶等结构错误提升为地面点。实验在 55 km 奥斯汀飞行数据上无需重训达到 5.88 m 平均 3D 误差,所有轨迹误差均低于 50 m。

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming Figure 1
2026-07-16cs.CV

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

2026-07-16机器人视觉语言强化学习

面向自动驾驶仿真中长尾场景难采集、现有生成模型缺乏对象级外观控制且长时序易漂移的问题,M^4World将多视角视频与LiDAR联合建模,用融合3D框、类别和文本/视觉属性的对象token实现交互式操控,并通过多阶段因果少步扩散训练支持分钟级流式生成。实验显示其FID/FVD优于基线,视觉/文本对象一致性大幅提升,并在树木运输车长尾增广中显著提高召回率。

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch Figure 1
2026-07-16cs.RO

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

Tsinghua University

2026-07-16强化学习

本文针对现有世界动作模型在推理时生成未来视频、难以实时闭环控制的问题,提出 GigaWorld-Policy-0.5:训练阶段继续用未来视觉动态提供密集监督,推理阶段仅解码动作,并用 MoT 分离视觉建模与动作生成;同时混合 AC-WM/WAM 预训练并用 AutoResearch 搜索配置。实验称其在保留视觉动态监督收益的同时,将本地 RTX 4090 上推理延迟降至 85 ms。

Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation Figure 1
2026-07-16cs.RO

Discriminative Barrier Functions for Safe Adversarial Imitation Learning from Observation

Anubhav Vishwakarma, Bhaumik Mehta, Caleb Hsu, Byron Boots, Karen Leung, Tyler Han

University of Washington

2026-07-16模仿学习安全鲁棒

针对从观察模仿学习在在线探索中容易碰撞、而控制障碍函数又依赖人工设计的问题,论文将逆强化学习的奖励候选限制为离散 CBF 空间,提出 DBF 从仅含状态的专家轨迹联合恢复屏障函数与模仿策略。实验显示其在仿真导航和真实避障中较标准 IRL 基线减少碰撞,并能泛化到训练中未出现的障碍配置。

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving Figure 1
2026-07-16cs.RO

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving

Jianguo Yu, Rukang Wang, Duanfeng Chu, Chen Wang, Renju Feng, Liping Lu

2026-07-16视觉语言视觉感知

这篇论文针对自动驾驶 VLA 将语义推理与控制生成混在单一路径中,导致语言瓶颈下细粒度空间几何信息塌缩的问题,提出 S²-VLA:用语义流提取多尺度 VLM 意图特征,用独立空间流保留视觉编码器的未压缩空间特征,并通过双流规划适配器融合二者。在 NAVSIM 闭环评测中,模型取得 PDMS 87.1、无碰撞率 98.4,显示解耦空间表征对安全轨迹规划有实质收益。

Learning Forward & Reverse Skills from a Single Unfinished Demonstration for Constrained Manipulation Tasks Figure 1
2026-07-16cs.RO

Learning Forward & Reverse Skills from a Single Unfinished Demonstration for Constrained Manipulation Tasks

Yexin Hu, Haoyi Zheng, Johannes Heidersberger, Dongheui Lee

2026-07-16机器人模仿学习

面向插入、开锁、拧螺丝等受几何约束且接触丰富的操作任务,论文针对单次示教可能不完整、且难以学习反向技能的问题,提出将自由空间运动用 DMP 表示、接触阶段按扭转方向分割为螺旋运动基元,并结合导纳校正与进度控制执行。实验覆盖四类任务,显示其相较一阶轨迹学习和分割基线有更高成功率与鲁棒性。

Merging Reaction to Cognition: A Hybrid Cognitive Strategy for Odour Source Localisation in Natural Environments Figure 1
2026-07-16cs.RO

Merging Reaction to Cognition: A Hybrid Cognitive Strategy for Odour Source Localisation in Natural Environments

Hugo Magalhães, Rui Baptista, Lino Marques

Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra, 3030-290, Coimbra, Portugal

2026-07-16机器人

面向湍流羽流中气味信号稀疏、梯度不可靠导致机器人难以快速定位污染源的问题,论文提出 Hybrid Fast-Cognitive:在认知式概率信念规划中加入由气味检测触发的反应式切换,使机器人在横流探索与朝源运动间自适应转换,参数由信念指标给出而非手调。仿真和 Mondego 河 ASV 实验显示,相比 Fast-Cognitive 行驶距离最多降约 50%,成功率 86%,平均定位误差约 3.2 米。

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads Figure 1
2026-07-16cs.RO

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads

Rafael Munoz-Salinas, Francisco Jose Romero-Ramirez, Sergio Garrido-Jurado

Department of Computer Science and A.I., Universidad de Córdoba, 14071, Córdoba, Spain, Department of Electronics and Computer Engineering, Universidad de Córdoba, 14071, Córdoba, Spain

2026-07-16机器人

这篇论文针对无人机降落中普通 ArUco 标记在远近尺度变化、中心遮挡或视野裁切下易失效的问题,提出 Recursive ArUco:把同一标记递归嵌入父标记黑白比特,并用边界采样避免依赖中心区域,从而在不同尺度保持同一 ID。主要结果是支持任意递归深度、部分遮挡下仍可检测,并适合多无人机分配不同降落垫;具体量化增益文中片段未充分说明。

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning Figure 1
2026-07-16cs.RO

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

2026-07-16机器人强化学习安全鲁棒

这篇论文针对机械臂长程操作中小偏差累积导致执行退化的问题,提出用局部/全局执行质量指标监控过程,并训练高层 agentic RL 策略在执行、重试、修复、重置等模式间切换,而不改动底层 VLA 或扩散策略。LIBERO 实验显示标准设置成功率最高提升 13.7%,扰动下最高提升 39.2%,但真实机器人验证仍文中未充分说明。

A Deployed Hybrid Vehicle-in-the-Loop Platform for Validating Cooperative Perception Figure 1
2026-07-16cs.RO

A Deployed Hybrid Vehicle-in-the-Loop Platform for Validating Cooperative Perception

Anastasia Bolovinou, Giorgos Hadjipavlis, Markos Antonopoulos, Panagiotis Tachtalis, Konstantinos Petousakis, Konstantinos Lazaridis, Alexandros Siskos, Bill Roungas, Angelos Amditis

2026-07-16机器人

面向自动驾驶法规逐步接受虚拟 homologation 证据的需求,本文构建并部署了一个混合 Vehicle-in-the-Loop 平台,将真实车、CARLA 数字孪生和 ETSI CAM/CPM V2X 流接入同一协同感知闭环。其核心价值在于把真实车辆消息实时转为概率占据栅格,并用虚实混合方式扩展多车场景验证。实验显示协同感知扩大视野覆盖、提升占据栅格召回;在中等以上定位噪声下,误差主要由定位不确定性而非天气造成,但仿真到真实的定量保真度仍文中未充分说明。

Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning Figure 1
2026-07-16cs.RO

Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning

Teng Li, Hanfei Shi, Chunjiang Zhao, Ya Xiong

2026-07-16视觉感知强化学习

针对簇生草莓中成熟果被未成熟果遮挡、单纯避障难以可靠采摘的问题,论文提出VGPA分层强化学习框架,将任务拆为障碍分离与目标抓取,并用视觉引导高层选项、PAES调节低层探索。仿真成功率达96.7%,实机在不同遮挡下为71.7%至88.3%,平均80.0%,高于直接采摘的59.7%,但耗时增加约1.22秒。

Dynamical Vehicle Orienteering Problem for Multi-Rotor Unmanned Aerial Vehicles Figure 1
2026-07-16cs.RO

Dynamical Vehicle Orienteering Problem for Multi-Rotor Unmanned Aerial Vehicles

František Nekovář, Matej Novosad, Martin Saska, Robert Pěnička

Faculty of Electrical Engineering, Czech Technical University, Technicka 2, 166 27, Prague, Czech Republic, available dynamics. A later model-based KOP formulation (Nekovář et al., 2023) imposed velocity and

2026-07-16机器人

本文针对传统定向越野路径规划忽略多旋翼无人机加速度、推力和重力约束的问题,提出动态车辆定向越野问题 DVOP,并将奖励选择与时间最优轨迹联合建模。核心方法是结合 NLP/MILP 的分支定界和可扩展的 LNS 启发式,利用 PMM 轨迹基元给出紧上界。基准实验较 KOP 方法最高提升 37%,实机飞行验证了轨迹可执行性。

The Nonsmooth Impact Direction (NSID) of Robotic Systems Figure 1
2026-07-16cs.RO

The Nonsmooth Impact Direction (NSID) of Robotic Systems

Annika Kirner, Christian Ott

Annika Kirner and Christian Ott are with the Automation and Control Institute, TU Wien, 1040

2026-07-16机器人

针对机器人碰撞中速度突变快、难以在控制周期内在线塑形且可能损伤硬件的问题,论文从瞬时非光滑冲击模型出发,提出并系统刻画非光滑冲击方向(NSID):它在配置/任务空间中与冲击不变子空间分解,且基本不依赖恢复系数等接触参数。理论结果表明,沿 NSID 接近可在任意弹性下反向速度方向,在全非弹性摩擦接触中产生法向冲量、避免滑移;实验用被动多体系统和力矩控制机械臂验证了这些性质。

nuTruck: Benchmarking Autonomous Driving Planning for Distributed Electric-drive Trucks Figure 1
2026-07-16cs.RO

nuTruck: Benchmarking Autonomous Driving Planning for Distributed Electric-drive Trucks

Jinyu Miao, Pu Zhang, Yifei He, Chengyao Zhang, Kun Jiang, Ke Wang, Mengmeng Yang, Diange Yang

2026-07-16规划控制数据集/基准

面向分布式电驱重卡,现有自动驾驶规划基准多针对乘用车或仅做开环评估,难以反映重卡侧翻等动力学安全风险。nuTruck将nuPlan真实场景与高保真非线性重卡动力学模型结合,支持闭环训练评测并引入非侧翻等安全指标。实验显示,乘用车常用规划器直接迁移到DET性能下降,仅靠控制器防侧翻会牺牲跟踪表现,规划阶段需同时考虑碰撞避免与动力学安全。

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties Figure 1
2026-07-16cs.RO

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties

Frederik Hagelskjær

2026-07-16三维

面向料箱抓取中姿态估计歧义和抓取误差会导致后续装配失败的问题,论文提出可插拔框架,把物体姿态分布、第二视角分布融合、手中位姿验证与重定向托盘组合起来决策。真实系统在三类物体上测试未出现失败,各模块均提升效率;但当前只处理 SO(2) 不确定性,向完整 SE(3) 扩展仍待验证。

Anatomy of Uncertainty: Expressive Descriptors of Robotic Manipulator Motion for Non-verbal Communication in Human-Robot Collaboration Figure 1
2026-07-16cs.RO

Anatomy of Uncertainty: Expressive Descriptors of Robotic Manipulator Motion for Non-verbal Communication in Human-Robot Collaboration

Ridhima Bector, Souravik Dutta, Poornima Ramachandran, Ree Yan Yeoh, Jui Hien Tan, Domenico Campolo, Bernhard Johannes Schmitt

2026-07-16机器人安全鲁棒

面向协作机械臂在感知不确定时仍需让人理解其状态的问题,论文把 Laban 动作分析投影到 Commitment–Vigilance 二维空间,并用接近、暂停、后退、探索、振荡等原语及 11 个运动描述符参数化不确定性表达。视频用户研究显示,参与者能较稳定识别置信、好奇、犹豫、恐惧等状态,部分描述符也会显著改变感知强度。

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching Figure 1
2026-07-16cs.CV

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching

Zehan Liu, Yage He, Xianwu Gong

School of Electronics and Control, Chang’an University

2026-07-16机器人

本文针对迭代式立体匹配在相关体搜索与特征 warping 间割裂、且局部 ConvGRU 难处理无纹理和重复区域的问题,提出 WAVE-Stereo。核心是用 GWCE 同时编码匹配候选、跨视图残差对齐和视差先验,并用 PGCP 周期性注入全局上下文。实验显示其在 Middlebury、ETH3D、KITTI、Booster 等零样本测试中保持竞争精度,KITTI 2015 D1-all 为 3.18%,推理约 66ms,且不依赖外部基础模型。

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation Figure 1
2026-07-16cs.CV

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

Shanghai Jiao Tong University, Shanghai Artificial Intelligence Laboratory, Southeast University, National University of Singapore, Zhejiang University, University of Oxford, available at github.com/InternRobotics/REAL., © 2026 Shanghai Artificial Intelligence Laboratory. All rights reserved., To resolve these issues, we present REAL (exploRatory, communicativE, And, deployLable), an

2026-07-16机器人视觉感知强化学习

这篇论文针对现有具身智能基准依赖模拟器特权感知、默认指令清晰而难以真实部署的问题,提出 REAL:用 RGB 探索、检测与视觉提示替代 oracle API,并引入模拟用户做动态意图澄清,再通过任务生成、SFT 与在线 RL 训练 Qwen3-VL-8B。REAL-Bench 含 241 个任务,交互任务成功率达 56.9%,实体双臂移动机器人 60 次测试端到端成功率为 78.3%。

Design and Control of the "QuadBoat": A Quadruped Surface Vehicle for Drowning Rescue Figure 1
2026-07-16cs.RO

Design and Control of the "QuadBoat": A Quadruped Surface Vehicle for Drowning Rescue

Lianxin Zhang, Yihan Huang, Huihuan Qian

2026-07-16规划控制

面向溺水救援中“接近目标后如何打捞并转运”的空缺,论文提出仿渔蛛的四足多体船 QuadBoat:四个支腿末端浮筒形成可变构型全向 USV,并用腿部逆运动学与级联 MPC-PID 控制姿态和航迹。实验显示其腿端跟踪误差为毫米级,圆形/8 字轨迹误差约厘米级,并完成室内外视觉跟踪与漂浮目标拾取,验证了水面目标捕获与搬运能力。

Unifying Decision-Making and Trajectory-Planning in Unsignalized Intersections Using Time-Varying Potential Fields Figure 1
2026-07-16eess.SY

Unifying Decision-Making and Trajectory-Planning in Unsignalized Intersections Using Time-Varying Potential Fields

David Costa, Francesco Cerrito, Massimo Canale, Carlo Novara

2026-07-16规划控制

面向无信号交叉口中多车意图不确定、规则式决策与轨迹规划易脱节的问题,论文将短时运动预测和冲突区占用系数转化为平滑的时变人工势场,并直接嵌入有限时域最优控制代价,使让行、减速、停车或通行由同一优化问题产生。仿真显示该方法可在多类交叉口和交通条件下保持自车安全,但结果主要限于仿真验证。

From Language to Navigation Goals: A Vision-Language Approach for Semantic Navigation of Mobile Robots Using RGB-D Perception Figure 1
2026-07-16cs.RO

From Language to Navigation Goals: A Vision-Language Approach for Semantic Navigation of Mobile Robots Using RGB-D Perception

Jose Martínez-Fajardo, Pablo Pueyo, Fernando Caballero, Luis Merino

2026-07-16机器人视觉语言视觉感知

面向非专家难以用坐标或预设路点操控移动机器人的问题,论文提出一个 ROS 2 语义导航框架,用 VLM 从自然语言和 RGB-D 图像中定位目标,再经几何投影生成 Nav2 可执行导航点。系统在仿真与 TurtleBot3、Unitree Go2 实机上测试,可处理直接和上下文指令并到达目标,但量化成功率和相对基线增益文中未充分说明。

Design, Modeling and Experimental Validation of a Miniature Hybrid Underwater Glider With Large-Range Foldable Deflectable Wings Figure 1
2026-07-16cs.RO

Design, Modeling and Experimental Validation of a Miniature Hybrid Underwater Glider With Large-Range Foldable Deflectable Wings

Yongjian Zhu, Yusen Tao, Feitian Zhang

2026-07-16机器人

针对小型混合水下滑翔机在狭窄环境中机动性和通过性不足的问题,论文提出 FoDeGlider:两侧机翼可独立进行 0–90° 大范围折叠与偏转,并将翼构型作为结构变量纳入 CRBA 投影的多体动力学与分部水动力建模。多构型实验和过门实验显示,参数辨识模型能较好预测不同变形状态下的动力学,并支持运动中主动变形通过受限通道。

An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning Figure 1
2026-07-16cs.RO

An Empirical Study on Stage-Information Interfaces for VLA Fine-Tuning

Yingwei Ji

2026-07-16机器人

本文针对长程机器人操作中单条任务指令覆盖多个动作阶段的问题,考察阶段信息应如何接入 VLA 微调。核心洞察是把分段标注视为进度模块与动作策略之间的接口选择:用当前阶段文本改写语言输入,或把归一化阶段序号并入机器人状态。LIBERO-10 上,直接微调时两种阶段信号均未超过原始全任务指令;从全任务基线继续微调时,Ordinal Stage-State 平均成功率最高,并在三组配对实验中均优于替代方案,说明阶段信息的收益依赖表示形式和引入时机。

Semantic Anchoring for Robotic Action Representations Figure 1
2026-07-16cs.RO

Semantic Anchoring for Robotic Action Representations

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

Peking University, Eastern Institute of Technology, Ningbo, Shanghai Jiao Tong University

2026-07-16机器人

这篇论文针对 VLA 在少量机器人示范上微调后语义结构被动作监督冲淡、导致泛化下降的问题,提出用预训练语义流形作为“锚点”来诊断和约束动作表征。核心洞察是动作表征中保留的意图级语义结构与 OOD 成功率同步;方法用对比对齐和共享/私有通道分解在训练期修复该结构,推理时不增加模型开销。实验覆盖仿真和真实平台,报告真实 ID 任务最高提升 18.7%,OOD 泛化最高提升 21.5%。

Active Trust Management for Successful Human-Robot Teaming: Moving from a Trust Repair to a Trust Satisficing Perspective Figure 1
2026-07-16cs.RO

Active Trust Management for Successful Human-Robot Teaming: Moving from a Trust Repair to a Trust Satisficing Perspective

Nicola Webb, Edmund R. Hunt

License (if available):, Link to published version (if available):, University of Bristol – Bristol Research Portal, This document is made available in accordance with publisher policies. Please cite only the, published version using the reference above. Full terms of use are available:, School of Engineering Mathematics & Technology, University of Bristol

2026-07-16机器人

面向搜救等高风险人机机器人协作,论文指出信任并非只在故障后修复,而是在任务中随情境、能力、可预测性与诚信判断持续波动。其核心洞察是将目标从“信任修复”转为“信任满足”,提出包含任务前信任启动、任务中在线代理指标测量、闭环行为调整与可变自主权的主动管理框架,并引用快速信任与运动同步指标实验作为支撑;但框架性强,实际提升任务成功率的结果文中未充分说明。

Visual Place Recognition Using Rate-Encoded Spiking Neural Networks with Discrete STDP Learning Figure 1
2026-07-16cs.NE

Visual Place Recognition Using Rate-Encoded Spiking Neural Networks with Discrete STDP Learning

Altzi Tsanko, Oikonomou Katerina Maria, Antonios Gasteratos

2026-07-16视觉感知

这篇论文针对机器人 SLAM 中视觉地点识别“分类准但零误报召回不足”的问题,重写 STDP 训练 SNN 的离散张量化推理流程,重点分析神经元概率分配、查询间状态重置和速度补偿序列聚合的影响。Nordland 100 地点实验显示,概率分配将 R@100P 从 44.13% 提至 77.93%,k=5 聚合达 100%,但部分增益来源仍未充分解耦。

Agile perceptive multi-skill locomotion for quadrupedal robots in the wild Figure 1
2026-07-16cs.RO

Agile perceptive multi-skill locomotion for quadrupedal robots in the wild

Jun-Gill Kang, Jaehyun Park, Tae-Gyu Song, Joon-Ha Kim, Seungwoo Hong, Hae-Won Park

Department of Mechanical Engineering, Korea Advanced Institute of Science and Technology, Daejeon 34141, Republic of Korea, School of Mechanical Engineering, Korea University, Seoul 02841, Republic of Korea

2026-07-16机器人

针对四足机器人在野外复杂地形中难以同时实现高速、感知驱动和多步态平滑切换的问题,论文提出 APT-RL:用简化动力学轨迹优化生成含力矩的二维运动数据,预训练统一潜空间与动作解码器,再通过强化学习和深度图像/激光雷达蒸馏实现机载部署。实机在室内外障碍、台阶、落差、树枝等场景中自主选择技能,瞬时速度最高约 6 m/s,但部分增益可能主要来自高质量轨迹数据与预训练先验。

IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking Figure 1
2026-07-16cs.RO

IMMNet: Hybrid Fusion of Model-based and Data-driven Approaches for Maneuvering Target Tracking

Yixuan Zhao, Chaoqun Yang, Lin Gao, Yongxiao Tian, Ting Yuan

School of Automation, Southeast University, Nanjing, 210096, China, School of ICE, University of Electronic Science and Technology of China, Chengdu, 611731, China, Faculty of Artificial Intelligence, Shanghai University of Electric Power, Shanghai, 201300, China, School of Automation and, Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, 200240

2026-07-16视觉感知

针对三维机动目标在运动模式频繁切换、噪声未知和模型失配下难以稳定跟踪的问题,IMMNet将IMM的多模型贝叶斯框架与可学习模块结合,用Transformer更新运动模式概率,并以KalmanNet替代解析卡尔曼增益。论文还构建了较真实的3D MTT数据集;仿真显示其在多种场景下优于传统IMM和现有数据驱动方法,但真实雷达部署效果文中未充分说明。

Flow-aware Optimal Navigation in Unsteady Flows through Reinforcement Learning Figure 1
2026-07-16cs.RO

Flow-aware Optimal Navigation in Unsteady Flows through Reinforcement Learning

Andrea Maria Braghin, Nicolò Botteghi, Matteo Tomasetto, Andrea Manzoni, Gabriele Cazzulani

2026-07-16机器人生成模型强化学习

这篇论文针对机器人在风、洋流等非定常流场中难以依赖全局先验规划的问题,用 TD3 在参数化混沌双涡流中训练面向任意目标的导航策略,并比较位置、局部速度、涡量及短期记忆等仿生观测。结果显示,带记忆的速度感知总体表现最好,速度信息更利于省能,涡量更利于逼近目标;显式加入全局流场参数反而降低性能,说明隐式局部感知可能更稳健。

COLMAR: Cooperative View Policy Learning for Multi-Agent Active 3D Reconstruction Figure 1
2026-07-16cs.RO

COLMAR: Cooperative View Policy Learning for Multi-Agent Active 3D Reconstruction

Phu Pham, Damon Conover, Aniket Bera

Department of Computer Science, Purdue University 2 DEVCOM Army Research Laboratory

2026-07-16强化学习三维

COLMAR面向多机器人主动三维重建中视角重复、队形聚集导致预算浪费的问题,将视角分配建模为基于共享地图观测的参数共享PPO策略,并用覆盖增益、欠探索区域发现和碰撞安全等重建感知奖励引导协同;训练依赖TSDF反馈,3DGS仅用于后续评估。在GLEAM与Replica上,相比启发式和非协同基线最高提升54%重建精度、49%覆盖率,但真实动态场景和通信定位鲁棒性仍未充分验证。

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots Figure 1
2026-07-16cs.RO

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen, Jia Qi Yip

2026-07-16机器人视觉语言

论文针对单帧视觉难以感知机器人力、接触和部分本体状态的问题,提出 Kepler-Encoder:把视觉、本体、力/扭矩作为同等模态,用学习查询 cross-attention 融合,并以 masked cross-modal latent prediction 自监督训练。结果显示,评估时仅输入视觉,其 latent 在 RH20T 上比冻结 ViT 和视觉-only 控制更能恢复末端尤其力信息,可跨四种机器人,并可用预测误差做无训练异常状态监测;但单时刻力恢复绝对值仍较有限。

Improving Map Consistency in Graph-Based LiDAR SLAM Through Information-Aware Odometry and Retroactive Loop Closure Figure 1
2026-07-16cs.RO

Improving Map Consistency in Graph-Based LiDAR SLAM Through Information-Aware Odometry and Retroactive Loop Closure

Saurabh Gupta, Niklas Trekel, Louis Wiesmann, Cyrill Stachniss

All authors are with the University of Bonn, Center for Robotics. Cyrill, Stachniss is additionally with the Lamarr Institute for Machine Learning, under the Robotics Institute Germany (RIG)., can only exploit the constraints available in the graph. If, end to improve optimization scalability and efficiency [12].

2026-07-16机器人

这篇论文针对图优化 LiDAR SLAM 中“轨迹误差低但重访区域地图仍错位”的问题,提出面向 ICP 的实时几何信息矩阵估计、分层多分辨率回环检测,以及利用优化后位姿图补回漏检回环的 retroactive loop closure。实验显示其轨迹精度与现有方法相当或更好,同时在重访位置减少重复结构、提升局部地图一致性。

Layered Risk Mapping for Autonomous Patient Transport in Expeditionary Medical Facilities Figure 1
2026-07-16cs.RO

Layered Risk Mapping for Autonomous Patient Transport in Expeditionary Medical Facilities

Lorena Maria Genua, Sarvesh Prajapati, Damla Leblebicioglu, Taşkın Padır

Institute for Experiential Robotics, Northeastern University, Boston, Massachusetts, USA.

2026-07-16安全鲁棒

面向野战/疫情医疗设施中患者转运消耗 PPE、占用医护且增加感染风险的问题,论文将自主轮椅导航建模为多源风险规划任务,用 Noisy-OR 融合坡度、静/动态障碍和语义可通行性生成代价图。仿真中碰撞率由 73% 以上降至 32% 以下,障碍间距翻倍,并在商用电动轮椅的室内外任务中验证可行性。

Topology-Agnostic Mesh Reconstruction of Deformable Objects from Sparse Touch Figure 1
2026-07-16cs.RO

Topology-Agnostic Mesh Reconstruction of Deformable Objects from Sparse Touch

Everest Yang

2026-07-16三维

这篇论文针对无视觉、遮挡或黑暗中机器人只能获得少量触觉接触时,如何估计柔性物体完整形状的问题,提出用同一套置换不变的网格查询交叉注意力模型,从稀疏触点重建绳、布和三维软体的全网格,并用深度集成不确定性学习下一次触摸位置。实验在仿真中显示,重建误差相较 IDW 和 GPIS 等非学习基线约降低三分之二;主动触摸带来较小但稳定的额外收益,在遮挡严重和误差尾部更明显,但有视觉时收益基本消失。

VAMP-MR: Vector-Accelerated Motion Planning and Execution for Multi-Robot-Arms Figure 1
2026-07-16cs.RO

VAMP-MR: Vector-Accelerated Motion Planning and Execution for Multi-Robot-Arms

Philip Huang, Chenrui Gao, Jiaoyang Li

Philip Huang and Jiaoyang Li is with the Robotics Institute, Carnegie Mellon University, Pittsburgh, PA 15213, USA.

2026-07-16机器人规划控制

面向多机械臂在共享工位中难以快速生成安全轨迹的问题,VAMP-MR抓住碰撞检测这一贯穿建图、采样验证、机器人间避碰和轨迹shortcutting的主要瓶颈,将VAMP的CPU SIMD向量化前向运动学与球化几何碰撞检测扩展到多臂、附件和环境场景,可作为FCL/Bullet式检测模块的替换件。实验显示其在规划和后处理基准中带来约10到100倍加速,四臂任务平均可在1秒内生成运动,并改善长时程双臂装配的异步规划执行效率。

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability Figure 1
2026-07-16cs.RO

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability

Everest Yang, Skye Thompson, George D. Konidaris

2026-07-16机器人

面向手术牵拉中软组织状态高维、遮挡且观测稀疏的问题,论文用40个带噪顶点估计完整可变形网格:MLP预测PCA低维潜变量,并用平滑与边长约束增强几何合理性。二维仿真中,两步规划达到全状态oracle 98.1%的表现,但验证仍限于模拟,真实组织泛化文中未充分说明。

EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal Figure 1
2026-07-16cs.RO

EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal

Alex Brandes, Haig Conti Georges Sajelian, Manthan Patel, Dominik Hollidt, Chenhao Li, Matthias Heyrman, Oliver Hausdoerfer, Manuel Kaufmann, Xi Wang, Jonas Frey, Angela P. Schoellig, Christian Holz, Marc Pollefeys, Marco Hutter

2026-07-16模仿学习

针对类人机器人在崎岖、非结构化地形中缺少带场景上下文的人类示范数据这一瓶颈,EgoHTR将穿戴式动捕、第一视角Aria传感器与便携3D扫描结合,构建厘米级场景对齐的4D人-地形重建流程与数据集。数据包含7类场景、55段序列和约15万帧,并在动捕真值上显示优于现有4D人-场景重建基线的精度,还用于训练感知式运动策略并部署到Unitree G1。

Joint On-and-Off Policy Learning for Vision-and-Language Navigation Figure 1
2026-07-16cs.RO

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

All authors are with Joy Future Academy. † Corresponding author.

2026-07-16机器人视觉感知强化学习

该文针对视觉语言导航中模仿学习易受分布偏移影响、纯强化学习又难覆盖推理时错误状态的问题,提出 JOP-VLN,将专家轨迹的离策略模仿学习与在线 GRPO 探索联合训练,并用高熵轨迹采样和错误优先排序提升纠错效率。实验在 VLN-CE R2R Val-Unseen 达到 69.9% 成功率、RxR 达到 68.0%,其中 R2R 报告为新的 SOTA。

Reverse to Advance: Teleoperation-Cost Effective Hard Policy Learning from Reversed Easy Tasks Figure 1
2026-07-16cs.RO

Reverse to Advance: Teleoperation-Cost Effective Hard Policy Learning from Reversed Easy Tasks

Qiyuan Qiao, Ge Yuan, Can Wang, Dong Xu

The University of Hong Kong

2026-07-16强化学习

针对高精度机器人操作中正向示教昂贵且噪声大的问题,论文利用“完成难、反向拆解易”的任务非对称性,提出 Auto-E2H:自动交替执行难/易策略收集反向轨迹,再经运动学与 critic 优势过滤后迭代训练正向策略。仿真与真机结果显示,其在较少硬任务遥操作下提升成功率、数据效率和训练稳定性。

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation Figure 1
2026-07-16cs.RO

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation

Shivansh Patel, Kaifeng Zhang, Sanjay Pokkali, Svetlana Lazebnik, Yunzhu Li

Columbia University

2026-07-16机器人

这篇论文针对机器人操作中柔性物体仿真难以兼顾物理一致性、材料未知和长时稳定性的问题,提出 PGRD:先优化弹簧-质点物理骨架,再用滑窗 Transformer 预测速度残差而非位置残差,以降低误差累积。实验覆盖绳、纸、软玩具、旗帜、掸子等真实物体,显示其轨迹预测优于纯物理和纯学习基线,并可用于 MPPI 操作规划、语言条件目标规划和基于 3D Gaussian Splatting 的交互式视频预测。

Stress-Sharing: A Bio-Inspired Approach to Decentralized Fault Repair in Modular Spacecraft Figure 1
2026-07-16cs.RO

Stress-Sharing: A Bio-Inspired Approach to Decentralized Fault Repair in Modular Spacecraft

Sidhdharth D. Sikka, Yue Shen, Shaoshuai Mou

Purdue University, West Lafayette, IN, USA

2026-07-16机器人

面向长期在轨任务中模块化航天器受损后难以依赖人工维修、冗余或预案重构的问题,论文提出受生物伤口愈合启发的去中心化 stress-sharing 策略:局部求救信号引导模块在保持连通安全的晶格枢转约束下填补断裂,并局部回溯恢复形状。PyBullet 仿真显示,在最高 30% 随机故障下仍可将约 80% 以上幸存模块聚成单一连通体,且规模越大整合效果越好。

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment Figure 1
2026-07-16cs.RO

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

University of Illinois Urbana-Champaign, Texas A&M University, University of California, Irvine

2026-07-16机器人

论文针对VLA用行为克隆微调时会覆盖预训练VLM语义表征、且语言头与动作头在不同观测上受监督导致错位的问题,提出Anchor-Align:用冻结VLM逐层蒸馏锚定表征,并把连续动作转成离散运动语言标签,在同一机器人观测上联合监督语言与动作。方法在xArm7实机上将两类架构成功率从28%/37%提升到54%/60%,并在LIBERO-PRO、LIBERO-Plus和CALVIN中改善OOD鲁棒性与长程控制。

Ego-Dynamics-Augmented World Model for Autonomous Driving with Zero-Shot Cross-Chassis Adaptation Figure 1
2026-07-16cs.RO

Ego-Dynamics-Augmented World Model for Autonomous Driving with Zero-Shot Cross-Chassis Adaptation

Zhidong Wang, Jingsong Liang, Zirui Li, Zhan Chen, Han Yu, Chen Lv

Zhidong Wang is also with the Collaborative Initiative, Interdisciplinary Graduate Programme, Nanyang Technological, University, Singapore.

2026-07-16强化学习

这篇论文针对 BEV 自动驾驶世界模型把自车运动与场景动态混在一起建模、导致想象滚动和跨车型泛化受限的问题,提出 DynaDreamer:用物理约束的自车动力学编码器提取可识别底盘上下文,并同时调制世界模型先验和后验,在想象中继续传播该上下文。实验报告其相对最强基线在城市和高速场景成功率分别提升 28% 和 61%,未见底盘外推时优势达 73%。

WNOJ-LIO: A White-Noise-on-Jerk Motion-Prior EKF for High-Dynamic LiDAR-IMU Fusion Figure 1
2026-07-16cs.RO

WNOJ-LIO: A White-Noise-on-Jerk Motion-Prior EKF for High-Dynamic LiDAR-IMU Fusion

Junning Lyu, Qizhi Guo, Xia Ning, Tao Song, Shaoming He

2026-07-16机器人

本文针对高速机器人/车辆中 IMU 振动噪声会经由惯导传播污染点云去畸变和配准的问题,提出用解耦 WNOJ 运动先验驱动 EKF 预测,并把 IMU 改作高频观测更新,从而将连续时间 GP 先验引入递归 LIO。仿真和最高 208 km/h 赛车实测显示,其在加速度、角速度去噪、扫描去畸变和定位精度上优于 FAST-LIO 风格基线。

Min-Max Regret Task Allocation and Planning of Heterogeneous Multi-Robot System in Partially Known Environments Figure 1
2026-07-16cs.RO

Min-Max Regret Task Allocation and Planning of Heterogeneous Multi-Robot System in Partially Known Environments

Xinkai Liang, Huixuan Chan, Ying Liu, Yangxi Shi, Hao Fang

2026-07-16机器人规划控制学习理论

本文针对部分已知环境中异构多机器人执行时序逻辑任务时,探索未知资源与利用已知资源难以兼顾且规划复杂度易爆炸的问题,将任务分配表述为最小最大遗憾优化,并用区域绑定原子命题与带遗憾分支定界的扩展规划决策树来剪枝策略空间。实验显示其随机器人数量和类型接近线性扩展,可在数千机器人规模上快速求解,并优于 MILP 基线;但假设静态拓扑已知,动态未知环境仍未覆盖。

A Hybrid Sampling-Based Trajectory Planner with Game-Theoretic Guidance for Autonomous Racing Figure 1
2026-07-16cs.RO

A Hybrid Sampling-Based Trajectory Planner with Game-Theoretic Guidance for Autonomous Racing

Alexander Langmann, Frederico Pita de Araujo, Mattia Piccinini, Johannes Betz

Munich Institute of Robotics and Machine Intelligence (MIRMI), corresponding author:

2026-07-16规划控制

面向自动赛车中仅把对手视为动态障碍会导致保守、缺少阻挡意图的问题,论文将离线学习的α-势博弈交互模型嵌入采样式轨迹规划,通过在线梯度优化生成交互参考路径并作为代价偏置。Yas Marina高保真仿真显示,该方法能产生主动阻挡等防守行为,碰撞数由14降至6,平均位置收益从0.54提升到0.61,但实车泛化仍文中未充分说明。

Safe Overtaking for Autonomous Racing Using Hierarchical Optimization and Learning-Based Control Figure 1
2026-07-16cs.RO

Safe Overtaking for Autonomous Racing Using Hierarchical Optimization and Learning-Based Control

Hassan Jardali, Kai Yin, Lantao Liu

2026-07-16规划控制优化算法安全鲁棒

针对自动赛车超车中固定衰减离散 CBF 过于保守、且需按赛道调参的问题,论文将超车侧选择交给高层 MIQP,将动力学与安全约束交给 Frenet MPC-CBF,并用强化学习在线调节 CBF 衰减参数。仿真和缩比硬件实验显示,自适应策略在多赛道上获得最高综合成功率,保持名义安全约束满足且减少手工调参。

Design and Characterization of a Limb Encircling Actuator Figure 1
2026-07-16cs.RO

Design and Characterization of a Limb Encircling Actuator

Japmanjeet Singh Gill, Gray Cortright Thomas, Nikko Van Crey, Roberto Leo Medrano, Elliott J. Rouse

2026-07-16机器人

这篇论文针对下肢外骨骼执行器常侧向外凸或集中在腰背、影响日常穿戴的问题,提出环绕肢体横截面布置的 Limb-Encircling Actuator,并用无框电机、轻量结构和可预紧径向轴承布局进行实现与测试。原型质量 894 g,连续扭矩密度达 7.5 Nm/kg,但作者也发现即便性能较高,系统仍难以真正贴近身体,说明主要瓶颈在执行器尺寸与几何封装。

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains Figure 1
2026-07-16cs.RO

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains

Rwik Rana, Jesse Quattrociocchi, Christian Ellis, Nathan Tsoi, Garrett Warnell, Joydeep Biswas

The University of Texas at Austin, DEVCOM Army Research Laboratory

2026-07-16规划控制

面向高速越野 MPC,论文关注通用 FKD 车辆模型在具体平台上精度不足、而单地形专家模型又易失去泛化的问题。OptCar 用近期状态-动作历史生成动力学上下文,并结合少量实车数据与按地形辨识的合成高滑移样本微调。实车闭环结果显示,其在 6 m/s 和地形/载荷变化下显著降低跟踪误差,优势主要来自历史条件化与有针对性的数据补足。

Parsimonious disturbance-aware minimum-time planning with parametric uncertainty Figure 1
2026-07-16cs.RO

Parsimonious disturbance-aware minimum-time planning with parametric uncertainty

Martino Gulisano, Matteo Masoni, Marco Gabiccini

cle parameters: moment of inertia, centre-of-mass position, and aerodynamic drag

2026-07-16规划控制安全鲁棒

针对最小圈速规划常贴近轮胎极限、在扰动和车辆参数偏差下难以跟踪的问题,论文把状态扰动与转动惯量、质心位置、气动阻力等参数不确定性一并纳入概率约束收紧,并只在关键赛道段激活鲁棒约束以控算量。MPC蒙特卡洛测试显示,鲁棒参考以适度时间损失换来更高完赛/存活率和更小控制、饱和离散度。

Attitude Estimation Using Inertial and Barometric Measurements Figure 1
2026-07-16cs.RO

Attitude Estimation Using Inertial and Barometric Measurements

Melone Nyoba Tchonkeu, Soulaimane Berkane, Tarek Hamel

M. Nyoba Tchonkeu is with the Department of Computer Science and Engineering, University of Quebec in Outaouais

2026-07-16机器人

论文针对GNSS受限和高加速度飞行中IMU难以区分重力与惯性加速度、导致姿态估计失准的问题,提出利用气压高度补充垂直运动信息的姿态观测框架。核心在于将气压计与IMU、磁力计融入SO(3)几何观测器,分别给出级联Riccati方案和统一的SO(3)×R²非线性方案,并证明AGAS或LES收敛条件。仿真与真实飞行数据表明,气压辅助可在缺少常规速度传感器时提升轻量化姿态估计的可靠性。

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics Figure 1
2026-07-16cs.CV

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

The Hong Kong University of Science and Technology (Guangzhou), Jilin University

2026-07-16机器人

这篇论文针对长时程机器人中3D场景图“先全量构建再筛选”带来的感知饱和、语义噪声和延迟问题,提出JITOMA:用任务热图保留低成本休眠锚点,并在LLM解析具体意图后只激活相关局部子图进行密集描述和功能推理。作者还构建JITOMA-Bench评估动态任务切换,结果显示其能显著缩小活跃图规模、降低caption延迟,并在长时程多任务中保持较稳定处理时间。

Towards end-to-end optimization in multimaterial 3D printing Figure 1
2026-07-16cs.CE

Towards end-to-end optimization in multimaterial 3D printing

Xue-Ling Luo, Steven Yang, Jingye Tan, Robert F. Shepherd, Noy Cohen, Nikolaos Bouklas

2026-07-16优化算法三维

多材料3D打印的难点在于材料配比、结构拓扑与非线性本构需同时优化,传统试错和黑箱神经本构都难以高效嵌入有限元。本文将稀疏物理增强神经网络转化为显式、可符号微分的组分相关超弹性模型,并结合FEniCSx伴随法做端到端拓扑与材料分布优化。在软体夹爪案例中,该流程实现了接触各向异性调控,并在拉伸失效约束下联合优化手指形状和材料梯度。

Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation Figure 1
2026-07-16cs.RO

Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation

Lingxiao Guo, Huanyu Li, Guanya Shi

Carnegie Mellon University, Website: https://wanda.lecar-lab.org, demonstration by scalable data generation. To this end, we introduce WANDA: learning open-

2026-07-16机器人强化学习

本文针对开放世界移动操作数据采集成本高、单任务常需大量示范的问题,提出 WANDA:从一次真实示范中重建场景与物体交互轨迹,再通过接触片段重排、全身运动规划、纠偏状态扩展和生成式 3D 世界合成多样训练数据。实验显示,其在仿真中较遥操作基线约有 50 倍样本效率,在真实 16 个环境、5 个长程任务上取得 54.8% 平均进度,并展示跨机体零样本迁移。

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models Figure 1
2026-07-16cs.RO

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

Luyuan Jia, Yinfeng Yu

2026-07-16机器人

这篇论文针对现有 LLM 零样本目标导航把物体与区域直接做“平面”关联、探索盲目且语义不准的问题,提出 HRO:先由已观测物体推断房间类型,再按目标与房间语义亲和度选择 frontier,最后执行路径规划。结果显示其在 HM3D/Gibson 上取得 53.0%/84.0% SR,优于 L3MVN 等基线,说明结构化的房间到物体推理比单纯换更强模型更关键。

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS Figure 1
2026-07-16cs.RO

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS

Fang Xu, Tianyu Zhou, Ruitong Tian, Md Jahidul Islam, Jing Du

Construction (ICIC) lab, Dept. of Civil and Costal Engineering, Weil Hall, University of Florida, Md Jahidul Islam, Assistant Professor, RoboPI Lab, Dept. of Electrical, and Computer Engineering, University of Florida, (ICIC) Lab, Dept. of Civil and Costal Engineering, 460F Weil Hall, University of Florida, Gainesville, FL 32611 (corresponding author), operator’s visual processing center, relying solely on visual

2026-07-16三维

面向狭窄、遮挡且高延迟的水下ROV遥操作,论文提出ROS-Unity框架,将3DGS驱动的动态外视角DAVS与躯干振触觉避障提示结合,把全局空间规划和局部边界提醒分离。30人重复测量实验显示,触觉在低延迟下改善路径贴合,而3DGS外视角在0.5至1.0秒延迟下更能减少碰撞、提升完成效率;fNIRS还表明其可维持前额叶执行控制,避免普通第一视角在关键延迟下出现认知脱离。

A Bayesian framework for the uncanny valley in humanoid robot design Figure 1
2026-07-16cs.RO

A Bayesian framework for the uncanny valley in humanoid robot design

Shimon Honda, Rin Shibano, Hideyoshi Yanagisawa

Department of Mechanical Engineering, Graduate School of Engineering, The University of Tokyo, Tokyo, Japan.

2026-07-16机器人

针对人形机器人设计中“恐怖谷”经验规则难以转化为可优化变量的问题,论文提出层级贝叶斯生成模型,把亲和感解释为类别条件惊讶的后验加权结果,并将类别模糊、跨模态不一致、预测不确定性和观测不确定性形式化。仿真显示模糊与外观-运动错配会降低亲和感;真人形变图像实验表明,提高观测不确定性可缓和中等拟人度处的熟悉度下降,低预测不确定性则提升机器人外观评分。

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI Figure 1
2026-07-16cs.RO

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

2026-07-16机器人

这篇论文针对具身智能训练越来越依赖大规模 GPU 并行仿真、但物理可信度与可复现性缺少系统评估的问题,提出 GPUSimBench,从吞吐、显存、斜面实物对齐和确定性评测 Isaac Lab、Genesis、MJX 等平台。主要洞察是 GPU 批量执行会在相同初始条件下产生跨运行和跨环境差异,并随并行规模进入不同随机性区间,说明盲目扩展可能损害可复现机器人学习。

Power from Potential: A Survey of Electrostatic Actuators for Haptics Figure 1
2026-07-16cs.RO

Power from Potential: A Survey of Electrostatic Actuators for Haptics

Ahad M. Rauf, Ran Zhou, Eric Acome, Madeline Balaam, Sean Follmer, Teng Han, Craig Shultz, Daniel Leithinger

2026-07-16机器人

面向可穿戴、贴肤和环境嵌入式触觉接口,传统电机、气动和热响应执行器在体积、噪声、功耗与响应速度上受限。本文系统梳理303篇高压静电执行器触觉研究,将其归纳为静电可切换粘附、介电弹性体、软电液执行器和电动泵四类,并比较带宽、力密度、尺度化与触觉模态适配性。结果指出HVEA在轻薄、静音、低电流、高空间分辨率和自感知集成上具优势,但商业可得性、制造控制、安全与人体工学仍是落地瓶颈。

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration Figure 1
2026-07-16cs.RO

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

Renmin University of China, Beijing Normal University

2026-07-16机器人数据集/基准

HRIBench针对现有VLA/机器人基准偏重孤立操作、缺少人机交互结构建模的问题,提出以可执行scenario scripts显式描述角色、时序依赖、协调约束和人类行为分布,并按Instructor、Collaborator、Intruder三类角色构建13个任务、650余评测episode及同步性、响应性、协议遵守和安全指标。实验显示GR00T、π0.5和ACT在协作场景尤其干扰场景中表现明显不足;使用HRIBench微调可提升协作表现,Sim+Real训练将GR00T N1.5真实任务成功率由0.10提高到0.43。

Autonomous UAV Route Planning for Coverage Maximization in Environmental Monitoring: A Systematic Literature Review Figure 1
2026-07-16cs.RO

Autonomous UAV Route Planning for Coverage Maximization in Environmental Monitoring: A Systematic Literature Review

Sebastian Jouannet-Contreras, Carola Figueroa-Flores

2026-07-16规划控制

面向环境监测的无人机覆盖规划需要同时权衡覆盖面积、能耗、障碍与复杂几何环境。本文不是提出新规划算法,而是构建基于 PRISMA 的系统综述方案,并初步筛选 2015–2026 年 Scopus 与 Web of Science 文献:562 条记录去重后筛得 247 篇进入全文评估。初步洞察是研究集中在覆盖建模、多机协同和能量优化,但天气、不确定性、复杂障碍与真实部署验证仍不足,仿真到现实的差距较突出。

SPINE: Bridging the Cyber-Physical Gap with Agentic AI Figure 1
2026-07-16cs.AI

SPINE: Bridging the Cyber-Physical Gap with Agentic AI

Minkyu Ham, Dongho Kim, Chan Lee, Jiayi Wang, Min Jun Kim, Yixi Zhang, Guo Ye, Jihai Zhao, Soyeon Park, Han Liu

Department of Statistics and Data Science, Northwestern University, Department of Computer Science, Northwestern University

2026-07-16机器人

论文针对具身智能落地中“会规划但难上线”的硬件软件集成瓶颈,提出 SPINE:用机器人专属配置档案、跨会话故障记忆、受限安全执行和实机遥操作验证,把通用代码代理改造成面向双臂机器人部署调试的流程化系统。实验中,SPINE 在 DOBOT 场景把可运行成功率从 75% 提升到 100%,平均上线时间从 16分45秒降至 13分47秒;在 AgileX PiPER 上修复 10/10 个植入故障,略高于专家基线的 9/10。

2026-07-15

41 篇
DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation Figure 1
2026-07-15cs.RO

DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation

Yu Fang, Wanxi Dong, Jiaqi Liu, Yue Yang, Mingxiao Huo, Yao Mu, Huaxiu Yao, Li Erran Li, Daniel Szafir, Mingyu Ding

University of North Carolina at Chapel Hill, Carnegie Mellon University, Shanghai Jiao Tong University

2026-07-15机器人强化学习

这篇论文针对机器人强化学习中稀疏终局奖励难以做信用分配、真实失败数据又难规模化获取的问题,提出 DenseReward:在仿真中按 Reach/Grasp/Lift/Move/Place 阶段合成碰撞、漏抓、掉落等物理失败轨迹,并用视觉和语言预测逐帧任务进展奖励。实验显示其在仿真和真实操作的稠密奖励预测上优于通用 VLM 与既有机器人奖励模型,并可为 MPC 和强化学习提供有效引导。

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale Figure 1
2026-07-15cs.LG

TerraZero: Procedural Driving Simulation for Zero-Demonstration Self-Play at Scale

Zhouchonghao Wu, Akshay Rangesh, Weixin Li, Wei-Jer Chang, Zachary Lee, Tim Wang, Wei Zhan

2026-07-15模仿学习

针对真实驾驶日志长尾场景稀缺、现有仿真器难同时兼顾速度与交通规则/多主体保真度的问题,TerraZero把日志仅作为地图来源,用程序化交通参与者、信号与动力学/奖励随机化生成训练场景,并以高速C仿真支撑零示范自博弈RL。结果显示其在InterPlan长尾榜领先,在nuPlan val14安全指标突出,并在Waymo仿真智能体真实性上优于其他无示范方法。

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models Figure 1
2026-07-15cs.RO

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences, School of Artificial Intelligence, University of Chinese Academy of Sciences

2026-07-15生成模型强化学习

这篇论文针对世界动作模型中动作表示与视频生成先验不匹配、又缺少连续运动信息的问题,提出用光流视频作为统一动作表示。核心洞察是光流既是像素级运动信号,又能以类 RGB 视频形式接入预训练视频生成器,从而在同一双流扩散框架中支持动作预测和动作条件世界建模,并可利用无动作标注视频预训练。实验显示,FlowWAM 在 RoboTwin 上达到 92.94%/92.14% 成功率,在 WorldArena 上 EWMScore 为 63.71。

ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning Figure 1
2026-07-15cs.RO

ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

Zhao Yang, Yinan Shi, Mingyuan Yao, Wenyao Xue, Yawei Jueluo, Longjun Liu

2026-07-15生成模型强化学习

ChunkFlow针对VLA/生成式机器人策略中动作分块带来的边界抖动:相邻chunk在重叠区预测不一致,会破坏长时序执行稳定性。其核心是把chunk划分为冻结、可编辑和未来区,在执行端确定性融合,并在训练中加入缝合一致性、一二阶连续性损失、历史扰动与AWAC微调,使策略学到可融合的边界结构。实验在CALVIN、LIBERO和真实机器人上显示更好的成功率-平滑性折中,LIBERO达93.4%,真实任务9/10成功,同时保持约4.43ms低延迟。

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality Figure 1
2026-07-15cs.RO

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

Artificial Intelligence and Robotics Lab, Department of Aerospace Engineering, Indian Institute of Science, India.

2026-07-15强化学习安全鲁棒

针对越野导航中光照剧烈变化、地形复杂和传感器退化导致单一 RGB 或刚性多模态方法失效的问题,MAMMOTH 将 RGB、热成像、3D 点云和自车速度用稀疏 MoE 融合,并通过模态 dropout 训练提升缺失模态下的可部署性;同时用扩散策略联合生成轨迹和基于 IMU 的可通行性启发以偏好更平滑安全的路径。实车越野与夜间实验显示,其在避障、地形感知规划和缺失模态泛化上优于基线。

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning Figure 1
2026-07-15cs.RO

ExToken: Structured Exploration for Efficient Vision-Language-Action Reinforcement Fine-tuning

Yilun Kong, Yunpeng Qing, Guozheng Ma, Haoyu Wang, Li Shen, Zhi Hou, Dacheng Tao

Nanyang Technological University, Zhejiang University, Sun Yat-sen University *, Sun Yat-sen University * Corresponding author.

2026-07-15视觉语言视觉感知

论文针对 VLA 强化微调中交互成本高、随机探索易陷入动作模式坍缩的问题,指出轨迹多样性比 rollout 数量更影响样本效率。ExToken 从离线示范的视频表征聚类中提取离散行为 token,引导策略按不同模式探索,并用状态条件 token 选择器衔接训练探索与确定性部署。模拟和真实操作实验显示其能提升覆盖度、加快收敛并在受限交互预算下提高任务表现。

UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies Figure 1
2026-07-15cs.RO

UR-VC: Unsupervised Robotic Value Correction for Time-Derived Progress Proxies

Lirui Zhao, Modi Shi, Li Chen, Qi Liu, Ping Luo, Hongyang Li

2026-07-15机器人

论文针对机器人示范中常用“归一化时间=任务进度”的偏差:接触丰富操作会滑移、回退,时间标签却单调增加。UR-VC的核心洞察是跨轨迹相似状态会在不同时间出现,因此用SigLIP-2检索其他 episode 的相似帧并聚合其时间标签,离线、无需训练地校正进度值。在双臂衣物铺平折叠实验中,校正信号能恢复局部退步和非均匀进展,并用于VLA优势标签后带来真实机器人成功率的正向趋势,但具体增益幅度和来源仍需更多说明。

Unveiling Complex Collective Behaviors from Simple Rewards Figure 1
2026-07-15cs.RO

Unveiling Complex Collective Behaviors from Simple Rewards

Yize Mi, Jianan Li, Liang Li, Shiyu Zhao

2026-07-15强化学习

这篇论文关注多智能体强化学习中“简单奖励为何会涌现复杂群体行为”的可解释性问题,提出从自我观测到个体行为再到群体行为的 EEC 框架,并用 ARM 显示策略隐含学习环境几何场。结果在形状装配和捕食-逃逸任务中表明,机器人会把未占据目标区域或捕食者 Voronoi 边界作为收敛目标,且 ARM 的空间梯度和距离分析支持这一解释。

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops Figure 1
2026-07-15cs.RO

PixelLoop: Shortcut Topological Navigation with Pixel-Level Loops

Sarthak Chittawar, Vansh Garg, Aditya Vadali, Krish Pandya, Rohit Jayanti, Sourav Garg, Madhava Krishna

The authors acknowledge the support of Ati Motors for this project. † {\dagger} Corresponding Author. 1 Robotics Research Center, IIIT-Hyderabad, India

2026-07-15机器人

论文针对拓扑视觉导航中仅按轨迹顺序连边会错过物理近路、导致任意起终点规划绕远的问题,提出在像素级相对3D拓扑中直接做闭环,将几何对应像素以零成本边连接,从而改变规划连通性并生成更细的代价图,而非只做SLAM式位姿校正。仿真中相较图像级基线成功率和SPL绝对提升超过35%,并在真实移动机器人上验证了可用性。

Autonomous Tracking and Terminal Guidance of Moving Targets for Fixed-Wing UAVs Figure 1
2026-07-15cs.RO

Autonomous Tracking and Terminal Guidance of Moving Targets for Fixed-Wing UAVs

Wei-Hao Liou, Teng-Hu Cheng

2026-07-15视觉感知

针对固定翼无人机难以在机动受限、视场受限和目标运动未知条件下持续跟踪并完成末端命中的问题,论文将YOLO视觉检测、UKF状态估计、带CBF自遮挡约束的NMPC盘旋跟踪,以及四元数BPNG末制导整合为三阶段框架。Gazebo/PX4高保真仿真显示,该系统能保持视觉接触、满足飞行与云台约束,并实现较精确的末端撞击角控制,但结果仍限于仿真验证。

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning Figure 1
2026-07-15cs.RO

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano

2026-07-15强化学习优化算法安全鲁棒

这篇论文针对安全强化学习中约束层会过度限制探索、拖慢机器人策略学习的问题,改造 ATACOM 安全层:只在动作朝约束边界移动时启用缩放,远离边界的动作保持不变。仿真中的 KUKA/平面气动曲棍球和四旋翼任务显示,ATACOM-DC 在训练全程维持低约束违规成本,同时通常获得更快学习曲线和接近或优于原 ATACOM 的任务表现。

No Figure
2026-07-15cs.HC

Practical Judgment, Virtue, and Intuition in the Use of Opaque AI-Enabled Systems

Nathan G. Wood, Andrew P. Rebera

2026-07-15机器人

针对不透明、可能具自主性的 AI 系统在军事等高风险场景中带来的可预测性、责任归属和人类控制难题,本文不依赖单纯可解释性技术,而提出以实践判断、德性与直觉作为部署治理资源。主要结果是论证即便系统机理无法完全理解,具备良好训练和最低功能认知的人类仍可更负责任地使用此类系统,但文中未充分说明可操作评估与实证增益。

Globalized Constrained Stein Variational Inference for Diverse Feasible Robot Motion Planning Figure 1
2026-07-15cs.RO

Globalized Constrained Stein Variational Inference for Diverse Feasible Robot Motion Planning

Jiayun Li, Georgia Chalvatzaki

PEARL Lab, Dept. of Computer Science, TU Darmstadt. 2 Hessian.AI, Darmstadt, Germany. 3 Robotics Institute Germany (RIG).

2026-07-15机器人规划控制

这篇论文针对机器人运动规划中“只给单一路径”难以应对多模态选择和严格可行性约束的问题,提出 SteinSQP:把 Stein 粒子推断与 SQP 结合,在核空间中直接处理线性化等式/不等式约束,并用适合 GPU 的矩阵自由原始-对偶求解和集成级 merit 函数保持多样性。五个受约束规划任务中,该方法生成完全可行且多样的运动集合,相比一阶 Stein 基线和串行多起点 NLP 收敛更稳、批处理求解更快。

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning Figure 1
2026-07-15cs.RO

Vision-Based Dribbling for Humanoid Soccer via Privileged Representation Learning

Flavio Maiorana, Valerio Spagnoli, Eugenio Bugli, Flavio Volpi, Daniele Affinita, Vincenzo Suriani, Daniele Nardi, Luca Iocchi

2026-07-15机器人视觉感知

这篇论文针对人形足球带球中视觉遮挡、球速变化和对手干扰使传统“检测加滤波再控制”链路难以服务控制的问题,提出用特权表示学习训练时序深度编码器,并将其嵌入强化学习策略,实现无需显式状态估计的视觉闭环带球。在 Booster T1 仿真中,无障碍成功率 100%,静态障碍 96%,但主动抢球对手仅 46%,说明主要瓶颈仍是动态对抗下的鲁棒控制,且结果尚未实机验证。

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference Figure 1
2026-07-15cs.RO

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

Peking University, PrimeBot Research Institute

2026-07-15机器人规划控制

这篇论文针对VLA模型在Jetson等低功耗板载设备上推理慢、控制频率低的问题,指出普通异步推理会带来感知与执行错位及反应延迟。Jetson-PI的核心是用已提交动作预测未来环境表征,让动作专家面向执行时刻规划,并结合置信度调度与llama.cpp系统优化。实验显示其在Jetson Orin上较PyTorch和vla.cpp分别提升8.66倍、5.41倍控制频率,LIBERO成功率较VLASH高14.8%。

Instance-Enriched Semantic Maps for Visual Language Navigation Figure 1
2026-07-15cs.RO

Instance-Enriched Semantic Maps for Visual Language Navigation

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

2026-07-15机器人

针对视觉语言导航中2D语义图缺少实例和高度信息、3D场景图存储开销大的问题,论文提出实例增强2.5D语义地图,用开放词汇全景分割保留小物体和垂直结构,并为实例加入房间上下文、属性描述与LLM多专家查询融合。实验显示其较3D基线AUC提升超27%,目标检索提升超17%,导航成功率提升超23%,同时存储减少约96%。

Streamlining stereo differentiable rendering for marker-free real-time tracking of surgical robots Figure 1
2026-07-15cs.RO

Streamlining stereo differentiable rendering for marker-free real-time tracking of surgical robots

Yanghe Hao, Martin Huber, Christos Bergeles, Tom Vercauteren

2026-07-15机器人视觉感知

这篇论文针对手术室中标记点易被遮挡、机器人部件需动态重定位导致连续相机到机器人位姿估计困难的问题,将 stereo differentiable rendering 的 roboreg 扩展到在线跟踪:用跨帧顺序优化和运动自适应参数保持时序收敛,并以 CUDA 多流和 CUDA graph 加速分割与优化。在自采动态数据上,1080p 达到 30 fps;静态标定误差为 1.7 cm/0.6°,动态 27460 帧平均 3D 误差 1.2 cm,遮挡场景 1.53 cm,并较 FoundationPose 更准且约 6 倍更快。

Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs Figure 1
2026-07-15eess.IV

Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs

Vlad Niculescu, Lorenzo Lamberti, Francesco Conti, Luca Benini, Daniele Palossi

2026-07-15优化算法

纳米无人机受算力、存储和功耗限制,视觉 CNN 上机部署通常依赖繁琐手工调优。本文围绕 Crazyflie 2.1/GAP8,将 PULP-Dronet 的训练、8 位量化、tiling、代码生成和闭环评测自动化,并改进飞控集成。结果在保持约 90% 分类精度下,内存减半、推理提速 1.6 倍,室内避障、自由飞行和 90 度转弯循迹均优于手工基线,计算功耗低于整机 1.6%。

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors Figure 1
2026-07-15cs.RO

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

School of Computer Science, Wuhan University, Institute of Automation, Chinese Academy of Sciences

2026-07-15视觉语言视觉感知

本文针对VLA机器人策略中“干净输入正常、视觉触发后长时序失控”的后门风险,指出BadVLA和INFUSE等攻击会形成注意力引导、空间紧凑且可因果验证的内部足迹。TrustVLA利用干净校准集监测逐层逐token的Dirichlet证据演化,定位可疑支撑并局部修复图像;在OpenVLA/LIBERO和π0.5迁移实验中降低攻击成功率,同时基本保持干净任务性能。

Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel Figure 1
2026-07-15cs.RO

Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel

Niccolò Caselli, Salvatore Lo Sardo, Francesco Massafra, Ippokratis Pantelidis, Samuele Punzo, Sathya Kamesh Bhethanabhotla

University of Amsterdam

2026-07-15强化学习规划控制

这篇论文针对 LeWorldModel 在长时程目标条件控制中扁平 CEM 规划易受模型误差累积和搜索难度影响的问题,提出冻结低层 LeWM、只增加高层潜在宏动作与子目标规划的 Hi-LeWM。核心洞察是层级本身并不保证收益,未约束的高层搜索会选到训练分布外、低层难以执行的子目标;将搜索限制在数据支持的宏动作附近后,在 PushT 中期和最长距离上分别较扁平 LeWM 提升 11.3% 和 14.7%。

Edge-Aware Thermal Infrared UAV Swarm Tracking Figure 1
2026-07-15cs.CV

Edge-Aware Thermal Infrared UAV Swarm Tracking

Yu-Hsi Chen

The University of Melbourne

2026-07-15视觉感知

本文针对热红外无人机蜂群中小目标易遮挡、运动突变且边缘设备算力受限的问题,提出以自适应运动学卡尔曼滤波为核心的在线跟踪流程,通过状态相关运动建模、瞬时误检抑制和预测滑行提升轨迹连续性。BSB实验显示其在HOTA、MOTA、IDF1上小幅优于BoT-SORT基线,但FPS由132降至约95,精度增益较小且部分来源仍需进一步验证。

A Bearing-Strength Method for Motion Estimation of Unknown Energy Emitters Figure 1
2026-07-15cs.RO

A Bearing-Strength Method for Motion Estimation of Unknown Energy Emitters

Haoyu Chen, Zian Ning, Yin Zhang, Shiyu Zhao

2026-07-15机器人

本文面向单个被动传感器追踪未知发射功率的运动光源、声源或无线电源,动机是传统 bearing-only 估计要求传感器横向机动,常与无人机追踪等任务冲突。核心思路是把方位与接收强度联合建模,并将未知功率扩展为状态,通过伪线性 Kalman 滤波利用强度对径向距离的物理约束。理论分析表明该方法不再需要横向运动条件,真实光源实验也验证了估计效果与可观测性结论。

Infra-Swarm: Robust Vision-Based Multi-Robot Swarming via Near-Infrared Spectral Vision Figure 1
2026-07-15cs.RO

Infra-Swarm: Robust Vision-Based Multi-Robot Swarming via Near-Infrared Spectral Vision

Haoyu Chen, Qijin Li, Wanyu Xiang, Xiuxiu Lin, Zian Ning, Shiyu Zhao

2026-07-15机器人视觉感知安全鲁棒

针对无线集群受带宽竞争限制、传统视觉又易受光照和算力约束的问题,Infra-Swarm让每个机器人用940nm近红外光源和四个窄带灰度相机,通过光斑方位与强度直接估计邻居3D位置,并用亮度调制承载简单语义通信。实验显示其可滤除99.2%环境光干扰,测距平均误差2.8cm,单帧处理约10ms,五机器人编队间距误差低于5cm。

Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences Figure 1
2026-07-15cs.RO

Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences

Taehyung Kim, Gwangmo Lee, Minjun Chang, Sunghyun Lim, Jongeun Choi

2026-07-15机器人强化学习

面向机器人规模化部署,论文指出逐用户对齐受偏好稀疏、噪声和验证成本限制,而单一共享策略又会抹平少数偏好。其核心是 PREC:先用跨用户轨迹自监督学习共享编码器,再用 leaky EM 将用户聚成偏好一致的少数簇,并为每簇学习代表性奖励和策略。仿真连续控制实验显示,PREC 的聚类更贴近真实偏好,在稀疏和噪声反馈下提升三类社会福利指标,并优于共享策略及逐用户基线。

Model-Based Diffusion Optimal Control for Multi-Robot Motion Planning Figure 1
2026-07-15cs.RO

Model-Based Diffusion Optimal Control for Multi-Robot Motion Planning

Zhilin He, Yorai Shaoul, Jiaoyang Li

2026-07-15机器人生成模型规划控制

这篇论文针对连续空间多机器人规划中动态可行性、硬碰撞约束与组合规模同时存在的问题,提出无需示范数据的 MDOC:用已知动力学下的模型化扩散进行采样,并在扩散 rollout 中嵌入 CBF 约束投影,再结合 CBS 处理机器人间冲突。仿真显示其在成功率、轨迹平滑度、采样效率和计算时间上优于代表性基线,且保持无碰撞,但增益在更复杂真实动力学中的来源仍需进一步验证。

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction Figure 1
2026-07-15cs.CV

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction

Yameng Zhang, Zhongyu Chen, Dianye Huang, Xiangyu Chu, K. W. Samuel Au, Zhongliang Jiang

2026-07-15三维安全鲁棒

针对自由手三维超声在长轨迹扫描中探头位姿易累积漂移的问题,论文提出“全局视觉引导、局部超声细化”的多模态框架:双相机提供稳定全局轨迹,B-mode 序列提取解剖相关运动线索,并用跨模态残差与多尺度位姿损失抑制漂移。在 FUSION-J/L 上平均漂移降至 1.67/1.29 mm,较双相机基线提升 16.5%/27.1%,体内前臂动脉重建 Hausdorff 距离为 1.58 mm。

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance Figure 1
2026-07-15cs.RO

StratMamba: Strategic and Reactive Stream Partitioning for Path-Efficient LiDAR-Based Obstacle Avoidance

Hung-Chieh Wu, Xiaopan Zhang, Kasra Sinaei, Ryan Abnavi, Kasun Weerakoon, Christopher Bradley, Seyed Fakoorian, Jiachen Li, Donald Ebeigbe

2026-07-15机器人

针对移动机器人在复杂障碍环境中既要快速避障又要保持长时目标规划、而 LSTM/Transformer 成本较高的问题,StratMamba 将 Mamba 状态划分为快衰减的 LiDAR 反应流和慢衰减的目标规划流,并在同一 PPO 框架下比较编码器。实验显示其在 IsaacLab、Gazebo 和 Go1 实机中降低超时率、提升路径效率与速度,对长 LiDAR 范围更稳健。

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation Figure 1
2026-07-15cs.RO

VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation

Mohan Liu, Zhihao Gu, Xuanyu Chen, Haitian Zhang, Kaimin Mao, Yan Wu, Wei-Yun Yau, Lin Wang

EmPACT Lab, Nanyang Technological University, Singapore, Institute for Infocomm Research (I2R), A*STAR, Singapore

2026-07-15机器人三维

VistaVLA针对现有VLA依赖2D观测、难以显式处理空间布局和几何约束的问题,引入由多视角视觉语言特征提升得到的语义3D Gaussian表示,并用Merge-then-Query将稠密高斯压缩为少量可接入策略的3D上下文token。实验显示其在仿真和真实桌面操作中优于2D/3D基线,真实七任务成功率提升22.8个百分点,OOD任务较VLA-Adapter提升30.0个百分点。

Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference Figure 1
2026-07-15cs.RO

Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

Yuzhou Wu, Yuxin Zheng, Muchun Niu, Yishan Yang, Tianhao Liu, hanwen kang, Jiajian Jing, Linfeng Zhang, Chuan Wen

2026-07-15视觉语言视觉感知

这篇论文针对VLA机器人操作模型在闭环控制中推理延迟过高的问题,指出相邻帧视觉token高度相似、扩散/flow策略多步更新低秩相关是主要时间冗余来源。方法上只刷新动态区域token,并将动作生成压缩为2步flow推理。LIBERO、RobotWin和真机实验显示端到端加速超过2倍,最高成功率98%,但长时程和高动态任务仍文中未充分说明。

Flatness-Preserving Residual Learning for Real-Time Tight Quadrotor Formation Flight Figure 1
2026-07-15cs.RO

Flatness-Preserving Residual Learning for Real-Time Tight Quadrotor Formation Flight

Pei-An Hsieh, Fengjun Yang, Nikolai Matni, M. Ani Hsieh

GRASP Laboratory, University of Pennsylvania, PA, USA

2026-07-15机器人

针对紧密四旋翼编队中下洗等气动耦合会破坏跟踪、甚至引发碰撞的问题,论文将残差动力学限制为依赖机群位置和速度的物理结构,使学习模型仍保持微分平坦性,并据此构造带前馈补偿的反馈线性化控制器。仿真与 Crazyflie 实验显示,该方法较标称控制平均误差降低 31%,性能接近 NMPC,但计算量约低一个数量级,且只需少于 30 秒训练数据即可在 5ms 回路运行。

DiffRadar: Differentiable Physics-Aware Radar SLAM with Gaussian Fields Figure 1
2026-07-15cs.RO

DiffRadar: Differentiable Physics-Aware Radar SLAM with Gaussian Fields

Gaurav Bagwe, Xiaoyong Yuan, Yongji Wu, Lan Zhang

Clemson University, Clemson University Clemson South Carolina USA

2026-07-15三维

这篇论文针对雷达 SLAM 在弱光、恶劣天气和隐私场景中有用但传统热图匹配易丢失几何连续性、忽略各向异性与多普勒物理的问题,提出用各向异性高斯场和可微雷达前向渲染直接在 RA/DA 信号域联合优化位姿与地图。在 Radarize 和退化压力测试中,文称轨迹误差最高降至约 1/6,走廊场景提升超过 20 倍,地图一致性翻倍,并以 70 FPS 实时运行。

Contract-Grounded Behavior Tree Synthesis via Coding Agents Figure 1
2026-07-15cs.RO

Contract-Grounded Behavior Tree Synthesis via Coding Agents

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

Nuclear and Applied Robotics Group, Department of Mechanical Engineering, The University of Texas at Austin

2026-07-15机器人

论文针对自然语言生成机器人行为树时容易调用不存在技能、参数或控制结构不合法的问题,提出让编码代理先通过机器人侧 MCP 服务读取显式“契约”,再生成并由运行时验证行为树。创新点在于把能力约束和执行权限放回机器人端,而非依赖提示词作者。实验在 110 个 PyRoboSim 任务和 14 个实体 Panther 任务上显示,该机制带来近乎完美的验证通过率和较高任务成功率,模板对小模型的反应式控制任务尤其有帮助。

Analysis of Mutual and Referential Human and Robot Gazes in a Collaborative Word Association Game Figure 1
2026-07-15cs.RO

Analysis of Mutual and Referential Human and Robot Gazes in a Collaborative Word Association Game

Jens V. Rüppel, Tim Schreiter, Andrey Rudenko, Achim J. Lilienthal

2026-07-15机器人

本文关注任务型人机协作中机器人凝视是否还能有效引导注意,而非只研究面对面社交对话。作者让参与者与具身的 NAO/LLM 伙伴玩词语联想协作游戏,并对比互视与指示性凝视条件,结合眼动、语音片段和事件标注分析。结果显示,机器人看向棋盘并未缩短人类首次注视目标词的时间;但人在提出确认请求时更常看向机器人,说明高认知负荷下语言协商可能压过了指示性凝视的作用。

LQG solution for POMDP without estimating states: A minimum variance approach Figure 1
2026-07-15math.OC

LQG solution for POMDP without estimating states: A minimum variance approach

Ranjan Sarkar, Prabhat K. Mishra

2026-07-15机器人

针对部分可观测、带噪线性系统中传统“先估计状态再控制”的分离原则在约束或观测受控场景下可能失效的问题,论文用最小方差对偶把当前控制量直接表示为历史测量和已施加输入的线性函数,并嵌入由 LQR 增益和噪声统计诱导的确定性优化。主要结果是给出相应定理推导与数值实验,表明无需显式状态估计也可求解该类 POMDP 的 LQG 控制。

More than a Manipulator: Planning Propellant-Free Attitude Maneuvers for Free-Floating Spacecraft Figure 1
2026-07-15cs.RO

More than a Manipulator: Planning Propellant-Free Attitude Maneuvers for Free-Floating Spacecraft

Harsh G. Bhundiya, Avi Soval, Keenan Albee

2026-07-15规划控制

这篇论文针对航天器姿态机动依赖推进剂或专用动量交换装置的问题,提出把自由漂浮航天器上的机械臂从“扰动源”转化为姿态执行器。其核心是将关节限位、自碰撞规避和耦合动力学纳入轨迹优化,规划无推进剂 slew 与 detumble 动作。结果显示,2至7自由度系统均能完成复杂机动,2自由度案例覆盖最高90度转向,并且机械臂的角动量/力矩包络可接近小卫星反作用轮阵列,但高维问题求解时间仍较长。

A Behavioral State Vocabulary in Sony ERS-111 R-CODE Figure 1
2026-07-15cs.RO

A Behavioral State Vocabulary in Sony ERS-111 R-CODE

Christopher A. Tucker

2026-07-15机器人

本文针对机器人系统常偏重高层规划、缺少持续具身监控的问题,把 Sony ERS-111 的 R-CODE 样例视为行为语料而非零散脚本,统计并规范化状态标题。核心洞察是,多种表面不同的例程共享一套紧凑状态词汇,围绕初始化、感知/决策、动作循环、同步、跌倒检测与恢复组织。结果显示 54 个图、292 个状态实例仅对应 47 个不同标题,说明行为多样性主要由少量可复用的反应式状态形式组合而来。

GaitSpan: Growing Humanoid Locomotion from Walking to Running Figure 1
2026-07-15cs.RO

GaitSpan: Growing Humanoid Locomotion from Walking to Running

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X.Yu

University of Michigan, Skyline High School, University of Michigan, UC Berkeley

2026-07-15机器人

这篇论文针对人形机器人从走路到慢跑、跑步通常需分别训练或依赖专家切换的问题,提出把已学会的行走策略作为“种子技能”扩展:用多节奏调制生成动作、以类 SLIP 动力学奖励塑造更长更高步幅,并用残差补偿细节。结果显示单一命令条件策略可覆盖连续速度范围,在多种形态、仿真迁移和真实地形上零样本运行,较多专家或模仿基线学习更快、步态表现更强。

Robust In-Hand Manipulation via Priors in Reinforcement Learning and Mechanical Design Figure 1
2026-07-15cs.RO

Robust In-Hand Manipulation via Priors in Reinforcement Learning and Mechanical Design

Yifei Chen, Shihan Lu, Ed Colgate, Kevin Lynch

Center for Robotics and Biosystems, Northwestern University

2026-07-15机器人强化学习安全鲁棒

这篇论文针对无视觉/触觉反馈下灵巧手指内滚动易受接触不确定性和重力扰动影响的问题,将两类物理先验嵌入强化学习与硬件形态:用抓取质量作为密集奖励引导稳定接触布局,并通过各向异性指尖曲率限制偏轴漂移。实验在多物体和多掌姿下显示旋转效率、抓取稳定性和抗扰性提升,但真实 sim-to-real 增益中先验与调参贡献的占比文中未充分说明。

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation Figure 1
2026-07-15cs.RO

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation

Robel Mamo, Rajitha de Silva, Grzegorz Cielniak, Taeyeong Choi

LaSER Lab, Kennesaw State University, Marietta, GA 30060, USA., Lincoln Institute for Agri-Food Technology, University of Lincoln, Lincoln LN2 2LG, UK.

2026-07-15机器人视觉感知

这篇论文针对农业机器人夜间导航缺少标注数据的问题,提出将白天作物行 RGB 图像无监督翻译为夜间近红外图像,并用 CLIP 约束语义一致性、用可见性掩码模拟 NIR 照明范围,从而复用白天标签训练夜间分割模型。实验在 AgriNight 数据集和实机夜间导航中显示,该方法相比现有图像翻译基线带来更好的图像质量与下游分割表现,但作物行切换和掩码真实性仍未充分解决。

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs Figure 1
2026-07-15cs.RO

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs

Jinyuan Zhang, Yuwei Wu, Guangyao Shi, Jonathan Diller, Gaurav S. Sukhatme, Vijay Kumar

are with the GRASP Lab, University of Pennsylvania, Philadelphia, PA 19104, USA., Guangyao Shi and Gaurav S. Sukhatme are with the Department of Computer Science, University of Southern California, Los Angeles, CA 90089, USA.

2026-07-15机器人

这篇论文针对狭窄、拥挤环境中多机器人编队容易因固定几何或手工切换规则而死锁的问题,提出 EFLUX:用确定性几何抽象约束 LLM 的高层决策,联合选择缩放、剪切等连续变形与拆分、合并等拓扑重构,并通过生成-验证-修正闭环转成逐机器人路点。仿真和硬件实验显示,其相较基线提高通过成功率、减少死锁和导航失败,但具体增益来源在不同模块间的拆分仍不够充分。

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory Figure 1
2026-07-15cs.AI

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Mingyang Yin, Zedong Chu, Mu Xu

AMAP CV Lab

2026-07-15机器人

这篇论文针对长程具身任务中“感知能做、执行难稳”的问题,提出位于低层控制器之上的 ABot-AgentOS,把场景规划、技能调用、执行验证、边云协同和可审计的多模态图记忆整合成通用运行层,并配套 EmbodiedWorldBench 评测。结果显示其在任务成功率、目标完成度和多项记忆基准上优于单控制器基线,自演化机制带来小幅提升;但真实硬件泛化和增益来源仍需更多拆解。

2026-07-14

113 篇
Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation Figure 1
2026-07-14cs.RO

Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation

Dian Wang, Jisang Park, Xiaomeng Xu, Han Zhang, Shuran Song, Jeannette Bohg

Stanford University

2026-07-14机器人强化学习

本文针对双臂移动操作中动作坐标系选择强烈影响扩散策略学习难度的问题,提出 MoF 在基准扩散状态上并行转换到多个任务相关坐标系,由帧专用去噪器预测后再融合,并用可微的 SE(3) 6D 表示处理 noisy action 的跨帧变换。九个仿真任务显示最优帧随任务变化,MoF 平均优于最佳单帧 oracle 和常规 MoE;两个真实任务中也超过各单帧基线。

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation Figure 1
2026-07-14cs.RO

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

Cornell University

2026-07-14机器人强化学习

这篇论文关注类人运动重定向加强化学习的简洁范式能否用于接触丰富的灵巧操作。作者提出 Regrind,从单个人类示范中保留手与物体的空间和接触关系,生成机器人参考轨迹,并用残差强化学习跟踪物体中心关键点。实验在两种多指手、剪刀和螺丝刀等任务上实现零样机迁移,同时指出成功高度依赖交互保持重定向、数据增强、观测动作设计、域随机化和系统辨识。

Robust bipedal locomotion on flowable slopes via foot-driven terrain manipulation Figure 1
2026-07-14cs.RO

Robust bipedal locomotion on flowable slopes via foot-driven terrain manipulation

Deniz Kerimoglu, Junnosuke Kamohara, Jiyeon Maeng, Ziwon Yoon, Seth Hutchinson, Ye Zhao, Daniel I. Goldman

Department of Mechanical Engineering, Georgia Institute of Technology, School of Physics, Georgia Institute of Technology, Atlanta, GA 30332, USA, Department of Electrical and Computer Engineering, Northeastern University

2026-07-14机器人生成模型安全鲁棒

论文针对双足机器人在颗粒斜坡等可流动地形上易打滑、俯仰失稳且难以建模的问题,提出从“肢端中心”调控足地相互作用:用可调深度、特定间距的足底齿板分配接触力,使基质应力接近或低于屈服阈值。小型BLUEY实验显示4 cm间距优于过疏或过密配置,可在30°颗粒斜坡持续行走;该原则还迁移到15 kg自主双足HECTOR,在15°斜坡上验证有效。

Active Noise Floor Estimation for Reliability-Optimal POMDPs: A Value-of-Noise-Information Approach Figure 1
2026-07-14eess.SY

Active Noise Floor Estimation for Reliability-Optimal POMDPs: A Value-of-Noise-Information Approach

Hyung-Jin Yoon

Department of Mechanical and Nuclear Engineering, Tennessee Technological, University, Cookeville, TN 37135, USA.

2026-07-14机器人

这篇论文针对POMDP中传感和执行噪声底随环境变化而使FRR可靠性证书失效的问题,提出以“噪声信息价值”VoNI判断何时值得主动探测噪声,而不是单纯追求估计精度。其核心洞察是只有当后验不确定性会改变证书间隙或可靠性覆盖时,探测才有决策价值。UGV仿真显示,VoNI比熵式探测更早发现感知噪声突变、漂移跟踪误差更低,并显著减少诊断动作。

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems Figure 1
2026-07-14cs.RO

Casting Everything to Online API Services? A Survey of Integrating Localized Speech Recognition Models in Robotic Systems

Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova

2026-07-14机器人视觉感知

论文针对机器人语音交互长期依赖在线 ASR API 的做法,梳理本地化语音识别模型在机器人系统中的集成路径。核心洞察是按模型族、ROS/云端/混合部署和应用平台组织权衡,显示 Whisper、OWSM、MMS 等基础模型与开源工具已降低本地部署门槛;但作为叙述性综述,文中未充分说明量化增益,结论主要是本地与混合方案更适合隐私、延迟和动态噪声场景。

MIRA: A Modular Open-Source Micro-UAV for Indoor Research Figure 1
2026-07-14cs.RO

MIRA: A Modular Open-Source Micro-UAV for Indoor Research

Lucas K. de Oliveira, Felipe A. G. Tommaselli, João Aires Marsicano, Marco S. Tayar, Pedro A. R. Saraiva, Ricardo V. Godoy, Marcelo Becker

University of São Paulo (USP), São Carlos, Brazil

2026-07-14机器人

面向室内微型无人机研究中商用平台封闭、开放平台难复制和难替换部件的问题,MIRA提出可本地3D打印的PLA模块化机架,并用容器化ROS 2/uXRCE-DDS桥接PX4与伴随计算机,使硬件替换不必重写固件。实测中,位置控制飞行稳定,机载通信中位延迟约0.02 ms,结构振动集中在90–110 Hz,避开低于20 Hz的控制带宽。

A Compact Top-Loading Robot for Endovascular Interventions: Design, Control and Evaluation Figure 1
2026-07-14cs.RO

A Compact Top-Loading Robot for Endovascular Interventions: Design, Control and Evaluation

Jonas Fischer, Lennart Karstensen, Franziska Mathis-Ullrich

2026-07-14机器人规划控制数据集/基准

针对血管介入机器人在病人侧占用空间大、器械更换复杂、难以兼容标准导丝和导管的问题,论文提出一套紧凑的顶部装载系统:两组小车交替夹持,气动膜式夹爪集成在旋转齿轮中,并用主从控制实现有限行程下的连续平移和旋转。实验显示导丝和导管运动较平滑,平均相对跟踪误差约为平移3.6%、旋转4.1%,体外血管模型中多数试验能到达目标,但临床场景下的鲁棒性仍待验证。

AutoPath: Learning Transferable Goal-Conditioned Stochastic Path Prior for Safe Navigation Without Human Demonstrations Figure 1
2026-07-14cs.RO

AutoPath: Learning Transferable Goal-Conditioned Stochastic Path Prior for Safe Navigation Without Human Demonstrations

Ziyang Zhang, Boyang Zhou, Zesong Yang, Haocheng Peng, Zeming Gai, Xiao Liang, Yujun Shen, Danping Zou, Ruizhen Hu, Hujun Bao, Zhaopeng Cui

2026-07-14机器人模仿学习安全鲁棒

AutoPath针对拥挤动态环境中安全导航的多路径选择与跨平台复用难题,将导航建模为目标条件随机路径先验,而非直接预测单一路径或底层控制;其关键在于目标对齐规范状态、极坐标动作流形和风险敏感多目标采样,使几何路径分布与机器人运动学解耦。实验显示其在密集静态和行人动态场景中保持较高成功率与效率,并可将差速机器人上学到的先验迁移到四足平台且无需重训。

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception Figure 1
2026-07-14cs.RO

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Jacob, Chao Liu, Peter Yichen Chen, Yuri Ivanov, Wojciech Matusik

2026-07-14机器人

低成本伺服机械臂中,线性电流到力矩假设会受摩擦、回差、饱和和温漂影响,导致动力学建模与无力传感器力感知失准。NeuralActuator用历史命令、状态和电机遥测训练多任务Transformer,通过可微仿真用位姿监督学习力矩替代量,并同时预测外力、接触门控和电机状态。实验覆盖OpenManipulator-X、SO-101和Franka,报告了较低轨迹误差、较准外力/载荷估计、关节状态分类,以及作为预训练模块提升行为克隆成功率。

High-level spatial Dubins airplane-based reference smoothing with low-level geometric tracking for quadrotor control Figure 1
2026-07-14cs.RO

High-level spatial Dubins airplane-based reference smoothing with low-level geometric tracking for quadrotor control

Mogens Plessen

2026-07-14视觉感知规划控制

本文针对四旋翼跟踪稀疏、急转弯参考路径时易在转角处切角、且样条或 NMPC 方法调参和计算成本较高的问题,提出高层 Dubins airplane 空间参考平滑与低层几何跟踪的分层控制框架。核心在于用低维空间建模把带横向约束的轨迹整形转化为小规模线性规划,并支持离线全局平滑或在线滚动规划;数值实验表明其能在贴近原始路径的同时满足单侧避障等横向约束,但实际飞行验证和相对性能增益仍文中未充分说明。

Requirement-Driven Design of Whole-Body Social Tactile Sensing via Virtual Human-Robot Interaction Figure 1
2026-07-14cs.RO

Requirement-Driven Design of Whole-Body Social Tactile Sensing via Virtual Human-Robot Interaction

Dakarai Crowder, Ruohan Zhang, Alexis E. Block, Wenzhen Yuan

are with University of Illinois at Urbana-Champaign, Champaign, IL, USA

2026-07-14机器人

这篇论文针对社交触觉机器人长期先做硬件、再适配识别算法的问题,提出用带触觉反馈的 VR 人机交互先采集全身接触数据,再反推触觉皮肤的覆盖位置与空间分辨率需求。作者在 Reachy 虚拟平台上识别出 9 类常见社交触摸,并用 18 名参与者采集 5520 次受控手势;仿真结果显示,二值触觉编码下手势识别性能在每 24 cm 约 18 个 taxel 后趋于稳定,为硬件制作前的传感器密度选择提供了量化基线。

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence Figure 1
2026-07-14cs.RO

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

2026-07-14强化学习

本文针对开放世界机器人中模型、数据与执行接口难以复用的问题,提出从世界动作模型走向“具身大脑”的路线图:让模型预测干预后果与意图状态,而由物理 harness 负责落地控制、验证和记录轨迹。主要结果是给出预测契约、系统分工、闭环后训练与评测标准化框架;这是综述和架构性方案,文中未充分说明实证增益。

Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots Figure 1
2026-07-14cs.RO

Automated Synthesis of Facial Mechanisms for Conversational Animatronic Robots

Zongzheng Zhang, Zi Lin, Jiawen Yang, Ziqiao Peng, Junyan Lao, Lin Cheng, Huazhe Xu, Hang Zhao, Hao Zhao

Institute for AI Industry Research (AIR), Tsinghua University 2 Beijing Academy of Artificial Intelligence (BAAI), Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University 4 Beihang University, pursue automated and scalable mechanical face synthesis, aiming, Crucially, scalable hardware alone is not sufficient. If anima-, results demonstrate that our framework provides a scalable and, substantial manual redesign, a scalability bottleneck our work

2026-07-14机器人

针对仿生机器人面部每换一种几何形态就需手工重设计、难以规模化的问题,论文把机械脸设计表述为可计算的合成任务:从单张2D肖像重建3D脸,并用参数化连杆模板、分层优化、解剖约束运动空间和碰撞外环生成可制造机构,同时加入说话/聆听双身份表情运动合成。实验覆盖多种脸型、人工设计对比、实时部署和用户研究,显示其可自动生成较自然的个性化会话机械脸。

Self-Healing Visual Recovery for Autonomous Ground Vehicles Using Camera-Only Visual Odometry Figure 1
2026-07-14cs.RO

Self-Healing Visual Recovery for Autonomous Ground Vehicles Using Camera-Only Visual Odometry

Jakob Solberg Berntzen, Safia Fatima, Leon Moonen

Simula Research Laboratory, Oslo, Norway, University of Oslo, Oslo, Norway, Falling component costs and persistent labor shortages, have moved these vehicles from laboratory prototypes, repetitive, labor-intensive tasks that could benefit greatly, visual reference is available, a proportional-derivative

2026-07-14机器人

针对低成本地面机器人在仅靠相机循线时遇到遮挡、反光或急转导致路线丢失且缺少 LiDAR/GPS 冗余的问题,论文提出把自愈恢复嵌入 50 ms 控制周期:先原地搜索并逐步放宽 HSV 颜色约束,失败后用单目视觉里程计回退到面包屑位姿再重试。系统在 CPU-only、20 Hz 条件下结合深度门控循线、YOLOv8n 避障和 VO 映射,在 Webots 三条路线的 119 次故障注入中恢复成功率为 86.6%,中位恢复时间 3.26 秒,但真实硬件泛化仍需进一步验证。

Trajectory Planning and Certification for 3-DOF Robot Manipulators Using Real Quantifier Elimination Based on Comprehensive Gröbner Systems Figure 1
2026-07-14cs.RO

Trajectory Planning and Certification for 3-DOF Robot Manipulators Using Real Quantifier Elimination Based on Comprehensive Gröbner Systems

Yu Nakai, Akira Terui, Masahiko Mikawa

University of Tsukuba, Tsukuba, Japan

2026-07-14机器人规划控制

针对机器人沿连续轨迹反复求逆运动学时 Gröbner 基计算开销高、且数值规划难以事前保证可行性的问题,论文把 myCobot 简化为只考虑末端位置的 3-DOF 模型,用参数化 CGS 复用基计算,并结合 CGS-QE 对直线段和三次自然样条轨迹做可行性认证,还给出可行参数区间;方法已在 Risa/Asir 中实现并报告实验结果,但具体速度增益幅度需看实验细节。

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs Figure 1
2026-07-14cs.RO

A Model for Mediating Multi-Modal Human Intent into Safe Maneuvers for UAVs

Sofia Nelson, Dalal Alrajeh, Pedro Antonio Alarcon Granadeno, Jane Cleland-Huang

2026-07-14安全鲁棒

这篇论文针对多模态人机交互中将语音、手势或 GUI 输入直接转成无人机动作带来的碰撞、越界和飞行包线风险,提出把人类意图先解释为有边界的机动请求,再经约束运动基元、请求-评估-执行流水线和运行时监控处理。其核心在于用需求规约描述前置条件、不变量、护栏与后置条件,使命令可被约束、拒绝或安全执行。初步实验显示语音和 GUI 请求可被可靠解释并安全执行,但验证仍偏实验室场景。

Coordinated Incremental Trajectory Tracking of a Tailsitter Drone Figure 1
2026-07-14cs.RO

Coordinated Incremental Trajectory Tracking of a Tailsitter Drone

Evangelos Ntouros, Ewoud J. J. Smeur

2026-07-14视觉感知规划控制

针对尾座式无人机在协调飞行中遇到大垂向速度时,既有微分平坦控制会退化或出现奇异的问题,本文用ϕ理论气动参数化和旋转矩阵推导解析平坦变换,避免欧拉角及攻角/侧滑角相关歧义。基于Parrot Swing的实验表明,该方法在半环等含显著垂向与横向运动轨迹中仍可保持定义良好,但接近气速与合力平行条件时仍显敏感,轨迹优化仍待完善。

Event-RGB Adaptive Tracking for Nighttime Highway Perception Figure 1
2026-07-14cs.CV

Event-RGB Adaptive Tracking for Nighttime Highway Perception

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

Haidong Wang, Hengxing Cai, and Renxin Zhong are with the School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China., Harbin Institute of Technology, Shenzhen, China.

2026-07-14视觉感知

本文针对夜间高速公路中RGB相机因低照度、高车速产生模糊和漏检,而事件相机又难以感知静止车辆的问题,提出JEAT,将事件流与RGB检测放入统一数据关联,并用基于NIS的自适应EKF动态调节模态权重;同时构建CARLA合成数据集SEHN。文中称该方法能缓解跨模态失效,但具体实验幅度和增益来源在给定文本中未充分说明。

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model Figure 1
2026-07-14cs.RO

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

2026-07-14机器人强化学习

针对通用图像/视频生成模型难以满足机器人多视角一致性、几何约束和交互动态的问题,Xiaomi-Robotics-U0 将具身生成视为世界基础模型能力的延伸,用 380 亿参数自回归框架联合训练文生图、编辑、具身场景迁移与视频生成。结果显示其在人评中优于 GPT-Image-2.0,World Arena 排名第一,并将 π0.5 的分布外操作成功率从 36.9% 提升到 63.2%。

DA-Nav: Direction-Aware City-Scale Vision-Language Navigation Figure 1
2026-07-14cs.RO

DA-Nav: Direction-Aware City-Scale Vision-Language Navigation

Ye Yuan, Kehan Chen, Xinqiang Yu, Wentao Xu, Heng Wang, Libo Huang, Chuanguang Yang, Yan Huang, Jiawei He, Zhulin An

2026-07-14机器人视觉语言视觉感知

DA-Nav针对城市级户外机器人导航对高成本稠密地图和人工细粒度监督的依赖,利用商业导航工具的粗粒度方向指令,将视觉语言导航转化为自车视角图像平面上的离散空间 grounding,并用包含偏航判断、动作预测和目标网格选择的 CoT 流程处理长程误差恢复。作者还构建 ReDA 数据集,加入方向指令和恢复轨迹;在 CARLA 未见城市中成功率达 56.16%,优于既有方法,并可零样本迁移到四足和人形机器人完成公里级实地闭环导航。

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues Figure 1
2026-07-14cs.RO

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira

Kyushu Institute of Technology, Fukuoka, Japan 2 CyberAgent, Tokyo, Japan 3 The University of Osaka, Osaka, JapanFor correspondence:

2026-07-14机器人强化学习

论文针对零售服务机器人过度依赖语音链路、难以及时响应靠近、挥手、指物等非语言信号的问题,先用真实门店遥操作数据量化这类触发:6天部署中15.3%的机器人发话由非语言行为引发。作者据此筛出9类高频服务相关线索,构建实时多人多标签视觉识别器,并将识别 token 接入LLM生成主动回应;离线结果显示常见社交线索上可较好匹配遥操作员意图,但任务指令类和跨场景泛化仍是限制。

IBPA: Real-time Free-form Manifold Mesh Reconstruction via Incremental Ball Pivoting with Integrated Hole Detection Figure 1
2026-07-14cs.GR

IBPA: Real-time Free-form Manifold Mesh Reconstruction via Incremental Ball Pivoting with Integrated Hole Detection

Mauhing Yip, Mohit Singh, Kostas Alexis, Christian Schellewald, Annette Stahl

2026-07-14视觉感知三维

面向ROV/AUV水下测绘中事后才发现覆盖缺口、且DTM/DSM难以表达悬垂和垂直结构的问题,论文将球旋转算法改造成增量式IBPA,从流式点云实时生成可定向流形三角网,并集成孔洞检测以提示应补扫区域。实验表明其可处理复杂自由形拓扑、重叠或分布不规则点云,并对离群点保持一定鲁棒性,但具体速度与精度增益幅度需结合全文结果判断。

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning Figure 1
2026-07-14cs.RO

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci

2026-07-14机器人强化学习

针对腿式机器人强化学习样本效率低、泛化弱的问题,SKooP 将形态对称先验与自编码器学习的受控 Koopman 线性潜空间结合,在训练中用 Koopman 预测作为 critic 的特权观测,并让 actor、critic、编码器和解码器保持等变。实验显示其在四足机器人双足化 locomotion 任务上收敛更快、奖励更高,并能迁移到不同仿真环境和镜像任务。

WarpMPC: Large-Batch MPC on GPU via ADMM with Unrolled $LDL^\top$ Factorization Figure 1
2026-07-14cs.RO

WarpMPC: Large-Batch MPC on GPU via ADMM with Unrolled $LDL^\top$ Factorization

Henrik Hose, Se Hwan Jeon, Charles Khazoom, Sangbae Kim, Sebastian Trimpe

2026-07-14规划控制

面向机器人学习中需要一次性求解上万到十万级 MPC 的瓶颈,WarpMPC 利用批内问题共享时间、代价和约束稀疏结构这一洞察,将 ADMM 中主耗时的稀疏 LDL^T 分解与回代展开为固定模式 GPU kernel,并配合内存布局、分段和依赖层调度优化。其在 cartpole、四旋翼和人形机器人非线性 MPC 上达到 8000 至 250000 次 SQP 迭代/秒,较基线快 3 到 25 倍,并用于数分钟内蒸馏可上机的纳米四旋翼控制网络。

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions Figure 1
2026-07-14cs.RO

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

Cornell University, Johns Hopkins University, University of Cambridge, pact the overall quality of human-robot collaboration [15]. Despite, second, they focus on controlled laboratory settings that may not, to facilitate collaboration in HRI, for example by conveying user, on five collaborative tasks, and separated the detection problem, studies conducted in controlled laboratory settings. All the code, ios with no failure). Labels are binary and derived directly from the

2026-07-14机器人视觉语言视觉感知

这篇论文针对机器人在真实人机交互中难以及时识别自身失误的问题,将错误检测从事后反应扩展到事前预判,并发布两组众包采集的原始非匿名视频数据,覆盖旁观者对失败的自然反应和失败发生前的面部预期信号。挑战赛中3支有效参赛队在至少一个赛道超过CNN基线,但论文更强调基准与数据资源,模型增益来源未充分说明。

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models Figure 1
2026-07-14cs.RO

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo

2026-07-14机器人视觉语言视觉感知

本文针对VLA在相机坐标中观察、却在机器人坐标中输出动作的坐标系错配问题,尤其是多视角示教数据下难以泛化。核心做法是把RGB-D点提升并变换为机器人中心pointmap,在保留H×W图像网格的同时注入机器人坐标下的3D几何,可直接接入预训练2D VLA。RoboCasa上π0.5和SmolVLA分别提升7.6和4.2点,真实Franka实验中未见相机位置的优势扩大到11.7点。

Towards Human-level Dexterous Teleoperation Figure 1
2026-07-14cs.RO

Towards Human-level Dexterous Teleoperation

Puhao Li, Zeyuan Chen, Yingying Wu, Pengkun Wei, Yuyang Li, Tianyu Wang, Jiaxiao Shi, Mingrui Yu, Baoxiong Jia, Song-chun Zhu, Tengyu Liu, Siyuan Huang

Tsinghua University, State Key Lab of General Artificial Intelligence, BIGAI, Peking University

2026-07-14机器人

这篇论文针对现有灵巧手遥操作只做运动学映射、难以处理接触力和物体惯性的问题,提出 TeleDexter:将操作者意图表示为指尖与物体姿态的连续协同子目标,并用单阶段强化学习低层控制器学习可实现的接触切换;结合几何感知重定向、随机动作遮蔽和域随机化实现零样本实机迁移。在两种灵巧手、七个重定向和长时程工具使用任务上,方法平均成功率达 75.2%,任务进度 87.1%,而基线基本失败,并可收集示教用于行为克隆训练自主策略。

EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation Figure 1
2026-07-14cs.RO

EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation

Yuecheng Xu, Tong Yang, Jingkai Jia, Chi Zhang, Xuelong Li, Wenqiang Zhang

College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University

2026-07-14机器人

针对机器人操作中原始动作轨迹噪声大、冗余且仅按控制形态编码会忽略场景作用的问题,EDAR将动作表示建模为环境依赖的潜在动作 token,同时约束其重建可执行控制并预测当前场景下的视觉后果,使相似电机命令能按不同交互效果区分。实验显示其在 LIBERO、CALVIN、Meta-World 及真实长程操作中提升策略成功率或任务完成长度。

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos Figure 1
2026-07-14cs.RO

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

2026-07-14视觉感知模仿学习

WALA针对机器人策略过度依赖带动作标注示教、难以利用大规模无动作视频的问题,提出从当前与稀疏未来观测的语义和几何变化中学习可执行潜动作,并用DINOv3特征与深度增量监督,避免像素重建噪声;训练时将潜动作同时对齐真实控制、潜目标和未来动力学。实验在RoboTwin表现较强,在RoboCasa达到75.2%平均成功率,并报告真实机器人泛化验证。

From Sketch Prior to Trajectories: A Mission-Oriented Coordinated Navigation Framework for Indoor UAV Swarm Figure 1
2026-07-14cs.RO

From Sketch Prior to Trajectories: A Mission-Oriented Coordinated Navigation Framework for Indoor UAV Swarm

Xinhang Xu, Ruiyang Liu, Haotian Jin, Yi Wang, Hongming Shen, Jianping Li, Lihua Xie

2026-07-14机器人

针对室内巡检、安防等任务中多无人机只需按顺序访问关键区域、而非完整探索环境的问题,论文将楼层平面图等草图先验与在线观测做拓扑对齐,构建含静态结构、动态通行性和区域状态的任务导向表示,并用2D任务路径引导3D轨迹优化。仿真与三机实验证明其可在多房间、通信丢失和多楼层场景下完成协调导航。

A Glimpse into Long-term Physical Coexistence with Intelligent Robots Figure 1
2026-07-14cs.RO

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang

2026-07-14机器人

面向长期人机共处,论文指出单一机器人策略不足以支撑记忆、交互、多机协同与安全执行。PHILIA以机器人网关解耦高层语义代理和本地实时执行,用统一能力接口组合观察、导航、操作、语音与中断等功能。系统在Astribot S1上展示家务场景,并在483条中英指令上评估能力路由,但整体效果增益更多来自架构可组合性,长期可靠性仍文中未充分说明。

CR-Solver: GPU-Accelerated Kinematics Solver for Tendon-driven Continuum Robots Figure 1
2026-07-14cs.RO

CR-Solver: GPU-Accelerated Kinematics Solver for Tendon-driven Continuum Robots

Heqing Yang, Yang Yi, Linqing Zhong, Linjiang Huang, Si Liu

Beihang University.

2026-07-14机器人优化算法

论文针对连续体机器人难以直接使用刚体规划库、现有PCC求解器泛化和实时性不足的问题,提出基于JAX的GPU并行两阶段优化框架CR-Solver,将逆运动学、轨迹规划和路径跟踪统一为约束非线性优化,并通过多初值并行搜索缓解局部极小。实验覆盖无障碍和杂乱场景,报告成功率稳定超过95%、毫米级精度,并相对CPU基线显著加速。

Towards Predictive, Aligned, and Scalable Robot Learning Figure 1
2026-07-14cs.RO

Towards Predictive, Aligned, and Scalable Robot Learning

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

2026-07-14机器人

论文针对机器人策略容易停留在经验记忆、跨视觉语言动作对齐不足而难以泛化的问题,提出 Lumo-2:用潜在世界动力学替代显式文本推理,并通过三阶段预对齐把动作表征逐步对齐到世界动态、视觉和语言。实验称其相对强 VLA/WAM 基线在长时程、物理理解和灵巧操作任务上稳定提升,但具体增益仍可能部分来自 scaling / data。

Stop to Decide: Latency-Aware Proprioceptive Navigation Primitives for Mapping-Free Quadruped Inspection Figure 1
2026-07-14cs.RO

Stop to Decide: Latency-Aware Proprioceptive Navigation Primitives for Mapping-Free Quadruped Inspection

Hanting Suo, Haonan Yan, Liang Wang, Aiguo Song

2026-07-14机器人

面向算力受限的商用四足巡检,论文追问能否不用建图、学习和重型外感知完成线路、窄廊与楼梯任务。核心洞察是控制环延迟会让运动中依靠俯仰判断登顶失效,提出“爬升—停稳—决策”节律并用v/f建模风险;在Unitree Go2上,楼梯越界由连续爬升的22/45降至1/45,窄廊转弯20/20无接触,整场完成18/20,但结果限于单一场地和平台。

GeoGS-SLAM: Online Monocular Reconstruction Using Gaussian Splatting with Geometric Priors Figure 1
2026-07-14cs.RO

GeoGS-SLAM: Online Monocular Reconstruction Using Gaussian Splatting with Geometric Priors

Ruilan Gao, Letian Jin, Yu Zhang

2026-07-14三维

GeoGS-SLAM针对单目RGB场景中3DGS-SLAM依赖深度传感器、几何先验方法又弱化RGB闭环约束的问题,将预训练视觉几何模型预测的相机与场景先验用于初始化和扩展高斯地图,并在粗到细优化中同时约束光度与几何误差,再结合在线回环和位姿图优化。文中在Replica、TUM RGB-D和Waymo等室内外基准上报告了更好的渲染质量与轨迹精度,同时保持在线实时性能。

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation Figure 1
2026-07-14cs.RO

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

Haojie Huang, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters, Robert Platt

Northeastern University, Stanford University, University of Pennsylvania, Brown University, Texas A&M University

2026-07-14机器人视觉感知

这篇论文针对视觉输入与3D末端执行器动作表征脱耦、导致操控策略难学且易过拟合的问题,提出将SE(3)动作块投影为连续、无界的双目图像平面关键点轨迹,再经三角化无损恢复3D位姿。其关键洞察是让观测和动作处于同一图像坐标系,从而可对每个相机独立做等变旋转增强,并用Diffusion X-Net融合多视角。实验显示,Pix2Act在10个MimicGen任务和真实机器人上优于多种强基线,并对相机扰动更稳健。

Comparison-Based Ordinal Learning for Proactive Driving Risk Assessment Figure 1
2026-07-14cs.RO

Comparison-Based Ordinal Learning for Proactive Driving Risk Assessment

Zhuoren Li, Yi Zhong, Weiqi Zhang, Xinrui Zhang, Lu Xiong, Chongfeng Wei, Bo Leng

2026-07-14安全鲁棒

针对自动驾驶风险评估中碰撞样本稀缺、逐帧风险标签难获得的问题,论文将安全事件的时间推进、危险/正常事件对比和物理反事实扰动转化为成对排序监督,学习与碰撞相关的序数风险分数,并可校准单个或多个代理风险指标。在100-Car和SHRP2数据的主动预警任务中,该方法提升了高召回风险区分、预警精度和提前量,但复杂多车场景与传感器输入仍待扩展。

VIA: Visual Interface Agent for Robot Control Figure 1
2026-07-14cs.RO

VIA: Visual Interface Agent for Robot Control

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

Stanford University

2026-07-14机器人规划控制

VIA针对VLA微调受机器人数据与算力限制、难以继承前沿基础模型推理能力的问题,将机器人控制改写为视觉界面上的代理任务:通用模型代理通过浏览器3D点云界面截图观察、设置虚拟夹爪路点并闭环修正,无需机器人专用微调或特权状态。实验显示 Claude Code 与 Codex 可零样本完成多类桌面操作,最强配置在 LIBERO-Goal 达到96.7%成功率,并在七块彩虹组装任务达到100%。

Desc++: Efficient Descriptor Enhancement for Data Association in Existing Visual SLAM Systems Figure 1
2026-07-14cs.RO

Desc++: Efficient Descriptor Enhancement for Data Association in Existing Visual SLAM Systems

Ting-Wei Ou, Huang-Ting Lin, Kuu-Young Young

2026-07-14机器人

这篇论文针对现有视觉 SLAM 中手工描述子在光照、视角变化下匹配不稳,而学习式前端又难以低成本替换的问题,提出 Desc++ 作为即插即用的描述子增强模块。其核心是融合关键点几何与原始描述子,并用 AFT 全局上下文和基于 Z-order 的 Mamba 顺序建模在线性复杂度下聚合空间关系。实验显示其在 HPatches 和四类 SLAM 系统中提升匹配质量,并在多数 EuRoC、KITTI、Hilti 序列上带来更稳定、较准确的轨迹估计。

PAKE: Learning Whole-Body Loco-Manipulation with Partial Kinematic Embeddings Figure 1
2026-07-14cs.RO

PAKE: Learning Whole-Body Loco-Manipulation with Partial Kinematic Embeddings

Zhengmao He, Moonkyu Jung, Hyeongjun Kim, Jiseong Lee, Hui Zhang, Jemin Hwangbo, Jie Song

2026-07-14机器人

PAKE针对足式移动机械臂在高自由度下难以同时实现精确末端跟踪、稳定运动和冗余利用的问题,将全身控制拆为KNF生成上身/机械臂部分运动参考与低层模仿控制执行,并让高层策略在潜空间选择冗余解。仿真中提升跟踪精度和可达工作空间,真机24次、8类任务中末端误差约4.5厘米/0.14弧度,速度跟踪也优于基线。

GraspGraphNet: Graph-Structured Multi-Embodiment Dexterous Grasp Generation Figure 1
2026-07-14cs.RO

GraspGraphNet: Graph-Structured Multi-Embodiment Dexterous Grasp Generation

Yeonseo Lee, Taeyeop Lee, Hyosup Shin, Guebin Hwang, Sungho Jo

Korea Advanced Institute of Science and Technology (KAIST), Daejeon, South Korea. † Corresponding author.

2026-07-14机器人

面向不同灵巧手难以共享配置空间、常需后处理或重定向的问题,GraspGraphNet将URDF手模型表示为运动学图,并在可执行的手掌位姿与关节空间中用动态世界边消息传递和条件流匹配生成抓取。共享模型在Barrett、Allegro、Shadow及40物体评测上平均成功率83.48%、单次约40 ms,去指拓扑变体无需重训仍达72.70%。

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters Figure 1
2026-07-14cs.RO

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

Edward Beng Wai Tan, Siew-Kei Lam

College of Computing and Data Science, Nanyang Technological University, Singapore. ∗ Corresponding author.

2026-07-14机器人

这篇论文针对端侧机器人难以承受大规模视觉导航策略的问题,主张把点目标导航中可解析的几何、占据与坐标变换显式化,只让三个小模块学习局部子目标、可通行后验和轨迹形状。系统仅训练0.58M参数、44k帧内一小时训练,在6060个仿真任务中接近NavDP表现,碰撞率最低并达50Hz,但真实机器人验证仍未充分说明。

SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation Figure 1
2026-07-14cs.RO

SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation

Haidong Cao, Wenjun Cao, Quanhao Li, Sicheng Xie, Zhiying Du, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, China, Shanghai Key Laboratory of Multimodal Embodied AI, China

2026-07-14机器人生成模型规划控制

针对连续动作预测易累积误差、多模态动作不稳定,而关键姿态方法又依赖外部规划器、难以实时闭环的问题,SegDiff将示教轨迹按关键姿态分段,用扩散模型直接生成从当前状态到下一关键姿态的连续轨迹,并借助DDIM反演做动态时序集成以校验和更新动作缓存。实验显示其在RLBench、RoboMimic及真实任务上整体优于ACT、Diffusion Policy、CoA等基线,RLBench 10任务平均成功率达86.7%,但DTE在无扰动仿真中的增益有限。

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching Figure 1
2026-07-14cs.RO

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

2026-07-14视觉语言生成模型

面向近距离人机交互中软体象鼻机器人难以用端点动作表达全身姿态的问题,论文将开放语义先规约为形态相关的意图-强度元组,再用样条压缩腱驱动轨迹,并以轻量 rectified flow 生成一对多可执行动作。消融显示成功率由原始密集回归的25.0%升至77.2%,较DDPM更快且略准;100人实机研究中总体满意正向评价由46%升至82%。

Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion Figure 1
2026-07-14cs.RO

Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion

Solvi Arnold, Rin Karashima, Tadashi Adachi, Takafumi Mochizuki, Kimitoshi Yamazaki

In a robotics context, which actions are available in a given, nise which actions are available to it in a given scene (i.e. rec-, SA is at NICT, Japan. Work performed while at Shinshu University, Japan., Tohoku University, Japan. Work performed while at Shinshu University, Japan.

2026-07-14机器人视觉感知规划控制

面向真实桌面操作中符号/语言规划难以表达细粒度物理状态的问题,论文将预定义 affordance 识别、动作效果视觉预测与文本目标匹配结合,用物体掩码跟踪被遮挡目标,并以 real-to-sim 图像转换缓解外观差异。实验分别评估模块,并在仿真和UR5实机任务中展示可生成多步操作计划,但具体相对增益幅度文中片段未充分说明。

Wearing A Coat: Dual-Arm Robot-Assisted Dressing with Differentiable Clothing Simulation Figure 1
2026-07-14cs.RO

Wearing A Coat: Dual-Arm Robot-Assisted Dressing with Differentiable Clothing Simulation

Yiming Liu, Lijun Han, Hesheng Wang

2026-07-14机器人

针对机器人辅助穿外套中已穿上一只袖子后产生的布料-人体接触约束,论文提出将实时可微服装仿真嵌入双臂控制:用带干摩擦的显式迭代提高大步长稳定性,并结合分阶段目标控制、人运动预测和局部约束优化补偿。仿真中相较 Projective Dynamics 显示计算优势,真实用户多姿态实验完成不同外套穿着,但具体安全余量与失败边界文中未充分说明。

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies Figure 1
2026-07-14cs.RO

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

2026-07-14机器人视觉语言强化学习

面向人群环境中的实时社交导航,论文指出纯 RL 反应快但缺少语义判断,纯 VLM 理解强却延迟高。其核心做法是 HUMA:常规低密度场景由 RL 策略执行,仅在人进入近身等敏感区域时通过 PSC 开关调用经 LoRA 训练的 VLM 进行高层引导。在 Social-MP3D 和 Social-HM3D 上成功率分别提升 20% 和 3%,并减少个人空间侵犯与碰撞,且在 Mirokaï 机器人上做了实机验证。

Real-Time Rulebook-Aware Nonlinear MPC for Autonomous Driving with Priority-Biased Tiered Slacks Figure 1
2026-07-14cs.RO

Real-Time Rulebook-Aware Nonlinear MPC for Autonomous Driving with Priority-Biased Tiered Slacks

Hadi Hajieghrary, Benedikt Walter, Chaitanya Shinde, Paul Schmitt, Miguel Hurtado

2026-07-14规划控制

论文针对自动驾驶规划中安全、法规、舒适与效率规则冲突难以实时取舍且难以审计的问题,提出将九类驾驶规则编译为四层共享松弛变量的非线性 MPC,并用强分离惩罚把违规偏向低优先级规则,同时记录逐规则残差。其在 150 个 WOMD 闭环场景中以 10Hz 运行,求解中位 28ms;在日志无关的安全与法规指标上相对专家回放无系统性组级劣势,但高分歧场景仍有局部退化,且并非形式安全或硬实时控制器。

Mapping Pamir: Multi-Session Visual-Inertial SLAM and 3D Reconstruction of an Underwater Shipwreck Figure 1
2026-07-14cs.RO

Mapping Pamir: Multi-Session Visual-Inertial SLAM and 3D Reconstruction of an Underwater Shipwreck

Michalis Chatzispyrou, Luke Horgan, Hyunkil Hwang, Harish Sathishchandra, Chinmay Burgul, Monika Roznere, Alberto Quattrini Li, Philippos Mordohai, Ioannis Rekleitis

2026-07-14三维

水下结构测绘受能见度差、AUV成本高和潜水时长限制,常需跨多次下潜完成。本文将廉价GoPro的视觉惯性SLAM与潜水电脑深度记录结合,用SVIn2关键帧和位姿先验驱动COLMAP,并借固定标定靶对齐多会话坐标,从而在单目重建中引入尺度和绝对深度。作者在巴巴多斯Pamir沉船三次下潜、167分钟视频和30万余帧数据上重建了外部及可进入内部,并开源含深度的VIO数据与Docker流程。

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer Figure 1
2026-07-14cs.RO

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

Harvard University. 2 Georgia Institute of Technology.

2026-07-14生成模型强化学习规划控制

这篇论文针对多任务、接触丰富的推块操作中行为克隆依赖大量示范且难扩展的问题,尝试用在线强化学习从零训练单一扩散策略。核心做法是把基于策略镜像下降的价值重加权 ELBO 作为扩散策略损失,并结合目标中心状态表示与反向课程缓解稀疏奖励探索。结果显示该策略在多形状、多目标仿真任务中优于高斯策略 RL,并能在不同重量、摩擦和目标位姿下零样本迁移到真实推块场景。

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments Figure 1
2026-07-14cs.RO

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

Siyi H, Jared Strade, Hyungtae Lim, Luca Carlone

2026-07-14三维

这篇论文针对机器人在室内探索中只能看到部分环境、却需要推断未知区域以支持导航和找物的问题,提出自顶向下的层级3D场景图生成框架:先用混合离散-连续图扩散模型补全房间类别、边界和连通性,再接入对象层扩散模型生成室内物体布局。实验显示其在3D-FRONT和Matterport3D部分场景图补全上优于占据图和LLM基线,尤其对分布外部分平面图泛化更好,并在机器人采集真实场景中完成了端到端演示。

X-GuideAR: An Augmented Reality Framework to Mitigate Radiation Exposure during Fluoroscopic Guidance Figure 1
2026-07-14cs.CV

X-GuideAR: An Augmented Reality Framework to Mitigate Radiation Exposure during Fluoroscopic Guidance

Mingxu Liu, Zixuan Liu, Ruchen Cai, Yu-Chen Ku, Suxi Gu, Amit Jain, Alejandro Martin-Gomez, Mehran Armand

Department of Computer Science, Johns Hopkins University, Department of Orthopaedic Surgery, Johns Hopkins School of Medicine, Department of Electrical Engineering and Computer Science, University of Arkansas, Department of Mechanical Engineering

2026-07-14机器人

该文针对骨科透视导航中反复调整 C 臂寻找关键视角导致医患辐射累积的问题,提出 X-GuideAR:用术前 CT 生成合成 X 光预览来辅助无辐射选视角,并在真实透视上叠加钻孔轨迹。以 S2AI 螺钉置入为例,8 条轨迹的初步实验显示 X 光次数减少 62.3%,可容纳安全螺钉直径由 5.9 mm 提升至 12.95 mm,但样本量较小,临床泛化仍待验证。

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions Figure 1
2026-07-14cs.RO

D-SafeMPC: Diffusion-Driven Safe Model Predictive Control with Discrete-Time Control Barrier Functions

Erdi Sayar, Ersin Daş, Joel W. Burdick, Alois Knoll, Erdal Kayacan

*This work was partially supported by the Horizon Europe Grant Agreement No. 101136056. 1 E. Sayar and E. Kayacan are with the Department of Electrical Engineering

2026-07-14生成模型规划控制安全鲁棒

本文针对扩散模型做机器人轨迹规划时难以硬性满足动力学与安全约束、且单纯用 MPC 后处理容易因初始轨迹差而失败的问题,提出 D-SafeMPC:在每个反向去噪步用离散时间 CBF/CLF 引导采样,再由 MPC 投影到安全可行轨迹并回馈下一步。Franka 静态与动态障碍仿真及实机迁移显示,其安全性、成功率和规划效率优于基线,但高维状态扩展与误差递推仍是限制。

Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors Figure 1
2026-07-14cs.RO

Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors

Yunkang Cheng, Yutong Wu, Menghan Li, Shihe Zhou, Mingguo Zhao

2026-07-14机器人

该文针对被动轮滑鞋让人形机器人面临滚动接触、欠驱动和姿态随速度变化而耦合的控制难题,提出切片圆柱轮接触模型,并用人体动捕构建 Pump Glide 与 Push Glide 的 AMP-PPO 运动先验、分别训练策略。仿真与实机试验显示两种步态可持续滑行,前者周期稳定,后者能响应速度指令,但速度误差仍受轮地模型近似影响。

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models Figure 1
2026-07-14cs.CV

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

Xiyan Su, Frank Diermeyer, Markus Lienkamp

Institute of Automotive Technology, Technical University of Munich, Munich Germany

2026-07-14强化学习

论文针对驾驶视频世界模型难以按交通规范受控、通常需重训或结构化条件的问题,提出在冻结的 rectified-flow/Open-Sora 2.0 世界模型采样时,把驾驶规则写成可微能量并注入到自车轨迹流中。实验显示该方法能把规划轨迹引导到反事实刹车目标,但生成视频几乎不随轨迹变化,说明瓶颈在视频与轨迹的跨流耦合不足。

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation Figure 1
2026-07-14cs.CV

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

2026-07-14视觉感知

TOLiD针对VFM到LiDAR蒸馏中同时存在的模态差异和ViT-3D骨干架构差异,改为把LiDAR特征提升为与ViT兼容的patch token,并用Frustum Pooling、Frustum Attention和可见性掩码做token级蒸馏,再通过masked bilinear sampling回到点级表示。实验覆盖5个异构数据集和4组跨传感器迁移,冻结骨干加轻量头时相对SOTA的mIoU优势随预训练数据从169k到342k帧由+2.0%扩大到+4.2%,但部分收益可能主要来自scaling / data。

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation Figure 1
2026-07-14cs.CV

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Changfei Fu, Guangcheng Chen, Wenjun Xu, Hong Zhang

Laboratory of Robotics and Computer Vision, Southern University of

2026-07-14规划控制

这篇论文针对 VLM 在 VLN-CE 中难以直接理解深度方向和 3D 交互的问题,提出不显式引入深度或几何编码,而是在 2D 像素平面用自回归坐标序列监督模型生成导航轨迹。核心洞察是像素轨迹比单一像素目标更能表达逐步交互过程,并可作为像素目标预测的类 CoT。实验称在相同设置下轨迹监督显著优于 pixel-goal,并以较少数据和算力达到 SOTA 水平,但具体增益归因仍需看完整实验细节。

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification Figure 1
2026-07-14cs.RO

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

Northeastern University, Stanford University, Brown University

2026-07-14机器人强化学习三维

针对机器人三维闭环操作中连续高维动作难以离散化、回归易平均化多峰解、扩散推理慢的问题,AMP将末端关键点动作投影到多相机图像平面,把像素位置作为分类类别,并用X-Net输出跨视角时序动作热图。实验显示其在仿真和真实长程任务中普遍优于ACT、Diffusion Policy等基线,平均成功率提升明显,真实任务提升约50%–70%,且单次前向推理更快、对激光指示等细粒度空间线索更敏感。

SensorPerch: Sense Wherever and Whenever it Matters Figure 1
2026-07-14cs.RO

SensorPerch: Sense Wherever and Whenever it Matters

Zhanxin Wu, Ruofei Tong, Tapomayukh Bhattacharjee

Cornell University

2026-07-14机器人

这篇论文针对机器人感知被机载传感器或固定基础设施限制、难以随任务获得最佳视角的问题,提出 SensorPerch:把传感器做成可由机器人自主取放、吸附在环境表面的独立无线模块,并用任务条件化的视角选择框架决定部署位置。真实机器人在两类共 8 个任务中验证了该思路,可在机器人离开后持续检测物体状态,并在策略相关感知任务上达到接近 oracle 第三人称视角的成功率。

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models Figure 1
2026-07-14cs.RO

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

Yale University, University of Connecticut, Peking University, Imperial College London

2026-07-14机器人

这篇论文针对机器人基础模型微调后容易依赖背景、光照、相机视角等非因果线索的问题,提出轻量级、与策略无关的人工中央凹感知 AFP,用任务条件掩码在微调阶段约束视觉注意力,而推理时不需加入控制环。实验称其在仿真和真实场景中减少过拟合、缩短微调时间,并提升环境扰动下的泛化能力。

Coverage Path Planning: Classical Foundations, Recent Advances, and Future Directions Figure 1
2026-07-14cs.RO

Coverage Path Planning: Classical Foundations, Recent Advances, and Future Directions

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Zhongqiang Ren, Yaming Ou, Yikui Zhai, C. L. Philip Chen

Zongyuan Shen 1 , Shalabh Gupta 2 , Shancheng Zhao 1 , Dehua Zhou 1 , Gao Wang 1 , Zhongqiang Ren 3

2026-07-14规划控制

这篇综述针对覆盖路径规划从单机器人二维场景扩展到多机器人、3D、平台约束、学习式与视觉覆盖后缺少统一脉络的问题,梳理2015至2026年为主的125项工作,并以问题驱动分类连接经典方法与新任务。其主要结果是给出六类CPP的建模、代表算法、优劣与开放挑战,指出在线可扩展规划、协同分配、资源约束和学习增强仍是关键瓶颈。

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning Figure 1
2026-07-14cs.RO

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

The Hong Kong Polytechnic University, Tongji University, McGill University, Mila-Quebec AI Institute

2026-07-14强化学习规划控制安全鲁棒

面向自动驾驶在密集交通中少见但高风险的交互长尾场景,论文提出 AWM:把世界模型改造成角色条件化对手,在共享自回归 rollout 中用反事实信用分配学习稀疏攻击联盟,再以冻结对手训练规划器的鲁棒最优响应。nuPlan 和 InterPlan 结果显示,其能生成可迁移对抗交互,并在保持常规闭环表现的同时提升高交互难例和尾部风险指标。

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control Figure 1
2026-07-14cs.RO

Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control

Jun Chen, Erdent Bao, Wenlong Dong, Jierui Liu, Qi Cai, Hao Wan, Shaopeng Li, Weijun Qin, Jing Liang, Huiping Zhuang

University of Electronic Science and Technology of China, Huazhong University of Science and Technology, Southern University of Science and Technology, South China University of Technology, EbTech Co. Ltd.

2026-07-14规划控制

这篇论文针对语言条件模仿学习中多步组合任务难泛化、层级策略联合训练易不稳定和技能码本坍塌的问题,提出 DASL:用低频语义策略预测可解释离散技能,高频控制策略在技能条件下结合潜空间扩散和 Decision Transformer 生成动作,并通过异步调度解耦推理与执行。实验覆盖 LOReL、Franka Kitchen、CALVIN、BabyAI 及真实机械臂,报告相较 LISA、SkillDiffuser、LADS 等基线在成功率、组合泛化和实时效率上更优。

Underwater Dead Reckoning with Deployable Situation-Triggered Covariance Scheduling Figure 1
2026-07-14cs.RO

Underwater Dead Reckoning with Deployable Situation-Triggered Covariance Scheduling

Akshay Naik (1), Ramavarapu S. Sreenivas (2), Dustin Nottage (3), Ahmet Soylemezoglu (3) ((1) University of Illinois Urbana-Champaign, Department of Electrical and Computer Engineering, (2) University of Illinois Urbana-Champaign, Department of Industrial and Enterprise Systems Engineering, (3) U.S. Army Engineer Research and Development Center, Construction Engineering Research Laboratory)

2026-07-14机器人

水下机器人在无视觉、无外部定位时只能依赖 IMU、DVL、深度等信号,固定 EKF 噪声参数难以同时适应直行、转弯和传感器退化。论文提出 ST-CAR-EKF,用车载情境触发器在同一连续误差状态 EKF 中切换离线标定的 Q/R 协方差,不重置状态;在 BlueROV2 池内留出测试中,平移 RMSE 从 0.488 m 降至 0.471 m,增益较小但各测试段一致。

BucketKD: A Safety-Aware Bucket-Based Knowledge Distillation Framework for End-to-End Motion Planning Figure 1
2026-07-14cs.RO

BucketKD: A Safety-Aware Bucket-Based Knowledge Distillation Framework for End-to-End Motion Planning

Md Nahidul Islam, Mohd Hasan Ali, Dipankar Dasgupta, Myounggyu Won

Mohd Hasan Ali is with the Department of Electrical and Computer Engineering, University of Memphis, Memphis, TN, United States

2026-07-14规划控制安全鲁棒

针对端到端自动驾驶规划模型过大、难以部署且现有 PlanKD 状态表示过粗和安全评估只看距离的问题,BucketKD 将关键环境变量划分为自适应非均匀桶,并用结合障碍物距离与 TTC 相对运动风险的 waypoint 注意力来蒸馏安全关键行为。在 CARLA 的 Bench2Drive 实验中,其在保持压缩率的同时,相比现有学生模型提升了规划精度与安全指标。

SLIDER: Sparse History-Guided Aerial Robot Target Search using Sliding Local Maps Figure 1
2026-07-14cs.RO

SLIDER: Sparse History-Guided Aerial Robot Target Search using Sliding Local Maps

Xiaolei Hou, Zheng Pan, Hua Lan, Zhenghao Zou, Yinhong Chen, Chenxi Zhu, Yang Lyu, Jinwen Hu, Chunhui Zhao

2026-07-14机器人

面向无人机在大规模未知环境中搜索目标时全局稠密地图占内存、候选视点过多导致规划延迟的问题,SLIDER用局部滑动地图结合稀疏历史位姿和拓扑信息,以传感器模型评估观测质量并增量聚类视点,从而减少全局重建和重聚类开销。仿真与实机实验显示,其在内存占用、决策延迟和搜索效率上优于代表性方法,但极端遮挡或死锁场景的鲁棒性仍有限。

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation Figure 1
2026-07-14cs.RO

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee, Sangtae Ahn

2026-07-14机器人生成模型安全鲁棒

SUREFlow针对生成式机器人操作策略在噪声、部分可观测和长时序 rollout 中小速度误差累积导致不稳定的问题,将 Mamba 状态空间骨干与条件流匹配结合,并显式预测动作速度及输入相关残差不确定性,用 URFlow 只细化高不确定动作维度,MGAD增强多模态时序条件。在 LIBERO 上平均成功率达92.5%,较 MaIL 高34.2%,在 LIBERO-PRO 约49%,以179M参数接近部分3-7B VLA表现。

Large Language Model Enhanced Differentiable Trajectory Planning for IoT-Enabled Autonomous Driving Figure 1
2026-07-14cs.RO

Large Language Model Enhanced Differentiable Trajectory Planning for IoT-Enabled Autonomous Driving

Shihao Zhang, Jing Yang, Ziyu Song, Zheng Lin, Sunil Prajapat, Zhaochen Xia, Hemant Ghayvat, Haitao Ding, Lip Yee Por, Ashok Kumar Das

2026-07-14规划控制

本文针对模仿学习规划器在复杂长尾交互中数据覆盖不足、与后端约束优化不一致、难以利用高层语义的问题,提出结合周车轨迹重组增广、复杂度感知异步 LLM 语义增强和可微轨迹优化的统一框架。方法在 nuPlan Hard20 闭环非反应/反应设置取得 83.63 和 78.29 总分,并用 CARLA-ROS 展示实时部署能力,但具体增益拆分仍需看消融是否充分。

Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household Environments Figure 1
2026-07-14cs.RO

Interleaved POMDP Planning for Multi-Object Search in Unknown Multi-Room Household Environments

Ruochu Yang, Ziyi Xia, Huibo Zhang, Yatong Han, Yiming Zhao, Yingke Li, Fumin Zhang, Yorai Wardi, Mengxue Hou

Georgia Institute of Technology, USA. 2 The Hong Kong University of Science and Technology, China. 3 Ising AI, China. 4 MIT, USA. 5 Notre Dame University, USA.

2026-07-14强化学习规划控制

这篇论文针对家庭机器人在未知多房间、遮挡和障碍物不确定环境中搜索多个物体时,传统 POMDP 难以扩展且导航风险高的问题,提出 Inter-POMDP:让高层 POUCT 用 LLM 语义先验维护物体分布信念,低层运动规划用障碍感知粒子信念估计导航代价,并将几何风险反哺高层决策。仿真和真实实验显示,相比基线碰撞数最多降 63%,导航步数降 35%,检测次数降 32%。

Tracking Through Decoupling Singularities: A Singularity-Robust Homotopy-Continuation Extension of Feedback Linearization Figure 1
2026-07-14eess.SY

Tracking Through Decoupling Singularities: A Singularity-Robust Homotopy-Continuation Extension of Feedback Linearization

Alex Borisevich

2026-07-14视觉感知安全鲁棒

本文针对反馈线性化在解耦矩阵失秩时控制量发散、轨迹无法穿越奇异点的问题,将跟踪改写为实时弧长同伦延拓,并用增广矩阵的 Moore-Penrose 最小范数解替代直接求逆。其关键洞察是横截条件可在孤立秩一退化处保持增广系统满秩,从而有界穿越并在远离奇异集时近似恢复原反馈线性化;仿真显示机械臂和 DC/DC 变换器中速度或控制需求显著低于朴素逆法,误差约为 O(1/k),但实物验证文中未充分说明。

CSI-Assisted Edge SLAM Testbed Platform for 5G Connected Unmanned Autonomous Vehicles Figure 1
2026-07-14cs.NI

CSI-Assisted Edge SLAM Testbed Platform for 5G Connected Unmanned Autonomous Vehicles

Boris Radovanovic, Sasa Talosi, Srdjan Sobot, Dejan Vukobratovic

2026-07-14机器人

面向5G/6G联网移动机器人将计算密集型SLAM卸载到边缘时的低时延、同步和跨层集成难题,本文搭建了CSI辅助Edge SLAM测试床,将自研UGV、ROS2 SLAM框架与5G O-RAN连接起来,并分析DDS/RTPS到5G用户面的数据链路,提出通过O-DU或RIC/xApp暴露CSI作为额外感知输入。结果主要是验证平台可用于真实通信感知协同实验,揭示延迟、数据流、同步和系统集成瓶颈;SLAM精度或性能增益文中未充分说明。

ABot-N1: Toward a General Visual Language Navigation Foundation Model Figure 1
2026-07-14cs.CV

ABot-N1: Toward a General Visual Language Navigation Foundation Model

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu

2026-07-14机器人

针对通用视觉语言导航中端到端策略易坐标漂移、长尾语义处理弱且难解释的问题,ABot-N1将慢速VLM推理与快速控制解耦,用CoT和像素目标作为统一接口覆盖点目标、物体、POI、指令和跟人导航。其在5类基准上达到SOTA,POI到达率提升至77.3%,室内/室外点目标成功率达95.4%/92.9%,但增益可能部分来自数据与后训练规模。

Navigating the Crowd: Non-linear MPC with Social Forces Dynamics for Human-Aware Robot Navigation Figure 1
2026-07-14cs.RO

Navigating the Crowd: Non-linear MPC with Social Forces Dynamics for Human-Aware Robot Navigation

Stefano Trepella, Andrea Ostuni, Mauro Martini, Pablo Pueyo, Noé Pérez-Higueras, Marcello Chiaberge, Fernando Caballero, Luis Merino

2026-07-14机器人规划控制

面向人群环境中机器人既要避障又要保持社交距离的问题,论文提出 SFM-NMPC,将社会力模型嵌入非线性 MPC 的人群动力学预测和社交代价中,使机器人与行人轨迹在优化环内联合预测。仿真在开放空间、走廊和狭窄通道等场景中对比 MPPI、DWB、ORCA、SARL 等方法,结果显示其在社交合规指标上更优,同时保持导航效率、轨迹平滑性和约 20Hz 实时运行。

Robotic Contextual Awareness for Human-Robot Collaboration and Environmental Understanding Figure 1
2026-07-14cs.RO

Robotic Contextual Awareness for Human-Robot Collaboration and Environmental Understanding

Federico Rollo

2026-07-14机器人

面向制造、物流、医疗等开放人机共处场景,论文关注移动机器人缺乏上下文感知导致难以安全协作的问题。核心思路是把个性化行人重识别/跟踪与几何、语义环境理解结合:提出CARPE-ID及持续学习图像池缓解遗忘,并改进LiDAR SLAM、回环检测和反射滤波。结果显示可更稳定地跟随特定人员、生成更可靠地图并提升复杂室内环境中的定位与识别鲁棒性。

VINE: Taming Generative Control Policies for Reinforcement Learning Figure 1
2026-07-14cs.RO

VINE: Taming Generative Control Policies for Reinforcement Learning

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

The Hong Kong University of Science and Technology, Peking University

2026-07-14生成模型强化学习规划控制

VINE关注生成式机器人控制策略在用价值梯度强化学习微调时易失稳的问题,指出根因不在多步迭代生成本身,而在为行为克隆设计的传统采样路径不适合价值驱动的分布迁移。其核心做法是在每个去噪步重构插值状态并重新注入噪声,使流匹配策略仍保留表达力和迭代采样,同时支持端到端价值反传;实验在OGBench离线RL和真实机器人操作任务上优于多种基线。

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving Figure 1
2026-07-14cs.RO

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving

Kang Ding, Zhigui Lin, Hongsong Wang, Jie Gui, Qi Liu, Zhe Wang, Luqi Tang, Lei He

2026-07-14规划控制

PrismAD针对端到端自动驾驶中交互、道路几何与导航意图被混合到同一表示、削弱专门推理和可解释性的问题,提出按语义拆分token,并用独立规划专家分别建模,再由语义路由器为运动预测和自车规划分配不同权重、支持稀疏激活。实验显示其在nuScenes开环、NeuroNCAP闭环及转弯场景中相对强基线提升了规划精度、安全性和鲁棒性。

Soft Eversion Robots for Colonoscopy: Challenges, Open Problems, and Emerging Solutions Figure 1
2026-07-14cs.RO

Soft Eversion Robots for Colonoscopy: Challenges, Open Problems, and Emerging Solutions

Cem Suulker, Thomas Mack, Qingzheng Cong, Neri Niccolò Dei, Reza Kashef, Mohammad Sheikh Sofla, Kaspar Althoefer

2026-07-14机器人

针对传统结肠镜带来的疼痛、摩擦和穿孔风险,本文综述软体外翻机器人用于结肠镜的关键瓶颈。其核心洞察是,现有方案并非单纯导航不足,而是在软顺应性、末端转向、载荷/器械递送和紧凑基站之间存在难以同时满足的三难权衡。对四类代表性设计的对比显示,长度、直径和弯曲能力已有部分方案接近临床需求,但无方案同时实现无摩擦软体推进与可靠载荷递送;未来应优先发展内通道载荷递送、柔性末端转向和更真实的柔性肠道模型验证。

PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation Figure 1
2026-07-14cs.RO

PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu

2026-07-14机器人生成模型

这篇论文针对动态密集环境中移动机器人既要安全可行又要低延迟重规划的问题,提出 PIER-Flow:用 MPC 专家蒸馏训练整流流策略,并把可微运动学 rollout 放入训练目标,推理时单步并行生成多个 action chunk,再用轻量可行性选择器筛选。实验报告仿真成功率 98.85%、零碰撞、平均 1.29 ms,边缘端约 5.3 ms,较 MPC 和扩散策略显著降延迟。

Diffusion-Residual Model Predictive Steering Control for Vehicle Stabilization at the Limit of Handling under Model Uncertainty Figure 1
2026-07-14cs.RO

Diffusion-Residual Model Predictive Steering Control for Vehicle Stabilization at the Limit of Handling under Model Uncertainty

Bongsob Song

with the Department of Mobility Engineering, Ajou University, Suwon, South Korea

2026-07-14生成模型规划控制安全鲁棒

该文针对车辆极限操稳下名义自行车模型误差导致MPC参考过激或约束过保守的问题,提出用条件扩散残差模型离线给出残差均值与不确定性:均值重定 yaw 参考,方差用于机会约束收紧稳定包络。仿真中D-res在7自由度模型和CarMaker多车型/路面/工况上降低峰值侧偏角,并在低附着场景恢复方向稳定;在线仅查表,Jetson AGX Xavier最坏4.08 ms,仍限于仿真域内验证。

Source-Lifted Flow Matching for Intervenable Multimodal Imitation Figure 1
2026-07-14cs.RO

Source-Lifted Flow Matching for Intervenable Multimodal Imitation

He Zhang, Ying Sun, Pengteng Li, Ziyang Chen, Yiren Zhao, Ziyang Rao, Weiyu Guo, Yandong Guo, Hui Xiong

2026-07-14视觉语言生成模型模仿学习

这篇论文针对流匹配模仿学习只能被动采样多种行为、难以在同一状态下指定后续策略的问题,提出 SL-FM:不把离散模式输入速度场,而是通过正交源提升让不同 source handle 在辅助坐标中保持可分,从而用共享无潜变量速度场实现可干预的多模态控制。实验显示其能消除交叉流导致的混合轨迹,在 D3IL 同前缀干预中 91.1% 改变未来路线,并在 D3IL、PushT 等基准上保持较强自由部署表现。

ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception Figure 1
2026-07-14cs.RO

ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception

Weichen Zhang, Shiquan Yu, Yinan Zhu, Peizhi Tang, Shilong Ji, Zhiyuan Deng, Tianyi Lyu, Haoyang Wang, Xin Zeng, Chen Gao, Yong Li, Xinlei Chen

Tsinghua University

2026-07-14视觉语言视觉感知

本文针对无人机具身感知中高层问答推理与低层飞控执行脱节的问题,提出 ActiveFly-Bench,将空中 EQA、观察行为规划和细粒度语言引导控制对齐到同一轨迹体系,并引入包含机体与云台的 7DoF 视角控制。实验和实机部署显示,现有 VLM/VLA 框架在行为规划与视角调整上仍明显不足,说明瓶颈不只是语义理解,也在可执行观察策略。

On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation Figure 1
2026-07-14cs.RO

On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation

Finn Ferchau, Daniel Pommer, Cristian Axenie

2026-07-14机器人视觉语言视觉感知

面向工业机器人部署中全量微调显存高、数据上云风险大的问题,论文系统评估π0这类VLA模型的LoRA适配:在UR5e四个精密装配任务上扫描rank、容量分配与冻结策略。核心发现是VLM与动作专家均匀LoRA已足够,但视觉编码器仍需全量适配;r≈32后性能饱和,相比FFT无显著损失,同时静态峰值显存由36.2GiB降至10.8GiB。

From Non-Rigid to Rigid: Safe Acquisition of Rigid Communication Graphs under Limited Sensing Figure 1
2026-07-14cs.RO

From Non-Rigid to Rigid: Safe Acquisition of Rigid Communication Graphs under Limited Sensing

Saharsh, Vedhas Talnikar, Pushpak Jagtap

Department of Cyber Physical Systems, Indian Institute of Science

2026-07-14安全鲁棒

这篇论文针对多机器人在感知半径受限时常需预设刚性通信图的现实缺口,研究如何从非刚性拓扑安全获得刚性图。核心思路是在领导者-跟随者框架下,用仅依赖邻居相对状态的分布式二次优化/CBF控制,间接重构时变通信边并避免碰撞。作者给出异构非线性机器人形成刚性图与无碰撞运动的形式化保证,并通过仿真和动捕硬件实验验证有限感知下的可行性。

Millimeter Wave Radar: From Synthetic Aperture to Probabilistic Mapping Figure 1
2026-07-14cs.RO

Millimeter Wave Radar: From Synthetic Aperture to Probabilistic Mapping

Jui-Te Huang, Ruoyang Xu, Michael Kaess

2026-07-14机器人

这篇论文针对烟雾、雾等条件下激光/深度相机失效,而毫米波雷达成图又稀疏噪声大的问题,提出从原始车规毫米波信号经合成孔径处理到概率占据图的完整流程,并显式考虑遮挡与目标概率分布。实验在多种室内场景中与常见雷达处理和概率建图方法比较,还用路径规划表现评估地图可用性,结果显示该流程能生成更接近 LiDAR 的占据图,但也暴露了参数和天线配置敏感等部署限制。

TAC-LOCO: Unified Whole-Body Control for Quadrupedal TACtile-Informed LOCO-Manipulation Figure 1
2026-07-14cs.RO

TAC-LOCO: Unified Whole-Body Control for Quadrupedal TACtile-Informed LOCO-Manipulation

Muqun Hu, Yuhao Zhou, Kabir Ray Malik, Chi Lin, Won Suk Lee, Yu She, Yan Gu

Purdue University, University of Florida

2026-07-14机器人规划控制

TAC-LOCO针对四足机器人在移动操作中难以感知并调节物体受力的问题,将柔性夹爪的触觉阵列编码为紧凑表征,并与本体感知一起输入统一强化学习策略,同时控制腿、机械臂和夹爪。其关键在于让策略根据接触状态在线调整抓握,而非固定用力抓取;仿真与Unitree Go2零样机实验显示,抓握力降低47%,掉落率低于1%,动态操作成功率约90%。

Direct Rotor Thrust Sensing and Feedback Control for Disturbance Rejection of Multirotors Using Load-cells Figure 1
2026-07-14cs.RO

Direct Rotor Thrust Sensing and Feedback Control for Disturbance Rejection of Multirotors Using Load-cells

Peter Böhm, Michael Brünig, Peyman Z. Moghadam, Pauline E.I. Pounds

2026-07-14规划控制

本文针对多旋翼在阵风、垂向入流和地效下需等机体运动受扰后才能估计补偿的问题,提出在每个旋翼处用低成本 load-cell 直接测量瞬时推力,并以高速内环闭环跟踪推力指令。单/双旋翼跷跷板平台和实飞机实验表明,尽管传感器噪声曾被认为难以使用,该方案仍可实现可行的推力调节,并提升复杂气动扰动下的姿态/推力扰动抑制效果。

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation Figure 1
2026-07-14cs.CV

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation

Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang

Zhejiang University, 2 Hunan University, 3 National University of Defense Technology, 4 Ant Group

2026-07-14视觉感知

本文针对事件相机与普通图像在无标签、传感器未严格对齐场景下难以建立像素级匹配的问题,提出两阶段蒸馏:先用大规模真实数据做无标签预训练,再以极线几何置信度引导目标域自蒸馏。实验在 MVSEC 与新构建的 TUM-VIE 跨模态位姿评测上达到 SOTA,自蒸馏相对零样本模型最高带来 21.9% 和 16.6% 提升,但部分收益可能也来自 scaling / data。

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness Figure 1
2026-07-14cs.CV

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness

Shunsuke Yokokawa, Hironori Kasahara

2026-07-14机器人

FlashBEV针对自动驾驶BEV感知中Sampling-VT在高分辨率、长距离和多高度采样下显存与延迟快速膨胀的问题,指出其本质是可独立累加的 gather-reduction,而非算法数学本身受限。方法将采样与归约融合为IO感知GPU执行,按线程局部累加并避免物化相机和高度中间张量,保持与Tensorized Sampling-VT精确等价。实验显示峰值显存降低超过一个数量级,结论中报告37倍显存下降和5.2倍前向加速,且显存基本不随高度bin增长。

Plug-and-Play Reweighting for Resilient Collaborative Decision-Making in Connected Autonomous Driving Figure 1
2026-07-14cs.RO

Plug-and-Play Reweighting for Resilient Collaborative Decision-Making in Connected Autonomous Driving

Jiewen Liu, Rui Liu, Matthew Lee, Ming C. Lin, Xiaorui Liu, Peng Gao

2026-07-14机器人

面向车联网自动驾驶中的协同决策,论文关注感知噪声或恶意协作者会污染共享点云并诱发错误制动/避障决策的问题。RCDM在注意力式编码器-解码器中加入无需再训练的即插即用重加权模块,用局部邻域相对中位结构的一致性降低异常点影响。高保真仿真覆盖噪声和五类攻击,在事故高风险场景中较现有方法最高提升约26%。

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation Figure 1
2026-07-14cs.RO

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

Alex Zongo, Peng Wei

2026-07-14安全鲁棒

本文关注城市低空小型无人机在 GNSS 多路径、遮挡或干扰下,学习型避碰策略会因状态观测失真而失效的问题。核心洞察是,与其用手工 CBF 在动作端强行覆盖策略,不如先估计不确定集合内最坏交通状态并作为保守观测输入,让已学到的多步避碰行为继续决策。实验显示动作过滤几乎不提升安全性,而观测过滤可将近距空中冲突减少约 90%,且对 CBF 参数更稳健。

PinFT: Miniature 5-Axis Force/Torque Sensor Embeddable to Tweezer-like Tool Figure 1
2026-07-14cs.RO

PinFT: Miniature 5-Axis Force/Torque Sensor Embeddable to Tweezer-like Tool

Leo King, Jenny Chen, Tae Myung Huh

2026-07-14机器人

面向机器人使用镊子等手持工具时缺少真实尖端力反馈的问题,PinFT将三层PCB、分段通孔电极和硅胶介质做成可嵌入镊尖的五轴电容式力/力矩传感器,强调逐尖端而非夹爪端测量。原型标定后力误差约0.23 N、力矩误差约2.5 mN·m,R²均超过0.97,并在夹取SMD电容、拔模拟毛发和撕裂硅胶任务中识别滑移、弹出等失败特征。

Chalito: An Extensible Library for Filtering-Based State Estimation in Quadruped Robots Figure 1
2026-07-14cs.RO

Chalito: An Extensible Library for Filtering-Based State Estimation in Quadruped Robots

Hilton Marques Souza Santana, João Carlos Virgolino Soares, Marco Antonio Meggiolaro, Claudio Semini

2026-07-14机器人

这篇论文针对四足机器人状态估计实现常绑定特定机器人、传感器和软件栈,导致滤波器难以公平复现与比较的问题,提出 Chalito/PyChalito:一个由 URDF 驱动、滤波器无关的 MATLAB/Python 基准库,抽象李群状态、滤波器、测量和接触管理接口。作者用仿真收敛、合成 Monte Carlo 和真实公开数据评估,覆盖两类滤波器与六种机器人,展示其可用于比较精度与一致性,但具体性能增益主要来自框架化评测而非新估计算法。

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning Figure 1
2026-07-14cs.RO

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

The authors are with TCS Research, Tata Consultancy Services Ltd., Bengaluru - 560066, Karnataka, India. ∗ Corresponding author, e-mail:

2026-07-14机器人规划控制

面向零售补货/拣选中开放货架、窄通道和执行失败带来的规划难题,论文将LLM的高层任务分解与VLM的场景 grounding 结合,并用执行反馈维护状态、迭代修正规划。系统在PyBullet中的双臂全向移动机器人上完成多物品取放、无效指令拒绝和错误计划自纠,但实验主要为仿真验证,真实门店泛化与量化增益文中未充分说明。

SEAMLiS: Visibility-Aware Safety for Perception-Limited Multi-Robot Exploration Figure 1
2026-07-14cs.RO

SEAMLiS: Visibility-Aware Safety for Perception-Limited Multi-Robot Exploration

Taekyung Kim, Rahul H Kumar, Aswin D. Menon, Tzu-Hsiang Lin, Dimitra Panagou

Department, Department of Mechanical Engineering, University of Michigan, Ann, modules. This design preserves the scalability and ef-

2026-07-14机器人安全鲁棒

针对有限视距和有限视场下,多机器人探索可能因传感器朝向追逐信息增益而过晚发现隐藏障碍的问题,SEAMLiS在不替换上游目标分配和规划器的情况下,于执行层加入可见性感知偏航门控与CBF位置安全滤波,确保关键未知边界保有制动余量。仿真、Isaac Sim和Crazyflie实机结果显示,其在测试的单/多机器人场景中实现无碰撞探索,并基本保留信息增益偏航的效率。

A Numerically-Robust ROS 2 Port of iG-LIO: Diagnosing and Fixing Toolchain-Induced Failures in Incremental GICP LiDAR-Inertial Odometry Figure 1
2026-07-14cs.RO

A Numerically-Robust ROS 2 Port of iG-LIO: Diagnosing and Fixing Toolchain-Induced Failures in Incremental GICP LiDAR-Inertial Odometry

Afonso E. Carvalho, David Portugal, Paulo Peixoto

Robotics Institute (RI), Carnegie Mellon University (CMU), Pittsburgh, USA.Institute of Systems and Robotics (ISR), University of Coimbra (UC), Coimbra, Portugal.

2026-07-14安全鲁棒

这篇技术报告关注将已停止维护于ROS1生态的iG-LIO迁移到ROS2 Jazzy时,原算法未变却出现NaN发散的问题。核心洞察是故障来自工具链与中间件而非估计模型:QoS不匹配会丢失/乱序IMU,oneTBB与Eigen的未初始化归约累加器会污染Hessian。作者给出可靠QoS、时间步检查和零初始化归约封装,并修正多类雷达解析;在Ouster OS0/OS1 Rev7与Livox MID-360上验证,轨迹与ROS1版本定性一致。

Diffusion for Long-Horizon Multi-Robot Path Planning in Human-Shared Environments Figure 1
2026-07-14cs.RO

Diffusion for Long-Horizon Multi-Robot Path Planning in Human-Shared Environments

Vaibhav Sanjay, Yorai Shaoul, Jiaoyang Li

Vaibhav Sanjay, Yorai Shaoul, and Jiaoyang Li are with the Robotics Institute, Carnegie Mellon University.

2026-07-14机器人生成模型规划控制

这篇论文针对人群共享空间中的多机器人长时域导航:既要机器人间协调避碰,又要保持接近人类行走习惯。核心做法是 MRRD,将滚动时域扩散生成、基于紧迫度的速度调节、差异化引导和 CBS 冲突消解结合,把人-机器人交互交给扩散先验、机器人间冲突交给搜索。实验显示其可实时扩展到约 15 台机器人,并在拥挤场景中提升安全性和任务成功率。

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning Figure 1
2026-07-14cs.RO

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

2026-07-14强化学习

论文针对离线到在线机器人强化学习中价值函数可靠性难以诊断的问题,提出 Robo-ValueRL:用历史条件价值估计器评估全局进度与局部动作偏好,并将价值信号用于质量条件策略预训练和在线残差适配。240 小时离线数据与 3000 多条在线轨迹表明,可靠价值估计与下游性能强相关,芯片插入和积木拆解成功率分别达 86% 和 84%,但部分增益可能主要来自数据规模与系统集成。

More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning Figure 1
2026-07-14cs.RO

More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning

Yi Li (TU Darmstadt), Alexandre Chapin (LIRIS), Liming Chen (LIRIS), Jan Peters (TU Darmstadt), Alap Kshirsagar (IIT Delhi, ADU)

2026-07-14模仿学习

本文关注视觉模仿学习中预训练编码器会混合任务相关与无关线索、影响未见物体和目标位置泛化的问题。核心洞察是增加容量或 token 数不如引入物体中心结构:冻结 DINO 上的 SPOT Slot Attention 将图像压成对象槽。PickCube 中在相同策略下成功率达 55.0%,较全局 DINO 高 22.4%;加入 2D 空间目标和原生分辨率后升至 68.7%,接近 3D oracle 的 71.7%。

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging Figure 1
2026-07-14cs.RO

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

2026-07-14视觉语言视觉感知

这篇论文针对现有 VLA 将动作生成简化为自回归 next-token 预测、难以显式建模长时序动作结构的问题,提出 TS-Mask VLA:用离散扩散动作专家和 Bridge Attention 接收 VLM 多层条件,并在时间-动作维度二维网格上做结构化 masking 与迭代重掩码生成。0.5B 模型在 LIBERO 达到 95.7% 成功率,在 CALVIN 平均序列长度 4.19,并报告真实机器人验证。

RASR: Range-Aware Scale Recovery for Metric UAV Navigation Figure 1
2026-07-14cs.RO

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics, China, Shenzhen International Graduate School, Tsinghua University, China, 3 Noah Ark Lab, Huawei, China, College of Automation Engineering, Nanjing University of Aeronautics and Astronautics, China, College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, China, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics, China Nanjing and Shenzhen China

2026-07-14机器人

这篇论文面向 GNSS 受限下无人机最后一段视觉导航中“图像对到可执行距离与航向命令”的尺度不准问题。RASR 的核心做法是把冻结的 MASt3R 式成对几何压缩为描述子,先做全局尺度恢复,再用按距离分桶的残差校正和命令网格对齐处理 PairUAV 协议下近距离相对误差更敏感的现象。实验显示其在 PairUAV 官方在线评测中总分达到 0.003189,但协议相关校准对泛化贡献仍需谨慎解读。

A Biomimetic Myoelectric Tentacle Prosthesis with Sensorless Object Detection and Vibrotactile Feedback Figure 1
2026-07-14cs.RO

A Biomimetic Myoelectric Tentacle Prosthesis with Sensorless Object Detection and Vibrotactile Feedback

Gabrielle Marion, Olivier Lecompte, Amandine Gesta, Abolfazl Mohebbi

Department of Mechanical Engineering

2026-07-14视觉感知强化学习

针对传统仿人假手难以适应多形状抓取且缺少触觉反馈导致认知负担高的问题,本文设计了肌电控制的仿生卷曲触手机构:以对数螺旋分段结构包覆物体,用电机电流斜率实现无外部传感器接触检测,并以累积振动反馈提示弯折区域。实验显示平均响应约77 ms、物体检测成功率超过90%,用户可较可靠识别触手构型,但长期佩戴适应性与日常任务泛化文中未充分说明。

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation Figure 1
2026-07-14cs.RO

A Comprehensive Survey and Systematic Real-World Evaluation of Embodied Vision-and-Language Navigation

Liuyi Wang, Kai Sheng, Zongtao He, Jinlong Li, Yongrui Qin, Haojie Dai, Xiangyi Wang, Jingwei Yang, Qingqing Yan, Chengju Liu, Qijun Chen

2026-07-14机器人视觉感知强化学习数据集/基准

本文针对视觉-语言导航长期依赖仿真基准、缺少真实机器人验证的问题,系统梳理层级式/端到端动作范式与判别式/生成式模型范式,并在10个真实场景中测试代表性配置。结果显示仿真到现实落差显著:单体RGB方法成功率由61%降至22%,层级框架真实成功率达51%,提示当前瓶颈主要在感知、决策与控制鲁棒性。

Maximizing Human Efficiency in Large-Scale Robot Post-Training via VLAC-Cut Guided Pipeline Figure 1
2026-07-14cs.RO

Maximizing Human Efficiency in Large-Scale Robot Post-Training via VLAC-Cut Guided Pipeline

Shaopeng Zhai, Qi Zhang, Tianyi Zhang, Haoran Zhang, Fuxian Huang, Zhanhui Lin, Zijun Xu

Continuous Learning Team, Shanghai AI Lab

2026-07-14机器人

这篇论文把真实机器人 VLA 后训练的瓶颈从样本效率转向人力效率:少量操作员要同时支撑多机器人迭代采数、干预和复位。核心做法是将远程接管与现场监控复位分工,并用 VLAC-CUT 自动切分轨迹,保留推进和恢复片段、过滤空转与致错片段。四个真实操作任务中,最终成功率达 80%–95%,吞吐较基座提升 1.7–4.2 倍,且在相同人工干预预算下优于仅 HITL 训练。

A Risk-Field Enhanced Closed-Loop Digital Twin Framework for Autonomous Driving Safety Validation Figure 1
2026-07-14cs.RO

A Risk-Field Enhanced Closed-Loop Digital Twin Framework for Autonomous Driving Safety Validation

Yongzhi Liu

School of Mechanical Engineering, Southeast University

2026-07-14安全鲁棒

针对自动驾驶安全验证中实车测试昂贵、罕见危险场景难复现且离线仿真难闭环的问题,论文提出将风险场嵌入数字孪生验证流程,用障碍物、车道偏离、边界、TTC和舒适性风险统一驱动场景排序、评估与强化学习训练。仿真式评估显示其可提升训练稳定性、碰撞规避和轨迹完成表现,但实际有效性仍受模型保真度、风险标定和 sim-to-real 迁移限制。

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World Figure 1
2026-07-14cs.RO

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

Xiaoyun Dong, Qian Xu, Yang Lu, Yang Lou, Yung-Hui Li, Jianping Wang

2026-07-14强化学习安全鲁棒

针对自动驾驶安全关键场景稀缺且真实闭环测试危险的问题,OmniSCS从行车日志构建可编辑驾驶世界,通过双策略智能体重建、深度细化背景重建,以及物体插入和轨迹编辑,同时合成外观级与行为级风险场景。实验显示其在nuScenes、Waymo、KITTI上提升编辑后场景保真度,训练增强带来感知mAP提升约5.3%、碰撞率降低9.7%,并支持13Hz闭环测试。

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems Figure 1
2026-07-14cs.RO

LLM-Centric Agentic AI for UAV Swarms: Architecture, Enabling Technologies, and Open Problems

Yousef Emami, Rahim Taheri, Mohammadhossein Homaei, Muhammad Atif Ur Rehman, Mohammad Shojafar

2026-07-14机器人

针对无人机蜂群在真实任务中受态势感知不足、链路不稳和安全威胁制约的问题,论文提出以 LLM 为中心的 LAUS 闭环智能体架构,将感知、记忆、工具调用、规划与治理结合,把高层任务转为蜂群动作。其主要洞察是安全风险集中在感知到推理接口;PMA 案例中仅篡改观测输入就使 LLM 调度代价从 121.2 升至 1720.3,显示该架构需配套抗幻觉、轻量部署和安全基准。

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving Figure 1
2026-07-14cs.RO

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving

Chengyue Wang, Bin Rao, Haicheng Liao, Bonan Wang, Chengzhong Xu, Zhenning Li

2026-07-14生成模型强化学习规划控制

这篇论文针对自动驾驶轨迹预测中过度依赖数据驱动、难以刻画远距离传播与交通状态变化的问题,提出 SWIFT:用小世界交互网络引入局部聚集和全局可达的结构先验,并用交通流状态编码器动态调节交互图,再通过多关系图推理建模直接与高阶关系。作者在 nuScenes、MoCAD、NGSIM 上报告其在精度、跨场景泛化、噪声鲁棒性和少样本训练下均优于强基线。

Saturation-Aware Robust Trajectory Optimization for Reusable Launch Vehicles via Differentiable Physics Figure 1
2026-07-14cs.RO

Saturation-Aware Robust Trajectory Optimization for Reusable Launch Vehicles via Differentiable Physics

Liwei Chen, Tong Qin

Beijing Institute of Aeronautical Systems Engineering, Beijing 100076, China

2026-07-14规划控制优化算法安全鲁棒

本文针对可复用火箭高攻角翻转着陆中非线性气动扰动与执行器饱和会破坏传统鲁棒轨迹优化保证的问题,提出可微物理框架下的 DPTC,将不确定状态表示为粒子集合,并把硬执行器投影嵌入计算图,联合优化前馈轨迹与时变反馈。6 自由度蒙特卡洛结果显示,相比 AD-SCvx 加协方差控制基线,该方法通过主动保留控制余量降低饱和风险,使 CEP50 降低 87%,但真实飞行可迁移性仍需进一步验证。

The Individual-Targeting Assumption: A Systematic Review of Proactive Robots in Human Group Settings Figure 1
2026-07-14cs.HC

The Individual-Targeting Assumption: A Systematic Review of Proactive Robots in Human Group Settings

Tauhid Tanjim, Tasmia Mayen, Malte F. Jung, Susan R. Fussell

*This work was not supported by any organization 1 T. Tanjim, M. F. Jung, S. R. Fussell are with the Department of Information Science at Cornell University, Ithaca, NY 14850, USA

2026-07-14机器人

这篇综述关注公共场景中主动机器人常面对的并非孤立个体,而是已有关系和共同注意的人群。作者通过梳理63篇2000至2025年的群体HRI研究,提出“个体目标化假设”这一诊断框架,指出60.3%的研究仍把共在者当作独立交互目标;主要失败模式包括参与误判、社会认可盲区和旁观者忽视,而机器人如何在接触前识别并进入既有群体仍基本缺位。

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving Figure 1
2026-07-14cs.RO

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving

Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

2026-07-14机器人

面向自动驾驶中车辆数量变化、交互博弈强且实时性受限的高层决策问题,论文提出 DecisionPerceiver,将动态交通参与者特征投影到固定潜空间,并用潜查询数调节交互表示粒度,同时细化换道与速度动作离散。基于 PPO 的三类场景实验显示,其在高速、路口和环岛任务中总体提升速度跟踪、碰撞控制与泛化表现,并在车辆数增加时展示较好可扩展性。

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments Figure 1
2026-07-14cs.RO

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments

Aachal Sharma, Narendra Kumar Dhar

Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi, Himachal Pradesh 175005, India.

2026-07-14机器人

面向杂乱、动态环境中机械臂难以同时处理高层任务推理、低层避障规划与安全裕度的问题,RoboNav-Arm 将 LLM 决策代理、对象级3D场景理解、上下文记忆、MoveIt碰撞场景更新和多规划器选择结合起来,并在执行中持续监测与重规划。文中在 Gazebo Classic 多障碍场景验证了较好的鲁棒性,但主要结果偏仿真展示,真实机器人效果文中未充分说明。

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction Figure 1
2026-07-14cs.AI

Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction

Yuchen Wang, Javal Vyas, Tong Liu, Mehmet Mercangoz

School of Computer Science, University of Sheffield, Department of Chemical Engineering, Imperial College London

2026-07-14规划控制

面向工业闭环控制中自然语言需求难以快速落地、云端大模型又有延迟与数据敏感问题,论文将经 GRPO 规则对齐的 Qwen2.5-1.5B 小模型嵌入动作生成、符号/数字孪生校验与重提示自纠的多智能体回路。随机热控仿真中,方法达到 91.5% 动作一致率、平均 3.84 秒推理延迟,符号重映射下仍保持 95% 在范围率;但硬件实测、复杂多变量场景和尾延迟文中未充分说明。

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos Figure 1
2026-07-14cs.RO

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos

Yifan Zhong, Zhang Chen, Tianrui Guan, Fanlian Zeng, Yuyao Ye, Tianjia He, Ka Nam Lui, Jiayi Li, Tingrui Zhang, Ruilin Yan, Xinhao Ji, Guangyu Zhao, Wenjie Lou, Jiayuan Zhang, Yuanpei Chen, Yaodong Yang

Institute for AI, PKU, 2 PKU-PsiBot Joint Lab, 3 UPenn

2026-07-14机器人视觉感知

EgoSteer针对灵巧手机器人缺少大规模、语言对齐且动作准确数据而难以按开放指令操作的问题,提出从第一视角人类视频到真机后训练的全栈方案:EgoSmith清洗标注9.6K小时视频,结合遥操作/DAgger纠错与带世界模型目标的VLA。实验显示其在40余项任务平均成功率约75%,并能少样本适配折盒等长程任务,但收益可能主要来自scaling / data与系统工程协同。

2026-07-13

33 篇
B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations Figure 1
2026-07-13cs.RO

B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations

Xiaoshen Han, Haoyu Xiong, Haonan Chen, Chaoqi Liu, Antonio Torralba, Yuke Zhu, Yilun Du

2026-07-13机器人强化学习

这篇论文针对视觉运动策略“能成功但执行慢”的问题,指出固定长度动作 chunk 的均匀时间分辨率和段间不连续会限制高速操作。核心做法是让策略直接预测 B-spline 的节点和控制点,用连续动作曲线替代离散动作序列,并在推理时做时间缩放与段对齐。实验显示该表示可接入 Diffusion Policy、ACT 等框架,在仿真和真实任务中缩短完成时间,同时保持或提升成功率。

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers Figure 1
2026-07-13cs.RO

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

Yujie Pang, Zudong Li

2026-07-13机器人

面向工业精密接触操作,论文针对ACT等动作分块策略仅靠行为克隆易受分布偏移和接触力失控影响的问题,提出PAC-ACT,将预训练ACT改造成块级Actor-Critic后训练,并用混合行为先验约束限制策略漂移。实验显示其在Metal Touch和Square Assembly上提升成功率、接触稳定性与力安全,Contour中>60N力读数减少46倍,同时保持接近ACT的低延迟和显存占用。

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination Figure 1
2026-07-13cs.RO

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

2026-07-13机器人生成模型

针对无通信、多机器人在局部可观测下同一观测对应多种协作动作、导致确定性蒸馏取均值失效的问题,CoDiMAD先用全局信息训练MAPPO特权教师,再把局部观测到教师动作的数据蒸馏为条件扩散策略,以采样保持多模态动作分布。三类协作任务中,它相较本地MARL和确定性蒸馏取得更好表现,并用分析支持其减少模式平均的效果。

CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles Figure 1
2026-07-13cs.RO

CORAL-AUV: CFD Oriented Reinforcement Learning for Autonomous Underwater Vehicles

Steven Roche, Milo Van Mooy, Nathan McGuire, Levi Cai, Jonathan P. How, Yogesh Girdhar

2026-07-13强化学习

这篇论文针对AUV在载荷和水动力变化下控制器难调、仿真到真实迁移受阻的问题,将CFD计算得到的阻力数据蒸馏为神经网络代理阻力模型,并嵌入强化学习训练,以较低开销保留高保真流体效应。实验显示,相比简化物理模型控制器,该方法在航点任务中能耗降低31%、速度提升11%、误差降低19%,且在尾部增重扰动下是唯一成功迁移的策略。

Task-Adaptive Design of Modular Aerial Manipulators Under Airflow Exposure Constraints Figure 1
2026-07-13cs.RO

Task-Adaptive Design of Modular Aerial Manipulators Under Airflow Exposure Constraints

Mengguang Li, Heinz Koeppl

2026-07-13生成模型优化算法

论文针对多旋翼空中操作中旋翼气流会干扰敏感目标、环境及平台自身的问题,提出将任务力矩可行性、末端执行器位置和气流暴露约束统一纳入模块化构型优化。核心创新是用目标侧气流容忍分类和锥-球气流包络,把下洗扩散几何化并保持可优化性,同时联合优化末端位置而非预设。实验以可扩展性和消融验证框架有效,但具体实机收益文中未充分说明。

How Mobile Gas Sensor Trajectories Govern Hydrogen Leak Detection: A Safety Gap in Manual Leak Inspection of Hydrogen System Components Figure 1
2026-07-13cs.RO

How Mobile Gas Sensor Trajectories Govern Hydrogen Leak Detection: A Safety Gap in Manual Leak Inspection of Hydrogen System Components

Christian Masuhr, Arne Wendt, Thorsten Schüppstuhl

2026-07-13视觉感知安全鲁棒

本文针对氢系统人工嗅探检漏只规定压力、浓度和速度等标量、缺少探头空间轨迹约束的问题,利用机器人试验台隔离操作者差异,系统测量近场浓度与动态扫描效应。核心洞察是路径、姿态和速度共同决定可检出性:常规直线扫描在小泄漏和较高速度下会产生严重漏检,而按几何设计的环绕/下探轨迹可保持安全裕度,并据此给出轨迹规则、动态信号衰减模型及从3D模型生成检漏轨迹的原型流程。

DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting Figure 1
2026-07-13cs.RO

DemoBridge: A Simulation-in-the-Loop Toolkit for Single-View Human Demonstration Retargeting

Zehao Wang, Fabien Despinoy, Sergey Zakharov, Tinne Tuytelaars, Rahaf Aljundi

2026-07-13模仿学习

为降低机器人操作示教采集对遥操作、动捕或手套的依赖,DemoBridge尝试把单视角人手演示转成可执行机械臂轨迹。核心在于将抓取姿态选择、整臂/物体碰撞约束与路径跟踪放入统一轨迹优化,并用 Isaac Sim 逐阶段验证和失败回退重规划。实验覆盖3个真实示教任务和合成基准,显示整条重定向流程可生成动态稳定、可用于策略学习的仿真 rollout。

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps Figure 1
2026-07-13cs.RO

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps

Brendan Hertel, Jonathan Spanos, Navya Garg, Reza Azadeh

2026-07-13视觉语言模仿学习

机器人示教学习常只拟合空间轨迹,忽略接触力,导致受力任务复现不稳甚至触发安全限制。本文把力传感纳入一次示教流程,用自适应多模态概率分段提取力感知基元,并在弹性图中加入外力约束、以凸优化学习轨迹模型。五个真实操作任务、两类力传感配置验证显示,该方法能较好分段并降低执行受力,具备跨平台适用性。

Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation Figure 1
2026-07-13cs.CV

Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation

Hyungtae Lim, Nathan Hughes, Xihang Yu, Ruihan Xu, Yun Chang, Jingnan Shi, Rajat Talak, Luca Carlone

2026-07-13三维

这篇论文针对现有3D场景图只用点云、包围盒或类别模板粗略表示物体,难以支持接触推理、操作和户外大尺度建图的问题,提出Hydra++:在分层场景图中接入类别无关的物体形状估计,并用重投影掩码一致性检查过滤退化预测,同时融合LiDAR与相机深度。实验显示其在仿真和真实校园场景中提升了物体级与场景级重建质量,但不同形状估计器的泛化与实时性存在明显权衡。

PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation Figure 1
2026-07-13cs.RO

PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation

Haohui Huang, Junda Duan, Tao Teng, Chenguang Yang

2026-07-13机器人视觉感知

该文针对视频或RGB-D给出的物体运动先验难以直接落到具体机器人执行的问题,提出把抓取可行性从局部姿态判断改为“抓取诱导的整段TCP轨迹”评估,并用分层可达性门控筛掉不可达候选,再以语义掩码限制只在可放松的笛卡尔分量上优化可操作性。四个桌面任务中,完整系统成功率达88.75%,高于视觉运动、IK筛选和去掩码变体,且降低运动偏差与运动学失败。

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning Figure 1
2026-07-13cs.LG

Shortcut Trajectory Planning for Efficient Offline Reinforcement Learning

Guanquan Wang, Yoshimasa Tsuruoka

2026-07-13强化学习规划控制

论文针对离线强化学习中扩散轨迹规划推理步数多、而一致性规划又依赖教师-学生蒸馏导致训练成本和不稳定性的问题,提出 STP:用步长条件化的 shortcut 模型单阶段生成轨迹,并结合带可行性修正的 critic 选择候选计划。D4RL 的运动、导航、操作和灵巧控制实验显示其在保持较强性能的同时降低训练复杂度与推理开销。

Effects of Robotic Touch on Older Users During Walking Guidance by a Humanoid Robot Figure 1
2026-07-13cs.RO

Effects of Robotic Touch on Older Users During Walking Guidance by a Humanoid Robot

Leonie Leven, Marko Ackermann, Christian Werner, Melina Schmetterer, Theresa Buchner, Monika Eckstein, Katja Mombaur

2026-07-13机器人

面对老年照护人手不足与导航能力衰退,论文研究类人机器人步行引导中的触碰方式是否影响接受度与压力。24名老年人体验无接触、握腕、挽臂和前臂支撑四种条件;生理信号显示交互带来轻微压力上升,但行为距离和问卷表明总体可接受,其中握腕与前臂支撑更能提升安全感、信任和舒适度,提示稳定、温和的接触优于纯无接触引导。

Differential Analysis of Multispectral Images for Terrain Identification Figure 1
2026-07-13cs.RO

Differential Analysis of Multispectral Images for Terrain Identification

Omar Kashmar, Hemendra Arya, Fulvio Mastrogiovanni

2026-07-13视觉感知

这篇论文针对野外机器人仅依赖 RGB 进行地形识别时易受低照度、阴影和材质相似性影响的问题,提出 DRIFT 多光谱框架,将原始光谱波段与抗光照变化的波段比值分别编码,并用差分融合突出两类线索的不一致性。实验覆盖无人机采集的油污土壤数据和受光照、冷热水扰动的草地场景,结果显示其相较强基线更稳健,同时保持轻量化、具备边缘部署潜力。

Robot Trajectron V3: A Probabilistic Shared Control Framework for SE(3) Manipulation Figure 1
2026-07-13cs.RO

Robot Trajectron V3: A Probabilistic Shared Control Framework for SE(3) Manipulation

Pinhao Song, Zhongxi Li, Ze Fu, Federico Ulloa Rios, Renaud Detry

2026-07-13机器人规划控制

针对低带宽、噪声接口下遥操作高自由度机械臂既慢又费力的问题,RT-V3将SE(3)抓取共享控制表述为贝叶斯意图推断,用Transformer融合点云、候选抓取姿态与历史运动,并分解平移/旋转动作分布以提升高维建模稳定性。实验显示其轨迹预测准确、反应式规划有竞争力,在真实用户研究中提高成功率和效率并降低身心负担,但仍依赖抓取规划器且存在人类行为分布偏移。

Validating Virtual Reality for Studying Multimodal Human-Robot Interaction in Socially Aware Robot Navigation Figure 1
2026-07-13cs.RO

Validating Virtual Reality for Studying Multimodal Human-Robot Interaction in Socially Aware Robot Navigation

Hariharan Arunachalam, Phani Teja Singamaneni, Rachid Alami

2026-07-13机器人视觉语言

这篇论文针对社会感知机器人导航中真实实验成本高、VR 是否能保留多模态交互线索尚不清楚的问题,构建与动捕场地匹配的 PR2 共导航 VR 原型,并在 21 名被试的交叉与擦肩场景中比较轨迹、头部朝向和主观感受。结果显示,VR 中对机器人社会感知与舒适度的评价接近真实世界,行为数据也呈现一致模式,支持其作为多模态 HRI 预实验平台。

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks Figure 1
2026-07-13cs.RO

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

2026-07-13模仿学习

面向长时程物体重排,论文针对显式技能库、技能边界标注和任务切换逻辑难以扩展的问题,提出从未标注子任务演示中学习隐式行为,并用 Flow Matching 生成多候选动作、由 critic 按任务价值选择执行。Habitat 实验显示,该方法在复杂重排和更长链式目标上优于任务特定模仿基线,接近带 oracle 规划的技能克隆系统;消融表明主要增益依赖可靠的价值引导候选选择。

Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation Figure 1
2026-07-13cs.RO

Tactile and Vision Conditioned Contact-Centric Control for Whole-Arm Manipulation

Rishabh Madan, Angchen Xie, Samantha Saak, Andres Blanco, Dohyeok Lee, Sarah Grace Brown, Yunting Yan, Mark Zolotas, Jose Barreiros, Tapomayukh Bhattacharjee

2026-07-13机器人视觉感知规划控制

面向护理和人机协作中的全臂接触操作,论文指出端执行器中心或纯学习方法难以同时处理遮挡下的多点接触、力调节和分布外物理一致性。TACTIC 将 RGB-D、分布式触觉和2D邻近图融入接触中心状态,用接触雅可比引导采样式 MPC,并把学习潜动态与解析运动学结合预测接触和力。仿真中优于 DreamerV3、Diffusion Policy 等基线,真实机器人在假人翻身、肢体重定位和动态迷宫任务上展示可行性,但不提供形式化安全保证。

Empirical Pedestrian Safety Assessment in a Mobile Robot Using a Predictive Social Force Model Figure 1
2026-07-13cs.RO

Empirical Pedestrian Safety Assessment in a Mobile Robot Using a Predictive Social Force Model

Alireza Jafari, Yun-Hao Tsai, Yen-Chen Liu

2026-07-13机器人安全鲁棒

论文关注移动机器人进入人行空间后,既要降低碰撞风险,也要避免让行人感到不安全的问题。作者在社会力模型和PTTC安全指标基础上加入有限时域预测,形成PSFM与PTSFM,并用真实非完整约束机器人和志愿者迎面相遇实验比较四种导航器。结果显示,PTTC显著改善最小碰撞时间、距离等客观安全指标;预测项只在少数子指标上有边际作用,主观评分差异未达显著,增益来源不清。

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency Figure 1
2026-07-13cs.RO

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo

2026-07-13机器人视觉感知

该文针对生成视频虽能给出物体运动先验、却缺少可执行几何与抓取约束的问题,提出 GenVid2Robot:先用真实首帧 RGB-D 建立语义锚点,再以稀疏 SE(3) 刚体一致性筛选生成视频轨迹,并将通过验证的相对运动作用到实际抓取时 TCP 位姿。RM75 实机实验显示,该流程在倒水、开盖、递工具、清扫等任务上优于若干复现基线,但仍受视频质量、锚点可见性和缺少在线力/视觉伺服限制。

TactiDex: A Real-World Tactile-Guided Benchmark for Human-Like Dexterous Manipulation Figure 1
2026-07-13cs.RO

TactiDex: A Real-World Tactile-Guided Benchmark for Human-Like Dexterous Manipulation

Suting Ni, Hanbing Zhang, Zhenyu Wei, Guo Chen, Chixuan Zhang, Ye Shi, Jingya Wang

2026-07-13机器人强化学习数据集/基准

这篇论文针对灵巧操作中只模仿手部轨迹、忽略接触力调节的问题,提出 TactiDex 真实触觉基准,联合全手压力、手部运动和物体 6D 状态,并用 TactiSkill 将触觉作为强化学习奖励的结构化监督,约束接触形成、力分布对齐和过大接触力。实验显示,在单手和双手任务中,该方法提升操作成功率、物体稳定性和接触逼真度,但跨传感器与仿真到真实的误差仍是限制。

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models Figure 1
2026-07-13cs.CV

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

2026-07-13强化学习

这篇论文针对动作条件世界模型依赖昂贵机器人动作标注、而现有潜动作模型会把背景等无关视觉因素编码进动作表示的问题,提出 CD-LAM:用具身中心重建、动作中心对比学习和潜空间校准对 LAM 去偏,并经三阶段微调接入 ACWM 与真实机器人动作。实验显示其在 2B/14B 骨干上降低动作跟随误差、提升视觉质量和鲁棒性,14B 模型以少于 DreamDojo 12 倍以上的适配更新达到或超过其效果。

BeyondSight: Object Permanence for End-to-End Autonomous Driving Figure 1
2026-07-13cs.RO

BeyondSight: Object Permanence for End-to-End Autonomous Driving

Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

2026-07-13机器人

本文针对端到端自动驾驶在遮挡场景中把“看不见”误当成“不存在”的问题,提出 BeyondSight,将物体存在性与即时可观测性解耦,通过时间传播与观测条件更新维持持久 actor 假设,并构建 nuScenes-Permanence 评测不可见目标。结果显示,不可见目标检测 mAP 从 0 提升到 0.249,规划 L2 平均误差由 0.61 降至 0.54,但长时遮挡下假设陈旧和漂移仍是限制。

Residual Physics-Informed Neural Networks for High-Fidelity BLDC Motor Modeling Figure 1
2026-07-13cs.RO

Residual Physics-Informed Neural Networks for High-Fidelity BLDC Motor Modeling

Haitham El-Hussieny

2026-07-13机器人

面向机器人关节中 BLDC 电机模型既要精确又要满足实时控制时延的问题,论文用带残差结构的 PINN 学习六状态连续时间代理,并把电机机电热 ODE 残差经归一化和课程调度并入训练。实验显示 CPU 训练约 110 秒,推理约 0.1–22 微秒,最高比 Euler/RK45 快 118 倍;但当前小模型电流 NRMSE 约 31%,精度增益仍有限。

Vascular Geometry Characterization for AI-Based Endovascular Navigation Figure 1
2026-07-13cs.RO

Vascular Geometry Characterization for AI-Based Endovascular Navigation

Han-Ru Wu, Harry Robertshaw, Lisa Dwyer-Joyce, Thomas C Booth, Alejandro Granados

2026-07-13机器人

针对血栓机械取栓中强化学习导航缺少可比较的血管复杂度评估框架,本文从61例CTA血管树自动提取主动脉弓型、牛弓、长度、迂曲度、反向弯曲等指标,并用SAC代理统一测试导航难度。结果显示血管几何显著影响耗时与成功率:左侧牛弓、II/III型弓和更高迂曲度延长导航,右侧II/III型弓及反向弯曲数也增加耗时并降低成功概率。

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method Figure 1
2026-07-13cs.CV

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

2026-07-13视觉感知数据集/基准

针对无人机目标检测中遮挡、目标像素稀少以及主动观测缺少真实数据和基准的问题,论文构建ATRNet-LUDO大规模实景UGAOD数据集,并用JEPA式世界模型改进主动观测策略的状态表征。实验显示主动观测较被动感知识别率提升约20个百分点,AOD-JEPA在相近移动代价下较DRL基线再提升2–3个百分点。

Dec-MARVEL: Decentralized Multi-Agent Exploration without Communication under Budget Constraints Figure 1
2026-07-13cs.RO

Dec-MARVEL: Decentralized Multi-Agent Exploration without Communication under Budget Constraints

Janghyun Cho, Jimmy Chiun, Guillaume Sartoretti, Changjoo Nam

2026-07-13优化算法

这篇论文面向通信不可靠、视场受限且电量/航程有限的多无人机探索,关注如何在不共享地图或目标的情况下减少重复覆盖。Dec-MARVEL 的核心思路是把视野中偶然观测到的队友轨迹作为隐式协同信号,并结合前沿几何、朝向选择和剩余预算学习可返航动作。900 组仿真中其在不同队伍规模和预算下取得最高或并列最高探索率、最低感知重叠,紧预算场景提升更明显,并通过实体机器人验证了迁移可行性。

CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding Figure 1
2026-07-13cs.RO

CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding

Yuri Ishitoya, Jeremy Siburian, Masashi Hamaya, Kuniaki Saito, Cristian C. Beltran-Hernandez, Mai Nishimura

2026-07-13视觉语言

这篇论文针对VLM微调为VLA时裸数字动作 token 偏离语言预训练分布、削弱语义迁移的问题,提出CLAP:在数值动作序列前自回归生成自然语言动作描述,用语言计划因果条件化后续动作预测,且不改骨干、词表或加入动作专家。实验显示2B模型单轮微调在LIBERO达90.8%,比VLA-0高14.9点,并在LIBERO-PRO扰动下更稳健;但只验证单一VLM家族,真实机器人泛化仍文中未充分说明。

Impedance-Guided Programmable Transmission of Localized Deformation in Modular Soft Metamaterials Figure 1
2026-07-13cs.CE

Impedance-Guided Programmable Transmission of Localized Deformation in Modular Soft Metamaterials

Weiyun Xu, Daewon Hong, Zhi Zhao, Rahul Dev Kundu, Xiaojia Shelly Zhang

2026-07-13机器人

本文针对软超材料模块级联时局部位移和力会快速衰减、限制软机器人执行与传感扩展的问题,提出把下游结构等效为端口机械阻抗,并结合非线性弹簧模型进行单元拓扑优化。结果显示,该方法比直觉设计和常规柔顺机构优化更能延缓变形衰减,并实现绕障位移路由、缺陷容忍软夹爪、机械 LED 显示和手指运动感知控制等原型。

SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control Figure 1
2026-07-13cs.RO

SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control

Siddarth Jain, Ho Jin Choi

2026-07-13机器人强化学习规划控制三维

面向未知且动态的人机共享环境,SplatCtrl试图解决机械臂仅靠静态地图或离线规划难以及时避障的问题。其核心是用RGB-D流在线更新3D Gaussian场景表示,并通过体素过滤、动态Gaussian重定位及由各向同性Gaussian构造连续SDF/碰撞概率场,将其接入控制障碍函数实现反应式控制。实验覆盖仿真、实机和人机协作场景,显示可在重建同时生成6-DoF无碰撞运动,但具体相对增益来源仍需看完整量化对比。

Adaptive MPPI with Online Disturbance Covariance Estimation: Provable Stability Tightening via Spatial Smoothing Figure 1
2026-07-13eess.SY

Adaptive MPPI with Online Disturbance Covariance Estimation: Provable Stability Tightening via Spatial Smoothing

Hyung-Jin Yoon, Hunmin Kim

2026-07-13机器人

本文针对 MPPI 在真实机器人中扰动协方差未知、空间变化导致稳定性证书长期偏松的问题,提出按状态网格在线估计协方差并加入按访问分布加权的空间平滑,同时保持采样协方差与控制代价的路径积分耦合。主要结果是给出估计误差的随机近似、平滑偏差与时变漂移分解,并证明在固定失配超过残余偏差和漂移允许量时,自适应方案会在有限可计算时间后获得更紧的闭环稳定性界。

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space Figure 1
2026-07-13cs.RO

FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space

Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov

2026-07-13机器人生成模型

FlowDAgger针对机器人基础策略在真实部署中遇到分布外物体、动力学和长尾失败时,常规再采样、微调或在线RL成本高且易破坏原有能力的问题。其核心是把人工纠正动作反演为冻结生成策略的噪声潜变量,再训练轻量潜空间策略来引导基模型。实验覆盖仿真、双臂和单臂真实操作,显示其用少量干预优于监督微调、动作空间DAgger和潜空间RL,并较好保留预训练技能。

AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning Figure 1
2026-07-13cs.RO

AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning

Iaroslav Kolomiets, Miguel Altamirano Cabrera, Artem Lykov, Jeffrin Sam, Dmitrii Iarchuk, Yara Mahmoud, Daniia Zinniatullina, Mikhail Konenkov, Dzmitry Tsetserukou

2026-07-13机器人视觉感知

针对灵巧人形机器人缺少可规模化训练数据的问题,AgenticFocus把普通人类第一视角视频转成机器人可用示教:先恢复被手遮挡的目标物体,再进行相机相对的全手动作重定向,并用分层混合现实合成同步视觉、动作与状态数据。实验显示其轨迹误差更低、腕部运动更平滑,SPARC优于两个跨 embodiment 基线。

Programming-by-Example for Batch-Editing Collision Meshes in 3D Software Figure 1
2026-07-13cs.GR

Programming-by-Example for Batch-Editing Collision Meshes in 3D Software

Gengyang Xu, Dongwei Xiao, Hengcheng Zhu, Yiteng Peng, Wei Meng, Shuai Wang, Shing-Chi Cheung

2026-07-13三维

这篇论文针对3D软件中碰撞网格需按交互意图反复手工修补、难以在异构资产间批量复用的问题,提出MeshForge:把少量图形界面示例转化为可复用编辑程序,并用语义标签、包围盒与接触图构成符号IR,结合语义、拓扑、几何三层选择器及ABI纠错来缓解感知噪声。实验覆盖8类资产、600个网格、24个任务,成功合成23个,平均需2.2个示例和3.5秒。

2026-07-10

38 篇
DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation Figure 1
2026-07-10cs.RO

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

The University of Hong Kong

2026-07-10机器人数据集/基准

DexVerse针对现有灵巧操作基准在任务多样性、机器人形态、视觉扰动和示范数据上难以同时覆盖的问题,构建了包含100类任务、3种机械臂和6种灵巧手的模块化测试平台,并提供VR遥操作采集的3180条多模态示范。对Diffusion Policy、DP3、OpenVLA和π0.5等方法的评测显示,最佳平均在线成功率仅34%,工具使用、精细接触和双手协作仍明显受限。

ContactMimic: Humanoid Object Interaction via Contact Control Figure 1
2026-07-10cs.RO

ContactMimic: Humanoid Object Interaction via Contact Control

Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta

University of Illinois Urbana-Champaign

2026-07-10机器人规划控制

这篇论文针对类人机器人仅跟踪关键点会“姿态像但没接触”的问题,提出 ContactMimic:在关键点轨迹之外显式输入按身体部位划分的二值接触指令,并用接触奖励与打破关键点-接触相关性的轨迹增强训练策略,让同一运动可按指令接触或避开物体。仿真中覆盖 10 类人-物交互动作,优于仅关键点跟踪基线;真实 G1 机器人上 5 个动作验证了接触可控性,但通用多动作策略和更广硬件验证仍未充分说明。

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation Figure 1
2026-07-10cs.GR

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

2026-07-10生成模型

面向游戏、仿真和类人机器人中需要实时响应且可控的3D人体动作生成,ARDY将显式根节点特征与潜在身体表示结合,并用两阶段自回归扩散Transformer处理在线文本与长时域运动学约束。实验在HumanML3D和Bones Rigplay上显示其动作质量与约束跟随较强,4步扩散平均延迟约33ms,但部分优势可能受大规模高质量数据影响。

Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups Figure 1
2026-07-10cs.RO

Learning Adaptive Solvers for Distributed Factor Graph Optimization on Matrix Lie Groups

Jaeho Shin, Maani Ghaffari, Yulun Tian

University of Michigan

2026-07-10优化算法

这篇论文针对多机器人/多会话因子图优化中分布式求解器依赖手调参数、难以迁移到异步通信和非 SE(3) 李群的问题,提出 DeepCORD:将 Riemannian 分布式优化器展开为可微迭代,用自监督反馈策略按优化阶段和通信状态自适应预测参数。实验覆盖 SE(3) 位姿图与 SL(4) 子地图对齐,在多数真实基准上取得更低目标值,包括 21/26 个 PGO 设置和全部 3 个投影对齐数据集。

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference Figure 1
2026-07-10cs.LG

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta

University of Washington, Toyota Research Institute

2026-07-10规划控制

这篇论文针对机器人连续控制难以直接复用语言链式推理的问题,提出让策略在端到端学习的自回归离散潜空间中进行可变长度“思考”。LMP 将控制推理表述为变分推断,并用潜轨迹上的强化学习优化下界,使策略按任务难度自适应分配测试时计算;同一框架还可作为变长动作 tokenizer。实验显示其在仿真和真实机器人任务中优于非迭代或固定计算方案,且 tokenizer 提升下游自回归策略表现。

Native Video-Action Pretraining for Generalizable Robot Control Figure 1
2026-07-10cs.RO

Native Video-Action Pretraining for Generalizable Robot Control

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

2026-07-10机器人视觉感知规划控制

论文针对现有视频-动作模型直接改造通用视频生成器时语义/动作空间割裂、因果结构不匹配和闭环推理过慢的问题,提出 LingBot-VA 2.0:用语义视觉-动作 tokenizer、自回归因果 DiT、稀疏 MoE 与带重定位的异步 Foresight Reasoning,从网页视频中学习可迁移控制表征。实验称其可用 10–15 个示范完成少样本适应,部分任务零样本执行,并在真实机器人上达到最高 225 Hz 异步闭环控制。

A New Human-Likeness and Comfort Index for Robot Movements Along Prescribed Paths Figure 1
2026-07-10cs.RO

A New Human-Likeness and Comfort Index for Robot Movements Along Prescribed Paths

Rosanna Coccaro, Enrico Ferrentino, Antonio Parziale, Angelo Marcelli, Pasquale Chiacchio

2026-07-10机器人

面向人机协作中“机器人像人一样动是否更舒适”的问题,论文把关注点从外形或整条轨迹转到给定路径下的时间律,基于人类运动的 sigma-lognormal 建模提出可在执行前计算的人类相似度/舒适度指标。作者用 68 名受试者、三组物理交互实验验证,主观舒适偏好与该指标分布呈总体一致趋势。

FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation Figure 1
2026-07-10cs.RO

FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation

Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li

2026-07-10机器人视觉语言视觉感知

FabriVLA针对大参数VLA在实时机器人控制中计算成本和延迟偏高的问题,探索1B级轻量视觉语言骨干能否支撑多任务精细操作。其核心是在InternVL3.5上加入流匹配动作头、零初始化门控自注意力建模动作序列依赖,并融合浅层VLM特征补充空间细节;在Meta-World MT50上达到90.0%分层平均成功率和92.0%总体成功率。

Early to Share, Late to Save: Synchronisation-Driven Communication Gating in Bandwidth-Constrained Cooperative VLN Figure 1
2026-07-10cs.MA

Early to Share, Late to Save: Synchronisation-Driven Communication Gating in Bandwidth-Constrained Cooperative VLN

Arav Gupta, Nivedan Yakolli, Avinash Gautam

2026-07-10强化学习

论文针对协作视觉语言导航中默认无限通信但真实机器人带宽受限的问题,提出按事后失败标签监督训练的 hindsight gating,避免用 REINFORCE 学通信时机的高方差。核心洞察是智能体并非在不确定时才通信,而是在早期、较有信心时同步 GRU 隐状态,随后独立导航。实验显示 B=3 时累计对齐增益达 0.072,接近无限通信的 0.078,且单位通信效率显著高于随机和熵门控。

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents Figure 1
2026-07-10cs.RO

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

Tsinghua University, Purdue University, Institute of Automation, Chinese Academy of Sciences, Zhongguancun Academy, Hong Kong University of Science and Technology

2026-07-10机器人

这篇论文针对冻结式 VLA 在语义重绑定、布局变化和接触失败下容易失效的问题,提出 Harness VLA:把 VLA 只作为可重试的接触丰富 primitive,由 LLM 规划器结合固定解析 primitive 与任务/全局记忆完成重定位、搬运、复位和失败规避。实验显示其在 LIBERO-Pro、RoboCasa365 上较强基线分别提升 38.6、25.4 个百分点,并在 RoboTwin C2R 达到 58.4%。

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data Figure 1
2026-07-10cs.RO

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

Georgia Institute of Technology

2026-07-10强化学习

这篇论文针对野外第一视角人类数据难以直接用于机器人行为克隆的问题,指出动作监督会混入形态、头部运动和风格差异。EgoWAM通过固定策略骨干与数据配比,仅替换世界预测目标,比较像素、DINO与3D flow,强调应预测跨具身一致的场景演化。实验显示WAM比BC更能利用人类数据,DINO提升物体/场景泛化最高约4倍,3D flow带来20–30%的域内增益。

Swapping Faces, Saving Features: A Dual-Purpose Pipeline for Pedestrian Privacy in ITS Figure 1
2026-07-10cs.CV

Swapping Faces, Saving Features: A Dual-Purpose Pipeline for Pedestrian Privacy in ITS

Roba H. Farouk, Catherine M. Elias

*This work was not supported by any organization 1 C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

2026-07-10三维

面向自动驾驶/ITS数据集中行人身份泄露与训练可用性冲突,论文提出针对Egy-DRiVeS街景的五阶段隐私流水线:行人检测、SCRFD人脸检测、CodeFormer增强、Roop或Ghost-v2换脸与融合,以保留表情、头姿和视线。实验显示质量增强能改善低清街景换脸,Roop在真实感、属性保留及遮挡/戴头巾等场景鲁棒性上优于Ghost-v2,但身份隐匿程度Ghost-v2略强。

On Exploring Input Resolution Scaling For Anytime LiDAR Object Detection Figure 1
2026-07-10cs.RO

On Exploring Input Resolution Scaling For Anytime LiDAR Object Detection

Ahmet Soyyigit, Shuochao Yao, Heechul Yun

2026-07-10视觉感知

面向自动驾驶中 LiDAR 3D 检测在嵌入式平台上难以同时满足精度与时延的问题,论文提出 MURAL:用单一模型支持 pillar/voxel 点云输入的多分辨率推理,并由截止时间感知调度器按运行时预测选择最高可行分辨率。nuScenes 与闭环仿真结果显示,其在多种 deadline 下优于固定分辨率和既有 anytime LiDAR 方法,并减少碰撞与不必要停车。

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition Figure 1
2026-07-10cs.CL

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

2026-07-10视觉感知学习理论

本文针对人格识别依赖 Big-5、MBTI 等固定理论、跨数据集泛化差且标注稀缺的问题,提出 JAM:用注意力池化图原型网络学习跨理论的潜在“伪侧面”,并结合人工链接、机器共识与 LLM-as-a-Judge 过滤歧义或错标样本。Essays 和 Kaggle 实验显示其跨框架性能有所提升,但具体增益中 LLM 评审、聚类对齐与数据清洗各自贡献仍需更细拆解。

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation Figure 1
2026-07-10cs.RO

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

Pengcheng Laboratory, Shenzhen Institutes of Advanced Technology, Peking University

2026-07-10机器人视觉语言视觉感知

本文针对无人机长航程视觉语言导航中语义推理慢、控制需低延迟且动作易不连续的问题,提出快慢双系统FSD-VLN:慢系统用预训练视觉语言模型提取稳定语义先验,快系统以DiT建模跨时间动作分布并异步生成控制,同时用时间感知优化稳定训练。仿真低空环境实验显示,其在未见场景成功率最高约提升2倍,单步延迟和任务时间均降低超过50%。

SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation Figure 1
2026-07-10cs.RO

SkillPlug: Unsupervised Skill Mining for Few-Shot Adaptation in Robotic Manipulation

Zi-han Ding, Ziwei Wang

2026-07-10机器人

这篇论文针对端到端视觉运动模仿策略难以显式复用跨任务行为、少样本适应效率低的问题,提出 SkillPlug:在既有策略上插入技能条件模块,从多任务演示中无监督挖掘可复用且非冗余的技能库,适配新任务时冻结技能、只微调路由器和动作头。实验在 DISCOVERSE、LIBERO 和真实机器人上均显示成功率提升,包括 DISCOVERSE 多任务 +45.1 个百分点、LIBERO 5-shot 迁移平均 +38.3 个百分点。

AnyDexRT: Calibration-Free Dexterous Hand Retargeting with Few-Shot Human Guidance Figure 1
2026-07-10cs.RO

AnyDexRT: Calibration-Free Dexterous Hand Retargeting with Few-Shot Human Guidance

Chenxi Wang, Ying Feng, Hongjie Fang, Shangning Xia, Lixin Yang, Chuan Wen, Cewu Lu

Shanghai Jiao Tong University, Shanghai Innovation Institute

2026-07-10机器人

灵巧手遥操作的瓶颈在于人手到不同机器人手的重定向常依赖精细标定、手工目标和手型特化调参。AnyDexRT的核心思路是把指尖运动看作人手与机器人手空间的对应学习,用自监督形状匹配建立基础映射,再用少量人工配对锚定任务相关区域,并用接触分类器修正捏取姿态。实验显示其在多种灵巧手和真实遥操作任务中提升重定向质量与控制直观性,同时减少人工调参。

INTENT: An LSTM Framework for Vehicle Intention Prediction in Intersection Scenarios with Comprehensive Ablation Analysis Figure 1
2026-07-10cs.AI

INTENT: An LSTM Framework for Vehicle Intention Prediction in Intersection Scenarios with Comprehensive Ablation Analysis

Logine M. Zaki, Catherine M. Elias

*This work was not supported by any organization 1 C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

2026-07-10机器人

该文面向自动驾驶在交叉口中难以及时判断他车直行、左转或右转意图的问题,提出基于 InD 鸟瞰轨迹数据的 INTENT 流水线:先通过道路标注、转向真值生成和车辆过滤构造样本,再用 LSTM 做提前 2 秒的意图分类,并配套消融实验。报告最佳验证准确率达 99.71%,但泛化到其他路口、视角和真实车载感知条件的效果仍文中未充分说明。

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning Figure 1
2026-07-10cs.RO

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

2026-07-10机器人

这篇论文针对 VLA 策略在阶段依赖操作中过于“反应式”、难以区分视觉相似但任务进度不同状态的问题,提出 TFP:用 LTC 连续时间隐状态维护 episode 内任务信念,并通过 AdaLN 直接调制 flow-matching 动作解码器。实验中 3.3B 模型在 LIBERO 从 96.9% 提升到 98.75%,LIBERO-plus 从 91.4% 到 93.77%,记忆诊断任务最高 75.0%,且分析显示记忆写入增益随操作事件显著变化。

X-ACTA: eXtended Analytic Center Tension distribution Algorithm for fixed and mobile cable-driven-parallel-robot Figure 1
2026-07-10cs.RO

X-ACTA: eXtended Analytic Center Tension distribution Algorithm for fixed and mobile cable-driven-parallel-robot

Domenico Dona', Vincenzo Di Paola, Alberto Trevisani, Matteo Zoppi

2026-07-10机器人

面向绳驱并联机器人在激烈机动或断绳后超出可行力旋量工作空间时的张力分配问题,论文提出 X-ACTA:以解析中心法为基础,采用两阶段松弛/含 slack 优化,在保持张力连续可微的同时纳入非线性约束,并尽量把力旋量误差限制在可行域边缘。仿真实验显示,相比 NTNU 方法,其收敛更快,并在高频张力成分与力旋量跟踪误差的权衡上表现出 Pareto 优势。

Input-Constrained Spatiotemporal Tubes for Safe Navigation of Unknown Euler-Lagrange Systems in Dynamic Environments Figure 1
2026-07-10eess.SY

Input-Constrained Spatiotemporal Tubes for Safe Navigation of Unknown Euler-Lagrange Systems in Dynamic Environments

Siddhartha Upadhyay, Ratnangshu Das, Pushpak Jagtap

Department of Cyber-Physical Systems, Indian Institute of Science, Bengaluru, India, Indian Institute of Science,, Bengaluru, India

2026-07-10机器人安全鲁棒

面向未知欧拉-拉格朗日机器人在动态环境中导航时易受模型误差、移动障碍和执行器饱和影响的问题,论文把输入约束显式嵌入时空管框架,给出闭式、无近似控制律及可离线验证的可行性条件,用来匹配控制余量、不确定性界和管参数。仿真覆盖移动机器人、四旋翼和航天器,并在移动机器人硬件上验证了有限时间到达-避障-保持任务可在输入限幅内完成。

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio Figure 1
2026-07-10cs.CV

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

2026-07-10视觉感知学习理论

这篇论文针对视频基础模型微调到机器人动作后丢失组合泛化能力的 VAG gap,指出关键不只是生成未来视频,而是动作头是否在规划阶段真正利用未来潜变量。作者提出 Temporal Ratio,用注意力衡量未来帧相对当前帧的依赖,并据此做推理时自适应引导;在 LIBERO 和真实双臂任务上提升 OOD 成功率,同时基本保持 ID 表现。

RadLoc: Radar-based 3-DoF Global Localization via Fast, Robust, and Lightweight Spatial Descriptor Across Diverse Environmental Scenarios Figure 1
2026-07-10cs.RO

RadLoc: Radar-based 3-DoF Global Localization via Fast, Robust, and Lightweight Spatial Descriptor Across Diverse Environmental Scenarios

Hogyun Kim, Jiwon Choi, Jungwoo Lee, Younggun Cho

Hogyun Kim, 1 Jiwon Choi, 1 Jungwoo Lee, and 1† Younggun Cho are with the Electrical Engineering, Inha University

2026-07-10安全鲁棒

RadLoc 面向恶劣天气和多场景下移动机器人需要可靠全局定位的问题,针对既有雷达方法多只优化地点识别或姿态估计、且计算开销偏高的局限,提出从检索到 3-DoF 位姿估计的一体化流程。其关键在于用 1D CA-CFAR 加速预处理,并利用旋转雷达近距离信息占优设计紧凑描述子和分层粗到细检索。15 条序列、5 个数据集实验显示,其在保持鲁棒识别的同时取得最小描述子和最快检索时间。

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim Figure 1
2026-07-10cs.CV

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim

Linli Shi, Ruijun Zhang, Ziyun Wang

Johns Hopkins University

2026-07-10机器人

针对机器人事件相机真实标注数据稀缺、与物理状态难对齐的问题,EVIS将基于对数亮度阈值触发的事件模型直接接入Isaac Sim/Isaac Lab,并用运动向量插值减少高频渲染开销。实验显示其可生成带精确真值的事件流,预训练E2VID、E-RAFT和匹配网络可直接使用;在RTX 5090上30×8配置达到约1.2倍实时。

Post-Training in End-to-End Autonomous Driving Figure 1
2026-07-10cs.CV

Post-Training in End-to-End Autonomous Driving

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

2026-07-10机器人

这篇综述的动机是端到端自动驾驶仅靠离线模仿学习难以处理闭环误差累积、少见恢复场景以及安全/舒适等长程目标。核心洞察是把模仿学习后的策略细化单独定义为 post-training,并按监督来源统一为蒸馏、偏好对齐、强化学习和测试时优化四类。主要结果是梳理了各类方法的反馈构造、数据/rollout 获取和局限,同时指出评测饱和、闭环指标粗糙、真车验证不足与推理成本等问题;文中未充分说明某一方法带来的统一实证增益。

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts Figure 1
2026-07-10cs.CV

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

Stanford University

2026-07-10视觉语言视觉感知强化学习规划控制

长程机器人任务常同时需要语义分解和几何可行性判断,纯语言或外部检查式规划容易给出看似合理但会碰撞、放不下的方案。APIVOT 的核心是在 VLM 规划轨迹中自适应插入“视觉思考”,把想象的未来场景用于内部几何验证,并用三阶段 SFT 学会何时用语言、何时用视觉。在 KitchenWorlds 上它较最强基线平均成功率提升 8.1 个百分点,空间约束越强优势越大,同时保留接近全视觉思考性能并减少 39% token。

Factors Influencing Conversational Engagement in Robot-Delivered Individual Cognitive Stimulation Therapy (iCST) for Dementia in Home Settings Figure 1
2026-07-10cs.RO

Factors Influencing Conversational Engagement in Robot-Delivered Individual Cognitive Stimulation Therapy (iCST) for Dementia in Home Settings

Emmanuel Akinrintoyo, Nicole Salomons

Emmanuel Akinrintoyo and Nicole Salomons are with Imperial College London

2026-07-10机器人

本文关注家庭场景中机器人递送个体认知刺激疗法时,痴呆患者的对话参与如何形成,因为现有研究较少分析这类治疗中的细粒度互动动态。研究将 Co-STAR 部署到8名患者家中,基于27次会话提取轮次词数、反应时长、延迟和自我指称等指标;结果显示个性化提示显著提升参与度,后段会话出现疲劳迹象,首 session 指标和居住状况也与长期参与相关。

D-CLIPSE: Distributed Consensus-based Localization with Passive Listening on Shared State Exchange Figure 1
2026-07-10cs.RO

D-CLIPSE: Distributed Consensus-based Localization with Passive Listening on Shared State Exchange

Kyle Biron-Gricken, James Richard Forbes

2026-07-10机器人

针对多机器人在通信、算力和单点故障约束下难以采用集中式定位的问题,D-CLIPSE提出一种基于共识的分布式滤波框架:通信双方只交换预积分里程计和相关共享状态,旁听机器人也可利用 overheard 状态交换更新估计。仿真与实验证明,该方法在精度和一致性上接近集中式方案,并优于对比的去中心化方法。

In vivo feasibility study of humanoid robots in surgery Figure 1
2026-07-10cs.RO

In vivo feasibility study of humanoid robots in surgery

Zekai Liang, Nikita Thareja, Peihan Zhang, Calvin Joyce, Soofiyan Atar, Florian Richter, Garth Jacobsen, Shanglei Liu, Ryan Broderick, Michael Yip

2026-07-10机器人

这篇论文针对医院人力短缺与现有手术机器人专用化、部署复杂的问题,评估通用人形机器人能否承担腹腔镜手术任务。核心做法是构建人形机器人遥操作框架,让其使用通用手动腕式器械,并通过台架测试、干实验用户研究和活体猪实验衡量精度、任务表现与临床可行性。结果表明该路线具备初步技术可行性和手术辅助潜力,但在稳定性、精度控制与安全验证上仍明显不足,距离临床部署还有关键技术缺口。

Soft Robotic Exogloves for Dexterous Mobility -- Towards Personalized Rehabilitation Figure 1
2026-07-10cs.RO

Soft Robotic Exogloves for Dexterous Mobility -- Towards Personalized Rehabilitation

Paul Dela Cruz, Mostafa Mo. Massoud, Jacqueline Libby

2026-07-10机器人

针对标准化软体康复手套难以贴合个体手部解剖、易造成关节错位并影响精细操作的问题,本文用3D手部扫描定制气动PneuNet外骨骼手套、掌背基座和个体化FEA手指模型。实验显示其能较准确驱动MCP/PIP关节,仿真可分析pHRI接触力,但近节指骨仍有非理想压缩;放松应变限制层可改善致动器与关节对齐。

Towards Soft Robotic Exogloves for Musculoskeletal Manipulation to Reduce Pain and Spasticity Figure 1
2026-07-10cs.RO

Towards Soft Robotic Exogloves for Musculoskeletal Manipulation to Reduce Pain and Spasticity

Antonia Salluce, Maeryn Erdheim, Gailen Davis, Lauren H. Sullivan, Max-William Kanz, Jacqueline Libby

2026-07-10机器人

针对中风等人群手部痉挛常伴随疼痛、现有外骨骼手套多偏向运动辅助或单独镇痛的问题,本文提出一款模块化软体气动外手套,将贴合手背拓扑的 dorsal fPN、可塞入过屈手指狭小空间的 ventral fPN 与掌部波纹驱动器结合,用分布式压缩实现按摩、开掌和姿态重定位。作者完成 FEM 优化、铸造/SLA 制作和试戴验证,显示可贴合个体手型并初步具备舒适性与作用力分布,但结果仍主要来自单名试用者的早期原型,临床效果文中未充分说明。

Monocular Vision Based Control Framework for Grasping Figure 1
2026-07-10cs.RO

Monocular Vision Based Control Framework for Grasping

Shail Jadav, Dongheui Lee

2026-07-10视觉感知规划控制

面向家庭和食品处理中的软硬混杂物体抓取,本文试图减少对触觉传感、物体模型和专用夹爪的依赖。核心做法是用单目 RGB 串联开放词汇检测、分割、关键点跟踪、单目深度与语言刚度先验,在接触前选择策略,并用形变/尺度视觉反馈调节夹爪。Franka 实物实验覆盖生菜、奶酪、可颂、纸巾和塑料瓶,显示仅靠视觉也能实现稳定取放,但相对基线的定量增益文中未充分说明。

Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments Figure 1
2026-07-10cs.RO

Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments

Erik Jagnandan, Mulugeta Haile, Gregory Barber, Pratik Chaudhari

2026-07-10机器人视觉感知

面向非结构化户外环境中动态避障难以依赖大规模机器人数据或仿真策略的问题,本文将UniDepth单目深度、SuperPoint/SuperGlue长序列匹配和束调整结合,用关键点TTC选择远离最近碰撞风险的地面运动原语。M3ED实测中,对TTC<1秒帧的精确率/召回率为0.49/0.38,真阳性中避让方向正确率84%,并覆盖22个物理障碍中的20个;但整体检测召回仍有限,性能受单目深度误差影响。

STEMbot: A Compliant Robot for Under-Canopy Plant Navigation Figure 1
2026-07-10cs.RO

STEMbot: A Compliant Robot for Under-Canopy Plant Navigation

Zachary Charlick, Nilay Roy Choudhury, Haoyu Ma, Xiaonan Huang, Dmitry Berenson

2026-07-10机器人

这篇论文面向有机农业中叶背和茎部害虫难以及早巡检的问题,提出可在植物冠层下攀爬的微型机器人 STEMbot。其关键在于柔顺轮式硬件结合 PIN-SLAM、语义 OcTree 与受茎枝流形约束的 A* 规划,使机器人能围绕遮挡目标进行分支感知导航。实验显示其可 traversing 7–33 mm 茎秆并在四种真实植物上自主导航,重建相对摄影测量基线平均 Chamfer 距离低于 1 cm,但仍依赖较刚性的植株和系留设置。

Shift & Drift: A Zero-Shot Benchmark for Generalizable and Robust Autonomous Driving Motion Planning Figure 1
2026-07-10cs.RO

Shift & Drift: A Zero-Shot Benchmark for Generalizable and Robust Autonomous Driving Motion Planning

Alessandro Canevaro, Hang Yu, Julian Schmidt, Peizheng Li, Silvan Lindner, Wilhelm Stork, Georg Martius, Julian Jordan

Code and data are available at:

2026-07-10规划控制数据集/基准安全鲁棒

这篇论文针对自动驾驶运动规划在同分布闭环评测中表现良好、但遇到新城市拓扑和执行扰动时可靠性不足的问题,提出 Shift & Drift 双轨零样本基准:一方面将航拍 DSC3D 场景转换到 nuPlan,另一方面注入动态噪声测试恢复能力。结果显示模仿学习规划器在行人密集语义迁移和相关执行噪声下明显退化,RL 方法 CaRL 更稳健,揭示了模仿保真度与闭环韧性的权衡。

Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains Figure 1
2026-07-10cs.RO

Physics-Guided Biomechanical Gait Adaptation for Humanoid Locomotion on Extreme Sloped Terrains

Xuanyu Chen, Mohan Liu, Dengchen Mei, Zhihao Gu, Haitian Zhang, Kaimin Mao, Haiyue Zhu, Shijun Yan, Lin Wang

Nanyang Technological University 2 A*STAR ⋆ Co-first Authors † Corresponding Author

2026-07-10机器人

本文针对人形机器人在连续陡坡上易因通用强化学习奖励退化为低重心蹲伏步态的问题,提出 HumoSlope:先用局部斜面上的自适应 ZMP 正则建立平衡先验,再用训练期地形描述符门控生物力学步态奖励,区分上坡髋主导推进与下坡膝主导制动。实验显示其可缓解姿态退化,并在仿真 36°、室外草坡 32.1° 上实现盲行走。

Idiobionics: The Unification of Privacy and Intelligent Robotic Prostheses Figure 1
2026-07-10cs.AI

Idiobionics: The Unification of Privacy and Intelligent Robotic Prostheses

Kwesi Afari Darfoor, Patrick M. Pilarski, Bailey Kacsmar

University of Alberta, Edmonton, Canada, Alberta Machine Intelligence Institute (Amii), Edmonton

2026-07-10机器人

论文关注智能义肢在提升自适应控制能力时带来的隐私风险:肌电、加速度等传感数据不仅可驱动运动意图识别,也可能暴露用户活动。作者提出“idiobionics”作为隐私与智能仿生肢体交叉研究框架,并用前臂三轴加速度数据展示活动推断攻击在经桡义肢场景中可行,说明未来义肢需从设计阶段纳入隐私威胁建模与防护。

SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept Figure 1
2026-07-10cs.RO

SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept

Natalia Trukhina, Vadim Vashkelis

2026-07-10机器人

这篇论文针对 GNSS 受限无人机中 VIO 漂移需要绝对定位校正的问题,提出用道路、建筑、水系、铁路等更稳定的语义结构替代易变外观,并联合栅格对齐、关系图验证、稳定性/区分度加权及不确定时拒绝定位。合成实验中,空间语义匹配 Recall@1 达 94.5–95.5%,明显高于全局语义描述子的 58.6%;但实验未验证真实飞行,且各模块的独立增益来源不清。

2026-07-09

50 篇
Continuous and large-scale: ELEANOR, the soft architected arm inspired by the elephant trunk Figure 1
2026-07-09cs.RO

Continuous and large-scale: ELEANOR, the soft architected arm inspired by the elephant trunk

Giovanna A. Naselli, Anderson B. Nardin, Seonggun Joe, Ryan Drinkwater, Enrico Donato, Diego Bianchi, Egidio Falotico, Michel C. Milinkovitch, Lucia Beccai

Soft BioRobotics Perception Laboratory, Istituto Italiano di Tecnologia, 16163 Genova, GE, Department of Autonomous Systems Engineering, Korea Aerospace University, Seoul, South, Photocentric Ltd., Peterborough PE1 5XN, United Kingdom, BRAIR lab, The BioRobotics Institute, Scuola Superiore Sant’Anna, 56025 Pontedera, Italy, Laboratory of Artificial and Natural Evolution, Department of Genetics and Evolution, University of Geneva, 30, Quai Ernest-Ansermet, 1211 Geneva, Switzerland, known that the currently available technology poses limitations (26, 27), the problem does not

2026-07-09机器人

面向仿象鼻连续体机械臂在米级尺度上易失真、难兼顾柔顺与结构稳定的问题,ELEANOR不再追求模块化预设动作,而是用生物外形缩放、渐缩晶格结构和仿纵向/斜向肌肉的腱驱动来保留连续性与动态特性。作者3D打印出85厘米、1.36千克的软体臂,展示了平滑弯扭和对不同形状物体的全身包覆抓取,说明尺度化结构连续性可能是提升象鼻式操作能力的关键。

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation Figure 1
2026-07-09cs.RO

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

Nanjing University of Science and Technology, Zhejiang University, National University of Singapore

2026-07-09机器人视觉语言视觉感知

论文针对现有VLA模型过度依赖当前观测、难以处理长时序操作的问题,提出LaMem-VLA:把短期视觉记忆和长期语义/动作连续性记忆检索后压缩为潜在记忆token,并直接织入VLA的嵌入推理序列,而非作为外部策略条件。实验显示其在LIBERO平均成功率达97.6%,在SimplerEnv-Bridge达73.9%,相对CogACT分别提升4.4和16.6个百分点。

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis Figure 1
2026-07-09cs.RO

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis

Kaicong Huang, Meng Ma, Ruimin Ke

2026-07-09强化学习

面向自动驾驶安全评估中罕见但关键的交互场景,CARLA-GS将视觉重建、语义推理和物理执行解耦:用3D Gaussian Splatting构建可编辑场景,多智能体LLM识别风险并生成意图级轨迹,再由CARLA和PID控制保证车辆运动可执行。Waymo实验显示,该框架能生成语义可控、时空一致且具备物理可行性的逼真角落案例视频。

Context-Aware Force Estimation for Deformable Tool Manipulation in Robotic Environmental Swabbing via Few-Shot Continual Adaptation Figure 1
2026-07-09cs.RO

Context-Aware Force Estimation for Deformable Tool Manipulation in Robotic Environmental Swabbing via Few-Shot Continual Adaptation

Siavash Mahmoudi, Chaitainya Kuppar Reddy, Yang Tian, Dongyi Wang

2026-07-09机器人

这篇论文针对机器人用海绵等可变形工具擦拭时,腕部力传感与真实接触力因滞后、迟滞和材料差异而失配的问题,提出冻结 LSTM 时序骨干、用 FiLM 上下文嵌入做少样本持续适配的力估计框架。UR5e 在九种工具-表面条件下实验显示,该方法在域偏移时将零样本误差最高降低 63%,并避免明显灾难性遗忘。

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences Figure 1
2026-07-09cs.RO

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences

Dean Zadok, Alon Wolf, Alex M. Bronstein, Oren Salzman

Department of Computer Science, Technion, Haifa, Israel

2026-07-09视觉感知

本文针对肌电假手难以区分单指动作、超声方法又常需用户校准的问题,提出 SonoRank:先用成对前臂超声序列学习各手指相对屈曲幅度排序,再结合初始静息参考微调用于实时多指屈曲检测。12 名健康受试者留一交叉验证中,相比跳过排序预训练的直接分类基线 F1 提升 28%,宏 F1 达 0.63,并可在消费级 GPU 上 57 Hz 运行;但样本规模小、拇指检测弱,离真实截肢用户部署仍需验证。

Generating Personalized Lower-Limb Kinematics Across Walking Speeds Using Subject-Conditioned Diffusion Figure 1
2026-07-09cs.RO

Generating Personalized Lower-Limb Kinematics Across Walking Speeds Using Subject-Conditioned Diffusion

Diya Dinesh, Adrian Krieger, Changseob Song, Dongho Park, Aaron J. Young, Inseung Kang

2026-07-09生成模型

该文面向外骨骼个体化控制中多速度步态采集成本高、临床人群负担重的问题,提出以单一已见速度的髋膝踝矢状面轨迹和目标速度为条件的残差扩散模型,用 Transformer 去噪器生成跨速度的个体化运动学变化而非直接生成整段步态。模型仅用健康人数据训练,在留出健康受试者上 MAE 为 3.4°,无卒中特定微调时在卒中受试者上为 6.0°,较前馈基线误差降低超过 70%,且单速度输入接近四速度输入效果。

Smooth Operator: A Real-Time Sampling-Based Algorithm for Kinematic Hand Retargeting Figure 1
2026-07-09cs.RO

Smooth Operator: A Real-Time Sampling-Based Algorithm for Kinematic Hand Retargeting

Robert Jomar Malate, Erik Bauer, Norica Bacuieti, Stefanos Charalambous, Elvis Nava, Robert K. Katzschmann, Benedek Forrai

Stanford University, United States

2026-07-09机器人

本文针对灵巧手遥操作中梯度式重定向易陷入局部最优并产生抖动、影响示教数据质量的问题,提出实时无梯度采样式重定向器 SBR,通过精英样本加权更新控制分布,将方差约束转化为内生低通平滑。仿真和18人真实用户研究显示,SBR总体任务成功率最高为54.1%,NASA-TLX负荷最低为36.4,并降低抖动与操作者疲劳。

Agent-Exploitation Affordances: From Basic to Complex Representation Patterns Figure 1
2026-07-09cs.RO

Agent-Exploitation Affordances: From Basic to Complex Representation Patterns

Bastien Dussard (LAAS-RIS, LAAS), Aurélie Clodic (LAAS-IDEA, LAAS-RIS), Guillaume Sarthou (LAAS-RIS)

collaboration.

2026-07-09机器人

针对传统机器人 affordance 表示多聚焦单智能体与物体、难以刻画人机/多智能体协作中“借助他者行动”的问题,论文基于 Chemero 的关系式 affordance 和本体表示,提出 cooperative affordance/agent-exploitation 的可组合模式。结果展示这些基本模式可表达代做、协作、协调和传递式行动等复杂场景,但尚未实证验证机器人系统中的性能增益。

EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI Figure 1
2026-07-09cs.RO

EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI

Xinjie Wang, Liu Liu, Taojun Ding, Andrew Choi, Chaodong Huang, Mengao Zhao, Ziang Li, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Wei Xu, Zhizhong Su

2026-07-09强化学习三维

论文针对具身学习中3D生成内容难以直接变成可执行训练环境的问题,提出 EmbodiedGen V2:用统一的 sim-ready 表示把几何、物理、交互 affordance、任务场景、多房间拓扑和跨仿真器导出串成可编辑流水线。实验显示资产人工接受率96.5%、碰撞成功率98.6%,83.3%任务世界无需手改可用;生成环境用于在线强化学习后,仿真成功率9.7%升至79.8%,真实机器人21.7%升至75.0%,但部分增益可能主要来自 scaling / data。

GeoGS-SLAM: Geometry-Only Gaussian Splatting for Dense Monocular SLAM Figure 1
2026-07-09cs.RO

GeoGS-SLAM: Geometry-Only Gaussian Splatting for Dense Monocular SLAM

Lipu Zhou, Yaoyun Kang, Junxiang Pang, Shengkai Sun, Tingting Bao, Kehan Wang

2026-07-09三维

这篇论文针对3DGS-SLAM中过度建模外观会拖慢几何收敛、引入漂浮伪影的问题,提出只保留位置、旋转、尺度和不透明度的GeoGS,并配合几何/光度监督、局部平面初始化和统一Sim(3)地图更新来避免回环后的撕裂。实验显示其在Replica、ScanNet++和ScanNet上提升重建质量与跟踪精度,Replica平均精度提升25%、完整度提升5%,ScanNet++ Chamfer Distance降低30%。

Immersive Social Interaction with VR and LLM-Assisted Humanoids Figure 1
2026-07-09cs.RO

Immersive Social Interaction with VR and LLM-Assisted Humanoids

Niraj Pudasaini, Geeta Chandra Raju Bethala, Pranav Doma, Anthony Tzes, Yi Fang

2026-07-09机器人

面向养老陪伴、危险环境搜救等场景中传统人形机器人遥操作认知负担高、行走控制困难的问题,本文将 Apple Vision Pro 手部追踪、语音指令解析与 GPT-4 辅助控制结合,实现语音行走、VR 操作和双向社交交互,并同步采集多模态数据。实验在抓取瓶子和传递方块任务上验证系统可用性,新手成功率分别为 0.8 和 0.7,专家为 0.90 和 0.8,但评测规模较小,泛化能力文中未充分说明。

Initiation Safety: A Missing Dimension in Generalist-Robot Safety Figure 1
2026-07-09cs.RO

Initiation Safety: A Missing Dimension in Generalist-Robot Safety

Zhijin Meng, Francisco Cruz

2026-07-09机器人安全鲁棒

论文指出通用机器人安全不应只看避碰或对话合规,还要判断是否有权迈出首次难以撤回的社交动作。核心洞察是把“启动授权”独立为第三层安全门,并提出 PAS:先用可逆探测收集证据,再按场景/用户偏好授权发声或行动。文中在门口人形机器人上实现框架,并给出日志对比和三条件用户研究方案,但实际用户实验结果与相对增益文中未充分说明。

Multi-Agent Robotic Control with Onboard Vision-Language Models Figure 1
2026-07-09cs.MA

Multi-Agent Robotic Control with Onboard Vision-Language Models

Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

2026-07-09机器人视觉语言视觉感知规划控制

论文针对机器人VLM/VLA依赖外部算力、长任务上下文保持差和可解释性不足的问题,提出全机载多智能体控制架构,由Megamind负责规划、委派与恢复,并让专用视觉/安全/控制代理协作。系统在仓库硬件在环仿真中用3B级VLM运行,包裹质检微调后准确率由76.7%升至91.5%,显示本地化MAS可作为低成本云端替代方案。

Communicative Efficiency of Single vs. Multi-Axis Robot Neck Motion Figure 1
2026-07-09cs.RO

Communicative Efficiency of Single vs. Multi-Axis Robot Neck Motion

Chapa Sirithunge, Haewon Jeong, Qinghua Guan, Fumiya Iida, Josie Hughes

2026-07-09机器人

这篇论文针对人形机器人颈部既要表达社交信号又受能耗约束的问题,把颈部运动建模为通信信道,用像素变化熵与能量构成 Motor Information Space 评估效率。实验显示信息量并非随自由度增加而上升,而是在 2DoF 达峰、3DoF 下降且能耗更高,形成“形态信息瓶颈”;感知实验也表明多轴运动会降低语义清晰度。

PLED-VINS: A Point-Line Event-Based Visual Inertial SLAM for Dynamic Environments Figure 1
2026-07-09cs.RO

PLED-VINS: A Point-Line Event-Based Visual Inertial SLAM for Dynamic Environments

Seunghun Lee, Jihun Nam, Dong-Uk Seo, Hyun Myung

2026-07-09机器人

这篇论文针对动态场景中移动物体和高速运动使视觉惯性 SLAM 观测不可靠的问题,提出 PLED-VINS:用事件流的熵-新近性评分估计点线特征的时间可靠性,再结合点线鲁棒 BA 的几何可靠性进行自适应加权,以压低动态观测影响。实验在含移动物体的动态序列上显示其状态估计优于对比方法,但具体增益在不同场景中的来源仍需结合完整结果判断。

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report Figure 1
2026-07-09cs.RO

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Wenyu Liu, Menglin Yang, Minqi Gu, Yaru Zhao, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

2026-07-09机器人

这篇报告针对四足机器人缺少可规模化、物理可行动作数据而难以形成通用控制器的问题,提出 ABot-C0:用视频生成、动捕、遥操作和人工设计构建 16074 段动作数据,并结合 Flow-Matching 跟踪策略、MCRC、全地形感知运动栈与统一部署系统。结果显示动作跟踪随数据规模提升,零样本成功率超过 90%,并在城市地形导航和陪伴式交互中验证了多策略切换与实机鲁棒性。

HumAIN: Human-Aware Implicit Social Robot Navigation Figure 1
2026-07-09cs.RO

HumAIN: Human-Aware Implicit Social Robot Navigation

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

2026-07-09机器人

面向人群环境中的社交导航,论文指出仅用位置/速度会丢失步态、朝向等预示意图的身体线索。HumAIN用含骨架关键点等特权多模态输入训练教师,再将潜在表征蒸馏到只需RGB和目标的轻量学生,使社会线索直接进入轨迹规划。实验称相对现有方法各项指标平均提升29.8%,但具体增益在不同场景中的来源仍需看消融细节。

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment Figure 1
2026-07-09cs.RO

Towards Reliable Aerial Ground Vehicle Collaboration: An Integrated Planning and Autonomy Framework for Field Deployment

Md Safwan Mondal, Luca Russo, James D. Humann, James M. Dotterweich, Pranav Bhounsule

Pranav A. Bhounsule are with the Department of Mechanical, and Industrial Engineering, University of Illinois Chicago, IL

2026-07-09规划控制

针对长时巡检/侦察中无人机续航不足、需与地面车协同充电且现场扰动会破坏会合计划的问题,论文提出端到端空地协作框架:用DRL联合规划访问顺序和会合点,并以YAML任务接口、PX4/ROS2自治栈和在线RARP重规划衔接执行。实验显示其任务时间优于启发式方法,RARP将能量裕度违规率由83.33%降至20.00%,户外任务含动态插入和搜救场景得到验证。

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders Figure 1
2026-07-09cs.RO

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

2026-07-09机器人视觉语言

面向社交机器人在多人对话中不能只靠静音规则判断轮次的问题,论文将语音活动投影扩展为音视频 MM-VAP,用语音相关预训练编码器、LoRA 适配、说话人间注意力和语义一致性损失来预测未来发声状态。在 NoXi、NoXi+J 上相对基线提升,部分轮次事件更明显,并在 Haru EDR 上显示其适合机器人调解场景。

TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation Figure 1
2026-07-09cs.RO

TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation

Jianyi Zhou, Feiyang Hong, Yunhao Li, Yicheng Zhao, Yongjue Cen, Zirui Liu, Jiakang Huang, Zirui Chen, Ruiyang Zhang, Weizhuo Zhu, Xuhua Song, Shuo Yang

2026-07-09机器人强化学习

面向插入、擦拭、软物体抓取等接触密集操作,论文指出单一 VLA/触觉策略难以同时处理慢速语义规划和快速滑移、力控纠偏。TouchWorld 将子任务规划、触觉世界模型预测、视觉-触觉目标条件动作生成与高频触觉残差修正分层解耦,把触觉同时作为预期接触目标和在线反馈。在六个真实机器人任务中,干净场景成功率 65.0%,人扰动下 53.7%,较最强基线分别高 15.7 和 18.5 个百分点。

Programmable Synchronization Graphs for Adaptive and Fault-Tolerant Modular Miniature Robots Figure 1
2026-07-09cs.RO

Programmable Synchronization Graphs for Adaptive and Fault-Tolerant Modular Miniature Robots

Okan Kulekcioglu, Arqam Bin Ahmad, Ines Garcia, Filipe Serra Alves, Onur Ozcan, M. Selim Hanay

Department of Mechanical Engineering, Bilkent University, International Iberian Nanotechnology Laboratory (INL), Abstract: Modular miniature robots could provide scalable function in constrained, self-reconfigurable robotic systems can provide versatility, scalability and fault, they suffer from programmability and scalability constraints, because frequency and

2026-07-09机器人

面向微型模块机器人在算力、通信和单元失效受限时难以协同的问题,论文把每个执行器-传感器对建模为同步图节点,用固定组内边同步异构模块、少量带符号组间边编程相位与步态,并可在线选择边。实验证明最多九模块可同步,五模块产生类似奔跑/小跑接触模式,稀疏正则图仍保持同步且降低耦合负担;更高图度提升失效容忍度,UCB选边相比集中式领从控制将最坏相位误差约降至三分之一。

Manual, Joystick, or Haptic Control? An In Vitro Comparison of Navigation Strategies for Robotic Interventional Neuroradiology Procedures Figure 1
2026-07-09cs.RO

Manual, Joystick, or Haptic Control? An In Vitro Comparison of Navigation Strategies for Robotic Interventional Neuroradiology Procedures

Benjamin Jackson, Nikola Fischer, Harry Robershaw, Xingyu Chen, S.H.Hadi Sadati, Yang Li, Jeremy Lynch, Nasr Abdelsalam, Jonathon Buwanabala, Matthew Benger, Sara Sciacca, Naga Kandasamy, Marco Mancuso-Marcello, Parthiban Balasundaram, Sahan Guruge, Neelan Das, Alejandro Granados, Kawal Rhode, Thomas C Booth

2026-07-09机器人规划控制

面向脑血管介入机器人从手动操作迁移到远程操控时的界面选择问题,论文在带力传感的体外血管模型上比较手动、摇杆、仿器械控制及触觉反馈。结果显示手动最快,仿器械控制整体优于摇杆且更直观,所有机器人模式壁面力低于穿刺阈值;触觉反馈有改善趋势但未达显著,增益来源仍不充分明确。

Safe Reinforcement Learning using Ideas from Model Predictive Control Figure 1
2026-07-09cs.LG

Safe Reinforcement Learning using Ideas from Model Predictive Control

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

2026-07-09强化学习规划控制安全鲁棒

这篇论文针对机器人和工业 CPS 中强化学习探索可能越过机械/执行器硬约束的问题,提出先用离线 MPC 计算递归可行的状态-动作集合,再用投影安全滤波器约束 RL 动作,从而把重计算移出实时环路。作者在 Quanser Aero 2 的 1-DOF 俯仰硬件上验证了安全探索和稳定收敛,但方法依赖动力学模型精度,且网格化离线映射的高维扩展性文中仍未充分解决。

Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators Figure 1
2026-07-09cs.RO

Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller, Mattia Piccinini, Johannes Betz

2026-07-09强化学习

这篇论文针对机器人中把生成式世界模型当作闭环测试裁判的风险:画面逼真并不等于能正确响应动作、给出可信安全结论。作者将VV&A、SOTIF和场景测试思想改造成L0-L4“可采信性阶梯”,要求先证明动作鲁棒性、适用包络、失效归因和现实迁移,才把仿真判决作为证据。在自动驾驶两个世界模型上的初步验证显示,视觉生成质量更高的模型反而在动作跟随和L2范围上更弱,说明FVD等指标不能替代闭环可信度评估。

Disturbance-aware Motion Planning for Over-actuated Underwater Vehicles Exploiting Actuation Redundancy for High-fidelity 3D Reconstruction Figure 1
2026-07-09cs.RO

Disturbance-aware Motion Planning for Over-actuated Underwater Vehicles Exploiting Actuation Redundancy for High-fidelity 3D Reconstruction

Yuer Gao, Tongqing Xu, Qingyang Liu, Yi Cai

This work was supported by the Hong Kong University of Science and Technology (Guangzhou). 1 All authors are with the Smart Manufacturing Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China.

2026-07-09规划控制三维

这篇论文针对水下近距离三维重建中推进器扰动会扬起沉积物、直接破坏成像质量的问题,利用八推进器ROV的过驱动冗余,在满足运动约束的同时于推力零空间中选择对目标区域扰动更小的分配,并引入可实时求解的尾流代理模型。实验显示其将目标区域粒子速度降低67%,重建RMSE较扰动无感基线降低55%,成功率达到98.5%。

Learning Spatiotemporal Tubes for Full Class of Signal Temporal Logic Tasks for Control of Unknown Systems under Input Constraints Figure 1
2026-07-09cs.RO

Learning Spatiotemporal Tubes for Full Class of Signal Temporal Logic Tasks for Control of Unknown Systems under Input Constraints

Ahan Basu, Ratnangshu Das, Soumyodipta Nath, Siyuan Liu, Pushpak Jagtap

Centre for Cyber-Physical Systems, Indian Institute of Science, Bengaluru, India, Electrical Engineering Department, Eindhoven Institute of Technology, Netherlands

2026-07-09规划控制优化算法

面向机器人在未知非线性 Euler-Lagrange 动力学和输入受限下执行复杂 STL 时序任务的难题,本文用物理信息神经网络学习球形时空管,将 STL 鲁棒度和 Lipschitz 约束写入训练,并给出闭式有界控制律保证轨迹留在管内。实验覆盖单体、多智能体和硬件场景,显示可满足全类 STL 规格且在线控制达到微秒级。

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields Figure 1
2026-07-09cs.RO

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields

Ahmet Ercan Tekden, Yasemin Bekiroglu

2026-07-09模仿学习

面向少样本示教中的长时程操作,论文指出传统运动基元依赖手工特征且组合方式常需人工指定。其核心做法是用物体中心神经场学习可解释的场景潜变量,再通过时序 MoE 门控组合物体条件运动基元生成完整轨迹。仿真长程任务和真实实验显示,该方法较图像基线显著减少训练数据,并具备噪声鲁棒性、类别级泛化和直接利用 3D 场景表示的能力。

How the Fusion of Onboard Sensors and V2X Data can Improve (or not) the Cooperative Perception of Connected Automated Vehicles Figure 1
2026-07-09cs.NI

How the Fusion of Onboard Sensors and V2X Data can Improve (or not) the Cooperative Perception of Connected Automated Vehicles

Amir Mohammadisarab, Miguel Sepulcre, Luca Lusvarghi, Javier Gozalvez

Uwicore lab., Universidad Miguel Hernández de Elche (UMH), Spain., collaboratively enhance situational awareness. Several studies, limited available spectrum. Consequently, current ETSI [4], in its early stages. Studies on the design of scalable

2026-07-09机器人

面向车载传感器受遮挡、视距和恶劣环境限制的问题,论文关注V2X协同感知数据与本车传感器在对象/轨迹层的真实融合,而非简单取并集;核心洞察是传感器噪声、V2X丢包和GNSS误差会显著影响关联与融合质量。结果显示协同感知可扩大感知范围、提升可见目标数量,但融合过程可能产生幽灵车辆,若不处理反而会引入额外错误。

GeoProp: Grounding Robot State in Vision for Generalist Manipulation Figure 1
2026-07-09cs.RO

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

Tongji University, DAMO Academy, Alibaba Group, HuPan Lab, Nanyang Technological University

2026-07-09机器人视觉语言视觉感知

这篇论文针对机器人策略中本体状态常被当作孤立向量、难以和视觉特征对齐的问题,提出 GeoProp:把末端执行器状态投影到图像特征图,在对应位置采样并用 FiLM 注入空间先验,同时加入短时运动预测采样。实验覆盖 67 个任务,在 Diffusion Policy、π0 和真实 Mobile ALOHA 任务上分别带来约 8.7%、4.0% 和 10.6% 的平均增益,参数只增加 2–3%。

PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation Figure 1
2026-07-09cs.RO

PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation

Zezeng Li, Enda Xiang, Thuy Tran, Di Huang, Momath Thiam, Liming Chen

Beihang University, China

2026-07-09机器人生成模型

PriGo针对扩散/流式机器人策略在分布变化和长程任务中易学到表层动作相关、缺少操作意图的问题,提出测试时原语引导:用PANet从观测和指令预测操作原语分布,再以可微一致性目标修正生成动作,无需重训原策略。LIBERO、CALVIN、SIMPLER及真实机器人实验显示其提升鲁棒性、长程执行和泛化,但结论也承认插件式设计使增益有限。

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation Figure 1
2026-07-09cs.RO

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

2026-07-09机器人安全鲁棒

这篇论文针对多机器人任务中高层LLM规划难以落地到真实接触操作、且执行失败会级联的问题,提出由规划、操作和验证三类智能体组成的闭环框架:先按依赖和能力分解分配任务,再用感知与抓取等工具 grounding,最后通过结果验证触发局部或全局重规划。真实机器人实验覆盖六类任务,显示其在成功率、扰动恢复和跨工作空间协作上优于若干学习式与LLM基线。

Ace! Motion Planning of Professional-Level Table Tennis Serves with a Robot Arm Figure 1
2026-07-09cs.RO

Ace! Motion Planning of Professional-Level Table Tennis Serves with a Robot Arm

Guillem Torrente, Guilherme Jorge Maeda, Divij Grover, Megumu Tsukamoto, Hamdi Sahloul, Peter Dürr

2026-07-09机器人规划控制

这篇论文针对乒乓球机器人长期偏重回合击球、而发球仍缺少合规且高水平方案的问题,提出将参数化运动基元、模型预测控制与 HEBO 贝叶斯优化结合,搜索拍面撞击状态与时机,并通过仿真生成、实机筛选和在线策略选择形成发球库。结果显示机器人可产生最高约 550 rad/s 旋转和 6.7 m/s 球速,速度、旋转与落点控制达到或超过精英选手水平。

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time Figure 1
2026-07-09cs.RO

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang

Peking University, Tsinghua University

2026-07-09强化学习

这篇论文针对机器人基础模型部署时难以快速适配新任务或用户偏好、常需机器人示教或微调的问题,提出 WAM-TTT:把未标注人类操作视频通过测试时自监督视频预测写入冻结 WAM 内的轻量快权重记忆,并用人机配对数据做元训练对齐控制信号。实验显示其在多种操作任务和泛化设置中优于上下文视频条件基线,但对人机阶段配对质量和训练分布外漂移仍较敏感。

SPECTRA: Context-Conditioned Spectral Movement Primitives for Robot Skill Generalization Figure 1
2026-07-09cs.RO

SPECTRA: Context-Conditioned Spectral Movement Primitives for Robot Skill Generalization

Boxuan Zhang, Sheng Liu, Chenglin Ming, Ahmed Abdelrahman

School of Computation, Information and Technology, Technical University of Munich, Germany, Karlsruhe Institute of Technology, Germany, The Department of Automation, Shanghai Jiao Tong University, China

2026-07-09机器人学习理论

这篇论文针对模仿学习中“先生成轨迹、再限速限加速度”容易破坏末端路径的问题,提出 SPECTRA/SMP:用有限时域傅里叶系数表示技能,以低频任务带建模主要几何结构,并用上下文条件 GMM/GMR 在规范任务坐标系预测谱系数;执行时通过相位调节满足关节速度和加速度约束而不改路径。实验显示其在跨任务框架泛化、抗扰重构、降低动态违规和 jerk、以及 Franka Panda 实机部署上保持了较好的末端轨迹一致性。

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent Figure 1
2026-07-09cs.RO

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

2026-07-09规划控制

面向 eVTOL/无人机在复杂空域中既要避障又要理解操作者偏好的航路规划问题,论文提出 FRAMe:用 LLM 直接生成航点,并结合 RAG 记忆检索历史方案、多模态 coach 进行几何有效性与偏好一致性检查。实验在四种 LLM、三档难度上做消融,完整系统对各 planner 均取得最高有效率,最高总体 93.8%,且在距离、航点数、避障间距等偏好指标上朝操作者目标改善。

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation Figure 1
2026-07-09cs.RO

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

Corresponding author.All authors are with NAVER LABS Corp., Republic of Korea

2026-07-09生成模型

自动驾驶仿真常被单一真实轨迹指标牵引,导致模型追求逼真却忽视多样可行未来。Flow-ERD用按智能体类型约束的连续流匹配生成车辆、骑行者和行人的运动,再以熵正则蒸馏缓解闭环协变量偏移并抑制模式坍缩。实验在WOSAC测试集真实度排名第一,并在验证集的真实度-多样性帕累托前沿优于可复现基线。

Residual-Conservative Model Predictive Path Integral Control Figure 1
2026-07-09eess.SY

Residual-Conservative Model Predictive Path Integral Control

Hyung-Jin Yoon, Hunmin Kim

Department of Mechanical and Nuclear Engineering, Tennessee Technological, University, Cookeville, TN, USA. ‡ H. Kim is with the School of Engineering, Department, of Electrical and Computer Engineering, Mercer University, Macon, GA, USA.This work was supported by internal funding at Tennessee, Technological University.

2026-07-09规划控制

针对低成本机器人中名义模型与真实执行偏差会削弱MPPI约束满足的问题,论文提出RC-MPPI,用预测-执行残差在线调节约束收紧、安全代价和温度;关键洞察是模型越不准,轨迹代价排序越不可信,应升高温度避免过度相信采样权重。理论上给出违约概率随残差保守化而降低的界,并在点质量和2R机械臂仿真中提升安全裕度、成功率与控制效率。

Dynamic Object Detection and Tracking in Construction: A Fisheye Camera and LiDAR Sensor Fusion Model Figure 1
2026-07-09cs.RO

Dynamic Object Detection and Tracking in Construction: A Fisheye Camera and LiDAR Sensor Fusion Model

Yilong Chen, Huili Huang, Yong K. Cho

assigns semantic labels by projecting 3D coordinates onto a 2D, computational resources, extensive labeled datasets, and heavy, YC, HH, YC are with Georgia Institute of Technology, Atlanta, GA 30332, comprises two core modules: (1) a projection and labeling, labeled point cloud data, accurate calibration between a, resources, our methods acquire and utilize the label from a, hand, we only project detected dynamic object centers onto a, environment, semantic labels are assigned through sensor, shown in Fig. 1, the centers of the detected dynamic objects, frame. These 3D centers are then projected onto the cylindrical, panoramic canvas to spatially align with 2D object labels, projected center point of each dynamic object with the

2026-07-09视觉感知

面向施工现场中机器人与人员共存时的安全导航,论文针对纯 LiDAR 难以给运动目标赋予语义、目标短暂停止时跟踪易退化的问题,提出将上视鱼眼相机生成的柱面全景与 SLAM 点云动态目标中心对齐,用 YOLOv8 标签反向更新三维目标和卡尔曼滤波。实机室内施工场景实验显示,该融合方法可减少图像误检和点云漏检,并提升动态/静态切换目标的跟踪稳健性。

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model Figure 1
2026-07-09cs.RO

GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model

Peter Bohm, Saimunur Rahman, Abdelwahed Khamis, Sagun Man Singh Shrestha, Chris McCool, Peyman Moghadam

2026-07-09机器人视觉语言

GemNav 针对视觉导航模型依赖专用视觉编码器、连续动作头和大规模跨机器人数据的问题,检验冻结 MLLM 视觉表征是否已足够。其核心做法是仅用 LoRA 调整语言塔,把路点和停止/不可达信号统一为离散 token,并用软解码损失保留度量结构。模型只用 8.7 小时 SCAND 数据训练,却在四个未见真实环境的 20 次位姿目标试验中全部到达,终止误差约 0.25–0.42 米;但跨平台迁移、纯图像目标自动停止仍未充分验证。

CaLiSym: Learning Symplectic Dynamics of Real-World Systems through Structured Canonical Lifts Figure 1
2026-07-09cs.RO

CaLiSym: Learning Symplectic Dynamics of Real-World Systems through Structured Canonical Lifts

Aristotelis Papatheodorou, Pranav Vaidhyanathan, Natalia Ares, Ioannis Havoutis, Gerard J. Milburn

2026-07-09强化学习

机器人动力学常受驱动、耗散和接触影响,直接套用保守系统的辛结构会约束错对象。CaLiSym 的关键做法是把物理状态及端口显式提升到规范相空间,在提升空间学习严格辛映射,再投影回原状态。实验覆盖耗散双摆、真实四旋翼和接触四足,显示其在分布外自回归预测上优于基线,并能数值保持辛形式。

G-PROBE: Cross-FOV Place Recognition and Certainty-Coupled Localization for 3D Point Clouds Figure 1
2026-07-09cs.RO

G-PROBE: Cross-FOV Place Recognition and Certainty-Coupled Localization for 3D Point Clouds

Jinseop Lee

2026-07-09视觉感知三维

针对现有3D点云地点识别默认依赖360度对称视场、在窄视场或跨传感器场景中易失效的问题,G-PROBE提出无需学习的跨FOV全局定位框架:用虚拟传感器分解和分支集成处理航向假设,并将前端占据一致性产生的BEV确定性图耦合到CG-GICP配准。实验覆盖五个LiDAR数据集和三类模态,在多会话学习-free方法中平均F1最高;360度到60度不对称视场下仍保留约54% Recall@1,明显优于基线。

A Continual Learning Framework for Adaptive Control of Modular Soft Robots Figure 1
2026-07-09cs.RO

A Continual Learning Framework for Adaptive Control of Modular Soft Robots

Nilay Kushawaha, Muhammad Sunny Nazeer, Baljinder Singh Bal, Cecilia Laschi, Egidio Falotico

The BioRobotics Institute, Scuola Superiore Sant’Anna, 56024, Pontedera, Italy, Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, 56127, Pisa, Italy, Department of Mechanical Engineering, National University of Singapore, 119077, Singapore, ETIS Lab UMR8051 CY Cergy Paris University - ENSEA - CNRS, France

2026-07-09机器人规划控制

模块化软体机器人在增减模块或固定多模块控制时,常因非线性动力学和集中式控制而需要重训、扩展性差。本文提出 SMPL 持续学习框架,用子网络和横向连接逐步学习不同构型,也可按模块分布式建模。仿真与三模块气动软臂实验证明其能保持旧构型知识、提升轨迹跟踪精度,并通过选择性激活模块降低计算开销。

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees Figure 1
2026-07-09cs.RO

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

Bhavya Sai Nukapotula, Samin Moosavi, Haoze Wang, Luke Duncan, Diya Shakkottai, Varun Murali, Srinivas Shakkottai

Texas A&M University, Student at Westwood High School, work done as an intern at Texas A&M University.

2026-07-09机器人规划控制

针对纯 LLM 机器人规划难以保证可执行与安全、传统 PDDL 又依赖完整形式化且不善用语境修复的问题,EvoPlan 将本地开源 LLM 置于可验证闭环中:从示范轨迹挖掘全局 STL 运动约束,用进化式 PDDL 生成/修复计划,并在执行前检查航点、违规重规划。实验显示其在 ALFWorld Text 优于强基线,对词表错配更稳健,且可在 Bench2Drive、HA-VLN-CE 与 Gazebo 中作为安全约束屏蔽器使用。

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review Figure 1
2026-07-09cs.RO

Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review

Inkyu Sa, Chanoh Park, Hea-Min Lee, Donghee Noh, Ho Seok Ahn

RovifyLab, Gyeonggi 13840, Republic of Korea, IT Application Research Center, Jeonbuk Regional Branch, Korea Electronics Technology Institute (KETI), Department of Electrical, Computer and Software Engineering, University of Auckland

2026-07-09机器人视觉感知

本文针对VLA研究长期偏重机械臂、无人机端到端控制综述不足的问题,统一梳理2017-2026年183项工作,将双臂协同与无人机导航/抓取视为同一类视觉-语言-动作问题。核心洞察是连续、分块动作生成,尤其流匹配和混合方案,较离散动作token或多步扩散更适合低延迟协调控制;结果显示跨本体数据、多任务共训和自主练习强化学习比单纯扩大数据规模更关键,并提出面向部署的双系统架构与14个研究方向。

SPEAR: A Simulator for Photorealistic Embodied AI Research Figure 1
2026-07-09cs.CV

SPEAR: A Simulator for Photorealistic Embodied AI Research

Mike Roberts, Renhan Wang, Rushikesh Zawar, Rachith Dey-Prakash, Quentin Leboutet, Stephan R. Richter, Matthias Müller, German Ros, Rui Tang, Stefan Leutenegger, Yannick Hold-Geoffroy, Kalyan Sunkavalli, Vladlen Koltun

2026-07-09机器人

SPEAR针对现有UE具身AI仿真器通用性、可编程性和高分辨率图像回传速度不足的问题,核心思路是通过模块化插件直接连接UE运行时反射系统,把1.4万多个UE函数暴露给Python,并支持异步调用、共享内存和帧内确定性任务图。结果显示其1080p图像可达73 FPS,相比UnrealCV+快9至21倍,并能控制多类智能体、生成多模态真值和联动MuJoCo。

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM Figure 1
2026-07-09cs.RO

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM

Andrew Fishberg, Yixuan Jia, Jonathan P. How

2026-07-09视觉感知

这篇论文针对协同 SLAM 中全局描述子持续广播会被已攻陷队友反推出图像与轨迹的问题,提出只在回环候选检测的相似度比较环节引入安全多方计算,而非加密整条 SLAM 流水线。其核心取舍是把隐私保护集中在轻量前端操作上,以降低开销。仿真和硬件实验显示,CILC 在视觉与 LiDAR 描述子上可实时运行、通信量可接受,并减少对内部恶意成员的信息泄露。

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation Figure 1
2026-07-09cs.RO

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

Shanghai AI Laboratory, Shanghai Jiao Tong University, Zhejiang University, Tsinghua University

2026-07-09机器人数据集/基准

RoboSnap针对机器人学习中真实数据采集昂贵、评测难复现的问题,尝试把单张RGB图像直接转成可交互仿真场景。其关键做法是分层重建:前景交互区域用碰撞感知资产和位姿修正保证物理稳定,背景用3D Gaussian Splatting保留视觉上下文。实验显示其场景可支持轨迹回放、合成数据训练,并在策略评测中呈现一定sim-real相关性,同时发布564个DROID场景的DROID-Sim数据集。

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation Figure 1
2026-07-09cs.RO

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

The University of Hong Kong, Beihang University, Peking University, The Chinese University of Hong Kong

2026-07-09机器人

NativeMEM针对预训练VLA在长时程操作中只能依赖当前观测、难以保留细粒度历史的问题,提出复用原视觉编码器的Native Memory Compression,将每个历史帧-视角压缩为一个原生记忆token,并通过两阶段训练对齐策略与任务微调。实验显示其在仿真中将成功率由32.4%提升到84.0%,真实机器人最高达98.7%,且以较低延迟和约20%训练数据达到有竞争力表现。

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization Figure 1
2026-07-09cs.RO

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

Zeyuan Ding, Wenhai Liu, Yang Xu, Jiayu Hu, Yinda Chen, Yi Zhang, Yong Dai, Jian Tang, Xiaozhu Ju

Beijing Innovation Center of Humanoid Robotics (X-Humanoid)

2026-07-09学习理论

论文针对现有 VLA 迁移到新物体、场景或机器人时过度依赖再采集和微调的问题,提出在感知与动作之间加入可学习 Reasoning Slots,让动作通路先聚焦指令相关物体和接触区域。结果显示其在零样本下已有更集中的操作注意力,RoboTwin 微调后达 91.4%/91.0% 成功率;但作者也承认仍存在 attention-to-action gap,可靠零样本控制尚未解决。

MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices Figure 1
2026-07-09cs.CV

MiLSD: A Micro Line-Segment Detector for Resource-Constrained Devices

Parsa Hassani Shariat Panahi, Amir Hossein Jalilvand, M. Hassan Najafi

π School of Computer Engineering, Iran University of Science and Technology, Tehran, Iran, + Electrical, Computer, and Systems Engineering Department, Case Western Reserve University, OH, USA

2026-07-09机器人

MiLSD面向SLAM、三维重建和工业检测中受MCU内存限制的线段检测问题,重点不是追赶GPU解析器,而是在亚MB预算下摸清精度-资源边界。论文发现F-Clip式中心、长度、角度表示在小模型中最有效,8位量化基本无损,4位尤其损伤角度回归。最终在约1MB激活预算内达到ShanghaiTech Wireframe sAP10=24.1,25k参数0.25MB基线为10.6。

2026-07-08

50 篇
Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation Figure 1
2026-07-08cs.RO

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

2026-07-08机器人三维

这篇论文针对现有 VLA 在真实操作中缺乏可靠三维几何与时序动作建模的问题,提出 Lift3D-VLA:将点云与预训练 2D 位置嵌入对齐以复用 2D 编码器,并用 GC-MAE 同时重建当前点云、预测未来几何,再由 LLM 多层协同生成动作块。实验覆盖 22 个仿真和 8 个真实任务,在 MetaWorld、RLBench 分别较最佳基线提升 10.8% 和 11.1%,真实任务提升 4 个百分点;但部分收益可能也来自更大规模预训练数据。

Embodied Human-Robot Interaction via Acoustics: A MARL Approach with AcoustoBots for Spatial Data Physicalization Figure 1
2026-07-08cs.RO

Embodied Human-Robot Interaction via Acoustics: A MARL Approach with AcoustoBots for Spatial Data Physicalization

Shiqi Liu, Narsimlu Kemsaram, Prateek Mittal, Pengyuan Wei, Sriram Subramanian

Department of Computer Science, Department of Artificial Intelligence, Department of Computer Science University College London London United Kingdom, Department of Artificial Intelligence University of Malaya Kuala Lumpur Malaysia

2026-07-08机器人强化学习

针对传统数据物理化多为静态、与现场空间脱节的问题,论文提出 AcoustoBots:在 TurtleBot3 上搭载超声相控阵,用悬浮颗粒高度原位编码城市标量数据,并用 MADDPG 协调避障导航、GS-PAT 维持运动中声悬浮。实验在 4m×3m 英国缩尺地图上验证单/双机器人任务,成功率分别为 90% 和 80%,显示该声学高度 cue 可作为移动人机交互中的可扫视物理信号。

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Figure 1
2026-07-08cs.RO

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

2026-07-08机器人强化学习

本文针对开放世界机器人操作中2D视频世界模型缺乏几何 grounding、难以支持精细6DoF控制的问题,提出用同步RGB、深度和光流作为轻量4D表征,并构建三分支扩散模型与逆动力学策略头,从单帧RGB-D和语言指令预测4D演化并直接输出动作。其结果显示生成的时空一致性更好,在真实双臂灵巧操作上达到SOTA,尤其提升空间精度和时序协调任务。

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation Figure 1
2026-07-08cs.RO

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

2026-07-08强化学习

论文针对真实遥操作采集受硬件、场景和人工重置限制而难以规模化的问题,提出“数字遥操作”:用手部姿态驱动机器人中心的动作条件世界模型,从单张参考图生成同步视觉轨迹,并将姿态重定向为机器人动作。其关键在深度感知骨架条件、人体到机器人渐进训练和流式自回归蒸馏,使模型在单 H100 上达到 40+ FPS。实验显示,仅用生成数据训练的策略可零样本迁移到真实双臂灵巧任务,且与真实数据混合能提升成功率,但跨机器人仍需平台级微调。

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation Figure 1
2026-07-08cs.RO

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

Tsinghua University, State Key Laboratory of General Artificial Intelligence, BIGAI, Harbin Institute of Technology, Peking University

2026-07-08机器人

这篇论文针对移动操作中“到达目标附近但姿态仍不适合操作”的最后一米导航问题,提出 UniLM-Nav:用同一个多模态大模型完成视角选择、任务条件 affordance 定位和结合机器人几何的底盘位姿推理。其核心洞察是,开放词汇操作需要细粒度空间关系而非仅目标物体定位。在 OVMM 上总体成功率达 23.77%,比 MoTo 高 3.13 个百分点,并在 Unitree 机器人上做了实机验证。

Neural-ESO: A Dual-Pathway Architecture for Provably Robust Learning-Based Control Figure 1
2026-07-08cs.RO

Neural-ESO: A Dual-Pathway Architecture for Provably Robust Learning-Based Control

Fan Zhang, Richie Suganda, Jinfeng Chen, Wenhua Liu, Hantao Fu, Bin Hu, Qin Lin

2026-07-08规划控制安全鲁棒

面向无人机降落等受时变未知扰动影响的安全控制,论文指出单纯依赖学习模型在训练期和分布外场景中缺乏稳定性保证。Neural-ESO将神经网络前馈扰动预测与传统ESO在线校正并联,并用Lipschitz约束给出UUB稳定条件。四旋翼地效实验显示其在正常、坡面OOD和高速近地扰动下比基线更稳健,但增益与训练数据覆盖的关系仍需进一步辨析。

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning Figure 1
2026-07-08cs.RO

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

2026-07-08机器人强化学习规划控制安全鲁棒

面向家庭服务机器人在开放世界中缺少对象位置、属性和动作效果知识的问题,论文提出 HUME,将基础模型生成的状态与转移假设显式表示为不确定变量,并把假设验证嵌入目标规划,使机器人在执行任务时主动收集信息、更新世界模型。仿真和真实机器人实验显示,该框架能提升自主知识扩展与任务完成能力,但具体增益相对不同基础模型和规划器的来源仍需结合完整实验细节判断。

Clustering-Embedded Model Predictive Path Integral Control: Avoiding Averaging-Induced Failure and Enabling Efficient Cluster Selection for Dynamic Obstacles Figure 1
2026-07-08cs.RO

Clustering-Embedded Model Predictive Path Integral Control: Avoiding Averaging-Induced Failure and Enabling Efficient Cluster Selection for Dynamic Obstacles

Zidong Liu, Kaixin Chang, Xu Chen

2026-07-08规划控制

这篇论文针对 MPPI 在障碍物前方会把左右绕行轨迹加权平均、导致犹豫甚至碰撞的问题,提出 CE-MPPI:先剔除碰撞 rollout,再用基于碰撞参考点的几何方向特征进行 DBSCAN 聚类,并按静态最低成本或动态障碍物反向运动选择单一簇更新控制。2D 仿真显示可缓解前方障碍犹豫和动态耦合,UR5e 实测达到到达时间降低 48%、末端路径缩短 12%。

Hilti-Trimble-Oxford Dataset: 360 Visual-Inertial Benchmark with Floor Plan Priors for SLAM and Localization Figure 1
2026-07-08cs.RO

Hilti-Trimble-Oxford Dataset: 360 Visual-Inertial Benchmark with Floor Plan Priors for SLAM and Localization

Samuele Centanni, Yuhao Zhang, Yifu Tao, Julien Kindle, Frank Neuhaus, Tilman Koß, Aryaman Patel, Michael Helmberger, Emilia Szymańska, Torben Gräber, Maurice Fallon

2026-07-08数据集/基准

面向施工现场进度监测中低成本视觉建图与按平面图定位的需求,论文发布Hilti-Trimble-Oxford数据集:30段跨7层、8个月采集的360视觉-惯性序列,配套2D平面图和LiDAR-惯性真值,并设置SLAM与平面图定位两类评测。挑战赛结果显示SLAM参与度更高、方法更成熟,而平面图定位误差更大,说明该场景仍是开放难题。

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models Figure 1
2026-07-08cs.RO

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

2026-07-08模仿学习

这篇论文针对 VLA 模仿学习中大规模演示数据冗余、噪声和覆盖不均导致“更多数据不一定更好”的问题,提出 SIEVE:把轨迹看作可复用视觉-运动基元及其转移接口的组合,先发现基元,再按结构暴露度分配筛选预算,并在同类组合中选择中心稳定轨迹。实验显示其在多数据集、基准和 VLA 模型上优于数据选择基线,并可用 50% 演示和训练步数超过全量训练。

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation Figure 1
2026-07-08cs.RO

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation

Wongyun Yu, Youngwoon Kim, Minsu Cho

2026-07-08机器人规划控制

本文针对人机交互示教重定向中“手指轨迹不含接触力、直接跟踪反而约束操作”的问题,提出以腕部为分界的 WristMimic:身体和腕部按运动学目标跟踪,手指则通过物体位姿与接触结果学习。核心洞察是腕部少接触却决定抓取可达性,并配合腕部重置约束和奖励优先级。实验显示其在无需手指姿态监督时达到或超过全手指监督方法,并能跨不同手型迁移。

From Foundation to Application: Improving VLA Models in Practice Figure 1
2026-07-08cs.RO

From Foundation to Application: Improving VLA Models in Practice

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

2026-07-08机器人

这篇论文针对VLA模型从实验室走向真实机器人时遇到的具身差异、动作空间不足和动态场景预测弱的问题,提出LingBot-VLA 2.0:通过约6万小时机器人与第一视角数据预训练,覆盖20种机器人形态,并扩展到头、腰、移动底盘和灵巧手等全身动作,同时加入基于视频语义和深度几何的未来预测任务。GM-100和长程移动操作实验显示性能提升,但增益可能主要来自scaling / data,具体贡献拆分仍需更多说明。

Learning to Throw Objects Safely in Multi-Obstacle Environments Figure 1
2026-07-08cs.RO

Learning to Throw Objects Safely in Multi-Obstacle Environments

Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei

2026-07-08安全鲁棒

这篇论文针对物流分拣等场景中“直接投掷更快但障碍物会带来碰撞风险”的问题,将多障碍投掷建模为安全强化学习任务。核心做法是用固定网格的势场状态表示同时编码目标吸引与障碍排斥,并以动觉示教初始化投掷核,再用 SAC、DDPG、TD3 优化;相比显式障碍状态,它更易扩展到不同障碍数量与布局。实验显示 SAC 最稳定,势场表示在仿真中成功率和泛化性更好,真实机器人在未见物体和杂乱场景中最高达到 90% 成功率。

Towards Real-World Applications with an Autonomous Powered Wheelchair Figure 1
2026-07-08cs.RO

Towards Real-World Applications with an Autonomous Powered Wheelchair

Simone Arreghini, Alessandro Giusti, Alex Bordini, Enrico Ferrara, Giovanni Fulgoni, Antonio Paolillo

2026-07-08强化学习

面向轮椅用户在真实环境中对主动、直观辅助移动的需求,论文将商用自平衡 Genny Zero 轮椅扩展为概念性自主平台,集成 RGB-D 人体感知、手势交互与 LiDAR 定位导航。实验展示了远程召唤和人员跟随两类辅助应用,说明该集成在受控场景中可行,但仍处于初步验证阶段,真实拥挤环境、安全性与用户可用性挑战文中未充分说明。

Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement Figure 1
2026-07-08cs.RO

Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement

Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki

Institute of Science Tokyo

2026-07-08视觉语言视觉感知

这篇论文针对流匹配式视觉语言动作模型在机器人实时控制中动作头迭代去噪耗时高的问题,提出无需训练的 ActionCache:用紧凑多模态键缓存并检索相似上下文下的中间动作,以热启动后续生成而非从噪声开始。实验显示其在仿真和真实任务中可在低延迟下保持较高成功率,对 π0.5 和 GR00T-N1.6 分别最高带来 11.75× 与 34.43× 推理加速。

Responsible Personalisation: The Double-Edged Sword of Personalisation in Human-Robot Interaction Figure 1
2026-07-08cs.RO

Responsible Personalisation: The Double-Edged Sword of Personalisation in Human-Robot Interaction

Antonio Andriella, Jauwairia Nasir, Andrea Rezzani, Alyssa Kubota, Dimitri Lacroix, Tamlin Love, Aniol Civit, Vicky Charisi, Elisabeth Andre, Wing-Yue Geoffrey Louie

Free University of Bozen-Bolzano, San Francisco State University, Nantes Université, Univ Angers, Laboratoire de psychologie des Pays de la Loire, LPPL, Bielefeld University, Center for Cognitive Interaction Technology (CITEC), Centre for Collective Intelligence, MIT, Oakland University

2026-07-08机器人

这篇论文针对人机交互中个性化机器人一方面提升参与、效率和信任,另一方面可能放大自主性侵蚀、偏见、操控和隐私风险的问题,提出一个结合机器人具身性、个性化生命周期与短/长期、开放/封闭场景的责任个性化框架。主要结果是把关键伦理风险映射到具体交互阶段和场景,并给出设计建议与开放问题,为评估和部署更可解释、可问责的个性化机器人提供结构化依据。

OrchardBench: A Physically-Grounded, GPU-Parallel Apple-Orchard Simulation Benchmark for Agricultural Robotics Figure 1
2026-07-08cs.RO

OrchardBench: A Physically-Grounded, GPU-Parallel Apple-Orchard Simulation Benchmark for Agricultural Robotics

Humphrey Munn

2026-07-08机器人数据集/基准

果园采摘机器人受田间实验昂贵、不可复现且易损伤作物限制,缺少既可并行又具植物物理真实性的基准。OrchardBench 将随机生成苹果树建成可弯折、断裂、挂果和遮挡的 GPU 并行仿真,并配套移动机械臂、感知基线与损伤/效率指标。实验显示解析基线仅成功采摘约 40% 已检测果实、约八分之一可达果实,主要瓶颈在遮挡感知和安全接触。

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models Figure 1
2026-07-08cs.AI

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

Franz Motzkus, Sebastian Bernhard

Franz Motzkus is with AUMOVIO, Germany, and with the Department of Applied Computer Science, University of Bamberg, Germany.

2026-07-08机器人

论文针对端到端自动驾驶模型决策不透明、错误行为难以定位的问题,在模型潜表示中加入基于稀疏自编码器的无监督字典学习,将轨迹评分拆解为可解释概念,并通过抑制特定概念验证其因果作用。实验显示,干预与错误行为相关的概念可改善碰撞规避、可行驶区域和红灯合规等指标,无需重新训练即可提升整体驾驶表现。

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation Figure 1
2026-07-08cs.RO

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

Fudan University, 2 Tsinghua University, 3 Peking University, PsiBot, 5 Zhongguancun Academy

2026-07-08机器人强化学习

这篇论文针对灵巧手真实世界学习中高维手指动作易放大模仿误差、强化学习探索又容易破坏接触的问题,提出用历史条件的潜在运动先验把手部控制压缩到连续且可解码的 latent 空间,并让模仿学习和残差强化学习共享该接口。实验在四个真实机器人任务上显示,LAMP 从少量示范得到 56.25% 平均 IL 成功率,经在线 RL 提升到 98.75%,优于 raw、PCA 和离散动作表示。

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration Figure 1
2026-07-08cs.RO

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

University of Edinburgh 2 Honda Research Institute Europe

2026-07-08生成模型强化学习

这篇论文针对机器人中 flow/diffusion 策略推理慢、遇到分布外状态且缺少高质量示教时性能下滑的问题,提出 OTQL:用 critic 估计的优势权重调节条件最优传输耦合,使流匹配更偏向高价值动作并形成更直的生成路径。实验称仅需 50-60 次交互即可后训练,单任务成功率由 36% 提至 86%,SmolVLA 由 38% 提至 76%,同时每次动作生成推理步数减少 70%。

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition Figure 1
2026-07-08cs.RO

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

2026-07-08视觉语言视觉感知

本文关注长时程家务机器人中 VLA 技能串联的“语义交接”问题:单个技能看似完成,却未给下一个技能留下可执行状态。论文构建带类型化技能契约、步数预算、多视角 VLM 验证与重规划的 BEHAVIOR-1K 执行诊断框架,核心洞察是区分干净技能边界快照上的能力与真实链式状态下的组合鲁棒性。结果显示若干导航、抓取、放置、开门技能在快照中达 77–100% 成功,但端到端 rollout 仍频繁停滞,失败主要归因于下一技能就绪性、目标 grounding 与链式状态下控制执行。

RoboVAST: Automated Scenario-Based Validation of Robots at Scale Figure 1
2026-07-08cs.RO

RoboVAST: Automated Scenario-Based Validation of Robots at Scale

Frederik Pasch, Samuel Wiest, Argentina Ortega, Nico Hochgeschwender

2026-07-08机器人

这篇论文针对机器人场景验证依赖人工选例、难以复现和规模化的问题,提出把环境、任务、系统参数等维度显式组合建模,并用 RoboVAST 以声明式配置、插件生成和容器化执行批量展开测试。实验在导航任务上覆盖 5480 个场景配置、超过 10 万次运行和 1800 小时仿真,显示其主要价值在于系统化扩大测试空间并区分稳定失效与随机异常。

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment Figure 1
2026-07-08cs.RO

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

Department of Computer Science and Engineering, and the Department of, Ocean Science, Hong Kong University of Science and Technology

2026-07-08机器人

水下弱光、浑浊和扰动会使视觉惯性 SLAM 特征退化并引发估计发散,APVI-SLAM 的思路是把视觉惯性与 DVL、压力传感器分成可重加权的子估计器,在视觉失效时用可靠性感知融合和滑窗冻结恢复跟踪;同时用四叉树引导的 3D Gaussian 与水体介质建模做增量逼真建图。实验称其在公开和自建珊瑚礁多模态数据集上取得实时速度下的定位与重建 SOTA,但具体增益可能部分来自新数据与工程实现。

Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation Figure 1
2026-07-08cs.RO

Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation

Yan Pan, Yuanchuan Ren, Chipui Chan, Jingcheng Sun, Chengxu Zhou

2026-07-08机器人

这篇论文针对四足机器人难以同时保持稳定站姿、触达地面物体并完成双手操作的问题,提出在 Unitree Go2 两条前小腿内集成滑台、俯仰/偏航关节和夹爪,使机器人四足着地时也能在身体中线协同抓取。系统还用视觉语言模型在技能边界选择动作;仿真中完成开柜放篮、双手抬箱和左右手交接,但结果仍限于仿真,真实硬件效果文中未充分说明。

EAGOR: Embodied Reasoning in Omni-direction Figure 1
2026-07-08cs.RO

EAGOR: Embodied Reasoning in Omni-direction

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

2026-07-08机器人

EAGOR针对360度机器人导航中ERP全景投影会造成方向漂移的问题,把目标方向从像素预测改写为球面上的递归贝叶斯信念估计。其核心是用冻结VLM提供语义证据,再以球谐信念场在球面上累积和随运动等变传播方向信念,无需训练骨干模型。实验覆盖Habitat、HOS、OSR-Bench和四足机器人,主动搜索相对提升34.4%/45.6%,导航成功率提升14.6%、步数和角误差下降。

MP-MPPI: A Motion Primitive Guided Sampling-Based Optimizer for Model Predictive Control Figure 1
2026-07-08cs.RO

MP-MPPI: A Motion Primitive Guided Sampling-Based Optimizer for Model Predictive Control

Marlon Mathisen, Aksel Vaaler, Olav Egeland, Eleni Kelasidi

Norwegian University of Science and Technology, Dept. of Mechanical and Industrial Engineering, Norway

2026-07-08规划控制

针对传统 MPPI 依赖局部噪声采样、在障碍场景中探索不足且提高噪声又易损害稳定性的矛盾,论文将预计算的可行动作基元作为结构化样本并入实时 MPPI 加权更新。四旋翼仿真表明,该方法在避障导航中相较基础 MPPI 提升了控制空间探索与碰撞规避表现,同时保留了实时反应能力;但结果仍主要限于仿真实验。

ThorArena: Benchmarking Humanoid Physical Interaction with Human Motion-Force Demonstrations Figure 1
2026-07-08cs.RO

ThorArena: Benchmarking Humanoid Physical Interaction with Human Motion-Force Demonstrations

Chenhao Yu, Hongwu Wang, Weitao Zhang, Youhao Hu, Jiachen Zhang, Gangyang Li, Alois Knoll, Shaqi Luo

Beijing Academy of Artificial Intelligence, Technical University of Munich

2026-07-08机器人模仿学习数据集/基准

这篇论文针对现有人形机器人评测偏重运动轨迹、忽略接触力的问题,提出 ThorArena:采集同步的人体全身运动与双手交互力数据,覆盖六类接触任务,并在仿真中回放真实力扰动,配套 FATS 等力感知指标。实验显示,相比无力评测,该基准能揭示控制策略在跟踪精度、稳定性、控制代价和存活时间上的显著差异。

Why does Deep Learning Improve Visual SLAM? Figure 1
2026-07-08cs.CV

Why does Deep Learning Improve Visual SLAM?

Giovanni Cioffi, Davide Scaramuzza

The authors are with the Robotics and Perception Group, Department of Informatics, University of Zurich, Switzerland, https://rpg.ifi.uzh.ch .

2026-07-08机器人

本文针对深度学习为何能提升视觉 SLAM 的归因问题,控制性地把 DROID-SLAM 的学习光流匹配与不确定性估计接入 ORB-SLAM3,隔离数据关联、残差加权与循环结构的作用。结果显示,性能增益主要来自学习的 2D 数据关联和不确定性,而非循环架构;ORB-SLAM3-OF-U 在 TartanAir 接近深度方法,并在 UZH-FPV 等分布外场景表现更强。

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures Figure 1
2026-07-08cs.RO

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker

2026-07-08机器人

RoboTALES针对视频生成模型用于机器人控制时想象轨迹容易偏离任务意图、难以支撑长程规划的问题,提出用LLM将指令分解为子目标来约束视频扩散模型,并用冻结VLM评价生成未来、以奖励反馈调整表示,再用这些任务对齐特征训练策略。在RoboCasa和LIBERO10操控任务上,方法整体优于Video-Policy等基线,长程任务优势更明显。

Imagined Rollouts are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure Figure 1
2026-07-08cs.RO

Imagined Rollouts are Kinematic, Not Dynamic: A Diagnosis of Long-Horizon World-Model Failure

Finn Rasmus Schäfer, Korbinian Moller, Yuan Gao, Christian Oefinger, Sebastian Schmidt, Johannes Betz

Autonomous Vehicle Systems Lab, Technical University of Munich, Garching b. M¨unchen, Germany

2026-07-08强化学习

论文针对世界模型长时域想象失败常被笼统归因于误差累积的问题,提出“运动学而非动力学”的诊断视角,并用 iKCE 结合物理条件扰动检验模型是否响应摩擦等机制变化。作者在 DreamerV3 walker-walk 检查点上发现,想象 rollout 的 iKCE 远高于真实物理匹配轨迹,且在跨越步态崩溃边界的摩擦扫描中几乎不变,说明模型更多在延续运动学轨迹而非建模动力学约束。

Delay-Aware Active Triangulation with Uncertainty-Driven Multi-Agent Reinforcement Learning for Counter-UAS Figure 1
2026-07-08cs.RO

Delay-Aware Active Triangulation with Uncertainty-Driven Multi-Agent Reinforcement Learning for Counter-UAS

Seungwook Lee, David Hyunchul Shim

2026-07-08强化学习安全鲁棒

面向反无人机中的多机视觉三角定位,论文指出真实系统的检测、通信和控制延迟会破坏既有即时反馈假设。方法将任务建模为带 AoI 观测的延迟 Dec-POMDP,并结合循环 MAPPO、感知一致奖励和多源协方差传播。仿真中达到 0.547 m RMSE、78.1% 有效三角化率,AoI 提升 10.6 个百分点;但仍缺少真实飞行验证。

Intercepting an Agile Target with Net-Carrying Drones using Competitive Multi-Agent Reinforcement Learning Figure 1
2026-07-08cs.RO

Intercepting an Agile Target with Net-Carrying Drones using Competitive Multi-Agent Reinforcement Learning

Timothée Gavin (ENAC-LAB, LAAS-RIS), Murat Bronz (ENAC)

the evader’s centre comes within a capture distance of any, in the centre of the arena.

2026-07-08强化学习

面向非法或敏捷无人机难以用传统模型化制导可靠拦截的问题,本文把多架携网追捕机与逃逸机建模为竞争式多智能体强化学习任务,用MAPPO结合PFSP自博弈并直接学习低层CTBR控制。仿真显示该方法相较启发式基线有更高捕获率、更短捕获时间和较低碰撞率,且出现协同围捕行为;但结果仍限于无障碍高保真仿真,真实感知和动力学扰动尚未验证。

Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion Figure 1
2026-07-08cs.GR

Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion

Mingyi Shi, Xuelin Chen, Taku Komura

The University of Hong Kong, Hong Kong

2026-07-08规划控制

该文针对手部动作自由度高、语义标注稀缺且跨数据集难复用的问题,主张先从大规模无标注动作中学习身体—手部运动学先验,再用轻量语义适配器施加控制。核心创新是流式自回归扩散先验、沿运动链聚合的级联注意力,以及按运动层级注入的属性/文本控制。实验称其在低资源和跨数据集设置下比端到端条件模型更稳健、运动更合理,并支持实时推理与交互式动画编辑。

DexTele: A Dual-Arm Dexterous Teleoperation System Based on Motion Retargeting and Adaptive Force Control Figure 1
2026-07-08cs.RO

DexTele: A Dual-Arm Dexterous Teleoperation System Based on Motion Retargeting and Adaptive Force Control

Yuanchuan Lai, Qing Gao, Ziyan Liang, Xianfeng Cheng, Junjie Hu, Zhaojie Ju

2026-07-08规划控制

DexTele针对双臂灵巧遥操作中跨机器人重定向难泛化、固定抓握力难适配物体的问题,将人体与机器人结构建成运动图,用SAG-GCN和潜变量优化实现无配对数据的跨平台臂手重定向,并结合VLM估计物体所需抓握力、MPC在线优化。仿真和实机实验显示其在多平台上提升重定向精度并实现更柔顺稳定的抓握,但具体增益来源仍需看实验细节。

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation Figure 1
2026-07-08cs.RO

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation

Paul Koch. Adem Karakurt, André Sers

back-projects these labels onto 100 real-world scenes. The, following in laboratory settings, positive labels are actionable. 3) Real↔Sim bidirectional, validated labels are back-projected onto all real camera, tools are packaged as Docker containers, enabling any lab, scalable, open, containerized generation system enabling, tions: grasping labels, robot reachability, and physical ob-

2026-07-08数据集/基准三维

本文针对现有抓取数据集难以同时提供真实RGB-D观测、物理可信抓取标签和Sim2Real对齐的问题,提出GraspIT生成系统:在Isaac Sim中用Franka Panda进行轨迹可达性过滤和四阶段滑移测试,并将仿真标签回投到真实场景。数据集包含约31.6万RGB-D帧、2.3M候选抓取和7.4k对象,其中82.94%为好抓取,17.06%形成分级难负样本;但论文主要验证数据规模与标注流程,实际训练增益仍需下游实验进一步说明。

TRIG: Trajectory-Rig Decoupled Metric Geometry Learning Figure 1
2026-07-08cs.CV

TRIG: Trajectory-Rig Decoupled Metric Geometry Learning

Lizhou Liao, Wentao Xu, Handong Wang, Lirong Yang, Shuai Yang, Weiwei Liu, Chang Huang

2026-07-08规划控制

TRIG针对自动驾驶多相机几何估计中尺度易漂移、车辆里程计与相机标定只被弱利用的问题,将相机位姿显式拆成动态自车轨迹和静态相机rig,并分别编码、监督,再用稀疏时空注意力分离时间聚合与跨相机交互。论文在五个驾驶基准上报告其在位姿、度量深度和三维重建任务达到SOTA,但具体增益中模型规模与数据因素的贡献仍需进一步拆解。

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning Figure 1
2026-07-08cs.RO

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning

Chuhao Zhou, Liquan Wang, Shuxin Cao, Xiangyu Chen, Yuxuan Hu, Boyu Ma, Animesh Garg, Jianfei Yang

2026-07-08规划控制学习理论

这篇论文针对机器人难以把同一工具功能迁移到未见工具的问题,指出关键障碍是视觉上的功能相似并不直接对应相同动作。FORGE 的核心洞察是用 2D 关键点轨迹作为中间表示,先从无动作数据预测功能计划,再用少量示教落地为控制动作。在七种工具的敲击基准中,方法在仿真和真实场景均优于现有方法,未见工具平均成功率提升超过 2 倍。

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis Figure 1
2026-07-08cs.RO

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

2026-07-08安全鲁棒

多鱼眼相机在机器人和采集平台中常用,但标定对拍摄观测质量高度敏感,经验规则难以迁移。论文的核心洞察是失败主要来自内参初始化病态:径向跨度不足会耦合焦距尺度与鱼眼投影形状参数;据此提出 CO-Calib,用学习式靶标检测和误差分析驱动选帧构造锚点、共视约束与补覆盖帧。在仿真中成功率由 68.1% 提升到 99.3%,并在真实多鱼眼系统上提高外参精度和稳定性。

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator Figure 1
2026-07-08cs.CV

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

National University of Singapore, 2 HKUST

2026-07-08机器人视觉感知生成模型

这篇论文针对具身导航缺少兼具规模、真实感和物理约束的交互环境这一瓶颈,提出 Image2Sim:将 RGB-D 序列先提升为特征高斯以固定三维结构,再用几何感知的一步像素流生成全景 RGB-D,并自动生成可执行轨迹与语言指令。系统构建约 2 万场景、超 1000 万训练样本,训练出的导航模型在标准基准和真实零样本迁移中均有提升,但部分收益可能主要来自 scaling / data。

Co-STAR: Cognitive Stimulation Therapy by an Autonomous Robot for Dementia -- A One-Week In-Home Study Figure 1
2026-07-08cs.RO

Co-STAR: Cognitive Stimulation Therapy by an Autonomous Robot for Dementia -- A One-Week In-Home Study

Emmanuel Akinrintoyo, Nicole Salomons

Emmanuel Akinrintoyo and Nicole Salomons are with Imperial College London

2026-07-08机器人

该研究针对家庭中个体化认知刺激疗法依赖照护者、执行一致性低的问题,构建了可在家自主引导痴呆患者进行CST的社交机器人Co-STAR,结合语音、平板提示和个性化活动。9名患者一周试用中完成31次、约半数计划疗程,单次平均约33分钟;结果显示方案具备可行性,但依从性仍受家属协助、技术故障、界面难度和兴趣下降影响。

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction Figure 1
2026-07-08cs.RO

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction

Honglin Wang, Shiyao Pan, Yun-Fu Liu

2026-07-08强化学习规划控制

面向自动驾驶多智能体轨迹预测中“模式多样性”和精度难兼得的问题,IMR在预测式框架中引入mode-world加权回归以缓解模式塌缩,并用分段、循环的迭代解码器直接生成坐标来逐步修正轨迹。在Argoverse 2多智能体榜单上整体排名第一,部分指标优于QCNeXt,但若干误差指标并非全面领先,增益来源仍需更多消融支撑。

Uncertainty-Aware Velocity Correction for Proprioceptive Vehicle Localization using Evidential Mamba Figure 1
2026-07-08cs.RO

Uncertainty-Aware Velocity Correction for Proprioceptive Vehicle Localization using Evidential Mamba

Abinav Kalyanasundaram, Karthikeyan Chandra Sekaran, Wolfgang Utschick, Michael Botsch

2026-07-08安全鲁棒

针对GNSS失效时车辆仅靠IMU会持续漂移、外部测速或多传感器方案部署成本高的问题,论文提出EVC-Mamba:用车载轮速、转角等本体传感数据经Mamba时序模型估计虚拟速度,并用证据深度学习给出不确定性,再作为ES-EKF量测校正IMU。实车结果显示,其定位误差可接近专用外部速度传感器,跨不同失联时长保持在约10%差距内,并能在边缘硬件上40Hz运行。

Efficient Transfer Learning of Robot Dynamic Models Using Morphological Similarity Figure 1
2026-07-08cs.RO

Efficient Transfer Learning of Robot Dynamic Models Using Morphological Similarity

Pavlo Kupyn, Yuya Hamamatsu, Roza Gkliva, Asko Ristolainen, Maarja Kruusmaa

The authors are with the Department of Computer Systems, Tallinn University of Technology, Tallinn, Estonia

2026-07-08机器人

软鳍驱动水下机器人受流固耦合影响,动力学建模和带标签数据采集成本高。论文利用形态相似性,将大尺寸 U-CAT 的动力学知识迁移到小型 Micro-CAT,核心是用自监督自编码器对齐两平台传感与控制序列的共享潜空间,并配合动力学预测头。真实机器人实验显示,该方法在目标平台无标签数据条件下仍能估计机体系速度,优于直接源域迁移等基线。

Physics-Regularized Machine Learning for Proprioceptive Vehicle Localization Using Onboard Sensors Figure 1
2026-07-08cs.RO

Physics-Regularized Machine Learning for Proprioceptive Vehicle Localization Using Onboard Sensors

Abinav Kalyanasundaram, Karthikeyan Chandra Sekaran, Wolfgang Utschick, Michael Botsch

2026-07-08机器人

面向GNSS中断时低成本车辆定位容易漂移的问题,论文提出PRML2,仅用车载本体传感器,将Transformer测量模型、物理约束层与可微自适应EKF端到端训练,使卡尔曼滤波在学习中充当物理正则。实验显示其在公开数据和低附着数据上提升定位精度、具备实时性,并发布了低摩擦场景数据集。

Dynamic Evaluation of Classical and Control-Aware Optimal Trajectory Planning in Robot Manipulators Figure 1
2026-07-08cs.RO

Dynamic Evaluation of Classical and Control-Aware Optimal Trajectory Planning in Robot Manipulators

Bhanuka Dayawansa, Rohan Munasinghe

2026-07-08机器人规划控制数据集/基准

这篇论文针对传统三次、五次和梯形轨迹只追求运动学平滑、却可能在非线性机械臂执行中放大跟踪误差和校正力矩的问题,提出将动力学与控制 effort 纳入有限时域规划,并用中点线性化处理大幅点到点运动。其关键价值在于用同一 UR5 非线性模型、PID 控制器和力矩约束隔离比较规划器影响;仿真显示该方法相较经典规划降低跟踪误差、校正力矩和闭环执行成本。

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory Figure 1
2026-07-08cs.RO

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory

Hu Zhu, Bohan Li, Xianda Guo, Hongsi Liu, Baorui Peng, Mingqi Yuan, Xin Jin, Wenjun Zeng, Chang Wen Chen

The Hong Kong Polytechnic University, Eastern Institute of Technology, Shanghai Jiao Tong University, Wuhan University, The University of Hong Kong, Georgia Institute of Technology

2026-07-08机器人

这篇论文针对室内机器人长期运行时占据图不能只做单帧或单房间预测的问题,提出 HIOcc 基准统一多源室内数据,并用 GEM-Occ 将局部视觉几何视为临时证据,转成语义高斯和自由空间射线后因果融合为分层记忆。实验显示其在局部预测、在线稳定性、自由空间推理、重访一致性和建筑级扩展上优于既有占据与高斯映射基线。

TypeGo: An OS Runtime for Embodied Agents Figure 1
2026-07-08cs.SE

TypeGo: An OS Runtime for Embodied Agents

Guojun Chen, Alex Schott, Lin Zhong

Yale University

2026-07-08机器人

TypeGo针对LLM机器人控制中推理延迟、任务并发和快速反应难以兼顾的问题,把具身智能运行时设计成类似操作系统的多层异步框架:用Skill Kernel仲裁身体资源,结合语义调度、抢占恢复、S0反射与S1 speculative skill streaming隐藏LLM延迟。在Unitree Go2原型任务中,较逐步规划将单步等待降50%,较整计划模式将首次动作时间降73%,但代价是更高token开销,实验规模仍偏早期。

Learning 4D Geometric Priors for Inference-Efficient World Action Models Figure 1
2026-07-08cs.RO

Learning 4D Geometric Priors for Inference-Efficient World Action Models

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

2026-07-08强化学习

这篇论文针对机器人操作中 WAM 偏重外观视频预测、缺少随动作变化的几何关系这一问题,提出 MECo-WAM:训练时加入受冻结 VGGT 监督的轻量 4D expert,并用衰减读掩码注意力和动作感知时序几何蒸馏把几何先验迁移到视频-动作通路,推理时移除辅助模块。实验在 LIBERO 达 98.2%、RoboTwin 2.0 达 92.6%,并在真实任务中提升成功率且不增加推理成本。

Quaternion-Averaging-Based Adaptive Complementary Filter for Pedestrian Dead Reckoning With a Foot-Mounted AHRS Figure 1
2026-07-08cs.RO

Quaternion-Averaging-Based Adaptive Complementary Filter for Pedestrian Dead Reckoning With a Foot-Mounted AHRS

Shunsei Yamagishi, Lei Jing

2026-07-08机器人

本文针对足部安装 AHRS 的行人航位推算在室内受陀螺漂移和磁干扰影响、而卡尔曼滤波计算开销较高的问题,提出 QAACF:用 Markley 四元数平均替代常见线性插值融合角速度、加速度和磁场姿态,并按步态阶段与磁扰强度自适应调权。实验显示其姿态 RMSE 低于多种既有滤波器,同时计算成本低于卡尔曼滤波;但对传感器精度和标定依赖较强,动态跑步等场景验证不足。

Geometry-Aware Infrastructure-Anchored Denoiser for UWB Sensing and Work-Zone Reconstruction Figure 1
2026-07-08cs.LG

Geometry-Aware Infrastructure-Anchored Denoiser for UWB Sensing and Work-Zone Reconstruction

Weizhe Tang, Jiaxi Liu, Junwei you, Steven T.Parker, Pei Li, Sikai Chen, Meng Ran, Bin Ran

2026-07-08三维

针对施工区UWB测距易受NLOS、突发噪声和长尾误差影响,进而扭曲边界重建的问题,GAIA将测距去噪显式绑定到几何一致的施工区多边形重建:通过时间建模、潜在锚点布局估计和确定性距离投影引入空间先验。真实户外UWB/GNSS/IMU数据上,相比PoseMLP总体MSE降18.4%、polygon IoU升15.5%,仿真压力测试也显示几何组件在强噪声下有帮助。

2026-07-07

121 篇
From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model Figure 1
2026-07-07cs.CV

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

Nanyang Technological University, DAMO Academy, Alibaba Group, HuPan Lab

2026-07-07视觉语言视觉感知安全鲁棒

这篇论文针对VLA在训练与部署摄像机位姿不一致时成功率骤降的问题,指出根源在于视觉输入处于相机坐标而动作却直接在机器人基座坐标中预测。CamVLA将策略拆成相机坐标系动作预测与6-DoF手眼矩阵回归,再用几何变换合成基座动作,从单目RGB和语言指令实现免标定、免深度的视角鲁棒操作;仿真和真实机器人实验显示其在未见视角下较π0、GR00T等基线取得更高成功率,但极端视角和高精度任务仍受限。

LLM-as-a-Verifier: A General-Purpose Verification Framework Figure 1
2026-07-07cs.AI

LLM-as-a-Verifier: A General-Purpose Verification Framework

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

Stanford University

2026-07-07三维

本文针对现有 LLM 评判器离散打分易并列、难泛化的问题,将“验证”视为新的 scaling 轴:利用评分 token logits 分布的期望生成连续分数,并通过更细粒度打分、重复评估和标准分解提升判别力。该框架无需额外训练,在代码、机器人和医疗任务上达到 SOTA;在机器人中还可作为轨迹奖励/进度信号,LIBERO 上较稀疏奖励约提升 1.8 倍样本效率。

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models Figure 1
2026-07-07cs.RO

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

2026-07-07强化学习数据集/基准

针对柔性物体世界模型缺少大规模真实多视角触觉数据、难以比较2D视频与3D几何建模的问题,Deform360采集198个日用品、1980段交互、41视角和双手触觉夹爪数据,并用无标记3D跟踪生成粒子标注。实验显示3D粒子模型在低数据下受益于结构先验,2D视频模型在数据充足时泛化更好,且可初步用于MPC机器人规划。

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation Figure 1
2026-07-07cs.RO

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

Tsinghua University, Shanghai AI Laboratory, Peking University

2026-07-07机器人

Cortex针对长程机器人操作中端到端VLA缺少记忆、易在子任务间累积错误,以及层级方法规划语义与执行运动学脱节的问题,提出以32类可执行技能原语、语义记忆和可达性约束连接VLM规划与VLA控制,并用视频标注、仿真数据和事件均衡采样微调。实验显示其在Libero-long和RoboTwin分别提升3.1%和4.1%,还可零样本完成部分真实多阶段任务。

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks Figure 1
2026-07-07cs.RO

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg

University of California, Berkeley, Carnegie Mellon University

2026-07-07强化学习

这篇论文针对工业/商业机器人在物体几何与位姿持续变化的“变异自动化”任务中难以兼顾可靠性与适应性的问题,提出 GaP:让多智能体编码系统生成由感知、规划、控制技能节点组成的有向计算图,并在 Isaac 仿真中并行排练、自学习优化图结构和参数。8 个仿真与真实基准显示其成功率显著高于 TAMP、VLA 等基线,但结论也承认离工业级节拍和可靠性仍有差距。

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis Figure 1
2026-07-07cs.CV

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

Xianhao Chen, Jiarui Hu, Yuanbo Yang, Xiyu Zhang, Tengyue Wang, Hujun Bao, Guofeng Zhang, Zhaopeng Cui

2026-07-07三维

这篇论文针对开放词表三维分割中过度依赖孤立物体外观、难以利用上下文关系的问题,提出 RelGraphOV:用多视角视觉语言推理自动构建三维场景图,并以双流门控 GAT 分离稠密几何特征与 CLIP 语义特征,减少图传播中的特征干扰。实验显示其在 ScanNetV2、ScanNet200 及 ScanNet++、Replica 零样本迁移上优于多种基线,消融也支持关系图、双流融合和层次对比学习的贡献。

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance Figure 1
2026-07-07cs.RO

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance

Andrew Snowdy, Ananya Trivedi, Sarvesh Prajapati, Lorena Maria Genua, Taskin Padir

2026-07-07机器人

面向养老院火灾等应急疏散中门口拥堵和救援人员负担问题,论文将开门通行、避让行人和递送物资统一为可反应的机器人任务。核心做法是用行为树连接感知、人类意图判断与移动操作控制,使机器人能按场景切换按门钮、让行、穿门或先取物。Toyota HSR 在硬件与仿真 105 次试验中成功 97 次,显示方案可行,但失败主要仍受感知可靠性限制。

GelNeuro: A Sensing-Computing Integrated Neuromorphic Tactile System for Texture Recognition Figure 1
2026-07-07cs.RO

GelNeuro: A Sensing-Computing Integrated Neuromorphic Tactile System for Texture Recognition

Luoyang Bian, Xinpan Meng, Zhenghua Ma, Houcheng Li, Long Cheng

2026-07-07视觉感知

面向机器人触觉纹理识别中高延迟、高功耗和主机中转依赖的问题,GelNeuro将GelSight Mini光学触觉前端与Speck2f神经形态SoC直接耦合,把接触引起的标记运动转为DVS事件并在片上SCNN分类,同时用硬件感知权重裁剪缓解8位部署退化。在15类自然纹理任务中,实芯片80 ms窗口达到96.3%准确率,板级有源功耗19.6 mW,并在未见接触深度上保持泛化。

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving Figure 1
2026-07-07cs.RO

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

2026-07-07视觉语言视觉感知安全鲁棒

本文针对恶劣天气下自动驾驶既“看不清”又“抓地弱”、现有系统多为事后反应的问题,提出用微调 VLM 识别路面与能见度,并将其转化为包含 RSS 保证和摩擦预算耦合的上下文自适应安全包络。CARLA 闭环实验中,VLM-CASE-MPC 完成全部试验,优于固定包络 MPC、VLM-MPC 和基础 MPC,消融显示摩擦与能见度自适应贡献互补。

Geometry-Aware Visual Odometry for Bronchoscopic Navigation via High-Gain Observer Fusion Figure 1
2026-07-07cs.RO

Geometry-Aware Visual Odometry for Bronchoscopic Navigation via High-Gain Observer Fusion

Mohammadreza Kasaei, Francis Xiatian Zhang, Feng Li, Farshid Alambeigi, Kevin Dhaliwal, Mohsen Khadem

navigation offers a scalable alternative, but conventional visual, School of Informatics, University of Edinburgh, UK., Baillie Gifford Pandemic Science Hub, Institute for Regeneration and, Repair, University of Edinburgh, UK., Walker Department of Mechanical Engineering and Texas Robotics, The, University of Texas at Austin, USA., the true bronchial axis. By back-projecting their centers to, network refines lumen centers. These outputs are fused to

2026-07-07机器人

这篇论文针对支气管镜导航中依赖术前 CT/外部传感器、而纯视觉里程计又易受低纹理、反光和管腔消失点奇异性影响的问题,提出利用气道腔口消失点反投影估计前进方向,并与 looming 速度和常规 VO 输出通过高增益观测器融合。其关键洞察是把管状解剖的几何“退化”转化为方向先验;在离体机械通气人肺实验中,相比 ORB-SLAM2、LoFTR-VO、DPVO 将绝对轨迹误差降低超过 50%,相对位姿误差也最低。

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies Figure 1
2026-07-07cs.CV

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk

2026-07-07机器人视觉语言视觉感知

这篇论文针对 VLA 导航易受视觉干扰、可通行区域理解不稳的问题,评估用 SegFormer 实时语义分割把可走区域标绿、不可走区域标红的视觉 grounding,无需重训即可接入 OmniVLA。结果显示在 Grand Tour 上远端 waypoint 误差降低 27–44%,长指令收益更明显,但图像目标提升很小;归一化分析表明增益主要来自缩短/正则化预测轨迹,而非提升单位距离推理能力。

Toward Personalized Social Robots for Child Well-being: Data Requirement Principles from a Recommender-System Perspective Figure 1
2026-07-07cs.HC

Toward Personalized Social Robots for Child Well-being: Data Requirement Principles from a Recommender-System Perspective

Jin Huang, Eric Nichols, Fethiye Irmak Dogan, Hatice Gunes

∗ These authors contributed equally and are co-first authors. 1 J. Huang, F. I. Doğan, and H. Gunes are with the University of

2026-07-07机器人

本文针对临床儿童关怀中社交机器人难以真正个性化的问题,指出瓶颈不在推荐模型,而在数据采集设计:儿童状态动态变化、反馈稀疏且隐式、跨次会话难以链接、观测数据存在干预偏差。核心贡献是从推荐系统视角提出四项数据原则:整合画像、有效性信号、可链接覆盖与曝光记录,并将其对应到机器人个性化能力需求,形成面向未来数据收集的操作性指南;文中主要是原则框架与文献梳理,未提供实证性能增益。

ECO: Incremental Ego-Centric Octree Update for Point Streams Figure 1
2026-07-07cs.RO

ECO: Incremental Ego-Centric Octree Update for Point Streams

Jaemin Yu, Seongyoon Jeong, Kang-Wook Chon, Duksu Kim

2026-07-07机器人

面向移动机器人连续点云建图,论文指出全局八叉树重建延迟高、内存和树平衡难控。ECO 将八叉树做成以机器人为中心的 3D 滑动窗口,并按 shift-out、shift-in、overlap 区域增量更新,避免反复全局重建和坐标变换。KITTI 上更新时间较静态重建平均降 24.87%,较有界增量基线降 54.60%,体素地图生成最高快 34.17%,动态场景还保留短期运动目标记忆。

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization Figure 1
2026-07-07cs.RO

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

Shanghai AI Laboratory

2026-07-07学习理论

这篇论文针对现有统一机器人策略在联合语义理解、未来预测与动作学习时易遗忘VLM语义、目标相互干扰且未利用视频生成先验的问题,提出InternVLA-A1.5:保留原生VLM并继续做VQA/子任务训练,同时用可学习foresight token查询任务相关未来,并借冻结视频生成模型监督其潜变量,推理时移除视频分支。模型在120万机器人轨迹和300万多模态样本上预训练,在六个仿真基准均取得最佳总体结果,真实场景中也提升组合泛化和长时程执行。

Designing Touch for Trauma-Informed Social Robots: A Design Space for Direct and Indirect Actuation Figure 1
2026-07-07cs.RO

Designing Touch for Trauma-Informed Social Robots: A Design Space for Direct and Indirect Actuation

Madeleine Rischer, Benedikt Bußmann

2026-07-07机器人

本文针对 PTSD 支持场景中机器人触觉可能带来安抚也可能触发再创伤的问题,提出区分直接接触与经由可穿戴/智能织物的间接接触,并以驱动模态、作用对象、预期效果构成设计空间。主要结果是给出面向安全、透明、同意、自主与触发规避的设计考量;但该框架仍属概念性分析,尚未用患者或治疗师实证评估。

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control Figure 1
2026-07-07cs.LG

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control

Ruslan Rakhimov, George Bredis, Yuriy Maksyuta, Daniil Gavrilov

2026-07-07生成模型规划控制

Qantara针对像素控制中的JEPA世界模型通常在训练时绑定规划或行为克隆、难以按部署约束切换的问题,提出在状态轴用Brownian bridge、动作轴用flow matching,并将噪声采样集中到推理会访问的边与角,从单个约2100万参数checkpoint支持潜在规划、动作采样和视频-逆动力学。实验在LeWM套件平均达91.2 SR,并在OGBench-Cube刷新SOTA;同权重的低成本BC/逆动力学路径也在Push-T和Cube保持较高成功率。

Multi-Robot Open Adaptive Teaming Across Unseen Environments, Partners, and Scales Figure 1
2026-07-07cs.RO

Multi-Robot Open Adaptive Teaming Across Unseen Environments, Partners, and Scales

Yang Li, Feng Xue, Fan Mo, Yunhao Liu, Jianhong Wang, Ying Wen, Qingrui Zhang, Shaoshuai Mou, Wei Pan

2026-07-07机器人

面向真实多机器人部署中环境陌生、队友未知且队伍规模动态变化的问题,论文将其形式化为开放自适应组队,并用超图形式博弈刻画高阶协作关系,提出逐步扩展伙伴与环境多样性的 HOLA。多无人机与四足追捕实验显示其在环境泛化、零样本协作和规模变化上优于自博弈、MAPPO、PBT、FCP,并可无微调迁移到 Crazyflie 与 Zsibot L1。

Real-World Perturbation Testing of Autonomous Driving Systems Figure 1
2026-07-07cs.SE

Real-World Perturbation Testing of Autonomous Driving Systems

Stefano Carlo Lambertenghi, Matthias Weil, Andrea Stocco

Technical University of Munich, Technical University of Munich fortiss GmbH Germany, Technical University of Munich Germany

2026-07-07强化学习

针对自动驾驶罕见工况数据难获、离线扰动测试难以反映真实风险的问题,本文构建含72种相机与LiDAR扰动的ROS测试框架,并跨离线模型、硬件在环和实车闭环三层评估端到端视觉模型与模块化LiDAR栈。结果显示模型级指标难预测系统级失效:相机小扰动也可导致控制不稳,LiDAR感知退化与闭环失败相关性弱,实时可行性是实测关键约束。

Closing the Reality Gap: Zero-Shot Sim-to-Real Deployment for Dexterous Force-Based Grasping and Manipulation Figure 1
2026-07-07cs.RO

Closing the Reality Gap: Zero-Shot Sim-to-Real Deployment for Dexterous Force-Based Grasping and Manipulation

Zhe Zhao, Zhibin Li, Yilin Ou, Mengshi Qi

State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China, University College London, United Kingdom

2026-07-07机器人

这篇论文针对多指灵巧手在接触丰富任务中难以从仿真零样本部署到真实硬件的问题,提出把密集触觉与关节力矩/电流反馈纳入全状态强化学习,并用快速触觉近似仿真、电流到力矩标定和随机化执行器动力学缩小现实差距。策略在仿真中训练后直接部署到五指手,实现了可按指令调节抓握力的稳定抓取和手内物体重定向,无需真实机器人微调。

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation Figure 1
2026-07-07cs.RO

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

2026-07-07机器人强化学习

DSWAM针对WAM虽擅长物理执行、却缺少粗粒度指令分解能力,以及WAM与VLA缺乏公平实机对比的问题,提出双系统框架:默认用视频共训练的WAM执行器直接预测动作块,仅在需要时调用视觉语言子任务规划器。匹配DeMaVLA设置下,折叠成功率由92.5%升至96.3%,耗时由2分18秒降至1分44秒,RoboTwin 2.0也达约92%成功率。

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis Figure 1
2026-07-07cs.RO

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

Kyung Hee University

2026-07-07机器人视觉感知数据集/基准

PRISM针对预训练VLA在具体用户环境中泛化不足、而人工遥操作采集成本高的问题,提出从单张RGB-D图像和语言指令生成个性化机器人数据集:保持目标场景语义与几何关系,同时用“digital cousin”实例变化、运动感知抓取和轨迹保持的视觉随机化合成演示。实验显示其在LIBERO/LIBERO-Plus优于基线,并在三项真实操作任务中最高达到100%成功率,跨环境变化时鲁棒性也更强。

WinTA-GIL: Windowed Trajectory Alignment for GNSS-IMU-LiDAR Heading Refinement in Intermittent Signal Environments Figure 1
2026-07-07cs.RO

WinTA-GIL: Windowed Trajectory Alignment for GNSS-IMU-LiDAR Heading Refinement in Intermittent Signal Environments

Kaixin Feng, Zhichao Wen, Zhaohong Liao, Xin Xia, You Li

2026-07-07规划控制

本文针对GNSS间歇失锁、启动或恢复阶段航向角弱可观导致惯导漂移累积的问题,提出WinTA-GIL:用LIO提供的短时高精度局部轨迹与滤波后的GNSS观测做窗口化非线性轨迹对齐,并通过状态判别自适应触发重估。实验覆盖公开与自采数据,显示其在极短信号窗口下仍能提升航向估计精度和鲁棒性。

Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control Figure 1
2026-07-07cs.RO

Athena-WBC: Capability-Aligned Policy Experts for Long-Tail Humanoid Whole-Body Control

Yuan Jiang, Ningyuan Zhang, Xicun Yang, Shidi Li, Yuzhi Jiang, Zhiyi Rong, Shuaikang Ma, Chuanzheng Li, Jie Chen

2026-07-07机器人强化学习规划控制

本文针对人形机器人全身控制中“训练集长尾”仍学不会的问题,指出失败并非只因样本少,而是默认训练目标与高动态、临界平衡动作所需能力不匹配。Athena-WBC 通过动态专家放松保守力矩/平滑惩罚、平衡专家采用重力课程,再经路由蒸馏成单一策略。在全尺寸人形实验中,相比 SONIC 式基线提升了长尾动作恢复和留出集跟踪,但真实机器人量化验证文中未充分说明。

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models Figure 1
2026-07-07cs.RO

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

University of Science and Technology of China (USTC), Institute of Artificial Intelligence, Hefei Comprehensive National Science Center

2026-07-07视觉语言视觉感知

本文针对现有 VLA 主要依赖通用视觉语言特征、动作专家需隐式补齐语义到控制鸿沟的问题,提出 CAC-VLA:让 VLM 预测由未来动作片段编码得到的粗到细潜在动作,并通过上下文门控自适应调节其对动作专家的影响,而非固定注入或生成可执行轨迹。在 LIBERO 上平均成功率 98.3%、LIBERO-Plus 上 89.5%,消融显示潜在动作时域和门控机制均有贡献。

SLAM: Structured and Localized Analytic Manifold Adaptation for Lifelong VPR Figure 1
2026-07-07cs.RO

SLAM: Structured and Localized Analytic Manifold Adaptation for Lifelong VPR

Kenta Tsukahara, Kanji Tanaka, Rai Hisada

2026-07-07机器人

面向长期机器人视觉地点识别中环境持续变化、类别递增和灾难性遗忘问题,论文将解析增量学习与状态估计类比,提出SLAM框架:用无迹扰动平滑软标签、GMM划分局部流形,并引入H∞鲁棒边界调节精度与最坏扰动抑制。在NCLT构造的10任务100类基准上,U+G组合取得最高27.5%准确率;完整H∞版本更偏保守,收益主要体现为鲁棒性权衡。

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery Figure 1
2026-07-07cs.RO

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

Zhiyuan Lu, Kanji Tanaka

2026-07-07机器人视觉感知规划控制优化算法

这篇论文针对热红外视觉地点识别在未建图或 OOD 场景中会高置信地产生错误闭环、而传统多假设跟踪实时性差的问题,提出 TAO:把多帧、多候选验证压缩为批量 SE(2) Procrustes 对齐和一次 SVD,以有界复杂度提供几何拒绝信号。实验强调其边界:5 米微尺度下难以区分连贯幻觉,AUC 仅 0.567;但在大尺度 map-out 场景可作为轻量失效保护,AUC 最高 0.991。

Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity Figure 1
2026-07-07cs.RO

Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity

Che-Sang Park, Junsu Ha, Jianlong Fu, Frank C. Park

2026-07-07生成模型

这篇论文针对扩散策略执行固定动作块时难以兼顾扰动响应与推理成本的问题,提出用“Spatial Attention”衡量动作分布对观测变化的敏感度,并据此动态缩短高敏感阶段、拉长低敏感阶段的执行 horizon。其关键洞察是,在固定采样预算下,观测敏感度越高越应频繁重规划;仿真、扰动任务和真实机器人实验显示,该方法在保持平均执行长度基本不变的同时提升成功率。

Aerial Manipulation: Contact, Medium Coupling, and the Geometry of Readiness Figure 1
2026-07-07cs.RO

Aerial Manipulation: Contact, Medium Coupling, and the Geometry of Readiness

Antonio Franchi

2026-07-07机器人

本文动机是澄清空中操作为何不能被视为“飞行底座上的机械臂”。核心洞察是把接触、气流耦合与自支撑统一为同一物理交互过程,并用作动几何中的任务等价纤维解释冗余如何在能耗、快速响应和被动介质耦合间权衡。主要结果是一套面向生物与机器人案例的交互模式、能力阶梯和开放问题框架,而非新的实验系统。

Geometry-Aware Motion Latents for Learning Robust Manipulation Policies Figure 1
2026-07-07cs.RO

Geometry-Aware Motion Latents for Learning Robust Manipulation Policies

Yunchao Zhang, Yijia Weng, Ruizhe Liu, Ming Hu, Leonidas Guibas, Yanchao Yang

2026-07-07机器人安全鲁棒

这篇论文针对机器人操作中仅从2D视觉序列学习运动潜变量容易忽略空间关系、导致视角和杂乱场景泛化差的问题,提出GeoMoLa:用单视角RGB-D生成的点云随时间演化预测来学习离散运动潜码,把动作抽象约束在三维几何变换而非外观重建上。实验称其在多种操作基准达到SOTA,消融显示几何预测是主要增益来源,真实杂乱环境中也能用较少示范保持较强鲁棒性。

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving Figure 1
2026-07-07cs.RO

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving

Argho Dey, Yunfei Yin, Swachha Ray, Md Minhazul Islam, Zheng Yuan, Sijing Xiong, Hongyu Liu, Zhiqiu Huang

Funding of SUGON Industrial Control and Security Center under Grant CUIT-, Sijing Xiong, Hongyu Liu, and Zhiqiu Huang are with the College of Computer, Science, Chongqing University, Chongqing 400044

2026-07-07规划控制

本文针对自动驾驶中相机观测受遮挡、模糊、光照和噪声破坏后,常规 BEV 时序融合不区分特征可靠性而导致规划不稳的问题,提出 RCT-AD:用可靠性感知模块对帧级 BEV 特征打分,并通过质量门控 FILO 记忆保留可信上下文、重建退化输入,再结合 LSTM 时序轨迹规划器和检测分割头注入语义/运动线索。nuScenes 上报告 NDS 61.5、mAP 52.9、mIoU 52.3,并称在感知、预测与规划鲁棒性上优于近期端到端基线。

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning Figure 1
2026-07-07cs.RO

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone

Stanford University, KTH Royal Institute of Technology, Italian Institute of Artificial Intelligence (AI4I)

2026-07-07视觉语言视觉感知

这篇论文针对VLA机器人/自动驾驶模型“会解释但未必按解释决策”的问题,区分提升性能的功能性推理与反映真实决策链路的忠实推理。作者提出Pinocchio学习式评判器,用观察 grounding、推理步骤一致性和动作一致性构造密集奖励进行RL后训练。实验显示其在保留轨迹性能的同时,相比对齐和轨迹误差基线提高忠实性,并在罕见反事实场景中使策略响应性达到SOTA的1.6倍。

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation Figure 1
2026-07-07cs.RO

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li

Tsinghua Shenzhen International Graduate School, Huawei Technologies Ltd.

2026-07-07机器人强化学习

本文针对少样本机器人操作中静态掩码只告诉“在哪交互”、缺少“如何起手”的问题,提出从冻结的 Flow Matching 图像到视频世界模型单次读取高噪声端潜在速度,构成 KAM 作为一阶运动可供性先验,并用 Perceiver token 条件化扩散策略。其无需视频 rollout 或微调世界模型,在 LIBERO 上达 90.6% 成功率,在 RoboTwin 2.0 Easy/Hard 上达 65.7%/22.4%,消融显示增益部分来自方向信息而非仅定位。

Governed Caste Reassignment in Heterogeneous Swarms: An Asymmetric-Trust Protocol with Audited Operator Countersignature Figure 1
2026-07-07cs.RO

Governed Caste Reassignment in Heterogeneous Swarms: An Asymmetric-Trust Protocol with Audited Operator Countersignature

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

2026-07-07机器人

面向医院、工厂等受监管异构机器人群,论文指出角色/“ caste ”升权不应只是内部分配决策,而应成为可审计治理事件。其核心是按权限格将重分配分为自动收紧、受限放宽和仅操作员授权,并用操作员会签、Ed25519 签名、哈希链与 Merkle 日志记录因果链。仿真到百机器人时延为个位到十几毫秒量级,并能阻断列举的四类攻击;但尚无实体机器人和多主机部署验证。

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing Figure 1
2026-07-07cs.RO

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

NVIDIA Corporation, 2 University of California, San Diego

2026-07-07机器人

这篇论文针对工业线缆布线中柔性体形变难预测、示教数据昂贵且传统规划泛化差的问题,提出用GPU并行刚体关节近似线缆动力学训练局部RL策略,并在部署时通过SILO让真实机器人跟踪仿真执行以缩小控制差距,配合线缆状态估计完成多阶段布线。实验显示其在真实线缆任务上成功率高于层级模仿学习等基线,周期时间约减半,且可泛化到4种不同线缆;限制是依赖已知治具几何与准静态同步。

DIVO: Continuous-time DVL-Inertial-Visual Odometry for Unmanned Underwater Vehicles Figure 1
2026-07-07cs.RO

DIVO: Continuous-time DVL-Inertial-Visual Odometry for Unmanned Underwater Vehicles

Kyungmin Jung, Angad Bajwa, Junha Yoo, Arturo Del Castillo Bernal, James Richard Forbes

2026-07-07机器人

水下机器人里视觉里程计常受低照度、浑浊和“海雪”干扰,而DVL、相机、IMU又存在异步采样难题。DIVO的核心是用高斯过程连续时间后端统一融合DVL-惯性-双目测量,并以SuperPoint+LightGlue增强短期视觉匹配。仿真和真实水下巡检实验显示,它在轨迹精度、鲁棒性和覆盖率上优于视觉惯性及声学视觉惯性基线,但未来仍需补充闭环等长期约束。

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Figure 1
2026-07-07cs.RO

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

University of California, Berkeley, Princeton University

2026-07-07机器人视觉感知

面向工业、农业、手术等真实机器人场景,作者指出仅用端到端轨迹难以评估 VLM 在模块化决策中的空间理解、规划与恢复能力。论文提出 RQA 框架,并构建 RoboVista:474 个专家标注的机器人 VQA 问题,覆盖 6 个领域、39 类任务。实验显示当前先进 VLM 在多域机器人推理上仍有明显缺口,且基准表现与双臂空间估计、闭环手术打结等真实执行效果强相关。

SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies Figure 1
2026-07-07cs.RO

SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies

Dijia Zhan, Xuemiao Xu, Jinyi Li, Jie Tang

2026-07-07视觉语言视觉感知

SEAM关注VLA策略按动作块执行时的跨块不一致:相邻块由独立噪声采样,可能选择不同运动模态,导致边界处急变。其核心洞察是同步执行后上一块未执行尾部天然可作为一致性参考,并用VLS在flow matching欧拉去噪后做闭式校正,无需反传或重训。LIBERO-10上边界jerk降28%、块切换不连续降27%,成功率基本保持且去噪开销约1.01倍。

Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning Figure 1
2026-07-07cs.RO

Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning

Xinchuan Qiu, Yi Yu

Graduate School of Advanced Science and Engineering, Hiroshima University, Graduate School of Advanced Science and Engineering, Hiroshima University Higashi-Hiroshima Japan

2026-07-07视觉语言视觉感知模仿学习

这篇论文针对 VLA 机器人模仿学习中常被忽视的示范数据组织问题,指出直接收集端到端长程轨迹会让策略同时学习抓取、感知和任务执行,影响稳定性。作者提出由简单到复杂的 S2C 示范采集策略,通过任务分解、环境标准化和逐步增加复杂度来组织数据。在双臂积木抓取/分类与毛巾折叠实验中,相比完整轨迹基线,方法提升了成功率和训练稳定性,但具体增益与数据量、场景控制的关系仍需更多消融说明。

HUGS: Guiding Unified Dexterous Grasp Synthesis Across Modes and Scales via Learned Human Priors Figure 1
2026-07-07cs.RO

HUGS: Guiding Unified Dexterous Grasp Synthesis Across Modes and Scales via Learned Human Priors

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Kangchen Lv, Li Huang, Yi Ren, Xiang Li

Tsinghua University

2026-07-07机器人

这篇论文针对灵巧抓取在物体尺度和接触模式变化下难以兼顾成功率与多样性的问题,提出不直接重定向人手示范,而是学习物体条件的人类先验来预测接触模式和腕部初始化,再结合力闭合优化生成机器人抓取。作者用304个物体、1.8K人类抓取训练先验,并合成157K场景中的3.2M抓取,覆盖2厘米到30厘米物体及双指到双手模式;实验显示其提升模式覆盖、合成效率和真实抓取适应性,但在线生成器和异常物体泛化仍有限。

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models Figure 1
2026-07-07cs.RO

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

Soft Robotic Lab, Department of Mechanical and Process Engineering

2026-07-07视觉感知强化学习规划控制

面向高自由度灵巧手操作中真实数据稀缺、像素级世界模型难以捕捉指尖接触与逐关节动作影响的问题,Mask2Real-WM将预测拆成“分割掩码动力学+真实感渲染”,用掩码缩小仿真到现实差距,使动力学可先在50小时仿真数据上预训练、再用少于2.5小时真实演示微调。实验显示该设计在23自由度可控性和OOD鲁棒性上优于端到端视频基线,但主要失败仍来自掩码动力学。

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining Figure 1
2026-07-07cs.CV

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

Jingyu Song, Yi Liu, Katherine A. Skinner

2026-07-07强化学习

这篇论文针对自动驾驶中相机-雷达方案成本低但缺少可复用预训练表示的问题,提出 CRISP:用历史多视角图像和雷达预测未来 LiDAR 点云,将 LiDAR 仅作为预训练特权监督,部署时仍只需相机和雷达。其关键在于把雷达距离与多普勒运动线索注入 BEV 时序传播,并用门控融合两种模态证据。在 nuScenes 上,CRISP 提升长时域点云预测,并迁移到检测、跟踪、地图、运动预测、占据和规划等任务。

Compressing the Validation Bottleneck: An Agentic Self-Driving Lab for Scientific Discovery Figure 1
2026-07-07cs.AI

Compressing the Validation Bottleneck: An Agentic Self-Driving Lab for Scientific Discovery

Kyunghoon Hur, Chihun Lee

2026-07-07机器人

论文关注智能体科研中真实实验验证仍是瓶颈的问题,提出把自驱实验室的低效来源拆成“实验轮次过多”和“单轮测量成本高”。核心思路是用带领域先验和可行性约束的 agentic DOE 选择下一轮实验,并用具不确定性判断的低成本测量代理高成本表征。文中主要给出生物工艺和金属增材制造场景的设计与评估指标,尚未充分说明已完成的实证增益。

Robustness Verification of an Autonomous Underwater Vehicle-based Plankton Classifier Figure 1
2026-07-07cs.RO

Robustness Verification of an Autonomous Underwater Vehicle-based Plankton Classifier

Abdelrahman Sayed Sayed, Pierre-Jean Meyer, Asgeir J. Sørensen, Mohamed Ghazel

2026-07-07安全鲁棒

面向AUV原位浮游生物成像中气泡、浑浊和噪声导致的误分类问题,论文将神经ODE分类器与可达性分析结合,提出先随机反例筛查、再用混合单调性和star-set传播验证的鲁棒性框架。结果表明其可在有界L∞扰动下为部分图像给出形式化稳定分类保证,并发现Tanh在全图扰动等较难场景下比ReLU更易验证。

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies Figure 1
2026-07-07cs.RO

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Weijie Wan, Baijun Chen, Haoran Lu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka

2026-07-07机器人数据集/基准

这篇论文针对通用机器人操作评测碎片化、任务偏简单且仿真与真实评测割裂的问题,提出 RoboDojo:统一 42 个仿真任务与 18 个真实任务,覆盖泛化、记忆、精度、长程执行和开放词汇指令等能力,并配套 Isaac Sim 并行评测、远程真实评测系统 RoboDojo-RealEval 与统一接入框架 XPolicyLab。作者已集成 30 个策略并建立排行榜,结果主要用于系统暴露现有策略在仿真诊断与真实部署中的能力短板。

ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI Figure 1
2026-07-07cs.RO

ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI

ACE-Brain Team : Ziyang Gong, Haoming Gu, Zehang Luo, Tianyi Zhang, Tao Tao, Yixiao Chi, Zhe Liu, Lingsi Zhu, Jingyuan Liu, Anke Tang, Songze Li, Yilun Kong, Ningjing Liu, Tianyu Zhu, Yunpeng Qing, Shuang Luo, Xiang Liu, Shi Fu, Dawei Nie, Sixiang Liu, Zhexi Wen, Feng Pan, Xiaofeng Wang, Zhi Hou, Chunxiao Liu, Xue Yang, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

2026-07-07机器人

这篇论文针对具身机器人中感知、规划、执行与评估割裂的问题,提出 ACE-Brain-0.5:用单一 8B 骨干统一空间感知、决策、导航/操作与进度自监控,并以 SSR+ 缓解多任务合并干扰,外接经验记忆实现自改进。实验覆盖十余个空间、导航、操作和进度评估基准,相比 ACE-Brain-0 在 18 个空间/grounding 任务中提升 14 个,导航与操作表现具竞争力,但具体增益可能部分来自数据与训练规模。

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy Figure 1
2026-07-07cs.RO

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy

Lei Song, Yonghao Long, Mengya Xu, Jiayi Geng, Xiuyuan Chen, Qi Dou

L. Song, Y. Long, M. Xu, and Q. Dou are with the Department of Computer Science and Engineering, The Chinese University of Hong Kong., J. Geng and X. Chen are with the Department of Thoracic Surgery, Peking University People’s Hospital, Beijing, China., J. Geng and X. Chen are with the Thoracic Oncology Institute, Peking University People’s Hospital, Beijing, China., J. Geng and X. Chen are with the Institute of Advanced Clinical Medicine, Peking University, Beijing, China., J. Geng and X. Chen are with Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer, Peking University People’s Hospital, Beijing, China.

2026-07-07机器人视觉语言

这篇论文针对手术机器人中“看懂场景”难以转化为“知道在哪操作”的问题,提出手术可供性图预测任务。方法融合自监督视觉Transformer的语义特征与生成模型编码器的空间特征,并用层级提示和场景引导跨模态注意定位吸引、夹闭、牵拉区域。作者构建了含1915段公开视频标注的数据集,实验显示优于现有基线,并在肺、前列腺仿体上支持dVRK执行自主操作。

A Perception-Manipulation Robotics System for Food Cutting Figure 1
2026-07-07cs.RO

A Perception-Manipulation Robotics System for Food Cutting

Xinyuan Luo, Wenzhen Yuan

2026-07-07机器人

面向烹饪机器人中食材硬度、摩擦和形变差异导致的切割策略难以泛化问题,论文提出先用固定试切的力反馈选择水果刀或锯齿刀,再由真实机器人上的强化学习在线调节下压力和锯切速度。实验中试切选刀在4类未见食材上达到100%成功,RL策略通常1–2片内收敛,整体优于固定策略并接近小规模人类参考表现。

Agent-driven Long-tail Simulation for Autonomous Driving Figure 1
2026-07-07cs.RO

Agent-driven Long-tail Simulation for Autonomous Driving

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

\phantom{}{}^{1} IIIS, Tsinghua University

2026-07-07机器人

本文针对自动驾驶闭环评测中回放和规则智能体交互性弱、难覆盖长尾行为的问题,提出由指令跟随大模型控制周边交通参与者的仿真框架,并用结构化动作接口约束物理可行性;同时构建基于 nuPlan 的 SemanticPlan 长尾场景集。实验显示现有先进规划器在这些语义丰富、多人交互场景中仍难稳定安全完成任务。

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance Figure 1
2026-07-07cs.RO

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance

Taekwon Ga, Jongeun Choi

2026-07-07机器人

面向密集障碍中MPC避障约束评估过慢、粗糙几何又易保守或失配的问题,论文提出PSDF:对凸多边形机器人与障碍边界做几何精确的有符号距离计算,并用无分支张量化实现支持GPU批量求值和自动微分;再将其线性化嵌入SQP-RTI MPC,使QP规模不随障碍边数增长。微基准、仿真和实机导航显示其在复杂多边形环境中保持实时性和稳健避障。

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models Figure 1
2026-07-07cs.RO

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China, Tsinghua University, Beijing, China

2026-07-07强化学习

本文针对世界-动作模型在真实机器人精密操作中易受标定、感知和接触动力学误差影响、常在最后几毫米对准或插入失败的问题,提出冻结WA主干、用轻量actor-critic适配器进行在线强化学习的HALO-WA。其核心是利用WA生成过程中的参考动作块与潜在特征,并通过混合注意力在保持动作块时序一致性的同时读取端阶段校正信息。实机四项任务中平均成功率由WA-base的26.4%提升至87.1%,且每任务仅需45–75分钟在线训练。

FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control Figure 1
2026-07-07cs.RO

FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control

Junxiao Lin, Kehan Zhou, Shuhang Ji, Yimin Peng, Shen Wang, Jialiang Hou, Fei Gao

2026-07-07生成模型规划控制

面向近距离空中物理交互中“要施力又要稳飞、还要少吹扰目标”的矛盾,论文提出紧凑同轴双旋翼 FLOAT Drone,用下洗流中的舵面产生 6DoF 力/矩,并以力匹配 CFD、精密测力辨识的多项式气动力模型、非线性分配器和 L1 自适应控制闭环。实验显示其相较线性分配提升跟踪精度,可抗地效、载荷和外扰,并完成 2cm 间隙抽屉推拉操作。

Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles Figure 1
2026-07-07cs.RO

Integrated Graph Search and Model Predictive Control for Smooth and Efficient Path Planning in Autonomous Vehicles

Duc-Tien Bui, Ngoc Thinh Nguyen, Hung Duy Nguyen, Dong Bi, Tomislav Mihalj, Arno Eichberger

*This work was supported by ASEAN-UNINET Project 1 Duc-Tien Bui is with the Institute of Automotive Engineering, Graz University of Technology, 8010 Graz, Austria

2026-07-07规划控制

面向自动驾驶局部路径规划中安全、平滑与实时性的权衡,论文将Dijkstra网格搜索得到的粗路径用于构造随道路位置变化的凸横向安全走廊,再在其中用MPC惩罚横向偏移三阶导数以细化轨迹。CarMaker直道和弯道超车仿真显示,相比多项式拟合加QP基线,横向加速度、曲率和jerk更低,计算耗时分别下降28.08%和29.52%。

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects Figure 1
2026-07-07cs.RO

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

2026-07-07机器人数据集/基准安全鲁棒

这篇论文针对软体/可变形物体操作中“完成任务但压坏、滑落或接触不安全”的评测缺口,提出 SoftVTBench,在 Isaac Sim 中结合 FEM 软体状态、多视角视觉、双指触觉和语言指令,区分 Goal Success 与 Safety Success。实验表明,单看成功率会明显高估策略能力;加入触觉在可变形物体任务上把安全成功率从 21.4% 提升到 35.6%,并减少变形,但真实世界泛化仍文中未充分说明。

Anytime Plug-and-Play Control with Contract-Based Distributed MPC Figure 1
2026-07-07math.OC

Anytime Plug-and-Play Control with Contract-Based Distributed MPC

Sabrina Bodmer, Danilo Saccani, Melanie N. Zeilinger, Andrea Carron

2026-07-07规划控制

面向多机器人在真实场景中通信拓扑随位置和进出网络不断变化的问题,论文提出基于契约的分布式 MPC:用距离定义邻居,并由预测轨迹生成时变单元与安全包络,把碰撞约束解耦到局部通信中,从而支持无需集中协调或审批的 anytime plug-and-play。作者给出递归可行性、约束满足与避碰保证,并在六到八辆自动驾驶赛车的仿真和真实八字赛道实验中展示高速相向运行下仍能安全协调。

XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control Figure 1
2026-07-07cs.RO

XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control

Lei Iok Tong, Qingchen Xie, Wei Huang, Ying Jie Yap, Yujie Zhang, Qianzhi Li, Xiaolong Liu, Zhidong Deng

Iok Tong Lei, Qingchen Xie, Wei Huang, Ying Jie Yap, and Zhidong Deng are with the Department of Computer Science and Technology, Tsinghua University, Beijing, China., Qianzhi Li is with the National College for Excellent Engineers, Beihang University, Beijing, China.

2026-07-07机器人生成模型规划控制

XS-VLA针对轻量VLA虽适合边缘实时控制、却缺乏空间定位能力且难以建模混合示范动作分布的问题,先用Qwen3-VL-4B生成粗粒度空间描述并蒸馏到0.25B SmolVLM2,再以CVAE结合Latent Flow Matching生成多模态动作。LIBERO上其平均成功率较SmolVLA 0.25B提升7.2%,Libero-Long提升23%,并在消融中较既有轻量流匹配策略实现3.2倍任务执行加速。

Neural LiDAR Bundle Adjustment Figure 1
2026-07-07cs.RO

Neural LiDAR Bundle Adjustment

Chin Yung Anson Hon, Kaicheng Zhang, Sen Wang

The authors are with Imperial College London, London, United Kingdom.

2026-07-07机器人

本文针对多视角 LiDAR 点云配准中传统 ICP/BA 依赖初始化、易陷局部最优,以及直接套用 RGB NeRF-BA 忽视 LiDAR 稀疏性和精确量测的问题,提出 NeLD-BA。核心洞察是 LiDAR NeRF 的位姿优化强依赖体采样密度,因此设计了面向 LiDAR 光线的高效体采样、位置编码和专用损失,联合优化神经地图与传感器位姿。在 Newer College 和 FusionPortable 上,方法在配准、建图与里程计指标上优于现有方法。

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning Figure 1
2026-07-07cs.RO

ACE: Agentic Control for Embodied Manipulation via Zero-shot Workflow Reasoning

Iok Tong Lei, QianZhi Li, Ying Jie Yap, Yujie Zhang, Rui Zhong, Haichao Gui, Xiaolong Liu, Zhidong Deng

Department of Computer Science, Tsinghua University, China, National College for Excellent Engineers, Beihang University, China

2026-07-07机器人生成模型规划控制

ACE针对开放式桌面抓放中语言目标复杂、长程推理和执行失败难以处理的问题,将机器人操作表述为零样本闭环工作流推理:高层代理分解并修订语义子目标,再通过可验证的掩码接口连接通用抓放策略。实验在方程拼装和约束检索任务上分别达到50%和70%成功率,优于端到端基线,但仍依赖人工确认,适用范围主要限于抓放。

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics Figure 1
2026-07-07cs.RO

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

Stefan Bühler, Mark Schutera

2026-07-07机器人

本文关注开源机器人依赖社区数据带来的投毒风险,指出少量恶意轨迹即可在VLA中植入触发词后门。作者在LeRobot的真实抓取放置任务上攻击smolVLA,将触发词与固定关节姿态绑定;结果显示,320条干净轨迹中加入3条投毒轨迹即可使触发条件下成功率降为0,而干净提示仍约50%,且触发词位置变化仍有效,说明攻击低成本且隐蔽。

Semantic-Guided Progressive Object Removal with Gaussian Splatting Figure 1
2026-07-07cs.RO

Semantic-Guided Progressive Object Removal with Gaussian Splatting

Xianliang Huang, Chen Xiao, Yuanxiang Ni, Guanming Liu, Mingkai Liu, Dikai Fan, Xiao Liu, Hao Zhang

2026-07-07三维

本文针对3D Gaussian Splatting场景中物体移除后跨视角不一致、细节过平滑的问题,提出结合DINOv2语义块匹配与分区域渐进细化的框架,并引入高频特征约束扩散补全。实验声称在前向和360°场景中较NeRF与Gaussian基线获得更好的感知质量、几何一致性和局部纹理保真度。

Real-Time LiDAR Gaussian Splatting SLAM Figure 1
2026-07-07cs.CV

Real-Time LiDAR Gaussian Splatting SLAM

Seungjun Tak, Yewon Jeon, Jaeik Hwang, SukMin Hwang, Seongbo Ha, Hyeonwoo Yu

2026-07-07三维

这篇论文针对大规模 LiDAR SLAM 中稀疏地图难以支持高保真重建、Gaussian Splatting 又易出现地图膨胀和误差累积的问题,提出将 G-ICP 跟踪与球面 2D Gaussian 稠密建图紧耦合:复用局部协方差初始化尺度和法向,并用几何复杂度控制剪枝/增密,同时把优化后的几何反馈给配准。在 Newer College 上以纯在线轨迹达到 86.78% F-score 和超过 20 FPS,并在 KITTI、Oxford Spires 等数据上展示较好的稳定性与可扩展性。

Conflict-Based Lazy Search for Fast Multi-Manipulator Planning Figure 1
2026-07-07cs.RO

Conflict-Based Lazy Search for Fast Multi-Manipulator Planning

Dongliang Zheng, Zhipeng Wang, Siqi Wang, Yuxi Lu, Bin He, Hesheng Wang, Panagiotis Tsiotras

2026-07-07规划控制

面向杂乱环境中多机械臂实时规划的高维与碰撞检测开销问题,论文将CBS改造成CBLS:预先构建可控稀疏度的懒评估关节空间图,并用带边队列的LEA*作为低层单臂搜索,以尽量推迟和减少昂贵的边碰撞检查。作者证明LEA*完备、最优且顶点效率最优,并在仿真和双臂实验中相较CBS与RRT-Connect取得更快规划表现。

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes Figure 1
2026-07-07cs.CV

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

2026-07-07视觉语言视觉感知强化学习

这篇论文针对长期运行机器人只能在重访后被动发现物体变化的问题,提出用场景上下文预判实例级物体在原位持续多久。核心洞察是同一类别的持久性取决于用途与人类活动语境,因此用VLM生成持久性先验并接入概率过滤器,同时蒸馏出视觉模型以降低部署成本。在新的野外标注数据集上,PreSIST-Lang和PreSIST-Vis均优于同效率基线,显示上下文先验有助于开放场景持久性预测。

Finite Reliability Representations: Noise-Calibrated Belief-Space Covers for Reliable Decision-Making Figure 1
2026-07-07eess.SY

Finite Reliability Representations: Noise-Calibrated Belief-Space Covers for Reliable Decision-Making

Hyung-Jin Yoon, Hunmin Kim

Department of Mechanical and Nuclear Engineering, Tennessee Technological, University, Cookeville, TN, USA. ‡ H. Kim is with the School of Engineering, Department, of Electrical and Computer Engineering, Mercer University, Macon, GA, USA.This work was supported by internal funding at Tennessee, Technological University.

2026-07-07机器人

论文针对部分可观测机器人系统中“信念空间该保留多细”的问题,指出离散化容差应由传感、过程和执行噪声及决策敏感性共同决定。其核心是有限可靠表示:用动作价值变化受限的可靠单元覆盖可达信念空间,并区分观测预测律、贝叶斯更新和信念转移核。结果给出单元常值策略的次优界,实验显示传感噪声不必然减少单元数,而执行不确定性可压平动作差异。

Finite-Sample Closed-Loop Stability of Model Predictive Path Integral Control for Linear Time-Invariant Systems Figure 1
2026-07-07math.OC

Finite-Sample Closed-Loop Stability of Model Predictive Path Integral Control for Linear Time-Invariant Systems

Hyung-Jin Yoon, Hunmin Kim

Department of Mechanical and Nuclear Engineering, Tennessee Technological, University, Cookeville, TN, USA. ‡ H. Kim is with the School of Engineering, Department, of Electrical and Computer Engineering, Mercer University, Macon, GA, USA.This work was supported by internal funding at Tennessee, Technological University.

2026-07-07规划控制

本文针对有限采样 MPPI 在闭环滚动执行中缺少稳定性保证的问题,聚焦带高斯扰动的离散 LTI 二次型系统。核心洞察是使用 DARE 终端代价时,精确有限时域 MPC 的首个控制等同于无限时域 LQR,因此可将 MPPI 视为 LQR 的随机扰动。论文给出采样误差与温度偏差分解、显式样本阈值,并证明期望意义下的实用指数稳定,残差来自过程噪声、MPPI 近似和置信失败概率。

Fast Asymptotically Optimal Kinodynamic Planning via Vectorization Figure 1
2026-07-07cs.RO

Fast Asymptotically Optimal Kinodynamic Planning via Vectorization

Yitian Gao, Andrew Lu, Zachary Kingston

2026-07-07规划控制

面向动态环境中的实时 kinodynamic 规划,论文指出传统采样规划慢,而并行化又常牺牲解质量。其核心做法是用 JAX/XLA 将 RRT 式批量扩展融合到 GPU,并借 AO-x 的代价约束反复重规划把快速但次优的并行搜索转化为渐近最优过程。实验显示 PAKR 在复杂动力学和 MuJoCo-XLA 场景中可毫秒级求解,运行时间接近或优于现有 GPU 规划器,同时解质量更好。

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control Figure 1
2026-07-07cs.RO

Worldscape-MoE: A Unified Mixture-of-Experts World Model for Scalable Heterogeneous Action Control

Jianjie Fang, Yongyan Xu, Ziyou Wang, Chen Gao, Yuchao Huang, Zhaolu Wang, Rongze Tang, Mingyuan Jia, Baining Zhao, Weichen Zhang, Xin Zhang, Haisheng Su, Yu Shang, Wei Wu, Xinlei Chen, Yong Li

2026-07-07强化学习规划控制

该文针对现有世界模型按相机轨迹、机器人动作、手部关节等控制接口割裂训练,难以共享数据和动力学知识的问题,提出基于DiT的Worldscape-MoE:用模态感知控制注入、共享专家与控制专属专家分解“共同世界规律”和“动作语义”,并通过渐进式MoE调优扩展新控制。实验显示异构监督未明显相互干扰,在WorldArena、移动与手控指标、OOD泛化和新增数据/专家扩展上均有提升。

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control Figure 1
2026-07-07cs.RO

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

Tongji University

2026-07-07机器人强化学习规划控制三维

本文针对现有机器人基础模型偏重2D视觉语义、难以显式推理动作对3D世界状态因果影响的问题,提出WSA1,将3D世界预测、3D一致的视觉规划与3D逆动力学统一到共享潜空间,并用双向注意力约束世界—动作一致性。模型仅用6000小时示范数据预训练,在RoboTwin2.0达93%成功率,真实任务较SOTA平均提升20%,但具体增益中架构、数据与规模化因素的贡献仍需进一步拆分。

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation Figure 1
2026-07-07cs.RO

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Hechang Chen, Hui Xiong, Sihong Xie

The Hong Kong University of Science and Technology (Guangzhou), Jilin University

2026-07-07机器人数据集/基准

这篇论文针对长程具身导航基准缺少声音、现有音视导航又多为单目标的问题,提出 LH-AVLN,将2到4个由类别、文本或图像指定的目标与持续空间化双耳声源结合,并区分有序/无序任务。核心洞察是声音在长程任务中是随进度变化的线索,既能辅助盲区搜索也会成为干扰,因此需要任务状态感知的声学 grounding。实验显示现有视觉语言、记忆和音视代理难以完成完整任务,训练-free 的 PAG-Nav 提供更强诊断基线但仍有明显提升空间。

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching Figure 1
2026-07-07cs.RO

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching

Yuran Chen, Xinye Cai, Zhonglin Gong, Yang Huang

2026-07-07生成模型强化学习

本文针对扩散/流匹配视觉运动策略推理需多步采样、难以用于低延迟闭环控制的问题,指出单步化的关键误差来自空间偏移、频率失真和多模态平均。方法通过递归一致动作流、双时间步频率一致性和对比流匹配分别修正轨迹、保留高频细节并分离动作模式。在 RoboTwin、Adroit、DexArt 及真实机器人上,仅 1 次前向推理即可达到或超过强 10 步生成策略的操控表现。

ObjRetarget: An Object-Aware Motion Retargeting Framework with Anthropomorphic Arm Constraints and Polyhedral Hand Modeling Figure 1
2026-07-07cs.RO

ObjRetarget: An Object-Aware Motion Retargeting Framework with Anthropomorphic Arm Constraints and Polyhedral Hand Modeling

Yuanchuan Lai, Qing Gao, Ziyan Liang, Junjie Hu, Zhaojie Ju

2026-07-07优化算法

面向从人类视频学习灵巧操作时易丢失手—物接触、强化学习方法泛化受限的问题,ObjRetarget将手臂大尺度运动与手部接触操作解耦:用人类参考轨迹、人形约束和冗余优化生成手臂轨迹,并以多面体簇和几何不变量保持多指接触结构。真实机器人实验显示其在多种任务中提升成功率与接触稳定性,并能适应不同示教、物体位姿和任务设置。

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation Figure 1
2026-07-07cs.RO

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

Australian Institute for Machine Learning, Adelaide University, Fudan University, Swiss Federal Institute of

2026-07-07机器人视觉语言视觉感知

本文指出现有 VLN/REVERIE 评测只要求智能体停在目标附近 3 米内,可能仍看不到或无法定位目标物体,形成“最后 3 米 grounding gap”。作者提出实例级 ONS、GS、OracleGS 指标、REVERIE-AIM 数据集,以及可插拔的 REALM 精修模块,用可见性驱动停止来对齐最终视角。实验显示其在四类 VLN 骨干上稳定提升近距离到达与目标可见性,如 ETPNav-ZS 的 ONS@0.1m 翻倍,但绝对性能仍远低于人类上限。

Occluding the Solution Space: Planner-Agnostic Adversarial Attacks on Tolerance-Aware Manipulation Figure 1
2026-07-07cs.RO

Occluding the Solution Space: Planner-Agnostic Adversarial Attacks on Tolerance-Aware Manipulation

Keke Tang, Tianyu Hao, Weilong Peng, Hao Jiang, Feng Wu, Peican Zhu, Jianmin Ji, Zhihong Tian

∗ These authors contributed equally. † Corresponding authors. 1 Keke Tang, Tianyu Hao, Weilong Peng, and Zhihong Tian are with Guangzhou University, Guangzhou 510006, China., Hao Jiang, Feng Wu, and Jianmin Ji are with the University of Science and Technology of China, Hefei 230026, China., Peican Zhu is with Northwestern Polytechnical University, Xi’an 710072, China.

2026-07-07机器人

面向机械臂操作中“到达一片可接受目标区域”而非精确位姿的实际需求,论文指出现有对抗评测过度依赖目标位姿和规划器查询。其核心是用离线运动学占据热图刻画可行轨迹密度,再在线以预算最大覆盖放置障碍,遮蔽整个解空间。仿真与真实机器人实验显示,该方法比规划器闭环基线更高效,也更稳定地诱发规划失败。

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models Figure 1
2026-07-07cs.RO

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

Nanjing University, Australian National University, Institute of Automation, Chinese Academy of Sciences

2026-07-07数据集/基准

这篇论文针对冻结 VLA 在部署中“会生成但不会判断”候选动作的问题,指出高质量动作已存在于输出分布中,瓶颈在长期后果评估。方法 SVA 用仿真中的 MCTS 收集带回报轨迹,再蒸馏成轻量 Q 值评估器,部署时从多候选动作中选择不确定性正则后的高值动作。实验显示其提升未见任务泛化与测试时 scaling,9B VLA+SVA 甚至超过 27B VLA 且延迟更低,但仍依赖可重置仿真,真机验证文中未充分说明。

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies Figure 1
2026-07-07cs.RO

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

Kelin Yu, Haode Zhang, Harish Ravichandar, Yunhai Han, Ruohan Gao

University of Maryland, College Park, Georgia Institute of Technology

2026-07-07强化学习

针对视觉策略在插入、装配等接触密集任务中缺少力觉与局部接触信息、易在接触瞬间失败的问题,OmniTacTune不重新训练多模态策略,而是冻结已有视觉策略,用真实环境强化学习学习轻量触觉残差修正;其两阶段流程先用基础策略自主 rollout 预热触觉编码器和 critic,再在线优化残差,并结合物体中心的视触觉奖励塑形。四个真实任务中,成功率由5–40%提升到85–100%,训练约40–80分钟。

Lost in Time? Continuous Symmetry and Identifiability in Aided Inertial Navigation with Unknown Measurement Delays Figure 1
2026-07-07cs.RO

Lost in Time? Continuous Symmetry and Identifiability in Aided Inertial Navigation with Unknown Measurement Delays

Jonathan Kelly, Phone Thiha Kyaw, Mattew Giamou

2026-07-07机器人

本文针对多传感器辅助惯导中未知恒定测量延迟会导致在线标定失效的问题,研究延迟与导航状态何时可辨识。核心洞察是用特殊伽利略群刻画延迟测量模型的连续对称性:某些轨迹形状会让延迟变化可被初始状态变化吸收。主要结果表明,不可辨识轨迹类别比既有分析更大,并与线性化雅可比零空间建立联系。

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts Figure 1
2026-07-07cs.RO

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts

Haozhe Zhang, Sixian Li, Yifei Zhang, Zezheng Huai, Hao Chen, Chunhua Shen, Jingjing Gong, Xipeng Qiu

Zhejiang University, Shanghai Innovation Institute, Fudan University, Nanjing University, Jilin University

2026-07-07视觉语言视觉感知安全鲁棒

CoRE-VLA瞄准机器人部署中传感器配置不一致、深度等辅助传感器可能缺失或失效的问题,认为固定观测接口和稠密动作生成会导致过度依赖传感器并限制多任务专化。其核心是在动作生成器中用任务意图和传感器可用性进行专家条件路由,结合模态 dropout,使模型能利用深度又能在缺失时退化。实验覆盖 LIBERO、RoboCasa 与真实双臂任务,显示其优于稠密消融和预训练 VLA 基线,并具备一定零样本泛化。

A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents Figure 1
2026-07-07cs.CV

A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents

Oliver Krumpek, Diana Leo

2026-07-07视觉感知三维

面向文化遗产中碎片化纸本文档的低损伤重建需求,论文提出将工业相机、投影引导界面与协作机器人结合的半自动系统,并设计带传感器的真空吸附件以保护脆弱纸片。系统支持人工按视觉提示摆放或由机器人自动定位;实验比较 SIFT、SuperPoint+SuperGlue 与 SE2-LoFTR 在旋转、尺度和破损条件下的匹配表现,最终选择 SE2-LoFTR,并报告 8cm² 碎片定位重复性达到 0.57mm。

ROBOCYCLE: Autonomous Dual-Arm Robotic Manipulation and Coordination for Recycling Applications Figure 1
2026-07-07cs.RO

ROBOCYCLE: Autonomous Dual-Arm Robotic Manipulation and Coordination for Recycling Applications

Rubén de J. Hilario-Cruz, Jesus A. García-González, Enrique Coronado, Arturo E. Cerón-López

2026-07-07机器人

面向城市垃圾增长、人工分拣短缺以及透明/可变形废弃物难以3D感知和抓取的问题,ROBOCYCLE构建了双臂回收平台,将多视角RGB-D、RF-DETR实例分割、点云重建与AnyGrasp 6-DoF抓取结合,并用ROS 2行为树协调拧瓶盖等序列操作;实机结果显示检测准确率97.8%,抓取成功率90.3%,整体任务成功率84.3%。

Token-Based Affordance Grounding with Large Vision-Language Models Figure 1
2026-07-07cs.CV

Token-Based Affordance Grounding with Large Vision-Language Models

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

2026-07-07视觉语言视觉感知

本文针对弱监督可供性定位在多动作共现、相似动作区分中易失效的问题,提出零样本 TokAG:从大视觉语言模型生成过程的跨注意力中聚合层/头信息,并按目标物体空间集中度选择最有用输出 token,将隐式语义转为可供性热图。实验显示其无需任务训练即超过多种弱监督方法,AGD20K unseen NSS 提升约10.7%,HICO-IIF 提升约29.7%;剩余误差主要来自 token 选择而非分割。

Cross-Embodiment Robot Manipulation via a Unified Hand Action Space Figure 1
2026-07-07cs.RO

Cross-Embodiment Robot Manipulation via a Unified Hand Action Space

Luis Felipe Casas, Robert Teal, Keval Shah, Abhijit Tadepalli, Wanxin Jin, Yu Xiang

Intelligent Robotics and Vision Lab, University of Texas at Dallas, Intelligent Robotics and Interactive Systems Lab, Arizona State University

2026-07-07机器人

这篇论文针对灵巧手策略通常绑定特定关节空间、难以跨硬件迁移的问题,提出用规范球面形变表示手部动作,并通过级联逆运动学映射到 Allegro、LEAP、Shadow、MANO 等不同手型。其关键洞察是把接触/运动语义放在共享几何空间中,而非各自关节空间中学习。强化学习的方块手内重定向实验显示,该表示支持多手训练、未见手零样本迁移、快速微调和真实部署;但跨 4 指与 5 指等差异较大形态时性能仍会下降。

CoorGrasp: Coordinated Contact Control for Adaptive Dexterous Grasping Under Uncertainty Figure 1
2026-07-07cs.RO

CoorGrasp: Coordinated Contact Control for Adaptive Dexterous Grasping Under Uncertainty

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Ren Yi, Xiang Li

2026-07-07规划控制安全鲁棒

这篇论文针对灵巧手抓取中“规划姿态已有、执行却因形状/位姿不确定而碰歪物体”的问题,提出基于触觉反馈的 MPC,把接近与抓取阶段按整体接触状态切分,并联合手臂补偿位置误差、在线平衡多接触力。其方法不限定抓型或接触位置,可接入现有抓取生成器;在 478 个物体、1.5 万次仿真和 8 个实物实验中,相比基线提升成功率并减少非期望物体运动。

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring Figure 1
2026-07-07cs.CV

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring

Dayou Mao, Yuchen Lin, Ashkan Ebadi, John Zelek, Alexander Wong, Yuhao Chen

University of Waterloo, Waterloo, ON, Canada

2026-07-07视觉感知数据集/基准

面向大型户外工地的自动进度监测,现有2D变化检测缺少长时序、多视角且贴近真实施工复杂性的公开基准。iVISION-2DCD用无人机RGB/LiDAR采集的稠密点云合成照片级双时相图像,并通过新视角生成、像素覆盖优化和半自动语义标注产生变化标签,覆盖一年、50余次采集和3.23万平方米工地。基准测试显示现有2DCD方法在该数据集上仍面临明显挑战,结果可能主要来自更复杂、更长期的数据设定。

Current as Touch: Proprioceptive Contact Feedback for Compliant Dexterous Manipulation Figure 1
2026-07-07cs.RO

Current as Touch: Proprioceptive Contact Feedback for Compliant Dexterous Manipulation

Chenyang Ma, Yunchao Yao, Zhenyu Wei, Ruogu Li, Daniel Szafir, Mingyu Ding

University of North Carolina at Chapel Hill

2026-07-07机器人

论文针对低成本灵巧手缺少可靠触觉/力传感、纯位置控制易压坏或打滑的问题,提出把电机电流与关节状态作为本体接触反馈,不直接估计力或控扭矩,而预测可由PD控制器转化为合适抓取力的柔顺参考位置。实验证明该接口在杯子堆叠、擦板、取卡和动态持瓶等任务中提升遥操作安全性、接触调节与策略鲁棒性。

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning Figure 1
2026-07-07cs.RO

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning

Yanzhou Li, Guangli Chen, Xiao-Meng Li, Wenjian Zhong, Yongkang Lu, Shenghuang He

2026-07-07机器人强化学习规划控制

针对异构多机器人编队中 Ackermann 领航车动力学复杂、全端到端强化学习样本效率低且传统控制依赖精确模型的问题,论文提出分层物理先验深度强化学习框架:上层用 SAC 学习领航导航,下层将物理前馈、PD 控制与残差 DRL 结合,并用分层奖励强化高精度保持。实验报告导航与编队策略成功率均达 100%,消融验证各模块有效,但真实场景泛化与增益来源仍需更多说明。

ADP: Adversarial Dynamics Priors for Physically Grounded Humanoid Locomotion Figure 1
2026-07-07cs.RO

ADP: Adversarial Dynamics Priors for Physically Grounded Humanoid Locomotion

Seokju Lee, Jeongtae Lee, Jeonghyeok Lim, Jeonguk Kang, Byungwook Lee, Seungho Han, Keun Ha Choi, Dongil Park, Kyung-Soo Kim

2026-07-07机器人

针对人形机器人受推扰后仅靠运动学模仿难以约束动量、接触力与接触时序的问题,ADP用轨迹优化生成满足SRBD约束的动力学特征分布,并以对抗判别器作为奖励,使策略无需显式跟踪姿态也能回到物理合理轨迹。实验中相较AMP,80%成功冲量阈值提升16.7%,平均恢复时间和速度跟踪误差分别降低47.9%与35.4%。

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control Figure 1
2026-07-07cs.RO

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

Fudan University, Shanghai Innovation Institute, East China Normal University

2026-07-07视觉语言视觉感知规划控制

这篇论文针对长时程机器人操作中 VLA 依赖即时观测、难以处理非马尔可夫记忆与慢速推理的问题,提出 HiMe 分层具身记忆:由高频 Executor 执行动作、Sentry 异步捕捉关键状态变化、Planner 管理长期策略,并用跨模态语义图式及 Add/Update/Delete 机制维护动态知识。实验显示其在长任务成功率、计算效率上优于扁平记忆基线,并能按人类偏好自我修正内部记忆。

Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation Figure 1
2026-07-07cs.RO

Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation

Pengwei Zhang, Bin Xie, Ce Hao, Xinpan Meng, Xinyu Guo, Fang Deng, Long Cheng, Tiancai Wang

2026-07-07机器人

该文针对接触丰富操作中视觉主导的 VLA 难以利用稀疏触觉、易发生模态塌缩的问题,提出 ResTacVLA:用跨模态预测器将触觉表示为相对视觉先验的“残差/惊讶”,再经 VQ 形成潜在接触原语,并用不确定性门控在视觉不可靠阶段注入触觉。五个真实任务中最高成功率 86.7%,平均较基线提升 34.6%,且对动态扰动更稳健。

Closed-loop vs. Open-loop Kalman Filter Architectures in Airborne Aided Inertial Navigation Figure 1
2026-07-07cs.RO

Closed-loop vs. Open-loop Kalman Filter Architectures in Airborne Aided Inertial Navigation

Antonia Hager, Torleiv H. Bryne

2026-07-07机器人

这篇论文针对航空与机器人惯导中开环、闭环卡尔曼滤波架构选择缺少同基准量化比较的问题,在统一的15状态误差状态Kalman滤波和大地坐标惯导模型下比较两者。核心洞察是架构取舍依赖IMU等级与安全隔离需求:开环更适合高端IMU,可保持测量融合平滑和航向完整性;闭环则对低成本MEMS等传感器是防止长期发散的必要反馈机制。仿真还显示初始偏置、车辆动态会缩短开环稳定时间,而闭环反馈在导航级IMU上可能引入轻微偏置游走并损害航向精度。

U-Joint CAAMS: Experimental Evaluation of a Universal-Joint Continuum Manipulator for Aerial Manipulation Figure 1
2026-07-07cs.RO

U-Joint CAAMS: Experimental Evaluation of a Universal-Joint Continuum Manipulator for Aerial Manipulation

Anuraj Uthayasooriyan, Musab Alibrahim, Krishna Manaswi Digumarti, Fernando Vanegas, Felipe Gonzalez

2026-07-07机器人数据集/基准

这篇论文针对多旋翼下洗气流和任务载荷会放大连续体机械臂离面弯曲、扭转,从而降低空中操作末端姿态精度的问题,提出弹簧增强万向节与管状骨架/内置导管结合的 U-Joint CAAMS。相比既有 NiTi 骨架设计,台架实验显示其在静风和峰值下洗下均更抗变形,峰值下洗时偏航、y 轴和滚转平均误差分别降低约 2.5–4 倍、2–45 倍和最高 5 倍,并通过悬停扰动测试及取水、喷洒、搬运任务验证可用性。

Invisible Strings: Deriving Puppetry Principles and their Hidden Connections to Robot Behavior Design Figure 1
2026-07-07cs.RO

Invisible Strings: Deriving Puppetry Principles and their Hidden Connections to Robot Behavior Design

Claire Lewis, Sawyer Collins, Alyssa Hanson, Johanna Smith, Tom Williams

Colorado School of Mines, California Sate University San Bernadino, Colorado School of Mines Golden Colorado USA, California Sate University San Bernadino San Bernadino California USA

2026-07-07机器人

论文针对动画、舞蹈、戏剧原则在机器人非语言行为设计中受物理约束、形态差异和抽象层级限制的问题,引入木偶戏作为更接近具身机器人的艺术参照。作者从木偶文本与专业木偶师焦点讨论中提炼出8条原则,覆盖呼吸、注视、动作与形态/互动设计,并将其转译为机器人行为设计指南,结果显示这些原则可补足既有艺术方法对物理具身、非人形机器人设计支持不足的空白。

GDPR-Aware Trajectory Sharing for ISAC-Assisted Robot Navigation: A Case Study on FID-Constrained Collision Prediction Figure 1
2026-07-07cs.RO

GDPR-Aware Trajectory Sharing for ISAC-Assisted Robot Navigation: A Case Study on FID-Constrained Collision Prediction

Zexin Fang, Bin Han, Donglin Wang, Fengchen Pei, Hans D. Schotten

2026-07-07机器人规划控制

这篇论文关注 ISAC 辅助机器人导航中轨迹共享带来的 GDPR 数据最小化问题:机器人需要足够轨迹预测碰撞,却不应暴露可重构的个人运动历史。核心做法是按 Fisher 信息密度对高信息轨迹段施加更强扰动,而非统一加噪。基于真实行人轨迹的实验显示,在相同漏检冲突率下,该方法比固定误差扰动具有更低重构泄漏和更短持续暴露长度。

Strouhal-Aware Model Predictive Control for Efficient Multi-Fin Flapping Locomotion Figure 1
2026-07-07cs.RO

Strouhal-Aware Model Predictive Control for Efficient Multi-Fin Flapping Locomotion

Yuya Hamamatsu, Zixi Chen, Maarja Kruusmaa, Asko Ristolainen

2026-07-07机器人规划控制

面向多鳍水下机器人拍动推进中效率与机动性难兼顾的问题,论文把生物流体中的 Strouhal 最优区间显式写入 MPC 代价,并用采样搜索加梯度优化求解非凸控制。池内与外场实验显示,各鳍可维持在 0.25–0.35 区间并跟踪力指令,0.1–0.3 m/s 巡航机械功耗降低 8.8%–32%,且达到基线无法实现的 0.4 m/s。

Derivations of Error-State Kalman Filter Kinematics for Globally Applicable Aided Inertial Navigation Systems Figure 1
2026-07-07cs.RO

Derivations of Error-State Kalman Filter Kinematics for Globally Applicable Aided Inertial Navigation Systems

Antonia Hager, Torleiv H. Bryne

⋆ Department of Engineering Cybernetics, Norwegian University of Science and Technology

2026-07-07机器人

面向跨大范围、长航时机器人/飞行器导航中地球曲率、自转与重力变化不可忽略的问题,本文系统推导并对照四类全局适用的辅助惯性导航 ESKF:测地/NED 经典形式、ECEF 左/右不变形式及混合形式。核心洞察是误差定义与坐标系会直接影响误差传播的轨迹依赖和数值条件;文中给出连续时间动力学、系统矩阵、位置量测雅可比,并指出右不变 ECEF 形式可能因绝对位置项导致病态,可用锚点表示缓解。

Fast 3D Foundation Model Initialized Gaussian Splatting Figure 1
2026-07-07cs.CV

Fast 3D Foundation Model Initialized Gaussian Splatting

Anurag Dalal, Daniel Hagen, Kjell G. Robbersmyr, Kristian Muri Knausgård

2026-07-07三维

针对传统3DGS依赖COLMAP/SfM导致耗时、低纹理或少视角场景不稳的问题,本文用VGGT-X等3D基础模型初始化相机位姿、深度和点云,再结合3R-GS式位姿—高斯联合优化、MLP位姿细化与深度引导损失。实验在Mip-NeRF 360、Tanks and Temples和RobustNeRF上约3分钟完成训练,达到23.61 dB PSNR、0.19 LPIPS和0.016 m ATE,但高畸变广角相机下位姿估计仍会失效。

Layout-independent actuation allocator for fin-actuated marine robots Figure 1
2026-07-07cs.RO

Layout-independent actuation allocator for fin-actuated marine robots

Yuya Hamamatsu, Maarja Kruusmaa, Asko Ristolainen

Department of Computer Systems, Tallinn University of Technology, Tallinn, Estonia

2026-07-07机器人

针对鳍驱动海洋机器人在鳍数量、位置或故障变化后需重新设计控制分配器的问题,论文将执行器布局表示为图,结合GNN、Transformer、MDN和可微物理代理,从多模态候选命令中细化低能耗分配。仿真显示单一模型可零样本适配训练外布局,真实水池与失效实验中性能接近专用布局控制器,但文中也指出sim-to-real振荡和约80ms推理开销仍限制高速控制。

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning Figure 1
2026-07-07cs.RO

AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning

Qi Liu, Yabei Li, Hongsong Wang, Heng Zhang, Lei He

School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China, State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing 100084, China, School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, Meituan Inc.

2026-07-07视觉语言视觉感知规划控制

AnchorVLA针对自动驾驶VLA规划中语言高层决策与连续轨迹执行脱节的问题,将动作从低信息密度的坐标 token 提升为表示完整局部运动模式的轨迹锚点。其DAAR用锚点承载行为级决策,DARF在对应残差空间生成连续、多模态细化轨迹,从而兼顾语义对齐与执行灵活性。在Bench2Drive闭环测试中,方法取得77.28的Success Rate和89.92的Driving Score。

Beyond Point-Attached Semantics: Object-Centric Semantic Fields for Generalizable Manipulation Figure 1
2026-07-07cs.RO

Beyond Point-Attached Semantics: Object-Centric Semantic Fields for Generalizable Manipulation

Zheng Sun, Lerong Zhang, Zhihao Li, Zhuo Li, Quentin Rouxel, Fei Chen

Department of Mechanical of Automation Engineering, The Chinese University of Hong Kong

2026-07-07机器人

这篇论文针对机器人跨实例操作中点云采样随视角和物体形状变化、功能部件语义不稳定的问题,提出将物体点云作为条件、在显式3D查询位置读取语义嵌入的对象中心连续语义场,而不是把语义附着在观测点上。该场用部件标注模型训练后冻结,为策略生成可重采样的语义点云;在RoboTwin仿真和真实双臂任务中,相比原始点云、2D特征提升和逐点3D语义基线表现更好。

Hope for the Best, Prepare for the Worst: Occlusion-Aware Contingency Planning for Autonomous Vehicles Figure 1
2026-07-07cs.RO

Hope for the Best, Prepare for the Worst: Occlusion-Aware Contingency Planning for Autonomous Vehicles

Truls Nyberg, Anna Gautier, Jana Tumova

2026-07-07规划控制

论文针对城市自动驾驶中由公交、货车等遮挡导致的“隐身”交通参与者风险,提出将遮挡状态可达性分析、面向安全过滤器的规划与应急树搜索结合的轨迹规划框架;其关键洞察是同时规划最可能情形与最坏情形,并利用未来观测及“未观测到目标”来降低保守性。仿真遮挡场景显示,该方法能更主动地保证避碰并提升通行效率,但实验规模较有限。

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations Figure 1
2026-07-07cs.RO

Exp2VLA: Enabling Vision-Language-Action for Drone Navigation from Expert Demonstrations

Van Huyen Dang, Kabilesh Rajendran, Erdi Sayar, Erdal Kayacan

2026-07-07机器人视觉语言视觉感知模仿学习

针对无人机VLA落地受限于大模型算力开销和航拍专家数据稀缺,Exp2VLA将强化学习、遥操作等专家策略在仿真中生成的轨迹转成LeRobot数据,用于微调紧凑/中等规模VLA,实现语言条件导航。π0.5版本在单目标达84.1%,多目标平均65.0%,未见颜色-形状组合零样本平均51.7%;SmolVLA显著退化,说明性能可能主要来自视觉语义容量与专家数据蒸馏。

Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization Figure 1
2026-07-07cs.LG

Sample-Efficient Pareto Front Modeling for Energy-Aware Reinforcement Learning Using Bayesian Optimization

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

2026-07-07强化学习优化算法

这篇论文针对工业强化学习中性能与能耗权重依赖人工调参、训练代价高且易漏掉帕累托折中的问题,把奖励权重选择建模为多目标贝叶斯优化,用 qEHVI 主动选择最有信息量的权重评估。在 Quanser Aero 2 单自由度俯仰控制实验中,MOBO 在 11 次评估预算下相较均匀网格获得更高超体积和相近或更好的覆盖度,并在约 4 次试验达到网格最终超体积,显示其优势主要来自减少冗余采样、提升样本效率。

Anticipatory Reinforcement Learning for Trajectory Tracking Figure 1
2026-07-07cs.LG

Anticipatory Reinforcement Learning for Trajectory Tracking

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

2026-07-07视觉感知强化学习规划控制

本文针对工业轨迹跟踪中常规深度强化学习只看当前误差而导致滞后和超调的问题,将目标速度与未来参考点并入 PPO 状态,使策略具备类似 MPC 的预见性但保持轻量推理。在 1-DoF 直升机 S 曲线跟踪仿真中,误差由 2.73°降至 0.31°;但实机零样本迁移存在 sim-to-real gap,单个 1 秒前瞻点即可达到与复杂配置相同的 1.11°,说明过密预测信息未必利于物理迁移。

Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System Figure 1
2026-07-07cs.LG

Integrating Physics-Informed Neural Networks for Safe Reinforcement Learning in a 1-DoF Helicopter System

Georg Schäfer, Jakob Rehrl, Stefan Huber

2026-07-07强化学习安全鲁棒

面向工业机电系统中强化学习探索可能越过硬件安全边界的问题,本文将可微物理模型嵌入 PPO actor 损失,用短时 RK4 前瞻轨迹对预计俯仰越界施加独立安全惩罚,减少对复杂 reward shaping 的依赖。在 1-DoF Quanser Aero 仿真中,平衡权重相比基线显著降低 30° 约束违规,同时仍能较好跟踪 40° 目标;过强惩罚则带来跟踪迟缓,真实硬件验证尚未完成。

LOTUSim: Multi-Domain Simulator for Marine Robotics Figure 1
2026-07-07cs.MA

LOTUSim: Multi-Domain Simulator for Marine Robotics

Cédric Buche (CROSSING, IMT Atlantique), Juliette Grosset (CROSSING), Hélène Lechêne, Marie Dubromel (CROSSING), Pierig Havez-Bodivit, Malcom Neo, Julien Prodhon

2026-07-07机器人

针对海洋机器人真实测试昂贵且危险、现有仿真器偏重自主算法而缺少人在环协同与真实海流的问题,LOTUSim构建了开源实时多域仿真平台,覆盖空中、水面和水下机器人,并支持多用户沉浸交互。其关键创新是分布式大规模异构集群仿真和受Ekman启发的分层水下流场模型;验证显示系统在大群规模下仍保持实时与高视觉质量,海流精度也优于Gauss–Markov基线。

DRBA: Dynamic Robotic Balance Assistant -- An assist-as-needed gait and balance rehabilitation robot for versatile training Figure 1
2026-07-07cs.RO

DRBA: Dynamic Robotic Balance Assistant -- An assist-as-needed gait and balance rehabilitation robot for versatile training

Yifan Wang, Li Li, Youlong Wang, Chengyuan Yang, Sherwin Stephen Chan, Jiaye Chen, Xiaoyue Yan, Hao Wang, Xuesheng Gong, Jun Lin, Hongping Hu, Wei Tech Ang

Nanyang Technological University, 639798 Singapore

2026-07-07机器人

针对老年和神经/肌骨疾病患者平衡能力下降、现有地面步态训练机器人在体积、透明性与适应性间难以兼顾的问题,论文提出 DRBA:以低惯量 3DoF 骨盆支撑臂、坐站辅助、跟随与跌倒干预实现按需减重和平衡支持。实验显示其对自然步态干扰较小;9 名不同平衡障碍老人试验中,相比治疗师辅助可提高步长和步速,并支持完成原本难以独立进行的训练任务,但长期康复增益仍文中未充分说明。

Beyond Heuristics: A Standardized Real2Sim Pipeline for Physical Human Robot Interaction in Human-in-the-Loop Simulation Figure 1
2026-07-07cs.RO

Beyond Heuristics: A Standardized Real2Sim Pipeline for Physical Human Robot Interaction in Human-in-the-Loop Simulation

Chengyuan Yang, Yifan Wang, Chun Kwang Tan, Sherwin Stephen Chan, Youlong Wang, Xiaoyue Yan, Lei Li, Wei Tech Ang

2026-07-07机器人

针对助行机器人实机测试成本高且有安全风险、HITL 仿真中人机耦合阻抗常靠经验调参的问题,论文提出从真实运动数据标定 pelvis–strap 6DoF 黏弹模型的 Real2Sim 流程,并用“安全且舒适”束带紧度定义可复现操作点。5 名受试者数据用于区分可共享与个体化参数,未见受试者仅需细调 5/12 个参数;校准模型比过软/过硬基线更能复现实交互包络并诱发更合理步态适应。

Function-Space Diffusion for Motion Planning Figure 1
2026-07-07cs.RO

Function-Space Diffusion for Motion Planning

Zinuo Chang, Yipu Chen, Byoungwoo Park, Hongzhe Yu, Yongxin Chen

2026-07-07生成模型规划控制

针对扩散式运动规划器依赖固定路点长度、难以跨离散分辨率泛化的问题,论文将轨迹视为连续函数,在函数空间中进行扩散;其关键设计是谱域逐模态加噪与保持起终点约束的 DST-FNO 反向网络。实验在 2D 点机器人和 7-DoF Franka 上显示,FSD-MP 在训练分辨率下性能相当,并可零样本生成最高 16× 分辨率轨迹且保持相近解模态。

Longitudinal-Motion-Aware Lateral Control for Autonomous Vehicles: A Robust Nonlinear Control Framework Figure 1
2026-07-07cs.RO

Longitudinal-Motion-Aware Lateral Control for Autonomous Vehicles: A Robust Nonlinear Control Framework

Sixu Li, Nitesh Kumar, Reyshwanth Ganeshan, Sivakumar Rathinam, Swaroop Darbha, Yang Zhou

2026-07-07规划控制安全鲁棒

论文针对自动驾驶横向控制常假设恒定车速、且忽略车辆参数不确定的问题,重新建立显式含纵向速度与加速度的跟踪误差模型,并用反馈线性化把纵向运动嵌入控制律,同时分析内部动态稳定性;在此基础上提出LR与INDI两种鲁棒化方案。仿真显示其在变速和参数失配下跟踪更稳健,实车实验验证了实时路径跟踪可行性。

Continuous-Time Gaussian Belief Trees for Motion Planning Figure 1
2026-07-07cs.RO

Continuous-Time Gaussian Belief Trees for Motion Planning

Rayan Mazouz, Qi Heng Ho, Zachary N. Sunberg, Morteza Lahijanian

2026-07-07规划控制三维

这篇论文针对机器人真实系统连续演化、传感器离散到达时,离散时间信念规划可能漏检采样间碰撞的问题,提出连续时间 Gaussian Belief Tree:用ODE传播信念协方差并在测量时做Kalman跳变更新,同时用信念障碍函数做整段概率安全验证,并纳入控制机会约束。实验将其接入RRT/SST,在多类基准尤其窄通道中比离散GBT有更高成功率并更稳定满足机会约束。

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras Figure 1
2026-07-07cs.CV

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

Juwei Shen, Yujie Wu, Changwen Chen

Department of Computing, FCMS, The Hong Kong Polytechnic University, at quadratic cost, restricting scalability for high-frequency, dependencies, achieving scalable and stable 3D tracking

2026-07-07视觉感知三维

面向高速运动、弱光和低延迟机器人感知中事件流稀疏异步、长程依赖难建模的问题,E-TraMamba将Mamba线性状态空间模型引入事件相机3D特征跟踪,并结合仿射运动预测、多尺度事件/相关/位置融合及EvD-PointOdyssey数据集。实验显示其在严格0.1m阈值下特征寿命超过2倍提升,跟踪比例更高、RMSE更低。

DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning Figure 1
2026-07-07cs.RO

DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning

Hanchen Cui, Sergio Arnaud, Arjun Majumdar, Daniel Dugas, Elie Aljalbout, Karthik Desingh, Krishna Murthy Jatavallabhula, Franziska Meier

Krishna Murthy Jatavallabhula 1†, University of Minnesota Twin Cities

2026-07-07强化学习

DreamSteer针对预训练VLA在部署时遇到未见物体和环境分布偏移时易失败、指令遵循不稳定的问题,提出无需微调的测试时 steering:从冻结VLA和少量运动原语采样动作块,用动作条件潜在世界模型想象后果,再由语言条件价值模型排序执行。真实机器人实验中,相比π0基线,OOD操作成功率由23.75%升至66.25%,指令遵循率由38.75%升至56.25%。

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation Figure 1
2026-07-07cs.RO

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

Jin Yang, Ping Wei, Nanning Zheng

National Key Laboratory of Human-Machine Hybrid

2026-07-07机器人

多视角机器人操作虽比体素方法更高效,但冗余视角、遮挡和背景噪声易造成注意力漂移。论文借鉴差分放大器提出 AmpAttention,通过区分差分信号与共模噪声并加入 CMRR 约束,在视图内和视图间提取高信噪比任务线索。基于此的 RVAF 在 18 个 RLBench 任务上取得更高平均成功率且训练时间减少约 33%,RVAF++ 结合 SAM2 后在 insert peg 等高精度任务上提升到 91%。

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving Figure 1
2026-07-07cs.RO

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

2026-07-07强化学习

CLEAR针对VLA自动驾驶主要依赖模仿学习、开环训练与闭环执行分布不一致的问题,先用专家轨迹预训练,再在CARLA中用PPO学习围绕预训练航点先验的残差策略,并通过仿真器与学习器异构分离扩大并行环境。文中报告其在CARLA longest6 v2、Bench2Drive等基准上超过既有方法,但增益可能主要来自闭环RL与scaling共同作用。

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training Figure 1
2026-07-07cs.RO

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Sun Yat-sen University, Beihang University

2026-07-07强化学习

TACO针对VLA在擦拭、拧盖等接触密集任务中“看起来对但力觉已偏”的局部失效,提出用触觉世界模型自动生成纠错监督:先识别失败邻近状态,再想象视触觉纠正片段并标注可执行动作,结合知识隔离触觉适配与优势条件训练,避免破坏原有视觉语言先验。真实机器人六项任务中,平均成功率较基线绝对提升44%,较无知识隔离版本提升32%。

Metallic Ultrasound Waveguides as a Distributed Tactile Sensing Platform for Contact Localization, Force Estimation, and Material Class Discrimination Figure 1
2026-07-07cs.RO

Metallic Ultrasound Waveguides as a Distributed Tactile Sensing Platform for Contact Localization, Force Estimation, and Material Class Discrimination

Alexandros Rosakis, Alessio Tamborini, Basile Fakhoury, Cole Bailey, Morteza Gharib

2026-07-07机器人

面向机器人触觉中“覆盖面积越大、布线与阵列越复杂”的矛盾,论文提出用金属超声波导和单个近端换能器实现分布式接触感知。核心洞察是接触会同时改变反射、透射与能量泄漏,R/T 可线性估计力,而与载荷近似无关的能量分配又携带材料信息。实验在钢丝与金属片上验证了定位、单点和双点力估计,以及九类材料区分,双接触力估计与负载传感器高度一致。

MorphQuad: Morphable Quadrotor for Superhuman Maneuverability, Manipulation, and Resiliency Figure 1
2026-07-07cs.RO

MorphQuad: Morphable Quadrotor for Superhuman Maneuverability, Manipulation, and Resiliency

J. Diaz Peon Gonzalez Pacheco, J. Xu, A. Zhao, H. Zhou, A. Navsalkar, A. Scheffer, A. Malli Reddi, S. Shankar, Y. Bao, V. Tzoumas

Aerospace Engineering, University of Michigan.

2026-07-07机器人

面向基础设施巡检、接触作业和应急场景中“像飞行机械手一样”在任意姿态运动、施力并抗扰的需求,论文提出 MorphQuad:在紧凑四旋翼上为四个旋翼各加入独立双轴云台,并配合 SE(3) 几何控制、L1 自适应抗扰和能量优化推力分配,使最大推力可朝任意方向输出。实机在全机载自主条件下完成绕管多圈旋转、阀门转动、栖停按压、推物,以及多方向强风和推拉扰动恢复。

A Spiking Sequence Generator for Polar Trajectories on Neuromorphic Hardware Figure 1
2026-07-07cs.NE

A Spiking Sequence Generator for Polar Trajectories on Neuromorphic Hardware

William R.P. Nourse, Roger D. Quinn

Mechanical & Aerospace Engineering, Case Western Reserve University, Cleveland, OH, USA, Mechanical & Aerospace Engineering, West Virginia University, Morgantown, WV, USA, networks, and networks should be capable of utilizing these dynamics while allowing controllable, circuit, we abstract these observations into a design principle: low-dimensional, controllable neural

2026-07-07机器人

面向受尺寸、重量和功耗约束的机器人控制,论文试图在黑箱端到端 SNN 与传统控制器转换之间取得折中:用 WTA 脉冲网络及辅助种群生成可解释的极坐标轨迹,并通过分流抑制分别调节方向、速度和半径。其在 SpiNNaker2 上实现后,仿真步时间较 CPU/GPU 降低约 2–3 个数量级、能耗降低约 3–4 个数量级,但短仿真的初始化与接口开销仍是主要限制。

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots Figure 1
2026-07-07cs.RO

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

CoLab, Beihang University

2026-07-07机器人

本文针对机器人策略训练框架已较成熟、但真实机器人部署仍依赖零散脚本的问题,提出 EVA-Client 作为统一客户端,将机器人接入、实时推理调度、调试、数据采集与物理评测串成闭环。其核心是解耦信号源、机器人后端、传输中间件和推理策略,并统一同步/异步、时间集成和 Real-Time Chunking 等执行方式;结果是多类机械臂与外部训练框架可在同一流程中复现实机部署、记录评测并回流为可训练数据,但具体性能增益幅度文中未充分说明。

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation Figure 1
2026-07-07cs.RO

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

Tsinghua University

2026-07-07机器人强化学习数据集/基准

机器人策略评估依赖真实硬件 rollout,成本高且难扩展;本文把世界模型作为策略评估器系统化研究,提出含真实遥操作与策略执行配对数据的 WMBench,比较 7 类视频世界模型、4 种动作表示和 32.4 万次模拟 rollout。核心洞察是评估可靠性更多取决于长时域动作一致性、数据配比和记忆/动作编码等设计,而非短期视觉真实感;据此构建的 GigaWorld-1 在评估对齐指标上较强基线提升 14.9%。

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation Figure 1
2026-07-07cs.CV

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

Chongkei Chang, Zhidong Deng

2026-07-07机器人强化学习

本文针对现有 VLA 多面向静态或自运动场景、难以拦截独立运动目标的问题,提出冻结基座 VLA、以其动作块作为语义条件的 DynaWM,用多视角历史和本体状态补足运动趋势,再由 flow-matching DiT 重生成动作。在 DynaGrasp-32/1600 上,覆盖四类基座与粗/精调检查点,平均成功率均提升,增益约 1.88%–45.31%,但真实场景泛化仍文中未充分说明。

Learning 3D Affordances for Blade Insertion in Cluttered Stowing Figure 1
2026-07-07cs.CV

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

2026-07-07三维

论文针对仓储机器人在杂乱软箱中插入刮板时,需判断工具可安全占据哪些三维自由空间的问题,指出将可供性建模为 SE(3) 姿态分布会在单模态生产数据上丢失几何多解结构。其核心做法是用 3D 占据场和掩码自编码器直接重建刮板占据空间,再后处理为姿态,并蒸馏到 RGB 快速推理。在 1 万真实仓储周期上,VulcanVoxel 的 top-5 覆盖率达 0.89,高于最佳姿态基线 0.71,RGB 学生模型约 30ms 推理。

Direct Time-of-Flight Measurement Accuracy Improvement With Perimeter-Gated SPADs Figure 1
2026-07-07cs.CV

Direct Time-of-Flight Measurement Accuracy Improvement With Perimeter-Gated SPADs

Md Sakibur Sajal, Hunter Guthrie, Zexi Liu, Marc Dandin

Department of Electrical and Computer Engineering, Carnegie Mellon University

2026-07-07机器人

该文面向机器人/三维感知中直接飞行时间测距受系统、TDC 与 SPAD 暗噪声抖动影响的问题,提出用周边栅控 SPAD 动态压低边缘暗载流子产生,并建立分层抖动估计框架结合片上计数式 TDC 实测验证。0.35 μm CMOS pg-SPAD 实验显示,在自由运行和时间门控模式下均可降低 SPAD 相关测量不确定性、提升直方图峰值与测距精度。

2026-07-03

47 篇
VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation Figure 1
2026-07-03cs.RO

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

SKL-MAIS, Institute of Automation, Chinese Academy of Sciences, School of Artificial Intelligence, University of Chinese Academy of Sciences, National University of Singapore, Fudan University

2026-07-03机器人强化学习

这篇论文针对接触丰富操作中视觉难以观测形变、滑移和摩擦,而触觉信号又短暂稀疏、易被视觉主导的问题,提出 VT-WAM 将未来视觉、触觉形变与动作预测统一到流匹配式 World Action Model 中,并用非对称 MoT 注意力和接触门控 AVTAG 强化接触阶段的触觉利用。在六个真实擦拭、剥皮和插入任务上,平均成功率达 71.67%,较 Fast-WAM 高 26.67 个百分点,消融显示触觉动态建模和接触期注意力引导均有贡献。

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots Figure 1
2026-07-03cs.RO

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Ling Xu, Chuyu Han, Borui Li, Hao Wu, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

Southeast University, Nanjing University, Institute for AI Industry Research (AIR), Tsinghua University

2026-07-03机器人

这篇论文针对具身模型落地时被 Python 栈、后端假设和机器人胶水代码割裂的问题,提出 C++ 推理运行时 Embodied.cpp,将 VLA 与 WAM 的共通执行路径抽象为输入适配、序列构建、骨干执行、头插件和部署适配五层,并支持多速率闭环与异构后端。实验中 HY-VLA 和 pi0.5 闭环成功率分别为 100.0% 和 91.0%,WAM Transformer 块内存从 312.2 MiB 降至 88.1 MiB。

Controllable Sim Agents with Behavior Latents Figure 1
2026-07-03cs.RO

Controllable Sim Agents with Behavior Latents

Juanwu Lu, Junyu Zhu, Ziran Wang

Purdue University, University of Tokyo

2026-07-03规划控制

面向自动驾驶仿真中“既逼真又可控”的需求,论文提出 CNeVA:用每个智能体的分通道折扣回报闭式推断高斯行为潜变量,并以混合通道掩码训练流式轨迹生成器,实现对安全、地图合规、速度和加速度等轴的条件控制。在 Waymo Open Motion 上,方法保持有竞争力的真实感,同时展示速度/加速度单调可控;软 eligibility 提升安全可控性,但作者也指出地图控制具坐标依赖,控制指标需结合物理合理性防止 reward hacking。

QuadRocket: An Aerial Robotic Testbed for Adaptive Thrust-Vector Control of Rocket-Like Vehicles Figure 1
2026-07-03cs.RO

QuadRocket: An Aerial Robotic Testbed for Adaptive Thrust-Vector Control of Rocket-Like Vehicles

Pedro Santos, Joel Reis, Paulo Oliveira, Carlos Silvestre

Faculty of Science and Technology, University of Macau

2026-07-03机器人规划控制

针对火箭类推力矢量控制验证成本高、风险大的问题,本文将四旋翼与万向节连接的圆柱体构造成可飞行倒立摆,把四旋翼视为推力矢量执行器,并用二球面降维姿态、自适应反步与动态面控制处理欠驱动、扰动和执行动态。仿真与室内动捕实验显示其能较准确跟踪轨迹并补偿常值扰动,证明该平台适合作为低成本控制验证试验台。

Learning Agile Intruder Interception using Differentiable Quadrotor Dynamics Figure 1
2026-07-03cs.RO

Learning Agile Intruder Interception using Differentiable Quadrotor Dynamics

Michael Anoruo, Xiaoyu Tian, Abhishek Rathod, Timothy Naudet, Thomas Canchola, Eric Sturzinger, Kshitij Goel, Wennie Tabib

† Carnegie Mellon University, § Artificial Intelligence Integration Center

2026-07-03机器人

针对反无人机拦截中被动单目视觉难以获得目标距离或相对位置的问题,论文将输入限制为入侵者三维方向单位向量与拦截机自身状态,并用可微四旋翼动力学和解析策略梯度端到端训练RNN控制策略。仿真显示,该方法可在入侵者最高10 m/s的敏捷三维轨迹下完成碰撞拦截,相比使用简化质点动力学的基线平均拦截率提升约30%,但硬件验证、感知噪声和对抗逃逸仍未充分覆盖。

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs Figure 1
2026-07-03cs.RO

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

Fudan University, Shanghai Innovation Institute

2026-07-03机器人

这篇论文针对 VLA 依赖昂贵专家示范、难以规模化的问题,提出先学“如何运动”再学“做什么”的分解视角:用无语言标注的离任务轨迹和机器人随机探索,通过逆动力学自监督预训练获得运动先验,再用少量专家数据做语言对齐。实验显示 TAP 在 SIMPLER 上较行为克隆提升约 10 个百分点,并可接近使用百万级专家轨迹的模型;真实 WidowX 上在相机扰动下仍保留 15–25% 成功率,而部分大规模基线降为 0%。

WorldSample: Closed-loop Real-robot RL with World Modelling Figure 1
2026-07-03cs.RO

WorldSample: Closed-loop Real-robot RL with World Modelling

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, Department of Electronic Engineering, Tsinghua University, Beijing, China, School of Automation, Central South University, Changsha, China, School of Automation, Beijing University of Posts and Telecommunications, Beijing, China

2026-07-03机器人强化学习

针对真实机器人强化学习中物理交互昂贵、单次 rollout 只覆盖一条结果路径的问题,WorldSample 用真实轨迹持续校准动作条件世界模型,再生成受物理数据锚定的反事实合成轨迹,并通过 Policy-Paced Learning 按 Q 值与不确定性筛选、调度合成样本以抑制幻觉噪声和价值高估。在接触丰富与精密装配任务中,方法相对基线将成功率提高 28%,训练步数减少 59%,世界模型视觉保真度也显著提升。

LIME: Learning Intent-aware Camera Motion from Egocentric Video Figure 1
2026-07-03cs.RO

LIME: Learning Intent-aware Camera Motion from Egocentric Video

Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum

University of Bonn

2026-07-03视觉感知

这篇论文瞄准机器人在执行前常需先“看得更有用”的问题,将相机运动从导航或操作的附属动作中独立出来,建模为由当前图像和自由语言意图条件化的相对 SE(3) 视角生成。核心做法是从第一视角视频中挖掘意图、预期观察增益和相机位姿监督,并用 VLM 结合自回归观察增益预测与 flow-matching 位姿头表达多解视角。实验显示,LIME 在目标接近、探索、视角切换及真实 Spot 机器人下游任务中优于多类基线。

ACID: Action Consistency via Inverse Dynamics for Planning with World Models Figure 1
2026-07-03cs.RO

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

Gawon Seo, Dongwon Kim, Suha Kwak

2026-07-03强化学习规划控制

本文针对动作条件世界模型在决策时规划中只看终点接近目标、忽略中间转移是否可由动作真实实现的问题,提出 ACID:用逆动力学模型反推每步预测转移对应的动作,并将其与原条件动作的残差作为循环动作一致性代价加入规划。该方法不改动世界模型,可作为测试时验证器使用;在四类世界模型和六个机器人/导航任务上均提升规划效果,并以更少规划计算达到基线相近准确率。

HEFT: Heavy-Payload Full-size Humanoid Teleoperation with Privileged Motion Guidance and Windowed Payload Curriculum Figure 1
2026-07-03cs.RO

HEFT: Heavy-Payload Full-size Humanoid Teleoperation with Privileged Motion Guidance and Windowed Payload Curriculum

Chenxin Liu, Qingzhou Lu, Guangxiao Yang, Xuanyang Shi, Chenghan Yang, Yanjiang Guo, Jianyu Chen

Tsinghua University, Shanghai Qizhi Institute

2026-07-03机器人

HEFT针对全尺寸人形机器人在真实重载遥操作中易受VR噪声、漂移和负载扰动影响的问题,提出训练期特权运动指导,用离线重建动作约束但部署时仍用原始VR输入,并用按运动窗口标注可承载上限的负载课程学习。系统在175cm、65kg的L7上验证,单一策略可完成转身、前后行走和下蹲等动作,真实双手负载最高达24kg。

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection Figure 1
2026-07-03cs.RO

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

2026-07-03学习理论

这篇论文针对VLA在相机姿态或物体布局轻微变化下易失效的问题,指出根因不只是视角数量不足,而是模型会学习相机、机器人和物体之间的伪相关。作者用双臂系统让一只手臂充当动态环境相机,比较固定、多固定与连续移动视角,并提出混合动态采集:用多固定视角保证训练稳定,用移动视角打破耦合。实验显示该策略在未见相机位姿和物体配置上优于单纯增加静态视角,且对ACT、Diffusion、Pi0、Gr00t等模型均有增益。

Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation Figure 1
2026-07-03cs.RO

Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation

Andrei-Marian Ungureanu, Stelian Spînu

A. M. UNGUREANU is with the Military Technical Academy “Ferdinand, S. SPÎNU is with the Military Technical Academy “Ferdinand I”, AI models and tangible applications, offering a scalable, publicly available at the following GitHub repository:, keeping the person centered within the video frame, even as, center of the image. As shown in Fig. 1, when the detected, face is outside the center zone, this positional offset is used, Figure 1. Face outside the center zone

2026-07-03机器人视觉感知

这篇论文面向低成本无人机在室内、GPS 受限等场景中难以实时完成感知与自主控制的问题,基于 DJI Tello 构建模块化视觉智能系统,将 YuNet 人脸检测、FaceNet 识别、单目深度估计与 PID 控制、网页监控界面集成起来。主要价值在于用轻量模型和开源架构串联跟随、扫描、循线导航等功能;实验展示了真实条件下可运行的人物跟踪、室内扫描和虚拟传感器循线,但定量对比与性能增益来源文中未充分说明。

NEUROSYMLAND: Neuro-Symbolic Landing-Site Assessment for Robust and Edge-Deployable UAV Autonomy Figure 1
2026-07-03cs.RO

NEUROSYMLAND: Neuro-Symbolic Landing-Site Assessment for Robust and Edge-Deployable UAV Autonomy

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

∗ Equal contribution. † Corresponding author. 1 School of Computing, Macquarie University, Sydney, NSW, Australia.

2026-07-03安全鲁棒

这篇论文针对无人机在非结构化环境中安全着陆时,纯视觉学习方法易受地形变化影响且决策不透明的问题,提出 NeuroSymLand:先由轻量感知构建带不确定性的语义场景图,再用显式 Scallop 符号规则评估平坦度、障碍距离和空间一致性,且运行时不依赖 LLM。实验中其在 72 个仿真场景完成 61 次成功评估,优于 4 个基线的 37–57 次;100 次硬件在环测试显示推理开销较小,主要成本来自感知与场景图构建。

CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation Figure 1
2026-07-03cs.RO

CoFL-S: Spatially Queryable Sector Flow Fields for Local Language-Conditioned Navigation

Haokun Liu, Zhaoqi Ma, Yicheng Chen, Wentao Zhang, Masaki Kitagawa, Zicen Xiong, Jinjie Li, Moju Zhao

Dragon Lab, Department of Mechanical Engineering, The University of Tokyo

2026-07-03机器人生成模型

这篇论文针对 VLN 中高层语言理解进展较快、低层动作接口却常被离散动作或短轨迹掩盖的问题,提出 CoFL-S:从第一视角 RGB-D 与局部子指令预测可空间查询的扇区流场,并通过场 rollout 生成连续控制。作者将 VLN-CE 转成帧级子指令、轨迹与稠密流场监督,并构建连续时间 Habitat 评测;在匹配编码器和控制器下,CoFL-S 在不同规划频率中优于 action-token/action-chunk,且零样本实机闭环也更稳。

Actuator Reality Shaping for Zero-Shot Sim-to-Real Robot Learning Figure 1
2026-07-03cs.RO

Actuator Reality Shaping for Zero-Shot Sim-to-Real Robot Learning

Satoshi Yamamori, Koji Ishihara, Kentaro Minamikawa, Kiyoharu Ohomori, Taiyo Yazaki, Norikazu Sugimoto, Jun Morimoto

Graduate School of Informatics, Kyoto University, Kyoto, Japan, Dept. of Brain Robot Interface, Computational Neuroscience Labs, ATR, Kyoto, Japan

2026-07-03机器人

这篇论文针对机器人强化学习中执行器非线性导致的 sim-to-real 落差,提出不再让仿真拟合硬件,而是在每个关节用二自由度前馈-反馈驱动器把真实执行器塑形成仿真的二阶参考模型。实验显示,该接口在单关节负载、7 自由度机械臂到达任务中降低跟踪误差并优于常规伺服、PID 和 ASAP 基线,还展示了轮腿机器人爬坡与人形行走的零样本迁移;但对强非线性硬件和低减速比关节的适用性文中仍未充分说明。

Bridge-WA: Predicting Where and How the World Changes for Robotic Action Figure 1
2026-07-03cs.RO

Bridge-WA: Predicting Where and How the World Changes for Robotic Action

Yongjie Bai, Hanting Wang, Mingtong Dai, Qijun Zhong, Yang Liu, Liang Lin

Sun Yat-sen University, Pengcheng Laboratory, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, X-Era AI Lab

2026-07-03机器人强化学习

Bridge-WA针对现有VLA多为反应式映射、缺少对操作后场景变化的显式建模,以及完整世界模型推理成本高的问题,提出用冻结的未来变化教师蒸馏出未来token、变化图和运动流三类紧凑先验,并通过WorldBridge注入动作Transformer。实验覆盖VLABench、RoboTwin2.0、LIBERO-Plus和真机,显示任务成功率、进度与OOD视觉鲁棒性提升;但效果仍依赖教师模型覆盖度和离线缓存成本。

Choreographing the Way of Water: A Computational Framework for Aquatic Robotic Art Figure 1
2026-07-03cs.RO

Choreographing the Way of Water: A Computational Framework for Aquatic Robotic Art

Aswin Ramachandran, Christopher Golling, Sebastian Burmester, Noa Sendlhofer, Jan Kamm, Ruiheng Jiang, Raffaello D'Andrea

2026-07-03机器人

这篇论文针对开放水域中波浪、洋流和漂移使机器人编队难以按音乐精确表演的问题,提出 Way of Water 一体化水面机器人艺术框架。核心创新是把硬件、RTK-GPS/LTE-MQTT 通信、SCP 轨迹生成、MPC 抗扰控制与类 DAW 的浏览器时间线编排工具封装在一起,让非程序员可用参数化形状、灯光和水柱创作。系统已在苏黎世湖 18 艘《天鹅湖》和威尼斯双年展 8 艘高速演示中验证,但规模目前约受集中式求解限制在 24 艘。

Influence of Radial Basis Activation Functions on Intelligent Controller for Robotic Manipulators Figure 1
2026-07-03eess.SY

Influence of Radial Basis Activation Functions on Intelligent Controller for Robotic Manipulators

Kimmo Paldanius, Gabriel Da Silva Lima, Wallace Moreira Bessa

2026-07-03机器人规划控制

针对机械臂轨迹跟踪中模型不确定性、摩擦和未建模扰动会削弱反馈线性化控制的问题,论文把RBF神经扰动估计器与Lyapunov自适应律结合,并重点考察基函数选择本身的影响。实验显示各有界核均保持稳定性,但IMQ核在平滑/斜坡轨迹上约降52%跟踪误差且控制努力增幅低于3%,而局部核在不连续指令下更易带来超调和较长调节时间。

Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies Figure 1
2026-07-03cs.RO

Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

2026-07-03视觉语言视觉感知生成模型

这篇论文针对冻结的流匹配视觉语言动作策略难以低成本适应新任务的问题,提出在推理阶段用由真实成功/失败轨迹训练的动作块 critic,对 SmolVLA 的反向 flow sampler 施加 Q 梯度引导,并加入任务描述条件与集成不确定性门控。LIBERO 上单任务成功率由 68% 提至 82%、82% 提至 86%,多任务验证由 46% 提至 56%,但锁定测试仅从 65% 到 67.5%,说明方法可行但主要瓶颈仍是 critic 泛化与校准。

Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning Figure 1
2026-07-03cs.RO

Cross-Platform Control for Autonomous Surface Vehicles via Adaptive Reinforcement Learning

Ruiheng Jiang, Thomas Bi, Raffaello D'Andrea, Aswin Ramachandran

2026-07-03强化学习规划控制

面向不同水面无人艇动力学和执行机构差异导致的逐平台建模、调参成本,本文将跨平台轨迹跟踪视为部分可观测控制问题,用随机化3-DoF解析模型训练单一强化学习策略,并通过教师—学生结构从交互历史中推断平台动力学潜变量。真实两平台零样本部署中,相比非自适应学习基线位置误差最高降低58%,接近平台专用调参MPC,但高速、强耦合工况仍未充分覆盖。

A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity Figure 1
2026-07-03cs.RO

A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity

Sujan Kumar Dhali, Bhaskar Dasgupta

S. K. Dhali is with Department of Mechanical Engineering, Indian Institute of Technology Kanpur, Kanpur 208016, India

2026-07-03机器人

这篇论文针对动态场景中传统视觉 SLAM 依赖静态世界假设、易被运动物体干扰的问题,提出基于 ORB-SLAM2 的 OCD SLAM:一方面用 SMOKE 与卡尔曼跟踪做对象级运动分类,另一方面引入“交叉视差”从时序与双目不一致中筛除漏检的动态特征,并在优化中提高静态点权重。KITTI Odometry 与 Raw 实验显示其轨迹精度优于 ORB-SLAM2 和若干动态 SLAM 方法,消融也表明交叉视差能补足仅靠 3D 检测的不足。

Episodic-to-Semantic Consolidation Without Identity Drift Figure 1
2026-07-03cs.AI

Episodic-to-Semantic Consolidation Without Identity Drift

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

2026-07-03机器人

面向医院、仓储等受监管场景中的长期运行机器人,论文关注“从经验中学习”与“认证身份不漂移”的冲突。核心做法是把情节日志到语义知识的巩固设计为确定性派生层,而非改写模型、提示或身份清单,并保留置信度与事件溯源。合成实验显示身份哈希在多次巩固后字节不变,且无效规划尝试平均减少79.8%,但验证主要依赖合成设定,真实部署泛化仍需进一步说明。

NeoMap: Training-free Novel-View Synthesis from Single Images and Videos Figure 1
2026-07-03cs.CV

NeoMap: Training-free Novel-View Synthesis from Single Images and Videos

Jinxi Li, Tianyi Zhang, Yafei Yang, Zihui Zhang, Peng Huang, Koon Wing Macgyver Lin, Bo Yang

2026-07-03视觉感知

NeoMap面向单图或单目视频的新视角合成,动机是避免相机条件微调或逐步硬引导带来的过拟合、伪影和全局不一致。其核心洞察是预训练视频模型的数据流形中已隐含可行的新视角解,因此通过深度扭曲先验、锚定流形投影与像素约束投影交替优化初始噪声,而非改写生成过程。实验在Tanks-and-Temples、LLFF和DAVIS上优于既有方法,兼顾生成质量与视角一致性。

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation Figure 1
2026-07-03cs.RO

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation

Peng Yun, Shouwang Huang, Hao Li, Jinxi Li, Jianan Wang, Bo Yang

2026-07-03机器人强化学习三维

面向抓取、投放等高速动态目标操作,论文指出现有 VLA/视频世界模型缺少显式 3D 几何、物理一致预测且延迟偏高。PhysMani 将在线优化的无散度 3D Gaussian 速度场作为物理世界模型,并用可学习 token 交叉注意力把局部未来运动注入策略。在新建 16 任务 PhysMani-Bench 及真实机器人实验中,其成功率和效率均优于多种 3D 策略与 VLA 基线。

SPLC: Social Preference Learning for Crowd Robot Navigation Figure 1
2026-07-03cs.RO

SPLC: Social Preference Learning for Crowd Robot Navigation

Zixuan Chen, Hao Fu, Haiwen Hu, Shiquan Zheng (Wuhan University of Science and Technology, Wuhan, China)

2026-07-03机器人

面向人群导航中离线强化学习奖励难以手工刻画社会规范的问题,SPLC用基于行人动态评估准则的社会偏好反馈自动生成轨迹偏好标签,并以偏好Transformer学习奖励,再接入IQL、CQL、TD3BC等离线RL算法。实验显示其在标准指标上优于现有基线,并通过TurtleBot4实机验证了在人机共存场景中的可用性。

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots Figure 1
2026-07-03cs.CV

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots

Seunghee Yun, Geonmo Yang, Juhui Lee, Changbeom Park, Jeahyung Choi, Younggun Cho

Journal of Institute of Control, Robotics and Systems (20xx) 30(x):000-000, Department of Electrical and Computer Engineering, Inha University, Hyundai Engineering & Construction Co., Ltd, Department of Electrical and Electronic Engineering, Inha University, ※ This research was supported by the Korea Heritage Service and the National Research Institute of Cultural Heritage in 2026 (Project No.: RS-2026-25518173), by the, Institute of Information & Communications Technology Planning & Evaluation (IITP) grant funded by the Korea government (MSIT) (No. 2022-0-00448/RS-2022-, underwater working environments and the controllability of the data

2026-07-03机器人视觉感知安全鲁棒

这篇论文面向水下机器人在近海施工监测中遇到的低能见度、前向散射模糊和海雪遮挡问题,核心思路不是改网络,而是用深度感知前向散射与真实图像提取的海雪模式生成更贴近实海域的合成数据,再重训 Joint-ID 并配合轻量后处理。韩国沿海机器人数据上的定性结果和 UIQM 均有提升,说明收益可能主要来自更真实的数据合成与后处理。

DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability Figure 1
2026-07-03cs.RO

DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability

Ziheng Xu, Qingfeng Li, Xuefeng Liu, Chen Chen, Jianwei Niu

2026-07-03三维

DL-SLAM针对动态场景中3D Gaussian Splatting SLAM既会误删短暂停止物体、又易把其融合进静态地图产生伪影的问题,提出像素级与对象级动态概率耦合框架:用语义和光流估计像素权重辅助跟踪,再提升到3D按实例剪除动态高斯,并由净化后的静态地图反向校正概率。实验称在三个动态数据集上跟踪精度最高提升13%,同时生成更干净的RGB与语义地图。

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon Figure 1
2026-07-03cs.RO

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

2026-07-03机器人

本文针对动作分块 VLA 在固定长 horizon 下“先预测后盲执行”导致闭环反应不足、误差累积的问题,提出无需改动主干权重的 VLA-Corrector:用潜空间视觉监控检测预测与实际视觉演化偏差,触发截断并通过在线梯度引导重新规划,从而形成事件驱动的自适应 horizon。实验显示其在多种 VLA 骨干、仿真与真实任务中提升鲁棒性和 success-per-call 效率,例如 π0.5 在 horizon 50 下成功率由 48.7% 升至 58.7%,平均调用还略降。

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation Figure 1
2026-07-03cs.CV

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

Duy Cao, Phong Nguyen-Ha

Qualcomm AI Research 1 1 1 Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-07-03生成模型三维

PixGS针对现有3D生成依赖多视图重建或潜空间级联扩散而带来的视角不一致、细节损失和训练复杂问题,改为在像素空间直接生成3D Gaussian属性张量,并在扩散过程中用深度、法线与LoG高频约束联合监督外观和几何。文中报告其优于现有方法,且单张A100约1秒推理;具体增益中数据规模与训练日程的贡献仍需更多消融区分。

Lightweight Safe Reinforcement Learning for End-to-End UAV Navigation Figure 1
2026-07-03cs.RO

Lightweight Safe Reinforcement Learning for End-to-End UAV Navigation

Shenghui Zhang, YuXuan Gao, Songwei Zhao, Jifeng Hu, Zijing Zhang, Hechang Chen

2026-07-03机器人强化学习安全鲁棒

这篇论文针对稀疏激光感知和高速飞行下无人机强化学习导航易碰撞、训练不稳且难以上机的问题,提出将轻量卷积感知、层级控制与拉格朗日安全 PPO 结合,并用课程学习稳定训练。实验覆盖不同障碍密度和速度,显示相较 RL 基线有更高成功率、更少安全违规和更好效率,但真实机部署与安全约束泛化仍文中未充分说明。

DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM Figure 1
2026-07-03cs.CV

DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM

Shoon Kit Lim, Melissa Jia Ying Chong, Ting Yang Ling

University of Southampton Malaysia, Iskandar Puteri, Johor, Malaysia

2026-07-03机器人

本文针对学习型视觉前端在紧耦合 VI-SLAM 中缺乏公平、系统评估的问题,提出 DL-VINS-Factory,将 ALIKED、RaCo、SuperPoint、XFeat 与 LK 或 LightGlue 组合接入统一 VINS-Fusion/Ceres 后端,并用 AnyLoc 解耦回环检索。实验显示学习特征可在嵌入式实时运行,但并非总优于传统跟踪;ALIKED+LG 在 EuRoC、NTU-VIRAL 上降低 ATE,Botanic Garden 中则更偏向光流方案,AnyLoc 回环数显著多于 BRIEF+DBoW2。

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning Figure 1
2026-07-03cs.RO

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

Hexian Ni, Tao Lu, Yinghao Cai

2026-07-03视觉语言视觉感知强化学习

这篇论文针对机器人强化学习中奖励难设计、偏好学习反馈低效且训练不稳的问题,提出将奖励拆成可由任务知识显式编码的形式奖励和从观测偏好中学习的残差奖励。CoRe 用 VLM 反馈迭代优化代码化奖励,并为视频偏好与状态重要性生成监督信号,从而减少人工介入。实验显示其在 10 个仿真和 5 个真实操作任务上优于现有方法,主要提升体现在学习效果与效率。

Imagining the Sense of Touch: Touch-Informed Manipulation via Imagined Tactile Representations Figure 1
2026-07-03cs.RO

Imagining the Sense of Touch: Touch-Informed Manipulation via Imagined Tactile Representations

Zhiyuan Zhang, Adeesh Desai, Jyun-Chi Hu, Yosuke Saka, Quan Khanh Luu, Jiuzhou Lei, Davood Soleymanzadeh, Bihao Zhang, Minghui Zheng, Yu She

† Corresponding author.Zhiyuan, Adeesh, Jyun-Chi, Yosuke, Quan, and Yu are with the Department of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA

2026-07-03机器人

这篇论文针对触觉传感器易损、需校准且部署成本高的问题,提出 TacImag:用成对视觉-触觉示范训练视觉/本体到触觉的“想象”模型,测试时无需真实触觉硬件也能给策略提供触觉表征。核心洞察是它并非凭空恢复缺失触觉,而是把视觉中微弱的接触线索转成更易利用的表示。六个仿真和四个真实任务显示,想象力场更适合插入、装配等接触敏感任务,真实实验平均提升 44.4%;想象触觉图像更利于纹理区分,平均提升 23.3%。

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning Figure 1
2026-07-03cs.RO

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

2026-07-03机器人强化学习模仿学习

这篇论文针对真实机器人强化学习中探索风险高、稀疏奖励难以收敛且人工介入成本大的问题,提出 AutoSERL:把单条示范轨迹转化为滑动窗口引导、安全恢复和自动停止介入三种机制,从而替代持续人类监督。在六个接触密集操作任务、两类机器人平台上,AutoSERL 优于20条示范的 SERL、行为克隆和 MILES,并在插入任务达到100%成功率,整体接近 HIL-SERL。

Path planning for unmanned naval surface vehicles Figure 1
2026-07-03cs.RO

Path planning for unmanned naval surface vehicles

Daniel G. Schwartz

Available online: xx xx 2025, Scientific Press Pte. Ltd. This work is, generated depends on the available size of the computer’s runtime stack. This limitation

2026-07-03规划控制

本文针对无人水面艇在已知静态障碍与未知动态障碍并存时的实时避障需求,提出全局与局部结合的规划框架:全局端融合 Grassfire、带对角的 MGF 与递归式 PRM 生成更平滑路径,局部端依据障碍相对全局路径的位置和运动方向,主动选择从其后方绕行。仿真与 D* 对比显示该策略能更系统地处理横穿障碍,但真实海况、传感误差和 COLREGS 细节适配仍文中未充分说明。

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment Figure 1
2026-07-03cs.CV

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

2026-07-03视觉语言视觉感知生成模型

论文针对VLA预训练中架构、数据和评测不统一导致范式难比较的问题,提出VLAFlow,在同一π0式流匹配框架、14维动作空间和约5000小时异构OXEMix数据上对比动作预测、语言共训练、未来潜表示对齐及其组合。结果显示,纯动作预训练易受异构数据负迁移影响;语言监督保留视觉语言泛化,未来潜对齐增强状态转移建模,二者结合的MindLWPI在LIBERO、LIBERO-Plus和SimplerEnv上整体最稳定。

Multi-Rate Nonlinear Model Predictive Control for Wall-Supported Bipedal Locomotion of Quadrupedal Robots Figure 1
2026-07-03cs.RO

Multi-Rate Nonlinear Model Predictive Control for Wall-Supported Bipedal Locomotion of Quadrupedal Robots

Taizoon Chunawala, Jeeseop Kim, Kaveh Akbari Hamed

2026-07-03机器人规划控制

针对四足机器人在狭窄走廊等受限环境中直立行走难以稳定的问题,论文提出分层多速率 NMPC:高层用单刚体模型同时规划质心、姿态、墙面/地面接触力与离散落足点,低层用带虚约束的 QP 全身控制跟踪全阶动力学。Unitree A1 仿真显示其可在粗糙地形和外扰下实现靠墙双足运动,相比 Raibert 启发式落足在高速不规则地形通过率提升约 2.9 倍,但验证仍主要限于仿真。

A Reconfigurable Rocker-Bogie Robot for High Step Climbing and Turning Figure 1
2026-07-03cs.RO

A Reconfigurable Rocker-Bogie Robot for High Step Climbing and Turning

Kento Koizumi, Tomoaki Ohba, Yuta Saito, Takeya Morito, Kenji Suzuki

2026-07-03机器人

面向狭窄、崎岖场景中地面机器人既要高越障又要灵活转向的矛盾,本文提出可重构摇臂-转向架底盘:通过转向架关节电机在六轮越障与四轮差速转向形态间切换,并在后端使用全向轮降低侧滑。原型实验显示,其零半径转向速度超过传统六个非转向抓地轮方案的 5 倍,平均轮端总扭矩约为后者 17%,同时可攀爬 40 cm 台阶,平均耗时 6.4 s。

Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems Figure 1
2026-07-03cs.CR

Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems

Qiang Han, Jie Wu, Bo Chen

2026-07-03机器人视觉语言

本文关注LVLM机器人在实时决策中可能被“过度思考”拖慢的安全风险:攻击者只需把可读场景文字嵌入视觉输入,就可能诱导模型生成冗长推理。核心创新是用三阶段框架挖掘可迁移触发词,结合前缀代理分数降低黑盒搜索成本,并在多模型与实物打印场景验证。结果显示三种LVLM均出现延迟放大,最强单触发达6.96倍,打印触发仍可达4.74倍。

SE(2) Navigation Mesh Figure 1
2026-07-03cs.RO

SE(2) Navigation Mesh

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

2026-07-03机器人

面向多层、狭窄和非平坦场景中的地面机器人全局导航,论文指出传统 NavMesh 忽略航向导致非圆形机器人可通行性估计失真。其核心是将可通行多边形扩展为按 yaw 分层的 SE(2) NavMesh,用足迹掩码建图,并用 ASA 分层优化位置与朝向,还支持点云流在线增量更新。实验显示其比经典 NavMesh 多捕获超过 50% 可通行区域,路径代价降至初始的 87%,并在真实机器人上验证实时构建与跨场景导航。

BIFROST: Bridging Invariant Feature Representation for Observation-space Sim2Real Transfer Figure 1
2026-07-03cs.RO

BIFROST: Bridging Invariant Feature Representation for Observation-space Sim2Real Transfer

Yunfu Deng, Josiah P. Hanna

2026-07-03机器人

这篇论文针对机器人 sim2real 中视觉差异与动力学差异叠加时,传统方法需分别适配且相互作用难处理的问题,提出用跨域双模拟目标从原始观测-动作历史中学习共享潜表示:只要两域序列导向等价长期行为,就拉近其隐状态。基于该表示在仿真中训练的策略可零样本迁移到真实系统;在视觉导航、接触丰富操作和视觉伺服实验中,BIFROST 在复合域差下优于域适配与联合训练基线,但效果依赖成对数据质量。

CommonRoad-Game: A Human-in-the-Loop Simulation Framework for Autonomous Driving Figure 1
2026-07-03cs.RO

CommonRoad-Game: A Human-in-the-Loop Simulation Framework for Autonomous Driving

Yunfei Bi, Youran Wang

2026-07-03机器人

本文针对自动驾驶运动规划常依赖离线数据、缺少实时人类交互测试且高保真仿真开销较大的问题,提出 CommonRoad-Game:一个与 CommonRoad 生态集成的轻量级人在环框架。其核心在于多线程时间同步、人类驾驶日志记录与场景生成,使规划器可在可复现实验中面对真实人类输入。实验显示该框架能保持稳定时序同步,支持多智能体仿真,并接入 IDM 与反应式规划器生成交互驾驶场景。

Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching Figure 1
2026-07-03cs.RO

Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching

William English, Hao Zheng, Rickard Ewetz

2026-07-03视觉语言视觉感知生成模型安全鲁棒

针对VLA机器人在真实操作中仅靠单步安全过滤难以及早避障的问题,本文把流匹配生成过程视为逐步细化的未来动作轨迹预测,并在每次去噪中嵌入CBF约束检查与最小范数修正,实现神经生成与符号安全约束交替作用。SafeLIBERO上碰撞避免率达82.8%、任务成功率81.6%,较单步方法分别提升6.3%和19.8%,长时程任务收益最大。

Simulation Based Reward Function Validation for Multi-Agent On Orbit Inspection Figure 1
2026-07-03cs.MA

Simulation Based Reward Function Validation for Multi-Agent On Orbit Inspection

Patrick Quinn, Bala Prenith Reddy Gopu, George M. Nehma, Madhur Tiwari

2026-07-03强化学习

面向空间碎片检查中多航天器近距离操作规划成本高、预设检查点难泛化的问题,本文用PPO式多智能体强化学习构建可在任意位置和数量采集图像的奖励验证框架,并通过高保真仿真生成图像、三维重建再反推奖励设计。结果显示MARL能形成有效的在轨检查控制策略,并提供燃料、避碰、协同与重建质量权衡的设计洞察,但作者也指出距离真实部署仍需安全保证和自动化重建反馈等进一步完善。

The Three Dimensions of ROS 2 Middleware Figure 1
2026-07-03cs.RO

The Three Dimensions of ROS 2 Middleware

Sanghoon Lee, Taehun Kim, Angelo Corsaro, Kyung-Joon Park

2026-07-03机器人

面向多机器人、边云协同和无线部署中 ROS 2 通信易受带宽波动、拓扑变化与状态维护开销影响的问题,论文将中间件限制归纳为 Time、Space、State 三个维度,并用该框架重读 DDS、Zenoh 等实现及相关研究。其主要结果不是新算法,而是指出空间抽象、时间可预测性和状态连续性之间存在结构性权衡,尤其在受限无线环境下会共同压缩 ROS 2 系统的可扩展性与鲁棒性。

Adaptive Companionship for Group-Following Robots: Handling Dynamically Changing Group Formations Figure 1
2026-07-03cs.RO

Adaptive Companionship for Group-Following Robots: Handling Dynamically Changing Group Formations

Cong-Thanh Vu, Yen-Chen Liu

2026-07-03机器人

这篇论文针对群体陪伴机器人难以适应成员加入、离开和队形变化的问题,提出用VLM在网格化群体交互空间中推理合适陪伴位置,并结合MPPI保证可行性与安全。其洞察是不过度依赖固定V形或并排行走模板,而让模型基于距离、轨迹相似性和空间约束判断群体关系。五类场景、用户研究和消融显示,该方法相对基线成功率提升约15%、碰撞率降低约25%,但不同VLM的精度—时延权衡明显。

WaveLander: A Generalizable Hierarchical Control Framework for UAV Landing on Wave-Disturbed Platforms via Reinforcement Learning Figure 1
2026-07-03cs.RO

WaveLander: A Generalizable Hierarchical Control Framework for UAV Landing on Wave-Disturbed Platforms via Reinforcement Learning

Chun-Kit Li, Iok Long Sit, Ming Fung Siu, Ka Yu Kui, Hin Wang Lin, Pengyu Wang, Ling Shi

Chun-Kit Li is with the Department of Mathematics, The Hong, University, The Hong Kong University of Science and Technology, Hong Kong SAR., Department, also with the Cheng Kar-Shun Robotics Institute, The Hong Kong University, the Department of Chemical and Biological Engineering, The Hong Kong, University of Science and Technology, Hong Kong SAR.

2026-07-03强化学习规划控制

面向海浪扰动下无人机在船舶/USV平台降落时需把握触地时机、又难以依赖精确运动预测的问题,WaveLander将任务拆成高层强化学习垂直决策与低层常规飞控稳定跟踪:策略仅用相对高度和平台姿态等紧凑观测输出连续垂直速度,并通过姿态感知奖励形成下降、悬停和撤退行为。随机波浪仿真、SITL迁移和代表性实测表明其在未见扰动下仍能较稳健降落,但真实海况规模与相对基线增益仍需更多验证。

2026-07-02

62 篇
FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model Figure 1
2026-07-02cs.RO

FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model

Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

2026-07-02视觉语言视觉感知

家具装配在真实尺度下同时面临长时序、双臂协调和高精度对齐,现有方法多停留在玩具规模或单臂任务。FurnitureVLA将装配拆成语义子任务,并让VLA同时预测动作与进度信号以自动切换阶段,配合仿真数据生成和VR遥操作采集。其仿真成功率由48%提升到80%,设计因素调优另带来21%增益,真实Kinova平台最难任务仅下降16%。

GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics Figure 1
2026-07-02eess.SY

GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics

Jeffrey Fang, Keyi Shen, Anutam Srinivasan, Glen Chou

⋆ Equal contribution. All authors are with the Georgia Institute of Technology, Atlanta, GA, USA, 30308.

2026-07-02规划控制学习理论安全鲁棒

面向不确定非线性与神经网络动力学的实时鲁棒控制,论文关注LTV近似中常被忽略或过保守的线性化误差界。核心做法是构造可微、GPU并行且可认证的LEB,并将其嵌入SLS求解器以支持紧致zonotope传播。实验在最高168维系统上实现最高67Hz控制率,同时降低保守性并保留形式化约束保证。

Sensorless Four-Channel Control Architecture Using Inverse Dynamics Modeling for Human-Scale Bilateral Teleoperation Figure 1
2026-07-02cs.RO

Sensorless Four-Channel Control Architecture Using Inverse Dynamics Modeling for Human-Scale Bilateral Teleoperation

Amir Noohian, Dylan Miller, Justin Valentine, Alan Lynch, Martin Jagersand

*Corresponding author 1 Amir Noohian and Alan Lynch are with the Department of Electrical and Computer Engineering, University of Alberta, Canada.

2026-07-02强化学习规划控制

面向人尺度双边遥操作中大惯量、动力学补偿困难以及力/力矩传感器昂贵且只能感知末端接触的问题,论文提出基于逆动力学建模的无传感四通道控制架构,用模型实时估计外部关节力矩并同时补偿主从机器人动力学。其在定制 WAM 系统上验证,相比传统两通道、四通道和透明度增强方法,提升位置与力跟踪、降低操作者用力,并在开门等全臂接触任务中提高可传递阻抗。

FastBridge: Closing the Model-Based Realization Gap in Safety Filters on 3D Gaussian Splatting for Fast Quadrotor Flight Figure 1
2026-07-02cs.RO

FastBridge: Closing the Model-Based Realization Gap in Safety Filters on 3D Gaussian Splatting for Fast Quadrotor Flight

Tscholl Dario, Nakka Yashwanth Kumar, Gunter Brian

2026-07-02三维安全鲁棒

面向高速四旋翼在3D Gaussian Splatting重建环境中的实时避障,论文指出既有3DGS安全滤波器用简化积分器模型会忽略执行器约束,导致指令屏障率无法真实实现。FastBridge将碰撞锥CBF提升到完整非线性四旋翼动力学,并用前向仿真的备份CBF维持QP可行性;仿真与硬件验证显示,相比现有3DGS滤波器轨迹jerk降低47%,运行速度提升2.25倍。

Structured 4D Latent Predictive Model for Robot Planning Figure 1
2026-07-02cs.RO

Structured 4D Latent Predictive Model for Robot Planning

Zhiyi Li, Peilin Wu, Xiaoshen Han, Ruojin Cai, Yilun Du

2026-07-02机器人规划控制

针对视频规划器只在2D像素中预测、难以保持三维几何一致性和视角泛化的问题,论文把机器人规划建模为结构化4D潜空间中的3D场景演化预测:用稀疏体素特征表示当前场景,并由文本条件生成未来3D潜状态,再交给目标条件逆动力学输出动作。实验显示其在生成质量接近强基线的同时,多视角一致性、3D一致性和复杂操作成功率更好,并能迁移到视觉变化和真实机器人平台。

Towards Metric-Agnostic Trajectory Forecasting Figure 1
2026-07-02cs.CV

Towards Metric-Agnostic Trajectory Forecasting

Markus Knoche, Daan de Geus, Bastian Leibe

2026-07-02规划控制

本文针对轨迹预测模型过度绑定 Argoverse、Waymo 等 benchmark 指标的问题,指出距离型指标与 soft mAP 会诱导相互冲突的训练目标。核心思路是先用指标无关的概率目标学习校准的预测分布,再用 TraDiE 后处理策略按不同指标抽取 K 条轨迹与置信度。基于 DONUT-NLL,在 Waymo 上同时刷新多项指标,并显示广义高斯分布优于若干替代分布。

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement Figure 1
2026-07-02cs.RO

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement

Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider

Carnegie Mellon University

2026-07-02强化学习

这篇论文针对机器人部署中失败后简单重试会重复犯错、人工介入恢复成本高的问题,提出 FAR:利用失败轨迹构造偏好信号,让策略避开导致失败的动作,并在重试时加入轻量扰动探索;成功恢复轨迹再用于持续微调。仿真九项任务和真实 xArm 三项任务中,FAR 相比标准扩散策略平均成功率分别提升 17.6% 和 11.7%,并在重置和步数预算下提高在线改进的数据效率。

Technical Report: Asynchronous Distributed Trajectory Estimation of Multi-Robot Systems Figure 1
2026-07-02cs.RO

Technical Report: Asynchronous Distributed Trajectory Estimation of Multi-Robot Systems

Adam Pooley, Matthew Hale

2026-07-02机器人规划控制

针对多机器人分布式状态/轨迹估计中通信与计算难以同步、慢节点拖累收敛的问题,本文把滑动窗口 MAP 估计改写为可部分异步执行的块坐标下降,并进一步近似更新以稀疏化必要通信。理论上证明对近似 MAP 解指数收敛;仿真相对同步 CADMM 基线最多降误差 64%,通信最多减少 96.9%,实机实验显示可承受跨三数量级的延迟。

ROSA: A Robotics Foundation Model Serving System for Robot Factories Figure 1
2026-07-02cs.RO

ROSA: A Robotics Foundation Model Serving System for Robot Factories

Wenqi Jiang, Jason Clemons, Rowland O'Flaherty, Hugo Hadfield, Alperen Degirmenci, Shuran Song, Yashraj Narang, Christos Kozyrakis

Stanford University

2026-07-02机器人

本文针对机器人工厂中每台机器人绑定本地或专用 GPU、且只优化单模型延迟的服务范式低效问题,提出 ROSA:用共享服务器级 GPU 池承载多机器人 RFM 推理,并提供面向机器人任务的多模型编排、SLO 与故障处理抽象,以工厂级加权动作吞吐为调度目标。基于 Ray Serve 等实现后,真实机器人和大规模合成负载显示其在满足延迟约束下,相比专用服务最高提升 12.06 倍生产率。

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization Figure 1
2026-07-02cs.RO

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

Suraj Borate, Aarav Shah, Madhu Vadali

2026-07-02视觉语言视觉感知

这篇论文针对室内无 GPS 场景中传统几何定位易受噪声、地图缺失影响的问题,把定位改写为“看图读地图”的语义推理任务。作者将前视相机、极坐标 LiDAR 与语义栅格地图输入微调后的 Qwen2.5-VL,并用回归头直接输出位姿。仿真数据上达到 0.11 m、5.7°误差;消融显示相机语义和 LiDAR 几何互补,但真实部署仍受静态地图和 sim-to-real 限制。

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation Figure 1
2026-07-02cs.RO

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

Peking University, Tsinghua University

2026-07-02机器人

该文针对灵巧操作中视觉难以感知接触力、而机器人触觉数据昂贵且异构的问题,提出用大规模人类第一视角触觉-动作数据进行可迁移预训练。核心是 H-Tac 数据集、统一触觉/动作空间,以及同时预测动作和未来触觉的双专家 VLA 架构,以缩小人到机器人的分布差异。仿真和真实机器人实验显示,TTP 在接触丰富、精细操作任务上优于无预训练或无触觉基线,但具体增益中 data scaling 的贡献仍需进一步拆解。

RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation Figure 1
2026-07-02cs.RO

RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation

Byeongguk Jeon, Seonghyeon Ye, JaeHyeok Doo, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

2026-07-02机器人强化学习数据集/基准

针对真实机器人评测成本高、传统仿真搭建重且存在 sim-to-real 偏差的问题,RoboWorld用自回归视频世界模型替代部分物理 rollout,并以任务进度感知 VLM 打分;其关键是 Step Forcing,通过锚定上下文和一步自前推上下文缓解长时生成的训练-测试错配,同时保留动作可控性。在 RoboArena 对齐实验中生成 4186 个 rollout,策略排名与真实评测高度相关,Pearson r=0.989、Spearman ρ=0.970。

AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation Figure 1
2026-07-02cs.RO

AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation

Qingda Hu, Ziheng Qiu, Jieru Zhao, Zhongxue Gan, Wenchao Ding

2026-07-02机器人

AutoSpeed针对模仿学习策略照搬示教速度、固定预测时域而导致效率受限的问题,提出无需阶段或速度标注的阶段自适应速度学习框架。其关键做法是用DCT生成不同速度的候选未来轨迹,并以预测误差与有效时域的组合代价选择监督目标,同时学习速度比例。实验显示该方法在仿真和真实操作中缩短完成时间并提升成功率,且推断速度与任务阶段对应。

Robots Ask the Way: Communication-Enabled Social Navigation Figure 1
2026-07-02cs.RO

Robots Ask the Way: Communication-Enabled Social Navigation

Valentino Sacco, Luca Scofano, Indro Spinelli, Fabio Galasso

2026-07-02机器人

这篇论文针对多住户环境中机器人寻找特定对象时只能被动避障、缺少主动获取线索的问题,提出 CommNav 任务与 Habitat 3.0c,并在 DDPPO 导航策略中加入 COMM 模块,让机器人向非目标居民询问目标的近期位置、方向和轨迹信息。实验显示,通信模块可将 Episode Success 提升约 10 个百分点;预训练有助于处理稀疏交互信号,且用 LLM 指令训练的策略在真人口语化、不完整指令上表现接近结构化信息,说明自然语言线索可较稳健地融入社会导航。

DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation Figure 1
2026-07-02cs.RO

DART-VLN: Test-Time Memory Decay and Anti-Loop Regularization for Discrete Vision-Language Navigation

Shaoheng Zhang, Zhichen Li, Jie Mei

2026-07-02机器人视觉语言视觉感知

这篇论文针对离散视觉语言导航中冻结记忆型智能体在测试时易受陈旧历史信息和局部回退影响的问题,提出无需训练的 DART-VLN:在读取端对记忆做衰减重加权,并在动作选择时加入反循环惩罚。R2R 和 REVERIE 实验显示,单独记忆衰减带来稳定收益,结合反循环后通常获得更短路径、更低运行时间和更好的成功率/SPL 权衡。

AMBUSH: Collaborative Capture in Complex Environments with Neural Acceleration Figure 1
2026-07-02cs.RO

AMBUSH: Collaborative Capture in Complex Environments with Neural Acceleration

Junfeng Chen, YinHang Luo, Xinyi Wang, Junrui Li, Meng Guo

The authors are with 1 the School of Advanced Manufacturing and Robotics, Peking University, Beijing 100871, China, and 2 the Distributed Autonomous Systems and Control Lab, University of

2026-07-02机器人

这篇论文面向复杂障碍环境中多机器人追捕更快、甚至由人控制逃逸者的实际需求,指出单一“伏击”策略即可让较慢追捕者取得优势。方法将隐藏点、攻击点和角色分配参数化,并用混合 MCTS 做长期规划,再以离线训练的图神经排序/评估器替代昂贵 rollout 加速在线搜索。仿真与硬件实验显示,该框架可应对两倍速逃逸者和不同智能水平对手,神经加速带来约 25% 捕获率提升和 17.1% 捕获时间下降,但仍依赖集中式规划。

Image-Domain Tilt Constrained Distributed Fusion for Maneuvering UAV Tracking with Multi-Camera Electro-Optical Observations Figure 1
2026-07-02eess.IV

Image-Domain Tilt Constrained Distributed Fusion for Maneuvering UAV Tracking with Multi-Camera Electro-Optical Observations

Minxing Sun, Yao Mao

2026-07-02视觉感知

面向机动小型无人机在电光多相机跟踪中短时预测易因仅有位置类观测而滞后的问题,论文将旋翼机图像中的表观横滚/俯仰视作与加速度相关的低层机动线索,通过视频与IMU弱标注训练YOLO-OBB,并在异步分布式滤波中融合倾角伪观测及相机姿态误差。仿真中预测RMSE由1.991米降至0.821米,真实多相机自一致性累计误差降低18.10%。

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization Figure 1
2026-07-02cs.CV

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization

Xuying Huang, Sicong Pan, Maren Bennewitz

2026-07-02视觉感知优化算法三维安全鲁棒

这篇论文针对室内机器人在隐私敏感场景中不能使用 RGB 图像的问题,研究仅依赖深度几何的开放词汇 3D 语义分割。核心思路是把 RGB 缺失带来的不确定性转化为测试时优化信号:保留稳定区域,只细化高不确定区域,并引入文本去偏和特征语义一致性等基础模型先验。实验在 ScanNet20/40/200 上显示,UTTO 无需额外训练即可稳定提升深度-only 开放词汇分割,并优于代表性 RGB-free 基线。

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios Figure 1
2026-07-02cs.RO

Beyond Line of Sight: Hybrid Validation of V2X Collective Perception in Complex Scenarios

Markos Antonopoulos, Anastasia Bolovinou, Bill Roungas, Elena Daskalaki, Angelos Amditis

2026-07-02机器人

面向自动驾驶在环岛等遮挡场景中单车视野受限、V2X协同感知缺乏可验证性的痛点,论文将多车观测以贝叶斯占据栅格融合,并引入不确定性与可靠性度量,用CARLA和车在环构成混合验证流程。实验显示协同感知使视场覆盖约提升260%,占据栅格召回率由0.82升至0.94;但未建模网络延迟,实际通信影响仍需后续验证。

From World Models to World Action Models: A Concise Tutorial for Robotics Figure 1
2026-07-02cs.RO

From World Models to World Action Models: A Concise Tutorial for Robotics

Xiaoxiong Zhang, Xiong Zeng, Wei Zhang

2026-07-02机器人强化学习

这篇教程针对机器人领域“世界模型”概念边界混乱的问题,提出将其统一理解为动作条件的未来观测或状态预测模型,并按观测空间与状态空间梳理设计取舍。核心洞察是进一步引入世界动作模型,把想象出的未来与可执行动作连接起来,归纳出四类范式。文章主要结果是形成面向具身预测与控制的结构化分类框架,而非报告新的实验增益。

From Prediction Uncertainty to Conformalized Distance Fields for Safe Motion Planning Figure 1
2026-07-02cs.RO

From Prediction Uncertainty to Conformalized Distance Fields for Safe Motion Planning

Jaeuk Shin, Yoonseok Ra, Insoon Yang

All authors are with the Department of Electrical and Computer Engineering, ASRI, Seoul National University, Seoul 08826, South Korea

2026-07-02规划控制安全鲁棒

面向动态人群/障碍中的实时安全规划,论文指出逐障碍或逐点共形不确定性会丢失空间一致性且随密度变贵;其核心是把预测距离场残差作为低秩函数整体共形化,离线用 FPCA+GMM 构造安全包络、在线轻量自适应更新,并嵌入 MPC。ETH–UCY 与最多 280 个动态障碍的四旋翼实验显示,FCP-MPC 在安全、可行性和计算效率间更均衡,尤其在高密度场景中成本对障碍数不敏感。

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark Figure 1
2026-07-02cs.CV

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark

Richard Schwarzkopf, Jonas Merkert, Frank Bieder, Annika Bätz, Alexander Blumberg, Carlos Fernandez, Felix Hauser, Fabian Immel, Christian Kinzig, Hendrik Königshof, Fabian Konstantinidis, Martin Lauer, Willi Poh, Nils Rack, Kevin Rösch, Yinzhe Shen, Marlon Steiner, Gleb Stepanov, Dominik Strutz, Ömer Şahin Taş, Julian Truetsch, Kaiwen Wang, Royden Wagner, Jan-Hendrik Pauls, Christoph Stiller

2026-07-02数据集/基准

这篇论文关注自动驾驶数据集常被“事后描述”而缺少设计方法的问题,尤其面向资源有限团队。核心洞察是先判断研究受阻于训练数据还是评测能力,再选择能闭合缺口的最小数据操作,只有在复用、重标注、统一或合成不足时才录制新数据。论文通过梳理主流AD数据集演化并以KITScenes为案例,给出从缺口诊断到传感器、标注和基准设计的策略框架,主要结果是形成一套数据集/基准创建指南,而非报告新模型性能增益。

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model Figure 1
2026-07-02cs.CV

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen, Lulu Zheng, Botai Yuan, Tianlun Li, Mingxin Wang, Dekang Qi, Bin Hu, Wei Mei, Yuze Xuan, Haolong Yang, Yanqing Zhu, Mu Xu, Zhiheng Ma, Xinyuan Chang

AMAP CV Lab

2026-07-02机器人强化学习

本文针对移动操作中现有 VLA 缺少世界模型、WAM 粗粒度视频预测与细粒度控制脱节的问题,提出 ABot-M0.5:用中间潜在动作连接视频表征与机器人控制,用双层 Mixture-of-Transformers 解耦底盘导航和机械臂操作,并以 Dream Forcing 缩小自回归推理的训练测试差异。实验显示其在长时程移动操作成功率和精细操作精度上达到或超过已有方法,但具体增益仍依赖消融来区分架构、训练策略与数据规模贡献。

Path Planning in Physically Viable World Models Figure 1
2026-07-02cs.RO

Path Planning in Physically Viable World Models

Su Ann Low, Cheng-Hsi Hsiao, Xingjian Li, Adam J. Thorpe, Ufuk Topcu, Krishna Kumar

The University of Texas at Austin

2026-07-02强化学习规划控制

这篇论文针对野外机器人常依赖过期重建地图、难以预判洪水或滑坡等地形变化导致路径失效的问题,提出将高斯泼溅场景与MPM物理仿真结合的“物理可行世界模型”,在假设干预后的场景上做贴地、避险路径规划。实验显示,在德州洪泛场地、阿拉斯加村庄和沙箱滑坡场景中,该方法能提前暴露静态地图看不到的绕行、不可达和任务失败。

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts Figure 1
2026-07-02cs.RO

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi

2026-07-02机器人

这篇论文针对VLA机器人策略在相机视角、传感器标定或机器人本体变化后性能骤降、而逐任务采集示教代价高的问题,提出DART:用同一任务在源域与目标域的一次微调权重做“类比”相减,抽取可复用的域向量,并通过奇异子空间过滤与缩放抑制噪声。作者的关键洞察是一次微调中的任务方向与域方向近似可加性分解;在仿真和真实实验中,DART在单示教场景下优于多种VLA适配基线。

From Real-Time Planning to Reliable Execution:Scalable Coordination for Heterogeneous Multi-Robot Fleets in Industrial Environments Figure 1
2026-07-02cs.RO

From Real-Time Planning to Reliable Execution:Scalable Coordination for Heterogeneous Multi-Robot Fleets in Industrial Environments

Bo Cao, Zhe Liu, Hesheng Wang

2026-07-02机器人规划控制

面向仓储和制造中高密度异构机器人车队,论文指出传统区域/拓扑调度过于保守,MAPF 又难处理真实尺寸、运动学和执行延迟。其核心是 SCALE:把在线路径规划与执行授权耦合,用运动诱导冲突削减生成可行局部路径,并用 CAPH 动态调整机器人动作优先级以吸收扰动。仿真和三天仓库部署显示系统可持续无碰撞、无死锁运行,吞吐提升超过 30%,但具体增益在各模块间的来源仍需更多消融说明。

Enhancing Robustness in Robot-Environment Interactions through Passive Compliant Degrees of Freedom: A Hybrid Position-Force Control Approach with Feedback Linearization Figure 1
2026-07-02cs.RO

Enhancing Robustness in Robot-Environment Interactions through Passive Compliant Degrees of Freedom: A Hybrid Position-Force Control Approach with Feedback Linearization

Rahman Ardakanian, Iman Kardan, AliAkbar Akbari, Ali Mousavi

Department of Mechanical, University of Mashhad, Center of Advanced, Department of Computer, Islamic Azad University, shocks propagate to the actuated joints and force-control loop. The approach is evaluated in MATLAB/Simulink on a 2-DOF planar, finishing, surgery, and human-robot collaboration. In these, Recent studies in collaborative and industrial scenarios

2026-07-02机器人规划控制安全鲁棒

面向非结构化接触中冲击、振动和环境刚度不确定导致的力控失稳问题,论文将反馈线性化的混合位置-力控制与末端被动柔顺自由度结合,核心洞察是用物理弹簧阻尼先在接触端储能耗能,而非完全依赖主动反馈。MATLAB/Simulink 的 2 自由度机械臂仿真表明,弹簧阻尼末端较刚性和仅弹簧方案能降低力/速度误差方差并平滑关节力矩,典型误差标准差降幅约 25%–41%。

[Preprint] Dynamic Modeling, Gait Synthesis, and Control of a Novel Subsurface Bore Propagator Figure 1
2026-07-02cs.RO

[Preprint] Dynamic Modeling, Gait Synthesis, and Control of a Novel Subsurface Bore Propagator

Lina van Brügge, Shruti Kotpalliwar, Anton Koval, Akshit Saradagi, George Nikolakopoulos

2026-07-02规划控制

面向缺少空腔、感知受限的地下自主探测,论文将仿蚯蚓锚定推进与隧道掘进式钻削合成一体化模块机器人,并用 Euler-Lagrange 分模块建模、PID 反馈和集中状态机生成步态,再通过 Unity/ROS 物理仿真贴近实机几何验证。结果显示系统能在钻削扰动下保持锚定,3 个步态周期累计前进 30 mm;但真实土壤实验与三维轨迹控制仍未充分说明。

Learning from Demonstration via Spatiotemporal Tubes for Unknown Euler-Lagrange Systems Figure 1
2026-07-02cs.RO

Learning from Demonstration via Spatiotemporal Tubes for Unknown Euler-Lagrange Systems

Ratnangshu Das, Puneeth Shankar, Varuni Buereddy, Ravi Prakash, Pushpak Jagtap

Robert Bosch Centre for Cyber-Physical Systems

2026-07-02模仿学习

针对传统模仿学习中“先生成轨迹、再由控制器跟踪”导致忽视动力学约束和时变容差的问题,本文将示教数据学习为时空管,用异方差高斯过程表达任务意图包络,并设计无需显式辨识的闭式受限控制律保持管不变性。移动机器人和7自由度机械臂实验显示,其在扰动下跟踪更稳,计算时间较基线降低约三个数量级。

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping Figure 1
2026-07-02cs.RO

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping

Jian Song, Tian Zi, Shen Guanting

2026-07-02机器人视觉语言视觉感知

本文关注机器人操作中“技术指标提升是否能被用户感知”的问题,而非再提出新系统。作者将原有语音、视觉、语言和模糊控制流水线与由 Grounding DINO+SAM、Qwen 3.5 9B 改进的配置做被试内比较,发现15个百分点的任务成功率增益能转化为显著更高的速度、可靠性和流畅性评分,24名参与者中17人偏好改进系统。

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning Figure 1
2026-07-02cs.RO

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

Department of Computer Science, National Tsing Hua University, NVIDIA AI Technology Center (NVAITC)

2026-07-02视觉语言视觉感知强化学习

这篇论文针对视觉复杂、目标抽象的强化学习任务中奖励难手工设计且绝对状态打分不稳定的问题,提出 VLM-AR3L:用视觉语言模型生成偏好标签,同时学习单状态的绝对奖励与相邻观测进退关系的相对奖励,并用孪生网络降低在线 VLM 查询成本。实验覆盖经典控制、操作和 Minecraft 等开放式任务,结果显示其较既有 VLM 奖励学习方法更稳定,部分场景还超过人工设计奖励。

Search-Based Spatiotemporal and Multi-Robot Motion Planning on Graphs of Space-Time Convex Sets Figure 1
2026-07-02cs.RO

Search-Based Spatiotemporal and Multi-Robot Motion Planning on Graphs of Space-Time Convex Sets

Jingtao Tang, Zining Mao, Lufan Yang, Hang Ma

Simon Fraser University, Canada

2026-07-02机器人规划控制优化算法

这篇论文针对连续空间中动态障碍与多机器人协同带来的时空可行域短暂、狭窄且难以搜索的问题,提出空间-时间凸集图 ST-GCS,将轨迹规划转化为带路径索引状态的最佳优先搜索,并用连续优化评估部分路径;同时通过精确凸分解保留已规划轨迹占用,实现动态障碍和机器人交互的统一处理。实验显示其在单机器人和多机器人任务中相较多类规划器显著加速且保持较高解质量,规模演示可在数分钟内协调最多 100 个机器人。

Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications Figure 1
2026-07-02cs.RO

Learning Gait-Aware Quadruped Locomotion with Temporal Logic Specifications

Merve Atasever, Cagan Bakirci, Alfredo Reina Corona, Keyan Azbijari, Jyotirmoy V. Deshmukh

Department of Electrical Engineering and Computer Sciences, University of California Berkeley, University of Southern California, Los Angeles, California, USA

2026-07-02机器人

这篇论文针对四足机器人强化学习奖励手工调参、难解释且难显式控制步态切换的问题,将行走-小跑、小跑、跳跃等速度区间的接触同步、安全、跟踪和力矩约束写成参数化 STL 规范,并用鲁棒度生成可微的密集奖励训练单一 PPO 策略。在 Barkour/MJX 仿真中,相比启发式奖励,STL 奖励在多速度命令下给出更稳定训练和更高速度跟踪成功率;但结果仍限于仿真,sim-to-real 与地形相关切换文中未充分说明。

Robust Operational Space Control with Conformal Disturbance Bounds for Safe Redundant Manipulation Figure 1
2026-07-02cs.RO

Robust Operational Space Control with Conformal Disturbance Bounds for Safe Redundant Manipulation

Wenhua Liu, Fan Zhang, Qin Lin

2026-07-02机器人规划控制学习理论安全鲁棒

面向冗余机械臂在人机交互和受限环境中的任务空间跟踪与安全约束,论文指出传统 OSCTC 依赖精确动力学、残差学习又需噪声较大的全状态且缺少保证。其核心是用 ESO 在操作空间估计集中扰动,并结合鲁棒 CBF 与滑动窗口共形预测在线给出扰动变化界,降低固定保守界带来的保守性。FR3 实验显示在多类扰动下可实现毫米级跟踪,并以 1 kHz 运行保持安全控制。

Unleashing More Actions via Action Compositional Training for VLA Models Figure 1
2026-07-02cs.RO

Unleashing More Actions via Action Compositional Training for VLA Models

Kai Peng, Jie Lu, Xiaojiang Peng

2026-07-02机器人

这篇论文针对VLA模型在机器人操作中容易记住固定物体—目标配对、难以组合已学子技能的问题,提出ACT-VLA:利用已有任务的文本潜表示插值,离线合成物理可行的组合示范,再并入常规训练,无需额外遥操作或改模型结构。在LIBERO仿真中,该方法显著提升组合OOD成功率,Spatial-OOD和Goal-OOD分别提高52.7和49.0个百分点,但真实机器人效果仍文中未充分说明。

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning Figure 1
2026-07-02cs.RO

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

2026-07-02规划控制安全鲁棒

多机械臂实时规划面临集中式难扩展、去中心化又依赖他臂可预测的问题。NeHMO将神经Hamilton-Jacobi可达性用于学习最坏情形臂间安全值函数,并引入物理先验与结构对称性提升DeepReach在高维关节空间的效率,再嵌入去中心化轨迹优化。实验覆盖最高五臂30DoF、异构和近对抗场景,报告优于现有基线。

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs Figure 1
2026-07-02cs.CV

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

2026-07-02机器人

面向边缘机器人,论文关注小型多模态大模型接入触觉后易遗忘原有视觉语言能力的问题。Splash 用视觉相对重要性评估参数,将关键子空间冻结、仅更新休眠子空间及轻量触觉前端,在不增加 LLM 推理开销的单阶段训练中完成触觉对齐。实验称其在 SSVTP、TVL、TacQuad 上达到 SOTA,且较好保留通用视觉语言能力。

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models Figure 1
2026-07-02cs.RO

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

Honda Research Institute (HRI), San Jose, CA 95134, USA., Drexel University, Philadelphia, PA 19104, USA., prompt (center left) containing the ground-truth agent class and task instructions. GPT-5 operates as a semantic annotator

2026-07-02视觉语言视觉感知规划控制

这篇论文针对自动驾驶中“并非所有遮挡都同样影响规划”的问题,提出用 Planning KL-divergence 从 nuScenes/Occ3D 中筛选并排序对自车轨迹最关键的隐藏智能体,再借助 GPT-5 生成结构化视觉证据与风险标注来训练 VLM。实验显示,PKL 引导数据微调能显著提升各类 VLM 的遮挡风险识别能力,小模型微调后可超过更大的零样本模型,且相较随机采样约有 30% 性能增益。

ASPIRE: Agentic /Skills Discovery for Robotics Figure 1
2026-07-02cs.RO

ASPIRE: Agentic /Skills Discovery for Robotics

Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

2026-07-02机器人

ASPIRE针对机器人编码智能体只能获得粗粒度成败反馈、且跨任务经验无法积累的问题,提出带细粒度多模态执行轨迹的闭环调试引擎、可检索技能库和进化式程序搜索,把验证过的失败修复沉淀为可迁移技能。实验显示其在LIBERO-Pro扰动、Robosuite双臂交接和BEHAVIOR-1K长程任务上较既有方法最高提升77、72和32个百分点,并在未见长程任务上零样本达31%成功率,另有初步仿真到真实迁移证据。

Guaranteed Escape for a Bouncing Robot in Pipe Chains Figure 1
2026-07-02cs.CG

Guaranteed Escape for a Bouncing Robot in Pipe Chains

Ahmad Kamaludeen, Somnath Kundu, Yeganeh Bahoo

∗Toronto Metropolitan University, Toronto, ON M5B 2K3

2026-07-02机器人

这篇论文关注无传感器“弹跳”机器人在正交管道链中如何保证找到出口,动机来自管道、风道等受限环境中的极简导航。核心做法是把反射轨迹转化为几何/数论条件,完整枚举单段末端方块内的九类轨迹,并据此分析 L 形管道与 k 段正交链。主要结果包括证明 α=π/4 时必能一次通过并逃逸、无理斜率保证退出、有理斜率情形可判定,且结论可扩展到圆弧连接处。

ELMP: Efficient Learning for Motion Planning via Analytical Policy Gradients Figure 1
2026-07-02cs.RO

ELMP: Efficient Learning for Motion Planning via Analytical Policy Gradients

Yixiao Li, Tifanny Portela, Jordis Herrmann, René Zurbrügg, Marco Hutter

This work was primarily supported by the ETH AI Center. 1 Robotic Systems Lab, ETH Zürich

2026-07-02强化学习规划控制优化算法

针对神经运动规划器迁移到新环境时依赖昂贵专家轨迹、且难处理可变工具几何的问题,ELMP在行为克隆预训练后,通过可微运动学层和解析策略梯度,用碰撞、到达目标与平滑性损失进行自监督微调,并以点云显式编码工具和整条运动链。结果显示其平均成功率达84.8%,未见环境中微调可由57.3%提升到89.8%,同时保持毫秒级推理并完成真实Franka验证。

HydraCollab: Adaptive Collaborative-Perception for Distributed Autonomous Systems Figure 1
2026-07-02cs.RO

HydraCollab: Adaptive Collaborative-Perception for Distributed Autonomous Systems

Luke Chen, Cheng-Ju Wu, David R. Martin, Qilin Ye, Pramod Khargonekar, Mohammad Abdullah Al Faruque

Department of Electrical Engineering and Computer Science, University of California, Irvine, USA.

2026-07-02机器人

HydraCollab针对多机器人协同感知中“传得越多越准但带宽越高”的矛盾,提出按协作收益选择传感器特征,并用空间置信图在重叠高置信区域做中间协作、其余区域转向后期结果协作。其洞察是噪声传感器和非重叠特征会浪费通信甚至伤害检测。在V2X-R、V2X-Radar和UAV3D-mini上,相比Where2comm仅用41%/26%带宽且精度略升约0.78%/0.75%。

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning Figure 1
2026-07-02cs.RO

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

2026-07-02机器人强化学习三维

面向月面长期任务中多机器人搬运载荷的强耦合、接触阶段差异和安全同步难题,本文将任务拆成抬升、运输、放置三个强化学习阶段,用联合状态集中训练、分布式执行,并以确定性 MDP 阶段门控和同步停机机制连接。仿真与 JAXA 类月面硬件实验显示三阶段均可稳定完成,单一端到端策略则未收敛,说明收益主要来自阶段分解缓解异质动力学下的训练干扰。

Dual-Informed Vertical Expansion for Multi-Objective Node Selection in Anytime Conflict-Based Search Figure 1
2026-07-02cs.RO

Dual-Informed Vertical Expansion for Multi-Objective Node Selection in Anytime Conflict-Based Search

Willem van Osselaer, Jiarui Li, Meshal Alharbi, Gioele Zardini

The authors are with the Laboratory for Information and Decision Sys-, tems, Massachusetts Institute of Technology, Cambridge, MA, USA (e-mails:, Science Hub, hosted in the MIT Schwarzman College of Computing, and, the real-time window available for replanning, and whether

2026-07-02机器人

面向多机器人路径规划中 CBS 在内存、实时可用解与最优性证明之间的取舍,论文把高层节点选择从实现细节提升为可替换策略,并提出 DIVE:在全局最优下界处重新锚定、在一次 dive 内沿有前景子节点纵向推进,同时用 incumbent 剪枝控制偏离。理论上证明遍历顺序不影响精确性,实验显示其显著减少 dive 中断、早期给出带 gap 的可行解,并比 best-first 使用更小队列。

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning Figure 1
2026-07-02cs.RO

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning

Skand Peri, Hung Nguyen, Chanho Kim, Li Fuxin, Stefan Lee

Oregon State University

2026-07-02强化学习三维

这篇论文针对视频或部分点云世界模型在遮挡下几何不一致、长时序误差累积的问题,提出先从单视角 RGB-D 补全物体点云,再在完整 3D 几何上学习动作条件动力学的 3DPWM。核心洞察是完整点云能让模型更稳定地推断质心、碰撞和规划代价。实验显示其在多种机械臂桌面操作中实现 100–300+ 步更可靠 rollout,提升开环/闭环规划,并展示一定 sim-to-real 迁移,但失败仍受分割、点云补全和规划延迟影响。

Iterated Invariant EKF for 3D Landmark-Aided Inertial Navigation Figure 1
2026-07-02cs.RO

Iterated Invariant EKF for 3D Landmark-Aided Inertial Navigation

Hilton Marques Souza Santana, João Carlos Virgolino Soares, Marco Antonio Meggiolaro

2026-07-02机器人三维

针对三维地标辅助惯性导航中传统 SO(3)-EKF 易在不可观方向产生虚假可观测、导致协方差过度自信的问题,论文首次将迭代不变 EKF 系统化用于已知地标地图下的 MAV 3D 定位。其核心是在李群不变误差框架上加入迭代更新,使估计更贴合观测流形并约束不确定性。Monte Carlo 仿真显示,相比 SO(3)-EKF、迭代 SO(3)-EKF 和 IEKF,IterIEKF 在轨迹精度、一致性及 IMU 偏置估计上更优,位置和速度误差约降 80%。

Stop Pretending Social Robots Are Inevitable Figure 1
2026-07-02cs.RO

Stop Pretending Social Robots Are Inevitable

Serge Thill

Donders Institute for Brain, Cognition, and Behaviour, Radboud University Nijmegen

2026-07-02机器人

本文动机是反驳 HRI/RO-MAN 等领域将“社会机器人必然进入社会”当作默认前提的叙事。核心洞察在于,这种框架会诱导脱离真实需求的想象式用户研究,弱化技术能力与社会必要性的检验。主要结果是提出一种依赖性测试:若未来人机社会并未出现,研究是否仍有贡献,并建议把 HRI 重新聚焦到支撑真实“交互”的认知机制上。

AD-MPCC: Adaptive Differentiable Model Predictive Contouring Control for Autonomous Racing Figure 1
2026-07-02cs.RO

AD-MPCC: Adaptive Differentiable Model Predictive Contouring Control for Autonomous Racing

Nam T. Nguyen, Binh Nguyen, Ahmad Amine, Thanh Vo-Duy, Rahul Mangharam, Truong X. Nghiem

Department of Electrical and Computer Engineering, University of, Department of Electrical and Systems Engineering, University of Penn-, CTI Lab4EV, School of Electrical and Electronic Engineering, Hanoi, University of Science and Technology, Hanoi 10000, Vietnam., where lr and lf are the distances from the center of gravity

2026-07-02规划控制

面向自动赛车在多路面下轮胎-地面相互作用变化导致模型失配和MPCC权重失效的问题,论文提出AD-MPCC:在线用带先验正则的MHE估计Pacejka参数,并通过可微MPCC生成权重调节,再用Pacejka信息机器学习近似以满足实时部署。F1TENTH仿真中,其单一路面圈速较标准MPCC快约11秒,且是唯一完成未知多路面赛道的方法,但结果仍限于仿真数据。

Learning Expert Strategy for Autonomous Robotic Endovascular Intervention via Decoupled Procedural Execution Figure 1
2026-07-02cs.RO

Learning Expert Strategy for Autonomous Robotic Endovascular Intervention via Decoupled Procedural Execution

Yanxi Chen, Tianliang Yao, Shaolong Tang, Jiyuan Zhao, Hengyu Hu, Zhaoxing Li, Antonio J. Sánchez Egea, Peng Qi

School of Mechanical Engineering, Tongji University, Shanghai 200092, China, Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China, School of Mechatronic Engineering and Automation, Shanghai University, Shanghai 200444, China, Department of Mechanical Engineering, Universitat Politècnica de Catalunya (UPC), Barcelona 08034, Spain.

2026-07-02机器人

面向血管内介入中导丝操作难、人工经验差异大且纯强化学习难以满足安全约束的问题,论文提出将高层导航策略与低层执行解耦:RL 负责生成全局意图,专家规则/MPC模块再约束运动学、曲率和血管边界。仿真与真实机器人实验显示成功率超过96%,操作步数减少29.3%,轨迹方差降低13%,说明该框架可提升自主介入的效率与一致性。

Optimal any-angle path planning in static and dynamic environments Figure 1
2026-07-02cs.RO

Optimal any-angle path planning in static and dynamic environments

Yiyuan Zou, Clark Borst

Control and Simulation, Faculty of Aerospace Engineering, Delft University of Technology, Delft, The Netherlands

2026-07-02规划控制

本文针对网格任意角路径规划中“最短路径可保证但难扩展到动态障碍”的问题,提出椭圆前向扩展与视场可见性检查,并用反向/前向扫描整合为 Zeta* 与 Zeta*-SIPP。结果显示,静态场景性能接近 Anya且更易扩展;动态场景中 Zeta*-SIPP 平均比 TO-AA-SIPP 快20倍以上,同时保持最优性。

Solution space path planning for supporting en-route air traffic control Figure 1
2026-07-02cs.AI

Solution space path planning for supporting en-route air traffic control

Yiyuan Zou, Wenying Lyu, Clark Borst

Control and Simulation, Faculty of Aerospace Engineering, Delft University of Technology, Delft, The Netherlands

2026-07-02规划控制

面向航路空管中算法难被管制员采纳的问题,论文将可解释的“解空间”显示转化为冲突规避路径规划框架,显式枚举安全可行动作,并结合距离、时间区间和区域三类意图冲突检测,提出顶点/边搜索两种 SSPP。MUAC Delta 扇区实验显示,顶点版配区域检测平均 3.69 ms 出路,约快于边版 3.77 倍,且能支持实时 what-if 探查与目标权衡。

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration Figure 1
2026-07-02cs.RO

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration

Xinghao Zhu, Zixi Liu, Shalin Jain, Chenran Li, Milad Noori, Huihua Zhao, John Welsh, Michael Andres Lin, Wei Liu, Tingwu Wang, Xingye Da, Zhengyi Luo, Vishal Kulkarni, Naema Bhatti, Yuke Zhu, Linxi Fan, Bowen Wen, Danfei Xu, Soha Pouya, Yan Chang

2026-07-02机器人模仿学习

这篇论文针对人类示范难以直接迁移到灵巧机器人手的问题,提出 CHORD:不再要求机器人复现人手轨迹或接触位置,而是在以物体为中心的接触力旋量空间中对齐可诱导的运动效果,并作为强化学习奖励。作者构建 4739 个双手灵巧操作任务,在 1831 个任务上取得 82.12% 平均成功率,且能扩展到全身操作和真实机器人部署;但部分收益可能也来自大规模任务与数据构建。

Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning Figure 1
2026-07-02cs.RO

Joint Discovery of Object and Action Symbols through Effect Prediction for Robotic Manipulation Planning

Burcu Kilic, Berke Kartal, Fatih Dogangun, Erhan Oztop, Emre Ugur

Bogazici University, 2 Ozyegin University, 3 Osaka University.

2026-07-02机器人规划控制

面向长时程机器人操作中连续感知运动空间难以直接规划的问题,本文主张从交互后果而非外观来形成符号。方法用带二值瓶颈的编码-解码模型,从随机操作数据中联合发现物体类别与动作原语,并预测运动、接触和力反馈轨迹;规划时利用预测轨迹的中间点执行部分动作,实现更精细控制。桌面重定位和堆叠实验显示,该效应驱动规划在已见和新物体上均优于扩散策略及视觉分类基线,少样本泛化也更依赖行为相似性。

A Unified Benchmark for RCM-Constrained Visual Servoing: Modeling-Controller Interaction and Robustness Analysis in Laparoscopic Robots Figure 1
2026-07-02cs.RO

A Unified Benchmark for RCM-Constrained Visual Servoing: Modeling-Controller Interaction and Robustness Analysis in Laparoscopic Robots

Jing Zhang, Mengtang Li

All authors are with School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University, Shenzhen, China.

2026-07-02机器人规划控制数据集/基准安全鲁棒

针对腹腔镜机器人自动视野调整中 RCM 约束模型与 IBVS 控制器难以公平复现比较的问题,论文构建统一速度层级基准,将三类 RCM 建模和六种控制架构纳入同一仿真框架。结果显示,切平面定义、约束维度、开闭环执行方式及奇异位形会显著改变安全性和鲁棒性,贡献更偏向可复现实验平台与建模—控制交互洞察,而非新控制算法。

Memory-Native Non-Terrestrial Networks for Embodied Intelligence Figure 1
2026-07-02cs.RO

Memory-Native Non-Terrestrial Networks for Embodied Intelligence

Chengyang Li, Yikun Wang, Jiahui He, Yujie Wan, Shuai Wang, Yuan Wu, Yik-Chung Wu, Chengzhong Xu, Huseyin Arslan

Chengyang Li, Yikun Wang, and Yik-Chung Wu are with The University of Hong Kong, Hong Kong, China., Jiahui He and Yujie Wan are with the Southern University of Science and Technology, Shenzhen, China., Shuai Wang is with the Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China., Yuan Wu and Chengzhong Xu are with the University of Macau, Macau SAR, China., Huseyin Arslan is with the Istanbul Medipol University, Istanbul, Turkey.

2026-07-02机器人

本文针对灾害、野外等场景中机器人依赖地面通信易中断,而传统非地面网络只按瞬时信道和业务需求决策的问题,提出记忆原生 NTN 框架。核心是区分环境几何/语义的物理记忆与 CSI、频谱、调度等数字记忆,并用获取、压缩、估值、更新和利用机制驱动跨层策略。在卫星具身问答仿真中,MemNTN 优于无状态 NTN 和地面方案,但具体增益来源仍需更多消融说明。

Trajectory Learning with Graph Representations for Social Robot Navigation Figure 1
2026-07-02cs.RO

Trajectory Learning with Graph Representations for Social Robot Navigation

Berke Kartal, Burcu Kilic, Yigit Yildirim, Emre Ugur

This work has been supported by the INVERSE project (no. 101136067), funded by the EU. 1 Bogazici University 2 CREATE Consortium

2026-07-02机器人规划控制

面向人群环境中机器人既要安全避障又要减少行人扰动的问题,论文用模仿学习替代依赖手工奖励的强化学习,并以图特征自编码器建模人—人/人—机器人关系,再结合轨迹级目标和共享潜变量联合预测行人与机器人轨迹,以缓解单步行为克隆的误差累积。仿真与真实数据实验显示,该方法在社交距离、碰撞和成功率等指标上优于行为克隆、扩散策略等数据驱动基线。

Urban Deceleration Behavior Modes Under Scene Context: An Early-Kinematic Classifier from Argoverse 2 Multi-Agent Trajectories Figure 1
2026-07-02cs.RO

Urban Deceleration Behavior Modes Under Scene Context: An Early-Kinematic Classifier from Argoverse 2 Multi-Agent Trajectories

Eni Solomon Laughter

School of Transportation Engineering, Chang’an University, Xi’an, Shaanxi, China, jectory data. Where simulator studies offer controllability of stimuli and counterfactual

2026-07-02强化学习

这篇论文针对城市跟驰减速行为虽常被研究但缺少清晰模式分类的问题,利用 Argoverse 2 多智能体轨迹从早期运动学信号中发现并预测减速模式。核心洞察是减速主要由少数稳定的运动学模式组织,早期 1 秒内的 jerk 是关键判别信号,场景上下文整体影响较弱。实验在 1219 个事件上得到 4 类模式,bootstrap ARI 为 0.897,早期分类 macro-F1 达 0.758,场景信息仅带来 0.059 F1 增益。

Invariant Stochastic Filtering on SE(3) for Inertial-Encoder State Estimation of Serial Rigid Manipulators Figure 1
2026-07-02cs.RO

Invariant Stochastic Filtering on SE(3) for Inertial-Encoder State Estimation of Serial Rigid Manipulators

S. Yaqubi, J. Mattila

(Corresponding author: S. Yaqubi.)S. Yaqubi and J. Mattila are with the Department of, University, Korkeakoulunkatu 6, 33720 Tampere, Finland

2026-07-02机器人

面向串联刚性机械臂在大姿态运动中融合 IMU 与编码器的状态估计难题,论文将每个连杆状态置于 SE(3) 上构造模块化 IEKF,利用群仿射误差动力学、Adjoint 协方差传递和区分陀螺/加速度计的噪声建模,避免整链单体滤波的高代价。理论上给出按连杆级联的均方最终有界性证明,数值两连杆实验显示其在位姿与 twist 估计上优于坐标 EKF 和原始测量基线。

FLYNN: Robust Neural Network for Robot Navigation using Fly Brain Topology Figure 1
2026-07-02cs.RO

FLYNN: Robust Neural Network for Robot Navigation using Fly Brain Topology

Benquan Wang, Jingdao Chen

Benquan Wang is with the Department of Computer Science Engineering, Mississippi State University, Mississippi State, MS 39762, USA

2026-07-02机器人安全鲁棒

针对导航模型在新环境、传感器退化或失明时易失效的问题,论文将果蝇全脑连接组拓扑直接约束为稀疏RNN,并把视觉等输入接入对应感觉神经元、由下行神经元输出控制。在MuJoCo导航中,FLYNN性能接近同规模手工网络,却在OOD场景和完全视觉丢失下保持可用;作者认为其鲁棒性可能来自连接组带来的模块化、冗余与线性感觉融合,但具体机制仍未充分说明。

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation Figure 1
2026-07-02cs.RO

Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation

Hadi Hajieghrary, Benedikt Walter, Paul Schmitt, Miguel Hurtado

2026-07-02规划控制

面向多无人机缆索吊运中集中式状态共享、载荷未知和安全约束难以兼顾的问题,论文提出 GPAC 分层几何控制框架:各机仅凭本地缆索测量估计有效载荷份额,并用低频邻居位置通信处理避碰,结合抗摆、ESO、并发学习和优先级 CBF 安全滤波。高保真仿真在柔性缆、风扰和传感器闭环下取得 33.8 cm 平均载荷跟踪 RMSE,但结果仍限于仿真,缆角和多约束同时激活的保证文中也承认不足。

When to Personalize Household Object Search: A Rigidity-Gated Hybrid Policy Figure 1
2026-07-02cs.RO

When to Personalize Household Object Search: A Rigidity-Gated Hybrid Policy

Xianyao Li, Yuhai Wang, Hu Xiao, Kaleb Smith, Gilbert Yang Ye, Eric Jing Du

2026-07-02强化学习

本文针对家用机器人找物中“何时需要个性化”的问题:物品位置既受房间语义影响,也受住户性格与收纳习惯影响。作者提出 PerSim,用物品“放置刚性”门控,在人群频率先验与 Big Five 特质条件先验之间切换,并用人类校准的仿真生成多日放置数据。200 人研究显示,个性化主要改善低刚性物品搜索偏好,高刚性物品用群体先验已足够;数字孪生中该混合策略降低了期望搜索成本。

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories Figure 1
2026-07-02cs.RO

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

Hassan Jaber, Refinath S N, Luca Cagliero, Christopher E. Mower, Haitham Bou-Ammar

Huawei, Noah’s Ark Lab, United Kingdom, University College London, United Kingdom

2026-07-02机器人视觉语言视觉感知数据集/基准

这篇论文针对VLA/VLM在机器人操作中缺乏精确空间关系表征的问题,提出EmbodimentSemantic数据集与基准,用有向物体-关系-物体三元组评测场景图恢复,并结合SO101实机数据与LIBERO仿真标注。结果显示,现有VLM能生成貌似合理的关系,但在深度、视角依赖和精确三元组F1上仍明显不足;将场景图注入VLA提示在部分任务提升控制表现,但也存在伤害策略的情况。

2026-07-01

69 篇
DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation Figure 1
2026-07-01cs.RO

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

Nanyang Technological University, Singapore, Beijing University of Posts and Telecommunications, Beijing, China

2026-07-01机器人视觉感知强化学习

这篇论文针对机器人操作中视频世界模型推理慢、难保留接触细节的问题,指出瓶颈在于动力学预测与高分辨率视觉合成被单一生成器耦合。DVG-WM将二者拆成低分辨率动态预览与高保真细化两阶段,并用flow matching和潜变量退化连接以重建接触结构。在LIBERO和真实平台上,其视频质量和指令跟随更好,最高实现3.97倍加速,结合动作专家真实任务成功率提升28.2%。

Freeform Preference Learning for Robotic Manipulation Figure 1
2026-07-01cs.RO

Freeform Preference Learning for Robotic Manipulation

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn

Stanford University

2026-07-01机器人

长时程机器人操作中,稀疏成功信号太弱,而单一二元偏好会把速度、安全、摆放质量等多维判断压成含混标签。本文提出 FPL,让标注者用自然语言自定义偏好轴并逐轴比较轨迹,学习语言条件奖励模型,再训练可按多轴奖励调节的策略。在四个真实和两个仿真任务上,FPL 相比稀疏奖励和传统偏好方法平均提升 38 个百分点,并展示了更密集的进度信号、组合泛化与测试时行为可控性。

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments Figure 1
2026-07-01cs.RO

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

The Hong Kong University of Science and Technology (Guangzhou), Harbin Institute of Technology, Huazhong University of Science and Technology, Beihang University

2026-07-01机器人视觉感知

针对高自由度人形机器人VLA训练中可执行观察—动作数据难以规模化的问题,论文提出 Human-as-Humanoid:借助与人类形态对齐的60自由度PrimeU、同步第一/第三视角视频、分阶段IK重定向和FK约束,把人类双手操作视频转为控制器对齐动作标签。实验显示其采集吞吐较遥操作提升4.8–7.2倍,并可在若干任务上无目标任务机器人示教部署,但精细接触任务仍依赖机器人数据校准。

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation Figure 1
2026-07-01cs.RO

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín

The University of Texas at Austin

2026-07-01机器人数据集/基准安全鲁棒

这篇论文针对家用机器人仿真只评估任务成功、却忽略真实部署中可能造成损坏的问题,提出 OopsieVerse:用 DamageSim 将接触力、温度和液体交互转化为机械、热与流体损伤信号,并配套 32 个家庭操作任务的 OopsieBench。作者在 OmniGibson 与 RoboCasa 中实现该框架,展示实时损伤反馈可收集更安全示范,损伤条件模仿学习和强化学习能降低损伤,并可用于评测 VLA 与改善部分 sim-to-real 安全性。

Adapting Generalist Robot Policies with Semantic Reinforcement Learning Figure 1
2026-07-01cs.RO

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine

2026-07-01机器人强化学习

这篇论文针对通用 VLA 机器人策略在长程、分布外任务中难以直接提示或用低层动作 RL 高效适配的问题,提出 SARL:把语言提示本身作为强化学习动作空间,在线学习哪些语义指令能调用并组合已有技能。实验称其在仿真和真实机器人上优于低层动作 RL、零样本 VLA 与 VLM 提示方案,并可在少于 100 个真实回合内完成适配。

RRT-Rope: A deterministic shortening approach for fast near-optimal path planning in large-scale uncluttered 3D environments Figure 1
2026-07-01cs.RO

RRT-Rope: A deterministic shortening approach for fast near-optimal path planning in large-scale uncluttered 3D environments

Louis Petit, Alexis Lussier Desbiens

This work was supported by the University of Sherbrooke., The authors are with the Createk Design Lab, University of Sherbrooke

2026-07-01规划控制三维

本文针对矿山采空区等大尺度、障碍较少的三维环境中,RRT 类方法找路快但收敛到短路径慢的问题,提出 RRT-Rope:先用改造的 RRT-connect 快速得到可行路径,再利用沿树枝加入的中间节点做确定性 shortcut 后处理。实验显示其在多种仿真环境中同时降低路径代价和计算时间,在典型采空区相较次优方法最高快约 70%,平均路径代价接近最优约 1.8%。

LeCropFollow: Latent Space Planning for Navigation in Unstructured Crop Fields Figure 1
2026-07-01cs.RO

LeCropFollow: Latent Space Planning for Navigation in Unstructured Crop Fields

Felipe Tommaselli, Francisco Affonso, Arthur Pompeu, Gianluca Capezzuto, Arun Narenthiran Sivakumar, Girish Chowdhary, Marcelo Becker

2026-07-01机器人规划控制

面向玉米冠层下导航中因缺株、断垄等非结构化特征导致几何行参考失效的问题,LeCropFollow不再把视觉热图压缩成关键点,而是保留完整语义热图并用TD-MPC2在潜空间中建模与在线规划。论文显示该表示可从简化仿真零样本迁移到真实田间,在常规行间表现接近现有方法,在种植空隙场景将相对关键点方法的语义失败减少约2.4倍。

MVP-Nav: Multi-layer Value Map Planner Navigator Figure 1
2026-07-01cs.RO

MVP-Nav: Multi-layer Value Map Planner Navigator

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

Shanghai Jiao Tong University

2026-07-01机器人

MVP-Nav针对RGB-only零样本目标导航缺少深度导致的物理不确定性与语义-几何错位,核心思路不是直接估深,而是借助3D基础模型将2D语义实例重投影为3D有向包围盒,并用多层价值图把MLLM语义优先级与占据约束统一到代价空间中做几何规划。实验称其在零样本ObjectNav基准上显著优于现有无深度方法,达到该类方法SOTA。

Learning Locomotion on Discrete Terrain via Minimal Proximity Sensing Figure 1
2026-07-01cs.RO

Learning Locomotion on Discrete Terrain via Minimal Proximity Sensing

Jiale Fan, Connor Flynn, Tianao Xu, Junzhe He, Andrei Cramariuc, Marco Hutter, Robert Baines

All authors are with the Robotic Systems Lab, ETH Zurich.

2026-07-01机器人

针对四足机器人在台阶、间隙等离散地形上仅靠机身深度感知易受遮挡、延迟和状态估计漂移影响的问题,本文把低成本红外 ToF 近距传感器嵌入 ANYmal 足端,用足下 4×4 预接触测距作为强化学习策略输入,并在仿真中建模噪声、延迟与失效以缩小 sim-to-real 差距。实验证明,该局部稀疏感知能提升离散地形通过鲁棒性,可作为低功耗、低延迟的全局感知补充。

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations Figure 1
2026-07-01cs.RO

CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations

Bowen Jiang, William Painter Reger, Roberto Martin-Martin

2026-07-01机器人模仿学习

CoDex针对喷瓶、胶枪等需同时“对准目标”和“触发内部机构”的灵巧功能操作,试图摆脱昂贵示教数据。其关键做法是让VLM把任务语义转成局部/全局几何约束,再用约束优化生成可功能抓取候选,并以强化学习细化成抓取-移动-触发策略。实机在6类未见物体任务上平均组合成功率73%,消融显示语义约束和最终RL阶段分别对姿态合理性与功能成功率至关重要。

Improving path-tracking performance of an articulated tractor-trailer system using a non-linear kinematic model Figure 1
2026-07-01cs.RO

Improving path-tracking performance of an articulated tractor-trailer system using a non-linear kinematic model

Marina Murillo, Guido Sanchez, Nestor Deniz, Lucas Genzelis, Leonardo Giovanini

Research Institute for Signals, Systems and Computational Intelligence, sinc(i), FICH-UNL/CONICET, Ciudad Universitaria UNL, 4 ∘ 4^{\circ} piso FICH, (S3000) Santa Fe, Argentina.

2026-07-01视觉感知

面向精准农业中拖挂农具在转弯和地头掉头时偏离拖拉机轨迹、易造成漏作或重叠的问题,论文建立了同时包含前轮转向与中央铰接转向的非线性运动学拖拉机-挂车模型,并将其嵌入NMPC,直接约束挂车而非仅控制拖拉机位置。ROS/Gazebo仿真显示,纳入挂车运动学后,直线路径和地头转弯中的挂车跟踪误差均明显降低。

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models Figure 1
2026-07-01cs.RO

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

2026-07-01视觉语言视觉感知强化学习

这篇论文针对 VLA 机器人策略长期依赖行为克隆/SFT、难以从自身失败中改进的问题,提出在 π0.5 上进行任务级 GRPO 后训练的 Z-1。其关键做法是用共享前缀与树状分支降低 rollout 成本,并结合完成度感知奖励校准及选择性联合更新 VLM 与动作专家。在仅用公开 RoboCasa 演示的设定下,Z-1 在 24 个任务上平均成功率达 80.6%,较 SFT 初始化提升 13.2 个百分点。

Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling Figure 1
2026-07-01cs.RO

Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling

Ziyan Wang, Tan Xiang, Peng Chen, Xintao Yan

The University of Hong Kong, Beihang University

2026-07-01机器人

本文关注自车中心日志训练的交通仿真器在全局闭环 rollout 中出现的局部观测—全局上下文错配:模型会把缺失原因的刹停等行为学成错误关联。核心做法 CRAFT 用基模型生成 what-if 失败样本,训练上下文偏好评估器 CPE,并在测试时重加权候选动作而不重训仿真器。实验显示其碰撞率降 31.2%、交通违规降 33.2%,且可提前预警部分异常行为。

RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation Figure 1
2026-07-01cs.RO

RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation

Xinyi Wang, Donghan Li, Zi'Ang Chen, Chong Yu, Chen Xin, Peng Ye, Yingkai Sun, Tao Chen

lFudan University, Shanghai AI Labo-, “The Chinese University of Hong Kong., advantages of simulation environments in scalability, control-, lability, and data acquisition costs, researchers have primarily

2026-07-01机器人数据集/基准

针对类人机器人灵巧操作数据稀缺、单视角视觉难以支撑复杂接触泛化的问题,RoboTacDex在Unitree G1上构建了含6k轨迹、19类任务、23种技能和22个物体的多模态数据集,同步记录多视角RGB-D、触觉与语义标注,并通过软硬件协同实现毫秒级同步。实验评测三类模仿学习模型,显示该数据能支持一定成功率和中等泛化,但具体性能增益中数据规模与多模态贡献的拆分仍不充分。

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving Figure 1
2026-07-01cs.CV

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving

Kyuhwan Yeon, Benjamin Ramtoula, Daniele De Martini

Mobile Robotics Group, University of Oxford, United Kingdom, selves become unreliable. Our project page is available at https://ori-, due to its scalability and conceptual simplicity, directly mapping raw sensor ob-

2026-07-01机器人

这篇论文针对端到端自动驾驶过度依赖当前传感器、缺乏提前预判且易受遮挡和恶劣天气影响的问题,提出将沿规划路线离线采集的街景视觉信息作为地理空间视觉先验,并通过双记忆与自适应门控注入现有规划器;在 NAVSIM-v2 上多种基线均有提升,且在传感器退化和先验不可靠时表现出更好的鲁棒性。

Reinforcement Learning-Based Control for an Inline Skating Humanoid Robot Figure 1
2026-07-01cs.RO

Reinforcement Learning-Based Control for an Inline Skating Humanoid Robot

Ethan Marot, Thomas Bi, Clemens Schwarke, Victor Klemm, Marco Hutter, Raffaello D'Andrea

Institute for Dynamic Systems and Control, ETH Zurich, Switzerland., Robotic Systems Lab, ETH Zurich, Switzerland

2026-07-01机器人强化学习规划控制

本文面向被动直排轮人形机器人的欠驱动、高不稳定滑行控制问题,提出无需人类动作数据或预设轨迹的强化学习框架,通过训练/验证使用不同轮子几何模型缓解接触伪影,并设计成功课程与滚动奖励诱导蹬滑策略。策略零样本迁移到 Booster T1,可动态平衡、转弯和抗扰,实测高速下运输成本较步行最多降低约 50%。

Autonomous UAV Navigation for Individual Wildlife Re-Identification Figure 1
2026-07-01cs.RO

Autonomous UAV Navigation for Individual Wildlife Re-Identification

Claire Sun, Tanya Berger-Wolf, Jenna Kline

The Ohio State University

2026-07-01机器人

面向野生动物个体重识别中人工采集成本高、航拍图像常缺少侧身纹理或分辨率不足的问题,本文将数据采集建模为主动感知任务,提出由YOLOv11检测、DINOv2姿态分类和“检测-转向-接近-拍摄”控制组成的无人机流程。斑马实地案例显示其较被动拍摄提高可用于re-ID的图像产出,姿态分类约75%准确,但结果仍属概念验证,端到端重识别增益和专家飞手对比文中未充分说明。

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models Figure 1
2026-07-01cs.RO

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

Harbin Institute of Technology, Great Bay University, Shanghai Jiao Tong University, Fudan University, Nanjing University

2026-07-01视觉感知

这篇论文针对VLA在插入、擦拭、装配等接触密集任务中难以及时感知滑移、卡滞和微小对齐误差的问题,提出UniTacVLA,将触觉从被动输入提升为可推理、可预测的交互线索:用统一触觉潜空间结合触觉CoT监督与粗到细未来触觉预测,并通过动作-触觉混合控制器做高频修正。真实机器人实验显示其在四类任务、干净与扰动场景下提升成功率、精度和接触鲁棒性。

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization Figure 1
2026-07-01cs.RO

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

Jingbo He, Michael Färber, Roberto Calandra

LASR Lab, TU Dresden, Project page: https://faerber-lab.github.io/RCT/, Code: https://github.com/faerber-lab/RCT

2026-07-01机器人视觉语言视觉感知学习理论数据集/基准

面向机器人在开放环境中触碰未见材料时的泛化问题,RCT提出按完整机器人按压序列组织的触觉-视觉-语言数据集,包含122种材料、3个DIGIT传感器,并强调帧随机划分会造成近重复接触泄漏。实验显示去除接触序列重叠使触觉到文本Recall@1下降17.7个百分点,进一步留出材料后仅25.1±6.1%,揭示新材料触觉泛化仍是核心瓶颈。

FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion Figure 1
2026-07-01cs.RO

FastDSAC: Enhancing Policy Plasticity via Constrained Exploration for Scalable Humanoid Locomotion

Guanchen Lu, Yajuan Dun, Yi Zhou, Letian Tao, Jingliang Duan, Jie Li, Guofa Li

This work was supported by the State Key Laboratory of Intelligent Vehicle Safety Technology under Project No. IVSTSKL-202506. 1 Chongqing University, Chongqing 400044, China, Tsinghua University, Beijing 100084, China, University of Science and Technology Beijing, Beijing 100083, China.

2026-07-01机器人强化学习

本文针对大规模并行采样下离策略人形机器人强化学习易受目标 Q 估计噪声影响、训练不稳并损失策略可塑性的问题,提出 FastDSAC:在 Bellman 备份中用均值中心的截断高斯约束目标动作,并配合连续高斯分布式 critic 与自适应方差调节,过滤极端低概率动作但保留探索。MuJoCo Playground 与 HumanoidBench 实验显示其在高 UTD 设置下收敛更快、后期退化更少、渐近性能优于 FastTD3/FastSAC 等基线,但可塑性提升主要是间接行为证据。

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation Figure 1
2026-07-01cs.RO

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

2026-07-01机器人数据集/基准

HABIT针对现有机器人操作数据多在“无人场景”采集、难以学习避让、协作和听从人类指示的问题,构建了含人在场的交互示范数据集:10,563段、164小时、60个任务,并按协作者、共工者、监督者三类角色组织任务流程。论文的核心洞察是把“人类存在”作为数据多样性的关键维度;在π0.5和GR00T N1.6上微调后,相比无人在场基线提升成功率,并诱发同步协作、主动让行与手势定位等人本行为,还能更快适应新的人机交互任务。

DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments Figure 1
2026-07-01cs.RO

DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments

Wen Jiang, Hanfang Liang, Li Wang, Kangyao Huang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

2026-07-01机器人视觉语言视觉感知规划控制

DynFly针对无人机视觉语言导航中“高层意图到可执行连续飞行”缺少运动接口的问题,不再只预测离散动作或稀疏航点,而是在B样条控制点空间用Spline-DiT和flow matching生成轨迹,并加入位置、速度、加速度、航向和目标对齐监督。OpenUAV实验显示其提升导航成功与轨迹质量,在Test Unseen Full上相对最强基线提高NDTW、SDTW、SR、OSR并降低NE。

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation Figure 1
2026-07-01cs.CV

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

Francisco S. Neves, Pedro N. Pereira, Raul D.S.G. Campilho, Andry M. Pinto

2026-07-01视觉语言安全鲁棒

面向海上设施巡检中无人机在浪涌、甲板倾斜和传感遮挡下难以安全降落的问题,论文将负担拆给USV与UAV:USV用3-RPU平台和SAC主动补偿波浪,UAV用多模态强化学习融合视觉、热成像与LiDAR完成末端进近,且两者无需主动通信。高保真仿真15次在平静到粗糙海况下均成功着陆,平均稳定化效率87.8%,粗糙海况下96%任务时间内甲板保持在水平1°以内,但真实海试仍待验证。

Stabilization Learning: A Paradigm Transition Bridging Control Theory and Machine Learning Figure 1
2026-07-01cs.RO

Stabilization Learning: A Paradigm Transition Bridging Control Theory and Machine Learning

Quan Quan

School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China, Tianmushan Laboratory, Beihang University, Hangzhou 311115, China, Zhongguancun Academy, Beijing 100094, China

2026-07-01规划控制学习理论

本文针对强化学习偏重最优性、传统控制依赖手工建模且难适应高维不确定系统的问题,提出以闭环稳定为首要目标的“稳定化学习”范式。核心洞察是把控制、观测、识别等任务统一为反馈策略使系统在扰动下收敛或有界的问题,并用六元组及含障碍/跟踪目标的扩展模型重写11类场景。主要结果是给出概念框架和问题转换路径,但实证增益与可落地性能文中未充分说明。

Communication-Aware Robot Execution for Cloud Inference under Spatially Heterogeneous Connectivity Figure 1
2026-07-01cs.RO

Communication-Aware Robot Execution for Cloud Inference under Spatially Heterogeneous Connectivity

Fengkai Liu, Yuichi Ohsita, Masayuki Murata, Hideyuki Shimonishi

2026-07-01机器人

这篇论文针对依赖云端基础模型的机器人在室内移动时遇到的空间异质无线连接问题:当前动作原语有限,下一次云推理若在弱信号区域提交或取回就会中断执行。核心做法是提出“请求—响应窗口”,把上传、云推理、下行和不确定性转化为请求点选择约束,并将通信地图下的请求点纳入 MPPI 局部规划。测量驱动实验显示,该方法在任务成功率上达到最好或并列最好,同时请求次数更少、失败率和重叠请求更低。

Robustness of Robotic Manipulation: Foundations and Frontiers Figure 1
2026-07-01cs.RO

Robustness of Robotic Manipulation: Foundations and Frontiers

Yifei Dong, Zhanyi Sun, Lujie Yang, Manuel Baum, Kei Ikemura, Shuran Song, Florian T. Pokorny, Xianyi Cheng

1 affiliationmark: Duke University, USA, 2 affiliationmark: KTH Royal Institute of Technology, Stockholm, Sweden, 3 affiliationmark: Stanford University, USA, 4 affiliationmark: Massachusetts Institute of Technology, USA

2026-07-01机器人安全鲁棒

论文针对机器人操作在真实接触、感知误差和任务变化下仍远弱于人类的问题,提出以“在不确定性与变化中达成目标”的任务中心定义,并从概率与控制视角统一形式化鲁棒性;其主要贡献是梳理感知、规划、控制、学习和硬件中的鲁棒机制,归纳不确定性调节与失效管理两类原则,同时总结评测指标与开放问题,为设计类人鲁棒操作系统提供框架。

ChronoFlow-Policy: Unifying Past-Current-Future Interaction Flow in Visuomotor Policy Learning Figure 1
2026-07-01cs.RO

ChronoFlow-Policy: Unifying Past-Current-Future Interaction Flow in Visuomotor Policy Learning

Bokai Lin, Yifu Xu, Xinyu Zhan, Hongjie Fang, Jialin Tian, Fu-Cheng Zhang, Yong-Lu Li, Cewu Lu, Lixin Yang

2026-07-01生成模型强化学习

这篇论文针对视觉运动策略中历史记忆与未来预测割裂的问题,提出用物体与夹爪的稀疏3D关键点轨迹统一表示过去、当前和未来交互流,并在扩散策略中将ChronoFlow预测与动作生成联合训练。实验覆盖14个仿真任务和5个真实操作任务,相比DP3、RISE及历史/未来建模基线更稳健,尤其改善长时程、非马尔可夫和可变形物体场景。

Energy-Optimal Spatial Iterative Learning within a Virtual Tube Figure 1
2026-07-01cs.RO

Energy-Optimal Spatial Iterative Learning within a Virtual Tube

Chen Min, Shuli Lv, Pengda Mao, Huixin Cao, Li Hong, Quan Quan

2026-07-01机器人

针对无人机续航受限且能耗优化依赖精确动力学/能耗模型、计算开销高的问题,论文提出在空间域而非时间域进行迭代学习,通过功率—速度梯度估计在虚拟管约束内逐步调整切向速度,从而避免速度变化带来的时间对齐误差。结果显示该无模型方法每轮复杂度为 O(n),在仿真和多平台实飞中接近模型优化效果,并较 IPOPT 基准快约 50–60 倍。

A Large-Language-Model Supported Personalized Driving Framework for Lane Change in Highway Scenarios Figure 1
2026-07-01cs.RO

A Large-Language-Model Supported Personalized Driving Framework for Lane Change in Highway Scenarios

Dong Bi, Yongqi Zhao, Paul Kovacevic, Tomislav Mihalj, Ji Zhou, Jiayuan Gong, Arno Eichberger

2026-07-01机器人

针对自动驾驶变道中用户偏好难以从自然语言、尤其隐含表达转为可执行行为的问题,论文将 LLM/RAG 与 Apollo 规划参数映射结合,把指令解析为激进、正常、保守及不同强度的变道参数集。实验显示这些参数能产生可区分的个性化变道行为,RAG 对隐含偏好识别提升更明显,但真实道路泛化与安全验证文中未充分说明。

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation Figure 1
2026-07-01cs.RO

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

2026-07-01视觉语言

针对触觉模型常把理解与生成分开、且难以跨 GelSight/DIGIT 等传感器泛化的问题,UniTac 将触觉建模为从非接触到接触的过程,同时显式编码传感器配置与物体属性;通过物体属性描述、传感器识别、两阶段生成对齐和传感器先验采样,在多传感器大规模数据上提升 PHYSICLEAR 理解性能,并生成更高 SSIM/PSNR 的跨传感器触觉信号。

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation Figure 1
2026-07-01cs.RO

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

2026-07-01视觉语言视觉感知

这篇论文针对VLA模型参数庞大且剪枝后常需再微调恢复的问题,质疑现有方法是否真正识别了冗余参数。作者从VLM到VLA适配过程中的参数差异入手,用无恢复的受控剪枝验证不同模块中参数变化与功能重要性的关系,指出冗余具有明显模块异质性。基于此设计联合剪枝策略,在LIBERO上使OpenVLA和π0.5减少12%–30%参数,同时保持约90%原始性能。

Stage-Transition Dense Reward Modeling for Reinforcement Learning Figure 1
2026-07-01cs.RO

Stage-Transition Dense Reward Modeling for Reinforcement Learning

Yang Yang, Bingjie Chen, Zihan Wang, Yizhe Li, Guoping Pan, Yi Cheng, Houde Liu

Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China.

2026-07-01强化学习

针对长程机器人操作中稀疏奖励难以探索、人工密集奖励又昂贵且脆弱的问题,本文提出 STDR,从未标注专家视频中推断任务阶段,并将阶段转移奖励与阶段内进度奖励结合,形成更符合操作逻辑的视觉密集奖励;同时加入 OOD 检测和抓取验证以抑制奖励黑客。实验覆盖 MetaWorld、ManiSkill、Franka Kitchen 的 14 个任务,显示其在样本效率和成功率上优于多种基线,部分任务达到或超过手工密集奖励,真机评估也显示奖励随成功进度更稳定。

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems Figure 1
2026-07-01cs.RO

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

2026-07-01机器人

面向工厂、远程施工等长时多机器人任务,论文关注的不只是生成分配方案,而是如何防止智能体提案破坏依赖、资源锁和安全约束。其核心是用任务森林与受控黑板同步维护任务层级和执行状态,并以派生耦合拓扑做确定性验证、原子提交和局部修复。实验覆盖室内工厂、30种子压力测试、消融与扩展性探测,报告减少无效提交、锁冲突、重复分配和破坏性修复。

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance Figure 1
2026-07-01cs.RO

3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance

Dongyoon Hwang, Byungkun Lee, Dongjin Kim, Hyojin Jang, Hoiyeong Jin, Jueun Mun, Minho Park, Hojoon Lee, Hyunseung Kim, Jaegul Choo

2026-07-01视觉感知规划控制三维

这篇论文针对分层 VLA 中“VLM 以 2D 轨迹规划、底层策略却在 3D 点云中控制”的表示错位,指出简单用深度反投影会让轨迹贴附场景表面而失真。3D HAMSTER 让规划器直接预测带度量深度的 3D 末端轨迹,并用深度编码器、稠密深度重建损失和混合数据训练保持几何与语言泛化。实验在 DroidSpatial-Bench、Colosseum 仿真和 Franka 真机上均优于 2D 引导及强 VLM 基线,尤其在外观扰动、未见语言/空间/视觉条件和需精确深度控制的任务中提升更明显。

Safe Online Learning via Smooth Safety-Structured Policy Composition Figure 1
2026-07-01cs.LG

Safe Online Learning via Smooth Safety-Structured Policy Composition

Hongpeng Cao, Liqun Zhao, Yuliang Gu, Naira Hovakimyan, Lui Sha, Marco Caccamo

School of Engineering and Design, Technical University of Munich, Department of Engineering Science, University of Oxford, Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign, Department of Computer Science

2026-07-01强化学习安全鲁棒

本文针对安全在线强化学习中“硬约束安全”与“平滑可优化”难以兼得的问题,提出 AutoSafe,将风险监测与安全干预嵌入策略生成过程,并用可微的策略组合在任务策略和安全先验之间按风险平滑切换。实验显示其在连续控制仿真中接近安全滤波器的约束满足能力,同时保持稳定学习和较好任务回报,并在实体倒立摆上验证了可行性;但方法仍依赖模型化安全设计,复杂动态场景的适用性有限。

Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning Figure 1
2026-07-01cs.RO

Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning

Xiangli Shi, Xiaomeng Zhu, Ye Tian, Yuchun Guo, Ziyang Sun, Lujie Yin, Yuxuan Zhou, Yufei Huang

Tsinghua University, The Hong Kong University of Science and Technology, University of London

2026-07-01强化学习

面向具身任务规划中LLM计划难以快速、确定性验证,而仿真又过慢的问题,论文提出以BDDL作为数据构建、计划检查和RL奖励的统一接口:从视频或任务生成并校验BDDL,用毫秒级符号引擎提供反馈,并用GroupAdapt按组通过率自适应收紧长度。实验中8B模型在BEHAVIOR-1000上Strict-Pass达97.3,相比Qwen3-8B相对提升25.9%,同时平均输出压缩到207 tokens。

TactX: Learning Shared Tactile Representations Across Diverse Sensors Figure 1
2026-07-01cs.RO

TactX: Learning Shared Tactile Representations Across Diverse Sensors

Junsung Park, Sachin Bhadang, Carmelo Sferrazza, Sha Yi, Xiaolong Wang

Seoul National University

2026-07-01机器人

针对触觉策略常被具体传感器绑定、换硬件需重采数据和重训的问题,TactX用成对接触数据把视觉、磁、阻式三类触觉经专属编码器对齐到共享潜空间,并结合对比学习与自/交叉重构保留接触信息。实验显示该表示可弱化传感器身份、保留物体级信息,并在抓放、插接、擦拭、重定向中实现跨传感器零样本迁移,平均成功率由视觉基线27.5%提升到45.9%。

Information-Aided DVL Calibration Figure 1
2026-07-01cs.RO

Information-Aided DVL Calibration

Zeev Yampolsky, Itzik Klein

2026-07-01机器人

本文针对AUV中DVL标定依赖水面GNSS、在遮蔽环境下只能使用未标定速度而导致漂移的问题,提出信息辅助标定:在有GNSS时引入近似零速度约束增强Kalman标定,在无GNSS时用简化误差模型和速度分量假设重构参考速度实现自标定。真实海试中,有GNSS模型较基线最高提升约20%,无GNSS自标定平均提升约30%、最高约35%,但效果依赖DVL安装轴向和速度近似假设。

Long-term Traffic Simulation via Structured Autoregressive Modeling Figure 1
2026-07-01cs.AI

Long-term Traffic Simulation via Structured Autoregressive Modeling

Lingyu Xiao, Zexin Feng, Xintao Yan

2026-07-01机器人

面向自动驾驶长时闭环仿真中车辆进出导致的动态多智能体交互难题,论文将路网拓扑、车辆状态与生成意图组织为可变长结构化自回归序列,并指出离散运动 token 与语言分布及注意力局部性相似,使冻结小型 LLM 也能迁移建模。RosettaSim 在 WOSAC 短期与长时仿真上达到 SOTA,并提出基于相似场景检索的 RTE,和标准指标相关性从 0.74 提升到 0.83。

Machine Learning-based Feedback Linearization Control of Quadrotor Subject to Unmodeled Dynamics Figure 1
2026-07-01cs.RO

Machine Learning-based Feedback Linearization Control of Quadrotor Subject to Unmodeled Dynamics

Amos Alwala, Gabriel da Silva Lima, Wallace Moreira Bessa

2026-07-01规划控制

针对四旋翼在气动阻力、执行器动态和外部扰动等未建模因素下反馈线性化性能下降的问题,论文将高斯 RBF 神经网络嵌入李雅普诺夫反馈线性化控制,在线自适应补偿非线性不确定性,并结合 SO(3) 几何姿态构造处理平动—转动耦合。Crazyflie 2.1 的 Gazebo 与实飞结果显示,相比基线反馈线性化,位置范数 RMSE 降低约 7.13%,偏航 RMSE 降低约 49.27%。

Diffusion-based 4D Trajectory Prediction and Distributed Control for UAV Swarms Figure 1
2026-07-01cs.RO

Diffusion-based 4D Trajectory Prediction and Distributed Control for UAV Swarms

Tianshun Li, Hongliang Lu, Haoang Li, Xinhu Zheng

∗ Corresponding author. 1 Tianshun Li is with The Hong Kong University of Science and Technology (Guangzhou), China

2026-07-01生成模型规划控制

面向低空复杂环境中无人机群的4D轨迹预测与编队跟踪,论文指出仅做离线预测难以处理强耦合、扰动和实时控制约束。其核心是先按空间轴解耦做粗预测,再用扩散模型细化残差动力学,并将结果接入分布式NMPC闭环控制。实验在自建三机多场景数据集上显示,跟踪误差较基线降低约10–15%,复杂场景平均误差低于0.07米,推理约34 FPS。

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents Figure 1
2026-07-01cs.RO

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

College of Information Science and Engineering, Ritsumeikan University, Japan, College of Computer Science and Technology, Zhejiang University, China

2026-07-01视觉语言视觉感知

MIRTH针对现有VLA单帧输入导致的时间短视、高层指令到低层动作缺少中间规划、以及自回归动作解码效率低的问题,在预训练VLA上加入长短期双尺度时间记忆枢纽、互信息约束的潜在推理token和并行动作解码。作者在LIBERO仿真与真实LeRobot平台上验证其优于单帧和朴素多帧基线,并表现出遮挡后恢复等错误修正能力。

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music Figure 1
2026-07-01cs.RO

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

Snehasis Banerjee, Ranjan Dasgupta

2026-07-01机器人视觉语言

这篇论文针对传统机器人交互依赖固定指令、难以理解人类多模态意图的问题,提出用 LLM 融合语音、手势与音乐节拍来生成四足机器人动作序列。核心做法是将 Whisper 转写、手势识别和节拍检测结果结构化后输入受限动作空间中的 LLM 规划器,并经动作队列和验证器执行。初步 Unitree Go2 实验展示了按手势触发、随节拍完成倒立等能力,但评估规模较小,真实增益和鲁棒性文中未充分说明。

A Modular Vision-Language-Action Robotics Framework for Indoor Environments Figure 1
2026-07-01cs.RO

A Modular Vision-Language-Action Robotics Framework for Indoor Environments

Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta

2026-07-01机器人视觉语言视觉感知

针对室内机器人难以将自然语言指令落到全局空间记忆与动作执行的问题,本文从无记忆 VLM 失败经验出发,提出 ROS 模块化 VLA 框架:限时探索中构建带 OwlViT 嵌入的语义体素地图,并用 Gemini 分类意图、结合地图生成动作提示。结果是在 CMU VLA 任务中形成可处理计数、目标定位和航点导航的完整闭环;但文中未充分说明定量指标与相对基线增益。

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies Figure 1
2026-07-01cs.RO

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

Carnegie Mellon University

2026-07-01生成模型规划控制

机器人生成式控制策略在测试时可通过更多去噪步数或并行采样提升表现,但固定计算预算会带来不必要延迟。ELASTIC的核心是把顺序/并行算力分配建模为meta-MDP,用强化学习在冻结基策略上按状态自适应调度。仿真中其在相同预算下优于固定和单轴scaling基线,真实π0.5操作中达到best-of-10成功率并降低34%延迟。

Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records Figure 1
2026-07-01cs.AI

Scenario Generation for Testing of Autonomous Driving Systems Using Real-World Failure Records

Anjali Parashar, Chuchu Fan

2026-07-01强化学习

本文针对自动驾驶测试依赖人工场景模板、难以覆盖真实失效情境的问题,提出从 NHTSA 事故记录中抽取类别变量与叙事信息,并用模块化 LLM 流水线生成适配具体仿真约束的测试场景。方法在 Metadrive 中覆盖 4 类道路、3 类他车运动及施工区异常,20 个场景中 17 个完全匹配模板,并暴露 IDM 策略的碰撞、近碰撞和避障振荡等问题。

What Probing Reveals about Autonomous Driving: Linking Internal Prediction Errors to Ego Planning Figure 1
2026-07-01cs.RO

What Probing Reveals about Autonomous Driving: Linking Internal Prediction Errors to Ego Planning

Hyeonchang Jeon, Kyungbeom Kim, Eugene Vinitsky, Kyung-Joong Kim

Gwangju Institute of Science and Technology (GIST), New York University

2026-07-01规划控制

本文针对自动驾驶策略在闭环指标表现良好却可能依赖脆弱启发式的问题,研究其内部是否真正形成周车预测与自车规划能力。作者用线性 probing、周车移除扰动和决策时表征干预分析 BC/IL/RL 模型随数据与训练规模变化的内部信号。结果显示,规模增大能增强规划表征并减少对无关车辆的依赖,但模型在近碰撞场景常过晚识别安全关键车辆;同时,纠正错误周车预测可把自车计划拉回更安全轨迹,说明预测错误会因果影响规划。

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors Figure 1
2026-07-01cs.RO

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

Purdue University, Robotics and AI Institute

2026-07-01强化学习

这篇论文针对真实机器人示教昂贵、仿真到真实迁移困难的问题,检验世界-动作模型能否仅凭合成先验实现零样本操作。作者将 Cosmos Policy 与大规模域随机化、AnyTask 自动生成示教结合,每个任务约 800 条仿真数据,无真实示教;在 Franka 上四类任务平均成功率达 35%,并展示未见瓶子的定性泛化。但实验规模较小,且各因素增益来源文中未充分说明。

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning Figure 1
2026-07-01cs.AI

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning

Sheng Zhang, Qinglin Li, Yuechao Zang, Xueqin Huang, Yijia Fu, Cheng Zhu

2026-07-01规划控制数据集/基准

该文针对现有无人机仿真偏重低层控制、LLM Agent 基准难覆盖多机协同约束的问题,提出面向大模型的 MultiUAV-Plat 平台、含 75 个任务会话与 9396 项检查的基准,以及结构化的 Agent4Drone 框架,在受限 API、局部观测和隐藏验证下评估闭环规划;实验中 Agent4Drone 任务通过率 57.9%,显著高于 ReAct 的 30.6%。

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation Figure 1
2026-07-01cs.CV

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

Bing Wu, Zuyao Chen, Changwen Chen

2026-07-01机器人规划控制三维

这篇论文针对零样本语义导航中过度依赖局部观测与贪心搜索、长距离任务易反复回退的问题,提出在线增量构建对象—区域—大区层级3D场景图,并在其上融合LLM语义先验与探索证据进行信念规划,通过HSG模拟器和有限步POUCT评估宏动作长期收益。实验称在多任务多数据集上优于现有方法,长距离场景SR和SPL平均提升9.4%与5.0%。

Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation Figure 1
2026-07-01cs.LG

Warp RL: Reshaping Base Policy Distributions for Dynamics Adaptation

Ethan Hirschowitz, Fabio Ramos

University of Sydney, Australia

2026-07-01强化学习

针对机器人策略在质量、接触或执行器等动力学变化下失效的问题,论文指出传统残差 RL 只能平移动作分布,无法修正方差、置信度和非均匀几何错配。Warp RL 用状态条件的可逆样条流重塑基策略分布,并保留恒等初始化,严格包含加性残差。实验显示其在 ManiSkill3 多个操作任务中在需分布重塑时明显优于残差方法,真实插 peg 任务成功率相近且完成时间缩短约 30%。

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory Figure 1
2026-07-01cs.RO

Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory

Yuhan Wu, Zhao Jin, Tao Li, Yuheng Zhang, Zhengping Che, Jian Tang, Zhichao Wang, Shuo Wang, Jun Jiang, Xiaobo Li, Yanyong Zhang, Yan Xia

University of Science and Technology of China, Beijing Innovation Center of Humanoid Robotics

2026-07-01机器人数据集/基准

这篇论文针对现有实验室自动化多依赖定制机械臂、难以评估类人灵巧手在毫克级精度操作中的可靠性,提出 Labimus 基准:用真实有机化学工作站重建 30 余个功能资产,结合粉末粒子物理、仪器读数闭环和固体称量 SOP,并以完成度、精度和长程进度联合评价。实验比较 ACT、Diffusion Policy 和 π0,显示策略即使能完成操作,也常无法满足实验容差,揭示任务成功与实验有效性之间的精度缺口。

Ground Plane-Aided Extrinsic Calibration of Inertial and RGB-D Sensors for Uncrewed Aerial Vehicles Figure 1
2026-07-01cs.RO

Ground Plane-Aided Extrinsic Calibration of Inertial and RGB-D Sensors for Uncrewed Aerial Vehicles

Ilyar Asl Sabbaghian Hokmabadi, Mahdis Bisheban

2026-07-01机器人

针对无人机 IMU 与 RGB-D 相机外参标定依赖棋盘格、视觉特征和轨迹估计的问题,论文利用室内地面法向应与重力方向一致的几何约束,通过深度学习分割地面、由深度点云估计法向,并与加速度计重力向量做鲁棒配准来求传感器相对姿态。实验显示该无靶方法优于 MATLAB 工具箱,精度接近 Kalibr,且不需专用标定板。

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force Figure 1
2026-07-01cs.RO

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

Stanford University

2026-07-01机器人

这篇论文针对机器人视觉预训练策略难以感知接触力、而多传感数据又稀缺的问题,提出多感知持续学习框架 MuSe:在视觉动作模型上后接力/力矩传感,通过多阶段融合、多模态未来预测和预训练数据回放减少遗忘。真实操作实验显示,它提升接触丰富任务表现,并在原视觉任务上保持甚至提高成功率,还能在未标注力数据的任务上预测力信号。

Motion Planning in Compressed Representation Spaces Figure 1
2026-07-01cs.RO

Motion Planning in Compressed Representation Spaces

Lukas Lao Beyer, Sertac Karaman

2026-07-01规划控制

针对传统规划易融入目标但缺少数据先验、学习式规划又常把任务目标固化在训练中的矛盾,本文把轨迹压缩为环境条件下的有序离散 token,并在测试时对 latent token 做解码-打分的贪心搜索,从而支持非可微或临时指定目标。作者在 nuPlan 和 Waymo 上展示了闭环规划与多智能体场景生成效果,无需任务特定训练,但实验主要限于自动驾驶。

The Quadruped Soft Tail: Compliant Grasping and Swabbing for Contamination Surveys in Harsh Environments Figure 1
2026-07-01cs.RO

The Quadruped Soft Tail: Compliant Grasping and Swabbing for Contamination Surveys in Harsh Environments

Harald Minde Hansen, Nandita Gallacher, Kristin Y. Pettersen, Jan Tommy Gravdahl, Mario di Castro

2026-07-01机器人

面向 CERN 放射性、线缆密集环境中的铍污染取样,论文提出在四足机器人上加装轻量柔顺的腱驱动软尾,并集成软夹爪、闭式运动学模型与抗奇异任务空间控制,使其可遥操作完成取纸、擦拭墙面和投放样本。实验显示夹爪动作对尾部形状影响很小,共模腱驱动可调节预紧与刚度,模型精度足以支撑实时控制。

Sampling-Based Coordination-Informed Multi-Objective Multi-Robot Reinforcement Learning Figure 1
2026-07-01cs.RO

Sampling-Based Coordination-Informed Multi-Objective Multi-Robot Reinforcement Learning

Antonio Marino, Esteban Restrepo, Soon-jo Chung, Paolo Robuffo Giordano, Claudio Pacchierotti

2026-07-01机器人强化学习

多机器人任务常需在时间、能耗、通信与避障等目标间动态权衡,而固定偏好或集中协调难以适应部分可观测和分布式执行。论文提出 CIMORL,用本地观测与邻居通信预测目标权重,并以 MCTS/MPPI 特权专家生成训练信号,同时给出权重同步与 Pareto 最优性的联系。实验称在协作和对抗任务中超体积提升 21.2%,并在 Crazyflie 无人机上验证稳定性,但具体增益中采样专家与权重机制的相对贡献仍需更多消融支撑。

Robustness-Based Synthesis for Time Window Temporal Logic Specifications via Mixed-Integer Linear Programming Figure 1
2026-07-01cs.RO

Robustness-Based Synthesis for Time Window Temporal Logic Specifications via Mixed-Integer Linear Programming

Philip Smith, Ahmad Ahmad, Kevin Leahy

2026-07-01安全鲁棒

面向机器人顺序任务中“到达并停留于多个区域、同时满足时间窗和安全约束”的控制合成问题,本文将 TWTL 鲁棒语义递归编码为 big-M MILP,并结合 DFA 设计任务自适应 MPC 视野。实验显示,鲁棒优化路径抗扰性更好;多子任务时直接 TWTL 编码较 STL 转写更快,闭环 MPC 能在扰动后重规划且 DFA 视野降低重求解时间。

TAPE: Tether-Aware Path Planning for Autonomous Exploration of Unknown 3D Cavities Using a Tangle-Compatible Tethered Aerial Robot Figure 1
2026-07-01cs.RO

TAPE: Tether-Aware Path Planning for Autonomous Exploration of Unknown 3D Cavities Using a Tangle-Compatible Tethered Aerial Robot

Louis Petit, Alexis Lussier Desbiens

supported by the University of Sherbrooke., The authors are with the Createk Design Lab, University of Sherbrooke, maximum length of available tether, thanks to a new hierar-

2026-07-01机器人规划控制三维

面向矿山采空区等未知三维空腔,系留无人机虽能保证续航和通信,但缆绳长度与缠绕会限制探索。TAPE 的核心是把全局前沿探索建模为 TSP 以压缩航程,再用局部规划在路径代价和放缆长度间可调权衡,并允许可兼容的缠绕。仿真和实飞显示,相比仅用 TSP 路径,航程平均只增加 4.1%,但满足最大缆长约束的案例从 53% 提升到 100%。

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping Figure 1
2026-07-01cs.CV

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

Annika Thomas, Mason Peterson, Jonathan P. How

2026-07-01机器人三维

针对在线3DGS机器人建图在有限算力下仍均匀分配高斯、浪费在任务无关区域的问题,GaussLite用自然语言任务驱动注意力:LLM解析目标/参照物,结合开放词汇检测、分割和3D关系过滤生成相关性掩码,并按相关性分配种子密度、梯度和尺度。等高斯预算、4Hz实时条件下,ROI PSNR在Replica提升2.72dB、真实场景提升2.23dB,多机器人融合仅共享7.08%地图仍优于拼接3.42dB。

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations Figure 1
2026-07-01cs.RO

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations

Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque

University of California, Irvine, CA, USA

2026-07-01生成模型安全鲁棒

这篇论文关注生成式端到端自动驾驶规划器的安全鲁棒性:许多扩散式或词表检索式方法最终都依赖评分头从固定候选轨迹中选最高分,且缺少后置安全过滤。作者提出 Derail,用面向碰撞、越界和急刹等行为的可微目标攻击评分头,使安全候选被不安全轨迹替换。实验覆盖四个生成式规划器,在 NAVSIM 上达到 100% 攻击成功率,并将碰撞率提升到约 25.8%–60.4%。

Wind and State Estimation on SE(3): Comparative Evaluation of EKF and UKF with Continuous and Discrete Quadrotor Models Figure 1
2026-07-01cs.RO

Wind and State Estimation on SE(3): Comparative Evaluation of EKF and UKF with Continuous and Discrete Quadrotor Models

Hiranya Udagedara, Adam Bigsby, Mahdis Bisheban

2026-07-01数据集/基准

面向四旋翼仅依赖机载传感器进行风速估计时,非线性动力学和姿态表示会限制精度。论文在 SE(3) 上比较连续模型与基于 Lie Group Variational Integrator 的离散模型,并分别嵌入 EKF/UKF。仿真与户外自由飞行结果显示,离散 SE(3) 模型结合 UKF 在悬停和轨迹跟踪中风速与状态估计更准,且可使用低成本传感器维持跟踪性能。

Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking Figure 1
2026-07-01cs.CV

Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking

Maximilian Luz, Thomas Nürnberg, Yakov Miron, Abhinav Valada

This work was funded by the Bosch Research collaboration on AI-driven automated driving., Department of Computer Science, University of Freiburg, Germany. 2 Bosch Research, Robert Bosch GmbH, Germany. 3 University of Haifa, Israel

2026-07-01视觉感知三维

本文针对相机式 4D 全景占据跟踪中体素特征逐帧重算、遮挡和静态结构缺乏几何时序一致性的问题,提出流式 Gaussian 编码器:以固定预算潜在高斯查询维护跨帧场景状态,经自车运动补偿传播,并用由深度监督塑形的不透明度作为可见性置信来更新、裁剪和补充状态。在 Occ3D-nuScenes 和 Waymo 上达到新的相机式 4D-POT 最优结果,提升跟踪一致性且几乎不增加推理开销。

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation Figure 1
2026-07-01cs.RO

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

Robotics Institute, Carnegie Mellon University

2026-07-01机器人

这篇论文针对灵巧手工具使用中“抓住”与“会用”之间的鸿沟,提出把大规模灵巧抓取数据转化为低层控制器预训练信号,并结合高层手部子目标预测形成分层模仿学习框架。作者构建355k轨迹的G2D-Pretrain和六项铰接工具任务DexCraft,结果显示该方法在仿真和真实实验中优于端到端扩散策略与从零训练的分层策略,真实场景相对DP3全任务成功率提升33.3个百分点。

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation Figure 1
2026-07-01cs.RO

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

2026-07-01机器人视觉语言视觉感知强化学习

针对血管介入机器人在复杂、个体化血管中导航时静态奖励难以兼顾直段快速推进与分叉安全转向的问题,论文引入多模态大模型做视觉语言流程推理,不直接控丝,而是根据实时场景动态调节强化学习奖励权重。物理机器人和多种血管模型实验显示,该方法相比静态奖励提升任务可靠性与导航效率。

ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models Figure 1
2026-07-01cs.RO

ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models

Kaier Liang, Hengde Dai, Cristian-Ioan Vasile

2026-07-01机器人视觉语言视觉感知

这篇论文针对现有零样本目标导航多停留在单目标、难以执行含先后与选择约束的自然语言长程任务的问题,提出 ViTL:先用 LLM 将指令编译为 LTL 并转成 DFA 做在线子任务选择与重规划,再用带方向标注的 VLM 打分生成多通道价值图。HM3D 实验显示其能完成带时序约束的长程导航,且方向得分提升单目标导航效率;在共同成功任务上路径较 LLM 规划器缩短 15.31%。

DSIP: A Dynamic Coordination Planner for Signal-Free Intersections using Diffusion-Model-Based Multi-Agent Motion Planning Figure 1
2026-07-01cs.RO

DSIP: A Dynamic Coordination Planner for Signal-Free Intersections using Diffusion-Model-Based Multi-Agent Motion Planning

Qian Hu, Haoyang Peng, Songan Zhang, Ming Yang, Hongtei Eric Tseng

2026-07-01生成模型规划控制

针对传统信号灯在高需求路口引入启停、延误和能耗的问题,DSIP把交叉口控制从相位切换转为多车连续轨迹协调:用扩散模型生成单车轨迹先验,并结合CBS式冲突消解、周期刷新与逐步执行。在理想CAV与完美V2X假设下,SUMO四岔口实验显示其较固定配时和强化学习信号控制降低平均延误、保持更高车速,优势主要体现在中高密度交通。

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning Figure 1
2026-07-01cs.RO

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

Taozhao Chen, Ian Manchester, Huaming Chen

School of Electrical and Computer Engineering, The University of Sydney, School of Aerospace, Mechanical and Mechatronic Engineering

2026-07-01视觉语言视觉感知

本文针对VLA机器人论文中常把任务成功率提升解释为“具备物理推理”的做法提出质疑。核心洞察是将策略能力拆成语义映射与物理动作决策,指出现有评测无法区分语义匹配、数据分布重叠和真正物理泛化。主要结果是论证当前证据不足以验证VLM骨干带来物理推理,并建议用受控物理变量评测来做因果归因。

Locker-based Truck-Drone Routing with Integrated Considerations of Pickups, Deliveries, and No-Fly Zones Figure 1
2026-07-01cs.RO

Locker-based Truck-Drone Routing with Integrated Considerations of Pickups, Deliveries, and No-Fly Zones

Xuanyu Liu, Hui Hu, Jiao Zhao, Ziliang Wang, Zhengbing He

Z. He is with the Faculty of Science and Technology, University of Nottingham Ningbo China.

2026-07-01机器人

面向智能柜参与的末端配送,论文指出传统卡车-无人机路径模型难以同时处理投递、退货揽收、载重相关能耗与禁飞区绕行。其创新在于提出 LTDRP-PDNF,并用两阶段深度强化学习:先学习卡车 CVRP 路径,再通过策略迁移和混合派单构造卡车-无人机协同路线。多规模实验显示其多数情况下优于元启发式和神经启发式基线,且计算时间较短。

2026-06-30

107 篇
VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes Figure 1
2026-06-30cs.RO

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, Karen Liu

Stanford University, Carnegie Mellon University

2026-06-30机器人

论文针对人形机器人视觉语言到全身操作运动缺少成规模配对数据的问题,提出在3D Gaussian Splatting重建室内场景中用特权几何与物体信息合成导航和交互轨迹,再事后渲染第一视角图像,形成视觉-语言-运动学监督。其VLK策略学习短时G1全身轨迹和腕部接触标签,并由全身跟踪器落到硬件动作;作者生成4.8万条轨迹,在仿真和Unitree G1实机导航、搬运任务上验证可行,但增益可能主要来自synthetic data scaling。

GROW$^2$: Grounding Which and Where for Robot Tool Use Figure 1
2026-06-30cs.RO

GROW$^2$: Grounding Which and Where for Robot Tool Use

Yuhong Deng, Yuyao Liu, David Hsu

National University of Singapore, Massachusetts Institute of Technology

2026-06-30机器人视觉语言

GROW²面向开放场景中的机器人即兴用具问题:机器人不仅要判断哪个物体可充当工具,还要定位可执行动作的具体区域。其核心洞察是以“物体部件”连接语义 affordance 与几何结构,先用 VLM 选择工具和任务相关部件,再结合单视角 RGB-D、3D 重建与多视角部件分割生成完整 3D affordance。实验显示其在 affordance 预测、开放类别泛化、仿真和真实 Franka 工具使用任务中均优于基线,但失败主要来自 VLM 选错工具/部件与视觉基础模型重建误差。

Sequential Planning via Anchored Robotic Keypoints Figure 1
2026-06-30cs.RO

Sequential Planning via Anchored Robotic Keypoints

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

Department of Electrical, Computer, and Systems Engineering, Department of Mechanical and Aerospace Engineering, Case Western Reserve University, United States

2026-06-30机器人规划控制

本文针对 VLA 在物体位置和任务表述变化下易失效的问题,指出瓶颈更多在感知重定位而非反复重写计划。SPARK 用一次 Gemini 生成类型化行为树,将低层控制封装进可组合原语,并把测试时计算用于多提示词 SAM3 grounding 与失败后重检测重试。其在六个 Libero-Pro 扰动单元达 43.7%,显著高于 CaP-Agent0 的 18.2%,实机跨三类机器人平均成功率为 68%。

Realtime Wind Estimation using Low Cost Quadrotor Uncrewed Aerial Vehicles Figure 1
2026-06-30cs.RO

Realtime Wind Estimation using Low Cost Quadrotor Uncrewed Aerial Vehicles

Hiranya Udagedara, Mahdis Bisheban

2026-06-30机器人

面向野火监测等需要便携、低成本实时测风的场景,论文用四旋翼自身 GPS/IMU 与动力学模型替代额外风速计,在 SE(3) 完整建模下比较 UKF 与 EKF 进行三维风速估计,并让无人机继续跟踪轨迹。仿真结果显示,随轨迹和风场非线性增强,UKF 相比 EKF 误差更小、轨迹偏离更少;但验证主要停留在数值仿真,真实飞行适用性文中未充分说明。

MOAR Planner: Multi-Objective and Adaptive Risk-Aware Path Planning for Infrastructure Inspection with a UAV Figure 1
2026-06-30cs.RO

MOAR Planner: Multi-Objective and Adaptive Risk-Aware Path Planning for Infrastructure Inspection with a UAV

Louis Petit, Alexis Lussier Desbiens

The authors are with the Createk Design Lab, University of Sherbrooke

2026-06-30规划控制安全鲁棒

面向电力线等基础设施近距离巡检,无人机规划需同时应对碰撞损伤、通信/定位失效、风况和电量变化。MOAR 将风险因子动态调制到安全、时间、能耗代价中,引入损伤与插入代价、预计算代价图和自适应速度图,并在离散图上搜索。仿真与实飞显示其可实时生成从短路径到高避障间隙的多类轨迹,覆盖约 90% 期望长度-安全范围。

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision Figure 1
2026-06-30cs.RO

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

Renmin University of China

2026-06-30视觉语言视觉感知

这篇论文针对跨机器人本体训练 VLA 时低层状态与动作空间难以对齐的问题,提出用密集具身思维链监督学习共享的高层操作认知。ZR-0 采用 VLM 推理流与 DiT 动作专家双流结构,训练时生成 ECoT、推理时跳过文本生成,并在约 6000 万帧数据上预训练。实验覆盖单臂、双臂、人形仿真及 xArm 实机,显示跨本体任务表现较强,但具体增益中数据规模贡献可能较大。

Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving Figure 1
2026-06-30cs.RO

Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving

Cheng Gong, Haoyang Wang, Chao Lu, Zirui Li, Jianwei Gong

2026-06-30强化学习

这篇论文针对自动驾驶策略在闭环部署中会暴露长尾错误、但传统模仿学习缺少持续纠错机制的问题,提出 R2LPL:从策略自身 rollout 中筛选可恢复的错误状态,检索可行纠正目标,并用回放式终身学习避免遗忘。nuPlan 闭环实验显示,少量迭代即可把中等性能规划器提升到学习式规划器 SOTA,尤其在 Test14-hard 等困难长尾场景增益明显。

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking Figure 1
2026-06-30cs.CV

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking

Kai Luo, Fei Teng, Mengfei Duan, Wanjun Jia, Xu Wang, Hao Shi, Kunyu Peng, Zhiyong Li, Kailun Yang

2026-06-30视觉感知

这篇论文针对多目标跟踪依赖逐帧框标注、难以规模化的问题,提出仅用目标点作为监督的 PS-MOT 范式。其核心是 PS-Track:用时序反馈提示把点演化为稳定伪标签,用点激发小波注意力补足边界线索,并以不确定性高斯学习抑制伪标签噪声。实验覆盖 DanceTrack、EmboTrack、SportsMOT、JRDB,显示在多种跟踪架构下接近全监督表现,并将标注时间约降 64%。

Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field Figure 1
2026-06-30cs.RO

Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field

Licheng Zhong, Gim Hee Lee

2026-06-30机器人

这篇论文针对抓取前非抓取式操作常依赖预设目标位姿的问题,指出物体通常存在多个可抓取构型,准备抓取更应优化“当前状态是否可抓”而非逼近单一姿态。作者构建由合成抓取生成的可抓集合,并学习抓取性场,为强化学习提供密集奖励,同时作为停止操作并切换抓取的判据。仿真和真实 Franka 实验显示,GOMP 能将物体重构到可抓状态,在无需外部规划器或人工停止条件下完成闭环操作到抓取,且预测的抓取性距离与真实抓取成功率相关。

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation Figure 1
2026-06-30cs.RO

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

Stanford University, University of California, Berkeley

2026-06-30机器人强化学习模仿学习

本文针对机器人学习新技能常需重训或微调的问题,提出用单次人类示范作为“行为提示”,让策略在测试时结合示范轨迹与当前观测直接输出动作。核心创新是BPP上下文视觉运动架构,并强调任务多样性比单任务示范数更关键,配套iPhUMI采集接口及DrawAnything、LIBERO-Gen评测。结果显示该方法能在未见绘图和桌面操作任务中实现一定测试时适应,但全新动作原语迁移仍未充分证明,增益可能主要来自scaling / data。

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform Figure 1
2026-06-30cs.RO

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

Mathilde Hochedel, Marc Lalonde

2026-06-30视觉语言视觉感知强化学习

本文动机是检验开放式视觉-语言-动作模型能否从基准环境迁移到真实 UR5e 机械臂。工作搭建了采集、RLDS 数据转换、OpenVLA/OpenVLA-OFT 微调与部署流程,核心洞察是实机性能瓶颈并非单纯模型能力,而在动作语义、坐标系、时序对齐、图像预处理和数据覆盖等系统一致性。实验显示离线指标较好但闭环执行不稳定,提示可靠部署需要数据—模型—控制全链路校准。

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation Figure 1
2026-06-30cs.RO

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation

Samira Huber, Klaas Pelzer, Duc M. Nguyen, Xuesu Xiao, Sören Pirk

Kiel University, Germany 2 George Mason University, USA

2026-06-30机器人

这篇论文针对办公室等长期运行场景中机器人只会记静态空间、难以利用人的到达时间、常驻位置等日常规律的问题,提出 HUMEMBR:持续构建身份感知的人类行为记忆,并通过检索增强 LLM 查询来支持问答与预测式导航。作者还提出 PersonEQA 评测人中心长时序推理;实验显示其在空间、时间和身份类问题上优于全上下文 LLM 基线,同时显著减少 token,并在 Spot 机器人两种真实环境中做了部署验证。

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation Figure 1
2026-06-30cs.RO

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

2026-06-30机器人视觉感知强化学习

FutureNav针对连续视觉语言导航中VLM多停留在“观测到动作”模仿、缺少显式世界状态与转移建模的问题,将文本、视觉和空间特征统一输入LLM,并用动作策略、逆动力学、前向动力学和未来空间状态生成四个目标联合训练。其关键在于把世界建模作为训练约束而非推理时额外规划,从而保持单次动作解码效率。实验显示4B骨干已在多个VLN基准达到SOTA,并超过部分更大导航模型;但具体增益与数据、预训练规模的相对贡献仍需更多拆分说明。

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control Figure 1
2026-06-30cs.RO

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

The Chinese University of Hong Kong, Shanghai AI Laboratory

2026-06-30机器人规划控制

该文针对人形机器人行为基础模型只能跟踪预设参考、遇到扰动和任务变化易累积漂移的问题,提出 ReactiveBFM,将自回归全身运动规划与 BFM 跟踪器闭环结合。关键在于用 scheduled prefix sampling 让规划器从真实误差状态中学习恢复,并以异步重规划、轨迹分块和紧凑状态表示缓解延迟与抖动。在 Unitree G1 上实现零样本移动目标到达,真实实验成功率 90%,强扰动 sim-to-sim 成功率 93.1%、跌倒率 2.0%。

Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation Figure 1
2026-06-30cs.RO

Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation

Yulin Zhou, Yimeng Wang, Nengyu Wang, Shaojia Xing, Shiyun Tu, Xiang Li, Jingkai Zhang, Ningbo Jiang, Yuankai Lin, Hua Yang, Xiangrui Zeng, Zhouping Yin

2026-06-30机器人

针对长程操作中当前观测相同但任务阶段不同导致的非马尔可夫歧义,Chronos将完整历史提升为策略动力学的潜在状态:每个物理步生成一个状态 token,用选择性 SSM 传播全轨迹记忆,并以二阶薛定谔启发的加速度桥细化动作。在16个仿真和4个真实任务中,0.3B模型在RMBench达73.6%成功率,显著超过π0.5和Mem-0,真实双臂任务平均成功率78%。

CSAR: Containerized System Architecture for Robotics Figure 1
2026-06-30cs.RO

CSAR: Containerized System Architecture for Robotics

Ambrosio-Cestero, Gregorio, Galindo Andrades, Cipriano, Gonzalez-Jimenez, Javier, Ruiz-Sarmiento, Jose-Raul

Málaga Institute for Mechatronics Engineering and Cyber-Physical Systems (IMECH.UMA), University of Málaga

2026-06-30机器人

这篇论文针对机器人实验室中多人协作、异构硬件共享、依赖冲突和可复现实验难以统一管理的问题,提出 CSAR:以 LXC/LXD 持久系统容器为核心,并结合 ROS 2/DDS 与三层边缘基础设施,把计算放置、硬件亲和性和网络拓扑显式纳入架构。真实实验室部署及 5G 边缘 3D SLAM、GPU 语义建图用例显示,它能隔离工作负载、提升共享资源利用率,并支持较安全的原型开发与复现实验。

X-Morph: Human Motion Priors for Scalable Robot Learning Across Morphologies Figure 1
2026-06-30cs.RO

X-Morph: Human Motion Priors for Scalable Robot Learning Across Morphologies

Ritwik Sharma, Shivam Sood, Arhaan Jain, Shyam Charan Kesavamoorthi, Chengyang He, Guillaume Sartoretti

National University of Singapore

2026-06-30机器人

非人形腿式机器人缺少像人形机器人那样的大规模运动数据,直接套用人类动作又常不满足接触和动力学约束。X-Morph的核心是把跨形态重定向作为中间参考,再经物理感知修正、特权RL跟踪和因果学生策略蒸馏,生成可部署技能。实验覆盖四足、六足和带机械臂四足,显示可跟踪多样及未见动作,并支持视频遥操作、文本到技能和下游行为先验。

ActiveVital: Geometry-Aware Embodied Vital Signs Monitoring for Home Healthcare Robots Figure 1
2026-06-30cs.RO

ActiveVital: Geometry-Aware Embodied Vital Signs Monitoring for Home Healthcare Robots

Yuxuan Hu, Shihao Li, Yang Xiao, Gen Li, Feng Xu, Jianfei Yang

2026-06-30机器人

面向家庭机器人在非受控姿态下进行非接触呼吸与心率监测,本文指出毫米波雷达只观测径向微动,传感器与胸廓几何失配会显著削弱信号。ActiveVital将观测几何作为可控变量,用视觉关键点定位胸部锚点并闭环调整机器人雷达至近法向入射,再结合差分相位增强提取生命体征。实验中呼吸间隔误差由0.87秒降至0.14秒,心率误差由13.59 bpm降至2.22 bpm,说明主要收益来自主动胸部对准而非单纯靠近。

ConCent: Contact-Centric Real-to-Sim-to-Real Learning from One Demonstration Figure 1
2026-06-30cs.RO

ConCent: Contact-Centric Real-to-Sim-to-Real Learning from One Demonstration

Heecheol Kim, Namiko Saito, Katsushi Ikeuchi, Yasuyuki Matsushita

The University of Tokyo

2026-06-30模仿学习

这篇论文针对接触丰富操作中仿真到现实迁移常因局部接触动力学失配而失败的问题,提出 ConCent:从一次真实 RGB-D 示范中优化物体接触几何,提取任务相关接触事件序列,并将其作为强化学习的结构化奖励与约束,而非依赖全局物理参数匹配或手工奖励。实验显示,在抓取、对齐、插入等接触阶段复杂的任务上,该方法比无接触约束的 RL 基线迁移更稳定、更鲁棒。

KYON: Semi-Modular Wheel-Legged Quadruped With Agile Bimanual Capability Figure 1
2026-06-30cs.RO

KYON: Semi-Modular Wheel-Legged Quadruped With Agile Bimanual Capability

Luca Rossini, Arturo Laurenzi, Francesco Ruscelli, Yifang Zhang, Giovanbattista Gravina, Lorenzo Baccelliere, Corrado Burchielli, Stefano Cordasco, Nikos Tsagarakis

2026-06-30机器人

针对现有四足机器人在高负载作业中常牺牲机动性、且双臂操作能力不足的问题,KYON提出半模块化轮腿四足平台:可更换轮式/足式小腿,将部分执行器置于机身并用传动降低远端惯量,同时结合全身控制与强化学习策略。实验显示其能完成稳定动态 locomotion 与双臂负载操作,验证了在复杂非结构环境中执行移动操作任务的可行性,但最大速度和载荷上限仍待后续系统评估。

Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping Figure 1
2026-06-30cs.RO

Self-supervised Geometry Reasoning for LiDAR Simultaneous Localization and Mapping

Jiwoo Kim, Jinwoo Lee, Woojae Shin, Giseop Kim, Hyondong Oh

Korea Advanced Institute of Science and Technology (KAIST), Daejeon, Republic of Korea, Daegu Gyeongbuk Institute of Science and Technology (DGIST), Daegu, Republic of Korea

2026-06-30机器人

这篇论文针对 LiDAR SLAM 中局部协方差、对应关系等几何量依赖手工估计、在稀疏或低分辨率点云下不稳定的问题,提出自监督几何推理框架:用高斯协方差显式表示点级局部几何,并利用 SLAM 产生的轨迹与对应关系构造似然监督,再把学到的几何反馈给后端形成递归改进。KITTI 多分辨率实验显示其可提升里程计和全局配准表现,但训练成本和迭代停止准则仍未充分解决。

AERIS: Aerial-Edge Role-Driven Intelligence at Runtime via Orchestrated Language-Model Swarm Figure 1
2026-06-30cs.RO

AERIS: Aerial-Edge Role-Driven Intelligence at Runtime via Orchestrated Language-Model Swarm

Jiabin Lou, Haopeng Wang, Xinyu Liu, Yu Zhang, Rongye Shi, Wenjun Wu

2026-06-30机器人

AERIS针对无人机上部署语言模型时的实时控制、算力受限和网络不稳定问题,将小语言模型、感知与控制模块拆成可运行时调度的角色,通过类型化消息、子目标对齐和角色重绑定维持闭环。实验显示其在AerialVLN长程导航中提升指令跟随,并在心跳调度下保持有界周期和较低执行错误,真实无人机实验验证了可部署性;但复杂遮挡和地标缺失下仍未达强鲁棒。

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance Figure 1
2026-06-30cs.RO

SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance

Tengyue Jiang, Chunpu Xu, Jiayue Kang, Yao Mu

Shanghai Jiao Tong University, East China University of Science and Technology, Hong Kong Polytechnic University, Xi’an University of Electronic Science and Technology

2026-06-30视觉语言视觉感知

这篇论文针对离散动作 tokenizer 在 VLA 中把每个 token 解码为固定连续动作、忽略机器人关节状态而造成压缩误差的问题,提出在 VQ 动作 tokenizer 中注入本体状态,尤其用轻量 adapter 对动作维度做状态条件调制,使有限 codebook 表示状态相关的动作族。实验显示其在 12 个 RoboTwin 任务上将平均成功率从 0.29 提升到 0.56,零样本 sim-to-real 三任务从 0.15 提升到 0.33。

Automating the Design of Embodied AgentArchitectures Figure 1
2026-06-30cs.RO

Automating the Design of Embodied AgentArchitectures

Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu

Australian Institute for Machine Learning, University of Adelaide, SA, Australia

2026-06-30机器人

这篇论文关注具身智能体仍依赖人工设计感知、记忆、规划与动作模块连接的问题,尝试把文本领域的智能体架构搜索迁移到机器人任务。作者提出可编辑类型图运行时 AgentCanvas 和带反思机制的 KDLoop 搜索流程,在导航、具身问答和语言条件操作的四类执行器上比较三种 AAS 方法;结果显示部分搜索架构能带来可部署或方向性的成功率提升,但也暴露 rollout 噪声、局部搜索陷阱和信用分配不足等限制。

TacEvo: Self-Evolving Architecture Discovery for Robotic Tactile Perception via LLM-Driven Quality-Diversity Search Figure 1
2026-06-30cs.RO

TacEvo: Self-Evolving Architecture Discovery for Robotic Tactile Perception via LLM-Driven Quality-Diversity Search

Mohammed AbuSadeh, Lan Wei, Dandan Zhang

2026-06-30机器人

TacEvo针对视觉触觉图像强依赖传感器物理特性、网络设计仍需专家反复调参的问题,将LLM代码级变异/交叉与MAP-Elites质量多样性搜索结合,并用网络档案和提示档案共同保留有效结构与生成策略。其在ViTacTip力回归和纹理栅格分类中保持约95%的可训练生成率,20代搜索显著提升验证适应度;高保真评估中力预测接近专家基线,细粒度分类优于基线。

SIR: Structured Image Representations for Explainable Robot Learning Figure 1
2026-06-30cs.RO

SIR: Structured Image Representations for Explainable Robot Learning

Paul Mattes, Jan Schwab, Jens Bosch, Nils Blank, Maximilian Xiling Li, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutikov

Intuitive Robots Lab, Karlsruhe Institute of Technology, Germany 2Robotics Institute Germany, ject labels), geometric cues (e.g., bounding boxes and point, Label, (e.g., symbolic labels, geometric cues, or visual features) af-

2026-06-30机器人视觉感知

这篇论文针对视觉嵌入策略缺乏显式结构、易受干扰且难解释的问题,提出用场景图作为机器人模仿学习的中间表征,并通过端到端学习的稀疏化模块保留任务相关子图。结果显示,SIR 在 RoboCasa 上平均成功率达 19.5%,高于图像基线 14.81%,且可通过被选节点分析干扰物、遗漏关键物体与数据集偏置。

CylindTrack: Depth-Aware Cylindrical Motion Modeling for Panoramic Multi-Object Tracking Figure 1
2026-06-30cs.CV

CylindTrack: Depth-Aware Cylindrical Motion Modeling for Panoramic Multi-Object Tracking

Buyin Deng, Kai Luo, Lingxin Huang, Xinqi Liu, Fei Cheng, Hang Zheng, Liming Yin, Kailun Yang

2026-06-30视觉感知

这篇论文面向全景相机多目标跟踪中0°/360°接缝导致的轨迹断裂,以及大视场下遮挡、尺度变化和单帧深度不稳定问题,提出CylindTrack:将实例深度建模为时间滤波的轨迹状态,并用球面时空一致性学习增强深度表征,再以圆柱角度状态完成跨接缝运动预测与关联。在QuadTrack和JRDB上分别取得33.67/31.12 HOTA、40.45/34.33 IDF1,并保持28.56/21.34 FPS,身份保持指标有稳定提升。

Heterogeneous Tactile Transformer Figure 1
2026-06-30cs.RO

Heterogeneous Tactile Transformer

Jianxin Bi, Qiang Wang, Jayaram Reddy, Kelvin Lin, Soibkhon Khajikhanov, Ruihan Gao, Harold Soh

National University of Singapore, 2 Carnegie Mellon University, 3 Smart Systems Institute, NUS

2026-06-30机器人

这篇论文针对触觉传感器形态差异导致模型难以跨设备复用的问题,提出 HTT:用传感器专属编码器接入光学与阵列式触觉,再通过共享 Transformer 和成对传感器的遮挡重建、跨模态预测对齐表示。作者还构建 160 万帧 HPT 配对数据集,并在物体分类、力估计、滑移检测及真实操作任务中显示更好的迁移到新任务和未见传感器的能力,但部分增益可能主要来自 scaling / data。

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation Figure 1
2026-06-30cs.RO

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation

Shengqi Xu, Guojin Zhong, Yang Liu, Fanjie Wang, Hu Luo, Hanyu Zhou, Weiyao Zhang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, 3NeoteAI, School of Computing, National University of Singapore

2026-06-30强化学习

这篇论文针对接触丰富操作中光学触觉图像和累计形变难以区分“接触/释放”等细粒度状态的问题,提出用瞬时运动与累计运动的相关性作为触觉表征,并结合 Mixture-of-Transformers 构建保留模态特性的视触觉策略。四个操作任务及消融显示,该方法相较常见表征和融合方式更稳定,且对部分光照、物体与传感器变化具备鲁棒性。

WARP: Whole-Body Retargeting for Learning from Offline Human Demonstrations Figure 1
2026-06-30cs.RO

WARP: Whole-Body Retargeting for Learning from Offline Human Demonstrations

Zhenyang Chen, Chuizheng Kong, Chuye Zhang, Yuanshao Yang, Lawrence Y. Zhu, Shreyas Kousik, Danfei Xu

Georgia Institute of Technology, Atlanta, Georgia 30332

2026-06-30模仿学习

WARP针对离线人类示教难以直接转成可学习机器人动作的问题,指出误差和多解会在无在线纠正时放大为监督噪声。其核心是用肩-肘-腕SEW闭式几何求解器,在精确跟踪末端的同时保留躯干、肘部和底盘意图,并结合惰性移动底盘控制生成一致轨迹。实验报告相较基线将全身跟踪误差降低99.34%,下游策略性能提升35%,并实现若干真实任务零样本全身移动操作。

REPAIR-Bench: A Benchmark for Robot Error Perception And Interaction Recovery Figure 1
2026-06-30cs.RO

REPAIR-Bench: A Benchmark for Robot Error Perception And Interaction Recovery

Giuliano Pioldi, Yashika Batra, Arman Ibrayeva, Yuanchen Bai, Purnjay Maruur, Promise Ekpo, Angelique Taylor

2026-06-30机器人数据集/基准

面向医疗等高风险人机协作场景中机器人失误难以及时识别和修复的问题,REPAIR-Bench将214次实体机器人交互整理为覆盖故障时序检测、视觉故障类型分类和用户偏好恢复预测的统一基准,并纳入跨轮次适应、面部/头姿、语音转写与事后情绪反馈。基线显示,层次循环模型较单轮模型提升严格F1(0.80 vs 0.68),故障定位中位绝对误差2.97秒;QLoRA微调Mistral-7B在恢复预测上Hit@5达0.76,但样本规模较小限制泛化。

OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model Figure 1
2026-06-30cs.RO

OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model

Iok Tong Lei, Qingchen Xie, Yifan Wang, Yap Ying Jie, Zhidong Deng

2026-06-30机器人生成模型三维

OpenSPM针对开放桌面操作中VLA语义泛化强但缺少精确几何约束、训练与推理成本高的问题,将任务分解为语义3D感知、物体中心关键空间位姿记忆、SE(3)迁移和闭环流匹配动作生成。其洞察是把示教压缩为可检索、可迁移的相对位姿,再用轻量模型补全局部轨迹并用反馈修正误差。在10个LIBERO-GOAL任务上达到85.6%成功率和约1033Hz等效控制频率,消融显示记忆与闭环校正是主要增益来源。

RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation Figure 1
2026-06-30cs.RO

RoamFlow: Reinforcement-Aligned One-Step Action MeanFlow Policy for Image-Goal Navigation

Zixuan Zhang, Yuqi Chen, Junjie Gao, Siyuan Song, Yongzhou Pan, Beichen Wang, Mir Feroskhan

2026-06-30机器人视觉感知生成模型强化学习

RoamFlow针对图像目标导航中逐步RL策略短视、扩散/流式生成推理慢的问题,将导航建模为轨迹生成,并用MeanFlow预测区间平均速度场以实现近一/少步动作序列生成;训练上先模仿学习稳定初始化,再在Habitat中用强化学习按到达效率与避障等目标细化。论文报告其在Habitat仿真和真实机器人上降低延迟,同时保持较强导航表现。

Flying to Image-Specified Objects: 3D Quadrotor Navigation via Cross-Graph Memory and Viewpoint Planning Figure 1
2026-06-30cs.RO

Flying to Image-Specified Objects: 3D Quadrotor Navigation via Cross-Graph Memory and Viewpoint Planning

Junjie Gao, Yuqi Chen, Yongzhou Pan, Yaosheng Deng, Jiaping Xiao, Mir Feroskhan

2026-06-30机器人视觉感知规划控制三维

这篇论文针对四旋翼执行实例级图像目标导航时面临的三维连续控制、前视窄视场和安全约束问题,指出关键不只是到达空间位置,而是选择能看见目标的视点。方法以层级框架生成面向前沿和候选目标的视点动作节点,并用对象/观测跨图语义记忆辅助策略选择,再交给轨迹规划器执行。仿真相对强基线取得稳定提升,真实飞行验证了可用性与鲁棒性。

Sphere-VIO: Fast and Robust Visual-Inertial Odometry via Unified Spherical Representation for Heterogeneous Multi-Camera Systems Figure 1
2026-06-30cs.RO

Sphere-VIO: Fast and Robust Visual-Inertial Odometry via Unified Spherical Representation for Heterogeneous Multi-Camera Systems

Yueteng Yang, Yusen Xie, Hao Wei, Qianhao Wang, Boyu Zhou, Fei Gao, Jun Ma, Jinni Zhou

2026-06-30安全鲁棒

Sphere-VIO针对异构多相机VIO难以兼顾跨相机关联、深度稳定性与实时性的痛点,将不同相机统一映射到球面空间,并结合HOFA半直接跟踪、多相机深度滤波和带球面残差的ESKF后端,减少拼接和优化开销。实验在公开与自建全向数据上显示,其在HILTI 2022平均ATE RMSE达0.1821 m、单帧约0.0122 s,体现出精度、鲁棒性与CPU实时性的折中优势。

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation Figure 1
2026-06-30cs.RO

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

Huazhong University of Science and Technology, Wuhan, China, Zhejiang University, Hangzhou, China, Project leaders.Huazhong University of Science and Technology, Wuhan, China, Corresponding authors.Huazhong University of Science and Technology, Wuhan, China

2026-06-30机器人强化学习

这篇论文针对视觉导航中两阶段世界模型依赖候选轨迹、推理开销高且动作与视觉预测不一致的问题,提出 SWAM,将起点和目标 RGB 条件下的中间 RGB-D 观测与动作轨迹在一次生成过程中联合建模,并用深度伪标签、视觉引导动作细化和轨迹尺度正则强化空间约束。实验显示其在成功率、轨迹精度、视觉质量、推理效率和跨场景泛化上优于策略式与两阶段基线。

Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies Figure 1
2026-06-30cs.RO

Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

Haoxu Huang, Tongsam Zheng, Yifan Chen, Jiacheng You, Yang Gao

Tsinghua University, Shanghai Qi Zhi Institute

2026-06-30机器人

这篇论文针对机器人策略迭代中真实 rollout 昂贵、普通验证集动作 MSE 又常与任务成功率相关性弱的问题,提出 Critical Interval MSE:只在抓取、接触、插入等对成败敏感的关键时间段计算误差,并结合时序集成、RTC 与 DTW 使离线验证更贴近部署行为。实验显示,在包含不同架构、数据量和训练步数的 27 个 checkpoint 上,CI-MSE 与 rollout 表现的 Spearman 相关达到 -0.87,明显优于原始 MSE 的 -0.61,且对超参数较稳健;但分布偏移下仍会受影响,不能替代真实机器人评测。

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models Figure 1
2026-06-30cs.RO

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen

2026-06-30视觉语言视觉感知强化学习

这篇论文针对现有 VLA 强化学习依赖环境成功信号、难以在无标注交互中自我改进的问题,提出 T2VLA:利用轨迹生成置信度与任务成功率的相关性,从模型自身 rollout 中选出局部伪专家和全局专家池,并用 DTW 相似度构造内在奖励进行测试时 GRPO 更新。实验显示其在 LIBERO、RoboTwin 等基准上优于监督微调基线,部分接近使用真实奖励的 oracle RL,并可适配 OpenVLA-OFT 与 π 系列模型。

AUSLUN: A Fixed-Hover UAV--USV System for GNSS-Denied Maritime Search and Navigation Figure 1
2026-06-30cs.RO

AUSLUN: A Fixed-Hover UAV--USV System for GNSS-Denied Maritime Search and Navigation

Siyuan Yang, Zikai Jia, Hailiang Kuang, Xiaoyu He, Qizhi Guo, Yihao Dong, Shaoming He

2026-06-30机器人

面向 GNSS 受限海域中 USV 难以发现远距离船只且缺少全局导航基准的问题,AUSLUN 将 UAV 固定悬停在岸边 VIO 可用位置,把搜索运动转移到变焦吊舱,并耦合多边形感知环形扫描、激光/数传量测统一的门控递归定位和相对目标引导恢复。仿真中扫描时间降低 10.9–55.6%,实测定位均误差 11.4 m,并完成一次搜索到导航及丢失恢复演示;但验证主要限于静止目标和单次集成任务。

Normalizing Flow-Enhanced Message Passing for Multirobot Collaborative Localization Figure 1
2026-06-30cs.RO

Normalizing Flow-Enhanced Message Passing for Multirobot Collaborative Localization

Han Shen, Guanghui Wen, Liangming Chen, Ming Cao

2026-06-30机器人生成模型

多机器人协同定位需要同时保持机器人状态相关性,并适应异常值与时变噪声;既有 GBP 精度较好但噪声建模受限,MF 可估计噪声却会削弱状态依赖。本文将 GBP 与 MF 统一为参数化消息传递,并用归一化流学习非线性测量项的梯度采样,扩展到李群状态。仿真与 ASV 实验显示,在融合里程计、GNSS 与 UWB 时,方法提升了定位精度、鲁棒性和噪声适应性。

TACO: A Test and Check Framework for Robust Pose Graph Optimization Figure 1
2026-06-30cs.RO

TACO: A Test and Check Framework for Robust Pose Graph Optimization

Emilio Olivastri, Alberto Pretto, Tobias Fischer

1 affiliationmark: Queensland University of Technology, AU, 2 affiliationmark: University of Padova, IT

2026-06-30优化算法三维安全鲁棒

本文针对SLAM位姿图优化中回环误匹配会使非线性最小二乘轨迹估计崩溃的问题,提出TACO框架:先用增量概率一致性在线测试新回环,再用基于Switchable Constraints的SOS周期性清洗误接纳约束,从而兼顾在线性与纠错能力。在2D与3D视觉SLAM基准上,50%外点率下仍分别超过90%和83%成功率,平均收敛约45ms和100ms,接近离线鲁棒方法但更适合在线部署。

Legible Shared Autonomy: Implicit Communication of Robot Belief through Motion Figure 1
2026-06-30cs.RO

Legible Shared Autonomy: Implicit Communication of Robot Belief through Motion

Jinwei Liu, Pengfei Li, Shaofeng Chen, Tao Wang, Yun-Bo Zhao

the State Key Laboratory of Autonomous Intelligent Unmanned Systems. The opening project number is ZZKF2025-1-10

2026-06-30机器人

这篇论文针对共享自治机械臂的透明度问题:机器人虽会推断用户目标并辅助运动,但用户看不到其信念,导致正确时仍持续操控、错误时又难以及早纠正。作者将“可读运动”引入共享自治,用动作级可读性指标让辅助动作同时推进任务并显式区分目标,并用置信度自适应分配控制权。仿真和六自由度机械臂用户实验显示,该方法提升用户对机器人信念的判断并减少控制 effort,但物理实验中任务时长有所增加。

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning Figure 1
2026-06-30cs.RO

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

Zhihao Liu, Qiuyi Gu, Yitao Wang, Dongming Qiao, Yixian Zhang, Shuaihang Chen, Liangzhi Shi, Tianxing Zhou, Zefang Huang, Kang Chen, Zhen Guo, Quanlu Zhang, Jincheng Yu, Xiaodan Liang, Guoliang Fan, Yu Wang, Feng Gao, Xinlei Chen, Chao Yu

Institute of Automation, Chinese Academy of Sciences, Tsinghua University, School of Artificial Intelligence, University of Chinese Academy of Sciences, Zhongguancun Academy, Pengcheng Laboratory, Harbin Institute of Technology, Beijing Institute of Technology, Zhejiang University, Peking University

2026-06-30机器人强化学习

STEAM针对真实机器人数据中同一轨迹混杂推进、停滞、纠错和失败的问题,将专家轨迹内帧对的归一化时间偏移作为自监督信号,训练时序偏移预测器集成,并用最小集成优势保守筛选混合质量数据。其核心洞察是相对时间顺序可提供无需人工奖励的帧级信用分配。实验覆盖双臂叠毛巾、结账、补货和抓放任务,能定位失败/恢复片段,并结合CFGRL较基线提升成功率16.2%至59%。

No Figure
2026-06-30cs.RO

Data-Driven Modeling and Control for Tethered Space Systems with Koopman-Informed Graphs

Ao Jin, Yifeng Ma, Panfeng Huang, Fan Zhang

2026-06-30规划控制

面向系绳航天系统中柔性绳网带来的高维、强耦合非线性建模与实时控制难题,论文将GNN的局部拓扑先验与Koopman提升空间的全局线性演化结合,形成KGD模型并嵌入MPC,同时加入双速率在线适应。地面柔性绳/网实验和轨道仿真显示其预测精度较高,并能在小规模训练后迁移到更大未见结构,但具体增益相对数据规模与训练分布的来源仍需更多消融说明。

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments Figure 1
2026-06-30cs.CV

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

Yirum Kim, Ue-Hwan Kim

2026-06-30强化学习三维

OP3DSG针对现有开放词汇3D场景图偏重物体、难以定位按钮/把手等可交互部件且关系推理易膨胀的问题,提出统一建模物体、部件、空间/功能关系与可供性的框架。其核心是用物体-部件知识约束候选、细粒度多视角3D融合保留小部件,并以几何先验约束LLM验证关系以减少幻觉。作者还构建UniGraph3D基准,实验显示其在部件定位、多层关系预测及机器人查询、导航、任务规划中优于既有方法。

FalconTrack: Photorealistic Auto-Labeled Perception and Physics-Aware Vision-Based Aerial Tracking Figure 1
2026-06-30cs.RO

FalconTrack: Photorealistic Auto-Labeled Perception and Physics-Aware Vision-Based Aerial Tracking

Yan Miao, Karteek Gandiboyina, Noah Giles, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Sayan Mitra

2026-06-30视觉感知

面向无 GPS 环境下的无人机视觉跟踪,FalconTrack 解决逼真数据难标注且难迁移的问题:用 Gaussian Splatting 从短视频自动分离目标并生成 RGB、掩码、类别和 6-DoF 位姿标签,再以多头感知、重投影约束和类别条件动力学 EKF 融合跟踪。实验显示约 20 分钟生成 1 万张标注图,真实零样本分类达 96–100%,机载约 25Hz,真实 F1-tenth 与门跟踪成功率 100%,优于仅视觉基线。

Analytic Concept-Centric Memory for Agentic Embodied Manipulation Figure 1
2026-06-30cs.RO

Analytic Concept-Centric Memory for Agentic Embodied Manipulation

Mingyang Sun, Xiujian Liang, Jiude Wei, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

Zhejiang University, Hangzhou, China, Shanghai Innovation Institute, Shanghai, China, Fudan University, Shanghai, China, Westlake University, Hangzhou, China, Shanghai Jiao Tong University, Shanghai, China

2026-06-30机器人

这篇论文针对长时程机器人操作中对象会持续存在、状态会变化、经验需复用的问题,指出纯历史记录或向量检索难以显式支持部件、可供性、动作效果和技能选择。核心做法是用解析概念组织记忆,把对象模板、语义部件、位姿、状态转移和可执行技能连接起来,并在运行时进行结构化粗到细检索。实验显示其在记忆依赖操作、关节物体泛化和真实场景评测中,相比非结构化或嵌入式记忆提升任务完成、检索、重识别和跨对象技能泛化。

No Figure
2026-06-30cs.RO

Trajectory Optimization for Collision-Aware Redundant Robotic Multi-Axis Additive Manufacturing by Constrained Gradient Projection

Zhikai Shen, Jiasheng Qu, Chenyu Xu, Zhuo Huang, Chengkai Dai, Yongzhe Li, Guoxin Fang

Z. Shen, J. Qu, C. Xu, Z.Huang and G. Fang are with the Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Hong Kong, China., C. Dai and G. Fang are with the Centre for Perceptual and Interactive Intelligence (CPII), Hong Kong, China. Y. Li is with the Department of Robotics at, the School of Mechanical Engineering, Southeast University, China.

2026-06-30机器人规划控制优化算法

面向冗余机器人多轴增材制造中长路径、高精度沉积与随打印演化碰撞约束难以兼顾的问题,论文将沉积位置视为逐点硬等式约束,在自运动流形切空间内做梯度投影,并用可微 SDF 建模动态工件碰撞。8 自由度平台实验显示平均喷嘴位置误差低于 10 μm,最大关节 jerk 降低最高 77.6%,消除采样碰撞和姿态违规,相比 SQP 最高加速 10.2 倍。

Cross-Spectral Stereo Inertial Odometry Figure 1
2026-06-30cs.RO

Cross-Spectral Stereo Inertial Odometry

Seungsang Yun, Hyunsoo Jang, Tai Hyoung Rhee, Hyunho Song, Hyeonjae Gil, Ayoung Kim

2026-06-30机器人

这篇论文针对同谱双目 VIO 在弱光、眩光等场景中两路相机同时退化、约束冗余导致尺度与可观测性受损的问题,提出 RGB-TIR 跨谱双目惯性里程计:将高延迟深度跨谱匹配异步注入高频估计,并用光度熵、热噪声与 NUC 处理调节谱可靠性权重。实验显示其在白天精度优于同谱基线,在视觉退化环境下更稳健。

Multi-UAV Formation Cooperative Obstacle Avoidance and Adaptive Shape Deformation Control in Complex Environments Based on BI-APF-RRT and Affine Transformation Figure 1
2026-06-30cs.RO

Multi-UAV Formation Cooperative Obstacle Avoidance and Adaptive Shape Deformation Control in Complex Environments Based on BI-APF-RRT and Affine Transformation

Yiliang Wu, Weican Chen, Yendo Hu

College of Marine Information Engineering, Jimei University, Xiamen, China

2026-06-30规划控制

针对多无人机编队在复杂障碍中难以兼顾避障灵活性与队形完整性的问题,论文将带目标偏置和随机扰动的 BI-APF-RRT 用于领导者质心全局规划,并以 B 样条平滑路径,再通过仿射变换按障碍距离自适应缩放、旋转队形。MATLAB 仿真显示,相比纯 APF 和传统 BI-RRT,该方法在 U 形陷阱、窄通道等场景中能避免局部极小并保持编队通过,但结果主要来自仿真验证。

MyGO-Splat: Multi-Objective Closed-Loop Geometric Feedback for RGB-Only Gaussian SLAM Figure 1
2026-06-30cs.RO

MyGO-Splat: Multi-Objective Closed-Loop Geometric Feedback for RGB-Only Gaussian SLAM

Fan Zhu, Ziyu Chen, Zhenjun Zhao, Zhisong Xu, Hui Zhu, Mingrui Li, Chunmao Jiang, Javier Civera

2026-06-30三维

MyGO-Splat针对单目RGB Gaussian SLAM中尺度漂移和几何无法反向约束跟踪的问题,提出闭环几何反馈框架:从各向异性高斯解析光栅化出深度与法线,并将基础模型深度自适应对齐到全局高斯空间,再回注跟踪优化。实验称其在仅用RGB输入时提升尺度稳定性和外观—几何一致性,表现接近RGB-D方法。

No Figure
2026-06-30cs.RO

Real-Time Compliance and Position Control of a Hyper-redundant Soft Robotic Arm

Runze Zuo, Tianhua Zou, Naike Wu, Mingyuan Li, Daniel Bruder

All authors are with the Department of Mechanical Engineering, University of Michigan, Ann Arbor, MI 48109, USA. ∗ R. Zuo is the corresponding author

2026-06-30机器人规划控制

面向非结构化接触任务中“既要定位精度又要被动顺应”的矛盾,本文将软体气动臂设计成带刚性骨架的7连杆、12独立转轴结构,用拮抗McKibben肌肉解耦关节角与刚度,并以统一的迭代IK/逆柔顺控制实时设定末端位置和方向性柔顺。实机与仿真验证了模型和控制器,移动白板书写、钥匙插入与抽屉开启实验表明,按任务切换柔顺方向可吸收隐藏误差并优于全软或全硬基线。

MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs Figure 1
2026-06-30cs.CV

MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs

Juanqin Liu, Leonardo Plotegher, Eloy Roura, Shaoming He

2026-06-30三维

该文针对远距离非合作固定翼无人机缺少 CAD 模型、关键点先验且单目深度与姿态耦合的问题,提出 MF-UAVPose6D:以热图中心定位建立目标锚点,用视角感知模块引入观测射线先验,并通过动态拓扑采样补足机翼、机身和尾翼的弱结构线索,再解耦平移与旋转估计。作者还构建 FW-UAV6DPose 合成数据集;实验显示其在旋转、深度恢复和联合位姿评估上优于相关方法且推理效率较高,但真实场景泛化仍需进一步验证。

Evolutionary Hyperparameter Optimization to Find Lightweight CNN Models for Autonomous Steering Figure 1
2026-06-30cs.NE

Evolutionary Hyperparameter Optimization to Find Lightweight CNN Models for Autonomous Steering

Devson Butani, Ryan Kaddis, Chan-Jin Chung

2026-06-30优化算法

本文针对自动驾驶转向预测中车载算力受限、数据规模很小的问题,用带 1/5 成功规则的(N+M)进化策略自动搜索 CNN/DNN 的滤波器与层配置,直接寻找轻量架构而非依赖蒸馏。实验基于 LTU ACTor 采集的 2957 张图像,结果表明模型尺寸可显著压缩并保持有竞争力的转向角误差,但跨天气、光照和更大场景的泛化增益文中未充分说明。

Lateral String Stability for Vehicle Platoons Figure 1
2026-06-30cs.RO

Lateral String Stability for Vehicle Platoons

Sixu Li, Swaroop Darbha, Yang Zhou

Texas A&M University, College Station, TX, 77483, USA

2026-06-30机器人

针对车队横向控制中路径跟踪误差会沿车辆传播、而传统纵向串稳定性难以刻画同一路段安全偏差的问题,论文提出以路径弧长为自变量的欧拉视角,定义横向串稳定性并比较车载感知与V2V“向前车学习”控制。主要结论是,仅依赖车载感知无法保证路径误差衰减,存在安全性根本限制;引入V2V通信后可实现真正的误差衰减,并给出L2稳定的充要条件与仿真验证。

Privacy-Preserving Decentralized Cooperative Localization with Range-Only Measurements: A Convex Optimization Based Approach Figure 1
2026-06-30cs.RO

Privacy-Preserving Decentralized Cooperative Localization with Range-Only Measurements: A Convex Optimization Based Approach

Nitesh Kumar, Reyshwanth Ganeshan, Sixu Li, Sivakumar Rathinam, Swaroop Darbha

Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA

2026-06-30优化算法

面向 GPS 拒止、多机器人协作定位中共享坐标会泄露轨迹的问题,论文将有界测距误差建模为凸可行集,用 SDP/MVE 表示位置不确定性,并通过地标交平面约束收紧单机范围、把机器人间耦合分解为局部 LMI,仅交换对偶变量而非位置。3D Monte Carlo 结果显示其误差低于球形约束等基线,接近集中式 oracle,同时保持分布式与隐私性。

Hierarchical Policy Learning via Spectral Decomposition Figure 1
2026-06-30cs.RO

Hierarchical Policy Learning via Spectral Decomposition

Shuxin Cao, Liquan Wang, Walker Byrnes, Yiye Chen, Yilun Du, Animesh Garg

2026-06-30强化学习

这篇论文针对机器人模仿学习中长程运动规划与精细接触控制被时间域策略混在一起建模的问题,指出动作序列在 DCT 频域中呈现低频管全局轨迹、高频管时序对齐和接触修正的层级结构,并提出 Causal Spectral Policy 先预测粗运动、再条件生成细粒度修正。仿真、真实机器人和噪声示教实验显示,CSP 在精密操作任务上优于强基线,并提升对遥操作噪声的鲁棒性。

Analyzing Uncertainty in the Spatial Representation of the Kinematic Bicycle Model Figure 1
2026-06-30cs.RO

Analyzing Uncertainty in the Spatial Representation of the Kinematic Bicycle Model

Shafayat Abrar, M. Zaeem Baig, Shahir Ul Islam Anzal, Abdul Basit Memon

2026-06-30安全鲁棒

面向自动驾驶与移动机器人中由轮位移、转向角噪声引起的位姿不确定性,论文分析后轮自行车运动学模型的协方差传播问题。其核心是用泰勒展开处理非线性三角项,并补全包含交叉协方差的闭式期望表达,修正既有推导不完整之处。结果显示解析协方差与蒙特卡洛仿真吻合,可用于定位与里程计自标定,但实际系统增益仍主要停留在模型层验证。

VISTA-DZ: Visual Semantic Trajectory Adaptation for Personalized Dilemma Zone Prediction Figure 1
2026-06-30cs.LG

VISTA-DZ: Visual Semantic Trajectory Adaptation for Personalized Dilemma Zone Prediction

Chuheng Wei, Ziye Qin, Ziran Wang, Guoyuan Wu

2026-06-30规划控制

本文针对黄灯两难区中同一轨迹因驾驶员风险偏好和制动习惯不同而产生不同停走决策的问题,提出将历史轨迹可视化后由VLM生成语义驾驶员画像,并用其通过跨注意力和FiLM调制BiGRU轨迹预测器,同时预测停走与决策时间。实验在仿真和实车数据上显示,语义画像优于仅轨迹和手工个性化特征,仿真随机划分准确率达93.26%,LODO为90.22%,但实车泛化仍依赖目标域校准。

CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation Figure 1
2026-06-30cs.RO

CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation

Juyi Sheng, Jincheng Li, Mingxin Tan, Mengyuan Liu

2026-06-30机器人模仿学习

CORE针对机器人示教昂贵、而人类视频等无动作视觉示教难以跨具身利用的问题,主张不迁移动作而提取成功终态中共享的物体构型、空间关系和接触约束。方法先学习终态结果编码,再聚合为视觉目标原型并注入策略骨干。实验在Meta-World、RoboTwin 2.0和真实任务上分别带来最高约3.9、11.1、17.0个百分点成功率提升,优于文本条件变体。

Learning Transferable Dynamics Priors from Action to World Modeling Figure 1
2026-06-30cs.RO

Learning Transferable Dynamics Priors from Action to World Modeling

Ze Huang, Jiahui Zhang, Hairuo Liu, Chenxi Zhang, Ran Cheng, Li Zhang

2026-06-30强化学习

论文针对机器人世界模型多依赖通用视频预训练、缺少可复用动作动力学先验的问题,提出用真实动作标注的大规模多视角操控数据进行动作到视频预训练,学习A2World扩散世界模型,并将同一权重适配为长时程仿真器A2World-sim和联合视频-动作策略A2World-policy。实验显示其在仿真评估、真实机器人和LIBERO策略学习中优于文本条件或任务特定预训练,但部分增益可能主要来自更大规模动作数据。

MTD-Map: Single-Stage Long-Term LiDAR Map Maintenance Framework via Mixture Transition Distribution Figure 1
2026-06-30cs.RO

MTD-Map: Single-Stage Long-Term LiDAR Map Maintenance Framework via Mixture Transition Distribution

TaeYoung Kim, Gilhwan Kang, Tae Ihn Kim, Seungwon Song, Hun Keon Ko

page is available at: https://taeyoung96.github.io/, Hunkeon Ko are with the Robotics Lab, Advanced Vehicle Platform

2026-06-30机器人

面向长期 LiDAR 地图会因行人、停放车辆和结构变化而失效的问题,MTD-Map 将动态物体剔除与变化检测统一为占据状态随时间转移的单阶段推断。其关键是用 Mixture Transition Distribution 近似高阶历史依赖,并以双极性表示区分出现与消失事件,再结合稳定性自适应先验抑制噪声同时保留准静态结构。实验显示其能稳健去除动态物体、变化检测性能具竞争力,并相较同时处理 DOR/CD 的方法降低计算开销。

Understanding LLM Intervention Explanations in Multi-Party Human-Robot Interaction Figure 1
2026-06-30cs.RO

Understanding LLM Intervention Explanations in Multi-Party Human-Robot Interaction

Micol Spitale, Massimiliano Nigro, Emily Cross

Micol Spitale and Massimiliano Nigro are with the Department of Electronics, Information and Bioengineering, Politecnico di Milano, Milan, Italy. Corresponding author’s email:

2026-06-30机器人

这篇论文关注LLM驱动社交机器人在多人对话中“何时、为何插话”仍不透明的问题。作者在三人两机器人任务中记录LLM编排器的610条干预解释,并用主题分析归纳出五类模式。结果显示解释主要服务于促进共识、平衡参与和维持互动流;不同配置总体稳定,但角色分化明显,mover偏协调推进,opposer更常以目标导向方式提出挑战。

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model Figure 1
2026-06-30cs.CV

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

2026-06-30视觉语言视觉感知安全鲁棒

这篇论文针对现有 VLA 依赖良好 RGB 成像、在低照度和近暗环境下动作预测不稳的问题,引入事件相机作为对光照更鲁棒的动态补充。核心创新不是把事件 token 直接并入语义空间,而是用 PREI 表示事件残差,并通过动作查询、门控交叉注意力将其路由到动作表征,从而尽量保留预训练 RGB-语言先验。仿真、LIBERO-Cross 消融和 Franka 实机结果显示,该接口在正常光照下基本保持性能,并显著提升低光鲁棒性;但真实任务规模较小,跨环境泛化仍需更多验证。

SPACE: Swarm Pheromone Fields for Adaptive Collision-Aware Exploration Figure 1
2026-06-30cs.RO

SPACE: Swarm Pheromone Fields for Adaptive Collision-Aware Exploration

Haohua Que, Haojia Gao, Mingkai Liu, Qian Zhang, Jiajun Sun, Fei Qiao

2026-06-30机器人

本文针对大规模室内机器人群在门洞、走廊等狭窄区域易拥堵、碰撞率随规模上升的问题,提出 SPACE:用共享的吸引前沿信息素、排斥已探索信息素和短时密度场进行去中心化协调。实验证明,在真实住宅与校园平面图、最多 256 台机器人中,它以约 2% 覆盖时间代价,将拥挤规模下的机器人接触率降至最低,较贪婪最近前沿法少 4–17 倍,说明此类协调主要提升安全性而非速度。

LAMP: Long-Horizon Adaptive Manipulation Planning for Multi-Robot Collaboration in Cluttered Space Figure 1
2026-06-30cs.RO

LAMP: Long-Horizon Adaptive Manipulation Planning for Multi-Robot Collaboration in Cluttered Space

Shuai Zhou, Yorai Shaoul, Jiaoyang Li

2026-06-30机器人规划控制

面向拥挤环境中的长时程多机器人协同搬运,论文指出仅规划物体路径再事后检查接触可行性会在狭窄处失效。LAMP将学习式短程操控生成与机器人级可行性验证嵌入搜索,提出耦合空间的LAMP-A*和延迟验证、可复用结果的LAMP-Lazy以支持在线重规划。仿真实验显示其能解决以往方法难以处理的高密度长任务,并较A*基线降低规划时间、提升鲁棒性。

Robust Extended Kalman Filter for Land Navigation Using Massive Array of MEMS IMUs Figure 1
2026-06-30eess.SY

Robust Extended Kalman Filter for Land Navigation Using Massive Array of MEMS IMUs

Omer Hanani, Alon Kipnis

signals may be unavailable or unreliable due to dense urban, This work was supported in part by Condor Pacific LTD., O. Hanani is with the School of Computer Science, Reichman University, A. Kipnis is with the School of Computer Science, Reichman University

2026-06-30机器人安全鲁棒

这篇论文面向 GNSS 受阻或被干扰时的陆地惯性导航,试图用大量低成本 MEMS IMU 缩小与战术级惯导的差距。核心做法是在 EKF 前加入 RISAF 预融合:用动态分位门控剔除突发异常,并实时跟踪单传感器偏置,从而避免把数百个传感器偏置全部纳入 EKF 状态。仿真和实车 GNSS-denied 测试显示,相比简单平均,RISAF 明显提升航向精度并降低漂移累积。

PL-LIT: A LiDAR-Inertial-Thermal SLAM Using Point-Line Features and Thermographic Mapping Figure 1
2026-06-30cs.RO

PL-LIT: A LiDAR-Inertial-Thermal SLAM Using Point-Line Features and Thermographic Mapping

Jiawei Xia, Yixiao Feng, Yongliang Shi, Chao Gao, Renjing Xu, Weining Lu, Bin Liang

2026-06-30机器人

PL-LIT针对可见光SLAM在强光、夜间和雾等场景下易失效,以及热成像受AGC和低对比度破坏亮度一致性的问题,提出紧耦合LiDAR-IMU-热/视觉SLAM。其核心是在线光度校准结合点线特征网络,并在ESIKF中加入线特征约束,同时构建概率热强度体素图用于异常热源检测。实验显示其在可见光环境保持通用性,在长距离热红外数据上达到SOTA,并能支持安全巡检中的热异常定位。

MoPe: Motion Permanence for Robust Monocular Gaussian Mapping in Dynamic Environments Figure 1
2026-06-30cs.RO

MoPe: Motion Permanence for Robust Monocular Gaussian Mapping in Dynamic Environments

Qixin Xiao

University of Michigan

2026-06-30三维安全鲁棒

这篇论文针对动态场景中单目高斯 SLAM 容易把短暂停止或反复遮挡的行人写入静态地图、产生 ghosting 并影响机器人定位导航的问题,提出“运动永久性”视角:动态性应由运动历史决定而非逐帧外观判断。MoPe 用 SE(3) 几何传播历史动态后验,并以有界贝叶斯 log-odds 与当前证据融合,再用于跟踪、建图、Gaussian 插入和清理。在 Wild-SLAM、Bonn、TUM 上提升跟踪鲁棒性并减少残影,尤其在动态行人序列收益更明显。

CORE Planner: Contextual-memory Oriented Reinforcement-learning in Unknown Environments for Robot Navigation Figure 1
2026-06-30cs.RO

CORE Planner: Contextual-memory Oriented Reinforcement-learning in Unknown Environments for Robot Navigation

Jintao Kong, Zhihao Zhang, Weihuang Chen, Liming Chen, Zhongyu Guo, Shuaiyu Liu, Hongbin Sun

2026-06-30机器人

面向无先验地图的未知环境导航,论文针对传统规划依赖手工规则、学习方法记忆不足且难以迁移的问题,提出 CORE Planner:以稀疏可视图替代密集栅格,并用 Transformer 融合历史动作形成上下文记忆和动态图稀疏化。实验称其较 FAR Planner 路径缩短 13%,较学习基线最高缩短 48%,且仅仿真训练即可零样本实机导航。

AnyBody: Free-Form Whole-Body Humanoid Control from Arbitrary Keypoint Guidance Figure 1
2026-06-30cs.RO

AnyBody: Free-Form Whole-Body Humanoid Control from Arbitrary Keypoint Guidance

Shuning Li, Sikai Li, Jiachen Li, Mingyu Ding

University of North Carolina at Chapel Hill, Georgia Institute of Technology

2026-06-30机器人规划控制

本文针对人形机器人依赖全身动捕、固定遥操作接口或上下身解耦导致数据采集昂贵且全身协同受限的问题,提出 AnyBody:先从大规模人体运动学习球面潜在运动空间,再用带掩码自注意力的 Transformer 将任意稀疏关键点对齐到该潜空间,并以冻结解码器作为运动先验。实验显示其在单腕、躯干、脚踝等稀疏指令下仍保持约 93% 以上跟踪成功率,可支持 G1 实机 VR 遥操作及空中书写、避障触达等下游任务。

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering Figure 1
2026-06-30cs.RO

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

2026-06-30强化学习

本文针对行为克隆策略从多样示范中学到不安全/不期望模式的问题,提出 MoRE:用临时行为模式分类器在训练期产生重定向梯度,并通过保留损失把这种偏好蒸馏进策略权重,部署时无需额外 steering。实验覆盖 8 个仿真与真实任务、Diffusion Policy 和 π0.5 VLA,平均部署成功率较原混合模式策略提升 44 个百分点,接近过滤数据重训且保持推理速度。

Empowering a Single-Frequency GNSS Receiver to Achieve High-Precision Positioning with Relative Observations Figure 1
2026-06-30cs.RO

Empowering a Single-Frequency GNSS Receiver to Achieve High-Precision Positioning with Relative Observations

Xingpeng Wang, Ziwen Qu, Juncheng Chen, Ruitian Pang, Xiangyu Li, Tiancheng Lai, Siqi Shen, Wentao Liu, Pengfei Wang, Chao Xu, Yanjun Cao

2026-06-30机器人

这篇论文面向野外机器人中 RTK 成本高、依赖基站而单频 GNSS 又只能米级定位的问题,提出把任意相对运动传感器与单频载波相位紧耦合,用虚拟锚点构造 epoch-to-anchor 约束,并结合周跳检测与恢复来抑制长期漂移。真实手持、UGV、UAV 数据显示,低成本单频接收机可由数米误差提升到分米级,但单频电离层误差仍限制精度。

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation Figure 1
2026-06-30cs.RO

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li

University of Maryland, College Park, Carnegie Mellon University, University of Alabama, University of Washington, Stanford University

2026-06-30视觉感知强化学习

TacGen针对视觉难以判定质量、硬度、密度、受力等接触属性的问题,提出将RGB与DIGIT触觉特征做对比对齐,并用潜空间V→T生成器从视觉合成触觉表征以缓解触觉数据稀缺。结果显示,V+T在多项物理属性探针上显著优于同容量视觉基线,生成触觉潜变量接近真实触觉效用,并将TACTO操作成功率从0.246提升到0.979,说明触觉对接触依赖表征不是可选补充。

Multi-Contact Force Estimation for Continuum Robots via Gaussian-Parameterized Factor Graphs Figure 1
2026-06-30cs.RO

Multi-Contact Force Estimation for Continuum Robots via Gaussian-Parameterized Factor Graphs

Aditya Prakash, Panagiotis Tsiotras

2026-06-30机器人三维

面向连续体机器人在未知狭窄环境中可能发生多处接触、传统逐节点力估计病态且难扩展的问题,论文将高斯混合力参数化嵌入概率离散 Cosserat 杆模型,并用因子图融合应变、腱张力与位姿测量,同步估计形状和外力。仿真显示其在单接触和多接触的力位置与大小估计上优于既有方法,并给出按需增加基函数的渐进版本用于顺序接触场景。

On the Identifiability of Aided Inertial Navigation Under Measurement Delays: A Geometric Approach Figure 1
2026-06-30cs.RO

On the Identifiability of Aided Inertial Navigation Under Measurement Delays: A Geometric Approach

Jonathan Kelly

2026-06-30机器人

针对辅助惯性导航中传感器测量存在未知恒定时延、直接把时延并入滤波状态却未必可辨识的问题,论文从特殊伽利略群上的几何视角分析时延与初始状态的可辨识性。核心洞察是延迟测量模型存在连续对称性,可由改变初始状态补偿时延变化;结果给出最小测量条件,并刻画了比既有工作更大的退化运动类别。

When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems Figure 1
2026-06-30cs.RO

When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems

Yash Tandon, Giovanni Tapia Lopez, Marcus Blennemann, Mohan Trivedi, Ross Greer

2026-06-30安全鲁棒

本文针对自动驾驶“遇不确定即停车”的最小风险状态在真实城市中可能阻塞急救、干扰交通和削弱无障碍服务的问题,梳理公开事故并从感知、规划、控制失配建立分类。核心洞察是安全不应只等同于避撞或静止,而需理解人类权威、多模态指令和社会化交通规则;结果指出未来框架应加入人机交互感知、语言/无障碍规划及远程协助控制。

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models Figure 1
2026-06-30cs.RO

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee, Youngsun Wi, Yinpei Dai, Dmitry Berenson, Nima Fazeli

Robotics Department, University of Michigan, Computer Science and Engineering Department, University of Michigan

2026-06-30视觉感知

这篇论文针对VLA在接触丰富操作中看不见力觉、而直接加入触觉分支又会破坏预训练分布的问题,提出TAP-VLA:把GelSight触觉剪切场渲染成空间对齐的箭头叠加到原有多视角RGB图像中,以视觉标注形式提供触觉信息而不改架构。真实机器人四类任务中成功率达78%,显著高于视觉-only和触觉融合基线的不足50%,说明触觉如何呈现给预训练VLA可能比单纯增加模态更关键。

A Unified Framework for Multi-Contact Path Planning in the Rolling Robot Systems Figure 1
2026-06-30cs.RO

A Unified Framework for Multi-Contact Path Planning in the Rolling Robot Systems

Qing Yu, Mikhail Svinin, Seyed Amir Tafrishi

2026-06-30机器人规划控制

多接触滚动机器人在无滑约束下需同时处理耦合运动学、曲面构型空间和避障,传统直接规划计算复杂。本文将问题拆为“先在球面上找安全路径、再恢复可滚动运动”:用 Montana 接触坐标建立多球五维接触状态模型,并在球面 Voronoi 路图上结合障碍和互斥区域检测,再用 log–exp 平滑与前向仿真验证。结果显示该框架可生成满足多接触滚动约束的避障路径,并分析了平滑度、种子密度与计算时间的权衡;但实验主要为仿真,实体平台与非球形扩展仍未验证。

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer Figure 1
2026-06-30cs.RO

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

School of Computing and Data Science, The University of Hong Kong, HKSAR.

2026-06-30强化学习规划控制三维

这篇论文针对关键位姿操作依赖人工标注或任务启发式、难以规模化的问题,提出用单条示范的VLM语义事件识别结合轨迹运动分段来自动标注关键位姿,并将其作为Diffusion Policy条件信号;进一步用可达性地图筛选候选关键位姿,尝试跨本体零样本迁移。robomimic的Can与Square实验显示,自动标签训练的策略可接近标准DP基线,在多模态插入任务中可达性过滤可能提升迁移,但实验规模较小,结论仍属可行性验证。

HJ-SafeDMP: Hamilton-Jacobi Reachability-Guided Dynamic Movement Primitives for Provably Safe Robot Motion Figure 1
2026-06-30cs.RO

HJ-SafeDMP: Hamilton-Jacobi Reachability-Guided Dynamic Movement Primitives for Provably Safe Robot Motion

Siddhanth Ramesh, Ravi Prakash

All the authors belong to Cyber-Physical Systems, Indian Institute of Science (IISc), Bengaluru.

2026-06-30机器人安全鲁棒

这篇论文针对DMP虽鲁棒高效但缺少形式化避碰保证、HJ可达性虽严谨但在线计算昂贵的问题,提出HJ-SafeDMP:用离线示范数据学习CBVF,并以闭式梯度调制层过滤DMP控制,避免每步求解CBF-QP。7自由度机械臂实验报告零碰撞率、执行速度较优化基线快数个数量级;但神经CBVF未形式验证,安全保证仍受近似误差和数据覆盖限制。

Cross-Session 3D LiDAR and Camera Fusion for Robust Localization of Unmanned Aerial Vehicles in GPS-Denied Environments Figure 1
2026-06-30cs.RO

Cross-Session 3D LiDAR and Camera Fusion for Robust Localization of Unmanned Aerial Vehicles in GPS-Denied Environments

Cong Hoang Quach, Chi Thanh Vo, Dong LT. Tran, Truong Son Nguyen, Manh Duong Phung, Thuan Hoang Tran

– School of Electrical and Data Engineering, University of Technology Sydney, New South Wales, Australia, – Institute of Aerospace Engineering and Technology, Duy Tan University, Da Nang, Vietnam, – College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam, – Smart Green Transformation Center (GREEN-X), VinUniversity, Hanoi, Vietnam, – Department of Artificial Intelligence and Robotics, Sejong University, Seoul, South Korea, unavailable in many real-world operating conditions [1]. This limitation is particularly critical for UAV-based

2026-06-30三维安全鲁棒

针对桥梁底部、隧道等 GPS 失效且视觉纹理/几何结构不稳定的无人机巡检场景,论文提出 Cross-Fusion:用离线多会话视觉-几何数据库提供全局约束,在线结合 3D LiDAR 里程计与单目图像检索/匹配,并将 2D 匹配提升为 3D 位姿校正。实验称其精度接近 GPS 定位,并在特征稀疏环境中保持较稳健表现。

ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies Figure 1
2026-06-30cs.LG

ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies

Tzu-Hsiang Lin, Srinivas Shakkottai, Dileep Kalathil, P. R. Kumar

Texas A&M University

2026-06-30生成模型

ReGuide针对扩散行为克隆在机器人长程操作中易受协变量偏移影响的问题,提出把测试时引导产生的成功恢复轨迹回收为训练数据,而不是执行后丢弃。其核心是阶段条件引导PCG:按任务阶段构造潜在目标、只在“已偏离但仍可恢复”区域施加梯度,并通过干净动作估计匹配动力学模型分布;随后用微调或重训迭代吸收这些轨迹。在Robomimic四项任务上,成功率相对基线提升约1.3–7.7倍,并优于LPB,消融表明收益主要来自引导恢复数据而非单纯增加rollout数量。

You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact Figure 1
2026-06-30cs.RO

You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact

Pengfei Ye, Yuxiang Ma, Haonan Chen, Guangming Wang, Yixiong Jing, Brian Sheil, Yilun Du, Edward Adelson

Harvard University, University of Cambridge

2026-06-30三维

针对视觉位姿估计在遮挡、弱光和透明/反光物体上失效的问题,YOTO探索仅凭一次双GelSight触觉接触恢复物体6DoF位姿。其关键是把触觉补丁表示为局部3D点云,在物体表面块上粗到细定位两处接触,再结合表面法向和传感器标定用闭式SVD求解位姿,并用虚拟触觉预训练加少量真实接触微调。四类物体实验显示其接触定位误差低于5mm,在重遮挡下优于视觉和几何基线,但仍需逐物体微调且对近共轴抓取敏感。

LNN-Fly: Continuous-Time UAV Navigation for Robust Obstacle Avoidance under Timing Mismatch Figure 1
2026-06-30cs.RO

LNN-Fly: Continuous-Time UAV Navigation for Robust Obstacle Avoidance under Timing Mismatch

Yulin Huang, Shaojie Chen, Di Feng, Jiahao Wang, Ping Liu, Jianxiao Zou

Ping Liu and Jianxiao Zou are with the Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China, Shenzhen, Guangdong 518000, China.

2026-06-30机器人安全鲁棒

这篇论文针对端到端无人机避障在真实部署中易受仿真差异、传感不规则和控制周期抖动影响的问题,提出 LNN-Fly:将连续时间循环策略显式输入 Δt,并用输入驱动遗忘门在接近障碍时刷新潜状态。模型通过含时序扰动的可微 rollout 训练,在仿真中提升低频、稀疏观测和抖动下的避障鲁棒性,并零样本迁移到实体四旋翼;室内跨频率测试 20 次飞行成功率达 100%,板载 CPU 推理约 2.5 ms。

Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning Figure 1
2026-06-30cs.RO

Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning

Shuo Cheng, Chuye Zhang, Alfred Cueva, Caelan Garrett, Ajay Mandlekar, Danfei Xu

Georgia Institute of Technology

2026-06-30机器人规划控制优化算法

Human2Any针对人类视频丰富但难以直接迁移到机器人、且受形体差异与场景可行性约束限制的问题,提出以物体—物体交互为核心的因子图表示,将可迁移的交互先验与机器人侧抓取、可达性、碰撞等约束解耦,并用约束感知采样组合规划。实验覆盖仿真、Franka桌面和RBY-1人形移动机器人,显示无需目标任务真实机器人示教也能完成细粒度与长程操作,并具备跨物体、布局和机器人形态的适应性。

Physics Models for Sim-to-Real Transfer in Professional-Level Robot Table Tennis Figure 1
2026-06-30cs.RO

Physics Models for Sim-to-Real Transfer in Professional-Level Robot Table Tennis

Christian Conti (1), Bilan Yang (1), Alexander Sigrist (2), Lorenzo Miele (2), Yamen Saraiji (1), Peter Dürr (2), Naoya Takahashi (2) ((1) Sony AI, Tokyo, Japan, (2) Sony AI, Zurich, Switzerland)

2026-06-30机器人

面向专业级乒乓球机器人,论文针对高速强旋下仿真误差会被对手利用、真实强化学习训练代价高的问题,重建球飞行、台面碰撞和球拍碰撞物理模型:阻力与马格努斯系数依赖雷诺数和自旋比,台面模型考虑球体屈曲并加残差,球拍模型加入残差神经网络。基于大规模高水平对局数据验证后,各模块相对既有基线降低预测误差,并用于训练可与职业选手对打的真实机器人策略。

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models Figure 1
2026-06-30cs.CV

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

2026-06-30强化学习

ViPSim针对具身世界模型中低维动作与高维视频生成缺乏几何对应、长时预测易轨迹漂移的问题,提出视觉空间与参数空间协同:前者引入末端位姿投影、相机视角、深度几何和机器人形态掩码,后者注入动作序列与相机矩阵以精确驱动运动。实验显示该方法可适配不同生成骨干,提升长时轨迹一致性,并在布料等可变形物体、OOD和跨机器人场景中保持较稳健表现。

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control Figure 1
2026-06-30cs.RO

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

Runji Cai, Toshihiko Yamasaki, Ling Xiao

2026-06-30机器人视觉语言视觉感知规划控制

本文针对社会机器人导航中“懂语义但难落地控制”的断层,指出仅靠几何规划难以处理人类意图、社交规范与情境线索。核心贡献是把VLM-SRN整理为高层视觉语言推理、低层规划控制及中间桥接机制三部分,并给出包含语义评估、空间 grounding、中间表示和控制模块的部署路线图;主要结果是系统梳理相关方法、数据集与评测平台,强调实用系统仍需混合架构,低延迟、安全性和分布外鲁棒性仍未充分解决。

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models Figure 1
2026-06-30cs.CV

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

Nuo Chen, Lulin Liu, Zihao Li, Ziyao Zeng, Zihao Zhu, Wenyan Cong, Junyuan Hong, Yunhao Yang, Zhengzhong Tu, Yan Wang, Boris Ivanovic, Marco Pavone, Zhangyang Wang, Yang Zhou, Zhiwen Fan

2026-06-30强化学习数据集/基准

这篇论文针对自动驾驶世界模型评估过度依赖视觉质量、难以发现碰撞等多智能体交互中的物理违背问题,提出 CrashTwin 基准:结合 25K 合成与 12K 真实碰撞序列,并用免标定重建从视频中恢复 3D 运动属性,评估时空一致性、动量/能量守恒和世界动态完整性。实验显示,现有高感知质量模型仍常出现严重物理失真,且物理指标比传统视觉指标更贴近人类对真实感的判断。

He3-Seeker: Robotic Information Planning for Lunar Helium-3 Distribution Mapping Figure 1
2026-06-30cs.RO

He3-Seeker: Robotic Information Planning for Lunar Helium-3 Distribution Mapping

Dong Li, Yujie Zheng, Chengdeng Cao, Siyu Teng, Yuchen Li, Yang Gao, Long Chen

2026-06-30机器人规划控制

这篇论文针对月球氦-3主要依赖轨道遥感间接反演、分辨率和可靠性不足的问题,将带钻取、采样和原位分析能力的月球车建模为主动资源测绘系统。核心创新是提出 He3-Seeker,用机器人信息规划在行驶与多点钻采成本之间权衡,按信息增益选择采样位置,并构造基于低分辨率遥感的参考分布用于评测。仿真实验显示其可更快获得较高保真度的氦-3分布图,但真实性仍取决于模拟环境和参考数据生成假设。

CubifyGS: Object-Centric 3D Gaussian Splatting for Lifelong Dynamic Scene Maintenance Figure 1
2026-06-30cs.RO

CubifyGS: Object-Centric 3D Gaussian Splatting for Lifelong Dynamic Scene Maintenance

Bohan Ren (1), Dianyi Yang (1), Shiyang Liu (1), Yu Gao (1), Jiadong Tang (1), Zhilin Lai (2), Yi Yang (1), Mengyin Fu (1) ((1) Beijing Institute of Technology, (2) Guangzhou Saite Intelligent Technology Co., Ltd.)

2026-06-30三维

针对机器人长期建图中物体被搬移后,传统 3DGS 依赖逐基元再优化会产生幽灵残影且恢复慢的问题,CubifyGS 将可移动物体建模为可复用高斯资产,通过时空变化感知、资产检索与刚体对齐、显式剪除旧物体,并用事件触发的局部自适应优化修补空洞和外观不匹配。论文在自建动态重排基准上显示,其相较可复现基线能更好抑制伪影并提升维护效率。

J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs Figure 1
2026-06-30cs.RO

J-LAW: Joint Localization and Actionable World Modeling via Coupled Latent Factor Graphs

Guanqun Cao, Liang Chen

2026-06-30强化学习

这篇论文针对传统 SLAM 有全局一致但不可预测、动作条件世界模型可规划但易漂移的问题,提出用耦合潜在因子图统一优化位姿、潜在状态和潜在地标,并通过位姿条件编码器与位姿—潜变量耦合因子实现双向约束。PushT 和 WildGS 实验显示,图优化能降低潜在预测 RMSE 与终点漂移,潜在回环也改善轨迹一致性,但耦合模块训练与回环置信度仍文中未充分说明。

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots Figure 1
2026-06-30cs.CR

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

Nima Dorzhiev

Pennsylvania State University, State College, USA

2026-06-30机器人规划控制

针对LLM接入ROS 2机器人后,传感器输入会被串入提示词并直接影响执行的问题,RIPA系统评估了视觉OCR、语音STT和LiDAR状态投毒三类感知通道的提示注入风险。结果显示脆弱性不随模型规模单调变化,70B Llama与约4B Gemma均高度易受攻击;LiDAR上下文投毒在DeepSeek上三类攻击均达100%成功率,混合语义防火墙虽能拦截已知模式,但仍被混淆载荷绕过。

PinNet: Keypoint-Aware Learned Local Descriptors with Geometric Embedding for Loop Closure in LiDAR SLAM Figure 1
2026-06-30cs.RO

PinNet: Keypoint-Aware Learned Local Descriptors with Geometric Embedding for Loop Closure in LiDAR SLAM

Yanlong Ma, Nakul S. Joshi, Christa S. Robison, Philip R. Osteen, Brett T. Lopez

*This research was sponsored by the DEVCOM Army Research Laboratory (ARL) under SARA CRA W911NF-24-2-0017. Distribution Statement A: Approved for public release

2026-06-30机器人

针对仅依赖 LiDAR 几何信息时回环检测易受稀疏点云、视角变化和相似结构干扰,且候选回环还需精确配准的问题,PinNet 学习关键点及局部描述子,并用基于平面的几何自注意力显式建模关键点间空间关系,以提升描述子的可区分性和配准可用性。实验在 SemanticKITTI 及 ARL、UCLA 自采多传感器数据上验证,表现出较强地点识别、相对位姿估计和单次定位能力。

Reachability Guarantees for Cart-Pole Swing-Up and Stabilization Figure 1
2026-06-30eess.SY

Reachability Guarantees for Cart-Pole Swing-Up and Stabilization

Mohamed Khalid M Jaffar

*This work was not supported by any organization. The simulation scripts are available at github.com/khalid2696/cartpole_swing_analysis .

2026-06-30机器人

针对车杆摆起中“全局能量摆起”与“局部 LQR 稳定”常被分开证明的问题,论文用可达性视角把两阶段控制串起来:通过能量误差 Lyapunov 设计并抵消保守耦合项,使导数符号确定,再用增广 Lyapunov 约束小车速度,并把切换区域严格嵌入 LQR 吸引域。仿真显示约 12 秒完成切换并收敛到直立平衡,小车位移保持在保守界内。

Fast and Accurate Outlier-Aware LiDAR Super-Resolution for SLAM Applications Figure 1
2026-06-30cs.RO

Fast and Accurate Outlier-Aware LiDAR Super-Resolution for SLAM Applications

Christos Anagnostopoulos, Alexandros Gkillas, Nikos Piperigkos, Aris S. Lalos

2026-06-30机器人

面向低成本16线激光雷达在SLAM中点云稀疏、漂移增大且常规超分辨率易引入离群点和实时性不足的问题,论文将距离图超分辨率写成含数据一致性、可学习先验和离群点抑制项的优化问题,并用深度展开构建轻量网络,集成到LeGO-LOAM端到端流程。实验显示其相较现有SR方法提升位姿估计精度与帧率,但具体增益分解文中未充分说明。

Embodiment Meets Environment: Toward Context-Aware, Safe Physical Caregiving Robots Figure 1
2026-06-30cs.RO

Embodiment Meets Environment: Toward Context-Aware, Safe Physical Caregiving Robots

Zhanxin Wu, Ruofei Tong, Jiaying Fang, Tapomayukh Bhattacharjee

Cornell University, real-world, human-centered settings remains challenging. Most

2026-06-30机器人安全鲁棒

面向护理机器人在不同家庭环境、人体位置和机械臂/工具形态下难以安全迁移的问题,论文提出 E2-CARE:把人、环境与机器人具身统一到 3D 动态场景图中,将护理技能表示为可复用交互模板,并在线合成硬/软约束用控制障碍函数执行。仿真覆盖多种日常活动、数百环境和不同具身,真实用户研究也显示安全感、行为合适性和满意度优于无约束版本。

Robotic Arm-Based Spectral Sensing for Strawberry Positioning and Non-Destructive Sweetness Measurement Figure 1
2026-06-30cs.RO

Robotic Arm-Based Spectral Sensing for Strawberry Positioning and Non-Destructive Sweetness Measurement

Yi Yang, Mark Cardamis, Wen Hu

2026-06-30机器人

面向草莓品质检测中人工破坏性取样难扩展、复杂植株中定位不稳的问题,论文构建了机械臂搭载RGB-ToF与光谱传感的闭环系统,用YOLOv11s检测、深度对齐和眼在手标定实现3D定位,并以搜索航点和增量接近控制完成无损测糖。42次实验端到端成功率88.10%,检测率95.24%,检测后接近成功率100%;主要瓶颈仍在困难深度/反射条件下的有效甜度区域提取。

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks Figure 1
2026-06-30cs.RO

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks

Yujin Wang, Junli Chen, Yixuan Li, Shunan Dong, Huazhong Yang, Yongpan Liu, Hongyang Jia

Tsinghua University

2026-06-30机器人

论文针对具身模型部署中过度依赖“单步推理更快即任务更快”的假设,提出 TISED 框架,把有损轻量化对每步时延、rollout 步数、动作滞后和硬件算力的影响分解到任务层面。结果显示,静态任务中加速可能因动作质量下降反而拉长完成时间,动态任务中适度损失精度却可因观测更新更及时提高成功率,且最优轻量化强度会随硬件平台漂移。

FADA: Few-Shot Domain Adaptation via Dynamics Alignment for Humanoid Control Figure 1
2026-06-30cs.RO

FADA: Few-Shot Domain Adaptation via Dynamics Alignment for Humanoid Control

Angchen Xie, Nikhil Sobanbabu, Ishayu Shikhare, Alan Wang, Max Simchowitz, Guanya Shi

Carnegie Mellon University

2026-06-30机器人规划控制

本文针对人形机器人从仿真到真实部署时因地形、载荷和执行器差异导致的精细控制失效,提出将策略拆成规划器与逆动力学模型的 FADA:先蒸馏特权教师,再在目标域仅用约 2 分钟 rollout 监督微调 IDM,以对齐执行动力学而非重训全策略。实验覆盖跨仿真与 Unitree G1、Booster T1 真机任务,显示其优于上下文适应和端到端微调基线,并能完成斜坡行走、负载操控和全身跟踪等高精度任务。

Improvement of Robot's Simultaneous Localization and Mapping Using an Effective Transformation to Achieve Linear Model Figure 1
2026-06-30cs.RO

Improvement of Robot's Simultaneous Localization and Mapping Using an Effective Transformation to Achieve Linear Model

Seyed Farzad Bahreinian, Maziar Palhang, Mohammad Reza Taban, Hasan Enami Eraghi

2026-06-30机器人

针对 EKF-SLAM 中运动与观测模型非线性导致线性化误差、滤波发散和一致性下降的问题,论文引入普通电子罗盘测得航向,并通过坐标/观测变换将 SLAM 状态空间改写为线性模型,从而直接使用标准 Kalman Filter 构成 LMKF-SLAM。实验在仿真与 Victoria Park 数据集上显示,其相较 EKF、UnFS 和 ICKF 在定位建图精度、收敛性、计算复杂度及对传感器不确定性的稳定性上更优。

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration Figure 1
2026-06-30cs.RO

When May I Help You? On The Effect of Proactivity on Group Human-Robot Collaboration

Thomas Vitry, Vanessa Maeder, Kieran Edgeworth, Asihati Hazaiti, Doga Deniz Ates, Connor Gäde, Jan-Gerrit Habekost, Dennis Becker, Stefan Wermter

2026-06-30机器人

这篇论文关注多人协作中机器人何时主动介入才不打断人类协调的问题,在双人密室逃脱任务中比较“被点名才回应”的反应式机器人与持续监听、主动发起帮助的主动式机器人。结果显示,主动式显著增加交互频率,但反应式完成率更高(92.86% 对 71.42%);效果还受用户LLM/机器人经验和内外向特质影响,说明主动性并非普遍增益,而需匹配团队需求。

Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models Figure 1
2026-06-30cs.RO

Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models

Yang Liu, Yuming Chen

College of Intelligent Robitcs and Advanced Manufacturing, Fudan University, readable or manipulable. What remains less clear is how these pieces fit together inside a world model as the

2026-06-30强化学习

本文动机在于指出世界模型的预测精度不足以解释其潜在状态如何组织物理信息。作者提出事件条件诊断协议,分析自由运动、碰撞、遮挡下运动学、接触与物体恒存表征的读出权重及投影干预效应。结果显示不同事件会系统性重加权相关物理场,接触方向在碰撞窗口、恒存方向在困难遮挡窗口对预测有可测影响,但不等同于发现显式物理模块。

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis Figure 1
2026-06-30cs.RO

RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis

Minh-Loi Nguyen, Nghiem Tuong Diep, Hung Khang Nguyen, Minh Le, Doanh Le Thien, Hoang H. Tran, Dung D. Le, Vu N. Duong, Daniel Sonntag, An Thai Le, Duy Minh Ho Nguyen, Vien Anh Ngo, Tran Van Nhiem

Ho Chi Minh City University of Science, Vietnam National University, VinUniversity, German Research Center for AI (DFKI), Center for AI Research, VinUniversity, University of Stuttgart, Max Planck Research School for Intelligent Systems

2026-06-30机器人视觉语言视觉感知强化学习

机器人世界模型生成的视频即使逼真,也可能违背物理、时序或任务逻辑,传统指标和单体VLM难以给出可定位诊断。RoboGaze将评测改为训练-free多代理视觉语言分析,结合任务场景 grounding、维度专家路由和critic验证,用6维30类故障 taxonomy 输出带时间位置和证据的报告。在382段人标机器人操作视频、8种VLM上,相比零样本基线描述F1最高提升43点、时序对齐提升37点,干净片段准确率由低于25%升至超过80%。

A Query-Driven Communication-Efficient Digital Twins Design for Autonomous Driving Figure 1
2026-06-30cs.RO

A Query-Driven Communication-Efficient Digital Twins Design for Autonomous Driving

Nuocheng Yang, Longyu Zhou, Sihua Wang, Changchuan Yin, Tony Q. S. Quek

2026-06-30机器人

这篇论文针对自动驾驶数字孪生依赖车辆持续上报导致通信与计算冗余的问题,提出由孪生体根据仿真结果主动发起查询的架构,并用跨注意力从不稳定潜特征中按需取数;同时将轨迹位置误差、孪生保真度和通信资源联合优化,设计跨时间步的粗到细查询与资源调度机制。仿真显示,相比传统同步方法,规划位置误差降低约24%,通信开销降低约40%。

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients Figure 1
2026-06-30cs.RO

Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients

Carmen Ng, Gjergji Kasneci

Technical University of Munich, Technical University of Munich Munich Germany

2026-06-30机器人优化算法

这篇论文关注由 LLM 控制的社交机器人在资源有限时“先帮助谁”的跨文化道德偏差,动机是现有审计多偏英语文本场景。作者将 Moral Machine 偏好梯度改写为护理、教育、服务中的机器人分配困境,审计四个模型的 5.76 万次决策。结果显示模型常无法稳定追踪中日等非西方文化梯度,群体优先等默认倾向会抹平差异,单靠提示难以修正。

2026-06-29

36 篇
DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand Figure 1
2026-06-29cs.RO

DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

Dihong Huang, Zhenyu Wei, Zhuxiu Xu, Yunchao Yao, Sikai Li, Mingyu Ding

University of North Carolina at Chapel Hill

2026-06-29机器人三维

DexCompose针对灵巧手多任务操作中“保持已有抓取”和“执行新交互”争夺同一手指动作空间的问题,将技能组合重写为手指级资源分配。其核心做法是通过释放测试识别维持首个技能所必需的手指,并用显式动作所有权加双残差模块分别稳定保留任务、约束下游策略适配。实验覆盖16个组合任务,平均成功率77.4%,较直接策略串联和最强基线均有明显提升,说明减少跨任务动作干扰是主要收益来源。

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation Figure 1
2026-06-29cs.RO

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

University of California, Berkeley, Stanford University

2026-06-29强化学习

针对长时程机器人模仿学习中遥操作示范常含停顿、失误和恢复,直接按整段或绝对时间进度筛选会引入噪声,WARP-RM用时间扭曲和反向播放构造自监督的相对进度速度,识别局部前进、停滞或回退,并在WARP-BC中重加权动作片段。真实双臂T恤折叠等420次实验中,混入低质数据时成功率保持19/20,而普通BC降至2/20,吞吐最高提升约18倍。

CacheMPC: Certified Cached Model Predictive Control for Quadruped Locomotion Figure 1
2026-06-29cs.RO

CacheMPC: Certified Cached Model Predictive Control for Quadruped Locomotion

Nimesh Khandelwal, Mehul Anand, Shakti S. Gupta, Mangal Kothari

2026-06-29机器人规划控制

本文针对四足机器人分层控制中 MPC 每周期求解 QP 过慢、嵌入式算力下难以提高更新率的问题,提出按接触模式分区的 LSH 轨迹缓存,并用逐查询后验可行性与拉格朗日对偶间隙证书筛选可复用解。Unitree Go2 仿真与 Orin NX 实机显示无门控缓存带来约 25×/18.7× 中位求解加速,边界稳定率相对无缓存未见显著差异;证书对闭环安全的独立贡献文中未充分说明。

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation Figure 1
2026-06-29cs.RO

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

Nadun Ranawaka, Josiah Wong, Wei-Lin Pai, Wei-Teng Chu, Tianyuan Dai, Masoud Moghani, Hang Yin, Yunfan Jiang, Wesley Durbano, Brandon Huynh, Yu Fang, Linxi Fan, Danfei Xu, Ruohan Zhang, Li Fei-Fei, Bowen Wen, Ajay Mandlekar, Yuke Zhu

Georgia Institute of Technology, Stanford University, The University of Texas at Austin, University of Toronto

2026-06-29强化学习数据集/基准

针对真实机器人数据采集与评测成本高、手工搭建仿真场景难以规模化的问题,SimFoundry从单段真实视频自动重建可交互数字孪生,并模块化生成保留可供性的物体、场景和任务“数字近亲”,用于训练与评测策略。实验显示其仿真评测与真实表现高度相关,7个任务、5类策略上平均 Pearson 0.911;加入三类近亲数据后,零样本真实成功率分别提升17%、21%和40%。

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors Figure 1
2026-06-29cs.RO

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

2026-06-29视觉感知生成模型

论文针对四足机器人动作库长期局限于行走、奔跑等少数步态的问题,指出依赖动物动作捕捉与跨形态重定向会带来数据稀缺和物理不可行。Uni-Mo改为由LLM生成提示、视频扩散模型直接合成目标机器人动作,并用身份一致性损失抑制外观漂移,再提取3D轨迹训练策略。其发布7488个语言标注动作,仿真成功率97.6%,真实Unitree Go2随机392个动作部署成功率96.7%。

Learning Stable In-Grasp Manipulation in a Non-Dropping Action Space Figure 1
2026-06-29cs.RO

Learning Stable In-Grasp Manipulation in a Non-Dropping Action Space

Ha Thang Long Doan, Hikaru Arita, Kazuto Nakashima, Kenji Tahara

2026-06-29机器人

本文针对端到端强化学习在灵巧手内操作中易出现隐性失稳、最终掉物且训练低效的问题,将任务限制在保持接触的 in-grasp 操作,并把 FTODG 稳定抓取理论转化为“非掉落”稳定动作空间,再用 CBF 过滤策略动作以满足力/接触约束。实验表明,TSIGL 在重定位、重定向及噪声、延迟、摩擦变化下减少掉落和异常手指动作,比基线 RL 更省样本,且较纯 FTODG 更准确。

PA-BiCoop: A Primary-Auxiliary Cooperative Framework for General Bimanual Manipulation Figure 1
2026-06-29cs.RO

PA-BiCoop: A Primary-Auxiliary Cooperative Framework for General Bimanual Manipulation

Bai Qicheng, Wang Ziru, Ma Teli, Dai Guang, Wang Jingdong, Wang Mengmeng

University of Technology, Hangzhou. ∗ Corresponding Author.

2026-06-29机器人

针对双臂操作中双模型缺少交互、单模型又常把两臂视为等价的问题,PA-BiCoop借鉴人类“主手执行核心动作、辅助手支撑”的分工,提出共享全局编码器加主/辅解码器,并用动态角色分配在左右臂间切换角色;实验显示其在RLBench2平均较SOTA提升48%,真实任务平均提升超过50%,说明显式建模可变分工能显著改善协同。

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior Figure 1
2026-06-29cs.LG

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

Qinhong Zhou, Chuang Gan, Anoop Cherian

2026-06-29机器人

本文针对具身多智能体在部分可观测协作中常与伙伴行为或环境状态失配的问题,提出 LLawCo:让代理从失败轨迹中归纳“协作法则”,并通过监督微调嵌入推理链,以提升可解释、可控的自对齐能力。作者还构建 PARTNR-Dialog 基准;在四种 LLM 骨干上,相比最强开源通信式基线,成功率在 PARTNR-Dialog 平均提升 4.5%,在 TDW-MAT 提升 6.8%。

Regularized Reward-Punishment Reinforcement Learning Figure 1
2026-06-29cs.LG

Regularized Reward-Punishment Reinforcement Learning

Jiexin Wang, Eiji Uchibe

2026-06-29强化学习

这篇论文针对奖励—惩罚强化学习中“趋利”和“避害”策略通常各自优化、只在价值层面混合的问题,提出用 KL 耦合让两个策略互为动态先验,在策略层面相互约束并共同影响 Bellman 传播。作者进一步给出 KCSO 与深度实现 klDMP,并加入先验软化与回放缓冲设计;在网格世界和 Gazebo 机器人导航中,相比 DQN、SQL、softDMP 展现更好的安全性与学习稳定性,同时保持接近的任务表现。

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots Figure 1
2026-06-29cs.RO

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

2026-06-29机器人

这篇论文针对人类操作数据便宜丰富但难以直接迁移到双臂夹爪机器人的问题,指出手部6DoF姿态噪声大且手指接触模式与夹爪不匹配,因此只用初始头戴相机坐标系下的相对腕部平移作为人机共享的“桥接动作”。方法在π0式VLA中用交错动作token和注意力掩码处理腕部平移、末端6DoF与夹爪信号缺失,并通过三阶段人类预训练、人机协同训练和少量机器人后训练实现迁移。真实双臂任务显示,该表示优于直接学习噪声6DoF人类动作,并能随人类数据规模提升,但对需精细旋转的任务仍受限。

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation Figure 1
2026-06-29cs.CV

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou

Peking University

2026-06-29机器人强化学习

本文针对机器人操作视频世界模型中常见的轨迹断裂、物体形变和接触关系不一致问题,提出 PhysisForcing:先定位机械臂、物体、接触区等物理信息区域,再用像素级轨迹对齐和语义级区域关系对齐共同约束 DiT 特征。实验显示其在 R-Bench、PAI-Bench、EZS-Bench 上稳定优于基线,并将 WorldArena 闭环规划成功率从 16.0% 提升到 24.0%。

AI-Driven Synthesis for High-Tech System Design: Automating Innovation Figure 1
2026-06-29cs.AI

AI-Driven Synthesis for High-Tech System Design: Automating Innovation

Luuk Oerlemans, Steven Westerhof, Theo Hofman

2026-06-29机器人

面向机器人、机电与动力系统设计中拓扑、尺寸和控制强耦合导致的组合爆炸,论文提出以计算设计综合为核心的自动化设计范式,将知识抽取、图式拓扑生成、强化学习与非线性规划结合,并讨论用生成模型快速预测候选方案。两个案例显示该框架可自动筛选电驱架构并优化空间布置,减少人工枚举和CAD迭代,但具体量化增益与泛化边界文中未充分说明。

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence Cloud-Native Simulation Infrastructure for Embodied Intelligence Training, Evaluation, and Data Collection Figure 1
2026-06-29cs.RO

Building a Scalable, Reproducible, Evaluatable, and Closed-Loop Simulation Environment Foundation for Embodied Intelligence Cloud-Native Simulation Infrastructure for Embodied Intelligence Training, Evaluation, and Data Collection

Junwu Xiong, Yongjian Guo, Mingxi Luo, Ning Qiao, Lei Kang, Song Wang, Yince Gao

2026-06-29数据集/基准

面向具身智能训练与评测中真实机器人采集成本高、复现弱和长尾失败样本不足的问题,本文将仿真上升为云原生基础设施,而非单一模拟器或基准,提出资源调度、运行时、推理执行、数据评测四层架构,并串联任务生成、轨迹采集、数据治理与闭环优化。主要结果是给出可扩展平台蓝图、服务接口和分阶段落地路线;但缺少实证性能与模型增益验证,实际收益可能主要来自 scaling / data。

When Multi-Robot Systems Meet Agentic AI:Towards Embodied Collective Intelligence Figure 1
2026-06-29cs.RO

When Multi-Robot Systems Meet Agentic AI:Towards Embodied Collective Intelligence

Yuxuan Yan, Yuanyuan Jia, Qianqian Yang

2026-06-29机器人

论文针对具身机器人从单机感知-控制管线走向带记忆、规划与反馈的 agentic 系统后,多机器人仍主要共享地图和任务而缺少共享执行状态的问题,提出具身集体智能 ECI:以协同感知、协同行动和协同进化组织团队世界记忆、任务进展与技能经验。示例导航实验显示,新加入机器人继承合并世界记忆可减少从零搜索,但这只是框架的局部验证。

Drifting in the Future: Stabilizing Path Following Drifting on High-Latency Vehicle Systems Figure 1
2026-06-29cs.RO

Drifting in the Future: Stabilizing Path Following Drifting on High-Latency Vehicle Systems

Frederik Werner, Till Heintzenberg, Markus Lienkamp, Johannes Betz

sions into open-loop unstable regimes, ensuring controllabil-, Systems, TUM School of Engineering and Design, Technical University of, Munich Institute of Robotics and Ma-, available, of achievable dynamics, labeled as the tangent space. When

2026-06-29机器人

这篇论文针对以往自动漂移多依赖低延迟、电驱且后轮独立控制的研究平台,难以迁移到量产燃油车的问题,扩展路径跟随漂移控制框架:用状态预测补偿超过250 ms的动力总成延迟,重构控制以适配差速器耦合,并加入制动稳速。实车圆形和8字漂移实验显示,系统可稳定跟踪路径与侧偏角,横向误差控制在1.1 m、侧偏超调约0.06 rad。

Swarm sign language: motion-based communication between drones Figure 1
2026-06-29cs.RO

Swarm sign language: motion-based communication between drones

Thomas Rey, Julien Moras, Alexandre Eudes, Antoine Manzanera

2026-06-29机器人

针对无人机集群在干扰、静默或受限环境中无线通信不可靠的问题,论文提出用可观测飞行动作作为低主动性的备用信道:发送机执行由9类平面几何基元组成、并由尺度和法向量调制语义的轨迹,接收机用位姿估计与3DTrajDecoder同时完成分类、分割和几何回归。作者通过程序化生成含噪、动力学可行轨迹训练模型,并结合仿真、消融和真实飞行验证可行性,但实际通信容量与复杂场景鲁棒性仍受限。

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation Figure 1
2026-06-29cs.RO

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

School of Computer Science and Technology, East China Normal University, Shanghai 200062, China, State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai 200240, China

2026-06-29机器人视觉语言视觉感知

S2-VLA针对长程机器人操作中静态多模态融合难以随任务阶段调整、早期误差会沿动作链累积的问题,引入状态空间引导的自适应注意力,用信念状态跟踪进度并动态门控视觉、语言意图与动作历史。实验称其以2B规模在LIBERO、SimplerEnv等基准上超过多种7B级VLA并达到SOTA,说明阶段感知融合比单纯扩大模型更关键。

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation Figure 1
2026-06-29cs.RO

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

Center for Project-Based Learning, 2 Integrated Systems Laboratory, 3 Computer Vision and Geometry

2026-06-29机器人视觉语言强化学习

LocalNav针对开放词汇ObjectNav依赖云端大VLM、难以在移动机器人低延迟部署的问题,采用场景图高层决策而非连续低层控制,并将Claude等前沿模型的空间语义推理蒸馏到4B Qwen模型,再用E-RLVR约束任务成功与生成长度。结果显示Claude场景图管线在HM3D OVON达39.7%成功率,约500条推理轨迹微调后本地模型达34.5%,结合RL与量化将总体推理延迟降低82.8%。

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control Figure 1
2026-06-29cs.RO

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

Jiatao Ding, Songqun Gao, Andrea Del Prete, Matteo Saveriano

2026-06-29机器人强化学习规划控制优化算法安全鲁棒

本文针对安全强化学习在机器人控制中难以兼顾任务回报与精确约束满足的问题,提出 PPO-EAL,将精确增广拉格朗日与 PPO 的裁剪策略更新结合,并用动量调节乘子以缓解约束振荡。实验覆盖倒立摆、Franka 到达、四足运动及齿轮装配 sim-to-real,显示其在安全约束精度、奖励和接触力控制上优于多种一阶安全 RL 基线。

Booster Lab: A Data-Centric Pipeline for Learning Deployable Humanoid Locomotion Policies Figure 1
2026-06-29cs.RO

Booster Lab: A Data-Centric Pipeline for Learning Deployable Humanoid Locomotion Policies

Penghui Chen, Tinglong Zheng, Yufeng Zhang, Mingguo Zhao

School of Mechanical and Electronic Control Engineering, Beijing Jiaotong University, Beijing, China, Booster Robotics Technology Co., Ltd, Beijing, China

2026-06-29机器人

这篇论文针对人形机器人可部署运动学习中“数据可用但不可直接上机”的问题,提出 Booster Lab,将动作筛选、修复、重定向、增强、可行性过滤、real-to-sim 标定、AMP 强化学习和 sim-to-real 部署串成闭环。结果在 Booster T1 上通过仿真与实机测试验证,并在 K1 上做了初步跨平台迁移;但具体收益有多少来自数据流程、模型标定或训练规模,文中仍未充分说明。

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations Figure 1
2026-06-29cs.RO

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

2026-06-29机器人

LXD-SLAM针对现有多传感器SLAM常绑定固定硬件、融合不统一且稠密地图难以全局一致的问题,提出以3D LiDAR为核心的可插拔框架,覆盖LiDAR、相机、IMU、轮速计和GNSS的32种组合。其关键在于用IESKF统一预测与点到网格/视觉重投影更新,并以多层GP子网格支持深度关联和回环。实验显示其在多种配置下达到或超过专用里程计,同时实时生成全局一致稠密网格。

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks Figure 1
2026-06-29cs.RO

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

2026-06-29视觉语言视觉感知

SpikeVLA针对现有VLA依赖大Transformer、难以在低功耗实时机器人上部署的问题,将视觉编码、跨模态推理和连续动作策略都改造成事件驱动的脉冲神经网络:Spike-V降视觉表征能耗,Spike-L用脉冲动态与token级稀疏减少推理开销,Spike-A用群体编码稳定输出控制。实验称其在导航和机器人控制中接近ANN基线,同时显著降低能耗与计算量,但神经形态硬件上的实时收益仍未充分验证。

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance Figure 1
2026-06-29cs.LG

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

Shiqiang Gong

2026-06-29生成模型规划控制安全鲁棒

面向安全关键的离线强化学习,论文指出现有扩散规划多按期望回报优化,容易忽视低概率灾难风险。RS-Diffuser将轨迹扩散生成与分布式价值 critic 结合,用分位数回归估计完整回报分布,并在采样去噪时以 CVaR 等尾部风险梯度引导规划,使同一模型可通过推理参数切换风险偏好。实验称其在风险敏感 D4RL 与机器人导航中提升回报、最坏情形鲁棒性并减少安全违规。

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models? Figure 1
2026-06-29cs.RO

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

University of Maryland, College Park

2026-06-29视觉语言视觉感知

这篇论文质疑当前VLA机器人模型是否过度继承大规模语言骨干,提出Drop-Then-Recovery:先移除Transformer块再微调,以闭环任务恢复能力衡量冗余,并用GateProbe按动作损失敏感度选块。实验显示语言模块在现有操作基准中高度冗余,删半数LLM块后OpenVLA-OFT在LIBERO从95.0%升至98.3%,仅保留两层也基本恢复;视觉和动作通路则明显更脆弱,说明现有基准对深层语言 grounding 压力不足。

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory Figure 1
2026-06-29cs.RO

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Peng Su, Zhaowen Li, Yan Huang, Liang Wang

2026-06-29强化学习

这篇论文针对长时程机器人操作中世界-动作模型易遗忘早期关键状态、难判断任务进度的问题,提出 DiM-WAM:用多银行历史事件记忆从真实观测中压缩并合并视觉事件,再以银行与时间嵌入参与视频和动作去噪,并加入进度监督。实验显示其在 RMBench 将 LingBot-VA 成功率从 28.4% 提升到 69.8%,真实 Franka 任务全流程成功率从 52.5% 提升到 80.0%。

CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation Figure 1
2026-06-29cs.RO

CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation

Wenqi Ge, Junde Guo, Zhen Fu, Shunpeng Yang, Jiayu Chen, Hua Chen

2026-06-29机器人模仿学习

本文面向人形机器人行走与双臂操作难以同时稳定、自然的问题,提出 CWI 将动捕数据按功能解耦:上肢利用完整 AMASS 保留多样操作,下肢用精选行走/下蹲片段经双 AMP 提供稳定运动先验,并用多 critic 与师生蒸馏统一成可由手部位姿和速度/高度命令控制的全身策略。仿真和 LimX Oli 实机结果显示其具备较好的全身协调与便携遥操作能力,但行为覆盖仍受动作库和命令接口限制。

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization Figure 1
2026-06-29cs.RO

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

National Tsing Hua University, National Yang Ming Chiao Tung University

2026-06-29学习理论三维

本文针对 VLA 在物体位置变化和同场景不同指令下容易失效的问题,指出瓶颈不只是是否有视觉 grounding,而是 grounding 信号如何表示并注入策略。作者将 2D 目标点经深度提升为相对夹爪的 3D 位移,用两层 MLP 编码后直接通过自适应层归一化注入动作头,无需改动骨干模型。在 LIBERO-PRO 上,GR00T-N1.6 的任务扰动成功率从 31.2 提升到 77.5,位置扰动从 28.1 提升到 60.2,并在 π0.5 和真实机器人实验中呈现类似收益。

Characterizing Driver Interactions with Autonomous Vehicles via Response Maps Figure 1
2026-06-29eess.SY

Characterizing Driver Interactions with Autonomous Vehicles via Response Maps

Dave Broaddus, Rachel DiPirro, Chishang (Mario) Yang, Dan Calderone, Wendy Ju, Meeko Oishi

University of New Mexico

2026-06-29机器人

针对自动驾驶车在路口交互中缺乏“社会感知”、容易出现该让不让或被让不走的问题,论文用博弈论中的响应映射把人类驾驶员加速度建模为依赖人车双方状态与AV行为的反馈律,并用VR驾驶模拟数据学习线性表示。结果显示,该框架能刻画驾驶员加速度反应,且人对让行、不让行、会响应人的AV表现出显著不同的行为模式。

P-ARC: Exploiting Subproblem Independence for Parallel Multi-Robot Motion Planning Figure 1
2026-06-29cs.RO

P-ARC: Exploiting Subproblem Independence for Parallel Multi-Robot Motion Planning

James D. Motes, Marco Morales, Nancy M. Amato

2026-06-29机器人规划控制

多机器人运动规划受复合空间指数膨胀与优先级方法串行依赖限制,难以随机器人数量扩展。P-ARC的核心洞察是利用ARC先独立规划、再局部耦合解冲突的子问题独立性,将初始规划、冲突检测和冲突消解并行化,并用成对覆盖保证可并行的独立冲突批次,同时引入OR多启动。实验覆盖最多128个2D机器人和Panda多机械臂场景,16核下相对顺序ARC接近4倍加速,但当冲突独立性不足时可能变慢。

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments Figure 1
2026-06-29cs.RO

Physics-Guided Robotic Radiation Source Localization along Arbitrary Measurement Paths in Unstructured Environments

Hojoon Son, Kai Tan, Fan Zhang

2026-06-29机器人

面向核设施等非结构化环境中的机器人辐射源定位,论文针对主动搜索会迫使机器人靠近源、且限制任务路径的问题,提出一种基于物理信息机器学习的RSL框架,用物理启发张量、偏移张量和并行推理处理未知障碍导致的伽马通量衰减,使机器人可沿任意测量路径定位源。方法在蒙特卡洛高保真仿真和真实机器人实验中跨源类型、障碍材料与几何进行验证,结果显示定位精度与鲁棒性优于既有方法,并支持在线连续学习部署。

Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor Figure 1
2026-06-29cs.RO

Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor

Yifan Zhai, Elia Raimondi, Yunfan Ren, Ismail Geles, Yannick Armati, Jiaxu Xing, Davide Scaramuzza

These authors are with the Robotics and Perception Group, Department of Informatics, University of Zurich

2026-06-29机器人

本文面向搜救、医疗投送等需不停机快速交付的场景,解决四旋翼悬挂载荷“边飞边抛”中绳索柔性、松紧切换和释放时机难建模的问题。核心做法是将实飞辨识的四旋翼模型与 PhysX 绳索/载荷求解器按步交换六维力矩耦合,并在其中训练强化学习策略。硬件零样本实验中,相比模型预测控制基线,落点误差最高降低 50%,投掷时长最高缩短 30%,消融表明高保真耦合仿真是主要增益来源。

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction Figure 1
2026-06-29cs.RO

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

2026-06-29机器人视觉感知

这篇论文针对现有人形机器人全身运动跟踪在搬物、上楼等接触密集场景中仅靠运动学参考会产生力交互歧义的问题,提出 SceneBot:在参考动作之外加入逐身体链路的接触提示,并用 hindsight scene reconstruction 从重定向人类动作中合成地形、物体与接触标注。模型用约 7.5 小时重构数据训练后,可在单一策略中覆盖自由运动、复杂地形与全身操作,并展示了搬箱上楼等长时程任务;但真实机器人部署与接触标签上层生成仍有待进一步说明。

Spacecraft Fiducial Marker for Autonomous Rendezvous, Proximity Operations, and Docking Figure 1
2026-06-29cs.RO

Spacecraft Fiducial Marker for Autonomous Rendezvous, Proximity Operations, and Docking

Ravi Kumar Thakur, Matouš Vrba, Martin Saska

2026-06-29机器人

面向在轨服务、装配和碎片清除中的自主交会近距操作,论文指出普通单尺度标记在近距离和曲面航天器表面易失效。AstraTag用递归 Spidron 图案、48位GRS编码和TPS曲面重映射实现多尺度识别与畸变补偿。实验显示其在曲面模拟航天器上检测率优于 Fractal ArUco 和 AprilTag,平面场景三者接近;但距离对比受 AprilTag 打印尺寸更大影响,部分增益可能来自 scaling。

Radar Guided Camera Verification for Automatic Emergency Braking Rethinking Object Detection in Radar Camera Fusion Figure 1
2026-06-29cs.CV

Radar Guided Camera Verification for Automatic Emergency Braking Rethinking Object Detection in Radar Camera Fusion

Ram Charan Akula, Sivanathan Kandhasamy, Manikandan Ganesan

2026-06-29视觉感知

本文针对AEB中雷达已完成目标定位后,相机仍运行重型目标检测的问题,提出将相机角色改为雷达ROI内的障碍存在验证,并用无需训练和GPU的边缘密度门控实现。实车72次行驶、13.16万帧评估显示,其最多减少98.7%视觉搜索空间,ROI平均延迟0.121 ms,AUC 0.898、召回0.994,33个威胁场景无漏制动;但跨平台、光照和标注一致性仍需更多验证。

AO-ARC: Almost-Surely Asymptotically Optimal Multi-Robot Motion Planning with ARC Figure 1
2026-06-29cs.RO

AO-ARC: Almost-Surely Asymptotically Optimal Multi-Robot Motion Planning with ARC

James D. Motes, Marco Morales, Nancy M. Amato

2026-06-29机器人规划控制

多机器人运动规划常在快速可行解与全局解质量保证之间取舍,原因是组合状态空间随机器人数量急剧膨胀。AO-ARC的关键是把ARC的自适应解耦/耦合冲突修复嵌入AO-x的有界可行规划框架,并用makespan全局时间界统一约束个体路径、局部子问题和完整组合问题,从而在必要时扩展到包含最优解。文中证明其几乎必然渐近最优,并在2D移动机器人、平面/3D机械臂任务中显示初始求解接近可行性求解器,且随机器人增多比现有anytime方法收敛更快、更稳定。

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience Figure 1
2026-06-29cs.RO

Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience

Raymond Yu, William Huey, Mustafa Mukadam, Anusha Nagabandi, Abhishek Gupta

University of Washington

2026-06-29强化学习

这篇论文针对真实机器人模仿策略虽可用但慢、脆弱,而直接在硬件上用强化学习改进代价高的问题,提出 SCORE:只在仿真中学习,并通过 flow steering 将动作限制在真实数据预训练生成策略的支持集内,而非简单贴近原分布,以减少仿真漏洞利用并保留可改进空间。在八个真实多指灵巧操作任务中,成功率由 37.8% 提升到 89.9%,优于最佳基线 59.5%,且完成步数减少 36.8%。

2026-06-26

63 篇
Scalable Behavior Cloning with Open Data, Training, and Evaluation Figure 1
2026-06-26cs.RO

Scalable Behavior Cloning with Open Data, Training, and Evaluation

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

Scalable Behavior Cloning with, Carnegie Mellon University, State-of-the-art systems are often developed in industry labs on proprietary datasets, and their training

2026-06-26模仿学习数据集/基准

针对机器人模仿学习中数据、训练配方和真实评测长期封闭且难复现的问题,论文提出全开源 ABC 栈:包含 3553 小时、13.5 万轨迹、195 任务的双臂遥操作数据 ABC-130K,以及硬件、训练/部署、仿真数据和评测回放。作者比较 DiT 与 VLA 等架构并用真实机器人消融,显示基线可完成折盒、取卡等灵巧长程任务;性能增益可能主要来自 scaling / data。

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays Figure 1
2026-06-26cs.RO

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

Department of Computer Science, University of North Carolina at Charlotte, United States

2026-06-26生成模型强化学习模仿学习

这篇论文针对机器人持续模仿学习中顺序微调易遗忘、而真实历史示范又常不可得的问题,提出 ReGen:利用世界动作模型同时生成动作与未来视觉的能力,递归合成旧任务伪轨迹并与新任务数据一起回放训练。仿真和真实操作实验显示,相比朴素顺序微调可将灾难性遗忘降低约 50%,接近需访问真实回放数据的方法;但性能仍受长时程视觉退化和动作—观测不一致限制。

RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection Figure 1
2026-06-26cs.RO

RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection

Xingyu Ren, Chugang Yi, Ge Ma, Youran Sun

2026-06-26视觉感知

这篇论文关注机器人团队在部署前已会对多个 VLA 策略做 smoke test,却通常只用平均表现选一个全局赢家的问题。RouterVLA 的核心洞察是把这些调试试运行转化为“按目标条件选专家”的监督信号,并用结果隔离的交叉评估避免把被评分试次泄漏进选择依据。在 34,752 条 LIBERO-Plus 记录上,简单的探测成功率规则将 held-out 成功率从 0.4686 提升到 0.6149,增益 14.64 个百分点;更复杂的学习打分器并未显著优于该规则,说明主要价值来自保留条件化调试证据而非 scorer 容量。

Continual Robot Policy Learning via Variational Neural Dynamics Figure 1
2026-06-26cs.RO

Continual Robot Policy Learning via Variational Neural Dynamics

Jiaxu Xing, Zhiyuan Zhu, Yunfan Ren, Ismail Geles, Yifan Zhai, Rudolf Reiter, Davide Scaramuzza

University of Zurich

2026-06-26机器人强化学习

这篇论文针对机器人部署后会反复遭遇风、载荷、磨损等隐藏且变化动力学,而固定策略或单次在线重拟合难以复用经验的问题,提出用真实轨迹学习带物理先验的变分神经动力学:循环编码器从近期交互推断隐变量,并同时条件化残差模型与策略,在可微仿真中持续优化。四旋翼实验显示,遇到重复风扰时约 1 秒恢复,比在线残差重拟合快约 5 倍,并在大扰动悬停和跟踪误差上分别降低 65.7% 和 53.3%。

Bridging Performance and Generalization in Reinforcement Learning for Agile Flight Figure 1
2026-06-26cs.RO

Bridging Performance and Generalization in Reinforcement Learning for Agile Flight

Jonathan Green, Jiaxu Xing, Nico Messikommer, Angel Romero, Davide Scaramuzza

University of Zurich

2026-06-26强化学习学习理论

本文针对强化学习无人机竞速在固定赛道上很快、但换到新赛道即崩溃的问题,提出结合学习进展驱动的自适应任务切换与物理约束程序化赛道生成的训练框架,使策略持续接触可行且多样的任务。结果显示,其在仿真和真实赛道上实现零样本泛化,相比既有方法泛化提升约7.4倍且速度快37.73%,视觉端到端设置中也能完成此前方法失败的未见赛道。

VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity Figure 1
2026-06-26cs.RO

VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity

Yuemin Mao, Uksang Yoo, Jean Oh, Jonathan Francis, Jeffrey Ichnowski

Carnegie Mellon University, Bosch Center for Artificial Intelligence

2026-06-26机器人

VibeAct针对灵巧手操作中接触、滑移事件快速且常被视觉遮挡的问题,提出不直接模拟原始振动音频,而把压电麦克风信号映射为可在仿真中计算的接触与滑移表征,再用其训练强化学习策略。数字克隆自动标注降低了真实数据成本;在五个接触丰富任务中,相比本体感知加点云基线更稳健,尤其在需持续反应控制的旋转、插入任务上收益明显,并完成实机迁移。

Hallucination in World Models is Predictable and Preventable Figure 1
2026-06-26cs.LG

Hallucination in World Models is Predictable and Preventable

Nicklas Hansen, Xiaolong Wang

2026-06-26强化学习

本文关注视觉世界模型在强化学习/控制中“看起来合理但偏离真实动力学”的幻觉问题,指出其根因更多是状态-动作覆盖不足而非单纯模型结构。作者构建 MMBench2,并将幻觉分为感知、动作边缘化和场景发散三类,提出无监督预测信号用于检测与采样。实验显示覆盖感知训练可同步降低多类失败,用预测信号作好奇心奖励仅需约 50 条真实轨迹即可适配未见环境。

OctoSense: Self-Supervised Learning for Multimodal Robot Perception Figure 1
2026-06-26cs.CV

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

General, Robotics, Automation, Sensing and Perception (GRASP) Laboratory, University of Pennsylvania, Computer Science Department, Brown University, SSL has been instrumental in building highly general representations trained on unlabeled data. These

2026-06-26机器人视觉语言

针对单一视觉传感器在低光、强动态范围、运动和丢包等真实机器人场景中易失效的问题,OctoSense构建了含RGB/事件相机、LiDAR、热成像、IMU、GPS和本体信息的同步平台与59小时数据集,并提出带模态专属tokenizer与推理缓存的后融合多模态MAE。实验显示其在深度、光流、语义分割和自运动估计上优于图像SSL模型,夜间和传感器退化时增益更明显。

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining Figure 1
2026-06-26cs.RO

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

2026-06-26机器人

这篇论文针对 VLA 预训练中视觉监督过密、语言—动作信号被稀释而导致策略依赖视觉捷径的问题,提出先“看不见”地学习动作:将已有示范拆成原子动作段,并配低层语言描述,构建 33K 条 LA 数据,在无视觉输入下预训练语言条件动作先验。实验显示,LA 预训练比单纯 VLA 预训练更能提升仿真与真实任务表现,混合 LA-VLA 训练最高带来 17.8 与 45.0 个百分点成功率增益,并增强视觉扰动鲁棒性。

BOWConnect: Parallel Bayesian Optimization over Windows with Learned Local Cost Maps for Sample-Efficient Kinodynamic Motion Planning Figure 1
2026-06-26cs.RO

BOWConnect: Parallel Bayesian Optimization over Windows with Learned Local Cost Maps for Sample-Efficient Kinodynamic Motion Planning

Sourav Raxit, Abdullah Al Redwan Newaz, Jose Fuentes, Leonardo Bobadilla

2026-06-26规划控制优化算法

本文针对动力学运动规划在高维状态空间采样低效、动态约束下代价启发不可靠、窄通道难以通过的问题,提出 BOWConnect:在双向并行树搜索中嵌入窗口化贝叶斯优化,让各线程在线学习局部代价图并生成可行动作,同时用空间哈希加速两树连接。实验称其在十个基准中成功率达 100%,复杂窄通道场景规划时间最快或接近最快,并在地面车和四旋翼实机上实现无碰撞实时规划。

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation Figure 1
2026-06-26cs.RO

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

Wen Ye, Peiyan Li, Tingyu Yuan, Yuan Xu, Xiangnan Wu, Chaoyang Zhao, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

2026-06-26机器人

这篇论文针对机器人操作中测试时扩展多只放大动作、忽视推理与历史轨迹的问题,提出可插拔的 E-TTS:联合采样并评分推理和动作,用历史缓冲与视觉语言验证器做闭环反馈迭代。实验覆盖 4 个基准、6 类环境、3 种本体和 4 个 VLA 模型,在无需额外专家数据或重训下,仿真最高提升 33.14%,真实场景最高提升 26.62%。

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy Figure 1
2026-06-26cs.RO

Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy

Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

Fudan University 2Shanghai Innovation Institute 3Jilin University

2026-06-26机器人

这篇论文针对长期家庭场景中机器人需同时调用 API/IoT 与物理执行、且要在失败后自恢复的问题,提出 OmniAct:用统一的网络-物理技能路由、事件边界压缩的分层记忆和异步视觉预检,把规划、记忆、验证解耦成闭环架构。实机 40 个长程任务显示其成功率、扰动恢复和 token/延迟开销均优于开环 VLA 与逐步推理基线,但增益中各模块贡献仍需更多消融支撑。

HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation Figure 1
2026-06-26cs.RO

HumanoidUMI: Bridging Robot-Free Demonstrations and Humanoid Whole-Body Manipulation

Hongwu Wang, Chenhao Yu, Youhao Hu, Jiachen Zhang, Yuanyuan Li, Shaqi Luo

Beijing Academy of Artificial Intelligence

2026-06-26机器人模仿学习

HumanoidUMI针对类人机器人全身操作示教依赖本体遥操作、成本高且效率低的问题,提出用PICO VR与UMI式夹爪进行无机器人采集,记录腕视图、夹爪状态和骨盆/双手/双脚五关键点,并通过高层扩散策略、空间关键点重定向和全身控制器部署到Unitree G1。五个真实任务显示其能覆盖双臂、弯腰、投掷和行走操作,并比遥操作获得更高有效示教吞吐。

Automating Potential-based Reward Shaping with Vision Language Model Guidance Figure 1
2026-06-26cs.LG

Automating Potential-based Reward Shaping with Vision Language Model Guidance

Henrik Müller, Daniel Kudenko

\addr L3S Research Center, Leibniz University Hannover

2026-06-26视觉感知强化学习

针对稀疏奖励下探索困难、手工奖励塑形又易引发 reward hacking 的问题,论文提出 VLM-PBRS:用轻量视觉语言模型对图像状态对给出偏好,学习势函数并以 PBRS 形式塑形,从而保留原最优策略、降低标签精度要求。Meta-World 与 Franka Kitchen 实验显示,该方法相较稀疏奖励和直接奖励学习更省样本,且增益与 VLM 偏好标签准确率相关。

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline) Figure 1
2026-06-26cs.RO

Learning to Fold: prizewinning solution at LeHome Challenge 2026 (1st place online, 2nd offline)

Ilia Larchenko

2026-06-26机器人

面向双臂衣物折叠中布料形变、稀疏二值奖励和未见衣物泛化难题,本文将流匹配VLA置于异步RL/rollout/人工DAgger闭环中,用同一策略网络同时预测动作、成功率、进度和未来关键量,以驱动AWR+RECAP优势学习、在线失败检测和候选选择,并配合Thompson采样调推理超参及重增强sim-to-real流程。系统获LeHome 2026线上62队第1、真实决赛第2,但作者强调缺少系统消融,具体增益来源不清,可能主要来自工程集成与数据。

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies Figure 1
2026-06-26cs.RO

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

2026-06-26视觉语言视觉感知

这篇论文针对长时程、接触丰富操作中 VLA 策略常以开环方式执行、缺少物理可行性检查和在线纠错的问题,提出 PhysReflect-VLA:在不改动预训练主干的情况下加入可行性算子、动作解释算子和基于 LLM 的反思模块,把执行过程变成闭环调节。真实多阶段任务中,相比代表性 VLA 基线平均成功率提升 5.4%,消融显示可行性检查与反思纠错均有贡献。

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies Figure 1
2026-06-26cs.RO

PAMAE: Phase-Aware-MoE Action Experts Towards Reliable Flow-Matching Vision-Language-Action Policies

Jiayu Yang, Tao Yang, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

2026-06-26视觉语言视觉感知生成模型

针对多阶段机器人操作中流匹配 VLA 通常用单一动作专家、难以区分接近/接触/搬运等阶段控制模式的问题,PAMAE 在保留预训练骨干的同时引入阶段感知稀疏 MoE 动作模块,用弱阶段信号训练路由而非直接监督动作,并通过先专家预热、再阶段一致路由优化来稳定专化;仿真多阶段任务中相对强基线成功率最高提升 9.2%,消融显示阶段监督路由和两阶段训练是关键。

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision Figure 1
2026-06-26cs.CV

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

2026-06-26视觉感知数据集/基准

面向无人机野火监测中烟雾遮挡、尺度变化和纯 RGB 难以识别隐蔽热点的问题,FlameVQA 基于 FLAME 3 构建了结合 RGB、热成像 JPEG 与逐像素辐射温度 TIFF 的多选 VQA 基准,覆盖检测、定位、覆盖估计、跨模态推理和飞行规划,并用热规则、一致性检查与人工审核增强标注可靠性。实验显示现有 MLLM 在显式跨模态线索下表现较好,但在浓烟下存在性判断和覆盖估计上仍明显失效,说明灾害场景需要更强领域适配。

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation Figure 1
2026-06-26cs.RO

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

2026-06-26生成模型

面向自动驾驶验证中罕见但关键的交互风险场景,论文针对闭环交通仿真里扩散模型难以兼顾真实、可控与低延迟的问题,提出用实例中心场景条件和多模态 proposal 先验来初始化联合潜变量扩散,并在紧凑动作潜空间加入地图、碰撞和博弈式引导。Waymo 实验显示,该方法相较独立边际生成更能保持交互一致性,少步采样提升效率,引导可在真实度与安全压力测试强度之间调节。

ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models Figure 1
2026-06-26cs.RO

ForesightSafety-VLA: A Unified Diagnostic Safety Benchmark for Vision-Language-Action Models

Mingyang Lyu, Yinqian Sun, Yiyang Jia, Sicheng Shen, Moquan Sha, Huangrui Li, Feifei Zhao, Yi Zeng

Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China., Beijing Key Laboratory of Safe AI and Superalignment, China., Beijing Institute of AI Safety and Governance, China., Gaoling School of AI, Renmin University of China, Beijing, China.

2026-06-26视觉语言视觉感知数据集/基准安全鲁棒

这篇论文针对现有 VLA 评测把安全简化为碰撞或任务失败、难以定位风险来源的问题,提出 ForesightSafety-VLA:在 RoboTwin 中构建 66 个嵌入式安全场景,按物理、指令、感知三类 13 项 taxonomy,并用安全成本、风险暴露时间和安全/不安全成败四象限评估过程风险。实验显示所有基线仍有非零安全成本和不安全成功,结构与视觉变化比普通语言改写更显著恶化安全,说明安全主要受感知、grounding 与控制能力共同制约。

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation Figure 1
2026-06-26cs.RO

RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation

Guodong Zhang, Qichen He, Wenyuan Xie, Shaokai Wu, Yanbiao Ji, Qiuchang Li, Bayram Bayramli, Yue Ding, Hongtao Lu

2026-06-26机器人优化算法

这篇论文针对开放世界机器人操作中语义理解难以转化为精确物理控制的问题,提出 Relational 6D Affordance Graph,将被操作部件与物理锚点的相对 SE(3) 关系作为中间表示,并结合 LLM/VFM 推断拓扑、定位姿态,再把执行转化为闭环运动学约束优化。实验显示其在仿真和真实环境中实现训练自由的零样本操作,并优于若干数据驱动基线,但主要覆盖刚体转动和平移关节。

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics Figure 1
2026-06-26cs.RO

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

2026-06-26机器人

本文针对文本到人体运动生成中“语义理解强但不物理、物理约束强但不懂开放词汇”的矛盾,提出 ICMPG:用 LLM 生成运动 token 候选,再像 MPC 一样在推理时结合仿真物理反馈与语义奖励滚动选择和细化。实验显示其在标准与零样本开放词汇设置下较基线获得更好的语义对齐和物理合理性,但推理开销与奖励模型可靠性仍是潜在限制。

RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction Figure 1
2026-06-26cs.RO

RobOralScan: Learning Active Intraoral Scanning for Robotic Dental Reconstruction

Jinhyung Lee, Haeun Yun, Siwon Kim, Gihyun Baek, Sungho Moon, Sehyun Hwang, Sunghoon Im

2026-06-26机器人三维

针对全牙弓口内扫描依赖人工、视野窄且易漏扫的问题,RobOralScan将其建模为闭环强化学习控制任务,用三态几何记忆累积历史观测,并以牙齿级覆盖奖励和渐进训练减少单牙覆盖不均。实验中平均覆盖率达92.58%、Chamfer Distance为0.00838,10次评估中8次完成扫描准则,并展示零样本仿真到真实机器人扫描的可行性。

UAV-MapFusion: RTK-Aligned Uncertainty-Aware Coarse-to-Fine Multi-Session UAV Mapping Figure 1
2026-06-26cs.RO

UAV-MapFusion: RTK-Aligned Uncertainty-Aware Coarse-to-Fine Multi-Session UAV Mapping

Feng Pan, Chunran Zheng, Bing Xue, Yukang Cui, Jiayu Wen, Zhiyu Chen, Wei Wang

2026-06-26安全鲁棒

这篇论文针对无人机单次航程和存储受限导致的大范围建图需多航次融合、但易出现长程漂移与局部几何失真的问题,提出 UAV-MapFusion:先用场景图做多会话粗融合,再通过 DTW 对齐 RTK 时间偏移、用 MOGP 补全掉帧下的连续 RTK 约束,并在不确定性感知因子图中自适应加权多源观测,最后以平面因子迭代细化局部结构。真实数据实验表明该系统能提升多航次点云地图的全局一致性与局部精度,但具体量化增益在给定片段中未充分说明。

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling Figure 1
2026-06-26cs.RO

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

2026-06-26视觉语言强化学习安全鲁棒

面向自动驾驶中的连续驾驶员监测,论文指出大视觉语言模型延迟高且可靠性不足,难以常开部署;核心做法是用轻量RGB-生理信号学生模型配合风险感知选择性门控,并加入驾驶员状态世界模型预测未来错误与动作代价。实验中学生模型达0.7440 Macro-F1、3.08ms延迟,选择性推理将不安全漏检由17.37%降至约5%,但最差组校准漂移仍未解决。

PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts Figure 1
2026-06-26cs.RO

PlanRL: A Trajectory Planning Architecture for Reinforcement Learning-based Driving Experts

Joonhee Lim, Yongjae Lee, Jangho Shin, Dongsuk Kum

2026-06-26强化学习规划控制

本文针对自动驾驶中强化学习专家直接输出油门/转向导致可解释性弱、道路几何学习负担重且难与端到端规划体系对接的问题,提出 PlanRL:让 RL 策略输出高层指令,再结合 Frenet 坐标系、多项式轨迹规划和运动学可行性检查生成可执行轨迹。在 CARLA Offline Leaderboard v1 与 NoCrash 上,驾驶分数分别提升 5% 和 11%,成功率提升 8% 和 19%。

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking Figure 1
2026-06-26cs.RO

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

2026-06-26机器人视觉感知生成模型

针对人形机器人接触丰富的移动操作依赖大量示教且难覆盖连续目标空间的问题,Humanoid-DART用目标条件扩散Transformer生成机器人与物体参考轨迹,再由强化学习全身控制器跟踪,并通过课程式采样与目标重标记把“差一点成功”的 rollout 纳入训练。实验在推、踢、传递、拾放等任务中显示,仅少量种子示教即可扩展任务空间覆盖,拾放可从4段基础示教泛化到种子范围外4到5倍目标,但评估仍限于单一物体和平地。

Ordinal Neural Collapse as a Representation Prior for Visual Navigation Figure 1
2026-06-26cs.RO

Ordinal Neural Collapse as a Representation Prior for Visual Navigation

E-In Son, Jung-Taak Kim, Seung-Woo Seo

2026-06-26机器人

这篇论文针对视觉导航中端到端模仿学习只用动作损失训练编码器、易学到与控制无关表征的问题,提出 ORION:利用从 Far Left 到 Far Right 的目标相对方向天然有序性,将类别均值约束到一条有序判别轴并压制轴外方差,再接入扩散式导航策略微调。仿真与真实实验显示,其相较 NoMaD 和普通神经塌缩基线提升成功率与目标进展,在复杂路口等视觉歧义场景更稳定,成功率最高提升 26 个百分点。

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision Figure 1
2026-06-26cs.RO

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision

Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang

2026-06-26视觉语言视觉感知

这篇论文针对 VLA 微调中连续动作损失对所有时刻一视同仁、难以显式建模抓手开合转折点的问题,提出 StaKe:从示教中的抓手状态自动生成阶段标签和下一关键帧动作目标,并以轻量辅助头在训练时施加监督、推理时不改原策略。实验显示其在双臂仿真和 Franka 真机任务上分别带来约 14% 与 56% 相对成功率提升,长时程、多抓手事件任务收益更明显。

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation Figure 1
2026-06-26cs.RO

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng

2026-06-26机器人视觉语言视觉感知强化学习

面向低示范、语言条件机器人操作中空间定位与精确控制难兼顾的问题,SSI-Policy提出RGB-only的结构化场景接口,将单目深度特征、语言 grounding 的物体布局和指令条件2D运动轨迹解耦为可从无动作视频预训练的感知层,再供扩散策略少样本学习控制。在LIBERO每任务10条示范下较最强基线提升近15%,并在13个真实任务中验证空间推理、跨 embodiment 与接触操作能力。

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation Figure 1
2026-06-26cs.RO

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

2026-06-26机器人模仿学习规划控制

PressMimic针对类人机器人模仿中仅依赖视觉与运动学参考导致脚滑、穿地和不稳定的问题,将足底压力作为贯穿感知与控制的物理 grounding 信号:FRAPPE++融合RGB与压力估计3D姿态和全局运动,PSP在强化学习中用压力分布约束接触模式。基于MotionPRO数据集的实验显示,压力信息提升了姿态/轨迹估计、抗遮挡与垂直漂移能力,并提高模仿任务成功率和运动稳定性。

Learning Motion Feasibility from Point Clouds in Cluttered Environments Figure 1
2026-06-26cs.RO

Learning Motion Feasibility from Point Clouds in Cluttered Environments

Sajid Ansari, Arthi, Girish Varma, Antony Thomas

International Institute of Information Technology Hyderabad

2026-06-26三维

这篇论文针对拥挤场景中采样式运动规划在不可行任务上耗时过高的问题,提出直接从RGB-D点云学习7自由度机械臂抓取运动可行性,并构建含2.71M个RRT-Connect标签的大规模基准。其核心价值在于摆脱简化几何模型,系统比较MLP、3D-CNN与点云Transformer;最佳GraspFC-PTX在Novel对象上AUROC达0.996,作为规划预过滤器可带来80–200倍加速,但未见场景分布外泛化仍有明显下降。

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention Figure 1
2026-06-26cs.RO

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Changhao Zhang, Jian Liu, Weiqiang Wang, Qi Li, Jituo Li, Hengshuang Zhao

2026-06-26强化学习

这篇论文针对接触丰富操作中纯视觉世界动作模型难以感知滑移、卡滞和细微对齐误差的问题,指出直接注入触觉 token 会造成“触觉污染”。其核心是 TAAM:用 VideoClean 阻断视觉查询读取触觉信息,同时让动作查询按预测触觉变化增强对触觉的关注。实验显示在 ManiFeel 上平均成功率提升 38.9%,接触丰富任务提升 86%。

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction Figure 1
2026-06-26cs.RO

LAMP: Lane-Aligned Motion Primitives for Feasible Trajectory Prediction

Sangjin Han, Hoseong Jung, Jeongtae Her, Changhyun Choi, H. Jin Kim

2026-06-26规划控制

这篇论文针对自动驾驶多模态轨迹预测中低概率候选常偏离车道拓扑、难以服务安全规划的问题,提出 LAMP:用 VQ-VAE 学习带轨迹形状的离散运动原语作为意图查询,并通过车道拓扑先验训练可行性感知选择器,在解码前过滤不可达或越界意图。基于 MTR/UniTraj 在 Argoverse 2 上实验,标准位移精度与强基线相当,但在可行性和多样性指标上更好。

Hardware Design for Table Tennis Robot Capable of Beating Professional Players Figure 1
2026-06-26cs.RO

Hardware Design for Table Tennis Robot Capable of Beating Professional Players

Nobuhiko Mukai, Pavel Adodin, Stefan Heusser, Alexander Sigrist, Divij Grover, Guillem Torrente, Farshad Khadivar, Takekazu Kakinuma, Peter Dürr

2026-06-26机器人

这篇论文面向乒乓球机器人真正击败职业选手所需的硬件瓶颈,先从高水平球员动作、来球速度与击球间隔反推工作空间、速度、抗外力和末端精度指标,再据此设计8自由度Ace机器人,并用拓扑优化、逆动力学选型和带延迟补偿的关节模型支撑RL控制。实验中机器人实现0.8秒全挥拍周期、22 m/s拍心峰值速度,并在与9名职业选手比赛中击败8人。

A Closed-Form 4-DoF Inter-Robot Pose Estimator using Bearing-only Measurements Figure 1
2026-06-26cs.RO

A Closed-Form 4-DoF Inter-Robot Pose Estimator using Bearing-only Measurements

Qixin De, Ao Zhuang, Yechen Zhang, Zhuozhou Qian, Danping Zou

2026-06-26机器人三维

面向 GPS 受限多机器人中仅靠视觉方位和里程计进行相对位姿估计时,传统 6-DoF 方法易在平面等常见运动下退化。论文利用 VIO 已知 roll/pitch,将问题降为 4-DoF,给出 yaw 与平移的闭式求解,并用可观性检测自适应触发估计。仿真和实机结果显示其精度、鲁棒性优于 SDP 类方法且计算开销显著更低。

Bridging Handheld and Teleoperated Supervision for Contact-Rich Manipulation via State-Gated Experts Figure 1
2026-06-26cs.RO

Bridging Handheld and Teleoperated Supervision for Contact-Rich Manipulation via State-Gated Experts

Vidullan Surendran, Neehar Peri, David Watkins

2026-06-26机器人视觉感知

这篇论文针对接触丰富操作中手持采集便宜但只记录“观测动作”、遥操作昂贵但能给出“期望动作”的矛盾,指出两类监督在不同任务阶段的有效性不同。作者提出 BRIDGE,用状态门控的扩散专家在自由空间和接触瓶颈间切换数据来源,只对失败片段补少量遥操作示范;在三项装配类任务中,相比纯手持基线成功率最高提升 36.7%,并追回全程遥操作上界约 79% 的性能差距。

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure Figure 1
2026-06-26cs.RO

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure

Yiyuan Pan, Hanjiang Hu, Shangtao Li, Xusheng Luo, Changliu Liu

Robotics Institute, Carnegie Mellon University, Pittsburgh, PA 15213, USA

2026-06-26机器人

这篇论文针对机器人策略部署时难以在不重训的情况下响应新偏好这一问题,指出端到端方法缺少可编辑结构,而传统神经符号编辑又可能生成物理不可执行的计划。其核心是 ReStruct:把用户偏好表示为自动机,并与 ENAP 的任务状态机做同步积,同时重算动作先验、冻结低层控制器,使结构编辑能落到可执行控制上。仿真与真实实验显示,该方法可处理对象偏好到时序逻辑约束,并在任务成功率和偏好遵循上最高超过 VLA 基线约 25%。

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control Figure 1
2026-06-26cs.RO

IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control

Chenlong Liu, Zhuohui Zhang, Xinyan Chen, Zhipeng Wang, Bin Cheng, Bin He

2026-06-26规划控制

这篇论文针对多智能体强化学习从仿真到真实部署时对动力学误差过敏的问题,提出 IDEA:不再试图精确建模或随机覆盖真实动力学,而是用离散语义动作结合闭环控制来对齐动作效果,并通过通信同步各智能体执行时序。在四个多智能体导航任务中,方法相较域随机化和域适应训练更快,真实成功率提升超过20%,并报告零碰撞和零时序执行误差。

OSC2Runner: OpenSCENARIO 2.x Compliant High-Fidelity AV Simulation in CARLA Figure 1
2026-06-26cs.RO

OSC2Runner: OpenSCENARIO 2.x Compliant High-Fidelity AV Simulation in CARLA

Thoshitha Gamage, Lasanthi Gamage

Southern Illinois University Edwardsville, Edwardsville, IL, USA, Webster University, St. Louis, MO, USA

2026-06-26强化学习

这篇论文针对自动驾驶场景测试仍依赖 OpenSCENARIO 1.x、难以原生执行 v2.x DSL 而导致时空漂移和异步延迟的问题,提出 OSC2Runner:用多阶段转译器将 v2.x 语法解析为类型安全 AST,并直接合成为 CARLA 中的确定性行为树。实验显示其能实现逐 tick 确定性、精确空间触发与 100 ms 跨主体同步,但高密度场景下 Python 执行开销仍是瓶颈。

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation Figure 1
2026-06-26cs.RO

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

University of North Carolina at Chapel Hill

2026-06-26机器人数据集/基准

WatchAct针对现有机器人操作基准只看当前图像、难以检验对人类过往行为理解的问题,构建了3000个真实人类动作视频对齐LIBERO任务的长程基准,覆盖事件、流程、意图和情景记忆推理,并分离评估视频到计划、执行和端到端流程。结果显示当前系统差距很大:最佳Gemini-3.1-Pro+π0.5仿真成功率仅16.3%,真机14.0%,规划和执行均是瓶颈。

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly? Figure 1
2026-06-26cs.RO

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

Stanford University, Cornell University

2026-06-26机器人

针对多指手精密装配中奖励稀疏、接触丰富且示教难的问题,Play2Perfect主张先通过任务无关“玩耍”预训练获得抓取、手内重定向和6D位姿控制先验,再用稀疏奖励微调到CAD定义的装配任务。核心洞察是预训练必须迫使手指进行真实手内操作,而非固定抓握搬运。实验显示其相较从零RL最高提升33倍样本效率,并可零样本仿真到现实完成0.5mm间隙插入及多部件装配、拧入任务。

A System for Fast, Resilient, and Adaptable Loco-Manipulation Behaviors on Humanoid Robots Figure 1
2026-06-26cs.RO

A System for Fast, Resilient, and Adaptable Loco-Manipulation Behaviors on Humanoid Robots

Duncan William Calvert

B.S. Computer Science, University of West Florida, US, 2014, A dissertation submitted to the Department of Intelligent Systems and Robotics, THE UNIVERSITY OF WEST FLORIDA, HAL MARCUS COLLEGE OF SCIENCE AND ENGINEERING

2026-06-26机器人

面向人形机器人在真实环境中既要行走又要操作物体的低速、易失败和难迁移问题,论文提出以行为树、可视化/可调的动作原语、并行动作层和回退机制组织 loco-manipulation 行为,并以开门穿越作为基准。评估显示系统可在多平台上快速构建、调试和复用开门、搬运、排序等任务,提升执行速度、韧性和操作者适应效率,但具体量化增益需结合长篇实验细节解读。

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs Figure 1
2026-06-26cs.LG

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell

2026-06-26机器人

本文针对自动驾驶轨迹预测中多模态候选虽覆盖充分、但概率排序常不可靠的问题,指出根因是推理时假设 GMM、训练时却用 WTA 硬分配,实质更接近 K-means,导致过分割和概率失真。作者提出测试时按后验加权合并候选轨迹,以及一步 EM 用软责任重分配概率,无需重训即可在 NuScenes、WOMD 和多种 WTA 模型上改善模式后验可用性与位移误差指标。

CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation Figure 1
2026-06-26cs.RO

CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation

Haonan Chen, Yuxiang Ma, Stephen Tian, Xiaoshen Han, Wenlong Huang, Feiyang Wu, Yunzhu Li, Jiajun Wu, Edward H. Adelson, Yilun Du

Harvard University, Stanford University, Massachusetts Institute of Technology, Columbia University

2026-06-26机器人

针对 GPU 插槽插入等长程、接触丰富操作中“高精度”和“泛化”难以兼得的问题,CoStream 将能力拆成语义约束、视频预测轨迹和触觉/力反馈三类独立行为,并在共享 SE(3) 接口上逐步组合为位姿命令。实机 8 个任务显示,其在精密装配和物体转移中提升明显,可从人工扰动中恢复且无需为每个新任务重训策略。

PRISM: Efficient and Locally Optimal Probabilistic Planning with Reachability Guarantees Figure 1
2026-06-26eess.SY

PRISM: Efficient and Locally Optimal Probabilistic Planning with Reachability Guarantees

Alex Rose, Christopher Jewison, Jonathan P. How

This work was supported by the Draper Scholars program. Alex Rose and Jonathan P. How are with Laboratory for Information and Decision Systems, Massachusetts

2026-06-26规划控制

面向带运动不确定性、障碍和控制约束的信念空间规划,PRISM针对采样路标覆盖不足且轨迹代价高的问题,提出协方差可达性条件,将问题分解为协方差收缩与确定性均值规划,并在线联合局部优化。理论上给出安全性和特定起终分布假设下的完备性保证;仿真中在拥挤场景显著提升覆盖率,最难场景仍达97–100%,且轨迹代价低于多种基线。

Exploring the Intrinsic Geometry of Diffusion Models with Constrained Inverse Kinematics Figure 1
2026-06-26cs.RO

Exploring the Intrinsic Geometry of Diffusion Models with Constrained Inverse Kinematics

Miguel Angel Rogel Garcia, Phone Thiha Kyaw, Jonathan Kelly

2026-06-26生成模型

这篇论文针对扩散模型是否真正学习数据流形几何这一难以在自然图像中验证的问题,转向几何可解析的受约束逆运动学场景。作者用UR5和Franka的七类任务约束训练单一条件扩散模型,并以解析的约束流形维度作真值检验。结果显示,模型score恢复的内在维度与各约束自由度一致,潜空间线性插值生成的关节解也基本贴近相应流形,说明其表征捕获了不止维度的局部几何结构。

MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins Figure 1
2026-06-26cs.RO

MPC-Injection: Biasing Off-Policy Locomotion RL Toward Controller-Induced Behavior Basins

Roy Xing (Dartmouth College), Seyoung Ree (Harvard University), Brian Plancher (Dartmouth College)

Dartmouth College, Harvard University

2026-06-26机器人强化学习规划控制

本文针对腿式机器人离策略强化学习在简单速度奖励下容易学到“高回报但不可部署”的振腿、拖行等局部行为的问题,提出将求解同一 MDP 的 MPC 轨迹直接注入 replay buffer,用状态分布而非奖励塑形或模仿损失把策略拉向设计者偏好的行为盆地。实验显示,在 2D walker 与 Unitree Go2 上,约 25% 注入可在 SAC/TD3 中诱导可用步态,并以一到两个奖励项达到接近 21 项奖励塑形和 AMP 的效果,且可定性迁移到真机;但其有效性依赖已有合适控制器,长训练和更复杂任务下稳定性仍文中未充分说明。

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models Figure 1
2026-06-26cs.CL

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block

Case Western Reserve University, Case Western Reserve University Cleveland USA

2026-06-26机器人

本文针对社会-物理人机交互(spHRI)术语分散、综述筛选成本高的问题,提出用可本地运行的小语言模型作为系统综述的二次筛查器,而非替代专家。结果显示spHRI论文数量持续增长,单个SLM尚不能达到人工判断水平,但集成模型找回了39篇人工漏筛论文,占最终相关集合10.29%,说明其价值主要在高召回的补漏与降低人工负担。

Scaling Nonlinear Optimization: Many Problems One GPU Figure 1
2026-06-26cs.RO

Scaling Nonlinear Optimization: Many Problems One GPU

John Viljoen, Johanna Haffner, Masayoshi Tomizuka, Negar Mehr

J. Viljoen, M. Tomizuka, and N. Mehr are with the Department of Mechanical Engineering, University of California, Berkeley, CA, USA.

2026-06-26优化算法

这篇论文针对机器人轨迹优化、IK、接触规划等非线性规划仍依赖 CPU 串行求解、难以接入 GPU 批量学习管线的问题,提出基于 IPOPT/JAX 的 jaxipm。核心做法是将 IPOPT 的分支回退逻辑融合为统一迭代,并用迭代级 batching 热重启已完成任务以减少 GPU 空闲。在四旋翼 NMPC 多类基准上,吞吐量相对 IPOPT 最高提升 32.85 倍,并展示了与 IPOPT 的逐迭代一致性。

KRVF: A Source-Aware Semantic Voxel World Representation for Edge Mobile Manipulation Figure 1
2026-06-26cs.RO

KRVF: A Source-Aware Semantic Voxel World Representation for Edge Mobile Manipulation

Runfeng Ling

Runfeng Ling is with The University of Manchester, Manchester, U.K.

2026-06-26机器人强化学习

本文针对边缘移动操作中 RGB-D 深度失效、动态物体残留与语义查询延迟的问题,提出 KRVF 源感知语义体素世界模型,将占据、颜色、语义证据、时间新鲜度和证据来源统一编码,并显式分离实测几何与语义假设。系统以 ROS 2 接口输出对象与抓取候选查询,仿真和回放实验展示了实时建图、语义落地和深度缺失下的非破坏性假设覆盖;但尚无真实机器人和定量基准,实际增益仍文中未充分说明。

Layered Outer-Loop Control for Disturbance-Robust Multi-Waypoint UAV Arrival Figure 1
2026-06-26cs.RO

Layered Outer-Loop Control for Disturbance-Robust Multi-Waypoint UAV Arrival

Runfeng Ling

Runfeng Ling is with The University of Manchester, Manchester, U.K.

2026-06-26规划控制安全鲁棒

本文针对多航点无人机在风扰、闭环延迟和抵近悬停切换下易出现过冲、反弹与末端漂移的问题,提出分层外环终端控制,将平滑接近、持续偏置补偿和近目标监管捕获/稳定分离,并强调剥离基准特化调参后再做迁移评估。结果显示,PyBullet 风扰下裸控制器晚期平均误差约0.024米,在PX4/Gazebo中去除非迁移先验后仍能维持厘米到分米级误差,并通过Vicon跟踪Tello硬件验证其可部署性。

Racing a Wheeled Quadruped: Active Load Transfer Mitigation via Model Predictive Control Figure 1
2026-06-26cs.RO

Racing a Wheeled Quadruped: Active Load Transfer Mitigation via Model Predictive Control

Marla Eisman, Brian Lam, Samuel Sonnino, Francesco Borrelli

2026-06-26规划控制

面向轮足四足在高速转弯中易侧向载荷转移、失稳甚至翻覆的问题,论文把 Unitree Go2-W 近似为带主动横滚自由度的车辆自行车模型,在分层框架中结合离线最优赛线、在线 MPC 最小化 LTR 与底层全身 RL 执行关节/轮端命令。实车赛道结果显示,主动横滚使平均 LTR 最多降低 44%,最快圈速提升 8.7%,峰值横向加速度提升 21.3% 至 1.98 m/s²。

NavIsaacLab: Generating Realistic Crowd via Parallel Robot Learning for Benchmarking Human-aware Navigation Figure 1
2026-06-26cs.RO

NavIsaacLab: Generating Realistic Crowd via Parallel Robot Learning for Benchmarking Human-aware Navigation

Bingyi Xia, Han Bao, Jingyu Zhu, Hanjing Ye, Yuhan Pang, Guangcheng Chen, Liang Lin, Wenjun Xu, Jiankun Wang

2026-06-26机器人数据集/基准

面向人机共处场景中缺乏高保真、多样化导航数据的问题,NavIsaacLab基于Isaac Lab构建可GPU并行的照片级物理仿真基准,并用轨迹扩散模型与对抗运动学习生成可控行人行为。论文还加入30个跨尺度场景和多维评测指标,并展示姿态感知强化学习策略可用于快速训练及实机迁移,但相对既有平台的定量增益来源仍可能主要来自scaling / data。

Fast LeWorldModel Figure 1
2026-06-26cs.LG

Fast LeWorldModel

Yuntian Gao, Xiangyu Xu

Xi’an Jiaotong University

2026-06-26强化学习

Fast LeWorldModel针对LeWM在视觉规划中依赖一步潜变量自回归展开、导致CEM候选评估慢且长视野误差累积的问题,改为以动作前缀为预测单元:用因果动作前缀编码器和并行潜变量预测器直接预测各前缀执行后的未来潜状态。实验在LeWM任务协议下将平均成功率从85.8%提升到90.5%,动力学模块约3.9倍加速,CEM求解时间从54.4秒降至28.3秒,并降低长视野开环误差增长。

TaskNPoint: How to Teach Your Humanoid to Hit a Backhand in Minutes Figure 1
2026-06-26cs.RO

TaskNPoint: How to Teach Your Humanoid to Hit a Backhand in Minutes

Blake Werner, Ilona Demler, Pietro Perona, Aaron D. Ames

California Institute of Technology

2026-06-26机器人

本文动机是让人形机器人像人学运动技能一样,用少量教练示范快速掌握动态操作,而不是依赖海量数据或精细奖励。核心洞察是许多技能成败取决于短暂“交互窗口”,TaskNPoint让人指定技能、单次示范、关键窗口和目标,再用仿真强化学习补全轨迹并随机化目标。实验中Unitree G1可学习网球正反手、踢球和搬箱,单任务少于1小时GPU训练并能部署到硬件。

RoboTales: ROBOTic Anthropomorphic LEarning Systems Figure 1
2026-06-26cs.RO

RoboTales: ROBOTic Anthropomorphic LEarning Systems

Andrew Chen, Ju-Hung Chen, Phurinat Pinyomit, Alexis E. Block

Case Western Reserve University, Case Western Reserve University Cleveland USA

2026-06-26机器人

该文针对现有教育/社交机器人讲故事多依赖屏幕、语音或固定手势,难以表达角色与情绪的问题,提出低成本 RoboTales:用可3D打印的两自由度袜子木偶末端执行器,结合音频驱动嘴部、头部/手臂动作与叙事同步,并可迁移到不同机械臂。小规模试验中,木偶模式相比仅手势模式获得更高 HRIES 评分和故事回忆表现,但样本仅10人,效果外推仍需更充分验证。

OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation Figure 1
2026-06-26cs.RO

OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation

Runyi Yu, Xiaoyi Lin, Ji Ma, Yinhuai Wang, Koukou Luo, Jiahao Ji, Huayi Wang, Wenjia Wang, Runhan Zhang, Ping Tan, Ting Wu, Ruoli Dai, Qifeng Chen, Lei Han

The Hong Kong University of Science and Technology, Wuhan University, The University of Hong Kong

2026-06-26机器人生成模型

该文针对人形机器人长时程移动操作中技能难以闭环串联、失败后难以恢复的问题,提出以接触流作为可规划的技能表示,用关键身体轨迹和二值接触信号连接低层 CF-Track 控制器与高层 CF-Gen 生成器。结果显示其在搬箱、推叠箱和技能组合任务上显著优于基线,并可结合 VLM 做语义任务分解,但部分收益可能也来自新采集 MoCap 数据与规则化规划设计。

Morphology-Specific Closed-Loop Control of Logarithmic-Spiral Continuum Arms via Online Jacobian Error Compensation Figure 1
2026-06-26cs.RO

Morphology-Specific Closed-Loop Control of Logarithmic-Spiral Continuum Arms via Online Jacobian Error Compensation

Partha Datta (1, 2), Yi Jin (1), Wei Lin (2), C. Chase Cao (1, 2, 3) ((1) Laboratory for Soft Machines and Electronics, Department of Mechanical and Aerospace Engineering, Case Western Reserve University, Cleveland, OH, USA, (2) Department of Electrical, Computer and Systems Engineering, (3) Advanced Platform Technology (APT) Center, Louis Stokes Cleveland VA Medical Center, USA)

Laboratory for Soft Machines and Electronics, Department of Mechanical and Aerospace Engineering, Case Western Reserve, University, Cleveland, OH 44106, USA, Department of Electrical, Computer and Systems Engineering, Case Western Reserve University, Cleveland, OH 44106, Advanced Platform Technology (APT) Center, Louis Stokes Cleveland VA Medical Center, Cleveland, OH 44106, USA, robots demonstrated scalable fabrication and versatile grasping but lacked inverse kinematics and closed-loop, logarithmic-spiral continuum arms. A segmented tendon-driven model with a centerline backbone and, accurate, robust, and scalable control of highly underactuated continuum manipulators. The proposed

2026-06-26规划控制

针对对数螺旋连续臂虽适合伸展、缠绕和抓取却缺少逆运动学与闭环控制的问题,本文用螺旋几何直接推导任务空间雅可比,并结合 Broyden 割线更新与卡尔曼滤波在线补偿模型误差。在 MuJoCo 仿真中,该方法相较 PCC 基线降低轨迹与姿态误差、提升抗扰性,并支持 reach-wrap-release、全臂抓取和多臂协作等形态驱动操作;但验证主要停留在仿真,硬件迁移效果文中未充分说明。

LiMoDE: Rethinking Lifelong Robot Manipulation from a Mixture-of-Dynamic-Experts Perspective Figure 1
2026-06-26cs.RO

LiMoDE: Rethinking Lifelong Robot Manipulation from a Mixture-of-Dynamic-Experts Perspective

Zhihao Gu, Lin Wang

School of EEE, Nanyang Technological University

2026-06-26机器人

这篇论文针对终身机器人操作中单任务 PEFT 难以复用技能、也难以建模新旧任务交互的问题,提出 LiMoDE:先用运动强度驱动的动态 MoE 在多任务预训练中抽取可复用短程技能,再在适配阶段逐步学习低秩 lifelong experts 并与冻结专家动态组合。实验在 LIBERO 与真实任务上显示其以适中参数和推理开销提升持续适配,LIBERO-LONG 适配提升约 7%、遗忘降低约 3%。

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards Figure 1
2026-06-26cs.RO

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards

Anıl Can Ateş, Orhan Kahraman, Cihan Topal

Istanbul Technical University

2026-06-26机器人视觉语言强化学习

这篇论文针对长时程机器人操作中手工奖励脆弱、单一 VLM 目标提示又在早期轨迹近乎平坦的问题,提出将任务拆成 approach、align、grasp 等语言微任务,并用多视角 VLM 奖励、反向课程和层级管理器切换阶段。Fetch 实验显示该分解能提供更连续的训练信号,使 PPO 学得更快,学习式管理器可达到或超过规则切换。

Reinforcement Learning Enables Autonomous Microrobot Navigation and Intervention in Simulated Blood Capillaries Figure 1
2026-06-26cs.RO

Reinforcement Learning Enables Autonomous Microrobot Navigation and Intervention in Simulated Blood Capillaries

Jannik Drotleff, Samuel Tovey, Paul Hohenberger, Christoph Lohrmann, Julian Hoßbach, Konstantin Nikolaou, Christian Holm

Institute for Computational Physics, University of Stuttgart

2026-06-26机器人强化学习

本文面向微机器人在血管内靶向给药、溶栓等任务中难以在复杂真实环境下自主控制的问题,构建含分叉毛细血管几何、流体场、红细胞动力学与布朗噪声的物理仿真,并用深度强化学习训练趋化导航策略。结果显示,机器人尺寸和游速存在由流动与热噪声主导的不可导航区;成功策略会自发形成 run-and-rotate、search-and-sit 等模式,并可在无需重训下完成毛细血管阻塞与解除阻塞,使流量恢复到健康基线。

Unsupervised Memory-Enhanced Video Transformers: Obstacle Detection for Autonomous Agricultural Rover Figure 1
2026-06-26cs.RO

Unsupervised Memory-Enhanced Video Transformers: Obstacle Detection for Autonomous Agricultural Rover

Théo Biardeau (XLIM-ASALI, UFR SFA (Poitiers)), Anne-Sophie Capelle-Laizé (UP, XLIM-ASALI, XLIM-ASALI), Salwan Alwan, David Helbert (UFR SFA (Poitiers), LabCom I3M (Poitiers))

requiring no data labels., confirmed by our analysis of the rover’s total stopping distance. Code available in the following, Data availability, Data for qualitative evaluation is available on the github:, VMTAD. Data for quantitative evaluation will be made available on request., in the evolution of precision agriculture. They reduce the need for human intervention in labour-

2026-06-26视觉感知

面向农田自主车安全,论文针对高置 LiDAR 难发现作物冠层下低矮障碍、监督检测又难覆盖未知物体的问题,将障碍视为“正常行驶视觉模式”的异常。VMTAD 用视频 Transformer 结合 FIFO 时序记忆与交叉注意力,在移动车载相机的动态场景中建模上下文且无需标注训练。在 Grillon 平台油菜数据上,检测 AUROC 达 0.973、分割 AUROC 达 0.997,轻量版推理约 14 ms,并结合停车距离分析验证实时安全性。

2026-06-24

41 篇
InSight: Self-Guided Skill Acquisition via Steerable VLAs Figure 1
2026-06-24cs.RO

InSight: Self-Guided Skill Acquisition via Steerable VLAs

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

Stanford University, Princeton University

2026-06-24机器人

这篇论文针对VLA机器人只能复现训练数据中已有技能、为新任务采集人工示范成本高的问题,提出InSight:先自动把示范切成带语言标签的可控动作原语,再由VLM发现新任务缺失原语、生成低层控制尝试并把成功轨迹回灌训练。实验覆盖仿真和真实翻块、关抽屉、清扫、拧转、倒液等任务,在无目标技能人工示范下最高达96%成功率,长程组合任务达80%,但复杂原语仍受单轴运动假设限制。

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics Figure 1
2026-06-24cs.RO

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

Marvin Rüdt, Hao Pang, Constantin Enke, Zäzilia Seibold, Kai Furmans

Institute for Material Handling and, Logistics, Karlsruhe Institute of Technology

2026-06-24视觉语言视觉感知

面向仓储物流中几何 SLAM 地图缺少对象语义与可移动性判断的问题,论文将 SLAM、SAM 实例分割、跨视角实例聚类和 VLM 零样本推理串成上下文语义建图流程,在无需预设类别或专门训练下生成含类别与可移动性的地图。实验显示语义分类 mIoU 达 98.93%、可移动性 mAcc 达 89.17%,但瓶颈主要在 VLM 上下文推理,实例聚类限制全景性能。

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization Figure 1
2026-06-24cs.CV

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

2026-06-24机器人

这篇论文针对室内机器人重定位长期依赖低层视觉特征、地图笨重且缺少语义可解释性的问题,提出 OpenReLoc:用对象级地图组织语义、布局和几何信息,并结合 CLIP 开放词汇描述、场景图匹配、DIOU 参考帧检索与双路径 2D ICP 姿态优化。在 ScanNet、ScanNet++ 及 Habitat 合成大场景上,方法报告了更高的重定位召回率和精度,尤其强调稀疏对象对应和可扩展场景下的稳健性。

World Value Models for Robotic Manipulation Figure 1
2026-06-24cs.RO

World Value Models for Robotic Manipulation

Zhihao Wang, Jianxiong Li, Yu Cui, Yuan Gao, Xianyuan Zhan, Junzhi Yu, Xiao Ma

ByteDance Seed, 2Peking University, 3Tsinghua University, labeled frame annotations. Our evaluations show that WVM maintains its SOTA performance on, comparisons or on non-scalable downstream policy performance. Another common choice is VOC [43], but it, manipulation tasks. We will make WVM and Suboptimal-Value-Bench available to support the community.

2026-06-24机器人强化学习

这篇论文针对机器人价值模型难以从混合质量视频数据中准确判断任务进展的问题,指出VLM式静态视觉表征缺乏时间建模与前瞻规划能力,并将预训练世界模型改造成WVM,用MoT连接视频潜变量与轻量价值DiT,以分布式价值块和flow matching学习进展。结果显示其在专家VOC和含800条次优轨迹的Suboptimal-Value-Bench上优于基线,并能提升仿真与真实操作中的策略学习表现。

TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments Figure 1
2026-06-24cs.RO

TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments

Shivani Kamtikar, Chung Hee Kim, Camilla Tabasso, Tye Brady, Joshua Migdal, Taskin Padir

2026-06-24机器人

这篇论文针对狭小、遮挡环境中机器人过度依赖视觉的问题,提出 TACTFUL:用多指高分辨率触觉在真实硬件上学习单一探索策略,同时完成物体发现、局部表面细化与基于触觉点云的识别。关键设计是行为克隆初始化 PPO,并用动态奖励在全局搜索和接触重建间切换。实验显示其在真实物体上达到 77% 成功率、平均重建误差 0.015 m,优于手工或基线探索方法。

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation Figure 1
2026-06-24cs.RO

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

Tsinghua University, University of Technology Sydney

2026-06-24机器人模仿学习

这篇论文针对真实机器人示教中常见的误抓、偏移和反复尝试,指出单调进度式价值建模会掩盖局部错误与纠正过程。核心创新是将 retry 关键点作为稀疏监督,构造局部偏好来学习“价值下降—恢复”的结构,并用该价值重加权行为克隆数据。真实操作实验显示,ReTVL 比进度基线更能识别有害片段和有效纠正行为,并提升不完美示教下的模仿成功率。

Parallel Dynamic Programming for Conic Linear Quadratic Control Figure 1
2026-06-24math.OC

Parallel Dynamic Programming for Conic Linear Quadratic Control

Luyao Zhang, Gabriel Bravo-Palacios, Brian Plancher, Sergio Grammatico

Barnard College, Columbia University, New York, NY 10027 USA & Dartmouth College

2026-06-24规划控制

面向长时域 MPC/轨迹优化中 Riccati 或稀疏 KKT 求解随预测步长串行增长、难以利用多核的问题,论文把带锥约束的 LQ 控制放入 ADMM,并将其原始步按时间切成固定端点 LQ 子问题并行求解,设计了相应的动态规划/Riccati 变体与共识步骤。在四旋翼悬停和低推力轨道转移基准上,PDPLQR 相比相关 LQ/稀疏求解器最高约 5 倍加速,长时域场景对 ProxLQR 也有约 35% 以上优势。

Optimization-based Safe Trajectory Planning for Autonomous Ground Vehicle in Multi-Floor Scenarios Figure 1
2026-06-24cs.RO

Optimization-based Safe Trajectory Planning for Autonomous Ground Vehicle in Multi-Floor Scenarios

Zishang Xiang, Runda Zhang, Runqi Chai, Kaiyuan Chen, Senchun Chai, Yuanqing Xia

Z Xiang, R. Zhang, R. Chai, S. Chai and Y. Xia are with the school of Automation, Beijing, Institute of Technology, Beijing, China

2026-06-24规划控制优化算法安全鲁棒

面向多楼层室内场景中AGV需在多个出口间做任务决策且优化轨迹易收敛慢的问题,论文将GVD安全路径与多目标出口选择结合,并用分层热启动OCP及相关障碍约束筛除降低求解负担。仿真显示该框架可生成连续平滑轨迹,且在示例中终端时间优于直接OCP和两阶段优化,但验证主要限于仿真,真实部署鲁棒性文中未充分说明。

ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos Figure 1
2026-06-24cs.RO

ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos

Pranjal Mishra, René Zurbrügg, Max Wilder-Smith, Marco Hutter, Marc Pollefeys, Zuria Bauer, Hermann Blum

ETH Zürich, Zürich, Switzerland. 2 Microsoft, Zürich, Switzerland. 3 University of Bonn, Bonn, Germany.

2026-06-24视觉感知三维

面向机器人在家庭等非结构化场景中操作门、抽屉等铰接物体的建模瓶颈,ArtiTwinSplat从手持RGB-D视频自动构建可交互数字孪生:先用静态序列建立3DGS规范模型,再通过外观变化、反向SAM2跟踪和3D轨迹估计关节类型、轴与运动范围,并进行关节条件高斯优化。实验在真实Kallax家具上展示了旋转/平移关节的逼真重建,可导出URDF并导入Isaac Sim;但结果主要为定性展示,量化增益文中未充分说明。

Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement Figure 1
2026-06-24cs.RO

Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement

Xin Liu, Yulin Li, Ziming Li, Pengyu Jing, Zhenhao Huang, Bingyang Zhou, Ziqiu Zeng, Siyuan Luo, Chenkun Qi, Fan Shi

National University of Singapore, Shanghai Jiao Tong University

2026-06-24机器人安全鲁棒

针对布料操作中模仿策略部署后难以纠错、接触与遮挡导致误差累积的问题,本文把可变形仿真器直接放入推理闭环:用FLASH生成合成数据训练单RGB到仿真状态的real-to-sim模块,再以稀疏网格 rollout 和先验引导MPPI在线修正策略轨迹。真实机器人实验显示其成功率与鲁棒性优于基线,消融表明仿真精度、状态恢复和规划先验缺一都会降性能。

Explaining Failures of Cyber-Physical Systems with Actual Causality Figure 1
2026-06-24cs.RO

Explaining Failures of Cyber-Physical Systems with Actual Causality

Khen Elimelech, Tom Yaacov, David A. Kelly, Hana Chockler, Moshe Y. Vardi

King’s College London

2026-06-24机器人

面向自动驾驶等黑箱神经控制CPS难以事前完全验证、失效后需要定位成因的问题,论文把“实际因果”从图像分类扩展到时序交互系统,指出直接套用会产生错误解释,并给出CPS场景下的建模准则与两种系统无关算法:穷举求最优解释、基于因果责任的启发式加速。实验在避障自动车中验证可生成失效解释,但近似算法的最优性需权衡。

Decentralized Pose Graph Riemannian Optimization for Object-based Multi-Robot SLAM Figure 1
2026-06-24cs.RO

Decentralized Pose Graph Riemannian Optimization for Object-based Multi-Robot SLAM

Yixian Zhao, Yan Huang, Yang Xu, Liang Li, Jinming Xu

2026-06-24机器人优化算法三维

面向目标语义多机器人 SLAM 中轨迹与持久物体强耦合、通信拓扑稀疏或失配导致的去中心化 PGO 低效问题,论文提出 DRAN:区分公共物体与私有轨迹,只对物体做共识、对轨迹边界变量交换,并在 SE(3) 上用本地近似牛顿曲率预条件更新。实验覆盖公开基准、仿真和六机器人实测,显示在接近集中式精度下减少迭代、运行时间与通信量,并对通信中断更稳健。

G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models Figure 1
2026-06-24cs.RO

G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models

Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

New York University Shanghai, Technical University of Denmark, MBZUAI - Mohamed bin Zayed University of Artificial Intelligence, New York University Abu Dhabi

2026-06-24视觉语言视觉感知

这篇论文针对 VLA 视觉 token 仍停留在二维图像坐标、难以利用多相机标定几何的问题,提出 G3VLA:在不改动作空间和模仿学习目标的前提下,将射线嵌入、PRoPE 和跨视角融合注入视觉 token,并用真实点图或 π3X 教师蒸馏提供几何监督。实验显示其在 LIBERO、RoboCasa24、RoboTwin2.0 和实机任务上提升较稳定,尤其有利于空间和物体敏感操作;但增益依赖几何 token 是否直接进入动作生成路径。

FT-WBC: Learning Fault-Tolerant Whole-Body Control for Legged Loco-Manipulation Figure 1
2026-06-24cs.RO

FT-WBC: Learning Fault-Tolerant Whole-Body Control for Legged Loco-Manipulation

Yudong Zhong, Pengfei Mai, Sikai Guo, Jiahang Cao, Zhihai Bi, Qiuyue Liu, Ziyan Feng, Jinni Zhou, Jun Ma

The Hong Kong University of Science and Technology (Guangzhou), The University of Hong Kong

2026-06-24机器人规划控制

这篇论文针对腿式移动操作中下肢执行器故障会放大机械臂引起的质心偏移、导致稳定性与可达空间冲突的问题,提出 FT-WBC:用上下身解耦策略、故障估计器和姿态自适应模块,将机械臂需要的基座姿态改写为故障条件下可执行的安全命令。仿真和实机结果显示,该方法在关节弱化、锁死等故障下提高生存率和操作工作空间,并可零样本迁移到真实腿臂机器人。

Varying Bundle Size Reactive Multi-Task Assignment using Selective Cost Estimation for Multi-Agent Systems Figure 1
2026-06-24cs.RO

Varying Bundle Size Reactive Multi-Task Assignment using Selective Cost Estimation for Multi-Agent Systems

Niklas Dahlquist, Shridhar Velhal, George Nikolakopoulos

2026-06-24机器人

本文针对动态多机器人任务分配中“组合竞拍可行但路径代价评估太贵”的瓶颈,提出由机器人本地生成可变大小任务束:先用欧氏距离等低保真启发式快速扩展候选树,再只对最有希望的分支做高保真路径规划,并由中心节点解集合打包完成全局分配。仿真显示,在静态、动态和隧道场景中相较反应式基线平均约提升10–18%,主要来自更好捕捉任务簇协同且计算时间接近基线。

NoContactNoWorries: Estimating Contact through Vision and Proprioception for In-Hand Dexterous Manipulation Figure 1
2026-06-24cs.RO

NoContactNoWorries: Estimating Contact through Vision and Proprioception for In-Hand Dexterous Manipulation

Soham Patil, Avirup Das, Sourabh Bhosale, Spandan Roy

2026-06-24机器人视觉感知

这篇论文针对灵巧手操作中触觉传感器昂贵、脆弱且难集成的问题,提出用腕部 RGB-D 视觉与本体感知预测指尖二值接触,把它作为“伪触觉”输入。核心是用姿态条件交叉注意力融合当前/指令关节状态与视觉 token,并用因果 Transformer 建模短时动态。仿真和真实 LEAP 手实验显示,该信号可替代真实/ oracle 接触用于物体重定向,能泛化到新物体且无需重训策略,但目前只覆盖固定指尖接触,未估计力或剪切等丰富触觉量。

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos Figure 1
2026-06-24cs.RO

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

Show Lab, National University of Singapore

2026-06-24机器人视觉感知

针对VLA缺少真实视频-动作数据、合成机器人视频又难以提供可靠控制信号的问题,论文提出“只监督生成中保留下来的几何信息”:从人类视频提取未来2D末端轨迹作为视觉骨干的辅助监督,动作头仅用真实示教训练。Franka三类抓放实验中,GRA在相同真实数据预算下平均成功率达68.9%,优于Real-only和伪动作基线,并缩小与4倍真实数据上限的差距。

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies Figure 1
2026-06-24cs.RO

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies

Tim Schreiter, Jens V. Rüppel, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM), Germany

2026-06-24机器人强化学习

针对工业标准缺少可读机器人状态/意图信号设计指南的问题,本文在同一移动非人形机器人上对比低表达LED与结合凝视、手势、语音的多模态策略,并同时做在线视频和博物馆真实实验。结果显示,多模态在转向、请求注意等复杂空间意图上更易读、更直观;LED对错误等约定化状态仍有效,但真实场景下整体可读性和信心明显下降。

RE4: Transformation-aware Imitation of Object Interactions Using Manipulation Modes Figure 1
2026-06-24cs.RO

RE4: Transformation-aware Imitation of Object Interactions Using Manipulation Modes

Arsh Chawla, Rahul Shome

Australian National University

2026-06-24机器人模仿学习

论文针对扩散/flow 模仿学习在物体交互中训练开销高、示范需求大且难解释的问题,提出 RE4:按操作模式进行示范检索、物体坐标重构、约束重规划与回放,并用示范数据自监督估计目标姿态。其在 Push-T 与 Robomimic 的状态和图像基准上匹配或超过基线,训练更轻量,并在稀疏数据和低数据场景中表现出更强鲁棒性。

Average Rankings Mask Per-Subject Optimality: A Friedman-Nemenyi Benchmark of EEG Motor-Imagery BCI Decoders Figure 1
2026-06-24cs.HC

Average Rankings Mask Per-Subject Optimality: A Friedman-Nemenyi Benchmark of EEG Motor-Imagery BCI Decoders

Xavier Vasques, Paul Barbaste, Olivier Oullier

IBM France Lab, Orsay, France, Computing and Mathematical Sciences Division, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE, Institute for Artificial Intelligence, Biotech Dental Group, Salon-de-Provence, France

2026-06-24视觉感知数据集/基准

本文针对运动想象 EEG-BCI 中“是否存在通用最优解码器”的问题,用 MOABB 在三套公开数据、两种频段上系统比较 1056 种特征-缩放-分类器组合,并用 Friedman-Nemenyi 等统计检验避免只看平均排名。结果显示 cov-tgsp 与 CSP 整体较强,但在大规模 PhysionetMI 上无显著胜负;单一最佳管线仅覆盖约 35% 被试,按被试选型可提升约 7 个准确率点,说明个体化选择比寻找统一解码器更关键。

PDS Joint: A Parametric Double-Spiral Joint Tailored for Dexterous Hands Figure 1
2026-06-24cs.RO

PDS Joint: A Parametric Double-Spiral Joint Tailored for Dexterous Hands

Haoyang Li, Yibo Wen, Yixiang Fan, Yiheng Xu, Yufeng Yue

2026-06-24机器人

面向灵巧手在接触和人机交互中既要柔顺安全又要保持关节支撑与本体感知的问题,论文提出参数化双螺旋 PDS 柔顺关节,用阿基米德/对数螺旋和不对称比调节屈伸、侧摆、旋转等方向刚度,并嵌入电感式传感与基于 ArUco 标定的 MLP 状态估计。实验给出几何参数到刚度分布的规律,发现侧向支撑随不对称性呈非单调变化;在最难的外展/内收估计中,MLP 较曲线拟合误差降低 41.6%,并在开源灵巧手上完成 9 类物体抓取和安全接触演示。

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots Figure 1
2026-06-24cs.RO

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

2026-06-24机器人视觉语言视觉感知

针对腿足机器人在低摩擦地面上仅靠运动学/本体感知往往要等到明显打滑才可判别的问题,SlipSense 将轻量化多模态足端传感器与 LSTM 地面反力估计、单类自监督异常检测结合,用力觉信号提前识别滑移。在 Unitree Go1 盲行实验中,系统可检测平均 24.1±6.4mm 的早期滑移,整体准确率 85.9%,相较足端速度基线分辨率提升 3.3 倍、准确率相对提升 24%。

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning Figure 1
2026-06-24cs.RO

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning

Kewei Hu, Wanchan Yu, Fangwen Chen, Jing Jiajian, Zimeng Li, Ying Wei, Tianhao Liu, Michael Zhang, Hanwen Kang

2026-06-24机器人

RoBoSR针对机器人在开放场景和长程任务中依赖示范序列、难以显式推理状态依赖的问题,提出以语义落地的对象中心场景图作为中间状态空间,将指令理解、前提/效果和目标状态建模为逐步状态转移,并用Manip-Cognition-1.6M联合监督训练。实验称其在多个基准和真实演示中优于提示式方法与传统TAMP,尤其提升零样本泛化和长程规划,但具体增益中数据规模贡献仍需进一步辨析。

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection Figure 1
2026-06-24cs.CV

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection

Zexi Chena, Zitai Huang, Qiwen Gu, Zhiqi Li, Shengli Dong, Chenlei Wang, Junqiao Zhao, Hongdong Wang, Bing Han

2026-06-24视觉感知

面向船舶巡检机器人在甲板与舱室间切换时遭遇的稀疏纹理、光照剧变和重复结构误匹配问题,论文提出 ProteusVPR:不重做检索骨干,而在通用 VPR 初检后加入融合相邻时序帧、几何描述、局部仿射坐标和方位编码的位姿细化网络,并构建 8K 全景 XHZ 船载数据集评测。实验显示该二阶段框架可在多种 VPR 骨干上稳定降低定位误差,平均均值误差降幅超过 60%,但代码与数据释放细节文中仍有限。

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control Figure 1
2026-06-24cs.RO

Grounding Generative Policies in Physics: Optimization-Guided Diffusion for Robot Control

Sabrina Bodmer, René Zurbrügg, Tifanny Portela, Hao Ma, Alexandre Didier, Marco Hutter, Colin Jones, Melanie Zeilinger

2026-06-24机器人视觉语言生成模型规划控制优化算法

这篇论文针对任务空间扩散策略在跨机器人部署时可能生成不可达、碰撞或控制器难以跟踪动作的问题,提出在 DDIM 反向采样中用受约束优化变量替代随机扰动,把物理可行性作为推理时硬约束或软惩罚注入而无需重训模型。实验覆盖灵巧抓取和视觉运动操作,显示其在保持生成质量的同时提升可执行性,任务成功率较最佳基线最高提升 20 和 23 个百分点。

Importance of Intent-Sharing for V2X-based Maneuver Coordination Figure 1
2026-06-24cs.NI

Importance of Intent-Sharing for V2X-based Maneuver Coordination

Rafael Molina-Masegosa, Sergei S. Avedisov, Miguel Sepulcre, Javier Gozalvez, Yashar Z. Farid, Onur Altintas

everything (V2X) communications, vehicles can collaborate, North America R&D – InfoTech Labs., IEEE copyright. This is an author-created postprint version. The final publication is available at https://ieeexplore.ieee.org/document/11310180

2026-06-24机器人

论文针对V2X协同驾驶中车辆需推断他车意图而导致轨迹预测误差、进而降低机动协调成功率的问题,比较了仅用当前位置/速度做恒速预测与直接共享计划轨迹的意图共享方案。核心洞察是把意图作为MCM/MSCM等消息的一部分,可减少近未来轨迹不确定性并避免不必要协调;在高速公路协同换道的两个仿真场景中,意图共享显著提高了协调成功比例,支持将其纳入机动协调协议。

The Evaluation Cost of Task Specialization in Evolutionary Multi-Robot Systems Figure 1
2026-06-24cs.RO

The Evaluation Cost of Task Specialization in Evolutionary Multi-Robot Systems

Paolo Leopardi, Heiko Hamann, Jonas Kuckling, Tanja Katharina Kaiser

Centre for the Advanced Study of Collective Behaviour &, Department of Computer and Information Science, University of Konstanz, Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg, University of Konstanz Konstanz Germany, University of Technology Nuremberg Nuremberg Germany

2026-06-24机器人数据集/基准

本文关注进化多机器人系统中“先分工再优化”是否划算:专职控制器虽能利用任务结构,但评估预算需在子任务间拆分,可能输给通才。作者在ARGoS觅食基准中比较通才与dropper/collector专才,核心洞察是专才的评估成本随群体规模增大而下降;结果显示机器人越多,专才越容易在更低总评估预算下超过通才,但结论依赖手工任务分解与固定分配。

Efficient Time-Domain Simulation of USV Motions in Short-Crested Irregular Waves Using an IRF-Based Framework Figure 1
2026-06-24cs.RO

Efficient Time-Domain Simulation of USV Motions in Short-Crested Irregular Waves Using an IRF-Based Framework

Fei Duan, Zihao Wang, Yaohua Zhou, Qing Xiao

aState Key Laboratory of Ocean Engineering, Shanghai Jiao Tong University, Shanghai 200240, China, b Department of Naval Architecture, Ocean and Marine Engineering, University of Strathclyde, Glasgow G4 0LZ, Scotland, c Institute of Artificial Intelligence, Shanghai University, Shanghai, 200444, China, d Rules & Technology Center of China Classification Society, Shanghai 200240, China

2026-06-24机器人

面向无人水面艇在短峰不规则海况中的长时域与近实时运动预测,论文用 IRF 将频域水动力载荷转为时域卷积重构,并结合瞬时湿表面压力积分与方向谱建模,避免大量规则波响应叠加。方法在 OSV 试验和 USV 实海测量上验证,升沉、横摇、纵摇统计量与时历总体吻合;方向离散对幅值有一定影响、对周期较弱,30°间隔被认为在精度与效率间较均衡。

NavWM: A Unified Navigation World Model for Foresight-Driven Planning Figure 1
2026-06-24cs.RO

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

Yanghong Mei, Longteng Guo, Ming-Ming Yu, Guiyu Zhao, Xingjian He, Jing Liu

Institute of Automation, Chinese Academy of Sciences, Beihang University, School of Artificial Intelligence, University of Chinese Academy of Sciences

2026-06-24机器人强化学习规划控制

这篇论文针对视觉导航中反应式策略缺乏前瞻、世界模型与控制分离以及单一轨迹预测导致的模式坍塌问题,提出 NavWM:用共享双向 Mamba 统一潜在世界推理、可控未来视觉生成与基于锚点的多模态动作预测,并通过模拟候选未来进行闭环选择。实验显示其在多个机器人数据集上提升未来图像质量,PSNR 由 14.17 提至 17.34,导航成功率由 66% 提至 72%,未见环境零样本成功率达 44%。

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs Figure 1
2026-06-24cs.RO

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs

Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

2026-06-24机器人强化学习

针对双足轮式机器人在连续楼梯上因教师-学生蒸馏表征缺乏动力学感知、地形编码不完整而运动不平顺的问题,DynaWM在并行蒸馏中加入世界模型正则以保留前向动力学相关几何信息,并用动量目标编码器稳定学生表征。PCA与指标显示其能分层编码楼梯高度,仿真和实机均表现出更好的连续楼梯适应性与运动平滑性。

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning Figure 1
2026-06-24cs.RO

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning

Qingyang Wang, Xingang Liu, Changwei Yao, Zikai Ouyang, Junwei Liu, Haibo Lu, Wei Zhang

2026-06-24模仿学习规划控制

这篇论文针对模仿学习中高质量示范昂贵、轨迹级数据增强常需拼接片段的问题,指出插值等非专家过渡会引入不自然动作并损害策略学习。MinInter 的核心做法不是设计更复杂连接器,而是在每个采样初始状态下选择所需总插值最少的源示范,从源头减少合成轨迹中的非专家段。在 MimicGen 的 12 个任务 26 个变体上,它同时提高数据生成成功率和策略成功率,尤其在接触丰富、长时程和高方差任务中收益更明显,并在报告子集上超过 SkillGen。

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration Figure 1
2026-06-24cs.CV

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration

Taekbeom Lee, Youngseok Jang, Jeonghwa Heo, Jeongjun Choi, H. Jin Kim

2026-06-24机器人

这篇论文针对机器人在陌生环境中需边探索边判断“还缺什么信息”的问题,提出 ObsGraph:以房间—视图—物体三层组织观察证据,保留视觉细节同时支持由粗到细检索,并把检索出的证据缺口直接转化为房间探索、视角细化或前沿探索等动作候选。实验显示其在具身推理与探索基准上提升任务成功率和效率,说明结构化记忆与自适应探索尺度有助于减少无效搜索。

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies Figure 1
2026-06-24cs.RO

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

Yonsei University

2026-06-24机器人

SPACE针对跨机器人数据中“同一动作命令在不同本体或硬件上产生不同运动”的监督不一致问题,主张用末端笛卡尔状态增量作为共享动作表示,并用轻量Action Adapter把预测位移转为目标机器人的控制命令。实验显示,在Franka结合UR5或手持夹爪数据、以及DROID多台Franka数据上,相比直接预测命令的策略成功率分别有约30%、50%和54%提升,并对控制频率、负载和增益变化更稳健。

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU Figure 1
2026-06-24cs.RO

TurboMPC: Fast, Scalable, and Differentiable Model Predictive Control on the GPU

Gabriel Bravo-Palacios, Jianghan Zhang, Zachary Pestrikov, Brian Plancher, Thomas Lew

2026-06-24规划控制

为让依赖GPU的大规模仿真、学习与神经网络机器人系统也能使用表达力足够的MPC,TurboMPC将SQP、ADMM、隐式微分与JAX-CUDA融合实现,支持不等式约束、隐式积分、跨时刻代价和松弛变量。实验显示其在规划、模仿学习、强化学习中较现有CPU/GPU可微求解器最高快15倍和58倍,并在实车竞速中通过批量贝叶斯调参超过手调基线,可扩展到8000多个节点 horizon。

Sim-to-Real Betting on the E-Process: Bringing "simulators" to anytime-valid confidence sequences Figure 1
2026-06-24cs.RO

Sim-to-Real Betting on the E-Process: Bringing "simulators" to anytime-valid confidence sequences

Yujia Chen, Bowen Weng

Department of Computer Science, Iowa State University

2026-06-24机器人

针对机器人真实测试昂贵、少量实机样本下均值性能估计不稳定的问题,本文把 sim-to-real 的 Kelly 投注估计与 anytime-valid e-process 置信序列结合,用模拟器混合给出的均值和方差直接为候选均值检验定下注大小。主要结果是可在任意停止时给出均值置信证书,并在模拟器矩较准时更快收紧区间;验证以合成示例为主,实际机器人增益仍取决于 simulator scaling / data。

Critique of Agent Model Figure 1
2026-06-24cs.AI

Critique of Agent Model

Eric Xing, Mingkai Deng, Jinyu Hou

⋄ \diamond Institute of Foundation Models, Mohamed bin Zayed University, † School of Computer Science, Carnegie Mellon University

2026-06-24机器人

本文动机是澄清“自动化工具”与真正具备自主性的智能体边界,回应当前LLM与机器人系统被泛称为agent的混乱。核心洞察是将外部脚手架驱动的agentic系统,与内生目标、身份、决策、自我调节和学习的agentive系统区分开,并提出GIC架构。主要结果偏概念性框架与安全讨论,缺少实验验证,实际增益来源文中未充分说明。

Topological Online Learning for Displacement-based Formation Control Figure 1
2026-06-24cs.RO

Topological Online Learning for Displacement-based Formation Control

Saksham Sharma, Shubhankar Gupta, Sumant A Gunagi, Suresh Sundaram

* Shubhankar and Saksham have contributed equally 1,3,4 Shubhankar, Sumanth and Suresh are with the Department of Aerospace Engineering, Indian Institute of Science, India

2026-06-24规划控制

针对多机器人编队在扰动下仅靠节点级鲁棒控制难以及时调整交互关系的问题,论文提出 TOLD,在边权层面在线学习拓扑权重以直接压低位移编队畸变,并给出无约束 OGF 与凸非负 OExpGF 两种更新。理论上分别保证畸变有界或渐近一致;12 机器人仿真和 Crazyflie 实验显示,相比固定权重或单独节点控制,RMDE/中位畸变最高降低约 33.14%、硬件中 OGF 超 62%、OExpGF 31.4%。

Enforcing Human-like Kinematics in Dexterous Piano Playing via Adversarial Posture Regularization Figure 1
2026-06-24cs.RO

Enforcing Human-like Kinematics in Dexterous Piano Playing via Adversarial Posture Regularization

Bin Qiu, Yanming Shao, Guanyu Cai, Yao Mu

Shanghai Jiao Tong University, The University of Hong Kong, Shanghai AI Laboratory

2026-06-24机器人

这篇论文针对双灵巧手弹钢琴中仅优化按键准确率或 IK 跟踪会导致关节过伸、“僵尸手”等不自然姿态的问题,提出 APR:用少量非曲目对齐的 Meta Quest 3 人手演奏数据,通过对抗式姿态分布匹配为 PPO 策略加入人类姿态先验。实验在 Shadow Hand/MuJoCo 钢琴任务上显示,APR 在保持 F1 按键表现的同时,在 cPSI、BSE、FAC 三个自然度指标和视觉质量上优于 PianoMime 等基线。

Decentralized Coordination of Autonomous Traffic Through Advanced Air Mobility Corridors Figure 1
2026-06-24cs.MA

Decentralized Coordination of Autonomous Traffic Through Advanced Air Mobility Corridors

Jasmine Jerry Aloor, Hamsa Balakrishnan

2026-06-24机器人

面向 AAM 走廊交通增长且集中式管制难以扩展的问题,论文用基于图神经网络的多智能体强化学习,在集中训练、分散执行下让固定翼飞机仅凭局部信息自组织通过单走廊、连续走廊和分流走廊。结果显示走廊边界遵从率超过 94%,低中密度下需战术解冲突少于 8%,但高密度分流场景升至约 17%,说明安全间隔仍依赖额外干预。

Engineering Reliable Autonomous Systems: Challenges and Solutions Figure 1
2026-06-24cs.RO

Engineering Reliable Autonomous Systems: Challenges and Solutions

Marie Farrell, Matt Luckcuck, Angelo Ferrando, Rafael C. Cardoso, Natasha Alechina, Marco Autili, Diana Benjumea Hernandez, Luciana Brasil Rebelo dos Santos, Daniela Briola, Ana Cavalcanti, Christian Colombo, Louise A. Dennis, Clare Dixon, Michael Fisher, Mario Gleirscher, Taylor Johnson, Charles Lesire, Livia Lestingi, Sven Linker, Brian Logan, Colin Paterson, Fabio Papacchini, Patrizio Pelliccione, Pedro Ribeiro, Maike Schwammberger, Silvia Lizeth Tapia Tarifa, Hazel Taylor, Jim Woodcock, Mengwei Xu, Yi Yang, Huan Zhang

2026-06-24机器人

随着自动驾驶、核设施巡检、家用助手机器人等自治系统进入安全关键场景,如何证明其行为可靠成为核心瓶颈。本文并非提出单一算法,而是汇总 ERAS 工作坊对验证确认、真实系统工程化和安全软件架构的跨社区讨论,指出形式化方法、仿真测试、运行时监控与物理实验需协同使用。主要结果是形成挑战目录与研究路线图,并通过多个机器人案例说明学术技术向工业实践转化仍不足。

Verifiable Foundation Models for Robot Safety Figure 1
2026-06-24cs.RO

Verifiable Foundation Models for Robot Safety

Davide Corsi, Kyungmin Kim, Roy Fox

University of California, Irvine

2026-06-24机器人安全鲁棒

这篇论文针对基础模型机器人控制难以形式化验证、仅靠经验安全或运行时屏蔽代价高的问题,提出 FEARL:将大控制器负责视觉/语言任务理解,小安全模块基于低维安全传感与上下文输出动作,从而只验证可 tractable 的安全模块。实验在三类仿真机器人任务和实体 Stretch 迁移中显示,该分解保持任务性能,并通过验证引导屏蔽实现零安全违规、较低覆盖率干预和小性能损失。

2026-06-23

174 篇
AutoDex: An Automated Real-World System for Dexterous Grasping Data Collection Figure 1
2026-06-23cs.RO

AutoDex: An Automated Real-World System for Dexterous Grasping Data Collection

Mingi Choi, Gunhee Kim, Jisoo Kim, Taeksoo Kim, Taeyun Ha, Jongbin Lim, Hanbyul Joo

Seoul National University

2026-06-23强化学习

AutoDex针对灵巧手抓取数据难规模化且仿真难验证真实接触的问题,将候选抓取生成与真实硬件自动验证结合,自动完成20相机位姿感知、碰撞监控执行、遮挡下跟踪、举升保持标注和物体重置。系统在100个物体上采集3593次带成败标签的真实试验,500轨迹研究中比遥操作快4.8倍;使用其验证库检索的抓取成功率达76%,高于未真实验证的34%。

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

2026-06-23视觉语言视觉感知数据集/基准安全鲁棒

面向 VLA 走向真实人机共处场景时缺乏统一安全验证的问题,LIBERO-Safety 用参数化任务语言生成物理与语义安全场景,并以关键姿态加运动规划替代纯遥操作,构建 1.97 万条无碰撞示范。对 8 个 VLA 和 2 个具身基础模型的评测显示,高多样性数据可降低碰撞风险,但成功率仍受轨迹合成不足和语义误对齐限制,暴露出泛化与安全之间的张力。

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation Figure 1
2026-06-23cs.RO

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, The Chinese University of Hong Kong

2026-06-23机器人

这篇论文针对机器人示教采集成本高、纯人手到机器人运动重定向难以对齐物理动力学的问题,提出 LaST-HD:用动作条件世界模型把非配对人手与机器人轨迹对齐到共享潜在物理推理空间,并配套低成本 OOL Glove 与混合到人手纠正训练流程。实验覆盖六个真实任务和三类本体,平均成功率优于 LaST、π0.5、Cosmos-Policy;仅用约 20 分钟手套纠正数据即可在新环境达到 90% 以上成功率。

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation Figure 1
2026-06-23cs.RO

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

Sikai Li, Shuning Li, Zhenyu Wei, Yunchao Yao, Chenran Li, Mingyu Ding

University of North Carolina at Chapel Hill, University of California, Berkeley

2026-06-23机器人

CoorDex针对类人机器人边走边灵巧操作中全身平衡、腕部到位与多指接触难以同时学习的问题,将身体运动先验和腕稳定手部先验分解建模,再用共享任务上下文和双残差头在潜空间协调二者。实验在G1+WUJI手的抓瓶搬运、开冰箱、取方块转身中验证可训练性;消融显示关节空间控制和单体潜变量策略在同等预算下失败,但结果仍主要限于仿真和特权状态观测。

A Reduced Order Model for Emergent Mechanics in Woven Systems Figure 1
2026-06-23cs.RO

A Reduced Order Model for Emergent Mechanics in Woven Systems

Anvay A. Pradhan, Evgueni T. Filipov, Talia Y. Moore

2026-06-23机器人

这篇论文针对编织结构在各向异性、剪切锁定、起伏交换等几何诱发力学上难以兼顾可解释性与计算成本的问题,提出节点-弹簧式降阶模型,用四类刚度元件刻画轴向变形、去起伏、织条间剪切与滑移。模型经单胞特征值分析和三点弯曲/剪切实验标定,在不同织条宽度与间距下误差约5%,并展示了泊松响应、渐进拔出、撕裂应力集中和空间分级刚度设计等能力。

Flatness Preserves Instruction Following in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

Flatness Preserves Instruction Following in Vision-Language-Action Models

Haochen Zhang, Yonatan Bisk

Carnegie Mellon University

2026-06-23视觉语言视觉感知

论文关注 VLA 在少量机器人数据微调后容易丢失预训练视觉语言表征、转而依赖视觉捷径而忽视指令的“指令盲”问题。核心洞察是将其归因于稀疏微调样本导致的尖锐损失景观,并用 SAM 在相同数据上保持平坦极小值。实验显示该做法无需额外数据或结构改动,在 LIBERO-PRO、LangGap、LIBERO-CF 及真实机器人中显著提升反事实指令跟随,分别报告 60.2%、70.2% 和 217% 增益。

Learning Process Rewards via Success Visitation Matching for Efficient RL Figure 1
2026-06-23cs.LG

Learning Process Rewards via Success Visitation Matching for Efficient RL

Raymond Tsao, Andrew Wagenmaker, Sergey Levine

2026-06-23强化学习

这篇论文针对机器人强化学习中稀疏成功奖励导致信用分配困难、微调效率低的问题,提出 Success Visitation Matching:用成功与失败轨迹训练判别器,将状态-动作访问比转化为稠密过程奖励,并证明不改变原始最优策略。实验在 LIBERO、RoboCasa 与真实 WidowX 操作任务上显示,相比仅用稀疏奖励,SVM 可显著加速并稳定 RL 微调,部分任务中使原本难以学习的策略取得成功。

Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation Figure 1
2026-06-23cs.RO

Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation

Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu

Georgia Institute of Technology

2026-06-23机器人生成模型模仿学习

这篇论文针对模仿学习在遮挡场景中默认“已看见目标”的局限,提出 See2Act:把扩散策略的动作去噪过程与 6-DoF 相机视角更新耦合,使机器人在预测动作时主动寻找更有信息量的观察。实验显示其在 Ravens 遮挡任务平均成功率 91%,RLBench 平均 81.1%,并用 50 条数字孪生示范实现真实抓放任务 95% 零样本迁移;代价是每步去噪都需重新观测,执行延迟较高。

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models Figure 1
2026-06-23cs.RO

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

Shanghai Jiao Tong University, Tsinghua Shenzhen International Graduate School, Tsinghua University, Shanghai AI Laboratory, pleted by Yuhao Wu during his internship at ScaleLab at SJTU. Wei Sui at D-Robotics and Ru Ying at Baidu

2026-06-23视觉语言视觉感知生成模型强化学习

该文针对离散扩散VLA难以直接用策略梯度强化学习的问题:最终动作边际概率需对多步去噪路径求和,计算不可行。作者将去噪过程视为MDP,改为优化采样去噪轨迹的逐步联合概率,并按任务复杂度调度去噪步数。结果在LIBERO达99.7%成功率,在RoboTwin 2.0较SFT基线提升30.6%,但不同步数调度的增益来源仍需更多拆解。

RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models

Ulas Berk Karli, Tesca Fitzgerald

Department of Computer Science, Yale University

2026-06-23视觉语言视觉感知

本文针对VLA在新机器人或任务中依赖被动补采示范、成本高且定位失败状态粗的问题,提出RECALL:用INSIGHT的不确定性信号选择高不确定状态收集恢复示范,并在持续学习中比较在线/离线采集、重放混合与EWC。结果显示,高不确定恢复数据比从初始状态被动示范更高效,首次不确定状态的在线采集已接近离线全量采集;但仅用新恢复数据微调会严重遗忘,重放混合目前最稳。

Autonomous Subsea Cable Search and Tracking with Graph-Optimised Priors and Visual Tracking Figure 1
2026-06-23cs.RO

Autonomous Subsea Cable Search and Tracking with Graph-Optimised Priors and Visual Tracking

Ibrahim Fadhil Djauhari, Adrian Bodenmann, Samuel Simmons, Cailei Liang, David White, Susan Gourvenec, Tom Bennetts, Darryl Newborough, Blair Thornton

2026-06-23视觉感知

面向海底通信电缆易受损且先验路径误差、线径小和局部掩埋导致 AUV 难以连续巡检的问题,论文将视觉检测与“反向 SLAM”式图优化结合,用观测持续修正全局电缆路线,并用悬链线物理模型约束未观测段搜索范围。海试中系统在故意偏移的初始地图下仍定位电缆,完成 120 米测试电缆最高 59% 的视觉跟踪,并能在误检或丢失后恢复。

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery Figure 1
2026-06-23cs.RO

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

(NSF) grants CNS-2146295 and CCF-2402941.The source code and supplementary materials for this paper will be publicly available.

2026-06-23机器人视觉语言视觉感知

该文针对机器人辅助手术中执行性错误细微、仅靠视频难以捕捉上下文的问题,提出融合视频、运动学数据与文本提示的实时检测框架;核心在于用手术层级活动、器械-对象交互和错误定义构造 activity prompting,并比较活动感知视觉嵌入。实验在 JIGSAWS 与 SAR-RARP50 上分别较基线提升最高 5% 和 16.6% F1,说明细粒度语义提示与运动学融合对错误识别有实际增益。

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies Figure 1
2026-06-23cs.RO

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li

Hong Kong Embodied AI Lab, The Chinese University of Hong Kong, University of Electronic Science and Technology of China, Shanghai Jiao Tong University

2026-06-23机器人

长时程机器人操作中,相似观测可能对应不同阶段,当前帧 VLA 难以判断下一步。KEMO 的核心是只记住由机器人运动线索和视觉变化共同触发的关键事件帧,将其编码为有序记忆 token,并通过交叉注意力与门控融合注入策略,同时在关键转移附近加权训练。真实双臂任务上,相比无记忆 π0.5,任务成功率提升 23.6%,阶段完成率提升 34.1%,消融表明事件选择、门控融合和关键帧对齐损失均有贡献。

A Generative Model for Closed-Loop Microsimulation of Signalized Intersections Figure 1
2026-06-23cs.RO

A Generative Model for Closed-Loop Microsimulation of Signalized Intersections

Yash Ranjan, Rahul Sengupta, Anand Rangarajan, Sanjay Ranka

The authors are with the Department of Computer and Information Science and Engineering, University of Florida, Gainesville, FL 32611, USA.

2026-06-23生成模型

论文针对传统交通微观仿真难以刻画信号交叉口异质交互、学习式轨迹模型闭环长时滚动易漂移的问题,提出 Enactor:以车辆为目标、行人为上下文,结合交叉口中心极坐标表示、领导车后保险杠几何特征、时空 Transformer 与闭环课程训练。结果显示其在 SUMO 两个路口的 4000 秒仿真中更接近速度和旅行时间分布,红灯违规较 IntTrajSim 降低一个数量级以上,并在真实鱼眼相机轨迹上优于匀速基线,但近距离 TTC 交互仍是主要短板。

Decentralized Autonomous Traffic Management through Corridor Networks Figure 1
2026-06-23cs.MA

Decentralized Autonomous Traffic Management through Corridor Networks

Jasmine Jerry Aloor, Aadarsh Govada, Hamsa Balakrishnan

2026-06-23机器人

面向高密度先进空中交通中集中式调度易受通信瓶颈、单点故障和响应滞后限制的问题,论文将多智能体强化学习用于AAM走廊网络的分散流量管理。核心做法是用旋转不变策略表示和课程训练,让仅在单走廊学到的局部进出、穿越与避让行为零样本迁移到含汇入、分叉的复杂网络。实验显示该策略在不同流量密度、几何结构和异构飞行器下仍能保持较好走廊贴合、完成率与速度,拥挤复杂场景中需战术干预的比例低于5%。

A Watermark for Vision-Language-Action and World Action Models Figure 1
2026-06-23cs.CR

A Watermark for Vision-Language-Action and World Action Models

Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

Hong Kong University of Science and Technology (Guangzhou), Wuhan University 3 Xi’an Jiao Tong University

2026-06-23视觉语言视觉感知强化学习

面向VLA和世界动作模型作为黑盒机器人服务被复用、权属难验证的问题,论文提出在生成前高斯噪声种子中注入密钥相关但分布不变的潜在水印,并用MAP从部分、后处理过的执行动作中恢复证据。实验在两类模型和两个机器人套件上显示,对任务成功率影响很小,16次审计可在1%误报率下达到100%检测率,并支持多密钥识别且抗多种输出与权重级攻击。

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory Figure 1
2026-06-23cs.RO

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory

Xiaolin Zhou, Liu Liu, Tingyang Xiao, Wei Feng, Fa Fu, Xinrui Meng, Xinjie Wang, Jialiang Han, Boyang Yu, Yun Du, Wei Sui, Zhizhong Su

Webpage: horizonrobotics.github.io/robot_lab/holoagent, workflow centered on Embodied AgentOS. AgentOS converts natural-language instructions into executable

2026-06-23三维

面向LLM智能体迁移到真实机器人时技能难组合、状态难观测、失败难恢复的问题,HoloAgent-0把任务规划抽象成Embodied AgentOS闭环运行时,并以持久3D空间/时间记忆和类型化技能接口连接导航、运动、操作等模块。实机与仿真评测显示其在长程导航、在线3D语义映射上具竞争力,并展示了物体搜索、多机器人协同和移动操作等闭环执行能力。

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation Figure 1
2026-06-23cs.RO

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

Jinsong Lin, Chi kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

∗ These authors contributed equally. † Corresponding author. 1 The Chinese University of Hong Kong, Hong Kong SAR, China.

2026-06-23机器人视觉语言视觉感知强化学习

本文面向 ERCP 胆道内镜在狭窄、反光、遮挡和组织接触环境中难以稳定自主导航的问题,提出 BiliVLA,将阶段语言指令、视觉目标定位与离散 3 自由度连续体内镜动作统一建模,并用场景感知监督、安全回退监督和 GRPO 强化优化提升闭环决策一致性。基于 1 万对图像—运动数据,在三类仿体任务中达到 91.96% 动作精度和 84.85% 成功率,但临床泛化仍待 ex vivo 或真实组织验证。

DVL-DeepONet: A Physics-Guided Operator Learning for Resilient Underwater Navigation Figure 1
2026-06-23cs.RO

DVL-DeepONet: A Physics-Guided Operator Learning for Resilient Underwater Navigation

Arup Kumar Sahoo, Itzik Klein

2026-06-23机器人

针对水下 AUV 在 DVL 噪声、波束缺失或无惯导条件下速度估计易退化的问题,论文提出将 DeepONet 用于 DVL 操作学习,并把 DVL 观测模型作为训练中的物理一致性约束,而非依赖显式矩阵求逆。框架含惯导融合、DVL-only 与缺失波束恢复三种变体,在约 10 km 真实 AUV 数据上相较模型法和学习基线最高提升约 40%,但具体增益来源仍需看消融是否充分说明。

SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors Figure 1
2026-06-23cs.RO

SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors

Pratyaksh Rao, Wancong Zhang, Randall Balestriero, Yann LeCun, Giuseppe Loianno

2026-06-23强化学习规划控制

SkyJEPA针对四旋翼学习动力学模型在长时域滚动中误差累积、且实机数据采集昂贵危险的问题,提出在潜空间预测未来表示的JEPA式世界模型,并用物理启发prober把冻结潜变量映射为可解释状态,再接入采样式最优控制。实验显示其在开环长时域预测和户外闭环控制中优于常见动力学学习基线,可在嵌入式硬件上实现较稳健的零样本仿真到现实迁移。

DexTeleop-0: Force-Aware Bimanual Dexterous Teleoperation with Ego-Centric Perception towards Shared Autonomy Figure 1
2026-06-23cs.RO

DexTeleop-0: Force-Aware Bimanual Dexterous Teleoperation with Ego-Centric Perception towards Shared Autonomy

Haichao Liu, Yuyao Jiang, Hyunsun Park, Yuanjiang Xue, Ziwei Wang

Nanyang Technological University, Singapore

2026-06-23机器人

面向双手灵巧遥操作中人手与机器人构型不匹配、缺少触觉/力反馈导致接触任务难采集的问题,DexTeleop-0在VR自我中心跟踪与IK重定向之上加入触觉驱动的共享自治优化:利用指尖力与接触点估计,通过操作空间雅可比和箱约束QP实时修正关节命令,实现力/力矩平衡。仿真与真实双臂灵巧手实验显示,其在稳健抓取、抗扰操作和复杂任务上较基线提升成功率与执行效率。

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation Figure 1
2026-06-23cs.RO

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

2026-06-23机器人生成模型三维

这篇论文针对机器人操作中流匹配策略默认使用单一各向同性高斯先验的问题,指出其难以适配多模态、异方差的动作分布,会造成传输场纠缠和训练低效。作者提出 LAFM,用潜在动作模型将观测映射到离散运动原语,并据此选择可学习的专用先验来初始化去噪过程。实验显示其在真实机器人任务成功率提升 23.4%,在 LIBERO-90 提升 10.4%,且以较小模型超过若干大型 VLA 基线。

TSD: A Physics-Inspired Trajectory Saliency Detector for Efficient Imitation Learning Figure 1
2026-06-23cs.RO

TSD: A Physics-Inspired Trajectory Saliency Detector for Efficient Imitation Learning

Yiming Zhao, Gongrui Ma, Qingkai Li, Mingguo Zhao

2026-06-23模仿学习规划控制

论文针对机器人模仿学习中高质量示教昂贵且轨迹片段信息密度不均的问题,提出无需训练、可插拔的 TSD,用空间熵识别精细操作、用向心加速度识别敏捷调整,从而筛出关键片段用于数据压缩和采集扩展。仿真与真实实验显示,TSD 压缩后的数据平均少用约 25% 仍可达到相当甚至更好性能,说明其增益主要来自保留任务关键段、削减冗余过渡动作。

A Relaxed Quadratic-Program-based Framework for Trajectory Tracking of Unicycle Robots with Singularity Avoidance Figure 1
2026-06-23cs.RO

A Relaxed Quadratic-Program-based Framework for Trajectory Tracking of Unicycle Robots with Singularity Avoidance

Hamza Tariq, Usman Ali, Adeel Akhtar

Hamza Tariq and Adeel Akhtar are with the Department of Mechanical & Industrial Engineering at the New Jersey Institute of Technology, Newark, NJ 07102, USA.

2026-06-23机器人视觉感知规划控制

本文针对单轮式机器人动态反馈线性化在零线速度处失效、难以处理停止与反向运动的问题,将原本刚性的 DFL 约束改写为带松弛变量的等式约束二次规划,使控制律在奇异点附近仍可行且保持时间不变。作者进一步证明了反馈律局部 Lipschitz 连续和跟踪误差一致最终有界,并在 TurtleBot3 的 ROS2–Gazebo 仿真中展示其相较经典 DFL 能完成含停车换向的轨迹跟踪。

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure Figure 1
2026-06-23cs.RO

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

Victor Lockwood, Hasan Mahmud, Mohammad Javad Khojasteh, Prabu David, Jamison Heard

2026-06-23机器人

本文关注HRI评估长期只由人类打分、缺少机器人视角的问题,提出让LLM驱动机器人以参与者身份填写同一套问卷的“反向评估”。结果显示,模型对满意度、享受等参与度指标与人类评分有中高相关且可靠,但会系统性误判舒适/怪异感,把好奇和投入当作舒适;这一失败在多模型、合成控制和Nao实机交互中仍存在,说明LLM自评可辅助实时参与度评估,却不足以捕捉未外显的内部情绪状态。

From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models Figure 1
2026-06-23cs.RO

From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models

David Oberacker, Meike Deitersen, Niklas Spielbauer, Tristan Schnell, Georg Heppner, Arne Roennau

2026-06-23三维

面向复杂真实环境中的机器人任务,论文指出固定本体和仅限物体对关系的3D场景图难以表达因果、功能与环境语义。其核心做法是用VLM先从实例生成概念与关系,再由LLM推理扩展为多层开放词汇的3D层级场景图森林,将物体节点与抽象概念节点共同组织。实验在uHumans2、ScanNet及Spot实机开放词汇取物中验证了关系质量和下游可用性。

IOI: Decoupling Kinematics and Physics for Interactive World Models Figure 1
2026-06-23cs.RO

IOI: Decoupling Kinematics and Physics for Interactive World Models

Chengyu Bai, Peidong Jia, Tiecheng Guo, Yukai Wang, Rui Ma, Fangyuan Zhao, Chunkai Fan, Xiaobao Wei, Jintao Chen, Hao Wang, Ying Li, Xiaozhu Ju, Jian Tang, Shanghang Zhang

2026-06-23强化学习

面向具身智能中纯数据驱动交互世界模型易出现动作漂移和物理状态不可信的问题,IOI将机器人确定性运动交给URDF前向运动学,并用前/侧/顶正交投影与MKAI模块注入视频生成器,使模型集中学习接触和环境动态。RoboTwin与真实平台实验显示,其运动保真、OOD泛化和策略评估一致性优于基线,合成数据训练策略可接近遥操作数据效果。

Flow6D: Discrete-to-Continuous Flow Matching for Efficient and Accurate Category-Level 6D Pose Estimation Figure 1
2026-06-23cs.CV

Flow6D: Discrete-to-Continuous Flow Matching for Efficient and Accurate Category-Level 6D Pose Estimation

Mingyu Mei, Li Zhang, Zibo Dai, Han Sun, Xinyue Zhao, Huiliang Shen, Zaixing He

2026-06-23生成模型三维

Flow6D针对类别级6D姿态估计中连续空间直接回归易受噪声、遮挡和局部最优影响且推理开销大的问题,将旋转和平移先离散成姿态bin,用离散flow matching定位高概率潜空间,再在局部残差空间用连续flow matching做精细回归。该离散到连续的设计试图同时降低搜索复杂度和弥补量化误差,并可扩展到关节物体;文中称其在合成与真实数据上优于现有方法,推理达到70 FPS。

Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation Figure 1
2026-06-23cs.RO

Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

Yang Yang, Yuchuang Tong, Zhengtao Zhang, Xu Ding, Ning Yang, Yifan Zhang, Haipeng Li, Kehu Yang, Miao Xin

) and the independent deployment project of the National Key Laboratory of Cognition and Decision

2026-06-23强化学习

这篇论文针对 LLM 自动奖励设计依赖试错反馈、易引入伪相关奖励项的问题,提出因果奖励世界模型 CRWM:先用多任务离线交互数据学习奖励组件与任务物理变量之间的因果拓扑,再作为任务无关先验约束 LLM 零样生成奖励函数。实验显示其无需反馈式奖励迭代即可生成可执行奖励,在连续控制和机器人技能任务中降低设计延迟,性能达到或超过现有方法,并能迁移到未见任务和不同机器人形态。

Conceptual Design of an Ecosystem for Real Farm Data Collection toward Agricultural AI Foundation Models Figure 1
2026-06-23cs.RO

Conceptual Design of an Ecosystem for Real Farm Data Collection toward Agricultural AI Foundation Models

Junsei Tanaka, Yoshihiro Sato

∗1 Kyoto University of Advanced Science

2026-06-23机器人

面向农业机器人基础模型训练,论文指出真实农场数据稀缺的关键不只是采集成本,还包括农户长期参与激励与生成式 AI 时代的数据真实性。其核心是设计一个数据市场生态:按需求与稀缺性自动定价、将购买收入分给农户,并用认证设备上传保障来源可信。主要结果是概念性论证三方经济可持续性,但实现、仿真和鲁棒验证文中未充分说明。

LP-NavOA: Integrated Local Navigation and Obstacle Avoidance for Humanoid Robots under Limited Perception Figure 1
2026-06-23cs.RO

LP-NavOA: Integrated Local Navigation and Obstacle Avoidance for Humanoid Robots under Limited Perception

Yukun Luo, Jianjun Ma, Yuyao Min, Jinzhe Li, Kaihong Huang, Peng Li

College of Intelligence Science and Technology, National University of Defense Technology

2026-06-23机器人

本文针对人形机器人在短距、部分可观测感知下既要避障又要找回稀疏目标的问题,提出LP-NavOA:先训练带局部raycast和圆形航向-速度命令的PPO全身运动骨干,再用A*与路点教师蒸馏一个只改写航向的循环局部规划器,部署时无需全局地图或外部规划器。在MuJoCo开放墙和室内场景中,准时到达率由约38–40%提升到85–97%,并减少擦碰/接触式前进;消融显示动态路线塑形、教师主动数据和圆形命令接口是主要增益来源。

Lessons from the Field: A Case Study of Robotic Intervention in an Industrial Emergency Figure 1
2026-06-23cs.RO

Lessons from the Field: A Case Study of Robotic Intervention in an Industrial Emergency

Jonathan Lichtenfeld, Frederik Bark, Robert Grafe, Oskar von Stryk

2026-06-23机器人

针对化工厂火灾后反应釜内爆炸性气体导致人员无法接近的问题,论文以一次真实应急处置为案例,展示UGV结合临场定制的机械臂延长工具、UAV辅助视角和远距离通信中继完成阀门开启。任务成功引入惰化气体、避免大规模爆炸,同时暴露研究型救援机器人在通信可靠性、狭窄通行和操作辅助能力上的现实短板。

Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation Figure 1
2026-06-23cs.RO

Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation

Ali Alabbas, Dipshikha Das, Camillo Murgia, Sainul Ansary, Alaa Elkamash, Philip Long

Ali Alabbas ∗1 , Dipshikha Das ∗1 , Camillo Murgia ∗1 , Sainul Ansary 2 , Alaa Elkamash 2 , Philip Long 2, *Authors have equally contributed to this work 1,2 Authors are with the Department of Electronic, Software and Advanced Manufacturing Engineering, Atlantic Technological University, Galway, Ireland

2026-06-23机器人

针对端到端VLA模型难解释、需微调且难在普通机器人硬件部署的问题,本文把自然语言操作拆成感知、语义路由和运动执行三层:用FastSAM+SoM建立可指代视觉锚点,再由LLM生成可验证YAML任务并交给MoveIt MTC规划。UR5e零样本实验覆盖开放顺序操作和密集空间关系推理,端到端成功率为62%,但失败分解与相对各模块的增益来源文中未充分说明。

Asymmetric physics enables efficient learning in quadrupedal robot swarms Figure 1
2026-06-23cs.RO

Asymmetric physics enables efficient learning in quadrupedal robot swarms

Yuang Zhang, Yunlong Song, Zhihao He, Zelin Ni, Kangyu Wang, Tianchi Liu, Yu Hu, Feng Yu, Danping Zou, Weiyao Lin

2026-06-23机器人

论文针对四足机器人群在拥挤、障碍环境中难以同时学习视觉感知、多机器人避让与接触式运动控制的问题,提出“非对称物理”训练:前向用高保真非可微仿真保证接触真实性,反传用可微替代模型提供低方差梯度。该方法可训练最多512台四足机器人,并在无通信、无全局地图条件下零样迁移到6台实体机器人,展现让行、瓶颈等待和贴墙等协调行为。

ShotcreteDepth: A Bi-modal Dataset for Robust Robotic Depth Perception in Shotcrete Construction Environments Figure 1
2026-06-23cs.RO

ShotcreteDepth: A Bi-modal Dataset for Robust Robotic Depth Perception in Shotcrete Construction Environments

Jakub Gregorek, Lars Arnold Dethlefsen, Patrick Schmidt, Mads Essenbæk, Jonas Flink Bentzen, Lazaros Nalpantidis

2026-06-23机器人数据集/基准安全鲁棒

面向喷射混凝土自动化中粉尘、弱光导致相机与 LiDAR 深度感知失效的问题,本文发布 ShotcreteDepth 双模态数据集,包含 11252 组同步立体 RGB 与 LiDAR 样本,并提供点云不可靠深度标注工具。实验用 9 个立体匹配、深度补全和单目估计方法验证该场景可做深度感知,但实时性与精度存在明显权衡,传感器融合潜力仍待进一步评估。

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models Figure 1
2026-06-23cs.RO

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models

Pinhao Song, Ze Fu, Yutong Hu, Renaud Detry

2026-06-23视觉语言视觉感知

本文针对辅助机器人中 VLA 具备语义泛化但在抓取、插入、释放等接触阶段易因空间精度失效的问题,提出 Assistron:冻结现成 VLA 负责语言驱动的宏观动作,仅在交互检测到的高风险阶段引入用户摇杆,并以贝叶斯/flow matching 后验引导融合修正。实验在多任务日常场景恢复基准上显示,相比纯自主 VLA 提高成功率,同时较传统遥操作降低认知与体力负担。

Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields for Flow-Based Object Manipulation Figure 1
2026-06-23cs.RO

Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields for Flow-Based Object Manipulation

Koki Seno, Daichi Yashima, Yusuke Takagi, Kento Tokura, Komei Sugiura

Keio University, Japan

2026-06-23机器人生成模型

针对机器人遥操作数据昂贵、跨本体视频难以直接用于策略学习的问题,本文将流式操作中的机器人运动从稀疏关键点位移改为密集速度场,并用 flow matching 将其建模为概率速度场。该表述更贴合连续时间运动,可由人类和多机器人视频共同训练;在 Fractal、Bridge V2、DROID、Fanuc 等基准含零样本设置中优于代表性基线,生成速度约快 33 倍,真实 13 项任务实验也取得更高平均成功率。

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents Figure 1
2026-06-23cs.RO

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

Haoran Zhang, Yifu Lu, Boyang Wang, Xuhui Kang, Yen-Ling Kuo, Zezhou Cheng, Mengdi Wang, Odest Chadwicke Jenkins

University of Michigan, Princeton University, University of Virginia

2026-06-23机器人视觉感知强化学习

长时程机器人操作中,失败往往不是单帧异常,而取决于动作历史与任务阶段。Foresight用动作条件世界模型的预测潜表示监控轨迹,仅需最终成败标签训练,再用函数式保形预测校准时变阈值。实验覆盖LIBERO-Long、ManiSkill-Long、BEHAVIOR-1K及真实ReactorX/Franka,多数设置优于FAIL-Detect、SAFE、RND和Gauge,长轨迹上提升更明显。

AdaReP:Adaptive Re-Planning under Model Mismatch for Neural World-Model Predictive Control Figure 1
2026-06-23cs.RO

AdaReP:Adaptive Re-Planning under Model Mismatch for Neural World-Model Predictive Control

Yutian Cheng, Xiaojian Ma, Xianhao Wang, Min Yang, Rongpeng Su, Hangxin Liu, Xi Chen, Shuai Li, Qing Li

2026-06-23强化学习规划控制

这篇论文针对神经世界模型 MPC 每步重规划计算开销高、固定复用策略又难适配模型误差传播的问题,提出训练-free 的 AdaReP:用执行轨迹与缓存预测的偏差及局部动力学敏感性在线调节重规划阈值。其核心洞察是旧计划代价由复用容忍度、累积 mismatch 和局部敏感性共同决定。实验覆盖图像规划、TD-MPC2 控制和 Franka 实机,在性能接近逐步重规划的同时显著减少模型查询,实机 50 次中查询量降幅超过 80%。

ISOPoT: Imaging Sonar Odometry by Point Tracking Figure 1
2026-06-23cs.RO

ISOPoT: Imaging Sonar Odometry by Point Tracking

Jaša Samec, Vid Rijavec, Marko Peljhan, Aleksander Grm, Andrej Androjna, Danijel Skočaj, Matej Dobrevski

Goriska cesta 6c, Vipava, 5271, Slovenia. 4 Marko Peljhan is also with the MAT Systemics, University of California, Santa Barbara

2026-06-23视觉感知

本文针对前视成像声呐在浑浊水下导航中噪声强、纹理弱、传统关键点匹配易失效的问题,提出用多帧点跟踪替代成对匹配的 ISOPoT。方法以 TAPNext 为跟踪骨干,结合网格化点管理、重叠缓冲和相关性细化,在静态场景假设下估计平面 SE(2) 运动。Aracati 2017 与自采 Portoroz 数据显示,其在纯声呐和与多传感器方法对比中均显著降低 ATE 与相对误差,消融表明细化模块贡献最大。

TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation Figure 1
2026-06-23cs.RO

TEXEDO : Test Time Scaling for Controller-aware Language-conditioned Humanoid Motion Generation

Jianuo Cao, Yuxin Chen, Yuzhen Song, Masayoshi Tomizuka, Chenran Li, Thomas Tian

Nanjing University, University of California, Berkeley, Southern University of Science and Technology

2026-06-23机器人规划控制

这篇论文针对文本生成的人形机器人动作“语义合理但控制器难以执行”的落地问题,提出 Texedo:在测试时从冻结生成器采样多条候选轨迹,用由跟踪控制器 rollout 蒸馏的动态可行性验证器先过滤,再用文本-动作对齐验证器重排选择。结果显示,该策略在仿真和 Unitree G1 实机上提升跟踪质量与语义对齐,并可迁移到未见生成器和分布外提示;但收益也可能部分来自更多采样带来的 test-time scaling。

Can Single-View Mesh Reconstruction Generalize to Robot Camera Rotation? Figure 1
2026-06-23cs.CV

Can Single-View Mesh Reconstruction Generalize to Robot Camera Rotation?

Yu Zhan, Guangcheng Chen, Hanjing Ye, Zhiqin Cheng, Zanjia Tong, Wenjun Xu, Hong Zhang

2026-06-23机器人三维

本文关注机器人腕部、机身等相机旋转时,单视图网格重建是否仍可作为可靠空间感知模块。作者设计按 roll/pitch/yaw 控制旋转的评测,拆解 MDE 点图、规范物体网格、相机坐标布局和物理可行性误差,发现旋转主要破坏深度与布局并引发碰撞穿透,而规范网格相对稳定;两阶段 SAM3D+FoundationPose 更稳,加入重力感知细化后,一阶段布局方向误差降低 47.1%。

Distilling Collaborative Dynamics into Latent Space for Implicit Coordination in Decentralized Multi-Agent Manipulation Figure 1
2026-06-23cs.RO

Distilling Collaborative Dynamics into Latent Space for Implicit Coordination in Decentralized Multi-Agent Manipulation

Chanyoung Park, Minsung Yoon, Andrew Jeong, Sung-eui Yoon

2026-06-23机器人

多臂操作在真实部署中常受局部观测、无通信和团队规模增长限制,集中式策略难以扩展。论文提出 CLS-DP,在 CTDE 下把训练期可见的多机器人未来动力学蒸馏为协作潜变量,执行时各机器人仅凭本地 RGB 和任务指令条件化扩散策略以隐式协调。RoboFactory 六项任务中平均成功率 38%,高于最佳集中式基线 20% 和去除潜变量的 9%。

Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI Figure 1
2026-06-23cs.RO

Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI

Xianda Guo, Bohao Zhang, Chenwei Huang, Shiyuan Chen, Ruilin Wang, Yiqun Duan, Cong Yang, Qin Zou, Wei Sui

School of Computer Science, Wuhan University, Soochow University

2026-06-23机器人数据集/基准

本文针对现有占据数据集偏向自动驾驶、难以覆盖人形机器人室内近场与全向感知的问题,提出基于四组环视双目的 Humanoid-OmniOcc 数据集,并用 Real2Sim2Real 将 Unitree G1 真实传感器配置复刻到 Isaac Sim,生成 15 个仿真场景、5 个真实环境和 155K+ 样本。配套 HS2Occ 利用双目深度先验做 2D 到 3D 提升,实验显示其优于单目基线,并在未见仿真场景和真实环境上具备更好泛化。

PanoVine: Whole-Body Visuomotor Control for Soft Growing Vine Robot Figure 1
2026-06-23cs.RO

PanoVine: Whole-Body Visuomotor Control for Soft Growing Vine Robot

Yimeng Qin, Xiaomeng Xu, William Heap, Aditi Oak, Shuran Song, Allison Okamura

Stanford University

2026-06-23机器人规划控制

PanoVine面向管道、地下设施等狭窄复杂场景中藤蔓软体机器人难以建模和感知不足的问题,提出在6米可生长机体上分布19个相机,并用示教训练端到端全身视觉运动策略,以直接利用形变、接触和环境几何反馈闭环控制。实验显示,该系统能在分叉选择、爬坡、无支撑地形、狭窄障碍和精确触达等任务中实现自主导航与操作。

Improving Robotic Imitation Learning via Trajectory Standardization Figure 1
2026-06-23cs.RO

Improving Robotic Imitation Learning via Trajectory Standardization

Licheng Yang, Lingfeng Qian, Fei Zheng, Yonghao He, Wei Sui, Shuangshuang Li, Hu Su

2026-06-23机器人模仿学习规划控制

这篇论文针对机器人模仿学习中遥操作轨迹因操作者速度、停顿和动作密度不一致而产生冗余与非均匀性的问题,提出离线的 ISR 轨迹重采样:用速度压缩低信息片段,用加速度保留转弯、减速和精细接触阶段,并以近似等信息距离选点。三项真实操作任务中,相比常用 3× 时间均匀下采样,ISR 在 π0.5 与 VO-DP 上分别将平均成功率提升到 71.8% 和 80.2%,同时减少数据规模与训练成本。

A Vendor-Agnostic LiDAR Data Conversion System with Multi-Signal Detection and Multi-Format Output Figure 1
2026-06-23cs.RO

A Vendor-Agnostic LiDAR Data Conversion System with Multi-Signal Detection and Multi-Format Output

Param Patel, Jay Dave, Pratyush Chakraborty

2026-06-23视觉感知

这篇论文针对多厂商 LiDAR 原始 PCAP 数据缺乏统一解码流程的问题,提出一个无需预先指定传感器厂商的转换系统。核心做法是用六类包级信号进行加权打分以识别 Ouster、Velodyne、Hesai、Livox 等来源,再调用对应解析后端并输出五种标准点云格式。实验显示,基于 C++ SDK 的 Ouster、Velodyne 吞吐可达 2.08M 和 1.47M 点/秒,而 Python 解析的 Hesai、Livox 约为 110K 和 150K 点/秒,性能差距主要来自解析实现层级。

HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning Figure 1
2026-06-23cs.RO

HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning

Jingyi Liu, Zhaohong Mai, ShunSen He, Hang Ren, Chao Wang, Shunbo Zhou, XiaoDong Wu, Heng Zhang

CloudRobo Lab, Huawei Cloud Computing Technologies Co., Ltd. 2 South China University of Technology. ∗ Corresponding author

2026-06-23强化学习

本文针对VLA/行为克隆策略在真实工业部署中易受分布偏移和累积误差影响的问题,提出将原模型冻结为黑盒动作生成器,并用人类在环指导的残差强化学习适配器在线修正动作;该方法强调模型无关、安全探索与样本效率,并扩展到力/触觉输入。真实机器人实验显示,约1–1.5小时在线训练后平均成功率超过95%,但不同任务与基座模型下的增益归因仍需更多细节支撑。

FPAS: Frontier-Based Path Planning with Adaptive Sampling for Large-Scale Unknown Environments Figure 1
2026-06-23cs.RO

FPAS: Frontier-Based Path Planning with Adaptive Sampling for Large-Scale Unknown Environments

Jinwoo Choi, Yeonkyu Lee, Jung-Taak Kim, Jisung Bae, Seung-Woo Seo

2026-06-23规划控制

面向大规模未知环境中的目标到达,FPAS针对频繁重规划、图规模膨胀和采样路径绕行带来的计算瓶颈,将探索中的frontier重新用于目标导向规划:局部阶段引导机器人向未知区域前进,遇到死胡同或低效路径时以全局frontier选取回退子目标,并用frontier派生的开放度自适应调节图节点密度。实验显示其在保持有竞争力到达性能的同时,显著降低计算开销。

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA Figure 1
2026-06-23cs.RO

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Michael Piseno, Guy Tevet, C. Karen Liu

Stanford University

2026-06-23机器人

这篇论文针对机器人操作中“数据绑定具体末端执行器”的问题:腕部相机里夹爪/手占据稳定大区域,使VLA容易学到本体外观而难以迁移。Cloak的关键做法是用已知几何实时生成末端遮罩,并在视觉编码器注意力中屏蔽这些patch,训练时再做遮罩增强,部署时结合指尖位姿FK/IK重定向。实验显示,模型仅用单一平行夹爪数据训练,也能零样本迁移到新夹爪、新机械臂和五指手,同时源本体性能只小幅下降。

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models Figure 1
2026-06-23cs.RO

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

2026-06-23视觉语言视觉感知

UniFS针对现有VLA快慢双系统在更新频率上的两难:慢更新会造成语义漂移,快更新又削弱加速收益。其核心是把VLM层按时间尺度分组,以多频率中间表征直接驱动动作专家,并用潜向量反转和多级监督实现由粗到细的控制。LIBERO上平均成功率达98.3%,较VLA-Adapter提升2.5%,推理延迟由36.5ms降至17.8ms,真机Franka实验也验证了可用性。

Cooperative-ORCA*: Real-Time Proactive Deadlock Avoidance for Continuous-Space Multi-Agent Navigation Figure 1
2026-06-23cs.RO

Cooperative-ORCA*: Real-Time Proactive Deadlock Avoidance for Continuous-Space Multi-Agent Navigation

Junfeng Wu, Jiaqi Chen, Hongkun Lyu, Kevin Zheng, Andy Li

Monash University, in the center (Fig 1b). At the time of entrance, the agents, Euclidean distance between the agent’s centre and the, tance between two agents’ center is less than 2r.

2026-06-23机器人

这篇论文针对连续空间多机器人导航中 ORCA* 只做局部反应、容易在狭窄通道等场景形成死锁的问题,提出 C-ORCA*:先用离散 MAPF 生成全局引导路径并抽取路点与走廊依赖,再在 ORCA* 速度控制中让智能体基于依赖主动等待;其 MAPF 变体还保留死锁后备重规划。实验在 Gap、Random、Room、Warehouse 上显示,该系列在成功率、运行时间和 flowtime 上整体优于 ORCA* 与 ORCA*-MAPF。

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration Figure 1
2026-06-23cs.RO

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration

Sandilya Sai Garimella, Daniel Chase Butterfield, Sean Wilson, Lu Gan

1 affiliationmark: Georgia Institute of Technology, USA, 2 affiliationmark: Georgia Tech Research Institute, USA

2026-06-23机器人

面向异构无人机—地面机器人在大尺度、动态户外环境中难以闭环评测 SLAM、协同感知与探索的问题,HERCULES 基于 UE5/AirSim 改造并开源,支持并发 UAV-UGV、统一航点控制、同步多模态传感、动态智能体与灾害现象。实验在沙漠、森林、城市中验证了协同 SLAM、3D 检测和在线探索流程,但算法性能增益更多体现为平台与数据能力。

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models Figure 1
2026-06-23cs.RO

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models

Moritz Zoellner, Anastasios Manganaris, Rohan Paleja

2026-06-23生成模型强化学习

论文针对扩散策略虽能表示多种机器人行为、却难在推理时按用户偏好选择模式的问题,提出用信号时序逻辑表达约束,并借助独立可微世界模型预测动作后果,将STL鲁棒性梯度注入仅生成动作的扩散去噪过程,无需重训即可引导策略。在Robomimic Can Transport任务中,该方法保持100%任务成功率,并将约束违反率从基线的80%以上降至4%。

No Figure
2026-06-23cs.RO

Integrated cloud-based architecture for robot-robot and human-robot collaboration using ROS 2--MQTT in Mediterranean Greenhouses

F. Cañadas-Aránega, M. Muñoz, J.C. Moreno, J.L. Blanco-Claraco

2026-06-23机器人

面向地中海温室中窄通道、植被遮挡和金属结构导致的多机器人通信不稳定问题,论文提出以 ROS 2 为边缘执行层、MQTT/FIWARE 与 iVeg 决策系统相连的云边双向架构,将人员和机器人感知结果压缩为轻量几何元数据共享。仿真与真实温室测试显示,该方案能在弱连接下保持数据同步,并支持基于群体感知的提前减速等安全协作。

Efficient Continuous Semantic Mapping based on Spatio-Temporal Awareness Figure 1
2026-06-23cs.RO

Efficient Continuous Semantic Mapping based on Spatio-Temporal Awareness

My Le Pham, Dinh Trieu Duong, Xiem HoangVan, Thanh Nguyen Canh

2026-06-23机器人

这篇论文针对连续语义建图中全空间处理开销高、体素独立建模导致语义随时间漂移的问题,提出将空间不确定性与时间记忆结合:用语义熵自适应调整核推理范围,并通过时间衰减融合历史与当前标签。在 SemanticKITTI 上达到 54.92% mIoU,较仅用空间建图高 13.18 个百分点,约带来 12% 精度提升。

Semantic-Aware Autonomous Exploration for UAVs in Unknown Indoor Environments Figure 1
2026-06-23cs.RO

Semantic-Aware Autonomous Exploration for UAVs in Unknown Indoor Environments

Duc-Thien Nguyen, Ngoc Minh Do, Xiem HoangVan, Thanh Nguyen Canh

2026-06-23机器人

本文针对室内无人机探索中过度依赖几何增益、把未知区域等价处理导致绕行和冗余观测的问题,在 DEP/PRM 路线图框架中加入体素语义地图与语义奖励,使候选视点同时按前沿/表面信息和门、走廊、物体等上下文价值排序。ROS Noetic 与 Gazebo 仿真显示,该方法在多个室内场景达到 90%–94% 覆盖率,并相较纯几何探索减少时间和飞行距离;但结果主要来自仿真,真实机鲁棒性文中未充分说明。

Line Drawings using LightBenders: Authoring and Illuminating Figure 1
2026-06-23cs.GR

Line Drawings using LightBenders: Authoring and Illuminating

Hamed Alimohammadzadeh, Shahram Ghandeharizadeh

University of Southern California, University of Southern California Los Angeles CA USA

2026-06-23机器人

本文面向用无人机群在室内生成空中线稿与字形显示的难题,动机在于现有创作工具难以同时处理内容生成、飞行同步、灯光控制及下洗气流干扰。核心创新是 LightBender 硬件、Blender/LB-Author 工具链,以及从 SVG 到 SFL 的放置与空间错层算法。结果显示最大 10.1 mm 失准在人因实验中仍可接受,中位评分为 8/10。

PenduMorph: Development and Motion Analysis of Pendulum-Actuated Rolling Reconfigurable Spherical Robot with Magnetic-Coupling Figure 1
2026-06-23cs.RO

PenduMorph: Development and Motion Analysis of Pendulum-Actuated Rolling Reconfigurable Spherical Robot with Magnetic-Coupling

Aung Myat, Peter Noyce, May Forgan, Qing Yu, Seyed Amir Tafrishi

2026-06-23机器人

面向巡检、搜救等接触复杂环境中模块化机器人外露机构脆弱、滚动后难以可靠重构的问题,PenduMorph 将二维内摆驱动、无线控制与磁耦合端执行器封装进球形模块,并对磁保持力建模。实验展示单模块稳定滚动、双模块吸附对接及协同耦合运动,但规模仍限于两个模块,复杂地形与长期可靠性文中未充分说明。

ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation Figure 1
2026-06-23cs.RO

ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation

Yuntian Wang, Zesheng Jia, Yuhui Duan, Qibing Wang, Yang Liu, Song Wang, Siao Liu, Jin Wang

School of Future Science and Engineering, Soochow University, Key Laboratory of General Artificial Intelligence and Large Models in Provincial Universities, Soochow University, College of Mechanical and Electronic Engineering, China Jiliang University, College of Electronics and Information Engineering, Tongji University

2026-06-23机器人

该文针对长程机器人操作中离散技能虽利于复用、却容易与视觉语义脱节且量化损失精细控制的问题,提出 ARP:先用视觉—动作对比对齐把视觉嵌入锚定到预量化动作潜变量,同时保持状态无关解码器,再用两步迭代残差头修正执行误差。实验显示其在 LIBERO 平均 89.6%、Meta-World 平均 73.8%,并在 Kuavo 4 Pro 真实机器人任务上优于多个离散技能基线。

Scalable Multi-Task Data Generation via Reinforcement Learning for Language-Conditioned Bimanual Dexterous Manipulation Figure 1
2026-06-23cs.RO

Scalable Multi-Task Data Generation via Reinforcement Learning for Language-Conditioned Bimanual Dexterous Manipulation

Zechu Li, Yufeng Jin, Puze Liu, Jan Peters, Georgia Chalvatzaki

2026-06-23机器人强化学习

这篇论文瞄准双臂灵巧操作缺少大规模高质量数据的问题,提出 RLDC:用任务专用的状态型 RL 教师在随机化仿真中闭环采集可执行轨迹,并自动生成、扩展语言标注,再蒸馏为视觉语言条件的扩散学生策略。结果显示,通用奖励可接近手工任务奖励的成功率,纯合成数据训练的多任务策略在三类任务上提升泛化并具备真实机器人零样本迁移能力。

BLENDS: Bayesian Learning-Enhanced Deep Smoothing for GNSS-Denied Environments Figure 1
2026-06-23cs.RO

BLENDS: Bayesian Learning-Enhanced Deep Smoothing for GNSS-Denied Environments

Nadav Cohen, Itzik Klein

2026-06-23机器人

本文针对低成本 INS/GNSS 在 GNSS 遮挡时惯导漂移、传统平滑又受普通 GNSS 米级误差限制的问题,提出 BLENDS:在贝叶斯平滑框架中引入 Transformer 学习协方差自适应与状态修正,并补偿普通 GNSS 相对 RTK 的系统偏差。四旋翼断星实验中,其位置 RMSE 相比 TFS/RTSS 最高降低 25.6%,同时减小估计不确定性。

Self-Evolving Cognitive Framework via Causal World Modeling for Embodied Scientific Intelligence Figure 1
2026-06-23cs.AI

Self-Evolving Cognitive Framework via Causal World Modeling for Embodied Scientific Intelligence

Yi Yu, Tetsunari Inamura

Graduate School of Advanced Science and Engineering, Hiroshima University, Advanced Intelligence and Robotics Research Center, Brain Science Institute, Tamagawa University, Graduate School of Advanced Science and Engineering, Hiroshima University Hiroshima Japan, Advanced Intelligence and Robotics Research Center, Brain Science Institute, Tamagawa University Tokyo Japan

2026-06-23强化学习

本文针对具身世界模型偏重预测、难以处理分布变化、干预与反事实推理的问题,提出以因果世界建模为核心的自演化认知框架,将因果发现、干预反馈和持续认知修正串成循环,并把交互视为生成和检验因果假设的认识过程。主要结果是给出从预测智能转向认知/认识智能的理论框架及因果-认识评测范式;实证增益文中未充分说明。

SPiralRoll: A Novel Adjustable-Stiffness Underactuated 3-DoF Joint with Torsion Springs for Rolling Robots Figure 1
2026-06-23cs.RO

SPiralRoll: A Novel Adjustable-Stiffness Underactuated 3-DoF Joint with Torsion Springs for Rolling Robots

Louis Keith, George Ripper, and Seyed Amir Tafrishi

2026-06-23机器人

面向滚动/球形机器人中柔顺执行器笨重、欠驱动机构难以同时兼顾多模态运动与承载的问题,SPiralRoll用弧形扭簧和两个电机在同一3D打印结构中产生转动、径向伸缩和非线性变形诱发的轴向自旋。实验比较全弧与单弧原型,显示前者支撑和平滑性更好,后者变形与惯性激励更强,并在球形机器人上验证了前滚和转向;但非线性刚度/动力学模型仍未充分说明。

Curvature-aware 3D length estimation of greenhouse cucumbers using RGB-D imaging and cubic spline arc-length integration Figure 1
2026-06-23cs.CV

Curvature-aware 3D length estimation of greenhouse cucumbers using RGB-D imaging and cubic spline arc-length integration

Manveen Kaur, Rajmeet Singh, Saeed Mozaffri, Shahpour Alirezaee

Department of Mechanical Engineering, University of Windsor, Mohamed bin Zayed University of Artificial Intelligence

2026-06-23三维

面向温室黄瓜按长度分级中人工测量吞吐低的问题,论文提出 CucumberVision,用 RGB-D、YOLO/SAM 分割与三维中轴样条弧长积分估计弯曲果实长度,并指出对齐后误用深度相机内参会带来 12–18% 系统低估。在 7 根黄瓜 48 次采集上,新方法 M5 的 MAPE 为 4.13%,显著优于直轴、PCA、骨架和关键点基线,但数据规模较小。

Do Rigid-Body Simulators Dream of Soft Robots? Learning Contact-Rich Manipulation for Tendon-Driven Continuum Robots Figure 1
2026-06-23cs.RO

Do Rigid-Body Simulators Dream of Soft Robots? Learning Contact-Rich Manipulation for Tendon-Driven Continuum Robots

Chengnan Shentu, Nicholas Baldassini, Tongjia Zheng, Priyanka Rao, Jessica Burgner-Kahrs

University of Toronto, Canada, Project Page: https://continuumroboticslab.github.io/opencr-mujoco/

2026-06-23机器人

针对软连续体机器人缺少可用于接触丰富操作学习的仿真基础设施,论文将腱驱动连续体机器人用Kirchhoff杆理论离散为MuJoCo中的刚体链,并解析设定关节刚度,从而同时获得接触求解、腱驱动和学习接口。实验显示其与Cosserat参考和真实硬件吻合,并在两项任务上实现零样本sim-to-real部署。

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation Figure 1
2026-06-23cs.AI

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

Yun Oh, Sukmin Yun

2026-06-23视觉感知强化学习

针对世界模型生成视频在机器人评测中常出现物体形变等物理不一致、进而放大仿真到现实偏差的问题,论文提出无需参考真值的评估框架:用DROID-SLAM与SEA-RAFT度量3D和光度一致性,并以熵加权异常分数筛选rollout,同时用因子图残差定位失真时空位置。实验显示过滤后VLA任务成功率提升超过8%,但泛化到更多模型仍文中未充分说明。

A Taxonomy of Conceptual Alignment in Human-Robot Dialogue Figure 1
2026-06-23cs.RO

A Taxonomy of Conceptual Alignment in Human-Robot Dialogue

Shengchen Zhang, Xiaohua Sun, Weiwei Guo

2026-06-23机器人

论文针对人机对话中“概念对齐”定义混乱、研究多停留在单向机器人学习或局部词汇适配的问题,主张将其视为双向、共同建构的设计过程。核心贡献是提出按启动触发因素与概念理解层级划分的分类法,并配套对话行为 schema;作者结合文献梳理和48段人类协作概念对齐对话进行实例化,结果提供了分析、比较和设计机器人概念对齐策略的结构化工具,但尚未展示在真实机器人系统中的性能增益。

Benchmarking Robot Memory Under Interference Figure 1
2026-06-23cs.RO

Benchmarking Robot Memory Under Interference

Soumil Rathi

2026-06-23机器人数据集/基准

这篇论文关注机器人在真实部署中跨多会话积累经验后,能否从被无关任务干扰的长历史里找回关键记忆。作者在 RoboMME 上构建 RoboMME-Interference,将相关演示放在历史缓冲区前端,并加入 0、1、3、7 个跨任务干扰会话,系统评测 9 类任务和 9 个记忆增强 VLA。结果显示,感知记忆在无干扰时显著提升成功率,如 FrameSamp-Modul 从 18.2% 到 45.3%,但随干扰增加几乎退回无记忆水平,说明当前机器人记忆仍缺乏可靠的长程抗干扰召回能力。

Multi-AUV Marine Life Tracking with Single Hydrophone Payloads via a Hidden Markov Model Equipped Particle Filter Figure 1
2026-06-23cs.RO

Multi-AUV Marine Life Tracking with Single Hydrophone Payloads via a Hidden Markov Model Equipped Particle Filter

Christopher Herrera, Kehlani Fay, Christopher Clark, Alberto Soto, Christopher Lowe, Mario Espinoza

2026-06-23视觉感知

针对固定水听器易因动物游出探测范围而丢失数据、传统AUV双水听器载荷又增加阻力的问题,本文让多台AUV各携带单个紧凑水听器,并用融合多艇测距信息的粒子滤波框架,引入由历史动物运动拟合的HMM行为运动模型来定位声学发射器。实海短时部署RMSE约10米,较大范围长时仿真约15米;HMM模型优于通用速度模型和随机游走基线,系统在约20%检测丢失下仍较稳健。

Tactile Genesis: Exploring Tactile Sensors at Scale for Learning Dexterous Tasks Figure 1
2026-06-23cs.RO

Tactile Genesis: Exploring Tactile Sensors at Scale for Learning Dexterous Tasks

Trinity Chung, Kashu Yamazaki, Dhruv Patel, Alexis Duburcq, Yiling Qiao, Katerina Fragkiadaki, Aran Nayebi

Carnegie Mellon University, effectively defines a new robot, and no lab can replicate the same learning ex-, suitability to cover the entire hand versus only the fingertip. A lab that buys or builds one sensorized, We present Tactile Genesis, a scalable and hardware-agnostic platform for tactile sensor simulation.

2026-06-23机器人

面向灵巧操作中触觉硬件难以公平比较的问题,论文提出 GPU 并行的 Tactile Genesis,在统一接口下模拟接触、力/力矩、弹性体位移、近场、音频和温度等触觉信号,并可调布局、分辨率与噪声。三类任务的消融显示,本体感觉不足;传感覆盖位置比传感类型更关键,全手低分辨率覆盖优于仅指尖高端传感,约 200 个 taxel 已够用,逐 taxel 力/力矩是稳健默认选择,并在 XHand1 上验证了有限 sim-to-real 转移。

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics Figure 1
2026-06-23cs.RO

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics

Fangzhuo Zhang, Xinyu Wang, Xiao Yang, Jinchang Zhang

2026-06-23机器人

面向真实临床超声机器人中“医嘱语义/流程推理”与“接触、患者运动、图像质量等实时闭环控制”难以由单一模块兼顾的问题,论文提出快慢脑分层框架:慢脑结合 API/手册知识做意图解析、任务图规划与验证,快脑用多模态反馈做局部修正,并以 Safety Shield 和升级机制处理风险。实验显示该设计提升规划与动态执行成功率,并减少安全违规。

FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation Figure 1
2026-06-23cs.RO

FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation

Kexin Shi, Junyao Shi, Poorvi Hebbar, Zhuolun Zhao, Tarun Amarnath, Yifan Su, Shikhar Bahl, Deepak Pathak

Carnegie Mellon University, University of Pennsylvania

2026-06-23机器人生成模型强化学习优化算法

这篇论文针对长时程、接触丰富机器人操作中,流匹配/扩散式动作头难以用传统 actor-critic 强化学习微调的问题:沿多步 ODE 反传代价高且不稳定。FlowDPG 的核心是把 critic 的动作梯度在训练时蒸馏进流匹配速度场,用示范速度保持可行动作、用价值梯度修正方向,从而绕开 BPTT,推理时仍只做常规 ODE 生成。作者在真实双臂 AirPods 装配任务上报告 92% 端到端成功率,高于 BC 基线和多类 RL 微调方法,但泛化到更多平台与任务仍未充分说明。

Any-Body Guard: Universal Safeguarding for Manipulation Policies via Action Masking Figure 1
2026-06-23cs.RO

Any-Body Guard: Universal Safeguarding for Manipulation Policies via Action Masking

Alex Beaudin, Hanna Krasowski, Kartik Nagpal, Sanjit A. Seshia, Murat Arcak, Negar Mehr

University of California, Berkeley

2026-06-23机器人安全鲁棒

面向学习式机械臂在不同本体和杂乱准静态场景中难以兼顾安全、实时性与任务成功率的问题,本文提出 X-Safe:在构型空间快速构造带概率碰撞保证的安全多面体,并用动作掩码沿策略原方向修正候选动作,无需额外数据或针对本体重工。仿真与硬件单臂、双臂抓取放置实验显示,其相较基线显著降低任务性能损失,硬件实验未发生碰撞,经验碰撞率低于形式化概率界。

Geometric Reconstruction of Extrinsic Contact Trajectories using Tactile Sensing and Proprioception for Tool Manipulation Figure 1
2026-06-23cs.RO

Geometric Reconstruction of Extrinsic Contact Trajectories using Tactile Sensing and Proprioception for Tool Manipulation

Seojung Min, Yoonjin Kim, Jeong-Jung Kim, Jung Kim

2026-06-23机器人三维

这篇论文针对工具操作中关键接触发生在远离触觉传感器的工具尖端、且接触会随时间移动的问题,将外在接触估计重新表述为轨迹几何重建。方法利用抓持处双触觉标记与本体感知估计工具相对刚体运动,先用近似固定点校准锚定初始工具尖端位置,再传播得到完整轨迹。在51次多条件实验中,世界坐标轨迹RMSE为8.59±2.41 mm,形状RMSE为5.96±1.16 mm,并可14 Hz在线运行;误差主要来自初始锚定偏置,而非轨迹形状逐步漂移。

OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation Figure 1
2026-06-23cs.RO

OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation

Yingdong Hu, Haodong Zhu, Boyuan Zheng, Yihang Hu, Tong Zhang, Zunhao Chen, Junming Zhao, Ruiqian Nai, Yang Gao

Tsinghua University, Shanghai Qi Zhi Institute

2026-06-23机器人

本文针对类人机器人常将上、下肢解耦、难以实现真正全身协同操作的问题,提出 OpenHLM 经验配方:用关节级全身遥操作采集数据,将预训练 VLA 适配到完整自由度,并通过静态操作与 HuMI 等廉价数据协同训练扩展物体和语言覆盖。在 HLM-12 上训练任务达 89% 进度,未全身遥操作覆盖任务由 33% 提升到 87%,且长程任务以少于一半示教时间超过 GR00T N1.6 和 Ψ0。

Full Nonlinear Nonholonomic Dynamics and Motion Analysis of a 3-DoF Underactuated Spherical Rolling Robot Figure 1
2026-06-23cs.RO

Full Nonlinear Nonholonomic Dynamics and Motion Analysis of a 3-DoF Underactuated Spherical Rolling Robot

Lakshmesha Krishnapa, Ahnaf Sharaar Mazahar, Seyed Amir Tafrishi

2026-06-23机器人

面向单电机球形滚动机器人难以用简化模型刻画的强欠驱动、非完整约束与柔顺耦合问题,论文为 MonoRollBot 建立保留完整广义坐标的非线性受约束动力学模型,区分滚动 Pfaffian 约束与丝杠完整约束。仿真与原型运动趋势定性一致,并显示重力、弹簧柔顺和惯性耦合会显著改变轨迹形态,为后续状态估计和混合控制提供模型基础。

Zero-shot Transfer of Reinforcement Learning Control Policies for the Swing-Up and Stabilization of a Cart-Pole System Figure 1
2026-06-23cs.RO

Zero-shot Transfer of Reinforcement Learning Control Policies for the Swing-Up and Stabilization of a Cart-Pole System

Nikki Xu, Hien Tran

Department of Mathematics, Box 8205, NC State University, Raleigh, NC 27695

2026-06-23强化学习规划控制

针对强化学习控制器从仿真直接上硬件时常因模型误差、噪声和执行器带宽产生失效的问题,本文以倒立摆小车的摆起与稳定位为例,分别训练两套策略并用 Simulink 切换,核心在于把一阶动作平滑、敏感性引导的域随机化和线性课程学习组合起来减少 sim-to-real gap。实验显示,摆起策略无需实机微调即可稳定把系统送入稳定器吸引域,稳定器能抗测试扰动,较大扰动后摆起策略也可重新介入恢复倒立。

Physics-Informed Eikonal Caging for Whole-Arm Manipulation Planning Figure 1
2026-06-23cs.RO

Physics-Informed Eikonal Caging for Whole-Arm Manipulation Planning

Yan Zhang, Yiming Li, Yifei Dong, Florian T. Pokorny, Sylvain Calinon

1 affiliationmark: Idiap Research Institute, Martigny, Switzerland, 3 affiliationmark: KTH Royal Institute of Technology, Stockholm, Sweden

2026-06-23机器人规划控制

本文针对全臂接触操作中接触动力学难精确建模、物体易逃逸的问题,将 caging 重写为有界速度下的最短逃逸时间问题,并证明其逃逸时间场满足 eikonal 方程,再用 PINN 学到可微鲁棒性指标嵌入轨迹优化。仿真与真实 Franka 桌面实验显示,该目标能促使机械臂形成更强几何包围,在扰动、简化物体几何和接触模型失配下较基线更稳健。

RoboLineage: Agent-Native Data Lifecycle Governance Across Robot Policy Iterations Figure 1
2026-06-23cs.RO

RoboLineage: Agent-Native Data Lifecycle Governance Across Robot Policy Iterations

Qian Luo, Wentao Guo, Zhennan Qin, Nanchun Guo, Yunhan Zhao, Yi Ma, Yanchao Yang

The University of Hong Kong, Beijing Institute of Technology

2026-06-23机器人强化学习

论文针对机器人策略迭代中数据采集、审核、训练、评估与发布证据分散、难以追溯的问题,提出 RoboLineage,将 rollout、数据决策、训练记录、评估和再采集计划统一为类型化 lineage artifacts,并让代理在明确边界内生成可审计状态。实验称其在真实机器人操作流程中降低常规迭代工作量、提升可审计性,同时基本保持下游策略性能。

Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data Figure 1
2026-06-23cs.RO

Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data

Yangtao Chen, Zixuan Chen, Peiyang Wang, Yong-Lu Li, Jing Huo, Jieqi Shi, Yang Gao

Shanghai Innovation Institute, 2 Nanjing University, 3 Shanghai Jiaotong University

2026-06-23机器人生成模型强化学习

Wh0针对灵巧操作中真实遥操作数据昂贵、仿真与公开视频又存在场景和本体差距的问题,将生成式视频世界模型定位为可控的人手操作数据源,而非动力学模拟器;其生成5万段对齐机器人场景与手部外观的第一视角视频,并经手部重建转成VLA训练监督。与少量真实机器人数据联合训练后,在18个真实任务上零样本成功率由8.3%升至38.9%,消融显示增益主要来自数据规模及场景/本体对齐。

Durability-Aware Multi-Objective Optimization of the Jansen Linkage: Trading Gait Quality Against Joint Wear Figure 1
2026-06-23cs.RO

Durability-Aware Multi-Objective Optimization of the Jansen Linkage: Trading Gait Quality Against Joint Wear

Jichao Wang

2026-06-23优化算法

这篇论文针对 Jansen 连杆以往只优化足端轨迹、忽略转动副磨损的问题,把参数化运动学、逆动力学与 Archard 磨损模型耦合,并用 NSGA-II 在步态质量和关节耐久性之间做双目标优化。核心洞察是经典“holy numbers”在加入耐久目标后并非帕累托最优;代表性设计在连杆长度改动约 ±29% 内,同时降低站立段起伏、速度波动和总关节磨损,磨损降幅约 56%,但其磨损量基于理想无间隙关节,更适合作相对排序而非寿命预测。

DeformX: A Versatile Co-Simulation Framework for Deformable Linear Objects Figure 1
2026-06-23cs.RO

DeformX: A Versatile Co-Simulation Framework for Deformable Linear Objects

Yi Yang, Xiang Fei, Lehong Wang, Chenhao Li, Zilin Dai, Henry Kou, Lu Li, Howie Choset

each reserves the right to be listed first. 1 The Robotics Institute, Carnegie Mellon University, Forbes Ave, Pittsburgh, PA 15213 USA. 2 Department of Mechanical Engineering, Carnegie Mellon University, Forbes Ave, Pittsburgh, PA 15213 USA. 3 School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Dongchuan Rd, Minhang District, Shanghai, China. 4 Zhiyuan College, Dongchuan Rd, Minhang District, Shanghai, China. 5 John A. Paulson School of Engineering and Applied Sciences, Harvard University

2026-06-23机器人

针对线缆、绳索等可变形线状物在机器人操作中难以同时获得真实视觉、可信物理和学习接口的问题,DeformX 将 Cosserat 杆物理引擎与 Isaac Sim 协同仿真,支持自由形状网格接触、CAD 网格蒙皮和传感渲染。实验显示,用其生成数据微调 SAM3 使真实线缆分割 mAP@75 提升 10.2%,纯仿真训练的甩绳策略在 UR5e 上平均命中误差为 6.6 cm。

KITE: Decoupling Kinematics and Interaction for Zero-Shot Cross-Embodiment Manipulation Figure 1
2026-06-23cs.RO

KITE: Decoupling Kinematics and Interaction for Zero-Shot Cross-Embodiment Manipulation

Qianxu Wang, Kuan Fang

Cornell University

2026-06-23机器人

这篇论文针对机器人策略难以跨不同本体复用的问题,指出瓶颈在于任务推理与具体运动控制被耦合。KITE用接触模式定义的潜在“交互意图”作为接口,让共享策略只预测任务相关意图,而各机器人用仅由运动学模型训练的解码器转成动作。实验覆盖夹爪、灵巧手和组合本体的三类任务,显示无需目标任务示范也能零样本迁移,并优于多种重定向和本体感知基线。

ACEsplat: Accelerated 3D Gaussian Scene Regression via RGB and Poses Only Figure 1
2026-06-23cs.RO

ACEsplat: Accelerated 3D Gaussian Scene Regression via RGB and Poses Only

Mingkai Liu, Haohua Que, Dikai Fan, Haojia Gao, Tianle Zhu, Handong Yao, Qian Zhang, Ruopeng Zhang, Xianliang Huang, Fei Qiao

Peking University, University of Georgia, Tsinghua University, Chongqing Vocational Institute of Engineering

2026-06-23三维

ACEsplat面向机器人与AR现场建图中3DGS依赖SfM点云或深度先验、耗时且稀疏视角下不稳的问题,提出仅用RGB和相机位姿的两阶段流程:先用自监督SCR快速生成场景坐标先验,再融合SCR特征初始化高斯并做逐场景优化。实验在Wayspots、Cambridge和RealEstate10K上分别取得29.11、33.20和26.11 dB PSNR,单GPU约15–25分钟完成重建。

Dynamics, stability, and energy efficiency of an energy-recycling rimless wheel with spring-clutch legs Figure 1
2026-06-23cs.RO

Dynamics, stability, and energy efficiency of an energy-recycling rimless wheel with spring-clutch legs

Tongchen Lin, Yanqiu Zheng, Chuhan Zhang, Ruigang Chen, Yizhar Or, Mingyi Liu

2026-06-23机器人

针对无轮缘轮/被动行走中足地碰撞能量大量耗散的问题,论文在伸缩弹簧阻尼腿中加入可锁止离合器,使冲击压缩能先被锁存并在下一步态周期释放,从而把顺应性与释放时机解耦。作者建立混合动力学模型并做稳定性、CoT 仿真与斜坡样机验证;结果显示相较黏弹腿基线 CoT 最多降 16.13%,相较刚性轮降逾 50%,且样机可在约 1° 浅坡被动行走,CoT 约 0.02。

How Should a Simulation-to-Reality Transfer Budget Be Spent? Figure 1
2026-06-23cs.RO

How Should a Simulation-to-Reality Transfer Budget Be Spent?

Syed Hamzah Rizvi, Yash Vardhan Tomar

2026-06-23机器人

这篇论文关注真实机器人交互预算有限时,系统辨识和域随机化该如何取舍。作者不提出新算法,而是在可控的 sim-to-sim 摆杆任务中系统扫描辨识 rollout 数和随机化宽度,直接测量零样本迁移收益。结果显示,在动力学可辨识且仅少数参数未知的良性设定下,少量真实测量即可弥合大部分现实差距;一旦有真实数据,按估计参数训练通常优于加宽随机化范围,宽随机化即使覆盖真实系统也难替代测量。

Multi-Target Maneuver Coordinations: Unlocking Coordination Opportunities in Connected Automated Driving Figure 1
2026-06-23cs.NI

Multi-Target Maneuver Coordinations: Unlocking Coordination Opportunities in Connected Automated Driving

Rafael Molina-Masegosa, Sergei S. Avedisov, Miguel Sepulcre, Takayuki Shimizu, Javier Gozalvez, Onur Altintas

order to anticipate driving conflicts and actively collaborate to, coordination opportunities that are not immediately available, IEEE copyright. This is an author-created postprint version. The final publication is available at https://ieeexplore.ieee.org/

2026-06-23机器人

现有车联网自动驾驶协同机动多默认与单一预设目标车谈判,错失随交通演化出现的替代机会。论文将创新点放在协同前的多目标选择:主车从多个潜在让行/配合车辆中评估并选取目标,而不改执行逻辑和协议。仿真显示该方法显著增加触发与成功的换道协同,成功率基本不降,并能更早启动;收益主要来自第二个后方目标车,更远目标贡献很小。

GeoFlow-SLAM++: A Robust Multi-Camera Visual-Inertial SLAM System with Relocalization Figure 1
2026-06-23cs.RO

GeoFlow-SLAM++: A Robust Multi-Camera Visual-Inertial SLAM System with Relocalization

Wei Fen, Tingyang Xiao, Liu Liu, Xiaolin Zhou, Zhizhong Su

2026-06-23生成模型安全鲁棒

针对单目或单RGB-D视觉惯性SLAM视场受限、传感器失效和跨会话重定位脆弱的问题,GeoFlow-SLAM++将GeoFlow-SLAM扩展为统一机体系状态的多相机紧耦合框架,并在同一几何后端下结合ORB与SuperPoint/LightGlue特征、跨视角地点识别、IMU预积分和可选伪深度约束。实验覆盖EuRoC、OpenLORIS、TUM、Hilti及自采数据,显示学习特征提升外观变化下鲁棒性,多相机定位在Hilti具竞争力,重定位接近LiDAR表现。

A Multimodal Tiltwing Framework for Bioinspired Aerial Robots Figure 1
2026-06-23cs.RO

A Multimodal Tiltwing Framework for Bioinspired Aerial Robots

Krispin C. V. Broers, Sophie F. Armanini

2026-06-23机器人视觉语言

针对现有无尾扑翼微飞行器飞行模式单一、航时受限的问题,论文提出双独立单翼推进单元的倾转翼框架,用大范围推力矢量、混合 Scotch-yoke 扑翼机构、被动翼旋转和非接触前缘跟踪来兼顾悬停、高速飞行与滑翔。实验显示单翼在 188°扑动幅度下由 3.1 g 电机产生 21.1 gf 平均升力,倾转测试得到近线性且对称的控制力矩响应。

Deep RL- Tuned Mo del-Free Adaptive Control for Lower-Limb Exoskeletons During Sit-to-Stand Transitions Figure 1
2026-06-23cs.RO

Deep RL- Tuned Mo del-Free Adaptive Control for Lower-Limb Exoskeletons During Sit-to-Stand Transitions

Ranjeet Kumbhar, Appaso M. Gadade, Rajmeet Singh, Ashish Singla, Ravinder Kumar

Department of Computer Science and Engineering, Thapar Institute of Engineering and Technology, Department of Mechanical Engineering, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)

2026-06-23强化学习规划控制

针对坐站转换中人机耦合强、个体差异大导致下肢外骨骼轨迹控制困难的问题,论文将二阶超局部无模型自适应反步控制、RBF在线动力学估计与TD3增益调度结合,使控制器可随动作阶段调整。仿真结果显示平均关节RMSE为0.078°,较PID、MFAC、LQR和SMC分别降低60.2%、54.4%、48.7%和42.6%,但效果仍主要基于联合仿真验证。

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation Figure 1
2026-06-23cs.RO

RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation

Pengzhi Yang, Xinyu Wang, Pengyu Jing, Kehan Wen, Yiduo Qu, Zhenhao Huang, Minghao Fu, Xin Liu, Yaheng Shen, Fan Shi

† \dagger NUS Human-Centered Robotic Lab, § University of Cambridge, ¶ School of Artificial Intelligence, Nanjing University

2026-06-23机器人强化学习

机器人操作中的强化学习常受稀疏奖励和手工稠密奖励限制,尤其长时序任务易被错误进度信号误导。RARM的核心是用一次成功演示作参考,通过通用视频上训练的时序对比视觉比较器定位进度,并以置信门控只奖励可靠的向前进展,抑制视觉相似但物理错误状态的假阳性奖励。在LIBERO、MetaWorld共9个仿真任务和4个真实任务中,它整体成功率优于VLM、轨迹对齐和相似度奖励基线,长时序如叠布收益更明显。

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation Figure 1
2026-06-23cs.RO

CoRDE: Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation

Haidong Huang, Xixin Zhao, Yaohua Zhou, Jiayu Song, Jiayi Zhang, Jun Ma, Haiyue Zhu, Xiaocong Li

2026-06-23机器人生成模型学习理论

针对多任务、长时程机器人模仿学习中单体扩散策略易发生梯度冲突、MoE 路由坍塌且专家参数膨胀的问题,CoRDE 用冻结概念编码器提供语义先验,经可学习软映射引导变分责任分配,并在共享冻结骨干上用 LoRA 构建轻量专家池。论文给出混合 score 误差界,实验称其能减少路由坍塌,形成更语义一致的专家分工,并提升动作质量与增量学习效率。

Predictive Gaze Is Preserved but Reorganized toward Monitoring during Robot-Mediated Manipulation Figure 1
2026-06-23cs.RO

Predictive Gaze Is Preserved but Reorganized toward Monitoring during Robot-Mediated Manipulation

Manuela Uliano, Silvia Fattorini, Marco Controzzi

The BioRobotics Institute, Scuola Superiore Sant’Anna, Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna, together with mismatches in controllable degrees of freedom between human and robotic limbs, are expected to alter how

2026-06-23机器人生成模型

本文关注遥操作中身体耦合与触觉/本体反馈被打断后,人类预测性注视是否仍能用于动作意图推断。作者将自然抓取范式迁移到机器人手臂远程操作,并按任务阶段分析眼动。结果显示,注视仍主要指向目标、抓取点等任务相关位置,保留预测作用;但相比自然操作,更多注意转向机械手和被操纵物体,说明视觉策略从单纯预判重组为预判与在线监控并存。

SurGE: Surrogate Gradient-guided Evolution for Co-design of Legged Robots with Parallel Elasticity Figure 1
2026-06-23cs.RO

SurGE: Surrogate Gradient-guided Evolution for Co-design of Legged Robots with Parallel Elasticity

Yulun Zhuang, Yue Qin, Justin Lu, Zelin Shen, Yichen Wang, Sicheng He, Yanran Ding

Authors are with the Department of Robotics, University of Michigan, Ann Arbor, MI 48109, USA., Sicheng He is with the Department of Mechanical and Aerospace Engineering, University of Tennessee, Knoxville, TN 37996, USA.

2026-06-23机器人优化算法

这篇论文针对腿式机器人并联弹性元件协同设计中接触与机构啮合不可微、CMA-ES 评估成本高且跨随机种子不稳定的问题,提出用可微 Kino-SRB 模型和设计感知策略生成替代梯度,再以均值平移注入 CMA-ES。结果显示,在单腿跳跃机器人 4 维设计空间中,SurGE 将跨种子标准差降至约 1/6、群体更集中,并在硬件二维子空间把目标值降低 37.65%,但真实增益仍依赖替代模型梯度与仿真目标的一致性。

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion Figure 1
2026-06-23cs.RO

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

University of Illinois Urbana-Champaign 2 University of Maryland College Park

2026-06-23生成模型规划控制

面向狭窄孔洞穿越任务,论文指出刚软混合机械臂若只按末端或分段规划,容易忽略环境接触下的主干形状可行性与刚软耦合。THREAD将整条运动链表示为连续主干轨迹,用环境感知扩散模型生成物理可行的多模态候选,并在推理时加入碰撞引导与少量残差RL修正。仿真平均成功率达92.4%,末端误差0.015m,碰撞显著少于基线,并展示了无需重训扩散规划器的跨硬件真实迁移。

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation Figure 1
2026-06-23cs.RO

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

Yashom Dighe, Karthik Dantu

University at Buffalo

2026-06-23视觉感知

这篇论文针对灵巧手内重定向中点云目标难以直接用于控制的问题:原始点集受采样、遮挡和无序性影响,当前—目标差异不等同于旋转误差。核心做法是用度量学习训练旋转感知点云编码器,使潜空间距离对齐 SO(3) 测地误差,再供 PPO 策略比较当前与目标点云。实验表明该接口在仿真中接近特权状态和蒸馏基线,且不依赖测试时位姿估计、配准、稠密流或教师动作;但真实机器人迁移文中未充分说明。

A Novel Bio-Inspired Fish Robot with Tunable Stiffness via Particle Jamming Figure 1
2026-06-23cs.RO

A Novel Bio-Inspired Fish Robot with Tunable Stiffness via Particle Jamming

Jack Stonecipher, Allen Gao, Wei Wang

2026-06-23机器人

这篇论文针对现有机器鱼难以像真鱼一样在不同速度下主动调节全身柔顺性的问题,设计了基于颗粒阻塞的蓝鳃鱼仿生自由游动机器人,可在几乎不改变外形和体积的情况下快速调节躯干刚度。实验显示,0 到 –40 kPa 真空压力带来约 54% 抗弯刚度变化,并显著改变身体曲率;在 1–1.5 Hz 时软体更快且 CoT 更低,而 2.5–3 Hz 时高刚度更有利,说明频率匹配的主动刚度调节对高速高效游动很关键。

RoverDevKit: An open, physics-grounded tradespace toolkit for conceptual design of lunar micro-rovers Figure 1
2026-06-23cs.RO

RoverDevKit: An open, physics-grounded tradespace toolkit for conceptual design of lunar micro-rovers

Jon Reifschneider

2026-06-23机器人

面向50 kg以下月球微型车早期设计中机动、功率、热控与质量强耦合且工具封闭/慢的问题,本文发布RoverDevKit,将地面力学、质量、功耗、热生存和巡航模型耦合为约30 ms评估器并用于NSGA-II权衡搜索。结果显示主导约束随任务场景变化:极区受储能限制,高地受松散月壤坡面牵引限制,月海和坑缘受航程限制;在平滑月壤目标下四轮刚性布局整体优于六轮,六轮主要在加入越障需求后进入帕累托集。

Programmable magnetic soft robots with controlled locomotion and directional liquid cargo release Figure 1
2026-06-23cs.RO

Programmable magnetic soft robots with controlled locomotion and directional liquid cargo release

Youyi Zhou, Zoe Evelyn Gureno, Meghna Majumder, Yunus Alapan

with the Bio-integrated Robotics Lab at Mechanical Engineering, Department, University of Wisconsin - Madison, Madison, WI 53706 USA, Nevertheless, the currently available magnetic soft robotic, Y. Alapan is with the Biomedical Engineering Department, University of, Y. Alapan is with the Carbone Cancer Center, University of Wisconsin -

2026-06-23机器人规划控制

面向胃肠道靶向给药中软机器人难以在保持运动/变形能力的同时定向释放液体载荷的问题,本文通过优化空间磁化剖面,将翻转定向、低场爬行和高场破蜡释放解耦,并用微孔弹性体储液、微晶蜡封口。实验显示材料孔隙率约49.3%、低pH下2小时无明显泄漏,约8.37 mT触发释放,0–4 mT可爬行且不泄漏,支持向组织界面定向释放的可行性。

Shape-programmable Magnetic Soft Membranes for Mechanically Active Microchannels Figure 1
2026-06-23cs.RO

Shape-programmable Magnetic Soft Membranes for Mechanically Active Microchannels

Direnc Akyildiz, Fatih Kocabas, Xiangyi Tan, Yunus Alapan

which allows it to be controllably deformed in the form of a, interfaces in next-generation microfluidic and lab-on-chip, shape-morphing material systems is microfluidic and lab-on-, integrated Robotics Lab at Mechanical Engineering Department, University, X. Tan is with the Department of Electronic and Electrical Engineering, University College London, London, WC1E 7JE UK., Y. Alapan is with the Biomedical Engineering Department, University of, Y. Alapan is with the Carbone Cancer Center, University of Wisconsin -, mm x 6 mm was then removed from the center of the PDMS, and then cured. A defined region at the center is then cut and excised, filled

2026-06-23机器人

微流控通道在低雷诺数层流下混合和界面调控受限,传统气动膜又增加结构复杂度。本文将含 NdFeB 的 PDMS 磁软膜嵌入通道壁,并通过折叠模板磁化写入相反磁化区,使外磁场下产生可逆正弦形变。实验显示 75 wt% 磁颗粒带来更大曲率,闭合通道内峰值位移约 146±22.48 µm;2 Hz、120 mT 驱动下染料混合绿色像素占比由 6.0% 升至 93.1%。

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models Figure 1
2026-06-23cs.RO

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner

University of Oxford

2026-06-23强化学习模仿学习

这篇论文针对机器人模仿学习依赖昂贵目标机器人示教、难以利用异构无动作数据的问题,提出用预测环境转移来“接地”动作表示:GLAM 将逆动力学推断和目标动作编码器对齐到共享潜在动作空间,再为行为克隆重标注多源轨迹。实验覆盖真实与仿真五个操作任务,在同等稀缺目标数据下较 BC 和既有潜在动作方法平均成功率提升约 48%,但对共享视角、场景和任务语义仍有依赖。

Online Learning of Robust Legged Odometry with Minimal Exteroceptive Supervision Figure 1
2026-06-23cs.RO

Online Learning of Robust Legged Odometry with Minimal Exteroceptive Supervision

Abhijeet M. Kulkarni, Yuze Du, Guoquan Huang

University of Delaware, IMUs and joint sensors, to achieve dynamic locomotion. These platforms are now readily available, platforms, supervised minimally by exteroceptive motion whenever it is available and falling back, exteroceptive velocity (if available) through an adaptive measurement selection strategy.

2026-06-23视觉感知安全鲁棒

针对腿式机器人里程计依赖外感知且需要复杂标定、在低光或弱特征环境易失效的问题,本文提出用外感知速度作为少量在线监督,训练基于 ESN 特征与 MLP 读出的本体速度模型,并由低秩 EKF 表征权重不确定性,再通过 InEKF 在外感知与学习本体速度间自适应切换。实验在 Spot 和 Vision 60 上验证,显示在感知退化场景下相比单一本体或外感知基线更稳健。

Energy-based Compositional Diffusion Planning Figure 1
2026-06-23cs.RO

Energy-based Compositional Diffusion Planning

Tao Sun, Utkarsh Aashu Mishra, Jiaxin Lu, Danfei Xu, Iro Armeni

2026-06-23生成模型规划控制

针对长时程机器人任务中训练数据多为短片段、现有扩散规划依赖启发式拼接而易产生全局不一致的问题,论文指出拼接更新通常是非保守场,不能对应有效轨迹密度;提出 ECD 将局部桥接势能相加形成全局能量,并补入边界反作用项,以线性复杂度近似推断。在 OGBench 拼接任务上,ECD 取得领先成功率,同时速度接近启发式拼接方法。

VQActFlow: Vector-Quantized Action Mode Steering for Multi-Task Robot Manipulation Figure 1
2026-06-23cs.RO

VQActFlow: Vector-Quantized Action Mode Steering for Multi-Task Robot Manipulation

Zhigen Zhao, Mark Leggiero, Yipu Chen, Haoran Liu, Yifan Wu, Huishu Xue, Sirui Zhan, Ye Zhao

Institute for Robotics and Intelligent Machines (IRIM), Georgia Institute of Technology, Atlanta, GA 30332

2026-06-23机器人生成模型

本文针对多任务机器人操作中同一视觉场景可对应不同语言指令和动作模式、连续生成策略易选错模式的问题,提出 VQActFlow:先用 VQ-VAE 将动作片段离散为代码,再用变分流匹配在生成过程中持续维护代码偏好,并让 CFG 与对比训练的 codebook critic 直接引导模式选择。实验显示其在 LIBERO-Goal、LIBERO-90 及 G1 人形和双臂硬件任务上优于连续流匹配和离散策略基线。

Boundary-by-Mask: Few-Shot Instance Segmentation with Mask-Conditioned Boundary Learning for Texture-Poor Industrial Parts Figure 1
2026-06-23cs.CV

Boundary-by-Mask: Few-Shot Instance Segmentation with Mask-Conditioned Boundary Learning for Texture-Poor Industrial Parts

Yutaka Yoshinaga, Naoya Chiba, Koichi Hashimoto

Yutaka Yoshinaga is with the Graduate School of Information Sciences, Tohoku University, Sendai, Japan.

2026-06-23视觉感知学习理论

面向工业零件少纹理、实例定义随任务变化的问题,论文提出 Boundary-by-Mask:不再匹配内部外观,而用少量 RGB-掩码样本在冻结基础编码器上训练浅层 MLP 预测 SDF 边界,再重建实例掩码;更换参考掩码即可切换整体/部件粒度。实验显示其在工业件和边界模糊食品上具备较好 few-shot 泛化、低纹理鲁棒性和目标可控性,但真实复杂产线场景仍文中未充分说明。

Conflict-Aware Switching for CBF-CLF-Based Multi-Goal Navigation Figure 1
2026-06-23cs.RO

Conflict-Aware Switching for CBF-CLF-Based Multi-Goal Navigation

Rohan Walia, Kevin Leahy

R. Walia and K. Leahy are with the Robotics Engineering Department, Worcester Polytechnic Institute, Worcester, MA 01609, USA.

2026-06-23机器人

本文针对多目标安全导航中 CBF-CLF-QP 的目标约束与安全约束冲突会造成减速、死锁和超时的问题,提出一种基于冲突程度启发式的无优先级目标切换策略,在高冲突时转向更少受限的待完成目标,而非昂贵预测或保守避障。实验覆盖静态障碍、巡逻障碍和多智能体蒙特卡洛场景,相比固定顺序访问降低完成时间与超时率,并保持安全约束。

Robot Critics that Sweat the Small Stuff Figure 1
2026-06-23cs.RO

Robot Critics that Sweat the Small Stuff

Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan, Pavel Tokmakov, Richard Zemel, Carl Vondrick

Columbia University, Toyota Research Institute

2026-06-23机器人

这篇论文针对机器人闭环操作中“差一点也会失败”的细粒度判断难题,指出通用 VLM 和已有进度估计方法难以区分毫米级对齐、接触等成败差异。作者用同一策略产生的成功/失败 rollout 构造配对进度监督,微调 VLM 作为 critic,并结合动作条件视频模型预测候选动作后果,在测试时重排执行。实验显示 critic 准确率超过 90%,真实任务成功率平均提升 11%,仿真提升 5.9%,但整体仍受视频预测质量与推理延迟限制。

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation Figure 1
2026-06-23cs.RO

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation

Nan Ming, Yeqiang Qian, Chunxiang Wang, Ming Yang

School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Key Laboratory of System Control and Information

2026-06-23视觉感知三维

LOGOS针对激光雷达在路缘、碎石、坑洼等微小正负障碍上易与路面起伏混淆、且遮挡或边缘稀疏扫描会使网格/参数化路面模型失效的问题,提出无需反向传播的LiDAR-only高斯高程 splatting:用自由空间感知初始化剪除非路面高斯,并以法向感知高程融合估计逐点有符号距离。实验覆盖城市与矿区异构点云,结果显示其在退化区域和越野场景显著优于现有方法,同时保持实时性。

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving Figure 1
2026-06-23cs.RO

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving

Yueyuan Li, Yifei Xiao, Mingyang Jiang, Xiang Zuo, Songan Zhang, Ming Yang

2026-06-23强化学习

这篇论文关注端到端自动驾驶中感知模型更新后,固定下游策略因潜表示漂移而失效的维护难题。作者将其形式化为模型 stitching 问题,核心洞察是不同感知模型在相同监督下仍保留可对齐的任务结构,可用轻量线性或卷积映射修复潜空间接口而非重训策略。实验覆盖初始化、传感器和域迁移变化;在 nuScenes 到 CARLA 的困难设置中,卷积 stitching 保留超过 91% 无漂移驾驶分数,并将适配时间从 22.18 小时降至 0.91 小时。

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling Figure 1
2026-06-23cs.RO

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

Tongji University, Shanghai Innovation Institute, Shanghai Jiao Tong University

2026-06-23视觉语言视觉感知强化学习

针对机器人操作中固定双视角易被遮挡、加相机又依赖部署一致性的问题,UniviewVLA用世界模型从标准agent/wrist视角生成多视角未来表征,并通过运动信息token压缩与基于动作熵的视角选择降低推理开销。实验显示其在LIBERO、CALVIN等无遮挡基准基本保持性能,在六个遮挡仿真任务上成功率由40.0%升至73.3%,真实机器人平均提升33.4个百分点。

Decoupling the Declarative from the Procedural in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

University of Edinburgh, Samsung AI Center - Cambridge, UK

2026-06-23视觉语言视觉感知

这篇论文针对现有VLA在少量示教后容易把“技能”和“对象”绑定、难以零样本迁移的问题,提出w2VLA,将目标位置等声明式知识与执行动作的程序式知识解耦,用冻结VLM/VFM特征分阶段调制机器人状态。实验显示其在已见任务上保持与π0.5、OTTER相近表现,同时能把已学技能迁移到不同乃至未见对象,基线则明显崩溃。

ASCII Art Turns LLMs into VLA Controllers Figure 1
2026-06-23cs.RO

ASCII Art Turns LLMs into VLA Controllers

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

2026-06-23规划控制

这篇论文针对传统 VLA 依赖多模态骨干、机器人数据和算力成本高的问题,提出把视觉观测渲染成 ASCII 文本,让纯文本 LLM 直接基于指令和场景字符图输出受约束动作。其洞察是用可读、易调试的文本化视觉桥接现有 LLM 训练栈,并用规划器示教与 DAgger 改进策略。实验显示在 2D 操作仿真和真实 7 自由度机械臂上能识别目标、规划可行动作并判断不可达场景,部分 2D 设置中文本模型甚至优于对应视觉模型。

Manipulider: A Multi-Engine Buoyancy-Controlled Robot for Thrusterless Underwater Gliding and Manipulation Figure 1
2026-06-23cs.RO

Manipulider: A Multi-Engine Buoyancy-Controlled Robot for Thrusterless Underwater Gliding and Manipulation

Yitao Jiang, Yewei Huang, Weizhi Cao, Mingi Jeong, Alberto Quattrini Li, Luyang Zhao, Muhao Chen, Devin Balkcom

2026-06-23机器人强化学习规划控制

面向水下机器人续航受限、螺旋桨易扰动和缠绕、传统浮力滑翔器姿态控制不足的问题,Manipulider用四个注射器式浮力发动机同时调节净浮力与浮心,实现无推进器滑翔、静态大角度悬停和基于姿态的抓取模块操作。实验显示每发动机40 mL可控排水、总浮力约160 g,最大静稳倾角约64.6°/61.8°,并完成升降、倾角调节和搬运演示。

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding Figure 1
2026-06-23cs.CV

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding

David Pascual-Hernández, Roberto Calvo-Palomino, Inmaculada Mora-Jiménez, Jose María Cañas-Plaza

2026-06-23视觉感知

面向非结构化户外机器人导航中细粒度地形与障碍类别相近、长尾且跨域变化大的感知难题,本文在 GOOSE 挑战中从 SegFormer 转向基于查询的 Mask2Former,并系统考察更大训练裁剪带来的空间上下文作用。结果显示 Mask2Former 明显优于基线,增大 crop 进一步提升细粒度判别,结合 TTA 在测试集取得 69.6% mIoU_comp、排名第 5。

Temporal logics and formal synthesis for robot planning and control Figure 1
2026-06-23cs.RO

Temporal logics and formal synthesis for robot planning and control

Jana Tumova, Joris Verhagen, Matti Vahs

KTH Royal Institute of Technology, tions are always met. Scalability is another key concern, as the computational

2026-06-23机器人规划控制

面向机器人走向不确定、动态真实环境后的可靠性需求,本文系统梳理如何用线性时序逻辑和信号时序逻辑精确定义任务、安全与时空约束,并将其转化为带可证明保证的规划与控制合成问题。核心洞察是把离散自动机/博弈、采样规划、轨迹优化和控制证书放在统一的形式化合成框架下比较其适用边界。主要结果是给出一份面向机器人规划控制的高质量综述,强调实际部署中保证强度受模型保真度、计算规模和不确定性处理共同限制。

Robot Self-Improvement via Human-Video Dynamics Models Figure 1
2026-06-23cs.RO

Robot Self-Improvement via Human-Video Dynamics Models

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger

Technical University of Munich

2026-06-23机器人视觉感知

这篇论文针对机器人部署后仍会遇到具身差异和失败状态、而人工纠错难以规模化的问题,提出从人类视频中学习与具身无关的动作、动力学和价值表示,并用DGAC把失败状态转化为可排序的纠正动作监督。实机七项操作任务中,方法将平均成功率从40%提升到81%,在π0.5骨干上也由62.7%提升到88.0%,显示人类视频先验可支持跨平台自改进。

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation Figure 1
2026-06-23cs.RO

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

Department of Electrical and Computer Engineering, Laboratory for Computational Sensing and Robotics, Johns Hopkins University, DEVCOM Army Research Laboratory

2026-06-23机器人规划控制

BIT-Nav针对VLM导航长期依赖稀疏历史帧、难以保留转向与位移等运动结构的问题,引入受海马路径积分启发的GRU轨迹记忆,用对比学习编码动作和相对位姿,并以单个记忆token接入VLM。实验显示其在累计航向估计达0.83准确率,并以约22倍更低token成本匹配历史帧基线的动作频率推断;但标准VLN成功率、SPL等端到端增益文中仍未充分说明。

Overcoming Imperfect Kinematics in Surgical Robotics Through Sim-to-Real Visuomotor Learning Figure 1
2026-06-23cs.RO

Overcoming Imperfect Kinematics in Surgical Robotics Through Sim-to-Real Visuomotor Learning

Zhaoxuan Yan, Kaizhong Deng, Zhaoyang Jacopo Hu, George P. Mylonas, Daniel S. Elson

2026-06-23机器人

面向手术机器人自动化中因线缆传动、迟滞和关节间隙导致的运动学误差,论文提出教师-学生式视觉运动低层控制器:教师在理想仿真中用特权状态训练,学生通过 DAgger 融合不可靠本体感知与外部2D视觉关键点来闭环补偿误差。方法已迁移到真实 dVRK,并在轨迹跟踪实验中表现出对工作空间误差和相机位姿变化的鲁棒性;但仅在单一示例任务上充分评估,泛化到更复杂手术流程仍文中未充分说明。

Long-Distance Real-World Navigation of the Legged-Wheeled Robot Go2-W Using Deep Reinforcement Learning Figure 1
2026-06-23cs.RO

Long-Distance Real-World Navigation of the Legged-Wheeled Robot Go2-W Using Deep Reinforcement Learning

Takaaki Matsuzawa, Kiyoshi Irie, Tomoaki Yoshida, Taro Suzuki, Yoshitaka Hara, Masahiro Tomono

2026-06-23机器人强化学习

面向腿轮机器人真实环境长距离自主导航仍缺少完整验证的问题,论文将四足机器人的本体感知 DRL 运动策略扩展到 16 自由度 Go2-W,并把低层运动控制、路径跟随与常规定位规划集成成户外导航系统。关键洞察是轮式行进会让髋关节持续受载并过热,策略通过周期性抬脚与负载分散抑制热集中。系统在 Tsukuba Challenge 2025 完成约 2.8 公里含人行道、公园和楼梯的自主行进,未因过热停止。

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction Figure 1
2026-06-23cs.CV

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction

Guangcheng Chen, Lihuang Fang, Huaqi Tao, Yicheng He, Li He, Hong Zhang

2026-06-23机器人

本文针对室内单目占据预测中混合高斯/超二次曲面原语常滞留在空区域、造成表示和计算浪费的问题,指出根因在于体素分类损失只能提供局部监督,难以驱动远距离原语重定位。其核心是将占据预测改写为体素分布估计,用前馈最大似然训练混合模型,并以归一化原语体积作为权重约束。实验显示,FLM-Occ在Occ-ScanNet上仅用32个超二次曲面、约为既有SOTA原语数的2.7%,仍取得更高精度并快3.7倍。

NAC: Neural Action Codec for Vision-Language-Action Models Figure 1
2026-06-23cs.RO

NAC: Neural Action Codec for Vision-Language-Action Models

Ahad Jawaid, Yu Xiang

The University of Texas at Dallas

2026-06-23视觉语言视觉感知

这篇论文针对 VLA 中连续机器人动作离散化面临的序列过长、压缩失真与延迟权衡,提出将神经音频 codec 迁移为动作 tokenizer:把短动作轨迹视作多通道 1D 信号,用多尺度 RVQGAN、offset codebook 与 Vocos/ISTFT 解码,并指出 mel 频谱损失不适合运动学信号,应改用时域和非 mel 频谱重建。实验在 LIBERO-10、RoboMimic 和真实操作任务上显示,NAC 在相近或更高压缩率下较 binning、FAST 和既有 VQ tokenizer 有更低重建误差与更高成功率。

Mind the Noise: Sensitivity of Transformer-based Interaction-Aware Trajectory Prediction Models to Noisy Data Figure 1
2026-06-23cs.AI

Mind the Noise: Sensitivity of Transformer-based Interaction-Aware Trajectory Prediction Models to Noisy Data

Shahab Salehi, Luca Lusvarghi, Miguel Sepulcre, Javier Gozalvez

IEEE copyright. This is an author-created postprint version. The final publication is available at https://ieeexplore.ieee.org/xxxx . S. Salehi, Networked Systems Lab, Universidad Miguel Hernandez de Elche, Elche, Spain, exploding gradient problems that can limit their scalability

2026-06-23规划控制

这篇论文关注自动驾驶轨迹预测在真实感知与V2X通信噪声下的可靠性问题,指出现有Transformer交互感知模型多在离线去噪数据集上训练评测,可能高估部署性能。作者以DeMo++和Argoverse 2为对象注入现实噪声,发现预测精度随噪声快速恶化:轻微噪声下下降约1.3倍,高现实噪声下可达3.9倍,提示需构建含不确定性的评测数据与降噪机制。

RogueRover: Autonomous Rogue Device Localization for Incident Response Figure 1
2026-06-23cs.RO

RogueRover: Autonomous Rogue Device Localization for Incident Response

Priyanka Prakash Surve, Asaf Shabtai, Yuval Elovici

2026-06-23机器人

这篇论文针对企业/工业场景中“能检测到 rogue AP、却难以快速找到实物位置”的应急响应瓶颈,提出用单台四足机器人在已建图环境中自主巡逻,仅依赖普通 802.11 RSSI 采样和离线定位估计,无需预部署传感器、RF 指纹或场地校准。实验在 800 平米室内、6 个设备和 11 次巡逻中验证,单次巡逻中位误差 1.62 米,多次聚合后 5/6 设备在 1 米内;结果还显示覆盖充分时简单加权质心不弱于路径损耗模型。

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM Figure 1
2026-06-23cs.RO

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM

Edward Beng Wai Tan, Siew-Kei Lam, Dongshuo Zhang

College of Computing and Data Science, Nanyang Technological University, Singapore. ∗ Corresponding author.

2026-06-23视觉感知三维安全鲁棒

这篇论文针对实时 3DGS-SLAM 中轻量跟踪的互补失效:特征法怕低纹理,ICP 在几何退化场景中病态。核心做法是在 G-ICP 跟踪中用 Hessian 谱分析识别不可观方向,并结合 3D Gaussian 协方差估计平面退化程度,只在退化子空间注入稀疏特征先验。TUM RGB-D 实验显示其可达 40.14 FPS,并在无纹理和结构退化序列中保持更稳定轨迹。

A Human-Inspired Thumb-Index Robotic Hand with Strain Gauges Embedded in Soft Joints Figure 1
2026-06-23cs.RO

A Human-Inspired Thumb-Index Robotic Hand with Strain Gauges Embedded in Soft Joints

Jonas Papenbrock, Shubhan Patni, Tomaso Lisini Baldi, Michele Guerri, Elia Landi, Ada Fort, Matej Hoffmann

2026-06-23机器人

针对低成本柔顺机械手难以同时获得安全自适应抓取与可靠本体感知的问题,本文提出双指 STIR Hand:在欠驱动腱传动拇指-食指结构的硅胶软关节中嵌入靠近中性轴的箔式应变片,并结合电机电流补偿。实验用 20 类物体数据表明,关节传感显著提升对尺寸、形状和材料刚度的区分能力,无需指尖触觉或外部视觉即可实现较高准确率分类。

Ultra-Fusion: A Resilient Tightly-Coupled Multi-Sensor Fusion SLAM Framework under Sensor Degradation and Spatiotemporal Perturbation for Intelligent Transportation Systems Figure 1
2026-06-23cs.RO

Ultra-Fusion: A Resilient Tightly-Coupled Multi-Sensor Fusion SLAM Framework under Sensor Degradation and Spatiotemporal Perturbation for Intelligent Transportation Systems

Yihong Tian, Junjie Zhang, Liuyang Li, Deteng Zhang, Yunfei Zuo, Jie Yin

Sichuan University, 4 Northwestern Polytechnical University, 5 Shanghai Jiao Tong University

2026-06-23机器人

面向车、足式机器人和 UAV 在隧道、城市峡谷等场景中因光照差、LiDAR 退化、轮滑、GNSS 中断及标定漂移导致定位失效的问题,Ultra-Fusion 将异步多传感器观测统一为滑窗因子,支持 WIO/VIO/LIO/LVIO,并用可观测性初始化、逐因子可靠性调度和在线时空标定提升鲁棒性。实验在 M3DGR 等多基准和 60 余系统对比中显示,其在长时、高速、退化和扰动条件下保持有竞争力的定位精度。

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages Figure 1
2026-06-23cs.RO

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

Juntong Peng, Yaobin Chen, and Ziran Wang are with the College of Engineering, Purdue University, West Lafayette, IN, USA. Corresponding author: Juntong Peng

2026-06-23机器人

这篇论文针对自动驾驶车队远程接管中原始传感器回传带宽高、调度员注意力有限的问题,提出云端 FleetAgent,用紧凑的向量化 V2N 消息而非图像流来评估车辆规划,并通过 VecFormer 将地图、目标和轨迹向量转为受限长度的 MLLM 输入,同时给出解释和介入紧急度。实验在 VecEval 上显示,其上行负载较原始图像最高降低 625 倍,KV-cache 较文本描述降低 16.54 倍,Lingo-Judge 提升 16.8%,介入失败率降低 19.9%,但验证仍主要是离线评测。

A UAV-Mounted Sensor Network for Close-Range Inspection of Wind Turbine Rotor Blades Figure 1
2026-06-23cs.RO

A UAV-Mounted Sensor Network for Close-Range Inspection of Wind Turbine Rotor Blades

Jost Wittmann, Ahmed Abdullahi Hassan, Nils Kömpe, Andreas Nüchter

2026-06-23机器人

面向海上风机叶片近距离巡检中人工分类缺陷困难、无人机传感器分辨率与同步受限的问题,论文设计了一套挂载于多旋翼的多模态传感网络,将RGB相机、热红外相机与自研激光散斑双目3D扫描器统一标定到同一坐标系,以兼顾大视场、平台运动和毫米级表面测量需求。实验仍处实验室阶段,结果主要证明了多传感器同步采集和初步点云重建可行,尚未给出真实飞行巡检或缺陷分类增益。

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world Figure 1
2026-06-23cs.RO

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

Steeven Janny, Leonid Antsfeld, Christian Wolf

2026-06-23机器人强化学习

论文针对真实机器人导航中视觉编码器究竟贡献什么的问题,系统比较预训练 ViT、MAE/DINO 系列及多教师蒸馏编码器。核心洞察是导航策略并不需要完整高维特征:将每个图像 patch 压缩为一个标量仍可保持性能,并自然形成可解释的空间 affordance 图。真实建筑中 966 次、24km 快速 RGB-only 导航实验显示,预训练与现实运动建模显著优于从动作端到端学感知,Lidar 特权预训练再微调也带来收益。

Discrete Geometric Modeling and Extended State Estimation of Continuum Robots Figure 1
2026-06-23eess.SY

Discrete Geometric Modeling and Extended State Estimation of Continuum Robots

Maximilian Herrmann, Leander Pfeiffer, Paul Kotyczka

∗Technical University of Munich, TUM School of Engineering and, Design, Munich Institute of Robotics and Machine Intelligence, centerline, center line. The orientation of a body-fixed orthonormal

2026-06-23机器人

针对连续体/腱驱动机器人动力学模型高维、非线性且数值刚性、难以实时用于控制的问题,论文把几何精确 Cosserat 梁写成最小应变变量,并在 Lie 群变分积分框架下离散化,同时纳入任意腱路径、外部质量和扩展卡尔曼扰动观测器。实验机器人结果显示,该模型在较粗时空离散下仍能保持较高精度和计算效率,并可同时估计状态、模型不确定性与外扰。

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation Figure 1
2026-06-23cs.RO

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation

Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip

2026-06-23机器人

这篇论文针对长时程、接触丰富操作中的部分可观测性:单帧视觉难以反映此前尝试、接触和任务进度。作者提出 CAMP,用机器人自身动作历史作为自监督信号,通过 DCT 压缩训练循环记忆模块,并将其作为扩散策略条件。实验覆盖四个真实机器人场景和两个新仿真基准,相比视觉运动和 VLA 基线取得明显成功率提升。

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving Figure 1
2026-06-23cs.RO

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving

Juntong Peng, Juanwu Lu, Yupeng Zhou, Can Cui, Yaobin Chen, Ziran Wang

The authors are with the College of Engineering, Purdue University, West Lafayette, IN 47907, USA.

2026-06-23生成模型

针对现有端到端协同驾驶依赖 BEV/特征融合导致带宽高、标准化差且需要大量协同标注的问题,OmniV2X 将车端、路侧等多源观测建模为独立条件序列,用生成式轨迹规划器通过交叉注意力直接生成未来路点,并可从单车数据预训练迁移到 V2X 场景。在 DAIR-V2X-Seq 上,其以少于 10% 微调数据和少于 1% 通信带宽超过既有基线,同时报告 35ms 延迟和 550MB 推理显存。

DPLAN: Minimal Connectivity to Floorplan Generation Figure 1
2026-06-23cs.CG

DPLAN: Minimal Connectivity to Floorplan Generation

Rohit Lohani, Krishnendra Shekhawat

BITS Pilani, Department of Mathematics, Pilani Campus, India

2026-06-23机器人

针对建筑平面生成中用户往往只给出必要门连接与禁邻约束、难以保证可实现布局的问题,DPLAN将房间关系转为平面图,通过连通性/双连通增强、三角剖分与分离三角处理,分别生成矩形和正交平面图。结果是一个Python交互原型,可在矩形边界内输出多种无重叠、满足约束的无尺寸布局;但文中主要展示算法流程,实际建筑尺度、交通流线和非矩形地块仍未充分说明。

Pose-Agnostic Robotic Functional Grasping via Observation-Action Canonicalization Figure 1
2026-06-23cs.RO

Pose-Agnostic Robotic Functional Grasping via Observation-Action Canonicalization

Le Qiu, Cole Harrison, Jiankai Sun, Yao Liu, Suning Huang, Qianzhong Chen, Yang You, Marco Pavone

Tsinghua University, Stanford University, University of California, Berkeley

2026-06-23机器人三维

这篇论文针对杯柄等功能性抓取中物体几何、朝向和正反放置变化导致闭环策略难以泛化的问题,提出 AnyMug:将顶视深度图和末端执行器动作共同规范化到杯子中心坐标系,使策略复用同一抓取行为,并用杯柄感知奖励、位姿课程和域随机化训练。结果显示其在未见杯子的仿真正放/倒放场景成功率超过 93%,零样本迁移到 Franka Panda 实物 5 个杯子达到 80%。

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning Figure 1
2026-06-23cs.RO

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

Seoul National University

2026-06-23机器人强化学习

这篇论文针对潜在动作预训练中“变化幅度”和“变化模式”被混在同一编码里的问题,提出 PoLAR:用时间间隔作为弱监督,在双曲空间中让半径表示转移幅度、方向保留动作模式。该结构可用于连续或离散潜在动作,并在仿真、真实机器人及大规模预训练设置中提升下游策略表现,优于常规潜在动作基线和部分强 VLA。

Horizon Adaptive Offline Policy Learning via Value Stitching Figure 1
2026-06-23cs.LG

Horizon Adaptive Offline Policy Learning via Value Stitching

Kexin Zheng, Xianyuan Zhan, Xintao Yan

The University of Hong Kong, Tsinghua University

2026-06-23强化学习

本文针对离线强化学习中长时域价值估计易累积偏差、固定 n-step 或 Q-chunking 又难适配多阶段任务的问题,提出 VAST:用依赖未来状态与时域长度的 G 函数直接监督可达子目标回报,并由 stitching policy 自适应选择子目标和备份长度来拼接价值信号。实验在 50 个 OGBench 任务上优于或持平固定时域与生成式价值基线,优势主要体现在复杂长时域任务。

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion Figure 1
2026-06-23cs.CV

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

2026-06-23视觉语言生成模型

该文针对现有多模态人体运动生成常把不同体型视为同一“平均人”的问题,提出 Odoriko:在统一扩散框架中用性别与 SMPL 形状参数条件化文本、音乐、视频/2D关键点输入,并通过 Shape-Aware Motion Transformer 融合形状与模态特征;缺少显式形状时还可联合估计形态。实验显示其在文生动作、音乐舞蹈和视频姿态估计上达到或超过专用模型,并提升形状一致性与可控性。

Factor-Aware Mixture-of-Experts with Pretrained Encoder for Combinatorial Generalization Figure 1
2026-06-23cs.RO

Factor-Aware Mixture-of-Experts with Pretrained Encoder for Combinatorial Generalization

Feihong Zhang, Guojian Zhan, Zeyu He, Yinuo Wang, Likun Wang, Tianze Zhu, Yao Lyu, Tao Zhang, Tinghao Yi, Wei You, Shengbo Eben Li

2026-06-23学习理论

这篇论文针对视觉机器人操作中扩散策略结合预训练视觉编码器后,仍难以应对光照、纹理、相机位姿等多因素组合变化的问题,提出 FAME:冻结预训练编码器,用按环境因素训练的轻量 adapter 作为专家,并由路由器进行稠密加权组合,以期把组合泛化的数据需求从指数式降到近线性。实验显示其在 Meta-World 上较扩散策略基线提升 34%,真实抓取放置任务泛化提升 35%。

How Should a Robot Configure Its Laser Scanner for Inspection? Figure 1
2026-06-23cs.RO

How Should a Robot Configure Its Laser Scanner for Inspection?

Zhiling Chen, David Gorsich, Matthew P. Castanier, Yang Zhang, Jiong Tang, Farhad Imani

2026-06-23机器人

这篇论文针对机器人激光检测中传感器参数常靠固定配置或人工调参、难适应物体几何/反光/光照和检测意图变化的问题,提出 SenseHD:把曝光、量程等配置视为离散“感知动作/工艺配方”,用视觉预扫描与任务指令构造超维表示,并通过关联记忆检索稳定配置而非回归精确数值。真实机器人平台实验显示,该方法相较规则、DNN 和多模态大模型基线在配置选择准确性、数据效率、低延迟和检测可靠性上更优。

MV-WAM: Manifold-Aware World Action Model with Value Augmentation Figure 1
2026-06-23cs.RO

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University., Beijing Innovation Center of Humanoid Robotics.

2026-06-23强化学习

本文针对世界动作模型在域内提升明显、但分布外操作泛化不足的问题,指出根因可能是视觉与动作处在异质流形上,联合优化会削弱动作鲁棒性。MV-WAM在MoTs框架中引入流形感知目标、跨模态因果掩码和进度价值调节,用视频预测来约束动作并在执行偏离时回滚;在RoboTwin随机场景达55.7%成功率、较最强基线高29.3%,真实双臂任务平均成功率77.5%。

ReFPO: Reflow Regularization for Flow Matching Policy Gradients Figure 1
2026-06-23cs.RO

ReFPO: Reflow Regularization for Flow Matching Policy Gradients

Ge Wang, Yibo Peng, Fan Feng, Shenhao Yan, Chengsi Yao, Jiahao Yang, Honghao Cai, Yiming Zhao, Xi Li, Jinke Ren, Shuguang Cui, Yatong Han, Zhen Li

2026-06-23生成模型强化学习优化算法

面向流匹配/扩散策略在机器人控制中采样步数多、在线RL训练不稳定的问题,ReFPO指出FPO梯度可视为带优势权重的隐式Reflow,并把已有CFM残差作为无权重Reflow正则加入目标,以拉直速度场、抑制代理比率尖峰且几乎不增计算。实验覆盖GridWorld、MuJoCo Playground和高维Humanoid,显示平均性能与离散化鲁棒性提升,且一步推理常接近或超过多步采样。

Membrane-based Acoustic Microrobots Figure 1
2026-06-23cs.RO

Membrane-based Acoustic Microrobots

Fatih Kocabas, Cemal Polat Avdar, Prithvi Venkatesh, Yunus Alapan

scalability of the proposed design architecture down to ~100 m., Bio- integrated Robotics Lab at Mechanical Engineering Department, University of Wisconsin - Madison, Madison, WI 53706 USA (608-265-, Y. Alapan is with the Biomedical Engineering Department, University, Y. Alapan is with Carbone Cancer Center, University of Wisconsin-, (Form 4, FormLabs) with a commercial resin (Gray v5, FormLabs). Post-printing, the molds were rinsed in isopropyl, Inc.) was prepared at a 10:1 (base:curing agent) weight ratio

2026-06-23机器人

针对传统声学微机器人依赖腔内微气泡而易因气体溶解导致共振漂移、推力衰减的问题,论文用薄柔性 PDMS 膜封闭微腔,以膜振动产生微流并阻断气体扩散。实验显示该结构可连续工作超过 24 小时,流速随驱动电压升高而增加;加入磁颗粒后可在约 2 mT 磁场下定向游动,并展示可缩小到约 100 μm。

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling Figure 1
2026-06-23cs.RO

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

School of Computer Science, The University of Sydney, Australia, Australian Centre For Robotics, The University of Sydney, Australia, College of Connected Computing, Vanderbilt University, TN, USA.

2026-06-23生成模型

这篇论文针对机器人在部署时才出现的安全约束与任务代价,提出把预训练扩散/flow 策略视为示范先验、把代价视为似然,直接采样约束后验。核心创新是将 Feynman-Kac 加权校正扩展到确定性 flow policy,无需重训即可统一引导 Diffusion Policy、GR00T-N1.6 和 π0.5。实验显示其在仿真与真实操作、非凸障碍和零样本任务中降低违约并提升成功率,但代价是约 1.25–2 倍推理变慢。

R2HandoverSim: A Simulation Framework and Benchmark for Robot-to-Human Object Handovers Figure 1
2026-06-23cs.RO

R2HandoverSim: A Simulation Framework and Benchmark for Robot-to-Human Object Handovers

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

Authors are with DANiLab, University of Leicester, Leicester, UK

2026-06-23机器人数据集/基准

针对机器人向人递物缺少统一评测、依赖难复现实验的问题,本文提出 R2HandoverSim,在 Isaac Sim 中用 UR5e、Robotiq 夹爪、MANO 手和多物体场景评测共享抓取姿态,并将规划可行性、可达性、稳定性、可供人抓取性与安全性拆成五项指标。对四个基线和 30 人真实实验的比较显示,仿真能识别真实成功率最高的方法,且细粒度指标比单一成功率更能解释用户感知质量。

Inductive Generalization for Robotic Manipulation Figure 1
2026-06-23cs.RO

Inductive Generalization for Robotic Manipulation

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

Carnegie Mellon University

2026-06-23机器人学习理论

这篇论文针对机器人操作中“泛化”常被简化为光照、物体等无结构分布偏移的问题,提出沿明确难度轴评估策略是否学到可外推的任务不变量,即归纳泛化。作者给出可复用的形式化评测协议,并在空间与组合复杂度递增的任务上测试现有 VLA 等策略;结果显示它们虽在分布内表现强,但在结构化 OOD 轴上系统失败,额外加入 MimicGen 分布内数据也未改善,说明该能力并非单靠数据覆盖或 scaling 自然获得。

Duet: Dual-Robot Understanding via Efficient Teaching Figure 1
2026-06-23cs.RO

Duet: Dual-Robot Understanding via Efficient Teaching

Yiqi Zhao, Ruohai Ge, Celina Shiyu Wang, Junjie Ye, Muchen Xu, Minhao Li, Sergey Zakharov, Basile Van Hoorick, Vitor Campagnolo Guizilini, Leonidas Guibas, Gaurav S. Sukhatme, Jyotirmoy V. Deshmukh, Yue Wang

University of Southern California, Toyota Research Institute, Stanford University

2026-06-23机器人

DUET针对异构双机器人协作中真实遥操作数据昂贵、难以规模化的问题,将双操作员VR遥操作与人-人协作轨迹采集结合,把两类数据投到共享姿态空间,并用ACT先在人类示范上预训练、再用少量机器人轨迹微调。在G1人形机器人与Vega1移动机械臂的四类接触协作任务中,方法相较仅用机器人数据的基线达到相当或更高成功率,同时人类数据采集平均比遥操作快5.4倍。

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City Figure 1
2026-06-23cs.CV

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

due to their high out-of-distribution nature. Our dataset is available at

2026-06-23视觉语言数据集/基准安全鲁棒

本文关注自动驾驶向复杂新城市部署时,VLM 作为认知骨干能否跨地域泛化。作者构建 Robusto-2,用利马与纽约行车视频、两地人类司机和多种 VLM 做全因子 VQA 对比,覆盖事实、评分、反事实和推理问题。结果显示,人类与 VLM 的回答差异明显且受问题类型调节,但利马/纽约地域本身未带来强差异,两地人类模式相近,提示当前 OOD 驾驶评测更需关注人机认知偏差而非简单地域标签。

Heterogeneous Policy Networks for Composite Robot Team Communication and Coordination Figure 1
2026-06-23cs.RO

Heterogeneous Policy Networks for Composite Robot Team Communication and Coordination

Esmaeil Seraj, Rohan Paleja, Luis Pimentel, Kin Man Lee, Zheyuan Wang, Daniel Martin, Matthew Sklar, John Zhang, Zahi Kakish, Matthew Gombolay

The published version of this work appears in IEEE Transactions on Robotics and is available at https://doi.org/10.1109/TRO.2024.3431829 ., Georgia Institute of Technology, Carnegie Mellon University, Sandia National Laboratories

2026-06-23机器人强化学习

这篇论文针对异构机器人团队中不同传感、动作与角色导致“通信语言”不一致、且规模扩展和带宽受限时协同困难的问题,提出扩展版 HetNet/MAH-PPO,用异构图注意力、FCN 与二值化消息学习可迁移、抗噪的通信策略。实验显示其在多个任务中较最强基线提升 5.84%–707.65%,同时将通信带宽需求降低约 200 倍。

Learning-Based Modeling of Soft Robots via Cosserat Rod Theory Figure 1
2026-06-23cs.RO

Learning-Based Modeling of Soft Robots via Cosserat Rod Theory

Mohammad Ali, Nithin Senthur Kumar, Eric J. Barth, Thomas Beckers

M. Ali and T. Beckers are with the Department of Computer Science, Vanderbilt University, Nashville, TN 37235, USA

2026-06-23机器人学习理论

软体杆状机器人难以用纯机理模型快速建模,纯数据模型又缺少物理一致性。本文将 Cosserat 杆的分布式端口哈密顿结构与高斯过程回归结合,直接从数据学习哈密顿量变分导数,从而保留能量耗散与不确定性估计。仿真中仅用单条轨迹训练即可泛化到六个未见初始角,平均 θ RMSE 为 0.222 rad、R² 为 0.919,且耗散能始终非负;但结果主要来自数值仿真,真实机器人验证文中未充分说明。

A Gated Graph Neural Network Approach to Fast-Convergent Dynamic Average Estimation Figure 1
2026-06-23cs.LG

A Gated Graph Neural Network Approach to Fast-Convergent Dynamic Average Estimation

Antonio Marino, Claudio Pacchierotti, Paolo Robuffo Giordano

2026-06-23机器人

面向多机器人等多智能体系统中仅靠邻居通信跟踪时变全局平均值的需求,论文用门控图神经网络把动态平均估计建模为分布式自回归过程,并在训练中加入收敛正则与编码—解码通信压缩。数值实验显示其相较传统模型驱动估计器收敛更快、误差更低,同时保持稳定性;但结果主要为仿真验证,真实机器人部署与泛化边界文中未充分说明。

Vesta: A Generalist Embodied Reasoning Model Figure 1
2026-06-23cs.RO

Vesta: A Generalist Embodied Reasoning Model

Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K.R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz

2026-06-23机器人

Vesta针对开放环境机器人需同时处理定位、空间推理、导航与长程规划,而多专家堆栈成本高且易级联出错的问题,提出以Qwen3-VL-8B为底座的通用具身规划器,通过偏向空间 grounding 的大规模SFT数据混合与多模态记忆机制统一四类能力。实验显示其在多类具身基准上平均超过单一SOTA基线20%以上、超过按类最优集成10%以上,真实机器人记忆任务成功率提升38.3%,但增益可能主要来自数据规模与配方。

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning Figure 1
2026-06-23cs.RO

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning

Qian Luo, Ruizhe Liu, Pei Zhou, Xunzhe Zhou, Yanchao Yang

2026-06-23模仿学习规划控制

本文关注模仿学习中示范轨迹“形状多样性”到底该有多少:过少会让策略脆弱,过多又会造成策略歧义。作者提出几何熵,通过目标坐标系对齐、尺度归一和谱统计,在训练前度量与任务位置无关的轨迹形状复杂度。仿真和真实接触操作实验显示,成功率与几何熵通常呈倒 U 型;随着数据、任务容易度或模型先验增强,最优多样性反而降低,VLA 模型上趋势近似单调下降。

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models Figure 1
2026-06-23cs.AI

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

2026-06-23机器人视觉语言视觉感知

这篇论文针对现有 VLA 机器人主要依赖语音或文本、对聋哑及嘈杂场景不友好的问题,提出 SignVLA:用 MediaPipe 手部关键点、注意力 LSTM 与时序稳定缓冲把手语转为可供 VLA 使用的自然语言指令,无需改动下游 GR00T 策略。实验显示其在受限 ASL 词表和 LIBERO 操作任务中能稳定识别并驱动机械臂执行,但真实大词表连续手语与实机泛化仍有待验证。

World Action Models: A Survey Figure 1
2026-06-23cs.RO

World Action Models: A Survey

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

National University of Singapore

2026-06-23强化学习

机器人策略正从仅由视觉语言模型直接映射动作,转向在行动前预测环境变化,但“世界模型、视频生成、VLA 与 WAM”边界混乱。本文的核心贡献是将世界动作模型界定为面向动作的预测模型,并用三类生成范式与四轴组件分解统一现有工作。主要结论是,强 WAM 并非简单给视频生成器加动作头,而是在可交互、因果、持久、物理合理与泛化之间,用更少未来生成换取控制所需信息与实时性。

TriMotion: Modality-Agnostic Camera Control for Video Generation Figure 1
2026-06-23cs.CV

TriMotion: Modality-Agnostic Camera Control for Video Generation

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng

2026-06-23视觉感知规划控制

针对现有视频生成的相机控制通常绑定单一输入模态、难兼顾易用性与几何精度的问题,TriMotion将参考视频、相机位姿和文本描述对齐到共享运动嵌入空间,并用由外参生成文本的Motion Triplet Dataset及潜空间运动一致性约束提升轨迹跟随。实验显示其在I2V/V2V中兼顾画质、时序一致性和相机运动准确性,并支持顺序运动组合与跨模态插值,但极端轨迹仍可能出现边界补全伪影。

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction Figure 1
2026-06-23cs.RO

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

Feeza Khan Khanzada, Jaerock Kwon

2026-06-23视觉感知

这篇论文针对相机优先的自动驾驶路点预测中“只监督轨迹、不监督周围交通参与者表示”的问题,提出训练期使用仿真器生成的道路用户 sidecar 标签,监督目标检测式定位、与自车轨迹相关性和短期运动,但推理时仍只用 RGB、车身状态和路线指令。结果显示,RU-sidecar 将 FDE 从普通 RGB 基线的 1.815 m 降至 1.223 m,并在含 VRU、演员密集场景中也有稳定收益;不过证据限于开环仿真,仍存在 privileged-to-camera gap。

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments Figure 1
2026-06-23cs.RO

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

2026-06-23机器人安全鲁棒

UNSEEN针对轻量无人机在未知环境中仅靠视觉导航时易受模糊、低纹理和定位漂移影响的问题,将SLAM、稀疏概率地图与滚动规划紧耦合,并显式传播位姿和地图不确定性来选择更利于估计的安全轨迹。实验显示其SLAM平移误差降低9.8%,规划使估计精度最高提升45%,任务成功率达100%。

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models

Yousung Lee, Dongsoo Har

2026-06-23视觉语言视觉感知安全鲁棒

这篇论文针对 VLA 机器人在分布外场景中可能自信失败、且连续动作模型缺少显式概率的问题,提出在推理时向视觉或视觉语言 Transformer 隐状态注入高斯扰动,用扰动后动作预测分歧估计认知不确定性。方法无需失败标签、重训练或特定解码机制,在 LIBERO 与 LIBERO-PRO 上相较动作采样不确定性更能检测失败,但具体增益在不同架构和真实机器人上的来源仍需进一步验证。

Toward Machine Risk Perception: Integrating Trust Calibration and Precursor-Based Risk Estimation for Humanoid Figure 1
2026-06-23cs.RO

Toward Machine Risk Perception: Integrating Trust Calibration and Precursor-Based Risk Estimation for Humanoid

He Wen

AI Safety Lab, Bailey College of Engineering & Technology, Indiana State University, aware and trustworthy human–robot collaboration in Industry, human–robot collaboration, [1]. Unlike conventional collaborative robots that operate within, collaborate with workers in roles traditionally reserved for, flexibility, rapid reconfiguration, and labor augmentation, envelopes [7,8]. Collaborative robots (cobots) extend this, More recent human-robot collaboration (HRC) research moves, under uncertainty [25,26], while the National Institute of, safe collaboration, highlighting the need to adjust behavior under, for humanoid collaboration in industrial settings., publicly available industrial safety reports and

2026-06-23机器人安全鲁棒

针对人形机器人在工厂中因双足平衡、全身运动和感知遮挡带来的非瞬时安全风险,论文提出以事故前兆为线索的风险感知框架,用Logistic–Exponential模型刻画风险随多源前兆升级与衰减,并把信任定义为事故概率的反向量来调节行为。作者从126个事件中整理出12类事故和241个前兆,发现多数事故在0.5–1.5秒内由多个前兆叠加演化,仿真“倒向人”案例显示该机制可更早触发干预。

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring without Lane Closure Figure 1
2026-06-23cs.RO

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring without Lane Closure

Yamil Uchani, Grace Abigail Luna Verdueta, Mauricio Figueroa, Edwin Salcedo

2026-06-23机器人

针对无人机路面巡检在开放交通中易受车辆、行人遮挡且难以实地反复验证的问题,论文构建了 Unity 数字孪生测试床,联合程序化病害生成、动态交通、无人机导航和两阶段 YOLOv8n+分类器感知,并比较悬停复查、微位移、跳过再访三种遮挡恢复策略。仿真中感知管线五类准确率达 99.26%,覆盖率受飞行高度显著影响;低交通下跳过再访最高达 97.95%,中高交通下悬停复查更稳定、最高 97.03%。

Coupled Routing and Configuration Optimization for Multi-Viewpoint Robotic Inspection Figure 1
2026-06-23cs.RO

Coupled Routing and Configuration Optimization for Multi-Viewpoint Robotic Inspection

Minh Nhat Vu, Khang Nguyen, Vu Trung Tran, Vien Ngo

Division of Computer and Mathematical Sciences, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE.

2026-06-23机器人优化算法

面向多视点工业检测,论文关注高自由度机器人在访问顺序自由时因先定 IK 再路径规划而损失全局时间最优的问题。其核心做法是把视点访问顺序与每个视点的冗余构型一起用 CMA-ES 搜索,并用闭式自运动参数化和双积分时间代理降低代价,最后仅对选中边做直接配点验证。仿真与 KUKA 线性滑台实机实验显示,该方法可生成平滑、无碰撞且满足动力学约束的轨迹,并比模块化和距离式基线缩短检测总时间。

Real-World Deployment of Massively Parallel Sampling-Based MPC for Contact-Rich Manipulation Figure 1
2026-06-23cs.RO

Real-World Deployment of Massively Parallel Sampling-Based MPC for Contact-Rich Manipulation

Magnus Dierking, Joao Carvalho, An Thai Le, Georgia Chalvatzaki, Jan Peters

Intelligent Autonomous Systems Lab, TU Darmstadt, Germany, Interactive Robot Perception & Learning Lab, TU Darmstadt, Germany, German Research Center for AI (DFKI), Robotics Institute Germany (RIG)., College of Engineering and Computer Science, VinUniversity, Vietnam.

2026-06-23机器人强化学习规划控制

这篇论文针对接触丰富操作中传统梯度式 MPC 难处理非光滑、多模态动力学的问题,将 JAX 并行采样与 MuJoCo MJX 高保真仿真接入真实 Franka Push-T 流水线。核心洞察是用 MTP 的结构化全局采样补足 MPPI/CEM 等单峰搜索易陷局部最优的缺陷,并在 MPC 预算内考察在线域随机化。结果显示,MTP 在仿真和实机模式切换任务上优于基线;但域随机化信号只有接触初始化参数较可解释,全局物理参数在实时频率下反馈偏弱。

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces Figure 1
2026-06-23cs.CV

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces

Gao Zhu, Zaishuo Xia, Yubei Chen

2026-06-23机器人

本文针对人形机器人控制中单一动作接口难以兼顾探索效率与精细反馈的问题,提出 MotionPyramid:从运动跟踪教师中预训练递归潜变量解码层级,并在下游强化学习中作为冻结的多分辨率残差动作接口。实验表明,粗层级提升早期学习和动作连贯性,细层级保留接触修正与最终精度,Residual Interfaces 可在同一控制器中结合长时程运动程序与帧级校正。

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model Figure 1
2026-06-23cs.RO

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing Innovation Center of Humanoid Robotics, Nanyang Technological University, Hong Kong University of Science and Technology, University of Electronic Science and Technology of China

2026-06-23强化学习安全鲁棒

SafeDojo针对VLA机器人在障碍丰富真实环境中不能依赖危险在线探索或手工安全函数的问题,把策略优化搬到交互式视频世界模型中,用想象轨迹同时估计任务进展与安全代价,并以拉格朗日约束GRPO平衡成功率和碰撞风险。实验在SafeLIBERO与Franka实机上均提升任务成功、安全成功和效率,其中Level I安全成功率较最强基线高8.25个百分点。

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems Figure 1
2026-06-23cs.RO

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

Jiahao Wu, Shengwen Yu

2026-06-23生成模型规划控制安全鲁棒

面向行人、配送机器人等混行的低速共享空间,论文指出传统“先预测障碍物、再规划自车”的单向流程会造成预测与执行轨迹不一致。JPPD将自车与多参与者未来轨迹放入同一扩散/流匹配生成过程,并用跨轨迹注意力和可微安全势场在采样中引导避障。实验覆盖仿真、自然行人回放、Isaac Sim和ROS Orin部署,报告相比两阶段基线改善尾部安全、近失误/堵塞等运营指标并降低延迟,但具体增益幅度需结合全文表格确认。

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation Figure 1
2026-06-23cs.RO

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

University of California, Los Angeles, 2 Nirvana Robotics, University of California, San Diego, 4 University of Utah

2026-06-23机器人视觉感知

MemoryVAM针对视频世界模型策略只看短窗口、在计数/顺序/遮挡等长程操作中丢失任务进度的问题,将每帧CLIP特征压缩为情节记忆token,并同时注入视频预测骨干和动作解码器,使“想象未来”和执行动作都受历史约束。该机制可接入UNet与DiT骨干;在LIBERO-Mem平均成功率由5%提升至42.5%,真实机器人计数、空间回忆和顺序跟踪成功率约75%–80%。

Learning Control as Enabling Layer for Embodied Intelligence Research explored with Soft Robotic Swimming in diverse Flow Speeds Figure 1
2026-06-23cs.RO

Learning Control as Enabling Layer for Embodied Intelligence Research explored with Soft Robotic Swimming in diverse Flow Speeds

Fabian Schwab, Federico Allione, Bingcheng Wang, Mohamed El Arayshi, Claudio Mucignat, Ivan Lunati, Cristiano Verrelli, Ardian Jusufi

Engineering Sciences Department, Swiss Federal Laboratories for Materials Science and Technology, Switzerland, Institute for NeuroInformatics, University of Zurich, Switzerland, Department of Electronic Engineering, University of Rome Tor Vergata, Italy, Beyond their engineering appeal, soft robotic fish serve as robophysical models: controllable

2026-06-23机器人生成模型规划控制

本文关注软体仿生鱼在不同水流负载下难以保持可重复体-尾摆动的问题。作者将嵌入式软弯曲传感与PID-LRLES重复学习控制结合,让控制器利用前几周期误差补偿周期性水动力偏差。流槽五档流速实验显示,在仅静水调参且参数固定时,该方法较PID更准确跟踪弯曲包络,并显著降低试次间RMSE离散度。

Distributed Model Predictive Control with Adaptive Safety Zones for Multi-Fleet Drone Operations Figure 1
2026-06-23eess.SY

Distributed Model Predictive Control with Adaptive Safety Zones for Multi-Fleet Drone Operations

Linda Mümken, Diyar Altinses, Michael Schwung, Stefan Lier, Andreas Schwung

2026-06-23规划控制安全鲁棒

面向仓库、城市走廊等受限空域中多机高密度运行的安全与容量问题,论文将安全区由固定半径改为随速度/制动距离自适应变化,并嵌入集中式与分布式 MPC,使混合机队可仅依赖邻居状态局部优化。理论上给出可行性、Lyapunov 稳定性和球堆积极限下的容量界,仿真显示自适应方案在固定半径 MPC 不可行的拥挤场景仍可保持无碰撞,并宣称单运营方容量最高约提升 1.8 倍。

Platooning Connected, Autonomous, and Human-Driven Vehicles: A Deep Reinforcement Learning-based Approach Figure 1
2026-06-23eess.SY

Platooning Connected, Autonomous, and Human-Driven Vehicles: A Deep Reinforcement Learning-based Approach

Zhen Qina, Dong-Fan Xie, Heng Ma, Xiaomei Zhao, Zhengbing He

School of Systems Science, Beijing Jiaotong University, Beijing 100044, China, Faculty of Science and Engineering, University of Nottingham Ningbo China

2026-06-23强化学习

针对传统车队编队多只允许联网车辆、难以反映含人工驾驶车和非联网自动车的混合交通,论文提出允许 HV/AV 条件加入的混合编队,并用 PPO/CTDE 与多层状态表示动态调节编队拓扑。结果显示策略不是简单扩张车队,而是通过限制过长编队抑制扰动传播,稳定性判别指标最高提升约51%,低渗透率下 TTCI 峰值降约52.95%,并小幅降低油耗与排放。

Tessellated Biomes: Distributed Robotic Assemblies for Architectural Resilience Figure 1
2026-06-23cs.RO

Tessellated Biomes: Distributed Robotic Assemblies for Architectural Resilience

Sergio Mutis, Eric Hughes, Gert Duvenhage

CAADRIA Conference, Vol. 2, 389–398. Available via CUMINCAD:, deployment of custom quadrupedal robots that collaboratively relocate, bottom-up assembly that adapts to material availability and changing conditions., HUMAN-ROBOT COLLABORATION (HRC), Research on human–robot collaboration (HRC) in architecture has established the, positioning the robot as an intelligent collaborator responding to gestures, sensing

2026-06-23机器人

面向建筑业线性建造、高排放与难重构的问题,论文提出 Tessellated Biomes:把本地微工厂多材料模块制造、库存感知的离散结构优化和多四足机器人协同搬运装配连接成循环流程。实验展示了 PLA、木材、混凝土自对准单元的制备、压缩主导结构优化与多机器人实体组装,但全尺度结构、摩擦/可逆连接和机器人载荷约束仍文中未充分验证。

TACT-ful: Multi-Channel Terrain Affordance and Compliance Training for Payload-Robust Perceptive Humanoid Locomotion Figure 1
2026-06-23cs.RO

TACT-ful: Multi-Channel Terrain Affordance and Compliance Training for Payload-Robust Perceptive Humanoid Locomotion

Thanh Ly, Truong-Duy Dang, Chien Le, Tan-Dzung Do, Phuong Tuan Dat, Cuc T. Trinh, Vien Anh Ngo, An T. Le

Center for AI Research, VinUniversity, Vietnam

2026-06-23机器人安全鲁棒

这篇论文针对人形机器人在楼梯、斜坡等结构化地形上负载行走时,单一高度图难以兼顾落脚平整性、坡度和可达性的问题,提出多通道地形代价驱动DCM落脚规划,并用虚拟力矩扰动训练下肢顺应性。仿真中在0.20米台阶可达1.0米/秒,15公斤居中负载和腕部力矩负载下成功率、功耗均优于基线;但真实硬件仅定性展示。

Bridging Multi-Valued Heuristics and Dimensionality Reduction in Multi-Objective Search Figure 1
2026-06-23cs.AI

Bridging Multi-Valued Heuristics and Dimensionality Reduction in Multi-Objective Search

Maya Wolff, Ariel Felner, Oren Salzman

2026-06-23机器人

这篇论文面向机器人路径规划等多目标最短路场景,动机是现有单值启发难以表达帕累托权衡,而多值启发与降维支配检查直接结合会破坏排序不变量。作者给出一致性约束下的 NAMOA*dr-mvh,并提出懒惰修复式 L-NAMOA*dr-mvh,仅在局部违规时回退精确检查。实验显示其保持正确完备,并在多值启发带来更强剪枝时相对现有方法可超过 10 倍加速。

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning Figure 1
2026-06-23cs.RO

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning

Letian Chen, Yiren Lu, Justin Fu, Yichen Xie, Runsheng Xu, Jyh-Jing Hwang, Ben Sapp, Drago Anguelov

2026-06-23视觉语言强化学习规划控制

这篇论文针对多模态大模型用于自动驾驶规划时,SFT 的逐 token 模仿目标难以约束碰撞、越界和舒适性等轨迹后果的问题,提出 MAGNIFIED:先用监督微调生成文本化 XY 轨迹,再将输出 token 映射回轨迹并用规划奖励做 RL 微调,可支持非可微代价。其在 WOMD 上相对 SFT 将 overlap rate 降低 10.5%、off-road rate 降低 38.9%,说明 RLFT 能把 MLLM 从模仿器推向更符合规划目标的代价感知规划器。

2026-06-19

71 篇
MemoryWAM: Efficient World Action Modeling with Persistent Memory Figure 1
2026-06-19cs.RO

MemoryWAM: Efficient World Action Modeling with Persistent Memory

Sizhe Yang, Juncheng Mu, Tianming Wei, Chenhao Lu, Xiaofan Li, Linning Xu, Zhengrong Xue, Zhecheng Yuan, Dahua Lin, Jiangmiao Pang, Huazhe Xu

The Chinese University of Hong Kong, Tsinghua University, Zhejiang University

2026-06-19强化学习

本文针对机器人长程操作中既要记住早期线索、又要控制推理开销的矛盾,提出 MemoryWAM:用近期帧保留短期细节、事件边界锚帧保留关键场景、gist tokens 压缩长程历史,并配合定制注意力读取混合记忆。结果显示其在 RMBench 和真实任务中优于 VLA 与既有 WAM 基线,同时较全历史记忆显著降低延迟和显存。

Generating Robot Hands from Human Demonstrations Figure 1
2026-06-19cs.RO

Generating Robot Hands from Human Demonstrations

Sha Yi, Nicklas Hansen, Xueqian Bai, Carmelo Sferrazza, Michael T. Tolley, Xiaolong Wang

University of California San Diego

2026-06-19机器人模仿学习

这篇论文针对机器人学习中“身体设计”难以与控制共同搜索的问题,提出用大规模人手拇指-食指轨迹直接生成机器人手形态,并让设计阶段使用部署时同样的逆运动学控制。其核心洞察是把人类示范从控制监督扩展为硬件优化信号,生成6DoF通用手和3DoF带四杆仿生耦合的任务手;实验显示前者实现高精度遥操作跟踪,后者以更低复杂度复现结构化轨迹,RL actor还将搜索从数小时降到分钟级。

The Token Is a Group Element: On Lie-Algebra Attention over Matrix Lie Groups Figure 1
2026-06-19cs.LG

The Token Is a Group Element: On Lie-Algebra Attention over Matrix Lie Groups

Przemyslaw Musialski

New Jersey Institute of Technology

2026-06-19机器人

本文针对机器人位姿、空间布局等任务中等变注意力依赖向量特征和复杂表示论的问题,提出将 token 直接视为矩阵李群元素,用相对位姿的李代数对数范数作为闭式注意力分数。该做法使等变性和相对一致性由群结构自然给出,并覆盖含尺度、剪切的仿射群。序列补全实验显示其以少得多的参数匹配或优于学习核,向量 token 基线则明显破坏不变性。

Increasing Resilience of Continuum Robots via Motion Planning Algorithms Figure 1
2026-06-19cs.RO

Increasing Resilience of Continuum Robots via Motion Planning Algorithms

Oxana Shamilyan, Ievgen Kabin, Zoya Dyka, Oleksandr Sudakov, Peter Langendoerfer

Technical Center, National Academy of Sciences of Ukraine, Kyiv, Ukraine

2026-06-19机器人规划控制

面向连续体机器人在狭窄、动态或高精度场景中难以自主规划且易产生机械磨损的问题,论文将AHP多准则决策嵌入GA与A*路径规划,把距离、电机损伤、机械臂损伤和精度纳入路径质量评估。实验基于简化但参考真实原型的两类仿真环境,结果显示GA运行时间较不受环境规模影响,并能生成更多样路径,从而有助于提升机器人韧性;但真实硬件闭环验证仍较有限。

Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation Figure 1
2026-06-19cs.RO

Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation

Fatma Youssef Mohammed, Grzegorz Malczyk, Kostas Alexis

2026-06-19机器人

面向资源受限的自主导航机器人,论文指出现有人类注视/scanpath 预测模型过重,难以用于实时主动感知。作者提出 GazeLNN,以 MobileNetV3 提取视觉特征、Liquid Neural Network 自回归预测连续注视热图,并将其接入强化学习主动相机控制。结果显示其在 MIT Low Resolution 上以 0.61 GFLOPs 达到 0.47 ScanMatch,计算量降 99.40%、推理最高快约 6 倍;真实飞行中,相比固定相机增加近 50% 地图体素并显著提升显著区域观测。

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates Figure 1
2026-06-19cs.RO

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates

Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

2026-06-19机器人视觉语言视觉感知规划控制安全鲁棒

这篇论文针对视觉语言导航中“平均成功率高但执行中会逐步振荡、停滞或绕路”的安全问题,提出 GroundControl:用恒速卡尔曼滤波建模到目标距离的正常下降趋势,并结合进展、单调性、路径效率和动作反转来估计轨迹级不确定性。其核心洞察是失败更像几何/时间一致性破坏,而非单步动作熵升高。实验在五个 EB-Navigation 划分上显示,该信号在选择性风险排序中接近 oracle,GPT-4o 上成功率 E-AURC 为 0.0024,并优于熵、 conformal 与启发式基线。

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation Figure 1
2026-06-19cs.RO

Slow Brain, Fast Planner: Latency-Resilient VLM-Augmented Urban Navigation

Zhenghao "Mark'' Peng, Honglin He, Quanyi Li, Yukai Ma, Bolei Zhou

Zhejiang University

2026-06-19机器人视觉语言

论文针对城市人行道导航中“轨迹生成够用但语义场景下打分选错”的问题,提出让慢速VLM只在规划器候选轨迹中选索引,再用带指数衰减的几何相似度Score Fusion把过期建议融入5–20Hz规划循环。约2000个困难真实场景中VLM选择相对规划器argmax降低30% ADE;仿真中延迟至5秒仍保持80%以上成功率,并在校园机器人上验证。

ARC: Adaptive Robust Joint State and Covariance Estimation Figure 1
2026-06-19cs.RO

ARC: Adaptive Robust Joint State and Covariance Estimation

Alexandre Hadji-Thomas, Andrew Stirling, James R. Forbes

2026-06-19安全鲁棒

针对机器人定位中传感器离群值和非高斯噪声会同时破坏状态估计与不确定性校准的问题,ARC将范数感知自适应鲁棒损失、IRLS状态更新和MWCD协方差估计放入统一BCD循环,联合自调损失形状、状态和测量协方差。仿真与真实UWB非视距实验显示,其能更稳定恢复内点协方差,状态精度匹配或优于基线,且无需手工调参。

TaCauchy: An Extensible FEM Framework for Vision-Based Tactile Simulation Figure 1
2026-06-19cs.RO

TaCauchy: An Extensible FEM Framework for Vision-Based Tactile Simulation

Hengfei Zhao, Yifan Xie, Junhao Gong, Yue Sun, Kai Zhu, Weihua He, Shoujie Li, Haohuan Fu, Wenbo Ding

2026-06-19视觉感知

本文针对视觉触觉传感器在强化学习中既要高保真力学监督、又要适配 Isaac Sim 并行训练的矛盾,提出 TaCauchy:基于 UIPC-FEM 直接由超弹性模型计算 Cauchy 应力,并分解为压力与牵引力,同时用自适应网格和模块化接口支持多类传感器。实验显示单环境 33.40 FPS、60 环境总吞吐 555 FPS,真实对比 SSIM 超过 0.93,但下游操控收益文中未充分说明。

LIT-GS: LiDAR-Inertial-Thermal Gaussian Splatting for Illumination-Robust Mapping Figure 1
2026-06-19cs.RO

LIT-GS: LiDAR-Inertial-Thermal Gaussian Splatting for Illumination-Robust Mapping

Shikuan Shi, Chunran Zheng, Jiaming Xu, Tianyong Ye, Tao Yu, Yukang Cui

2026-06-19三维安全鲁棒

这篇论文针对机器人高斯地图在光照变化、弱纹理场景中依赖 RGB 光度约束而易漂移的问题,提出 LiDAR-惯性-热成像的 LIT-GS:用带置信度的 LIV 地图点建立热像与 LiDAR 关联,并在 BA 与高斯优化中持续加入 LiDAR 点到平面约束。实验显示其在私有与公开数据上提升几何精度和渲染质量,尤其适合低照或强光变化环境。

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems Figure 1
2026-06-19cs.RO

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

Amit Jain, Richard Linares

Amit Jain 1 1 1 Postdoctoral Associate, Department of Aeronautics and Astronautics., and Richard Linares 2 2 2 Associate Professor, Department of Aeronautics and Astronautics.

2026-06-19规划控制

这篇论文针对航天器学习控制策略研发中实验迭代慢、易把随机种子噪声误判为改进的问题,提出 AutoResearch:由 LLM 离线驱动代码修改、训练与记录,并把种子噪声测量、重采样验证和逐项删改审计嵌入流程。结果显示,在相对交会和带禁入区对接任务上,经审计策略显著超过噪声尺度;随机搜索表现较弱,对接任务甚至未得到可行策略。

CoLI: A Reproducible Platform for Continuum Robot Learning via Monolithic 3D Printing and Isomorphic Teleoperation Figure 1
2026-06-19cs.RO

CoLI: A Reproducible Platform for Continuum Robot Learning via Monolithic 3D Printing and Isomorphic Teleoperation

Ziyuan Tang, Chenxi Xiao*

2026-06-19机器人三维

这篇论文针对连续体机器人在学习研究中难以复现、装配复杂、建模控制门槛高的问题,提出 CoLI:用多材料一体化 3D 打印制造柔顺机械臂,并通过同构遥操作建立执行器级直接映射,绕开显式运动学建模,同时接入 LeRobot 支持示教与模仿学习。实验给出约 3.2 N/mm 力-形变特性、约 430 mm 工作空间和最高 1 kg 动态负载,并在多项操作任务中展示可复现的数据采集与自主控制基线。

An Infrastructure-less, Control-Independent Solution to Relative Localisation of a Team of Mobile Robots using Ranging Measurements Figure 1
2026-06-19cs.RO

An Infrastructure-less, Control-Independent Solution to Relative Localisation of a Team of Mobile Robots using Ranging Measurements

Paolo Golinelli, Tommaso Faraci, Daniele Fontanelli

P. Golinelli and D. Fontanelli are with the Department of Industrial Engineering, University of Trento, Trento, Italy.

2026-06-19机器人规划控制

面向无固定基站、部署快速且运动任务不应被定位需求牵制的多机器人场景,论文提出仅依赖里程计、稀疏测距与短距通信的去中心化相对定位方法。核心洞察是不强求唯一可观测解,而用多假设贝叶斯框架保留所有与测量一致的相对位姿,并通过信息共享服务部分连通队伍。LIMO 机器人与 UWB 实验展示了在不同可观测性和连通条件下的可用性,但具体精度增益和计算代价权衡仍需结合全文结果判断。

Autonomous Driving with Priority-Ordered STL Specifications Under Multimodal Uncertainty Figure 1
2026-06-19cs.RO

Autonomous Driving with Priority-Ordered STL Specifications Under Multimodal Uncertainty

Taha Bouzid, Shuhao Qi, Mircea Lazar, Sofie Haesaert

2026-06-19视觉语言安全鲁棒

面向自动驾驶在多模态交通预测下难以同时满足安全、规则与舒适性的冲突,论文提出将带字典序优先级的 STL 规范扩展到不确定场景,用 CVaR 等风险鲁棒度和保序奖励保证高优先级安全约束压倒低优先级目标,并用 MPPI 做滚动优化。仿真中的高速接管和行人穿越场景表明,该方法能在冲突目标下优先保持安全,但真实闭环基准验证仍待补充。

Towards 3D karst underwater scene reconstruction from rotating sonar data Figure 1
2026-06-19cs.RO

Towards 3D karst underwater scene reconstruction from rotating sonar data

Georgios Evangelos Margaritis, Lionel Lapierre, Simon Rohou, Zhi Yan, Andreas Nüchter, François Goulette

2026-06-19三维

面向喀斯特含水层几何难以获取、声呐点云稀疏且导航漂移严重的问题,论文提出从人工潜水员操作的旋转剖面声呐数据重建水下洞道的完整流程:先用连续时间6DoF SLAM校正轨迹,再结合神经泊松与点卷积表面重建生成网格,并在Blender中优化为可交互浏览的三维模型。结果显示该流程能从约5万点的噪声数据恢复较连贯的洞道表面,但定量精度评估文中未充分说明。

Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems Figure 1
2026-06-19cs.RO

Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems

Yandong Wang, Jiaqian Yu, Xiongfeng Peng, Lu Xu, Yamin Mao, Weiming Li, Jaewook Yoo, Dongwook Lee, Daehyun Ji, Mingbo Zhao, Chao Zhang

2026-06-19视觉语言视觉感知

本文针对双臂 VLA 中仅靠端到端隐式学习难以稳定处理紧耦合协作的问题,提出 Co-VLA,将双臂动作从单一向量拆为共享协作潜变量与双臂残差潜变量,并用部署端 LAC 调节同步、非对称、平滑与安全约束。实验显示其在仿真和真实任务中优于单体动作头,紧协作任务成功率提升 27%,真实 OOD 成功率由 13% 到 27%,完成时间最多降低 25%。

Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications Figure 1
2026-06-19cs.RO

Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications

Paul Koch, Vivek Chavan, André Sers, Adem Karakurt, Paul Hofmann, Mohamad Zaher Ziadeh, Jörg Krüger

2026-06-19机器人视觉感知

该文针对认知机器人视觉依赖大规模精标数据、纯真实采集成本高而纯仿真存在 sim2real 域差的问题,提出将真实场景与仿真数据生成闭环链接,用真实场景约束合成数据并迭代缩小域差,为6D位姿、抓取与环境理解等任务提供多模态标注基础。主要结果仍是趋势梳理和方案框架,缺少完整实验验证,具体性能增益与来源文中未充分说明。

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think Figure 1
2026-06-19cs.RO

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tuan Dam, Vu Duong, Tung M. Luu, Trung Le, Tran Nguyen Le, Minh Vu, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

Center for AI Research, VinUniversity, University of Arkansas, Technical University of Denmark, Hanoi University of Science and Technology, Monash University, Oldenburg University, University of Stuttgart, Stanford University

2026-06-19视觉语言视觉感知

这篇论文针对现代VLA模型微调成本高、实时推理延迟大的问题,指出π0、GR00T-N1.5等连续控制模型存在显著层间表征冗余,并提出训练前用一次前向和CKA识别、删除冗余Transformer层的CLP方法。实验显示可裁掉约30–50%层数,使训练时间降40–50%、推理最高加速30%,在仿真和10个真实任务中仍保持或超过原模型表现,低数据场景还可能起到正则化作用。

Mobile Target Search with Imperfect Perception: A Partially Observable Stochastic Game Theoretical Approach Figure 1
2026-06-19cs.RO

Mobile Target Search with Imperfect Perception: A Partially Observable Stochastic Game Theoretical Approach

Hanzheng Zhang, Shu Liang, Shuyu Liu

Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, Shanghai, ChinaDepartment of Control Science and Engineering, Tongji University, Shanghai, China

2026-06-19机器人

面向传感受限、干扰或通信噪声下的移动目标搜索,论文指出仅求 POSG 均衡不足以保证最终发现目标,因为虚警会显著稀释有效信息。其核心是把后验信念越过阈值形式化为 α-可检测性,并用随机递推与 Borel-Cantelli 给出充分条件和最坏情形界;同时提出服务器辅助分布式算法,结合聚合势博弈与 KL 约简,在仿真中验证了策略有效性和可检测性分析。

FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching Figure 1
2026-06-19cs.RO

FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching

Francesco Argenziano, Miguel Saavedra-Ruiz, Sacha Morin, Charlie Gauthier, Daniele Nardi, Liam Paull

Sapienza University of Rome, Rome, Italy, Mila - Quebec AI Institute, Montréal, QC, Canada

2026-06-19视觉语言生成模型

这篇论文针对家庭机器人在动态环境中难以寻找被人移动过的物体这一问题,提出 FlowMaps:用 VAE 表示物体几何与语义,再以潜在流匹配/DiT 直接建模连续 3D 空间中的多模态未来位置分布,而不依赖显式活动标签或离散容器关系。作者在 ProcTHOR 生成轨迹上训练,并在未见家庭、600 多个动态 ObjNav 回合及真实机器人部署中验证,结果显示其优于现有零样本与训练式基线。

Stable Transformer-Actor-Critic Model Predictive Control: A Contraction Analysis Approach Figure 1
2026-06-19cs.RO

Stable Transformer-Actor-Critic Model Predictive Control: A Contraction Analysis Approach

Antonio Marino (CAM), Valerio Modugno (UCL), Marco Cognetti (LAAS)

University of Cambridge, University College London

2026-06-19规划控制

针对 Actor-Critic MPC 中序列学习模型难以给出闭环稳定性保证的问题,本文将 Transformer 用于根据历史状态预测 MPC 代价参数,并证明其可受约束满足全局 δISS,再结合黎曼收缩理论推导小增益稳定条件并作为训练正则。3D 无人机实验显示,该约束在强扰动和避障场景下提升鲁棒性,未正则化基线会失效。

Belt-Finger: An Affordable Soft Belt-Driven Gripper for Dexterous In-Hand Manipulation Figure 1
2026-06-19cs.RO

Belt-Finger: An Affordable Soft Belt-Driven Gripper for Dexterous In-Hand Manipulation

Boya Zhang, Andreas Zell, Georg Martius

Department of Computer Science, University of Tübingen, Germany

2026-06-19机器人

针对传统平行夹爪便宜可靠但缺乏手内操作能力、灵巧手又昂贵复杂的问题,Belt-Finger用可3D打印的软双皮带手指作为即插即用升级,在保持开合抓取的同时增加平移、俯仰和滚转自由度。论文还配套遥操作与简化随机MPC,并在遥操作、MPC和VLA策略任务中显示,相比普通平行夹爪可提升任务可行性、效率和用户满意度。

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-trainin Figure 1
2026-06-19cs.CV

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-trainin

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

2026-06-19生成模型

HilDA针对现有相机到LiDAR自监督蒸馏只对齐视觉基础模型末层、忽略层级语义与时序几何的问题,提出多层语义蒸馏、CLS全局上下文对齐和时间占据扩散辅助任务,将“识别什么”与“在哪里/如何运动”联合预训练。实验显示其在跨模态蒸馏基准达到SOTA,并在3D检测、场景流和语义占据预测上优于既有蒸馏方法。

Robust Assembly State Reasoning from Action Recognition for Human-Robot Collaboration Figure 1
2026-06-19cs.RO

Robust Assembly State Reasoning from Action Recognition for Human-Robot Collaboration

James Fant-Male, Roel Pieters

Cognitive Robotics group, Unit of Automation Technology and Mechanical Engineering, Tampere University, 33720, Tampere, Finland

2026-06-19机器人视觉感知安全鲁棒

这篇论文针对人机协作装配中“识别到动作”并不等于“知道装配阶段”的问题,系统比较了基于逻辑、HMM和神经网络的五类状态跟踪方法,并在模拟噪声与真实HAR输入下测试鲁棒性。核心洞察是最优方法依赖任务结构:低变异任务中NN和HMM表现较好,而重复动作、缺少额外传感信息或输入噪声较强时,建模动作持续时间的逻辑方法反而更稳健。

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation Figure 1
2026-06-19cs.RO

Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation

Jianing Guo, Fangzheng Chen, Zihao Mao, Wong Lik Hang Kenny, Zhenhong Wu, Yu Li, Yishuai Cai, Yuanpei Chen, Yikun Ban, Kai Chen, Qi Dou, Yaodong Yang, Xianglong Liu, Huijie Zhao, Simin Li

2026-06-19机器人生成模型

本文针对流匹配/扩散式机器人策略依赖固定频率离散动作块的问题:混合频率示教会丢失频率信息,推理时相邻动作也易抖动不一致。核心做法是用 DCT 将动作转到频域做流匹配,并用余弦基重建连续轨迹,同时约束一阶时间导数以抑制高频误差。实验显示 FAFM 在 toy、避障、LapGym、LIBERO 及 Franka 实机上提升成功率、平滑性、收敛和抗频率/机械偏差鲁棒性。

Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform Figure 1
2026-06-19cs.RO

Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform

Hyeonna Choi, Jung Yup Kim, Hyuneui Lim, Seunggyu Jeon

Robotic Laboratory Platform, a Department of Bionic Machinery, Research Institute of AI Robot, Korea Institute of Machinery & Materials, b Department of Nano-devices & displays, Nano-convergence Manufacturing Research Division, Korea Institute, Department of Bionic Machinery, Research Institute of AI Robot, Korea Institute of Machinery & Materials, 156, commands for a robotic laboratory platform. A Parser Agent formalizes the natural-language protocol into a, constraints of the robotic laboratory platform to generate device-level control commands. A heterogeneous LLM, quantification using a microplate was demonstrated on a robotic laboratory platform, validating end-to-end, based self-driving laboratories., Keywords: Autonomous laboratory

2026-06-19机器人

这篇论文针对生物实验自然语言协议难以直接转为机器人可执行命令的问题,提出由 Parser Agent、规则映射引擎和异构 LLM Validator 组成的双代理框架,用确定性约束减少执行幻觉,并用跨模型反馈自校正解释错误。实验显示,Validator 的严格性比异构本身更关键,Claude 验证器显著提升中小 Parser 的通过率;框架还在 Bradford 微孔板实验中完成端到端机器人执行。

Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation Figure 1
2026-06-19cs.RO

Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation

Jonghoon Lee, Seong Hyeon Park, Byungwoo Jeon, Minha Lee, Jinwoo Shin

Korea University, multi-view and physically consistent augmentation is a practical path to scalable

2026-06-19机器人三维

这篇论文针对 VLA 机器人策略在新物体外观或几何上易失效、重新采集多视角遥操作数据成本高的问题,提出 Pose6DAug:利用已有成功轨迹保持动作不变,在 3D 中用目标物体网格和时序一致的 6D 位姿替换被操作物体,从而生成多视角且物理合理的反事实示范。在 RoboCasa 上,用其增强数据微调可使新物体成功率相对强基线提升 16.5%,同时保持分布内表现。

VFILC: Accurate Frequency Extrapolations in Imitation Learning via Sampling Frequency ILC Figure 1
2026-06-19cs.RO

VFILC: Accurate Frequency Extrapolations in Imitation Learning via Sampling Frequency ILC

Nozomu Masuya, Toshiaki Tsuji, Sho Sakaino

2026-06-19模仿学习

针对传统模仿学习难以在训练速度范围外稳定生成变速接触操作的问题,本文将可变频率模仿学习与迭代学习控制结合,通过同时调整神经网络采样频率、频率标签及反馈项来校正外推时的时序误差。在擦拭、搅拌、摇晃三类任务中,VFILC在高频外推下仍达到接近插值频率的精度,擦拭和摇晃误差分别较纯VFIL降低81%和50%,搅拌插值场景也提升27%。

MirrorDuo: Reflection-Consistent Visuomotor Learning from Mirrored Demonstration Pairs Figure 1
2026-06-19cs.RO

MirrorDuo: Reflection-Consistent Visuomotor Learning from Mirrored Demonstration Pairs

Zheyu Zhuang, Ruiyu Wang, Giovanni Luca Marchetti, Florian T. Pokorny, Danica Kragic

Division of Robotics, Perception and Learning, 2 Department of Mathematics, KTH Royal Institute of Technology, Stockholm, Sweden

2026-06-19模仿学习

这篇论文针对图像行为克隆在跨工作空间布局泛化时示教采集成本高的问题,提出 MirrorDuo:将 RGB 视角、本体状态与 6-DoF 末端动作做反射一致的成对变换,既可作为 MirrorAug 数据增强,也可作为反射等变扩散策略先验。实验显示,在左右示教均衡时同等数据预算下性能更好;仅有单侧示教时,也能以零到少量目标侧样本迁移到镜像任务。

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems Figure 1
2026-06-19cs.RO

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

2026-06-19机器人强化学习

面向仓储RMFS中多AGV在动态拥挤环境下的低时延、低功耗路径规划需求,论文提出SDQN-RMFS:先用允许碰撞的DQN训练提高轨迹信息密度与稳定性,再以硬标签蒸馏和参数缩放将ANN策略转为SNN并部署到SPECK2E类脑芯片。实验称在保持接近原策略决策质量的同时,相比RTX 4090最高节能11281倍、延迟约减半,但离线部署到闭环真实系统的效果文中未充分说明。

Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory Figure 1
2026-06-19cs.RO

Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory

Jinghan Yang, Yunchao Zhang, Wang Yuan, Haolun Wan, Jiaming Zhang, Zhengyang Hu, Yanchao Yang

InfoBodied AI Lab, The University of Hong Kong

2026-06-19学习理论

本文针对 VLA 机器人在分布外场景中可能静默失效且代价不可逆的问题,提出用信息论信号做可解释失效预测:从闭环感知—动作过程提炼动作熵、动作时间互信息和状态转移—动作互信息,分别刻画漂移、冻结和幻觉抓取等模式。实验覆盖 6 个 VLA 与 3 类环境,域内接近最强基线,并在跨模型、仿真到真实迁移中无需重训仍保持较高准确率,真实任务约 83%。

Evaluation of Augmented Reality-based Intuitive Interface for Robot-Assisted Transesophageal Echocardiography: A User Study Figure 1
2026-06-19cs.RO

Evaluation of Augmented Reality-based Intuitive Interface for Robot-Assisted Transesophageal Echocardiography: A User Study

Xiu Zhang*, Matteo Di Mauro*, Sofia Breschi, Angela Peloso, Emiliano Votta, Arianna Menciassi, Elena De Momi

Xiu Zhang is with Department of Electronics, Information and Bioengineer-, Institute, Scuola Superiore Sant’ Anna, 56025 Pontedera, Italy (Corresponding, the Department of Electronics, Information and Bioengineering, Politecnico, Arianna Menciassi is with the BioRobotics Institute, Scuola Superiore

2026-06-19机器人数据集/基准

这篇论文针对机器人辅助经食管超声中探头操控不直观、医生负担和辐射暴露等问题,评估了结合电磁跟踪、虚拟仿真与HoloLens三维显示的AR交互界面。核心洞察是将空间可视化与探头端点级控制分开比较:3D显示将位置误差中位数由13 mm降至3 mm并约减半姿态误差,端点级控制又进一步降低约50%姿态误差和用户差异,但3D条件耗时略增,可能与AR适应成本有关。

Motor Angular Speed Preintegration for Multirotor UAV State Estimation Figure 1
2026-06-19cs.RO

Motor Angular Speed Preintegration for Multirotor UAV State Estimation

Matěj Petrlík, Filip Novák, Robert Pěnička, Martin Saska

Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague, 166 36, Prague 6, Czech Republic, The paper is supported by the materials available at, over, the mass distribution on the UAV is typically not centered, The Center of Gravity (COG) is then offset from the geometri-, cal center of the UAV, which is compensated by faster rotation, marily on IMU measurements. We summarize the available lit-, rectly available angular accelerations that are crucial for snap

2026-06-19机器人

针对多旋翼无人机上 IMU 易受螺旋桨振动、噪声和标定误差影响,导致近障与激烈飞行状态估计不稳的问题,论文提出用电调测得的电机角速度经动力学模型生成加速度并做预积分,形成可嵌入因子图的 MAS 因子,并与 LiDAR 里程计组成 MAS-LO。实验相较 LIO-SAM 报告位置误差降 28%、速度误差降 65%、测量滞后降 14%,但姿态误差有所上升。

SWAP: Symmetric Equivariant World-Model for Agile Robot Parkour Figure 1
2026-06-19cs.RO

SWAP: Symmetric Equivariant World-Model for Agile Robot Parkour

Kaixin Lan, Ze Wang, Hongyi Li, Lei Jiang, Chaojie Fu, Chengkai Su, Choi Lam Wong, Yongbin Jin, Hongtao Wang

2026-06-19机器人强化学习

这篇论文针对四足跑酷中潜在世界模型会把左右对称交互重复学习、导致样本效率和几何泛化受限的问题,提出 SWAP:在感知、潜在动力学和 actor-critic 中硬编码镜像等变/不变约束,使镜像观测对应镜像隐状态与动作。实验显示其能泛化到未见镜像地形,并零样本迁移到真实 Apollo 四足,完成 2.13 米跨沟和 1.63 米登台;但更复杂离散落脚环境仍未充分验证。

Deep-Unfolded Coordination Figure 1
2026-06-19cs.RO

Deep-Unfolded Coordination

Hunter Kuperman, Minchan Jung, Rahul V. Ghosh, Alex Oshin, Evangelos A. Theodorou

Autonomous Control and Decision Systems Laboratory, Georgia Institute of Technology

2026-06-19机器人

面向多机器人协同规划中 ADMM-DDP 依赖人工调参、规模增大后收敛变慢的问题,本文将固定迭代数的分布式优化器展开为可训练网络,让 Deep Coordinator 根据求解状态在线调整非凸优化的惩罚参数,并用隐函数梯度和无监督损失避免监督训练退化。在车辆与四旋翼仿真中,其以相近轨迹质量和约束满足度实现 6.18–9.44 倍加速,并能泛化到训练规模 8 倍的系统。

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances Figure 1
2026-06-19cs.RO

Co-policy: Responsive Human-Robot Co-Creation for Musical Performances

Xuetao Li, Wenke Huang, Mang Ye, Zijian Liu, Jinhua Xie, Jifeng Xuan, Miao Li

School of Computer Science, Wuhan University, Wuhan, China, College of Computing and Data Science, Nanyang Technological University, Singapore, School of Automation, Wuhan University of Technology, Wuhan, China, School of Geodesy and Geomatics, Wuhan University, Wuhan, China, School of Robotics, Wuhan University, Wuhan, China

2026-06-19机器人强化学习

论文针对机器人音乐系统常停留在按谱回放、难以把人类意图转化为可实时执行的创造性回应的问题,提出 Co-policy:用语义锚点与微调 Qwen-VL 生成结构化共创计划,再以受音乐与可达性约束的变奏模块和单次前向的高斯混合视觉运动策略执行。真实编钟实验、消融和专家评估显示,其意图对齐、敲击准确率与响应频率优于扩散策略等基线。

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms Figure 1
2026-06-19cs.RO

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms

Youbin Yao, Nieqin Cao, Mingyan Li, Yan Ding, Fuqiang Gu, Chao Chen

Chongqing University, Chongqing, China 2 Xi’an Jiaotong-Liverpool University, Suzhou, China

2026-06-19机器人

本文针对双臂示教采集成本高、单臂策略只能串行执行的问题,提出 ExS2D,将单臂监督扩展为双臂操作:先由视觉语言模型生成带前序约束的子任务,再用掩码引导的动作映射落地到抓放动作,最后进行考虑依赖、运动代价与碰撞的双臂分配。实验显示其在仿真中平均执行步数减少 54.4%,成功率接近单臂基线,并在真实双臂任务中无需双臂示教验证可行性。

MMD-SLAM: Structure-Enhanced Multi-Meta Gaussian Distribution-Guided Visual SLAM Figure 1
2026-06-19cs.RO

MMD-SLAM: Structure-Enhanced Multi-Meta Gaussian Distribution-Guided Visual SLAM

Fan Zhu, Ziyu Chen, Peichen Liu, Yifan Zhao, Zhisong Xu, Hui Zhu, Hongxing Zhou, Sixun Liu, Chunmao Jiang

2026-06-19三维

这篇工作针对现有 3DGS-SLAM 对室内结构先验利用不足、易产生模糊和地图不一致的问题,提出以 Atlanta World 假设引导的 MMD-SLAM:在跟踪中融合点线约束,在建图中用带主方向的点/线/面多元高斯及演化策略表达结构。实验称其在跟踪与渲染上优于基线,相比 MonoGS 在 ScanNet 上 ATE RMSE 降低 48.56%,Replica 上 PSNR 提升 5.71%。

World Engine: Towards the Era of Post-Training for Autonomous Driving Figure 1
2026-06-19cs.RO

World Engine: Towards the Era of Post-Training for Autonomous Driving

Tianyu Li, Li Chen, Caojun Wang, Haochen Liu, Kashyap Chitta, Zhenjie Yang, Yuhang Lu, Naisheng Ye, Yihang Qiu, Yufei Wang, Luoxi Zou, Jiaxin Peng, Jin Pan, Zhaoyu Su, Andrei Bursuc, Shengbo Eben Li, Andreas Geiger, Peng Su, Hongyang Li

2026-06-19强化学习

这篇论文针对自动驾驶中安全关键长尾事件稀缺、单纯扩大真实路测数据收益递减的问题,提出 World Engine:从真实日志发现基座模型失效场景,重建为高保真交互仿真,并生成多样交通变体用于强化学习后训练。结果显示,在 nuPlan 长尾闭环基准上相较监督预训练显著减少失败,收益超过单纯加倍预训练数据;在量产级系统中,仿真碰撞率最高降低 45.5%,200 公里实车测试零接管。

TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index Figure 1
2026-06-19cs.RO

TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index

Tai Hyoung Rhee, Dong-Guw Lee, Ayoung Kim

2026-06-19视觉感知

这篇论文针对室内热红外图像低热对比下随机噪声和固定条纹会破坏机器人定位、深度估计的问题,提出在小波域进行轻量去噪,并用 Wavelet Entropy 与 Directional Stripe Index 分别约束散斑噪声和方向性条纹。作者还构建真实干净/含噪配对的 SCaN-TIR 数据集;结果显示 TIDY 可约 34Hz 在线运行,在严重室内退化和零样本场景中提升去噪鲁棒性,并带来热惯性里程计和单目深度估计的下游增益。

EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models Figure 1
2026-06-19cs.RO

EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models

Thien-Loc Ha, Quang-Tan Nguyen, Trong-Bao Ho, Long Dinh, Minh Duc Nguyen, Gia-Binh Nguyen, Pham Tri Quang, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

VinUniversity, University of Stuttgart

2026-06-19视觉语言视觉感知

这篇论文针对VLA模型缺少旋转几何归纳偏置、在物体朝向变化时依赖大量示教的问题,提出EquiVLA:在不改冻结视觉语言骨干的前提下,用Token级Frame Averaging构造近似SO(2)等变视觉表征,并以等变Flow-matching DiT生成动作。基于GR00T N1.5,LIBERO成功率由78.1%升至92.6%,CALVIN序列长度由3.45升至4.03,真实Mobile ALOHA任务由54%升至72%。

Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection Figure 1
2026-06-19cs.RO

Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection

Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha, Gia-Binh Nguyen, Viet-Thanh Nguyen, Long Dinh, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

VinUniversity, University of Stuttgart

2026-06-19机器人

这篇论文针对动作分块机器人策略在异步执行中因推理延迟导致块边界动作不连续的问题,提出把前缀一致性从“生成后纠偏”改写为“生成前选初始噪声”。PAINT 利用流匹配的局部性,通过反向 Euler 反演和 repainting 构造无需训练、梯度或改模型的噪声锚定方法;在 12 个仿真基准和 6 个真实操作任务中,相比 RTC 等方法提升前缀一致性、成功率和延迟鲁棒性。

Data Standards for Humanoid Robotics: The Missing Infrastructure for Physical AI Figure 1
2026-06-19cs.RO

Data Standards for Humanoid Robotics: The Missing Infrastructure for Physical AI

Shaoshan Liu, Xiugong Qin, Xuan Wu, Xuan Xia, Ning Ding, Jialu Liu, Jie Tang

2026-06-19机器人

本文针对人形机器人数据难以跨平台、跨任务累积的问题,提出数据标准应成为 Physical AI 的基础设施。核心洞察是将数据视为具身交互 episode,而非孤立样本,并要求保留身体、动作、场景、任务、轨迹、结果及时间同步、坐标系、标定等物理一致性。主要结果是给出面向 ISO/WD 26264-1 的标准框架:通用层覆盖元数据、溯源、质量、版本和可追踪性,能力层为操作、移动、人机交互和认知定义领域数据语法。

Temporal Self-Imitation Learning Figure 1
2026-06-19cs.RO

Temporal Self-Imitation Learning

Yinsen Jia, Boyuan Chen

Duke University

2026-06-19模仿学习

这篇论文针对长时程机器人操作中“高回报不等于高效完成”的问题,指出稠密奖励会诱导拖延、绕路或依赖偶然恢复,而快速成功轨迹本身可作为自监督信号。TSIL将已发现的高效成功轨迹转化为配置条件的自适应时间目标,并用效率加权自模仿回放防止好行为被遗忘。在15个长时程操作任务中,方法提升了学习效率、完成速度、快速行为再访问率和对不稳定训练的鲁棒性,但初始探索仍依赖基础学习器。

VOiLA: Vectorized Online Planning with Learned Diffusion Model for POMDP Agents Figure 1
2026-06-19cs.RO

VOiLA: Vectorized Online Planning with Learned Diffusion Model for POMDP Agents

Marcus Hoerger, Rishikesh Joshi, Rahul Shome, Ian Manchester, Hanna Kurniawati

2026-06-19生成模型规划控制

VOiLA针对机器人在部分可观测、不确定环境中难以获得精确POMDP模型的问题,学习任务无关的转移与观测生成模型,并将条件扩散采样器蒸馏为前馈生成器,接入GPU向量化在线规划器VOPP。实验显示采样成本最高降近三个数量级,用少于10%训练数据达到或超过Recurrent SAC,并在未见环境和四足机器人实机任务中表现出更好泛化,实机10/10成功。

Bidirectional Tutoring for Developmental Motor Learning in Robots: Co-Developed Interaction Dynamics Support Stable Learning Figure 1
2026-06-19cs.RO

Bidirectional Tutoring for Developmental Motor Learning in Robots: Co-Developed Interaction Dynamics Support Stable Learning

Rui Fukushima, Jun Tani

2026-06-19机器人

这篇论文针对机器人运动学习常把示教视为单向模仿、忽略师生相互适应的问题,提出“双向辅导”:让导师干预与机器人当前行为和既有内部动力学耦合,并用带生成重放的 PV-RNN 支持阶段式学习。真实人形机器人上的人工与 AI 导师实验显示,该机制产生更一致的轨迹、更稳定的逐阶段泛化,且所需导师干预逐步减少。

A Differentiable Composite Approximation Framework for Autonomous Underwater Vehicle Maneuvering Modeling from Sea-Trial Data Figure 1
2026-06-19cs.RO

A Differentiable Composite Approximation Framework for Autonomous Underwater Vehicle Maneuvering Modeling from Sea-Trial Data

Aobo Wang, Aifei Xia, Zihao Wang, Lizhu Hao

2026-06-19机器人

针对海试数据中 AUV 操纵建模易受多项式项共线性、神经模型过拟合和海流扰动影响的问题,论文将可解释的水动力多项式基与神经残差统一成可微复合预测器,并用敏感度约束的梯度共校准替代先拟合再冻结的灰箱流程,同时引入转弯运动海流补偿。7 米 AUV 多工况海试结果显示,其递推轨迹和速度预测优于纯多项式、纯神经和冻结先验混合基线。

Comparative Study on Agility, Efficiency, and Impact Absorption of Bipedal Robots with Active Toes Figure 1
2026-06-19cs.RO

Comparative Study on Agility, Efficiency, and Impact Absorption of Bipedal Robots with Active Toes

Joong-Gil Kim, Wontae Ye, Geunwoo Cho, Seong-Ho Yun, Se-Hyoung Cho, Yong-Jae Kim

2026-06-19机器人

论文针对多数双足机器人足部结构过简、缺少可主动调力脚趾而限制效率、敏捷性和缓冲能力的问题,设计了带主动脚趾的14自由度双足机器人,并用含耦合传动与功耗建模的高保真仿真进行公平消融比较。结果显示,在1.33 m/s行走时主动脚趾使CoT降低17.5%、脚跟着地GRF降低5.0%,敏捷测试中的平均和最大路径偏差分别下降25.0%与34.0%。

Route-Constrained Robust Fusion Estimation for MEMS/GNSS Integrated Navigation of Unmanned Ground Vehicles in GNSS Degraded Environments Figure 1
2026-06-19cs.RO

Route-Constrained Robust Fusion Estimation for MEMS/GNSS Integrated Navigation of Unmanned Ground Vehicles in GNSS Degraded Environments

Jingzhi Cui, Chao Zhang, Yuliang Mao, Shaolin Lü, Dongmei Li, Huan Che, Rong Zhang

2026-06-19机器人安全鲁棒

这篇论文面向隧道等 GNSS 严重遮挡场景中无人地面车仅靠惯导和轮速计易累积漂移的问题,核心思路是把短时航迹与高精地图任务路线做局部匹配,经二维刚体变换生成伪位置观测并注入 EKF,同时加入触发、质量校验、路线偏移补偿和单步限幅。长隧道、多段隧道和弯道实验显示,该方法可抑制误差累积和最大偏离风险,提升道路级定位连续性。

ForEnt: A Multi-Modal Dataset for Characterizing Quadruped Robot Entrapments in Forest Environments Figure 1
2026-06-19cs.RO

ForEnt: A Multi-Modal Dataset for Characterizing Quadruped Robot Entrapments in Forest Environments

Natapat Kirdwichai, Danesh Tarapore

2026-06-19机器人数据集/基准

这篇论文针对森林巡检中四足机器人易被藤蔓、低枝或复杂地面困住、而现有森林数据集多记录正常行走的问题,发布 ForEnt 失败中心多模态数据集。其创新在于用 Unitree Go2 在 8 个真实林地点采集约 1.7 km、11 段序列和 69 次人工标注困陷事件,提供同步 RGB-D、LiDAR、本体感知与第三视角视频,并用视觉可通行性估计和本体感知缠绕检测展示其可用于暴露现有方法在真实困陷场景下的局限。

Safe Local Navigation for Ackermann-Steered Robots in Unmapped Environments Figure 1
2026-06-19cs.RO

Safe Local Navigation for Ackermann-Steered Robots in Unmapped Environments

Christian Schaible, Shahin Sirouspour

2026-06-19机器人安全鲁棒

面向搜救、探索等无地图且无全局目标场景,本文关注 Ackermann 转向机器人如何在实时约束下安全局部导航。核心做法是先从局部障碍中选择最大开阔方向,再用凸二次规划生成左右障碍边界线以最大化间隙,并由反馈线性化 PD 控制跟踪。仿真和 1/10 RC 车实验显示,相比部分探索式规划器,该方法路径更安全、控制 effort 较低且计算时间更短。

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning Figure 1
2026-06-19cs.RO

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

Calvin Luo, Chen Sun, Shuran Song

2026-06-19生成模型

面向预训练扩散机器人策略在线强化微调中探索低效的问题,DF-ExpEnse 将扩散策略采样作为连续动作空间的候选过滤器,再用 critic ensemble 以价值下界和不确定性评估探索兴趣;在多机器人场景中还通过跨机体归一化减少重复探索。文中在 RoboMimic、OpenAI Gym 和 DexMimicGen 等操控与 locomotion 任务上,相比默认微调和替代动作选择策略表现出更高样本效率。

Scaling Self-Play for End-to-End Driving Figure 1
2026-06-19cs.RO

Scaling Self-Play for End-to-End Driving

Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

NYU Tandon School of Engineering, 6 McMaster University, 7 Princeton University

2026-06-19机器人

论文针对端到端自动驾驶依赖离线人类日志、缺少闭环反馈而易累积误差的问题,提出在高吞吐像素级模拟器 Gigapixel 中做大规模自博弈,并用特权 RL 教师通过 self-play DAgger 蒸馏像素策略,再以轻量感知适配迁移到真实传感器。结果显示无需人类轨迹监督即可在 HUGSIM 达到领先、在 NAVSIM-v2 具竞争力,且性能随自博弈规模提升而增长,增益可能主要来自 scaling / data。

CTS-MoE: Implicit Terrain Adaptation via Mixture-of-Experts for Perceptive Locomotion Figure 1
2026-06-19cs.RO

CTS-MoE: Implicit Terrain Adaptation via Mixture-of-Experts for Perceptive Locomotion

Francisco Affonso, Matheus P. Angarola, Ana Luiza Mineiro, Aditya Potnis, Marcelo Becker, Girish Chowdhary

University of Illinois Urbana-Champaign, University of São Paulo

2026-06-19机器人

针对足式机器人在楼梯、沟壑和障碍等不连续地形上单一策略过保守、分层子策略又难以平滑泛化的问题,CTS-MoE将多任务强化学习中的共享与隔离拆开处理:用感知条件的稠密MoE actor组合专家行为,用任务特定critic抑制价值干扰,并在并发师生框架中端到端训练。仿真与Unitree Go1实机结果显示,其在已见和未见地形上较单体基线降低跟踪误差、提高成功率。

Formal Verification of Learned Multi-Agent Communication Policies via Decision Tree Distillation Figure 1
2026-06-19cs.RO

Formal Verification of Learned Multi-Agent Communication Policies via Decision Tree Distillation

Ahmad Farooq, Kamran Iqbal

2026-06-19机器人

面向无人机群等安全关键多机器人场景,论文关注学习到的多智能体通信策略难以形式化认证的问题。其核心做法是将神经策略经领域特征抽取蒸馏为决策树,再自动转成 PRISM 模型并用成对组合分解验证 PCTL 性质。实验在5–7架无人机任务中达到约97.9%蒸馏保真度,18项性质满足16项,碰撞概率0.3%低于1%阈值,且蒙特卡洛显示与原网络偏差不超过0.6个百分点。

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification Figure 1
2026-06-19cs.RO

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Ameya Salvi, Jie Hu

Authors are with Hitachi America, Ltd., Michigan, U.S.A.

2026-06-19机器人

面向仓储等动态场景中机器人故障形态多变、规则检测和微调式VLM难以扩展的问题,Fail-RAG将故障图像与上下文嵌入到检索库,通过相似度召回失败案例,再让VLM按模板判断并解释原因,无需为新边界情况重新微调。仿真与真实机械臂、移动操作机器人实验显示,其在五类操作上的故障检测准确率平均比直接使用现成VLM高25个百分点。

Safe, Real-Time Active Model Discrimination and Fault Diagnosis for Nonlinear Systems via Differentiable Reachability Figure 1
2026-06-19cs.RO

Safe, Real-Time Active Model Discrimination and Fault Diagnosis for Nonlinear Systems via Differentiable Reachability

Xinpei Ni, Melkior Ornik, Glen Chou, Samuel Coogan

X. Ni, G. Chou and S. Coogan are with the Institute of Robotics and Intelligent Machines (IRIM), Georgia Institute of Technology, Atlanta, GA 30332, USA

2026-06-19安全鲁棒

面向长时运行机器人中传感器漂移、执行器退化等故障会危及安全且需快速隔离的问题,论文将主动故障诊断表述为带安全约束的输出反馈策略优化,用可微区间可达集近似并最小化候选模型输出可达集重叠来生成区分性动作。实验覆盖四旋翼、战机、差速车硬件和四足导航,最多11种故障模式,在线规划低于50 ms,并报告了较基线更高的区分成功率与形式化安全保证。

One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies Figure 1
2026-06-19cs.RO

One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies

Chuer Pan, Litian Liang, Dominik Bauer, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Shuran Song

Stanford University, 2 Columbia University, 3 Toyota Research Institute

2026-06-19机器人

这篇论文针对视觉运动策略在初始位姿变化和未见障碍下易失效、而重复采集示教成本高的问题,提出 1001 Demos:用单次眼在手鱼眼示教重建可编辑 3DGS 场景,并通过轨迹优化生成动作—视角一致、无碰撞且接触前物理可行的增强轨迹。仿真与真实实验显示,该方法提升了多类操作任务在原场景及含障碍增强场景中的成功率。

pdSTL: Probabilistic Differentiable Signal Temporal Logic for Stochastic Systems Figure 1
2026-06-19cs.RO

pdSTL: Probabilistic Differentiable Signal Temporal Logic for Stochastic Systems

Bennett Dogbey, Hemanth Manjunatha

All Authors are with Dept. of Mechanical and Aerospace Engineering, Oklahoma State University, Stillwater, OK USA

2026-06-19机器人

这篇论文针对机器人在噪声动力学、感知误差下用确定性 STL 规划会高估安全裕度的问题,提出 pdSTL:在信念轨迹上用区间概率语义传播保守满足界,并把时序逻辑算子展开成可微的 LSTM 式递归监测器,从而可直接嵌入梯度优化。仿真避障、自动驾驶换道和 Crazyflie 实飞显示,pdSTL 相比确定性可微 STL 有更高成功率与安全率,且规划保证与部署表现更一致。

SCAN-Planner: Spatial Collision-Aware Local Planning for Route-Guided Long-Range Quadruped Navigation Figure 1
2026-06-19cs.RO

SCAN-Planner: Spatial Collision-Aware Local Planning for Route-Guided Long-Range Quadruped Navigation

Han Zheng, Zhe Chen, Yiwen Fu, Ming Yang, Tong Qin

Shanghai Jiao Tong University, Shanghai, China.

2026-06-19机器人规划控制

面向四足机器人在窄通道、杂乱室内、楼梯和大尺度三维环境中的长距离导航,SCAN-Planner针对传统局部规划过度保守、难处理悬空障碍和易陷入局部死胡同的问题,提出偏航感知双圆柱足迹、投影A*与z梯度抑制、机器人中心滑动地图及边界回退机制,在保持位置B样条优化效率的同时进行三维全身碰撞检查。仿真和实机结果显示其能生成更安全、平滑且高效的轨迹,覆盖密集障碍、楼梯和室内外长距离任务。

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? Figure 1
2026-06-19cs.CV

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

2026-06-19视觉感知强化学习

这篇论文针对视频生成式世界动作模型在机器人控制中推理昂贵、易建模无关细节且长时预测误差会误导动作的问题,提出 ImageWAM:用预训练图像编辑模型的去噪 KV cache 表示“当前到目标”的指令引导视觉变化,再驱动 flow-matching 动作专家而不解码未来帧。实验显示其在仿真和真实任务上优于标准 VLA 与竞争性 WAM,并将 FLOPs 降至视频 WAM 的 1/6、延迟降至 1/4。

A Categorial and Sheaf-Theoretic Semantics for Autonomic Component Ensembles Figure 1
2026-06-19cs.RO

A Categorial and Sheaf-Theoretic Semantics for Autonomic Component Ensembles

Manuel Hernández, Eduardo Sánchez-Soto

2026-06-19机器人

面向机器人群体等大规模自治组件系统,论文指出SCEL的操作语义难以刻画全局一致性与涌现性质,提出用范畴论和层论重解释SCEL:组件对应拓扑点,动态集成对应开集,分布式知识对应层数据,信息共享等价于局部数据粘合。主要结果是给出一套形式语义框架,并用层上同调把共识失败、任务不可解等现象表述为可度量的拓扑障碍;但文中未充分说明实验验证或工程增益。

Proprioceptive Invariant State Estimation for Humanoid Robots on Non-Inertial Ground Figure 1
2026-06-19cs.RO

Proprioceptive Invariant State Estimation for Humanoid Robots on Non-Inertial Ground

Falak Mandali, Zijian He, Yan Gu

Purdue University, West Lafayette, IN 47907, USA.

2026-06-19机器人

本文针对人形机器人在船舶、车辆等非惯性地面上估计失准的问题,提出仅依赖本体传感的 InEKF:利用足端 IMU 与接触运动学约束,把地面运动引入过程和右不变测量模型,无需地面传感器。Digit 实验显示,相比既有 InEKF 收敛加快 96%、位置误差降低 80%,旋转地面行走在 1 米初始误差下平均误差小于 9 厘米。

Simulating Robotic Locomotion in Sand: Resistive Force Theory in an Open-Source Physics Engine Figure 1
2026-06-19cs.RO

Simulating Robotic Locomotion in Sand: Resistive Force Theory in an Open-Source Physics Engine

Ryan Walker Brown, Laura K. Treers, Kathryn A. Daltorio

2026-06-19机器人学习理论

这篇论文针对现有机器人仿真难以描述沙地陷入、支撑与步态受阻的问题,将三维颗粒阻力理论接入开源 MuJoCo,形成 RFT-SiM,用离散表面片按深度、姿态和运动方向施加阻力而非逐粒建模。实验验证显示其能保留足端形状、速度和载荷变化带来的趋势,并将 12 自由度六足机器人在沙中的行走距离与足部下陷预测控制在实测约 20% 误差内。

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning Figure 1
2026-06-19cs.LG

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel

2026-06-19三维

面向机器人操作中密集3D观测高维、耗内存且缺少物体结构的问题,3D-DLP将DLP扩展到RGB-D和彩色/占据体素,以自监督重建学习带3D关键点、尺度和外观的粒子表示,并引入外观感知K-means先验与色度损失。实验显示其可做无监督场景分解和可控编辑,在MimicGen与RLBench上较2D粒子和体素基线提升操作成功率,但体素内存开销和复杂动态场景泛化仍是限制。

Playful Agentic Robot Learning Figure 1
2026-06-19cs.RO

Playful Agentic Robot Learning

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

University of California, Berkeley

2026-06-19机器人

这篇论文针对现有机器人代码代理只能在接到任务后被动积累技能的问题,提出让机器人在部署前通过“玩耍”主动学习。核心是 RATs:自主生成新颖但可学的探索目标,用 Code-as-Policy 执行、逐步验证、失败诊断和重试,并把成功行为沉淀为可检索代码技能库。实验显示,该技能库在 LIBERO-PRO、MolmoSpaces 上相对 CaP-Agent0 分别提升 20.6 和 17.0 个百分点,并可迁移到 RoboSuite 与真实场景,但真实部署规模仍有限。

FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning Figure 1
2026-06-19cs.LG

FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning

Takanori Yoshimoto, Yang Hu, Naruya Kondo, Tatsuya Matsushima

University of Tsukuba, The University of Tokyo

2026-06-19机器人

这篇论文针对潜在动作模型中“固定容量瓶颈”与真实转移复杂度不匹配的问题:容量太小会丢失对齐动作所需线索,太大又会在少量或偏分布标签下引入难以消解的无关变化。FlexLAM的核心做法是在不改架构和损失的前提下,用嵌套 dropout 训练可变长度、前缀有效的潜在动作码,使同一模型可按需使用不同 token 预算。实验显示,单个 FlexLAM 在 DMLab 的 4/16/64 token 预算下均优于分别训练的固定容量基线,并改善 Ego4D 转移重建,但真实机器人策略迁移仍文中未充分说明。

DiffusionVS: A Generative Framework for Robust Visual Servoing Based on Diffusion Policy Figure 1
2026-06-19cs.RO

DiffusionVS: A Generative Framework for Robust Visual Servoing Based on Diffusion Policy

Hongkang Cui, Rui He, Haoyao Chen

2026-06-19生成模型强化学习安全鲁棒

本文针对回归式视觉伺服在噪声和分布偏移下易抖动、误差累积的问题,将 Diffusion Policy 引入伺服控制,用标签角点归一化图像坐标条件生成一段相机速度,并通过在线交互采样扩充训练数据。实验显示其在仿真中接近 100% 成功率、实物 93%,且作为扩散模块接入既有网络可最高提升约 30% 成功率。

3D Scene Graphs: Open Challenges and Future Directions Figure 1
2026-06-19cs.RO

3D Scene Graphs: Open Challenges and Future Directions

Dennis Rotondi, Francesco Argenziano, Sebastian Koch, Nathan Hughes, Martin Buechner, Johanna Wald, Lukas Rosenberger Schmid, Daniele Nardi, Abhinav Valada, Liam Paull, Federico Tombari, Luca Carlone, Kai O. Arras

University of Stuttgart, Sapienza University of Rome, University of Freiburg, University of Montreal, be exhaustive and included all available relevant works in, ric grounding, and scalability to large scenes. Subsequently

2026-06-19三维

面向机器人在真实三维环境中同时需要几何精度、语义理解与可查询长期记忆的问题,本文将3D场景图作为空间AI中连接SLAM、感知、语言与规划的显式表示来梳理。其核心贡献不是提出新算法,而是统一定义节点、边、层级、时间动态与功能/可供性扩展,系统比较构建流程、应用与评测协议。主要结果是指出领域仍受术语碎片化、基准和指标不一致、真实部署鲁棒性不足限制,并提供持续更新的3DSG论文数据库。

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League Figure 1
2026-06-19cs.RO

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

2026-06-19数据集/基准

这篇论文针对机器人装配中“符号规划能推理但缺少物理落地、端到端 VLA 又难处理长时序约束”的缺口,提出基于 LEGO Duplo 的 WorkBenchMark:400 个四级复杂度任务、仿真环境与部分真实评测,并给出结合开放词汇感知、装配-by-拆解规划和碰撞感知执行的基线。实验显示该规划流水线在各难度层级均优于现代 VLA/VLM 基线,后者随空间复杂度上升明显退化。

Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots Figure 1
2026-06-19cs.RO

Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots

Khurram Javed, Joseph Modayil, Gloria Kennickell, Richard S. Sutton, John Carmack

2026-06-19机器人强化学习安全鲁棒

这篇论文针对真实机器人上直接进行实时强化学习缺少低成本、耐用基准的问题,提出 Physical Atari:用 Robotroller 操作实体 Atari 手柄,并由 Atari Devbox 以视觉方式呈现游戏画面和奖励。其关键设计是轴承减磨、舵机高频监控与限流保护,以及3D打印和商用部件降低门槛。平台成本低于1000美元,可连续运行数周无机械故障;实验表明算法能在机器人上直接学习,但很小的机体/部署分布偏移也会显著损害策略性能,凸显在线适应的重要性。

2026-06-18

62 篇
Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning Figure 1
2026-06-18cs.RO

Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

Seoul National University

2026-06-18机器人视觉语言三维

面向长程灵巧操作中语言指令难以可靠落到三维接触、放置和工具轨迹的问题,论文将VLM语义规划与物理执行解耦,用多视角RGB标定图像融合2D关键点,通过三角化和参考视角射线投票获得3D grounding,并结合原子动作库、抓取可行性筛选和闭环重规划。真实机器人实验显示其在3D定位精度和执行成功率上优于单视角RGB-D与微调VLA基线,可零样本处理新物体和工具使用任务。

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos Figure 1
2026-06-18cs.RO

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik

2026-06-18机器人视觉感知

论文针对灵巧手机器人数据依赖昂贵遥操作/仿真探索的问题,提出 Do as I Do:从普通单目 RGB 人类视频中重建手-物体 4D 交互,再通过带动力学的采样优化重定向为可执行的多指手臂动作,尽量不限制物体类别和行为类型。实验显示其在手物交互估计和轨迹提取上优于既有方法,并能从网络/第一视角/第三视角视频生成可在真实灵巧手上回放的数据,但仍受刚体假设、单目深度与接触歧义限制。

UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning Figure 1
2026-06-18cs.LG

UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

Mohamed Nabail, Leo Cheng, Jingmin Wang, Nicholas Rhinehart

2026-06-18强化学习规划控制安全鲁棒

针对偏好强化学习早期依赖被动采样、交互与人工偏好成本高的问题,UBP2把奖励、动力学和值函数的不确定性统一纳入模型预测规划,用集成模型在想象轨迹上同时权衡回报与信息增益,并用乐观查询选择偏好对。理论上给出有限/无限时域次线性遗憾界;在 Meta-World 操作任务中,相比无乐观规划的模型式方法和模型无关偏好RL表现出更高样本效率。

Modeling Branches for Active Manipulation using Iterative Parameter Estimation Figure 1
2026-06-18cs.RO

Modeling Branches for Active Manipulation using Iterative Parameter Estimation

Madhav Rijal, Rashik Shrestha, Trevor Smith, Yu Gu

2026-06-18机器人

面向农业机器人在授粉、采摘等任务中需要拨开或稳定脆弱枝条、且传统避障/经验推枝易造成损伤的问题,论文将点云重建的枝条自动转为四面体有限元模型,并用真实形变迭代估计材料参数,再在规划中显式约束形变能与受力。30次不同几何和材质枝条实验显示,平均形变能降低35.69%,代价是路径长度增加8.10%。

Observability and Consistency Analysis for Visual-Inertial Navigation with Anchored Feature Parameterizations Figure 1
2026-06-18cs.RO

Observability and Consistency Analysis for Visual-Inertial Navigation with Anchored Feature Parameterizations

Mitchell Cohen, Vassili Korotkine, James Richard Forbes

2026-06-18机器人

面向资源受限场景中仍广泛使用的 EKF/MSCKF 类 VINS,论文关注锚定特征参数化对可观性与一致性的影响。核心洞察是其不可观子空间不依赖地标状态,因此地标线性化误差较少破坏一致性,但仍依赖导航状态,需结合 FEJ 或右不变误差等约束。仿真和 TUM-VI 实验显示,锚定特征在特征初始化较差或噪声较高时明显优于全局地标表示,单独使用也可接近带一致性改进的全局表示。

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models Figure 1
2026-06-18cs.LG

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

CogAI Lab, FusionBrain Lab, Applied AI Institute, HSE University

2026-06-18视觉语言视觉感知强化学习

本文针对VLA模型经机器人数据微调后是否仍保留常识与世界知识这一盲点,提出Act2Answer:把VLM问答改造成桌面短程动作选择,用放置动作回答以降低控制混淆,并做逐层意图探测。实验覆盖7个VLA和9个VLM,发现VLA在颜色、形状等浅层感知上尚可,但在情绪、公共信息等高层语义类别明显落后于源VLM;VQA共训练有助于保留知识,相关信号多出现在中层而在高层衰减。

A Mixed-Reality Testbed for Autonomous Vehicles Figure 1
2026-06-18cs.RO

A Mixed-Reality Testbed for Autonomous Vehicles

H. M. Sabbir Ahmad, Ehsan Sabouni, Emrullah Celik, Zean Wan, Damola Ajeyemi, Christos G. Cassandras, Wenchao Li

Boston University, Department of Electrical and Computer Engineering

2026-06-18机器人

针对自动驾驶算法在仿真与真实部署之间验证断层、物理平台规模和场景受限的问题,本文构建了融合 CARLA 与实体移动机器人的混合现实 HIL 测试床,支持多模态传感、V2X 通信和虚实多智能体扩展,并集成基于 CBF 的在线自监督安全控制框架。实验展示了平台可运行感知、规划、控制与联网车辆场景,并能在训练和部署中维持安全约束,但量化优于既有测试床的增益文中未充分说明。

Shape Sensing of Continuum Robots using Direct Laser Writing Figure 1
2026-06-18cs.RO

Shape Sensing of Continuum Robots using Direct Laser Writing

Amber K. Rothe, Nidhi Malhotra, Jaydev P. Desai

2026-06-18机器人

连续体机器人适合微创手术,但柔顺结构使形状估计困难,现有成像、磁/光传感方案在速度、干扰、成本或集成上受限。本文将直接激光写入的石墨烯应变传感器直接制备在聚酰亚胺切槽管关节外表面,并用同一激光工位完成传感器与柔性关节加工,减少装配对准误差且保留中央腔道。实验对滞后、速率依赖和松弛进行表征,关节角预测误差最低1.76°,闭环跟踪误差低于3°。

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems Figure 1
2026-06-18cs.CV

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems

Haohua Que, Zhipeng Bao, Qianyi Wu, Handong Yao

All authors are with the College of Engineering, University of Georgia, Athens, GA 30602, USA.

2026-06-18机器人

面向V2X中云端大多模态模型带来的全帧上传带宽与预填充延迟瓶颈,CABLE利用交通场景目标的时空稀疏性,将上一帧云端分割掩码经自车运动补偿、残差运动细化和走廊包络融合生成下一帧ROI,仅上传掩码图像并反馈更新。五个自动驾驶数据集上,ROI像素覆盖减少73%–87%,估计LMM预填充加速5–8倍,但检测质量有一定折中。

OneCanvas: 3D Scene Understanding via Panoramic Reprojection Figure 1
2026-06-18cs.CV

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

Technical University of Munich

2026-06-18三维

面向机器人/具身智能中需要从特定视角判断距离、方向与可见性的3D场景理解,OneCanvas不再为VLM另接复杂几何编码器,而是用深度和位姿把多视角patch反投影到统一世界坐标,再按经纬度放到一张全景画布并加入度量3D位置嵌入,让预训练VLM像读单图一样推理。配合程序化空间预训练,它在SQA3D、VSI-Bench和零样本SPBench上达到SOTA,并声称训练算力低一个数量级。

Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation Figure 1
2026-06-18cs.RO

Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation

Thomas M. Kwok, Nicholas Koenig, Yue Hu

2026-06-18机器人

面向远程护理等机器人遥操作场景,单RGB-D无标记动捕虽便宜易部署,但上肢自遮挡会造成关节深度跳变和臂长不一致。论文提出AKC后处理,用固定上/前臂长度与勾股几何从腕部位置确定被遮挡关节深度,无需概率模型或调参。与Vicon对比及仿真、实体机器人遥操作实验显示,该方法在静态和动态动作中降低误差、保持解剖一致性,并提升长时间严重遮挡下的稳定性。

Mobile Pedipulation for Object Sliding via Hierarchical Control on a Wheeled Bipedal Robot Figure 1
2026-06-18cs.RO

Mobile Pedipulation for Object Sliding via Hierarchical Control on a Wheeled Bipedal Robot

Yue Qin, Yulun Zhuang, Zelin Shen, Yanran Ding

The authors are with the Department of Robotics, University of Michigan, Ann Arbor, MI 48109, USA., This work was supported by National Science Foundation, under grant 2427036 and Schaffler Group USA, Inc.

2026-06-18机器人规划控制

针对轮式双足机器人虽具移动性但缺少与地面物体动态交互能力的问题,本文提出分层控制框架:用含髋滚转自由度和多接触模式的三刚体/TRBO模型构建NMPC,并结合考虑粘滑转变的轨迹优化规划,实现轮腿协同滑动物体。实机在Tron1上完成侧向取出桌下1 kg物体、用scooting推动4 kg物体0.228 m,仿真可启动23 kg物体滑动,但依赖动捕、点质量物体模型和预设接触序列。

Constant Time-Delay Leader Following with Neural Networks and Invariant Extended Kalman Filters for Arbitrary Trajectories Figure 1
2026-06-18cs.RO

Constant Time-Delay Leader Following with Neural Networks and Invariant Extended Kalman Filters for Arbitrary Trajectories

Luka Antonyshyn, Paulo Ricardo Marques de Araujo, Sidney Givigi

Luka Antonyshyn is with the University of Toronto Institute for Aerospace Studies, Toronto, Canada

2026-06-18机器人

本文面向无车间通信、无公共坐标系和无 GPS 的车队跟随场景,解决后车按固定时间延迟复现前车任意轨迹的问题。核心做法是用概率 Seq2Seq 网络为 SE(2) 上的 IEKF 预测热启动,并接入几何 MPC 利用流形轨迹估计。仿真中相较纯 IEKF、学习基线和真值参考进行对比,真实机器人实验也验证了在非线性、变速轨迹下的跟踪可行性与误差改进。

Invertible Neural Network Adapter for One-Step Flow Matching in Robot Manipulation Figure 1
2026-06-18cs.RO

Invertible Neural Network Adapter for One-Step Flow Matching in Robot Manipulation

Yu Zhang, Kangyi Ji, Yongxiang Zou, Rongtao Xu, Feng Zheng, Long Cheng

2026-06-18机器人生成模型

面向机器人操作中流匹配策略迭代推理慢、单步近似易损失动态一致性的问题,论文提出可插拔的可逆神经网络适配器,将动作生成约束在双射潜空间中,以保留信息并修正单步预测。实验覆盖 RoboTwin、Libero 与真实机械臂任务,报告成功率达到或接近 SOTA,并将 VLA 平均延迟由 110 ms 降至 61 ms。

FAST-LIVGO: A Degeneracy-Robust LiDAR-Inertial-Visual-GNSS Fusion Odometry Figure 1
2026-06-18cs.RO

FAST-LIVGO: A Degeneracy-Robust LiDAR-Inertial-Visual-GNSS Fusion Odometry

Zhiyu Chen, Chunran Zheng, Jiayu Wen, XiaoLei Zhang, Jiaming Xu, Feng Pan, Yukang Cui

2026-06-18安全鲁棒

面向长距离、高动态和退化场景中 LIVO 易漂移、GNSS 易受多路径污染的问题,FAST-LIVGO 在 ESIKF 内紧耦合激光、惯性、视觉与 GNSS,引入 DTW 时空对齐、Doppler/固定锚点 TDCP 约束,并按 LIVO 退化程度切换外点剔除模式。M3DGR 与 20 m/s 固定翼 UAV 实验显示其可减少累计漂移和地图重影,精度与鲁棒性优于对比方法。

Learning to Annotate Delayed and False AEB Events: A Practical System for Extreme Class Imbalance and Asymmetric Label Noise Figure 1
2026-06-18cs.RO

Learning to Annotate Delayed and False AEB Events: A Practical System for Extreme Class Imbalance and Asymmetric Label Noise

Mengxiang Hao, Xin Jiang, Xinghao Huang, Wenliang Su, Zhiteng Wang, Junjie Rao, Xiaotian Yang, Wei Liao, Chengyu Han, Gen Liang, Yulun Song, Zhitao Xu, Xianpeng Lang

2026-06-18机器人

这篇论文针对量产 AEB 日常触发数据中延迟/误触发样本不足 5%、人工筛查成本高的问题,将事件标注建模为三分类任务。核心做法是结合面向 AEB 物理特性的少数类增强,与基于稳定难度估计和探针自适应阈值的噪声抑制,以缓解极端类别不均衡和真触发标签中的非对称噪声。系统已部署到生产流程,报告称延迟/误触发召回提升 80%,人工工作量降低 50%。

Hardware- and Vision-in-the-Loop Validation of Deep Monocular Pose Estimation for Autonomous Maritime UAV Flight Figure 1
2026-06-18cs.RO

Hardware- and Vision-in-the-Loop Validation of Deep Monocular Pose Estimation for Autonomous Maritime UAV Flight

Maneesha Wickramasuriya, Beomyeol Yu, Jaden Shin, Mason Huslig, Taeyoung Lee, Murray Snyder

2026-06-18视觉感知三维

面向舰载无人机海上验证成本高、受天气制约且风险大的问题,本文构建硬件在环/视觉在环闭环验证框架:用3D Gaussian Splatting实时渲染海色情景,在Jetson上运行TNN-MO单目6D位姿估计,并以延迟卡尔曼滤波融合IMU补偿约0.3秒感知延迟。室内实飞完成自主起飞、轨迹跟踪和降落,表明延迟单目视觉在补偿后可维持稳定闭环飞行。

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision Figure 1
2026-06-18cs.RO

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhong

Beihang University, ShanghaiTech University, Tsinghua University

2026-06-18视觉感知数据集/基准

针对触觉表示学习受传感器和机器人形态差异限制、缺少可比较评测的问题,本文提出以第一视角视觉配对全手触觉的 HT-Bench,含 226 任务、千万级 RGB 与触觉帧,并设计检索、补全、视觉到触觉生成和时序预测评测;同时提出向量量化的 HandTouch,通过空间、跨模态、时间渐进训练学习表示。结果显示其在 Recall@5、补全 RMSE 和 OOD cIoU 上均优于基线,但效果可能部分来自大规模配对数据。

Viking Hill Dataset: A Lidar-Radar-Camera Dataset for Detection and Segmentation in Forest Scenes Figure 1
2026-06-18cs.RO

Viking Hill Dataset: A Lidar-Radar-Camera Dataset for Detection and Segmentation in Forest Scenes

Vladimír Kubelka, Oleksandr Kotlyar, Unal Artan, Martin Magnusson

2026-06-18视觉感知数据集/基准

面向林下机器人在遮挡、泥尘和季节变化中感知树木/植被的需求,论文发布 Viking Hill 多模态森林数据集,首次提供共注册 4D 成像雷达、激光雷达与 RGB,并用共享 3D cuboid、单木胸径和 ROS 标注工具支持检测、分割与定位研究。MinkowskiUNet 基线显示雷达在地面和树冠上接近激光雷达(IoU 约 91%、86%),但树干等细结构仍明显落后(56% vs 74%)。

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning Figure 1
2026-06-18cs.RO

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

University of California, Los Angeles, Zhejiang University, Massachusetts Institute of Technology

2026-06-18机器人三维

针对人行道比道路更拥挤、结构更弱且难以获取大规模稠密3D标注的问题,论文提出 WalkOCC:用少量 RGB-LiDAR 配对序列生成伪3D占用监督,并通过射线行进的2D-3D一致性把大量单目图像纳入训练。其核心价值在于兼顾几何约束与可扩展数据覆盖,在 Sidewalk3D 上提升占用预测与路缘等细粒度结构分割,报告 mIoU 提升15.6%,夜间、跨场景和跨机器人形态泛化也更稳。

GCNGrasp-VP: Affordance-Guided View Planning for Efficient Task-Oriented Grasping Figure 1
2026-06-18cs.RO

GCNGrasp-VP: Affordance-Guided View Planning for Efficient Task-Oriented Grasping

Zanjia Tong, Wenlong Dong, Chengjie Zhang, Hong Zhang

Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology, Shenzhen, China.

2026-06-18规划控制

本文针对任务导向抓取在初始视角遮挡下易失效的问题,指出现有视角规划多关注几何/重建不确定性而忽略任务相关局部区域。方法将 GCNGrasp-v2 的抓取评估与可供性场预测解耦并复用,用可供性作为信息增益直接规划相机视角,无需完整场景重建。实验显示仅一次视角调整即可优于场景不确定性基线,真实单物体抓取成功率明显提升且保持毫秒级延迟。

ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing Figure 1
2026-06-18cs.RO

ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing

Alessandro Scherl, Bernhard Neuberger, Simon Schwaiger, David Mulero-Pérez, Lucas Muster, Jose Garcia-Rodriguez

2026-06-18视觉感知

本文针对基于自监督 ViT 特征的视觉伺服在“粗粒度更稳但不准、高分辨率更准但慢且仍易误匹配”之间的矛盾,提出 ART-VS:先用原生分辨率做全局粗对齐,误差足够小时再切换到高分辨率分块匹配,将对应限制在局部邻域以提升精度和收敛稳定性。无需任务训练下,扰动场景收敛率达 95.4%,较标准/全分辨率 ViT-VS 分别高 18.8/14.4 个百分点,并在真实抓取中取得 95% 和 98% 成功率。

ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks Figure 1
2026-06-18cs.RO

ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks

Simon Schwaiger, David Seyser, Alessandro Scherl, Wilfried Wöber, Gerald Steinbauer-Wagner

Graz University of Technology, Institute of Software Engineering and Artificial Intelligence, University of Applied Sciences Technikum Wien, Department of Industrial Engineering, University of Alicante, Department of Computer Technology, University of Natural Resources and Life Sciences, Institute for Integrative Nature Conservation Research

2026-06-18机器人

面向语言条件机器人任务,论文针对 VLM 稠密特征噪声大、空间一致性差的问题,提出 ReSiReg:利用中间层较稳定的空间结构聚类成视觉原型,再将每个 patch 重构为原型级语言嵌入的软混合,从而不增加参数地改善语言落地特征。实验覆盖开放词汇分割、3D 语义建图和真实操作场景,显示稠密检索与目标激活更稳定,并给出较小的 25M 参数机器人用 VLM。

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots Figure 1
2026-06-18cs.RO

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots

Roberto Corlito, Fabian Schmidt, Nils Seibert, Markus Enzweiler, Abhinav Valada, Arne Roennau

Machine Intelligence and Robotics Lab, Karlsruhe Institute of Technology (KIT), Germany., Institute for Intelligent Systems, Esslingen University of Applied Sciences, Germany. 3 Department of Computer Science, University of Freiburg, Germany.

2026-06-18机器人视觉语言数据集/基准

针对四足机器人足端冲击、振动和快速转动会破坏常规 SLAM 感知这一问题,论文利用 ANYmal D 的 GrandTour 数据集系统剥离相机模态、快门类型和 IMU 档次对视觉/视觉惯性/激光视觉惯性 SLAM 的影响。核心洞察是硬件配置本身显著决定鲁棒性:双目优于单目和 RGB-D,全局快门明显减少运动导致的跟踪失败,而在剧烈腿式运动下,常规惯性融合反而可能降低 ORB-SLAM3、RTAB-Map 等视觉框架表现。

Congestion-Aware Robot Tour Planning in Crowded Environments Figure 1
2026-06-18cs.RO

Congestion-Aware Robot Tour Planning in Crowded Environments

Stefano Bernagozzi, Charlie Street, Masoumeh Mansouri, Lorenzo Natale

2026-06-18机器人规划控制

面向博物馆导览、商场配送等需依次访问多个地点的服务机器人,论文指出人群拥堵会触发避障并显著拉长行程,最短路未必最优。其核心做法是用真实人流学习 CLiFF 动态地图,在线预测人群轨迹与边上拥堵分布,再构建滚动时域 MDP 选择访问顺序和路径。实验在真实商场人群数据上显示,相比考虑拥堵的哈密顿路径基线可生成更快的巡游,但更大规模场景的扩展性仍待验证。

Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation Figure 1
2026-06-18cs.CV

Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation

Zirui Zheng, Jiaqian Yu, Xiongfeng Peng, jun shi, Mingyi Li, Chao Zhang, Weiming Li, Dong Wang, Huchuan Lu, Xu Jia

2026-06-18机器人强化学习

面向长时程机器人操作,论文指出腕部相机快速运动和末端遮挡会让动作条件世界模型遗忘或幻觉早期可见物体。Mem-World 的核心是 W-VMem:用4D、以腕视角为中心的 surfel 记忆锚定历史观测,并按未来动作相关视角渲染和评分检索历史帧。实验显示其提升时间一致性,策略评估与真实表现的 Pearson 相关性较 Ctrl-World 提高14.5%,合成数据训练使长程任务成功率从58%升至72%。

TactSpace: Learning a Physics-enriched Shared Latent Space for Tactile Sim-to-Real Transfer Figure 1
2026-06-18cs.RO

TactSpace: Learning a Physics-enriched Shared Latent Space for Tactile Sim-to-Real Transfer

Arunim Joarder, Arjun Bhardwaj, René Zurbrügg, Mayank Mittal, Florin Püntener, Sira Bielefeldt, Cosmin Roman, Vaishakh Patil, Marco Hutter

Micro- and Nanosystems Lab, ETH Zürich, ETH AI Center

2026-06-18机器人

针对触觉传感器真实信号难以高保真仿真、导致操作学习中 sim-to-real 失效的问题,TactSpace 不再匹配原始信号,而用多模态编码器、交叉重建与对比对齐,把刚体仿真几何、FEA 应力场和真实电容读数映射到共享潜空间。下游任务仅用仿真训练即可零样本迁移到真实传感器,在力预测和形状重建上分别降低 16.7% 与 45.8% 误差,并提供 Isaac Lab 触觉仿真插件。

Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos Figure 1
2026-06-18cs.CV

Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos

Runze Xu, Yiluo Zhang, Jian Wang, Yu Wang, Jincheng Yu

2026-06-18视觉感知

该文针对通用 VLA 训练过度依赖大规模带动作标注机器人数据的问题,尝试从无标注第一视角人类操作视频中提取可迁移动作先验。核心做法是用物理掩码引导的混合解耦 VQ-VAE 将运动动态与背景变化分离,形成跨具身离散动作码本,并在适配阶段解耦意图预测与状态感知以减少动作幻觉。仿真与真实实验显示,仅用约 50 条机器人轨迹微调即可接近大量标注数据训练的 VLA 表现,但精细操作能力仍受码本容量限制。

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement Figure 1
2026-06-18cs.RO

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita

The University of Tokyo, Japan

2026-06-18强化学习

针对VLA由模仿学习导致误差累积、精细操作易失败的问题,本文用冻结VLA上的残差RL做纠偏;关键洞察是让残差只看可在仿真和真实中一致获得的物体6D位姿、本体状态和基座动作,并通过遥操作回放对齐仿真/真实VLA,从而避免图像域差和蒸馏。残差仅在仿真训练后零样本迁移到FR3五个任务,真实成功率由42%提升到76%,且成功轨迹可再训练多任务VLA实现自改进。

A High-accuracy Event-based Underwater SLAM System Figure 1
2026-06-18cs.RO

A High-accuracy Event-based Underwater SLAM System

Yifan Peng, Qihang, Liu, Haoying Li, Yuzhe Li, Junfeng Wu, Ziyang Hong

2026-06-18机器人

面向水下机器人在无 GPS、光照变化和重复纹理下传统视觉 SLAM 易失效的问题,论文提出事件双目水下 SLAM:用结构张量与梯度构造 Time Surface 质量度量,并以初始化前贝叶斯优化、跟踪中异步局部搜索自适应调节时间衰减;同时引入视差先验和“最新观测优先”三角化提升匹配与初始化稳定性。作者还发布 UWE 水下事件数据集,在公开数据和 UWE 上相较现有事件方法表现出更高精度、鲁棒性和实时性。

C-ARC: Continuous-Adaptive Range Clustering for Non-Repetitive LiDAR Sensors Figure 1
2026-06-18cs.RO

C-ARC: Continuous-Adaptive Range Clustering for Non-Repetitive LiDAR Sensors

Nick B. Schroeder (1), Jonathan Lichtenfeld (2), Oskar von Stryk (2) ((1) Technical University of Darmstadt, Darmstadt, Germany, (2) Simulation, Systems Optimization and Robotics Group, Technical University of Darmstadt, Germany)

2026-06-18机器人

针对 Livox 等非重复扫描 LiDAR 缺少固定扫描线和帧边界、导致传统实时聚类在稀疏性与延迟间难权衡的问题,C-ARC 用滑动窗口上的持久双图解耦高频点插入与按需聚类输出,并以指数控制自适应标定距离网格分辨率。实验显示其在 Mid-360 上可单线程 20 Hz 实时运行;Avia 结果也指出集中扫描导致的单元占用无界是主要瓶颈。

ZiMPedance: Impedance-Aware ZMP Modeling and Control for Payload Carrying with Quadruped Robots Figure 1
2026-06-18cs.RO

ZiMPedance: Impedance-Aware ZMP Modeling and Control for Payload Carrying with Quadruped Robots

Giovanni B. Dessy, Lorenzo Amatucci, Victor Barasuol, Claudio Semini

2026-06-18机器人规划控制

针对四足机器人用被动弹簧臂搬运载荷时,接口弹簧阻尼会激发振荡并破坏 ZMP 稳定裕度的问题,论文将载荷接口动力学显式并入 ZMP 分析,指出欠阻尼参数可能与步态谐波共振,并构建阻抗增强的 SRBD-MPC。仿真中稳定性违规由 7.0% 降至 0.7%,水平地面反力代价最多降 15%;实机在 2 kg 载荷拉放扰动下保持稳定,而基线失败。

Space Is Intelligence: Neural Semigroup Superposition for Riemannian Metric Generation Figure 1
2026-06-18cs.RO

Space Is Intelligence: Neural Semigroup Superposition for Riemannian Metric Generation

Chenghao Xu

2026-06-18机器人

针对传统运动规划把智能放在策略、搜索或碰撞检测器中的设定,本文提出让场景直接生成配置空间的黎曼度量,机器人只需沿测地线运动。核心是 Encoder-Router 通过李代数中的半群叠加与指数映射组合固定生成元,保证度量正定并支持不同障碍数量的组合。实验称仅用一个双障碍场景训练即可在未见障碍配置上零样本成功,并显著拉开无碰撞与穿障路径代价,但验证仍局限于二维点机器人。

HALOMI: Learning Humanoid Loco-Manipulation with Active Perception from Human Demonstrations Figure 1
2026-06-18cs.RO

HALOMI: Learning Humanoid Loco-Manipulation with Active Perception from Human Demonstrations

Zehui Zhao, Yuxuan Zhao, Gaojing Zhang, Chenxi Liu, Maolin Zheng, Wenzhao Lian

Shanghai Jiao Tong University, University of Sussex, East China University of Science and Technology

2026-06-18机器人模仿学习

HALOMI针对人形机器人整身移动操作中真人示教易采集但难迁移的问题,强调主动头眼协调和人机形态差异带来的视角、动作执行落差。其核心是用带头戴自视角与双手UMI的无机器人采集,结合在潜在行为流形中规划的全身控制器,并通过视角对齐和控制器感知轨迹适配减小误差。在Unitree G1五类真实任务上验证,三项定量任务平均成功率达85%,还展示了抛掷和深蹲抓取等动态能力。

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs Figure 1
2026-06-18cs.RO

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

2026-06-18机器人强化学习

面向社交机器人共语手势难以由手工动画或常规学习方法兼顾自然性、表达性与实体约束的问题,本文将 GPT-4.1 与 Pepper 的低层运动原语库结合生成可执行手势代码,并用五轮在线用户评分进行迭代 RLHF 微调。实验显示,人类偏好反馈可逐步改善生成手势的相关性、流畅度和表达性,使 LLM 生成的动作较初始基线不再那么僵硬。

Two-Phase Bilevel Search for the Moving-Target Traveling Salesman Problem with Moving Obstacles Figure 1
2026-06-18cs.RO

Two-Phase Bilevel Search for the Moving-Target Traveling Salesman Problem with Moving Obstacles

Allen George Philip, Anoop Bhat, Sivakumar Rathinam, Howie Choset

Mechanical Engineering, Texas A&M University, College Station, TX 77843-3123.

2026-06-18机器人

面向需在时间窗内拦截多个运动目标且同时避开运动障碍的MT-TSP-MO,论文指出该问题兼具NP难与实际补给、监视等需求。其核心是给出可用求解器处理的MICP离散建模,并提出两阶段双层搜索:高层在采样目标图上解GTSP,低层用直线检测与时空图DFS验证避障可达性,再改进初始巡回。实验在最多40个目标和40个障碍上,相比既有基线在成功率、路径成本和计算时间上均更优。

Selective Unit-Cell Actuation in Lattice Structures for Distributed Morphology in Soft Robots Figure 1
2026-06-18cs.RO

Selective Unit-Cell Actuation in Lattice Structures for Distributed Morphology in Soft Robots

Trevor Exley, Altair Coutinho, Lucia Beccai

2026-06-18机器人

针对软体晶格机器人中驱动器多停留在模块/器件层、晶格仅被动导向变形的问题,论文将气动驱动与曲杆晶格下沉到单元胞共设计,形成可寻址的单体嵌入式气动单元。实验显示1×1到3×3结构位移和力可扩展且循环重复性较好,3×3×3选择性驱动可产生弯曲、定向抓取,并通过主动/被动单元异质拼接实现爬行。

Leveraging Energy Features for Surface Classification with Deep Learning: A Comparative Analysis Across Three Independent Datasets Figure 1
2026-06-18cs.RO

Leveraging Energy Features for Surface Classification with Deep Learning: A Comparative Analysis Across Three Independent Datasets

Alexander Belyaev, Oleg Kushnarev

evaluation was conducted across three publicly available, % and 72% on the LabelMars dataset. The improvement in

2026-06-18数据集/基准

面向移动机器人在复杂地面上因摩擦、振动和能耗变化导致导航失效的问题,论文系统评估电机电流、功率等能量特征能否作为本体感知的地表分类信号,并在三个公开数据集上比较 RNN、CNN、Transformer 与 Mamba。结果显示,纯能量特征可达约85–90%准确率,较 IMU 融合低5–10%;加入能量特征可稳定提升 IMU 模型约1–2%,CNN整体最好,说明低成本能耗信号可独立使用也适合作为补充模态。

Stealthy World Model Manipulation via Data Poisoning Figure 1
2026-06-18cs.LG

Stealthy World Model Manipulation via Data Poisoning

Yibin Hu, Xiaolin Sun, Zizhan Zheng

Department of Computer Science, Tulane University

2026-06-18机器人强化学习

面向机器人和连续控制中日益常见的世界模型微调流程,论文指出本地轨迹缓冲区可成为隐蔽投毒入口。作者提出 SWAAP:先用双层优化寻找既接近干净动力学又会诱导低回报规划的目标世界模型,再通过受隐蔽约束的梯度匹配仅篡改少量下一状态目标。实验在 TD-MPC2、DINO-WM 及 DMControl、MyoSuite、MetaWorld 上显著降低性能,并能绕过所测残差、CUSUM、TRIM 等非自适应检测与鲁棒训练防御。

Spatially Stratified Distillation for Heterogeneous Radar Place Recognition Figure 1
2026-06-18cs.CV

Spatially Stratified Distillation for Heterogeneous Radar Place Recognition

Sagun Singh Shrestha, Samuel Harding, Abdelwahed Khamis, Saimunur Rahman, Peyman Moghadam

CSIRO Robotics, Brisbane, Australia 2 University of Queensland, Brisbane, Australia

2026-06-18视觉感知

论文面向低成本稀疏、窄视场4D车载雷达查询与高密度旋转雷达地图之间的异构地点识别难题。核心做法是空间分层蒸馏:对两类雷达共同观测区域强对齐,对仅教师可见的结构区域施加低权重先验,避免逼迫学生幻觉不可观测结构。HeRCULES实验显示其在单/多会话、异构与同构检索中均超过SHeRLoc,异构AR@1由0.722提升至0.766。

High-Degree-of-Freedom Lightweight Bioinspired Leg for Enhanced Mobility in Small Robots Figure 1
2026-06-18cs.RO

High-Degree-of-Freedom Lightweight Bioinspired Leg for Enhanced Mobility in Small Robots

Haoqi Han, Yifei Yu, Jiaming Zhang, Xinru Cui, Linxi Feng, Hesheng Wang

Xinru Cui, Linxi Feng are with the Department of Automation, Shanghai Jiao Tong University, Shanghai, 200240, China (e-mail: ).

2026-06-18机器人

面向小型腿式机器人在狭窄空间中难以同时获得高自由度、低腿部惯量和足够输出力的问题,论文提出仿昆虫的四自由度微型并联腿,将驱动集中在机身,并用双球面五杆与同心/合并球心设计简化运动学、降低远端惯量。样机质量18.9 g,足端力约0.5 N,工作空间超过22255 mm³,实验展示了较好的单腿空间运动灵活性。

A Scalable Embodied Intelligence Platform for Seamless Real-to-Sim-to-Real Transfer of Household Mobile Manipulation Tasks Figure 1
2026-06-18cs.RO

A Scalable Embodied Intelligence Platform for Seamless Real-to-Sim-to-Real Transfer of Household Mobile Manipulation Tasks

Kui Yang, Xianlei Long, Haoxuan Li, Yan Ding, Chao Chen

2026-06-18机器人

面向家庭移动操作中仿真搭建成本高、长程任务评测不统一、策略难跨硬件部署的问题,论文提出 BestMan 平台:用 ASG 从真实观测自动生成带语义和关节结构的仿真场景,以 THMM/SPA 组织可复用感知与规划技能,并用 HUM 抽象不同机器人接口。实验显示其可支撑标准化基准、大规模仿真评估和多平台真实部署,但具体性能增益来源仍需结合完整指标判断。

EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation Figure 1
2026-06-18cs.RO

EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation

Zecheng Yin, Benedict Jun Ma

2026-06-18机器人视觉语言视觉感知

本文针对未知环境中目标物导航既要成功又要少走冤枉路的问题,指出训练式方法泛化弱、免训练方法易重复探索。EffiNav 将开源视觉语言模型的语义推理与深度感知、历史防重访机制结合,形成免训练导航框架,并可加入物体记忆扩展到 GOAT-BENCH。实验在 HM3D、OVON 及真实机器人上验证,SR/SPL 达到或超过近期基线,体现出更均衡的效率与泛化性。

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models Figure 1
2026-06-18cs.RO

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

2026-06-18数据集/基准安全鲁棒

本文针对具身基础模型安全对齐缺少真实伤害数据的问题,认为机器人动作的风险不仅来自显式恶意指令,也来自执行后演化出的间接危险。作者从 DROID 真实观测出发,结合场景理解、危险状态图像编辑、时序提示与 Wan2.7 单次 rollout 合成,构建含 1 万段视频的 RoboShackles,覆盖直接伤害和火、电、水、坠落等间接伤害。按拒绝式安全准则评测 6 个 EFM 时,所有模型在测试场景中均生成不安全动作,暴露出现有模型对人身伤害预防的对齐不足。

DNN Koopman-Based Deviation Compensation for UGV Path Tracking Control on Coupled Slope and Potholed Road Figure 1
2026-06-18cs.RO

DNN Koopman-Based Deviation Compensation for UGV Path Tracking Control on Coupled Slope and Potholed Road

Jian Zhao, Wenbo Zhou, Zhicheng Chen, Bing Zhu, Jiayi Han, Dongjian Song, Yinju Lin, Peixing Zhang

2026-06-18视觉感知规划控制

面向越野无人车在耦合坡度与坑洼路面下因轮胎侧偏刚度、垂向载荷和未建模非线性变化导致的路径跟踪退化,论文将自适应遗忘RLS参数估计、Laguerre-MPC与DNN-Koopman偏差补偿结合,并用事件触发协同机制约束补偿可信度和转向可行性;HiL实验显示多工况跟踪性能提升超过11.5%。

Self-Supervised Mask-Aware Transformers for Fault-Tolerant FBG Force Sensing in Minimally Invasive Surgical Robotics Figure 1
2026-06-18cs.RO

Self-Supervised Mask-Aware Transformers for Fault-Tolerant FBG Force Sensing in Minimally Invasive Surgical Robotics

Peibo Sun, Shiyuan Dong, Shucheng Ye, Jianrong Cai, Yushan Liu, Hongen Liao, Tianqi Huang, Fang Chen

2026-06-18机器人

面向微创手术机器人中FBG多通道力传感的非线性耦合与光纤断裂掉线问题,论文用显式观测掩码的Transformer替代按故障模式校准的模型库,并通过掩码重建预训练、动态损坏微调和单次前向不确定性头提升容错性。在8通道导管传感器上,正常RMSE为0.0066 N,4通道失效时为0.0126 N,优于255模型库的0.0154 N。

SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping Figure 1
2026-06-18cs.RO

SRL: Combining SLIP Model and Reinforcement Learning for Agile Robotic Jumping

Xiaowen Hu, Linqi Ye, Yudi Zhu, Chenyue Shao, Rankun Li, Qingdu Li, Yan Peng

2026-06-18机器人强化学习

面向救援、物流等场景中腿式机器人跨越障碍的需求,论文针对SLIP模型难适应复杂接触、纯强化学习训练低效的问题,提出SRL:以SLIP生成跳跃前馈轨迹,PPO实时反馈修正,并结合六阶段FSM、分阶段奖励和PD控制。双足/四足仿真、迁移与实机验证显示,其训练更快、跳跃更稳,位置跟踪误差低于0.1米,速度误差约在目标±3%内。

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation Figure 1
2026-06-18cs.RO

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

University of Toronto, Vector Institute, Stanford University, Allen Institute for AI

2026-06-18机器人视觉感知

论文针对真实机器人操作评测成本高、视频世界模型长时滚动易漂移且多视角不一致的问题,提出 SC3-Eval:用前向-逆动力学一致性约束动作与生成视频、用跨视角补全保持多相机一致,并在测试时以逆动力学误差作为不确定性早停信号。其在381小时真实桌面清理数据上评测7个VLA策略,闭环Pearson相关达0.929、MMRV为0.119,优于Ctrl-World等基线,并能复现部分真实失败模式。

Admittance-Based Surface Alignment for Human-in-the-Loop Robotic Visual Inspection Figure 1
2026-06-18cs.RO

Admittance-Based Surface Alignment for Human-in-the-Loop Robotic Visual Inspection

Antara Banerjee, Colin Acton, Xu Chen

Antara Banerjee is with the Department, Website: https://macs-lab.github.io/robotic-inspection-orientation-control-2026/

2026-06-18机器人

面向高价值制造中的机器人视觉检测,论文关注离线轨迹难以适应感知噪声、曲面不规则和人工遥操作调整的问题。作者将末端相机建模为在黏性介质中运动的虚拟球,用导纳式质量-阻尼外环把表面法向误差与操作者输入统一为速度命令,可在不改工业机械臂内环的情况下实时柔顺对齐。UR5e与RealSense实验显示,在15°和40°初始误差下均稳定收敛,最终平均姿态误差约0.4°,重定向时间约6秒,较人工遥操作更可重复。

Benchmarking Action Spaces in Reinforcement Learning for Vision-based Robotic Manipulation Figure 1
2026-06-18cs.RO

Benchmarking Action Spaces in Reinforcement Learning for Vision-based Robotic Manipulation

Seyed Alireza Azimi, Homayoon Farrahi, Abhishek Naik, Colin Bellinger, A. Rupam Mahmood

Department of Computing Science, University of Alberta, School of Electrical Engineering and Computer Science, University of Ottawa, Vector Institute, Alberta Machine Intelligence Institute (Amii)

2026-06-18机器人视觉感知强化学习数据集/基准

针对视觉机器人强化学习中动作空间如何影响安全性、平滑性与仿真到现实迁移这一关键但少有实机验证的问题,本文在 Franka Panda 的拾取和推动任务上系统比较位姿增量、位姿速度、关节位置增量和关节速度,并用 PPO、域随机化完成视觉策略的零样本迁移。结果显示动作表示显著改变实机表现,其中关节速度在两项任务中整体最稳,拾取成功率达 100%,推动位移最高且轨迹 jerk 最低;关节位置增量接近但依赖阻抗调参。

DREAM-Chunk: Reactive Action Chunking with Latent World Model Figure 1
2026-06-18cs.RO

DREAM-Chunk: Reactive Action Chunking with Latent World Model

Wenxi Chen, Kaidi Zhang, Chi Lin, Zhiyuan Zhang, Yu She, Yuejiang Liu, Raymond A. Yeh, Shaoshuai Mou, Yan Gu

Purdue University, Stanford University

2026-06-18强化学习

针对 VLA 动作分块在执行已提交 chunk 后近似开环、易受随机动力学、硬件误差和部分观测影响的问题,DREAM-Chunk 在不微调基策略的情况下,引入轻量潜在世界模型,于测试时采样多个候选 chunk、预测其潜在未来,并按观测轨迹匹配切换动作。实验显示其在 Kinetix 高噪声场景及 SO-101、Franka 上四个操作任务中提升鲁棒性,精密插入扰动下 π0.5 成功率由 10% 升至 65%。

Aerial-ground LiDAR place recognition with patch-level self-supervised learning and expanded reciprocal re-ranking Figure 1
2026-06-18cs.CV

Aerial-ground LiDAR place recognition with patch-level self-supervised learning and expanded reciprocal re-ranking

Yandi Yang, Xianghong Zou, Jianping Li, Haofeng Xie, Saurav Uprety, Hongzhou Yang, Naser El-Sheimy

2026-06-18视觉感知

论文针对地面 LiDAR 地点识别依赖预采街景地图、覆盖不足的问题,转向利用已公开且大范围覆盖的机载 ALS 作为先验地图,但需处理空地视角域差和初检误匹配。方法将多尺度 patch 级自监督与场景级学习结合,并用扩展互惠重排序利用 ALS 空间邻域关系。新建 CS-Urban-Scenes 后,检索网络在 Recall@1 上较 SOTA 提升 9.8%,ER 重排序无需训练又带来最高 10.2% 增益。

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Leveraging DINOv3 for Robust Outdoor Scene Understanding in Field Robotics Figure 1
2026-06-18cs.CV

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Leveraging DINOv3 for Robust Outdoor Scene Understanding in Field Robotics

Jaeil Park, Hyobin Choi, Sangjin Lee, Hyungtae Lim, Sung-Hoon Yoon

∗ Co-advised this work. 1 Multimodal Intelligence and Perception Laboratory (MIP), Department of Electrical Engineering and Computer Science, Daegu Gyeongbuk Institute of Science and Technology (DGIST), Massachusetts Institute of Technology (MIT)

2026-06-18机器人视觉感知安全鲁棒

面向野外机器人在非结构化场景中遭遇的长尾类别、尺度变化、平台视角差异与局部语义歧义,本文给出 GOOSE 2D 细粒度语义分割挑战冠军方案。方法并未提出全新架构,而是将 DINOv3 ViT-L/16、ViT-Adapter 与 Mask2Former 组合,并在全局 [CLS] token 上加入 11 个粗类别的多标签辅助监督,推理时使用多尺度/翻转 TTA 和前三检查点集成。最终官方综合 mIoU 为 76.57%,细类 69.32%、粗类 83.81%,排名第一。

AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework Figure 1
2026-06-18cs.CR

AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework

Inderjeet Singh, Haitham Mahmoud, Andrés Murillo

2026-06-18机器人

针对机器人、AIoT 与网络物理系统仅靠仿真或监管试点易被过度解读的问题,论文把 AI 沙盒定义为可度量的系统级保证环境,提出边界形式化、证据“最弱环”组合规则、沙盒分类与面向评测装置本身的威胁模型,并用真实沙盒案例展示其在保真度、可控性、可观测性、隔离、复现和治理证据上的比较方式,主要结果是明确沙盒证据能支持哪些有限部署声明,而非直接证明安全。

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture Figure 1
2026-06-18cs.RO

As You Wish: Mission Planning with Formal Verification using LLMs in Precision Agriculture

Marcos Abel Zuzuárregui, Stefano Carpin

The authors are with the Department of Computer Science and Engineering, University of California, Merced, CA, USA.

2026-06-18规划控制

面向非专业农户用自然语言指挥农业机器人时容易因语义歧义导致任务偏离的问题,本文在LLM任务规划器外加入由另一LLM生成LTL规格、SPIN模型检查与错误反馈自修正的闭环,并用两个商业LLM降低同源偏差。实验与田间验证表明,该流程能发现并修正部分计划—意图不一致,提升自主导航与数据采集的可追踪性,但LLM生成有效LTL仍是主要瓶颈。

Task Allocation and Motion Planning in Dynamic, Cluttered Environments via CBBA and Graphs of Convex Sets Figure 1
2026-06-18cs.RO

Task Allocation and Motion Planning in Dynamic, Cluttered Environments via CBBA and Graphs of Convex Sets

Matthew D. Osburn, Cameron K. Peterson, John L. Salmon

2026-06-18规划控制优化算法

面向拥挤动态环境中的多机器人任务分配,论文指出仅用距离或名义时间出价会导致不可行或低效分配。其核心是把3D+time时空GCS轨迹优化嵌入CBBA出价与一致性流程,使任务成本直接反映动态障碍、时间可达性和轨迹约束,并扩展到会移动的会合类任务。仿真案例显示该框架能生成避碰路径并给出更准确的任务完成时间估计,但实验仍以模拟场景为主。

N(CO)$^2$: Neural Combinatorial Optimization with Chance Constraints to Solve Stochastic Orienteering Figure 1
2026-06-18cs.RO

N(CO)$^2$: Neural Combinatorial Optimization with Chance Constraints to Solve Stochastic Orienteering

Anas Saeed, Marcos Abel Zuzuárregui, Stefano Carpin

The authors are with the Department of Computer Science and Engineering, University of California, Merced, CA, USA.

2026-06-18优化算法

面向农业采样、导航等机器人任务中边代价运行时才显现的随机定向问题,论文试图摆脱为每个随机组合优化问题手工设计启发式的做法。其核心是用随机游走生成训练信号,并以边增强图 Transformer 在强化学习框架下学习边选择热图,再结合机会约束构造可行路径。实验称在多类 SOPCC 实例上可泛化,解质量接近现有 MILP,且求解更快。

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer Figure 1
2026-06-18cs.CV

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

Jinhao You (1), Shuo Lyu (1), Zhuohang Lyu (1), Tanxuan Li (1), Zibo Zhao (1), Jiaxiang Hu (2), Kai Tang (3), Yichen Guo (3) ((1) University of Pennsylvania, (2) University of California, Irvine, (3) Nanyang Technological University)

University of Pennsylvania, University of California, Irvine, Nanyang Technological University

2026-06-18机器人

面向机器人等场景中多视角快速三维重建,本文针对 VGGT 跨帧注意力随帧数和 patch 数二次增长的问题,指出其 24 层存在浅层缺少跨视图结构、中层负责对齐、深层几何冗余但仍保姿态的三段机制,并据此设计免训练的双轴 U 形压缩:保护几何/边缘显著 token,同时用相移网格、参考帧锚点和未压缩相机/寄存器 token 下采样 K/V。实验显示在重建质量基本匹配下,相比 VGGT* 最高约 6.7 倍加速。

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision Figure 1
2026-06-18cs.RO

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

University of Maryland, College Park

2026-06-18机器人视觉感知规划控制

针对导航 VLA 缺少大规模、目标条件且具避障监督的问题,VEGA 将野外第一视角视频重建为局部几何,采样文本/图像/航点目标,并用几何规划生成多模态避障轨迹来训练 flow-matching 策略,推理时仅需 RGB 和目标。在 VEGA-Bench 上碰撞率较最强基线降 33.0%、障碍间隙增 17.9%,实机成功率至少提升 150.0%。

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation Figure 1
2026-06-18cs.RO

PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation

Yuhang Huang, Xuan Lv, Junyan Xu, Zhiyuan Yu, Jiazhao Zhang, Ruizhen Hu, Wancheng Feng, Shilong Zou, Hewen Xiao, Ziqiao Zhou, Kaiyun Huang, Zhiyu Peng, Juzhan Xu, Hang Zhao, Chenyang Zhu, Renjiao Yi, Yifei Huang, Douhui Wu, Yan Zhang, Kexu Cheng, Chunhe Song, Yunzhi Xue, Xiuhong Zhang, Leitao Guo, Yunji Chen, Bin Wu, Haibin Yu, Kai Xu

Institute of AI for Industries, Chinese Academy of Sciences

2026-06-18机器人强化学习三维

面向机器人操作中多相机世界模型易出现物体漂移、深度矛盾和纹理错位的问题,PAIWorld认为跨视角通信与3D几何监督必须同时存在,并在DiT世界模型中加入几何感知跨视角注意力、Geo-RoPE相机位姿编码和Latent 3D-REPA蒸馏。模型以2.5M多视角视频训练,在WorldArena总分第一、AgiBot-Challenge2026第二,并支持规划、动作世界模型和策略后训练。

Guava: An Effective and Universal Harness for Embodied Manipulation Figure 1
2026-06-18cs.RO

Guava: An Effective and Universal Harness for Embodied Manipulation

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

2026-06-18机器人

针对端到端 VLA 依赖大量机器人数据、难以低成本处理长程任务与失败恢复的问题,Guava 将具身操作建模为工具调用式 harness,强调迭代感知-推理-行动循环、语义动作抽象和多模态观测三点设计。作者还用少于 2K 条仿真轨迹蒸馏到 4B 开源模型,在仿真与真实环境中接近前沿闭源模型,并能泛化到未见物体、新指令和长程任务。

Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures Figure 1
2026-06-18cs.RO

Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures

Bowen Li, Mayank Mishra, Y. Isabel Liu, Stone Tao, Nishanth Kumar, Alexander G. Gray, Ruwan Wickramarachchi, Jonathan Francis, Sebastian Scherer, Tom Silver

CMU, 2 Princeton, 3 AI2, 4 MIT, 5 Centaur AI, 6 Bosch Center for AI

2026-06-18机器人

针对机器人在开放环境中失败模式组合爆炸、单纯学习反应式恢复技能难以泛化的问题,论文提出 ReSYNC:把失败后的恢复经验同时用于强化学习新恢复技能和发现关系谓词,从而更新符号规划抽象,使局部恢复转化为测试时的主动避错规划。四个连续控制仿真域中,组合新任务平均成功率约 70%,较恢复学习、谓词学习、策略学习、VLM 规划和 HRL 基线高 50% 以上,并展示了非抓取操作的仿真到真实迁移。

2026-06-17

54 篇
Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement Figure 1
2026-06-17cs.RO

Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement

Mingtong Zhang, Dhruv Shah

Princeton University, time verification as a practical and scalable mechanism for improving robotic policies during, availability of human demonstrators. Thus, robot foundation models face a fundamental bottleneck:

2026-06-17强化学习

针对机器人策略依赖昂贵人工示范、部署后难以自我改进的问题,本文提出 VERITAS:把预训练通用策略当作候选动作生成器,用无需梯度训练的视觉/VLM 验证器在推理时进行 best-of-N 选择,并将成功轨迹回灌微调。仿真和真实操作中,该方法无需额外示范即可稳定提升在线成功率;用 20–100 条验证轨迹后训练平均带来约 10% 增益,且数据效率接近人工专家示范。

MOCHI: Motion Enhancement of Collaborative Human-object Interactions Figure 1
2026-06-17cs.CV

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

Jiye Lee, Yonghun Choi, Jungdam Won

MOCHI: Motion Enhancement of Collaborative Human-object, JIYE LEE, Seoul National University, South Korea, YONGHUN CHOI, Seoul National University, South Korea, JUNGDAM WON∗, Seoul National University, South Korea, Collaborative human-object interaction shows dynamic and complex move-, laborative multi-human object interaction (MHOI) scenarios requires high-, Enhancement of Collaborative Human-object Interactions), a two-stage, Authors’ addresses: Jiye Lee, Department of Computer Science and Engineering, Seoul, Yonghun Choi, Department of, Jungdam Won, Department of Computer Science and Engineering, Seoul, ment of Collaborative Human-object Interactions. ACM Trans. Graph. 45, 4, Collaborative human-object interaction scenarios, such as carrying

2026-06-17机器人

MOCHI面向多人协作搬运等场景中动作捕捉易受遮挡、接触错位、抖动和手指细节缺失影响的问题,提出两阶段增强框架:先从噪声身体姿态优化生成物理合理抓握与手物交互序列,再用单人扩散运动先验结合人-物/人-人约束细化全身动作。实验显示其可提升真实捕捉和生成模型输出的MHOI质量,并支持不同人数、物体几何与关键帧创作。

EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies Figure 1
2026-06-17cs.RO

EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies

Ning Gao, Jinliang Zheng, Xing Gao, Haoxiang Ma, Hanqing Wang, Yukai Wang, Jiantong Chen, Zanxin Chen, Shujie Zhang, Mingda Jia, Xuekun Jiang, Zihou Zhu, Xinyu Li, Shuai Wang, Hao Li, Wenzhe Cai, Yuqiang Yang, Xudong Xu, Zhaoyang Lyu, Yao Mu, Tai Wang, Jiangmiao Pang, Jia Zeng, Weinan Zhang, Chunhua Shen

Shanghai AI Laboratory, Xi’an Jiaotong University, Institute for AI Industry Research (AIR), Tsinghua University, Tsinghua University, University of Science and Technology of China, Shanghai Jiao Tong University, Zhejiang University

2026-06-17机器人

本文针对通用移动操作策略常用单一成功率难以定位能力短板的问题,提出 EBench 仿真诊断基准:26 个任务同时覆盖移动、长时程和高精度灵巧操作,并按 5 类能力与 4 类分布外泛化维度标注。评测显示,π0.5 总体测试成功率最高为 29.5%且训练到测试保持最好;InternVLA-A1擅长移动操作但在灵巧任务上明显崩溃,XVLA则强在不同原子技能,说明相近总分掩盖了显著能力差异。

Adaptive Volumetric Mechanical Property Fields Invariant to Resolution Figure 1
2026-06-17cs.CV

Adaptive Volumetric Mechanical Property Fields Invariant to Resolution

Rishit Dagli, Donglai Xiang, Vismay Modi, Xuning Yang, Gavriel State, David I.W. Levin, Maria Shugrina

2026-06-17机器人

面向机器人训练和交互式仿真中大量 3D 资产缺少体积力学参数的问题,AdaVoMP 用稀疏自适应体素树同时表示形状与材料场,并以稀疏 Transformer 自回归地粗到细生成杨氏模量、泊松比和密度。相比固定 64³ 网格的 VoMP/Pixie,它将复杂区域细分到最高 1024³、均质区域保持稀疏,实验显示在更低测试计算下取得更高材料预测精度,可把高分辨率资产转为可变形仿真对象。

Beyond Failure Recovery: An Engagement-Aware Human-in-the-loop Framework for Robotic Systems Figure 1
2026-06-17cs.RO

Beyond Failure Recovery: An Engagement-Aware Human-in-the-loop Framework for Robotic Systems

Jiaying Fang, Joyce Yang, Zhanxin Wu, Bohan Yang, Tapomayukh Bhattacharjee

2026-06-17机器人

论文指出传统人机协同多在失败或不确定时才询问用户,容易让护理等场景中的使用者长期被动、参与感下降;其核心是提出 E-MPC,把用户参与度作为可控目标,并用交互频率与类型建模其动态,在工作负担约束下主动规划何时、如何询问。仿真覆盖多类用户画像,真实机器人辅助取食实验也显示其在保持任务成功的同时改善用户体验。

Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So Figure 1
2026-06-17cs.AI

Memory as a Wasting Asset: Pricing Flash Endurance for Embodied Agents, and the Limits of Doing So

Josef Liyanjun Chen

2026-06-17机器人

论文关注机器人长期运行中闪存擦写寿命被当作“免费存储”使用的问题,将片上 NVM 耐久度建模为会折旧的稀缺资产,并用单一影子价格 η 指导 RAM/NVM/云端的记忆放置。核心洞察是最优策略可化为带磨损成本的逐字节阈值索引;实测显示价值—写入强度关系随场景而变,长时程重复操作为正、短程近零、遥操作为负。结果表明该约束在高端 TLC 上多半不绑定,在廉价 QLC/eMMC 上会影响寿命和成本,但学习式磨损感知控制器在任务价值上仅与价格路由打平,是否提升任务表现仍未充分说明。

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System Figure 1
2026-06-17cs.RO

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

Qwen-RobotNav Technical Report: A Scalable Navigation Model, We present Qwen-RobotNav, a scalable navigation model built on Qwen3-VL that, multiple task modes that select the navigation behaviour, and controllable observation, AMAP CV Lab, 2025, multi-task capability, but also a controllable interface whose observation strategy can be reconfigured by, ABot-N0 (AMAP CV Lab, 2025) retains only a sliding, We introduce Qwen-RobotNav, a scalable navigation model built on Qwen3-VL (Yang et al., 2025a) that, behaviour appropriate for each sub-goal. Second, controllable observation parameters, including visual

2026-06-17机器人

这篇技术报告针对多任务导航在真实长程场景中需要被上层智能体动态调度、且不同任务依赖不同视觉历史的问题,提出基于 Qwen3-VL 的 Qwen-RobotNav:用任务模式和可控观测参数(token 预算、时间衰减、相机权重等)统一调节上下文,而非改骨干结构。模型以 15.6M 样本多任务共训,并在 VLN-CE RxR、EVT-Bench、NAVSIM 等取得领先结果;用于具身问答系统时也提升 HM-EQA/EXPRESS-Bench,并减少导航步数。

WireCraft: A Simulation Benchmark for Industrial DLO Manipulation Figure 1
2026-06-17cs.RO

WireCraft: A Simulation Benchmark for Industrial DLO Manipulation

Chongyu Zhu, Ramy ElMallah, Hyegang Kim, Zachary Tang, Jiachen Rao, Artem Arutyunov, Seungyeon Ha, Chi-Guhn Lee

Department of Mechanical and Industrial Engineering, University of Toronto, Canada, Department of Computer Science, University of Toronto, Canada, CREFLE Inc., Seongnam, Republic of Korea

2026-06-17机器人数据集/基准

工业线缆等 DLO 操作缺少可复用、贴近装配夹具且能对齐仿真与真实数据的基准。WireCraft 将连接器插入、卡扣布线和槽道压入统一到可配置仿真中,提供两类线缆物理模型、标准策略接口及多来源轨迹。实验显示,特权状态 RL 在代表任务上成功率超过 82%,说明任务可解;但视觉 RL、模仿学习和 VLA 在连接器接触对准阶段明显退化,真实 UR5 验证也暴露 sim-to-real 与精细接触控制仍是瓶颈。

EAGG: Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning Figure 1
2026-06-17cs.RO

EAGG: Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning

Wanhao Niu, Qiyan Ke, Yuan Sun, Hao Sun, Jie Xu, Muyuan Ma, Ruiqi Hu, Fuchun Sun

2026-06-17机器人

面向同一系统需在平行夹爪到灵巧手间切换的抓取生成问题,EAGG认为仅用静态手型标识会丢失拓扑、耦合与接触变化。方法把各末端执行器表示为拓扑图和PCA低维控制空间,并在采样中用冻结认知骨干反复注入当前几何。MultiGripperGrasp上六种训练手平均成功率56.17%,接近专用模型,接触距离中位数由0.239cm降至0.189cm,并展示微调、零样本和真实硬件迁移。

A Hybrid Optimization Framework for Grasp Synthesis under Partial Observations Figure 1
2026-06-17cs.RO

A Hybrid Optimization Framework for Grasp Synthesis under Partial Observations

Wenzheng Zhang, Fahira Afzal Maken, Tin Lai, Fabio Ramos

2026-06-17优化算法

面向未知物体在单视角点云下抓取规划易受局部几何不完整和手爪开口设定影响的问题,论文将由 AS-ICP 数据训练的能量模型作为全局抓取先验,并把其梯度与 ICP 几何对齐共同嵌入 SVGD 粒子优化中迭代修正抓取姿态。在 67 个物体、5360 次尝试中成功率为 60.9%,高于 AnyGrasp、GPD 和 AS-ICP,显示学习先验与解析优化的紧耦合带来更好泛化。

Uncertainty Quantification for Flow-Based Vision-Language-Action Models Figure 1
2026-06-17cs.RO

Uncertainty Quantification for Flow-Based Vision-Language-Action Models

Ralf Römer, Maximilian Seeliger, Saida Liu, Ben Sturgis, Marco Bagatella, Daniel Marta, Andreas Krause, Angela P. Schoellig

2026-06-17视觉语言视觉感知生成模型安全鲁棒

面向流匹配式视觉语言动作模型在分布外场景中会无预警执行不可靠动作、且适配新任务示教成本高的问题,本文用小规模集成的速度场分歧(VFD)估计认知不确定性,并据此提出 SAVE 主动微调框架来选择任务和初始状态采集专家示教。LIBERO 实验显示,VFD 的校准性、性能预测和失败检测优于基线,SAVE 至少减少 22 个示教样本需求。

LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation Figure 1
2026-06-17cs.RO

LAGO Policy: Latency-Aware Asynchronous Diffusion Policies with Goal-Directed Collision-Free Planning for Smooth Manipulation

Guowei Shi, Xupeng Xie, Yiming Luo, Jian Guo, Jun Ma, Boyu Zhou

The Hong Kong University of Science and Technology (Guangzhou) 2, International Digital Economy Academy 3, The University of Hong Kong 4, Southern University of Science and Technology

2026-06-17机器人生成模型强化学习规划控制

本文针对扩散视觉运动策略在异步推理中因感知—执行延迟导致动作块不连续、运动抖动,以及遇到未见障碍时缺乏显式避障机制的问题,提出 LAGO Policy:用延迟感知的 classifier-free guidance 解耦未来动作条件,并结合示范中学习的任务目标预测、目标导向无碰规划与时空轨迹优化。真实机器人实验显示其能降低 jerk、实现更平滑的无碰执行,并在杂乱任务中提高成功率。

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation Figure 1
2026-06-17cs.RO

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

Tianyi Lu, Hui Zhang, Zijie Diao, Junke Wang, Shengqi Xu, Xingyao Lin, Guojin Zhong, Ziyi Ye, Peng Wang, Zuxuan Wu, Yu-Gang Jiang

Fudan University, 2Shanghai Innovation Institue, 3Neote AI

2026-06-17机器人视觉感知强化学习

针对现有 VLA 多将观测直接映射到动作、难以处理长程操作推理的问题,ThinkingVLA 将操作规划拆为未来状态预测与逆动力学推断,并在统一 MoT 自回归模型中交织前向 CoT、预测图像和基于图像的逆向 CoT。实验显示其在仿真与真实机器人基准上优于单模态和解耦式 CoT,长程任务增益更明显。

SPARK: Low Latency Single-Camera 3D Pose Estimation for Autonomous Racing using Keypoints Figure 1
2026-06-17cs.RO

SPARK: Low Latency Single-Camera 3D Pose Estimation for Autonomous Racing using Keypoints

Dominic Ebner, Markus Lienkamp

All authors are with the Technical University of Munich, Germany, School of Engineering & Design, Department of Mobility Systems Engineering, Institute of Automotive Technology and Munich Institute of Robotics and Machine Intelligence (MIRMI)

2026-06-17三维

面向自动驾驶赛车中对非合作对手高速机动的低时延感知需求,SPARK利用赛车目标类别单一、尺寸固定的先验,将YOLO姿态网络预测的9个车辆关键点与PnP位姿恢复结合,并提供由LiDAR 3D真值生成2D关键点标注的方法。实车赛车数据评测显示,其在远距离3D位姿检测上优于现有单目3D方法且延迟更低,并与LiDAR方案相比更适合边缘部署;具体数值增益在片段中未充分说明。

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space Figure 1
2026-06-17cs.RO

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

Bochen Yang, Lianlei Shan

Imperial College London, Tsinghua University

2026-06-17强化学习

PearlVLA针对VLA在低延迟动作生成与显式规划之间的权衡,将“思考”从文本、像素子目标或动作搜索转移到VLM潜空间:用固定视觉 grounding 与可迭代潜在计划分支分离表示,每轮以计划条件世界查询调用冻结潜在世界模型获得未来反馈,再经RefineNet残差细化,最终并行解码动作块,并用CRG-PRL按同状态计划编辑的想象未来奖励优化过程。在LIBERO上,监督版平均成功率98.5%,加入过程奖励强化学习后达98.7%。

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT Figure 1
2026-06-17cs.RO

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Northeastern University, Tsinghua University

2026-06-17视觉感知强化学习三维

针对 World-Action 模型依赖专家轨迹、难以通过交互获得细粒度操作能力的问题,WAM-RL 将强化学习引入 WA 范式,联合优化世界模型与动作模型:世界模型用成功轨迹做在线视频 SFT 并加 KL 稳定潜空间,动作模型用重建一致性奖励训练。实验显示,仅优化 actor 主要改善短程任务,而联合优化对长程任务更关键,并在 LIBERO 与 RLBench 上取得稳定提升。

Learn to Quantify Social Interaction with Constraints for Pedestrian Walking Figure 1
2026-06-17cs.AI

Learn to Quantify Social Interaction with Constraints for Pedestrian Walking

Xiaodan Shi

Xiaodan Shi is with Department of Computer and Systems Sciences, Stockholm University

2026-06-17优化算法

本文针对行人轨迹预测中“社会交互”常被黑箱聚合、难以解释的问题,提出 Learn to Cluster:用概率潜变量从轨迹序列中无监督聚类交互模式,并以社交约束损失拉开不同模式、约束同类相似,再将模式接入 MDN 预测。实验显示其能学到强弱交互及模式转移线索,在 ETH 上明显优于多种基线、UCY 上接近或达到 SOTA;但部分增益来自模式约束还是预测结构仍需进一步拆解。

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models Figure 1
2026-06-17cs.RO

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

et al., 2026), and EBench (Laboratory, 2026), alongside two new benchmarks: RoboTwin-IF, an instruction-

2026-06-17机器人

本文针对机器人操作数据异构、昂贵且难以随规模提升泛化的问题,提出基于 Qwen-VL 的 VLA 模型 Qwen-RobotManip,核心是先做跨本体对齐再扩展数据:统一状态动作表示、相机系位姿增量与上下文策略适配,并用人类第一视角演示合成 15 类平台轨迹,汇聚约 3.81 万小时开放数据。实验显示其在多种 OOD 基准、指令跟随和跨本体迁移上优于 π0.5 等模型,并在 RoboChallenge 获得约 20% 相对提升。

From Ad Hoc Pilots to Repeatable Patterns: Structuring Drone Collaboration in Emergency Services with DroneLets Figure 1
2026-06-17cs.RO

From Ad Hoc Pilots to Repeatable Patterns: Structuring Drone Collaboration in Emergency Services with DroneLets

Dzmitry Katsiuba, Samuel Brander, Mateusz Dolata, Gerhard Schwabe

Structuring Drone Collaboration in Emer-, University of Zurich, Zeppelin University, questions: how emergency teams want to collaborate with drones, and how to formalize, these collaborations into repeatable processes. Based on four field trials and 95 inter-, Collaboration Engineering to embodied agents. DroneLets capture setup requirements, and drone actors. They offer a modular framework for designing repeatable, scalable, collaboration processes in emergency services, illustrated through patterns such as, Keywords: Collaboration Engineering, Drones, Human-Agent Collaboration, Emergency Ser-, drone pilot. This pilot assumes a role analogous to that of a facilitator in collaborative work – controlling, Final version is available here: https://aisel.aisnet.org/icis2025/is_transformwork/is_transformwork/19/, Katsiuba, D., Brander, S., Dolata, M., & Schwabe, G. (2025). From Ad Hoc Pilots to Repeatable Patterns: Structuring Drone Collaboration in Emergency

2026-06-17机器人

论文关注应急服务中无人机虽能提升态势感知与安全性,却常依赖临场飞手和即兴协调的问题。作者基于4次实地试验与95次访谈,将消防、警务等场景中的人机协作归纳为44个交互模式和10类元模式,并提出DroneLets,把协作工程中的可复用流程扩展到具身无人机,显式描述环境约束、能力配置、人员与无人机动作及异常处理。结果显示,当前瓶颈主要在角色、通信和流程结构,而非单纯飞行能力。

HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning Figure 1
2026-06-17cs.RO

HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning

Taowen Wang, Zikang Xie, Bin Yang, Yunheng Wang, Zizhao Yuan, Yuetong Fang, Yixiao Feng, Yichi Wang, Xingyu Chen, Haodong Chen, Qiwei Wu, Weisheng Xu, Lihan Chen, Lusong Li, Zecui Zeng, Renjing Xu

The Hong Kong University of Science and Technology (Guangzhou), Beijing University of Technology, Harbin Institute of Technology, Shenzhen, Shenzhen MSU-BIT University, JD Explore Academy

2026-06-17机器人数据集/基准

针对人形机器人任务决策与全身动态执行耦合、现有基准难以评估策略—运动跟踪器接口的问题,HumanoidArena提出面向第一视角分层全身学习的仿真基准,包含7个需要足部落点、平衡和姿态调整的腿部关键HOI/HSI任务,并用扰动条件与跨GMT协议评估泛化和迁移。实验显示分层控制可完成多类全身交互,但性能强依赖低层GMT,跨跟踪器迁移仍脆弱。

Accountability in Autonomous Drone-Based Firefighting: Insights From a Field Trial Figure 1
2026-06-17cs.RO

Accountability in Autonomous Drone-Based Firefighting: Insights From a Field Trial

Dzmitry Katsiuba, Anna Katharina Boos, Robin Hany, Mateusz Dolata, Gerhard Schwabe

University of Zurich, Zeppelin University, Final version is available here: https://aisel.aisnet.org/icis2025/ethical_is/ethical_is/10/, enabling them to perform complex tasks either autonomously or in close collaboration with human teams.

2026-06-17机器人

针对自主无人机进入消防应急后可能打乱既有指挥与追责关系的问题,论文基于瑞士两支志愿消防队、95名参与者的两次真实场景演练,并用Bovens问责框架分析人—机—组织互动。核心发现是,无人机在层级中的角色定位不清会导致责任归属混乱,新的无人机与消防员、旁观者互动也引入额外问责风险;据此提出8条部署建议,以在提升态势感知的同时避免削弱问责链条。

ED3R: Energy-Aware Distributed Disaster Detection Enabled by Cooperative Robotic Agents Figure 1
2026-06-17cs.RO

ED3R: Energy-Aware Distributed Disaster Detection Enabled by Cooperative Robotic Agents

Lina Magoula, Nikolaos Koursioumpas, Nancy Alonistioti, Ramin Khalili

* Dept. of Informatics and Telecommunications, National and Kapodistrian University of Athens, Greece, ** Huawei Heisenberg Research Center (Munich), Germany

2026-06-17机器人视觉感知

面向野火等灾害监测中机器人需在不确定环境、通信/算力受限和电量约束下快速可靠检测的问题,ED³R将无人机与远程控制器做分层协同:控制器管运动,机器人按能耗与网络状态选择本地或远程推理及视觉模型,并用分布式神经回归进行前瞻评估,结合避障、区域避免和提前停止。仿真中任务成功率最高97.18%,困难场景较基线节能36.4%、检测提速41%。

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI Figure 1
2026-06-17cs.RO

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

Hong Yang, Basura Fernando

Centre for Frontier AI Research, College of Computing and Data Science, Nanyang Technological University, Singapore

2026-06-17数据集/基准

针对现有 VQA/EQA 难以区分真实具身推理与语言或视觉捷径的问题,ERQA-Plus 构建了一个诊断型基准:以 711 张机器人视角图像生成 1,766 个问答,按感知、动作、社交、导航环境与常识推理分类,并通过生成-评审-修订及人工验证控制质量。实验显示最强 Qwen3-VL-32B 达到 83.4% 准确率,但在空间、流程、事件预测和意图推断上仍有明显短板。

FLAP: FOV-Constrained Active Perception Planning for Prior-Map-Free 3D Navigation Figure 1
2026-06-17cs.RO

FLAP: FOV-Constrained Active Perception Planning for Prior-Map-Free 3D Navigation

Mengke Zhang, Sitong Li, Tiancheng Lai, Ruitian Pang, Mingxuan Zhang, Qingcheng Chen, Fei Gao, Chao Xu, Yanjun Cao

2026-06-17机器人规划控制三维

针对无先验地图、杂乱三维环境中无人机受传感器视场和量程限制而难以兼顾安全与效率的问题,FLAP将主动感知直接嵌入可微轨迹优化,在传感器坐标系中建模FOV约束,并用速度触发的风险惩罚和可优化起始时刻的感知子轨迹提前观察未知区域。仿真与实机实验显示,该方法在不同传感器配置和复杂三维结构中能减少迟滞感知风险,保持安全同时提升导航效率。

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation Figure 1
2026-06-17cs.RO

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

School of Computer Science, Peking University, Princeton University, Tsinghua University

2026-06-17机器人视觉语言视觉感知

针对多数 VLA 机器人模型只依赖 RGB、难以感知温度/声音/雷达等物理属性的问题,MuseVLA 将传感器视为按需调用的工具:先生成传感器 token 和目标描述,再把异构读数转成对齐到视觉平面的 grounded sensor image,并用合成数据降低多传感采集成本。真实灵巧手任务中平均成功率 80.6%,较 RGB-only 和原始热图式多传感基线分别显著提升,未见任务零样本达 66.7%。

RICH-SLAM: Radar SLAM with Incremental and Continuous Hilbert Mapping Figure 1
2026-06-17cs.RO

RICH-SLAM: Radar SLAM with Incremental and Continuous Hilbert Mapping

Bingbing Zhang, Huan Yin, Yang Xu, Shuo Liu, Shaojie Shen, Fumin Zhang, Wen Xu

2026-06-17机器人

雷达在恶劣天气中稳健,但观测稀疏且噪声大,难以生成可用于导航的连续稠密地图。RICH-SLAM 将 Rao-Blackwellized 粒子滤波用于位姿、多模态后验处理,并以增量 Hilbert 降秩高斯过程更新占据场,同时用地图参数完整后验进行粒子加权。自采数据和 ColoRadar 实验表明,其可从稀疏雷达构建带不确定性的连续占据图,并支持基于不确定性的移动机器人规划。

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments Figure 1
2026-06-17cs.RO

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

2026-06-17三维

面向机器人学习中真实数据采集昂贵、仿真场景构建慢且前景物体分离差的问题,GASE用全景相机阵列一次扫描获取多视频流,并在3D重建前基于相机位姿与SAM2在2D域跨帧提取物体、修复背景,再分别用3DGS和TRELLIS生成可导入物理仿真的场景与资产。实验显示其分割精度较现有3D Gaussian方法提升超过10%,修复质量达到SOTA,真实机器人操控与导航中相对纯真实训练的性能差距小于10%。

MagicSim: A Unified Infrastructure for Executable Embodied Interaction Figure 1
2026-06-17cs.RO

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

2026-06-17机器人

针对机器人学习中仿真、技能、规划与智能体交互割裂、常依赖“魔法动作”的问题,MagicSim提出一个确定性批量运行时和共享MDP,用YAML构建可复现多物理世界,并以Command→Skill→Planner→Robot→Record闭环把语言命令落到真实机器人动作。其主要结果是同一任务可同时用于RL评测、成功轨迹自动采集和VLM/智能体交互,生成对齐的多模态监督;但定量增益与对比实验在给定片段中未充分说明。

When Robots Sleep: Offline Skill Consolidation for Shared-Policy Robot Learning Figure 1
2026-06-17cs.RO

When Robots Sleep: Offline Skill Consolidation for Shared-Policy Robot Learning

Nethmi Jayasinghe, Diana Gontero, Amit Ranjan Trivedi

Department of Electrical and Computer Engineering

2026-06-17机器人强化学习

这篇论文关注长期部署机器人在顺序学习新技能时,即使单项任务仍有成功率,也会破坏同一共享策略中相关技能的协同可靠性。作者提出 Sleeping Robots:在线“清醒”学习当前技能,离线“睡眠”用冻结 critic/actor 记忆生成旧技能代理梯度,并以 Nash bargaining、锚定和局部兴奋性进行整合,无需任务头或轨迹回放。实验显示其在 Meta-World MT5 上较最强非 oracle 基线平均成功率提升 64%、成对可靠性提升 2 倍,在 SurgicAI 上也改善平均成功率和后向迁移。

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning Figure 1
2026-06-17cs.CV

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

School of Computer Science, Peking University

2026-06-17机器人规划控制三维

GeneralVLA-2针对机器人规划中单目重建易幻觉、经验记忆仅按语义检索而难控质量的问题,强化GeneralVLA的规划输入:用GeoFuse-MV3D在多视角RGB-D下以掩码验证几何先验、软视觉壳和保外观融合获得更稳物体形状,并将KnowledgeBank改为带质量、置信、生命周期和冲突元数据的治理式记忆。结果显示,GSO-30重建指标较MV-SAM3D小幅提升,记忆模块在Terminal-Bench和SWE-Bench上优于ReasoningBank,但真实长程机器人评估仍有限。

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation Figure 1
2026-06-17cs.CV

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

Fudan University, School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shanghai Innovation Institute, Shenzhen Loop Area Institute

2026-06-17机器人

这篇论文针对短窗口 VLA 在重复操作中无法把“上一子任务已完成什么”传给下一阶段的问题,提出 WeaveLA:只在子目标完成事件触发写入,用查询注意力将刚完成片段压缩为 8 个潜在 token,并直接调制下一子任务的动作专家而非提示或视觉输入。在冻结 π0.5 主干上,RoboMME 中最难的 SwingXtimes N=3 成功率由 0% 提升到 47.8%,而 N=1 基本不变,说明收益主要来自跨子任务记忆通道。

Embodiment Shapes Rolling Behavior in a Multimodal Infant Model Figure 1
2026-06-17cs.RO

Embodiment Shapes Rolling Behavior in a Multimodal Infant Model

Leon Philipp, Francisco M. López, Jochen Triesch

2026-06-17视觉语言

论文针对婴儿翻身机制难以通过真实实验分离的问题,使用具备本体感受和前庭感知的 MuJoCo 虚拟婴儿 MIMo,通过 PPO 学习仰卧到俯卧翻滚,并在 1、3、6、9 月龄身体形态间比较。核心洞察是身体发育本身会显著塑造可学到的滚动策略;结果显示较大月龄模型成功率更高、动作更快,且协调模式与真实婴儿观察相符。

Continual Online Personalization of Exoskeleton Control via Manifold-Aware Experience Replay Figure 1
2026-06-17cs.RO

Continual Online Personalization of Exoskeleton Control via Manifold-Aware Experience Replay

Changseob Song, Inseung Kang

C. Song and I. Kang are with the Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA.

2026-06-17规划控制

面向中风等临床用户步态差异大、外骨骼在线适配在多任务行走中易灾难性遗忘的问题,论文提出基于步态流形的经验回放框架,用编码特征组织回放缓冲区,避免依赖显式任务标签,并在线更新髋外骨骼步态相位估计器。在模拟偏瘫步态、速度和坡度切换实验中,相比无回放基线,扭矩跟踪和相位跟踪准确性分别提升约40%和60%。

Credibility-Weighted Pricing of Autonomous Vehicle Liability Under Operational Design Domain Shift Figure 1
2026-06-17cs.LG

Credibility-Weighted Pricing of Autonomous Vehicle Liability Under Operational Design Domain Shift

Doyeon Jang

2026-06-17机器人

自动驾驶车队进入新城市时,本地事故与理赔样本稀疏、ODD 和软件版本又持续变化,传统精算定价难以外推。论文将层级贝叶斯可信度模型与学习到的 ODD 相似核结合,在城市、版本和区域间有条件借力,并可退化为 Bühlmann–Straub。基于 Waymo/NHTSA SGO 的 648 起事故和 1.16 亿英里实验显示,城市可信度仅 0.12–0.46,部分池化明显优于不池化;学习核优势在四城数据中不稳定,功效分析称约需 12 个部署城市才易检出。

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation Figure 1
2026-06-17cs.RO

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation

Haoran Lu, Mutian Shen, Shuyang Yu, Yu Xiao, Songling Liu, Jianshu Zhang, Shang Wu, Yue Chen, Guo Ye, Jiayi Wang, Zhaoran Wang, Han Liu

Northwestern University, Peking University

2026-06-17机器人三维

本文针对仿真机器人数据生成中原始 3D 资产只有几何、缺少可执行交互知识的瓶颈,提出 AnnotateAnything:先用 VLM 提取人类交互先验并落到 affordance、关键点和部件等 3D 线索,再通过大规模并行物理优化与验证生成抓取、灵巧接触、关节操作、插入、悬挂和导航等动作标注。实验显示其在标注效率、数据采集效率和任务成功率上优于现有流程,并可服务 affordance 检测、机器人 VQA 与视觉指令微调。

DexLink Hand: A Compact, Affordable, 16-DOF Linkage-Driven Hand with Human-Like Dexterity Figure 1
2026-06-17cs.RO

DexLink Hand: A Compact, Affordable, 16-DOF Linkage-Driven Hand with Human-Like Dexterity

Hao Wu, Yanzhe Wang, Yu Feng, Jian Liu, Jihao Li, Jianshu Zhou, Huixu Dong

2026-06-17机器人

针对灵巧手常在自由度、体积与成本之间难以兼顾的问题,DexLink Hand 采用平面/空间连杆、球面四杆与蜗杆自锁等机构,把运动解耦、关节协同和承载能力嵌入机械结构中。原型在人体手尺寸内集成16个执行器驱动20关节,重320g、成本低于400美元;实验达到最高Kapandji评分,可复现33类Feix抓取,并完成多种日用品和工具的稳定抓握与灵巧操作。

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies Figure 1
2026-06-17cs.RO

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei

Southeast University, The Chinese University of Hong Kong

2026-06-17机器人生成模型

本文针对生成式机器人策略默认从与观测无关的标准高斯噪声开始、导致生成器需先把无信息噪声搬运到可行动作区域的问题,提出 LeaP:用本体状态条件化的可学习对角高斯作为动作块源先验,同时预测均值和状态自适应方差,且不改下游生成器和求解器。在 RoboTwin 15 个操作任务上平均成功率达 81.6%,较 A2A、VITA、无先验和 BridgePolicy 高 6.5–25.5 个百分点,并在 flow matching、diffusion bridge 和真实部署中均有增益。

Damage Adaptation in Seconds for Architected Materials Figure 1
2026-06-17cs.RO

Damage Adaptation in Seconds for Architected Materials

James Avtges, Jake Ketchum, Helena Young, Taekyoung Kim, Ryan Truby, Todd Murphey

Northwestern University, Evanston, IL, USA

2026-06-17机器人

面向软体机器人在割裂、烧蚀或现场修补后模型迅速失效的问题,论文提出 LEAP:利用构筑材料晶格损伤可离散、低维编码的特性,将损伤作为潜变量并用集成加权快速自适应。作者在 HSA 驱动的 6DoF 软腕触觉描迹任务中验证,数秒到一分钟内无需仿真即可适应未见损伤,使力/力矩本体感知预测损失降低约 90%,但仍需较充分的执行器预表征。

Agent Utilities over Generalized Voronoi Regions and their Gradients Figure 1
2026-06-17cs.RO

Agent Utilities over Generalized Voronoi Regions and their Gradients

Andre N. Costa, Petter Ögren, Carlos H. C. Ribeiro

2026-06-17优化算法

面向多机器人在动态竞争环境中评估“谁能更有效影响某片空间”的问题,论文将经典 Voronoi 区域推广为由任意代价诱导的 CIV 区域,可纳入 LQR 动力学、速度和控制能耗;并把效用定义为区域上密度积分,利用 Reynolds 输运定理把效用梯度化为边界线积分。足球双队示例中,该轮廓积分法与有限差分梯度误差接近,仅相差数个百分点,但运行约快 25 倍。

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations Figure 1
2026-06-17cs.CV

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

2026-06-17模仿学习

针对端到端自动驾驶依赖大规模专家驾驶日志、闭环图像 RL 又计算昂贵的问题,TerraTransfer 将“学会驾驶”和“学会看见”解耦:先在向量化仿真器中通过多智能体自博弈训练规划教师,再用成对的图像/场景状态数据,以动作 KL 和低秩结构损失对齐视觉学生,全程不监督人类轨迹。文中报告其在光真实 3DGS 闭环场景中接近自博弈教师,并在总体 HD-Score 上超过模仿学习基线。

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning Figure 1
2026-06-17cs.RO

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

Rice University, Robotics and AI Institute

2026-06-17机器人视觉感知

针对互联网人类操作视频缺少可执行机器人监督的问题,EgoInfinity将任意RGB视频自动转换为度量化4D手-物交互表示,并通过跨模块尺度校准、交互感知精修和功能性跨形态重定向,把手轨迹与6DoF物体状态编译为机器人关节轨迹。实验覆盖感知一致性、IK可行性、多机器人重定向及真实抓取、切割、擦拭、倒水,显示其可作为从网络视频到机器人学习数据的可扩展引擎。

Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework Figure 1
2026-06-17cs.RO

Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework

Milind Rampure, Shadman Sakib, Haley Patel, Zahid Hasan, Nirmalya Roy

2026-06-17机器人视觉语言

面向灾害救援、远程分诊等不宜接触伤员的场景,论文提出可部署在异构移动机器人上的无接触呼吸率监测框架,通过亮度自适应选择 RGB、热成像、近红外和低照度相机,结合人体关键点胸部 ROI 与 SQI 过滤在边缘端估计呼吸。三类四足/轮式平台实验显示无需逐平台重调即可泛化;RGB 最远约 8 米、NIR 约 6 米,热成像仅短距可靠,低照度相机可在全黑下支持 8 米监测。

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models Figure 1
2026-06-17cs.CV

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

2026-06-17视觉语言视觉感知数据集/基准

面向端到端自动驾驶在长尾场景中难以被可靠评估的问题,论文指出纯规则指标缺乏语境、纯 VLM 评估又缺少物理约束。DriveJudge 让 VLM 先理解场景并选择调用碰撞、车道偏离等确定性规则函数,在可解释性与上下文适应之间折中;作者还构建 33,577 个带人类合理性标注的样本和两项评测任务。实验中其驾驶质量分类较 EPDMS 提升 21.23 AUC,轨迹偏好选择较 DriveCritic 提升 6.5%。

Transformer-Based Warm-Starting for Feasible and Optimal Terminal Approach to Tumbling Objects with Space Manipulators Figure 1
2026-06-17cs.RO

Transformer-Based Warm-Starting for Feasible and Optimal Terminal Approach to Tumbling Objects with Space Manipulators

Yuji Takubo, Maximilian Adang, Mac Schwager, Simone D'Amico

2026-06-17机器人

面向在轨服务中空间机械臂接近翻滚目标时的实时轨迹生成难题,论文将问题拆成质心平移规划与姿态—机械臂力矩分配两阶段,并用因果 Transformer 为计算瓶颈阶段提供 SCP 热启动。300 个测试场景显示,该先验最多减少 28% 迭代和 23% 运行时间,成本分布基本不变;用于可行性投影时还可显著缩短时间并避免启发式初始化的高成本尾部。

Abstention-Aware Personalized Object Rearrangement via Uncertainty-Guided LLM Assistance Figure 1
2026-06-17cs.RO

Abstention-Aware Personalized Object Rearrangement via Uncertainty-Guided LLM Assistance

Sam Collin, Ali Ayub

This research was undertaken, in part, thanks to funding from the Natural Sciences and Engineering Research Council of Canada (NSERC), Concordia University

2026-06-17安全鲁棒

这篇论文针对家庭机器人整理中“并非所有物体都该被放置”的现实问题,指出既有个性化重排方法常假设场景干净且必须给出位置。作者提出 APOLLO,用少量示范训练 CPU 可运行的个性化嵌入模型,并以不确定性选择性调用 LLM,同时支持弃置决策;还构建含多家具、噪声上下文和显式弃置的 APOR 数据集。PARSEC 与 APOR 实验显示其优于既有 LLM 基线并显著减少 LLM 调用。

VISTA: Scale-Aware Visual Navigation via Action History Conditioning Figure 1
2026-06-17cs.RO

VISTA: Scale-Aware Visual Navigation via Action History Conditioning

Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame

Institute of Science Tokyo, Polytechnique Montreal, CoRA Lab, Polytechnique Montreal, Mist Lab

2026-06-17机器人

VISTA针对视觉导航模型为跨平台泛化而输出归一化动作时产生的尺度歧义:同一轨迹用不同部署步长反归一化会改变真实几何并增加碰撞。论文的核心做法是把归一化动作历史与图像一起条件化,并采用DINOv3增强重复/弱纹理场景表征,使模型关联过去动作和视觉位移。实测零样本在户外、森林、办公室等场景目标预测成功率达100%,平均通过95%检查点。

Contrastive Action-Image Pre-training for Visuomotor Control Figure 1
2026-06-17cs.RO

Contrastive Action-Image Pre-training for Visuomotor Control

Yuvan Sharma, Dantong Niu, Anirudh Pai, Zekai Wang, Zhuoyang Liu, Baifeng Shi, Stefano Saravalle, Boning Shao, Ruijie Zheng, Jing Wang, Konstantinos Kallidromitis, Yusuke Kato, Fabio Galasso, Yuke Zhu, Danfei Xu, Linxi "Jim" Fan, Jitendra Malik, Trevor Darrell, Roei Herzig

Sapienza University of Rome

2026-06-17视觉感知规划控制

针对机器人视觉编码器缺少大规模“视觉—动作”预训练信号的问题,论文提出 CAIP:从海量第一视角人类视频中提取 3D 手部关键点,将其作为末端执行器动作代理,并用对比学习对齐图像/语言与动作块表示。在约 3.2 万小时人类视频和少量机器人数据上训练后,CAIP 在真实灵巧操作任务中优于 DINOv2、SigLIP、MVP、R3M 等基线,平均成功率达 76%,折叠、倒液和精细操作增益超过 30%。

Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception Figure 1
2026-06-17cs.CV

Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception

Aditya Mishra, Haroon Lone

Indian Institute of Science Education and Research, Indian Institute of Science Education and Research Bhopal India

2026-06-17数据集/基准

本文关注边缘设备上连续道路感知与静态基准之间的部署落差:视频流中的时序抖动、热节流和负载变化会被传统评测掩盖。作者提出 Edge-TSR,将检测、跟踪、细粒度分类与基于轨迹的轻量时序稳定结合。实验显示三类基线从图像到真实流式部署性能相对下降 20–30%,该稳定机制最高恢复 10.16% 分类准确率,并在 Jetson Orin Nano 上完成 55 分钟、26 km 部署,维持 16.18 FPS 且热状态安全。

Intermittent Strategic Cooperation of Two Selfish Agents on Graphs Figure 1
2026-06-17cs.MA

Intermittent Strategic Cooperation of Two Selfish Agents on Graphs

Itay Shedlezki, Noa Agmon

Bar-Ilan University

2026-06-17机器人

论文关注自利机器人/智能体在图上各自赶往目标时,临时结伴可能降低通行时间却易被单方偏离破坏的问题。核心洞察是稳定合作并非任意交替,而必须呈现“独立行走—单段连续合作—再独立行走”的严格结构。基于此,作者证明任意实例均存在纯纳什均衡,并给出多项式算法枚举非支配均衡,再用讨价还价准则比较多均衡下的个体时间与社会福利。

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining Figure 1
2026-06-17cs.RO

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

CUHK MMLab

2026-06-17机器人

针对机器人示教昂贵、VLA 预训练数据难扩展的问题,ACE-Ego-0 将第一视角人类视频转成伪动作,并用相机坐标动作、形态条件与时间对齐动作块统一人机数据,再以可靠性感知损失降低伪标签噪声影响。在 6K+ 小时混合数据上预训练后,RoboCasa 达 72.8%,RoboTwin 2.0 Easy/Hard 达 91.12%/90.62%,并迁移到真实双臂任务。

VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories Figure 1
2026-06-17cs.RO

VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories

Svetlana Lukina, Mohamad Al Mdfaa, Gloria Haro, Sergey Zagoruyko, Gonzalo Ferrer

Mobile Robotics Laboratory, Artificial Intelligence Center, Moscow, Russia, Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra, Barcelona, Spain

2026-06-17机器人

面向机器人长时间第一视角导航轨迹中的回溯问答,论文指出仅靠全视频大模型代价高、仅靠知识图谱又易丢失长程上下文。VL-MemKnG将时空知识图谱与持久化片段级记忆结合,离线构建、查询时融合检索与推理。在WalkieKnowledgeT+上,Top-1检索由58%提升到67%,Recall@1由34.50%升至40.55%,尤其改善跨非连续时间片段的证据聚合问题。

ParkingTransformer: LLM-Enhanced End-to-End Trajectory Planning for Autonomous Parking Figure 1
2026-06-17cs.RO

ParkingTransformer: LLM-Enhanced End-to-End Trajectory Planning for Autonomous Parking

Hauteng Wu, Xu Li, Dong Kong, Zihang Wang, Xieyuanli Chen, Benwu Wang, Wenkai Zhu

2026-06-17规划控制

面向从道路/入口到车位的长距离自主泊车,论文指出级联系统易累积误差、端到端方法又缺少语义理解且 dense BEV 代价高。ParkingTransformer 将多视角感知、LLM 隐状态与轨迹查询结合,直接对历史和原始传感输入做交互,并用 3D 位置编码、固定窗口流式记忆和粗到细解码提升空间推理与效率。在 CARLA 闭环中 driving score 为 61.32,实车平均成功率 88.70%。

HRDX: A Large-Scale Vector HD-Map Dataset Figure 1
2026-06-17cs.RO

HRDX: A Large-Scale Vector HD-Map Dataset

Sahith Reddy Chada, Isht Dwivedi, Nirav Savaliya

Honda Research Institute US, San Jose, CA.

2026-06-17数据集/基准

现有公开 HD 地图数据集规模小、语义属性稀疏且缺少可复现的航拍模态,限制在线矢量地图构建研究。HRDX 提供约 40 小时/1400 km 多传感器数据、对齐正射影像和 10 类/20+ 属性标注,并提出同时评估几何与属性的 CS 指标。实验显示更大数据规模和航拍先验能提升地图几何与语义预测,航拍教师蒸馏也可改善相机-only 模型,增益可能部分来自 scaling / data。

Extracting Semantics: LLM-Guided Automatic Population of Robot Ontology from URDF Figure 1
2026-06-17cs.RO

Extracting Semantics: LLM-Guided Automatic Population of Robot Ontology from URDF

Bastien Dussard (LAAS-RIS, LAAS), Guillaume Sarthou (LAAS-RIS

LAAS-CNRS, Department of Robotics, Toulouse, France, remains labor-intensive, requiring substantial manual effort from domain experts

2026-06-17机器人

这篇论文针对机器人本体构建依赖人工标注、URDF又缺少标准语义的问题,提出用LLM从URDF中的部件命名和结构信息推断传感器、末端执行器等语义,并通过目标本体概念约束提示、多次查询投票及语法/模式校验降低幻觉。作者在多个机器人描述上做初步验证,结果显示该流程可把低层URDF转为可推理的具身知识,但仍主要是概念验证。

2026-06-16

127 篇
T-Rex: Tactile-Reactive Dexterous Manipulation Figure 1
2026-06-16cs.RO

T-Rex: Tactile-Reactive Dexterous Manipulation

Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle, Ruijie Zheng, Jing Wang, Ryan Punamiya, Mengda Xu, Yuqi Xie, Yunfan Jiang, Letian Fu, Konstantinos Kallidromitis, Matteo Gioia, Junyi Zhang, Jiaxin Ge, Haiwen Feng, Fabio Galasso, Wei Zhan, David M. Chan, Yutong Bai, Roei Herzig, Jiahui Lei, Fei-Fei Li, Ken Goldberg, Jitendra Malik, Pieter Abbeel, Yuke Zhu, Danfei Xu, Jim (Linxi)Fan, Trevor Darrell

La Sapienza University

2026-06-16机器人

T-Rex针对现有VLA缺少触觉、难以在接触丰富任务中快速闭环反应的问题,提出100小时同步视触觉遥操作数据集,并用可变频率MoT结合低频视觉动作规划与高频触觉残差修正,触觉由时空VQ-VAE编码。在12个插入、形变、力敏感和双手任务上,平均成功率较最强基线提升超过30%。

Human Universal Grasping Figure 1
2026-06-16cs.RO

Human Universal Grasping

Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto

New York University, Tsinghua University, University of Michigan

2026-06-16机器人

论文针对多指机器人抓取泛化受限于真实数据稀缺的问题,提出直接从日常人类抓取中学习。HUG用智能眼镜采集1M帧自我中心RGB-D与MANO手姿态,训练流匹配模型生成可重定向到不同机器人手的人类抓取,无需机器人数据。HUG-Bench真实测试中桌面成功率66.7%,较基线高23和34个百分点,野外跨相机、手型和家庭环境仍达62.0%。

Geometric Action Model for Robot Policy Learning Figure 1
2026-06-16cs.RO

Geometric Action Model for Robot Policy Learning

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

ETH AI Center

2026-06-16机器人强化学习

论文针对现有VLA/WAM主要依赖2D图像或潜空间、难以显式处理深度、尺度和遮挡的问题,提出GAM:将预训练几何基础模型在中间层拆分,插入因果未来预测器,在共享几何token空间中联合预测未来3D结构与动作。实验显示其在LIBERO/Plus和真实机器人上成功率、相机扰动鲁棒性优于多类基线,同时模型更小、推理最高快55倍。

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes Figure 1
2026-06-16cs.RO

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

Shenzhen International Graduate School, Tsinghua University, The Chinese University of Hong Kong

2026-06-16强化学习

这篇论文针对 VLA 在线强化学习微调中“每条轨迹只有成败标签、但策略更新需要逐步监督”的信用分配问题,提出 HABC:将稀疏结果拆成可达性与效率两类信号,用双头 critic 和状态自适应门控生成行为克隆权重,并按人类接管边界限制结果归因。真实双臂接触任务中,相比 SFT 成功率由 36%/44%/12% 提升到 92%/88%/38%。

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies Figure 1
2026-06-16cs.RO

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

Tsinghua University

2026-06-16机器人三维

针对模仿学习操控策略在物体位姿、机器人构型和相机视角变化下需要大量示教的问题,R2RDreamer 将真实示教的物体点云与末端轨迹在共享 3D 坐标中联合编辑,再通过遮挡感知投影生成 2D 控制视频,并用视频补全合成 RGB 观测,避免强依赖完整 3D 重建。实验表明,该增强数据能提升 2D 扩散策略和视觉语言动作模型在空间偏移任务中的泛化,消融支持 3D 编辑、遮挡处理和视频补全的作用。

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning Figure 1
2026-06-16cs.RO

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

Fudan University, The Chinese University of Hong Kong, Shanghai Jiao Tong University

2026-06-16机器人强化学习

论文针对人形机器人 VLA 部署中易累积失败、而人工接管又因全身协调和灵巧手遥操作产生犹豫/冗余动作的问题,提出 ROVE:用人在环采集 rollout 与干预数据,将干预分阶段标注,并以乐观价值估计结合机器人轨迹和跨 embodiment 人类视频训练 critic,再用优势信号抽取策略。真实接触丰富和细粒度操作任务上,ROVE 优于 SFT、RL/IIL 等经验学习基线,并在多轮 rollout-intervention 中持续提升。

Task-Error Residual Learning for Real-Robot Five-Ball Juggling Figure 1
2026-06-16cs.RO

Task-Error Residual Learning for Real-Robot Five-Ball Juggling

Kai Ploeger, Jan Peters

2026-06-16机器人

论文针对真实机器人高动态抛接中样本昂贵、标量奖励信息不足的问题,提出用带方向的任务误差监督来学习残差,并以任务误差模型和解析先验选择下一次试验,而非随机探索。系统虽只用简化抛物线/接触模型和软 PD 控制,仍在 Barrett WAM 双臂上实现 3、4、5 球稳定杂耍,通常第二次尝试即收敛;消融显示方向反馈与有信息先验缺一不可,固定雅可比 Newton 更新最可靠。

When Should a Robot Replan? Regret-Guided Update Scheduling in Time-Varying MDPs Figure 1
2026-06-16cs.RO

When Should a Robot Replan? Regret-Guided Update Scheduling in Time-Varying MDPs

Negin Musavi, Gokul Puthumanaillam, Ruben Hernandez, William Schafer, Melkior Ornik

Department of Aerospace Engineering, University of Illinois Urbana–Champaign, Champaign, IL 61820, USA

2026-06-16机器人学习理论

这篇论文针对非平稳环境中机器人受能耗与算力限制、无法每步观测并重规划的问题,将有限更新预算建模为时变 MDP 中的跳步更新调度。核心在于分析陈旧策略和传播状态估计在跳过区间内造成的动态遗憾增长,并据此设计在线的遗憾引导更新规则。仿真火星车导航和 Crazyflie 室内避障实验显示,自适应分配优于固定或其他预算基线。

SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks Figure 1
2026-06-16cs.RO

SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks

Zhizheng Liu, Honglin He, Vivek Alumootil, Akshat Pandya, Brad Squicciarini, Wayne Wu, Bolei Zhou

University of California, Los Angeles

2026-06-16机器人数据集/基准

针对城市人行道视觉导航缺少统一、可复现实测基准的问题,SidewalkBench 基于 Isaac Sim 构建程序生成与真实扫描场景,并加入事件触发的动态行人行为,用于拆解结构、交互和长距离导航失效。论文评测 9 个模型,覆盖 330 个单元测试、800 个行人反应场景和 105 个长程任务,结果显示现有模型主要瓶颈在行人意图/手势理解与长程鲁棒性,合成数据扩展可能主要是性能提升来源。

CrossMaps: Confidence-Aware Open-Vocabulary Semantic Mapping for Rover Navigation Figure 1
2026-06-16cs.RO

CrossMaps: Confidence-Aware Open-Vocabulary Semantic Mapping for Rover Navigation

Jan-Niklas Klein, Sona Ghahremani, Christian Medeiros Adriano, Holger Giese

Hasso Plattner Institute for Digital Engineering, Potsdam, Germany.

2026-06-16机器人

面向越野/行星漫游车在噪声、遮挡和光照变化下仅靠几何 SLAM 难以支持语义导航的问题,CrossMaps 将多尺度 tile 级 CLIP 嵌入投影到 SLAM 对齐的 3D 网格,并用几何、语义、时间置信度融合;其 STM/LTM 双记忆只把高置信、语义一致且多视角支持的单元提升为长期地标。文中展示其可在 Jetson Orin UGV 上实时生成自然语言可查询热力图,但导航精度和相对 VLMaps 的量化增益文中未充分说明。

Unified Motion-Action Modeling for Heterogeneous Robot Learning Figure 1
2026-06-16cs.RO

Unified Motion-Action Modeling for Heterogeneous Robot Learning

Yunhao Cao, Shitong Liu, Chao Feng, Meryl Zhang, Xuanchen Lu, Andrew Owens, Kuan Fang

Cornell University, mode at deployment. Using hindsight-relabeled motion contexts and a contrastive, additional details are available at https://uma-manipulation.github.io., across time, object motion can be extracted from video without action labels, lives in the same, but require paired motion-action labels, leaving action-free video data unused. Motion-prediction, separate downstream controller and offer no straightforward way to incorporate action labels when, robot data is available. As a result, no single existing method can both learn motion from action-free, video and leverage action labels when they are available., labels contribute supervision through one shared objective. We further extend hindsight experience, pretraining on publicly available data with no overlap with the test environments. UMA consistently, which requires paired motion-action labels and cannot ingest action-free video, or dynamics modeling, which requires a separate controller and lacks a native interface for action labels. Our approach

2026-06-16机器人

机器人基础模型常受限于机器人数据稀缺、跨域迁移差,以及动作生成与动力学建模割裂。UMA将3D物体运动轨迹作为统一接口,用掩码生成式Transformer共同建模物体运动与机器人动作,并结合 hindsight 运动上下文和对比学习,从无动作人类视频、仿真和真实机器人数据中预训练。实验显示其在真实桌面操作的零样本控制上较强基线提升约20–25个百分点,动力学预测MSE也低于专用模型,并支持少样本任务适配。

Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models Figure 1
2026-06-16cs.RO

Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models

Dongbin Na, Chanwoo Kim, Soonbin Rho, Giyun Choi, Gangbok Lee, Dooyoung Hong

RGA Inc., ensuring full reproducibility. The source codes and datasets are publicly available, segment from overview, center (focal), and detail perspectives, compensating for the limitations of

2026-06-16机器人视觉语言视觉感知

面向服务机器人长距离行走后的空间问答与导航,论文针对依赖 GPT-4o 等闭源在线模型带来的网络、延迟和成本问题,提出全开源 BinTrack。其核心洞察是把两处锚点地标之间的轨迹视为有序一维序列,用二分式检索结合多视角记忆逐步定位目标坐标。实验显示其较开源基线最高提升 22.8%,在 SpaceLocQA 全局问题上接近或超过已报道闭源结果,并带来 1.5 倍以上推理加速,同时发布真实四足机器人街景数据集 GangnamLoop。

LOPAL: Local Performance-Aware Active Learning from Imperfect Demonstrations Figure 1
2026-06-16cs.RO

LOPAL: Local Performance-Aware Active Learning from Imperfect Demonstrations

Johannes Heidersberger, Shail Jadav, Dongheui Lee

2026-06-16模仿学习

针对示教学习中人类示范并非整体好坏、而是同一轨迹内局部质量波动的问题,LOPAL把局部任务表现与轨迹一起用GMM建模,优先拼接各示范中的高质量片段,并在缺少好数据的区域通过共享自治主动请求用户纠正。仿真和真实管道检测实验显示,该方法可在减少示教负担的同时提升性能,真实任务最高提升27.31%。

SGM-SLAM: Scene Graph Matching for Data-Efficient Distributed SLAM Figure 1
2026-06-16cs.RO

SGM-SLAM: Scene Graph Matching for Data-Efficient Distributed SLAM

Yewei Huang, Tixiao Shan, Abhinav Rajvanshi, Niluthpol Chowdhury Mithun, Yaxuan Li, Brendan Englot, Han-Pang Chiu

Dartmouth College, 100 N Main St, Hanover, NH 03755, USA, Stevens Institute of Technology, 1 Castle Point Terrace, Hoboken, NJ 07030, USA

2026-06-16机器人

多机器人 SLAM 在低带宽、视角差异和轨迹重叠有限时,依赖视觉/点云特征做跨机器人关联容易通信开销大且不稳。SGM-SLAM 将 RGB-LiDAR 融合生成语义点云、物体层和轨迹层,用物体标签与质心进行场景图匹配,并通过多阶段交换与优化减少传输量。仿真及室内外腿足机器人实测表明,该方法能在不依赖 GPS 的分布式设置下完成有效地图合并与约束发现。

ExoTraj: A General Lower-limb Exoskeleton Assistance Policy for Complex Environments Figure 1
2026-06-16cs.RO

ExoTraj: A General Lower-limb Exoskeleton Assistance Policy for Complex Environments

Xiao-Yin Liu, Guotao Li, Long Sun, Xu Liang, Zeng-Guang Hou

1 affiliationmark: The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China, 2 affiliationmark: The School of Artificial Intelligence, University of Chinese Academy of Sciences, China, 3 affiliationmark: CASIA-MUST Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology, China., 4 affiliationmark: The School of Automation and Intelligence, Beijing, Jiaotong University, China

2026-06-16强化学习

面向复杂户外环境中外骨骼难以依赖昂贵动捕/足压设备进行自适应助力的问题,ExoTraj采用分层策略:上层用快速流匹配从多模态观测生成跨受试者关节轨迹,并通过一步迭代满足实时性;下层以MPC将预测轨迹转为平滑稳健力矩。实验显示其在线跨受试者预测误差较传统方法降低14.0%,相对零力矩条件代谢率降11.5%–24.4%,心率和峰值肌激活也明显下降。

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning Figure 1
2026-06-16cs.RO

Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning

Tung M. Luu, Hwanhee Kim, Younghwan Lee, Chang D. Yoo

2026-06-16视觉感知强化学习

这篇论文针对偏好强化学习在机器人任务中依赖大量人工视频比较、奖励标注成本高的问题,提出 VOTP:利用视频基础模型的表征空间刻画行为相似性,并用最优传输将少量已标注偏好传播到离线未标注片段,生成伪偏好来学习奖励。实验覆盖 D4RL、MetaWorld 和真实桌面操作,在极少反馈预算下优于现有离线 PbRL,并展示了对视觉干扰的一定鲁棒性;但方法仍依赖预训练视频模型,其偏差与 OT 计算扩展性需谨慎评估。

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies Figure 1
2026-06-16cs.RO

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao Wang

Beijing Academy of Artificial Intelligence, Peking University

2026-06-16机器人强化学习学习理论数据集/基准

针对通用操作策略在真实机器人上“会做训练任务但未必掌握可复用技能”的诊断难题,ATOM-Bench 将桌面操作拆成运动原子与指令原子,构建单臂/双臂30个原子任务和24个留出组合任务,并用AS、CFS区分原子能力不足与组合复用失败。五类策略2700次实机评测显示,简单指令 grounding 可学,但精细运动、计数和排除仍弱,且强原子表现不能稳定迁移到组合任务。

SoK: Security and Privacy of Foundation-Model-Powered Robots Figure 1
2026-06-16cs.RO

SoK: Security and Privacy of Foundation-Model-Powered Robots

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

College of Computing and Data Science, Nanyang Technological University, Singapore, School of Cyber Science and Engineering, Wuhan University, China

2026-06-16机器人

针对基础模型进入机器人后安全与隐私风险不再局限于模型本身、会沿具身执行链和外部生态扩散的问题,本文提出 F-E-S-G 四层信任边界框架,覆盖基础模型、具身系统、支撑生态与治理影响,并用多级 taxonomy 重新编码 96 篇研究。分析显示,现有工作存在跨层威胁传播被低估、防御与风险位置不匹配、隐私与评测协议覆盖不足等系统性缺口。

DIFF-IPPO: Diffusion-Based Informative Path Planning with Open-Vocabulary Belief Maps Figure 1
2026-06-16cs.RO

DIFF-IPPO: Diffusion-Based Informative Path Planning with Open-Vocabulary Belief Maps

Sausar Karaf, Oleg Sautenkov, Mikhail Martynov, Dzmitry Tsetserukou

*Equal contributionAuthors are with Intelligent Space Robotics Laboratory, CDE, Skoltech

2026-06-16生成模型规划控制

面向开放环境中的目标搜索,传统IPP常依赖高斯信念或昂贵优化,难以处理语义感知产生的多峰非高斯信念图。DIFF-IPPO将CLIP开放词汇信念图生成与条件扩散轨迹生成结合,并用覆盖目标做推理时引导,使轨迹集中高置信区域。合成数据归一化检测得分为81.49%–86.55%,搜救仿真中5架无人机约3.5分钟首次发现目标;但碰撞避免、任务分配和真实多智能体协同文中未充分说明。

DataLadder: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid Figure 1
2026-06-16cs.RO

DataLadder: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid

Peidong Liu, Yongce Liu, Songyan Guo, Fuyuan Ma, Zhihao Yuan, Ao Li, Zengjue Chen, Wenhao Li, Tianle Zhang, Mingyang Li, Jiale Zhang, Junzhe Xiong, Zhiyuan Xiang, Dafeng Chi, Yuzheng Zhuang, Yihang Li, Qingrong He, Jiaming Liang, Chen Cai, Peng Hao, Mingxi Luo, Song Wang, Junwu Xiong, Ruodai Li, Liyi Luo, Wei Tan, Dongjiang Li, Jiawei Li, Hui Shen, Yicheng Gong, Liang Lin

2026-06-16机器人

面向通用机器人策略评测难复现、真机示教昂贵且人类视频难直接用于机器人的问题,DataLadder把JoySim作为机器人—仿真—人类数据的中间层:一端将真实整理任务重建为校准数字孪生并引入人体反馈检查轨迹自然性,另一端把第一视角人类示教经物理约束过滤后转成机器人轨迹、标注和视角数据。主要结果是形成可云端复用的数据生成与评测基础设施;量化增益文中未充分说明,收益可能主要来自scaling和data管线化。

Pride and Prejudice: Toward an Information-Theoretic Framework for Mutually Communicative Driver Behavior Modeling Figure 1
2026-06-16cs.RO

Pride and Prejudice: Toward an Information-Theoretic Framework for Mutually Communicative Driver Behavior Modeling

Tingjun Li, Nan Xu, Shuo Feng, Hassan Askari, Bruno Henrique Groenner Barbosa, Konghui Guo

2026-06-16机器人

论文针对混合交通中自动车与人类驾驶员在变道时相互误读意图导致的不安全与低效率问题,将交互建模为隐式双向沟通。核心做法是把 level-k 贝叶斯劝服、虚拟特征、信息论沟通奖励和自适应沟通可供性结合,用 Pride-Inquiry 与 Pride-Prejudice 平面解释驾驶员表达、探询和偏见。基于 NGSIM 的 C-MIRL 标定显示,强制变道预测误差相对非沟通基线最高降低约 20%,DIL 问卷也与学习到的沟通变量呈正相关。

VENOM: Versatile Embodied Network for Omni-bodied Motion tracking Figure 1
2026-06-16cs.RO

VENOM: Versatile Embodied Network for Omni-bodied Motion tracking

Siddharth Padmanabhan, Kazuki Miyazawa, Takato Horii

Graduate School of Engineering Science, University of Osaka, 1-3 Machikaneyama-cho, Toyonaka-shi, Osaka 560-8531, Japan

2026-06-16视觉感知

针对跨不同人形机器人进行高表现、富表达的全身动作跟踪仍依赖拆分上下身控制且数据稀缺的问题,VENOM构建含状态、动作和奖励的多机器人仿真轨迹数据集,并用带多输入/动作头的GPT式统一控制器做监督学习。结果显示其在多机体、多行为上较多机器人MLP基线有更好关节跟踪与根部稳定性,加入噪声轨迹提升鲁棒性,并在无奖励反馈下接近TWIST2强化学习专家;增益可能主要来自架构与data scaling共同作用。

PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation Figure 1
2026-06-16cs.RO

PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation

Yanan Zhou, Ranpeng Qiu, Yincong Chen, Jiajie Cui, Weiming Zhi

School of Computer Science, The University of Sydney.Australian Centre For Robotics, The University of Sydney.

2026-06-16机器人

面向开放工作空间中移动物体、遮挡等局部扰动会使学习型操作策略脆弱的问题,PATCH不再依赖全局异常或策略不确定性,而是利用当前动作块投影短时执行走廊,在潜空间预测相关 patch 演化并累积无法由自运动解释的持续残差,作为暂停、恢复或路由干预信号。真实机器人 rollout 与部署实验显示,其触发比对比运行时监控更稳定、与任务更相关,并能在扰动后恢复原策略。

Towards mm-Level Accurate UWB Radar: High-Accuracy Phase-Based Obstacle Detection through Multi-Channel Fusion Figure 1
2026-06-16eess.SP

Towards mm-Level Accurate UWB Radar: High-Accuracy Phase-Based Obstacle Detection through Multi-Channel Fusion

Jelle De Moerloose, Adnan Shahid, Eli De Poorter

2026-06-16视觉感知

面向AGV、机器人避障等无需贴标签的精确测距需求,本文针对被动UWB雷达反射弱、多径混杂且相位漂移/缠绕难用的问题,提出用LOS参考抵消硬件相位漂移,并在粒子滤波中融合多频道幅度粗估与相位变化以解歧和抗信道退化。DW3000双基地机器人在金属工业环境中验证,中位误差1.69 cm,多信道相较单信道降错超过40%。

Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty Figure 1
2026-06-16cs.RO

Reinforcement Learning with Inner-loop Dynamics Estimator for Aerial Manipulation under Uncertainty

Shivansh Pratap Singh, Samaksh Ujjwal, Ishita Chaudhary, V R Vasudevan, Rishabh Dev Yadav, Spandan Roy

2026-06-16机器人强化学习安全鲁棒

针对空中机械臂在快速臂运动、抓取/释放导致载荷变化时难以精确建模和稳定控制的问题,论文提出分层框架:外层强化学习将6DoF末端目标映射为无人机—机械臂全身指令,内层用动力学估计器补偿未知耦合和惯性扰动。实机实验中相较RL+PID与RL+INDI+PID,平均RMSE最高降低40.9%、成功率更高;但验证主要限于八字轨迹,缺少显著性检验。

WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots Figure 1
2026-06-16cs.RO

WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots

Thang Tran Viet, Thanh Nguyen Canh, Gia Huy Uong, Phuc Van Dinh, Tan Viet Tuyen Nguyen, Xiem HoangVan, Nak Young Chong

2026-06-16机器人优化算法

面向实体类人机器人共语手势难以同时对齐语音重音并满足运动约束的问题,WaveSync将LLM给出的逐词语义重要性与Whisper时间戳构成语义波,用DMP约束轨迹,再以波前优化做峰值对齐和冲突传播。五个对话场景仿真中,其同步精度和主客观评价优于三个基线;但仍依赖固定动作库,真实机器人部署尚未验证。

Steering Generative Reinforcement Learning into Stable Robotic Controller Figure 1
2026-06-16cs.RO

Steering Generative Reinforcement Learning into Stable Robotic Controller

Yixuan Wang, Shutong Ding, Ke Hu, Tianxiang Gui, Jingya Wang, Ye Shi

ShanghaiTech University

2026-06-16机器人生成模型强化学习规划控制

论文针对扩散/流式生成策略在机器人部署时因随机潜变量采样导致动作抖动、接触不稳和响应不一致的问题,提出 SteerGenPO:先用生成式 RL 学到多模态动作流形,再训练状态条件潜变量 actor 以确定性“引导”生成策略,并用潜空间正则约束可靠支持域。实验在六个 Isaac Lab 任务和 Unitree G1 行走中优于 PPO、GenPO 等基线,提升回报、轨迹跟踪稳定性与指令响应可靠性。

Automated Digital Twin Construction for Highway Scenarios Using LiDAR Point Clouds and OpenStreetMap Figure 1
2026-06-16cs.RO

Automated Digital Twin Construction for Highway Scenarios Using LiDAR Point Clouds and OpenStreetMap

Yongqi Zhao, Dong Bi, Paul Kovacevic, Tomislav Mihalj, Martin Schabauer, Johannes Betz, Arno Eichberger

2026-06-16三维

面向自动驾驶仿真,真实高速道路的 OpenDRIVE 数字孪生构建仍依赖昂贵测绘和人工修正,且单靠 LiDAR 难覆盖匝道。论文提出融合车载 LiDAR 与 OSM 的自动流程:用点云重建主线车道、边界和高程,用 OSM 推断未测匝道几何与拓扑并统一导出地理配准 OpenDRIVE。六段真实高速实验平均横向 RMSE 为 0.740 m,生成地图可在 CarMaker 与 Esmini 中使用,但效果仍受 OSM 完整性和点云证据密度限制。

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models Figure 1
2026-06-16cs.CV

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

VGG, University of Oxford, ETH AI Center

2026-06-16视觉语言视觉感知

面向机器人与 AR 的跨时间室内重定位,论文指出自我中心 RGB 序列常有模糊、视角剧变和局部重叠,传统点云配准与需训练的场景图匹配都不稳。PROSE 用预训练 VLM 生成开放词汇 3D 场景图并进行跨扫描物体匹配,通过高度分桶、同/不同验证和几何一致性投票估计刚体变换,全程无需深度、标注图或训练。在 Aria Digital Twin 与 Aria Everyday Activities 上,其配准召回、旋转和位移误差均优于几何及学习式场景图基线,并支持后续路径规划。

Elastic ODYN: Differentiable Optimization for Infeasible Control and Learning in Robotics Figure 1
2026-06-16cs.RO

Elastic ODYN: Differentiable Optimization for Infeasible Control and Learning in Robotics

Aristotelis Papatheodorou, Jose Rojas, Ioannis Havoutis, Carlos Mastalli

2026-06-16机器人规划控制优化算法

机器人控制中的 QP 常因模型误差、冲突目标和退化接触而不可行,现有可微 QP 层易失稳。本文提出 Elastic Odyn,用平滑平方 ℓ2 弹性松弛和非内点原始-对偶求解,在不可行时收敛到最接近可行解,并配套对偶恢复、可微层和不可行感知 SQP。实验覆盖基准 QP、接触、参数辨识及四足/人形轨迹优化,显示其在鲁棒性、热启动和收敛可靠性上优于同类弹性求解器。

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning Figure 1
2026-06-16cs.AI

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

2026-06-16强化学习安全鲁棒

针对混合交通环岛中人类驾驶意图未知、冲突区是否可用难以判断的问题,ROSA-RL将Transformer的5秒冲突区占用概率预测作为强化学习状态,学习不确定性感知的速度建议,而非依赖确定性轨迹规则。基于真实数据的仿真显示,它在部分可观测场景下优于可比模型式基线,并接近完全已知占用的理想设置,同时改善效率与安全。

ADAPT: Analytical Disturbance-Aware Policy Training for Humanoid Locomotion Figure 1
2026-06-16cs.RO

ADAPT: Analytical Disturbance-Aware Policy Training for Humanoid Locomotion

Bofan Lyu, Jindou Jia, Kuangji Zuo, Yanshuo Lu, Shijia Han, Gen Li, Boyu Ma, Jingliang Li, Geng Li, Jianfei Yang

2026-06-16机器人强化学习

面向人形机器人在搬运、推门等力交互任务中易受未知外力扰动、仅靠域随机化或历史估计难以兼顾精度与泛化的问题,ADAPT 将解析全身扰动观测器接入强化学习策略,用可得动力学与电机力矩无传感器估计残余力/力矩,并作为观测和奖励塑形信号。Unitree G1 实验显示其在推挤、躯干扰动和未见过的非对称手部负载下提升速度跟踪与鲁棒性,还能诱导更轻足的步态。

Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning Figure 1
2026-06-16cs.LG

Direction-Conditioned Policies via Compositional Subgoal Scoring for Online Goal-Conditioned Reinforcement Learning

Swaminathan S K, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan, Aritra Hazra

2026-06-16强化学习

论文针对在线目标条件强化学习中远距离目标坐标对策略几何信息不足的问题,提出 DCP:用 InfoNCE 表征从已访问状态池中打分选择与目标对齐的子目标,并让 actor 只接收表征空间方向与距离;部署时去掉子目标池直接指向最终目标。作者用 HJB 解释方向充分性并给出失效条件,在 9 个导航/操作环境中多数指标优于 Contrastive RL,增益在操作和障碍交互任务更明显,但 AntSoccer 失败暴露了学习梯度病态。

Agile Fall Recovery for Quadrotors with Bidirectional Thrust via Reinforcement Learning Figure 1
2026-06-16cs.RO

Agile Fall Recovery for Quadrotors with Bidirectional Thrust via Reinforcement Learning

Anke Zhao, Yuhang Zhong, Kenghou Hoi, Junyu Mou, Junjie Wang, Lijie Wang, Jialiang Hou, Fei Gao

2026-06-16强化学习

针对四旋翼碰撞后可能以任意姿态倒地、且轻量传感器在接触和剧烈机动中易失效的问题,本文用双向推力平台学习自主起飞恢复。核心是循环强化学习策略结合非对称 actor-critic、INDI 低层控制和高保真电机/光流仿真,避免依赖显式状态估计。仿真消融和实机实验显示可零样本迁移,并在不同初始姿态、风扰、载荷和地面条件下恢复到稳定悬停。

APEX: Adaptive Policy Execution for Precise Manipulation Figure 1
2026-06-16cs.RO

APEX: Adaptive Policy Execution for Precise Manipulation

Mengfei Zhao, Chenxi Jiang, Tuo An, Jindou Jia, Jianfei Yang

2026-06-16机器人强化学习

本文关注模仿学习/VLA策略在部署时与底层PD等控制器之间的“执行间隙”:策略给出的高层参考缺少速度等高阶信息,且训练时不了解控制动态,导致精密操作失败。APEX作为不改策略和控制器的即插即用中间层,先用自适应被动滤波重构可执行参考,再依据实时跟踪误差在线补偿未知动力学,并给出收敛保证。实验中示范回放跟踪误差降41.2%,四类策略成功率提升4.8–25.8个百分点。

HATS: A Human-Agent Teleoperation System for Multi-Arm Data Collection Figure 1
2026-06-16cs.RO

HATS: A Human-Agent Teleoperation System for Multi-Arm Data Collection

Zesen Lin, Jian-Jian Jiang, Haoming Cen, Xiao-Ming Wu, Dandan Zhang, Wei-Shi Zheng

School of Computer Science and Engineering, Sun Yat-sen University, China, Nanyang Technological University, Singapore, Imperial College London, UK

2026-06-16机器人

面向需要三到四臂协同的大工作空间操作,论文指出现有单人遥操作负担重、多人成本和协调开销高。HATS 的核心是“人类主驾+MLLM 副驾”解耦控制:人直接控制两只主臂,免训练智能体用感知、规划和运动原语控制两只辅臂,并允许语音纠偏。七个真实任务中平均成功率达 86.4%,效率和数据质量接近专家双人团队,下游模仿学习效果也相当。

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies Figure 1
2026-06-16cs.RO

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

Yincong Chen, Ranpeng Qiu, Zihao Li, Yanan Zhou, Guoqiang Ren, Weiming Zhi

2026-06-16机器人模仿学习

双机器人搬运、铺展等物理耦合任务中,失败常来自相位错位、不会等待或让步,而非单机技能不足。论文提出 SAI:用单操作者分阶段训练 A、再让 B 学会配合已部署的 A,最后在协作失败附近稀疏干预修正 A,以伙伴分布课程诱导协调。真实刚性与柔性物体任务中,相比独立模仿和消融基线提升成功率、同步性与让步行为。

HOLO-MPPI: Multi-Scenario Motion Planning via Hierarchical Policy Optimization Figure 1
2026-06-16cs.RO

HOLO-MPPI: Multi-Scenario Motion Planning via Hierarchical Policy Optimization

Youngjae Min, Jovin D'sa, Faizan M. Tariq, David Isele, Navid Azizan, Sangjae Bae

2026-06-16强化学习规划控制优化算法

面向多场景机器人运动规划,论文针对端到端强化学习易受分布偏移影响、MPPI又依赖手工采样先验的问题,提出HOLO-MPPI:离线在抽象动作空间学习高层策略和世界模型,在线将其作为MPPI采样先验并在低层控制空间实时细化。自动驾驶实验显示其较原始MPPI、端到端SAC和仅用先验的方法成功率更高、控制更平滑,并保持实时性。

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry Figure 1
2026-06-16cs.CV

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry

Jituo Li, Shunwang Sun, Jialu Zhang, Xinqi Liu, Jinyao Hu, Zhicheng Lu, Sajad Saeedi, Guodong Lu

Zhicheng Lu is with the Rural Health Research Institute, Charles Sturt University, Sydney, Australia., Sajad Saeedi is with University College London, U.K.

2026-06-16生成模型安全鲁棒

本文针对单目视觉里程计在动态物体、低纹理和跨域场景下易漂移,以及现有学习式方法要么表征不够可解释、要么依赖复杂多阶段管线的问题,提出 MVOFormer。其核心是用光流—语义双分支编码器联合建模像素运动与对象先验,再由迭代多模态解码器抑制不可靠区域并逐步细化 6DoF 位姿。实验显示该方法无需目标域微调,在 TartanAir、KITTI、TUM-RGBD、ETH3D-SLAM 上优于已有学习式帧间方法,突出零样本鲁棒性。

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands Figure 1
2026-06-16cs.CV

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

2026-06-16机器人视觉感知

针对视频示教转机器人指令时常把动作说对却选错功能相关物体的问题,论文将动作识别与物体识别解耦:用 TSM 建模时序动作,用轨迹角色、模糊检测和重叠抑制筛选任务物体,再交给 VLM 做类别识别以支持新物体。修改版 Something-Something V2 上动作准确率 86.79%,标准/新物体 BLEU-4 为 0.337/0.261,较最强任务基线提升 80.2%/143.9%。

A Formal Resilience Framework for Cyber-Physical Embodied Systems under Device-Level Cyberattacks Figure 1
2026-06-16cs.CR

A Formal Resilience Framework for Cyber-Physical Embodied Systems under Device-Level Cyberattacks

Alberto Giaretta

2026-06-16机器人

面向机器人等具身CPS,论文指出传统故障容错依赖传感/执行器异常,难以处理隐蔽设备级网络攻击对任务和机体完整性的破坏。其核心是把IDS信号、功能目标、具身约束与设备关键性纳入统一形式化韧性框架,并定义可容忍扰动δ、退化阈值γ和缓解可行性μ等谓词。主要结果是通过引理、定理和分析示例证明框架内部一致性,可区分可容忍与不可容忍攻击并判断缓解策略;但仍以理论验证为主,真实机器人实证文中未充分说明。

RHO: Your Coding Agent is Secretly a Roboticist Figure 1
2026-06-16cs.RO

RHO: Your Coding Agent is Secretly a Roboticist

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

University of California, Berkeley

2026-06-16机器人

论文针对现有 Code-as-Policies 机器人系统在部署时依赖多轮 LLM 代码修正、难以实时控制的问题,提出 RHO:把计算转移到训练期,由带工具的编码代理在环境反馈下进化多文件“策略仓库”,而非单提示或单函数。其仓库级反思搜索可写测试、调用仿真、读错误并修改多文件,生成可解释的神经符号策略;在 Robosuite 单轮达 70.0%,LIBERO-PRO 达 45.0%,RAI O3DE 从 23.5% 提升到 44.3%。

Training and Evaluating Diffusion Policies with Long Context Lengths Figure 1
2026-06-16cs.RO

Training and Evaluating Diffusion Policies with Long Context Lengths

Abhinav Agarwal, Adam Wei, Taylan Kargin, Michael Zeng, Cole Becker, Arif Kerem Dayi, Pablo Parrilo, Asuman Ozdaglar, Russ Tedrake

Massachusetts Institute of Technology

2026-06-16生成模型

本文针对机器人模仿学习中短历史观测难以处理记忆需求、易重复失败动作的问题,系统考察 Diffusion Policy 在不同任务、数据规模、架构和上下文长度下的表现。核心洞察是,长上下文的朴素扩展并非必然脆弱,UNet+Cross-Attention 与足够数据可保持高成功率;同时提出多上下文长度课程式联合训练,在低数据场景较强基线提升约 1.25–2 倍,并重新审视过去动作预测增益来源。

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos Figure 1
2026-06-16cs.RO

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

Zhejiang University, Hangzhou, China, Shanghai Jiao Tong University, Shanghai, China, Shanghai AI Laboratory, Shanghai, China

2026-06-16机器人视觉感知

V2P-Manip针对遥操作/动捕数据昂贵且单目人类视频存在深度歧义、遮挡和接触不物理的问题,提出从非结构化RGB视频到灵巧手策略的统一流程,结合3D资产获取、尺度与轨迹估计、两阶段几何/物理一致性细化,并用残差强化学习约束探索。其在TACO和OakInk上提升位姿精度与训练效率,多项仿真任务平均成功率超过75%,且可迁移到五种不同灵巧手。

An Augmented Reality Brain-Robot Interface for Generalist Robot Arm Manipulation Figure 1
2026-06-16cs.RO

An Augmented Reality Brain-Robot Interface for Generalist Robot Arm Manipulation

Shangkai Zhang, Rousslan Fernand Julien Dossa, Luca Nunziante, Marina Di Vincenzo, Kai Arulkumaran

*This work was supported by JST under Moonshot R&D Grant Number JPMJMS2012. 1 All authors were with Araya Inc., Chiyoda, Tokyo, Japan at the time of this work.

2026-06-16机器人

针对现有辅助机器人接口多依赖特定任务、难支持真实环境中多步骤日常操作的问题,本文将AR视觉叠加、眼动选物与EEG运动想象选动作结合到共享自治框架,并接入通用机器人策略执行低层操作。18名健康被试完成饮水、抽屉和烤箱任务,子任务成功率接近满分,SUS为76.94,显示可用性较好,但尚未在目标运动障碍人群中验证。

SemGeoNav:A Safety-Guided Visual Navigation Approach with Semantic Reasoning and Geometric Planning Figure 1
2026-06-16cs.RO

SemGeoNav:A Safety-Guided Visual Navigation Approach with Semantic Reasoning and Geometric Planning

Yu Liu, Zongyang Chen, Yan Guo, Chao Liu, Xianfei Pan

2026-06-16机器人规划控制安全鲁棒

针对端到端视觉导航语义到达能力强但缺少显式几何约束、传统规划安全却难处理图像目标的问题,SemGeoNav采用分层框架:先由视觉基础模型/扩散模型生成语义候选轨迹,再用深度回投影、TTC风险筛选、梯度优化和时间平滑进行在线安全修正。Unitree Go2实机实验显示其相较ViNT、NoMaD取得更高成功率和更短导航时间。

ART-Glove: Articulated Tactile Glove for Contact-Grounded Dexterous Interaction Capture Figure 1
2026-06-16cs.RO

ART-Glove: Articulated Tactile Glove for Contact-Grounded Dexterous Interaction Capture

Changyi Lin, Ding Zhao

Carnegie Mellon University

2026-06-16机器人

针对灵巧操作示教中“保留人手灵活性”和“记录可用于接触推理的数据”难以兼得的问题,ART-Glove用16个刚性功能表面显式表示手侧接触几何,并以22个解剖对齐关节、编码器和2048点压阻触觉同步采集120 Hz数据。实验表明其能保持近自由手部运动,关节与触觉测量可靠,并可记录接触丰富任务中的表面运动和接触信号。

Is Your Trajectory Displacement Safe in Long-tail? Figure 1
2026-06-16cs.RO

Is Your Trajectory Displacement Safe in Long-tail?

Qiao Sun, Weicheng Zheng, Yixin Huang, Hang Zhao

Shanghai Qi Zhi Institute, Tsinghua University, Tongji University

2026-06-16规划控制安全鲁棒

针对长尾自动驾驶场景中闭环指标饱和、RFS/ADE与人类安全偏好不一致且缺少解释的问题,论文把规划评测改写为“相对专家轨迹是否引入额外威胁”的检测任务,提出FluidTest:成对WebUI标注、32类语义威胁体系和带反思的三智能体验证,并以NATR衡量安全性。在WOD-E2E val151上,标注一致性较高,Poutine与RAP分别有65%和51%轨迹被识别出额外威胁,说明高分规划器仍存在显著安全失败。

FlowMPC: Improving Flow Matching policies with World Models Figure 1
2026-06-16cs.LG

FlowMPC: Improving Flow Matching policies with World Models

Chandon Hamel

Stanford University

2026-06-16生成模型强化学习规划控制

FlowMPC针对流匹配行为克隆虽能生成多模态动作、但不直接优化回报且易受分布外误差影响的问题,将FM策略作为动作序列提议器,结合TD-MPC2式世界模型与MPPI在测试时评估和选择轨迹,无需改动FM训练目标。在ManiSkill的PickCube和PickSingleYCB上,加入规划后端成功率分别由93.14%升至97.44%、56.81%升至66.41%,显示世界模型主要帮助末端纠错和稳定完成任务。

TopoRetarget: Interaction-Preserving Retargeting for Dexterous Manipulation Figure 1
2026-06-16cs.RO

TopoRetarget: Interaction-Preserving Retargeting for Dexterous Manipulation

Jielin Wu, Shenzhe Yao, Guanqi He, Xiaohan Liu, Zhaoqing Zeng, Xiangrui Jiang, Han Yang, Wentao Zhang, Hang Zhao

IIIS, Tsinghua University

2026-06-16机器人

论文针对人手示教迁移到灵巧手时仅匹配手姿会破坏关键接触、进而影响基于参考轨迹的强化学习这一问题,提出 TopoRetarget:在手与物体关键点上构建稀疏交互图,用距离加权 Laplacian 形变、方向一致性、运动学约束和穿透处理保持局部手物关系。实验显示其在 ContactPose 上接触精度和对齐优于基线,Pen-Spin 训练成功率提升 40.6 个百分点,并在 Wuji Hand 上实现方块重定向和转笔的零样本迁移。

PolyMerge: Compressing 3D Gaussian Splats with Polytope Coverings for Provably Safe Resource-Constrained Navigation Figure 1
2026-06-16cs.RO

PolyMerge: Compressing 3D Gaussian Splats with Polytope Coverings for Provably Safe Resource-Constrained Navigation

Jihoon Hong, Chih-Yuan Chiu, Sara Fridovich-Keil, Glen Chou

Georgia Institute of Technology.

2026-06-16机器人三维安全鲁棒

面向小型无人机等算力/内存受限平台,3DGS虽能高保真建图却难以直接用于安全规划。PolyMerge将占据空间转成可调数量的凸多面体覆盖,并通过迭代合并在保守性与计算量间折中,保证对障碍的过近似;再结合CBF安全滤波实现在线避障。仿真和Crazyflie实机显示其可在板载约束下实时生成安全轨迹,速度优于基线且保持碰撞安全保证。

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation Figure 1
2026-06-16cs.RO

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu Li

Tongji University, Shanghai Innovation Institute, Xi’an Jiaotong University, Shanghai Jiao Tong University

2026-06-16机器人

面向多任务 VLA 微调中示范数据规模大、质量不均且影响函数难以扩展的问题,ATHENA用线性层梯度的Kronecker结构降低投影开销,并以低秩随机截断近似Hessian逆,同时设计全局/局部交互影响以避免任务间筛选失衡。实验显示其将影响计算从8054.6降至25.7 GPU小时,在RoboTwin 2.0用50%数据、真实机器人六任务用66.7%数据即可达到或超过全量联合微调。

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video Figure 1
2026-06-16cs.CV

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

2026-06-16视觉感知

面向机器人操作中布料、弹性体等可变形物体难以从真实交互快速建模的问题,EgoPhys尝试只用单段第一视角RGB人类操作视频构建可仿真的数字孪生;其关键在于先重建时序4D点云和粗弹簧模型,再把逐物体逆物理优化蒸馏为状态条件材料码本,用于预测未见物体的稠密刚度场。实验报告其在重建、未来预测和零样本泛化上优于基线,并在xArm6上展示了辅助规划的可行性。

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks Figure 1
2026-06-16cs.RO

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schmeckpeper

2026-06-16机器人

针对长时程家务操作中当前观测不足、视觉运动策略缺乏短期记忆的问题,论文提出 PRISM:用门控注意力抑制历史中的无关信息,并以层次化压缩降低长上下文计算与存储开销,可利用约两分钟历史;同时构建覆盖四类短期记忆的 ReMemBench。实验显示其在 ReMemBench、真实任务及 RoboCasa/LIBERO 上较强基线提升约 5%–15%。

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints Figure 1
2026-06-16eess.SY

Distributed Safe Consensus Under Asymmetric Input and Time-Varying Output Constraints

Abhinav Sinha, Shashi Ranjan Kumar

2026-06-16优化算法安全鲁棒

针对多智能体一致性中常忽略执行器非对称饱和与输出安全约束的问题,本文把非对称执行器动力学嵌入单积分器模型,并在时变安全区间上引入障碍坐标与带钉扎项的分布式同步律。理论结果证明在紧初值集上解完备、有界,实际输入严格满足上下限,输出前向保持安全,变换误差指数收敛,并同步到设计者指定的可行轨迹;仿真验证了这些性质。

A Deployment Case Study in Robotic Apparel Automation: Digital Twin Integration, Interoperability, and Workforce Enablement Figure 1
2026-06-16cs.RO

A Deployment Case Study in Robotic Apparel Automation: Digital Twin Integration, Interoperability, and Workforce Enablement

Gokul Narayanan, Abhiroop Ajith, Jonathan Zornow, Carlos Calle, Auralis Herrero Lugo, Jose Luis Susa Rincon, Chengtao Wen, Eugen Solowjow

2026-06-16机器人

面向服装制造中织物易变形、传统设备接口割裂而导致自动化难落地的问题,论文以牛仔短裤缝制作工厂部署案例为对象,核心洞察是把数字线程从 DXF 生成工艺参数与机器人轨迹,并用数字孪生做产线节拍、可达性和人机可用性预验证,再通过互操作层、运行时监测和操作员培训支撑现场执行。两阶段部署覆盖二维口袋工序和三维成形缝,表明这些系统级集成要素对从实验室走向规模化服装机器人自动化是关键。

Anisotropic Template Ansätze for Robust Positive Invariance under State-Dependent Uncertainty Figure 1
2026-06-16eess.SY

Anisotropic Template Ansätze for Robust Positive Invariance under State-Dependent Uncertainty

Abdelrahman Ramadan, Melissa Greeff, Sidney Givigi

2026-06-16安全鲁棒

针对鲁棒MPC用全局扰动集会忽略状态/输入相关不确定性的方向性、导致管集过保守的问题,论文提出由GP协方差生成的正定矩阵场来变换固定椭球模板,并用LMI与有限图验证保证RPI,在线仅需一次协方差查询和小矩阵开方。四旋翼仿真中,相比非自适应同伦基线,3D速度管体积缩小195倍,7D速度-控制子空间缩小约2.1×10^5倍;高维图证书构造仍是主要限制。

A Smart-Scheduled Hybrid (SSH) EKF-FGO State Estimation Figure 1
2026-06-16cs.RO

A Smart-Scheduled Hybrid (SSH) EKF-FGO State Estimation

Eric Levi, Soosan Beheshti

2026-06-16机器人

这篇论文关注机器人状态估计中实时性与全局一致性的取舍:EKF便宜但易漂移,FGO精确但计算贵。作者将“何时触发优化”显式建模,提出SSH EKF-FGO框架,让EKF逐步运行、FGO按固定间隔批量校正,并用EKF置信作为图优化先验。平面SLAM仿真显示,延长优化间隔会逐渐增加优化前漂移,但计算成本下降更快,因此存在以较低代价保留大部分全局优化收益的调度区间。

Leveraging Deep Learning for Object and Position Recognition of Load Carriers for Autonomous Logistics Vehicles Figure 1
2026-06-16cs.RO

Leveraging Deep Learning for Object and Position Recognition of Load Carriers for Autonomous Logistics Vehicles

Christoph Legat, Tobias Miller, Marco Riess

Research Group on Cognitive Autonomy & Predictive Intelligence, Technical University of Applied Sciences, Augsburg, Germany

2026-06-16视觉感知

面向工厂内 AGV 自动取放载具时人工摆放带来的位置偏差,论文提出用 RGB-D 相机与 CNN 直接预测载具固定地标点,再结合已知几何模型估计相对距离、横向偏移和旋转角。系统在工业硬件上实现,运行约 55.8 ms,满足 15 fps 实时性要求;但结论承认当前地标预测精度仍不足,定位误差对偏差较大场景敏感,需更大数据集和更强网络改进。

$λ$-Reachability: Geometric-Horizon Safety Bellman Equations for Humanoid Safety Figure 1
2026-06-16cs.RO

$λ$-Reachability: Geometric-Horizon Safety Bellman Equations for Humanoid Safety

Rui Chen, Shangtao Li, Yifan Sun, Changliu Liu

Robotics Institute, Carnegie Mellon University

2026-06-16机器人安全鲁棒

面向人形机器人在高维感知与复杂动力学下难以用传统 HJ/CBF 精确评估长期安全的问题,本文提出 λ-Reachability,用几何分布多步 rollout 与随机吸收终端构造安全 Bellman 目标,在一步 TD 与长时域最坏安全信号之间可调,并证明 δ<1 时为压缩映射、λ→1 可恢复无折扣可达性目标。仿真和真实人形机器人平衡、避障实验显示,其安全集边界分类和安全裕度估计均优于一步 TD 基线。

Friction Characterization of a Cable-Driven Differential Actuation System for Lower-Limb Exoskeletons Figure 1
2026-06-16cs.RO

Friction Characterization of a Cable-Driven Differential Actuation System for Lower-Limb Exoskeletons

Alberto Maria Nobili, Fabio Salsedo, Alessandro Filippeschi

2026-06-16机器人

面向下肢外骨骼减轻远端质量与避免关节扭矩传感器的需求,论文提出髋—膝屈伸差动驱动结构,用两台电机通过线性耦合共享关节扭矩,并针对齿轮与缆索/滑轮传动建立含载荷相关与无关项的摩擦估计模型。实机原型实验表明该方法可进行无传感器关节扭矩估计,但具体误差与控制增益幅度文中未充分说明。

ControlMap: Controllable High-Definition Map Generation for Traffic Scenario Simulation Figure 1
2026-06-16cs.RO

ControlMap: Controllable High-Definition Map Generation for Traffic Scenario Simulation

Marwan Farag, Steffen Wäldele, Yu Yao

ControlMap: Controllable High-Definition Map, University of Stuttgart, Stuttgart, Germany, This paper presents a data-driven pipeline for controllable HD map gen-, and city-level style transfer via city label conditioning. To complement, Controllable Generation, No Label, No Label indicates that the model took no city label as input during genera-

2026-06-16规划控制

面向自动驾驶仿真中 HD 地图采集昂贵、场景拓扑难以按需覆盖的问题,ControlMap 用易获取的 SD/OpenStreetMap 道路骨架作为空间控制信号,将 ControlNet 式分支接入 SLEDGE 的潜空间扩散 Transformer,并用 classifier-free guidance 调节服从度与多样性、用城市标签控制风格。实验显示生成地图能更贴合输入道路拓扑并保留城市级细节,新增指标也表明其相对无条件基线更接近真实 HD 地图。

Energy-Efficient Arm Reaching for a Humanoid Robot via Deep Reinforcement Learning with Identified Power Models Figure 1
2026-06-16cs.RO

Energy-Efficient Arm Reaching for a Humanoid Robot via Deep Reinforcement Learning with Identified Power Models

Nestor N. Deniz, Simon Parsons, Fernando Auat Cheein

Nestor N. Deniz, Sebastian Vega and Fernando Auat Cheein are with the Engineering Department at Harper Adams University, Newport, Shropshire TF10 8NB, UK.

2026-06-16机器人强化学习

面向采摘等野外任务中仿人臂反复伸手受电池约束的问题,论文将实验辨识的 Unitree G1 左臂电功率模型嵌入强化学习评估与奖励设计,并用 SAC 学习增量关节位置策略;其关键洞察是能耗、可达工作空间和低层 PD 跟踪共同决定 sim-to-real 表现。结果显示,运动学仿真随机目标成功率 69.9%,真机 30 次受限采摘包络内试验均满足 4 cm/8.6° 容差,平均能耗 71.5±48.3 J。

Identification of a Physics-Based Electrical Power Consumption Model for the Unitree G1 Humanoid Arm Figure 1
2026-06-16cs.RO

Identification of a Physics-Based Electrical Power Consumption Model for the Unitree G1 Humanoid Arm

Nestor N. Deniz, Sebastian Vega, Simon Parsons, Fernando Auat Cheein

Nestor N. Deniz, Sebastian Vega and Fernando Auat Cheein are with the Engineering Department at Harper Adams University, Newport, Shropshire TF10 8NB, UK.

2026-06-16机器人

面向电池受限的人形机器人操作,本文为 Unitree G1 七自由度左臂建立可解释的物理线性用电模型,以支持能耗感知规划、续航与热管理。核心在于用基线扭矩修正刻画重力补偿下铜损变化,并加入关节速度两两交互描述多关节耦合。基于实机 897 条轨迹识别后达 R²=0.933、RMSE 1.07 W,在未见速度的 46 条验证轨迹上 R²=0.965。

GeoTLM: Geometry-aware Tactile-Language Models for Contact Motion Orientation Reasoning of Dynamic Objects Figure 1
2026-06-16cs.RO

GeoTLM: Geometry-aware Tactile-Language Models for Contact Motion Orientation Reasoning of Dynamic Objects

Qiutian Li, Zinan Liu, Lin Wang

2026-06-16机器人

这篇论文针对现有触觉-语言模型在接触丰富场景中难以判断旋转、滑动方向的问题,指出瓶颈不在模型规模而在缺少保留剪切场几何结构的归纳偏置。GeoTLM加入仅约14k参数的DGR模块,用接触掩码引导剪切表示,并通过反对称七区域池化捕捉旋转手性。实验显示,在新物体旋转识别上较无几何编码器提升14.6个百分点,真实传感器滑动识别提升16.2个百分点。

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI Figure 1
2026-06-16cs.RO

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

2026-06-16视觉语言

面向具身机器人低功耗视觉感知,论文指出 Spikformer 虽省能但难以直接吸收 VLM 的多模态知识。VL2Spike 将冻结 VLM 作为教师,提出空间-时间视觉脉冲蒸馏对齐图像特征、脉冲 token 与膜电位动态,并用脉冲原型引导语言蒸馏注入文本语义。实验报告静态数据集平均提升 6.81%、能耗约 15.7%,VPR 任务提升 6.63%。

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors Figure 1
2026-06-16cs.RO

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors

Loukas Kordos, Leonard T. Franz, Simon Rappenecker, Oliver Hausdoerfer, Angela P. Schoellig, Pavel Kolev, Georg Martius

2026-06-16机器人

针对四足机器人强化学习常把任务、硬件限制、步态偏好和地形适应混在复杂奖励中的问题,LoComposition 将速度跟踪、运行约束、能耗最小化与外感知分离,主张无需显式步态先验即可涌现高效步态。消融显示各组件对应不同失效模式;相较复杂奖励基线,在越障能力相近下运输成本降低56%、限制违规减少96%,并可零样本迁移到 Unitree Go2。

FlashNav: Ultra-Fast Policy Training for Robot Navigation within 20 Seconds Figure 1
2026-06-16cs.RO

FlashNav: Ultra-Fast Policy Training for Robot Navigation within 20 Seconds

Shanze Wang, Yiwei Qian, Xinming Zhang, Jun Xue, Siwei Cheng, Xianghui Wang, Qingyuan Hu, Xiaoyu Shen, Wei Zhang

Eastern Institute of Technology, Ningbo, The Hong Kong Polytechnic University, National University of Singapore, University of Science and Technology of China, Shanghai Jiao Tong University

2026-06-16机器人强化学习

针对深度强化学习导航训练常需数小时、阻碍快速适配与部署的问题,FlashNav将速度级导航抽象为与MDP对齐的GPU批量位图仿真,只保留占据几何、激光测距、目标条件控制、碰撞与重置,移除渲染和高保真物理,并配合全GPU离策略训练。实验显示其在TurtleBot2和Unitree Go2上最快20秒内达到100%成功率,且策略可迁移到真实轮式与腿式机器人。

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies Figure 1
2026-06-16cs.RO

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu

♠ \spadesuit Tsinghua University, ◆ \blacklozenge Jilin University, ▶ \blacktriangleright Nankai University, ♣ \clubsuit Peking University, ■ \blacksquare Harbin Institute of Technology, ▼ \blacktriangledown Zhongguancun Academy

2026-06-16机器人强化学习

这篇论文针对现有 VLA 缺少动作后果预判、像素级 WAM 又因视频生成而延迟高的问题,提出 LaWAM:在预训练视觉特征潜空间中复用 latent action model 的前向解码器,直接预测紧凑的潜在视觉子目标,并以此条件化动作块生成。实验在 LIBERO 达 98.6%、RoboTwin 达 91.22%,真实操作也具竞争力;单次动作块推理 187ms,较像素空间 WAM 最多降低 24 倍延迟。

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models Figure 1
2026-06-16cs.CL

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

Beijing Jiaotong University

2026-06-16视觉语言视觉感知

针对现有 VLA 机器人策略几乎只用英文训练与评测、难以判断多语言能力是否能迁移到动作执行的问题,本文扩展 LIBERO、SimplerEnv 等基准构造多语言与语码混合指令,系统评估并分析行为和表征偏移。结果显示即使语言骨干具备多语能力,非英文指令仍显著降成功率;提出的 MPCA 通过对齐多语言主成分表征,可缓解这一差距。

Can Causal Models Enhance Robot Navigation? Online Causal Adaptation for Real-Robot Navigation Figure 1
2026-06-16cs.RO

Can Causal Models Enhance Robot Navigation? Online Causal Adaptation for Real-Robot Navigation

Zhitao Liang, Alex Mitrevski, Emmanuel Dean, Karinne Ramirez-Amaro

2026-06-16机器人

针对因果模型多停留在仿真或离线分析、难以验证其能否提升真实机器人导航的问题,本文将一个面向“感知能力”的因果模型接入 ROS2/nav2:既离线评估轨迹,也在预测能力低时在线接管速度指令。TIAGo 走廊实验显示,该评分与路径效率正相关、与不规则行为负相关,并与人工标注高度一致(κ=0.88);在转角和避障等复杂场景优于默认导航,但简单场景增益有限,且安全性受未建模环境因素限制。

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning Figure 1
2026-06-16cs.RO

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning

Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie

Harbin Institute of Technology, Shenzhen, Shandong University, Shenzhen Loop Area Institute

2026-06-16机器人

论文针对具身持续学习中闭环控制会放大特征漂移、导致旧操作任务遗忘的问题,提出将新任务视为可复用技能组合的 SCE 框架。其通过 CSG 从示范中构建技能库,并用 DETE 分别建模技能执行与跨技能转换,再自适应融合生成动作。LIBERO 与真实机器人实验显示,该方法在保持旧任务能力和整体成功率上优于对比方法,消融与特征漂移分析支持其收益来自更稳定的技能复用与切换。

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty Figure 1
2026-06-16cs.RO

PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty

Wenjing Tang, Xuanjin Jin, Yuan Liu, Renming Huang, Cewu Lu, Panpan Cai

Shanghai Jiao Tong University, Shanghai Innovation Institute

2026-06-16机器人模仿学习规划控制安全鲁棒

真实机器人长程操作同时受感知遮挡与技能执行随机性影响,手工构建可用于规划的 POMDP 成本很高。本文提出 PO-PDDL,将 PDDL 的关系符号表示扩展为含信念、随机转移和观测模型的形式,并从真实执行视频重建隐状态轨迹、用状态—观测不一致识别部分可观测性来学习模型。实验显示其在含约束和不确定性的实机任务中达到 100% 成功率、最高累计奖励,并比现有 PDDL/POMDP 学习与 VLM 规划降低规划成本。

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action Figure 1
2026-06-16cs.AI

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action

Cheng Zhang, Qing Cai, Xingzheng Wu, Xun Yang, Xiaojun Chang, Bingkun Bao, Liqiang Nie, Xinwang Liu, Yi Yang

2026-06-16机器人

针对医疗基础模型多停留在静态感知与决策、难以参与真实临床物理交互的问题,本文以“感知—决策—行动”闭环重组医疗具身智能研究,系统梳理核心组件、手术机器人/护理陪伴/沉浸式教学/远程诊疗等应用和数据集;主要结果是给出统一分类框架,并指出数据稀缺、不确定性建模与高精度安全控制仍是落地瓶颈。

TO-SoFiT: Topology Optimization of Hydraulic Soft Fish Tail Design for programmable undulating locomotion Figure 1
2026-06-16cs.RO

TO-SoFiT: Topology Optimization of Hydraulic Soft Fish Tail Design for programmable undulating locomotion

A Padmaprabhan, Amal Shaji, Prabhat Kumar

Indian Institute of Technology Hyderabad, Indian Institute of Technology Hyderabad Telangana, 502285 India

2026-06-16机器人优化算法

面向软体机器鱼尾仍依赖经验设计、难以处理液压载荷随结构变化而耦合的问题,本文用密度式拓扑优化结合 Darcy 定律与排水项建模压力分布,并在多目标约束下协同优化 PneuNet 鱼尾单元。仿真显示优化截面在相同 3 kPa 下较矩形单元变形提升 17.30%,串联单元可产生可调波动幅值和多轴弯曲,但实验实物验证文中未充分说明。

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time Figure 1
2026-06-16cs.RO

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun

NAVER AI Lab, Korea University

2026-06-16视觉感知

为降低VLA/WAM在新任务上反复采集机器人示教与微调的成本,论文提出ReCAP:先用目标机器人与廉价源 embodiment(如人手)配对轨迹训练一次,部署时冻结模型,仅向检索池追加源侧示教,并以检索轨迹提供高层进展、策略学习残差纠偏。实验显示PushT未见角度成功率从6.0%升至34.9%,RoboTwin未见任务31.5%优于26.0%,且有真实机器人验证。

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC Figure 1
2026-06-16cs.RO

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou

Georgia Institute of Technology

2026-06-16强化学习规划控制安全鲁棒

面向仅有像素观测、显式状态难以获得的安全机器人控制,本文将紧凑马尔可夫潜空间世界模型与并行 SLS 鲁棒 MPC 结合,并用 conformal prediction 校准动力学误差和潜空间约束检查器误差,从而在规划时传播可达管并施加概率安全约束。实验覆盖 Reacher、Cube、Push-T 和双臂绳操作,名义规划成功率显著高于 Le-WM、DINO-WM、PLDM,鲁棒设置下也较 HJ-filtered、LPB 等提升安全率和鲁棒成功率;复杂顺序任务仍受潜空间欧氏目标距离限制。

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments Figure 1
2026-06-16cs.RO

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

Zhejiang University, Shanghai Innovation Institute, Hong Kong University of Science and Technology (GZ), Nanjing University

2026-06-16安全鲁棒

本文关注精细操作中“完美示教反而难学”的问题:流畅专家轨迹把对齐、接触和纠偏压缩到很短片段,导致策略主要学到自由空间运动。作者提出从数据与表示两层处理:刻意放慢关键段、重采样关键帧,并用 STAIR 将短时局部运动蒸馏为动态特征来条件化 VLA 动作专家。实验显示,仅用流畅数据时 STAIR 将六个真实任务总体成功率由 50.0% 提升到 62.2%,接近刻意示教的 64.4%。

SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA Figure 1
2026-06-16cs.RO

SAPS: Shared Autonomy for Policy Steering by Blending Teleoperation with a Pretrained VLA

Crystal Zhou, Jehan Yang, Douglas J. Weber, Zackory Erickson

Carnegie Mellon University

2026-06-16强化学习

针对预训练 VLA 在物体位置、语义等分布外扰动下易失效,而纯遥操作负担高的问题,SAPS 将人类实时遥操作指令与冻结策略输出在动作层融合,无需重训、辅助模型或改采样器,并比较固定混合、接管与余弦相似度动态仲裁。其在 LIBERO、LIBERO-PRO、CALVIN 和真实 Franka 上相较全自主最高提升 82% 成功率,同时减少人工介入并缩短完成时间。

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation Figure 1
2026-06-16cs.RO

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

Nanyang Technological University, Singapore, National University of Singapore, Singapore

2026-06-16机器人生成模型规划控制

针对多机器人在障碍环境中同时满足到达目标、避障与通信连通约束时,传统优化/采样方法易陷入局部最优或需后处理的问题,论文提出 Roken:把每个机器人轨迹表示为 token,用扩散 Transformer 通过自注意力建模协同,并跨注意力读取地图,同时加入局部占据重建和远期路标预测辅助监督。实验显示其可前馈生成不同规模队伍的连通安全轨迹,成功率超过生成训练数据的基线,并能泛化到未见或部分观测环境。

NIMO: A Software Platform for Closed-Loop Materials Exploration with Diverse AI Algorithms Figure 1
2026-06-16cs.RO

NIMO: A Software Platform for Closed-Loop Materials Exploration with Diverse AI Algorithms

Ryo Tamura, Naruki Yoshikawa, Koji Tsuda, Shoichi Matsuda

Center for Basic Research on Materials, National Institute for Materials Science, 1-1 Namiki, Tsukuba, Graduate School of Frontier Sciences, The University of Tokyo, 5-1-5 Kashiwa-no-ha, Kashiwa, Chiba, Center for Green Research on Energy and Environmental Materials, National Institute for Material, Self-driving laboratories (SDLs), where artificial intelligence proposes subsequent experiments and, goals with the heterogeneous robotic hardware found across different laboratories. Here, we present, freely available at https://github.com/NIMS-DA/nimo, offering a versatile, plug-and-play foundation to, automated experimentation defines the self-driving laboratory (SDL)3–7. In an SDL, the AI proposes the, center of this integration, coordinating the flow of commands and data among the individual modules and

2026-06-16机器人

材料自驱实验室的瓶颈在于多样 AI 策略难以与各实验室异构机器人顺畅闭环。NIMO 以 CSV 文件交换解耦 AI 与硬件,并用离散候选池约束可行实验,在统一 Python 接口中集成 12 类探索算法。论文展示其已驱动电解液、有机合成、薄膜、燃料电池、咖啡环相图和传统移液平台等六类 SDL,并可接入 IvoryOS;但文中更偏平台综述,算法带来的定量效率增益未充分说明。

Transferring Contact, Not Just Motion: Compliant Grasping Across Dexterous Hands Figure 1
2026-06-16cs.RO

Transferring Contact, Not Just Motion: Compliant Grasping Across Dexterous Hands

Soofiyan Atar, Yao-Ting Huang, Michael Yip

Department of Electrical and Computer Engineering, University of California San Diego, United States

2026-06-16机器人

这篇论文针对跨灵巧手抓取中“只迁移动作、不迁移接触力”导致易滑落、过约束和遮挡下失效的问题,提出把各手的原始 effort 经系统辨识标定为关节力矩、指尖力与负载描述,并与共享 MANO 手姿态 latent 组成统一力-位置接口;在此基础上训练带视觉遮挡增强的 MARC flow-matching 策略,并用混合力/位置控制执行。实验覆盖三种结构不同的手和十个物体,reach-and-lift 平均成功率由 0.44 提升到 0.71,并可零样本迁移到未见 15-DoF 配置。

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities Figure 1
2026-06-16cs.RO

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

Hassan Ismkhan, Hamid Bouchahcia

Bournemouth University

2026-06-16视觉语言强化学习模仿学习安全鲁棒

针对真实机器人部署中相机遮挡、传感器掉线导致多模态模仿学习失效的问题,论文提出 RL4IL:用 PPO 在 BFS 扩展候选示范上学习检索排序,并通过软交叉注意力融合动作;缺失模态时再用按模态的 RL 检索与软插补重建嵌入,无需重新训练策略。在 LIBERO-Spatial/Object/Goal 上,完整相机 dropout 下显著优于 BC、BESO-ACT、DisDP 等,最高成功率 0.733,而 DisDP 为 0.295。

Understanding and Modeling Perceived Cognitive and Physical Strain Dynamics for Planning-Oriented Human-Robot Collaboration in Prefabricated Construction Figure 1
2026-06-16cs.RO

Understanding and Modeling Perceived Cognitive and Physical Strain Dynamics for Planning-Oriented Human-Robot Collaboration in Prefabricated Construction

Yifan Wang, Bo Xiao, Shane T. Mueller

for Planning-Oriented Human–Robot Collaboration in Prefabricated, .​ Ph.D. Candidate, Department of Civil, Environmental, and Geospatial Engineering, .​ Assistant Professor, Department of Civil, Environmental, and Geospatial Engineering, .​ Professor, Department of Psychology and Human Factors, Michigan Technological, Abstract: Human–robot collaboration (HRC) in prefabricated construction requires, mixed-effects modeling to examine collaborative conditions, session effects, and, Keywords: Human-centric human–robot collaboration, productivity, flexibility, and safety, collaborative robots and human–robot teams have, Human–robot collaboration (HRC) task allocation and scheduling are

2026-06-16机器人规划控制

面向预制建筑人机协作调度,论文指出现有规划常把工人状态视为固定,难以反映重复作业与休息中的认知/体力负荷变化。作者通过受控工作-休息实验采集主观努力评分,比较线性、指数与混合效应模型,提出可嵌入任务分配的状态动态表征;结果显示认知负荷累积更符合线性混合效应模型,而休息恢复呈非线性衰减。

FD-SLAM: Fast Dense Radar-Inertial SLAM with Frequency-Domain Loop Closure and Pose Graph Optimization Figure 1
2026-06-16cs.RO

FD-SLAM: Fast Dense Radar-Inertial SLAM with Frequency-Domain Loop Closure and Pose Graph Optimization

Nader J. Abu-Alrub, Nathir A. Rawashdeh

2026-06-16优化算法三维

针对扫描雷达在恶劣可视条件下适用但噪声大、帧率低、长轨迹匹配易漂移的问题,FD-SLAM保留雷达强度图的稠密结构,用频域极坐标描述子检索回环,并经相位相关、配准相似度和几何一致性等多阶段验证后加入SE(2)位姿图优化。公开数据集上相较FD-RIO降低漂移,精度接近现有雷达SLAM,旋转精度较好,CPU前端可超过雷达采样率。

FARM: Find Anything using Relational Spatial Memory Figure 1
2026-06-16cs.RO

FARM: Find Anything using Relational Spatial Memory

Siming He, Leo Huang, Adam Lilja, Fabio Hubel, Jonas Frey, Marco Pavone, S. Shankar Sastry, Jitendra Malik, Claire Tomlin

Stanford University

2026-06-16机器人

面向家庭、仓库等多相似物体场景,论文指出仅按类别或视觉特征记忆难以响应“在某物左侧/下方”的关系式查询。FARM构建实时开放词汇的对象级关系空间记忆,用高斯对象表示、异步视觉语言描述,并将LLM解析出的符号关系显式执行,再由VLM重排候选。在67个场景、4.4万查询上,Recall@5/10较既有方法提升164%/224%,Accuracy@1经重排提升35%,并在四足机器人上闭环演示。

Learning Context-Aware Neural ODE Dynamics for Adaptive Robotic Control Figure 1
2026-06-16cs.RO

Learning Context-Aware Neural ODE Dynamics for Adaptive Robotic Control

Shao-Yi Yu, Jen-Wei Wang, Maya Horii, Masayoshi Tomizuka, Vikas Garg

2026-06-16机器人规划控制

针对风场、接触条件或载荷变化下模型预测控制难以依赖固定动力学的问题,论文提出上下文感知 Neural ODE:用状态—动作历史推断隐含环境因素,并通过两阶段训练将环境表征与连续时间动力学解耦,无需先验物理模型即可接入 MPC。实验显示其在变风四旋翼仿真中优于基线,并在 Sphero 不同地面与 Fanuc 变质心推物任务上提升预测精度和鲁棒性。

A Bilateral Teleoperation Framework for Dexterous Manipulation Figure 1
2026-06-16cs.RO

A Bilateral Teleoperation Framework for Dexterous Manipulation

Stefano Dalla Gasperina, Dong Ho Kang, Haiyun Zhang, Aldo Galvan, Job D. Ramirez, Aaron Kim, Mark Helwig, Kazuto Yokoyama, Takahisa Ueno, Tetsuya Narita, Ann Majewicz-Fey, Ashish D. Deshpande, Luis Sentis

2026-06-16机器人

面向接触丰富的灵巧遥操作中手臂协同、低延迟反馈和异构设备集成不足的问题,本文构建了模块化双向框架,将手外骨骼、力反馈臂、柔顺机械臂与三指灵巧手统一到ROS控制栈,支持手部重定向、多尺度触觉和共享控制。真实操作验证了系统可行性,并指出关键增益更依赖形态感知重定向、合适触觉粒度与非自主共享控制,而非单纯硬件保真度。

A Corridor-Scale CARLA-VISSIM Co-Simulation Framework for Multi-Intersection Urban Traffic Figure 1
2026-06-16cs.RO

A Corridor-Scale CARLA-VISSIM Co-Simulation Framework for Multi-Intersection Urban Traffic

Sima Ashayer, Austin Haris, Mina Sartipi

2026-06-16强化学习

面向自动驾驶与智慧走廊研究中“微观交通逻辑”和“高保真感知环境”难以兼顾的问题,论文实现了 CARLA UE5 与 VISSIM 2026 的十五路口走廊级协同仿真,通过双向步进同步、actor 所有权/生命周期管理、坐标对齐和 LiDAR/RoadRunner HD 地图统一几何。MLK 案例显示其可在约 100 车、100 行人负载下保持信号镜像、车行人同步和混合控制稳定,但效果主要是系统集成与规模验证。

A Hybrid Model-Based and Model-Free Framework for Active Multi-View Viewpoint Optimization in Sonar Target Recognition Figure 1
2026-06-16cs.RO

A Hybrid Model-Based and Model-Free Framework for Active Multi-View Viewpoint Optimization in Sonar Target Recognition

Yongkyoon Park, Jane Shin

2026-06-16视觉感知优化算法

面向水下机器人前视声呐识别中单视角噪声大、外观随视角剧烈变化且在线 POMDP 规划开销高的问题,本文将 CNN 观测似然、基于 Radon 的方向估计与信息增益奖励结合,用 PPO 离线学习依赖信念状态的选视角策略,部署时仅做贝叶斯信念更新和策略前向推理。海洋垃圾声呐数据实验显示,其在保持或提升识别准确率的同时减少观测步数与运动代价,实时性接近纯模型自由方法。

Robust Conformal CBF and CLF Controllers via Iterative Policy Updates Figure 1
2026-06-16eess.SY

Robust Conformal CBF and CLF Controllers via Iterative Policy Updates

Omid Mirzaeedodangeh, Eliot Shekhtman, Nikolai Matni, Lars Lindemann

2026-06-16强化学习规划控制安全鲁棒

本文针对将保形预测误差界直接用于鲁棒 CLF/CBF 时会因策略诱导的闭环分布漂移而丢失安全/稳定保证的问题,提出按 episode 迭代更新策略的框架。核心是用对抗鲁棒保形预测,并通过闭环轨迹敏感性分析给出可计算的分布漂移预算及隐式/显式误差界更新规则。论文证明了每轮有限样本有效性、概率安全与稳定证书及收敛条件,并在倒立摆、多障碍迷宫和四旋翼上验证。

SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation Figure 1
2026-06-16cs.RO

SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation

Wenkang Hu, Haoran Wang, Yitong Li, Liu Liu, Mengao Zhao, Lai Jiang, Xincheng Tang, Junhang Wei, Zhengjie Shu, Zhendong Wang, Zhizhong Su, Huamin Wang, Ruigang Yang

Shanghai Jiao Tong University

2026-06-16机器人

针对可变形物体操作中真实数据昂贵、RGB 仿真到真实长期依赖微调/遥操作的问题,SimWeaver 将可测量校准的可变形仿真器、单图资产生成、拓扑感知确定性轨迹合成和 ISP 感知视觉增强串联,用每任务 200 条仿真示范训练 VLA 策略。其在 5 类任务零样本真实部署平均成功率 91%、单任务均超 80%,丝绸抓取在纹理/光照/旋转分布移位下达 100%,且单轨迹成本显著低于真实采集。

Covariance-Regulated Recursive Koopman Learning for Nonlinear Systems with Uncertain Time-Varying Dynamics Figure 1
2026-06-16cs.RO

Covariance-Regulated Recursive Koopman Learning for Nonlinear Systems with Uncertain Time-Varying Dynamics

Weibin Gu, Chen Yang, Lu Shi, Chao Gao

Tsinghua University, PR China, China University of Petroleum-Beijing at Karamay, PR China, Xinchen Qihang Inc., PR China, † Corresponding authorsThis work was supported in part by the China Postdoctoral Science Foundation (Grant No. 2025M781650) and Xinchen Qihang Inc., PR China.

2026-06-16机器人

针对机器人离线动力学模型在滑移、摩擦等时变不确定条件下易失效的问题,论文分析递归 Koopman/RLS 在线辨识中的协方差膨胀与增益冻结,并提出 CR-RKL,通过误差死区门控或恒迹归一化约束协方差。实验在差速车和26克扑翼微飞行器上显示,该方法能稳定在线建模,并嵌入 MPC 后保持较可靠跟踪。

Hamilton-Jacobi Reachability-Based Safe Reinforcement Learning for Emergency Collision Avoidance Figure 1
2026-06-16eess.SY

Hamilton-Jacobi Reachability-Based Safe Reinforcement Learning for Emergency Collision Avoidance

Yuhong Jiang, Shiyue Zhao, Junzhi Zhang, Junfeng Zhang, Xinhan Li, Shijie Zhao, Chengkun He

2026-06-16强化学习安全鲁棒

面向低附着、极限工况下紧急避障中“当前安全但未来失稳/碰撞”的问题,论文将几何碰撞裕度与横摆稳定边界统一为符号安全函数,并用HJ可达性从离线极限驾驶数据近似有限时域运动安全集,再作为CMDP连续安全代价指导PID-Lagrangian SAC。仿真和实车结果显示,该方法较基线提高到达率、轨迹更平滑,并保持更大的统一安全裕度。

Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models Figure 1
2026-06-16cs.RO

Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models

Shenhao Yan, Ge Wang, Qi Liu, Weilin Meng, Jiahao Yang, Chengsi Yao, Fan Feng, Xiaoguang Ma, Yiming Zhao, Yatong Han

Northeastern University

2026-06-16视觉语言视觉感知

面向VLA全模型推理过慢、难以支撑低延迟高频闭环控制的问题,论文提出在现有模型内部语义-动作接口处异步解耦:低频刷新语义缓存,高频动作模块结合当前状态与历史动作持续重规划,并用时间错位训练缓解语义陈旧。LIBERO上适配π0.5和UniVLA,并在真机验证,动作模块服务器端最高达35.6 Hz,但对可复用中间语义接口和缓存新鲜度仍有依赖。

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration Figure 1
2026-06-16cs.RO

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

2026-06-16机器人

针对LLM多机器人协作中反复推理带来延迟、离线排程导致机器人空等的问题,OSDAG只调用一次LLM将自然语言任务分解为带依赖的DAG,并用约束感知在线调度把就绪子任务实时分配给空闲机器人。五个基准及双臂真实实验显示,其推理时间较对话式方法快5–15倍,较顺序基线最多缩短38%完工时间,成功率保持竞争力。

Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility Figure 1
2026-06-16cs.RO

Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility

Simon Kohaut, Felix Divo, Julius Hahnewald, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

Artificial Intelligence and Machine Learning Lab, TU Darmstadt, Honda Research Institute, Hessian Center for AI (hessian.AI), Centre for Cognitive Science, German Center for AI (DFKI), Uncertainty in Artificial Intelligence Lab, TU Eindhoven

2026-06-16机器人

面向自动驾驶中行人、骑行者、车辆等混合交通体的轨迹预测,论文指出纯神经模型难显式利用交通规则且可解释性弱。作者提出 TraCS,将自然语言规则经 LLM 代理生成概率一阶逻辑程序,并以神经置信门控对候选轨迹重加权。Argoverse 2 上接入 DeMo、Polaris、QCNet 后,多数 Brier 风格指标小幅但稳定改善,弱势交通参与者收益更明显。

Co-Creating Buildable and Open Social Robot Study Companions with University Students Figure 1
2026-06-16cs.RO

Co-Creating Buildable and Open Social Robot Study Companions with University Students

Farnaz Baksh, Matevž B. Zorec, Feiazie Baksh, Karl Kruusamäe

2026-06-16机器人

针对开源社交机器人虽可促进学生动手与维护、但装配复杂会削弱参与的问题,本文让圭亚那和爱沙尼亚大学生共同改造 RSC v4.1,将 DfA/DfD 原则落实为旋锁、卡扣和免工具维护结构。结果显示可用性从 SUS 59.4 升至 89.4,工作负荷和装配时间下降;关键洞察是感知难度比耗时更决定学生是否愿意采用开源硬件。

Rethinking Implicit Spatial Representation in Visuomotor Policy Learning Figure 1
2026-06-16cs.RO

Rethinking Implicit Spatial Representation in Visuomotor Policy Learning

Xiangyu Chen, Yuxuan Hu, Chuhao Zhou, Jianfei Yang

2026-06-16强化学习

论文针对生成式视觉运动策略中视觉表示“重语义、轻空间”的问题,系统比较池化方式后指出,Spatial Softmax 形成的隐式空间表示虽维度更低,却更稳定且更利于关注任务相关区域;进一步诊断出常规编码器下采样导致空间信息坍塌,并提出 PRISM 通过多尺度空间提取与自顶向下交叉注意力融合保留细粒度位置线索。在多任务和多策略骨干上取得一致提升,低分辨率 ToolHang 成功率由 5.0% 提升到 13.4%,参数仅增 15.4%。

Seam-to-Graph Reconstruction for Garment Configuration Alignment Figure 1
2026-06-16cs.RO

Seam-to-Graph Reconstruction for Garment Configuration Alignment

Xuzhao Huang, Kai Tang, Fuyuki Tokuda, Norman C. Tien, Kazuhiro Kosuge

2026-06-16三维

面向丝网印刷、缝制等需要反复精确对齐的服装操作,论文指出像素、关键点或点云状态难以兼顾遮挡鲁棒性与控制可用性。其核心是把部分、无序且带噪的缝线观测与多视角点云融合,经 Seam-to-Graph 网络重建固定拓扑的结构骨架图,并以此做分层、形变感知视觉伺服。真实双臂机器人实验显示,该方法在装载与对齐任务中达到接近人工的精度、误差方差更小,并能泛化到不同服装。

VLALeaks: Membership Inference Attacks against Vision-Language-Action Models Figure 1
2026-06-16cs.CR

VLALeaks: Membership Inference Attacks against Vision-Language-Action Models

Xukun Luan, Jinyan Liu, Xuesong Li, Yuanguo Bi, Renjun Wu, Zhongxiang Lei, Di Wang

2026-06-16视觉语言视觉感知

针对 VLA 机器人数据采集昂贵、训练样本易被模型记忆而引发隐私和数据产权风险的问题,本文提出首个面向 VLA 的成员推断框架 VLALeaks,核心洞察是成员与非成员样本会在视觉、语言、动作模态的自注意力关系中呈现差异,并据此抽取模态内/跨模态特征训练攻击器。多模型、多仿真与真实平台实验显示,其在 AUC 与 TPR@1%FPR 上优于既有 MIA,揭示当前 VLA 部署存在可利用的数据泄漏通道。

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion Figure 1
2026-06-16cs.RO

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

2026-06-16机器人生成模型

本文针对部分可观测导航中“路径可行但执行时缺少定位观测”导致的失效,转而优化环境而非机器人策略。核心是 SCoDA:用条件扩散生成有限数量视觉标记的任务相关布局,并通过 shielded sampler 将标记放在最能及时纠正位姿漂移的轨迹区段。仿真与硬件实验显示,它较启发式和无引导基线提升执行可靠性与完成时间,且接近 rollout 优化上界。

MimicIK: Real-Time Generative Inverse Kinematics from Teleoperation with FK Consistency Figure 1
2026-06-16cs.RO

MimicIK: Real-Time Generative Inverse Kinematics from Teleoperation with FK Consistency

Jiahao Yang, Shenhao Yan, Fan Feng, Chengsi Yao, Ge Wang, Zhixin Mai, Yiming Zhao, Yatong Han

2026-06-16生成模型

面向 VLA/端执行器轨迹部署时实时 IK 易成瓶颈的问题,MimicIK 将逆运动学建模为基于当前关节与目标位姿的连续关节增量生成,采用条件流匹配和两步 MIP 推理,并用可微 FK 一致性损失约束物理精度。在 8848 条真实 6-DOF 遥操作数据上,平均位置误差 4.65 mm、10 mm 成功率 92.01%、尖峰率 7.99%,延迟 6.74 ms,可支持 20 Hz 控制并在奇异附近更稳定。

MotionVLA: Vision-Language-Action Model for Humanoid Motion Figure 1
2026-06-16cs.CV

MotionVLA: Vision-Language-Action Model for Humanoid Motion

Nonghai Zhang, Siyu Zhai, Yanjun Li, Zeyu Zhang, Zhihan Yin, Yandong Guo, Boxin Shi, Hao Tang

School of Computer Science, Peking University

2026-06-16机器人视觉语言视觉感知

本文针对人形运动生成中单一运动码本偏向低频姿态、难以保留速度等高频物理动态的问题,提出双流频域 tokenizer DSFT,将 Base 姿态语义与 Phys 物理动态分开做 DCT 截断和 BPE,并用 Qwen3.5 以先 Base 后 Phys 的自回归序列生成。实验显示,在 2B 骨干下,HumanML3D 的 Diversity 与真实数据差距缩小超 50%,MBench 的运动-条件一致性提升 3.8%,足滑略降。

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent Figure 1
2026-06-16cs.GT

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

Ashutosh Kumar

2026-06-16学习理论数据集/基准

这篇论文针对自动驾驶中未被现有 VQA 或显式谈判基准覆盖的“隐式让行/抢行”社会协调问题,提出 Self-Driving Negotiator:一个文本化、多轮、程序生成的交互环境,要求模型从对方速度与位置变化推断隐藏意图并输出驾驶动作,奖励由特权仿真状态验证以降低话术作弊。实验含三类场景和六个模型榜单,当前模型距脚本专家仍有差距,最佳平均成功率约 0.68,争议并线场景模型差异不显著。

DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects Figure 1
2026-06-16cs.RO

DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects

Tianshan Zhang, Yijia Duan, Yanjun Li, Zeyu Zhang, Hao Tang

School of Computer Science, Peking University

2026-06-16机器人

面向开门、抽屉等铰接物体,论文指出仅复现几何轨迹或在固定动力学下追求任务成功,难以保证多指手持续接触并驱动物体运动。DragMesh-2将目标关节从动作通道中移除,要求运动由手—把手物理接触产生,并用PICA把接触保持、脱离风险、动作饱和、阻尼随机化和时间接触响应注入训练。在7个GAPartNet物体和多种阻尼条件下,其相较基线在接触负载变化时更稳健,但高阻尼下成功率仍明显下降。

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models Figure 1
2026-06-16cs.CV

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models

Dianqiao Lei, Lianlei Shan

2026-06-16视觉语言视觉感知强化学习

针对VLA依赖显式CoT带来的高延迟和多步误差累积,本文提出AVA-VLA,将推理改为连续潜变量演化,并用强化学习按任务奖励对潜在轨迹去噪、对齐,再通过置信度门控早退以动态权衡速度与深度。实验称其在具身决策基准上较显式CoT推理提速6倍,并在LIBERO达到98.3%平均成功率,但具体增益来源仍需结合更完整消融判断。

Design and Fabrication of a Spin Coater with In-Situ Optical Measurement for Soft Thin Films Figure 1
2026-06-16cs.RO

Design and Fabrication of a Spin Coater with In-Situ Optical Measurement for Soft Thin Films

Daniel Gliksberg, Jiajie Qiu, Jun Suzuki, Kamal Youcef-Toumi

2026-06-16机器人

面向介电弹性体等软薄膜制备中接触测厚易压缩样品、商用光学计量昂贵且需离线的问题,本文设计了以3D打印为主的低成本旋涂机,并把轻质反射镜、激光束位移与四象限探测器集成到原位测厚流程中。实验用金属垫片验证分辨率约3.6–3.7微米、最佳重复性13微米,硅胶薄膜厚度可控制在目标值9微米内。

Phase-Localized Curation Does Not Help: A Negative Result on Per-Phase Metric Selection for Demonstration Filtering Figure 1
2026-06-16cs.LG

Phase-Localized Curation Does Not Help: A Negative Result on Per-Phase Metric Selection for Demonstration Filtering

Aarav Bedi

Department of Mechanical Engineering, University of California, Berkeley

2026-06-16模仿学习

论文针对模仿学习中带缺陷示范的过滤问题,检验“按操作阶段选择不同质量指标”是否优于全局打分。核心洞察是负结果:当缺陷集中在单一阶段时,跨阶段秩聚合会把有效信号与无关阶段噪声混合,反而稀释缺陷识别能力。三项 LIBERO 接触式抓放任务、每条件五个种子中,phase-gated curation 从未最佳,且两项任务最差,指标选择也不能跨任务迁移。

Exact, Efficient, and Safe Occlusion-Aware Planning Using AH-Polyhedrons Figure 1
2026-06-16cs.RO

Exact, Efficient, and Safe Occlusion-Aware Planning Using AH-Polyhedrons

Long Kiu Chung, David Isele, Toktam Mohammadnejad, Faizan M. Tariq, Sangjae Bae, Shreyas Kousik, Jovin D'sa

Honda Research Institute (HRI), Mountain View, CA., Georgia Institute of Technology, Atlanta, GA.

2026-06-16规划控制安全鲁棒

面向自动代客泊车等遮挡频繁、道路规则弱且过度保守会导致停滞的场景,论文提出 APRO:将博弈式主动感知中的遮挡安全条件重写为 AH-多面体并集,用线性规划做精确验证,避免道路拓扑假设和集合过近似,并可接入优化规划或二分搜索。仿真、真实停车场回放和 F1/10 硬件实验中均保持 100% 安全率,同时具备实时性,相比 HJ、Kamm 圆和 OA-MPC 更少数值误差或保守停滞。

An Autonomous Subgram SMA-Based Swimmer Figure 1
2026-06-16cs.RO

An Autonomous Subgram SMA-Based Swimmer

Conor K. Trygstad, Francisco M. F. R. Gonçalves, Néstor O. Pérez-Arancibia

scalable to mm-to-cm sizes., ington State University (WSU) Foundation and the Palouse Club through a, the WSU Voiland College of Engineering and Architecture through a start-up, The authors are with the School of Mechanical and Materials En-, gineering, Washington State University (WSU), Pullman, WA 99164, USA., implemented using an MPLabs PicKit 4 in-circuit debugger, tool and the MPLabs X IDE v6.20 developer environment.

2026-06-16机器人

面向灾害巡检、污染监测等场景中微型水下/水面机器人仍依赖系缆或外部驱动、难以昆虫尺度自主化的问题,论文提出900 mg的Swima:用两枚SMA微执行器、软尾、四杆传动和自制轻量PCB集成电池、IMU与MCU,实现低电压自主推进与航向反馈控制。实验显示其可续航约18分钟,最高速度22.4 mm/s,转向14°/s,0°航向跟踪RMS误差约6.5°。

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention Figure 1
2026-06-16cs.RO

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

Jason Chan, Jonathan C. Kao

Department of Computer Science, University of California, Los Angeles, Departments of Electrical and Computer Engineering

2026-06-16视觉语言视觉感知

针对VLA在部署中常因细小轨迹偏差失败、而语言纠错太粗、全遥操作又削弱自主性的问题,论文提出Token Steering:把低维用户意图转成FAST动作token并在推理时注入自回归动作序列,让模型补全后续轨迹。其洞察是低频token更控制全局语义、高频token偏局部修正;在抽屉关闭和状态感知物体交换任务中,成功率分别由10.0%升至72.5%、16.7%升至93.8%。

LV-Calib: LiDAR-Camera Extrinsic Calibration with Boundary-Response Modeling Figure 1
2026-06-16cs.RO

LV-Calib: LiDAR-Camera Extrinsic Calibration with Boundary-Response Modeling

Sheng Hong

2026-06-16学习理论

针对自装机器人中激光雷达-相机外参易受目标制作复杂、LiDAR黑白边界回波展宽影响的问题,LV-Calib用可打印AprilGrid结合圆形反射率边界,将视觉重投影约束与按置信度加权的LiDAR特征对齐联合优化,并进一步标定边界处pitch-yaw-range残差统计。实验显示其达到亚像素重投影、毫米级LiDAR特征一致性,并改善里程计表现。

Inference-time Policy Steering via Vision and Touch Figure 1
2026-06-16cs.RO

Inference-time Policy Steering via Vision and Touch

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

Carnegie Mellon University

2026-06-16视觉感知强化学习

面向移液、擦拭、插 peg 等接触密集操作,论文指出仅靠视觉的推理时策略 steering 难以判断局部接触力与瞬时触觉事件。ViTaL 将多模态引导拆成双层优化:视觉长时域采样验证负责行为模式选择,触觉短时域扩散编辑负责接触细化,并用视触觉潜在世界模型与文本条件触觉奖励在潜空间打分。真实机器人三项任务中,相比基础策略成功率提升 51%,较单模态 steering 至少高 33%,较朴素融合至少高 20%。

Multimodal Physiological Assessment of Contact-Rich Physical Human-Robot Interaction Under Varying Environmental Conditions Figure 1
2026-06-16cs.RO

Multimodal Physiological Assessment of Contact-Rich Physical Human-Robot Interaction Under Varying Environmental Conditions

Yanyi Chen, Xi Wang, Min Deng

2026-06-16机器人视觉语言

针对接触丰富的人机物理协作中仅看轨迹误差、完成时间会掩盖操作者负担的问题,本文在18种温度、噪声与照度组合下进行描迹实验,同步采集EDA、sEMG、眼动和舒适度评分。核心洞察是环境压力可被生理补偿而不体现在任务指标上:性能基本稳定,但皮肤电导表征的自主神经负荷随温度升高,体力与认知负荷变化不显著。

DynaHMRC: Decentralized Heterogeneous Multi-Robot Collaboration for Dynamic Tasks with Large Language Models Figure 1
2026-06-16cs.RO

DynaHMRC: Decentralized Heterogeneous Multi-Robot Collaboration for Dynamic Tasks with Large Language Models

Wenhao Yu, Yu'ang Xie, Yifan Duan, Jie Peng, Guanting Ye, Ka-Veng Yuen, Yanyong Zhang, Jianmin Ji

2026-06-16机器人

面向动态、通信受限的异构多机器人任务,论文指出集中式 LLM 调度易受上下文瓶颈和队伍变化影响。DynaHMRC 将每个机器人建模为具角色感知的 LLM 智能体,通过自描述、竞价分配、选举领导者和反思执行形成去中心化闭环,并配套动态基准与专家数据微调。实验显示其相较强基线有更高成功率、更少动作和通信步数,且在评测规模内具备一定扩展趋势。

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy Figure 1
2026-06-16cs.RO

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering, Brooklyn, NY, 11201.

2026-06-16生成模型强化学习

面向仅有单目 RGB、难以构建可靠占据图的户外机器人探索,VANDERER 将预训练扩散策略用于生成可行动作,并在推理时加入视觉好奇心模块:用导航世界模型预测候选动作的未来观测,再以相对历史观测的新颖性作为代价引导去噪采样,无需额外探索专家数据。仿真实验显示其平均探索面积比 NoMaD 高 13.4%,并观察到视觉好奇心与几何探索收益相关。

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations Figure 1
2026-06-16cs.RO

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

Department of Computer Science, California State University, Northridge, Department of Mechanical Engineering

2026-06-16机器人

这篇论文针对家用/辅助机器人中“力度、压力”等连续触觉偏好难以用语言精确标注和控制的问题,提出不直接用语言条件生成动作,而是先学习距离与轨迹差异线性对应的低维结构化行为潜空间,再让 LLM 根据用户提示选择潜变量。仿真和真实触觉操作实验显示,该方法比语言条件 VTLA/VLA 基线用更少偏好标签实现更准确的个性化适配,但目前主要验证一维风格与任务特定策略。

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies Figure 1
2026-06-16cs.LG

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

Yifan Ruan, Chenyang Cao, Andreas Burger, Ali Pesaranghader, Kaveh Kamali, Jaehong Kim, Nandita Vijaykumar, Alan Aspuru-Guzik, Igor Gilitschenski, Nicholas Rhinehart

University of Toronto, Vector Institute

2026-06-16生成模型

本文针对扩散/flow 机器人策略难以用 TD critic 稳定改进的问题:直接穿过多步去噪反传不稳,微调或蒸馏又成本高且损失表达力。QPILOTS 保持基策略冻结,在测试时把中间噪声状态投影/采样到干净动作空间,再用 Q 梯度修正 flow 漂移。其 U/M 两版分别追求快速近似和后验采样无偏估计;在 OGBench 50 任务平均成功率达 90%,并能引导冻结 VLA,在 6 个 LIBERO 任务上优于或持平既有推理时方法。

Computing Smooth Geodesics under Two-Sided Curvature Bounds with Applications to Robotics and Image Analysis Figure 1
2026-06-16cs.RO

Computing Smooth Geodesics under Two-Sided Curvature Bounds with Applications to Robotics and Image Analysis

Da Chen, Zhenjiang Li, Jean-Marie Mirebeau, Xuecheng Tai, Jinglin Zhang, Wei Zhang, Laurent D. Cohen

CEREMADE, University Paris Dauphine, University-PSL, CNRS, UMR 7534, Paris, 75775, France, Department of Radiation Oncology, Shandong Cancer Hospital and Institute, Shandong First Medical University, Shandong Academy of Medical Sciences, Jinan, 250117, China, Department of Mathematics, Centre Borelli, ENS Paris-Saclay, CNRS, University Paris-Saclay, Gif-sur-Yvette, 91190, France, School of Control Science and Engineering, Shandong University, Jinan, 610101, China

2026-06-16机器人视觉感知学习理论

针对传统一阶最短路径难以控制曲率、Elastica 仅软惩罚而 Dubins 路径不够光滑的问题,论文提出在 HJB/PDE 框架下带任意上下曲率硬约束的测地线模型,并给出 Hamiltonian 离散与快速求解方案。实验用于机器人路径规划和图像曲线结构跟踪,显示其能在保持光滑的同时更准确满足曲率范围并获得更稳健路径。

Deep Learning-Based Lunar Crater Terrain Relative Navigation Figure 1
2026-06-16cs.RO

Deep Learning-Based Lunar Crater Terrain Relative Navigation

Batu Candan, Simone Servadio

2026-06-16机器人

面向月球南极等特征稀疏、惯导易漂移的自主着陆/绕飞场景,论文将 NASA 挑战赛训练的 U-Net++陨坑检测器接入基于全球陨坑库匹配的 EKF,相比单纯检测更关注误匹配对导航闭环的影响。仿真中在初始位置误差达 5 km 时可恢复,并将误差降至百米量级;但效果依赖运行图像尺度与训练分布匹配,增益可能主要来自 scaling / data。

Synthetic-to-Real Pipeline for Safe Landing Zone Detection Figure 1
2026-06-16cs.RO

Synthetic-to-Real Pipeline for Safe Landing Zone Detection

Shrikant Banerjee, Reza Faieghi

2026-06-16视觉感知安全鲁棒

面向无人机在无预设降落点的城市/非结构化环境中自主回收,论文针对真实航拍像素级标注稀缺与机载算力受限问题,构建了基于 Blender 的程序化合成数据与域随机化流程,并仅用合成数据微调 OneFormer,再用 EDT 几何模块输出带障碍缓冲的最大安全降落区。结果显示模型在 UAVid 上具备一定零样本分割能力,并可在 DJI 实拍视频中定性找到无碰撞区域;但实时部署细节和相对真实数据训练的增益仍未充分说明。

Bayesian Optimization for Learning Nonlinear MPC in Autonomous Agent Navigation Figure 1
2026-06-16cs.RO

Bayesian Optimization for Learning Nonlinear MPC in Autonomous Agent Navigation

Lorenzo Ortolani, Gabriel Voss, Gabriele Beltrami, Francesco Dorati, Tommaso Felice Banfi

2026-06-16机器人规划控制优化算法

面向未知动态环境中四足机器人实时导航对避障表示和MPC权重敏感的问题,本文将LiDAR高斯占据、滚动A*规划与带平滑障碍势的非线性MPC耦合,并用TPE贝叶斯优化离线搜索11维控制参数、用GP分析敏感性。在Gazebo与Unitree Go2实机上,仿真调参可直接迁移,部署成功率最高90.0%,仿真综合指标平均提升38.9%。

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining Figure 1
2026-06-16cs.CV

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

2026-06-16视觉语言视觉感知

本文针对VLA中离散动作token多为重建压缩、难以给视觉语言骨干提供语义监督的问题,提出X-Tokenizer,将动作token化视为语义接口学习。其SRQ把首层量化用于MAM学习粗粒度动作意图,深层保留执行残差,并通过对齐冻结基础模型表征与预测下一帧VL特征注入多模态语义。在2.4M轨迹预训练后,冻结tokenizer用于混合离散-连续VLA,在真实任务聚合表现最佳,并较FAST提升多模态 grounding 13.5%、长时程任务8.25。

DC-Motion: Decoupling Semantics and Details via Discrete-Continuous Tokens for Human Motion Generation Figure 1
2026-06-16cs.GR

DC-Motion: Decoupling Semantics and Details via Discrete-Continuous Tokens for Human Motion Generation

Hequan Wang, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

Wuhan University, Wuhan University Wuhan China

2026-06-16机器人

针对文本到人体动作生成中扩散模型语义组合弱、离散 AR 模型易丢失细节并产生抖动的问题,DC-Motion 将动作表征拆为离散语义 token 与连续残差:先用 DC-VAE 解耦结构和高频动力学,再以 MaskGIT 预测语义布局、轻量残差扩散补细节。在 HumanML3D 与 KIT-ML 上取得 SOTA FID(0.041/0.148)和更高 R-precision,长指令对齐与运动真实感均有提升。

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception Figure 1
2026-06-16cs.CV

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception

Kushal Khemani, Evan Leri, George Xu, Amit Hod

NEXEDGE Research Lab

2026-06-16视觉感知

面向嵌入式边缘目标检测中负载波动导致延迟飙升、而道路弱势参与者漏检代价更高的问题,RAMS用空闲态校准的资源压力指标在常驻YOLOv8三档模型间切换,并在近期检测到VRU时抑制降级。跨Pi、x86与Jetson实验显示,Jetson TRT重载下safety2平均3.41ms、比固定MEDIUM快5.6倍,仍保留约74%代理精度;检测条件策略的SWAS较阈值策略提升25.4%(oracle)/47.3%,但受NANO仅24.2% VRU召回限制。

Impedance MPC with Patient-Torque Estimation for Knee Rehabilitation Exoskeletons Figure 1
2026-06-16eess.SY

Impedance MPC with Patient-Torque Estimation for Knee Rehabilitation Exoskeletons

Yongyan Cao, Jinshan Tang

2026-06-16规划控制

面向膝关节康复外骨骼在痉挛抑制、轨迹跟踪与主动助力之间的冲突,论文将SEA膝关节经代数前馈化为常系数双积分器,用可预计算的阻抗MPC在QP中硬约束关节范围、力矩和速度,并用SEA弹簧形变驱动Kalman患者力矩估计实现无EMG的扰动补偿和按需助力。仿真/基准中500 Hz、20步长Kalman MPC在15 Nm痉挛下约0.1 mrad RMS、0.2 mrad峰值,显著优于经典阻抗的约515 mrad偏差;MyoSuite多自由度扩展仍主要是解析投影,闭环验证文中未充分说明。

2026-06-15

55 篇
Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control Figure 1
2026-06-15cs.CV

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

University of Oxford, University of Cambridge, Nanyang Technological University

2026-06-15规划控制三维

面向机器人仿真与操作中缺少可泛化铰接物体重建的问题,本文将静态3D网格与显式运动学指令结合,用部件描述、连接关系、关节类型和点提示消解标注粒度歧义,并借助VLM伪标注构建15万级异构数据训练前馈模型。实验显示其跨类别和AI生成网格泛化优于既有方法,可与图像到3D模型串联,从真实图像生成可导入物理仿真的铰接资产;增益可能主要来自scaling/data与指令化约束的共同作用。

EgoGuide: Egocentric Guidance for Efficient Robot-Free Demonstration Collection and Learning Figure 1
2026-06-15cs.RO

EgoGuide: Egocentric Guidance for Efficient Robot-Free Demonstration Collection and Learning

Yue Xu, Mingtao Nie, Tianle Li, Hong Li, Yibo Luo, Siyuan Huang, Yong-Lu Li

Shanghai Jiao Tong University, Shanghai Innovation Institute, Beijing Institute for General Artificial Intelligence (BIGAI)

2026-06-15机器人模仿学习

论文针对 UMI 式无机器人示教中轨迹冗余、缺少全局场景信息导致数据效率低的问题,提出 EgoGuide:同步采集腕部与头戴自我中心视角,并用视觉-几何覆盖度评分通过 AR 在线指导采集;同时设计 GERP,以门控残差方式让自我中心视角在腕部观测歧义或遮挡时修正动作。真实任务中,该方法在相同数据量下提升成功率,Pepper Sorting 可用约一半示教达到相近效果,并增强遮挡场景鲁棒性。

Whole-Body Impedance Model Predictive Control for Safe Physical Human--Robot Interaction on Floating-Base Platforms Figure 1
2026-06-15cs.RO

Whole-Body Impedance Model Predictive Control for Safe Physical Human--Robot Interaction on Floating-Base Platforms

Yongyan Cao

2026-06-15机器人规划控制安全鲁棒

面向浮基双足/人形机器人在保持接触平衡时进行安全物理人机交互的问题,论文将质心MPC、优先级WBC与残余零空间中的阻抗MPC串联,引入接触一致反馈线性化和Kalman扰动估计,使臂端模型在每个接触模式下化为可预计算QP的双积分器。仿真显示该方法可在17自由度双足和Unitree G1上实现约1 kHz控制,并在有界恒定交互力下获得零稳态误差;硬件验证仍未给出。

Safe Reinforcement Learning of Autonomous Highway Driving: A Unified Framework for Safety and Efficiency Figure 1
2026-06-15cs.RO

Safe Reinforcement Learning of Autonomous Highway Driving: A Unified Framework for Safety and Efficiency

Chufei Yan, Zhihao Cui, Yiyan Lv, Taojie Chen, Ning Bian, Yulei Wang

2026-06-15强化学习安全鲁棒

针对高速自动驾驶中强化学习试错探索难以兼顾训练安全与部署效率的问题,论文提出 MoE-RM-SRL,将安全距离约束、奖励机任务结构和稀疏门控多专家 DQN 结合,用规则感知奖励与按场景激活专家减少控制切换不连续。CARLA 与 DiL-VR 实验显示,其在双车道、汇入/驶出及对抗场景中总体取得更高碰撞安全率、奖励和效率,多车道正常场景零碰撞,但对抗多车道仍有碰撞。

Impedance MPC with Disturbance Estimation for Dexterous Hand Control Figure 1
2026-06-15cs.RO

Impedance MPC with Disturbance Estimation for Dexterous Hand Control

Yongyan Cao

2026-06-15规划控制

面向灵巧手在接触中既要高精度轨迹跟踪又要受限柔顺力控的矛盾,论文将恒定状态矩阵的 offset-free Impedance MPC 扩展到多类腱传动,通过代数前馈化为双积分器,并用仅编码器的增广 Kalman 扰动估计实现零稳态误差,同时在 QP 中嵌入接触力、执行器与 jerk 约束。液压手指仿真/算例在 1.5 Nm 接触下达 0.5 mrad RMS、6.6 mrad 峰值偏差,16 自由度 LEAP Hand 中可在 0.7 s 内恢复抓取扰动。

What Robots Do Matters More Than What They Look Like: Task Context Shapes Trust in Educational HRI Figure 1
2026-06-15cs.RO

What Robots Do Matters More Than What They Look Like: Task Context Shapes Trust in Educational HRI

Anna-Maria Velentza, Konstantina Nikou, Anne-Gwenn Bosser, Nikolaos Fachantidis

LIRES Robotics Lab, University of Macedonia, GR and School, of Educational Social Policies, University of Macedonia, GR., Brest-Bretagne INP, COMMEDIA team, Lab-STICC CNRS, color robots are available in the market and in, research labs, being demonstrated as capable of

2026-06-15机器人

这篇论文关注教育场景中社交辅助机器人如何赢得信任,动机是机器人外形多样但教师实际选择依据不清。作者用81名未来教师的被试内视频实验,同时比较三种机器人外观与教学、流程指导、个人信息讨论三类任务,核心洞察是信任主要由任务语境而非拟人外观决定。结果显示流程指导信任最高,教学居中,索取个人信息显著最低;外观主效应不显著,外观与任务交互仅边缘显著。

Sensitivity Shaping for Latent Modeling Figure 1
2026-06-15cs.RO

Sensitivity Shaping for Latent Modeling

Hongzhan Yu, Chenghao Li, Ruipeng Zhang, Henrik Christensen, Sicun Gao

University of California San Diego

2026-06-15机器人

本文关注机器人生成式潜在动力学在部署策略偏移下的安全问题:后验式 OOD 分数会因模型对关键控制不敏感而漏检高误差转移。核心洞察是通过在高支持训练区域约束控制雅可比的 Frobenius 范数,主动塑造局部控制敏感性,避免不同动作的潜在预测坍缩。视觉避障、操作和真实机器人导航实验显示,该方法能更早发现未示范失败轨迹,并提升 OOD 感知闭环规划安全性。

ORCA: A Platform for Open-Source Dexterity Research Figure 1
2026-06-15cs.RO

ORCA: A Platform for Open-Source Dexterity Research

Francesco Capuano, Maximilian Eberlein, Fabrice Bourquin, Clemens Claudio Christoph

University of Oxford

2026-06-15机器人

针对灵巧手研究受硬件成本高、控制/仿真/遥操作/重定向工具割裂而难以复现的问题,ORCA以约3千美元、可3D打印的Orcahand为基础,开源统一软件栈并接入LeRobot流程。文中展示了用消费级VR采集手内重定向示教、训练并评估自主策略的端到端流程,主要结果是提供可复现的灵巧操作研究平台,而非提出新的控制算法。

TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation Figure 1
2026-06-15cs.RO

TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation

Zihao Li, Ranpeng Qiu, Yincong Chen, Guoqiang Ren, Weiming Zhi

Zeno AI 2 Zhejiang University, Zhejiang University of Technology 4 The University of Sydney

2026-06-15模仿学习规划控制

论文聚焦机器人长程模仿中的“延迟证据”问题:早期视觉线索消失后,后续相似观测却需要不同动作。TRACE的核心是用执行轨迹的路径签名作为读写键,在固定大小潜在记忆中保存当时可见的任务证据,并以轻量适配器接入动作分块和扩散策略。真实世界五类任务结果显示,它相较短历史和循环记忆基线提升分支选择与成功率,诊断表明收益主要来自保留历史证据。

Provably Safe, Yet Scalable Reinforcement Learning Figure 1
2026-06-15cs.LG

Provably Safe, Yet Scalable Reinforcement Learning

Kai S. Yun, Zeyang Li, Navid Azizan

2026-06-15强化学习安全鲁棒

针对安全强化学习中软约束缺乏形式保证、显式证书/不变集又难以扩展且保守的问题,论文提出两阶段 PS2-RL:先用安全到达价值函数训练备份策略,以前向积分隐式扩大控制不变集;再通过可微投影层把 BCBF 约束嵌入任意 RL 管线。实验在车道保持和 10 维四旋翼跟踪中报告训练与部署均 100% 安全,并优于基线。

Spatially Conditioned Diffusion Policy: Learning Precise and Robust Manipulation with a Single RGB Camera Figure 1
2026-06-15cs.RO

Spatially Conditioned Diffusion Policy: Learning Precise and Robust Manipulation with a Single RGB Camera

Seoyoon Kim, Kanghyun Kim, Dongwoo Ko, Yeong Jin Heo, Min Jun Kim

Korea Advanced Institute of Science and Technology (KAIST)

2026-06-15机器人生成模型强化学习安全鲁棒

本文针对单全局 RGB 相机缺少腕部近景而难以兼顾精细接触细节与任务相关区域选择的问题,提出 SCDP:在扩散策略去噪过程中,将中间末端执行器轨迹投影为视觉注意锚点,并在多尺度特征图上采样局部特征。实验显示其在 Meta-World 仅 20 条示教下各难度组成功率超过 80%,优于单视角基线并接近多相机方案,真实任务中也表现出较好精度和抗干扰性。

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators Figure 1
2026-06-15cs.RO

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav, Wei Pan, Spandan Roy

∗ Equal contribution. 1 Robotics Research Center, IIIT Hyderabad, India.

2026-06-15机器人

针对空中机械臂放置任务依赖人工给定精确坐标、交互不直观的问题,AERMANI-PLACE将语言指令转化为图像编辑模型生成的视觉标记,再结合深度信息投影为3D放置点并进行碰撞感知轨迹执行,无需专门训练数据。在100个室内任务上成功率87%,真实空中平台25次试验成功率72%,主要失败来自生成幻觉、深度噪声和飞行扰动。

CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Driving Planners Figure 1
2026-06-15cs.RO

CADET: Physics-Grounded Causal Auditing and Training-Free Deconfounding of End-to-End Driving Planners

Zikun Guo

Z. Guo is with the School of Electronics Engineering, Kyungpook National University, Daegu, Republic of Korea

2026-06-15机器人

本文针对端到端自动驾驶规划器可能把路边物体、建筑等共现线索误当因果依据且传统 L2/碰撞率难以暴露的问题,提出无需训练的 CADET:用物理几何先验结合扰动影响计算 PCR,并在测试时屏蔽可疑查询。nuScenes 上对 SparseDrive 的审计显示,少数物理无关目标可像真实因果目标一样影响规划,PCR 比仅看影响更有选择性,TCM 能去除这类依赖而 L2 基本不变。

Kine2Go: Kinematic dataset for the Unitree Go2 robot with diverse gaits and motions Figure 1
2026-06-15cs.RO

Kine2Go: Kinematic dataset for the Unitree Go2 robot with diverse gaits and motions

Władysław Pałucki, Paweł Siwak, Krzysztof Ciebiera, Marek Cygan

University of Warsaw

2026-06-15机器人数据集/基准

针对四足机器人学习中缺少可直接用于模仿学习、强化学习和行为克隆的 Go2 运动示范数据,Kine2Go 将多来源四足运动重定向到 Unitree Go2,并用 RL 跟踪生成带扰动的状态—电机动作轨迹。论文发布 40 个策略产生的 800 条多样步态/运动轨迹及可扩展 Genesis 管线,填补低层运动控制数据空缺;但跳跃、坐姿、复杂地形和足底压力数据尚未覆盖。

ForestBack: Breadcrumb-Based Pedestrian Dead Reckoning for Infrastructure-Free Return Navigation Figure 1
2026-06-15cs.RO

ForestBack: Breadcrumb-Based Pedestrian Dead Reckoning for Infrastructure-Free Return Navigation

Aueaphum Aueawatthanaphisut, Chanakan Chaipan

2026-06-15机器人

针对森林、室内等无 GPS 且无外部基础设施场景中的返航难题,ForestBack 将行人航位推算记录为可逆“面包屑”节点,并结合加速度步态检测、自适应步长、磁力计航向与气压高度校正生成反向路径指引。在36次室内绕障实验中,相比传统 PDR,平均 RMSE 从1.129米降至0.965米,末端误差从1.781米降至1.388米,转向检测一致性约99.90%;但验证场景较受控,真实森林泛化仍需进一步说明。

Causal Object-Centric Models for Planning with Monte Carlo Tree Search Figure 1
2026-06-15cs.AI

Causal Object-Centric Models for Planning with Monte Carlo Tree Search

Rodion Vakhitov, Leonid Ugadiarov, Alexey Skrynnik, Aleksandr Panov

CogAILab & MIRAI

2026-06-15强化学习规划控制

针对视觉强化学习中整体表征难以刻画多物体交互、导致规划被无关实体干扰的问题,COMET 将冻结的无监督对象槽表征接入 MuZero 式 MCTS,在槽空间中用 Transformer 世界模型规划,并通过动作-槽融合和对象因果注意力突出任务相关物体。八个对象视觉控制与机器人任务上,其训练早期平均归一化得分高于单体模型和对象中心基线,但效果仍受槽分割质量限制。

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack Figure 1
2026-06-15cs.RO

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

He Zhang, Lingzhu Xiang, Haitao Lin, Zeyu Huang, Minghui Wang, Dingyan Zhong, Yubo Dong, Yihao Wu, Yongming Rao, Dongsheng Zhang, Wanjia He, Ling Chen, Kai Huang, Jiahao Chen, Sichang Su, Xumin Yu, Ziyi Wang, Chengwei Zhu, Xiao Teng, Yuchun Guo, Yufeng Zhang, Yuandong Liu, Rui Wang, Zisheng Lu, Han Hu, Zhengyou Zhang

2026-06-15机器人视觉语言视觉感知强化学习

论文动机是指出通用机器人不能只靠单一 VLA 模型,而需覆盖数据、训练、强化学习后训练到部署的完整栈。HyVLA-0.5 以 1 万小时指尖 UMI 人类示教、MoT 骨干+flow-matching 动作专家、delta-chunk 表示和无奖励 FlowPRO 离线偏好优化为核心,支持跨本体迁移与高频闭环部署;实验声称在多机器人任务上显著提升成功率并接近上限,但具体增益可能主要来自 scaling / data。

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models Figure 1
2026-06-15cs.RO

Elastic Queries Reinforcement Learning: Self-Aware Policy Execution for VLA Models

Ge Wang, Xinyu Tan, Xiang Li, Man Luo, Chengsi Yao, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xiangyuan Wang, Zhixin Mai, Yiming Zhao, Yatong Han, Zhen Li

2026-06-15强化学习

该文针对 VLA 机器人策略推理与重规划频率固定、难以匹配操作过程中“易阶段/接触困难阶段”计算需求差异的问题,提出 EQRL:在冻结底层 VLA 的前提下,用轻量强化学习适配器联合选择潜变量、去噪步数和动作块长度,并用 critic 集成分歧估计状态难度来分配计算预算。实验覆盖 LIBERO、ALOHA 仿真及真实机器人,结果显示在保持或提升成功率的同时降低摊销推理成本。

Robust Fall Recovery for Armless Bipedal-Wheeled Robots Via Force-Guided Learning Figure 1
2026-06-15cs.RO

Robust Fall Recovery for Armless Bipedal-Wheeled Robots Via Force-Guided Learning

Haidong Hou, Zhangguo Yu, Tao Han, Hengbo Qi, Khaleel Ghazal, Yu Zhang, Yidong Du, Xuechao Chen, Fei Meng

2026-06-15机器人安全鲁棒

针对无臂双足轮式机器人跌倒后缺少手臂或多足支撑、强化学习易陷入“死点”的问题,论文提出 FTSR:在仿真中将与机身高度相关的辅助力建模为可优化约束,并结合高度递进的阶段奖励和师生蒸馏,使策略逐步减少外力依赖。实机实验显示其可从多种随机姿态和地形中恢复并继续运动,且可迁移到高自由度人形机器人。

FloVerse: Floor Plan-Guided Multi-Modal Navigation Figure 1
2026-06-15cs.RO

FloVerse: Floor Plan-Guided Multi-Modal Navigation

Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang

School of Computer Science & Technology, Beijing Institute of Technology

2026-06-15机器人

针对现有具身导航多依赖局部观测、主动建图或大范围探索,且平面图引导研究主要局限于 PointNav 的问题,FloVerse 将平面图作为结构化空间先验,统一 PointNav、ObjectNav 与 ImageNav,并构建含 1627 个场景、24 万专家轨迹的数据集;其 ThreeDiff 以扩散规划器做多模态目标推理,再用深度占据信息细化避障。实验显示,平面图先验在三类目标上均提升成功率与效率,模型还能隐式捕获目标空间位置。

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation Figure 1
2026-06-15cs.RO

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

2026-06-15机器人生成模型

ReactVLA针对扩散式VLA策略多步采样导致闭环操控延迟过高的问题,将动作生成改为改进Mean Flow的一到少步有限区间传输,并用Attention Residual在Transformer深度间动态保留多模态特征。其在LIBERO、RoboIMI和真实任务中优于同规模SmolVLA、π0等基线,精细操作最高提升1.65倍,推理速度超4倍,真实延迟低于38.6 ms。

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment Figure 1
2026-06-15cs.RO

Optimality-Preserving Decomposition for Scalable QAOA in Natural-Language-Guided Multi-Drone Assignment

Junyeop Bang, Byongho Lee, Dohyun An, Hwangnam Kim

Department of Smart Convergence, Korea University, School of Electrical Engineering

2026-06-15机器人

面向多无人机区域分配随规模增长而难以由人工建模和经典精确搜索实时求解的问题,论文把微调 LLM 生成 QUBO 约束与面向 NISQ 的 CVaR-QAOA 后端结合,核心在于用 W-state/XY mixer 结构性满足硬约束,并以保最优的图划分和 separator-DP 合并降低量子比特需求。实验称理想 oracle 情况 100% 恢复全局最优,真实 QAOA 采样为 96.3%。

SyLink Hand: A Synergy-Inspired Linkage-Driven Anthropomorphic Hand for Human-Like Dexterity Figure 1
2026-06-15cs.RO

SyLink Hand: A Synergy-Inspired Linkage-Driven Anthropomorphic Hand for Human-Like Dexterity

Hao Wu, Yanzhe Wang, Yu Feng, Yitong Li, Jingxiang Guo, Jian Liu, Jianshu Zhou

2026-06-15机器人

针对仿人灵巧手常因全驱动设计带来结构复杂、成本高和控制困难的问题,SyLink Hand从人手运动捕捉中提取关节协同关系,用优化平面连杆耦合多关节,并提出紧凑球面四杆实现MCP屈伸与外展/内收解耦。原型以11个执行器驱动19个关节,重520g、成本约400美元,实验展示了接近人手的运动轨迹、较强承载能力,以及多类抓取、手内操作和工具使用能力。

When and How Severely: Scenario-Specific Safety Envelopes for Driving VLAs Figure 1
2026-06-15cs.RO

When and How Severely: Scenario-Specific Safety Envelopes for Driving VLAs

Abhinaw Priyadershi, Jelena Frtunikj

2026-06-15安全鲁棒

针对驾驶VLA安全认证中“单一噪声阈值+平均误差”难以刻画不同场景风险的问题,本文在Alpamayo R1的15,968个扰动样本上提出按场景的二维SOTIF安全包络:噪声失效阈值与失败严重度分布。结果显示总体σ≤50会掩盖多类场景可到σ=70的差异,GMM将CoC变化后的轨迹错误分成6个严重度带,且STOP_SIGNAL虽阈值宽松却有约4倍于LANE_KEEPING的高严重失败占比。

BIM-Loc: BIM-Integrated Discrepancy-Aware LiDAR-based Indoor Localization Figure 1
2026-06-15cs.RO

BIM-Loc: BIM-Integrated Discrepancy-Aware LiDAR-based Indoor Localization

Yinqiang Zhang, Liang Lu, Yipeng Pan, Maolin Lei, Yuhan Xie, Zhanteng Xie, Xiaowei Luo, Jia Pan

1 affiliationmark: Department of AI & Data Science, University of Hong Kong (HKU), Hong Kong, China., 2 affiliationmark: Department of Architecture and Civil Engineering, City University of Hong Kong (CityU), Hong Kong, China., 3 affiliationmark: Humanoids and Human Centered Mechatronics Research Line, Italian Institute of Technology (IIT) Genoa, Italy.

2026-06-15机器人

面向缺少显著特征且无 GNSS 的室内巡检/服务机器人,论文指出直接用设计阶段 BIM 定位会受“设计—现实”差异影响。BIM-Loc 将 LiDAR 观测与 BIM 通过多重命中光线投射关联,在位姿图中加入 BIM 约束,并用层次贝叶斯在线更新差异图,从而同时估计 BIM 坐标系下轨迹和结构状态。仿真及工地、楼宇实测显示其定位精度与鲁棒性优于现有地图先验方法。

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime Figure 1
2026-06-15cs.RO

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

Department of Electrical and Electronic Engineering, Korea University

2026-06-15机器人

针对无人机在通道受阻、无进展循环或任务歧义时频繁调用远程智能体会带来延迟、成本和安全验证压力的问题,论文提出 PMR,将飞行执行与安全关键环节留在本地,仅用 learned-CVI 按预期恢复收益选择性触发受限技能推理,并经解析、验证和安全过滤后执行。在 400 次 Gazebo/PX4 测试中,困难/歧义场景成功率由本地 5.0% 提升至 95.0%,且较规则触发减少 16.7% 调用和 29.2% token。

Universal Manipulation Exoskeleton: Learning Compliant Whole-body Policies with Real-time Torque Feedback Figure 1
2026-06-15cs.RO

Universal Manipulation Exoskeleton: Learning Compliant Whole-body Policies with Real-time Torque Feedback

Litian Liang, Jingxi Xu, Xinda Qi, Yujun Cai, Houzhu Ding, Luqi Wang, Zhixin Sun, Jyh-Herng Chow, Ming Yang, Mark Cutkosky

Stanford University

2026-06-15机器人

面向家庭/协作机器人在接触中需要柔顺而现有遥操作数据缺少力矩信号的问题,论文提出 UME 上肢外骨骼,通过实时触觉力矩反馈、全臂关节配置与力矩记录、通用重定向及 IMU 底盘控制,采集可用于学习全身双臂柔顺策略的数据。在推箱、翻箱、GPU 夹取和冰箱取饮料等任务中,UME 成功率达 0.85–0.95,明显高于无力矩和仅末端位姿基线。

Short-Horizon Position Accuracy of Single-Track Models: Implications for Motion Planning of Autonomous Vehicles Figure 1
2026-06-15cs.RO

Short-Horizon Position Accuracy of Single-Track Models: Implications for Motion Planning of Autonomous Vehicles

Aron J. Aertssen, Lars A.T.H. van Alen, Igo J.M. Besselink, Rudolf G.M. Huisman, René M.J.G. van de Molengraft

2026-06-15规划控制

面向自动驾驶 MPC 中模型既要快又要能保证轨迹安全的矛盾,论文用实车 Nissan Leaf 的 GNSS-INS/CAN 数据系统比较运动学、线性轮胎动态、Magic Formula 非线性轮胎含准静态载荷转移三类单轨模型的短时位置预测。核心洞察是把评估指标从常见横摆率/加速度转向规划更直接需要的位置误差,并强调模型复杂度、参数辨识质量与工况范围的取舍;具体定量排名在给定片段中未充分说明。

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation Figure 1
2026-06-15cs.RO

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation

Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti, Yuexi Song, Glen Chou

Georgia Institute of Technology, Atlanta, GA 30308

2026-06-15机器人规划控制安全鲁棒

面向绳索、布料等高维可变形物体在接触丰富场景中难以兼顾实时规划、约束安全与感知/模型不确定性的问题,论文提出 CORD-SLS:用接触平滑的 GPU 并行可微仿真提供可优化梯度,并结合基于 SLS 的输出反馈鲁棒 MPC 与 conformal prediction 校准误差边界。仿真和硬件的避障、路由、折叠、铺平任务显示其可达毫秒级规划,并在安全性、速度和成功率上优于基线。

GAIT: Legged Robot Proprioceptive State Estimation with Attention over Inertial-Leg Tokens Figure 1
2026-06-15cs.RO

GAIT: Legged Robot Proprioceptive State Estimation with Attention over Inertial-Leg Tokens

Young-Rang Seo, Hajun Kim, Sangmin Kim, Dongyun Kang, Hae-Won Park

2026-06-15机器人

针对腿式机器人仅依赖本体感知进行高速状态估计时,传统接触辅助滤波依赖静止接触假设和接触检测、学习方法又易受训练步态分布限制的问题,GAIT 将 IMU 与各腿运动学表示为 Inertial-Leg tokens,用注意力按接触相关可靠性自适应重加权,并结合 GRU 与滤波器输出机体速度及不确定性。Unitree Go1 实验显示,其在未见步态和仿真未建模碎石地形上优于平铺输入的学习估计器及接触辅助模型方法。

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic Figure 1
2026-06-15cs.CV

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

Qingping Zeng, Fei She

Tsinghua University

2026-06-15机器人

这篇论文针对 VLA 中“小模型上选出的视觉编码器能否迁移到大骨干”的不确定性,提出冻结语言模型与动作头、仅训练线性投影器的视觉塔嫁接诊断。实验在 SmolVLA 与 π0.5、四种编码器和 LIBERO 两套任务上显示,SmolVLA 上 SigLIP 最优,但大骨干上空间任务由 DINOv2 领先、物体任务接近平局且受种子影响,说明编码器排名依赖骨干规模;结论仅限离线 action MSE 与该嫁接协议,不代表闭环部署效果。

A Modular Dual-Arm Apple Harvesting Robot with Enhanced Field Performance Figure 1
2026-06-15cs.RO

A Modular Dual-Arm Apple Harvesting Robot with Enhanced Field Performance

Keyi Zhu, Kyle Lammers, Chaaran Arunachalam, Kaixiang Zhang, Renfu Lu, Zhaojian Li

Department of Mechanical Engineering, Michigan State University, Department of Electrical and Computer Engineering, United States Department of Agriculture

2026-06-15机器人

针对苹果采收中劳动力短缺、单臂吞吐低且果园环境感知不稳的问题,本文提出垂直叠放的模块化双臂机器人,将同一棵树上下冠层并行采摘,并结合 Grounding-DINO/EfficientViT-SAM 感知、限加加速度轨迹与 CBF 安全滤波、线性扫掠采摘和时序逻辑协调。室内每次尝试 3.65 秒,较串行快 1.76 倍;田间 1738 次循环成功率 80.0%,单臂平均 7.53 秒,91.2% 果实保持 USDA Extra Fancy。

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing Figure 1
2026-06-15cs.RO

Self-Improving VLA Policies: Selected Diffusion Noise for Spurious-Robust Action Smoothing

Duc Minh Nguyen, Bao-Ngoc Dao, Tung M. Luu, Binh Gia Nguyen, Vinh Tong, Anji Liu, Vu N. Duong, Dung D. Le, Daniel Sonntag, Trung Le, Ngan Le, Jan Peter, An Thai Le, Minh Nhat Vu, Mathias Niepert, Khoa D. Doan, Duy M. H. Nguyen, Vien Anh Ngo

Center for AI Research, VinUniversity, University of Stuttgart, National University of Singapore, University of Oldenburg, Monash University, University of Arkansas

2026-06-15生成模型安全鲁棒

针对扩散式VLA策略在分布偏移下易受虚假视觉相关影响、且生成动作抖动的问题,论文提出训练免费的Selected Diffusion Noise:在测试时从不同噪声种子生成候选动作,用目标物体遮挡视图构造“幻觉”负集做对比筛选,再按Jerk平滑性选择轨迹。该方法无需改参数或外部评估器,在Google Robot、Widow-X及真实机器人数据上跨π0和GR00T带来约8%仿真、10%真实成功率提升,并降低动作不稳定性。

The N2D Haptic Glove: A Multi-Finger Glove for 2D Directional Force Feedback for Contact Rich Manipulation Figure 1
2026-06-15cs.RO

The N2D Haptic Glove: A Multi-Finger Glove for 2D Directional Force Feedback for Contact Rich Manipulation

Yao-Ting Huang, Jake Honma, Omar Hernandez, Logan Li, Kaitlin Calimbahin, Bryce Hackel, Michael C. Yip

2026-06-15机器人

针对遥操作中仅靠视觉或单轴触觉难以判断指尖受力方向、易过压且控制不稳定的问题,论文提出 N2D Haptic Glove:用低摩擦、零回差的绞盘传动在拇指、食指和中指提供二维平面动觉力反馈。台架实验显示力方向与幅值跟踪误差较小,用户研究表明相比视觉-only和单轴反馈,它在轴向探测/按压任务中降低接触力误差、提升一致性和主观体验。

Development of a 3 in Sewer Pipe Inspection Robot with an Articulated Differential Mechanism using X-shaped Linkages Figure 1
2026-06-15cs.RO

Development of a 3 in Sewer Pipe Inspection Robot with an Articulated Differential Mechanism using X-shaped Linkages

Shoya Umemura, Ryota Taniguchi, Atsushi Kakogawa

2026-06-15机器人

针对日本老旧下水管中直径小于约100 mm管道难以用推入式相机检查、既有Xbot-1牵引力不足且易卡在管接头台阶的问题,论文提出Xbot-2:串联多个带X形连杆的推进单元,用单根线驱动形成铰接差动机构以适应管径变化,并通过驱动轮电流阈值检测接触后放松线张力越障。实验显示两/三推进单元牵引力由50.6 N提升至75.0/103.1 N,三单元样机可较顺畅通过管接头,但阈值泛化能力仍需进一步验证。

Semidefinite Relaxations for Collision-Free Motion Planning Figure 1
2026-06-15cs.RO

Semidefinite Relaxations for Collision-Free Motion Planning

Bernhard Paus Graesdal, Alexandre Amice, Pablo A. Parrilo, Russ Tedrake

Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA, USA.

2026-06-15规划控制

针对避障运动规划中障碍约束非凸、NLP 对初值敏感且难作采样规划内循环的问题,本文把球形障碍下的多项式轨迹规划精确写成半无限 QCQP,并给出半正定松弛。核心洞察是将该松弛解释为更高维空间中的全局最优规划问题,从而刻画紧性条件,并利用对称性把 PSD 锥规模降到随多项式次数线性、与环境维度无关。实验中相较 SNOPT/IPOPT 快 10–100 倍、耗时方差更低,并可作为 RRT 的凸 steering 函数生成 C4 连续最小 snap 四旋翼轨迹。

ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving Figure 1
2026-06-15cs.RO

ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving

Zhiyuan Zhang, Yanlun Peng, Jianing Zhang, Xianda Guo, Zehan Huang, Haoran Liu, Qifeng Li, Shaofeng Zhang, Xiaosong Jia, Junchi Yan

Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University, Institute of Trustworthy Embodied AI (TEAI), Fudan University, School of Computer Science, Wuhan University, University of Science and Technology of China

2026-06-15强化学习数据集/基准

该文针对自动驾驶行为世界模型评测过度依赖日志相似度、难以衡量周车对偏离日志自车动作的反应这一问题,提出 ReactSim-Bench:将自车控制与周车仿真解耦,用规划器生成并经规则与人工筛选的偏离轨迹施加交互压力,并以碰撞、地图合规和运动学指标评估反应。基于 nuPlan 构建 2636 个三类场景,比较 Transformer、扩散和 next-token 模型,并分析重规划频率对反应性能的影响。

WAM4D: Fast 4D World Action Model via Spatial Register Tokens Figure 1
2026-06-15cs.CV

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

2026-06-15强化学习

WAM4D针对现有世界动作模型多停留在2D视频/潜空间、难以表达操作所需3D约束,而显式4D几何又拖慢推理的问题,提出用空间register token在训练期读取未来深度并蒸馏几何先验,部署时移除几何分支;同时设计因果混合注意力避免跨模态非因果泄漏。实验在RoboTwin 2.0和真实长程任务中显示其提升空间一致性与成功率,并保持较高动作推理效率。

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving Figure 1
2026-06-15cs.RO

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University, Shanghai, 201804, China, Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China

2026-06-15安全鲁棒

这篇论文针对自动驾驶闭环对抗训练中过度追求碰撞会生成不可解场景、且采样难以匹配策略能力的问题,提出 AlignADV:用 DPO 将场景生成对齐到“关键但可解”,再用行为指纹和多模态能力预测做动态课程采样。Waymo Open Motion Dataset 实验显示,其训练步数最多减少 40.6%,并在正常与对抗交通中降低碰撞率、提升路线完成率。

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation Figure 1
2026-06-15cs.CV

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

Carnegie Mellon University

2026-06-15视觉语言视觉感知

面向VLA自动驾驶模型因大视觉语言骨干与推理模块导致实时部署困难的问题,RT-VLA将SimLingo作为教师,通过视觉特征、查询表示、路点预测和语言logits的多层监督蒸馏训练轻量学生,并把语言解释转为离线事后分析以避免控制延迟。在Bench2Drive上,其闭环驾驶与语言推理接近教师,视觉模式推理加速44.8倍,视觉+语言模式加速7.9倍。

SplatlessDF: Continuous Distance Field Mapping with Non-Splatting Gaussians Figure 1
2026-06-15cs.RO

SplatlessDF: Continuous Distance Field Mapping with Non-Splatting Gaussians

Monisha Mushtary Uttsha, Lan Wu, Teresa Vidal-Calleja

2026-06-15三维

面向机器人规划需要可连续查询距离、梯度而高斯泼溅多偏向渲染的问题,SplatlessDF把各向异性高斯直接作为距离场参数,而非投影 splat,并可与独立的2DGS渲染高斯通过几何一致性联合优化。实验显示其在2D/3D距离与梯度精度、运行扩展性和CHOMP避障上优于对比方法,联合版还提升2DGS渲染几何;但当前为无符号DF,表面提取依赖额外符号恢复。

An Attention-based Model for Robust Forecasting with Missing Modality Figure 1
2026-06-15cs.RO

An Attention-based Model for Robust Forecasting with Missing Modality

Zhitian Zhang, Wenjie Zi, Yunduz Rakhmangulova, Saghar Irandoust, Hossein Hajimirsadeghi, Thibaut Durand

Simon Fraser University

2026-06-15安全鲁棒

面向真实机器人中传感器缺失导致多模态预测退化的问题,论文将预测模型写成CVAE,并用模态无关的注意力聚合与随机模态掩码、缺失模态对齐损失,使不完整输入的条件分布接近完整输入。作者在5个多模态数据集、人体轨迹预测和机器人操作预测任务上验证,缺失训练或推理模态时均优于既有融合基线。

Learning Dynamic Swing-Up of an Inverted Pendulum using Remote Magnetic Actuation Figure 1
2026-06-15cs.RO

Learning Dynamic Swing-Up of an Inverted Pendulum using Remote Magnetic Actuation

Viacheslav Sydora, Jasan Zughaibi, Denis von Arx, Quentin Boehler, Michael Muehlebach

2026-06-15机器人

针对电磁导航系统多停留在准静态控制、远离平衡的动态轨迹跟踪不足的问题,论文以磁驱倒立摆摆起作为高动态基准,提出将含执行器带宽的轨迹优化、时变 LQR 与迭代学习控制结合,用重复试验修正前馈力矩。实验显示仅靠 LQR 无法完成摆起,而 ILC 在 6 次迭代内实现 0.6 秒摆起并稳定捕获,学习到的修正与高精度磁场标定预测的力矩误差相近。

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation Figure 1
2026-06-15cs.RO

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

Namai Chandra, Shriram Damodaran, Lin Wang

EmPACT Lab, Nanyang Technological University

2026-06-15机器人

论文针对现有 VLA 主要拟合示教、缺少刚体动力学与接触约束导致动作物理不一致的问题,提出无需训练的 PhysVLA 推理时外置校正层:用任务阶段有限状态机划分操作流程,并在检测到 Euler-Lagrange 残差异常时才修正动作。其可包裹冻结的 OpenVLA 等骨干,单步开销小于 1ms,在 LIBERO-Spatial 上最高提升成功率 17 个百分点、稳定性 19 个百分点,并在真实机械臂抓放中显示可迁移增益。

Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation Figure 1
2026-06-15cs.RO

Guided Diffusion with Distilled Vision-Language Reliability for Aerial Navigation

Ivan Valuev, Iana Zhura, Valerii Serpiva, Didar Seyidov, Dzmitry Tsetserukou

2026-06-15机器人视觉语言视觉感知生成模型

针对室内无人机在玻璃、镜面、过曝等场景中深度观测看似可信却会误导规划的问题,论文将视觉语言模型的开放词汇可靠性判断蒸馏为轻量热图,并把该热图与3D ESDF代价一起用于扩散轨迹去噪引导,使不可靠区域像障碍物一样被避开。仿真和真机结果显示,相比NoMaD,碰撞违规率由40.3%降至9.6%,路径区域平均可靠性由0.588升至0.925,蒸馏推理最高约快2倍。

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation Figure 1
2026-06-15cs.RO

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

2026-06-15机器人视觉语言视觉感知

针对端到端导航泛化差、模块化零样本方法受闭集检测器限制、3D 记忆又难以多机共享的问题,AnyGoal 将 VLM 视为带噪语义 oracle,把其判断融合进可跨子任务保留的 2D 高斯贝叶斯价值图,并用 VLM 打分与 UCB 混合选择前沿,通过共享地图上的贪心分配实现无中心多机器人协同。在 GOAT-Bench val_unseen 上,双机器人达到 52.4% 子任务成功率,较 Modular GOAT 提升 27.5 个百分点;单机器人也有 41.9%,说明增益主要来自决策与记忆结构而非单纯增加机器人数量。

ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation Figure 1
2026-06-15cs.RO

ContactWorld: What Matters in Vision-Tactile World Models for Contact-Rich Manipulation

Zhiyuan Zhang, Pokuang Zhou, Kaidi Zhang, Adeesh Desai, Temitope Amosa, Davood Soleymanzadeh, Jiuzhou Lei, Minghui Zheng, Yu She

School of Industrial Engineering, Purdue University, Department of Mechanical Engineering, Texas A&M University

2026-06-15机器人视觉感知强化学习

面向接触丰富操作中世界模型难以稳定预测长时接触动力学的问题,本文提出 ContactWorld 基准,在12类插入、拆解、拧紧与探索任务上系统比较视觉-触觉表征。核心洞察是空间结构、时间连续性与跨模态兼容性比单纯增加模态更关键:点云将平均规划成功率由约21%提升到32.1%,与触觉力场结合进一步达36.1%,且长时规划中触觉收益更明显。

Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning Figure 1
2026-06-15cs.RO

Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning

Jeffrin Sam, Dzmitry Tsetserukou

Skolkovo Institute of Science and Technology (Skoltech), Moscow, Russia

2026-06-15机器人

论文针对单 GPU 微调 VLA-JEPA 时同代码不同随机种子会出现“种子彩票”的隐性失效:LIBERO-Object 上一次种子跌至 65.2%。作者将原因归为冻结编码器下动作预测器的输出塌缩,并用 Jacobian 零空间解释 L2、EWC 等权重级约束为何失效。实验表明 VICReg、Dropout 和减半学习率等输出级正则在 3 个 LIBERO 基准、21 次合并运行中消除灾难种子,核心价值在降低尾部风险而非单纯提高平均成功率。

Efficient Domain-Adaptive Policy Learning via Kernel Representation with Application to Quadrotor Control under Non-Stationary Disturbances Figure 1
2026-06-15cs.RO

Efficient Domain-Adaptive Policy Learning via Kernel Representation with Application to Quadrotor Control under Non-Stationary Disturbances

Hongyu Zhou, Mingtian Tan, Vasileios Tzoumas

University of Michigan, Ann Arbor

2026-06-15强化学习规划控制

面向四旋翼在阵风、载荷变化、地效切换等非平稳扰动下的轨迹跟踪,论文将未知扰动表示为基于随机傅里叶特征的可微核函数,并在离线随机化核系数与带宽训练策略、在线用最小二乘同步更新二者以快速自适应。仿真和 Crazyflie 实机显示,该方法相较学习式与模型式自适应基线提升跟踪精度,文中报告仿真最高约60–70%、实机最高约30%的位置误差改善。

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models Figure 1
2026-06-15cs.RO

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Sam Tak Wu Kwong, Yuguang Fang

everything (V2X) communication, collaborative perception, inter-, Index Terms—Autonomous driving, collaborative perception, torically centered on robust, self-contained vehicles that, collaborative intent, and react too late in tightly coupled traffic., toward collaborative autonomy., Lab of Smart City funded by The Hong Kong Jockey Club Charities Trust, Department, University, Sam Tak Wu Kwong is with Lingnan University, Hong Kong. (Email:, of sight and led to collaborative perception (CP) methods based, including collaborative perception, shared world modeling, Surveys collaborative machine learning enabled by

2026-06-15强化学习

本文针对单车智能在遮挡、部分可观测和密集交互中易失效的问题,综述多智能体具身自动驾驶从 V2X 信息交换走向共享世界模型的趋势。核心洞察是协作不应停留在传感数据融合,而要形成可预测、可对齐的跨车—路—人共享状态,用于意图理解、规划协同和闭环验证。文中梳理 380 余篇工作,指出现有结果主要依赖仿真、基准和离线评测,基础模型协同仍缺少开放交通中的实时安全保证。

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift Figure 1
2026-06-15cs.RO

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom

Department of Computer Science, Dartmouth College, Hanover, NH, Department of Electrical and Computer Engineering, Clemson University, Clemson, SC, Department of Mechanical and Aerospace Engineering, University of Houston, Houston, TX

2026-06-15生成模型强化学习

针对水面机器人等系统中“动作并不能单独决定未来”的问题,FlowMo-WM从图像-动作历史中同时估计物体自身动量与不可见水流/风漂移;其关键做法是用短历史潜变量表征物体运动、长历史上下文表征慢变外界扰动,并以零上下文残差转移区分受控动力学和漂移效应。在多种隐藏流场与随机动力学仿真中,该模型较同类动作条件潜世界模型提升长时域预测与规划表现,消融显示长历史环境上下文对稳定预测确有作用。

An integrated interpretable control effectiveness learning and nonlinear control allocation methodology for overactuated aircrafts Figure 1
2026-06-15eess.SY

An integrated interpretable control effectiveness learning and nonlinear control allocation methodology for overactuated aircrafts

Umut Demir, Aamir Ahmad, Walter Fichter

University of Stuttgart, Faculty of Aerospace Engineering and Geodesy, Institute of Flight Mechanics and Control (iFR), Germany.

2026-06-15规划控制

针对过驱动飞机在强非线性和多执行器耦合下线性控制分配失配、全机载模型计算重且黑箱方法难验证的问题,论文用带物理约束的 SINDy 从飞行数据学习显式稀疏控制效能映射,并嵌入含执行器动态的非线性分配器,在线用残差触发参数刷新。高保真基准机动仿真显示,其精度接近完整非线性机载模型,同时显著降低计算开销,并能在执行器故障和工况变化下较平滑重构。

$μ_0$: A Scalable 3D Interaction-Trace World Model Figure 1
2026-06-15cs.RO

$μ_0$: A Scalable 3D Interaction-Trace World Model

Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

University of Maryland, College Park, Seoul National University

2026-06-15强化学习三维

论文针对机器人学习中视频数据丰富但动作标注稀缺且依赖本体的问题,提出以物体、工具、手和接触区域的全局3D交互轨迹作为介于像素预测和动作预测之间的世界模型接口。其TraceExtract自动从异构视频抽取语义关键点、3D轨迹和事件级语言,μ0用VLM骨干与Trace Expert预测B样条轨迹。实验显示其在2D/3D轨迹预测上优于基线,并在RoboCasa365和UR3任务中以无动作预训练接近或超过部分动作监督VLA。

Scalable Dynamic Tactile Sensing Enabled by Passive and Flexible Acoustic Waveguides Figure 1
2026-06-15cs.RO

Scalable Dynamic Tactile Sensing Enabled by Passive and Flexible Acoustic Waveguides

Guimin Long, Changhong Linghu, Chuanping Liu, Ke Xu, Xingjian Jing

Scalable Dynamic Tactile Sensing Enabled by Passive and, Department of Mechanical Engineering, City University of Hong Kong, Hong Kong, China, Corresponding Author: Xingjian JING, City University of Hong Kong, Hong Kong, China, pulse waves, feather touches, and finger contact. This establishes a scalable, flexible

2026-06-15机器人

面向大面积动态触觉阵列中布线复杂、成本高且柔性与精度难兼得的问题,论文提出被动式深亚波长声波导方案:用弹性膜亥姆霍兹谐振器和柔性微管形成封闭网络,以少量麦克风读取各节点特征声纹,并结合快速小波变换与轻量网络定位。实验实现低频触觉信号实时感知,4 麦克风 64 节点阵列准确率超过 99%、最高 4 mm 分辨率,推理约 5.5 ms,并展示手套、大面积皮肤等柔性原型。

Occupancy-Grounded Room Segmentation for Hierarchical 3D Scene Graphs Figure 1
2026-06-15cs.RO

Occupancy-Grounded Room Segmentation for Hierarchical 3D Scene Graphs

Carlos Cueto Zumaya, Iacopo Catalano, Jorge Peña-Queralta, Wallace Moreira Bessa

2026-06-15视觉感知三维

本文针对层次化3D场景图中“房间层”定义不统一、难以按真实房间几何评估的问题,提出从RGB-D构建3D占据图,经垂直净空投影和自由空间分解得到可跟踪多边形区域,并以此锚定房间节点。12个Matterport3D场景上,相比Hydra召回率从0.152升至0.379、F1从0.241升至0.427,但精度更低,且墙面边界准确性仍未解决。

2026-06-12

56 篇
Mana: Dexterous Manipulation of Articulated Tools Figure 1
2026-06-12cs.RO

Mana: Dexterous Manipulation of Articulated Tools

Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, C. Karen Liu

Stanford University 3 {}^{\text{3}}

2026-06-12机器人

这篇论文针对多指手使用钳子、夹子、注射器等铰接薄工具时需同时稳定抓握与施加精确驱动力、遥操作和端到端 RL 都难以获取数据的问题,提出 Mana:将操作视作动画补间,用少量功能区域点击生成抓握关键帧,再由运动规划和短程 RL 合成接触丰富轨迹,并训练点云条件扩散策略。系统在 Allegro 手上对四类工具实现从桌面抓取到手内驱动的零样本 sim-to-real,高成功率但部分阶段仍依赖腕部遥操作。

Improving Robotic Generalist Policies via Flow Reversal Steering Figure 1
2026-06-12cs.RO

Improving Robotic Generalist Policies via Flow Reversal Steering

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

Stanford University 1 , UC Berkeley 2

2026-06-12机器人生成模型

这篇论文针对机器人通用策略在新任务中虽含有丰富行为先验、但难以被语义指令直接调用的问题,提出 Flow Reversal Steering:将人或 VLM 给出的粗略但合理动作反向通过 flow 策略,定位对应噪声并再映射为分布内精细动作。实验覆盖仿真和真实操作,显示其可提升零样本控制,并通过噪声空间行为克隆在约一分钟、10 条轨迹内带来最高 95% 绝对成功率提升,也能为强化学习提供先验以改进基线难以提升的任务。

$\texttt{WEAVER}$, Better, Faster, Longer: An Effective World Model for Robotic Manipulation Figure 1
2026-06-12cs.RO

$\texttt{WEAVER}$, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

Arnav Kumar Jain, Yilin Wu, Jesse Farebrother, Gokul Swamy, Andrea Bajcsy

Mila - Québec AI Institute, Carnegie Mellon University, McGill University

2026-06-12机器人强化学习

面向机器人操作中世界模型难以同时兼顾真实度、长时一致性与推理速度的问题,WEAVER将多视角记忆架构、预训练编码器、未来潜变量预测、奖励头以及flow matching/ diffusion forcing结合,用于低交互的策略评估、改进和测试时规划。真实硬件实验显示,其评估与真实成功率相关ρ=0.870,在π0.5上无真实交互提升38%成功率,规划提升14%且比Ctrl-World快5–10倍。

MCR-Bionic Hand: Anatomical Structural Priors for Dexterous Manipulation Figure 1
2026-06-12cs.RO

MCR-Bionic Hand: Anatomical Structural Priors for Dexterous Manipulation

Haosen Yang, Guowu Wei

† Haosen Yang: ORCID 0000-0001-7488-6834.Guowu Wei is with the School of Science, Engineering and Environment, University of Salford, Salford M5 4WT, UK.

2026-06-12机器人

本文针对灵巧手过度依赖高维主动控制、忽视人体结构本身“计算”作用的问题,提出以解剖结构先验生成默认抓取、再由肌肉通路调制接触状态的思路,并实现1:1 MCR-Bionic肌骨仿生手。实验与几何力学模型显示,腕指腱效应、伸肌腱帽和内在肌通路可产生预成形、远端关节耦合与抓后稳定调制,在硬币旋转、笔传递、翻币和方块操作中支持低维状态生成与细粒度接触操控。

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories Figure 1
2026-06-12cs.CL

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen

2026-06-12视觉语言视觉感知

论文瞄准科学实验从“会规划”到“能动手”的落差:现有 VLA 主要学家居/桌面操作,缺少移液、加热、透明液体和固定协议等实验室监督。作者提出 RoboGenesis 仿真数据引擎生成跨机器人实验流程数据,并用 FAST 动作 token 预训练、flow matching 与 DiT 动作专家训练 LabVLA。结果显示其在 LabUtopia 的 ID/OOD 平均成功率优于基线,且少量 Franka 实机任务验证了仿真预训练可迁移,但真实湿实验部署仍未充分说明。

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models Figure 1
2026-06-12cs.CV

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

2026-06-12强化学习

针对世界-动作模型在杂乱场景中依赖文本易指代不清、仅预测 RGB 又缺乏目标语义约束的问题,MaskWAM 将首帧目标 mask 作为视觉提示,并在统一 MoT/flow-matching 框架中联合预测未来 RGB、mask 与动作,使策略被显式锚定到任务物体。实验在 LIBERO、RoboTwin 和真实任务上均优于文本条件 WAM/VLA,报告成功率达 98.4%、92.2%,真实语言歧义场景提升明显。

Heterogeneous LiDAR Early Fusion and Learned Re-Ranking Strategy for Robust Long-Term Place Recognition in Unstructured Environments Figure 1
2026-06-12cs.CV

Heterogeneous LiDAR Early Fusion and Learned Re-Ranking Strategy for Robust Long-Term Place Recognition in Unstructured Environments

Judith Vilella-Cantos, Juan José Cabrera, Mónica Ballesta, David Valiente, Luis Payá

2026-06-12视觉感知强化学习安全鲁棒

面向葡萄园等非结构化农业场景,长期地点识别易受植被季相变化、重复行结构和传感器差异影响。论文提出 MinkUNeXt-VINE++,将 Livox Mid-360 与 Velodyne VLP-16 点云做早期融合,并在检索后用轻量学习式重排序修正候选排名。TEMPO-VINE 实验显示,相比单传感器 Recall@1 约提升20%,加入重排序后约提升30%,对跨传感器与长期场景更稳健。

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale Figure 1
2026-06-12cs.RO

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

Karlsruhe Institute of Technology, Robotics Institute Germany

2026-06-12机器人模仿学习

面向机器人示教中空间标注难以兼顾规模与质量的问题,SPARC不再把检测置信度等同于标注正确性,而是利用任务时序、夹爪接近、物体运动和机器人遮挡过滤来识别被交互物体,并为每条标注校准可靠性。IA-Bench上其高置信定位准确率达80.2%(检测基线58.1%),在95%精度目标下从28万轨迹保留16.7万条,训练出的VLM与策略在物体定位、指向和杂乱真实场景操作中优于基线。

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation Figure 1
2026-06-12cs.RO

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

The University of Tokyo, National Institute of

2026-06-12机器人强化学习

这篇论文针对目标条件视觉导航中“世界模型能预测未来视角、却仍需外部规划器选动作”的脱节问题,提出 NavWAM:用扩散 Transformer 将未来观测、目标进展值和动作片段放入同一潜变量序列联合去噪,使视觉前瞻直接服务闭环控制。经仿真预训练与真机适配后,NavWAM 在离线与真实机器人图像目标导航中优于规划式世界模型基线,且无需 CEM 测试时搜索,并与更大的直接策略模型保持竞争力。

GIVE: Grounding Human Gestures in Vision-Language-Action Models Figure 1
2026-06-12cs.RO

GIVE: Grounding Human Gestures in Vision-Language-Action Models

Pengfei Liu, Gen Li, Junqiao Fan, Boyu Ma, Jindou Jia, Yang Xiao, Jianfei Yang

2026-06-12视觉语言视觉感知

这篇论文针对现有 VLA 机器人策略过度依赖文字指令、在含糊指令下难以理解人类手势意图的问题,提出 GIVE:不改动预训练策略结构,而是用手部骨架和指尖射线做视觉提示,并用 VLM 生成手势与任务语义描述,形成视觉-语义双通路意图 grounding。真实 HRI 实验中,目标识别准确率提升 40%,整体任务成功率提升 80%,并在新空间布局和不同参与者上表现出一定泛化性。

PolyFlow: Safe and Efficient Polytope-Constrained Flow Matching with Constraint Embedding and Projection-free Update Figure 1
2026-06-12cs.LG

PolyFlow: Safe and Efficient Polytope-Constrained Flow Matching with Constraint Embedding and Projection-free Update

Jianming Ma, Qiyue Yang, Yang Zhang, Liyun Yan, Zhanxiang Cao, Yazhou Zhang, Yue Gao

2026-06-12生成模型优化算法安全鲁棒

面向机器人规划与控制等安全关键场景,标准 flow matching 易因拟合和数值积分误差越过多面体约束。PolyFlow 将约束嵌入离散时间流定义和投影自由架构,用 ray-shooting 与可学习门控保证每步更新在可行域内,避免采样时求解投影/QP。实验称在多类规划控制任务中实现零约束违反,并较基线保持分布质量、显著降低推理延迟。

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation Figure 1
2026-06-12cs.RO

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

Beijing Institute of Technology

2026-06-12机器人

面向移动操作中视角变化、深度噪声以及底盘与机械臂控制需求不同的问题,GeoHAT提出“只在可靠处注入几何、只在需要处关注几何”的扩散式模仿学习框架:用轻量Fourier空间编码生成稠密3D token,并以深度置信门控融合到DINOv2特征;动作端将臂和底盘拆成子空间,通过稀疏交叉注意力分别取用视觉上下文。其在ManiSkill-HAB上达到79.3%平均成功率,较最强基线高23.7%,真实任务也优于基线。

Real-Time Execution with Autoregressive Policies Figure 1
2026-06-12cs.RO

Real-Time Execution with Autoregressive Policies

Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

Korea Institute of Science and Technology, Seoul National University

2026-06-12机器人

这篇论文针对 VLA 在真实机器人中因自回归顺序解码导致推理慢、同步执行会停顿的问题,提出通过调整动作 token 化 horizon、按子块条件化、受限解码来保证严格延迟,并利用空闲时间做多轨迹解码。作者在 LIBERO 仿真和 DROID 真实环境中验证,微调得到的 π0-REALFAST 在实时执行下优于同级 flow-matching/RTC 基线,任务成功率和执行速度接近更强的 π0.5,说明自回归策略仍可支持实时部署。

Low cost, easily manufactured, highly flexible strain and touch sensitive fiber for robotics applications Figure 1
2026-06-12cs.RO

Low cost, easily manufactured, highly flexible strain and touch sensitive fiber for robotics applications

Christian Diaz Herrera, Srushti Raste, Simin Liu, Miles Modeste, Jiyang (Patton)Yin, Katelyn McCall, Yuxing Jared Yao, Roopkamal Chahal, Simon Chidley, Trung Ha, T. David Westmoreland, Sonia Roberts

2026-06-12机器人

面向软体机器人、辅助设备和教育/DIY场景中传感器昂贵、制备门槛高的问题,论文提出用电镀导电线和硅胶管手工穿制的柔性传感纤维,20 cm 约2分钟完成且材料便宜。其洞察是折叠导电线在拉伸时改变等效电阻,同时同一纤维也可作电容触摸/近场传感。实验展示了应变表征、温漂与耐久/修复性,并在气动手指抓取、机器人绑带姿态、柔性体姿态估计、机械臂触摸触发和跟手等任务中验证可用性。

EMG-Based Adaptation of Anisotropic Virtual Fixtures for Robot-Assisted Surgical Resection and Dissection Figure 1
2026-06-12cs.RO

EMG-Based Adaptation of Anisotropic Virtual Fixtures for Robot-Assisted Surgical Resection and Dissection

Dario Onfiani, Michael Dyck, Luigi Biagiotti, Julian Klodmann

2026-06-12机器人

面向腹腔镜切除/分离中软组织变形、视野受限和频繁重定位带来的固定虚拟夹具不适配问题,论文提出基于移动标架的各向异性虚拟夹具,并用前臂 EMG 推断操作者意图,实时放大或脱开约束,实现引导与自由移动切换。标准化训练任务的试点用户研究显示,该方法提升了路径精度和运动一致性,同时降低主观认知负荷、用力感与挫败感。

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation Figure 1
2026-06-12cs.RO

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation

Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim

Dongguk University, in human-centered environments [1, 2]. Many real-world manipulation tasks are difficult or ineffi-

2026-06-12机器人

这篇论文针对双臂操作中“该看哪路视觉”和“两臂如何协同”随阶段变化而被单体 VLA 混在一起学习的问题,提出双层结构分解:用视角选择路由动态重加权左右腕部视角,用交互感知 MoE 分离协同与单臂动作生成。在 RoboTwin 2.0 六个仿真任务和三个真实长程任务中,相比单体基线平均成功率分别提升 27.7% 和 43.3%,且优于只用单模块的变体。

Humor Style Drives Laughter, Topic Shapes Acceptability: Evaluating Bilingual Personal and Political Robot-Delivered AI Jokes Figure 1
2026-06-12cs.RO

Humor Style Drives Laughter, Topic Shapes Acceptability: Evaluating Bilingual Personal and Political Robot-Delivered AI Jokes

Anna-Maria Velentza, Anne-Gwenn Bosser

Univ Brest-Bretagne INP, COMMEDIA team, Lab-STICC CNRS UMR 6285, France, university classroom. We examined the effects of, natural long-term collaboration between humans, were studying and the medium of collaboration

2026-06-12机器人

本文关注LLM生成幽默在真实群体人机交互中由具身机器人讲出时如何被接受,动机是让机器人在课堂等社交场景中更自然地参与调节与互动。研究用Navel机器人向双语学生讲不同幽默风格、个人/政治主题的笑话,并同时考察好笑程度、适当性与语言偏好。结果显示,幽默风格主要驱动“好笑”,攻击型和亲和型评分更高;主题主要影响可接受性,个人相关笑话比政治笑话更合适;语言偏好还受主题、流利度和个人幽默实践影响。

WT-UMI: Tactile-based Whole-Body Manipulation via Force-Supervised Contact-Aware Planning Figure 1
2026-06-12cs.RO

WT-UMI: Tactile-based Whole-Body Manipulation via Force-Supervised Contact-Aware Planning

Jaehwi Jang, Zhaoyuan Gu, Alfred Cueva, Zimeng Chai, Junjie Sheng, Thong Nguyen, Himank Galundia, Yifan Wu, Huishu Xue, Isaac Legene, Ojas Mediratta, Davin Doan, Andrew Collins, Sarah Sadegh, KyoungMok Kim, Rishita Dhalbisoi, Zun Chen, Ye Zhao

bulky rigid objects, and human–humanoid collaboration, WT-UMI improves suc-, Our project page is available at https://wt-umi.github.io/WTUMI/., deformable and large rigid objects and human–humanoid collaborative transport., The authors are with The Institute for Robotics and Intelligent Machines, Georgia Institute of Technology., body manipulation (Fig. 1). WT-UMI enables scalable human demonstration collection while re-, human demonstrations often lack robot-executable action labels. To convert these force-aware hu-, serve as action label to supervise planner training. The action-labeled human data preserves accurate, objects, and human–humanoid collaboration, where it improves the success rate and reduces contact-

2026-06-12机器人规划控制

面向搬运大件、柔性物体和人机协作等全身接触操作,论文指出仅靠视觉/本体感知难以定位并调节接触力。WT-UMI用同一套可穿戴/机器人安装的全身触觉接口采集人类与遥操作数据,并通过力条件位姿校正把人类示教转为机器人可执行目标,再用力监督规划器预测位姿与接触力、由触觉导纳控制跟踪。五类任务中相较四种基线提升成功率并降低接触漂移,但当前仅预测法向标量力。

Proprioceptive-visual correspondence enables self-other distinction in humanoid robots Figure 1
2026-06-12cs.RO

Proprioceptive-visual correspondence enables self-other distinction in humanoid robots

Yurun Chen, Tianyuan Gao, Yizhong Ge, Shikun Ban, Yizhou Wang, Hongkai Xiong, Wenjun Zeng, Wentao Zhu

Eastern Institute of Technology, Ningbo, Shanghai Jiao Tong University, Peking University, Carnegie Mellon University, East China Normal University, Ningbo Institute of Digital Twin

2026-06-12机器人

面向人形机器人与人或同形机器人共处时“哪个身体是我”的基础问题,论文提出利用本体感觉与视觉的时序对应作为自监督信号:当前关节状态只应匹配同一帧中的自身掩码,而与其他时刻不匹配,再用识别出的自身掩码训练无运动学先验的3D占据自模型。作者在29自由度Unitree G1的仿真与真实多智能体场景中验证,可稳定区分自他,并支持到达、避障规划和人到机器人动作重定向。

Visual Place Recognition in Forests with Depth-Aware Distillation Figure 1
2026-06-12cs.CV

Visual Place Recognition in Forests with Depth-Aware Distillation

Walter Nedov, Saimunur Rahman, Kavindie Katuwandeniya, David Hall, Kaushik Roy, Peyman Moghadam

CSIRO Robotics, Brisbane, Australia 2 University of Queensland, Brisbane, Australia 3 Queensland University of Technology, Brisbane, Australia

2026-06-12视觉感知

本文针对森林场景中植被重复、结构线索弱、跨遍历外观变化导致视觉地点识别不稳的问题,提出深度感知蒸馏 DAD:冻结 DINOv2/SALAD 外观教师,仅学习深度 patch 嵌入,并用三元组检索损失与描述子对齐损失将几何线索注入原有表征空间。在 WildCross 零样本评测中,DAD 相比外观基线显著提升,跨序列平均 R@1 从 49.38 提至 62.69,说明预测深度也能为自然场景 VPR 提供有效互补信息。

Embedding ISO 10218 Safety Compliance in Robots via Control Barrier Functions for Human-Robot Collaboration Figure 1
2026-06-12cs.RO

Embedding ISO 10218 Safety Compliance in Robots via Control Barrier Functions for Human-Robot Collaboration

Federico Parma, Cesare Tonola, Nicola Pedrocchi, Manuel Beschi

Dipartimento di Ingegneria Meccanica e Industriale, University of Brescia, Italy., Institute of Intelligent Industrial Technologies and Systems, National Research Council of Italy, STIIMA-CNR, Milan, Italy.

2026-06-12机器人规划控制安全鲁棒

面向人机协作中传统 SSM 过度保守、易停机的问题,本文将 ISO 10218 的分离距离约束嵌入控制层,提出利用人体加速度前向预测最小人机距离的 CBF,并结合 SQP 的任务缩放与空间管约束抑制无序避障。UR10e 仿真和实机结果显示,相比 PD-CBF 方法轨迹误差均值降低 63%,且较工业 SSM 基线显著减少停机、保持较高任务吞吐。

Multi-Modal Multi-Agent Robotic Cognitive Alignment enabled by Non-Invasive Consumer Brain Computer Interfaces: A Proof of Concept Exploration Figure 1
2026-06-12cs.RO

Multi-Modal Multi-Agent Robotic Cognitive Alignment enabled by Non-Invasive Consumer Brain Computer Interfaces: A Proof of Concept Exploration

Nataliya Kosmyna, Liz Jenkins, Anoop K. Sinha

2026-06-12机器人

论文针对主动式多智能体机器人常在用户高专注时打断、造成认知负荷的问题,提出用消费级非侵入式 BCI 实时估计 EEG 参与度,并作为“认知对齐”门控:高负荷时暂存主智能体语音/动作输出,让次级智能体后台处理,低负荷后再释放。原型结合 LLM、多机器人和异步 HTTP 管线,初步证明该闭环可行并可减少不合时宜打断;但评估主要是概念验证,受会议现场新奇效应、Muse 信噪比和固定阈值限制,实际增益仍需长期严格验证。

Redesigning Regularization for Effective Policy Smoothing Figure 1
2026-06-12cs.RO

Redesigning Regularization for Effective Policy Smoothing

Taisuke Kobayashi, Naoto Yamanaka

T. Kobayashi and N. Yamanaka are with the National Institute of Informatics (NII) and with The Graduate University for Advanced Studies (SOKENDAI)

2026-06-12强化学习

针对强化学习策略在机器人上易因输入扰动产生抖动、而原 L2C2 平滑正则实现复杂且效果不足的问题,论文指出其状态距离、策略散度和批损失标量化三处实现偏差,并提出 L2C2-v2:可控期望距离、KL 散度及偏向最坏样本的 tilted loss。实验显示该方法在多任务和两类算法中增强平滑且保持或提升控制性能,并在四足机器人 sim-to-real 中提高速度指令突变下的鲁棒性。

MPC for underactuated spacecraft control with a Lyapunov supervised physics-informed neural network correction layer Figure 1
2026-06-12eess.SY

MPC for underactuated spacecraft control with a Lyapunov supervised physics-informed neural network correction layer

Amirhossein Ayanmanesh Motlaghmofrad, Carlo Cena, Mauro Martini, Marcello Chiaberge

2026-06-12规划控制

针对欠驱动航天器姿态控制中不可控轴、惯量不确定和未建模耦合导致的MPC跟踪退化,论文提出分层架构:NMPC负责约束下规划,PINN离线学习残余扰动力矩,Lyapunov监督层在线限幅或抑制学习修正以保稳定。100次高保真仿真中,相比单独NMPC,稳态误差和最终误差均有统计显著下降,最坏最终误差降幅约52.9%,但验证仍限于仿真。

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation Figure 1
2026-06-12cs.RO

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

Tsinghua University, Shanghai Qi Zhi Institute, Shanghai Jiao Tong University, University of California, Berkeley, Fudan University, Shanghai Innovation Institute

2026-06-12机器人强化学习

这篇论文针对触觉策略长期绑定特定传感器和机器人本体、难以跨硬件泛化的问题,提出 FTP-1:用形态感知触觉 token 空间统一图像、阵列和状态类触觉信号,再由共享触觉 Transformer 学习可迁移技能。模型在来自 26 个来源、21 种传感器约 3000 小时数据上预训练;5 套硬件微调中,已见传感器成功率提升 17.2%,未见传感器也提升约 31%,但部分收益可能主要来自数据规模与预训练 scaling。

Scale Buys Interpolation, Structure Buys a Horizon: Certified Predictability for Equivariant World Models Figure 1
2026-06-12cs.LG

Scale Buys Interpolation, Structure Buys a Horizon: Certified Predictability for Equivariant World Models

Hongbo Wang

2026-06-12强化学习

这篇论文针对世界模型只看平均误差、难以判断单次 rollout 能信多久的问题,提出用等变结构给潜在世界模型计算“可预测视界”证书:误差在对称轨道上恒定,并由 Lyapunov 谱给出分通道 horizon,且证明近似等变的界是紧的。实验显示等变模型在 Lorenz-96 上能恢复谱并优于 dense/RNN 基线,还可零校准审计 TD-MPC2、V-JEPA 等预训练模型,但其精确性依赖真实动力学对称性。

Effects of Social Interactions in Self-Organising Railway Traffic Management Figure 1
2026-06-12cs.MA

Effects of Social Interactions in Self-Organising Railway Traffic Management

Fabio Oddi, Federico Naldini, Leo D'Amato, Grégory Marlière, Paola Pellegrini, Vito Trianni

2026-06-12生成模型

面向集中式铁路调度在密集网络中计算慢、扩展性差且难以共享商业敏感信息的问题,论文考察自组织交通管理中“预测邻域时间窗”如何塑造列车协商图与局部MILP/共识过程。核心洞察是该参数并非越长越好:闭环仿真显示短时间窗已足以维持全局排程可行性和质量,延长窗口主要增加局部问题复杂度与响应延迟,却未带来明显最优性收益。

EA-WM: Event-Aware World Models with Task-Specification Grounding for Long-Horizon Manipulation Figure 1
2026-06-12cs.RO

EA-WM: Event-Aware World Models with Task-Specification Grounding for Long-Horizon Manipulation

Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

AI Lab, Country Garden Services Group, Fudan University

2026-06-12机器人视觉语言强化学习

本文针对长程操作中视觉/潜特征世界模型难以判断任务事件是否达成的问题,提出 EA-WM:在冻结视觉特征动力学上加入由任务规格、动作历史和机器人状态 grounding 的事件预测与验证层,用任务进展、语义一致性、物理可行性和不确定性引导 CEM/PPO 候选动作选择。实验显示 PointMaze 成功率 0.90→0.94,Deformable/Wall-Single 达 94%/95%,LIBERO 验证 AUC 0.993947,酒架任务 97/100;但事件监督主要来自模拟器,真实部署仍待验证。

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants Figure 1
2026-06-12cs.RO

Y-BotFrame: An Extensible Embodied Agent Framework for Quadruped Robot Assistants

Luyao Zhang, Ke Li, Yuan Ding, Xulong Zhao, Guo Yu, Chengwei Yan, Fuyu Dong, Jiawei Hu, Di Wang, Nan Luo, Gang Liu, Quan Wang

Xidian University, Xidian University Xi’an China

2026-06-12机器人

针对四足机器人在开放环境中难以兼顾多任务、可扩展性与稳定部署的问题,Y-BotFrame采用分层具身智能框架:由LLM将自然语言指令映射为标准化工具调用,底层封装语音交互、无预建图导航和具身问答等模块,并支持机器人端与服务器分布式部署。论文主要给出系统设计和参考实现,声称可实现语音驱动的地面助手协作,但缺少充分实验与量化对比,实际性能增益和鲁棒性文中未充分说明。

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation Figure 1
2026-06-12cs.RO

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

Shanghai AI Laboratory, Zhejiang University, Shanghai Jiao Tong University, Tsinghua University, China University of Mining Technology

2026-06-12机器人视觉语言视觉感知数据集/基准

针对VLM在机器人操作中被用作奖励、评估与故障判断器却缺少过程理解评测的问题,论文提出RoboProcessBench,将操作进展分解为静态监测与动态推理下的12类诊断问题,并构建含约5.8万QA、覆盖260个任务的ProcessData。实验显示多种VLM在局部进度和时间推理上普遍薄弱;用ProcessData-SFT微调Qwen2.5-VL-7B和InternVL-3-8B后,在局部状态、运动和原语线索上有稳定提升,但时间相关能力仍是瓶颈。

Comparing Commercial Depth Sensor Accuracy for Medical Applications Figure 1
2026-06-12cs.RO

Comparing Commercial Depth Sensor Accuracy for Medical Applications

Pit Henrich, Maximilian Weiherer, Franziska Hansen, Bernhard Egger, Franziska Mathis-Ullrich

Department of Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-Universit¨at Erlangen-N¨urnberg, Erlangen, Germany, Department of Computer Science, Friedrich-Alexander-Universit¨at Erlangen-N¨urnberg, Erlangen, Germany, nologies, Germany), Stereolabs ZED 2i (Stereolabs, France), and, D405 (Intel RealSense, United States), Stereolabs ZED 2i -, .1 mm (Stereolabs, France), Zivid 2M+ 60 (Zivid, Norway), marble-white PLA (Bambu Lab, China) calibration cubes have, Stereolabs ZED 2i (2.1mm)

2026-06-12机器人

面向医疗/手术机器人中对可靠三维表面感知的需求,本文在猪骨、猪腹部组织和硅胶肾模型上,用光笔采样参考点云定量比较立体、结构光和 ToF 四类商用深度传感器。核心洞察是传感器排名强依赖组织材质与工作距离:约 50 cm 下 Zivid 2M+ 60 整体最稳定且误差最低,ZED 2i 在真实组织上接近但在均质暗色模型上退化,D405 拉近到 33 cm 明显改善,Flexx 精度相对落后。

GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training Figure 1
2026-06-12cs.RO

GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training

Zhihai Bi, Qiang Zhang, Guoyang Zhao, Jiahang Cao, Xueyin Luo, Yushan Zhang, Jinglan Xu, Ruoyu Geng, Yulin Li, Andrew F. Luo, Jun Ma

2026-06-12机器人视觉感知

针对人形机器人物体交互中平衡、接触与泛化耦合且传统方法依赖逐任务训练或示教的问题,GenHOI尝试直接模仿单个生成视频:先由仿真首帧和语言指令生成交互视频,再提取手—物接触事件与区域,转为物体中心几何约束来优化轨迹并闭环跟踪。仿真和真实实验覆盖抓箱、搬椅、抬桌等任务,显示其无需任务特定训练即可获得更强的位姿泛化。

Diffusion Transformer World-Action Model for AV Scene Prediction Figure 1
2026-06-12cs.CV

Diffusion Transformer World-Action Model for AV Scene Prediction

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

Stanford University

2026-06-12生成模型强化学习

这篇论文针对自动驾驶中如何用自车动作预测未来场景的问题,构建了小型动作条件 DiT 世界模型,在 SD-VAE 潜空间中预测最长 8 秒后的前视图,并系统比较表征、目标函数和评估指标。核心洞察是传统 L2/SSIM 会偏向模糊回归均值,需用 FID/KID 衡量分布真实性;扩散模型 KID 比回归好 4.8 倍,且具备转向可控性(ρ=0.81),跳跃式重锚定模型还能恢复接近真实的运动幅度。

Trajectory-Level Redirection Attacks on Vision-Language-Action Models Figure 1
2026-06-12cs.RO

Trajectory-Level Redirection Attacks on Vision-Language-Action Models

Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda, Hooshang Nayyeri, Dilek Hakkani-Tür, Melkior Ornik

2026-06-12视觉语言视觉感知规划控制

这篇论文关注 VLA 机器人把语言提示反复用于闭环重规划所带来的安全风险:微小、看似仍保留原命令的文本扰动,可能改变最终物理结果。作者形式化“命令保持的轨迹级重定向”威胁,并提出基于在线 rollout、类似 DAgger 的提示搜索。仿真与硬件实验显示,该攻击可在多类 VLA 架构上稳定把任务导向攻击者目标,9 个模型中 7 个成功率超过 90%,也提示防御需做命令级规范化而非表面清洗。

EmbodiSteer: Steering Embodiment-Agnostic Visuomotor Policies with Joint-Space Guidance for Zero-Shot Cross-Embodiment Deployment Figure 1
2026-06-12cs.RO

EmbodiSteer: Steering Embodiment-Agnostic Visuomotor Policies with Joint-Space Guidance for Zero-Shot Cross-Embodiment Deployment

Shihefeng Wang, Kangchen Lv, Mingrui Yu, Xiang Li

Department of Automation, Tsinghua University, Beijing Key Laboratory of Embodied Intelligence Systems, Institute for Embodied Intelligence and Robotics, Tsinghua University

2026-06-12机器人

这篇论文针对笛卡尔末端执行器策略虽便于跨机器人学习、但部署时缺乏本体约束感知而易发生整臂碰撞的问题,提出无需训练的 EmbodiSteer:在推理阶段把扩散采样提升到目标机器人关节空间,用正运动学、雅可比更新和类 CBF 的整身避障引导,在尽量保持末端行为的同时修正关节轨迹。实验显示其在 9 个仿真机器人上较笛卡尔执行降低 46.1% 碰撞、提升 28.5% 成功率,在两台真机受限场景中碰撞降低 90.0%、成功率提升 36.7%。

SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation Figure 1
2026-06-12cs.RO

SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation

Sunghwan Kim, Byeonghyun Pak, Kehan Long, Yulun Tian, Nikolay Atanasov

SceniX Inc., University of Michigan

2026-06-12机器人

面向长时程移动操作中仅靠图像难以持续判断位置、环境变化和任务进度的问题,SERF 将环境与具身机器人建成共享潜空间的时空神经点特征图,并用物体刚体跟踪与正运动学在线更新,再以多参考系、多尺度 token 条件化 VLA 策略。在 BEHAVIOR-1K 上,其平均任务进度由 44.0% 提升到 58.7%,路径更直接,对场景配置变化和掉落物恢复也更稳健。

Towards Reliable Sequential Object Picking in Clutter: The Runner-up Solution to RGMC 2025 Figure 1
2026-06-12cs.RO

Towards Reliable Sequential Object Picking in Clutter: The Runner-up Solution to RGMC 2025

Wei Yu, Xidan Zhang, Ziyi Zheng, Weijie Kong, Huixu Dong

School of Mechanical Engineering, Zhejiang University, Hangzhou, clutter, demonstrating strong performance in both laboratory, the center of gravity (COG) for object, and the angle between, objects in the bin. Our evaluation included both laboratory, testing and real competition scenarios. In the laboratory, we, of the third-round experiment and our routine laboratory tests

2026-06-12机器人

面向杂乱料箱中的顺序目标抓取与搜索,论文提出一套软硬件一体化方案:UR5e配合融合软夹爪、电磁铁和吸盘的多模态末端,结合NIDS-Net实例分割、基于遮挡矩阵与GMM空间记忆的重排策略,以及按类别选择的抓取姿态生成与碰撞过滤。实验中实验室10轮平均任务完成率为68%,RGMC 2025 Pick-in-Clutter赛道获第二名;主要失败来自相似物体误检、透明物体点云差和箱角空间受限。

An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics Figure 1
2026-06-12cs.RO

An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics

Zhe Liu, Huanbo Jin, Zhaohui Du, Zhe Wang, He Xu, Peijia Li, Jiaming Gu, Quan Lu, Qi Wang, Bin Ji, Ting Xiao

Augmentation Framework for Wet-Lab Robotics, Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education, East China University of Science and Technology, Shanghai, CN., Department of Computer Science and Engineering, Department of Laboratory Medicine, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, CN, Wet-lab robots can improve the reproducibility, throughput, and, open editable laboratory assets, and efficient pipelines that turn, augmentation framework for wet-lab robot learning. Pipette, releases over 43 open-source and re-editable wet-lab assets, We further introduce an 11-task wet-lab embodied benchmark, wet-lab robotic tasks.

2026-06-12机器人数据集/基准

针对湿实验室机器人真实示教昂贵、样本易污染且缺少可复现实验环境的问题,论文提出 Pipette:包含可编辑湿实验资产、自然语言任务注册、带成功校验的仿真轨迹增强和 11 项基准。仅每任务 30 条示教下,ACT 平均成功率 65.5%,增强使 SmolVLA 从 44.1% 提升到 74.7%、π0 从 40.4% 到 46.5%,说明收益可能主要来自仿真扩增数据。

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning Figure 1
2026-06-12cs.RO

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

2026-06-12规划控制学习理论

面向家庭、仓储等场景中机器人需即时理解开放自然语言且避免大规模示教训练的问题,论文提出 GRASP:由 LLM 将指令转成带空间约束的符号目标,GroundingDINO 以边界框感知物体,并用 IoU、中心距离与比例控制闭环执行。实验称其在桌面分拣/摆放中具备较高指令遵循和定位精度,但量化结果与失败模式在给定文本中未充分说明。

Learning to Adapt: Representation-Based Reinforcement Learning for Multi-Task Skill Transfer Figure 1
2026-06-12cs.RO

Learning to Adapt: Representation-Based Reinforcement Learning for Multi-Task Skill Transfer

Aryan Naveen, Haitong Ma, Haldun Balim, Na Li

2026-06-12强化学习

针对多任务机器人强化学习中样本效率低、跨任务泛化差的问题,本文提出 RepMT-SAC,将共享动力学与任务奖励解耦,用谱 MDP 分解把价值函数表示为任务无关技能与少量任务权重的组合。在四旋翼轨迹跟踪实验中,该方法在域内任务可零样本达到 100% 成功率,域外复杂轨迹仅用约 10% 预训练预算即可快速适应,并较 SAC、CTRL-SAC 最高提升约 30%。

AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots Figure 1
2026-06-12cs.RO

AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots

Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian

The Institute of Automation, Chinese Academy of Sciences, School of Automation, Beijing Institute of Technology, College of Automotive and Energy Engineering, Tongji University, School of Transportation Science and Engineering, Beihang University, Information Science, East China Normal University

2026-06-12机器人

针对空中机械臂中无人机大尺度运动与机械臂精细操作在动作尺度和控制目标上耦合导致的抖动、漂移与阶段切换冲突,AIR-VLA+用级联双动作解码器实现单向协同与物理解耦,并在无人机运动解码器加入全局语义、隐式抓取感知和非对称特征级MoE。AIR-VLA基准上平均得分48.0,相比单头π0.5任务完成分提升80.2%。

SemanticXR: Low Power and Real-time Queryable Semantic Mapping with an Object-Level Device-Cloud Architecture Figure 1
2026-06-12cs.DC

SemanticXR: Low Power and Real-time Queryable Semantic Mapping with an Object-Level Device-Cloud Architecture

Rahul Singh, Devdeep Ray, Connor Smith, Sarita Adve

University of Illinois Urbana-Champaign

2026-06-12机器人

面向移动 XR/机器人场景中开放词汇语义地图难以同时满足实时、低功耗和可查询的问题,SemanticXR 将“对象”提升为设备—云协同的通信、执行与内存管理基本单元,在云端做对象级并行、几何降采样和深度-建图协同,在设备端维护稀疏对象地图与增量优先更新。实验显示其在同等语义质量下服务器建图延迟提升 2.2×,上行带宽低于 2.5 Mbps,万级对象查询低于 100 ms,设备额外功耗约 2%。

Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids Figure 1
2026-06-12cs.RO

Stubborn: A Streamlined and Unified Reinforcement Learning Framework for Robust Motion Tracking and Fall Recovery for Humanoids

Xiao Ren, Yuhui Yang, Zongbiao Weng, Zhijie Liu, He Kong

Xiao Ren and Yuhui Yang contributed equally to this work. The authors are with the Southern University of Science and Technology, Shenzhen 518055, China. E-mails: [12431359

2026-06-12机器人视觉感知强化学习安全鲁棒

针对人形机器人运动跟踪与跌倒恢复常被拆成多阶段、独立策略训练且硬终止限制恢复探索的问题,Stubborn 用单一非对称 Actor-Critic 策略结合 yaw 对齐表示、Bernoulli 概率终止和由终止/跟踪误差驱动的自适应采样,让失败状态成为学习恢复的入口。仿真与 Unitree G1 实验显示其在 LAFAN1 跟踪误差、强扰动恢复成功率上优于或接近多种基线,消融表明概率终止和采样策略贡献了主要增益。

Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation Figure 1
2026-06-12cs.RO

Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation

Yu Guo, Chang Yu, Siyu Ma, Yunuo Chen, Yin Yang, Ying Nian Wu, Chenfanfu Jiang

University of California, Los Angeles, University of California, San Diego, University of Utah

2026-06-12机器人三维

Sparse2Act针对稀疏3D操作编码器常被下游任务、策略结构和动作空间绑定的问题,提出用末端执行器任务空间动作作为几何监督,对遮蔽点云token进行观察—动作对齐预训练;下游仅复用编码器初始化,仍可使用自身动作参数化。结果显示其在LIBERO-10达86.9%成功率,LIBERO到Meta-World迁移达73.4%,仿真预训练加少量真机微调在四个真实任务平均72.5%,说明动作信号可作为可迁移3D表征的紧凑监督。

EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows Figure 1
2026-06-12cs.RO

EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows

Clinton Enwerem, John S. Baras, Calin Belta

Institute for Systems Research, University of Maryland, College Park, MD, U.S.A.

2026-06-12生成模型

论文针对灵巧抓取生成中“先给姿态、再验力”导致的力闭合和摩擦失效问题,提出 EquiDexFlow:用 SE(3) 等变流匹配从点云联合生成腕姿、关节、触点、法向和接触力,并通过表面投影与摩擦锥投影把部分物理约束写入结构。实验在 81 个物体、8100 个力闭合抓取上训练,报告零摩擦违规、最低 wrench residual,并可迁移到 LEAP Hand 完成 6 个实物开环抓取测试。

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence Figure 1
2026-06-12cs.RO

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

Xin Zhou, Cong Miao

Nanjing University of Information Science and Technology

2026-06-12强化学习

论文针对机器人在新场景部署时示教数据昂贵、静态 WAM 易因碰撞、空抓和感知幻觉产生执行偏差的问题,提出在冻结 Cosmos3-Nano–Policy-DROID 上插入经验记忆、异常检测、策略路由和动作校正层,形成闭环在线适应。RoboLab 零样本实验中成功率保持 100%,BananaInBowlTask 时间由 25.60s 降至 9.27s、路径由 1.81m 降至 0.83m,但结果仍限于仿真和少量任务。

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation Figure 1
2026-06-12cs.AI

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

2026-06-12规划控制

为缓解真实人类出行轨迹采集成本高且受隐私限制的问题,TrajGenAgent用无需微调的分层LLM代理生成合成轨迹:先由LLM按个体与星期规划活动链,再用确定性工作流结合POI检索、距离/运动学约束和时长生成落地到具体访问序列。论文还引入基于异常检测的评估以补足传统总体统计指标。实验显示其在基准和大规模仿真数据上同时提升时空统计一致性、语义连贯性与个体行为保真度。

Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning Figure 1
2026-06-12cs.LG

Individual Control Barrier Functions-Guided Diffusion Model for Safe Offline Multi-Agent Reinforcement Learning

Qingyun Guo, Junyi Shi, Jianuo Huang, Tianyu Shi

School of Computing and Data Science, Xiamen University Malaysia, Sepang, Malaysia

2026-06-12生成模型强化学习规划控制安全鲁棒

这篇论文针对安全离线多智能体强化学习中既不能在线试错、又需处理智能体协同与约束的问题,提出将神经化个体控制屏障函数嵌入奖励条件多智能体扩散模型:在状态轨迹生成阶段反传 CBF 损失引导样本落入安全集,再用逆动力学恢复策略。实验称在多类基准上显著降低安全违规,同时保持有竞争力的回报。

DARRMS -- An Efficient Algorithm for Dynamic Attention Radius in Resource-Constrained Multi-Agent Systems Figure 1
2026-06-12cs.RO

DARRMS -- An Efficient Algorithm for Dynamic Attention Radius in Resource-Constrained Multi-Agent Systems

Benjamin Alcorn, Eman Hammad

B. Alcorn is with the Department of Electrical & Computer Engineering, Texas A&M University, College Station, TX 77845, USA, Texas A&M University, College Station, TX 77845, USA

2026-06-12机器人

面向多机器人/多智能体在算力与感知受限下仍需协同决策的问题,DARRMS将Stackelberg序贯博弈与动态注意半径联合优化,让智能体按不确定性和风险只观察必要邻域,在低复杂度策略与更耗资源的自适应策略间切换。文中理论与实验表明可降低计算需求并保持较稳健的决策性能,但具体收益幅度和对比细节在给定片段中未充分说明。

EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations Figure 1
2026-06-12cs.RO

EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations

Yangcen Liu, Shuo Cheng, Xinchen Yin, Woo Chul Shin, Alfred Cueva, Yiran Yang, Zhenyang Chen, Chuye Zhang, Danfei Xu

Georgia Institute of Technology, Tsinghua University, robot demonstrations. Egocentric human videos offer a scalable source of diverse, a scalable framework for transforming egocentric human manipulation videos into, real robots show that EgoEngine enables scalable conversion of human videos, Figure 1: EgoEngine is a scalable data engine that converts egocentric human videos into robot, hardware availability, complex interfaces, and high-DoF contact-rich control [3, 4, 5]. As a conse-, ing scalable non-robot data sources that can reduce or eliminate dependence on robot demonstration, interfaces such as Aria glasses [9] further make scalable high-fidelity collection efficient for robot, In this work, we introduce EgoEngine, a scalable framework to convert egocentric human videos, • We treat egocentric human videos as a scalable data source of robot supervision, and

2026-06-12机器人视觉感知模仿学习

面向灵巧操作中真实机器人示教昂贵且难扩展的问题,EgoEngine把第一视角人类操作视频转成成对的机器人观测与可执行动作:先构建物体中心数字孪生,用修复/渲染/融合替换人手外观,再通过重定向并结合Replay、MPC、RL的自适应优化生成轨迹。实验显示其合成视觉更接近真实机器人观测,轨迹成功率接近全RL但成本更低,并在无真实机器人示教下实现多项零样本灵巧策略学习。

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation Figure 1
2026-06-12cs.RO

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

University of California, Los Angeles

2026-06-12机器人生成模型模仿学习

针对送餐机器人/辅助轮椅在复杂人行道上仅靠单目相机进行长程无地图导航时易累积误差、缺乏社会合规和精细控制的问题,FlowPilot用锚定流匹配表示多模态轨迹,并以少量人在环干预做偏好对齐。仿真中基础模型达42%成功率、66%路线完成率,偏好微调后真实场景干预率降40.0%、近干预率降52.1%。

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation Figure 1
2026-06-12cs.RO

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

2026-06-12规划控制

面向动态、杂乱环境中的机械臂反应式运动生成,论文指出瓶颈在高保真环境建模的规划开销以及感知—规划时序耦合。G-MAPP 将多相机深度感知转为球等结构化几何表示,并在 GPU 上并行执行基于几何代数与向量场启发式的多智能体任务空间探索。实验在 7-DoF Franka 上验证,GPU 版相对 CPU 最高约 5 倍加速,并在简单和复杂实物场景中实现避碰。

Foresight: Iterative Reasoning About Clues that Matter for Navigation Figure 1
2026-06-12cs.RO

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

2026-06-12机器人

本文面向稀疏语言指令下的开放世界无地图导航,动机是机器人需在规划过程中判断路标、坡道、绕行等哪些视觉线索真正相关。Foresight 将微调 VLM 作为规划器兼评论器,迭代生成图像空间路径、用目标与场景自评并修正,再结合人类偏好奖励进行 RL 后训练。离线与 6 个真实环境实验显示,其任务成功率平均提升 37%,每次任务干预减少 52%,且可在 Jetson AGX Orin 上实时运行。

Action-Effect Memory Pretraining for Robot Manipulation Figure 1
2026-06-12cs.RO

Action-Effect Memory Pretraining for Robot Manipulation

Yijing Zhou, Qiwei Liang, Sitong Zhuang, Jiaxi Li, Xianpeng Wang, Boyang Cai, Yunyang Mo, Renjing Xu

Hong Kong University of Science and Technology (Guangzhou), Shenzhen University

2026-06-12机器人

该文针对机器人操作中单帧视觉预训练难以处理遮挡、接触变化和非马尔可夫状态的问题,提出 AEM:将视觉与动作历史交错建模,用 Mamba 和掩码重建把长时序压缩到最终视觉 token 作为紧凑记忆。实验显示其接入 Diffusion Policy、ManiFlow 后,在 RoboTwin2.0、RMBench 和真实机器人上提升成功率,并比直接堆叠历史帧降低延迟与计算开销。

$μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models Figure 1
2026-06-12cs.LG

$μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models

Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky, Aydar Bulatov, Artem Pshenitsyn, Yuri Kuratov, Alexey Skrynnik, Aleksandr I. Panov, Alexey K. Kovalev

CogAI Lab, Moscow, Russia

2026-06-12机器人

本文针对VLA在部分可观测操作中仅依赖当前观测、难以记住已消失关键信息的问题,隔离研究“递归记忆”本身的作用:在OpenVLA-OFT中加入少量跨步传递的可学习记忆token,用TBPTT端到端训练且不引入检索或辅助损失。实验显示,MIKASA-Robo训练任务成功率从0.42升至0.84,同结构未见任务从0.07升至0.23;但新记忆结构任务接近基线,LIBERO达96.2%,说明轻量递归有明确适用边界。

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration Figure 1
2026-06-12cs.RO

Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration

Leo Xu, Letian Li, Alex Cuellar, Michael Hagenow

University of Wisconsin–Madison, 2 Massachusetts Institute of Technology

2026-06-12机器人

本文针对人机协作中过度依赖手工意图识别与规划、难以迁移的问题,研究端到端 VLA 是否能从示范中学会隐式协助。核心洞察是动作分块会产生“示范动作泄漏”,在潜在任务阶段切换处导致机器人过早递工具等误协助;作者提出无需重训的推理时 steering 缓解。实体装配任务和 16 人用户研究显示,该方法可支持更长执行 horizon,减少抢先动作、失败并缩短协作时间。

2026-06-11

55 篇
FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning Figure 1
2026-06-11cs.RO

FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning

Steven Oh, Jason Jingzhou Liu, Tony Tao, Philip Han, Kenneth Shaw, Satoshi Funabashi, Ruslan Salakhutdinov, Deepak Pathak

Carnegie Mellon University, Waseda University

2026-06-11机器人强化学习

针对低成本机械臂缺少力/力矩传感器、难以完成接触丰富操作的问题,论文提出 FACTR 2:用 NEXT 仅凭约 10 分钟无接触运动数据学习自由空间力矩模型,并以电机电流残差估计外部关节力矩;再用 FIRST 按接触阶段重采样示教数据强化行为克隆。实验显示其估计接近专用关节力矩传感器,可支持低成本臂力反馈遥操作,并在五个长时程任务上较既有力感知策略提升超过 17% 任务进度。

World Pilot: Steering Vision-Language-Action Models with World-Action Priors Figure 1
2026-06-11cs.RO

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

Institute of Automation, Chinese Academy of Sciences (CASIA), Nanjing University, Beihang University

2026-06-11视觉语言视觉感知强化学习

本文针对 VLA 依赖静态图文预训练、缺少动作下场景演化建模而导致 OOD 操作脆弱的问题,提出 World Pilot:冻结视频预训练的世界-动作模型,将场景演化 latent 注入感知层,并把预测轨迹作为动作生成先验。该设计避免用像素级未来图像引入无关细节,在 LIBERO-Plus 零样本 OOD 上达 84.7% 总成功率,并在四类真实机器人任务中取得最高成功率。

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? Figure 1
2026-06-11cs.RO

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

Stanford University, 2 University of Waterloo, 3 NVIDIA

2026-06-11机器人

论文针对具身规划中盲目增加测试时计算会带来高延迟、token/FLOPs 开销且收益不稳定的问题,提出 Direct:依据场景图像与指令的多模态上下文,在思维链深度、模型规模和记忆历史等计算轴上动态路由到“足够强且更便宜”的 VLM 规划器。实验显示这些计算轴带来的能力增益各不相同;在 VLABench、RoboMME 与 Franka DROID 实机任务中,Direct 可接近或超过更强固定模型的成功率,并最高降低 65% 平均延迟。

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving Figure 1
2026-06-11cs.CV

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

2026-06-11视觉语言视觉感知

针对自动驾驶 VLA 模型虽能语言推理却缺少稠密 3D 空间落地的问题,VLGA 在视觉、语言、动作之外加入参数隔离的几何专家,并用 LiDAR 监督逐像素 pointmap 重建,使策略显式学习可用于规划的连续几何结构。在 nuScenes 开环中其无 ego 状态 VLA 指标领先,平均 L2 为 0.50m、3 秒碰撞率 0.18%;在 Bench2Drive 闭环驾驶得分达 79.08,较最强先前 VLA 高 0.71。

Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration Figure 1
2026-06-11cs.RO

Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration

Sadman Sakib Enan, Junaed Sattar

2026-06-11机器人视觉感知

面向水下多潜水员—机器人协作中 AUV 需理解潜水员活动以安全介入的问题,论文提出 DAR-Net,用 Transformer 做时序推理,并以像素级语义掩码约束模型关注潜水员、机器人和关键物体而非背景;同时构建含 2640 张标注图像、6 类活动的 UDA 数据集。受控水域实验显示其优于现有活动识别模型,但开放水域泛化仍文中未充分说明。

UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning Figure 1
2026-06-11cs.RO

UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning

Haoyuan Deng, Yitong Gao, Yudong Lin, Haichao Liu, Zhenyu Wu, Ziwei Wang

Nanyang Technological University, Beijing University of Posts and Telecommunications

2026-06-11强化学习

这篇论文针对真实机器人 HiL-RL 中大量人工接管耗时的问题,指出主要成本并非只来自危险失败,而是“不出事但无进展”的低效探索。UniIntervene 用未来条件价值估计和时间价值风险判别器自动识别停滞,并从历史干预记忆中检索高价值目标,由目标条件恢复策略执行纠偏。真实操作实验显示,相比现有 HiL-RL 基线平均成功率提升 8.6%,人工干预减少 57%,但效果依赖价值估计校准和恢复记忆覆盖度。

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies Figure 1
2026-06-11cs.RO

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

Zhejiang University, 2 Zhejiang Humanoid Robot Innovation Center

2026-06-11视觉语言视觉感知学习理论

本文针对连续动作 VLA 在语言指令分布外泛化差的问题,指出随机初始化的动作专家会在语言稀疏、视觉动作密集的数据中走向视觉捷径并干扰 VLM。APT 将策略分解为视觉-动作先验与语言条件似然,先用冻结 VLM 的视觉特征预训练动作专家,再通过门控融合注入语言。实验显示该两阶段方法可迁移到 π、GR00T 类架构,并在未见指令与组合任务上带来稳定提升。

Ambient Diffusion Policy: Imitation Learning from Suboptimal Data in Robotics Figure 1
2026-06-11cs.RO

Ambient Diffusion Policy: Imitation Learning from Suboptimal Data in Robotics

Adam Wei, Nicholas Pfaff, Thomas Cohn, Arif Kerem Dayı, Constantinos Daskalakis, Giannis Daras, Russ Tedrake

2026-06-11机器人生成模型强化学习模仿学习

针对高质量机器人示教昂贵而次优/OOD 数据大量存在的问题,论文提出 Ambient Diffusion Policy:不再简单混合或降权训练,而是利用机器人动作的谱幂律及扩散策略的“高噪声学全局规划、低噪声学局部技能”特性,只让次优数据在高/低扩散时间参与训练。实验覆盖噪声轨迹、仿真到真实、任务不匹配和 OXE 大规模混合数据,六个任务中优于共训练基线,在 OXE 上最高提升 33%。

CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy Figure 1
2026-06-11cs.RO

CHORUS: Decentralized Multi-Embodiment Collaboration with One VLA Policy

Ria Doshi, Tian Gao, Annie Chen, Chelsea Finn, Jeannette Bohg

Stanford University

2026-06-11强化学习

面向移动多机器人协作中集中式策略随队伍规模膨胀、分散式策略又常依赖通信或对齐的问题,CHORUS 将预训练 VLA 通过 LoRA 微调为单一共享策略,让每台机器人仅凭本地观测和身份提示独立执行。真实任务中,它较从零训练的分散模型成功率提升 64 个百分点、队友反应性提升 40 个百分点,并优于集中式基线;但严格同步类任务仍不适用。

Traceable Virtual Sea Trials in the Marine Robotics Unity Simulator for Manoeuvring Assessment of Unmanned Surface Vehicles Figure 1
2026-06-11cs.RO

Traceable Virtual Sea Trials in the Marine Robotics Unity Simulator for Manoeuvring Assessment of Unmanned Surface Vehicles

Paria Rezayan

a School of Engineering and Built Environment, Sheffield Hallam University, UK

2026-06-11机器人

针对无人水面艇实船操纵试验成本高、环境扰动大且不利于水动力导数辨识的问题,论文在 MARUS 中加入可追溯虚拟海试流程,自动执行回转圈与Z形试验,并区分指令与实际差动推力执行以避免系统辨识误用输入。案例中左右回转指标差异约3.9%和4.6–4.7%,Z形超调均低于1°、满足 IMO 判据,显示数据生成具备较好重复性与审计性。

Fast-SDE: Efficient Single-Microphone Sound Source Distance Estimation in Reverberant Environments Figure 1
2026-06-11cs.SD

Fast-SDE: Efficient Single-Microphone Sound Source Distance Estimation in Reverberant Environments

Jiang Wang, Runwu Shi, Yaozhong Kang, Benjamin Yen, Takeshi Ashizawa, Kazuhiro Nakadai

Department of Systems and Control Engineering, Institute of Science Tokyo

2026-06-11机器人

该文针对机器人在人机交互中需低成本感知声源距离、而麦克风阵列受同步校准和算力体积限制的问题,提出 Fast-SDE:用单麦克风输入的幅度与相位时频特征,按频带拆分并共享子带编码器,再以轻量回归头估计距离。其核心洞察是子带结构可保留混响中的距离线索同时降低全频建模开销;仿真和真实实验显示,在参数量与运行成本更低的情况下取得与现有方法有竞争力的精度。

Fourier Features Let Agents Learn High Precision Policies with Imitation Learning Figure 1
2026-06-11cs.LG

Fourier Features Let Agents Learn High Precision Policies with Imitation Learning

Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling, Enrico Krohmer, Nicolas Schreiber, Xiaogang Jia, Niklas Freymuth, Gerhard Neumann

2026-06-11模仿学习

针对高精度操作中点云策略虽有3D几何先验却表现不稳的问题,论文将原因归于点云编码器中MLP对低频函数的谱偏置,使细微空间差异难以驱动动作决策。其核心做法是在扩散模仿学习的点云输入前加入Fourier特征映射,把笛卡尔坐标升维以放大高频几何细节。实验显示该简单改动在多种点云编码器、RoboCasa、ManiSkill3及真实机器人任务上稳定提升,成功率最高分别增约20%和7%,真实任务归一化分数由14.8%升至40.2%。

UGV-Conditioned Multi-UAV Informative Planning on a Shared Exposure Belief Figure 1
2026-06-11cs.RO

UGV-Conditioned Multi-UAV Informative Planning on a Shared Exposure Belief

Lars Oerlemans, Moji Shi, Marija Popovic

*Equal contribution. Authors are with the MAVLab, Faculty of Aerospace, line space partitioning can support scalable decentralised, strate scalable coordination, they are primarily designed for

2026-06-11规划控制

本文针对未知威胁环境中UGV安全行驶依赖空中侦察、但现有多UAV多偏向通用建图而非降低地面风险的问题,提出共享“暴露度信念”框架:UAV在线更新风险图,UGV据此重规划,UAV再按当前路线优先观测相关区域,并用区域分配减少重复侦察。仿真显示,相比不考虑威胁的系统UGV累计暴露降低38%,多UAV冗余覆盖由38.8%降至3.7%,但验证仍基于理想感知与通信。

Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering Figure 1
2026-06-11cs.RO

Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering

Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy

Robotics Institute, Carnegie Mellon University

2026-06-11视觉感知

论文针对 VLA 语言到行为映射脆弱、提示改写难以可靠提升任务成功率的问题,提出在冻结 VLA 上交互搜索有效语言序列,并蒸馏为闭环语言反馈策略;同时用保形校准的改进预测头判断何时拒绝干预以避免分布外伤害。实验显示,该方法在仿真和真实 Franka 上分别较基线提升 24.7% 和 65.0%,并在视觉、语义扰动下保持较强无害性且能触发开环提示未见的恢复行为。

DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems Figure 1
2026-06-11cs.RO

DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

Wangxuan Institute of Computer Technology, Peking University, University of California, Merced

2026-06-11机器人

自动驾驶系统引入基础模型后,模块集成成本高且难满足实时调度需求。DrivingAgent将设计与运行时调度拆成两类代理:先解析架构、生成并用超网络训练验证新模块,再用强化学习训练的轻量LLM结合长短期时间戳记忆动态调用模块。实验称其在nuScenes和Bench2Drive上取得更好的速度—精度折中。

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models Figure 1
2026-06-11cs.CV

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

The University of Hong Kong

2026-06-11强化学习

论文针对世界动作模型中“能预测合理未来却未必能产生正确动作”的表征错配问题,指出视频扩散特征偏重重建外观,导致动作解码器关注无关背景。作者提出 AGRA,将中间视频特征对齐到冻结视觉基础模型的空间语义表征,以正则化世界模型到动作的接口。真实机器人实验显示,AGRA提升交互区域注意力、目标定位和抗干扰能力,ID成功率由34%升至80%,OOD泛化也有明显增益。

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends Figure 1
2026-06-11cs.RO

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

Jinshan Lai, Jianwei Hu, Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Tingxuan Huang, Xi Ren, Qiang Ma

2026-06-11数据集/基准

本文针对具身智能评测从单一数据集转向复杂评测系统后,基准构建成为可靠评估瓶颈的问题,提出以需求/任务、数据采集、清洗标注、套件与指标、执行诊断五阶段来统一梳理文献。核心洞察是自动化并非单纯降本,而是把成本转移到验证、可审计性、版本治理和长期维护;主要结果是给出人工、传统自动化、基础模型辅助与闭环智能体流程的比较框架,并强调未来基准需可诊断、可审计、可持续刷新。

AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents Figure 1
2026-06-11cs.RO

AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents

Ke Li, Jianfei Yang, Luyao Zhang, Guo Yu, Chengwei Yan, Yuan Ding, Di Wang, Nan Luo, Gang Liu, Xiao Gao, Quan Wang

Xidian University, Xi’an University of Architecture and Technology, Xidian University Xi’an China, Xi’an University of Architecture and Technology Xi’an China

2026-06-11机器人

针对无人机应用仍依赖预设航点和任务专用流水线、难以复用和扩展的问题,AerialClaw将无人机封装为由LLM驱动的闭环决策智能体,采用brain–skill–runtime架构,结合硬/软技能、文档化能力边界、记忆反思和安全运行时校验。论文主要展示其可在mock、PX4/Gazebo和AirSim中复用同一任务逻辑,并提供Web控制台与开源部署脚本;但缺少定量对比实验,实际自主性能增益文中未充分说明。

PEBRE: An Open-Hardware Compute and Perception Add-On for the Pepper Robot Figure 1
2026-06-11cs.RO

PEBRE: An Open-Hardware Compute and Perception Add-On for the Pepper Robot

Malte Kuhlmann, Ignacio Bugueno-Cordova, Emil Alms, Javier Ruiz-del-Solar, Nicolás Navarro-Guerrero

2026-06-11机器人

Pepper 仍被大量用于社交机器人研究,但原有算力、传感器和低时延能力已难支撑现代多模态应用,云端方案又受网络、隐私与安全限制。PEBRE 提出由 Pepper 直接供电的开源硬件扩展,采用紧凑模块化 3D 打印结构,集成 Jetson Orin Nano、RealSense、外置摄像头和麦克风等。实验验证显示其在计算、视觉、音频、无线连接、热管理和室内建图等方面可显著增强 Pepper,且尽量保持机体形态与移动性。

Bridging the Morphology Gap: Adapting VLA Models to Dexterous Manipulation via Intent-Conditioned Fine-Tuning Figure 1
2026-06-11cs.RO

Bridging the Morphology Gap: Adapting VLA Models to Dexterous Manipulation via Intent-Conditioned Fine-Tuning

Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding

2026-06-11机器人

论文针对预训练 VLA 多依赖低自由度夹爪、难以迁移到高自由度灵巧手的问题,提出 InDex:将原有 1-DoF 抓取输出解释为连续“虚拟抓取意图”,先用 LoRA 对齐手臂轨迹与意图,再冻结骨干并用意图条件扩散头生成手指关节动作。在 lifting、stacking、pick-place、nut assembly 仿真中平均成功率达 85.8%,优于端到端微调和模仿学习基线,并减少手指抖动。

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model Figure 1
2026-06-11cs.RO

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT), Germany, Robotics Institute of Germany

2026-06-11视觉语言视觉感知

论文针对现有 VLA 将视觉、语言、力觉等传感器强行同步到同一时钟,导致慢模态被重复计算、快模态接触瞬态被漏采且动作受慢模态阻塞的问题,提出 DAM-VLA:为各模态维护按传感器频率刷新的独立潜变量缓冲,并用门控交叉注意力接入高频力/扭矩而尽量保持预训练骨干不变。真实七个接触丰富操作任务中,其平均成功率达 95.2%,显著高于最强同步基线 40.95%,同时实现 100Hz 平滑控制。

Fibration Trees: A Unified Approach to Multi-Robot Motion Planning Figure 1
2026-06-11cs.RO

Fibration Trees: A Unified Approach to Multi-Robot Motion Planning

Andreas Orthey, Florian T. Pokorny, Lydia E. Kavraki

1 affiliationmark: Technical University of Berlin, Germany, 2 affiliationmark: KTH Royal Institute of Technology, Stockholm, Sweden, 3 affiliationmark: Rice University and the Ken Kennedy Institute, Houston, TX, US

2026-06-11机器人规划控制

针对多机器人运动规划中投影、优先级与并行分解各自绑定专用求解器、难以组合和公平比较的问题,论文用“纤维化树”把不同层级状态空间表示统一为树上的纤维化映射,并提出可在用户定义树上运行的 Fibration-RRT。实验覆盖 32 个场景、最高 96 自由度,显示其能利用所给结构提升高维规划效率,并证明概率完备性。

Point Cloud Segmentation for Autonomous Clip Positioning in Laparoscopic Cholecystectomy on a Phantom Figure 1
2026-06-11cs.RO

Point Cloud Segmentation for Autonomous Clip Positioning in Laparoscopic Cholecystectomy on a Phantom

Balázs Gyenes, Nikolai Franke, Paul Maria Scheikl, Pit Henrich, Rayan Younis, Gerhard Neumann, Martin Wagner, Franziska Mathis-Ullrich

2026-06-11视觉感知三维

面向腹腔镜胆囊切除中夹闭定位对亚毫米精度、可解释性和少量医疗数据的需求,本文避免端到端回归,改用单相机无颜色点云分割、骨架化与 B 样条提取夹闭目标,并通过12.8万合成点云预训练、logit 空间类别合并及 VariableJitter/RandomPatches 增广提升迁移。在实体仿真人实验中,目标定位在0.75 mm容差下成功率95%,自主夹闭定位执行成功率100%。

KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility Figure 1
2026-06-11cs.RO

KinematicRL: A Sim-to-Real Reinforcement Learning Framework For Social Navigation With Kinodynamic Feasibility

Zhiming Xu, Haodong Yang, Chengju Liu, Qijun Chen, Chenpeng Yao

(Corresponding author: Chenpeng Yao.) Zhiming Xu is with the School of Computer Science and Technology, Engineering, Tongji University, Shanghai 201804, China, and also with, Shanghai Institute of Intelligent Science and Technology, Tongji University

2026-06-11机器人强化学习

针对社交导航中强化学习策略依赖一阶仿真动力学、难以直接落地到差速机器人且常需相机-LiDAR融合的问题,KinematicRL将二阶控制量作为动作空间,并用随机 iLQR 预训练以提升动力学可行性;同时提出仅基于2D LiDAR的聚类行人跟踪和带门控残差的时空 Transformer,以适应人数变化。实验显示其改善运动学指标,并可在真实差速机器人上以较少修改部署。

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network Figure 1
2026-06-11cs.RO

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

National University of Singapore

2026-06-11机器人视觉感知

针对 VLA 依赖大量具身示范且视频规划难以落地执行的问题,VICX 将冻结视频生成模型用于语言条件视觉规划,再用 V2T-ICON 通过检索到的图像-状态上下文把机械臂视频映射为状态轨迹,并闭环重规划纠错。Meta-World 中仅用 3 个源任务训练执行模块,即可泛化到 9 个任务,支持自我修正和跨 embodiment 迁移。

Learning Unions of Convex Sets via Invertible Latent Decomposition for Path Planning Figure 1
2026-06-11cs.RO

Learning Unions of Convex Sets via Invertible Latent Decomposition for Path Planning

Taerim Yoon, Dongho Kang, Kisang Park, Junha Cha, Stelian Coros, Sungjoon Choi

Korea University

2026-06-11规划控制优化算法

这篇论文针对显式凸集规划约束可保证安全但高维扩展差、隐式模型可扩展却难给硬约束的问题,提出 ILD:用可逆神经映射把配置空间变形到更易被凸多面体覆盖的潜空间,并结合 VGS 维持集合连通性及测试时边界细化。实验覆盖 2D、6-DoF 与 14-DoF 操作,报告更高覆盖率、连通性和规划成功率,14-DoF 上较凸分解基线快 100 倍以上,细化后未观察到假阳性。

MPPI-based Informative Trajectory Planning for Search and Capture of Drifting Targets with ASVs Figure 1
2026-06-11cs.RO

MPPI-based Informative Trajectory Planning for Search and Capture of Drifting Targets with ASVs

Sanjeev Ramkumar Sudha, Marija Popović, Erlend M. Coates

2026-06-11规划控制

面向海上垃圾清理和搜救中目标随风流漂移、且需在未知水域兼顾发现新目标与拦截已知目标的问题,论文提出混合式 ASV 规划框架:用基于 MPPI 的时空信息轨迹规划在连续控制空间长时域权衡探索、跟踪、安全与动力学约束,接近目标后切换纯追踪制导完成捕获。仿真中该方法优于自适应和非自适应基线,并通过 ASV 外场实验验证可部署性。

Deformable In-Hand Slip-Aware Tactile Sensor with Integrated Velocity, Force/Torque, and Pressure Map Sensing Figure 1
2026-06-11cs.RO

Deformable In-Hand Slip-Aware Tactile Sensor with Integrated Velocity, Force/Torque, and Pressure Map Sensing

Gabriel Arslan Waltersson, Yiannis Karayiannidis

2026-06-11机器人

面向平行夹爪在手操作中接触状态、摩擦与滑移难以实时感知的问题,论文提出一种可变形触觉指尖,把光学滑动速度、6自由度力/力矩估计和由霍尔传感器重建的压力分布集成在同一柔顺结构中。实验显示其可在多种材料的平面与曲面上跟踪滑移,并较刚性方案改善接触动力学和扭矩控制能力,但具体性能边界仍由实验限制界定。

DuoBench: A Reproducible Benchmark for Bimanual Manipulation in Simulation and the Real World Figure 1
2026-06-11cs.RO

DuoBench: A Reproducible Benchmark for Bimanual Manipulation in Simulation and the Real World

Tobias Jülg, Seongjin Bien, Simon Hilber, Yannik Blei, Pierre Krack, Maximilian Li, Sven Parusel, Rudolf Lioutikov, Florian Walter, Wolfram Burgard

University of Technology Nuremberg, 2 Karlsruhe Institute of Technology, Franka Robotics, 4 Technical University of Munich

2026-06-11机器人强化学习数据集/基准

针对现有双臂操作基准难以覆盖多样协同模式、真实复现实验成本高且二元成功率诊断不足的问题,DuoBench在FR3 Duo上构建11个仿真任务和部分真实任务,配套3D打印资产、遥操作数据、四类协同分类与阶段式评估。实验显示,当前模仿学习和VLA策略在早期交互、双臂并行执行及仿真到真实迁移上仍频繁失败,混合训练虽有时提升真实表现但不能消除sim-to-real差距。

Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation Figure 1
2026-06-11cs.RO

Critic Architecture Matters: Dual vs. Unified Critics for Humanoid Loco-Manipulation

Mehmet Turan Yardımcı

2026-06-11机器人

面向人形机器人同时行走与触达时多目标强化学习梯度相互干扰的问题,论文在 Unitree G1 与 Isaac Lab 中对比统一 critic 和按运动/操作分离奖励的双 critic。核心洞察是 critic 架构本身会影响操作效率,且常规训练奖励和课程进度难以暴露差异。标准化评测中双 critic 触达速度提升 3.5 倍、吞吐约翻倍、成功率更高,反作弊奖励未带来额外收益;但实验仍受仿真、单 seed 及动作维度混杂限制。

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection Figure 1
2026-06-11cs.CV

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

Everett Richards

2026-06-11视觉语言视觉感知

面向自动驾驶中VLM危险检测的安全评估,论文指出仅看CLIP图像嵌入漂移无法反映任务决策稳定性,提出将嵌入漂移与基于危险/非危险提示的hazard margin漂移和翻转率对齐分析。在BDD100K七类扰动上发现相关性强烈依赖扰动类型:JPEG、下采样较可预测,而运动模糊、遮挡可在较小嵌入变化下造成判决翻转;多数扰动导致漏检,遮挡则更易误报。

Modular Anthropomorphic Hand Design via Multi-Parameter Finger Benchmarking and Selection Figure 1
2026-06-11cs.RO

Modular Anthropomorphic Hand Design via Multi-Parameter Finger Benchmarking and Selection

Yu Zhang, Huijiang Wang, Josie Hughes

2026-06-11数据集/基准

针对仿人灵巧手设计变量耦合、评测指标割裂且整手迭代成本高的问题,本文提出可更换手指的模块化平台,用多参数基准先筛选关节、骨架、皮肤与传感布局,再整合到遥操作整手验证。优化后的 JCPB 手相较基线侧向提升能力提高 83.3%,整手抓握力约提高 32%,旋钮转动范围扩大 87.5%。

Human-Guided Co-Manipulation of Carbon Fiber Plies Figure 1
2026-06-11cs.RO

Human-Guided Co-Manipulation of Carbon Fiber Plies

Rami Ojanen, James Fant-Male, Roel Pieters

2026-06-11机器人

针对碳纤维铺层等柔性材料难以全自动搬运、纯人工又低效且不 ergonomics 的问题,论文在飞机座椅铺放场景中比较顺应控制、预定义轨迹、分步语音、视觉腕部跟踪及混合方案。核心洞察是无需建模材料本体,语音、视觉与力控各补短板:预定义轨迹最快,语音直观,顺应控制更稳定可控,腕部跟踪可减少拉扯并改善三维引导,混合方法最有望用于完整协作流程。

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning Figure 1
2026-06-11cs.RO

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning

Shengcheng Luo, Xiyan Huang, Zhe Xu, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

ShanghaiTech University, Beijing Institute for General Artificial Intelligence

2026-06-11强化学习

面向视觉不可用或遮挡场景下的灵巧手盲抓取,论文关注稀疏触觉信号表达弱、触觉仿真到真实迁移困难的问题。方法通过Real2Sim接触事件校准缩小二值触觉时序差异,引入带传感器空间布局先验的触觉编码器,并将物体专属RL专家轨迹蒸馏为触觉条件扩散策略。在带触觉LEAP Hand的20个物体实测中,无视觉和无真实抓取示范条件下成功率为27%,效果仍有限但验证了该路径的可部署性。

TacCoRL: Integrating Tactile Feedback into VLA via Simulation Figure 1
2026-06-11cs.RO

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

Siyu Ma, Yuqi Liang, Chang Yu, Yunuo Chen, Hao Su, Yixin Zhu, Yin Yang, Chenfanfu Jiang

University of California, Los Angeles, 2 University of California, San Diego, University of Electronic Science and Technology of China, Peking University, 5 University of Utah

2026-06-11强化学习

面向插入、装配等接触密集操作中视觉难以判断局部接触状态的问题,TacCoRL将触觉作为对预训练VLA的后训练信号,而非依赖大规模触觉预训练。其核心是在对齐真实机器人的仿真中混合真实/仿真轨迹做共训练,再用稀疏奖励RL学习近失败状态下触觉应如何调制动作,并用真实数据监督约束分布漂移。四个双臂任务中真实成功率由基线50.0%提升到72.5%,但仍依赖任务级数字孪生和少量真实触觉示范。

Explore From Sketch: Accelerating UAV Exploration in Large-scale Environments with Prior Maps Figure 1
2026-06-11cs.RO

Explore From Sketch: Accelerating UAV Exploration in Large-scale Environments with Prior Maps

Tiancheng Lai, Yuman Gao, Xiangyu Li, Ruitian Pang, Xingpeng Wang, Siqi Shen, Mengke Zhang, Yin He, Fei Gao, Chao Xu, Yanjun Cao

Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University, Hangzhou 310027, China, Huzhou Institute, Zhejiang University, and Huzhou Key Laboratory of Autonomous System, Huzhou 313000, China., Zhejiang Zhongyan Industry Co., Ltd, Hangzhou 310000, China.

2026-06-11机器人

这篇工作针对大规模复杂环境中无人机仅依赖局部观测易绕路、效率低的问题,利用常见但不精确的二维先验草图提供全局引导。核心在于将GeoContext、多帧验证和Scale-ICP组成鲁棒2D-3D配准,并在多重定位假设下用MCTS、风险选择与固定终点TSP衔接全局指导和局部视点覆盖。实验显示相较现有方法探索效率最高提升34.2%,飞行距离减少37.9%,且对先验缺失和形变有一定鲁棒性。

Improving Human Diving Endurance with a Field-Deployable, Untethered Exoskeleton Figure 1
2026-06-11cs.RO

Improving Human Diving Endurance with a Field-Deployable, Untethered Exoskeleton

Zhihao Zhou, Zhenmeng Ju, Rui Yang, Chenxi Zhang, Ming Xu, Enhao Zheng, Dongjie Jiang, Lecheng Ruan, Jingeng Mai, Qining Wang

2026-06-11机器人

针对水下阻力大、气瓶供气有限导致潜水作业续航受限的问题,论文提出无缆、可外场部署的髋关节助力外骨骼 DiveMate,并基于蛙鞋 flutter kick 的自然节律自适应施加助力。真实潜水测试显示,在给定呼吸气体下行进距离提升 42.9%、潜水时长提升 54.9%,净耗气率降低 47.0%,同时肌肉激活下降,说明其主要通过降低踢腿生理负担改善水下耐力。

DroneShield-AI: A Multi-Modal Sensor Fusion Framework for Real-Time Autonomous Drone Threat Detection, Behavioral Intent Classification, and Swarm Intelligence in Contested Airspace Figure 1
2026-06-11cs.CV

DroneShield-AI: A Multi-Modal Sensor Fusion Framework for Real-Time Autonomous Drone Threat Detection, Behavioral Intent Classification, and Swarm Intelligence in Contested Airspace

Marius Bayizere

Code, model weights, and simulation datasets: publicly available at submission (see Section VI.D), Networks. Evaluated on three publicly available real-world datasets (DroneRF, OpenSky Network, a target of 500+ labelled sorties by Q4 2026. All code, model weights, and simulation datasets are, The global proliferation of commercially available unmanned aerial vehicles (UAVs) has created a security

2026-06-11视觉感知

针对低空小型无人机在冲突空域中难以被单一传感器及时发现、且缺少意图与蜂群建模的问题,本文提出 DroneShield-AI,将 RF、声学、YOLOv8 视觉、证据加权融合、BICE 意图分类和 GAT 蜂群分析串成低成本 CPU 管线。公开数据与仿真评估显示融合检测准确率 96.1%、误报率 3.2%、端到端延迟 142 ms;但 BICE/GNN-SIM 主要基于物理校准仿真,真实外场验证仍未完成。

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning Figure 1
2026-06-11cs.RO

SAFER-Nav: Enhancing Safety for Visual Robot Navigation via Segmentation-Aware Fine-Tuning

Geonyeong Ko, Giung Lee, Changjoo Nam

Dept. of Electronic Engineering, Sogang University, Seoul, Korea, Dept. of Computer Science, Rice University, Houston, TX, USA, Vertical Labs, Co., Ltd., Seoul, Korea

2026-06-11机器人视觉感知安全鲁棒

针对视觉导航基础模型在陌生、拥挤或光照变化环境中仍会“朝目标走但不安全”的问题,SAFER-Nav 将可通行区域与障碍边界的分割信息通过轻量分支和注意力融合注入冻结的 RGB 导航骨干,并用辅助分割路径生成安全导向航点。实机实验覆盖多机器人、室内场景及静动态障碍,相比 ViNT、NoMaD 及 CARE 增强版本降低碰撞,同时基本保持到达目标能力;但效果依赖在线分割质量。

LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition Figure 1
2026-06-11cs.RO

LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition

Harsh Gupta, Guanya Shi, Wenzhen Yuan

University of Illinois Urbana-Champaign, Carnegie Mellon University

2026-06-11机器人视觉感知

针对机器人示教和结构化人类数据昂贵且绑定具体本体的问题,LUCID将无结构人类视频中的任务意图与仿真中学习的本体控制解耦:意图模型闭环预测短时物体流和手掌位姿,控制策略再转为动作,并可复用到灵巧手和夹爪。实验在搅拌、擦拭、投放等真实任务上显示,闭环方案平均成功率73%,显著高于开环基线28%,且随视频数据规模提升而改进。

Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing Figure 1
2026-06-11cs.RO

Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing

Hao Wang, Fu-Zhao Ou, Shiqi Wang, Zhaolin Wan, Xiaopeng Fan

2026-06-11机器人模仿学习

面向工业线缆布线中相机运动、远程部署等导致的视觉失真,论文提出抗失真的机器人模仿学习框架,将面向机器人操作行为的图像质量评估模块、置信度学习机制与决策模块结合,用质量信息在训练中强调低质且困难样本,并构建 MyRMB 数据集量化失真对机器人视觉系统的影响。实验显示该设计可提升离散技能或连续动作决策准确性,但跨真实物理环境的泛化验证仍未充分说明。

ConsistencyPlanner: Real-time Planning with Fast-Sampling Consistency Models Figure 1
2026-06-11cs.RO

ConsistencyPlanner: Real-time Planning with Fast-Sampling Consistency Models

Qichao Zhang, Xing Fang, Jiaqi Fang, Zhenwen Cai, Jie Ling, Qiankun Yu, Dongbin Zhao

State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China, Guangzhou Zaofu Intelligent Technology Co., Ltd.

2026-06-11规划控制

面向自动驾驶闭环规划中“多模态行为建模”与“实时推理”难以兼顾的问题,论文将快速采样的一致性模型引入规划器,并用带注意力的解码器融合场景特征与动作 token,以生成多样候选轨迹。Waymax 实验显示其在碰撞率、越界率等安全指标上优于学习式基线,动态场景更明显;但进度率仍偏保守,效率与安全权衡尚未充分解决。

Cross-Modal Benchmarking for Robotic Perception in Natural Environments Figure 1
2026-06-11cs.CV

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

University of Sydney (USyd), Australia., Queensland University of Technology (QUT), Australia.

2026-06-11机器人数据集/基准

面向农业、监测和搜救等自然场景,论文指出现有感知基准多偏城市/室内,难以暴露野外机器人在植被、遮挡和窄径中的失效。其核心是 WildCross:47.6万余帧RGB与半稠密深度/法向、6DoF位姿和同步激光子图对齐,统一评测视觉/跨模态地点识别和单目尺度深度。实验对NetVLAD、DINO系、LIP-Loc、DepthAnything等进行零样本与微调比较,结果显示现有模型跨域泛化不足;深度扩展实验和PGT微调的具体增益幅度文中片段未充分说明。

Adversarial Attacks on Learned Policies for Surgical Robotic Tasks Figure 1
2026-06-11cs.RO

Adversarial Attacks on Learned Policies for Surgical Robotic Tasks

Shutong Jin, Ziyang Chen, Preethi Satish, Paavan Gupta, Florian T. Pokorny, Ken Goldberg

University of California, Berkeley, KTH Royal Institute of Technology

2026-06-11机器人

针对手术机器人逐步采用端到端学习策略但安全脆弱性缺乏评估的问题,论文系统研究视觉对抗扰动对去创和缝合策略的影响,区分中断与定向操控两类威胁,并提出伪装成光照变化的时序光度攻击。对 ACT、Diffusion Policy 和 π0 的 560 次实体实验显示,攻击使任务成功率平均下降 61%,且定向攻击可毫秒级生成并在闭环中放大为危险动作。

Learning Object Manipulation from Scratch via Contrastive Interaction Figure 1
2026-06-11cs.RO

Learning Object Manipulation from Scratch via Contrastive Interaction

Tongle Shen, Caleb Chuck, Fan Feng, Biwei Huang

2026-06-11机器人

论文针对对比强化学习在接触、抓取等交互密集操作中表现不稳的问题,指出物体交互会引发动力学模式切换,使可达性结构呈分段非线性,标准 CRL 容易抹平关键边界。作者提出交互加权重采样 IWR,在交互前中后构造更有信息量的状态-目标对,以强化表示对模式变化的刻画。实验覆盖动态迷宫、Meta-World 和机器人冰球,仿真平均提升约 19.8%,真实冰球任务成功率由 25% 提至 60%。

Steering Multirobot Behavior via Closed-Loop Affine Activation Editing Figure 1
2026-06-11cs.RO

Steering Multirobot Behavior via Closed-Loop Affine Activation Editing

Satyajeet Das, Darren Chiu, Shashank Hegde, Gaurav S. Sukhatme

Department of Computer Science, University of Southern California

2026-06-11机器人

针对机器人部署时需改变预训练策略行为、而微调可能破坏原有能力的问题,论文提出 CLAE:在推理阶段冻结策略权重和动作头,用稀疏自编码器定位相关中间激活,并由轻量 RL 策略闭环输出仿射编辑。多四旋翼仿真与实机实验显示,该方法可在保持导航避障基础上调节速度、维持编队并实现避摄像头的新增行为。

Bridging the sim2real gap in the table tennis robot with a transformer-based ball states predictor Figure 1
2026-06-11cs.RO

Bridging the sim2real gap in the table tennis robot with a transformer-based ball states predictor

Yin Bi, Christian Conti, Bilan Yang, Alexander Sigrist, Peter Dürr, Naoya Takahashi

2026-06-11机器人

面向乒乓球机器人中高速闭环控制对未来球位、速度与旋转预测的需求,论文用基于 Transformer 的编码器—解码器从历史观测直接建模长时序相关性,并采集 10 万余条真实轨迹支撑泛化;进一步提出部署时用真实数据训练的预测器替换仿真物理预测器的 SPAD 策略。实验显示其长时域预测优于物理和学习基线,并在无需重训策略的情况下缩小 sim-to-real 差距。

A Modular Dual-Camera Pipeline for Micro-Inspection Using Aerial Robots Figure 1
2026-06-11cs.RO

A Modular Dual-Camera Pipeline for Micro-Inspection Using Aerial Robots

S.H. Mirtajadini, N. Rublein, R.M. Ramakrishnan, G. ter Maat, M. Aldibaja, A.Y. Mersha

2026-06-11机器人

针对无人机近距离获取微小目标细节时存在安全风险、窄视场易受扰动丢目标且常依赖先验几何的问题,论文提出兼容 PX4/ROS 2 的开源双相机微检流水线:广角双目在线分割表面、估距并划分检查区,变焦云台相机逐区拍细节,并用视觉反馈补偿机体运动。仿真显示扰动下覆盖更稳,实测在树干虫卵/毛虫与温室粘虫板场景中获得了有效检测和高细节成像。

Dynamic Execution Horizon Prediction for Chunk-based Robot Policies Figure 1
2026-06-11cs.RO

Dynamic Execution Horizon Prediction for Chunk-based Robot Policies

Yuchi Zhao, Miroslav Bogdanovic, Arjun Sohal, Liyu Tao, Kourosh Darvish, Alán Aspuru-Guzik, Florian Shkurti, Animesh Garg

2026-06-11机器人

论文针对动作分块机器人策略普遍采用固定执行步长的问题:长步长平滑高效但反应慢,短步长利于精细接触却不稳定。作者提出 DEHP,在冻结预训练分块策略的前提下,用轻量分支根据观测和动作块预测重规划时机,并以 chunk-level PPO 训练。实验显示其在装配、插入等高精度和长时程任务上优于调参后的固定步长基线,且学到的步长随任务阶段变化。

PLUME: Probabilistic Latent Unified World Modeling and Parameter Estimation for Multi-Finger Manipulation Figure 1
2026-06-11cs.RO

PLUME: Probabilistic Latent Unified World Modeling and Parameter Estimation for Multi-Finger Manipulation

Abhinav Kumar, Soshi Iba, Rana Soltani Zarrin, Dmitry Berenson

University of Michigan 2 Honda Research Institute USA

2026-06-11机器人强化学习

多指灵巧操作对摩擦、形状、位姿等隐含物理参数高度敏感,单纯域随机化或固定历史策略难以覆盖精细任务。PLUME用流匹配统一学习参数信念更新、潜在参数表示和条件世界模型,并用奖励与似然评分做规划。其在螺丝刀、阀门、拨盘、提桶仿真及真实螺丝刀零样本迁移中优于离线RL和世界模型行为克隆基线,但训练仍依赖仿真真值参数。

HiPi: Reproducible High-Fidelity Piezoresistive Sensors for Robotic Manipulation Figure 1
2026-06-11cs.RO

HiPi: Reproducible High-Fidelity Piezoresistive Sensors for Robotic Manipulation

Changyi Lin, Raihan Haque, Hui-Ping Wang, Ding Zhao

Carnegie Mellon University 2 General Motors

2026-06-11机器人

面向机器人操作中压阻触觉传感器“易复现但信号一般、高保真但难部署”的矛盾,HiPi以低串扰读出为基础重做硬件栈:可商用贴装的小型PCB、STM32共享MCU、多传感器SPI通信和FPCB导电层。双臂四块16×32阵列可达220Hz;3D打印接触图案实验中,平均IoU由0.428升至0.797,Dice由0.539升至0.886。

Energy-Conserved Neural Pipelines: Attenuating Error Propagation in Modular Neural Networks via Physical Conservation Constraints Figure 1
2026-06-11cs.LG

Energy-Conserved Neural Pipelines: Attenuating Error Propagation in Modular Neural Networks via Physical Conservation Constraints

David Young, Swan Yi Htet

2026-06-11优化算法

针对模块化神经管线在机器人感知到控制等场景中易发生误差逐级放大的问题,论文提出在模块边界强制保持激活向量 L2 能量不变,把归一化从软惩罚改为硬约束。CIFAR-10 中噪声下精度保持率由约35%升至77%,多深度管线表现近似不变;在 MuJoCo Franka 感知-控制实验中,对单目深度漂移噪声平均提升18.9个百分点,但对部分噪声类型作用有限。

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models Figure 1
2026-06-11cs.RO

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

2026-06-11机器人

针对具身模型能力割裂、多任务训练冲突和缺少长程闭环验证的问题,Embodied-R1.5 将空间认知、任务规划/纠错与指向定位统一到 8B EFM 中,并用 15B token 自动构造数据、均衡 RL 与 PGC 闭环执行支撑训练和部署。结果显示其在 24 个具身 VLM 基准中 16 个达 SOTA,小数据微调成 VLA 后超过 π0.5 等基线,并在零样真实机器人长程任务中展示泛化与自纠错能力。

Model-based Optimization of Anguilliform Swimming Gaits for Soft Robotic Applications Figure 1
2026-06-11cs.RO

Model-based Optimization of Anguilliform Swimming Gaits for Soft Robotic Applications

Brian Van Stratum, James Gallentine, Caleb Rucker, Eric Barth, Jonathan E. Clark, Kourosh Shoele

FAMU/FSU College of Engineering, Tallahassee, FL 32310, Mechanical Engineering, Vanderbilt University, Nashville Tennessee 37235, Mechanical Engineering, The University of Tennessee, Knoxville, Tennessee 37996

2026-06-11机器人优化算法

面向同时游泳与攀爬的软体仿七鳃鳗机器人,论文针对形态—控制空间过大、纯实验或 CFD 难以协同优化的问题,构建结合 Lighthill 大振幅细长体理论与非线性梁模型的中等保真 FSI 模型,并用遗传算法联合优化气动步态和尾鳍参数。实验表明低频受阻力主导、高频受惯性主导,优化后 SLIDER 达到约 21.7±0.4 cm/s(0.59 体长/s)的系留游速。

MASK: Multi-Agent Semantic K-Scheduling for Risk-Sensitive 6G Robotics Figure 1
2026-06-11cs.RO

MASK: Multi-Agent Semantic K-Scheduling for Risk-Sensitive 6G Robotics

Ahmet Gunhan Aydin, Elif Tugce Ceran

2026-06-11机器人安全鲁棒

面向6G机器人群在有限PRB/子载波下无法全员同时通信且仍需规避尾部风险的问题,MASK将通信调度与风险敏感MARL结合:A-SIG按本地语义重要性只允许Top-K智能体发送观测,再由自监督全局编码器和分布式回报策略进行CVaR式决策。实验称在仅开放少量信道接入时可接近无通信约束基线,并对随机丢包保持鲁棒,但具体增益来源仍需更多消融支撑。

2026-06-10

63 篇
TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation Figure 1
2026-06-10cs.RO

TacForeSight: Force-Guided Tactile World Model for Contact-Rich Manipulation

Yujie Zang, Yuhang Zheng, Xian Nie, Yupeng Zheng, Shuai Tian, Songen Gu, Chen Gao, Zining Wang, Shuicheng Yan, Wenchao Ding

National University of Singapore, Shanghai Jiao Tong University, Institute of Automation, Chinese Academy of Sciences, Fudan University

2026-06-10机器人强化学习

面向插入、锁紧等接触丰富操作中力/触觉反馈常被动融合、难以及时应对接触突变的问题,TacForeSight利用腕部高频力/力矩作为未来指尖触觉变化的先导信号,在紧凑潜空间预测短时触觉动态,并将预测触觉作为策略的前瞻接触先验。真实机器人五类任务和三种在线扰动实验显示,其在常规与扰动场景均优于基线,尤其提升动态接触恢复鲁棒性。

JOIN: Anchor-Grasp-Conditioned Joining via Opposition, Inference, and Navigation for Bimanual Assistive Manipulation Figure 1
2026-06-10cs.RO

JOIN: Anchor-Grasp-Conditioned Joining via Opposition, Inference, and Navigation for Bimanual Assistive Manipulation

Drake Moore, Matt Cheng, Xiang Zhi Tan, Taşkın Padır

2026-06-10机器人

本文面向轮椅单臂难以完成开瓶、倒水、抬托盘等双手日常任务的问题,提出按需召唤移动机械臂与已抓取的轮椅“锚定臂”协作的 bimanual joining 设定。JOIN 将问题分为规划、导航、抓取三阶段,用 VLM 判断任务目标与运动方向,再用锚定参考的对置评分选基座位置、用任务条件方向可操作性选抓取。在 Kinova Gen3 与 Stretch 3 的四类真实任务中,JOIN 成功 19/20,高于 AnyGrasp 基线 14/20,且显著减少操作者抓取修正。

EM-Fall: Embodied mmWave Sensing for Day-and-Night Fall Detection on Humanoid Robots Figure 1
2026-06-10cs.RO

EM-Fall: Embodied mmWave Sensing for Day-and-Night Fall Detection on Humanoid Robots

Yanshuo Lu, Yuxuan Hu, Shenghai Yuan, Xinyu Zhou, Kuangji Zuo, Bofan Lyu, XiChen Yuan, Jianfei Yang

2026-06-10机器人视觉感知

面向居家养老中跌倒检测受佩戴依从性、固定传感覆盖盲区、夜间与遮挡影响的问题,EM-Fall将毫米波雷达装到移动人形机器人上,通过跟随调节视角,并用聚类-EKF跟踪、人本目标过滤与轻量时序建模抑制宠物运动和多径干扰。论文在8个真实室内场景、4名参与者上验证,显示移动具身感知较固定雷达提升监测连续性,并在低照、遮挡和干扰条件下保持较稳健检测。

RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning Figure 1
2026-06-10cs.RO

RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning

Yichao Zhong, Yidan Lu, Yuhang Lu, Tianyang Tang, Haoguang Mai, Yixuan Pan, Tianyu Li, Li Chen, Jingbo Wang, Zhongyu Li, Peng Lu, Hongyang Li

The University of Hong Kong, The Chinese University of Hong Kong

2026-06-10机器人强化学习

本文针对人形机器人足球射门中稳定性、击球力量、目标精度和运动球时机难以兼顾的问题,提出 RoboNaldo:用单个人类踢球动作为支架,通过三阶段运动引导课程强化学习,先学稳定全身踢腿,再学习任意静止球的瞄准接触,最后用行走指令与踢球触发接口扩展到运动球。仿真中任意球误差较基线低 48.6%、球速达 2.96 倍;Unitree G1 实机在 3 米射门中静止球和运动球平均误差为 0.73/0.86 米,最高球速 13.10 m/s。

A Distributed Multi-UGV Exploration Framework With Loop-Aware Planning and Descriptor-Aided Localization in Resource-Limited Environments Figure 1
2026-06-10cs.RO

A Distributed Multi-UGV Exploration Framework With Loop-Aware Planning and Descriptor-Aided Localization in Resource-Limited Environments

Zhiwei Li, Haiou Liu, Xijun Zhao, Ji Li, Yingze Wang, Boyang Wang

2026-06-10规划控制

面向无 GPS、带宽受限且无先验地图的多 UGV 探索,论文指出定位漂移会破坏地图一致性并造成重复覆盖。其核心是把跨车回环从被动后端约束提升为规划锚点:用轻量 LiDAR 全局描述子和距离图预对齐做鲁棒地点识别,再以位姿不确定性筛选高价值回环并嵌入分层任务分配与局部规划。实验中回环检索 AR@1/AR@1% 为 89.9%/95.5%,相较 mTSP 探索时间和行驶距离分别降 15% 和 14%。

Generation of Diverse and Functional Robot Designs using Superquadrics Parametrisation and Quality-Diversity Figure 1
2026-06-10cs.RO

Generation of Diverse and Functional Robot Designs using Superquadrics Parametrisation and Quality-Diversity

Leni Le Goff, Simon Smith, Emma Hart

2026-06-10机器人

针对机器人形态与控制联合进化中搜索空间巨大、易早熟收敛且生成设计多样性不足的问题,论文用仅少量参数、可解释的超二次曲面表示底盘,并结合CPPN布置部件、homeokinetic控制快速评估运动能力,再用MAP-Elites显式维护形态多样性。两种环境实验显示,SQ+MAP-Elites取得最高QD-score,能生成更多且功能性更好的多样机器人设计。

A Spiking Neural Architecture for Coordinating Arm and Locomotor Control Figure 1
2026-06-10cs.RO

A Spiking Neural Architecture for Coordinating Arm and Locomotor Control

Lea Steffen, Kathryn Simone, Graeme Damberger, Travis DeWolf, Hudson Ly, Chris Eliasmith

Centre for Theoretical Neuroscience, Dept. of Systems Design Engineering University of Waterloo Waterloo Canada, Dept. of Nanotechnology Engineering University of Waterloo Waterloo Canada, Dept. of Philosophy University of Waterloo Waterloo Canada

2026-06-10规划控制

针对现有脉冲神经网络机器人控制多将双足行走与手臂操作分开处理的问题,本文在 Unitree H1 仿真平台上构建统一 SNN 控制架构:用 NEF/SPA 与脉冲基底节进行高层动作选择,结合力控 REACH 手臂模块和由 ANN 转换来的步态策略。Nengo 与 Isaac Sim 联合仿真显示其可完成目标到达、连续数字绘制、路径跟随行走,并能在行走与手臂控制间切换;真实硬件部署和能耗增益仍未充分说明。

Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving Figure 1
2026-06-10cs.RO

Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving

Zehan Zhang, Neng Zhang, Yaoyi Li, Jia Cai, Zhiling Wang

University of Science and Technology of China, Yinwang Intelligent Technology Co., Ltd, Hefei Institutes of Physical Science, Chinese Academy of Sciences, Equal contribution.Work done during an internship at Yinwang Intelligent Technology Co., Ltd.Corresponding author.

2026-06-10生成模型规划控制

针对学习式自动驾驶规划在闭环中易受帧间扰动影响、而静态引入历史又会诱导复制旧运动模式的问题,本文提出 DFP:将轨迹按历史、当前、未来分块并赋予独立扩散噪声,训练中联合去噪,推理时用历史退火的 CFG 可调地融合历史约束与无历史分支。nuPlan 闭环与消融显示其在无需重后处理时保持竞争性性能,并改善轨迹连续性、稳定性与舒适性。

Multi-UAV Active Sensing with Information Gain-based Planning and Belief Fusion Figure 1
2026-06-10cs.RO

Multi-UAV Active Sensing with Information Gain-based Planning and Belief Fusion

S. Habibi, L. Marques

2026-06-10规划控制

针对多无人机在有限航时、传感不确定性与覆盖/精度权衡下的主动感知问题,论文将农田二值地形建模为概率信念图,用因子图刻画空间相关性,并以信息增益驱动路径规划和多种信念融合规则协同建图。实验表明,IGbIPP较随机游走和扫掠规划更能降低熵与MSE;更大视场显著提升覆盖和精度,贝叶斯、log-odds与Dempster–Shafer融合表现最好。

Language-Driven Cost Optimization for Autonomous Driving Figure 1
2026-06-10cs.RO

Language-Driven Cost Optimization for Autonomous Driving

Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora

2026-06-10优化算法

自动驾驶规划器的代价权重通常离线手调,难以随交通情境和乘客偏好变化。本文将 LLM 作为自然语言到风险感知 MPPI 代价参数的接口,并加入部署前的非技术化解释确认与运行中反馈修正。NuPlan 仿真和多类用户指令显示,该方法能诱导更快、更保守或更平顺等预期行为,控制频率约 100 ms,但真实道路验证仍未充分说明。

Resilient Navigation for Autonomous Farm Robots by Leveraging Jerk-Augmented Models with IMU-Only Disturbance Rejection Figure 1
2026-06-10cs.RO

Resilient Navigation for Autonomous Farm Robots by Leveraging Jerk-Augmented Models with IMU-Only Disturbance Rejection

Batu Candan, Mohammed Atallah, Simone Servadio, Saeed Arabi

Iowa State University, Ames, IA 50011, USA

2026-06-10机器人

面向农田机器人在 GNSS/LiDAR/视觉中断及崎岖地面振动下的惯性导航失稳问题,论文将 jerk 纳入 EKF 状态,并用按轴残差驱动的多调谐因子实时调整测量协方差,以隔离局部冲击而保留未受扰轴信息。在 Salin247 实车数据上,相比 6/9 状态基线 EKF,3D 位置 RMSE 明显降低,纯 IMU 航位推算更稳健。

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning Figure 1
2026-06-10cs.RO

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

2026-06-10机器人强化学习

这篇论文瞄准长期运行机器人在动态环境中难以从碎片化观测维持稳定场景记忆的问题。AllDayNav 的核心是用自演化多模态记忆保存视觉关键帧、语义与时间上下文,并将其接入强化学习控制环,以隐式学习替代显式地图/场景图。仿真和真实跨房间、跨回合、跨任务实验中,其成功率接近 100%,路径效率和鲁棒性优于地图式、VLM 与 RL 基线。

Task Robustness via Re-Labelling Vision-Action Robot Data Figure 1
2026-06-10cs.RO

Task Robustness via Re-Labelling Vision-Action Robot Data

Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

2026-06-10机器人视觉感知安全鲁棒

机器人模仿学习数据虽变大,但长轨迹对应少量指令,导致语言—动作多样性不足、指令跟随不稳。TREAD 用现成 VLM 将原始演示分解为语义子任务、定位对应视频片段,并生成含物体属性与空间关系的多样化标签,无需新采集数据。LIBERO 上微调 Octo 与 π0-FAST 后,未见任务和文本目标的成功率提升,说明收益主要来自轨迹分解与语言重标注的数据增强。

AgniNav: Configuration-Driven Cross-Embodiment Local Planning for Robot Navigation Figure 1
2026-06-10cs.RO

AgniNav: Configuration-Driven Cross-Embodiment Local Planning for Robot Navigation

Tianhao Zang (1 and 2), Siwei Cheng (3), Haidong Huang (2), Shanze Wang (1), Wei Zhang (1) ((1) Eastern Institute of Technology, Ningbo, China, (2) University of Nottingham, Nottingham, UK, (3) University of Science and Technology of China, Hefei, China)

2026-06-10机器人规划控制

针对单目导航策略常与特定机体、相机高度和足迹绑定、跨轮式/足式/人形迁移需重训的问题,AgniNav用四参数碰撞安全包络统一感知与规划:高度条件化I2S预测1D伪激光,足迹参数配置局部规划器,并用RGB-D生成高度条件标签训练。实机在Turtlebot2、Go2、K1上分别达39/40、18/20、18/20成功,碰撞0、1、2次,Jetson Orin上30Hz运行。

MV-Actor: Aligning Multi-View Semantics and Spatial Awareness for Bimanual Manipulation Figure 1
2026-06-10cs.RO

MV-Actor: Aligning Multi-View Semantics and Spatial Awareness for Bimanual Manipulation

Yinchen Tian, Huan Li, Muyao Peng, Xi Wang, Yan Wang, You Yang

School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan, China, Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China, AIR Wuxi Innovation Center, Tsinghua University, Wuxi, China

2026-06-10机器人

针对双臂操作中多相机视角常被独立编码、语义难共享,而显式3D融合又依赖易退化深度的问题,MV-Actor将校准视角间的物理对应区域做语义交互,并引入前馈重建模型的空间token与深度修复,构建统一语义-空间表示。其在PerAct2上达到87.8%平均成功率,真实双臂实验中也优于RGB、RGB-D及显式3D基线。

Embodiment-conditioned Generalist Control for Multirotor Aerial Robots Figure 1
2026-06-10cs.RO

Embodiment-conditioned Generalist Control for Multirotor Aerial Robots

Orestis Konstantaropoulos, Welf Rehberg, Mihir Kulkarni, Kostas Alexis

Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU), Trondheim, Norway

2026-06-10机器人规划控制

多旋翼在更换电机/桨或采用非平面、非对称布局时常需重新调参,传统控制器也依赖几何假设。本文用质量与惯量归一化的控制分配矩阵作为具身描述,训练一个PPO位置控制策略在同一旋翼数的多种形态间共享权重。仿真中该策略能覆盖四/六旋翼的广泛形态,单卡约5分钟训练,并在三种差异明显的六旋翼实机上实现零样本迁移。

An Exposure-Time-Aligned Primary-Path Architecture for Autonomous-Driving ECUs Figure 1
2026-06-10cs.RO

An Exposure-Time-Aligned Primary-Path Architecture for Autonomous-Driving ECUs

Toru Saito, Yuki Hagura, Tatsuya Konishi, Satoru Mizusawa, Takumi Yajima

2026-06-10机器人

面向量产自动驾驶ECU在模块化多NN流水线向端到端迁移期间的算力、同步和安全约束,论文指出对等 late fusion 在多SoC上会放大跨芯片抖动且缺少渐进替换单元。其核心是选定Primary-Path、用主传感器曝光时间τexp驱动融合,并允许E2E路径同周期共跑。实测在双SoC AD-ECU上相机快门到规划输出平均296 ms,满足350 ms预算。

Gradient based Bilevel for Inverse Optimal Control, a Riemannian approach Figure 1
2026-06-10cs.RO

Gradient based Bilevel for Inverse Optimal Control, a Riemannian approach

Ahmed-Manaf Dahmani, Vincent Bonnet, David Daney, François Charpillet

2026-06-10规划控制优化算法

针对逆最优控制中传统双层优化需反复求解内层控制问题、投影式方法又易因约束资格条件失效而数值不稳的问题,论文将满足最优性条件的轨迹集合解释为黎曼流形,并提出 RIOC 在该流形上投影观测轨迹、保持可行性。真实人臂轨迹实验显示,其重建精度与双层 IOC 相当或更好,计算时间约降至四分之一。

GUIDE: Goal-Initialized Directional Understanding for End-to-End Visual Navigation Figure 1
2026-06-10cs.RO

GUIDE: Goal-Initialized Directional Understanding for End-to-End Visual Navigation

Liang Wang, Jin Jin, KanZhong Yao, YiBin Wu, Fangqiang Ding, Jin Wang, Jun Wu, Zhe Sun, Qiuguo Zhu

Institute of Cyber-Systems and Control, Zhejiang University, Institute of Artificial Intelligence (TeleAI), China Telecom, Oxford Robotics Institute, University of Oxford, Center for Robotics, University of Bonn, Department of Mechanical Engineering, Massachusetts Institute of Technology

2026-06-10机器人

针对腿式机器人视觉导航依赖持续目标更新、在局部可观测迷宫中易陷入死胡同的问题,GUIDE提出“仅初始化给目标”的端到端强化学习设定,通过多频本体感受历史训练空间锚点预测器来形成自运动与方向记忆,并结合原始深度流感知局部几何。仿真和四足机器人实测显示,其无需后续目标引导或先验地图即可穿越密集障碍和结构化迷宫,并具备零样本实机迁移能力。

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation Figure 1
2026-06-10cs.RO

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation

Jiawei Gao, Chaoqi Liu, Peilin Wu, Haonan Chen, Yilun Du

Harvard University, Stanford University

2026-06-10机器人规划控制

面向搬运重物、擦桌、书写等需持续接触力的操作任务,论文指出仅靠模仿策略输出位姿会把规划与物体动力学耦合,泛化差,而显式力控又依赖腕部力传感器。IMPACT用关节力矩和机械臂动力学在线估计外力,学习内部模型预测慢变载荷/接触力,并以前馈补偿接入阻抗控制。仿真和Franka实机结果显示,其在未知重量、外扰补偿和混合位置-力任务中成功率、轨迹稳定性、安全性与能耗均优于隐式力控和数据增强基线。

Bridging Semantics and Physical Execution: A Neuro-Symbolic Framework for Multi-Pair Robotic Assembly Figure 1
2026-06-10cs.RO

Bridging Semantics and Physical Execution: A Neuro-Symbolic Framework for Multi-Pair Robotic Assembly

Xinyi Li, Aiguo Song, Linhu Wei, Huijun Li

2026-06-10机器人

面向非结构化环境中的多零件装配,论文针对LLM规划易幻觉、符号规划难扩展以及接触执行缺乏闭环的问题,提出从RGB-D语义量化到局部子图生成、JS散度触发辅助动作、全局拓扑协调与动态行为树力控执行的神经符号框架。其核心在于把常规装配逻辑与遮挡、占位、姿态等边界情形解耦。100个真实场景离线可执行率达97%,UR3实机在0.5 mm公差和强干扰下成功率90%。

On-sky demonstration of reinforcement learning for adaptive optics control Figure 1
2026-06-10astro-ph.IM

On-sky demonstration of reinforcement learning for adaptive optics control

Jalo Nousiainen, Vincent Chambouleyron, Benoit Neichel, Sylvain Cetre, Jean-Francois Sauvage, Angelie Alagao, Markus Kasper, Jonathan Dray, Romain Fetick, Byron Engler

Aix Marseille University, CNRS, CNES, LAM, Marseille, France, control. In simulations and laboratory experiments, they have demonstrated robustness to real-world effects such as photon and, ing (RL)– based approaches (bypassing the need for labeled, results across various numerical simulations and lab tests (Nou-

2026-06-10强化学习模仿学习规划控制

传统单共轭自适应光学常用积分控制,易受时延、配准误差、振动和噪声限制;本文将强化学习控制器 PO4AO 首次部署到 OHP 1.52 m 望远镜 Papyrus 系统上,以端到端策略优化同时处理预测控制、重建与振动抑制。多夜实测中,PO4AO 在不同亮度和大气条件下均优于标准积分器,并能用同一组超参数运行;但当前 Python 实现仍带来约 720 µs 额外延迟、抖动和掉帧,说明工程优化仍是落地关键。

ros2probe: Non-intrusive, Kernel-selective Observability for Robot Operating System 2 Middleware Figure 1
2026-06-10cs.RO

ros2probe: Non-intrusive, Kernel-selective Observability for Robot Operating System 2 Middleware

Jisang Yu, Sanghoon Lee, Yeonwoo Choi, Kyung-Joon Park

2026-06-10机器人

论文针对 ROS 2 观测工具必须加入 DDS 域而引入“探针效应”的问题:观测本身会增加发现流量、资源开销并扭曲丢包结果。ros2probe 的关键思路是在域外被动解析 RTPS 发现包重建 ROS 2 语义状态,并用内核过滤只上送目标话题数据。实验覆盖多平台、DDS 与机器人负载,发现图扰动低于 0.5%,避免饱和时最高 38.5% 的订阅端丢包,CPU/内存最高降至约 1/7 和 1/28。

Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization Figure 1
2026-06-10cs.RO

Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization

Yitian Shi, Di Wen, Zhengqi Han, Zicheng Guo, Yu Hu, Edgar Welte, Kunyu Peng, Rainer Stiefelhagen, Rania Rayyes

Karlsruhe Institute of Technology (KIT)

2026-06-10机器人视觉感知强化学习模仿学习规划控制

针对从人类视频学习操作时接触阶段噪声大、物体开放集且人机形态不一致的问题,论文提出 HOWTransfer:以手为中心重建3D腕/手轨迹,通过无需类别先验的接触定位找出可迁移交互片段,再将人类抓取意图映射为平行夹爪多模态抓取并编辑轨迹。实验显示其在多类任务中实现约86%成功率,盲评中生成轨迹优于遥操作轨迹。

Pushing the Performance Limits in Autonomous Racing: Continuous Stability-Aware Adaptive Velocity Planning in Formula Student Driverless Figure 1
2026-06-10cs.RO

Pushing the Performance Limits in Autonomous Racing: Continuous Stability-Aware Adaptive Velocity Planning in Formula Student Driverless

Tamara Bergerhoff, Sebastian Baader, Pascal Meißner, Frank Deinzer

*This work was supported by Mainfranken Racing e.V.All authors are with the Center for Artificial Intelligence and Robotics (CAIRO)

2026-06-10强化学习规划控制

面向 Formula Student Driverless 中高速、窄赛道和环境变化导致的速度规划瓶颈,论文提出不直接估计物理胎路摩擦系数,而由侧偏、滑移、路径/状态误差等稳定性指标迭代推断连续 scaling factor,并生成沿赛道的摩擦映射,再结合 GG 图与 Forward-Backward Solver 更新目标速度。在真实 FS 赛车 10 圈测试中,相比非自适应方法单圈时间最高改善 35%,平均提升约 8%,增益可能主要来自 scaling / data 的逐圈自适应。

Vehicle Prediction Model for Enhanced MPC Path Tracking in Formula Student Driverless Figure 1
2026-06-10cs.RO

Vehicle Prediction Model for Enhanced MPC Path Tracking in Formula Student Driverless

Sebastian Baader, Tamara Bergerhoff, Pascal Meißner, Frank Deinzer

∗ This work was supported by Mainfranken Racing e.V.All authors are with the Center for Artificial Intelligence and Robotics (CAIRO)

2026-06-10视觉感知强化学习规划控制

面向 Formula Student 无人赛车高速窄赛道中车辆强非线性导致 MPC 跟踪依赖模型精度的问题,论文提出三段式预测模型:运动学自行车名义模型、利用历史跑圈残差的离线 BLR,以及适配当前路面/天气的在线 SGPR,在保持实时性和不确定性估计的同时融合先验与数据。实车 MPC 验证中,预测精度较现有方法最高提升约 57%。

Self-Supervised Relevance Modelling in Autonomous Driving via Counterfactual Analysis Figure 1
2026-06-10cs.RO

Self-Supervised Relevance Modelling in Autonomous Driving via Counterfactual Analysis

Luca Lusvarghi, Javier Gozalvez, Pablo Urbano Hidalgo

Networked Systems Lab, Universidad Miguel Hernandez de Elche, Elche, Spain., efficient usage of available computational resources, reduces, labelled as important if it could potentially influence the ego-, annotated datasets are poorly scalable due to their high cost, significantly more scalable with respect to state-of-the-art, latency and enables scalable real-time relevance estimation, randomly sampled and represents the center of its coordinates, pedestrian, truck, etc.). Position and heading refer to the center

2026-06-10机器人

面向自动驾驶感知管线算力高、场景中大量目标并非都影响决策的问题,本文用反事实分析自监督生成因果数据集,将目标相关性定义为其对规划轨迹的连续影响,而非人工标注的二分类重要性,并通过“添加目标”减少混杂。基于 SUMO/Autoware 的城市场景实验显示,模型可在单 CPU 毫秒级估计相关性,适用于高密度实时场景,并能生成相关性热图辅助感知与规划。

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data Figure 1
2026-06-10cs.RO

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data

Dong Fang, Youjun Wu, Yuanxin Zhong, Rui Zhang, Yunlong Wang, Xiaosong Jia, Yu-Gang Jiang

Fudan University, Hefei University of Technology, Beijing University of Posts and Telecommunications

2026-06-10机器人

针对灵巧手因关节定义、自由度和控制约定不同而难以共享真实数据的问题,论文提出UDHM将人手与多种机器人手映射到统一22-DoF语义接口,并用UniDexTok在真实标准化关节状态上学习跨本体离散token,避免依赖重定向或仿真。实验中相较UniHM,MPJAE从15.63°降至0.16°、MPJPE从18.51mm降至0.18mm,并显示跨本体数据可提升重建及零/少样本适配能力。

Planar-Sector LOS Guidance for Interception of Agile Targets with Lifting-Wing Quadcopters Figure 1
2026-06-10cs.RO

Planar-Sector LOS Guidance for Interception of Agile Targets with Lifting-Wing Quadcopters

Linkai Liu, Kun Yang, Han Zou, Chen Min, Shuli Lv, Shuai Wang, Quan Quan

2026-06-10机器人

针对传统四旋翼视觉拦截在高速机动目标前受视场锥约束、机动余度和航程不足的问题,论文将拦截器换为升力翼四旋翼,并提出沿相机对称面放宽的平面扇区 LOS 约束,配合含协调转弯补偿的双层控制和延迟补偿 EKF。户外实验在不规则机动和 2–5 级风下实现最远 138 m 拦截,静态/动态成功率分别为 90% 和 71%。

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations Figure 1
2026-06-10cs.RO

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

Recently, robotic foundation models choose to mine the vast pool of human videos available on-, line [11, 12, 13, 14] as a scalable substitute for robot data. They learn visual or reward representations, or pretrain Vision-Language-Action (VLA) models on hand-action labels distilled from egocentric, available at internet scale.

2026-06-10强化学习模仿学习

面向灵巧手操作中机器人示教昂贵、人体视频到机器人存在 embodiment gap 的问题,论文提出 Dexterous Point Policy:用手腕与五指尖的统一 3D 关键点同时表示观测和动作,并加入指尖接触预测补足力信息,在约 100 万人类第一视角视频预训练后仅用少量任务人体演示微调。真实双臂灵巧手任务中无需任何机器人示教达到 75.0% 成功率,显著高于 VLA 基线 1.0%,接触预测和视频规模化预训练分别带来主要增益。

LieIPM: Lie Group Interior Point Method for Direct Trajectory Optimization of Rigid Bodies Figure 1
2026-06-10cs.RO

LieIPM: Lie Group Interior Point Method for Direct Trajectory Optimization of Rigid Bodies

Sangli Teng, Ruiqi Zhang, Tzu-Yuan Lin, William A Clark, Mark Mueller, Ram Vasudevan, Maani Ghaffari, Koushil Sreenath

2026-06-10规划控制优化算法

针对刚体直接轨迹优化中欧氏参数化易引入旋转奇异、四元数双覆盖和病态约束的问题,LieIPM 将动力学与约束直接建模在矩阵李群上,结合李群变分积分器、闭式一二阶内蕴导数和线搜索内点法做牛顿更新。文中称导数与牛顿步对时域和自由度呈线性复杂度,在仿真和真实任务中较通用求解器及已有结构化方法更稳健、收敛更快,部分任务达到数量级加速。

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness Figure 1
2026-06-10cs.RO

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Shanghai Jiao Tong University, Huawei Technologies Ltd

2026-06-10机器人视觉感知

本文针对零样本连续视觉语言导航中过度依赖训练式 waypoint 预测器、深度信息利用隐式且历史上下文冗余的问题,提出 AgenticNav,将导航重构为 VLM 与环境之间的工具调用框架:模型可直接选择 RGB 像素作为目标,按需查询像素级度量深度,并通过紧凑轨迹图选择性召回历史视图。R2R-CE 上在相同 VLM backbone 下取得零样本 SOTA,GPT-5.5 版本达 55% SR、48.41% SPL,并有真实场景验证与消融支持各工具带来增益。

VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models Figure 1
2026-06-10cs.RO

VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models

Guiyu Zhao, Longteng Guo, Junyou Zhu, Jun Fu, Yanghong Mei, Bin Cao, Jie Jiang, Xingjian He, Jing Liu

Institute of Automation, Chinese Academy of Sciences, Beijing, China, University of Chinese Academy of Sciences, Beijing, China

2026-06-10视觉语言视觉感知

论文针对VLA机器人操作在测试时一次性预测易因细微位姿误差导致抓取失败、碰撞或任务偏离的问题,提出即插即用的VeriSpace验证器:先生成多个候选动作,再用融合视觉语义与显式3D几何的双路径场景编码,以及面向空间关系、几何可行性和目标进展的推理来选动作。实验显示其在公共基准和真实机器人任务中均提升决策可靠性,如SIMPLER上使OpenVLA提高18个百分点,并优于既有验证方法。

Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults Figure 1
2026-06-10cs.RO

Uncovering Vulnerability of Vision-Language-Action Models under Joint-Level Physical Faults

Minsoo Jo, Taeju Kwon, Junha Chun, Youngjoon Jeong, Taesup Kim

Graduate School of Data Science, Seoul National University

2026-06-10视觉语言视觉感知

论文关注 VLA 机器人在真实部署中常被忽视的本体侧故障:关节锁死、行程受限或摩擦增大都会改变动作到运动的映射,使闭环执行偏离策略预期。作者指出这种脆弱性具有明显关节依赖性,且并非只由任务不可达造成;为此提出冻结基础 VLA 上的 J-PARC,通过近期关节动力学推断故障状态并做残差动作校准,在仿真和有限真实实验中提升故障下成功率,同时基本保持无故障表现。

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models Figure 1
2026-06-10cs.RO

Act on What You See: Unlocking Safe Social Navigation in Vision-Language-Action Models

Qingzi Wang (1), Xiyang Wu (1), Guangyao Shi (2), Dianwei Chen (1), Xianfeng Yang (1), Dinesh Manocha (1) ((1) University of Maryland, (2) University of Southern California)

University of Maryland, University of Southern California

2026-06-10机器人视觉语言视觉感知安全鲁棒

本文针对社交导航中 VLA 能“看懂”行人和风险却未转化为安全动作的问题,指出瓶颈在感知—行为对齐而非表征缺失。提出无需人工标注的 SALSA 后训练,通过人/物反事实场景打破显著性捷径,并用未来风险重标注训练提前避碰。在 SCAND 与实机中,近碰率降低 86.4%,反事实社交准确率由 53% 提升至 93%,行人间距提升 76%。

GuideWalk: Learning Unified Autonomous Navigation and Locomotion for Humanoid Robots across Versatile Terrains Figure 1
2026-06-10cs.RO

GuideWalk: Learning Unified Autonomous Navigation and Locomotion for Humanoid Robots across Versatile Terrains

Haoxuan Han, Chen Chen, Linao Gong, Xin Yang, Hao Hu, Junhong Guo, Zhicheng He, Yao Su, Fenghua He

Harbin Institute of Technology

2026-06-10机器人

本文针对人形机器人在复杂地形中需同时避障与保持动态稳定的难题,提出 GuideWalk:用 DWA 导航引导与预训练地形自适应运动教师组成复合教师,经 DAgger 蒸馏到单一端到端策略,再用带行为克隆辅助项的 PPO 微调。仿真与实机实验显示其能在楼梯、斜坡、窄梁和杂乱障碍中实现较稳定的导航与行走,但局部速度引导在死胡同等全局规划场景仍受限。

Information-Preserving Continuous Occupancy Mapping with Variance-Weighted Submap Joining Figure 1
2026-06-10cs.RO

Information-Preserving Continuous Occupancy Mapping with Variance-Weighted Submap Joining

Zhuhua Bai, Yingyu Wang, Liang Zhao, Shoudong Huang

2026-06-10机器人

针对大规模 SLAM 中离散占据栅格子图拼接梯度不光滑、缺少不确定性加权且连续方法难以可靠闭式推断的问题,论文将原始观测压缩为信息保持的 log-odds 充分统计量,用异方差 RVM 在潜空间获得闭式均值与方差,并据此做方差加权的连续子图位姿与全局地图联合优化。2D 仿真和大规模实测显示,其位姿精度、全局一致性、表示紧凑性和不确定性校准均优于栅格拼接及已有连续占据基线。

UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data Figure 1
2026-06-10cs.RO

UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data

Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin Wang, Chao Yu, Yan Ding

2026-06-10机器人强化学习数据集/基准

针对现有真实机器人评测未覆盖 UMI 数据到部署闭环、导致不同硬件与重置流程下难以公平比较的问题,UMI-Bench 1.0 将示教采集、场景重置、策略执行、日志打包、评分与任务因素分析统一成可复现实机协议。首版包含 10 个桌面操作任务、约 2 万条示教和每任务 50 个评测 episode,用于诊断 seen/unseen 条件下的成功率、进度与子目标表现;文中主要结果是基准与流程发布,未充分说明带来具体策略性能增益。

Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies Figure 1
2026-06-10cs.RO

Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies

Zi Yin, Peilin Chai, Siyuan Huang, Zhanhao Hu

Tsinghua University, Johns Hopkins University

2026-06-10机器人生成模型

针对视觉条件扩散机器人策略易被输入扰动操控的问题,本文将风险从“让机器人失败”推进到测试时接管:TAKO 通过离线优化少量通用对抗贴片,把贴片切换变成可组合的动作原语接口,利用视觉偏置在扩散推理中持续影响动作生成。实验覆盖2D操作、无人机投递、仿真与真实地面导航,以及不同视觉编码器和DDPM/DDIM/flow matching,人类操作者在所有评测设置中实现100%接管成功,而目标策略匹配基线失败。

No Figure
2026-06-10cs.RO

A Practical Recipe Towards Improving Sim-and-Real Correlation for VLA Evaluation

Shuo Wang, Hanyuan Xu, Yingdong Hu, Fanqi Lin, Yang Gao

Tsinghua University, Shanghai Qi Zhi Institute

2026-06-10数据集/基准

针对真实机器人评测成本高、仿真基准未必能替代真实结论的问题,论文不再提出新模拟器,而是从 sim-and-real correlation 统一比较多平台、五个 VLA 策略及视觉、布局、语言、行为扰动。核心洞察是可靠仿真不仅要视觉/物理逼真,还要复现真实世界中的策略排序、性能相关性和失败模式;实验显示适量仿真微调可提升相关性,但过量微调会掩盖分布外泛化能力。

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation Figure 1
2026-06-10cs.RO

HiMem-WAM: Hierarchical Memory-Gated World Action Models for Robotic Manipulation

Xiaoquan Sun, Ruijian Zhang, Chen Cao, Yihan Sun, Jiahui Chen, Zetian Xu, Bo Chen, Haijier Chen, Zhen Yang, Jiarun Zhu, Yijun Hong, JingZhe Xu, Jingrui Pang, Mingqi Yuan, Jiayu Chen

The University of Hong Kong, Huazhong University of Science and Technology, Tsinghua University, Wuhan University, Southern University of Science and Technology

2026-06-10机器人强化学习

面向长时程机器人操作中现有 WAM 难以保留任务相关历史、对部署扰动仍不稳的问题,HiMem-WAM 将低层运动潜变量组织为高层技能潜变量,并在预测到技能边界时用门控记忆稀疏写入任务状态,从而保持因果推理而无需测试时生成未来视频。实验在 LIBERO 达 97.7%、零样本 LIBERO-PLUS 达 76.0%、RMBench 达 26.3%,真实任务较 π0.5 平均提升 22.5%。

Rethinking Embodied Navigation via Relational Inductive Bias Figure 1
2026-06-10cs.RO

Rethinking Embodied Navigation via Relational Inductive Bias

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

2026-06-10机器人

本文针对 ObjectNav 中开放词汇感知易受误检、相似干扰物和失败探索污染地图的问题,提出 DB-Nav:把目标相关物体关系拆成“激活”共现线索与“抑制”混淆/验证失败线索,并在探索图中动态调制 frontier 价值。实验称其在标准 ObjectNav 基准上提升 SR 与 SPL,且无需在线 VLM 推理,增益主要来自对不可靠语义证据的显式抑制。

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control Figure 1
2026-06-10cs.RO

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

Tsinghua University, Project Page: https://tsinghua-mars-lab.github.io/OMG/

2026-06-10机器人规划控制

本文针对现有人形机器人控制依赖少量技能奖励设计、运动跟踪又难以承接多模态意图的问题,提出“生成大脑+跟踪小脑”的 OMG 框架:用 1000+ 小时 OMG-Data 统一到 Unitree G1 运动空间,并以扩散 Transformer 从语言、音频和人体参考生成可执行全身轨迹。实验显示其在运动质量、物理可执行性、模型 scaling、少样本适配和零样本组合控制上表现较强,增益可能主要来自数据规模与统一生成骨干。

Baseline-Free Policy Optimization for Neural Combinatorial Optimization Figure 1
2026-06-10cs.LG

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

Carlos S. Sepúlveda, Gonzalo A. Ruz

2026-06-10强化学习优化算法

本文针对神经组合优化中 REINFORCE/POMO 依赖 rollout baseline 的脆弱性,指出困难实例上劣质基线会放大梯度噪声并导致训练崩溃。作者将 LLM 对齐中的 GRPO 引入 TSP/CVRP,通过组内采样轨迹的相对归一化优势取代外部基线。实验显示 GRPO 避免了 TSP-100 上 REINFORCE 从低成本迅速退化的现象,在匹配梯度更新时解质量距 POMO 约 2% 内,但 P3O 在 CVRP 上波动较大。

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation Figure 1
2026-06-10cs.RO

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

Stanford University, 2 UC Berkeley, 3 Shanghai Jiao Tong University 4 xdof.ai

2026-06-10机器人强化学习

针对长时程机器人操作中 VLA 微调依赖昂贵示范、稀疏奖励难以驱动在线自改进的问题,SARM2 将可跨任务的动作原语阶段估计器与多门控 MoE 价值头结合,提供细粒度逐步奖励,并用 SPIRAL 将自主 rollout 转化为策略改进信号。10 任务评测中其价值估计 MSE 较最强基线降约 80%,在叠短裤和擦白板任务上成功率分别提升到 100% 和 90%。

Improved Representation of Matrix Lie Group Operations through Tensor Notation Figure 1
2026-06-10cs.RO

Improved Representation of Matrix Lie Group Operations through Tensor Notation

Clark Taylor

Air Force Institute of Technology

2026-06-10机器人

面向机器人状态估计中旋转/位姿在矩阵李群上求导难以表达、向量化雅可比易掩盖结构的问题,论文提出用张量与爱因斯坦求和记号统一表示矩阵李群操作和导数,并定义张量投影以简化 Log 等求导。作者在两个 SO3 高斯牛顿估计示例中展示该记号可直接构造残差雅可比并得到接近真值的旋转估计,但结果主要是表示法演示,缺少系统定量对比。

MARCH: Model-Assisted Reinforcement Learning for the Perceptive Control of Humanoids over Sparse Footholds Figure 1
2026-06-10cs.RO

MARCH: Model-Assisted Reinforcement Learning for the Perceptive Control of Humanoids over Sparse Footholds

Codrin Crismariu, Ryan K. Cosner

Department of Mechanical Engineering, Tufts University

2026-06-10机器人强化学习规划控制

针对人形机器人在稀疏踏脚石且带横向约束场景中,纯模型方法难抗感知与动力学误差、纯无模型强化学习又样本低效且动作不精确的问题,MARCH用简化模型先生成安全参考轨迹,再以CLF奖励训练特权教师,并蒸馏为基于深度视觉的学生策略,结合滚动足步规划、Transformer与MDN处理多步落脚选择。仿真显示其样本效率更高、力矩和角加加速度更低,硬件上Unitree G1可跨越可变间距踏脚石,但实机重复性仍受相机延迟与精度限制。

Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction Figure 1
2026-06-10cs.RO

Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction

Dongjun Lee, Juheon Choi, Dong Kyu Shin, Sinjae Kang, Kimin Lee

Seoul National University

2026-06-10机器人

这篇论文针对仅靠语言指令难以表达真实意图的问题,提出 EDITH:用智能眼镜实时采集第一视角、 gaze 与语音,并由高层 VLM 将短暂的凝视/指向等非语言线索转成“细粒度指令+关键帧”子任务,再交给低层 VLA 执行。真实人机交互任务中,语言基线平均成功率低于 6.5%,EDITH 达到 59.7%,且显著降低用户表达负担。

Locomotion analysis of a quadruped interacting with the lunar granular surface Figure 1
2026-06-10cs.RO

Locomotion analysis of a quadruped interacting with the lunar granular surface

Yash J Vyas

2026-06-10机器人

面向月球坑洞等任务,四足机器人需在低重力、能量受限且月壤颗粒软接触条件下稳定行走。本文将颗粒介质足地 terradynamic 模型接入强化学习仿真,对比刚性接触与月壤软接触策略,指出软接触会改变步态、降低速度跟踪并增加力矩与总体能耗,说明月壤建模对腿足形态、电机选型和控制协同设计是必要的。

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents Figure 1
2026-06-10cs.RO

What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents

Jiaheng Hu, Mohit Shridhar, Caden Lu, Dhruv Shah, Hao-Tien Lewis Chiang, Jie Tan, Annie Xie

2026-06-10机器人

针对单体 VLA 难以处理长时程、组合与语义推理操作的问题,本文把分层 VLA 统一到 options 式控制框架中,系统拆解高层 VLM、低层 VLA、终止条件、记忆与观测表示等设计因素。实验覆盖仿真与真实 ALOHA,显示朴素层级虽有提升,但真正的增益来自具推理能力的规划器、可控的执行器及合适接口协同,尤其在长时程和推理任务上优于平铺 VLA。

YUBI: Yielding Universal Bidigital Interface for Bimanual Dexterous Manipulation at Scale Figure 1
2026-06-10cs.RO

YUBI: Yielding Universal Bidigital Interface for Bimanual Dexterous Manipulation at Scale

Takehiko Ohkawa, Jumpei Arima, Yuki Noguchi, Masatoshi Tateno, Makoto Sugiura, Takuya Okubo, Kengo Ikeuchi, Yuma Shin, Hiroki Nishizawa, Naoaki Kanazawa, Yuki Wakayama, Daiki Fukunaga, Koshi Makihara, Tomohiro Motoda, Floris Erich, Yukiyasu Domae, Tatsuya Matsushima, Yohishiro Okumatsu, Kei Ota

2026-06-10机器人

论文针对开放社区缺少大规模高质量双手灵巧操作数据、现有 UMI 设备笨重且精细控制受限的问题,提出指尖对齐的轻量 YUBI 夹爪与固定/移动式 VR 跟踪采集系统,通过自然捏合降低人体—夹爪错位。作者收集 8434 小时、120 万片段、119 任务数据;用户实验显示其在小物体操作和效率上优于 UMI,并训练单一 VLA 策略迁移到 UR、Franka 和 Toyota ELEY 三类双臂平台。

What Demonstration Curation Metrics Do to Your Policy Figure 1
2026-06-10cs.RO

What Demonstration Curation Metrics Do to Your Policy

Aarav Bedi

Department of Mechanical Engineering, University of California, Berkeley

2026-06-10强化学习模仿学习

针对模仿学习中示范数据常需筛除缺陷轨迹的问题,本文在 LIBERO 抓取放置任务中控制注入“过早松爪”结构性缺陷,比较7种筛选指标的缺陷检测AUROC与下游BC策略表现。核心洞察是二者显著脱钩:最高AUROC指标只带来13.3%成功率,而较低AUROC的轨迹对齐可达90.0%,接近93.3%干净数据上限;同时指出回合长度会虚高检测结果,评估应以训练出的策略为准。

SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration Figure 1
2026-06-10cs.LG

SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration

Kaustubh Mani, Yann Pequignot, Vincent Mai, Liam Paull

Mila - Québec AI Institute

2026-06-10强化学习优化算法安全鲁棒

针对安全关键场景中强化学习早期探索易进入高认知不确定区域、导致灾难性动作的问题,SHAPO将策略对参数扰动的敏感性视为actor不确定性的可优化代理,在Fisher/KL几何下于扰动参数处计算梯度,使更新对罕见不安全动作更保守、对已安全动作降权。实验显示其在Safety-Gym和MuJoCo连续控制任务中较多种on-policy安全RL基线同时降低累计失败与尾部代价,并扩展安全-性能Pareto前沿。

Exploration of Foundation Model-Based Robots in Patient and Elderly Care Figure 1
2026-06-10cs.RO

Exploration of Foundation Model-Based Robots in Patient and Elderly Care

Zhiwen Qiu, Wei Liu, Yuexing Hao

Cornell University, Ithaca, 14850, USA

2026-06-10机器人强化学习

面对老龄化与护理人力紧张,本文梳理基础模型机器人在患者和老年照护中的落地状态。核心洞察是,现有系统多把 LLM/VLM 作为语音对话与推理层,用于陪伴、训练、筛查和流程协调,而非真正具备多模态闭环物理自主。已有评估显示可提升可用性、参与度和认知互动,但幻觉、对话中断等可靠性问题仍常见,临床或照护结局证据有限。

Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs Figure 1
2026-06-10cs.RO

Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs

Jonathan C. Kao, Jason Chan, Andy Wang

Departments of Electrical and Computer Engineering, University of California, Los Angeles, Department of Computer Science

2026-06-10视觉语言视觉感知生成模型规划控制

针对VLA在执行中易受语言理解、泛化和OOD漂移影响且现有纠偏接口要么低频粗糙、要么高带宽并需再训练的问题,论文提出Flow Control:把键盘等低维实时输入作为流匹配动作专家的初始条件注入冻结VLA,使其将粗略意图转化为符合专家动作分布的高自由度动作。实验含16人用户研究,显示可提升零样本π0.5-DROID任务成功率与完成速度,并且用这些轨迹微调还能改善自主策略。

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination Figure 1
2026-06-10cs.RO

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

The University of Hong Kong, State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Institute of Automation, Chinese Academy of Sciences, Nanjing University

2026-06-10强化学习

针对现有世界-动作模型为追求逼真未来视频而推理过慢、难以实时部署的问题,Efficient-WAM提出“面向动作的低成本未来想象”:从WAN-2.2-5B迁移并结构化剪枝视频专家,使用稀疏视频latent和视频少步、动作多步的非对称去噪,把未来预测作为控制引导而非图像生成目标。在RoboTwin 2.0和真实操作中,1B模型以粗糙预测保持较强成功率,并将物理部署每chunk延迟降至约98–100 ms,较既有WAM约30倍加速。

Robotic Nonprehensile Object Transportation with a Hanging Tray Figure 1
2026-06-10cs.RO

Robotic Nonprehensile Object Transportation with a Hanging Tray

Adam Heins, Angela P. Schoellig

2026-06-10机器人

针对机器人“服务员问题”中托盘物体易滑动、液体易晃洒且传统方案依赖可倾斜机械臂的问题,本文将托盘用绳索悬挂在末端,使其真实呈三维摆运动,从物理上降低剪切力,并仅控制3自由度移动底盘,抵达后用含积分项的LQR抑制摆动。仿真和实机实验表明,相比刚性静态托盘,该设计显著减少滑移与晃液,并被集成到基于举手识别和视觉伺服的交互式机器人送餐演示中。

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation Figure 1
2026-06-10cs.RO

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation

Sriram Krishna, Ben Eisner, Haotian Zhan, Ying Yuan, Haoyu Zhen, Chuang Gan, Shubham Tulsiani, David Held

2026-06-10机器人

针对机器人模仿学习依赖大量遥操作数据且难以泛化的问题,GHOST将操作分解为高层3D末端子目标预测与低层目标条件控制,并用投影热图把3D目标接入图像策略;子目标近似跨 embodiment,使人类视频可只监督高层而无需动作重定向。实验显示,相比平坦Diffusion Policy,层级结构提升分布内成功率,并能用少量人类示范适应新物体、类别和任务组合。

Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization Figure 1
2026-06-10cs.CV

Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization

Ray Zhang, Marcus Greiff, Thomas Lew, John Subosits

when other sensors such as GPS are unavailable or unre-, *1Website: https://github.com/ToyotaResearchInstitute/, †2All authors are with Toyota Research Institute, 4440 El Camino Real, color and pixel labels through the functional representa-, pixel labels. RKHS-BA [66] extends frame-to-frame reg-

2026-06-10优化算法三维

针对ICP等依赖对应关系的方法在特征稀疏、噪声环境中易失效,以及既有RKHS无对应配准速度偏慢且未利用局部几何的问题,本文提出G-CVO:用逐点各向异性核在RKHS中编码表面结构,并以二阶黎曼Gauss-Newton在SE(3)上优化。实验显示其在KITTI、特征稀疏赛车数据和ETH RGB-D跟踪中更准更稳,较一阶RKHS求解最高提速10倍,在困难驾驶场景漂移降低超过55%。

Uncertainty-Aware Motion Planning for Autonomous Driving in Mixed Traffic Environment Figure 1
2026-06-10cs.RO

Uncertainty-Aware Motion Planning for Autonomous Driving in Mixed Traffic Environment

Ming Cheng, Hao Chen, Ziyi Yang, Ziluowen Luo, Senzhang Wang

Central South University, City University of Macau

2026-06-10规划控制安全鲁棒

面向自动车与人驾车混行场景,论文指出现有强化学习规划常把人类驾驶意图预测当作确定状态,易在感知噪声和行为多样性下产生危险决策。UAMP用邻近感知的不确定性估计构造联合意图分布,并通过UCVL校准价值学习偏差,使策略在高不确定交互中更保守。多车道实验显示其提升安全性和乘坐舒适性,同时基本保持通行效率。

Co-GLANCE: Uncertainty-Aware Active Perception for Heterogeneous Robot Teaming Figure 1
2026-06-10cs.LG

Co-GLANCE: Uncertainty-Aware Active Perception for Heterogeneous Robot Teaming

Michal P. Podolinsky, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Christian Ellis, Ufuk Topcu

The University of Texas at Austin

2026-06-10机器人安全鲁棒

面向野外空地异构机器人中遮挡导致的视角依赖感知不确定性,Co-GLANCE将VLM的遮挡推理与机器人分配能力蒸馏到轻量端侧模型,并用保形预测结合选择性拒答给分割、分配和检测提供校准不确定性,从而触发主动换视角观测。实测中其遮挡分割和机器人分配准确率较云端VLM基线分别提升25%和36%,单帧延迟降低约350倍,并发布空地协同数据集。

Equanimity in HRI: Applying Calm Technology Principles to Human-Robot Interaction Figure 1
2026-06-10cs.HC

Equanimity in HRI: Applying Calm Technology Principles to Human-Robot Interaction

Barbara Sienkiewicz, Bipin Indurkhya

2026-06-10机器人

面对家庭中设备通知与交互过载带来的注意力消耗和焦虑,本文将 Calm Technology 引入人机交互,主张家用辅助机器人应以“平静/均衡”为设计目标。核心洞察是把低打扰、环境化提示、透明状态与意图表达、用户自主性等原则转化为机器人设计指南。主要结果是形成面向家庭机器人的原则与示例,并讨论可用问卷和分项实验验证,但文中未充分说明系统实现或实证效果。

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation Figure 1
2026-06-10cs.CV

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

2026-06-10机器人视觉语言视觉感知安全鲁棒

VLA 机器人策略的实时闭环控制受视觉 token 计算开销限制,而仅依赖浅层注意力的剪枝容易误删深层推理所需信息。SAFE-Pruner 利用连续操作中的语义注意力一致性,用历史帧深层注意力预测当前帧后续重要 token,并通过自适应子任务划分处理注意力突变。论文在多种 VLA 架构、仿真与真实场景中报告最高 1.89× 加速,成功率下降低于 1.7%,较现有剪枝方法最高提升 1.9%。

2026-06-09

117 篇
MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models Figure 1
2026-06-09cs.RO

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

2026-06-09视觉语言视觉感知

本文针对现有 VLA 多依赖当前观测、难以处理长程时序依赖的问题,提出 MemoryVLA++:用感知-认知记忆库存储并压缩历史细节与语义,再借助世界模型在潜空间“想象”未来状态,融合过去、现在与未来来驱动扩散动作头。实验覆盖 5 个仿真基准和 3 类真实机器人任务,在 Libero、SimplerEnv 等上优于基线,真实机器人长程记忆/想象任务分别提升约 26% 和 28%。

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models Figure 1
2026-06-09cs.RO

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

Zhenyu Wu, Xiuwei Xu, Yukun Zhou, Yifan Li, Qiuping Deng, Xiaofeng Wang, Zheng Zhu, Bingyao Yu, Ziwei Wang, Jiwen Lu, Haibin Yan

Beijing University of Posts and Telecommunications, Tsinghua University, Nanyang Technological University

2026-06-09视觉感知强化学习

该文针对机器人世界模型用紧凑动作向量难以刻画厘米级接触差异、影响策略评估可靠性的问题,提出 iMaC:用 URDF 和正运动学把未来关节动作渲染成运动图像,并结合深度/点云构造两路接触几何图像,使视频生成显式受机器人姿态和场景交互约束;训练时还加入闭环 rollout 缓解长时误差。八个真实长程操作任务中,其生成评估分数与真实成功率呈强正相关,可用于比较策略 checkpoint。

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing Figure 1
2026-06-09cs.RO

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

Shanghai Jiao Tong University, Shanghai AI Laboratory, The University of Hong Kong

2026-06-09强化学习

本文针对现有世界-动作模型将视频预测与动作执行绑定在同一短时频率、导致世界分支浪费在冗余近帧变化上的问题,提出 AHA-WAM:用低频视频 DiT 作为带滚动 KV 记忆的长时域规划器,高频动作 DiT 通过分层注意力和 OVCR 按最新观测路由复用上下文,并用 offset 训练适配异步相位。其在 RoboTwin 达 92.80% 成功率、真实任务达 78.3%,闭环控制 24.17Hz,较 Fast-WAM 加速 4.59 倍。

SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps Figure 1
2026-06-09cs.RO

SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps

Yanming Shao, Zanxin Chen, Wenwei Lin, Mingjie Zhou, Tianxing Chen, Xiaokang Yang, Yichen Chi, Yao Mu

2026-06-09机器人

针对人手交互蕴含功能意图但直接迁移到灵巧手易受形态、接触和可达性约束而失效的问题,SynManDex将“人类预抓取”仅作为 affordance 感知提案,再用机器人本体的重定向、力闭合接触优化和执行检查落地。其在312个物体上获得86.4%稳定抓取、4.67/5类人评分,合成示教训练策略在仿真达80.7%成功率,真实36自由度双手平台25/30成功。

AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning Figure 1
2026-06-09cs.RO

AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning

Hong Li, Yue Xu, Yihan Tang, Yankang Dong, Chenyuan Liu, Chenyang Yu, Xuyang Li, Siyuan Huang, Yujun Shen, Nan Xue, Yong-Lu Li

Shanghai Jiao Tong University, 2 Ant Group, Shanghai Innovation Institute, Beijing Institute for General Artificial Intelligence (BIGAI), This work was done during an internship at Shanghai Jiao Tong University. Correspondence to: Yong-Lu

2026-06-09机器人视觉感知

面向接触丰富操作中力觉/触觉采集难、传感器装配昂贵且视觉触觉传感器易因制造和使用产生不一致的问题,论文提出臂戴式教学系统 AetheRock,集成低成本可维修 GelSlim-MiniFab、指部压力传感器和模块化 PCB,并设计 ForceVT 用视觉与力引导跨保真触觉表征学习。真实机器人实验显示其采集窗口长于 UMI、数据可用性高,且在触觉退化场景下提升策略鲁棒性。

Difference-Aware Retrieval Policies for Imitation Learning Figure 1
2026-06-09cs.RO

Difference-Aware Retrieval Policies for Imitation Learning

Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta

Paul G. Allen School of Computer Science & Engineering, University of Washington, Toyota Research Institute

2026-06-09模仿学习

针对行为克隆在部署中因误差累积进入分布外状态而高方差、易失稳的问题,论文提出 DARP:推理时检索专家数据中的 k 近邻,并结合邻居状态、动作及与查询状态的差分向量预测和聚合动作,相当于在局部图上隐式做拉普拉斯平滑。该方法不需额外交互或数据,在 MuJoCo、Robosuite、Robocasa 及视觉模仿任务中较标准 BC 提升约 15–46%。

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models Figure 1
2026-06-09cs.RO

Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models

Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh

University of California Los Angeles

2026-06-09视觉语言视觉感知安全鲁棒

这篇论文针对 VLA 机器人策略在动态场景中缺乏碰撞安全保证、而外部 VLM 场景理解过慢的问题,提出直接读取冻结 VLA 内部少数注意力头来在线识别当前目标,并将其余跟踪物体作为障碍输入 CBF-QP 安全滤波器,无需训练或重型辅助模型。在 SafeLIBERO 及其动态障碍扩展上,该方法静态场景接近特权状态 oracle,动态场景平均碰撞率较初始化式方法降低约 43%。

ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models Figure 1
2026-06-09cs.RO

ProbeAct: Probe-Guided Training-Free Failure Recovery in Vision-Language-Action Models

Fan Zhang, Seongbin Park, Baharan Mirzasoleiman, Shariar Talebi, Nader Sehatbakhsh

University of California Los Angeles

2026-06-09视觉语言视觉感知

论文针对VLA在光照、视角和初始状态扰动下易陷入“记忆化轨迹”、感知仍有效但动作头失配的问题,提出ProbeAct:从冻结模型隐藏状态探测3D物体位置,用无关物体类别的运动学状态机检测抓取/放置失败,并以分层CBF对动作作最小修正。LIBERO-plus上OpenVLA-OFT成功率由69.6%升至74.1%,但验证仍限于仿真。

Safe Polytope-in-Polytope Motion Planning and Control with Control Barrier Functions Figure 1
2026-06-09cs.RO

Safe Polytope-in-Polytope Motion Planning and Control with Control Barrier Functions

Alejandro Gonzalez-Garcia, Dries Dirckx, Jan Swevers, Wilm Decré

2026-06-09规划控制安全鲁棒

针对狭窄环境中点/圆形机器人近似过于保守、逐障碍物约束又随障碍数量膨胀的问题,论文将多边形机器人保持在实时生成的凸自由空间多面体内,并把该包含关系写成 MPC 中的离散 CBF 约束,约束规模主要随自由空间边界和机器人形状变化。实验在船舶仿真和非完整移动机器人硬件上验证 10 Hz 在线运行,相比多面体障碍物 CBF 随障碍增多最高约 91 倍加速,并能处理 LiDAR 与动态障碍。

Modeling Components and Connections in Cyber-Physical Systems Figure 1
2026-06-09cs.RO

Modeling Components and Connections in Cyber-Physical Systems

Kate Sanborn, Tanuj Kenchannavar, Vakul Nath, Jonathan Sprinkle

2026-06-09机器人

针对ROS启动文件虽能表达组件层级却难以呈现节点通信接口、且手写XML易出语法与配置错误的问题,论文提出基于WebGME的ROSLaunchVisual,将节点、发布/订阅、参数和重映射建模为可视化互联组件,并结合动态探测信息做静态设计分析。实验以真实启动文件评估导入导出、校验和通信映射等功能,表明该工具可降低配置错误、提升大型或协作机器人项目中的系统理解与启动文件维护效率。

Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot Dynamics Figure 1
2026-06-09cs.RO

Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot Dynamics

Rishabh Dev Yadav, Samaksh Ujjawal, Sihao Sun, Spandan Roy, Wei Pan

2026-06-09机器人

针对欧拉-拉格朗日机器人在载荷变化、未建模耦合和扰动下名义动力学失准、普通残差学习破坏机械结构的问题,本文将模型误差分解为惯量修正、诱导科氏项和广义力残差,并用稀疏历史潜变量与贝叶斯在线更新仅适配扰动敏感部分。多类移动、飞行和机械臂实验显示其提升动力学预测与轨迹跟踪,但具体增益在不同平台上的来源仍需结合完整实验细节判断。

ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies Figure 1
2026-06-09cs.RO

ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies

Haodi Hu, Chung-Ta Huang, Jing Liu, Ye Wang, Kei Suzuki, Matthew Brand, Toshiaki Koike-Akino

University of Southern California, USA, Mitsubishi Electric Research Laboratories (MERL), USA, Harvard University, USA

2026-06-09视觉语言视觉感知强化学习

针对VLA策略在误放、丢抓等离分布失败状态下脆弱且直接微调代价高、易遗忘的问题,ReCoVLA冻结基础VLA,用外部VLM识别失败类型与恢复阶段,并将其编译为带阶段门控的残差RL奖励,而非让VLM直接出动作。三类Fetch操作任务中,仿真平均成功率由36.7%升至66.7%,真实零样本迁移达61.7%,OOD测试也优于无恢复基线。

Motion planning for hundreds of floating robots Figure 1
2026-06-09cs.RO

Motion planning for hundreds of floating robots

Jan Kamm, Antonio Terpin, Raffaello D'Andrea, Aswin Ramachandran

2026-06-09机器人规划控制

面向水面大规模机器人编队表演,论文解决稀疏关键帧之间需在数秒内生成长时域、无碰撞且可跟踪轨迹的问题。核心做法是从初始轨迹构建时空碰撞图,将全局耦合约束分解为可并行求解的交互簇,并加入簇更新、循环依赖处理、QP 稀疏化和动态时间尺度等工程机制。方法在最高 500 机器人、1000 步仿真中显著快于单体 SCP,并已用于苏黎世湖 24 艘船和威尼斯双年展实物演示。

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience Figure 1
2026-06-09cs.RO

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience

Ruizhe Liao, Wenrui Chen, Liangji Zeng, Haoran Lin, Fan Yang, Kailun Yang, Yaonan Wang

Hunan University

2026-06-09强化学习

DexPIE针对灵巧手模仿学习在高维接触任务中易累积误差、依赖大量示教且长时程稀疏奖励难以改进的问题,利用真实部署经验做后训练。其关键在于灵巧手人类介入与多阶段DAgger扩展探索覆盖,用相对动作空间异步推理缩小示教-部署时序差,并以连续最优性指标进行细粒度策略提取。三项真实灵巧操作任务中,相比示教基线成功率提升37%,且优于对照方法。

Shape Formation for the Cooperative Transportation of Arbitrary Objects Using Multi-Agent Reinforcement Learning Figure 1
2026-06-09cs.RO

Shape Formation for the Cooperative Transportation of Arbitrary Objects Using Multi-Agent Reinforcement Learning

Mohamed Sayed, Wolfram Burgard, Tanja Katharina Kaiser

2026-06-09强化学习

针对多机器人托举任意形状物体时,真实物体几何不规则、质量分布不均使预设均匀队形难以安全承载的问题,论文将运输前的承重队形生成单独建模,采用CTDE框架下的多智能体PPO,让机器人依据局部载荷估计和物体足迹信息自主进入支撑区域并避障。仿真结果显示,该策略在杂乱环境、不同机器人数量和复杂非均匀物体上能形成较均衡队形,且接近MILP最优解。

CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control Figure 1
2026-06-09cs.RO

CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control

Jiacheng Li, Yize Guo, Jiabin Guo, Qingchen Liu, Jiahu Qin

AIRLab, Department of Automation, University of Science and Technology of China

2026-06-09视觉感知规划控制

CT-VAM针对VLA模型在低层闭环控制中反复处理语言导致延迟和算力开销的问题,主张将语言仅用于形成紧凑任务意图,再由本地视觉-动作策略执行。其核心是TARS分流条件注意力融合动作、视觉、本体和任务流,并用FCI支持异步动作块平滑衔接。68M参数模型在LIBERO平均成功率82.1%,优于非VLM基线,并展示Jetson Orin NX上的真实部署。

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications Figure 1
2026-06-09cs.RO

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications

Tao Li, Liang Liu, Jianli Han, Weimin Lv

\authormark 1College of Aerospace Science and Engineering, Naval Aviation University, Yantai 264000, China

2026-06-09优化算法三维

面向自动驾驶多相机相对位姿估计,论文针对传统 6 点/17 点方法在 RANSAC 中计算量高、匹配需求多的问题,利用车辆常见先验提出基于深度平移参数化与一阶旋转近似的统一框架,并给出已知竖直方向、已知转轴方向和地面平面运动下的 4 点/4 点/3 点最小求解器;在合成数据和 KITTI 上显示其假设生成更快,同时保持与现有方法接近的精度与鲁棒性。

Safe-RULE: Safe Reinforcement UnLEarning Figure 1
2026-06-09cs.LG

Safe-RULE: Safe Reinforcement UnLEarning

Shixiong Jiang, Taozheng Zhu, Fanxin Kong

Department of Computer Science and Engineering, University of Notre Dame

2026-06-09安全鲁棒

论文关注离线安全强化学习在机器人等安全关键场景中易受数据投毒影响的问题:静态数据中的恶意轨迹可能让“安全”策略部署时违反成本约束。Safe-RULE将机器遗忘引入离线Safe RL,在不重训、无需访问环境的前提下,显式区分需保留的干净数据与需遗忘的投毒数据,并在遗忘目标中同时约束任务回报和安全成本。Safety Gym实验显示该方法能降低投毒后的安全违规、提升防御效果,但摘要片段未充分说明相对各基线的具体数值增益。

Targeting World Models to Compromise Robot Learning Pipelines Figure 1
2026-06-09cs.RO

Targeting World Models to Compromise Robot Learning Pipelines

Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian

Northeastern University, University of Massachusetts Amherst

2026-06-09机器人强化学习

这篇论文关注世界模型被接入机器人数据生成、仿真和策略学习后带来的供应链风险:攻击者无需在原始遥操作数据中直接放入危险轨迹,而是注入在世界模型中才触发的视觉提示或转移动力学劫持。作者验证文本条件和动作条件世界模型均可被利用,能生成危险合成轨迹,并进一步在下游DRL策略中植入端到端后门;VLA场景仅为概念验证,现实流水线有效性文中未充分说明。

Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling Figure 1
2026-06-09cs.RO

Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling

Carlos Vélez García, Miguel Cazorla, Jorge Pomares

University of Alicante

2026-06-09机器人

论文指出离线目标条件机器人学习中,传统 HER 把未来完整状态当作目标,会让机器人姿态、速度等无关维度变成额外约束。GS-HER 的核心是把已达状态视为某个“目标集合”的证明,用二值查询指定哪些状态变量决定成功,从而在不改底层 GCRL 算法的情况下支持推理时切换目标语义。实验在 OGBench 与五类离线学习器上显示,尤其在存在干扰维度的操作任务中优于 full-state HER,且同一 checkpoint 可回答多种目标谓词。

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models Figure 1
2026-06-09cs.RO

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

2026-06-09视觉感知强化学习

该文针对机器人策略通常从观测直接输出动作、缺少对候选动作后果的显式检查这一问题,提出ω-EVA:先让策略生成动作块,再用动作条件潜在世界模型预测其未来特征,并由三分支refiner结合当前状态、想象未来和原动作修正输出,避免推理时生成视频。实验在LIBERO、LIBERO-PLUS与RoboTwin 2.0上相对Stage 2均有小幅提升,如LIBERO 97.9%到98.6%、RoboTwin 88.9%到90.3%,但各分支独立因果贡献仍在评估中。

Dense Force Estimation with an Event-based Optical Tactile Sensor Figure 1
2026-06-09cs.RO

Dense Force Estimation with an Event-based Optical Tactile Sensor

Agis Politis, René Zurbrügg, Valentina Cavinato

2026-06-09机器人

面向灵巧操作中高时空分辨率、密集力反馈的需求,本文针对传统视觉触觉受帧率、模糊和带宽限制的问题,提出首个基于事件式光学触觉的密集 3D 力场重建流程:用事件标记跟踪估计剪切位移,用 U-Net 从稀疏事件推断法向形变,再经 iFEM 转换为物理一致的力。实验在最高约 4/4/20 N 范围内达到 0.14/0.10/0.93 N 平均绝对误差,并以约 100 Hz 运行。

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer Figure 1
2026-06-09cs.RO

Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer

Sanghoon Lee, Jiyeong Chae, Kyung-Joon Park

Daegu Gyeongbuk Institute of Science and Technology (DGIST), Daegu Gyeongbuk Institute of Science and Technology (DGIST) Daegu Republic of Korea

2026-06-09机器人

本文关注学习策略、规划器和 VLA 模型进入机器人闭环后,同时扰动控制、计算调度与通信带宽,而现有 ROS 2 等中间件缺少统一治理层的问题。核心洞察是将机器人中间件重新定义为 Physical AI 的 harness,并提出 Projection、Isolation、Transfer 三类执行机制及 ROS 2 Harness Profile,用声明式约束输出区域、推理预算和运行工况。论文主要是架构性论证与开放方向,未给出系统实现或实验评估,实际开销与可靠性增益文中未充分说明。

Real-time body pose non-verbal communication with a consistency-based reliability measure Figure 1
2026-06-09cs.CV

Real-time body pose non-verbal communication with a consistency-based reliability measure

Alina Marcu, Dragos Costea, Cristina Lazar, Marius Leordeanu

2026-06-09三维

这篇论文面向救援、远距人机交互等无法依赖语音和人脸的场景,研究仅用2D全身姿态识别非语言沟通意图。作者发布含10类意图、15.7万真实帧的数据集,并在真实与合成数据上比较12种轻量模型,报告Orin Nano实时性能;核心洞察是自回归预测中的自一致性可作为无需标签的可靠性信号。结果显示其数据集识别均值约87%,合成集更易、IPC接近失效,且一致性随步数提升但在易混类别上仍会自信出错。

ReGIL: Retrieval-Guided Imitation Learning from a Single Demonstration Figure 1
2026-06-09cs.RO

ReGIL: Retrieval-Guided Imitation Learning from a Single Demonstration

Yuying Zhang, Francesco Verdoja, Wenyan Yang, Ville Kyrki

School of Electrical Engineering, Aalto University

2026-06-09模仿学习

针对单条示范下视觉操作容易因分布偏移和稀疏奖励而失败的问题,ReGIL把唯一示范作为可反复查询的外部记忆:先用检索到的片段引导探索并扩充成功缓冲区,再通过当前轨迹与局部专家片段的时间对齐构造稠密奖励。实验显示其在LIBERO、Meta-World上较基线提升成功率和训练效率,真机三项任务仅一条示范、少于一小时在线训练达到75%以上成功率。

MosaicIMU: Composing Carrier Experts for Generalizable Neural Inertial Odometry Figure 1
2026-06-09cs.RO

MosaicIMU: Composing Carrier Experts for Generalizable Neural Inertial Odometry

Junye Zou, Huiyi Yan, Xinning Xu, Xiaolei Li, Pengkun Zhou, Jinhui Zhang, Ziyang Meng

2026-06-09机器人

针对学习式惯性里程计常绑定单一载体、跨车辆/行人/四足/无人机泛化差的问题,MosaicIMU将载体先验做成可按样本组合的MoE专家特征,而非固定载体头,并把预测的局部速度与不确定性送入历史感知EKF;还通过轻量残差专家和路由器选样支持未知域与在线适配。实验中平均ATE和RTE-10s较最强学习基线降40%和34%,在线自采序列ATE由42.60 m降至7.60 m。

Taming Perception Jitter: Uncertainty-Aware LiDAR Object Detection for Reliable Motion Classification Figure 1
2026-06-09cs.RO

Taming Perception Jitter: Uncertainty-Aware LiDAR Object Detection for Reliable Motion Classification

Cornelius Schröder, Žygimantas Marcinkus, Markus Lienkamp

This research was funded by the Bavarian Research Foundation. 1 Institute for Automotive Engineering, Munich Institute of Robotics and Machine Intelligence, School of Engineering and Design

2026-06-09视觉感知安全鲁棒

针对自动驾驶中 LiDAR 检测框帧间抖动会被跟踪器误解为物体运动、进而触发错误预测和不必要停车的问题,本文在 CenterPoint 中加入偶然不确定性估计,并用短时间窗两样本 z 检验区分真实运动与感知抖动,可较小改动接入 Autoware。实验显示其在 nuScenes 上与速度阈值法相当,但在真实道路测试中显著减少静态物体被判动态及由此导致的停车,关键洞察是实车数据存在速度规则易误判的“抖动带”。

TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation Figure 1
2026-06-09cs.RO

TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation

Huaihang Zheng, Yi Yang, Kai Ma, Shenglin Xu, Tian Xie, Guozheng Li, Xiangyu Wang, Yiren Ma, Si Liu, Yinian Mao, Baoxu Liu

Beijing Institute of Technology, Beihang University, State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, China University of Mining and Technology (Beijing)

2026-06-09机器人强化学习

这篇论文针对接触丰富操作中离线 VLA 遇到接触状态分布偏移时无法自适应、易用力不当或反复重试的问题,提出 TORL-VLA:先用触觉推导的 wrench-aware VLA 生成动作与未来力/力矩参考,再由轻量在线 actor-critic 基于实时触觉反馈修正动作,并用 intervention-censored critic 避免把人工接管后的成功错误归因给接管前策略。真实机器人在门闩、杯子放置和鸡蛋处理等长时序任务上,相比离线 VLA、触觉/力觉 VLA 与常规在线精修基线,提高了子任务和整任务成功率及限时执行效率。

KPGrasp: Scalable Keypoint Flow Matching for Dexterous Grasp Generation Figure 1
2026-06-09cs.RO

KPGrasp: Scalable Keypoint Flow Matching for Dexterous Grasp Generation

Yuansen Huang, Jiayi Chen, Haoran Liu, Yubin Ke, Bing Han, Jiangran Lyu, Mi Yan, Li Yi, He Wang

Peking University, Xi’an Jiaotong University, Tsinghua University

2026-06-09生成模型

KPGrasp针对灵巧抓取生成中依赖接触损失、测试时优化导致调参脆弱和推理慢的问题,将抓取表示为与物体点云同坐标系的欧氏3D手部关键点,并用Transformer流匹配模型直接从大规模数据学习先验。结果显示其在Dexonomy达76.3%成功率、穿透2.4mm,在DexGrasp Anything上无需微调取得最佳平均表现,批量推理约0.032秒/抓取,真实物体实验成功率83%。

Dual Quaternion-Based Unscented Kalman Filter with Visual Inertial Odometry for Navigation in GPS-Denied Environments Figure 1
2026-06-09cs.RO

Dual Quaternion-Based Unscented Kalman Filter with Visual Inertial Odometry for Navigation in GPS-Denied Environments

Mohamed Khalifa, Hashim A. Hashim

and Aerospace Engineering, Carleton University, Ottawa, Ontario, K1S-5B6

2026-06-09机器人

面向无 GPS 环境下 MAV 等平台依赖 VIO 但 IMU 易漂移、视觉约束不稳定的问题,论文将单位对偶四元数用于名义位姿,并用 6 维 twistor/对偶 MRP 表示局部误差,在 UKF 中生成 sigma 点、传播协方差并直接融合图像特征与 IMU。EuRoC MAV 仿真显示其在高初始不确定性下可收敛,困难序列位置 RMSE 为 0.2584 m,优于文中基准滤波器。

VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands Figure 1
2026-06-09cs.RO

VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands

Dongting Li, Qianyang Wu, Xingyu Chen, Liang Li, Yuhang Lin, Sikai Wu, Guoyao Zhang, Mingliang Zhou, Diyun Xiang, Qiang Zhang, Renjing Xu, Jianzhu Ma

Tsinghua University, Xiaomi Robotics Lab

2026-06-09机器人视觉感知规划控制

针对人形机器人与物体敏捷交互在真实部署中依赖密集参考轨迹、完美物体状态和地形信息的问题,VAIC 将用户意图解耦为多轴速度目标与逐帧交互状态,并用特权教师到视觉学生的两阶段蒸馏,通过深度时序与本体历史隐式估计被遮挡的物体动力学。实机结果显示单一策略可完成搬箱、推拉小车和滑板等任务,并优于基线。

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation Figure 1
2026-06-09cs.RO

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

2026-06-09机器人

这篇论文针对单目视觉导航难以同时获得全局定位与米尺度障碍感知的问题,提出 VGP-Nav 将前馈多视图重建、几何感知检索和加权运动平均耦合起来,并用全局位姿先验把视觉几何锚定到地面平面以在线恢复尺度。实验显示其在多个基准上达到领先表现,并完成真实移动机器人部署,说明低成本单 RGB 相机导航具备可行性。

Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection Figure 1
2026-06-09cs.RO

Back to the Familiar Future: Failure Recovery for VLA Policies via Pre-Imagined Milestone Selection

Suyeon Shin, Juwon Kim, Hyeonbin Park, Hyunseo Kim, Hyundo Lee, Hyung-Sin Kim, Byoung-Tak Zhang

Seoul National University, Yonsei University, Soongsil University

2026-06-09机器人

本文针对VLA机械臂在接触扰动或动作累积误差后落入陌生状态、直接重规划易失稳的问题,提出B2FF:执行前从干净初态预想一组未来视觉里程碑,失败时用可恢复性选择器挑选其中一个作为固定视觉目标,引导冻结的低层动作生成器回到熟悉轨迹。在故障注入LIBERO且恢复时机受控的设置下,基线成功率由56.3%提升到74.0%,并有真实实验展示可解释恢复;但方法依赖可设置未来图像接口和触发时机。

RPO-PDT: Demonstrating Role-Play-Based Knowledge Adaptation for Student Support Dialogue (Demonstration System) Figure 1
2026-06-09cs.RO

RPO-PDT: Demonstrating Role-Play-Based Knowledge Adaptation for Student Support Dialogue (Demonstration System)

Filip Janik, Ewa Olton, Robert Smales, Harris Spratt, Shea Tait, Md Zia Ullah, Yanchao Yu

Edinburgh Napier University, Edinburgh Napier University Edinburgh United Kingdom

2026-06-09模仿学习

面向高校学生支持场景中本地制度知识、角色边界与安全响应难以同时保证的问题,RPO-PDT 将 Rasa 编排、结构化知识检索、策略约束 LLM、确定性危机升级和 Furhat 具身交互结合;核心在反向角色扮演,把未解决对话从学生视角重放并沉淀为可复用导师策略。论文主要展示了可运行原型及模块集成效果,但文中未充分说明定量实验或相对基线增益。

Can we stabilize an inverted pendulum with feedback from a time-of-flight camera? Figure 1
2026-06-09cs.RO

Can we stabilize an inverted pendulum with feedback from a time-of-flight camera?

Anthony Czubarow, Antonio Terpin, Raffaello D'Andrea

∗ : Equal contribution.All authors are with the Institute for Dynamic Systems and Control, ETH Zürich.

2026-06-09机器人

论文针对低分辨率、带深度噪声的 ToF 相机能否支撑快速不稳定系统闭环控制这一疑问,构建了相机置于倒立摆下方的更困难车杆平台,并用仅由 ToF 深度估计的摆角配合标准 LQG 控制。实验表明,即使在 Raspberry Pi/ROS2 带来抖动的条件下,廉价 ArduCam ToF 仍能实现可靠、精确的倒立摆稳定,无需高端编码器或外部动捕;具体误差指标在给定片段中未充分说明。

Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation Figure 1
2026-06-09cs.RO

Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation

Luca Ghisi, Jacopo Essenziale, Carlo D'Eramo, Matteo Luperto

2026-06-09强化学习

针对强化学习自动赛车几乎都聚焦四轮车、摩托车还需处理倾角与平衡失稳的问题,本文在 VRider SBK 仿真中将 SAC 与自定步课程学习 SPDL 结合,自动生成由易到难的赛道任务,并加入倾角历史、赛道前瞻点和面向两轮动力学的稳定性奖励。初步实验显示,相比普通 SAC,该方法在多赛道和多车型上收敛更快、圈速更低、驾驶更稳定,但仍主要是仿真计时赛基线。

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation Figure 1
2026-06-09cs.RO

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

2026-06-09机器人强化学习

MotionWAM针对现有WAM视频-动作去噪过慢、以及人形机器人常见上下身分层控制导致腿部只能维持平衡的问题,提出用视频世界模型的中间去噪特征驱动策略,并以统一运动潜变量预测覆盖行走、躯干、高度、手部和脚部交互的全身运动token。通过三阶段从第一视角视频到G1本体数据再到任务示教的训练,在9个真实Unitree G1任务中实现实时闭环控制,整体成功率较同示教微调的VLA基线高30%以上,并能完成踩踏板、踢球等分层策略难以实现的脚部任务交互。

Deterministic Execution of ROS~2 Applications via Lingua Franca Figure 1
2026-06-09cs.RO

Deterministic Execution of ROS~2 Applications via Lingua Franca

Harun Teper, Shaokai Lin, Shulu Li, Edward A. Lee, Jian-Jia Chen

TU Dortmund University, University of California, Berkeley, RWTH Aachen University

2026-06-09机器人

针对 ROS 2 发布订阅与 executor 调度带来的回调顺序、分布式消息交错和定时器偏移不确定性,论文提出把未修改的 ROS 2 应用自动转换为 Lingua Franca 程序,用逻辑时间定义可确定执行的 ROS 2 子集并接管运行时协调。合成案例和 Autoware 评估显示,默认 ROS 2 的回调顺序与端到端延迟跨运行波动,而 LF 控制版本获得固定执行顺序和更一致的延迟。

Trajectory Optimization in Single and Dual-UAV Bearing-Only Target Localization Figure 1
2026-06-09cs.RO

Trajectory Optimization in Single and Dual-UAV Bearing-Only Target Localization

Zhijian Xiao, Huayu Huang, Bin Li, Yang Shang, Banglei Guan

College of Aerospace Science and Engineering, National University of Defense Technology, Changsha 410073, China, Hunan Key Laboratory of Image Measurement and Visual Navigation, Changsha 410073, China

2026-06-09规划控制优化算法

针对仅方位角无人机目标定位中观测几何退化、传统 FIM 目标梯度易消失以及双机轨迹聚集的问题,论文将机动约束纳入主动轨迹优化,提出谱加权 FIM 目标、双机视线交会角正弦项和带粒子归一化的运动约束 PSO。仿真显示,相比常规 FIM 方法,单机中位定位误差降低 99.21%,双机提升 69.70%,但验证主要限于仿真场景。

Autonomous Obstacle Removal for Excavators through Policy Learning with Particle Simulation Figure 1
2026-06-09cs.RO

Autonomous Obstacle Removal for Excavators through Policy Learning with Particle Simulation

Yuki Kadokawa, Sandro M. Alcantara Tacora, Taro Abe, Daisuke Endo, Genki Yamauchi, Takeshi Hashimoto, Takamitsu Matsubara

Nara Institute of Science and Technology, Nara 630-0192, Japan., Public Works Research Institute, Ibaraki 300-2621, Japan.

2026-06-09强化学习

本文针对挖掘机清除埋地障碍物时需随土体变形和障碍暴露程度反复调整轨迹、粒子仿真又训练昂贵的问题,提出以“埋深”同时刻画任务难度和仿真成本的课程强化学习框架:策略由 RGB-D 地形与障碍信息输出参数化挖掘轨迹,并从浅埋低粒子逐步过渡到深埋高保真场景。实验显示基线训练一周仍失败或成功率约 20%,该方法三天内达 90% 以上,并迁移到 12 吨真实挖掘机完成多种钢制障碍物移除。

Bridged SBI: Correcting Biased Low-Fidelity Posteriors for Cost-Efficient High-Fidelity Inference Figure 1
2026-06-09cs.RO

Bridged SBI: Correcting Biased Low-Fidelity Posteriors for Cost-Efficient High-Fidelity Inference

Gahee Kim, Yuki Kadokawa, Sandro M. Alcantara Tacora, Taro Abe, Daisuke Endo, Genki Yamauchi, Takeshi Hashimoto, Takamitsu Matsubara

2026-06-09机器人

面向机器人土方作业中高保真颗粒仿真校准成本过高、低保真后验又因粒径和粒子数变化产生偏差的问题,论文提出 Bridged SBI:先用低保真仿真定位粗略高密度参数区,再用少量高保真样本学习局部残差桥,将低保真后验样本校正到高保真一致区域。仿真到仿真和真实土壤校准实验显示,在高保真预算受限时其后验更稳定准确,KL 相比 Naive-MF 最高降 75%、相比 HF-only 最高降 67%。

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs Figure 1
2026-06-09cs.RO

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs

Jiangtao Shuai, Zongxiong Chen, Manfred Hauswirth, Sonja Schimmler

Technical University of Berlin, Germany and 2 Fraunhofer FOKUS, Germany.

2026-06-09视觉语言

面向机器人任务推理,USD 数字孪生场景需映射到本体类以构建知识图谱,但人工词典难扩展。本文将 USD 物体名称、几何、位置和场景图上下文与线性化 TBox 组成提示,考察 LLM 零样本本体 grounding。结果显示,描述性命名下准确率达 90–96%,缩写名为 49–89%,不透明命名结合上下文最高 48%;消融表明增益主要来自父路径和兄弟节点中的语义线索,而非几何信息。

RAM: Reachability Across Morphologies Figure 1
2026-06-09cs.RO

RAM: Reachability Across Morphologies

Tim Walter, Xinyu Chen, Jonathan Külz, Matthias Althoff

Department of Computer Engineering, Technical University Munich, University of Hamburg, Assign labels, show that our data generation produces reliable labels and scales to billions of samples. Finally

2026-06-09机器人

机器人形态设计和轨迹规划反复依赖可达工作空间评估,但传统逆运动学或体素图对新形态代价高且难泛化。RAM的核心是只预测“是否存在无碰撞IK解”,用形态条件的隐式占据网络学习SE(3)可达性,并用300亿前向运动学样本训练。实验报告F1为86%,较基线高14%,推理达纳秒级,并将形态优化和轨迹优化分别加速约1到2个数量级。

LAEI: Layered Autonomous Edge Intelligence Framework for Robust UAV Swarm Operations Figure 1
2026-06-09cs.RO

LAEI: Layered Autonomous Edge Intelligence Framework for Robust UAV Swarm Operations

Changmin Park, Wooyong Jung, Hwangnam Kim

School of Electrical Engineering, Korea University

2026-06-09安全鲁棒

面向无人机集群在通信受限、环境不确定和节点失效下难以兼顾全局一致性与本地自治的问题,LAEI提出分层边缘智能框架:无人机端执行感知、避障与动作选择,轻量监督层仅做目标重分配、策略条件建议和故障恢复,不直接控制低层动作。仿真与边缘推理测试显示其可缩短任务完成时间、提升覆盖效率并维持较低碰撞率。

Autonomous FPV Flight with Translational Optical Flow and Uncertainty Mask Figure 1
2026-06-09cs.RO

Autonomous FPV Flight with Translational Optical Flow and Uncertainty Mask

Yang Deng, Yu Hu, Feng Yu, Linzuo Zhang, Danping Zou

2026-06-09生成模型安全鲁棒

论文针对单目 RGB FPV 无人机高速避障中原始光流易受自运动旋转干扰、且在扩张焦点附近障碍信号弱的问题,提出将光流分解后仅使用平移光流,并加入由前后向光流不一致得到的不确定性掩码作为策略输入,在可微仿真中训练控制器。结果显示其在仿真最高 13.91 m/s、真实森林环境最高 11.79 m/s,30 次实飞成功率 93.3%。

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models Figure 1
2026-06-09cs.CV

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models

Jiaheng Chen

School of Software, Northeastern University

2026-06-09强化学习

论文针对潜在世界模型评估依赖 CEM/仿真 rollout、耗时且难区分表示与规划器问题,提出以动作可识别性为核心的 ATM:比较真实编码转移与模型预测转移中的动作语义迁移,形成可解释诊断矩阵和筛选分数。实验显示其可在秒级替代分钟到小时级评估,OGBench-Cube 上 5% 间隔的成对排序准确率达 98.8%,并用 AITS 训练信号使 LeWM 成功率提升约 10 个百分点。

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning Figure 1
2026-06-09cs.RO

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

School of Information Science and Electronic Engineering & School of Integrated Circuits, Shanghai Jiao Tong University, Institute of Artificial Intelligence, China Telecom, Central South University, Jiangsu University

2026-06-09机器人视觉感知

面向连续环境中的零样本视觉语言导航,论文指出现有基础模型导航器过度依赖局部视觉与线性历史,易缺乏跨房间空间定位。SpaceVLN将任务分解为可验证的“空间—地标”阶段,在线构建由空间路标、路径和地标证据组成的空间认知记忆,并用Spatial-CoT进行进度定位、空间关系推理与重规划。其在R2R-CE、RxR-CE、GN-Bench和HM3D-OVON上取得零样本SOTA成功率,并通过真实机器人验证,但仍受开放词汇 grounding、路标噪声和频繁模型调用影响。

C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache Figure 1
2026-06-09cs.LG

C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache

Weisen Zhao, Lam Nguyen, Zhicong Lu, Yuzhang Shang

George Mason University, University of Central Florida

2026-06-09强化学习

该文针对世界动作模型在机器人闭环执行中需按多个动作块反复去噪、推理延迟高的问题,指出现有缓存只利用单块内冗余,忽略连续平滑行为下跨动作块、同一去噪步残差高度相关的现象。C3ache无需训练,跨块缓存并复用残差以跳过部分DiT计算;在Fast-WAM上于LIBERO和RoboTwin实现最高2.5倍墙钟加速,任务成功率几乎不降。

PTDL:Multi-Terrain Fall Recovery via Phase-Terrain Decoupled Learning Figure 1
2026-06-09cs.RO

PTDL:Multi-Terrain Fall Recovery via Phase-Terrain Decoupled Learning

Xiaoyu Xu, Zhiming Chen, Yuenan Zhao, Ran Song, Wei Zhang

2026-06-09机器人

面向人形机器人在斜坡、碎石等非结构地面跌倒后仍需自主恢复并继续行走的问题,PTDL将训练监督按“恢复/行走阶段”和“地形类型”解耦:用重力门控双运动先验判别器连接起身与速度跟踪行走,并用仅训练期可见的地形分层奖励诱导不同支撑策略,部署时仍是单一本体感知策略。论文在29自由度Unitree G1上展示了平地、碎石和最高20°斜坡的仿真与硬件恢复及过渡行走,但定量对比表在片段中未充分说明。

Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis Figure 1
2026-06-09cs.RO

Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis

Yi Yu, Xinchuan Qiu

Graduate School of Advanced Science and Engineering

2026-06-09视觉语言视觉感知数据集/基准

针对现有 VLA 评测多停留在仿真或高端机械臂、难以暴露低成本硬件噪声下鲁棒性的问题,论文在 SO-101 上构建四个真实操作任务基准,并加入失败分类、语义/执行层分解与恢复能力指标。实测 π0.5、SmolVLA、Wall-X 与 ACT 后发现,预训练 VLA 通常优于模仿学习基线,但表现强依赖任务,主要失败来自执行不稳定,且不同架构的恢复能力差异明显。

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups Figure 1
2026-06-09cs.CV

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups

Xiangzhong Liu, Xihao Wang, Hao Shen

Technical University of Munich, 80333 Munich, Germany

2026-06-09视觉感知强化学习三维安全鲁棒

面向低成本自动驾驶/物流车常见的双鱼眼相机+车顶 LiDAR 稀疏配置,论文指出早期统一到笛卡尔或极坐标 BEV 会放大鱼眼畸变与低重叠问题。其 GA-HF 将鱼眼特征用畸变感知 LSS 提升到极坐标以保角分辨率,LiDAR 与检测回归保留在笛卡尔空间,并用双注意力校正融合伪影。实验在 KITTI-360、Dur360BEV、Fisheye3DOD 上均优于基线,KITTI-360 NDS 较笛卡尔融合提升 4.2%。

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video Figure 1
2026-06-09cs.RO

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

Georgia Institute of Technology, University of Pennsylvania, Toyota Research Institute, Carnegie Mellon University

2026-06-09视觉感知

该文瞄准灵巧操作中机器人示教昂贵、单段人类视频又受遮挡与人机形态差异影响难以直接迁移的问题。Video2Sim2Real用基础模型重建数字孪生并提取运动先验,关键洞察是以物体中心关键帧优化机器人构型作为锚点,而非全程信任重定向轨迹;再用IL处理真实点云下的几何重校准、残差RL处理手指接触适配,并结合碰撞感知规划扩展物体布局。七类日常任务实验显示其在仿真成功率、安全性、轨迹连贯性和sim-to-real鲁棒性上优于多种基线。

Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks Figure 1
2026-06-09cs.RO

Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks

Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami

Tandon School of Engineering, New York University, Courant Institute of Mathematical Sciences, New York University, AMI Labs

2026-06-09机器人生成模型强化学习

该文针对视觉世界模型在机器人长时程、多阶段操作中难以直接规划连续动作的问题,提出 WorldDP:用物体中心世界模型在高层生成可达子目标,并结合粒子滤波、接触预测和基于 SAM2/DINOv2 的物体表示,再由低层目标条件扩散策略执行。实验在 OGBench 多类任务上优于世界模型、扩散策略及子目标生成基线,但测试时粒子滤波开销较大。

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation Figure 1
2026-06-09cs.RO

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

ShanghaiTech University, Beijing Institute for General Artificial Intelligence

2026-06-09机器人视觉感知安全鲁棒

这篇论文针对灵巧操作中视觉被遮挡时,稀疏触觉信号与图像特征难以对齐、隐式融合数据效率低的问题,提出 RGB-S:用机器人正运动学和相机标定把触觉接触位置投影到 RGB 平面,并生成受力大小调制的高斯显著图,再以零初始化条件分支接入预训练视觉骨干。六个仿真与真实任务显示,该显式图像域触觉锚定在遮挡场景更鲁棒,真实遮挡成功率较最强隐式基线提升 26.7 个百分点。

Guided Discovery of New Behaviors using Diffusion Policies Figure 1
2026-06-09cs.RO

Guided Discovery of New Behaviors using Diffusion Policies

Dian Yu, Sebastian Sanokowski, Majid Khadiv

Munich Institute of Robotics and Machine Intelligence, Technical University of Munich

2026-06-09生成模型

针对少量示范下扩散策略易重复主导模式、难发现有效稀有行为的问题,论文提出 GDNB:用 Feynman–Kac corrector 和基于 score 范数的引导势将采样推向“有前景但低支持”的前沿轨迹,再用采样式轨迹优化修复并回灌数据微调策略。实验在多种操作环境中显示其能持续发现初始策略低表示、且可执行的新行为。

Safe, Fluent and Acceptable Motion Generation and Execution for Human--Robot Interaction in Manufacturing Environments Figure 1
2026-06-09cs.RO

Safe, Fluent and Acceptable Motion Generation and Execution for Human--Robot Interaction in Manufacturing Environments

Thibaut Lopez, Olivier Aycard, Pierre-Brice Wieber, Mohamed Boua, Christine Jeoffrion

2026-06-09机器人安全鲁棒

面向制造场景中人与机械臂近距离协作,论文指出仅满足物理安全不足以保证可接受交互,并将速度与交互距离作为可解释控制参数嵌入预测控制框架,生成四类具社会感知的避障行为。非专家用户实验显示,这些运动风格不显著增加 NASA-TLX 工作负荷,但速度剖面对自信、稳固、力量和平滑等机器人感知有显著影响,说明可在保持安全与任务连续性的同时调节社会接受度。

Systems-Level Planning and Coordination of Truck-Drone Collaborative Delivery Networks Figure 1
2026-06-09cs.NI

Systems-Level Planning and Coordination of Truck-Drone Collaborative Delivery Networks

Didem Cicek, Burak Kantarci

D. Cicek and B. Kantarci are with the School of Electrical Engineering and, Computer Science at the University of Ottawa, Ottawa, ON, K1N 6N5, Canada.

2026-06-09规划控制

面向电商增长下城市末端配送的拥堵、能耗与无人机监管约束,论文将卡车—无人机配送视为需通信与控制协同的异构网络,而非单一优化问题;提出涵盖空间需求匹配、协作模式、资源流程编排、性能评估与可扩展性的五层规划框架,并用 Amazon 真实路由数据构造案例。结果显示相较纯卡车模式,总配送时间降 42.4%、能耗降 44.2%,但框架偏概念化,具体增益可能主要来自任务划分与同步假设。

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation Figure 1
2026-06-09cs.RO

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

Peking University, The Hong Kong University of Science and Technology, Nanjing University, State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Peking University Beijing China, The Hong Kong University of Science and Technology Hong Kong China, Nanjing University Nanjing China, State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing China

2026-06-09机器人强化学习

针对视觉主导的世界动作模型在接触丰富操作中难以感知接触、滑移等关键信号的问题,Dream-Tac将触觉纳入生成式世界动作建模,联合预测未来视觉、触觉与动作,并用接触门控融合和接触感知注意力只在关键交互时强化触觉影响;同时用FlashAttention改写和扩散缓存加速训练/推理。在六个真实接触操作任务上,其动作准确率平均提升31.7%,训练最高快2.9倍、推理快1.8倍。

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking Figure 1
2026-06-09cs.RO

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

The University of Hong Kong, Shenzhen Institutes of Advanced Technology, Southern University of Science and Technology, University of Michigan, University of Macau

2026-06-09机器人数据集/基准

针对现有机器人导航仿真器依赖定制代码、接口复杂且难以接入 LLM 自动流程的问题,IR-SIM 将场景原生表示为可复现的 YAML,并通过 agent skills 从自然语言生成配置与运行脚本,支持运动学、碰撞、LiDAR、行为、RL 接口及高保真/实机桥接。实验展示其可用于自然语言建场景、避障策略训练、社会导航基准和后续验证,但量化性能增益文中未充分说明。

Real-Time and Accurate Collision-Free Teleoperation via Differentiable Constraint-Based Trajectory Planning Figure 1
2026-06-09cs.RO

Real-Time and Accurate Collision-Free Teleoperation via Differentiable Constraint-Based Trajectory Planning

Max Grobbel, Tristan Schneider, Daniel Flögel, Sören Hohmann

2026-06-09规划控制优化算法

面向非触觉设备遥操作中操作者只给末端位姿、易引发自碰撞和环境碰撞的问题,论文将基于凸优化对偶的可微碰撞约束嵌入模型预测轨迹规划,用胶囊体建模机械臂、用多面体建模障碍物,以避免球体近似精度低或数值梯度收敛慢。仿真和 UR5e 实机测试显示,该方法在更精确几何建模下计算时间更低,并实现更平滑的无碰撞末端遥操作。

Hybrid Neural Network and Conventional Controller Approach for Robust Control of Highly Unstable Systems: Application to Tilt-Rotor Control Figure 1
2026-06-09eess.SY

Hybrid Neural Network and Conventional Controller Approach for Robust Control of Highly Unstable Systems: Application to Tilt-Rotor Control

Ali Kafili Gavgani, Amin Talaeizadeh, Aria Alasty, Hossein Nejat Pishkenari

Advanced Research Lab for Control and Agricultural Robotics (Sharif AgRoLab), Department of Mechanical Engineering, Sharif University of Technology, Tehran, Iran

2026-06-09规划控制安全鲁棒

针对倾转旋翼虽可全驱动但动力学高度不稳定、传统多旋翼欠驱动受限的问题,论文先验证端到端状态到控制量学习在该平台上难以稳定系统;核心做法是把神经网络用于学习输入无关动力学,并嵌入滑模控制以降低实时计算和增强鲁棒性。仿真中该混合控制在模型不确定性和外扰下有效,LSTM 动力学预测器较 MLP 表现更好且运行更快。

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback Figure 1
2026-06-09cs.RO

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

Beijing Institute of Technology

2026-06-09规划控制

针对物理驱动4D生成中环境力场仍依赖专家手调、SDS优化慢且难切换离散力场、纯LLM缺少仿真反馈的问题,PhysAgent将材料/几何先验与文本驱动的外力场解耦,构建MPM仿真闭环多智能体:Semantic Agent借助力场技能库初始化,Refine Agents用视觉基础模型提取轨迹并转成文本反馈以更新配置。实验显示其在多模态提示下能更快生成稳定多样场景,物理准确性和多样性优于基线。

Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras Figure 1
2026-06-09cs.CV

Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras

Xiangzhong Liu

2026-06-09视觉感知

面向自动驾驶中针孔与鱼眼混合相机的 BEV 3D 检测,论文指出鱼眼径向畸变会破坏 PETR 等方法的均匀采样和2D-3D对应。DAPETR用 MEI 相机模型构造统一畸变感知位置编码,并加入图像特征与3D位置嵌入的双向共调制;在改造的 KITTI-360 上优于 PETR、PolarPETR 及投影式基线,同时发现显式极坐标重参数化与学习式适配叠加会相互冲突。

Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language Figure 1
2026-06-09cs.RO

Language as a Sensor: Calibrated Spatial Belief Estimation in 3D Scenes from Natural Language

Aryan Naveen, Jason Xinyu Liu, Luca Carlone, Andreea Bobu

MIT Laboratory for Information & Decision Systems, MIT Computer Science & Artificial Intelligence Laboratory

2026-06-09三维

论文针对机器人在未观测区域中难以利用人类空间描述的问题,提出把自然语言视为带不确定性的传感器:LSM将话语与场景图映射为高斯混合分布,分别表达指代歧义和空间不确定性,并由VL-Map与视觉观测做贝叶斯融合。在VLA-3D和真实Spot实验中,LSM是唯一保持校准的语言预测器,融合后较最强基础模型基线在真实目标处获得约70%更多概率质量。

Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation Figure 1
2026-06-09cs.RO

Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation

Zhexuan Zhou, Yichen Lai, Jinhao Zhang, Huizhe Li, Youmin Gong, Jie Mei

2026-06-09机器人生成模型强化学习

论文针对扩散机器人策略在原始动作空间中同时承担场景理解与轨迹生成、导致速度场复杂且双臂时序协调困难的问题,提出 LDP:用观测条件 CVAE 将动作压缩到经“塑形”的潜空间,使每个观测下的潜变量分布更集中,再以逐 token diffusion forcing 和 staircase sampling 建模时序依赖并缓解训练/推理错配。实验显示其在 RoboTwin 2.0 协调任务上显著优于 DP3,并可迁移到真实双臂平台。

PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning Figure 1
2026-06-09cs.RO

PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning

Haoyu Li, Aaron Thomas, Shuyan Zhou, Xianyi Cheng

Department of Mechanical Engineering and Materials Science, Duke University, Durham, NC 27708, USA. 2 Department of Computer Science, Duke University, Durham, NC 27708, USA.

2026-06-09三维

机器人仅有语义三维地图难以处理材质、质量和关节等物理约束,影响安全操作与长程规划。PhysGraph 将 RGB-D 多视角重建、对象关联、功能部件分解与 VLM/LLM 视觉推理结合,构建含空间关系、材质和运动学属性的层级 3D 场景图,无需专门训练即可做零样本关节建模。实验称其在语义分割、多物体质量估计和关节预测上达到 SOTA,并支持约束感知 affordance 与 real-to-sim。

FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning Figure 1
2026-06-09cs.CV

FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning

Haihao Lin, Xiangsheng Huang, Xiao Yang, Weibang Zhou, Yiqi Zhang, Bo Yang, Simin Zeng, Jiawei Yang, Zhengyang Wang, Jiahui Du

University of Chinese Academy of Sciences, Hebei Key Laboratory of Cognitive Intelligence, Xiong’an Institute of Innovation, Hebei University of Technology, Beijing Information Science and Technology University

2026-06-09视觉语言视觉感知

本文针对 VLA 行为克隆微调中只约束会改变动作的特征方向、导致动作等价状态中的颜色/类别/背景等视觉残差坍缩的问题,提出 FiberTune:用在线动作探针滤除动作预测方向,再对剩余视觉 token 与冻结教师对齐并保持有效秩,且推理无额外开销。在 CALVIN、LIBERO、π0.5/OpenVLA-OFT 及 SO-101 实机上均优于仅任务损失微调,如 CALVIN SR(5) 提升 10.7 个百分点,实机成功率由 72.7% 升至 78.1%。

HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning Figure 1
2026-06-09cs.RO

HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning

Zechu Li, Yufeng Jin, Xiaoyang Liu, Puze Liu, Vignesh Prasad, Carlo D'Eramo, Georgia Chalvatzaki

Honda Research Institute Europe, Columbia University, Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems, University of Würzburg

2026-06-09机器人强化学习

论文针对机器人强化学习落地中任务构建、奖励设计与超参调试高度依赖专家的问题,将自动化流程抽象为“harness engineering”。HARBOR 用主控与专门代理、标准命令、持久化产物、可执行门控和可复用经验,把自然语言任务推进到仿真训练,并通过并行试验迭代奖励和算法。实验覆盖 6 个基准 16 个任务,显示其可端到端自动化流程,性能达到或优于默认配置,并在实际 token 与时间成本下减少工程工作量,部分策略可迁移到真实机器人。

Real-IKEA: Physical Fidelity is the Prerequisite for Robust Manipulation Figure 1
2026-06-09cs.RO

Real-IKEA: Physical Fidelity is the Prerequisite for Robust Manipulation

Kunqi Xu, Zhenhao Huang, Siyuan Luo, Ziqiu Zeng, Fan Shi

Human-centered Robotic Lab, National University of Singapore, School of EECS, Peking University

2026-06-09机器人安全鲁棒

论文针对接触丰富的开合操作中仿真物理过粗导致策略依赖脆弱摩擦拉拽的问题,提出 Real-IKEA:用真实 IKEA 把手/旋钮构建 1,079 个高保真关节资产,引入双向表面偏差评估碰撞网格,并校准阻尼与摩擦。实验显示,在精确接触几何和阻力下,PPO 策略能自发学到穿孔勾取、杠杆等形闭合策略,而简化碰撞模型更易退化为抗阻力差的摩擦拉拽。

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation Figure 1
2026-06-09cs.RO

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

School of Mathematical Sciences, Peking University, School of Artificial Intelligence, Shanghai Jiao Tong University

2026-06-09机器人强化学习

面向擦拭、剥离、推挤等接触丰富操作中视觉难以判断弱接触、过压或卡滞的问题,FAWAM不再只把力作为额外观测,而是在感知、预测与执行三层使用6轴力/力矩:用历史力调制动作生成,联合预测未来动作和末端力轨迹,并以预测—实测力偏差在线残差修正动作。真实机器人实验平均成功率达85.0%,较最强视觉基线和已有力感知基线分别提升36.25%和21.25%。

OASIS: From Simulation Data Collection to Real-World Humanoid Loco-Manipulation Figure 1
2026-06-09cs.RO

OASIS: From Simulation Data Collection to Real-World Humanoid Loco-Manipulation

Zehao Yu, Jiakun Zheng, Weiji Xie, Jiyuan Shi, Chenyun Zhang, Chenjia Bai, Xuelong Li

Institute of Artificial Intelligence (TeleAI), China Telecom, Fudan University, East China University of Science and Technology, Shanghai Jiao Tong University

2026-06-09机器人强化学习

针对人形机器人移动操作示教数据难以兼顾质量与规模的问题,OASIS将数据采集完全搬到仿真中:由真实物体图像生成3D资产并估计物理属性,先用VR遥操作记录状态,再离线高保真渲染并做光照、纹理和相机随机化,训练分层视觉运动策略。真实Unitree G1零样本实验显示,仿真数据训练的策略在多数任务上优于真实遥操作数据,增益可能主要来自更大的视觉多样性。

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA Figure 1
2026-06-09cs.RO

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

Tsinghua University

2026-06-09机器人视觉感知

本文关注机器人探索操作中“失败尝试”如何揭示隐藏前提,例如拉不开抽屉反而说明需先解锁。作者提出 EMT-QA 任务,并用闭环代码代理从标注轨迹中蒸馏一行可审计的读取启发式 DRH,推理时仅作为冻结 VLM 的提示而不更新权重。三项仿真和两项真实机器人任务上,DRH 相比最佳原始模态基线将动作链准确率提升 0.38–0.47,且可生成匹配 VLM 的程序分类器。

Autonomous Aerial Manipulation via Contextual Contrastive Meta Reinforcement Learning Figure 1
2026-06-09cs.LG

Autonomous Aerial Manipulation via Contextual Contrastive Meta Reinforcement Learning

Lixuan Jin, Bingxuan Lan, Xinyi Bao, Xiangyuan Xie, Chunjie Zhang, Zheng Chen, Tianshuo Liu, Ruijie Tian, Jinyu Ru, Gang Wang, Lei Yuan, Yang Yu

National Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China, School of Artificial Intelligence, Nanjing University, Nanjing, China, Faculty of Robot Science and Engineering, Northeastern University, China, National Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology, China

2026-06-09机器人强化学习

面向无人机物流中载荷需自主获取且不同物体会显著改变飞行动力学的问题,论文提出 Aco2:用轻量挂钩完成取放,并通过基于交互历史的上下文编码器与对比式元强化学习,让策略在线推断载荷动态而无需显式辨识。方法在仿真中结合课程学习、阈值奖励和域随机化训练,实验显示可零样本迁移到真实四旋翼,完成多种带把手、较重或笨重物体的自主挂取、运输与释放;但仍依赖外部动捕,开放环境泛化文中未充分说明。

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation Figure 1
2026-06-09cs.RO

GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation

Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan

Anhui University, University of Science and Technology of China

2026-06-09机器人

论文针对现有 VLA 在未见物体、背景变化和跨机器人本体部署中泛化不足的问题,提出 GEAR-VLA:用粗到细动作学习连接离散动作语义与解耦的 DiT 连续动作专家,并通过语义对齐的 3D 空间骨干和本体规范化接口引入几何与跨本体共享。实验显示其在 LIBERO、LIBERO-Plus、RoboTwin 2.0 达到 SOTA,真实 AgileX 成功率 85.9%,未预训练本体 LDT-01 为 81.0%,通用抓取 90.1%。

Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data Figure 1
2026-06-09cs.RO

Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data

Linqi Yin, Shiduo Zhang, Shenling Qiu, Chenxin Li, Zhaoyang Fu, Lei Xiao, Xiang Wang, Chenchen Yang, Zhe Xu, Pengfang Qian, Jingjing Gong, Xipeng Qiu, Xuanjing Huang, Yu-Gang Jiang

Fudan University, Shanghai Innovation Institute

2026-06-09视觉语言规划控制

论文针对预训练 VLM 直接微调为 VLA 时同时面临机器人视觉分布与动作预测目标双重错配、且易遗忘的问题,提出从同一机器人轨迹自动构造具身轨迹耦合 ETC 视觉语言监督,并用分布桥接、目标桥接、保持式适配三阶段逐步训练。仿真和真机实验显示,该策略比动作数据直接适配更能保留具身理解并提升对新视觉语言组合的泛化,少量动作数据配合任务相关 ETC 即可覆盖未示范条件。

Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning Figure 1
2026-06-09cs.RO

Towards End to End Motion Planning and Execution for Autonomous Underwater Vehicles Using Reinforcement Learning

Elisei Shafer, Oren Gal

Department of Marine Technologies, University of Haifa, Israel

2026-06-09强化学习规划控制

针对AUV感知、规划、控制流水线工程量大的问题,论文尝试用端到端深度强化学习直接从相机、前视成像声呐和本体感知输出推进器指令。核心做法是分层RL:高层以RLPD/SERL生成子目标,低层用SAC+HER执行控制。在HoloOcean仿真中可避障,路径长度接近RRT*基线约4%–6%,对噪声和低能见度较稳健,但面对未访问区域和新障碍形状时泛化仍有限。

ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies Figure 1
2026-06-09cs.RO

ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies

Bingjia Huang, Xiangyu Li, Xiang Wang, Liang Mi, Zixu Hao, Weijun Wang, Hao Wu, Kun Li, Yunxin Liu, Ting Cao

Institute for AI Industry Research (AIR), Tsinghua University, University of Electronic Science and Technology of China, Nanjing University, Tsinghua University.

2026-06-09机器人视觉感知生成模型强化学习

生成式机器人策略部署时常在犹豫、偏航或不可恢复动作前失效,而现有检测器依赖内部状态、视觉特征或重采样,泛化和开销受限。ActProbe的核心洞察是仅用单次前向输出的动作块即可预警:以相邻动作块重叠部分的时序一致性误差TCE和当前动作幅值ACM,经任务条件化LSTM-MLP估计逐步失败概率。在OpenVLA、π0/π0.5、GR00T等五组设置中,它将F1-及时性帕累托超体积平均提升12.7%,未见任务早期ROC-AUC领先9.0%,并在PPO微调中减少2.9倍交互。

EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control Figure 1
2026-06-09cs.RO

EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control

Haoyang Ge, Peng Ren, Yukun Shi, Cong Huang, Kun Li, Kai Chen

Tianjin University, Tianjin, China, Zhongguancun Academy, Beijing, China, Beihang University, Beijing, China, Zhongguancun Institute of Artificial Intelligence, Beijing, China

2026-06-09机器人规划控制

针对现有人形机器人多依赖给定轨迹回放、VLA又偏短程任务技能,EgoPriMo将第一视角人类示教作为可扩展的全身运动先验来源,用文本只表达高层意图。其核心是三流DiT联合建模身体、视觉与语言,并用任务掩码在同一 checkpoint 中支持重建、生成和预测。Nymeria与EgoExo4D实验显示其优于UniEgoMotion,生成的SMPL运动可由Unitree控制器执行,但接触与语言交互评估仍有限。

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving Figure 1
2026-06-09cs.RO

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, Jun Ma

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, and Jun Ma are with The Hong Kong University of Science and Technology (Guangzhou), China (e-mail:

2026-06-09安全鲁棒

面向自动驾驶中LLM推理易坍缩为单一假设、计算开销大且难以持续适应的问题,LUNA-AD将多智能体分析系统生成的不确定性感知示范,蒸馏到双头轻量语言模型,并用反思式 lifelong learning 保留多模态策略多样性。nuPlan闭环实验显示其在非反应/反应模式下成功率达SOTA量级,同时1.7B模型延迟约192ms,显著低于GPT类知识驱动方案。

Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning Figure 1
2026-06-09cs.RO

Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning

Alvaro Gonzalez, M.H. Hasan Shovo, Ali Ayub

2026-06-09机器人安全鲁棒

面向家庭机器人长期主动协助,论文针对现有复杂时空模型在噪声环境下计算开销大、鲁棒性不足的问题,提出 GLOBE:用 n-gram Markov 学习个性化活动与物体使用序列,仅在低置信预测时调用 LLM 语义推理。作者还构造含人、宠物、幼儿扰动的 HOMER-Noise;实验显示其在干净与噪声数据上接近 SOTA,同时提升鲁棒性和训练效率,并在 Stretch 3 上做了概念验证。

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors Figure 1
2026-06-09cs.RO

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors

Dongli Wu, Xiaobao Wei, Hao Wang, Qiaochu Dong, Ying Li, Qingpo Wuwu, Ming Lu, Wufan Zhao

2026-06-09机器人三维

针对遮挡和局部观测下抓取需要同时理解接触局部几何与完整物体结构的问题,GraspFoM将SAM3D的三维基础先验转为共享物体潜变量,统一驱动重建与抓取;其锚点初始化的截断扩散头直接生成连续多模态抓取位姿,并用重建感知评分器和残差潜变量更新让两任务互相约束。实验称其在GraspNet-1B抓取与三维重建指标上均达SOTA,尤其提升新物体泛化且额外参数较少。

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation Figure 1
2026-06-09cs.RO

PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation

Lingxuan Wu, Zijian Zhu, Lizhong Wang, Chengyang Ying, Huayu Chen, Xiao Yang, Fangming Liu, Jun Zhu

iting policy expressivity and overall scalability., and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China 2Peng Cheng Labo-, limiting scalable deployment. Test-time approaches (Hsu, mise policy expressivity and scalability while failing to, diverge. Collectively, these challenges require scalable post-, components constitute a scalable post-training alignment

2026-06-09机器人生成模型安全鲁棒

针对扩散策略在真实机器人操作中易违反碰撞、力和运动学等物理约束的问题,PACT将安全作为部署前后训练对齐:用自生成轨迹把可微安全代价的梯度蒸馏进扩散去噪过程,并通过逐步收紧约束的课程更新控制策略漂移,避免因强制安全导致任务能力遗忘。实验覆盖仿真与真实双臂/GPU装配等任务,平均安全违规率降低31.0%,任务成功率提升30.7%。

Uncertainty-Aware Intention Prediction for Human-to-Robot Assembly Teleoperation Figure 1
2026-06-09cs.RO

Uncertainty-Aware Intention Prediction for Human-to-Robot Assembly Teleoperation

Fnu Heman, Yixuan Wang, Kolin Xu, Conner Wallace, John Dang, Akhil Joshi, Jun Sheng, Pinhas Ben-Tzvi, Mingyu Cai

2026-06-09机器人安全鲁棒

面向装配遥操作中机器人示教昂贵、长时序动作边界模糊且安全场景需要可靠不确定性的问题,论文将人手示教预训练的 MS-TCN++ 迁移到少量机器人数据,并结合保形预测给出帧级预测集,再用 VLM 只校正低置信片段。22 类装配实验中,仅 16 条机器人示教使 Edit 从 70.50 提升到 80.70,VLM 校正将帧准确率从 45.21% 提至 46.42%,且基本保持 Edit。

MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model Figure 1
2026-06-09cs.RO

MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model

Shanglin Yuan, Weiheng Zhao, Xianda Guo, Wei Sui, Li Yu, Wenyu Liu, Xinggang Wang

Huazhong University of Science and Technology, Wuhan University

2026-06-09视觉语言视觉感知

该文针对长程机器人操作中仅堆叠历史帧、深度或离散4D特征易产生几何漂移和时间碎片化的问题,提出 MotionVLA:把短历史窗口转为连续轨迹场 token,并让当前视觉 token 查询、再在轨迹监督下回耦到 VLA。RoboTwin2.0、LIBERO 与初步真机结果显示,其可提升长程成功率与路径效率,使执行更平滑直接。

G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation Figure 1
2026-06-09cs.CV

G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation

Yufei Wei, Shuhao Ye, Chenxiao Hu, Yiyuan Pan, Dongyu Feng, Rong Xiong, Yue Wang, Yanmei Jiao

State Key Laboratory of Industrial Control and Technology, Zhejiang University, Hangzhou, China, Zhejiang Humanoid Robot Innovation Center Co., Ltd., Ningbo, China, School of Information Science and Engineering, Hangzhou Normal University, Hangzhou, China

2026-06-09三维

本文针对跨序列重定位和多相机里程计中“两组图像间6DoF位姿”这一共性问题,指出现有多视图模型忽略组内已知几何与跨组推理。G2G冻结多视图基础模型,仅加入重采样器、跨组注意力桥和多帧位姿头,用相对位姿监督训练约32M参数。在四类仿真、真实跨季节与零样本迁移数据上取得最佳非oracle精度。

Impedance MPC for Physical Human-Robot Interaction: Predictive Disturbance Rejection with Joint-Limit Safety Figure 1
2026-06-09cs.RO

Impedance MPC for Physical Human-Robot Interaction: Predictive Disturbance Rejection with Joint-Limit Safety

Yongyan Cao, Jinshan Tang

2026-06-09机器人规划控制安全鲁棒

面向人机物理交互中“高精度跟踪”和“受力顺从安全”的冲突,论文提出两层 Impedance MPC:先用解析前馈消去重力、科氏项和任务空间惯量,将机械臂化为常 A 的双积分模型,再用带扰动状态的 Kalman 增广 MPC 实现无偏跟踪,并结合零空间屏障处理关节限位。在 Franka FR3 测试中,15N 持续外力下稳态误差由传统阻抗的 44.8mm 降至 0.05mm 以下,圆轨迹达亚毫米级,并对噪声和 30% 惯量失配保持鲁棒;但物理硬件验证仍属未来工作。

SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation Figure 1
2026-06-09cs.RO

SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation

Songlin Wei, Zhenhao Ni, Jie Liu, Zhenyu Zhao, Junjie Ye, Hongyi Jing, Junkai Xia, Xiawei Liu, Michael Leong, Liang Heng, Di Huang, Yue Wang

USC Physical Superintelligence (PSI) Lab

2026-06-09机器人强化学习数据集/基准

针对人形机器人 loco-manipulation 真实评测昂贵且难复现、现有仿真偏桌面或轮式机器人的缺口,SIMPLE 将 MuJoCo 接触动力学与 Isaac Sim 写实渲染结合,构建含 60 类全身任务、50 个室内场景和千余物体的统一基准,并内置规划与 VR 遥操作数据采集。实验显示仿真表现与真实结果强相关,且在 SIMPLE 数据上训练的策略可在相近设置下零样本迁移到实体人形机器人。

Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking Figure 1
2026-06-09cs.RO

Mind Your Steps: A General Learning Framework for Accurate Humanoid Foothold Tracking

Alessandro Montenegro, Shihao Li, Puze Liu, Alberto Maria Metelli, Jan Peters

2026-06-09机器人视觉感知

论文针对人形机器人在复杂环境中仅靠速度指令难以精确、安全落脚的问题,提出一种轻量的通用3D落脚点跟踪学习框架:用站立脚坐标系表示目标,并通过Goal Sampler生成可行训练目标,使低层策略不依赖特定地形或上层规划器。仿真中与多种规划器结合完成目标到达、杂乱环境、窄路和楼梯等任务,并在Booster T1上实现零样本实机落脚跟踪。

Disturbance-Aware Aerial Robotics for Ethical Wildlife Monitoring Figure 1
2026-06-09cs.RO

Disturbance-Aware Aerial Robotics for Ethical Wildlife Monitoring

Mahmut Osmanovic, Isac Paulsson, Teddy Lazebnik

Department of Computing, Jonkoping University, Jonkoping, Sweden, Department of Information Systems, University of Haifa, Haifa, Israel, a scalable alternative, which has shown promising performance in multiple studies. Nonetheless, existing ap-, advances, but each comes with important drawbacks. Direct observation and manual tracking are labour-intensive

2026-06-09机器人

这篇论文针对野生动物监测中“看得清”与“少打扰”难以兼顾的问题,提出面向异构无人机群的扰动感知强化学习框架:用动物学仿真和由真实轨迹统计拟合的物种运动模型训练策略,在奖励中显式权衡观测质量与扰动风险。实验覆盖鸽、胡狼、距翅麦鸡及多种行为模式,学习策略优于规则基线,并在任务、动物动态和无人机类型间表现出泛化能力。

Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins Figure 1
2026-06-09cs.RO

Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins

Zhihao Liu, Victor Nan Fernandez-Ayala, Tianyu Wang, Qiang Qin, Xi Vincent Wang, Dimos V. Dimarogonas, Lihui Wang

2026-06-09机器人规划控制

论文针对LLM机器人规划难以保证物理可行、缺少执行反馈与人工监管的问题,提出将语言理解交给LLM、把约束验证、排序和执行交给确定性模块的神经符号框架。其核心是SDI多智能体架构、LangGraph故障路由、两级恢复和Unity数字孪生人工复核;在70条不同难度自然语言任务上达到100%成功率,并优于10个基线,消融显示命令结构化、符号验证、选择性路由和恢复技能均有必要。

Propeller-Assisted Robust 3D Hopping Robot with Hierarchical Force Allocation Figure 1
2026-06-09cs.RO

Propeller-Assisted Robust 3D Hopping Robot with Hierarchical Force Allocation

Chuhan Zhang, Hongbo Zhang, Yanlin Chen, Yunxi Tang, Yun-Hui Liu, Mingyi Liu, Xiangyu Chu

Department of Mechanical Engineering, Guangdong Technion–Israel Institute of Technology, China., Department of Mechanical Engineering, Technion–Israel Institute of Technology, Haifa, Israel., Multiscale Medical Robotics Centre, Hong Kong SAR.

2026-06-09机器人三维安全鲁棒

针对单足三维跳跃在飞行相欠驱动、仅短暂支撑相可用地面反力而难以抗扰的问题,论文提出 Pro-OMEGA2:以 3-RSR 主动并联腿负责主要跳跃与接触力,机身三旋翼只作姿态辅助,并用基于单刚体模型的分层力分配在支撑/飞行间协调腿力与推力。实机室内外实验显示其可持续三维跳跃,完成地形转换和冲击推搡恢复。

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving Figure 1
2026-06-09cs.RO

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving

Yuhong Shi, Jianyi Liu, Lihang Sun, Li Li, Xudong Dong

2026-06-09模仿学习

针对大模型自动驾驶在交互复杂、长尾场景中因分布偏移和因果混淆导致决策不稳的问题,论文提出 HiL-OBC,将人类接管从安全兜底转为在线监督信号;其 MOBC 以接管概率做软门控,并用贝叶斯后验适应持续更新策略。在 LangAuto-Human CARLA 上,StructNav、LFG、LMDrive 的驾驶得分分别提升 47.25%、31.59%、32.12%,同时减少交通违规。

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning Figure 1
2026-06-09cs.RO

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning

Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério

German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC), School of Computation, Information and Technology (CIT), Technical University of Munich (TUM), Arcisstr. 21, 80333 Munich, Germany.

2026-06-09机器人

面向工业装配中自然语言易用性与少样本技能学习难以兼得的问题,CLASP将预训练VLM与任务参数化KMP结合:用2–5次示教学习技能并自动生成技能schema,执行时由语言选择、绑定对象,并用协方差加权在轨迹层融合兼容技能;若能力缺口存在则主动请求新示教。7自由度机械臂实验在技能选择、组合和主动学习场景达到73.3%–100%成功率。

SynthICL: Scalable In-context Imitation Learning with Synthetic Data Figure 1
2026-06-09cs.RO

SynthICL: Scalable In-context Imitation Learning with Synthetic Data

Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

The Robot Learning Lab, Imperial College London

2026-06-09模仿学习

这篇论文针对 ICIL 依赖大量真实示教或点云导致扩展困难、sim-to-real 差距大的问题,提出 SynthICL:用 Isaac Sim 生成高保真 RGB-only 上下文—任务轨迹,训练 flow-matching Transformer,并加入预测下一子目标图像的辅助目标以强化视觉对齐。在 16 个未见真实操作任务中,仅给 1 次示教平均成功率达 79%,优于已有方法。

Vision-Guided Dual-Arm Humanoid Robotic Disassembly of End-of-Life 18650 Lithium-ion Battery Packs Figure 1
2026-06-09cs.RO

Vision-Guided Dual-Arm Humanoid Robotic Disassembly of End-of-Life 18650 Lithium-ion Battery Packs

Yile Chen, Zhihao Liu, Xi Vincent Wang, Lihui Wang

2026-06-09机器人视觉感知

面向退役 18650 电池包人工拆解风险高、现有机器人常依赖已知位姿/夹具/专用工具的问题,论文将单体级拆解建模为视觉引导双臂操作流程:用 RGB-D 与预训练抓取检测生成候选,结合腕部相机 look-and-move 离散修正,并通过双臂中途支撑转移替代外部夹具。在 21 节电芯 mock-up 上端到端成功率 8/10,电芯定位 RMSE 2.4 mm,平均每包 6.0 分钟。

Learning Predictive Control with Deep Koopman Operators for Autonomous Vehicle Motion Planning Figure 1
2026-06-09cs.RO

Learning Predictive Control with Deep Koopman Operators for Autonomous Vehicle Motion Planning

Xinglong Zhang, Yongqian Xiao, Haotian Cao, Xing Zhou, Xin Yin, Xin Xu

2026-06-09规划控制

针对自动驾驶运动规划中传统 MPC 依赖精确模型、在线求解非凸优化过慢的问题,论文将深 Koopman 预测器与滚动时域 actor-critic 结合,在升维线性可观测空间内学习闭环反馈策略,并把障碍物局部凸近似、势场及梯度嵌入策略学习。仿真和红旗 EHS3 实车避障实验显示,其相较 CBF-MPC、LMPCC 在安全性、实时性和舒适性上更优,但验证场景仍偏代表性工况。

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data Figure 1
2026-06-09cs.RO

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong Zhao, Jeff Lai, Chelsea Finn

Stanford University, 2 Meta

2026-06-09机器人

针对机器人操作缺少互联网规模交互数据的问题,Ego-Pi探索用第一视角人类示范与类人机器人数据共同微调π0.5 VLA。方法通过双手动作token交错扩展到灵巧双臂控制、将人手姿态对齐到机器人关节空间,并加入子任务生成辅助损失。实验显示机器人可从仅存在于人类数据中的排序规则、技能组合和规则化包装中迁移任务语义,多项成功率达到90%以上;但低层灵巧技能迁移仍未充分解决。

Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations Figure 1
2026-06-09cs.RO

Reinforcement learning in linear embedding space unlocks generalizable control across soft robot configurations

Xinglong Zhang, Cong Li, Hangjie Mo, Yue Jiang, Xin Xu, Wei Jiang, Zhenshan Bing, Yihe Yang, Xiaojian Li, Yueneng Yang, Huimin Lu, Ling-li Zeng, Alois Knoll, Dewen Hu, Li Wen, Wei Pan

2026-06-09机器人强化学习规划控制

针对软体机器人换材料、刚度或结构后需重新建模与重训控制器的问题,论文提出在一次预训练的 Koopman 线性嵌入空间中进行模型无关强化学习,使策略与具体形态解耦并可在线更新。该方法在 30 种软体机器人配置上验证,相比同类方法最多减少 75 倍训练样本,并在高速运动、1 kg 负载、多执行器故障及敲钉、倒饮料、书法等真实任务中保持可迁移控制性能。

Revisiting Articulated Parts Perception in Robot Manipulation Figure 1
2026-06-09cs.RO

Revisiting Articulated Parts Perception in Robot Manipulation

Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li

Shanghai Jiao Tong University

2026-06-09机器人

针对机器人操作中关节部件状态难以从单帧 RGB-D 稳健感知的问题,论文指出传统姿态标注成本高、基于点跟踪的 flow 噪声和歧义大,提出用三关键点表示运动轴与接触运动平面的 GPS,并结合 VR 快速人工标注构建 234 物体、41K 帧数据集。训练的 GPS 预测模型在感知上优于姿态/flow 基线,并在无域内微调的真实机器人实验中于 9 个物体、270 初始状态达到 73% 成功率。

Continual Quadruped Robots Coordination via Semantic Skill Discovery Figure 1
2026-06-09cs.RO

Continual Quadruped Robots Coordination via Semantic Skill Discovery

Daoqing Wang, Yuchen Xiao, Weixuan Huang, Zhilong Zhang, Shenghua Wan, Meng Li, Lei Yuan, Yang Yu

2026-06-09机器人

本文针对多四足机器人在开放任务流中团队规模和协作模式变化、易灾难性遗忘的问题,提出 Conquer 语义技能库框架,以“检索—适配—更新”复用已有协作技能;其 SAG 主干支持可变数量机器人,并用任务/轨迹语义描述组织 LoRA 技能。Isaac Lab 14 任务中最终平均成功率达 95.6%,显示前向迁移强、遗忘很小,Unitree Go2 实机验证了可部署性。

Cybernetic Android Avatar "Yui": System Integration, Field Deployment, and Evaluation Figure 1
2026-06-09cs.RO

Cybernetic Android Avatar "Yui": System Integration, Field Deployment, and Evaluation

Kaoruko Shinkawa, Mizuki Nakajima, Taisei Mogi, Yoshihiro Nakata

2026-06-09数据集/基准

针对视频会议和常见远程呈现机器人难以提供共享物理空间与细腻非语言线索的问题,论文集成全身安卓化身 Yui:55 自由度身体、拟人头部表情/凝视、手臂手部与移动底盘,并支持 HMD 沉浸式或摄像头桌面操控。三类真实部署显示,两台设备在大阪世博相关场景累计运行约 1131 小时,用户对共在感、拟人性和情绪意图传达评价较好,但维护负担与精细控制仍是主要瓶颈。

vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models Figure 1
2026-06-09cs.RO

vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models

Khanh D. Nguyen, Hung T. Ho, Chinh T. Nguyen, Thanh Q. Duong, Linh D. Le, Duy M. H. Nguyen, Vien A. Ngo, An T. Le

VinRobotics, Vietnam 2 Center for AI Research, VinUniversity, Vietnam, Max Planck Research School for Intelligent Systems, Germany, University of Stuttgart, Germany 6 German Research Center for Artificial Intelligence

2026-06-09视觉语言视觉感知

面向机器人端侧硬件难以承载 Python/PyTorch VLA 推理的问题,vla.cpp 将 llama.cpp 扩展为统一 C++ 运行时,原生支持缓存视觉语言前缀、跨注意力动作头及 flow/diffusion 多步去噪,并用单一 bundle 服务多类架构。实验显示其在 LIBERO-Object 上基本复现参考策略,BitVLA 以 1.3GiB 达到 100% 成功率,可跨 RTX 与 Jetson 运行;roofline 分析指出批量 1 推理主要受计算利用率限制,定制 IMMA GEMM 将 BitVLA 单步延迟降 4.5 倍。

Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning Figure 1
2026-06-09cs.RO

Cooperative Long Rope Skipping via Multi-Agent Reinforcement Learning

Zihao Wang, Shijie Peng, Kerui Wu, Yu Huang, Ruiqi Xue, Dong Liu, Tian Xu, Lei Yuan, Yang Yu

National Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China, School of Artificial Intelligence, Nanjing University, Nanjing, China, Beijing Academy of Artificial Intelligence, BAAI, Beijing, China

2026-06-09强化学习

这篇论文瞄准多人长绳跳中双人形机器人需协同甩动柔性绳并适配不同跳跃节奏的问题。作者提出 Marope:低层用 MAPPO/CTDE 学习去中心化甩绳技能,高层集中调度旋转中心与角速度,并用多样化跳跃策略增强泛化。仿真和 Unitree G1 实机结果显示,其相较无调度、无玩家多样性等基线降低碰撞与相位误差,提高完成率,并可与人类或机器人玩家协作。

Perceptive Behavior Foundation Model: Adapting Human Motion Priors to Robot-Centric Terrain Figure 1
2026-06-09cs.RO

Perceptive Behavior Foundation Model: Adapting Human Motion Priors to Robot-Centric Terrain

Zifan Wang, Yizhao Li, Teli Ma, Qiang Zhang, Yudong Fan, Hao Xu, Shuo Yang, Junwei Liang

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology, Artificial General Intelligence Institute, University of Science and Technology of China

2026-06-09机器人

针对人类动作先验默认与机器人地形兼容、在远程操作或不同环境中会失效的问题,论文提出 Perceptive BFM:保留原始运动参考作为指令,用机器人本地地形感知修正落脚、抬脚高度、姿态和接触时序。其核心是离线 TCRS 生成贴合地形的监督,再通过教师—学生与身份门控 Transformer 将能力迁移到部署策略。实验显示单一策略可在楼梯、斜坡、稀疏支撑和户外不规则地形上跟踪多类动作,但实机结果多为定性,定量部署增益仍不充分。

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets Figure 1
2026-06-09cs.RO

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizhuoma, Yue Zhao, Zhenshan Bing, Yan Ding, Jianxing Liu

School of Astronautics, Harbin Institute of Technology, Suzhou Research Institute, Harbin Institute of Technology, Shanghai Jiao Tong University, Shanghai AI Lab, Nanjing University, Xi’an Jiaotong-Liverpool University, Fudan University

2026-06-09机器人视觉感知

针对第一视角 RGB-D 示教虽易采集、却缺少物体位姿/几何/接触信息且常依赖 CAD 资产的问题,EgoAERO提出从单段自我中心视频中无资产重建接触一致的手-物轨迹,并通过两阶段残差学习迁移到灵巧手策略。实验显示其可完成单示教灵巧操作,在 HOI4D 上接近基于 CAD 重建的下游性能,并可迁移到真实机器人,但仍主要面向单手任务。

MuJoCo-Drones-Gym: A GPU-Accelerated Multi-Drone Simulator for Control and Reinforcement Learning Figure 1
2026-06-09cs.RO

MuJoCo-Drones-Gym: A GPU-Accelerated Multi-Drone Simulator for Control and Reinforcement Learning

Manan Tayal

2026-06-09强化学习规划控制

针对现有四旋翼学习环境在物理精度、多智能体支持与深度强化学习吞吐之间的取舍,本文将 gym-pybullet-drones 思路迁移并扩展到 MuJoCo/MJX,提供可切换气动模型、动作/观测接口、PettingZoo 多智能体封装、七类任务、风场与课程等包装器。结果展示其可作为控制与RL基准,并通过JAX向量化支持数千并行环境,但具体速度或性能增益幅度文中未充分说明。

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations Figure 1
2026-06-09cs.RO

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji Zhang, Chen Lv

Nanyang Technological University, Carnegie Mellon University, The Chinese University of Hong Kong, A*STAR Institute for Infocomm Research (I2R)

2026-06-09机器人模仿学习

面向未知环境中的目标导航,论文指出仅靠第一视角或文本化地图的 VLM 容易短视、重复探索。IntentNav 将人类低层动作通过前沿演化标注为高层搜索意图,在 BEV 空间统一前沿与目标候选,并结合候选视觉记忆训练 VLM 选择路点。实验显示其在 MP3D、HM3D-v1/v2 上达到或接近 SOTA,并可零样本迁移到轮式、四足和人形机器人。

Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies Figure 1
2026-06-09cs.RO

Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies

Ziqian Wang, Jiayu Sun, Xingjian Mao, Minqian Wang, Yao Mu

Shanghai Jiao Tong University, University of Michigan, Ann Arbor, University of Electronic Science and Technology of China

2026-06-09生成模型优化算法

这篇论文针对流匹配 VLA 难以用强化学习微调的问题:策略无显式似然,直接把 Q 值反传过多步去噪又不稳定。Q-VGM 的关键是把动作空间的 Q 梯度转成去噪时刻的速度场修正,用 look-forward、Q 梯度上升和 keep-best 机制做残差速度匹配,而非只在测试时选动作或蒸馏终端动作。在固定自采样回放数据上,LIBERO 成功率由 75.0% 提升到 92.5%,RoboTwin 2.0 由 76.4% 到 87.2%,真实机器人由 40.0% 到 67.5%。

PRISM: PRior-guided Imagination Sampling in world Models Figure 1
2026-06-09cs.RO

PRISM: PRior-guided Imagination Sampling in world Models

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye

Northeastern University, University of California, Berkeley, Qiyuan Lab, University of Florida

2026-06-09强化学习

PRISM关注世界模型规划中“先采哪些动作”这一瓶颈:无先验的MPPI/CEM会浪费大量采样,而外部VLM/策略先验又带来冗余。其核心是在冻结的JEPA世界模型编码器上接轻量MLP预测状态条件高斯动作先验,并用精度加权的高斯乘积闭式融合到采样分布中;先验不确定时可退回普通规划。实验在PushT和Cube上较vanilla世界模型MPC提升约32–35个百分点,且小采样预算下收益最大、推理开销很小。

X-OP: Cross-Morphology Whole-Body Teleoperation via MPC Retargeting Figure 1
2026-06-09cs.RO

X-OP: Cross-Morphology Whole-Body Teleoperation via MPC Retargeting

Jen-Wei Wang, Sarthak Kaingade, Andrea Tagliabue, Nicholas Morozovsky

University of California, Berkeley

2026-06-09规划控制

面向具身操作数据采集,论文针对外骨骼/多相机成本高、单XR端到端策略需按机器人重训且易失稳的问题,提出单XR驱动的分层全身遥操作:用MPC/MPPI在MuJoCo数字孪生中把人意图重定向为低层控制器命令,并通过状态同步与SLAM反馈处理噪声、接触和漂移。仿真与实机在类人和移动操作臂上验证,类人任务时间降超30%、能耗降超20%,移动操作臂实现零碰撞。

End-to-End Control of a Powered Knee-Ankle Prosthesis Towards Unified, Tuning-Free Assistance Figure 1
2026-06-09cs.RO

End-to-End Control of a Powered Knee-Ankle Prosthesis Towards Unified, Tuning-Free Assistance

John Shim, Christoph Nuesslein, Sixu Zhou, Hanjun kim, Kinsey Herrin, Aaron Young

2026-06-09规划控制

针对动力膝踝假肢依赖阻抗控制、需人工调参与显式步态/地形分类的问题,论文将TCN直接从机载编码器、IMU和力传感器映射到连续力矩与摆动轨迹,实现无模式标签的端到端实时控制。基于18名大腿截肢者多地形数据训练,并在4名受试者五类行走任务中验证:踝力矩随速度、坡道上膝预屈随坡度、下坡阻尼力矩等关系基本复现训练数据,楼梯转换也较平滑,显示其统一自适应辅助的可行性。

TBD-VLA: Temporal Block Diffusion Vision Language Action Model Figure 1
2026-06-09cs.CV

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

University of Virginia

2026-06-09视觉感知生成模型

面向离散 VLA 逐 token 自回归解码延迟高、并行解码又缺少显式时序依赖的问题,TBD-VLA 将动作序列切成时间块,在块内做掩码离散扩散并行生成、块间保持自回归,还利用时间补全支持 Real-Time Chunking 异步执行。论文报告其在仿真和真实操作、多种扰动下优于既有 VLA,并在 LIBERO 中以 2B 模型达到 0.117s 延迟,兼顾速度与时序一致性。

Path Planning Using Deep Deterministic Policy Gradient: A Reinforcement Learning Approach Figure 1
2026-06-09cs.RO

Path Planning Using Deep Deterministic Policy Gradient: A Reinforcement Learning Approach

Qiang Le, Yaguang Yang, Isaac E. Weintraub

Qiang Le 2 2 2 Associate Professor, Department of Electrical and Computer Engineering Hampton University, Hampton, VA, Yaguang Yang 3 3 3 Research Scientist, Department of Electrical and Computer Engineering Hampton University, Hampton, VA

2026-06-09强化学习规划控制优化算法

本文针对威胁/障碍环境中自动体路径规划的非线性、非凸与实时求解困难,采用 DDPG 在连续状态和动作空间中学习从位置、航向到转向动作的策略。核心设计是将目标吸引场、圆形禁区排斥场与航向变化能耗惩罚结合,并加入智能初始航向以提升避障训练稳定性。仿真含单/多障碍场景,并与伪谱最优控制比较,结果显示路径可行且推理显著更快,更适合实时任务规划。

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots Figure 1
2026-06-09cs.RO

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots

Aniket Patil, Mandeep Singh, Uday Girish Maradana, Nitin J. Sanket

Perception and Autonomous Robotics (PeAR) Group, Robotics Engineering Department, Worcester Polytechnic Institute.

2026-06-09机器人生成模型

面向微型无人机传感器与算力受限、难以依赖深度重建的问题,MinNav用单目前向相机估计光流及其不确定性,并结合场景类型判别与主动探索控制,在未知静态障碍、动态障碍和异形缝隙间寻找自由空间。实机与仿真显示总体成功率约70%,性能接近深度方法且计算量低得多,但动态避障仍受视野和约100 ms延迟限制。

DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features Figure 1
2026-06-09cs.CV

DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features

Knut Peterson, Zaid Mayers, David Han

2026-06-09视觉感知学习理论

面向远距离无人机监视中单目图像目标仅占少量像素、框噪声和背景干扰导致测距不稳的问题,论文提出 DroneDAR:以 ResNet 替换 DroneRanger 的自定义 CNN,并用轻量边界框特征门控在外观与几何尺度线索间自适应融合。LRDDv3 实验显示其在各距离段均优于基线,最佳配置为 ResNet-18、220×220 裁剪和 Huber loss;同时指出更大骨干收益有限,极远距离误差仍主要受框噪声与纹理缺失限制。

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation Figure 1
2026-06-09cs.RO

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing Qu, Stan Birchfield, Jonathan Tremblay, Valts Blukis

University of Michigan

2026-06-09机器人

面向真实机器人中开放词汇、长时程操作的规划、监控与失败恢复难题,VoLo 将 VLA/WAM 不再视为固定执行器,而是作为可中断工具,由 VLM 在闭环中协调感知模型和抓取/放置原语。论文同时提出 RoboVoLo 基准,覆盖常识、记忆、复杂指代和世界知识等 126 个任务;实验显示 VoLoAgent 优于单一 VLA/VLM、代码策略和 TAMP 式系统,并在 Franka 实机上验证了编排相对独立动作模型的提升。

Astro, I'm Home! Investigating Factors that Influence the Acceptance of Home Robots Using Supervised Machine Learning Figure 1
2026-06-09cs.CY

Astro, I'm Home! Investigating Factors that Influence the Acceptance of Home Robots Using Supervised Machine Learning

Katrin Fischer, Essence Wilson, Steffie Kim, Dmitri Williams

2026-06-09机器人

针对传统技术接受模型难以刻画家用社交机器人“具身”特征的问题,本文以 Astro 家庭机器人视频实验和问卷数据为基础,引入 Lasso、Ridge 等监督学习正则化方法筛选影响使用意向的变量。结果显示,UTAUT2 中绩效期望、社会影响和享乐动机最稳定;模型还提示可用性、信任与能力感是预测家用机器人接受度的关键补充因素。

2026-06-08

50 篇
Affordance-Based Hierarchical Reinforcement Learning for Quadruped Pedipulation Figure 1
2026-06-08cs.RO

Affordance-Based Hierarchical Reinforcement Learning for Quadruped Pedipulation

Tuba Girgin, Jose Castelblanco, Gabriel Rodriguez, Emre Girgin, Cagri Kilic

This study is partially supported by 2024-2025 COE-The Boeing Center for Aviation and Aerospace Safety (BCAAS), Research Stimulus Program. 1 Department of Aerospace Engineering, Embry-Riddle Aeronautical University, Daytona Beach, FL, USA.

2026-06-08强化学习

针对四足机器人用腿操作物体仍依赖专家设计高层轨迹的问题,论文提出基于可供性的三层层级强化学习:由激光点云估计可达且适合地形的基座位姿与物体接触点,再驱动导航、行走和足端操作策略。系统在 Isaac Sim 训练并迁移到 Unitree Go2 实机,能在不同坡度和随机物体场景中自主选择候选位姿并完成交互,同时采集开放环境物体交互数据;但多模块误差累积对精细操作成功率仍是主要限制。

Physiologically Constrained Musculoskeletal Neural Network for Multi-DoF Joint Kinematics Estimation from Partially Observed sEMG Figure 1
2026-06-08eess.SY

Physiologically Constrained Musculoskeletal Neural Network for Multi-DoF Joint Kinematics Estimation from Partially Observed sEMG

Wending Heng, Mingming Zhang, Glen Cooper, Zhenhong Li

University of Manchester, Southern University of Science and Technology

2026-06-08机器人

针对表面肌电只能观测部分相关肌肉、导致腕关节多自由度运动估计缺乏生理一致性的问题,论文提出MSK-NN:用CNN从已测sEMG联合推断已测与未测肌肉激活,并嵌入可微Hill型肌骨前向动力学,通过运动学、肌肉协同和解剖趋势损失训练而不依赖力/力矩标签。在6名受试者两自由度腕部任务中,其NRMSE和R²优于CNN、Bi-LSTM、CNN-LSTM和PET,随机运动增益更明显,且被排除输入的ECRB激活与真实sEMG包络时间一致。

Planning-aligned Token Compression for Long-Context Autonomous Driving Figure 1
2026-06-08cs.RO

Planning-aligned Token Compression for Long-Context Autonomous Driving

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

2026-06-08规划控制

针对端到端 VA/VLA 自动驾驶在长历史上下文下 token 过多、而基于时间衰减的压缩易丢失让行/停车等关键线索的问题,论文提出 COMPACT-VA:用条件 VQ-VAE 和 Q-former 将压缩记忆与历史轨迹、学习到的规划意图耦合,并以分层 FIFO 保留上下文。在四向停车、遮挡、无保护转弯等高信号场景中,其成功率达 68.3%,较基线约提升 6.3%,roll-through 降低 22%,同时相对未压缩处理实现 3.3 倍加速和 2.7 倍显存降低。

On orbital stabilization of a circular motion primitive for a dynamic extension of the Dubins car model Figure 1
2026-06-08eess.SY

On orbital stabilization of a circular motion primitive for a dynamic extension of the Dubins car model

Artem Angelchev-Shiryaev, Pavel E. Aleshin, Anton S. Shiriaev, Pavel A. Shamanaev, Leonid B. Freidovich

Department of Industrial and Mechanical Sciences, Lund University, Lund, Sweden, Department of Information Technologies, Sirius University, Sirius, Russia, Department of Engineering Cybernetics, NTNU, Trondheim, Norway, Department of Applied Physics and Electronics, Umeå University, Umeå, Sweden

2026-06-08机器人

本文关注带动力学扩展的 Dubins 小车在圆周运动基元上的轨道稳定问题,动机是非完整约束系统中常规横向线性化可能既不稳定又不可由线性反馈镇定。作者的核心洞察是利用运动邻域的特殊结构与非标准横向坐标,给出可显式验证的适用条件,使基于横向线性化的设计仍可用于非线性系统。主要结果证明即使横向线性化不可镇定,仍可通过光滑反馈实现该圆周运动的轨道稳定,并用数值仿真展示设计流程。

Re-imagining ISO 26262 in the Age of Autonomous Vehicles: Enhancing Controllability through Transferability and Predictability Figure 1
2026-06-08cs.RO

Re-imagining ISO 26262 in the Age of Autonomous Vehicles: Enhancing Controllability through Transferability and Predictability

Chaitanya Shinde, Hadi Hajieghrary, Paul Schmitt, Adam Shoemaker, Bodo Seifert, Steve Kenner

2026-06-08规划控制

针对 ISO 26262 默认有人类驾驶员可接管、难以直接评估 L4/L5 自动驾驶安全的问题,论文将可控性重构为可转移性与可预测性:前者衡量故障容忍时间内切换到后备安全机制的能力,后者衡量外部交通参与者能否预判车辆行为,并引入设计—可达差距 ΔT、ODD 分片证据与验证准则。主要结果是形成与 ISO 26262/SOTIF 兼容的可审计指标框架,但文中未充分说明实际系统上的量化安全增益。

Rapid co-design of Buoyancy-assisted robots for Challenging Locomotion using Gaussian Evolutionary Specialists Figure 1
2026-06-08cs.RO

Rapid co-design of Buoyancy-assisted robots for Challenging Locomotion using Gaussian Evolutionary Specialists

Ankit Sinha, Nitish Sontakke, Dennis Hong, Yusuke Tanaka, Sehoon Ha

Ankit, Nitish and Sehoon are with the School of Interactive Computing, Georgia Institute of Technology, TSRB 85 5th St NW, Atlanta, GA - 30332, USA

2026-06-08机器人三维

面向 BALLU 这类对浮力、腿长等形态高度敏感的机器人,传统协同设计需为每个候选形态反复训练 RL 控制器,代价很高,而通用策略又会行为多样性坍塌。论文提出 GES,将设计空间划成演化的高斯“领地”,让专家策略分别学习并作为零样本评估器。实验中其较朴素通用策略提升约 5–25%,硬件上越过 24 cm 障碍,较基线提升 3 倍,并将优化时间减少 37%。

Simulation-Driven Imitation Learning for Biosignals-Free Shared-Autonomy Prosthetic Grasping Figure 1
2026-06-08cs.RO

Simulation-Driven Imitation Learning for Biosignals-Free Shared-Autonomy Prosthetic Grasping

Kaijie Shi, Wanglong Lu, Huiling Chen, Vinicius Prado da Fonseca, Ting Zou, Hanli Zhao, Xianta Jiang

2026-06-08模仿学习

针对无肌电假肢共享自治抓取中真实示教采集昂贵、难扩展且泛化不足的问题,论文构建了可自动生成腕部视角示教的仿真框架,结合可行抓取合成、自然手腕轨迹重定向和程序化室内场景,用于训练模仿学习策略。仿真基准显示数据足以支持有效学习,迁移到真实假肢后在12名参与者、1800次试验的三类设置中抓取成功率超过90%,但增益可能主要来自scaling / data。

Spline Policy: A Structured Representation for Robot Policies Figure 1
2026-06-08cs.RO

Spline Policy: A Structured Representation for Robot Policies

Mengze Tian, Yiming Li, Sichao Liu, Auke Ijspeert, Sylvain Calinon

2026-06-08机器人强化学习

针对模仿学习中固定分辨率 action chunk 难以显式表达连续性、重采样和控制约束的问题,论文提出 Spline Policy:在不改动扩散、流匹配、Transformer、VLA 等骨干的前提下,让策略预测样条参数,并可进一步转为局部闭环向量场。实验覆盖低维、仿真、灵巧手和真机任务,显示其与现代策略兼容,并带来紧凑解码、扰动修正、不确定性传播和控制器集成能力;但性能增益相对具体任务与基线的来源仍需细看实验设置。

RhinoVLA Technical Report Figure 1
2026-06-08cs.RO

RhinoVLA Technical Report

Huixi Intelligence : Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

2026-06-08机器人

本文针对 VLA 机器人策略难以在边缘端实时闭环部署的问题,指出延迟瓶颈不只是参数量,而是视觉与上下文 token 触发的 GEMM 投影开销。RhinoVLA 以 token 更省的 Qwen3-VL、连续 Action Expert、72D 统一状态动作槽、View Registry 和机器人实例 LoRA 进行模型—芯片协同设计,并在 Huixi R1 上结合编译、混合精度和并行视觉编码优化;实验显示其性能接近 π0.5,同时达到 11.69 Hz,超过 10 Hz 实时控制目标。

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos Figure 1
2026-06-08cs.CV

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos

Anurag Ghosh, Francesco Pittaluga, Khiem Vuong, Angela Chen, Juan Alvarez-Padilla, Manmohan Chandraker, Srinivasa Narasimhan

Carnegie Mellon University, NEC Labs America, referenced 3D reconstruction at metric scale (center). Long-tailed objects such as cones, barrels, and barricades, ∗Work done at Carnegie Mellon University, platforms, spans more cities and unusual situations than any publicly available autonomous vehicle, maintained map, yields a scalable, annotation-free signal of data quality (Fig. A.1). This allows us to

2026-06-08视觉感知

自动驾驶仿真依赖少量车队数据或人工合成场景,难覆盖施工区等长尾情形。Dash2Sim利用街景等公共参考从野外单目行车记录仪视频恢复带尺度和地理配准的4D驾驶日志,并用独立地图进行免标注闭环可用性验证,构建ROADWork4D。数据含17城4244场景、274万3D框;2201个验证场景显示现有闭环规划器在施工区换道上普遍失败,规则/混合方法优于学习方法,恢复深度还使新视角合成感知指标最高提升19%。

CAPE: Contrastive Action-conditioned Parallel Encoding for Embodied Planning Figure 1
2026-06-08cs.RO

CAPE: Contrastive Action-conditioned Parallel Encoding for Embodied Planning

Cong Chen, Haowen Wang, Zhixiang Zhang, Pei Ren, Zhengping Che

2026-06-08规划控制

这篇论文针对视觉动力学模型在机器人规划中容易把容量耗在背景、纹理等与动作无关信息,且自回归 rollout 成本高、误差累积的问题,提出 CAPE:从初始视觉上下文和候选动作序列一次性并行预测未来潜表示,并用目标收敛对比目标强化不同动作导致的结果差异。实验在 DROID 和零样本 RoboCasa 上显示,其在未来状态检索、离线动作匹配和闭环规划中优于基线,同时降低长时域规划推理开销。

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation Figure 1
2026-06-08cs.RO

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

Harbin Institute of Technology (Shenzhen), Pengcheng Laboratory, Harbin Institute of Technology (Shenzhen) Shenzhen China, Pengcheng Laboratory Shenzhen China

2026-06-08机器人视觉语言视觉感知规划控制

针对 VLN-CE 中传统“点式”航点易落在不可达区域、且高层规划与低层控制脱节的问题,论文提出 Trajectory Waypoint:不再只预测目标点,而是生成带完整可执行路径的候选轨迹。方法用 TSDF 引导的扩散策略避障采样,并让导航器直接基于轨迹几何和时序信息做语言条件选择。VLN-CE 实验显示其在候选可达性(%Open)和下游导航性能上均优于基线。

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking Figure 1
2026-06-08cs.CV

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

Eduardo Borges, Luís Garrote, Urbano J. Nunes

Authors are with the Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra, Portugal.

2026-06-08视觉感知三维

面向移动机器人在人群中3D行人跟踪易因遮挡和拥挤发生ID切换的问题,论文系统考察RGB外观ReID是否值得加入LiDAR几何跟踪,采用投影式轻量外观分支比较CNN/ViT、融合与记忆策略。KITTI实验显示,简单线性融合会受视觉噪声拖累而降性能;将ReID作为级联二阶段仅用于找回丢失轨迹更有效,MobileNetV2/MGN等轻量网络在时延与身份一致性间较优。

Robotic Policy Adaptation via Weight-Space Meta-Learning Figure 1
2026-06-08cs.RO

Robotic Policy Adaptation via Weight-Space Meta-Learning

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

University of Verona, ItalAI and Sapeinza University of Rome

2026-06-08机器人强化学习

针对VLA机器人策略在新任务上仍依赖带动作标注示范和逐任务微调的问题,论文提出WIZARD:把适应视为权重空间推断,由语言指令和短示范视频一次前向生成冻结VLA的任务LoRA适配器。其元训练学习任务证据到专家LoRA更新的映射,无需测试时优化。LIBERO上对未见数据集最高约2倍、未见任务最高约14倍提升,真实Franka实验也优于实域适配基线。

An Abstract Architecture for Explainable Autonomy in Hazardous Environments Figure 1
2026-06-08cs.RO

An Abstract Architecture for Explainable Autonomy in Hazardous Environments

Matt Luckcuck, Hazel M Taylor, Marie Farrell

Department of Computer Science, & Hamilton Institute, Maynooth University, University of Manchester

2026-06-08机器人

面向核工业等危险环境中人机共用的自主机器人,论文关注操作者和监管者如何信任系统决策。其核心是把可解释性前置到架构设计中:以BDI智能体承担高层决策,并与解释器组成Central Executive,集中接收系统信息,以支持对过去行为和未来不行动的“为什么”解释。文中主要给出抽象架构和民用核场景示例,尚未实现或实证评估,实际效果仍待验证。

Shield-Loco: Shielding Locomotion Policies with Predictive Safety Filtering Figure 1
2026-06-08cs.RO

Shield-Loco: Shielding Locomotion Policies with Predictive Safety Filtering

Aditya Shirwatkar, Sebastian Sanokowski, Shishir Kolathaya, Aaron Johnson, Majid Khadiv

Robert Bosch Center for, Indian Institute of Science, Munich Institute of Robotics and, Technical University of Munich, Department of Computer, Department of, Carnegie Mellon University, Institute for Advanced Study

2026-06-08机器人安全鲁棒

针对接触条件化强化学习腿式运动在未训练障碍环境中缺乏安全约束的问题,Shield-Loco不改动原策略,而是在足端接触位置上加预测安全过滤:用全物理滚动预测碰撞,并以采样优化、价值函数引导、几何投影、动量更新和 replica-exchange 搜索更安全的落脚序列。四足机器人仿真与实机密集杂乱场景中,安全违规显著减少且对名义步态扰动较小,但文中也承认缺少理论安全保证。

A Causal Probabilistic Framework for Perception-Informed Closed-Loop Simulation of Autonomous Driving Figure 1
2026-06-08cs.RO

A Causal Probabilistic Framework for Perception-Informed Closed-Loop Simulation of Autonomous Driving

Zhennan Fei, Rickard Johansson, Mikael Andersson, Matthias Eng, Mattias Eriksson, Kaveh Kianfar, Sadegh Rahrovani, Chris van der Ploeg, Michael Borth, Maren Buermann, Michiel Braat, Henk Goossens, Zijian Han, Majid Khorsand Vakilzadeh, Gabriel Rodrigues de Campos

2026-06-08机器人

论文针对自动驾驶SIL仿真常用“理想感知”会低估SOTIF风险、而全栈传感器仿真成本过高的问题,提出用贝叶斯因果概率模型在对象级闭环仿真中注入由雾雨、低清晰度、目标重叠等触发的漏检、尺寸和位置误差,并接入OpenSCENARIO/OSI工具链。实验表明,该方法能暴露理想仿真中隐藏的危险控制反应,同时保持可扩展性。

Test-Time Trajectory Optimization for Autonomous Driving Figure 1
2026-06-08cs.RO

Test-Time Trajectory Optimization for Autonomous Driving

Yihong Xu, Eloi Zablocki, Yuan Yin, Elias Ramzi, Ellington Kirby, Alexandre Boulch, Matthieu Cord

2026-06-08规划控制优化算法

论文指出端到端自动驾驶规划常受限于一次性候选轨迹集合,即使评分器足够好也只能“择优而非改进”。TOAD将冻结评分器视为轨迹级奖励,在测试时用CEM从基规划器轨迹热启动并连续搜索,无需重训;同时发现只有能泛化到候选集外的评分器才适合优化。实验中其在六个规划器上提升NAVSIM-v1/v2表现,DrivoR+TOAD在NAVSIM-v2达56.3 EPDMS,并在HUGSIM闭环评测中改进。

QuadVerse: An Integrated Framework Aligning Visual-Physical Reality for Quadruped Simulation Figure 1
2026-06-08cs.RO

QuadVerse: An Integrated Framework Aligning Visual-Physical Reality for Quadruped Simulation

Yuxiang Chen, Yuanhao Wang, Ziheng Zhang, Meng Zhang, Yu Liu, Yufei Jia, Tiancai Wang, Erjin Zhou, Jin Xie

Nanjing University, Tsinghua University

2026-06-08机器人

针对四足机器人仿真到现实中视觉、接触和执行器误差相互累积的问题,QuadVerse把RGB重建的几何约束3DGS场景作为统一校准基底,结合批量逼真自视角渲染、语义网格摩擦先验与轨迹后验搜索,以及残差执行器补偿来对齐物理交互。实验显示其提升重建质量和运动跟踪,渲染超过2000 FPS,并在无需任务级真实试跑的户外视觉导航中达到84%真实成功率,接近仿真92%。

Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models Figure 1
2026-06-08cs.RO

Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models

Jinhao Wu, Shiduo Zhang, Yicheng Liu, Xiaopeng Yu, Sixian Li, Siyin Wang, Hang Zhao, Jing Huo, Yang Gao, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang

Nanjing University, Shanghai Innovation Institute, Fudan University, Tsinghua University

2026-06-08视觉语言视觉感知规划控制

本文针对 VLA 直接从视觉语言输入生成动作时缺少中间运动意图、长程任务易误差累积的问题,提出 Coarse-to-Control:先在动作 token 空间预测粗粒度未来轨迹,再以其为前缀生成可执行动作,并用共享 residual-VQ 词表对齐规划与控制。实验显示其在 LIBERO 达 97.90%、SimplerEnv-WidowX 达 83.3%,且在真实操作和多阶段长程任务中优于直接生成及文本/视觉/空间 CoT 基线。

LARA: Latent Action Representation Alignment for Vision-Language-Action Models Figure 1
2026-06-08cs.CV

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

2026-06-08视觉语言视觉感知

LARA针对机器人动作标注数据稀缺、LAM与VLA分开训练导致潜在动作未与真实轨迹对齐的问题,提出在扩散式VLA中联合优化LAM和策略的潜在动作表示对齐机制,使LAM受真实动作约束、VLA受前向动力学正则。实验覆盖3个仿真和1个真实操作基准,分别在完整训练、后训练增强和LAM精炼中带来约10%、5%、15%的平均提升。

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning Figure 1
2026-06-08cs.RO

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

Tsinghua University

2026-06-08强化学习

针对现有世界动作模型在长程任务中过度依赖视频预测、推理开销大且语言只作静态指令的问题,论文提出 AdaWAM:用轨迹线索与 VLM 标注任务切换和精细操作阶段,并训练轻量动态路由器,在需要时触发文本推理或视觉“想象”,其余时间仅解码动作。实验在 LIBERO、RoboTwin 2.0 及真实 ALOHA/PiPER 任务上显示,其在长程和高难精细操作中优于多种 WAM/VLA 基线,同时降低推理开销。

Predictive Style Matching: Natural and Robust Humanoid Locomotion Figure 1
2026-06-08cs.RO

Predictive Style Matching: Natural and Robust Humanoid Locomotion

Simeon Nedelchev, Ekaterina Chaikovskaia, Egor Davydenko, Eduard Zaliaev, Roman Gorbachev

2026-06-08机器人安全鲁棒

论文针对人形机器人强化学习步态虽稳健但上身僵硬、不自然,而运动模仿又会削弱扰动恢复的问题,提出 PSM:用离线预测器把下肢历史和速度指令映射为可解释的上身关节与步态目标,仅在训练中作为奖励。Unitree G1 仿真和实机结果显示,其上身风格误差较任务型 RL 约降一个数量级,同时保持跌倒恢复率;模仿基线更像参考动作但扰动下跌倒约多 5 倍。

Extending Responsibility-Sensitive Safety for the Assessment of Offloaded Autonomous Driving Services Figure 1
2026-06-08cs.RO

Extending Responsibility-Sensitive Safety for the Assessment of Offloaded Autonomous Driving Services

Robin Dehler, Aryan Thakur, Michael Buchholz

All authors are with the Institute of Measurement, Control and Microtech-, nology, Ulm University, Albert-Einstein-Allee 41, 89081 Ulm, Germany

2026-06-08安全鲁棒

面向自动驾驶功能卸载带来的V2X时延波动,论文指出传统RSS未区分本地与卸载服务的响应时间,难以评估卸载后的安全余量。作者扩展RSS,引入“guarded”状态,并将其用于SOFOF卸载决策、受控回退和热待机切换:只有端到端时延下仍安全才允许卸载。仿真与实车测试显示,该方法相比现有卸载框架提升安全性,但以一定效率损失为代价。

A Multi-Operator Mixed-Reality Interface for Multi-Robot Control and Coordination: Co-Located and Private Workspace Collaboration Figure 1
2026-06-08cs.RO

A Multi-Operator Mixed-Reality Interface for Multi-Robot Control and Coordination: Co-Located and Private Workspace Collaboration

Omotoye Shamsudeen Adekoya, Antonio Sgorbissa, Carmine Tommaso Recchiuto

2026-06-08机器人规划控制

面向多机器人任务中多名操作员需共享态势且避免指令冲突的问题,论文将 HORUS MR 小地图界面扩展为多用户协作系统,支持同址共享工作区与各自私有工作区,并用共享会话同步和按机器人控制租约实现任务分配、遥操作与交接仲裁。36 人实验显示两种模式任务表现相近,但同址共享显著提升协作感、共同理解和交接清晰度,说明其主要收益在协调流畅性而非短时任务吞吐。

Task Editing for Generalizable 3D Visuomotor Policy Learning Figure 1
2026-06-08cs.RO

Task Editing for Generalizable 3D Visuomotor Policy Learning

Jian-Jian Jiang, YiHan Yang, Lan Wei, Yuming Luo, Xiao-Ming Wu, Xuhang Chen, Bin Fan, Dandan Zhang, Wei-Shi Zheng

Sun Yat-sen University, Imperial College London, Nanyang Technological University, South China University of Technology

2026-06-08强化学习三维

针对3D视觉运动策略依赖大量真实示教、且现有物体中心增强难以改变场景结构和技能序列的问题,Task-Edit将任务拆为场景、技能、物体三类属性,在Real2Sim2Real流程中独立编辑并重组,用单条示教合成多样轨迹,同时用深度与点云修复减小仿真到真实差距。真实机器人实验显示其在长程操作、跨场景泛化,以及扰动、障碍和杂乱场景等难采集设置中均优于基线。

Mission-Level Runtime Assurance Framework for Autonomous Driving Figure 1
2026-06-08cs.RO

Mission-Level Runtime Assurance Framework for Autonomous Driving

Chieh Tsai, Salim Hariri

2026-06-08机器人

论文指出,自动驾驶的运行时安全监控若只关注碰撞、车道等平台级安全,可能放过会跳过检查点、进入禁区或耗尽任务预算的高层指令。作者提出任务级运行时保障框架,用 successor-safe 监控在执行前联合预测平台安全与未来任务可行性,并以回退动作替换不可接受指令。在 highway-env 任务故障注入实验中,该方法将随机故障下任务成功率约从 0.44 提升到 0.73。

Compliance-Based Sensor Placement for Force Sensing on a Sensorized Prostate Phantom Figure 1
2026-06-08cs.RO

Compliance-Based Sensor Placement for Force Sensing on a Sensorized Prostate Phantom

Sizhe Tian (CRIStAL, DEFROST), Yinoussa Adagolodjo (CRIStAL, Polytech Lille, Jeremie Dequidt (CRIStAL

2026-06-08机器人

面向前列腺指检训练中需在不遮挡接触面、不过度降低硅胶柔顺性的条件下估计按压位置与力大小,论文用FEM被动柔顺性矩阵联合表面位移标记和3个内置气腔压力信号,并提出带ROI权重的贪心传感器布置,优先提升DRE后侧接触区可观测性。仿真中选取10个表面标记后,ROI最小奇异值均值较QR布置提高22.5%,但硬件与下游力定位验证尚未完成。

LIMMT: Less is More for Motion Tracking Figure 1
2026-06-08cs.RO

LIMMT: Less is More for Motion Tracking

Yu Guan, Zekun Qi, Chenghuai Lin, Xuchuan Chen, Dairu Liu, Wenyao Zhang, Jilong Wang, Xinqiang Yu, He Wang, Li Yi

2026-06-08视觉感知

针对人形机器人运动跟踪中“大规模动捕数据未必更好”、网络数据常含物理伪影且训练昂贵的问题,LIMMT从数据中心视角将质量定义为物理可行性、动作多样性与复杂度,并提出GQS:先用仿真过滤不可实现动作,再用谐波运动嵌入建模语义多样性,最后进行复杂度加权采样。实验显示,仅用AMASS约3%精选数据即可超过全量训练,并能迁移到不同跟踪器。

T-GMP: Terrain-conditioned Generative Motion Priors for Versatile and Natural Humanoid Locomotion Figure 1
2026-06-08cs.RO

T-GMP: Terrain-conditioned Generative Motion Priors for Versatile and Natural Humanoid Locomotion

Junhong Guo, Hao Hu, Chen Chen, Haoxuan Han, Linao Gong, Xin Yang, Zhicheng He, Yao Su, Fenghua He

Harbin Institute of Technology

2026-06-08机器人生成模型

论文针对人形机器人在复杂地形上常见的“能走但不自然”问题,指出固定运动先验会与地形适应需求冲突。T-GMP用CVAE从少量状态-地形示范中学习地形条件化的潜在运动流形,并通过地形条件判别器和落脚惩罚融入对抗强化学习,使策略随地形平滑切换全身协调风格。实验在八类地形和全尺寸机器人部署中显示,其通过率与运动平滑性优于基线,同时保留更拟人的手臂、躯干和重心调节行为。

ActionMap: Robot Policy Learning via Voxel Action Heatmap Figure 1
2026-06-08cs.RO

ActionMap: Robot Policy Learning via Voxel Action Heatmap

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

Show Lab, National University of Singapore

2026-06-08机器人强化学习

本文针对现有 VLA 动作解码器多为单点预测、难以利用动作空间几何邻近性的不足,提出可替换原解码头的 ActionMap:用平移、旋转和夹爪的体素热力图表示动作分布,并以高斯软标签训练、再解码为连续动作。该方法在 OpenVLA-OFT 和 π0.5 上均有效,LIBERO 平均分别提升 +8.2% 和 +1.6%,低数据下更稳,真实 Franka 任务成功次数也显著高于 L1 回归头。

A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation Figure 1
2026-06-08cs.RO

A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation

Kangjian Zhu, Haobo Jiang, Jianjun Qian, Jin Xie

Nanjing University of Science and Technology, Nanyang Technological University, Nanjing University

2026-06-08三维安全鲁棒

针对单视角RGB-D在角落视角下易受遮挡、而传统多视角预重建耗时且可能损失几何细节的问题,论文提出仅引入一个辅助视角的后融合6-DoF抓取估计框架;其关键在于用跨视角自监督对比学习约束点特征的空间一致性与抓取方向可分性,并通过跨视角对齐的圆柱积分模块聚合抓取相关局部几何。在GraspNet-1Billion及真实实验中,该方法相较现有SOTA在Seen、Similar、Novel划分上均取得AP提升。

Neuro-Symbolic Learning for Long-Horizon Task Planning Under Complex Logical Constraints Figure 1
2026-06-08cs.RO

Neuro-Symbolic Learning for Long-Horizon Task Planning Under Complex Logical Constraints

Qiwei Du, Zitong Zhan, Shaoshu Su, Bowen Li, Yi Du, Zhipeng Zhao, Taimeng Fu, Sebastian Scherer, Jiaoyang Li, Chen Wang

2026-06-08规划控制优化算法

面向长时程机器人任务规划中对象多、逻辑约束复杂导致符号搜索爆炸的问题,论文指出既有对象剪枝学习存在训练于全空间、测试于自剪枝空间的暴露偏差。iFlax将对象重要性学习建模为双层优化,并用Repair/Restart/Rollback稳定规划反馈。在MazeNamo等三类基准及四足移动操作平台上验证,相比Flax失败率降80.04%、规划时间降57.14%。

What Is My Robot Thinking? Design Considerations for Transparent and Trustworthy Shared Autonomy Figure 1
2026-06-08cs.RO

What Is My Robot Thinking? Design Considerations for Transparent and Trustworthy Shared Autonomy

Atharv Belsare, Zohre Karimi, Connor Mattson, Rushiil Nakka, Daniel S. Brown

2026-06-08机器人

论文关注共享自主辅助机器人中“机器人以为用户想做什么”不可见导致的意图错配与信任下降问题。作者在固定控制器下系统比较视觉/语音、稀疏/丰富四类透明反馈,将界面透明度作为独立变量。25人两项操作实验显示,显式反馈能提升意图对齐并减少纠正干预,用户更偏好视觉;但完整暴露置信分布并不稳定提升信任或协作,信息量需随任务复杂度匹配。

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation Figure 1
2026-06-08cs.RO

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

Colab, Colab, Beihang University, National University of Singapore

2026-06-08机器人

本文针对现有无人机 VLN 多为离散/粗动作、VLA 又偏短程原子任务的问题,提出 FLIGHT 长时程细粒度导航基准,并用专家连续 6-DoF 轨迹和 Pilot Reasoning 标注连接任务进度与下一子目标;FLIGHT VLA 采用低频流式 VLM 推理、高频扩散动作模型控制的异步架构。闭环实验显示其在多阶段完成、子目标遵循和终端控制上优于代表性 VLN/VLA 基线。

STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images Figure 1
2026-06-08cs.RO

STRIPS-WM: Learning Grounded Propositional STRIPS-style World Models from Images

Abhiroop Ajith, Constantinos Chamzas

Department of Robotics Engineering, Worcester Polytechnic Institute

2026-06-08视觉感知强化学习

本文针对视觉长程操作中像素预测难以捕捉动作可用条件与效果的问题,提出 STRIPS-WM:先从动作-图像转移归纳有限任务图,再用 CP-SAT 联合学习二值谓词和 STRIPS 前提/增删效应,并训练视觉分类器把谓词接回图像。实验显示其在视觉重排任务的 image-to-plan 成功率优于视觉 rollout、潜空间图搜索和 LatPlan 类基线;但方法仍依赖确定性、图覆盖和命题化假设。

Three-dimensional hydro-cluttered locomotion by an undulatory robot Figure 1
2026-06-08cs.RO

Three-dimensional hydro-cluttered locomotion by an undulatory robot

Tianyu Wang, Matthew Fernandez, Galen Tunnicliffe, Nikolas Cornell, Justin Duong, Donoven Dortilus, Zhaochen J. Xu, Patricia Meza, Sean Lublinsky, Darsh Parikh, Jianfeng Lin, Emily Grace, Daniel I. Goldman

Institute for Robotics and Intelligent Machines, Georgia Institute of Technology, Atlanta, GA 30332, USA., School of Physics, Georgia Institute of Technology, Atlanta, GA 30332, USA., George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA., School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA., Department of Mechanical and Industrial Engineering, Northeastern University, Boston, MA 02115, USA., Ransom Everglades School, Coconut Grove, FL 33133, USA.

2026-06-08机器人

本文关注红树林、礁区等“水下杂乱”环境中障碍接触不可避免、传统开阔水域机器人易失效的问题,提出细长无肢机器人 AquaMILR:用双侧缆驱实现可编程体柔顺性,并结合分布式浮力/深度调节。实验显示,合适柔顺性可把身体—障碍相互作用转化为稳定前进,深度调节可绕行和脱困,惯性诱发滚转还能在卡滞时自恢复;红树林实测验证其可进入根区并进行机载视觉检查。

Lane Change Trajectory Planning for Personalized Driving Comfort and Mobility Efficiency Figure 1
2026-06-08cs.RO

Lane Change Trajectory Planning for Personalized Driving Comfort and Mobility Efficiency

Haoxuan Dong, Dongjun Li, Ziyou Song

Department of Mechanical Engineering, National University of Singapore, Department of Electrical Engineering and, University of Michigan

2026-06-08规划控制

本文针对换道规划中安全、舒适与通行效率难以兼顾且驾驶偏好差异大的问题,将三阶多项式轨迹生成器与共享骨干双头 MLP 结合:基线头保证稀缺/未知工况可行性,个性化头学习舒适或效率偏好,并用误差赢家逻辑回归门控切换。仿真与蒙特卡洛结果显示,该方法可按偏好调节最大横向加速度和换道时长,基线在个性化数据不足时仍保持可用。

Learning All-Terrain Locomotion for a Planetary Rover with Actively Articulated Suspension Figure 1
2026-06-08cs.RO

Learning All-Terrain Locomotion for a Planetary Rover with Actively Articulated Suspension

Arthur Bouton, Tristan D. Hasseler, Michael Paton, Travis Brown, Jacob Levy, William Reid, Joshua Martin, Hari Nayar

Jet Propulsion Laboratory, California Institute of Technology, Pasadena, CA 91109 USA, Center for Autonomy, University of Texas at Austin, Austin, TX 78712 USA, Space Systems Laboratory, University of Maryland, MD 20742 USA

2026-06-08机器人

面向未来行星车在松软沙地、陡坡和乱石等被动悬挂难以通过的地形中机动受限的问题,论文提出四轮 ERNEST 主动万向悬挂,并用强化学习训练单一神经控制器统一处理转向、轮位重构和载荷再分配,无需显式地形分类。控制器在高保真土壤-接触仿真中训练并经域随机化零样本迁移到实车,可自主通过岩石场、轮高台阶、沙纹和沙坡;在 20° 沙坡上干沙运输成本约降 37%,湿沙中被动悬挂则陷停。

Multi-Robot Planning and Control from CCTV Camera Networks in a Real Warehouse Figure 1
2026-06-08cs.RO

Multi-Robot Planning and Control from CCTV Camera Networks in a Real Warehouse

Luke Robinson, Benjamin Ramtoula, Anas Izaaryene, Paul Newman, Daniele De Martini

2026-06-08机器人规划控制

面向仓库中机器人单机传感与算力成本高、相机标定维护困难的问题,论文把外部 CCTV 网络用于多机器人离板控制:在未标定的像素级拓扑相机图上做图像空间规划,并用优先级到局部联合规划及重叠区信号量处理冲突与交接。系统在真实仓库30台相机、6条约27米货架通道和4台异构机器人上验证,支持并行自主运行,单路线任务时间仅比人工遥控慢5.1%。

AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation Figure 1
2026-06-08cs.RO

AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation

Jiyun Jang, Yujin Sung, Woosung Joung, Daewon Chae, Sangwon Lee, Sohwi Kim, Jinkyu Kim, Jungbeom Lee

Korea University, University of Michigan, KT R&D Center

2026-06-08机器人视觉语言安全鲁棒

论文关注视觉运动策略在语义识别正确时仍因不理解机器人基坐标系与图像方向的对应关系而在未见物体位置失效的问题。AxisGuide利用相机参数和末端位姿,把基坐标系+x/+y/+z方向投影为额外视觉通道拼接到RGB输入中,显式提示动作坐标含义。在LIBERO和真实任务中,该方法在单/多视角下均提升成功率,部分未见位置或任务增益可达约20个百分点。

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems Figure 1
2026-06-08cs.RO

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems

John S. Baras, Sai Sandeep Damera, Ryan Matheu, Clinton Enwerem, Praveen M.S. Kumar

2026-06-08机器人

面向含学习感知与传统规划控制的自主CPS,论文指出现有MBSE难以把ML/AI组件纳入可追踪、可验证的工程流程。其核心是IDDMBSE:在SysML驱动的V流程每步加入需求驱动的数据闭环,并以Perfect、Trades-X、Veritas串联ROS评估、混合设计空间搜索和形式/数据/运行时验证。作者在可信地面机器人上覆盖传感器选型、风险路径规划、行为树验证、鲁棒感知和多机器人协同;但量化增益文中未充分说明。

SCOUT: Semantic scene COverage via Uncertainty-guided Traversal Figure 1
2026-06-08cs.RO

SCOUT: Semantic scene COverage via Uncertainty-guided Traversal

Junyu Mao, Sara Ayoubi, Vishnu D. Sharma, Ilija Hadžić, Matthew Andrews

2026-06-08安全鲁棒

本文针对3D场景图通常在固定数据上离线生成、与机器人采集决策脱节的问题,提出SCOUT把主动遍历和概率场景图构建闭环结合:用开放词汇观测更新对象语义置信度与几何关系,再按语义不确定性、几何覆盖和行走代价选择下一视角。初步实验显示其相对割草式遍历有明显提升,但评估仍偏初步,真实机器人验证与收敛效率文中未充分说明。

Optimal Control Approach for Non-prehensile Ball Juggling Using a 7-DoF Manipulator Figure 1
2026-06-08cs.RO

Optimal Control Approach for Non-prehensile Ball Juggling Using a 7-DoF Manipulator

Joel Ramadani (1), Vasilije Rakčević (1), Riddhiman Laha (1), Arne Sachtler (1 and 3), Valentin Le Mesle (1), Achim J. Lilienthal (1), Sami Haddadin (2) ((1) Technical University of Munich, (2) MBZUAI Abu Dhabi, (3) DLR Oberpfaffenhofen)

2026-06-08规划控制

针对非抓取式抛接中接触时间长、混合动力学敏感且在线优化来不及的问题,论文提出模型驱动的两阶段最优控制框架:先用二维球—工具模型生成任务空间轨迹,再映射为满足7自由度机械臂约束的关节轨迹,并离线构建扰动顶点状态的修正轨迹库供在线选择。方法在仿真和Franka Panda实物上完成摆起与周期抛接验证,但鲁棒性范围和相对基线增益文中说明有限。

On the Hardness of Optimal Motion on Trees Figure 1
2026-06-08cs.RO

On the Hardness of Optimal Motion on Trees

Tzvika Geft

2026-06-08机器人

针对多机器人路径规划中“树上运动是否易优化”这一长期未决问题,本文从栈重排出发构造统一归约框架,揭示树状、甚至细分星形结构中的共同困难来源。结果证明标号与2-着色 MAPF 在距离、makespan、flowtime 三类目标下均为 NP-hard,并同时解决树上 Pebble Motion 与有色 Pebble Motion 的复杂性空白。

AEGIS: A Backup Reflex for Physical AI Figure 1
2026-06-08cs.AI

AEGIS: A Backup Reflex for Physical AI

Josef Chen

2026-06-08机器人

论文针对长时程机器人操作中错误会逐步累积、但失败征兆常在早期已出现在策略内部激活中的问题,提出 AEGIS:用冻结弱策略的隐藏状态探针做逐步预警,并只在触发时切换到更强的独立策略。LIBERO-Spatial 上其在强策略仅运行 38% 步数时,恢复弱策略失败轨迹的 10.1%,约为同预算盲切换或随机触发的两倍,表明收益主要来自切换时机而非额外计算。

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos? Figure 1
2026-06-08cs.RO

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?

Richard Li, Aditya Prakash, Andrew Wen, Saurabh Gupta, Yilun Du, Pulkit Agrawal

Massachusetts Institute of Technology, University of Illinois Urbana-Champaign, Harvard University

2026-06-08机器人视觉感知

论文针对机器人示教数据稀缺、日常人类视频难以直接迁移到机器人操作的问题,构建含532段自然动作视频和高质量三角化3D手部标注的TriHands,并系统分析手部姿态质量、图像尺度对齐与人机动作差距。核心洞察是,仅有准确手标注仍不够,视觉与策略网络需按不同具身专门化。六个真实操作任务中,该共训练配方在低机器人数据下带来29.7个百分点绝对成功率提升。

ChronoForest: Closed-Loop Multi-Tree Diffusion Planning for Efficient Bridge Search and Route Composition Figure 1
2026-06-08cs.RO

ChronoForest: Closed-Loop Multi-Tree Diffusion Planning for Efficient Bridge Search and Route Composition

Jungmin Seo, Jaesik Park

Seoul National University

2026-06-08生成模型规划控制

本文针对仅有短时离线轨迹时,机器人仍需完成长程到达、必经点访问并保持路线较短的问题。ChronoForest将时间距离引导的双向树扩散“桥接”搜索,与基于已发现桥证据的在线多树路线重求解闭环耦合,避免把不可靠的长程距离估计直接当作全局代价。其在OGBench AntMaze-Stitch中三种规模成功率达99.8%、99.3%、99.5%,giant-stitch较既有扩散方法最高提升34.5个百分点,并在Hamiltonian组合任务中以低于穷举规划的代价改善路线质量。

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation Figure 1
2026-06-08cs.RO

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation

Lennart Julian Droß, Andreas Orthey, Marc Toussaint

2026-06-08机器人

针对机器人操作学习和TAMP基准缺少大规模、可系统变化且含物体互锁依赖的数据,论文提出PhyRoGen,用程序化内容生成从物体、关节和变换自动构造物理操作谜题的运动链,并实现6类生成器。作者生成24个谜题,用采样式规划在1–300秒内全部求解,并在PyBullet中用KUKA LBR iiwa验证可操作;但实验仍限于仿真,缺少与其他生成框架的系统对比。

Robots Need More than VLA and World Models Figure 1
2026-06-08cs.RO

Robots Need More than VLA and World Models

Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar

Stanford University, Technical University of Darmstadt, UCL Centre for AI

2026-06-08机器人强化学习

本文针对通用机器人过度依赖“收集更多示教、训练更大 VLA/世界模型”的思路,指出真正瓶颈在于如何把人类视频、仿真轨迹和部署失败等弱标注物理经验转成机器人可用监督。核心洞察是构建数据自动标注、跨形态重定向、物理约束世界模型和奖励接地四类接口;主要结果是给出综述式研究框架而非实证增益,具体性能提升文中未充分说明。

2026-06-05

60 篇
HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers Figure 1
2026-06-05cs.RO

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

California Institute of Technology, The Institute for Human & Machine Cognition

2026-06-05机器人规划控制

论文针对人形机器人任务规划难以生成高频全身轨迹的问题,提出 HANDOFF:用含底盘速度、根高度和双腕目标的 10 维显式任务空间接口连接规划与全身控制,并通过上下文门控的多教师 KL 蒸馏,将运动跟踪、行走和跌倒恢复专家融合为单一 MoE 策略。在 Unitree G1 上,其速度跟踪接近 SOTA,鲁棒双臂操作工作空间达 0.31 m³,并可由 VLM 规划器零微调完成多类语言驱动实机任务。

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies Figure 1
2026-06-05cs.RO

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

2026-06-05视觉语言视觉感知规划控制

现有 VLA 通常继承示教中的单一执行速度,难以在搬运阶段加速、接触阶段减速。TempoVLA 的关键洞察是动作幅值直接决定运动快慢,因此用 VSTA 通过合并/拆分动作重定时示教,并把速度标量作为策略条件输入。仿真和真实任务显示其可双向调速,VSTA 还提升默认 1× 成功率,并可结合 VLM 做动态速度调度。

Flow-based Policy Adaptation without Policy Updates Figure 1
2026-06-05cs.RO

Flow-based Policy Adaptation without Policy Updates

Luzhe Sun, Jingtian Ji, Haoran Chen, Jiawei Zhou, Matthew R. Walter

Toyota Technological Institute at Chicago, Stony Brook University

2026-06-05生成模型强化学习

针对人类、IL/RL 策略或 VLA 在零样本部署中动作噪声、偏差且不便微调的问题,论文提出 GLOVES:用流匹配将候选动作块直接传输到专家动作分布,并利用反向流得分作为 OOD 门控,只在异常时介入以保留意图。少量专家示范即可训练;在 4 个仿真和 2 个真机任务中,13/16 个随机包装设置取得最高成功率,并使微调 VLA 仿真表现最高提升 29.03%。

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation Figure 1
2026-06-05cs.RO

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

2026-06-05生成模型安全鲁棒

面向自动驾驶闭环评测中稀有高风险场景难采集、扩散式生成慢且易在长时域累积抖动/越界等伪影的问题,RiskFlow将多车未来轨迹改写为动作空间的一步流传输,直接生成加速度与偏航率,并在输出动作上做风险交互引导和地图正则,再由车辆动力学还原轨迹。nuScenes+tbsim实验显示,其在保持安全关键生成能力的同时提升现实性,并显著降低推理耗时。

Ensuring Interaction Safety in Multitask Exoskeleton Control: A Simulation-Trained Variable Impedance Framework Figure 1
2026-06-05cs.RO

Ensuring Interaction Safety in Multitask Exoskeleton Control: A Simulation-Trained Variable Impedance Framework

Muyuan Ma, Houcheng Li, Haotian Zhai, Lijun Han, Xinpan Meng, Xiuze Xia, Long Cheng

2026-06-05规划控制安全鲁棒

论文针对外骨骼在多任务辅助中既要快速适应动作、又要保证人机交互安全的问题,提出先在 MuJoCo 肌骨-外骨骼仿真中用 PPO 生成交互数据,再训练融合语义指令与本体历史的双模态策略,在线输出参考轨迹和可变阻抗;关键在于用 Lyapunov 条件约束刚度变化,给学习控制器加上稳定性边界。实验显示其可覆盖九类任务,并在真实负重重复任务中较基线降低代谢成本,但泛化到更多被试和多关节系统仍待验证。

Waypoints Matter: A Systematic Study for Sampling-Based Trajectory Planning Figure 1
2026-06-05cs.RO

Waypoints Matter: A Systematic Study for Sampling-Based Trajectory Planning

Josep M. Barbera, Antonio Artuñedo, Jorge Villagra

2026-06-05规划控制

这篇论文针对采样式自动驾驶轨迹规划中路点布置长期被当作实现细节的问题,在固定轨迹原语和候选预算下,系统比较均匀采样、增强 RDP* 与曲率条件分配等 449 组配置。核心发现是名义路点间距才是可靠性和候选质量的主导参数;调好的均匀采样通常不输更复杂方法,曲率前瞻策略仅在曲率丰富道路上带来小幅稳定优势,而 RDP* 未优于均匀采样。

VOLT: Vision and Language Trajectory Segmentation for Faster-than-Demonstration Policies Figure 1
2026-06-05cs.RO

VOLT: Vision and Language Trajectory Segmentation for Faster-than-Demonstration Policies

Robert Ramirez Sanchez, Daniel J. Evans, Dylan P. Losey, Siddarth Jain

2026-06-05视觉感知模仿学习规划控制

论文关注模仿学习中“示范慢、机器人应更快执行”的矛盾,指出简单整体加速会破坏抓取、接触等精细阶段。VOLT 的核心是用视觉语言模型从完整示范视频中分割可加速与需谨慎执行的片段,再仅对安全片段下采样并训练扩散策略。实验显示,训练期示范下采样比测试期跳动作更稳定,VOLT 相比基线在保持相近成功率的同时最高实现约 2.57 倍提速。

Meridian: Metric-Semantic Primitive Matching for Cross-View Geo-Localization Beyond Urban Environments Figure 1
2026-06-05cs.RO

Meridian: Metric-Semantic Primitive Matching for Cross-View Geo-Localization Beyond Urban Environments

Mason Peterson, Qingyuan Li, Yixuan Jia, Fernando Cladera, Carlos Nieto-Granda, Camillo Jose Taylor, Jonathan P. How

2026-06-05机器人

针对 GNSS 受限场景中地面机器人难以在非城市、自然环境里利用航拍图全局定位的问题,Meridian 将航拍图与 RGB-D 地面观测抽象为对象质心和区域边界等点线度量-语义基元,借助开放集基础模型提取并用一致性度量与鲁棒位姿图剔除错误匹配,无需区域特定训练或初始化。实验覆盖自动驾驶、校园公园和野外营地等 19 km 轨迹,优化后平均误差为 2.4 m。

Attitude-Aided Linear Calibration of Triaxial Accelerometers Figure 1
2026-06-05cs.RO

Attitude-Aided Linear Calibration of Triaxial Accelerometers

Yongqiang Yu, Tian Huang, Yipeng Yang

2026-06-05机器人

面向低成本 MEMS 加速度计在机器人与 IMU 场景中依赖昂贵标定设备或非线性迭代的问题,论文提出姿态辅助线性标定 ALAC,用组合误差矩阵统一表示偏置、尺度、非正交与安装误差,并将静态重力约束化为闭式 CHLS 求解,最少五个任意姿态即可支持在线递推。机器人平台和公开 IMU 数据实验显示,其离线/在线精度与抗噪性优于多种基线,原始数据上表现尤其稳健。

Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation Figure 1
2026-06-05cs.CV

Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation

Ariel Herrera, Xueyang Kang, Atal Anil Kumar

Ariel Herrera is with the Department of Engineering, University of Luxembourg, Esch-sur-Alzette, Luxembourg.

2026-06-05机器人视觉感知

针对双臂布料展开中严重形变与自遮挡导致角点不可见、真实标注数据稀缺的问题,论文用 Blender 域随机化生成自动标注数据,并结合 CNN 角点热图与 YOLOv8-OpenCV 皱褶检测:先沿结构皱褶抓取拉伸,角点露出后再切换到基于关键点的熨平。实验中关键点 MPE 为 1.7615±0.7461 像素,且无需微调可迁移到真实布料,但真实机器人闭环成功率文中未充分说明。

Multi-Resolution Tactile Imitation Learning for Contact-Rich Robotic Manipulation Figure 1
2026-06-05cs.RO

Multi-Resolution Tactile Imitation Learning for Contact-Rich Robotic Manipulation

Rickmer Krohn, Erik Helmut, Niklas Funk, Jan Peters, Vignesh Prasad, Georgia Chalvatzaki

Hessian AI, 4 Robotics Institute Germany

2026-06-05机器人模仿学习

这篇论文针对接触丰富操作中单一视觉或单一触觉难以捕捉局部接触、滑移和高频振动的问题,提出 MiTaS:用模态专属 CNN stem 与 Transformer 融合 RGB、GelSight 低频空间触觉和 Evetac 高频事件触觉,并条件化 flow-matching 模仿策略。五个任务中平均成功率达 80%,高于视觉-only 的 31% 和视觉-触觉基线的 54%;协同训练还能在无 Evetac 推理时提升部分任务表现,但传感器组合泛化仍需更多验证。

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning Figure 1
2026-06-05cs.RO

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning

Ziyang Yu, Xiang Li, Qiong Chang, Jun Miyazaki

School of Computing, Institute of Science Tokyo

2026-06-05机器人

这篇论文针对机器人点云流水线中 FPS 在百万点级传感器下成为实时瓶颈的问题,提出 RadiusFPS:用球形体素建立保守半径界,先剪除整块无需更新的区域,再用坐标级跳过测试减少残余距离计算,同时保持固定初始化和 tie-breaking 下的标准 FPS 更新规则;其 GPU 版以 warp 级融合核减少全局内存往返。实验显示 CPU 最高比朴素 FPS 快 186×,GPU 采样延迟最高降 52×,端到端分割可提速至 2.5×,并约用 QuickFPS 一半显存。

Breaking Time: A Fully Gaussian Framework for Distributed and Continuous-Time SLAM Figure 1
2026-06-05cs.RO

Breaking Time: A Fully Gaussian Framework for Distributed and Continuous-Time SLAM

Davide Ceriola, Simone Ferrari, Luca Di Giammarino, Leonardo Brizi, Giorgio Grisetti

2026-06-05三维

针对离散时间或集中式连续时间 SLAM 难以处理异步高频传感器、滚动快门和多相机场景的问题,本文提出 G-solver,将高斯过程运动先验嵌入高斯置信传播,用统一概率模型同时支持任意时刻插值、不确定性查询和分布式消息传递。实验覆盖合成与真实数据,显示其在滚动快门和分布式多相机优化中估计稳定、精度可靠,运行时间与现有连续时间方法相近。

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action Figure 1
2026-06-05cs.RO

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

Boyang Zhang, Lianlei Shan

Department of Electrical and Computer Engineering, Boston University, Department of Computer Science, Tsinghua University

2026-06-05视觉语言视觉感知强化学习规划控制

针对 VLA 在长时程和高不确定操作中一次性动作解码缺乏测试时 deliberation、显式 CoT 又带来 token 延迟的问题,MPCoT 将推理放到连续潜空间:并行初始化 M 条控制假设,经共享权重迭代 K 步细化,再按学习到的置信权重软聚合,且仅在训练时用专家一致性、VLM/世界模型进展和成功反馈监督路径评分。其保持 OpenVLA-OFT 的 8 步动作接口、推理时无奖励和无推理 token,在 LIBERO/CALVIN 上提升长时程成功率;消融显示深度、宽度和奖励引导路径偏好均有贡献,但实机鲁棒性仍文中未充分说明。

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving Figure 1
2026-06-05cs.RO

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

Yining Xing, Zehong Ke, Zhiyuan Liu, Yanbo Jiang, Wenhao Yu, Jianqiang Wang

2026-06-05数据集/基准

CLEAR针对端到端自动驾驶中多模态规划与实时推理难兼顾的问题,将扩散式多步去噪替换为VAE潜空间单步条件漂移,并用Drive-JEPA提供视觉几何特征、微调Qwen 3.5 0.8B的隐藏状态进行自适应采样调度和候选轨迹评分。其核心洞察是LLM更适合作为交通语义特征源而非直接生成轨迹;在NAVSIM v1上达到PDMS 93.7、最高99 FPS,但调度离散化和多阶段训练仍限制端到端性。

TAM: Torque Adaptation Module for Robust Motion Transfer in Manipulation Figure 1
2026-06-05cs.RO

TAM: Torque Adaptation Module for Robust Motion Transfer in Manipulation

Dongwon Son, Florian Shkurti, Jason Lee, Naman Shah, Beomjoon Kim, Dieter Fox

Allen Institute for AI, University of Toronto, University of Washington, ∗ Work done during an internship at the Allen Institute for AI.

2026-06-05机器人安全鲁棒

论文针对同一策略在真实机器人、不同实例或未知负载下因动力学偏差而失效的问题,提出将适应层下沉到低层控制器之后的扭矩接口:TAM仅利用本体历史编码隐状态,并以1kHz输出残余扭矩修正,因此可复用到RL、BC、MPC及不同动作空间策略。作者在随机化仿真中训练、无需真实数据微调,在Franka动态操作与跨机器人仿真中优于在线系统辨识和RMA基线,提升零样本鲁棒执行。

ActiveMimic: Egocentric Video Pretraining with Active Perception Figure 1
2026-06-05cs.RO

ActiveMimic: Egocentric Video Pretraining with Active Perception

Xingyao Lin, Guojin Zhong, Tianyi Lu, Ziyi Ye, Yichen Zhu, Zuxuan Wu, Yu-Gang Jiang

Fudan University, Shanghai Innovation Institute

2026-06-05视觉感知

针对自我中心人类视频预训练虽易规模化却弱于机器人数据的问题,ActiveMimic指出缺失信号是人类操作时主动调整视角的相机运动。方法从单目胸/头戴RGB视频中恢复同步相机与双腕轨迹,解耦并统一为27维动作,用同一目标联合学习视角动作与操作动作。真实机器人任务显示其优于仅用人类视频的基线,并接近机器人数据预训练模型,分析认为主动感知能力主要来自预训练而非微调。

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding Figure 1
2026-06-05cs.RO

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

Qize Yu, Jiadi You, Yuran Wang, Jiaqi Liang, Bowen Ping, Yang Tian, Yue Chen, Minghong Cai, Zeying Gong, Ruihai Wu, Yinchuan Li, Junwei Liang, Yingcong Chen

2026-06-05视觉语言视觉感知

论文针对 VLM 语义空间与机器人 3D 控制之间难以直接对齐的问题,提出以 affordance 作为训练中的任务化中间表征,而非单纯端到端预测动作。AffordanceVLA 将可操作性分解为 Which2Act、Where2Act、How2Act,分别约束目标物体、2D 交互区域和 3D 几何,并用 MoT 多专家架构与三阶段数据课程训练。实验显示其在 LIBERO、CALVIN 和真实场景中取得有竞争力的成功率,并提升泛化、空间鲁棒性和指令跟随;但部分增益可能也来自合成标注与数据流程。

MotionDisco: Motion Discovery for Extreme Humanoid Loco-Manipulation Figure 1
2026-06-05cs.RO

MotionDisco: Motion Discovery for Extreme Humanoid Loco-Manipulation

Ilyass Taouil, Michal Ciebelski, Shafeef Omar, Haizhou Zhao, Angela Dai, Aaron M. Johnson, Majid Khadiv

Ilyass Taouil 1,∗ &Michal Ciebielski 1,∗ &Shafeef Omar 1,∗ &Haizhou Zhao 1,2 &Angela Dai 1 &Aaron M. Johnson 3 &Majid Khadiv 1 & 1 Technical University of Munich, Germany, New York University, USA, Carnegie Mellon University, USA

2026-06-05机器人

针对人形机器人在长时域、接触丰富的移动操作中依赖遥操作或人类动作重定向、难以覆盖新场景的问题,MotionDisco 将 LLM 引导的程序化进化搜索用于生成接触计划,并用分层运动动力学轨迹优化与剪枝反馈筛选可行全身轨迹。消融显示结构化反馈的迭代搜索优于一次性生成,且能产生多样技能;作者进一步用发现的轨迹训练 RL 跟踪策略,并在真实人形机器人上执行多类长时域任务。

Towards Realistic 3D Sonar Simulation Figure 1
2026-06-05cs.RO

Towards Realistic 3D Sonar Simulation

Youssef Attia (1), Davide Costa (2), Francesco Wanderlingh (1 and 3), Filippo Campagnaro (2 and 3), Enrico Simetti (1 and 3) ((1) University of Genova, Italy, (2) University of Padova, (3) Interuniversity Research Center on Integrated Systems for the Marine Environment, Italy)

2026-06-05三维

面向水下机器人三维感知与导航,现有声呐仿真多把 3D 声呐近似为几何渲染版 LiDAR,难以反映折射、多路径和相位成像。论文在 Isaac Sim 5.1 中构建模块化水下仿真框架,实现类 Water Linked 3D-15 的体积点云声呐,并与 ROS 2、DVL、IMU、压力计及改造 FastLIO2 集成。HIL 实验表明其可在 Jetson Orin Nano 上支撑实时 SLAM,但与港口实测相比仍存在稀疏、杂波和缺失表面等 sim-to-real 差距,当前增益主要来自可用的闭环工程集成而非完整声学求解。

3D Underwater Path Planning via Generative Flow Field Surrogates Figure 1
2026-06-05cs.RO

3D Underwater Path Planning via Generative Flow Field Surrogates

Zachary Cooper-Baldock, Paulo E. Santos, Russell S.A. Brinkworth, Karl Sammut

Flinders University

2026-06-05生成模型规划控制三维

面向AUV在母平台尾流中发射回收时,均匀流模型难以刻画三维螺旋桨尾流,而RANS CFD又无法上艇实时计算。论文将正则化PatchGAN和带自注意力的2D3DGAN作为CFD替代,生成128³流场并嵌入能耗加权A*。在550种工况、19800条轨迹上,CFD可降能耗5.7–12.5%、高流速遭遇最多降77.8%;cGAN以28–146微秒推理恢复约45–60%的CFD收益。

A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models Figure 1
2026-06-05cs.RO

A Conversational Framework for Human-Robot Collaborative Manipulation with Distributed Generative AI models

Arash Ghasemzadeh Kakroudi, Roel Pieters

2026-06-05机器人生成模型

针对真实人机协作中自然语言指令不完整、场景歧义和生成模型幻觉会直接影响机器人安全的问题,论文提出将LLM理解、VLM视觉定位、协调与运动执行拆成可分布部署的ROS 2节点,并用网页界面展示意图与像素/深度/机器人坐标结果,在执行前强制人工确认。Franka FR3实验表明,该模块化管线在拾取、放置、交接任务中能在歧义增加时评估可靠性与延迟,不同LLM/VLM组合存在速度与定位准确性的权衡。

L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation Figure 1
2026-06-05cs.RO

L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation

Liwen Zhang, Dong Zhou, Guanghui Sun, Yifei Zheng, Yuhui Hu, Kaihong Ouyang, Zuoquan Zhao

Zuoquan Zhao is with the Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong, Shatin, New Territories, Hong Kong SAR, China.

2026-06-05机器人生成模型强化学习优化算法

面向航天器舱内微重力操作中目标易漂移、动作分布多模态且机载能耗受限的问题,论文将扩散策略改为脉冲神经网络形式,并用强化学习微调,加入状态相关延迟注入以增强动态时空感知。在舱门开启、翻滚目标收纳、精密旋盖等五类任务上,L-SDPPO相较现有方法报告了更高成功率和更低能耗。

Sample-efficient Low-level Motion Planning for Robotic Manipulation Tasks via Zero-shot Transfer Learning Figure 1
2026-06-05cs.RO

Sample-efficient Low-level Motion Planning for Robotic Manipulation Tasks via Zero-shot Transfer Learning

Yuanzhi He, Victor Romero-Cano, José J. Patiño, Juan David Hernández, William Sawtell, Gualtiero Colombo

2026-06-05机器人规划控制

针对复杂机械臂操作中低层规划随任务难度上升而采样效率下降、训练成本高的问题,论文将迁移学习引入 iCEM,在推理阶段从简单上游任务迁移采样分布、精英轨迹等参数,并用任务分解重设计堆叠和货架放置奖励。仿真中在堆叠、滑动、货架放置任务上成功率最高提升 23%,并在 Franka Emika 真机堆叠中验证可行性。

Gotta Grow Fast: Design and Benchmarking of a Tip Mount for High-Speed Vine Robots Figure 1
2026-06-05cs.RO

Gotta Grow Fast: Design and Benchmarking of a Tip Mount for High-Speed Vine Robots

Antonio Alvarez Valdivia, Robert Reeve, Ankush Dhawan, Ciera McFarland, Chad Council, Margaret McGuinness, Nathaniel Hanson

2026-06-05机器人数据集/基准

面向搜救、巡检中藤蔓机器人需高速生长并在尖端携带相机/传感器的问题,论文抓住机器人翻出时截面常呈三角折展的现象,设计三角滚轮式尖端安装座,用滚动替代内层滑动以降低摩擦,并构建测量尾部张力的基准测试台。对多种安装方案的比较显示,该设计在TPU涂层防撕裂尼龙机体上实现稳定翻出,尾部张力最低、增长表现最可重复,并在2米机器人上达到3.65 m/min演示速度。

RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning Figure 1
2026-06-05cs.RO

RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning

Chaoyi Xu, Yixuan Jiang, Jiahui Huan, Yuhui Fu, Haoyu Zhou, Weitian Yuan, Jiayi Yu, Wanpeng Zhang, Haoqi Yuan, Zongqing Lu

Peking University, Beihang University, Tsinghua University

2026-06-05机器人

论文针对灵巧操作示教中“人手动作可捕获但机器人部署不可执行/接触与观测不一致”的问题,提出 RealDexUMI:将同一轻量灵巧手、手内视觉与指尖触觉模块同时用于可穿戴采集和机器人执行,并用掌侧同构手套直接产生机器人手命令,减少重定向带来的落差。8 个真实任务中平均成功率 88.75%,可泛化到未见初始位姿,并跨 3 种机器人本体迁移。

PLAN-S: Bridging Planning with Latent Style Dynamics for Autonomous Driving World Models Figure 1
2026-06-05cs.AI

PLAN-S: Bridging Planning with Latent Style Dynamics for Autonomous Driving World Models

Xiaoyun Qiu, Jingtao He, Yijie Chen, Yusong Huang, Haotian Wang, Yixuan Wang, Xinhu Zheng

Intelligent Transportation Thrust, Systems Hub, and Center of Seamless Connectivity & Connected Intelligence, The Hong Kong University of Science and Technology (Guangzhou), Guangzhou 511453, China.

2026-06-05强化学习规划控制

针对潜在世界模型规划器直接从纠缠 latent 生成轨迹、难以显式监督风险/可行驶性/驾驶风格的问题,PLAN-S在规划头前解码受自车状态与风格调制的四通道语义代价图,并分别以注意力融合和奖励融合接入回归式与锚点评分式规划器。冻结宿主骨干下,nuScenes平均L2达0.55 m且3秒碰撞率相对降42%,NAVSIM规则代价版达89.4 PDMS,学习代价在困难场景有互补收益。

Merging model-based control with multi-agent reinforcement learning for multi-agent cooperative teaming strategies Figure 1
2026-06-05cs.RO

Merging model-based control with multi-agent reinforcement learning for multi-agent cooperative teaming strategies

Christian Llanes, Spencer W. Jensen, Samuel Coogan

1 affiliationmark: School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA., 2 affiliationmark: Sandia National Laboratories, Albuquerque, NM 87123, USA.

2026-06-05强化学习规划控制

论文针对纯多智能体强化学习在安全关键机器人任务中难以满足动力学约束、鲁棒性不足的问题,将MPC作为actor中的优化层扩展为MA-AC-MPC,使团队可在非可微长时域奖励下学习协作,同时输出可行控制。实验覆盖2v2追逃和无人机-全向车协同降落;相比MA-AC-MLP,在质量扰动与硬件测试中更稳,降落硬件成功率达100%对60%。

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis Figure 1
2026-06-05cs.RO

World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis

Yi Yang, Zhihong Liu, Siqi Kou, Yiyang Chen, Yanzhe Hu, Jianbo Zhou, Boyuan Zhao, Zhijie Wei, Xiao Xia, Xueqi Li, Pengfei Liu, Zhijie Deng

2026-06-05强化学习

论文针对现有 WAM 过度依赖视觉下一帧、缺少语言推理而 VLA 又难以利用视频世界建模的问题,提出 WLA:用自回归 Transformer 同时建模文本子任务与低层物理动态,并通过 World Expert、Action Expert 与 meta-query 让世界预测训练时辅助动作生成、推理时可关闭或用于测试时扩展。WLA-0 仅 2B 活跃参数,在 RTX 5090 上约 40ms 推理,在 RoboTwin2.0 Clean 达 92.94%、RMBench 达 56.5%,并展示了从无动作跨本体视频学习新任务的潜力。

T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation Figure 1
2026-06-05cs.CV

T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation

Jingkun Feng, Reza Sabzevari

Jingkun Feng and Reza Sabzevari are with the P4MARS Lab at the Faculty of Aerospace Engineering, Delft University of Technology.

2026-06-05视觉感知三维

面向机器人交互,现有开放词汇3D方法多停留在物体级,或对全场景做细粒度过分割而耗时耗显存。T-FunS3D的核心是先构建含实例与关系视觉嵌入的开放词汇3D场景图,再依据自由任务描述只检索相关物体并用视觉语言模型定位其功能部件。SceneFun3D实验显示其精度接近现有最优,同时运行更快、内存占用更低。

Towards a Data Flywheel for Embodied Intelligence in Logistics Figure 1
2026-06-05cs.RO

Towards a Data Flywheel for Embodied Intelligence in Logistics

Anlan Yu, Zaishu Chen, Zhiqing Hong, Daqing Zhang

Peking University, Peking University Beijing China

2026-06-05机器人

论文针对物流机器人从实验室走向真实仓储时数据昂贵、长尾包裹操作难覆盖的问题,提出“物流数据飞轮”:把日常作业视频、示教、日志和失败反馈转成可复用数据,并用世界模型生成恢复轨迹。其初步方法 WM-DAgger 通过纠偏动作合成与一致性过滤降低生成数据幻觉,在少样本软包推动等任务中将成功率由标准 BC 的 26.7% 提升到 93.3%;但整体飞轮和持续部署增益仍属规划,文中未充分说明。

Learning of Robot Safety Policies via Adversarial Synthetic Scenarios Figure 1
2026-06-05cs.RO

Learning of Robot Safety Policies via Adversarial Synthetic Scenarios

Nikolai Dorofeev, Alexey Odinokov, Rostislav Yavorskiy

2026-06-05机器人安全鲁棒

面向家庭、医院等开放人机环境中机器人策略“能完成任务但未必安全”的问题,本文将危害工程流程形式化为资产、暴露模式、危害场景、仿真数据与安全微调五步,并提出红队生成危险合成场景、蓝队迭代修正安全策略的对抗式框架,以替代穷举或随机仿真。文中主要给出问题建模、系统架构和小规模概念验证,声称可更高效发现高风险边界案例,但尚非完整评测系统,实际安全增益文中未充分说明。

A Novel Method with Encoder-Decoder for Cross-Sensor Adaptation in Surface Shape Sensing with Sparse Strain Sensors Figure 1
2026-06-05cs.RO

A Novel Method with Encoder-Decoder for Cross-Sensor Adaptation in Surface Shape Sensing with Sparse Strain Sensors

Shuo Wang, Heng Luo, Dian Jin, Xiaoming Tao

2026-06-05机器人

针对稀疏应变传感阵列因个体差异、批次差异或安装偏差导致形状感知模型难以复用的问题,论文将Transformer编码器与图神经网络解码器结合,并引入元学习和少样本跨传感器适配,把应变读数映射到表面特征点坐标。实验中,新阵列仅用少于5%标注数据即可在1秒内适配,平均误差约4.0 mm,明显优于未适配的23.0 mm,并减少重新采集与训练成本。

TAGA: Terrain-aware Active Gaze Learning for Generalizable Agile Humanoid Locomotion Figure 1
2026-06-05cs.RO

TAGA: Terrain-aware Active Gaze Learning for Generalizable Agile Humanoid Locomotion

Peizhuo Li, Hongyi Li, Mingfeng Fan, Fangzhou Xu, Shuhao Liao, Yuxuan Ma, Zicheng Zeng, Ze Wang, Yongbin Jin, Yuhong Cao, Hongtao Wang, Guillaume Sartoretti

MarmotLab, National University of Singapore, Center of X-Mechanics, Zhejiang University, South China University of Technology, Project Page: https://marmotlab.github.io/taga-humanoid/

2026-06-05机器人

针对人形机器人在复杂地形中既要远距离预判又要精确落足的感知矛盾,TAGA将深度视觉、本体感知与高度扫描结合,学习无显式监督的主动凝视:先预测任务相关地形区域,再用注意力提取局部几何。仿真和Unitree G1实机显示其在沟壑、踏脚石、窄梁、台阶和户外地形上更稳健,并实现感知人形系统中报道的1.2米真实跨沟距离;但长期高动态动作受电机热负载和高度扫描质量限制。

LadderMan: Learning Humanoid Perceptive Ladder Climbing Figure 1
2026-06-05cs.RO

LadderMan: Learning Humanoid Perceptive Ladder Climbing

Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

Amazon FAR, 2 USC, 3 UC Berkeley, 4 Stanford University, 5 CMU, † Amazon FAR Co-Lead

2026-06-05机器人

针对人形机器人在梯子上因踏点/抓点稀疏、全身接触耦合强且感知误差易导致失稳的问题,LadderMan用单条参考动作通过混合运动跟踪生成多专家,再以模仿学习结合强化学习蒸馏为深度视觉运动策略,并借助视觉基础模型缩小深度感知的仿真到现实差距;同时用双智能体框架分离下肢稳定与上肢操作。实验显示其可在多种梯子几何上零样本部署到Unitree G1,并支持换灯泡、递箱等梯上遥操作任务。

Visuotactile and Explicitly Force-Controlled Robotic Ultrasound for Abdominal Volumetric Reconstruction Figure 1
2026-06-05cs.RO

Visuotactile and Explicitly Force-Controlled Robotic Ultrasound for Abdominal Volumetric Reconstruction

Adrian Piedra, R Brooke Jeffrey, Oussama Khatib

1 affiliationmark: Stanford Robotics Laboratory, Computer Science Department, Stanford University, Stanford, CA 94305 USA, 2 affiliationmark: Department of Radiology, School of Medicine, Stanford University, Stanford, CA 94305 USA

2026-06-05机器人规划控制三维

针对腹部超声依赖熟练技师、图像质量受手法和接触力影响的问题,本文将专家自由手扫描的运动/力策略、双目三维腹部地形与触觉刚度测量结合,用于识别肋缘并规划两类自适应扫查路径;七自由度力矩控制机械臂通过闭环显式力控维持探头接触。实体验证显示,其图像质量接近专家扫描,并可获取三维体数据,但临床泛化范围文中未充分说明。

Amortized Nonlinear Model Predictive Control Figure 1
2026-06-05eess.SY

Amortized Nonlinear Model Predictive Control

Francesco Pillitteri, Alberto Bemporad

2026-06-05规划控制

本文针对非线性 MPC 每个采样时刻求解全 NLP 过慢、难以在高频或嵌入式硬件部署的问题,将输入仿射系统的一步最优控制摊还为随状态和参考变化的小规模 QP。核心做法是用解析基线给出 QP 参数,再由单网络学习残差修正,并通过可微内点 QP 层保证首个控制动作满足硬约束。三连杆平面机械臂跟踪实验显示,其相对全 NLP 有数量级加速,相比 RTI 也有明显提速,同时保持接近的跟踪性能与约束满足。

PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation Figure 1
2026-06-05cs.RO

PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation

Chong Ma, Taiyi Su, Jian Zhu, Jianjun Zhang, Zitai Huang, Yi Xu, Hanli Wang

Tongji University, This work was completed during an internship at Midea AI Research Centers.

2026-06-05强化学习数据集/基准

针对真实机器人中 VLA 策略需观察—执行动作块—再规划的闭环评测,而现有世界模型多沿固定轨迹开环预测的问题,PiL-World 将策略预测的动作块转成多视角未来观测并回馈策略,结合动作视觉控制、历史记忆、多视角联合生成及成功/失败轨迹训练。三项真实双臂任务中,其想象 rollout 更接近真实执行,将成功率估计误差由 63.2% 降至 12.0%。

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models Figure 1
2026-06-05cs.CV

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

University of Science and Technology of China, Shanghai Innovation Institute, Fudan University

2026-06-05视觉语言视觉感知

论文针对扩散式VLA沿用多步图像生成范式导致动作解码开销大的问题,指出机器人策略的条件很丰富而动作块低维,因而一阶生成未必需要蒸馏或一致性等复杂机制。方法保持标准flow matching,仅将训练时间分布偏向高噪声端。MNIST网格到序列验证该条件-目标结构后,在LIBERO系列中一步策略通常匹配十步解码,LIBERO-Long达95.6%,真实双臂实验也显示相同趋势;但最优噪声偏移如何选择文中未充分说明。

DexFuture: Hierarchical Future-State Visuomotor Targeting for Bimanual Dexterous Tool Use Figure 1
2026-06-05cs.RO

DexFuture: Hierarchical Future-State Visuomotor Targeting for Bimanual Dexterous Tool Use

Runfa Blark Li, Kuang-Ting Tu, Nikola Raicevic, Dwait Bhatt, Xinshuang Liu, Keito Suzuki, Ki Myung Brian Lee, Nikolay Atanasov, Truong Nguyen

2026-06-05机器人

双手灵巧工具使用依赖演示中的未来目标,部署时不可得,而动作条件世界模型在线规划又太慢。DexFuture将问题拆成高层从自我视角RGB、本体与几何历史预测多步未来目标,低层目标条件结构策略高速跟踪执行。OakInk2切割、倒水、擦拭等任务中,它达到特权oracle约90%性能,显著优于无目标策略的7%,并以60Hz运行,约比DexWM式CEM规划快250倍。

Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation Figure 1
2026-06-05cs.RO

Accelerating and Scaling MPC-Guided Reinforcement Learning for Humanoid Locomotion and Manipulation

Junheng Li, Liang Wu, Sergio A. Esteban, Lizhi Yang, Ján Drgoňa, Aaron D. Ames

California Institute of Technology, CA 91106, USA

2026-06-05机器人强化学习规划控制

论文针对人形机器人中MPC能提供物理约束与长时域指导、但嵌入RL训练开销过高的问题,提出训练期MPC-RL:用质心动力学MPC轨迹构造带预测置信度的奖励,并设计并行于时域、免构建的GPU批量πⁿ MPC求解器以支持大规模PPO训练。实验与硬件验证显示,该方法提升行走、抗扰、负载行走和推290 kg推车等操作能力,部署时无需运行MPC。

Dynamic Multi-Agent Pickup and Delivery in Robotic Cellular Warehousing Systems Figure 1
2026-06-05cs.RO

Dynamic Multi-Agent Pickup and Delivery in Robotic Cellular Warehousing Systems

Cheng Ren, Ming Li, Xinping Guan, George Q. Huang

2026-06-05机器人

面向 RCWS 中用户在拣选执行期间继续追加 SKU 的现实场景,论文将其形式化为内部订单演化下的 Dynamic-MAPD,而非传统静态任务。核心做法是在 token passing 框架上做事件触发在线重规划:Dynamic-TP 对受影响机器人局部改路,Coop-TP 进一步让空闲机器人协助新增拣选。仿真显示两者相较静态与非协作基线可显著降低订单流动时间。

Preserving Full 6-DOF Actuation Under Abrupt Total Rotor Failures: Passive Fault-Tolerant Flight Control Using a Biaxial-Tilt Hexacopter Figure 1
2026-06-05cs.RO

Preserving Full 6-DOF Actuation Under Abrupt Total Rotor Failures: Passive Fault-Tolerant Flight Control Using a Biaxial-Tilt Hexacopter

Yipeng Yang, Yiqiao Tang, Hao Zhang, Jinqi Jiang, Jianfeng He, Rumo Chen, Xinghu Yu, Zhan Li, Huijun Gao

2026-06-05规划控制

针对常规共面多旋翼在突发整桨失效后可达力/力矩空间迅速坍缩、难以保持全 6-DOF 控制的问题,本文从结构与控制共同入手,采用双轴倾转过驱六旋翼,并把瞬态力矩跳变纳入 AWS 内切球评估;同时提出无需故障检测、切换或在线优化的 HOFA+LESO 与自适应分配两类被动容错方案。仿真和实飞显示其可在单个及多个旋翼失效下悬停和跟踪 6-DOF 轨迹,且恢复裕度优于单轴倾转和共面六旋翼。

Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation Figure 1
2026-06-05cs.RO

Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation

Dabin Kim, Daemin Park, Sangyub Lee, Jinsik Kim, Yeongtak Oh, Jongho Shin, Sungroh Yoon

2026-06-05机器人安全鲁棒

面向长时程具身操作中早期语义误 grounding、子任务误差传播与接触风险会累积成物理事故的问题,本文将安全干预按规划时、策略时、执行时三层组织,并区分形式化、统计与经验性证据边界。主要结论是现有工作在运行时控制较成熟,但策略时安全证据不足、接触丰富长时程操作缺少形式保证,不确定性触发介入和专用安全基准仍不充分。

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning Figure 1
2026-06-05cs.RO

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

2026-06-05视觉感知强化学习

针对端到端自动驾驶多依赖视觉到动作相关性、缺少动作条件世界动力学与反事实推理的问题,Discrete-WAM 将视觉状态、 ego 动作和决策统一离散化为对齐 token,并用离散扩散联合建模世界预测、动作策略与分层决策规划。实验称其在大规模自动驾驶基准上达到有竞争力或更优规划表现,并支持可控未来生成、反事实推理和安全感知评估,但具体增益来源仍需结合消融进一步判断。

Auditing Demonstration Curation Metrics: Action-Only Scorers Fail on the Structural Defects That Degrade Imitation Policies Figure 1
2026-06-05cs.RO

Auditing Demonstration Curation Metrics: Action-Only Scorers Fail on the Structural Defects That Degrade Imitation Policies

Aarav Bedi (University of California, Berkeley)

2026-06-05模仿学习

论文关注模仿学习中示范数据自动筛选指标是否真的能剔除会伤害策略的样本。作者构建可控抓取放置测试床,注入已知缺陷并同时评估缺陷检测与下游行为克隆成功率。结果显示,动作噪声等细微扰动可被异常检测筛出并基本恢复性能,但关键时刻错误动作等结构性缺陷会绕过所有仅看动作的指标,部分指标甚至反向打分;只有利用状态轨迹的指标能部分发现并最多恢复约三分之一性能差距。

Wave Focusing in Metamaterials: Tactile Displays Beyond the Diffraction Limit Figure 1
2026-06-05cs.ET

Wave Focusing in Metamaterials: Tactile Displays Beyond the Diffraction Limit

Gregory Reardon, Max Linnander, Dustin Goetz, Neeli Tummala, Yon Visell

Media Arts and Technology Program, 2 Department of Mechanical Engineering, Department of Electrical and Computer Engineering, University of California, Santa Barbara, USA.

2026-06-05机器人

面向机器人遥操作、VR/AR等需要大面积高分辨触觉反馈的场景,论文针对稀疏致动波聚焦受板波衍射限制、虚拟触觉像素过大的问题,提出在刚性薄板上加入局域共振杆阵列,通过超材料色散工程产生慢波分支,再结合逆滤波控制实现多点可编程聚焦。实验显示仅用8个边缘电磁致动器即可在超过300 cm²表面生成最小约2 cm²的虚拟像素,面积较普通板缩小约10倍,并支持75–400 Hz宽带、多点独立波形和运动触觉源。

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning Figure 1
2026-06-05cs.LG

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning

Rohan Siva, Neel P. Bhatt, Yunhao Yang, Seoyoung Lee, Nishant Gadde, Christian Ellis, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

The University of Texas at Austin, University of Colorado Boulder

2026-06-05机器人

这篇论文针对机器人规划中过度依赖物体外观、难以判断“能做什么”的问题,提出 A4D:在 CLIP 等视觉语言嵌入中用 affordance 及其反义词构造功能轴,将图像投影到功能潜空间,并用距离估计不确定性、触发新 affordance 发现。实验显示其在已知 affordance 上约 94% 准确率,较强 VLM 基线高 15 个百分点以上,新 affordance 少样本后可超过 90%,推理约快 100 倍。

Learning Contact Representation for Leg Odometry Figure 1
2026-06-05cs.RO

Learning Contact Representation for Leg Odometry

Emre Girgin, Cagri Kilic

Department of Aerospace Engineering, Embry Riddle Aeronautical University

2026-06-05机器人

腿式里程计依赖支撑足零速更新,接触相位误判会放大机体速度漂移,而足端力传感器并非总可用且难处理打滑。本文用关节编码器运动学训练去噪自编码器,在潜空间用两分量 GMM 生成连续支撑概率,并将其用于 ESEKF 的 ZUPT 协方差自适应缩放。仿真和实机实验显示,该自监督检测器优于需 GRF 伪标签的监督 CNN/GRU 与 HMM 等概率基线,并降低下游里程计漂移。

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers Figure 1
2026-06-05cs.CV

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

Jean Cordonnier, Chenghao Xu, Olga Fink, Malcolm Mielle

2026-06-05三维

针对RGB-热成像三维重建依赖精确配准双目或成对采集、难以扩展到独立传感器/多机器人采集的问题,本文用VGGT分别估计两种模态相机位姿,再借助跨模态特征匹配与Procrustes对齐,训练未配对RGB-T 3D Gaussian Splatting。九个场景实验显示其热视图合成具竞争力且保持RGB质量,并指出仅看单模态指标会掩盖跨模态几何不一致。

FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization Figure 1
2026-06-05cs.RO

FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization

Yihao Wu, He Zhang, Junbo Tan, Xueqian Wang, Zhengyou Zhang

Futian Laboratory, Tsinghua University

2026-06-05生成模型强化学习优化算法

面向真实机器人中 VLA 后训练难以利用失败信号、奖励设计和 critic 训练成本高的问题,FlowPRO 将流匹配 VLA 的离线偏好优化与遥操作介入回滚结合:RPRO 用近端正则约束隐式奖励幅度以抑制 Flow-DPO 式 reward hacking,并用平滑插值把稀疏正负轨迹转成逐状态监督。四个长程双臂任务上,其成功率和完成时间均优于 DAgger、TPO 等基线,消融显示近端项、SFT 混合和数据处理均有贡献。

Uncertainty-Aware Adaptive Sensor Fusion for Autonomous Navigation Figure 1
2026-06-05cs.RO

Uncertainty-Aware Adaptive Sensor Fusion for Autonomous Navigation

Simegnew Yihunie Alaba, Yuichi Motai

Simegnew Yihunie Alaba

2026-06-05机器人安全鲁棒

面向复杂环境中 IMU 漂移与视觉受遮挡、光照变化导致的 VIO 定位不稳,论文将 ViT 编码 IMU 时序、MCNN 提取光流视觉线索,并用不确定性估计进行门控自适应融合与 UKF 噪声调整,另引入不确定性感知损失。在 KITTI 上相较基线降低 ATE/RPE,并报告 A100 上 155 FPS;但真实资源受限硬件上的部署效果文中未充分说明。

Learning from Demonstrations over Riemannian Manifolds using Neural ODEs: An Extended Abstract Figure 1
2026-06-05cs.RO

Learning from Demonstrations over Riemannian Manifolds using Neural ODEs: An Extended Abstract

Diana Cuervo Espinosa, Mahathi Anand, Angela P. Schoellig

*This work is supported in part by Robotics Institute Germany, funded by BMFTR grant 16ME0997K 1 Chair of Robotics and System Intelligence, Technical University of Munich, Germany

2026-06-05模仿学习

该文针对示教学习多在欧氏空间中处理、难以自然表示机器人姿态等曲流形状态的问题,提出用 VAE 将位姿示教编码为黎曼潜空间,并以目标条件 Neural ODE 近似测地线生成运动。仿真中路径能留在数据流形簇内并避开低密度边界,目标收敛精度具竞争力;主要收益是推理时间显著快于图搜索式测地线方法,但验证仍限于简单案例。

MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping Figure 1
2026-06-05cs.RO

MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping

Haofei Lu, Hongjia Liu, Yifei Dong, Florian T. Pokorny, Jens Lundell, Danica Kragic

Department of Robotics, Perception and Learning, KTH Royal Institute of Technology, Sweden., Robotics and Autonomous Systems at University of Turku, Finland.

2026-06-05生成模型强化学习

本文针对灵巧手抓取常把全部自由度用于单物体、难以连续保留已抓物的问题,提出 MoDex:以点云、抓取历史和 opposition space 指定参与手指的扩散策略,只占用部分自由度并通过模仿学习预训练、DPPO 强化学习微调。仿真和 Franka+Allegro 实机实验中,相比学习基线成功率分别提升 2.92–17.92% 和 6.67–17.78%。

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents Figure 1
2026-06-05cs.RO

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

The University of Texas at Austin, Iowa State University

2026-06-05机器人

本文针对 LLM 生成机器人技能“易生成、难信任”的问题,提出 VASO:把技能表示为同时面向模型检查器和规划器的语义契约,用时序逻辑与命题对齐标注函数验证技能诱导计划,并将反例轨迹转成文本梯度更新可复用技能而非微调模型。其在 Jackal 与 PX4 任务上用少于 100 个优化样本达到约 97.2% 形式规约合规率,优于执行反馈、提示优化和微调基线,但自动命题对齐本身仍未被形式验证。

Efficient Computation of Distance Functions for Navigation Vector Fields in Lie Groups Figure 1
2026-06-05cs.RO

Efficient Computation of Distance Functions for Navigation Vector Fields in Lie Groups

Vinicius M. Gonçalves, João Baião, Felipe Bartelt, Douglas G. Macharet, Gustavo M. Freitas, Héctor Azpúrua, Luciano C. A. Pimenta

2026-06-05机器人

面向李群导航向量场的路径跟踪,控制环中反复求机器人位姿到曲线的最近点代价高,尤其不适合嵌入式高频控制。论文将曲线限制为李群上的 G-polynomial,利用其结构把近似距离计算化为少量多项式求根,并给出 SE(3) 实用公式,可作为直接近似或优化初值。仿真中相对 Piyavskii–Shubert 保持精度并最高约 5× 加速,且在 7 自由度机械臂上验证闭环跟踪。

Flash-WAM: Modality-Aware Distillation for World Action Models Figure 1
2026-06-05cs.LG

Flash-WAM: Modality-Aware Distillation for World Action Models

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

Northeastern University, University of Georgia, EmbodyX Inc.

2026-06-05强化学习

Flash-WAM针对世界-动作模型虽能联合预测未来视频与动作、但扩散去噪步数过多难以实时控制的问题,指出视频与动作因SNR噪声日程不同导致普通一致性蒸馏在低噪动作流梯度消失。其按模态选择一致性函数:视频用保方差参数化,动作用线性梯度缩放。基于LingBot-VA,单步推理将RoboTwin延迟由8.1秒降至348毫秒,约23倍加速,并保持RoboTwin 85.5%、LIBERO 95.7%成功率,真实Unitree G1平均60%。

Inverse Manipulation through Symbolic Planning and Residual Operator Learning Figure 1
2026-06-05cs.RO

Inverse Manipulation through Symbolic Planning and Residual Operator Learning

Yigit Yildirim, Giuseppe Rauso, Riccardo Caccavale, Alberto Finzi

2026-06-05机器人规划控制

论文关注机器人技能“撤销”问题:许多操作,尤其非抓取推动,不能靠倒放轨迹恢复初始世界状态。作者将演示中抽取的 STRIPS 符号算子转为逆向恢复目标,先用符号规划完成可达部分,再把未满足谓词转成残差强化学习奖励细化控制。在 ManiSkill3 PushCube 上,方法达到 1 cm 容差下 90% 成功率和 1.4 mm 平均精度,但实验仅覆盖单一任务族。

A New Quaternion-Joint Cable-Driven Redundant Manipulator Configuration and its Control Through FABRIK and Residual Reinforcement Learning Figure 1
2026-06-05cs.RO

A New Quaternion-Joint Cable-Driven Redundant Manipulator Configuration and its Control Through FABRIK and Residual Reinforcement Learning

Tanapath Pornthisan, Thanapat Kemthong, Thanyapisit Kangsathien, Pasut Aranchaiya, Paulo Garcia, Viboon Sangveraphunsiri

2026-06-05强化学习规划控制

面向狭窄、遮挡环境中轻量机械臂的路径穿越需求,论文针对四元数关节线驱冗余机械臂建模复杂、制造误差易放大导致控制不稳的问题,提出4段8关节的新构型,并用FABRIK作模型基线、残差强化学习补偿滞后和未建模动力学。仿真与实物结果称该构型以更少关节/硬件获得更大工作空间,RRL在位置和姿态精度上较FABRIK提升约三个数量级。

OLIVE: Online Low-Rank Incremental Learning for Efficient Adaptive Exoskeletons Figure 1
2026-06-05cs.RO

OLIVE: Online Low-Rank Incremental Learning for Efficient Adaptive Exoskeletons

Dong Liu, Yanxuan Yu, Ben Lengerich, Tony Geng, Ying Nian Wu

University of California, Los Angeles, Columbia University, University of Wisconsin-Madison, Rice University, University of California, Los Angeles Los Angeles California USA, Columbia University New York New York USA, University of Wisconsin-Madison Madison Wisconsin USA, Rice University Houston Texas USA

2026-06-05机器人

针对外骨骼控制器部署后难以适应用户差异、疲劳和复杂地形的问题,OLIVE将预训练基控制器冻结,仅在线更新低秩残差,并用传感器奖励、门控和动态秩调度在稳定性与算力间折中。实验称其在步态平滑、省力和稳定性上较最强基线分别提升13、22、15个百分点,约1800步收敛、端到端延迟7.4毫秒。

2026-06-04

45 篇
GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors Figure 1
2026-06-04cs.RO

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

2026-06-04机器人视觉感知三维

针对人形机器人移动操作示范依赖遥操作/动捕、难以覆盖多物体和场景的问题,GRAIL先构建已知尺度、相机、几何和机器人形态的3D场景,再用视频基础模型提供交互先验并重建可执行4D人-物轨迹,降低单目视频歧义。其生成2万余条序列训练Unitree G1视觉策略,真实抓取成功率84%、爬楼梯90%,增益可能主要来自资产条件化数据规模与更受约束的重建。

X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation Figure 1
2026-06-04cs.RO

X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation

Rachel Luo, Michael Watson, Apoorva Sharma, Heng Yang, Han Qi, Edward Schmerling, Sushant Veer, Boris Ivanovic, Marco Pavone

2026-06-04强化学习数据集/基准

面向机器人策略上线验证中真实测试昂贵、最新策略样本少的问题,X4Val将仿真、历史日志和跨平台等非配对多域数据嵌入共享表示,学习可迁移的真实指标神经代理,并以交叉拟合控制变量保持估计有效性。文中在自动驾驶与真实机器人操作案例中,相比蒙特卡洛和经典配对控制变量获得更窄置信区间,最高降低38.4%方差。

HORIZON: Recoverability-Governed Curriculum for Physical-Domain Scaling Figure 1
2026-06-04cs.RO

HORIZON: Recoverability-Governed Curriculum for Physical-Domain Scaling

Chenhao Bai, Liqin Lu, Kaijun Wang, Hui Chen, Jin-Chuan Shi, Yuyang Liu, Hao Chen, Chunhua Shen

Zhejiang University, State Key Lab of CAD & CG, Zhejiang University of Technology

2026-06-04机器人

论文关注在线强化学习中机器人策略如何扩大物理域而不陷入不可恢复失败:单纯加宽域随机化会让四足机器人采样失去纠正信号。HORIZON将“可恢复性”作为课程边界,通过检查点回滚与边界细化逐步扩展动力学扰动。实验显示,不同物理轴可学习速度不一,紧凑核心域优于盲目全域覆盖,离线专家蒸馏也难替代联合在线课程带来的鲁棒性。

Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation Figure 1
2026-06-04cs.RO

Generalization of World Models under Environmental Variability for Vision-based Quadrotor Navigation

Luca Zanatta, Grzegorz Malczyk, Kostas Alexis

Norwegian University of Science and Technology

2026-06-04机器人视觉感知强化学习学习理论

本文针对视觉四旋翼世界模型在环境结构、障碍和感知变化下是否仍可迁移这一问题,系统比较不同随机性下 DreamerV3 的自监督预训练与强化学习微调,并用跨环境重建验证替代单纯仿真胜率作为评估信号。核心发现是 SSL 阶段的跨环境鲁棒性更能预测 sim-to-real:泛化好的模型均在真实未知场景成功穿越最窄 0.67 m 间隙,仿真最强策略反而失败;离散潜变量规模和训练序列长度是主要影响因素,开放环还可在仅 2.5 s 真实输入后想象飞行 12 m。

CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation Figure 1
2026-06-04cs.CV

CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation

Yurim Jeon, Dongseong Seo, Seung-Woo Seo

2026-06-04视觉感知三维

论文针对跨视角地理定位中“检索覆盖广但精度受限、位姿估计精但搜索范围窄”的割裂问题,提出 CIPER 将城市级地面-航拍图像检索与 3-DoF 位姿估计放入同一 Transformer 框架,通过共享编码器、任务 token、双向跨注意力位姿解码器和集合预测来统一全局匹配与局部对齐。在 VIGOR、KITTI、Ford Multi-AV 上表现出有竞争力的检索与定位性能,尤其在视场受限和朝向不确定场景更稳健。

What Can Eye Gaze Teach Us About Real-World Cycling? Insights From the Oxford RobotCycle Project Figure 1
2026-06-04cs.HC

What Can Eye Gaze Teach Us About Real-World Cycling? Insights From the Oxford RobotCycle Project

Benjamin Hardin, Efimia Panagiotaki, Daniele De Martini, Lars Kunze

University of Oxford, University of the West of England Bristol, University of Oxford Oxford United Kingdom, University of the West of England Bristol Bristol United Kingdom

2026-06-04机器人强化学习

该研究关注真实骑行中“感知危险”难以事后自报的问题,利用 Oxford RobotCycle 试验中可穿戴眼动眼镜采集的凝视时长与水平视线离散度,比较车道类型、路口、事件和路线差异。结果显示,牛津狭窄非保护自行车道与机动车道眼动差异有限,公交车道更具区分;不同路口及超车、行人等事件会显著改变眼动模式。但作者也指出,仅靠眼动难以区分具体事件或稳定估计压力,需结合目标检测与场景分割。

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement Figure 1
2026-06-04cs.RO

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

Yunpeng Mei, Jiakai He, Hongjie Cao, Chenyu Wang, Xiaowen Zhu, Yihan Zhou, Jiamin Wang, Chenbo Xin, Peng Cheng, Yuxuan Yang, Yijie Wang, Xinhu Zheng, Gao Huang, Jie Chen, Gang Wang

2026-06-04视觉语言视觉感知生成模型强化学习

该文针对VLA机器人在部署后产生成功、半成功与失败混合轨迹,传统BC会模仿失败、筛选又浪费数据、离线RL需额外critic的问题,提出ForesightFlow:在流匹配动作块中联合生成成功潜势,并将优势加权仅用于动作、潜势均匀训练以避免价值幻觉,再用潜势做best-of-K选择。实验在BEHAVIOR-1K和真实双臂任务上优于模仿基线,仿真接近独立critic方法,训练计算减少38%。

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation Figure 1
2026-06-04cs.RO

WAM-Nav: Asymmetric Latent World-Action Modeling for Unified Visual Navigation

Ning Yang, Yan Huang, Kaiwen Peng, Ziheng He, Kai Wang, Cui Miao, Kailin Lyu, Guo Li, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu

Nanjing University, Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences, National University of Defense Technology, Tsinghua University

2026-06-04机器人强化学习

针对视觉导航中反应式策略缺少前瞻、模块化视觉想象又带来误差累积和延迟的问题,WAM-Nav将长时域动作生成与短时域潜在视觉预测放入共享Diffusion Transformer中做非对称联合扩散,并结合双流上下文和统一目标对齐,支持图像目标、点目标与无目标探索。实验在ClutterScenes和InternScenes上显示其泛化更强,Image-Goal与Point-Goal成功率分别提升15.7%和3.3%,实机零样本迁移平均成功率达85%。

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving Figure 1
2026-06-04cs.RO

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving

Renju Feng, Rukang Wang, Ning Xi, Jianguo Yu, Liping Lu, Pan Zhou, Duanfeng Chu

School of Cyber Science and Engineering, Huazhong University of Science

2026-06-04生成模型规划控制

论文针对端到端自动驾驶在高方差人类示范下易出现“风格平均”、缺乏可控性且可能运动学不安全的问题,提出 D³-MoE:用风格条件扩散并行生成多风格候选,并将轨迹按横向/纵向物理维度解耦,由自监督路由选择 DiT 专家后重组。NAVSIM 上默认达到 88.2 PDMS、84.3 EPDMS,Best-of-Three 提升至 91.3、87.5,显示规划质量与风格可控性优势。

Teaching Robots to Say 'I Don't Know' : SENTINEL for Uncertainty-Aware SLAM Figure 1
2026-06-04cs.RO

Teaching Robots to Say 'I Don't Know' : SENTINEL for Uncertainty-Aware SLAM

Abhishek S, Badrikanath Praharaj, Sreeram MV

2026-06-04机器人安全鲁棒

低成本仅测距2D LiDAR缺少强度/双回波诊断,遇到玻璃、镜面等会让SLAM无声崩坏。SENTINEL无需训练和标签,融合扫描几何统计与LiDAR/RGB-D深度一致性,为每帧给可靠度并在低阈值时屏蔽扫描、退回里程计。实机五类材质实验显示玻璃区R_geo最低0.24、与干净最小值相差3.8倍,可定位拒绝/噪声区域;同时指出红外传感器失效不独立及Gazebo难复现这些故障。

M3imic: Learning a Versatile Whole-Body Controller for Multimodal Motion Mimicking Figure 1
2026-06-04cs.RO

M3imic: Learning a Versatile Whole-Body Controller for Multimodal Motion Mimicking

Zuxing Lu, Ziang Zheng, Yao Lyu, Jingyu Liu, Feihong Zhang, Song Lu, Xin Yuan, Changyin Sun, Xingxing Zuo, Shengbo Eben Li

Tsinghua-Efort Joint Research Center for EAI Computation and Perception and SunRisingAI Lab, Zuxing Lu, Jingyu Liu, Xin Yuan and Changyin Sun are with the School of Automation, Southeast University, Nanjing 210096, China., Ziang Zheng, Yao Lyu, Feihong Zhang, Song Lu and Shengbo Eben Li are with the School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China., Xingxing Zuo is with the Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi 7909, UAE.

2026-06-04视觉语言规划控制

M3imic针对人形机器人低层全身控制中关节轨迹、人类姿态与末端执行器位姿等参考模态稠密度和结构不一致的问题,提出用模态专属编码器映射到共享隐式指令空间,并结合课程式采样进行端到端强化学习,避免部署时IK或多阶段蒸馏。其单一策略在Unitree G1上验证,可跨模态零样本迁移;仿真未见测试集最高成功率达98.42%。

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning Figure 1
2026-06-04cs.RO

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning

Amirhosein Alian, Yongqiang Zhao, Shiyi Gu, Xuyang Zhang, Zhuo Chen, Christopher E. Mower, Haitham Bou-Ammar, Shan Luo

King’s College London, UK, Huawei, Noah’s Ark Lab, UK, University College London, UK

2026-06-04视觉感知模仿学习数据集/基准

针对现有 VLA 操作数据多缺少触觉、语言条件与动作轨迹耦合的问题,HapTile 构建了带操作者实时力触觉反馈的视觉-触觉-语言-动作数据集,含 38 个日常接触丰富任务、1726 条演示及自研指尖视觉触觉传感器。基准实验显示触觉在插孔、擦白板等任务上可显著提升 π0 表现,如插孔由 0% 到 90%,但不同触觉表示收益不稳定,融合策略仍待改进。

Real-World Deployment of a 5G-Connected Edge-Controlled Aerial Robot in Industrial Subterranean Mines Figure 1
2026-06-04cs.RO

Real-World Deployment of a 5G-Connected Edge-Controlled Aerial Robot in Industrial Subterranean Mines

Achilleas Santi Seisa, Emanuele Pagliari, Gerasimos Damigos, Elias Small, George Nikolakopoulos

University of Technology, Luleå

2026-06-04机器人强化学习规划控制

针对5G边缘控制机器人多停留在仿真或实验室、难以验证工业可用性的缺口,论文把无人机高层NMPC控制器卸载到矿区附近Kubernetes边缘集群,并通过5G NR SA闭环连接,在活跃地下矿山按人工航点自主飞行、规划平滑避障轨迹。实测部署表明该架构可在真实矿山中运行并满足基本实时控制需求,但量化性能增益与稳定裕度文中未充分说明。

Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives Figure 1
2026-06-04cs.CV

Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives

Ayumi Umemura, Toshinori Kuwahara, Marc Pollefeys, Daniel Barath

2026-06-04机器人

室内机器人定位常依赖预建3D地图或针对场景训练的模型,难以维护和迁移;Z-FLoc改用普遍可得的2D平面图,将单目重建投影为BEV后提取线、圆等几何基元,并用最小求解器与鲁棒假设验证完成跨模态匹配。实验显示其在模拟和真实未见环境中优于需目标域训练的学习方法,且全程使用固定超参数。

SoftPINCH: EMG-Driven Soft Exoskeleton Assistance for Finger Flexion and Grasping Figure 1
2026-06-04cs.RO

SoftPINCH: EMG-Driven Soft Exoskeleton Assistance for Finger Flexion and Grasping

Nicklas Nikolaj Grønvall, Magnus Malthe Sigsgaard Nielsen, Xiaofeng Xiong, Saravana Prashanth Murali Babu

2026-06-04机器人

针对传统手部外骨骼笨重、限制自然运动,以及肌电控制易受噪声和个体差异影响的问题,SoftPINCH将腱驱动软拇指-食指外骨骼、指尖磁接触传感与实时sEMG意图解码结合。实验显示CNN+LSTM在跨被试测试中达99.4%准确率,注意力模块无明显增益;主动辅助可显著降低屈指和抓握肌肉负担,最高负载下减少92.6%。

COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection Figure 1
2026-06-04cs.RO

COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection

Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan, Julian F. P. Kooij

Department of Cognitive Robotics, Delft University of Technology, Department of Intelligent Systems, Delft University of Technology, the Netherlands

2026-06-04机器人强化学习规划控制安全鲁棒

面向机器人安全强化学习中奖励与安全 Q 值相关却常被独立估计的问题,论文提出 COP-Q:在联合 Q 空间构造置信界,并用 Cholesky 分解按“安全优先”顺序投影不确定性,保留安全保守性同时减轻奖励过度保守。Brax 运动与 Safety-Gymnasium 导航实验显示,其在硬/软安全设置下保持较强安全表现,并取得有竞争力或更好的样本效率。

CADENCE: Predicting Realized MAPF Execution Time Beyond Sum of Costs Figure 1
2026-06-04cs.RO

CADENCE: Predicting Realized MAPF Execution Time Beyond Sum of Costs

Abhishek S, Badrikanath Praharaj, Sreeram MV

2026-06-04机器人

这篇论文针对MAPF常用SoC、makespan等离线指标难以反映真实机器人执行耗时的问题,在7×7工作区、7台差速机器人上构建480次硬件执行数据,分层比较SoC、原始运动负担与交互协调结构的预测力。核心洞察是,执行时间差异在机器人启动前已部分体现在计划的转弯、连续移动、启停等运动描述中;加入这些特征相较SoC-only将 held-out MAE/RMSE约降48%–61%,而协调特征增益较小且稳定性不足。

CoRe-MoE: Contrastive Reweighted Mixture of Experts for Multi-Terrain Humanoid Locomotion with Gait Adaptation Figure 1
2026-06-04cs.RO

CoRe-MoE: Contrastive Reweighted Mixture of Experts for Multi-Terrain Humanoid Locomotion with Gait Adaptation

Kailun Huang (1), Zikang Xie (1), Yanzhe Xie (1), Panpan Liao (3), Fanghai Zhang (1), Yanheng Mai (1), Wenhao Xu (2), Yunheng Wang (1), Renjing Xu (1), Haohui Huang (3) ((1) Hong Kong University of Science and Technology (Guangzhou), (2) South China Agricultural University, (3) Guangdong University of Technology)

Hong Kong University of Science and Technology (Guangzhou), South China Agricultural University, Guangdong University of Technology

2026-06-04机器人

针对单一策略同时处理人形机器人步行/跑步切换与复杂地形适应时易出现梯度干扰、MoE专家不分化的问题,CoRe-MoE将基础步态生成与地形感知调整分两阶段训练,并用对比学习重加权MoE门控以形成地形专门化,再融合两路动作。仿真中成功率、稳定性和多地形适应性优于基线,并在Unitree G1上零样本通过楼梯、斜坡、障碍和户外地形。

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training Figure 1
2026-06-04cs.RO

VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training

Siyuan Yang, Linzheng Guo, Ouyang Lu, Zhaxizhuoma, Daoran Zhang, Xinmiao Wang, Ting Xiao, Fangzheng Yan, Zhijun Chen, Yan Ding, Chao Yu, Chenjia Bai, Xuelong Li

2026-06-04视觉感知

VISTA关注UMI手持示教数据用于VLA训练时的两类失配:腕部鱼眼视角偏离VLM预训练分布,且人采轨迹可能违反目标机器人的运动学、碰撞和控制约束。方法通过UMI-VQA做鱼眼视觉语言对齐,并在训练前进行轨迹级物理验证,再以两阶段共训练学习动作。实验显示UMI-VQA能稳定提升策略表现,物理验证分数与部署成功相关,并在仿真和真实操作中优于π0.5、LingBot-VLA和Wall-X。

BPDA-GMM: Bayesian Probabilistic Data Association via Gaussian Mixture Models for Semantic SLAM Figure 1
2026-06-04cs.RO

BPDA-GMM: Bayesian Probabilistic Data Association via Gaussian Mixture Models for Semantic SLAM

Thanh Nguyen Canh, Haolan Zhang, Xiem HoangVan, Antonio Sgorbissa, Nak Young Chong

2026-06-04三维

这篇论文针对语义 SLAM 中相似物体导致的数据关联歧义,以及在线建图时地标集合不断增长使传统 PDA 需重算权重或手调新地标概率的问题,提出 BPDA-GMM:用 Dirichlet 过程/CRP 给新旧地标分配贝叶斯关联概率,并以语义高斯混合增量更新对象地图,结合语义-几何门控、歧义时的 α-divergence tempering 和零位姿雅可比后端。仿真与真实室内实验显示其在轨迹精度、语义地图质量及对感知混淆和分类错误的鲁棒性上优于基线。

MineXplore: An Open-Source Reinforcement Learning Exploration Benchmark for GNSS-Denied Underground Environment Figure 1
2026-06-04cs.RO

MineXplore: An Open-Source Reinforcement Learning Exploration Benchmark for GNSS-Denied Underground Environment

Abhishek S, Badrikanath Praharaj, Sreeram MV

2026-06-04强化学习数据集/基准

面向GNSS失效、弱光且拓扑复杂的地下矿井导航,本文指出现有开放仿真多停留在Gazebo或程序生成场景,难以服务GPU强化学习。MineXplore将智利真实铜矿数据经六阶段轮廓到MJCF流程编译为MuJoCo/Gymnasium基准,加入LiDAR墙面、摩擦区、坡度与照明;几何IoU达0.9538,PPO五种子最佳覆盖率88.89%±1.74%,但其物理参数仍非严格数字孪生。

MAD: Mapping-Aware World Models for Agile Quadrotor Flight Figure 1
2026-06-04cs.RO

MAD: Mapping-Aware World Models for Agile Quadrotor Flight

Xinhong Zhang, Runqing Wang, Yunfan Ren, Ding Yu, Boyu Zhou, Jian Sun, Fang Deng, Jie Chen, Gang Wang

2026-06-04强化学习

面向杂乱环境中四旋翼高速飞行的部分可见、需记忆与低延迟控制问题,MAD在端到端策略和传统建图规划之间引入几何感知世界模型,用占据/可见性栅格与本体状态重建替代原始图像重建,使潜变量携带空间记忆和自运动信息。借助DiffAero的GPU并行地图监督,MAD可结合Dreamer、PPO和SHAC训练,在导航与竞速中较视觉基线提升成功率、速度和跨任务迁移,并实现仿真9.66 m/s、真实森林5.05 m/s飞行。

Cooperative Circumnavigation for Multiple Unmanned Surface Vehicles Without External Localization Figure 1
2026-06-04cs.RO

Cooperative Circumnavigation for Multiple Unmanned Surface Vehicles Without External Localization

Xueming Liu, Lin Li, Xiang Zhou, Tianjiang Hu, Qingrui Zhang

School of Aeronautics and Astronautics, Sun Yat-sen University (Shenzhen Campus), Shenzhen, China

2026-06-04机器人

针对无 GPS/外部定位时多无人艇难以同时估计目标与队友相对位置并保持环绕编队的问题,论文利用目标非合作、艇间可协作的感知不对称,采用目标方位的 PLKF 与艇间测距/里程计的最大相关熵 KF,并用耦合振子控制主动产生持久激励以保证可观测性。理论证明估计器可观测且编队可收敛,数值仿真验证了在非高斯测距噪声和短暂遮挡下的有效性。

TransTac: Visuo-Tactile Modality Transition via Ultraviolet-Encoded Transparent Elastomers Figure 1
2026-06-04cs.RO

TransTac: Visuo-Tactile Modality Transition via Ultraviolet-Encoded Transparent Elastomers

Lingyue Yang, Bin Fang

2026-06-04机器人

TransTac针对传统视觉触觉传感器不透明、RGB-D近距离深度退化导致预接触到接触阶段存在感知断层的问题,提出透明硅胶中嵌入紫外反光标记的双目VBTS,并用轻量标记检测与先验引导Delaunay立体匹配实现稀疏三角化重建。实验显示匹配鲁棒性较全局分配基线提升约21%,触觉图像零样本识别最高83.3%,跨模态对齐显著增强,原型成本约70美元。

OSCAR: Omni-Embodiment Skeleton-Conditioned World Action Model for Robotics Figure 1
2026-06-04cs.RO

OSCAR: Omni-Embodiment Skeleton-Conditioned World Action Model for Robotics

Zhuoyuan Wu, Jun Gao

Peking University, University of Michigan

2026-06-04机器人强化学习

OSCAR针对机器人视频世界模型在真实策略评估中动作跟随不准、场景/本体泛化弱的问题,构建经清洗去重的多机器人本体与第一视角人手联合数据,并用无纹理的2D运动学骨架作为统一动作条件来减轻外观过拟合。基于Cosmos-Predict2.5-2B单卡微调后,在动作一致性、画质和运动连贯性上优于更大或更耗算力基线,且在RoboArena上的虚拟成功率与真实评估显著相关。

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training Figure 1
2026-06-04cs.CV

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

Shanghai Jiao Tong University, Harbin Institute of Technology, Nanyang Technological University, Fudan University, Nanjing University, Great Bay University

2026-06-04视觉语言视觉感知三维

这篇论文针对现有VLA主要依赖2D图像、在机器人操作中缺乏3D空间推理的问题,提出3DThinkVLA:将低层几何感知与高层空间推理解耦,通过潜空间3D特征对齐、带推理锚点的在线蒸馏和空间增强动作融合,把3D先验注入动作预测而无需推理时3D传感器或显式CoT。实验称其在LIBERO、LIBERO-PLUS、SimplerEnv及真实机器人任务上达到SOTA,并缓解动作捷径与灾难性遗忘。

When Freshness Is Not Enough: Distribution-Aware Age of Information for Networked LQR Control Figure 1
2026-06-04eess.SY

When Freshness Is Not Enough: Distribution-Aware Age of Information for Networked LQR Control

Abdullah Y. Etcibasi, C. Emre Koksal, Eylem Ekici

Abdullah Y. Etcibasi, C. Emre Koksal, and Eylem Ekici are with the Department of Electrical and Computer Engineering, The Ohio State University, Columbus, OH 43210, USA.

2026-06-04规划控制

本文针对网络化 LQR 控制中“平均信息年龄越小越好”的常见假设,直接从闭环代价推导调度目标,指出性能取决于更新间隔分布的高阶矩, unstable 或相关扰动下还取决于指数矩,而非均值 AoI。理论上给出状态无关策略下近周期调度的最优性,并用 NGSIM US-101 跟车数据验证:相同平均 AoI 的策略可产生显著不同跟踪代价。

Think Fast and Far: Long-Horizon Online POMDP Planning via Rapid State Sampling Figure 1
2026-06-04cs.RO

Think Fast and Far: Long-Horizon Online POMDP Planning via Rapid State Sampling

Yuanchu Liang, Edward Kim, J. Arden Knoll, Wil Thomason, Zachary Kingston, Lydia E. Kavraki, Hanna Kurniawati

2026-06-04规划控制

本文针对长时域、部分可观测机器人规划中在线 POMDP 求解难以兼顾深度与动作空间规模的问题,提出 ROP-RAS3:用 VAMP 加速的采样式运动规划在线生成多样宏动作,并以参考策略形式改写 Bellman 备份,避免穷举动作。实验覆盖最高 3000 步前瞻和 35 维状态的导航、操作及实机任务,成功率较现有在线 POMDP 方法提升数倍,但最优性针对参考式目标而非原始 POMDP。

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation Figure 1
2026-06-04cs.RO

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation

Yilong Wang, Cheng Qian, Edward Johns

The Robot Learning Lab, Imperial College London

2026-06-04机器人模仿学习

论文针对可变形物体操作中状态高维、遮挡和同一任务存在多种折叠方式的问题,提出用单次人类演示替代难以精确定义的语言指令。Instant-Fold 先通过时间对比预训练学习形变一致的视觉 token,再用演示条件化的 flow-matching Transformer 生成双臂动作。仿真训练在服装折叠中优于语言条件和多种基线,并展示未微调的真实机器人零样本迁移,但仍依赖可靠分割和有限手工上下文库。

RSC: Decentralized Rigid Formation Flocking for Large-Scale Swarms via Hybrid Predictive Control and Online Reconfiguration Figure 1
2026-06-04cs.RO

RSC: Decentralized Rigid Formation Flocking for Large-Scale Swarms via Hybrid Predictive Control and Online Reconfiguration

Ganyu Zou, Linhan Wang, Chen Dai, Siji Chen, Chang-Tien Lu

2026-06-04规划控制

面向大规模无人机在杂乱环境中既要避障又要严格保持刚性队形的问题,RSC将有限时域轨迹预测、APF近场安全控制和在线领导—跟随角色重配置结合,以缓解局部极小、振荡和穿障后重组迟缓。25架无人机场景中,在无碰撞且边长误差低于10%的标准下成功率达83%,显著高于低于5%的基线。

What Are We Actually Benchmarking in Robot Manipulation? Figure 1
2026-06-04cs.RO

What Are We Actually Benchmarking in Robot Manipulation?

Tianchong Jiang, Xiangshan Tan, Samuel Wheeler, Luzhe Sun, Tewodros W. Ayalew, Matthew Walter

Toyota Technological Institute at Chicago, Chicago, IL, USA, University of Chicago, Chicago, IL, USA, Argonne National Laboratory, Lemont, IL, USA

2026-06-04机器人数据集/基准

这篇论文质疑机器人操作领域把固定基准分数等同于通用操作能力的做法,提出用“捷径可解性、统计显著性、渐进过拟合、数据来源依赖”四类诊断审计基准有效性。作者评估 LIBERO、CALVIN、SimplerEnv、RoboCasa 与 RoboTwin 2.0,发现最常被引用的 LIBERO、CALVIN 等反而失败更多:如无语言编码器的 0.09B 探针可接近 LIBERO SOTA,许多 SOTA 增益不显著,CALVIN 姿态重采样会显著降分。

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification Figure 1
2026-06-04cs.RO

PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification

Charlie Gauthier, Sacha Morin, Liam Paull

2026-06-04规划控制三维

针对开放词汇语义地图仍是静态表示、难以在真实执行前验证 LLM 机器人计划的问题,PerceptTwin 将机器人感知得到的 3D 场景图自动转成可交互仿真:匹配/生成资产、用点云定位、预测 affordance,并引入 LLM judge 做可行性与安全偏好检查。实验显示其反馈使 GPT5 系列规划成功率平均提升约 39%,人类对前置条件失败计划的判断准确率最高提升 18%。

Towards Estimating Normal and Shear Interface Pressures in Prosthetic Sockets via Least Squares and Mechanics Modeling Figure 1
2026-06-04cs.RO

Towards Estimating Normal and Shear Interface Pressures in Prosthetic Sockets via Least Squares and Mechanics Modeling

Axel González Cornejo, Tianhao Yu, Chi Hwan Lee, Edgar Bolívar-Nieto

2026-06-04机器人

针对假肢接受腔适配仍依赖人工经验、界面压力数据稀疏且剪切力难测的问题,论文搭建了可同步获取全局六维力/力矩与局部法向/剪切压力的受控测试台,并用准静态弹簧-质量接触模型结合两阶段凸最小二乘识别参数。静态载荷验证显示,引入常值偏置可降低力/力矩通道稳态误差并改善局部载荷一致性,Pareto 分析进一步揭示全局与局部目标间的权衡。

DLO-Lab: Benchmarking Deformable Linear Object Manipulations with Differentiable Physics Figure 1
2026-06-04cs.RO

DLO-Lab: Benchmarking Deformable Linear Object Manipulations with Differentiable Physics

Junyi Cao, Yian Wang, Ziyan Xiong, Chunru Lin, Zhehuan Chen, Chuang Gan

2026-06-04机器人数据集/基准

针对绳索、电缆等可变形线状物体任务长期依赖窄任务启发式、真实数据难扩展且仿真材料/接触支持不足的问题,DLO-Lab构建了面向DLO的可微物理仿真与基准,支持弹性、不可伸长性、弯曲塑性、环拓扑及与刚体/软体/流体耦合,并加入抓取点提议和长程任务分解代理。实验显示,可用梯度时基于梯度的方法样本效率最高,接触不连续或稀疏奖励下采样优化更稳健,且部分策略可迁移到真实机器人。

Dual Advantage Fields Figure 1
2026-06-04cs.LG

Dual Advantage Fields

Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin, Dmitry V. Dylov, Fakhri Karray, Vladislav Kurenkov, Martin Takáč, Arip Asadulaev

Computational Imaging Lab, dunnolab, Innopolis University

2026-06-04机器人

论文针对离线目标条件强化学习中“全局可达性估计”难以直接给出局部动作偏好的问题,提出 Dual Advantage Fields:利用双线性价值表示中目标嵌入等价于状态表示空间价值梯度的洞察,学习动作造成的折扣特征位移,并按其与目标方向的对齐度为动作打分。该信号在可实现情形下对应 Bellman advantage,可用于无需额外 Q 函数的策略提取;在 OGBench locomotion、manipulation 与 puzzle 任务上提升了聚合 RLiable 指标,尤其适合局部正确动作并非直指最终目标的场景。

Distribution-Free Risk-Aware Planning and Control Under Uncertainty Using Conformal Spectral Risk Control Figure 1
2026-06-04cs.RO

Distribution-Free Risk-Aware Planning and Control Under Uncertainty Using Conformal Spectral Risk Control

Junsik Eom, Tulga Ersal

2026-06-04规划控制安全鲁棒

面向真实不确定分布难以准确建模导致风险感知 MPC 约束可能失效的问题,本文将共形风险控制扩展到一般谱风险度量,构造无需分布假设的预测集,并嵌入 RA-MPC 以给出统计意义上的谱风险安全保证。在静态与动态车辆避障仿真中,相比基于采样平均的 RA-MPC,在分布错设下碰撞安全性更好且求解时间更低。

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation Figure 1
2026-06-04cs.RO

Affordance2Action: Task-Conditioned Scene-level Affordance Grounding for Real-Time Manipulation

Litao Liu, Yifan Han, Pengfei Yi, Wenbo Yu, Hanqing Wang, Haoran Du, Enze Yuan, Zilin Yuan, Ruiding Feng, Michael Liu, Qi Zhang, Jingjin Yu

Department of Computer Science, Rutgers University-New Brunswick, The Hong Kong University of Science and Technology (GZ), Shanghai AI Laboratory

2026-06-04机器人视觉语言

论文针对语言操控中“指令应落到功能部件而非物体类别”、且拥挤场景常一对多的问题,提出 A2A:用 A2A-AffordGen 构建真实多物体的任务条件 affordance 基准,并改造 SAM3 做实时掩码 grounding,再将其作为策略空间先验。实验显示其在单/多区域定位上优于通用分割、VLM 与蒸馏基线,A2A-GroundingModel 达 9.7 FPS,并在 LIBERO 与真实机械臂任务中提升策略成功率。

Multi-Agent Next-Best-View Optimization for Risk-Averse Planning Figure 1
2026-06-04cs.RO

Multi-Agent Next-Best-View Optimization for Risk-Averse Planning

Amirhossein Mollaei Khass, Vivek Pandey, Guangyi Liu, Athanasios Cosse, Emrah Bayrak, Nader Motee

2026-06-04规划控制优化算法安全鲁棒

面向未知环境中多机器人主动建图与安全导航的通信瓶颈,本文提出分布式、风险规避的 NBV 优化:各机器人保留本地 3DGS 地图,仅交换候选视点、轨迹描述和标量信息增益,并用 C-ADMM 协调;AV@R 则用于按轨迹碰撞风险构造关注区域和路径评分。Gibson 仿真显示其建图质量与安全性接近集中式方法,同时通信量降低数个数量级,但真实传感与实机验证文中未充分说明。

Selecting haptic guidance models in teleoperation: guidelines from a comparative user study Figure 1
2026-06-04cs.RO

Selecting haptic guidance models in teleoperation: guidelines from a comparative user study

Alexis Boulay (AUCTUS), Margot Vulliez (AUCTUS), David Daney (AUCTUS)

2026-06-04机器人

针对遥操作中触觉引导模型常凭经验选择、缺少跨场景比较准则的问题,论文将弹簧阻尼、势场和引导管统一为带模型特定引导函数的刚度-阻尼形式,并提出基于力-运动观测的在线交互质量指标。在垂直农场任务用户研究中,结果显示不存在通用最优:弹簧阻尼更适合拥挤环境,势场在空旷场景更快但靠近障碍有风险,引导管整体较均衡;引导力大小还与舒适度和信任评分相关。

CoPark: Learning Reactive Parking via Self-Play Figure 1
2026-06-04cs.RO

CoPark: Learning Reactive Parking via Self-Play

Jiarong Wei, Yanxing Chen, Sinuo Song, Yin Wu, Anna Rehr, Abhinav Valada

Department of Computer Science, University of Freiburg, Germany, Technical University of Munich, Germany

2026-06-04机器人

论文针对自动泊车中“高精度入位”与“对周围车辆即时让行”相互冲突的问题,提出 CoPark:用 Hybrid A*+Stanley 离线轨迹作为几何先验,再由自博弈残差策略按邻车威胁非对称释放控制权,纵向便于让行、横向保持车位对齐,并用闭环细化修正终端误差。在 DLP 与 DSC3D 零样本评测中成功率约 70–85%、碰撞率 3–6%,优于经典、模仿学习和大规模 RL 基线。

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization Figure 1
2026-06-04cs.RO

CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization

Tewodros Ayalew, Matthew Jeung, Samuel Wheeler, Xiao Zhang, Andre de la Cruz Arce, Kaylene Stocking, Michael Maire, Matthew R. Walter

University of Chicago, Toyota Technological Institute at Chicago, Argonne National Laboratory

2026-06-04强化学习

针对传统世界模型依赖显式动作标签、难以利用无标注视频且跨 embodiment 迁移受限的问题,CLAW 将潜在动作模型与扩散式视频世界模型端到端联合训练,并用对抗潜在正则抑制未来信息泄漏、避免表示塌缩,学习连续且有语义结构的潜在动作。实验显示其在观察模仿、目标规划、动作迁移和可控性评测上优于现有方法,但落地执行仍需少量真实动作标注来对齐控制。

Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models Figure 1
2026-06-04math.OC

Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models

Eleanor Brosius, Yuji Takubo, Daniele Gammelli, Simone D'Amico, Marco Pavone

Stanford University

2026-06-04规划控制优化算法

面向航天交会等任务中人工将自然语言需求改写为可解最优控制约束成本高、适应性差的问题,论文提出用结构化输入驱动 LLM 先生成数学约束、再生成 CVXPY 可执行代码并接入凸轨迹优化器。初步消融显示合适提示可稳定产出可运行约束,中间数学表达并非必需但影响不大;在航天器交会案例中成功率较高,但验证范围仍较窄。

AgenticDiffusion: Agentic Diffusion-based Path Planning for Vision-Based UAV Navigation Figure 1
2026-06-04cs.RO

AgenticDiffusion: Agentic Diffusion-based Path Planning for Vision-Based UAV Navigation

Faryal Batool, Muhammad Ahsan Mustafa, Fawad Mehboob, Valerii Serpiva, Dzmitry Tsetserukou

2026-06-04机器人视觉感知生成模型规划控制

针对室内无人机仅依赖单视角视觉导航时易受遮挡、目标不可见和全局结构缺失影响的问题,AgenticDiffusion将语言推理、开放词汇目标定位、多视角视点选择、扩散轨迹规划与NMPC执行整合成统一流程,先生成任务级导航计划再执行。真实室内40次试验中任务成功率为80%,扩散规划器轨迹生成成功率为100%。

CADET: A Modular Platform for Evaluating Distributed Cooperative Autonomy in Connected Autonomous Vehicles Figure 1
2026-06-04cs.RO

CADET: A Modular Platform for Evaluating Distributed Cooperative Autonomy in Connected Autonomous Vehicles

Pragya Sharma, Brian Wang, Mani Srivastava

2026-06-04机器人

针对自动驾驶协同自治从单车单机走向 V2X、边缘/云部署后,网络抖动、异构算力和多租户负载会直接影响安全的问题,CADET 将感知、规划、控制拆成可跨车辆、RSU、边缘和云组合部署的模块,并用 NetWaggle 做可复现实迹驱动网络/负载仿真与多层指标记录。实验显示,低时延 V2V 意图包比云端感知更安全,RSU 辅助感知可缓解遮挡但在并发请求过载后安全裕度会崩塌。

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation Figure 1
2026-06-04cs.CV

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding, Kun Zhou

2026-06-04视觉语言视觉感知

本文针对具身视觉语言决策中 VLM/VLA 容易把干扰物当作目标、产生物体幻觉的问题,提出 SceneDiver:先用场景图建立全局理解,再将任务分解到局部子场景中逐步生成聚焦计划,并通过轻量适配器蒸馏到 VLA 以保留实时性。实验显示其在操作任务提升 10%–15%,导航最高提升 16%,LIBERO-plus 成功率最高提升 9.6%,额外开销约 2.64%。

2026-06-03

80 篇
SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image Figure 1
2026-06-03cs.CV

SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image

Inhee Lee, Sangwon Baik, Sungjoo Kim, Hyeonwoo Kim, Hyunsoo Cha, Hanbyul Joo

Seoul National University

2026-06-03视觉感知三维

面向机器人操作中单图重建场景一进仿真就因穿透、悬空或下沉而失稳的问题,SimuScene将物理引擎从事后修正器改为重建过程中的诊断信号:用重力仿真暴露支撑和碰撞误差,并驱动重力轴拉伸与基于OBB的遮挡形状重采样。实验显示其在物理稳定性和几何对齐指标上达到领先表现,且重建场景可用于类人控制和机械臂操作任务。

Exploring Easy Boosts for Lidar Semantic Scene Completion Figure 1
2026-06-03cs.CV

Exploring Easy Boosts for Lidar Semantic Scene Completion

Tetiana Martyniuk, Jonathan Seele, Alexandre Boulch, Gilles Puy, Renaud Marlet, Raoul de Charette

2026-06-03机器人

本文针对激光雷达语义场景补全中模型结构越来越复杂、但输入先验贡献缺乏系统评估的问题,研究无需改架构的“免费”增强:用现成点云分割器生成语义伪标签,并通过射线投射区分空闲与未知体素。实验表明语义先验是 mIoU 提升主因,可见性带来次级增益;两者结合使4个既有模型平均提升5.2 mIoU,SSA-SC达28.8 mIoU,老模型也能接近或超过可复现SOTA。

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking Figure 1
2026-06-03cs.RO

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

2026-06-03机器人视觉感知

论文针对人形机器人运动跟踪中“敏捷性与零样本泛化难兼得”的问题,认为瓶颈主要来自数据规模不足和模型结构不匹配。Humanoid-GPT用2B帧重定向运动数据、因果GPT式Transformer、专家蒸馏与HME均衡采样来训练在线全身控制器。实验显示其在未见动作、在线遥操作和Unitree G1实机舞蹈等任务上保持实时稳定跟踪,并给出数据/模型规模的scaling分析。

Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation Figure 1
2026-06-03cs.RO

Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation

Roohan Ahmed Khan, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

2026-06-03机器人视觉感知强化学习

针对无人机强化学习导航仍高度依赖人工奖励设计和反复调参的问题,论文提出 AgenticRL:用多模态 GPT 结合任务语言与场景图像生成奖励,经 PPO 训练后再根据策略诊断反馈闭环改写奖励,并在部署时识别场景、选择对应策略。其在穿门、避障、越障降落等任务中使策略行为相对初始奖励提升 71%,真实无人机成功率 91%,仿真到现实准确率 94%。

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring Figure 1
2026-06-03cs.CV

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu

Carnegie Mellon University, Mitsubishi Electric Research Laboratories, Harvard University

2026-06-03视觉语言视觉感知安全鲁棒

面向智能眼镜、协作机器人等物理场景中“同一动作因意图不同而安全性不同”的监控难题,VLESA从第一视角视频联合推断目标与未来动作,并用基于机器人宪法标注的EgoSafety训练GRPO目标条件安全Q-filter进行干预。其在ASIMOV-2.0上提升精确帧干预准确率,Q-filter通过约束解码使动作安全性提高超过41个百分点。

Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation Figure 1
2026-06-03cs.RO

Preference-Calibrated Human-in-the-Loop Reinforcement Learning for Robotic Manipulation

Zeyi Liu, Guangyao Liu, Yinuo Qu, Yuquan Xue, Bofang Jia, Chunhua Yang, Weihua Gui, Keke Huang, Ziwei Wang

Central South University, Nanyang Technological University, Zhejiang University

2026-06-03机器人强化学习

本文关注真实机器人 HIL-RL 中“成功轨迹”并不等于每步都优的问题:被人类接管前的次优片段会因终端奖励回传而被高估。PACT 用示教训练进度模型定位这些片段,并利用接管时人类动作优于策略动作的隐式偏好,同时校准 critic 的 Bellman 目标、约束 actor 向纠正动作对齐。五个真实操作任务中,成功率由 58.0% 提升到 82.5%,干预率下降,收敛约快 1.3 倍。

PointAction: 3D Points as Universal Action Representations for Robot Control Figure 1
2026-06-03cs.RO

PointAction: 3D Points as Universal Action Representations for Robot Control

Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

University of Pennsylvania

2026-06-03机器人规划控制三维

这篇论文针对视频动作模型只生成 RGB rollout、缺少可执行的三维运动与接触几何约束,导致动作落地依赖大量机器人动作标注的问题,提出 PointAction:先让视频模型联合预测未来 RGB 与动态 XYZ 点图,把任务相关几何的 4D 点运动作为跨本体动作接口,再用扩散式解码器转成控制。实验显示其在机器人场景 4D 生成、仿真任务上优于 VLA/VAM 基线,并能迁移到预训练未见过的两种真实机械臂。

SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction Figure 1
2026-06-03eess.IV

SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction

Dan Jacobellis, Neeraja J. Yadwadkar

Department of Electrical and Computer Engineering, The University of Texas at Austin

2026-06-03三维

面向云机器人中高分辨率视觉受限于端侧算力、功耗和带宽的问题,SEAOTTER将轻量传感器端自编码潜变量与云端一次性转码结合,生成兼容标准JPEG的文件,并学习JPEG颜色变换、量化矩阵和码率代理以适配下游任务。在200:1压缩下,相比AVIF实现7倍编码、3.5倍解码加速,ImageNet top-1提升8%,同时保留JPEG基础设施兼容性。

Multi-Robot Bearing-only Pose Estimation via Angle Rigidity Figure 1
2026-06-03cs.RO

Multi-Robot Bearing-only Pose Estimation via Angle Rigidity

J. Francisco Presenza, Leonardo J. Colombo, Ignacio Mas, Juan I. Giribet

2026-06-03机器人三维

针对多机器人仅依赖机体坐标系方位测量时难以获得绝对姿态、相对旋转测量代价高且传统 bearing rigidity 拓扑要求强的问题,本文用方位内积形成的角度先在三维中估计位置,再结合方位及其导数恢复 SO(3) 姿态。其分布式观测器只要求有向感知图满足角刚性,无需互易观测或所有机器人持续观测,并在部分机器人持续激励运动下证明局部一致指数稳定,仿真验证了可行性。

Semantic-weighted ICP for LiDAR Odometry: Class-Aware Residual Reweighting for Robust Scan Registration Figure 1
2026-06-03cs.RO

Semantic-weighted ICP for LiDAR Odometry: Class-Aware Residual Reweighting for Robust Scan Registration

Vasco Carvalho, Tiago Barros, Urbano J. Nunes

2026-06-03安全鲁棒

针对传统 LiDAR 里程计在动态物体、植被和非结构化地形中易因不可靠对应而漂移的问题,论文在 SuMa++ 的点到平面 ICP 中引入按语义类别设定的残差权重,而非简单剔除整类点,使稳定结构贡献更大、潜在动态或几何不稳定类别影响更小。SemanticKITTI 与 RELLIS-3D 实验显示其相较基线提升位姿估计,尤其在刚性特征稀缺的越野场景更明显,但效果依赖场景语义组成。

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction Figure 1
2026-06-03cs.CV

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction

Koki Nagano, Hongyu Liu, Seonwook Park, Tianye Li, Amrita Mazumdar, Christian Jacobsen, Shengze Wang, Michael Stengel, Rajarshi Roy, Ka Chun Cheung, Simon See, Shalini De Mello

2026-06-03机器人

本文针对人机二元交互中语音与动作往往被分开、离线或轮流建模的问题,提出 DyaPlex:在冻结的全双工语音模型上接入可训练运动塔,通过二元动作 token 交错与时间对齐 RoPE 交叉注意力,实现边听边说、边感知对方动作边生成自身动作的因果流式交互。模型用 4000 小时 Seamless Interaction 训练,在单人和双人交互基准上达到 SOTA;但部分增益可能主要来自 scaling / data。

Denoising Tells When to Replan: Denoising-Variance Adaptive Chunking for Flow-Based Robot Policies Figure 1
2026-06-03cs.RO

Denoising Tells When to Replan: Denoising-Variance Adaptive Chunking for Flow-Based Robot Policies

Xiangdong Feng, Yuxuan Cheng, Chen Shi, Boyao Han, Yuxuan Yan, Yitong Hong, Zhuotao Tian, Li Jiang

Beijing Institute of Technology, The Chinese University of Hong Kong, Shenzhen, Shenzhen Loop Area Institute, Hunan University, Xi’an Jiaotong University, Renmin University of China, Harbin Institute of Technology, Shenzhen

2026-06-03机器人生成模型

这篇论文针对流式/扩散式机器人策略中 action chunk 固定执行长度难以兼顾效率与精细交互响应的问题,提出无需训练的 DVAC:利用末端去噪步骤中 clean-action 估计的方差判断预测动作稳定性,只执行低方差前缀,并用滚动局部尺度自适应阈值。实验显示其在 LIBERO、RoboTwin、CALVIN 和真实操作中提升成功率并减少重规划;π0.5 策略在 LIBERO 上由 94.75% 提升到 98.00%,重规划减少 43.0%。

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems Figure 1
2026-06-03cs.RO

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

Department of Robotics, Perception, and Learning, KTH Royal Institute of

2026-06-03生成模型

针对流匹配策略虽能建模复杂多模态动作、却缺乏机器人控制稳定性保证的问题,论文提出 SFMDS:用流匹配隐式参数化动力系统,并通过由潜在 Lyapunov 函数和 LaSalle 原理导出的可行速度集合约束解空间,提供软正则与硬结构两种版本,并扩展到 Lie 群以处理位姿运动。实验覆盖基准、仿真、真实人形机器人及 1682 维系统,显示其能学习稳定、可扩展且多模态的运动生成。

Optimal Design and Analytical Modeling of a Soft Fin-Ray Effect Gripper Finger Using the Finite Rigid Elements Method Figure 1
2026-06-03cs.RO

Optimal Design and Analytical Modeling of a Soft Fin-Ray Effect Gripper Finger Using the Finite Rigid Elements Method

Sara Adeli, Hassan Sayyaadi

S. Adeli is with the Mechanical Engineering Department at Sharif University, H. Sayyaadi is with the Mechanical Engineering Department at Sharif

2026-06-03机器人

面向番茄等易损农产品的柔顺抓取与后续力控制,论文设计并3D打印TPU Fin-Ray软手指,用有限刚体元法替代纯FEM或数据驱动模型来获得可解释、较高效的解析建模,并用ANSYS与实验校验。其按指尖位移、总挠度、应力和接触力优化几何,得到30 mm长度、10 mm肋距、7根-15°肋、1 mm肋厚的配置;FREM预测形变误差约3%,ANSYS约2%。

Worth Remembering: Surprise-Gated Robot Episodic Memory Figure 1
2026-06-03cs.RO

Worth Remembering: Surprise-Gated Robot Episodic Memory

Nicolas Gorlo, Derek K. Wise, Alberto Speranzon, Luca Carlone

Massachusetts Institute of Technology

2026-06-03机器人

面向长时运行机器人,论文关注如何在存储受限下记住“发生过什么”而非仅维护当前场景状态。核心思路是用 V-JEPA-2 潜空间中的贝叶斯惊讶度作为无监督、因果的写入门控,只保存预测分布显著改变的事件,并叠加到 DAAAM 4D 场景图记忆上。实验显示在 OC-NaVQA 长时空问答各指标较 DAAAM 提升至少 12%,且在 Kinetics-400 事件边界检测上超过监督和离线基线。

Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation Figure 1
2026-06-03cs.RO

Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation

Nan Sun, Yuan Zhang, Yongkun Yang, Wentao Zhao, Peiyan Li, Jun Guo, Wenxuan Song, Pengxiang Ding, Runze Suo, Yifei Su, Xin Xiao, Xinghang Li, Huaping Liu

Tsinghua University, Peking University, Zhejiang University, Fudan University, Wuhan University, Shanghai Innovation Institute

2026-06-03机器人

本文针对VLA机器人在复杂/OOD操作中“会理解但难行动”、具身CoT形式与接入方式不清的问题,构建近98万轨迹的大规模CoT语料并指出有效推理需落到末端运动、图像轨迹等动作指导;ERVLA用CoT-dropout把推理作为训练支架而非测试前缀,避免自回归误差。其在LIBERO-Plus达86.9%、VLABench达53.2%,真实机器人中也优于基线,但增益可能部分来自scaling/data。

Neural Navigation Functions for Zero-Shot Generalizable Motion Planning Figure 1
2026-06-03cs.RO

Neural Navigation Functions for Zero-Shot Generalizable Motion Planning

Benjamin D. Shaffer, Pei-An Hsieh, Brooks Kinch, Nathaniel Trask, M. Ani Hsieh

University of Pennsylvania, United States, Department of Mechanical Engineering and Applied Mechanics, Department of Electrical and Systems Engineering

2026-06-03机器人规划控制

针对传统势场易陷局部极小、直接学习规划值函数又难保安全与跨几何泛化的问题,论文提出 Neural-NF:不直接预测策略,而是由内禀拉普拉斯特征学习椭圆 PDE 的局部系数,再在目标域全局求解导航函数,从结构上保留避障、单调下降和最优控制解释。实验在多类 2D 几何上显示其零样本迁移和数据效率优于 PointNet、GNN、DeepONet 等直接预测基线,复杂迷宫中值函数误差约降至 3.7%/7.4%,最高约 5 倍改进。

On dynamic multi-agent pathfinding methods: review, simulations and modifications Figure 1
2026-06-03nlin.CD

On dynamic multi-agent pathfinding methods: review, simulations and modifications

Gabriel Fejziaj, Salama Hassona, Wieslaw Marszalek

2026-06-03机器人

本文针对动态多智能体路径规划中动态障碍、局部可观测与智能体冲突同时存在时,传统单智能体重规划或静态 MAPF 方法难以兼顾质量与实时性的动机,构建统一仿真框架比较 Dijkstra、D* Lite、STA*、WHCA*、M* 与新方法 A**。A** 的关键思路是离线生成多条几何模板路径,在线用时空规划重连与适应变化。实验显示 A** 在多数智能体规模下取得最低 SoC,但计算开销显著且失败率约 21%,鲁棒性不如 STA*/WHCA*。

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset Figure 1
2026-06-03cs.RO

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset

Jessica Wenninger, Gabriel Skantze

2026-06-03机器人视觉感知数据集/基准

面向社交机器人近距离、自视角交互中易因遮挡、出画和非线性运动产生身份切换的问题,本文用 Furhat 采集并标注新的 HRI 跟踪数据集,系统比较人脸与身体跟踪、长时记忆和 ReID。结果显示瓶颈主要在时序关联:加长记忆可缓解遮挡,ReID显著提升身体跟踪却会因侧脸敏感恶化人脸跟踪;优化管线较基线减少49% IDSW。

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation Figure 1
2026-06-03cs.RO

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation

Xinhai Li, Xiaotao Zhang, Yuehao Huang, Jiankun Dong, Tianhang Wang, Sunyao Zhou, Yunzi Wu, Chengnuo Sun, Yunfei Ge, Qizhen Weng, Chi Zhang, Chenjia Bai, Xuelong Li

Institute of Artificial Intelligence, China Telecom, 2Shanghai Jiao Tong University, 3Zhejiang, University, 4Tongji University, 5Fudan University, 6Jiangsu University, capability for achieving general robotic intelligence. However, the availability and quality of navigation, are constrained by limited coverage, poor controllability, and high data collection costs. Since VLMs are

2026-06-03机器人强化学习数据集/基准

针对VLN受限于高保真、可交互导航数据不足且长程泛化弱的问题,GN0将数据生成、仿真评测和策略学习统一起来:构建含动态3DGS人形的GN-Matrix并自动生成4700万序列,提出支持BEV评测与碰撞交互的GN-Bench,以及结合DAgger+RL、兼容有图/无图设定的GN-BAE。实验称其在GN-Bench和VLN-CE上超过现有SOTA,但部分增益可能主要来自大规模数据与3DGS仿真质量。

A 3D Isovist World Model -- Revealing a City's Unseen Geometry and Its Emergent Cross-City Signature Figure 1
2026-06-03cs.RO

A 3D Isovist World Model -- Revealing a City's Unseen Geometry and Its Emergent Cross-City Signature

Xuhui Lin, Stephen Law, Nanjiang Chen, Kunyao Li, Tao Yang

The Bartlett School of Construction and Project Management, University College London, UK, Department of Geography, University College London, UK, School of Project Management, Faculty of Engineering, The University of Sydney, Sydney, AU, School of Engineering, Cardiff University, Cardiff, UK, School of Architecture, Tsinghua University, Beijing, CN, trained on Manhattan and Paris with no city label, develops a cross-city spatial signature. City identity is, buildings look like?” but “what space is available to me, and how will it change if I move?” The isovist

2026-06-03强化学习三维

这篇论文针对城市机器人导航中 RGB 世界模型混入光照外观、BEV 占据又压扁三维结构的问题,主张用“负空间”表示可通行几何:将每一位置的 3D isovist 球面深度图作为预测状态,并结合深度残差、自回滚调度采样和可写入的持久 BEV 潜变量地图来提升跨路径一致性。在曼哈顿与巴黎 OSM 数据上,模型较 copy-last 基线改善 MAE/RMSE/边缘清晰度,且其时序潜变量可用线性探针以 89.3% 识别城市,但结论仍受仅两城和高度来源混杂限制。

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models Figure 1
2026-06-03cs.RO

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

2026-06-03视觉语言视觉感知

PHASER关注VLA机器人连续学习中新任务导致旧技能遗忘的问题,指出均匀经验回放会按轨迹时长偏置,饿死短暂但关键的操作阶段。其核心是按子技能阶段等额分配缓存,并用语言、视觉、动作原型路由高干扰历史阶段,另以Auto-PC自动抽取阶段边界。在LIBERO上跨三种VLA骨干验证,相同回放预算下ASR较ER最高提升31%,LIBERO-Goal最终ASR达87.8%。

Making Embodied AI Reliable: A Community Agenda from Testing to Formal Verification Figure 1
2026-06-03cs.SE

Making Embodied AI Reliable: A Community Agenda from Testing to Formal Verification

Xi Zheng, Dulanga Weerakoon, Yintong Huo, Teresa Yeo, Guy Van Den Broeck, Vijay Ganesh, Daniel Neider, Biplav Srivastava, Ivan Ruchkin, Archan Misra, Corina Pasareanu

2026-06-03机器人

面向开放世界中的机器人/具身 AI,论文指出可靠性难点来自感知不确定、人机交互、环境变化与跨模块涌现故障。核心洞察是把可靠性视为全生命周期保障问题,而非单点测试或验证;提出以神经符号表示串联场景测试、组合式形式化验证和运行时保障。主要结果是形成社区研究议程与集成工作流,文中未充分说明量化实验收益。

CANMOT: Class-Aware Noise Modeling for Multi-Object Tracking in Autonomous Driving Figure 1
2026-06-03cs.RO

CANMOT: Class-Aware Noise Modeling for Multi-Object Tracking in Autonomous Driving

Timo Osterburg, Stefan Schütte, Torsten Bertram

Institute of Control Theory and Systems Engineering, TU Dortmund University, Germany.

2026-06-03视觉感知

本文针对自动驾驶3D多目标跟踪中卡尔曼滤波常把过程噪声与测量噪声跨类别、全局共享的假设,指出不同交通参与者及纵横向不确定性差异显著。CANMOT为各类别学习对角协方差,并可在物体坐标系建模以保留各向异性。nuScenes实验显示其提升AMOTA、显著减少ID切换,并用ANEES/χ²检验揭示现有KF跟踪普遍过度自信,虽校准改善但一致性仍不足。

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion Figure 1
2026-06-03cs.CV

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion

Ye Wu, Ruiqi Song, Baiyong Ding, Nanxin Zeng, Junjie Cheng, Yunfeng Ai

2026-06-03三维

面向矿区等非结构化自动驾驶场景,论文指出稀疏布局、异形障碍和长尾类别会削弱常规3D检测与现有占据预测的跨模态融合效果。UnsOcc用RenderFusion通过图像深度与LiDAR语义占据的双向渲染监督对齐特征,并用基于3D Gaussian Splatting的GSRefinement把稀疏3D预测投影为2D语义图以强化长尾监督。作者构建露天矿数据集,并在该数据集和nuScenes上报告优于现有方法。

Learned Non-Maximum Suppression for 3D Object Detection Figure 1
2026-06-03cs.CV

Learned Non-Maximum Suppression for 3D Object Detection

Timo Osterburg, Stefan Schütte, Torsten Bertram

Institute of Control Theory and Systems Engineering, TU Dortmund University, Germany.

2026-06-03视觉感知三维

针对激光雷达3D检测中传统NMS依赖手调阈值、忽略候选框关系而易在拥挤或遮挡场景误删/漏滤的问题,论文把后处理改为检测级可学习重打分:D2D-Rescore用自注意力建模全局候选关系,GossipNet3D在BEV局部邻域消息传递,并用贴合nuScenes指标的匹配训练。实验显示相较CircleNMS可提升mAP、NDS和真阳性质量,尤其利好小目标与少见类别,且无需改动基础检测器、开销较小。

Partially Observable Adversarial Patch Attacks on Vision-Language-Action Models in Robotics Figure 1
2026-06-03cs.RO

Partially Observable Adversarial Patch Attacks on Vision-Language-Action Models in Robotics

Xiaofei Wang, Mingliang Han, Tianyu Hao, Yi Yang, Yun-Bo Zhao, Keke Tang

Keke Tang.) Xiaofei Wang is with the Department of Automation, University of Science and Technology of China, Hefei, China, and also with SmartMore Corporation

2026-06-03机器人视觉语言视觉感知

这篇论文关注VLA机器人在真实攻击中难以被攻击者完整观测执行轨迹的问题,提出部分可观测威胁模型:仅用早期少量帧生成后续通用的静态对抗贴片。方法先借助注意力图选择与指令相关的关键视觉区域,再联合破坏目标语义对齐并增大动作轨迹曲率。仿真和真实机器人实验显示,该攻击仍能造成长时程扰动,显著降低任务成功率并优于已有基线。

NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics Figure 1
2026-06-03cs.RO

NVIDIA Isaac Sim: Enabling Scalable, GPU-Accelerated Simulation for Robotics

Sicong Gao, Maurice Pagnucco, Tomasz Bednarz, Yang Song

School of Computer Science and Engineering, The University of New South Wales

2026-06-03机器人

针对机器人仿真从控制验证转向感知学习、合成数据和数字孪生后工具链割裂的问题,本文将 Isaac Sim 作为完整生态而非单一仿真器来梳理,突出其 GPU PhysX、RTX 渲染、USD 资产与 Isaac Lab 并行训练接口的组合价值。主要结果是给出与 Gazebo、MuJoCo 等平台的系统比较,并归纳其在工业、医疗、具身 AI、基础模型和基准中的使用模式;局限集中在开放世界物理学习、仿真中心训练和实际可用性约束。

Static and Dynamic Representations for Tactile Contact-Angle Estimation with Event-Based Sensors Figure 1
2026-06-03cs.RO

Static and Dynamic Representations for Tactile Contact-Angle Estimation with Event-Based Sensors

Yanhui Lu, Efi Psomopoulou, Benjamin Ward-Cherrier

2026-06-03机器人

面向接触丰富操作中对接触角的低时延估计,论文从人类快/慢适应触觉通路出发,比较 NeuroTac 事件流的短时动态轮廓、持续状态静态轮廓及二者融合,并用同一轻量 MLP 回归。实验显示三种管线 P99 延迟均低于 10 ms;静态表示在连续滚动和随机停顿场景中更稳,连续滚动平均 MAE 达 0.160°,停顿阶段 MAE 为 0.251°。

Bionic Human-Motion Style Transfer for Physically Executable Whole-Body Control of Humanoid Robots Figure 1
2026-06-03cs.RO

Bionic Human-Motion Style Transfer for Physically Executable Whole-Body Control of Humanoid Robots

Tianchen Huang, Mingkuan Zhao, Yang Gao, Feiyang Yuan, Junchi Gu, Xiaohu Zhang, Dongdong Zhao, Shi Yan, Yu Wang, Wei Gao, Shiwu Zhang

2026-06-03机器人规划控制

针对人形机器人既要稳定执行又要呈现可读、可调人体风格动作的问题,本文把动画式风格迁移纳入物理可执行全身控制流程:用多条件潜扩散融合风格、内容与轨迹,并在解码运动上加入接触一致性和时序平滑约束,再由预瞄式全身跟踪策略执行。仿真与 Unitree G1 实验显示,其相较动画基线减少足滑和抖动,125 次真机试验成功率达 96.0%,但强风格放大会带来平衡与解耦风险。

SPADE: Sketch-guided Path Planning Augmented with Diffusion Experts Figure 1
2026-06-03cs.RO

SPADE: Sketch-guided Path Planning Augmented with Diffusion Experts

Charbel Abi Hana, Tatiana Ghantous, Mikael Khalil, Anthony Rizk

2026-06-03生成模型规划控制

SPADE面向AMR局部路径规划中“用户偏好难以手工奖励化、示教数据稀缺且BC泛化差”的问题,在SKIPP式草图示教基础上加入ROS 2标注工具,并用离线训练的图像条件扩散模型作为专家指导轻量行为克隆模型训练。实验和消融显示,其APE降低39.1%、FID降低33.5%,可训练参数少93.8%,在接近扩散模型泛化能力的同时保留边缘端实时部署特性。

Human2Humanoid: Physics-Aware Cross-Morphology Motion Retargeting for Humanoid Robots Figure 1
2026-06-03cs.RO

Human2Humanoid: Physics-Aware Cross-Morphology Motion Retargeting for Humanoid Robots

Tianchen Huang, Feiyang Yuan, Junchi Gu, Shurui Fang, Xiaohu Zhang, Yu Wang, Wei Gao, Shiwu Zhang

2026-06-03机器人

针对人形机器人复现人类动作时存在形态差异大、成对人机动作数据稀缺以及接触伪影难控的问题,Human2Humanoid将无配对重定向建模为CycleGAN式跨域迁移,并结合骨架感知GCN、基于T-pose归一化的末端轨迹一致性损失和显式接触/高度物理约束。在Unitree G1实验中,该方法相较PHC、GMR和Unitree Retarget取得更高跟踪成功率、更低跟踪误差与地面穿透,消融也显示语义保持和物理约束分别贡献可控性与接触可行性。

PerchRL: Vision-Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion Figure 1
2026-06-03cs.RO

PerchRL: Vision-Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion

Zihong Lu, Zongzhuo Liu, Huaxu Li, Jinqiang Cui, Jie Mei, Youmin Gong, U Kei Cheang, Boyu Zhou

2026-06-03视觉感知强化学习

针对四旋翼在快速、不规则运动的倾斜平台上仅依赖机载视觉栖停时易受视场受限和短时丢失目标影响的问题,PerchRL采用“状态预训练—视觉微调”的强化学习流程,引入随机扰动平台轨迹与历史时序增强以减少对固定轨迹的过拟合,并结合可见性状态补充和主动感知奖励提升丢失后的恢复能力。仿真与真实实验显示其可实时完成敏捷栖停,并能在不同四旋翼平台上零样本迁移。

Reliability-Guided Depth Fusion for Glare-Resilient Navigation Costmaps Figure 1
2026-06-03cs.RO

Reliability-Guided Depth Fusion for Glare-Resilient Navigation Costmaps

Shang-En Tsai

2026-06-03机器人

针对反光地面、玻璃等场景中 RGB-D 深度空洞和尖峰会在代价地图中累积成“幽灵障碍”的问题,论文将抗眩光建图转化为逐像素深度可靠性估计:用轻量 DRM-Net 预测可信度,并在融合前以加权+门控的 RGF 抑制低可信观测。D435/Jetson 实机实验显示,该方法减少误插入障碍、保留可通行空间,并在多种眩光条件下保持实时运行。

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform Figure 1
2026-06-03cs.RO

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

Shanghai Innovation Institute, Huazhong University of Science and Technology, Shanghai Jiao Tong University

2026-06-03机器人

该文针对具身操作中商用机械臂昂贵且黑盒、VLA 训练依赖私有大数据导致难复现的问题,提出端到端开源的 OpenEAI-Platform:约 790 美元的 6+1 DoF OpenEAI-Arm、低层控制与制造资料,以及基于 Qwen3-VL-4B 和 Diffusion Transformer 动作头的两阶段开源数据训练流程。实验称其在四个真实操作任务中,同策略下机械臂优于两款商用 6+1 DoF 平台,VLA 成功率接近 π0,但具体增益中硬件、控制与数据清洗的贡献仍需进一步拆分。

Extreme Motion Generation via Hybrid Null-Space Control for Straight-Line Path Following Figure 1
2026-06-03cs.RO

Extreme Motion Generation via Hybrid Null-Space Control for Straight-Line Path Following

Xinyi Yuan, Weiwei Wan, Kensuke Harada

2026-06-03规划控制

本文针对固定基机械臂在喷涂、焊接等直线路径跟随中常因关节限位或姿态约束过早终止的问题,提出“极限运动生成”框架:在零空间内用强化学习负责远离边界时的长时域利用,用模型控制器接管近边界稳健避险,并以滞回规则切换,另用条件扩散模型选择初始构型。在7自由度Franka FR3的1万项任务中,平均路径长度较模型基线提升27%,但真实硬件验证文中未充分说明。

Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation Figure 1
2026-06-03cs.RO

Grasp-Then-Plan with Failure Attribution: A Closed Two-Stage Framework for Precise and Generalizable Robotic Manipulation

Jiahao Xu, Peiyuan Wang, Hanzhuo Zhang, Zihao Yu, Tianyu Fu, Hao Chen, Xuanhao Xiang, Jianbo Yu, Chenchen Fu, Wanyuan Wang

School of Computer Science and Engineering, Southeast University, China

2026-06-03机器人

本文针对长程机器人操作中抓取与规划失败原因相互混淆、导致错误微调的问题,提出 GTP-FA:先生成任务相关抓取,再基于失败轨迹学习可泛化的失败归因,并将优化分别路由到抓取评分/风险惩罚或规划数据采集与微调。仿真和真机实验显示,该框架可提升 PPO、BC、扩散策略、SAC 与 VLA 等基学习器的任务成功率。

eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents Figure 1
2026-06-03cs.RO

eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents

A. Haroon Rasheed, Maria Kabtoul

simultaneously (e.g. a VLM describing scenes, an object detector listing entities, a place classifier labelling regions)

2026-06-03机器人

这篇论文针对具身智能体记忆只按文本或知识图组织、难以同时回答“什么、在哪里、何时”的问题,提出 eMEM:用 SQLite、HNSW 与 R-tree 统一支撑图式记忆,并通过分层巩固把多层感知观测压缩为可检索摘要,向 LLM 暴露 10 个空间-语义-时间召回工具。在基于 ProcTHOR-10K 的 eMEM-Bench 上,系统 988 个探针加权均分 80.8;相比纯 RAG,在上下文检索和 DRM 诱饵拒绝上分别高约 30 和 29 分。

Autonomous Navigation System for Library Service Robot Based on Unitree Go2 Edu Figure 1
2026-06-03cs.RO

Autonomous Navigation System for Library Service Robot Based on Unitree Go2 Edu

Aoduo Li, Haoran Lv, Bingquan Ou, Jianfeng Li, Yingdong Li, Zimeng Li

2026-06-03机器人

论文面向图书馆窄通道、地面过渡、临时杂物与行人遮挡等非理想室内场景,提出基于 Unitree Go2 Edu 四足机器人的 ROS 2 导航系统。核心在于将 4D LiDAR、前向 RGB-D 与 IMU 分工融合,结合 RTAB-Map 建图、EKF/AMCL 定位和 Nav2 的 A*+DWA 规划,以利用四足平台对低矮障碍和局部不连续的容忍度。真实图书馆实验中,静态、低密度动态和高密度动态场景成功率分别为 100%、96%、88%,地图平均度量误差为 3.7 cm。

GPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy Optimization Figure 1
2026-06-03cs.RO

GPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy Optimization

Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang

The Hong Kong University of Science and Technology (Guangzhou)

2026-06-03强化学习模仿学习优化算法

这篇论文针对 GPU 并行机器人强化学习仍多为单任务专家训练的问题,将 LIBERO 的结构化操作任务编译为 Isaac Lab 中的异构多任务基准 MT-Libero,并提出 DGPO:用跨任务重要性加权 PPO 处理任务失衡,用自适应行为克隆利用匹配示范动作。实验显示其在 Goal、Object、Spatial、Long 等任务及状态/视觉输入下优于无示范 RL 和已有示范方法,但仍局限于仿真桌面操作。

RobotValues: Evaluating Household Robots When Human Values Conflict Figure 1
2026-06-03cs.RO

RobotValues: Evaluating Household Robots When Human Values Conflict

Jongwook Han, Hyeongjin Kim, Yohan Jo

Graduate School of Data Science, Seoul National University

2026-06-03机器人

这篇论文针对家用机器人评测过度关注任务完成与安全、忽视价值冲突决策的问题,提出 RobotValues:包含 1 万个图像 grounded 的家庭场景、候选动作及基于利益相关者反应的价值标注。实验显示,多种机器人 VLM 默认偏向安全与迁就,较少选择隐私;即使被明确要求优先某一冲突价值,仍常无法覆盖默认偏好,错误率约 80%。

SplitAdapter: Load-Aware Humanoid Loco-Manipulation via Factorized Adaptation Figure 1
2026-06-03cs.RO

SplitAdapter: Load-Aware Humanoid Loco-Manipulation via Factorized Adaptation

Jeonguk Kang, Hanbyel Cho, Sanghyun Kang, Donghan Koo

2026-06-03机器人

论文针对人形机器人搬箱时负载质量、取放高度与真实动力学误差耦合导致重载 sim-to-real 不稳的问题,提出在冻结基础操控策略上加 SplitAdapter,将历史信息拆成物体/负载与机器人动力学两类上下文,并用分裂世界模型、GRL 对抗去耦和分层 FiLM 调制策略。MuJoCo 与真实机器人实验显示,其在 2/4/6 kg、0/30/60 cm 条件下提升抬起和完整任务成功率,优势主要集中在 6 kg 重载场景。

Bridging Predictive Uncertainty and Safe Action: Sample-Conditioned Differentiable Planning for Autonomous Driving Figure 1
2026-06-03cs.RO

Bridging Predictive Uncertainty and Safe Action: Sample-Conditioned Differentiable Planning for Autonomous Driving

Chengzhen Meng, Pei Liu, Zhiyu Huang, Chen Lv, Jun Ma

2026-06-03规划控制安全鲁棒

面向自动驾驶中预测不确定性难以传递到可解释安全规划的问题,论文提出样本条件微分规划:用条件扩散生成多样周车未来,并以经验 CVaR 尾部风险约束纳入可微优化规划,同时用有向图编码场景以降计算。在 Waymo Open Motion 和 Argoverse 2 的开环、闭环实验中,安全性、效率与舒适性优于多种基线。

EaDex: A Cross-Embodiment Dexterous Manipulation Framework from Low-Cost Demonstrations Figure 1
2026-06-03cs.RO

EaDex: A Cross-Embodiment Dexterous Manipulation Framework from Low-Cost Demonstrations

Qian Zhao, Xin Tong, Chengdong Wu, Yang Yang, Yingtian Li

Faculty of Robot Science and Engineering, Northeastern University, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, School of Automation, Nanjing University of Information Science and Technology

2026-06-03机器人模仿学习

EaDex针对灵巧手学习中纯强化学习探索成本高、模仿学习示教采集昂贵的问题,主张低精度人手示教已足以提供关节物体操作所需的接触先验。方法用单个RGB-D相机结合MANO建模、标准化、接触与跨手重定向生成示教,并以接触奖励驱动示教退火,使策略逐步从跟随示教转向自主优化。在三种灵巧手和三类开合任务的九个设置中,平均成功率36.5%,较无退火基线相对提升55.3%,但绝对成功率仍显示任务难度较高。

Wheel-Mounted/GNSS Fusion with AI-Aided Position Updates Figure 1
2026-06-03cs.RO

Wheel-Mounted/GNSS Fusion with AI-Aided Position Updates

Gal Versano, Itzik Klein

2026-06-03机器人

面向自动地面车辆在GNSS可用但轮载惯导仍易漂移的定位问题,论文将轮载IMU的周期运动信号与WMINet位移回归结合,把神经网络给出的二维位移作为额外位置更新并入误差状态EKF,与GNSS更新共同约束轨迹。真实机器人多轮载IMU实验显示,相比标准轮载惯导/GNSS融合,位置RMSE约降低46%。

AirDreamer: Generalist Drone Navigation with World Models Figure 1
2026-06-03cs.RO

AirDreamer: Generalist Drone Navigation with World Models

Zian Liu, Andong Yang, Chunkai Yang, Ruidong An, Chao Gao, Guyue Zhou

2026-06-03机器人强化学习

针对无人机在未知、拥挤环境中依赖手工感知规划或端到端策略易失效的问题,AirDreamer将基于深度图的世界模型与强化学习策略解耦,用环境表征支撑稀疏奖励训练,减少人工 shaping 并促成主动偏航、绕障等行为。仿真与真机实验显示其能逃离非凸障碍局部最优,在挑战地图成功率较最强基线提升5.3%,且部署到真实无人机无需额外调参。

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models Figure 1
2026-06-03cs.RO

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

Tongji University, Shanghai Innovation Institute, Shanghai Jiao Tong University, Zhejiang University, Jingdezhen Ceramic University, Tsinghua University, University of Science and Technology of China

2026-06-03机器人

论文针对 VLA 模型能理解语义却在精细操作中缺少可执行几何对齐的问题,提出 GeoAlign:用机器人域 RGB-D 后训练得到仅由 RGB 推理的 GEP 几何特征,并让机器人本体状态查询图像几何网格,为动作解码器提供阶段相关的局部几何 token。实验显示其在 LIBERO、SimplerEnv-Fractal 和真实 ALOHA 上分别达 99.0%、85.3%、78.8% 成功率,消融表明后训练几何特征与状态引导查询均有贡献。

BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal Interactions Figure 1
2026-06-03cs.RO

BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal Interactions

Zhe Sun, Meng Wang, Lei Wang, Yuxi Wang, Wanxin Li, Yujia Peng, Zhenliang Zhang

State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China, Peking University, Beijing, China

2026-06-03机器人

该文面向5–8岁儿童难以编程控制机器人、只能被动观看机器人叙事的问题,提出 BotDirector:用LLM对话生成故事与JSON脚本,结合实物摆放、虚实空间对齐、A*路径规划、语音反馈和AprilTag视觉定位,让群体桌面机器人或机械臂表演儿童自带玩具。主要结果是给出系统流程与功能原型;文中未充分说明用户实验或定量效果,实际可用性仍待验证。

Toward Gripper-Integrated Active Electrosense for Pre-Contact Sensing in Underwater Soft Grippers Figure 1
2026-06-03cs.RO

Toward Gripper-Integrated Active Electrosense for Pre-Contact Sensing in Underwater Soft Grippers

Ahsan Tanveer, Muhammad Hamza, Waqar Hussain Afridi, Chen Wang, Guangming Xie

2026-06-03机器人

针对浑浊、眩光和夹爪遮挡使水下抓取末端视觉失效的问题,本文将主动电感知电极集成到章鱼式软夹爪上,用驱动—感测多通道电压作为接触前线索。仿真显示导电目标在抓取区域内会产生随位置变化的非均匀电极签名;水槽实验用悬挂金属球验证相对空水基线存在对象相关响应,并发现可检测性强依赖5–20 V激励和1 mHz–1 kHz频率等设置,但尚未给出标定检测性能。

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models Figure 1
2026-06-03cs.RO

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

2026-06-03强化学习

论文针对 WAM 依赖 RGB 未来预测、缺少几何与语义结构理解的问题,指出其价值更可能来自训练期预测监督带来的表征学习,而非推理时显式“想象”。GeoSem-WAM 在未来 RGB 预测外加入几何和语义分支,训练统一潜空间,部署时丢弃辅助分支、不生成未来视频。实验称在仿真和真实任务中提升动作预测、场景理解与遮挡等复杂场景鲁棒性。

ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control Figure 1
2026-06-03cs.RO

ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control

Yutong Liang, Quanquan Peng, Ri-Zhao Qiu, Xiaolong Wang

2026-06-03视觉感知规划控制

针对人手示范迁移到灵巧手时因形态与接触差异导致长时程轨迹难以物理执行的问题,ConTrack将物体跟踪设为约束,用对偶变量在线调节任务成功与动作/接触风格保真,并用策略可达的中段重置库稳定训练。文中在GRAB、ARCTIC、DexterHand及双臂xArm7+xHand实机验证中,相比已有方法提升成功率与物体位姿精度,同时保持关节和接触一致性。

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation Figure 1
2026-06-03cs.CV

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

Adelaide University, Responsible AI Research Centre, Australian Institute for Machine Learning, Institute for Infocomm Research (I2R), A*STAR

2026-06-03机器人

论文关注实例目标导航中目标描述含糊、同类干扰物多时,机器人何时向 oracle 提问才“划算”。作者将交互建模为带成本的不确定性降低问题,从导航语料挖掘四类问题及权重,构建含加权成功率的 Isaac Sim 基准,并提出零样本 MLLM 导航器 TANDEM。实验显示其在加权成功率上优于无交互和统一成本交互基线,困难场景收益最大。

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation Figure 1
2026-06-03cs.CV

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA : Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

OmniDreams acts as a highly responsive, reactive environment, providing a scalable and comprehensive, Controllable Scenario Editing . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

2026-06-03生成模型强化学习

面向自动驾驶策略在长尾、安全关键场景中的闭环评测瓶颈,OmniDreams用Cosmos扩散模型经21k小时驾驶数据中训/后训,实时自回归生成受历史帧、仿真状态和驾驶动作约束的多视角传感视频,弥补重建式仿真难泛化到新天气、新物体和复杂交互的问题。文中显示其可接入AlpaSim与Alpamayo 1形成响应式闭环环境,并在NuRec上将其后训为WAM后以约1/5参数超过Alpamayo 1.5;具体增益可能主要来自大规模数据与模型先验。

How Visible Are Silent Manipulation Failures? An Observability Study of False-Success Detection in Simulated Robot Episodes Figure 1
2026-06-03cs.RO

How Visible Are Silent Manipulation Failures? An Observability Study of False-Success Detection in Simulated Robot Episodes

Aarav Bedi (University of California, Berkeley)

2026-06-03机器人视觉感知

论文关注模仿学习数据中“机器人自判成功但实际失败”的隐性标签污染,构建双臂 ALOHA 仿真测试床,通过环境扰动产生真实失败而非改标签,并用隐藏的仿真状态作真值,对比本体感知与视觉的可观测性。结果显示,方块转移的假成功几乎可由关节速度检出,但插桩任务仅部分可见,视觉能补上主要缺口;且本体信号依赖低于真实传感噪声的微小速度差,仿真结果应视为乐观上界。

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models Figure 1
2026-06-03cs.RO

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

Wenbo Zhang, Jianxiong Li, Shuai Yang, Sijin Chen, Jiajun Liu, Lingqiao Liu, Xiao Ma

2026-06-03视觉语言视觉感知优化算法

面向VLA部署时易受视觉、环境和本体分布偏移影响的问题,TTT-VLA把适配入口从更新策略参数转为优化可学习潜在提示:训练时用状态 grounding 代理任务塑造提示,测试时仅用交互数据的自监督信号更新提示、冻结主干。SimplerEnv单/多本体实验显示成功率稳定提升,分析认为增益主要来自修正少量关键决策而非整体改写行为。

ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control Figure 1
2026-06-03cs.RO

ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control

Gina Yoon, Sumin Lee, Joo Yong Sim

2026-06-03机器人规划控制

针对现有 LLM 机器人方法多停留在高层规划、低层控制又依赖提示和缺少实时纠错的问题,ModuLoop 将自然语言任务分解为模块化 Python 控制代码,并通过仿真可达性验证、执行探针和闭环调试迭代修正。文中在 RGB-D 相机—机械臂手眼标定与后续抓取放置中验证,仿真坐标生成准确率达 100%,整体表现出较高执行自主性,但更大规模任务泛化仍有待说明。

ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL Figure 1
2026-06-03cs.LG

ConTraIRL: Factorized Contrastive Abstractions for Transferable IRL

Yikang Gui, Bikramjit Banerjee, Prashant Doshi

School of Computing, University of Georgia, School of Computing Sciences & Computer Engineering, The University of Southern Mississippi

2026-06-03强化学习

这篇论文针对逆强化学习中奖励函数在“见过的动力学”和“见过的目标”重新组合时容易失效的问题,提出 ConTraIRL:用双编码器把状态分解到动力学不变的目标空间与目标不变的动力学空间,并通过对比学习和时间阶段对齐构造可重组的潜表示奖励。MuJoCo 连续控制实验显示,在只给目标环境少量专家状态的设定下,该方法相较迁移 IRL 基线提升了奖励恢复、样本效率和未见动力学—目标配对的鲁棒性。

Exact equivariance, kept through training, buys zero-shot generalisation across the symmetry group Figure 1
2026-06-03cs.LG

Exact equivariance, kept through training, buys zero-shot generalisation across the symmetry group

Hongbo Wang (Stony Brook University)

Department of Mathematics, Stony Brook University, Stony Brook, NY 11794, USA

2026-06-03机器人

论文针对机器人世界模型在只见有限姿态时难以跨旋转/平移泛化的问题,强调把精确等变性嵌入编码器、预测器并在规划器中保持,而非依赖数据增强。核心洞察是正交群作用下 relMSE 损失严格不变,训练不会破坏 Vector-Neuron/e3nn 的交错结构,因此可把已见姿态误差原样搬到整个对称轨道。实验在 PushT 与 3D 点云上显示,等变模型虽无明显域内优势且误差不一定低,但 OOD/seen 预测误差约为 1,非等变基线放大 13–157 倍;闭环控制在匹配等变规划器下也保持近浮点精度或统计平坦。

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry Figure 1
2026-06-03cs.RO

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja

Northwestern University, University of Chicago

2026-06-03机器人

针对纯 IMU 惯性里程计在 AR 眼镜/可穿戴人体跟踪中易受噪声累积和人体动作复杂性导致漂移的问题,MARIO 的关键思路是把里程计估计显式锚定到由头戴 IMU 推断的 SMPL 人体姿态先验,并融合副 IMU、气压计、磁力计提供的高度和航向线索。该模块可接入 TLIO、AirIO、RoNIN、EQNIO,在 Nymeria、Aria Everyday、TLIO 数据集上稳定降低误差,Nymeria 位置漂移最多降 36%,多传感器融合下漂移改善约 42%。

Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion Figure 1
2026-06-03cs.CV

Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion

Oskar Natan, Jun Miura

2026-06-03机器人

面向自动驾驶感知中多传感器、多视角与多任务模型堆叠带来的计算开销和任务失衡问题,论文提出紧凑型多任务网络,在一次前向中融合4路RGB、DVS与LiDAR,联合完成语义/深度/LiDAR分割和鸟瞰投影,并用改进GradNorm自适应调损失权重。实验在3个CARLA数据集和nuScenes-lidarseg上显示,其以更少参数、更低显存和更快推理保持或提升性能。

Hybrid Dynamics Modeling for a Flexible 2-DoF Robotic Arm Figure 1
2026-06-03cs.RO

Hybrid Dynamics Modeling for a Flexible 2-DoF Robotic Arm

Maciek Popik, Daniel Yang, Mahdis Bisheban

2026-06-03机器人

针对柔性连杆机械臂中刚体动力学难以刻画柔顺、摩擦和硬件非线性等未建模效应的问题,论文在TUDOR开源数据上比较运动学Ridge回归、基于公开参数的RBD,以及由最小二乘辨识的RBD并用GMM/GMR学习残差的混合建模思路。结果显示,直接使用物理参数的模型误差最大,正则化回归和数据辨识参数更贴近实测力矩,说明性能增益可能主要来自数据驱动辨识与残差建模,而非纯参数物理模型。

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset Figure 1
2026-06-03cs.CV

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

FZI Research Center for Information Technology, Karlsruhe Institute of Technology, University Charles III of Madrid, Delft University of Technology

2026-06-03视觉语言数据集/基准

针对现有自动驾驶数据集在传感器精度、HD 地图完整性和欧洲复杂城市覆盖上的不足,KITScenes Multimodal 采集三城多模态数据,提供同步高分辨率相机、400m+ 激光雷达、4D 雷达及具拓扑连接的 Lanelet2 级 3D 交通元素地图。论文同时设立在线 HD 地图、远距深度、视角合成和端到端驾驶基准;结果显示现有地图与深度方法在完整拓扑和 200m 以上距离上明显失效,暴露了既有基准未覆盖的能力缺口。

SCOPE: Real-Time Natural Language Camera Agent at the Edge Figure 1
2026-06-03cs.RO

SCOPE: Real-Time Natural Language Camera Agent at the Edge

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

2026-06-03机器人

论文针对自然语言驱动机器人相机缺少闭环、可复现实测与边缘部署评估的问题,提出 SCOPE:用 Blender 与真实 PTZ 相机共享动作/观测接口,将 SLM 规划、VLM 感知和相机工具解耦,并发布 536 个任务基准。对 19 种组合的结果显示,更强 SLM 主要降低幻觉和工具路由错误;规划足够强后瓶颈转向感知,MoE 与量化在保持精度的同时改善延迟和内存,给出可实时边缘部署的设计取舍。

Improved Postural Stability Using a Lightweight Semi-Active Soft Back Support Device Under Standing Perturbations Figure 1
2026-06-03cs.RO

Improved Postural Stability Using a Lightweight Semi-Active Soft Back Support Device Under Standing Perturbations

Rohan Khatavkar, Jiefeng Sun, Hyunglae Lee

2026-06-03机器人

针对老年人在站立扰动、尤其前向失衡时易因躯干过度前屈而跌倒的问题,论文提出一种轻量半主动软背部支撑装置,将弹性带与可快速放气产生助力的反向气动人工肌肉并联,在小幅屈曲时也能提供伸展辅助。5名健康受试者实验显示,相比无装置/被动模式,半主动模式可显著降低全身角动量并提高稳定裕度,但样本量较小,老年人场景仍需验证。

Impact of a Soft Wearable Back-Support Device on Postural Stability during Trip-Like Perturbations Figure 1
2026-06-03cs.RO

Impact of a Soft Wearable Back-Support Device on Postural Stability during Trip-Like Perturbations

Yuanhao Chen, Rohan Khatavkar, Soubhagya Nayak, Jiefeng Sun, Hyunglae Lee

2026-06-03机器人

针对绊倒扰动中躯干失稳与跌倒风险,本文评估一款1.2 kg软 wearable 背部支撑装置,通过层堵塞变刚度弹性带和折纸肌肉调节松弛量,为躯干前屈提供可调恢复力。5名健康男性在站立和行走跑台扰动中测试,装置均提高最小稳定裕度;站立时高刚度显著优于低刚度,行走时两种刚度均优于无装置但差异不显著,推广性受样本量限制。

Direct Informed Sampling on Riemannian Manifolds via Loewner Order Lower Bounds Figure 1
2026-06-03cs.RO

Direct Informed Sampling on Riemannian Manifolds via Loewner Order Lower Bounds

Phone Thiha Kyaw, Jonathan Kelly

2026-06-03学习理论

针对RRT*/BIT*等最优采样规划在构型相关黎曼度量下缺乏可采纳启发式、欧氏或标量特征值界过松甚至不可采纳的问题,论文用Loewner序构造保留方向性的矩阵下界,并经Cholesky映射把黎曼informed set化为欧氏超椭球以直接无拒绝采样。在UR5、Franka、PR2多种度量实验中,该界比欧氏和标量界更紧,提升多种规划器收敛速度。

Terminal Time and Angle-Constrained Nonlinear Intercept Guidance Figure 1
2026-06-03eess.SY

Terminal Time and Angle-Constrained Nonlinear Intercept Guidance

Shivam Bajpai, Abhinav Sinha

2026-06-03机器人

面向拦截器只能施加横向加速度、却需同时满足命中时间与命中角约束的欠驱动制导问题,论文提出分层滑模框架:用时间误差与角度误差子流形构成复合流形,并设计变增益自适应制导律。该方法直接基于非线性交会运动学,可用于静止目标并扩展到匀速目标;多场景仿真显示其能同时压低时间与角度终端误差,但实机约束和增益整定细节仍文中未充分说明。

Cosmos 3: Omnimodal World Models for Physical AI Figure 1
2026-06-03cs.CV

Cosmos 3: Omnimodal World Models for Physical AI

Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang

omnimodal world models as scalable, general-purpose backbones for embodied agents. Our post-trained, synthetic datasets, and evaluation benchmark available under the Linux Foundation’s OpenMDW-1.1, website is available at research.nvidia.com/labs/cosmos-lab/cosmos3 .

2026-06-03强化学习

面向物理 AI 中感知、世界模拟与动作策略割裂导致训练昂贵且低效的问题,Cosmos 3 用统一的 Mixture-of-Transformers 架构联合处理/生成语言、图像、视频、音频和动作,把 VLM、视频生成器、世界模型与策略模型收敛到同一骨干。实验覆盖理解、生成和机器人策略,报告达到多项 SOTA,并在开源文生图、图生视频与 RoboArena 策略榜居前;具体增益可能仍主要来自大规模 scaling、数据与后训练组合。

A Measurement-Driven Digital Twin Architecture for Plant-Level Biomass Estimation and Growth Forecasting in Hydroponic Systems Figure 1
2026-06-03cs.RO

A Measurement-Driven Digital Twin Architecture for Plant-Level Biomass Estimation and Growth Forecasting in Hydroponic Systems

Morgan Mayborne, Abhisesh Silwal, George Kantor

2026-06-03机器人

针对水培系统中单株生菜受个体差异和非线性生长影响、产量难以在线预测的问题,论文构建了测量驱动的植物级数字孪生:用FarmBot与RGB-D相机持续采集环境和图像数据,以CNN无损估计生物量并在线校准NiCoLet等生长模型。结果显示,1300张图像训练的网络质量估计误差约1.5 g,集成后可预测未来1–4天产量,误差约2 g。

AURA: Action-Gated Memory for Robot Policies at Constant VRAM Figure 1
2026-06-03cs.AI

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

Josef Chen

2026-06-03机器人

论文针对机器人长时运行中 KV-cache 随时间线性增长、边缘硬件写带宽和显存受限的问题,提出 AURA-Mem:在冻结 VLA 主干外接常量大小快速权重记忆,并用“当前观测是否会改变下一步动作”的动作误差门控来决定何时写入。结果显示其推理状态固定为 4,224 字节,在合成任务以相近准确率减少约 5–9 倍写入;在 LIBERO-Long 上成功率不低于基线,并以约 7 倍更少写入保持常量内存。

Hybrid Adaptive Kalman Filtering for Data-Efficient Joint Tracking and Classification Figure 1
2026-06-03cs.RO

Hybrid Adaptive Kalman Filtering for Data-Efficient Joint Tracking and Classification

Jiho Lee, Nisar R. Ahmed, Rebecca Russell

2026-06-03视觉感知

本文针对卡尔曼滤波在模型失配、噪声协方差调参和低标注数据场景下不稳定的问题,提出自监督混合自适应卡尔曼滤波,用神经网络仅从测量中学习动力学与过程噪声的结构化修正,同时保留创新似然用于广义贝叶斯模型分类。在真实无人机轨迹和 AirSim 仿真中,方法相较调参 KF 提升跟踪精度与不确定性一致性,并在小数据和大数据下保持较稳健的分类表现。

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos Figure 1
2026-06-03cs.RO

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos

Jaehyeon Son, Junhyun Kim, Kyle Kam, Jeremiah Coholich, Seok Joon Kim, Jinhoo Kim, Chris Dongjoo Kim, Jaemin Cho, Dieter Fox, Zsolt Kira

Georgia Institute of Technology, Allen Institute for AI, Johns Hopkins University, University of Washington

2026-06-03视觉感知模仿学习规划控制

本文针对 VLA 适配新任务依赖昂贵遥操作数据、单次人类示范又难以精确跨具身落地的问题,提出 SeeTraceAct:从示范视频、当前视角和语言中学习视觉潜在计划,并在训练时用带可见性预测的未来末端轨迹辅助监督,以处理多视角遮挡和出视野。作者还发布 RoboCasa-DC 基准;在仿真四种设置均优于基线,真实 Franka 由人类示范条件化时平均成功率提升 12.5 个百分点。

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs Figure 1
2026-06-03cs.RO

See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

2026-06-03机器人

本文针对VLA在干扰、外观变化和相似任务下泛化脆弱的问题,认为低层执行器不应同时从粗指令中推断执行模式和关注区域。S2通过VLM生成保留目标的局部子任务指令,并学习无标注、由控制目标驱动的视觉证据预算,让策略只依赖任务充分的局部证据。实机TX-G2与HSR八项任务中,平均子任务成功率由π0.5的54.2%提升至79.0%。

Motion Planning in Dynamic Environments: A Survey from Classical to Modern Methods Figure 1
2026-06-03cs.RO

Motion Planning in Dynamic Environments: A Survey from Classical to Modern Methods

Zongyuan Shen, Yaming Ou, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Zhongqiang Ren, Junfeng Fan, Long Cheng

Zongyuan Shen 1 , Yaming Ou 2 , Shalabh Gupta 3 , Shancheng Zhao 1 , Dehua Zhou 1 , Gao Wang 1

2026-06-03规划控制

面向自动驾驶、服务机器人等含移动障碍的场景,论文指出现有综述偏静态或应用受限,难以覆盖近十年动态规划进展。其核心贡献是按采样、图搜索、MPC、学习方法及速度障碍/势场/动态窗口等局部规划重构138篇工作的算法谱系,并把相机、LiDAR、事件相机等动态感知纳入讨论。主要结果是梳理各类方法在实时重规划、预测不确定性、人机交互和冻结机器人问题上的优劣与开放挑战。

Fixed-Time Dynamic Landing of Quadrotors using Adaptive Unscented Kalman Filtering and Nonlinear Model Predictive Control Figure 1
2026-06-03cs.RO

Fixed-Time Dynamic Landing of Quadrotors using Adaptive Unscented Kalman Filtering and Nonlinear Model Predictive Control

Mohammadreza Izadi, Zeinab Shayan, Steven Waslander, Reza Faieghi

2026-06-03规划控制

面向四旋翼在移动车辆/平台上的末端动态降落,论文关注触地时刻不一致、平台状态预测受噪声变化影响等问题。方法将规定触地时间的实时最小 jerk 轨迹规划与 NMPC 结合,并用在线调节噪声统计的自适应 UKF提升平台运动估计,同时分析参考轨迹对推力/力矩约束的可行性。仿真和室内硬件实验显示,其能实现可重复降落,平台速度预测精度优于固定噪声的 EKF/UKF。

CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving Figure 1
2026-06-03cs.RO

CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving

Yifan Wang

2026-06-03机器人

本文针对自动驾驶规则门控中“可交互修复却被硬否决”的假阴性问题,提出 CARVE 作为不依赖预测的证书层:在有限多主体战术算子格上搜索修复,并用按路权缩放的合作包络限制对非优先车辆的请求,同时给出责任成本与自车回退。其在 589 个 INTERACTION/Lanelet2 回放场景中接受 98.64% 初始否决,恢复 370/378 个类似人类解决的误否决,并保持 589/589 路权尊重、零优先车误请求和 400/400 压力负例否决。

Too Much of a Good Thing: When sim2real Efforts Impede Policy Learning (And What to Do About It) Figure 1
2026-06-03cs.RO

Too Much of a Good Thing: When sim2real Efforts Impede Policy Learning (And What to Do About It)

Kyle Morgenstein, Bharath Masetty, Stephen Welch, Luis Sentis

2026-06-03强化学习

本文指出过度追求高保真 sim2real 会造成“验证仿真器”锁定,并让大型人形机器人在高增益、力矩受限下探索效率变差。核心洞察是将行为学习与系统辨识解耦:先在更易学习的支持仿真中生成仅受运动学约束的策略,再用前向模型和状态模仿迁移到高保真仿真并上机。案例声称可在 Apollo 人形机器人上零样本部署,但定量收益文中未充分说明。

TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches Figure 1
2026-06-03cs.CR

TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches

Zhengxian Huang, Wenjun Zhu, Haoxuan Qiu, Xiaoyu Ji, Wenyuan Xu

2026-06-03机器人

本文关注带 CoT 推理的 VLA 机器人模型安全性:显式中间推理虽提升泛化与可解释性,却可能成为可操控的高层意图通道。作者提出 TRAP,通过物理对抗贴片劫持“推理到动作”路径,使模型在不改用户指令下执行攻击者指定行为。实验覆盖三类代表性推理 VLA,并包含打印贴片实物攻击,显示该漏洞具有跨架构有效性,同时提出轻量一致性检测作为初步防御。

Geometric Adaptive Control with Neural Networks for a Quadrotor UAV in Wind fields Figure 1
2026-06-03math.OC

Geometric Adaptive Control with Neural Networks for a Quadrotor UAV in Wind fields

Mahdis Bisheban, Taeyoung Lee

additionally limited by computing resources available in real-, are not available in [13]., is represented by the position of the center of mass x ∈R3, distances from the origin of the body-fixed frame to the center

2026-06-03规划控制

针对四旋翼在未知风场中易受非结构化力和力矩扰动、且精确气动建模或测风依赖较强的问题,论文在 SE(3) 几何控制框架中引入多层神经网络与在线自适应权重更新,用以近似并补偿任意状态相关扰动,避免欧拉角奇异性。理论上证明位置与航向跟踪误差一致最终有界且界可调小,并通过含风仿真和室内风扇实验展示了在激烈机动下的抗风效果。

Geometric Adaptive Control for a Quadrotor UAV with Wind Disturbance Rejection Figure 1
2026-06-03math.OC

Geometric Adaptive Control for a Quadrotor UAV with Wind Disturbance Rejection

Mahdis Bisheban, Taeyoung Lee

of the body-fixed frame is located at the center of mass of, of the center of mass in the inertial frame. The kinematics, sponds to the drag which is assumed to act on the center

2026-06-03规划控制

面向四旋翼在户外风扰下难以稳定跟踪的问题,论文在 SE(3) 几何框架上构造自适应非线性控制器,用两个在线更新的三层神经网络分别补偿位置与姿态动力学中的未知非结构化扰动,避免欧拉角奇异性。作者还建立包含推力/力矩变化、桨叶挥舞和阻力的风场模型,并用 Lyapunov 分析证明跟踪误差一致最终有界、界可调小;数值仿真显示无需先验气动知识也能抑制风扰并跟踪期望轨迹。

2026-06-02

121 篇
RoboDream: Compositional World Models for Scalable Robot Data Synthesis Figure 1
2026-06-02cs.RO

RoboDream: Compositional World Models for Scalable Robot Data Synthesis

Junjie Ye, Rong Xue, Basile Van Hoorick, Runhao Li, Harshitha Rajaprakash, Pavel Tokmakov, Muhammad Zubair Irshad, Vitor Guizilini, Yue Wang

1 USC Physical Superintelligence (PSI) Lab, 2 Toyota Research Institute

2026-06-02机器人强化学习

RoboDream针对机器人模仿学习中真实遥操作数据昂贵且难以覆盖多物体、多场景的问题,提出以机器人渲染轨迹锚定具身运动、再显式注入物体与场景先验的视频世界模型,将动作执行与环境合成解耦。由此支持“轨迹重生”和无道具遥操作,在零样本新物体、新场景、新视角下合成示范;真实机器人实验显示,合成数据可稳定提升下游策略表现并减少真实数据需求。

Permissive Safety Through Trusted Inference: Verifiable Belief-Space Neural Safety Filters for Assured Interactive Robotics Figure 1
2026-06-02cs.RO

Permissive Safety Through Trusted Inference: Verifiable Belief-Space Neural Safety Filters for Assured Interactive Robotics

Haimin Hu

2026-06-02机器人安全鲁棒

面向人机交互中意图不确定、在线推断可能出错而传统安全滤波过保守的问题,本文将置信空间安全滤波的验证与推断可靠性耦合:只在“可信推断区域”用共形预测认证并部署,从而避免把少量推断失败等同于滤波器失效。仿真人车交互实验显示,该方法相比直接共形预测可认证更大的安全集,在线拒绝率更低,并在同等基准安全集水平下获得更高安全覆盖。

AFUN: Towards an Affordance Foundation Model for Functionality Understanding Figure 1
2026-06-02cs.RO

AFUN: Towards an Affordance Foundation Model for Functionality Understanding

Zhaoning Wang, Yi Zhong, Jiawei Fu, Henrik I. Christensen, Jun Gao

University of Michigan, University of California, San Diego

2026-06-02机器人

AFUN针对现有可供性方法多停留在“哪里能交互”、缺少可执行3D动作且数据域狭窄的问题,构建统一数据管线,将机器人、人类、仿真和扫描数据标准化为语言、功能掩码与物体中心3D运动标签,并用RGB-D和任务文本联合预测交互区域及Bézier运动曲线。实验中其在8个分割测试集上平均gIoU/cIoU较最强基线提升23.9/26.3,接触点命中率和3D运动预测也领先,并可零微调用于真实机器人操作;增益可能主要来自更大规模异构数据与统一监督。

IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes? Figure 1
2026-06-02cs.RO

IMAC-AgriVLN: Can Agricultural Vision-and-Language Navigation Agents be Aware of Instruction Mistakes?

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

2026-06-02机器人视觉感知

针对农业视觉语言导航默认“指令一定正确”而难以应对口误的问题,论文构建 A2A-MI 基准,用半自动标注向 A2A 指令注入形容词、名词和动词三类错误,并发现现有农业 VLN 智能体在错误指令下成功率下降约 57%。作者提出 IMAC 模块,利用当前前视图像与指令判断并尝试纠错,接入 AgriVLN 后显著改善成功率和导航误差,但案例也显示过度纠错可能引入新噪声。

Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis Figure 1
2026-06-02cs.CV

Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis

Xiang Xu, Alan Liang, Youquan Liu, Xian Sun, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

2026-06-02安全鲁棒

这篇论文针对4D LiDAR生成中“所有区域同等建模”导致远处、小物体和遮挡边界失真的问题,提出U4D:先用预训练分割器的Shannon熵定位高不确定点,再以“先难后易”的两阶段扩散生成不确定区域并补全全场景,同时用MoST门控融合空间细节与时间一致性。在nuScenes和SemanticKITTI上,文中报告FRD/FPD降低约6%–11%,TTCE最低,并提升下游语义分割效果。

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation Figure 1
2026-06-02cs.RO

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski

Robotics Institute, Carnegie Mellon University, Pittsburgh, USA

2026-06-02机器人强化学习

本文针对现有 VLA 在传送带、抛接等动态物体操作中因感知到执行延迟而瞄准“过期状态”的问题,提出 AHEAD:在冻结 OpenVLA 外接仅 4.9M 参数的潜空间世界模型,利用光流估计的速度/加速度与语言-运动显著性,只预测任务相关 patch,并按不确定性自适应决定前瞻步长。实验显示其在 20 个仿真动态场景成功率达 79%–97%,实机 xArm 7 在多项拦截任务中显著优于基线,投射物抓取达 19/30 而基线为 0。

NDPP-Grasp: Non-Differentiable Physical Plausibility Constraint-Guided Task-Oriented Dexterous Grasp Generation Figure 1
2026-06-02cs.RO

NDPP-Grasp: Non-Differentiable Physical Plausibility Constraint-Guided Task-Oriented Dexterous Grasp Generation

Qiuchi Xiang, Haoxuan Qu, Hossein Rahmani, Jun Liu

Lancaster University

2026-06-02优化算法

该文针对任务导向灵巧抓取中“任务匹配”和“物理可行性”常被分离处理的问题,指出后处理修正无法约束扩散生成轨迹,且非穿透、自碰撞等约束往往不可微。NDPP-Grasp将去噪过程视为随机控制,用仅前向评估的非可微物理约束逐步引导生成,并用摊销前瞻降低计算开销;实验显示其能在保持任务对齐的同时提升物理可行性,但具体增益幅度需看完整实验细节。

A Simulation Platform for Flapping-Wing Vehicles Figure 1
2026-06-02cs.RO

A Simulation Platform for Flapping-Wing Vehicles

Haichuan Li, Tomi Westerlund

University of Turku, clouds, and RGB camera feeds. Our platform enables scalable, Our proposed framework enables scalable generation of, research, enabling safe, repeatable, and scalable development

2026-06-02机器人

针对扑翼飞行器对湍流极敏感、载荷限制导致传感受限,而现有仿真多用层流假设和理想传感器造成 sim-to-real 差距的问题,论文提出 Unity 平台 FWAV-Sim,结合准稳态叶素气动、钝体阻力、分形噪声湍流场及带噪 IMU/LiDAR/RGB 传感器,生成同步真值与多模态数据。实验称其可提升控制抗阵风和感知鲁棒性,但具体增益来源与真实机验证文中未充分说明。

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO Figure 1
2026-06-02cs.RO

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

Tianyang Chen, Wenjun Li, Xin zhou, Yuze Wu, Fei Gao

Zhejiang University

2026-06-02机器人

本文针对无人机VLA导航中SFT数据昂贵、泛化弱且难以对齐“如何飞”的细粒度意图问题,提出EG-GRPO,在在线rollout中混入少量专家轨迹,并用指令条件奖励模型提供轨迹级反馈,同时并行化仿真与推理。实验显示相对SFT成功率提升至2.13倍,意图对齐提升60.9%,rollout耗时降低43.5%。

FATE-VLA:Failue-aware test generation for vision-language-action models Figure 1
2026-06-02cs.RO

FATE-VLA:Failue-aware test generation for vision-language-action models

Arusa Kanwal, Pablo Valle, Shaukat Ali, Aitor Arrieta

Mondragon University, Simula Research Laboratory

2026-06-02视觉语言视觉感知

论文指出,VLA 模型仍多用固定或随机场景评测,而具身空间中的失败往往稀疏且成簇,易低估部署风险。FATE-VLA 将评测改写为主动失败发现,结合 ART 式多样性探索与由历史执行训练的代理失败预测,生成高风险且多样的测试场景。四个先进 VLA 上相较基线最多多发现 29.7% 失败,并揭示更丰富的轨迹级和对象级失败模式。

A Kinetic Theory of Encounter-Based Information Propagation in Multi-Robot Systems Figure 1
2026-06-02cs.RO

A Kinetic Theory of Encounter-Based Information Propagation in Multi-Robot Systems

Alkesh K. Srivastava, Philip Dames

2026-06-02机器人学习理论

针对多机器人在地下、海上或受干扰环境中无法保持持续联网的问题,论文把“近距离相遇才通信”的目标跟踪建模为类似动理论的信息运输过程,用相遇率、信息年龄和目标位移解释误差,并提出访问、陈旧性、几何三类极限。大规模仿真显示,通信覆盖决定信息能否扩散,归一化陈旧性主导可用信息下的跟踪误差,而目标运动过快时误差会饱和,单纯增强通信收益有限。

Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation Figure 1
2026-06-02cs.RO

Dynamics Are Learned, Not Told: Semi-Supervised Discovery of Latent Dynamics Geometries For Zero-Shot Policy Adaptation

Zhiming Xu, Weitao Zhou, Xianghui Pan, Nanshan Deng, Chengju Liu, Qijun Chen, Chenpeng Yao

2026-06-02强化学习

这篇论文针对机器人强化学习中物理条件变化导致策略失效的问题,质疑RMA等依赖显式物理参数的适应范式,提出从交互结果学习潜在动力学几何。方法将变分推断与对比学习结合,用局部一致性和全局均匀性约束轨迹编码器的平滑拓扑,并从理论上把目标域遗憾与编码器Lipschitz常数联系起来。MuJoCo实验显示,LDG在未建模、复合和时变动力学偏移下优于参数中心基线,同时提升分布内稳定性和潜变量可解释性。

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models Figure 1
2026-06-02cs.RO

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wang, Cong Huang, Kai Chen

2026-06-02视觉语言

论文针对VLA模型评测中易被视觉或指令-动作捷径掩盖的问题,提出RoboSemanticBench,将数学、难数学和常识问答转化为机器人抓取正确答案块的具身选择任务,并用GSR、TSR、nSG区分抓取能力与语义选目标能力。实验显示,多种代表性VLA虽能学会抓候选块,但在控制抓取成功后正确目标选择接近或低于随机,说明预训练语义能力常未有效传递到动作预测路径。

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning Figure 1
2026-06-02cs.RO

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

The Chinese University of Hong Kong, Shenzhen

2026-06-02机器人强化学习三维

Dexterity-BEV针对现有VLA依赖2D RGB、输入输出及跨机器人/相机/数据集坐标不一致导致泛化受限的问题,引入逐像素3D的aligned vertex map/spectrum,并将多视角观测、机器人动作统一到共享坐标与规范BEV框架,同时配套空间与时间对齐数据流水线。文中称在仿真和真实操作中,对相机视角、机器人基座位姿和场景变化更鲁棒并显著提升成功率,但具体增益来源可能部分来自数据处理与对齐规模化。

FW-NKF: Frequency-Weighted Neural Kalman Filters Figure 1
2026-06-02cs.RO

FW-NKF: Frequency-Weighted Neural Kalman Filters

Adnan Harun Dogan, Berken Utku Demirel, Christian Holz

All authors are with the Department of Computer Science, ETH Zürich, Switzerland 1 ., Code is available at https://github.com/eth-siplab/Frequency-weighted-neural-Kalman-filters

2026-06-02机器人

针对机器人状态估计中 IMU 振动、偏置漂移和周期干扰等有色/带限噪声,FW-NKF 将可学习的因果频谱整形算子嵌入卡尔曼创新项,并用神经观测与转移模型配合频域重构损失学习去噪表示。论文在摆、Lorenz、MAV 和人体姿态基准上验证,定位误差最高降低约 10%,姿态精度也有改善。

Network Distributed Multi-Agent Reinforcement Learning for Consensus Control of Quadcopters Figure 1
2026-06-02cs.RO

Network Distributed Multi-Agent Reinforcement Learning for Consensus Control of Quadcopters

Youssef Mahran, Zeyad Gamal, Aamir Ahmad, Ayman El-Badawy

Mechatronics Engineering Department, German University in Cairo (GUC), Egypt, Institute of Flight Mechanics and Control (IFR), Head of Flight Robotics, University of Stuttgart, Germany, Faculty of EMS, Head of Mechatronics Engineering Department, German University in Cairo (GUC), Egypt

2026-06-02强化学习规划控制

面向大规模四旋翼集群一致性控制中集中式 MARL 难扩展、纯去中心化训练不稳定的问题,论文将通信图显式纳入决策,提出每机仅观测两个邻居的 ND-MARL,并用 MASAC 训练高层一致性规划器、低层控制器跟踪参考。实验显示轨迹平滑且可集成到四旋翼栈;三智能体训练策略可零样本部署到最多 250 架,但大规模下稳态离散度随稀疏信息传播增加。

TIDES: Time-Derivative Event Simulation via Deformable Reconstruction Figure 1
2026-06-02cs.CV

TIDES: Time-Derivative Event Simulation via Deformable Reconstruction

Christopher Thirgood, Dipon Kumar Ghosh, Simon Hadfield

2026-06-02三维

本文针对事件相机仿真中由离散帧差分导致的时间戳批量化问题,尤其在高速运动和遮挡下失真严重,提出基于动态 4D Gaussian Splatting 的连续时间模拟器 TIDES。其核心是直接对渲染过程求时间导数,获得可见性一致的亮度变化率,并用遮挡风险自适应步进和瓦片级读出仲裁模拟带宽限制。实验称在四个配对 RGB-事件基准上达到最优事件流保真度,并提升合成到真实下游任务迁移效果。

World-Task Factorization for Robot Learning Figure 1
2026-06-02cs.RO

World-Task Factorization for Robot Learning

Eduardo Sebastián, Adrian Pfisterer, Vito Mengers, Oliver Brock, Amanda Prorok

Department of Computer Science and Technology, University of Cambridge, United Kingdom, Robotics and Biology Laboratory, Technische Universität Berlin, Germany, Robotics and Biology Laboratory, Technische Universität Berlin, Robotics Institute Germany

2026-06-02机器人强化学习

本文针对机器人策略在新约束、队友和环境组合下难以泛化的问题,主张先将“世界因素”(运动学、感知、几何等)与“任务因素”(目标优先级、权衡、角色选择等)解耦。其核心洞察是用贝叶斯模型证据论证这种分解符合数据生成不变性,并以 AICON 图式世界模型加小型学习策略调制梯度路径。三类协作任务结果显示,该方法较端到端学习更省样本,性能接近或超过解析启发式,并能零样本泛化到分布外配置及无重训迁移到真实硬件。

Market-Based Replanning for Safety-Critical UAV Swarms in Search and Rescue Missions Figure 1
2026-06-02cs.RO

Market-Based Replanning for Safety-Critical UAV Swarms in Search and Rescue Missions

Luiz Giacomossi, Andrea Haglund, Claire Namatovu, Emily Zainali, Esaias Målqvist, Yonatan M. Beyene, Ivan Tomasic, Baran Çürüklü, Håkan Forsberg

2026-06-02规划控制安全鲁棒

面向搜救无人机群在电量耗尽、坠机等个体失效下仍需持续覆盖的需求,论文提出 IRDS 分布式重规划框架,将失效视为市场“清算”事件,用距离加权反向拍卖快速释放并重分配扇区任务,并以动态几何共识确认目标、APF 保障避碰。PyBullet 中 8 机、8×8 网格随机故障实验显示,在 25% 劳动力退化下任务成功率仍达 93%,重分配延迟约 13–18 秒,但物理死锁和共识超时处理仍未充分解决。

WALL-WM: Carving World Action Modeling at the Event Joints Figure 1
2026-06-02cs.RO

WALL-WM: Carving World Action Modeling at the Event Joints

Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J.W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

2026-06-02强化学习

论文针对现有机器人世界动作模型用固定长度 action chunk 对齐语言、视频与控制,导致语义事件和低层动作粒度错配的问题,提出以“可执行语义事件”为训练原子进行 VLA 预训练,并配合事件级标注、聚类均衡采样、可变长度事件推理与 Staircase Decoding 统一推理。实验称其在大规模真实机器人泛化评测中达到 SOTA,但具体增益中 data/scaling 与事件建模的贡献边界仍需进一步拆分。

Co-training with Ego-centric Video and Demonstration for Robot Navigation Task Figure 1
2026-06-02cs.RO

Co-training with Ego-centric Video and Demonstration for Robot Navigation Task

Shoya Kuno, Yumo Ouchi, Kanata Suzuki

Shoya Kuno is affiliated with Depertment of Informatics, Graduate School of Informatics, Kyoto University, Sakyo, Kyoto, Japan., All authors are affiliated with Spatial Robotics Research Center, Fujitsu Limited.

2026-06-02机器人视觉感知模仿学习

该文针对真实机器人采集导航示教成本高、而第一视角人类行走视频难以直接用于移动机器人控制的问题,提出用单目视觉里程计估计人类视频中的相机运动,并经轨迹平滑、运动学投影和离散化转换为机器人动作标签,再与少量机器人数据联合训练 VLA。水果搜索实验显示,单用人类数据因域差表现很差,联合训练在有干扰物与未见起点上均优于仅机器人数据,说明增益可能主要来自人类视频带来的语言与视角数据扩充。

Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects Figure 1
2026-06-02cs.RO

Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects

Jens U. Kreber, Lukas Mack, Joerg Stueckler

University of Augsburg

2026-06-02强化学习三维

面向家居桌面场景中多刚体遮挡、接触和机器人动作影响难以预测的问题,本文提出 MRO-GWM:用对象中心 Gaussian Splatting/anchor 表示物体形状,并以刚体位姿变换编码历史状态,再由含空间、时间与时空注意力的 Transformer 预测未来物体位姿。实验在合成多物体场景和仿真非抓取 MPC 中验证了对未见物体的预测能力,并能完成两类操作任务;但依赖已知分割与位姿,真实场景效果文中未充分说明。

Closed-Form Pose Estimation of Endoluminal Medical Devices via Gradiometer-Based Electromagnetic Localization System Figure 1
2026-06-02cs.RO

Closed-Form Pose Estimation of Endoluminal Medical Devices via Gradiometer-Based Electromagnetic Localization System

Zhiwei Wu, Jiahao Luo, Yubo Pu, Siyi Wei, Yuankai Chen, Jinhui Zhang

vices, thereby improving dexterity, access, and controllability, School of Automation, Beijing Institute of Technology, Beijing, 100081

2026-06-02三维

面向腔内医疗器械磁导航中6自由度位姿需场图标定或非线性迭代、难以实时闭环的问题,论文提出GELS:用紧凑磁力计阵列构成准梯度计,分离多电磁源的局部磁场与梯度,并借助欧拉齐次关系和多源Procrustes配准闭式恢复位姿,不依赖初值、场图或源磁矩标定。台架实验显示序列平均位置误差10.80–15.57 mm,最快14.49 Hz,求解中位耗时172 µs;精度瓶颈主要来自传感器间不一致和偶极模型失配。

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections Figure 1
2026-06-02cs.RO

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections

Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober

2026-06-02生成模型强化学习

论文针对扩散策略在行为克隆中易受分布偏移影响、人工纠错数据又常只利用教师动作而忽略机器人失败动作的问题,提出 SDP:把正负 action-chunk 纠错对构造成期望动作集合,并通过采样集合内动作来训练扩散策略。实验显示其在多种操作任务、离线与在线聚合中提升成功率与抗噪性,并生成更高质量数据,但需额外采样开销。

PHASOR: Phase-Anchored Universal Action Representations for Humanoid Embodiments Figure 1
2026-06-02cs.RO

PHASOR: Phase-Anchored Universal Action Representations for Humanoid Embodiments

Kihyun Kim, Chaeyun Kim, Jongho Shin, Taeyoun Kwon, Junghyun Kim, Mijin Koo, Haon Park

Seoul National University

2026-06-02机器人

这篇论文针对人形机器人动作潜空间常与具体机体绑定、缺乏时间结构而难以跨平台迁移的问题,提出 PHASOR:把运动按身体部位分解为由 FFT 参数化的相位流形,并用独立姿态分支补充非周期位形,再以人类运动预训练流形和轻量适配器对齐多种机器人。实验覆盖一人类与四类人形机器人,跨 embodiment 检索 R@1 超过 88%(最佳约 90.3%),并在模仿、遥操作和强化学习中带来一致收益。

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space Figure 1
2026-06-02cs.RO

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space

Bing-Cheng Chuang, I-Hsuan Chu, Bor-Jiun Lin, YuanFu Yang, Min Sun, Chun-Yi Lee

2026-06-02视觉感知

本文针对扩散式视觉语言动作策略把 SE(3) 位姿当作欧氏向量建模所导致的流形漂移、坐标变换不等变和非测地轨迹问题,提出 Lie Diffuser Actor:在 SE(3) 上用左不变 SDE 加噪、在切空间做 score matching,并经指数映射回到流形。实验显示其在 CALVIN ABC→D 将平均任务长度从 3.27 提升到 3.51,OpenVLA-OFT/LIBERO Long 成功率从 92.20 提升到 94.13,并在真实机器人多数任务上优于基线。

DisFlow: Scene Flow from Distance Field for Object Pose, Velocity Tracking, and Dynamic Object Reconstruction Figure 1
2026-06-02cs.RO

DisFlow: Scene Flow from Distance Field for Object Pose, Velocity Tracking, and Dynamic Object Reconstruction

Lan Wu, Sheila Sutjipto, Jennifer Wakulicz, Teresa Vidal-Calleja

2026-06-02视觉感知生成模型三维

面向机器人在抓取、交互等任务中同时感知动态物体运动与几何的需求,DisFlow 将物体表示为带法向约束的 GPIS 距离场,并从距离场推导场景流,在物体坐标系中闭式增量估计 6DoF 位姿、线/角速度并融合表面。实验称其可实时输出轨迹、速度、稠密重建和不确定性,优于仅跟踪或仅重建基线,但具体量化增益在给定片段中未充分说明。

Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality Figure 1
2026-06-02cs.RO

Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality

Yixuan Yang, Sha Zhang, Rui Li, Zhenfei Yin, Xinzhu Ma, Yiran Qin, Lei Bai, Xudong Xu, Shilin Shan, Wangmeng Zuo, Yanyong Zhang, Wanli Ouyang, Feng Zheng, Shixiang Tang, Dongzhan Zhou

Shanghai AI Laboratory, Harbin Institute of Technology, University of Oxford, Beihang University, Nanyang Technological University, University of Science and Technology of China

2026-06-02机器人

透明物体因折射、反射导致深度传感失效,多视角重建又难以部署到实时抓取。Trans2Occ的核心是绕开深度补全,直接由单张RGB预测体素占据,用粗粒度但几何一致的3D表示服务抓取,并通过仿真生成RGB—占据标注实现规模化训练。实验称其在仿真和真实机器人中无需微调即可迁移,配合简单规则抓取可稳定操作透明物体,但具体增益可能主要来自仿真数据覆盖与占据表示的任务适配。

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds Figure 1
2026-06-02cs.CV

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds

Rai Hisada, Kanji Tanaka

2026-06-02机器人

面向机器人长期视觉地点识别中“稠密地图占存储、稀疏锚点降精度”的矛盾,FlatVPR认为基础模型特征流形弯曲会破坏物理空间的线性插值,并用即插即用残差适配器与Pullback Flatness Loss将DINOv2特征几何拉平,使稀疏锚点间可重构描述子。NCLT跨季节、100m锚点实验中,平均MRR由0.697提升到0.872,Recall@1由61.5%升至83.0%;但EM中的E步更偏概念性锚点选择准则。

FlipItRight: Stable Pose-Targeted Throw-Flip Across Diverse Objects Figure 1
2026-06-02cs.RO

FlipItRight: Stable Pose-Targeted Throw-Flip Across Diverse Objects

Axel Dawne, Shinkyu Park

2026-06-02三维

论文瞄准机器人抛掷中同时控制落点与姿态的难题,尤其是物体离手后不可控且释放状态与高自由度机械臂轨迹强耦合。FlipItRight 将“释放状态”作为中间表示,先由物体层规划满足目标落姿的候选释放状态,再由机器人层筛选可执行轨迹,并在末段保持近似恒定末端速度以减小释放时序误差。真实平台上跨不同形状、尺寸和质量物体完成120次试验,成功率90%,消融显示各设计对性能有贡献。

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation Figure 1
2026-06-02cs.CV

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

Carnegie Mellon University, Nanyang Technological University

2026-06-02机器人视觉语言视觉感知

该文针对 VLN-CE 中 VLM 逐步预测低层动作带来的监督歧义、短视决策和高调用成本,提出 Goal2Pixel:将导航统一为图像平面可通行像素 grounding,前进像素反投影为 3D waypoint,转向/停止也编码为辅助像素区域,并用可见性关键帧记忆、语义嵌入和坐标损失适配 VLM。在 R2R-CE Val-Unseen 达到 54.1% SR、52.5% SPL,平均仅 7.75 次 VLM 调用,较直接动作预测约少 6 倍;RxR-CE 也取得接近 SOTA 的效率与轨迹质量。

Embedding Semantic Risk into Distance Fields and CBFs for Online Monocular Safe Control Figure 1
2026-06-02cs.RO

Embedding Semantic Risk into Distance Fields and CBFs for Online Monocular Safe Control

Dawei Zhang, Nuo Chen, Shuo Liu, Roberto Tron, Zhiwen Fan

Boston University, United States

2026-06-02规划控制安全鲁棒

针对单目机器人安全控制中几何地图难以区分“人、宠物、杂物”等风险差异的问题,论文将语义标签在控制优化前嵌入ESDF:按类别选择障碍并做不同膨胀,再用语义相关CBF增益调节避障响应。该框架结合基础模型单目稠密SLAM、语义分割与CBF,在仿真和硬件中实现10–20 Hz在线运行,并展示了遥操作和自主导航中的语义感知避障。

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation Figure 1
2026-06-02cs.CV

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

Singapore Management University, Fudan University, Princeton University

2026-06-02机器人视觉感知强化学习数据集/基准

针对机器人视频世界模型评测长期默认指令有效、可行且安全的问题,本文提出 RoboTrustBench,从 DROID 构建 1207 个专家验证的图像-指令样本,覆盖正常、约束敏感、反事实和对抗场景,并用六维 13 项标准评估可信性。对 7 个模型的人评与 MLLM 评测显示,现有模型虽能生成连贯画面,但在约束推理、物理交互、反事实接地和抑制危险指令上明显不足。

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms Figure 1
2026-06-02cs.RO

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

Zixuan Jin, Wenzhuo Zhang, Shuxian Quan, Zirui Dong, Fangwen Ye, Yuchen Shi, Cheng Xu

*School of Computer and Communication Engineering, University of, *Shunde Innovation School, University of Science and Technology, centralized control [2]. This property underpins the robustness, scalability, flexibility

2026-06-02机器人规划控制

面向群体机器人中多阶段涌现行为难以统一建模、控制和解释的问题,论文提出 PhySwarm,将宏观多相对流–扩散–反应密度场与微观可执行运动耦合,并用神经物理控制器在强化学习与 PINN 约束下学习可解释物理参数。文中在循迹觅食、可重构编队导航和角色自适应搜救等概念验证任务中展示了不同阶段行为的生成与密度场解释,但真实硬件验证和相对基线增益幅度仍需进一步确认。

Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation Figure 1
2026-06-02cs.RO

Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation

Xiang Fang, Wanlong Fang, Changshuo Wang

School of Software Engineering, Huazhong University of Science and Technology, Nanyang Technological University, Singapore, University College London

2026-06-02机器人视觉语言视觉感知

该文针对连续环境视觉语言导航中长程任务易受场景理解不足、静态地图依赖和启发式规划限制的问题,提出 HSAN:用视觉语言模型动态构建对象—区域—分区层级语义图,以最优传输选择兼顾指令语义与可达性的长期目标,并用图感知强化学习执行低层控制。论文称在多个 VLN-CE 基准上达到 SOTA、提升成功率和未见环境泛化,但具体数值与增益来源在给定文本中未充分说明。

Hierarchical Object Representation for Spatial Robot Perception: Points, Meshes, and Superquadrics Figure 1
2026-06-02cs.RO

Hierarchical Object Representation for Spatial Robot Perception: Points, Meshes, and Superquadrics

Ceng Zhang, Wan Su, Mohamed Samshad, Gregory S. Chirikjian, Rajat Talak

National University of Singapore (NUS), Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), actionable and scalable representation for long-term autonomy incorpo-

2026-06-02机器人

现有3D场景图常把物体简化为点云或包围盒,难兼顾重建精度与机器人在线规划效率。论文提出四层层次化物体表示:多视角点云、基础模型生成的稠密网格、超二次曲面及膨胀超二次曲面,并配套RGB-D构建、最佳视角选择、参数化关联与闭式碰撞检测流程。在HOPE、ReplicaCAD、Kimera-Multi和NUS校园数据上验证,其视角选择提升形状/位姿指标,基于超二次曲面的地图对齐优于ROMAN,并支持更高效的安全导航。

Spatio-Temporal Reconnection for Multi-Robot Networks using Adaptive Prescribed-Time CBFs Figure 1
2026-06-02cs.RO

Spatio-Temporal Reconnection for Multi-Robot Networks using Adaptive Prescribed-Time CBFs

Hao Liu, Yupeng Yang, Yanze Zhang, Wenhao Luo

2026-06-02机器人

针对多机器人在大范围、短通信半径场景下持续保持全局连通会牺牲任务效率的问题,论文将重连视为可暂时断开但需按时恢复的时空约束,提出自适应 prescribed-time CBF:结合 FT-CBF 的状态相关可达时间与 PT-CBF 的截止时间结构,并用任务进度与重连紧迫度触发成对约束。理论证明可在规定有限时间内回到通信范围,实验显示在满足重连与避碰的同时提升任务执行效率。

Global Convergence of a Line-Search Filter Differential Dynamic Programming Method Figure 1
2026-06-02math.OC

Global Convergence of a Line-Search Filter Differential Dynamic Programming Method

Ming Xu, Iman Shames

School of Computer and Communication Sciences, Department of Electrical and Electronic Engineering, University of Melbourne

2026-06-02学习理论

针对带状态/控制非线性约束的离散最优控制中,DDP 扩展常缺少全局收敛保证的问题,本文从线搜索滤波法视角分析 FilterDDP。核心洞察是证明其“后向递推—前向仿真”试探点在特定问题类上可承担类似 NLP 中阻尼牛顿步的作用,从而可移植 Wächter–Biegler 的滤波收敛框架。主要结果表明生成序列的每个极限点可行,且至少一个极限点满足一阶最优性条件,并进一步给出处理不等式约束的障碍内点扩展。

Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX Figure 1
2026-06-02cs.RO

Crazyflow: An Accurate, GPU-Accelerated, Differentiable Drone Simulator in JAX

Martin Schuck, Marcel P. Rath, Yufei Hua, AbhisheK Goudar, SiQi Zhou, Angela P. Schoellig

Technical University of Munich, University of Toronto, Simon Fraser University

2026-06-02生成模型

面向无人机学习与控制对高速、精确且可微仿真的需求,Crazyflow 用 JAX/XLA 将动力学与控制器编译为统一可微计算图,并支持多层次模型、Crazyflie 兼容与轻量系统辨识。实验显示其单机速度较现有仿真器快一个数量级以上,可在消费级 GPU 上扩展到百万级无人机、超 9 亿步/秒;真实平台上实现无域随机化亚厘米跟踪,并在抛飞后 0.38 秒内在线训练恢复策略完成稳定。

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World Figure 1
2026-06-02cs.RO

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

Stanford University

2026-06-02机器人强化学习三维

针对人形机器人移动操作中遥操作示范昂贵、纯仿真视觉差距大导致VLA难以迁移的问题,LEGS将MuJoCo动态网格前景与手持扫描重建的3D Gaussian Splatting真实背景合成,并用程序化运动基元生成无遥操作标注数据、通过颜色校准对齐部署相机。在Unitree G1三类取放任务和三种VLA上,纯LEGS数据均匹配或超过人类遥操作,优于mesh-only仿真;重渲染增强在物体与场景外观变化下仍保持成功率,且新场景成本显著低于遥操作。

A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception Figure 1
2026-06-02cs.RO

A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception

Weitung Chen, Phil Tinn, Per Gunnar Auran, Martin Ludvigsen, Peter Halland Haro

2026-06-02机器人数据集/基准

水下机器人视觉具语义但易受浑浊影响,声呐稳健却缺少语义,跨模态学习受限于真实配对数据不足。论文提出 SOVIS:在 Trondheimfjord 由 Blueye X3 采集 17 次下潜、6 个地点的 7.6 万余帧单目相机—多波束声呐同步数据,并提供清洗同步流程与可投影标注工具。用 306 个鱼类标注做概念验证时,跨模态检测达 46.7% mAP@0.10,较单目/几何基线约提升 7 倍。

Autopilot-Preserving Residual Q-Learning with HJB-Inspired Finite-Action Risk Filtering for Fixed-Wing UAV Command Supervision Figure 1
2026-06-02cs.RO

Autopilot-Preserving Residual Q-Learning with HJB-Inspired Finite-Action Risk Filtering for Fixed-Wing UAV Command Supervision

Mehmet Iscan, Batuhan Temiz

PythaLab, Yildiz Technical University, Istanbul, Turkey

2026-06-02视觉感知安全鲁棒

针对固定翼无人机在强风、湍流和激进转弯下传统自驾仪适应性不足、端到端RL又会把探索风险推到舵面的问题,论文把学习器放在自驾仪上层,仅对空速、高度、航向命令加有限残差,并用HJB启发的价值评分、相对no-op优势和CLF/CBF式动作过滤保留安全回退。12状态仿真中平均路径RMS误差降至44.809 m,优于基线338.617 m和Q残差88.809 m,但收益主要集中在最困难场景,且空速误差和控制活动增加。

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo Figure 1
2026-06-02cs.RO

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo

Guo Pu, Yixuan Han, Zhouhui Lian

2026-06-02三维

ActMVS瞄准主动三维重建中深度传感器带来的成本、重量与功耗问题,尝试让单目机器人/UAV仅凭RGB与位姿完成安全探索。其核心是用体素-帧可见性的视图因子图为MVS选择更合适参考帧,并通过全局深度优化约束跨视角一致性,从而在线生成稠密度并维护占据图。Replica实验显示其几何与渲染质量接近RGB-D基线,AirSim中也能无碰撞规划,但运行时间和显存开销仍限制真实机载部署。

S2M-Trek: From Single to Multi-Sphere Transport via Per-Frame Deep Sets on a Wheel-Legged Robot Figure 1
2026-06-02cs.RO

S2M-Trek: From Single to Multi-Sphere Transport via Per-Frame Deep Sets on a Wheel-Legged Robot

Zong Chen, Xuebin Li, Jinpeng Xiao, Shaoyang Li, Ben Liu, Min Li, Zhouping Yin, Yiqun Li

School of Mechanical Science and Engineering, Huazhong University of Science and Technology, School of Mathematics, Harbin Institute of Technology

2026-06-02机器人

本文针对轮腿机器人无夹具同时运输多个自由滚动球时,球体无身份且每帧槽位可独立置换导致的表示错配问题。核心洞察是历史拼接 Deep Sets 只满足对角置换不变性,PFDS 改为逐帧集合池化再做时序读出,从结构上匹配每帧置换对称性。仿真中 PFDS 在五球课程学习上五个随机种子均达到 100% 不掉落,DAgger 蒸馏的 TactSet 用 16×16 触觉接触图达到 75%,但实机部署文中未完成。

PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making Figure 1
2026-06-02cs.RO

PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making

Rufeng Chen, Yue Chang, Xiaqiang Tang, Hechang Chen, Sihong Xie

2026-06-02机器人

面向开放词汇导航中语义歧义和感知模型误差会被确定性地图放大、导致错误终止的问题,PSG-Nav保留对象语义分布构建3D概率场景图,并通过“多宇宙”采样在多个一致世界中评估地标效用,再用基于成功/失败记忆的EEC校准候选目标。其在MP3D、HM3D、HSSD上成功率达66.1%、44.8%、67.9%,并报告真实机器人验证。

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance Figure 1
2026-06-02cs.RO

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

2026-06-02机器人

面向突发横穿行人时,传统帧式感知的延迟、运动模糊和光照敏感会限制自动驾驶避障反应。DeepIPCv3将LiDAR的3D几何与DVS事件流结合,并用类Transformer跨模态注意力动态融合,再输出局部路点和控制命令。作者在自建昼夜多模态数据集上做离线评测,报告其轨迹与控制误差最低、在弱光下仍能执行转向或急停;但真实在线闭环安全性仍文中未充分说明。

OneVLA: A Unified Framework for Embodied Tasks Figure 1
2026-06-02cs.RO

OneVLA: A Unified Framework for Embodied Tasks

Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang, Hangjun Ye, Xiaojun Liang, Long Chen, Wenbo Ding

2026-06-02机器人

现有VLA模型多为导航或操作分别设计,跨任务方法也常依赖任务特定变体,限制通用机器人能力。OneVLA将导航与操作动作维度拼接到统一动作头,并用操作预训练、混合导航数据训练和CoT微调的渐进流程共享视觉语言表征。文中称其在仿真和真实环境的多项导航、操作基准上达到SOTA,并观察到联合训练带来双向增益,但具体增益来源可能与数据构造和训练规模有关。

Training-Free Imitation Learning with Closed-Form Diffusion Policies Figure 1
2026-06-02cs.RO

Training-Free Imitation Learning with Closed-Form Diffusion Policies

Raghav Mishra, Ian R. Manchester

Australian Center for Robotics, ARIAM Hub, and School of Aerospace, Mechanical and Mechatronic Engineering, University of Sydney

2026-06-02生成模型模仿学习

针对神经扩散策略在模仿学习中每轮数据收集后需长时间离线训练、拖慢部署迭代的问题,论文提出 Closed-Form Diffusion Policies:直接从有限示范数据的条件闭式 score 构造扩散策略,无需训练即可推理。实验显示其可在移动 CPU 上毫秒级控制机器人,推理约快于神经扩散策略 7 倍,并在低维模仿基准上接近需数小时训练的神经基线;同时可作为推理时编辑模块,用于策略引导和示范增强。

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning Figure 1
2026-06-02cs.RO

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

2026-06-02机器人视觉语言视觉感知强化学习规划控制

面向无人机视觉语言导航,论文关注自由语言意图到安全6-DoF飞行的落地难题,指出直接VLA动作回归易受几何不一致和动力学失配影响。ImagineUAV的核心思路是先用指令条件视频扩散世界模型“想象”未来第一视角,再由视觉里程计式动作提取器恢复相对位姿,并经 kinodynamic 规划生成可碰撞检查、动态可行的轨迹。实验称其在UAV-Flow上达到70.9%成功率并优于VLN/VLA基线,且完成真实飞行验证。

Coordinating Task Switching in a Robotics Multi-Agent System Using Behavior Trees Figure 1
2026-06-02cs.MA

Coordinating Task Switching in a Robotics Multi-Agent System Using Behavior Trees

Lucas Haug, Anarosa Alves Franco Brandão, Arthur Casals

LTI - Laboratório de Técnicas Inteligentes, Universidade de S a ~ \tilde{a} o Paulo, SP

2026-06-02机器人

该文针对 VSSS 三机器人足球中集中式调度随角色增多而使 FSM 难维护、难扩展的问题,将球队角色分配与实时任务切换重构为行为树,以提升模块化和响应性。作者在 FIRASim 中与原 FSM 策略对比,并参加学术竞赛验证;结果表明方案可用于动态多机器人协同,维护性与扩展性更好,但具体性能增益幅度文中未充分说明。

Time-Optimal Collision Avoidance Via a Greedy Polynomial Backward Sweep Figure 1
2026-06-02math.OC

Time-Optimal Collision Avoidance Via a Greedy Polynomial Backward Sweep

Zeno Pavanello, Frank De Veld, Roberto Armellin

Department of Aerospace Science and Technology (DAER), Politec-, Netherlands Aerospace Centre (NLR), Anthony Fokkerweg 2, Te Pu¯naha ¯Atea Auckland - Space Institute (TPA-SI), The Univer-, Earth-centered orbits has posed significant challenges for, lably, it can pose a threat of collision to nearby actively, RTN to Earth Centered Inertial (ECI), in which the state, [12]. B is centered on the secondary object

2026-06-02机器人

针对低推力卫星避碰中“最晚何时必须开始机动”比单纯省燃料更贴近运行需求的问题,论文提出从最近接时刻反向贪心叠加推力的时间最优 GTO 方法,并用微分代数把碰撞风险对控制的影响多项式化、在线修正 TCA。大规模交会测试显示,其在错失距离和碰撞概率指标下接近最优控制基准,仅有小幅最优性损失,计算时间适合星上实现。

Tether-Aware Dynamic Collision Avoidance for USV-HROV Systems Figure 1
2026-06-02cs.RO

Tether-Aware Dynamic Collision Avoidance for USV-HROV Systems

Yang Gu, Ziyang Hong, Xuanlin Chen, Hao Wei, Cheng Wang, Shujie Yang, Yulin Si

2026-06-02机器人

面向近岸海缆巡检中USV跟踪HROV时会遇到来船、且脐带缆可能被船体刮碰或因避障被拉紧的问题,论文用缆绳与障碍船的三维椭球包络投影构造“缆绳安全”平面域,并在速度障碍法中加入放缆/缆长裕度约束,再与LOS跟踪融合。Gazebo仿真显示该方法能避开动态船只,同时保持缆绳域正间隔并降低拉紧风险,但尚缺水池或实船验证。

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry Figure 1
2026-06-02cs.RO

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma

ShanghaiTech University, Shanghai Jiao Tong University, The Chinese University of Hong Kong

2026-06-02强化学习

高频机器人控制中,扩散/流策略的多步采样延迟高,而一阶段策略又容易丢失中间纠错信号。本文提出 IDP,不显式估计不稳定的 drifting 向量场,而从相似观测下专家动作的局部变化提取条件几何,并与全局几何对比来加权势能损失,训练单步生成器贴近有效动作流形。实验覆盖 2D、3D 与真实操作任务,显示其优于显式 drifting 变体,并与强一阶段基线竞争。

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA Figure 1
2026-06-02cs.RO

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA

Hung Mai, Bin Zhu, Tuan Do

National Economics University, Vietnam, Singapore Management University, Phenikaa University, Vietnam

2026-06-02机器人

本文关注 WAM 的未来预测是否真的带来超越任务成功率的可控行为改进,而非仅增加生成模块。作者提出模型无关诊断框架,结合 rollout 行为指标与稀疏自编码器特征分析,评估动作一致性、目标进展、干扰物扰动和表征的预测性。LIBERO 与 RoboTwin2.0 上 7 类策略结果显示,WAM 常提升目标选择和物体级行为,但收益依赖架构且推理成本更高;顺序式 WAM 的预测表征最清晰,联合式易纠缠,辅助式会压缩未来信息。

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs Figure 1
2026-06-02cs.RO

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

Jianing Qian, Qinhe Peng, Emmanuel Panov, Leonor Fermoselle, Dinesh Jayaraman, Bernadette Bucher, Tarik Kelestemur

University of Pennsylvania, RAI Institute, University of Michigan

2026-06-02机器人模仿学习

这篇论文针对移动操作等大空间、长时序任务中的部分可观测问题:机器人常需利用视野外或较早观察到的物体信息。作者将任务相关场景图作为显式结构化记忆,动态维护物体节点、空间位置与可见性,并作为模仿学习策略输入,而非依赖完整稠密地图或隐式时序记忆。仿真移动操作和真实桌面实验显示,该方法在需要长期推理和遮挡/视野受限的设置下显著提升策略成功率;但性能依赖可靠的目标识别与跟踪,复杂动态场景下仍可能受限。

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation Figure 1
2026-06-02cs.RO

Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation

Zijia Chen, Yuenan Hou, Xinhua Jiang, Yu Li, Weijie Li, Li Liu

College of Electronic Science and Technology, National University of Defense Technology, Shanghai AI Laboratory

2026-06-02机器人规划控制

本文针对少样本机器人操作中视觉、语言与轨迹表征混用导致的模态干扰,以及传统 MoE 路由在数据稀缺时易专家塌缩的问题,提出 MATE:用多模态 MoE 做子 token 级特征解耦,引入跨模态余弦路由削弱尺度偏置,并用温度与噪声稳定专家分配。在 LIBERO 少示范设置下平均成功率较轨迹引导基线提升 4.75%,LIBERO-Long 提升 8.83%,真实乒乓实验显示轨迹预测可辅助执行。

Robust Integrated Planning and Control for Quadrotors in Dynamic Environments via NMPC with CBF Penalties Figure 1
2026-06-02cs.RO

Robust Integrated Planning and Control for Quadrotors in Dynamic Environments via NMPC with CBF Penalties

Zeinab Shayan, Mohammadreza Izadi, Reza Faieghi

2026-06-02规划控制安全鲁棒

面向四旋翼在动态障碍、输入受限和风扰下规划与控制分层易失效的问题,论文将NMPC用于一体化规划控制,并把CBF改写为指数型软惩罚以缓解硬约束导致的不可行,同时结合高增益扰动观测器和Kalman障碍预测。Gazebo与实机对比显示,其相较常规NMPC和硬CBF-NMPC在可行性、避障平滑性与抗扰跟踪上更稳健。

Position: Good Embodied Reward Models Need Bad Behavior Data Figure 1
2026-06-02cs.RO

Position: Good Embodied Reward Models Need Bad Behavior Data

Ran Tian, Yilin Wu, Andrea Bajcsy

2026-06-02强化学习

面向机器人后训练、测试时选择和评估中日益关键的具身奖励模型,论文指出当前数据过度偏向成功示范,导致模型缺乏对失败、危险和投机行为的校准。作者用 RoboArena 人类标注评测三个 SOTA 奖励模型,发现它们会系统性高估低质量执行、不安全交互和表面完成任务的捷径,且任务越复杂偏差越大;少量真实失败视频作为上下文示例即可改善人类偏好一致性并减少高代价误报。

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation Figure 1
2026-06-02cs.RO

$τ_0$-WM: A Unified Video-Action World Model for Robotic Manipulation

Pengfei Zhou, Shengcong Chen, Di Chen, Jiaxu Wang, Rongjun Jin, Bingwen Zhu, Yike Pan, Songen Gu, Kuanning Wang, Shufeng Nan, Xingyu Qiu, Chenhao Qiu, Pu Yang, Yunuo Cai, Jianxiong Gao, Yifan Li, Yanwei Fu, Xiangyu Yue, Zhi Chen, Jianlan Luo

Shanghai Innovation Institute 2 AGIBOT Finch

2026-06-02机器人视觉感知强化学习

面向机器人操作中“动作可执行但难预判后果、视频模型懂动态却缺少机器人动作 grounding”的矛盾,τ₀-WM 将策略、视频预测和动作评估统一到共享视频扩散世界模型中,用异构数据和模态掩码联合训练,并在测试时采样、重去噪排序与模拟器纠偏。实验显示其在长程和精细操作任务上优于相关基线,异构预训练与测试时计算均带来增益。

AI-IoT-Robotics Integration: Survey of Frameworks, Emerging Trends, and the Path Toward Connected Robotics Figure 1
2026-06-02cs.RO

AI-IoT-Robotics Integration: Survey of Frameworks, Emerging Trends, and the Path Toward Connected Robotics

Ranulfo Bezerra, Satoshi Tadokoro, Kazunori Ohno

2026-06-02机器人

针对AIoT、IoRT等二元融合难以闭合“感知—认知—行动”回路的问题,本文系统梳理AI、IoT与机器人三元集成研究,提出按集成深度分类的视角和模块化架构,强调边缘SLM与云端LLM协同的分布式智能。主要结果是归纳互操作、反馈控制、数据融合与安全等瓶颈,并将Connected Robotics与Physical AI定位为后续路线;文中未充分说明实证性能增益。

GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping Figure 1
2026-06-02cs.RO

GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping

Beining Han, Yu-Wei Chao, Erwin Coumans, Clemens Eppner, Balakumar Sundaralingam, Jia Deng, Stan Birchfield, Adithyavairavan Murali

Princeton University

2026-06-02生成模型

该文针对6-DOF抓取模型换夹爪即需重训、难以跨本体迁移的问题,提出GraspGen-X:在扩散式抓取生成与判别器中显式条件化夹爪表示,并用手指闭合的扫掠体积编码夹爪,结合程序化夹爪生成20亿仿真抓取数据训练。实验显示其在新物体、新真实夹爪上零样本优于重定向、GraspGen和AnyGrasp,也可作为新夹爪微调的更好初始化;部分增益可能主要来自大规模数据与程序化分布。

OSCAR: Obstacle Survival Curves for Adaptive Robot Navigation Figure 1
2026-06-02cs.RO

OSCAR: Obstacle Survival Curves for Adaptive Robot Navigation

Hshmat Sahak, Aoran Jiao, Nicholas Rhinehart, Tim Barfoot

University of Toronto, Canada

2026-06-02机器人

本文针对图路线导航中临时障碍带来的“等还是绕”决策:人可能很快离开,推车/椅子却可能长期占道。OSCAR 将障碍清除时间建模为按类别条件化的生存曲线,并利用右删失观测在线更新,再把障碍记忆转化为时间依赖边代价来计算等待阈值。仿真中少于每类 20 次观测即可接近真分布 oracle 1% 内并优于启发式基线,真实中庭机器人 50 次任务也显示阈值能随经验改进。

Make Your VLA More Robust Without More Data By Interleaving Motion Planning Figure 1
2026-06-02cs.RO

Make Your VLA More Robust Without More Data By Interleaving Motion Planning

Dan BW Choe, Sundhar Vinodh Sangeetha, Samuel Coogan, Shreyas Kousik

Georgia Institute of Technology, All authors are with the Georgia Institute of Technology, Atlanta, GA, USA

2026-06-02强化学习规划控制安全鲁棒

论文针对长程移动操作中端到端 VLA 易因导航、空间定位和子任务顺序错误而累积失败的问题,提出 MPVI:在无需新增训练数据的情况下,将开放词汇目标检测、前沿探索和经典运动规划与 VLA 交替使用,并用本体触发的 VLM 完成检查控制模块切换。在 BEHAVIOR-1K 上相较强 VLA 基线任务进度提升 113%,但对精细操作瓶颈任务帮助有限。

Threading Optimization for Vision-Language-Action Model Inference in Low-Cost Smart Agricultural Manipulation Figure 1
2026-06-02cs.RO

Threading Optimization for Vision-Language-Action Model Inference in Low-Cost Smart Agricultural Manipulation

Keith Truongcao, Christopher Nhu, Zijian An, Phong Nguyen, Siwei Cai, Lifeng Zhou

∗ Equal contribution † \dagger Corresponding authorDepartment of Electrical Engineering, Drexel University, Philadelphia, USA

2026-06-02机器人视觉语言视觉感知优化算法

本文针对VLA模型在低成本农业机械臂上推理慢、控制抖动和难以细粒度修正的问题,将RTAC从伪代码落到Fairino FR5实体系统,核心是用进程/线程化的生产者—消费者架构解耦策略推理与动作执行,并绕开Python GIL带来的阻塞。实验在大蒜、核桃操作任务上显示,相比基础RTAC实现,任务完成时间和控制稳定性均有改善,但具体增益数值文中片段未充分说明。

Generative Multi-Robot Motion Planning via Diffusion Modeling with Multi-Agent Reinforcement Learning Guidance Figure 1
2026-06-02cs.RO

Generative Multi-Robot Motion Planning via Diffusion Modeling with Multi-Agent Reinforcement Learning Guidance

Suk Ki Lee, Venkata Sai Deepak Mutta, Hyunwoong Ko

2026-06-02机器人生成模型强化学习规划控制

多机器人共享空间中,集中式规划难扩展、去中心化生成又易产生轨迹冲突。本文用单机器人扩散模型为各机器人独立采样轨迹,并在反向去噪时引入 MARL 训练的集中式价值函数梯度,以推高多智能体回报而无需重训生成模型或联合建模。四机器人迷宫实验中,智能体干扰率由 55.4% 降至 41.8%,但障碍物近距率上升,说明协调增益伴随贴近边界的权衡。

A Machine-to-Machine Knowledge-Guided LLM Agent for Generalizable Radiotherapy Treatment Planning Figure 1
2026-06-02cs.RO

A Machine-to-Machine Knowledge-Guided LLM Agent for Generalizable Radiotherapy Treatment Planning

Md Mainul Abrar, Xun Jia, Yujie Chi

2026-06-02规划控制

放疗计划中上层治疗参数仍依赖人工试错,限制效率和泛化。本文将DRL在前列腺计划中探索到的TPP分布作为机器到机器知识,通过上下文学习注入LLM代理,使其在物理可行参数空间内自主迭代。实验覆盖基础/复杂前列腺和肝脏场景,指导版均达到最优评分,并将迭代次数由约12–20步降至2–6步,显示跨部位、OAR配置和初始质量的稳健迁移。

GABI: Geometry-Aware Boundary Integration for Spacecraft Segmentation Figure 1
2026-06-02cs.CV

GABI: Geometry-Aware Boundary Integration for Spacecraft Segmentation

Iason Georgios Velentzas, Dhruv Ahuja, Panagiotis Tsiotras

Georgia Institute of Technology

2026-06-02视觉感知学习理论

空间强光照、阴影和背景变化使航天器分割难以跨目标泛化,而机载系统又要求模型轻量。GABI 的核心是从已有掩码生成连续距离场,在卷积分割网络中加入辅助预测头与边界调制,用几何边界关系约束纹理特征学习。实验显示其在 SPARK 上较基线 AP 最高提升约 5%,泛化实验 AP 提升超过 50%;轻量版接近重型 Transformer 指标且小约 10 倍,重型版则超过 Transformer 且仍更轻。

From Cues to Horizons: Dynamic Risk Horizon Profiling for Trajectory Prediction Figure 1
2026-06-02cs.RO

From Cues to Horizons: Dynamic Risk Horizon Profiling for Trajectory Prediction

Xinyi Ning, Zilin Bian, Dachuan Zuo, Semiha Ergan, Kaan Ozbay

2026-06-02规划控制安全鲁棒

本文针对现有风险感知轨迹预测多把历史风险当作辅助输入、忽略未来风险演化与不确定性的问题,提出动态风险 horizon profiling:用可学习风险势场估计周车时空接近性,并通过端点粗预测和 horizon 重要性注意力刻画不同未来时刻的关键风险。方法在 highD 与 SHRP2 上验证,5 秒预测相较基线分别降低 highD RMSE 25.0% 和 SHRP2 minFDE 29.1%。

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning Figure 1
2026-06-02cs.RO

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

Georgia Institute of Technology

2026-06-02生成模型规划控制

论文针对短时域扩散先验拼接成长时域计划时“局部一致但全局不连贯”的问题,提出 CoFi 推理采样器:先让各局部去噪估计对齐到共享粗结构形成全局脚手架,再加噪到中间层并用同一局部先验细化细节。实验覆盖机器人长程规划、全景图和长视频生成,较组合扩散基线提升全局连贯性与局部质量,并减少约 2–8 倍去噪器调用。

SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models Figure 1
2026-06-02cs.RO

SafeVLA-Bench: A Benchmark for the Success-Safety Gap in Vision-Language-Action Models

Jialiang Fan, Weizhe Xu, Oleg Sokolsky, Insup Lee, Fanxin Kong

University of Notre Dame, University of Pennsylvania

2026-06-02视觉语言视觉感知数据集/基准安全鲁棒

论文指出现有 VLA 操作基准只看任务是否完成,容易掩盖碰撞、扰动物体、抓取不稳等成功轨迹中的安全问题。SafeVLA-Bench 作为后验评测层,用任务相关 STL 规范和 SBU/VSI 指标同时衡量“成功但不安全”的频率与严重度,并接入 LIBERO、RoboCasa-365。实验显示高成功率并不等于安全:LIBERO 高 SR 方法仍有 13–15% 不安全回合,RoboCasa 成功回合中 36–56% 违反至少一条安全约束。

No Figure
2026-06-02cs.RO

STEM: Semantic Target Search and Exploration using MAVs in Cluttered Environments

Nikhil Sethi, Max Lodel, Laura Ferranti, Robert Babuška, Javier Alonso-Mora

2026-06-02机器人

面向搜救等任务中微型无人机在未知、杂乱三维环境里受续航、遮挡和传感范围限制而难以快速找目标的问题,STEM将语义目标搜索与覆盖式探索结合:把已观测物体的语义优先级传播到邻近前沿体素,并用组合式视点评规划在目标相关性与探索收益间权衡,也可接入LLM相似度作为先验。仿真和真实MAV实验显示其比基线更快发现目标,同时保持合理探索时间并能应对语义不确定性。

Beyond Pure Sampling: Hybrid Optimization Mechanisms for Non-Convex Model Predictive Control Figure 1
2026-06-02cs.RO

Beyond Pure Sampling: Hybrid Optimization Mechanisms for Non-Convex Model Predictive Control

Yuichiro Aoyama, Minchan Jung, Akash Ratheesh, Evangelos A. Theodorou

1 affiliationmark: School of, Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA, USA, 2 affiliationmark: Development Division, Komatsu Ltd., Tokyo, Japan, 3 affiliationmark: Department of Electrical and Computer Engineering, Inha University, Incheon, Republic of Korea

2026-06-02规划控制优化算法

针对非凸MPC中DDP易陷局部极小、纯采样MPPI又收敛慢且控制噪声大的问题,论文用最大熵DDP解释并构造“先梯度利用、再按动作价值逆Hessian采样扰动”的混合机制,分析单峰、多峰与Stein变体。四类拥挤导航基准显示其在低维任务优于MPPI,高维任务速度偶逊于MPPI激进探索但成功率更稳,并以四旋翼实验证实可部署性。

Infeasible optimization problems and the hierarchical augmented Lagrangian method in imitation learning Figure 1
2026-06-02cs.RO

Infeasible optimization problems and the hierarchical augmented Lagrangian method in imitation learning

Roland Andrews, Justin Carpentier, Ajay Sathya

2026-06-02模仿学习优化算法

论文关注带硬安全/稳定约束的模仿学习在约束不可行时会导致训练不稳定的问题,指出专家数据、动力学/形态差异或过严安全阈值都可能造成不可行。核心做法是引入分层增广拉格朗日方法,并用不可行优化理论解释其行为:即使原约束无解,训练也会趋向“最接近可行”的约束模仿学习解。作者在含总加速度与行人安全约束的玩具驾驶任务中展示了该现象和方法的安全策略效果,但实验规模较小。

BEVIO: Efficient Bird's-Eye-View based Sparse-Update Visual-Inertial Odometry for Lunar Day-Night Navigation Figure 1
2026-06-02cs.RO

BEVIO: Efficient Bird's-Eye-View based Sparse-Update Visual-Inertial Odometry for Lunar Day-Night Navigation

Mohit Singh, Shehryar Khattak, Ashish Goel, Michael Paton, Kostas Alexis, Issa A. Nesnas

2026-06-02机器人

面向月球车在算力、能耗受限且昼夜/自照明导致低帧率视觉更新困难的导航需求,BEVIO将场景自适应鸟瞰视角特征匹配接入xVIO前端,以提升大基线相邻图像的内点匹配稳定性。仿真与半尺度ERNEST野外昼夜实验显示,其可在低至0.25 Hz、约1 m图像间距下保持可靠VIO,相比尺度补偿后的毅力号基线约有两倍提升。

Shape Your Body: Value Gradients for Multi-Embodiment Robot Design Figure 1
2026-06-02cs.RO

Shape Your Body: Value Gradients for Multi-Embodiment Robot Design

Nico Bohlinger, Jan Peters

Technical University of Darmstadt, Germany, Robotics Institute Germany (RIG), German Research Center for AI (DFKI)

2026-06-02机器人优化算法

机器人形态与控制强耦合,传统协同设计需为每个候选硬件反复训练强化学习,难以扩展。本文将多形态通用策略中的价值函数冻结为可微设计代理,用价值梯度在信赖域内优化连续形态参数。实验覆盖四足、人形、六足等最多50个机器人和1100余维参数,能在低边际成本下改进扰动或未见设计,并定位限制性能的执行器、质量和控制增益参数。

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models Figure 1
2026-06-02cs.RO

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

2026-06-02强化学习

该文针对具身视频世界模型逐帧生成长时操作 rollout 计算昂贵、但简单丢帧会漏掉接近、接触、抓取等关键事件的问题,提出 SKIP:用机器人感知的多模态特征选取事件保留关键帧,仅扩散生成稀疏帧,再用间隔预测与动作条件插值重建密集视频。LIBERO 上相对密集 Wan 2.2 快 4.16 倍、FVD 降 89%,生成数据完全替代真实示范时 π0.5 成功率仅小幅下降,优于密集生成基线。

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion Figure 1
2026-06-02cs.RO

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion

Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

Tongji University, Shanghai, China, Shanghai Innovation Institute, Shanghai, China, Shanghai Jiao Tong University, Shanghai, China, Humanoid Robot (Shanghai) Co., Ltd., Shanghai, China

2026-06-02机器人

论文针对人形机器人在稀疏落脚点和狭窄障碍环境中既需全局地形判断又需精确落脚的问题,提出 GLAD 地形编码器,将机器人中心高程图经 CNN 后分解为全局注意力上下文分支与状态条件局部注意力落脚分支,避免细粒度线索被混合稀释。实验显示其可通过踏石、楼梯、宽沟和障碍密集地形,并在 Unitree G1 上用机载 LiDAR 实现零样本仿真到现实迁移。

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation Figure 1
2026-06-02cs.RO

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

2026-06-02机器人

面向无预建地图、物体会被移动且 SLAM 位姿会修正的室内移动操作,DREAM 将激光-惯性-视觉 SLAM、动态时空语义体素记忆和混合目标重定位闭环集成;其关键在于位姿图感知的历史观测重积分与冗余记忆剪枝,并结合语言 3D 检索、开放词汇检测和 mLLM 验证。四个真实动态实验中,长期任务成功率较 DynaMem 从 40%–60% 提升到 55%–70%,内存与在线更新时间保持有界。

Edge-Based QoS-Aware Adaptive Task Placement: A Closed-Loop Control in Multi-Robot Systems Figure 1
2026-06-02cs.OS

Edge-Based QoS-Aware Adaptive Task Placement: A Closed-Loop Control in Multi-Robot Systems

Thien Tran, Jonathan Kua, Thuong Hoang, Minh Tran, Honghao Lyu, Jiong Jin

Deakin University, Australia, RMIT University, Vietnam, Zhejiang University, China, Swinburne University of Technology, Australia

2026-06-02机器人规划控制

面向多机器人将感知任务卸载到边缘时易受网络抖动和资源竞争影响的问题,本文搭建树莓派闭环视觉伺服测试床,并提出按延迟、CPU 利用率和切换开销打分的 QoS 感知自适应任务放置控制器。实验显示,静态卸载虽降本地负载但会放大尾延迟和超期率,而 ATP 能在 CPU 压力与网络故障间切换本地/边缘执行,将违约率稳定压在约 5% 阈值内。

A Four-Tier Communication Architecture and Sim-to-Real Validation of a Graphical Open-Source Platform for Robotic Engineering Education Figure 1
2026-06-02cs.HC

A Four-Tier Communication Architecture and Sim-to-Real Validation of a Graphical Open-Source Platform for Robotic Engineering Education

Thien Tran, Khang Duong, Minh Tran, Jonathan Kua, Thuong Hoang, Jiong Jin

Deakin University, Australia, RMIT University, Vietnam, Swinburne University of Technology, Australia

2026-06-02机器人

论文针对高校机械臂教学中商业数字孪生成本高、流程僵化,而 ROS 又对新手门槛过高的问题,提出 GOSP 的四层通信架构:用 Blender 可视化建模,经 Python 中间件封装序列化、路由与 ROS 通信,再连接仿真和实体端。初步 sim-to-real 多轴轨迹验证显示物理执行误差约 ±2.5 mm、无关键延迟或坐标错位,说明该硬件无关管线可支撑低成本、可迭代的机器人课程,但教学效果仍待后续人因评估。

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking Figure 1
2026-06-02cs.RO

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking

Junnan Nie (1), Jiayi Li (2), Jiachen Zhang (1), Junyi Lao (1), Chenghao Liu (1), Tianle Zhang (2), Songfang Huang (1) ((1) Peking University, (2) JD Explore Academy)

Peking University., JD Explore Academy

2026-06-02机器人

本文关注动作分块机器人策略部署时被忽视的执行窗口选择问题:固定执行步长在不同任务上成功率非单调且难迁移。PACE的核心洞察是操作轨迹存在阶段性运动结构,可用预测动作块速度曲线中的低速谷值作为重规划边界,从而无需训练、无需访问策略内部即可在线决定执行前缀。实验显示其在50个RoboTwin2.0任务上将平均成功率从57.8%提升到64.2%,真实ALOHA/Franka上成功率从50.7%提升到70.4%。

DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning Figure 1
2026-06-02cs.RO

DriveAnchor: Progressive Anchor-based Flow Learning for Autonomous Driving Planning

Limin Yan, Haoyun Tang, Yutao Qiu, Hongqing Liu, Haoyu Xu

Xi’an Jiaotong University, Beijing Institute of Technology

2026-06-02生成模型规划控制

面向自动驾驶中流匹配规划缺少结构化多样性、在线可控性和安全优化的问题,DriveAnchor将轨迹锚点词表作为生成先验,用几何能量场按走廊重定位锚点,并以零阶RL在锚点空间优化碰撞奖励。约200万内部场景上近距碰撞率降89%、平均奖励升32%,Orin推理2.06ms;但未做公开基准评测,泛化判断受限。

PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation Figure 1
2026-06-02cs.RO

PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation

Haofan Cao, Zhaoyang Li, Zhichao You, Liang Guo, Tianrui Li

Southwest Jiaotong University, University of Leeds

2026-06-02机器人视觉语言视觉感知

面向插接等富接触操作,论文指出低频 VLA 动作难以直接承担力敏感控制,关键瓶颈在语义到接触控制接口。PaCo-VLA 将模型输出改为语义绑定、阶段与导纳参数提案,再由独立的无源性屏蔽器通过能量罐、参数投影、力/时序检查生成实际命令。仿真与真实连接器、充电枪实验显示其较未屏蔽 VLA 和直接动作基线精度更高,并在对抗性柔顺变化下保持零无源性违规。

A passive universal grasping mechanism based on an everting shell Figure 1
2026-06-02cs.RO

A passive universal grasping mechanism based on an everting shell

Mythra V. S. Balakuntala, Safvan Palathingal, G. K. Ananthasuresh

2026-06-02机器人

针对通用被动夹爪在无需复杂控制下适应不同形状物体的需求,论文提出一种单体柔顺机构:以可翻转双稳态壳作为开闭触发核心,并连接分布柔顺抓取臂形成包络式抓取。作者用 Abaqus 分析余弦旋转壳的力—位移双稳态特性,设计出可手动驱动的原型,并通过 3D 打印样机做初步抓取试验;结果表明其可抓取一定尺寸和重量范围内的刚性物体,但实验规模和定量性能文中未充分说明。

Adaptive PD Gains for Energy-Conscious Control in Physical Human-Robot Interaction Figure 1
2026-06-02cs.RO

Adaptive PD Gains for Energy-Conscious Control in Physical Human-Robot Interaction

Danyal Saqib, Francisco Andrade Chavez, Marie Charbonneau

2026-06-02机器人规划控制

面向物理人机交互中力/力矩传感依赖和能量安全约束难落地的问题,论文将能量限制嵌入传统 PD 控制:当机器人动能或势能接近预算时自适应调整增益,并用可调耗散函数控制截止阈值与变化陡度。作者给出 Lyapunov 稳定条件,并在 PAL Robotics TALOS 的仿真与硬件实验中验证了能量受限和受外力时的柔顺行为。

ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement Figure 1
2026-06-02cs.RO

ROG-Grasp: Root-Oriented Geometry for Robotic Grasping and Placement

Zijian An, Augustus Sroka, Ran Yang, Bill Cai, Satoru Eto, Brian Poon, Kelvin Cai, Shijie Geng, Feng Liu, Yiming Feng, Lifeng Zhou

2026-06-02机器人

面向采后分拣包装中“抓起后还要按固定朝向放置”的需求,ROG-Grasp利用番茄、洋葱等根/茎部近似平面的几何先验:先用YOLO定位根部,再从RGB-D点云拟合平面法向,生成抓取姿态并通过笛卡尔路点完成朝向约束放置。实验显示其在单物体和杂乱场景中成功率约80–90%,执行约7–8秒,明显优于训练的VLA策略。

Literary Emotions in Motion: A Soft Robotics Installation for Tactile Storytelling Figure 1
2026-06-02cs.RO

Literary Emotions in Motion: A Soft Robotics Installation for Tactile Storytelling

Carolina Silva-Plata, Abraham Villavicencio-Carmona, Miguel Silva Plata, Stefan Escaida, Ruben Fernandez

2026-06-02机器人

这篇论文面向艺术化软机器人中情感表达过度依赖视觉/听觉的问题,探索把叙事文本的语义情绪转化为可触摸的刚度变化。其核心做法是用语言模型从六类情绪中选出主次情绪,驱动七个六边形排布的硅胶气动模块,并通过薄膜结构扩大低成本执行器的刚度范围。机械表征和10人用户研究显示,刚度调制结合LED颜色/亮度能让参与者较一致地感知预设情绪,但样本规模较小,感知可靠性仍需更严格验证。

SoFiE: Soft Finger Exoskeleton for Intelligent Grasping Figure 1
2026-06-02cs.RO

SoFiE: Soft Finger Exoskeleton for Intelligent Grasping

Magnus Malthe Sigsgaard Nielsen, Nicklas Nikolaj Grønvall, Xiaofeng Xiong, Saravana Prashanth Murali Babu

2026-06-02机器人

针对关节炎、损伤或老化导致的手功能下降,SoFiE 以轻量、可定制的软式食指外骨骼辅助抓握。其核心是柔性 3D 打印模块、腱驱动无绳执行,以及兼具被动回弹和本体感知的 StretchSense、用于触觉/顺应性估计的 MagSense。实验显示其可估计手指姿态、区分不同硬度材料,并在多种日常物体抓握中产生可分辨的传感特征。

Behavior Cloning of MPC for 3-DOF Robotic Manipulators Figure 1
2026-06-02cs.RO

Behavior Cloning of MPC for 3-DOF Robotic Manipulators

Theo Guegan, Dexter Wen Jie Teo

University of Waterloo, lable environment for testing and evaluating the proposed, This work was conducted during an exchange program at University of, Teo is currently with Nanyang Technological University, Singapore, and, Code available : https://github.com/theguega/neural-mpc

2026-06-02机器人模仿学习规划控制

针对 MPC 在实时与嵌入式机械臂控制中计算开销过高的问题,论文用 IK+MPC 生成 MuJoCo 中 3-DOF 机械臂示范数据,并以行为克隆训练多种静态与时序网络替代控制器。关键洞察是该任务当前关节状态已近似满足马尔可夫性,深层 MLP 优于 GRU/滑窗模型。结果显示推理延迟约降至 1ms、约 3 倍加速,宽松容差成功率 84.98%,但严格精度下仍有约 2.9cm 末端误差,终端稳态误差尚未解决。

Constrained Whole-Body Tracking for Humanoid Robots Figure 1
2026-06-02cs.RO

Constrained Whole-Body Tracking for Humanoid Robots

Daniel Morton, Pranit Mohnot, Marco Pavone

Stanford University

2026-06-02机器人视觉感知

论文针对人形机器人RL全身跟踪在部署时难以满足训练后新增安全约束的问题,提出 ConstrainedMimic:在运动重定向、已重定向参考和策略输出三个位置引入基于全身接触约束动力学/运动学的CBF安全滤波,并保持任务一致以减少干预。仿真Unitree G1实验显示可处理自碰/外障碍避让、关节限位与质心稳定约束,CPU/GPU/TPU上可达300–500Hz,但真实硬件与感知不确定性仍未充分验证。

FAIR^2 Drones: An AI-Ready Standard for Cross-Domain Wildlife Drone Datasets Figure 1
2026-06-02cs.RO

FAIR^2 Drones: An AI-Ready Standard for Cross-Domain Wildlife Drone Datasets

Jenna Kline, Kilian Meier, Vandita Shukla, Edouard G. A. Rolland, Elena Iannino, Lucie Laporte-Devylder, Constanza Andrea Molina Catricheo, Blair Costelloe, Elizabeth Campolongo, Henrik S. Midtiby, Devis Tuia, Benjamin Risse, Ulrik P.S. Lundquist, Anders Lyhne Christensen, Fabio Remondino, Thomas Richardson, Tanya Berger-Wolf

The Ohio State University, Department of Computer Science and Engineering, Columbus, OH, USA, School of Civil, Aerospace and Design Engineering, University of Bristol, Bristol, United Kingdom, Computer Vision and Machine Learning Systems Group, Institute for Geoinformatics, University of Muenster, Unmanned Aerial Systems Center, University of Southern Denmark, Odense, Denmark, Department of Collective Behavior, Max Planck Institute of Animal Behavior, Konstanz, Germany, Department of Biology, University of Konstanz, Konstanz, Germany, Department of Biology, University of Southern Denmark, Odense, Denmark, Environmental Computational Science and Earth Observation laboratory, Ecole Polytechnique F´ed´erale de, the scientific return on investment for costly field deployments and accelerates cross-domain collaboration in environmental, operations also depend on close collaboration with local experts to ensure animal welfare [6]. Even short field campaigns can, their original purpose, constraining interdisciplinary collaboration and slowing progress., associated labels, metadata describing how data was collected and processed is essential for reproducibility and secondary

2026-06-02数据集/基准

野生动物无人机数据采集成本高,但现有数据集常只服务生态、机器人或视觉单一社区,缺少可复用元数据。论文提出 FAIR² Drones 标准,将 FAIR²、Darwin Core 与数据集卡结合,统一平台、传感器、任务、标注、伦理和多模态链接字段,并给出验证工具与参考实现;主要结果是形成可检查的九模块模板,支持生态分析、机器人复现实验和视觉基准,但文中未充分说明其在真实社区中的采用效果。

Belief Consistency Between Foundation-Model Evidence and Geometric Perception in Persistent Robotic Maps Figure 1
2026-06-02cs.RO

Belief Consistency Between Foundation-Model Evidence and Geometric Perception in Persistent Robotic Maps

Christoffer Heckman, Harel Biggie, Brendan Crowe, Nicholas Roy

2026-06-02机器人

针对机器人持久地图中几何感知较可验证、而基础模型语义证据未校准且可能与当前观测冲突的问题,论文提出在贝叶斯更新前加入按类别校准的提交门和逐事件冲突丢弃窗口,只接受与几何通道一致且可靠的声明。在 KITTI-360、ScanNet 上,相比仅校准融合显著提升地图精度,KITTI 平均类 IoU 由 0.180 到 0.522,is_car 提交精度达 99.7%,并在替换 VLM 和使用 Mask2Former 几何通道时保持稳定。

DRL-Based Pose Control for Double-Ackermann Robots Under Actuation Uncertainties Figure 1
2026-06-02cs.RO

DRL-Based Pose Control for Double-Ackermann Robots Under Actuation Uncertainties

Oussama Zaim, Mélodie Daniel, Aly Magassouba, Miguel Aranda, Olivier Ly

*These authors contributed equally. 1 Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, F-33400 Talence, France. 2 School of Computer Science, University of Nottingham

2026-06-02机器人强化学习规划控制三维

本文针对双阿克曼四轮转向机器人在泊车、对接等任务中需同时控制位置与朝向、且仿真到真实受执行器延迟和加速度限制影响的问题,将 ManeuverNet 从位置控制扩展到完整位姿控制,并用 sim-to-sim-to-real 将 Gazebo 中观察到的执行不确定性注入 PyBullet 训练。结果显示,朴素策略在严格条件下由 PyBullet 100% 成功率跌至 Gazebo 25%,改进后 Gazebo 最高达 92%、严格阈值下 69%,并可无额外调参迁移到真实机器人。

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM Figure 1
2026-06-02cs.RO

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM

Yuhao Zhang, Yifu Tao, Frank Dellaert, Maurice Fallon

2026-06-02三维

ScaRF-SLAM针对几何基础模型直接参与跟踪易受深度误差和不确定性影响的问题,主张将经典特征SLAM负责低延迟位姿估计、GFM仅用于稠密建图,并通过关键帧子图、帧间/子图尺度优化和投影式点云融合保持尺度一致。实验引入楼宇级室内数据集并在室内外评测,轨迹精度优于GFM式SLAM,重建精度较已有方法提升约10%–20%,室内约达每10米2厘米误差。

Predicted-Flow Control Barrier Functions for Real-Time Safe Optimal Control Figure 1
2026-06-02eess.SY

Predicted-Flow Control Barrier Functions for Real-Time Safe Optimal Control

Amirsaeid Safari, Jesse B. Hoagg

Department of Mechanical and Aerospace Engineering, University of Kentucky, Lexington, KY 40506 USA

2026-06-02生成模型规划控制安全鲁棒

针对传统控制障碍函数在输入约束下难以构造且只看当前状态、容易短视的问题,论文提出预测流控制障碍函数,将安全证书作用于有限时域内的预测轨迹,并通过终端备份安全集与规划时间平移保证凸优化可行。其 FlowBarrier 在密集环境非完整地面机器人100次试验中实现零安全违规,相比NMPC和两类CBF滤波器有更高到达率和更低计算时间。

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement Figure 1
2026-06-02cs.CV

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

Carnegie Mellon University, University of Washington, Stanford University, Video results are available at the project website: https://junwon.me/StressDream/.

2026-06-02视觉感知强化学习数据集/基准安全鲁棒

这篇论文针对视频世界模型在策略评估中只生成“常规未来”、容易漏掉低概率高代价失败的问题,提出 STRESSDREAM:在推理时优化扩散模型初始噪声,用 VLM 语义目标把视频引向文本指定的碰撞、洒落等事件,同时用典型集约束避免 OOD 幻觉。实验覆盖自动驾驶和机械臂,失败检测召回率由 54% 提升到 94%,并使 VLA 策略成功率由 39% 提升到 71%。

Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation Figure 1
2026-06-02cs.RO

Per-Group Error, Not Total MSE: Fine-Tuning Vision-Language-Action Models for 11-DoF Mobile Manipulation

Pau Montagut Bofi, Mario García Blasco, Tessa Pulli, Markus Vincze

2026-06-02机器人视觉语言视觉感知

面向 Toyota HSR 这类 11 自由度移动操作平台,论文指出将手臂、夹爪、头部和底盘动作合成总 MSE 会误导 VLA 微调选点。作者将误差按关节组分解,发现 SmolVLA 的瓶颈在底盘收敛慢,而 π0.5 仅微调动作头虽总 MSE 最低却损伤手臂精度;60 次真机实验中未微调的 π0.5 80k 得分最高,说明分组误差比总 MSE 更能预测部署表现。

HOIST: Humanoid Optimization with Imitation and Sample-efficient Tuning for Manipulating Suspended Loads Figure 1
2026-06-02cs.RO

HOIST: Humanoid Optimization with Imitation and Sample-efficient Tuning for Manipulating Suspended Loads

Songyang Liu, Shunyu Yao, Dingyuan Huang, Shuai Li

Department of Civil and Coastal Engineering, University of Florida

2026-06-02机器人模仿学习优化算法

面向建筑吊装等场景中人工近距离扶持悬挂重物的安全风险,HOIST将其建模为人形机器人全身接触操控欠驱动摆动物体的问题。方法先用VR遥操作示范微调高层VLA策略,再在固定全身控制器上通过少量批量RL rollout校正部署偏差,优化落点与停止行为。仿真和真机实验显示,相比纯VLA rollout,平移误差降低19.9厘米、角度误差降低3.56度,并优于仅模仿和增加示范基线。

Continuous Reasoning for Vision-Language-Action Figure 1
2026-06-02cs.RO

Continuous Reasoning for Vision-Language-Action

Yueh-Hua Wu, Tatsuya Matsushima, Kei Ota

2026-06-02视觉语言视觉感知

论文针对VLA中语言式推理与连续控制粒度不匹配的问题,提出把“推理”建模为可复用、可共享且与动作块对齐的连续潜变量接口:用WAE约束高斯“thought”空间,并通过EMA教师消费学生thought预测动作来做自验证。实验显示其在LIBERO-PRO鲁棒性上优于π0.5等基线,平均suite mean由58.0升至64.0;真实机器人TX-G2与HSR子任务成功率相对π0.5分别提升40.4%和26.3%。

Series-Parallel Integrated Nonlinear Elastic Actuator applied to the lean motion of a bicycle simulator Figure 1
2026-06-02cs.RO

Series-Parallel Integrated Nonlinear Elastic Actuator applied to the lean motion of a bicycle simulator

Christina Kohler, Michiel Plooij, Nuria Peña-Perez, Arend L. Schwab, Heike Vallery

Institute Germany (RIG)., Arend L. Schwab is with the Department of BioMechanical Engineering, Heike Vallery is with the Institute of Automatic Control, RWTH Aachen University, 52074 Aachen, Germany and with the Department of BioMechanical Engineering

2026-06-02机器人

面向自行车触觉模拟器的倾斜自由度,论文关注如何同时获得支撑骑手重力矩所需的高峰值扭矩与安全真实交互所需的低阻抗、精确力控。作者提出 SPINEA,通过电机与负载轴线错位的非线性传动,使同一弹性元件同时承担串联与并联弹性作用,无需离合或多套弹簧。原型实验显示其可被动支撑大倾角力矩,并在固定车架下实现约 4.25 Hz、载人骑行下约 4 Hz 的扭矩跟踪带宽。

Cuttlebot: a platform demonstration for complex, autonomous, bio-inspired swimmers Figure 1
2026-06-02cs.RO

Cuttlebot: a platform demonstration for complex, autonomous, bio-inspired swimmers

Alexander Nicholas White, Ang Leo Li, Alexander Yin, Derrick Roseman, Valeria Saro-Cortes, Hannah Wiswell, Aimy Wissa, Mihai Duduta

School of Mechanical, Aerospace, and Manufacturing Engineering, University of, Department of Mechanical and Industrial Engineering, University of Toronto, University of Connecticut, Institute of Materials Science, Department of Mechanical and Aerospace Engineering, Princeton University, the artificial muscles to controllably output force and torque in six axes. This work provides a

2026-06-02模仿学习

面向深海探索中对耐压、耐温且生态友好的软体机器人的需求,论文提出 CORE 自主平台,将供电、视觉/IMU 感知、处理与多路高压 DEA 人工肌肉控制集成,并以仿乌贼 Cuttlebot 验证模块化波动鳍和软夹爪。实验显示其可系留/无缆三维游动、目标跟踪与抓取,最高平移约 2.6 cm/s、转向约 10°/s,并能在六轴上产生可控力/力矩。

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models Figure 1
2026-06-02cs.RO

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models

Nishad Sahu, Kalpana Panda, Congyuan Yu, Changzhong Qian, Shounak Sural, Ragunathan Rajkumar

Carnegie Mellon University, Birla Institute of Technology and Science Pilani

2026-06-02安全鲁棒

论文针对端到端自动驾驶在闭环基准高分但安全语义能力不明的问题,提出与 Bench2Drive 对齐的 Safe2Drive,覆盖施工区、行人乱穿和遮挡弱势道路使用者等100个场景,并设计包含碰撞前制动、施工物接触、车道居中和平顺性的 SDS 指标。测试 LEAD 与 SimLingo 后发现其驾驶分从原基准的94.7/85.07降至39.95/41.00,SDS仅11.85/15.27,暴露施工区理解、红灯遵守和行人制动等脆弱行为。

Modeling Robotics Dataset Construction as an Artifact-Based Build Process Figure 1
2026-06-02cs.RO

Modeling Robotics Dataset Construction as an Artifact-Based Build Process

Leon Pohl, Lukas Beer, George Sebastian, Mirko Maehlisch

2026-06-02机器人数据集/基准

针对 ROS bag 到机器学习数据集常依赖顺序脚本、迭代慢且难复现的问题,论文将机器人数据集构建建模为带显式依赖的 artifact build DAG,并实现 Bazel 扩展 Bagzel/Bagzel-xattr。实验显示在 5.1–20.4GB 数据上相较 rosbag2nuscenes 扩展性更好,20.4GB warm build 最高加速 386.26×、增量构建 7.21×,但验证仍限于单机和中等规模数据。

Completion at the Boundary (CaB): Deployable Switching with Completion-Aware Control under Limited Calibration Figure 1
2026-06-02cs.RO

Completion at the Boundary (CaB): Deployable Switching with Completion-Aware Control under Limited Calibration

Yusuke Sano, Takeshi Itoga

Intelligent Systems Laboratory, SECOM Co., Ltd.

2026-06-02规划控制学习理论

本文针对VLA机器人执行“先A后B”等复合指令时缺少可部署完成判定接口的问题,指出切换本身会干预闭环轨迹,单一标量完成信号在跨任务边界证据极性变化下易失效。CaB用Before/Hit/After边界阶段Token形成共享完成后验,同时服务于何时切换与切换处动作调节;在第一人称Minecraft VLA基准的E1/E2协议下,报告了复合执行成功率与交接质量提升。

V2I Work Zone Geometry Reconstruction with Pose-Conditioned UWB Range Denoising Figure 1
2026-06-02cs.RO

V2I Work Zone Geometry Reconstruction with Pose-Conditioned UWB Range Denoising

Jiaxi Liu, Hangyu Li, Yang Cheng, Rui Gana, Junwei You, Weizhe Tang, Peng Zhang, Steven T. Parker, Xiaopeng Li, Bin Ran

2026-06-02三维

面向自动驾驶车辆在临时施工区中难以及时获得可靠几何地图的问题,论文将装在锥桶上的 UWB 路侧单元作为可快速部署的测距锚点,但重点处理 NLOS、突发离群、锚点无序/缺失和车辆位姿不确定带来的测距噪声。其核心是姿态条件、置换等变的多锚点预测去噪器,结合锚点级时序建模、集合聚合和两阶段训练。实测与仿真显示该方法提升测距、锥桶定位和施工区三维几何重建,在原始输入上将现场加权 MSE 降低 66.9%。

Ontology-Guided Reasoning for Affordance-Based Explanations of Robot Navigation Figure 1
2026-06-02cs.RO

Ontology-Guided Reasoning for Affordance-Based Explanations of Robot Navigation

Amar Halilovic, Vahidin Hasic, Senka Krivic

*This work was not supported by any organization 1 Amar Halilovic is with the Institute of Artificial Intelligence, Ulm University, 89081 Ulm, Germany

2026-06-02机器人

面向室内机器人导航失败只报“路径被挡”而难以请求人类协助的问题,本文将局部物体、可供性、状态及空间关系组织为机器人中心的本体,并通过假设物体—可供性状态改变来筛选可执行解释因素。在机器人图书管理员的程序化基准中,该方法比仅语义基线更准确定位相关解释因素,且在语义干扰增多时保持较稳健。

World Models for Robotic Manipulation: A Survey Figure 1
2026-06-02cs.RO

World Models for Robotic Manipulation: A Survey

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

Department of Mechanical Engineering, The Hong Kong Polytechnic University, Kowloon, Hong Kong SAR, China, Department of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen, China, School of Advanced Engineering, Great Bay University, Dongguan, Guangdong, China, College of Robotics Science and Engineering, Taiyuan University of Technology, Taiyuan, China, School of Data Science, City University of Hong Kong (Dongguan), Dongguan, Guangdong, China, Department of Mechatronic Engineering, Guangdong Polytechnic Normal University, Guangdong, China, School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, China, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore, College of Mechanical and Electrical Engineering, Northeast Forestry University, Harbin, China, Greater Bay Area National Center of Technology Innovation, Guangzhou, China, Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Kowloon, Hong Kong SAR, Department of Production Engineering, KTH Royal Institute of Technology, Stockholm, Sweden

2026-06-02机器人强化学习

机器人操作中的接触、遮挡和不可逆状态变化要求机器人在执行前预测动作后果,但“世界模型”概念已被不同社区泛化而混乱。本文将其界定为动作条件预测系统,按预测表示、预测—动作接口和使用阶段建立分类,串联强化学习、视频生成、几何/物理模型与 VLA,并综述34个数据集和评测协议。主要结论是世界模型正从单任务动力学预测器转向机器人学习基础设施,但接触建模、幻觉控制、动作对齐和闭环基准仍未充分解决。

General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling Figure 1
2026-06-02cs.CV

General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling

Huaihai Lyu, Chaofan Chen, Mingyu Cao, Yuheng Ji, Changsheng Xu

2026-06-02机器人

论文针对 VLA/模仿学习中直接回归绝对动作坐标导致的坐标系依赖、速度绑定和多模态平均问题,提出 Generalized Action Manifold:用弧长参数化解耦轨迹形状与时间速度,用 Schema-Affine-Factorization 将动作归一到规范世界线并分离几何模式与仿射调制。作者称该结构先验可把稀疏示范扩展为连续有效动作流形,在空间/时间分布偏移下优于几何无关基线;但给定片段中具体基准、数据规模和增益幅度未充分说明。

PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs Figure 1
2026-06-02cs.RO

PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs

Erdem Uysal, Timo Kehrer, Sebastiano Panichella

Institute of Computer Science, University of Bern, 3012 Bern, Switzerland

2026-06-02优化算法

这篇论文针对LLM直接闭环控制无人机带来的延迟、幻觉风险,以及端到端VLA策略难解释、难加约束的问题,提出PEACE:由LLM一次性生成类型化任务计划,再由ROS 2/MAVLink执行器确定性执行,并用2D检测加深度投影构建3D世界模型,独立约束层检查高度与地理围栏,失败时有限重规划。实验在PX4/Gazebo仿真中验证可行性,显示相比紧耦合LLM控制可减少模型调用并提升可审计性与约束执行;真实机部署和动态场景效果文中仍未充分说明。

RocketSmith: An Agentic System for High-Powered Rocket Design and Manufacturing Figure 1
2026-06-02cs.RO

RocketSmith: An Agentic System for High-Powered Rocket Design and Manufacturing

Peter Pak, Jesse Barkley, Rumi Loghmani, Derek Baich, Ananya Pamal, Amir Barati Farimani

Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh

2026-06-02机器人

高功率火箭开发需在仿真、CAD 与制造软件间反复切换,稳定性和质量更新带来流程摩擦。RocketSmith 将 LLM 代理与 MCP 工具调用结合,把轨迹仿真、参数化 CAD、切片质量估计和稳定性优化串成可验证闭环,并支持零样本或人在环迭代。作者用其设计并 FDM 制造 4 枚火箭实飞,均稳定发射,2 枚可复飞回收,实测与仿真最高点对比达到 84% 准确率。

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation Figure 1
2026-06-02cs.CV

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

Kailing Li, Tianwen Qian, Lijin Yang, Yuqian Fu, Jingyu Gong, Xiaoling Wang, Liang He

School of Computer Science and Technology, East China Normal University, King Abdullah University of Science and Technology

2026-06-02机器人视觉感知三维

论文针对VLM在视觉语言导航中“懂语义但不懂3D几何”、且难以直接执行连续动作的问题,提出训练无关的HSGM,将可通行区域、障碍、物体关系、候选路点与历史轨迹组织为分层语义-几何俯视图,让VLM只做高层路点选择,低层由A*完成避障路径,并用子任务分解缓解长程遗忘。在R2R-CE和RxR-CE上分别达到47.9%和41.8%成功率,报告称零样本SOTA且超过部分监督方法。

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems Figure 1
2026-06-02cs.RO

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

Barak Or

2026-06-02机器人

本文针对机器人基础模型、VLA 和世界模型把感知直接转为物理动作时可能出现的“静默失败”:系统看似自信且语义合理,却因状态估计、遮挡或分布偏移执行危险动作。核心洞察是需在黑箱模型与硬件执行之间建立独立的运行时动作授权边界。论文综述多条安全研究线,给出静默失败定义、授权事件形式化、护栏功能分类及评估指标,但文中主要是文献综合与问题框架,未提供新的实机验证结果。

Can Predicted Dynamics Exist in the Physical World? Figure 1
2026-06-02cs.RO

Can Predicted Dynamics Exist in the Physical World?

Barak Or

2026-06-02强化学习

论文关注世界模型、VLA 或策略输出的状态轨迹/动作块虽预测误差低,却可能在真实机器人动力学包络内不可执行的问题。作者提出模型无关的“物理可采纳性”运行时门控,在执行前按运动学可达性、动作条件动力学残差和多时域一致性检测并给出拒绝归因。LeRobot PushT 实验中,完整门控 AUC 为 0.957,回放干预可拦截约 87–89% 无效提案,同时平均任务进展保持约 0.998。

Whole-Body Inverse Kinematics with Graph Diffusion Figure 1
2026-06-02cs.RO

Whole-Body Inverse Kinematics with Graph Diffusion

Helong Huang, Kai Tan, Feng Wen, Guowei Huang, Xingyue Quan

Large Model Algorithm Lab, Huawei

2026-06-02生成模型

面向高自由度、双臂/躯干等多分支机器人中传统 IK 易受初始化影响、学习法又忽略拓扑且难表达一对多解的问题,论文提出 GraphDiff-IK:从 URDF 构建关节运动学图,在图上做条件扩散生成,并加入分阶段消息传递、躯干感知条件、带噪正运动学反馈和任务空间监督。实验显示其在多类机器人上提升末端位置/姿态精度与稳定性,同时能采样多个可行解。

Balancing Accuracy and Efficiency: Adaptive Dynamics Orchestration for Model Predictive Control Figure 1
2026-06-02cs.RO

Balancing Accuracy and Efficiency: Adaptive Dynamics Orchestration for Model Predictive Control

Francesco Cancelliere, Aniket Datar, Giovanni Muscato, Xuesu Xiao

2026-06-02规划控制

论文针对采样式 MPC 在越野导航中“高保真模型更准但慢、轻量模型更快但易在复杂地形失真”的矛盾,提出 ADO 将动力学模型选择本身纳入在线决策:维护不同精度/开销的模型库,用已执行动作的反事实回放估计各模型在地形语义下的残差,并实时切换。实车实验显示其在平坦区域保留低开销吞吐,在困难地形提升保真度,建模误差低于固定轻量模型,接近最高保真模型但计算成本更小。

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models Figure 1
2026-06-02cs.LG

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models

Christian Gumbsch, Leonardo Barcellona, Lennard Schünemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, Efstratios Gavves

University of Amsterdam, Catholic University of Leuven, Toyota Research Institute, crafted or even unavailable in real-world applications, such as robotics. Recent work, applications, such as an RL-based robotic scenario, reward functions are not naturally available, constrained by both the quality and quantity of available demonstrations.

2026-06-02视觉语言强化学习模仿学习优化算法

针对机器人强化学习中奖励函数难以手工设计、零样本 VLM 奖励又易产生假阳性并诱发 reward hacking 的问题,论文提出 Demo2Reward:用少量专家演示在策略训练前自动优化冻结 VLM 的任务提示,以压低误判且保留真成功检测。实验显示其在多种仿真任务、策略骨干和真实机器人场景中优于零/少样本 VLM 奖励,无需微调或增加训练时推理开销。

Invascal: Inverse-Vacuity Self-Calibration for Uncertainty-Aware LiDAR Range-View Semantic Segmentation Figure 1
2026-06-02cs.RO

Invascal: Inverse-Vacuity Self-Calibration for Uncertainty-Aware LiDAR Range-View Semantic Segmentation

Kerim Turacan, Hannes Reichert, Andrei Bolandut, Konrad Doll

University of Applied Sciences Aschaffenburg, Aschaffenburg, Germany

2026-06-02视觉感知安全鲁棒

面向自动驾驶/移动机器人中 LiDAR range-view 语义分割的安全可靠性,论文针对 softmax 过度自信、MC dropout/集成代价高的问题,提出架构无关的 Adapter Head,将类别偏好与证据强度解耦,并用 Invascal 直接自校准不确定性强度。多数据集和多骨干实验显示,其以较小计算开销改善不确定性校准,同时基本保持分割精度。

Linear Motility Maps in Nonlinear Viscous Fluids Figure 1
2026-06-02cs.RO

Linear Motility Maps in Nonlinear Viscous Fluids

Yishun Zhou, Shai Revzen

2026-06-02机器人

论文针对低雷诺数机器人/微游动器在非牛顿黏性流体中是否仍受扇贝定理约束的问题,证明幂律黏度下运动映射仍对形变速度保持齐次线性结构,因此互易运动不能产生净位移;但在 Carreau–Yasuda 流体中,一维“尺蠖”模型可借非幂律阻力实现净运动,并可通过改变驱动速度切换方向。

Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems Figure 1
2026-06-02cs.RO

Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems

Julian Langschwert, Georg Schaefer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

2026-06-02强化学习

针对机电系统辨识中激励信号需兼顾信息量与硬件安全、传统 PRBS/扫频依赖人工限幅的问题,本文将实验设计建模为有限时域 MDP,用 PPO 学习 Quanser Aero 2 的电压激励,并以终端参数误差奖励和角度安全惩罚约束轨迹。结果显示,联合智能体在较少安全违规(0.75%)下优于经典基线,尤其将阻尼误差从 Chirp 的约 495% 降至 198%,但阻尼辨识仍受 ARX-RLS 病态影响且训练稳定性不足。

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data Figure 1
2026-06-02cs.RO

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data

Zhiyuan Feng, Qixiu Li, Huizhi Liang, Rushuai Yang, Yichao Shen, Zhiying Du, Zhaowei Zhang, Yu Deng, Li Zhao, Hao Zhao, Zongqing Lu, Oier Mees, Marc Pollefeys, Jiaolong Yang, Baining Guo

Tsinghua University, Xi’an Jiaotong University, Fudan University, Peking University

2026-06-02机器人视觉语言视觉感知

本文关注 VLA 机器人操作对大规模机器人示教的依赖:示教昂贵且受具体机体限制,而人类视频丰富但缺少可执行动作标注。论文的核心洞察是按“视频转成何种动作相关信号”统一梳理方法,归纳为潜在动作、预测世界模型、显式 2D 线索和显式 3D 结构四条桥接路径,并总结数据集信号与开放挑战。作为综述,文中未报告统一实验增益,主要结果是给出分类框架、资源清单和对视频分段、机体/视角对齐及部署评测的研究路线判断。

VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis Figure 1
2026-06-02cs.RO

VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis

Zeqin Liao, Peifan Ren, Zixu Gao, Hongyu Gong, Lianyu Hu, Wenbing Tang, Yuhong Nan, Zibin Zheng, Yang Liu

Zeqin Liao, Lianyu Hu and Yang Liu are with School of computing and data science, Nanyang Technological University., Wenbing Tang is with Northwest A&F University

2026-06-02视觉语言视觉感知

VLA 模型受训练数据覆盖限制,部署到长尾场景时易失败,而既有测试多停留在暴露问题、难以转化为修复数据。VLAMotor 的核心思路是用潜空间距离筛选高不确定且低冗余的测试用例,再让 VLM 智能体把失败轨迹抽象、规划为可执行修复技能并生成微调数据。四类操作任务中,其仿真失败触发率达 92.33%,覆盖率较 VLATest 提升 18.93%,微调后成功率提升 49.25%,实机成功率提升 57.50%。

2026-06-01

59 篇
Learning Controlled Separation of Small Objects Between Two Fingers with a Tactile Skin Figure 1
2026-06-01cs.RO

Learning Controlled Separation of Small Objects Between Two Fingers with a Tactile Skin

Ulf Kasolowsky, Berthold Bäuml

2026-06-01规划控制

面向工业中盲抓小颗粒后需保留指定数量的场景,论文提出双指“受控分离”任务:仅依赖指尖空间触觉皮肤和关节反馈,在仿真中用稀疏奖励强化学习控制6自由度机械手让多余6mm颗粒掉落。结果显示理想触觉几乎可解该任务,4×4触觉相较仅用关节传感在多颗粒目标上最高提升约20%,并在DLR-Hand II上实现接近仿真的迁移成功率。

Batched Differentiable Rigid Body Dynamics in PyTorch for GPU-Accelerated Robot Learning Figure 1
2026-06-01cs.RO

Batched Differentiable Rigid Body Dynamics in PyTorch for GPU-Accelerated Robot Learning

Yue Wang, Yanran Xu, Wenbo Wu, Chuanhang Qiu, Zhaoxing Li

2026-06-01机器人

针对大规模机器人强化学习中 Pinocchio 等 CPU 刚体动力学库难以嵌入 GPU/PyTorch 训练环的问题,论文提出 bard:用纯 PyTorch 重写 Featherstone 算法,并通过分层惰性缓存、预计算 Rodrigues 常数的无矩阵乘关节变换、按树深度的 level-parallel 传播提升批量吞吐。在 7–23 自由度模型上数值匹配 Pinocchio,H200、batch 4096 下 FK/Jacobian 最高约 64×/63×,系统辨识质量误差 1.24%,Isaac Lab 4096 环境内循环动力学较 Pinocchio 快 8.5×、较 ADAM 快 2×。

IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving Figure 1
2026-06-01cs.RO

IDOL: Inverse-Dynamics-Guided Future Prediction for End-to-End Autonomous Driving

Chenghao Zhang, Timin Li, Dongmei Li

Department of Electronic Engineering, Tsinghua University

2026-06-01机器人

IDOL针对端到端自动驾驶中“预测未来场景”与“生成可执行轨迹”耦合不足的问题,提出在潜在BEV空间用世界模型预测多步未来,并通过相邻未来状态的逆动力学解码运动增量,将状态转移转化为轨迹优化信号;再配合轻量闭环细化提升长时一致性。论文在NAVSIM v1/v2上报告优于可比方法的SOTA结果。

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making Figure 1
2026-06-01cs.RO

On-Device Robotic Planning: Eliminating Inference Redundancy for Efficient Decision-Making

Joonhee Lee, Hyunseung Shin, Hyunmi Kim, Pei Zhang, Jeonggil Ko

School of Integrated Technology, College of Computing, Yonsei University, Department of Hyperscale AI SoC Research Section, ETRI, EECS - Electrical and Computer Engineering, University of Michigan

2026-06-01机器人规划控制

论文针对基于大语言/视觉语言模型的机器人规划在端侧部署中推理延迟过高的问题,指出相邻观测间动作和子目标存在显著时间冗余。其核心是 REIS:用轻量场景门控筛掉无需重推理的帧,并通过 KV-cache 引导的 affordance 路由复用历史推理上下文。ALFRED 与真实机器人实验显示,该方法可明显降低推理开销和重复动作生成,同时任务成功率基本保持竞争力。

Actuator-Aware Inverse Kinematics with Joint-Limit Admissibility for Torque-Controlled Redundant Robots Figure 1
2026-06-01cs.RO

Actuator-Aware Inverse Kinematics with Joint-Limit Admissibility for Torque-Controlled Redundant Robots

Mohammad Dastranj, Mahdi Hejrati, Jouni Mattila

2026-06-01机器人规划控制

针对力矩控制冗余机器人中传统逆运动学只优化运动学误差、却可能生成下游控制器难以跟踪的关节参考的问题,论文将所需关节速度作为QP变量,引入CBF式关节限位可容许约束、任务松弛项,以及考虑上一时刻命令一致性和执行器力矩能力的兼容性目标。在7自由度上肢外骨骼VDC实验中,该方法相比伪逆、阻尼最小二乘和约束QP基线减少逼近限位的命令,并改善实际任务跟踪且无需改动底层控制器。

Shaft-integrated Force Sensing with Transformer-based Dynamics Compensation for Telesurgery Figure 1
2026-06-01cs.RO

Shaft-integrated Force Sensing with Transformer-based Dynamics Compensation for Telesurgery

Shuyuan Yang, Grant Boone, Timo Markert, Sebastian Matich, Andreas Theissler, Martin Atzmueller, Zonghe Chua

2026-06-01机器人

面向机器人微创手术中触觉反馈、技能评估和力感知自主操作对工具端力测量的需求,论文将商用管状六轴力/力矩传感器集成到标准线缆驱动手术器械轴端,并用融合传感器读数与机器人状态的 Transformer 补偿线缆驱动引入的内部力。台架牵引与触诊实验显示归一化误差低于 6%,且较纯近端数据驱动方案对未见条件泛化更好;但高内力会导致传感器饱和,轴向力可观测性和高载荷性能仍受限。

Triangle Splatting SLAM Figure 1
2026-06-01cs.CV

Triangle Splatting SLAM

Nicholas Fry (1 and 2), Eric Dexheimer (2), Kirill Mazur (2), Paul H. J. Kelly (1 and 2), Andrew J. Davison (2) ((1) Software Performance Optimisation Group, Imperial College London, (2) Department of Computing, Imperial College London)

2026-06-01机器人

面向机器人和具身智能中需要可碰撞、可编辑显式几何的在线建图问题,本文用可微三角形“汤”统一替代高斯/隐式/TSDF等中间表示,在跟踪与建图中直接渲染优化三角面,并通过受限 Delaunay 在线生成连通网格,配合位姿优化、等边正则和窗口增密提升稳定性。在 Replica 与 TUM-RGBD 上,其轨迹精度与基线相当,3D 几何质量更好,并展示了在线网格编辑能力。

Adaptive Artificial Time-Delay Control with Barrier Lyapunov Constraints for Euler-Lagrange Robots Figure 1
2026-06-01cs.RO

Adaptive Artificial Time-Delay Control with Barrier Lyapunov Constraints for Euler-Lagrange Robots

Saksham Gupta, Rishabh Dev Yadav, Sarthak Mishra, Amitabh Sharma, Sourish Ganguly, Wei Pan, Spandan Roy, Simone Baldi

2026-06-01机器人规划控制优化算法

这篇论文面向机器人在未知、状态相关动力学扰动下仍需严格满足位置和速度安全边界的问题,提出将自适应人工时延估计与障碍 Lyapunov 约束控制耦合:在线估计 TDE 误差的状态相关上界参数,同时用时变 BLF 编码全状态约束,并给出稳定性证明。作者在 5 自由度机械臂实验中显示,相比既有方法更能在动态不确定性下保持约束不被违反。

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely Figure 1
2026-06-01cs.CL

Multi-Turn Multi-Agent Dialogue for Collaborative Reconstruction Improves VLM Performance on Spatial Reasoning, But Only Barely

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

Computational Linguistics, Department of Linguistics, University of Potsdam, Germany, German Research Center for Artificial Intelligence (DFKI), Berlin, Germany

2026-06-01视觉语言三维

本文关注VLM在机器人协作中能否通过语言传递视觉空间理解,而非只做单轮问答。作者设计了程序员—机器人双智能体搭建任务,将目标理解、指令生成、指令落地和动作执行拆开分析。结果显示,多轮协作只带来很小提升,详细文本目标和分层图像表示更有效,瓶颈主要在视觉空间 grounding 与可执行指令生成。

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting Figure 1
2026-06-01cs.RO

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting

Hannah Schieber, Dominik Frischmann, Victor Schaack, Angela P. Schoellig, Daniel Roth

* equal contribution 1 Hannah Schieber, Dominik Frischmann, Victor Schaack, and Daniel Roth are with the Technical University of Munich, Human-Centered Computing and Extended Reality Lab, TUM University Hospital, Clinic for Orthopedics and Sports Orthopedics, Munich Institute of Robotics and Machine Intelligence (MIRMI), Learning Systems and Robotics Lab

2026-06-01规划控制三维

面向未知室内机器人同时需要避障几何与目标语义的问题,LiftNav没有把语义密集嵌入GS,而是在GSFusion的TSDF+Gaussian Splatting双地图上,用YOLO检测、TSDF深度反投影与聚类完成轻量语义提升,并以TSDF梯度优化B样条轨迹、加入hinge-loss碰撞项。Replica仿真中相较SplatNav语义目标可行率达100%,路径更短且jerk更低,但严格GT成功率受目标质心落入物体边界影响降至79%。

Haptic Sorter: A Unified Planning Framework for Online Shape Estimation and Real-Time Pose Inference Figure 1
2026-06-01cs.RO

Haptic Sorter: A Unified Planning Framework for Online Shape Estimation and Real-Time Pose Inference

Zhuoyi Lu, Lin Yang, Sri Harsha Turlapati, Domenico Campolo

† \dagger These authors contributed equally to this workAll authors are with the School of Mechanical and Aerospace Engineering, Nanyang Technological University (NTU), Singapore

2026-06-01规划控制三维

针对透明/遮挡物体中视觉难以提供可靠几何与接触中位姿漂移的问题,本文把触觉探索、超椭圆形状建模和操作规划放入同一可微框架:用贝叶斯优化选择更有约束力的接触点,并以力残差驱动 Haptic ODE 在线修正位姿。系统在二维分拣任务的仿真和多臂实物平台上验证了不同形状下的可用性,但文中片段未充分说明相对基线的定量增益。

Learning Terrain-Aware Whole-Body Control for Perceptive Legged Loco-Manipulation Figure 1
2026-06-01cs.RO

Learning Terrain-Aware Whole-Body Control for Perceptive Legged Loco-Manipulation

Sikai Guo, Yudong Zhong, Guoyang Zhao, Botao Dang, Zhihai Bi, Jun Ma

2026-06-01机器人规划控制

针对四足机械臂在台阶、斜坡等非平整地形上仅靠本体感知易碰撞、基座扰动会破坏末端跟踪的问题,论文提出 TA-WBC:用混合外感知编码器提取足端周围高程特征,并以足接触平面定义末端目标采样,再通过双策略蒸馏把越障行走与全身操作统一到一个 RL 控制器中。仿真和实机结果显示其可扩大可达空间、降低末端跟踪误差并减少意外绊碰。

Surface Constraint Policy for Learning Surface-Constrained and Dynamically Feasible Robot Skills Figure 1
2026-06-01cs.RO

Surface Constraint Policy for Learning Surface-Constrained and Dynamically Feasible Robot Skills

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Jie Pan, Han Ding

2026-06-01机器人强化学习优化算法

面向擦拭、抛光、超声扫描等需贴合复杂自由曲面的操作,论文指出扩散模仿学习缺少显式表面几何约束和动态可执行性,易失去稳定接触。其核心是SCP:用示教导出的二维加权高斯核编码曲面约束,再由扩散策略生成任务意图,并映射为受曲面约束的DMP以平滑执行。实验显示在多种表面操作中成功率和接触稳定性优于对比方法。

AR Forcing: Towards Long-Horizon Robot Navigation World Model Figure 1
2026-06-01cs.RO

AR Forcing: Towards Long-Horizon Robot Navigation World Model

Yifei Yang, Zehua Fan, Huan Li, Aoqi Wang, Lida Huang, Haibao Yu, Haiyan Liu, Xuanyao Mao, Jason Bao, Liang Xu, Bingchuan Sun, Yan Wang

2026-06-01机器人强化学习

这篇论文针对扩散式机器人导航世界模型在训练时并行监督、规划时自回归滚动导致的分布偏移与长时域漂移问题,提出 AR Forcing:仅改变训练调度,把标准扩散单步噪声预测损失嵌入自回归上下文更新,使模型训练时接触自身生成的状态。实验在 RECON、SCAND、HuRoN、TartanDrive 等数据集上显示,其长时域图像一致性、轨迹预测和规划指标优于 NWM,并提升未知环境鲁棒性。

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation Figure 1
2026-06-01cs.RO

DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation

Taiyi Su, Jian Zhu, Tianjian Wang, Youzhang He, Zitai Huang, Jianjun Zhang, Chong Ma, Hanyang Wang, Tianjiao Zhang, Munan Yin, Weihao Ding, Yi Xu

2026-06-01机器人视觉语言视觉感知

DeMaVLA瞄准家务机器人中衣物等可变形物体折叠难以跨类别泛化的问题,避免为不同衣物训练独立策略。其核心是在VLM骨干上加入经隔层剪枝的LLM动作专家,用flow matching生成连续双臂动作,并结合约5000小时真实双臂预训练与人机协同DAgger失败纠正后训练。实验显示其在RoboTwin具竞争力,并在真实家庭折叠基准上表现较强,但增益可能主要来自scaling / data与纠错数据共同作用。

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving Figure 1
2026-06-01cs.RO

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello

† Department of Control and Computer Engineering, ‡ Department of Mechanical and Aerospace Engineering

2026-06-01强化学习

面向车载具身 LLM 控制器的实时部署难题,本文指出剪枝时机比单纯剪多少更关键,提出在 SFT/RL 适配过程中进行结构化剪枝的 BPF,尤其利用 RL 闭环反馈决定保留结构。基于 RobotxR1 自动驾驶管线,BPF-SFT/RL 相比后训练剪枝等策略取得更优性能-内存-吞吐权衡,尺寸/端到端性能折衷较直接换小模型提升 1.69 倍,并在 Jetson AGX Orin 上最高提升解码吞吐 27%。

HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model Figure 1
2026-06-01cs.RO

HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model

Xiang Zhu, Puzhen Yuan, Yichen Liu, Jianyu Chen

Institute for Interdisciplinary Information Sciences, Tsinghua University, China, Shanghai Qi Zhi Institute, China

2026-06-01机器人视觉语言视觉感知

HARP-VLA针对人类视频用于机器人VLA预训练时的视觉表征错位与动作不可执行问题,认为潜在动作仍会受视觉域差异牵制。方法用少量人机配对演示作桥接、未配对视频提供动力学监督,并结合面向操作的辅助线索与源相对配对判别对齐损失,同时学习对齐视觉编码器和潜在动作空间。实验显示其改善表征对齐和策略性能,在CALVIN ABC→D达到4.481平均长度,真实任务较最强基线提升7.1%成功率。

Simulation of collision avoidance behavior in crowd movement by data-driven approach Figure 1
2026-06-01cs.RO

Simulation of collision avoidance behavior in crowd movement by data-driven approach

Xuanwen Liang, Eric Wai Ming Lee

Department of Architecture and Civil Engineering, City University of Hong Kong, Hong Kong

2026-06-01机器人

针对数据驱动人群仿真虽能降低轨迹误差、却在双向/多向流中产生过高碰撞率的问题,论文提出 CPGAN,将行人迎面避让时更常通过横向加速度转向而非减速的机制写入碰撞损失,并结合 Voronoi 运动特征提取。双向流实验显示,该损失可显著降低相向行人碰撞率至接近受控实验水平,同时复现车道形成和 N-t 曲线。

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration Figure 1
2026-06-01cs.CV

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

Jun Wang, Xiaohao Xu, Xiaonan Huang

University of Michigan, Ann Arbor

2026-06-01机器人视觉语言视觉感知安全鲁棒

论文关注人机共处中 VLM 不能仅“看懂场景”、还需判断机器人本体是否已碰撞或即将碰撞的安全缺口。作者提出 Habitat 3.0 构建的 TouchSafeBench,用多视角 RGB-D、轨迹与仿真接触标签评测当前安全分类和提前预警。结果显示多种前沿/机器人 VLM 最佳平均 Macro-F1 仍低于 50%,深度输入并不会自动带来碰撞 grounding,且机器人—环境接触尤其薄弱。

TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues Figure 1
2026-06-01cs.RO

TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues

Tianle Zeng, Hanjing Ye, Jianwei Peng, Jingwen Yu, Hanxuan Chen, Hong Zhang

Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology, Shenzhen, China. 2

2026-06-01机器人

这篇论文针对长距离户外视觉语言导航中目标语义线索被遮挡、变稀或离开视野后,机器人易回退、摆动和盲目探索的问题,提出 TARIC:将可见性门控的语义方位与近场可通行性实时对齐,并把间歇二维线索提升为世界坐标下的三维记忆,用不确定性读出在绕行时保持可执行指引。实验覆盖四足和轮式平台的 600–1000 米路线,仿真成功率较最强基线提升超过 10 个百分点,真实成功率为 40% 对 17.5%。

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning Figure 1
2026-06-01cs.RO

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

Department of Engineering Design, Indian Institute of Technology, Madras, Robotics Institute, Carnegie Mellon University

2026-06-01机器人

开放环境中的风险常与机器人本体和感知/控制栈相关,单靠VLM预先枚举会漏掉长尾交互故障且过度保守。DFM2让机器人在异常扰动后结合视觉语义追因,构建经验驱动“危险库”,并用语义体素与少样本核回归刻画扰动空间影响及不确定性。文中在仿真和硬件、不同本体与故障模式下验证,显示相比纯几何和预先避障基线可提高生存率、减少不必要绕行,但具体增益幅度需看完整表格。

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving Figure 1
2026-06-01cs.CV

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

Jiahui Li, Jiawei Sun, Zixiang Ren, Ming Liu, Jiamin Shi, Ruiteng Zhao, Zhiyang Liu, Liying Liu, Zuoguan Wang, Kaidi Yang

National University of Singapore

2026-06-01三维

论文针对感知自由端到端驾驶中“密集图像 patch 被压缩为少量 scene tokens 后仅受规划损失监督”导致信息保留不足和 token 冗余的问题,提出 NTR:训练时用自蒸馏的掩码潜特征重建直接约束 scene-token 瓶颈,并用基础模型语义先验强调车辆、可行驶区等关键结构,推理时移除辅助分支不增加开销。在 Waymo E2E 与 NavSim1/2 上取得 SOTA,并显示 token 冗余下降、有效秩提升;但语义先验质量和额外训练成本仍是限制。

Building Generalization Into Behavior Generation Via Adaptive Compositions of Regularities Figure 1
2026-06-01cs.RO

Building Generalization Into Behavior Generation Via Adaptive Compositions of Regularities

Aravind Battaje, Malte Bernhard, Vito Mengers, Oliver Brock

2026-06-01学习理论

针对机器人在未预见情境中难以泛化的问题,论文提出将动力学、运动学、几何约束等“规律”显式表示为可交互的可微网络,并由感知反馈在线自适应组合,AICON再通过梯度生成行为。作者在可控仿真任务中测试移动目标、障碍、扰动及传感/执行变化等新条件,17种场景中16种产生合适行为;唯一失败来自已编码规律信息不足,表明自适应组合可作为行为生成的有效归纳偏置。

Seeing Fast and Slow: Bimodal 3D Scene Graphs for Open-set Tasks Figure 1
2026-06-01cs.RO

Seeing Fast and Slow: Bimodal 3D Scene Graphs for Open-set Tasks

Marcel Bartholomeus Prasetyo, Shrutika Vishal Thengane, A Manicka Praveen, Yi Loo, Malika Meghjani

* These authors contributed equally.The authors are with Singapore University of Technology and Design (SUTD), Singapore.

2026-06-01三维

面向开放集任务,机器人若始终构建细粒度开放词汇3D场景图,难以在边缘端实时运行。BiMoSG的洞察是多数时间只需粗语义:默认用闭集分割和棱柱体对象表示快速建图,并以邻域关系形成层次;当LLM规划器触发相关对象时,再切换到VLM/FastSAM等慢模式补充开放集细节。实验称快模式约0.1秒/帧,比对比方法约快3倍,并在未知环境中缩短任务执行时间且成功率相近。

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air Figure 1
2026-06-01cs.RO

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

Southern University of Science and Technology, Fudan University

2026-06-01强化学习

这篇论文关注单机空中 VLA 的跟踪、导航能力能否直接迁移到无人机—无人车闭环协作。作者提出 CARLA-Air,将 CARLA 与 AirSim 置于同一 Unreal 运行时,共享物理时钟、状态和传感管线,并用移动平台降落、遮挡恢复护航两类诊断任务评估协作。结果显示,现有空中 VLA 常能跟随地面伙伴,却难以形成稳定协同行为;状态提示收益有限,朴素双向交互还可能放大误差,说明需要显式伙伴状态、低延迟协调和团队目标对齐。

A study on a Real-Time VR-Based Teleoperation Framework for Manipulator in Dynamic Environment Figure 1
2026-06-01cs.RO

A study on a Real-Time VR-Based Teleoperation Framework for Manipulator in Dynamic Environment

InGyu Choi, GeonYeong Go, SunWoo Ahn, HyoJae Kang, Min-Sung Kang

Department of Robotics, Hanyang University, Department of Smart Construction Engineering, Hanyang University, Department of Interdisciplinary Robot Engineering Systems, Hanyang University, School of Smart Convergence Engineering, Hanyang University, Ansan

2026-06-01机器人

面向灾害、工地等动态危险场景中 VR 遥操作易受障碍变化、碰撞风险和 IK 延迟影响的问题,论文将 VR 6DoF 输入、RGB-D/TSDF 在线重建障碍感知与 GPU 加速的约束轨迹优化放入同一实时闭环,同时处理目标跟踪、关节限位和避障。在 Franka 7 自由度机械臂实验中,系统约 30–40 ms 规划延迟、25–30 Hz 更新,在无障碍、静态和移动障碍场景下能基本跟随操作者意图并生成安全绕行轨迹。

RDGen: Demonstration Generation for High-Quality Robot Learning via Reinforcement Learning Figure 1
2026-06-01cs.RO

RDGen: Demonstration Generation for High-Quality Robot Learning via Reinforcement Learning

Zijian Zhu, Menglin Zou, Zhuang Li, Yaojie Tu, Xinhai Sun

2026-06-01机器人强化学习模仿学习

RDGen针对VLA训练中高质量机器人轨迹依赖人工遥操作、成本高且噪声大的瓶颈,将强化学习从最终控制器重定位为示范数据生成器:用VLM解析任务、Grounding DINO定位物体,并把仿真中SAC学到的策略迁移到真机收集成功轨迹。抓取放置实验显示其成功率较高,轨迹比人工遥操作更平滑,并带来更好的下游VLA训练效果,但任务泛化和精细操作能力仍文中承认有限。

Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization Figure 1
2026-06-01cs.RO

Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization

Usman Nizamani, M. Shaheer Luqman, Fawad Javed Fateh, Ali Shah Ali, Murad Popattia, M. Zeeshan Zia, Quoc-Huy Tran

Retrocausal, Inc.

2026-06-01强化学习

针对传统强化学习在机器人操作中虽能得分却常产生不自然、抖动动作的问题,论文提出 HiMAQ:将人类示范的宏动作先量化为细粒度子动作原型,再聚合为粗层动作原型,以保留动作结构与细节。D4RL Adroit 上结合 IQL、SAC、RLPD 均较单层 MAQ 提升 DTW/Wasserstein 等人类相似度,并保持或提高成功率;22 人主观评测也更偏好 HiMAQ。

Trajectory Planning for Non-Communicating Mobile Robots using Inverse Optimal Control Figure 1
2026-06-01cs.RO

Trajectory Planning for Non-Communicating Mobile Robots using Inverse Optimal Control

Nina Majer, Yannick Epple, Xin Ye, Stefan Schwab, Sören Hohmann

∗FZI Research Center for Information Technology, ∗∗Institute of Control Systems, Karlsruhe Institute of Technology

2026-06-01机器人规划控制

面向无通信移动机器人在路口/交汇场景中的去中心化避碰与防死锁,论文将逆最优控制用于从历史轨迹在线估计各机器人未知目标,并引入“自我预测”视角,联合预测相互影响后再规划。2–8 机器人仿真中,相比基于恒加速度估计目标的规划,全体到达时间中位数缩短 9.8%,且未出现规划或预测求解失败。

Wall-OSS-0.5 Technical Report Figure 1
2026-06-01cs.RO

Wall-OSS-0.5 Technical Report

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

2026-06-01机器人

论文针对VLA预训练是否本身就能产生可执行机器人策略、而不只是微调初始化的问题,提出开源4B Wall-OSS-0.5。其核心是梯度桥接联合训练:用离散动作预测强更新VLM骨干,用多模态损失保持视觉语言 grounding,并以连续flow matching作为部署动作接口。模型在20余种本体和大规模轨迹上训练,零样本实机17任务已能完成多项操作;微调后15任务平均进度60.5%,较π0.5高17.5个百分点。

High-Load-Density Electro-Permanent Magnetic Foot with Controllable Adhesion for Quadruped Wall-Climbing Robots Figure 1
2026-06-01cs.RO

High-Load-Density Electro-Permanent Magnetic Foot with Controllable Adhesion for Quadruped Wall-Climbing Robots

An Li, Bo Tao, I-Ming Chen, Han Ding

Magnetic Foot with Controllable Adhesion for, controllable adhesion, featuring force-feedback circular Halbach-, achieving controllable and reliable magnetization under real-, magnetization controllability or even complete failure of the, An Li and I-Ming Chen are with the School of Mechanical and, Aerospace Engineering, Nanyang Technological University, Singapore., Bo Tao and Han Ding are with the School of Mechanical Science and, Engineering, Huazhong University of Science and Technology, In addition to electrical controllability, magnetization is, permanent magnetic foot with controllable adhesion for, magnetization drivers, which together enable controllable

2026-06-01机器人规划控制

面向钢结构巡检中四足机器人在竖直、倒挂及复杂铁磁表面上可靠吸附/脱附的需求,论文提出带力反馈的圆形 Halbach-net 电永磁足和可控脉冲磁化驱动,通过三维并联磁路降低气隙与局部接触敏感性,并用压力传感闭环判定吸附状态。实验中单元最大吸附力超过 1000 N、载重自重比超 200:1,集成到 Unitree GO2 后可在天花板、竖壁及喷漆、穿孔、曲面钢面上稳定运动。

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring Figure 1
2026-06-01cs.RO

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li

University of Wisconsin–Madison, Georgia Institute of Technology

2026-06-01机器人

针对 VLA 机器人执行中失败难以及时发现、逐步标注昂贵且现有重采样/VLM 监控开销大的问题,本文将失败检测建模为粗监督学习,提出 Hide-and-Seek:用跨轨迹与轨迹内对比损失,从仅有轨迹成败标签中定位失败相关动作并形成时间结构信号。在 LIBERO、VLABench 和真实 xArm 上,覆盖 OpenVLA、π0、π0.5,方法在已见/未见任务上优于多类基线,bACC 最高提升 11.7%,且比 VLM 监控准确率高 13.1%、速度快 2000 倍以上。

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning Figure 1
2026-06-01cs.RO

Feat2Go: Visual Feature-Grounded Value Estimation for Embodied Reinforcement Learning

Junyang Shu, Zhiwei Lin, Bingqing Wei, Yongtao Wang

Wangxuan Institute of Computer Technology, Peking University, China

2026-06-01强化学习

针对VLA机器人强化学习中终局二值奖励稀疏、长程任务难以手工设计进度信号的问题,Feat2Go用预训练视觉世界模型V-JEPA 2的patch级特征度量中间状态与子目标相似度,并通过趋势聚类划分语义阶段,生成连续结构化价值目标;再训练价值模型按观测和指令预测进度,用于PPO/GRPO奖励重塑。实验显示其在ManiSkill3将OpenVLA-OFT的OOD成功率从17.5%提升到82.9%,在RoboTwin 2.0域随机化任务达88.8%。

Two Degree-of-Freedom Vibratory Transport in a Grasp Figure 1
2026-06-01cs.RO

Two Degree-of-Freedom Vibratory Transport in a Grasp

C. L. Yako, Shenli Yuan, Kenneth Salisbury

2026-06-01机器人

针对滚轮/皮带式主动指尖接触小、机构和控制复杂的问题,本文探索用可控非对称振动实现抓取内操作。核心是以音圈执行器闭环生成粘滑波形,并解析、实验验证粘着加速度与滑移加速度对线速度及平面角速度的影响;双2-DoF振动表面夹爪可对多类物体实现上下运输和旋转,但刚性物体的双向平移仍受结构倾斜与离面振动限制。

Object-Informed Model Predictive Path Integral Control for Non-Prehensile Robot Manipulation Figure 1
2026-06-01cs.RO

Object-Informed Model Predictive Path Integral Control for Non-Prehensile Robot Manipulation

Nikola Raicevic, Bharath Raam Radhakrishnan, Chenbin Yu, Ki Myung Brian Lee, Nikolay Atanasov

2026-06-01机器人规划控制

针对非抓取推操作中接触不连续、物体欠驱动导致长时域 MPPI 搜索空间过大的问题,论文将规划分解为“物体层虚拟受控轨迹生成”和“机器人层跟踪该轨迹”两个耦合问题,并提出一次规划的 SOI 与闭环重规划的 CLOI。仿真和 xArm6 实机避障推物实验显示,相比标准 MPPI,成功率分别提升约 40% 和 20%,仿真控制频率还提高 26%。

No Figure
2026-06-01cs.RO

SSR: Scaling Surefooted and Symmetric Humanoid Traversal to the Open World

Ruiqi Yu, Yiwen Wang, Yuan Hao, Jun WU, Qiuguo Zhu

Zhejiang University

2026-06-01机器人强化学习

面向人形机器人在开放人类环境中跨越楼梯、斜坡、间隙和高台时的安全落脚与自然全身运动难题,SSR提出单阶段端到端强化学习框架,利用“想象落脚点”在触地前评估支撑区域,并在潜空间做等变对称增强、结合地形特定运动先验。实验显示其可在多类真实地形上稳定长距离行走,完成45厘米高台和90厘米间隙等挑战。

DisPlace: Discriminative Place Projections for Multi-Reference Visual Place Recognition Figure 1
2026-06-01cs.CV

DisPlace: Discriminative Place Projections for Multi-Reference Visual Place Recognition

Dhyey Manish Rajani, Michael Milford, Tobias Fischer

2026-06-01视觉感知

多参考视觉地点识别虽能缓解天气、季节和视角变化,但现有方法常平均融合或保留全部参考,难以区分稳定地点信息与条件噪声。DisPlace将多次遍历描述子的融合写成广义特征值问题,最大化地点间可分性并抑制同地点跨参考变化,生成紧凑单一表示。其在4个数据集、6种描述子上优于7个基线,在54个外观变化设置中49个最佳,并降低推理存储开销。

FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance Figure 1
2026-06-01cs.LG

FLAG: Flow Policy MaxEnt-RL by Latent Augmented Guidance

Sungha Kim, Gawon Lee, Jusuk Lee, Jonghae Park, H. Jin Kim, Daesol Cho

Seoul National University, Georgia Institute of Technology

2026-06-01生成模型强化学习

本文针对最大熵强化学习中高斯策略表达力不足、生成式策略又易受全局重要性采样权重退化和 BPTT 不稳定影响的问题,提出 FLAG:利用 flow 的确定性潜变量到动作映射,将状态扩展为潜变量增强 MDP,在局部区域做重要性采样并以 EM 式监督目标优化一致的代理 MaxEnt 目标。实验显示其在 DMC Dog、MyoSuite、MuJoCo 等高维控制任务中用较少 Q 评估仍优于全局采样基线,并达到或接近最优表现。

GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation Figure 1
2026-06-01cs.RO

GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation

Beichen Shao, Mengying Xie, Heng Su, Wanyi Zhang, Mingyan Li, Yan Ding, Fausto Giunchiglia, Chao Chen

2026-06-01机器人安全鲁棒

本文针对服务机器人操作铰接物体时因物体形态多样、末端与把手交互复杂而导致泛化差和碰撞风险的问题,提出 GSAM:先由视觉模块估计运动学参数,再用微调 VLM 结合常识链式推理修正感知偏差,并让 LLM 将物体、交互姿态和避障知识转为约束函数供规划器验证可达性。实验在 5 类 50 个铰接任务和随机初始构型上,相比最佳基线成功率提升 36.0%,标准差降低 3.1%。

Geometry-Aware Control Barrier Functions for Collision Avoidance via Bernstein Polynomial Approximations Figure 1
2026-06-01cs.RO

Geometry-Aware Control Barrier Functions for Collision Avoidance via Bernstein Polynomial Approximations

Siwon Jo, Yanze Zhang, Yupeng Yang, Wenhao Luo

2026-06-01规划控制

针对不规则机器人与障碍物中球/超椭球近似过保守、多局部基元约束过多的问题,本文用 Bernstein 多项式 SDF 统一表示机器人和环境几何,并由最小距离与 KKT 条件构造可微的几何感知 CBF,直接生成闭环安全控制约束。仿真覆盖单机器人多障碍导航和异构多机器人避碰,显示能保持安全并改善实时约束规模,但主要证据仍限于模拟。

Primitive Subspaces Mediate Few-Shot Transfer in VLAs Figure 1
2026-06-01cs.RO

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

2026-06-01机器人

面向工业机器人中新任务需反复采集数据并微调的成本问题,论文考察VLA能否仅凭少量演示在测试时组合已学子技能。核心洞察是用原语分段轨迹和原语级语言监督训练,可形成可解码且因果必要的“原语子空间”。在OpenVLA与π0.5、REASSEMBLE和LIBERO-Long上,原语训练用3个演示达到微调上界78%,平坦训练约需10个;消融该子空间使迁移下降32个百分点,但实验仍限于仿真。

WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation Figure 1
2026-06-01cs.CV

WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation

Varun Nair, Vidyut Baradwaj, Jiahang He, Anya Singh, Jai Relan, Cabrel Happi

2026-06-01机器人

这篇论文针对第一视角操作视频中手部遮挡导致基于场景几何的相机朝向估计失效问题,提出把手腕运动与头肩臂链条形成的运动学耦合视为可学习视觉概念。WristCompass仅用双腕4D相对特征和短时GRU从单目RGB恢复相机旋转,在TACO上达13.8°中位误差,优于常量和VGGT;仅用TACO训练还可零样本迁移到Epic Kitchens,达14.3°,但在头动与腕动解耦任务上会失效。

BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies Figure 1
2026-06-01cs.LG

BOKBO (Best of K Bad Options): Calibrated Abstention for VLA Policies

Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

2026-06-01机器人

针对VLA策略K采样推理只选“最佳”动作、却无法发现K个候选全都不安全的问题,BOKBO引入基于保形风险控制的执行/弃权层,并指出扰动式K采样中的置信度和样本分歧主要跟踪噪声而非不确定性。其用学习到的违规预测器实现校准,在LIBERO上ε=0.05时约80%覆盖、执行违规率降至3.1%,并在不同骨干、任务套件和分布偏移下复现。

Bidirectional Incremental Generalized Hybrid A* Figure 1
2026-06-01cs.RO

Bidirectional Incremental Generalized Hybrid A*

Sidharth Talia, Oren Salzman, Siddhartha Srinivasa

2026-06-01机器人

面向复杂动力学、非结构化环境中的实时/anytime 运动规划,论文指出 IGHA* 的“冻结顶点”会遮蔽可行解支撑点,导致大量无效扩展。其核心是将 IGHA* 改为前后向双向搜索,通过近相遇连接与共享分支定界缓解该屏障,同时保留代价单调改进和终止性。实验在 R3/R4/R6 及高速越野闭环车规划中显示,Bi-IGHA* 在相近解质量下显著减少顶点扩展。

PInVerify: An Offline Embodied Benchmark for Active Instance Verification Figure 1
2026-06-01cs.CV

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

Yuhang Jiang

University of Trento, Italy

2026-06-01数据集/基准

论文指出具身导航到达目标附近并不等于找到正确实例,细粒度属性常需多视角近距离核验。其将主动实例验证形式化为有限时域决策过程,并提出离线基准 PInVerify,含 18 类、3000 个多视角 episode、6 扇区拓扑及陷阱/不可达视角标注。实验显示最佳 MLLM 基线较嵌入基线高 4.9pp,检测仍有约 3.1pp 缺口,所测 NBV 策略未带来可靠增益,LoRA 微调代理达 85.6%。

Exploiting Chordal Sparsity for Globally Optimal Estimation with Factor Graphs Figure 1
2026-06-01cs.RO

Exploiting Chordal Sparsity for Globally Optimal Estimation with Factor Graphs

Avinash Subramanian, Connor Holmes, Timothy D. Barfoot, Frank Dellaert, Frederike Dümbgen

Avinash Subramanian and Frank Dellaert are with the College of Computing, Georgia Institute of Technology, Atlanta, GA, USA

2026-06-01机器人

针对因子图状态估计中局部求解器依赖初始化、SDP 全局松弛又建模繁琐且代价高的问题,论文把常见 GTSAM 因子图自动提升为 QCQP/SDP,并利用变量消元得到的 Bayes tree 做弦稀疏分解,以多个 clique PSD 变量替代大矩阵。3D 环形 pose-graph SLAM 与 2D 链式定位实验显示,运行时间随规模近似线性、接近局部法,同时稳定获得可认证全局最优。

ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning Figure 1
2026-06-01cs.RO

ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning

Faiq Shamass

2026-06-01强化学习规划控制

针对离策略连续控制策略在真实执行中易产生高频动作抖动、后处理滤波又带来相位滞后的问题,ZAPS-DA 将平滑与奖励学习解耦:主 actor 仍按 SAC 训练,另设部署用 actor 监督模仿回放缓冲中经零相位 SG 滤波的动作,实现“非因果滤波的因果蒸馏”。在 MetaDrive 中转向抖动降 14–21 倍、油门降 3–5 倍且任务完成率相当但奖励降 6.3%;在 Webots ACC 中奖励持平、转向抖动降 8–45 倍,失败率由 2.0% 降至 0.7%。

Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering Figure 1
2026-06-01cs.RO

Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering

Emil Martens, Aaron Miller, Matias Varnum, Annette Stahl

Norwegian University of Science and Technology 2 Skydio https://www.skydio.com/

2026-06-01机器人

面向机器人中常见的实时非线性最小二乘优化,Caspar试图降低手写高性能CUDA求解器的门槛:用户用Python/SymForce定义含李群操作的符号残差,系统通过DABSEG中间表示、符号化稀疏优化、自适应重排和内存访问优化生成CUDA核与求解接口。在BAL束调整实验中,其相较Ceres、DeepLM、MegBA等达到同等精度所需时间快约5–20倍,并通常占用更少显存,但结论主要基于束调整任务,跨任务泛化仍待验证。

Prior Availability in Industrial Visual Sim-to-Real: A Review of CAD-Guided and CAD-Unavailable Regimes Figure 1
2026-06-01cs.CV

Prior Availability in Industrial Visual Sim-to-Real: A Review of CAD-Guided and CAD-Unavailable Regimes

Chenxi Tao, Seung-Kyum Choi

George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology

2026-06-01机器人

本文针对工业视觉 sim-to-real 常被简化为“合成到真实图像迁移”的问题,提出按先验可用性重组综述:区分 CAD 可用、CAD 不可用与边界先验场景。核心洞察是 CAD 不只是生成数据,还提供测试时几何校验;无 CAD 时只能依赖正常性建模和特征偏差。基于 T-LESS/BOP、MVTec AD、VisA 的经验锚点显示,单纯增加 CAD 渲染量不足以闭合域差,源分布设计、模型容量和少量真实校准更关键。

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode Figure 1
2026-06-01cs.AR

Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode

Josef Chen

2026-06-01学习理论

面向机器人、车载与端侧助手等无法批处理的 batch-1 单流 LLM 解码,论文质疑“只受 HBM 带宽限制”的部署假设。其核心洞察是快 GPU 上延迟还受 CUDA 启动开销与量化运行时实现制约:44 组实验中 L4 可达约 81% 内存地板而 H100 仅约 27%;CUDA Graphs 在 H100 提速 1.259×、L4 仅 1.028×;L4 上 GPTQ+ExLlamaV2 将 Qwen-2.5-7B 从 62.32 ms/步降至 17.36 ms/步,接近 H100 图化后的 11.78 ms/步。

Any-ttach: Quick End-effector Swapping Enables Manipulation Dexterity with Simplicity Figure 1
2026-06-01cs.RO

Any-ttach: Quick End-effector Swapping Enables Manipulation Dexterity with Simplicity

Weizhe Ni, Jinzhou Li, Haoyu Li, Cody Andres Alessio-Bunnell, Wenjing Pan, Xianyi Cheng

*These authors contributed equally to this work. 1 Department of Mechanical Engineering and Materials Science, Duke University, Durham, NC 27708, USA.

2026-06-01机器人

针对高自由度灵巧手把操作能力与复杂硬件、接触控制强耦合的问题,Any-ttach提出以工具为中心的路线:让1-DoF平行夹爪通过低成本自动快换接口稳定连接日常工具、铰接工具乃至仿人手,并配合共享接口的人类示教装置和分层工具-技能规划。实验显示该机械约束连接提升换装可靠性、降低工具位姿波动、提高示教效率,并在三明治制作和黄瓜处理等长时序任务中组合6个工具子技能完成操作。

ARISTO Hand: Sensing-Driven Distal Hyperextension for Fine-Grained Manipulation Figure 1
2026-06-01cs.RO

ARISTO Hand: Sensing-Driven Distal Hyperextension for Fine-Grained Manipulation

Aaron Kim, Dong Ho Kang, Mark Helwig, Mingyo Seo, Kazuto Yokoyama, Tetsuya Narita, Luis Sentis

2026-06-01机器人

面向薄片、小边缘等日常精细操作中接触几何难控制、力感知不可靠的问题,ARISTO Hand 将可主动远端过伸的腱驱手指与“刚性传感指甲+软电容触觉阵列”结合,使指尖可贴合平面并区分边缘/指腹接触。实验显示,在 1–20 mm 物体上过伸将拉出力提升 2.76 倍,并在 SD 卡拔插任务中验证了边缘力测量和稳定抓取能力。

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments Figure 1
2026-06-01cs.RO

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

Shivendra Agrawal, Bradley Hayes

University of Colorado Boulder

2026-06-01视觉语言视觉感知强化学习安全鲁棒

针对商店、办公室等几何重复且物体会变化的室内场景,传统 AMCL 和固定类别语义定位易陷入全局歧义。VLM-GLoc 将 VLM 作为开放词汇语义观测器,把图像转成细粒度文本嵌入,并用反向语义提议初始化粒子,再分层融合几何一致性。真实超市和实验室测试中,全局定位成功率达 70% 和 74%,明显高于几何或固定类别基线。

Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics Figure 1
2026-06-01cs.RO

Physics-informed Goal-Conditioned Reinforcement Learning under Hybrid Contact Dynamics

Vittorio Giammarino, Anastasios Manganaris, Ahmed H. Qureshi

Department of Computer Science, Purdue University

2026-06-01强化学习

这篇论文关注稀疏奖励目标条件强化学习在接触丰富操作中失效的问题:混合接触动力学会带来模式依赖可控性和非光滑价值景观,使直接套用 Eikonal/PDE 物理正则可能与真实动力学不匹配。作者据此提出接触感知残差和层级分解,只在可行方向或完全可控表征上施加物理约束。离线操作实验显示其优于朴素全状态正则,并给出初步真实机器人数据验证。

CoMo3R-SLAM: Collaborative Monocular Dense SLAM with Learned 3D Reconstruction Priors for Outdoor Multi-Agent Systems Figure 1
2026-06-01cs.RO

CoMo3R-SLAM: Collaborative Monocular Dense SLAM with Learned 3D Reconstruction Priors for Outdoor Multi-Agent Systems

Zhihao Cao, Qi Shao, Shuhao Zhai, Feng Tian, Anh Nguyen, Hesheng Wang, Baoru Huang

University of Liverpool, Harbin Engineering University, University of Ottawa, Shanghai Jiao Tong University, Imperial College London

2026-06-01三维

面向户外多机器人协同建图,论文针对RGB-D传感器负担大、单目存在尺度歧义且跨机器人匹配易失效的问题,提出CoMo3R-SLAM:用学习式3D重建先验提供稠密点图、软尺度锚和几何对应,并结合跨智能体点图验证、Sim(3)同步与全局BA。在Tanks and Temples与Waymo上,其ATE达到或接近最佳,部分场景超过RGB-D方法,并可在线约8 FPS运行。

ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation Figure 1
2026-06-01cs.RO

ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation

Zeyuan He, Bowen Yang, Zhirui Fang, Keru Zhou, Lei Jiang, Jingjing Qian, Fan Mo, Junchi Yan, Philip Torr, Xiu Li, Li Jiang, Jialin Yu

2026-06-01视觉语言视觉感知

针对现有 VLA 机器人策略多从当前观测反应式预测动作、缺少未来动力学建模而在分布外扰动下泛化不足的问题,ELAN4D 用机器人关节和末端等关键点的未来 3D 位移轨迹作为具身中心的 4D 监督,并通过带梯度隔离的 ControlNet 式辅助分支注入训练,推理时丢弃轨迹解码器、接口不变。论文在 LIBERO、LIBERO-Plus、RoboTwin2.0 和真实任务中报告了相对强基线的稳定提升,尤其在相机、背景和布局变化下收益更明显。

Learning-Based Navigation for Indoor Mobile Robots Figure 1
2026-06-01cs.RO

Learning-Based Navigation for Indoor Mobile Robots

Tri-Tin Nguyen, Tien-Dat Nguyen, Gia-Uy Le, Vinh Nguyen, Vinh-Hao Nguyen

2026-06-01机器人

针对室内移动机器人中传统全局/局部规划依赖手工规则、在拥挤障碍场景中易保守的问题,论文提出分层学习式导航:用代价感知 A* 轨迹监督训练神经全局规划器,并让局部策略在 DWA 可行动作格上做离散选择,经行为克隆和带可行性掩码的 PPO 微调。仿真与真实室内实验显示,该方法能生成可行全局路径和更平滑可靠的避障控制,相比传统 DWA 改善路径质量。

Structured interactions improve distributed coordination beyond model scaling in a real-world multi-robot system Figure 1
2026-06-01cs.RO

Structured interactions improve distributed coordination beyond model scaling in a real-world multi-robot system

Junping Wang, Zhizhong Zhang, Yongqiang Tang, Geng Zheng, Jiaming Zhang, Shiji Song, Yanmei Li, Yushan Ma

*State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, No.95, School of Artificial Intelligence, University of Chinese Academy of, School of Computer Science and Technology, East China Normal, University, No.1663 Zhongshan North Road, Putuo District, Shanghai, Department of Automation, Tsinghua University, Qinghuayuan Street, Liupanshan Laboratory, Ningxia University, No.489, Helanshan West, ants possessing only about 250,000 neurons, build elaborate nests and forage, scale of their parts, but the structure of their interactions. Similarly, schools of fish

2026-06-01机器人强化学习

论文针对多机器人中“扩大神经网络是否比改通信方式更有效”的问题,在10台真实TurtleBot协同搬运与建图任务中独立操控模型规模和通信拓扑。核心洞察是把结构化交互作为系统级变量:模块层级/小世界拓扑比全连接更能平衡局部自治与全局协同。结果显示,全连接切换到模块层级带来约47分性能增益,而隐藏层从32扩到512最多仅增9分,并提升抗噪声和掉队鲁棒性;但1024以上饱和主要来自仿真外推,仍需实体验证。

Reinterpreting Safety Thresholds as Neuron Spiking Thresholds Figure 1
2026-06-01cs.NE

Reinterpreting Safety Thresholds as Neuron Spiking Thresholds

Enrico Del Re, Mohamed Sabry, Cristina Olaverri-Monreal

Johannes Kepler University Linz, Austria

2026-06-01安全鲁棒

论文针对自动驾驶安全评估中固定 SSM 阈值难以刻画“持续临界压力”和“短时高风险峰值”的问题,将阈值重释为 LIF 神经元的脉冲触发阈值,并用 SNN 融合多种安全指标来对齐人类制动起点。基于 CARLA/Unreal 与 6-DOF 平台的跟车实验,模型脉冲活动与不同场景下的刹车行为较一致,且显示阈值较稳定、衰减因子反映个体时间敏感性。

2026-05-29

43 篇
DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation Figure 1
2026-05-29cs.RO

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang

Seoul National University, University of Maryland, College Park, Georgia Institute of Technology

2026-05-29机器人

这篇论文针对机器人操作中常用静态视觉/视觉语言编码器缺乏动作动态感知、易关注控制无关区域的问题,提出 DynaFLIP:用人类与机器人视频构造图像转移、语言和 3D flow 三模态监督,通过单纯形体积最小化结合余弦正则与对比学习,训练测试时仅需图像的视觉骨干。实验显示其在仿真和真实任务、多种策略含 VLA 上优于基线,OOD 场景最高提升 22.5%。

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field Figure 1
2026-05-29cs.CV

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

Shangjie Xue, Jesse Dill, Dhruv Ahuja, Frank Dellaert, Panagiotis Tsiotras, Danfei Xu

Georgia Institute of Technology

2026-05-29三维安全鲁棒

面向机器人主动建图,论文指出3DGS在训练视角未覆盖区域常低估不确定性,影响下一视角规划。GAVIS将每个高斯粒子相对训练视角的各向异性可见性用球谐显式表示,并接入贝叶斯网络式不确定性感知光栅化,以最大信息增益选视角。多类室内、合成与空间场景实验显示其重建质量、可见覆盖和不确定性评估速度均优于FisherRF、VIMC、NVF,且可作为后处理增强既有方法。

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving Figure 1
2026-05-29cs.RO

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

University of Massachusetts Amherst 2 Princeton University, Stanford University 4 Carnegie Mellon University

2026-05-29机器人

现有机器人基准多考察既定条件下的抓取、推动等技能,难以诊断模型在意外约束下的推理与策略修正能力。RoboWits提出双臂创造性问题求解基准,并用多智能体流水线自动生成种子任务、变体场景和评测指标,覆盖几何、材料与装配推理的208个任务。实验显示,预训练VLA经单任务微调可在种子任务上初步成功,但在变体任务上明显脆弱,即使有oracle状态的VLM规划器也泛化不足。

A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms Figure 1
2026-05-29cs.RO

A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms

Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu, Zheng Li, XiLin Fang, Tingyu Cui, Shengcheng Fu, Haoyang Li, Anqi Wang, Zifan Wang, Dongjie Zhu, Chenyu Cao, Zhenbiao Huang, Ziang Zheng, Jie Lu, Xin Ma, Zhengyang Wei, Xiang Zhao, Tianyue Zhan, Ye He, Yuxiang Chen, Yizhou Jiang, Yue Li, Haizhou Ge, Yuhang Dong, Fan Jia, Ziheng Zhang, Meng Zhang, Xiwa Deng, Zhixing Chen, Hanyang Shao, Chenxin Dong, Yixuan Li, Yizhi Chen, Bokui Chen, Kaifeng Zhang, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Xiang Li, Yue Gao, Guyue Zhou

2026-05-29机器人强化学习

这篇论文针对机器人强化学习训练被默认绑定到 GPU 物理仿真的趋势,指出瓶颈应从端到端仿真—学习闭环而非单一仿真器速度来分析。作者提出 UniLab,用 CPU 批量刚体仿真配合 GPU 策略学习,并通过统一运行时处理数据搬运、缓冲和同步,支持多种 RL 算法与后端。实验报告在相同工作站上获得 3–10 倍训练效率提升,并可运行于 macOS、ROCm 和 Intel XPU,说明高效训练不必依赖 CUDA/GPU 驻留物理。

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation Figure 1
2026-05-29cs.RO

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng Li, Jianfei Yang

2026-05-29机器人视觉语言视觉感知

本文针对语言指令在相似目标选择、细粒度作用位置和执行中意图变化上表达不足的问题,提出 Gaze2Act,将人的第一视角注视通过免标记跨视角语义匹配映射到机器人视角,生成目标掩码与注视点,并在感知提示和动作条件中显式融入 VLA 策略。Unitree G1 上覆盖 7 类、16 个真实任务的实验显示,其在意图准确率和任务成功率上优于语言控制及语言派生掩码基线,尤其改善目标消歧、精细交互和动态意图引导。

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments Figure 1
2026-05-29cs.RO

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

Robot trajectories provide direct action supervision, egocentric human data supplies scalable real-world, synthetic simulation improves controllability and out-of-distribution coverage, and vision-language

2026-05-29机器人视觉语言视觉感知

Qwen-VLA针对具身模型常被拆分为操控、导航或特定机器人策略、难以跨任务和本体泛化的问题,将Qwen3.5视觉语言骨干接入DiT/flow-matching动作解码器,并用本体感知提示与统一动作/轨迹空间联合训练多源机器人、人类、仿真和导航数据。实验显示其在LIBERO达97.9%、Simpler-WidowX达73.7%、R2R OSR达69.0%,真实ALOHA OOD平均成功率76.9%,但增益可能主要来自大规模数据与训练配方。

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models Figure 1
2026-05-29cs.RO

BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models

Zhongxi Chen, Yifan Han, Yanming Shao, Huanming Liu, Congsheng Xu, Xiaoyu Chen, Yao Mu, Wenzhao Lian

Shanghai Jiao Tong University (SJTU), Shanghai AI Laboratory

2026-05-29强化学习

BORA针对灵巧手VLA在高维动作、遮挡和真实接触误差下仅靠模仿学习难以稳定执行的问题,提出离线到在线的RL后训练框架:离线用认知token与动作chunk联合的critic评估物理后果,并用少步一致性策略缓解生成式动作的信用分配;在线冻结VLA基座,通过人类介入驱动的chunk级残差适配修正执行偏差。五个真实灵巧操作任务中,平均成功率绝对提升33%,未见物体泛化最高提升43%。

Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance Figure 1
2026-05-29cs.RO

Sample-Efficient Diffusion-based Reinforcement Learning with Critic Guidance

Shutong Ding, Zejia Zhong, Zhongyi Wang, Ke Hu, Bikang Pan, Jingya Wang, Ye Shi

2026-05-29生成模型强化学习

这篇论文针对扩散策略强化学习中采样式方法收敛慢、梯度式方法易丢失多样性的矛盾,提出 CGPO:在去噪过程中直接引入 critic guidance,把动作生成推向高 Q 值区域,并用引导动作回归更新策略,同时配合价值校准和抑制过估计的 critic 目标。实验覆盖 5 个 MuJoCo 任务和 Franka 真实抓取,结果显示其优于现有扩散式 RL 与常规基线,并展示无需示教的真实机器人训练可行性。

Replicable Simulation-Based Robot Validation through Provenance Figure 1
2026-05-29cs.RO

Replicable Simulation-Based Robot Validation through Provenance

Argentina Ortega, Samuel Wiest, Frederik Pasch, Nico Hochgeschwender

2026-05-29机器人

机器人仿真验证虽便于重复运行,但配置、模型转换、日志与后处理缺乏可追溯记录,导致结果难以复现。本文将数据溯源与 FAIR 元数据前置到测试流程中,扩展 RoboVAST 自动记录制品关系,并在 Turtlebot 4 导航验证数据集上生成可查询的链接数据溯源图;主要结果是发布了一个 FAIR-by-design 数据集,并总结了词表对齐、属性选择和标准采纳等落地障碍。

Fisher-Preserving Guidance: Training-Free Manifold Constraints for Safe Diffusion Control Figure 1
2026-05-29cs.RO

Fisher-Preserving Guidance: Training-Free Manifold Constraints for Safe Diffusion Control

Hao Ren, Zetong Bi, Yiming Zeng, Le Zheng, Zhi Li, Zhaoliang Wan, Lu Qi, Hui Cheng

2026-05-29生成模型规划控制优化算法安全鲁棒

针对扩散策略在视觉导航中受测试时目标引导后容易偏离训练流形、产生不可靠或低效轨迹的问题,论文提出无需再训练的 FPG-OPS:用 Fisher 等值约束和低秩 Outer Product Span 投影限制反向扩散更新,并以 TFDS 不确定性进行多样本动作融合。实验覆盖 Maze2D、PushT、仿真与真实机器人,显示相对强扩散策略基线稳定提升且仅需单次反传级开销。

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding Figure 1
2026-05-29cs.CV

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

Luzhou Ge, Xiangyu Zhu, Jinyan Liu, Xuesong Li

2026-05-29视觉语言三维

面向长期机器人任务中动态场景的开放词汇理解与指代表达,DGSG-Mind针对跨视角实例关联脆弱、物体拓扑变化难更新的问题,将概率体素网格与3D Gaussian实例地图结合,并用几何-语义一致性做局部动态精修;其上构建层次场景图和3D Gaussian Mind,融合结构关系、空间语义与RoI渲染进行多模态推理。实验显示其在自重建地图上的零样本3D视觉定位表现最佳,并在开放词汇分割、重建和真实机器人动态更新中表现较强。

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation Figure 1
2026-05-29cs.RO

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

Institute of Artificial Intelligence, University of Bremen, Germany.

2026-05-29机器人

面向多步操作中接触时机和物体状态演化难以仅靠反应式策略把握的问题,本文提出 Future-Experience Conditioning:由本体引导的 LLM 推断任务未来,结合无机器人数字孪生 rollout 与视频扩散生成短期未来片段,并将其 latent 条件化给 BC/BC+RL 控制器。在 RoboCasa 和 CALVIN 仿真中,正确或生成的未来优于无未来,错误未来显著伤害性能,BC+RL 整体最好;但结论限于仿真,真实迁移与生成质量影响未充分说明。

Energy-Aware NECO for Single-Pass Pixel-wise Out-of-Distribution Detection in Semantic Segmentation Figure 1
2026-05-29cs.CV

Energy-Aware NECO for Single-Pass Pixel-wise Out-of-Distribution Detection in Semantic Segmentation

Boyuan Zhang, Huanshan Huang, Yifei Cao

2026-05-29视觉感知

面向移动机器人语义分割在分布外场景下既要可靠又受限于边缘算力的问题,本文提出单次前向的 Energy-Aware NECO:将解码器特征上的中心化 NECO 几何比值与 logit Energy 标准化后凸融合,弥补纯几何分数易漏检的缺陷。在 miniMUAD 像素级 OOD 上 AUROC 达 0.8539,优于 NECO、Energy 和集成熵基线,但极高召回尾部仍不如集成方法。

Joint Angle Estimation with Customized Wristband Based on Online Incremental Learning Figure 1
2026-05-29cs.RO

Joint Angle Estimation with Customized Wristband Based on Online Incremental Learning

Shuo Wang, Xiaobin Chen, Xiaoming Tao

Shuo Wang, Xiaobin Chen and Xiaoming Tao are with Research Institute for Intelligent Wearable Systems, The Hong Kong Polytechnic University, Kowloon, Hong Kong.

2026-05-29机器人

针对柔性腕带传感在实际佩戴中易受左右手、位置偏移和个体差异引发数据漂移的问题,论文设计了含四个织物应变传感器的定制腕带,并用IMU在线提供标签,通过PSO初始化的OSELM进行增量学习,采集时完成个性化校准。实验显示该系统可在多种配置下跟踪腕关节屈伸运动,平均误差约15°,部分场景R²超过0.7,但角度极值估计仍受传感器一致性和滞后影响。

MARS Policy: Multimodality Only When It Matters Figure 1
2026-05-29cs.RO

MARS Policy: Multimodality Only When It Matters

Jindou Jia, Tuo An, Yuxuan Hu, Gen Li, Jingliang Li, Bohan Hou, Xiangyu Chen, Jiaqi Bai, Bofan Lyu, Jianfei Yang

2026-05-29视觉语言强化学习

论文针对模仿学习中生成式策略虽能表达多模态动作但训练和推理昂贵、而许多任务阶段并不需要随机性的矛盾,提出 MARS:在 flow matching 中用高斯噪声与历史动作先验混合,并由模态调度网络按状态自适应注入噪声和分配推理步数。8 个仿真与 4 个真实任务显示,其保持多模态能力,同时真实实验平均成功率提升 16.67%,推理延迟降低 83.20%。

PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology Figure 1
2026-05-29cs.RO

PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology

Sergey Arkhangelskiy

2026-05-29机器人数据集/基准

论文针对真实机器人 VLA 评测常用固定超时成功率、小样本且缺少置信区间的问题,提出 PhAIL 基准:以完成时间 CDF 为基本对象,将硬失败记为无穷,并分离人类相对吞吐量 HRT 评分与宏平均 KS 显著性检验。在 Franka FR3 四物体、约 990 次回放上,KS 在 N≤30/单元时能区分 GR00T/ACT、OpenPI/ACT,而 OpenPI 与 GR00T 仍不可分;最佳 VLA 仍约比人类慢 7 倍,SmolVLA 明显最差。

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration Figure 1
2026-05-29cs.RO

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao

2026-05-29规划控制三维

面向百级无人机编队,传统简化形状表示易变形,而近似全连接协同又计算重且会传播异常个体影响。FLIP将最优编队位置序列求解转化为时空点云配准,各机器人基于他机广播轨迹分布式计算Sim(3)匹配,并用带外点剔除的RANSAC抑制失败或次优轨迹。仿真显示其可实时规划120架无人机复杂三维编队,并在近10%异常个体下保持正常成员队形。

Momentum Based Reward Design for Low Emission Traffic Signal Control Figure 1
2026-05-29cs.LG

Momentum Based Reward Design for Low Emission Traffic Signal Control

Chinmay Mundane, Amith Manoharan, Arun Singh

Institute of Technology, University of Tartu

2026-05-29强化学习规划控制

针对强化学习交通信号控制中常用延误/排队奖励易诱发短视切相、破坏车流连续性并增加排放的问题,论文提出动量型奖励 MBRF,以放行效率鼓励相位保持和车辆持续运动,而非事后惩罚拥堵。在 SUMO 单路口实验中,MBRF 取得最高吞吐量、更低队列和 CO2 排放,并在同质/异质交通下较 DQN 基线、Max Pressure 与 LQF 更稳定,但大规模路网泛化仍文中未充分说明。

EXACT-MPPI: Exact Signed-Distance Navigation for Arbitrary-Footprint Robots from Point Clouds via Path Integral Control Figure 1
2026-05-29cs.RO

EXACT-MPPI: Exact Signed-Distance Navigation for Arbitrary-Footprint Robots from Point Clouds via Path Integral Control

Chen Peng, Zhikang Ge, Wenwu Lu, Haiming Gao, Stavros Vougioukas, Peng Wei

2026-05-29机器人规划控制三维

针对带载荷或机具的地面机器人常呈非凸复杂足迹、传统栅格/膨胀近似会在窄间隙中误删可行运动的问题,EXACT-MPPI将解析精确的点到多边形有符号距离直接嵌入MPPI,从激光点云和稀疏路标生成控制,并用JAX批量GPU加速。实验显示其距离评估快于学习式基线,在凸近似失败场景保留可行通行,并可迁移到差速、Ackermann、全向和混合平台。

VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models Figure 1
2026-05-29cs.RO

VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models

Dehao Huang, Aoxiang Gu, Chengjie Zhang, Bolin Zou, Wenlong Dong, Zilang Cen, Yue Wang, Hong Zhang

2026-05-29视觉语言视觉感知

这篇论文针对开放世界机器人操作中 VLA 模型难以实时判断任务是否会成功的问题,指出集成采样和动作 token 概率既慢又不适合连续动作。VLAConf 利用冻结 VLA 的视觉/语言隐表示,加上本体状态与步数条件,用轻量 one-class 置信头单次前向输出异常分数并校准为成功置信度。LIBERO 与真实机器人实验显示其置信信号质量更好,推理效率显著高于基线。

How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments Figure 1
2026-05-29cs.RO

How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments

Ji-Hoon Hwang, Daeyoung Kim, Hyung-Suk Yoon, Dong-Wook Kim, Seung-Woo Seo

All authors are with Department of Electrical and Communication Engineering, Seoul National University, Korea

2026-05-29视觉感知

论文关注越野机器人语义分割在部署时因场景差异、颠簸导致的模糊噪声等内外部分布偏移而误判可通行区域的问题。ST-Seg的核心思路不是去除风格,而是用ImageNet学习真实风格分布并分层采样扩展源域,同时用深层纹理流形约束风格增强带来的局部纹理不稳定。实验显示其在多种偏移目标域和UGV实采场景中优于既有方法,但具体增益幅度在给定片段中未充分说明。

Learning to Feel Materials from Multisensory Tactile Data via Interpretable Models Figure 1
2026-05-29cs.RO

Learning to Feel Materials from Multisensory Tactile Data via Interpretable Models

Li Zou, Yasemin Vardar

Delft University of Technology (TU Delft), Department of Cognitive Robotics, Delft, 2628 CD, The Netherlands

2026-05-29机器人

针对机器人与触觉显示中低层触觉信号如何对应人类材质感知仍不清楚的问题,论文用 SENS3 多模态触觉数据和心理物理评分构建三段可解释模型:由按压、静触、滑动特征预测粗糙、冷热、软硬等感知属性,再分类材质,并与直接分类对照。结果显示,多探索动作融合能提升预测,热觉线索对感知建模和材质识别尤其关键,提示现有机器人手指和触觉接口应补足热与顺应性反馈。

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments Figure 1
2026-05-29cs.CV

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

Ji-Hoon Hwang, Jisung Bae, Dong-Wook Kim, Yeonkyu Lee, Seung-Woo Seo

2026-05-29视觉感知

面向越野等非结构化场景,论文指出仅用语义分割适配视觉基础模型会受任务无关特征、标注歧义和语义—物理安全错配影响,易产生危险假阳性。ViTA在SAM2上引入可学习通行提示、视角多样化训练估计不确定性,并蒸馏单目深度模型的坡度/高程风险,融合为连续通行评分;跨城市、越野和实机数据评测显示其IoU、Precision达到SOTA,并显著降低假阳性、提升跨域泛化。

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation Figure 1
2026-05-29cs.RO

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation

Victor Kowalski, Chengxi Li, Dongheui Lee

(DLR), German Aerospace Center, Wessling, Germany.Website: https://tuwien-asl.github.io/VE2VF/

2026-05-29机器人视觉感知强化学习安全鲁棒

面向接触丰富装配中视觉策略易受光照、纹理和背景变化影响的问题,VE2VF先用人类在环真实世界强化学习训练含视觉教师,再将其蒸馏为仅依赖位姿、速度和力/力矩的无视觉学生,保留视觉探索效率同时削弱视觉过拟合。在NIST装配板上,约50分钟、3个代表任务训练后总体成功率达95%,可泛化到8个未见变体,最难任务经蒸馏微调达到全成功。

Planning with the Views via Scene Self-Exploration Figure 1
2026-05-29cs.AI

Planning with the Views via Scene Self-Exploration

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Manling Li

Northwestern University, University of Washington, University of Oxford, Stanford University

2026-05-29规划控制

论文关注 VLM 是否能在真实 3D 场景中理解相机动作并进行多步视角规划,指出现有模型虽具备局部视角变化知识,却难以组合成长程计划。作者构建 ViewSuite,并提出自探索与视图图蒸馏交替训练:即使失败轨迹也可形成有效视角连通监督。该方法将 Qwen2.5-VL-7B 的交互式视角规划成功率从 2.5% 提升到 47.8%,超过 GPT-5.4 Pro 和 Gemini 3.1 Pro。

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models Figure 1
2026-05-29cs.RO

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.

2026-05-29视觉语言视觉感知

针对 VLA 在未见任务中难以迁移相似物体、场景和动作经验的问题,VLA-Pro 将每个已见任务的 LoRA 适配器存为可检索的“程序记忆”,推理时根据视觉语言上下文取回并融合相关适配器来生成动作。该方法可插拔到 π0.5、RDT、X-VLA 等骨干,在 RoboTwin、RLBench 和真实操作中提升跨任务泛化,仿真最高相对提升 207%,真实成功率由 5.8% 升至 65.0%。

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models Figure 1
2026-05-29cs.RO

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang

Tsinghua University, University of Illinois at Urbana-Champaign

2026-05-29视觉语言视觉感知生成模型

本文针对VLA在每个控制步都完整运行视觉编码器、LLM和动作头导致算力高、控制频率低的问题,提出“按阶段思考”的ElegantVLA:用轻量调度器依据表征相似度、机器人运动和任务进度,在感知语言与动作去噪间动态选择重算或复用,无需改训基模型。实验在GR00T、CogACT和真实任务中保持或提升成功率,最高仿真加速3.77倍,真实机器人计算降2.18倍、频率由13.8Hz升至26.3Hz。

3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding Figure 1
2026-05-29cs.RO

3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding

Zhongyu Xia, Yousen Tang, Bingqing Wei, Yongtao Wang

Wangxuan Institute of Computer Technology, Peking University

2026-05-29视觉语言视觉感知三维

这篇论文针对现有 VLA 主要依赖 2D 视觉、难以处理精确空间关系和遮挡的问题,提出可插拔的 3DVLA:用多视角一致的 3D 特征融合、面向对象的 3D 实例 token,以及保留预测器的掩码自监督分支来补全被遮挡视觉 token。方法不要求额外人工实例标注,并可接入多个 VLA 基线;在 LIBERO-Plus 和 RoboTwin 2.0 上均带来稳定且显著的操作成功率提升。

A Progress-Aware Leader-Follower Midair Docking System for Dual-Drone Aerial Manipulation Figure 1
2026-05-29cs.RO

A Progress-Aware Leader-Follower Midair Docking System for Dual-Drone Aerial Manipulation

Yifan Cai, Jan Ming Kevin Tan, Xiangqi Li, Chenzhe Jin, Narsimlu Kemsaram, Valerio Modugno

2026-05-29机器人

面向微型无人机在空中自组装、载荷交接和协同搬运中难以稳定对接的问题,论文将对接视为接近、对准、捕获、稳定的多阶段任务,提出带进度感知门控的主从双机系统,结合轻量磁吸框架、同步设定点和ROS 2/Crazyflie/PX4日志管线。仿真与室内动捕实验证明其可重复完成接近与磁吸对接,并以队形误差、偏航一致性、对接时间和失败模式量化可靠性。

Decoupled Thrust-Axis Attitude Control Using Quaternions for Chandrayaan-3 Lunar Landing Mission Figure 1
2026-05-29eess.SY

Decoupled Thrust-Axis Attitude Control Using Quaternions for Chandrayaan-3 Lunar Landing Mission

Aditya Rallapalli, Suraj Kumar, Rijesh M P, Ashok Kumar Kakula, Bharat Kumar GVP

2026-05-29规划控制

针对月球着陆中四元数姿态控制会把推力轴对准与绕推力轴滚转耦合、在大角度传感器指向需求下干扰制导的问题,论文提出解析式解耦的四元数推力轴控制,将横向推力轴跟踪与任务滚转约束独立处理。高保真仿真、蒙特卡洛及地面/HIL测试显示,该方法在大滚转命令下显著减小轨迹偏差并提升终端精度。

Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation Figure 1
2026-05-29cs.RO

Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation

Dayuan Chen, Kai Tang, Yukuan Zhang, Kazuhiro Kosuge, Yasuhisa Hirata

2026-05-29机器人模仿学习安全鲁棒

针对长程柔性物体操作中视觉状态别名导致模仿学习策略在相似观测下输出相反动作、且难以自恢复的问题,论文将任务阶段通过 FiLM 注入 ACT 编码器,并用融合视觉、力和位姿的阶段预测器闭环触发恢复轨迹,配合阻抗控制执行。在双臂 T 恤悬挂/取下实验中,FiLM 优于无条件和 token 条件基线,悬挂成功率由 56% 提升到 87%。

Decentralized LLM-Driven Coordination of Acoustic Robots for Contactless Object Manipulation Figure 1
2026-05-29cs.RO

Decentralized LLM-Driven Coordination of Acoustic Robots for Contactless Object Manipulation

Yingying Wang, Narsimlu Kemsaram, Sriram Subramanian

2026-05-29机器人

面向医疗、实验室等需无接触搬运且非专家也能下达任务的场景,论文提出将语音识别、LLM 语义解析、JSON 任务表示和 ROS2 分布式调度结合,用多台搭载超声相控阵的 TurtleBot3 执行顺序、并行与同步声学操控。实验中顺序任务成功率 96%、并行 86%、同步协作 70%,说明自然语言到分布式接触式动作可行,但同步搬运仍受对齐与时序误差限制。

The Open Motion Planning Library 2.0 Figure 1
2026-05-29cs.RO

The Open Motion Planning Library 2.0

Weihang Guo, Theodoros Tyrovouzis, Emiliano Flores, Clayton W. Ramsey, Zachary K. Kingston, Ioan A. Şucan, Mark Moll, Lydia E. Kavraki

2026-05-29规划控制

针对采样式运动规划算法复现、基准比较困难且实时机器人应用对低延迟规划需求上升的问题,论文介绍 OMPL 2.0 的演进:在原有模块化抽象上扩展最优/惰性/约束/时序逻辑规划与更多状态空间,并集成 VAMP、CAPT 等 SIMD 加速碰撞检测和运动学。结果显示其可在部分场景达到微秒级求解、千赫兹级解率,并继续作为 MoveIt 等生态的通用规划基座。

MonoDuo: Using One Robot Arm to Learn Bimanual Policies Figure 1
2026-05-29cs.RO

MonoDuo: Using One Robot Arm to Learn Bimanual Policies

Sandeep Bajamahal, Lawrence Yunliang Chen, Toru Lin, Zehan Ma, Jitendra Malik, Ken Goldberg

University of California, Berkeley

2026-05-29机器人

双臂操作受限于双臂硬件和示教数据稀缺,而单臂机器人更常见。MonoDuo让单臂机器人与人协作采集左右角色互换的示教,再用手部姿态估计、分割和补全生成目标双臂机器人的合成示教,并混合真实机器人动作与人手重定向动作。五个任务中对未见双臂配置零样本成功率达35%–70%,加入25条目标示教微调后较从零训练提升约65%–70%。

Extreme dynamic symmetry enables omnidirectional and multifunctional robots Figure 1
2026-05-29cs.RO

Extreme dynamic symmetry enables omnidirectional and multifunctional robots

Jiaxun Liu, Boxi Xia, Boyuan Chen

Department of Mechanical Engineering and Materials Science, Duke University, Department of Electrical and Computer Engineering, Duke University, Department of Computer Science, Duke University

2026-05-29机器人

针对机器人设计长期偏重几何对称、难以保证任意方向作用能力的问题,论文提出“动态对称性”并用质心可达加速度集合的动态各向同性来量化。作者通过1500余种仿真形态和Argus球形多足平台验证:20腿近极限各向同性原型可实现姿态无关运动、复杂地形通过、自稳定、部分执行器失效下恢复及全向感知交互,但真实物体操作仍受ToF传感器热失步限制。

Distributed Non-Uniform Scaling Control of Multi-Agent Formation with Dynamic Agent Joining Figure 1
2026-05-29eess.SY

Distributed Non-Uniform Scaling Control of Multi-Agent Formation with Dynamic Agent Joining

Tao He, Gangshan Jing

2026-05-29规划控制

针对现有基于拉普拉斯的非均匀编队缩放多假设智能体集合固定、难以支持任务中扩队的问题,论文把矩阵值约束与谱图理论结合,提出在任意维度下新智能体加入时的动态拉普拉斯构造与分布式加入协议,使局部更新仍保持半正定性和目标形状零空间等谱性质。仿真验证了编队在非均匀缩放机动中可接纳新成员并收敛到期望形状,但实证规模和真实机器人验证文中未充分说明。

CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control Figure 1
2026-05-29cs.RO

CA-AC-MPC: CUDA-Accelerated Actor-Critic Model Predictive Control

Antoonio Buo, Vittorio Cammarota, Michele Avagnale, Pierluigi Arpenti, Vincenzo Lippiello, Fabio Ruggiero

2026-05-29规划控制

针对 AC-MPC 将可微 MPC 嵌入 actor 后在前向求解和反向梯度传播中反复解优化问题、导致训练与推理延迟高的问题,论文将 iLQR 型 DiffMPC 重写为 C++/CUDA PyTorch 扩展,用融合 kernel 覆盖 rollout/线性化、带盒约束 Riccati 后向传递和线搜索 rollout,以减少 Python 层时域递归与 kernel 调度开销。无人机竞速仿真中,CA-AC-MPC 在保持或接近原 AC-MPC 控制性能的同时获得一到两个数量级的端到端加速,并达到接近极限动态的领先圈速。

Learning and Adaptation in Wire Arc Additive Manufacturing Bead Geometry Control Figure 1
2026-05-29cs.RO

Learning and Adaptation in Wire Arc Additive Manufacturing Bead Geometry Control

Chen-Lung Lu, John Wen

2026-05-29规划控制

针对 WAAM 中热积累与熔池动态导致的焊道高度、宽度难以同时稳定控制,论文将焊枪速度和送丝率到几何输出建模为 MIMO 动态系统,用简单 RNN 直接进入一步预测控制,并利用上一层预测误差在线微调以适应热状态变化。机器人平台与线扫描反馈实验显示,相比恒定输入和静态模型基线,RNN 控制显著提升高度与宽度一致性;自适应主要进一步改善高度,宽度仍受热波动和耦合效应限制。

Multi-Resolution End-to-End Deep Neural Network for Optimizing Latency-Accuracy Tradeoff in Autonomous Driving Figure 1
2026-05-29cs.RO

Multi-Resolution End-to-End Deep Neural Network for Optimizing Latency-Accuracy Tradeoff in Autonomous Driving

Qitao Weng, Heechul Yun

2026-05-29机器人

本文关注端到端自动驾驶中输入分辨率带来的延迟—精度—安全权衡:车道巡航与路口等场景对细节和响应速度需求不同,固定分辨率易失效。作者在 WoR 单目策略上加入共享卷积、按分辨率独立 BN 的多分辨率骨干,可在延迟预算下运行时选尺度,并支持无原始数据的分辨率重定向。CARLA 实验显示,相比固定分辨率基线,车道侵入、闯红灯和碰撞等路线安全指标更优,但切换触发仍依赖 oracle,真实硬件泛化文中未充分说明。

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving Figure 1
2026-05-29cs.CR

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr

University of Massachusetts Amherst

2026-05-29视觉语言视觉感知

该文关注带显式推理的自动驾驶 VLA 在真实文本接口噪声下的安全性:语音转写、大小写或字符扰动可能不只影响语言理解,还会破坏推理—轨迹耦合。作者以 NVIDIA Alpamayo 为对象做黑盒闭环评测,提出同时衡量推理语义/结构变化与碰撞、越界等安全指标的 ReasonBreak 基准。结果显示文本扰动可使推理攻击成功率最高 89%、轨迹操纵最高 72%,且推理变化与轨迹偏移相关性较弱,提示推理本身是独立攻击面;简单输入规范化可缓解但不足以覆盖自适应或多模态攻击。

Human-in-the-Loop Swarms: A Bionic Swarm Approach to Real-World Soil Mapping Figure 1
2026-05-29cs.RO

Human-in-the-Loop Swarms: A Bionic Swarm Approach to Real-World Soil Mapping

Petras Swissler, Mohammadali Rashidioun, Nicholas Sahu, Raaid Kabir, Ayodeji Aderibigbe, Oladoyin Kolawole

2026-05-29强化学习

针对群体/野外机器人真实验证成本高、硬件开发周期长的问题,本文提出“仿生群体”框架:由人携带手机网页端和蓝牙传感器执行移动与采样,服务器集中运行群体算法并下发指令,从而把非核心的机器人执行难题外包给人。作者以土壤测绘为场景设计 Score-Biased-Search,按重建地图位置评分引导搜索;仿真显示随代理数增加出现超线性地图重建收益,并在户外实验证明该人机闭环平台可用于快速验证群体搜索算法。

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models Figure 1
2026-05-29cs.CV

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

CFCS, School of CS, PKU, Technology Co., Ltd, both a systematic evaluation framework and a scalable data solu-, surements are available [4]. These constraints have long hindered

2026-05-29视觉感知数据集/基准三维

这篇论文针对现有 VLM 会描述“左右前后”却难以支撑机器人抓取、轨迹等低层三维交互的问题,提出 Embodied3DBench:用高保真仿真生成带细粒度 3D 标注的 2.1 万问答,覆盖定位、空间关系、多视角对应、可供性、抓取点和轨迹六类任务。对 13 个模型的评测显示,高层空间关系较强但度量定位和交互先验仍脆弱;作者还合成 130 万训练问答,微调后低层空间能力显著提升,增益可能主要来自数据。

Ultra-Reduced-Impact-Encased-Logging (URIEL): propose a new method for selective sustainable logging and post-harvest silvicultural treatment in tropical forest using airborne robotics systems Figure 1
2026-05-29cs.AI

Ultra-Reduced-Impact-Encased-Logging (URIEL): propose a new method for selective sustainable logging and post-harvest silvicultural treatment in tropical forest using airborne robotics systems

Daniel Albiero, Gelton Fernando de Morais, Daniela Han, Flávio Roberto de Freitas Gonçalves, Artur Vitório Andrade Santos, Wesllen Lins de Araújo, Alessandra Maia Freire, Cláudio Kiyoshi Umezu, Mateus Peressin, Francesco Toscano, Admilson Írio Ribeiro, Alfeu J. Sguarezi Filho, Américo Ferraz Dias Neto, Angel Pontin Garcia

School of Agricultural Engineering, University of Campinas (UNICAMP), Campinas, 13083-875, Brazil, School of Mechanical Engineering, University of Campinas (UNICAMP), Campinas, 13083-875, Brazil, Depart. of Agricultural, Forestry, Food and Environmental Sciences, University of Basilicata, Viale Dell'Ateneo Lucano 10, 85100, Italy, Sorocaba Environmental Engineering, São Paulo State University (UNESP), Sorocaba, 18087-180, Brazil, Center for Engineering, Modeling and Applied Social Sciences, Federal University of ABC (UFABC), Santo André, 09280-560, Brazil

2026-05-29机器人三维

面向热带森林采伐导致的生态破坏与可持续经营难题,本文提出 URIEL:将直升机集材、空中机器人、AI 与采后无人机育林处理结合,试图以选择性采伐减少道路和地表扰动。作者完成设备概念设计、数字样机仿真和不同直升机—木材—距离组合的经济分析,结果称其具备较高经济可行性,并可近乎消除附带林分损伤;但落地仍依赖产业、政府、认证企业与原住民等多方协同。

2026-05-28

60 篇
Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Representation Figure 1
2026-05-28cs.RO

Beyond Binary: Sim-to-Real Dexterous Manipulation with Physics-Grounded Contact Representation

Jiahe Pan, Stelian Coros, Jitendra Malik, Toru Lin

2026-05-28机器人

针对接触丰富灵巧操作中真实触觉数据难采集、原始触觉又难以仿真迁移的问题,论文提出以压力中心 CoP 将指尖触觉压缩为三维接触力和接触位置,并用可微动力学校准 taxel 方向以对齐仿真与硬件。在盲插孔和球平衡任务中,CoP 条件策略实现多指手零样本 sim-to-real,优于二值接触和原始 taxel 基线,并显示出对物体质量等物理属性的隐式编码。

Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following Figure 1
2026-05-28cs.RO

Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following

Xucheng Wang, Zhizhou Yang, Xiaoman Zhang, Sung Eun Kim, Romain Hardy, Pranav Rajpurkar

\addr 1 Department of Biomedical Informatics, Harvard Medical School, \addr 2 Department of Surgery

2026-05-28机器人强化学习模仿学习数据集/基准

针对开放手术中缝合跟线这一重复但依赖熟练助手的环节,论文将其建模为机器人床旁协作任务,并用160段遥操作示范系统比较ACT、Diffusion Policy、SmolVLA和π0在数据量、视角与背景变化下的表现。结果显示理想条件成功率约50–75%,主要失败来自深度感知;带预训练视觉语言骨干的π0更省数据、更抗背景扰动,并在外科医生协作试验中完成23/25针。

How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures Figure 1
2026-05-28cs.RO

How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures

Krishnam Gupta

2026-05-28机器人

针对VLA输出到电机之间缺乏系统监控的问题,本文用无需训练、黑盒的SafeContract在PushT和ALOHA上比较VQ-BeT、Diffusion Policy与ACT,指出失败信号具有架构特异性:方向反转率在三类模型中均强预测失败,jerk只对离散/分块模型有效,而常用速度违规检测几乎不预测失败,尤其对连续模型接近随机,说明监控器需按架构选择。

Integrated Exploration-Aware UAV Route Optimization and Path Planning Figure 1
2026-05-28cs.RO

Integrated Exploration-Aware UAV Route Optimization and Path Planning

Jimin Choi, Grant Stagg, Cameron K. Peterson, Max Z. Li

2026-05-28规划控制优化算法

面向灾害、 wildfire、污染等场景中无人机续航有限且先验危险报告位置不准的问题,本文将报告建模为不确定ROI和连续风险场,联合求解ROI路由、伪节点覆盖增强、分段预算分配与B样条信息路径,并用在线信念更新触发重规划。仿真48组配置显示,在线重规划的平均KL降低较离线规划提升15.9%,较直线路径提升48.6%,但仍主要验证于合成单机场景。

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation Figure 1
2026-05-28cs.RO

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

State Key Lab of Processors, Institute of Computing Technology, CAS, Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS, University of Chinese Academy of Sciences, Intelligent Software Research Center, Institute of Software, CAS, University of Science and Technology of China

2026-05-28机器人

论文针对VLA微调中“指令直接到控制”易记忆整段轨迹、数据效率低且跨任务泛化弱的问题,提出PrimitiveVLA:将示教自动拆解为11类可复用运动原语,并用MCR统一原语指令与对象掩码;推理时由VLM规划原语序列、LLM生成切换逻辑闭环组装。实验称在Libero-90上OpenVLA提升9.2%,数据效率约翻倍,未见任务提升6×,长程任务成功率由30.50%升至80.25%。

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving Figure 1
2026-05-28cs.RO

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

2026-05-28强化学习安全鲁棒

针对自动驾驶中 DRL 随机探索不安全且收敛慢、纯 LLM 决策又难以实时的问题,SARAD 用 RAG 检索的专家驾驶知识引导探索,并通过注意力判别器把 LLM 先验动作并入策略优化;同时加入基于历史碰撞数据微调的碰撞预测与规则回退安全层。文中在 Highway-Env 上报告了更高累计奖励、更快收敛和更低碰撞风险,但真实道路泛化仍未充分说明。

SPRINT: Efficient Spectral Priors for Humanoid Athletic Sprints Figure 1
2026-05-28cs.RO

SPRINT: Efficient Spectral Priors for Humanoid Athletic Sprints

Yantong Wei, Kaihong Huang, Hainan Pan, Jiawei Luo, Jiawei Zhou, Ziyan Mai, Zhiwen Zeng, Yaonan Wang, Huimin Lu

2026-05-28机器人

面向人形机器人高速冲刺中可用人体运动数据少、控制易失稳且步态切换不连续的问题,SPRINT将行走/慢跑/跑步的周期性转到频域,用仅5段参考动作训练速度自适应谱先验,并与低层残差稳定控制结合生成可行关节轨迹。实验在Unitree G1上实现零样本仿真到真实迁移,最高达6 m/s,并能在0–6 m/s间平滑切换且保持较自然运动形态。

What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies Figure 1
2026-05-28cs.RO

What Frozen VLAs Already Know About Success: A Probing Study of Value-Like Structure in Foundation Robot Policies

Jiachen Zhang (1 and 2), Junnan Nie (1), Junyi Lao (1), Wei Cheng (1), Chenghao Liu (1), Jiaxin Jiang (2), Songfang Huang (1) ((1) Peking University, (2) China Agricultural University)

2026-05-28机器人

这篇论文追问仅以模仿学习训练的 VLA 是否暗含“成功概率/价值”信息,而不只是动作生成器。作者用冻结的 OpenVLA、Pi0.5、CLIP、DINOv2 特征训练轻量线性探针读取轨迹成败信号,并用同任务同时间步匹配排除任务身份和时间进度捷径。结果显示 Pi0.5 探针仍有约 92% 配对排序准确率;作为测试时动作前缀选择器,可将 push-plate 成功率从 26.7% 提到 44.3%,但收益非普适且计算开销较高。

Mag-VLA: Vision-Language-Action Model for Bimanual Magnetically Actuated Microrobot Manipulation Figure 1
2026-05-28cs.RO

Mag-VLA: Vision-Language-Action Model for Bimanual Magnetically Actuated Microrobot Manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

*Equal contributions. All authors are with the Department of Bioengineering, Imperial-X, Imperial College London.

2026-05-28机器人视觉语言视觉感知

针对磁驱微机器人依赖间接磁场驱动、显微视觉感知受限且双臂磁体耦合控制困难的问题,Mag-VLA 将 LoRA 适配的 Qwen2.5-VL 与运动阶段识别、阶段条件 ACT 动作块解码结合,用语言和视觉生成双臂连续轨迹。在75段遥操作数据和实机实验中,ACT 头优于扩散/流式动作头,接近成功率达90%,运输成功率随难度为80%、70%、50%。

EIT-Pneumatic Hybrid Robotic Skin for Practical and Accurate Force Map Reconstruction Figure 1
2026-05-28cs.RO

EIT-Pneumatic Hybrid Robotic Skin for Practical and Accurate Force Map Reconstruction

Junhwi Cho, Sunggyu Bae, Junghyeon Ma, Hyosang Lee, Jung Kim, Kyungseo Park

2026-05-28机器人三维

面向安全人机交互中的大面积全身触觉需求,论文针对 EIT 皮肤力估计不均匀、气动皮肤难定位的问题,提出 3D 打印与喷涂制备的 EIT–气动混合机器人皮肤,用 Tikhonov 反演提供空间线索并以单垫气压标定校准力值。载荷压入实验显示同一气垫内重建更一致,灵敏度变异系数由 0.31 降至 0.14,并在仿人机器人胸部多接触场景中保持可用。

Learning a Kinodynamic Trajectory Manifold for Impact-Aware Compliant Catching of Fast-Moving Objects Figure 1
2026-05-28cs.RO

Learning a Kinodynamic Trajectory Manifold for Impact-Aware Compliant Catching of Fast-Moving Objects

Guorui Pei, Mengshi Zhang, Xi Chen, Jinsong Wu, Jiaming Qi, Peng Zhou

2026-05-28规划控制

面向高速飞行物体抓取中反应时间短、冲击不确定和动力学约束强的问题,论文提出先用仿真强化学习采集成功且考虑缓冲的轨迹,再学习条件化低维动力学轨迹流形,在线由物体初始状态直接生成参考轨迹并配合柔顺控制。MuJoCo实验显示其相比直接策略执行有更高成功率、更低峰值冲击力,并在状态估计误差下较平稳退化;但文中尚无真实机器人验证。

A Digital Twin Framework for Virtual Visuo-Haptic Teleoperation of Complex-Shaped Optical Microrobots Figure 1
2026-05-28cs.RO

A Digital Twin Framework for Virtual Visuo-Haptic Teleoperation of Complex-Shaped Optical Microrobots

Zongcai Tan, Lan Wei, Dandan Zhang

2026-05-28机器人

针对光镊驱动复杂形状微机器人在多陷阱操作中缺少空间感知与可靠力反馈的问题,本文构建ROS连接的数字孪生双手遥操作框架,结合Isaac Sim、图像位姿/深度估计、MSDM与OTT光力模型及触觉渲染。仿真细胞递送中,触觉反馈使接触力和偏离陷阱中心距离波动分别降53.2%和55.2%,成功率由30%升至80%。

Self-Supervised Online Robot-Agnostic Traversability Estimation for Open-World Environments Figure 1
2026-05-28cs.RO

Self-Supervised Online Robot-Agnostic Traversability Estimation for Open-World Environments

Julia Hindel, Simon Bultmann, Houman Masnavi, Daniele Cattaneo, Abhinav Valada

enables robots to continuously learn from unlabeled open-, unlabeled robot experience. Our method first infers robust, the dataset, code, and trained models publicly available., Department of Computer Science, University of Freiburg, Germany., traversability labels from handcrafted proprioceptive criteria, sensors without human labeling. Commonly, cues such as flat, obtain weak terrain labels [15], other works compute a precise, available platform-dependent proprioceptive sensors should

2026-05-28机器人强化学习

面向开放野外环境中地形不断变化、离线标注和手工可通行性指标难以跨机器人泛化的问题,论文提出 COTRATE:用本体/惯性信号在线学习连续地形评分,再通过视觉特征对齐损失监督单目可通行性网络,并以多样性特征回放降低遗忘和存储开销。在两类机器人、11种地形约5万张图像及三种导航场景中,方法优于现有自监督可通行性与开放词汇分割基线,并展示跨平台迁移能力。

Tactile-Proprioceptive Sensor Fusion for Contact Wrench Estimation in Whole-Body Physical Human-Robot Interaction Figure 1
2026-05-28cs.RO

Tactile-Proprioceptive Sensor Fusion for Contact Wrench Estimation in Whole-Body Physical Human-Robot Interaction

Junha Min, Junghyeon Ma, Jiwung Kwon, Sunggyu Bae, Joohyung Kim, Kyungseo Park

2026-05-28机器人

面向全身物理人机交互中低成本、灵敏的接触力估计,论文将气动机器人皮肤的接触/定位线索与基于电机电流的本体感知融合,用触觉信号区分静摩擦残差和真实外力,并用 TCN 在线补偿粘滑滞后,从而在机器人表面重建多轴接触力。皮肤集成机械臂实验显示,相比仅触觉或仅本体方案,该方法在静态接触、运动引导和示教中提升了灵敏度与响应性。

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning Figure 1
2026-05-28cs.LG

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas Stork

2026-05-28强化学习模仿学习

针对“学习作弊”式RL教师到高维观测学生的模仿学习中,教师利用学生不可见特权信息导致不可约模仿差距的问题,论文将可模仿性转化为表示学习:并行训练教师策略与自监督对比共享嵌入,并用梯度限制、对齐和稳定损失隐藏私有信息而不改奖励。实验在暴露模仿差距的环境中较强基线提升学生表现、缩小差距,消融支持各损失项作用。

Safety-Critical Adaptive Impedance Control via Nonsmooth Control Barrier Functions under State and Input Constraints Figure 1
2026-05-28cs.RO

Safety-Critical Adaptive Impedance Control via Nonsmooth Control Barrier Functions under State and Input Constraints

Faisal Lawan, Xiaoran Han, Joaquin Carrasco, Barry Lennox, Xiaoxiao Cheng

2026-05-28规划控制优化算法安全鲁棒

面向人机交互和接触任务中模型不确定、外力扰动与关节/力矩约束并存的问题,论文提出在线自适应阻抗控制:用位置-速度组合非光滑CBF构造QP安全滤波器,并结合IT2模糊系统、扰动观测器和力矩软约束精确罚项。理论证明安全集前向不变和跟踪误差一致最终有界,7自由度机械臂仿真显示在强参数不确定和外部力作用下仍能满足约束并保持阻抗跟踪。

Accelerating Robot Path Planning via Connectivity-Preserving Region Proposal Network Figure 1
2026-05-28cs.RO

Accelerating Robot Path Planning via Connectivity-Preserving Region Proposal Network

Zhanzheng Ma, Cancan Zhao, Shuai Zhang, Bo Ouyang

2026-05-28机器人规划控制

针对采样式路径规划在大规模/窄通道环境中搜索空间过大、学习式区域建议易碎片化且拓扑不一致的问题,论文将候选区域预测改写为分割任务,提出CP-RPN:用DAT编码全局依赖、反卷积解码保细节,并以连通性与持久同调拓扑损失约束掩码,再在紧凑走廊内用Voronoi规划和局部A*兜底。实验称相较MPT候选区域缩小60.13%,平均0.11秒规划,成功率99.60%。

Magnet-Based Soft Robotic Skin Using a 3D-Printed Multi-Lattice Structure and CNN-Based Tactile Super-Resolution Figure 1
2026-05-28cs.RO

Magnet-Based Soft Robotic Skin Using a 3D-Printed Multi-Lattice Structure and CNN-Based Tactile Super-Resolution

Yunseong Bang, Joowon Park, Suan Sim, Youngjun Ryu, Sukho Park, Kyungseo Park

iments validate localization accuracy and indicate scalability to, Y. Bang, S. Sim, Y. Ryu, S. Park, and K. Park are with the Department, Institute of Science and Technology), 42988 Daegu, Republic of Korea, J. Park is with Department of Electrical, Electronic and Computer, Engineering, University of Ulsan, 93 Daehak-ro, Nam-gu, 44610 Ulsan, packed sensors, limiting scalability., scalability limitations of magnetized-film-based tactile skins., the Z-axis. To overcome the scalability and practicality lim-, (e) scalability on curved surface.

2026-05-28机器人三维

面向全身机器人皮肤在大面积、安全触碰中常受传感器裸露、盲区和低分辨率限制的问题,本文将嵌入永磁体的SLS 3D打印TPU多层晶格与稀疏霍尔阵列结合,用晶格扩散形变形成重叠感受野,并用CNN做触觉超分辨回归。在140×140 mm区域仅用16个传感器,XY平均定位误差1.13 mm、Z向0.55 mm,并展示40 Hz实时接触估计。

Chance-Constrained MPPI under State and Dynamic Object Prediction Uncertainty and the Evaluation of Collision Risk Calibration Figure 1
2026-05-28cs.RO

Chance-Constrained MPPI under State and Dynamic Object Prediction Uncertainty and the Evaluation of Collision Risk Calibration

Benjamin Serfling, Konrad Doll, Kati Radkhah-Lens

2026-05-28数据集/基准安全鲁棒

本文关注机会约束 MPPI 在动态人群导航中对“已校准”定位与感知不确定性的隐含依赖:一旦过度自信会破坏安全,过度保守又可能冻结甚至产生概率稀释。作者提出用 Brier、Log Loss 等 proper scoring rules 评估闭环碰撞风险校准,并构建 DUCCT-MPPI,同时传播机器人定位不确定性和动态障碍预测不确定性。仿真显示其在拥挤场景中较 Monte Carlo MPPI 成功率提升近 28%,且时间和社会力指标更低,但真实机器人验证仍待补充。

Identifying Explicit Parsimonious Piece-wise Polynomial Relationships in Industrial time-series: Application to manipulator robots Figure 1
2026-05-28cs.RO

Identifying Explicit Parsimonious Piece-wise Polynomial Relationships in Industrial time-series: Application to manipulator robots

Mazen Alamir, Sacha Clavel

Univ. Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab, 38000 Grenoble, France

2026-05-28机器人

面向工业机器人时序中训练场景不完整、DNN难解释且易外推失效的问题,论文把已有的稀疏隐式多项式残差模型推进为显式分段多项式预测器,通过若干“投票”划分在多项式集合中选型并平均输出。6轴机器人逆模型实验显示其精度可与DNN竞争且复杂度、计算时间低得多;4轴跨工况测试中,前三轴较Transformer显著更稳健,但第四轴同样失效,说明优势并非无条件成立。

EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation Figure 1
2026-05-28cs.RO

EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation

Arianna Alonso Bizzi, Fernando Cladera, C. J. Taylor

2026-05-28生成模型

面向事件相机在微型机器人中的低延迟运动感知,本文针对现有光流方法难以高效映射到 FPGA 的问题,提出将事件按时间桶离散为 1-bit 占用网格,并用移位寄存器、计数器和比较器并行评分离散速度假设的 EventShiftFlow。它牺牲稠密亚像素精度换取极低硬件开销:两轴流水线存储低于 13 kbit、无需 DSP/浮点/除法;合成数据方向近乎完美,真实序列四段方向准确率达 99.5%。

IMU Propagation as Preintegration Figure 1
2026-05-28cs.RO

IMU Propagation as Preintegration

Jianzhu Huai

State Key Lab of Info Engineering in Surveying, Mapping and Remote Sensing

2026-05-28机器人

这篇论文针对因子图惯性融合中预积分常被视为需单独实现、难以复用和校验的问题,指出 IMU 传播与预积分本质上是同一计算的两种表达;可用既有传播器生成预积分量、偏置雅可比和协方差,也可反向恢复状态转移矩阵。随机 IMU 序列实验显示,RK4 传播与 GTSAM 两类预积分在雅可比、协方差和转移矩阵上高度一致。

Natural Locomotion: Principle and Method Figure 1
2026-05-28cs.RO

Natural Locomotion: Principle and Method

Mirado Mortel, Luc Jaulin, Lionel Lapierre, Simon Rohou

2026-05-28机器人

论文针对被动动力学、顺应性与共振如何“选择”机器人自然步态的问题,提出以内部振子周期回归、机体位姿漂移和单周期 POE 平均功率为零来定义自然运动流形。其核心是先关闭再打开推进通道的构造:标量情形可证明 POE 闭合等价于内部回归,多自由度情形需结合模态与状态一致性。作者在 Chaplygin sleigh/摆驱动车和三体无滑系统上验证,显示固定被动结构可能不支持、支持一个或多个自然运动族。

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation Figure 1
2026-05-28cs.RO

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao, Mingchao Sun, Yanfen Shen, Zedong Chu, Zhining Gu, Wei Guo, Xiaolong Cheng, Qiming Li, Kangning Niu, Yanqing Zhu, Xiaolong Wu, Tianlun Li, Mu Xu

2026-05-28机器人视觉语言视觉感知强化学习数据集/基准

该文聚焦真实商业街区中机器人到达具体 POI 入口的“最后几米”难题,指出现有 VLN 基准粒度粗或仿真到真实差距大。核心贡献是构建基于真实采集与 3DGS 重建、接入 Isaac Sim 的 POINav-Bench,并提出将 POI 标识/入口定位与连续路点执行解耦的 Brain-Action 框架,配套 70K 标识-入口数据。实验表明该框架可用于更精细的 POI 到达评测与导航,但具体增益幅度文中片段未充分说明。

ProgVLA: Progress-Aware Robot Manipulation Skill Learning Figure 1
2026-05-28cs.RO

ProgVLA: Progress-Aware Robot Manipulation Skill Learning

Seungsu Kim, Jinyoung Choi, Seungmin Baek, Jean-Michel Renders

2026-05-28机器人

针对小型 VLA 在算力受限和长程操作中易受长多模态序列拖累的问题,ProgVLA 用两阶段 Perceiver 将视觉、语言和本体感知压缩为控制上下文,并在流匹配模仿学习中加入进度头,以剩余时域和成功权重提供内部任务进展信号。0.1B 参数模型无需大规模机器人预训练,在 LIBERO、Meta-World 的长程和高难任务上达到或超过更大预训练基线,真实玩具厨房任务平均成功率为 68%。

Natural Functional Gradients for Smooth Trajectory Optimization Figure 1
2026-05-28cs.RO

Natural Functional Gradients for Smooth Trajectory Optimization

Kisang Park, Chanwoo Kim, Kyungjae Lee, Sungjoon Choi

2026-05-28规划控制优化算法

面向狭窄、杂乱操作环境中“可行但不平滑”或“平滑但易陷局部”的轨迹优化矛盾,论文将轨迹视为 Hilbert 空间函数,用高斯平滑诱导的自然泛函梯度做零阶更新,并以蒙特卡洛估计支持黑箱碰撞/接触评估。实验显示其在受限机械臂操作中较代表性规划与优化基线提升可行率并生成更平滑轨迹,但采样开销和核协方差选择仍是主要限制。

Visualizing Latent Phase Structures in Locomotion Policies: A Multi-Environment Study with Temporal Feature Extension Figure 1
2026-05-28cs.RO

Visualizing Latent Phase Structures in Locomotion Policies: A Multi-Environment Study with Temporal Feature Extension

Daisuke Yasui, Toshitaka Matuki, Hiroshi Sato

National Defense Academy of Japan

2026-05-28机器人

论文关注深度强化学习步态策略虽能在 MuJoCo 中高效运动、但内部相位结构难解释的问题。作者将聚类特征从单步状态扩展为状态、动作、下一状态和下一动作,并在选簇数时抑制自转移,以避免相似姿态但不同后续决策被合并。实验在 Ant、HalfCheetah、Walker2D 上得到更清晰、规则的周期相位转移结构。

Provably Guaranteed Polytopic Uncertainty Quantification for SLAM Figure 1
2026-05-28cs.RO

Provably Guaranteed Polytopic Uncertainty Quantification for SLAM

Guangyang Zeng, Yulong Gao, Yuan Shen, Lingpeng Chen, Haoying Li, Guodong Shi, Junfeng Wu

School of Data Science, The Chinese University of Hong Kong, Shenzhen, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, Department of Electrical and Electronic Engineering, Imperial College London, School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney

2026-05-28安全鲁棒

面向自动驾驶、无人机等安全关键场景中 SLAM 点估计缺乏可信风险边界的问题,论文把集合成员估计与保形预测结合,用多面体统一表示位姿与地标不确定性,并设计前向建图、后向位姿跟踪和位姿复合三个可组合模块;在确定性输入边界下可证明包含真实状态,在数据校准边界下给出预设概率保证。仿真和实验显示其不确定集比近期保证式位姿 UQ 更紧,并可扩展到完整 3D-3D 地标 SLAM 流水线。

Robo-Blocks: Generative Scaffolding in End-User Design and Programming of Social Robots Figure 1
2026-05-28cs.HC

Robo-Blocks: Generative Scaffolding in End-User Design and Programming of Social Robots

Arissa J. Sato, Callie Y. Kim, Nathan Thomas White, Abhinav Maneesh, Yuqing Wang, Hui-Ru Ho, Bilge Mutlu

Department of Computer Sciences, University of Wisconsin–Madison

2026-05-28机器人生成模型

论文针对新手难以同时完成社交机器人交互规划、意图表达与程序实现的问题,提出 Robo-Blocks:把 LLM 作为“生成式脚手架”,先共创叙事,再生成可编程目标,并在积木编程、仿真和实体部署中给出提示。新手部署研究显示,该流程能帮助用户把高层故事转成机器人行为,但也出现依赖型、独立型、协作型等使用模式;当建议不匹配机器人能力或可用积木时会引发挫折,说明关键价值在于辅助构思与过渡,而非完全自动生成程序。

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving Figure 1
2026-05-28cs.CV

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving

Toomas Tahves, Mauro Bellone, Junyi Gu, Raivo Sell

Department of Mechanical and Industrial Engineering, Tallinn University of Technology, Estonia, FinEst Centre for Smart Cities, Tallinn University of Technology, Estonia, Department of Computer Science and Engineering, Universitas Mercatorum, Rome, Italy, Department of Computer Science and Engineering, Chalmers University of Technology, Gothenburg, Sweden, University of Gothenburg, SE-412 96, Sweden

2026-05-28视觉感知数据集/基准

面向自动驾驶中多模态数据缺少像素级标注、且行人/骑行者/标志等关键小类极度不均衡的问题,论文用 SAM 将 ZOD 的检测框转为语义掩码,并通过过滤、去重和人工筛选构建 2300 帧基准。基于该数据比较 CLFT 与 DeepLabV3+,CLFT-Hybrid 在 ZOD 达 48.1% mIoU;在 Iseauto 上验证到 77.5% mIoU,并显示跨传感器迁移有效,但小目标和恶劣天气仍是主要瓶颈。

STR Robot: Design of an Autonomous Mobile Robot from Simulation to Reality Figure 1
2026-05-28cs.RO

STR Robot: Design of an Autonomous Mobile Robot from Simulation to Reality

Vinh Nguyen, Gia-Uy Le, Tien-Dat Nguyen, Tri-Tin Nguyen, Vinh-Hao Nguyen

2026-05-28机器人

针对户外移动机器人直接实机调试成本高、仿真到现实迁移易受传感差异和模型误差影响的问题,论文在既有 Ackermann 底盘上构建统一自主导航栈,结合 FAST-LIVO2/FAST-LIO2 定位建图、改进 A* 路径规划与 A-GMPC 跟踪控制,并给出可复现实验设置。仿真和户外实机结果显示系统可生成较平滑安全的路径并实现可靠跟踪,但相对各模块基线的定量增益文中未充分说明。

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents Figure 1
2026-05-28cs.RO

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

Harbin Institute of Technology, Heriot-Watt University, Malaysia Campus, Fraunhofer Institute for Applied Information Technology, Soochow University, Harbin Institute of Technology School of Software Harbin China, Harbin Institute of Technology School of Computer Science and Technology Harbin China, Heriot-Watt University, Malaysia Campus School of Mathematical and Computer Sciences Malaysia, Fraunhofer Institute for Applied Information Technology Sankt Augustin Germany, Soochow University School of Future Science and Engineering Suzhou China

2026-05-28安全鲁棒

本文针对安全关键具身智能体在金丝雀发布中身份哈希漂移、导致认证与审计链失效的问题,提出 ICAN-Deploy:将“能力名称”冻结并纳入身份哈希,将“能力版本”作为可变运行态,从状态机层面保证发布窗口内身份不变。作者将其集成到 AEROS 运行治理层,并用闭式证明、AST lint 与 TLA+ 验证;在 MuJoCo 中 Franka Panda 的 100 次真实金丝雀循环里实现零身份漂移,入口延迟约 1.52–2.01 ms,而纳入版本的基线方案会漂移。

An Operator-Based Approach to STL Figure 1
2026-05-28cs.RO

An Operator-Based Approach to STL

Panagiotis Rousseas, Dimos V. Dimarogonas

2026-05-28机器人

针对现有 STL 验证与控制合成难以处理深层嵌套公式的问题,本文把 STL 满足性转化为作用在各原子谓词可达性值函数上的算子组合,而非为每个复杂片段重新构造 CBF 或可达集。核心在于给出 CBF-STL 算子的嵌套规则与逻辑树参数化,证明其可给出公式满足的充要条件,并在复杂嵌套片段仿真中展示了在线控制合成能力。

Whose Is This?: Context-Aware Object Ownership Inference with Uncertainty-Guided Questioning Figure 1
2026-05-28cs.RO

Whose Is This?: Context-Aware Object Ownership Inference with Uncertainty-Guided Questioning

Saki Hashimoto, Akira Taniguchi, Shoichi Hasegawa, Yoshinobu Hagiwara, Tadahiro Taniguchi

2026-05-28安全鲁棒

面向家庭服务机器人理解“我的杯子”等指令时难以从视觉或近期使用区分真实所有权与临时借用的问题,论文提出 COIN:用 LLM 融合用户背景与物体使用历史估计所有者,并用 conformal prediction 表示不确定性,只在含糊时提问更新语义地图。仿真家庭实验中其优于基线,Subset Accuracy 达 0.988、Mean Jaccard 达 0.991,在临时使用和共享所有权场景也保持较高鲁棒性。

SAFEVPR: Patch-Based Conformal Verification for Safe Cross-Condition Sequence Visual Place Recognition Figure 1
2026-05-28cs.RO

SAFEVPR: Patch-Based Conformal Verification for Safe Cross-Condition Sequence Visual Place Recognition

Ha Sier, Jiaqiang Zhang, Zhuo Zou, Xianjia Yu, Tomi Westerlund

Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku, Turku, Finland., Zhuo Zou is with the School of Information Science and Technology, Fudan University, Shanghai, China.

2026-05-28视觉感知安全鲁棒

面向跨光照、季节等条件下的序列视觉地点识别,论文关注 top-1 检索结果是否可安全接纳,避免错误闭环带来灾难性定位约束。SafeVPR 不训练新模型,而用冻结 DINOv2 的补丁互近邻匹配分数替代余弦相似度,并在分数分箱上做 Mondrian conformal LTT 校准。其核心洞察是判别力高不等于风险可校准;在 23 个跨条件设置中均满足 α=0.10 的经验 FDR,有均值 FDR 0.014、TPR 0.75,纹理重复场景则倾向安全拒绝。

How Should We Teach Robots? A Comparison of Kinesthetic, Joystick, and Gesture-Based Teaching Figure 1
2026-05-28cs.RO

How Should We Teach Robots? A Comparison of Kinesthetic, Joystick, and Gesture-Based Teaching

Petr Vanc, Jan Kristof Behrens, Václav Hlaváč, Karla Stepanova

Czech Institute of Informatics, Robotics and Cybernetics (CIIRC CTU)

2026-05-28机器人

面向非专家通过示范教机器人时“该用哪种输入方式”的问题,论文在同一 Robothon 操作板上比较动觉牵引、手柄遥操作与手势遥操作,并同时考察回放成功率、示范时长、NASA-TLX 负荷和常见错误。结果显示,动觉牵引在需姿态对齐和接触丰富任务中最短、负荷最低且成功率最高;手柄更适合简单取放;手势虽总体不稳,但在部分场景接近动觉,提示其可作为无接触替代方案。

Simultaneous Contact Selection and Planning for Contact-Rich Manipulation with Cascaded Optimization Figure 1
2026-05-28cs.RO

Simultaneous Contact Selection and Planning for Contact-Rich Manipulation with Cascaded Optimization

Zhe Zhang, Xingrong Diao, Haoxiang Liang, Han Yang, Bi-Ke Zhu, Dandan Zhang, Jiankun Wang

2026-05-28机器人规划控制优化算法

针对接触丰富操作中接触位置需人工给定、易陷入局部最优的问题,论文提出级联优化框架 SCSP:先用替代接触模型与离散-连续优化在线全局搜索接触点,再以其为先验实时生成冗余机械臂轨迹。仿真与真实实验显示,该方法能产生多样操作策略,并在动力学误差和感知噪声下保持较好鲁棒性,且在更复杂任务上展示一定泛化能力。

Con-DSO: Learning Short-Horizon Consistency Priors for RGB-D Direct Sparse Odometry Figure 1
2026-05-28cs.CV

Con-DSO: Learning Short-Horizon Consistency Priors for RGB-D Direct Sparse Odometry

Haolan Zhang, Thanh Nguyen Canh, Chenghao Li, Ziyan Gao, Xiongwen Jiang, Nak Young Chong

2026-05-28机器人

针对RGB-D直接视觉里程计在动态物体、遮挡、光照变化和深度噪声下易破坏光度/几何一致性的问题,Con-DSO学习相邻帧的像素级光度与深度几何不确定性,并转化为关键帧质量先验,用于支持点选择和解耦加权位姿估计。其仅用TartanAir训练,在五个RGB-D基准上零样本提升,相比直接VO基线ATE在ICL-NUIM降超20%,在多组动态/真实场景降50%–80%。

VLM-Based Advanced Rider Assistance System for Motorcycle Safety Figure 1
2026-05-28cs.RO

VLM-Based Advanced Rider Assistance System for Motorcycle Safety

Mohamed Elnoor, Francesca Baldini, Ananya Trivedi, Faizan M. Tariq, Jovin D'sa, David Isele, Sangjae Bae, Dinesh Manocha, Yosuke Sakamoto

Honda Research Institute, USA, San Jose, CA, 95134., University of Maryland, College Park, MD 20742, USA., Northeastern University, Boston, MA 02115, USA.

2026-05-28视觉语言安全鲁棒

针对摩托车对坑洼、积水等路面风险更敏感而现有 ARAS 缺少语义推理的问题,论文提出将 VLM 的场景风险理解与分割定位结合,生成面向摩托车动力学的逐像素风险图,并驱动采样式局部规划给出油门和转向建议。在 CARLA 多场景评估中,相比基线取得更高成功率和更低危险暴露,且风险图具备一定可解释性。

SANTS: A State-Adaptive Scheduler for World Action Models Figure 1
2026-05-28cs.RO

SANTS: A State-Adaptive Scheduler for World Action Models

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Xinyu Bing, Zhongxue Gan, Chunxu Tian

Fudan University, Harbin Institute of Technology, Deep Computing Era Technology Co., Ltd

2026-05-28强化学习

这篇论文针对像素空间 World Action Models 推理慢且“完整视频去噪”未必最利于控制的问题,指出动作条件应按当前状态选择噪声轨迹中的中间视频表示。SANTS 以轻量调度器联合预测停止风险和继续去噪步长,并用冻结动作分支后的路径级奖励训练,使目标对齐动作质量而非视觉保真度。实验在 RoboTwin 2.0 达到 94.4% 成功率、真实机器人七任务平均 73.1%,相对完整去噪分别降低 81.7% 和 79.0% 延迟。

Frequency-Guided Action Diffusion via Sub-Frequency Manifold Traversal Figure 1
2026-05-28cs.RO

Frequency-Guided Action Diffusion via Sub-Frequency Manifold Traversal

Junlin Wang

School of Engineering and Applied Science, University of Pennsylvania

2026-05-28生成模型

论文针对行为克隆中人类示教常含抖动、停顿等高频噪声,且扩散策略在迭代去噪中可能放大这些伪高频的问题,提出 Frequency Guidance Operator:用 DCT 低通滤波构造多级子频率流形,训练多频带映射,并在反向去噪时按逐步扩展的频带引导动作生成。作者在 5 个基准的 15 个操作任务及真实环境中报告了更高成功率、更平滑且时间一致的动作。

A Surveillance Evasion Game with Continuous Sensor Redeployment via Bilevel Optimization Figure 1
2026-05-28cs.RO

A Surveillance Evasion Game with Continuous Sensor Redeployment via Bilevel Optimization

Jaehyeok Kim, Kartik A. Pant, Joseph Kinerson, Kylie Sommer-Kohrt, Worawis Sribunma, Li-Yu Lin, James M. Goppert

2026-05-28优化算法

针对关键设施反无人机中入侵者可利用旋转/定向传感器的时空盲区规避探测的问题,论文将攻防建模为连续策略空间上的零和微分博弈,允许异构传感器沿凸建筑边界连续重部署,并用 log-sum-exp 平滑约束配合 STP-RRT* 与非线性规划求攻击者最优路径,再交替双层优化逼近局部纳什均衡。500 次蒙特卡洛中,相比随机布设探测概率提升约 4 倍,收敛率 96.8%。

S-Cheetah: A Novel Quadrupedal Robot with a 3-DOF Active Spine Learning Agile Locomotion Figure 1
2026-05-28cs.RO

S-Cheetah: A Novel Quadrupedal Robot with a 3-DOF Active Spine Learning Agile Locomotion

Zimu Li, Weibang Bai

2026-05-28机器人

针对刚性躯干四足机器人难以利用动物脊柱实现高速奔跑、急转和空中自正的问题,S-Cheetah设计了含偏航、俯仰、横滚串联关节的3自由度主动脊柱,并用PPO、速度课程学习及步态/脊柱奖励促使腿脊协同。在Isaac Sim和MuJoCo评估中,其旋转G2 gallop峰值速度达6.9 m/s,原地转向7.2 rad/s,并涌现猫科式自由落体四足着陆;但结果主要为仿真,实机验证文中未充分说明。

Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language Figure 1
2026-05-28cs.RO

Tabero: Learning Gentle Manipulation with Closed-Loop Force Feedback from Vision, Touch, and Language

Qiwei Wu, Rui Zhang, Xin Xiang, Tao Li, Weihua Zhang, Junjie Lai, Renjing Xu

2026-05-28机器人视觉感知

针对现有 VLA 缺少触觉与闭环力反馈、易在精细操作中施力过大的问题,Tabero 通过在高保真触觉仿真中重放开源轨迹生成视觉-触觉-语言数据,并用多维指标同时评估成功率与“轻柔度”。其 Tabero-VTLA 将力/位置命令解耦并交由固定混合控制器执行,在保持较高任务成功率的同时,轻柔指令下平均夹持力降低超过 70%。

Turning Video Models into Generalist Robot Policies Figure 1
2026-05-28cs.RO

Turning Video Models into Generalist Robot Policies

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

2026-05-28机器人视觉感知

针对机器人缺少大规模动作标注、VLA 难以跨任务和跨本体泛化的问题,论文将视频生成模型保留为无动作视觉规划器,另训练本体专属的 Jacobian-IDM 将预测视频转为动作,形成闭环 VERA。结果显示其在仿真、真实 Panda 零样本操作和 16-DoF Allegro 手方块重定向中表现强,并可复用同一视频规划器搭配不同 IDM。

Colosseum V2: Benchmarking Generalization for Vision Language Action Models Figure 1
2026-05-28cs.RO

Colosseum V2: Benchmarking Generalization for Vision Language Action Models

Jeremy Morgan, Prajwal Vijay, Hyeonho Oh, Jincen Song, Ashvin Arora, Alina Du, Gaurav Sukhatme, Jesse Thomason, Ishika Singh

2026-05-28视觉感知学习理论数据集/基准

论文针对VLA模型“能看懂、听懂但未必能稳健操作”的评估缺口,提出Colosseum V2基准,在ManiSkill中覆盖28个任务、13类操作、单双臂形态及视觉/语言/动作扰动,并支持GPU并行测试。对ACT和π0.5的评测显示,现有方法在分布外泛化和基础成功率上仍有明显短板,仿真结果与真实机器人趋势相关。

HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning Figure 1
2026-05-28cs.RO

HumanoidMimicGen: Data Generation for Loco-Manipulation via Whole-Body Planning

Kevin Lin, Ajay Mandlekar, Caelan Reed Garrett, Nikita Chernyadev, Yu Fang, Runyu Ding, Yuqi Xie, Justin Tran, Linxi Fan, Yuke Zhu

The University of Texas at Austin

2026-05-28机器人规划控制

论文针对人形机器人行走并操作缺少大规模示范、纯遥操作采集昂贵且高自由度控制难的问题,提出 HumanoidMimicGen:从少量示范中切分接触丰富的全身技能,结合腿部强化学习控制、上下身解耦规划与单双臂技能适配,在新物体位姿和场景布局中生成稳定无碰撞数据。作者还构建 9 任务 G1 仿真基准;实验显示生成数据可训练有效视觉运动策略,与少量真实数据联合训练时真实机器人表现较仅用真实数据提升约 20%。

AURA: Asymptotically Optimal Uncertainty-Robust Replanning Algorithm for Kinodynamic Systems Figure 1
2026-05-28cs.RO

AURA: Asymptotically Optimal Uncertainty-Robust Replanning Algorithm for Kinodynamic Systems

Seyedali Golestaneh, Zhuoyun Zhong, Donghyung Lee, Constantinos Chamzas

2026-05-28规划控制安全鲁棒

针对动力学采样规划通常离线执行、有限规划时间导致轨迹次优且模型/执行不确定性会放大跟踪偏差的问题,AURA 将渐近最优前向传播规划器作为在线元规划层,运行中保留搜索进展并持续全局重规划,同时用 GPU 加速的局部控制优化恢复到安全参考轨迹且不依赖 steering function。仿真与真实任务显示其可将执行偏差降低最高 72%,总任务时间较基线最多减少 50%。

Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning Figure 1
2026-05-28cs.RO

Simulation-Informed Diffusion for Decentralized Multi-robot Motion Planning

Jinhao Liang, Sven Koenig, Ferdinando Fioretto

University of Virginia, University of California, Irvine

2026-05-28机器人生成模型规划控制

针对去中心化多机器人规划中仅凭局部静态观测易短视、通信又受限的问题,论文提出 SID:用同一个约束感知扩散模型先模拟邻居未来可行轨迹,再将这些模拟作为安全约束来规划自身轨迹,并仅在预测冲突无法本地化解时通信。实验显示其在轨迹质量与约束满足上优于 ORCA、IA-MPC、MIMIC-D,并可扩展到 108 个机器人和 160 个障碍物场景。

Design of a Real-time Asynchronous Monocular Odometry for Planetary Exploration Figure 1
2026-05-28cs.RO

Design of a Real-time Asynchronous Monocular Odometry for Planetary Exploration

Benat Inigo, Florian Steidle, Wolfgang Stuerzl

2026-05-28机器人

面向行星车算力、带宽受限且光照动态范围大的场景,论文设计了纯事件相机单目里程计:用 RATE 异步特征跟踪输出逐点触发 ESKF 更新,并维护三维路标,避免依赖帧图像、IMU或GPU。初步仿真在1像素噪声下对齐后平均绝对位姿误差约0.065 m,UZH真实序列约0.06 m,但约17.5 s后因特征大量丢失失败,系统仍处早期设计阶段。

Trinity: Unifying Class-Agnostic Terrain and Semantic Segmentation for Unstructured Outdoor Environments by Leveraging Synthetic Data Figure 1
2026-05-28cs.RO

Trinity: Unifying Class-Agnostic Terrain and Semantic Segmentation for Unstructured Outdoor Environments by Leveraging Synthetic Data

Marcus G Müller, Wout Boerdijk, Maximilian Durner, Riccardo Giubilato, Abel Gawel, Wolfgang Stürzl, Roland Siegwart, Rudolph Triebel

2026-05-28视觉感知

面向非结构化户外机器人,论文针对固定地形类别和平台相关可通行标注难迁移的问题,提出 Trinity-Net:用统一 Transformer 同时做类别无关的视觉地形分割与任务相关语义分割,并扩展 OAISYS 生成 RUGDSynth、发布 EXTerra 真实数据。实验显示该联合训练在 RUGD 上表现较强,并可迁移到行星探测类真实场景,但具体增益中合成数据与架构贡献的拆分仍需进一步验证。

Agentic Language-to-Objective Synthesis for Optofluidic Assembly Figure 1
2026-05-28cs.RO

Agentic Language-to-Objective Synthesis for Optofluidic Assembly

Ivan Saraev, Elena Erben, Weida Liao, Fan Nan, Gerhard Neumann, Eric Lauga, Moritz Kreysing

) Institute of Biological and Chemical Systems, Karlsruhe Institute of Technology, Germany, ) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK, ) Department of Mathematics, Imperial College London, UK, ) Institute of Anthropomatics and Robotics (IAR), Karlsruhe Institute of Technology, Germany, biocompatibility, and controllability17. Recent optofluidic approaches18, which we, Similar pressures of labor-intense experimental planning have driven autonomous, ‘self-driving’ lab platforms across chemistry, physics and materials27-31, including

2026-05-28机器人

该文针对光流控微装配中“把自然语言意图写成可优化目标函数”仍需人工、难复用的问题,提出 Speak-to-Objective:用带反馈目录的 LLM 代理把语音/文本命令合成为可微目标,并由 SLSQP 结合热黏性流模型或实验平台执行。结果显示其可生成包含形状、间距、拓扑/分配约束的可解释目标,支持扰动后自恢复、部分轨迹装配和仿真实验对比;但实验规模仍弱于仿真,首发成功率仍有提升空间。

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation Figure 1
2026-05-28cs.RO

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

Hongyu Ding, Sizhuo Zhang, Ziming Xu, Jinwen Guo, Hongxiu Liu, Xingzhi Cheng, Zixuan Chen, Haifei Qi, Duo Wang, Hao Xu, Jieqi Shi, Yifan Zhang, Jing Huo, Jian Cheng, Yang Gao, Jiebo Luo

2026-05-28机器人视觉感知

针对具身导航依赖大规模机器人轨迹训练、跨任务跨形态泛化成本高的问题,Uni-LaViRA将导航统一为语言-视觉-机器人动作翻译:用MLLM输出语义方向与像素目标,并加入TODO List Memory和Second Chance Backtrack缓解长程遗忘与错误恢复。零训练下在VLN-CE、ObjectNav、EQA、Aerial-VLN及四类真实机器人上验证,多个基准成功率接近或超过近期训练型导航基础模型。

Synthetic Emotions vs. Gamification: Exploring Engagement Strategies for Small Social Robots in Different Age Groups Figure 1
2026-05-28cs.RO

Synthetic Emotions vs. Gamification: Exploring Engagement Strategies for Small Social Robots in Different Age Groups

Morten Roed Frederiksen, Kasper Støy

2026-05-28机器人

面向焦虑儿童等长期治疗场景中“如何让小型社交机器人保持日常参与”的问题,论文比较了AffectaPocket触觉机器人上的合成情绪反馈与游戏化积分奖励,核心洞察是偏好与真实行为可能不一致且受年龄/情境影响。6–8岁儿童更偏好情绪式互动(68.75%),但大学生全天自然场景实验中积分机制带来更高任务准确率并更能维持表现。

Inducing Calmness With Pocket-Sized Robotics: Reducing Movement and Heart Rate in Children through Hand-Held Tactile Interactions Figure 1
2026-05-28cs.RO

Inducing Calmness With Pocket-Sized Robotics: Reducing Movement and Heart Rate in Children through Hand-Held Tactile Interactions

Morten Roed Frederiksen, Kasper Støy, Maja Matarić

2Data Systems and Robotics, IT-University of Copenhagen, Denmark, Interaction Lab, University of Southern California, Los Angeles, California, U.S.

2026-05-28机器人

针对儿童在课堂/家庭中易出现高唤醒、烦躁和难以专注的问题,本文探索一种口袋大小触觉机器人:通过手持节律振动匹配游戏,把注意力锚定到触觉与按键节奏上,以诱导具身自我调节。18名儿童的被试内实验显示,交互使心率平均下降3.56 bpm,整体身体运动减少约38%,与注意相关部位运动下降约45%,但长期效果与具体机制仍需进一步验证。

SCALE-COMM: Shared, Contrastively-Aligned Latent Embeddings for MARL Communication Figure 1
2026-05-28cs.RO

SCALE-COMM: Shared, Contrastively-Aligned Latent Embeddings for MARL Communication

Mahmoud Abouelyazid, Eman Hammad

2026-05-28强化学习

面向部分可观测多机器人/仓储场景中通信协议易漂移、语义不一致且会干扰策略学习的问题,SCALE-COMM将通信表征与控制优化部分解耦,用跨智能体、跨时间的对比对齐、EMA目标编码器、课程式SSL-RL权重和原型离散化来学习紧凑消息。在Traffic-Junction、Predator-Prey、Find-Goal及自建仓储任务中,相比AEComm、CACL及SimCLR/MoCo/SwAV等基线,表现出更快收敛、更高任务性能和更好的表征对齐;但真实部署细节文中未充分说明。

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation Figure 1
2026-05-28cs.RO

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

Boxiang Qiu, Liliang Chen, Yue Liao, Nan Wang, Lintao Wang, Jiayi Luo, Wenzhi Zhao, Shengcong Chen, Di Chen, Ye Li, Chen Gao, Shuicheng Yan, Si Liu, Maoqing Yao, Guanghui Ren

LV-NUS Lab

2026-05-28机器人视觉感知强化学习

面向机器人操作中真实评测慢、传统仿真难覆盖接触/形变和闭环学习信号不足的问题,GE-Sim 2.0 将动作条件视频生成器用大规模真实机器人数据重训,并加入本体状态解码、VLM 世界裁判和加速 rollout,使视频仿真可为策略提供状态与奖励。实验称其以 2B 参数登顶 WorldArena,25 帧单 H100 约 2.3 秒,世界裁判优于通用 VLM,基于筛选仿真轨迹训练可带来真实机器人成功率提升;部分增益可能主要来自 scaling / data。

A Factory-Floor Deployment Case Study of VLA Pipelines for Industrial Packaging Task: Workflow, Failures, and Lessons Figure 1
2026-05-28cs.RO

A Factory-Floor Deployment Case Study of VLA Pipelines for Industrial Packaging Task: Workflow, Failures, and Lessons

Brian Zhu, Philipp Schmitt, Philine Meister, Lukas Gensler, Momen Khalil, Emmanuele Poggi, Johannes Hechtl, Carsten Braunroth, Kai Wurm, Gokul Narayanan, Eugen Solowjow, Georg von Wichert, Andre Scholz, Felix Albrecht, Maxmillian Metzner

2026-05-28生成模型

论文关注VLA从实验室走向工厂时的可靠性落差,以西门子产线透明附件袋装箱为案例,研究预训练Pi0.5如何通过任务微调落地。核心价值不在提出新模型,而是记录数据采集、筛选、微调、评估与针对性恢复数据的迭代流程,并总结遥操作、视角、延迟和失败模式等工程瓶颈。现场累计2535条约10小时数据;最终成功率文中称未达预期,但给出了可操作的部署教训。

Differentiable Model Predictive Safety for Heterogeneous Mobility at Urban Intersections Figure 1
2026-05-28cs.MA

Differentiable Model Predictive Safety for Heterogeneous Mobility at Urban Intersections

Wenzhe Song, Hao Zhang

School of Business, Stevens Institute of Technology, Department of Mechanical Engineering, Carnegie Mellon University, services [3]. The safe, efficient, and scalable coordination of, is predicated on the availability of an accurate, low-, .1109/IARCE68366.2025.11485680. The final, published version is available at: https://ieeexplore.ieee.org/document/11485680

2026-05-28安全鲁棒

面向无信号城市路口中自动车与低速移动机器人动力学差异大、碰撞风险不对称的问题,论文提出 DMPS,将可微潜在动力学预测与安全 critic 嵌入多智能体 RL,通过对展开预测模型反传来在线微调当前动作。CARLA 混合交通实验显示,DMPS-MAPPO 在高密度场景将碰撞率降至约 5.6%,较基线减少 32.7%,同时保持延迟和通行效率。

Surprising Performances of Students with Autism in Classroom with NAO Robot Figure 1
2026-05-28cs.HC

Surprising Performances of Students with Autism in Classroom with NAO Robot

Qin Yang, Huan Lu, Dandan Liang, Shengrong Gong, Huanghao Feng

2026-05-28机器人

针对自闭症儿童机器人干预多停留在一对一康复场景、缺少真实集体课堂证据的问题,论文将 NAO 与特教教师协同嵌入课堂,并用多机位视频从注意、交流、互动和情绪等维度编码比较。初步结果显示,机器人课堂中学生注意力和参与度更高,才艺展示与指令任务中刻板重复和无关小动作减少,但样本规模与长期效果文中未充分说明。

2026-05-27

40 篇
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding Figure 1
2026-05-27cs.CV

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu

2026-05-27视觉语言视觉感知生成模型学习理论数据集/基准

论文针对VLM把检测/grounding框序列化为坐标token逐个生成,导致几何耦合被破坏且推理慢的问题,提出LocateAnything的并行框解码:以框/点为原子单元一次预测,并用混合模式在不可靠时回退到自回归;同时构建1.38亿查询数据。实验显示其在多类定位基准上提升高IoU精度并最高约2.5倍吞吐,但部分增益可能主要来自scaling/data。

Riding the Shifting Potential: When Reactive Control Suffices for Multi-Goal Behavior Figure 1
2026-05-27cs.RO

Riding the Shifting Potential: When Reactive Control Suffices for Multi-Goal Behavior

Vito Mengers, Oliver Brock

2026-05-27机器人生成模型强化学习模仿学习规划控制

论文针对多目标机器人任务中反应式控制易陷入局部极小、通常需规划或学习策略的问题,指出瓶颈在于静态目标编码而非反应式控制本身。其在 AICON 图式世界模型中加入零空间投影,并按当前状态动态确定优先级,使冲突目标可在线协调。在非凸导航和非凸物体平面推推动作中,该方法无需示范或重训,推动任务百例达到 100% 成功率,优于最陡下降和扩散策略,并可迁移到真实机器人约束下。

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies Figure 1
2026-05-27cs.RO

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

XLANG Lab, The University of Hong Kong, Qwen Team, Alibaba Inc.

2026-05-27机器人视觉语言视觉感知强化学习规划控制

FineVLA针对现有机器人轨迹多只配粗粒度目标指令、缺少“如何执行”监督的问题,提出从10个开源数据集统一轨迹并标注动作对齐细节的框架,同时提供FineVLA-Data、RoboFine-Bench、专用VLM标注器和可控VLA策略训练配方。实验显示,细粒度监督不降低任务成功率,且与原始目标指令混合最优;FG:Raw约1:2到1:1时在仿真达86.8%/82.5%,真实双臂任务由49.9提升到62.7,并显著改善姿态、颜色和接近方向等可控因素。

Towards Drone-based Mapping of Volcanic Gases using Gas Tomography Figure 1
2026-05-27cs.RO

Towards Drone-based Mapping of Volcanic Gases using Gas Tomography

Marius Schaab, Niklas Karbach, Antonia Rabe, Thomas Wiedemann, Patrick Hinsen, Dmitriy Shutin, Thorsten Hoffmann, Achim J. Lilienthal

2026-05-27视觉感知模仿学习三维安全鲁棒

火山 CO2 监测需要在危险地形中定位排放源,但无人机搭载接触式传感器会因旋翼下洗扰动羽流而漏检。论文改用无人机反射器配合 TDLAS 开路遥测,并在气体层析重建中加入拉格朗日风场平流补偿。在埃特纳附近泥火山实验中,接触式方案几乎未检出 CO2,而开路层析得到的分布图与人工原位测量一致。

FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation Figure 1
2026-05-27cs.CV

FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation

Zihui Zhang, Zhixuan Sun, Yafei Yang, Jinxi Li, Jiahao Chen, Bo Yang

2026-05-27视觉感知强化学习学习理论数据集/基准三维

针对复杂点云中无场景级人工标注的3D物体分割,FoundObj认为仅靠语义或几何先验都难以定义“物体”。其用超点级智能体自底向上合并候选区域,并把自监督2D语义模型与3D物体中心模型分别转化为语义一致性和几何中心一致性奖励,通过强化学习发现多类别物体。实验显示其在多个基准上优于现有无标签方法,并在零样本和长尾场景中保持较好泛化。

TCBiRRT: Rapid Motion Planning for Tightly Coupled Dual-arm Space Manipulator Using Task-space Random Expansion Figure 1
2026-05-27cs.RO

TCBiRRT: Rapid Motion Planning for Tightly Coupled Dual-arm Space Manipulator Using Task-space Random Expansion

Jiawei Zhang, Xinhao Miao, Jifeng Guo, Qinghua Li, Chengchao Bai

2026-05-27规划控制优化算法三维安全鲁棒

面向在轨大型结构装配中双臂空间机械臂受闭链约束、可行空间狭窄且障碍复杂导致规划低效的问题,论文提出 TCBiRRT,将随机采样与扩展从高维关节空间转到被操作物体位姿定义的任务空间,并用路径逆运动学生成连续关节轨迹,结合双向 RRT 与重抓取连接树。仿真显示其在多种装配场景中相较现有规划器显著提高成功率,并将规划时间提升到数量级级别。

YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting Figure 1
2026-05-27cs.CV

YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting

Rajmeet Singh, Manveen Kaur, Shahpour Alirezaee, Irfan Hussain

2026-05-27机器人视觉感知规划控制数据集/基准三维

面向温室采摘机器人在遮挡、光照变化下需同时判断番茄成熟度并给出可执行采摘点的问题,论文在 YOLO26 上引入轻量特征金字塔、成熟度感知注意力和带中心点回归的紧凑检测头。其自采 1500 张图数据上总体 mAP@0.5 为 92.9%,成熟果 95.2%,仅 2.38M 参数;30% BN 剪枝后约 1.8M,精度几乎不降,但实机闭环采摘效果文中未充分说明。

VR-DAgger: Immersive VR for Dexterous Data Collection and Uncertainty-Guided On-Policy Correction Figure 1
2026-05-27cs.RO

VR-DAgger: Immersive VR for Dexterous Data Collection and Uncertainty-Guided On-Policy Correction

René Zurbrügg, Tifanny Portela, Arjun Bhardwaj, Aravind Elanjimattathil Vijayan, Maximum Wilder-Smith, Marco Hutter

The Authors are with the Robotics Systems Lab ETH Zürich.

2026-05-27机器人强化学习模仿学习安全鲁棒

针对模仿学习中任务数据采集慢、分布偏移下错误累积且人工纠错常浪费在低价值片段的问题,VR-DAgger将沉浸式VR灵巧遥操作与Isaac Lab中的自主rollout结合,用MC dropout从扩散策略失败轨迹中筛选高不确定短片段供人回放纠正,无需全程监控或额外干预分类器。在XHand三类任务上,相比BC成功率最高提升23个百分点,并较无引导人工检查减少约40%单样本采集时间。

Trust Region Q Adjoint Matching Figure 1
2026-05-27cs.LG

Trust Region Q Adjoint Matching

Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin

2026-05-27生成模型强化学习规划控制优化算法

针对预训练 flow policy 在离线/离策略强化学习微调中易被 critic 误差放大、偏离先验并崩溃的问题,TRQAM 将信赖域参数 λ 内嵌到随机最优控制采样动力学中,并用投影对偶下降直接约束路径空间 KL;其关键洞察是该 KL 可写成 λ 的闭式函数,从而比损失级 KL 正则更可控。在 50 个 OGBench 任务上,离线成功率达 68%,高于最强基线 46%,并在 offline-to-online 设置中保持优势。

Learning to Balance Motor Thermal Safety and Quadrupedal Locomotion Performance with Residual Policy Figure 1
2026-05-27cs.RO

Learning to Balance Motor Thermal Safety and Quadrupedal Locomotion Performance with Residual Policy

Yuhang Wan, Weixian Lin, Letian Qian, Yiqi Zou, Weiwei Wu, Shengwei Wu, Chuanlin Zhao, Xin Luo

All authors are with the School of Mechanical Science and Engineering, Huazhong University of Science and Technology

2026-05-27机器人强化学习三维安全鲁棒

针对电驱四足在负载和长时间运动中易因电机过热触发保护、而单一热安全策略又会过于保守的问题,本文将全身电机热模型并入强化学习,先训练地形适应的名义步态,再用热状态驱动的残差策略按温度修正动作。仿真显示其能在性能与温升间折中;Unitree A1 负载 3 kg 实测可多地形稳定行走超过 13 分钟,而名义策略约 5 分钟即过热。

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving Figure 1
2026-05-27cs.RO

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

Jiaxiang Li, Yumao Liu, Ke Ma

The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China

2026-05-27视觉语言视觉感知强化学习模仿学习规划控制

面向VLM自动驾驶中语义推理难以兼顾精确3D空间预测的问题,TPS-Drive认为文本化会造成空间幻觉、稠密BEV又引入背景冗余干扰,因此用冻结3D检测头监督的任务引导VQ构建以动态体为中心的纯化空间token,并按场景理解、未来预测、动作生成解耦训练,最后加入奖励优化。在nuScenes开环中降低碰撞并提升体状态预测,在NAVSIMv1/v2闭环中刷新安全指标。

Towards Shared Embodied Intelligence in Humanoid Robots through Optimization Development and Testing of the Human Aware ergoCub Robot Figure 1
2026-05-27cs.RO

Towards Shared Embodied Intelligence in Humanoid Robots through Optimization Development and Testing of the Human Aware ergoCub Robot

Carlotta Sartore, Mohamed Elobaid, Lorenzo Rapetti, Giulio Romualdi, Stefano Dafarra, Nicola A. Piga, Ines Sorrentino, Paolo Maria Vicecone, Silvio Traversaro, Ugo Pattacini, Luca Fiorio, Francesco Draicchio, Giovanna Tranfo, Lorenzo Natale, Marco Maggiali, Daniele Pucci

School of Computer Science, University of Manchester, Manchester, United Kingdom., Collaboration is central to human behavior, enabling tasks beyond individual capability. This ability arises from, their environment, a phenomenon referred to as embodied cognition. Designing humanoid robots that collabo-, integrates shared intelligence and embodied cognition to enable robots to physically collaborate with humans, the humanoid robot ergoCub, whose morphology and control have been optimized for collaborative tasks with, Collaboration is a conducive condition for survival in the natural world, enabling groups to accomplish tasks, sible for individuals to create alone. Collaboration can even overcome species limitations, leading to interspecies, planning, resulting in highly effective rescue missions [2]. It becomes then clear how collaboration depends upon, ical attributes have also evolved in response to the need for collaboration within and across species. An example, and cognitive abilities optimized for collaboration with other beings. The proposed shared embodied intelligence, in collaboration with the National Institute for Insurance against Accidents at Work (INAIL)., (QP) [19–21]. This hierarchical control has also been applied to human–robot collaboration, with emphasis on

2026-05-27机器人规划控制优化算法三维安全鲁棒

面向人形机器人与人安全协作中缺少伙伴表征、硬件与控制割裂的问题,论文提出“共享具身智能”架构,将人体模型、运动意图与工效学指标嵌入硬件—控制协同优化。其具体落地为 ergoCub:形态与物理智能参数围绕协作任务和人体负担优化,展示了从设计到控制测试的一体化流程;但定量性能增益在给定片段中未充分说明。

Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty Figure 1
2026-05-27cs.RO

Trust, Geometry, and Rules: A Credibility-Aware Reinforcement Learning Framework for Safe USV Navigation under Uncertainty

Yuhang Zhang, Shuqi Chai, Yukang Zhang, Liusha Yang, Mingchuan Zhang, Wei Wang, Qingjiang Shi, Quanbo Ge

2026-05-27机器人强化学习三维安全鲁棒

面向感知噪声和 COLREGs 规则离散化导致的无人艇避碰不稳定问题,论文将 POMDP 强化学习与滤波可信度、协方差膨胀速度障碍和连续规则嵌入结合:用信任因子调节 critic 学习,用几何安全盾覆盖危险动作,并平滑会遇责任信号。仿真会遇实验显示其在感知不一致下训练更稳,碰撞规避与规则遵从优于基线。

Object Pose and Shape Estimation for Grasping: Does it Work? Figure 1
2026-05-27cs.RO

Object Pose and Shape Estimation for Grasping: Does it Work?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

∗ Equal Contributions, 1 Robotics Research Center, IIIT Hyderabad, 2 National University of Singapore

2026-05-27视觉语言视觉感知生成模型模仿学习三维

本文针对“单视角物体位姿与形状估计是否已足以支撑抓取”这一问题,比较端到端抓取与先重建物体再反向对抓取采样的模块化路线。核心洞察是,借助 SAM3D、CRISP、SceneComplete 等开放集三维估计模型,显式几何可生成更多稳定抓取,尤其改善小物体场景。实验显示模块化方法在仿真、数据集和真实机器人中整体优于 AnyGrasp,但性能依赖位姿/形状精度,在拥挤遮挡场景会退化,扩展到视觉语言条件抓取时可接近多视角 LERF-TOGO。

A Bioinspired Underwater Robot with a Latch-Mediated Soft Bistable Mechanism Figure 1
2026-05-27cs.RO

A Bioinspired Underwater Robot with a Latch-Mediated Soft Bistable Mechanism

Chongze Bi, Wenjie Wu, Zonghao Zuo, Li Wen

challenges related to limited energy availability. As the, center. c) Ultimate state of our robot. The sliding block is at Top dead center., Authors are with School of Mechanical Engineering and Automation, Beihang University, dead center (TDC) of the sliding block and a limited block at

2026-05-27机器人生成模型规划控制

面向小型水下机器人受电池能量密度限制、连续推进效率不足的问题,本文借鉴虾蛄/跳蚤的 LaMSA 机制,提出单电机驱动的软双稳态执行器,并集成被动锁扣实现慢速储能与快速释放,带动四鳍产生非对称拍动。原型重约350 g,可通过调鳍角实现上升、斜向前进和横移;实验测得最大推力0.528 N、冲量0.147 N·s、垂直位移30 mm。

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology Figure 1
2026-05-27q-bio.NC

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

G. Nagarjuna, Durgaprasad Karnam

2026-05-27生成模型强化学习规划控制三维

论文针对认知主义难以符号落地、4E理论难以解释生成性的断裂,提出将整个身体视为认知单元的SMN架构:以多尺度拮抗动力学和“可停顿性”解释注意、意向性与自我/世界区分,并用四层动作模式连接自主调节到语言惯例化。主要结果是形式化草案、八类可预测表征及参考仿真;实证验证仍未充分说明。

OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes Figure 1
2026-05-27cs.CV

OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes

Regina Kurkova, Maxim Popov, Sergey Kolyubin

2026-05-27机器人强化学习规划控制数据集/基准三维

该文针对语义地图评测依赖固定数据集、难覆盖操作中的小物体、遮挡和杂乱场景的问题,将 OSMa-Bench 扩展为由提示词生成合成室内场景的开放基准,并利用已知生成提示构造 Prompt-grounded VQA 来检验计数与空间关系。实验含40个有效场景,提示到场景匹配率约90%;在 ConceptGraphs 与 BBQ 上,摄像机光照显著降低分割,Prompt-grounded QA总体低于30%,暴露出两类方法在几何精度与场景图完整性上的不同失效模式。

Learning Compositional Symbolic Task Rules from Demonstrations with Inductive Logic Programming Figure 1
2026-05-27cs.RO

Learning Compositional Symbolic Task Rules from Demonstrations with Inductive Logic Programming

Oleh Borys, Karla Stepanova

The authors are with the Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague.This work was co-funded by the European Union under the project Robotics and Advanced

2026-05-27机器人模仿学习学习理论三维

这篇论文针对模仿学习只学动作轨迹、难以恢复可检查任务结构的问题,提出用 Popper/ILP 将复杂操作任务拆成多层抽象目标,逐级学习一阶逻辑规则并把低层规则复用于高层规划约束。合成积木装配实验显示,学到的规则可解释,并能泛化到更难、含未见物体和位置的任务;但系统仍依赖人工给定谓词、编码和偏置,真实感知与噪声场景尚未充分验证。

Can VLA Models Learn from Real-World Data Continually without Forgetting? Figure 1
2026-05-27cs.RO

Can VLA Models Learn from Real-World Data Continually without Forgetting?

Jiarun Zhu, Yijun Hong, Xiaoquan Sun, Zetian Xu, Mingqi Yuan, Zhiyong Wang, Wenjun Zeng, Jiayu Chen

2026-05-27机器人视觉语言视觉感知强化学习模仿学习

这篇论文关注真实部署中 VLA 机器人持续学习新技能时的灾难性遗忘,而非以往较同质的仿真设置。作者构建含四个真实操作任务、每任务 500 条轨迹的数据流,系统比较顺序微调、经验回放和联合训练,指出回放频率、缓冲区大小与动作归一化等实现细节会决定成败;结果显示朴素顺序学习遗忘严重,适度回放可显著缓解,配置得当时甚至优于同数据预算的联合多任务训练。

Manipulating Tangible Virtual Object Dynamics to Promote Learning of Precision Force Generation Figure 1
2026-05-27cs.RO

Manipulating Tangible Virtual Object Dynamics to Promote Learning of Precision Force Generation

Alberto Garzás-Villar, Alba Riera-Cardona, Alexis Derumigny, J. Micah Prendergast, Jane Murray Cramm, Laura Marchal-Crespo

Department of Cognitive Robotics, Delft University of Technology, Delft, 2628 CD, The Netherlands, Department of Socio-medical Sciences, Erasmus School of Health Policy & Management, Erasmus University Rotterdam, Rotterdam, 3062PA, The Netherlands., Department of Applied Mathematics, Delft University of Technology, Delft, 2628 CD, The Netherlands, Department of Rehabilitation Medicine, Erasmus Medical Center, Rotterdam, 3015 GD, The Netherlands

2026-05-27机器人强化学习规划控制三维

针对卒中康复中精细力生成训练常忽视体感参与的问题,本文用力反馈机器人在虚拟冰壶任务中改写“可触摸”虚拟弹簧的力—位移动力学,以非线性高斯/反对称高斯关系诱导探索或触觉约束。50名健康受试者实验显示,反对称高斯训练期力精度持续优于线性,高斯组后期才显优势;但长期保持无显著差异,且迁移结果表明受试者更多学到目标位移而非目标力,临床增益来源仍需进一步澄清。

Look Further: Socially-Compliant Navigation System in Residential Buildings Figure 1
2026-05-27cs.RO

Look Further: Socially-Compliant Navigation System in Residential Buildings

Akira Shiba, Marina Obata, Nathan Kau, Zoltan Beck, Rishi Shah, Michael Sudano, Sabrina Lee

2026-05-27机器人安全鲁棒

面向住宅楼走廊中的配送机器人,论文指出只在近距离避障会让人感到突兀,较早表达让行意图更重要。作者提出基于远距离行人感知的主动换道 PLC,在约 8 米外从走廊中心移至侧边。42 人用户研究显示,该策略在正面相遇场景下显著提升安全、平滑和礼貌感知;但在盲角交汇场景中优势不明显,偏好分散。

SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation Figure 1
2026-05-27cs.RO

SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation

Melanie Neubauer, Christian Rauch, Gerald Koinig, Alexia Tischberger-Aldrian, Roland Pomberger, Elmar Rueckert

2026-05-27视觉感知规划控制数据集/基准

面向钢铁回收中磁选后仍需人工剔除铜杂质的痛点,SteelDS补齐了工业碎片化E40废钢缺少公开像素级数据的空白。其核心贡献是采集传送带高分辨率视频,并为不规则、遮挡和不同密度的钢/铜废料提供实例分割掩码与类别标注。数据集包含5个子集、24,297帧、396个钢件和101个含铜件,可作为目标检测、分割、跟踪及自动分拣算法评测基准;文中主要结果是数据资源与标注统计,未充分说明模型性能增益。

On the Generalization Capabilities, Design Choices and Limitations of Keypoint Imitation Learning Figure 1
2026-05-27cs.RO

On the Generalization Capabilities, Design Choices and Limitations of Keypoint Imitation Learning

Thomas Lips, Marco Moletta, Michael C. Welle, Danica Kragic, Francis wyffels

2026-05-27机器人视觉感知生成模型强化学习模仿学习

针对RGB模仿学习在未见物体和场景变化下需大量示教的问题,论文系统整合关键点模仿学习:用视觉基础模型从少量人工标注中提取3D关键点,并比较匹配、跟踪、模型与策略设计。2000余次真实机器人测试显示,KIL总体成功率75%,高于RGB基线47%,场景变化下优势更大,接近S2-diffusion的73%;但其并未明显超越其他物体中心表征,且受关键点提取模型失效限制。

L-Learning : A Lyapunov-Based Approach Leveraging Lagrangian Mechanics for Efficient and Stable Robot Tracking Figure 1
2026-05-27cs.RO

L-Learning : A Lyapunov-Based Approach Leveraging Lagrangian Mechanics for Efficient and Stable Robot Tracking

Quan Quan, Hao Li

2026-05-27机器人视觉感知规划控制学习理论

面向机器人在不确定动态环境中轨迹跟踪时,传统模型控制适应性不足、强化学习样本开销高且稳定性难保证的问题,L-Learning 将拉格朗日力学作为物理先验,用统一网络从数据学习能量函数,并由此同时构造 Lyapunov 函数与控制器。文中给出跟踪误差渐近收敛的稳定性论证,并报告在实验中提升跟踪精度与数据效率,但具体增益来源仍需更多消融说明。

HyperSim: A Holistic Sim-To-Real Framework For Robust Robotic Manipulation Figure 1
2026-05-27cs.RO

HyperSim: A Holistic Sim-To-Real Framework For Robust Robotic Manipulation

Junyi Dong, Haotian Luo, Ziwei Xu, Shengwei Bian, Heng Zhang, Sitong Mao, Jingyi Guo, Yang Xu, Wenhao Chen, Qiuyu Feng, Yao Mu, Ping Luo, Shunbo Zhou, Xiaodong Wu

2026-05-27机器人强化学习规划控制安全鲁棒

机器人操作策略依赖大量真实交互数据,但纯仿真训练常受视觉、动力学和状态分布差距影响。HyperSim将高保真场景重建、带扰动的对抗轨迹生成与仿真-真实联合训练串联,强调同时提升环境真实感和状态-动作覆盖。400次真实实验中,ACT与π0的迁移成功率分别达80%和95%,扰动场景完成率提升35%。

Enabling Extensible Embodied Capabilities with Tools Figure 1
2026-05-27cs.RO

Enabling Extensible Embodied Capabilities with Tools

Xueyang Zhou, Zijia Wang, Qianjiang Li, Yibo Hu, Guiyao Tie, Li Wan, Yidan Liu, Pan Zhou, Lichao Sun, Yongchao Chen

2026-05-27机器人视觉感知强化学习规划控制学习理论

针对端到端具身策略把感知、推理、规划与控制耦合在单一模型中、难以复用和诊断的问题,论文提出将能力外化为可注册、发现和调用的工具,设计 ETP 协议并整理 100+ 工具,同时用 EmbodiedToolBench 评估工具使用能力。仿真与真实实验显示工具增强在 EB-ALFRED、EB-Navigation 平均提升 31% 和 36%,但收益主要集中在认知与感知,执行类能力增益有限,且模型仍难稳定判断何时、选何种、如何串联工具。

Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty Figure 1
2026-05-27eess.SY

Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty

Chayan Banerjee, Ethan Goan

2026-05-27机器人强化学习优化算法三维安全鲁棒

面向安全关键机器人/强化学习部署中“动力学变化+部分可观测”同时出现的失效,本文指出二者会形成状态估计与动力学辨识相互依赖的“认知陷阱”。其核心是用互信息式复合不确定系数κ在线刻画耦合,并以MaxInfoRL主动探测和自适应安全约束替代被动鲁棒。模拟行走实验显示复合不确定导致约77%性能下降,明显高于单独因素叠加的46%,但整体仍偏概念验证。

Provably Safe Motion Planning Under Unknown Disturbances Figure 1
2026-05-27cs.RO

Provably Safe Motion Planning Under Unknown Disturbances

Ibon Gracia, Qi Heng Ho, Luca Laurenti, Morteza Lahijanian

2026-05-27机器人规划控制优化算法安全鲁棒

针对未知随机扰动下传统鲁棒/高斯假设规划过保守的问题,本文用轨迹数据学习 Wasserstein 歧义管,并将其与采样式运动规划、机会约束和 bandit 自适应有效性检查结合;低维分解降低保守性与计算量。实验显示其在狭窄、杂乱环境和严格安全阈值下成功率高于矩方法基线,但代价是分布鲁棒设定下仍会保守。

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient Figure 1
2026-05-27cs.RO

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient

Haoxiang You, Yilang Liu, Davis Zong, Qian Wang, Teeratham Vitchutripop, Qi Wang, Daniel Rakita, Ian Abraham

2026-05-27机器人强化学习规划控制优化算法数据集/基准

针对视觉强化学习端到端训练在渲染并行、显存和长时域可微动力学上成本过高且不稳定的问题,本文提出 SDPG:用少量带渲染轨迹评估策略、用物理-only 扰动 rollout 以随机搜索近似解耦策略梯度,并配合自适应探索与归一化。实验显示其在视觉 MuJoCo 上较基线训练更快、显存更低且回报更高,并给出操作/运动基准及 Go2 实机迁移。

Heterogeneous AAV Logistics Task Allocation: A Reinforcement Learning Enhanced Overlapping Coalition Formation Game Approach Figure 1
2026-05-27cs.RO

Heterogeneous AAV Logistics Task Allocation: A Reinforcement Learning Enhanced Overlapping Coalition Formation Game Approach

Yuze Zhou, Jingliang Sun, Junzhi Li, Jianxin Zhong, Zihan Wang, Teng Long

2026-05-27强化学习学习理论三维

面向城市低空物流中订单随机到达、任务时窗严格且异构无人机资源难以高效复用的问题,本文将Transformer-SAC学习到的前瞻任务选择策略嵌入重叠联盟形成博弈,用注意力处理变长任务集并替代启发式联盟更新;同时证明该过程为精确势博弈、有限步收敛到纳什稳定。仿真中32架AAV/80任务较启发式OCF降本39.76%,并以室内飞行实验验证可行性。

Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning Figure 1
2026-05-27cs.RO

Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning

Dhruv S. Kushwaha, Zoleikha A. Biron

2026-05-27机器人视觉感知强化学习模仿学习规划控制

面向机器人强化学习中探索与部署都需满足状态/输入约束的问题,本文将数据驱动 Koopman 预测器与 CBF 安全滤波嵌入 SAC,用提升空间中的仿射约束构造轻量 QP,并用留出轨迹估计的投影残差收紧屏障条件,同时让 critic 学习实际执行动作。结果显示 CartPole 稳定与跟踪可零违规且回报不降;在 Safety Gymnasium 高维 locomotion 中仅部分减少违规,暴露一阶速度屏障和线性 EDMD 的适用边界。

Multi-Robot Box Transport over Different Surfaces with Decentralized Role-based Proportional Control Figure 1
2026-05-27cs.RO

Multi-Robot Box Transport over Different Surfaces with Decentralized Role-based Proportional Control

Aditya Bhatt, Himavarshini Yarragangu, Urvish Shah, Venkata Sai Yaswanth Mohan Thota, Souma Chowdhury

2026-05-27机器人规划控制三维

面向仓储、救灾等场景中多机器人在不同坡度和摩擦地面上推运箱体的困难,论文提出异步去中心化的 R2P2 方法:机器人依据箱体平移/旋转需求自分配 push、support、prevent 等角色,并用规则或比例速度控制执行。该方法降低通信与集中优化依赖,在 IsaacSim 六机器人、多质量与多地形实验中成功率优于虚拟领航-跟随基线,并在四台 TurtleBot 搬运 1.2kg 箱体上完成实体验证。

Closing the Loop in Teleoperation: Episode-Level Data Quality Assessment and Feedback for High-Quality Demonstration Collection Figure 1
2026-05-27cs.RO

Closing the Loop in Teleoperation: Episode-Level Data Quality Assessment and Feedback for High-Quality Demonstration Collection

Gokul Narayanan, Yash Shahapurkar, Melih Erdogan, Brian Zhu, Eugen Solowjow

2026-05-27机器人强化学习模仿学习数据集/基准三维

面向机器人遥操作示教中“任务成功但轨迹质量差”会拖累模仿学习的问题,论文提出 DQAF,将子任务语义进展、平滑性、停滞、关节/运动学限制等遥测信号转成单回合质量评分与可执行的自然语言反馈,从事后筛数据转为采集闭环。验证中其拒收理由和专家审查对齐,3 名新手的先导实验显示获得即时反馈者提升更快,但样本规模很小,结论仍偏初步。

RCSP: Risk-Sensitive Conjectural Scenario Planning for Safe Dynamic Robot Navigation Figure 1
2026-05-27cs.RO

RCSP: Risk-Sensitive Conjectural Scenario Planning for Safe Dynamic Robot Navigation

Zhengye Han, Quanyan Zhu

Department of Electrical and Computer Engineering, New York University

2026-05-27机器人规划控制学习理论数据集/基准三维

论文关注动态障碍场景中“尚未碰撞但已被当前速度带入未来死局”的近失误承诺问题。RCSP在局部规划层维护障碍运动假设后验,采样短时未来并用CVaR惩罚尾部风险,再经安全过滤执行。仿真中其在MuJoCo瓶颈与ROS2/Gazebo近失误任务提升安全性,但带来延迟;在DynaBARN/Jackal严格成功率上仍弱于调优DWA/TEB,适合作为风险预测补充层。

NightSight: Passive Computation for Navigation in Dark Using Events Figure 1
2026-05-27cs.RO

NightSight: Passive Computation for Navigation in Dark Using Events

Deepak Singh, Brijan Vaghasiya, Shreyas Khobragade, Nitin Sanket

2026-05-27机器人视觉感知强化学习安全鲁棒

面向小型空中机器人在断电、搜救等全黑环境中的低载荷导航,NightSight 将事件相机、编码孔径和红外点阵投影结合,把深度相关的散焦形状作为“被动计算”线索,再用仅由简单平面合成数据训练的 CNN 恢复稠密深度。系统在真实复杂场景零样本泛化,Jetson Orin Nano 上达 20Hz,2.5m 范围内 L1 误差约 7cm。

Collaborative Navigation and Exploration with $β$-Sparse Gaussian Processes Figure 1
2026-05-27cs.RO

Collaborative Navigation and Exploration with $β$-Sparse Gaussian Processes

Evangelos Psomiadis, Dipankar Maity, Panagiotis Tsiotras

D. Guggenheim School of Aerospace Engineering, Georgia Tech, Atlanta, GA, USA, Department of Electrical and Computer Engineering, UNC Charlotte, Charlotte, NC, USA

2026-05-27机器人模仿学习优化算法三维安全鲁棒

面向未知环境中异构机器人协同导航的通信瓶颈,论文将地形/代价图建模为高斯过程,并提出β-Sparse GP,用任务相关的诱导点选择压缩传感机器人观测,同时用兼顾RoI与不确定性的策略在线决定其行动。火星与地球地图仿真显示,相比无通信路径代价降低18%,相较原始数据传输通信量减少76%。

Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering Figure 1
2026-05-27cs.MA

Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering

Maxim Mednikov, Oren Gal

2026-05-27强化学习规划控制数据集/基准三维安全鲁棒

这篇论文针对多智能体/机器人系统部署时常见的通信延迟、丢包和传感滞后问题,指出同步训练得到的策略会因过期观测而失稳。核心做法不是重训策略,而是在执行端插入由 GRU 动力学模型与卡尔曼递推组成的信念状态滤波层,用当前状态估计替换延迟消息。实验显示其在 MPE、VMAS 和连续控制基准中提升了抗延迟、抗丢包与抗噪声能力,收益主要集中在强协同和动态不稳定任务。

PhyPush: One Push is All You Need for Sensorless Physical Property Estimation with Physics-Guided Transformers Figure 1
2026-05-27cs.RO

PhyPush: One Push is All You Need for Sensorless Physical Property Estimation with Physics-Guided Transformers

Koyo Fujii, Luis Figueredo, Praminda Caleb-Solly, Ivan Boschi, Edoardo Ida', Marco Carricato, Aly Magassouba

School of Computer Science, University of Nottingham, Nottingham, United Kingdom. 2 Dept. of Industrial Engineering, University of Bologna, Bologna, Italy.

2026-05-27机器人强化学习优化算法学习理论

面向机器人在无专用力/触觉传感器条件下快速识别物体质量与摩擦的问题,PhyPush利用一次平移推动中的末端执行器速度序列,并以Transformer建模瞬态与稳态动力学差异;其物理引导损失将牛顿第二定律和库仑摩擦约束写入训练。仿真中在域外场景较含完整力信息的基线误差降低超过10%,真实实验也优于纯数据驱动损失。

When Does Adaptive Guidance Help? Belief-Aware Privileged Distillation for Autonomous Driving Under Partial Observability Figure 1
2026-05-27cs.RO

When Does Adaptive Guidance Help? Belief-Aware Privileged Distillation for Autonomous Driving Under Partial Observability

Mehmet Haklidir

2026-05-27模仿学习三维安全鲁棒

面向自动驾驶中遮挡和有限视野导致的部分可观测问题,论文质疑 GSAC 固定蒸馏强度是否合适,提出用前向模型集成分歧自适应调节教师指导系数的 BA-GSAC。实验显示轻中度 POMDP 下有收益,但重遮挡时分歧因只预测可见观测而失效,系数很快降到下限;最佳结果反而来自简单线性衰减,说明稳定性增益可能主要来自调度而非不确定性估计。

Towards Real-World Identification of Fatigued Muscle Groups via Musculoskeletal Simulation Figure 1
2026-05-27cs.RO

Towards Real-World Identification of Fatigued Muscle Groups via Musculoskeletal Simulation

Jenishkumar Chauhan, Samarth Brahmbhatt, Vineet Vashista

2026-05-27机器人视觉感知强化学习三维

面向人机协作和远程肌骨筛查中难以无接触定位疲劳肌群的问题,论文用 MyoSuite 肌骨仿真生成健康/疲劳上肢运动,并将真实动捕的15个负重肩肘动作转为关节轨迹特征,与仿真特征匹配来判别三角肌、肱二头肌、肱三头肌疲劳。真实受试实验显示该方法能区分多类疲劳肌群,并分析了仿真配置对缩小 sim-to-real 差距的影响。

2026-05-26

89 篇
AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond Figure 1
2026-05-26cs.RO

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

Southwest Jiaotong University, Tsinghua University

2026-05-26视觉感知生成模型强化学习规划控制学习理论

面向自动驾驶长尾安全场景的数据稀缺与仿真可控性不足,AnyScene将3D语义占据作为几何中枢:先用BEV Occupancy VAE与时空扩散Transformer从任意BEV自回归生成高频占据序列,再以GGVE无参考地扩展为多视角视频并支持可变相机。实验显示其在占据与视频生成上达到SOTA,并能泛化到跨数据集/自定义布局,提升稀疏视角3D重建。

MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control Figure 1
2026-05-26cs.CV

MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Jingya Wang

2026-05-26机器人视觉感知生成模型模仿学习规划控制

面向用自然语言直接驱动物理仿真人形角色,论文针对两阶段方法的运动/控制域偏移和端到端文本到动作语义鸿沟,提出 MIND:把人形状态中的运动动态视为“意图”中介,在扩散策略中同时预测全局意图和逐步意图,并在潜空间建模以约束动作生成。实验显示其在语义对齐、物理合理性和动作自然度上优于多种基线。

LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data Figure 1
2026-05-26cs.CV

LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data

Knut Peterson, Zaid Mayers, Azmain Yousuf, Priontu Chowdhury, Asher Zaczepinski, Solmaz Arezoomandan, Reihaneh Maarefdoust, David Han

2026-05-26视觉感知数据集/基准安全鲁棒

面向共享空域中无人机需远距离可靠避障/监视的问题,LRDDv3补足现有数据集在高分辨率、真实飞行视角、距离标注和热红外配对上的缺口。其核心贡献是汇集102,532张4K RGB图、29,630张配对IR图及0–200米范围信息,覆盖多天气、光照、背景遮挡与运动相机;主要结果是形成更完整的长距小目标检测基准,改进可能主要来自数据规模与多模态/场景覆盖。

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models Figure 1
2026-05-26cs.CV

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

2026-05-26视觉语言视觉感知强化学习学习理论三维

面向具身智能中无需3D标注的开放词汇定位,AgentGrounder针对现有零样本3DVG依赖多视图图像、早期匹配易级联出错和提示冗余的问题,直接在彩色点云上先构建对象查找表,再由工具化LVLM按查询选择候选、做确定性几何评分,并在需要颜色/材质等证据时按需渲染。ScanRefer与Nr3D上相对SeeGround取得稳定提升,但文中Nr3D增益数值表述略不一致。

RePlan-Bot: Multi-Level Replanning for Embodied Instruction Following Figure 1
2026-05-26cs.RO

RePlan-Bot: Multi-Level Replanning for Embodied Instruction Following

Xicheng Gong, Guozheng Sun, Peiran Xu, Yadong Mu

Peking University, Tsinghua University

2026-05-26规划控制数据集/基准三维安全鲁棒

面向具身指令跟随中长程规划、局部可观测和不可逆状态变化导致的失败,RePlan-Bot 将重规划嵌入高、中、低三个层级:LLM 审核器依据环境反馈动态修正子目标,多层实例地图结合常识引导物体搜索,ViT 动作校正器提前替换风险低层动作。在 ALFRED 上其在已见和未见环境均达到新的 SOTA,消融显示三类重规划模块均有贡献。

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills Figure 1
2026-05-26cs.RO

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

University of Michigan, Ann Arbor

2026-05-26机器人数据集/基准

这篇论文针对进化式机器人设计“只保留最优个体、丢弃试验经验”的问题,提出 Auto-Robotist:让 LLM 将仿真搜索轨迹蒸馏为可检查的自然语言技能库,记录结构原型、正反规则及证据,并在后续搜索中检索指导形态编辑,同时保留 GA 探索。实验在 7 个 EvoGym 任务上显示,其冷启动 5×5 搜索优于或匹配 GA,且学到的技能迁移到 10×10 设计空间时在所有任务上超过 GA。

OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation Figure 1
2026-05-26cs.RO

OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation

Xinzhe Chen, Sihua Ren, Liqi Huang, Haowen Sun, Mingyang Li, Xingyu Chen, Zeyang Liu, Xuguang Lan

National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University

2026-05-26机器人视觉语言视觉感知强化学习规划控制

针对现有VLA/WAM中间表征停留在观测空间、需解码器隐式恢复6DoF刚体几何的问题,OASIS用相机坐标系SE(3)末端轨迹预测来对齐观测与动作空间,并以姿态监督隐状态条件化动作块生成。在LIBERO、CALVIN及真实Franka/Kinova实验中均超过VLA/WAM基线,OOD扰动下仍保持较高成功率。

Extending Embodied Question Answering from Perception to Decision Figure 1
2026-05-26cs.RO

Extending Embodied Question Answering from Perception to Decision

Xicheng Gong, Qiwei Li, Peiran Xu, Yadong Mu

Peking University

2026-05-26视觉语言数据集/基准

现有具身问答多停留在静态感知或单项空间/规划能力,难以评估交互中的状态变化与即时决策。本文提出 EQA-Decision,将400万余多模态问答按静态场景、空间理解、任务动态和即时决策四类、九个子任务统一标注,并配套基准与基于 Qwen3-VL 的 RoboDecision。实验显示该基准能区分并训练提升 VLM 的空间、时序和动作级推理能力,但具体增益可能主要来自更大规模数据与决策式监督。

HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight Figure 1
2026-05-26cs.RO

HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight

Quang Ngoc Pham, Jonas Eschmann, Yang Zhou, Alejandro Ojeda Olarte, Giuseppe Loianno, Van Anh Ho

Department of Electrical Engineering and Computer Sciences

2026-05-26机器人强化学习规划控制安全鲁棒

面向无人机在人群和复杂环境中难以完全避免碰撞的问题,HoLoArm不再只依赖感知避障,而是将蜻蜓翅结节启发的柔顺关节引入四旋翼机臂,并用强化学习控制补偿软硬混合结构的建模困难。实验显示其可多方向被动形变并在约0.3–0.6秒内恢复,最高承受7.6 m/s碰撞,且能携带540 g载荷稳定飞行。

ParkourFormer: Integrating Predictive Supervision and Sequence Modeling into Parkour Locomotion Figure 1
2026-05-26cs.RO

ParkourFormer: Integrating Predictive Supervision and Sequence Modeling into Parkour Locomotion

Yanheng Mai, Wenhao Xu, Zirui Huang, Yifei Fu, Shengwei Dong, Xinjue Wang, Kailun Huang, Yanzhe Xie, Renjing Xu

The Hong Kong University of Science and Technology (Guangzhou), CLAI-LAB, CL-TECH, South China Agricultural University, Guangdong University of Technology

2026-05-26机器人视觉感知强化学习学习理论数据集/基准

针对人形机器人跑酷中仅凭当前观测反应难以应对接触切换和全身动力学变化的问题,ParkourFormer将运动控制建模为带未来条件的序列决策:当前状态通过交叉注意力检索历史传感—动作轨迹,并用轻量预测头监督预测短期本体状态,再与时序特征共同生成动作。在楼梯、沟壑、斜坡、粗糙地形和障碍等统一多地形任务上,仿真与Unitree G1实机平均通过率达93.85%,较MLP、MoE-MLP和普通Transformer最高提升42.73%。

Implicit Null-space Manifold Generation for Redundant Robotic Systems Figure 1
2026-05-26cs.RO

Implicit Null-space Manifold Generation for Redundant Robotic Systems

Taiki Ishigaki, Teresa Vidal-Calleja, Ko Ayusawa, Eiichi Yoshida

Tokyo University of Science, Japan, University of Technology Sydney, Australia, National Institute of Advanced Industrial Science and Technology, Japan

2026-05-26机器人三维

这篇论文针对冗余机器人中“同一任务对应多组构型”但传统雅可比方法只求单次解、难以复用解空间几何的问题,提出用雅可比引导采样在解流形邻域收集样本,并以高斯过程构造配置空间隐式标量场,使零水平集表示零空间流形且形成连续距离场。实验在三连杆平面机器人和7自由度Franka上验证了流形建模、邻近查询及跨连续任务族表示的可行性。

HumanFlow -- Diffusion-Driven MAV Navigation Among Humans via Tightly-Coupled Motion Tracking, Forecasting, and Control Figure 1
2026-05-26cs.RO

HumanFlow -- Diffusion-Driven MAV Navigation Among Humans via Tightly-Coupled Motion Tracking, Forecasting, and Control

Simon Schaefer, Joshua Näf, Stefan Leutenegger

2026-05-26机器人视觉感知生成模型强化学习规划控制

面向在人群中飞行的微型无人机,论文针对动态视角、严重遮挡和人体局部可见时感知与避障脱节的问题,提出 HumanFlow:用3D场景条件化的潜空间扩散模型统一人体跟踪与预测,并将其潜表示接入基于 flow matching 的近似 MPC 控制策略。实验显示其人体轨迹更平滑准确、计算开销低于强基线,集成导航后在仿真真实人体轨迹中保持无碰撞并提升到达效率。

Compliant Non-Prehensile Pushing Manipulation Figure 1
2026-05-26cs.RO

Compliant Non-Prehensile Pushing Manipulation

Francesco Cufino, Mario Selvaggio, Fabio Amadio, Fabio Ruggiero

2026-05-26机器人视觉感知规划控制三维安全鲁棒

面向医院、协作工位等有人环境中难以抓取物体的推送需求,论文将非抓取推送从传统位置控制扩展到阻抗控制机器人:用带互补约束的 MPC 同时调节推力与接触点,并加入能量罐无源滤波抑制外部干扰下的能量累积。仿真和两套真实机器人实验表明,该方法可在人员物理交互时保持柔顺无源,并对物体参数变化维持一定轨迹跟踪鲁棒性。

G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation Figure 1
2026-05-26cs.RO

G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation

Dongzhihan Wang, Yi Du, Jianan Sun, Yuan Xue, Yingchen Zhang, Bing Xiao, Chen Wang, Liang Xu

Shanghai University, Shanghai 200444, China., Dongzhihan Wang, Yi Du, and Chen Wang are with the Spatial AI & Robotics Lab, Institute for Artificial Intelligence and Data Science, Department of Computer Science and Engineering, University at Buffalo, Buffalo, NY 14260, USA. Contact: https://sairlab.org. 3 Jianan Sun is with the College of Information Science and Technology, Donghua University, Shanghai 200051, China. 4 Yingchen Zhang is with the State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, and the University of Chinese Academy of Sciences, Beijing 100190, China. 5 Bing Xiao is with the School of Automation

2026-05-26机器人视觉语言生成模型强化学习规划控制

面向“先跨校园到达地点、再按语言描述找人/物”的户外机器人任务,G-DRAGON将自然语言目标作为OSM实体的生成式检索问题,并用本地轻量LLM生成行为树,把地理路由、SLAM坐标系与末端开放词汇体素语义探索串起来。仿真中较现有基线提升约50%,真实UGV在未见城市环境完成最长500米搜寻;但仍需边缘服务器初始化行为树。

Acting on the Unseen: Communication-Free Collaborative Filtering for Decentralized Multi-Robot Task Allocation Figure 1
2026-05-26cs.RO

Acting on the Unseen: Communication-Free Collaborative Filtering for Decentralized Multi-Robot Task Allocation

Alexander Apartsin, Yigal Meshulam, Yehudit Aperstein

Acting on the Unseen: Communication-Free Collaborative, aHolon Institute of Technology, Holon, Israel., bAfeka Tel Aviv Academic College of Engineering, Tel Aviv, Israel, onboard new tasks, by running online low-rank collaborative filtering over the broadcast (SwarmCF). The, collaborative filtering, central coordinator / centralized training. In many real deployments none of these is available:, Relation to collaborative filtering. Low-rank collaborative filtering is itself classical, . We propose SwarmCF, a decentralized, online, low-rank collaborative filter that each robot runs

2026-05-26机器人强化学习学习理论安全鲁棒

针对多机器人任务分配在无通信、无先验任务模型、仅能私有噪声地旁观队友结果时难以处理未尝试任务的问题,论文提出 ZK-MRTA 设定与 SwarmCF:各机器人利用被动广播做在线低秩协同过滤,从共享潜在能力—任务结构中泛化到未见配对。理论给出相对无结构学习的样本复杂度与累计收益分离,实验显示随群体规模能力提升,并约达到集中全通信上限约 80% 的 earned skill。

ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation Figure 1
2026-05-26cs.CV

ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation

Huan Ren, Yihan Chen, Chuxin Wang, Nailong Liu, Wenfei Yang, Tianzhu Zhang

2026-05-26数据集/基准三维安全鲁棒

针对类别级位姿估计中深度点云因自遮挡而不完整、直接串联补全网络又带来误差累积和开销的问题,ComPose将点云补全作为任务驱动的内部模块与位姿估计统一训练,通过关键点渐进补全、几何关系编码和关系一致性损失,为NOCS预测提供完整结构线索。实验显示其在标准基准上优于现有方法,深度版在REAL275的10°2cm指标提升9.1%,且不依赖类别形状先验。

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation Figure 1
2026-05-26cs.RO

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

2026-05-26机器人生成模型强化学习规划控制数据集/基准

论文针对扩散/自回归机器人策略在单次随机推理下不稳定的问题,提出推理时采样框架 TapSampling:用 Action-VAE 在低维后验中高效生成候选动作,再用由轨迹顺序自监督训练的任务进度验证器选择更可能推进任务的动作。实验显示其在仿真和真实环境中可无策略微调提升多种通用机器人策略表现。

Safety-Critical Whole-Body Control for Humanoid Robots via Input-to-State Safe Control Barrier Functions Figure 1
2026-05-26cs.RO

Safety-Critical Whole-Body Control for Humanoid Robots via Input-to-State Safe Control Barrier Functions

Kwanwoo Lee, Sanghyuk Park, Gyeongjae Park, Myeong-Ju Kim, Jaeheung Park

Abstract: Safety-critical control is essential for humanoid robots operating in complex human-centered environ-, in complex, human-centered environments. To operate, Kwanwoo Lee, Sanghyuk Park, Gyeongjae Park, and Jaeheung Park are with the Department of Intelligence and Information, Seoul National, Technology, Republic of Korea, and with ASRI, AIIS, Seoul National University, Republic of Korea. He is the corresponding author of this, erarchical projections, which can limit scalability as the

2026-05-26机器人视觉感知规划控制优化算法学习理论

针对人形机器人在关节限位、自碰撞、避障等约束下易受模型误差、跟踪误差和外扰破坏安全保证的问题,论文将ISSf-CBF安全滤波器插入运动学WBC与动力学WBC之间,以保守参数把速度级安全约束转移到全阶动力学。仿真和实机在行走、遥操作、单腿平衡等任务中显示其能在模型不匹配下提升安全裕度并实时满足多重约束。

Action-Prior Denoising for Smooth Real-Time Chunking Figure 1
2026-05-26cs.RO

Action-Prior Denoising for Smooth Real-Time Chunking

Dongyang Liu, Zhaowen Zheng, Yu Sun, Longxu Zhang, Yixuan Liu, Hao Wan

2026-05-26机器人强化学习学习理论三维

论文针对动作分块策略在推理延迟下新旧 chunk 交接不连续的问题,指出硬 RTC 的二值前缀约束忽略了可编辑重叠区仍应贴近旧计划这一结构。Soft RTC 用逐 token 动作先验去噪替代硬掩码,无需改模型并保持训练期 RTC 的快速部署。Kinetix 上短窗口成功率接近硬 RTC,.medium 窗口在高延迟下将动作差分和 jerk 降低约 9%,小规模真机结果也显示命令更平滑。

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation Figure 1
2026-05-26cs.RO

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

Wenhui Chu

Department of Computer Science and Engineering, Texas A&M University, College Station, TX, USA

2026-05-26机器人视觉感知数据集/基准三维安全鲁棒

这篇论文针对 SAM 等基础模型在透明物体、杂乱场景等机器人视觉中零样本退化的问题,指出域偏移在 Transformer 各层并不均匀:浅层差异大、深层迁移较好。RepSAM据此用 CKA 预先分配 LoRA 秩,并结合深度融合与边缘损失。六个基准上以 4.0M 可训练参数达到 89.0% mIoU,接近全量微调且训练成本大幅降低,仿真抓取成功率较 LoRA RGB 基线提升 12.0%。

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models Figure 1
2026-05-26cs.RO

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

Stanford University

2026-05-26机器人视觉语言视觉感知生成模型强化学习

这篇论文针对预训练VLA在真实机器人任务中泛化尚可但成功率不足、RL微调又常样本低效的问题,提出EXPO-FT:在EXPO框架上适配动作chunk的流/扩散式策略,并结合轻量编辑策略与人在环纠正,尽量保留预训练先验而避免直接高成本更新。实验在串灯布线/插头、台球击打、插花等精细操作中平均仅用19.1分钟在线数据达到30/30成功,优于从零RL和既有VLA微调方法。

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration Figure 1
2026-05-26cs.RO

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration

Yoga Satwik Chappidi, Avideh Zakhor

Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, Berkeley, CA, USA.

2026-05-26机器人视觉语言视觉感知规划控制三维

面向未知室内三维建图中“前沿易达但未必有价值”的分支选择问题,OPAL不做重型全局巡游规划,而是在歧义分支点让无人机原地360度偏航刷新视野,再用可达邻域过滤、局部选择器及可选LLM/VLM仲裁下一前沿。仿真显示其计算更简单、行驶距离更短、覆盖-距离AUC更高,但总探索时间因旋转增加;实机两处室内场景中某变体较FALCON最多减少约25%航程。

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning Figure 1
2026-05-26cs.RO

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning

Hyung-Suk Yoon, Seung-Woo Seo

2026-05-26机器人强化学习模仿学习规划控制数据集/基准

针对模仿学习中专家示范覆盖窄、机器人在线遇到未见状态易失效的分布偏移问题,本文提出 RAIL 框架:离线阶段用低成本补充示范和带正则的判别器加权行为克隆扩展覆盖,在线阶段仅在检测到偏移时把自身经验视为次优示范进行自监督更新。MuJoCo 噪声环境实验显示,其离线鲁棒性和在线适应性均优于基线。

Path Following Control System of Line-of-Sight Guidance for Robotic Dolphin with Multi-Link Mechanism in Underwater Simulator Figure 1
2026-05-26cs.RO

Path Following Control System of Line-of-Sight Guidance for Robotic Dolphin with Multi-Link Mechanism in Underwater Simulator

Takumi Asada, Takao Oki, Hideo Furuhashi, Kenta Tabata, Renato Miyagusuku, Koichi Ozaki

2026-05-26机器人规划控制数据集/基准三维

针对多连杆仿生水下机器人路径跟随缺少可验证控制框架的问题,本文在 Webots/ROS2 水下仿真中建模七关节机器海豚,将 LOS/ALOS 制导经映射函数转换为多关节 CPG 幅值控制。实验显示,合适前视距离约为机体长度的 1.75 倍,带幅值控制的 ALOS 在 RMSE 和 MAE 上误差最小,说明仿真可用于预调参数并评估 BAUV 跟踪性能。

Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving Figure 1
2026-05-26cs.RO

Decision-Making with Lightweight Confidence-Aware Language Model for Autonomous Driving

Ruoyu Yao, Ruiguo Zhong, Pei Liu, Mingxing Peng, Rui Yang, Jun Ma

2026-05-26视觉语言生成模型强化学习模仿学习学习理论

面向车载算力受限下大模型自动驾驶决策延迟过高、且常缺少显式不确定性的问题,论文用多智能体LLM慢速生成带置信度的CoT示范,再蒸馏到双头轻量语言模型,同时预测决策概率与解释,并结合RAG微调提升数据效率。nuPlan闭环实验显示其在常规与长尾场景达到SOTA成功率,且保持较低推理延迟。

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand Figure 1
2026-05-26cs.RO

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

Dominic Maggio, Nicolas Gorlo, Luca Carlone

Laboratory for Information & Decision Systems, Massachusetts Institute of Technology

2026-05-26机器人视觉语言学习理论数据集/基准三维

面向机器人在开放室内外环境中执行导航与操作时,现有3D场景图依赖深度传感器且语义粒度固定。FOUND-IT以几何基础模型为核心,用未标定单目视频实时建图,并在查询时按任务动态生成对象、可通行空间与区域粒度,还引入智能体式查询构建。实验显示其在ASHiTA SG3D任务 grounding 上准确率提升79%,可在Jetson Thor地面机器人上实时运行,并能处理YouTube房屋导览视频。

Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System Figure 1
2026-05-26cs.RO

Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System

Yuhui Hu, Dong Zhou, Kaihong Ouyang, Zhongliang Yu, Jianfeng Lv, Xiangyu Shao

2026-05-26机器人强化学习规划控制优化算法学习理论

针对空间机械臂与航天器基座强动力耦合导致末端精度和姿态稳定难以兼顾的问题,论文将任务拆成机械臂与基座两个 PPO 智能体,并用 TESG 在时间步级切换非最优先验策略来引导探索、降低双智能体训练干扰。仿真显示该框架在成功率、控制精度和收敛性上优于常见 DRL 基线,并在约束、扰动和感知不确定性下保持一定鲁棒性。

Parallel Differentiable Reachability for Learning and Planning with Certified Neural Dynamics and Controllers Figure 1
2026-05-26cs.RO

Parallel Differentiable Reachability for Learning and Planning with Certified Neural Dynamics and Controllers

Keyi Shen, Glen Chou

2026-05-26机器人生成模型强化学习规划控制优化算法

针对神经网络动力学与控制器在机器人闭环中难以高效获得不确定性保证的问题,论文提出 JAX 上的可并行、可微可达性框架,将 Taylor 模型 flowpipe 与 CROWN 线性界传播统一起来,并把可达集目标接入模型/控制器训练和采样式 MPC。实验覆盖非抓取操作、真实 T-pushing、四旋翼及最高 72 维系统,显示可在线规划并保持有界扰动下的认证可达集过近似。

UWM-JEPA: Predictive World Models That Imagine in Belief Space Figure 1
2026-05-26cs.LG

UWM-JEPA: Predictive World Models That Imagine in Belief Space

Santosh Kumar Radha, Oktay Goktas

2026-05-26强化学习安全鲁棒

论文针对部分可观测环境中 JEPA 世界模型难以在盲 rollout 中保留多种隐藏未来的问题,提出 UWM-JEPA:用系统-环境联合密度矩阵表示 belief latent,并以可学习酉变换推进,使联合谱、纯度和熵不被预测器耗散。实验显示,在隐藏速度任务中其反事实动作预测准确率达 0.77,优于匹配 LSTM-JEPA 的 0.53;短视距盲 rollout 的探针退化也更小,但长视距与更复杂环境仍文中未充分说明。

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks Figure 1
2026-05-26cs.CV

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks

Sambit Mohapatra, Senthil Yogamani, Heinrich Gotzig, Patrick Mader

2026-05-26视觉感知强化学习优化算法数据集/基准三维

面向自动驾驶中 LiDAR BEV 检测的高算力/高功耗瓶颈,本文将端到端脉冲编码器-解码器引入三维目标检测,用替代梯度训练,并设计面向关键点与框回归的脉冲域损失及可部署的全二值脉冲版本。KITTI 上膜电位输出版本在 IoU=0.5 达到 92.05/87.04/86.51 AP,学习式脉冲编码优于手工编码;能耗分析显示较等价 CNN 降低 3.33×,但实验仍以静态帧重复近似时间流。

GreenSeg: Ground Segmentation Algorithm for Agricultural Robots in Mediterranean Greenhouses using RGB-D Point Clouds Figure 1
2026-05-26cs.RO

GreenSeg: Ground Segmentation Algorithm for Agricultural Robots in Mediterranean Greenhouses using RGB-D Point Clouds

Fernando Cañadas-Aránega, José C. Moreno, José L. Blanco-Claraco

2026-05-26机器人视觉感知优化算法数据集/基准三维

面向地中海温室窄行、异质地面和聚乙烯反光导致 RGB-D“鬼点”的低成本导航需求,GreenSeg用全局平面拟合结合曲率过滤适应地形,再以种子点区域生长约束可通行地面的空间连续性。AGRICOBIOT I在四种日照场景测试中优于基线,走廊末端转向时平均召回最高提升11.58%、mIoU提升19.24%。

FusionCore: A 23-State Unscented Kalman Filter for IMU, Wheel Encoder, GPS, and Visual SLAM Fusion in ROS 2 Figure 1
2026-05-26cs.RO

FusionCore: A 23-State Unscented Kalman Filter for IMU, Wheel Encoder, GPS, and Visual SLAM Fusion in ROS 2

Manan Kharwar

2026-05-26机器人规划控制数据集/基准三维

面向 ROS 2 机器人中 IMU、轮速计、GPS 与视觉 SLAM 融合易受传感器偏置、GPS 中断和坐标投影影响的问题,FusionCore 将陀螺/加速度计偏置及轮速计偏航率系统偏置纳入 23 状态 UKF,并加入 ECEF 原生 GPS、按自由度校准的门控和噪声自适应。在 NCLT 12 条长序列上相对 robot_localization 有 10 条 ATE 更低,提升 1.2–22.2 倍,但对比中基线 UKF 全部数值发散,增益来源仍需更多独立验证。

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation Figure 1
2026-05-26cs.CV

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

Aviral Chharia, Fernando De la Torre

2026-05-26视觉感知强化学习优化算法数据集/基准三维

面向低资源下大规模生成可用3D头部资产,论文针对现有方法依赖多视角采集、3D监督或先合成中间视图导致成本高且一致性漂移的问题,提出MVCHead:用HiSS/HiBiSS状态空间结构直接回归3D Gaussian,并以SE(3)多视角Critic在自渲染视图间施加一致性信号。实验称其在感知质量、纹理与几何一致性上优于既有方法,并发布FaceGS-10K数据集,但完整360°覆盖仍受限。

InvariantCloud: A Globally Invariant, Uniquely Indexed Point Cloud Framework for Robust 6-DoF Tactile Pose Tracking Figure 1
2026-05-26cs.RO

InvariantCloud: A Globally Invariant, Uniquely Indexed Point Cloud Framework for Robust 6-DoF Tactile Pose Tracking

Pengfei Ye, Yuxiang Ma, Yi Zhou, Wei Chen, Wenzhen Dong, Molong Duan

2026-05-26机器人视觉语言视觉感知模仿学习数据集/基准

面向无CAD模型、无外部相机条件下精细操作中的触觉6-DoF位姿跟踪难题,InvariantCloud将视觉触觉传感器表面标记预构造成带唯一ID的全局不变点云,用ID对应替代ICP/光流匹配,并结合Kabsch求解与PCA主轴估计改善偏航角。实验显示其在多物体长序列中降低累积漂移和重定位误差,偏航跟踪稳定性优于基线。

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation Figure 1
2026-05-26cs.LG

Grow-Prune-Freeze Networks: Adaptive & Continual Learning Technique for Olfactory Navigation

Kordel K. France, Ovidiu Daescu

2026-05-26机器人视觉语言视觉感知强化学习学习理论

针对嗅觉导航数据稀缺、环境非平稳且机器人需在线适应的问题,论文提出 Grow-Prune-Freeze 网络:按验证损失增长层、按显著性剪枝并冻结稳定早期层,以在持续强化学习中平衡可塑性与遗忘,并用随机矩阵理论解释谱稳定性。基于 Expected SARSA 的实验在湍流气味羽流源定位中达到约94%泛化成功率,非嗅觉任务仅提供初步泛化证据。

Soft Pneumatic Actuators for Soft Robotics: A Motion-Based Review of Actuation Mechanisms and Performance Trade-offs Figure 1
2026-05-26cs.RO

Soft Pneumatic Actuators for Soft Robotics: A Motion-Based Review of Actuation Mechanisms and Performance Trade-offs

Mohammed Abboodi

2026-05-26机器人优化算法安全鲁棒

软气动执行器种类快速增加,使仅按行程、弯曲角或压力选型和横向比较变得不可靠。本文以线性、弯曲、扭转和全向四类运动重组文献,核心洞察是性能主要由腔体、纤维/编织、褶皱、非对称与约束层共同决定,而非压力单因子。综述指出相似运动输出可能对应截然不同的力、耗气、滞后、耐久和集成代价,并给出比较时需同时报告尺寸、载荷、气源与测试条件的准则。

A Decentralized LiDAR-SLAM System with Certifiably Optimal Pose Graph Optimization Figure 1
2026-05-26cs.RO

A Decentralized LiDAR-SLAM System with Certifiably Optimal Pose Graph Optimization

Baoshan Song, Feng Huang, Li-Ta Hsu

2026-05-26机器人模仿学习规划控制优化算法学习理论

面向去中心化多机器人 LiDAR-SLAM 中单次坐标对齐和局部 PGO 易陷入局部最优、长期漂移累积的问题,论文将 RBCD 可认证最优位姿图优化接入 P2P SLAM 后端,把机器人内外约束统一优化并用对偶证书检验全局最优性。实车拆分双机器人实验中,相比 DiSCo-SLAM 两条轨迹 RMSE 分别降低 48.9% 和 13.4%。

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models Figure 1
2026-05-26cs.RO

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Dongbin Zhao, Haoran Li, Zongqing Lu

2026-05-26机器人视觉语言视觉感知生成模型强化学习

针对现有 VLA 在更换末端执行器时需单独微调动作头、难以利用跨本体示教的问题,X-DiffVLA用统一扩散动作头建模异构动作分布,并以 Embodiment Forcing 注入形态条件、Morphological Tree Diffusion 挖掘末端间行为相关性。在 RoboCasa 与 Isaac Gym 中覆盖夹爪到灵巧手,分别较基线提升 15.3% 和 12.5%,并给出真实机器人验证。

RAMBA: 4D Radar Mapping by Bundle Adjustment Figure 1
2026-05-26cs.RO

RAMBA: 4D Radar Mapping by Bundle Adjustment

Jianzhu Huai, Yiwen Chen, Binliang Wang

2026-05-26机器人规划控制优化算法数据集/基准三维

针对4D雷达里程计虽可在线估计但离线全局地图仍易受漂移和重访不一致影响的问题,RAMBA把GICP式协方差加权点到点约束扩展到多帧束调整,并联合IMU预积分、雷达自速度与回环约束优化关键帧状态。在ColoRadar和SNAIL Radar上,其地图一致性提升,轨迹精度通常优于雷达惯性里程计和位姿图优化基线。

ParkingWorld: End-to-End Autonomous Parking Reinforcement Learning from Corrective Experience in 3DGS Simulation Figure 1
2026-05-26cs.RO

ParkingWorld: End-to-End Autonomous Parking Reinforcement Learning from Corrective Experience in 3DGS Simulation

Zhengcheng Yu, Changze Li, Haoran Liu, Tong Qin

2026-05-26生成模型强化学习模仿学习学习理论三维

面向狭窄车位中低速机动、避障与仿真到实车视觉鸿沟带来的自动泊车难题,本文构建可交互的真实场景 3DGS 泊车模拟器,并提出 CIL-SERL:把失败探索、人类纠正和回滚片段组织成多级回放“错题本”,引导离策略强化学习重点学习错误修正。仿真与实车闭环实验显示,其在成功率、效率和安全性上均优于对比方法。

Micro-Swarm Locomotion Optimization in Dynamic Flow using Multi-Objective Multi-Agent Reinforcement Learning Figure 1
2026-05-26cs.RO

Micro-Swarm Locomotion Optimization in Dynamic Flow using Multi-Objective Multi-Agent Reinforcement Learning

Josef Berman, Oren Gal

2026-05-26机器人生成模型强化学习规划控制优化算法

面向血管等非定常流场中微机器人群难以兼顾逆流推进、节能和平滑控制的问题,论文将不可压 Navier–Stokes CFD 与多目标多智能体 PPO 直接耦合,并用 PCGrad 处理目标梯度冲突。16 个磁驱微机器人在脉动流中学到分层节流、周期棘轮和末端个体化策略;相较蛮力基线,进展奖励提升超过 8,能效维持 0.63–0.65、平滑度接近 1,消融显示无 PCGrad 会导致能效和平滑性崩塌。

Performance Comparison of Classical and Neural Sampling Algorithms for Robotic Navigation Figure 1
2026-05-26cs.RO

Performance Comparison of Classical and Neural Sampling Algorithms for Robotic Navigation

Hichem Cheriet, Badra Khellat Kihel, Samira Chouraqui

2026-05-26机器人规划控制优化算法

针对 RRT* 在障碍密集场景中均匀采样低效、收敛慢且路径锯齿的问题,本文在统一设置下比较经典 RRT*、Neural RRT* 与 Neural Informed RRT*,核心洞察是用学习到的采样分布并结合 informed 采样区域可更集中探索有效通道。实验显示神经引导方法路径最多缩短 14%、平滑度提升 55–75%,Neural Informed RRT* 综合最好,但计算时间略有增加。

Convex-Neural RRT*: Fast and Reliable Learning-Guided Sampling for High-Quality Robot Path Planning Figure 1
2026-05-26cs.RO

Convex-Neural RRT*: Fast and Reliable Learning-Guided Sampling for High-Quality Robot Path Planning

Hichem Cheriet, Badra Khellat Kihel, Samira Chouraqui, Bara J. Emran

2026-05-26机器人规划控制优化算法学习理论数据集/基准

针对 RRT* 等采样规划器在复杂障碍环境中需大量迭代才能得到高质量路径的问题,论文提出 Convex-Neural RRT*:用 U-Net 预测优质路径附近的 waypoint 区域,再提取凸候选区域/角点进行混合采样,并用代价稳定早停减少无效搜索。在 3 类环境、18 个地图上,相比神经引导变体耗时降低 30–75%,相比 LTA* 降低 88–98%,相对经典 RRT* 路径约短 5%,成功率超过 99%。

Stiffness Optimization for Concentrated Bending in Magnetically Actuated Catheters: Maintaining Steerability under Gradient Stiffness Figure 1
2026-05-26cs.RO

Stiffness Optimization for Concentrated Bending in Magnetically Actuated Catheters: Maintaining Steerability under Gradient Stiffness

Jiewen Tan, Junnan Xue, Shing Shin Cheng, Shuang Song, Erli Lyu, Jiaole Wang

2026-05-26机器人规划控制优化算法三维安全鲁棒

针对磁驱软导管中“高刚度利于推送但削弱转向、低刚度易屈曲”的矛盾,论文提出SO-MAC:用磁体—弹簧多段结构和递归优化的梯度刚度,在近端稳定枢轴处集中弯曲,同时让远端对准段自恢复近直以传递推进力。实验中1.5 mm导管实现180°转向、3 mm弯曲半径,形状误差1.39±0.56 mm,支点误差0.35±0.10 mm,并在支气管模型中完成视觉反馈导航。

Learning, locomotion, and navigation of soft synthetic snakes in three-dimensional, heterogeneous environments Figure 1
2026-05-26cs.RO

Learning, locomotion, and navigation of soft synthetic snakes in three-dimensional, heterogeneous environments

Xiaotian Zhang, Ali Albazroun, Tixian Wang, Songyuan Cui, Prashant G. Mehta, Mattia Gazzola

2026-05-26机器人强化学习规划控制三维安全鲁棒

针对软体蛇形机器人在三维非结构地形中高自由度、强接触非线性导致控制难的问题,论文将 Cosserat 杆物理仿真、真实重建地形接触、生物启发的双波驱动与振荡器感知嵌入强化学习;先在均质地形学习步态原语,再用感知阈值切换策略适应异质摩擦与3D地形。结果显示均质任务接近全可达,异质场景中策略切换通常优于从零训练,并能在火星等真实扫描地形上实现较可靠导航。

Loosely Coupled Factor Graph Optimization for Pseudolite-Augmented Navigation Figure 1
2026-05-26cs.RO

Loosely Coupled Factor Graph Optimization for Pseudolite-Augmented Navigation

Chih-Chun Chen, Lipeng Tan, Shiyu Bai, Heike Vallery

2026-05-26机器人优化算法数据集/基准三维

面向隧道、城市峡谷等 GNSS 可见性差场景,论文将伪卫星提供的类 GNSS 信号纳入松耦合因子图优化:先由 GNSS/PL 伪距最小二乘给出位置观测,再与 IMU 预积分和偏置因子联合优化。80 秒实测中,在仅 4 颗高仰角 GPS 卫星并加入 0–2 个伪卫星的设置下,FGO 相比 LS 将平均 3D 误差降低 22.8%–41.3%,加入伪卫星还能进一步改善精度,但收益受发射机几何影响。

Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion Figure 1
2026-05-26cs.RO

Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion

Gianluca Sabatini, Chenhao Li, Marco Hutter

2026-05-26机器人生成模型强化学习优化算法安全鲁棒

针对PPO在仿真中稳定但样本效率低、难以直接用于真机在线微调的问题,本文分析SAC在大规模并行腿足训练中落后PPO的具体原因:动作空间/初始探索失配、超时截断处理偏置和奖励传播过慢,并通过小方差策略初始化、关节限幅动作边界、timeout-aware critic目标与n步回报修正RSL-RL-SAC。实验在7类腿足平台和粗糙地形速度跟踪任务上显示,其在不改PPO奖励、固定超参下基本追平PPO回报,但墙钟时间和随机种子稳定性仍未完全解决。

ARCANE-PedSynth: Synthetic Multi-Pedestrian Datasets with Behavioural Crossing Annotations Figure 1
2026-05-26cs.RO

ARCANE-PedSynth: Synthetic Multi-Pedestrian Datasets with Behavioural Crossing Annotations

Muhammad Naveed Riaz, Maciej Wielgosz, Antonio M. López Peña

2026-05-26强化学习规划控制数据集/基准三维

面向自动驾驶中过街意图预测,论文针对真实数据过街样本少、危险场景难采集且标注昂贵的问题,提出基于 CARLA 的 ARCANE-PedSynth,用混合 AI/手动控制将过街率从原生 9% 提升到可配置最高 75%,并用 12 状态行为 FSM、5 类行人角色生成犹豫、观察、折返等行为,输出同步 RGB/LiDAR/DVS 与逐帧标签。示例数据集 PedSynth++ 含 533 段多行人、12 种天气;在其上训练 PedGT 的 16 帧模型达到 F1=89,但文中也说明这主要验证合成域内可学习性,真实域泛化仍未充分证明。

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos Figure 1
2026-05-26cs.RO

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos

Zhi, Wang, Botao He, Kelin Yu, Seungjae Lee, Ruohan Gao, Furong Huang, Yiannis Aloimonos

2026-05-26机器人视觉感知生成模型强化学习模仿学习

机器人操作依赖大量机器人示教,而人类第一视角视频虽便宜却存在外观与运动学具身差距。HumanEgo的核心是把手—物交互提升为实体级ICT表示,并结合手臂修复、虚拟夹爪、流匹配策略和多种密集辅助监督,从分钟级人类视频中训练可部署策略。实验显示每任务30分钟视频在4个真实任务达92.5%成功率,15分钟仍有75%,并比同等采集时间遥操作高41%,还能零样本迁移到新机器人、相机和环境。

Learning High-Frequency Continuous Action Chunks in Latent Space Figure 1
2026-05-26cs.RO

Learning High-Frequency Continuous Action Chunks in Latent Space

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding

2026-05-26机器人生成模型强化学习规划控制

这篇论文针对机器人在 60Hz 等高频动作分块下易抖动、块间不连续的问题,指出直接在动作空间学习负担过重。方法用 VAE 将高频动作块压到连续潜空间学习,并提出免训练的 Reuse-then-Refine 复用已执行动作再经 VAE 修正,以缓解异步推理边界断裂。三项真实接触任务显示其轨迹更平滑、精度更好、停顿更少。

Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models Figure 1
2026-05-26cs.RO

Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models

Lei Zheng, Peiqi Yu, Zengqi Peng, Changliu Liu, Armin Lederer

2026-05-26机器人视觉语言生成模型强化学习规划控制

本文针对扩散策略多步去噪导致机器人闭环控制延迟过高的问题,将教师扩散模型蒸馏为单次前向推理,并用带状态相关模态增益的因子化动态 Koopman 层刻画去噪轨迹的潜在转移,以保留多模态行为。实验在 D4RL MuJoCo 与 Kinova 机械臂上显示,其回报优于现有一步蒸馏基线,推理降至毫秒级,并能实现较平滑的实时执行。

MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo Figure 1
2026-05-26cs.RO

MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo

Yufei Jia, Junzhe Wu

2026-05-26机器人规划控制优化算法学习理论数据集/基准

面向在线机器人学习中频繁短步进、局部重置和批量查询导致的 Python/对象生命周期开销,MuJoCoUni 在不改动 MuJoCo 物理内核的前提下,用 BatchEnvPool 持久管理多环境模型、线程数据和线程池,支持最终状态返回、稀疏重置随机化及传感器/Jacobian/地形查询。论文给出接口、数值一致性测试和微基准脚本;具体吞吐增益幅度文中未充分说明。

Learning Transferable Motor Skills for Geometry-Aware Robotic Surface Tasks Figure 1
2026-05-26cs.RO

Learning Transferable Motor Skills for Geometry-Aware Robotic Surface Tasks

Miroslav David, Karla Stepanova, Robert Babuska

2026-05-26机器人视觉语言模仿学习规划控制三维

面向喷涂、焊接等表面作业,论文试图解决几何路径规划缺少专家执行习惯、示教又难跨几何迁移的问题。其核心是把速度缩放、姿态偏移等技能显式表示为可解释规则,并由1D轨迹编码器与PointNet++ CAD编码器联合预测后注入规划轨迹。仿真中在L形与窗框物体上分类F1接近1,参数MAE较低;但尚未实机验证,泛化增益可能主要来自合成规则与数据设定。

DBPnet: Damper Characteristics-Based Bayesian Physics-Informed Neural Network for Wheel Load Estimation Figure 1
2026-05-26eess.SY

DBPnet: Damper Characteristics-Based Bayesian Physics-Informed Neural Network for Wheel Load Estimation

Tianyi Wang, Tianyi Zeng, Zimo Zeng, Feiyang Zhang, Yujin Wang, Xiangyu Li, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

2026-05-26强化学习规划控制数据集/基准三维安全鲁棒

面向 ADAS 底盘控制中难以直接、鲁棒获取的轮载估计问题,论文指出复杂悬架几何、非线性动力学和传感噪声会削弱传统滤波与普通 PINN。DBPnet 以悬架连杆级瞬时动力学建模提供物理约束,并将贝叶斯 PINN 与阻尼器特性启发的时序物理条件嵌入结合,使传感变化动态调制网络。仿真和实车实验显示其相较基线取得更低 RMSE 与 MaxError。

Manifold-Constrained MPPI: Real-Time Sampling-Based Control Under Hard Constraints Figure 1
2026-05-26cs.RO

Manifold-Constrained MPPI: Real-Time Sampling-Based Control Under Hard Constraints

Seulchan Lee, Sanghyun Kim

2026-05-26机器人视觉感知生成模型强化学习规划控制

针对闭链双臂等任务中 MPPI 软惩罚难以保证等式硬约束的问题,论文提出 MC-MPPI:先用 VAE 学习约束流形的低维潜空间,在其中采样规划近可行轨迹,再仅对选中解用一次 QP 修正残余偏差,避免逐样本投影。仿真与真实 14DoF 系统显示其可 100Hz 稳定运行,在动态避障中保持约束并提升跟踪精度。

Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning Figure 1
2026-05-26cs.LG

Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning

Yu Yang, Yihong Guo, Anqi Liu, Pan Xu

2026-05-26生成模型强化学习模仿学习规划控制数据集/基准

针对离线强化学习中源域数据充足而目标域数据稀少、且动力学不匹配的问题,本文认为仅重加权/过滤源数据或用一步动力学滚动都会受覆盖不足和长时误差累积限制。CEDGE先在源轨迹上训练扩散模型,再用由回报、域一致性和行为偏置组成的能量引导把整条轨迹推向目标动力学,无需重训生成器。ODRL实验显示,该轨迹级生成既提升扩散规划,也能作为合成数据改善目标策略学习。

Lifted Schrödinger Bridges for Gaussian Mixture Endpoints: Projection Gaps and Path-Space Obstructions Figure 1
2026-05-26math.OC

Lifted Schrödinger Bridges for Gaussian Mixture Endpoints: Projection Gaps and Path-Space Obstructions

Siddhartha Ganguly, George Rapakoulias, Panagiotis Tsiotras

2026-05-26生成模型规划控制优化算法学习理论三维

针对多峰高斯混合端点下薛定谔桥难以闭式求解的问题,论文把轨迹提升到带源-目标成分标签的路径空间,将问题拆成可解析的高斯成分桥与有限维熵耦合,并给出 Sinkhorn 形式。核心洞察是忘记标签后的投影虽满足原端点约束,却通常与无标签最优桥存在条件标签信息造成的熵间隙;同时推导了后验平均 Markov 漂移、能量上界及间隙消失条件。

MR-LiDAR: A Multi-Resolution Roadside LiDAR Benchmark for Perception Diagnostics and Deployment Guidance Figure 1
2026-05-26cs.RO

MR-LiDAR: A Multi-Resolution Roadside LiDAR Benchmark for Perception Diagnostics and Deployment Guidance

Shunlai Cui, Peng Cao, Yuan Zhu, Yongjiang He, Jiacheng Yin, Xiao Huo, Gang Cao, Xiaobo Liu

2026-05-26视觉感知强化学习规划控制数据集/基准三维

针对路侧感知中激光雷达选型常依赖经验、缺少同场景硬件对比的问题,MR-LiDAR用16/32/80/128线雷达在相同路侧场景采集车辆与弱势交通参与者数据,将线数、线束分布、距离、类别和遮挡作为诊断变量。实验显示16/32线在20米后明显退化,VRU更易受点云稀疏影响;更关键的是,优化线束分布的80线可在中远距离匹敌甚至超过均匀128线,说明单纯堆线数并非最优部署策略。

Enhanced INS/GNSS State Estimation using GNSS-Based Acceleration Measurements Figure 1
2026-05-26cs.RO

Enhanced INS/GNSS State Estimation using GNSS-Based Acceleration Measurements

Gal Versano, Itzik Klein

2026-05-26机器人强化学习数据集/基准三维安全鲁棒

面向地面无人车在低动态运动中仅靠 GNSS 位置更新难以观测姿态与 IMU 偏置的问题,论文从历史 GNSS 位置结合运动模型中用最小二乘提取平滑加速度,并作为辅助量测加入误差状态 EKF,无需新增硬件。两套真实 UGV、不同平台和 IMU 等级实验中,相比标准位置辅助 INS/GNSS,平均位置 RMSE 分别降低 11.40% 与 20.74%。

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance Figure 1
2026-05-26cs.CV

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance

Po-Chien Luan, Zimin Xia, Wuyang Li, Yang Gao, Alexandre Alahi

2026-05-26机器人生成模型强化学习规划控制优化算法

这篇论文针对导航世界模型长时滚动中生成噪声累积导致的感知漂移,以及预测视角与机器人运动不一致的几何漂移。核心做法是先预测稀疏未来锚点,再在锚点间分块生成中间帧,并用双向极线约束为扩散 Transformer 提供几何定位,无需显式 3D 监督。四个导航基准上,方法提升了长程视觉质量、几何一致性、多视角一致性,并带来更好的下游规划表现。

Geometric Workspace Analysis and Transmission-Aware Dynamics of a Serial Spherical Tool for Microsurgery Figure 1
2026-05-26cs.RO

Geometric Workspace Analysis and Transmission-Aware Dynamics of a Serial Spherical Tool for Microsurgery

Anestis Mablekos-Alexiou, Lyndon da Cruz, Christos Bergeles

2026-05-26机器人优化算法数据集/基准三维

面向显微/玻璃体视网膜手术中需围绕远程运动中心精确摆动且需快速定型执行器的串联球面机构,论文把关节轴几何与可达姿态工作空间解析关联起来,避免早期设计完全依赖数值优化,并引入自锁传动摩擦主导的动力学建模来估计扭矩需求。原型实验显示工作空间预测与实测约98%一致,扭矩响应仿真与实测超过85%一致。

Passivity-based Semi-autonomous Rotational Motion Navigation for Rigid-body Networks: Stability and Human Passivity Analysis Figure 1
2026-05-26eess.SY

Passivity-based Semi-autonomous Rotational Motion Navigation for Rigid-body Networks: Stability and Human Passivity Analysis

Reiji Terunuma, Yuta Nakamura, Takeshi Hatanaka

2026-05-26机器人规划控制三维

面向人在环多机器人三维姿态导航中手动意图与自主协同可能破坏稳定的问题,论文在 SO(3) 上结合 stealthy control、虚拟领导者与无源姿态同步律,使反馈给人的平均方向保持可控不变,并在“人可视为无源系统”假设下证明闭环稳定。仿真进一步辨识操作者传递函数并检验无源性,结果显示稳定性相关的无源条件对增益设置敏感。

Sum of Costs Diffusion with Dynamic Guidance for Motion Planning Figure 1
2026-05-26cs.RO

Sum of Costs Diffusion with Dynamic Guidance for Motion Planning

Aysu Aylin Kaplan, Özgür Erkent

2026-05-26机器人生成模型规划控制优化算法学习理论

面向机械臂运动规划在新场景中易失效的问题,论文把扩散轨迹生成与碰撞总代价梯度结合:在并行去噪中对预测的最终轨迹计算多项碰撞成本之和,并用权重均匀性动态决定何时开始引导,而非固定步数或单一成本。实验称其在 Mπnets 多种测试设置上优于对比方法,尤其提升跨设置泛化;但具体收益与计算开销的权衡仍需更多消融支撑。

Towards Low-Gravity Planetary Exploration using Reinforcement Learning for Walking, Jumping, and In-flight Attitude Control Figure 1
2026-05-26cs.RO

Towards Low-Gravity Planetary Exploration using Reinforcement Learning for Walking, Jumping, and In-flight Attitude Control

Jørgen Anker Olsen, Kostas Alexis

2026-05-26机器人视觉感知强化学习规划控制安全鲁棒

面向火星低重力下轮式探测器难以进入的陡坡、熔岩管和大障碍地形,论文把为跳跃优化的 Olympus 四足机器人与深度强化学习策略结合,统一训练行走、垂直/前向跳跃和飞行中姿态重定向,并用层级状态机调度多策略完成越障。结果显示硬件上姿态控制可在 2.6 秒完成 90° 重定向;火星重力仿真中可实现 3.1 米垂直跳和 3.9 米前跳,但除姿态控制外主要仍停留在仿真验证。

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models Figure 1
2026-05-26cs.CV

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

2026-05-26视觉语言视觉感知三维

该文针对VLA是否真正具备三维几何理解、以及如何把VGGT等几何基础模型接入GR00T-N1.5进行系统实验。核心贡献是用线性探针量化VLA与GFM的“几何鸿沟”,并公平比较Early Fusion、Late Fusion和Spatial Forcing等注入方式。结果显示,基础微调在RoboCasa/LIBERO上相对GR00T提升不显著,真实G1整体成功率也仅小幅上升;较可靠收益主要体现在Early Fusion改善接近阶段,最终增益可能主要来自更多数据或多相机配置。

PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution Figure 1
2026-05-26cs.RO

PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution

Anna Deichler

2026-05-26机器人视觉语言规划控制数据集/基准三维

本文关注服务机器人在第三视角下解析“把杯子放到那个上面”这类指称时,如何同时利用手势、语言和三维场景。作者用自然共语手势数据 MM-Conv,提出姿态与文本无共享参数的后期融合,并隔离类别嵌入影响;结果显示冻结 MiniLM 类别表示的融合在各类指称上优于单模态,Top-1 达 31.9%,也揭示共享类别表示可能掩盖真实融合贡献。

MuGen: Multi-Skill Generative Locomotion Controller for Humanoid Robots Figure 1
2026-05-26cs.RO

MuGen: Multi-Skill Generative Locomotion Controller for Humanoid Robots

Yusen Feng, Xiang Wang, Heyuan Yao, Zixi Kang, Xinyu Huo, Boyang Yu, Pengyun Qiu, Ruijie Zhao, Baoquan Chen, Libin Liu

2026-05-26机器人生成模型强化学习规划控制

针对类人机器人运动模仿中依赖任务奖励、生成轨迹与真实动力学脱节且难以复用技能的问题,MuGen在物理仿真中用VQ-VAE和模型式强化学习学习离散、动力学可行的运动潜空间,并通过教师-学生与渐进DAgger式蒸馏部署到策略。实验显示其在Unitree G1及仿真中可跟踪未见过的走、跑、舞蹈、蹲走等动作,较基线提升跟踪精度和鲁棒性,并可不依赖参考轨迹复用潜变量生成新动作。

Elevator-LIO: Robust LiDAR-Inertial Odometry for Multi-Floor Navigation under Elevator-Induced Non-Inertial Motion Figure 1
2026-05-26cs.RO

Elevator-LIO: Robust LiDAR-Inertial Odometry for Multi-Floor Navigation under Elevator-Induced Non-Inertial Motion

Yifan Zhang, Yudong Huang, Yuchong Zhang, Changze Li, Haoran Liu, Ming Yang, Tong Qin

2026-05-26机器人强化学习数据集/基准三维安全鲁棒

面向机器人跨楼层导航中电梯运动导致传统 LIO 将非惯性加速度误当自运动、进而漂移或发散的问题,Elevator-LIO 将机器人相对轿厢运动与电梯竖直运输运动解耦,并在模式相关误差状态 Kalman 滤波中加入停靠时零速度/零加速度约束和自适应体素降采样。20 组真实序列、79 次乘梯实验中均保持连续定位,17 组终端高度误差低于 1 cm,并在 Hilti 室内数据上保持竞争力。

Polymander II: an amphibious salamander-inspired robot with contact and flow sensors Figure 1
2026-05-26cs.RO

Polymander II: an amphibious salamander-inspired robot with contact and flow sensors

Qiyuan Fu, Sudong Lee, Andrea Grillo, Jonathan Arreguit, Louis Gevers, Josie Hughes, Auke J. Ijspeert

2026-05-26机器人生成模型规划控制安全鲁棒

面向两栖机器人在陆地—水域切换中缺少可防水环境力感知的问题,论文提出 Polymander II:用紧凑霍尔传感器与不同弹性结构同时测足端接触力和脊柱侧向水动力,并通过总线高速采集外感与本体信息。实验显示传感信号能对应步行、游泳节律,并可触发从行走到游泳的自动平滑过渡,为后续力反馈两栖运动控制验证提供硬件基础。

Vision-Guided Outdoor Flight and Obstacle Evasion via Reinforcement Learning Figure 1
2026-05-26cs.RO

Vision-Guided Outdoor Flight and Obstacle Evasion via Reinforcement Learning

Shiladitya Dutta, Aayush Gupta, Varun Saran, Avideh Zakhor

2026-05-26视觉感知强化学习规划控制三维安全鲁棒

面向 GNSS/通信受限、障碍密集户外场景中无人机仍依赖人工操控的问题,论文提出以双目深度和 VIO 为输入的端到端传感运动策略:预训练自编码器压缩视觉,LSTM 规划控制网络直接输出商用无人机可执行的速度指令,并结合全局规划器监督、课程强化学习、域随机化与奖励平滑提升 sim-to-real 鲁棒性。实测在未见过的户外障碍环境和 DJI M300 平台上零样本迁移,累计 650 米无碰导航。

A Reinforcement Learning Inspired Latent Yield Based Adaptive Algorithm Switching Mechanism Figure 1
2026-05-26cs.MA

A Reinforcement Learning Inspired Latent Yield Based Adaptive Algorithm Switching Mechanism

Jayprakash S. Nair, Jimson Mathew, Shivashankar B. Nair

2026-05-26机器人强化学习数据集/基准三维

面向动态在线场景中单一算法表现随实例变化而失效、瞬时指标又易导致频繁误切换的问题,本文提出用累积“潜在收益”记忆奖惩历史,并结合岛模型在本地利用与跨岛探索间自适应切换。排序任务和机器人避障实验显示该机制可降低反应式切换并提升算法选择效果,但相对强基线和增益来源仍需更多说明。

Smoother Action Chunking Flow Policy via Prior-Corrected Orthogonal Trust-Region Guidance Figure 1
2026-05-26cs.RO

Smoother Action Chunking Flow Policy via Prior-Corrected Orthogonal Trust-Region Guidance

Kai Fang, Hailong Pei, Xuemin Chi

2026-05-26机器人生成模型强化学习规划控制学习理论

这篇论文针对 flow-matching 机器人策略在 action chunk 边界产生动作跳变、加速度和 jerk 尖峰的问题,指出 RTC 在中间去噪步校正不足且方向无约束。作者提出 POTR:用数据先验尺度 σd 重新标定 guidance 权重,并将校正向量分解为沿去噪速度和平行外的正交分量,对后者施加 trust region。LIBERO 上相较 RTC 成功率提升,同时 chunk 边界 L2 跳变、加速度和 jerk 持续下降;消融显示主要增益来自 prior-corrected scaling,OTR 进一步改善稳定性。

RoboHitch: Learning Visual Affordance from Disordered Keypoints for Hitch Knots Tying Figure 1
2026-05-26cs.RO

RoboHitch: Learning Visual Affordance from Disordered Keypoints for Hitch Knots Tying

Jiahui Zuo, Boyang Zhang, Fumin Zhang

2026-05-26机器人视觉感知强化学习模仿学习三维

针对绳索打结中自遮挡导致有序关键点跟踪漂移、拓扑不匹配的问题,RoboHitch改用无序3D关键点与RGB图像学习单臂系缆结策略,以动态图自编码器和卷积自编码器提取几何/视觉线索,并通过双向交叉注意力预测抓取与放置可供性。真实机器人实验显示其能在存在遮挡和交叉的场景中完成hitch knot,具备一定泛化性。

PACT: Proactive Asking for Continual Task Assistance in Human-Robot Collaboration Figure 1
2026-05-26cs.RO

PACT: Proactive Asking for Continual Task Assistance in Human-Robot Collaboration

Chengbo He, Sheng Li, Chenyang Ma, Bochao Zou, Li Sun, Jiansheng Chen, Junliang Xing, Yuanchun Shi, Huimin Ma

2026-05-26机器人强化学习三维

面向跨天、长期人机协作中机器人只能看到部分上下文且早期不了解用户习惯的问题,PACT将辅助决策改为“先问或直接做”的选择:结合当前多模态观察与历史交互,用强化学习等策略判断何时在意图或任务层面澄清,并用Clarification Utility衡量准确率与打扰频率的权衡。多日具身协作实验显示,相比被动推断基线,PACT提升了辅助准确率和澄清效用;但评估仍限于受控单用户模拟协议。

IsaacIPC: Coupling High-Fidelity Simulation and Realistic Rendering for Contact-Rich Robotic Systems Figure 1
2026-05-26cs.RO

IsaacIPC: Coupling High-Fidelity Simulation and Realistic Rendering for Contact-Rich Robotic Systems

Qixin Liang, Zhongqing Han

2026-05-26机器人强化学习数据集/基准

面向具身智能中抓取、触觉与运动等接触密集任务,现有 IPC 仿真虽稳健但难兼顾真实渲染和触觉压力精度。本文将 GPU IPC/libuipc 接入 IsaacSim/Lab,用双网格映射保留高质量视觉资产,并提出 GMCP 在触觉表面采样构造屏障势以改善压力分布。实验在接触基准上验证 GMCP,并展示四足、灵巧手和 UMI 夹爪等刚柔耦合场景;但实时强化学习规模化效率仍是限制。

Terrain-Adaptive Grouser Wheel for Optimal Planetary Exploration: Design and Experimental Investigation Figure 1
2026-05-26cs.RO

Terrain-Adaptive Grouser Wheel for Optimal Planetary Exploration: Design and Experimental Investigation

Vincent Griffo, Yashwanth Kumar Nakka

2026-05-26机器人视觉语言模仿学习优化算法

面向月/火星车在松散颗粒、岩石与硬地间切换时固定轮齿难以兼顾牵引与沉陷的问题,论文设计了可连续调节 16 个 grouser 高度的重构车轮,并用闭环机构实现统一伸缩。750 次试验显示,自适应轮齿在颗粒地形中可将打滑降低 30.0–58.0%,行驶时间与能耗最高改善 77.4%;同时 scaling 分析表明最优轮齿高度随地形颗粒性变化,固定高度不存在全地形最优。

AcroRL: Learning Aggressive Quadrotor Inversion using Bidirectional Thrust Figure 1
2026-05-26cs.RO

AcroRL: Learning Aggressive Quadrotor Inversion using Bidirectional Thrust

Gabriel Rodriguez, Henri Sayag, Abhishek Rathod, John Stecklein, Siddharth Saha, Christopher Barngrover, Wennie Tabib

2026-05-26视觉感知强化学习规划控制优化算法三维

针对双向推力四旋翼在正飞/倒飞切换时受电机反转延迟、执行器饱和影响而难以小范围倒置的问题,AcroRL用强化学习训练正倒飞双向参考调制策略,并结合Hopf几何控制、约束分配和非对称随机推力模型以保持与常规轨迹跟踪兼容。仿真中较最强优化基线RMSE降32%、稳定时间降57%,实机多偏航倒置RMSE低于0.35米。

ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots Figure 1
2026-05-26cs.RO

ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots

Yibin Wang, Muhan Li, Zihan Guo, Sam Kriegman

2026-05-26机器人视觉感知强化学习规划控制

针对机器人形态—控制协同进化中“每个形态单独训练”成本高、单一通用控制器又易保守的问题,ECo-MoE用形态潜变量门控多个控制专家,在共享知识的同时保留模块化适配能力,并支持把预训练策略作为专家注入以“示范引导进化”。实验显示该框架在更复杂行为或地形下提升可进化性,并能将自由形态搜索牵引到期望结构,但仍局限于仿真陆地运动。

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance Figure 1
2026-05-26cs.RO

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance

Runze Wang, Yuqian Fu, Yu Li, Tao Lin, Tianwen Qian, Mohamed Elhoseiny, Bo Zhao, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

2026-05-26机器人视觉语言视觉感知强化学习规划控制

针对现有 VLA 在复杂场景中难以判断“该在哪里交互”、视觉规划与动作预测耦合弱的问题,Afford-VLA 将任务条件 affordance 内化为模型内部接口:用可学习 <AFF> token 生成交互区域掩码,并通过掩码池化嵌入直接条件化动作头,同时让动作梯度反向优化该路径。其在 LIBERO、LIBERO-Plus、SimplerEnv 上分别达到 97.4%、78.1%、58.1% 的成功率,并报告了较强真实机器人结果。

Investigating the Effect of a Series Elastic Actuation Retrofit to Black-Box Actuators Figure 1
2026-05-26cs.RO

Investigating the Effect of a Series Elastic Actuation Retrofit to Black-Box Actuators

Ivan Tregear, Ayhan Aktas, Ferdinando Rodriguez y Baena

2026-05-26机器人规划控制

面向既有一体化“黑箱”执行器刚性高、齿隙和静摩擦削弱力控的问题,论文将低成本激光切割扭转串联弹性元件以后置 FSEA 形式改装,并用直接角位移测量绕开传动非线性。实验显示闭环力控最大带宽由 10.32 Hz 提升至 30.32 Hz,约 2.93 倍;该 25 英镑模块峰值带宽还比商用 ATI 力传感器高 7.63%,但平均一致性不如后者。

No Figure
2026-05-26cs.RO

Anisotropic Diffusion-Driven Ergodic Coverage in Multi-Robot Systems

Thales C. Silva, Anoop Kiran, Nora Ayanian

2026-05-26机器人生成模型优化算法三维

面向已知目标概率分布下的多机器人动态覆盖,论文针对热方程式遍历搜索各向同性平滑会模糊分布边界的问题,引入 Perona-Malik 各向异性扩散来扩散覆盖误差并生成势场,使机器人沿保留结构边缘的梯度运动。该框架在数学上包含热方程和径向基表示等既有方法,并通过多场景仿真展示了能在探索—利用之间保持遍历覆盖,同时更好保留目标分布的尖锐特征。

MASt3R-Nav: WayPixel Navigation in Relative 3D Maps Figure 1
2026-05-26cs.RO

MASt3R-Nav: WayPixel Navigation in Relative 3D Maps

Vansh Garg, Rohit Jayanti, Krish Pandya, Sarthak Chittawar, Siddharth Tourani, Muhammad Haris Khan, Sourav Garg, Madhava Krishna

2026-05-26机器人视觉感知强化学习模仿学习规划控制

论文针对视觉导航中全局一致3D地图代价高、图像/对象拓扑又丢失几何细节的问题,提出以MASt3R匹配得到的像素相对3D连通图,在稀疏化后生成WayPixel Costmap,并让PixelReact控制器直接利用像素级规划代价预测轨迹。实验称其在仿真四类任务和真实演示中优于图像级、对象级方法,说明相对像素几何可在无需全局重建和深度传感的情况下提升导航鲁棒性。

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation Figure 1
2026-05-26cs.CV

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

2026-05-26机器人视觉感知数据集/基准三维

面向机器人近场操作和室内导航,现有鱼眼深度基准多为户外或缺少高精度真值,难以评估宽视场感知。WideDepth用高分辨率LiDAR扫描生成毫米级室内鱼眼/针孔、水平/垂直双目数据,并给出鱼眼视差与度量深度转换及适配流程;在5K基准和18K稀疏深度训练样本上评测多类模型,微调针孔双目模型在鱼眼数据上最高提升62%,但增益可能主要来自数据适配与额外训练。

RED: Adaptive Real-Time DAG Scheduling for Robotic Inference under Environmental Dynamics Figure 1
2026-05-26cs.RO

RED: Adaptive Real-Time DAG Scheduling for Robotic Inference under Environmental Dynamics

Zexin Li, Tao Ren, Johnathan Liu, Xiaoxi He, Cong Liu

2026-05-26机器人三维安全鲁棒

面向动态场景中机器人多任务 DNN 推理的实时性问题,RED 将环境变化导致的任务增删、依赖变化与异步到达建模为可重构 DAG 调度问题;其关键在于在线分配中间截止期,并结合 MIMONet 编码器/解码器共享结构重建图、按需同步和过载丢弃低关键任务。作者在多代 Jetson、Apple M 系列及 ROS 2 管线验证,报告相较 EDF 可降低 40.5% deadline miss、缩短 24.7% 响应时间并提升 34.8% QoE。

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving Figure 1
2026-05-26cs.AI

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving

Zhengqi Sun, Yiwen Sun, Boxuan Liu, Tailai Chen, Tianxu Guo, Jiabin Liu

2026-05-26强化学习三维安全鲁棒

论文针对LLM自动驾驶决策“懂规则但缺物理约束”、易产生不可执行动作的问题,提出RIA闭环框架:先由LLM给出意图与候选动作,再用动作条件世界模型短时滚动预测并由安全评分器选择可执行动作,反馈给下一轮推理。在CARLA 1000回合点目标任务中,RIA达到80.05%路线完成率、51.10%到达率和0.20%碰撞率,优于LLM无验证及CARLA TM、MADA等免训练基线。

Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date Autonomous Robot Learning Figure 1
2026-05-26cs.AI

Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date Autonomous Robot Learning

Hong Su

2026-05-26机器人视觉感知生成模型规划控制三维

面向长期运行机器人在开放环境中遭遇新特征、新类别和更高效动作流程的问题,本文将学习对象从固定参数扩展为可更新的输入、输出、模型与动作例程,提出“思考—学习”双向闭环:思考选择证据并规划验证,学习结果反过来改进后续推理。实验显示特征适应识别准确率由0.419升至0.845,动作平均长度由13.0降至4.0,证据选择率提升到0.965,但真实机器人规模与增益来源仍需进一步说明。

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform Figure 1
2026-05-26cs.AI

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal, Poovammal E, Talal Bonny

2026-05-26视觉语言视觉感知强化学习模仿学习规划控制

本文针对 LLM 在因果推理、持续状态跟踪和长时域规划中的脆弱性,指出其根源可能是“预测文本序列”与“建模环境潜在动力学”的目标错配。作者提出潜在动力学推断(LDI)视角,并构建由自然语言规则编译出的 Flux 状态转移环境,对比纯文本观测的 LLM 与访问显式潜在状态的强化学习智能体;后者在长局游戏中胜率约 79%,显著高于 LLM 的 11%,表明显式世界模型有助于稳定规划与状态维护。

MEMOR-E: In-Context and Fine-Tuned LLM Personalization for Alzheimer's Assistive Robotics Figure 1
2026-05-26cs.AI

MEMOR-E: In-Context and Fine-Tuned LLM Personalization for Alzheimer's Assistive Robotics

Maissa Abir Smaili, Eren Sadikoglu, Ransalu Senanayake

2026-05-26机器人生成模型规划控制

面向阿尔茨海默症患者日常照护中记忆、语言退化带来的提醒与陪伴需求,MEMOR-E 将四足移动机器人、平板交互、本地 LLM、Longformer 认知任务建模和 XAI 统计摘要结合,用于生成分阶段但非诊断的辅助策略。实验基于 DementiaBank 转录与合成对照,显示其能产生较稳定的严重程度趋势和可读证据,支持看护者监督下的个性化交互,但真实场景与临床有效性仍未充分验证。

SEIDM: A Safe and Efficient Intelligent Driver Model for Autonomous Driving Behavior Figure 1
2026-05-26eess.SY

SEIDM: A Safe and Efficient Intelligent Driver Model for Autonomous Driving Behavior

Yuyang Yao, Shaocheng Luo

2026-05-26生成模型规划控制学习理论三维安全鲁棒

该文针对经典 IDM 在自适应巡航跟驰中偏保守、导致车距过大和交通流收敛慢的问题,提出 SEIDM:用结合 TTC 与时距 TH 的动态风险因子调节安全减速项,使安全时更积极跟驰、风险升高时更强制动。城市仿真显示其相比 IDM 及变体可缩短稳定间距、加快达到交通流均衡,并维持安全约束。

2026-05-25

34 篇
Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers Figure 1
2026-05-25cs.CV

Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

Shuhong Zheng, Michael Oechsle, Erik Sandström, Marie-Julie Rakotosaona, Federico Tombari, Igor Gilitschenski

2026-05-25视觉感知三维

针对视觉几何 Transformer 在多视图三维重建中因全局注意力随帧数和 token 数二次增长而难以扩展的问题,本文将加速归结为限制每个 query 可访问的 key/value token,并提出无需训练的 GoToHunt:先用多样性准则选关键帧以覆盖场景,再按注意力熵进行层自适应帧内稀疏化。实验显示在 500 张图像场景中可将 VGGT 推理时间降低超过 85%,同时基本保持甚至偶尔提升重建表现。

No Figure
2026-05-25cs.RO

Robotic Strawberry Harvesting with Robust Vision and Deep Reinforcement Learning based Sim-to-Real Control

Al Bashir, Shao-Yang Chang, Partho Ghose, Prem Raj, Chen-Kang Huang, Azlan Zahid

2026-05-25机器人视觉感知强化学习规划控制优化算法

面向温室草莓采摘中遮挡杂乱导致的分割不稳、3D目标漂移和传统IK/规划轨迹不够平滑等问题,论文将边缘监督与注意力增强的YOLO26实例分割、RGB-D目标估计,以及Isaac Lab中训练的目标条件PPO控制器接入ROS闭环。视觉分割在自采和公开数据上提升约10–14%,实机采摘281颗草莓,达到96.6%到达成功率、84.3%总体采摘成功率。

Point Tracking Improves World Action Models Figure 1
2026-05-25cs.RO

Point Tracking Improves World Action Models

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

2026-05-25机器人视觉感知生成模型强化学习三维

论文针对世界动作模型只预测像素时易受光照、纹理等无关外观扰动影响、难以显式捕捉遮挡和长时运动的问题,提出 JOPAT:在同一扩散 Transformer 中联合生成视觉潜变量、带可见性的 2D 点轨迹和机器人动作。其核心洞察是点轨迹提供更稳定的对应级运动接口,可补足像素表征。在 40 个 LIBERO 任务上平均成功率达 97.8%,并在遮挡、出框和真实 LeRobot 长程操作中优于像素基线。

Instrumentation for Imitation Learning: Enhancing Training Datasets for Clothes Hanger Insertion Figure 1
2026-05-25cs.RO

Instrumentation for Imitation Learning: Enhancing Training Datasets for Clothes Hanger Insertion

Remko Proesmans, Thomas Lips, Francis wyffels

2026-05-25机器人视觉感知生成模型强化学习模仿学习

针对机器人模仿学习在真实操作中数据需求高、视觉难以可靠感知衣物状态的问题,论文把红外传感器嵌入衣架,作为训练阶段的特权状态信号,并用其生成专家轨迹增强数据。衣架插入任务中,带传感策略比纯视觉高14–25个百分点,且纯视觉学生经增强数据后接近带传感专家,说明仪器化可提升数据质量与任务意识。

SFG-ROS: A Resource-Aware Framework for Dense Multi-Agent Perception Figure 1
2026-05-25cs.RO

SFG-ROS: A Resource-Aware Framework for Dense Multi-Agent Perception

Constantin Blessing, Elias Geiger, Jakob Häringer, Dennis Grewe, Markus Enzweiler

2026-05-25机器人学习理论安全鲁棒

面向多机器人密集感知中 ROS 2 易出现的发现风暴、命名冲突、网络饱和和重复解压开销,SFG-ROS 将高频本地流量与全局通信隔离,采用规范化命名、定向 Fast DDS 路由、按需集中解码及异构加速器自适应容器部署。在轮式与足式机器人、LiDAR 和双目深度相机场景中,网络流量被约束为 O(1),相较标准 ROS 2 每新增订阅者的 CPU 扩展惩罚降低 72.3%,同时保持低延迟。

No Figure
2026-05-25cs.RO

Direct Dynamic Retargeting for Humanoid Imitation Learning from Videos

Constant Roux, Ludovic De Matteïs, Armand Jordana, Valentin Guillet, Nicolas Mansard, Olivier Stasse, Philippe Souères

2026-05-25机器人视觉感知强化学习模仿学习规划控制

这篇论文针对从单目视频到人形机器人模仿学习时,人-机形态差异和视频姿态噪声会让传统几何重定向产生动力学不可行参考的问题,提出 DDR:跳过逆运动学中间投影,直接在任务空间用物理仿真中的 CEM-MPC 优化可行轨迹和接触序列。实验显示 DDR 相比 GR/IDR 有更高示范跟踪精度,并使下游强化学习收敛更快、平衡和敏捷动作执行更稳,还在 Unitree H1-2 上实现零样本迁移。

Any2Any: Efficient Cross-Embodiment Transfer for Humanoid Whole-Body Tracking Figure 1
2026-05-25cs.RO

Any2Any: Efficient Cross-Embodiment Transfer for Humanoid Whole-Body Tracking

Ming Yang, Tao Yu, Feng Li, Hua Chen

2026-05-25机器人视觉感知强化学习规划控制学习理论

针对人形机器人全身跟踪模型训练成本高、且强依赖特定机体的问题,Any2Any将跨本体迁移拆成运动学对齐与动力学适配:先统一源/目标机器人的观测和动作接口,再仅在动力学敏感模块加入轻量PEFT以保留原有运动先验。实验覆盖多种平台和预训练骨干,显示其可用约1%数据与算力完成从Unitree G1到LimX Oli/Luna等迁移,并达到接近或优于从头训练的跟踪效果。

Vision-Based Agile Landing on Turbulent Waters Figure 1
2026-05-25cs.RO

Vision-Based Agile Landing on Turbulent Waters

Dimosthenis Angelis, Leonard Bauersfeld, Davide Scaramuzza, Evangelos Boukas

2026-05-25视觉感知强化学习规划控制三维

面向海上无人机回收中船体六自由度扰动、目标可见性退化且难以获得平台状态的问题,论文将降落建模为部分可观测强化学习任务,用连续两帧稀疏局部特征与机体状态隐式估计相对运动,直接输出姿态和推力,并用合成关键点训练以适配不同特征提取器。仿真中在 Very Rough 海况下优于 MPC 基线,真实平台上完成 300 余次机载自主降落验证。

How Many Training Samples Are Needed for the Inverse Kinematics Solutions by Artificial Neural Networks Figure 1
2026-05-25cs.RO

How Many Training Samples Are Needed for the Inverse Kinematics Solutions by Artificial Neural Networks

Dong-Won Lim

2026-05-25机器人强化学习规划控制优化算法学习理论

本文关注用前馈神经网络求机器人逆运动学时“训练样本到底需要多少”的实际问题,尝试用 Lipschitz 连续性、近似误差界和误差/采样间距比来刻画样本量与精度的关系。3-DOF 机械臂仿真显示,样本从 8 增至 125 时轨迹跟踪和欧氏误差明显改善,但超过 125 后收益趋于饱和,提示数据规模优化可能比盲目加样本更重要。

TactileReflex: Noise-Statistics-Driven Vision-Tactile Reflex Control for Force-Sensitive Manipulation Figure 1
2026-05-25cs.RO

TactileReflex: Noise-Statistics-Driven Vision-Tactile Reflex Control for Force-Sensitive Manipulation

Ziyan Feng, Yulong Fu, Zheng Li, Yuxin He, Jieji Ren, Lujia Wang, Jinni Zhou, Yudong Zhong, Qiang Nie

2026-05-25机器人视觉语言视觉感知规划控制三维

论文针对薄壁塑料杯等易变形容器在防滑与防压坏之间力裕度极窄的问题,提出用视觉触觉传感器自身噪声统计自动设定阈值的 TactileReflex,无需外力标定或手工调参,并以剪切、接触强度和压力中心三类图像代理构成约 12Hz 三通道反射控制。实验中滑移检测达 100% 真阳性、0% 假阳性,完整系统在消融中 5/5 避免永久变形,倒水任务 9/10 成功而固定力基线全失败。

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation Figure 1
2026-05-25cs.RO

Semantically Structured Mixture-of-Experts for Compositional Robotic Manipulation

Chengyu Deng, Guanqi Chen, Yizhou Chen, Zejia Liu, Zhiwen Ruan, Guanhua Chen, Jia Pan

2026-05-25机器人视觉语言视觉感知生成模型强化学习

论文针对扩散策略在多任务机器人操作中“性能、泛化、实时效率”难兼顾的问题,认为现有 MoE 按噪声等低层信号路由会割裂可复用技能。SMoDP 用 VLM 离线生成动词-名词技能标注,训练轻量技能预测器进行语义路由,并以跨模态/模态内对比学习稳定专家分工。实验覆盖 LIBERO 与真实 ALOHA,显示其较扩散和 MoE 基线有更好的成功率、参数效率,并可通过少量微调组合迁移到新任务。

Droneulator: A Portable UAV Simulator for Agricultural Workflows with RotorPy and Godot 4 Figure 1
2026-05-25cs.RO

Droneulator: A Portable UAV Simulator for Agricultural Workflows with RotorPy and Godot 4

Jacob Swindell, Michael Lowen, Marija Popovic, Riccardo Polvara

2026-05-25机器人视觉感知生成模型强化学习规划控制

面向农业无人机在果园巡检、树冠避障和学习控制中难以兼顾真实场景、飞行动力学与ROS/PX4部署的问题,Droneulator将RotorPy动力学、Godot 4视觉传感和Zenoh桥接的ROS 2兼容数据流整合为可移植栈,并提供PX4与WebSocket双控制路径。实验显示其可支持COLMAP重建采集、EGO-Planner无碰撞局部规划和基于深度的强化学习训练,但多机、超实时和真实风噪等仍待扩展。

Multi-Floor Exploration for Ground Robots via an Incremental Reachable Graph and Structural Priors Figure 1
2026-05-25cs.RO

Multi-Floor Exploration for Ground Robots via an Incremental Reachable Graph and Structural Priors

Zhiwen Zhu, Jiaqi Chen, Xiangyi Huang, Meiqi Hu, Boyu Zhou

2026-05-25机器人视觉感知强化学习三维

面向楼梯、坡道和多层重叠通行面使2D/2.5D地图失效的问题,本文将地面机器人可达支撑面维护为增量稀疏图,用未确认但可能可行的边保留探索机会,并把已探索楼层的任务区结构投影到目标楼层形成可修正的假设图。分层规划在真实与假设结构上联合决策,仿真显示探索效率和建图完整性优于基线,实机验证了实时可行性。

Sparse Compositional Flow Matching by geometric assembly from motion primitives Figure 1
2026-05-25cs.RO

Sparse Compositional Flow Matching by geometric assembly from motion primitives

Yan Tang, Yuanbo Tang, Tingyu Cao, Shaolun Huang, Yang Li

2026-05-25机器人生成模型规划控制优化算法学习理论

这篇论文针对机器人轨迹生成常把轨迹当作逐点高维信号、忽略可复用运动片段而导致样本效率和可解释性不足的问题,提出在物理轨迹空间而非潜空间中组合运动基元:先用带可学习长度掩码和起点指示的字典学习得到稳定基元,再用带几何连续约束的稀疏流匹配生成基元放置矩阵。在 Open X-Embodiment 和 3DMoTraj 上,方法较最强基线 ADE/FDE 分别提升 19.2%/21.0%,并将 FDE/ADE 比降至 1.07。

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models Figure 1
2026-05-25cs.CV

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

2026-05-25视觉语言视觉感知生成模型规划控制优化算法

本文针对端到端自动驾驶中自回归规划有因果性但易累积误差、扩散规划全局一致但缺少因果约束的问题,提出 ChainFlow-VLA:先用 AR 生成多模态因果轨迹,再以 VLM 隐状态引导残差扩散做语义化修正。NAVSIM v1 得分 94.85,略超人类 94.8;但增益相对数据与模型规模的来源仍未充分说明。

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype Figure 1
2026-05-25cs.RO

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype

Lipeng Dai, Luping Xiang, Kun Yang

2026-05-25机器人强化学习三维

面向具身智能走向远程协作和工业部署时对低时延、高可靠通信的需求,论文分析具身体与6G的双向关系,并提出由人类意图感知、O-RAN传输、智能中介和具身执行组成的分层架构。作者实现触觉设备—工业机械臂—5G O-RAN测试床原型,实验显示毫秒级时延和稳定闭环运行,但仍更偏架构验证而非完整6G系统实证。

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation Figure 1
2026-05-25cs.RO

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation

Zixuan Hu, Xuantuo Huang, Yancheng Li, Yichun Hu, Shengyong Xu, Ling-Yu Duan

2026-05-25机器人视觉语言视觉感知优化算法数据集/基准

面向真实视觉语言导航中环境持续变化导致的遗忘与负迁移,论文提出 IDEA,将测试时适应不再视为一次性更新,而是沉淀为可复用的软提示资产库,并用 Fisher 加权提取可迁移知识、通过历史资产凸包投影构建免训练跨域桥接初始化。在 REVERIE、R2R、R2R-CE 上相较现有 TTA 方法取得稳定提升,离散基准平均约 +2.5% SR、+1.9% SPL。

Signal Temporal Logic Motion Planning via Graphs of Convex Sets Figure 1
2026-05-25cs.RO

Signal Temporal Logic Motion Planning via Graphs of Convex Sets

Yu Chen, Ancheng Hou, Mingyang Feng, Xiao Yu, Xiang Yin

2026-05-25机器人规划控制优化算法学习理论数据集/基准

针对STL任务规划中离散时间混合整数编码随时域、逻辑约束和维度快速膨胀的问题,论文将STL先转为定时自动机,再与配置空间凸分解耦合成联合转移系统,把连续时间规划化为凸集图上的最短路,并生成满足速度与光滑约束的Bézier轨迹。作者证明了构造的可靠性和固定自动机/分解后的多项式缩放特性,并在低维基准、四旋翼、30自由度人形及UR-3实机上展示可执行轨迹。

Lipschitz Optimization for Formal Verification of Homographies Figure 1
2026-05-25cs.CV

Lipschitz Optimization for Formal Verification of Homographies

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio

2026-05-25机器人视觉感知强化学习优化算法学习理论

面向自动驾驶、航天和机器人等需认证的视觉系统,本文针对传统验证难以覆盖相机三维位姿扰动的问题,将平面场景中的相机运动写成闭式单应变换,并用 Lipschitz 优化与分段连续性给出像素值线性界,从而接入 Venus 等验证器。实验显示相较既有 PWL 方法最高加速 89%、界限收紧约 7%,并在 VNN-COMP 与跑道分类案例中揭示模型对投影扰动的脆弱性。

No Figure
2026-05-25cs.CV

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin

2026-05-25机器人视觉语言规划控制数据集/基准三维

面向真实人机交互中“房间太闷”“想热饭”这类隐式需求,论文提出 IntentionNav,将目标类别隐藏,要求机器人从自由文本意图、RGB-D 与位姿中推断并主动寻找物体。其核心在于用同一物理目标配对四种表达风格和四类意图线索,诊断语言鲁棒性、目标推断、可达性与终止定位。三种 VLM 虽有 68.7% 到达 2 米邻域,但终止成功仅 24.9%、1 米 grounded success 仅 5.5%,显示瓶颈主要在视觉验证和近距离终止决策。

Autonomous Frontier-Based Exploration with VLM Guidance Figure 1
2026-05-25cs.RO

Autonomous Frontier-Based Exploration with VLM Guidance

Aarush Aitha, Avideh Zakhor

2026-05-25机器人视觉语言视觉感知规划控制

针对传统 frontier/NBV 探索依赖几何启发、容易在未知室内环境中做出短视路径选择的问题,本文把 VLM 作为高层“策略指挥器”:在多前沿决策点,将占据栅格、候选前沿视角图像和历史上下文组成多模态提示,由 Gemini 选择更有潜力的探索方向,底层仍由 ROS 导航执行。仿真于 6 个室内场景显示,相比既有方法地图覆盖率最高提升 24%,且无需训练,但对联网 VLM 的依赖和真实机器人验证仍有限。

Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping Figure 1
2026-05-25cs.RO

Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping

Nitin Vegesna, Avideh Zakhor

2026-05-25视觉感知强化学习规划控制学习理论三维

这篇论文面向无人机在未知室内环境中既要完整建图、又要按开放词汇语言查询尽快发现目标物体的冲突目标。SAGE在FALCON覆盖式前沿探索上引入CLIP语义记忆、短时语义缓存、目标前沿和有界的语义-几何代价,使语义只重排候选前沿而不破坏覆盖性。Matterport3D仿真中其目标发现优于FALCON和语义消融,相比FTU在共享任务上平均快13.7倍;真实飞行显示发现能力提升,但探索速度和轨迹长度仍不如FALCON。

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control Figure 1
2026-05-25cs.RO

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

2026-05-25机器人视觉语言视觉感知生成模型强化学习

针对VLA动作解码常用固定采样步数、难以按状态分配计算并复用闭环时序信息的问题,论文将π0的流匹配动作专家替换为EqM时间无关平衡解码器,把动作生成视为迭代求解,并支持自适应停止与warm start。实验在300步预算下将RoboTwin 19任务平均成功率由40.4%提升到50.2%,LIBERO总体相当且LIBERO-10达87.0%;同时指出残差更低不一定更可执行,但增益来源尚未完全拆分。

Four Simple Proprioceptive Estimators for Legged Robots Figure 1
2026-05-25cs.RO

Four Simple Proprioceptive Estimators for Legged Robots

Frank Dellaert, Chiyun Noh, Varun Agrawal, Ayoung Kim

2026-05-25机器人

面向腿式机器人仅依赖本体感知时消费级 IMU 积分易漂移的问题,论文将足端间歇接触作为几何约束,按复杂度构建四种简化估计器:接触辅助 InEKF、因子图更新版、固定滞后平滑器及带演化偏置版本,并采用触地/间隔触发的低频接触更新而非高频关节测量。实验显示事件驱动更新比高频接触更新漂移更小;四种方法已集成到 GTSAM 并提供 ROS2 实现。

UfM*: Uncertainty from Motion* for DNN Depth Estimation Using Gaussians Figure 1
2026-05-25cs.RO

UfM*: Uncertainty from Motion* for DNN Depth Estimation Using Gaussians

Soumya Sudhakar, Sertac Karaman, Vivienne Sze

2026-05-25机器人视觉感知三维安全鲁棒

面向资源受限机器人中单目深度 DNN 的安全部署,论文关注传统集成/采样不确定性需多次推理且单视图难发现跨视角不一致的问题。UfM* 将历史与当前深度预测压缩为高斯混合,在三维区域层面匹配并度量多视角分歧,再回归到像素级不确定性;相比点云 UfM 更省存储并能捕捉区域相关误差。在 OOD ScanNet 上结合 aleatoric 不确定性较 ensemble 降低 ECE 24–28%,仅用 3% 能耗和 0.02% 内存,并在 Cortex-A76 上 30 FPS、63 mJ/帧运行。

PIMbot: A Self-Adaptive Attack Framework for Adversarial Manipulation of Multi-Robot Reinforcement Learning Figure 1
2026-05-25cs.RO

PIMbot: A Self-Adaptive Attack Framework for Adversarial Manipulation of Multi-Robot Reinforcement Learning

Zexin Li, Ziliang Zhang, Hyoseung Kim, Cong Liu

2026-05-25机器人强化学习规划控制三维

针对多机器人强化学习在社会困境中易受误通信或恶意个体破坏的问题,PIMbot将奖励通道的激励操纵与自身动作的策略操纵统一建模,并用在线自适应多目标控制在自利增益和团队扰乱间切换。实验在ER、IPD、Stag Hunt及Gazebo机器人任务中显示可显著压低协作成功率,Jetson Orin Nano案例进一步验证了嵌入式部署成本与可行性。

Verified Task-Space Motion Planning Under Joint-Space Constraints Figure 1
2026-05-25cs.RO

Verified Task-Space Motion Planning Under Joint-Space Constraints

Hanjiang Hu, Changliu Liu, Yebin Wang

2026-05-25视觉感知强化学习规划控制优化算法学习理论

针对任务空间反应式规划常用固定笛卡尔步长、在雅可比病态或关节限位附近易产生越界与跟踪漂移的问题,本文把每一步可达的任务空间盒子转化为二阶 IK 近似上的 SOS/S-procedure 认证,并用等价二分实现亚毫秒求解,再嵌入 Bug2 自适应步长。94 个对抗场景中,该方法实现零关节限位违规和 100% 到达率,而标准 Bug2 有 6–11% 步骤违规且最高 18% 失败。

Active Sensing Subserves Task-Level Control Figure 1
2026-05-25q-bio.NC

Active Sensing Subserves Task-Level Control

Andrew Lamperski, Debojyoti Biswas, Eric S. Fortune, John Guckenheimer, Kathleen Hoffman, Noah J. Cowan

2026-05-25机器人生成模型规划控制学习理论三维

针对机器人/生物控制中为何需要主动感知的问题,本文将其从“为获取信息而运动”改写为任务级闭环控制的必然产物:自适应传感会削弱可观测性,迫使系统通过运动重塑反馈。文中结合生物证据、控制理论与仿真指出,探索/利用模式切换可降低跟踪误差和控制代价,并为机器人感知控制设计提供启发。

Robots That Know What to Ask: Recovering Misaligned Rewards through Targeted Explanations Figure 1
2026-05-25cs.RO

Robots That Know What to Ask: Recovering Misaligned Rewards through Targeted Explanations

Helena Merker, Nick Walker, Andreea Bobu

2026-05-25机器人视觉感知强化学习模仿学习三维

论文针对模仿/逆强化学习中示范未充分覆盖所有任务特征而导致奖励错配的问题,提出 ASQ:利用不同特征在示范中的方差判断哪些偏好被欠说明,并用自然语言解释后定向索取纠正示范。仿真桌面操作和 Franka 用户研究显示,相比随机查询或被动收集,该方法更快恢复真实奖励,解释引导的示范也更有信息量。

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models Figure 1
2026-05-25cs.RO

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models

Ruofan Jin, Zaixi Zhang

2026-05-25机器人视觉语言视觉感知强化学习模仿学习

针对 VLA 在新环境泛化脆弱、依赖大量示范且在线强化学习探索低效的问题,Agentic-VLA 将学习过程本身做成“智能体化”:按能力动态合成奖励并拆分子目标,用语言 critic 引导探索,并通过任务嵌入检索历史策略权重热启动。论文在 LIBERO 上报告长程任务提升 12.3%、1-shot 提升 28.5%、无示范跨任务迁移达 31.2%,收敛速度为既有在线适应方法的 2.4 倍,并在 RoboTwin 2.0 上保持优势。

No Figure
2026-05-25cs.GR

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

2026-05-25机器人生成模型强化学习模仿学习规划控制

面向“语言指令—物理可执行”之间常失配的问题,SCRIPT把动作、物理状态与文本作为独立 token 流在 JAST-DiT 中联合注意,并用非线性历史条件稳定长时闭环控制;训练上先模仿预训练,再以混合物理/文本奖励做 RL 后训练。实验显示其在文本对齐、运动质量和物理真实感上优于既有方法,并在 1200 小时 MotionMillion 上随模型规模扩大持续提升,部分收益可能主要来自 scaling / data。

Extending Deep Event Visual Odometry with Sparse Point-Cloud Export Figure 1
2026-05-25cs.RO

Extending Deep Event Visual Odometry with Sparse Point-Cloud Export

Alireza Safdari, Sajad Ashraf

2026-05-25视觉感知生成模型模仿学习三维

这篇工作针对事件相机 VO 只能输出轨迹、难以直接服务三维查看和后续建图的问题,在不改动 DEVO 核心里程计的前提下,抽取其内部稀疏深度与位姿并转换为可清理、可导出的点云。实验在 BOARD SLOW 序列上显示,点云与 EMVS 局部一致,5 cm 阈值下精度较高,但密度和完整性有限,且会受累计里程计误差影响。

No Figure
2026-05-25cs.RO

Remote Teleoperation of Endovascular Intervention Robots: A Systematic Review

Xingyu Chen, Yinchao Yang, Nikola Fischer, Harry Robertshaw, Benjamin Jackson, Mohammad Shikh-Bahaei, Christos Bergeles, Thomas C Booth

2026-05-25机器人学习理论安全鲁棒

针对血管内介入医生辐射/体力负担高、急性卒中取栓等专科资源地域不均的问题,本文系统梳理远程遥操作血管内机器人证据,重点把机器人机构、通信链路与临床可行性放在同一框架评估。纳入2501篇中的16项研究后发现,导管/导丝可在最远7000公里距离操控,稳定网络下延迟约30–163 ms,小规模人体试验成功率达100%;但证据主要来自动物和模型实验,安全性与泛化仍需多中心临床验证。

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation Figure 1
2026-05-25cs.CV

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

2026-05-25机器人视觉语言视觉感知生成模型强化学习

GEM-4D针对视频世界模型“看起来合理但点级运动和几何对应不稳定”、难以直接用于机器人执行的问题,提出将预训练4D几何基础模型的稠密对应表征蒸馏到视频生成骨干中,训练时约束几何一致性、推理时不增加开销,并用逆动力学把一致的视频 rollout 转成6-DoF轨迹。实验显示其在视频预测和几何一致性上优于基线,真实操作成功率由61%提升到81%。