近日,机器人领域顶级学术会议 Robotics: Science and Systems (RSS) 2026 公布录用结果,今年会议仅接收了 210 篇论文。北京中关村学院与清华大学、无问芯穹等联合团队的两项成果成功入选,充分展现了该团队在强化学习算法及系统、具身智能等前沿方向上的深厚的技术积累与领先的研究实力。
RSS 是机器人领域顶级学术会议,以严苛的数学严谨性、算法可证明性与系统可复现性为核心特色,覆盖机器人学习、感知、控制、规划、人机交互等前沿研究方向。往届会议曾涌现出在高速无人机避障、多机器人协同、人形机器人运动控制等多个方面的突破性工作。会议整体秉持「小而精」的定位,深耕基础理论与核心算法研究,评审标准严格、科研成果质量突出。
RSS 2026
RLinf-USER:面向具身智能的真实世界可扩展在线策略学习系统
近年来,随着具身智能的发展,研究范式正逐步从 “仿真训练 + 真实部署” 转向直接在真实世界中进行在线策略学习。然而,与仿真环境不同,真实世界具有不可加速、难以复位、成本高昂以及设备异构等特点,使得数据采集效率低、训练过程不稳定,传统依赖同步训练和单机资源的强化学习系统难以扩展。因此,真实世界策略学习的瓶颈不再仅仅是算法问题,而本质上是一个系统问题。
针对这一挑战,本文提出了一个统一且可扩展的真实世界在线策略学习系统 RLinf-USER,从系统层面重构机器人学习范式。在规模化在线策略学习场景下,存在大规模异质硬件资源(机器人、端云计算卡)难以统一管理和调度的问题,USER 采用统一硬件抽象层,将机器人硬件与计算硬件放在相同层级管理,实现 “像使用 GPU 一样使用机器人”,具有高度可扩展性。
针对具身大模型在端云协同训练时面临的端云网络跨域互通困难、集中式通信跨域开销大等问题,USER 设计了自适应通信平面,通过网络隧穿和分布式数据通道降低跨域通信负担,实现流量本地化,完成了跨越千里的端云协同训练(北京、深圳两地多机同时学习),跨域场景下学习效率提升约 3 倍。针对仿真世界同步训练架构效率低的问题,USER 设计了全异步训练架构,解耦数据生成、传输、训练与权重同步,训练吞吐提升 5.7 倍。针对长周期在线学习中多模态数据体量持续增长、纯内存缓冲区容量受限、纯磁盘存储难以满足高频采样需求的问题,USER 设计了持久化缓存感知缓冲区,通过内存缓存与磁盘持久化存储协同,结合动态索引组织与异步存取机制,实现了海量历史数据的高效采样与持续复用。此外,USER 在统一的接口下,还支持多样的学习组件(多种模型、算法和奖励函数),模块化的设计易于二次开发。
RLinf-VLA:面向视觉 - 语言 - 动作模型强化学习的统一高效框架
近年来,视觉 - 语言 - 动作(VLA)模型正成为具身智能的重要基础,而强化学习(RL)为进一步提升任务成功率提供了关键手段。然而,当前 VLA 的 RL 研究仍存在三方面问题:一是模型、算法与仿真器相互割裂,缺乏统一平台,难以公平比较与灵活扩展;二是渲染、推理与训练之间耦合紧密,系统资源利用不足,效率受限;三是缺少系统性的训练经验总结,导致性能提升不稳定、复现成本较高。
为此,本文提出 RLinf-VLA,一个面向 VLA 强化学习的统一高效框架,其核心特点可概括为 “多、快、好”。“多” 在于通过统一接口支持多种 VLA 模型、RL 算法与异构仿真器,提升扩展性与评测一致性;“快” 在于针对 RL 流水线设计灵活资源分配机制,并为 GPU 并行仿真提出混合细粒度流水线策略,实现 1.61 倍 —1.88 倍的训练加速;“好” 在于基于该框架训练的模型在 LIBERO、ManiSkill 和 RoboTwin 等基准上取得约 20%-85% 的稳定性能提升,并进一步总结出一套有效的训练实践。RLinf-VLA 为具身智能中的 VLA 强化学习研究提供了一个统一、高效且可复现的基础系统。

接连拿下两个 RSS 顶会收录的亮眼成果,既是北京中关村学院携手清华大学、无问芯穹等联合团队科研创新能力的有力佐证,更是产学研协同研发模式高效赋能前沿探索的生动体现。面向未来,学院将持续聚焦具身智能前沿赛道,深化跨主体产学研联动创新,以硬核技术积淀,为行业落地应用构筑稳固核心支撑。
笃行四季 智转未来丨政校企研共筑 AI 成果转化 “中关村样板”
一起下楼趣运动!中关村两院第二届趣味运动会圆满收官




.png)