超50万小时人类视频预训练,智在无界以Being-H0.8定义下一代隐式触觉世界动作模型
7月28日,通用具身基础模型公司智在无界BeingBeyond正式发布Being-H0.8——全球首个隐式触觉世界动作模型。
Being-H0.8首次将触觉模态引入大规模模型预训练,并将视觉、触觉、动作以及未来状态变化统一到同一隐空间(latent space)。这使机器人不仅能够理解“看到了什么、做了什么、接触到了什么”,还能够进一步理解“世界因此发生了怎样的变化”,从而形成对物理交互过程更加完整的认知与预测能力。
智在无界是业内率先提出以大规模人类视频数据来训练通用具身基础模型框架的团队。历经Being-H0到Being-H0.8的持续迭代,智在无界已汇聚了超过500,000小时的第一人称视频原始数据,并与数十家数据合作伙伴建立合作。
但数据规模只是起点。真正决定模型能力的,是数据能否准确、有效地描述动作、接触与交互。
围绕这一目标,智在无界已完成从数据管线、模型预训练、后训练、评测到端侧部署的全栈基础设施建设。这套体系能够推动规模化数据持续沉淀、模型能力持续进化,并让机器人不断走向开放、复杂的真实物理世界。
在此基础上,智在无界打造了高质量人类交互数据库UniHand 3.0。该数据库覆盖自然物体交互、长时程任务、丰富手部动作及多样化场景,为具身基础模型提供规模化、高质量的人类交互经验。

UniHand 3.0不仅是目前国内规模最大的人类视频数据集,也标志着全球范围内首次有团队针对如此大规模的人类视频数据应用,系统分享数据来源等关键信息,为人类视频数据在具身智能领域的规模化使用提供了更具参考价值的实践路径。
智在无界创始人卢宗青表示:“Being-H0.8代表着一个重要节点,不仅是从视觉到触觉,从观察世界到理解交互的模型能力进化,更预示着一个同时具备视觉理解、触觉交互、动作生成、世界预测、跨本体泛化的具身基础模型即将诞生。我们正在迈向全新的1.0时代。接下来,智在无界将以前所未有的训练范式,加速通用具身基础模型的到来。”

Being-H0.8项目链接:https://research.beingbeyond.com/being-h08
创新点之一:首个在预训练阶段就加入触觉信息的具身基础模型
Being-H0.8 相较于前代 Being-H0.7 的核心突破,是首次将触觉模态系统性地引入隐式世界模型架构,它也是首个结合大规模人类视频与触觉信息开展预训练的具身基础模型。
触觉的加入,使模型能够感知视觉难以直接观测的接触状态、受力变化与物体约束,从而完成一系列仅依赖视觉难以稳定解决的接触密集型任务。

为了充分利用高频触觉反馈,Being-H0.8 进一步提出慢快动作专家(Slow-Fast Action Expert)。
在标准的完整动作块生成机制之上,模型引入了一条轻量级的快速更新流:系统首先在每个动作时域(horizon)开始时计算一次“世界—动作上下文”并进行缓存;随后,在时域内少数几个锚点(anchor)处,注入最新观测到的本体状态与触觉反馈,动态生成或修正当前正在执行的动作片段。
这一机制既保留了动作块预测的整体规划能力与计算效率,又能够根据接触过程中的实时反馈快速调整动作,为精密抓取、插拔、旋拧、装配等接触密集型操作提供更高的稳定性与响应速度。
创新点之二:自主研发TactoHand,让规模化数据应用成为可能
触觉是灵巧操作中最关键、却长期缺席的感知模态之一。人类在许多操作中必须通过触摸判断物体是否接触、是否滑动以及施力是否合适,触觉能够直接反映接触位置、接触范围、受力状态以及物体与手部之间的空间关系。这些信息往往无法仅通过视觉可靠获得。
然而,现有触觉传感器和数据采集系统普遍成本高昂,采集流程也高度依赖专用硬件、触觉手套和受控实验环境。
数据采集人员通常难以摆脱实验室场景的限制,更难以在真实世界中覆盖足够多样的物体、任务和交互方式。因此,触觉数据始终难以达到基础模型预训练所需的规模。

针对这一瓶颈,智在无界自主研发了面向大规模无标注人类视频的密集触觉伪标签系统 TactoHand。
该系统无需为数据采集者配备触觉手套或额外传感器,即可从普通人类视频中推断手部与物体交互过程中密集空间点的接触概率和连续接近度(continuous proximity),以接近零边际成本的方式为海量视频补充触觉监督。
基于 TactoHand,智在无界首次将触觉信息扩展至超过 50 万小时的人类视频,并将其用于具身基础模型预训练。这使触觉数据第一次从昂贵、稀缺的实验室信号,转变为可以大规模生产和利用的预训练资源。
创新点之三:采用创新性TopoHand架构,打通人手、灵巧手与平行夹爪
智在无界是最早开展大规模人类视频预训练的团队之一,也较早意识到:要将人类操作知识有效迁移至机器人,关键不仅在于扩大数据规模,还必须解决人手、灵巧手、平行夹爪等异构本体之间的动作空间不一致问题。
在 Being-H0.5 中,团队首次提出统一动作空间 UAS,通过预定义语义槽位,将末端位姿、夹爪开合、手指关节和机器人状态等不同控制变量映射到共享表示中,从而支持 30 余种异构机器人本体。
然而,第一代 UAS 主要依赖动作槽位及其掩码实现跨本体兼容,尚未从运动学结构层面统一人手与不同机器人末端执行器。

在 Being-H0.8 中,团队进一步提出第二代统一动作空间 TopoHand,为人类手部、灵巧手和平行夹爪提供统一的运动学接口。
TopoHand 采用固定拓扑的“螺旋手”(screw-hand)表征,由 20 个语义关键点和 20 个规范关节变量组成,并以手腕为中心建立统一坐标系:
x 轴指向中指指尖在手掌平面上的投影方向,z 轴与手掌法线方向一致,y 轴则用于构成右手坐标系。
在这一表示下,不同本体特有的关节命名、机械结构和网格拓扑均被隔离在策略接口之外。
模型不再直接依赖某一具体机器人或人手模型的原始关节定义,而是在统一的语义拓扑和运动学空间中学习操作规律。
相比第一代 UAS,TopoHand 不仅实现了控制变量层面的兼容,还进一步消弭了人手、灵巧手和平行夹爪之间的结构差异,使大规模人类视频中的操作先验能够更加高效地迁移到多种机器人本体,并显著提升跨本体预训练的效率与可扩展性。
结语:
在一年左右的时间里,智在无界已围绕“大规模人类视频预训练”完成多个关键里程碑:相继发布全球首个基于数千小时、超万小时、20万小时、50万小时人类视频预训练的具身基础模型。

这几代模型的持续演进,分别回应了通用具身基础模型在不同发展阶段所面临的核心数据问题:人类视频如何使用?如何规模化地应用人类视频进行模型预训练?又如何从数据中提炼高质量信息,持续驱动模型进化?

接下来,我们面对的是一个更宏大、更关键的时代命题:“什么样的训练范式,能够加速通用具身基础模型的到来?”
迈向全新的1.0时代,智在无界BeingBeyond将致力于给出自己的答案。
0
分享
好文章,需要你的鼓励












参与评论
请您注册或者登录星河频率社区账号即可发表回复
去登录
相关评论(共0条)
查看更多评论