具身智能训练的下一站,不一定是真实世界
作者|毛心如
过去一年,具身智能行业最确定的共识,就是机器人缺数据。
于是,数据采集成了新的角力场。
各路玩家搭建起自己的数据工厂,通过遥操作、人类示范,甚至让机器人自主探索,在真实世界里一点一滴积累经验。
无论国内海外,真机数据几乎成了主流叙事的标准配置。
但就在这条热闹赛道之外,一条不太主流的选择,仿真数据,正在重新获得关注。
今年以来,随着苏度科技等玩家持续加码仿真训练,行业开始重新追问一个根本问题:机器人,真的必须先踏入现实世界才能学会做事吗?
大模型时代,互联网文本近乎取之不尽,可机器人没这么幸运,每一次真实动作,都绑着真实的硬件、真实的环境、真实的时间成本。
仿真的价值由此显现,既然现实经不起大规模试错,不如让机器人先在虚拟世界中学习,这其实是仿真路线多年来一直在回应的命题。
但质疑声也从未间断,Sim2Real Gap,即仿真与现实之间的鸿沟,始终是机器人学习的最大挑战。
虚拟环境能模拟视觉、物理和动作,但现实中的摩擦、碰撞、物体变形、混乱交互,很难被完全复刻。
正因如此,仿真过去更多被当作研发辅助,而不是训练智能的主力路径。
然而,随着具身智能模型的演进,更深层的问题已经浮出水面:数据的生产方式本身正在发生变化。
行业必须创造新的数据生产方式,现实世界数据 + 仿真生成数据 + 机器人自主探索数据,三者相互补充、循环迭代,最终形成具身智能的数据飞轮。
仿真正在从辅助工具,变成这一新生产方式中不可缺少的一环。
围绕这一变化,国内正形成两类仿真派玩家:一类是将仿真作为模型训练核心路径的全栈公司,希望通过虚拟环境帮助机器人获得大规模经验;另一类则在构建机器人训练所需的基础设施,为行业提供数字资产、仿真环境以及数据生成能力。
它们都在争夺机器人时代最关键的入口,经验的生产能力。
真机数据正在触碰天花板,
机器人需要新的经验来源
在真机数据采集被高举高打的当下,它的边际效益却开始显现出清晰的天花板。
过去一年,行业投入大量资源建设数据工厂,遥操作员大规模采集轨迹,人类示范视频被反复标注清洗,似乎只要把真实世界的交互堆够量,通用模型就能自然涌现。
但当数据需求从百万级跃升到千万甚至更大规模时,真机路线的结构性瓶颈开始变得无法回避。
首先是成本。每一次有效的真机轨迹,都对应着真实的人力、硬件损耗和时间消耗。
遥操作需要专业人员长时间坐在控制台前,设备本身也要承受反复试验带来的磨损。
行业普遍估算,训练一个具备基本泛化能力的通用人形具身大模型,至少需要上千万级别的优质交互数据轨迹。
如果全部依赖真机采集,单条数据的综合成本会迅速推高到难以持续的水平,最终形成采得越多、负担越重的循环。
与大模型时代几乎零边际成本的文本数据相比,机器人数据的昂贵属性被放大得格外明显。
其次是规模与多样性的双重困境。
真实物理世界的变量组合近乎无限:物体材质从刚体到柔性体,光照从自然光到复杂反射,接触状态从稳定抓取到滑动碰撞,再加上家庭、仓储、产线等不同场景的布局差异,人工采集几乎不可能系统性覆盖。
更棘手的是长尾与高危场景,高温物体搬运、狭窄空间的精密操作,这些在现实中要么风险极高,要么出现频率极低,数据工厂很难主动生产出来。
结果就是,模型在常见任务上表现尚可,一旦遇到分布外的情况,泛化能力立刻塌陷。
最后是产能本身的物理约束。
数据工厂可以扩建场地、增加遥操作工位,但始终受限于真实时空。
一台机器人同一时间只能在一个位置执行一个动作,并行度远低于仿真环境中动辄成百上千个并行实例的效率。
迭代速度也随之受限:发现模型缺陷后,重新采集针对性数据往往需要数周甚至数月,而虚拟世界里同样的调整可能只需要几小时。
真机数据的产能、场景覆盖和成本三重天花板,已经清晰可见。
正是在这个背景下,行业开始重新审视仿真:它不是要完全替代真实数据,而是要成为机器人获取海量经验的新来源,补上真机数据无法独自撑起的那部分。
当现实世界的经验生产遇到硬约束时,虚拟世界提供了另一条可以规模化、可控、可复现的路径。
这并不意味着真机数据失去价值,而是意味着单一依赖真机的生产方式,已经难以支撑具身智能向下一个阶段迈进。
两条路线正在争夺机器人数据入口
在重建数据生产方式的过程中,国内形成了两条清晰的仿真路线。
一条由全栈机器人公司主导,它们用仿真训练自己的模型,以苏度科技、银河通用、Roboscience、跨维智能四家为代表。
它们没有追随真机为主、仿真为辅的主流范式,而是将仿真体系作为核心技术底座,自研专属仿真引擎与训练管线,让仿真数据成为模型迭代的核心来源,真机数据仅用于最终的微调对齐。
苏度科技走虚实融合路线,以大规模虚拟仿真数据为主体,融合少量真实采集数据,在效率与精度之间寻找平衡。
这种路线让机器人既有仿真里练出的见识,也有真机上磨出的手感。
今年苏度 R1 的 60 分钟演示中,机器人连续抓取百余件未见物体,涵盖透明、反光、柔软和不规则形态,成功率接近 100%;在 WAIC 上进一步展示了边移动边操作等多项技能。

银河通用押注数据规模,构建百亿级具身智能数据集与银河星坊数据基建,采用约 99% 仿真合成数据加 1% 真机数据的金字塔体系,并补齐柔性物体仿真短板。
通过海量仿真完成基础能力训练后,仅用极小比例真机数据做场景对齐,已实现叠衣服等长程柔性操作的高成功率。
Roboscience 把重点放在物理引擎上,自研可微多模态仿真引擎 RoboMirage,生成标准化运动轨迹,再结合互联网视频数据训练跨本体、跨场景的 VLOA 世界模型。
配合全自动标注清洗管线,单条数据成本降至传统方案的 1/20 至 1/200,并以每周数十万小时的速度扩充数据集。
跨维智能以生成式仿真为核心,自研 DexVerse 引擎持续产出高真实度新场景与交互任务,重点覆盖零件抓取、精密装配、柔性操作等长尾场景。
仿真完成精细化训练后,再结合真机调试,降低精密设备试错损耗,实现垂直场景的高效落地。
四家公司路径各有侧重:苏度重虚实融合,银河通用数据规模,Roboscience 重物理精度,跨维智能重生成式能力。
它们用不同的方式回答同一个问题:如何让仿真训练出的模型在真机上同样好用。
另一类玩家不做机器人、不卷大模型,只专注输出仿真引擎、虚拟场景、合成数据和训练平台。
光轮智能是综合能力最突出的一家,2026 年估值其突破 150 亿元,成为全球首个具身数据独角兽。
其求解-测量-生成平台覆盖合成数据、人类视频挖掘、工业级评测与部署反馈全链条,适配多品类机器人及多物理场交互,RoboFinals 评测平台提供统一能力评估标准。
目前在人类视频、仿真合成与工业评测三个领域光轮智能均实现全球交付量第一。
谋先飞强调自主可控,从底层物理求解器到上层训练管线全链路自研。
当前国内大量仿真工具依赖海外开源框架,存在技术卡脖子、适配性不足、安全可控性差等问题,谋先飞搭建了国产自主可控的高精度仿真训练场,并推出 MotrixLab 平台。
主打工业级高精度物理还原,为高端工业与精密操作场景提供国产化仿真训练方案。
群核科技的核心壁垒在于场景资产的广度。
其空间智能训练平台 SpatialVerse 积累了超过 5 亿个结构化 3D 空间场景和 4.8 亿个 3D 模型,是行业最大的室内场景素材库。
与传统人工标注只能标记物体标签不同,群核科技的合成数据能自动生成物体间的空间关系,这对机器人导航和交互理解至关重要。
目前,群核科技已经为宇树科技等头部厂商提供数据,精准补足了通用仿真引擎在空间结构还原上的短板。
凌迪科技选择的是一条更难的路,柔性体仿真。
在具身智能训练中,刚体仿真已相对成熟,但布料、衣物、软质杂物、可形变物品等柔性物体始终是行业难点,也是人形机器人落地日常场景的关键瓶颈。
深耕服装仿真领域十余年,凌迪积累了全球最大的柔性体仿真数据库之一。
如今,其面向具身智能推出全栈数据引擎 SynReal World,围绕数据生成、虚拟训练、仿真评测、真实落地构建能力,可快速生成各类柔性物体的高精度交互数据。

其产品已和银河通用等企业合作,有效解决了柔性操作场景的 Sim2Real 迁移难题,补齐了通用模型在软体交互上的关键短板。
这四家基建派玩家虽同属仿真数据赛道,但护城河泾渭分明。
光轮智能强在全栈基础设施与国际标准话语权,谋先飞赢在自主可控与高端工业仿真,群核科技手握场景规模之利,凌迪科技则独占柔性体仿真精度。
它们共同构成了仿真赛道的基础设施层,让整个具身智能行业得以站在更坚实的虚拟地基上,去触碰物理世界的边界。
仿真不会替代现实,
但会重塑机器人学习方式
仿真路线的讨论热度升温,并不意味着行业争论就此平息。
Sim2Real 的鸿沟依然存在,虚拟环境里的每一次完美抓取,都不等于真实世界中的成功。
摩擦力、材料形变、光照变化,真实物理世界充满难以精确建模的变量。具身智能追求开放环境中的泛化能力,对仿真系统的真实性要求远高于过去。
苏度 R1 的演示令人印象深刻,但演示终归是演示,距离在家庭、仓储等非结构化场景中稳定运行,中间还隔着漫长的验证周期。
不过,行业对这道鸿沟的认知正在转变。
它不再被看作不可逾越的天堑,而是被视为可以通过更高保真物理引擎、虚实数据飞轮逐步缩小的工程问题。
苏度科技和跨维智能的探索表明,在部分操作任务上,仿真到现实的鸿沟已可被压缩到接近实用的程度;银河通用的实践也证明,合成数据与真机数据的合理配比,往往比非此即彼更有效。

这种虚实融合的思路,其实在自动驾驶领域已经有过充分验证。Waymo、特斯拉等公司都大量依赖仿真环境训练和验证复杂场景。
机器人今天面对的问题,本质上与自动驾驶十年前类似:现实世界数据昂贵,而智能需要无限经验。
有意思的是,像光轮智能、极佳视界、海天瑞声等早期切入自动驾驶业务的公司,如今也纷纷转向具身智能相关方向,正是因为它们在仿真与合成数据上的积累,天然适配了机器人对海量经验的新需求。
另一边,真机数据模式本身也正在触达边际效益的天花板。
正是在这个背景下,仿真训练的结构性价值被重新审视:
成本与效率:仿真可将数据生成的边际成本降至电费级别,并实现长时效运行
多样性:通过域随机化与物理参数扫描,仿真能系统性地扩展物体材质、光照、接触状态的组合分布,人工采集几乎无法企及
可复现与评测:仿真评测比真机实地测试更容易建立标准化、可对比的能力度量体系
冷启动:在真机数据尚不足以支撑通用基座时,仿真提供了先建立基础能力的可行路径
当然,仿真不是万能解药。物理建模的极限、视觉与力觉的一致性、长期任务中的误差累积,依然是硬骨头。
行业讨论也逐渐摆脱二元对立,走向更务实的分工协同:全栈玩家是落地验证的探路者,基建服务商是生态的筑基人。
但热闹背后,一个隐忧同样值得关注:行业的度量衡尚未统一。
不同公司各有各的引擎、数据格式和评测标准,缺乏类似 ImageNet 的物理基准测试集。在仿真走向主引擎的过程中,谁能主导标准,谁就可能掌握下一阶段的话语权。
归根结底,具身智能的终极竞争是数据竞争,而数据竞争的底层,是能够产生数据的环境的竞争,更准确地说,是经验生产能力的竞争。
过去互联网公司争夺的是谁拥有更多的网络数据;机器人时代争夺的,是谁能拥有一个更适合机器人学习和成长的世界。
从这个意义上说,仿真从来不是具身智能的过渡方案,而是机器人产业走向规模化不可或缺的基础设施。
物理世界的 AI,必须用物理规则来训练,而仿真,正在虚拟世界中为 AI 建造一所物理大学。
当然,仿真并不是具身智能的终点,机器人终究要落地现实环境完成检验。
但毋庸置疑,仿真已经成为打通数据、模型与物理世界的关键桥梁。
机器人赛道的竞争,早已不局限于真机数据采集量,核心比拼的是持续、高效产出高质量交互经验的能力。
未来,谁能提升仿真物理真实度、压低数据生成成本、跑通高效的虚实迭代飞轮,就有望在通用具身智能到来之际抢占优势。
0
分享
好文章,需要你的鼓励












参与评论
请您注册或者登录星河频率社区账号即可发表回复
去登录
相关评论(共0条)
查看更多评论