作者|张竹
具身智能到底有没有自己的 Scaling Law?怎样才能实现 Scaling Law?
这是过去两年,整个行业一直没有明确答案的问题。
与语言大模型不同,具身智能面对的是不断变化物理世界。
它不仅需要理解环境和任务目标,还需要预测物体变化、规划连续动作,并在执行过程中处理各种不确定因素。
这就导致,机器人需要面对连续判断、长时间执行的复杂任务,成功率就会明显下降。
如果具身智能根本不存在 Scaling Law,那每家公司就只能在垂直场景里做工程优化,行业永远等不来规模化跃迁。
如果成立,那真正的问题就变成了:机器人学干活,算法重要还是数据重要?什么样的算法和数据配方,才能最高效带来具身智能的 GPT-3 时刻?
在2026 WRC上,极佳视界交出了他们的答卷,用数据金字塔和算法金字塔双轮驱动,构建可扩展(Scalable)的具身基础模型。
新一代具身基础模型 GigaBrain-0.7 以「双金字塔」架构为核心,将世界模型引入机器人的实时决策回路,让机器人「先预演判断,再执行动作」,同时实现了行业内首个超 20 分钟超 10 个任务的长程复杂精细操作一镜到底。
从「理论共识」到「范式落地」
极佳视界在今年二季度率先提出了「如何构建可扩展(Scalable)的具身基础模型」这一行业核心命题,并确立了「数据金字塔」与「算法金字塔」的双轮驱动战略。
8月19日,极佳视界正式推出新一代具身基础模型——GigaBrain-0.7。
GigaBrain-0.7 系统论证了「双金字塔」架构每一层的价值,并在相同真机评估基准下,效果全面领先全球头部开源模型。
这不仅是一次版本的迭代,更是极佳视界将「数据+算法」双金字塔理论转化为大规模工程实践与真机泛化能力的飞跃。
核心架构创新GigaBrain-0.7 的三层算法金字塔
GigaBrain-0.7 深度融合了三层算法金字塔,基于全栈算法能力完成了全新的架构设计,在模型架构层面实现了从物理常识理解和预判、到高精度连续动作控制、再到闭环经验强化的完整进化。

GigaBrain-0.7架构图
「第一层」
世界模拟(World Simulation)——赋予 VLA 物理常识理解和预判能力
▍VLM 物理常识理解和规划
以大规模视觉语言模型 VLM(System-2)为大脑主干,深度理解物理世界的常识规律、因果逻辑与高层任务规划。
同时通过原生时空交互注意力机制(Temporal-Spatial Block),在空间视觉 Token 中引入了相对位置编码与相对时间编码,解决了具身任务中的长程时序推理难题。
▍World Model 未来变化预测和判断
GigaBrain-0.7 首次提出 System-3 的定义,使用之前发布的 GigaWorld-1 实现对物理世界未来变化的预测和判断,补齐了当前 VLA 不具备预判能力的短板。
具体来说,基于 GigaWorld-1 的 System-3 可同步生成当前动作的未来价值评估(Action Value Feedback)和未来关键进展的视觉图像预测,这些未来表征被编码并即时补充至 GigaBrain-0.7 的输入 prompt 中,为机器人提供了「预演未来」的能力,显著提升了高难度、长程长尾任务的真机执行成功率和完成速度。
「第二层」
动作对齐(Action Alignment)——基于 MoT 和 Flow Matching 的多本体动作生成
▍跨本体参数共享(Shared Action Expert)
System-1 基于 MoT 架构,采用 Flow Matching 范式生成高质量连续动作。
在 Action Expert 模块中,不同机械本体共享绝大部分 Transformer 核心参数,仅通过本体类型 ID(Robot ID)路由至对应的输入/输出投影层,成功实现了异构本体间的操作知识迁移与共享。
▍软知识隔离(Soft Knowledge Insulation)
在 Action Expert 与 VLM 视觉主干之间设计了 Soft Knowledge Insulation 机制,既保障了 VLM 主干强泛化的通用任务理解与规划能力,又最大限度提升了专用机器人操纵的精度。
▍端到端联合预训练(Unified End-to-End Pretraining)
引入随机 Prompt 动态改写机制,配合细粒度的 Subtask 与 VQA 标注,在统一架构内实现 Subtask 语言规划、VQA 视觉理解、离散动作桥接与连续动作生成的一次性端到端联合预训练,大幅提升预训练效率和动作对齐能力,极大的增强了模型在未知场景中的泛化性与指令严格遵循能力。
「第三层」
经验强化(Experience Reinforcement)——从离线经验学习到在线持续强化
GgaBrain0.7 的经验强化管线分为三个步骤:
首先监督微调阶段,极佳视界使用少量专家数据进行训练,使得预训练模型在复杂域外任务上具备一定的成功率;
然后离线训练阶段,一些基于上一阶段模型自主 Rollout 采样的数据和人类在环数据被加入,使得模型具备错误恢复能力、提升成功率的同时,还能够对任务的完成进度和质量进行评估;
最后在线训练阶段,极佳视界基于模型评估能力构建稠密奖励,并通过人类在环的方式进行在线强化学习,进一步增加模型在精细操作上的成功率。GigaBrain-0.7 深度融合了三层算法金字塔,基于全栈算法能力完成了全新的架构设计,在模型架构层面实现了从物理常识理解和预判、到高精度连续动作控制、再到闭环经验强化的完整进化。
GigaBrain-0.7-RL流程图
▍离线经验学习
模型在执行真机任务的同时,极佳视界会将 Rollout 数据进行实时记录,并人工进行轨迹成功与失败、进度快与慢、质量高与低的标记,基于这些人类经验同步进行 Value 估计和 Policy 更新的离线强化学习训练,在使得模型具备错误恢复能力的同时,能够对任务的完成进度和质量进行评估,进而高效的提升大部分任务的完成能力。
▍在线持续强化
对于高难度精细复杂操作任务,经过离线强化学习训练完的模型也未必能稳定达到 100% 成功率,因此极佳视界可以进一步通过人类在环的方式进行在线持续强化学习,通过边执行、边修正、边更新的方式,使得动作轨迹越来越精细、任务完成性越来越高,直到稳定达到 100% 成功率。
全阶数据基建五层数据金字塔的工程化落地
数据是具身智能 Scaling 的基石。GigaBrain-0.7 背后是极佳视界构建的庞大、高质量、跨模态数据集。
「海量互联网数据」
针对机器人操作场景,基于自研 GigaData Platform 数据平台,对互联网海量数据进行深度清洗与细粒度结构化标注。
极佳视界不仅构建了近 3 亿对「图像-语言」数据集,极大强化了 System-2 在空间理解、目标定位、交互预测及轨迹推理的底层能力;同时还构建了数万小时的视频数据,成为训练 System-3 的强大数据基石。
「传感器同构的真人数据」
同构采集硬件全栈自研:自研了与极佳双臂人形本体 Maker H01 传感器完全同构的 UMI(手柄示教)与 EGO(第一视角头戴)采集设备。
全流程质量闭环:为了得到高质量的真人数据,极佳视界对硬件设计、数据采集、数据清洗、训练数据构建,做了多重保障,最终清洗得到近 11200 小时高质量真人数据。

UMI数据处理流程
EGO数据处理流程
极高的数据效率:得益于极高的数据一致性和数据质量,仅需 300 条 UMI 数据进行后训练,即可让 Maker H01 人形本体在全新任务中实现自主操作。
「生成与仿真数据」
依托自研的数据生成平台 GigaData Platform,结合视频生成与高保真物理仿真,构建了超 5000 小时清晰的高质量长尾场景数据,破解真机采集安全与成本痛点。

GigaData Platform数据生产流程图
「真机数据」
基于极佳视界自研的轮臂人形机器人 Maker H01 与轮臂机器人 Maker M01,以及部分开源真机数据,极佳视界最终清洗得到 20500 小时的高质量真机数据。

真机数据处理流程
真机性能表现全面超越全球头部开源模型
「数据+算法」双金字塔的深度融合,赋予了 GigaBrain-0.7 行业顶尖的具身操控能力。
「Data Scaling 验证具身 Scaling Laws」
能否 Scaling 是具身智能最重要的问题之一,因为这直接决定了具身能否复刻大语言模型的成功,进而影响着物理 AGI 的进程。
GigaBrain-0.7 从多个角度验证出了具身智能可以被 Scaling 的这一趋势。
首先,从图一的预训练规模和域外任务预测误差来看,少量数据随着预训练的进行存在过拟合现象,但随着数据量的不断提升,过拟合不仅逐渐缓解,且当数据量到达一定量级时,模型涌现出越来越强的泛化性。
其次,从图二的预训练数据类型和真机成功率关系来看,增加 UMI 和 Ego 等数据可以直接提升真机效果,表明无本体数据是可以被 Scaling 的。
最后,如图三预训练数据量和基模真机成功率关系所示,极佳视界对 GigaBrain-0.7 全量数据预训练的不同阶段的模型进行测试,发现随着预训练的不断进行,真机成功率也不断提升,且最终无须单任务后训练微调,一个预训练基模便可实现多任务的百分之百成功率。


「System-3 显著提升任务完成能力」
传统 VLA 在做动作之前,不具备对物理世界未来变化的预测和判断能力,导致任务完成性和泛化性存在瓶颈。GigaBrain-0.7 首次提出 System-3 的概念,基于 World Model 实现 World Value Model,让 VLA 在做具体动作之前先对未来动作做了很好的推演和判断,不仅显著提升了执行任务的成功率,而且任务完成得分和完成速度也明显提升。
「开箱即用的基模能力」
极佳视界对 GigaBrain-0.7 的基模做了全方位的评测,包括分能力评测(语言跟随能力、复杂操作能力)、分机型评测(AgileX PiPER 双臂机器人、Maker H01 人形机器人)、分范围评测(域内、域外)、分任务评测(24 个任务全面评估)。
结果表明,GigaBrain-0.7 的基模展现出了极其突出的通用性,并涌现出了令人惊喜的泛化性,真正做到了「One Model,Many Tasks」的具身基模应该具备的「开箱即用」的能力。
▍基模语言跟随能力

▍基模复杂操作能力
「Benchmark 全面领先」
▍真机评测
在相同真机评估基准(AgileX PiPER & Maker H01)下,GigaBrain-0.7 与国际主流及行业头部模型进行了全面横向后训练对比,真机效果全面领先。
特别是在「具身原生的自研本体 Maker H01」上任务成功率展现出「断档领先」的突出优势。
后训练语言跟随能力

后训练复杂操作能力

▍仿真评测
为了方便大家验证模型能力和横向对比,极佳视界特意挑选了仿真评测和实机部署相关性高度一致的 RoboColiseum 平台进行了评测。
经过平台 4 个方面的全方位评估,结果同样全面领先全球头部开源模型和闭源方法,取得 4 个分项全部第一的成绩,轻松登顶榜首。
这进一步证明了 GigaBrain-0.7 的超强基模能力和任务泛化能力。

GigaBrain-0.7 的意义不只是一次模型迭代,更是极佳视界将「数据+算法」双金字塔理论转化为工程实践与真机泛化能力的飞跃,在多个维度验证了具身智能实现 Scaling 的可能性,当数据层级足够丰富、算法架构足够体系化,具身智能的能力边界,是可以被系统性推高的。
从世界模拟→动作对齐→经验强化的三层算法金字塔,到从互联网图文到真机操作的五层数据金字塔,「双金字塔」架构试图解决具身智能 Scaling 过程中最核心的问题,数据如何积累,算法如何承接,以及两者如何共同推动模型能力提升。
具身智能距离真正走向通用化仍然需要时间,但 GigaBrain-0.7 提供了一份可验证的阶段性答案。
但随着数据积累、算法优化和工程验证的持续推进,具身智能向物理 AGI 靠近的路径,正在变得更加清晰。













参与评论
请您注册或者登录汽车之心社区账号即可发表回复
去登录
相关评论(共0条)
查看更多评论