作者|李沐蓉
机器人整理客厅整理到一半,把杯子放进了柜子,转身回到桌前,又开始找那个杯子。
这几乎是当下所有家庭机器人的缩影,当下能叠衣服、会冲咖啡、能炒一盘番茄炒蛋的机器人已经不算稀奇。
但如果把任务从一个演示动作拉长到真实家庭场景中,问题就会暴露出来,机器人能够完成一个动作,却很难持续完成一系列事情。
问题在于,目前行业主流使用的VLA模型,大多还停留在「看到目标、执行动作、结束任务」的单点闭环里。
而家庭环境复杂、任务交织、状态多变,机器人真正面对的,不是一个个被切开的任务,而是一段连续、充满变量的日常。
所以,当机器人开始进入真实家庭,最大的挑战是如何在一个动态环境里持续、稳定地干活。
家庭不是工厂,
机器人面对的是更复杂的场景
聊起具身智能为什么迟迟进不了家庭,大家习惯归因于硬件可靠性不足、训练数据稀缺、模型架构有短板。
这些都是真实存在的障碍,但如果把「整理客厅」这样的家庭任务拆开来看,会发现一个更深层的瓶颈:无论是单纯依靠世界模型,还是依靠 VLA 模型,绝大多数机器人仍停留在「动作智能」阶段。
它们能根据当前感知执行指令,却缺乏对任务进程、环境变化以及整体目标的持续理解,因而在长程、多变的家庭场景中频频失效。
VLA 模型,把视觉、语言与动作连接起来,让机器人知道「现在应该做什么」。
而长程任务进一步要求机器人知道「我已经做了什么、为什么这么做、接下来应该做什么」。
就像机器人能拿起一个杯子,却做不到自主理解把杯子洗干净,再放回该放的柜子里。
前者解决的是单个动作问题,后者考验的则是跨越时间、跨越多个子任务的连续判断能力,二者之间存在明显的能力断层。
因此机器人进入工厂,会比进入家庭更容易,很大程度上是因为,工业环境相对稳定,工厂里的任务往往可以被拆解成明确、固定、重复的流程,机器人只需要在相对稳定的环境中不断执行。
而家庭却恰恰相反,它不是一条固定生产线,是一个不断变化的开放环境:物品会移动,空间会变化,人的需求也会随时调整。
所以,家庭机器人需要解决的难点主要集中在三个地方:
一是家庭任务天然是长程任务,而且随时可能被打断。
很多家庭任务,本质上都不是一个动作能够完成的,比如,整理客厅动辄十几分钟起步,涉及几十个物品、多个交叉的子任务,过程中还经常可能被用户的临时需求、宠物闯入或突发状况打断。
这就需要机器人必须在移动和操作过程中,保持对任务进度和环境状态的判断,必须知道,刚才完成了什么,现在处于哪个阶段,接下来应该如何继续。
否则每一次中断就意味着重新开始,完成长程任务遥遥无期。
第二,家庭环境天然是非结构化的。
在家庭中,机器人每天面对的都是,桌面上随意摆放的物品、被压皱的衣服、不同材质、形状的玩具书本、还有随时出现的遮挡、新增杂物、位置偏移等变量。
这些变化对于人来说很常见,但对传统依赖固定流程和标准化场景的机器人而言,却很难稳定应对。
面对不规则玩具、易变形的柔性物品、轻薄光滑的塑料包装,甚至一个被碰歪了角度的水杯,抓取与操作成功率都会急剧下滑,更谈不上自主调整策略。
第三,用户指令天然是不完整的。
没有人会像编程一样对家庭机器人说,「移动到茶几左侧,拿起那本蓝色封面的绘本,竖直插入第二层书架从左数第三个空位。」
现实中的指令大概率只有一句:「帮我把客厅收拾一下」。
至于哪些物品该放进哪个收纳盒、哪些是临时出现的垃圾需要丢弃。这些没说出口的信息,用户对家庭机器人的预期是默认知道的。
这就需要机器人需要具备类似人的任务理解能力,结合对空间、物体和任务目标的理解自主补全,从服务指令走向服务人。
归根结底,真正决定机器人能否走进家庭的,从来不是某一个动作完成得多么精准漂亮,而是它能否在一个持续变化、充满不确定性的环境里,持续、稳定、有逻辑地干完一整件「家务活」。
这也是为什么行业里越来越多的共识正在从「练好单点技能」转向「补齐长程能力」,毕竟,家庭不是流水线,日子也不会按剧本演。
但值得追问的是,当下主流的 VLA 和世界模型这两条路线,为什么都还没能把这三个难点解决掉?
BetaWAM 0.1 ,让机器人操作从「动作智能」走向「任务智能」
传统的 VLA 模型,本质上是一套「看图说话再行动」的系统,视觉模块负责看,语言模块负责理解指令,动作模块负责执行。
在工厂这类高度结构化场景中,VLA 有着强大的执行能力,比如「打包汉堡、薯条、可乐」这样的标准化指令,能按既定流程完成。
但它只能完成动作,却不能理解物理世界, 不知道「这个动作会带来什么后果」,更无法预判物体运动、环境变化。
这就带来两个致命问题,一是泛化性弱,环境稍有变动,光线、物体位置偏移,任务成功率就会断崖式下跌;
二是长时任务容易失效,模型难以规划多步骤动作。
即使是以精细操作见长的 π0.5 这类多任务 VLA 模型,也依然面临类似挑战,在熟悉场景中能够完成任务,面对新环境就卡住。
也正因为如此,越来越多企业将目光转向世界模型。
英伟达推出了世界基础模型 Cosmos,Google DeepMind 发布了 Genie-3,特斯拉也在其仿真系统里深度集成了世界模型技术;国内的它石智航、大晓机器人、千诀科技等,也是这一阵营的代表玩家。
世界模型,能弥补 VLA 缺乏因果推理的短板,进而让机器人理解物理世界如何演变、预测未来状态。
可是当前主流的视频生成式世界模型,底层架构大多仍受制于「离散的下一步预测」上,把连续的物理世界切分成一帧帧静态画面。
这种方式在短时间视觉生成上表现出色,但一进入长视距的物理任务,误差就会逐帧累积,时间一长,模型就容易偏离物理规律、产生不合逻辑的「幻觉」。
一旦预测不准,后续的强化学习也会被错误信息带偏,长程推演里误差越滚越大,无法在真实世界里完成复杂任务。
更关键的是,世界模型单独来看解决的是「理解与预测」问题,而不是「执行」问题。
两条路线各有优点,却都无法根本性解决家庭任务所需要的长程规划、非结构化应对和指令补全能力。
而贝塔无限成了业界率先在非标真实场景完成长程复杂任务的玩家,其最新发布的世界动作模型 BetaWAM 0.1,并不是单纯强化某一个动作能力,而是突破性地让机器人在真实家庭的非结构化环境中,不靠预设、不靠遥控,自主完成一整套客厅整理收纳任务。
观察这两年人形机器人的演示,不难发现,多半机器人要么站着不动,只用手臂干活,要么单纯行走、走到目标点再停下来操作。
比如 Figure Helix 01 采用先定位再操作的串行逻辑,但整体响应延迟高、场景适应性有限;特斯拉Optimus 的公开演示也大多停留在单一任务或预设场景下。
很少有人形机器人能像人类一样,一边走路、一边端着东西、一边干活。
但在真实家庭里,绝大多数活需要全身协同完成,比如拖地,手臂用力推拖把的同时,腿部要保持平衡持续前进;
还有把衣服放入洗衣机,需要移动、弯腰、抓取、放置多个动作连续完成。
这些对人类而言近乎本能的无缝切换,对机器人却是移动与操作两套控制系统间的耦合难题,也是行业长期存在的「卡脖子」环节。
很多机器人系统会把不同能力分开处理。移动模块负责走,操作模块负责抓,两个部分独立决策。
这就导致机器人一旦切换状态,可能造成动作停顿、接触中断或姿态不稳定,把一个连贯的动作硬生生切分开。
而贝塔无限的 BetaWAM 0.1 的突破之处在于,利用世界动作模型,将移动和操作放在同一个任务决策框架中,机器人不需要先问「我该往哪走」,再问「我该怎么抓」,而是始终在回答「我现在做什么能让任务整体向前推进」。

由此机器人可以一边走,一边干活,动作连贯自然,不再卡顿。
但真正决定机器人能不能应付家庭日常的,从来不是理想环境下的流畅演示,是它面对意外时的反应方式。
与其他世界动作模型不同的是,BetaWAM 0.1 在统一框架之上,进一步赋予机器人空间物理理解和记忆能力,使其能对自身位置与目标物体进行精细的空间调整。
例如,当乐高被书本临时盖住,机器人没有因为「看不见」就判定任务失败,而是结合先前的观察和记忆,推演出书本下方大概率还是那块积木,随后规划路径、移开书本、完成抓取。
即便抓取中途失手掉落,它也能重新夹取,不会中断主任务;若收纳筐或自身站位不理想,它还会自主微调,而不是报错卡死。

这种「容错能力」,恰恰是当前主流模型最稀缺的。
VLA 模型在面对目标遮挡、物体掉落等场景配置变化时,鲁棒性和泛化性明显不足;世界模型则受制于长时程预测的误差累积,在真实场景下的抗干扰能力缺乏保障。
而 BetaWAM 0.1 让机器人即便遇到干扰和突发情况,也能根据任务目标、空间关系和历史记忆,实时生成新的解决策略,实现了行业领先的泛化能力。
此外,要让长程任务不「断片」,离不开一套可靠的记忆机制。贝塔无限构建了一套三维记忆体系:
Token 记忆负责表达明确状态,比如任务进展、物体位置等。
Latent 记忆则保留视觉、空间、触觉等难以语言描述的信息。
参数化记忆则把反复验证过的稳定经验,沉淀进策略或模型。
机器人不再需要每一次任务都从零开始,能把记忆和当下的空间关系判断进行结合,面对环境变化和突发干扰,也能用极短的时间完成推理响应,恢复任务状态。
而在执行层面,双臂协作和底盘升降则把操作能力落到了实处。
家庭收纳、整理任务天然需要双手配合,一手固定、一手抓取,或一手移动、一手调整。双臂协作可以让机器人多步骤连贯完成任务,更接近人类真实的做事方式。
同时,家庭空间是立体的,从地面到高柜、从桌面到底层抽屉,任务目标高度各异;底盘升降则赋予了机器人全空间可达性,操作不再受限于固定高度,任务规划因此有了更大的自由度。
简而言之,家庭机器人真正要跨越的门槛,从来不是某一项单点技能的突进,而是能否把感知、决策、记忆和执行拧成一股绳,完成长流程复杂任务,这是家庭这种非结构化环境,对机器人提出的最基础的要求。
BetaWAM 0.1 ,以单一模型驱动长程复杂的移动操作任务,重新定义了「大小脑协同」与「操作能力」的边界,它让机器人不仅完成任务,更能接住意外、看懂变化,从动作智能迈向真正的任务智能。
贝塔无限以「长程任务操作+记忆」,
补齐机器人进家庭的缺口
简而言之,当行业还在讨论 VLA 还是世界模型更接近具身智能未来时,贝塔无限选择用自研的世界动作模型率先回答了一个更具体的问题,机器人能自主地在真实的、非结构化的家庭环境中,持续完成长程复杂任务。
这两年,VLA 和世界模型都在时序建模上有明显进展,但如何跨越十几分钟的时间尺度,完成长程任务和实现零样本泛化性,仍是一个尚未被充分解决的问题。
VLA 缺少持续的状态追踪,只能基于几帧的视野做动作决策,任务一拉长就容易丢失进度。
而世界模型虽然擅长推理预测,但本质上是在凭当前一帧去推测下一帧,同样撑不住十几分钟量级的任务。它更像一个优秀的环境预言家,却不是一个合格的执行者。
换句话说,两条路线都缺少一个关键能力,对任务本身的持续追踪和理解。而家庭这个场景,恰恰最需要这个能力。
这正是贝塔无限选择从「长程任务+记忆」切入的底层逻辑,目标不是替代 VLA 或世界模型,而是补上机器人从「动作智能」走向「任务智能」过程中缺失的一环。
但也意味着,这是一条对数据、模型和系统工程协同要求都更高的路线。
基于这个判断,从成立之初,贝塔无限就确立了一条相对笃定的技术路线,坚持打造以人为中心的全栈技术体系,瞄准更复杂消费级具身智能终端,建设具备长期记忆和能完成长程复杂的智能体。
它的壁垒并不在单个模块,而在几件需要时间积累的事:真机长程交互数据、记忆的更新与纠错机制、模型、Agent 和控制系统的协调能力,以及跨时间沉淀的家庭用户数据。
这套路线的底色,也与团队背景形成了一种呼应。贝塔无限联合创始人兼 CEO 刘武龙毕业于清华大学电子系,曾负责华为大模型工程团队和强化学习方向,参与智能驾驶系统和大规模 AI 基础设施建设,有复杂动态环境中的决策与大模型工程量产的丰富经验。

联合创始人兼 CTO 陶帅同样出自清华电子系,曾任字节跳动商业化 AI 算法与工程负责人,主导过千人千面推荐系统,拥有个性化建模经验。
这两条经验线,恰好对应了家庭机器人最需要解决的两个核心问题:如何在动态环境中完成长程复杂的移动操作任务,以及如何让机器人越用越懂这个家。
世界动作模型模型决定了机器人的操作基础,而记忆系统又增强了决定机器人对家庭和用户的了解程度。
搭载 BetaWAM 0.1 的机器人既让记忆参与每一次操作决策,又拥有对现实世界持续更新的认知。
它经历过的干扰、失败、交互经验,都会沉淀为能力,从而完成更多的长程复杂任务,在操作能力和泛化能力的都实现了突破性的效果。
可以看到,贝塔无限第一次让家庭机器人成了一个「做得好、记得住、扛得住干扰」的智能体。
它知道这个家的空间布局,理解用户的使用习惯,还记得哪些事情已经完成,也能在出现意外时自主调整。
未来,当机器人面对一堆散落的玩具、凌乱的客厅或者临时变化的需求时,用户不需要重新告诉它每一步应该怎么做,它就能持续地把这些活干完,不中断、不让人操心。












参与评论
请您注册或者登录汽车之心社区账号即可发表回复
去登录
相关评论(共0条)
查看更多评论