绑定手机

获取验证码

注册、登录代表你已阅读并同意《用户协议》

取消
当前位置: 首页 > 详情

长程任务之后,机器人真正的“智能”才开始显现

李沐蓉 2026-09-14 11:01:00 5634
作者|李沐蓉
过去几年,行业里刷屏的机器人 Demo,大多停留在抓取、搬运、放置等单点任务上。
但从今年下半年开始,风向明显变了。
机器人不再满足于证明自己会做一个动作,而是开始尝试把一件事从头到尾做完。
比如,千寻智能 Moz1 只需要一句「整理客厅」的指令,就能自主完成把可乐放进冰箱、把脏碗送进洗碗机、把垃圾丢进桶里等连续任务。
还有成立不到一年的墨奇智能,首次公开亮相便展示了一段 15 分钟一镜到底的家务整理过程。
这些变化背后,是行业正在进入新的竞争阶段。
机器人从能够运动走向能够操作,从单项技能走向多技能组合。
下一阶段的考题已然出现,长程复杂任务,就是最直接的考场。

为什么长程任务才是真正的考场,难在哪里 

具身智能要走进真实世界,长程复杂任务是绕不过去的一关。
因为现实世界里绝大多数活儿都是多步骤、长周期、强关联、多约束的复杂任务。
比如「整理房间」,对机器人来说,整个过程中,它需要持续识别环境中的物体,理解任务目标,判断物品归属,规划行动顺序,执行抓取和移动动作,再确认任务是否完成。
普林斯顿大学 Recuris 项目的核心发现,长时序任务失败的根源,往往不是缺少可用经验,而是缺少一个紧凑、可靠的「当前任务状态」,机器人能不能维持一个随时间变化、持续更新的状态。
而完成长程复杂任务,一直是行业公认的难题。
这背后,对应的具身智能要面对的三层困境,记不住、想不清、接不住,不知道做到哪了,不知道接下来该做什么,也不知道出错了以后怎么办。
具体来说,首先是缺乏长效时序记忆。
目前主流使用的模型,无论是 VLA 还是世界模型,记忆大多仍是单层历史上下文缓存,采用的还是帧级独立推理模式。
也就是说,模型没有类似人类的分层记忆系统,难以对长时程任务中的关键状态进行有效筛选和结构化记忆。
一旦任务被中断或环境发生变化,就很难回溯和恢复状态。
当任务变长,机器人就很容易丢失任务进度,造成步骤逻辑错乱。
比如已经完成收杯子动作,之后可能再次执行同样步骤。
这些在人类看来再基础不过的连续操作能力,对机器人来说却需要让记忆真正嵌进决策闭环里,而不是仅仅作为参考信息。
其次,误差的不断累积也是长程任务难以突破的重要原因。
长程任务通常需要机器人连续完成数十个动作。
单个动作中的微小误差,在短任务中可能并不会造成明显影响,但随着任务不断推进,这些误差会逐渐放大。
夹爪抓取位置偏移 1 毫米,底盘移动角度偏差 0.5 度,或者物体摆放位置略有变化,误差不断累计起来,就会导致整个任务失败。
举例来说,如果每个子步骤成功率为 95%,当任务链拉长到 10 步时,全部成功的概率会降到约 60%。
而真实家庭和工厂环境远比实验环境复杂,任务链条越长、环境越开放,需要处理的异常状态和分支情况就会越多,长程任务失败的可能性也随之上升。
误差之外,规划和执行之间的脱节,同样影响着长程任务的成功率。
现在模型基本采用「双系统」的结构:高层负责理解任务和规划,低层负责具体动作执行。
像机器人接收到「整理厨房」的指令,高层模型可以规划出收拾垃圾、整理餐具、擦拭桌面的任务流程。
但真正执行动作的是底层控制系统。
问题在于,当任务持续时间拉长,两层系统不能共享同一套、持续更新的任务状态。
高层模型知道目标是什么,但未必知道每一次动作执行的细节;底层模型知道当前动作怎么完成,却不一定理解整个任务已经推进到了哪里。
这种割裂,就会导致机器人面对失败时无法正确判断下一步应该怎么办。
再叠加「大脑慢、小脑快」的异步控制矛盾,模型推理和电机控制天然是两种不同的响应速度,动作看起来就会格外迟缓、脱节。
除此之外,机器人还不太会随机应变地拆解任务。当前机器人更多依赖提前规划好的流程,在标准化环境中表现不错,一旦进入开放环境,泛化能力有限,就容易因为任务变化而失去方向。
加上高质量具身数据缺乏和 Sim-to-Real 的行业难题,长程任务的难度被进一步放大。

三条技术路线,殊途同归

随着具身智能逐步走向落地,单点能力的比拼已经接近尾声,长程任务才是接下来真正拉开差距的地方。
围绕这道题,行业已经出现几种不同的解决路径,如果用一句话分别概括,大致可以归纳为:让机器人想得更远、让机器人记得更多、让机器人边做边想。
三条路线背后,对应的是机器人在长程任务中的三种关键能力。
第一种是让机器人想得更远,通过分层架构提升机器人的任务理解和规划能力,代表玩家有极佳视界、墨奇智能。
常见的双层系统结构是,System 1 负责动作执行,System 2 负责任务理解和规划。
而极佳视界不同的是,提出了三层系统,增加 System 3,把世界模型放进机器人的实时决策回路,进一步承担「预测和推演」的角色,一边琢磨接下来可能发生什么,一边盯着任务到底进行到了哪一步。
System 3 可同步生成当前动作的未来价值评估和未来关键进展的视觉图像预测,这些未来表征再反馈给机器人决策系统,进而显著提升了复杂任务的成功率。
基于此,据极佳视界展示的演示视频,机器人完成了一段超 20 分钟、涵盖 10 余个任务的连续操作,包括热鸡翅、收拾餐桌、整理客厅等环节。
而墨奇智能则在分层架构基础上,进一步调整了System 1和System 2的边界。
它提出的 Agentic-Native 路线,过去主要由 System 2 负责的目标维护、任务记忆和进度追踪,被进一步下沉到直接控制机器人行动的 System 1 中。
也就是说,机器人不仅在执行动作,同时也能理解自己当前处于任务的哪个阶段。
此外,墨奇智能还在System 1内部构建了三层记忆
  • 短期:处理毫秒级的控制连续性;
  • 中期:管理步骤级的执行状态;
  • 长期:保留任务整体的目标与进度。
这样一来,机器人整理房间时,不需要每完成一步都重新询问「下一步是什么」,而是在执行过程中持续知道,房间还没有整理完成,桌面已经处理过,衣服还需要继续收拾。
第二条路径让机器人「记得更多」,则是建立统一状态,让记忆成为机器人的认知闭环,以贝塔无限为代表。
贝塔无限提出 BetaMem 全时空多模态记忆具身大脑架构,拥有长期记忆、实时记忆、情景记忆、空间记忆、程序记忆等多个记忆模块。
记忆参与机器人工作的全流程,Agent、VLA 以及世界模型可以共享同一份持续更新的认知状态,使记忆不仅用于保存过去,还能参与当前决策。
机器人搭载最新发布的 BetaWAM 0.1 模型,已经能自主完成 10 分钟以上的移动操作任务,面对十分杂乱的客厅,形态各异的物品,可以基于记忆中对物体材质、表面特性的判断实时调整抓取策略。
更关键的是,它给记忆加上了「判断和理解」能力。
比如,乐高块被书本挡住时,系统没有因为「目标从视野消失」就判定任务结束,而是结合遮挡前的位置和当前变化形成假设,移开书本再抓取。
过去的观察形成状态判断,状态影响下一步行动,行动产生新的反馈,新反馈再验证或修正原来的判断,由此形成一个闭环。
这正是长程任务的关键,执行任务,不能只靠当前画面,还需要把过去信息和当前状态结合起来。
第三条路径,则是 VLA 和世界模型融合型,比如,千寻智能采用了 VLA 与世界模型一体化架构,让机器人边理解边行动。
Spirit v1.6 将视觉感知、语言理解、动作生成与世界状态预测纳入统一训练,机器人不再「先想再做」,而是「边感知、边决策、边调整」,在任务过程中不断根据环境变化调整策略。
在这一架构中,Agent 负责理解长期目标和任务上下文,例如将整理客厅拆解为多个子任务并跟踪进度。感知与导航系统负责建立空间理解和移动规划。
基座模型则结合语言指令、视觉信息和机器人状态生成具体动作。
机器人 Moz1 只需要一句整理客厅的指令,就能自主完成所有动作,就算中途被其他临时任务干扰,也没有僵住,而是重新判断当前状态,处理完临时任务之后,又接着回去完成先前任务。
回看几家公司的解法,虽然路径不同,各有侧重,却在补同一块短板,怎么让机器人在较长的时间里,始终保持对任务状态的掌控。

长程任务,重新定义机器人的竞争标准

从「会做动作」到「能把事情做完」,是具身智能走向真实应用必须跨越的一道关键门槛。
正如墨奇智能黄青虬所言:「长程任务能不能完成意味着企业复杂系统的构建能力,同时也意味着系统是稳定的。」
结合前面梳理的技术难点和技术路径也能看出,一台机器人想连续做完 20 分钟的长程任务,实际上要把感知、记忆、规划、执行、纠错、再规划多个环节整套链路协同运转,比拼的是整套智能闭环的综合能力。
具体来说,机器人得持续记住自己走到哪一步,时刻感知环境的变化,抑制误差的累积,并且在某一步失败之后,还能做出准确判断、及时纠错,甚至重新规划整条路径。
整条链路环环相扣,任一模块失效,都可能会直接导致任务中断。
因此,衡量长程任务能力的标准,也不能只是机器人能够运行多久。
任务时长只是最直观的指标,更重要的是机器人能不能稳定完成任务,包括任务成功率、异常恢复能力、人工介入频率。
前段时间,很受人关注的 Figure 机器人长达几十个小时的直播分拣,一定程度上证明了机器人的泛化能力,但仔细看,也都是「单一重复任务」,离长程复杂任务链还有一定距离。
真正落地到产业所需要的可靠性,是换一个房间、换一批物体,无论任务多复杂,系统依然能理解目标并稳定执行。
一次 20 分钟一镜到底的 Demo,只是证明机器人具备完成任务的可能,但要真正进入家庭,还有更长的工程验证过程。
产业落地真正需要的,不是机器人偶然完成一次任务,而是在第 100 次、第 1000 次面对复杂任务时,依然保持稳定表现。
而能不能完成长程复杂任务,也决定了机器人不再是被一条条指令临时唤醒的机械工具,而是能在长任务里持续存在,清楚自己「在做什么、做到哪了、接下来该干嘛」的智能体。
硬件能力的提升,比如更强的电机、更轻的关节、更便宜的传感器,是渐进的、可以按参数表预期的。
但长程任务能力的突破,考验的是整个系统架构能不能撑住时间维度上的复杂性,一旦真正跑通,带来的会是任务边界的整体扩展。
跨过这一关,具身智能才算真正开始展现它的「智能」所在。
回到行业现状,我们看到,整体节奏正在回归理性,人形机器人全面入户的时代短期内不会到来,但第一批具备「准长程」能力机器人已经出现。
距离它们能在第 100 次任务里依然表现稳定,或许还有很长的路,但这条路的起点,已经踩下去了。
未来机器人之间的竞争,不再只是比谁能完成一个动作,而是谁能在真实世界里持续把事情做好。

点击文末「阅读原文」参与案例征集。

本文为星河频率原创文章,作者:李沐蓉,如需转载,请联系授权。违规转载法律必究。
0

0

分享

好文章,需要你的鼓励

参与评论

相关评论(共0条)

Copyright ©2019-2026 深圳市星河频率机器人信息科技有限公司 版权所有

备案号:粤ICP备2025456896号