2026 年开年的第一天,一场特别的机器人比赛,在广州塔 450 米高的户外观景平台举行。
赛道并不长,却并不好走。
112 级弧形旋转阶梯垂直攀升 10 米,台阶高度存在细微差异,再叠加高空户外环境带来的风阻,11 支参赛队伍需要操控双足人形、多足、轮式等不同形态的机器人完成登高。
最终,普渡机器人的轮式四足机器狗 PUDU D5 用时 13 秒 01 率先登顶,拿下轮式四足机器人组冠军和最佳技术创新奖。
13 秒、112 级台阶、450 米高空,这些数字很快成为传播焦点。
但是当这些能力离开比赛和展台,进入工业厂区、电力设施、消防救援等更加复杂的真实环境,它还能不能像在赛道上一样稳定地完成任务?
8 月 19 日,PUDU D5 出现在世界机器人大会(WRC 2026)的舞台上。不同的是,这一次普渡想展示的,不再只是机器狗能跨过怎样的障碍。
在普渡的展台上,楼梯、砂石、窄道被浓缩进一条复杂环境自主通行路线,背后所指向的,则是工业、电力、消防等真实作业场景。
事实上,这也是普渡过去几年不断拓宽的边界。从最早被大众熟悉的机器人、商用清洁机器人、工业配送机器人,再到如今 PUDU D5 开始进入的复杂环境,机器人拥有了越来越多的身体,也被放进越来越不同的现实世界。
然而,随着机器人越来越多、场景越来越复杂,它们是否还需要各自从头学习?那些散落在不同机器人、不同场景里的经验,又能不能最终汇入同一个「大脑」?
机器人最难学会的,
是人类不需要计算的「直觉」
在这次世界机器人大会的普渡展台上,机器人面对的是一条被刻意「制造麻烦」的路线。
二层结构里,楼梯、砂石、窄道被集中放在一起。
PUDU D5 需要在没有人工实时操控的情况下,自主感知周围环境、规划路线,穿过砂石区域,再完成上下楼梯和狭窄空间通行。
真正值得关注的,并不是 PUDU D5 能不能爬上一级台阶,而是面对一个不断变化的物理世界,它究竟知不知道下一步应该怎么走。

因为真实世界最麻烦的地方,恰恰在于没有标准答案。
人类走到湿滑地面会下意识放慢脚步,端起一杯水时知道不能突然倾斜,搬起一个箱子时会根据重量调整姿势。
我们几乎不会计算摩擦系数、重力或者运动轨迹,但长期与物理世界交互形成的经验,早已把这些判断变成一种「直觉」。
对于机器人而言,这些人类不需要计算的「直觉」,反而是最难学会的东西。
过去几年,大模型让机器人越来越擅长「看懂」世界。VLM 能够理解视觉信息,VLA 进一步把视觉、语言和动作连接起来。
但从「看见」到「行动」之间,其实还缺少重要的一环:如果这样做,接下来会发生什么?
机器人可以知道眼前是一只杯子,却未必理解杯子倾斜之后水会洒出来;可以识别一块湿滑表面,却未必知道抓取或者行走时应该调整力度。
普渡将这种能力的缺失称为「物理直觉缺口」:机器人能够看到物体,却不一定真正理解可达性、可操作性以及动作背后的物理约束。
这也是普渡在其具身智能大模型 PuduFM 中引入 PIM 物理直觉模型的原因。
与单纯预测未来画面不同,PIM 采用因果注意力 Transformer,在潜空间中建模物体运动和物理交互。
它并不追求把未来世界的每一个像素都生成出来,而是试图抓住真正影响机器人行动的物理状态变化。
简单来说,PIM 想让机器人在真正行动之前,多问自己一句:「如果我这么做,会发生什么?」
这是一个很重要的变化。
如果说 VLA 更多解决的是「我应该做什么」,那么 PIM 进一步解决的是「我这么做是否合理」。普渡也因此把 PIM 与 VLA 结合:前者承担物理推理和预测,后者负责多模态理解与动作生成,让机器人逐渐形成从感知、预测到执行的完整链路。
但这种「直觉」同样不可能凭空长出来。
为此,普渡给 PuduFM 设计了预训练、仿真强化和真实世界微调三阶段训练体系,并把真实环境中的人工介入重新转化为模型持续修正的数据。
于是,真实世界对于机器人的意义也开始发生变化。
对于一台真正需要长期工作的机器人而言,现实世界既是它最终工作的地方,也是它永远无法毕业的训练场。
从自主行动到解决问题,
需要越过几道「坎」?
拥有「物理直觉」,并不意味着机器人就能够真正把工作做完。现实世界对机器人的考验,往往是一环扣一环。
到了工业、电力、消防这些环境里,一台机器人首先要能够自己抵达任务地点,然后找到真正的异常,最后还要尽可能完成处置。任何一环掉链子,所谓的「智能」都很难转化成真正的生产力。
所以,PUDU D5 真正要越过的第一道坎,是「到得了」。
这听起来简单,却是很多自动化设备的天然边界。
过去大量机器人之所以能够稳定工作,一个重要前提是环境足够规整:地面平整、路线固定,甚至需要提前改造场地。但工业、电力、消防不会为了机器人重新设计现场。
面对楼梯、斜坡、崎岖路面和临时障碍,机器人必须反过来适应环境。PUDU D5 采用轮腿式形态,本质上也是在效率和通过性之间寻找平衡:平整路面可以快速移动,遇到台阶和复杂地形,则依靠腿部完成跨越。
但「到得了」只是开始。第二道坎,是「看得懂」。
巡检并不是让机器狗按照固定路线走上一圈,再拍几张照片回来。
到了电力场景,它需要关注设备温度、仪表状态、异常声源;进入工业车间,又要识别异常发热、泄漏以及有毒有害气体。

这也是工业巡检真正困难的地方。环境越复杂,不确定因素越多,而巡检最终的价值并不是完成路线本身,而是及时发现异常。
也就是说,PUDU D5 既要理解「路在哪里」,还要知道「问题在哪里」,机器人由一个移动底盘,开始变成能够持续感知现场的智能终端。
于是,第三道坎随之出现:发现问题之后,能不能进一步「把事情解决」?
从能力来看,PUDU D5 并不是一个固定功能的产品,更像是一套可以根据任务改变能力的作业平台。
进入电力场景,可以通过机械臂完成阀门操作和物品抓取;面对工业环境,可以搭载不同感知设备完成风险检测。
进入消防场景,PUDU D5 又可以根据任务搭载水炮、脉冲灭火、惰性气体灭火等专业模块,让人员留在相对安全的位置,由机器人抵近危险区域完成处置。
PUDU D5 本身也采用开放式扩展设计,可搭载不同外围设备适配巡检、运输等任务。
从「到得了」,到「看得懂」,再到「解决问题」,这三道坎其实勾勒出了 PUDU D5 真正想解决的问题。
它并不是为了证明四足机器人比轮式机器人或者人形机器人更高级。
恰恰相反,PUDU D5 说明的是另一件事:
现实世界如此复杂,本来就很难存在一种适合所有任务的身体,而当机器人需要跨过楼梯、砂石和斜坡,进入那些人员受限甚至存在风险的区域时,四足形态才显现出它独特的价值。
一脑多形,或许是具身智能
「通用」更现实的答案
过去几年,人形机器人快速升温,「像人」一度成为通用机器人的重要想象。
但真正进入商业世界之后,另一个现实也越来越明显:并不是所有工作,都需要一台「像人」的机器人。
具身智能所谓的「通用」,可能从一开始就存在两种不同的答案:
一种是寻找一个足够通用的身体,让一台机器人完成尽可能多的任务;另一种则是身体保持专业化,但让不同身体背后的「大脑」逐渐通用。
普渡选择的是后者。这也是普渡「一脑多形」技术理念真正值得讨论的地方。
它并不是简单地把 PUDU D5、PUDU D7 以及配送、清洁机器人放在同一个产品矩阵里,而是试图解决具身智能行业长期存在的另一个问题:
过去不同形态的机器人,往往拥有各自独立的模型、软件和数据体系。
做一台配送机器人要开发一套能力,换成清洁机器人又重新开发,进入工业场景再来一次。不同产品之间看似属于同一家公司,背后的智能却可能是一座座彼此隔离的「孤岛」。
普渡也将这种不同构型之间模型和数据相互割裂的问题,称为具身智能走向通用的一道「构型鸿沟」。
「一脑多形」要做的,恰恰是把身体和智能逐渐拆开。
按照普渡提出的 Physical Agent 架构,一台机器人可以被拆成「本体+系统+技能」三个层次。
其中,本体决定机器人以什么方式进入物理世界:PUDU D5 负责复杂地形,PUDU D7 面向工业作业,PUDU D9 进一步探索更加通用的人机协作。
PuduAgent OS 则像机器人的中枢,负责理解任务、拆解任务、调用能力以及管理记忆。
再往下,PuduFM 负责环境理解、物理预测和动作执行。
普渡今年推出 PuduAgent 时,也将其定义为连接认知、记忆、执行与安全的统一具身智能基础设施。
这样一来,机器人行业过去「一种产品对应一套智能」的开发逻辑,就有机会发生变化。
比如过去在配送场景里积累的导航能力,不必永远停留在配送机器人身上;
进入清洁、工业乃至新的机器人形态之后,一部分能力可以通过统一模型继续迁移和复用。
普渡的 PuduFM 已经试图让配送、清洁、工业以及人形等不同机器人共享同一个「大脑」,其 PIM 与 VLA 结合的架构也原生支持异构硬件。
从这个角度看,「一脑多形」真正试图降低的,其实是具身智能规模化的边际成本。
因为具身智能要真正进入成百上千种商业场景,不可能每进入一个行业、每换一种身体,都重新从零训练一套模型、重新开发一套软件。
如果过去机器人产业的扩张方式是「多一种机器人,就多开发一套系统」,那么未来更理想的状态应该是:底层智能越来越通用,身体和技能根据任务灵活组合。
但真正决定这套体系能不能成立的,还不是架构画得有多漂亮,而是「大脑」究竟有没有足够多的现实经验。
这恰恰让普渡过去十年的商业化积累有了新的意义。截至目前,普渡累计出货超过 13 万台,业务进入 85 个以上国家和地区。
根据普渡披露的数据,每年还在产生数千万小时的真实导航和操作数据。
过去这些数字更多意味着销量、客户和市场规模;到了 Physical AI 阶段,它们同时意味着大量持续与物理世界发生交互的数据入口。
于是,「一脑多形」真正的飞轮才开始出现:
更多身体进入更多场景,产生导航、操作、交互以及异常纠正数据;
这些数据继续训练共同的「大脑」;大脑能力提升之后,又可以赋予更多机器人,让它们进入新的场景。
这也意味着,普渡所说的「场景智能」,并不是单纯让一台机器人变得更聪明,而是让场景本身开始成为智能持续生长的土壤。
当 PUDU D5 在复杂地形里获得的经验、配送机器人在餐厅里学会的导航、清洁机器人在商场里遇到的人流,以及 PUDU D7 在工厂里完成的一次作业,最终都有机会沉淀进同一个「大脑」,所谓「一脑多形」才真正从一个产品架构,变成一种具身智能的进化方式。
所以,具身智能真正的「通用」,或许从来不只有「造出一个万能的人形机器人」这一条路。
身体可以继续千差万别,各自去做最适合自己的工作;但真正需要越来越通用的,是身体背后的智能大脑。
而这,或许才是「通用」更现实的一种答案。












参与评论
请您注册或者登录汽车之心社区账号即可发表回复
去登录
相关评论(共0条)
查看更多评论