机器人如何自进化,乐享科技走了一条新路 作者|Li Yuan 编辑|郑玄 最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出 ,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并 将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型 。 自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了 变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变 成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该 被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行 业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被 谨慎对待的判断。 近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭 载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食 材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断 、需求临时增加和场景变化。 在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现 的过程并非每一步都顺利。 机器人完成了部分自主烧烤操作,也出现了停顿、失败和重新调整。 乐享科技似乎并不回避这些不完美:它想展示的重点,不是机器人在 一个固定流程里零失误地把烧烤做完,而是任务和环境发生变化之后 ,机器人能否继续寻找信息、调整动作,再把任务推进下去。两个机 器人本体全程互相传递任务信息、自主思考决策并合理分工协作。 图片:https://imgslim.geekpark.net/uploads/image/file/85/ee/ 85ee4f1d1825ca3252671c9912d9a068.jpg 一场直播当然不能回答关于「自进化」的所有问题,但这种展示方式 至少体现出一种相对开放的态度:机器人可以失败,真正需要观察的 是失败之后会发生什么。 对机器人来说,「自进化」不能只是一个好听的词。它至少要回答三 个问题:第一,机器人能不能发现现实和自己预测之间的偏差;第二 ,它能不能判断哪些经验值得留下、哪些应该忘掉;第三,它能不能 把一次任务、一个场景和一具身体上的经验,迁移到新的任务、场景 和身体上。 当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化, 或许是下一个时代最重要的问题。 为此,我们和乐享科技背后的团队聊了聊他们的模型思路。 01 不是更会模仿, 而是能不能理解真实世界 过去几年,具身智能最常见的思路,是把视觉、语言和动作连接起来 :机器人看到环境,接收任务,再输出动作。这条路线的价值很直接 ,它让机器人可以借助大规模数据学习人的示范,也让复杂指令开始 有机会落到具体行动上。 但在乐享科技团队看来,这种从输入到动作的映射仍然存在一个根本 限制:它擅长回答「下一步应该做什么」,却未必真正理解「为什么 要这样做」,以及这个动作会给真实世界带来什么后果。 团队将 VLA 的局限概括为「不懂因果」,将传统 world model 的问 题概括为「可生成、不可执行」。按照这一判断,前者更接近从已有 数据中学习动作规律,但这并不自然等于理解动作与结果之间的因果 关系;后者可以预测世界可能如何变化,却不代表预测出的未来一定 能够被机器人的关节、力矩和控制系统实现。 图片:https://imgslim.geekpark.net/uploads/image/file/bb/85/ bb855f845b1e0626274ba8e167238710.png 真实世界恰恰不是一组干净的输入输出。接触力、摩擦、滑动、遮挡 、物体形变以及目标临时变化,都会让同一个动作产生不同后果。一 个杯子的质量增加一倍,关节需要输出的力矩就应该随之变化;液体 重心不断移动,机器人也不能只是机械复现某条既定轨迹。画面上「 看起来合理」,与身体上「真的做得到」之间,还有很长一段距离。 这解释了乐享科技为什么没有把重点继续放在动作预测上。 按照团队在采访中的描述,以太大模型是一个由世界状态、内部状态 和能量状态耦合而成的动力系统。感知、预测和行动仍然存在,但并 不是三个依次调用的独立模块,也不是一个从输入直接吐出动作的黑 盒。团队更愿意把它称为「energy-driven state transition」,即 由能量驱动的状态转移。 这里的「能量」不是机器人电池还剩多少,相关负责人把它形容为一 个 landscape,一张贯穿系统的评价地形:哪些状态值得靠近,哪些 状态应该舍弃,当前还缺少什么信息,以及接下来应该把计算和注意 力放在哪里,都在这张地形中被共同衡量。 这让感知本身也变成了任务的一部分。机器人不再只是被动接收摄像 头传回来的画面,而是带着问题寻找答案:为了继续行动,我还需要 看到什么?当前视角能否消除不确定性?是否应该先移动身体、改变 观察位置,再决定下一步动作?团队将其称为具有「感知意图」的主 动感知。 这套思路可以从乐享科技展示的「太极宗师」任务中得到更直观的理 解。在这一任务里,机器人左手需要控制杯中液体不洒,右手同时维 持另一个物体稳定。液体状态、外部扰动和关节状态都在持续变化, 很难依靠一条固定动作轨迹完成。按照团队的解释,系统需要建立动 作、物理状态与结果之间的因果关系,并根据后果不断调节控制。 这并不能单独证明机器人已经拥有完整的物理直觉,但它至少揭示了 乐享科技想用以太大模型解决的问题:真正困难的不是生成下一个看 起来正确的动作,而是让动作在一个不断变化、会反过来影响机器人 的物理世界里成立。 从模仿动作走向理解行动后果,是这条路线的第一层变化。它也为「 自进化」提供了前提:如果机器人无法识别现实与预测的差异,就无 从知道自己错在哪里,更谈不上从错误中形成新能力。 02 自进化不是一句口号, 而是一套闭环机制 那么,乐享科技为什么认为 Aether 可以「自进化」?在采访中,我 们把问题进一步落到了模型内部:机器人执行任务时,变化的究竟只 是瞬时状态和记忆,还是策略乃至模型权重? 乐享科技给出的回答是,这些层级都会更新。按照团队的解释,他们 所说的「自进化」,首先发生在执行过程中的预测误差修正,但并不 止于一次性的状态调整。 机器人在行动前形成预测,执行后观察结果,再比较真实结果与原有 预测之间的偏差。如果世界已经不再是刚才以为的样子,系统就需要 更新内部状态,判断原计划是否失效,再进行局部或全局的重新规划 。这个过程不是任务失败后才启动的补救措施,而是伴随每一次行动 持续发生。 面对临时改变的目标,系统会重新判断原有计划是否仍然适用,并生 成新的动作:「我现在看到的世界,还是我刚才认为的世界吗?」从 预测、执行、反馈、更新到再次行动,系统始终处在循环之中。 在 demo 中,机器人需要处理一块有污渍的玻璃。它发现污渍并不在 自己面对的这一侧,而在玻璃外侧,于是改变原来的处理方式,把手 伸向窗外继续擦拭。正是体现这一点。 这与传统意义上的 action prediction 有一个明显区别。后者更关 心在当前输入下输出什么动作;按照乐享科技的说法,Aether 则会 同时维护世界状态、任务状态和系统自身状态。一次行动之后,变化 的不只是机械臂的位置,也可能包括短期经验、技能参数,以及系统 对某种因果规律的判断。 图片:https://imgslim.geekpark.net/uploads/image/file/a8/4a/ a84ac291635aacbea50bfde641f303f8.jpg 长时序任务由此成为一个重要观察点。团队提到,乐享科技已经展示 过一镜到底的连续任务,机器人需要理解步骤之间的先后关系,记住 已经完成到哪里,并能在中途改变目标或中断后继续执行。单个动作 是否准确当然重要,但更难的是,在持续变化的过程中保持对「当前 世界是什么样」「任务进行到哪里」「下一步为什么这样做」的统一 理解。 只是,能够根据反馈调整,还不等于能够持续学习。在线学习最大的 风险,是把偶然扰动当成规律,把错误经验写进模型,甚至在学会新 东西时破坏原有能力。 按照乐享科技的介绍,以太大模型不会让所有新经验直接进入长期知 识。系统会先评估一次经验是否可靠、是否新颖、能否归因、能否泛 化,再决定它值不值得改变已有知识。换句话说,学习能力的一半, 是知道什么应该学;另一半,是知道什么不该学。 与之配套的是分层记忆。越具体、越依赖单一场景的状态,生命周期 越短,任务结束后就可以被清除;越抽象、经过反复验证的规律,保 留时间越长,可能进入世界模型和因果模型。 图片:https://imgslim.geekpark.net/uploads/image/file/35/34/ 3534dc728958ddab717f363f5af33dde.jpg 模型是否真的会「调参」,是区分临场适应与自进化的关键。对此, 团队明确表示,经过筛选和验证的经验也可能进一步影响模型权重, 并被长期保留;如果只是某个场景下的临时状态,则不会永久写入模 型。也正因为更新可能从记忆和策略继续进入参数层,乐享科技才把 这套机制称为「自进化」。不过,这里仍然需要保留一个边界:目前 我们得到的是团队对内部机制的解释,权重如何变化、变化幅度多大 ,以及新能力能否稳定保留,还需要更具体的测试结果来呈现。 数据的角色也因此发生变化。真人视频被用于理解人的行为逻辑、推 测意图和构建认知,类似一种预训练;示教视频负责把认知落到可执 行动作上,被团队形容为「给机器人上幼儿园」;真实运行数据使用 得最少,却承担最重要的 reality calibration,也就是让机器人在 真实环境里接受检验。 团队还有一个更形象的说法:机器人可以给自己做「错题本」。真正 有价值的不是记住某一次失败,而是从失败中分离出可以复用的规律 ,在下一次面对相似但并不完全相同的任务时调用它。 这也解释了为什么泛化性是判断自进化是否成立的关键。如果所谓学 习只能留在原来的任务和原来的机器人上,它更像一次局部调参;只 有当经验能够穿过场景和本体差异,才可能真正成为更一般的能力。 图片:https://imgslim.geekpark.net/uploads/image/file/c9/b9/ c9b92eeaec3b75e399b2fd63a293a62f.jpg 据相关负责人介绍,以太大模型已经在约五家不同机器人本体上积累 经验,涉及双臂、双足和轮式形态。不同本体在关节数量、自由度、 末端执行器、质量分布、控制方式以及传感器布局上都有差异。迁移 到新机器人时,团队通常希望获得 URDF、关节名称和传感器配置, 以完成运动学对齐、传感器标定、动力学参数辨识和进一步微调。 以太大模型之所以能真正实现「一脑多形」,关键在于:接入一个全 新本体后,它能够通过自主探索认知该本体的性能差异、关节限位等 约束,并据此生成适配不同本体的动作与轨迹来完成任务。由此,模 型完成了对本体的自我认知与适配,进而实现软硬件解耦。 控制系统同样体现了这种分工。团队所称的 200Hz 以上频率,覆盖 的是状态读取、控制器计算和关节指令更新;高层感知和推理并不以 同一个固定频率运行,而是根据任务复杂度与当前不确定性调整周期 。当高层推理需要更长时间时,主动感知反而可能变得更频繁,以获 得更多信息。 因此,乐享科技所说的自进化,并不是机器人突然拥有了自我意识, 也不是一个简单的端到端黑盒,而是一组更综合的工程机制:主动获 取信息,根据预测误差调整行动,筛选值得学习的经验,把不同层级 的经验存入不同记忆,再尝试将较稳定的规律迁移到新任务和新身体 上。 03 如果机器人真的能自进化, 那就是 next level 过去的机器人更像被训练好的执行机器。它可以把规定动作做得越来 越精准,但任务之外的经验很难沉淀;它可以被部署到现场,部署后 的反馈却未必会变成长期能力;它也可以更换场景和身体,但每一次 迁移常常近似重新开始。 乐享科技借以太大模型所提出的观点,不只是让机器人完成更多工作 ,而是让部署本身成为学习过程。机器人进入真实世界之后,不再只 是消耗训练阶段获得的能力,也可能在一次次行动中校准对世界的理 解,把可验证的经验逐渐变成新的能力。 最近围绕 GPT-6 的讨论,也让许多人重新思考下一代模型的跃迁会 来自哪里。人们关心的已不只是参数是否更大、推理是否更强,还包 括模型能否在更长周期中积累经验、形成记忆,并在持续交互中改变 自己的能力边界。落到机器人身上,这个问题会变得更具体,也更严 格,因为每一个判断最终都要接受物理世界的检验。 如果具身智能只是从指令走向动作,它仍然是一种更复杂的自动化。 但如果机器人能够在行动中发现偏差,在反馈中筛选经验,在记忆中 沉淀规律,并把这些规律带到新的任务和身体上,那么它就不只是「 更会干活」,而是开始具备某种生长性。 当然,关于「自进化」,乐享科技需要回答的还有很多:泛化能够跨 越多大的任务差异,学习可以持续多久,模型变化如何被量化,新能 力能否在不同机器人上稳定复现,以及长期运行后如何证明旧能力没 有退化。 但目前所展示出的能力已经把问题向前推了一步。衡量机器人的方式 ,或许将不再只有「它现在会做什么」,还要加上一句:「它做完之 后学会了什么?」 一旦机器人真的能够把现实世界里的经历变成可积累、可验证、可迁 移的能力,它改变的就不只是某个 demo、某家公司或某条技术路线 。那意味着机器人不再只是被制造、被训练、被部署的机器,而可能 成为一种能够在世界中持续获得经验的行动系统。 那确实是具身智能真正的 next level。 *头图来源:乐享科技 本文为极客公园原创文章,转载请联系极客君微信 geekparkGO 极客一问 你认为下一代模型的跃迁会来自哪里? 图片:https://imgslim.geekpark.net/uploads/image/file/4c/9c/ 4c9cde8a6845d3e2f92a5350ad2f137d.gif 图片:https://imgslim.geekpark.net/uploads/image/file/e3/a9/ e3a9261dda62437bbbb3d868113042a5.gif