高德地图ABot具身智能体系完成全栈升级

chq123 2026-08-01 07:14 阅读数 4581 #科创经济

从“单点技能”到“体系进化”——高德ABot具身智能迎来全栈升级。这一次,高德一次性发布5款模型,在17项权威基准中拿下SOTA,并把“身随眼动、手脚并用、过目不忘”的能力,装进同一套自进化技术体系。

核心看点:

1.身随眼动——ABot-N1 仅靠普通地图+RGB相机完成城市级自主导航,室外成功率92.9%,5项基准SOTA

2.手脚并用——ABot-M0.5 让机器人边走边干,复杂任务领先第二名20.4%,4项基准SOTA

3.过目不忘——ABot-ER与AgentOS构建终身记忆系统,5项记忆基准全部刷新世界纪录

在具身智能的探索中,我们常面临一个共同的困境:为什么大模型已经能生成逼真的3D世界、能规划复杂的任务链,却很难让一台机器人在真实城市的人行道上稳定走完一公里,或者在家里连续完成"找到杯子、接水、端过来"这样一个简单的三步操作?

因为物理世界不是一道题,而是一场持续的考试。单点能力再强,不能闭环就无法交付;单次表现再好,不能积累就无法进化。行业长期聚焦于单模型突破——更好的导航模型、更强的操作模型、更聪明的推理模型——但它们各自为政,数据不互通、经验不共享、能力不复用。这本质上是一个体系问题:机器人需要的不是更多零件,而是一个完整的、会自我进化的有机体。

今天,高德宣布 ABot 具身体系完成全栈升级,一次性发布 ABot-N1、ABot-M0.5、ABot-ER、ABot-AgentOS、ABot-C0 五款模型,并在 17 项权威基准中拿下 SOTA。作为全球首个全栈具身技术体系,ABot 将世界模型、基座模型与具身 Agent 架构耦合为一个高度协同的“有机生命体”——五款模型分别对应机器人的“脚、手、脑、中枢和运动神经”,并以“身随眼动、手脚并用、过目不忘”的里程碑,推动具身智能从“局部技术提升”迈向“体系化跃迁”。

ABot-N1:让机器人“身随眼动”

机器人想进入开放世界,第一步是“走进去”。但常规导航地图是为人类设计的:路线哪怕画在机动车道上,人凭常识也能安全通行。机器人没有这种细粒度空间常识,传统方案只能依赖专门采集的高精地图,成本高、扩展慢,也无法应对真实环境的动态变化。

ABot-N1 作为通用导航基座模型,要做的正是让机器人像人一样“身随眼动”。

它采用快慢双系统架构:慢系统负责长程逻辑推理,快系统负责实时控制。当导航出现偏差时,模型会基于慢系统的正确推理,将控制权回退到视觉判断。同时,ABot-N1 首创像素级思维链,把每一步决策同时输出为自然语言推理链与像素级标注,让“为什么这样走”变得可追溯、可沉淀。

(ABot-N1开放环境全自主导航克服定位偏差)

这意味着机器人只需普通 RGB 相机和 SD 路网,就能完成城市级长程自主导航。评测显示,ABot-N1 在点位导航、目标导航、指令跟随、兴趣点导航与人物跟随五大任务上均领先同类模型,室外导航成功率达到 92.9%,并在 R2R-CE、HM3D-OVON、ABotN-PointBench、ABotN-POIBench、EVT-Bench 等 5 项权威基准取得 SOTA。

在产品演示中,ABot-N1 展现出的不只是一条规划路线:它可以识别可通行区域与禁行区域,理解红绿灯与交通规则,在人群中动态避障,在狭窄空间与楼梯场景中自主重规划,并稳定跟随主人穿越城市公共空间。它不是在执行导航,而是在理解世界。

ABot-M0.5:让机器人“手脚并用”

会走之后,机器人还要“会干活”。真实场景中的长程任务,从来不是站在原地完成一次抓取,而是移动、感知、操作在极细时间粒度上的协同。传统模型把“移动”和“操作”线性串联,底盘与机械臂互相干扰,视线一被遮挡、动作偏了几毫米,后续就全盘崩溃。

ABot-M0.5 作为通用操作基座模型,连接了“能动”与“能干”。

它将机器人运动与操作拆分为两条独立动作流,使二者互不干扰;同时引入帧级隐式动作,让让机器人“眼、手、脚”在更细的时间颗粒上实时对齐,真正像人一样能够手脚并用。

(ABot-M0.5全自主进行移动操作)

更关键的是,ABot-M0.5 采用“梦境自愈”训练机制:训练中让模型基于自身预测的含噪视觉画面继续生成动作,自己学会在偏差中找平衡,从根本上解决“一步错、步步错”。

146dc104-85c2-11f1-90a1-92fbcf53809c.png

这让机器人在 LIBERO、RoboTwin、RoboCasa365 等 4 项权威基准上均取得 SOTA。在 RoboCasa-365 测试中,复杂任务领先前代 SOTA 20.4%,基础任务领先 10.6%,呈现出越难越强。

视频中,ABot-M0.5 完成了从桌面环境感知、精准抓取、倒茶操作到服务递送的完整闭环,像人一样边走边干。

ABot-ER 与 ABot-AgentOS:让机器人“过目不忘”

当机器人拥有了“身随眼动”与“手脚并用”的能力,还需要一个顶层大脑——具身Agent架构来统一调配。其组成包括具身大脑ABot-ER与执行中枢ABot-AgentOS。

ABot-ER 负责从感知到行动的全流程判断,让机器人超越单纯视觉判别,真正“想明白”物体、空间与任务之间的关系。ABot-ER 取得 3 项 SOTA,并登顶数十家机构联合发布的 Embodied Arena 2D-EQA。

而 ABot-AgentOS 则进一步把“想明白”转化为“做得到”。

AgentOS 将规划、调用、执行与验证从机器人本体中解耦,通过插件式 Skill 接入不同本体,使同一套系统能够适配人形、四足、轮式等异构机器人。更重要的是,它具备跨任务、跨时间的多模态终身记忆系统:基于任务失败轨迹定向优化记忆存储结构,把每一次执行中的成功、失败和纠错都转化为下一次可复用的经验。

在产品演示中,AgentOS 的能力被完整呈现:它可以理解自然语言指令,主动查询时间与天气,在多轮对话中持续保持上下文;接收到新任务后,机器人独立出发,通过 Point Goal 导航抵达指定区域,利用 Verifier 核验目标人员与场所,在遮挡环境中调用 Memory 重新发现目标,最终返回用户身边完成交付。

这类复杂长程任务的完成,靠的不是单点能力,而是 ER 与 AgentOS 构成的智能体架构——它让机器人从“做完即忘”走向“越用越聪明”,是ABot体系实现闭环自进化的核心。

由ABot-C0运控系统组成的"运动神经",是实现模型能力外化的最后一环。该模型通过构建四足机器人统一的行为基座,将ABot体系的每一个决策,稳稳传导到机器人动作上。

ABot的自进化能力,实现了从底层世界模型到顶层Agent架构的全栈智能涌现,让机器人像人类积累知识一样,在各个成长阶段皆能展现出高度统一的通用型智能。未来,ABot将持续深入基础探索,融入更多形态的机器人,让它们在真实开放的世界中持续学习、自然演进。

热门