分享好友 资讯首页 频道列表

北大等联合研发ω-0模型,让人形机器人“边走边做”成现实

2026-08-13 23:435080

家庭场景被视为检验人形机器人技术实力的终极考场。相较于工厂内结构化、可预测的流水线作业,家庭环境存在大量非确定性变量:杂乱堆放的物品、动态变化的家具布局、需要多步骤协同的操作任务,这些因素共同构成了机器人技术落地的天然屏障。例如,从冰箱取物时需侧身避开障碍物,清洁桌面时需同步调整身体姿态与工具位置,这些对人类而言简单的动作,对机器人系统却需要突破感知、决策与执行的协同瓶颈。

针对这一技术难题,由多所高校及研究机构组成的联合团队近日提出创新解决方案——隐空间预测世界动作模型ω-0。该模型通过整合语言指令、环境感知与本体状态信息,直接生成底层控制系统可解析的精简动作特征,实现"移动-操作"同步进行的全身动态协同。在包含跨区域收纳、高低位清洁等11项典型居家任务的测试中,其第一视角模式成功率达79.1%,全场景模式更突破81.8%,性能指标全面领先现有主流模型。

传统机器人系统普遍采用"先定位后操作"的分阶段策略,这种模式在连续作业场景中暴露出明显缺陷。以清洁大尺寸桌面为例,机械臂达到工作极限后必须移动身体,但移动过程中需持续保持清洁工具与接触面的有效互动;拖地作业时,手臂施力变化会直接影响身体平衡,要求腿部实时调整支撑重心。现有系统的独立决策机制往往导致动作衔接卡顿、接触中断甚至倾倒风险,难以满足家庭场景的连续作业需求。

ω-0模型的创新性体现在架构设计与训练体系的双重突破。研发团队摒弃了传统的视频-动作逆向映射路径,转而构建基于查询的统一表征框架。该架构通过未来视觉特征提供任务进程与场景演变的宏观指引,动作分支直接生成全身运动潜在指令,实现感知-决策-执行的全链路贯通。为提升模型对真实场景的适应能力,团队设计了三阶段递进式训练方案:首阶段进行全身动作的视觉语言模型预训练;次阶段融合视觉、语言与本体数据,通过视频查询预测环境动态变化;最终阶段引入海量真实居家操作数据,完成场景自适应的精细化调优。

支撑这项技术突破的,是一个包含40.3小时真实环境数据的大型开源数据集ω-HOME。该数据集涵盖4827条任务轨迹与24类典型操作,每条轨迹均同步记录语言指令、多视角视觉信息、本体状态及全身运动数据。这种多维度的数据采集方式,有效降低了下游任务训练对人工示范数据的依赖,为行业提供了可复用的技术基础设施。

尽管81.8%的任务成功率标志着重要技术进展,但家庭机器人的实用化仍面临多重挑战。真实场景中的光照变化、物体遮挡、突发干扰等不可预测因素,对系统的鲁棒性提出更高要求。当前研究为行业指明了关键技术路径——将机器人视为统一运动体而非独立部件的组合,这种整体性思维模式或将成为突破实验室演示阶段、迈向生活化服务的关键转折点。

反对 0
举报 0
收藏 0
打赏 0
评论 0
华硕RTX Spark笔记本未发先火,大内存成亮点或引创意人士追捧
华硕RTX Spark笔记本未发先火,大内存成亮点或引创意人士追捧

0评论2026-08-132160

AI赋能“仿生眼”新突破:精准电刺激助力失明者重获视觉希望
AI赋能“仿生眼”新突破:精准电刺激助力失明者重获视觉希望

0评论2026-08-12515

AI科研新突破:Claude挑战黎曼猜想,意外改写数学零点下界纪录
AI科研新突破:Claude挑战黎曼猜想,意外改写数学零点下界纪录

0评论2026-08-121257

蚂蚁百灵Ling-3.0-tiny开源:轻量高效,本地部署开启智能应用新可能
蚂蚁百灵Ling-3.0-tiny开源:轻量高效,本地部署开启智能应用新可能

0评论2026-08-121241

8万级唯一激光雷达智驾!零跑A05上市售价6.39万起
8万级唯一激光雷达智驾!零跑A05上市售价6.39万起

0评论2026-08-121719

埃安全新车系Ray亮相,Ray 7首发,以科技与颜值拥抱年轻市场
埃安全新车系Ray亮相,Ray 7首发,以科技与颜值拥抱年轻市场

0评论2026-08-051679

MirrorCode榜单揭晓:Claude Fable 5登顶,AI编程迈向“项目级委托”新阶段
MirrorCode榜单揭晓:Claude Fable 5登顶,AI编程迈向“项目级委托”新阶段

0评论2026-08-052223

山西发力低空经济新赛道 100座“星际探索”飞行公园绘就产业融合新图景
山西发力低空经济新赛道 100座“星际探索”飞行公园绘就产业融合新图景

0评论2026-08-051862