分享好友 资讯首页 频道列表

北大等联合研发ω-0模型,让人形机器人“边走边做”成现实

2026-08-13 23:436020

家庭场景被视为检验人形机器人技术实力的终极考场。相较于工厂内结构化、可预测的流水线作业,家庭环境存在大量非确定性变量:杂乱堆放的物品、动态变化的家具布局、需要多步骤协同的操作任务,这些因素共同构成了机器人技术落地的天然屏障。例如,从冰箱取物时需侧身避开障碍物,清洁桌面时需同步调整身体姿态与工具位置,这些对人类而言简单的动作,对机器人系统却需要突破感知、决策与执行的协同瓶颈。

针对这一技术难题,由多所高校及研究机构组成的联合团队近日提出创新解决方案——隐空间预测世界动作模型ω-0。该模型通过整合语言指令、环境感知与本体状态信息,直接生成底层控制系统可解析的精简动作特征,实现"移动-操作"同步进行的全身动态协同。在包含跨区域收纳、高低位清洁等11项典型居家任务的测试中,其第一视角模式成功率达79.1%,全场景模式更突破81.8%,性能指标全面领先现有主流模型。

传统机器人系统普遍采用"先定位后操作"的分阶段策略,这种模式在连续作业场景中暴露出明显缺陷。以清洁大尺寸桌面为例,机械臂达到工作极限后必须移动身体,但移动过程中需持续保持清洁工具与接触面的有效互动;拖地作业时,手臂施力变化会直接影响身体平衡,要求腿部实时调整支撑重心。现有系统的独立决策机制往往导致动作衔接卡顿、接触中断甚至倾倒风险,难以满足家庭场景的连续作业需求。

ω-0模型的创新性体现在架构设计与训练体系的双重突破。研发团队摒弃了传统的视频-动作逆向映射路径,转而构建基于查询的统一表征框架。该架构通过未来视觉特征提供任务进程与场景演变的宏观指引,动作分支直接生成全身运动潜在指令,实现感知-决策-执行的全链路贯通。为提升模型对真实场景的适应能力,团队设计了三阶段递进式训练方案:首阶段进行全身动作的视觉语言模型预训练;次阶段融合视觉、语言与本体数据,通过视频查询预测环境动态变化;最终阶段引入海量真实居家操作数据,完成场景自适应的精细化调优。

支撑这项技术突破的,是一个包含40.3小时真实环境数据的大型开源数据集ω-HOME。该数据集涵盖4827条任务轨迹与24类典型操作,每条轨迹均同步记录语言指令、多视角视觉信息、本体状态及全身运动数据。这种多维度的数据采集方式,有效降低了下游任务训练对人工示范数据的依赖,为行业提供了可复用的技术基础设施。

尽管81.8%的任务成功率标志着重要技术进展,但家庭机器人的实用化仍面临多重挑战。真实场景中的光照变化、物体遮挡、突发干扰等不可预测因素,对系统的鲁棒性提出更高要求。当前研究为行业指明了关键技术路径——将机器人视为统一运动体而非独立部件的组合,这种整体性思维模式或将成为突破实验室演示阶段、迈向生活化服务的关键转折点。

反对 0
举报 0
收藏 0
打赏 0
评论 0
OpenAI宣布GPT-5.5模型10月14日下线 用户需尽快切换至替代模型
OpenAI宣布GPT-5.5模型10月14日下线 用户需尽快切换至替代模型

0评论2026-09-162409

优必选超级工厂投产:人形机器人量产启幕,中国智造再攀新高峰
优必选超级工厂投产:人形机器人量产启幕,中国智造再攀新高峰

0评论2026-09-162251

云知声U2-Flash实测:快速完成Agent搭建与大型滑梯建模,表现亮眼
云知声U2-Flash实测:快速完成Agent搭建与大型滑梯建模,表现亮眼

0评论2026-09-161714

GPT-6 Sol即将发布:性能逼近旗舰却成本更低,AI进化再提速
GPT-6 Sol即将发布:性能逼近旗舰却成本更低,AI进化再提速

0评论2026-09-162685

国产MCV模式全球领跑:5公里分辨率10天预报1小时内完成,异构计算显实力
国产MCV模式全球领跑:5公里分辨率10天预报1小时内完成,异构计算显实力

0评论2026-09-16955

从厨房到餐桌的革新:AI手机芯片如何让智能体验“热气腾腾”?
从厨房到餐桌的革新:AI手机芯片如何让智能体验“热气腾腾”?

0评论2026-09-162793

云知声U2-Flash实测:快速构建Agent与3D建模,展现高效生产力新范式
云知声U2-Flash实测:快速构建Agent与3D建模,展现高效生产力新范式

0评论2026-09-162916

魔芯科技新一轮融资或达10亿元,估值近100亿元
魔芯科技新一轮融资或达10亿元,估值近100亿元

0评论2026-09-12655

DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选
DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选

0评论2026-09-122832

AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景
AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景

0评论2026-09-122310