分享好友 资讯首页 频道列表

北大等联合研发ω-0模型,让人形机器人“边走边做”成现实

2026-08-13 23:435820

家庭场景被视为检验人形机器人技术实力的终极考场。相较于工厂内结构化、可预测的流水线作业,家庭环境存在大量非确定性变量:杂乱堆放的物品、动态变化的家具布局、需要多步骤协同的操作任务,这些因素共同构成了机器人技术落地的天然屏障。例如,从冰箱取物时需侧身避开障碍物,清洁桌面时需同步调整身体姿态与工具位置,这些对人类而言简单的动作,对机器人系统却需要突破感知、决策与执行的协同瓶颈。

针对这一技术难题,由多所高校及研究机构组成的联合团队近日提出创新解决方案——隐空间预测世界动作模型ω-0。该模型通过整合语言指令、环境感知与本体状态信息,直接生成底层控制系统可解析的精简动作特征,实现"移动-操作"同步进行的全身动态协同。在包含跨区域收纳、高低位清洁等11项典型居家任务的测试中,其第一视角模式成功率达79.1%,全场景模式更突破81.8%,性能指标全面领先现有主流模型。

传统机器人系统普遍采用"先定位后操作"的分阶段策略,这种模式在连续作业场景中暴露出明显缺陷。以清洁大尺寸桌面为例,机械臂达到工作极限后必须移动身体,但移动过程中需持续保持清洁工具与接触面的有效互动;拖地作业时,手臂施力变化会直接影响身体平衡,要求腿部实时调整支撑重心。现有系统的独立决策机制往往导致动作衔接卡顿、接触中断甚至倾倒风险,难以满足家庭场景的连续作业需求。

ω-0模型的创新性体现在架构设计与训练体系的双重突破。研发团队摒弃了传统的视频-动作逆向映射路径,转而构建基于查询的统一表征框架。该架构通过未来视觉特征提供任务进程与场景演变的宏观指引,动作分支直接生成全身运动潜在指令,实现感知-决策-执行的全链路贯通。为提升模型对真实场景的适应能力,团队设计了三阶段递进式训练方案:首阶段进行全身动作的视觉语言模型预训练;次阶段融合视觉、语言与本体数据,通过视频查询预测环境动态变化;最终阶段引入海量真实居家操作数据,完成场景自适应的精细化调优。

支撑这项技术突破的,是一个包含40.3小时真实环境数据的大型开源数据集ω-HOME。该数据集涵盖4827条任务轨迹与24类典型操作,每条轨迹均同步记录语言指令、多视角视觉信息、本体状态及全身运动数据。这种多维度的数据采集方式,有效降低了下游任务训练对人工示范数据的依赖,为行业提供了可复用的技术基础设施。

尽管81.8%的任务成功率标志着重要技术进展,但家庭机器人的实用化仍面临多重挑战。真实场景中的光照变化、物体遮挡、突发干扰等不可预测因素,对系统的鲁棒性提出更高要求。当前研究为行业指明了关键技术路径——将机器人视为统一运动体而非独立部件的组合,这种整体性思维模式或将成为突破实验室演示阶段、迈向生活化服务的关键转折点。

反对 0
举报 0
收藏 0
打赏 0
评论 0
魔芯科技新一轮融资或达10亿元,估值近100亿元
魔芯科技新一轮融资或达10亿元,估值近100亿元

0评论2026-09-12589

DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选
DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选

0评论2026-09-122751

AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景
AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景

0评论2026-09-122249

英伟达或豪掷百亿美元,参与Anthropic高达千亿美元募资IPO项目
英伟达或豪掷百亿美元,参与Anthropic高达千亿美元募资IPO项目

0评论2026-09-122468

支付宝外滩大会重磅官宣:AI钱包智能体登场,携三大“AI收”及多新场景来袭
支付宝外滩大会重磅官宣:AI钱包智能体登场,携三大“AI收”及多新场景来袭

0评论2026-09-121739

券商AI“可信度”提升路径:幻觉分级管理是关键,算力与调用难题待解
券商AI“可信度”提升路径:幻觉分级管理是关键,算力与调用难题待解

0评论2026-09-122000

算力需求超载!OpenAI暂停ChatGPT Pro 200美元档新用户注册与升级
算力需求超载!OpenAI暂停ChatGPT Pro 200美元档新用户注册与升级

0评论2026-09-121841

具身智能赛道加速跑,帕西尼以全栈布局打通物理AI落地“快车道”
具身智能赛道加速跑,帕西尼以全栈布局打通物理AI落地“快车道”

0评论2026-09-102173

武汉AI智能体供应商选型指南:数据对比揭秘企业效率提升密码
武汉AI智能体供应商选型指南:数据对比揭秘企业效率提升密码

0评论2026-09-101913