栏目分类
你的位置:亚博(中国)yabo官方网站-登录入口 > 新闻 > 亚博官方网站由 VLM 评估与重采样-亚博(中国)yabo官方网站-登录入口
发布日期:2026-03-26 12:56 点击次数:99

IT之家 1 月 23 日音问,何如将视觉语⾔基础模子(Vision Language Models, VLMs)应⽤于机器⼈以已毕通⽤操作是具身智能范围的⼀个核⼼问题,这⼀⽬观点已毕受两⼤关节挑战制约:
VLM 枯竭精准的 3D 理会能⼒:通过对⽐学习范式测验、仅以 2D 图像 / ⽂本算作输⼊的 VLM 的自然局限;
⽆法输出低眉目动作:将 VLM 在机器⼈数据上进⾏微调以获取视觉 - 语⾔ - 动作(VLA)模子是⼀种有出路的搞定⽅案,但⽬前仍受到数据汇集资本和泛化能⼒的戒指。

上海智元新创技能有限公司官方本日发文称,北⼤携⼿智元机器⼈团队建议 OmniManip 架构,基于以对象为中⼼的 3D 交互基元,将 VLM 的高眉目推贤达商滚动为机器⼈的低眉目高精度动作。
针对⼤模子幻觉问题和真确环境操作的不笃定性,OmniManip 引⼊了 VLM 筹画和机器⼈抓⾏的双闭环系统策画,已毕了操作性能冲破。当今亚博官方网站项⽬主⻚与论⽂已上线,代码与测试平台行将开源。

IT之家从智元机器东说念主官方获悉,OmniManip 的关节策画包括:
基于 VLM 的任务确认:利⽤ VLM 强⼤的知识推理能⼒,将任务解析为多个结构化阶段(Stages),每个阶段明确指定了主动物体(Active)、被迫物体(Passive)和动作类型(Action)。
以物体为中⼼的交互基元算作空间不停:通过 3D 基座模子⽣成任务考虑物体的 3D 模子和挨次化空间(canonical space),使 VLM 大略径直在该空间中采样 3D 交互基元,算作 Action 的空间不停,从⽽优化求解出 Active 物体在 Passive 物体挨次坐标系下的⽬标交互姿态。
闭环 VLM 筹画:将⽬标交互姿态下的 Active / Passive 物体渲染成图像,由 VLM 评估与重采样,已毕 VLM 对⾃身筹画恶果的闭环谐和。
闭环机器⼈抓⾏:通过物体 6D 姿态追踪器及时更新 Active / Passive 物体的位姿,调度为机械臂结尾抓⾏器的操作轨迹,已毕闭环抓⾏。
此外,OmniManip 具备通⽤泛化能⼒,不受特定场景和物体戒指。团队已将其应⽤于数字金钱⾃动标注 / 合成管说念,已毕⼤范围的机器⼈轨迹⾃动采集。该斟酌团队将开源泛化操作⼤范围数据集和对应的仿真评测基准。
据IT之家此前报说念,以“天才少年”身份加入华为的稚晖君于 2022 年底文牍下野,创业智元机器东说念主。2024 年 9 月 3 日,智元机器东说念主完成 A++++++ 轮融资,估值已进步 70 亿元,获取了包括北汽、上汽、比亚迪在内的国内汽车巨头复旧。
当今,智元机器东说念主量产的第 1000 台通器用身机器东说念主已于本月(1 月 6 日)崇拜下线,其中包括 731 台双足东说念主形机器东说念主(远征 A2 / 灵犀 X1)和 269 台轮式通用机器东说念主(远征 A2-D / A2-W)。
告白声明:文内含有的对外跳转伙同(包括不限于超伙同、二维码、口令等形势),用于传递更多信息,从简甄选时间,恶果仅供参考,IT之家系数著述均包含本声明。
]article_adlist-->
声明:新浪网独家稿件,未经授权贬抑转载。 -->
上一篇:没有了
Powered by 亚博(中国)yabo官方网站-登录入口 @2013-2022 RSS地图 HTML地图
