7月15日,小米正式发布并开源具身领域首个统一生成模型Xiaomi-Robotics-U0(下称“U0”)。该模型参数量达380亿,首次将多项具身世界建模能力与通用图像生成能力统一到一套多模态自回归架构中,为机器人训练数据的生成、迁移和扩增提供统一底座。
机器人训练高度依赖包含场景、物体、动作和空间关系的大规模数据,但真实世界的数据采集长期面临成本高、周期长的瓶颈,也很难覆盖不同光照、背景、物体组合和机器人本体。
过去,应对不同类型的数据,通常需要调用不同模型分别生成。U0的核心突破在于,将通用图像生成能力与具身世界建模能力统一到一套多模态自回归架构中,覆盖四类核心任务,贯通了“生成场景—迁移轨迹—扩展环境—生成交互过程”的数据生产链路。
这四项能力具体包括:具身场景生成,根据文本描述,为指定机器人生成桌面、厨房、仓库等环境下的多视角初始观测;具身迁移,将已有机器人轨迹迁移至新环境,在改变光照、背景、材质或物体的同时,保持机械臂姿态、动作轨迹和场景布局一致;机器人交互视频生成,根据初始观测和操作指令生成后续视频,兼顾动作连贯性和物理一致性;通用文生图与图像编辑,保留通用视觉生成与编辑能力,将互联网视觉知识迁移到具身智能任务中,扩充训练数据的场景和物体类型。
真机测试显示,经过U0生成的数据训练后,机器人即使到了从未见过的环境,也能更好地完成任务,平均完成进度提升26.3%。
需要注意的是,给机器人“造”数据,和普通的AI画图有本质区别:画面不仅要逼真,更要与真实采集的动作轨迹严格对齐——同一个物体在不同相机视角下的位置必须几何一致,机械臂的姿态不能因为换了背景而错位,否则生成的数据无法用于训练。
为此,U0提出五维解耦结构化控制范式,将机器人工作场景拆分为工作台布局、操作物体、无关物体、光照和背景五个维度。每个维度都可以通过自然语言独立调整,修改前景、背景或光照的同时,尽量保持机械臂姿态、空间结构及多视角关系不变。

WorldArena 榜单,UNIS 为 Xiaomi-Robotics-U0 匿名评测代号(榜单时间2026年7月15日),在全球共126个模型中位列第一
在由清华大学、北京大学等机构联合打造的具身智能权威评测基准WorldArena上,U0获得73.64分,综合性能排名全球第一;指令遵循、交互质量和视角一致性三个子项也全部位列第一;可控性得分达到91.60,3D准确性达到92.04。
效率层面,U0提出FlashAR+高速推理加速方案,结合对角并行解码与高效的缓存调度技术,能够将一张可用高清训练图片(1024×1024分辨率)的生成时间从原来的7.5分钟(450.77秒)极限压缩至5.44秒,效率提升82.9倍。这一突破为具身训练数据的低成本、规模化生产提供了工程基础。机器人训练团队因而能够在更短时间内,批量生成覆盖不同背景、光照、物体和机型的训练数据。
小米人形机器人在真实工业场景中的落地也迎来快速迭代。7月14日,小米披露了旗下人形机器人在汽车工厂“实习”的最新进展,经过4个月的不断迭代,小米机器人在自攻螺母上件工站的双侧作业成功率从90.2%提升至98%,距离人工作业合格率仅差1个百分点。与此同时,还解锁了两项全新“实习”岗位——中控台侧盖板排序和料箱折叠回收,两项任务成功率均已达到90%。
(文章来源:国际金融报)