AI从数字世界走向物理世界 世界模型驱动物理AI“原生觉醒”
2026年07月19日 11:02
来源: 上观新闻
东方财富APP

方便,快捷

手机查看财经快讯

专业,丰富

一手掌握市场脉搏

手机上阅读文章

提示:

微信扫一扫

分享到您的

朋友圈

  2025年,世界模型从学术概念走向产业风口。2026年,AI开始从数字世界走向物理世界,而世界模型被学界视为实现这个目标最核心的“操作系统”或“大脑”之一。何为世界模型?它的核心是让AI理解并模拟真实世界的运行规律,说得直白点,就是让AI能察言观色,作出合理决策,从而让机器先思考、再行动。

  今年世界人工智能大会期间,世界模型是一个被频频提及的热词。在专家看来,世界模型正驱动物理AI从理解到执行,其价值已渗透到多个核心场景。

  具身智能的“最后一厘米”

  提到世界模型,很多人第一个联想到的是机器人,世界模型也被产业界看作是突破具身智能泛化瓶颈的核心技术。觅蜂科技董事长兼CEO姚卯青在WAIC论坛上指出,世界模型需要掌握三项关键能力:多模态融合理解、物理规律掌握,以及因果推理。

  如何连接这些能力?在WAIC现场,一目科技首次展示了“视触觉”技术。“人类指尖约有1.2万个触觉点,而视触觉技术可达每平方厘米24万个点,远超传统方案。”一目科技项目负责人陈雨晴介绍,视触觉在柔性材料内部建立光学观测系统,当机器人与物体发生接触时,材料产生微米级形变,内置光学系统实时记录变化图像,再通过AI算法还原压力分布、剪切力、纹理、滑移趋势等物理信息。

  “一目科技正在构建的,正是连接物理世界与智能系统之间‘缺失的那一层’,成为世界模型的基础模型提供者。”一目科技创始人兼CEO李智强解释,其底层是视触觉传感器采集真实交互数据;中间层通过数据采集系统和触觉编码模型,将物理交互转化为结构化知识;上层结合虚拟仿真平台,形成“真实世界—数据世界—模型训练”的持续迭代闭环,目前,仿真系统已能与物理世界实现80%—90%的对齐。

  成立仅一年的DaxAI大咖机器人则展示了另一条路径。品牌在现场首发DaxBrain-WM(Dualis)两仪世界模型,是一款专为物理世界原生设计的具身智能中枢。大咖机器人现场负责人认为,“本体即智能”,并为机器人配备“灵巧手”与“全掌触觉”,从而大大降低物理AI的Token消耗。在核心架构上,“两仪”架构让两种智能各司其职,阴模型负责毫秒级感知—动作闭环,阳模型负责“动脑”进行任务分解与多机协同,响应延迟低于50毫秒。目前,这套系统已落地柔性物流自主分拣、柔性力控人机交互、多智能体协同三大商业化能力。

  德勤亚太物理人工智能卓越中心主管合伙人孙晓臻指出,世界模型的仿真闭环有望将具身智能的试错成本降低两个数量级,预计2027年工业仿真可实现商业化闭环。

  工程化能力取得显著进步

  当世界模型从理论走向工程,背后的技术路径并不完全相同,但中国厂商在工程化能力和应用场景方面已取得显著进展。

  “今天最聪明的人工智能本质上仍是‘缸中之脑’,未必能真正理解物体的位置、空间关系与可操作性,也难以在持续变化的环境中边行动、边接收反馈、边及时调整。”腾讯首席科学家张正友说。针对这一问题,WAIC期间,腾讯Robotics X实验室、福田实验室联合腾讯混元发布3项具身智能系列新模型,首次系统性打通“感知—身体—行动”的闭环。记者注意到,腾讯的3款模型各司其职:Hy-Embodied-VLM-1.0像“右脑”,负责理解图像、空间和场景;Hy-Embodied-RxBrain-1.0像具身“大脑”,把“会推理”与“会想象”统一起来,一边给出语言步骤,一边生成每一步的目标图像;Hy-Embodied-VLA-0.5连接“小脑”和身体,通过超1万小时人类示教数据训练,在第三方评测中拿下仿真综合排名第一。

  在此之前,蚂蚁集团旗下蚂蚁灵波也发布业界首个具身原生世界动作模型LingBot-VA 2.0。与行业常见的“视频生成模型微调”路线不同,该模型从零开始预训练,专为机器人与真实环境交互设计。蚂蚁灵波首席科学家沈宇军用“开门见猫”的例子揭示了两种路线的根本分歧:一扇磨砂玻璃门后有一只猫,数字世界的视觉理解中,猫清晰可见,但对机器人而言,从物理空间感知的角度,那只猫不应该存在。“数字世界和物理世界的需求天然不一样。数字世界希望画质高、有想象力;但物理世界更重要的是快,是合理。”LingBot-VA 2.0采用严格的因果自回归架构——先有因、后有果,与真实世界的物理规则完全一致,目前已适配17家厂商的20余种机器人构型。

  生成式AI和决策式AI的交汇点

  当然,世界模型并不仅仅用在具身智能上,而是渗透到多个核心场景。高盛在7月最新报告中称,世界模型可能成为未来AI基础设施需求的第二引擎。物理世界模型将支撑机器人、物流、自动驾驶和工业设计,社会世界模型则会被用于战略推演、投资决策、治理压力测试和政策情景分析等。

  以自动驾驶为例,英国自动驾驶公司Wayve的GAIA-1和特斯拉FSD都在构建世界模型,让汽车能够预测其他车辆的变道轨迹和动作,从而根据因果联系作出反应。在这种方式下,汽车不需要再依赖高精地图。视频生成和游戏领域也是世界模型的“兵家必争之地”。今年以来,中国厂商在该领域的布局明显提速,字节Seedance 2.0就属于视觉世界模型,能够根据当前帧预测未来帧,阿里云发布的HappyOyster也是一款可实时构建与交互的世界模型产品,支持1分钟连续实时位移和3分钟以上高清画面生成。

  WAIC论坛上,京东集团副总裁、京东探索研究院副院长段楠介绍了近日开源的全球首个全栈实时视频视觉语言交互模型。他透露,该模型能对持续视频流做实时理解,通过自主交互满足用户需求。京东也在探索实时视频编辑模型,支持超过30FPS对流式视频的实时编辑能力。段楠认为,这类技术不仅是视频生成发展的重要方向,也为未来在具身智能领域做大规模数据合成提供了底层技术积累。

  有专家认为,世界模型正在成为生成式AI和决策式AI的交汇点。过去,生成式AI主要关注内容创作,强化学习主要关注决策执行,而世界模型可用生成能力构建仿真环境,并在其中训练决策,或将成为“AI通往物理世界”的一大“关键战役”。

(文章来源:上观新闻)

文章来源:上观新闻 责任编辑:143
原标题:AI从数字世界走向物理世界,世界模型驱动物理AI“原生觉醒”
郑重声明:东方财富发布此内容旨在传播更多信息,与本站立场无关,不构成投资建议。据此操作,风险自担。
举报
分享到微信朋友圈

打开微信,

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈

扫描二维码关注

东方财富官网微信


扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500