阿里云发力视频大模型:通义万相升级为2.1版本全面开放使用
2025年01月09日 17:12
作者: 罗亦丹
来源: 新京报
东方财富APP

方便,快捷

手机查看财经快讯

专业,丰富

一手掌握市场脉搏

手机上阅读文章

提示:

微信扫一扫

分享到您的

朋友圈

  新京报贝壳财经讯(记者罗亦丹)1月9日,阿里云通义万相携2.1版本升级杀入了视频生成大模型的竞技场,并在权威评测集VBench上登顶。此次升级,通义万相在大幅度复杂运动、物理规律遵循、艺术表现等方面全面提升。

  版本升级后,新版的通义万象在视频生成领域的权威评测集VBench登上榜首位置,超越混元、海螺AI、Gen3、Pika等国内外视频生成模型。具体来看,VBench一共有16个评分维度,而通义万相在运动幅度、多对象生成、空间关系等关键能力上拿下最高分,最终以总分84.7%的成绩斩获第一。

  目前,精准理解和模拟物理世界是当下视频生成模型的核心难题,现有模型生成的视频在大幅运动、物理复杂场景表现较差,容易生成肢体扭曲、违背物理定律的视频。针对这一难题,通义万相团队采用自研VAE和DiT架构,有效增强了时空上下文关系建模能力。

  在DiT的设计中,全新通义万相使用时空全注意机制,这一机制让模型能够更准确地模拟现实世界的复杂动态;团队还引入了参数共享机制,不仅提升了模型的性能,还有效降低了训练成本;此外,针对文本的嵌入进行优化,实现更优的文本可控性的同时也减少了计算需求。

  在视频VAE方面,通义万相设计了一种创新的视频编解码方案。通过将视频拆分成若干块(Chunk)并缓存中间特征的方式,代替直接对长视频的E2E编解码过程,实现显存的使用与原始视频长度无关,从而能够支持无限长1080P视频的高效编解码,这一关键技术为任意时长视频的训练提供了新的路径。

  在全新架构下,通义万相在大幅度的肢体运动和肢体旋转场景的视频生成上表现更稳定,即便是花样滑冰、游泳、跳水等运动视频也能保持肢体协调并符合正常运动轨迹。通义万相在文字视频生成上实现了突破,成为首个支持中文文字生成能力、且同时支持中英文文字特效生成的视频生成模型,可满足广告设计、短视频等领域的创作需求。

  上图为用户输入“平拍一位女性花样滑冰运动员在冰场上进行表演的全景。她穿着紫色的滑冰服,脚踩白色的滑冰鞋,正在进行一个旋转动作。她的手臂张开,身体向后倾斜,展现了她的技巧和优雅”后,通义万相生成的内容。

  目前,该模型已全面开放,用户可在通义万相官网直接免费使用,个人开发者和企业用户可在阿里云百炼调用通义万相API。

(文章来源:新京报)

文章来源:新京报 责任编辑:126
原标题:阿里云发力视频大模型:通义万相升级为2.1版本全面开放使用
郑重声明:东方财富发布此内容旨在传播更多信息,与本站立场无关,不构成投资建议。据此操作,风险自担。
举报
分享到微信朋友圈

打开微信,

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈

扫描二维码关注

东方财富官网微信


扫一扫下载APP

扫一扫下载APP
信息网络传播视听节目许可证:0908328号 经营证券期货业务许可证编号:913101046312860336 违法和不良信息举报:021-61278686 举报邮箱:jubao@eastmoney.com
沪ICP证:沪B2-20070217 网站备案号:沪ICP备05006054号-11 沪公网安备 31010402000120号 版权所有:东方财富网 意见与建议:4000300059/952500