通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话
新京报贝壳财经讯(记者罗亦丹)1月28日,阿里云通义千问开源全新的视觉模型Qwen2.5-VL,推出3B、7B和72B三个尺寸版本,并已在魔搭社区、HuggingFace等平台开源。
其中,旗舰版Qwen2.5-VL-72B在13项权威评测中的得分领先GPT-4o与Claude3.5。新的Qwen2.5-VL能够更准确地解析图像内容,支持超1小时的视频理解,无需微调就可变身为一个能操控手机和电脑的AI视觉智能体(Visual Agents),实现给指定朋友送祝福、电脑修图、手机订票等多步骤复杂操作。

Qwen2.5-VL识别和定位马路上骑摩托车未戴头盔的人。官方供图
通义团队此前曾开源Qwen-VL及Qwen2-VL两代模型,而新的Qwen2.5-VL视觉知识解析能力实现了飞跃,如准确识别和定位马路上骑摩托车未戴头盔的人,或是以多种格式提取发票中的核心信息并做结构化的推理输出。其视频理解能力也得到了增强,可以在视频中搜索具体事件,并对视频的不同时间段进行要点总结,打开摄像头,用户就能与Qwen2.5-VL实时对话。
开发者基于Qwen2.5-VL也能开发属于自己的AI智能体,如自动核验快递单地址与照片中的门牌号是否对应,根据家庭摄像头判断猫咪状况进行自动喂食,自动进行火灾报警等。
(文章来源:新京报)
网友评论
郑重声明:
1.根据《证券法》规定,禁止编造、传播虚假信息或者误导性信息,扰乱证券市场;2.用户在本社区发表的所有资料、言论等仅代表个人观点,与本网站立场无关,不对您构成任何投资建议。用户应基于自己的独立判断,自行决定证券投资并承担相应风险。
《东方财富社区管理规定》
热门评论
查看全部评论
全部评论
最新
最热
最早
基民2579w18U27
2025-02-05 07:09:56
来自 河南
ds成本低和其是单模态文字大模型有关,多模态大模型的成本肯定比文字大模型高几个数量级
置顶
删除
举报
评论
点赞
两刀屠龙
2025-01-28 20:56:36
来自 安徽
开始洗脑了
置顶
删除
举报
评论
点赞
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
- 11
- 12