通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话

行情中心

指数期指期权个股板块排行新股基金港股美股期货外汇黄金自选股自选基金

数据中心

资金流向主力排名板块资金个股研报新股申购转债申购北交所申购 AH股比价年报大全融资融券龙虎榜限售解禁 IPO审核大宗交易估值分析

首页 > 财经频道 > 正文

通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话

2025年01月28日 19:41

作者：罗亦丹

来源：新京报

2人评论

小中大

东方财富APP

方便，快捷

手机查看财经快讯

专业，丰富

一手掌握市场脉搏

手机上阅读文章

提示：

微信扫一扫

分享到您的

朋友圈

　　在东方财富看资讯行情，选东方财富证券一站式开户交易>>

　　新京报贝壳财经讯（记者罗亦丹）1月28日，阿里云通义千问开源全新的视觉模型Qwen2.5-VL，推出3B、7B和72B三个尺寸版本，并已在魔搭社区、HuggingFace等平台开源。

　　其中，旗舰版Qwen2.5-VL-72B在13项权威评测中的得分领先GPT-4o与Claude3.5。新的Qwen2.5-VL能够更准确地解析图像内容，支持超1小时的视频理解，无需微调就可变身为一个能操控手机和电脑的AI视觉智能体（Visual Agents），实现给指定朋友送祝福、电脑修图、手机订票等多步骤复杂操作。

　　Qwen2.5-VL识别和定位马路上骑摩托车未戴头盔的人。官方供图

　　通义团队此前曾开源Qwen-VL及Qwen2-VL两代模型，而新的Qwen2.5-VL视觉知识解析能力实现了飞跃，如准确识别和定位马路上骑摩托车未戴头盔的人，或是以多种格式提取发票中的核心信息并做结构化的推理输出。其视频理解能力也得到了增强，可以在视频中搜索具体事件，并对视频的不同时间段进行要点总结，打开摄像头，用户就能与Qwen2.5-VL实时对话。

　　开发者基于Qwen2.5-VL也能开发属于自己的AI智能体，如自动核验快递单地址与照片中的门牌号是否对应，根据家庭摄像头判断猫咪状况进行自动喂食，自动进行火灾报警等。

（文章来源：新京报）

文章来源：新京报责任编辑：6

原标题：通义开源视觉理解模型Qwen2.5-VL可操控手机、视频通话

郑重声明：东方财富发布此内容旨在传播更多信息，与本站立场无关，不构成投资建议。据此操作，风险自担。

东方财富网

分享到微信朋友圈

打开微信，

点击底部的“发现”

使用“扫一扫”

即可将网页分享至朋友圈