通义实验室
25-05-20 11:05 微博认证:通义大模型官方微博

今天来复习一下Qwen2.5-VL技术报告
Qwen2.5-VL是Qwen模型家族的旗舰视觉语言模型,主要特点如下:
1️⃣感知更丰富的世界:擅长识别常见物体,还能够分析图像中的文本、图表、图标、图形和布局。
2️⃣Agent:直接作为一个视觉 Agent,可以推理并动态地使用工具,初步具备了使用电脑和使用手机的能力。
3️⃣理解长视频和捕捉事件:能够理解超过 1 小时的视频,通过精准定位相关视频片段来捕捉事件。
4️⃣视觉定位:Qwen2.5-VL 可以通过生成 bounding boxes 或者 points 来准确定位图像中的物体,并能够为坐标和属性提供稳定的 JSON 输出。
5️⃣结构化输出:对于发票、表单、表格等数据,Qwen2.5-VL 支持其内容的结构化输出,惠及金融、商业等领域的应用。
#通义##Qwen# http://t.cn/A6gKdcR4

发布于 浙江