当前位置:首页 > 元宇宙 > AI

阿里通义千问推出 Qwen2-VL:开源 2B 7B 参数 AI 大模型,处理任意分辨率图像无需分割成块

来源: 责编: 时间:2024-09-02 17:19:13 21观看
导读 8 月 30 日消息,通义千问团队今天对 Qwen-VL(视觉语言、Vision Language)模型进行更新,推出 Qwen2-VL。Qwen2-VL 的一项关键架构改进是实现了动态分辨率支持(Naive Dynamic Resolution support)。与上一代模型 Qwen

8 月 30 日消息,通义千问团队今天对 Qwen-VL(视觉语言、Vision Language)模型进行更新,推出 Qwen2-VL。E6328资讯网——每日最新资讯28at.com

Qwen2-VL 的一项关键架构改进是实现了动态分辨率支持(Naive Dynamic Resolution support)。与上一代模型 Qwen-VL 不同,Qwen2-VL 可以处理任意分辨率的图像,而无需将其分割成块,从而确保模型输入与图像固有信息之间的一致性。这种方法更接近地模仿人类的视觉感知,使模型能够处理任何清晰度或大小的图像。E6328资讯网——每日最新资讯28at.com

E6328资讯网——每日最新资讯28at.com

另一个关键架构增强是 Multimodal Rotary Position Embedding(M-ROPE)。通过将 original rotary embedding 分解为代表时间和空间(高度和宽度)信息的三个部分,M-ROPE 使 LLM 能够同时捕获和集成 1D 文本、2D 视觉和 3D 视频位置信息。这使 LLM 能够充当多模态处理器和推理器。E6328资讯网——每日最新资讯28at.com

E6328资讯网——每日最新资讯28at.com

在 7B 规模下,Qwen2-VL-7B 保留了对图像、多图像和视频输入的支持,以更具成本效益的模型大小提供“具有竞争力”的性能。E6328资讯网——每日最新资讯28at.com

E6328资讯网——每日最新资讯28at.com

Qwen2-VL-2B 模型针对潜在的移动部署进行了优化。尽管参数量只有 2B,但官方表示该模型在图像、视频和多语言理解方面表现出色。E6328资讯网——每日最新资讯28at.com

E6328资讯网——每日最新资讯28at.com

附模型链接如下:E6328资讯网——每日最新资讯28at.com

Qwen2-VL-2B-Instruct:https://www.modelscope.cn/models/qwen/Qwen2-VL-2B-InstructE6328资讯网——每日最新资讯28at.com

Qwen2-VL-7B-Instruct:https://www.modelscope.cn/models/qwen/Qwen2-VL-7B-InstructE6328资讯网——每日最新资讯28at.com

本文链接://www.dmpip.com//www.dmpip.com/showinfo-45-6597-0.html阿里通义千问推出 Qwen2-VL:开源 2B 7B 参数 AI 大模型,处理任意分辨率图像无需分割成块

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: AI 行业风光背后:80% 项目会失败,5 大原因导致

下一篇: OpenAI 和 Anthropic 同意推出新模型前交给美国政府评估安全

标签:
  • 热门焦点
Top
Baidu
map