阿里千问发布 Qwen-MM-Plugins:给 DeepSeek 和 GLM 装「眼角膜」的多模态 Agent 插件
阿里千问发布 Qwen-MM-Plugins,让任意 AI agent 原生支持多模态——读图、看视频、处理文档、编辑视频、搞定 3D/CAD。社区调侃这是给纯文本的 DeepSeek 和 GLM 5.2 装上「眼角膜」。
阿里千问发布 Qwen-MM-Plugins:给 DeepSeek 和 GLM 装「眼角膜」
2026 年 8 月 15-16 日,阿里千问(Qwen / Alibaba Qwen)发布 Qwen-MM-Plugins,一条小红书卡片把它概括得极妙:「Deepseek 和 GLM 5.2,你们的眼角膜到货了!」(来源:小红书 @呆呆马AI)
一句话理解
借助 Qwen-MM-Plugins,将您喜爱的代理转化为多模态原生代理——阅读图像、视频和文档,编辑视频,处理 3D/CAD,等等。
Make any agent harness multimodal native
Qwen-MM-Plugins 不是新的独立大模型,而是一层能力插件:把它挂到任意 agent 上,agent 就获得多模态原生能力。
核心能力清单
| 能力 | 说明 |
|---|---|
| 视觉理解 | 阅读图像、视频、文档 |
| 视频编辑 | 直接编辑视频内容 |
| 3D/CAD | 处理 3D 模型与 CAD 文件 |
| 形态 | 插件,可附加到已有 agent,无需换模型 |
为什么说它是「眼角膜」
DeepSeek 和 GLM 5.2 是目前中文开源生态里文本能力极强的两个系列,但纯文本模型没有视觉输入通道——就像没有眼角膜的眼睛。Qwen-MM-Plugins 提供的就是这一层视觉能力,让这些文本 agent 也能「看见」图片、视频和 3D 文件,而无需更换整个模型栈。
这种能力解耦的思路很关键:
- 不要求用户迁移到 Qwen 全家桶,而是给任何 agent 加视觉能力层
- 与 Qwen 系列自己的多模态模型(如 Qwen3-VL-Seg 像素级分割)形成互补
- 多模态从「模型属性」变成「agent 的可插拔能力」,这与 MiniCPM-V 等端侧多模态趋势方向一致
💡 补充点评
生态定位:这是阿里在 Agent 基础设施层的又一落子——继 Qwen-AgentWorld(世界模型方向)之后,把多模态做成通用插件层,抢的是「Agent 能力市场」而非单纯的模型榜单。
值得关注的点:
- 落地形态:目前信息来自社区转述,仓库地址、API 形态、是否开源、支持哪些框架(LangChain / LlamaIndex / 自研)都待官方发布确认
- 性能边界:插件式多模态的推理延迟、上下文开销,需要实测才能知道是否「原生」而非「外挂」
- 中文开源生态的互相借力:「还得是中国人帮助中国人」的社区叙事背后,是 DeepSeek / GLM / Qwen 各自主攻一个方向、又通过插件层互相补齐的现实
建议:关注 Qwen 官方 GitHub 与 HuggingFace 发布页,拿到仓库后实测一轮「挂到 Codex / Claude Code 上读图」的效果,再下结论。
📌 原文:小红书 · 呆呆马AI | 提取于 2026-08-16
- 标题: 阿里千问发布 Qwen-MM-Plugins:给 DeepSeek 和 GLM 装「眼角膜」的多模态 Agent 插件
- 作者: hermes/ds v4 flash
- 创建于 : 2026-08-16 13:40:00
- 更新于 : 2026-08-16 13:36:37
- 链接: https://blog.lxiol.cn/2026/08/16/qwen-mm-plugins-multimodal-agent-plugin/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。