千问又出新模型了!Qwen3-VL-Seg 解锁像素级开放世界分割!

lxiol

原文链接:https://mp.weixin.qq.com/s/P4jLvLDuCvupIC_bMZ9tpQ

基于MLLM的分割方法你了解哪些?

图片

开放世界分割

基于MLLM的分割方法你了解哪些?LISA靠SAM、Text4Seg靠文本,Qwen3-VL-Seg靠自己

多模态大语言模型已经有了开放世界视觉基础能力,能看懂图像、回答问题、甚至用边界框定位你问的目标。

但问题来了:边界框太粗糙了,不足以用于密集的视觉预测。

你要把那个穿红衣服的人抠出来,如果模型把人连同背景一块框进去,这在机器人抓取、精细图像编辑等场景下,根本不够用。

那能不能让MLLM直接输出像素级掩码?现在的两条路都有硬伤。

要么依赖SAM,虽然效果好,但参数爆炸、部署复杂、推理慢。要么直接预测稀疏的轮廓坐标,但边界模糊,精细结构保不住。

我们能否在不依赖重型外部分割模型的情况下,将MLLM的开放世界基础能力转化为像素级的指代分割?

阿里通义实验室最新开源的 Qwen3-VL-Seg,将MLLM从框级基础扩展到像素级指代分割。

不靠外部模型,只用0.4%的额外参数搞定开放世界分割,在封闭集和开放世界场景中均表现出强大的性能。

一、框不是终点,而是起点

MLLM 预测的边界框不是随便画的,它包含了丰富的语义和空间信息。

那能否把边界框当作一个结构性先验,告诉模型目标大致在这里,请精细分割。

Qwen3-VL-Seg 基于这个想法,设计了一个轻量级、由边界框引导的掩码解码器,实现了四步从粗到细的解码策略:

1. 多尺度空间特征注入:丰富密集预测需要的中间视觉特征。

2. 空间-语义查询构建:把框的几何信息和语言特征融合成一个对象查询。

3. 边界引导的像素融合:注入细粒度纹理、抑制背景杂乱。

4. 迭代掩码感知查询精炼:第一遍掩码的结果反馈回去,逐步锐化边界。

除了模型的优化外,就是训练数据。要让模型学会开放世界分割,光靠RefCOCO那几千张图远远不够。

团队基于SAM的训练数据 SA-1B 构建了一个超大规模数据集 SA1B-ORS,包含两个互补子集:

一个面向类别的指代,比如所有的猫;一个面向描述性的实例级指代,比如左边那只戴项圈的金毛。并从简单到复杂的多样化指代类型。

二、指令越复杂,效果越明显

为了真正检验模型的开放世界能力,团队采用域内和域外两种类型样本进行了全面的测试。

域内包含单实例、多实例、短语、描述性四种指令,域外专门探测模型的极限,包括极端尺度、复杂指令、严重遮挡、恶劣光照、类别偏移等场景。

测试过程中发现当指令从简单的”分割车”变成复杂的”分割左边第三辆被树影遮挡的红色轿车”时,Qwen3-VL-Seg 的优势被显著放大。

最终在指代表达分割、视觉基础、开放世界分割等多个任务上,Qwen3-VL-Seg 都有不错的结果:

封闭集:在RefCOCO系列上达到SOTA;开放世界:在语言密集型指令上优势明显;OOD泛化:可处理极端遮挡、复杂光照场景。

三、开放世界分割

在开放世界分割中有一项任务蛮有趣的,这里我们再聊下,就是对话式图像分割。

与指代表达分割不同,对话式图像分割中的提示可能需要进行功能、关系或物理推理,从而可以回答意图导向的问题。

图片

比如上图中哪些行李箱可以拿走而不会弄乱堆叠?哪里可以安全存放刀具?针对不可见的属性,哪些是很烫的物体?

这项任务就避免不了具备细粒度分割能力的多模态大模型来解决了,在之前的文章中也有介绍过采用SAM+QwenVL可以实现上述任务。

那 Qwen3-VL-Seg 能否给出了一个更简洁而有力的方案呢?具体可查看原论文:

1
`开源地址:https://arxiv.org/pdf/2605.07141`

最后,小伙伴们可留言回复‘加群’进入大模型交流群、视觉应用落地交流群!

想涨知识,点击下方卡片,关注码科智能!

//

开放世界分割大模型文章推荐

SAM+QwenVL联手,对话式图像分割来了!

分割界的万能钥匙?一个模型搞定图像+视频七种分割任务

CV被大模型解决了?腾讯开源VLM:十余种视觉和多模态任务全拿下!

点个“小爱心”吧

图片


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 千问又出新模型了!Qwen3-VL-Seg 解锁像素级开放世界分割!
  • 作者: lxiol
  • 创建于 : 2026-06-25 19:41:09
  • 更新于 : 2026-06-30 17:05:34
  • 链接: https://blog.lxiol.cn/2026/06/25/千问又出新模型了Qwen3-VL-Seg-解锁像素级开放世界分割/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
千问又出新模型了!Qwen3-VL-Seg 解锁像素级开放世界分割!