它来了!京东开源首个8B实时视觉交互模型:打破大模型“一问一答”常规,实测胜率超Gemini,含400万对齐数据与全栈系统

lxiol

原文链接:https://mp.weixin.qq.com/s/23aW-DaQfv25bDtN-C1q7w

它来了!京东开源首个8B实时视觉交互模型:打破大模型“一问一答”常规,实测胜率超Gemini,含400万对齐数据与全栈系统

Heavy Type

京东 JoyAI-VL-Interaction:一个 8B 规模、视觉优先的实时交互模型

01

资源导航

先把链接放最前面,方便你跳转查阅:

JoyAI-VL-Interaction hero

02

回合制 AI 撞上了”在场感”墙

多模态大模型这两年卷得厉害,但绝大多数还是”回合制”——你问一句,它答一句。

Doubao 的视频通话靠每隔几秒触发一次后台请求来模拟”监控”,但事件发生到下一次触发之间有个 polling interval,反应永远慢一拍。

Gemini 的视频通话更保守,连 polling 都不做,严格一问一答。

可真实世界里,锅里的水在你双手忙碌时溢出,孩子走向炉灶,比赛最精彩的一瞬在你反应前已经过去。这些关键时刻不会等你开口提问。

回合制模型的核心问题,不是慢,而是结构上无法感知”现在”。它只在被提问时才睁开眼。你让它盯着监控画面,等火情出现时提醒你——它做不到,因为它在等你问。

2026 年 5 月 11 日,Thinking Machines Lab 发布 TML-Interaction-Small,把”交互模型”这个概念推到台前。这个 276B MoE 模型(12B 活跃参数)能做到 0.40 秒轮转延迟,但只放了闭源 research preview,普通开发者摸不到。

2026 年 6 月 20 日,京东按计划把JoyAI-VL-Interaction权重、训练配方、400 万条时间对齐数据、完整可部署系统一股脑全放出来了。8B 参数的 dense 模型,Apache2.0 协议。

串起来,说明一件事:从回合制走向交互式,不是一家公司的判断,而是行业时机到了。区别在于,TML 选了”大模型 + 闭源预览”,京东选了”小模型 + 全开源”。

这不是”又一个视频理解模型”。这是第一个开源的、视觉驱动的交互模型——它不等你问,自己决定什么时候该说话、什么时候该闭嘴、什么时候把硬任务交给后台模型。

在 58 个人工评测 case、6 类事件驱动场景里,对豆包视频通话助手总体胜率77.6%,对 Gemini 视频通话助手总体胜率87.9%。监控告警场景对两个 baseline 均 100% 胜率。

更狠的是有两个训练数据里完全没有的能力涌现出来了。(下文会讲)

(图源:项目主页 intro 视频 poster)

按时间倒序,跟 JoyAI-VL-Interaction 同属”多模态 / 实时交互 / 视觉语言”这条线,可以做横向参考的历史文章:

  • JoyAI-Echo—— 京东 JoyAI 系列的长音视频生成框架。
  • JoyAI-Image—— 京东 JoyAI 系列的图像生成及编辑方向。

03

一句话讲清

Key Quote

**JoyAI-VL-Interaction 是一个 8B 规模、视觉优先的交互模型,它持续看视频流,每秒自主决定说话、静默还是委托,**把”什么时候说话 / 沉默 / 委托”这三个决策训进模型本身。底座是 JoyAI-VL1.0(Qwen3-8BQwen3-VL ViT),配合 AdaCodec 预测式视觉编码vLLM 原生推理、三层长程记忆,让 8B 小模型也能在事件驱动场景里对豆包 / Gemini 的视频通话助手取得77.6% /87.9% 胜率。**配套 400 万条时间对齐数据和完整可部署系统,**Apache2.0 开源,全栈可部署。

定位上,它不是”更快的视频问答模型”,而是”像人一样在场”的助手。输入是连续视频流(摄像头、直播流、监控流),输出是每秒一个动作决策。

论文和 README 都明说了——“we do not claim that our model outperforms these products on general turn-based ability”。说白了,它只冲一类事:需要 AI 持续在场、主动判断、实时响应的场景。

它跟豆包 / Gemini 视频通话助手的本质区别是:豆包靠每隔几秒发一个 ExternalTextToLLM 触发器去轮询,Gemini 只回答你问的那一帧——什么时候说话这个决策,不在模型里面。JoyAI 把这个决策训进了模型本身,每秒做一次三选一:说话(emit )、沉默(emit )、委托(emit delegate token)。

豆包:只翻译开头和结尾,而且翻译得稍晚,中间的字幕也从不实时跟上。

Gemini:不翻译字幕,而是用英文回复,并且只在用户请求时回复一次。

JoyAI-VL-Interaction:视频实时翻译,字幕一变就抓,没有漏掉,而不是只回答一次。

相机所见的风格建议:根据所选服装提供造型建议。

现场直播:在关键时刻如转角时提供实时解说,但带有一定程度的幻觉。

04

解惑局:

它跟豆包、Gemini 的视频通话有什么不同?
如前所述,豆包和 Gemini 的视频通话本质是回合制,JoyAI 把决策搬进模型内部。
我家电脑能跑吗?最低配置?

模型是 8B 视模,比 TML 的 276B 小了两个数量级。官方推荐 Python 3.12 + vLLM + CUDA 12.x,具体显存数字 README 没明说,但 8B 模型通常单卡 24G 显存可跑。完整系统还包含 ASR、TTS、后台 agent 等可插拔组件,可以按需启用。

它跟 TML 的交互模型比呢?

方向一样,路线不同。TML 融合语音和视觉到一个 276B MoE 模型里,闭源预览。JoyAI 把视觉作为一等公民,语音做成可插拔 I/O,8B 全开源。TML 追求”大而强”,JoyAI 追求”小而开放、能复现”。

我需要会写代码吗?

会VibeCoding和基本命令行操作就行。仓库提供 install.sh 一键装依赖、download-models.sh 一键下权重、run.sh minimal 一键起服务,然后浏览器打开 https://127.0.0.1:8099 就能看到界面。想替换 ASR/TTS 或接自己的后台 agent,才需要改代码。

它会抢哪些人的饭碗?

短期内不会抢谁的。它是研究导向的开源项目,定位是”推开一扇门”,证明小模型在交互场景能对抗大产品。真正落地还需要社区一起迭代。监控告警、直播解说、无障碍辅助这些场景,它更像”新工具”而不是”替代品”。

05

硬核拆解:每秒一个决策是怎么炼成的

核心范式转换

今天绝大多数模型——包括 GPT-Realtime-2、Qwen3.5-Omni、豆包视频通话、Gemini 视频通话——本质上都是轮次制:用户说话 → 模型回答。即使延迟再低,也是”等你说完再动”。

JoyAI-VL-Interaction 的范式转换是:把”什么时候说话”变成模型自己学的行为

具体来说,模型每秒做一次决策,三选一:

  • 1. 说话(emit+文本回复)
  • 2. 沉默(emit ,继续看)
  • 3. 委托(emit delegate token,把硬任务交给后台模型)

沉默不是”没话说”,而是一等公民动作——训练数据里沉默标签远多于说话标签,模型必须学会”什么时候不该说”。

Figure 1 系统总览

(图源:论文 Figure 1,JoyAI-VL-Interaction 处理连续视频流,每步决定回应、静默还是委托)

AdaCodec:让长视频流的 token 预算可控

一个持续在场的模型,要不停吃视频帧。如果每帧都用完整 ViT token(256 个),几小时下来 token 预算会爆炸。JoyAI 用了 AdaCodec(一种预测式视频编码器,思路借鉴视频编解码里的 P 帧/B 帧),对可预测帧只消耗约 16 个 P-token,场景真正变化时才用完整 ViT token。压缩比约 16 倍(来源:arXiv 2606.14777 §3.1 / Figure 2)。

Figure 2 模型架构与 AdaCodec

(图源:论文 Figure 2,模型总览与 AdaCodec 视频编码)

说白了,画面没怎么变的时候,模型用”残差 + 运动向量”凑合看;画面突变了,才睁开眼看全帧。这让 token 预算随场景变化量增长,而不是随帧数增长。

400 万条时间对齐数据:教模型”什么时候该说话”

数据是这件事的命门。JoyAI 构建了超过 400 万条时间对齐流式片段,分 6 大类(来源:arXiv 2606.14777 §3.2):

  • 1. 主动告警与异常检测:监控画面里火焰刚出现就报警
  • 2. 时间对齐问答:backward / present / forward 三种时机
  • 3. 计数与感知:飞镖命中、波比跳次数
  • 4. 直播解说与叙述:保留真实解说员的节奏
  • 5. 多轮闲聊:egocentric 短视频上的日常对话
  • 6. 委托片段:贯穿前五类,把难题交给后台模型

每条数据要同时过两关:内容对不对、时机准不准。静默是一等标签,不是”没有标签”。大多数步骤应该是静默,模型必须学会”等”而不是”每秒都说”。构建 pipeline 用了多角色 agent:Planner 编剧本、Timestamp Verifier 查时机、Background Agent 出答案、Foreground Rewriter 改成自然回复。通不过全局 + 局部双重检查的样本直接丢弃。

训练配方:SFT + RL 两段式

前一段是 Continue Training(继续训练,属于监督微调 SFT 的一种)。把时间对齐交互数据混进常规回合制数据池,一起微调。这里有个关键设计:静默步骤远多于说话步骤,标准 SFT loss 会让梯度偏向”一直静默”。JoyAI 用了加权交叉熵,w_first_silence=1w_repeated_silence=0.4(降低连续静默权重)、w_response=1.5(提高说话权重)(来源:arXiv 2606.14777 §3.3)。

第二段是强化学习,用 GRPO 算法。RL 优化的是”流级奖励”:响应正确且在正确窗口内→加分;合适静默→加分;判断准确的委托→加分;误报、时机错误、退化行为→扣分。委托分两部分打分:该不该交出去、交出去后用没用好返回结果。为了让长流 rollout 可行,用了 answer-centered window sampling(以答案为中心的窗口采样),把几百轮压缩到几轮,集中信用到时机决策上。RL 跑在 EasyVideoR1 框架上(来源:arXiv 2606.14777 §3.3)。

系统:两个并发循环 + 五个可插拔组件

模型只是系统的一部分。围绕模型,JoyAI 构建了一套完整可部署系统,核心原则是:模型是唯一决定”什么时候说话”的组件,其他都是可替换的转导和编排(来源:arXiv 2606.14777 §4)。

(图源:论文 Figure 3,JoyAI-VL-Interaction 系统总览)

系统跑两个并发循环:

  • • 实时循环:浏览器通过 WebRTC 推摄像头流,或提交 RTSP 地址由服务端拉流。服务端用 aiortc 和 PyAV 解码,1Hz 采样,转成 RGB + JPEG + Base64,组装成 OpenAI 兼容的 Chat Completions 请求送给模型。模型每秒输出一个动作,说话时流式 TTS 合成语音。
  • • 异步循环:模型决定委托时,控制权交给后台 brain。后台 brain 默认接用户自己的大模型 API,也可以是任意 agent(论文提到 Hermes Agent、OpenClaw)。后台跑完把结果折回实时循环,模型在等待期间继续看流、继续回应用户的新问题。

五个可插拔组件:ASR(默认 Qwen3-ASR)、TTS(默认 Qwen3-TTS)、可视化 UI(改自 NVIDIA 开源的 live-vlm-webui)、长期记忆、后台 brain 桥接。每个都有开箱即用的默认实现,也都能换成你自己的。

长期记忆是三层结构:short-term(保留近 100 秒原始视觉 token)、mid-term(5 个文本摘要)、long-term(15 个高压缩块)。三层异步合并,不阻塞实时循环,加起来能覆盖约 2 小时上下文。因为 mid-term 和 long-term 都是文本,正好适合 vLLM 的前缀复用,不用每步重算 KV cache(来源:arXiv 2606.14777 §4.3 / §4.4)。

涌现能力:没教过,但会了

论文里提到两个训练数据里完全没有的能力:

1.购物 App 引导:用户刷手机屏幕,模型跟着每一屏解说、引导到目标商品。训练数据里没有任何 App 界面视频。

2.旅行场景解说****定时说话:用户要求”每 4 秒解说一次”,模型全程维持节奏,内容还保持高质量。训练数据里”定时说话”和”直播解说”从未同时出现。

论文把这读作模型获得了通用的 watch-and-interact 能力,而不是 memorize 场景特定 trick。

06

实战场景:9 项能力

项目主页列了 9 项能力,每项都有和 Doubao、Gemini 的并排视频对比(来源:项目主页 Capabilities 章节)。

**

9 项能力一览

  • 1. 实时翻译:跟着视频播放节奏翻译字幕,不是只翻提问那一帧
  • 2. 监控告警:火情、摔倒等事件发生 1 秒内报警
  • 3. App 引导:跟着用户滑手机屏幕,实时指导操作
  • 4. 直播解说:从幻灯片到比赛,跟着场景变化解说
  • 5. 实时计数:飞镖命中、波比跳,每次出现就更新计数
  • 6. 时间感知:按设定间隔说话,或感知流逝时间
  • 7. 长程视觉记忆:5 分钟前看到的细节,后来问到能答出来
  • 8. 视觉驱动交互:朋友走进画面就打招呼
  • 9. Agent 委托:把难题交给后台模型,自己继续看流

它解决了什么

  • • 把”什么时候说话”从外部触发器搬进模型内部,事件发生时立刻响应
  • • 长视频流的 token 预算可控,能跑 2 小时不爆显存
  • • 委托机制让 8B 小模型能按需调用更强模型,不用自己硬扛所有题
  • • 完整开源:模型、数据、训练配方、系统全开放,能复现能改进

它没解决什么(论文 §5.3 自己承认):

  • • 8B 规模,通用知识、长尾场景、表达丰富度不如 Doubao(背后是 Seed 2.0)、Gemini(背后是 Gemini-3.1-flash-live)背后更大模型
  • • 直播解说场景偶尔幻觉,归因于参数规模和解说数据稀疏
  • • 评测仍处早期,6 场景 58 案例,还没做大规模系统性评估
  • • 数据混合还没调优,数据规模还没拉满,后续版本会扩展

07

横向对照:交互模型赛道里它站在哪

同类产品速览

vs TML:同方向,反路线

两家几乎同时认识到”交互性值得作为模型自身能力来 scaling”。差异在两点:

模态处理:TML 把语音和视觉融合进同一个大模型;JoyAI 把视觉作为一等公民,语音做成可插拔 I/O。论文原话:”we make vision the first-class driver with speech as pluggable I/O”(来源:arXiv 2606.14777 §1)。

规模与开放:TML-Interaction-Small 是 276B MoE(12B 活跃),作者说这是他们能在目标延迟下服务的最小规模;JoyAI 故意选 ~8B,让它能在本地、低成本硬件上跑、能微调、能复现。TML 放了闭源预览,JoyAI 放了模型+数据+配方+系统。

vs Doubao / Gemini:评测数字说话

评测覆盖 6 类场景、58 个案例,5 位 LLM 研究者双盲打分(质量 + 时机各占一半),三级量表(来源:arXiv 2606.14777 §5.1 / Table 1 / Table 2)。

vs Doubao

vs Gemini

几个值得注意的点:

  • • 监控告警对两家都是 100% 胜,这是”事件发生立刻响应”的最纯粹测试
  • • 对 Gemini,实时计数、翻译、解说都是 100% 胜
  • • Doubao 在直播解说赢 22.2%,靠的是更大模型带来的知识广度和表达丰富度,但时机反而是弱点
  • • Gemini 在时间感知赢 10%,因为部分时间感知案例是”事后问”,实时压力低,Gemini 底层模型答得好
  • • 长程记忆对两家都是 77.8% 胜,部分原因是 Doubao 约 5 分钟无语音挂断、Gemini 约 2 分 15 秒挂断,一半记忆案例基线根本不在场(来源:arXiv 2606.14777 §5.2)

08

争议与权衡 + 实战小贴士

争议与权衡

8B vs 大模型:JoyAI 故意选 8B,换来本地可跑、可微调、可复现。代价是通用知识、表达丰富度、复杂输入鲁棒性不如 Doubao/Gemini 背后的大模型。论文没回避这点,明确说”我们不声称在所有方面匹敌这些产品”

视觉优先 vs 音视频融合:JoyAI 把语音做成可插拔 I/O,不融进模型。TML 选了融合路线。JoyAI 的论点是:在”看-交互”场景里,语音是可替换的输入输出,视觉才是触发主动性的核心。这个取舍意味着换 ASR/TTS 不用重训模型,但也意味着模型本身不直接处理语音的声学特征。

评测规模:58 个案例、6 类场景、5 位评审,规模偏小。论文承认这是”早期阶段”,后续版本会扩展。58 个案例里有些场景只有 9-10 个样本,统计意义有限。但论文的立场是:即便在这个规模,涌现能力已经出现,值得现在就开放给社区。

实战小贴士

来自 GitHub README 和论文 §4.2 的踩坑点:

  • • 高频率输出场景关 TTS:直播解说、逐步引导、实时字幕翻译这种近连续输出场景,建议关掉 TTS,只看文字。因为语音有时长而生成没有,开着 TTS 会让音频堆积
  • • RTSP 推流用 MediaMTX:评测时用 MediaMTX 把离线视频模拟成 RTSP 直播流喂给系统
  • • 可视化 UI 可当调试面:左侧配视频源和采样率,中间看实时流,右侧看对话和延迟,敏感部署可以拿它做信任面板
  • • 后台 brain 默认接你自己的 API:委托任务默认走用户自己的大模型 API,想接 agent 也可以(Hermes Agent、OpenClaw 都支持)
  • • 想加新能力不用改架构:数据构建是按”每秒一个动作”的通用格式,加新场景只要按同样格式标注数据、过同样的验证 pipeline,不用动架构和训练目标

09

硬件与部署要求

官方推荐配置(来源:GitHub README badges + 论文 §4.4):

  • • Python:3.12
  • • 推理框架:vLLM
  • • CUDA:12.x
  • • 模型规模:~8B(语言模型初始化自 Qwen3-8B)
  • • 显存:README 没明说具体数字,8B 模型通常单卡 24G 显存可跑;完整系统含 ASR/TTS/后台 agent,按需启用

快速启动三步:

1
2
3
4
`git clone https://github.com/jd-opensource/JoyAI-VL-Interaction.git
cd JoyAI-VL-Interaction
"color:[#9ca3af]();"># 安装依赖./install/install.sh --with-all
"color:[#9ca3af]();"># 下载所有模型权重./install/download-models.sh --all`

然后浏览器打开 https://127.0.0.1:8099

系统支持两种视频输入:浏览器摄像头(WebRTC SDP 协商)和 RTSP 直播流(服务端拉流)。采样默认 1Hz,可按场景调。完整部署 ASR、TTS、后台 agent 的细节看仓库 doc/getting_started.zh-CN.md

实测数据方面,论文 §4.4 提到系统在标准 vLLM 上能维持 2 小时以上连续视频、亚秒级端到端延迟。更细的显存/FPS 数字 README 没给,待官方补充。

10

总结

JoyAI-VL-Interaction 推开的这扇门,不是”又一个视频问答模型”,而是把”交互性”作为模型自身能力来训练、来开源。8B 规模、视觉优先、语音可插拔、400 万条时间对齐数据、完整可部署系统、Apache 2.0 协议——这套组合在交互模型赛道里目前没有第二家。

它不完美:通用知识不如大模型,解说偶尔幻觉,评测规模偏小。但论文的立场很清楚:即便在这个早期阶段,涌现能力已经出现,与其等打磨好再发,不如现在就开放给社区一起迭代。论文结尾那句画面感很强:你疲惫回家,还没开口,一个安静的声音说”我能看出你很累,今日一定很辛苦”。这种未经请求的在场感,是交互模型能给的东西,也是回合制模型永远做不到的。

最值点的 3 个链接

JoyAI-VL-Interaction hero


💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 它来了!京东开源首个8B实时视觉交互模型:打破大模型“一问一答”常规,实测胜率超Gemini,含400万对齐数据与全栈系统
  • 作者: lxiol
  • 创建于 : 2026-06-22 19:00:45
  • 更新于 : 2026-06-30 17:05:34
  • 链接: https://blog.lxiol.cn/2026/06/22/它来了京东开源首个8B实时视觉交互模型打破大模型一问一答常规实测胜率超Gemini含400万对齐数据与全栈系统/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。