【VR】视频检索V-Agent: An Interactive Video Search System Using Vision-Language Models
note
- 训练一个视频表征模型,用于query文本检索召回视频。文本、视频画面、ASR 文本处于同一个向量空间中的跨模态表征。
- 因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理
- multi-agent:
- Routing Agent:判断该聊天还是搜索。
- Search Agent:调用检索模型召回 Top-10,再调用 LLM 重排。
- Chat Agent:基于检索结果生成摘要,并支持用户选择多个视频继续提问。
文章目录
一、研究动机
V-Agent: An Interactive Video Search System Using Vision-Language Models
CIKM 2025
链接:https://huggingface.co/NCSOFT/multimodal-embedding
传统的视频搜索系统主要依赖元数据(如标题、标签、描述)或简单的文本匹配,这在多模态场景下存在显著局限。随着视频内容的爆炸式增长,用户需要能够直接理解视频画面(Visual)和语音(Audio)内容的智能搜索系统。
- 传统系统的瓶颈:现有系统(如YouTube)无法深入分析视频内部的视觉场景和对话内容,导致搜索结果往往遗漏关键信息。
- VLM的应用缺口:虽然视觉语言模型(VLM)在视频理解方面表现出色,但大多数研究集中在训练方法和基准测试性能上,缺乏将其有效集成到真实世界系统性应用中的探索。
- 多模态理解的挑战:视频不仅包含画面,还包含音频、字幕和元数据。如何在一个统一的框架下融合这些异构信息,并提供交互式的对话体验,是本研究试图解决的核心痛点。
二、V-Agent
V-Agent 的核心在于结合了改进的视觉语言检索模型与多智能体(Multi-Agent)架构,实现了从“检索”到“交互”的闭环。
1、检索模型
把 Qwen2-VL 训练成视频检索模型
基础模型是 Qwen2-VL-7B-Instruct。作者用 1.7 万条视频偏好数据训练:
- 输入:视频 + prompt
- 正样本:正确回答
- 难负样本:rejected answer
然后用 InfoNCE,让“视频与正确语义”更接近、“错误回答”更远,最终取 EOS hidden state 作为统一向量。所以它确实训练出了一个可用于检索的多模态 Embedding 模型,而不是让 VLM 直接生成搜索答案。
2、Retrieval Vector 权重相加
因为视频训练数据较少,作者从图文检索模型 GME 中提取“检索能力”:
τ = GME 参数 − 原始 Qwen2-VL 参数
最终模型 = 视频微调模型 + τ
理解:先让 Qwen2-VL 学会视频语义匹配,再把 GME 已经学好的图文检索能力以参数差分的形式迁移进去。

为了在小规模数据上实现高效的视频-文本对齐,作者提出了一种独特的权重调整方法:
- 微调策略:利用 17k 规模的视频偏好数据集对 Qwen2-VL-7B 进行微调,使其具备基础的视频-文本检索能力( M F M_F MF)。
- 向量加法:计算专业图像-文本检索模型(GME)与原始指令微调模型(Qwen2-VL)的权重差值,定义为“检索向量 τ \tau τ”。将该向量加到微调后的模型中( θ M R = θ M F + τ \theta_{M_R} = \theta_{M_F} + \tau θMR=θMF+τ),显著增强了模型在视觉-文本对齐方面的泛化能力,弥补了视频训练数据不足的缺陷。
3、建立视频索引
每个视频均匀抽取 48 帧,同时用 Whisper 提取音频转写;如果有视频描述,也与 ASR 文本拼接。
分别生成:视频帧 Embedding、音频转写/描述 Embedding
并存入 pgvector 的 HNSW 索引。
查询时用同一个模型编码文本 query,然后分别召回视觉和文本结果,按下面方式融合:
总分 = 0.5 × 视觉相似度 + 0.5 × ASR/描述相似度
4、系统架构:三智能体协作

系统通过三个智能体的分工协作来处理复杂的用户请求:
- 路由智能体 (Routing Agent):充当“调度员”,判断用户意图。如果涉及视频查找,转交搜索智能体;如果是闲聊或通用知识问答,直接转交聊天智能体。
- 搜索智能体 (Search Agent):
- 索引构建:利用 Whisper 提取音频转录文本,结合均匀采样的视频帧(默认48帧),通过上述检索模型生成多模态嵌入。
- 检索与融合:接收查询后,分别计算视觉帧和音频转录与查询的相似度,使用加权公式(默认各占50%)融合得分。
- 重排 (Re-ranking):引入基于 LLM 的重排模块,对初筛出的 Top-K 候选视频进行二次精排,大幅提升最终结果的相关性。
- 聊天智能体 (Chat Agent):基于搜索智能体返回的精排结果,结合视频内容生成摘要或直接回答用户关于视频内容的追问,实现深度的交互式问答。
三、实验结果
论文在两个主流基准数据集上验证了 V-Agent 的有效性,重点展示了其在零样本(Zero-shot)场景下的强大性能。
数据集与指标
- MSR-VTT:侧重于基础的视频-文本匹配。
- MultiVENT 2.0:侧重于复杂的多语言、事件中心的视频检索(包含6种语言,涉及视觉、音频、嵌入式文本等多维度)。
关键性能对比
表1:MultiVENT 2.0 基准测试结果 (零样本)
| 模型/系统 | nDCG@10 | R@10 | 备注 |
|---|---|---|---|
| V-Agent (Ours) | 0.680 | 0.676 | 当前 SOTA |
| MMMORRF | 0.586 | 0.611 | 此前最佳基线模型 |
| SigLIP | 0.375 | 0.409 | - |
| CLIP | 0.304 | 0.333 | - |
| InternVideo2-6B | 0.005 | 0.004 | 在此复杂任务中表现不佳 |
表2:MSR-VTT 基准测试结果
| 模型 | R@1 | R@5 | R@10 |
|---|---|---|---|
| Ours (w. Retrieval Vector) | 0.476 | 0.720 | 0.798 |
| GME-7B (Mean Pooling) | 0.411 | 0.655 | 0.764 |
| InternVideo2-6B | 0.559 | 0.783 | 0.851 |
完整结果:
注:因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理
四、结果分析
通过对实验结果和消融实验的解读,可以得出以下核心洞察:
- 检索向量的关键作用:在 MSR-VTT 数据集上,加入检索向量后,R@10 从 0.750 提升至 0.798。这表明通过借用强图像-文本对齐模型的“知识”(权重差),可以有效补偿视频领域训练数据的稀缺性,提升跨模态对齐精度。
- 重排机制的显著提升:消融实验显示,去除重排(Re-ranking)模块会导致 nDCG@10 下降约 6 个百分点(从 0.680 降至 0.614)。这说明初筛模型负责召回,而 LLM 驱动的重排器对于最终排序的精准度至关重要。
- 多模态融合的必要性:在 MultiVENT 2.0 上的巨大领先优势(相比次优模型提升近 10 个点)证明,单纯依赖视觉模型(如 InternVideo2)或简单融合方法是不够的。V-Agent 通过结合 ASR 音频转录与视觉帧的联合嵌入,更能应对复杂的多语言、多事件检索需求。
- 效率与效果的平衡:虽然增加采样帧数(如从16帧增至48帧)能提升效果,但收益边际递减且增加延迟。因此,系统选择了 48 帧作为平衡效果与效率的最优配置。
更多推荐


所有评论(0)