note

  • 训练一个视频表征模型,用于query文本检索召回视频。文本、视频画面、ASR 文本处于同一个向量空间中的跨模态表征。
  • 因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理
  • multi-agent:
    • Routing Agent:判断该聊天还是搜索。
    • Search Agent:调用检索模型召回 Top-10,再调用 LLM 重排。
    • Chat Agent:基于检索结果生成摘要,并支持用户选择多个视频继续提问。

一、研究动机

V-Agent: An Interactive Video Search System Using Vision-Language Models
CIKM 2025
链接:https://huggingface.co/NCSOFT/multimodal-embedding

传统的视频搜索系统主要依赖元数据(如标题、标签、描述)或简单的文本匹配,这在多模态场景下存在显著局限。随着视频内容的爆炸式增长,用户需要能够直接理解视频画面(Visual)和语音(Audio)内容的智能搜索系统。

  • 传统系统的瓶颈:现有系统(如YouTube)无法深入分析视频内部的视觉场景和对话内容,导致搜索结果往往遗漏关键信息。
  • VLM的应用缺口:虽然视觉语言模型(VLM)在视频理解方面表现出色,但大多数研究集中在训练方法和基准测试性能上,缺乏将其有效集成到真实世界系统性应用中的探索。
  • 多模态理解的挑战:视频不仅包含画面,还包含音频、字幕和元数据。如何在一个统一的框架下融合这些异构信息,并提供交互式的对话体验,是本研究试图解决的核心痛点。

二、V-Agent

V-Agent 的核心在于结合了改进的视觉语言检索模型多智能体(Multi-Agent)架构,实现了从“检索”到“交互”的闭环。
在这里插入图片描述

1、检索模型

把 Qwen2-VL 训练成视频检索模型
基础模型是 Qwen2-VL-7B-Instruct。作者用 1.7 万条视频偏好数据训练:

  • 输入:视频 + prompt
  • 正样本:正确回答
  • 难负样本:rejected answer

然后用 InfoNCE,让“视频与正确语义”更接近、“错误回答”更远,最终取 EOS hidden state 作为统一向量。所以它确实训练出了一个可用于检索的多模态 Embedding 模型,而不是让 VLM 直接生成搜索答案。

2、Retrieval Vector 权重相加

因为视频训练数据较少,作者从图文检索模型 GME 中提取“检索能力”:
τ = GME 参数 − 原始 Qwen2-VL 参数
最终模型 = 视频微调模型 + τ

理解:先让 Qwen2-VL 学会视频语义匹配,再把 GME 已经学好的图文检索能力以参数差分的形式迁移进去。

在这里插入图片描述

为了在小规模数据上实现高效的视频-文本对齐,作者提出了一种独特的权重调整方法:

  • 微调策略:利用 17k 规模的视频偏好数据集对 Qwen2-VL-7B 进行微调,使其具备基础的视频-文本检索能力( M F M_F MF)。
  • 向量加法:计算专业图像-文本检索模型(GME)与原始指令微调模型(Qwen2-VL)的权重差值,定义为“检索向量 τ \tau τ”。将该向量加到微调后的模型中( θ M R = θ M F + τ \theta_{M_R} = \theta_{M_F} + \tau θMR=θMF+τ),显著增强了模型在视觉-文本对齐方面的泛化能力,弥补了视频训练数据不足的缺陷。

3、建立视频索引

每个视频均匀抽取 48 帧,同时用 Whisper 提取音频转写;如果有视频描述,也与 ASR 文本拼接。

分别生成:视频帧 Embedding、音频转写/描述 Embedding
并存入 pgvector 的 HNSW 索引。

查询时用同一个模型编码文本 query,然后分别召回视觉和文本结果,按下面方式融合:
总分 = 0.5 × 视觉相似度 + 0.5 × ASR/描述相似度

4、系统架构:三智能体协作

在这里插入图片描述

系统通过三个智能体的分工协作来处理复杂的用户请求:

  1. 路由智能体 (Routing Agent):充当“调度员”,判断用户意图。如果涉及视频查找,转交搜索智能体;如果是闲聊或通用知识问答,直接转交聊天智能体。
  2. 搜索智能体 (Search Agent)
    • 索引构建:利用 Whisper 提取音频转录文本,结合均匀采样的视频帧(默认48帧),通过上述检索模型生成多模态嵌入。
    • 检索与融合:接收查询后,分别计算视觉帧和音频转录与查询的相似度,使用加权公式(默认各占50%)融合得分。
    • 重排 (Re-ranking):引入基于 LLM 的重排模块,对初筛出的 Top-K 候选视频进行二次精排,大幅提升最终结果的相关性。
  3. 聊天智能体 (Chat Agent):基于搜索智能体返回的精排结果,结合视频内容生成摘要或直接回答用户关于视频内容的追问,实现深度的交互式问答。

三、实验结果

论文在两个主流基准数据集上验证了 V-Agent 的有效性,重点展示了其在零样本(Zero-shot)场景下的强大性能。

数据集与指标

  • MSR-VTT:侧重于基础的视频-文本匹配。
  • MultiVENT 2.0:侧重于复杂的多语言、事件中心的视频检索(包含6种语言,涉及视觉、音频、嵌入式文本等多维度)。

关键性能对比

表1:MultiVENT 2.0 基准测试结果 (零样本)

模型/系统 nDCG@10 R@10 备注
V-Agent (Ours) 0.680 0.676 当前 SOTA
MMMORRF 0.586 0.611 此前最佳基线模型
SigLIP 0.375 0.409 -
CLIP 0.304 0.333 -
InternVideo2-6B 0.005 0.004 在此复杂任务中表现不佳

表2:MSR-VTT 基准测试结果

模型 R@1 R@5 R@10
Ours (w. Retrieval Vector) 0.476 0.720 0.798
GME-7B (Mean Pooling) 0.411 0.655 0.764
InternVideo2-6B 0.559 0.783 0.851

完整结果:
在这里插入图片描述
注:因为GME模型没有经过图像/视频训练,所以这里的对比中GME是对帧图emb进行mean pooling处理

四、结果分析

通过对实验结果和消融实验的解读,可以得出以下核心洞察:

  • 检索向量的关键作用:在 MSR-VTT 数据集上,加入检索向量后,R@10 从 0.750 提升至 0.798。这表明通过借用强图像-文本对齐模型的“知识”(权重差),可以有效补偿视频领域训练数据的稀缺性,提升跨模态对齐精度。
  • 重排机制的显著提升:消融实验显示,去除重排(Re-ranking)模块会导致 nDCG@10 下降约 6 个百分点(从 0.680 降至 0.614)。这说明初筛模型负责召回,而 LLM 驱动的重排器对于最终排序的精准度至关重要。
  • 多模态融合的必要性:在 MultiVENT 2.0 上的巨大领先优势(相比次优模型提升近 10 个点)证明,单纯依赖视觉模型(如 InternVideo2)或简单融合方法是不够的。V-Agent 通过结合 ASR 音频转录与视觉帧的联合嵌入,更能应对复杂的多语言、多事件检索需求。
  • 效率与效果的平衡:虽然增加采样帧数(如从16帧增至48帧)能提升效果,但收益边际递减且增加延迟。因此,系统选择了 48 帧作为平衡效果与效率的最优配置。
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐