MVP-RAG 技术架构解析

阿里与小红书联合提出的 MVP-RAG(Multi-View Progressive Retrieval-Augmented Generation)是一种针对电商场景的混合检索增强生成框架。其核心创新在于通过双级检索机制(粗粒度+细粒度)与 LLM 生成能力的协同,解决了商品属性识别中的语义歧义、长尾属性和多模态对齐三大难题。技术架构包含以下关键组件:

  • 视图感知检索器:基于商品标题、描述、评论等多源数据构建异构视图,通过对比学习优化向量空间对齐
  • 渐进式检索模块:第一级检索采用基于 BM25 的稀疏检索实现粗筛,第二级通过稠密检索(如 Contriever)完成精排
  • 动态融合解码器:利用 LLM(如 GPT-4)的推理能力,将检索结果与商品上下文进行概率加权融合

解决的核心技术挑战

语义歧义问题 通过多视图对比学习(Multi-View Contrastive Learning)构建属性感知的嵌入空间,在服装品类测试中使 "修身"、"oversized" 等歧义属性的识别准确率提升 42%。具体采用 InfoNCE 损失函数优化视图间一致性:

$$\mathcal{L}{MVCL} = -\sum{i=1}^N \log \frac{\exp(s(v_i,v_i^+)/\tau)}{\sum_{j=1}^N [\exp(s(v_i,v_j)/\tau) + \exp(s(v_i,v_j^-)/\tau)]}$$

长尾属性挖掘 设计属性-值联合分布建模模块,采用动态负采样策略增强对低频属性(如 "非遗工艺")的捕捉能力。在测试集上使长尾属性召回率从 23% 提升至 68%。

多模态对齐 引入跨模态注意力机制,将视觉特征(通过 CLIP 编码)与文本检索结果进行对齐。实验显示该方案使图文匹配准确率提高 37%,特别改善了对 "渐变配色" 等视觉主导属性的识别。

电商场景性能表现

在淘宝、小红书真实场景的 AB 测试中,MVP-RAG 展现出显著优势:

| 指标 | 基线方案 | MVP-RAG | 提升幅度 | |----------------|----------|---------|----------| | 属性识别 F1 | 0.72 | 0.89 | +23.6% | | 搜索转化率 | 12.3% | 15.7% | +27.6% | | 上新商品审核时效 | 4.2h | 1.8h | -57.1% |

工程实现关键点

检索优化技巧

  • 采用 Faiss-IVFPQ 实现十亿级商品库的毫秒级检索
  • 设计基于 TTL 的缓存策略,使热门商品检索延迟稳定在 50ms 以下
  • 实现属性值动态聚类,自动发现新兴属性(如 "克莱因蓝")

生成控制策略

def hybrid_generation(query, retrieved_items):
    relevance_scores = calculate_semantic_similarity(query, retrieved_items)
    diversity_scores = calculate_diversity(retrieved_items)
    fusion_weights = softmax(relevance_scores + 0.3*diversity_scores)
    
    augmented_prompt = build_augmented_prompt(
        query, 
        retrieved_items,
        weights=fusion_weights
    )
    return llm.generate(augmented_prompt)

行业应用展望

该技术已应用于淘宝商品自动分类、小红书内容标签体系构建等场景。未来可扩展至:

  • 跨境商品的多语言属性映射
  • 直播带货场景的实时商品识别
  • AR 试穿中的视觉属性增强

通过持续优化检索效率与生成可控性,MVP-RAG 为电商领域的知识密集型任务提供了新的技术范式。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐