摘要:本文提出了 YOLOE-26——一个统一框架,它将经过部署优化的YOLO26架构与 YOLOE 的开放词汇学习范式相结合,用于实时开放词汇实例分割。该方法基于YOLOv26无 NMS 、端到端的设计,既保留了YOLO系列特有的高效性和确定性,又将其能力扩展至闭集识别之外。 YOLOE -26采用具有PAN/ FPN 式多尺度特征聚合的卷积主干网络,随后连接端到端回归头和实例分割头。其关键架构创新在于用对象嵌入头替代固定类别概率值,将分类任务转化为与文本描述、视觉示例或内置词汇生成的提示嵌入进行相似性匹配。为实现高效的开放词汇推理,该框架整合了支持零开销文本提示的可重参数化区域-文本对齐(RepRTA)、用于示例引导分割的语义激活视觉提示编码器(SAVPE),以及支持无提示推理的惰性区域提示对比机制。所有提示模态均在统一的对象嵌入空间内运作,实现了文本提示、视觉提示及完全自主分割之间的无缝切换。大量实验表明,无论在有提示还是无提示场景下,该框架在不同模型规模下均展现出稳定的扩展性能,并实现了优异的精度与效率平衡。该训练策略利用大规模检测与标注数据集,并采用多任务优化技术,同时完全兼容Ultralytics生态系统,适用于训练、验证和部署。总体而言, YOLOE -26为动态现实场景中的实时开放词汇实例分割提供了一种实用且可扩展的解决方案。

鸟瞰图: YOLOE -26模型用于开放词汇实例分割的简化架构。
YOLOE -26开放词汇实例分割模型在640像素分辨率下,通过文本和视觉提示进行测试。结果基于最小数据集采用端到端(e2e)评估方法得出。罕见(r)、常见(c)和高频(f)类别划分遵循标准开放词汇基准。模型在Objects365v1、 GQA 和Flickr30k数据集上完成训练。
YOLOE -26模型在640像素分辨率下实现了无需提示的开放词汇实例分割性能。结果基于最小数据集通过端到端(e2e)评估得出。这些无需提示的模型采用内置词汇表(如RAM++标签集),无需用户提供的文本或视觉提示。模型训练数据集包括Objects365v1、 GQA 和Flickr30k。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐