YOLOE-26:利用 YOLOE 集成 YOLO26 实现实时开放词汇实例分割(美国康奈尔大学2026年研究)
·
摘要:本文提出了 YOLOE-26——一个统一框架,它将经过部署优化的YOLO26架构与 YOLOE 的开放词汇学习范式相结合,用于实时开放词汇实例分割。该方法基于YOLOv26无 NMS 、端到端的设计,既保留了YOLO系列特有的高效性和确定性,又将其能力扩展至闭集识别之外。 YOLOE -26采用具有PAN/ FPN 式多尺度特征聚合的卷积主干网络,随后连接端到端回归头和实例分割头。其关键架构创新在于用对象嵌入头替代固定类别概率值,将分类任务转化为与文本描述、视觉示例或内置词汇生成的提示嵌入进行相似性匹配。为实现高效的开放词汇推理,该框架整合了支持零开销文本提示的可重参数化区域-文本对齐(RepRTA)、用于示例引导分割的语义激活视觉提示编码器(SAVPE),以及支持无提示推理的惰性区域提示对比机制。所有提示模态均在统一的对象嵌入空间内运作,实现了文本提示、视觉提示及完全自主分割之间的无缝切换。大量实验表明,无论在有提示还是无提示场景下,该框架在不同模型规模下均展现出稳定的扩展性能,并实现了优异的精度与效率平衡。该训练策略利用大规模检测与标注数据集,并采用多任务优化技术,同时完全兼容Ultralytics生态系统,适用于训练、验证和部署。总体而言, YOLOE -26为动态现实场景中的实时开放词汇实例分割提供了一种实用且可扩展的解决方案。
更多推荐



所有评论(0)