4月24日,腾讯Robotics X实验室联合混元团队发布并开源 HY-Embodied-0.5-X,这是一款面向具身任务落地的多模态大模型,基于 HY-Embodied-0.5-MoT-2B 架构打造,围绕机器人在真实环境中“看得懂、想得清、做得到”的关键链路进行专项优化。


模型在10个主流具身复杂任务规划评测集上达到业内先进水平,其中7个评测集位于端侧领域模型第一名。


图片

在4月18日召开的中国电子信息年会上,腾讯首席科学家、Robotics X实验室主任、福田实验室主任张正友做了主题报告,并介绍了HY-Embodied-0.5与HY-Embodied-0.5-X。相比通用多模态模型,HY-Embodied-0.5-X 更聚焦机器人在真实交互中的核心问题,重点增强了精细操作理解、空间推理、动作预测、风险判断、多模态指代理解和长程规划等能力,推动模型从“看懂”进一步走向“干活”。

就在4月初,腾讯混元团队联合腾讯Robotics X实验室开发的HY-Embodied-0.5系列基础模型,包含两款主力模型:MoT-2B(总参数4B,仅激活2B),采用创新的混合Transformer(MoT)架构,主打端侧部署和实时响应,以及MoE-32B(总参数407B,激活32B),追求复杂推理与极致性能。为了让AI真正“看懂”物理空间并做出准确反应,团队在架构、数据组织和训练流程上做出了大量创新。

HY-Embodied-0.5-X 结合自采机器人第一视角操作数据、机械臂操作数据以及开源具身数据,构建了覆盖操作理解、第一人称任务推理、多模态交互指代理解等核心场景的高质量训练数据,并配套思维链标注与自动化数据质量闭环。

图片

在训练上,模型采用“验证—扩展—全量”的分阶段迭代策略,优先验证数据质量和训练配置,再逐步扩展到大规模训练,提升训练效率与效果稳定性。

场景方面,HY-Embodied-0.5-X 适用于家庭服务、桌面操作、任务规划与仿真评测等具身智能场景。模型既可以用于机器人在真实环境中的空间推理、精细操作推理、任务理解和失败反思,也可用于仿真环境中的规划评测、多模态交互研究,以及本地部署场景下的具身能力验证与开发。

一、丰富可靠的数据组成

图片

在数据层面,HY-Embodied-0.5-X 融合了自采机器人第一视角操作数据、机械臂操作数据以及开源具身数据,构建了覆盖操作理解、第一人称任务推理、多模态交互指代理解等关键场景的高质量训练数据。

图片

其中:

  • 针对机械臂与人手操作轨迹,团队围绕状态理解、下一步动作预测、操作风险判断、失败诊断和候选动作优劣比较等任务进行了专项数据构建;

  • 针对第一视角具身任务,覆盖了细粒度动作识别、子任务进度判断、手部空间定位、深度估计、相对空间关系推理、相机位姿推断等多类能力;

  • 围绕真实协作场景中的“把这个放到那里”这类模糊指令,构建了结合语音与手势的多模态交互指代理解数据,进一步增强模型对真实人机协作场景的适应能力。

图片

在数据建设之外,HY-Embodied-0.5-X 还引入了系统化的数据质量闭环。所有核心数据均附带思维链标注,用于训练模型在给出答案前进行逐步推理;同时,团队建立了从“生成—校验—修正”到“评测反跑验证”的完整流程,对结构化字段完整性、视觉有效性、多样性分布和模型增益效果进行端到端度量。面向开放世界泛化能力,团队还进一步将具身、互联网及 3D 数据纳入统一体系,构建了标准化的数据重构流水线,将异构源数据转化为统一的高质量具身推理数据。

二、训练:验证—扩展—全量”的分阶段迭代策略

在训练层面,HY-Embodied-0.5-X 采用“验证—扩展—全量”的分阶段迭代策略:先通过精选小规模高质量数据快速验证训练配置和数据清洗效果,再逐步扩大训练规模,最终在确认最优数据组合和训练策略后启动全量训练。这样的方式既提升了训练效率,也尽可能确保每一分算力都投入到最有价值的数据上。

围绕真实具身任务,HY-Embodied-0.5-X 主要展现出三方面特点:

第一,更强的空间理解能力。 模型能够更准确地理解物体位置、场景布局、相对空间关系和操作状态,为动作决策和任务执行提供更可靠的感知基础。

第二,更强的长程规划能力。 模型能够处理多步骤、强依赖的复杂任务,在连续交互中完成更稳定的任务拆解、动作规划与执行决策。

第三,更强的具身交互能力。 模型不仅具备视觉理解与对话能力,还能够进行任务解析、指代消解、动作决策、风险判断和失败反思,更贴近真实机器人交互闭环。

三、10个主流benchmark 拿下多项第一

在开源 benchmark 评测中,HY-Embodied-0.5-X 相比同尺寸开源模型也展现出较强竞争力。在覆盖规划、空间推理、具身问答、视觉指代与轨迹理解等方向的 10 个 benchmark 上,模型取得了 6 项第一、3 项第二,并在 CV-Bench 等通用视觉空间任务上保持第一梯队表现,体现出在规划、空间理解和具身交互等核心能力上的均衡优势。

图片

此外,HY-Embodied-0.5-X 在自建的基于 AI2Thor 仿真环境的具身规划基准测试中展现出较强的多步骤任务规划与连续交互能力。该基准共包含 1011 道任务,覆盖厨房、卧室、客厅、浴室四大家居场景,考察模型在导航、抓取、放置、开关电器、切割食材等操作中的规划与执行表现。结果显示,HY-Embodied-0.5-X 在长程操作、自认知、空间理解等关键维度上取得了明显提升。和类似尺寸的模型相比,我们的综合得分第一。在长程操作任务上,虽然只有2B参数,我们的模型超过了尺寸大得多的Claude-4.0-Sonnet和GPT-5.4,仅次于我们去年发布的32B的TAIROS-Planning和138B的Gemini 3.0 Pro,排名第三。

图片

我们从基准测试中选取了四个代表性任务,并在 AI2Thor 中完成实际执行与演示录制,涵盖厨房切菜装盘、制作冰咖啡、玄关整理和卧室贵重品收纳等场景。任务普遍涉及导航、抓取、放置、开关、切割、等待等多种操作,并考察模型在空间理解、状态切换、分类整理和多步骤规划上的综合能力。四个任务的标准动作序列均在仿真环境中成功执行,展现了模型在真实家居场景下完成复杂多步任务的规划与执行能力。

完整评测结果:

图片

除了基准评测,HY-Embodied-0.5-X 还完成了在基于 Tairos 平台的PlaygroundX 仿真架构上的接入验证。PlaygroundX 是一个基于语义的具身任务仿真平台,面向人居场景,重点评测模型将自然语言指令转化为可执行动作序列的能力。

接入后,HY-Embodied-0.5-X能够在“把土豆扔到垃圾桶里”“关上冰箱门”“把西红柿放进冰箱”等典型居家任务中生成完整规划,并在执行过程中结合环境反馈进行调整,尤其在“把西红柿放进冰箱”任务中,模型在初始规划未考虑冰箱门状态的情况下,能够基于执行失败反馈快速完成重规划,补充“开门—放置”等动作,形成一次完整的 ReAct 闭环:推理、执行、感知失败、再规划。这说明 HY-Embodied-0.5-X 不仅具备任务规划能力,也具备面向真实交互过程的反馈利用与失败修正能力。

面向未来,HY-Embodied-0.5-X 的开源不仅希望为具身智能社区提供一个更具落地导向的基座选择,也希望推动模型从“通用理解”走向“真实执行”,在空间理解、长程规划、交互闭环和具身推理等关键方向持续突破。

开源模型地址:

Tairos官网:https://tairos.tencent.com/openSourceModels/hy-embodied

GitHub:https://github.com/Tencent-Hunyuan/HY-Embodied-0.5-X

Hugging face:https://huggingface.co/tencent/HY-Embodied-0.5-X

关注腾讯开源公众号

获取更多最新腾讯官方开源信息!

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐