GS-Agent:基于生成式仿真构建四维物理世界

论文原始链接:https://arxiv.org/html/2607.21522v1

摘要

利用自然语言生成动态、物理真实的四维(3D空间+时间)虚拟世界兼具巨大价值与技术难点。传统计算机图形管线高度依赖人工调整材质、运动、渲染参数;现有生成式大模型虽可直接由文本输出4D内容,但普遍存在物理真实性差、可控性不足两大缺陷。
本文提出GS-Agent端到端多智能体框架,将物理引擎纳入智能体迭代循环,模仿人类影视/游戏场景制作全流程自动生成四维物理仿真世界。GS-Agent将世界生成任务拆解为两大核心模块:实体管理(3D资产检索/生成、材质调参、物体摆放、运动控制)、渲染配置(相机与灯光调度)。三类专业智能体通过代码与物理引擎交互,接收多模态图像/仿真反馈协同迭代,最终产出符合文本描述、具备流体/可变形体/刚体真实物理交互的动态场景,并支持电影级运镜与光影设计。
在牛顿物理基准、复杂多物体交互场景上开展完整实验,相比Sora2、Wan2.2等文生视频模型、SWE-Agent类代码智能体基线,GS-Agent生成结果物理一致性、文本指令匹配度、精细可控性全面领先;同时框架可自主检测仿真故障并完成修复。本工作为生成式物理世界构建提供全新范式,赋能内容创作与具身AI仿真数据生成。
在这里插入图片描述

图1 GS-Agent整体效果展示
GS-Agent接收自然语言输入生成具备真实物理交互的四维仿真世界,支持刚体、可变形物体、流体耦合模拟,同时输出电影级相机与灯光画面。框架不止输出像素视频,还同步输出深度图、法向图、粒子动力学等多模态结构化仿真数据,可直接用于机器人训练等下游任务。

1 引言

动态、物理可信的四维仿真世界在具身智能、自动驾驶、游戏、影视制作领域具备广泛应用价值:高质量仿真环境可安全、低成本训练机器人智能体,大幅缩小仿真到现实(sim-to-real)差距;同时自然语言驱动的世界生成可降低内容创作门槛,拓展叙事与交互内容形式。

现有技术路线存在明显短板:

  1. 传统人工管线:需人工完成3D资产整理、材质调试、场景搭建、物体运动编排、相机灯光设计,人力成本极高;
  2. 纯生成式文生视频/3D模型:Sora、Wan、4D-Fy等扩散模型仅从像素数据学习,难以严格遵循物理守恒定律,物体碰撞、流体形变等动态过程易出现违背常识的失真,且用户难以精细控制物体、镜头时序行为;
    3 代码智能体(如Blender专用Agent):仅能生成静态3D场景,缺少完整实时物理仿真闭环,无法处理多材料动态交互。

本文创新思路:模仿人类场景导演工作流,采用大模型多智能体架构,将物理引擎嵌入迭代优化循环,全程通过仿真反馈修正场景参数。

本文三大核心贡献

  1. 提出GS-Agent端到端多智能体框架,以物理引擎为底层支撑,全自动完成自然语言到四维动态物理世界的全流程构建,复刻专业影视/游戏制作流水线;
  2. 设计三层分工智能体体系(总管智能体/实体智能体/渲染智能体),配套标准化智能体-仿真交互工具接口,智能体通过代码调用仿真、接收多模态反馈协同迭代优化场景;
  3. 在两套评测集开展量化+人工用户评测,验证GS-Agent在物理真实性、文本对齐度、镜头可控性上全面超越主流基线;框架具备自主故障修复、细粒度自然语言调控能力,同时可输出结构化仿真数据支撑具身AI训练。

图2 GS-Agent系统总架构
总管智能体解析文本、拆解子任务并分发至实体/渲染智能体;实体智能体负责3D资产、材质、物体运动;渲染智能体控制相机、灯光与视频录制。智能体通过消息工具互通,统一标准化接口调用Genesis物理引擎,最终输出可执行仿真代码与渲染视频。完整工具定义见附录B。

2 相关工作

2.1 3D/4D场景生成

早期文本生成3D方案依赖规则映射;现代方法基于扩散、高斯泼溅等生成模型从海量数据学习场景几何,但普遍忽略物理动力学约束。近期工作引入物理求解器提升动态真实性,但大多仅生成单段视频帧。
区别于现有单模型/单智能体方案,GS-Agent采用多智能体分层架构,内置完整实时物理引擎闭环,全程迭代校验动力学一致性,规避纯视觉生成模型泛化缺陷。

2.2 文生视频模型

主流文生视频基于扩散Transformer架构,部分工作引入物理先验,但仍存在时序不一致、物理违背、镜头难以精准控制三大痛点。GS不直接生成像素,而是基于确定性物理仿真渲染画面,从底层保证运动、碰撞、流体行为严格遵循物理守恒,从根源解决时序失真。

2.3 大模型智能体

现有大模型智能涵盖文本工具、GUI操作、机器人控制、代码生成等方向,部分Blender专用智能体仅支持静态3D场景制作。GS-Agent是首个内置统一物理引擎、全自动生成完整四维动态世界的多智能体框架。

3 GS-Agent:内置生成式仿真的多智能体框架

人类专业场景制作流程为:导演拆解需求、分配建模/动画/渲染任务、反复预览迭代修正。GS-Agent复刻该流程,设计三类专业化智能体协同工作,底层基于Genesis物理引擎完成所有仿真计算。本章先介绍物理引擎基础组件,再分模块说明三类智能体完整功能。
在这里插入图片描述

3.1 底层物理引擎核心组件

GS后端采用Genesis通用物理仿真引擎,三大核心模块:

  1. 实体(Entity)
    实体统一定义格式:E=(几何形态Morph,物理材质Material,视觉表面Surface)E=(\text{几何形态Morph},\text{物理材质Material},\text{视觉表面Surface})E=(几何形态Morph,物理材质Material,视觉表面Surface)
  • Morph:网格/基础几何体定义物体外形;
  • Material:区分刚体、可变形体、流体,决定动力学求解方案;
  • Surface:纹理、颜色等视觉属性;
    附加参数:初始速度、外力、运动约束、粒子发射器等动态控制参数。
  1. 动力学求解器(Solver)
    根据材质自动匹配求解算法:
  • 刚体:标准刚体求解;
  • 可变形连续介质:MP物质点法;
  • 流体:SPH光滑粒子流体动力学;
    支持自定义仿真步长、分辨率,平衡仿真精度与计算速度。
  1. 渲染器(Renderer)
    独立于仿真计算模块,包含相机(位置/视角/视场)、光源(方向光/球形/环境HDR)、阴影三大可调模块,支持光栅实时预览、光线追踪高质量输出。

3.2 总管智能体(Manager Agent)

全局调度核心,承担四大功能:

  1. 任务拆解与分发
    读取用户自然语言需求,推理所需全部场景组件,生成分步执行计划,逐个将子任务下发实体/渲染智能体;每轮子任务完成后校验仿真结果,不达标则触发迭代修正。
  2. 全局仿真配置
    提前/运行中调整全局仿真超参:重力、仿真子步、MPM网格分辨率、SPH粒子尺寸、阴影/分割可视化等,保证仿真稳定、便于智能体视觉调试。
  3. 仿真时间线控制
    支持推进仿真步数、重置场景,分步查看中间动态效果;全部组件校验通过后触发完整仿真与视频录制。
  4. 跨智能体通信
    通过SendMessage工具向实体、渲染智能体下发文字指令,接收反馈并决策下一步优化方向。

3.3 实体智能体(Entity Agent)

负责场景内全部物体的创建、材质、运动控制,五大核心能力:

3.3.1 3D资产检索

内置BlenderKit、PolyHaven开源资产库,采用CLIP文本+图像联合嵌入构建语义检索索引,输入文本即可匹配匹配度最高的网格模型,同步返回模型路径、包围盒、预览图。

3.3.2 3D资产生成

资产库无匹配模型时调用Meshy文生3D接口生成网格;多次生成失败自动降级为立方体、球体等基础几何体搭建物体。

3.3.3 实体空间摆放

读取资产包围盒信息,自动缩放、对齐物体世界坐标,保证无穿插、合理间距;摆放完成后请求渲染智能返回视觉截图,检测碰撞、错位并迭代修正。

3.3.4 物理材质调参(核心创新)

传统3D工具材质参数调参门槛极高,GS自动迭代优化:
基于常识初始化杨氏模量、泊松比、塑性屈服应力等物理参数,运行仿真读取形变、流体动态反馈,反向微调参数;同步匹配MPM/SPH求解器分辨率,保证仿真数值稳定。

3.3.5 实体运动控制

支持PD控制器、直接力/速度指令、粒子发射器三类运动脚本,可编写时序运动逻辑,在统一仿真时间轴内执行刚体位移、流体喷射等动态事件。

3.4 渲染智能体(Render Agent)

负责全部视觉输出与镜头灯光设计,三大模块:

  1. 相机定位
    解析用户镜头描述(远景、特写、侧拍等),读取实体世界坐标,自动设置相机三维位置、朝向、视场角;
  2. 时序相机轨迹与视频录制
    将运镜逻辑编写为可执行代码(环绕、推拉、跟随物体),与仿真步数同步录制画面;轨迹代码可独立修改,无需重新运行物理仿真;
  3. 灯光系统配置
    支持方向光、球形光源、HDR环境光,调整位置、强度、色温匹配场景氛围,规避画面过曝、阴影失真等渲染瑕疵。

3.5 智能体统一交互机制

  1. 跨智能体通信:全局SendMessage工具,携带文字指令+可选截图/视频;
  2. 仿真调用接口:标准化工具集(附录B完整工具列表),智能体仅调用封装接口,无需编写底层仿真代码;
  3. 迭代闭环:每轮操作后获取仿真数值、渲染图像、视频多模态反馈,自动判断是否符合文本需求,循环优化直至达标。

4 实验部分

在这里插入图片描述

4.1 实验配置

4.1.1 两套评测数据集

  1. NewtonGen基准(24组场景):覆盖抛物线运动、弹性形变等12类基础物理定律,量化物理一致性;
  2. 自制复杂场景集(30组):流体、软体、刚体多物体碰撞、动态镜头等高难度复合任务。

4.2 评测指标

  1. State-PIS 物理不变性得分(核心指标):直接读取物理引擎每一帧物体质心、速度真值,计算能量、加速度等守恒量标准差,分数越高物理越真实;传统文生视频仅能通过图像分割计算Video-PIS,精度更低;
  2. 文本对齐得分:感知编码器对比文本与生成视频视觉特征相似度;
  3. 美学指标:采用VBench官方美学打分标准。

4.3 对比基线

  1. 文生视频模型:Sora2(闭源SOTA)、Wan2.2(开源SOTA);
  2. 代码智能基线:原生SWE-Agent、增加视觉反馈增强版SWE-Agent w/ Visual;
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

4.4 实现细节

底层物理引擎:Genesis;大模型基座统一使用GPT-5;所有输出统一720p分辨率用于公平对比,GS原生支持更高分辨率渲染。

4.2 主实验量化结果

表1 自动量化指标对比

模型 Video-PIS State-PIS 文本对齐得分 美学得分
Sora2 0.62 - 30.6 48.5
Wan2.2 0.46 - 29.8
SWE-Agent 0.41 0.44 25.8 42.0
SWE-Agent(视觉增强) 0.49 0.57 26.8 44.6
GS-Agent(本文) 0.71 0.83 32.2 47.6

结论:GS-Agent物理不变性、文本匹配度显著超越全部基线,美学分数仅略低于闭源Sora2。

表2 人工用户调研(15名受试者,5分李克特量表,270份有效问卷)

模型 物理真实性 相机可控性 内容匹配度 画面美学
Sora2 4.01 3.92 4.65 4.18
Wan2.2 2.72 3.49 4.45 3.71
SWE-Agent 3.18 3.49 3.40 2.40
SWE-Agent(视觉增强) 3.25 3.96 3.72 2.44
GS-Agent 4.33 4.32 4.70 3.86

人工评测用户最认可GS的物理真实度与镜头控制能力;纯扩散模型画面美学小幅领先,但物理逻辑大量失真。

定性对比结论

  1. 文生视频模型仅表层匹配文字,流体破碎、子弹穿水等场景违反流体力学,镜头旋转后背景物体几何错乱;
  2. SWE类代码智能体无法精准调参,易出现材质、动力学错误,文本指令完整匹配度不足;
  3. GS依托实时物理引擎,全程严格遵循动力学守恒,镜头、物体均可自然微调,同时支持完整多材料耦合仿真。

4.3 框架特有涌现能力

图4 自主仿真故障修复示例

浴缸3D模型存在几何缝隙导致流体泄漏,GS自动检测仿真异常,生成刚性补丁修改模型几何,无需人工介入完成修复。

图5 细粒度自然语言操控示例

支持自然语言指令修改渲染、新增物体、调整物体速度等精细化操作,降低专业仿真使用门槛。

4.4 消融实验与基座测试

表3 不同大模型基座性能

基座模型 State-PIS 文本对齐 美学
GPT-5 0.83 29.9 47.6
Gemini3-Pro 0.81 28.2 45.7
Qwen3.5-27B 0.62 27.1 45.3

框架兼容开源/闭源主流大模型,开源27B模型仍可正常运行整套管线,仅物理推理精度小幅下降。

表4 架构消融实验

方案 State-PIS 文本对齐 美学
完整GS-Agent 0.83 29.9 47.6
移除多智能体(单一体智能体) 0.42 27.9 47.3
移除专用仿真工具接口 0.57 26.8 44.6
  1. 多智能体分工至关重要:单智能体同时处理建模、渲染、仿真易混淆任务,推理逻辑混乱,物理一致性大幅下滑;
  2. 专用仿真工具封装不可省略:直接暴露底层仿真API给大模型会频繁出现参数错误、引擎崩溃。

5 讨论

5.1 框架核心优势:不止生成视频

GS底层输出可执行完整仿真代码,同步输出深度图、物体分割、曲面法向、粒子动力学等结构化多模态数据,可直接用于机器人强化学习、自动驾驶仿真数据集构建,区别于仅输出视频的文生模型。

5.2 物理时序全局一致性保证

纯扩散视频基于像素分布生成,长时序易出现物体形变、空间位置漂移;GS所有动态由确定性物理方程求解,几何、运动、能量全局自洽,天然适配交互式世界模型、具身智能仿真。

5.3 局限性

  1. 物理引擎本身算力与精度限制:高精度流体、软体仿真计算开销巨大,复杂真实世界完整模拟仍存在瓶颈;
  2. 大模型影视叙事理解短板:智能体自检、镜头美学评判能力有限,复杂分镜、长时序剧情生成仍存在优化空间。

6 结论

本文提出GS-Agent多智能体生成仿真框架,将物理引擎纳入智能体迭代循环,可直接由自然语言生成具备真实刚体、可变形体、流体交互的四维动态世界。总管、实体、渲染三类专业智能分工协作,通过标准化工具接口调用仿真、接收多模态反馈自主迭代优化。
大量量化与人工评测证明,GS在物理真实性、文本指令匹配、镜头精细可控性上全面超越现有文生视频、静态3D智能体基线;框架支持自主修复仿真故障、兼容多款开源/闭源大模型,输出结构化仿真数据支撑具身AI研究。未来工作将进一步优化智能体影视理解能力、提升大规模并行仿真生成效率。

附录A 更广社会影响

正向价值

  1. 内容创作普惠:无需专业图形学、仿真知识,普通人通过自然语言即可制作影视、游戏动态场景,降低创作门槛;
  2. 具身AI数据供给:低成本批量生成物理可信仿真环境,减少真实机器人实地采集数据的高昂成本,加速sim-to-real算法迭代。

潜在风险

  1. 虚假内容滥用:可生成高度真实、严格遵循物理的伪造动态画面,难以通过常规视频鉴伪工具识别,存在虚假信息传播风险;
  2. 算力能耗:大模型+高精度物理仿真组合计算密集,碳排放量较高;
  3. 行业冲击:自动化场景制作可能挤压传统三维美术、动画从业者岗位。

风险缓解方案

  1. 仿真代码、渲染视频嵌入加密数字水印,提供溯源依据;
  2. 底层大模型增加安全提示词拦截恶意仿真生成需求;
  3. 推进行业透明化评估,完善生成内容监管标准。

附录B 完整工具接口与系统提示脚本

B.1 智能体-仿真标准化工具总表

工具参数规范:<>必填参数,[]可选参数

通用全局工具(全部智能体可用)

工具名 参数 功能说明
GetSceneInfo 获取当前全场景全局信息
GetEntityInfo name 查询指定实体几何、材质、运动参数
SendMessage recipient, message, [image] 向其他智能体发送指令,附带截图/视频

总管智能体专属工具

| 工具 | 参数 | 功能 |
|------|------|
| ConfigureSimOptions | [dt],[substeps],[gravity] | 设置全局仿真步长、重力 |
| ConfigureMPMOptions | [网格分辨率],[粒子尺寸] | 可变形体求解器配置 |
| ConfigureSPHOptions | [粒子尺寸] | 流体求解器配置 |
| ConfigureVisOptions | [阴影],[背景色] | 可视化调试开关 |
| AdvanceScene | steps | 向前推进N帧仿真 |
| ResetScene | 无 | 重置整个场景到初始状态 |
| FinalizeOutcome | video_path | 任务完成,输出视频路径 |

实体智能体专属工具

| 工具 | 参数 | 功能 |
|------|------|
| AddEntity | name, code | 新增实体,code包含几何/材质脚本 |
| RemoveEntity | name | 删除指定实体 |
| UpdateEntity | name, code | 修改实体材质、外形参数 |
| AddEmitter | name, code | 流体粒子发射器创建 |
| RetrieveAsset | query | 文本检索3D资产库 |
| GenerateAsset | query | 调用文生3D生成网格 |
| ConfigureEntitiesControl | code | 编写实体时序运动控制逻辑 |

渲染智能体专属工具

| 工具 | 参数 | 功能 |
|------|------|
| ConfigureCameraModel | [分辨率],[坐标],[视场角] | 设置相机参数 |
| AddDirectionalLight | 方向,颜色,强度 | 添加平行光(光栅渲染) |
| AddSphereLight | 坐标,颜色,半径 | 球形点光源(光线追踪) |
| RenderCurrentFrame | 无 | 渲染当前单帧截图 |
| ConfigureCameraControl | code | 编写相机运动、录制时序代码 |

B.2 全套智能系统提示脚本

完整总管智能体、实体智能体、渲染智能体Prompt脚本见Listing1/2/3,所有脚本开源可直接复用,适配GPT、Qwen、Gemini等主流基座。

B.3 智能体自检迭代流程

每轮仿真推进后总管智能读取渲染视频,分析流体泄漏、物体穿插等故障,通过SendMessage下发修复指令给实体智能;渲染智能可读取单帧截图,调整灯光、相机参数,循环迭代至满足文本需求或达到最大调用轮次。

附录C 补充实验细节

C.1 更多定性对比样例

附录图7包含多组流体、软体、镜头控制场景GS与基线直观对比图。

C.2 用户调研完整流程

15名受试者,随机打乱所有模型生成视频,从物理真实性、相机可控性、内容匹配、画面美学四项5分制打分,共收集270份有效问卷,完整调研界面见附录图8。
打分标准:

  1. 物理真实性:物体运动、形变、流体符合物理守恒,无瞬移、穿插;
  2. 相机可控:镜头平稳,严格遵循文本描述运镜;
  3. 内容匹配:物体、场景、动作与文本描述一致;
  4. 美学:构图、光影无噪点、闪烁等视觉瑕疵。

C.3 故障根源分析

  1. 自检上下文污染:大模型容易受自身规划文本干扰,产生确认偏见,无法客观识别画面缺陷;
  2. 故障归因错误:仿真报错时智能容易调整无关参数(如反复调摩擦,实际是模型几何穿插),陷入迭代死循环;
  3. API幻觉:智能体会编造物理引擎不存在的参数/工具,造成执行报错。

开源资源汇总

  1. 项目主页(含演示视频):https://umass-embodied-agi.github.io/gs-agent/
  2. arXiv论文PDF:https://arxiv.org/pdf/2607.21522
  3. 完整智能体Prompt脚本、工具代码、实验复现脚本:项目主页开源仓库
  4. NewtonGen、自制评测集任务文件、仿真场景Docker镜像:仓库data目录
  5. 消融实验、用户调研完整原始数据:项目配套Hugging Face数据集
Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐