视频链接:https://www.bilibili.com/video/BV1xZZFBdE73/?vd_source=5ba34935b7845cd15c65ef62c64ba82f

无论具身本体面对的是结构化场景还是繁杂多变的场景,不管是通过rule-based还是learning-based的范式,最终回到程序的编码世界中如何进行表示,如何执行?考虑成本、效率、可行性,没有绝对的方式,正在看的世界模型也是一样。

  1. 预编程方式:固定的程序,受限于程序员的思维,如果没有考虑到的conner case或者多变的场景,那么程序就极有可能无法继续完成任务
  2. 模仿学习(IL):通过学习大量的专家数据进行模仿,需要进行分解成相对独立有起始的片段,对动作进行标注,效果很好,但场景更为特定,且不说数量问题,如果一些没有出现的场景,那么本身制造这段样本数据就是最大的难题
  3. 强化学习(RL):通过与环境交互进行学习,试错来优化行为,同样也无法覆盖较多场景,实际工况中不太允许进行trail and error和成功率较低的情况,对于执行的结果也不一定是最佳(如精度和完成率不能很容易兼得)

世界模型:从自然模态中学习并抽象世界的结构化和层级化知识,分析当前(抽象表征),预测未来(序列预测)。(咋有点MPC的味道)。

The_Book_of_Why

提供了对环境的因果关系理解(完美世界:你不怕大因果吗?),具备进行反事实推理 Counterfactual Reasoning 的能力(对已经发生的事,假设一个 “与事实相反的条件”,推理会出现什么结果,发散、正推、反推,没见过场面也不怕)

为什么世界模型特别需要它?世界模型要能想象,就必须会反事实推理:

  1. 预测:如果我这么做,会怎样?
  2. 规划:如果不这么做,会不会更好?
  3. 归因:正是因为做了 X,才导致 Y
  4. 泛化:把因果规律迁移到新场景

没有反事实推理,只能 “看数据、模仿”,不能理解因果。

Transformer 和世界模型的关系?

依赖于 Transformer 的序列预测、反事实推理,世界模型是用 Transformer 来建模时空、物理、因果的一种高级任务。Sora 把视频拆成 spatiotemporal tokens 用 Transformer 建模世界的时空演化

“在像素空间中,随着球逐渐离开桌面并移除画面,某些时间步的图像可能不再包含球的像素信息,因为球已完全不在画面中。然而,在潜在空间中,球的存在和运动轨迹仍然在球出现前和消失后的帧中表征。”

因果关系:球就要从桌面滚出去。还可以预测未来球怎么动,什么轨迹,掉到地上是什么变化?

下面两个在线 web,根据提供的信息进行泛化,理解,生成新的场景,可以尝试玩一下,感受一下。

腾讯混元3D https://3d.hunyuan.tencent.com/sceneTo3D?tab=worldplay

李飞飞团队 https://marble.worldlabs.ai

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐