最新 AI 论文盘点(2026-04-27):5 篇新作看 Agent 世界模型、低成本 scaling law、多图理解、长尾 3D 重建与 LLM 水印

昨天这批论文如果放在一起看,我觉得有一条很清晰的共线:

AI 研究正在越来越少地只比“能力上限”,而是在更认真地处理系统真正进入现实环境后会遇到的硬约束。

这些约束是什么?

  • 训练预算不是无限的,scaling law 本身也得讲成本
  • Agent 不只是会生成文本,还得能预测环境、理解反馈、修正世界模型
  • 多图视觉理解不是把几张图一起喂进去就算完成,真正难的是跨图一致性和对象恒常性
  • 真实世界的 3D 重建不是每个场景都像热门地标一样有海量高质量图片,更多是稀疏、噪声、长尾
  • 模型生成内容进入真实分发链路之后,出处追踪和版权归属问题也开始越来越绕不过去

所以昨天我挑的这 5 篇,不是单纯挑“headline 最大”的,而是尽量挑那些能反映系统瓶颈正在怎么变化的工作。

分别来自:

  • Agent / 世界模型综述
  • scaling law 与实验预算
  • 多图 MLLM 训练
  • 长尾 3D reconstruction
  • LLM watermarking

它们方向看起来挺散,但拼起来恰好能看到一个趋势:

下一阶段 AI 的竞争,不只是模型更强,而是谁更懂得把预算、环境、证据、一致性和可追踪性这些现实因素一起纳入系统设计。


1)Agentic World Modeling:Agent 真正缺的,可能不是更多工具,而是更像样的世界模型

  • arXiv:2604.22748
  • 标题:Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
  • 方向:Agent / world model / environment modeling / survey

这篇论文首先值得注意的地方,是它没有把 world model 继续讲成一个模糊大词,而是试图把不同社区对“世界模型”的理解重新整理到一个统一框架里。

作者的判断很明确:

当 AI 系统从“生成一句文本”走向“持续完成目标”时,环境动力学建模会变成核心瓶颈。

这件事在很多场景里都成立:

  • 操作 GUI 的 agent
  • 浏览网页和调用工具的 agent
  • 多智能体协作系统
  • 科学发现与实验设计系统
  • 需要长期交互和反馈修正的任务型助手

论文提出了一个很有用的 “levels × laws” taxonomy。

它把能力分成三层:

  • L1 Predictor:学一步局部转移
  • L2 Simulator:做多步、动作条件下的 rollout
  • L3 Evolver:预测失败后还能根据新证据修正自己的模型

同时又把约束来源分成四类“law”:

  • physical
  • digital
  • social
  • scientific

这个框架的价值不只是分类漂亮,而是它在提醒一个现实问题:

不同 agent 场景失败的原因并不一样,因为它们所处环境的“规律类型”就不一样。

比如:

  • 机器人要服从物理规律
  • GUI agent 要服从软件界面状态转移
  • 社交模拟要面对社会规范和多主体行为
  • 科研 agent 要符合科学约束与实验反馈

论文还系统整理了 400 多篇相关工作和 100 多个代表性系统,这让它更像一篇路线图,而不只是普通 survey。

我觉得这篇最重要的启发是:

Agent 能不能做好,不只是“会不会调用工具”,而是它有没有足够好的环境预测结构,能在行动前形成有效预期,并在行动后修正预期。

如果你最近在看 browser agent、GUI agent、多智能体 simulation,这篇会很值得放进阅读清单。


2)Spend Less, Fit Better:scaling law 不是只能靠“先烧很多钱再拟合”

  • arXiv:2604.22753
  • 标题:Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
  • 方向:scaling law / experimental design / budget-aware training

这篇论文抓住的是一个常被忽略但其实很贵的问题:

大家都喜欢用 scaling law 规划大模型训练,但为了把 scaling law 拟合出来,本身就要先做一堆昂贵实验。

也就是说,scaling law 看起来是在帮你省钱,但它自己的“学费”可能就已经很高了。

作者把这个问题重新表述成:

  • 有一堆候选实验
  • 每个实验成本不同
  • 预算有限
  • 目标不是把所有点都跑了,而是让你在高成本目标区间的外推最准确

这个重构很重要。

因为它把 scaling law 拟合从“数据分析问题”改成了一个更现实的:

预算约束下的序贯实验设计问题。

他们提出的方法是 uncertainty-aware 的主动选择策略,核心想法是把预算优先花在那些对目标区间外推最有帮助的实验上。

结果也很有意思:

  • 在一组多样化 scaling-law 任务上
  • 它通常只用大约 10% 总训练预算
  • 就能逼近用全量实验拟合时的效果

我觉得这篇论文最大的价值,不只是“又一个更好的拟合算法”,而是它在提醒大模型工程里一个越来越关键的事实:

随着训练成本越来越高,连“为了做判断而做的小实验”都必须开始讲 ROI。

未来很多训练决策可能都要这么看:

  • 不是先做完再分析
  • 而是边做边决定下一笔预算最该花在哪里

这类思路对配方搜索、蒸馏设计、后训练实验,其实都很有迁移价值。


3)CGC:多图理解真正难的,不是看到多张图,而是别把对象关系看串了

  • arXiv:2604.22498
  • 标题:Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding
  • 方向:MLLM / multi-image understanding / grounding / RL-based reward

这篇论文切的是我一直觉得很关键、但还没被充分解决的问题:

MLLM 在单图上看起来已经挺强,但一到多图细粒度理解,还是很容易出错。

典型问题包括:

  • spatial hallucination
  • attention leakage
  • object constancy 失败

也就是:

  • 图 A 的属性跑到图 B 身上
  • 模型注意力被相似背景带偏
  • 同一个对象换个视角后,模型就认不出来是不是同一个

论文提出的 CGC(Compositional Grounded Contrast)有两个值得关注的点。

第一,它尽量避免昂贵人工标注和大规模 CoT 合成

作者不是重新大规模造多图标注数据,而是建立在已有单图 grounding 标注之上,去构造组合式多图训练样本。

这点很务实。

因为多图数据如果完全手工标注,成本会非常高,而 MLLM 训练现在本来就已经很烧资源。

第二,它把“跨图对比”和“图内对比”都显式做了

CGC 用了两类构造:

  • Inter-Image Contrast:加强跨图辨别,避免不同图里的语义混淆
  • Intra-Image Contrast:增强跨视角或相关样本下的对象恒常性

此外,它还在 GRPO 框架里加入了一个 Rule-Based Spatial Reward,去强化:

  • source-image attribution
  • spatial alignment
  • structured output validity

这点很重要。

因为很多 MLLM 的问题不是“完全没看见”,而是:

它输出时没有足够强的结构约束,所以容易把看到的东西组织错。

实验上,CGC 在多图 benchmark 上拿到不错结果,还对更广泛的多模态任务有迁移增益。

我觉得这篇论文最值得带走的判断是:

多图理解不是简单地把上下文长度拉长,而是必须显式解决跨图归因、空间一致性和对象恒常性。

如果这几点不单独建模,模型很容易“每张图单看都像懂了,合起来反而开始乱”。


4)MegaDepth-X:3D 重建下一个难点,不是热门地标,而是互联网图像分布的长尾部分

  • arXiv:2604.22714
  • 标题:Long-tail Internet photo reconstruction
  • 方向:3D vision / reconstruction / sparse-view / foundation model finetuning

这篇论文讨论的是一个特别现实的 3D 问题。

我们过去看到很多 3D reconstruction 系统效果很好,往往默认数据条件是:

  • 某个著名地标
  • 有大量照片
  • 拍摄角度丰富
  • 图像质量相对稳定

但现实世界大部分场景并不满足这些条件。

真正更普遍的情况其实是:

  • 图像稀疏
  • 质量参差不齐
  • 拍摄视角很不均匀
  • 纹理重复、对称结构多
  • 没什么可用的可靠几何监督

作者认为,这个“long-tail regime”才是 3D foundation model 接下来必须认真处理的区域。

他们的核心思路是:

虽然长尾稀疏场景本身很难拿到干净监督,但可以从那些已经重建得很好的热门场景里,主动采样出“像长尾一样稀疏”的训练子集。

基于这个想法,论文做了两件事:

  • 提出 MegaDepth-X 数据集
  • 设计一种采样策略,让训练图像集更接近长尾场景中的相机分布

然后再用这些数据去微调 3D foundation models。

结果是:

  • 在极端稀疏条件下重建更稳
  • 在对称和重复结构场景下也更可靠
  • 同时还能保持对标准 dense benchmark 的泛化

这篇论文真正吸引我的地方,是它非常典型地体现了一个趋势:

很多“模型不够强”的问题,最后发现不是 backbone 不够大,而是训练分布没有覆盖真实世界最难、最常见的尾部情况。

这对 3D 方向是这样,对自动驾驶、机器人、文档理解、长尾 OCR,其实也都类似。

换句话说:

不是 benchmark 上最亮眼的部分最值得担心,而是那些过去被默认忽略的长尾条件,才最可能决定系统能不能落地。


5)SSG:LLM 水印在低熵生成里为什么容易失效?问题可能出在词表划分方式

  • arXiv:2604.22438
  • 标题:Logit-Balanced Vocabulary Partitioning for LLM Watermarking
  • 方向:LLM watermarking / code generation / math reasoning / security

LLM watermarking 这条线最近越来越值得关注。

因为只要模型生成内容开始真正进入:

  • 内容平台
  • 教育场景
  • 代码生成链路
  • 企业写作与审计系统

“这段内容是不是模型生成的、来自哪个模型体系”这类问题就会越来越现实。

这篇论文讨论的是经典 KGW watermarking 方案在低熵场景下失效的问题。

所谓低熵场景,最典型的就是:

  • 代码生成
  • 数学推理

这类任务的 token 分布通常更尖锐,模型在每一步可选空间没那么大。

于是 watermark 能插手改动 token 选择的余地就会变小,导致可检测性下降。

作者把这个现象提炼成一个挺关键的概念:

watermark strength 与 next-token probability distribution 强相关。

这意味着,问题不只是“有没有打水印”,而是:

  • 当前 token 分布下,水印到底有没有足够操作空间

他们提出的 SSG(Sort-then-Split by Groups)做法,本质上是在重新设计词表划分方式,让两个候选子集在 logit 上更平衡。

这样做的目标是:

抬高每次 token 预测时 watermark strength 的下界。

直白说,就是尽量保证:

  • 即使在低熵生成里
  • 也还能留出一点可控空间给水印信号

实验显示,它在代码生成和数学推理任务上能提升水印可检测性。

这篇工作让我觉得很有意思的一点是:

它不是在做特别宏大的“AI 安全叙事”,而是很具体地盯住了一个工程事实:

你能不能打上稳定水印,取决于采样空间有没有被任务本身压得太窄。

这类工作以后可能会越来越重要,因为水印技术如果只在开放式聊天里有效、但一到代码和推理场景就失效,那实际可用性会非常有限。


最后总结

昨天这 5 篇论文如果放在一起看,我觉得最值得注意的不是它们各自所在的小方向,而是它们共同指向的一种系统化倾向:

  • Agent 不再只是“会不会调工具”,而是要不要有环境模型
  • scaling law 不再只是“拟合一条漂亮曲线”,而是预算怎样更值钱
  • MLLM 不再只是“能不能看多张图”,而是跨图归因是否稳定
  • 3D 重建不再只是“头部 benchmark 多高”,而是长尾场景能不能扛住
  • LLM watermarking 不再只是“理论上可行”,而是低熵任务里还是否有效

这些问题有个共同点:

它们都在把 AI 研究从“能力展示”推向“系统条件下的真实可用性”。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐