最新 AI 论文盘点(2026-04-11):5 篇新作看个性化对齐、Agent 在线训练、病理路由与视频运动控制

昨天这批论文如果放在一起看,有一个很明显的共同点:

大家越来越少在比“谁的 headline 更大”,而是在比谁更能把系统里的真实瓶颈拆清楚。

比如:

  • reward model 到底懂不懂用户个人偏好?
  • Agent 在线训练真正浪费的是模型能力,还是环境样本?
  • 视频生成里的“控制”为什么常常看起来能动、但就是不听指挥?
  • 病理 WSI 里的 MoE 为什么总容易退化成少数专家在干活?
  • 低资源翻译里,把规则写进 prompt,模型就真的能稳定执行吗?

这类问题有一个共同特征:

它们都不是“规模再大一点”就一定能自动解决的。

昨天我挑 5 篇来盘,分别来自 LLM 对齐、Agent、视频生成、计算病理和机器翻译方向。它们未必每一篇都会成为最热话题,但都很适合判断:未来系统真正卡住的位置到底在哪。

1)Personalized RewardBench:reward model 离“理解个体偏好”还差多远?

  • arXiv:2604.07343
  • 标题:Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
  • 方向:LLM 对齐 / reward model / 个性化偏好评测

这篇论文瞄准的是一个过去很容易被“平均分”掩盖的问题:

一个 reward model 在通用偏好评测上表现不错,是否就代表它真的理解不同用户之间的偏好差异?

作者给出的答案并不乐观。

他们提出了 Personalized RewardBench,核心不在于再做一个普通偏好基准,而是刻意把问题改成:

  • 两个回答都不差
  • 区别主要来自是否符合某个具体用户的个人 rubric
  • 模型需要区分“普遍可接受”与“这个人真正更喜欢哪个”

实验结果显示,当前最强 reward model 在这项任务上的准确率峰值也只有 75.94%。

这说明通用对齐和个体对齐不是一回事。

如果你在做个性化助手、AI 陪伴、企业风格化 agent、reward reranking 系统,这篇论文很值得看。

2)Android Coach:在线 Agent 训练的关键,不一定是更多 rollout,而是把昂贵状态榨干

  • arXiv:2604.07277
  • 标题:Improve Online Agentic Training Efficiency with Single State Multiple Actions
  • 方向:Agent / 在线强化学习 / Android 智能体

这篇论文抓的问题很现实。

现在很多 Android Agent、GUI Agent 的训练都卡在一个地方:环境交互太贵。

模拟器慢、在线 rollouts 成本高、采样效率差,导致训练非常烧资源。

作者指出,很多现有方法默认采用的是 Single State / Single Action,也就是每拿到一个在线状态,只采一个动作样本来更新策略。

问题是,这会严重浪费昂贵状态。

所以他们提出 Android Coach,把思路改成 Single State Multiple Actions。

核心包括:

  • 对同一个在线状态采多个动作候选
  • 用 critic 估计 action value
  • 引入 process reward model 提升 critic 可靠性
  • 用 group-wise advantage estimator 改进训练信号

结果上,它在 AndroidLab 和 AndroidWorld 上,相比 UI-TARS-1.5-7B 拿到了 7.5% / 8.3% 的成功率提升,并在同等成功率下实现 1.4x 的训练效率提升。

这篇论文真正值得记住的,不只是 Android Agent,而是在提醒我们:很多 agent 训练瓶颈,不一定是模型不会,而是昂贵交互样本被浪费了。

3)MoRight:视频生成里最难的不是“让它动”,而是把运动变量拆对

  • arXiv:2604.07348
  • 标题:MoRight: Motion Control Done Right
  • 方向:视频生成 / 可控生成 / 运动控制

很多视频生成方法号称能做 motion control,但实际体验往往是:

  • 物体在动
  • 镜头也在动
  • 场景关系也在变
  • 最后用户根本说不清到底哪一部分是自己控制出来的

MoRight 这篇论文抓住的正是这个问题。

作者认为,现有方法里有两个核心混淆:

  1. 相机运动和物体运动纠缠在一起
  2. 运动只被看成像素位移,没有显式建模动作后果之间的因果关系

他们的做法是把 motion 更细地拆开:

  • 在 canonical static-view 下指定 object motion
  • 通过 temporal cross-view attention 转到目标视角
  • 把 motion 分成 active(用户驱动)和 passive(后果响应)两类

这篇工作的意义不是“又一个控制视频的框架”,而是它在提醒大家:视频里的控制不是一个单变量问题。

4)ROAM:病理 WSI 的 MoE 路由,不能只靠 softmax 自己学

  • arXiv:2604.07298
  • 标题:Region-Graph Optimal Transport Routing for Mixture-of-Experts Whole-Slide Image Classification
  • 方向:计算病理 / WSI / MoE / MIL

这篇论文对 AI 医疗、多模态病理这条线很值得关注。

它讨论的是病理全视野图像(WSI)分类中的一个长期问题。

当前很多方法还是 MIL 框架:

  • 一张超大病理切片拆成很多 patch
  • 模型聚合 patch 级特征做 slide-level 分类

问题在于,如果所有 instance 都走同一条共享路径,模型很难对病理异质性进行真正有区分度的建模。

MoE 看起来是自然方向,但又容易遇到另一个老毛病:softmax routing 经常失衡,最后只有少数 expert 在承担大部分工作。

ROAM 的核心思路是:

  • 先把 dense patch 压缩成 spatial region tokens
  • 用 entropic optimal transport 做 region-to-expert assignment
  • 加容量约束,避免专家利用失衡
  • 引入 graph-regularised Sinkhorn,让空间相邻区域的路由更一致

实验里,ROAM 在多个 benchmark 上表现有竞争力,并在 NSCLC 外部泛化上拿到 AUC 0.845 ± 0.019。

这篇论文比“换个更大 backbone”更值得长期关注,因为它在认真回答:病理场景下,MoE 到底应该怎么路由才不塌。

5)In-Context Translation:把语法说明塞进 prompt,不等于模型就能稳翻

  • arXiv:2604.07320
  • 标题:Evaluating In-Context Translation with Synchronous Context-Free Grammar Transduction
  • 方向:机器翻译 / in-context learning / 低资源语言

这篇论文的切口很妙。

很多人对低资源翻译有一种直觉:如果训练数据不够,那能不能把词典、语法规则、教材式说明直接塞进 prompt,让模型“现场学会翻译”?

听起来很合理。

但问题是:模型真的会把这些形式规则稳定地转成翻译行为吗?

作者设计了一个比较干净的形式化测试:

  • 用 synchronous context-free grammar 构造语言对
  • 把语法规则和输入句子一起给模型
  • 观察模型是否能按规则完成转导

他们系统分析了 grammar size、sentence length、morphology 差异、written script 差异。

结论很清楚:

  • grammar 变大,性能下降明显
  • 句子变长,性能下降明显
  • 形态差异、书写系统差异都会显著拖累表现
  • 常见错误包括错译、幻觉新词、保留未翻译源词

这篇论文的重要性在于,它帮很多“规则写进 prompt 就行”的乐观想法降了温。

六、把这 5 篇放在一起,昨天最值得记住什么?

如果要用一句话概括昨天这批论文,我会说:

AI 研究正在从“泛能力堆高”走向“系统失真点拆解”。

这 5 篇分别在拆不同层面的错位:

  • Personalized RewardBench:通用偏好 vs 个体偏好
  • Android Coach:环境成本 vs 训练利用率
  • MoRight:控制需求 vs 控制接口设计
  • ROAM:病理异质性 vs 路由退化
  • In-Context Translation:规则可描述 vs 规则可执行

七、如果你现在在做系统,昨天最值得优先跟进哪几篇?

  • 做 LLM 对齐 / 长期助手:Personalized RewardBench
  • 做 Agent / GUI Agent / Browser Agent:Android Coach
  • 做视频生成 / 世界模型 / 可控多模态:MoRight
  • 做 AI 医疗 / 数字病理 / 多模态病理:ROAM
  • 做低资源翻译 / 规则增强生成:In-Context Translation

八、最后总结

昨天这批论文给我的整体感觉不是“又一个大一统新范式来了”,而是:

研究在越来越认真地处理那些过去常被一句话带过的系统问题。

因为当研究开始认真面对:

  • 偏好不是平均值
  • 交互样本不是无限的
  • 控制变量不是一句 prompt 就能讲清楚的
  • 路由机制不是 softmax 一跑就自然合理
  • 规则描述不等于规则执行

那么很多看起来更“土”的问题,反而会逐渐变成真正决定系统上限的问题。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐