最新 AI 论文盘点(2026-04-11):5 篇新作看个性化对齐、Agent 在线训练、病理路由与视频运动控制
最新 AI 论文盘点(2026-04-11):5 篇新作看个性化对齐、Agent 在线训练、病理路由与视频运动控制
昨天这批论文如果放在一起看,有一个很明显的共同点:
大家越来越少在比“谁的 headline 更大”,而是在比谁更能把系统里的真实瓶颈拆清楚。
比如:
- reward model 到底懂不懂用户个人偏好?
- Agent 在线训练真正浪费的是模型能力,还是环境样本?
- 视频生成里的“控制”为什么常常看起来能动、但就是不听指挥?
- 病理 WSI 里的 MoE 为什么总容易退化成少数专家在干活?
- 低资源翻译里,把规则写进 prompt,模型就真的能稳定执行吗?
这类问题有一个共同特征:
它们都不是“规模再大一点”就一定能自动解决的。
昨天我挑 5 篇来盘,分别来自 LLM 对齐、Agent、视频生成、计算病理和机器翻译方向。它们未必每一篇都会成为最热话题,但都很适合判断:未来系统真正卡住的位置到底在哪。
1)Personalized RewardBench:reward model 离“理解个体偏好”还差多远?
- arXiv:2604.07343
- 标题:Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization
- 方向:LLM 对齐 / reward model / 个性化偏好评测
这篇论文瞄准的是一个过去很容易被“平均分”掩盖的问题:
一个 reward model 在通用偏好评测上表现不错,是否就代表它真的理解不同用户之间的偏好差异?
作者给出的答案并不乐观。
他们提出了 Personalized RewardBench,核心不在于再做一个普通偏好基准,而是刻意把问题改成:
- 两个回答都不差
- 区别主要来自是否符合某个具体用户的个人 rubric
- 模型需要区分“普遍可接受”与“这个人真正更喜欢哪个”
实验结果显示,当前最强 reward model 在这项任务上的准确率峰值也只有 75.94%。
这说明通用对齐和个体对齐不是一回事。
如果你在做个性化助手、AI 陪伴、企业风格化 agent、reward reranking 系统,这篇论文很值得看。
2)Android Coach:在线 Agent 训练的关键,不一定是更多 rollout,而是把昂贵状态榨干
- arXiv:2604.07277
- 标题:Improve Online Agentic Training Efficiency with Single State Multiple Actions
- 方向:Agent / 在线强化学习 / Android 智能体
这篇论文抓的问题很现实。
现在很多 Android Agent、GUI Agent 的训练都卡在一个地方:环境交互太贵。
模拟器慢、在线 rollouts 成本高、采样效率差,导致训练非常烧资源。
作者指出,很多现有方法默认采用的是 Single State / Single Action,也就是每拿到一个在线状态,只采一个动作样本来更新策略。
问题是,这会严重浪费昂贵状态。
所以他们提出 Android Coach,把思路改成 Single State Multiple Actions。
核心包括:
- 对同一个在线状态采多个动作候选
- 用 critic 估计 action value
- 引入 process reward model 提升 critic 可靠性
- 用 group-wise advantage estimator 改进训练信号
结果上,它在 AndroidLab 和 AndroidWorld 上,相比 UI-TARS-1.5-7B 拿到了 7.5% / 8.3% 的成功率提升,并在同等成功率下实现 1.4x 的训练效率提升。
这篇论文真正值得记住的,不只是 Android Agent,而是在提醒我们:很多 agent 训练瓶颈,不一定是模型不会,而是昂贵交互样本被浪费了。
3)MoRight:视频生成里最难的不是“让它动”,而是把运动变量拆对
- arXiv:2604.07348
- 标题:MoRight: Motion Control Done Right
- 方向:视频生成 / 可控生成 / 运动控制
很多视频生成方法号称能做 motion control,但实际体验往往是:
- 物体在动
- 镜头也在动
- 场景关系也在变
- 最后用户根本说不清到底哪一部分是自己控制出来的
MoRight 这篇论文抓住的正是这个问题。
作者认为,现有方法里有两个核心混淆:
- 相机运动和物体运动纠缠在一起
- 运动只被看成像素位移,没有显式建模动作后果之间的因果关系
他们的做法是把 motion 更细地拆开:
- 在 canonical static-view 下指定 object motion
- 通过 temporal cross-view attention 转到目标视角
- 把 motion 分成 active(用户驱动)和 passive(后果响应)两类
这篇工作的意义不是“又一个控制视频的框架”,而是它在提醒大家:视频里的控制不是一个单变量问题。
4)ROAM:病理 WSI 的 MoE 路由,不能只靠 softmax 自己学
- arXiv:2604.07298
- 标题:Region-Graph Optimal Transport Routing for Mixture-of-Experts Whole-Slide Image Classification
- 方向:计算病理 / WSI / MoE / MIL
这篇论文对 AI 医疗、多模态病理这条线很值得关注。
它讨论的是病理全视野图像(WSI)分类中的一个长期问题。
当前很多方法还是 MIL 框架:
- 一张超大病理切片拆成很多 patch
- 模型聚合 patch 级特征做 slide-level 分类
问题在于,如果所有 instance 都走同一条共享路径,模型很难对病理异质性进行真正有区分度的建模。
MoE 看起来是自然方向,但又容易遇到另一个老毛病:softmax routing 经常失衡,最后只有少数 expert 在承担大部分工作。
ROAM 的核心思路是:
- 先把 dense patch 压缩成 spatial region tokens
- 用 entropic optimal transport 做 region-to-expert assignment
- 加容量约束,避免专家利用失衡
- 引入 graph-regularised Sinkhorn,让空间相邻区域的路由更一致
实验里,ROAM 在多个 benchmark 上表现有竞争力,并在 NSCLC 外部泛化上拿到 AUC 0.845 ± 0.019。
这篇论文比“换个更大 backbone”更值得长期关注,因为它在认真回答:病理场景下,MoE 到底应该怎么路由才不塌。
5)In-Context Translation:把语法说明塞进 prompt,不等于模型就能稳翻
- arXiv:2604.07320
- 标题:Evaluating In-Context Translation with Synchronous Context-Free Grammar Transduction
- 方向:机器翻译 / in-context learning / 低资源语言
这篇论文的切口很妙。
很多人对低资源翻译有一种直觉:如果训练数据不够,那能不能把词典、语法规则、教材式说明直接塞进 prompt,让模型“现场学会翻译”?
听起来很合理。
但问题是:模型真的会把这些形式规则稳定地转成翻译行为吗?
作者设计了一个比较干净的形式化测试:
- 用 synchronous context-free grammar 构造语言对
- 把语法规则和输入句子一起给模型
- 观察模型是否能按规则完成转导
他们系统分析了 grammar size、sentence length、morphology 差异、written script 差异。
结论很清楚:
- grammar 变大,性能下降明显
- 句子变长,性能下降明显
- 形态差异、书写系统差异都会显著拖累表现
- 常见错误包括错译、幻觉新词、保留未翻译源词
这篇论文的重要性在于,它帮很多“规则写进 prompt 就行”的乐观想法降了温。
六、把这 5 篇放在一起,昨天最值得记住什么?
如果要用一句话概括昨天这批论文,我会说:
AI 研究正在从“泛能力堆高”走向“系统失真点拆解”。
这 5 篇分别在拆不同层面的错位:
- Personalized RewardBench:通用偏好 vs 个体偏好
- Android Coach:环境成本 vs 训练利用率
- MoRight:控制需求 vs 控制接口设计
- ROAM:病理异质性 vs 路由退化
- In-Context Translation:规则可描述 vs 规则可执行
七、如果你现在在做系统,昨天最值得优先跟进哪几篇?
- 做 LLM 对齐 / 长期助手:Personalized RewardBench
- 做 Agent / GUI Agent / Browser Agent:Android Coach
- 做视频生成 / 世界模型 / 可控多模态:MoRight
- 做 AI 医疗 / 数字病理 / 多模态病理:ROAM
- 做低资源翻译 / 规则增强生成:In-Context Translation
八、最后总结
昨天这批论文给我的整体感觉不是“又一个大一统新范式来了”,而是:
研究在越来越认真地处理那些过去常被一句话带过的系统问题。
因为当研究开始认真面对:
- 偏好不是平均值
- 交互样本不是无限的
- 控制变量不是一句 prompt 就能讲清楚的
- 路由机制不是 softmax 一跑就自然合理
- 规则描述不等于规则执行
那么很多看起来更“土”的问题,反而会逐渐变成真正决定系统上限的问题。
更多推荐



所有评论(0)