📌 本期是【大模型 RL 算法总结】的续篇,相比之前的单步RL,本期主要回顾多步 Agentic 任务的 RL 算法:GiGPO、Tree-GRPO、ARPO、AEPO、RAPO。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐