个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向
RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。
RL + 生成式轨迹是 2025-2026 最火热的方向之一。本文从一个小白的视角,梳理 SFT 的天花板、四种 RL 范式(奖励引导、拒绝采样、策略梯度、世界模型),深入分析 log-prob 难题和 reward hacking,用大量对比图和流程图让每个概念一目了然。最后给出了自己的理解和未来方向判断。