项目简介
Flow-GRPO 是将 Flow Matching 与 GRPO 强化学习结合用于自动驾驶策略训练的工作。本项目聚焦于读通源码、跑通流程、理解稀疏奖励下的策略对齐。
我做了什么
- 整理了一份小白友好的源码阅读顺序,并在关键文件加入教学注释,帮助快速建立整体认知。
- 梳理了从环境交互、轨迹采样、奖励计算到 GRPO 更新的完整数据流。
- 记录了训练启动、显存/采样步数等工程踩坑与对应解法。
成果
- 产出两篇源码学习笔记:总体架构笔记 + 小白版阅读顺序(带注释)。
- 形成一份可复用的「Flow-GRPO 跑通 checklist」。
相关链接
- GitHub: github.com/qyllll
- 配套笔记:Flow-GRPO 源码学习笔记、小白版源码学习教程