项目简介

Flow-GRPO 是将 Flow MatchingGRPO 强化学习结合用于自动驾驶策略训练的工作。本项目聚焦于读通源码、跑通流程、理解稀疏奖励下的策略对齐

我做了什么

  • 整理了一份小白友好的源码阅读顺序,并在关键文件加入教学注释,帮助快速建立整体认知。
  • 梳理了从环境交互、轨迹采样、奖励计算到 GRPO 更新的完整数据流。
  • 记录了训练启动、显存/采样步数等工程踩坑与对应解法。

成果

  • 产出两篇源码学习笔记:总体架构笔记 + 小白版阅读顺序(带注释)。
  • 形成一份可复用的「Flow-GRPO 跑通 checklist」。

相关链接