AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调
「面向零基础读者逐行拆解 ucla-mobility/AutoVLA(NeurIPS 2025):先把 VLA、动作 codebook、KMeans 聚类、快慢思考、SFT、GRPO/RFT、Qwen2.5-VL、token、规则奖励这些黑话翻译成人话,再厘清仓库边界(基座是 Qwen2.5-VL-3B、核心是动作 token 化 + 两阶段训练),然后逐文件逐函数细讲 build_codebook 的 KMeans 聚类、modeling_auto_vla 如何在 VLM 上挂 action_head、action_head 的动作 token 投影与解码、Stage-1 SFT 模仿学习、Stage-2 RFT/GRPO 拒绝采样微调、run_infer 里慢思考如何被旁路提速,最后串起完整数据流并给出个人思考与本系列其他文章的关系」