AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调

「面向零基础读者逐行拆解 ucla-mobility/AutoVLA(NeurIPS 2025):从 VLA/动作 codebook/KMeans/快慢思考/SFT/GRPO 等概念讲起,配合论文架构图 + 自绘 SVG(整体架构、KMeans 聚类、两阶段训练流程),逐文件细讲 build_codebook 聚类、modeling_auto_vla 挂 action_head、LoRA 微调策略、SFT 数据模板设计、Stage-2 RFT 拒绝采样精修、推理旁路,最后给出个人思考与系列关系」

2026年7月20日 · 9 分钟 · 1729 字 ·