RiskWorld 论文精读:以目标为中心的潜在世界模型,用于自动驾驶风险识别
论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型
SimWAM 代码完整解读:从 Video DiT 到 Action DiT,从 SFT 到 FlowGRPO 的逐行拆解
论文精读|DriveVLA-M0:失败感知的记忆增强,让 VLA 学会吃一堑长一智
论文精读|Percept-WAM:把 2D/3D 感知’种’进 VLM 里的感知增强世界动作模型
论文精读|BrainWAM:大脑式’动作空间协调’——把 VLA 语义先验和 WAM 预测动态拧成一股绳
论文精读|Metis:用’非对称注意力掩码’把视频生成与动作预测解耦的世界动作模型
论文精读|SimWAM:把世界模型当’训练老师’,用 Flow-GRPO 让 Action Expert 学会’自己开车'
端到端自动驾驶模型架构全解:从感知到规划的六大范式与 80+ 模型逐篇拆解
纯视觉端到端模型在 Cosmos 风格迁移加持下的 NAVSIM 大规模评测:11 个开源模型全景
自动驾驶学习路径总目录|用我的论文精读串成的金字塔地图
损失函数完全指南:从 L1 到 GRPO——端到端自动驾驶中的 Loss 设计哲学
论文精读|DriveTransformer:统一Transformer——告别BEV,拥抱稀疏Token并行交互
论文精读|TransFuser:用 Transformer 做传感器融合——让相机和激光雷达"商量着开车"
论文精读|PARA-Drive:完全并行的端到端架构,把感知预测规划"同时跑"
Flow-GRPO 完全讲解:训练/推理/梯度流/Loss 设计的逐行拆解
论文精读|iPad: Iterative Proposal-centric End-to-End Autonomous Driving
论文精读|DrivoR: Driving on Registers — 基于寄存器token的高效端到端自动驾驶
Cosmos 3 代码讲解:Mixture-of-Transformers 双塔统一五模态世界模型
论文精读|LIBERO:面向终身机器人学习的知识迁移基准
论文精读|RT-1:Robotics Transformer——大规模真实机器人数据驱动的策略学习
论文精读|PaLM-E:具身多模态语言模型——让机器人理解真实世界
论文精读|SayCan:让大型语言模型在机器人上落地执行
论文精读|Gato:DeepMind的通用智能体——一个网络玩转604种任务
论文精读|Open X-Embodiment:跨机器人大规模数据集与RT-X模型
论文精读|DROID:大规模真实世界机器人操作数据集
论文精读|RH20T:面向拟人全身控制的机器人操作数据集
论文精读|Octo:开源通用机器人策略——大规模多任务机器人基础模型
论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态
论文精读|DreamerV3:通过世界模型掌握多样领域——通用强化学习智能体
论文精读|UniSim:学习交互式真实世界模拟器——生成式世界模型
论文精读|EmbodiedGPT:基于具身思维链的视觉-语言预训练
论文精读|VIMA:基于多模态提示的通用机器人操作——多模态大模型驱动机器人
论文精读|MOO:基于预训练视觉-语言模型的开放世界物体操作
论文精读|LeRobot:让机器人学习触手可及——HuggingFace的开源机器人学习框架
论文精读|具身智能VLA模型综述:从视觉-语言到动作生成的技术全景
论文精读|具身智能:形态、动作、感知与学习的协同——全面综述
论文精读|虚实对齐:具身智能的全面综述——从仿真到真实的迁移
个人思考|VLA 都有了视觉编码器,为什么还需要感知模块?
个人思考|自动驾驶感知模块全景:从传感器到BEV再到占用网络,到底在感知什么
个人思考|自动驾驶技术全景学习指南:从基础到前沿的六范式知识体系
论文精读|SparseOccVLA:稀疏占用查询桥接 Occupancy 与 VLM,实现统一 4D 场景理解与规划
个人思考|JEPA-DRIVE:用联合嵌入预测架构做自监督驾驶决策
论文精读|LinkVLA:统一语言-动作理解与生成的 VLA 架构
论文精读|ST4VLA:空间引导训练实现鲁棒的视觉-语言-动作模型
论文精读|NoRD:无需推理的高效数据驱动 VLA
论文精读|VLA Safety Survey:视觉-语言-动作模型安全的全面综述
论文精读|DLWM:双潜在世界模型实现高斯中心的全方位预训练
论文精读|RAW2Drive:对齐世界模型的强化学习端到端驾驶
论文精读|MOSAIC:面向端到端自动驾驶的缩放感知数据选择
Cosmos-3 + MoE + Flow-GRPO 架构概览
思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计
个人思考|强化学习 + 生成式轨迹规划:四种范式、核心挑战与未来方向
论文精读|AlpaMayo-R1:因果推理链 + RL 驱动的 VLA 驾驶策略
AlpaMayo-R1 代码讲解:VLM 说推理链、Expert 雕轨迹、一个模型两套头
论文精读|TransDiffuser:去相关多模态表示驱动的扩散式轨迹生成
论文精读|AutoVLA:用自适应推理与 GRPO 微调统一「思考」与「动作」的端到端 VLA
论文精读|MAN TruckScenes — 第一个面向重卡自动驾驶的多模态数据集,把 4D 雷达做成 360° 全覆盖
论文精读|TruckV2X:首个以重卡为中心的 V2X 车路协同感知数据集,专治盲区与挂车遮挡
论文精读:Longitudinal Safety Distance Control Considering Cargo Load(ICVES 2025)——RSS 安全距离模型为什么漏算了满载重卡的刹车
AutoVLA 代码讲解:把「开车」变成「说动作 token」并用 GRPO 微调
Diffusion Planner 代码讲解:轨迹级扩散 + 免训练能量引导
Diffusion Policy 代码讲解:用 DDPM 给机器人「生成」一连串动作
pi0 代码讲解:通用 VLA 的「VLM 主干 + Flow Matching 动作专家」
UniAD 代码讲解:端到端自动驾驶的「全栈 Transformer」是怎么拼起来的
VAD 代码讲解:把场景「矢量化」后,端到端能有多轻
代码讲解:DiffusionDrive 从架构到训练推理的完整闭环
代码讲解:DiffusionDriveV2 — 用 GRPO 强化学习给截断扩散的多样轨迹「上安全锁」
代码讲解:DriveVLA-W0 世界模型如何给 VLA 大模型补上稠密监督
代码讲解:SparseDriveV2 因子化轨迹词汇表与两级评分的完整闭环
论文精读:Drive-JEPA — Video JEPA 预训练 + 多模态轨迹蒸馏的端到端驾驶
论文精读:GTRS — 通用轨迹评分(CVPR25 自动驾驶挑战赛冠军)
论文精读:WoTE — 用 BEV 世界模型做在线轨迹评估的端到端驾驶
论文精读|Anti-rollover APF — 用五自由度动力学 + 侧翻排斥势场,让重卡规划阶段就避开翻车
论文精读|TruckDrive — 面向重卡的长距离高速公路感知数据集,把感知边界推到 1000 米
场景理解与Failure Analysis:定位自动驾驶的边界
仿真器搭建与闭环测试:从CARLA到SIL/HIL
主流自动驾驶方案对比:FSD vs Momenta vs 华为 vs 小鹏
VLA大模型训练技巧:混合精度×梯度检查点×序列并行
论文精读|DriveVLA-W0:世界模型放大自动驾驶数据缩放律
NAVSIM 详解:自动驾驶规划的事实标准评测基准
论文精读|NVIDIA Cosmos 3:全模态世界基础模型开启物理AI新纪元
Flow-GRPO 详解:流匹配策略的强化学习优化
论文精读|SparseDriveV2:Scoring is All You Need——可扩展轨迹词表与打分
JEPA 详解:LeCun 的联合嵌入预测架构与自动驾驶应用
论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划
AlpaSim 详解:面向强化学习的自动驾驶仿真评测框架
论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架
论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型
知识点拆解|GRPO 强化学习方法详解:从 DeepSeek 到自动驾驶
论文精读|EMMA:Waymo的多模态端到端驾驶大模型
知识点拆解|PPO 算法深度拆解:从 Policy Gradient 到 GRPO 的进化之路
知识点拆解|VLM 视觉语言模型入门详解:从 CLIP 到 GPT-4V
知识点拆解|自动驾驶强化学习中的 Reward 函数设计详解
NVIDIA DRIVE平台详解:从Orin到Thor
论文精读|GoalFlow:目标引导流匹配轨迹生成
知识点拆解|大语言模型基础详解:Transformer、MoE 与 Scaling Law
知识点拆解|离线强化学习详解:从 CQL、IQL 到自动驾驶 VLA
知识点拆解|RLHF 与偏好对齐详解:从大模型到自动驾驶驾驶风格学习
知识点拆解|多模态对齐与指令微调详解:从 VLM 到 VLA 的关键桥梁
论文精读|DriveVLM-W0 与 DriveWLM 系列:世界模型如何点亮驾驶大模型
知识点拆解|Chain-of-Thought 推理详解:让 VLA 学会’先思考再行动'
知识点拆解|Scoring-based 规划范式详解
知识点拆解|逆强化学习详解:从专家演示中学会’为什么这么开'
论文精读|Diffusion Planner:把轨迹规划重定义为扩散式未来生成
知识点拆解|Transformer与注意力机制基础
论文精读|AlphaDrive:GRPO 强化学习唤醒驾驶推理与多模态规划
论文精读|Sparse4D:全稀疏多摄像头 3D 感知的三连击
知识点拆解|视频生成模型基础详解:VQVAE、扩散模型与DiT
论文精读|Last-VLA:小米的视觉-语言-动作模型
知识点拆解|驾驶世界模型全景详解:分类、代表工作与发展脉络
知识点拆解|条件扩散模型详解:引导方法与条件注入技术
论文精读|Senna:用 VLM 给端到端驾驶装上’大脑'
知识点拆解|Flow Matching 与扩散模型统一视角:从 SDE 到 ODE 的生成范式
论文精读|Gen-Drive:扩散模型生成 + 强化学习精调的驾驶策略
论文精读|BEVFormer:时空 Transformer 玩转多摄像头 BEV 感知
论文精读|DriveDreamer:构建真实驾驶场景的世界模型
论文精读|A Survey of World Models for Autonomous Driving:自动驾驶世界模型全景综述
论文精读|SafeDiffuser:用控制障碍函数给扩散规划加上安全保证
论文精读|MVAdapt:零样本多车型适应的端到端自动驾驶
论文精读|Teaching VLA Models What to See and Where to Look:DriveTeach-VLA 的视觉教学三段式
论文精读|From Foundation to Application: Improving VLA Models in Practice(LingBot-VLA 2.0)
论文精读|ABot-M0.5:统一的移动操作世界动作模型
论文精读|ExploreVLA:密集世界建模与探索驱动的端到端自动驾驶
论文精读|Agent-driven Long-tail Simulation for Autonomous Driving:用 LLM 代理驱动自动驾驶长尾仿真
论文精读|K-Risk:知识增强的高风险驾驶场景数据集
论文精读|LingBot-VLA:务实的 VLA 基础模型
CoWorld-VLA精读:多专家世界模型中的自动驾驶推理
RT-2精读:VLA奠基之作——将网络知识迁移到机器人控制
VLA-World精读:统一预测想象与反思推理的视觉-语言-行动世界模型
论文精读|nuTruck:面向分布式电驱重卡的自动驾驶规划闭环基准
论文精读|VADv2:概率规划——把驾驶决策从"猜唯一答案"变成"算概率分布"
论文精读|WCog-VLA:双层级世界认知,让自动驾驶从被动反应走向主动博弈
论文精读|Diffusion Policy:扩散模型做机器人动作生成
论文精读|World4Drive:用意图感知的物理隐世界模型,摆脱感知标注做端到端规划
论文精读|VLA for Autonomous Driving:自动驾驶视觉-语言-动作模型的过去、现在与未来
论文精读:DiffusionDriveV2 — RL-Constrained Truncated Diffusion
论文精读|ACT + ALOHA:低成本双臂遥操作与动作分块策略
NAVSIM 排行榜深度分析:谁在统治端到端规划?架构、创新与分数全解
Scaling Law与数据策略:训好大模型的工程法则
车端C++开发实战:从Python原型到生产级代码
分布式训练的工程实践:从DeepSpeed到3D并行
论文精读:FeaXDrive — Feasibility-aware Trajectory-Centric Diffusion Planning
论文精读:Hydra-MDP — End-to-end Multimodal Planning with Multi-target Hydra-Distillation
论文精读:UniDriveVLA — Mixture-of-Transformers 解耦感知-推理冲突的统一驾驶 VLA
论文精读|AutoDrive-P³:感知-预测-规划链式思维的统一强化微调——ICLR 2026 端到端驾驶新范式
论文精读|DriveFuture:未来感知潜在世界模型——以未来状态条件化当前规划的 SOTA 范式
论文精读|Uni-World VLA — 交错世界建模与规划实现闭环交互驾驶
论文精读|π0:基于Flow Matching的通用视觉-语言-动作模型
论文精读|UniAD:面向规划的端到端自动驾驶框架(CVPR 2023最佳论文)
Flow Matching 入门详解:从扩散模型到连续动作生成(含代码讲解)
论文精读|CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准
论文精读:Bench2Drive — Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
论文精读:BEV-VAE — Multi-View Image Generation with Spatial Consistency
论文精读:TOAD — Test-Time Trajectory Optimization for Autonomous Driving
论文精读:WorldVLA — Towards Autoregressive Action World Model
论文精读|CLOVER:闭环价值估计与排序框架——端到端自动驾驶规划的生成-打分新范式
论文精读|ReWorld — 面向 World Action Model 的表征学习
论文精读|X-World — 可控多相机世界模型实现可扩展端到端自动驾驶
论文精读|DriveVLM:把大语言模型推理能力搬上自动驾驶
什么是 VLA(Vision-Language-Action)模型?