论文精读|BrainWAM:大脑式'动作空间协调'——把 VLA 语义先验和 WAM 预测动态拧成一股绳

BrainWAM 用’大脑分工’的思路回答一个根本问题:VLA(语义推理)和 WAM(预测动态)到底该怎么结合?它先诊断出 Tri-MoT 朴素融合的致命伤——语义 token 抢占注意力、压垮预测信号;再受左右脑半球经胼胝体通信、小脑协调运动意图的启发,把语义和预测拆成两条特化通路,各自产出’面向动作’的表示,最后在紧凑的动作空间里用 CAB(胼胝体动作桥)双向交换、CIF(小脑意图融合)协调解码。NAVSIM v1 拿到 89.5 PDMS、v2 拿到 89.6 EPDMS,双双超过 VLA-only、WAM-only 和 Tri-MoT。

2026年8月19日 · 9 分钟 · 1852 字 · 

论文精读|Metis:用'非对称注意力掩码'把视频生成与动作预测解耦的世界动作模型

Metis 用 Mixture-of-Transformers 把’视频生成专家’和’动作预测专家’拆成两个独立 Transformer,再用一张非对称注意力掩码管理二者的信息流:动作只看向当前帧,未来视频可以看动作。训练时联合优化两者学到世界动态,推理时直接跳过视频生成只跑动作分支——NAVSIM-v2 navhard/navtest 和 CityWalker 全面 SOTA,纯动作推理比带视频快 8 倍,还零样本部署到四足机器人。

2026年8月17日 · 7 分钟 · 1360 字 · 

论文精读|SimWAM:把世界模型当'训练老师',用 Flow-GRPO 让 Action Expert 学会'自己开车'

SimWAM 用 joint flow matching 把预训练视频专家的交通动态先验’蒸馏’进轻量级 Action Expert,再用隔离注意力掩码让动作分支彻底摆脱未来帧依赖;随后把确定性 Flow ODE 转成可探索的 SDE,用 GRPO 直接优化 NAVSIM 组合驾驶奖励,突破模仿学习的上限。91.5 PDMS 新 SOTA,推理时延大幅低于 imagine-then-act 的 WAM,并零样本迁移到 nuScenes。

2026年8月17日 · 12 分钟 · 2408 字 · 

JEPA 详解:LeCun 的联合嵌入预测架构与自动驾驶应用

JEPA 是 Yann LeCun 提出的自监督表征学习框架,核心思想是在嵌入空间做预测而非重建像素,避免了对决策无关细节的浪费。它采用双编码器加预测器的架构,配合 EMA 目标编码器与 stop-gradient 机制实现稳定训练。在自动驾驶世界模型中已成为生成式方法的重要替代方案。

2026年7月19日 · 3 分钟 · 615 字 · 

驾驶数据标注与处理:从人工标注到自动化范式

数据是自动驾驶系统的燃料。本文系统梳理 2D/3D/Temporal 标注的规范与工具,介绍自动标注(auto-labeling)、NeRF/3DGS 数据生成等前沿范式,覆盖 nuScenes、Waymo 等主流数据集和 corner case 挖掘策略。

2026年7月19日 · 3 分钟 · 588 字 · 

论文精读|DiffusionDrive:扩散模型驱动的端到端轨迹规划

DiffusionDrive 将扩散模型引入自动驾驶轨迹规划,从噪声出发逐步去噪生成多条合理轨迹,解决了确定性回归的 mode averaging 痛点。它通过轨迹初始化先验和截断扩散策略大幅减少采样步数,让扩散规划真正跑在车端。在闭环评测中达到生成式端到端驾驶的领先水平。

2026年7月19日 · 3 分钟 · 573 字 · 

AlpaSim 详解:面向强化学习的自动驾驶仿真评测框架

AlpaSim 是一个面向强化学习训练与评测的自动驾驶仿真框架,支持闭环训练、多场景评测和安全验证。它采用微服务架构与神经渲染引擎 NRE,兼顾传感器保真度与横向可扩展性。是连接驾驶策略训练和部署验证的关键基础设施。

2026年7月19日 · 4 分钟 · 651 字 · 

多智能体交互决策:博弈论在自动驾驶中的应用

自动驾驶并非独角戏,自车与其他交通参与者之间的交互博弈是最具挑战的决策问题。本文从博弈论基础(纳什均衡/Stackelberg博弈/势博弈)出发,讲解交互决策的核心挑战(部分可观测/意图不确定性/计算实时性),主流方法对比(基于规划的IV-game→基于学习的MADRL→基于模型的Gameformer),以及在换道博弈、无保护左转、环岛通行等典型场景中的应用实践。

2026年7月19日 · 3 分钟 · 543 字 · 

论文精读|ReCogDrive:小米EV强化认知端到端自动驾驶框架

华科×小米EV 提出 ReCogDrive,将 VLM 认知推理(场景理解与决策分析)、扩散规划器(连续轨迹生成)和 DiffGRPO 强化学习(安全优化)三阶段统一。它的层级化数据流水线自动生成含推理链的 VQA 标注,解决了 VLM’会想但不会开’的模态错配问题。在 NAVSIM 和 Bench2Drive 上达到 SOTA,验证了’认知-规划-优化’三分天下的 VLA 设计范式。

2026年7月19日 · 3 分钟 · 629 字 · 

模型部署入门详解:从 PyTorch 到车端推理

模型部署是将训练好的深度学习模型转换、优化并部署到车端推理引擎的过程。本文讲解 ONNX/TensorRT 的核心概念、FP16/INT8 量化原理、VLA 大模型的边缘部署挑战,以及 Orin 等主流车端硬件的技术参数。

2026年7月19日 · 4 分钟 · 812 字 · 

论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型

Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块:BEV感知头(3D检测+占用预测+地图分割)和 Planning Expert(~1.1B 参数 Flow Matching 轨迹生成器),四阶段渐进训练。关键设计:不设推理时打分器,直接用 Flow Matching 单次采样输出轨迹,RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS(RL),WOD-E2E 7.91 RFS,AlpaSim 闭环 0.37 分。

2026年9月6日 · 12 分钟 · 2448 字 · 

论文精读|LIBERO:面向终身机器人学习的知识迁移基准

LIBERO 是首个面向终身决策学习(LLDM)的机器人操作基准,包含 130 个语言条件任务和 4 个任务套件。它系统研究了五种知识迁移场景下的策略架构、终身学习算法、任务顺序、预训练效果等关键问题。一个反直觉的发现:简单的顺序微调在正向迁移上反而优于 EWC、ER 等经典终身学习方法。

2026年7月28日 · 3 分钟 · 564 字 · 

论文精读|SparseOccVLA:稀疏占用查询桥接 Occupancy 与 VLM,实现统一 4D 场景理解与规划

SparseOccVLA 用稀疏占用查询作为视觉与语言之间的单一桥梁,彻底摆脱 ViT patch token,让 LLM 在统一框架内同时完成场景理解、占用预测和轨迹规划。在 OmniDrive-nuScenes 上 CIDEr 提升 7%,Occ3D-nuScenes mIoU 提升 0.5,nuScenes 规划指标达 SOTA。

2026年7月27日 · 4 分钟 · 806 字 · 

论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型

阿里 Qwen-VLA 用’认知主干+运动专家’双模块解耦架构(类比大脑皮层与小脑分工),将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略,稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。

2026年7月19日 · 3 分钟 · 610 字 · 

模型评估体系与回归检测:守护版本质量

自动驾驶模型需要频繁迭代,但如何确保新版本’不比旧版本差’是一个被严重低估的工程难题。本文讲解模型回归检测的全套实践:离线评估Pipeline搭建(开环感知指标/闭环规划指标/计算延迟)、回归测试集的设计原则(场景覆盖/难度层级/对抗样本)、指标一致性分析(confidence interval/statistical significance/effect size)、以及CI/CD流水线中的自动化门禁机制(regression gate+人工review)。

2026年7月19日 · 6 分钟 · 1108 字 · 

知识点拆解|GRPO 强化学习方法详解:从 DeepSeek 到自动驾驶

GRPO 用’组内相对优势’替代 PPO 的 critic 网络,大幅降低大模型强化学习的训练成本与显存开销。它通过对同一 prompt 采样一组回答并基于组内奖励均值做基线来实现策略优化。已在 DeepSeek-R1 及自动驾驶项目 AlphaDrive、Flow-GRPO 中成为首选 RL 算法。

2026年7月19日 · 3 分钟 · 570 字 · 

知识精讲|ViT与视觉架构进化详解

从 ViT 到 ConvNeXt,视觉架构在 Transformer 与卷积之间完成了一个轮回。本文系统梳理 ViT 的核心机制(patch embedding、position encoding、class token),详解 DeiT、Swin、ConvNeXt 等关键演进,并分析多尺度特征金字塔与 VLA 视觉编码器的选型逻辑与缩放定律。

2026年7月19日 · 4 分钟 · 820 字 · 

论文精读|CARLA: An Open Urban Driving Simulator —— 自动驾驶仿真的事实标准

CARLA 是首个从头构建、开源开放的城市场景驾驶仿真器,基于 Unreal Engine 4 实现了高保真渲染、灵活传感器配置和标准化基准评测。本文从架构设计、实验基准到历史影响全面拆解这篇 CoRL 2017 经典论文,并分析其如何成为自动驾驶研究的事实标准平台。

2026年7月18日 · 9 分钟 · 1745 字 · 

论文精读|RT-1:Robotics Transformer——大规模真实机器人数据驱动的策略学习

RT-1是Google Robotics团队提出的一种基于Transformer的机器人策略模型,通过在超过13万条真实机器人轨迹数据上训练,实现了对700+种任务的强大泛化能力。该工作首次证明了大规模、多样化的真实数据结合高容量架构能够在机器人领域取得类似NLP和CV领域的scalable性能。

2026年7月28日 · 3 分钟 · 456 字 · 

功能安全入门:ISO 26262与SOTIF

L4自动驾驶的部署必须满足功能安全标准,但AI研究人员对此往往一片空白。本文从ISO 26262的ASIL等级与HARA分析出发,讲解功能安全的核心概念(故障/失效/危险/风险/安全目标/安全状态),再深入到SOTIF(ISO 21448)——专门针对自动驾驶’已知不安全场景’和’未知不安全场景’的安全分析框架。重点讨论VLA模型中感知不确定性量化、降级策略(degradation strategy)和安全监控(safety monitor)的工程实践。

2026年7月19日 · 4 分钟 · 745 字 ·