论文精读|Qwen-Drive-1.0:阿里通义首个驾驶视觉-语言基础模型

Qwen-Drive-1.0 基于 Qwen3.5-4B VLM 外挂两个模块:BEV感知头(3D检测+占用预测+地图分割)和 Planning Expert(~1.1B 参数 Flow Matching 轨迹生成器),四阶段渐进训练。关键设计:不设推理时打分器,直接用 Flow Matching 单次采样输出轨迹,RL 后训练用 GRPO 式分组优势优化。NAVSIM v1.1 榜上 90.7 PDMS(RL),WOD-E2E 7.91 RFS,AlpaSim 闭环 0.37 分。

2026年9月6日 · 12 分钟 · 2448 字 · 

论文精读|Qwen-VLA:阿里通义千问统一视觉-语言-动作基础模型

阿里 Qwen-VLA 用’认知主干+运动专家’双模块解耦架构(类比大脑皮层与小脑分工),将操作、导航、轨迹预测三类异构具身决策问题统一进同一模型。它采用 T2A→CPT→SFT→RL 四阶段渐进训练策略,稳定解决预训练 VLM 与随机初始化 DiT 动作解码器的不对称训练问题。在多机器人本体和多任务家族上展现一致跨任务性能与强分布外泛化。

2026年7月19日 · 3 分钟 · 610 字 ·