论文精读|OpenVLA:开源视觉-语言-动作模型——VLA走向开放生态
OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。
OpenVLA 是首个完全开源的 7B 参数视觉-语言-动作模型,在 97 万条真实机器人演示上训练,以 7 倍更少的参数超越闭源模型 RT-2-X(55B)。通过融合 DINOv2 和 SigLIP 双视觉编码器与 Llama 2 语言骨干,结合 LoRA 微调和量化推理,OpenVLA 让 VLA 模型首次走向开放生态。