图1是詹锟2026年3月17日GTC 2026上讲MindVLA-o1的图。
图2是詹锟2026年6月16日Livis Day上讲马赫VLA-o1的图。
这两张图架构、设计逻辑是完全一样的,名字略有区别,MindData变成了马赫Data,MindSim: Controllable Multimodal Word Model变成了马赫World Model,MindVLA-o1变成了马赫VLA-o1。
闭环逻辑完全一致
数据引擎 ↔ 世界模型:双向交互,多模态数据生成与仿真评估;
数据引擎 → VLA 模型:向下输送标注数据,做基础训练;
世界模型 → VLA 模型:向下做闭环训练;
世界模型 ↔ 强化学习设施:双向交互,轨迹(Trajectory)回传、奖励(Reward)反馈;
强化学习设施 → VLA 模型:输出优化后的驾驶策略(Policy),形成完整训练闭环。
3处小差异:
1.MindVLA-o1中相机(Cameras)对应 3D ViT 编码器,激光雷达(Lidar)单独(既有图标又有文字)设一个Lidar Encoder,是两个独立的感知编码分支。马赫VLA-o1的图中,相机+激光雷达的图标(不含文字)都合并到同一个3D VIT Encoder中,取消了独立的激光雷达编码器模块。
备注:詹锟在2026年6月16日QA中确认3D-Vit是纯视觉方案,不依赖激光雷达。详见理想谢炎詹锟26年6月16日31个QA(下)
2.MindVLA-o1标注了是MoE(fast&slow),马赫VLA没有。
3.MindVLA-01奖励维度是是4项Corner Cases(边缘场景)、Safety(安全)、Comfort(舒适)、Driving Styles(驾驶风格),马赫VLA新增Efficiency(效率)维度。
基于此,合情推理2026年6月16日Livis Day上的马赫VLA-o1,就是2026年3月17日GTC 2026上的MindVLA-o1。
完整图文/压缩/视频详见詹锟讲理想下一代自动驾驶基础模型MindVLA-o1图文版/压缩版/视频版
PPT与所有论文PDF:
https://pan.baidu.com/s/1kNYWzsOsleHlmDMhxPd5uw 提取码: ynz6