云霞资讯网

小鹏第二代 VLA 全新版本加上时间。那怎么理解这个「加上了时间」呢?我觉得一个

小鹏第二代 VLA 全新版本加上时间。那怎么理解这个「加上了时间」呢?

我觉得一个比较好理解的方式是:它把时间从模型的输入,变成模型的内在状态。

第一部分,过去发生的。

以前主流方案是每来一帧图像,都要把历史特征重新拼一遍再算,那就意味着算力要求很高,而且时间范围之外的东西都会被丢掉。

这样的历史往往也只用于感知、到不了决策。

小鹏的 Infini-VLA 思路是每帧信息只输入一次,汇入一条持续累计的内部状态流,车端每帧计算量因此也就是恒定的,这样让记忆窗口从行业常见的两三秒直接拉到 30 秒。

到底有什么是值得记忆的,也会用百万级 token 的超长序列训练,教会模型什么值得记,什么可以忘掉。

第二部分,对未来的推测

以前的旧范式用固定数量的查询,一次性回归出一条未来轨迹,这样的结果是确定的、单解的,没有备选的。

新版本改用 Flow Matching, 从噪声中生成多条候选轨迹,再由强化学习按安全、效率、舒适、合规四个维度打分,择优执行。

用发布会的原话说:预测更多种未来,才能选择更好的行动。

第三部分,解决实时推理。

记忆变长、未来变多,按传统的看→算→输出→再看这样的串行推理,车端芯片是不够用的。

所以小鹏选择流式自回归,当前状态由上一时刻状态与当前观测接力推出,想象层里模型生成的未来画面也会回灌为下一步输入。把历史驻留在状态里,每帧只算增量,感知、推理、执行一起,端到端响应提速 300%。

630 版本的小鹏 VLA 的逻辑是:世界模型负责想得远,状态流负责记得住,强化学习负责选得对。

小鹏g9l首发第二代vla全新版本 小鹏第二代VLA首次模型重大升级