小鹏成立 12 年,终于让一辆车增加了 30 秒记忆。听上去像一笔极不划算的时间买卖。毕竟,今天随便一个大语言模型都能吞下几十万字的上下文。它可以记住一份财报、一部小说,甚至你半年前随口说过的黑历史。相比之下,一辆售价几十万元、装着多颗 AI 芯片的汽车,记忆只有 30 秒,多少显得有点寒碜。但在物理世界里,30 秒并不短。时速 90 公里时,汽车 30 秒能跑 750 米。一个行人从路边探身、犹豫、后退,又突然折返;一辆右侧车辆连续几次压线,随后加速抢进车道;前车的刹车灯亮了两次,车流开始像手风琴一样收紧。单看其中任何一帧,AI 可能都认得出人、车和道路。把这些瞬间串起来,它才有机会明白一件更重要的事:接下来会发生什么。8 月 27 日,小鹏在广州发布第二代 VLA 的首次重大升级。新版本端侧模型参数量扩大 3.5 倍,Infini-VLA 架构可以保留此前 30 秒的道路信息,流式推理让端到端响应速度提升 300%,X-Foresight 则尝试推演未来 6 秒的场景。全新 XOS 6.3.0 将由小鹏 G9L 首发搭载。AI 开始理解时间。自动驾驶最大的盲区,藏在上一秒过去很多智驾系统像一群分工明确、但互相不太熟的部门。感知模块负责认出前方有一辆车,预测模块计算它可能往哪走,规划模块决定减速还是变道,控制模块再把决定变成方向盘和踏板动作。前一个部门传错一句话,后面所有人都可能一本正经地做错事。端到端模型把这些环节压进同一个网络,减少了信息在模块之间搬运时的损耗。然而,如果模型主要盯着当下画面,它依然更像一个反应很快的新手司机。看见加塞再刹车,看见行人迈步再让行,每次都答对了眼前这道题,却没有读懂整张卷子的上下文。老司机的经验往往不在“看见了什么”,而在“看见它怎么变成现在这样”。右侧那辆车是不是要加塞,关键并非它位于右侧,而是它刚才还与前车保持距离,现在却连续贴近车道线?物理世界中的危险很少突然生成,它通常先露出一小截因果关系。所以,小鹏这次把 30 秒历史、实时推理和 6 秒预测放在一起,意义不只是“看得更久”。它试图让历史、现在与未来同时进入一次驾驶决策。这有点像教人下棋。只问下一步落子,背棋谱就够了。逼他推演六步以后,才看得出他究竟懂不懂棋。让 AI 多想一会,汽车却不能等问题随之而来:历史越长、未来越远,计算量越大。聊天机器人多想两秒,用户顶多敲敲桌子。时速 90 公里的汽车多想两秒,已经向前冲出 50 米。这正是此次升级最值得看的矛盾。模型既要获得更长的记忆和更复杂的推演能力,又必须在车端有限的算力与功耗里实时运行。想得更多,反而要答得更快。小鹏的办法,是把过去那种“看、计算、输出、再看”的离散流程,改成持续接收画面、持续推理、持续行动的流式过程。旧画面里已经算过的内容尽量复用,关键时刻投入更多计算,不重要的视觉信息则压缩掉。它追求的不是让汽车写出一篇漂亮的思维过程,而是留下几个真正影响动作的判断:减速、等待、准备变道。X-Foresight 披露的训练数据包含约 28 万小时驾驶视频、3400 万个最长 30 秒的片段和 7 路环视摄像头。在同规模的内部对照中,引入预测式世界模型后,碰撞失败率从 0.228%降至 0.191%,相对下降 16.2%。AI infra比单个模型更加重要小鹏称,目前一次模型训练的数据吞吐量已经超过 1 亿个视频片段,比半年前提高 10 倍。此前公布的 X-World 系统拥有超过 50 万个仿真场景,每天完成相当于 3000 万公里真实道路的模拟测试。2025 年,小鹏研发投入达到 94.9 亿元,同比增长 47%。这些数字拼出的并非一个“更大模型”的故事,而是一座模型工厂:车队把真实世界的异常送回来,系统从海量视频中找到值得训练的片段,世界模型在仿真中反复制造难题,评估工具筛出退步与风险,新模型再被压缩、部署回车端。真正稀缺的并非数据,而是从一百万次“无事发生”里捞出一次“差点出事”的能力。一段普通的直路行驶视频,存一万遍也不会自动变成壁垒。难的是给数据建立语义,找出陌生场景,把同一个危险动作放进不同光线、天气和国家的道路里反复验证。机器只有 30 秒记忆,公司必须有十年记忆。这也解释了小鹏为何反复强调 AI Infra。汽车行业过去的核心资产是工厂、供应链和经销网络;到了物理 AI 阶段,模型迭代系统开始变成另一条生产线。谁能稳定地生产下一代模型,谁才可能吃到规模效应。从 2014 年成立算起,小鹏走了 12 年,把汽车的记忆向过去拉到 30 秒,又把它的目光向未来推了 6 秒。对人的一生来说,这点时间微不足道;对一辆正在驶过路口的车来说,已经足够把一次条件反射变成一次提前判断。人类依靠时间理解世界,机器也开始补这门课。每一条真实道路,都是考场。
小鹏让 AI 增加 30 秒记忆
来源:PingWest
2026年08月29日 02:01
0 阅读
分享到: