侵权投诉
订阅
纠错
加入自媒体

Ashok 没讲的,特斯拉工程负责人Phil讲了:FSD 算法结构、代理任务与 30 万卡

2026-08-07 10:37
vehicle公众号
关注

看过我们之前文章《特斯拉 CVPR 2026 演讲全文和详解:把自动驾驶,做成「所有机器人的基础模型」》的老粉,能从全貌上明白特斯拉FSD的总体逻辑。

但是,特斯拉FSD算法到底是怎么样的结构?FSD端到端到底怎么摆脱黑盒?怎么可解释?怎么可推理?特斯拉到底怎么看VLA的?特斯拉到底用了和需要多少算力来训练其模型?Ashok Elluswamy 在那个演讲中都没有透露。

不过,Vehicle 从 CVPR 2026 DriveX Workshop 里面找到了他们工程负责人Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲。这个演讲中我们找到以上问题的答案,Phil Duan毕竟是工程负责人,人家开发落地的,Ashok Elluswamy 估计领导当久了,宏观信息多点。

所以,本文对Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲结合其PPT给大家分享和科普以上答案。

端到端:一个函数

Phil Duan在演讲首先讲了一大堆FSD安全以及为什么规则模块化算法行不通等等背景,Vehicle老粉们都熟悉了,这里就不分享了,新粉可以看看之前文章。

整场演讲的核心公式,也是特斯拉从马斯克到Ashok整体的算法叙事故事:

特斯拉把自动驾驶从"一堆工程模块的拼装",重写成了"一个视频基础模型的下一步动作预测问题"——和训练 GPT 是同一套方法论,只是把"下一个词"换成了"下一个方向盘和油门刹车"。

它和 LLM 的对应关系非常直白:输入进输出出端到端。

不过和LLM不同的是,现实世界的物理AI 闭环才是关键

不过,物理AI 模型不是"预测一次就完事",而是以极高帧率不断地"看、动、世界变了、再看"。此外,真实世界比文本世界残酷得多,复杂度更高,还需要有考虑延时。

两大问题:算法黑盒和欺骗

一,维度诅咒(严重欠约束)

输入侧:大到离谱,8 路摄像头 × 36 Hz × 高分辨率。如果按标准做法(图片切 patch图像区域小块,然后tokenize),token 数是 "billions of billions"

Phil Duan在演讲中给了一个更好理解的参照:哪怕只取很短的一段视频,token 数也是"CLIP (对比语言-图像预训练)处理一张 224×224×3 图片"的 2000 倍以上

科普插入:CLIP 处理 224×224 图片时,按 16×16 切 patch 得到 196 个 token。乘以 2000 倍就是约 40 万 token。这还只是"短短一段"。而完整的驾驶上下文远不止如此。这就是为什么演讲说"必须发明极其复杂的方法把输入压缩到可管理的上下文长度"——视频 tokenizer / 时空压缩本身就是特斯拉的核心技术资产之一。

输出侧:小到离谱只有 2 个自由度:转向角 + 加减速度。

丰富的数据,你要推导出仅仅两个维度的运动,再到不让两者相撞,这简直是Massively underconstrained(严重欠约束)。

Phil Duan在演讲的PPT 底部放了四张图作为举例:夜间高速、雪地、浓雾、白天多车道,这四个图片在视觉上天差地别的世界,但是AI给出的标签是一模一样:< drive straight >前行。

这对算法来讲是灾难, 用监督学习的语言说:你的输入熵极高,输出熵极低。

模型的梯度只能通过"2 个数字的误差"回传给一个要理解整个世界的巨大编码器。这个时候模型可能会发现一条捷径(shortcut):"管它看到什么,我直行就好,大部分时候都对。"这就是典型的 shortcut learning / 捷径学习,模型达成了低 loss,却什么都没学会。

二,因果的相关(剔除伪相关)

Phil Duan在演讲中展示了一个路口画面的图片:人类只看"左转绿箭头",但神经网络看到的是一大堆指示牌、背景里一堆绿灯、甚至远处还有"禁止驶入"标志。

在只有 2 个输出数字的监督信号下,模型凭什么知道"该看左转箭头,不该看背景那颗绿灯"? 它完全可能学到"背景有绿色,那就可以走"这种伪相关的捷径。而这种伪相关在 99% 的情况下不会出错,只会在那个致命的 1%里要命。

怎么知道环境的输入和运动控制的因果?

针对这种物理AI的复杂度问题,特斯拉算法如何破解呢?

特斯拉算法核心解法:代理任务共训练(Multi-task Co-training)

这可能是大家最不了解特斯拉算法的一部分,大家PR文章看多了,一直理解FSD端到端里面为一个无法解释的大模型。

其实这是特斯拉方案里最"反直觉但最关键"的一步,他们并没有扔掉模块化时代的遗产,而是把它们降级成了训练时的辅助信号。

Phil Duan在演讲的PPT中一共列了 16 类代理任务:3D 几何、2D/3D 目标检测、目标跟踪、语义分割、实例分割、稠密深度、场景流与光流、OCR 与标志理解、图像分类、场景理解、视觉问答、定位与建图、未来帧预测、图像重建(+ 架构图里的全景分割、3D 占用、人体网格、关键点跟踪、文字识别)。

记住这些算法名词,关注Vehicle后续有空科普,这些辅助信号就构成了特斯拉算法的三层理解:

帮助梯度流过网络。 2 个数字的梯度太稀疏,撑不起一个巨大的视觉编码器。但"这个像素属于哪个物体""这个点离你多远""这个牌子写了什么",这些任务提供的是每像素、每帧的稠密监督信号,梯度量级高出好几个数量级。

强迫模型形成正确的表征。 如果编码器的特征必须同时支持"预测 3D 占用"和"识别标志文字",它就不可能只学到"画面偏亮就直行"这种捷径——因为那种特征无法完成分割和 OCR 任务。代理任务是防止捷径学习的正则化器。

这是把"因果"注入模型的方式。 让模型能读出"左转绿箭头"(OCR + 标志理解),它才有可能建立"绿箭头,可以左转"的正确因果,而不是"背景有绿色,走"。

更绝的是Phil Duan表示这些辅助信号的代理任务的指标不是目标。特斯拉不追求把每个代理任务的指标都刷到最高,那未必让最终模型更好。它们只需要"足够健康(healthy enough)"。特斯拉唯一该衡量的,真正部署的那个任务:驾驶。

这种逻辑直接推翻了整个学术界自动驾驶 benchmark 的评价逻辑(刷 nuScenes 检测 mAP、刷 occupancy mIoU)。在特斯拉的框架里,这些指标是训练手段,不是产品目标。

不过,当前基本上国内所有端到端的算法都在用这个方法论,差距只是谁用的好与不好,算法模块是不是组合好,端到端训练是不是拉齐。

拆解了算法背后,那么接下来护城河是什么?

护城河:数据引擎

Phil Duan在演讲中演示了特斯拉数据的指标,目前特斯拉大概约 700 万台的车队每日产生驾驶时长约 500 年,日常用的典型数据集>120 年驾驶时长、数百 PB,内部 dashboard 峰值1.05 亿个视频片段 / 148 年时长,FSD 累计里程刚突破 100 亿英里。

在特斯拉的数据集里面"边缘案例"这个概念被规模消解了。 行业里所有人都在谈边缘案例,都在建仿真器去合成罕见场景。但当你有 700 万台车时,任何边缘案例都是每天发生的日常。 单个人类司机一辈子见不到的场景,特斯拉每天都在收。

在演讲中Phil Duan表示,视频数据,如果随机采样,会有 90% 是完全没用,例如一个高速驾驶视频。

所以,数据不是越多越好,而是需要多样化。那么特斯拉如何从自己的数据大海里面捞出想要的数据?

特斯拉捞数据两个准则,一个是真正有意思的片段,也就是典型和稀少场景;另外一个是模型输出与人类司机操作不一致的片段。

模型输出与人类司机操作不一致的片段本质是 disagreement mining / hard example mining。

他的逻辑是:模型和人开得一样的地方,训练它没有信息增益;只有"模型想这么开,但人类实际那么开"的地方,才携带模型尚未掌握的知识。

所以,特斯拉等于用整个车队做了一个规模空前的主动学习(active learning)循环,每一台在路上跑 FSD 的客户车,都在为下一版模型自动标注"我哪里还不行"。

很多人问,这些数据采回来,车上只有摄像头,没有激光雷达,那么我们常年需要的 3D 占用、3D 检测的 Ground Truth 从哪来?

Phil Duan在演讲中透露的答案是离线自动标注(auto-labeling),特斯拉用一套云端没有算力约束的大模型对采集到的视频跑推理,生成 3D 真值,再用来监督车端模型。这就是特斯拉云端"教师模型(teacher model)教相机端模型"——知识蒸馏 + 离线重建,是纯视觉方案能拿到 3D 监督的关键工程。

这套理论如何泛化和移植到机器人?

如何泛化:互联网数据与 Optimus 数据

Phil Duan在演讲再次确认了,特斯拉会利用互联网上视频等知识数据+自有数据+推理能力来支持泛化。

在演讲中,Phil Duan举了一个"高速上的椅子"这个例子完美说明了问题:高速公路上出现一把椅子,车辆必须避开,但你不可能等到车队采集到足够多"高速上的椅子"样本才让模型学会。

而任何互联网视频、或 Optimus 实验室的室内数据里,椅子多得是模型只要知道什么是椅子,就能在高速上认出它。

这里,在演讲中有人提问了特斯拉对当前VLA(不知道VLA可用点击我们之前文章《一文看懂视觉语言动作模型(VLA)及其应用》)的看法。

Phil Duan回复"Language is means to an end."语言是一种(而非唯一)获得世界知识和推理能力的载体。其核心思想:"真正重要的不是语言,是物理世界的知识 + 推理能力。"

如何保证安全:可验证奖励的强化学习

在本次演讲问答中,Phil Duan分享了特斯拉的端到端模型有由模仿学习(Imitation Learning)和强化学习(RL)分别承担从人类驾驶数据学"通常怎么开"和用可验证奖励学"什么绝对不能做"来做,从而防止事故发生。

"可验证奖励(verifiable reward)" 是当下大模型后训练最热的概念(RLVR,Reinforcement Learning from Verifiable Rewards)——之所以在数学、代码上 RL 效果好,是因为答案对不对可以被程序自动判定,不需要人类打分。 "有没有撞到"恰好就是这样一个完美的可验证信号:在仿真或回放中,碰撞是几何上可判定的、无歧义的、可自动计算的。所以它可以被无成本地大规模用作 RL 的奖励函数。 这解释了为什么 Phil 说"bake in 非常直接(very straightforward)"。

现在不少辅助驾驶/自动驾驶公司在神经网络输出之后,会挂一个规则化的安全监控层(轨迹碰撞校验、多方案切换、fallback 到保守策略),这种"安全兜底层"后处理来确保模型输出的安全。

Phil Duan在演讲中回答是:特斯拉不做兜底这一层。"在测试/部署时,我们基本上就是依赖模型本身来做这件事。"

这在特斯拉的架构上是自洽的,如果你在输出端挂了一个规则兜底层,你就重新引入了"人类手写规则",重新回到了 bitter lesson 的错误一侧,而且破坏了"同构算力 + 确定性延迟"的优势。

算力:30万卡

有了算法和数据,那么接下来就是算力的问题了,这次演讲Phil Duan

算是官方公布了特斯拉算力的发展和现状。拿H100 等效来衡量Tesla AI 训练算力:

2021 中 – 2023 初接近于零

2023 下半年开始阶梯式抬升

2024 年中约 90,000

2025 全年约 100,000 – 120,000

2026 年 3 月 约 140,000

2026 年 6 月 约 280,000(垂直跃升)

看来,特斯拉在 2026 年 Q2 算力卡直接翻倍,说明有一次大规模集群交付,加入AI时代的算力投资大潮。

总结:特斯拉算法

Ashok 讲的是特斯拉想去哪儿,Phil Duan 讲的是特斯拉怎么走到那儿。前者是叙事,后者是工程。对做行业内的人来说,后者更有用。

Phil Duan 这场演讲最反常识的地方在于:它把过去十年被行业抛弃的东西,又捡了回来。

感知、分割、检测、深度、光流、OCR——这些模块化时代的老任务,一个都没死。它们只是从"系统的骨架"变成了"训练的脚手架"。楼盖完了脚手架拆掉,但楼的形状是脚手架决定的。

这也是为什么"端到端 = 黑盒"这个流传最广的说法,其实是错的。FSD 内部有大量人类完全读得懂的中间表征,只是到了车上不再导出。不导出,不等于不存在。

最后留个问题给各位:如果代理任务才是端到端不塌的关键,那国内玩家和特斯拉的差距,到底是差在模型规模和算力,还是差在这十几个头选得对不对、训得齐不齐? 欢迎评论区聊聊。

参考资料以及图片

CVPR 2026 Self-Driving at Scale with Foundation Models的演讲内容 - Phil Duan (Tesla),

*未经准许严禁转载和摘录

       原文标题 : Ashok 没讲的,特斯拉工程负责人Phil讲了:FSD 算法结构、代理任务与 30 万卡

声明: 本文由入驻维科号的作者撰写,观点仅代表作者本人,不代表OFweek立场。如有侵权或其他问题,请联系举报。

发表评论

0条评论,0人参与

请输入评论内容...

请输入评论/评论长度6~500个字

您提交的评论过于频繁,请输入验证码继续

暂无评论

暂无评论

    在线客服

    文章纠错
    x
    *文字标题:
    *纠错内容:
    联系邮箱:
    *验 证 码:

    粤公网安备 44030502002758号