Ashok 没讲的,特斯拉工程负责人Phil讲了:FSD 算法结构、代理任务与 30 万卡
看过我们之前文章《特斯拉 CVPR 2026 演讲全文和详解:把自动驾驶,做成「所有机器人的基础模型」》的老粉,能从全貌上明白特斯拉FSD的总体逻辑。
但是,特斯拉FSD算法到底是怎么样的结构?FSD端到端到底怎么摆脱黑盒?怎么可解释?怎么可推理?特斯拉到底怎么看VLA的?特斯拉到底用了和需要多少算力来训练其模型?Ashok Elluswamy 在那个演讲中都没有透露。
不过,Vehicle 从 CVPR 2026 DriveX Workshop 里面找到了他们工程负责人Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲。这个演讲中我们找到以上问题的答案,Phil Duan毕竟是工程负责人,人家开发落地的,Ashok Elluswamy 估计领导当久了,宏观信息多点。
所以,本文对Phil Duan (Tesla)名为Self-Driving at Scale with Foundation Models的演讲结合其PPT给大家分享和科普以上答案。
端到端:一个函数
Phil Duan在演讲首先讲了一大堆FSD安全以及为什么规则模块化算法行不通等等背景,Vehicle老粉们都熟悉了,这里就不分享了,新粉可以看看之前文章。

整场演讲的核心公式,也是特斯拉从马斯克到Ashok整体的算法叙事故事:
特斯拉把自动驾驶从"一堆工程模块的拼装",重写成了"一个视频基础模型的下一步动作预测问题"——和训练 GPT 是同一套方法论,只是把"下一个词"换成了"下一个方向盘和油门刹车"。
它和 LLM 的对应关系非常直白:输入进输出出端到端。
不过和LLM不同的是,现实世界的物理AI 闭环才是关键
不过,物理AI 模型不是"预测一次就完事",而是以极高帧率不断地"看、动、世界变了、再看"。此外,真实世界比文本世界残酷得多,复杂度更高,还需要有考虑延时。
两大问题:算法黑盒和欺骗
一,维度诅咒(严重欠约束)
输入侧:大到离谱,8 路摄像头 × 36 Hz × 高分辨率。如果按标准做法(图片切 patch图像区域小块,然后tokenize),token 数是 "billions of billions"
Phil Duan在演讲中给了一个更好理解的参照:哪怕只取很短的一段视频,token 数也是"CLIP (对比语言-图像预训练)处理一张 224×224×3 图片"的 2000 倍以上
科普插入:CLIP 处理 224×224 图片时,按 16×16 切 patch 得到 196 个 token。乘以 2000 倍就是约 40 万 token。这还只是"短短一段"。而完整的驾驶上下文远不止如此。这就是为什么演讲说"必须发明极其复杂的方法把输入压缩到可管理的上下文长度"——视频 tokenizer / 时空压缩本身就是特斯拉的核心技术资产之一。
输出侧:小到离谱只有 2 个自由度:转向角 + 加减速度。
丰富的数据,你要推导出仅仅两个维度的运动,再到不让两者相撞,这简直是Massively underconstrained(严重欠约束)。
Phil Duan在演讲的PPT 底部放了四张图作为举例:夜间高速、雪地、浓雾、白天多车道,这四个图片在视觉上天差地别的世界,但是AI给出的标签是一模一样:< drive straight >前行。
这对算法来讲是灾难, 用监督学习的语言说:你的输入熵极高,输出熵极低。
模型的梯度只能通过"2 个数字的误差"回传给一个要理解整个世界的巨大编码器。这个时候模型可能会发现一条捷径(shortcut):"管它看到什么,我直行就好,大部分时候都对。"这就是典型的 shortcut learning / 捷径学习,模型达成了低 loss,却什么都没学会。
二,因果的相关(剔除伪相关)
Phil Duan在演讲中展示了一个路口画面的图片:人类只看"左转绿箭头",但神经网络看到的是一大堆指示牌、背景里一堆绿灯、甚至远处还有"禁止驶入"标志。
在只有 2 个输出数字的监督信号下,模型凭什么知道"该看左转箭头,不该看背景那颗绿灯"? 它完全可能学到"背景有绿色,那就可以走"这种伪相关的捷径。而这种伪相关在 99% 的情况下不会出错,只会在那个致命的 1%里要命。
怎么知道环境的输入和运动控制的因果?
针对这种物理AI的复杂度问题,特斯拉算法如何破解呢?
特斯拉算法核心解法:代理任务共训练(Multi-task Co-training)
这可能是大家最不了解特斯拉算法的一部分,大家PR文章看多了,一直理解FSD端到端里面为一个无法解释的大模型。
其实这是特斯拉方案里最"反直觉但最关键"的一步,他们并没有扔掉模块化时代的遗产,而是把它们降级成了训练时的辅助信号。
Phil Duan在演讲的PPT中一共列了 16 类代理任务:3D 几何、2D/3D 目标检测、目标跟踪、语义分割、实例分割、稠密深度、场景流与光流、OCR 与标志理解、图像分类、场景理解、视觉问答、定位与建图、未来帧预测、图像重建(+ 架构图里的全景分割、3D 占用、人体网格、关键点跟踪、文字识别)。
记住这些算法名词,关注Vehicle后续有空科普,这些辅助信号就构成了特斯拉算法的三层理解:
帮助梯度流过网络。 2 个数字的梯度太稀疏,撑不起一个巨大的视觉编码器。但"这个像素属于哪个物体""这个点离你多远""这个牌子写了什么",这些任务提供的是每像素、每帧的稠密监督信号,梯度量级高出好几个数量级。
强迫模型形成正确的表征。 如果编码器的特征必须同时支持"预测 3D 占用"和"识别标志文字",它就不可能只学到"画面偏亮就直行"这种捷径——因为那种特征无法完成分割和 OCR 任务。代理任务是防止捷径学习的正则化器。
这是把"因果"注入模型的方式。 让模型能读出"左转绿箭头"(OCR + 标志理解),它才有可能建立"绿箭头,可以左转"的正确因果,而不是"背景有绿色,走"。
更绝的是Phil Duan表示这些辅助信号的代理任务的指标不是目标。特斯拉不追求把每个代理任务的指标都刷到最高,那未必让最终模型更好。它们只需要"足够健康(healthy enough)"。特斯拉唯一该衡量的,真正部署的那个任务:驾驶。
这种逻辑直接推翻了整个学术界自动驾驶 benchmark 的评价逻辑(刷 nuScenes 检测 mAP、刷 occupancy mIoU)。在特斯拉的框架里,这些指标是训练手段,不是产品目标。
不过,当前基本上国内所有端到端的算法都在用这个方法论,差距只是谁用的好与不好,算法模块是不是组合好,端到端训练是不是拉齐。
拆解了算法背后,那么接下来护城河是什么?
护城河:数据引擎
Phil Duan在演讲中演示了特斯拉数据的指标,目前特斯拉大概约 700 万台的车队每日产生驾驶时长约 500 年,日常用的典型数据集>120 年驾驶时长、数百 PB,内部 dashboard 峰值1.05 亿个视频片段 / 148 年时长,FSD 累计里程刚突破 100 亿英里。
在特斯拉的数据集里面"边缘案例"这个概念被规模消解了。 行业里所有人都在谈边缘案例,都在建仿真器去合成罕见场景。但当你有 700 万台车时,任何边缘案例都是每天发生的日常。 单个人类司机一辈子见不到的场景,特斯拉每天都在收。
在演讲中Phil Duan表示,视频数据,如果随机采样,会有 90% 是完全没用,例如一个高速驾驶视频。
所以,数据不是越多越好,而是需要多样化。那么特斯拉如何从自己的数据大海里面捞出想要的数据?
特斯拉捞数据两个准则,一个是真正有意思的片段,也就是典型和稀少场景;另外一个是模型输出与人类司机操作不一致的片段。
模型输出与人类司机操作不一致的片段本质是 disagreement mining / hard example mining。
他的逻辑是:模型和人开得一样的地方,训练它没有信息增益;只有"模型想这么开,但人类实际那么开"的地方,才携带模型尚未掌握的知识。
所以,特斯拉等于用整个车队做了一个规模空前的主动学习(active learning)循环,每一台在路上跑 FSD 的客户车,都在为下一版模型自动标注"我哪里还不行"。
很多人问,这些数据采回来,车上只有摄像头,没有激光雷达,那么我们常年需要的 3D 占用、3D 检测的 Ground Truth 从哪来?
Phil Duan在演讲中透露的答案是离线自动标注(auto-labeling),特斯拉用一套云端没有算力约束的大模型对采集到的视频跑推理,生成 3D 真值,再用来监督车端模型。这就是特斯拉云端"教师模型(teacher model)教相机端模型"——知识蒸馏 + 离线重建,是纯视觉方案能拿到 3D 监督的关键工程。
这套理论如何泛化和移植到机器人?
如何泛化:互联网数据与 Optimus 数据
Phil Duan在演讲再次确认了,特斯拉会利用互联网上视频等知识数据+自有数据+推理能力来支持泛化。
在演讲中,Phil Duan举了一个"高速上的椅子"这个例子完美说明了问题:高速公路上出现一把椅子,车辆必须避开,但你不可能等到车队采集到足够多"高速上的椅子"样本才让模型学会。
而任何互联网视频、或 Optimus 实验室的室内数据里,椅子多得是模型只要知道什么是椅子,就能在高速上认出它。
这里,在演讲中有人提问了特斯拉对当前VLA(不知道VLA可用点击我们之前文章《一文看懂视觉语言动作模型(VLA)及其应用》)的看法。
Phil Duan回复"Language is means to an end."语言是一种(而非唯一)获得世界知识和推理能力的载体。其核心思想:"真正重要的不是语言,是物理世界的知识 + 推理能力。"
如何保证安全:可验证奖励的强化学习
在本次演讲问答中,Phil Duan分享了特斯拉的端到端模型有由模仿学习(Imitation Learning)和强化学习(RL)分别承担从人类驾驶数据学"通常怎么开"和用可验证奖励学"什么绝对不能做"来做,从而防止事故发生。
"可验证奖励(verifiable reward)" 是当下大模型后训练最热的概念(RLVR,Reinforcement Learning from Verifiable Rewards)——之所以在数学、代码上 RL 效果好,是因为答案对不对可以被程序自动判定,不需要人类打分。 "有没有撞到"恰好就是这样一个完美的可验证信号:在仿真或回放中,碰撞是几何上可判定的、无歧义的、可自动计算的。所以它可以被无成本地大规模用作 RL 的奖励函数。 这解释了为什么 Phil 说"bake in 非常直接(very straightforward)"。
现在不少辅助驾驶/自动驾驶公司在神经网络输出之后,会挂一个规则化的安全监控层(轨迹碰撞校验、多方案切换、fallback 到保守策略),这种"安全兜底层"后处理来确保模型输出的安全。
Phil Duan在演讲中回答是:特斯拉不做兜底这一层。"在测试/部署时,我们基本上就是依赖模型本身来做这件事。"
这在特斯拉的架构上是自洽的,如果你在输出端挂了一个规则兜底层,你就重新引入了"人类手写规则",重新回到了 bitter lesson 的错误一侧,而且破坏了"同构算力 + 确定性延迟"的优势。
算力:30万卡
有了算法和数据,那么接下来就是算力的问题了,这次演讲Phil Duan
算是官方公布了特斯拉算力的发展和现状。拿H100 等效来衡量Tesla AI 训练算力:
2021 中 – 2023 初接近于零
2023 下半年开始阶梯式抬升
2024 年中约 90,000
2025 全年约 100,000 – 120,000
2026 年 3 月 约 140,000
2026 年 6 月 约 280,000(垂直跃升)
看来,特斯拉在 2026 年 Q2 算力卡直接翻倍,说明有一次大规模集群交付,加入AI时代的算力投资大潮。
总结:特斯拉算法
Ashok 讲的是特斯拉想去哪儿,Phil Duan 讲的是特斯拉怎么走到那儿。前者是叙事,后者是工程。对做行业内的人来说,后者更有用。
Phil Duan 这场演讲最反常识的地方在于:它把过去十年被行业抛弃的东西,又捡了回来。
感知、分割、检测、深度、光流、OCR——这些模块化时代的老任务,一个都没死。它们只是从"系统的骨架"变成了"训练的脚手架"。楼盖完了脚手架拆掉,但楼的形状是脚手架决定的。
这也是为什么"端到端 = 黑盒"这个流传最广的说法,其实是错的。FSD 内部有大量人类完全读得懂的中间表征,只是到了车上不再导出。不导出,不等于不存在。
最后留个问题给各位:如果代理任务才是端到端不塌的关键,那国内玩家和特斯拉的差距,到底是差在模型规模和算力,还是差在这十几个头选得对不对、训得齐不齐? 欢迎评论区聊聊。
参考资料以及图片
CVPR 2026 Self-Driving at Scale with Foundation Models的演讲内容 - Phil Duan (Tesla),
*未经准许严禁转载和摘录
原文标题 : Ashok 没讲的,特斯拉工程负责人Phil讲了:FSD 算法结构、代理任务与 30 万卡
图片新闻
最新活动更多
-
10月14日立即报名>> 【重庆站】PNT关键技术与测试验证研讨会
-
精彩回顾立即查看>> 【线上直播】松下透明导电膜车载应用在线研讨会
-
精彩回顾立即查看>> 【线下会议】恩智浦创新技术峰会·深圳
-
精彩回顾立即查看>> 【在线直播】可视化神器!VisionSym 赋能汽车光学原型开发
-
精彩回顾立即查看>> 12月16-17日 AMD 嵌入式峰会
-
精彩回顾立即查看>> 恩智浦创新技术峰会
推荐专题
- 器件研发经理 广东省/珠海市
- 激光器高级销售经理 上海市/虹口区
- 光模块软件工程师 江苏省/无锡市
- 光学研发高级工程师 广东省/深圳市
- 资深激光器研发经理 江苏省/苏州市
- 智慧制造项目经理 江苏省/徐州市
- 技术总监 湖南省/长沙市
- 结构工程师 广东省/深圳市
- 电子工程师(LED显示屏) 广东省/深圳市
- (高级)耦合工艺工程师 广东省/深圳市


分享











发表评论
登录
手机
验证码
手机/邮箱/用户名
密码
立即登录即可访问所有OFweek服务
还不是会员?免费注册
忘记密码其他方式
请输入评论内容...
请输入评论/评论长度6~500个字
暂无评论
暂无评论