网易首页 > 网易号 > 正文 申请入驻

AI Agent颠覆了端到端了吗?

0
分享至

这几个月,已经有些科技企业和主机厂试图用AI Agent(智能体)做自动驾驶,声称能规避端到端的弊端。当然,这些做法也没大声嚷嚷。一个是监管因素,另一个可能是AI Agent才刚刚起步。

端到端的长尾能力,为什么不行

经过一年多的商业化落地,端到端+VLM(视觉语言大模型)在长尾场景中表现不如期待,背后的原因是决策短视。在中我们曾经讨论过,端到端往往以单帧画面、单步动向作为决策依据,缺乏对未来数秒内连贯的规划能力,没有形成“策略序列”。这一点上不如人类。其实无须长尾,就一个简单的左转,端到端也是只考虑下一秒动作,没有完整的通过路口的规划。之所以实际动作看上去还算连贯,是由多个“下一秒动作”串起来。一旦中间出岔子,需要改变计划的时候,系统就缺乏应变能力。

背后还有一个原因,就是端到端的感知是被动的。模型训练阶段就固定接收低维度文本指令(如速度、导航信息)和完整视觉信息。对图像的关键细节缺乏关注,形成视觉忽视。到底什么才被认定为“关键细节”,是人类驾驶的核心技能。


比如等待左转的经典场景:左转灯刚亮,右侧人行横道远端晃过一团影子。电光火石间,人马上就察觉到存在两个不合理之处:一个是人行横道方向正处于红灯,另一个即便在人行道上,这个速度也绝对不是行人。只有注意到“异常”,才会及时刹车。多半是外卖电动车顺人行横道闯红灯抢行。

如果只注重信号灯、交通规则和前一秒的画面,就不会有制动决策。端到端的无依托左转向来有问题,就是因为处理不了这种复杂场景。

对于不确定又很关键的视觉信息,人类司机的处理方式,通常都是“再看一眼”或“凑近点看”。如果情况紧急则采取保守策略。

显然,人类应对长尾的行为,包含了策略序列和主动感知两个重要能力。

世界模型的合成数据,两种大模型训练效果不同

有些企业就想用AI Agent的方式来解决解决长尾问题。在线互动上,智能体已经获得广泛应用。想想打银行客服电话,对面是谁接起电话。智能体不止能当客服和电子助手,在线教学、客户专业支持、数据库助手……看上去智能体似乎更胜任与人类互动。在车端,智能体也首先用于座舱互动。

将其作为聊天助手,其引擎通常就是LLM(大语言模型)。如果搭建VLA(语言-视觉-行为大模型),即从思考范式上成为一个驾驶智能体(模拟司机),是不是能够更好地解决长尾问题,让智驾具备L3能力呢。

两者都需要大模型训练、蒸馏和车端转移小模型。不过,两者区别几乎体现在所有环节。端到端为了应对长尾,需要大量实车数据。世界模型生成的合成数据,用于端到端训练效果不好。


简单说,合成数据可以扩充样本,但是没办法解决“零样本泛化”的问题。比如我们用各种“鬼探头”合成数据训练端到端大模型,感觉练得也挺好的,结果一上路,碰到一辆驴车,又懵了。长尾是无穷无尽的,非结构性场景最好由认知推动,由数据推动的端到端训练效果不理想。模拟考经常得高分,一上正式考场就考砸。

Agent可以玩命用世界模型训练。合成环境对现实物理模拟很粗糙,但Agent可以通过视觉轨迹奖励,优化决策。与端到端的被动视觉不同,Agent通过多次主动视觉-动作的反馈,探索合理策略。这和人思维模式很像了,面对陌生场景,用保守方法(低速跟前车,随时改变策略)试错。而不是像端到端那样的内部黑箱。

看和听的能力

主动视觉有两个特征,一个是“对齐”,另一个是自动调整权重。调权重很容易理解,在雨雪雾天气里面,激光雷达和摄像头都会受到强干扰,而且这些干扰很难用滤波手段去除。这个时候,如果降低摄像头感知权重,提升毫米波雷达权重,将减少误判。人也是如此,黑暗的环境下,人虽然不能像蝙蝠那样发出超声波探路,但不由自主“竖起耳朵”专注于声音,同时降低视觉敏感度。

而“对齐”也是人类的核心技能。面对一幅画面或者动态图,如果有人说,找找画面里面的“半个苹果”,你还会关注每个细节吗?显然不,你只会快速扫描整幅图,去找那个符合语言特征的玩意。顺便说一句,驾驶当中,交通标志标线、各种画面、人类口语,都是“大语言”。

这就是语言和图像的“对齐”。一句话一般只与画面中特定细节对应。如果提供一个长文本,任何受过基础教育的人,也是迅速找到与图画描述有关的词句。然后和画面特定位置建立映射。Agent也具有这个能力,即建立了跨模态语义匹配与融合能力。


一辆车如果由AI Agent驾驶,人可以随时发号施令:“跟住前面第二辆红车,别管眼前这辆白的”。系统自己会选择“一组”合理策略执行这道模糊的命令。

想做到这一点,需要完成视觉语言的基座训练(主要练“对齐”),思维-动作后训练(其中关键是扩散模型,持续预测轨迹和环境,以便调整),强化训练(包含刚才说的奖励模型)。这些训练完成之后,能在车端运行的AI Agent也就有了。

内化规则

和端到端需要另加规则兜底不同,AI Agent可以内化规则,就通过奖励函数学习的方式。比如让行救护车、消防车等,Agent计算“让行代价=延误时间×急迫系数”、“不让行风险=事故概率×伤亡可能性”等量化规则,而非依赖一堆条件语句。

AI Agent的核心突破在于,分层推理将数据转化为可交互的知识,其训练过程更接近人类驾驶员的经验积累模式——在理解规则的基础上通过实践优化策略。也因为同样原因,人可以与AI Agent互动,参与驾驶。这是“人机共驾”的高级阶段,不是通过控制权交接,而是用语言就能互动和干预。

语言映射和决策-行为多次反馈机制,与人开车的方式也很类似。与端到端相比,强学习的AI Agent更像人,其推理结果和行为模式都可以验证和反推,与端到端不同。

两者暂时各擅胜场

说了这么多AI Agent的优点,是不是说它可以一脚将端到端踢开,成为智驾主流?AI Agent有个很大的缺点——决策时间长,都是秒级的。对于一些紧急情况,显然不行。因此有些企业试图让端到端主导99%的L2场景,即轻量化思考;只有1%左右的长尾场景,由AI Agent来完成复杂博弈。后者的思维链也不能太长,最多三四层。再长的话人受不了,就像临门一脚思考人生一样诡异。

当然这是实验性质的。两种架构融合在一起,才有商业化部署的价值(比如云端协同)。如果能为世界模型开发出高保真物理引擎,强化学习可能训练出同时具备精准控制和复杂博弈能力的时敏型驾驶模型。

这需要解决三个问题:逻辑链的实时性瓶颈、神经符号系统保障决策的可解释性、跨场景认知迁移机制。

当前条件下,端到端方案仍是L2量产的最优解。虽然没摸到其能力边界,但有能力登上L3高台阶的,大概率是AI Agent,只要解决其思考时长问题。而复杂泊车等非时敏型场景,现在AI Agent就已经解决得很好。


自动驾驶的核心矛盾,一直都是无限场景空间与有限训练资源的对抗。端到端方案更倾向于通过实车数据提升数据利用效率,AI Agent则通过决策范式以降低数据依赖。两者关系如同内燃机与电动机——短期并存满足不同场景需求,长期催生融合新架构。或者还有一种可能,就是其中一种解决自身瓶颈,从而取代对方。看长期的话,AI Agent更有希望做到这一点。

注:图片部分来源网络,如有侵权,联系删除。

“消失的前车”透露了智驾哪方面缺陷?

克服AI幻觉?也许在开智驾倒车

2025过半,整车市场终局的端倪

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
印度人:要是中国真比印度发达,为啥中国城市大街看不到突突车?

印度人:要是中国真比印度发达,为啥中国城市大街看不到突突车?

沙雕小琳琳
2026-09-08 17:12:32
上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

上海男子飞美国航班上挥拳打人,落地被捕次日凌晨全家遭遣返,一拳打没了全家美国签证

Mr王的饭后茶
2026-09-07 20:07:14
突发!成龙确诊ADHD,热搜炸了!

突发!成龙确诊ADHD,热搜炸了!

财经要参
2026-09-08 12:00:03
女篮世界杯疯狂一夜!6,队拿到出线名额,2,队闯进八强

女篮世界杯疯狂一夜!6,队拿到出线名额,2,队闯进八强

紧跟时代脉搏
2026-09-09 00:26:18
2-1!意甲劲旅逆转+第88分钟绝杀 3连胜紧追国米 48岁加图索正名

2-1!意甲劲旅逆转+第88分钟绝杀 3连胜紧追国米 48岁加图索正名

我爱英超
2026-09-08 06:45:29
2026款五羊 S150上市 售价0.598万元起

2026款五羊 S150上市 售价0.598万元起

车质网
2026-09-07 13:50:08
中科院:江浙沪血液有害物质浓度爆表!

中科院:江浙沪血液有害物质浓度爆表!

生命科学前沿
2024-03-27 17:38:51
1939年长沙会战,得知后面的追兵是南京屠城的第六师团,中国士兵们只说了一句话

1939年长沙会战,得知后面的追兵是南京屠城的第六师团,中国士兵们只说了一句话

饭小妹说历史
2026-09-08 09:05:31
在江浙沪,反向就业就要火了。

在江浙沪,反向就业就要火了。

老陆不老
2026-09-08 21:13:13
雷军展示“折叠机的坟场 :干了8万次跌落 摔了1500多台工程机 花费几千万元

雷军展示“折叠机的坟场 :干了8万次跌落 摔了1500多台工程机 花费几千万元

快科技
2026-09-08 08:00:04
30岁退役的英超欧冠双料球星,被赌博拖垮

30岁退役的英超欧冠双料球星,被赌博拖垮

码上闲叙
2026-09-08 18:04:43
大衣哥朱之文被投诉了!投诉理由是穿地主装唱红歌《我的祖国》,网友:先普及一下什么是爱国服装

大衣哥朱之文被投诉了!投诉理由是穿地主装唱红歌《我的祖国》,网友:先普及一下什么是爱国服装

火山詩话
2026-09-07 07:30:23
江苏最大高铁站还没通车,一个隐患已经摆在面前

江苏最大高铁站还没通车,一个隐患已经摆在面前

牛锅巴小钒
2026-09-08 17:23:15
专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

专家谈华为首款韬定律芯片麒麟9050 Pro:为全球集成电路产业发展打开新思路

快科技
2026-09-08 08:32:04
中日要有重头戏?日媒爆料:高市政府协商出席APEC,中国非去不可

中日要有重头戏?日媒爆料:高市政府协商出席APEC,中国非去不可

吕醿极限手工
2026-09-08 16:13:50
这条无耻新闻,终于引起公愤了!

这条无耻新闻,终于引起公愤了!

胖胖说他不胖
2026-09-07 11:50:18
突然,全线大跳水!股市、黄金、白银,集体杀跌!发生了什么?

突然,全线大跳水!股市、黄金、白银,集体杀跌!发生了什么?

证券时报
2026-09-08 19:00:04
伟大的2-0爆冷!郑钦文一战创历史,赢麻了:排名飙升+狂揽523万

伟大的2-0爆冷!郑钦文一战创历史,赢麻了:排名飙升+狂揽523万

大秦壁虎白话体育
2026-09-08 02:24:44
越南新娘嫁到浙江18年,第一次回娘家,丈夫给了她一箱方便面

越南新娘嫁到浙江18年,第一次回娘家,丈夫给了她一箱方便面

流萤叙情
2025-09-05 18:22:25
沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

沉默六天,终于瞒不住了!中方登船检查3小时,日本政府罕见失声

哎呀哎呀看电影
2026-09-07 18:38:48
2026-09-09 03:28:49
新浪汽车出品 incentive-icons
新浪汽车出品
一家有理想的汽车媒体
4150文章数 1162关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

伊朗称捕获美军先进潜航器 现场画面公布

头条要闻

伊朗称捕获美军先进潜航器 现场画面公布

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

智谱六连跌失守1000大关,发生了什么?

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

时尚
旅游
本地
房产
公开课

会穿衣的女性,能够借助最合适的单品,"修身上衣"显瘦又大方

旅游要闻

探访金刚碑温泉老村 名人故居有了不同的打开方式

本地新闻

宁波,中国制造的隐藏大佬

房产要闻

真快啊!海口这个超级城更,又有大动作!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版