← 返回研报监控站

汽车行业深度报告:AI系列深度07期:CNN与ViT两类视觉骨干有何差异?

机构: 东吴证券 研究员: 黄细里 评级: 增持 增持 页数: 10 日期: 2026-07-30 行业: 汽车零部件
通俗版摘要
汽车正在靠眼睛变聪明,核心是把摄像头看到的画面翻译成机器能懂的语言,关键在于选对翻译引擎。眼下主流有两类视觉骨干:CNN像按章办事的老师傅,先立规矩再干活;ViT像见多识广的新人,靠海量数据和算力自己找规律。CNN省数据、省算力、反应快,适合装进车里实时判断;ViT看得更全局、潜力大,但吃得慢、算得贵,更适合实验室和云端大模型。产业已经分层:前沿研究和多模态大模型偏爱ViT路线,量产自动驾驶更多用CNN打底再混搭注意力,形成折中方案。纯卷积网络加上现代训练技巧也能接近ViT水平,说明好模型不只靠注意力这一种解法。更长远看,懂数字世界的模型还不够,把物理世界跑通才是增量更大的方向。智能驾驶因为能形成数据闭环,最先验证物理AI的价值。风险主要来自技术迭代慢、落地速度不及预期以及商业化爬坡的不确定性。
专业版摘要
视觉骨干网络承担将原始像素转化为高层语义特征的核心功能,并决定下游分类、检测与分割任务的上限。CNN与ViT分别代表“将图像先验嵌入结构”与“将关系学习交由数据与规模”的设计哲学,其竞争本质在于先验、数据与算力的分工。视觉架构历经手工特征、CNN崛起、ViT引入注意力及2021年后的融合时代,CNN凭借局部连接、权值共享与平移等变性在数据受限与端侧实时场景中更高效,但对长程依赖建模较弱;ViT以自注意力实现首层全局交互并弱化先验,在大规模预训练下上限更高,却对数据、算力与位置编码依赖更强。ConvNeXt与MLP-Mixer等研究表明纯卷积或替代结构在现代训练范式下仍可逼近ViT,暗示视觉架构正走向任务、数据与算力约束下的动态平衡。产业落地呈现分层:多模态大模型与研究前沿普遍采用ViT或类Transformer视觉编码器,而车端量产因算力、时延与安全约束更多采用CNN前端、BEV/Transformer融合与混合骨干。数字AI底座的路径趋于确定但难以形成物理闭环,物理AI有望成为更大增量的方向,智能驾驶作为率先跑通闭环的典型场景值得重点关注。风险包括技术迭代不及预期、大模型厂商ARR增速放缓、云服务商资本开支不足以及智能驾驶与机器人商业化落地不及预期。
关联个股
查看东方财富原文 →