热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后

小鹏甩出TuringViT视觉编码器:只用十分之一数据,却把SOTA基线甩在身后

来源:互联网 更新时间:2026-07-22 15:42

先说一个行业里不太被公开说破的事实:视觉大模型这些年一直卡在一道隐形门槛上——想要顶尖效果,就得先砸下天量的数据和算力。结果就是,真正能玩转视觉大模型的,始终是少数几家头部团队。直到7月21日,小鹏集团拿出了TuringViT高效视觉编码器,这个局面才有了被打破的可能。

从架构、数据范式到训练流程,TuringViT把视觉编码器从头到尾重新梳理了一遍。它给出的不是某个单一环节的优化,而是一套系统性的解决方案。更重要的是,这条路径是可复现的、低成本的,意味着达到了SOTA水平的视觉Transformer训练,不再是少数团队的专属特权,整个行业都能从中受益。

这次TuringViT的定位非常明确:面向VLM与VLA时代的到来,全面支撑小鹏的三大业务场景——智能驾驶、智能座舱和IRON人形机器人。为了达成这个目标,它从架构、数据和训练三个维度同步突破,搭建起一套以线性注意力、高质量数据治理和原生动态分辨率为核心的技术体系,在效果、效率和落地性上同时拉满。

image.png

训练流程上,TuringViT采用了一套四阶段渐进式原生动态分辨率训练范式。从预训练的第一天起,它就在主动适配下游VLM和VLA的输入特性,这跟过去那种先固定分辨率预训练、再事后做适配的传统做法,完全是两码事。

这套编码器在小鹏的技术体系里已经有了明确的落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头传来的高分辨率、多帧动态道路场景,为预测式世界模型提供视觉token。面向智能座舱和驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型的对齐更加高效,不同画幅和比例的视觉输入都能被灵活处理,这为更丰富的座舱交互功能打下了基础。而在小鹏IRON人形机器人体系里,它扮演的角色相当于视觉视网膜,负责物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪这些基础感知能力。可以说,TuringViT的发布,是在为这个行业补上一块关键拼图。

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc