
7月21日,小鹏集团称,施展发布TuringViT高效视觉编码器,面向VLM(视觉言语模子)/VLA(视觉言语作为模子)利用场景,从架构遐想、数据范式与测验经由进行了系统性重构。小鹏方面称,该编码器将用于小鹏智能驾驶、智能座舱及IRON东谈主形机器东谈主三伟业务场景。
在VLM/VLA系统中,视觉编码器频繁被视为物理AI的“感知进口”,负责将图像或视频滚动为供后续言语、作为模块处理的视觉特征。
跟着VLM/VLA时间向真实场景落地,高鉴识率图像、多视角输入和和谐视频帧对视觉编码器的效果与时序处理才调冷漠了更高条款。
小鹏方面觉得,行业大量取舍的“复用开源通用ViT”决策,难以同期得志智能驾驶、具身机器东谈主等场景对性能、蔓延与定制化的需求。
小鹏将TuringViT的遐想归纳为三个维度。
架构方面,TuringViT以Turing线性刺办法(TLA)为主,并保留极少圭臬多头刺办法,组成搀和Turing Block架构;在高鉴识率输入下,筹备复杂度由二次方缩放转为近线性。
据小鹏公布的测试数据,在1536×1536鉴识率下,TuringViT-18L的推理狡赖量达到Seed1.5-ViT的3.04倍。
该编码器提供两个规格版块:TuringViT-18L包含3组Turing Block,面向动态鉴识率下的部署;TuringViT-24L包含4组Turing Block,侧重提高表征才调。
数据方面,TuringViT取舍VISTA-Curation多模态数据科罚活水线。据小鹏方面先容,该活水线对图文和视频数据进行多阶段筛选、再行描述和评分,以提高单个样本的监督信息量。TuringViT使用0.85B图文对进行预测验,约为SigLIP2-L测验数据限制的10%。在包括ImageNet-1K在内的六项零样天职类基准上,TuringViT-24L的平均准确率为83.6%。
测验方面,TuringViT取舍四阶段渐进式原活泼态鉴识率测验决策,从预测验阶段即适配卑劣VLM/VLA的输入特色,相助二维旋转位置编码,维持不同尺寸和长宽比的输入。小鹏方面默示,这一遐想减少了对“固定鉴识率预测验+过后适配”旅途的依赖。
小鹏方面称,TuringViT将用于三类业务场景。
在智能驾驶边界,小鹏称TuringViT是第二代VLA模子的中枢视觉编码器,负责处理多路环顾录像头的高鉴识率图像和多帧动态谈路场景输入,为臆测式宇宙模子提供视觉token。
在智能座舱场景中,TuringViT的VLM原生特色用于对王人视觉特征与言语模子,并维持不同画幅和比例的视觉输入。
在小鹏IRON东谈主形机器东谈主的时间体系中,小鹏将TuringViT定位为基础视觉模块,承担物体识别、空间关连交融、可操作区域检测和动态环境跟踪等功能。
何小鹏在3月20日事迹会上称,小鹏IRON东谈主形机器东谈主经营于2026年底量产,年底月产能指标为上千台,并将优先在小鹏门店落地商用。
小鹏方面默示,TuringViT的架构遐想与测验经由不依赖特定硬件平台,可为行业提供一条可复现的视觉大模子测验旅途。
从时间布局看,TuringViT补上了小鹏物理AI时间体系中的视觉编码器一环。
此前,小鹏已接续袒露多视角生成式宇宙模子X-World、宇宙模子推理加快引擎X-Cache、臆测式宇宙模子X-Foresight及X-Mind时间框架。TuringViT则位于这套物理AI时间体系的感知输入端。
不外,视觉编码器从时间发布到实质场景的限制化落地,仍要经过工程适配、算力部署与场景考证。
TuringViT能否在车端、座舱和机器东谈主三个各异化的物理环境中雄厚开动,尚需合手续不雅察。小鹏方面默示,异日将合手续扩大高质地图文视频数据限制,深入时序建模与具身视觉标的的时间探索。
免责声明:本文内容与数据仅供参考,不组成投资建议世界杯体育,使用前请核实。据此操作,风险自担。
