关闭AI文档助手功能:拓展人类创造力的边界
2026-07-21 3415389
2026-07-21 0
视觉大模型长期被一个隐形门槛卡着:想拿到顶尖效果,就得先囤够天量数据和算力,这让先进视觉能力成了少数头部团队的专属玩具。7月21日,小鹏集团发布TuringViT高效视觉编码器,宣称从架构、数据范式到训练流程系统性重构了视觉编码器,为行业提供了一条可复现、低成本的SOTA级视觉Transformer训练路径,把先进视觉大模型从头部专属推向行业普惠。
TuringViT的定位很清晰:面向VLM与VLA时代,全面支撑智能驾驶、智能座舱和IRON人形机器人三大业务场景。它从架构、数据、训练三个维度同步突破,搭起一套线性注意力主导、高质量数据治理、原生动态分辨率三位一体的技术体系,在效果、效率与落地性上做三重提升。

训练流程上,TuringViT采用四阶段渐进式原生动态分辨率训练范式,从预训练第一天起就适配下游VLM与VLA的输入特性,彻底告别了固定分辨率预训练再加事后适配的传统模式。
这套编码器在小鹏的技术体系里已经有了明确落点。在智能驾驶领域,它是第二代VLA模型的核心视觉编码器,负责处理多路环视摄像头的高分辨率、多帧动态道路场景输入,为预测式世界模型提供视觉token;面向智能座舱与驾泊一体化,TuringViT的VLM原生特性让视觉特征与语言模型实现更高效对齐,可支撑不同画幅和比例的视觉输入,为更丰富的座舱交互功能打底;在小鹏IRON人形机器人体系里,它则扮演着视觉视网膜的核心角色,提供物体细粒度识别、空间关系理解、可操作区域检测和动态环境追踪等基础感知能力。项目主页已上线 https://turingvit.github.io/。