首页
看点啥
插画图片
首页 看点啥 LocateAnything - 英伟达视觉语言定位模型正式推出

LocateAnything - 英伟达视觉语言定位模型正式推出

2026-07-26 0

LocateAnything是什么

LocateAnything是英伟达推出的视觉语言定位模型,基于并行框解码技术,用户输入自然语言即可在图像中精准框选目标。模型支持多目标检测、GUI定位、OCR文本检测和点级指向等任务,推理速度达12.7 BPS(H100),较Qwen3-VL快10倍,在LVIS等基准达SOTA,适用机器人、文档智能与自动驾驶场景。

LocateAnything的主要功能

LocateAnything的技术原理

微信关注回复“开源”,加入AI开源项目交流群

如何使用LocateAnything

LocateAnything的核心优势

LocateAnything的项目地址

LocateAnything的同类竞品对比

对比维度LocateAnything-3BRex-Omni所属机构NVIDIA 英伟达开源社区产品定位通用视觉语言定位与检测模型通用视觉定位与理解模型核心解码技术并行框解码(PBD),原子化单次预测完整边界框串行/混合坐标 token 生成推理速度(H100)12.7 BPS~5.0 BPS速度倍数基准慢约 2.5 倍LVIS 精度(F1@Mean)50.746.9COCO 精度(F1@Mean)54.752.9Dense200 精度58.758.3DocLayNet 文档精度76.870.7M6Doc 文档精度70.155.6TotalText(OCR)43.340.6HumanRef 指代定位68.865.4

LocateAnything的应用场景

喜欢(0)

上一篇

谷歌推出全新AI生图模型Nano Banana 2 Lite: 4 秒出图:主打高频批量内容生产

谷歌推出全新AI生图模型Nano Banana 2 Lite: 4 秒出图:主打高频批量内容生产

下一篇

百度浏览器如何设置才能禁止网页自动播放视频和音频

百度浏览器如何设置才能禁止网页自动播放视频和音频
猜你喜欢