来自英伟达研究团队的这篇CVPR 2026论文,目前正在HuggingFace上高居热度榜第一。
这项研究推出了LocateAnything——一个重新定义边界框预测方式的视觉语言检测模型。对于AI智能体和机器人而言,"看见"物体只是第一步,真正有价值的是能以足够快的速度精准定位目标,从而驱动实际行动。
LocateAnything基于1.38亿个高质量样本训练而成,其核心突破在于采用并行解码方式预测边界框,而非传统的逐坐标顺序输出。这一架构改进在显著提升定位精度的同时,也大幅提高了视觉定位与目标检测任务的推理吞吐量。
项目主页:http://t.cn/AX61yMUZ http://t.cn/AX61yJJ4
