NVIDIA开源了视觉定位通用模型LocateAnything(已被ECCV 2026接收)。 针对以往多模态模型逐个坐标串行生成的效率瓶颈,它引入并行框解码(PBD),把检测框和点视为原子单元单步直出,并结合混合推理模式在速度与格式准确性间取得平衡。 在7.85亿标注框数据加持下,该模型能通吃密集检测、GUI界面定位及OCR等多类任务;单卡H100实测吞吐达12.7 BPS,相比同类方案提速显著并拿下多项SOTA。 目前已开放3B权重、LoRA微调与针对A100等架构优化的批推理代码