arXiv · Computer Vision· Ayesh Abu Lehyeh, Jay Hwasung Jung, Safwan Wshah·· 4 hr agoAI score25
What Words Keep of a Place:跨视角地理定位的零样本语言推理研究
What Words Keep of a Place: Zero-Shot Language Reasoning for Cross-View Geo-Localization
AI brief
研究提出零样本跨视角地理定位方法,用多模态大语言模型(MLLM)把地面全景与卫星瓦片描述成结构化文本并比对,全程无需训练。在 9,826 对 VIGOR 数据上,全库按描述相似度排序 Recall@1 仅 0.39%;缩到 10 个邻近瓦片后,MLLM 评判器将随机排序效果翻倍并追平强词法基线,还能指出字段一致或冲突。
Source: arXiv · Computer Vision · arxiv.org