arXiv · Computer Vision· Simon Parkinson, Paloma Liu, Wei Zheng, Mohammadreza Sheikhfathollahi·· 3 小时前AI 评分36
基于字幕中介的行人感知安全估计与路由方法
Caption-Mediated Perceived-Safety Estimation for Pedestrian Routing
AI 导读
该研究提出一种可解释的行人路由方法,通过视觉-语言模型生成字幕作为中间表示来估计街道级感知安全,而非直接使用 CLIP 图像嵌入。实验覆盖曼彻斯特和哈德斯菲尔德两个地区的 654,115 张图像、36 个选区,字幕表示达到与图像嵌入相当的性能。
来源:arXiv · Computer Vision · arxiv.org