热点事件持续更新
字幕中介的行人感知安全估计与路由方法
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
该研究提出一种可解释的行人路由方法,利用视觉-语言模型生成字幕作为中间表示来估计街道级感知安全,而非直接使用 CLIP 图像嵌入。实验覆盖曼彻斯特和哈德斯菲尔德两个地区的 654,115 张图像、36 个选区,结果显示字幕表示达到与图像嵌入相当的性能。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:00
研究提出基于字幕中介的行人感知安全估计方法,在两个英国地区大规模实验中字幕表示性能与图像嵌入相当。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv · Computer Vision基于字幕中介的行人感知安全估计与路由方法
该研究提出一种可解释的行人路由方法,通过视觉-语言模型生成字幕作为中间表示来估计街道级感知安全,而非直接使用 CLIP 图像嵌入。实验覆盖曼彻斯特和哈德斯菲尔德两个地区的 654,115 张图像、36 个选区,字幕表示达到与图像嵌入相当的性能。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。