arXiv · Computer Vision· Qingtao Xia, Siyao Cheng, Jiahua Bao, Jiaxing Du, Jie Liu·· 16 小时前AI 评分36
检索到却读不懂:提取文本何时弥合文档视觉语言模型的检索—阅读鸿沟
Found but Not Read: When Extracted Text Closes the Retrieval-Reading Gap in Document Vision-Language Models
AI 导读
研究提出检索—阅读鸿沟:文档视觉语言模型(VLM)即使检索到正确页面,也常不利用其中证据。在带可追溯证据的 FoveaDoc-Bench 上,检索几乎覆盖全部证据页,但加入 CPU-OCR 文本使严格准确率提升 13 至 16 个百分点,精确文本层约使增益翻倍。
来源:arXiv · Computer Vision · arxiv.org