跳到正文
原文
arXiv · Information Retrieval· Divya Godara, Sachin Gupta·· 3 小时前AI 评分15

EVICALC 系统报告与失败分析:DocSem 共享任务中的证据优先与算术其次

Evidence First, Arithmetic Second: A System Report and Failure Analysis for DocSem

AI 导读

summary_zh: EVICALC 在 DocSem 共享任务官方最终测试中实现 8.61% 联合准确率(1,730 个任务)。系统读取 PDF、选择段落、让语言模型生成算术表达式并在本地代码中求值,同时保存中间结果以检视失败。

来源:arXiv · Information Retrieval · arxiv.org