arXiv · Artificial Intelligence· Nishtha N. Vaidya, Stephan Grimm, Thomas Hubauer, Thomas A. Runkler·· 3 小时前AI 评分35
面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准
Ontology-Grounded, Reasoner-Verified Benchmarks for Evaluating LLM Reasoning in Scientific AI
AI 导读
该研究提出从 OWL 2 本体自动生成多选题基准的流水线,正确答案由本体锚定,干扰项通过 OWL 推理器形式化验证。在 Pizza(112 题)、PMDco(2,491 题)和 DOID(15,216 题)三个本体上生成基准,6 个 LLM 零样本准确率为 41.1%-76.8%,显著高于 25% 随机基线。
来源:arXiv · Artificial Intelligence · arxiv.org