arXiv · Computation and Language· Lukas Thede, Yash Kumar Atri, David Chen, Danielle Bitterman, Matthias Bethge, Tom Hartvigsen, Zeynep Akata·· 3 小时前AI 评分35
MedKIT:评估大语言模型的知识整合与泛化能力
MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models
AI 导读
MedKIT 是一个面向医学领域的知识整合与迁移评测基准,针对临床证据更新序列,评估模型在词汇变体、关系变换、组合推理和操作化任务上的知识可用性。研究覆盖 12 种知识整合策略和 5 个通用及医学大语言模型,发现大多数方法在原更新任务和词汇变体上表现良好,但关系泛化、组合推理和操作任务均无显著提升。
来源:arXiv · Computation and Language · arxiv.org