Skip to content
arXiv · Computation and Language· Xueting Fang, Zehui Li, Yang Yang, Camilla Giovino, Shubh K. Patel, Shailly Prajapati, Vallijah Subasri, Caihua Shan·· 7 hr agoSelectedAI score60

KlinikeBench:超越诊断准确率的大语言模型临床评估基准

KlinikeBench: Evaluating Language Models Beyond Diagnostic Accuracy

AI brief

arXiv 论文提出 KlinikeBench,包含 333 个由临床医生撰写的任务,在隔离沙盒中评估大语言模型与虚拟患者的交互式临床接诊能力。31 个模型和 7 个模型家族的实验显示,表现最好的模型(如 GPT-6-astra 和 Claude Opus 5)在任务成功率低于 30%,尽管其诊断准确率达 90.7%。基准揭示诊断准确率与交互式临床评估之间存在显著差距。

Why it matters

原文揭示了诊断准确率与交互式临床评估之间的显著差距,为理解大语言模型在真实医患对话中的实际边界提供了新测试平台。

Source: arXiv · Computation and Language · arxiv.org