arXiv · Artificial Intelligence· Abinitha Gourabathina, Haoran Zhang, Yuexing Hao, Walter Gerych, Marzyeh Ghassemi·· 3 小时前AI 评分52
Sense and Sensitivity:基于医生专家基准评估LLM临床分诊推荐
Sense and Sensitivity: Benchmarking LLM Clinical Triage Recommendations with Physician Experts
AI 导读
论文提出覆盖6000+临床场景、7000+医生标注和225000条模型响应的临床分诊基准,发现LLM比医生更倾向推荐不必要护理,且对性别和语气扰动更敏感。
来源:arXiv · Artificial Intelligence · arxiv.org