arXiv · Computation and Language· Krithik Vishwanath, Haitong Lin, Anton Alyakin, Jin Vivian Lee, D. Brock Hewitt, Jie J. Yao, William Robert Small, Hammad A. Khan, Cordelia Orillac, Aakaash Varma, Brandon Ye, Daniel Alexander Alber, Gustavo Stolovitzky, Batia Wiesenfeld, Oded Nov, Wei Wu, Kang Zhang, Yindalon Aphinyanaphongs, Tim Requarth, Eric Karl Oermann, The International Digital Twin Consortium in Healthcare, Medicine·· 4 hr agoAI score48
临床医生使用语言模型的方式与模型评测方式存在偏差
Clinician use of language models diverges from how the models are evaluated
AI brief
研究分析 35 个专科 6,342 名医护在八个月内向机构助手发送的 127,833 条查询,发现文档与行政占 36.2%、知识检索占 28.9%,诊断仅 3.7%,且逾三分之一查询按原样难以良好作答。将 RCQ-Map 应用于 58 个公开基准构建的 Clinical AI Benchmark Atlas 显示,基准中位不含文档请求,任务构成与真实使用仅重合 31%,评测需匹配真实临床使用。
Source: arXiv · Computation and Language · arxiv.org