跳到正文
原文
arXiv · Artificial Intelligence· Min Zeng, Rui Zhang·· 16 小时前AI 评分50

研究称大语言模型随患者证据演变更新临床判断时不可靠

Large language models exhibit unreliable updating of clinical judgment as patient evidence evolves

AI 导读

论文用电子健康记录中的匹配重症监护轨迹评估大语言模型的纵向信念更新,发现基于先前判断调整时预测误差更常增加而非减少。模型对恶化呼吸证据的反应强于匹配的改善证据,先验风险从 10% 升至 90% 使估计偏移 26.2 个百分点,提示词未能恢复可靠更新。

来源:arXiv · Artificial Intelligence · arxiv.org