arXiv · Computation and Language· Aishik Nagar, Abhishek Vaidyanathan, Arun-Kumar Kaliya-Perumal, Elijah Tzen Hsuen Boey, Stefan Winkler·· 16 小时前AI 评分51
研究发现开放权重 LLM 潜在空间中存在可定位且可因果使用的临床概念中心
Clinical Concept Centers in LLMs
AI 导读
论文在 11 个开放权重 LLM 的潜在空间中发现可解释、仅在对应临床叙事上激活并因果驱动行为的临床概念中心。对抗性角色提示下模型仍保持内部一致并使用相关概念中心,沿这些中心 steering 可带来下游临床表现提升,盲测医生验证显示其激活与使用情况可预测医生偏好。
来源:arXiv · Computation and Language · arxiv.org