跳到正文
原文
arXiv · Computation and Language· Xinkai Chen·· 3 小时前AI 评分20

Structure vs. Chain-of-Thought: 评估 LLM 抑郁症严重程度提取标准

Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity

AI 导读

研究比较了 LLM 直接评分与标记 PHQ-9/BDI-II 临床标准再计数两种方式在 Reddit 语料上的抑郁严重程度评估,采用二次加权 Kappa 衡量一致性。

来源:arXiv · Computation and Language · arxiv.org