arXiv · Computation and Language· Xinkai Chen·· 3 小时前AI 评分20
Structure vs. Chain-of-Thought: 评估 LLM 抑郁症严重程度提取标准
Structure vs. Chain-of-Thought: Evaluating LLM Criteria Extraction for Depression Severity
AI 导读
研究比较了 LLM 直接评分与标记 PHQ-9/BDI-II 临床标准再计数两种方式在 Reddit 语料上的抑郁严重程度评估,采用二次加权 Kappa 衡量一致性。
来源:arXiv · Computation and Language · arxiv.org