跳到正文
原文
arXiv · Computation and Language· Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter·· 5 小时前AI 评分58

可靠但设计敏感:LLM标注中的工具不确定性

Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation

AI 导读

研究测试了7个LLM、12种任务设计、3次独立运行,对3000条推文进行冒犯性语言与仇恨言论标注。同一模型与任务设计下中位Fleiss' κ达0.91,更换任务设计后Cohen' κ降至0.76。

来源:arXiv · Computation and Language · arxiv.org