arXiv · Computation and Language· Thomas Reiter, Christoph Kern, Fedor Miasnikov, Sofiia Nikolenko, Rob Chew, Stephanie Eckman, Frauke Kreuter·· 5 小时前AI 评分58
可靠但设计敏感:LLM标注中的工具不确定性
Reliable but Design-Sensitive: Instrument Uncertainty in LLM Annotation
AI 导读
研究测试了7个LLM、12种任务设计、3次独立运行,对3000条推文进行冒犯性语言与仇恨言论标注。同一模型与任务设计下中位Fleiss' κ达0.91,更换任务设计后Cohen' κ降至0.76。
来源:arXiv · Computation and Language · arxiv.org