arXiv · Computation and Language· Himarsha R. Jayanetti, Sivakanesan Dhanushkanda, Shuai Hao, Michael L. Nelson, Michele C. Weigle·· 4 hr agoAI score30
人类、专用工具与 LLM 在社交媒体文本情感分析上均难达共识
Nobody Truly Agrees on Sentiment: Humans, Bespoke Tools, and LLMs Struggle with Social Media Texts
AI brief
研究评估 TextBlob、VADER、Twitter-roBERTa-base 与 Qwen3-32B、GPT-OSS-120B、Llama-4-Maverick-17B 在 100 条推文上与 6 名人类标注者的一致性,Cohen's kappa 与 Fleiss' kappa 显示人类间仅 fair agreement。
Source: arXiv · Computation and Language · arxiv.org