arXiv · Computers and Society· Xi Zhao, Xinyue Jiao, Zhen Xu·· 4 hr agoAI score50
超越分数准确性:审视 LLM 生成的结构化评估在高等教育中的诊断质量
Beyond Score Accuracy: Examining the Diagnostic Quality of LLM-Generated Structured Assessment in Higher Education
AI brief
研究基于 JorGPT 数据集(3,041 条学生作答、50 道开放性计算机科学题),对比人类教师与三款商业 LLM 的评分,发现 LLM 结构化评估存在三类系统性偏差。子维度分数高度相关(r = 0.82-0.99,VIF 最高 45),文本反馈对学生误解的检出率仅 5-7%(教师为 15-31%),且语气一律偏积极;评分准确性随知识领域波动,程序性主题最可靠。
Source: arXiv · Computers and Society · arxiv.org