Skip to content
Hot eventLive

研究:LLM评分与反馈的诊断质量存在系统性缺陷

1 reports1 sources4 hr ago updated

Get the story

AI overview

2026年10月8日,一篇发表于arXiv Computers and Society的研究《超越分数准确性:审视LLM生成的结构化评估在高等教育中的诊断质量》报告了相关发现。研究基于JorGPT数据集,包含3,041条学生作答与50道开放性计算机科学题,对比人类教师与三款商业LLM的评分,识别出LLM结构化评估中的三类系统性偏差:各子维度分数高度相关(r=0.82–0.99,方差膨胀因子VIF最高达45),提示维度间缺乏独立性;文本反馈对学生误解的检出率仅5–7%,而教师为15–31%;反馈语气一律偏积极。同时,评分准确性随知识领域波动,程序性主题最可靠。该研究未涉及此前其他数字或说法,无矛盾之处。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 8, 2026
  1. arXiv · Computers and Society
    超越分数准确性:审视 LLM 生成的结构化评估在高等教育中的诊断质量

    研究基于 JorGPT 数据集(3,041 条学生作答、50 道开放性计算机科学题),对比人类教师与三款商业 LLM 的评分,发现 LLM 结构化评估存在三类系统性偏差。子维度分数高度相关(r = 0.82-0.99,VIF 最高 45),文本反馈对学生误解的检出率仅 5-7%(教师为 15-31%),且语气一律偏积极;评分准确性随知识领域波动,程序性主题最可靠。

Heat trend

Current heat 9·Comparable peak 10(Oct 8)·Comparable change over 24 hours –

02.557.510Oct8Oct8Oct8Oct8

The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.