Skip to content
arXiv · Computers and Society· Chris Rohlfs, Rodrigo Vergara Bosse, Priscilla Rain Hopper, Keanon O'Keefe, Patrick Russell·· 7 hr agoSelectedAI score73

教育 AI 中 LLM-as-Judge 误报问题研究:MagicSchool 的实践与优化

When Evaluators Cry Wolf: Lessons from Production LLM-as-Judge Evaluation in Educational AI

AI brief

MagicSchool 的 K-12 AI 产品每月处理数百万条师生消息,团队沿学生安全、语气与教学角色、教学价值、结构质量四维度监控输出。研究发现误报逐渐主导标记,挤占分析师对真实缺陷的注意力。

Why it matters

教育 AI 场景下通过三重优化将误报率大幅压低,同时保持严重案例捕获率,为 LLM-as-Judge 的实际部署提供可复用的调优路径。

Source: arXiv · Computers and Society · arxiv.org