arXiv · Computers and Society· Steven Denney, Matthew DiGiuseppe·· 4 hr agoAI score32
JEV 对比 LLM:七项政治学复现实验的准确率、成本与校准度
JEV versus LLMs: Accuracy, Cost and Calibration on Seven Political Science Replications
AI brief
JEV 在七项政治学复现任务中与 GPT-6 Luna 和 Qwen3.8-27B 能力相当或接近,但按 OpenAI 批量定价并无成本优势。单次提问时 JEV 的概率校准优于 GPT-6 Luna 的 token 概率,却并非稳定优于 Qwen3.8-27B;除非需要速度,JEV 唯一明显优势是便于解析选项概率。
Source: arXiv · Computers and Society · arxiv.org