arXiv · Computation and Language· Jin Huang, Diego Ferreras Garrucho, Yutong Xie, Walter M. Yuan, Qiaozhu Mei, Chen Lian, Jonathon Hazell·· 4 hr agoAI score35
HouseholdBench:评估大语言模型对家庭经济行为的预测能力
HouseholdBench: Evaluating Large Language Models as Predictors of Household Economic Behavior
AI brief
研究者推出评测基准 HouseholdBench,整合 6 项美国家庭调查与 32 项预测任务,覆盖消费、收入、劳动、预期与住房等数值、类别和概率结果。评测显示,多数专有与开源 LLM 优于无变化基线,最佳模型将数值结果误差降低 12.2%,但梯度提升树在多数任务中仍居第一,领先专有 LLM 接近其表现,开源模型落后。
Source: arXiv · Computation and Language · arxiv.org