arXiv · Computation and Language· Jhen-Ke Lin, Chung Chun Wang·· 3 小时前AI 评分35
StreamDecisionBench:评估语言流中决策在力(in force)的准确性
StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams
AI 导读
StreamDecisionBench(SDB)评估语言模型在流式证据下的决策在力准确性,将每个错误时刻归因于判断、延迟或两者。测试覆盖四个应用家族、六个设置下的四个托管模型,在 1-5 秒更新间隔内,归一化曲线下面积得分与无时序准确率和 Oracle 时序得分乘积差距在 2.9 分以内。
来源:arXiv · Computation and Language · arxiv.org