跳到正文
原文
arXiv · Computation and Language· Jhen-Ke Lin, Chung Chun Wang·· 3 小时前AI 评分35

StreamDecisionBench:评估语言流中决策在力(in force)的准确性

StreamDecisionBench: Evaluating Decisions in Force on Evolving Language Streams

AI 导读

StreamDecisionBench(SDB)评估语言模型在流式证据下的决策在力准确性,将每个错误时刻归因于判断、延迟或两者。测试覆盖四个应用家族、六个设置下的四个托管模型,在 1-5 秒更新间隔内,归一化曲线下面积得分与无时序准确率和 Oracle 时序得分乘积差距在 2.9 分以内。

来源:arXiv · Computation and Language · arxiv.org