Skip to content
Evaluation sources

Long-Horizon Terminal-Bench

Tencent HY / Lehigh 等 / 编程 · 在较长时间内持续使用终端,完成复杂工程与工具任务。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

90 分钟、2 小时和 3 小时预算分别比较;修复前后判题协议不能混排,也不能把不同 Agent 的最好结果当统一模型成绩。

How this evidence is used

候选观察:等待明确标注修复协议的新批次,现有旧分不自动采集到公开榜,也不计分;不据此断言每条旧结果都利用了漏洞。

Evaluation limits and attribution

官方披露过判题信息泄漏;当前不能证明已有成绩属于隔离判题后的同一协议。部分任务与其他专业评测的来源重叠待核。

Data license: Apache 2.0 · 官方 IntelligenceLab/LHTB-leaderboard 成绩数据集;保留署名和变更说明。

成绩由 Tencent HY / Lehigh 等 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。