Skip to content
arXiv · Artificial Intelligence· Mohammadreza Sediqin, Shivali Dalmia, Srinivasa Karthikeya Reddy Kovvuri, Abhishek Mukherji·· 4 hr agoAI score55

论文提出智能体评测的可信层框架

A Trust Layer for Agent Evaluation

AI brief

论文提出 Trust Layer for Agent Evaluation,在每个基准分数旁报告其是否可信,验证结果是否由基准评分逻辑支持、通过是否来自可追踪计算、完成声明是否与实际一致,以及重复执行是否稳定。

Source: arXiv · Artificial Intelligence · arxiv.org