跳到正文
原文
arXiv · Artificial Intelligence· Hoda Ayad, Tanu Mitra, Abhishek Mukherji·· 16 小时前AI 评分39

CuBEs:文化情境化行为评测与文化盲 LLM 评测的局限

CuBEs: Culturally-Situated Behavioral Evaluations and the Limitations of Culture-Blind LLM Judges

AI 导读

研究者提出 CuBEs(Culturally-situated Behavior Evaluations),通过自动化测试管线把文化上下文注入行为测试场景与评测,用于探测 LLM 的谄媚、自我偏好、过度自信等行为。

来源:arXiv · Artificial Intelligence · arxiv.org