跳到正文
原文
arXiv · Human-Computer Interaction· Pakhapoom Sarapat, Saksorn Ruangtanusak, Kunat Pipatanakul, Pittawat Taveekitworachai·· 3 小时前AI 评分42

角色扮演推理模型的能力泄漏问题:RoleCapBench 评测与 Injection 缓解方法

When a Kindergartener Solves Calculus: Measuring Capability Leakage in Role-Prompted Reasoning Models

AI 导读

研究发现角色扮演提示无法让推理模型的能力与角色匹配,幼儿园角色下仍能解微积分,角色声音得分 1.218–1.389 时上方角色准确率保持 0.811–0.898。提出 Injection 方法,在推理时注入角色能力指引与前缀,使上方角色准确率最多降低 0.562,角色内准确率下降小于 0.058。RoleCapBench 覆盖六种教育角色与四个评估层级,脚本与评测数据将在接收后公开。

来源:arXiv · Human-Computer Interaction · arxiv.org