Skip to content
arXiv · Multiagent Systems· Aaron Rose, Carissa Cullen, Sahar Abdelnabi, Philip Torr, Brandon Gary Kaplowitz, Christian Schroeder de Witt·· 3 hr agoSelectedAI score62

通过多智能体可解释性检测多智能体共谋

Detecting Multi-Agent Collusion Through Multi-Agent Interpretability

AI brief

论文提出 NARCBench 基准,在 Qwen3-32B、Llama-3.1-70B、DeepSeek-R1 32B、GPT-OSS-20B 上评估五种聚合探测方法,识别三种共谋特征并映射到不同异常检测范式。Llama-3.1-70B 零样本迁移 AUROC 达 0.73–0.93,在隐写二十一点任务达 0.99–1.00,且检测性能随模型能力提升。代码与数据已公开。

Why it matters

提出 NARCBench 基准并验证五种探测方法,为多智能体共谋检测提供了可复现的白盒信号与跨模型证据。

Source: arXiv · Multiagent Systems · arxiv.org