arXiv · Machine Learning Theory· Michael Tang, Mahmoud Abdelgalil, Jorge I. Poveda·· 4 小时前AI 评分30
欺骗性 Bandit 问题:探索耦合与多智能体学习的脆弱性
The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning
AI 导读
论文证明随机探索的独立性与隐私性对安全至关重要,对手可利用另一智能体探索的特权信息实施欺骗。在最小双人强单调设定下,欺骗者获得仅与受害者探索相关的泄露信号,通过将自身探索动作与该信息耦合,注入外部性并把学习动态导向新的稳态——欺骗性纳什均衡(DNE)。
来源:arXiv · Machine Learning Theory · arxiv.org