arXiv · Machine Learning Theory· Hanwei Zhang, Tianma Hu, Gaojie Jin, Xu Cheng, Ronghui Mu·· 3 小时前AI 评分34
Concept Bottleneck Models 在几何-语义扰动下的鲁棒性研究
Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations
AI 导读
Concept Bottleneck Models(CBMs)旨在提供可解释的中间表示,但其鲁棒性此前结论不一。研究者提出基于生成器的评估框架,在潜在空间的连续几何扰动和概念空间的离散语义干预两种模式下对比标准分类器与 CBMs 的鲁棒性。结果表明可解释性并不天然带来鲁棒性,概念瓶颈会重新分配敏感度,揭示出依赖扰动模式和任务结构的可解释性-鲁棒性权衡。
来源:arXiv · Machine Learning Theory · arxiv.org