arXiv · Statistics Machine Learning· Nikolaj Thams, Anton Rask Lundborg·· 3 小时前AI 评分29
条件独立性检验中的嵌入偏差
Embedding-Bias in Conditional Independence Testing
AI 导读
论文研究以嵌入向量 ψ(Z) 替代文本或图像 Z 做条件独立性检验时的偏差问题,指出嵌入检验的有效性无法由数据确认,失效时原假设下的拒绝概率可趋于 1。研究给出偏差恒等式:偏差等于遗漏部分的绝对相关乘以两个偏 R² 的几何平均,并提出在声明容差下稳健的检验。在合成数据与文本嵌入上该稳健检验近似保持水平;在语言模型生成的文本上,即使使用生成器自身状态,任何嵌入都会使嵌入检验产生偏差。
来源:arXiv · Statistics Machine Learning · arxiv.org