arXiv · Software Engineering· Tianlin Li, Yunxiang Wei, Zhiming Li, Aishan Liu, Qing Guo, Xianglong Liu, Dongning Sun, Yang Liu·· 3 小时前AI 评分27
AI 代码生成器会泄露代码吗?对 CodeLLMs 训练数据检测的实证研究
Are AI Coders Snitches? An Empirical Study of Pretraining Data Detection on Code Large Language Models
AI 导读
研究评估了 7 种前沿训练数据检测(TDD)方法在 8 个 CodeLLMs 上的表现。提出 CodeSnitch 函数级基准,含 9000 个代码样本(三种语言),并基于 Type-1 至 Type-4 代码克隆分类设计变异策略测试鲁棒性。
来源:arXiv · Software Engineering · arxiv.org