跳到正文
原文
arXiv · Software Engineering· Tianlin Li, Yunxiang Wei, Zhiming Li, Aishan Liu, Qing Guo, Xianglong Liu, Dongning Sun, Yang Liu·· 3 小时前AI 评分27

AI 代码生成器会泄露代码吗?对 CodeLLMs 训练数据检测的实证研究

Are AI Coders Snitches? An Empirical Study of Pretraining Data Detection on Code Large Language Models

AI 导读

研究评估了 7 种前沿训练数据检测(TDD)方法在 8 个 CodeLLMs 上的表现。提出 CodeSnitch 函数级基准,含 9000 个代码样本(三种语言),并基于 Type-1 至 Type-4 代码克隆分类设计变异策略测试鲁棒性。

来源:arXiv · Software Engineering · arxiv.org