跳到正文
热点事件持续更新

LLM生成代码检测器会过时,存在指标幻觉

2 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02 arXiv Software Engineering 发表研究,评估 8 个通用 LLM 判断器和 3 个专用检测器在 C++、Java、Python 上的表现,发现检测器会随代码生成模型演进而过时。同日同一期刊又发表另一项研究,评估 7 种前沿训练数据检测(TDD)方法在 8 个 CodeLLMs 上的表现,提出 CodeSnitch 函数级基准(含 9000 个代码样本,三种语言),并基于 Type-1 至 Type-4 代码克隆分类设计变异策略测试鲁棒性。两篇研究共同指向检测器指标与时效性问题。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    CodeSnitch:代码LLM训练数据检测的实证研究
    arXiv · Software Engineering:AI 代码生成器会泄露代码吗?对 CodeLLMs 训练数据检测的实证研究
  2. 10月2日 12:00 · 1 篇报道
    Code Detectors Have a Half-Life: LLM生成代码检测器的过时与指标幻觉
    arXiv · Software Engineering:代码检测器具有半衰期:LLM 生成代码检测中的过时与指标幻觉

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Software Engineering
    代码检测器具有半衰期:LLM 生成代码检测中的过时与指标幻觉

    研究评估了 8 个通用 LLM 判断器和 3 个专用检测器在 C++、Java、Python 上的表现,发现检测器会随代码生成模型演进而过时。

  2. arXiv · Software Engineering
    AI 代码生成器会泄露代码吗?对 CodeLLMs 训练数据检测的实证研究

    研究评估了 7 种前沿训练数据检测(TDD)方法在 8 个 CodeLLMs 上的表现。提出 CodeSnitch 函数级基准,含 9000 个代码样本(三种语言),并基于 Type-1 至 Type-4 代码克隆分类设计变异策略测试鲁棒性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。