研究LLM代码生成中的过度自信失效
Get the story
2026年10月9日,arXiv 软件工程方向发布一手论文《LLM 代码生成中过度自信失效的特征分析》。研究在四个开源代码模型与三个基于执行的基准上考察代码 LLM 的过度自信问题,发现错误程序常以与正确程序相当的 token 级置信度生成。现有不确定性信号只能提供部分且依赖模型的执行失效证据,基于不确定性的选择并不能稳定提升接受集合准确率。指令微调与常见缓解策略均未可靠解决该失效;探索性隐层分析提示,隐藏表示可能编码了输出置信度未暴露的正确性相关信号。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Software EngineeringLLM 代码生成中过度自信失效的特征分析
论文在四个开源代码模型与三个基于执行的基准上研究代码 LLM 的过度自信问题,发现错误程序常以与正确程序相当的 token 级置信度生成。现有不确定性信号只能提供部分且依赖模型的执行失效证据,基于不确定性的选择并不能稳定提升接受集合准确率。指令微调与常见缓解策略均未可靠解决该失效,探索性隐层分析提示隐藏表示可能编码输出置信度未暴露的正确性相关信号。
Heat trend
Current heat 9·Comparable peak 10(Oct 9)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.