热点事件持续更新
DART-ES:面向进化策略微调LLM的难度感知重加权与定向回放
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月7日,arXiv Machine Learning Theory 发布一手报道,提出 DART-ES 方法,用难度感知重加权与定向回放改进进化策略(ES)对大语言模型的全参数微调,仅靠前向计算即可训练。报道给出多项实验结果:DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%;在 GSM8K 上超过 GRPO 的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。目前报道仅包含上述事实,未见与其他报道矛盾之处,也未见后续进展或独立验证信息。
AI 根据报道生成 · 2 小时前更新
最新进展10月7日 12:00
arXiv 报道 DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%。报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv · Machine Learning TheoryDART-ES:面向进化策略微调 LLM 的难度感知重加权与定向回放
提出 DART-ES,用难度感知重加权与定向回放改进进化策略(ES)对 LLM 的全参数微调,仅靠前向计算即可训练。DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。