跳到正文
热点事件持续更新

DART-ES:面向进化策略微调LLM的难度感知重加权与定向回放

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月7日,arXiv Machine Learning Theory 发布一手报道,提出 DART-ES 方法,用难度感知重加权与定向回放改进进化策略(ES)对大语言模型的全参数微调,仅靠前向计算即可训练。报道给出多项实验结果:DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%;在 GSM8K 上超过 GRPO 的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。目前报道仅包含上述事实,未见与其他报道矛盾之处,也未见后续进展或独立验证信息。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv · Machine Learning Theory
    DART-ES:面向进化策略微调 LLM 的难度感知重加权与定向回放

    提出 DART-ES,用难度感知重加权与定向回放改进进化策略(ES)对 LLM 的全参数微调,仅靠前向计算即可训练。DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。