arXiv · Machine Learning Theory· Zhishen Sun, Hongzhan Wang, Sizhe Dang, Guang Dai, Haishan Ye·· 4 hr agoAI score33
DART-ES:面向进化策略微调 LLM 的难度感知重加权与定向回放
DART-ES: Difficulty-Aware Reweighting and Targeted Replay for Fine-Tuning LLMs with Evolution Strategies
AI brief
提出 DART-ES,用难度感知重加权与定向回放改进进化策略(ES)对 LLM 的全参数微调,仅靠前向计算即可训练。DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。
Source: arXiv · Machine Learning Theory · arxiv.org