arXiv · Machine Learning Theory· Sungyoon Kim, Kaan Ozkara, Youngsuk Park·· 3 小时前AI 评分30
用链式 LMO 优化大语言模型
Optimizing Large Language Models with Chained LMOs
AI 导读
论文提出链式线性最小化预言机(chained LMO),把多矩阵归一化优化器统一为 LMO 组合,并指出许多链式方法在光滑凸目标上可能发散。理论分析基于线性联想记忆,表明链式结构在各向异性嵌入下可优于 Muon。新优化器 TensorChain 在 Qwen3 0.6B 与 1.7B 预训练中平均 token 效率领先所有链式基线,在相同验证损失下较 Muon 平均节省 9.6% token。
来源:arXiv · Machine Learning Theory · arxiv.org