arXiv · Machine Learning Theory· Ahmed Nebli·· 3 小时前AI 评分28
Phase-HDC:用梯度阈值替代优化器历史状态的离散相位学习
Phase-HDC: Replacing Optimizer History with Gradient Thresholds in Discrete Phase Learning
AI 导读
Phase-HDC 提出一种只存模型、不存优化器历史状态的训练方法:每次更新最多把低比特角度参数移动一步,且仅当梯度足够大时触发。该规则是“每个被改参数支付固定代价”的一阶损失模型的精确解;在其余条件不变时,其精度与使用 6-bit moments 的 Adam 相当,存储少 3 倍。
来源:arXiv · Machine Learning Theory · arxiv.org