跳到正文

#教程/实践

今日 0 条
9月29日周二
9月9日周三
8月25日周二
  1. Hugging Face Blog67

    Granite 4.2 推理模型构建方法解析

    IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。

    推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。

8月10日周一
  1. Interconnects65

    Nathan Lambert 新书《Reinforcement Learning from Human Feedback》要点概览

    Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。

3月28日周四