跳到正文

#教程/实践

今日 2 条
8月28日周五
8月26日周三
8月25日周二
  1. Hugging Face Blog67

    Granite 4.2 推理模型构建方法解析

    IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。

    推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。

8月22日周六
  1. Sebastian Raschka62

    Claude 文本水印机制详解

    Sebastian Raschka 讲解了 Claude 文本水印的工作原理:水印在采样阶段通过密钥与锦标赛采样引入确定性,检测时无需重新运行模型,只需用相同密钥和函数对文本计分并设阈值。移除水印需编辑未知的水印位置,可能导致文本质量下降。

8月21日周五
  1. Ben's Bites · News60

    作者亲述如何从零搭建个人 Agent 与轻量记忆

    作者分享新个人 Agent 的文件结构,包含 AGENTS.md、code.md、todos.md、memory.md、log.md,并指出 git 历史可替代 log.md;记忆方面倾向手动维护最小文件而非自动保存,同时用子文件夹组织记忆指针。文中还对比了 Claude Cowork 与 ChatGPT 的异同。

8月18日周二
  1. Hugging Face Blog62

    Dharma AI:GPU管理实践——相同集群提升33个百分点利用率

    Dharma AI发布约束感知GPU分配器,在七种基准场景中对比FIFO调度器,相同硬件与负载下GPU利用率提升最多33个百分点,优先级加权输出最多提升105%。该方法将实时推理视为需求曲线而非固定预留,按优先级跨整个调度 horizon 放置批量任务,并通过22维特征预测训练负载与周需求画像来支撑调度决策。

    推荐理由:同一集群通过调整分配顺序而非更换硬件,实现了最高33个百分点的利用率提升,为企业GPU调度提供了可复用的约束感知方法。

8月15日周六
  1. Sebastian Raschka36

    从零构建 AI 文本检测器

    summary_zh: 作者结合 Substack 新推出的 AI 检测器功能与本地 DIY LLM 项目,演示如何从零实现一个 AI 文本检测器,并将其用作验证器训练小语言模型生成可规避检测的文本。

8月14日周五
  1. Hugging Face Blog74

    Strands Robots、LeRobot 与 Hugging Face Storage Buckets 打通录制、训练与部署循环

    Strands Robots 演示了用 Storage Bucket 记录 LeRobot 格式数据、通过字节级去重同步、从 Hub 流式读取训练、再以 mode='real' 部署到物理机器人的完整循环。示例使用 SO-100 机械臂和 mock policy,配套 notebook 在模拟环境即可运行。

    推荐理由:原文给出一条从录制到训练再到部署的完整数据循环,读者可据此判断它会怎样改变现有机器人工作流。

8月10日周一
  1. Interconnects65

    Nathan Lambert 新书《Reinforcement Learning from Human Feedback》要点概览

    Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。

7月23日周四
  1. Vector Institute33

    Mixture-of-Experts:从稀疏路由到多模态部署

    MoE 模型通过路由器为每个 token 动态选择少量专家子网络激活,在增加总参数的同时保持每 token 计算稀疏。文章首先解释路由决策、负载均衡与训练中 specialization 的形成机制,随后报告了在 4 张 A100 GPU 上微调 350 亿参数多模态 MoE 的经验,涵盖 5 种失败的 sharding 方案、最终成功的方法,以及按层路由审计揭示的音频、视频与文本容量分配。

7月18日周六
7月4日周六
  1. Lilian Weng77

    Harness Engineering for Self-Improvement

    Lilian Weng 梳理了 harness 工程如何支撑递归自改进(RSI),将 harness 定义为围绕基础模型的运行时系统,负责编排执行、工具调用、上下文管理、状态持久化与结果评估。

    推荐理由:原文系统梳理了 harness 工程的设计模式与优化路径,读者可借此理解自改进循环中非模型层的角色与边界。

6月27日周六
6月17日周三
5月29日周五
  1. Together AI78

    Together AI 构建最快语音转文本栈的方法

    Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。

    推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。

5月19日周二
4月18日周六
4月4日周六
  1. Sebastian Raschka63

    编码智能体的六个核心组件

    Sebastian Raschka 梳理了编码智能体(coding harness)的六个组件:实时仓库上下文、提示词形状与缓存复用、结构化工具与权限、上下文压缩、结构化会话记忆以及有界子代理委托,并配套了纯 Python 最小实现 mini-coding-agent。文章指出,LLM 本身能力相近时,harness 的设计往往是区分实际编码体验的关键。

3月22日周日
  1. Sebastian Raschka46

    大语言模型注意力变体视觉指南

    Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。

3月11日周三
  1. Mistral AI42

    基于 Vibe 构建 Rails 测试代理:让代理自动编写开发者不愿写的测试

    基于 Mistral 开源编码助手 Vibe 构建了一个自主代理,能自动读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行。通过 AGENTS.md 上下文工程和按文件类型分类的 SKILLS 文件,质量分数从 0.68 提升到 0.74。该代理并行处理多个文件,并自动管理 factories 和 fixtures 等共享上下文,避免测试遗漏。

2月12日周四
  1. Andrej Karpathy · Notes70

    microgpt:200行Python从零实现GPT

    Andrej Karpathy发布开源项目microgpt,单文件200行纯Python无依赖,完成数据集加载、分词、自定义autograd、GPT-2风格架构、Adam优化器、训练与推理全流程。模型在32,000个名字数据集上训练1,000步,损失从约3.3降至约2.37,并生成新名字样例。附逐步代码解读与从train0.py到train5.py的渐进构建路径。

1月24日周六
1月22日周四
10月5日周日
9月6日周六
5月1日周四
  1. Lilian Weng76

    为什么我们需要思考:测试时计算与思维链综述

    Lilian Weng 综述了测试时计算与思维链(CoT)的最新进展,涵盖动机、心理类比、并行采样与顺序修正、RL 训练、忠实性分析与连续空间思考等主题,并讨论了奖励黑客与可扩展性边界。

    推荐理由:原文系统梳理了测试时计算与思维链的技术全景,读者可借此理解不同推理增强方法的原理、适用边界与已知风险。

11月28日周四
  1. Lilian Weng56

    强化学习中的 Reward Hacking

    Lilian Weng 梳理了强化学习中 reward hacking 的定义、成因与典型示例,并重点分析了 RLHF 训练下语言模型的对齐风险。文中列举了模型篡改单元测试、迎合用户偏好以及 LLM 作为评分器出现位置偏差等案例,并介绍了 Goodhart 定律、虚假相关、奖励篡改与上下文奖励黑客等概念。

7月7日周日
  1. Lilian Weng46

    大语言模型的外在幻觉(Extrinsic Hallucinations)

    文章将幻觉限定为模型输出未被上下文或世界知识支撑的编造内容,重点讨论外在幻觉,即输出应基于预训练数据的事实性。Gekhman et al. 2024 发现微调新知识时模型学得慢,且学会后增加幻觉倾向;最佳验证表现出现在多数 Known 样本被学会、仅少数 Unknown 样本被学会时。FactualityPrompt 与 FActScore 等方法通过命名实体错误率和蕴含比来量化幻觉。

4月12日周五
  1. Lilian Weng39

    Diffusion Models for Video Generation

    扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。

3月28日周四
2月25日周日
2月5日周一
  1. Lilian Weng36

    高质量人工数据:收集、标注与质量保障

    高质量人工数据是深度学习模型训练的关键燃料,任务设计、标注者筛选与培训、数据聚合及质量保障各环节均影响最终数据质量。早期研究如1907年Nature的"Vox populi"和2009年Callison-Burch对Amazon Mechanical Turk的实验表明,通过加权方案可有效降低噪声标注者干扰,提升众包标注与专家判断的一致性。

12月17日周日
10月25日周三
  1. Lilian Weng47

    LLM 对抗攻击综述

    对抗攻击通过精心构造的输入触发大语言模型输出不安全内容,攻击者可在白盒(获取梯度信号)或黑盒(仅通过 API)设定下操作。常见方法包括 Token 替换、基于梯度的攻击、Jailbreak 提示、人工红队与模型红队攻击,其中 TextAttack 等框架实现了针对分类与生成任务的对抗样本生成。

6月23日周五
  1. Lilian Weng74

    LLM Powered Autonomous Agents

    Lilian Weng 综述了以 LLM 为核心控制器的自主智能体系统,涵盖规划(含 CoT、Tree of Thoughts、ReAct、Reflexion、Chain of Hindsight 与 Algorithm Distillation)、记忆(短时与长时记忆及外部向量检索)与工具使用(MRKL、Toolformer、HuggingGPT 与 API-Bank 等)。

3月15日周三
1月11日周三
  1. Lilian Weng36

    大型 Transformer 模型推理优化

    summary_zh: 大型 Transformer 模型推理面临高内存占用与自回归解码难以并行两大瓶颈,KV 缓存随序列长度二次增长。文章重点介绍网络压缩(剪枝、量化、蒸馏)与架构改进两类优化手段,并以 DistilBERT 为例说明蒸馏可减少 40% 参数同时保持 97% 性能、运行速度提升 71%。

9月9日周五
4月16日周六
2月20日周日