跳到正文

#教程/实践

今日 2 条
12月5日周日
  1. Lilian Weng20

    半监督学习(Semi-Supervised Learning)综述:一致性正则化与 Π-model

    半监督学习同时利用有标签与无标签数据训练模型,损失函数为 L = Ls + μ(t)Lu,其中 μ(t) 随训练步 ramp up。无监督损失基于一致性正则化:同一输入经不同数据增强或 Dropout 后,模型预测应保持一致。该思想被 SimCLR、BYOL、SimCSE 等自监督方法采用,Π-model 通过两次前向传播最小化输出差异。

9月24日周五
7月11日周日
  1. Lilian Weng18

    什么是 Diffusion Models(扩散模型)?

    扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。

3月21日周日
  1. Lilian Weng37

    Reducing Toxicity in Language Models

    summary_zh: 大型预训练语言模型在训练过程中会不可避免地从互联网数据中习得毒性行为与偏见,安全部署需要对生成过程进行有效控制。毒性内容涵盖侮辱、仇恨言论、网络欺凌等多种类型,现有分类体系如 OLID 采用三级层次结构区分攻击类型与目标。

1月2日周六
  1. Lilian Weng37

    Controllable Neural Text Generation

    summary_zh: 文章探讨如何引导无条件语言模型生成受控文本,涵盖三种主要路径:测试时贪心解码与重采样、基于提示词的设计与自动搜索、以及微调基础模型或可操纵层。

10月29日周四
  1. Lilian Weng14

    如何构建开放域问答系统?

    开放域问答(ODQA)要求模型在无相关上下文的情况下回答事实性问题,分为开放书与闭卷两种设定。常见方案采用检索器-阅读器框架,先从外部知识库(如 Wikipedia)检索相关文档,再由阅读器抽取答案。检索器可使用基于 TF-IDF 的传统信息检索或基于密集向量的神经检索。

8月6日周四
6月7日周日
1月29日周三
  1. Lilian Weng27

    强化学习的课程训练(Curriculum for Reinforcement Learning)

    课程学习通过从简单到复杂的样本安排加速模型收敛,Bengio 等人(2009)提出聚焦"有趣"样本的策略。Zaremba & Sutskever(2014)在 LSTM 数学程序预测中发现混合课程(naive + mix)优于单一策略。PCG 被用于 GVGAI、CoinRun、Procgen 等 RL 基准以提升泛化,POET 结合进化算法与程序化关卡进一步改善泛化。

11月10日周日
  1. Lilian Weng36

    自监督表征学习(Self-Supervised Representation Learning)

    自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。

9月5日周四
  1. Lilian Weng12

    Evolution Strategies(进化策略)

    summary_zh: 进化策略(ES)属于进化算法(EA)家族,是一种黑箱优化方法,适用于无法直接计算梯度的目标函数 f(x): R^n → R。与遗传算法不同,ES 优化的变量是实数向量 x ∈ R^n,而非二进制编码。

5月5日周日
3月14日周四
  1. Lilian Weng36

    深度神经网络是否严重过拟合?

    深度神经网络参数量大且训练误差可趋近于零,却仍能泛化到样本外数据,引发对其是否严重过拟合的讨论。文章从奥卡姆剃刀、最小描述长度(MDL)原则和 Kolmogorov 复杂度等经典理论出发,探讨模型复杂度与泛化之间的关系。理解深度神经网络的泛化机制,有助于为为什么 DNN 能泛化提供思路。

12月27日周四
  1. Lilian Weng26

    Object Detection Part 4: Fast Detection Models

    本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。

10月13日周六
  1. Lilian Weng26

    Flow-based Deep Generative Models

    Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。

6月24日周日
  1. Lilian Weng15

    Attention?Attention!

    summary_zh: 注意力机制源于人类视觉注意与词间关联的类比,用重要性权重向量对其它元素加权求和来近似预测目标。Seq2Seq 固定长度上下文向量难以记住长句,注意力通过源端与目标端之间的可学习捷径连接解决该问题。

5月5日周六
4月8日周日
  1. Lilian Weng12

    Policy Gradient Algorithms

    策略梯度是解决强化学习问题的方法之一。文章系统梳理了包括 PPO、SAC、D4PG、TD3、SVPG、IMPALA、PPG 在内的多种策略梯度算法,并总结了降低方差、经验回放、目标网络、熵正则等共性设计原则。IMPALA 通过解耦执行与学习、利用 V-trace 离策略校正实现高吞吐训练。

2月19日周一
  1. Lilian Weng36

    强化学习综述:从基础概念到经典方法

    文章综述强化学习(RL)领域,介绍智能体与环境交互、通过试错学习最优策略以最大化累积奖励的核心框架。涵盖状态、动作、奖励、策略与价值函数等关键概念,并对比基于模型/无模型、在策略/离策略等经典方法分类。

1月23日周二
  1. Lilian Weng22

    多臂老虎机问题及其解法

    多臂老虎机问题是探索与利用权衡的经典模型,目标是最大化累积奖励并最小化遗憾。文章介绍了 ε-Greedy 算法和 Upper Confidence Bounds(UCB)等策略,通过实验估计动作价值并平衡随机探索与利用已知最优动作。算法实现位于 lilianweng/multi-armed-bandit。

12月31日周日
12月15日周五
  1. Lilian Weng20

    Object Detection for Dummies Part 2:CNN、DPM 与 Overfeat

    本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。

10月29日周日
10月15日周日
8月1日周二
7月22日周六
7月8日周六
6月21日周三
  1. Lilian Weng15

    面向好奇者的深度学习概述

    summary_zh: 深度学习模型本质上是大型深层人工神经网络,其成功主要得益于数据规模增长与算力提升。CNN 受视觉皮层启发,通过卷积核提取图像特征;RNN 擅长处理序列数据,在手写识别、语音识别和机器翻译中表现显著。