半监督学习(Semi-Supervised Learning)综述:一致性正则化与 Π-model
半监督学习同时利用有标签与无标签数据训练模型,损失函数为 L = Ls + μ(t)Lu,其中 μ(t) 随训练步 ramp up。无监督损失基于一致性正则化:同一输入经不同数据增强或 Dropout 后,模型预测应保持一致。该思想被 SimCLR、BYOL、SimCSE 等自监督方法采用,Π-model 通过两次前向传播最小化输出差异。
半监督学习同时利用有标签与无标签数据训练模型,损失函数为 L = Ls + μ(t)Lu,其中 μ(t) 随训练步 ramp up。无监督损失基于一致性正则化:同一输入经不同数据增强或 Dropout 后,模型预测应保持一致。该思想被 SimCLR、BYOL、SimCSE 等自监督方法采用,Π-model 通过两次前向传播最小化输出差异。
summary_zh: 大模型训练面临 GPU 内存与计算时间瓶颈,需依赖并行策略扩展至多 GPU。数据并行通过梯度同步更新权重,模型并行将参数切分到不同设备,流水线并行则用微批次减少空闲等待。
扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。
summary_zh: 大型预训练语言模型在训练过程中会不可避免地从互联网数据中习得毒性行为与偏见,安全部署需要对生成过程进行有效控制。毒性内容涵盖侮辱、仇恨言论、网络欺凌等多种类型,现有分类体系如 OLID 采用三级层次结构区分攻击类型与目标。
summary_zh: 文章探讨如何引导无条件语言模型生成受控文本,涵盖三种主要路径:测试时贪心解码与重采样、基于提示词的设计与自动搜索、以及微调基础模型或可操纵层。
开放域问答(ODQA)要求模型在无相关上下文的情况下回答事实性问题,分为开放书与闭卷两种设定。常见方案采用检索器-阅读器框架,先从外部知识库(如 Wikipedia)检索相关文档,再由阅读器抽取答案。检索器可使用基于 TF-IDF 的传统信息检索或基于密集向量的神经检索。
summary_zh: NAS 通过搜索空间、搜索算法与评估策略三大组件自动学习高性能网络架构。顺序层表示(如 Zoph & Le 2017)依赖专家知识硬编码参数,计算开销极大;基于单元(Cell)的表示(如 NASNet)将架构组织为 Normal Cell 与 Reduction Cell 的重复堆叠,并在块内学习跳跃连接。
summary_zh: 文章讨论深度强化学习中的探索策略,涵盖 epsilon-greedy、上置信界、Boltzmann 探索与 Thompson sampling 等经典算法,以及熵损失、基于噪声的探索等深度 RL 方法。
课程学习通过从简单到复杂的样本安排加速模型收敛,Bengio 等人(2009)提出聚焦"有趣"样本的策略。Zaremba & Sutskever(2014)在 LSTM 数学程序预测中发现混合课程(naive + mix)优于单一策略。PCG 被用于 GVGAI、CoinRun、Procgen 等 RL 基准以提升泛化,POET 结合进化算法与程序化关卡进一步改善泛化。
自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。
summary_zh: 进化策略(ES)属于进化算法(EA)家族,是一种黑箱优化方法,适用于无法直接计算梯度的目标函数 f(x): R^n → R。与遗传算法不同,ES 优化的变量是实数向量 x ∈ R^n,而非二进制编码。
summary_zh: Domain Randomization(DR)通过随机化仿真环境中的视觉与物理参数,训练能跨环境泛化的策略,从而缩小 sim2real 差距。
深度神经网络参数量大且训练误差可趋近于零,却仍能泛化到样本外数据,引发对其是否严重过拟合的讨论。文章从奥卡姆剃刀、最小描述长度(MDL)原则和 Kolmogorov 复杂度等经典理论出发,探讨模型复杂度与泛化之间的关系。理解深度神经网络的泛化机制,有助于为为什么 DNN 能泛化提供思路。
本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。
Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。
summary_zh: 注意力机制源于人类视觉注意与词间关联的类比,用重要性权重向量对其它元素加权求和来近似预测目标。Seq2Seq 固定长度上下文向量难以记住长句,注意力通过源端与目标端之间的可学习捷径连接解决该问题。
使用Tensorflow和OpenAI Gym实现深度强化学习模型,代码已开源在lilian/deep-reinforcement-learning-gym。Q-learning通过Bellman方程更新Q值,结合ε-greedy策略探索;使用DiscretizedObservationWrapper将连续Box观察空间离散化,并通过target network与Q网络批量更新训练。
策略梯度是解决强化学习问题的方法之一。文章系统梳理了包括 PPO、SAC、D4PG、TD3、SVPG、IMPALA、PPG 在内的多种策略梯度算法,并总结了降低方差、经验回放、目标网络、熵正则等共性设计原则。IMPALA 通过解耦执行与学习、利用 V-trace 离策略校正实现高吞吐训练。
文章综述强化学习(RL)领域,介绍智能体与环境交互、通过试错学习最优策略以最大化累积奖励的核心框架。涵盖状态、动作、奖励、策略与价值函数等关键概念,并对比基于模型/无模型、在策略/离策略等经典方法分类。
多臂老虎机问题是探索与利用权衡的经典模型,目标是最大化累积奖励并最小化遗憾。文章介绍了 ε-Greedy 算法和 Upper Confidence Bounds(UCB)等策略,通过实验估计动作价值并平衡随机探索与利用已知最优动作。算法实现位于 lilianweng/multi-armed-bandit。
summary_zh: R-CNN 系列通过选择性搜索生成约 2k 个候选区域,对每个区域独立提取 CNN 特征并送入 SVM 分类,同时用边界框回归修正检测窗口。
本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。
summary_zh: 本文讲解图像梯度向量、HOG 与 SS 等传统目标检测基础方法,不涉及深度神经网络。梯度向量通过相邻像素颜色差计算幅值与方向,可用卷积核(如 Prewitt、Sobel)加速。
summary_zh: Word embedding 将词汇映射为低维稠密向量,替代 one-hot 的高维稀疏表示,常用方法包括基于统计的 count-based 和基于预测的 context-based。
summary_zh: Lipton (2017) 在"The mythos of model interpretability"中总结可解释模型三性质:simulatability、algorithmic transparency 与 decomposability。
summary_zh: 本教程延续 Part 1 的 RNN 股价预测模型,为其加入多股票响应能力。通过将股票符号映射为 embedding_size=3 的嵌入向量,并与每日价格向量拼接后输入 LSTM 单元,使模型能区分不同股票的价格序列。
教程演示如何用 Tensorflow 构建基于 LSTM 的 RNN 模型预测 S&P500 指数收盘价,使用 Yahoo! Finance 2017 年 6 月 23 日前的历史数据,仅用每日收盘价作为输入。
summary_zh: 深度学习模型本质上是大型深层人工神经网络,其成功主要得益于数据规模增长与算力提升。CNN 受视觉皮层启发,通过卷积核提取图像特征;RNN 擅长处理序列数据,在手写识别、语音识别和机器翻译中表现显著。