跳到正文

#多模态

今日 195 条
3月9日周六
2月2日周五
12月17日周日
10月10日周二
8月16日周三
  1. Chip Huyen · Notes38

    LLM 研究中的开放挑战

    文章梳理了 LLM 领域的 10 个主要研究方向,包括幻觉、上下文学习、多模态、新架构和 GPU 替代方案等。幻觉是企业在生产环境中采用 LLM 的首要障碍,需同时研究缓解方法与评估指标。上下文长度与构建方式影响 RAG 效果,模型对上下文首尾信息更敏感;多模态能提升性能并拓展应用场景。

6月7日周三
4月3日周一
1月1日周日
10月4日周二
  1. Jay Alammar · Notes70

    图解 Stable Diffusion 原理

    Jay Alammar 用 6 张图讲解 Stable Diffusion 的核心组件与扩散过程:文本经 ClipText 编码器转为 token 嵌入,UNet+调度器在潜在空间逐步去噪,最后由 Autoencoder 解码器生成像素图像。文章说明扩散模型通过加噪训练预测噪声,并介绍如何将文本条件注入 UNet 的注意力层以实现文本控制生成。

6月10日周五
4月25日周一
11月5日周五
10月8日周五
7月11日周日
  1. Lilian Weng18

    什么是 Diffusion Models(扩散模型)?

    扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。

5月31日周一
8月6日周四
7月27日周一
11月10日周日
  1. Lilian Weng36

    自监督表征学习(Self-Supervised Representation Learning)

    自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。

1月31日周四
12月27日周四
  1. Lilian Weng26

    Object Detection Part 4: Fast Detection Models

    本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。

10月13日周六
  1. Lilian Weng26

    Flow-based Deep Generative Models

    Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。

12月31日周日
12月15日周五
  1. Lilian Weng20

    Object Detection for Dummies Part 2:CNN、DPM 与 Overfeat

    本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。

9月28日周四
8月20日周日
6月21日周三
  1. Lilian Weng15

    面向好奇者的深度学习概述

    summary_zh: 深度学习模型本质上是大型深层人工神经网络,其成功主要得益于数据规模增长与算力提升。CNN 受视觉皮层启发,通过卷积核提取图像特征;RNN 擅长处理序列数据,在手写识别、语音识别和机器翻译中表现显著。

9月3日周四
  1. Chris Olah · Notes18

    Visual Information Theory

    Chris Olah 的笔记通过可视化概率分布讲解信息论,用天气与穿衣的独立与相关案例说明联合概率与条件概率的分解。文中展示 p(rain, coat) = p(rain)·p(coat|rain) 与 p(coat)·p(rain|coat) 两种等价视角,并提及贝叶斯定理与辛普森悖论。

8月31日周一
  1. Chris Olah · Notes28

    计算图上的微积分:反向传播

    summary_zh: 反向传播是训练深度模型的关键算法,相比朴素实现可将梯度下降训练速度提升多达一千万倍。 文章通过计算图讲解导数计算,介绍前向模式与反向模式微分,阐明反向传播通过路径合并高效计算导数的原理。

8月27日周四
  1. Chris Olah · Notes31

    Understanding LSTM Networks

    summary_zh: LSTM 是一种特殊的循环神经网络(RNN),通过细胞状态和门控机制解决长程依赖问题,能够有效学习长期信息。该网络由 Hochreiter & Schmidhuber(1997)提出,在语音识别、语言建模、翻译、图像描述等任务上表现优异,目前已广泛使用。

1月16日周五