无需 TD 学习的强化学习:分治范式与 Transitive RL
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。
作者 Jack Morris 基于 EMNLP 2023 论文证明文本嵌入可被逆转为原始文本,并开源 vec2text 方法与代码。实验显示,对 32 token 文本经 50 步迭代修正后精确匹配率达 92%,BLEU 达 97,揭示向量数据库存在隐私与信息泄露风险。
summary_zh: 单细胞测序技术通过测序DNA和RNA在单个细胞层面探索细胞异质性,2013年Nature将其评为年度方法。scRNA-tools数据库截至2021年收录超过1000个分析工具,其中许多利用深度学习技术。
Petar Veličković 讨论如何将经典算法与数据结构捕获到深度神经网络中,并提出算法对齐(algorithmic alignment)作为提升泛化与可解释性的设计原则。文章梳理了从学习执行图算法、CLRS-30 基准到神经算法推理(NAR)蓝图的进展,并指出将经典算法应用于真实世界时面临输入工程与算法瓶颈等挑战。
Lilian Weng 重构并扩充了 2020 年的 Transformer 家族综述文章,Version 2.0 是旧版超集,长度约两倍。文章系统梳理了 Transformer 基础结构、注意力机制、多头自注意力及编码器-解码器架构等核心组件的演进与变体。
summary_zh: VisualBERT 将图像区域与文本共同输入 BERT,在 MS COCO 上训练,NLVR 和 Flickr30K 上超越当时 SOTA,VQA 上仍有差距。
summary_zh: 对比表征学习旨在让相似样本对在嵌入空间中靠近、不相似样本远离,可应用于有监督与无监督场景,是自监督学习中最强方法之一。
summary_zh: 文章系统梳理了 Transformer 架构的演进,重点讨论如何改进 vanilla Transformer 的注意力机制,以提升长期依赖捕捉能力、降低内存与计算开销,并增强 RL 任务求解表现。
summary_zh: Meta-RL 训练智能体在未见过的任务上快速适应,在测试时通过有限交互自主调整隐藏状态,无需显式微调。Meta-RL 与普通 RL 的核心区别在于策略输入额外加入上一时刻的奖励与动作,通常采用 LSTM 作为循环策略,其隐藏状态用于追踪轨迹特征。
summary_zh: 文章综述 2018 年前后 NLP 领域通用预训练语言模型的进展,涵盖 CoVe、ELMo、OpenAI GPT 与 BERT 等模型。
元学习旨在让模型像人类一样通过少量样本快速适应新任务,其核心思想是"学会学习"。文章将元学习建模为在任务分布上优化期望损失,每个任务视为一个数据样本,并通过构造支持集与预测集来模拟少样本分类中的快速学习过程。训练过程模仿测试时的有限标签暴露机制,使模型能泛化到未见过的任务配置。
Autoencoder 通过编码器 $g_\phi$ 和解码器 $f_\theta$ 在瓶颈层学习低维隐变量 $\mathbf{z}$,以重构输入 $\mathbf{x} \approx f_\theta(g_\phi(\mathbf{x}))$,并使用 MSE 损失优化。
summary_zh: Naftali Tishby 提出用信息瓶颈(IB)方法研究深度神经网络训练过程中的信息变化,并将 DNN 视为马尔可夫链。训练包含两个阶段:先充分表示输入以最小化泛化误差,再通过压缩表示遗忘无关细节。
summary_zh: 生成对抗网络(GAN)由生成器 G 和判别器 D 组成,通过极小极大博弈训练,但存在训练不稳定和难以收敛的问题。文章从 KL 散度与 JS 散度的数学差异出发,解释 GAN 损失函数为何难以优化,并引出旨在解决训练困难的 WGAN 改进方案。