跳到正文

#Agent

今日 265 条
3月14日周四
3月9日周六
2月28日周三
12月11日周一
  1. Jeremy Howard · fast.ai42

    Answer.AI:Jeremy Howard 与 Eric Ries 推出新型 AI 研发实验室

    Jeremy Howard 与 Eric Ries 今日推出 Answer.AI,一家基于基础研究突破打造实用终端产品的 AI 研发实验室,获 Decibel VC 1000 万美元投资。团队为全远程深度技术通才,Jeremy 专注迁移学习与微调研究,Eric 带来精益创业与长期治理经验。实验室采用研发互驱路径,以实际开发目标指引研究方向。

10月20日周五
10月14日周六
  1. The Gradient58

    Neural Algorithmic Reasoning:Petar Veličković 谈用神经网络捕获经典计算

    Petar Veličković 讨论如何将经典算法与数据结构捕获到深度神经网络中,并提出算法对齐(algorithmic alignment)作为提升泛化与可解释性的设计原则。文章梳理了从学习执行图算法、CLRS-30 基准到神经算法推理(NAR)蓝图的进展,并指出将经典算法应用于真实世界时面临输入工程与算法瓶颈等挑战。

8月16日周三
  1. Chip Huyen · Notes38

    LLM 研究中的开放挑战

    文章梳理了 LLM 领域的 10 个主要研究方向,包括幻觉、上下文学习、多模态、新架构和 GPU 替代方案等。幻觉是企业在生产环境中采用 LLM 的首要障碍,需同时研究缓解方法与评估指标。上下文长度与构建方式影响 RAG 效果,模型对上下文首尾信息更敏感;多模态能提升性能并拓展应用场景。

6月23日周五
  1. Lilian Weng74

    LLM Powered Autonomous Agents

    Lilian Weng 综述了以 LLM 为核心控制器的自主智能体系统,涵盖规划(含 CoT、Tree of Thoughts、ReAct、Reflexion、Chain of Hindsight 与 Algorithm Distillation)、记忆(短时与长时记忆及外部向量检索)与工具使用(MRKL、Toolformer、HuggingGPT 与 API-Bank 等)。

3月15日周三
1月27日周五
4月25日周一
3月28日周一
3月14日周一
2月1日周二
11月5日周五
1月2日周六
  1. Lilian Weng37

    Controllable Neural Text Generation

    summary_zh: 文章探讨如何引导无条件语言模型生成受控文本,涵盖三种主要路径:测试时贪心解码与重采样、基于提示词的设计与自动搜索、以及微调基础模型或可操纵层。

6月7日周日
4月7日周二
1月29日周三
  1. Lilian Weng27

    强化学习的课程训练(Curriculum for Reinforcement Learning)

    课程学习通过从简单到复杂的样本安排加速模型收敛,Bengio 等人(2009)提出聚焦"有趣"样本的策略。Zaremba & Sutskever(2014)在 LSTM 数学程序预测中发现混合课程(naive + mix)优于单一策略。PCG 被用于 GVGAI、CoinRun、Procgen 等 RL 基准以提升泛化,POET 结合进化算法与程序化关卡进一步改善泛化。

9月5日周四
  1. Lilian Weng12

    Evolution Strategies(进化策略)

    summary_zh: 进化策略(ES)属于进化算法(EA)家族,是一种黑箱优化方法,适用于无法直接计算梯度的目标函数 f(x): R^n → R。与遗传算法不同,ES 优化的变量是实数向量 x ∈ R^n,而非二进制编码。

6月23日周日
  1. Lilian Weng27

    Meta Reinforcement Learning(元强化学习)

    summary_zh: Meta-RL 训练智能体在未见过的任务上快速适应,在测试时通过有限交互自主调整隐藏状态,无需显式微调。Meta-RL 与普通 RL 的核心区别在于策略输入额外加入上一时刻的奖励与动作,通常采用 LSTM 作为循环策略,其隐藏状态用于追踪轨迹特征。

11月30日周五
  1. Lilian Weng23

    Meta-Learning: Learning to Learn Fast

    元学习旨在让模型像人类一样通过少量样本快速适应新任务,其核心思想是"学会学习"。文章将元学习建模为在任务分布上优化期望损失,每个任务视为一个数据样本,并通过构造支持集与预测集来模拟少样本分类中的快速学习过程。训练过程模仿测试时的有限标签暴露机制,使模型能泛化到未见过的任务配置。

6月24日周日
  1. Lilian Weng15

    Attention?Attention!

    summary_zh: 注意力机制源于人类视觉注意与词间关联的类比,用重要性权重向量对其它元素加权求和来近似预测目标。Seq2Seq 固定长度上下文向量难以记住长句,注意力通过源端与目标端之间的可学习捷径连接解决该问题。

5月5日周六
1月23日周二
  1. Lilian Weng22

    多臂老虎机问题及其解法

    多臂老虎机问题是探索与利用权衡的经典模型,目标是最大化累积奖励并最小化遗憾。文章介绍了 ε-Greedy 算法和 Upper Confidence Bounds(UCB)等策略,通过实验估计动作价值并平衡随机探索与利用已知最优动作。算法实现位于 lilianweng/multi-armed-bandit。

5月31日周二
  1. Andrej Karpathy · Notes37

    Deep Reinforcement Learning: Pong from Pixels

    Andrej Karpathy 博客讲解策略梯度(Policy Gradients)算法,用 2 层神经网络从 Pong 游戏原始像素直接学习控制挡板。代码仅 130 行 Python,依赖仅 numpy,实现端到端强化学习。文中指出近期 RL 进展主要来自算力、数据和基础设施,而非算法突破。

11月14日周六
  1. Andrej Karpathy · Notes12

    AI 短篇故事:认知断层

    summary_zh: 故事主角 Merus 是一名"shaper",通过公司提供的先进硬件执行 Human Intelligence Task(HIT)。他使用的 avatar agent 基于开源 Visceral 5.0 系列模型的一个近期 fork。

9月3日周四
  1. Chris Olah · Notes37

    神经网络、类型与函数式编程

    summary_zh: 神经网络通过多层函数复合优化任务,每层将数据转换为特定表示;该文将深度学习中的表示对应为函数式编程里的类型,提出深度学习是优化与函数式编程的交汇点。