跳到正文

#论文/研究

今日 45 条
1月13日周二
1月10日周六
  1. Berkeley AI Research32

    Information-Driven Design of Imaging Systems

    伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。

1月9日周五
  1. ScienceDaily · AI75

    Stanford SleepFM:从单夜睡眠信号预测百余种疾病风险

    Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。

1月6日周二
  1. ScienceDaily · AI60

    宾大与密歇根大学研发出比盐粒更小的可编程自主机器人

    宾夕法尼亚大学与密歇根大学团队造出约 200×300×50 微米的全自主可编程机器人,可游泳、感知温度并自主决策,单个成本约一美分,由 LED 供光可持续运行数月。研究发表于 Science Robotics 与 PNAS,机器人通过电场驱动周围离子运动前进,配备完整处理器、内存与传感器,并能用跳舞抖动编码温度数据通过显微镜读取。

12月30日周二
  1. Sebastian Raschka12

    LLM Research Papers: The 2025 List (July to December)

    Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。

11月1日周六
  1. Berkeley AI Research62

    无需 TD 学习的强化学习:分治范式与 Transitive RL

    Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。

    推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。

9月1日周一
  1. Berkeley AI Research40

    word2vec 到底学到了什么?

    word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。

3月6日周三
  1. The Gradient60

    文本嵌入能完美编码文本吗?

    作者 Jack Morris 基于 EMNLP 2023 论文证明文本嵌入可被逆转为原始文本,并开源 vec2text 方法与代码。实验显示,对 32 token 文本经 50 步迭代修正后精确匹配率达 92%,BLEU 达 97,揭示向量数据库存在隐私与信息泄露风险。

1月14日周日
1月27日周五
6月10日周五
5月31日周一
4月7日周二
6月23日周日
  1. Lilian Weng27

    Meta Reinforcement Learning(元强化学习)

    summary_zh: Meta-RL 训练智能体在未见过的任务上快速适应,在测试时通过有限交互自主调整隐藏状态,无需显式微调。Meta-RL 与普通 RL 的核心区别在于策略输入额外加入上一时刻的奖励与动作,通常采用 LSTM 作为循环策略,其隐藏状态用于追踪轨迹特征。

1月31日周四
11月30日周五
  1. Lilian Weng23

    Meta-Learning: Learning to Learn Fast

    元学习旨在让模型像人类一样通过少量样本快速适应新任务,其核心思想是"学会学习"。文章将元学习建模为在任务分布上优化期望损失,每个任务视为一个数据样本,并通过构造支持集与预测集来模拟少样本分类中的快速学习过程。训练过程模仿测试时的有限标签暴露机制,使模型能泛化到未见过的任务配置。

8月12日周日
9月28日周四
8月20日周日