跳到正文

#多模态

今日 25 条
3月22日周日
  1. Sebastian Raschka46

    大语言模型注意力变体视觉指南

    Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。

3月18日周三
3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

3月16日周一
  1. ScienceDaily · AI31

    科学家发现AI能提升人类创造力

    斯旺西大学一项超过800人参与的在线实验显示,使用AI支持系统设计虚拟汽车时,受试者花更多时间、产出更好设计且参与感更强。系统采用MAP-Elites方法生成包含高效、非常规乃至故意缺陷方案的视觉画廊,多样化输出帮助参与者突破初始假设并鼓励冒险。

2月25日周三
2月10日周二
2月7日周六
  1. ScienceDaily · AI35

    宾州州立团队开发可编程智能合成皮肤,可隐藏图像并改变形状

    宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。

2月2日周一
  1. ScienceDaily · AI60

    斯坦福团队展示微透镜光腔阵列,实现千级光腔量子比特并行读出

    斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。

1月25日周日
  1. ScienceDaily · AI62

    研究人员对10万人测试AI与人类创造力

    蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。

1月13日周二
1月10日周六
  1. Berkeley AI Research32

    Information-Driven Design of Imaging Systems

    伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。

1月9日周五
  1. ScienceDaily · AI75

    Stanford SleepFM:从单夜睡眠信号预测百余种疾病风险

    Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。

1月8日周四
12月30日周二
  1. Sebastian Raschka12

    LLM Research Papers: The 2025 List (July to December)

    Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。

12月17日周三
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

9月29日周一
9月1日周一
  1. Berkeley AI Research40

    word2vec 到底学到了什么?

    word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。

8月1日周五
7月17日周四
  1. Mistral AI61

    Le Chat 新增深度研究、语音对话与项目管理功能

    Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。

    推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。

7月15日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。

    推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。

3月17日周一
11月17日周日
4月12日周五
  1. Lilian Weng39

    Diffusion Models for Video Generation

    扩散模型已用于图像合成,研究社区正将其扩展到视频生成任务。视频生成是图像的超集,需要在时间维度上保持一致性,并面临高质量视频数据收集困难的问题。Imagen Video 通过级联扩散模型和渐进蒸馏将采样步数减半,Sora 则采用 DiT 架构处理时空块。

3月9日周六
12月17日周日
6月10日周五
7月11日周日
  1. Lilian Weng18

    什么是 Diffusion Models(扩散模型)?

    扩散模型受非平衡热力学启发,通过马尔可夫链逐步添加高斯噪声并学习逆向扩散过程来生成数据。与 GAN、VAE 和流模型相比,扩散模型具有固定训练过程、高维潜变量等区别。前向扩散过程可将数据逐步噪声化为各向同性高斯分布,逆向过程则通过学习模型近似条件概率实现从噪声重建样本。

5月31日周一
8月6日周四
11月10日周日
  1. Lilian Weng36

    自监督表征学习(Self-Supervised Representation Learning)

    自监督学习通过构造自生成的监督信号,利用无标注数据训练模型学到可用于下游任务的中间表征。图像领域常用预处理变换(如旋转、裁剪、失真)构造 pretext task,以 ImageNet 分类准确率评估表征质量。原文指出生成模型与自监督表征学习的目标不同,后者关注通用特征提取而非生成多样真实图像。

1月31日周四
12月27日周四
  1. Lilian Weng26

    Object Detection Part 4: Fast Detection Models

    本篇聚焦 SSD、RetinaNet 与 YOLO 系列等单阶段检测模型,承接 Part 3 的 R-CNN 两阶段方案。YOLO 将图像划分为 S×S 网格,每个 cell 预测 B 个边界框与类别概率,输出张量形状为 S×S×(5B+K),损失函数含定位损失与分类损失,分别由 λ_coord=5 与 λ_noobj=0.5 加权。

10月13日周六
  1. Lilian Weng26

    Flow-based Deep Generative Models

    Flow-based deep generative models 通过 normalizing flows 显式学习数据分布 $p(\mathbf{x})$,以负对数似然为损失函数,克服 GAN 和 VAE 无法显式估计概率密度的困难。模型由一系列可逆变换构成,利用 Jacobian 行列式和变量替换定理实现精确密度估计,可用于生成新样本、密度估计、隐变量推断与缺失数据填补。

12月31日周日
12月15日周五
  1. Lilian Weng20

    Object Detection for Dummies Part 2:CNN、DPM 与 Overfeat

    本文介绍用于图像分类的经典卷积神经网络架构,包括 AlexNet(5 个卷积层 + 2 个 MLP 层)、VGG(19 层,3×3 卷积)和 ResNet(152 层,残差块)。目标检测评估指标 mAP 基于 PR 曲线面积计算,以 IoU 阈值 0.5 判定正样本。变形部件模型 DPM 由根滤波器、部件滤波器和空间模型组成,得分为滤波器点积减去形变代价。

9月28日周四
8月20日周日