跳到正文

#多模态

今日 16 条
5月18日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Omni Flash

    Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。

    推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。

5月17日周日
5月16日周六
  1. Sebastian Raschka48

    Gemma 4、Laguna XS.2、ZAYA1-8B 与 DeepSeek V4 的架构进展:KV 共享、mHC 与压缩注意力

    Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。

5月14日周四
5月13日周三
  1. ScienceDaily · AI62

    自然说话中的停顿与填充词或可揭示早期痴呆风险

    Baycrest、多伦多大学和约克大学的研究显示,日常对话中的停顿、填充词(uh/um)及取词困难与执行功能显著相关,AI 分析语音可预测认知测试表现,且不受年龄、性别和教育程度影响。研究者认为自然语音或成为比传统纸笔测试更易重复的认知筛查工具,但需长期研究区分正常老化与疾病早期信号。

5月2日周六
4月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 AI co-clinician 研究倡议

    Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。

    推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

4月23日周四
4月18日周六
  1. ScienceDaily · AI60

    打印人工神经元成功与活体脑细胞通信

    西北大学工程师用可打印的 MoS2 和石墨烯电子墨水在柔性聚合物上制造人工神经元,通过部分分解聚合物形成窄导电路径,产生类似神经元放电的电信号。实验显示这些信号在小鼠小脑切片上匹配生物神经元的时间与形状特征,可靠激活真实神经回路。研究发表于 Nature Nanotechnology,作者指出该技术有望推动脑机接口、神经假体及能效更高的类脑计算硬件。

4月14日周二
4月7日周二
  1. ScienceDaily · AI64

    USC团队发布耐高温1300°F记忆体,可运行于700°C并加速AI矩阵运算

    USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。

4月3日周五
  1. Google DeepMind82

    Gemma 4 发布:字节级对齐的最强开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。

    推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。

3月31日周二
3月29日周日
3月25日周三
  1. Google Research42

    映射现代世界:S2Vec 如何学习城市的语言

    Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。

3月22日周日
  1. Sebastian Raschka46

    大语言模型注意力变体视觉指南

    Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。

3月18日周三
3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

3月16日周一
  1. ScienceDaily · AI31

    科学家发现AI能提升人类创造力

    斯旺西大学一项超过800人参与的在线实验显示,使用AI支持系统设计虚拟汽车时,受试者花更多时间、产出更好设计且参与感更强。系统采用MAP-Elites方法生成包含高效、非常规乃至故意缺陷方案的视觉画廊,多样化输出帮助参与者突破初始假设并鼓励冒险。

2月25日周三
2月10日周二
2月7日周六
  1. ScienceDaily · AI35

    宾州州立团队开发可编程智能合成皮肤,可隐藏图像并改变形状

    宾州州立 Hongtao Sun 团队利用水凝胶和半色调编码 4D 打印技术,开发出可编程智能合成皮肤。该材料可通过热、溶剂或机械刺激改变外观、质地和形状,并能将图像编码进材料内:乙醇中透明,加热水或冰水后隐藏图像显现。单个薄片即可同时控制外观与形变,无需多层结构。

2月2日周一
  1. ScienceDaily · AI60

    斯坦福团队展示微透镜光腔阵列,实现千级光腔量子比特并行读出

    斯坦福大学物理学家团队在 Nature 发表论文,展示由 40 个光腔组成的阵列及超过 500 个光腔的原型,每个光腔容纳单个原子量子比特,通过微透镜将光聚焦到单个原子上,实现并行读出。研究指出该方案可扩展至百万量子比特的光腔网络,为分布式量子计算和量子数据中心提供基础。

1月25日周日
  1. ScienceDaily · AI62

    研究人员对10万人测试AI与人类创造力

    蒙特利尔大学Karim Jerbi教授与Yoshua Bengio等合作在Scientific Reports发表研究,使用Divergent Association Task对比GPT-4、Claude、Gemini等模型与超过10万人的创造力表现。部分AI系统在发散语言创造力任务上超过人类平均,但最富创造力的人类仍显著优于所有AI模型。研究还发现AI创造力可通过温度参数和提示词调整。

1月13日周二
1月10日周六
  1. Berkeley AI Research32

    Information-Driven Design of Imaging Systems

    伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。

1月9日周五
  1. ScienceDaily · AI75

    Stanford SleepFM:从单夜睡眠信号预测百余种疾病风险

    Stanford Medicine与合作者开发SleepFM,基于约60万小时多导睡眠图数据训练,可从单夜睡眠信号估计100多种疾病的未来风险。模型在预测帕金森病(C-index 0.89)、痴呆(0.85)、高血压心脏病(0.84)、心梗(0.81)、前列腺癌(0.89)、乳腺癌(0.87)和死亡(0.84)等方面表现突出;结合多通道信号时准确性最高。

1月8日周四
12月30日周二
  1. Sebastian Raschka12

    LLM Research Papers: The 2025 List (July to December)

    Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。

12月17日周三
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

9月29日周一
9月1日周一
  1. Berkeley AI Research40

    word2vec 到底学到了什么?

    word2vec 在小初始化下以离散、顺序的步骤学习,每次步骤增加嵌入矩阵的秩,最终学习结果等价于对目标矩阵 M* 做 PCA。目标矩阵 M* 由语料共现概率定义,其 top 特征向量对应名人传记、政府行政、地理描述等可解释主题。该理论在温和近似条件下闭合可解,与数值实验吻合良好。