跳到正文

#多模态

今日 195 条
6月12日周五
6月11日周四
  1. Vector Institute40

    Anne Martel:用 AI 个性化癌症治疗

    Anne Martel 开发 AI 系统,从医学影像(数字病理与放射影像)和临床文本数据中提取可操作信息,辅助肿瘤科医生制定个性化治疗方案。她的团队在 ICCV 展示多模态融合方法:将病理大模型与基因组数据及临床记录结合,通过多任务学习共享表征,提升预测准确性。医学影像 AI 已从跟随计算机科学进展转向贡献原创方法。

6月9日周二
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

6月6日周六
  1. Sebastian Raschka16

    LLM 研究论文清单:2026 年 1 月至 5 月

    summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。

6月5日周五
  1. Google Research66

    Google Research发布PHRM系统:通过智能手机摄像头实现被动心率监测

    Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。

    推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。

6月2日周二
  1. Together AI73

    MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践

    MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。

    推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。

5月27日周三
5月25日周一
5月19日周二
5月18日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Omni Flash

    Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。

    推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。

5月17日周日
5月16日周六
  1. Sebastian Raschka48

    Gemma 4、Laguna XS.2、ZAYA1-8B 与 DeepSeek V4 的架构进展:KV 共享、mHC 与压缩注意力

    Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。

5月14日周四
5月13日周三
  1. ScienceDaily · AI62

    自然说话中的停顿与填充词或可揭示早期痴呆风险

    Baycrest、多伦多大学和约克大学的研究显示,日常对话中的停顿、填充词(uh/um)及取词困难与执行功能显著相关,AI 分析语音可预测认知测试表现,且不受年龄、性别和教育程度影响。研究者认为自然语音或成为比传统纸笔测试更易重复的认知筛查工具,但需长期研究区分正常老化与疾病早期信号。

5月2日周六
4月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 AI co-clinician 研究倡议

    Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。

    推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

4月23日周四
4月18日周六
  1. ScienceDaily · AI60

    打印人工神经元成功与活体脑细胞通信

    西北大学工程师用可打印的 MoS2 和石墨烯电子墨水在柔性聚合物上制造人工神经元,通过部分分解聚合物形成窄导电路径,产生类似神经元放电的电信号。实验显示这些信号在小鼠小脑切片上匹配生物神经元的时间与形状特征,可靠激活真实神经回路。研究发表于 Nature Nanotechnology,作者指出该技术有望推动脑机接口、神经假体及能效更高的类脑计算硬件。

4月14日周二
4月7日周二
  1. ScienceDaily · AI64

    USC团队发布耐高温1300°F记忆体,可运行于700°C并加速AI矩阵运算

    USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。

4月3日周五
  1. Google DeepMind82

    Gemma 4 发布:字节级对齐的最强开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。

    推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。

3月31日周二
3月29日周日
3月25日周三
  1. Google Research42

    映射现代世界:S2Vec 如何学习城市的语言

    Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。

3月22日周日
  1. Sebastian Raschka46

    大语言模型注意力变体视觉指南

    Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。

3月18日周三
3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

3月16日周一
  1. ScienceDaily · AI31

    科学家发现AI能提升人类创造力

    斯旺西大学一项超过800人参与的在线实验显示,使用AI支持系统设计虚拟汽车时,受试者花更多时间、产出更好设计且参与感更强。系统采用MAP-Elites方法生成包含高效、非常规乃至故意缺陷方案的视觉画廊,多样化输出帮助参与者突破初始假设并鼓励冒险。

2月26日周四
2月25日周三
  1. Vector Institute36

    CRISPNAM-FG:可解释深度学习竞争风险生存模型在医疗领域的应用

    Vector Institute 等机构联合开发 CRISPNAM-FG 模型,将 Fine-Gray 竞争风险框架与 Neural Additive Models 结合,在预测糖尿病足并发症风险的同时保持特征级可解释性。该模型通过独立的 FeatureNet 子网络处理每个临床变量,捕捉非线性效应,避免依赖 LIME/SHAP 等事后解释方法,在高风险医疗场景中实现高精度与透明度的兼顾。