香港大学团队展示可在近绝对零度运行的类脑芯片
香港大学研究团队在 SiC MOSFET 中实现负微分电阻效应,首次在 10mK 下用单晶体管复现生物神经元的高效脉冲活动。该芯片可集成于量子处理器附近,大幅降低低温系统热负荷,并有望用于深空探测。相关论文发表于 Nature Communications。
香港大学研究团队在 SiC MOSFET 中实现负微分电阻效应,首次在 10mK 下用单晶体管复现生物神经元的高效脉冲活动。该芯片可集成于量子处理器附近,大幅降低低温系统热负荷,并有望用于深空探测。相关论文发表于 Nature Communications。
Anne Martel 开发 AI 系统,从医学影像(数字病理与放射影像)和临床文本数据中提取可操作信息,辅助肿瘤科医生制定个性化治疗方案。她的团队在 ICCV 展示多模态融合方法:将病理大模型与基因组数据及临床记录结合,通过多任务学习共享表征,提升预测准确性。医学影像 AI 已从跟随计算机科学进展转向贡献原创方法。
Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。
推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本的 12B 多模态模型,采用无编码器架构,视觉和音频输入直接进入 LLM 主干,16GB 显存或统一内存即可本地运行。
推荐理由:无编码器架构把视觉与音频直接接入 LLM 主干,读者可了解端侧多模态模型在显存与延迟上的取舍。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。
推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
Mistral 收购 Emmi AI,宣布加码 Physics AI,覆盖航空航天、汽车、半导体与能源领域。已发布多项突破,包括 3D 机翼跨声速 CFD 数据集、GyroSwin 5D 代理模型、AB-UPT 支持 140M 体素单 GPU 推理,以及 NeuralDEM 端到端多物理场代理模型,部分成果已开源。
summary_zh: Mohamad Moosavi 是多伦多大学化学工程助理教授、Vector Institute Faculty Member,致力于用深度学习加速碳捕获、能源存储和催化等可持续技术的材料发现。
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。
Google 在 Project Genie 中接入 Street View 真实街景图像,生成式世界模型可基于美国真实地点生成互动虚拟环境。该功能通过 Maps Imagery Grounding 技术实现,用户可选风格(如"Ocean World"、"B&W film")并描述角色,Genie 创建锚定真实街景的想象世界。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。
Google DeepMind 在新加坡启动国家 AI 合作计划,聚焦医疗、教育与科研。合作包含 AI co-clinician 研究、AlphaFold 等 AI for Science 工具、Gemma 跑鞋助手、Gemini for Education 全校覆盖,以及与 IMDA 和 MLCommons 共建多模态安全基准。
summary_zh: 剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 工具研究病原体跨物种传播引发败血症等疾病的分子开关。
Google DeepMind与Google Research开发的AI天气模型WeatherNext在2025年10月飓风Melissa登陆牙买加前5天预测其将达到5级强度,置信度80%,3天前升至近100%。
推荐理由:WeatherNext在飓风Melissa登陆前5天以80%置信度预测出5级强度,为防灾争取了关键准备时间。
Together AI 发布开源视频翻译工具 Violin,集成 Whisper V3 转录、DeepSeek V4 Pro 翻译和 Cartesia Sonic 3 语音合成,并提供视频内容问答与自然语言选音功能。工具以 MIT 许可证开源,包含 Web 应用、CLI 和 Agent 技能,演示视频 24 小时后删除。
Baycrest、多伦多大学和约克大学的研究显示,日常对话中的停顿、填充词(uh/um)及取词困难与执行功能显著相关,AI 分析语音可预测认知测试表现,且不受年龄、性别和教育程度影响。研究者认为自然语音或成为比传统纸笔测试更易重复的认知筛查工具,但需长期研究区分正常老化与疾病早期信号。
summary_zh: Google Research 强调开源软件与开放数据集是现代科学的驱动力,通过与 UCSC Genomics Institute、Janelia、ISTA、CSIRO、AIIMS 及 Human Pangenome Research Consortium 等机构合作推动科学进步。
Google DeepMind 在 Science 发表 AI co-clinician 研究,提出三方照护框架,由医生监督下的 AI 代理辅助患者。在 98 个初级保健查询中系统仅 1 例出现关键错误,并在 OpenFDA RxQA 开放问答中超越前沿模型。
推荐理由:双盲评估与随机模拟实验为医疗AI协作提供了可复现的验证框架,读者可借此理解多模态能力边界与安全架构的设计取舍。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Vector 团队在 ICLR 2026 发表 48 篇论文并主导 6 个研讨会,覆盖强化推理、生成式多模态、自主智能体、可信 AI 与科学发现等方向。
Google Research 发布了一种照片重构图方法,现已集成到 Google Photos 的 Auto Frame 功能中。该方法通过 3D 点图估计和生成式潜在扩散模型,在改变相机位姿与焦距后自动补全原本未拍摄到的内容,并针对人像自动检测广角畸变、恢复自然比例。
西北大学工程师用可打印的 MoS2 和石墨烯电子墨水在柔性聚合物上制造人工神经元,通过部分分解聚合物形成窄导电路径,产生类似神经元放电的电信号。实验显示这些信号在小鼠小脑切片上匹配生物神经元的时间与形状特征,可靠激活真实神经回路。研究发表于 Nature Nanotechnology,作者指出该技术有望推动脑机接口、神经假体及能效更高的类脑计算硬件。
summary_zh: Google Research 发布 Vantage 实验,通过生成式 AI 在模拟环境中评估批判性思维、协作与创造性思维等未来必备技能。
USC研究团队在Science发表新型memristor记忆体,可在700°C持续工作超50小时且经历逾10亿次开关循环。器件采用钨电极、铪氧化物陶瓷与石墨烯层,利用石墨烯阻隔钨原子迁移以防止短路。研究指出该原理可迁移至其他材料,并已成立TetraMem公司推进商业化,但高温逻辑电路与量产仍待开发。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
summary_zh: DNA 纳米机器人可在血液中精准递送药物、靶向癌细胞与病毒,并组装纳米级数据存储与计算设备。研究人员利用 DNA 链置换、生物化学燃料信号及外部电场/磁场/光控等方式调控其运动。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,旨在让指针理解用户所指的视觉与语义上下文,减少繁琐提示词。
Google Research 推出 S2Vec,一个自监督框架,通过将城市地理空间数据栅格化为多层图像并使用掩码自编码学习通用嵌入向量。在社会经济预测任务的零样本地理外推上,S2Vec 表现优于 SATCLIP、GEOCLIP、RS-MaMMUT、Hex2vec 和 GeoVeX 等基线模型。但在树冠覆盖率和海拔等环境任务上仍有明显改进空间。
Sebastian Raschka 整理了大语言模型注意力变体图库,包含 45 个架构条目,每个条目配有可视化模型卡片,并提供海报版本。文章内容涵盖多头注意力(MHA)等核心注意力机制,以 GPT-2、OLMo 2 7B、OLMo 3 7B 等架构为例进行说明。该图库旨在作为参考资料和轻量学习资源。
Google Research 在 The Check Up 活动中公布多项医疗 AI 成果,包括与 Fitbit 合作开发的 Personal Health Agent、与 Imperial College London 和 NHS 合作提升乳腺癌检测、并识别 25% 此前被漏诊的 interval cancers。
Google Research与多家NHS机构合作,在Nature Cancer发表两项互补研究,评估AI乳腺X光筛查系统。
推荐理由:两项Nature Cancer研究显示AI在乳腺X光筛查中可减少约四成人工阅读工作量,同时保持与双读流程相当的灵敏度。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
斯旺西大学一项超过800人参与的在线实验显示,使用AI支持系统设计虚拟汽车时,受试者花更多时间、产出更好设计且参与感更强。系统采用MAP-Elites方法生成包含高效、非常规乃至故意缺陷方案的视觉画廊,多样化输出帮助参与者突破初始假设并鼓励冒险。
Together AI 在 NVIDIA GTC 2026 宣布多项合作与模型上线,包括集成 NVIDIA Dynamo 1.0 推理框架、通过 NemoClaw 提供超 150 个优化模型、上线 NVIDIA Nemotron 3 Super(120B 参数、1M 上下文窗口)以及 NVIDIA Parakeet TDT 0.6B V3 ASR 模型。
summary_zh: Vector Institute 于 2 月 19-20 日举办第三届 Remarkable 2026 大会,吸引逾 1,500 名研究者与产业人士参与。
summary_zh: Arcee AI 发布 Trinity Large(400B MoE,13B 激活参数),采用 SWA、QK-Norm、NoPE 与门控注意力。
Vector Institute 等机构联合开发 CRISPNAM-FG 模型,将 Fine-Gray 竞争风险框架与 Neural Additive Models 结合,在预测糖尿病足并发症风险的同时保持特征级可解释性。该模型通过独立的 FeatureNet 子网络处理每个临床变量,捕捉非线性效应,避免依赖 LIME/SHAP 等事后解释方法,在高风险医疗场景中实现高精度与透明度的兼顾。