Amazon Research Awards 获奖者公布
summary_zh: Amazon Research Awards(ARA)公布秋季2025评审结果,70位获奖者来自49所大学、11个国家,覆盖AI信息安全、智能体AI、自动化推理、AWS密码学、网络安全与反滥用、可持续性等6个方向。
summary_zh: Amazon Research Awards(ARA)公布秋季2025评审结果,70位获奖者来自49所大学、11个国家,覆盖AI信息安全、智能体AI、自动化推理、AWS密码学、网络安全与反滥用、可持续性等6个方向。
Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。
推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。
Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。
Mistral 收购 Emmi AI,宣布加码 Physics AI,覆盖航空航天、汽车、半导体与能源领域。已发布多项突破,包括 3D 机翼跨声速 CFD 数据集、GyroSwin 5D 代理模型、AB-UPT 支持 140M 体素单 GPU 推理,以及 NeuralDEM 端到端多物理场代理模型,部分成果已开源。
亚马逊研究团队在ICLR发表论文,提出集合监督微调(SSFT)与全局分叉策略优化(GFPO),通过为不同推理模式分配全局分叉token来训练模型掌握多样化推理策略,并在推理时选择最优模式。AIME 2025、AIME 2024与LiveCodeBench-v5上Pass@1分别提升6.84、5.37与4.94个百分点,同时改善pass@k多样性且不损害单次准确率。
推荐理由:提出集合监督微调与全局分叉策略优化,在标准推理与编程基准上单次准确率提升5%至7%。
Jack Clark在牛津大学HAI Lab发表演讲,探讨如何面对AI持续成功带来的变革,并分享个人使用AI的经历与Anthropic内部因Claude Opus 4.6而发生的组织变化。文中预测2026至2028年AI在生物、自主公司、机器人和科学发现等领域的进展,并附一则关于技术奇点与生命延续的虚构故事。
Mistral AI 已签署最终协议收购 Physics AI 先驱 Emmi AI,强化其工业 AI 布局。Emmi AI 总部位于奥地利,其 30 多名研究人员和工程师将加入 Mistral 的 Science 与 Applied AI 团队,公司的大型工程模型可用实时仿真替代数天计算并构建数字孪生。双方将打造面向工程师的 best-in-class 智能体,覆盖航空航天、汽车和半导体等行业。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。
推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。
Google DeepMind 在亚太区启动首届 Accelerator 计划,聚焦「AI for the Planet」,帮助应对该地区不断上升的环境风险。该计划为期三个月,面向区域内的初创企业、研究团队和非营利组织,覆盖自然、气候、农业、能源等领域。
Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。
宾大物理学家 Bo Zhen 团队开发出激子极化激元(exciton-polariton),实现全光开关,仅耗约 4 皮焦耳能量。传统光子芯片在非线性激活步骤需光-电转换,而该技术可避免这一瓶颈,有望降低大 AI 系统的能耗并支持未来芯片上的量子计算功能。
Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。
推荐理由:原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。
Omar Abudayyeh 和 Jonathan Gootenberg 用 Co-Scientist 扫描数万篇论文,提出 20 多个可逆转衰老的新基因假说,并验证部分成功使细胞恢复年轻状态。Co-Scientist 将大规模筛选数据与文献分析的时间从最多 6 个月缩短到几天。
SentinelOne 分析 fast16.sys 病毒,称其可精准篡改高精度计算软件结果,影响 LS-DYNA 等工具。Tilde Research 指出 Muon 优化器会导致 MLP 层大量神经元死亡,并提出 Aurora 优化器,在 nanoGPT 上损失与 MMLU 优于 Muon。
Google 在 Project Genie 中接入 Street View 真实街景图像,生成式世界模型可基于美国真实地点生成互动虚拟环境。该功能通过 Maps Imagery Grounding 技术实现,用户可选风格(如"Ocean World"、"B&W film")并描述角色,Genie 创建锚定真实街景的想象世界。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
Google 正在把内容透明度与验证工具扩展到搜索、Gemini、Chrome、Pixel 和 Google Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频加上水印,Gemini 应用中的验证功能已被使用 5000 万次,并将在未来几周扩展到搜索和 Chrome。
推荐理由:原文列出了 SynthID 与 C2PA 在搜索、Chrome、Pixel 上的落地范围,可据此判断内容溯源的行业分工。
Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。
Google DeepMind 在新加坡启动国家 AI 合作计划,聚焦医疗、教育与科研。合作包含 AI co-clinician 研究、AlphaFold 等 AI for Science 工具、Gemma 跑鞋助手、Gemini for Education 全校覆盖,以及与 IMDA 和 MLCommons 共建多模态安全基准。
summary_zh: 剑桥大学 Clare Bryant 教授使用 Google DeepMind 的 Co-Scientist 工具研究病原体跨物种传播引发败血症等疾病的分子开关。
summary_zh: Google DeepMind 推出 AI 研究助手 Co-Scientist,帮助 Calico Life Sciences 的专家整合衰老生物学领域的分散发现,生成可验证的新假设。
summary_zh: 爱丁堡大学生物工程师 Filippo Menolascina 使用 Co-Scientist 梳理文献,针对代谢功能障碍相关脂肪性肝炎(MASH)生成新假设。
MIT 的 Raman 与 Boston Children's Hospital 的 Flynn 利用 Co-Scientist 整合神经组织工程与 RNA 表面图谱技术,快速梳理 ALS 矛盾文献并生成可检验假设。Co-Scientist 帮助研究者按可行性与风险收益排序研究方向,并催化两人合作探索 RNA 机制与潜在 RNA 药物。
斯坦福遗传学家 Gary Peltz 使用 Co-Scientist 从现有药物文献中筛选肝纤维化候选药,Co-Scientist 提出的三种候选药中有两种在人体肝细胞实验中阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤应答。
推荐理由:原文给出 Co-Scientist 在肝纤维化药物筛选中的对比结果,读者可据此评估 AI 科研助手在真实实验中的辅助价值。
Google DeepMind与Google Research开发的AI天气模型WeatherNext在2025年10月飓风Melissa登陆牙买加前5天预测其将达到5级强度,置信度80%,3天前升至近100%。
推荐理由:WeatherNext在飓风Melissa登陆前5天以80%置信度预测出5级强度,为防灾争取了关键准备时间。
Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。
NASA 与 Microchip Technology 联合开发的新一代抗辐射处理器,在 JPL 的辐射、热和冲击测试中表现出约 500 倍于现有航天抗辐射芯片的性能。该芯片采用系统级封装,集成了 CPU、计算卸载、网络、内存和 I/O,目标是在深空、月球和火星任务中支持自主决策与科学数据处理,并计划应用于地球轨道器、行星车、深空探测器和载人栖息地。
Together AI 与 Pearl Research Labs 合作推出 Gemma-4-31B-it-pearl 推理端点,价格折扣超 25%,由 Pearl 加密货币收益对冲。Pearl Network 通过 Proof of Useful Work 在推理和训练过程中并行生成 ¶PRL 代币,降低 LLM 每 token 价格。
Together AI 发布开源视频翻译工具 Violin,集成 Whisper V3 转录、DeepSeek V4 Pro 翻译和 Cartesia Sonic 3 语音合成,并提供视频内容问答与自然语言选音功能。工具以 MIT 许可证开源,包含 Web 应用、CLI 和 Agent 技能,演示视频 24 小时后删除。
阿尔托大学研究团队开发了一种量子启发式算法,可在瞬间模拟包含超过 2.68 亿个位点的非周期量子材料,远超传统超级计算机能力。该算法将准晶体问题编码为量子多体系统,利用张量网络实现指数级加速,为拓扑量子比特和超摩尔超准晶体的设计铺路。研究目前仍处于理论模拟阶段,未来可适配至芬兰量子计算基础设施上的实际量子硬件。
Baycrest、多伦多大学和约克大学的研究显示,日常对话中的停顿、填充词(uh/um)及取词困难与执行功能显著相关,AI 分析语音可预测认知测试表现,且不受年龄、性别和教育程度影响。研究者认为自然语音或成为比传统纸笔测试更易重复的认知筛查工具,但需长期研究区分正常老化与疾病早期信号。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论与演化假设来加速生命科学等领域的科研突破。
推荐理由:原文给出多智能体协作与假设生成引擎的具体阶段,读者可据此评估它对现有科研工作流的实际改变。
Import AI 456 汇总三篇论文与一则思想实验:递归自我改进可能通过技术与经济反馈环引发爆炸式增长,13%自动化即可触发临界点,硬件研发是关键杠杆;Meta与KAIST提出神经计算机概念。
DeepSeek-V4 支持 1M 上下文窗口,通过 CSA/HCA/SWA 混合注意力在 token 轴压缩 KV 缓存。在 NVIDIA HGX B200 上,缓存策略使单节点 KV 容量从约 1.2M token 提升至 3.7M token。
推荐理由:V4 把百万上下文变成系统问题,读者可据此判断自身负载是否落在压缩注意力与缓存策略的有效区间。
伯克利研究团队综述了自适应并行推理(APR)范式,提出模型可自主决定何时分解任务、生成多少并行线程以及如何协调。APR 通过特殊控制标记在推理时动态分配串行与并行计算,相比固定并行和多数投票等方法能减少冗余并避免上下文膨胀。文中对比了 Multiverse 等修改推理引擎与 ThreadWeaver 等保持引擎不变的系统设计,并讨论了基于关键路径的并行效率奖励和当前开放问题。
推荐理由:原文梳理了自适应并行推理的范式与推理系统实现差异,读者可据此理解不同并行策略在延迟和准确率上的权衡。
summary_zh: 使用 Goose CLI Agent 配合 Together 的 dedicated containers skill,从 HuggingFace 拉取 Netflix 刚发布的 void-model,在单次会话内完成容器配置并部署到 Together DCI 基础设施,实现发布当天即可运行。
Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。
推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。
EPFL Philippe Schwaller 团队在 Matter 发表 Synthegy 框架,将大语言模型作为推理工具指导传统计算搜索。化学家以自然语言给出合成策略(如优先成环、避免保护基),系统评分并解释匹配度,双盲研究中 36 位化学家的评估与系统结果一致率为 71.2%。同一接口也可用于反应机理的电子步骤搜索与条件细化。