跳到正文

全部动态

今日 60 条
6月23日周二
  1. Together AI66

    ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核

    Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。

    推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。

6月17日周三
  1. Google Research35

    Google Earth AI 发布 Farmscapes 高分辨率向量化乡村生态地图

    Google Earth AI 发布 Farmscapes 向量化数据集,将英国 130,000 km² 高分辨率卫星影像中的树篱、石墙和林地转为可操作矢量清单。基于 RSF ViT 骨干(预训练于 3 亿+全球卫星图)微调,结合亚米影像与 1 米 LiDAR 双层标注,用 Polsby–Popper 紧凑度得分区分林地(≥30 米直径)、树丛与线性植被。

6月16日周二
  1. Google DeepMind67

    Google DeepMind 发布 AI Control Roadmap 框架,阐述 AI 代理安全防御体系

    Google DeepMind 发布 AI Control Roadmap,提出分层防御框架,将内部 AI 代理视为潜在未对齐实体,通过监控、阻断与指标度量管理风险。框架基于 MITRE ATT&CK 构建威胁模型,并按检测规避能力(D1-D4)与攻击执行能力(R1-R3)匹配安全措施;团队已分析百万条编码代理轨迹,用于优化 Gemini Spark 等代理的实时监控。

    推荐理由:原文给出分层防御框架与三条关键能力演进路径,读者可借此理解企业级 AI 代理安全的技术路线。

6月13日周六
6月11日周四
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

6月10日周三
  1. Amazon Science76

    AWS EC2 M9g 实例推出经形式化验证的隔离引擎

    AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。

    推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。

  2. Google DeepMind44

    Google DeepMind 联合 Schmidt Sciences 等机构投资多智能体 AI 安全研究

    Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 和 Google.org 宣布提供最高 1000 万美元的技术研究资助,面向全球研究人员。资助重点研究大规模多智能体 AI 系统的群体行为,并提供框架以理解和缓解潜在风险。申请截止日期为 2026 年 8 月 8 日,获奖者预计于 2026 年秋季公布。

  3. Together AI22

    Together AI 通过 ISO 27001:2022 认证

    Together AI 获得 A-LIGN 颁发的 ISO 27001:2022 认证,其信息安全管理体系统过独立审计,覆盖全球平台及第三方数据中心。认证为企业在 Together AI 上运行生产级 AI 工作负载提供治理、访问控制、资产管理、安全开发与事件响应等方面的安全保障,并可与 SOC 2 等框架互补。

6月9日周二
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    推荐理由:Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

  2. Amazon Science47

    Project Eluna:智能体 AI 的物理世界锚定

    2026 年 AI 从"知道"转向"行动",Amazon 推出 Project Eluna,作为仓库运营的智能体模型,通过数字仪表板辅助运营决策。论文提出四种锚定方法:物理引导深度学习、不确定性感知推理、文本到数值桥接,以及第四种方法。UQ4CT 框架在五个基准上保持高准确率,同时将预期校准误差降低 25% 以上。

  3. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。

6月8日周一
  1. Google DeepMind67

    DeepMind 发布 AI 辅助学习在塞拉利昂的 RCT 结果

    DeepMind 发布塞拉利昂预注册 RCT 结果,使用 Guided Learning 的学生数学成绩提升 +0.258 标准差,相当于 1.2-1.7 年学习进度;教师将 Gemini 融入约一半课堂的小组增益达 1.8-2.5 年。

    推荐理由:在塞拉利昂的 RCT 显示 AI 辅导可带来 1.2-2.5 年学习进度增益,为教育 AI 的实证基础提供了关键数据。

6月5日周五
  1. Google Research66

    Google Research发布PHRM系统:通过智能手机摄像头实现被动心率监测

    Google Research在Nature发表PHRM研究,通过智能手机前置摄像头在日常使用中被动监测心率,跨肤色MAPE<10%,RHR估计MAE<5bpm达到可穿戴设备精度。研究基于35万+视频片段和近700名多样本参与者,覆盖浅色到深色皮肤群体,并公开了最大规模智能手机视频数据集及预训练PHRM-mini模型供合格研究者申请。

    推荐理由:PHRM在大规模日常使用中实现跨肤色符合行业标准的心率监测,MAE低于5bpm的RHR估计达到可穿戴设备水平,为智能手机被动健康追踪设立了新基准。

6月4日周四
  1. Google Research58

    Google开源水文模型框架以提升全球洪水韧性

    Google Research将用于Google Flood Hub的水文模型框架开源至GitHub,采用Apache 2.0许可,基于PyTorch并支持LSTM架构。框架包含2024基准测试版与升级版,新版本在有测站流域将可靠预报期延长6天、无测站流域延长1天,并可与Delft-FEWS平台集成。捷克水文气象研究所(CHMI)已合作验证并提供适配器。

6月3日周三
  1. Amazon Science73

    Ground truth is a process, not a dataset

    Amazon AGI 团队提出 audit-then-score 协议与 DeepFact-Bench、DeepFact-Eval 两套数据集,用于评估 AI 生成的研究报告。实验显示,未经辅助的专家在已知答案集上仅 60.8% 准确率,而经过四轮审核校准后升至 90.9%;DeepFact-Eval 基于 GPT-4.1 达 83.4%,优于传统事实核查系统与既有深度研究系统。

    推荐理由:原文揭示了深度研究场景下静态基准的局限,为理解 AI 评估体系的演进方向提供了可迁移方法。

6月2日周二
  1. Together AI73

    MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践

    MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。

    推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。

5月29日周五
  1. Together AI78

    Together AI 构建最快语音转文本栈的方法

    Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。

    推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。

5月28日周四
  1. Mistral AI62

    Mistral 在 AI Now Summit 2026 发布工业 AI 栈与 Vibe 智能体

    Mistral 在 AI Now Summit 2026 推出面向工业工程的 AI 栈,并宣布与 Airbus、BMW、ASML 合作,覆盖设计、仿真与生产环节。Vibe 被升级为可处理长周期任务的统一智能体,同时法国 Les Ulis 新建 10 MW 数据中心计划于 2026 年 Q3 开放。

    推荐理由:原文给出了工业 AI 栈与 Vibe 智能体的能力边界,读者可据此判断 Mistral 在企业级工作流中的差异化定位。

  2. Mistral AI63

    Mistral AI 发布 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit 公测版,这是一个可组合框架,用于构建面向 AI 应用的生产级搜索流水线。框架将摄入、检索和评估统一在单一接口下,减少团队组装基础设施的时间,并内置召回率、精确率、MRR 和 NDCG 等评估指标。

    推荐理由:将摄入、检索与评估统一到单一框架,减少团队在集成上的工程开销,使其能专注于搜索质量本身的持续优化。

  3. Amazon Science79

    AWS数据中心网络用扁平化架构替代胖树架构

    Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。

    推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。

  4. Google Research62

    Google Research 提出零信任聚合实现隐私分析

    Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。

    推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。

5月27日周三
  1. Mistral AI42

    Mistral 发布 physics AI:工程加速的基础

    Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。

5月26日周二
  1. Amazon Science62

    多样化推理轨迹教会大语言模型做出更好决策

    亚马逊研究团队在ICLR发表论文,提出集合监督微调(SSFT)与全局分叉策略优化(GFPO),通过为不同推理模式分配全局分叉token来训练模型掌握多样化推理策略,并在推理时选择最优模式。AIME 2025、AIME 2024与LiveCodeBench-v5上Pass@1分别提升6.84、5.37与4.94个百分点,同时改善pass@k多样性且不损害单次准确率。

    推荐理由:提出集合监督微调与全局分叉策略优化,在标准推理与编程基准上单次准确率提升5%至7%。

5月23日周六
  1. Mistral AI48

    Mistral AI 收购 Physics AI 先驱 Emmi AI,加速 AI 原生工业

    Mistral AI 已签署最终协议收购 Physics AI 先驱 Emmi AI,强化其工业 AI 布局。Emmi AI 总部位于奥地利,其 30 多名研究人员和工程师将加入 Mistral 的 Science 与 Applied AI 团队,公司的大型工程模型可用实时仿真替代数天计算并构建数字孪生。双方将打造面向工程师的 best-in-class 智能体,覆盖航空航天、汽车和半导体等行业。

5月22日周五
  1. Mistral AI64

    Mistral Studio 发布 Connectors 支持内置与自定义 MCP

    Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。

    推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。

5月20日周三
  1. Google Research58

    ERA发表Nature论文并推动计算发现

    Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。

5月19日周二
  1. Together AI73

    Together AI 发布编码智能体推理基准测试

    Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。

    推荐理由:原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。