ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核
Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。
推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。
推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。
Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。
推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。
推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。
推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。
Mistral AI 发布 Search Toolkit 公测版,这是一个可组合框架,用于构建面向 AI 应用的生产级搜索流水线。框架将摄入、检索和评估统一在单一接口下,减少团队组装基础设施的时间,并内置召回率、精确率、MRR 和 NDCG 等评估指标。
推荐理由:将摄入、检索与评估统一到单一框架,减少团队在集成上的工程开销,使其能专注于搜索质量本身的持续优化。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
伯克利研究团队综述了自适应并行推理(APR)范式,提出模型可自主决定何时分解任务、生成多少并行线程以及如何协调。APR 通过特殊控制标记在推理时动态分配串行与并行计算,相比固定并行和多数投票等方法能减少冗余并避免上下文膨胀。文中对比了 Multiverse 等修改推理引擎与 ThreadWeaver 等保持引擎不变的系统设计,并讨论了基于关键路径的并行效率奖励和当前开放问题。
推荐理由:原文梳理了自适应并行推理的范式与推理系统实现差异,读者可据此理解不同并行策略在延迟和准确率上的权衡。
Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。
推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。
Google 发布 ERA 辅助科研的预印本,展示其在流行病学、宇宙学、气候与神经科学四个领域的应用。在流感、COVID-19 和 RSV 预测中,ERA 达到或接近 CDC 顶级预测水平;与 Gemini Deep Think 结合推导出宇宙弦引力辐射的统一公式;利用 GOES East 卫星数据以 10 分钟间隔反演柱平均 CO2;在斑马鱼神经回路中发现可泛化的机制性解。
推荐理由:四类科学场景展示了 ERA 与 LLM 协作解决开放问题的潜力,为 AI 辅助科研提供可迁移方法。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding
推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。
Google Research发布MoGen模型,通过点云流匹配生成合成神经元形态,用于训练PATHFINDER重建模型。加入10%合成数据后,鼠轴突重建错误率降低4.4%,主要减少合并错误,在全鼠脑规模上相当于节省157人年人工校对。MoGen及物种特异性模型已开源。
推荐理由:用合成神经元训练PATHFINDER,将重建错误率降低4.4%,在全鼠脑规模上相当于节省157人年校对工作。
Together AI 发布 Parcae,一种稳定的循环语言模型架构,在相同数据和参数下比先前循环模型降低最多 6.3% 验证困惑度。770M Parcae 达到与 1.3B Transformer 相当的质量,并给出循环次数的幂律缩放关系。团队已开源训练代码与模型。
推荐理由:原文给出具体困惑度对比与参数减半效果,读者可据此评估循环架构在边缘部署中的实际参数效率。
Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。
推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。
Together AI 发布 DBPlanBench,把 Apache DataFusion 的物理执行计划暴露给 LLM,通过紧凑 JSON 序列化和 JSON Patch 局部修改计划,避免重新生成整个计划。
推荐理由:将 LLM 引入物理计划优化,用语义推理弥补统计估计偏差,为数据库查询加速提供了可复现的新方法。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Google Research 提出森林与树的(N,K)权衡框架,研究在固定预算下标注条目数与每条目标注者数量的最优配比。实验基于毒性、DICES、D3code、Jobs 等真实主观数据集,发现每条目 3–5 个标注者常不足、多数票用广度策略、意见分布用深度策略,并开源了模拟器。
推荐理由:给出了(N,K)权衡的模拟框架和开源工具,读者可据此在有限预算下设计更可复现的评估方案。