跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

117条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 81–100 条 · 共 117 条
6月23日周二
  1. Together AI66

    ParallelKernelBench:前沿大语言模型尚不能编写高效多GPU内核

    Together AI发布ParallelKernelBench(PKB)开源基准,包含87个来自真实代码库的多GPU内核生成问题,要求模型用CUDA内核替代PyTorch+NCCL并通过NVLink直接通信。

    推荐理由:基准揭示前沿模型在多GPU内核生成上正确率与速度优势均有限,为分布式优化研究提供了可复现的测试平台。

6月22日周一
  1. Interconnects82

    GLM-5.2 是开放智能体的关键一步

    Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。

    推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。

6月11日周四
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

6月9日周二
  1. Amazon Science77

    亚马逊研究提出意图执行差距框架并开源 Simple Strands Agent

    亚马逊在 arXiv 发表论文 Dissecting model behavior through agent trajectories,提出意图执行差距(intent-execution gap)概念,指出智能体性能瓶颈在于 harness 将模型意图转化为动作并反馈执行结果的能力。

    推荐理由:论文揭示了智能体性能瓶颈从模型推理转向 harness 执行转换,提出双向意图执行差距框架并开源 SSA harness。

6月2日周二
  1. Together AI73

    MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践

    MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。

    推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。

5月29日周五
  1. Together AI78

    Together AI 构建最快语音转文本栈的方法

    Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。

    推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。

5月28日周四
  1. Mistral AI63

    Mistral AI 发布 Search Toolkit 公测版

    Mistral AI 发布 Search Toolkit 公测版,这是一个可组合框架,用于构建面向 AI 应用的生产级搜索流水线。框架将摄入、检索和评估统一在单一接口下,减少团队组装基础设施的时间,并内置召回率、精确率、MRR 和 NDCG 等评估指标。

    推荐理由:将摄入、检索与评估统一到单一框架,减少团队在集成上的工程开销,使其能专注于搜索质量本身的持续优化。

5月22日周五
5月17日周日
5月8日周五
  1. Berkeley AI Research73

    自适应并行推理:高效推理扩展的新范式

    伯克利研究团队综述了自适应并行推理(APR)范式,提出模型可自主决定何时分解任务、生成多少并行线程以及如何协调。APR 通过特殊控制标记在推理时动态分配串行与并行计算,相比固定并行和多数投票等方法能减少冗余并避免上下文膨胀。文中对比了 Multiverse 等修改推理引擎与 ThreadWeaver 等保持引擎不变的系统设计,并讨论了基于关键路径的并行效率奖励和当前开放问题。

    推荐理由:原文梳理了自适应并行推理的范式与推理系统实现差异,读者可据此理解不同并行策略在延迟和准确率上的权衡。

5月6日周三
  1. Google DeepMind82

    AlphaEvolve:Gemini 驱动的编程智能体跨领域规模化影响

    Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。

    推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。

4月30日周四
  1. Google Research67

    Google Research 科学家使用 Empirical Research Assistance 的四种方式

    Google 发布 ERA 辅助科研的预印本,展示其在流行病学、宇宙学、气候与神经科学四个领域的应用。在流感、COVID-19 和 RSV 预测中,ERA 达到或接近 CDC 顶级预测水平;与 Gemini Deep Think 结合推导出宇宙弦引力辐射的统一公式;利用 GOES East 卫星数据以 10 分钟间隔反演柱平均 CO2;在斑马鱼神经回路中发现可泛化的机制性解。

    推荐理由:四类科学场景展示了 ERA 与 LLM 协作解决开放问题的潜力,为 AI 辅助科研提供可迁移方法。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

4月24日周五
  1. Together AI70

    Together AI 发布分布感知推测解码 DAS,RL 展开加速最高 50%

    Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding

    推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。

4月16日周四
  1. Google Research60

    MoGen:基于点云流匹配的神经元形态生成以加速脑连接组重建

    Google Research发布MoGen模型,通过点云流匹配生成合成神经元形态,用于训练PATHFINDER重建模型。加入10%合成数据后,鼠轴突重建错误率降低4.4%,主要减少合并错误,在全鼠脑规模上相当于节省157人年人工校对。MoGen及物种特异性模型已开源。

    推荐理由:用合成神经元训练PATHFINDER,将重建错误率降低4.4%,在全鼠脑规模上相当于节省157人年校对工作。

4月15日周三
  1. Together AI67

    Parcae:基于稳定循环架构以更少参数实现更强性能

    Together AI 发布 Parcae,一种稳定的循环语言模型架构,在相同数据和参数下比先前循环模型降低最多 6.3% 验证困惑度。770M Parcae 达到与 1.3B Transformer 相当的质量,并给出循环次数的幂律缩放关系。团队已开源训练代码与模型。

    推荐理由:原文给出具体困惑度对比与参数减半效果,读者可据此评估循环架构在边缘部署中的实际参数效率。

4月13日周一
  1. Together AI82

    EinsteinArena:让智能体在开放平台上协作解决数学难题

    Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。

    推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。

4月3日周五
  1. Google DeepMind82

    Gemma 4 发布:字节级对齐的最强开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。

    推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。

4月1日周三
  1. Google Research62

    构建更好的 AI 基准:多少标注者才够用?

    Google Research 提出森林与树的(N,K)权衡框架,研究在固定预算下标注条目数与每条目标注者数量的最优配比。实验基于毒性、DICES、D3code、Jobs 等真实主观数据集,发现每条目 3–5 个标注者常不足、多数票用广度策略、意见分布用深度策略,并开源了模拟器。

    推荐理由:给出了(N,K)权衡的模拟框架和开源工具,读者可据此在有限预算下设计更可复现的评估方案。