NVIDIA 开源 Magpie TTS 多语言语音模型,支持 12 种语言与自有环境部署
NVIDIA 发布 364M 参数的开源语音合成模型 Magpie TTS Multilingual,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并提供男声与女声。
NVIDIA 发布 364M 参数的开源语音合成模型 Magpie TTS Multilingual,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并提供男声与女声。
Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Nathan Lambert基于OpenAI-HuggingFace黑客事件及Black Hat披露,提出十条观点:更持久的推理模型可能更易被用于攻击;模型对用户意图的假设影响安全边界。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务。用户可在模型页或通过 Python、JavaScript SDK,用 HF token 调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM,后续将扩展更多任务。
summary_zh: Amazon 公布 Build on Trainium 34 个获奖项目,该计划投入 110 万美元算力资助,聚焦新模型架构、ML 库、大规模分布式系统等方向。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
Meta 发布 GEM 训练细节,通过定制推荐内核库、混合超低精度训练、拓扑感知 5D 并行与 SM-free 通信等协同设计,将端到端训练效率翻倍至 20–25% MFU,并在 12 个月内将训练 FLOPs 扩展 4 倍。
推荐理由:Meta 分享了 GEM 在 LLM 规模下训练推荐模型的具体方法,为跨推荐与 LLM 的基础设施协同设计提供可迁移经验。
Interconnects 推出 Artifacts Hub 与 Adoption Dashboard 两项免费数据工具,覆盖 Hugging Face 近两年发布的 792 个开源模型。
Interconnects 复盘最新开放模型动态,指出多家公司持续投入训练并以开放方式发布模型,Thinking Machines 的 Inkling 与 Poolside 的 Laguna S2.1 等均在 Pareto 前沿有表现。DeepSeek-V4-Flash 在 OpenAI 降价后更新,Kimi K3 采用非商业许可并引发关于美国政策工具的讨论。
Google Research 提出 Science One Framework 与 Chain-of-Evidence(CoE)审计框架,在 75 篇生成论文上验证自主研究系统的可验证性。Science One Framework 在五个 ADRS 任务上实现零幻影引用、完全可复现得分,并在 MLE-Bench 与 Parameter-Golf 上达到 SOTA。
推荐理由:通过引入可验证证据链框架,为自主研究系统的可信度提供了可量化的审计方法。
ThunderAgent 在单 8×H100 节点上相对 SGLang 达到 2.5 倍吞吐量、P50 延迟降低约 10 倍,8 节点集群实现 2.4 倍加速且接近线性扩展。
推荐理由:把多轮 agent 请求视为程序而非独立请求,让 KV cache 命中率提升并缓解多节点负载不均。
Together AI 发布 Dedicated Model Inference 平台,支持部署自有或开源权重模型,并提供部署配置、预热加速、Canary/蓝绿/滚动发布、A/B 与影子流量测试及 Prometheus 可观测性。平台覆盖从实验到生产的全生命周期,并同步开启自定义训练(含 LoRA 与强化学习)封闭测试。
推荐理由:原文给出部署预热、流量切换与可观测性等具体能力,读者可以据此判断它能否降低自研推理栈的运维成本。
英国AI安全研究所分析显示,GLM-5.2和DeepSeek V4-Pro在窄网络安全评测上已接近4至7个月前的闭源前沿模型,但在长周期链式攻击任务上差距仍较大。
推荐理由:开源模型与闭源模型在网络安全能力上的差距正在缩小,提示防御方需在能力扩散前抓紧准备。
Hugging Face 检测到生产基础设施遭自主 AI 代理系统入侵,未经授权访问了部分内部数据集和凭证,未发现公开模型、数据集或 Spaces 被篡改。攻击通过恶意数据集利用数据处理管道中的代码执行路径发起,代理框架在数千个短期沙箱中执行了超过 17,000 条操作。
推荐理由:Hugging Face 披露了由自主 AI 代理系统驱动的入侵事件,并分享了用自有开源模型进行取证分析的实践经验。
Hugging Face 发布 Real World VoiceEQ 基准,从声学信息层面评估语音交互的人本质量,覆盖ASR、TTS、S2S与语音理解,超40款开源与闭源模型参与。评测基于超过100万条人类评分,包含78.5万条TTS与4.8万条STS评分,并指出传统基准在噪声、口音、情绪等真实场景下高估模型表现,语音模型在
推荐理由:原文呈现了覆盖40余款模型的评测结果与关键发现,帮助读者在语音接口成为主流交互方式的背景下重新审视现有基准的局限。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
summary_zh: MIT 开设 JARVIS Challenge,要求本科生在四周内用 AI 设计、加工、组装并测试一台 50–100 磅推力的单转子喷气发动机。
Nathan Lambert 分析指出,开放模型正面临蒸馏与前沿能力双重监管压力,最可能的结果是在6个月内对接近 GPT-5.5、Claude Opus 4.8 或 GLM-5.2 能力的开放权重模型实施禁令或延迟。他批评 Anthropic 的蒸馏讨论具有监管俘获特征,并认为仅靠美国单边禁令难以奏效,呼吁美国公司尽快发布同等能力的开放模型以改变叙事。
推荐理由:作者以观察者视角梳理了开放模型面临的双重政策压力,可帮助读者理解当前监管讨论与产业博弈的关联。
MIT CSAIL 团队发布 FloatForm 系统,由 21 厘米方形自主船组成,通过磁锁原结构实现自组装、拆解与重组,仅在精调位置时引入轻量中央规划器。实验中 8 个机器人完成构型转换并集体运输,仿真可扩展至 64 个;10 次试验中 4 机器人成功率为 90%、8 机器人为 70%。论文发表于 Nature Communications,源自与阿姆斯特丹合作的 Roboat 项目。
推荐理由:分布式水下机器人自组装为可编程水上基础设施提供了可扩展思路,对应急响应与公共空间重构有参考价值。
Hugging Face 更新 vLLM 的 transformers 建模后端,在 Qwen3-4B、Qwen3-32B、Qwen3-235B-A22B-FP8 三种模型上达到或超越原生 vLLM 吞吐。模型作者只需添加 --model-impl transformers 标志即可自动获得优化推理,无需手写自定义实现。
推荐理由:transformers 后端现已达到原生 vLLM 实现同等吞吐,模型作者无需重写代码即可在 vLLM 中获得优化推理性能。
Hugging Face 与 SkyPilot 联合推出 store: hf 存储后端,用 hf:// URL 将 HF Bucket 或 Hub repo 挂载到 SkyPilot 任务,实现跨云 GPU 任务零 egress 读取。
推荐理由:Hugging Face Storage 成为 SkyPilot 官方存储后端,团队可在任意云上运行 GPU 任务并免费读取 Hub 数据,无需跨云拷贝或承担 egress 费用。
summary_zh: PRX 团队公开了其预训练数据策略:从公开与内部数据集混合采集图像数据,用 VLM 重新标注,并以长caption 保证描述完整。流程上使用 Lance 做特征工程与数据集构建、MDS 格式流式读取;文本编码器切换至 Qwen3-VL 后改为训练时实时计算 latent,仅带来约 3–4% 吞吐量开销;图像统一以质量 92 的 JPEG 编码。
Import AI 464 汇总了 Fable 在 KernelBench-Mega 上写出首个真正且最快的 megakernel,实现 18.71 倍 CUDA 加速。
Mistral 发布 Leanstral 1.5,这是一个 Apache-2.0 许可的 Lean 4 形式验证模型,119B 总参数、6B 激活参数。它在 miniF2F 上达到 100%,解出 PutnamBench 587/672 题,FATE-H 为 87%、FATE-X 为 34%,权重已在 Hugging Face 开源并提供免费 API。
Together AI 完成 8 亿美元 C 轮融资,投资方包括 Aramco Ventures、NVIDIA、General Catalyst 等,并获得 500MW 以上算力承诺。
summary_zh: Meta 今年迎来连续第十一年赞助 Python 软件基金会(PSF),Python 是 Meta 使用最广泛的编程语言,支撑 Instagram、Threads 后端及 PyTorch 等 AI 研究。
Google Research 推出 TabFM,将表格预测重构为上下文学习问题,单次前向传播即可生成零样本预测。该模型基于数亿个合成数据集训练,无需手动特征工程与超参调优,目前已开源并集成至 Google Cloud BigQuery。
Every Eval Ever 与 Hugging Face 社区评测现已实现互操作,官方提供了转换器工具,可自动将 EEE 评测记录同步为模型仓库中的 YAML 文件。数据存储已收录约 22.9 万条评测结果,覆盖 2.2 万个模型和 2200 个基准。该工具支持 MMLU-Pro、GPQA、HLE 和 GSM8K 四项基准,并在写入前自动审核冲突。
推荐理由:EEE与Hugging Face社区评测现在可互操作,转换器自动将EEE记录写入YAML文件并审核冲突,解决评测结果分散难以对比的长期问题。
Together AI 在 ICML 2026 发布九篇论文,覆盖智能体、模型塑造、算法优化、系统优化与内核五个层级。DSGym 提供 1000+ 任务统一评估框架,ThunderAgent 提升 1.5–3.6 倍智能体吞吐,TTT-Discover 用开源 120B 模型在数学、GPU 内核、算法和生物领域取得新纪录。
推荐理由:九篇论文覆盖从智能体到 GPU 内核的完整栈,读者可据此判断哪些层是当前性能瓶颈。
教程介绍如何用开源工具与开放权重大模型搭建本地编码智能体,以 Qwen3.6 配合 Qwen-Code 为主,并对比 Codex、Claude Code、Cline 等其他智能体框架。
Nathan Lambert 亲测 GLM-5.2 后认为,它是首个在编码 harness 中表现可靠的开放权重通用智能体模型,Arena 评测中已能比肩 Claude Opus 4.8 的 max 模式。社区反响强烈,作者将其与 DeepSeek R1 类比,并指出这会给 Anthropic 带来定价压力,同时让开放模型经济迎来拐点。
推荐理由:作者以亲测视角说明 GLM-5.2 在编码智能体工作流中的可用性,为读者判断开放模型何时能替代闭源前沿模型提供可迁移观察。
文章指出禁止开源 AI 是严重错误,开源软件已为全球创造超 8 万亿美元经济价值。开源 AI 以开放权重模型形式成为对抗 Anthropic 与 OpenAI 双头垄断的关键制衡力量。文章强调开源的透明性使其更安全,并呼吁警惕以中美竞争为借口监管开源带来的反噬。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。
推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。
Google Research 在 I/O 2026 集中发布 Gemini for Science、Google Health 应用、Coralboard、WeatherNext、Groundsource、Gemma V4 等研究驱动产品与开源工具,并开放 Science Skills、Paper Assistant Tool 等实验性能力。
Mistral 收购 Emmi AI,宣布加码 Physics AI,覆盖航空航天、汽车、半导体与能源领域。已发布多项突破,包括 3D 机翼跨声速 CFD 数据集、GyroSwin 5D 代理模型、AB-UPT 支持 140M 体素单 GPU 推理,以及 NeuralDEM 端到端多物理场代理模型,部分成果已开源。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
Gemma 4 E2B/E4B 采用跨层 KV 共享以缩减长上下文缓存;Laguna XS.2 引入逐层注意力预算分配;ZAYA1-8B 使用压缩卷积注意力;DeepSeek V4 结合 mHC 与压缩注意力。原文聚焦 Transformer 块、残差流、KV 缓存与注意力计算部分,未涉及数据集、训练计划或 benchmark 对比。