最新精选
第 101–117 条 · 共 117 条Together AI 发布开源框架 Aurora,将推测解码改为由在线推理 trace 持续训练 draft 模型的飞轮。在 Qwen3 和 Llama3 上比已训好的静态 speculator 额外提速 1.25x;域切换后约 10,000 个请求恢复接受长度;混合流量下从零在线训练 acceptance length 达 3.08、吞吐 302.3 tokens/s。代码已开源。
推荐理由:把 speculative decoding 从静态离线训练改成在线自适应飞轮,对已训好的静态 speculator 能再叠加 1.25x 加速。
Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。
推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。
Together AI 联合 CMU、Princeton、Cartesia AI 发布 Mamba-3,一种以推理效率为主要目标的新状态空间模型(SSM)。
推荐理由:Mamba-3以推理效率为核心重新设计SSM,在1.5B规模上对延迟与精度给出了可对比的实测结果。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
- Google Research精选AI 评分7373
Google Research 发布 Groundsource 方法,利用 Gemini 从全球新闻报道中提取洪水事件,构建了覆盖 150 多个国家、260 万条记录的开放数据集。方法结合 Google Read Aloud 和 Cloud Translation API 进行多语言文本提取与标准化,并通过 Gemini LLM 完成分类、时间推理和空间定位验证。
推荐理由:该方法将非结构化新闻转化为结构化灾害数据,为全球洪水预测提供了新的数据基线。
Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。
推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。
- Google Research精选AI 评分6060
Google Research发布WAXAL开源语音数据集,覆盖27种撒哈拉以南非洲语言、超过1亿使用者,包含约1846小时ASR转录语音和565小时TTS高质量录音,采用CC-BY-4.0许可。
推荐理由:开源语音数据集覆盖27种撒哈拉以南非洲语言,为低资源语言语音技术提供了可复用的数据基础。
Together AI 在首届 AI Native Conf 发布七项更新,涵盖 FlashAttention-4、Together Megakernel、together.compile、Reinforcement Learning API、ThunderAgent、ATLAS-2 与 CPD。
推荐理由:七项发布覆盖内核、强化学习与推理优化,读者可据此评估 Together 在生产部署与训练加速上的最新能力边界。
Together AI 发布 SF Streets 和 US Streets 两个新基准,测试发现 15 个主流语音模型对街名的平均转录错误率达 39%,非英语母语者比英语母语者准确率低 18 个百分点,导航偏差平均多 1.2 英里。
推荐理由:研究揭示了主流语音模型在街名转录上的显著误差,并给出小样本合成数据的改进方法,对导航和应急调度场景具有直接参考价值。
Together AI 研究团队通过主题中性的开放种子提示(如 "Actually," "Let's think step by step," 或仅标点)移除 chat 模板与系统提示,研究 LLM 的近无约束生成行为。
推荐理由:在无主题提示下观察模型原始生成分布,揭示了各模型族稳定的语义偏好与退化模式,为审计和指纹识别提供了新视角。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 批量模型和 Voxtral Realtime 实时模型。
推荐理由:原文给出了两款模型的价格与延迟配置,读者可以据此对比其成本与实时性是否匹配自身场景。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Mistral 发布 Codestral 25.08,并推出包含 Codestral Embed、Devstral 与 Mistral Code 插件的企业级编程栈,支持云、VPC 与本地部署。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Mistral AI 发布首个推理模型 Magistral,分开源的 Magistral Small(24B)与企业版 Magistral Medium;Magistral Medium 在 AIME2024 得分 73.6%,多数投票 @64 达 90%,Small 分别为 70.7% 与 83.3%。
推荐理由:Mistral 首次推出推理模型 Magistral,分开源与企业两个版本,读者可据此对比其推理能力与部署选择。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
Mistral 发布 Mistral Medium 3,宣称以显著更低成本提供接近前沿大模型的性能。模型在编码与 STEM 任务上接近更大更慢的竞品,API 定价为输入 $0.4 / 输出 $2 每百万 token,可在四卡及以上自托管环境部署。
推荐理由:原文给出性能与成本对比,读者可据此判断它对现有开源大模型格局的影响。
Mistral 推出 OCR API,支持图像和 PDF 输入,以 interleaved 文本与图片结构化输出,并作为默认文档理解模型集成到 Le Chat。API 在 la Plateforme 以 1000 页/$ 开放,批量推理每美元页数约翻倍,同时提供自托管选项。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。