Google 发布 Gemini 3.5 Transcribe 语音转写模型
Google 发布语音转文字模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测试流式 WER 为 4.0%、非流式为 2.6%。
推荐理由:原文列出流式与非流式 WER、延迟改进幅度及两条 API 形态,可与 Chirp 3 对照判断升级幅度。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测试流式 WER 为 4.0%、非流式为 2.6%。
推荐理由:原文列出流式与非流式 WER、延迟改进幅度及两条 API 形态,可与 Chirp 3 对照判断升级幅度。
Microsoft Agent Framework 发布 Python 通道包,支持 OpenAI Responses、Telegram、A2A 和 MCP 协议接入。
推荐理由:原文给出了多协议接入能力和共享状态模型,开发者可据此判断是否需要将现有 Agent Framework 应用扩展到新的通道。
MIT研究人员开发CrysVCD框架,在材料生成初期通过价电子约束规则筛选不稳定结构,与扩散模型和语言模型结合使用。近70%计算生成达到晶格动力学稳定标准,机械稳定性和亚稳性分别达68%和85%,生成效率比事后筛选提高一个数量级。
Kubernetes v1.37 发布,主题为 Garhwal,包含 67 项增强,其中 16 项升为 Stable、23 项升为 Beta、27 项进入 Alpha、1 项弃用。Stable 特性包括弹性 watchcache 初始化,Beta 特性包括 HorizontalPodAutoscaler 缩放到零和基于清单的准入控制配置,Alpha 特性包括 Pod 级检查点与恢复。
Sentence Transformers v6.0 引入 MultiVectorEncoder,支持 ColBERT 风格的晚交互检索,并提供完整微调流程。
推荐理由:原文给出了一套完整的多向量模型微调流程与实测数据,读者可据此在单张消费级 GPU 上复现领域检索模型。
NVIDIA Dynamo 推出 Shadow Engine Recovery 预览功能,在 LLM 引擎进程失败时实现秒级恢复,避免冷启动带来的权重加载、kernel 编译和 CUDA graph 捕获开销。
推荐理由:原文给出热恢复能力与秒级恢复入口,读者可据此评估它对推理可用性的实际影响。
Google Research 在 CHI 2026 发表 AgentHands 原型,利用 XR 空间理解能力为 AI 智能体添加与语音同步的手部手势。系统包含环境感知、手势事件库、嵌入手势的推理和同步执行模块,在 12 人用户研究中相比纯语音基线显著提升了空间定位、复杂动作理解、安全提示效果并降低了认知负荷。
summary_zh: Google Search 提供 5 种工具帮助用户升级家居装饰:AI Mode 可上传房间照片可视化推荐沙发并生成预览;Google Lens 可识别复古物品并搜索相似商品。
IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。
推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。
NVIDIA 发布 CUDA Python 1.0,提供稳定的公共 API,让 Python 开发者无需深入 CUDA C++ 即可直接访问 GPU。统一基础层减少对 PyTorch、CuPy、RAPIDS 等上层库的依赖,降低维护绑定与构建工具链的成本。完整平台访问使开发者能更灵活地编写 GPU 加速代码,推动 Python GPU 生态进一步发展。
Multiverse Computing 提出 QAH 方法,对 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 后,在 9 项基准中 7 项超越原 bfloat16 检查点,并在 LiveCodeBench 上超过 120B 原版教师模型。
推荐理由:原文给出了压缩-量化-恢复流程的对比,读者可据此判断 QAH 在训练稳定性与推理成本上的实际收益。
开发者可将 Claude Desktop 配置为通过 Ollama 作为第三方网关,同时使用本地模型和 Ollama 云端模型。连接后可在 Ollama 内切换 Anthropic 模型或关闭功能恢复原设置。默认关闭遥测,Ollama 对所有模型和服务执行严格零数据保留策略。
GitHub 工程团队发布了一款 Alt Text 插件,帮助开发者改进网页图片的替代文本质量。插件默认运行 5 条确定性规则(缺失、文件名、占位符、泛泛用词、相邻重复),并可选调用模型判断上下文相关性;模型仅输出建议而非结论,且默认关闭。文中还说明了布局重复检测、隐私与成本控制、已知限制及开源评测工具。
推荐理由:文章展示了自动化检查与模型判断的边界划分,读者可借鉴其确定性规则优先、模型仅作建议的设计模式。
MIT工程师提出名为η-learning的机器学习方法,可在不含极端事件的历史数据中学习并生成统计上合理的极端情景,如百年一遇暴雨的可能位置、范围和强度。该方法结合点统计与空间地图约束,已应用于美国大陆极端降水模拟,相关论文发表于Nature Communications。
推荐理由:该方法不依赖历史极端事件数据即可生成罕见情景,为城市和金融等领域的风险评估提供了可迁移的新工具。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型,合作规模达数亿欧元。Mistral 将探索使用 HUMAIN 的数据中心基础设施,双方还计划在沙特推进联合 go-to-market 策略,面向受监管行业。
生成式 AI 规模扩张使分布式模型训练跨数十万 GPU,以太网成为一级性能瓶颈。Spectrum-X Ethernet 针对大规模 AI 重新设计以太网规则,保留标准化与成本优势的同时解决 scale-out 网络瓶颈。
summary_zh: NVIDIA Vera Rubin 与 Blackwell 面向 Agentic AI 推理推出新性能基准。OpenRouter 报告显示真实使用中平均每请求 prompt tokens 增长约 4 倍。
summary_zh: AI 工厂是受电力约束的工业系统,衡量效率的关键指标已从 GPU 数量转向每瓦 AI 输出。NVIDIA DSX MaxLPS 针对推理负载优化应用级每瓦性能,关注电力分配与冷却等非计算环节的能耗。
summary_zh: NVIDIA 提出 Vera CPU 应对 Agentic AI 集群调度难题,指出 AI 工厂中 GPU 负责运行模型,CPU 负责编排、工具执行与沙箱计算,而智能体工作负载具有不可预测和高动态特性。
NVIDIA BlueField-4 DPU 为 Agentic AI 工厂提供专用数据处理能力,支撑多 Terabit 带宽下的线速网络、存储与安全。传统云基础设施面向通用工作负载设计,而 Agentic AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算单元。
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配后扩展平台能力,覆盖从小模型到大模型、开源到闭源的最广泛 AI 工作负载。Vera Rubin NVL72 是迄今最通用的机器,提供高吞吐与交互性。
Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。
AdaptGrow 是 GPU 加速的矩阵分解算法,将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构断裂信号,支持单 GPU 与多节点规模运行。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控场景,解决错误分组带来的风险。
Amazon 发布开源基准 SOP-Bench,覆盖 12 个业务领域、2000+ 任务,把专家撰写的真实 SOP 与工具及答案对齐来评估智能体。实验显示升级模型未必提升表现、工具过多会降低成功率,且没有一种模型+智能体组合在所有流程中占优。
推荐理由:原文给出基线模型在真实业务 SOP 上的失败模式,读者可据此判断自研智能体在部署前应重点测试哪些环节。
NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿通用架构。AVO 强调智能体系统(harness)在上下文接收、工具使用、状态维护、反馈响应、失败恢复与长任务持续上的关键作用。原文未给出具体模型版本号、参数规模、benchmark 分数细节、速度倍数、价格或开源/闭源信息。
NVIDIA 基于 OpenShell 及生态合作,梳理了 AI Agent Stack 各层的安全与信任构建思路。文章分析了安全在智能体长期运行中的角色,并给出每层应承担的安全职责。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,把匿名聚合的移动性模式与 Gemini 的文本嵌入对齐,为地点生成兼顾身份与动态功能的嵌入向量。在公开基准上,该方法在访问意图预测上最高取得 81.9% 的相对提升,价格水平分类提升 75.1%,忙碌度估计准确率提升 24.7%。
Papers with Code 构建混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 语义检索,并使用 RRF 算法融合结果。系统依赖 Hugging Face Jobs 进行批量 embedding 构建、Storage Buckets 存储持久化产物、Inference Endpoints 提供低延迟在线查询 embedding。
Hugging Face 提出三种测试量化语音 ASR 模型的基准优化行为,评估了 11 个开源模型,发现高分模型在 VoxPopuli 和 LibriSpeech 上会复现基准错误转录、恢复被掩码数字,并依据声学线索切换拼写变体。相关脚本和未归一化输出已开源。
推荐理由:原文给出三种可复现的测试方法,读者可据此自行评估语音模型在真实场景中的泛化能力。
Together AI 在 113 个 DeepSWE 任务、每侧 452 次 rollout 上对比 GLM-5.3(max)与 GPT-5.6 Sol(max)。
推荐理由:同一跑道上 GLM-5.3 以一半价格逼近 Sol,在重试和覆盖率上反而反超,读者可据此设计前端开源、后端旗舰的级联路由。
Together AI 在 DeepSWE 上对比 GLM-5.3 与 Claude Fable 5:首次尝试通过率 69.0% vs 69.7%,GLM-5.3 每次调用 $3.99。
推荐理由:在精度相近时,GLM-5.3 以五分之一成本覆盖更多任务,为预算有限的工程团队提供了清晰的选型与路由依据。
summary_zh: MIT 研究人员开发了预测电化学合成氨催化剂性能的新方法,通过密度泛函理论模拟替代试错筛选,可在数年内加速寻找使该方法与 Haber-Bosch 工艺具备成本竞争力的催化剂化合物。
Liquid AI发布LFM2.5-DSpark推测解码草稿模型,为LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款模型提供最高3.2倍GPU加速与最高2.87倍端侧加速。函数调用延迟平均降低57%,llama.cpp与SGLang已支持首日集成。
Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。
推荐理由:原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。
summary_zh: 生成式推荐系统将目标从基于嵌入相似度的传统目标,转变为在大型商品目录中根据用户历史序列预测下一个动作或物品。LLM 的兴起推动了这一从判别式到生成式的范式转变,使推荐系统能够建模更复杂的用户行为序列。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
summary_zh: NVIDIA Holoscan 是构建实时边缘 AI 应用的平台,HoloHub 为其配套仓库,提供参考应用与组件。开发者可使用通用编码智能体调用与工程师相同的示例、文档和开发工具。
Google Search 新增互动视觉、练习测验、Lens 分步讲解、笔记本和自定义文件生成 5 项 AI 学习工具。练习测验覆盖 ACT、AP、GRE、SAT 等标准化考试,由 Princeton Review 等教育合作伙伴提供内容,英文版全球免费开放。笔记本功能同步至 AI Mode,支持跨 Google 产品自动同步资料。
summary_zh: NVIDIA FLARE 支持跨机构协调训练视觉语言模型(VLM),用于视觉问答、图像描述和图文推理等任务。联邦学习使各数据本地站点无需集中原始记录即可协作适配模型,适用于医疗等多机构场景。