Kubernetes v1.37:Metrics API 正式晋升为稳定版(v1)
Kubernetes v1.37 将 metrics.k8s.io API 从 beta 晋升为稳定版 v1,提供节点与 Pod 的 CPU 和内存使用量,与 v1beta1 资源类型和字段完全一致。kubectl top 已支持 v1 并自动回退,HPA 控制器目前仍仅支持 v1beta1。该 API 通过 API 聚合层由 metrics-server 等实现提供,无需启用特性门控。
Kubernetes v1.37 将 metrics.k8s.io API 从 beta 晋升为稳定版 v1,提供节点与 Pod 的 CPU 和内存使用量,与 v1beta1 资源类型和字段完全一致。kubectl top 已支持 v1 并自动回退,HPA 控制器目前仍仅支持 v1beta1。该 API 通过 API 聚合层由 metrics-server 等实现提供,无需启用特性门控。
Google 搜索 AI Mode 新增三项旅行规划功能:航班价格追踪、里程积分价格显示和酒店预订。航班价格追踪已覆盖全球 180 多个国家和地区;里程积分显示首批支持 Alaska Airlines、American Airlines、Hilton 等多家航司和酒店集团。酒店预订在美国英文版上线,集成 Booking.com、Expedia、IHG 等合作伙伴。
summary_zh: Google DeepMind 联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,对 Gemini Flash Lite 模型开展全球首个双盲评估,外部评测被限制在加密环境中,防止模型提前接触测试题目。
Weaviate 1.39 发布,Boost API 与 MMR 多样性选择进入正式可用,4-bit 旋转量化预览、Search REST API 实验性上线,HNSW 快照改为自动。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Microsoft Agent Framework 发布 Python 通道包,支持 OpenAI Responses、Telegram、A2A 和 MCP 协议接入。
推荐理由:原文给出了多协议接入能力和共享状态模型,开发者可据此判断是否需要将现有 Agent Framework 应用扩展到新的通道。
Kubernetes v1.37 发布,主题为 Garhwal,包含 67 项增强,其中 16 项升为 Stable、23 项升为 Beta、27 项进入 Alpha、1 项弃用。Stable 特性包括弹性 watchcache 初始化,Beta 特性包括 HorizontalPodAutoscaler 缩放到零和基于清单的准入控制配置,Alpha 特性包括 Pod 级检查点与恢复。
NVIDIA Dynamo 推出 Shadow Engine Recovery 预览功能,在 LLM 引擎进程失败时实现秒级恢复,避免冷启动带来的权重加载、kernel 编译和 CUDA graph 捕获开销。
推荐理由:原文给出热恢复能力与秒级恢复入口,读者可据此评估它对推理可用性的实际影响。
summary_zh: Google Search 提供 5 种工具帮助用户升级家居装饰:AI Mode 可上传房间照片可视化推荐沙发并生成预览;Google Lens 可识别复古物品并搜索相似商品。
NVIDIA 发布 CUDA Python 1.0,提供稳定的公共 API,让 Python 开发者无需深入 CUDA C++ 即可直接访问 GPU。统一基础层减少对 PyTorch、CuPy、RAPIDS 等上层库的依赖,降低维护绑定与构建工具链的成本。完整平台访问使开发者能更灵活地编写 GPU 加速代码,推动 Python GPU 生态进一步发展。
开发者可将 Claude Desktop 配置为通过 Ollama 作为第三方网关,同时使用本地模型和 Ollama 云端模型。连接后可在 Ollama 内切换 Anthropic 模型或关闭功能恢复原设置。默认关闭遥测,Ollama 对所有模型和服务执行严格零数据保留策略。
summary_zh: NVIDIA Vera Rubin 与 Blackwell 面向 Agentic AI 推理推出新性能基准。OpenRouter 报告显示真实使用中平均每请求 prompt tokens 增长约 4 倍。
summary_zh: AI 工厂是受电力约束的工业系统,衡量效率的关键指标已从 GPU 数量转向每瓦 AI 输出。NVIDIA DSX MaxLPS 针对推理负载优化应用级每瓦性能,关注电力分配与冷却等非计算环节的能耗。
summary_zh: NVIDIA 提出 Vera CPU 应对 Agentic AI 集群调度难题,指出 AI 工厂中 GPU 负责运行模型,CPU 负责编排、工具执行与沙箱计算,而智能体工作负载具有不可预测和高动态特性。
NVIDIA BlueField-4 DPU 为 Agentic AI 工厂提供专用数据处理能力,支撑多 Terabit 带宽下的线速网络、存储与安全。传统云基础设施面向通用工作负载设计,而 Agentic AI 工厂需连接多样用户、智能体、应用、数据源与存储系统至大规模加速计算单元。
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配后扩展平台能力,覆盖从小模型到大模型、开源到闭源的最广泛 AI 工作负载。Vera Rubin NVL72 是迄今最通用的机器,提供高吞吐与交互性。
Google Research 提出 Biomarker Discovery Framework,一个多智能体系统,用于从可穿戴传感器数据中优先排序候选生物标志物。在三个队列共9,279名参与者-观测中,框架自主识别了41个心理健康和25个代谢候选数字生物标志物。框架结合假设生成、统计分析、对抗验证和文献推理,通过11项内部检查电池分配报告标签,保持统计严谨性与人类监督。
AdaptGrow 是 GPU 加速的矩阵分解算法,将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构断裂信号,支持单 GPU 与多节点规模运行。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控场景,解决错误分组带来的风险。
NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿通用架构。AVO 强调智能体系统(harness)在上下文接收、工具使用、状态维护、反馈响应、失败恢复与长任务持续上的关键作用。原文未给出具体模型版本号、参数规模、benchmark 分数细节、速度倍数、价格或开源/闭源信息。
NVIDIA 基于 OpenShell 及生态合作,梳理了 AI Agent Stack 各层的安全与信任构建思路。文章分析了安全在智能体长期运行中的角色,并给出每层应承担的安全职责。
summary_zh: Google DeepMind 回顾十五年来从 Atari 到 EVE Online 的游戏 AI 研究,与 Fenris Creations 等游戏工作室合作开发 SIMA 多世界智能体。
Papers with Code 构建混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 语义检索,并使用 RRF 算法融合结果。系统依赖 Hugging Face Jobs 进行批量 embedding 构建、Storage Buckets 存储持久化产物、Inference Endpoints 提供低延迟在线查询 embedding。
Liquid AI发布LFM2.5-DSpark推测解码草稿模型,为LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款模型提供最高3.2倍GPU加速与最高2.87倍端侧加速。函数调用延迟平均降低57%,llama.cpp与SGLang已支持首日集成。
Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。
推荐理由:原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。
summary_zh: 生成式推荐系统将目标从基于嵌入相似度的传统目标,转变为在大型商品目录中根据用户历史序列预测下一个动作或物品。LLM 的兴起推动了这一从判别式到生成式的范式转变,使推荐系统能够建模更复杂的用户行为序列。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
summary_zh: NVIDIA Holoscan 是构建实时边缘 AI 应用的平台,HoloHub 为其配套仓库,提供参考应用与组件。开发者可使用通用编码智能体调用与工程师相同的示例、文档和开发工具。
Google Search 新增互动视觉、练习测验、Lens 分步讲解、笔记本和自定义文件生成 5 项 AI 学习工具。练习测验覆盖 ACT、AP、GRE、SAT 等标准化考试,由 Princeton Review 等教育合作伙伴提供内容,英文版全球免费开放。笔记本功能同步至 AI Mode,支持跨 Google 产品自动同步资料。
summary_zh: NVIDIA FLARE 支持跨机构协调训练视觉语言模型(VLM),用于视觉问答、图像描述和图文推理等任务。联邦学习使各数据本地站点无需集中原始记录即可协作适配模型,适用于医疗等多机构场景。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格晚交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 及 ColPali 视觉文档检索 checkpoint。
推荐理由:原文给出了多向量模型的加载、评分和索引方案,读者可以据此判断它会怎样改变现有检索工作流。
Together AI 在端点层新增 A/B 实验功能,通过控制组与变体部署的百分比分流对比真实用户指标。实验挂载到端点,控制组在基础流量中按权重抽取后重新采样到变体,变体权重必须为零;支持 95/5 到 50/50 多档流量与最多 20 个变体,通过 etag 防止并发更新冲突。
推荐理由:平台在端点层原生支持 A/B 实验与滚动升级的编排,读者可据此把新模型上线从自建分流逻辑中解耦。
创意团队随项目规模扩大,文件夹命名漂移、标签质量下降、关键词搜索词汇不匹配三重问题叠加,最终检索失效。解决方案需结合语义相似性、关键词匹配与元数据过滤的双阶段路径:先 ingest 生成 embedding 与元数据,再通过 vector database 一次检索融合语义与关键词信号,并用元数据约束保证生产环境精度。
OlmoEarth Studio 现支持计算并导出自定义 embedding 向量,输出为 COG,模型权重与源码公开。可选 Nano(128 维,1.4M 参数)、Tiny(192 维,6.2M 参数)或 Base(768 维,89M 参数)编码器,时间跨度 1-12 个月,分辨率 10-80 米。越南 Ca Mau 红树林区仅用 60 个标注像素训练逻辑回归,加权 F1 达 0.84。
Google DeepMind 发布多语言手语转文字模型 SL2T,首次将手语 AI 带入 Gboard 和 Live Transcribe,从 ASL 到英语在 Pixel 11 上可用且无需额外付费。
推荐理由:原文给出 ASL 到英语的零样本 BLEURT 分数与隐私保护方案,读者可据此判断该功能在真实设备上的可用性与隐私边界。
summary_zh: Kubernetes SIG CLI 推出 KYAML,作为标准 YAML 的严格子集,旨在解决缩进敏感、静默类型转换等问题。kubectl 1.34+ 已支持 `-o kyaml` 输出格式,Google yamlfmt 在 v0.21.0 新增 kyaml 格式化器,可将现有文件转换为 KYAML。
Mistral 推出区域推理端点和 Priority Tier,并宣布平台将支持第三方开放模型,首发 Z.ai 的 GLM-5.2。Mistral Regional Endpoints 已正式可用,客户可选择推理在欧洲或美国运行;Priority Tier 处于 public preview,提供自定义速率限制和 uptime SLA。
Weaviate 在 Query Agent 的 Search Mode 中新增 effort 参数,支持 medium、high、ultrahigh 三档,在 BRIGHT Biology 等推理密集型检索基准上,ultrahigh 将 nDCG@10 从 Hybrid Search 的 13.0 提升至 57.5。
GitHub 发布 Copilot SDK for Java 1.0.7-preview.1,提供框架无关且支持 BYOK 的 Java 端 Copilot 集成方式。SDK 支持注解、lambda 和 JSON Schema 三种工具定义,通过虚拟线程与 Jakarta EE 组合,并可在 Open Liberty 26 上运行示例房产推荐代理应用。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Meta Superintelligence Labs 发布开源多模态模型 Muse Glimmer(30B,Apache 2.0),已在 Ollama 上线,支持 128K+ 上下文,专为本地 Agent 工作流设计。
推荐理由:原文给出了本地 Agent 工作流的具体入口和 Apple Silicon 上的性能提升,读者可以据此判断它会怎样改变本地编码与多模态调用方式。
GitHub 基于 OpenSSF malicious-packages 仓库构建统一导入器,使 Dependabot 恶意软件告警覆盖 npm、PyPI、Maven、RubyGems、NuGet、Go、crates.io 和 PHP Composer 八大生态。
推荐理由:原文给出从 npm 扩展到八生态的管道设计,读者可据此评估自身多生态依赖的恶意软件覆盖与告警启用条件。
Baseten 成为 Hugging Face Hub 支持的 Inference Provider,首批上线对话与文本生成任务。用户可在模型页或通过 Python、JavaScript SDK,用 HF token 调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM,后续将扩展更多任务。