Kubernetes v1.36 推出服务端分片 List 与 Watch 功能
Kubernetes v1.36 引入服务端分片 List 和 Watch(KEP-5866),API server 按 hash 范围过滤事件,每个控制器副本只接收所属分片。
Kubernetes v1.36 引入服务端分片 List 和 Watch(KEP-5866),API server 按 hash 范围过滤事件,每个控制器副本只接收所属分片。
Google DeepMind 发布 AlphaEvolve,一款由 Gemini 驱动的编程智能体,用于设计高级算法并已在数学、计算机科学和 Google 基础设施中部署。
推荐理由:原文展示了 AlphaEvolve 在数学、量子物理、基础设施和商业场景中的具体提升,读者可据此评估它作为通用算法设计智能体的实际边界。
Kubernetes v1.36 中原生类型的声明式验证(Declarative Validation)达到 GA,DeclarativeValidation 功能门控默认启用。
Kubernetes v1.36 引入 manifest-based admission control alpha 特性,允许通过 API server 启动时加载磁盘上的策略文件,在集群引导阶段即生效并防止被删除。
推荐理由:原文给出了 manifest-based admission control 的启动加载机制和保护边界,读者可以据此评估它对集群引导阶段安全策略可用性的实际改善。
Together AI 在 NVIDIA GTC 2026 分享其生产级推理优化体系,涵盖 FlashAttention-4、ThunderKittens 及开源自适应推测解码系统 Aurora(最高加速 1.25x)。
Kubernetes v1.36 引入 Pod-Level Resource Managers(Alpha),将 Topology、CPU 与 Memory 管理器从容器级分配扩展为 Pod 级资源预算与 NUMA 对齐。
summary_zh: Google Research 强调开源软件与开放数据集是现代科学的驱动力,通过与 UCSC Genomics Institute、Janelia、ISTA、CSIRO、AIIMS 及 Human Pangenome Research Consortium 等机构合作推动科学进步。
Kubernetes v1.36 中 In-Place Pod-Level Resources Vertical Scaling 毕业进入 Beta,通过 InPlacePodLevelResourcesVerticalScaling 功能门控默认启用,允许用户在线调整 Pod 的聚合资源预算,通常无需重启容器。
Together AI 与 Adaption 合作,让 Adaptive Data 用户可直接在 Adaption 平台优化数据集后执行 Together Fine-Tuning。
Kubernetes v1.36 引入 Memory QoS 的 TieredReservation 策略,按 Pod 的 QoS 等级提供分层内存保护:Guaranteed Pod 通过 memory.min 获得硬保护,Burstable Pod 通过 memory.low 获得软保护,BestEffort Pod 不设保护。
DeepSeek-V4 Pro 已在 Together AI 提供 Serverless Inference,模型级支持 1M 上下文,当前部署窗口为 512K,采用 1.6T 参数 MoE 架构,激活 49B 参数。提供 Non-Think、Think High、Think Max 三档推理模式,并针对重复长上下文给出缓存输入定价($0.20 / 1M tokens)。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Kubernetes v1.36 通过 client-go 的 AtomicFIFO 特性与 ConsistencyStore 接口缓解控制器缓存陈旧问题,并在 kube-controller-manager 中默认启用 DaemonSet、StatefulSet、ReplicaSet、Job 四类控制器的陈旧一致性检查。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Kubernetes v1.36 将暂停 Job 的 Pod 资源可变功能从 alpha 升级为 beta,MutablePodResourcesForSuspendedJobs 功能开关默认启用。
Mistral AI 发布 Workflows 进入公开预览,这是面向企业 AI 的编排层,基于 Temporal 引擎提供容错执行、可观测性与人工审批。开发者用 Python 编写工作流,通过 Le Chat 触发,Studio 记录全量执行轨迹;控制平面在 Mistral,Worker 部署在用户自有 Kubernetes 环境,支持云、本地或混合部署。
Weaviate v1.37 已开源并上线云服务,新增 MCP Server、可扩展分词器、MMR 多样性搜索、查询性能分析、增量备份、Gemini 音频支持和 BlobHash 属性类型。MCP Server 让 LLM 和 IDE 可原生对接数据库;增量备份通过引用未变更数据块缩小备份体积;BlobHash 在向量化后仅持久化 SHA-256 哈希。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research 发布了一种照片重构图方法,现已集成到 Google Photos 的 Auto Frame 功能中。该方法通过 3D 点图估计和生成式潜在扩散模型,在改变相机位姿与焦距后自动补全原本未拍摄到的内容,并针对人像自动检测广角畸变、恢复自然比例。
Weaviate 推出托管记忆服务 Engram,基于 Weaviate 向量数据库,通过异步管道从原始数据提取、整合并持久化记忆,支持语义搜索检索。Engram 提供项目级、用户级和属性级作用域,以及可配置管道和缓冲机制,适用于聊天机器人、持续学习和多智能体系统,并计划推出 Claude Code 等集成。
推荐理由:原文给出了记忆管理的能力变化和开放入口,读者可以据此判断它会怎样改变现有 Agent 工作流。
summary_zh: 多租户 GPU 集群让多个团队共享同一硬件,通过硬配额、预订窗口和调度护栏实现租户隔离,防止跨团队资源争抢。平台需提供 pooled capacity、tenant isolation 和 self-serve access 三项核心能力,并支持按租户实际用量直接计费。
summary_zh: Google Research 发布 Vantage 实验,通过生成式 AI 在模拟环境中评估批判性思维、协作与创造性思维等未来必备技能。
Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。
推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。
summary_zh: AI Native Cloud 是为 AI 原生公司量身打造的新一代云基础设施,覆盖从预训练、微调到推理的完整生命周期。它以 GPU 加速、NVLink/RDMA 高速互联和统一软件栈为核心,强调研究到生产的快速转化、推理速度与成本优化,以及可按需扩展的 GPU 集群能力。
Together AI 的内核团队在 2022 年阵亡将士纪念日假期发布 FlashAttention,实现 2–3 倍加速。2025 年 3 月团队约 15 人,用一周时间基于 ThunderKittens 在 Blackwell 上开发出比 cuBLAS 快 2 倍的 FP4/FP8 GEMM 内核。团队采用学术与产业协同模式,成员来自 UCSD、普林斯顿、Caltech 等。
Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。
推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。
Ollama 0.19 预览版在 Apple Silicon 上基于 MLX 框架加速,M5/M5 Pro/M5 Max 利用新 GPU 神经加速器提升 TTFT 和生成速度。引入 NVIDIA NVFP4 格式支持,并升级缓存以提高响应效率。
推荐理由:Apple Silicon 上运行 Ollama 的速度变化和 NVFP4 支持,可帮助用户评估本地推理的性能边界。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,旨在让指针理解用户所指的视觉与语义上下文,减少繁琐提示词。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。
推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。
Mistral AI 发布 Voxtral TTS,4B 参数、支持 9 种语言的多语言文本转语音模型,提供自然、情感化语音生成与低延迟流式输出。模型通过 API 和 Mistral Studio 开放,定价 $0.016/1k 字符,并提供开源权重。
推荐理由:原文给出延迟、定价与多语言支持等具体指标,读者可据此评估其是否适配自有语音 Agent 流程。
大阪市立大学工学助理教授 Fujinaga 开发了一套结合图像识别与统计分析的"收获难易度估计"系统,训练机器人在采摘前评估每个番茄的难易程度。测试中成功率达 81%,约四分之一的成功采摘来自首次正面尝试失败后从侧面收获。该研究将"收获难易度"确立为可量化评估指标,推动机器人与人类协作的农业模式。
Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。
推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。
Mistral AI 作为创始成员加入 NVIDIA Nemotron Coalition,与 NVIDIA 共同开发前沿开源基础模型, Mistral Small 4 今日发布。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,在 FLTEval 基准上以 6B 参数超越多个更大开源模型。它通过 Mistral Vibe 集成、支持 MCP,提供免费 API 和 Apache 2.0 权重;pass@2 得分 26.3 仅需 $36,而 Sonnet 4.6 需 $549。
Together AI 在 NVIDIA GTC 2026 宣布多项合作与模型上线,包括集成 NVIDIA Dynamo 1.0 推理框架、通过 NemoClaw 提供超 150 个优化模型、上线 NVIDIA Nemotron 3 Super(120B 参数、1M 上下文窗口)以及 NVIDIA Parakeet TDT 0.6B V3 ASR 模型。
Together AI 发布覆盖 STT、LLM、TTS 的一体化语音 Agent 平台,端到端延迟低于 500ms,并原生集成 Deepgram(STT)和 Cartesia(TTS)。
推荐理由:统一 STT、LLM、TTS 栈并把端到端延迟压到 500ms 以下,让语音 Agent 的实时对话体验更易落地。
Together GPU Clusters(曾用名 Instant Clusters)新增自动扩缩容、基于角色的访问控制、全栈可观测性、自助节点修复与主动健康检查。
Together AI 在首届 AI Native Conf 发布七项更新,涵盖 FlashAttention-4、Together Megakernel、together.compile、Reinforcement Learning API、ThunderAgent、ATLAS-2 与 CPD。
推荐理由:七项发布覆盖内核、强化学习与推理优化,读者可据此评估 Together 在生产部署与训练加速上的最新能力边界。
summary_zh: Together AI 发布了全新品牌视觉,由 Pentagram 设计公司打造,表达开放、连接与共享规模的理念。新视觉围绕 AI 全生命周期整合开源创新、前沿系统研究与开发者体验。
summary_zh: Vector Institute 于 2 月 19-20 日举办第三届 Remarkable 2026 大会,吸引逾 1,500 名研究者与产业人士参与。
Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。
推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。
summary_zh: Ollama 0.17 将 OpenClaw 个人 AI 助手的启动简化为单条命令 `ollama launch openclaw --model kimi-k2.5:cloud`,自动处理安装与配置。