Meta 构建组织第二大脑:AI 从专家处学习并持续改进
Meta 发布一个组织级 AI Agent,通过结构化知识库与可组合食谱分离知识与推理,并借助自改进循环将专家反馈编译为经过回归测试的更新,无需模型重训练。系统包含知识层、推理层、评估框架与改进循环,经过六周三轮开发实现评估时间从天降至分钟、零回归,且每次修正自动强化回归套件。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Meta 发布一个组织级 AI Agent,通过结构化知识库与可组合食谱分离知识与推理,并借助自改进循环将专家反馈编译为经过回归测试的更新,无需模型重训练。系统包含知识层、推理层、评估框架与改进循环,经过六周三轮开发实现评估时间从天降至分钟、零回归,且每次修正自动强化回归套件。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最强基础模型,定价为 3.6 Flash 的一半;同步推出 Gemini 3.5 Transcribe 语音转文本模型。
推荐理由:Google 在一个月内连续发布两款 Flash 模型并下放到 Pixel 硬件,开发者可以用更低成本构建智能体。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解功能,视频分析 token 消耗最高降低 88%、成本最高降低 66%、准确率最高提升 7%。
推荐理由:原文给出了 token 与成本降幅的具体数字和 API 启用方式,读者可据此判断长视频分析的成本边界。
Google Pics 基于 Nano Banana 模型,面向 Google AI Pro、Ultra 订阅者及大部分 Workspace 商业用户开放,可进行对象分割、图像内文字编辑与翻译、多选项生成和协作编辑。该工具以独立产品形式推出,并已集成到 Docs 和 Slides,Drive 将在未来几周跟进,使用入口为 pics.new。
推荐理由:原文给出了生成与编辑能力及 Workspace 入口,读者可据此判断它会怎样融入现有办公流程。
Hugging Face 发布 @huggingface/kernels 库及 Fleet 众测工具,提供 207 个 WebGPU 内核,覆盖矩阵乘法、Softmax、LayerNormalization 等操作。
推荐理由:Hugging Face发布207个WebGPU内核库,以版本化包形式提供可复用的GPU操作原语,并搭配Fleet众测平台收集真实硬件性能证据,为浏览器端本地AI推理奠定底层基础。
JuliaHub 推出 Dyad 3.0,帮助工程团队通过自主 AI 智能体完成物理仿真、安全分析与质量校验,并依据物理定律修正设计。Julia 用户已超 100 万,被用于模拟电路、气候建模、疫苗研发和飞机防撞系统。
推荐理由:原文给出 Dyad 3.0 的物理约束能力和 Boeing 等客户案例,读者可据此判断工程设计的自动化边界。
Hugging Face 与 Voice Arena 合作在 Open ASR Leaderboard 推出 Monsoon en-IN 和 Monsoon hi-IN 评测集,覆盖印度英语和印地语。
推荐理由:新增 Hindi 与 Indian English 评测集让 ASR 错误率的地域、人口和设备差异可被追踪,读者可据此评估模型在多元人群上的真实表现。
Skala 1.1 在 GMTKN55 上加权误差达 2.8 kcal/mol,在 55 个类别中 32 个达到最优,同时保持半局域泛函的计算效率。Skala 已登陆 CP2K,并正在集成至 Psi4、FHI-aims、ORCA 和 VASP;微软研究院同步推出持续更新的性能基准报告。
推荐理由:原文给出精度提升与多软件集成进展,读者可据此评估 Skala 在现有计算化学工作流中的可用性。
Mistral 发布 Agentic Search 检索层,通过 search、open、navigate、read、grep 五个工具让模型多步检索、打开并核对文档,已集成进 Mistral Search Toolkit 以及 Studio 和 Vibe 的 Libraries。
推荐理由:原文用 FinanceBench 和 OfficeQA Pro 两组基准对比一次性 RAG 与多步检索循环,读者可借此了解复杂文档检索的取舍。
Sentence Transformers v6.0 新增 MultiVectorEncoder,支持 ColBERT 风格晚交互检索,可直接加载 PyLate、Stanford-NLP ColBERT 及 ColPali 视觉文档检索 checkpoint。
推荐理由:原文给出了多向量模型的加载、评分和索引方案,读者可以据此判断它会怎样改变现有检索工作流。
Together AI 在端点层新增 A/B 实验功能,通过控制组与变体部署的百分比分流对比真实用户指标。实验挂载到端点,控制组在基础流量中按权重抽取后重新采样到变体,变体权重必须为零;支持 95/5 到 50/50 多档流量与最多 20 个变体,通过 etag 防止并发更新冲突。
推荐理由:平台在端点层原生支持 A/B 实验与滚动升级的编排,读者可据此把新模型上线从自建分流逻辑中解耦。
Google DeepMind 发布多语言手语转文字模型 SL2T,首次将手语 AI 带入 Gboard 和 Live Transcribe,从 ASL 到英语在 Pixel 11 上可用且无需额外付费。
推荐理由:原文给出 ASL 到英语的零样本 BLEURT 分数与隐私保护方案,读者可据此判断该功能在真实设备上的可用性与隐私边界。
Together AI 与 Moonshot AI 达成战略合作,成为 Kimi 模型的首发平台,首发模型为 Kimi K3。Kimi K3 是迄今最大开源模型,参数规模达 2.8T 的稀疏 MoE 架构,支持原生视觉与 1M token 上下文窗口。
NVIDIA 发布 Cosmos-H-Dreams,一款基于单张 RTX PRO 6000 GPU 运行的手术机器人实时生成式仿真器。该模型从 Cosmos-H-Surgical-Simulator 蒸馏而来,通过 FlashDreams 推理库实现约 160 fps 的交互式操作,每潜在帧仅需 2 步去噪,支持 dVRK 桌面缝合任务,并可连接学习型手术策略形成闭环。
推荐理由:NVIDIA将手术世界模型压缩至单卡实时推理,使外科机器人策略的闭环评估与合成数据生成不再依赖稀缺物理硬件。
Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。
推荐理由:Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。
Together AI 发布 Dedicated Model Inference 平台,支持部署自有或开源权重模型,并提供部署配置、预热加速、Canary/蓝绿/滚动发布、A/B 与影子流量测试及 Prometheus 可观测性。平台覆盖从实验到生产的全生命周期,并同步开启自定义训练(含 LoRA 与强化学习)封闭测试。
推荐理由:原文给出部署预热、流量切换与可观测性等具体能力,读者可以据此判断它能否降低自研推理栈的运维成本。
Grabette 是 Pollen Robotics 发布的开源手持采集设备,配合 Gripette 机械爪端,能用普通相机、IMU 和深度相机记录操作演示,并自动生成 LeRobot 格式的机器人就绪数据集。
推荐理由:原文给出了低成本的采集方案与开放数据集入口,读者可以据此判断它能否降低机器人学习的数据门槛。
Together GPU Clusters 推出被动健康检查、自动节点修复、Slinky 1.0 等功能,覆盖 GPU 总线故障、热节流、Xid 错误等场景。配合集群详情页、外部 OIDC、启动脚本和验收测试选项,提升多团队场景下的可观测性、访问控制与自定义能力。
推荐理由:原文给出了平台健康与运维控制两方面的具体能力变化,读者可以据此评估它对现有训练与推理工作流的影响。
Hugging Face 更新 vLLM 的 transformers 建模后端,在 Qwen3-4B、Qwen3-32B、Qwen3-235B-A22B-FP8 三种模型上达到或超越原生 vLLM 吞吐。模型作者只需添加 --model-impl transformers 标志即可自动获得优化推理,无需手写自定义实现。
推荐理由:transformers 后端现已达到原生 vLLM 实现同等吞吐,模型作者无需重写代码即可在 vLLM 中获得优化推理性能。
微软在 Build 2026 发布 Foundry Managed Compute,Hugging Face 模型现可通过一键部署在 Azure 上运行。模型目录每周更新,仅包含 SafeTensors 格式的安全筛选模型,支持 vLLM、SGLang、TensorRT-LLM、NIM、TEI、llama.cpp 等运行时,并提供统一端点、Azure Monitor 指标和每部署计费标签。
推荐理由:Hugging Face 模型现可通过 Foundry Managed Compute 一键部署,微软承担了从运行时构建、安全扫描到 CVE 补丁的运维层,让企业能在自有租户中运行开源模型。