Google DeepMind 联手 Accenture、Bain、BCG、Deloitte、McKinsey 加速企业 AI 转型
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助各行业大规模采用前沿 AI。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助各行业大规模采用前沿 AI。
Berkeley 团队提出 GRASP,一种针对学习型世界模型的长时序梯度规划器。它通过提升轨迹到虚拟状态实现时间并行优化,在状态迭代中注入噪声探索,并重塑梯度以保留动作梯度、截断易受对抗攻击的状态输入梯度。在 Push-T 任务上,GRASP 在更长时间范围下取得了比 CEM、GD、LatCo 更高的成功率和更快的收敛速度。相关论文已发布于 arXiv。
推荐理由:GRASP 用梯度松弛与状态噪声探索解决长时序世界模型规划的病态优化问题,为当前大模型规划器提供了一条可复用的优化路径。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。
summary_zh: Google Research 发布 Vantage 实验,通过生成式 AI 在模拟环境中评估批判性思维、协作与创造性思维等未来必备技能。
Gemini Robotics-ER 1.6 发布,增强空间推理、多视角理解与仪器读数能力,提升机器人在真实环境中的自主决策水平。该模型通过与 Boston Dynamics 合作发现仪器读数场景,利用 agentic vision 结合视觉推理与代码执行实现精确读数,并在安全性上为迄今最安全版本,在对抗性空间推理任务中优于前代。
Together AI 发布 EinsteinArena,一个让 AI 智能体通过消息、讨论和排行榜协作与竞争的开源平台。智能体已在 11 维接吻数问题上将下界从 593 推进到 604,并在 Erdős 最小重叠问题、第二自相关不等式等多个问题上取得新的 SOTA。平台提供实时验证、公开排行榜和问题讨论线程,所有代码开源。
推荐理由:平台让多个智能体在公开讨论区和实时排行榜上协作与竞争,推动了多个长期开放数学问题的边界。
Google Research 推出 PaperVizAgent 与 ScholarPeer 两款学术智能体,分别用于生成论文配图和自动同行评审。
Together AI 发布 DBPlanBench,把 Apache DataFusion 的物理执行计划暴露给 LLM,通过紧凑 JSON 序列化和 JSON Patch 局部修改计划,避免重新生成整个计划。
推荐理由:将 LLM 引入物理计划优化,用语义推理弥补统计估计偏差,为数据库查询加速提供了可复现的新方法。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。
推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。
Together AI 发表 ICLR 2026 论文,提出研究长上下文 LLM 分治框架的理论方法。Planner 重写任务、Worker 并行处理文档分块、Manager 聚合答案,弱模型(如 Llama-3-70B、Qwen-72B)使用该框架可匹配或超越 GPT-4o 单次处理。
推荐理由:弱模型配合分治策略可在长上下文任务中追平 GPT-4o 单次推理,为工程落地提供低成本并行方案。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。
推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。
Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。
推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。
Google Research 在 The Check Up 活动中公布多项医疗 AI 成果,包括与 Fitbit 合作开发的 Personal Health Agent、与 Imperial College London 和 NHS 合作提升乳腺癌检测、并识别 25% 此前被漏诊的 interval cancers。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,在 FLTEval 基准上以 6B 参数超越多个更大开源模型。它通过 Mistral Vibe 集成、支持 MCP,提供免费 API 和 Apache 2.0 权重;pass@2 得分 26.3 仅需 $36,而 Sonnet 4.6 需 $549。
Together AI 在 NVIDIA GTC 2026 宣布多项合作与模型上线,包括集成 NVIDIA Dynamo 1.0 推理框架、通过 NemoClaw 提供超 150 个优化模型、上线 NVIDIA Nemotron 3 Super(120B 参数、1M 上下文窗口)以及 NVIDIA Parakeet TDT 0.6B V3 ASR 模型。
SPEX 与 ProxySPEX 是用于在大规模下识别大语言模型关键交互作用的算法框架,利用稀疏性和低阶性将搜索问题转化为稀疏恢复问题。ProxySPEX 利用层次结构特性,以约 1/10 的消融次数达到与 SPEX 相当的性能。
Google Research与Beth Israel Deaconess Medical Center合作,发布了AMIE在真实门诊场景中的前瞻性单中心可行性研究。100名患者在就诊前通过安全网页链接与AMIE进行文本问诊,由医生实时监督。研究显示零安全触发事件,AMIE诊断符合率90%、top-3准确率75%,且患者和医生对其接受度良好。
推荐理由:研究提供了AMIE在真实门诊场景中的安全性和可行性证据,为对话式医疗AI的临床落地提供了初步实证基础。
基于 Mistral 开源编码助手 Vibe 构建了一个自主代理,能自动读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行。通过 AGENTS.md 上下文工程和按文件类型分类的 SKILLS 文件,质量分数从 0.68 提升到 0.74。该代理并行处理多个文件,并自动管理 factories 和 fixtures 等共享上下文,避免测试遗漏。
Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。
推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。
summary_zh: Ollama 0.17 将 OpenClaw 个人 AI 助手的启动简化为单条命令 `ollama launch openclaw --model kimi-k2.5:cloud`,自动处理安装与配置。
Ollama 在 Claude Code 中新增 Subagents 与网页搜索功能,无需 MCP 服务器或 API Key。Subagents 可并行执行文件搜索、代码探索和研究等任务;网页搜索内建于 Anthropic 兼容层,模型需要最新信息时由 Ollama 直接返回结果。推荐云端模型包括 minimax-m2.5、glm-5 与 kimi-k2.5。
推荐理由:原文给出无需 MCP 与 API Key 的入口,读者可据此判断它能否降低 Claude Code 的接入成本。
OpenClaw 是连接 WhatsApp、Telegram、Slack、Discord、iMessage 等通讯平台与 AI 编程助手的本地化网关,保持对话和代码隐私。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。
推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。
summary_zh: Vector 研究人员在 NeurIPS 2025 发表 80 篇论文,涵盖基础模型、扩散生成、强化学习与隐私保护联邦学习等方向。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
MiniMax M2 在 Ollama 云端上线,主打编码与智能体工作流。Ollama 给出在 VS Code、Zed、Droid 等工具中的接入步骤,并提供云端 API 访问。
推荐理由:原文给出模型能力变化与多工具接入入口,读者可据此判断它对现有开发工作流的影响。
Mistral AI 发布企业级生产 AI 平台 Mistral AI Studio,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
summary_zh: Meta 发布基于 LLM 的 Automated Compliance Hardening(ACH)工具,结合变异测试与生成式 AI,自动生成高相关性变异体并确保测试能捕获这些变异。
Vector Institute 在 ICLR 2025 发表 71 篇被接收论文,覆盖神经架构、优化、理论及多模态 AI、科学发现与负责任机器学习。ACES 自动提取事件流数据集的队列并提升可复现性;AttriBoT 用缓存激活与层次归因实现 300 倍加速,使上下文归因比生成响应快 30 倍;行动抽象方法在熵寻求 RL 与 GFlowNets 中提升样本效率并发现可解释的高层动作。
Mistral 发布 Codestral 25.08,并推出包含 Codestral Embed、Devstral 与 Mistral Code 插件的企业级编程栈,支持云、VPC 与本地部署。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Mistral AI 为 Le Chat 推出深度研究、语音对话、多语言推理和项目管理等新功能。深度研究模式可自动规划、搜索并生成结构化参考报告,语音模式由 Voxtral 模型驱动支持自然语言对话,多语言推理由 Magistral 模型支持,项目功能可组织对话并保留工具与设置。
推荐理由:Le Chat 新增深度研究、语音对话、多语言推理和项目管理功能,为用户提供了从信息搜集到组织协作的一体化 AI 助手体验。
Vector 研究人员将在 2025 年 7 月于温哥华举办的 ICML 上发表 45 篇论文,涵盖 AI 安全性、医疗与环境监测等方向。亮点工作包括利用 LLM 进行自适应信息提取的框架、AutoElicit 方法,以及神经网络训练轨迹对初始条件的高度敏感性分析。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。
推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。
Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。
推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。
Mistral 发布 Agents API,将语言模型与代码执行、网页搜索、图像生成及 MCP 工具等内置连接器结合,并提供持久记忆与多智能体编排能力。SimpleQA 上 Mistral Large 和 Medium 启用网页搜索后得分分别从 23%、22.08% 提升至 75%、82.32%。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。