HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。
GitHub Copilot 应用重写了 Pull Request 视图,以支持单文件变更量极大的 Pull Request。方案将代码几何与评论块几何分离,用惰性测量、滚动锚定和单通道调度避免跳动,并配合流式数据管道与缓存策略;实测在 2,200 文件、超百万行变更、400+ 行内评论的极端案例上仍保持流畅。
该方案基于 Strands Agents SDK 构建单一 AI Agent,运行时动态调用 Amazon Bedrock(Claude Sonnet)、Amazon Rekognition 和 Amazon Transcribe,处理自然语言视频查询。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
Microsoft Research 在 Physical AI Toolchain 中新增行业首个机器人推理卸载能力,可将 SO-101、UR10e 等机器人的推理从机载 GPU 卸载至边缘或云 GPU。实验显示,卸载改善了移动操作任务的成功率、响应精度和电池续航,并支持通过 Kubernetes 自动容器化与编排。
推荐理由:首次系统量化了机器人推理卸载的收益,为物理 AI 基础设施选型提供可对比的实测依据。
NVIDIA 验证工程师 Sakeena Fiza 负责量产前验证数据中心系统,曾见证 Rubin GPU 全球首次在系统级成功枚举。她与团队从 tray、rack、cluster 一路验证到客户 AI factory,目标是在客户之前发现硬件问题。单块板卡含数万组件、机架接近 50 万,验证需在真实条件下把硬件推向极限。
NVIDIA AI Day Singapore 展示 Nemotron 3 Super、Nemotron 3 Nano Omni、Cosmos 开放世界模型及 VSS 蓝图在东南亚的落地。
Together AI 发布教程,演示基于 Qwen3.5 4B 和 Hugging Face 多源数据集微调 Jev 类分类模型,训练成本约17美元,耗时约25分钟,并部署到 Together AI 专用端点。
推荐理由:原文给出了从数据准备到部署的完整流程,读者可以按此低成本复现一个专用分类模型。
GPT-6 提升了提示词缓存的命中率,并新增诊断工具、显式断点与控制选项,以降低延迟与成本。
GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。
推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。
summary_zh: Janet Kuo 与 Maciej Szulik 讨论 Kubernetes SIG Apps 工作负载 API 的演进,涵盖 Deployments、StatefulSets、DaemonSets、Jobs 与 CronJobs 的可靠性与扩展性挑战。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
vLLM 推出硬件无关(HW agnostic)层,确保项目在推进前沿 GPU 性能工程的同时,继续支持旧 GPU、消费者级 GPU 和树外加速器。新层保持 fullgraph torch.compile 兼容、可扩展、与硬件特定路径隔离,并使用原生 PyTorch 或可移植 DSL 实现。
推荐理由:vLLM 新增硬件无关层,让关心多硬件和旧 GPU 的用户在不牺牲可移植性的前提下继续使用。
NVIDIA Isaac ROS 5.0在多伦多ROSCon发布,引入智能体工作流与GPU加速软件包,帮助人与AI智能体共同开发机器人。FoundationPose提供面向智能体的推理库,使机器人感知并跟踪物体位姿的速度最高可快5.5倍。新版支持ROS Lyrical和Ubuntu 24.04。
Microsoft Agent Framework 发布 Foundry 托管代理隔离,包含用户隔离和 Foundry 托管会话隔离两个独立控制,分别对应调用者身份和沙箱会话。开发者可使用 .NET 和 Python SDK 通过 AgentSession 传入 delegated user identity 或显式 agent_session_id,实现共享沙箱或独立会话等部署模式。
推荐理由:原文给出了用户隔离与会话隔离两套控制及多种可用模式,读者可据此评估自身应用在数据归属和会话生命周期上的选择。
Together AI 发布 Canary Rollouts 功能,支持在同一个端点上以 canary、blue-green、rolling 三种策略将流量从源模型逐步迁移到目标模型,并在每步执行健康检查与指标门控。
推荐理由:平台将人工回滚转为自动化阶梯流量与健康检查,适合在生产环境替换模型时控制风险。
Weaviate 发布 Engram 托管记忆与上下文服务,演示如何通过主题描述、边界、作用域与检索模式控制代理记忆。原文给出从 raw 数据到记忆的流水线、主题描述决定记忆内容与形态、bounded 与 scope 的行为差异,以及四种提示词布局下的缓存与计费对比。
推荐理由:原文通过真实输出演示了四个配置决策如何改变代理的记忆行为,读者可依此调整自己的主题描述与提示词布局。
oMLX 创造者兼维护者 Jun Kim 加入 Hugging Face,继续主导这一基于 Apple MLX 的本地 AI 项目。oMLX 保持 Apache 2.0 开源,从副业转为有资金支持的全职项目,并作为 mlx-lm、mlx-vlm 之上的新想法试验场。Hugging Face 还希望打通 transformers 模型定义到 MLX 参考实现的快速转换。
Hugging Face 的 transformers 库新增 GGUF 模型支持,用户可通过熟悉的 API 在 Apple Silicon Mac 上运行 llama.cpp 量化 checkpoint。
推荐理由:transformers 新增 GGUF 支持,在 Apple Silicon 上通过熟悉 API 运行量化模型,性能接近 llama.cpp,为本地推理提供便捷入口。
Kubernetes v1.37 将 PersistentVolumeClaimUnusedSinceTime 功能门控升至 Beta 并默认启用,PVC 保护控制器为每个 PVC 添加 Unused 条件,标识是否有运行中的 Pod 正在引用该卷。
NVIDIA推出DSX Ready认证计划,用于评定AI工厂电源与冷却产品是否符合DSX参考设计要求。计划初始覆盖电池储能系统(BESS)和冷却分配单元(CDU)两类,Hitachi Energy、LG Energy Solution、Tesla及LG Electronics、LiquidStack、Vertiv等合作伙伴产品已获认证。该计划帮助建设者降低集成风险,但通过认证不替代现场工程评估。
NVIDIA 推出全栈安全系统 Halos,覆盖 AV 与机器人从硬件、软件、AI 行为到部署生命周期的安全工程。Halos 整合 DRIVE AGX Thor、IGX Thor、Halos OS、Alpamayo、Isaac Lab 与 Omniverse,并提供可追溯的安全证据与第三方认证支持。
summary_zh: NVIDIA 发布开源安全运行时 OpenShell,为 AI Agent 提供沙箱执行与策略管控,合作伙伴 Cisco DefenseClaw 和 JFrog 已在其基础上构建治理与技能扫描能力。
Multiverse Computing 将 LLM 深度剪枝重构为约束二元优化问题,等价于全耦合伊辛自旋玻璃,用 Hessian 能量作为下游质量代理,避免逐条评测。
推荐理由:把深度剪枝重新表述为伊辛自旋玻璃优化问题,可用廉价能量代理替代逐条评测,且与量化、低秩压缩等手段堆叠。
NVIDIA 在纽约气候周重点介绍五家用 AI 推进清洁能源的公司,覆盖电网、核电、储能与聚变。ThinkLabs AI 基于 NVIDIA CUDA 的数字孪生与 agents 帮助 Southern California Edison 把电网互联评估从 30-45 天缩短到 2 分钟,Atomic Canyon 的 Neutron 和 NIVA 平台服务于核电运营。
Hugging Face 发布 tokenizers v1 预览版,在 Apple M4 Max 上单线程编码速度比 v0.23 快 3 到 30 倍,8 线程扩展效率达 76%。主要改进包括 bitcannon 位流分词、线程本地词缓存、无分配合并循环和批量模型调用,且输出 token ID 与 v0.23 完全一致。
推荐理由:原文给出了速度提升和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google Research 推出 MilleMiglia,一个 C++ 实例生成器,用于构建中段物流网络的真实基准。中段物流覆盖区域或大陆尺度的配送中心间运输,占物流成本大头且影响时效,但学术研究长期缺乏公开高质量数据。MilleMiglia 在 GitHub 开源,通过隐私保护的方式捕捉中段运输的多车辆接力、时间窗口与分拣同步等约束,为后续优化研究提供基础。
summary_zh: 一家全球金融科技公司在 Together 上将编程智能体流量迁移至 GLM-5.2,采用 Dedicated Model Inference 实现自服务供给、指标 API 和模型灵活性。
Weaviate 1.39 扩展 Rotational Quantization(RQ),新增 4-bit 支持并带来多项量化改进。8-bit RQ 编码速度最高提升 3.8×,4-bit RQ 在保持相似召回率的同时堆内存减少 45%。
summary_zh: Kubernetes v1.37 新增 emptyDir 权限模式与 bind mount 选项,允许在卷挂载层面直接设置 noexec、nosuid、nodev 及 sticky bit(01777)等标志,无需借助 init container 或变通方案。
Emerald AI、Google 与 NVIDIA 今日联合宣布成立 AI Energy Management Alliance(AEMA),首个专注于让数据中心根据电网状况动态调节用电的联盟。
Mistral 为 Mozilla Firefox Smart Window(beta)提供模型支持,该 AI 浏览助手目前面向法国和北美用户,英国和德国今年晚些时候跟进。Firefox Smart Window 默认不保存对话记录,Mistral 承诺零数据保留,双方共同强调用户控制与开源分发。
曼彻斯特大学与 NVIDIA Earth-2 团队基于 Isambard-AI 训练 Earth-2 CorrDiff 和 StormCast,生成了分辨率 2-3 平方公里的英国全域污染模型,训练仅用两天。同一工作流可在 DGX Spark 桌面系统运行推理,作者计划开源训练数据与工作流,并展望由智能体接口驱动的实时污染问答。
推荐理由:展示了生成式AI模型从国家级超算到桌面设备的可迁移路径,降低了污染建模的硬件门槛。
Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。
summary_zh: Glyph 将企业数据目录的列描述生成与类型标注建模为协作 LLM 智能体图。描述器通过 active RAG 从企业 GitHub 检索管道源码;标注器并行运行描述标签器、业务正则标签器和基于微调对比编码器的元数据标签器,再用 RRF 融合输出。
Apple ML Research 提出共享选择性持久记忆架构,识别并保留任务规格、数据模式、工具配置和输出约束四类可复用上下文,丢弃会话特定推理轨迹。该记忆可在工作空间间通过基于角色的访问控制共享,实现协作复用。
推荐理由:选择性记忆架构在三个企业场景中任务完成率从79%提升至96%,为多轮工具调用的上下文管理提供了可复用的工程路径。
NVIDIA 公布 DSX 平台早期验证结果:Lambda 在 19 节点 HGX B200 集群上运行 DSX MaxLPS,同等功耗预算下 token 吞吐提升 24%,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 公布 Vera Rubin NVL72 与 DSX 平台新成果,MLPerf Inference v6.1 中 Vera Rubin NVL72 较 GB300 NVL72 吞吐量提升最高 3.7 倍,DSX MaxLPS 在相同功耗下集群 token 吞吐量提升 24%、每瓦性能提升 23%。
推荐理由:AI基础设施的关键指标正从峰值性能转向每兆瓦智能体token数,读者可据此评估自身AI工厂的能效与扩容空间。
Google宣布其AI技术已支持超过300种语言,覆盖全球70亿人口(86%全球人口),并发布AI & Economy ATLAS互动洞察。同时公布AlphaGenome Atlas、WeatherNext 3、Planetary Prediction Engine等科学进展与应用。
summary_zh: DevFest 2026 将于 10 月 1 日至 12 月 31 日在全球 115 国举办超过 800 场活动,由 Google Developer Groups 社区主导。