跳到正文

#部署/工程

今日 14 条
今天9月30日周三
  1. Google Developers · AI62

    Antigravity SDK 新增本地 AI 模型支持

    Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。

    推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。

  2. arXiv · Multiagent Systems30

    IMPACT:面向云边微服务迁移的意图驱动多智能体策略与注意力机制

    IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。

  3. arXiv · Human-Computer Interaction22

    SPECTRA:面向自主边缘-云 GUI 定位的认知扰动与轨迹分析

    SPECTRA 是一种轻量级自主请求框架,通过显著性引导的定向扰动和高效认知轨迹分析,在预填充阶段量化智能体高维认知轨迹的拓扑发散,避免低效的输出解码。实验表明,GTA1-32B+InfiGUI-G1-3B 和 GTA1-32B+Holo1.5-3B 分别以 37.58% 和 39.24% 的平均请求率,保留了 93.44% 和 95.60% 的云端独占性能。已被 ACM MM 2026 接收。

9月29日周二
  1. Ollama Blog73

    Ollama 0.35 新增 Jev 风格决策模型支持

    Ollama 0.35 推出 /v1/systemone 端点,支持 Jev 风格的决策模型,本地运行无额外成本且延迟更低。今日上线三个模型:nimble(9B,Bespoke Labs)、tev1(4B,Together AI)和 tev1:0.8b(0.8B,Together AI)。

    推荐理由:本地低延迟决策模型开放调用,对实时分拣、路由与审核场景有直接迁移价值。

9月28日周一
  1. Mistral AI44

    Mistral 在慕尼黑开设德国枢纽,推进欧洲工业 AI

    Mistral 在慕尼黑开设德国枢纽,专注 Physics AI 与工业 AI,并招募研究、工程与应用 AI 岗位。该公司计划到 2030 年建成 1 gigawatt 欧洲算力,其开放权重模型可运行在客户自有基础设施上。其收购的 Emmi AI 带来 30 多名物理与工程 AI 专家,正与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用。

9月26日周六
  1. AWS Machine Learning Blog29

    在 Amazon EKS 上借助 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%

    在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习,吞吐量提升 40%。RLHF 与 GRPO 需同时平衡大规模 rollout 生成和紧耦合策略训练,两侧速率不匹配会让加速器空闲或引发训练不稳定。更稀疏的 MoE 使训练更受通信而非算力制约;作业超出单实例后,通信从节点内 NVLink 转到更低带宽的节点间链路。

9月25日周五
  1. Amazon Science60

    Reactor 与 Amazon Neuron Science 合作实现 Trainium 上的实时视频生成

    Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。

    推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。

  2. AWS Machine Learning Blog36

    Aderant 使用 Amazon Nova Lite 构建智能工单分诊系统

    Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。

9月24日周四
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-VL-3B DSpark 草稿模型加速视觉语言推理

    Liquid AI 为 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过推测解码在不改变输出质量的前提下加速推理。草稿模型增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30x-3.13x、端到端加速 1.56x-2.62x;在 H100 上解码加速 20.4x-2.66x、端到端加速 1.64x-2.27x。

    推荐理由:原文给出了具体加速数据和多框架支持,读者可据此评估在边缘设备或 GPU 上部署该草稿模型的性价比。