Antigravity SDK 新增本地 AI 模型支持
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
研究者使用 8 位精英棋手封存的对局数据,分别用不同方法独立学习每位棋手模型,再在 withheld dyads 上组合测试。以开局家族总变差距离和 WDL 总变差距离为评估指标,M1 降低 WDL-TV 但对开局家族 TV 影响小,M2 显著降低开局家族 TV 但对 WDL-TV 作用有限;将两者组件结合的 post-hoc 方法在两个指标上均保留改进。
IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。
Sieve and Sage 将检索失败分解为不可回答与受干扰两种状态,用轻量模块 Sieve 筛选干扰证据,再调用 LLM(Sage)生成与拒答。在通用和高风险专家领域较单阶段基线准确率最高提升 69.4 个百分点、Macro-F1 提升 55.2 个百分点,速度最高加快 1.99 倍。
研究者在商业可重构 CMOS 芯片上实现基于异步布尔网络的准模拟决策架构,利用分布式布尔混沌并行生成熵源。在 1024 臂赌博机问题上完成并行决策实验,并将熵源扩展至 5120 个并行通道,聚合采样率达 2.14 TS/s。
研究者与 K-12 教师协作,基于大语言模型(LLMs)共同设计了一套多智能体反欺凌模拟系统,用于生成真实校园场景,帮助学生提升应对欺凌的能力。该研究明确了 LLM 驱动的多智能体模拟系统的关键设计参数,为开发更有效、可扩展的反欺凌工具提供参考。
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
研究提出 Agent-Callable Feature Coverage(ACFC)指标与 Agent Readiness Conformance(ARC)框架,从可访问性、可发现性、可控性三轴评分(0-9)。
summary_zh: 该综述系统梳理了机器人上下文学习(ICL)的四类接口:context-conditioned policies、geometric demonstration transfer、world-model-based control、skill- and agent-based execution。
论文提出 RePair 方法,利用生成式基于智能体模型校准仿真世界,将候选机制操作化为自然语言规则,通过匹配干预估计效应并分析行为轨迹。在四个基于现有社会科学模型和实证研究的仿真世界中验证表明,自然语言规则可产生可测量的集体效应,规则比较随配置积累趋同,行为轨迹将集体效应与智能体行为关联,为探索因果机制提供可行路径和实践指导。
arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。
推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
summary_zh: OpenAI 推出 Dots,作为主动式助手在复杂项目和日常任务中持续工作,帮助用户掌控进度。Dots 能在任务推进过程中保持连贯性,减少手动切换与跟进。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
OpenAI 的 GPT-6.1 Sol 模型已在 GitHub Copilot 中正式推出,支持智能体编码和终端工作流。早期测试表明,相比 GPT-6 和 GPT-5.6 系列,它能以更少的 token 和步骤可靠完成任务。
推荐理由:早期测试显示该模型在多步编码任务中能以更少的 token 和步骤完成工作,用户可据此评估是否切换模型以优化成本与效率。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。
Multiverse Computing 提出 ProvenanceGuard,在 MCP agent 回答后逐条核查 claim 与来源是否匹配,而非把所有证据混合后判断。测试中它从 139 条应被拦截的 claim 中拦下 138 条,并对来源识别正确的比例约 86%。该方法可对接 RARR 修复循环,在本地配置下每条回答约增加半秒开销。
MIT研究者系统评估了算法单一文化的主要质疑,发现系统排斥等论点并不成立,并证明单一文化会形成信息回声室、抑制探索。在招聘场景中,将多种算法捆绑成集成模型可克服此局限,有时表现甚至优于多元算法环境。
Apple ML 团队提出往返协议评估 16 个模型对树结构算术表达式的序列化与恢复,发现通道失真且不对称,最佳模型对组合可达 92.9%,约 73.6% 失败源自生成端,结构难度主导而非模型族,约 3600 条微调样本即可让开放权重模型超越未训练 Gemini-3.1-Pro。
推荐理由:通过生成与提取的往返协议揭示模型间序列化树结构的失真瓶颈,为改进模型通信提供可量化依据。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
summary_zh: NVIDIA 发布 Open Agent Safety Platform,提供持续芯片内 Agent 监控的参考实现。平台面向 agentic AI 的安全需求,借鉴互联网早期经验,在模型运行时进行实时监测。
MIT 10名本科生参加PKG中心2026 Code.Tulsa项目,在塔尔萨与Muscogee和Cherokee部落合作开发AI与数据科学项目。学生参与原住民孕妇健康风险评估系统PRAMS调研,同时由Allie Zong协助开发面向25名原住民高中生的TASC科学夏令营,涵盖AI工程、DNA技术与物理化学。
GitHub Copilot app 可用 /create-canvas 把自然语言描述变成在右侧面板打开、与智能体共享的 canvas。提示要写清工作流、使用者能直接操作的内容,以及智能体能添加或更新的事项,界面可以是看板、议题分拣板、发布清单、仪表盘、表单或表格。
summary_zh: SkyRL 是开源 RL 框架,结合 Amazon SageMaker HyperPod 的 Ray 集群与 GRPO 后训练,将 Qwen3-VL-8B 在 VisGym SFT 检查点上的迷宫求解率从 43.75% 提升至 95% 以上。
NarrateAI 在 Amazon Bedrock 上实现五项协同的质量保障技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架与数据准确性验证。系统在约 13 秒内开始流式响应,数值准确率达 99.3%,六个月生产部署中无服务中断。
Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。
推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。
Anthropic 发布预印本,称其 AI 代理在巨型病毒基因组中发现了类似 CRISPR 系统的重复 DNA 序列。实验调用约 950 个 AI 代理自主探索数十亿蛋白质,耗时逾 21 小时,但目前尚未确定这些序列的功能,也未发现配套的 DNA 切割酶。
推荐理由:AI 代理在基因组数据中发现类 CRISPR 重复序列,展示了自动化挖掘分子工具的潜力,但功能尚未验证。
GitHub Copilot 推出 Canvas 功能,允许用户在应用内构建无浏览器边框的全栈应用界面,与 Agent 双向通信。Canvas 可调用第三方 API、在本地执行代码,用于构建游戏、管理 Winget 包、操作 SQLite 数据库或自动化开发工作流。
Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。
推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,基于 GitHub Security Lab Taskflow Agent 框架。
推荐理由:原文给出了一个可自主运行的模糊测试流水线,读者可以据此理解 LLM 代理在安全自动化中的决策与执行分离设计。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为企业对话模型加上动态视觉形象,已在 Gemini Enterprise 上线。
推荐理由:原文给出实时视频形象与异步工具调用的能力说明,读者可据此了解企业智能体的交互形态变化。
summary_zh: Amazon Bedrock AgentCore Gateway 与 Model Context Protocol(MCP)结合,让 AI Agent 在不复制或集中数据的前提下跨多个 AWS 账户查询。
Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。
Microsoft Agent Framework 发布 AG-UI 交互接入、FoundryMemoryProvider 记忆、CodeAct 执行与弹性后台执行四项更新,覆盖 .NET 与 Python,并提供 FastAPI 与 ASP.NET Core 示例。
推荐理由:原文给出了四项能力更新与跨语言示例,读者可据此判断哪些能力能直接接入现有应用。
Anthropic 与霍华德·休斯医学研究所 Janelia 校区合作推出 Model Hardware Standard(MHS),通过软件框架连接不同厂商的实验室设备,并让 AI 智能体直接控制仪器、协调实验。MHS 可集成到任何具备可编程接口的设备,消除定制化代码需求;研究团队将原本需要数月的实验搭建缩短至数小时。
推荐理由:平台大幅缩短设备互联与实验搭建时间,为实验室自动化提供了可迁移的集成方法。
综述探讨AI在放疗流程中的应用,涵盖器官分割、剂量预测、治疗计划优化与结局预测。涉及深度学习、U-Net、扩散模型及大语言模型在放疗物理与临床中的实践与挑战。
HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。
推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。