跳到正文

#Agent

今日 16 条
今天9月30日周三
  1. Google Developers · AI62

    Antigravity SDK 新增本地 AI 模型支持

    Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。

    推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。

  2. arXiv · Multiagent Systems20

    Amadeus:建模人类行为的智能体在象棋对弈中的交互预测

    研究者使用 8 位精英棋手封存的对局数据,分别用不同方法独立学习每位棋手模型,再在 withheld dyads 上组合测试。以开局家族总变差距离和 WDL 总变差距离为评估指标,M1 降低 WDL-TV 但对开局家族 TV 影响小,M2 显著降低开局家族 TV 但对 WDL-TV 作用有限;将两者组件结合的 post-hoc 方法在两个指标上均保留改进。

  3. arXiv · Multiagent Systems30

    IMPACT:面向云边微服务迁移的意图驱动多智能体策略与注意力机制

    IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。

  4. arXiv · Computation and Language42

    Sieve and Sage:高效干扰过滤实现可靠 RALM 拒答

    Sieve and Sage 将检索失败分解为不可回答与受干扰两种状态,用轻量模块 Sieve 筛选干扰证据,再调用 LLM(Sage)生成与拒答。在通用和高风险专家领域较单阶段基线准确率最高提升 69.4 个百分点、Macro-F1 提升 55.2 个百分点,速度最高加快 1.99 倍。

  5. arXiv · Multiagent Systems25

    探索生成式基于智能体模型中的因果机制

    论文提出 RePair 方法,利用生成式基于智能体模型校准仿真世界,将候选机制操作化为自然语言规则,通过匹配干预估计效应并分析行为轨迹。在四个基于现有社会科学模型和实证研究的仿真世界中验证表明,自然语言规则可产生可测量的集体效应,规则比较随配置积累趋同,行为轨迹将集体效应与智能体行为关联,为探索因果机制提供可行路径和实践指导。

  6. arXiv · Machine Learning67

    Sage:带语义纠错的形式化框架

    arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。

    推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。

  7. AWS Machine Learning Blog59

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力

    GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。

  8. GitHub Changelog74

    GPT-6.1 Sol 在 GitHub Copilot 中正式可用

    OpenAI 的 GPT-6.1 Sol 模型已在 GitHub Copilot 中正式推出,支持智能体编码和终端工作流。早期测试表明,相比 GPT-6 和 GPT-5.6 系列,它能以更少的 token 和步骤可靠完成任务。

    推荐理由:早期测试显示该模型在多步编码任务中能以更少的 token 和步骤完成工作,用户可据此评估是否切换模型以优化成本与效率。

9月29日周二
  1. Microsoft Research72

    Microsoft 推出 Quine 生物 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。

    推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。

  2. Hugging Face Blog51

    ProvenanceGuard:面向 MCP Agent 的来源感知事实核查

    Multiverse Computing 提出 ProvenanceGuard,在 MCP agent 回答后逐条核查 claim 与来源是否匹配,而非把所有证据混合后判断。测试中它从 139 条应被拦截的 claim 中拦下 138 条,并对来源识别正确的比例约 86%。该方法可对接 RARR 修复循环,在本地配置下每条回答约增加半秒开销。

  3. MIT News · AI39

    算法单一文化的影响取决于具体细节

    MIT研究者系统评估了算法单一文化的主要质疑,发现系统排斥等论点并不成立,并证明单一文化会形成信息回声室、抑制探索。在招聘场景中,将多种算法捆绑成集成模型可克服此局限,有时表现甚至优于多元算法环境。

  4. Apple Machine Learning Research62

    通信瓶颈:语言模型中树结构表达式序列化的往返研究

    Apple ML 团队提出往返协议评估 16 个模型对树结构算术表达式的序列化与恢复,发现通道失真且不对称,最佳模型对组合可达 92.9%,约 73.6% 失败源自生成端,结构难度主导而非模型族,约 3600 条微调样本即可让开放权重模型超越未训练 Gemini-3.1-Pro。

    推荐理由:通过生成与提取的往返协议揭示模型间序列化树结构的失真瓶颈,为改进模型通信提供可量化依据。

9月28日周一
9月26日周六
9月25日周五
  1. Amazon Science60

    Reactor 与 Amazon Neuron Science 合作实现 Trainium 上的实时视频生成

    Reactor 与 Amazon Neuron Science 团队合作,在 Trainium 上实现了基于 Rolling Forcing 的实时视频生成。团队采用以 NKI 为中心的底层优化,将 3D-RoPE 从 5 秒降至 1.8 毫秒,缓存拷贝从 23 毫秒降至 1.9 毫秒,并采用混合分片策略与模型代码合并,使管道仅用 11 GB 高带宽内存即达成 16 fps 以上的实时生成。

    推荐理由:原文给出了具体优化路径与实测数据,读者可据此判断 Trainium 在实时视频生成上的可行性边界。

  2. Nature · Machine Learning67

    Anthropic AI 生物实验室在病毒中发现类 CRISPR DNA,后续如何发展

    Anthropic 发布预印本,称其 AI 代理在巨型病毒基因组中发现了类似 CRISPR 系统的重复 DNA 序列。实验调用约 950 个 AI 代理自主探索数十亿蛋白质,耗时逾 21 小时,但目前尚未确定这些序列的功能,也未发现配套的 DNA 切割酶。

    推荐理由:AI 代理在基因组数据中发现类 CRISPR 重复序列,展示了自动化挖掘分子工具的潜力,但功能尚未验证。

  3. GitHub Blog · AI & ML58

    GitHub Copilot 推出 Canvas 自定义 UI

    GitHub Copilot 推出 Canvas 功能,允许用户在应用内构建无浏览器边框的全栈应用界面,与 Agent 双向通信。Canvas 可调用第三方 API、在本地执行代码,用于构建游戏、管理 Winget 包、操作 SQLite 数据库或自动化开发工作流。

  4. Google Research60

    Google Research 推出自动化一致长形式视频生成框架

    Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等框架,自动化长形式视频生成,缓解语义漂移并提升多镜头叙事一致性。

    推荐理由:Google Research 推出 Co-Director、CANVAS、A²RD 和 VQQA 等多代理框架,自动化一致的长形式视频生成,有效缓解语义漂移和特征漂移,提升多镜头叙事一致性。

  5. AWS Machine Learning Blog36

    Aderant 使用 Amazon Nova Lite 构建智能工单分诊系统

    Aderant 基于 Amazon Nova Lite 和 Amazon Bedrock 构建智能工单分诊系统,自动化上下文收集、分类、路由与知识增强。系统每小时处理未分配工单,前 2.5 周审查 109 个工单,路由准确率约 96%,每周节省 8–14 工时,月运营成本低于 $30。低于置信度的工单仍由人工复核,团队通过 CloudWatch 监控并每周优化提示词与路由逻辑。

9月24日周四
  1. Nature · Machine Learning72

    Anthropic 推出 Model Hardware Standard 平台,让实验室设备与 AI 智能体协同工作

    Anthropic 与霍华德·休斯医学研究所 Janelia 校区合作推出 Model Hardware Standard(MHS),通过软件框架连接不同厂商的实验室设备,并让 AI 智能体直接控制仪器、协调实验。MHS 可集成到任何具备可编程接口的设备,消除定制化代码需求;研究团队将原本需要数月的实验搭建缩短至数小时。

    推荐理由:平台大幅缩短设备互联与实验搭建时间,为实验室自动化提供了可迁移的集成方法。

  2. AWS Machine Learning Blog60

    HEMA 用 MCP 和 Amazon Bedrock AgentCore 构建内部 AI 助手 HAL

    HEMA 搭建了内部 AI 助手 HAL,将分散的知识库、API 目录和流程文档整合为统一知识层,并通过 MCP 在 Kiro、Claude 等工具中提供即时答案。

    推荐理由:原文给出了一家零售商从门户跳跃到即时答案的完整搭建路径,读者可据此理解 MCP 与 AgentCore 在企业知识层中的实际组合方式。