跳到正文

#Agent

今日 199 条
今天9月30日周三
  1. arXiv · Robotics30

    ATLAS:通过对齐传输潜在结构实现可靠世界模型规划

    ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。

  2. Google Developers · AI40

    如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析

    行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。

  3. arXiv · Artificial Intelligence43

    自发现 RL 在经验时代:学习历史是资产还是负担?

    研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。

  4. arXiv · Machine Learning62

    Mara Chain:重新思考失败作为 AI 系统自动演进的踏脚石

    论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。

    推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。

  5. arXiv · Artificial Intelligence50

    Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

    研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。

  6. Google Developers · AI60

    构建零信任 AI 智能体:基于意图而非语法的运行时治理

    Google 开发者博客第二部分演示了基于 ADK 的 Customer Support & Returns Agent,在 Gemini Enterprise Agent Platform 上引入 Model Armor、Semantic Governance Policies 与 Agent Anomaly Detection 三层运行时治理。

    推荐理由:原文给出了三层运行时治理的具体分工与闭环方式,读者可据此理解零信任智能体在平台侧如何覆盖单请求与多轮会话两类边界。

  7. arXiv · Neural and Evolutionary Computing36

    一种基于上下文维护和检索记忆的神经网络

    研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。

  8. arXiv · Artificial Intelligence62

    Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models

    研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。

    推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。

  9. arXiv · Computation and Language42

    记忆适配方法 MATE 提升具身智能体任务执行成功率

    MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。

  10. arXiv · Neural and Evolutionary Computing35

    LLM 引导搜索发现高距离二进制线性码新记录

    研究者基于 EvoTune 框架和 ShinkaEvolve 代码库提出 LinCodeEvolve,利用大语言模型引导搜索结合精确最小距离评估,发现 7 个破纪录二进制线性码。六个具有简洁拟循环描述,经完全枚举验证,改进了码表中 22 条记录。结果表明 LLM 引导搜索可辅助编码理论发现。

  11. arXiv · Artificial Intelligence36

    更多程序还是更多重复?LLM Harness 中覆盖率与专业化的分离

    研究在 386 个 MATH-500 任务上比较了 8 个生成 harness 与基线,每个成员执行 3 次。相同程序产生 2.16 个百分点的重复平均 oracle 余量,生成程序虽呈现更多重复得分模式,但相对基线的损失在所有 3 次重复中持续存在于 100 个任务,稳定互补性在 3 次重复中仍未解决。

  12. arXiv · Computation and Language28

    SFIA 框架下的结构化技能与责任层级提取:从词汇基线到智能体检索增强生成

    研究将技能提取形式化为从自由文本中预测(技能,责任层级)对的结构化预测任务,针对 SFIA 的 147 个技能和 7 个责任层级展开。五种策略对比显示,基于检索的匹配识别技能最多,生成式策略精度更高;仅将层级作为显式决策的策略才能可靠预测层级,相似性选择准确率不足一半;三智能体流水线延迟加倍但精度未提升。

  13. arXiv · Neural and Evolutionary Computing42

    HeurEvo:面向时间敏感数学优化的混合求解器增强启发式智能体演化框架

    HeurEvo 是一个自动化计划-代码-组件共演化框架,通过智能体在岛基进化结构中联合优化高层算法结构、实现与共享组件池。框架在组合优化基准和 MIPLIB 实例上,能在严格运行时间预算内找到高质量解,常匹敌或超越需数小时至数天的现有最优求解器,并在六边形 packing 等非线性几何问题上改进此前最佳结果。

  14. arXiv · Computer Vision36

    系统性多智能体视觉语言导航:形式化、基准与方法

    论文首次将多智能体视觉语言导航形式化为带依赖与资源约束的协调问题,提出 MAVLN 基准,包含 11,724 条轨迹、145 个场景、最多 4 个智能体与三种指令模式。配套系统 TRISS 集成 LLM 子任务调度器、共享拓扑记忆与冲突感知执行机制,在调度、规划与执行上均存在显著改进空间。

  15. Google Developers · AI62

    Antigravity SDK 新增本地 AI 模型支持

    Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。

    推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。

  16. arXiv · Multiagent Systems20

    Amadeus:建模人类行为的智能体在象棋对弈中的交互预测

    研究者使用 8 位精英棋手封存的对局数据,分别用不同方法独立学习每位棋手模型,再在 withheld dyads 上组合测试。以开局家族总变差距离和 WDL 总变差距离为评估指标,M1 降低 WDL-TV 但对开局家族 TV 影响小,M2 显著降低开局家族 TV 但对 WDL-TV 作用有限;将两者组件结合的 post-hoc 方法在两个指标上均保留改进。

  17. arXiv · Multiagent Systems30

    IMPACT:面向云边微服务迁移的意图驱动多智能体策略与注意力机制

    IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。

  18. arXiv · Computation and Language42

    Sieve and Sage:高效干扰过滤实现可靠 RALM 拒答

    Sieve and Sage 将检索失败分解为不可回答与受干扰两种状态,用轻量模块 Sieve 筛选干扰证据,再调用 LLM(Sage)生成与拒答。在通用和高风险专家领域较单阶段基线准确率最高提升 69.4 个百分点、Macro-F1 提升 55.2 个百分点,速度最高加快 1.99 倍。

  19. arXiv · Multiagent Systems25

    探索生成式基于智能体模型中的因果机制

    论文提出 RePair 方法,利用生成式基于智能体模型校准仿真世界,将候选机制操作化为自然语言规则,通过匹配干预估计效应并分析行为轨迹。在四个基于现有社会科学模型和实证研究的仿真世界中验证表明,自然语言规则可产生可测量的集体效应,规则比较随配置积累趋同,行为轨迹将集体效应与智能体行为关联,为探索因果机制提供可行路径和实践指导。

  20. arXiv · Machine Learning67

    Sage:带语义纠错的形式化框架

    arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。

    推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。

  21. AWS Machine Learning Blog59

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力

    GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。

  22. GitHub Changelog74

    GPT-6.1 Sol 在 GitHub Copilot 中正式可用

    OpenAI 的 GPT-6.1 Sol 模型已在 GitHub Copilot 中正式推出,支持智能体编码和终端工作流。早期测试表明,相比 GPT-6 和 GPT-5.6 系列,它能以更少的 token 和步骤可靠完成任务。

    推荐理由:早期测试显示该模型在多步编码任务中能以更少的 token 和步骤完成工作,用户可据此评估是否切换模型以优化成本与效率。

9月29日周二
  1. Microsoft Research72

    Microsoft 推出 Quine 生物 AI 研究系统

    Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。

    推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。