ATLAS:通过对齐传输潜在结构实现可靠世界模型规划
ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。
ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。
summary_zh: 该研究将生成式大语言模型与弱监督技术结合,用于自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型。通过提示工程生成合成标签,方法具备成本效益和可扩展性,同时支持多标签与层次化分类。
行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。
Brain-SAD提出一种受大脑启发的安全自动驾驶控制框架,通过动态恐惧信号在线决策长期常规交互策略与短期紧急碰撞防御策略。实验表明,该框架在任务完成和碰撞恢复时间上更短,在连续复杂交叉路口场景下可靠性更强。
Lookahead-R 将工具检索重构为资源约束下的序贯决策问题,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,并驱动代价敏感的不确定性引导蒙特卡洛树搜索。
研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。
TRACE 是一种面向肿瘤学大语言模型的可部署树状关系结构增强框架,将昂贵的离线结构学习与轻量在线推理分离,在零样本设置下无需监督标签即可进行任务自适应证据选择。
论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。
推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。
Google 发布 autofinetune 项目,将自主研究循环应用于 LLM 后训练(SFT 与 GRPO),由 Tunix、Gemma 与 Cloud TPU 配合 Antigravity CLI 和 Gemini Flash 3.7 驱动。
研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。
Google 开发者博客第二部分演示了基于 ADK 的 Customer Support & Returns Agent,在 Gemini Enterprise Agent Platform 上引入 Model Armor、Semantic Governance Policies 与 Agent Anomaly Detection 三层运行时治理。
推荐理由:原文给出了三层运行时治理的具体分工与闭环方式,读者可据此理解零信任智能体在平台侧如何覆盖单请求与多轮会话两类边界。
研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。
研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。
推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。
MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。
研究者基于 EvoTune 框架和 ShinkaEvolve 代码库提出 LinCodeEvolve,利用大语言模型引导搜索结合精确最小距离评估,发现 7 个破纪录二进制线性码。六个具有简洁拟循环描述,经完全枚举验证,改进了码表中 22 条记录。结果表明 LLM 引导搜索可辅助编码理论发现。
summary_zh: 该研究提出 Environment Steering,将智能体与执行环境状态建模为数据库表,跟踪记录级数据流并在运行时对照声明式策略检查。
Google 与 Speakeasy 合作,将用于生成 Google GenAI Interactions、Agents 和 Webhooks API 客户端库的 OpenAPI 生成套件以 AGPLv3 开源。
研究在 386 个 MATH-500 任务上比较了 8 个生成 harness 与基线,每个成员执行 3 次。相同程序产生 2.16 个百分点的重复平均 oracle 余量,生成程序虽呈现更多重复得分模式,但相对基线的损失在所有 3 次重复中持续存在于 100 个任务,稳定互补性在 3 次重复中仍未解决。
研究将技能提取形式化为从自由文本中预测(技能,责任层级)对的结构化预测任务,针对 SFIA 的 147 个技能和 7 个责任层级展开。五种策略对比显示,基于检索的匹配识别技能最多,生成式策略精度更高;仅将层级作为显式决策的策略才能可靠预测层级,相似性选择准确率不足一半;三智能体流水线延迟加倍但精度未提升。
summary_zh: 研究在 Growing NCA 实验中分离训练与评估的更新模式,异步训练在 10/10 次运行通过短时域质量测试,而同步仅 3/10;所有 10 个异步模型在确定性评估下仍保持目标 4,096 步。
HeurEvo 是一个自动化计划-代码-组件共演化框架,通过智能体在岛基进化结构中联合优化高层算法结构、实现与共享组件池。框架在组合优化基准和 MIPLIB 实例上,能在严格运行时间预算内找到高质量解,常匹敌或超越需数小时至数天的现有最优求解器,并在六边形 packing 等非线性几何问题上改进此前最佳结果。
论文首次将多智能体视觉语言导航形式化为带依赖与资源约束的协调问题,提出 MAVLN 基准,包含 11,724 条轨迹、145 个场景、最多 4 个智能体与三种指令模式。配套系统 TRISS 集成 LLM 子任务调度器、共享拓扑记忆与冲突感知执行机制,在调度、规划与执行上均存在显著改进空间。
summary_zh: NVIDIA OpenShell 为 AI 智能体添加运行时控制(Runtime Controls),让智能体在获得目标后可自主写代码、使用工具,并在新信息到来时持续工作。
Google 宣布 Antigravity SDK 支持本地模型与多种执行选项,初始支持通过 LiteRT 运行 Gemma 4 26B A4B,开发者可在离线环境下使用与云端相同的 agentic 能力。
推荐理由:本地 Gemma 4 26B 与云端 Gemini 3.8 Flash 协同的混合编排示例,帮助开发者在隐私与成本约束下设计本地 agent 工作流。
研究者使用 8 位精英棋手封存的对局数据,分别用不同方法独立学习每位棋手模型,再在 withheld dyads 上组合测试。以开局家族总变差距离和 WDL 总变差距离为评估指标,M1 降低 WDL-TV 但对开局家族 TV 影响小,M2 显著降低开局家族 TV 但对 WDL-TV 作用有限;将两者组件结合的 post-hoc 方法在两个指标上均保留改进。
IMPACT 是一个面向云边微服务迁移与带宽控制的意图驱动 Agentic AI 框架,采用集中训练分散执行(CTDE),将每个边缘云建模为自主智能体并编码局部 SLO 风险、迁移紧迫性与计算压力。实验表明,在 5 边缘和 20 边缘场景下,IMPACT 相比现有因子化多智能体强化学习与启发式基线,平均延迟降低 30-50%,尾延迟偏差降低 40-70%,在严格阈值下实现接近零的 SLO 违约率。
Sieve and Sage 将检索失败分解为不可回答与受干扰两种状态,用轻量模块 Sieve 筛选干扰证据,再调用 LLM(Sage)生成与拒答。在通用和高风险专家领域较单阶段基线准确率最高提升 69.4 个百分点、Macro-F1 提升 55.2 个百分点,速度最高加快 1.99 倍。
研究者在商业可重构 CMOS 芯片上实现基于异步布尔网络的准模拟决策架构,利用分布式布尔混沌并行生成熵源。在 1024 臂赌博机问题上完成并行决策实验,并将熵源扩展至 5120 个并行通道,聚合采样率达 2.14 TS/s。
研究者与 K-12 教师协作,基于大语言模型(LLMs)共同设计了一套多智能体反欺凌模拟系统,用于生成真实校园场景,帮助学生提升应对欺凌的能力。该研究明确了 LLM 驱动的多智能体模拟系统的关键设计参数,为开发更有效、可扩展的反欺凌工具提供参考。
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
研究提出 Agent-Callable Feature Coverage(ACFC)指标与 Agent Readiness Conformance(ARC)框架,从可访问性、可发现性、可控性三轴评分(0-9)。
summary_zh: 该综述系统梳理了机器人上下文学习(ICL)的四类接口:context-conditioned policies、geometric demonstration transfer、world-model-based control、skill- and agent-based execution。
论文提出 RePair 方法,利用生成式基于智能体模型校准仿真世界,将候选机制操作化为自然语言规则,通过匹配干预估计效应并分析行为轨迹。在四个基于现有社会科学模型和实证研究的仿真世界中验证表明,自然语言规则可产生可测量的集体效应,规则比较随配置积累趋同,行为轨迹将集体效应与智能体行为关联,为探索因果机制提供可行路径和实践指导。
arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。
推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
summary_zh: OpenAI 推出 Dots,作为主动式助手在复杂项目和日常任务中持续工作,帮助用户掌控进度。Dots 能在任务推进过程中保持连贯性,减少手动切换与跟进。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
OpenAI 的 GPT-6.1 Sol 模型已在 GitHub Copilot 中正式推出,支持智能体编码和终端工作流。早期测试表明,相比 GPT-6 和 GPT-5.6 系列,它能以更少的 token 和步骤可靠完成任务。
推荐理由:早期测试显示该模型在多步编码任务中能以更少的 token 和步骤完成工作,用户可据此评估是否切换模型以优化成本与效率。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式实验框架,连接模型、工具、文献和研究人员。与 Broad Institute 合作在胰腺癌细胞状态转换中预测并验证了数千种化合物,整个筛选与验证过程在一个周末完成,部分化合物出现意外表型。Quine Fellows 计划现已开放申请,系统目前仅限研究用途。
推荐理由:原文展示了跨模态生物世界模型的实际验证路径,读者可据此评估计算实验与湿实验闭环对研发效率的潜在影响。