MACTS-EM:带涌现记忆的多智能体协同时间序列预测框架
论文提出 MACTS-EM 多智能体协同时间序列预测框架,集成领域专用预测智能体、元认知层、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件。在金融市场、气候模式、能源消耗与疫情传播评估中,预测准确率提升 8-12%,零样本迁移能力提升 22-27%,状态转换期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。
论文提出 MACTS-EM 多智能体协同时间序列预测框架,集成领域专用预测智能体、元认知层、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件。在金融市场、气候模式、能源消耗与疫情传播评估中,预测准确率提升 8-12%,零样本迁移能力提升 22-27%,状态转换期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。
FinNextAssist 是一个面向专业金融分析的端到端深度研究框架,将研究流程拆分为 Task Planner、Evidence Compiler、Reasoning Engine 与 Report Assembler 四个阶段,并引入 TabAgent 与 HeteroAgent 两个轻量子智能体。
ELMS(Evidence-based LLM-guided Monte Carlo Search)提出评估器在环的 motif 支架搜索框架,把结构评估从终端筛选转为可执行的设计反馈。
提出 AMBER(Adaptive Multi-view Budgeted Elo Reranking),一种在线、带预算的多视角重排框架,动态优化全局资源分配。
FSPO 是一种面向预算化 LLM RL 后训练的反馈状态控制器,联合学习策略一致风险-to-go 模型与长视界效用模型。在匹配 GRPO 资源包络下,FSPO 取得 66.11% 留出集和 59.43% OOD 准确率,优于最强自适应基线 PB2 的 64.47% 和 57.03%。
论文提出 Recursive Self-Rewrite(RSR)框架,用单一基础模型 Qwen-3.8-27B 在多种 harness 下发现成功解法,再重构为通用 harness 下的训练轨迹。
ROUTEAUDIT 把验证器路由建模为契约条件识别问题,通过契约格、独立响应带和请求级界限,在策略变化时分离路由策略本身的贡献。在 1,319 个留出任务请求上,学习策略与 RLVR 质量分别为 0.9522 和 0.9553,RLVR 相对静态策略配对差 +0.0068,区间 [0.0015,0.0122];归因恢复路由 MAE 0.0011、端点重构误差 0.0004。
Ego2World 是一个新基准,把带标注的烹饪活动编译为部分可观测下的可执行规划环境,将源步骤与对象映射为符号动作规则、持久世界状态和显式任务条件,并分离世界状态与智能体信念以支持跨任务研究。
研究者提出分段式在线蒸馏方法 Seg-OPD,用于学习推理修订。该方法基于不确定性指标选取学生模型的推理片段,获取教师模型对应的重写版本,训练学生偏好教师重写片段,同时保留 token 级密集监督。在数学推理与竞赛编程任务上,Seg-OPD 的修订成功率高于基线,推理准确率平均相对提升 5.22%,代码已开源。
论文提出 GraphMemory,一种轻量级图结构记忆系统,用于在推理时积累、精炼并连接可复用策略。GraphMemory 每次查询只检索相关子图,使在线上下文适应无需暴露全部记忆,且在有界检索下检索量随样本数增长保持恒定。实验显示其下游性能具竞争力,记忆构建 token 比基线减少约 81-85%。
研究提出长程 AI 智能体的新型执行安全失效模式 GHOST:在良性交互下,智能体仍可能违反多轮之前设定的安全约束,在 GPT-5.5 上发生率达 11.5%。理论上证明若每个安全前缀的残余违规风险下界不可求和,执行几乎必然进入风险区。研究进一步提出双层防御 STAR-Guard,结合历史语义安全约束恢复与执行前确定性审计,在 GPT-5.5 实验设置下未再观察到 GHOST 事件。
研究实证测量了 LLM 智能体的信念采纳概率,发现其采纳核呈 sigmoid 形态,具有复杂传染特征,阈值受声明可信度、来源可靠性和智能体倾向三个来源影响,且可由与先验信念的连贯性这一单一有效维度近似。群体动力学上,簇状网络比随机网络传播更广,并出现分岔级联窗口与自维持滞后共识,使共识一旦形成便远难于消除。论文共 18 页、6 幅图,已被 NeurIPS 2026 FAST 工作坊接收。
研究构建五种沟通风格轴与四种基于规则的方言变体,在 RAG 管线与两个工具型智能体共三个基准上测试邮件助手。间接请求降低全部三个基准表现,正式请求降低两个智能体基准表现;冗长请求主要损害词汇检索器,间接与方言变体即使检索到相关邮件仍有害。智能体场景中间接与正式请求主要导致遗漏必需动作,而非产生更多无依据动作。
时间序列预测(TSF)基准评测过度依赖留出误差,稳健性研究又常把失效简化为高斯噪声、随机掩码或有界对抗扰动,难以反映真实部署中的失效模式。输入侧异常往往对应改变时间动态、破坏跨变量依赖、引发状态切换或由故障传感器传导至下游决策的结构化事件,i.i.d. 扰动无法忠实刻画这类语义、因果与系统级失效。
研究者推出 TasteBench,一个面向感官预测的多模态基准与隐私保护竞赛,覆盖 215 种植物基食品、24 个产品类别、21K+ 人类评估与 15K 风味分子。
论文系统比较了微调与 RAG 两种构建 LM 世界模型的路径,覆盖具身、网页导航和社交共 5 类环境,发现微调在 15/20 设置中让智能体获得更高奖励,而 RAG 数据效率更高。RAG 检索器持续从经验缓冲区捞出次优转移,层级式查询重构优于传统检索管线。最终提出的混合系统在多个环境与模型上持续胜出。
论文提出 Meta-reasoning for Iterative Research Agents(MIRA),一种把研究分配与执行分离的分层架构:外层元推理器从持久研究记录中整理上下文并下达下一步工作指令,内层执行器负责执行。
论文用 Mixture-of-Agents(MoA)方法测量大语言模型每个 token 实际所需的推理计算量,定义能复现该 token 的最小 agent 的推理成本为“充分计算量”。
论文提出 Tropical Reinforcement Learning,把传统期望回报中对成功轨迹概率求和改为取最大值(热带半环),让状态价值等于最可能已验证解的对数概率并保留可重放路径,从而支持跨 rollout 的前缀与后缀组合。
DeReAct 是一种模块化智能体架构,将动作授权与完成控制解耦为两个门控策略:执行前校验动作的 Critic,以及重建环境支持状态并认证任务完成的 Context Manager。
论文提出 Comparative Inference for Tool-use Agents(CITA),训练比较推理模型(CIM)在执行前估计下一次工具调用对最终任务成功的长期价值。
EvoGen-Harness 是一个生成器无关的多责任图像生成 Harness 进化框架,配合 Trace(轨迹相对归因与协同进化)机制,在随机执行间聚合证据并用失败归因作为搜索先验。
FourierQK 用带通滤波内积替代标准点积注意力,在字符级语言模型(TinyShakespeare,6 层 GPT)上验证五种滤波器假设。
专利检索常需处理数万 token 文档,多数神经检索方法受限于截断输入。该研究提出神经解析器,将依赖解析的双仿射注意力适配到发明图预测,局部评分把复杂度从 O(n²) 降到 O(n·w)。模型从 100 万条规则解析文档蒸馏而来,在 40,000 token 以上文档部署无需重新训练,推理成本降为原来的 1/3;在下游 Graph Transformer 检索中,全文档引用召回率提升 1.1%。
论文测试了多语言编码器能否为同一产品的不同语言渲染生成语言一致的语义 ID(SIDs)。实验基于 Amazon ESCI listings 的英语、西班牙语和日语版本,使用 E5 多语言编码器与残差量化。
研究者开发 LeanSide,一个形式化验证的协同推理系统,让用户以自然语言撰写和修改证明,后端自动将学生推理形式化为 Lean 并把验证输出转化为可理解的反馈。研究通过大学数学课堂部署开展用户研究,分析哪些系统属性帮助学生推进、哪些导致卡住,并据此提出在人机协同推理中使用形式化验证后端的设计启示。论文 16 页、13 图,arXiv:2610.00760 [cs.HC]。
论文提出 Frame-Evidence Co-Adaptation(FECA)框架,解决多模态深度研究中图表数值保真问题。FECA 将图表生成建模为视觉帧与检索证据的迭代交互,视觉帧引导证据获取,证据决定帧的接受、修订或丢弃。实验表明 FECA 在 100 个真实研究主题上显著提升数值保真度,同时保持报告质量与图表可用性。
该研究提出从 OWL 2 本体自动生成多选题基准的流水线,正确答案由本体锚定,干扰项通过 OWL 推理器形式化验证。在 Pizza(112 题)、PMDco(2,491 题)和 DOID(15,216 题)三个本体上生成基准,6 个 LLM 零样本准确率为 41.1%-76.8%,显著高于 25% 随机基线。
VisionQ 是首个基于同行评审 CV 比较图的基准,将每个判断锚定到命名视觉标准。包含 1,409 篇 CVPR/ICCV 论文、1,800+ 验证比较图和 3,911 个手工标注数据点,以及六轴 51 叶分类法。
PixelDense 通过语义投影流处理 DINOv2 和 SAM2,几何投影流处理 Depth Anything v2 和 Metric3D v2,并加入权重空间正交性惩罚,使两类教师处于不交子空间。
该研究提出一种基于原型的模糊规则框架,直接解释预训练基础模型内部层的patch级特征,无需微调。在ViT-S/16骨干网络的最后两个块上,通过特征空间聚类学习类别原型,并用人类可读的IF-THEN模糊规则进行分类。在无线胶囊内镜、胃肠道内镜和结肠息肉分割任务上,该方法在冻结特征下达到与黑盒分类器相当的准确率,并能用于检测合成医学图像中生成器未能复现的真实原型与规则,定位合成图像与真实组织的差异。
该研究提出源空间广义贝叶斯推断框架,用一至少步改进 MeanFlow(iMF)映射表示先验并在其高斯源空间中进行后验采样,建立 Wasserstein 误差界并分解为训练次优性与模型类近似误差。
该研究针对由加权次分数布朗运动驱动的随机微分方程,利用欧拉近似从离散观测中重建高斯驱动增量并构造轨迹似然。神经网络和径向基函数表示漂移、扩散及归一化时间权重,通过似然轮廓估计协方差指数和扩散尺度,并在二十组系数设置下与两种神经网络方法进行了对比。
针对语义分割中 RankSEG 方法依赖条件独立假设(CIA)忽略标签相关性的问题,提出用空间局部依赖(SLD)结构替代 CIA,并引入互矩近似与不动点优化策略。算法复杂度降至 O(d log d),在低对比度或小物体场景下显著优于传统 argmax 和 CIA-based RankSEG。实验代码已公开。
ORACLE 是一种并发感知的在线路由机制,将自适应路由与自适应验证反馈对齐,作为免训练的“反馈环”叠加在任意模型选择策略上,先分类任务类型再动态分配任务适配的验证器。
summary_zh: TRACE 通过目标分组检索、独立类型化证据定位、多模态表格抽取、模式驱动表格构建与 fail-closed 验证,缩小来源访问与评分可见正确性之间的 grounding contract gap。
研究分析47节真实课堂、604道投票题与34万条回答,发现89%题目答案可从讲座文本定位,且存在仅靠上下文才能识别的注意力检查题型。提问以低阶认知为主,分属七种教学功能,学生答题表现由功能决定而非措辞。多数学生答对率88.5%,但部分高共识错误答案无法仅凭一致性识别;学生自评正确率与实际表现存在差距。
Doc2LoRA 用 Doc-to-LoRA 超网络为每篇论文生成一个 LoRA 适配器,把论文空间中的每一点(含混合点)映射为可接受自然语言提问和指令的大语言模型。
研究对照了六种检索策略在科学问答中的表现,包括经典top-k密集检索、LLM查询改写、改写后LLM重排序、RRF多查询融合、agentic工具调用管道以及ColBERTv2晚交互检索。
AdaM-Rec 是一个基于 LLM 的多模态推荐框架,通过代理式路由动态校准文本与视觉模态的依赖程度。它利用伪查询匹配实际查询粒度,以正交互项目为代理目标评估各模态的召回表现,进而优化路由策略并执行路由召回,最终以相关性排序候选结果。实验表明 AdaM-Rec 在多个基准上优于现有最优方法。