跳到正文

#arXiv

今日 152 条
10月5日周一
  1. arXiv · Multiagent Systems38

    MACTS-EM:带涌现记忆的多智能体协同时间序列预测框架

    论文提出 MACTS-EM 多智能体协同时间序列预测框架,集成领域专用预测智能体、元认知层、涌现记忆机制、多模态上下文整合与对抗鲁棒性组件。在金融市场、气候模式、能源消耗与疫情传播评估中,预测准确率提升 8-12%,零样本迁移能力提升 22-27%,状态转换期间韧性增强 16-21%,分布偏移后恢复速度加快 15-18%。

  2. arXiv · Artificial Intelligence21

    ROUTEAUDIT:面向预算化多验证器路由的交互感知识别方法

    ROUTEAUDIT 把验证器路由建模为契约条件识别问题,通过契约格、独立响应带和请求级界限,在策略变化时分离路由策略本身的贡献。在 1,319 个留出任务请求上,学习策略与 RLVR 质量分别为 0.9522 和 0.9553,RLVR 相对静态策略配对差 +0.0068,区间 [0.0015,0.0122];归因恢复路由 MAE 0.0011、端点重构误差 0.0004。

  3. arXiv · Artificial Intelligence35

    Seg-OPD:用分段式在线蒸馏学习推理修订

    研究者提出分段式在线蒸馏方法 Seg-OPD,用于学习推理修订。该方法基于不确定性指标选取学生模型的推理片段,获取教师模型对应的重写版本,训练学生偏好教师重写片段,同时保留 token 级密集监督。在数学推理与竞赛编程任务上,Seg-OPD 的修订成功率高于基线,推理准确率平均相对提升 5.22%,代码已开源。

  4. arXiv · Artificial Intelligence36

    将记忆与上下文解耦:面向 token 高效测试时持续学习的结构化记忆

    论文提出 GraphMemory,一种轻量级图结构记忆系统,用于在推理时积累、精炼并连接可复用策略。GraphMemory 每次查询只检索相关子图,使在线上下文适应无需暴露全部记忆,且在有界检索下检索量随样本数增长保持恒定。实验显示其下游性能具竞争力,记忆构建 token 比基线减少约 81-85%。

  5. arXiv · Artificial Intelligence47

    长程智能体中的 GHOST:跨轮次被忽视安全约束引发的治理风险

    研究提出长程 AI 智能体的新型执行安全失效模式 GHOST:在良性交互下,智能体仍可能违反多轮之前设定的安全约束,在 GPT-5.5 上发生率达 11.5%。理论上证明若每个安全前缀的残余违规风险下界不可求和,执行几乎必然进入风险区。研究进一步提出双层防御 STAR-Guard,结合历史语义安全约束恢复与执行前确定性审计,在 GPT-5.5 实验设置下未再观察到 GHOST 事件。

  6. arXiv · Artificial Intelligence42

    LLM 智能体中信念形成的连贯性驱动与传染群体动力学

    研究实证测量了 LLM 智能体的信念采纳概率,发现其采纳核呈 sigmoid 形态,具有复杂传染特征,阈值受声明可信度、来源可靠性和智能体倾向三个来源影响,且可由与先验信念的连贯性这一单一有效维度近似。群体动力学上,簇状网络比随机网络传播更广,并出现分岔级联窗口与自维持滞后共识,使共识一旦形成便远难于消除。论文共 18 页、6 幅图,已被 NeurIPS 2026 FAST 工作坊接收。

  7. arXiv · Artificial Intelligence39

    Lost in the Request:沟通变体如何扰乱邮件智能体检索与行动

    研究构建五种沟通风格轴与四种基于规则的方言变体,在 RAG 管线与两个工具型智能体共三个基准上测试邮件助手。间接请求降低全部三个基准表现,正式请求降低两个智能体基准表现;冗长请求主要损害词汇检索器,间接与方言变体即使检索到相关邮件仍有害。智能体场景中间接与正式请求主要导致遗漏必需动作,而非产生更多无依据动作。

  8. arXiv · Artificial Intelligence26

    时间序列预测基准为何需要场景化压力测试

    时间序列预测(TSF)基准评测过度依赖留出误差,稳健性研究又常把失效简化为高斯噪声、随机掩码或有界对抗扰动,难以反映真实部署中的失效模式。输入侧异常往往对应改变时间动态、破坏跨变量依赖、引发状态切换或由故障传感器传导至下游决策的结构化事件,i.i.d. 扰动无法忠实刻画这类语义、因果与系统级失效。

  9. arXiv · Artificial Intelligence46

    如何训练你的世界模型:基于 LM 的世界建模中微调与 RAG 的对比

    论文系统比较了微调与 RAG 两种构建 LM 世界模型的路径,覆盖具身、网页导航和社交共 5 类环境,发现微调在 15/20 设置中让智能体获得更高奖励,而 RAG 数据效率更高。RAG 检索器持续从经验缓冲区捞出次优转移,层级式查询重构优于传统检索管线。最终提出的混合系统在多个环境与模型上持续胜出。

10月2日周五
  1. arXiv · Information Retrieval33

    From Rules to Neural Graphs:专利先有技术检索的可扩展结构化预测

    专利检索常需处理数万 token 文档,多数神经检索方法受限于截断输入。该研究提出神经解析器,将依赖解析的双仿射注意力适配到发明图预测,局部评分把复杂度从 O(n²) 降到 O(n·w)。模型从 100 万条规则解析文档蒸馏而来,在 40,000 token 以上文档部署无需重新训练,推理成本降为原来的 1/3;在下游 Graph Transformer 检索中,全文档引用召回率提升 1.1%。

  2. arXiv · Human-Computer Interaction32

    LeanSide:面向自然语言证明的形式化验证协同推理系统

    研究者开发 LeanSide,一个形式化验证的协同推理系统,让用户以自然语言撰写和修改证明,后端自动将学生推理形式化为 Lean 并把验证输出转化为可理解的反馈。研究通过大学数学课堂部署开展用户研究,分析哪些系统属性帮助学生推进、哪些导致卡住,并据此提出在人机协同推理中使用形式化验证后端的设计启示。论文 16 页、13 图,arXiv:2610.00760 [cs.HC]。

  3. arXiv · Human-Computer Interaction36

    多模态深度研究中的忠实图表生成:Frame-Evidence Co-Adaptation

    论文提出 Frame-Evidence Co-Adaptation(FECA)框架,解决多模态深度研究中图表数值保真问题。FECA 将图表生成建模为视觉帧与检索证据的迭代交互,视觉帧引导证据获取,证据决定帧的接受、修订或丢弃。实验表明 FECA 在 100 个真实研究主题上显著提升数值保真度,同时保持报告质量与图表可用性。

  4. arXiv · Computer Vision28

    从图像潜在空间到模糊规则:胃肠道基础模型的可解释性分析

    该研究提出一种基于原型的模糊规则框架,直接解释预训练基础模型内部层的patch级特征,无需微调。在ViT-S/16骨干网络的最后两个块上,通过特征空间聚类学习类别原型,并用人类可读的IF-THEN模糊规则进行分类。在无线胶囊内镜、胃肠道内镜和结肠息肉分割任务上,该方法在冻结特征下达到与黑盒分类器相当的准确率,并能用于检测合成医学图像中生成器未能复现的真实原型与规则,定位合成图像与真实组织的差异。

  5. arXiv · Statistics Machine Learning12

    使用神经网络和欧拉近似对加权次分数布朗运动驱动的随机微分方程进行推断

    该研究针对由加权次分数布朗运动驱动的随机微分方程,利用欧拉近似从离散观测中重建高斯驱动增量并构造轨迹似然。神经网络和径向基函数表示漂移、扩散及归一化时间权重,通过似然轮廓估计协方差指数和扩散尺度,并在二十组系数设置下与两种神经网络方法进行了对比。

10月1日周四
  1. arXiv · Statistics Machine Learning25

    On the Relaxation of Conditional Independence Assumption for Image Segmentation

    针对语义分割中 RankSEG 方法依赖条件独立假设(CIA)忽略标签相关性的问题,提出用空间局部依赖(SLD)结构替代 CIA,并引入互矩近似与不动点优化策略。算法复杂度降至 O(d log d),在低对比度或小物体场景下显著优于传统 argmax 和 CIA-based RankSEG。实验代码已公开。

  2. arXiv · Computers and Society28

    实时课堂互动中的提问模式与学生参与度:基于讲座上下文分析的研究

    研究分析47节真实课堂、604道投票题与34万条回答,发现89%题目答案可从讲座文本定位,且存在仅靠上下文才能识别的注意力检查题型。提问以低阶认知为主,分属七种教学功能,学生答题表现由功能决定而非措辞。多数学生答对率88.5%,但部分高共识错误答案无法仅凭一致性识别;学生自评正确率与实际表现存在差距。

  3. arXiv · Information Retrieval34

    AdaM-Rec:面向多模态推荐的自适应模态路由框架

    AdaM-Rec 是一个基于 LLM 的多模态推荐框架,通过代理式路由动态校准文本与视觉模态的依赖程度。它利用伪查询匹配实际查询粒度,以正交互项目为代理目标评估各模态的召回表现,进而优化路由策略并执行路由召回,最终以相关性排序候选结果。实验表明 AdaM-Rec 在多个基准上优于现有最优方法。