跳到正文

#arXiv

今日 152 条
10月5日周一
  1. arXiv · Statistics Machine Learning17

    时变贝叶斯优化的渐近性能

    论文研究时变贝叶斯优化(TVBO)在噪声且评估代价高的时变黑盒目标上的理论表现,给出 TVBO 算法累积 regret 的上界与算法无关下界,并推导出算法具备 no-regret 性质所需的充分条件。分析据称首次覆盖实践中所有主要平稳核函数类别,回答瞬时 regret 能否渐近消失及何时消失的问题。

  2. arXiv · Statistics Machine Learning27

    迭代一致性模型:稳定性、误差界与噪声调度

    该研究将多步一致性模型(CM)采样分析为加噪与近似去噪算子的组合,在明确可验证的稳定性假设下推导出非渐近误差界,把初始误差的收缩与近似误差的累积分开。误差界赋予噪声调度不同角色:早期较大噪声水平驱动收缩,晚期较小噪声水平控制残余偏差,并为强对数凹与半对数凹目标给出显式常数。实验显示,进入误差界的收缩与近似剖面可可靠测量,且与预测的函数形式高度吻合,为多步 CM 提供收敛理论与采样器设计路径。

  3. arXiv · Statistics Machine Learning25

    HOST:用留出集评分实现高效高斯 DAG 学习

    论文提出 HOST,一种高效 DAG 学习算法,用逐节点留出集评分与凸回归替代子集搜索,无需预先给出入度上界。HOST 在排序步骤利用留出样本评分在期望上抬高排序分的特性实现单向误差控制,再通过递归移除间接效应恢复父节点。在合适条件下,HOST 可在多项式时间内以约 d log p 的样本复杂度精确恢复 p 节点、最大入度 d 的 DAG,实验显示其图恢复效果具竞争力且运行时间扩展性良好。

  4. arXiv · Statistics Machine Learning38

    ENCORE:用于扩散模型生成的精确非平衡副本交换控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,把向上移动变为截断,从而避免模拟难以处理的时间反转。该方法在合成目标、分子 Boltzmann 采样和图像生成上取得有竞争力的准确率与多样性,对采样器扰动保持稳健,并适用于现有 RE 校正无法使用的蒸馏采样器。论文还证明目标不变性,并给出用于调节调度与计算预算的诊断。

  5. arXiv · Information Retrieval23

    大型音频语言模型中音乐概念的音符级时序定位研究

    研究提出 MusicGroundingBench,一个由算法生成的钢琴音频构成、带有精确符号对齐的受控基准,包含三音与两小节设置,用于评测大型音频语言模型的定位与理解能力。实验显示跨模态微调可让模型学会两种能力,但增加定位监督并未在不同骨干模型上稳定提升理解力。两个受测 LALM 在基础音乐概念上的零样本定位仍有限,凸显接地音乐理解仍是开放挑战。

  6. arXiv · Information Retrieval39

    学习查询编码器可能很难,即使向量检索在几何上很容易

    论文提出以冻结文档索引可达的最大召回率衡量几何容量,并在多个真实检索基准上发现单向量查询编码器的检索质量常远低于索引可支持的上限。作者给出理论证据:存在一个检索任务,可用小型单隐层 ReLU 网络实现完美召回的查询编码器,但任何统计查询学习器要超越随机基线 k/n 都需要指数级多的统计查询。研究认为检索基准存在大量未实现的几何容量,查询编码器可学习性是嵌入检索的潜在瓶颈。

  7. arXiv · Information Retrieval26

    Lion-SP:用于高效检索的可学习 Soft Top-K 与逐项阈值自适应稀疏优化

    该论文提出通过可学习 soft top-K、逐项阈值(per-term thresholding)与 FLOPs 正则化协同优化模型稀疏度,以缩短 LLM 语义词扩展带来的过长查询与文档向量。在 MS MARCO 和 BEIR 数据集上,Lion-SP 显著降低平均查询与文档长度,实现更低检索延迟与存储成本,同时保持有竞争力的相关性,论文已被 SIGIR 2026 接收。

  8. arXiv · Computation and Language26

    CLIMB:面向多模态检索增强生成的可信度引导互补证据框架

    CLIMB 是一个免训练的多模态 RAG 推理时框架,先用 MMR 式目标构建兼顾查询相关性与段落冗余的互补证据池,再由 R/E/C 评审器按相关性、证据特异性与跨模态对齐打分,仅在置信度提升时接受更新答案。在 Encyclopedic-VQA 和 InfoSeek 上,CLIMB 稳定优于检索增强多模态基线,且无需修改底层检索器或 MLLM。

  9. arXiv · Computation and Language37

    语言模型边际注意力空间中的涌现结构

    研究者将 60 多个 LLM 的 post-softmax 注意力权重按 query 位置边缘化,构建 token-head「边际注意力空间」。按 token 轴降维得到跨模型稳健的文本内禀信号,并可理论证明下一 token 分布相似的模型具有相似的输入-输出 Jacobian 统计;按 head 轴降维则形成跨文档保持的模型私有特征。

  10. arXiv · Computation and Language37

    LLM 偏好推理中可行动不确定性的评测

    论文提出“可行动不确定性”(actionable indeterminacy)框架,区分何时行动、何时澄清、何时提出最小代价约束修复,并构建覆盖对象分配、会议安排、公寓选择与稳定匹配的求解器基准。实验发现,模型能识别需要澄清或修复的情形,却在已有正当行动时仍进行干预;正确决策标签也不保证生成可用的行动、问题或修复。明确响应要求可显著提升完全正确响应率,并改变干预决策。

  11. arXiv · Computation and Language43

    大语言模型中知识可及性的几何结构

    研究提出“知识可及性”概念,发现 LLM 能否召回查询所需知识,在生成前就由查询表征的几何结构决定:越靠近表征空间中心的查询越易召回,远离中心则可及性下降,并存在区分二者的知识边界。受控实验显示该中心几何与知识可及性的关联强于推理难度,且查询改写对易及查询更有效、链式推理在边界附近更有效、检索在边界外增益更大,可作为自适应推理的生成前信号。

  12. arXiv · Computation and Language36

    在线交流中心理健康污名的自动评测

    研究者提出一个基于理论的基准,用于自动评测在线交流中的心理健康污名,涵盖六种心理健康状况的自然新闻与社交媒体文本。标注框架包含二元污名检测任务,以及覆盖污名模式、领域和具体成分的多级分类体系。实验显示,情感、毒性与仇恨言论分类器难以捕捉心理健康污名,LLM 在缺少明确操作规则时常过度预测污名;公开部分基准、标注、示例与代码已发布。

  13. arXiv · Computation and Language44

    Sigma:大规模连续扩散语言模型

    论文提出 Sigma,首个基于可引导低维 ODE/SDE 潜轨迹的大规模(3B/8B)连续扩散语言模型,通过分块似然优化训练,并用自回归模型预训练权重热启动。推理中,分类器无关引导与得分温度对高保真推理和编码至关重要;在 GSM8K、Minerva、HumanEval、MBPP 及 MATH-500、AIME 上与离散模型表现相当。

  14. arXiv · Computation and Language40

    APDMem:智能体控制的渐进式披露查询自适应长期记忆架构

    APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮次级证据笔记和原始消息四层,由控制器按查询复杂度渐进披露。检索到的证据经笔记合成器整理为面向查询的结构,合并事实、排序事件并标记矛盾。LongMemEval 实验显示,APDMem 仅访问 8% 的对话即取得强长上下文记忆推理性能,论文已被 EMNLP 2026 Industry Track 接收。

  15. arXiv · Multiagent Systems55

    Recursive Agent Optimization 研究提出递归智能体强化学习方法

    论文提出 Recursive Agent Optimization(RAO),一种训练递归智能体的强化学习方法,让智能体能够递归地向自身的新实例派生并委派子任务。RAO 教会模型何时以及如何委派与通信,使智能体在推理时通过分治扩展到更长上下文,泛化到比训练时更难的任务,并可能降低相对单智能体系统的实际耗时。

  16. arXiv · Multiagent Systems41

    WebUIProof:用 UI-Agent 执行框架评测 WebUI 代码生成器

    WebUIProof 是一个面向执行的 WebUI 代码生成评测基准,覆盖通用 WebUI 与 3D 交互仿真两类任务,提供结构化规格与可执行交互测试。其 UI-agent harness 在无头浏览器中以 plan–act–observe 循环定位 DOM 元素、执行动作并校验断言;对八款商用 LLM 的评测显示,页面渲染成功时交互需求仍频繁失败,3D 仿真界面尤甚。