Skip to content

#arXiv

152 today
TodayOct 7Wed
  1. arXiv · Computation and Language47

    统一多模态模型的视觉拒答能力研究

    研究提出视觉拒答(visual abstention)任务,要求统一多模态模型在请求的视觉变换违反任务规则时识别无解并拒绝生成。论文发布 Draw-or-Decline(DoD)基准,含 1,050 对可行/不可行请求、覆盖 7 类任务;评测 8 个 UMM 显示,最强编辑器编辑准确率 68.4%,却仅拒绝 0.4% 的不可行请求。

  2. arXiv · Computation and Language47

    ReFold:面向长程 AI 智能体的免训练可逆跨轮上下文折叠

    ReFold 是一种免训练的渲染层,在保留底层交互历史的同时只压缩模型渲染上下文,以替代依赖额外模型调用或启发式规则的上下文预测方法。它通过存根替换早期轮次已展示内容、把智能体自报完成的轮次折成一行笔记,并按分块渲染每隔几步重写一次缓存前缀;所有移除严格可逆,误删只需从历史恢复一次。

  3. arXiv · Computation and Language44

    SteerScope:面向 LLM 引导方法的多维评测套件

    论文提出 SteerScope,一个双轴多维评测套件,用 15 项指标联合刻画引导结果与方法属性,覆盖目标效能、副作用、泛化与数据依赖性。研究在统一模型、任务与协议下对 4 个系列共 23 种方法(含 Prompting、LoRA、SFT 基线)进行基准测试,发现现有激活引导方法在效能与副作用的整体平衡上均未超过 Prompt Steering 基线,且两者存在稳定耦合。

  4. arXiv · Computation and Language36

    Turnslide:用有限状态机行走实现可扩展多轮数据合成

    Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。

  5. arXiv · Computation and Language35

    长文档问答的层级检索研究:无需 LLM 摘要的树导航

    研究提出 NavTree,一种仅在叶节点输出的层级检索器:索引阶段零 LLM 调用,构建确定性平衡分段树,查询时以混合词频与稠密前沿游走从根节点导航到叶块。在匹配成本评测中,NavTree 是最强的匹配成本层级检索器,与最强扁平基线持平;在长文档多跳 QA 中,它是唯一在类对类基础上显著超过 BM25 的层级方法。

  6. arXiv · Statistics Machine Learning25

    Transformer 架构下分层推理奖励的强化学习:极小极大最优速率

    一项研究将奖励建模为响应空间上的分层函数,证明基于 Transformer 架构的 actor-critic 算法在查询预算与正则化强度上达到极小极大最优速率(对数因子内),并对固定提示数最优。研究对比指出,离线奖励建模中从固定参考分布采样会把遗憾衰减限制为对数速率。结果量化了在线策略探索对 RL 后训练的收益。

  7. arXiv · Statistics Machine Learning16

    正值金融时间序列的可扩展正则化向量乘法误差模型

    论文为正定金融时间序列的 log-vMEM 模型提出基于分层滞后结构的正则化估计,采用多元伽马误差分布与分块坐标下降算法,并用 GPU 加速数值积分以缓解对数似然计算瓶颈。研究组合三种滞后结构与四种惩罚函数,通过模拟检验参数恢复效果,并应用于 Microsoft(NASDAQ: MSFT)日内已实现波动率的联合动态建模。

  8. arXiv · Statistics Machine Learning23

    逐元素 i.i.d. 重尾数据上经验风险最小化的渐近分析

    论文针对逐元素 i.i.d. 对称 α-稳定重尾数据下线性回归经验风险最小化问题,给出预测性能的精确渐近刻画。研究引入描述每个系数对应随机有效问题的功能序参量,用 replica 方法在样本量与特征维度按固定比例发散的比例高维极限下完整表征泛化误差,并建立重尾普适律、典型误差与预测可靠性的标度律及 Bayes 最优预测误差。方法还适用于其他具有持续局部异质性的系统。

  9. arXiv · Statistics Machine Learning28

    Learning a Mixture of GFlowNets

    论文提出描述 GFlowNet 混合的通用理论框架,分为连续索引(CI)与离散索引(DI)两类。CI GFlowNets 可解释为随机特征展开,在图结构任务中提升采样器表达能力并通过谱平移降低学习不稳定性;DI GFlowNets 涵盖既有训练方法,并支撑新提出的 Stratum-Conditioned(SC)GFlowNets。

  10. arXiv · Statistics Machine Learning31

    语言模型中柏拉图表征的一种理论

    论文提出一种理论,解释多语言语言模型内层为何呈现相似的跨语言表征,即柏拉图表征假说。研究假设数据存在跨语言共享的抽象层级结构,并用共享上层生成规则的概率上下文无关文法生成合成语言,验证贝叶斯最优 next-token 预测器 belief propagation 的消息编码与 transformer 行为吻合。

  11. arXiv · Statistics Machine Learning33

    自监控测试时适应的可交换性失效:前提即问题

    论文研究多步时间序列预测中的自监控测试时适应,指出监控与适应共用同一预测误差反馈时,重叠目标与误差依赖会破坏统计保证所需的可交换性假设。这会导致监控在无有害变化时误报,保护响应反而降低预测质量,且适应可能掩盖持续变化,而原始冻结模型保留更清晰信号。论文据此提出需检验监控假设、在真实反馈下对比适应与冻结模型并限制保护响应的影响。

  12. arXiv · Statistics Machine Learning29

    扩散模型的特征信息动力学

    论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。

  13. arXiv · Audio and Speech23

    VoxReason:在语音合成前审计基于来源的语音规划

    VoxReason 提供一个 100 例验证器基准,固定每条语音、编辑一个指定来源标签线索,并对引用证据、八个规划字段和允许的响应打分。在 24 例来源键不相交测试中,来源情绪先验的规划槽准确率为 0.958,但必需变化准确率为 0.000;在 32 例情绪不相交测试中,两项分别为 0.219 和 1.000。该基准评估派生标签与结构化规划,不涉及音频输入、生成语音或听众判断。

  14. arXiv · Statistics Machine Learning22

    稀疏支持向量机的高维统计推断

    研究者提出一种针对稀疏支持向量机(SVM)的高维统计推断框架,在样本量与特征数按比例增长的渐近区间内,通过将 L1-惩罚 SVM 表示为线性规划并利用对偶变量识别 hinge 损失次梯度,构造出计算可行的去偏估计量,其坐标渐近服从高斯分布。该框架可为单个特征提供置信区间与假设检验,并支持错误发现率控制的变量选择,在强相关设计下完成仿真校准与功效分析,并应用于高维乳腺癌基因表达数据。

  15. arXiv · Audio and Speech40

    WorldSonus:为世界模型带来实时空间声音合成

    WorldSonus 是一个面向世界模型的交互式视频转音频框架,用于实时空间声音合成。它采用流式因果自回归扩散架构,以 0.41 的实时因子(RTF)合成音频块,并通过以音频为中心的字幕管线与按块索引的提示词调度实现生成中的动态声音控制。实验显示,WorldSonus 在开放域视频转音频基准上可匹配或超越现有双向模型的声学质量与空间对齐表现。

  16. arXiv · Statistics Machine Learning19

    梯度 EM 学习高维高斯混合模型中 √d 分离条件是否必要?

    论文证明在高维情形下,梯度 EM 学习高斯混合模型所需的真成分间最小分离度 Ω(√d) 的维度依赖不可避免。研究针对混合权重用标准 EM 更新、成分均值用梯度 EM 更新的混合算法,证明对任意 ε>0,当维度足够大时,Ω(d^{0.5-ε}) 量级的分离度在最坏情况下不足以保证随机初始化下总体梯度 EM 在亚指数时间内全局收敛,即便在过参数化设定下也成立。

  17. arXiv · Audio and Speech21

    HINTT 提交 MLC-SLM 挑战赛:对比级联与统一方案的说话人日志和 ASR

    HINTT 系统提交至第 2 届多语种会话语音语言模型挑战赛(MLC-SLM),研究多语种说话人归属 ASR。最终方案采用级联管线:微调 DiariZen 说话人日志模型、微调 Qwen3-ASR,并加 LLM 生成式纠错;对照组用相同官方训练数据微调 VibeVoice-ASR 作为统一模型。实验显示级联系统在 MLC-SLM Task 1 条件下更可靠,统一语音 LLM 是有前景的方向。

Oct 5Mon
  1. arXiv · Databases27

    Zephon:为在线有状态基础模型数据加载管线提供弹性确定性

    Zephon 是一款面向基础模型的数据加载器,支持在线、有状态管线,同时提供弹性确定性与高效的检查点恢复。它将全局流划分为与拓扑无关的 lane,序列化排序决策并并行化无状态工作,仅检查点有限的飞行中状态,使恢复成本不随训练进度增长。在文本与视觉-语言工作负载上,Zephon 实现了具有竞争力的吞吐量,并提供现有加载器对在线有状态管线所不具备的保证组合。

  2. arXiv · Databases32

    Tracking State Footprints:AI 智能体如何实现事务化交互

    论文提出用「状态足迹」描述 AI 智能体在本地上下文、编排器与外部系统间读写的状态,把多智能体系统(MAS)协调转化为数据管理问题。当前编排器不追踪智能体读写状态,即使简单编码任务也会出现并发异常。智能体无法像数据库事务那样基于固定模式或隔离快照读取、失败后确定性重放,但可语义化解决冲突而非中止,为新一代编排器与事务接口提供方向。

  3. arXiv · Databases27

    RaBitQ-SSD:面向 SSD 常驻向量搜索的分割编码与流水线 I/O

    RaBitQ-SSD 扩展 IVF-RaBitQ,用于向量集合超出 DRAM 容量时的 SSD 常驻近似最近邻搜索。它提出 Split-RaBitQ,在 DRAM 中保留每个二进制码的可配置前缀,使内存码存储低于每维 1 bit,并提供带概率误差界的一致距离估计,从而在候选列表内做更细粒度剪枝;异步搜索流水线协调候选剪枝与 SSD 读调度,减少不必要读取并重叠 I/O 与计算。

  4. arXiv · Neural and Evolutionary Computing32

    用于分布偏移实时恢复的自修复循环网络集成方法

    提出一种让策略在无监督条件下在线恢复分布偏移的方法,控制器由多个观察随机掩码子集的循环网络组成,通过序列卡尔曼融合合并高斯输出。部署时将共识视为自监督标签并按卡尔曼增益补数缩放各成员贡献,用 RFLO 近似实时循环学习在每个环境步后更新参数。仿真连续控制任务显示该方法在传感器偏移后恢复接近原性能,而观察完整观测的集成无法恢复。

  5. arXiv · Neural and Evolutionary Computing16

    聚合准确率掩盖脉冲语音分类器中集中的时间脆弱性

    一项针对冻结 SpikeSCR 语音分类器的研究显示,聚合准确率无法揭示局部脆弱样本与内部活动变化。该分类器在 100 条验证语音上达到 86.0836% 验证准确率,等源期望准确率从 84.00% 升至 84.54%,但 84 个初始正确源中有 13 个存在不利邻域,其中 5 个源贡献了 93.21% 的不利迁移。