跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Robotics62

    微调检测器在部署词汇外覆盖率的测量与修复

    arXiv论文提出纵向协议,用预训练检查点对比其微调后代,追踪开放词汇top-K提案覆盖率Cτ。在四个架构、三个领域上的实验显示,Cτ随领域精度上升而下降,1024px²以上框下降5.12至63.35个百分点。

    推荐理由:论文揭示细粒度微调提升精度的同时会侵蚀开放词汇覆盖,并给出无需训练即可修复的方法。

  2. arXiv · Computation and Language34

    Less Uniform Discrete Diffusion is More Powerful and Scalable

    LUDI 是一种新型均匀扩散语言模型(UDLM)框架,通过引入更不均匀的损失函数和逐 token 时间嵌入来解决过均匀训练目标和采样时的条件-目标混淆问题。研究将 7B 自回归模型继续训练为 LUDI-7B,实现每步 3 token 的速度提升,并在少步生成和复杂推理上达到与掩码扩散基线相当的性能。

  3. arXiv · Audio and Speech50

    可微分声学仿真重建声道

    论文提出可微分且 GPU 加速的声道声学模拟器,通过梯度下降从声音重建声道形状。技术贡献包括频域流体公式(比时域有限差分并行度高 70 倍)、可微分湍流模型以及神经网络参数化几何。实验覆盖 11 语言的自监督声道编码,以及与 MRI 生成模型耦合实现无配对数据的动态声道重建。

  4. arXiv · Neural and Evolutionary Computing28

    Elastic Dictionary Learning Networks(EDLNets)提升对抗鲁棒性与泛化能力

    论文提出 Elastic Dictionary Learning Networks(EDLNets),一种基于字典结构先验的新型 ResNet 架构,在多个数据集、主干网络和威胁模型上显著提升对抗鲁棒性与泛化能力。实验表明该方法是首个验证字典结构可在强自适应攻击下可靠增强深度学习鲁棒性的工作。

  5. arXiv · Artificial Intelligence26

    PowerZooJax:基于 JAX 的电力系统强化学习基准

    PowerZooJax 是一个基于 JAX 的电力系统强化学习基准套件,涵盖发电、输电、配电、分布式能源和数据中心微电网五类约束马尔可夫决策任务。通过将潮流、经济调度、市场出清和设备动力学重写为 JAX 计算图,整个训练与评估循环保持在 GPU 上,实验显示相比 CPU 仿真有显著加速,并实现了策略回报、安全违规和分布外压力条件的标准化评估。该开源基准已发布于 arXiv。

  6. arXiv · Computation and Language42

    PrimeSeeker:面向能力的深度搜索 Agent 监督框架

    PrimeSeeker 提出潜在锚点推理(latent anchor reasoning),将深度搜索分解为锚点解析与关系传递的耦合操作链,并构建 web-grounded 锚点结构。框架基于 9,221 条专家轨迹训练 30B 搜索 Agent,在五项深度搜索基准上表现强劲;参考步优化进一步改善监督策略,轨迹检索冗余低、固定预算下以更少工具调用实现强解覆盖。

  7. arXiv · Robotics62

    FineART:细粒度标注机器人轨迹数据集与视觉-语言-动作模型用于双臂操作

    研究团队发布 FineART 数据集,包含 40,543 条轨迹、1,718 小时和 533,913 个子任务,覆盖 151 个双臂操作任务,并推出 FineART-VLA 视觉-语言-动作策略。

    推荐理由:论文给出了细粒度标注的双臂操作数据集和自预测子任务训练方法,读者可据此评估其对长时序操作任务的实际提升。

  8. arXiv · Audio and Speech50

    OmniDream:从任意单目视频生成沉浸式音视频体验

    OmniDream 是一个无需训练的框架,将无声单目视频转换为沉浸式音视频体验,观众可自由环视而声音与视觉场景保持空间对齐。其核心是对象中心的音频表示,将声音源的内在音频内容与场景相关声学效应解耦,支持独立音频生成、基于物理的传播模拟和灵活空间音频渲染。实验显示在音频-视觉对齐、空间正确性和感知沉浸感上优于基线。

  9. arXiv · Computer Vision50

    PreviewDiff:多模态评判引导的扩散模型潜在空间搜索

    PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。

  10. arXiv · Audio and Speech58

    τ-Multilingual:跨语言语音Agent基准评测

    论文提出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,并通过母语者评审与评测生成语言和语音输出。在 4,500 次全双工通话和五种语音配置下,西语、葡语和印地语与英语的任务完成度差距在 3.2 分以内,韩语和普通话分别下降 14.7 和 8.4 分;韩语系统更多遗漏回复,普通话系统更多打断,两者均在工具和实体上表现较弱。

  11. arXiv · Computation and Language58

    evalstats:如何对 LLM 评判做统计推断并信任结果

    论文提出 evalstats 开源 Python 包,用于在小样本 AI 评测中对 LLM 评判分数做校准推断。研究发现直接对原始评判分数统计会导致假阳性膨胀,尤其在人类与 LLM 评判接近完全一致时风险最高;作者通过预测驱动推断(PPI)实现 9 种假设检验,并引入 bootstrap-adaptive power tuning 以稳定小规模标注校准集。

  12. arXiv · Artificial Intelligence60

    SAGE:自演化智能体的统计接受门控

    论文提出 SAGE,一种用于 LLM 自演化智能体的统计接受门控,通过逐项配对比较和单侧配对检验来识别并过滤由噪声导致的不可靠改进与已破坏技能的回归。在五个基准和四种骨干模型上,SAGE 将回归率在 19/20 设置中降低,并在 LiveMath 和 OfficeQA 等任务上提升最终得分。

    推荐理由:为自演化智能体的技能更新提供了一种统计检验门控,可在控制回归的同时保留有效改进。

  13. arXiv · Robotics28

    DORA: 面向部分连接机器人团队的分歧导向数据中继算法

    DORA 是一种面向异构 UAV 团队的分歧导向数据中继算法,通过量化机器人与队友之间的任务相关分歧来驱动通信,综合考虑任务相关性、发现新颖性、传感器不确定性和信息时效性。在四种不同物体密度和空间结构的仿真环境及物理 UAV 平台上验证,相比传统基于时间的通信调度方法,MRT 解析延迟最多降低 74.8%。该研究目前处于审稿中。

  14. arXiv · Machine Learning28

    基于脑电图的癫痫发作预测混合集成学习方法

    提出一种校准混合集成方法,组合五个深度学习模型与三个经典机器学习模型,通过逻辑回归堆叠元学习器进行癫痫发作预测。在 CHB-MIT 数据集上采用严格 LOPO 交叉验证,过滤后队列达到 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟;目标误报预算约束下的测试调优 oracle 为 60.9% 灵敏度、每小时 0.951 次误报警。代码已公开。

  15. arXiv · Computation and Language48

    构建具有挑战性的浏览器使用任务:基于受控环境干预的 BreakingWeb 基准

    BreakingWeb 通过在七家自托管网站的 519 组任务对上施加确定性、可检测且可恢复的环境干预,构建了挑战性浏览器使用基准,涵盖 29 种干预家族。评估六种主流浏览器智能体、三种仅看截图的 GUI 智能体及人类后,干预使智能体通过率平均下降 22.9%,近半数任务被推翻;75% 的失败属于智能体在未完成实际变更时声明成功。代码、数据与环境已公开。

  16. arXiv · Artificial Intelligence62

    ChatGPT 与年轻人痛苦对话分析:正确的词,错误的时刻

    研究分析了 19,930 段 ChatGPT 对话与 158 名 18-25 岁年轻人的调查数据,发现痛苦中的用户情感投入和行为改变更显著。临床医生审查五个案例后指出七种流程失败,如过早跳到解决方案,并提出分阶段设计准则。

    推荐理由:研究揭示了年轻用户在急性痛苦中与 ChatGPT 互动的具体失败模式,为设计更安全的对话式 AI 提供了可操作的临床反馈框架。

  17. arXiv · Neural and Evolutionary Computing28

    Causal pieces:逐片分析与改进脉冲神经网络

    summary_zh: 研究者提出"causal pieces"概念,将前馈 SNN 的输入与参数空间划分为不同区域,每个区域由同一子网络引发输出脉冲。对于大膜时间常数的电流基 LIF 神经元,每个 causal piece 内输出脉冲时间对输入和参数局部 Lipschitz 连续,并给出与 causal pieces 数量相关的近似误差下界。

  18. arXiv · Machine Learning28

    ReLOBGen:可回放限价订单簿消息生成方法

    ReLOBGen 在生成限价订单簿消息时直接保证可回放性,无需事后修正或重采样。它从当前订单簿的挂单中学习分布选取参考订单,再通过掩码确保剩余字段与市场状态一致。在 500 条消息回放中实现 100% 可回放性,相比 LOBS5 基线每条消息提速 2.7–3.6 倍,并改善了盘口统计与相对价格的市场真实性。

  19. arXiv · Robotics30

    ATLAS:通过对齐传输潜在结构实现可靠世界模型规划

    ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。

  20. arXiv · Computation and Language35

    车载对话助手多轮对话自动评估框架

    提出一种针对车载对话助手(ICA)的自动化多轮对话测试框架,通过闭环模拟、策略引导用户模拟器与对抗策略管理器,结合两级LLM裁判评估轮次失败与对话质量。在工业ICA上验证,自动化裁判与人类标注高度一致,策略引导每轮对话发现的独特失败类型提升2.96倍,失败对话数翻倍以上。

  21. arXiv · Artificial Intelligence32

    COFFEE:面向离散扩散模型的未来感知目标引导框架

    COFFEE 是一个即插即用的离散扩散模型引导框架,通过将序列依赖与目标解耦,避免枚举所有补全带来的指数级计算增长。该框架在每一步扩散中利用无目标载体吸收去噪器的边际分布,并用编译的有限状态模型记录组合对序列级偏好的影响,从而在不重新训练的前提下将全局偏好转移到未解析位置。实验覆盖符号、语言和生物多个基准,展现出任务依赖的质量与多样性权衡。

  22. arXiv · Robotics35

    Bilinear World Models:通过双线性参数化学习表示与结构化动力学以实现高效控制

    提出 JEPA 风格的世界模型,将动力学限制为双线性参数化,把建模负担转移至编码器,鼓励更丰富的表示并暴露系统的可控几何结构。该结构可结构性强制动作可恢复性,防止表示坍缩;非线性动力系统可通过变换变为双线性形式。在 2D 和 3D 控制任务中,从高维观测直接学习后规划时间减少近三个数量级,同时保持或提升控制精度,并支持更长时序规划与实时控制。