微调检测器在部署词汇外覆盖率的测量与修复
arXiv论文提出纵向协议,用预训练检查点对比其微调后代,追踪开放词汇top-K提案覆盖率Cτ。在四个架构、三个领域上的实验显示,Cτ随领域精度上升而下降,1024px²以上框下降5.12至63.35个百分点。
推荐理由:论文揭示细粒度微调提升精度的同时会侵蚀开放词汇覆盖,并给出无需训练即可修复的方法。
arXiv论文提出纵向协议,用预训练检查点对比其微调后代,追踪开放词汇top-K提案覆盖率Cτ。在四个架构、三个领域上的实验显示,Cτ随领域精度上升而下降,1024px²以上框下降5.12至63.35个百分点。
推荐理由:论文揭示细粒度微调提升精度的同时会侵蚀开放词汇覆盖,并给出无需训练即可修复的方法。
GeoWind2Plan 在给定背景风向量、3D 建筑几何与起终点后,将建筑几何变换到参考风场帧,用局部几何条件神经算子预测任务相关 3D 风块,拼接为可查询局部风场,并基于物理无人机能耗模型优化 3D 路径与速度剖面。
LUDI 是一种新型均匀扩散语言模型(UDLM)框架,通过引入更不均匀的损失函数和逐 token 时间嵌入来解决过均匀训练目标和采样时的条件-目标混淆问题。研究将 7B 自回归模型继续训练为 LUDI-7B,实现每步 3 token 的速度提升,并在少步生成和复杂推理上达到与掩码扩散基线相当的性能。
论文定义感知计算的决定价值为从廉价感知切换到昂贵感知带来的下游损失变化,并提出 DEEP 基准,在选择、延迟和能耗预算下评估预升级分配器。实验发现 KITTI 和 nuScenes 上 34–54% 的升级反而恶化决策结果,感知增益与决策价值常符号相反。
论文提出可微分且 GPU 加速的声道声学模拟器,通过梯度下降从声音重建声道形状。技术贡献包括频域流体公式(比时域有限差分并行度高 70 倍)、可微分湍流模型以及神经网络参数化几何。实验覆盖 11 语言的自监督声道编码,以及与 MRI 生成模型耦合实现无配对数据的动态声道重建。
论文提出 Elastic Dictionary Learning Networks(EDLNets),一种基于字典结构先验的新型 ResNet 架构,在多个数据集、主干网络和威胁模型上显著提升对抗鲁棒性与泛化能力。实验表明该方法是首个验证字典结构可在强自适应攻击下可靠增强深度学习鲁棒性的工作。
SABLE(Sparse-view Animal Behavior Latent Embeddings)是一个自监督框架,通过几何归纳偏置和多视角 Transformer,结合单目深度与姿态估计先验,从极稀疏视角重建 3D 动物行为。
PowerZooJax 是一个基于 JAX 的电力系统强化学习基准套件,涵盖发电、输电、配电、分布式能源和数据中心微电网五类约束马尔可夫决策任务。通过将潮流、经济调度、市场出清和设备动力学重写为 JAX 计算图,整个训练与评估循环保持在 GPU 上,实验显示相比 CPU 仿真有显著加速,并实现了策略回报、安全违规和分布外压力条件的标准化评估。该开源基准已发布于 arXiv。
PrimeSeeker 提出潜在锚点推理(latent anchor reasoning),将深度搜索分解为锚点解析与关系传递的耦合操作链,并构建 web-grounded 锚点结构。框架基于 9,221 条专家轨迹训练 30B 搜索 Agent,在五项深度搜索基准上表现强劲;参考步优化进一步改善监督策略,轨迹检索冗余低、固定预算下以更少工具调用实现强解覆盖。
研究团队发布 FineART 数据集,包含 40,543 条轨迹、1,718 小时和 533,913 个子任务,覆盖 151 个双臂操作任务,并推出 FineART-VLA 视觉-语言-动作策略。
推荐理由:论文给出了细粒度标注的双臂操作数据集和自预测子任务训练方法,读者可据此评估其对长时序操作任务的实际提升。
OmniDream 是一个无需训练的框架,将无声单目视频转换为沉浸式音视频体验,观众可自由环视而声音与视觉场景保持空间对齐。其核心是对象中心的音频表示,将声音源的内在音频内容与场景相关声学效应解耦,支持独立音频生成、基于物理的传播模拟和灵活空间音频渲染。实验显示在音频-视觉对齐、空间正确性和感知沉浸感上优于基线。
论文提出一种最小表示方法,将 D 维无散向量场编码为同一域上的 (D-1) 维场,利用傅里叶空间中的横向结构并通过 Householder 正交变换构造降维坐标。
PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。
summary_zh: 研究证明深度算子网络(ONets)能以指数收敛速率逼近椭圆型二阶偏微分方程的系数到解映射,涵盖 $d$ 维周期域与解析右端项/系数,涵盖扩散反应、参数化扩散及各向同性线弹性系统。
论文提出 τ-Multilingual,将 τ-Voice 扩展至西班牙语、巴西葡萄牙语、印地语、韩语和普通话,并通过母语者评审与评测生成语言和语音输出。在 4,500 次全双工通话和五种语音配置下,西语、葡语和印地语与英语的任务完成度差距在 3.2 分以内,韩语和普通话分别下降 14.7 和 8.4 分;韩语系统更多遗漏回复,普通话系统更多打断,两者均在工具和实体上表现较弱。
summary_zh: 该论文提出自适应离线强化学习(AORL),主张离线 RL 的目标应从直接部署扩展为学习可通过记忆、探索和自我修正持续改进的自适应策略先验。
论文提出 RoboActualizer,在冻结视频世界模型之上用仅 60M 参数的轻量实际器完成任务条件未来选择与动作读出。
推荐理由:用冻结世界模型加轻量实际器实现机器人任务条件动作生成,大幅降低训练成本并支持实时控制。
论文提出 evalstats 开源 Python 包,用于在小样本 AI 评测中对 LLM 评判分数做校准推断。研究发现直接对原始评判分数统计会导致假阳性膨胀,尤其在人类与 LLM 评判接近完全一致时风险最高;作者通过预测驱动推断(PPI)实现 9 种假设检验,并引入 bootstrap-adaptive power tuning 以稳定小规模标注校准集。
FD-AA是一种适配冻结3D CT编码器的轻量级器官感知分类头,在七个腹部器官上结合衰减感知模块与掩码广义均值池化。FD-AA配合Pillar-0在CT-RATE测试集AUC达0.798,在外部RAD-ChestCT数据集AUC达0.713,macro AUC/AP从0.763/0.346提升至0.798/0.405(p=0.034/0.016)。
论文提出 SAGE,一种用于 LLM 自演化智能体的统计接受门控,通过逐项配对比较和单侧配对检验来识别并过滤由噪声导致的不可靠改进与已破坏技能的回归。在五个基准和四种骨干模型上,SAGE 将回归率在 19/20 设置中降低,并在 LiveMath 和 OfficeQA 等任务上提升最终得分。
推荐理由:为自演化智能体的技能更新提供了一种统计检验门控,可在控制回归的同时保留有效改进。
Homo-RAG 是一个基于大语言模型的基因功能预测框架,结合同源引导的多跳检索与证据感知排序,利用斑马鱼与人类直系同源关系从 ZFIN、UniProt 和 PubMed 获取证据。
DORA 是一种面向异构 UAV 团队的分歧导向数据中继算法,通过量化机器人与队友之间的任务相关分歧来驱动通信,综合考虑任务相关性、发现新颖性、传感器不确定性和信息时效性。在四种不同物体密度和空间结构的仿真环境及物理 UAV 平台上验证,相比传统基于时间的通信调度方法,MRT 解析延迟最多降低 74.8%。该研究目前处于审稿中。
提出一种校准混合集成方法,组合五个深度学习模型与三个经典机器学习模型,通过逻辑回归堆叠元学习器进行癫痫发作预测。在 CHB-MIT 数据集上采用严格 LOPO 交叉验证,过滤后队列达到 74.2% 发作级灵敏度、每小时 1.24 次误报,平均预警时间 16.9 分钟;目标误报预算约束下的测试调优 oracle 为 60.9% 灵敏度、每小时 0.951 次误报警。代码已公开。
研究者构建了一个包含超过11000张标注图像的新数据集,用于识别图像中对象的拓扑关系。测试中,VGG16等深度学习方法验证准确率达到89.55%,显著优于传统机器学习模型。结果表明迁移学习在拓扑关系分析中的有效性,为空间推理研究提供了新基准。
BreakingWeb 通过在七家自托管网站的 519 组任务对上施加确定性、可检测且可恢复的环境干预,构建了挑战性浏览器使用基准,涵盖 29 种干预家族。评估六种主流浏览器智能体、三种仅看截图的 GUI 智能体及人类后,干预使智能体通过率平均下降 22.9%,近半数任务被推翻;75% 的失败属于智能体在未完成实际变更时声明成功。代码、数据与环境已公开。
研究分析了 19,930 段 ChatGPT 对话与 158 名 18-25 岁年轻人的调查数据,发现痛苦中的用户情感投入和行为改变更显著。临床医生审查五个案例后指出七种流程失败,如过早跳到解决方案,并提出分阶段设计准则。
推荐理由:研究揭示了年轻用户在急性痛苦中与 ChatGPT 互动的具体失败模式,为设计更安全的对话式 AI 提供了可操作的临床反馈框架。
QK-GCC 将 GCC 中的手工频谱匹配替换为两个麦克风信号之间的 Query-Key 匹配,通过幅度-相位频率 token 分别映射为 Query 和 Key,实现频率可靠性学习与局部频谱证据聚合。
summary_zh: 研究者提出"causal pieces"概念,将前馈 SNN 的输入与参数空间划分为不同区域,每个区域由同一子网络引发输出脉冲。对于大膜时间常数的电流基 LIF 神经元,每个 causal piece 内输出脉冲时间对输入和参数局部 Lipschitz 连续,并给出与 causal pieces 数量相关的近似误差下界。
ReLOBGen 在生成限价订单簿消息时直接保证可回放性,无需事后修正或重采样。它从当前订单簿的挂单中学习分布选取参考订单,再通过掩码确保剩余字段与市场状态一致。在 500 条消息回放中实现 100% 可回放性,相比 LOBS5 基线每条消息提速 2.7–3.6 倍,并改善了盘口统计与相对价格的市场真实性。
提出自适应响应几何,将深度、对数深度或视差的选择变为图像级未知量,用连续响应族统一这些坐标并定义深度相关增益。训练免调管道在故意不完整的度量观测下达到宏 AbsRel 0.0301 和宏 NMed 14.04°,优于 PriorDA、LDCM 和 Any2Full。
ATLAS 是一种训练目标,通过 Wasserstein 嵌入匹配(WEMReg)将成对结构从编码器表示传输到规划潜在空间,同时校准全局潜在分布。在 LeWM 中,ATLAS 提升了 PushT、TwoRoom 和 OGBench-Cube 上的平均目标到达成功率,尤其在 TwoRoom 高新颖性子集上增益最大。诊断结果表明规划潜在空间的新颖性结构更强、边际校准更好、多步预测误差更低。
提出一种针对车载对话助手(ICA)的自动化多轮对话测试框架,通过闭环模拟、策略引导用户模拟器与对抗策略管理器,结合两级LLM裁判评估轮次失败与对话质量。在工业ICA上验证,自动化裁判与人类标注高度一致,策略引导每轮对话发现的独特失败类型提升2.96倍,失败对话数翻倍以上。
研究比较了卷积神经网络与预训练音频变换器在蜂后缺失检测上的表现,基于2024年10月至2026年8月间5,129段录音、来自47个养蜂场的3,285个蜂箱数据。调制频谱图模型在未见蜂箱上AUROC达0.81、AUPRC为0.37,跨养蜂场泛化时性能下降。
COFFEE 是一个即插即用的离散扩散模型引导框架,通过将序列依赖与目标解耦,避免枚举所有补全带来的指数级计算增长。该框架在每一步扩散中利用无目标载体吸收去噪器的边际分布,并用编译的有限状态模型记录组合对序列级偏好的影响,从而在不重新训练的前提下将全局偏好转移到未解析位置。实验覆盖符号、语言和生物多个基准,展现出任务依赖的质量与多样性权衡。
summary_zh: 该研究将生成式大语言模型与弱监督技术结合,用于自动判断新闻文章是否涉及经济政策不确定性(EPU)并识别其具体类型。通过提示工程生成合成标签,方法具备成本效益和可扩展性,同时支持多标签与层次化分类。
Brain-SAD提出一种受大脑启发的安全自动驾驶控制框架,通过动态恐惧信号在线决策长期常规交互策略与短期紧急碰撞防御策略。实验表明,该框架在任务完成和碰撞恢复时间上更短,在连续复杂交叉路口场景下可靠性更强。
summary_zh: 该研究提出 Expert Knowledge Internalization(EKI)框架,将法医级专家感知内化到多模态大语言模型中,而非依赖外部模块。
Lookahead-R 将工具检索重构为资源约束下的序贯决策问题,通过轻量级执行感知代理世界模型联合预测工具执行成功率、延迟成本与语义效用,并驱动代价敏感的不确定性引导蒙特卡洛树搜索。
GLaS-JEPA 直接预测当前编码器在掩码位置的连续表示,无需对比学习、离散目标或独立 EMA 目标编码器,并通过 SIGReg 表示空间正则化防止表征坍缩。
提出 JEPA 风格的世界模型,将动力学限制为双线性参数化,把建模负担转移至编码器,鼓励更丰富的表示并暴露系统的可控几何结构。该结构可结构性强制动作可恢复性,防止表示坍缩;非线性动力系统可通过变换变为双线性形式。在 2D 和 3D 控制任务中,从高维观测直接学习后规划时间减少近三个数量级,同时保持或提升控制精度,并支持更长时序规划与实时控制。