跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Robotics28

    蒸馏特权控制障碍函数到 RGB 仅视觉安全滤波器用于动态视觉导航

    提出一种教师-学生视觉蒸馏框架,将特权 CBF 教师的安全行为迁移到仅 RGB 的学生安全滤波器,用于动态环境中的端到端视觉导航。学生仅依赖短时序 RGB 历史、机器人速度和名义控制动作直接输出安全动作,教师在真实到模拟的动态 3D 高斯泼溅环境中利用真值状态构建安全约束,并通过考虑障碍速度不确定性及动作增强来缩小师生信息差距。

  2. arXiv · Artificial Intelligence62

    小LLM团队扩展的精确生成-变换分解:跨编排架构实证

    论文 sweeping 八种 Agent 编排架构与五款 7-9B 指令模型,在 GSM8K、GSMHard、ARC、GPQA、MMLU 及可执行代码基准上最多 30 次调用,发现团队扩展收益高度任务依赖:算术题提升最高 17 分,其余基准最多 4 分。

    推荐理由:用可验证的生成-变换分解解释不同架构在算术与多选任务上的收益差异,为团队扩展策略提供迁移方法。

  3. arXiv · Machine Learning25

    KernelOnet:一种基于核函数的可解释神经算子

    KernelOnet 将核函数显式嵌入神经算子架构,用数据驱动核、物理信息核和混合核三种互补核替代 DeepONet 的隐式基函数网络。在三个基准和一个浅水波导工程问题上,KernelOnet 以更少可学习参数达到更高精度,无需内部解标签的无监督配置,且每次查询推理成本远低于逐实例求解器。

  4. arXiv · Computation and Language60

    大语言模型何时应信任自身修正:风险感知的内在自修正研究

    论文研究大语言模型内在自修正在 BoolQ、GSM8K 和 Corr2Cause 上的修正行为,发现二次推理既可纠正错误,也可能把初始正确答案翻错,例如 Llama-3.1-8B 在 GSM8K 提升 25.5 个百分点但改变 19.1% 的初始正确答案。

    推荐理由:研究揭示自修正可能把正确答案翻成错误答案,读者可据此评估何时值得启用二次推理。

  5. arXiv · Robotics47

    LIBERO-MAX:机器人策略在环境变化时能否自适应?

    LIBERO-MAX 是一个包含 8,000 对案例的基准,涵盖几何、观测、外观、杂乱和路径 8 类变化,每对案例固定任务、初始状态、策略种子和事件前动作序列,对比有无中途事件的任务执行表现。测试覆盖 14 个当前 VLA、混合和世界动作策略,事件导致成功率下降 11.0-25.7 个百分点。该基准为诊断机器人策略在执行中途面对环境变化时的失败提供了可复现的测试平台。

  6. arXiv · Audio and Speech25

    无教师自蒸馏一致性轨迹学习实现快速语音增强

    本文提出无教师自蒸馏一致性轨迹框架,去除外部教师模型,每轮训练时间减少 5 倍。模型采用三阶段课程训练,在 VoiceBank+DEMAND 上达到宽带 PESQ 3.01、ESTOI 0.87、SI-SDR 19.07 dB,优于基于教师模型的 3.57、0.87 和 12.8 dB。研究发现低步数几何调度最大化感知质量,高步数均匀调度有利于信号保真度。

  7. arXiv · Artificial Intelligence20

    GeoOutageBench:面向多模态停电与韧性分析的时空知识图谱问答基准

    GeoOutageBench 是一个评估 LLM 时空知识图谱问答能力的基准,融合停电记录、遥感、气象与领域本体等多模态数据。它提供从时空包含、共现分析到假设评估的分层查询分类,并支持用户配置对 NL-to-SPARQL 解释、本体效用和检索准确性的三项评估。基准代码、数据与结果在 arXiv:2609.36082 可获取。

  8. arXiv · Robotics12

    空间多段腱绳驱动连续体机器人的闭合形式笛卡尔正运动静力学

    该研究提出一种力到笛卡尔构型的闭合形式模型,以笛卡尔 backbone 中心线与累积材料扭转为广义坐标,避免迭代平衡求解。数值对比 GVS 模型,单段与三段机器人 tip-position 偏差分别为 8.91×10⁻⁶ 与 1.01×10⁻⁵,评估耗时 1.52μs 与 2.94μs,相对基线加速约 1864x 与 3348x。

  9. arXiv · Computation and Language66

    超越上下文窗口:基于自适应熵的混合检索与长上下文路由框架

    论文提出 EDAR 框架,在推理时根据 RAG 响应前几个 token 的预测熵决定是使用检索结果还是升级到全长上下文处理,并在 LongBench v2 和 Infinity-Bench 上验证。预测熵与幻觉率高度相关(Pearson r=0.85),EDAR 保留纯长上下文 97.4% 的准确率,同时降低 70.7% 的 token 消耗,仅升级 18.2% 的查询。

    推荐理由:用预测熵在推理时动态选择 RAG 或长上下文,可在几乎不损失精度的前提下大幅降低 token 支出。

  10. arXiv · Artificial Intelligence40

    AI 理解的复调观:LLM 输出源于多重并行机制的协作与竞争

    论文提出 LLM 是"复调"(polyphonic)系统,输出由多个并行机制以不同可靠性组合而成,多个机制可共同完成同一任务而无单一不可或缺者。复调性使得单一声誉归因变得危险,作者据此提出以"可靠且受控的电路"为核心的理解框架,为 AI 信任提供可验证的内部组织判据。

  11. arXiv · Machine Learning20

    Normative Loss Landscape Navigation: A Trajectory-Based Approach to Mitigating Forgetting in Incremental Learning

    summary_zh: TMLN(Trajectory-Modulatory Landscape Navigation)将持续学习形式化为曲率损失景观上的最优控制问题,利用对角经验 Fisher 信息矩阵(FIM)定义局部 Riemannian 流形,并通过网络参数值的历史轨迹动态调节预条件器,直接集成到梯度更新中,从而在不依赖加法惩罚的情况下保护历史关键参数方向。

  12. arXiv · Audio and Speech37

    零音视频资源场景下的音视频语音识别自举方法

    研究在零真实音视频资源场景下,仅用合成视觉数据自举音视频语音识别(AVSR)。团队合成超700小时说话人视频并微调预训练AV-HuBERT模型,在手动标注的加泰罗尼亚语基准上达到接近SOTA的性能,参数和训练数据远少于Whisper-large-v3,且优于纯音频基线、在声学降级下仍保持多模态优势。

  13. arXiv · Neural and Evolutionary Computing17

    一种基于内源性默认模式网络动力学的脉冲神经网络初级自我意识模型

    研究提出一个10,000神经元脉冲神经网络(SNN)模型,基于Izhikevich动力学,由5,000个常规放电皮层神经元和5,000个内源性爆发DMN起搏器神经元组成。DMN层通过连续紧张性电流维持自主生物电节律,DMN到网络突触权重高于感觉层连接。数值模拟展示内源性起搏活动与外部感觉扰动如何产生持续自持的"自我"神经表征。

  14. arXiv · Computer Vision31

    SAGE-Restore:面向满文古籍修复的风险感知选择性恢复框架

    SAGE-Restore 提出一种基于笔画引导注意力机制的选择性修复框架,通过补丁级修复概率预测与像素级软门控控制修复应用范围。在满文古籍全页盲修复任务上,该方法达到 R-Recovery 0.463、RFS 0.626、U-Fidelity 0.968,在修复质量与内容保留之间取得平衡。论文已提交 IEEE ICASSP 2027。

  15. arXiv · Computation and Language60

    语言模型 sycophantic agreement 的机制追溯

    该研究使用因果中介分析识别语言模型 sycophantic agreement 的机制:观点在最后一个 prompt token 的残差流中被早期整合,并通过一组稀疏的早期注意力头传递;消融这些头可显著降低奉承性同意,同时基本保持事实准确性。当观点通过无内容的 pushback(如

    推荐理由:论文用因果中介分析定位了奉承性同意的机制,为更精准的对齐干预提供了可验证的切入点。

  16. arXiv · Audio and Speech38

    EmoRES-TTS:残差增强向量引导的情感语音生成方法

    EmoRES-TTS 提出残差增强向量引导方法,将情感向量分解为共享分量与残差分量,在不微调主干的前提下分别控制。在 IEMOCAP 上,EmoRES 在 IndexTTS-2 和 CosyVoice2 上均超越 CoCoEmo,秩相关相对提升最高 118.8%,情感命中率相对提升最高 20.1%,人类评估中主导情感识别率相对提升最高 35.0%,自然度偏好达 63.8%。代码已发布。

  17. arXiv · Neural and Evolutionary Computing15

    谐振模式动态多样性:面向可重构纳米机械系统的储层计算

    研究在单个 NEMS 谐振器中利用两个相互作用模式,通过不同模态驱动幅度分配回放相同输入序列,并将响应拼接为单一特征矩阵。在 NARMA-2 上,相比单模式运行将方差归一化测试误差降低超过 28 倍,相比最优双模式设置降低超过 3 倍;线性记忆容量测量显示可回忆跨度仅少数符号,随延迟快速衰减。复用 NEMS 特征在非线性映射任务上的误差显著低于电气馈通特征。

  18. arXiv · Artificial Intelligence38

    SMat-Attention:结构化长上下文序列建模

    SMat-Attention 通过引入具有结构化长程路由的因果掩码族,将 VC 维数 d 作为控制访问模式复杂度、预填充成本和解码内存的显式旋钮。d=1 恢复标准因果掩码,增大 d 允许更丰富的子集路由模式;硬路由构造的预填充复杂度为 O(T^{2-3/d}+T),固定时间窗流式解码每 token 使用 O(T^{1-1/d}) 缓存状态实现常数时间。

  19. arXiv · Computer Vision35

    MATE:通过互对抗自训练与演化数据提升统一多模态模型

    MATE 是一种基于强化学习的统一多模态模型后训练框架,让生成与理解分支轮流担任挑战者与求解者,挑战来自模型自身输出且随训练演化。在 Janus-Pro-1B 上,MATE 将 GenEval 提升 2.4 点、DPG-Bench 提升 1.7 点、九项理解基准平均提升 0.7 点,并增强图像-文本循环一致性。

  20. arXiv · Machine Learning32

    道路交通事故预测中的复现失败与平凡基线

    研究复现了不确定性感知图神经网络在伦敦三区道路事故预测中的11项设计决策,仅4项在第二区复现成功,7项失败且4项符号反转。多种子评估显示参考架构在各区种子波动高达35.7点。在匹配历史深度下,所提模型与按累计历史事故数排序的无参数基线统计不可区分(-0.90点,p=0.61),而参考架构在18个保留窗口中全部败于基线(-17.37点,p<10⁻⁶)。

  21. arXiv · Computation and Language67

    灾害社交感知还可信吗?检测 AI 生成灾害推文的实证证据

    研究构建了 12,000 条文本数据集,涵盖 9 起灾害中人类原文、LLM 润色人类文、事实型 AI 生成文和情感型 AI 生成文,并测试 OSM-Det、Fast-DetectGPT、Binoculars 与 LLM 法官。

    推荐理由:研究提供了实证证据,说明当前文本 AI 检测器在灾害推文中可靠性不足,读者可据此重新评估仅依赖文本检测来保障灾害信息可信度的做法。

  22. arXiv · Machine Learning64

    StepLearn:LLM 智能体的非参数测试时学习框架

    论文提出 StepLearn,将单步迁移作为假设即时用于下一步,再经跨轮次验证后才持久复用,在 WebArena-Lite 和 ALFWorld 上相对 EvoTest 提升 2.2–12.7 个百分点。

    推荐理由:提出了即时使用与跨轮次信任分离的非参数框架,在两个基准上相对最强基线提升最高12.7个百分点。

  23. arXiv · Audio and Speech22

    Zephyr:基于稀疏感知柔性 FPGA PE 阵列的高效音频降噪脉冲神经网络系统

    Zephyr 将 SOTA 音频降噪网络 Spiking-FullSubNet 转换为硬件友好版本,通过 QAT 与激活函数简化实现约 28× 功耗下降至 52.9nJ/32ms 音频帧,并在 PYNQ-Z1 FPGA 上以 100MHz 实现 0.727 实时因子。系统采用稀疏感知柔性 PE 阵列处理异构计算负载,面向手机、无线耳机与助听器等边缘设备低功耗推理。

  24. arXiv · Neural and Evolutionary Computing22

    Dropout Universality: Scaling Laws and Optimal Scheduling at the Edge-of-Chaos

    论文提出均值场理论分析 dropout 在混沌边缘的行为,识别平滑与折角激活的普适类及对应标度指数,并推导出最大化正则化效果时 dropout 应集中于输入层。实验在视觉、语音和金融时间序列上验证,MLP 增益最一致,Transformer 增益较小。论文已被 ICML 2026 接收。

  25. arXiv · Computer Vision31

    LeRF:学习参考坐标系以实现视角推理

    LeRF 训练视觉语言模型构建并使用显式参考坐标系进行视角依赖推理,判断是否需要坐标系、定位参考实体并预测原点与实体中心坐标系,再通过轻量渲染器叠加到图像上供后续推理。研究采用监督微调与强化学习,在多个视角推理基准上超越基座模型与现有开源方法,同时提升坐标系定位与朝向估计效果。