跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Computation and Language73

    Mnemon:原始记录、快速判断、慢速思考

    Mnemon 是基于快慢双系统划分的记忆代理,把对话保留为原始带时间戳记录,由 LLM(System 2)规划检索、决策模型 Jev(System 1)快速判断,并通过显式预算生成小 View 供回答模型使用。

    推荐理由:将记忆系统拆分为快慢两层,用决策模型做快速判断、LLM 做慢速规划,在长历史下成本增长极低。

  2. arXiv · Artificial Intelligence33

    MERID:基于递归自改进智能体的多模态探索用于重度抑郁症分析

    MERID框架通过基于经验的递归自改进(RSI)自动构建抑郁症预测管线,包含Grounded State Construction(GSC)、Coupled Pipeline Exploration(CPE)和Evidence-Guided Evolution(EGE)三个模块。实验在抑郁症基准数据集上取得优于多模态和基于智能体基线的结果,并凸显声学与语言线索对抑郁症检测的价值。代码已开源。

  3. arXiv · Computer Vision33

    Merlin Plus:大规模多癌症CT图像-掩码-报告数据集

    Merlin Plus 是首个覆盖9个器官的大规模CT数据集,包含1,153个体素级肿瘤掩码和纵向元数据。作者基于报告构建主动学习框架,由放射科报告筛选病例、模型生成初始掩码、放射科医生审核修正,降低标注负担同时保持高质量。数据集支持多器官癌症检测、分割与时序进展分析。

  4. arXiv · Computation and Language40

    大语言模型组合任务中的因果与可解释结构

    研究团队分析 Llama、Qwen、Gemma 和 Mistral 在循环概念(月份、小时、星期、音乐音符)提示下的激活表征,发现中间层使用两个 token 的联合表征,后期层使用三个 token 的联合表征来完成下一个 token 预测。几何上结构化但因果上无效的关系也被识别,而限制模型使用因果相关的联合表征反而提升了预测准确率。

  5. arXiv · Machine Learning15

    用于谱优化的神经网络

    论文提出两种神经网络模型,直接从域几何学习微分算子的谱,用于谱优化问题。第一种用 Fourier 系数与轻量 MLP 编码星形域,精度达 0.2%,并通过系数缩放满足特征值缩放律,对旋转和反射平均后获得不变性。

  6. arXiv · Computation and Language34

    Question-Specific Knowledge Graphs for Efficient Visual Reasoning

    summary_zh: VisKG 是一种基于强化学习的视觉推理框架,将图像转化为问题特定的知识图谱表示,在保持链式推理所需实体关系的同时过滤感知噪声。实验显示 VisKG 在科学、数学和通用视觉理解基准上达到与基线相当或更好的性能,同时所需 token 数更少;采用 GDPO 训练相比 GRPO 平均提升 2% 准确率。

  7. arXiv · Robotics25

    一种稳健的单传感元件触觉传感器,可同时检测压力与粘性并实现实时信号解耦

    该研究提出一种基于霍尔效应传感器与软磁复合材料的表面柔软触觉传感器,在稳健弹性框架内实现压力与剥离力的实时区分。单一传感元件在同一接触点实现双模态感知,消除应力串扰,具备优异的信号基线稳定性与可靠性。该传感器在评估粘附性、精确监测橡胶老化、处理轻质物体及认知自然物体表面特性方面具有应用潜力。

  8. arXiv · Computer Vision34

    RA-CFGCache:从分支级准则到分类器自由引导下的引导风险控

    summary_zh: RA-CFGCache 提出一种风险对齐缓存框架,在分类器自由引导(CFG)下同时处理分支误差组合与局部扰动传播问题。实验在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上进行,相比已有无训练缓存基线提升了效率-保真度权衡,且兼容 TeaCache、DiCache、MagCache 等代理族。

  9. arXiv · Computation and Language62

    VoxParity:声音应改变决策时的几乎人类例外

    论文提出 VoxParity 测试语音代理是否因语音线索而改变动作:在 183 个跨 14 行业的场景中保持文本固定、仅改变音频(如指导音、医疗监护音、紧急呼叫。

    推荐理由:同一句话配上不同语音时,多数语音代理仍按文字行事,揭示了声纹线索与规则冲突时的系统性盲区。

  10. arXiv · Artificial Intelligence33

    FigAct:将科学图表转化为可交互画布以进行解释

    FigAct 是一个将静态科学图表转化为问题驱动视觉呈现的框架,通过直接操作图表现有图形元素生成短叙述并施加视觉动作引导观众注意力。该框架采用分层搜索策略将 token 消耗降低约 40×,并使用 grounding accuracy、search efficiency、rendering quality 三项任务特定奖励训练 FigAct-8B。

  11. arXiv · Machine Learning12

    Preferent Compression Bounds Are Tight

    summary_zh: 本文证明偏好压缩界是紧的,通过均匀分布与顺序统计的显式构造在极限下达到该界,并提供仅依赖初等计数论证的更短证明,无需无限维对偶。 本文证明偏好压缩界是紧的,通过均匀分布与顺序统计的显式构造在极限下达到该界,并提供仅依赖初等计数论证的更短证明,无需无限维对偶。

  12. arXiv · Artificial Intelligence40

    Principled Thoughts for Latent Recursive LLM Systems

    REST(REpresentation-Supervised Thoughts)在仅用交叉熵(CE)监督最终解码答案的训练基础上,增加因果性、最小性、可分离性和稳定性四个可微分损失。跨数学、科学、医学和代码生成 7 个基准,相同训练数据、计算量和隐空间预算下,REST 比纯 CE 训练准确率最高提升 7.5 个百分点,收敛速度提升 30%。隐状态思考更易解码和解释,且无需推理时架构改动或额外参数。

  13. arXiv · Robotics22

    面向路径规划的3D场景补全:基于耦合TUDF占用表示学习的部分观测方法

    该研究提出面向路径规划的3D场景补全框架,输入部分LiDAR观测,联合预测TUDF连续几何表示和体素级占用图。双向耦合学习机制让TUDF特征指导占用重建,占用特征反过来优化距离场估计,直接输出完整表示供轨迹规划无缝集成,无需后处理。在未见过的环境实验中,该方法同时提升几何重建质量和下游规划性能。

  14. arXiv · Computer Vision37

    CELLO:基于组织病理学图像的端到端单细胞空间转录组预测框架

    CELLO通过单次病理基础模型前向传播与网格采样,从H&E染色病理图像中同时提取所有细胞的位置特异性特征,并引入距离衰减交叉注意力模块利用空间局部形态上下文细化细胞表征。在52对公共Xenium-H&E数据(约1000万细胞、12个器官)上,CELLO平均预测精度优于基线,整体推理时间较DeepSpot2Cell提速14倍(不含上游细胞分割)。

  15. arXiv · Computation and Language40

    CruxBench:信息发现基准

    CruxBench 评估大语言模型的信息发现能力,通过 Value of Information(VOI)对模型生成的子问题打分。基准包含 293 个目标预测问题,VOI 与模型能力独立度量高度相关(r=0.90)。前沿模型仅略优于随机基线,信息发现仍具挑战。

  16. arXiv · Machine Learning22

    FLIP:让跨洲联邦学习可复现的多应用平台研究

    FLIP(Federated Learning Interoperability Platform)是一个开源多应用平台,通过可组合服务实现联邦学习的训练与评估可复现。研究在英国和泰国两个客户端节点上对合成胸部X光队列进行了联邦微调与联邦评估两个用例验证,证明此类平台能支持国际联邦学习协作并提升可复现性、可审计性和站点治理。论文同时对现有平台做了全面比较,帮助研究者和运维人员选型。

  17. arXiv · Computer Vision22

    高倍率知识迁移的可迁移性研究:全切片成像中的跨分辨率蒸馏分析

    该研究通过分解式分析教师访问、表示损失和模型过剩,探讨跨分辨率蒸馏在全切片成像中的有效性。研究在十个病理队列上进行控制实验,发现提供教师区域均值 alongside 原生低倍率特征可提升下游性能。直接预测的重建误差低于残差预测,但预测特征未能充分表示教师目标的变化,且更好的重建并不一致地改善下游得分。

  18. arXiv · Computation and Language38

    PACT:成对锚定校准微调用于单标记类型决策

    PACT 将对比对数据中的结构转化为四项训练损失,在 324 项留出集上以 84.6% 准确率匹配已发布基线(85.2%),位置偏差降至 9.8%(基线 13.8%),有序字段 MAE 0.232(基线 0.311)。相比仅用交叉熵的对照组,PACT 在两个种子下更准确,种子间波动减半,NLL 降低 26%。代码、数据分割与训练记录已公开。

  19. arXiv · Artificial Intelligence62

    记忆是一种推导:长期智能体中的分布式证据悖论

    论文提出 DerivAudit 框架,审计长期智能体的持久记忆是否真正由交互历史支持。研究发现,仅靠作者提供的引用时近 60% 看似无支持的记忆在扩大证据后可被恢复,但 17-21% 仍无支持,且扩大证据本身会使两个骨干模型上的准入可靠性恶化。

    推荐理由:提出记忆推导审计框架,揭示扩大证据范围虽能恢复部分支持但无法保证准入可靠,对长周期智能体的记忆可信性有直接参考价值。

  20. arXiv · Computation and Language36

    缺失财务数据危机解析:面向 SEC 10-K 提取的生成式 AI 流水线

    研究评估 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B 在 SEC 10-K 文本中提取财务属性的表现,覆盖现金与等价物、短期债务、信贷额度及研发支出四类变量。Qwen-2.5 14B 在现金数据上达 83.33% F1,Llama-3.3 70B 在 R&D 叙事脚注中达 76.92% F1,参数规模与文档复杂度对齐可提升零样本准确率并缓解缺失数据偏差。

  21. arXiv · Artificial Intelligence28

    AdaST:面向时空预测的自适应耦合框架

    AdaST 提出自适应时空预测框架,通过分解-重组范式处理时空耦合结构未知、耦合动态异质和空间建模不足三大挑战。利用异构感知专家因子化输入,角色对齐模块处理各分量,相关性自适应重组器整合预测。实验显著优于现有基线,验证自适应方法必要性,已被 NeurIPS 2026 主会接收。

  22. arXiv · Robotics17

    Trajectory-Level Mode Guidance for Controllable Diffusion-Based Multi-Robot Motion Planning

    论文提出在干净轨迹空间中引入轨迹级模式引导的扩散模型多机器人运动规划方法,通过随时间步递减的引导强度逐步注入部分轨迹先验,在早期阶段引导生成、后期释放约束以保留扩散模型的多模态特性。框架通过梯度优化融入规划代价,并扩展至多机器人场景加入碰撞代价,在单机器人与多机器人任务上实现可控轨迹合成与安全多智能体协调。

  23. arXiv · Audio and Speech33

    音视频语音处理的高效方法:MUTUD 多模态训练与单模态部署框架

    论文提出 MUTUD 框架,在训练阶段使用音视频多模态数据,推理阶段仅用单一模态,通过 TAME 模块估计缺失模态信息。该方法在多种音视频语音任务上缩小了多模态与单模态模型的性能差距,同时减少模型规模和计算量,部分场景降低近 80%。相关成果已发表于 TMLR,arXiv 版本为 2501.18157v2。

  24. arXiv · Computation and Language50

    语言模型幻觉检测中的可检测性缺口:隐藏异质性

    研究发现基于采样一致性的幻觉检测存在可检测性缺口,高一致(Ghost)与低一致(Flickering)幻觉之间的 AUC 差距为 0.35 到 0.46。冻结 regime 分配后,词汇与语义响应离散度在全部 12 个模型与数据集设置中保持不对称,bootstrap 95% 置信区间不包含零。

  25. arXiv · Artificial Intelligence38

    VLA 隐接口层选择之谜:信息论分析

    VLA 策略通过单一层选择与多层融合连接视觉语言骨干与动作头,但融合优势有限,47/54 配置不如最佳单层策略。InfoNCE 作为动作条件信息瓶颈目标,与策略成功率关联最稳定,以最高 InfoNCE 分数选层可减少 9-33 倍 GPU 计算,将平均选择遗憾从 17.89 降至 3.71 个百分点。