Skip to content

#arXiv

152 today
TodayOct 7Wed
  1. arXiv · Databases24

    Crane:用于图流摘要的精确可扩展神经 sketch

    研究者提出 Crane,一种用于图流摘要的层级神经 sketch 架构,针对有限内存下高频项遮蔽低频项的问题。Crane 采用层级进位机制将高频项自动提升到更高内存层,并在顶层占用超过阈值时动态扩展新层。实验显示其相比 SOTA 方法显著降低估计误差,同时具备有竞争力的吞吐量。

  2. arXiv · Neural and Evolutionary Computing17

    BrainScaleS 晶圆级神经形态系统的突触损耗估算

    论文提出一种估算 BrainScaleS 晶圆级神经形态系统突触损耗的方法,基于概率分布与硬件突触路由架构,先估算无损耗的最大网络规模,再预测更密集或更大网络模型的损耗。研究者将预测结果与映射软件实际运行结果对比,显示了 BrainScaleS 系统的能力与局限,并指出当前映射算法的不足。该方法可用于映射参数优化、映射软件基准测试和新硬件设计空间探索。

  3. arXiv · Neural and Evolutionary Computing34

    ReGraph:解释“what”与“where”双视觉通路中涌现泛化的计算模型

    研究者提出 ReGraph,一个带生物学归纳偏置的循环双通路图模型,包含视网膜驱动的通路特化编码、背侧到腹侧调制和动态侧向连接。在 Something-Something V2 动作基准上,上下文不变编码与网格状空间基沿扩展背侧通路共同涌现,单通路、无调制变体和标准基线中则缺失。后验分析显示这些网格状基可作为侧向连接的信息处理复用路由模板,表明泛化在层级视觉处理的通路分化阶段即已成形。

  4. arXiv · Neural and Evolutionary Computing25

    共模误差限制低时间步深度脉冲 Q 网络

    研究者提出 CMC-DSQN,用辅助 ANN 补偿 SNN 输出中的共模误差,以缓解低时间步 DSQN 的性能退化。在 Atari 与 MiniAtar 环境中,CMC-DSQN 在 T=2 时较 SOTA DSQN 基线提升近 20%,在 T=4 时进一步超过 ANN 基线。推理时可直接由 SNN 输出做贪心动作选择,辅助 ANN 可完全移除,保留 SNN 的能效优势。

  5. arXiv · Machine Learning Theory28

    FlexiFlow:基于多臂赌博机的 ML 工作流模型切换

    FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换至备选模型。它采用新型多臂赌博机方法对模型排序,综合考虑模型运行时间、通过用户自定义断言的机率以及 ML 工作流的计算结构。实验显示,运行时切换模型并复用中间结果,可将工作流准确率最高提升 23%,相比顺序运行获得 48% 效率增益。

  6. arXiv · Machine Learning Theory30

    神经场编码适应几何

    论文提出用适应几何评估神经场,除重建质量外,还衡量网络拟合新观测的难易与权重对历史观测的保留程度。图像实验显示局部线性模型可预测适应成本,替换切线核会显著降低预测精度;物理场实验中,同一网络反复拟合序列后,权重能以 68.6% 准确率恢复波速符号,而仅看当前观测只有 50%。切线核特征值同时预测哪些变化易学、以及多快被后续拟合覆盖。

  7. arXiv · Machine Learning Theory41

    从人类研究决策轨迹中学习科学探索

    研究提出 ResearchTrails 数据集,用 Git 仓库的 commit 历史作为人类研究探索的代理,并构建自动化可扩展流水线,从仓库提交中提取结构化研究轨迹,捕捉方法、实验与消融的连续变化。论文表明这些轨迹包含超越最终论文的中间决策信号,可用于测试时检索人类研究经验作为外部技能,以及在研究轨迹上训练模型以提升对新研究决策的泛化。

  8. arXiv · Machine Learning Theory27

    LiLib:基于漂移触发模型库的无人机终身空地路径损耗预测

    LiLib 是一种面向无人机的轻量持续学习方案,用窗口残差检测漂移并维护一个递归最小二乘专家库,复用或新建专家以应对空地路径损耗变化。仿真中,LiLib 将预测 RMSE 从 5.89 dB 降至 4.03 dB,重返已知环境后的误差从 12.3 dB 降至 5.7 dB,速率适配恢复至 regime-aware oracle 吞吐的 99%。

  9. arXiv · Machine Learning Theory29

    SchemaFill:用槽位并行投机解码提升 LLM 工具调用效率

    SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。

  10. arXiv · Machine Learning Theory41

    TRIAGE:面向原生 NVFP4 强化学习的方向感知失配稳定方法

    论文提出 TRIAGE,一种方向感知稳定方法,用分段诊断选择性再平衡策略梯度更新,并对残余严重失配施加有界修复,同时保留采样器与学习器的原生 NVFP4 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,TRIAGE 在五个数学推理基准达到全精度水平性能,原生 NVFP4 加 TRIAGE 的 rollout 吞吐较 BF16 最高提升 2.3x。

  11. arXiv · Machine Learning Theory25

    Sculpt:用于运动学可容许城市风预测的嵌套势函数框架

    论文提出 Sculpt,一种嵌套势函数框架,把无散度与壁面不可穿透约束直接嵌入参数化,在三维交错网格上通过体积向量势的离散旋度生成无散度速度更新,并用共享标量势约束边界、无需逐步压力投影。为评估精度与运动学可容许性,作者发布 UrbanWindFlow 数据集,覆盖多种城市形态与来流条件。

  12. arXiv · Machine Learning Theory33

    DART-ES:面向进化策略微调 LLM 的难度感知重加权与定向回放

    提出 DART-ES,用难度感知重加权与定向回放改进进化策略(ES)对 LLM 的全参数微调,仅靠前向计算即可训练。DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。

  13. arXiv · Machine Learning Theory47

    Learning to Decide, Not to Reason:基于低秩激活引导的参数高效决策算子

    论文提出 \method{},一种通过行为克隆训练的 System-1 决策算子,将注入技能的成本降低约两个数量级。默认算子仅用 330K 参数即可匹配 1.33M 参数的强化学习算子,并把 3,685 token 的推演压缩为 6 token 决策且精度无损;rank-4 变体仅 23K 参数,为最强已发表技能算子的 1/58。

  14. arXiv · Machine Learning Theory21

    Learning to Remember:为紧凑型循环神经网络蒸馏记忆保持能力

    一篇 arXiv 预印本提出 Memory-Discrepancy Knowledge Distillation(MemKD)框架,用专门损失函数捕捉教师与学生模型在时间序列子序列间的记忆保持差异。实验显示 MemKD 显著优于现有 KD 方法,并可在多种压缩级别下匹配教师模型性能,大幅减少参数量与内存占用且不明显损失精度。

  15. arXiv · Machine Learning Theory28

    QiYao-I:面向不规则多元时间序列预测的流形基础模型

    研究者提出 QiYao-I,一种面向不规则多元时间序列预测的流形基础模型,用于处理观测采样不规则、跨变量异步记录的问题。模型引入采样条件化的时序流形注意力机制,将真实时间戳映射到可学习的时序流形特征空间,并在注意力层注入时序流形偏置,同时提出带频率感知能力的动态变量交互机制。

  16. arXiv · Machine Learning Theory37

    AttSVD:基于注意力引导 SVD 的提示自适应低秩 KV Cache 压缩

    AttSVD 是一种免训练的 KV Cache 压缩方法,按每个提示词的注意力几何做在线截断 SVD,保留注意力实际读取的方向,按保留秩比例降低每头 KV 内存。提出累积与流式两种解码时缓存策略,并以逐矩阵能量规则和注意力感知基截断做自适应压缩。在多个模型、agentic benchmark 与完整 LongBench 上与稠密缓存持平,KV 内存最多节省 50%。

  17. arXiv · Software Engineering26

    ZonoGPT:面向大型 GPT 模型验证的抽象域

    ZonoGPT 是一种用于验证大型 Transformer 的抽象域,空间复杂度与网络深度无关。它用结构化 zonotope 与生成器缩减机制保留相关性,并为 Attention、LayerNorm 和 GELU 设计保精度变换。该方法可验证官方 HuggingFace 模型至 GPT-2 Medium(24 blocks、300M+ 参数),并在文本与视觉任务上成功验证 1,339 个实例。

  18. arXiv · Software Engineering43

    ReLoop:用结构化建模与行为验证提升 LLM 优化代码可靠性

    ReLoop 提出结构化生成与行为验证两种机制,缓解 LLM 生成的优化代码“可执行但语义错误”的问题,在组合问题上该可行性-正确性差距可达 90 个百分点。结构化生成在 RetailOpt-190 上为 Claude Opus 4.6 带来 +8.5pp 准确率,行为验证在 MAMO-ComplexLP 上提升 +4.4pp,并借助诊断执行恢复实现 100% 可执行代码。

  19. arXiv · Software Engineering43

    工具出错时:数学智能体在受损工具反馈下的可靠性研究

    研究通过受控损坏框架评估数学智能体能否检测并纠正被篡改的工具调用结果,覆盖 31 道题、四种验证设计。无验证时准确率从 100% 降至 72.4%,强制同上下文反思可完全恢复到 100%;可选验证仅在模型主动调用时提升准确率。重启实验显示显式检测后完整重启成功率为 100%,论文已被 NeurIPS 2026 第 6 届数学推理与 AI 工作坊接收。

  20. arXiv · Software Engineering44

    旧事实重现时的重读、回退与时序记忆局限

    身份型时序记忆在常规转换中达到 98.5% 模型判定准确率,但追加旧语句的逐字重读后准确率降至 10.8%、陈旧值率升至 88.5%。拒绝重新激活已退役值的防护机制将准确率恢复到 97.7%、陈旧值率降至 0.8%,却无法在缺少变更来源信息时识别合法回退。研究基于 130 个提取器选取的软件修复原子转换,另有 707 个软件修复的探索性提取研究提供范围背景。

  21. arXiv · Software Engineering38

    面向规范驱动开发的 EPIC 框架

    研究者提出面向规范驱动开发(SDD)的 EPIC 框架,含 10 个质量维度共 40 项实践,指导开发者在使用 coding agent 前把期望与决策写进规范、计划和任务。研究以 ISO/IEC/IEEE 29148 为标准评估 114 个开源 SDD 仓库,15 名从业者认可全部实践;规范质量前三分之一的仓库 bug 修复提交占 11.8%,低于后三分之一 20.4%,贡献者中位数多 4 倍。

  22. arXiv · Information Retrieval25

    LLM 时代还需要地名词典吗?用空间神经符号索引链接检索

    论文评估了五种冻结文本编码器在空间语义索引任务上的表现,比较暴力最近邻检索与受地名词典层级约束的神经符号分层束搜索两种策略。结果显示无约束稠密检索常出现严重空间错误,层级约束可改善粗粒度地理定位,但对细粒度定位指标收益有限,文本编码器难以复现地名词典编码的精细空间保真度。代码已公开,论文被 ACM SIGSPATIAL '26 接收。

  23. arXiv · Information Retrieval25

    KadiAssistant:面向 Kadi4Mat 信息检索的对话式 AI 智能体

    KadiAssistant 是集成进 Kadi 研究数据生态的隐私优先 AI 助手,帮助研究者高效访问、聚合与综合异构且敏感的研究数据。它将自托管 LLM 与受 RAG 启发的隐私保护语义搜索结合,可读取 Kadi 上的文件与记录元数据,并遵循细粒度访问权限。该方案跨学科术语与标准搭建桥梁、降低研究者的访问门槛,并强化 FAIR 数据原则中的可发现性。

  24. arXiv · Information Retrieval40

    UNREAL:用单一模型统一检索与长上下文

    UNREAL 提出模型原生证据选择框架,直接从冻结 LLM 的内部表征编码 chunk 并生成检索查询,新增参数不足 500K,主干模型保持不变。在 3B token、2100 万 chunk 的 Wikipedia 索引上,四种 dense 与 hybrid 骨干均超越 SOTA 检索-重排系统,HotpotQA 召回率从 49.1% 升至 73.2%。