Crane:用于图流摘要的精确可扩展神经 sketch
研究者提出 Crane,一种用于图流摘要的层级神经 sketch 架构,针对有限内存下高频项遮蔽低频项的问题。Crane 采用层级进位机制将高频项自动提升到更高内存层,并在顶层占用超过阈值时动态扩展新层。实验显示其相比 SOTA 方法显著降低估计误差,同时具备有竞争力的吞吐量。
研究者提出 Crane,一种用于图流摘要的层级神经 sketch 架构,针对有限内存下高频项遮蔽低频项的问题。Crane 采用层级进位机制将高频项自动提升到更高内存层,并在顶层占用超过阈值时动态扩展新层。实验显示其相比 SOTA 方法显著降低估计误差,同时具备有竞争力的吞吐量。
研究者提出 ConnectomeX 框架及可训练架构 FlyVision,保留生物视觉的 ON/OFF 并行处理、循环计算与群体图交互。FlyVision 以 80,608 参数在 MNIST 达 99.34% 准确率,ImageNet-1K 上 Large 模型以 3.7M 参数达 66.25% top-1;22 类皮肤病基准达 95.28% macro-AUROC。
论文提出一种估算 BrainScaleS 晶圆级神经形态系统突触损耗的方法,基于概率分布与硬件突触路由架构,先估算无损耗的最大网络规模,再预测更密集或更大网络模型的损耗。研究者将预测结果与映射软件实际运行结果对比,显示了 BrainScaleS 系统的能力与局限,并指出当前映射算法的不足。该方法可用于映射参数优化、映射软件基准测试和新硬件设计空间探索。
研究者提出 ReGraph,一个带生物学归纳偏置的循环双通路图模型,包含视网膜驱动的通路特化编码、背侧到腹侧调制和动态侧向连接。在 Something-Something V2 动作基准上,上下文不变编码与网格状空间基沿扩展背侧通路共同涌现,单通路、无调制变体和标准基线中则缺失。后验分析显示这些网格状基可作为侧向连接的信息处理复用路由模板,表明泛化在层级视觉处理的通路分化阶段即已成形。
研究者提出 CMC-DSQN,用辅助 ANN 补偿 SNN 输出中的共模误差,以缓解低时间步 DSQN 的性能退化。在 Atari 与 MiniAtar 环境中,CMC-DSQN 在 T=2 时较 SOTA DSQN 基线提升近 20%,在 T=4 时进一步超过 ANN 基线。推理时可直接由 SNN 输出做贪心动作选择,辅助 ANN 可完全移除,保留 SNN 的能效优势。
FlexiFlow 是一个数据流系统,能在当前模型准确率偏低时动态切换至备选模型。它采用新型多臂赌博机方法对模型排序,综合考虑模型运行时间、通过用户自定义断言的机率以及 ML 工作流的计算结构。实验显示,运行时切换模型并复用中间结果,可将工作流准确率最高提升 23%,相比顺序运行获得 48% 效率增益。
论文提出用适应几何评估神经场,除重建质量外,还衡量网络拟合新观测的难易与权重对历史观测的保留程度。图像实验显示局部线性模型可预测适应成本,替换切线核会显著降低预测精度;物理场实验中,同一网络反复拟合序列后,权重能以 68.6% 准确率恢复波速符号,而仅看当前观测只有 50%。切线核特征值同时预测哪些变化易学、以及多快被后续拟合覆盖。
论文提出 Minimal-Witness Reinforcement Learning(MWRL),把“找出所有最小充分见证”形式化为可学习问题:取策略采样成功提案所认证集合的并集,并按去掉该提案后群体并集损失的覆盖量进行归因。
研究提出 ResearchTrails 数据集,用 Git 仓库的 commit 历史作为人类研究探索的代理,并构建自动化可扩展流水线,从仓库提交中提取结构化研究轨迹,捕捉方法、实验与消融的连续变化。论文表明这些轨迹包含超越最终论文的中间决策信号,可用于测试时检索人类研究经验作为外部技能,以及在研究轨迹上训练模型以提升对新研究决策的泛化。
论文提出 WRAP(Wasserstein-Reweighting Adversarial Perturbation),一种源自双预算分布鲁棒优化(DRO)的漂移感知对抗训练框架,用于改进深度对冲策略。
SoloQ 是一种面向扩散大语言模型(dLLM)的免校准量化框架,通过将权重与激活映射到归一化旋转基实现数据无关量化,并结合结构化 K-RPBH 旋转与轻量重缩放校正。
LiLib 是一种面向无人机的轻量持续学习方案,用窗口残差检测漂移并维护一个递归最小二乘专家库,复用或新建专家以应对空地路径损耗变化。仿真中,LiLib 将预测 RMSE 从 5.89 dB 降至 4.03 dB,重返已知环境后的误差从 12.3 dB 降至 5.7 dB,速率适配恢复至 regime-aware oracle 吞吐的 99%。
SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。
论文提出 TRIAGE,一种方向感知稳定方法,用分段诊断选择性再平衡策略梯度更新,并对残余严重失配施加有界修复,同时保留采样器与学习器的原生 NVFP4 W4A4 前向执行。在 Qwen3-4B 与 Qwen3-30B-A3B 上,TRIAGE 在五个数学推理基准达到全精度水平性能,原生 NVFP4 加 TRIAGE 的 rollout 吞吐较 BF16 最高提升 2.3x。
论文提出 Sculpt,一种嵌套势函数框架,把无散度与壁面不可穿透约束直接嵌入参数化,在三维交错网格上通过体积向量势的离散旋度生成无散度速度更新,并用共享标量势约束边界、无需逐步压力投影。为评估精度与运动学可容许性,作者发布 UrbanWindFlow 数据集,覆盖多种城市形态与来流条件。
研究提出 Contrastive Diffusion Alignment(ConDA),在冻结的预训练扩散模型之上仅学习轻量对齐映射,借助辅助变量非线性 ICA 保证潜坐标可识别。
研究者提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器块中 Self-Attention 与 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合,使解码器获得多层信息。
提出 DART-ES,用难度感知重加权与定向回放改进进化策略(ES)对 LLM 的全参数微调,仅靠前向计算即可训练。DART-ES 在五个基座模型上均优于 ES,平均准确率从 72.07% 提升至 73.53%,超过 GRPO 在 GSM8K 上的 73.26%;在五个数学推理基准上平均准确率为 49.20%,高于 ES 的 48.34%。
论文提出 \method{},一种通过行为克隆训练的 System-1 决策算子,将注入技能的成本降低约两个数量级。默认算子仅用 330K 参数即可匹配 1.33M 参数的强化学习算子,并把 3,685 token 的推演压缩为 6 token 决策且精度无损;rank-4 变体仅 23K 参数,为最强已发表技能算子的 1/58。
一篇 arXiv 预印本提出 Memory-Discrepancy Knowledge Distillation(MemKD)框架,用专门损失函数捕捉教师与学生模型在时间序列子序列间的记忆保持差异。实验显示 MemKD 显著优于现有 KD 方法,并可在多种压缩级别下匹配教师模型性能,大幅减少参数量与内存占用且不明显损失精度。
研究者提出 QiYao-I,一种面向不规则多元时间序列预测的流形基础模型,用于处理观测采样不规则、跨变量异步记录的问题。模型引入采样条件化的时序流形注意力机制,将真实时间戳映射到可学习的时序流形特征空间,并在注意力层注入时序流形偏置,同时提出带频率感知能力的动态变量交互机制。
AttSVD 是一种免训练的 KV Cache 压缩方法,按每个提示词的注意力几何做在线截断 SVD,保留注意力实际读取的方向,按保留秩比例降低每头 KV 内存。提出累积与流式两种解码时缓存策略,并以逐矩阵能量规则和注意力感知基截断做自适应压缩。在多个模型、agentic benchmark 与完整 LongBench 上与稠密缓存持平,KV 内存最多节省 50%。
该论文提出预算化自适应神经算子求解框架,用全局 Fourier neural operator 推进全场、局部算子提出分块残差修正、集合感知选择器决定细化位置,宏策略决定何时及花费多少剩余预算。
论文提出指导增强 GRPO(GA-GRPO)统一理论框架,把外部指导建模为随机指导算子 G,并将 LUFFY、ExPO、PAPO、TAPO 纳入为特例。
TEMPEST 是一种基于时序卷积网络的嵌入模型,采用 ArcFace 角度间隔损失,将 60 秒多模态驾驶窗口映射为 96 维嵌入,支持无需重训练或重拟合分类器的动态注册。
ZonoGPT 是一种用于验证大型 Transformer 的抽象域,空间复杂度与网络深度无关。它用结构化 zonotope 与生成器缩减机制保留相关性,并为 Attention、LayerNorm 和 GELU 设计保精度变换。该方法可验证官方 HuggingFace 模型至 GPT-2 Medium(24 blocks、300M+ 参数),并在文本与视觉任务上成功验证 1,339 个实例。
研究者提出 CLEAR,一个结合因果知识图谱的多智能体漏洞检测框架,构建漏洞因果知识图谱(VCKG)建模入口点、前置条件、根因与修复意图之间的因果链。框架由 Collector、Claim、Critic、Judge 四个专门智能体协作,通过检索到的因果上下文验证漏洞假设。
研究者提出 Constrained Lagrangian Abstract Domain(CLAD),一种新的神经网络验证抽象域,可对由凸约束组合定义的输入区域计算可靠的上近似。
PBT-Bench 包含 100 个属性测试问题,覆盖 40 个真实 Python 库,共注入 365 个语义 bug(平均每题 3.65 个),按 L1-L3 难度分层。
ReLoop 提出结构化生成与行为验证两种机制,缓解 LLM 生成的优化代码“可执行但语义错误”的问题,在组合问题上该可行性-正确性差距可达 90 个百分点。结构化生成在 RetailOpt-190 上为 Claude Opus 4.6 带来 +8.5pp 准确率,行为验证在 MAMO-ComplexLP 上提升 +4.4pp,并借助诊断执行恢复实现 100% 可执行代码。
研究通过受控损坏框架评估数学智能体能否检测并纠正被篡改的工具调用结果,覆盖 31 道题、四种验证设计。无验证时准确率从 100% 降至 72.4%,强制同上下文反思可完全恢复到 100%;可选验证仅在模型主动调用时提升准确率。重启实验显示显式检测后完整重启成功率为 100%,论文已被 NeurIPS 2026 第 6 届数学推理与 AI 工作坊接收。
FC-SWE 提出失败条件强化学习框架,在补丁验证失败后恢复仓库原始状态,把失败补丁与验证反馈作为上下文生成恢复轨迹,并改造 GRPO 训练策略。
该研究提出 Failure-Driven Prompt Refinement(FDPR),通过分析大语言模型在漏洞分析中的反复失败来指导提示词优化。研究基于 Damn Vulnerable Java Application(DVJA)识别出误报、漏报、推理无依据和 CWE 误分类等失败模式,并在 Juliet Test Suite 上评估与跨模型验证。
研究提出 ES-Trace 框架,用模型文档可追溯性图(MDTG)追踪模型卡之外的伦理来源披露证据,覆盖 10 家发布方的 26 个模型、77 份文档与 20 个 ES-CodeGen 方面。
身份型时序记忆在常规转换中达到 98.5% 模型判定准确率,但追加旧语句的逐字重读后准确率降至 10.8%、陈旧值率升至 88.5%。拒绝重新激活已退役值的防护机制将准确率恢复到 97.7%、陈旧值率降至 0.8%,却无法在缺少变更来源信息时识别合法回退。研究基于 130 个提取器选取的软件修复原子转换,另有 707 个软件修复的探索性提取研究提供范围背景。
研究者提出面向规范驱动开发(SDD)的 EPIC 框架,含 10 个质量维度共 40 项实践,指导开发者在使用 coding agent 前把期望与决策写进规范、计划和任务。研究以 ISO/IEC/IEEE 29148 为标准评估 114 个开源 SDD 仓库,15 名从业者认可全部实践;规范质量前三分之一的仓库 bug 修复提交占 11.8%,低于后三分之一 20.4%,贡献者中位数多 4 倍。
论文提出 CogAdapt,一种基于认知信号的代码模型稀疏微调框架,先从人类 EEG 与注意力数据学习程序级和 token 级先验,再结合冻结模型对具体编程任务的响应,决定分配多少微调量及更新哪些 transformer 块。
论文评估了五种冻结文本编码器在空间语义索引任务上的表现,比较暴力最近邻检索与受地名词典层级约束的神经符号分层束搜索两种策略。结果显示无约束稠密检索常出现严重空间错误,层级约束可改善粗粒度地理定位,但对细粒度定位指标收益有限,文本编码器难以复现地名词典编码的精细空间保真度。代码已公开,论文被 ACM SIGSPATIAL '26 接收。
KadiAssistant 是集成进 Kadi 研究数据生态的隐私优先 AI 助手,帮助研究者高效访问、聚合与综合异构且敏感的研究数据。它将自托管 LLM 与受 RAG 启发的隐私保护语义搜索结合,可读取 Kadi 上的文件与记录元数据,并遵循细粒度访问权限。该方案跨学科术语与标准搭建桥梁、降低研究者的访问门槛,并强化 FAIR 数据原则中的可发现性。
UNREAL 提出模型原生证据选择框架,直接从冻结 LLM 的内部表征编码 chunk 并生成检索查询,新增参数不足 500K,主干模型保持不变。在 3B token、2100 万 chunk 的 Wikipedia 索引上,四种 dense 与 hybrid 骨干均超越 SOTA 检索-重排系统,HotpotQA 召回率从 49.1% 升至 73.2%。