Mnemon:原始记录、快速判断、慢速思考
Mnemon 是基于快慢双系统划分的记忆代理,把对话保留为原始带时间戳记录,由 LLM(System 2)规划检索、决策模型 Jev(System 1)快速判断,并通过显式预算生成小 View 供回答模型使用。
推荐理由:将记忆系统拆分为快慢两层,用决策模型做快速判断、LLM 做慢速规划,在长历史下成本增长极低。
Mnemon 是基于快慢双系统划分的记忆代理,把对话保留为原始带时间戳记录,由 LLM(System 2)规划检索、决策模型 Jev(System 1)快速判断,并通过显式预算生成小 View 供回答模型使用。
推荐理由:将记忆系统拆分为快慢两层,用决策模型做快速判断、LLM 做慢速规划,在长历史下成本增长极低。
EquivDP3 为 Unitree G1 人形机器人(43 关节)提出两阶段策略:高层扩散规划器以 SIM(3)-等变 VNN 编码器输出 6 Hz 全身指令,由预训练 RL 移动策略和差分逆运动学模块以 50 Hz 执行。
MERID框架通过基于经验的递归自改进(RSI)自动构建抑郁症预测管线,包含Grounded State Construction(GSC)、Coupled Pipeline Exploration(CPE)和Evidence-Guided Evolution(EGE)三个模块。实验在抑郁症基准数据集上取得优于多模态和基于智能体基线的结果,并凸显声学与语言线索对抑郁症检测的价值。代码已开源。
Merlin Plus 是首个覆盖9个器官的大规模CT数据集,包含1,153个体素级肿瘤掩码和纵向元数据。作者基于报告构建主动学习框架,由放射科报告筛选病例、模型生成初始掩码、放射科医生审核修正,降低标注负担同时保持高质量。数据集支持多器官癌症检测、分割与时序进展分析。
研究团队分析 Llama、Qwen、Gemma 和 Mistral 在循环概念(月份、小时、星期、音乐音符)提示下的激活表征,发现中间层使用两个 token 的联合表征,后期层使用三个 token 的联合表征来完成下一个 token 预测。几何上结构化但因果上无效的关系也被识别,而限制模型使用因果相关的联合表征反而提升了预测准确率。
论文提出两种神经网络模型,直接从域几何学习微分算子的谱,用于谱优化问题。第一种用 Fourier 系数与轻量 MLP 编码星形域,精度达 0.2%,并通过系数缩放满足特征值缩放律,对旋转和反射平均后获得不变性。
summary_zh: 该工作提出一种无需坐标投影的 splat 回归模型,结合包裹高斯分布的 splat 在任意黎曼流形上学习到达时间场。研究在多个黎曼流形上验证了该方法,并与针对每个流形单独适配的多层感知机进行了准确率和模型规模对比。
论文首次对 12 款主流 EU AI Act 合规检查器(AIACC)进行实证评估,发现其质量差异显著,目前仅能作为早期导向工具。现有检查器存在交互模式不一致、过度简化关键义务、无法提供确定性可执行指导等问题,可能导致用户产生虚假合规感。
summary_zh: VisKG 是一种基于强化学习的视觉推理框架,将图像转化为问题特定的知识图谱表示,在保持链式推理所需实体关系的同时过滤感知噪声。实验显示 VisKG 在科学、数学和通用视觉理解基准上达到与基线相当或更好的性能,同时所需 token 数更少;采用 GDPO 训练相比 GRPO 平均提升 2% 准确率。
该研究提出一种基于霍尔效应传感器与软磁复合材料的表面柔软触觉传感器,在稳健弹性框架内实现压力与剥离力的实时区分。单一传感元件在同一接触点实现双模态感知,消除应力串扰,具备优异的信号基线稳定性与可靠性。该传感器在评估粘附性、精确监测橡胶老化、处理轻质物体及认知自然物体表面特性方面具有应用潜力。
summary_zh: RA-CFGCache 提出一种风险对齐缓存框架,在分类器自由引导(CFG)下同时处理分支误差组合与局部扰动传播问题。实验在 FLUX.1-dev、Wan2.1-T2V-1.3B 和 CogVideoX-2B 上进行,相比已有无训练缓存基线提升了效率-保真度权衡,且兼容 TeaCache、DiCache、MagCache 等代理族。
summary_zh: TORQUE 在固定比特预算下联合优化旋转前后保留的高精度坐标数量与具体坐标,通过 top-k 前旋转保留最小化量化误差上界,并利用离线 codebook 实现并行参数选择。
论文提出 VoxParity 测试语音代理是否因语音线索而改变动作:在 183 个跨 14 行业的场景中保持文本固定、仅改变音频(如指导音、医疗监护音、紧急呼叫。
推荐理由:同一句话配上不同语音时,多数语音代理仍按文字行事,揭示了声纹线索与规则冲突时的系统性盲区。
FigAct 是一个将静态科学图表转化为问题驱动视觉呈现的框架,通过直接操作图表现有图形元素生成短叙述并施加视觉动作引导观众注意力。该框架采用分层搜索策略将 token 消耗降低约 40×,并使用 grounding accuracy、search efficiency、rendering quality 三项任务特定奖励训练 FigAct-8B。
该研究提出通过 amortize action selection 进训练,让策略主动探索 articulated object 的隐藏运动学参数。方法用生成先验初始化关节类型与参数的 belief 分布,再用贝叶斯滤波更新,并以 per-point articulation flow field 条件化策略;训练时用 RL 奖励每次交互从后验中移除的熵。
TempLoc 通过全局坐标估计、帧间注意力对应与不确定性引导融合,提升户外 LiDAR 重定位的时序一致性。在 NCLT 和 Oxford RobotCar 上显著优于现有方法。
summary_zh: 本文证明偏好压缩界是紧的,通过均匀分布与顺序统计的显式构造在极限下达到该界,并提供仅依赖初等计数论证的更短证明,无需无限维对偶。 本文证明偏好压缩界是紧的,通过均匀分布与顺序统计的显式构造在极限下达到该界,并提供仅依赖初等计数论证的更短证明,无需无限维对偶。
REST(REpresentation-Supervised Thoughts)在仅用交叉熵(CE)监督最终解码答案的训练基础上,增加因果性、最小性、可分离性和稳定性四个可微分损失。跨数学、科学、医学和代码生成 7 个基准,相同训练数据、计算量和隐空间预算下,REST 比纯 CE 训练准确率最高提升 7.5 个百分点,收敛速度提升 30%。隐状态思考更易解码和解释,且无需推理时架构改动或额外参数。
该研究提出面向路径规划的3D场景补全框架,输入部分LiDAR观测,联合预测TUDF连续几何表示和体素级占用图。双向耦合学习机制让TUDF特征指导占用重建,占用特征反过来优化距离场估计,直接输出完整表示供轨迹规划无缝集成,无需后处理。在未见过的环境实验中,该方法同时提升几何重建质量和下游规划性能。
CELLO通过单次病理基础模型前向传播与网格采样,从H&E染色病理图像中同时提取所有细胞的位置特异性特征,并引入距离衰减交叉注意力模块利用空间局部形态上下文细化细胞表征。在52对公共Xenium-H&E数据(约1000万细胞、12个器官)上,CELLO平均预测精度优于基线,整体推理时间较DeepSpot2Cell提速14倍(不含上游细胞分割)。
CruxBench 评估大语言模型的信息发现能力,通过 Value of Information(VOI)对模型生成的子问题打分。基准包含 293 个目标预测问题,VOI 与模型能力独立度量高度相关(r=0.90)。前沿模型仅略优于随机基线,信息发现仍具挑战。
FLIP(Federated Learning Interoperability Platform)是一个开源多应用平台,通过可组合服务实现联邦学习的训练与评估可复现。研究在英国和泰国两个客户端节点上对合成胸部X光队列进行了联邦微调与联邦评估两个用例验证,证明此类平台能支持国际联邦学习协作并提升可复现性、可审计性和站点治理。论文同时对现有平台做了全面比较,帮助研究者和运维人员选型。
该研究通过分解式分析教师访问、表示损失和模型过剩,探讨跨分辨率蒸馏在全切片成像中的有效性。研究在十个病理队列上进行控制实验,发现提供教师区域均值 alongside 原生低倍率特征可提升下游性能。直接预测的重建误差低于残差预测,但预测特征未能充分表示教师目标的变化,且更好的重建并不一致地改善下游得分。
Jev 作为固定通用概率决策模型,在 WISDM、UCI341 和 PAMAP2 三个数据集上对 1,800 个加速度计窗口进行评估,macro-F1 分别仅为 0.038、0.118 和 0.089,远低于监督模型的 0.686–0.907。
针对 VLA 模型异步执行导致动作分布偏移、限制实时响应的问题,本文提出两种互补机制:Recursive Flow-Field Distillation 利用 VLA 动作生成流训练异步策略,Propose-Resolve 异步生成多条动作序列并基于 VLA 分布似然近似选择最优。
PACT 将对比对数据中的结构转化为四项训练损失,在 324 项留出集上以 84.6% 准确率匹配已发布基线(85.2%),位置偏差降至 9.8%(基线 13.8%),有序字段 MAE 0.232(基线 0.311)。相比仅用交叉熵的对照组,PACT 在两个种子下更准确,种子间波动减半,NLL 降低 26%。代码、数据分割与训练记录已公开。
ROSS 在强化学习与在线蒸馏生成的历史回放中保留完整轨迹,仅对选定的模型生成续接部分施加损失。在 Qwen3.6-35B-A3B 上,六项基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%,无需额外策略回放即可通过离线 SFT 复用行为经验。
论文提出 DerivAudit 框架,审计长期智能体的持久记忆是否真正由交互历史支持。研究发现,仅靠作者提供的引用时近 60% 看似无支持的记忆在扩大证据后可被恢复,但 17-21% 仍无支持,且扩大证据本身会使两个骨干模型上的准入可靠性恶化。
推荐理由:提出记忆推导审计框架,揭示扩大证据范围虽能恢复部分支持但无法保证准入可靠,对长周期智能体的记忆可信性有直接参考价值。
论文提出 Null 攻击,通过梯度引导的时序重排,在保护累积张量完全不变的前提下实现攻击。在 DVS Gesture 上 ConvSNN 达 81.56% ASR、GRU 达 98.67%;DailyDVS-200 上多视角融合网络达 99.28% 精确盲区 ASR。
本文提出非对称侦察兵-工人框架,利用小型侦察车在未知环境中探索并验证大型工人机器人可行路径。实验表明该方法能修复被阻塞路段并大幅减少侦察车行驶距离,真实室内部署中成功导航狭窄走廊找到工人可行路径。
研究评估 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B 在 SEC 10-K 文本中提取财务属性的表现,覆盖现金与等价物、短期债务、信贷额度及研发支出四类变量。Qwen-2.5 14B 在现金数据上达 83.33% F1,Llama-3.3 70B 在 R&D 叙事脚注中达 76.92% F1,参数规模与文档复杂度对齐可提升零样本准确率并缓解缺失数据偏差。
论文提出基于黎曼流形的内蕴密集联想记忆模型,将记忆建模为 Epanechnikov 核密度模式搜索,证明正曲率在高维可擦除记忆、负曲率强化记忆,并给出 geodesic 容量标度 $q_\beta^{-1/2}$ 与 $q_\beta^{-1}$;在 WordNet 全名词层级上验证体积修正提升低容量检索。
LAIP(Localization via Audio-Informed Pooling)框架用轻量级 Audio-informed Spatial Pooling(AiSP)替换标准全局聚合模块,通过帧级对齐的音频查询中间视觉令牌来恢复被丢弃的空间信息。
AdaST 提出自适应时空预测框架,通过分解-重组范式处理时空耦合结构未知、耦合动态异质和空间建模不足三大挑战。利用异构感知专家因子化输入,角色对齐模块处理各分量,相关性自适应重组器整合预测。实验显著优于现有基线,验证自适应方法必要性,已被 NeurIPS 2026 主会接收。
论文提出在干净轨迹空间中引入轨迹级模式引导的扩散模型多机器人运动规划方法,通过随时间步递减的引导强度逐步注入部分轨迹先验,在早期阶段引导生成、后期释放约束以保留扩散模型的多模态特性。框架通过梯度优化融入规划代价,并扩展至多机器人场景加入碰撞代价,在单机器人与多机器人任务上实现可控轨迹合成与安全多智能体协调。
LEGO-Anything 是一个 Image-to-Code 框架,编程智能体迭代编写并执行 Blender 代码以重建 3D 场景。LEGO-Bench 包含 208 张来自 104 个场景的图像,GPT-6-astra 取得 53.4% 室内和 39.6% 室外分数。LEGO-Plugin 作为免训练插件提升全部 6 个模型,最高相对提升 62.7%。
FluxLite 是一个无需训练、轻量级的离散扩散模型推理控制框架,通过在预训练反向速率的稀疏有向图上引入稀疏跳率扰动补偿项,将 Feynman-Kac SMC 的重加权方差转化为局部凸优化目标。
论文提出 MUTUD 框架,在训练阶段使用音视频多模态数据,推理阶段仅用单一模态,通过 TAME 模块估计缺失模态信息。该方法在多种音视频语音任务上缩小了多模态与单模态模型的性能差距,同时减少模型规模和计算量,部分场景降低近 80%。相关成果已发表于 TMLR,arXiv 版本为 2501.18157v2。
研究发现基于采样一致性的幻觉检测存在可检测性缺口,高一致(Ghost)与低一致(Flickering)幻觉之间的 AUC 差距为 0.35 到 0.46。冻结 regime 分配后,词汇与语义响应离散度在全部 12 个模型与数据集设置中保持不对称,bootstrap 95% 置信区间不包含零。
VLA 策略通过单一层选择与多层融合连接视觉语言骨干与动作头,但融合优势有限,47/54 配置不如最佳单层策略。InfoNCE 作为动作条件信息瓶颈目标,与策略成功率关联最稳定,以最高 InfoNCE 分数选层可减少 9-33 倍 GPU 计算,将平均选择遗憾从 17.89 降至 3.71 个百分点。