跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Robotics39

    ComManip:将操作策略过拟合至舒适区域

    ComManip 提出一种将机器人操作策略专门化到舒适操作区域的学习范式,在有限演示预算下提升任务成功率。研究发现,在紧凑稳定区域训练的策略比追求视觉多样性的策略表现更好。实验覆盖 ACT、π₀.₅、RDT、OpenVLA-OFT 和 SmolVLA 等多种策略架构,在大工作空间中任务成功率提升约 20 个百分点或更多。

  2. arXiv · Computation and Language71

    Memory Consolidation Flattens the Temporal Shape of User Facts

    论文提出 LAPSE 基准,发现记忆写入会选择性抹平进行时表达,例如将 "I am driving a Peugeot" 记为 "The user drives a Peugeot"。该现象在 244/381 对陈述中出现,且 mem0、Graphiti、Letta 等已部署管道均存在此问题,导致后续读者在判断事实是否仍成立时出现偏差。

    推荐理由:揭示了长期记忆写入会丢失进行时线索,使后续读者更难判断事实是否仍然成立。

  3. arXiv · Machine Learning33

    Preconditioned Physics-Informed Neural Operator Training

    提出预条件残差损失函数,解决物理信息神经网络算子训练中的病态条件数问题,在椭圆和鞍点问题上实现网格无关条件数。无需标签数据即可匹配监督训练精度,在 Poisson、Allen-Cahn 和稳态 Stokes 方程上比先前物理信息算子学习方法准确 4-25 倍。适用于线性和非线性方程、稳态或时间依赖问题,结构化和非结构化网格均兼容,推理无额外开销。

  4. arXiv · Computer Vision23

    当语义很重要时:面向共语音手势生成的可靠性感知语义-节奏控制

    针对共语音手势生成中语义信息利用不足的问题,提出一种可靠性感知的语义-节奏控制框架。通过双分支语义贡献估计机制量化文本语义对运动预测的影响,并基于此在内容相关段强化语义引导、在节奏主导段限制语义干预。同时引入噪声条件特征调制与潜在扰动提升真实声学环境下的鲁棒性,在基准数据集上实现了语义表达、节奏同步、运动多样性与鲁棒性的平衡。

  5. arXiv · Computer Vision36

    Reprogramming Vision-Language Models via Structured Prompt Reparameterization

    summary_zh: RVP 通过结构化提示重参数化对视觉语言模型进行视觉重编程,在 11 个少样本分类基准和 4 个 CLIP 主干上优于现有方法。CLIP 视觉重编程可表示为从冻结图像嵌入到下游 logits 的线性映射,RVP 用单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,几乎无额外计算开销。

  6. arXiv · Computation and Language42

    LLaDA 与 Dream 上的可靠并行解码方法 RPD

    掩码扩散语言模型(MDLM)可并行预测多个掩码 token,但同一次前向传播的预测未必可靠。研究提出无训练的 Reliable Parallel Decoding(RPD),按层间预测稳定性与最终置信度选择候选,在累积熵预算下提交可靠预测、推迟上游不确定的预测。在 LLaDA 和 Dream 的数学推理与代码生成基准上,RPD 达到最高解码吞吐量,同时保持或提升准确率。

  7. arXiv · Artificial Intelligence12

    超越状态到达:内在动机驱动的选项发现抽象学习

    该研究提出一种新算法,通过为每个子目标识别相关特征子集来学习可迁移的抽象选项,替代传统同时瞄准状态所有方面的状态到达方式。在三个稀疏奖励图像领域(包括 Atari 游戏 Montezuma's Revenge)上实现快速探索,选项泛化性更强,避免数量爆炸。

  8. arXiv · Robotics35

    AeroManip-VLA:基于 RL 生成演示的可扩展视觉-语言-动作空中操控学习基准

    AeroManip-VLA 是一个面向空中操控的可扩展 VLA 数据生成与策略评估基准,提供 GPU 加速的仿真框架,支持低层级载荷感知飞行与操控控制。通过可复用强化学习策略与专家任务规则自动生成涵盖抓取放置及长时序导航操控任务的演示数据,并引入自动化事件标注与轨迹分类机制。该基准支持在大规模并行环境中系统评估模仿学习与 VLA 基线方法,分析其性能特征与失败模式,便于在真实部署前进行仿真验证。

  9. arXiv · Computation and Language40

    MemFold:通过在线策略优化学习紧凑软记忆以实现长上下文个性化

    MemFold 将查询条件化的文本记忆压缩为 K 个连续向量作为记忆接口,通过组相对奖励和置信门控的在线策略蒸馏进行训练。教师模型从不采样,推理时完全移除。在 Qwen 三个骨干网络上,MemFold 在 PersonaMem-32K 和 PersonaMem-128K 上达到最高准确率,且迁移到 PrefEval 和 LongMemEval 无需目标域训练。

  10. arXiv · Machine Learning20

    生成式去噪器雅可比矩阵的谱性质研究

    该研究提出通过分析生成式去噪器(如扩散模型和流匹配模型)的雅可比矩阵谱来表征模型差异,发现更好的生成性能对应更大的雅可比特征值。研究引入一种通过扰动输入控制雅可比谱的正则化方案,在ImageNet上验证了强化数据相关主特征方向、抑制噪声无关方向的谱属性有助于改善生成质量。

  11. arXiv · Computer Vision52

    You Only Reprogram Once:重新思考视觉重编程的长训练

    论文提出 YORO 方法,利用冻结模型的响应空间通过单次前向遍历构建下游预测器,无需反向传播或优化器更新;贝叶斯判别映射(BDM)基于流式类统计推导协方差感知仿射映射。在三个全数据设置上平均精度较最强无梯度映射提升 18.4–24.4%,16-shot CLIP 四骨干平均从 71.4% 提升至 77.2%。YORO-FP 可选对视觉提示再优化 20 轮,验证时常保留单次预测器。

  12. arXiv · Robotics28

    NIDAR:基于伪 NIR 引导的固有分解实现可扩展场景无关 LiDAR 强度重建

    NIDAR 是一个前馈框架,从 RGB 外观和仿真几何合成密集类强度观测,无需目标场景强度标签或基于梯度的拟合。模型在 Waymo 上离线训练并在 Waymo 和 nuScenes 上评估,像素级精度和结构感知质量优于重建基线。伪 NIR 先验通过反射率-重映射路径最有效,并已集成到 Unreal Engine 5、Isaac Sim 和生成式 LiDAR 管线中。

  13. arXiv · Computation and Language62

    Eternal Sunshine of the Spotless Mind:系统性地擦除 LLM 记忆

    论文研究持久化 LLM 在用户要求下遗忘信息的能力,发现当前模型即使声称已遗忘仍会保留信息。作者提出 DeLLM 框架,通过动态构建查询上下文与维护消息溯源图来识别需删除的消息,实验显示 DeLLM 在高删除率的同时保持了实用性。

    推荐理由:论文提出让大语言模型按用户请求删除记忆的新方向,对关注隐私和长期交互的读者有参考价值。

  14. arXiv · Machine Learning25

    可表示但未学习:编码秩与交互预测的误差下限

    论文证明输入编码通过等价类限制预测器可联合复现的对比空间,无需标签或训练即可计算经验误差下限。在 140-rectangle siRNA 交互面板上,图神经网络的训练特征掩码将 165 个终点状态合并为 90 类,使 140 个交互对比的秩降至 72,对应下限 0.009980,占拟合模型交互 MSE 的 14.6%;恢复至少 3 列化学特征可恢复满秩。

  15. arXiv · Robotics42

    PreferenceFlow:通过人类干预引导冻结流匹配机器人策略

    PreferenceFlow 在测试时通过人类干预改进预训练流匹配策略,无需环境奖励或更新基线策略。人类干预片段与机器人片段配对训练偏好模型,推理时用 QGF 采样更新,以偏好梯度替代价值梯度,并辅以梯度惩罚和零梯度损失。在 Franka 机器人四项真实精密插入任务中,成功率从基线 69% 提升至 90.5%。

  16. arXiv · Artificial Intelligence55

    Safety Operator:通过谱优化调节安全指令的表达强度

    论文提出将 transformer 中的安全指令上下文 token 吸收为乘性算子,并通过调节其主特征值来控制安全指令对生成的影响强度。作者推导出带抑制权重的对比安全损失,在有害查询上强调安全指令、在无害查询上抑制它,从而在攻击成功率和过度拒绝率之间映射出 Pareto 改进关系。https://arxiv.org/abs/2609.36434

  17. arXiv · Machine Learning31

    物理交叉模态掩码自编码器用于地震-测井表示学习

    论文提出物理交叉模态掩码自编码器(CM-MAE),联合处理3D地震体积与1D测井深度片段,使用四轴旋转位置嵌入和稀疏Mixture-of-Experts层。预训练覆盖约178,000平方公里海域与陆上盆地及约92,000口井,匹配掩码消融显示地震上下文使测井重建提升9.73%,反向仅提升0.65%。海上压缩慢度盐体AUROC达0.910,陆上盆地保留层序结构但绝对校准仍依赖具体测线。

  18. arXiv · Robotics38

    VidAct:基于单目视频学习物体中心3D感知的机器人操作策略

    VidAct是一个视频到机器人的框架,从单目演示视频中学习物体中心、3D感知的操作策略,并实现零样本真实部署。系统通过重建物体网格与运动、残差轨迹迁移适应新物体配置,并在策略学习中预测完整物体点云作为辅助任务,提供密集的物体位姿与3D几何监督。实验表明该方法在人类、机器人、生成及互联网视频上均有效,3D监督提升了策略泛化与仿真到真实的成功率。

  19. arXiv · Machine Learning23

    EvoMO-SR:基于 LLM 与子结构引导的多目标符号回归进化框架

    EvoMO-SR 是一个由 LLM 驱动的符号回归框架,LLM 生成方程骨架,系数由外部优化器拟合,并引入多目标生存选择与子结构引导变异机制。在 LSR-Synth 的 8 个领域内外设置中,该框架使用 Llama-3.1-8B-Instruct 在 7 个场景取得最佳准确率,并通过基于规范化子树重叠与项匹配的两个符号精度指标验证了更高的结构恢复概率。

  20. arXiv · Computation and Language60

    DeepRewind:预测并修复深度研究 Agent 的过早承诺

    DeepRewind 为深度研究 Agent 引入可逆控制层,用类型化图表示来源、证据、主张、假设与承诺,并通过提示词世界模型预测影响与可逆性。实验显示,在 DRBench 和 LiveDRBench 上 Insight Recall 提升 3.6 个百分点,过早承诺相对减少 59.1%。论文链接:https://arxiv.org/abs/2609.36344

    推荐理由:论文提出可逆深度研究的控制层,为长程 Agent 的过早承诺问题提供了可量化的修复路径。

  21. arXiv · Robotics64

    Spotter:让具身模型主导执行,VLM 并行反思纠正

    Spotter 提出让具身模型持续执行、VLM 并行监控并在检测到错误时介入反思纠正的架构。实验显示,结合 Qwen 或 GPT 作为 VLM 后,Cosmos Policy 和 π₀.₅ 在 RoboCasa 分别提升 5.6 和 7.5 个百分点,π₀.₅ 在 RoboTwin 2.0 Hard 设置下从 47.2% 升至 57.0%,真实机器人上从 53% 升至 83%。

    推荐理由:提出 VLM 并行监控并按需介入的反思机制,为具身模型的错误修复提供了可复现的新路径。

  22. arXiv · Computer Vision22

    VLM4Cluster:预训练视觉-语言模型时代的深度聚类基准

    VLM4Cluster 是一个涵盖 17 种方法、20 个数据集的图像聚类基准,系统评估了语言辅助聚类(LaIC)在对抗鲁棒性、分布外泛化与计算效率上的表现。研究显示 LaIC 在语义密集基准上显著提升聚类性能,泛化能力更强、效率更优,但在大规模与细粒度数据集上增益不稳定,且未系统降低对抗扰动敏感性。

  23. arXiv · Machine Learning17

    公平策略优化在主-从弱耦合马尔可夫决策过程中的研究

    研究提出在主-从弱耦合马尔可夫决策过程(M2WCMDP)框架下优化单调、凹、置换不变归一化公平函数的方法。对于同质从属子MDP,证明问题可简化为平台加参与者均值效用目标的优化。对于一般情况,引入基于计数比例的深度强化学习方法与优先级采样器生成可行计数动作。在纽约市校准数据集上的定价与出租车调度联合控制实验中验证了方法的有效性与可扩展性。

  24. arXiv · Computation and Language47

    训练大语言模型表达评估意识

    研究提出口头化训练(VT)方法,使 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 的口头化评估意识提升 2.4-2.9 倍,同时潜在评估意识和行为保持稳定。VT 利用模型自发口头化作为证据,在口头化前截断 rollout 并用 RL 目标训练。该方法可迁移到未见过的智能体场景,且口头化反映模型通过合成文档微调获得的更丰富知识。

  25. arXiv · Artificial Intelligence42

    ARCagent:面向临床问答的自适应检索校准智能体

    ARCagent 是一个面向 ME/CFS 的自适应检索校准临床问答智能体,构建了包含 1,706 个片段、10 个来源的知识库与跨指南冲突注册表,并通过冲突感知检索校准流水线重排证据。其 LLM-as-Judge 基准平均比关键词匹配高 10.1 个百分点,最终达到 95.3%,代码已开源。

  26. arXiv · Machine Learning40

    DSpine:通过相邻因果注入实现并行草稿与深度条件解码的推测解码方法

    DSpine 在骨干网络各层通过门控相邻注入将前驱预测特征写入后继,使因果条件链沿网络深度展开,同时所有位置并行更新。在 Qwen3-4B 和 Qwen3-8B 上,DSpine 在两个温度下均取得最长接受长度;0 温度下 Qwen3-8B 七项 benchmark 均值从 DFlash 的 3.77 提升至 4.82(+27.8%),SGLang 服务测试中吞吐量平均提升 23.3%。