跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Artificial Intelligence43

    自发现 RL 在经验时代:学习历史是资产还是负担?

    研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。

  2. arXiv · Machine Learning62

    Mara Chain:重新思考失败作为 AI 系统自动演进的踏脚石

    论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。

    推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。

  3. arXiv · Computer Vision34

    Xiaomi-OCR-0 技术报告

    Xiaomi-OCR-0 是一个统一的 0.8B 文档解析与 OCR 理解模型,基于 Qwen3.5-0.8B 训练,在 Real5-OmniDocBench、OmniDocBench v1.6 和 Wild-OmniDocBench 上分别取得 95.24、96.83 和 87.94 的成绩,五个 OCR 导向 VQA 基准平均 83.2。

  4. arXiv · Audio and Speech23

    信号无关与信号相关神经 Ambisonic 矩阵编码:支持任意阵列与可变麦克风数量

    论文提出基于 Transformer 的矩阵编码方法,通过共享麦克风级处理和掩码自注意力,实现任意麦克风阵列且支持可变麦克风数量。信号无关(SI)编码从阵列传递函数预测编码矩阵,信号相关(SD)扩展额外引入观测麦克风信号。两者在 LibriSpeech 模拟场景训练并在源类型、未见麦克风数量和源数量变化上评估,SD 整体强于 SI,均优于传统最小二乘编码。

  5. arXiv · Robotics31

    双向拮抗肌腱驱动灵巧机械手的设计与验证

    本文提出一种仿人型、200 mm长、220 g重的17-DoF 3D打印机械手,基于双向拮抗肌腱路由机制实现掌侧与背侧双向抓取。实验显示电机到关节传动误差平均3.0%,关节带宽平均13.2 Hz,最大指尖力29 N,定位重复性达0.15 mm,Kapandji评分8,完成全部33种GRASP抓取类型验证。

  6. arXiv · Artificial Intelligence50

    Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

    研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。

  7. arXiv · Neural and Evolutionary Computing36

    一种基于上下文维护和检索记忆的神经网络

    研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。

  8. arXiv · Audio and Speech35

    Selective Lookahead for Attention-Based Streaming ASR

    提出 Selective Lookahead 机制解决基于注意力模型的流式语音识别问题,通过有界前瞻分块编码器与动态未来分块解码,在 LibriSpeech test-clean 上以 306 ms 中位延迟达到 6.5% WER 的静态前瞻最佳精度,等待预算将延迟尾部控制在静态基线 90 百分位以下 0.1 个 WER 点。该论文已被 IEEE SLT 2026 接收。

  9. arXiv · Robotics40

    TeAR:在执行器退化下的操控策略测试时自适应

    TeAR 是一种策略无关的测试时自适应方法,在操控策略输出端引入轻量 Transformer,结合关节温度、电机电流、供电电压等实时遥测信号,对动作进行放大、阻尼或偏置修正。在 18 个策略-任务对上评估,含退化模型失配时 TeAR 成功率为 31.8%,高于基线 25.6% 与假设模型逆的 30.6%;真实机械臂上加热场景成功率提升 10-15%,无需在机器人端微调。

  10. arXiv · Artificial Intelligence62

    Beyond Symmetric Agents: Cognitive Diversity and Multi-Agent Debate in Small Language Models

    研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。

    推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。

  11. arXiv · Neural and Evolutionary Computing25

    Hybrid Joint-Selective Optimization:针对低维感兴趣参数的降维 Levenberg-Marquardt 精修

    本文提出混合联合选择性优化(HJSO)框架,将参数分为高维剩余块与低维感兴趣参数(POI),先联合一阶优化再冻结其余变量、对 POI 做降维 Levenberg-Marquardt 精修。在矩阵特征值、逆 Bratu(PINN 求解)和 100 维非线性 Black-Scholes(DeepBSDE)三个问题上,HJSO 比联合一阶基线更快达到 POI 误差阈值并提升最终精度。

  12. arXiv · Machine Learning33

    通过行与列尺度场观察 Transformer 权重的中观视角

    研究提出行与列尺度场概念,通过中观层面的 log-RMS 剖面刻画权重矩阵的通道分布,结合全局尺度与平衡核心精确表示矩阵。在 Pythia 四个规模检查点与三组初始化控制实验中,平衡后核心幅度剖面相似;混合桥预测池化形状偏离,字段在共享功能通道的对齐投影间一致,query/key 剖面遵循重分配的 RoPE 频率。

  13. arXiv · Computation and Language42

    记忆适配方法 MATE 提升具身智能体任务执行成功率

    MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。

  14. arXiv · Robotics42

    SkillWeaver:通过神经交互技能的智能体探索实现规模化机器人数据生成

    SkillWeaver 是一个智能体框架,通过探索可复用、参数化的闭环策略 Neural Interaction Skills(NIS)自主生成机器人数据。系统在 14.1K 场景中生成 39.1K 演示,并蒸馏为视觉运动策略,在仿真和真实操作基准上提升对新物体、空间配置和环境的泛化能力,支持零样本与少样本的 sim-to-sim 及 sim-to-real 迁移。

  15. arXiv · Neural and Evolutionary Computing35

    LLM 引导搜索发现高距离二进制线性码新记录

    研究者基于 EvoTune 框架和 ShinkaEvolve 代码库提出 LinCodeEvolve,利用大语言模型引导搜索结合精确最小距离评估,发现 7 个破纪录二进制线性码。六个具有简洁拟循环描述,经完全枚举验证,改进了码表中 22 条记录。结果表明 LLM 引导搜索可辅助编码理论发现。

  16. arXiv · Audio and Speech60

    语音LLM评测中的声学捷径与欠明确理由研究

    论文审计了六款语音LLM评测模型,发现它们一致地偏好更响亮的音频、更重视内容丰富度,并将情感表达映射为质量偏好;这些效应在成对比较中更明显,而逐分评分常将其掩盖。伴随的理由很少指出改变判断的声学线索,词汇有限,导致声学依据不明确。作者发布SpeechJudgeAudit数据集与工具以支持复现和后续审计。

    推荐理由:研究揭示了语音大模型在评估中的声学捷径问题,对构建更可靠的语音评测系统有参考价值。

  17. arXiv · Computer Vision33

    AerialDojo-200K:大规模开放世界空中目标搜索基准套件

    AerialDojo-200K 包含 205,732 个任务实例(超 10 万语义目标与图像目标),覆盖 42 个仿真场景和 21 种场景类型。数据集由 12 名标注员耗时两个月手动标注 109 个地标、2099 个目标物体及锚点,并配备无碰撞参考轨迹与多视角视频。研究评估了 5 个开源与 4 个闭源多模态大语言模型,结果显示通用空中智能体仍有很长路要走。

  18. arXiv · Artificial Intelligence36

    更多程序还是更多重复?LLM Harness 中覆盖率与专业化的分离

    研究在 386 个 MATH-500 任务上比较了 8 个生成 harness 与基线,每个成员执行 3 次。相同程序产生 2.16 个百分点的重复平均 oracle 余量,生成程序虽呈现更多重复得分模式,但相对基线的损失在所有 3 次重复中持续存在于 100 个任务,稳定互补性在 3 次重复中仍未解决。

  19. arXiv · Robotics60

    KPI:人形机器人物理交互的可提示内核

    论文提出 KPI,一种可提示的物理交互内核,在轨迹源与未修改的全身跟踪器之间传递力合同(跟踪、顺从或保持力范围),并根据跟踪误差和力矩估计实时调整手臂刚度、阻尼、参考与前馈。实验涵盖指令驱动的绞盘操作、开门、箱子搬运及脚本化表面交互演示,其中人形机器人能通过绞盘将另一台机器人完全吊离地面。

    推荐理由:提出可提示的物理交互内核,让轨迹源与全身跟踪器之间以力合同交互,为具身智能体执行复杂操作提供了可迁移方法。

  20. arXiv · Computer Vision40

    CoDimRecon:基于可变形曲线、曲面与体素的仿真就绪 3D 场景智能重建

    CoDimRecon 是一个智能体框架,从多视角 RGB 观测重建包含刚体、关节体和可变形物体的可编辑场景。可复用的仿真技能初始化物理模型与参数,智能体驱动的行为测试暴露不匹配并触发针对性修正。在 Replica 和 ScanNet++ 上取得具有竞争力的组合重建精度,并产出杆、壳、体三种可变形仿真资产。

  21. arXiv · Computation and Language28

    SFIA 框架下的结构化技能与责任层级提取:从词汇基线到智能体检索增强生成

    研究将技能提取形式化为从自由文本中预测(技能,责任层级)对的结构化预测任务,针对 SFIA 的 147 个技能和 7 个责任层级展开。五种策略对比显示,基于检索的匹配识别技能最多,生成式策略精度更高;仅将层级作为显式决策的策略才能可靠预测层级,相似性选择准确率不足一半;三智能体流水线延迟加倍但精度未提升。

  22. arXiv · Artificial Intelligence31

    Token 边界代价:压缩证书与预测权衡研究

    该研究通过从两侧约束最优 token 数量,量化了预分词边界带来的压缩代价。在英文维基百科上,边界使最优 token 数增加 28.3–36.8%,BPE 分别比受限下界和无约束上界高 2.1% 和 10.9%。引入 boundary licences 后,仅许可 10% 词汇跨切即可恢复 85.2%–100.0% 的 token 数缩减收益。

  23. arXiv · Machine Learning62

    二值化拉平评分空间:LLM 裁判奖励的信息损失与恢复

    论文指出 LLM 裁判常被二值为 pass/fail(0/1),这种二值化会引入仿射拉伸模糊性,使策略在不改变裁判报告的前提下任意拉伸分数。作者通过联合高斯模型证明,引入第三个等级可增加第二个阈值、消除该模糊性。

    推荐理由:论文揭示二值化评分会掩盖策略在阈值内的任意拉伸,为使用 LLM 裁判训练策略时保留区分度提供了量化依据。

  24. arXiv · Neural and Evolutionary Computing42

    HeurEvo:面向时间敏感数学优化的混合求解器增强启发式智能体演化框架

    HeurEvo 是一个自动化计划-代码-组件共演化框架,通过智能体在岛基进化结构中联合优化高层算法结构、实现与共享组件池。框架在组合优化基准和 MIPLIB 实例上,能在严格运行时间预算内找到高质量解,常匹敌或超越需数小时至数天的现有最优求解器,并在六边形 packing 等非线性几何问题上改进此前最佳结果。