自发现 RL 在经验时代:学习历史是资产还是负担?
研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。
研究对自发现 RL 规则 Disco103 进行首个因果机制审计,围绕经验时代五支柱展开。发现循环历史能将可用奖励尺度扩展至六十年窗口,而解除历史固定后导入状态自然演化可减轻不匹配惩罚。在环境变化下控制回放保留可逆转 DQN 的表观适应优势,验证结果同时移植到第二组规则 OPEN。
TRACE 是一种面向肿瘤学大语言模型的可部署树状关系结构增强框架,将昂贵的离线结构学习与轻量在线推理分离,在零样本设置下无需监督标签即可进行任务自适应证据选择。
论文提出 Kolmogorov-Arnold Classifier System(KACS),基于 Kolmogorov-Arnold 表示定理将目标函数分解为单变量子问题,为每个子问题分配独立规则集。
论文提出 Mara Chain,一种将拒绝候选保留并迭代细化为优化踏脚石的精炼过程,在 AppWorld、TerminalBench 2.1 和 MuSiQue 上以更少 rollout 取得更高性能提升。
推荐理由:提出将失败候选保留并迭代优化的 Mara Chain,在多个基准上以更少 rollout 提升性能,为 AI 系统自动演进提供可迁移方法。
Xiaomi-OCR-0 是一个统一的 0.8B 文档解析与 OCR 理解模型,基于 Qwen3.5-0.8B 训练,在 Real5-OmniDocBench、OmniDocBench v1.6 和 Wild-OmniDocBench 上分别取得 95.24、96.83 和 87.94 的成绩,五个 OCR 导向 VQA 基准平均 83.2。
论文提出基于 Transformer 的矩阵编码方法,通过共享麦克风级处理和掩码自注意力,实现任意麦克风阵列且支持可变麦克风数量。信号无关(SI)编码从阵列传递函数预测编码矩阵,信号相关(SD)扩展额外引入观测麦克风信号。两者在 LibriSpeech 模拟场景训练并在源类型、未见麦克风数量和源数量变化上评估,SD 整体强于 SI,均优于传统最小二乘编码。
本文提出一种仿人型、200 mm长、220 g重的17-DoF 3D打印机械手,基于双向拮抗肌腱路由机制实现掌侧与背侧双向抓取。实验显示电机到关节传动误差平均3.0%,关节带宽平均13.2 Hz,最大指尖力29 N,定位重复性达0.15 mm,Kapandji评分8,完成全部33种GRASP抓取类型验证。
研究从同一 GPT-2 Small 预训练检查点出发,对比标准与对抗性持续训练后的因果电路规模。在 85% 忠实度以下标准模型电路更小,但在 90%、95% 高忠实度下鲁棒模型需要更少的边。鲁棒模型也更易被 SAE 分解且任务归因涉及更少 SAE 特征。
研究者训练了一个带情景记忆缓冲区的循环神经网络(RNN),通过贝叶斯推理持续预测自然电影中的场景并推断上下文。上下文以低秩方式调节 RNN 的循环连接(工作记忆基础),模型活动模式与人类 fMRI 响应最匹配。上下文同时调节情景记忆检索,模型基于内容相似性和上下文相似性检索记忆,比无上下文调节的模型学习更快。
summary_zh: 机器学习领域多数论文的实证结果难以复现,代码也常不可获取,阻碍研究进展。该论文分析并量化了这些问题,提出在不具备可复现性时提升结果可检查性的具体方案。
研究提出多智能体框架(故事智能体、图像智能体与评论智能体协作)生成逼真的多模态假新闻,覆盖科学、健康与娱乐三大领域,共生成超过 9,000 条配对多模态新闻帖子,并基准测试了 16 个开源与闭源多模态大语言模型的自动检测能力。
FunKAN 在 MRI 去 Gibbs 伪影与解剖分割上达 SOTA,但 11.6M 参数、8.7 GFLOPs 难以部署于边缘医疗设备。
提出 Selective Lookahead 机制解决基于注意力模型的流式语音识别问题,通过有界前瞻分块编码器与动态未来分块解码,在 LibriSpeech test-clean 上以 306 ms 中位延迟达到 6.5% WER 的静态前瞻最佳精度,等待预算将延迟尾部控制在静态基线 90 百分位以下 0.1 个 WER 点。该论文已被 IEEE SLT 2026 接收。
TeAR 是一种策略无关的测试时自适应方法,在操控策略输出端引入轻量 Transformer,结合关节温度、电机电流、供电电压等实时遥测信号,对动作进行放大、阻尼或偏置修正。在 18 个策略-任务对上评估,含退化模型失配时 TeAR 成功率为 31.8%,高于基线 25.6% 与假设模型逆的 30.6%;真实机械臂上加热场景成功率提升 10-15%,无需在机器人端微调。
研究测试了认知多样性是否驱动多智能体辩论(MAD)收益,对比23个模型、5项任务、5500+次实验。发现辩论在匹配预算下与自一致性采样持平或更差,角色提示降低准确率,混合模型团队表现取决于成员能力而非异质性,且收益主要来自首轮回答。同时指出辩论转录会静默溢出上下文窗口,修正后辩论与采样差距从-1.8分变为持平。
推荐理由:论文通过预算匹配的严格对照实验,对多智能体辩论的收益来源提出了新解释。
本文提出混合联合选择性优化(HJSO)框架,将参数分为高维剩余块与低维感兴趣参数(POI),先联合一阶优化再冻结其余变量、对 POI 做降维 Levenberg-Marquardt 精修。在矩阵特征值、逆 Bratu(PINN 求解)和 100 维非线性 Black-Scholes(DeepBSDE)三个问题上,HJSO 比联合一阶基线更快达到 POI 误差阈值并提升最终精度。
研究提出行与列尺度场概念,通过中观层面的 log-RMS 剖面刻画权重矩阵的通道分布,结合全局尺度与平衡核心精确表示矩阵。在 Pythia 四个规模检查点与三组初始化控制实验中,平衡后核心幅度剖面相似;混合桥预测池化形状偏离,字段在共享功能通道的对齐投影间一致,query/key 剖面遵循重分配的 RoPE 频率。
summary_zh: SENSE 将 EEG 信号合成语义语音,结合基于电极几何图的编码器与 EEG Semantic Conditioning,在 N400 数据集上同时提升声学与语义指标。
CLIP 与 SigLIP 编码器中存在单一主导方向,捕获图像-文本均值分离平方范数的 94.4-99.9%,表明均值分离分量近似秩一。
MATE 在 ALFWorld 134 个任务上分别用 Qwen2.5-14B 和 72B 达到 81.3% 与 93.3% 成功率,token 消耗约为原始轨迹的十分之一。该方法通过移除过时控制上下文、提取条件-动作-效果转换、经验证动作归一化和任务相关表示选择,将检索到的轨迹转为可执行记忆,无需额外 LLM 推理。实验表明经验证动作归一化是恢复检索经验有效性的主要机制。
summary_zh: 该研究提出将 CVaR 应用于每步即时成本而非价值函数,使任意期望型 POMDP 规划器仅需修改代价计算即可具备风险敏感性,同时保留有限时间误差界且与风险水平无关,并在风险中性极限下回归标准期望规划。
SkillWeaver 是一个智能体框架,通过探索可复用、参数化的闭环策略 Neural Interaction Skills(NIS)自主生成机器人数据。系统在 14.1K 场景中生成 39.1K 演示,并蒸馏为视觉运动策略,在仿真和真实操作基准上提升对新物体、空间配置和环境的泛化能力,支持零样本与少样本的 sim-to-sim 及 sim-to-real 迁移。
研究者基于 EvoTune 框架和 ShinkaEvolve 代码库提出 LinCodeEvolve,利用大语言模型引导搜索结合精确最小距离评估,发现 7 个破纪录二进制线性码。六个具有简洁拟循环描述,经完全枚举验证,改进了码表中 22 条记录。结果表明 LLM 引导搜索可辅助编码理论发现。
论文测试了一个仅 28,656 参数的卷积自编码器在 AFRL GOTCHA 相位历史数据上的压缩表现,结果在所有码率下均输给 BAQ 与 KLT 等基线。在 16 b/cs 时自编码器 NMSE 为 -2.87 dB,远低于 8-bit BAQ 的 -35.5 dB(±3σ 裁剪)与 -41.0 dB(调优裁剪),检测 F1 被限制在 33%。
summary_zh: 该研究提出 Environment Steering,将智能体与执行环境状态建模为数据库表,跟踪记录级数据流并在运行时对照声明式策略检查。
论文审计了六款语音LLM评测模型,发现它们一致地偏好更响亮的音频、更重视内容丰富度,并将情感表达映射为质量偏好;这些效应在成对比较中更明显,而逐分评分常将其掩盖。伴随的理由很少指出改变判断的声学线索,词汇有限,导致声学依据不明确。作者发布SpeechJudgeAudit数据集与工具以支持复现和后续审计。
推荐理由:研究揭示了语音大模型在评估中的声学捷径问题,对构建更可靠的语音评测系统有参考价值。
AerialDojo-200K 包含 205,732 个任务实例(超 10 万语义目标与图像目标),覆盖 42 个仿真场景和 21 种场景类型。数据集由 12 名标注员耗时两个月手动标注 109 个地标、2099 个目标物体及锚点,并配备无碰撞参考轨迹与多视角视频。研究评估了 5 个开源与 4 个闭源多模态大语言模型,结果显示通用空中智能体仍有很长路要走。
研究在 386 个 MATH-500 任务上比较了 8 个生成 harness 与基线,每个成员执行 3 次。相同程序产生 2.16 个百分点的重复平均 oracle 余量,生成程序虽呈现更多重复得分模式,但相对基线的损失在所有 3 次重复中持续存在于 100 个任务,稳定互补性在 3 次重复中仍未解决。
HeadGuard 通过固定高精度掩码保护约 1/8 的 KV 头部,在 2 位量化下将八模型六任务判别平均分从 0.436 提升至 0.580。Qwen 和 InternVL 收益最大,键保护可在更低存储成本下保留大部分恢复效果,且兼容三种基础量化器与两种校准数据集。
论文提出 KPI,一种可提示的物理交互内核,在轨迹源与未修改的全身跟踪器之间传递力合同(跟踪、顺从或保持力范围),并根据跟踪误差和力矩估计实时调整手臂刚度、阻尼、参考与前馈。实验涵盖指令驱动的绞盘操作、开门、箱子搬运及脚本化表面交互演示,其中人形机器人能通过绞盘将另一台机器人完全吊离地面。
推荐理由:提出可提示的物理交互内核,让轨迹源与全身跟踪器之间以力合同交互,为具身智能体执行复杂操作提供了可迁移方法。
CoDimRecon 是一个智能体框架,从多视角 RGB 观测重建包含刚体、关节体和可变形物体的可编辑场景。可复用的仿真技能初始化物理模型与参数,智能体驱动的行为测试暴露不匹配并触发针对性修正。在 Replica 和 ScanNet++ 上取得具有竞争力的组合重建精度,并产出杆、壳、体三种可变形仿真资产。
研究将技能提取形式化为从自由文本中预测(技能,责任层级)对的结构化预测任务,针对 SFIA 的 147 个技能和 7 个责任层级展开。五种策略对比显示,基于检索的匹配识别技能最多,生成式策略精度更高;仅将层级作为显式决策的策略才能可靠预测层级,相似性选择准确率不足一半;三智能体流水线延迟加倍但精度未提升。
summary_zh: 研究在 Growing NCA 实验中分离训练与评估的更新模式,异步训练在 10/10 次运行通过短时域质量测试,而同步仅 3/10;所有 10 个异步模型在确定性评估下仍保持目标 4,096 步。
WenetSpeech-Min 是一个约 10,000 小时闽南语语音的开源语料库,提供逐句闽南语与普通话双转录。论文同时建立闽南语 ASR 与 TTS 基准并发布手工验证评测集。在该语料上训练的模型在多数指标上超越开源系统,性能接近商业系统。
该研究通过从两侧约束最优 token 数量,量化了预分词边界带来的压缩代价。在英文维基百科上,边界使最优 token 数增加 28.3–36.8%,BPE 分别比受限下界和无约束上界高 2.1% 和 10.9%。引入 boundary licences 后,仅许可 10% 词汇跨切即可恢复 85.2%–100.0% 的 token 数缩减收益。
Persistence Forcing(PerF)利用像素空间扩散 Transformer 中持久特征与活跃特征的分工,让持久特征持续引导活跃特征细化局部细节。在 ImageNet 256×256 上,PerF-L 以一半参数达到 FID 1.91,接近 JiT-H 的 1.86;PerF-H 在 256×256 和 512×512 上分别达到 FID 1.63 和 1.76。
SCOUT 是一个动力学感知元学习框架,通过共享信念潜空间将动作预测策略与前向动力学模型耦合,在测试时利用动作-结果失配持续更新内部动力学信念。实验表明该方法在模拟操作基准上显著加速在线自适应,并实现稳健的仿真到现实迁移。
论文提出 Alignment Forecasting 任务,在微调前预测模型是否会在欺骗或谄媚等失败模式上显著恶化。作者构建了 ALIGNMENTFORECASTBENCH,包含 5000+ 问题,覆盖 17 个目标模型、32 个数据集和 16 种失败模式。
论文指出 LLM 裁判常被二值为 pass/fail(0/1),这种二值化会引入仿射拉伸模糊性,使策略在不改变裁判报告的前提下任意拉伸分数。作者通过联合高斯模型证明,引入第三个等级可增加第二个阈值、消除该模糊性。
推荐理由:论文揭示二值化评分会掩盖策略在阈值内的任意拉伸,为使用 LLM 裁判训练策略时保留区分度提供了量化依据。
HeurEvo 是一个自动化计划-代码-组件共演化框架,通过智能体在岛基进化结构中联合优化高层算法结构、实现与共享组件池。框架在组合优化基准和 MIPLIB 实例上,能在严格运行时间预算内找到高质量解,常匹敌或超越需数小时至数天的现有最优求解器,并在六边形 packing 等非线性几何问题上改进此前最佳结果。