One-Step Next-Latent Prediction Is Not a World Model
summary_zh: LeNEPA 将 next-latent prediction 扩展到时间序列,用 LeJEPA 的各向同性惩罚替代原有的 stop-gradient。
summary_zh: LeNEPA 将 next-latent prediction 扩展到时间序列,用 LeJEPA 的各向同性惩罚替代原有的 stop-gradient。
作者提出一种基于 L* 语法推断的可学习确定性有限自动机路由,将输入查询分发给确定性符号引擎或小型语言模型,在 Raspberry Pi 4B(8 GB RAM。
论文提出 GapFT,通过单次解码结果筛选训练样本,聚焦策略单样本失败但 K 样本内可恢复的问题。在 LogiQA 2.0 和 ReClor 上,基于 Llama-3.1-8B 的 Pass@1 相对提升 14.4 和 13.9 点,单次解码达到源模型 verifier-selected Pass@4 水平,且仅用全量验证池三分之一的匹配预算。
推荐理由:通过区分首句成功与K样本内恢复的失败,针对性填补模型单次推理的能力缺口。
arXiv 论文提出 Sage(Semantic Agent-Guided Formalization Engine),用四阶段分解生成加双信号语义纠错循环,替代整体翻译。
推荐理由:通过分解生成与双信号语义纠错,Sage 把形式化翻译中的假设丢失和空真问题从 70.9% 压到 2.7%,为数学形式化数据瓶颈提供了可复现的工程路径。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
Apple ML 团队提出往返协议评估 16 个模型对树结构算术表达式的序列化与恢复,发现通道失真且不对称,最佳模型对组合可达 92.9%,约 73.6% 失败源自生成端,结构难度主导而非模型族,约 3600 条微调样本即可让开放权重模型超越未训练 Gemini-3.1-Pro。
推荐理由:通过生成与提取的往返协议揭示模型间序列化树结构的失真瓶颈,为改进模型通信提供可量化依据。
研究在RTX 3080 Ti上测试Falcon3-1B、LLaMA-3.2-1B和Qwen2.5-1.5B的组合剪枝与量化,发现混合压缩在TruthfulQA上超出预期约7-14点,但在GSM8K和MMLU上反而下降16-20点,部分设置下GSM8K准确率降至零;效应在中等剪枝(20-30%)最明显,50%剪枝时减弱,量化单独使用即可实现约2-3倍内存缩减。
summary_zh: 研究提出 B-BiLO 框架,在 PDE 逆问题中结合贝叶斯推理与双层局部算子学习,上层用 Hamiltonian Monte Carlo 采样后验参数,下层通过低秩适配(LoRA)微调神经网络近似解算子。
summary_zh: DACA-GRPO 是一种轻量级即插即用的 GRPO 训练增强方法,针对扩散语言模型强化学习中去噪步骤等权处理和均值场似然估计有偏的两大缺陷,引入去噪进度分数与分层掩码似然两个互补机制。
Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。
微软研究院的新基准 MindTopo 发现,专有与开放权重多模态模型在静态拓扑推理上明显强于交互规划,且都远低于人类。它按连续性、分离、顺序、包围和绳结五类,测试静态场景问答,以及模拟环境中须维持或改变关系的动作规划。规划失败常在理解场景之后出现,模型失去对结构关系的追踪,或提出违反环境约束的动作。
Google Research 提出知识剖析框架,发现前沿大模型的事实性错误主要源于回忆失败而非知识未编码。WikiProfile 基准包含 2,150 条维基百科事实,每个事实配 10 个问题,评测了 13 个 LLM 约 450 万条响应。
推荐理由:该研究将大模型的 factual error 重新定义为 recall 失败而非 encoding 失败,并证明思考机制可恢复约四成到六成已编码但无法直接提取的事实。
CARE-X是微软研究介绍的胸部X光统一视觉语言模型,结合生成式报告与结构化预测并通过DAPO奖励对齐学习优化临床正确性。该模型在ReXVQA基准达到94%准确率,并在印度Narayana Health临床数据上验证了罕见ICU病理检测效果。工具增强测量实验显示,Qwen3-VL-4B-Instruct结合确定性计算工具后,测量依赖条件的F1平均提升43.6个百分点。
推荐理由:CARE-X通过联合训练生成与判别能力,在统一模型中实现灵活报告生成与校准预测,为放射学人工智能提供了可迁移的多任务优化方法。
Berkeley AI Research 提出 ABBEL 框架,将交互历史压缩为自然语言信念状态,并通过信念评分监督信念内容。在 CollabBench 协作编程中,ABBEL 恢复约一半全上下文性能差距,峰值上下文 token 数降至约 4.2 万,训练步数减半;在 Combination Lock 游戏中,结合领域知识的信念评分可接近或超越全上下文模型。
推荐理由:通过将摘要隔离为可监督的信念状态,在协作编程和组合游戏中以更少训练步数和更低显存缩小了与全上下文模型的性能差距。
Google Research 论文指出,让大语言模型生成推理轨迹能解锁原本难以回忆的参数知识,即使面对简单单跳事实问题亦然。研究发现计算缓冲与事实启动两种互补机制,并指出推理中的幻觉中间事实会降低最终答案准确率。
summary_zh: Sebastian Raschka 整理了 2026 年 1 月至 5 月他标记的 LLM 研究论文清单,涵盖架构与模型设计、高效训练与推理、稀疏注意力与长上下文、推理与测试时计算、强化学习、智能体系统、编码智能体、扩散语言模型及评测基准等类别。
亚马逊研究团队在ICLR发表论文,提出集合监督微调(SSFT)与全局分叉策略优化(GFPO),通过为不同推理模式分配全局分叉token来训练模型掌握多样化推理策略,并在推理时选择最优模式。AIME 2025、AIME 2024与LiveCodeBench-v5上Pass@1分别提升6.84、5.37与4.94个百分点,同时改善pass@k多样性且不损害单次准确率。
推荐理由:提出集合监督微调与全局分叉策略优化,在标准推理与编程基准上单次准确率提升5%至7%。
Google Research 提出 Simula 框架,将合成数据生成重构为机制设计问题,通过推理驱动实现可控制的数据集构建。论文发表于 Transactions on Machine Learning Research,在网络安全、法律推理、数学等五个领域最多生成 512K 数据点,全系统一致优于简单基线,且高质量数据比单纯增加数量更有效。
研究人员开发出神经符号AI系统,在Tower of Hanoi测试中成功率95%,传统系统仅34%;训练能耗降至标准VLA的1%,运行能耗降至5%,学习时间从一天半缩短至34分钟。该系统结合神经网络与符号推理,减少试错过程,相关研究将在ICRA 2026发表。
Together AI 发表 ICLR 2026 论文,提出研究长上下文 LLM 分治框架的理论方法。Planner 重写任务、Worker 并行处理文档分块、Manager 聚合答案,弱模型(如 Llama-3-70B、Qwen-72B)使用该框架可匹配或超越 GPT-4o 单次处理。
推荐理由:弱模型配合分治策略可在长上下文任务中追平 GPT-4o 单次推理,为工程落地提供低成本并行方案。
OIST 研究发现,让 AI 在训练中进行内部"自言自语"并结合短期记忆,能提升多任务灵活性与整体表现。新方法在序列反转、模式重建等复杂任务上增益明显,且可用稀疏数据训练,无需大规模数据集。研究团队计划将实验拓展至真实动态环境,探索家庭与农业机器人应用。
Sebastian Raschka 整理了 2025 年 7 月至 12 月的 LLM 研究论文列表,涵盖推理模型、RLHF、推理时扩展、架构、高效训练、多模态与数据集等类别。该列表为其 Substack 付费订阅者的附加内容,正文仅浏览摘要、少数全文精读。原文未给出具体模型、参数、分数或速度倍数。
Berkeley AI Research 提出不基于时间差分(TD)学习的强化学习算法,采用分治策略将轨迹递归拆分为子段,以对数级减少 Bellman 递归并缓解误差累积。
推荐理由:提出非TD学习的分治式RL范式,在长 horizon 任务上展示了可扩展性,读者可借此了解值函数学习的新方向。
Petar Veličković 讨论如何将经典算法与数据结构捕获到深度神经网络中,并提出算法对齐(algorithmic alignment)作为提升泛化与可解释性的设计原则。文章梳理了从学习执行图算法、CLRS-30 基准到神经算法推理(NAR)蓝图的进展,并指出将经典算法应用于真实世界时面临输入工程与算法瓶颈等挑战。