Power-SMC:面向免训练 LLM 推理的低延迟序列级幂采样
研究者提出 Power-SMC,一种免训练采样方法,面向与 Metropolis–Hastings 采样相同的序列级幂分布,同时保持接近标准解码的延迟。该方法并行维护多条候选序列,用重要性权重打分并周期性剪枝,理论证明采样温度 τ=1/α 可唯一消除逐步权重方差。
研究者提出 Power-SMC,一种免训练采样方法,面向与 Metropolis–Hastings 采样相同的序列级幂分布,同时保持接近标准解码的延迟。该方法并行维护多条候选序列,用重要性权重打分并周期性剪枝,理论证明采样温度 τ=1/α 可唯一消除逐步权重方差。
论文研究时变贝叶斯优化(TVBO)在噪声且评估代价高的时变黑盒目标上的理论表现,给出 TVBO 算法累积 regret 的上界与算法无关下界,并推导出算法具备 no-regret 性质所需的充分条件。分析据称首次覆盖实践中所有主要平稳核函数类别,回答瞬时 regret 能否渐近消失及何时消失的问题。
论文提出 E-process 授权 Thompson Sampling(e-ATS),为每条臂同时维护全历史与折扣 Beta 状态,由 anytime-valid e-process 授权折扣状态,并用可逆相关性分数控制其影响。
一项预注册基准在 8 个公开数据集上以 200 至 20,000 行训练样本、7 种生成器(independent marginals、Gaussian copula。
一项研究通过可处理的事实召回模型解析 Muon 优化器的谱正交化机制,发现梯度流(GF)学习时间比为 $\widetilde{\Theta}(\sqrt{S/R})$,谱梯度流(Spectral GF)将其降至 $\widetilde{\Theta}(1)$。
ReRoute 框架将事实数据与部分机制知识结合,通过把预训练骨干网络的查询输入固定到参考值、经已知机制路径重新引入变化并在原始事实数据上微调,实现无需对照干预数据的科学 what-if 预测。
AREX 是一种面向预训练 flow matching 模型的免训练采样器,利用目标均值与协方差刻画可解析的采样动力学,并将学习到的动力学分解为全局仿射分量与神经残差项。
该研究将多步一致性模型(CM)采样分析为加噪与近似去噪算子的组合,在明确可验证的稳定性假设下推导出非渐近误差界,把初始误差的收缩与近似误差的累积分开。误差界赋予噪声调度不同角色:早期较大噪声水平驱动收缩,晚期较小噪声水平控制残余偏差,并为强对数凹与半对数凹目标给出显式常数。实验显示,进入误差界的收缩与近似剖面可可靠测量,且与预测的函数形式高度吻合,为多步 CM 提供收敛理论与采样器设计路径。
论文提出 HOST,一种高效 DAG 学习算法,用逐节点留出集评分与凸回归替代子集搜索,无需预先给出入度上界。HOST 在排序步骤利用留出样本评分在期望上抬高排序分的特性实现单向误差控制,再通过递归移除间接效应恢复父节点。在合适条件下,HOST 可在多项式时间内以约 d log p 的样本复杂度精确恢复 p 节点、最大入度 d 的 DAG,实验显示其图恢复效果具竞争力且运行时间扩展性良好。
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,把向上移动变为截断,从而避免模拟难以处理的时间反转。该方法在合成目标、分子 Boltzmann 采样和图像生成上取得有竞争力的准确率与多样性,对采样器扰动保持稳健,并适用于现有 RE 校正无法使用的蒸馏采样器。论文还证明目标不变性,并给出用于调节调度与计算预算的诊断。
论文在分类任务上比较 SFT 与 RFT,发现即使教师示范全部语义正确,SFT 仍比 RFT 更容易遗忘。
研究提出 MusicGroundingBench,一个由算法生成的钢琴音频构成、带有精确符号对齐的受控基准,包含三音与两小节设置,用于评测大型音频语言模型的定位与理解能力。实验显示跨模态微调可让模型学会两种能力,但增加定位监督并未在不同骨干模型上稳定提升理解力。两个受测 LALM 在基础音乐概念上的零样本定位仍有限,凸显接地音乐理解仍是开放挑战。
flowreader 将长多模odal文档的证据选择建模为带容量限制的最小费用流问题,在 VisDoMBench 上配合 Qwen3-VL-32B 取得最高宏平均准确率 68.9,超出此前最强系统 2.7 分。
论文提出 Whole-Pool Setwise 重排序方法 DualEnd,让每次比较对整个候选池排序,并同时选出最相关与最不相关的候选,从两端填满排序,在 50 次 LLM 比较内完成 100 个候选的完整排序。
论文提出 Matryoshka Residual Vector Quantization(MRVQ),一种面向冻结嵌入的后处理残差量化器,其最大码率码可按丢弃残差级降低码率、按丢弃嵌入坐标降低维度,单一常驻产物即可覆盖所有评估的(维度,码率)组合。
研究者基于 dictyBase 构建了面向模式生物 Dictyostelium 的文献检索基准,包含策展人生成的生物查询、PubMed 索引文章与结构化基因注释。
论文提出以冻结文档索引可达的最大召回率衡量几何容量,并在多个真实检索基准上发现单向量查询编码器的检索质量常远低于索引可支持的上限。作者给出理论证据:存在一个检索任务,可用小型单隐层 ReLU 网络实现完美召回的查询编码器,但任何统计查询学习器要超越随机基线 k/n 都需要指数级多的统计查询。研究认为检索基准存在大量未实现的几何容量,查询编码器可学习性是嵌入检索的潜在瓶颈。
提出 Asymmetric Intervention-Guided Margin Supervision(AIMS),把删除单个历史事件的效果转化为排序监督,用于指令引导的 LLM 生成式推荐。
该论文提出通过可学习 soft top-K、逐项阈值(per-term thresholding)与 FLOPs 正则化协同优化模型稀疏度,以缩短 LLM 语义词扩展带来的过长查询与文档向量。在 MS MARCO 和 BEIR 数据集上,Lion-SP 显著降低平均查询与文档长度,实现更低检索延迟与存储成本,同时保持有竞争力的相关性,论文已被 SIGIR 2026 接收。
CLIMB 是一个免训练的多模态 RAG 推理时框架,先用 MMR 式目标构建兼顾查询相关性与段落冗余的互补证据池,再由 R/E/C 评审器按相关性、证据特异性与跨模态对齐打分,仅在置信度提升时接受更新答案。在 Encyclopedic-VQA 和 InfoSeek 上,CLIMB 稳定优于检索增强多模态基线,且无需修改底层检索器或 MLLM。
SyntaxBench 是一个面向字符级推理的诊断基准与统计评估框架,包含字符计数、字母包含、回文检测、编辑距离、最长字符串选择五项核心任务,以及更难的子串抽取压力测试 index_to_span。
针对 Touché 2026 的反因果声明任务,Shrome 在 Countercausal News Corpus(CCNC)上为检测、抽取、极性三个子任务各建一个模型。
研究者将 60 多个 LLM 的 post-softmax 注意力权重按 query 位置边缘化,构建 token-head「边际注意力空间」。按 token 轴降维得到跨模型稳健的文本内禀信号,并可理论证明下一 token 分布相似的模型具有相似的输入-输出 Jacobian 统计;按 head 轴降维则形成跨文档保持的模型私有特征。
论文提出“可行动不确定性”(actionable indeterminacy)框架,区分何时行动、何时澄清、何时提出最小代价约束修复,并构建覆盖对象分配、会议安排、公寓选择与稳定匹配的求解器基准。实验发现,模型能识别需要澄清或修复的情形,却在已有正当行动时仍进行干预;正确决策标签也不保证生成可用的行动、问题或修复。明确响应要求可显著提升完全正确响应率,并改变干预决策。
研究提出“知识可及性”概念,发现 LLM 能否召回查询所需知识,在生成前就由查询表征的几何结构决定:越靠近表征空间中心的查询越易召回,远离中心则可及性下降,并存在区分二者的知识边界。受控实验显示该中心几何与知识可及性的关联强于推理难度,且查询改写对易及查询更有效、链式推理在边界附近更有效、检索在边界外增益更大,可作为自适应推理的生成前信号。
OLMo-Detect 基于完全开放的 OLMo 2 流水线构建,覆盖预训练、中训练与后训练,并在三个关键轴上对齐成员与非成员样本,同时通过 infini-gram 严格过滤非成员。
研究提出 Multilingual Distractor Interference(MDI)评测协议,在 TruthfulQA 与 TriviaQA 上对 5 款指令微调 LLM 进行 40,000 次评测。
研究者提出一个基于理论的基准,用于自动评测在线交流中的心理健康污名,涵盖六种心理健康状况的自然新闻与社交媒体文本。标注框架包含二元污名检测任务,以及覆盖污名模式、领域和具体成分的多级分类体系。实验显示,情感、毒性与仇恨言论分类器难以捕捉心理健康污名,LLM 在缺少明确操作规则时常过度预测污名;公开部分基准、标注、示例与代码已发布。
研究者提出即插即用框架 FOVEATED,通过随机偏移前文 key 的 Rotary Position Embedding (RoPE) 位置来构建每句话的聚焦视图,缓解非结构化知识编辑(UKE)中的上下文依赖问题。
AptMQL-Bench 由编码智能体加人工核验的转换流水线构建,将 BIRD 迁移为 21 个文档型数据库、3,186 条自然语言请求及对应 MQL 查询,SQLite 迁移无数据丢失且扩展高效。
论文提出 Sigma,首个基于可引导低维 ODE/SDE 潜轨迹的大规模(3B/8B)连续扩散语言模型,通过分块似然优化训练,并用自回归模型预训练权重热启动。推理中,分类器无关引导与得分温度对高保真推理和编码至关重要;在 GSM8K、Minerva、HumanEval、MBPP 及 MATH-500、AIME 上与离散模型表现相当。
APDMem 是一种分层长期记忆架构,将对话历史表示为主题摘要、个性化关键事实、轮次级证据笔记和原始消息四层,由控制器按查询复杂度渐进披露。检索到的证据经笔记合成器整理为面向查询的结构,合并事实、排序事件并标记矛盾。LongMemEval 实验显示,APDMem 仅访问 8% 的对话即取得强长上下文记忆推理性能,论文已被 EMNLP 2026 Industry Track 接收。
XiangqiBench 是一个可执行基准,从 119 个有引擎或仅搜索验证的强制杀局出发,要求 LLM 智能体对引擎防守方完成将杀,并用交互式 REPL 区分真实走子、状态查询与前向模拟。
论文提出 Recursive Agent Optimization(RAO),一种训练递归智能体的强化学习方法,让智能体能够递归地向自身的新实例派生并委派子任务。RAO 教会模型何时以及如何委派与通信,使智能体在推理时通过分治扩展到更长上下文,泛化到比训练时更难的任务,并可能降低相对单智能体系统的实际耗时。
研究者推出 SovereignNegotiation-Bench,把代理法中的忠诚、服从实际授权、保密、坦诚与勤勉五项义务转化为对 episode 日志的确定性检查,前三项汇入单一核心指标。
研究者提出 Dynamic Expert Pruning(DEP),针对 MoE 架构在多智能体系统中静态剪枝失效的问题,利用智能体的 system 与 task prompt 预测所需专家。
SceneFactory-3D 是一个 GPU 批处理、物理 grounded 的多智能体驾驶模拟器,车辆通过悬挂与摩擦限制的轮接触力执行加速和转向指令,并受空间变化摩擦、3D 高度场、重力和刚体接触约束。
在多智能体辩论中,向一致多数屈服的 LLM 智能体仍在其内部表征中保留原始前提。研究用两跳事实题与脚本化同伴测试四个开源模型,Qwen3.5-4B、Qwen3.6-27B 和 Gemma-4-E4B-it 屈从时仍以 J-lens 在预设层读出原始桥接实体(hit@100 为 0.85。
WebUIProof 是一个面向执行的 WebUI 代码生成评测基准,覆盖通用 WebUI 与 3D 交互仿真两类任务,提供结构化规格与可执行交互测试。其 UI-agent harness 在无头浏览器中以 plan–act–observe 循环定位 DOM 元素、执行动作并校验断言;对八款商用 LLM 的评测显示,页面渲染成功时交互需求仍频繁失败,3D 仿真界面尤甚。
MIRROR 是一种通信层完整性原语,将单一规范化载荷复制到 k 条逻辑路径,仅当严格多数路径报告相同摘要时才接受消息,在路径妥协比例 α < 0.5 的假设下把攻击成功率压到 0%。