统一多模态模型的视觉拒答能力研究
研究提出视觉拒答(visual abstention)任务,要求统一多模态模型在请求的视觉变换违反任务规则时识别无解并拒绝生成。论文发布 Draw-or-Decline(DoD)基准,含 1,050 对可行/不可行请求、覆盖 7 类任务;评测 8 个 UMM 显示,最强编辑器编辑准确率 68.4%,却仅拒绝 0.4% 的不可行请求。
研究提出视觉拒答(visual abstention)任务,要求统一多模态模型在请求的视觉变换违反任务规则时识别无解并拒绝生成。论文发布 Draw-or-Decline(DoD)基准,含 1,050 对可行/不可行请求、覆盖 7 类任务;评测 8 个 UMM 显示,最强编辑器编辑准确率 68.4%,却仅拒绝 0.4% 的不可行请求。
ReFold 是一种免训练的渲染层,在保留底层交互历史的同时只压缩模型渲染上下文,以替代依赖额外模型调用或启发式规则的上下文预测方法。它通过存根替换早期轮次已展示内容、把智能体自报完成的轮次折成一行笔记,并按分块渲染每隔几步重写一次缓存前缀;所有移除严格可逆,误删只需从历史恢复一次。
研究者提出 Nucleus Speculative Decoding(NSD),在标准接受规则之外引入目标模型 nucleus 判定,接受高可信度的草稿 token。理论分析给出单步误差与序列级保真界,实验显示吞吐量最高达自回归解码的 5.16 倍、标准投机解码的 3.15 倍。代码已在 GitHub 开源。
论文提出 SteerScope,一个双轴多维评测套件,用 15 项指标联合刻画引导结果与方法属性,覆盖目标效能、副作用、泛化与数据依赖性。研究在统一模型、任务与协议下对 4 个系列共 23 种方法(含 Prompting、LoRA、SFT 基线)进行基准测试,发现现有激活引导方法在效能与副作用的整体平衡上均未超过 Prompt Steering 基线,且两者存在稳定耦合。
DLoop 是一种循环式投机解码方法,在草稿模型保持高置信度时连续执行多个草稿阶段,再统一验证累积的草稿 token,从而减少目标模型前向传播次数。
论文提出 LORE-KV,一种免训练的 KV cache 驱逐方法,通过从冻结模型采样短自回归续写,用响应侧 query 状态估计 prompt-token 效用,无需辅助模型或训练。
研究者提出 HARP 框架,把每个智能体的私有偏好从提示词中移出,为每个智能体在有限候选偏好集上维护一个数值后验,并按贝叶斯规则闭式更新;语言模型只提供动作和逐候选似然,使估计与推理解耦。
论文提出 Insight Provenance 任务,判断审稿洞见源自人类、LLM 还是混合贡献,并构建 InsightProv-v0 数据集,含 4,057 篇论文与 12,660 条人类审稿,用 GPT-4o、Gemini 和 DeepSeek 模拟不同 LLM 参与度并做句子级标注。
TIDE 2.0 是一个 MIT 许可的开源引擎,将可替换识别器与键控匿名器分离,在机构自有硬件上运行。代理值以密码学生成且无存储链接表,日期按患者保留区间偏移,同一键下所有出现获得相同代理值,新键生成的结果无法与早期结果关联。
CroissantMiner 提出首个面向 Croissant 元数据端到端提取的基准,覆盖完整 Croissant schema 的核心与 Responsible AI(RAI)字段,含 602 篇论文,其中 102 篇有人工校验 gold 标注、500 篇有 LLM 生成 silver 标注。
Turnslide 提出一个全自动轻量级多轮数据合成框架,将每个 API 建模为有限状态机,生成状态合法的工具序列,并用单次 LLM 调用把序列转成完整样本。该方法不追求多样性,而是对轮数、工具序列和任务复杂度设定目标分布。在下游 SLM 微调中,其 FSM 生成数据显著优于未变异基线,达到 70.7% 全准确率(对比 63.4% 和 53.7%),且 token 用量减少 3.6-6.6 倍。
研究针对法译英生物医学翻译,协同应用知识蒸馏与量化压缩学生模型。结果显示模型体积减少 69%,推理速度提升 98.21%,CO2 排放降低 98.46%,且不牺牲翻译质量。实验还比较了多种微调策略,表明联合优化压缩技术适合资源受限的翻译服务场景。
提出条件锚定生成蒸馏(CAGD):保留少量旧 prompt,用冻结的前一模型重建补全与生成状态,并在学习下一任务时匹配其预测分布。
研究提出 NavTree,一种仅在叶节点输出的层级检索器:索引阶段零 LLM 调用,构建确定性平衡分段树,查询时以混合词频与稠密前沿游走从根节点导航到叶块。在匹配成本评测中,NavTree 是最强的匹配成本层级检索器,与最强扁平基线持平;在长文档多跳 QA 中,它是唯一在类对类基础上显著超过 BM25 的层级方法。
一项研究将奖励建模为响应空间上的分层函数,证明基于 Transformer 架构的 actor-critic 算法在查询预算与正则化强度上达到极小极大最优速率(对数因子内),并对固定提示数最优。研究对比指出,离线奖励建模中从固定参考分布采样会把遗憾衰减限制为对数速率。结果量化了在线策略探索对 RL 后训练的收益。
论文为正定金融时间序列的 log-vMEM 模型提出基于分层滞后结构的正则化估计,采用多元伽马误差分布与分块坐标下降算法,并用 GPU 加速数值积分以缓解对数似然计算瓶颈。研究组合三种滞后结构与四种惩罚函数,通过模拟检验参数恢复效果,并应用于 Microsoft(NASDAQ: MSFT)日内已实现波动率的联合动态建模。
论文评估了五类多列双样本漂移检测方法(边际、投影与核嵌入方法),在 Harvard Dataverse、Failing Loudly 复现(平均绝对误差 0.030–0.053)及 1.375 亿行 Trendyol 商品排序特征表上测试四类漂移。
论文针对逐元素 i.i.d. 对称 α-稳定重尾数据下线性回归经验风险最小化问题,给出预测性能的精确渐近刻画。研究引入描述每个系数对应随机有效问题的功能序参量,用 replica 方法在样本量与特征维度按固定比例发散的比例高维极限下完整表征泛化误差,并建立重尾普适律、典型误差与预测可靠性的标度律及 Bayes 最优预测误差。方法还适用于其他具有持续局部异质性的系统。
论文提出描述 GFlowNet 混合的通用理论框架,分为连续索引(CI)与离散索引(DI)两类。CI GFlowNets 可解释为随机特征展开,在图结构任务中提升采样器表达能力并通过谱平移降低学习不稳定性;DI GFlowNets 涵盖既有训练方法,并支撑新提出的 Stratum-Conditioned(SC)GFlowNets。
研究提出 BulkBoost 双带谱重加权框架,用固定秩与噪声校准两种变体,把低于 Marchenko–Pastur 噪声边的 bulk 与高于边的 spike 分开,仅靠一个共享的 bulk-to-spike 增益调整权重。
论文提出一种理论,解释多语言语言模型内层为何呈现相似的跨语言表征,即柏拉图表征假说。研究假设数据存在跨语言共享的抽象层级结构,并用共享上层生成规则的概率上下文无关文法生成合成语言,验证贝叶斯最优 next-token 预测器 belief propagation 的消息编码与 transformer 行为吻合。
论文研究高斯分布间 FID 估计的样本复杂度,给出经验 plug-in 估计器 Θ(d²/n) 偏差与 Θ(d/n + d²/n²) 方差界,证明其样本复杂度下界为 ≳ d²。
论文研究多步时间序列预测中的自监控测试时适应,指出监控与适应共用同一预测误差反馈时,重叠目标与误差依赖会破坏统计保证所需的可交换性假设。这会导致监控在无有害变化时误报,保护响应反而降低预测质量,且适应可能掩盖持续变化,而原始冻结模型保留更清晰信号。论文据此提出需检验监控假设、在真实反馈下对比适应与冻结模型并限制保护响应的影响。
论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。
VoxReason 提供一个 100 例验证器基准,固定每条语音、编辑一个指定来源标签线索,并对引用证据、八个规划字段和允许的响应打分。在 24 例来源键不相交测试中,来源情绪先验的规划槽准确率为 0.958,但必需变化准确率为 0.000;在 32 例情绪不相交测试中,两项分别为 0.219 和 1.000。该基准评估派生标签与结构化规划,不涉及音频输入、生成语音或听众判断。
研究者推出 AVMeme Exam,一个由人工标注、收录逾千个标志性网络音视频(涵盖语音、歌曲、音乐与音效)的多模态基准,每条 meme 配有一组从表层内容到上下文、情绪、用法与世界知识的 Q&A,并附年份、转录、摘要与敏感度等元数据。
研究者提出一种针对稀疏支持向量机(SVM)的高维统计推断框架,在样本量与特征数按比例增长的渐近区间内,通过将 L1-惩罚 SVM 表示为线性规划并利用对偶变量识别 hinge 损失次梯度,构造出计算可行的去偏估计量,其坐标渐近服从高斯分布。该框架可为单个特征提供置信区间与假设检验,并支持错误发现率控制的变量选择,在强相关设计下完成仿真校准与功效分析,并应用于高维乳腺癌基因表达数据。
该研究针对公平多臂老虎机问题,提出轨迹式 Nash 遗憾 $\widetilde{\mathrm{NR}}_T$ 与高概率 Nash 遗憾 $\widehat{\mathrm{NR}}_T$,在完整样本路径上计算几何平均,弥补现有定义忽略各轮奖励联合分布的不足。
WorldSonus 是一个面向世界模型的交互式视频转音频框架,用于实时空间声音合成。它采用流式因果自回归扩散架构,以 0.41 的实时因子(RTF)合成音频块,并通过以音频为中心的字幕管线与按块索引的提示词调度实现生成中的动态声音控制。实验显示,WorldSonus 在开放域视频转音频基准上可匹配或超越现有双向模型的声学质量与空间对齐表现。
论文证明在高维情形下,梯度 EM 学习高斯混合模型所需的真成分间最小分离度 Ω(√d) 的维度依赖不可避免。研究针对混合权重用标准 EM 更新、成分均值用梯度 EM 更新的混合算法,证明对任意 ε>0,当维度足够大时,Ω(d^{0.5-ε}) 量级的分离度在最坏情况下不足以保证随机初始化下总体梯度 EM 在亚指数时间内全局收敛,即便在过参数化设定下也成立。
论文提出 AV-NeuroAMP,一个端到端视听框架,整合噪声语音、目标说话者视频与听者听力图,联合完成语音增强、个性化放大与动态范围压缩,并引入听力图条件特征线性调制(AC-FiLM)融入个体听力特征。
HINTT 系统提交至第 2 届多语种会话语音语言模型挑战赛(MLC-SLM),研究多语种说话人归属 ASR。最终方案采用级联管线:微调 DiariZen 说话人日志模型、微调 Qwen3-ASR,并加 LLM 生成式纠错;对照组用相同官方训练数据微调 VibeVoice-ASR 作为统一模型。实验显示级联系统在 MLC-SLM Task 1 条件下更可靠,统一语音 LLM 是有前景的方向。
研究者提出面向金融领域的 Text-to-SQL 系统 Financial LINking Text-to-SQL(FLINT),以解决通用系统在生产金融数据库上准确率低于 50% 的问题。
Zephon 是一款面向基础模型的数据加载器,支持在线、有状态管线,同时提供弹性确定性与高效的检查点恢复。它将全局流划分为与拓扑无关的 lane,序列化排序决策并并行化无状态工作,仅检查点有限的飞行中状态,使恢复成本不随训练进度增长。在文本与视觉-语言工作负载上,Zephon 实现了具有竞争力的吞吐量,并提供现有加载器对在线有状态管线所不具备的保证组合。
论文提出用「状态足迹」描述 AI 智能体在本地上下文、编排器与外部系统间读写的状态,把多智能体系统(MAS)协调转化为数据管理问题。当前编排器不追踪智能体读写状态,即使简单编码任务也会出现并发异常。智能体无法像数据库事务那样基于固定模式或隔离快照读取、失败后确定性重放,但可语义化解决冲突而非中止,为新一代编排器与事务接口提供方向。
RaBitQ-SSD 扩展 IVF-RaBitQ,用于向量集合超出 DRAM 容量时的 SSD 常驻近似最近邻搜索。它提出 Split-RaBitQ,在 DRAM 中保留每个二进制码的可配置前缀,使内存码存储低于每维 1 bit,并提供带概率误差界的一致距离估计,从而在候选列表内做更细粒度剪枝;异步搜索流水线协调候选剪枝与 SSD 读调度,减少不必要读取并重叠 I/O 与计算。
FrugalEvo 提出成本感知演化框架,用高成本 LLM 探索策略、低成本 LLM 实现并迭代优化代码,并以 BA-AUC 衡量固定预算内的解题质量。
提出一种让策略在无监督条件下在线恢复分布偏移的方法,控制器由多个观察随机掩码子集的循环网络组成,通过序列卡尔曼融合合并高斯输出。部署时将共识视为自监督标签并按卡尔曼增益补数缩放各成员贡献,用 RFLO 近似实时循环学习在每个环境步后更新参数。仿真连续控制任务显示该方法在传感器偏移后恢复接近原性能,而观察完整观测的集成无法恢复。
研究者将演化框架 EXAQC 扩展到图像分类,自动发现参数化量子电路(PQC)作为中间处理模块,同时保留经典特征提取与预测层。
一项针对冻结 SpikeSCR 语音分类器的研究显示,聚合准确率无法揭示局部脆弱样本与内部活动变化。该分类器在 100 条验证语音上达到 86.0836% 验证准确率,等源期望准确率从 84.00% 升至 84.54%,但 84 个初始正确源中有 13 个存在不利邻域,其中 5 个源贡献了 93.21% 的不利迁移。