VLM 何时该反思:MOTIVE 学习多视角自验证
研究者提出 MOTIVE 框架,用多视角自验证与可靠性引导的选择性反思提升视觉语言模型(VLM)多模态推理的可靠性。MOTIVE 从互补验证视角评估候选答案,学习与正确性对齐的可靠性分数,在推理时据此决定直接接受还是触发历史引导的反思。实验显示其在多个多模态基准和 VLM 骨干上优于强自验证与自纠正基线,并减少不必要的推理轮次,无需外部评判。
研究者提出 MOTIVE 框架,用多视角自验证与可靠性引导的选择性反思提升视觉语言模型(VLM)多模态推理的可靠性。MOTIVE 从互补验证视角评估候选答案,学习与正确性对齐的可靠性分数,在推理时据此决定直接接受还是触发历史引导的反思。实验显示其在多个多模态基准和 VLM 骨干上优于强自验证与自纠正基线,并减少不必要的推理轮次,无需外部评判。
论文提出判定 AI 智能体声明可审计的条件:声明须先明确其策略、范围、可裁决记录及记录写入者,并在判定前固定决策规则。研究将 Auditable Agents 框架的可检查性维度扩展到声明层面,补充独立记录覆盖、授权绑定动作参数、完整性三项条件,并用声明核查表分析六类常见声明,锚定 NIST、IETF、OWASP 草案。
TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。
论文提出检索准入验证框架,将每个记忆-查询对判定为 admissible、inadmissible 或 unresolved,并在匹配 required-evidence recall 下比较路由。
论文提出按断言语义类别设定置信门槛的 Agent 记忆保留策略,对证据充分的类别宽松保留、对推断不可靠的类别更严格弃权。
EPOCH 是一种证据治理架构,通过任务契约、类型化记忆、主动证伪、准入检查与独立回放,让候选结果按其所支持主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA,标准化平均分 0.65 对最强基线 0.53,内部 Math14 套件均分 0.57,并在 AgentHPO 描述性聚合中领先。覆盖十个发现问题,涵盖可执行构造、算法优化、反例与有证明支持的结果。
论文提出 Trust-Gated Capability Control,将五层信任栈落地为可运行机制,以打破多智能体 LLM 系统中的信任-脆弱性悖论。方案包含跨层协同算子、基于无遗憾在线估计器的逐层重要性权重,以及仅在综合信任与前置层达到阈值时发放短期可撤销能力授权。
该论文提出一个模块化诊断框架,用可学习的因子化策略分析多楼层物体导航(ObjectNav)中的失败因素,将单一全局策略分解为楼层内探索策略与楼层间切换策略。楼层内轻量策略通过蒸馏视觉语言模型(VLMs)的探索逻辑,为强化学习(RL)提供有效初始化;在理想化假设下,因子化策略在策略表示层面与单一全局策略理论等价。实验表明,感知性能与爬楼稳定性是多楼层导航的主要瓶颈。
该论文提出 SPEAR 框架,把人机对齐从部署前的偏好学习与微调,重新定义为持续的交互设计问题。SPEAR 包含五项支柱:Specification(意图表达与共识建立)、Process(智能体何时行动、询问、延后或暂停)、Evaluation(用户如何判断成功)、Adaptation(智能体随重复使用适应用户)与 Recalibration(用户调整信任与预期)。
论文提出“视觉编排税”概念,指智能体 VLM 流水线中语义未变的图像被重复重建为图像条件请求,并给出测量到认证的框架。审计指标 M1_trace 与 M2 在 SeeingEye 和 MAMMQA 上发现 66.8–75.6% 视觉证据触碰冗余。
SWORD(Simulation-driven Workflow and Prompt Optimization with Role-based Design)框架被提出,用于联合优化多智能体工作流拓扑与自然语言提示词,仅依赖标量任务指标,无需领域初始化或任务特定工程。
GameGo 提出一个可扩展框架,把简短游戏种子转化为基于行业游戏开发实践的完整 Product Requirements Documents,并用任务特定动态压缩在保留核心玩法约束的同时不限制设计探索。
一项研究提出免训练的 late-concentrated power-law token 削减调度,在不增加推理成本的情况下提升 Vision Transformer 在分布偏移下的精度。
研究提出 Foveated Compression,在固定 token 预算下用一次全分辨率编码混合原生与压缩分辨率视觉 token,并借 Foveated Merger 与 Foveated Selector 选择九个空间格之一保留原生分辨率。
论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。
PhysLDM 提出统一的潜在扩散范式,用于一次性体积可变形模拟,核心为整体时空 VAE,在米级场景上实现约 2.48 mm 重建精度与最高 78x token 压缩。研究发现复杂可变形动力学常呈混沌,确定性回归易产生非物理平均,扩散模型更能刻画其分布。PhysLDM 仅在 Objaverse 规模数据集上运动学训练,可零样本泛化至 GSO 与 Toys4K,并支持逆问题求解与高阶设计优化。
AIMS 提出锚点整合多视角合成框架,用最远点采样选取固定数量的空间分布锚点,将邻近观测通过轻量可学习积分器融合进锚点表示,使可用观测数与全局模型处理的视角数解耦。在 RealEstate10K 与 ScanNet 上分别取得 29.41 dB 和 17.73 dB PSNR,平均每视角渲染 7.24 ms,质量—效率权衡优于 transformer 与 Gaussian 基线。
GeoWM 直接在指定未来时点预测场景几何,无需递归 rollout。它用几何基础模型把观测 RGB 帧转为几何历史,条件化 flow-matching transformer 预测未来几何,并以轻量相机运动预测器提供几何先验。在覆盖城市驾驶、空中飞行与动态操作的四个数据集上,GeoWM 在深度、相机位姿与 3D 场景几何预测上优于所评估的世界模型,且长时点推理时间大幅降低。
研究以冻结的 V-JEPA 2 预测器隐藏物体,比较其预测与编码器表征:静止物体仅部分保留,被容器携带的物体完全不保留,移动物体在 0.3 秒内丢失(V-JEPA 自身 tube mask 下 0.5 秒,ViT-H 在 90% 掩码率下保留至 1.1 秒)。
研究者发布 TC3-VQA 数据集,用于把战伤救治中的视觉观察与临床条令对应起来。数据集来自公开 TC3 教学与现场视频及权威文档,含 581 个条目、覆盖 11 个概念、1,860 个问题,涵盖干预识别、条令、临床推理、程序指导和视觉信息不足时的拒答;答案保留原文片段与字符偏移,并附设备框、解剖标签、时间片段和来源元数据。
研究提出零样本跨视角地理定位方法,用多模态大语言模型(MLLM)把地面全景与卫星瓦片描述成结构化文本并比对,全程无需训练。在 9,826 对 VIGOR 数据上,全库按描述相似度排序 Recall@1 仅 0.39%;缩到 10 个邻近瓦片后,MLLM 评判器将随机排序效果翻倍并追平强词法基线,还能指出字段一致或冲突。
论文提出一种基于计算机视觉的深度学习方法,用于在板球直播比赛中检测违规投球动作。系统从投球视频中识别肩部帧与出手帧,计算两帧间投球手臂角度变化,超过预设阈值(如 15 度)即判定为可能违规。研究使用 62 个视频、11 名男性投手的数据集进行评估,取得较高真阳性率,但数据集以右手常规动作为主,仍需更大规模与多样化环境验证。
论文提出 Continuous Anchored Latent Reasoning(CALR),一种视觉潜推理方法,把渲染出的推导压缩为紧凑中间状态,并通过功能锚定连接潜状态形成与答案使用。
研究者发布 Robot-to-Robot Interaction(R2RI)数据集,号称首个专为机器人间交互(RRI)任务设计,包含多个人形机器人基于真实人类社会行为建模的交互。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅输入两张图像即可在单次前向传播中预测像素对齐的高斯基元,无需逐场景优化即可渲染新视角。
研究提出 Artemis,一种几何约束的多智能体驾驶世界模型,通过从多智能体观测重建显式 3D 世界地图来统一各智能体的 3D 状态,提升跨视角一致性并恢复视野外智能体。
DTFormer 是一个 RGB-D-Text 三模态语义分割框架,核心为 Text-guided Semantic Alignment Module(TSAM),将文本线索编码为语义原型,并在多个编码器与解码器层显式对齐 RGB-D 特征。
论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。
研究者提出 Hierarchy-GBP(H-GBP),一种迭代式两阶段框架,先用粗图近似求解全局误差并投影回原图,再用 GBP 细化局部误差。论文证明 H-GBP 收敛到最优,并在实验中显示其在线性稀疏图上比标准 GBP 收敛更快。
论文提出 IAU-FOA,一种面向闭源 MLLM 的可迁移对抗攻击方法,通过视觉不变性增强与自适应不平衡传输改进目标迁移性。该方法在全局与局部层面对齐对抗样本与目标样本:余弦目标缩小全局语义差距,patch token 聚类后经最优传输做细粒度对齐,并对弱匹配簇采用置信度自适应不平衡传输。实验显示 IAU-FOA 在开源与闭源 MLLM 上均优于现有可迁移攻击方法,代码已开源。
SynAM-E(合成增材制造事件)是首个面向金属增材制造熔池监测的公开多源模拟事件相机基准,含 15 个来源、8 个机构的 85 个物理校准事件分片。
BoT-Feedback 提出 Biomechanics of Thought(BoT)四阶段推理框架,将 MLLM 推理建立在结构化生物力学证据上,以生成可解释的人体动作反馈。
研究提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)把概念遍历建模为穿过中间状态的曲线,以一维坐标及其学习函数定义轨迹,使引导方向随概念变化且保持可解释。
前沿多模态大语言模型在医学图像对齐评估上正达到拐点,数月前发布的模型泛化较差、部分场景接近随机水平,而 GPT-6 在几乎所有测试场景中超过 85%。研究比较了提示策略、图像呈现方式,以及本地微调 MLLM 与任务专用 CNN:微调模型在训练任务上可匹敌或超越前沿模型,但迁移到未见场景明显更弱。医学图像对齐由此成为通用视觉推理的有效测试平台。
论文提出,在线策略蒸馏(OPD)在跨分词器场景下,严格的 1:1 对齐已覆盖多数学生模型生成的 token。在数学推理与代码生成的三组异构师生模型上,将反向 KL 限制在共享词表的 top-16 子集,准确率可媲美全共享词表 OPD 并优于对比基线。span 监督虽实现全覆盖却降低准确率,论文据此主张优先保证监督可靠性而非扩大对齐覆盖。
论文提出 Foresight-over-Graph(FoG),一个面向知识库问答的前瞻感知证据检索框架,用远到近反馈引导路径探索并维护紧凑记忆子图。在常用 KBQA 基准上取得 SOTA,CWQ 的 Hit 提升 16.58%,同时减少 LLM 调用与 token 用量;代码已开源。
论文提出“翻译同构假设”(TIA)在原理上对语用标记、敬语和历时分层术语等类型学概念不成立,并用 usage-cloud 框架形式化 α-unalignability,即无法同时保持词汇忠实与结构忠实的映射。
研究在 IndicMT Eval 上检验 COMET 分数的脚本不变性,发现脚本身份解释 native-script COMET 方差的 22.9%,且五种语言与标注者的一致性全部下降。
研究者提出罚金式无正确选项 MCQA 设定,在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性,即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。
ARIA 是一个两阶段音频驱动框架,从带字符级时间戳的演唱录音生成粤语歌词。它用 TRATE 从时间戳音频预测 0243 序列,再用 DRA-TCLG 基于预测声调方案与检索增强词汇引导生成流畅歌词,并构建大规模音频—粤拼—0243 数据集。实验显示其在 0243 预测与声调一致歌词生成上表现强,论文被 EMNLP 2026 Findings 接收。