Skip to content

#arXiv

152 today
TodayOct 7Wed
  1. arXiv · Artificial Intelligence35

    VLM 何时该反思:MOTIVE 学习多视角自验证

    研究者提出 MOTIVE 框架,用多视角自验证与可靠性引导的选择性反思提升视觉语言模型(VLM)多模态推理的可靠性。MOTIVE 从互补验证视角评估候选答案,学习与正确性对齐的可靠性分数,在推理时据此决定直接接受还是触发历史引导的反思。实验显示其在多个多模态基准和 VLM 骨干上优于强自验证与自纠正基线,并减少不必要的推理轮次,无需外部评判。

  2. arXiv · Multiagent Systems36

    关于 AI 智能体的可审计声明

    论文提出判定 AI 智能体声明可审计的条件:声明须先明确其策略、范围、可裁决记录及记录写入者,并在判定前固定决策规则。研究将 Auditable Agents 框架的可检查性维度扩展到声明层面,补充独立记录覆盖、授权绑定动作参数、完整性三项条件,并用声明核查表分析六类常见声明,锚定 NIST、IETF、OWASP 草案。

  3. arXiv · Artificial Intelligence28

    TopoPlanner:面向 LLM 智能体的胞腔工作流复合体拓扑一致任务规划

    TopoPlanner 提出拓扑一致规划框架,将工具依赖图提升为胞腔工作流复合体,作为 LLM 工具规划的拓扑感知上下文。它通过余层一致胞腔检索获取请求相关闭子复合体,在检索拓扑上做多维结构推理,并接入规划 LLM 生成工具序列。在四个工具规划基准的 loop、merge 与 loop-merge 工作流上,TopoPlanner 在不同本地 LLM 骨干上均优于 prompt 与图增强基线。

  4. arXiv · Artificial Intelligence45

    EPOCH:通过证据治理搜索实现可靠发现

    EPOCH 是一种证据治理架构,通过任务契约、类型化记忆、主动证伪、准入检查与独立回放,让候选结果按其所支持主张的强度与范围接受评估。它在 AlgoTune 上取得 SOTA,标准化平均分 0.65 对最强基线 0.53,内部 Math14 套件均分 0.57,并在 AgentHPO 描述性聚合中领先。覆盖十个发现问题,涵盖可执行构造、算法优化、反例与有证明支持的结果。

  5. arXiv · Robotics24

    多楼层物体导航的模块化策略学习:面向诊断研究的因子化框架

    该论文提出一个模块化诊断框架,用可学习的因子化策略分析多楼层物体导航(ObjectNav)中的失败因素,将单一全局策略分解为楼层内探索策略与楼层间切换策略。楼层内轻量策略通过蒸馏视觉语言模型(VLMs)的探索逻辑,为强化学习(RL)提供有效初始化;在理想化假设下,因子化策略在策略表示层面与单一全局策略理论等价。实验表明,感知性能与爬楼稳定性是多楼层导航的主要瓶颈。

  6. arXiv · Human-Computer Interaction34

    SPEAR:交互式人机对齐的五项原则

    该论文提出 SPEAR 框架,把人机对齐从部署前的偏好学习与微调,重新定义为持续的交互设计问题。SPEAR 包含五项支柱:Specification(意图表达与共识建立)、Process(智能体何时行动、询问、延后或暂停)、Evaluation(用户如何判断成功)、Adaptation(智能体随重复使用适应用户)与 Recalibration(用户调整信任与预期)。

  7. arXiv · Computer Vision24

    Dual-FDM:在频率感知扩散模型中解耦双图像参考以实现个性化生成

    论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。

  8. arXiv · Computer Vision47

    PhysLDM:用于高保真可变形模拟的潜在扩散模型

    PhysLDM 提出统一的潜在扩散范式,用于一次性体积可变形模拟,核心为整体时空 VAE,在米级场景上实现约 2.48 mm 重建精度与最高 78x token 压缩。研究发现复杂可变形动力学常呈混沌,确定性回归易产生非物理平均,扩散模型更能刻画其分布。PhysLDM 仅在 Objaverse 规模数据集上运动学训练,可零样本泛化至 GSO 与 Toys4K,并支持逆问题求解与高阶设计优化。

  9. arXiv · Computer Vision24

    AIMS:锚点整合多视角合成,实现可扩展新视角渲染

    AIMS 提出锚点整合多视角合成框架,用最远点采样选取固定数量的空间分布锚点,将邻近观测通过轻量可学习积分器融合进锚点表示,使可用观测数与全局模型处理的视角数解耦。在 RealEstate10K 与 ScanNet 上分别取得 29.41 dB 和 17.73 dB PSNR,平均每视角渲染 7.24 ms,质量—效率权衡优于 transformer 与 Gaussian 基线。

  10. arXiv · Computer Vision35

    GeoWM:在显式几何中实现高效直接世界建模

    GeoWM 直接在指定未来时点预测场景几何,无需递归 rollout。它用几何基础模型把观测 RGB 帧转为几何历史,条件化 flow-matching transformer 预测未来几何,并以轻量相机运动预测器提供几何先验。在覆盖城市驾驶、空中飞行与动态操作的四个数据集上,GeoWM 在深度、相机位姿与 3D 场景几何预测上优于所评估的世界模型,且长时点推理时间大幅降低。

  11. arXiv · Computer Vision21

    面向战术战伤救治的基于条令的视觉问答数据集 TC3-VQA

    研究者发布 TC3-VQA 数据集,用于把战伤救治中的视觉观察与临床条令对应起来。数据集来自公开 TC3 教学与现场视频及权威文档,含 581 个条目、覆盖 11 个概念、1,860 个问题,涵盖干预识别、条令、临床推理、程序指导和视觉信息不足时的拒答;答案保留原文片段与字符偏移,并附设备框、解剖标签、时间片段和来源元数据。

  12. arXiv · Computer Vision25

    What Words Keep of a Place:跨视角地理定位的零样本语言推理研究

    研究提出零样本跨视角地理定位方法,用多模态大语言模型(MLLM)把地面全景与卫星瓦片描述成结构化文本并比对,全程无需训练。在 9,826 对 VIGOR 数据上,全库按描述相似度排序 Recall@1 仅 0.39%;缩到 10 个邻近瓦片后,MLLM 评判器将随机排序效果翻倍并追平强词法基线,还能指出字段一致或冲突。

  13. arXiv · Computer Vision14

    基于深度学习的板球违规投球动作检测

    论文提出一种基于计算机视觉的深度学习方法,用于在板球直播比赛中检测违规投球动作。系统从投球视频中识别肩部帧与出手帧,计算两帧间投球手臂角度变化,超过预设阈值(如 15 度)即判定为可能违规。研究使用 62 个视频、11 名男性投手的数据集进行评估,取得较高真阳性率,但数据集以右手常规动作为主,仍需更大规模与多样化环境验证。

  14. arXiv · Computer Vision21

    面向通用少样本类增量学习的生成数据筛选方法

    论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。

  15. arXiv · Computer Vision24

    IAU-FOA:面向闭源 MLLM 的可迁移对抗攻击视觉不变性增强特征最优对齐方法

    论文提出 IAU-FOA,一种面向闭源 MLLM 的可迁移对抗攻击方法,通过视觉不变性增强与自适应不平衡传输改进目标迁移性。该方法在全局与局部层面对齐对抗样本与目标样本:余弦目标缩小全局语义差距,patch token 聚类后经最优传输做细粒度对齐,并对弱匹配簇采用置信度自适应不平衡传输。实验显示 IAU-FOA 在开源与闭源 MLLM 上均优于现有可迁移攻击方法,代码已开源。

  16. arXiv · Computer Vision44

    医学图像对齐评估作为前沿多模态模型通用视觉推理的测试

    前沿多模态大语言模型在医学图像对齐评估上正达到拐点,数月前发布的模型泛化较差、部分场景接近随机水平,而 GPT-6 在几乎所有测试场景中超过 85%。研究比较了提示策略、图像呈现方式,以及本地微调 MLLM 与任务专用 CNN:微调模型在训练任务上可匹敌或超越前沿模型,但迁移到未见场景明显更弱。医学图像对齐由此成为通用视觉推理的有效测试平台。

  17. arXiv · Computation and Language27

    跨分词器在线策略蒸馏:为何应从对齐覆盖转向监督可靠性

    论文提出,在线策略蒸馏(OPD)在跨分词器场景下,严格的 1:1 对齐已覆盖多数学生模型生成的 token。在数学推理与代码生成的三组异构师生模型上,将反向 KL 限制在共享词表的 top-16 子集,准确率可媲美全共享词表 OPD 并优于对比基线。span 监督虽实现全覆盖却降低准确率,论文据此主张优先保证监督可靠性而非扩大对齐覆盖。

  18. arXiv · Computation and Language25

    罚金式无正确选项 MCQA:分析 LLM 在选项全部无效时的弃权行为

    研究者提出罚金式无正确选项 MCQA 设定,在 MMLU-Pro 数学子集中移除标注的正确选项,允许模型选择剩余选项或输出 ABSTAIN,并对被迫作答的无效响应施加惩罚。研究进一步引入正确条件分析,仅在模型原本答对的样本上评估弃权表现。结果显示,高 MCQA 准确率并不能保证弃权可靠性,即使在明确提示无正确选项并采用罚金评分时,模型仍会对部分原本答对的样本给出无效强制选择。

  19. arXiv · Computation and Language24

    ARIA:面向粤语歌词创作的音频驱动旋律—声调关系建模

    ARIA 是一个两阶段音频驱动框架,从带字符级时间戳的演唱录音生成粤语歌词。它用 TRATE 从时间戳音频预测 0243 序列,再用 DRA-TCLG 基于预测声调方案与检索增强词汇引导生成流畅歌词,并构建大规模音频—粤拼—0243 数据集。实验显示其在 0243 预测与声调一致歌词生成上表现强,论文被 EMNLP 2026 Findings 接收。