跳到正文

#arXiv

今日 152 条
10月5日周一
  1. arXiv · Computer Vision18

    空间落地手势生成基准

    研究者提出空间落地手势生成基准,含约 2K 条来自自然 VR 对话的指向标注片段与真实 3D 指涉对象,要求系统判断何时、如何及在何处指向,并分离时间对齐、空间落地与自然度三项评估。该基准提供流匹配基线 MM-Conv-Flow,与独立检索系统和真人动作对比后发现,几何落地可超过真人指向但自然度并无提升。这是 ECCV 2026 HSI Workshop 指涉手势挑战赛基准。

  2. arXiv · Computer Vision37

    NegT2IBench:否定如何改变画面——面向文本到图像模型的极性基准

    研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。

  3. arXiv · Computer Vision26

    ReSCUE:面向未切分长视频的同传手语翻译重译与句子提交框架

    ReSCUE 提出面向未切分长手语视频的同传 SLT 统一框架,对齐真实流式条件下的训练与推理。框架结合推理感知训练、稳定重译与句子提交机制,处理部分输入、非手语停顿与多句上下文。标准句级基准上延迟更低、低延迟下翻译质量最佳;长视频数据集上接近使用真实句边界的离线 oracle 系统,且延迟显著更低。

  4. arXiv · Computer Vision19

    RYOPO:将端到端类别级物体位姿估计带入实时

    RYOPO 提出端到端可训练的查询式 RGB-D 集合预测器,联合完成检测、分割与 9-DoF 位姿估计,无需 CAD 形状先验或单独训练的实例分割器。共享图像与场景编码避免逐物体裁剪编码,在 NOCS 上显著优于已发表的 RGB-D 联合检测与位姿估计结果,并在 REAL275 与 HouseCat6D 全物体评估中达到与两阶段方法相当的性能。

  5. arXiv · Computer Vision42

    通过组合偏好与准则奖励后训练前沿文生图模型

    研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。

  6. arXiv · Computer Vision44

    预测空掩码为何胜过 SAM 3:重新审视视频目标分割评测

    研究者提出 FaVOS 基准,用于评估目标在长视频中仅间歇出现的低时间可见度场景下的视频目标分割(VOS)方法。在该场景下,标准 J&F 指标会把评测退化为“目标缺席分类”,空预测在目标缺席帧上获得高奖励,导致一个简单的空掩码预测器也能胜过 SAM 3 等强模型。为此论文提出 Volumetric J&F,将掩码序列作为时空体评估,削弱目标缺席奖励的主导地位,同时保留对分割质量与时间结构的敏感度。

  7. arXiv · Computer Vision27

    TRAC:面向高效自回归视频生成的轨迹感知复用与自适应校正

    论文提出免训练框架 TRAC,用于高效自回归(AR)视频生成,针对分块去噪轨迹顺序耦合导致近似误差累积与传播的问题,给出稳健累积调度(RCS)、自回归轨迹感知引导调度(ATGS)与谱结构校正(SSC)三个组件。在 SkyReels-V2 和 FramePack-F1 上实验显示,TRAC 相比现有方法取得最高推理效率与最佳生成质量。

  8. arXiv · Computer Vision27

    用谱对齐校正引导扩散轨迹

    论文提出 Spectral Correction Guidance,用谱对齐作为准则评估并校正引导扩散采样过程。该方法无需训练,可跨扩散骨干与条件生成任务使用,不修改底层模型。在 text-to-image 生成中较基线引导方法提升偏好指标,在 ImageNet 上优于 CFG,且在更少的去噪步数下仍保持改进。

  9. arXiv · Computer Vision30

    SymRegFlow:面向视频世界模型的对称正则化流匹配

    SymRegFlow 是一种对称正则化流匹配框架,可在无真值新视角 RGB 监督下实现连续视角的多视角一致视频生成。它将源视角几何扭曲为噪声锚点,结合掩码双锚点监督与跨锚点去噪输出一致性,并在仿射高斯代理下证明一致性正则化可恢复干净参考最优。在 nuScenes 上,其 FVD 较最佳基线降低超过 31%,FVD 与 FVMD 均为被评估基线中最低,源条件推理的 FID 与实例保持也最佳。

  10. arXiv · Computer Vision33

    GRAFT:通过持续教师蒸馏扩展聚合式基础模型

    研究者提出 GRAFT,一种持续多教师蒸馏框架,让统一骨干网络从开放式基础模型序列中逐步习得能力。新教师加入时,GRAFT 将已蒸馏模型作为教师以保留既有能力,学生同时从旧模型与新教师学习,并引入 Teacher Specific Readout Tokens 与 Geometry Agnostic Relational Loss 调和异构教师的表征几何。

  11. arXiv · Software Engineering35

    智能体基础设施验证套件中的判别式夹具覆盖

    论文将突变分析应用于多会话智能体状态投影层的不变式套件,发现常规验证会认证一个让移除事件身份去重的一阶突变体存活的套件。冻结修复后的十二项检查套件并对抗读者指定的十个突变体运行,杀死五个;五个存活者分为从未激活与内部状态损坏两种模式。作者枚举七个判别维度,按未覆盖维度各添加一个夹具并复用现有 oracle,五个存活者全部死亡,公开含冻结哈希与运行日志的 artifact。

  12. arXiv · Software Engineering23

    SimuVerity:面向工程级 Simulink 模型生成的智能体基准

    SimuVerity 是一个包含 101 个文本到可执行 Simulink 模型生成任务的基准,覆盖十个工程领域,用于评估智能体是否真正满足工程需求。其分层评估器先检查交付物、可执行性与工程合格性,再从六个维度打分;六个智能体系统的最佳总分仅 42.86。结果显示结构相似性不能代表工程性能,部分高分模型仍存在严重视觉布局混乱。

  13. arXiv · Statistics Machine Learning22

    DAGR:通过差分感知目标交叉注意力实现状态条件化目标表征

    论文提出 DAGR,用多尺度门控交叉注意力把任意后融合编码器的静态目标嵌入细化为状态条件化表征,并以门控残差和差分感知注意力规则约束细化过程。理论分析指出后归一化放置会破坏“闭合门时返回输入”的条件,在冻结检查点上造成损失,恢复该条件可部分挽回。OGBench 上 DAGR 改进导航任务、其他任务持平或落后于基线,消融显示增益来自门控残差而非差分偏置,代码已开源。

  14. arXiv · Statistics Machine Learning23

    贝叶斯混合模型的一种快速非可逆采样器

    论文提出一种新颖且简单的非可逆采样方案,用于贝叶斯混合模型(组件数固定或可变),在多种场景下显著优于经典采样器,尤其在收敛阶段和组件存在不可忽略重叠时。理论上,该非可逆方案的渐近方差不会比标准方案差超过 4 倍;尺度极限分析表明其可将收敛时间从 O$(n^2)$ 降至 O$(n)$。

  15. arXiv · Statistics Machine Learning18

    Score 扩散模型在最小数据假设下的 KL 收敛保证

    论文针对 score 扩散模型给出 KL 散度下的收敛保证,聚焦源自 Ornstein-Uhlenbeck 半群及其动力学对应版本的固定步长模型。研究放宽了以往要求 score 函数或其近似一致 Lipschitz 的限制,为任何对标准高斯分布具有有限 Fisher 信息的数据分布提供简单、改进且尖锐的 KL 收敛界。论文编号 arXiv:2308.12240v3。

  16. arXiv · Statistics Machine Learning16

    约束采样中的惩罚非可逆 Langevin 方法

    论文提出惩罚非可逆 Langevin 算法,用于从定义在紧凸集上的约束分布 π(x)∝e^{-f(x)}1_C(x) 中采样。算法将平方距离惩罚与保持惩罚 Gibbs 分布的常数或相容状态相关反对称扰动结合,在 log Sobolev 不等式下给出全梯度算法的非渐近全变差界,在随机梯度下建立 2-Wasserstein 界。