跳到正文

#论文/研究

今日 570 条
今天9月30日周三
  1. arXiv · Computer Vision25

    OCA:ODE 驱动的跨注意力用于图像到点云配准

    OCA 通过常微分方程建模图像与点云的理想特征交互,改进跨注意力机制以缓解注意力模糊问题。该模块可无缝集成到现有 I2P 配准框架中,在四个公开基准数据集上,将配准召回率在标准、微调和零样本设置下分别最高提升 5%、9% 和 15%。论文已被 ECCV'26 接收。

  2. arXiv · Machine Learning21

    EN-HMTFL:面向车载自组织网络的分层联邦多任务学习

    EN-HMTFL 提出一种编码器共享的分层联邦多任务学习框架,车辆在本地保留任务专属解码器,仅通过层级结构交换全局共享编码器。实验在 MNIST 和 GTSRB 数据集上进行,相比表示共享基准准确率最高提升 24.0%,收敛场景最多减少 69 轮通信(28.8%)。原始数据和本地解码器参数始终保留在车辆端。

  3. arXiv · Robotics12

    跨异构机械臂的尺度不变可操作性形状跟踪

    提出一种尺度不变的可操作性形状跟踪方法,将仅相差正标量的矩阵视为等价并使用单位行列式代表元。在四台异构机器人上评估机器人间与人机迁移,所提方法在无需尺度调参时末端形状距离达 9.30×10⁻⁵,Full 方法在 KR500 和 UR20 上的轴比误差为 0.19–0.31;人机协同任务中末端位置误差为参考臂长的 2.4–5.6%,Full 方法最高达 75%。

  4. arXiv · Machine Learning36

    EHRFlow:从电子健康记录中学习连续患者轨迹的多边际流匹配框架

    EHRFlow 是一个多边际流匹配框架,通过编码患者历史条件化未来动力学,支持不规则观测时间与任意预测 horizon。在超过 100 万患者的真实临床数据集及独立外部验证队列上,EHRFlow 提升 horizon-averaged top-5 临床代码准确率,并在受控反事实模拟中近似降压干预的已知效果。

  5. arXiv · Artificial Intelligence35

    关系型基础模型在上下文学习中的支持集目标泄露:影响、检测与缓解

    关系型上下文学习(ICL)在支持集包含目标派生特征时会产生目标泄露失败模式,查询集本身不受影响。研究构建了14种合成泄露类型、对应20列,涵盖不同噪声、覆盖度、模态与关系距离。用冻结关系编码器加ICL头在RelBench数据库评估,Integrated Gradients可排序并移除可疑列,在泄露影响最大的设置下部分恢复性能。

  6. arXiv · Computation and Language40

    认知专家大语言模型与对应脑系统更一致

    研究通过提示和微调构建六个认知领域专家 LLM 变体,发现每个专家对相应脑区的预测更准确。该结论在三个基础模型和三个 fMRI 数据集上均成立,且仅认知领域干预有效。汇总对齐分数可能掩盖特定模型在区域上的差异。

  7. arXiv · Robotics42

    LexiconVLA:学习可复用的原子动作代码本以应对未见任务

    LexiconVLA 提出可检索的原子动作代码本,实现跨任务复用。全局与细节代码本分别捕捉共享交互结构与细粒度执行变化,通过视觉-原子动作对齐将轨迹重建与动作码视觉预测结合。在 26 个 RLBench 任务上,BridgeVLA 未见任务成功率从 16.67% 提升至 34.17%,整体达 71.08%,为已报告结果中最高。

  8. arXiv · Computation and Language28

    CineSubBench:基于多语言电影字幕评估大语言模型的长叙事与文化理解能力

    CineSubBench 是一个基于多语言电影字幕的长上下文理解评测基准,覆盖 1,012 部电影、6 种语言、6,072 条字幕轨道和 813 万条时间戳字幕条目。基准包含 7 项任务,涵盖叙事重建与抽象、类型预测、年龄适宜性、10 国电影分级系统及字幕语言安全。评测显示,9 个 LLM 中情节前提比完整梗概更易恢复,跨语言一致性差异显著,脏话比轻微粗俗更易定位。

  9. arXiv · Computer Vision38

    VidScribe:视频生成中视觉文本渲染与原地编辑的统一基准测试

    VidScribe 是一个覆盖 T2V、R2V、I2V、V2V 四种生成模式的视频文本诊断基准,包含 803 个人工验证样本和 12 轴正交因子空间。评测 11 个商业与开源系统后发现,视频文本能力非单一,I2V 最稳定,V2V 编辑是主要瓶颈,且退化集中在文本结构与时序因素。基准对齐的偏好优化可带来可测量的视觉文本生成提升。

  10. arXiv · Machine Learning42

    Dyad:通过原生类型化决策扩展大语言模型

    Dyad 在预训练 LLM 上附加环境条件动作编码器,并行嵌入候选动作描述并与模型内部状态打分。冻结 LLM 仅训练动作编码器在四个未见过环境中取得一致提升;联合优化在 ALFWorld 上相对 9B 模型获得 3.80% 绝对增益,同时改善通用知识、推理与编码能力。

  11. arXiv · Computer Vision48

    AffectReveal:基于事件的情感识别超越视觉表象

    AffectReveal 提出事件锚定情感识别(EGER),在 10,052 个视频和 10,734 张图像上构建 EGER-Bench,覆盖 11 种情感。实验显示事件上下文将人类识别准确率从 33.96% 提升至 72.08%。该框架无需微调,在三个下游模型和四种输入设置下平均 UAR 提升 5.26–10.53 点,未微调模型在 12 项对比中全部超越微调基线。

  12. arXiv · Robotics28

    运动学非线性时空轨迹扭曲用于接触丰富的灵巧操作演示

    该方法从手部和物体轨迹输入出发,输出考虑中间路径点、环境障碍、时间偏移和不同起止构型的高质量非线性轨迹扭曲。基于接触分布的利用,能够可靠地计算复杂高维灵巧手部轨迹。实验在公开人类手部运动数据集的 4 个演示共 12 种变体上进行基线对比,并展示了跨不同操作器的泛化能力,结果和代码将在发表时公开。

  13. arXiv · Machine Learning50

    Koa-action:面向生成式大语言模型的快速且一致的结构化决策框架

    Koa-action 将分类等原子动作约束为单 token 输出,通过监督微调实现确定性一步解码。在生产意图路由基准上达到 85.5% 准确率,与 Claude-4.8-Opus、Gemini-Pro-3.1 持平,领先 GPT-5 和 Gemini-2.5-Pro;响应约半秒,中位速度较前沿模型快最高约 7.5 倍,同时支持多模态输入与多标签输出。

  14. arXiv · Computation and Language34

    FastGuide 加速扩散大语言模型的奖励引导解码

    FastGuide 采用并行与自回归混合解码加速扩散语言模型的奖励引导,在三个奖励基准上比顺序奖励引导解码快 4.4×,生成质量相近。它每步一次奖励模型反向传播并复用 guidance 生成多个 token,利用 KV cache 和注意力稀疏重计算逐步 unmask token,并对模型不自信的 token 延迟解码。

  15. arXiv · Computer Vision23

    FM-ReID:选择性竞争 Token 路由用于目标重识别

    FM-ReID 提出一种端到端框架,将局部表征学习建模为选择性竞争 Token 路由。其 Competitive Fine-grained Mining 模块使用多个挖掘查询与一个残差查询竞争 DINOv3 稠密 Token,上方优先选择保留各挖掘查询分配的 Token,残差槽接收检索描述符排除的 Token。