Skip to content

#arXiv

152 today
Oct 1Thu
  1. arXiv · Computer Vision38

    ReGain:在合成图像个性化中恢复主体保真度

    DreamBooth 微调合成图像会降低主体保真度,产生过饱和色彩和过多高频细节。研究者定位原因为分类器自由引导(CFG)的膨胀,并提出训练无关的 ReGain 校正,在采样时按频段缩放引导量。在 Stable Diffusion v1.5 上,ReGain 用 DINO、DINOv2 和 CLIP-I 衡量缩小了 51-64% 的主体保真度差距,同时保持文本对齐。

  2. arXiv · Artificial Intelligence37

    使用掩码扩散模型条件生成创意国际象棋谜题

    论文提出基于掩码扩散模型的条件生成方法,支持按战术主题和部分棋盘状态生成谜题。引入同步最佳走子预测辅助任务,将解唯一性提升11.6%、主题条件准确率提升2.5%;结合DDPO强化学习框架,使符合主题且唯一的局面产出率提高89.1%。作者首次发布开源权重模型,提供可控的创意生成新路径。

Sep 30Wed
  1. arXiv · Computers and Society31

    STRIDE:文本到轨迹跨场景自动对齐评估框架

    STRIDE 是首个评估场景描述与行人轨迹上下文一致性的自动化框架,基于社会学理论构建 VRDST 评估协议,将高层上下文分解为场景自适应行为问题,并通过确定性测量工具库得出可复现答案。STRIDE-Bench 包含 1K 场景、6K 行为问题和 11K 测量,覆盖 30 张真实地图,人类验证一致性达 80%。实验显示现有文本到轨迹模型的上下文对齐能力有限,细粒度上下文条件化仍存在挑战。

  2. arXiv · Statistics Machine Learning14

    Fitted Q-Iteration 有限样本理论:动作作为函数时的折扣无限时域研究

    summary_zh: 论文研究折扣无限时域下拟合 Q 迭代(FQI)在函数动作空间中的有限样本理论,针对函数动作缺乏勒贝格密度、传统覆盖条件过强、函数动作空间过大导致贪心优化困难三个挑战,引入基于评论器的相对覆盖条件并给出学习策略遗憾的多项式衰减界。

  3. arXiv · Robotics45

    合作式多智能体视觉-语言-动作模型通过强化微调

    提出三阶段强化微调(RFT)流水线训练多智能体VLA模型,在RoboTwin、RoboFactory和真实场景双臂Franka机器人任务上平均成功率分别提升23.1%、16.4%和44%。该方法基于π₀和π₀.₅骨干网络,通过初始化感知数据采集、离线信用筛选微调与潜在空间在线微调三阶段实现多机器人协作。代码已公开。

  4. arXiv · Computer Vision50

    PreviewDiff:多模态评判引导的扩散模型潜在空间搜索

    PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。

Sep 29Tue
  1. Hugging Face Blog51

    ProvenanceGuard:面向 MCP Agent 的来源感知事实核查

    Multiverse Computing 提出 ProvenanceGuard,在 MCP agent 回答后逐条核查 claim 与来源是否匹配,而非把所有证据混合后判断。测试中它从 139 条应被拦截的 claim 中拦下 138 条,并对来源识别正确的比例约 86%。该方法可对接 RARR 修复循环,在本地配置下每条回答约增加半秒开销。

Sep 3Thu
  1. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    Why it matters: 单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

Sep 2Wed
  1. Hugging Face Blog56

    BenchMIRT:LLM 基准实际上在测量什么?

    Allen AI 提出 BenchMIRT,用多维项目反应理论逐题审计 LLM 基准,从 100 个模型、16 个基准、34K+ 题中独立恢复出安全与推理两个维度。分析显示 BBQ、WMDP 等基准的得分更依赖推理能力;保留 10% 题目仍能维持排名,模型在未见过题目上的预测准确率达 79%。

May 13Wed
  1. ScienceDaily · AI49

    量子算法破解超大规模准晶体材料模拟难题

    阿尔托大学研究团队开发了一种量子启发式算法,可在瞬间模拟包含超过 2.68 亿个位点的非周期量子材料,远超传统超级计算机能力。该算法将准晶体问题编码为量子多体系统,利用张量网络实现指数级加速,为拓扑量子比特和超摩尔超准晶体的设计铺路。研究目前仍处于理论模拟阶段,未来可适配至芬兰量子计算基础设施上的实际量子硬件。