Skip to content

#图像生成

29 today
TodayOct 7Wed
  1. arXiv · Artificial Intelligence21

    谱扩散的能量条件噪声调度与白化方法

    论文提出能量自适应噪声调度与白化策略,用于变换域扩散模型,将全局谱白化与按变换系数能量及图像相关能量路径联合调制的噪声分配结合。该方法保持高斯过渡与闭式边缘分布,兼容标准 DDPM 和 DDIM,无需修改扩散架构。CIFAR-10 实验将紧凑 DCTdiff U-Net 变体的 Fréchet Inception Distance 从 142.48 降至 100.45。

  2. arXiv · Computer Vision24

    Dual-FDM:在频率感知扩散模型中解耦双图像参考以实现个性化生成

    论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。

  3. arXiv · Computer Vision17

    REViT-v2:分层窗口化旋转反射等变 ViT,用于等变特征提取

    研究者提出 REViT-v2,一种基于窗口化群卷积自注意力与分层特征架构的可扩展旋转群等变视觉 Transformer。该方法可扩展到参数量达数百万的群等变 ViT,并在 ImageNet 等实际尺寸的大规模数据集上验证。代码与预训练权重已开源,论文被 NeurIPS NeurREPS workshop 2026 接收。

  4. arXiv · Computer Vision43

    SRIM:抗缩放的图像防护扰动,抵御恶意编辑

    SRIM 把照片缩放建模为频率选择信道,在多个锚点尺度上采样扰动并偏向当前最弱尺度,以应对未知缩放因子。在 9 至 30 兆像素照片、2 至 8 倍缩放下,SRIM 将 FLUX.2-klein 编辑的最坏破坏度从已发表最强防护的 0.192 LPIPS 提升到 0.463;同等可见度下防护约翻倍,并对 9B 模型、FLUX.2-dev 与 InstructPix2Pix 同样有效。

  5. arXiv · Computer Vision28

    ElasticFit:基于 VLM 推理与生成式适配的拟合感知 3D 物体插入

    ElasticFit 是一个 VLM 引导的拟合感知 3D 物体插入框架,通过场景接地表示把语言指令与渲染观察转化为落点、占据体积、朝向与适配模式(刚性放置、均匀缩放或弹性拟合)等结构化约束,再生成场景条件物体先验、重建 3D 并按模式细化网格,强制碰撞规避、接触一致与物理接地。

  6. arXiv · Computer Vision23

    WildMatch:基于弱监督的图像匹配器自适应方法用于野生动物重识别

    WildMatch 提出一种仅用身份标签、无需关键点或几何对应标注的弱监督方法,对预训练关键点匹配器进行自适应。该方法用预训练匹配器挖掘信息量大的图像对,从身份一致性中导出弱正负监督,并对比微调匹配网络,强化同身份对应、抑制异身份对应。在开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。

  7. arXiv · Computer Vision27

    LAO-X:无需人工标注即可在 X 光安检扫描中定位任意物体

    研究者提出自监督框架 LAO-X,可在 X 光安检扫描中定位任意物体,全程无需人工标注。LAO-X 通过显著性引导的 X 光物体挖掘模块与物理引导合成生成多样图像—标注对,并用遮挡控制课程策略微调 Segment Anything Model 2(SAM2)定位器。在六个 X 光基准测试中,LAO-X 在重度杂乱场景下较 SAM2 及 X 光专用基线取得 2% 至 23% 的 mAP 提升。

  8. arXiv · Computer Vision31

    HCMAN:面向低收入临床环境的乳腺癌早期检测混合跨模态注意力网络

    论文提出混合跨模态注意力网络 HCMAN,用 transformer 跨模态注意力机制融合乳腺 X 光图像与结构化临床数据。模型基于埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张乳腺 X 光图像验证,准确率 97.8%、灵敏度 97.2%、特异性 98.3%、AUC 0.987,显著优于仅用图像的基线。

  9. arXiv · Computer Vision21

    面向通用少样本类增量学习的生成数据筛选方法

    论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。

  10. arXiv · Computer Vision34

    UniPro:从 2D 图像到 3D 体数据的统一多模式医学图像分割

    研究者提出 UniPro,用传播机制把 2D 分割扩展到 3D 体数据,统一语义、上下文、交互和传播四种分割模式。模型以类别先验、参考样本、用户点击和相邻切片预测作为条件输入,并引入双向与 3D 监督提升传播可靠性。实验显示其在多模态、多解剖结构上表现稳健,可从稀疏 2D 初始化实现标注高效的 3D 分割,减少逐切片校正工作量。

  11. arXiv · Statistics Machine Learning29

    扩散模型的特征信息动力学

    论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。

Oct 5Mon
  1. arXiv · Machine Learning Theory30

    用于 Flow-Map 蒸馏的几何感知时间重参数化

    论文提出一种几何感知时间重参数化方法,为 Flow-Map 蒸馏中学生模型分配更多时间以学习教师生成 ODE 中法向加速度较大的轨迹段,同时保留教师几何路径与终端分布。该方法在蒸馏前一次性估计共享时钟,无需重新训练教师模型,也不增加学生参数或推理时的网络评估开销。在合成数据、CIFAR-10 和 CelebA-64 上,该方法在相同推理预算下优于恒等时间蒸馏,包括一步和两步图像生成质量提升。

  2. arXiv · Human-Computer Interaction29

    HandMade:用带部件标注的 VR 草图做生成式 3D 创作的空间提示词

    HandMade 提出一种结合 VR 3D 草图与语言的工作流,把粗略的带部件标注 3D 草图作为现有生成模型的空间提示词,而非待重建的几何体。它将分割后的 VR 笔触转换为多视角部件引导与结构化提示词,用户用 3D 草图指定物体布局与部件关系,用语言表达身份、材质、风格与局部细节。

  3. arXiv · Computer Vision33

    COFLOW:基于上下文流匹配的视觉生成自适应步数选择方法

    COFLOW 是一种推理时自适应方法,根据提示词特征为每次生成选择步数,以在线无监督奖励平衡推理效率与生成保真度。该方法即插即用、无需重训底层生成模型,可推广至图像与视频生成,实现超过 2.5x 加速并保持感知与语义质量。论文还给出标准正则性条件下 O(1/K) 前向欧拉离散化误差界,已被 NeurIPS 2026 接收。

  4. arXiv · Computer Vision22

    弥合研究与实践:通用模型与皮肤科专用模型在临床皮肤病变分类中的系统评估

    该研究在近期皮肤科数据集上系统评估了通用视觉语言模型、医学视觉语言模型、基础模型与皮肤科专用分类器,覆盖皮肤镜图像与智能手机临床照片。评估维度包括分布偏移、模态变化与人口统计学差异下的鲁棒性,以量化当前 SOTA 模型与临床部署要求的差距。论文共 10 页、1 幅图、3 张表,已被 MICCAI 2026 接收。

  5. arXiv · Computer Vision27

    CalCErt:医学图像分类中置信度校准的分箱认证

    CalCErt 是一种简单高效的后处理策略,可为任意预训练可微分分类器提供分箱置信度校准认证。该方法结合经验校准估计、统计集中界与置信函数的局部 Lipschitz 估计,在半径 R 的 ℓ2 球内推导最坏情况失校准的数据相关上界。在 11 项医学图像分类任务与多种对抗扰动上的实验显示,其认证覆盖率显著高于基线策略,同时保持有竞争力的紧致度。代码已开源。

  6. arXiv · Computer Vision37

    NegT2IBench:否定如何改变画面——面向文本到图像模型的极性基准

    研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。

  7. arXiv · Computer Vision42

    通过组合偏好与准则奖励后训练前沿文生图模型

    研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。