Skip to content

#图像生成

35 today
TodayOct 7Wed
  1. arXiv · Artificial Intelligence21

    谱扩散的能量条件噪声调度与白化方法

    论文提出能量自适应噪声调度与白化策略,用于变换域扩散模型,将全局谱白化与按变换系数能量及图像相关能量路径联合调制的噪声分配结合。该方法保持高斯过渡与闭式边缘分布,兼容标准 DDPM 和 DDIM,无需修改扩散架构。CIFAR-10 实验将紧凑 DCTdiff U-Net 变体的 Fréchet Inception Distance 从 142.48 降至 100.45。

  2. arXiv · Computer Vision24

    Dual-FDM:在频率感知扩散模型中解耦双图像参考以实现个性化生成

    论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。

  3. arXiv · Computer Vision17

    REViT-v2:分层窗口化旋转反射等变 ViT,用于等变特征提取

    研究者提出 REViT-v2,一种基于窗口化群卷积自注意力与分层特征架构的可扩展旋转群等变视觉 Transformer。该方法可扩展到参数量达数百万的群等变 ViT,并在 ImageNet 等实际尺寸的大规模数据集上验证。代码与预训练权重已开源,论文被 NeurIPS NeurREPS workshop 2026 接收。

  4. arXiv · Computer Vision43

    SRIM:抗缩放的图像防护扰动,抵御恶意编辑

    SRIM 把照片缩放建模为频率选择信道,在多个锚点尺度上采样扰动并偏向当前最弱尺度,以应对未知缩放因子。在 9 至 30 兆像素照片、2 至 8 倍缩放下,SRIM 将 FLUX.2-klein 编辑的最坏破坏度从已发表最强防护的 0.192 LPIPS 提升到 0.463;同等可见度下防护约翻倍,并对 9B 模型、FLUX.2-dev 与 InstructPix2Pix 同样有效。

  5. arXiv · Computer Vision28

    ElasticFit:基于 VLM 推理与生成式适配的拟合感知 3D 物体插入

    ElasticFit 是一个 VLM 引导的拟合感知 3D 物体插入框架,通过场景接地表示把语言指令与渲染观察转化为落点、占据体积、朝向与适配模式(刚性放置、均匀缩放或弹性拟合)等结构化约束,再生成场景条件物体先验、重建 3D 并按模式细化网格,强制碰撞规避、接触一致与物理接地。

  6. arXiv · Computer Vision23

    WildMatch:基于弱监督的图像匹配器自适应方法用于野生动物重识别

    WildMatch 提出一种仅用身份标签、无需关键点或几何对应标注的弱监督方法,对预训练关键点匹配器进行自适应。该方法用预训练匹配器挖掘信息量大的图像对,从身份一致性中导出弱正负监督,并对比微调匹配网络,强化同身份对应、抑制异身份对应。在开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。

  7. arXiv · Computer Vision27

    LAO-X:无需人工标注即可在 X 光安检扫描中定位任意物体

    研究者提出自监督框架 LAO-X,可在 X 光安检扫描中定位任意物体,全程无需人工标注。LAO-X 通过显著性引导的 X 光物体挖掘模块与物理引导合成生成多样图像—标注对,并用遮挡控制课程策略微调 Segment Anything Model 2(SAM2)定位器。在六个 X 光基准测试中,LAO-X 在重度杂乱场景下较 SAM2 及 X 光专用基线取得 2% 至 23% 的 mAP 提升。

  8. arXiv · Computer Vision31

    HCMAN:面向低收入临床环境的乳腺癌早期检测混合跨模态注意力网络

    论文提出混合跨模态注意力网络 HCMAN,用 transformer 跨模态注意力机制融合乳腺 X 光图像与结构化临床数据。模型基于埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张乳腺 X 光图像验证,准确率 97.8%、灵敏度 97.2%、特异性 98.3%、AUC 0.987,显著优于仅用图像的基线。

  9. arXiv · Computer Vision21

    面向通用少样本类增量学习的生成数据筛选方法

    论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。

  10. arXiv · Computer Vision34

    UniPro:从 2D 图像到 3D 体数据的统一多模式医学图像分割

    研究者提出 UniPro,用传播机制把 2D 分割扩展到 3D 体数据,统一语义、上下文、交互和传播四种分割模式。模型以类别先验、参考样本、用户点击和相邻切片预测作为条件输入,并引入双向与 3D 监督提升传播可靠性。实验显示其在多模态、多解剖结构上表现稳健,可从稀疏 2D 初始化实现标注高效的 3D 分割,减少逐切片校正工作量。

  11. arXiv · Statistics Machine Learning29

    扩散模型的特征信息动力学

    论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。

  12. SiliconANGLE · AI49

    Gamma 5 重塑演示平台,让 AI 生成内容更接近人工设计

    Gamma 推出重建版平台 Gamma 5,通过全新编辑器、更强的 AI 智能体和扩展至数千套的视觉模板库,减少 AI 演示文稿常见的版式重复与“AI 味”。平台整合 20 余个 AI 模型(含 Anthropic、OpenAI、Google)及多个图像生成器,智能体可在沙箱中生成图像、操作文件、联网检索并自检输出。

Oct 6Tue
  1. SiliconANGLE · AI44

    Gamma 5 重构演示平台,让 AI 生成内容更接近人工设计

    Gamma 推出重构版演示平台 Gamma 5,新编辑器、AI 智能体和视觉样式库支持智能体在沙箱中生成图像、操作文件、联网检索并自查输出,模板库扩至数千套。平台整合 20 余个 AI 模型(含 Anthropic、OpenAI、Google)及约 20 个连接器,导入材料的视觉准确率基准从约 30% 升至 97% 以上。

Oct 5Mon