跳到正文

#图像生成

今日 35 条
10月2日周五
10月1日周四
  1. arXiv · Computer Vision38

    ReGain:在合成图像个性化中恢复主体保真度

    DreamBooth 微调合成图像会降低主体保真度,产生过饱和色彩和过多高频细节。研究者定位原因为分类器自由引导(CFG)的膨胀,并提出训练无关的 ReGain 校正,在采样时按频段缩放引导量。在 Stable Diffusion v1.5 上,ReGain 用 DINO、DINOv2 和 CLIP-I 衡量缩小了 51-64% 的主体保真度差距,同时保持文本对齐。

  2. arXiv · Computer Vision30

    PixelUMM:无需编码器的统一图像与视频理解与生成模型

    PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间处理图像与视频。图像表示为空间图块,视频表示为时空管状块,通过单层线性投影连接原始像素与共享多模态骨干网络。其混合 Transformer 架构结合共享注意力与任务特定参数,支持自回归文本预测和像素空间流匹配,在图像与视频理解及生成任务上取得竞争力表现。

  3. arXiv · Computer Vision31

    Modal Kinetic Typography:通过字体固有振动模态动画化矢量字形

    论文提出模态动力学排版(modal kinetic typography),通过矢量字形的有限元特征模态驱动动画,保持字形可读性并表达语义概念。方法使用冻结的视频扩散模型监督模态振幅与相位,相比 Dynamic Typography、AniClipart 和 Astra(GPT-6)在概念对齐、运动流畅度和字形完整性上更优,且人类评测者更偏好其结果,包括冻结字形仅靠运动的设置。

9月30日周三
  1. arXiv · Artificial Intelligence60

    CoRe:协同演化奖励模型以缓解视频扩散模型中的潜在奖励欺骗

    论文提出 CoRe 框架,通过让奖励模型与生成器共同演化来缓解视频扩散模型中的潜在奖励欺骗问题。固定潜在奖励会在数百次更新后导致分布逃逸,使奖励分数与感知和运动质量脱钩;CoRe 在生成器当前样本上持续重训练奖励模型并锚定真实视频偏好,在 Wan2.1-T2V-1.3B 上相比预训练模型和先前对齐方法持续提升生成质量,并避免固定奖励优化的质量崩溃。

    推荐理由:固定奖励信号会让视频生成模型在潜在空间偏离数据分布,CoRe 通过奖励模型与生成器共同演化来缓解这一问题,为视频扩散模型的对齐提供了可迁移的动态训练视角。

  2. arXiv · Computer Vision35

    MATE:通过互对抗自训练与演化数据提升统一多模态模型

    MATE 是一种基于强化学习的统一多模态模型后训练框架,让生成与理解分支轮流担任挑战者与求解者,挑战来自模型自身输出且随训练演化。在 Janus-Pro-1B 上,MATE 将 GenEval 提升 2.4 点、DPG-Bench 提升 1.7 点、九项理解基准平均提升 0.7 点,并增强图像-文本循环一致性。

  3. arXiv · Computer Vision50

    PreviewDiff:多模态评判引导的扩散模型潜在空间搜索

    PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。

9月29日周二
9月25日周五
9月23日周三
9月18日周五
9月8日周二
9月2日周三
  1. Google AI Blog60

    Google Pics 在 Google Workspace 中推出图像生成与编辑功能

    Google Pics 基于 Nano Banana 模型,面向 Google AI Pro、Ultra 订阅者及大部分 Workspace 商业用户开放,可进行对象分割、图像内文字编辑与翻译、多选项生成和协作编辑。该工具以独立产品形式推出,并已集成到 Docs 和 Slides,Drive 将在未来几周跟进,使用入口为 pics.new。

    推荐理由:原文给出了生成与编辑能力及 Workspace 入口,读者可据此判断它会怎样融入现有办公流程。

8月17日周一
7月23日周四
  1. Hugging Face Blog68

    Nunchaku Lite 正式接入 Diffusers,4-bit 量化扩散模型推理无需额外推理引擎

    Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。

    推荐理由:Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。

7月1日周三
  1. Google DeepMind69

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。

    推荐理由:Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。

5月18日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Omni Flash

    Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。

    推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。

5月17日周日
  1. Google DeepMind62

    Google 扩展内容透明度工具,SynthID 验证进入搜索与 Chrome

    Google 正在把内容透明度与验证工具扩展到搜索、Gemini、Chrome、Pixel 和 Google Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频加上水印,Gemini 应用中的验证功能已被使用 5000 万次,并将在未来几周扩展到搜索和 Chrome。

    推荐理由:原文列出了 SynthID 与 C2PA 在搜索、Chrome、Pixel 上的落地范围,可据此判断内容溯源的行业分工。

1月10日周六
  1. Berkeley AI Research32

    Information-Driven Design of Imaging Systems

    伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。

4月3日周一
1月1日周日
10月8日周五
10月29日周日