跳到正文

#图像生成

今日 35 条
10月5日周一
  1. The Verge · AI37

    OpenAI 在 ChatGPT 中增加更多广告

    OpenAI 将为 ChatGPT 推出新的视觉广告格式,在用户生成图像时展示赞助产品与服务的图片。该广告将于本月晚些时候在美国开始测试,与生成图像分离且不影响 ChatGPT 的回答,Plus、Pro 和 Enterprise 订阅用户不会看到广告。ChatGPT 今年 2 月首次引入广告,此前仅显示公司名称、标志和产品链接,OpenAI 表示将设置护栏避免广告出现在敏感语境中。

  2. arXiv · Machine Learning Theory30

    用于 Flow-Map 蒸馏的几何感知时间重参数化

    论文提出一种几何感知时间重参数化方法,为 Flow-Map 蒸馏中学生模型分配更多时间以学习教师生成 ODE 中法向加速度较大的轨迹段,同时保留教师几何路径与终端分布。该方法在蒸馏前一次性估计共享时钟,无需重新训练教师模型,也不增加学生参数或推理时的网络评估开销。在合成数据、CIFAR-10 和 CelebA-64 上,该方法在相同推理预算下优于恒等时间蒸馏,包括一步和两步图像生成质量提升。

  3. arXiv · Human-Computer Interaction29

    HandMade:用带部件标注的 VR 草图做生成式 3D 创作的空间提示词

    HandMade 提出一种结合 VR 3D 草图与语言的工作流,把粗略的带部件标注 3D 草图作为现有生成模型的空间提示词,而非待重建的几何体。它将分割后的 VR 笔触转换为多视角部件引导与结构化提示词,用户用 3D 草图指定物体布局与部件关系,用语言表达身份、材质、风格与局部细节。

  4. arXiv · Computer Vision33

    COFLOW:基于上下文流匹配的视觉生成自适应步数选择方法

    COFLOW 是一种推理时自适应方法,根据提示词特征为每次生成选择步数,以在线无监督奖励平衡推理效率与生成保真度。该方法即插即用、无需重训底层生成模型,可推广至图像与视频生成,实现超过 2.5x 加速并保持感知与语义质量。论文还给出标准正则性条件下 O(1/K) 前向欧拉离散化误差界,已被 NeurIPS 2026 接收。

  5. arXiv · Computer Vision22

    弥合研究与实践:通用模型与皮肤科专用模型在临床皮肤病变分类中的系统评估

    该研究在近期皮肤科数据集上系统评估了通用视觉语言模型、医学视觉语言模型、基础模型与皮肤科专用分类器,覆盖皮肤镜图像与智能手机临床照片。评估维度包括分布偏移、模态变化与人口统计学差异下的鲁棒性,以量化当前 SOTA 模型与临床部署要求的差距。论文共 10 页、1 幅图、3 张表,已被 MICCAI 2026 接收。

  6. arXiv · Computer Vision27

    CalCErt:医学图像分类中置信度校准的分箱认证

    CalCErt 是一种简单高效的后处理策略,可为任意预训练可微分分类器提供分箱置信度校准认证。该方法结合经验校准估计、统计集中界与置信函数的局部 Lipschitz 估计,在半径 R 的 ℓ2 球内推导最坏情况失校准的数据相关上界。在 11 项医学图像分类任务与多种对抗扰动上的实验显示,其认证覆盖率显著高于基线策略,同时保持有竞争力的紧致度。代码已开源。

  7. arXiv · Computer Vision37

    NegT2IBench:否定如何改变画面——面向文本到图像模型的极性基准

    研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。

  8. arXiv · Computer Vision42

    通过组合偏好与准则奖励后训练前沿文生图模型

    研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。

  9. arXiv · Computer Vision31

    TerraVis:基于 MLLM 工作流评估文生图模型的世界一致性

    TerraVis 是一个评估文生图图像世界一致性的框架,定义涵盖物体、交互、场景三级的 18 类违例分类体系,并用 MLLM 先判定图像可评估性,再检测违例、划分轻微或严重并得出总分。在两个常用基准上,TerraVis 与人类判断的相关性在现有指标中最强;代码已开源,论文被 NeurIPS 2026 接收。

  10. arXiv · Computer Vision27

    用谱对齐校正引导扩散轨迹

    论文提出 Spectral Correction Guidance,用谱对齐作为准则评估并校正引导扩散采样过程。该方法无需训练,可跨扩散骨干与条件生成任务使用,不修改底层模型。在 text-to-image 生成中较基线引导方法提升偏好指标,在 ImageNet 上优于 CFG,且在更少的去噪步数下仍保持改进。

  11. arXiv · Computer Vision27

    基于 AI 的多阶段方法用于低倍头皮图像的雄激素性脱发评估

    提出一种结合毛囊单位定位、可见发干计数、发干宽度估计、区域聚合与可解释规则层的雄激素性脱发自动定量分析与临床决策支持框架。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验用 160 名专家标注患者、2,400 张毛发镜图像和约 158,000 条毛囊单位标注。

  12. arXiv · Computer Vision29

    SCION:用实例化神经基元实现场景组合

    SCION 提出一种层级组合式场景表示,用可复用基元的紧凑词表和轻量世界空间实例替代独立 Gaussians,在多视角重建中联合优化离散与连续参数。该方法在保持高质量的同时将场景压缩至 1.2 MB,码率失真表现优于现有 Gaussian 压缩方法,并支持无需重训练的实例级场景编辑与动画。论文已被 NeurIPS 2026 接收。

  13. arXiv · Computer Vision34

    EditHero:面向长时序部件级 3D 编辑与 Vibe Modeling 的基准

    EditHero 是据作者所知首个面向长时序、部件级 3D 编辑的基准,提供自然语言指令与目标图像,覆盖几何与纹理,并用确定性装配引擎在每次编辑后生成精确目标、人工复核每条序列。对比显示非智能体方法常漏改并扰动应保持区域,LLM/VLM 智能体更遵循指令且更好保留未编辑部分,但每次编辑耗时数分钟;作者将开源引擎与编辑序列。

  14. arXiv · Statistics Machine Learning27

    迭代一致性模型:稳定性、误差界与噪声调度

    该研究将多步一致性模型(CM)采样分析为加噪与近似去噪算子的组合,在明确可验证的稳定性假设下推导出非渐近误差界,把初始误差的收缩与近似误差的累积分开。误差界赋予噪声调度不同角色:早期较大噪声水平驱动收缩,晚期较小噪声水平控制残余偏差,并为强对数凹与半对数凹目标给出显式常数。实验显示,进入误差界的收缩与近似剖面可可靠测量,且与预测的函数形式高度吻合,为多步 CM 提供收敛理论与采样器设计路径。

  15. arXiv · Statistics Machine Learning38

    ENCORE:用于扩散模型生成的精确非平衡副本交换控制

    研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,把向上移动变为截断,从而避免模拟难以处理的时间反转。该方法在合成目标、分子 Boltzmann 采样和图像生成上取得有竞争力的准确率与多样性,对采样器扰动保持稳健,并适用于现有 RE 校正无法使用的蒸馏采样器。论文还证明目标不变性,并给出用于调节调度与计算预算的诊断。

  16. arXiv · Artificial Intelligence32

    MintFlow:面向约束流匹配的极小轨迹干预方法

    MintFlow 是一种免训练的约束采样框架,把约束执行表述为对预训练流轨迹的极小干预,在满足观测测量、物理定律等约束的同时尽量减少对预训练数据分布的偏离。该方法通过伴随形式给出扰动的闭式解,避免昂贵的迭代优化,并自适应选择干预时间以平衡扰动幅度与剩余流的放大效应。在生成视觉与物理系统建模任务上,MintFlow 达到有竞争力的约束满足度,且比 SOTA 约束方法更好地保留预训练生成分布。

10月2日周五
  1. arXiv · Machine Learning Theory36

    Specificity-Aware Diffusion Steering via Variance-Reduced Sequential Monte Carlo

    该研究提出一种基于方差缩减序贯蒙特卡洛(SMC)的扩散模型推理期导向方法,通过重叠区域似然比目标抑制负参考分布质量,同时最小化对正分布的扭曲。实验在合成任务、类别对比生成、文本到图像及肽-MHC 结合剂任务上验证,相较负引导基线更有效抑制非期望区域、减小模式偏移并降低 SMC 权重坍缩。代码已公开。

  2. arXiv · Machine Learning Theory33

    ZeNOVA:流形约束初始噪声优化实现高效生成模型对齐

    ZeNOVA 提出一种无梯度初始噪声对齐方法,通过退火软值引导、流形约束超球面朗之万动力学和 Metropolis-Hastings 跳跃解决黑盒奖励场景下的不稳定与低效问题。实验在图像和视频生成模型上表明,ZeNOVA 比所有零阶基线更稳定地将初始噪声优化至更高奖励,利用高斯先验几何结构。方法适用于多种黑盒奖励对齐场景。

  3. arXiv · Multiagent Systems24

    Form and Void:自主 AI 智能体的纠缠式正负空间构图

    论文提出 Form and Void Agent(FaV-A),一个面向分阶段正负空间生成的多模态 AI 智能体。FaV-A 先生成基础对象,再分析其形状与空间结构以识别候选负空间语义,最后为最终图像生成阶段产出构图指令。实验与消融分析显示,FaV-A 比直接 zero-shot MLLM 基线更能生成视觉连贯、语义对齐的正负空间构图。

  4. arXiv · Human-Computer Interaction36

    多模态深度研究中的忠实图表生成:Frame-Evidence Co-Adaptation

    论文提出 Frame-Evidence Co-Adaptation(FECA)框架,解决多模态深度研究中图表数值保真问题。FECA 将图表生成建模为视觉帧与检索证据的迭代交互,视觉帧引导证据获取,证据决定帧的接受、修订或丢弃。实验表明 FECA 在 100 个真实研究主题上显著提升数值保真度,同时保持报告质量与图表可用性。

  5. arXiv · Computer Vision36

    个性化图像生成基准与 PEARL 推理反射框架

    论文提出首个基于用户历史的多轴个性化图像生成基准,包含个性化场景生成与个性化创意生成两个任务。PEARL 将多模态推理器与冻结图像生成器以推理-反射交替循环结合,在两项任务上相对基线平均提升 15%。基准面向真实电商与社交媒体场景,评估涵盖目标保真度、视觉质量、用户区分度及语义对齐等维度。