OpenAI 在 ChatGPT 测试更多广告
OpenAI 将从本月晚些时候起在 ChatGPT 测试新的视觉广告格式,美国用户将率先看到,广告会出现在使用 ChatGPT Images 生成图片时,并明确标注、与生成图像分开。
OpenAI 将从本月晚些时候起在 ChatGPT 测试新的视觉广告格式,美国用户将率先看到,广告会出现在使用 ChatGPT Images 生成图片时,并明确标注、与生成图像分开。
OpenAI 将为 ChatGPT 推出新的视觉广告格式,在用户生成图像时展示赞助产品与服务的图片。该广告将于本月晚些时候在美国开始测试,与生成图像分离且不影响 ChatGPT 的回答,Plus、Pro 和 Enterprise 订阅用户不会看到广告。ChatGPT 今年 2 月首次引入广告,此前仅显示公司名称、标志和产品链接,OpenAI 表示将设置护栏避免广告出现在敏感语境中。
OpenAI 将于本月晚些时候在美国测试新展示广告,在 ChatGPT 生成图像时于其下方以轮播或商品图片行展示,广告会标注为广告并与生成图像保持分离。广告主可通过 Hightouch、Tealium、LiveRamp 发送转化数据,并接入 AppsFlyer、Adjust、Branch 等归因服务商。
研究者将演化框架 EXAQC 扩展到图像分类,自动发现参数化量子电路(PQC)作为中间处理模块,同时保留经典特征提取与预测层。
论文提出一种几何感知时间重参数化方法,为 Flow-Map 蒸馏中学生模型分配更多时间以学习教师生成 ODE 中法向加速度较大的轨迹段,同时保留教师几何路径与终端分布。该方法在蒸馏前一次性估计共享时钟,无需重新训练教师模型,也不增加学生参数或推理时的网络评估开销。在合成数据、CIFAR-10 和 CelebA-64 上,该方法在相同推理预算下优于恒等时间蒸馏,包括一步和两步图像生成质量提升。
HandMade 提出一种结合 VR 3D 草图与语言的工作流,把粗略的带部件标注 3D 草图作为现有生成模型的空间提示词,而非待重建的几何体。它将分割后的 VR 笔触转换为多视角部件引导与结构化提示词,用户用 3D 草图指定物体布局与部件关系,用语言表达身份、材质、风格与局部细节。
COFLOW 是一种推理时自适应方法,根据提示词特征为每次生成选择步数,以在线无监督奖励平衡推理效率与生成保真度。该方法即插即用、无需重训底层生成模型,可推广至图像与视频生成,实现超过 2.5x 加速并保持感知与语义质量。论文还给出标准正则性条件下 O(1/K) 前向欧拉离散化误差界,已被 NeurIPS 2026 接收。
该研究在近期皮肤科数据集上系统评估了通用视觉语言模型、医学视觉语言模型、基础模型与皮肤科专用分类器,覆盖皮肤镜图像与智能手机临床照片。评估维度包括分布偏移、模态变化与人口统计学差异下的鲁棒性,以量化当前 SOTA 模型与临床部署要求的差距。论文共 10 页、1 幅图、3 张表,已被 MICCAI 2026 接收。
论文提出跨模态平面图像配准方法 CDPM,通过几何一致的跨模态 patch 对渐进适配 DINOv3,并构建 DINO-Centric Feature Pyramid,让多尺度 DINO 表示主导对应关系估计、轻量 CNN 分支辅助局部细化。
CalCErt 是一种简单高效的后处理策略,可为任意预训练可微分分类器提供分箱置信度校准认证。该方法结合经验校准估计、统计集中界与置信函数的局部 Lipschitz 估计,在半径 R 的 ℓ2 球内推导最坏情况失校准的数据相关上界。在 11 项医学图像分类任务与多种对抗扰动上的实验显示,其认证覆盖率显著高于基线策略,同时保持有竞争力的紧致度。代码已开源。
研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。
研究通过受控的 anchor–stress 协议评估文本编码器诊断与去噪器干预,提出纯文本的 Compositional Stress Index(CSI),在 SD1.5、SDXL 和 SD3 文本路径上区分常见与罕见组合,并提供上游诊断坐标。
研究者提出 BeeWhere,一种结合 ArUco 标记检测与深度学习实例分割的 AI 辅助标注与分析流程,用于从高分辨率群落图像和视频中量化熊蜂行为。研究以 Bombus impatiens 微群落为测试对象,标注 483 帧、8,443 个熊蜂实例,并训练 YOLO 实例分割模型。
研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。
TerraVis 是一个评估文生图图像世界一致性的框架,定义涵盖物体、交互、场景三级的 18 类违例分类体系,并用 MLLM 先判定图像可评估性,再检测违例、划分轻微或严重并得出总分。在两个常用基准上,TerraVis 与人类判断的相关性在现有指标中最强;代码已开源,论文被 NeurIPS 2026 接收。
ViTok 将 AM-RADIO 式学生模型(由 SigLIP2 与 DINOv3-L 蒸馏)整合为兼顾全局识别与密集语义的多教师蒸馏方案,采用 CLS/patch 分离适配头、非对称 cosine/MSE 损失、DINOv3-L 初始化、教师重加权、MIM 与 PHI-S 特征平衡。
论文提出 Spectral Correction Guidance,用谱对齐作为准则评估并校正引导扩散采样过程。该方法无需训练,可跨扩散骨干与条件生成任务使用,不修改底层模型。在 text-to-image 生成中较基线引导方法提升偏好指标,在 ImageNet 上优于 CFG,且在更少的去噪步数下仍保持改进。
DAGS 是一种轻量、无注意力的解耦外观与几何条件方案,引导冻结图像 DiT 生成高保真、可独立控制的渲染结果。两个小型卷积编码器每帧计算一次条件特征,以逐层逐元素残差注入图像 token,避免通过注意力堆叠条件带来的二次开销。
提出一种结合毛囊单位定位、可见发干计数、发干宽度估计、区域聚合与可解释规则层的雄激素性脱发自动定量分析与临床决策支持框架。临床队列含 243 名患者(127 例 AGA、116 例非 AGA),计算机视觉实验用 160 名专家标注患者、2,400 张毛发镜图像和约 158,000 条毛囊单位标注。
FactorSplat 提出逐场景 N 维高斯泼溅(N-DGS)代理,推理时接受区域特定强度到 RGBA 曲线以控制医学体渲染的颜色与可见性。在七个 CT 与 MR 扫描上,其在验证、插值、未见组合和分布外(OOD)编辑四类划分中平均 PSNR 相对 region-aware VEG 提升 1.10 至 1.52 dB。
EviDent-CBCT 提出证据瓶颈框架,用解剖感知网络把牙科 CBCT 扫描映射为牙级、全局与牙-IAC 证据记录,再经牙科逻辑一致性投影、确定性渲染器和图像盲局部语言模型生成报告。
SCION 提出一种层级组合式场景表示,用可复用基元的紧凑词表和轻量世界空间实例替代独立 Gaussians,在多视角重建中联合优化离散与连续参数。该方法在保持高质量的同时将场景压缩至 1.2 MB,码率失真表现优于现有 Gaussian 压缩方法,并支持无需重训练的实例级场景编辑与动画。论文已被 NeurIPS 2026 接收。
EditHero 是据作者所知首个面向长时序、部件级 3D 编辑的基准,提供自然语言指令与目标图像,覆盖几何与纹理,并用确定性装配引擎在每次编辑后生成精确目标、人工复核每条序列。对比显示非智能体方法常漏改并扰动应保持区域,LLM/VLM 智能体更遵循指令且更好保留未编辑部分,但每次编辑耗时数分钟;作者将开源引擎与编辑序列。
AREX 是一种面向预训练 flow matching 模型的免训练采样器,利用目标均值与协方差刻画可解析的采样动力学,并将学习到的动力学分解为全局仿射分量与神经残差项。
该研究将多步一致性模型(CM)采样分析为加噪与近似去噪算子的组合,在明确可验证的稳定性假设下推导出非渐近误差界,把初始误差的收缩与近似误差的累积分开。误差界赋予噪声调度不同角色:早期较大噪声水平驱动收缩,晚期较小噪声水平控制残余偏差,并为强对数凹与半对数凹目标给出显式常数。实验显示,进入误差界的收缩与近似剖面可可靠测量,且与预测的函数形式高度吻合,为多步 CM 提供收敛理论与采样器设计路径。
研究者提出 ENCORE,首个精确的并行推理时控制方法,通过让每个副本存储生成轨迹,把向上移动变为截断,从而避免模拟难以处理的时间反转。该方法在合成目标、分子 Boltzmann 采样和图像生成上取得有竞争力的准确率与多样性,对采样器扰动保持稳健,并适用于现有 RE 校正无法使用的蒸馏采样器。论文还证明目标不变性,并给出用于调节调度与计算预算的诊断。
论文提出 SatisDive,一种免训练、推理阶段使用的文本到图像生成方法,将生成建模为 satisficing:每张图像须达到奖励下限,整批图像须满足多样性阈值。
论文对文本到图像生成中“无训练安全机制依赖全局不安全信号”的假设做几何分析,发现紧凑不安全子空间难以覆盖异构的不安全语义,而扩大聚合又会扭曲安全相邻的良性提示词。
MintFlow 是一种免训练的约束采样框架,把约束执行表述为对预训练流轨迹的极小干预,在满足观测测量、物理定律等约束的同时尽量减少对预训练数据分布的偏离。该方法通过伴随形式给出扰动的闭式解,避免昂贵的迭代优化,并自适应选择干预时间以平衡扰动幅度与剩余流的放大效应。在生成视觉与物理系统建模任务上,MintFlow 达到有竞争力的约束满足度,且比 SOTA 约束方法更好地保留预训练生成分布。
Black Forest Labs 发布 Flux 3 Image,支持多步编辑、最多十张参考图、4K 输出,并提供免费演示与 API 折扣。
MiniMax M3.1 Flash Preview 在前端创作任务中与 Claude Opus 5.5 同题对比,交付 15 秒动态设计作品集、手绘、水墨短片、交互场景与游戏原型,完成度足以与旗舰模型一较高下。
该研究提出一种基于方差缩减序贯蒙特卡洛(SMC)的扩散模型推理期导向方法,通过重叠区域似然比目标抑制负参考分布质量,同时最小化对正分布的扭曲。实验在合成任务、类别对比生成、文本到图像及肽-MHC 结合剂任务上验证,相较负引导基线更有效抑制非期望区域、减小模式偏移并降低 SMC 权重坍缩。代码已公开。
EvoGen-Harness 是一个生成器无关的多责任图像生成 Harness 进化框架,配合 Trace(轨迹相对归因与协同进化)机制,在随机执行间聚合证据并用失败归因作为搜索先验。
ZeNOVA 提出一种无梯度初始噪声对齐方法,通过退火软值引导、流形约束超球面朗之万动力学和 Metropolis-Hastings 跳跃解决黑盒奖励场景下的不稳定与低效问题。实验在图像和视频生成模型上表明,ZeNOVA 比所有零阶基线更稳定地将初始噪声优化至更高奖励,利用高斯先验几何结构。方法适用于多种黑盒奖励对齐场景。
论文提出 Form and Void Agent(FaV-A),一个面向分阶段正负空间生成的多模态 AI 智能体。FaV-A 先生成基础对象,再分析其形状与空间结构以识别候选负空间语义,最后为最终图像生成阶段产出构图指令。实验与消融分析显示,FaV-A 比直接 zero-shot MLLM 基线更能生成视觉连贯、语义对齐的正负空间构图。
论文提出 Frame-Evidence Co-Adaptation(FECA)框架,解决多模态深度研究中图表数值保真问题。FECA 将图表生成建模为视觉帧与检索证据的迭代交互,视觉帧引导证据获取,证据决定帧的接受、修订或丢弃。实验表明 FECA 在 100 个真实研究主题上显著提升数值保真度,同时保持报告质量与图表可用性。
论文提出首个基于用户历史的多轴个性化图像生成基准,包含个性化场景生成与个性化创意生成两个任务。PEARL 将多模态推理器与冻结图像生成器以推理-反射交替循环结合,在两项任务上相对基线平均提升 15%。基准面向真实电商与社交媒体场景,评估涵盖目标保真度、视觉质量、用户区分度及语义对齐等维度。
summary_zh: 该研究提出连续偏好场(CPF),将人类裁剪偏好建模为多峰连续分布,通过峰值聚类、离格精修、负样本塑造和场组装从离散标注中恢复密集偏好景观。
summary_zh: Gestalt 提出一种基于 multimodal interplay 的大 multimodal 模型新范式,构建从模态专属处理、跨模态对齐到深层 multimodal 集成的多阶段金字塔结构。
PixelDense 通过语义投影流处理 DINOv2 和 SAM2,几何投影流处理 Depth Anything v2 和 Metric3D v2,并加入权重空间正交性惩罚,使两类教师处于不交子空间。