LENS-GRF:基于集合变换器与门控残差融合的痤疮严重程度分级与多评级临床 Oracle 分析
LENS-GRF 结合自适应面部皮肤分割、全局 Vision Transformer 先验与排列不变 Lesion Set Transformer,用于四类痤疮严重程度分级。
LENS-GRF 结合自适应面部皮肤分割、全局 Vision Transformer 先验与排列不变 Lesion Set Transformer,用于四类痤疮严重程度分级。
Ideogram 推出 Ideogram 4.5,声称只修改用户指定的区域,保持身体形状和背景等不变。提供 0.8 至 22 美元四个品质档位,原生 2K 分辨率,现已通过平台和 API 开放,合作伙伴包括 Picsart、Runway、Pika 和 Leonardo AI,公司表示开源权重版本即将推出。
DreamBooth 微调合成图像会降低主体保真度,产生过饱和色彩和过多高频细节。研究者定位原因为分类器自由引导(CFG)的膨胀,并提出训练无关的 ReGain 校正,在采样时按频段缩放引导量。在 Stable Diffusion v1.5 上,ReGain 用 DINO、DINOv2 和 CLIP-I 衡量缩小了 51-64% 的主体保真度差距,同时保持文本对齐。
PixelUMM 是一个无需编码器的统一多模态模型,直接在像素空间处理图像与视频。图像表示为空间图块,视频表示为时空管状块,通过单层线性投影连接原始像素与共享多模态骨干网络。其混合 Transformer 架构结合共享注意力与任务特定参数,支持自回归文本预测和像素空间流匹配,在图像与视频理解及生成任务上取得竞争力表现。
统一多模态模型(UMM)的图像理解与自回归生成共享参数并相互干扰,现有方法以层或专家为单位诊断冲突。研究提出位置解析干扰图谱,发现生成梯度在序列前1/4位置与理解的余弦相似度低至-0.18,位置解释冲突方差的31%-35%。
该研究提出一种可解释的行人路由方法,通过视觉-语言模型生成字幕作为中间表示来估计街道级感知安全,而非直接使用 CLIP 图像嵌入。实验覆盖曼彻斯特和哈德斯菲尔德两个地区的 654,115 张图像、36 个选区,字幕表示达到与图像嵌入相当的性能。
论文提出模态动力学排版(modal kinetic typography),通过矢量字形的有限元特征模态驱动动画,保持字形可读性并表达语义概念。方法使用冻结的视频扩散模型监督模态振幅与相位,相比 Dynamic Typography、AniClipart 和 Astra(GPT-6)在概念对齐、运动流畅度和字形完整性上更优,且人类评测者更偏好其结果,包括冻结字形仅靠运动的设置。
NesTok 提出嵌套自对齐框架,针对动态视觉 Tokenizer 引入跨长度训练,用完整长度序列指导较短序列的重建优化。在 ImageNet 上 rFID 达 0.98,下游图像生成取得 gFID 1.46 的当前最优成绩。代码将开源。
summary_zh: MoRe-Drag 将像素空间变形作为粗运动证据注入生成采样轨迹,通过区域感知潜在重组合与阶段自适应条件化,在 DragBench-SR 和 DragBench-DR 上显著提升拖拽精度,达到 SOTA 水平。
论文提出 VIGOR-his 数据集,包含 11 座城市、三个大洲的 43,653 个地点四级配对,并构建 CrossTimeEdit 模型,将历史街景生成转化为编辑任务,以近期街景约束视角与不变外观、以卫星时序差异作为变化证据。
论文提出 CoRe 框架,通过让奖励模型与生成器共同演化来缓解视频扩散模型中的潜在奖励欺骗问题。固定潜在奖励会在数百次更新后导致分布逃逸,使奖励分数与感知和运动质量脱钩;CoRe 在生成器当前样本上持续重训练奖励模型并锚定真实视频偏好,在 Wan2.1-T2V-1.3B 上相比预训练模型和先前对齐方法持续提升生成质量,并避免固定奖励优化的质量崩溃。
Why it matters: 固定奖励信号会让视频生成模型在潜在空间偏离数据分布,CoRe 通过奖励模型与生成器共同演化来缓解这一问题,为视频扩散模型的对齐提供了可迁移的动态训练视角。
MATE 是一种基于强化学习的统一多模态模型后训练框架,让生成与理解分支轮流担任挑战者与求解者,挑战来自模型自身输出且随训练演化。在 Janus-Pro-1B 上,MATE 将 GenEval 提升 2.4 点、DPG-Bench 提升 1.7 点、九项理解基准平均提升 0.7 点,并增强图像-文本循环一致性。
PreviewDiff 是一种无需训练、测试时搜索方法,将扩散采样从标量搜索转为多模态评判引导的中间潜在空间搜索。在去噪检查点解码局部预览,由多模态评判器评分并给出自然语言反馈,据此分支为语义提示编辑和局部重噪声潜在延续,再评分并选择性前向推进。图像与视频生成基准上,PreviewDiff 一致优于等预算 Best-of-N 与强标量搜索基线,更早干预与更大搜索宽度收益最大。
summary_zh: 葛丽泰·嘉宝的 AI 数字形象已为瑞典轴承公司 SKF 拍摄 99 秒广告,这是她去世后首次出现在动态影像中。创作者使用中国 Seedream 和 Google Nano Banana Pro 等模型,通过文字提示生成其外貌,并由真人演员配音表演。
Google Research 提出 Diffusion Controller 框架,将图像生成去噪过程重构为连续控制问题,以轻量级转向阻尼器网络在灰盒环境下超越 LoRA。实验基于 Stable Diffusion v1.4 并在 HPS-v2 上评估,同时支持运行时调节控制强度。
同一 AWS vLLM-Omni DLC 在 SageMaker AI 部署两个端点:FLUX.2-klein-4B 实时生成图像,Wan2.1-VACE-1.3B 再异步把该图像做成短视频。
Runway 推出 GWM Worlds 2 研究预览,引入 WorldPrompt 功能以指定世界和动作,实现实时交互视频和音频生成。文章采访 CTO Kamil Sindi 和研究科学家,探讨了 autoregressive diffusion 模型和从视频生成到世界模型的工程挑战,包括 distillation 方法。
阿里云发布 Qwen Image 2.1,参数仅7B,可在RTX 3090等消费卡运行。内部基准Qwen Image Benchmark得分60.2,接近GPT Image 2.5 Sunburst(67)和Nano Banana 2.0(59.82);AI Arena图像编辑得分1367,位列开源第一。
图像编辑基础模型的多模态能力正变得核心,用户可通过指令直接编辑图像。评估这类模型面临挑战,需要闭环的 agentic evaluation 方法。原文未给出具体模型版本、参数规模或 benchmark 分数。
ChatGPT Images 2.5 发布,帮助用户将想法、草图和参考照片转化为更个性化、更精致的图像,生成的图像更能反映用户的原始想法。
Google Pics 基于 Nano Banana 模型,面向 Google AI Pro、Ultra 订阅者及大部分 Workspace 商业用户开放,可进行对象分割、图像内文字编辑与翻译、多选项生成和协作编辑。该工具以独立产品形式推出,并已集成到 Docs 和 Slides,Drive 将在未来几周跟进,使用入口为 pics.new。
Why it matters: 原文给出了生成与编辑能力及 Workspace 入口,读者可据此判断它会怎样融入现有办公流程。
Google Research发布PhotoScan,一种基于深度学习的研究框架,可从标准2D智能手机照片估算三维身体成分指标(体脂率、A/G比、V/S比),用于预测胰岛素抵抗。
Nunchaku Lite 现已原生集成到 Diffusers,用户可通过 from_pretrained() 直接加载 4-bit 量化扩散模型,无需单独推理引擎或本地 CUDA 编译。
Why it matters: Nunchaku Lite 现已原生接入 Diffusers,无需额外引擎即可通过 from_pretrained() 加载 4-bit 量化模型,在 RTX 5090 上 VRAM 从 24GB 降至约 12GB,推理加速约 30%。
Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。
Why it matters: Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
Why it matters: Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。
Google 正在把内容透明度与验证工具扩展到搜索、Gemini、Chrome、Pixel 和 Google Cloud。SynthID 已为超过 1000 亿张图片和视频、6 万年音频加上水印,Gemini 应用中的验证功能已被使用 5000 万次,并将在未来几周扩展到搜索和 Chrome。
Why it matters: 原文列出了 SynthID 与 C2PA 在搜索、Chrome、Pixel 上的落地范围,可据此判断内容溯源的行业分工。
伯克利 AI 研究提出基于信息量的成像系统直接评估与优化框架,用噪声测量估计互信息以统一分辨率、噪声等质量指标。在颜色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计可预测解码器性能并指导设计优化,比端到端方法需更少内存与计算,且无需任务特定解码器。
fast.ai 发布新课程《From Deep Learning Foundations to Stable Diffusion》,为 Practical Deep Learning for Coders 第二部分,包含超过 30 小时视频内容。
作者用 Stable Diffusion、DALL-E 和 Midjourney 重制《Nemesis 2》1987 年开场动画,逐面板对比原版与 AI 生成效果。
summary_zh: Stanford AI Lab 公布 ICCV 2021 录用论文列表,涵盖 GLoRIA 多模态医学图像识别、Point-Voxel Diffusion 3D 形状生成与补全、CAPTRA 类别级位姿跟踪、Human-Object Relationships 视频检测、Geography-Aware 自监督学习及 HuMoR 3D 人体运动模型。
summary_zh: 本文讲解图像梯度向量、HOG 与 SS 等传统目标检测基础方法,不涉及深度神经网络。梯度向量通过相邻像素颜色差计算幅值与方向,可用卷积核(如 Prewitt、Sobel)加速。