DDT-RFE:是否应跳过 Diffusion 模型中的残差连接
研究者提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器块中 Self-Attention 与 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合,使解码器获得多层信息。
研究者提出 DDT-RFE,移除 Decoupled Diffusion Transformer(DDT)编码器块中 Self-Attention 与 MLP 周围的残差连接,并将输入 patch embedding 与中间及最终编码器特征融合,使解码器获得多层信息。
研究提出 Diffusion On-Policy Context Distillation(D-OPCD),把智能体改进后的提示词作为特权上下文,将 agent harness 的能力蒸馏进扩散模型权重。
论文提出能量自适应噪声调度与白化策略,用于变换域扩散模型,将全局谱白化与按变换系数能量及图像相关能量路径联合调制的噪声分配结合。该方法保持高斯过渡与闭式边缘分布,兼容标准 DDPM 和 DDIM,无需修改扩散架构。CIFAR-10 实验将紧凑 DCTdiff U-Net 变体的 Fréchet Inception Distance 从 142.48 降至 100.45。
研究者提出 CHARTER,一种面向计算病理学的参考感知评估章程,要求研究者 DECLARE 预期目标与参考、QUANTIFY 候选引发的预测偏移、AUDIT 比较结论的稳定性。
该研究发布一个西方蓝鸟(Sialia Mexicana)检测与分割基准数据集,包含来自 41 次录制会话的 6,000 余张 4K 高分辨率野外标注图像,鸟体仅占画面很小比例。
论文提出高斯泼溅序列压缩方法 GSCV,用标准视频编解码器完成压缩。现有基于视频的方案依赖 Parallel Linear Assignment Sorting(PLAS)与跟踪原始信息,但跟踪信息在多数实际场景不可用,原始 PLAS 会因随机性产生帧间相关性弱的图像。
RefRoute 提出紧凑残差条件化与条件/注意力路由,降低多参考图像生成中参考表征与注意力开销,并在 16 个参考时让 50-step 与 4-step 配置分别取得 $18.3\times$ 和 $14.2\times$ 相对 FLUX 基线的加速。
研究扩展了人在回路框架,结合 5,901 个基础模型生成伪标签、860 个专家标注疑难病例与 198 个共识失败病例,系统评测九种细胞核分割模型配置下的七种微调策略。
提出 RBMatch,一个面向半监督建筑足迹提取的双层级类别重平衡框架,联合调控伪标签生成与无监督优化,以解决仅平衡伪标签选择时背景偏差在无监督损失优化中重现的“imbalance leak”问题。
论文提出 Dual-FDM,在频率感知扩散模型中解耦定制参考与色彩风格参考,以同时处理定制风格迁移和色彩风格迁移。方法在频域内用掩码策略解耦不同频段:定制风格迁移中用定制参考前景的中频段替换风格参考背景的中频段,色彩风格迁移中用色彩参考的前景与背景低频段替换风格参考背景的低频段,替换后的频段作为键值重建去噪个性化图像的前景与背景。
研究者提出 REViT-v2,一种基于窗口化群卷积自注意力与分层特征架构的可扩展旋转群等变视觉 Transformer。该方法可扩展到参数量达数百万的群等变 ViT,并在 ImageNet 等实际尺寸的大规模数据集上验证。代码与预训练权重已开源,论文被 NeurIPS NeurREPS workshop 2026 接收。
CETUS 在 USGS 卡西尼号土卫六 SAR 镶嵌图上比较 DINOv2、DOFA、CROMA 与经典图像测量及未训练 vision transformer 特征,分类器依据专家地貌图学习地形标签并预测到地理分离区域。
SRIM 把照片缩放建模为频率选择信道,在多个锚点尺度上采样扰动并偏向当前最弱尺度,以应对未知缩放因子。在 9 至 30 兆像素照片、2 至 8 倍缩放下,SRIM 将 FLUX.2-klein 编辑的最坏破坏度从已发表最强防护的 0.192 LPIPS 提升到 0.463;同等可见度下防护约翻倍,并对 9B 模型、FLUX.2-dev 与 InstructPix2Pix 同样有效。
ElasticFit 是一个 VLM 引导的拟合感知 3D 物体插入框架,通过场景接地表示把语言指令与渲染观察转化为落点、占据体积、朝向与适配模式(刚性放置、均匀缩放或弹性拟合)等结构化约束,再生成场景条件物体先验、重建 3D 并按模式细化网格,强制碰撞规避、接触一致与物理接地。
WildMatch 提出一种仅用身份标签、无需关键点或几何对应标注的弱监督方法,对预训练关键点匹配器进行自适应。该方法用预训练匹配器挖掘信息量大的图像对,从身份一致性中导出弱正负监督,并对比微调匹配网络,强化同身份对应、抑制异身份对应。在开源野生动物重识别数据集上,其准确率超过现成匹配器和一种 SOTA 局部-全局融合方法,并在留出个体的开放世界协议下学到可迁移的对应先验。
SimCortex v2 提出一个深度学习框架,从 T1 加权 MRI 同时重建左右白质与软脑膜表面,用基于带状条件 U-Net 类网络预测的多尺度稳态速度场联合优化四个表面。
论文提出免训练框架 HGSS,用于文本到图像扩散模型的组合概念擦除,通过层次跨度定位与动态属性绑定消除目标概念且不更新模型权重、不增加学习参数。
研究者提出自监督框架 LAO-X,可在 X 光安检扫描中定位任意物体,全程无需人工标注。LAO-X 通过显著性引导的 X 光物体挖掘模块与物理引导合成生成多样图像—标注对,并用遮挡控制课程策略微调 Segment Anything Model 2(SAM2)定位器。在六个 X 光基准测试中,LAO-X 在重度杂乱场景下较 SAM2 及 X 光专用基线取得 2% 至 23% 的 mAP 提升。
论文提出混合跨模态注意力网络 HCMAN,用 transformer 跨模态注意力机制融合乳腺 X 光图像与结构化临床数据。模型基于埃塞俄比亚四家转诊医院 1,024 名患者的 2,560 张乳腺 X 光图像验证,准确率 97.8%、灵敏度 97.2%、特异性 98.3%、AUC 0.987,显著优于仅用图像的基线。
MoonGS 是首个面向月球场景的前馈式 3D Gaussian Splatting 框架,仅输入两张图像即可在单次前向传播中预测像素对齐的高斯基元,无需逐场景优化即可渲染新视角。
研究揭示文本到图像模型的 VAE 潜空间存在与亮度和对抗色对齐的共享颜色子空间,并通过编码器线性近似与定向潜空间引导,在 SD1.5 到 FLUX.2 和 Z-Image 的多种 VAE 中一致验证。
一项面向巴基斯坦旁遮普的作物产量预测原型融合 Random Forest、XGBoost、支持向量回归与 Ridge 堆叠集成,并接入 MobileNetV2 叶片健康分类器,部署为带 SHAP 解释的 Web 应用。
Anchor and Adapt 是一个两阶段提示词学习框架,把异常语义获取与目标正常外观适配分离:第一阶段从带标注辅助数据学习可迁移的正常与异常锚点,第二阶段固定锚点,仅用少量目标正常样本适配额外的正常分支。
论文提出通用少样本类增量学习(G-FSCIL)设定,基础会话本身仅含少量类别,解决基类与增量数据同时稀缺导致的表征薄弱与语义漂移问题。方法用冻结的扩散模型构建类特定合成候选池,在首次观测时执行类反转并复用条件嵌入按需生成,再学习知识筛选策略选出兼具语义一致性与视觉多样性的样本,并蒸馏为可迁移的选择策略。
DistScene 提出单图组合式 3D 场景生成框架,联合建模环境与单个物体,将环境作为显式场景组件为物体放置提供几何上下文。方法包括 Scene-Frame Generation、Object-Centric Refinement 与 Object-to-Scene Distillation,后者通过自动合成并渲染的场景把预训练物体生成先验迁移到场景生成。
研究提出 KANSteer,用 Kolmogorov-Arnold Networks(KANs)把概念遍历建模为穿过中间状态的曲线,以一维坐标及其学习函数定义轨迹,使引导方向随概念变化且保持可解释。
研究者提出 UniPro,用传播机制把 2D 分割扩展到 3D 体数据,统一语义、上下文、交互和传播四种分割模式。模型以类别先验、参考样本、用户点击和相邻切片预测作为条件输入,并引入双向与 3D 监督提升传播可靠性。实验显示其在多模态、多解剖结构上表现稳健,可从稀疏 2D 初始化实现标注高效的 3D 分割,减少逐切片校正工作量。
论文研究高斯分布间 FID 估计的样本复杂度,给出经验 plug-in 估计器 Θ(d²/n) 偏差与 Θ(d/n + d²/n²) 方差界,证明其样本复杂度下界为 ≳ d²。
论文提出特征信息动力学(feature information dynamics),一个基于信息论的框架,用于定位扩散模型生成过程中特征出现的时刻。研究用 I-MMSE 恒等式把特征互信息变化率与无条件与特征条件去噪损失之差相连,给出特征信息密度的实用估计量,并发展链式分解区分特征层级中的共享与增量信息。
研究者将演化框架 EXAQC 扩展到图像分类,自动发现参数化量子电路(PQC)作为中间处理模块,同时保留经典特征提取与预测层。
论文提出一种几何感知时间重参数化方法,为 Flow-Map 蒸馏中学生模型分配更多时间以学习教师生成 ODE 中法向加速度较大的轨迹段,同时保留教师几何路径与终端分布。该方法在蒸馏前一次性估计共享时钟,无需重新训练教师模型,也不增加学生参数或推理时的网络评估开销。在合成数据、CIFAR-10 和 CelebA-64 上,该方法在相同推理预算下优于恒等时间蒸馏,包括一步和两步图像生成质量提升。
HandMade 提出一种结合 VR 3D 草图与语言的工作流,把粗略的带部件标注 3D 草图作为现有生成模型的空间提示词,而非待重建的几何体。它将分割后的 VR 笔触转换为多视角部件引导与结构化提示词,用户用 3D 草图指定物体布局与部件关系,用语言表达身份、材质、风格与局部细节。
COFLOW 是一种推理时自适应方法,根据提示词特征为每次生成选择步数,以在线无监督奖励平衡推理效率与生成保真度。该方法即插即用、无需重训底层生成模型,可推广至图像与视频生成,实现超过 2.5x 加速并保持感知与语义质量。论文还给出标准正则性条件下 O(1/K) 前向欧拉离散化误差界,已被 NeurIPS 2026 接收。
该研究在近期皮肤科数据集上系统评估了通用视觉语言模型、医学视觉语言模型、基础模型与皮肤科专用分类器,覆盖皮肤镜图像与智能手机临床照片。评估维度包括分布偏移、模态变化与人口统计学差异下的鲁棒性,以量化当前 SOTA 模型与临床部署要求的差距。论文共 10 页、1 幅图、3 张表,已被 MICCAI 2026 接收。
论文提出跨模态平面图像配准方法 CDPM,通过几何一致的跨模态 patch 对渐进适配 DINOv3,并构建 DINO-Centric Feature Pyramid,让多尺度 DINO 表示主导对应关系估计、轻量 CNN 分支辅助局部细化。
CalCErt 是一种简单高效的后处理策略,可为任意预训练可微分分类器提供分箱置信度校准认证。该方法结合经验校准估计、统计集中界与置信函数的局部 Lipschitz 估计,在半径 R 的 ℓ2 球内推导最坏情况失校准的数据相关上界。在 11 项医学图像分类任务与多种对抗扰动上的实验显示,其认证覆盖率显著高于基线策略,同时保持有竞争力的紧致度。代码已开源。
研究者推出 NegT2IBench,包含 4,800 条提示,覆盖两种属性类型与四类关系,按极性组织以区分否定与提示复杂度的影响。基于检测器的评分在 600 张图像、三名标注者上与至多 30 倍大的视觉语言评判一致,而仅用其一小部分 GPU 内存。覆盖 11 个 T2I 模型与 211,200 张图像,九个模型在单条否定句上得分低于单条肯定句,41.5% 失败句恰好渲染了提示禁止的内容。
研究通过受控的 anchor–stress 协议评估文本编码器诊断与去噪器干预,提出纯文本的 Compositional Stress Index(CSI),在 SD1.5、SDXL 和 SD3 文本路径上区分常见与罕见组合,并提供上游诊断坐标。
研究者提出 BeeWhere,一种结合 ArUco 标记检测与深度学习实例分割的 AI 辅助标注与分析流程,用于从高分辨率群落图像和视频中量化熊蜂行为。研究以 Bombus impatiens 微群落为测试对象,标注 483 帧、8,443 个熊蜂实例,并训练 YOLO 实例分割模型。
研究者提出一种面向开放域文生图的后训练方案,将偏好奖励与基于准则的奖励组合,以兼顾人类审美偏好、提示词忠实性并抑制奖励破解。RL 训练后的 Flux2dev 在 Arena 文生图榜上 Elo 较基础模型高 69 分,后训练的 Ideogram-4 达到 Elo 1223.5,超过榜单所有开源模型(截至 2026 年 9 月 4 日快照)。