Skip to content
arXiv · Computer Vision· Feifei Li, Runjie Wang, Xiaohan Zhang, Zhenxing Qian, Mi Wen, Mi Zhang·· 4 hr agoAI score41

场景文本劫持场景:揭示、利用并缓解图像生成模型中的渲染文本语义泄漏

When Scene Text Hijacks the Scene: Uncovering, Exploiting, and Mitigating Rendered-Text Semantic Leakage in Image Generation Models

AI brief

研究提出“渲染文本语义泄漏”现象:图像生成模型会把待渲染文本当作指令语义理解,而不仅是逐字复现的视觉约束。论文将主视觉提示词与渲染文本解耦,量化语义泄漏与渲染保真度,发现有害语义可经 LLM 提示词增强管道残留并引导非文本区域,即使主提示词无害。研究在 FLUX-2-dev 上给出初步缓解方案,降低不安全语义迁移且保留预期文本渲染。

Source: arXiv · Computer Vision · arxiv.org