arXiv · Computer Vision· Hung-Jen Chen, Yu-Heng Ho, Ting-Yao Huang, Po-Hsiang Hsu, Li-Yu Chen, Chun-Yi Lee, Min Sun·· 3 小时前AI 评分22
Qwen-VL 与 LLaVA 的归纳视觉逻辑:少样本跨分布适应新方法
Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs
AI 导读
Qwen-VL 与 LLaVA 等生成式视觉语言模型在零样本任务上表现强,但在未见过的专业领域(远距离 OOD)判别特征缺失时失效。IVL 是一种无需训练的新框架,通过双模式提示从少量支持图像提取语义描述与视觉观察,构建类别特征字典并分层过滤空间证据,在多个远距离 OOD 基准上达到最高综合准确率,且预测可解释、可追溯。
来源:arXiv · Computer Vision · arxiv.org