跳到正文
原文
arXiv · Computer Vision· Zizhao Li, Chengyi Cai, Mohammed Yaqoob Ansari, Feng Liu, Joseph West, Kourosh Khoshelham·· 7 小时前AI 评分36

Reprogramming Vision-Language Models via Structured Prompt Reparameterization

Reprogramming Vision-Language Models via Structured Prompt Reparameterization

AI 导读

summary_zh: RVP 通过结构化提示重参数化对视觉语言模型进行视觉重编程,在 11 个少样本分类基准和 4 个 CLIP 主干上优于现有方法。CLIP 视觉重编程可表示为从冻结图像嵌入到下游 logits 的线性映射,RVP 用单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,几乎无额外计算开销。

来源:arXiv · Computer Vision · arxiv.org