跳到正文
热点事件持续更新

RVP与YORO:视觉语言模型重编程两条路径

2 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30 arXiv同时出现两篇视觉重编程研究。RVP提出结构化提示重参数化,将CLIP视觉重编程视为从冻结图像嵌入到下游logits的线性映射,单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,在11个少样本分类基准和4个CLIP主干上优于现有方法。YORO则利用冻结模型响应空间,通过单次前向遍历构建下游预测器,无需反向传播或优化器更新;贝叶斯判别映射(BDM)基于流式类统计推导协方差感知仿射映射,在三个全数据设置上平均精度较最强无梯度映射提升18.4–24.4%,16-shot CLIP四骨干平均从71.4%提升至77.2%,并可选对视觉提示再优化20轮。两篇均聚焦冻结视觉语言模型的高效重编程,但方法路径不同。

AI 根据报道生成 · 2 小时前更新

事件进展

2 个进展
  1. 9月30日 12:00 · 1 篇报道
    RVP通过结构化提示重参数化重新编程视觉语言模型
    arXiv · Computer Vision:Reprogramming Vision-Language Models via Structured Prompt Reparameterization
  2. 9月30日 12:00 · 1 篇报道
    YORO:视觉重编程单次前向预测方法
    arXiv · Computer Vision:You Only Reprogram Once:重新思考视觉重编程的长训练

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Computer Vision
    You Only Reprogram Once:重新思考视觉重编程的长训练

    论文提出 YORO 方法,利用冻结模型的响应空间通过单次前向遍历构建下游预测器,无需反向传播或优化器更新;贝叶斯判别映射(BDM)基于流式类统计推导协方差感知仿射映射。在三个全数据设置上平均精度较最强无梯度映射提升 18.4–24.4%,16-shot CLIP 四骨干平均从 71.4% 提升至 77.2%。YORO-FP 可选对视觉提示再优化 20 轮,验证时常保留单次预测器。

  2. arXiv · Computer Vision
    Reprogramming Vision-Language Models via Structured Prompt Reparameterization

    summary_zh: RVP 通过结构化提示重参数化对视觉语言模型进行视觉重编程,在 11 个少样本分类基准和 4 个 CLIP 主干上优于现有方法。CLIP 视觉重编程可表示为从冻结图像嵌入到下游 logits 的线性映射,RVP 用单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,几乎无额外计算开销。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。