热点事件持续更新
RVP与YORO:视觉语言模型重编程两条路径
2 篇报道1 个报道来源6 小时前更新
先了解这件事
AI 综述
2026-09-30 arXiv同时出现两篇视觉重编程研究。RVP提出结构化提示重参数化,将CLIP视觉重编程视为从冻结图像嵌入到下游logits的线性映射,单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,在11个少样本分类基准和4个CLIP主干上优于现有方法。YORO则利用冻结模型响应空间,通过单次前向遍历构建下游预测器,无需反向传播或优化器更新;贝叶斯判别映射(BDM)基于流式类统计推导协方差感知仿射映射,在三个全数据设置上平均精度较最强无梯度映射提升18.4–24.4%,16-shot CLIP四骨干平均从71.4%提升至77.2%,并可选对视觉提示再优化20轮。两篇均聚焦冻结视觉语言模型的高效重编程,但方法路径不同。
AI 根据报道生成 · 2 小时前更新
最新进展9月30日 12:00
两篇方法同日发布,RVP强调单提示重参数化,YORO强调无梯度单次预测器与BDM映射。事件进展
2 个进展
- 9月30日 12:00 · 1 篇报道RVP通过结构化提示重参数化重新编程视觉语言模型arXiv · Computer Vision:Reprogramming Vision-Language Models via Structured Prompt Reparameterization
- 9月30日 12:00 · 1 篇报道YORO:视觉重编程单次前向预测方法arXiv · Computer Vision:You Only Reprogram Once:重新思考视觉重编程的长训练
报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv · Computer VisionYou Only Reprogram Once:重新思考视觉重编程的长训练
论文提出 YORO 方法,利用冻结模型的响应空间通过单次前向遍历构建下游预测器,无需反向传播或优化器更新;贝叶斯判别映射(BDM)基于流式类统计推导协方差感知仿射映射。在三个全数据设置上平均精度较最强无梯度映射提升 18.4–24.4%,16-shot CLIP 四骨干平均从 71.4% 提升至 77.2%。YORO-FP 可选对视觉提示再优化 20 轮,验证时常保留单次预测器。
- arXiv · Computer VisionReprogramming Vision-Language Models via Structured Prompt Reparameterization
summary_zh: RVP 通过结构化提示重参数化对视觉语言模型进行视觉重编程,在 11 个少样本分类基准和 4 个 CLIP 主干上优于现有方法。CLIP 视觉重编程可表示为从冻结图像嵌入到下游 logits 的线性映射,RVP 用单个视觉提示即可在推理时重参数化为冻结主干加线性分类器,几乎无额外计算开销。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。