跳到正文
原文
量子位· henry·· 4 小时前精选AI 评分78

何恺明团队提出多模态视觉原生Harness框架VISTA

何恺明团队发布多模态Harness框架

AI 导读

何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生Harness框架VISTA,让现有多模态模型无需额外训练即可保存原始画面,并在推理时回看、放大和检查细节。

推荐理由

论文提出不训练新模型的视觉原生Harness,让多模态模型按需回看原始画面,并在多个交互式基准中给出量化提升。

来源:量子位 · qbitai.com