量子位· henry·· 4 小时前精选AI 评分78
何恺明团队提出多模态视觉原生Harness框架VISTA
何恺明团队发布多模态Harness框架
AI 导读
何恺明团队在论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中提出视觉原生Harness框架VISTA,让现有多模态模型无需额外训练即可保存原始画面,并在推理时回看、放大和检查细节。
推荐理由
论文提出不训练新模型的视觉原生Harness,让多模态模型按需回看原始画面,并在多个交互式基准中给出量化提升。
来源:量子位 · qbitai.com