量子位· henry·· 5 hr agoSelectedAI score78
Kaiming He's Team Proposes VISTA, a Multimodal Vision-Native Harness Framework
何恺明团队发布多模态Harness框架
AI brief
Kaiming He's team introduced VISTA, a vision-native harness framework, in the paper "VISTA: A Visual Harness for Reasoning in an Interactive World." It enables existing multimodal models to preserve raw visual frames without additional training and to revisit, zoom in, and inspect details during reasoning.
Why it matters
The paper introduces a vision-native harness that requires no new model training, lets multimodal models revisit raw frames on demand, and reports quantitative gains across multiple interactive benchmarks.
Source: 量子位 · qbitai.com