Skip to content
量子位· henry·· 5 hr agoSelectedAI score78

Kaiming He's Team Proposes VISTA, a Multimodal Vision-Native Harness Framework

何恺明团队发布多模态Harness框架

AI brief

Kaiming He's team introduced VISTA, a vision-native harness framework, in the paper "VISTA: A Visual Harness for Reasoning in an Interactive World." It enables existing multimodal models to preserve raw visual frames without additional training and to revisit, zoom in, and inspect details during reasoning.

Why it matters

The paper introduces a vision-native harness that requires no new model training, lets multimodal models revisit raw frames on demand, and reports quantitative gains across multiple interactive benchmarks.

Source: 量子位 · qbitai.com