开放世界评估:衡量前沿 AI 能力的新方法与 CRUX 首轮实验
Sayash Kapoor 等人提出开放世界评估概念并介绍 CRUX 项目,首轮实验让 AI 代理在 macOS 虚拟机上开发并发布 iOS 应用,仅需一次不必要的人工干预,耗时约 45 分钟开发、10 天审核,总成本约 1000 美元,其中开发与提交仅 25 美元。作者据此提示应用商店可能面临代理自动提交 spam 的早期风险,并建议明确人工干预边界、公开日志、进行干跑与实时监控。
推荐理由:文章通过 CRUX 首轮实验揭示代理已接近自主发布应用,对应用商店治理与能力评估范式转移具有参考价值。