Vector Institute 发布 State of Evaluation 研究:全球11个AI模型经16项基准评估
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
值得读的 AI 论文与研究成果:架构创新、训练方法、能力测量与理论进展的精选解读。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
Vector Applied Scientist David Emerson 等人提出通用提示模板 Abstract ScreenPrompt 和 ISO-ScreenPrompt,在 10 个临床领域的系统综述上实现 97.7% 加权灵敏度和 85.2% 加权特异性(摘要筛选),全文筛选达 96.5% 灵敏度和 91.2% 特异性。
推荐理由:通用提示模板让大语言模型在系统综述筛选中达到高灵敏度与特异性,为自动化证据筛选提供了可迁移方法。
斯坦福 Hazy Research 团队发布 Minions 论文与开源代码,让本地小模型(如 Llama 3.2 via Ollama)与云端大模型(如 GPT-4o)协作,将大量 LLM 工作负载转移到消费设备。
推荐理由:通过本地小模型与云端大模型协作的两套协议,在显著降低远程调用成本的同时保持较高性能。
Vector Institute研究显示,基于Word2Vec和语言特征的简单AI模型在ADReSS数据集上以92%准确率和100%灵敏度检测阿尔茨海默病,性能超过微调的BERT和GPT-2等上下文模型。该方法结合词向量与34项语言特征,可解释性强、计算效率更高,未来需在不同人群和临床场景中进一步验证。
推荐理由:用简单词向量加语言特征就能在ADReSS上达到92%准确率,为低成本、可解释的阿尔茨海默筛查提供新思路。
Geoffrey Hinton 与 John J. Hopfield 因「为人工神经网络的机器学习奠定基础的发现和发明」共享 2024 年诺贝尔物理学奖。Hinton 是 Vector Institute 联合创始人、多伦多大学计算机科学名誉教授,其方法基于 Hopfield 的模式保存与重建技术,成为当今大型人工神经网络的关键基础。
推荐理由:Hinton获奖及其学生网络为加拿大AI生态提供背景,读者可借此理解学术传承与产业影响力的关联。