Vector Institute 发布 State of Evaluation 研究:全球11个AI模型经16项基准评估
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
Google Gemma 2 现已提供 2B、9B 和 27B 三种规格,采用全新架构,27B 参数在基准测试中超越两倍规模模型。Ollama 已支持运行 Gemma 2,并给出与 LangChain、LlamaIndex 的集成示例。
推荐理由:27B 参数在开放模型中实现超越更大模型的性能,为开源部署提供了新的效率标杆。
Google Research 推出基于 TensorFlow Lite 的移动端胎儿超声评估模型,支持非专家通过盲扫协议获取孕周与胎位预测。模型在 Pixel 设备上实现 30 帧/秒以上实时推理,且无精度损失,并提供扫查质量反馈。
推荐理由:原文给出移动端实时推理速度与质量反馈机制,读者可据此评估该工具在低资源场景下的可用性。