Ollama 发布 NVIDIA DGX Spark 性能测试结果
Ollama 在 DGX Spark 固件 580.95.05 与 Ollama v0.12.6 下测试 gpt-oss、gemma3、llama3.1、deepseek-r1、qwen3 等模型的 prefill 与 decode 速度,并给出固件升级与安装命令。
推荐理由:原文给出 DGX Spark 上多模型的量化与速度数据,读者可据此评估本地部署的吞吐与显存匹配度。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
Ollama 在 DGX Spark 固件 580.95.05 与 Ollama v0.12.6 下测试 gpt-oss、gemma3、llama3.1、deepseek-r1、qwen3 等模型的 prefill 与 decode 速度,并给出固件升级与安装命令。
推荐理由:原文给出 DGX Spark 上多模型的量化与速度数据,读者可据此评估本地部署的吞吐与显存匹配度。
OpenAI 联合 Ollama 发布 gpt-oss-20b 与 gpt-oss-120b 两个开源权重模型,支持 Agentic 能力、链式推理、可配置推理强度和 MXFP4 量化,20B 模型可在 16GB 内存运行,120B 模型可单卡 80GB GPU 部署。
推荐理由:本地即可运行 OpenAI 最新开源权重模型,读者能据此评估自身硬件是否满足部署门槛。
Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。
推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。
Vector Institute AI Engineering团队评估了11个前沿模型(涵盖开源与闭源),使用16项基准(含MMLU-Pro、MMMU、OS-World),并首次开源结果与代码,提供交互排行榜。
推荐理由:Vector开源了16项基准与代码并附交互排行榜,读者可据此独立复现和比较11个前沿模型的能力与局限。
Geoffrey Hinton 与 John J. Hopfield 因「为人工神经网络的机器学习奠定基础的发现和发明」共享 2024 年诺贝尔物理学奖。Hinton 是 Vector Institute 联合创始人、多伦多大学计算机科学名誉教授,其方法基于 Hopfield 的模式保存与重建技术,成为当今大型人工神经网络的关键基础。
推荐理由:Hinton获奖及其学生网络为加拿大AI生态提供背景,读者可借此理解学术传承与产业影响力的关联。
Ollama 推出对 OpenAI Chat Completions API 的内置兼容支持,可使用 cURL、OpenAI Python/JS 库及 Vercel AI SDK、Autogen 等框架本地调用模型。
推荐理由:本地 Ollama 新增 OpenAI 兼容接口,开发者可沿用既有 SDK 与工具链对接本地模型。