跳到正文
原文
Ollama Blog·· 2025-09-23AI 评分58

Ollama 推出新的模型调度系统

New model scheduling

AI 导读

Ollama 发布新的模型调度引擎,精确测量模型所需内存,减少内存溢出崩溃并提升 GPU 利用率。示例显示 gemma3:12b 在 128k 上下文下 token 生成速度从 52.02 提升至 85.54 tokens/s,mistral-small3.2 提示评估速度从 127.84 提升至 1380.24 tokens/s。新功能默认适用于新引擎实现的所有模型。

来源:Ollama Blog · ollama.com