跳到正文
原文
Google Research·· 2026-06-27AI 评分59

Pixel上通过冻结MTP加速Gemini Nano模型

Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction

AI 导读

Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。

来源:Google Research · research.google