Google Research·· 2026-06-27AI 评分59
Pixel上通过冻结MTP加速Gemini Nano模型
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
Google Research在Pixel 9和10上部署冻结多Token预测架构,通过将MTP头附加到已冻结的Gemini Nano v3模型实现端侧加速。该架构利用零拷贝设计,MTP头直接交叉关注主模型KV缓存,在通知摘要和校对任务中提速50%以上,每实例节省130MB内存。
来源:Google Research · research.google