跳到正文
原文
arXiv · Artificial Intelligence· Chence Yang, Ningxi Cheng, Arash Akbari, Qitao Tan, Qingchan Zhu, Ci Zhang, Changdi Yang, Yanzhi Wang, Wei Niu, Jinhui Wang, Jin Lu, Geng Yuan·· 16 小时前AI 评分29

BitNest:面向内存高效 LLM 推理加速的位嵌套投机解码

BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration

AI 导读

BitNest 提出位嵌套投机解码框架,将低精度草稿直接嵌入高精度目标表示,让草稿与目标模型共享单一物理权重。它进一步把渐进精度设计扩展到 KV cache 以支持长上下文推理,在多个 7B–8B 边缘友好 LLM 上平均投机接受率达 95.2%,相对 FP16 自回归解码实现 1.48–1.61x 端到端加速。

来源:arXiv · Artificial Intelligence · arxiv.org