arXiv · Artificial Intelligence· Chence Yang, Ningxi Cheng, Arash Akbari, Qitao Tan, Qingchan Zhu, Ci Zhang, Changdi Yang, Yanzhi Wang, Wei Niu, Jinhui Wang, Jin Lu, Geng Yuan·· 16 小时前AI 评分29
BitNest:面向内存高效 LLM 推理加速的位嵌套投机解码
BitNest: Bit-Nested Speculative Decoding for Memory-Efficient LLM Inference Acceleration
AI 导读
BitNest 提出位嵌套投机解码框架,将低精度草稿直接嵌入高精度目标表示,让草稿与目标模型共享单一物理权重。它进一步把渐进精度设计扩展到 KV cache 以支持长上下文推理,在多个 7B–8B 边缘友好 LLM 上平均投机接受率达 95.2%,相对 FP16 自回归解码实现 1.48–1.61x 端到端加速。
来源:arXiv · Artificial Intelligence · arxiv.org