Skip to content
arXiv · Machine Learning Theory· Zhi-Kai Chen, Song-Yan Li, De-Chuan Zhan, Han-Jia Ye·· 4 hr agoAI score29

SchemaFill:用槽位并行投机解码提升 LLM 工具调用效率

SchemaFill: Efficient LLM Tool Calling via Slot-Parallel Speculative Decoding

AI brief

SchemaFill 提出槽位并行投机解码框架,让 LLM 工具调用中的未来槽位值并发生成候选,再由目标模型在实际输出前缀下验证,仅提交通过验证的 token。候选可跨多个字段和调用拼接验证,无需预知实际调用序列或参数值。在 Glaive 和 BFCL 上,端到端吞吐量较自回归解码最高提升 4.05×,代码已开源。

Source: arXiv · Machine Learning Theory · arxiv.org