小红书团队开源的高效长上下文 LLM 服务框架。通过注意力头分类和分段式 KV 缓存策略,将长上下文大模型推理的预填充 FLOPs 降低约 50%-70%,同时保持接近无损的精度。 https://...
Geek(@geekbb)176 字 (约 1 分钟)
85
小红书团队开源的高效长上下文LLM服务框架通过注意力头分类和分段式KV缓存策略,降低预填充FLOPs约50%-70%。
入选理由:RedKnot框架通过分段式KV缓存策略减少50%-70%预填充计算量
精选推文#LLM#开源#优化技术#KV缓存中英混合