LMCache:LLM 推理的 KV Cache 管理层,让 GPU 显存压力骤降

今天在 GitHub Trending 上看到一个很有意思的项目:LMCache,一个 KV Cache 管理中间层,能够把 GPU 显存里的中间结果持久化出来复用,显著降低 TTFT(首 Token 延迟)...

技术 · 开源 · 周六, 六月 13, 2026 · 5 分钟 · 2027 字