LMCache:LLM 推理的 KV Cache 管理层,让 GPU 显存压力骤降
今天在 GitHub Trending 上看到一个很有意思的项目:LMCache,一个 KV Cache 管理中间层,能够把 GPU 显存里的中间结果持久化出来复用,显著降低 TTFT(首 Token 延迟)...
今天在 GitHub Trending 上看到一个很有意思的项目:LMCache,一个 KV Cache 管理中间层,能够把 GPU 显存里的中间结果持久化出来复用,显著降低 TTFT(首 Token 延迟)...