Computation-Aware Tiered Eviction: Optimizing KV Cache Management for Long-Context LLM Inference
Sathish Kumar
Int J Performability Eng . 2026, (8): 462 -472 .  DOI: 10.23940/ijpe.26.08.p4.462472