
La prima risposta è lenta, le altre volano: cosa conserva davvero la KV cache
Per un modello da 13 miliardi di parametri la cache di un singolo token occupa 800 KB, e una richiesta da 2048 token arriva a 1,6 GB. Da quella memoria nasce lo sconto del 90% sul prompt caching, e anche la regola che quasi nessuno applica: la cache è un prefisso, e un byte cambiato in testa la butta via tutta.







