Session systèmes 3/4 · Cours apprenant

Dimensionnement et optimisation du cache KV

Le cache clé-valeur conserve l’état d’attention des tokens déjà traités. Il accélère le décodage mais croît avec le contexte et les séquences concurrentes.

La mémoire KV croît linéairement avec les tokens en cache (une séquence, illustratif)1 GB2k4 GB8k8 GB16k16 GB32kDoubler le contexte double approximativement le cache
La mémoire KV croît linéairement avec les tokens en cache (une séquence, illustratif)

Ce que vous saurez faire

Séance de 2 heures

Modèle de taille

Une estimation courante vaut 2 × couches × têtes KV × dimension de tête × tokens en cache × octets par élément. Multiplier par les séquences actives lorsque les caches sont indépendants.

Leviers d’optimisation

Borner le contexte, regrouper les requêtes, utiliser GQA/MQA si le modèle le permet, paginer les blocs, réutiliser les préfixes vérifiés et évaluer séparément une précision de cache réduite.

Mesurer le service

Suivre TTFT, latence inter-token, débit, occupation du cache, évictions/recalculs et latences p50/p95 avec des contextes et une concurrence réalistes.

Ouvrir l’outil interactif — cache KV

Vérification rapide

Que devient la mémoire KV si le contexte actif double ?

Afficher la réponse

Dans l’estimation linéaire simplifiée, elle double approximativement.

Le prompt caching fournisseur est-il identique au cache KV actif ?

Afficher la réponse

Non. La réutilisation de préfixe suit des règles propres au fournisseur.

Mettre en pratique

Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.

Aller aux exercices · Passer le quiz