Le cache clé-valeur conserve l’état d’attention des tokens déjà traités. Il accélère le décodage mais croît avec le contexte et les séquences concurrentes.
Ce que vous saurez faire
Séance de 2 heures
- Expliquer ce que stocke le cache clé-valeur, pourquoi il supprime du travail d’attention redondant pendant le décodage, et pourquoi il croît à la fois avec la longueur de contexte et avec la concurrence.
- Appliquer l’estimation 2 x couches x têtes KV x dimension de tête x tokens en cache x octets par élément à une architecture donnée, puis la multiplier par le nombre de séquences actives.
- Prédire la conséquence mémoire d’un doublement du contexte actif ou d’un doublement de la concurrence sous cette estimation linéaire, et nommer les endroits où l’estimation cesse d’être linéaire.
- Comparer le contexte borné, le regroupement délibéré des requêtes, l’attention GQA/MQA, la pagination des blocs de cache, la réutilisation vérifiée de préfixes et la précision réduite du cache comme des leviers distincts aux coûts distincts.
- Distinguer le cache de prompt d’un fournisseur du cache KV d’exécution d’une requête unique, et énoncer les règles d’éligibilité et de persistance qui régissent chacun.
- Choisir les mesures de service qui révèlent la pression sur le cache : temps jusqu’au premier token, latence inter-tokens, débit de sortie, occupation du cache, taux d’éviction et de recalcul, latences p50/p95.
- Concevoir un test de charge dont la distribution des longueurs de contexte et le niveau de concurrence correspondent au trafic de production qu’il prétend prédire.
Modèle de taille
Une estimation courante vaut 2 × couches × têtes KV × dimension de tête × tokens en cache × octets par élément. Multiplier par les séquences actives lorsque les caches sont indépendants.
Leviers d’optimisation
Borner le contexte, regrouper les requêtes, utiliser GQA/MQA si le modèle le permet, paginer les blocs, réutiliser les préfixes vérifiés et évaluer séparément une précision de cache réduite.
Mesurer le service
Suivre TTFT, latence inter-token, débit, occupation du cache, évictions/recalculs et latences p50/p95 avec des contextes et une concurrence réalistes.
Ouvrir l’outil interactif — cache KV
Vérification rapide
Que devient la mémoire KV si le contexte actif double ?
Afficher la réponse
Dans l’estimation linéaire simplifiée, elle double approximativement.
Le prompt caching fournisseur est-il identique au cache KV actif ?
Afficher la réponse
Non. La réutilisation de préfixe suit des règles propres au fournisseur.
Mettre en pratique
Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.