Session systèmes 2/4 · Cours apprenant

CPU, GPU et quantification

Le choix matériel dépend de la forme de la charge. La quantification peut réduire la mémoire des poids, mais compatibilité, latence et qualité doivent être mesurées.

Le prefill est parallèle sur les positions ; le decode est séquentielPrefillDecodetous les tokens du prompt d’un coupun token à la fois
Le prefill est parallèle sur les positions ; le decode est séquentiel

Ce que vous saurez faire

Séance de 2 heures

Rôles CPU et GPU

Le CPU convient au contrôle, au prétraitement et aux charges modestes. Le GPU offre beaucoup d’unités parallèles et une forte bande passante pour les tenseurs. Le prefill est parallèle ; le décodage reste séquentiel entre positions.

Estimation mémoire

Une première estimation des poids vaut paramètres × bits par poids ÷ 8. Elle exclut cache KV, activations, surcoût de l’allocateur, buffers et parfois des couches non quantifiées.

Porte de sortie quantifiée

Comparer au modèle de référence sur des tâches représentatives. Relever qualité, TTFT, latence inter-token, débit, pic mémoire, matériel, runtime et hash de l’artefact.

Ouvrir l’outil interactif — CPU et GPU Ouvrir l’outil interactif — quantification

Vérification rapide

Un fichier plus petit garantit-il une latence plus basse ?

Afficher la réponse

Non. Kernels, déquantification, charge et matériel peuvent inverser le résultat.

Quantifier les poids réduit-il automatiquement le cache KV ?

Afficher la réponse

Non. La précision des poids et celle du cache sont deux choix distincts.

Mettre en pratique

Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.

Aller aux exercices · Passer le quiz