Session systèmes 2/4 · Quiz et corrigé

CPU, GPU et quantification

10 questions, une seule bonne réponse par question. L’objectif est de vérifier que vous savez dimensionner la mémoire honnêtement, séparer le prefill du décodage, et refuser une version quantifiée qui n’a pas été mesurée.

1. Qu’est-ce qui détermine si une charge convient à un CPU ou à un GPU ?

Afficher la réponse

B — Les CPU conviennent au flot de contrôle général, au prétraitement et aux charges modestes. Les GPU conviennent aux opérations tensorielles denses à fort parallélisme et forte demande de bande passante. Le nombre de paramètres et la taille de fichier sont des conséquences, pas la propriété déterminante.

2. Pourquoi le décodage autorégressif est-il plus difficile à paralléliser que le prefill ?

Afficher la réponse

B — Le prefill traite toutes les positions du prompt d’un coup et est hautement parallèle. Le décodage émet une position de token à la fois, chacune conditionnée par la sortie précédente : la séquence ne peut pas être déroulée à l’avance.

3. Un modèle de 7 milliards de paramètres est stocké en 16 bits par poids. Quelle est la première estimation de mémoire des poids ?

Afficher la réponse

C — 7 × 10⁹ × 16 ÷ 8 = 1,4 × 10¹⁰ octets, soit environ 14 Go. La formule est paramètres × bits par poids ÷ 8, et 16 bits font 2 octets par poids.

4. Le même modèle 7B est quantifié en 4 bits. Que devient l’estimation ?

Afficher la réponse

B — 7 × 10⁹ × 4 ÷ 8 = 3,5 × 10⁹ octets, soit environ 3,5 Go. Diviser par deux les bits par poids divise par deux cette estimation, mais cela ne dit rien de la mémoire résidente totale.

5. Lequel de ces postes n’est PAS couvert par l’estimation paramètres × bits ÷ 8 ?

Afficher la réponse

B — L’estimation ne couvre que le stockage des poids. Le cache KV, les activations, la surcharge de l’allocateur, les tampons d’exécution, les métadonnées et les couches non quantifiées se situent tous en dehors.

6. Un fichier de modèle plus petit garantit-il une latence plus faible ?

Afficher la réponse

B — Un format quantifié exige des noyaux qui le traitent efficacement sur le matériel cible. Si le runtime déquantifie à la volée ou retombe sur un chemin générique, l’artefact plus petit peut être plus lent que le plus gros.

7. Vous avez quantifié les poids de 16 bits à 4 bits. Qu’est-il arrivé au cache KV ?

Afficher la réponse

C — La précision des poids et celle du cache KV sont des réglages indépendants. Abaisser l’une n’abaisse pas l’autre, et à long contexte ou forte concurrence le cache peut dominer le budget.

8. Que faut-il consigner pour une porte de sortie de quantification ?

Afficher la réponse

C — La porte compare un candidat quantifié à une référence de plus haute précision sur des tâches représentatives, et elle n’est reproductible que si le matériel, le runtime et l’identité de l’artefact sont consignés à côté des chiffres de performance et de qualité.

9. Vous comparez une version CPU et une version GPU, mais chacune a utilisé un jeu de prompts différent. Quel est le statut du résultat ?

Afficher la réponse

C — La charge, les prompts, le runtime et la grille de qualité doivent rester constants pendant que le matériel ou la précision varie. Sinon l’écart ne peut pas être attribué à la variable testée.

10. Quelle phase est typiquement la plus limitée par la bande passante mémoire à une taille de lot de 1 ?

Afficher la réponse

B — À une taille de lot de 1, le décodage lit l’ensemble des poids pour produire un seul token : il est donc généralement limité par la bande passante mémoire. Le prefill amortit cette lecture sur de nombreuses positions et tend à être limité par le calcul.

Barème

8 à 10 bonnes réponses : vous savez dimensionner un déploiement et défendre une décision de quantification par des mesures. 5 à 7 bonnes réponses : le calcul est acquis mais les exclusions et la porte de sortie ne sont pas encore des réflexes ; relisez la pile du budget mémoire et la liste de contrôle de la porte. Moins de 5 : reconstruisez les bases avant tout déploiement, en commençant par prefill contre décodage et par le fait que l’estimation des poids est un plancher, pas un budget.

Cours apprenant · Aller aux exercices