Session systèmes 1/4 · Diapositives

Tokenizers et budgets de tokens

1/18

Tokenizers et budgets de tokens

Le modèle ne voit jamais votre texte. Il voit une suite d’entiers produite par un tokenizer.

Notes du présentateur

Ouvrez à froid sur cette affirmation et laissez-la agir un instant. Demandez qui a déjà compté les tokens d’une invite mise en production. Deux minutes, sans autre diapositive.

2/18

Pourquoi cette séance vient en premier

Notes du présentateur

Posez le cadre : c’est de la plomberie, et c’est la plomberie qui casse. Trois minutes, puis avancez.

3/18

Ce qu’est un token

Notes du présentateur

Tokenisez une phrase en direct et lisez les morceaux à voix haute, espaces comprises. Cette seule démonstration élimine définitivement l’idée qu’un token vaut un mot. Cinq minutes.

4/18

Les tokens sont spécifiques au modèle

La même chaîne tokenisée par deux tokenizers différents donne deux comptes différents, et aucun des deux n’est faux.

Notes du présentateur

Demandez à la salle d’estimer le compte de tokens d’une courte phrase avant de révéler les deux nombres. La dispersion des estimations est le moment pédagogique.

5/18

Un compte sans tokenizer n’est pas un résultat

Tout chiffre de tokens doit porter l’identifiant du tokenizer et de la révision qui l’a produit.

Notes du présentateur

Érigez-le en règle pour toute la séance : chaque nombre inscrit sur la fiche reçoit une étiquette de tokenizer. Faites-la respecter pendant l’atelier A.

6/18

Atelier A — le même texte, deux tokenizers

Cinq échantillons, deux tokenizers, un tableau. Comparez les comptes et les rapports.

Notes du présentateur

20 minutes, en binôme. Circulez et vérifiez que les colonnes sont bien étiquetées. Récupérez deux ou trois rapports pour le débriefing.

7/18

Ce que les rapports vous apprennent

Type de contenuCoût typique par rapport à la prose anglaisePourquoi
Prose anglaiseRéférence, environ 1,2 à 1,4 token par motLa mieux couverte par le vocabulaire
Prose française, même sensCouramment 15 à 30 pour cent de plusLes séquences moins fréquentes se fragmentent davantage
Code sourceNettement plus par caractère visibleIndentation, ponctuation, découpage des identifiants
Emoji et écritures raresPlusieurs tokens par caractèreRepli au niveau des octets
Notes du présentateur

Présentez-les comme des ordres de grandeur défendables, pas comme des constantes. Dites explicitement qu’ils dépendent du tokenizer et doivent être remesurés pour le vôtre.

8/18

Le réglage par défaut anglophone est un coût caché

Un produit non anglophone paie une taxe en tokens sur chaque requête, qui se cumule en coût, en latence et en contexte perdu.

Notes du présentateur

Point particulièrement pertinent pour ce public. Demandez si quelqu’un a dimensionné un produit francophone à partir de références anglaises. Deux minutes.

9/18

Tout ce qui est dans la fenêtre est facturé

Toute la requête doit tenir : entrée et sortie réservéeSystèmeHistoriqueSchémas d’outilsRécupéréUtilisateurSortieFenêtre de contexteréservé à la sortie
Toute la requête doit tenir : entrée et sortie réservée
Notes du présentateur

Soulignez que les trois premiers sont invisibles dans la plupart des interfaces, et que c’est exactement pour cela qu’on les oublie. Affichez une requête rendue si vous en avez une sous la main.

10/18

Réservez la sortie

La réponse générée doit tenir dans la même fenêtre que l’entrée : budgétisez-la avant d’envoyer.

Notes du présentateur

Demandez ce qui arrive quand il reste 200 tokens et qu’on réclame une réponse de 900. Laissez quelqu’un le dire à voix haute : la réponse est coupée en pleine phrase.

11/18

L’équation du budget

Système plus historique plus schémas plus récupération plus entrée plus sortie réservée doit rester sous la fenêtre de contexte.

Notes du présentateur

Écrivez-la au tableau et laissez-la affichée. Les participants la recopieront sur la fiche de l’atelier B.

12/18

Atelier B — budgétiser une requête complète

Assembler, mesurer, totaliser, comparer, puis décider quoi couper.

Notes du présentateur

25 minutes, en binôme. Insistez pour qu’ils mesurent le template rendu, pas le texte brut. Circulez au moment du dépassement : c’est là que l’apprentissage se produit.

13/18

Quand cela ne tient pas

Notes du présentateur

Faites le débriefing de l’atelier B ici. Demandez à chaque binôme de nommer le contenu exact sacrifié, puis insistez : l’utilisateur s’en apercevrait-il ?

14/18

La troncature est une décision de conception

Si vous ne choisissez pas de politique, le moteur d’exécution en choisit une à votre place et ne vous le dit pas.

Notes du présentateur

C’est la phrase à répéter. Associez-la au rappel que le dépassement produit des réponses dégradées, pas des exceptions.

15/18

Épinglez le trio en entier

Notes du présentateur

Ces trois éléments forment une unité atomique. Précisez qu’un décalage s’exécute sans erreur, et que c’est ce qui le rend dangereux. Enchaînez sur l’atelier C.

16/18

Testez aux frontières

Notes du présentateur

Demandez lesquels figurent déjà dans les suites de tests de la salle. La réponse honnête est en général : aucun. Trois minutes.

17/18

Estimations contre mesures

Les ratios caractères par token servent à la planification de capacité. Ce qui conditionne une requête utilise le vrai tokenizer.

Notes du présentateur

Bouclez la boucle avec le ratio que quelqu’un a appliqué au français dans l’atelier A et comparez-le au compte mesuré.

18/18

Limite honnête

Notes du présentateur

Terminez sur la méthode plutôt que sur les chiffres. Donnez la seule chose à retenir : mesurez votre propre chaîne, et étiquetez chaque compte avec son tokenizer.