Session systèmes 1/4 · Cours apprenant

Tokenizers et budgets de tokens

Un tokenizer transforme le texte en identifiants de tokens avant son traitement par le modèle. Les budgets bornent contexte, sortie, latence et coût.

La même phrase, trois tokenizers, trois comptes différentsAnglaisThe quick brown fox4FrançaisLe renard brun rapide5Codedef fn(x):5
La même phrase, trois tokenizers, trois comptes différents

Ce que vous saurez faire

Séance de 2 heures

Les tokens dépendent du modèle

Un token peut être un mot, un fragment, une ponctuation, un espace ou des octets. Utilisez le tokenizer exact et le gabarit de chat associés à la révision du modèle.

Budgéter toute la requête

Comptez les instructions système, l’historique, les schémas d’outils, les passages récupérés, la saisie et la sortie réservée. Définissez une politique explicite de troncature ou de résumé.

Contrôles opérationnels

Figez les révisions. Testez plusieurs langues, le code, les emoji, les tokens spéciaux et la troncature. Mesurez avec le vrai tokenizer ; l’estimation par caractères reste approximative.

Ouvrir l’outil interactif — tokenizer

Vérification rapide

Deux modèles peuvent-ils compter différemment la même phrase ?

Afficher la réponse

Oui. Le vocabulaire, la normalisation et la segmentation varient selon le tokenizer.

Que doit contenir la fenêtre de contexte ?

Afficher la réponse

La requête sérialisée complète et les tokens réservés à la sortie.

Mettre en pratique

Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.

Aller aux exercices · Passer le quiz