Les produits LLM grand public exposent les mêmes modèles à travers des surfaces différentes. Chaque surface modifie ce qui entre dans la fenêtre de contexte, ce que le modèle peut appeler, et ce que l’opérateur doit vérifier.
Ce que vous saurez faire
Séance de 2 heures
- Énoncer, pour n’importe quelle requête, ce que contient réellement la fenêtre de contexte : la question, les sources injectées, les fichiers joints et la mémoire persistante.
- Prédire quel mode de défaillance produit une surface donnée : rappel périmé, résumé infidèle, ou calcul non vérifié.
- Choisir la surface la moins coûteuse capable de répondre correctement, au lieu de se rabattre par défaut sur la plus puissante.
- Vérifier une réponse adossée à la recherche en ouvrant ses citations et en qualifiant chaque affirmation : étayée, non étayée, ou invérifiable.
- Lire un programme émis comme l’artefact vérifiable d’un calcul, plutôt que de faire confiance au nombre affiché.
- Estimer le coût relatif d’un tour à contexte long et expliquer pourquoi coller un document entier est rarement gratuit.
- Auditer la mémoire persistante et les instructions personnalisées comme une surface de confidentialité, et non comme un simple confort d’usage.
Une surface est une politique de contexte
Un tour de chat simple est un flux de tokens autonome, borné par la date de coupure des connaissances. Une surface de recherche y injecte des passages récupérés. Une surface de code y injecte des fichiers du dépôt. Une surface documentaire y injecte un corpus déposé. Choisir une surface, c’est choisir ce qui occupe la fenêtre de contexte, pas seulement cliquer sur un bouton.
La récupération déplace le mode de défaillance
Sans récupération, le risque est un rappel périmé ou fabriqué. Avec récupération, le risque se déplace vers la qualité des sources, la sélection des passages et la fidélité du résumé. La récupération réduit l’obsolescence ; elle ne dispense pas d’ouvrir la source citée et de confirmer l’affirmation.
Calcul délégué et exécution de code
Quand une surface peut exécuter du code, le calcul et le travail sur données quittent le flux de tokens pour s’exécuter dans un interpréteur. Cela supprime les erreurs de calcul mental mais introduit un nouvel artefact vérifiable : le programme émis. Lisez le code, pas seulement le nombre affiché. Toute extrapolation au-delà des données observées reste une hypothèse.
Coût d’exploitation et persistance
Un contexte plus long coûte plus cher et décode plus lentement : bornez ce que vous collez. Mémoire, instructions personnalisées et configurations enregistrées persistent entre les sessions : ce sont des commodités autant qu’une surface de confidentialité, à réviser plutôt qu’à accumuler silencieusement.
Ouvrir l’outil interactif — budget de contexte Ouvrir l’outil interactif — tokenizer
Cadrage inspiré d’Andrej Karpathy, « How I use LLMs » (conférence publique). Les concepts sont ici reformulés et adaptés pour ce cours ; l’original fait autorité. https://www.youtube.com/watch?v=EWvNQjAaOHw
Vérification rapide
Activer un outil de recherche rend-il une réponse fiable ?
Afficher la réponse
Non. Cela déplace le mode de défaillance du rappel périmé vers la qualité des sources et du résumé. La source citée doit toujours être ouverte et vérifiée.
Pourquoi préférer une surface exécutant du code pour un calcul ?
Afficher la réponse
Le calcul s’exécute dans un interpréteur au lieu d’être prédit token par token, et il laisse un programme inspectable comme artefact à relire.
Quel est le coût de coller un très long document dans le contexte ?
Afficher la réponse
Un prix par tour plus élevé et un décodage plus lent, car l’attention et le décodage croissent avec les tokens maintenus dans la fenêtre.
Mettre en pratique
Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.