Modèles, tokens et fenêtre de contexte : ce qui se passe en coulisses
Chaque fois que vous écrivez à Claude ou à ChatGPT, trois éléments déterminent le résultat : le modèle qui répond, le nombre de tokens que consomme la conversation et la place qui reste dans la fenêtre de contexte. Comprenez ces trois notions et vous choisirez le bon outil, économiserez votre quota d'utilisation et obtiendrez des réponses plus précises.
01Au fait, qu'est-ce qu'un modèle de langage ?
Un modèle de langage (LLM) est un logiciel entraîné sur une énorme quantité de textes : livres, sites web, code, documents. Grâce à cet entraînement, il a appris les structures de la langue et acquis beaucoup de connaissances.
Au fond, il ne fait qu'une chose : deviner la suite. Il lit ce que vous avez écrit, prédit le mot suivant (plus exactement, le token suivant), l'ajoute, et recommence jusqu'à former une réponse complète.
Cela paraît simple, mais quand le modèle est grand et bien entraîné, ces prédictions sont assez bonnes pour rédiger un e-mail, vérifier un calcul ou écrire du code.
02Un moteur et un bureau
Voyez le modèle comme la cylindrée d'une voiture : un gros moteur est plus puissant mais consomme davantage, et il est inutile pour aller à l'épicerie du coin. La fenêtre de contexte, c'est la surface du bureau sur lequel vous travaillez : chaque document, plan et message que vous y posez prend de la place. Quand le bureau est plein, vous résumez, vous rangez quelques papiers ou vous passez à un bureau vide.
03Ce qui se passe quand vous appuyez sur Envoyer
- 1Votre texteLa question, les fichiers et tous les messages précédents de la conversation
- 2Découpage en tokensLe texte est découpé en petits morceaux de mots
- 3Le modèleCalcule le token suivant le plus probable
- 4Nouveaux tokensGénérés un par un, chacun à partir des précédents
- 5La réponseLes tokens sont réassemblés pour former le texte que vous lisez
04Les familles de modèles Claude
Haiku
Le petit modèle rapide. Idéal pour les tâches courtes et répétitives : trier des e-mails, extraire des données d'un tableau, donner des réponses rapides.
Sonnet
Un bon compromis entre rapidité et intelligence. Un choix par défaut raisonnable pour la plupart des tâches quotidiennes : rédiger, résumer, relire des documents.
Opus
Un grand modèle pour les travaux longs et complexes : vérifier un calcul délicat, faire tourner des agents de programmation, analyser plusieurs documents ensemble. Plus lent, il entame davantage votre quota.
Niveau supérieur
En octobre 2026, il existe aussi un modèle appelé Fable, au-dessus d'Opus, pour les tâches de raisonnement les plus difficiles. Les noms et les versions changent : consultez toujours la page officielle des modèles.
ChatGPT et Gemini
OpenAI et Google proposent eux aussi des modèles plus ou moins grands, ainsi que des variantes avec réflexion. La logique est la même : plus grand signifie plus intelligent, mais plus lent et plus coûteux.
05Tokens, contexte et réflexion : les notions clés
Token
Un morceau de mot. Un mot court peut tenir en un seul token, un mot long en plusieurs. Tout ce qui entre dans le modèle et en sort est compté en tokens.
Hébreu ou anglais
En général, un même contenu se découpe en davantage de tokens en hébreu qu'en anglais, car les modèles ont été entraînés surtout sur de l'anglais. Les conversations en hébreu se remplissent donc plus vite.
Fenêtre de contexte
Le nombre de tokens que le modèle peut voir en même temps dans une conversation : instructions, fichiers, vos messages et ses réponses. Au-delà, il ne voit rien. À chaque message, le modèle relit toute la conversation.
Quand elle est pleine
Avec les offres payantes, Claude résume automatiquement les parties les plus anciennes pour faire de la place (Claude Code appelle cela la compaction). Les premiers détails peuvent devenir flous : pour un nouveau sujet, ouvrez une nouvelle conversation avec un court résumé.
Mode réflexion
Le modèle raisonne en silence avant de répondre : il décompose le problème et se vérifie lui-même. C'est mieux pour les calculs et les analyses, mais plus lent et plus gourmand en tokens.
Limites d'utilisation
Les abonnements Claude comportent des limites d'utilisation. Les longues conversations, les gros fichiers, les modèles lourds et le mode réflexion entament tous davantage votre quota.
06Un e-mail rapide à un client
07Relire un long rapport de calcul
08Un agent de programmation qui corrige une application
09Quel modèle pour quelle tâche
| Tâche | Niveau de modèle | Réflexion | Pourquoi |
|---|---|---|---|
| E-mail court ou reformulation | Haiku ou Sonnet | Désactivée | Tâche simple, la rapidité compte |
| Résumer un compte rendu de réunion | Sonnet | Désactivée | Texte moyen, pas de calcul |
| Traduire un cahier des charges technique | Sonnet | Désactivée ou faible | Exige des termes exacts, pas un raisonnement poussé |
| Extraire des données de dizaines de factures | Haiku | Désactivée | Beaucoup de petites tâches répétitives |
| Relire une note de calcul ou une norme | Opus | Activée | Exige de la logique, des unités cohérentes et une autovérification |
| Comparer des devis complexes | Sonnet ou Opus | Activée | Beaucoup de paramètres et de conditions |
| Agent de programmation ou automatisation longue | Opus | Activée | Beaucoup d'étapes, exige de la planification et des corrections |
| Trouver des idées de titres d'articles | Sonnet | Désactivée | De la créativité, pas du calcul |
10Comment économiser votre quota
- 1
Adaptez le modèle à la tâche
N'utilisez pas Opus pour un e-mail de deux lignes. Sonnet ou Haiku le feront plus vite et à moindre coût.
- 2
Un sujet, une conversation
Une longue conversation est relue à chaque message. Nouveau sujet = nouvelle conversation, avec un court résumé.
- 3
N'envoyez que le nécessaire
Au lieu d'un PDF de 200 pages, joignez le chapitre utile ou collez le tableau dont vous avez besoin.
- 4
Utilisez les Projects
Dans les Projects, les documents sont récupérés au besoin au lieu d'être tous chargés dans chaque conversation (voir Un contexte qui reste).
- 5
Désactivez les outils inutiles
Les connecteurs et outils actifs occupent de la place dans la fenêtre de contexte. Ne gardez activé que ce que vous utilisez.
- 6
La réflexion seulement quand elle aide
Oui pour les calculs et les analyses, non pour rédiger un e-mail.
11Pourquoi toujours vérifier : les hallucinations
Ce que le modèle peut faire
- Inventer un numéro d'article de norme qui n'existe pas
- Donner une valeur de coefficient qui semble juste mais qui est fausse
- Citer une source qui n'existe pas
- Paraître totalement sûr de lui, même quand il se trompe
Ce que vous faites
- Vérifier chaque chiffre dans la norme ou le catalogue d'origine
- Demander la source et la vérifier vous-même
- Joindre le document lui-même au lieu de vous fier à la mémoire du modèle
- Ne valider que ce que vous avez vérifié vous-même
12Questions fréquentes
Pourquoi le modèle « oublie »-t-il ce que j'ai dit au début de la conversation ?
Probablement parce que la fenêtre de contexte s'est remplie et que Claude a résumé les parties les plus anciennes, ou simplement parce que la conversation est si longue que des détails se perdent. Ouvrez une nouvelle conversation avec un résumé des points essentiels.
Faut-il écrire en anglais pour économiser des tokens ?
Pas forcément. L'hébreu consomme généralement plus de tokens, mais si vous êtes à l'aise en hébreu, les réponses sont bonnes. Pour les documents très longs, l'anglais mérite d'être envisagé.
Comment savoir de quels modèles je dispose ?
Dans le sélecteur de modèle de l'interface Claude. La liste dépend de votre abonnement, et les noms changent avec le temps. La liste à jour se trouve sur la page des modèles de la documentation Claude.
Un modèle plus grand est-il toujours meilleur ?
Non. Pour les tâches simples, il est plus lent et consomme davantage de quota sans grand bénéfice. Choisissez le plus petit modèle qui fait bien le travail.
Le mode réflexion empêche-t-il les hallucinations ?
Il réduit les erreurs de calcul et de raisonnement, mais ne les élimine pas. Vous devez toujours vérifier chaque chiffre important.