Guides IAComment l'IA réfléchit

Modèles, tokens et fenêtre de contexte : ce qui se passe en coulisses

Chaque fois que vous écrivez à Claude ou à ChatGPT, trois éléments déterminent le résultat : le modèle qui répond, le nombre de tokens que consomme la conversation et la place qui reste dans la fenêtre de contexte. Comprenez ces trois notions et vous choisirez le bon outil, économiserez votre quota d'utilisation et obtiendrez des réponses plus précises.

8 min de lecture

01Au fait, qu'est-ce qu'un modèle de langage ?

Un modèle de langage (LLM) est un logiciel entraîné sur une énorme quantité de textes : livres, sites web, code, documents. Grâce à cet entraînement, il a appris les structures de la langue et acquis beaucoup de connaissances.

Au fond, il ne fait qu'une chose : deviner la suite. Il lit ce que vous avez écrit, prédit le mot suivant (plus exactement, le token suivant), l'ajoute, et recommence jusqu'à former une réponse complète.

Cela paraît simple, mais quand le modèle est grand et bien entraîné, ces prédictions sont assez bonnes pour rédiger un e-mail, vérifier un calcul ou écrire du code.

02Un moteur et un bureau

Voyez le modèle comme la cylindrée d'une voiture : un gros moteur est plus puissant mais consomme davantage, et il est inutile pour aller à l'épicerie du coin. La fenêtre de contexte, c'est la surface du bureau sur lequel vous travaillez : chaque document, plan et message que vous y posez prend de la place. Quand le bureau est plein, vous résumez, vous rangez quelques papiers ou vous passez à un bureau vide.

03Ce qui se passe quand vous appuyez sur Envoyer

  1. 1Votre texteLa question, les fichiers et tous les messages précédents de la conversation
  2. 2Découpage en tokensLe texte est découpé en petits morceaux de mots
  3. 3Le modèleCalcule le token suivant le plus probable
  4. 4Nouveaux tokensGénérés un par un, chacun à partir des précédents
  5. 5La réponseLes tokens sont réassemblés pour former le texte que vous lisez

04Les familles de modèles Claude

Rapide et économique

Haiku

Le petit modèle rapide. Idéal pour les tâches courtes et répétitives : trier des e-mails, extraire des données d'un tableau, donner des réponses rapides.

Équilibré

Sonnet

Un bon compromis entre rapidité et intelligence. Un choix par défaut raisonnable pour la plupart des tâches quotidiennes : rédiger, résumer, relire des documents.

Puissant et lourd

Opus

Un grand modèle pour les travaux longs et complexes : vérifier un calcul délicat, faire tourner des agents de programmation, analyser plusieurs documents ensemble. Plus lent, il entame davantage votre quota.

Évolue

Niveau supérieur

En octobre 2026, il existe aussi un modèle appelé Fable, au-dessus d'Opus, pour les tâches de raisonnement les plus difficiles. Les noms et les versions changent : consultez toujours la page officielle des modèles.

Même principe

ChatGPT et Gemini

OpenAI et Google proposent eux aussi des modèles plus ou moins grands, ainsi que des variantes avec réflexion. La logique est la même : plus grand signifie plus intelligent, mais plus lent et plus coûteux.

05Tokens, contexte et réflexion : les notions clés

Unité de mesure

Token

Un morceau de mot. Un mot court peut tenir en un seul token, un mot long en plusieurs. Tout ce qui entre dans le modèle et en sort est compté en tokens.

Bon à savoir

Hébreu ou anglais

En général, un même contenu se découpe en davantage de tokens en hébreu qu'en anglais, car les modèles ont été entraînés surtout sur de l'anglais. Les conversations en hébreu se remplissent donc plus vite.

Mémoire de travail

Fenêtre de contexte

Le nombre de tokens que le modèle peut voir en même temps dans une conversation : instructions, fichiers, vos messages et ses réponses. Au-delà, il ne voit rien. À chaque message, le modèle relit toute la conversation.

Résumé automatique

Quand elle est pleine

Avec les offres payantes, Claude résume automatiquement les parties les plus anciennes pour faire de la place (Claude Code appelle cela la compaction). Les premiers détails peuvent devenir flous : pour un nouveau sujet, ouvrez une nouvelle conversation avec un court résumé.

Réflexion

Mode réflexion

Le modèle raisonne en silence avant de répondre : il décompose le problème et se vérifie lui-même. C'est mieux pour les calculs et les analyses, mais plus lent et plus gourmand en tokens.

Selon l'abonnement

Limites d'utilisation

Les abonnements Claude comportent des limites d'utilisation. Les longues conversations, les gros fichiers, les modèles lourds et le mode réflexion entament tous davantage votre quota.

06Un e-mail rapide à un client

Responsable administrativedemande
Rédige un e-mail court et poli pour informer le client que le devis partira jeudi au lieu de mardi, car nous attendons les données géotechniques.
obtient
Un e-mail de cinq lignes prêt à copier, en quelques secondes.
OutilClaude avec Haiku ou Sonnet, réflexion désactivée

07Relire un long rapport de calcul

Ingénieur structuredemande
Ci-joint une note de calcul de chevilles chimiques (PDF, 40 pages). Vérifie que les charges du tableau 3 correspondent au récapitulatif de la page 38, et signale toute incohérence d'unités ou de coefficients de sécurité.
obtient
Une liste de trois incohérences, avec les numéros de page et la raison pour laquelle chacune paraît suspecte. L'ingénieur vérifie chacune d'elles lui-même.
OutilClaude avec Opus, réflexion activée

08Un agent de programmation qui corrige une application

Ingénieur qui développe un outil de calcul internedemande
Il y a un bug : quand je modifie l'épaisseur du béton, le résultat ne se met pas à jour. Trouve la cause, corrige-la et lance les tests.
obtient
L'agent lit plusieurs fichiers, trouve la fonction défectueuse, la corrige et lance les tests. C'est un travail long, il consomme donc beaucoup de tokens.
OutilClaude Code avec Opus (voir /ai/agents/)

09Quel modèle pour quelle tâche

TâcheNiveau de modèleRéflexionPourquoi
E-mail court ou reformulationHaiku ou SonnetDésactivéeTâche simple, la rapidité compte
Résumer un compte rendu de réunionSonnetDésactivéeTexte moyen, pas de calcul
Traduire un cahier des charges techniqueSonnetDésactivée ou faibleExige des termes exacts, pas un raisonnement poussé
Extraire des données de dizaines de facturesHaikuDésactivéeBeaucoup de petites tâches répétitives
Relire une note de calcul ou une normeOpusActivéeExige de la logique, des unités cohérentes et une autovérification
Comparer des devis complexesSonnet ou OpusActivéeBeaucoup de paramètres et de conditions
Agent de programmation ou automatisation longueOpusActivéeBeaucoup d'étapes, exige de la planification et des corrections
Trouver des idées de titres d'articlesSonnetDésactivéeDe la créativité, pas du calcul

10Comment économiser votre quota

  1. 1

    Adaptez le modèle à la tâche

    N'utilisez pas Opus pour un e-mail de deux lignes. Sonnet ou Haiku le feront plus vite et à moindre coût.

  2. 2

    Un sujet, une conversation

    Une longue conversation est relue à chaque message. Nouveau sujet = nouvelle conversation, avec un court résumé.

  3. 3

    N'envoyez que le nécessaire

    Au lieu d'un PDF de 200 pages, joignez le chapitre utile ou collez le tableau dont vous avez besoin.

  4. 4

    Utilisez les Projects

    Dans les Projects, les documents sont récupérés au besoin au lieu d'être tous chargés dans chaque conversation (voir Un contexte qui reste).

  5. 5

    Désactivez les outils inutiles

    Les connecteurs et outils actifs occupent de la place dans la fenêtre de contexte. Ne gardez activé que ce que vous utilisez.

  6. 6

    La réflexion seulement quand elle aide

    Oui pour les calculs et les analyses, non pour rédiger un e-mail.

11Pourquoi toujours vérifier : les hallucinations

Ce que le modèle peut faire

  • Inventer un numéro d'article de norme qui n'existe pas
  • Donner une valeur de coefficient qui semble juste mais qui est fausse
  • Citer une source qui n'existe pas
  • Paraître totalement sûr de lui, même quand il se trompe

Ce que vous faites

  • Vérifier chaque chiffre dans la norme ou le catalogue d'origine
  • Demander la source et la vérifier vous-même
  • Joindre le document lui-même au lieu de vous fier à la mémoire du modèle
  • Ne valider que ce que vous avez vérifié vous-même

12Questions fréquentes

Pourquoi le modèle « oublie »-t-il ce que j'ai dit au début de la conversation ?

Probablement parce que la fenêtre de contexte s'est remplie et que Claude a résumé les parties les plus anciennes, ou simplement parce que la conversation est si longue que des détails se perdent. Ouvrez une nouvelle conversation avec un résumé des points essentiels.

Faut-il écrire en anglais pour économiser des tokens ?

Pas forcément. L'hébreu consomme généralement plus de tokens, mais si vous êtes à l'aise en hébreu, les réponses sont bonnes. Pour les documents très longs, l'anglais mérite d'être envisagé.

Comment savoir de quels modèles je dispose ?

Dans le sélecteur de modèle de l'interface Claude. La liste dépend de votre abonnement, et les noms changent avec le temps. La liste à jour se trouve sur la page des modèles de la documentation Claude.

Un modèle plus grand est-il toujours meilleur ?

Non. Pour les tâches simples, il est plus lent et consomme davantage de quota sans grand bénéfice. Choisissez le plus petit modèle qui fait bien le travail.

Le mode réflexion empêche-t-il les hallucinations ?

Il réduit les erreurs de calcul et de raisonnement, mais ne les élimine pas. Vous devez toujours vérifier chaque chiffre important.

Dans ce guide

La boîte à outils de Claude : ce qu'il faut ajouter à chaque tâche pour qu'il travaille mieuxUn kit par tâcheQu'est-ce qu'un Artifact ? Guide pour les ingénieurs qui veulent plus qu'une réponse dans le chatPlus que des réponsesQu'est-ce qu'un agent IA ? Guide pratique pour les ingénieursLes agents IA au travailQue sont les Skills ? Le guide de l'ingénieur pour enseigner à Claude les procédures de votre bureauProcédures pour l'IAQu'est-ce qu'un connecteur ? Comment Claude se branche sur vos applications (MCP)Claude rejoint vos outilsQu'est-ce qu'un Plugin ? Le guide de l'ingénieur pour installer tout un flux de travail Claude en une foisPacks de travail pour l'IAQu'est-ce qu'un prompt et comment bien le rédiger ?Parler à l'IAProjects et mémoire dans Claude : faites-lui retenir votre travailUn contexte qui resteImages et vidéo avec Claude : ce qu'il voit, ce qu'il crée et les solutions de contournementL'œil de ClaudeQu'est-ce qu'un design system ? Le guide pour les non-designersDu design sans designerQu'est-ce qu'un snippet ? Le guide de l'ingénieur sur les morceaux de code et de texte réutilisablesBriques réutilisablesQu'est-ce que GitHub ? Le guide pour les ingénieurs qui ne codent pasGitHub sans coderConcevoir une image avec l'IA : créer, retoucher et améliorer des visuels, gratuitement ou nonImages avec l'IAConcevoir un personnage IA : mascotte, avatar, présentateur parlant, 3DTâche : personnage IACalculs d'ingénierie avec l'IA : calculer, vérifier et documenter correctementCalculer avec l'IACréer des logiciels d'ingénierie avec l'IA : de la petite calculette à l'application, sans être programmeurLogiciels sans coderTrouver un produit avec l'IA : rechercher, comparer et vérifier produits, fournisseurs et fiches techniquesRecherche de produitsTrouver une norme avec l'IA : la bonne norme et le bon article, sans hallucinationsNormes sans approximationLe guide complet de ClaudeTout pour bien démarrer, étape par étape

Retour à la page IA