1) Une requête = UN appel que votre programme fait à l'IA
Une requête, c'est un programme qui pose une fois une question à l'IA et reçoit une fois une réponse. ATTENTION : 1 message que vous écrivez ne veut PAS DIRE 1 requête. Le nombre de requêtes que devient un message dépend de l'outil que vous utilisez.
Le programme demande→Le modèle réfléchit→Le modèle répond
= 1 REQUÊTEQue votre message fasse 5 mots ou 500, cet UNIQUE appel compte pour 1 requête. La longueur ne change pas le NOMBRE de requêtes — mais elle change les tokens consommés, et donc ce que vous payez en PAYG.
Alors, combien de requêtes fait 1 message de votre part ?
Si vous écrivez dans une fenêtre de chat : 1 message = 1 requête. Simple. Mais dans les outils de code (Claude Code, Cline, Codex…), c'est TRÈS différent. Ces outils fonctionnent comme des « agents » : vous écrivez une seule phrase, et ils travaillent étape par étape en arrière-plan, en interrogeant à nouveau le modèle à CHAQUE ÉTAPE.
Exemple : vous dites à Claude Code « corrige ce bug ». En coulisses :1Il lit vos fichiers → 1 requête
2Il examine le code pour trouver le bug → 1 requête
3Il écrit la correction → 1 requête
4Il lance les tests, lit le résultat → 1 requête
5Si un test échoue, il corrige à nouveau → 1 requête de plus… et ainsi de suite
Autrement dit, votre UNIQUE phrase peut devenir 20–30 requêtes en arrière-plan. C'est pourquoi un forfait « 1 000 requêtes/jour » s'épuise plus vite que prévu. Ce n'est pas un bug — c'est le mode de fonctionnement des outils agentiques.
Vous pouvez toujours voir combien de requêtes vous avez utilisées sur la page Activité du panneau ; chaque requête est une ligne distincte.
2) Token = des morceaux de mots
L'IA ne lit pas les mots comme nous. Elle découpe le texte en petits morceaux ; chacun de ces morceaux est appelé un TOKEN. Un token est parfois un mot entier, parfois la moitié d'un mot, parfois un signe de ponctuation.
Cette phrase : « Il fait très beau aujourd'hui. »Bugün hava çok güzel.
Cela fait environ 5 tokens. En gros : 1 token ≈ 4 caractères. Dans les langues où les mots sont longs, le nombre de tokens est un peu plus élevé. Le tarif est calculé sur les tokens — pas sur les mots ou les caractères.
3) Il existe deux types de tokens : sortants et entrants
Dans une requête, les tokens circulent dans les deux sens. Les deux sont comptés.
- ENTRÉE (ce que vous envoyez) — votre question + les instructions données à l'IA + la conversation précédente le cas échéant.
- SORTIE (ce que le modèle écrit) — l'intégralité de la réponse que vous recevez. La sortie est généralement plus coûteuse que l'entrée, car c'est la partie qui fait vraiment travailler le modèle.
⚠ Le plus surprenant : dans un chat, l'historique est renvoyé à chaque fois
L'IA n'a AUCUNE mémoire. Elle ne se souvient pas de votre message précédent. C'est pourquoi, quand vous poursuivez un chat, le programme renvoie TOUTE la conversation depuis le début — sinon le modèle ne saurait pas de quoi vous parlez. Autrement dit, plus le chat s'allonge, plus chaque message devient coûteux :
1Message 1 — seule votre question est envoyée~30 token
2Message 2 — question 1 + réponse 1 + question 2 sont envoyées~90 token
3Message 3 — tout ce qui précède + question 3 sont envoyés~200 token
Que faire : ouvrez un NOUVEAU CHAT quand le sujet change. Accumuler 50 messages dans un même chat rend chaque nouveau message très coûteux.
4) Dans les outils de code, même « bonjour » ne part jamais seul
Des outils comme Claude Code et Cline envoient beaucoup de choses en arrière-plan sans que vous vous en rendiez compte : le contenu des fichiers que vous avez ouverts, la structure du projet, les instructions données à l'outil… C'est pourquoi, même si vous tapez « bonjour » à l'écran, des milliers de tokens peuvent partir en coulisses.
Ce n'est pas un bug, c'est le mode de fonctionnement de l'outil — et cela explique pourquoi même une petite question a un coût.
5) Comment est-ce compté ? DIFFÉREMMENT en forfait et en solde
📦 Si vous avez acheté un forfaitVous disposez d'un crédit quotidien. Chaque REQUÊTE (chaque appel API) consomme 1 crédit — pas chaque message que vous écrivez. Court ou long, peu importe. Avec un forfait de 500 requêtes/jour, un outil agentique peut l'épuiser en quelques tâches.
1 appel API = 1 crédit 💳 Si vous payez depuis le solde (PAYG)Pas de crédit. À chaque requête, le prix des tokens consommés est déduit de votre solde. Question courte = peu d'argent. Long chat = beaucoup d'argent.
payez selon les tokens
Exemple réel : sur le modèle claude-haiku-4-5, 1M de tokens coûtent 0.3 $. Ainsi, une requête de 1 000 tokens revient à environ 0.0142 ₺. (Prix issus du catalogue en direct.)6) Pourquoi est-ce que je vois TROIS lignes dans le registre ?
En consultant Activité dans le panneau, vous voyez trois lignes pour une seule requête. Pas de panique — l'argent n'est débité qu'une fois. Voici comment ça marche : au démarrage de la requête, nous ne pouvons pas savoir combien elle coûtera, alors nous « mettons de côté » un certain montant. Une fois terminé, nous rendons TOUT ce que nous avions mis de côté et ne déduisons que ce qui a réellement été dépensé.
Réservation — mise de côté (maximum estimé)−$0,05
Remboursement — tout le montant mis de côté est rendu+$0,05
Utilisation — ce qui a réellement été dépensé est déduit−$0,01
Résultat : seul ce qui a réellement été dépensé sort de votre poche. Les trois portent le même numéro de requête, donc rien ne se mélange.
7) Comment dépenser moins ?
- Ouvrez un nouveau chat quand le sujet change — pour que l'ancienne conversation ne soit pas renvoyée à chaque fois.
- Formulez votre question clairement. Au lieu de longues explications, dites exactement ce que vous voulez.
- Pour les tâches simples, choisissez un modèle bon marché (comme GLM, Kimi). Inutile de sortir le modèle le plus cher pour chaque tâche.
- Si vous l'utilisez régulièrement, achetez un forfait — étant basé sur des crédits, il revient bien moins cher sur les longues requêtes.