Parnpro.fr
Formation certifiee Qualiopi
BD
BusinessDigital.frOrganisme certifie Qualiopi · Formation IA et digital

Comment réduire de 90% sa consommation de tokens Claude Code

Quand on passe ses journées dans Claude Code, la facture tokens grimpe vite. Chaque lecture de fichier, chaque diff, chaque sortie de commande shell mange du contexte. La bonne nouvelle : deux outils open source permettent de diviser cette consommation par dix, sans rien changer à sa façon de travailler.

Voici comment les mettre en place, ce qu'ils font concrètement, et pourquoi ils changent l'équation économique du développement assisté par IA.

Le contexte : des quotas qui se resserrent

Depuis le 13 septembre 2026, Anthropic a mis fin au bonus de 50% sur les limites hebdomadaires de Claude Code. Les développeurs qui comptaient sur cette marge se retrouvent contraints d'optimiser chaque token. Le sujet n'est plus théorique : c'est un poste de coût que chaque équipe technique doit piloter.

Claude Code lit des fichiers, analyse des diffs, interprète des logs. Chacune de ces opérations consomme des tokens d'entrée facturés au prix du modèle actif. Avec Claude Opus 5, le token d'entrée coûte 5 dollars par million (contre 15 dollars sur Opus 4). Un fichier de 2000 lignes lu trois fois dans une session, c'est déjà plusieurs dizaines de milliers de tokens partis en lecture pure, avant même que le modèle ait produit une seule ligne de code.

Le calcul devient encore plus douloureux quand on travaille sur des projets volumineux. Un monorepo avec des centaines de fichiers, des tests verbeux, des logs de build qui défilent : le contexte se remplit, la fenêtre se sature, et le portefeuille se vide.

Deux développeurs ont attaqué ce problème sous des angles complémentaires. L'un côté lecture de fichiers, l'autre côté sorties shell.

Bulk Reader : déléguer la lecture à un modèle 17 fois moins cher

Dimitri Mazmanov, Principal Product Manager chez Spotify, a publié un plugin pour Claude Code qui repose sur une idée simple : pourquoi faire lire un fichier de configuration de 800 lignes par Claude Opus quand un modèle plus léger peut en extraire l'essentiel ?

Son constat de départ est limpide : les agents de code ne passent pas la majorité de leur temps à raisonner, mais à réaliser des actions. En l'occurrence des éditions et lectures de fichiers. Utiliser un modèle frontier pour lire un fichier est mathématiquement disproportionné. De même, les agents consacrent une grande partie de leur budget tokens à générer du code boilerplate : création de classes, configuration d'un soft, écriture de tests.

Son plugin s'appuie sur le système de hooks de Claude Code. Un hook, c'est un script qui s'exécute avant ou après certaines actions de l'agent. Le hook "bulk-reader" intercepte les appels de lecture de fichiers volumineux et les redirige vers Gemini 2.5 Flash, le modèle de Google qui traite le million de tokens d'entrée à 0,30 dollar, contre 5 dollars chez Claude Opus 5 : près de dix-sept fois moins cher pour lire les mêmes octets.

Architecture technique du plugin

Le plugin est composé de deux hooks et de deux skills qui fonctionnent ensemble.

Le premier hook, check-file-size, contrôle la taille de chaque fichier que Claude Code souhaite lire. Si le fichier dépasse un seuil configurable (350 lignes par défaut), il bloque la lecture et demande à Claude d'utiliser la skill reader. Les lectures ciblées passent normalement, car lire seulement une partie d'un fichier consomme peu de tokens.

Le second hook, check-bash-read, applique la même logique aux commandes de lecture en mode bash (cat, head, tail). Cela empêche Claude de contourner la skill en passant par le terminal.

L'agent reader est configuré avec une température déterministe (0,2) et un prompt strict :

You are a precise code analyst. Read the provided files and answer the question concisely. Output structured bullets only. No greetings, no prose, no preambles. Lead every bullet with the exact name, type, or line number. Use nested bullets for details. Skip anything the caller did not ask for.

Le second agent : code-writer

Mazmanov a ajouté un second agent baptisé "code-writer". Celui-ci cible un autre poste de dépense : l'écriture de code répétitif. Les fichiers de configuration, les boilerplates, les squelettes de composants React, les migrations SQL basiques. Tout ce code prévisible qui ne nécessite pas la puissance de raisonnement d'un modèle frontier.

L'agent writer est configuré avec ce prompt :

You generate code files based on a spec and reference files. Match the existing patterns, conventions, naming, and style exactly. Output only the code, no explanations, no markdown fences unless asked. If the spec is ambiguous, make reasonable choices that match the reference code's patterns.

Le code-writer délègue ces tâches d'écriture mécanique au même modèle économique, et réserve Claude pour ce qui justifie son prix : l'architecture, le débogage complexe, la compréhension de la logique métier.

Pourquoi des hooks et pas des instructions dans CLAUDE.md ?

Mazmanov avait d'abord configuré les règles de délégation dans un fichier CLAUDE.md, en langage naturel. Le problème : Claude ne respectait pas toujours les instructions d'appel des deux agents. Pour rendre l'appel déterministe, il a construit un plugin Claude Code qui verrouille la lecture via des hooks (un mécanisme que Claude ne peut pas contourner), complétés par des scripts de transport vers les agents et des skills qui indiquent la marche à suivre.

Benchmarks et limites

Sur un repo Java avec quatre scénarios différents, Mazmanov est parvenu à mesurer une réduction moyenne de 90% de la consommation de tokens en lecture avec Claude Code.

Trois limites mineures se posent toutefois. Le reader ne peut pas retrouver de numéro de ligne précis quand il remonte son analyse, ce qui oblige Claude à relire manuellement les fichiers qu'il souhaite éditer. Le modèle qui reçoit la délégation reste moins performant que Claude (logiquement), ce qui exclut les tâches de débogage complexe et de décision d'architecture. La latence réseau ajoute un délai lié à l'appel API vers Gemini, variable selon la taille des fichiers.

RTK : compresser les sorties shell avant qu'elles n'atteignent le contexte

L'approche de RTK (Rust Token Killer) est différente. Ce projet open source, développé par un développeur français et écrit en Rust, se place comme un proxy entre le terminal et l'agent IA. Il ne change pas de modèle : il compresse les données avant qu'elles n'arrivent dans la fenêtre de contexte.

Le problème qu'il cible est précis : la "noise" des sorties shell. Un git log, un cargo test, un npm build... l'agent IA avale toutes ces sorties alors qu'il n'a besoin que d'une fraction pour comprendre ce qui se passe.

RTK intercepte cette sortie et applique quatre stratégies de compression successives.

La première est le filtrage de boilerplate. Les en-têtes répétitifs, les lignes de séparation, les messages de statut standards sont retirés. La deuxième stratégie regroupe les lignes similaires. Quand un test produit cinquante lignes quasi identiques (« test_user_1 passed, test_user_2 passed, test_user_3 passed... »), RTK les fusionne en une seule entrée avec un compteur.

La troisième stratégie est la troncature intelligente. Les sorties très longues sont coupées en conservant le début (qui donne le contexte), la fin (qui donne le résultat), et un échantillon du milieu. La quatrième est la déduplication pure : les blocs de texte identiques qui apparaissent plusieurs fois dans une même sortie sont réduits à une seule occurrence.

Chiffres concrets

Les résultats mesurés sur des commandes courantes :

CommandeTokens avant RTKTokens après RTKRéduction
git diff12 00096092%
npm test6 00060090%
cargo test~8 000~800~90%

L'utilisation est transparente : on préfixe la commande avec rtk. Un git status devient rtk git status sans rien changer d'autre à ses habitudes.

Compatibilité large

RTK n'est pas spécifique à Claude Code. Il fonctionne avec une dizaine d'outils : Copilot, Cursor, Gemini CLI, Windsurf, Cline, Codex, et GitHub Copilot. Tout agent IA qui exécute des commandes shell et en consomme la sortie profite de la compression. L'intégration se fait via un hook pour chacun de ces outils.

L'outil est distribué comme un binaire Rust compilé, donc rapide à l'exécution. La latence ajoutée par la compression est négligeable comparée au temps d'inférence du modèle. C'est un outil qu'on installe et qu'on oublie.

Combiner les deux pour un effet maximal

Ces deux outils sont complémentaires. Bulk Reader réduit le coût de la lecture de fichiers en déléguant à un modèle moins cher. RTK réduit le volume de données injectées dans le contexte depuis le terminal. Ensemble, ils couvrent les deux sources principales de consommation de tokens dans une session de développement.

Un développeur qui travaille huit heures par jour sur Claude Code peut facilement consommer 50 à 100 millions de tokens par mois. À 5 dollars le million sur Opus 5, cela représente 250 à 500 dollars mensuels rien qu'en tokens d'entrée. Diviser cette facture par cinq ou dix, c'est rendre le développement assisté par IA accessible à des équipes qui hésitaient sur le budget.

Autres techniques d'optimisation des tokens Claude Code

Au-delà de ces deux outils, plusieurs pratiques réduisent la consommation au quotidien.

Structurer son fichier CLAUDE.md correctement. Un CLAUDE.md trop long est relu à chaque tour de contexte. Garder les instructions essentielles, déporter le reste dans des fichiers de documentation que Claude lira à la demande.

Utiliser les sous-agents de façon ciblée. Chaque sous-agent a sa propre fenêtre de contexte. Déléguer une recherche exploratoire à un sous-agent évite de polluer le contexte principal avec des centaines de lignes de résultats de grep.

Préférer les lectures partielles. Au lieu de lire un fichier entier de 500 lignes, demander à Claude de lire les lignes 100 à 150. Les outils Read et grep consomment proportionnellement à ce qu'ils retournent.

Compresser les conversations longues. Claude Code compresse automatiquement le contexte quand la fenêtre approche de sa limite. Mais structurer son travail en sessions courtes et ciblées reste plus efficace que de tout faire dans une seule conversation marathon.

Choisir le bon modèle selon la tâche. Claude Haiku 4.5 consomme bien moins de tokens pour des tâches simples (reformulation, extraction de données, génération de boilerplate). Basculer avec /model quand la tâche ne justifie pas un modèle frontier.

Ce que cela dit de l'écosystème Claude Code

L'existence de ces plugins montre la maturité de l'écosystème. Le système de hooks de Claude Code, introduit avec les skills, permet à n'importe quel développeur de modifier le comportement de l'agent sans toucher au code source. C'est un modèle extensible qui rappelle celui des extensions VS Code ou des plugins Webpack.

On voit émerger une économie de l'optimisation des agents IA. Pas seulement sur les prompts (le prompt engineering reste nécessaire), mais sur l'infrastructure autour : quels tokens envoyer, à quel modèle, à quel moment. C'est un problème d'ingénierie classique d'allocation de ressources, appliqué à un nouveau type de ressource.

Pour les entreprises qui déploient l'IA à l'échelle, c'est une compétence à acquérir. Savoir configurer un hook Claude Code ou mettre en place un proxy de compression des sorties shell, c'est du même ordre que savoir configurer un CDN ou un cache applicatif : un levier technique qui a un impact financier direct.

Pour ceux qui se forment à ces outils, notre académie en ligne propose des modules pratiques sur l'intégration des agents IA dans les workflows de développement. Le catalogue de formations couvre les fondamentaux de l'IA appliquée au métier, y compris l'optimisation des coûts d'inférence.

En pratique : par où commencer

Si vous utilisez Claude Code au quotidien, commencez par RTK. L'installation est rapide (un binaire à télécharger), la configuration minimale, et le gain immédiat. Vous verrez la différence dès la première session.

Ensuite, ajoutez le plugin Bulk Reader pour les projets où la lecture de fichiers représente un poste important. Les monorepos, les bases de code legacy, les projets avec beaucoup de documentation embarquée sont les meilleurs candidats.

Les deux outils sont open source. Le code est lisible, les contributions bienvenues. Si vous développez vos propres hooks Claude Code, la structure du plugin de Mazmanov est un bon point de départ pour comprendre l'API.

Pour approfondir le sujet de l'optimisation des coûts IA en entreprise, consultez notre page Formation IA pour entreprises qui détaille les stratégies concrètes de déploiement.

Sources


Par Franck PARIENTI, BusinessDigital.fr

Financez cette formation a 100% via votre OPCO

Demander un devis gratuit
Mis a jour le 21 septembre 2026 · parnpro.fr