Intermédiaire·2 min·23 juillet 2026

Claude-thermos : économise 20% de ta facture API

🎧 Résumé audio0:00 / 0:00
Un outil gratuit qui garde ton cache Claude chaud et t'épargne des milliers de tokens inutiles.
Claude-thermos : économise 20% de ta facture API

Pourquoi ça compte pour toi

Si tu utilises Claude avec des sous-agents (workflows multi-étapes, délégués à d'autres instances), ton cache expire silencieusement toutes les 5 minutes d'inactivité. Résultat : tu repays la totalité de ta conversation à chaque reprise. Claude-thermos l'empêche automatiquement, ce qui réduit ta facture d'environ 20% sur les sessions longues. Pour un créateur ou entrepreneur qui itère intensément sur des tâches complexes, c'est du vrai cash récupéré.

Ce qu'il faut retenir

  • 1.Rafraîchit le cache Claude en arrière-plan pour éviter les expirations du TTL de 5 min
  • 2.Coût quasi nul (lectures 0.1x) pour éviter des réécritures massives (1.25x)
  • 3.Journaux détaillés : vois exactement combien tu as économisé par session

Tu galères avec le jargon ?

Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.

Le problème silencieux du cache Claude

Tu utilises Claude Code avec des agents secondaires ? Chaque fois qu'un sous-agent tourne plus de 5 minutes, le cache du système principal s'efface. Quand le sous-agent termine et que l'agent principal reprend, Claude doit ré-encoder toute ta conversation — pas au prix lecture (0.1x), mais au prix écriture (1.25x). Sur 185 sessions analysées, ce gaspillage représentait 22% de la facture totale.

Comment ça marche

Claude-thermos s'intercale entre toi et l'API Anthropic (une simple redirection locale). Il détecte quand :

  1. L'agent principal est inactif
  2. Un sous-agent tourne encore

Et il « réveille » le cache en rejouant la dernière requête avec max_tokens: 1 — sans toucher au trafic réel. C'est une lecture gratuite qui maintient le cache vivant.

Quand le sous-agent termine, le cache est toujours là. L'agent principal reprend sans surcoût.

Mise en place en 30 secondes

uvx claude-thermos # au lieu de : uvx claude
uvx claude-thermos -p "fix the bug" # tous les args passent directement

Prérequis : Python 3.11+ et la CLI Claude dans ton PATH.

Configuration (optionnelle)

  • --idle 270 : délai avant de réveiller (secondes)
  • --interval 270 : fréquence entre réveils
  • --max-cycles 4 : nombre max de réveils par épisode inactif

Désactive temporairement avec CLAUDE_WARMER_DISABLE=1.

Vois les économies

Chaque session génère un summary.json dans ~/.claude-thermos/logs/ :

  • warms_fired : appels de réchauffage envoyés
  • rewrite_avoided_tokens : tokens sauvés
  • net_savings : bénéfice net en unités de tokens

Pour convertir en euros (exemple Claude 3.5 Sonnet à $3/M tokens) :

net_savings × 3 / 1_000_000 = euros sauvés

Le calcul : chaque réchauffage coûte une lecture (0.1x). Chaque réécriture évitée aurait coûté une écriture (1.25x) sur un contexte conséquent. L'équilibre est largement en ta faveur.

Et concrètement pour toi ?

Choisis ton profil — la lecture de l'article change selon qui tu es.

🔭 Curieux

Pour toi, Claude-thermos montre comment on optimise déjà les coûts des outils IA : c'est un bon exemple concret de ce que veut dire « économie de ressources » dans un monde où les modèles coûtent cher à tourner.

Newsletters Noésis

3 minutes d'IA dans ta boîte mail, chaque matin.

Rejoins les francophones qui comprennent, essaient et progressent avec l'IA. Choisis ce que tu veux recevoir. Désabonnement en 1 clic.

Explorer les thèmes de cet article :