- Un agent multi-étapes consomme dix à cinquante fois plus de tokens qu'un simple appel de chat, parce qu'il relit tout son contexte à chaque étape.
- Trois postes font dérapper la facture : les boucles d'outils, le contexte qui gonfle et les relances silencieuses.
- Notre grille : coût par tâche = tokens moyens par tâche × prix du modèle × nombre de tâches, plus 20 % de marge pour les échecs.
- La mise en cache, le choix d'un modèle plus petit pour les étapes simples et un plafond par tâche divisent la note par trois sans dégrader la qualité.
Pourquoi la démo ne dit rien du coût
Une démonstration d'agent traite une tâche, sous les yeux de tout le monde, avec un prompt soigné. En production, le même agent traite deux mille tâches par jour, dont une partie sont mal formulées, incomplètes ou contradictoires. Il relance des outils, redemande des précisions, recommence. Chaque reprise coûte des tokens, et les tokens se paient.
Nous avons vu un client passer d'un budget prévisionnel de 300 euros par mois à une facture réelle de 4 200 euros le deuxième mois. Rien n'était cassé : l'agent faisait exactement ce qu'on lui avait demandé, sur un volume que personne n'avait mesuré.
Ce qu'un appel de chat coûte, et ce qu'un agent coûte
Un échange avec un assistant classique, c'est une question, un contexte et une réponse : quelques milliers de tokens. Un agent, lui, enchaîne des étapes. À chacune, il reçoit à nouveau ses instructions, l'historique de ce qu'il a déjà fait et le résultat des outils appelés. Le contexte grossit, et le prix avec lui.
Les trois postes qui dérapent
Les boucles d'outils
Un agent qui interroge une base, ne trouve pas ce qu'il cherche et réessaie avec une autre formulation peut boucler cinq ou six fois. Chaque tour rejoue le contexte complet. Sans plafond, une seule tâche difficile coûte autant que cinquante tâches faciles.
Le contexte qui gonfle
Les résultats d'outils sont souvent verbeux : un extrait de base de données de deux cents lignes, une page web entière, un document PDF complet. Tout cela reste dans la fenêtre de contexte jusqu'à la fin de la tâche. Résumer ou tronquer les résultats intermédiaires est la mesure la plus rentable que nous connaissions.
Les relances silencieuses
Les bibliothèques d'orchestration relancent automatiquement un appel qui échoue ou qui dépasse un délai. C'est utile, mais chaque relance est facturée. Nous avons trouvé chez un client un taux de relance de 18 % que personne ne surveillait, soit près d'un cinquième de la facture pour des appels sans résultat.
Fixez un plafond de tokens par tâche et un nombre maximal d'étapes. Quand la limite est atteinte, l'agent s'arrête, journalise l'échec et passe la main à un humain. Un agent qui sait abandonner coûte moins cher qu'un agent obstiné.
La méthode pour estimer avant de construire
Nous refusons désormais de chiffrer un projet d'agent sans avoir mesuré trois choses sur un échantillon réel de cinquante tâches : le nombre moyen d'étapes, la taille moyenne du contexte à chaque étape et le taux d'échec. Une journée de prototype suffit pour les obtenir.
| Donnée | Comment la mesurer | Ordre de grandeur observé |
|---|---|---|
| Étapes par tâche | Journal du prototype sur 50 tâches réelles | 4 à 12 |
| Tokens par étape | Moyenne entrée + sortie, relevée par l'outil de traçage | 8 000 à 20 000 |
| Taux d'échec ou de reprise | Tâches abandonnées ou relancées sur 50 | 10 à 25 % |
| Volume mensuel | Avec le métier, sur les données réelles du mois dernier | Souvent sous-estimé d'un facteur 2 |
Le calcul devient simple : tokens moyens par tâche multipliés par le prix du modèle, multipliés par le volume mensuel, plus 20 % pour les échecs et les relances. Si le résultat vous fait sursauter, c'est le bon moment pour changer d'architecture, pas après trois mois de facturation.
Diviser la facture par trois sans dégrader la qualité
Quatre leviers reviennent dans tous nos déploiements. Le premier est la mise en cache du prompt système et des documents de référence, que la plupart des fournisseurs facturent beaucoup moins cher lorsqu'ils sont répétés. Le deuxième est le routage : un petit modèle pour classer, extraire ou reformuler, le grand modèle uniquement pour raisonner. Le troisième est le résumé des résultats intermédiaires. Le quatrième, le plus négligé, est la mesure : un tableau de bord du coût par tâche, consulté chaque semaine par quelqu'un qui a le pouvoir d'arrêter l'agent.
« Un agent dont personne ne regarde la facture n'est pas en production. Il est en roue libre. »
Conclusion
Le coût d'inférence n'est pas une fatalité, c'est une variable de conception. Les projets qui durent sont ceux où le budget a été mesuré sur des tâches réelles avant le lancement, où l'agent a un plafond, et où quelqu'un lit la facture. Le reste, c'est de l'optimisme.
FAQ
Quel budget mensuel prévoir pour un premier agent ?
Pour un agent borné traitant 500 à 2 000 tâches par mois, comptez entre 150 et 800 euros d'inférence, selon la longueur des contextes et le modèle choisi. En dessous de 500 tâches, un simple flux d'automatisation revient souvent moins cher qu'un agent.
Faut-il un modèle open source pour réduire les coûts ?
Pas forcément. Un modèle ouvert hébergé par vos soins coûte en infrastructure et en temps d'équipe. Pour des volumes inférieurs à quelques millions de tokens par jour, un modèle propriétaire avec cache et routage reste généralement plus économique.
Comment suivre les coûts au quotidien ?
Les outils de traçage comme LangSmith, Langfuse ou Arize donnent le nombre de tokens par appel. Ajoutez le prix du modèle et regroupez par tâche : vous obtenez le coût unitaire, la seule mesure qui compte.
Que faire si le budget explose en cours de route ?
Couper d'abord les relances automatiques, plafonner les étapes, puis résumer les résultats d'outils. Ces trois mesures se mettent en place en une journée et ramènent la plupart des factures dans l'épure.