Ce que coûte vraiment un parc de 46 agents IA
À RETENIR
- L'inférence est la ligne la plus petite et la plus prévisible de la facture d'un parc d'agents. Dans le modèle ci-dessous, elle pèse environ 5 % du coût mensuel d'un agent.
- Les lignes chères sont la revue humaine et la maintenance d'ingénierie, et les deux suivent l'autonomie accordée, pas le nombre de tokens consommés.
- La charge par agent n'est pas plate. Elle s'infléchit vers le haut au moment où les agents commencent à partager des dépendances, car un changement en amont cesse d'être local.
- Les 46 agents étaient les opérations internes d'Integra. C'est un système différent de la plateforme à 11 agents livrée pour un fonds de private equity, et les deux ne s'additionnent jamais.
- L'agent le moins cher d'un parc est celui que vous avez supprimé. La mise à la retraite est une décision de conception, pas un aveu d'échec.
MODÉLISÉ, PAS MESURÉ
La taille du parc est réelle, et la forme du problème aussi. Chaque montant de cet article est un modèle bâti sur des hypothèses que j'énonce intégralement, valorisé aux tarifs publics affichés. C'est une illustration du rapport entre les lignes, pas une facture d'un employeur ou d'un client.
La facture que personne ne montre
J'ai déployé environ 46 agents IA pour les opérations internes d'Integra, où j'ai été CTO jusqu'en juin 2026. On me demande ce que ça coûtait. On pense à la facture de tokens, et c'est la réponse la moins intéressante que j'aie.
L'inférence était ma ligne la moins chère et la plus prévisible. Elle arrive tous les mois, elle est mesurée à six décimales, et on la réduit en une après-midi en routant vers un modèle plus petit. Rien d'autre dans la vie d'un parc ne se comporte ainsi.
Le coûteux, c'était tout ce qui devait rester vrai après la mise en production. Personne ne publie cette courbe : la voici, avec les hypothèses de chaque chiffre assez visibles pour que vous puissiez les contester.
Ce qu'étaient vraiment les 46
D'abord la mise au point, parce que ces deux chiffres sont fusionnés en permanence et je refuse que ça passe en silence.
Les 46 agents étaient les opérations internes d'Integra : ma propre entreprise, mes propres systèmes, au passé. Ce ne sont pas les 11 agents en production de la plateforme GenAI livrée pour un fonds de private equity immobilier américain confidentiel gérant environ 3 Md$ d'actifs. Client différent, base de code différente, année différente. 46 et 11 ne font pas 57, et toute page qui les additionne se trompe.
Ce que je ne publie pas, c'est la répartition de ces 46 par fonction : c'était interne. Ce que je publie, c'est la classification que j'utilisais, car le palier d'un agent détermine son coût bien plus que ce qu'il fait.
La construction des 11 agents est documentée séparément dans son étude de cas dédiée, et tout ce qui suit concerne l'autre parc.
Les cinq lignes de la facture mensuelle d'un agent
Un agent a cinq coûts récurrents. Quatre n'apparaissent sur aucun tableau de bord fournisseur.
Ce n'est pas une observation neuve, juste une observation démodée. L'article qui a nommé le problème pour les systèmes de machine learning le disait déjà il y a dix ans.
Sculley et ses collègues chez Google le formulaient ainsi dans Hidden Technical Debt in Machine Learning Systems (NeurIPS 2015) : il est courant de supporter des coûts de maintenance continus massifs dans les systèmes de machine learning réels. Les agents n'ont pas abrogé ce constat. Ils l'ont multiplié par le nombre d'agents.
Une facture modélisée, et toutes ses hypothèses
Voici un agent, modélisé de bout en bout. Chaque entrée est une hypothèse, et je les montre toutes pour que vous puissiez y substituer les vôtres.
L'agent est un agent d'opérations internes de palier 1 : il rédige, une personne envoie. Il tourne 2 000 fois par mois. Chaque exécution lit environ 8 000 tokens d'entrée et écrit environ 1 000 tokens de sortie. Environ 5 % des exécutions escaladent vers une personne, et chaque escalade prend 3 minutes à lire et à traiter. Le coût chargé est de 60 $ de l'heure pour le relecteur et de 80 $ de l'heure pour l'ingénieur, qui consacre 2 heures par mois à cet agent. Plateforme et stockage d'audit correspondent à la quote-part d'infrastructure partagée de l'agent.
Les tokens sont valorisés aux tarifs publics affichés pour un petit modèle de production au moment de l'écriture, 1 $ par million de tokens d'entrée et 5 $ par million en sortie, selon la page de tarifs d'Anthropic. Substituez votre propre fournisseur et le rapport bouge à peine, car la ligne tokens reste petite dans tous les cas.
Regardez les deux lignes mises en avant. Une personne qui lit des escalades, c'est 58 % de cet agent. Les tokens, 5 %. Si vous dépensez votre budget d'optimisation sur le modèle, vous négociez âprement un vingtième du problème.
Le levier qui déplace vraiment cette facture est le taux d'escalade, et ce taux est une décision de conception, pas un choix de fournisseur. Réglez le seuil d'abstention trop prudemment et vous venez d'embaucher quelqu'un sans le dire.
Où ce seuil est fixé, et contre quoi il est évalué avant une mise en production, c'est le travail de la suite d'évals.
Pourquoi l'agent 40 coûte plus cher que l'agent 4
La charge par agent n'est ni plate ni linéaire. Elle reste presque plate un moment, puis elle s'infléchit, et l'inflexion ne vient pas du volume. Elle vient du moment où les agents commencent à partager des choses.
Voici les points où elle s'est infléchie pour moi. Ce n'est pas une loi mesurée, c'est la forme que j'ai vue se répéter, et vos inflexions tomberont à d'autres compteurs selon ce que vous aurez mutualisé tôt.
Agents 1 à 3 : la maintenance est invisible
Une seule personne les a construits et se souvient encore de chaque décision. Rien n'est écrit parce que rien n'a besoin de l'être. La charge est réelle et non mesurée, et c'est pourquoi tout parc commence par la sous-estimer.
Vers l'agent 6 : il faut un registre
Quelqu'un demande ce que fait un agent, qui en est propriétaire et ce qui se passe s'il s'arrête. Personne ne répond de mémoire. Le premier artefact au niveau du parc apparaît, et ce n'est pas du code : c'est une liste.
Vers l'agent 15 : les dépendances partagées mordent
Un index de recherche, un gabarit de prompt, un identifiant de modèle, un chemin d'authentification, désormais partagés. Un changement en amont cesse d'être local. C'est l'inflexion : l'agent marginal devient peu cher à construire et cher à porter.
Vers l'agent 30 : le parc devient le travail
Les migrations, la suite d'évals partagée et le registre ne tiennent plus dans les interstices entre deux fonctionnalités. Quelqu'un est désormais propriétaire du parc plutôt que d'un agent, que ce rôle porte un nom ou non.
Vers 46 : on compte les propriétaires, pas les agents
La bonne question n'est plus combien d'agents tournent, mais combien d'humains on peut réveiller pour eux. C'est là que j'en étais à la fin du mandat, et c'est le chiffre que je demanderais en premier à une équipe.
La ligne migration n'a rien d'hypothétique. Les fournisseurs de modèles retirent leurs modèles selon un calendrier et préviennent : Anthropic s'engage sur au moins 60 jours avant le retrait d'un modèle public, et son propre historique montre plusieurs retraits dans une même année. À 4 agents, un retrait est une après-midi. À 40 qui partagent un identifiant de modèle, c'est un trimestre de quelqu'un.
Le cycle de vie que personne ne budgète
L'autre absent de la plupart des estimations, c'est que les agents ont un cycle de vie, et que l'essentiel se déroule après la mise en production que tout le monde avait planifiée.
Voici la boucle telle que je l'ai réellement exécutée. Notez l'endroit où elle ne s'arrête pas.
- 1
PropriétaireIngénieur
Nomme une tâche à automatiser et accepte d'assumer le résultat.
Pas de propriétaire, pas d'agent. C'est le refus le moins cher possible.
- 2
IngénieurAgent
Le construit, lui assigne un palier d'autonomie, et écrit les évals qui le bloquent.
Le palier se fixe ici et coûte cher à relever ensuite.
- 3
AgentRelecteur
Tourne, et escalade tout ce qu'il ne peut pas étayer par une preuve.
C'est la ligne de coût récurrente, chaque mois, indéfiniment.
- 4
RelecteurOps du parc
Signale les escalades qui se répètent, car un motif est un bug, pas une charge de travail.
Sauter cette étape, c'est rendre les heures de revue permanentes.
- 5
Ops du parcIngénieur
Déclenche une migration quand un modèle, un index ou un connecteur partagé change en dessous.
Le coût suit ici le nombre d'agents qui partagent cette dépendance.
- 6
PropriétaireOps du parc
Met l'agent à la retraite quand personne n'a lu sa sortie depuis un mois.
L'étape que presque tous les parcs sautent, et la seule qui réduit le coût durablement.
La frontière de permissions qui décide de la part d'étape 3 qu'un humain doit toucher, c'est le moindre privilège pour les agents qui paient.
Ce que je couperais en premier
Si on me tendait demain la facture d'un parc en me demandant de la diviser par deux, je n'ouvrirais pas d'abord la configuration de routage des modèles. J'ouvrirais le registre.
Voici l'ordre dans lequel je travaillerais vraiment.
Un agent coûte plus qu'il ne devrait. Que faites-vous ?
Si personne n'a lu sa sortie depuis 30 jours
Supprimez-le
L'agent le moins cher est celui qui n'existe plus. La mise à la retraite est une décision de conception, et un parc qui n'en a pas ne fait que grossir.
Si la ligne revue domine
Corrigez le taux d'escalade, ou rétrogradez d'un palier
Soit le seuil d'abstention est trop prudent, soit l'agent occupe un palier qu'il n'a pas mérité. Deux changements de conception, pas de modèle.
Si la ligne ingénierie domine
Corrigez la dépendance partagée, pas l'agent
Une maintenance récurrente sur un agent est le plus souvent un problème de plateforme déguisé en agent. Le corriger une fois paie sur tout ce qui le partage.
Si la ligne tokens domine vraiment
Routez plus bas, mettez en cache, groupez
Rare, et le cas le plus simple. C'est aussi la seule branche où un tableau de bord fournisseur vous dit quoi faire.
La version inconfortable de cet article, c'est qu'un parc d'agents est surtout une décision de staffing déguisée en infrastructure. Vous n'achetez pas des tokens. Vous achetez l'obligation de maintenir 46 choses vraies.
C'est très bien, à condition de l'avoir chiffré. Ce qui tue les parcs, c'est de le découvrir en deuxième année, par une personne devenue relectrice à plein temps sans que personne l'ait décidé.
Pour le paysage plus large de cette discipline et de ceux qu'on recrute pour la faire, je tiens un état des lieux de l'ingénierie des agents.
Et si c'est le métier lui-même que vous cherchez à comprendre, ce que fait vraiment un ingénieur IA forward-deployed est le cadre plus large dans lequel s'inscrit ce travail de parc.
FAQ
L'inférence est la partie que tout le monde cite et celle qui compte le moins. Dans le modèle de cet article, un agent d'opérations internes coûte environ 26 $ par mois en tokens et environ 521 $ par mois tout compris, car la revue humaine et la maintenance d'ingénierie dominent. Ces montants sont modélisés à partir d'hypothèses explicites, pas relevés sur une facture. Ce qu'il faut retenir, c'est le ratio : les tokens pèsent environ 5 % de la ligne, et une personne qui relit les escalades environ 58 %.
Parce que les agents cessent d'être indépendants. Les premiers ne partagent rien : la maintenance se résume à ce dont leur unique propriétaire se souvient. Au-delà d'une douzaine, ils partagent un index de recherche, un gabarit de prompt, un identifiant de modèle, un chemin d'authentification. Dès lors, un changement en amont n'est plus un changement local, et une seule mise à la retraite de modèle impose de revalider tous les agents qui en dépendaient plutôt que d'en corriger un.
Non, et c'est important. Les 46 étaient les opérations internes d'Integra, où j'ai été CTO jusqu'en juin 2026. Les 11 formaient une plateforme GenAI distincte livrée pour un fonds de private equity immobilier américain confidentiel gérant environ 3 Md$ d'actifs. Clients différents, systèmes différents, années différentes. On ne les additionne jamais.
Supprimer des agents. Le deuxième moyen est d'en rétrograder un d'un cran, pour qu'il rédige au lieu d'agir et qu'un humain envoie. Les deux battent l'optimisation de modèle, car ce sont les heures de revue et la maintenance d'ingénierie qui portent le coût, et un agent que personne ne lit coûte autant qu'un agent que tout le monde lit.
À petite échelle, non. Celui qui les a construits les porte, et c'est invisible. Quelque part au-delà de trente, le parc devient lui-même le travail : le registre, la suite d'évals partagée, la migration quand une dépendance part à la retraite. Si personne ne s'en charge, cela ne cesse pas d'arriver : cela cesse simplement d'être fait exprès.
Cet article vous a plu ?
Recevez les suivants dans votre boîte mail chaque mardi.
