◆L'inférence est la ligne la plus petite et la plus prévisible de la facture d'un parc d'agents. Dans le modèle ci-dessous, elle pèse environ 5 % du coût mensuel d'un agent.
◆Les lignes chères sont la revue humaine et la maintenance d'ingénierie, et les deux suivent l'autonomie accordée, pas le nombre de tokens consommés.
◆La charge par agent n'est pas plate. Elle s'infléchit vers le haut au moment où les agents commencent à partager des dépendances, car un changement en amont cesse d'être local.
◆Les 46 agents étaient les opérations internes d'Integra. C'est un système différent de la plateforme à 11 agents livrée pour un fonds de private equity, et les deux ne s'additionnent jamais.
◆L'agent le moins cher d'un parc est celui que vous avez supprimé. La mise à la retraite est une décision de conception, pas un aveu d'échec.
~46~46
AGENTS QUE J'AI FAIT TOURNER
ops internes Integra, jusqu'en juin 2026
1111
UN AUTRE SYSTÈME
la plateforme du fonds, jamais additionnée
55
LIGNES SUR LA FACTURE
une seule concerne les tokens
MODÉLISÉ, PAS MESURÉ
La taille du parc est réelle, et la forme du problème aussi. Chaque montant de cet article est un modèle bâti sur des hypothèses que j'énonce intégralement, valorisé aux tarifs publics affichés. C'est une illustration du rapport entre les lignes, pas une facture d'un employeur ou d'un client.
La facture que personne ne montre
J'ai déployé environ 46 agents IA pour les opérations internes d'Integra, où j'ai été CTO jusqu'en juin 2026. On me demande ce que ça coûtait. On pense à la facture de tokens, et c'est la réponse la moins intéressante que j'aie.
L'inférence était la seule ligne bien élevée du lot. Rien d'autre dans la vie d'un parc ne l'était.
Le coûteux, c'était tout ce qui devait rester vrai après la mise en production. Personne ne publie cette courbe : la voici, avec les hypothèses de chaque chiffre assez visibles pour que vous puissiez les contester.
La facture dont on me parle
Celle des tokens. Elle tombe tous les mois, elle est mesurée à six décimales, et on la réduit en une après-midi en routant vers un modèle plus petit. C'était ma ligne la moins chère et la plus prévisible.
La facture que je payais vraiment
Tout ce qui devait rester vrai après la mise en production. Ce n'est pas mesuré, ça ne tombe pas à date fixe, et aucun tableau de bord fournisseur ne vous prévient quand ça monte. Ce sont des gens qui la portent.
Ce qu'étaient vraiment les 46
D'abord la mise au point, parce que ces deux chiffres sont fusionnés en permanence et je refuse que ça passe en silence.
Les 46 agents étaient les opérations internes d'Integra : ma propre entreprise, mes propres systèmes, au passé. Ce ne sont pas les 11 agents en production de la plateforme GenAI livrée pour un fonds de private equity immobilier américain confidentiel gérant environ 3 Md$ d'actifs. Client différent, base de code différente, année différente. 46 et 11 ne font pas 57, et toute page qui les additionne se trompe.
Ce que je ne publie pas, c'est la répartition de ces 46 par fonction : c'était interne. Ce que je publie, c'est la classification que j'utilisais, car le palier d'un agent détermine son coût bien plus que ce qu'il fait.
La construction des 11 agents est documentée séparément dans son étude de cas dédiée, et tout ce qui suit concerne l'autre parc.
LE PARC, PAR PALIER D'AUTONOMIE
La fonction dit à quoi sert un agent. Le palier dit ce qu'il coûte. La même logique de synthèse est quasi gratuite au palier 0 et chère au palier 3, parce que le palier 3 achète un humain dans chaque action.
Les cinq lignes de la facture mensuelle d'un agent
Un agent a cinq coûts récurrents. Quatre n'apparaissent sur aucun tableau de bord fournisseur.
Ce n'est pas une observation neuve, juste une observation démodée. L'article qui a nommé le problème pour les systèmes de machine learning le disait déjà il y a dix ans.
Sculley et ses collègues chez Google le formulaient ainsi dans Hidden Technical Debt in Machine Learning Systems (NeurIPS 2015) : il est courant de supporter des coûts de maintenance continus massifs dans les systèmes de machine learning réels. Les agents n'ont pas abrogé ce constat. Ils l'ont multiplié par le nombre d'agents.
CE QUE COÛTE UN AGENT CHAQUE MOIS
Cinq lignes récurrentes. Celle du haut est celle que tout le monde budgète, et les quatre du dessous sont celles qui décident vraiment si le parc survit à sa deuxième année.
Une facture modélisée, et toutes ses hypothèses
Voici un agent, modélisé de bout en bout. Chaque entrée est une hypothèse, et je les montre toutes pour que vous puissiez y substituer les vôtres.
L'agent est un agent d'opérations internes de palier 1 : il rédige, une personne envoie. Il tourne 2 000 fois par mois. Chaque exécution lit environ 8 000 tokens d'entrée et écrit environ 1 000 tokens de sortie. Environ 5 % des exécutions escaladent vers une personne, et chaque escalade prend 3 minutes à lire et à traiter. Le coût chargé est de 60 $ de l'heure pour le relecteur et de 80 $ de l'heure pour l'ingénieur, qui consacre 2 heures par mois à cet agent. Plateforme et stockage d'audit correspondent à la quote-part d'infrastructure partagée de l'agent.
Les tokens sont valorisés aux tarifs publics affichés pour un petit modèle de production au moment de l'écriture, 1 $ par million de tokens d'entrée et 5 $ par million en sortie, selon la page de tarifs d'Anthropic. Substituez votre propre fournisseur et le rapport bouge à peine, car la ligne tokens reste petite dans tous les cas.
Ligne
Comment elle est dérivée
Modélisé par mois
Part
Inférence
16 M tokens d'entrée à 1 $/M, 2 M en sortie à 5 $/M
26 $
5 %
Quote-part plateforme
Orchestration, files, stockage, supervision
25 $
5 %
Entretien des données
Réindexation et dérive des connecteurs, amortis
10 $
2 %
Revue humaine
100 escalades, 3 min chacune, à 60 $/h
300 $
58 %
Maintenance d'ingénierie
2 heures d'ingénieur par mois à 80 $/h
160 $
31 %
Total
Somme des cinq lignes ci-dessus, parts arrondies
521 $
100 %
Regardez les deux lignes mises en avant. Une personne qui lit des escalades, c'est 58 % de cet agent. Les tokens, 5 %. Si vous dépensez votre budget d'optimisation sur le modèle, vous négociez âprement un vingtième du problème.
Le levier qui déplace vraiment cette facture est le taux d'escalade, et ce taux est une décision de conception, pas un choix de fournisseur. Réglez le seuil d'abstention trop prudemment et vous venez d'embaucher quelqu'un sans le dire.
La charge par agent n'est ni plate ni linéaire. Elle reste presque plate un moment, puis elle s'infléchit, et l'inflexion ne vient pas du volume. Elle vient du moment où les agents commencent à partager des choses.
Voici les points où elle s'est infléchie pour moi. Ce n'est pas une loi mesurée, c'est la forme que j'ai vue se répéter, et vos inflexions tomberont à d'autres compteurs selon ce que vous aurez mutualisé tôt.
LA COURBE DE CHARGE
1
Agents 1 à 3 : la maintenance est invisible
Une seule personne les a construits et se souvient encore de chaque décision. Rien n'est écrit parce que rien n'a besoin de l'être. La charge est réelle et non mesurée, et c'est pourquoi tout parc commence par la sous-estimer.
2
Vers l'agent 6 : il faut un registre
Quelqu'un demande ce que fait un agent, qui en est propriétaire et ce qui se passe s'il s'arrête. Personne ne répond de mémoire. Le premier artefact au niveau du parc apparaît, et ce n'est pas du code : c'est une liste.
3
Vers l'agent 15 : les dépendances partagées mordent
Un index de recherche, un gabarit de prompt, un identifiant de modèle, un chemin d'authentification, désormais partagés. Un changement en amont cesse d'être local. C'est l'inflexion : l'agent marginal devient peu cher à construire et cher à porter.
4
Vers l'agent 30 : le parc devient le travail
Les migrations, la suite d'évals partagée et le registre ne tiennent plus dans les interstices entre deux fonctionnalités. Quelqu'un est désormais propriétaire du parc plutôt que d'un agent, que ce rôle porte un nom ou non.
5
Vers 46 : on compte les propriétaires, pas les agents
La bonne question n'est plus combien d'agents tournent, mais combien d'humains on peut réveiller pour eux. C'est là que j'en étais à la fin du mandat, et c'est le chiffre que je demanderais en premier à une équipe.
La courbe de charge, par inflexion plutôt que par mois. Chaque palier est une chose qu'on ne peut plus faire de façon informelle, et le coude vers l'agent 15 est l'endroit où le partage passe d'économie à passif.
La ligne migration n'a rien d'hypothétique. Les fournisseurs de modèles retirent leurs modèles selon un calendrier et préviennent : Anthropic s'engage sur au moins 60 jours avant le retrait d'un modèle public, et son propre historique montre plusieurs retraits dans une même année. À 4 agents, un retrait est une après-midi. À 40 qui partagent un identifiant de modèle, c'est un trimestre de quelqu'un.
Le cycle de vie que personne ne budgète
L'autre absent de la plupart des estimations, c'est que les agents ont un cycle de vie, et que l'essentiel se déroule après la mise en production que tout le monde avait planifiée.
Voici la boucle telle que je l'ai réellement exécutée. Notez l'endroit où elle ne s'arrête pas.
CYCLE DE VIE
Le cycle de vie d'un agent comme boucle, pas comme lancement. Les étapes 3 à 5 se répètent toute la vie de l'agent, et la dernière étape est la seule sortie.
Si on me tendait demain la facture d'un parc en me demandant de la diviser par deux, je n'ouvrirais pas d'abord la configuration de routage des modèles. J'ouvrirais le registre.
Voici l'ordre dans lequel je travaillerais vraiment.
L'ORDRE
L'ordre compte. Trois de ces quatre branches sont du travail de conception, et celle par laquelle tout le monde commence est celle qui rapporte le moins.
La version inconfortable de cet article, c'est qu'un parc d'agents est surtout une décision de staffing déguisée en infrastructure. Vous n'achetez pas des tokens. Vous achetez l'obligation de maintenir 46 choses vraies.
C'est très bien, à condition de l'avoir chiffré. Ce qui tue les parcs, c'est de le découvrir en deuxième année, par une personne devenue relectrice à plein temps sans que personne l'ait décidé.
L'inférence est la partie que tout le monde cite et celle qui compte le moins. Dans le modèle de cet article, un agent d'opérations internes coûte environ 26 $ par mois en tokens et environ 521 $ par mois tout compris, car la revue humaine et la maintenance d'ingénierie dominent. Ces montants sont modélisés à partir d'hypothèses explicites, pas relevés sur une facture. Ce qu'il faut retenir, c'est le ratio : les tokens pèsent environ 5 % de la ligne, et une personne qui relit les escalades environ 58 %.
Parce que les agents cessent d'être indépendants. Les premiers ne partagent rien : la maintenance se résume à ce dont leur unique propriétaire se souvient. Au-delà d'une douzaine, ils partagent un index de recherche, un gabarit de prompt, un identifiant de modèle, un chemin d'authentification. Dès lors, un changement en amont n'est plus un changement local, et une seule mise à la retraite de modèle impose de revalider tous les agents qui en dépendaient plutôt que d'en corriger un.
Non, et c'est important. Les 46 étaient les opérations internes d'Integra, où j'ai été CTO jusqu'en juin 2026. Les 11 formaient une plateforme GenAI distincte livrée pour un fonds de private equity immobilier américain confidentiel gérant environ 3 Md$ d'actifs. Clients différents, systèmes différents, années différentes. On ne les additionne jamais.
Supprimer des agents. Le deuxième moyen est d'en rétrograder un d'un cran, pour qu'il rédige au lieu d'agir et qu'un humain envoie. Les deux battent l'optimisation de modèle, car ce sont les heures de revue et la maintenance d'ingénierie qui portent le coût, et un agent que personne ne lit coûte autant qu'un agent que tout le monde lit.
À petite échelle, non. Celui qui les a construits les porte, et c'est invisible. Quelque part au-delà de trente, le parc devient lui-même le travail : le registre, la suite d'évals partagée, la migration quand une dépendance part à la retraite. Si personne ne s'en charge, cela ne cesse pas d'arriver : cela cesse simplement d'être fait exprès.
Ancien CTO d'Integra. Auteur nommé (1 sur 5) d'ERC-3643, premier auteur d'ERC-6960, co-auteur d'ERC-7410 et co-auteur d'ERC-8203, encore à l'état de brouillon. Conçoit des systèmes d'IA en production et des systèmes Web3 régulés.