ALLER AU CONTENU
Agents IA10 minAgents in Production / Ep. 10

Comment mériter un seuil d'éval

Adam Boudjemaa
PARTAGER

À RETENIR

  • Un seuil n'est pas un chiffre. C'est une affirmation sur votre coût de l'erreur, écrite dans les unités de votre propre référence, et sans valeur détachée du jeu sur lequel il a été mérité.
  • Figez le jeu d'évals avant de mesurer quoi que ce soit. Un seuil mérité sur un jeu que vous éditez est un seuil que vous pouvez déplacer en éditant le jeu.
  • Chiffrez les deux sens de l'erreur. Là où le coût n'a pas de plafond, le seuil est zéro, pas quatre-vingt-dix-neuf pour cent. Là où le coût se compte en minutes de relecture, le seuil est un budget que vous renouvelez.
  • Quand un run passe sous le seuil, trois choses différentes peuvent être en cause : l'agent, le jeu, ou le seuil lui-même. Nommer laquelle, c'est l'essentiel du travail.
  • Copier le seuil d'un autre, c'est réussir une barrière qui ne testait jamais votre risque. C'est l'échec que cet article existe pour empêcher.
3
FOIS OÙ CETTE SÉRIE A ESQUIVÉ
les épisodes 3, 6 et 7 renvoient tous ici
0
SEUILS COPIABLES
chez moi comme chez les autres
11
AGENTS DERRIÈRE LA MÉTHODE
une plateforme, un seul harnais d'évals

ILLUSTRATION CHIFFRÉE, PAS UN BENCHMARK

Il y a un seul chiffre de cet article que vous pourriez copier, et c'est zéro, pour une raison que j'expliquerai. Chaque seuil et chaque coût en dessous est une illustration : des valeurs inventées, montrées pour rendre le calcul visible. Les décomptes de choses qui existent, comme le nombre d'agents que j'ai exploités, sont réels. Aucun taux de justesse, aucun taux de réussite et aucun seuil d'un système que j'ai livré n'apparaît ici, et aucun n'est sous-entendu.

Le chiffre que j'ai refusé de donner trois fois

Trois fois maintenant, cette série a mené le lecteur jusqu'à la même question puis s'est arrêtée. L'épisode 6 le dit le plus crûment : copiez la structure, méritez les chiffres. Il ne dit jamais comment on les mérite.

Ce n'était pas de la modestie. Je ne voulais pas publier un chiffre que quelqu'un collerait dans sa propre barrière, parce qu'un seuil issu de mon déploiement mesure mon risque, pas le sien, et le coller produit une barrière qui passe pour la mauvaise raison.

Mais refuser de répondre trois fois est une dette, pas un argument. Voici donc la méthode. C'est la partie qui se transpose vraiment et, contrairement à un chiffre, personne ne peut faire semblant de l'avoir faite.

LA DETTE
1

L'épisode 3 a refusé de publier un taux de justesse

Le post sur le RAG soutient qu'il n'existe pas de chiffre de justesse unique et honnête pour un système dont tout le travail est de se comporter différemment selon l'état de la preuve, puis renvoie vers la suite d'évals « seuils compris ».

2

L'épisode 6 a construit la barrière et laissé les seuils vides

Il vous donne les dimensions, les trois verdicts, et un fichier de grille où chaque seuil est le mot « blocks_release_if ». Puis il dit : copiez la structure, méritez les chiffres.

3

L'épisode 7 a rendu le chiffre décisif puis est passé à autre chose

Le post sur les coûts montre que c'est le taux d'escalade, pas le modèle, qui déplace la facture d'un parc d'agents. Où ce seuil se fixe, dit-il, c'est le travail de la suite d'évals. C'est-à-dire ici.

Trois articles, une seule esquive. Chacun a raison de dire que le chiffre ne se transpose pas, et aucun ne dit quoi faire à la place. Voici l'article qui vous doit cette réponse.

Si vous ne l'avez pas lu, la suite d'évals qui bloque une release est la machinerie dans laquelle cet article met des chiffres. Elle construit la barrière. Celui-ci mérite les seuils.

Un seuil est une affirmation, pas un chiffre

Commencez par jeter l'idée qu'un seuil est un chiffre. Un chiffre seul ne peut être ni juste ni faux. Il peut seulement être plus grand ou plus petit qu'un autre chiffre.

Un seuil est une affirmation, et cette affirmation a des parties. Voici l'enregistrement complet. Le seuil lui-même est un champ sur sept, et c'est le moins intéressant.

ENREGISTREMENT DU SEUIL
record Threshold
dimensionstring

À quelle dimension notée ce seuil appartient. Une vraie barrière a un seuil par dimension. Un agent avec un score global unique a un chiffre marketing, pas une barrière.

direction'at most' | 'at least'

Dans quel sens le seuil pointe. La moitié des disputes sur les seuils, ce sont deux personnes avec des sens opposés et le même chiffre.

barnumber

La valeur elle-même. Sans signification hors des six champs qui l'entourent, ce qui est exactement pourquoi c'est la seule partie que l'on copie.

measured_onset_hash

Le jeu figé exact sur lequel ce seuil a été mérité, par empreinte. Changez le jeu et le seuil n'est plus un seuil, c'est une rumeur sur un examen plus ancien.

becausecost_of_being_wrong

Une phrase nommant qui paie quand cette dimension échoue. Si vous ne savez pas l'écrire, vous n'avez pas dérivé le chiffre, vous en avez hérité.

ownerperson

La personne qui porte le risque, pas celle qui a lancé l'éval. Ce sont presque jamais les mêmes, et la barrière appartient à la première.

review_bydate

La date à laquelle ce seuil doit être re-mérité. Un seuil sans péremption devient discrètement un folklore que personne ne se souvient d'avoir approuvé.

Sept champs, dont le seuil. Tout ce qui rend un seuil défendable vit dans les six autres, et c'est pourquoi un chiffre copié n'en emporte rien.

Relisez le champ « because ». C'est le test honnête de savoir si vous avez mérité un seuil : pouvez-vous dire, en une phrase, qui paie quand cette dimension échoue, et combien. Si oui, le chiffre en découle. Sinon, aucune quantité de mesures n'en produira un.

Figez le jeu avant de mesurer quoi que ce soit

Avant tout cela, il vous faut quelque chose contre quoi mesurer, et ça doit tenir immobile. C'est l'étape que les équipes sautent, et la sauter invalide tout ce qui suit.

Un jeu d'évals figé est une collection fixe de cas avec une empreinte. Chaque run enregistre l'empreinte. On peut ajouter des cas. On ne peut jamais en modifier ni en supprimer. Cette troisième règle est tout l'enjeu : sans elle, une barrière qui échoue peut être franchie en éditant l'examen, et elle le sera, à 18h un jour de release, par quelqu'un de bien intentionné.

Le jeu n'est pas un seul seau. Il a des compartiments, et ils ont des règles différentes.

LE JEU, PAR COMPARTIMENTS
Diagramme en couches : 4 niveaux, de haut en basDiagramme en couches : 4 niveaux, de haut en bas. Niveau 1, NOYAU FIGÉ : Des cas réels, issus du trafic réel, Empreinté, versionné, jamais édité. Niveau 2, LOT RED-TEAM : Chaque sonde ayant fonctionné, pour toujours, Ajout seul, jamais retiré après un correctif. Niveau 3, RÉSERVE : Cas candidats en attente de label, Non notés avant le prochain gel. Niveau 4, HOLDOUT : Ouvert seulement le jour de la release, Le compartiment que personne n'a le droit d'optimiser.NOYAU FIGÉDes cas réels, issus du trafic réelEmpreinté, versionné, jamais éditéLOT RED-TEAMChaque sonde ayant fonctionné, pourtoujoursAjout seul, jamais retiré après uncorrectifRÉSERVECas candidats en attente de labelNon notés avant le prochain gelHOLDOUTOuvert seulement le jour de lareleaseLe compartiment que personne n'a ledroit d'optimiser
Quatre compartiments, quatre règles. Le noyau figé est ce sur quoi les seuils se méritent ; le holdout est le seul que personne n'a le droit d'optimiser.
D'où vient un cas
Ce qu'il apporte
La règle
Une question du trafic réel
La distribution que vous servez vraiment
Chaque cas figé commence par une vraie question d'une vraie personne
Un incident
Un échec que vous avez déjà payé une fois
Ne fermez jamais un bug sans ajouter le cas qui l'a attrapé
Une sonde de red-team qui a marché
La surface d'attaque, pas le chemin heureux
Ajoutez-la pour toujours, y compris après le correctif
Un cas synthétique
La couverture d'un état trop rare dans le trafic réel
Autorisé, étiqueté comme synthétique, et jamais majoritaire
Un cas écrit après avoir vu le score
Rien
C'est ainsi qu'une barrière devient discrètement une cérémonie

Les labels sont l'autre moitié. Chaque cas porte le comportement attendu, pas le texte attendu : répondre, s'abstenir, ou bloquer. Et le label est fixé par la personne qui porte le risque, pas par l'ingénieur qui veut que le run soit vert.

Ça ressemble à de la procédure. C'est en réalité l'heure la moins chère que vous dépenserez, car un cas labellisé par le responsable du risque est le seul qu'on puisse ensuite montrer dans une pièce où quelqu'un est mécontent.

La boucle qui fait mériter un chiffre

Vous pouvez enfin mesurer. Et la première chose à comprendre, c'est qu'un seuil n'est pas produit par une mesure. Il est produit par une boucle que vous finissez par arrêter.

Faites tourner le candidat sur le jeu figé, sans y toucher. Ce premier run n'est pas un score à célébrer ni à excuser, c'est une référence : la position de départ honnête dont tout chiffre ultérieur n'est qu'un écart.

LA BOUCLE
Diagramme de flux : 5 étapesDiagramme de flux : 5 étapes. Figez le jeu et enregistrez son empreinte, puis Lancez le candidat sans y toucher, et appelez ça la référence. Lancez le candidat sans y toucher, et appelez ça la référence, puis Triez les échecs par classe de coût, pas par nombre. Triez les échecs par classe de coût, pas par nombre, puis Ne changez exactement qu'une chose. Ne changez exactement qu'une chose, puis Relancez le jeu identique et comparez. Relancez le jeu identique et comparez revient à Lancez le candidat sans y toucher, et appelez ça la référence.1Figez le jeu et enregistrezson empreinteRien sous cette ligne n'estcomparable à quoi que ce soit tantque le jeu n'a pas d'empreinte etque l'empreinte n'est pas notée.2Lancez le candidat sans ytoucher, et appelez ça laréférencePas un score à défendre. Uneposition de départ. Chaque chiffreaprès celui-ci est un écart depuisici.3Triez les échecs par classede coût, pas par nombreDix échecs bon marché et un cher,ça ne fait pas onze échecs. Lescompter ensemble, c'est ainsiqu'une barrière finit pardéfendre la mauvaise dimension.4Ne changez exactement qu'unechosePrompt, récupération, politique oumodèle. Une seule. Deuxchangements et une amélioration,et vous n'avez rien appris sur nil'un ni l'autre.5Relancez le jeu identique etcomparezMême empreinte, mêmes cas, mêmeslabels. La seule variable est ceque vous avez changé, et c'est cequi donne un sens à l'écart.
Un seuil est ce qui reste quand cette boucle cesse de rapporter. Notez l'arête pointillée : l'étape 5 ne termine rien, elle revient à l'étape 2 avec le même jeu et une seule variable changée.

Vous arrêtez quand un cycle complet cesse de déplacer la classe chère. Ce point n'est pas un triomphe, c'est une information : il dit où le système habite aujourd'hui, et c'est la dernière entrée honnête du seuil.

Remarquez ce que la boucle ne vous a pas dit. Elle vous a dit ce que fait le système. Elle n'a rien dit sur ce qui est assez bon. Cette question n'est pas du tout une question d'ingénierie, et c'est pourquoi la section suivante parle d'argent et pas de modèles.

Chiffrez les deux sens de l'erreur

Voici le geste qui sépare un seuil dérivé d'une supposition décorée. Se tromper n'est pas une seule chose. Ça a des sens, et les sens ont des prix radicalement différents.

Écrivez-les pour votre propre système. Quatre lignes suffisent en général, et c'est la dernière colonne qui fixe le seuil.

L'agent se trompe de cette façon
Qui le découvre
Ce que ça coûte
Ce que ça implique pour le seuil
Il répond alors que la preuve était mince
Peut-être personne, jusqu'à un audit
Aucun plafond que vous sachiez nommer
Zéro sur cette classe de cas
Il refuse ce qu'il aurait pu répondre
Le relecteur, immédiatement
Des minutes, et vous savez les chiffrer
Un budget que vous renouvelez, pas un seuil à défendre
Il est lent
L'utilisateur, immédiatement
De la patience, et parfois une échéance
Un plafond fixé par la fenêtre de revue
Il fuit
Un attaquant, en silence
Ce qu'il choisit de prendre
Pas un seuil du tout. Un blocage.
QUEL SENS COÛTE CHER
Décision: Quel sens de l'erreur coûte cher dans votre domaine ?Arbre de décision : Quel sens de l'erreur coûte cher dans votre domaine ? Si une réponse fausse et confiante atteint quelqu'un qui va agir dessus, alors Le seuil est zéro sur cette classe. Si le sens coûteux est un refus inutile, alors Donnez-lui un budget, pas un seuil. Si les deux sens ne vous coûtent presque rien, alors Vous n'avez pas besoin de barrière ici.DÉCISIONQuel sens de l'erreur coûte cherdans votre domaine ?SI une réponse fausse et confianteatteint quelqu'un qui va agirdessusLe seuil est zéro sur cetteclassePas quatre-vingt-dix-neuf pourcent. Zéro, sur les cas du jeu figéqui portent ce coût. On ne met pasde pourcentage sur un chiffre qu'onrefuse de nommer.SI le sens coûteux est un refusinutileDonnez-lui un budget, pas unseuilChiffrez les minutes de relecture,décidez ce que la file absorberachaque mois, et laissez lepourcentage en découler. Puisrenouvelez-le comme n'importe quelbudget.SI les deux sens ne vous coûtentpresque rienVous n'avez pas besoin debarrière iciLivrez, surveillez en production,et dépensez le budget d'évals surla partie du système qui peutvraiment blesser quelqu'un. Unebarrière sur une surfaceinoffensive est du théâtre avec uncoût de maintenance.
La forme du seuil vient de la forme du coût. Un coût sans plafond ne peut pas recevoir de pourcentage, et un coût dérisoire ne mérite pas de barrière.

C'est la troisième branche qui fait tiquer, et c'est la plus honnête. La plupart des agents n'ont pas besoin de barrière de release. Ceux qui lisent les documents d'un fonds régulé, si, et la raison tient entièrement à qui paie quand ils se trompent, pas à l'intérêt du modèle.

La ligne « il répond alors que la preuve était mince » est exactement le comportement que les citations vérifiées et l'abstention sont faits pour empêcher à l'exécution. Ici, on lui met un prix.

Une illustration chiffrée, et rien à copier

Assemblez les deux moitiés et l'enregistrement du seuil s'écrit tout seul. En voici un, rempli de bout en bout, avec des valeurs inventées pour que vous voyiez le calcul plutôt que de copier la réponse.

Lisez d'abord les lignes « because ». C'est elles qui travaillent. Les chiffres ne sont que ce que ces phrases impliquent une fois la division faite.

threshold.yaml
# threshold.yaml
# A WORKED ILLUSTRATION. Every number below is invented for this article.
# The arithmetic transfers. The values never do.

frozen_set:
  hash: sha256:7f1c9a...    # the exam. change it and every bar below expires
  cases: 200                # illustrative
  thin_evidence: 40         # the class where being wrong has no priced ceiling
  answerable: 160           # the class where being wrong costs known minutes

thresholds:
  - dimension: unescalated_thin_evidence
    direction: at_most
    bar: 0                  # not "99 percent". zero.
    because: >
      A confidently wrong figure that reaches the books is not priced in
      reviewer minutes. Nobody will name the ceiling, so the bar is zero.
    owner: the person who signs off on the books

  - dimension: over_refusal_on_answerable
    direction: at_most
    bar: 10                 # percent: 16 of the 160 answerable cases, exactly
    because: >
      An unnecessary escalation costs about three reviewer minutes. At the
      modelled 60 dollars an hour from episode 7 that is about 3 dollars each.
      16 escalations is about 48 dollars a run. 10 percent is the rate this
      queue agreed to absorb. Price your own minutes and the number moves.
    owner: the lead who staffs the review queue

review_by: 2026-11-01       # a threshold with no expiry becomes folklore

Suivez le second jusqu'au bout. Une escalade inutile prend environ trois minutes de relecture, et aux soixante dollars de l'heure modélisés dans le post sur les coûts, cela fait environ trois dollars. Dix pour cent de cent soixante cas répondables, c'est seize d'entre eux, soit environ quarante-huit dollars par exécution. Le seuil n'est pas « dix pour cent de justesse », c'est « nous paierons pour seize de ces cas, et voici le taux qui a produit ce compte ».

Changez maintenant une entrée. Divisez le taux de relecture par deux et le seuil bouge. Passez le relecteur d'un service à la journée à un service en deux heures et il rebouge. Cette sensibilité n'est pas une faiblesse de la méthode, c'est la méthode : le chiffre est censé bouger quand votre coût de l'erreur bouge.

Et voyez ce que fait le premier seuil. Il refuse d'être un pourcentage. Quand le coût d'un échec n'a aucun plafond que quelqu'un accepte d'énoncer, le seul seuil défendable est zéro, et la conséquence honnête est que la barrière bloquera des releases qu'un pourcentage aurait laissées passer. C'est fait pour ça.

Le taux de relecture ci-dessus n'est pas nouveau : c'est l'hypothèse modélisée de ce que coûte un parc de 46 agents, où ces mêmes trois minutes sont la plus grosse ligne de la facture. Les seuils et les coûts sont la même conversation tenue à deux moments différents.

Quand le run rate, trois causes possibles

Six mois plus tard, un run de release passe sous le seuil. C'est là que la plupart des barrières meurent en silence, car l'équipe débat de l'agent alors que l'agent n'est peut-être pas ce qui a changé.

Trois choses ont pu bouger, et elles appellent des réponses complètement différentes. Le premier travail n'est pas de corriger quoi que ce soit, c'est de trouver laquelle.

LE RATÉ, COMME UN EMBRANCHEMENT
Diagramme de flux : 3 étapesDiagramme de flux : 3 étapes. Un run de release passe sous le seuil, puis Demandez laquelle des trois a bougé. Demandez laquelle des trois a bougé se divise en 3 : Si l'empreinte du jeu a changé, alors La comparaison est nulle. Si le jeu a tenu, l'agent a changé, alors Une vraie régression. Si rien n'a changé sauf le coût, alors Le seuil a expiré. Les deux chemins continuent vers Notez laquelle c'était.L'EMPREINTE DU JEU A CHANGÉLE JEU A TENU, L'AGENT A CHANGÉRIEN N'A CHANGÉ SAUF LE COÛT1Un run de release passe sous leseuilAvant que quiconque touche à unprompt, vérifiez ce qui a réellementchangé depuis le run auquel on lecompare.2Demandez laquelle des trois abougéLe jeu, l'agent, ou le monde contrelequel le seuil avait été chiffré.La comparaison est nulleVous n'avez pas mesuré unerégression, vous avez mesuré unautre examen. Relancez surl'empreinte figée avant de débattrede l'agent.Une vraie régressionC'est le cas pour lequel la barrièreexiste. Retenez la release etretournez dans la boucle, unevariable à la fois.Le seuil a expiréLe seuil avait été chiffré contreune réalité plus ancienne.Re-méritez-le avec le responsable durisque au lieu de faire échouer desreleases contre une affirmationpérimée.3Notez laquelle c'étaitDans le registre du run, à côté del'empreinte. Dans six mois, cetteligne fera la différence entre unepiste d'audit et une dispute.
Un run raté, trois diagnostics. Seul le bras du milieu est une régression ; les deux autres sont une comparaison cassée et une affirmation périmée, et corriger l'agent serait faux dans les deux cas.

C'est le premier bras qui piège. Un jeu qui a grossi de neuf cas depuis le dernier run n'est pas le même examen, et comparer à travers produit un chiffre qui ressemble à une régression sans en être une. Enregistrer l'empreinte à chaque run transforme ce bras en vérification de deux minutes plutôt qu'en dispute de deux jours.

Un jeu figé a une date de péremption

La dernière chose que personne ne planifie : un jeu figé n'est pas permanent. Il est figé, ce qui est différent. Il a un cycle de vie, et la fin de ce cycle est une décision de conception, pas un accident.

Voici la boucle telle qu'elle tourne vraiment, avec les rôles qui portent chaque étape.

LE CYCLE DE VIE
Diagramme de séquence : 4 participants : Ingénieur, Jeu figé, Barrière, Responsable risqueDiagramme de séquence : 4 participants : Ingénieur, Jeu figé, Barrière, Responsable risque. Étape 1 : Ingénieur vers Jeu figé, Fige les cas et enregistre l'empreinte.. Étape 2 : Barrière vers Jeu figé, Rejoue le jeu identique à chaque release.. Étape 3 : Ingénieur vers Jeu figé, Ajoute de nouveaux cas, et n'en modifie aucun ancien.. Étape 4 : Jeu figé vers Responsable risque, Signale la dérive : la production est pleine de cas que le jeu n'a jamais eus.. Étape 5 : Responsable risque vers Ingénieur, Ordonne une nouvelle référence, et les anciens seuils expirent avec l'ancienne empreinte.. Étape 6 : Responsable risque vers Barrière, Retire le jeu quand le produit qu'il testait n'existe plus..INGÉNIEUR > JEU FIGÉFige les cas et enregistrel'empreinte.Rien n'est noté, et aucun seuil n'existe,tant que ceci n'a pas eu lieu.BARRIÈRE > JEU FIGÉRejoue le jeu identique à chaquerelease.Le même examen à chaque fois, sinon lacomparaison est du théâtre.INGÉNIEUR > JEU FIGÉAjoute de nouveaux cas, et n'enmodifie aucun ancien.L'ajout change l'empreinte, ce qui périme lesseuils, exprès.JEU FIGÉ > RESPONSABLE RISQUESignale la dérive : la production estpleine de cas que le jeu n'a jamaiseus.Le jeu n'est pas devenu faux. Il est devenunon représentatif, ce qui est pire car ilpasse encore.RESPONSABLE RISQUE > INGÉNIEUROrdonne une nouvelle référence, et lesanciens seuils expirent avecl'ancienne empreinte.Retour dans la boucle. C'est normal, pas unéchec.RESPONSABLE RISQUE > BARRIÈRERetire le jeu quand le produit qu'iltestait n'existe plus.La seule fin propre. Tout le reste est un jeuque personne ne croit et que personne nesupprime.
Le jeu survit à de nombreuses releases et ne survit pas au produit. Notez la dernière étape : la mise à la retraite est délibérée, et c'est là que la ligne s'arrête au lieu de continuer vers la release suivante.

Le signal de dérive est le subtil. Un jeu périmé ne se met pas à échouer. Il se met à passer, confortablement, sur des questions que vos utilisateurs ont cessé de poser il y a un an. Une barrière qui dit toujours oui a le même contenu informatif que pas de barrière, et coûte plus cher à faire tourner.

Mettez donc la date de revue dans l'enregistrement, comme un champ, à côté du seuil. Pas dans un agenda, pas dans la tête de quelqu'un. Dans le fichier que la barrière lit.

Zéro. Non parce que zéro serait un bon défaut, mais parce que c'est le seul seuil qui n'affirme rien sur mes données. Quand une classe d'échec a un coût auquel personne ne veut mettre de plafond, un pourcentage est une façon de faire croire qu'on a chiffré ce qu'on n'a pas chiffré. Tous les autres chiffres de cet article sont des illustrations, et ils devraient vous être inutiles, ce qui est à quoi vous voyez qu'ils sont honnêtes.

Une fois les seuils posés, ce sont aussi l'artefact que vous tendez quand on vous demande de prouver la justesse plutôt que de l'affirmer, ce qui est le même argument que traiter le règlement IA européen comme une checklist d'ingénierie. Un régulateur ne veut pas d'un adjectif. Il veut le jeu, le seuil, et la raison pour laquelle c'est ce chiffre.

FAQ

Vous le dérivez, vous ne le choisissez pas. Figez un jeu d'évals construit à partir de votre propre trafic, faites tourner votre système actuel dessus pour obtenir une référence, puis chiffrez les deux sens de l'erreur. Là où le coût d'une réponse fausse n'a pas de plafond nommable, le seuil est zéro sur cette classe de cas. Là où le coût se compte en minutes de relecture connues, le seuil est le taux que vos relecteurs ont accepté d'absorber. Le chiffre est une sortie de ce calcul, jamais une entrée.

C'est un ensemble fixe de cas d'évaluation, adressé par son contenu, que chaque run de release rejoue à l'identique. Figer veut dire que le jeu a une empreinte, que cette empreinte est enregistrée avec chaque run, et que les cas peuvent être ajoutés mais jamais modifiés ni supprimés. Sans cela, deux runs ne sont pas comparables, et une barrière qui échoue peut être franchie en éditant discrètement l'examen.

Parce qu'un seuil publié a été mérité sur les données de quelqu'un d'autre, ses modes d'échec et son coût de l'erreur. C'est une vraie mesure d'un système qui n'est pas le vôtre. Le copier vous donne une barrière qui rend un verdict sur un déploiement que vous n'avez pas, ce qui est pire que pas de barrière du tout, car cela ressemble à une preuve.

Assez pour qu'un seul cas qui bascule ne change pas le verdict, et assez peu pour qu'une personne lise vraiment les échecs. Je me soucie beaucoup plus de quels cas y figurent que de combien. Un jeu fait d'incidents réels, de vraies questions et de chaque sonde de red-team ayant fonctionné vaut mieux qu'un jeu bien plus gros généré par un modèle pour paraître exhaustif.

Quand le jeu change, quand le modèle en dessous change, ou quand sa date est passée. Chaque seuil devrait porter une date de revue. Un seuil sans péremption cesse d'être une mesure et devient un folklore que personne ne se souvient d'avoir approuvé.

Agents in Production

Episode 10 · 10 publies

PrecedentSuivant
Adam Boudjemaa

Adam Boudjemaa

Ancien CTO d'Integra. Auteur nommé (1 sur 5) d'ERC-3643, premier auteur d'ERC-6960, co-auteur d'ERC-7410 et co-auteur d'ERC-8203, encore à l'état de brouillon. Conçoit des systèmes d'IA en production et des systèmes Web3 régulés.

Cet article vous a plu ?

Recevez les suivants dans votre boîte mail chaque mardi.