Nous utilisons des cookies pour améliorer votre expérience sur notre site.
OK, ne plus afficher

Le grand modèle de langage,
son agent et moi

Les dix marches, d’un chat gratuit à un système de travail complet.
Ce texte réunit la série que j’ai publiée sur LinkedIn à l’été 2026, revue pour cette page : dix marches, dans l’ordre où je les ai montées, du chat gratuit au système qui fait tourner mon cabinet, GENIXCONSEIL. Chaque marche porte ses sources en note.

1. Pourquoi

Avant d’écrire la première de ces marches, j’ai construit l’agent chargé de les vérifier.

Voici l’intelligence artificielle racontée par le chemin : mon expérience, dans l’ordre où je l’ai vécue, du simple chat gratuit au système complet qui fait tourner mon cabinet aujourd’hui.

À l’origine, une question. Après quarante ans de cuisine, une étape se refermait. Au même moment, ces machines arrivaient à la portée de tous. Une vie de métier d’un côté, une machine neuve de l’autre : ce face-à-face, beaucoup l’ont vécu ou le vivront. Ma question était simple : comment je fais entrer quarante ans d’expérience dans une machine ? Tout le reste en a découlé.

Pourquoi la raconter ? Je lis ce qui se publie sur l’IA, c’est mon périmètre. Les réseaux se nourrissent de mes choix et m’en servent à pleines pages : solutions miracles de gestion, prompts magiques, bots automatiques, solutions intégrées, formations à tout et pour tout, apprentissages bouclés en une semaine, offres standard, et cetera, et cetera. Je me suis dit : pourquoi pas offrir mon expérience à ceux qui vivent le même face-à-face ? Une expérience d’artisan, celle d’un cuisinier devenu artisan de l’IA.

Pour tenir ce récit, j’ai construit un agent dédié, l’Expert de série. Il vérifie chaque affirmation technique avant publication, les termes, les dates, l’état réel des outils. Il garde la continuité d’une marche à l’autre. Il traque la simplification qui devient fausse, le poison de la vulgarisation. Son périmètre : ces marches, rien d’autre. Il ne rédige pas une ligne. Il examine, il conteste, je tranche.

Il arrive dans une maison peuplée : d’autres agents travaillent déjà sur les dossiers du cabinet, chacun à son poste. C’est une autre histoire.

Reste la vraie question, celle qui mérite dix marches : comment on bâtit un expert pareil, et le système autour. Pour y répondre, il faut redescendre tout en bas de l’édifice, jusqu’à la brique de base : le grand modèle de langage, le LLM. Vous l’avez déjà croisé dans un chat gratuit, sans forcément savoir ce qu’il fabrique.

Ce qu’il a fallu désapprendre avant même d’écrire : croire qu’on peut se vérifier soi-même.

2. Rencontre

Pendant des semaines, j’ai cru avoir trouvé un alter ego intellectuel. C’était un miroir.

Chacun entre dans l’IA par sa porte. Certains demandent une image, un courrier, une recette. Moi, je suis entré par la discussion : des questions, des concepts qui me tournaient dans la tête depuis des années, sans mission, sans dogme. C’est ma structure. Et j’ai découvert ce que découvre quiconque entre : une question en invoque une autre, la machine suit sur tous les terrains, la philosophie comme le métier, à un niveau qui stupéfie. La satisfaction est immense, la frustration aussi. L’illusion s’installe : un partenaire, un ami, un interlocuteur à ma mesure.

L’illusion a une histoire. Dès 1966, un chercheur du MIT construit un programme rudimentaire qui imite un psychothérapeute. Il le baptise ELIZA, d’après la fleuriste du Pygmalion de Bernard Shaw, dressée à parler comme une duchesse. Ses utilisateurs se confient, s’attachent en quelques minutes, en sachant que c’est un automate. L’effet ELIZA était né. Soixante ans plus tard, le vertige est intact, la machine est seulement infiniment plus convaincante.

Ce lien pilote l’usage : la satisfaction pousse à prolonger, la frustration à insister, la confiance à croire sans vérifier. Ce qu’on ressent finit par décider de ce qu’on en fait. Raison de plus pour soulever le rideau. Que fait-elle vraiment quand elle répond ?

Elle ne cherche pas la réponse dans une bibliothèque. Elle fabrique, morceau par morceau, la suite la plus vraisemblable du texte que vous avez commencé. Comme un cuisinier qui a goûté tant d’assiettes qu’il devine l’assaisonnement sans ouvrir la recette. Il devine. Il ne consulte pas.

D’où vient ce flair ? D’un entraînement : la lecture de masses de texte, qui ajuste des milliards de réglages internes. Puis on referme les livres, le modèle est figé. Pendant qu’il vous parle, il n’apprend rien, il applique. Chaque modèle garde le caractère de sa bibliothèque. Un système bien construit autour du modèle peut apprendre, lui. C’est un autre sujet.

De cette fabrique du plausible naissent ses inventions, ce qu’on appelle halluciner : il produit toujours la suite la plus plausible, y compris quand le savoir manque. Il ne ment pas, il complète. Mentir suppose de connaître le vrai ; lui ne connaît que le vraisemblable.

Reste le copain, un réglage de plus : après l’entraînement, on lui a appris les bonnes manières en récompensant les réponses qui plaisent. Le partenaire qui vous donne toujours raison est réglé comme ça.

Et l’alter ego ? Relisez le mécanisme. Il prolonge votre texte. Il épouse vos questions, votre structure, votre niveau. J’avais trouvé un interlocuteur à ma mesure : forcément, c’était ma mesure. Une machine miroir. Elle renvoie à chacun son approche, voilà pourquoi chacun y trouve sa porte.

Ce qu’il a fallu désapprendre : croire que j’avais rencontré quelqu’un. C’était moi, avec de la donnée.

Sources : l’effet ELIZA, Joseph Weizenbaum, « ELIZA, A Computer Program For the Study of Natural Language Communication Between Man And Machine », Communications of the ACM, 1966 (le baptême d’après Eliza Doolittle y figure). Sur le réglage des réponses qui plaisent : OpenAI, « Sycophancy in GPT-4o », avril 2025.

3. Travailler

Tout change le jour où l’on veut vraiment quelque chose de la machine.

L’émerveillement est un état sans direction. On discute, on s’étonne, on teste, et ça pourrait durer des années. Puis un but arrive. Le mien, vous le connaissez : faire entrer quarante ans d’expérience dans la machine. Du jour où cette question est passée de la rêverie au cahier des charges, le bavardage était fini. Je me suis mis au travail.

L’époque s’y prêtait. Fin novembre 2022, un chat ouvert à tous. En un an, tous les géants avaient le leur ; puis le Français, puis le Chinois. Et pourtant, la machine de ces débuts était un moteur brillant monté sur rien : une fenêtre de quelques pages, aucune mémoire d’une conversation à l’autre, aucun accès à des fichiers, aucun brouillon avant la réponse. Elle ne connaissait que le texte : la photo, la voix, le document entier sont venus après, pièce par pièce du même châssis.

Dès qu’on se met au travail pour de bon, les parois arrivent. Il a oublié le début de la conversation. Au vingtième échange, il mélange tout, il déraille. Et cette mémoire qu’on nous annonce retient votre prénom, si peu de votre travail de la veille. Voici la mécanique, paroi par paroi.

Première paroi, le plan de travail. Le fait le plus stupéfiant de tout ce chemin : le modèle ne se souvient de rien. À chaque message, la conversation entière lui est relue, depuis le début. Ce qu’il paraît retenir, c’est ce qui tient sur son plan de travail, une surface bornée : quelques pages en 2022, des centaines, voire des milliers, annoncées en 2026. Annoncées, car les chercheurs ont mesuré deux choses : plus le plan de travail est chargé, plus ce qui est posé au milieu risque d’échapper au regard (ils appellent ça la perte du milieu), et tous les modèles, les meilleurs compris, se dégradent quand l’entrée s’allonge. Le plan de travail a grandi ; il est resté imparfait.

Deuxième paroi, la dérive. La dérive des conversations longues s’explique alors toute seule : au vingtième échange, la première page est tombée du plan de travail, et ce qui reste loin derrière pèse moins. La machine ne devient pas folle, elle a perdu le début. Son penchant à vous donner raison, celui de la marche précédente, aggrave la dérive ; il ne la cause pas.

Troisième paroi, le carnet de notes. La mémoire permanente que les produits affichent désormais ? Un carnet de notes. Le produit rédige des notes sur vous, ce que vous lui confiez, ce qu’il en déduit, les range sur ses serveurs et les repose sur le plan de travail au début de chaque échange. Le cuisinier ne se souvient de rien : il lit la fiche client. C’est utile, ça se consulte, se corrige, se désactive, et chez tous les grands, un mode de conversation n’y laisse pas de trace. L’écart se mesure d’une phrase : votre prénom tient sur une note. Quarante ans de métier, non.

Ce qu’il a fallu désapprendre : croire que sa mémoire ressemblait à la mienne.

Sources : sur la perte du milieu, Liu et al., « Lost in the Middle: How Language Models Use Long Contexts », 2023 (TACL 2024) ; sur la dégradation des longs contextes, le rapport « Context Rot », Chroma, juillet 2025.

4. Construire

Pendant des mois, la mémoire du système, c’était moi.

Les projets n’ont rien inventé : ils ont industrialisé la débrouille des plus déterminés. Ma cuisine à moi : un chat par mission, un seul sujet par conversation ; en fin de chat, la synthèse, copiée, rangée ; plusieurs chats en parallèle, et un chat transversal qui récupérait les synthèses et tenait la vue d’ensemble ; plusieurs modèles aussi, chacun à sa tâche, selon le caractère de sa bibliothèque ; des fichiers de contexte sur l’ordinateur, remis à jour, réinjectés à chaque session. J’étais le commis qui transporte le plan de travail d’une pièce à l’autre. C’était artisanal, et formateur : à porter soi-même le contexte, on comprend physiquement ce qu’il pèse.

Puis les projets sont arrivés, chez les principaux produits, gratuit compris désormais, avec des plafonds plus bas. Un projet attache en permanence des fichiers et des consignes à toutes les conversations ouvertes dedans. Rien de magique : ces éléments sont préchargés sur le plan de travail. C’est la mise en place, au sens de nos cuisines : les fiches et les consignes posées avant chaque service, les mêmes chaque matin. La machine n’a toujours pas de souvenir, mais elle n’ouvre plus la journée les mains vides.

Là, la débrouille est devenue construction ; pour moi, le point zéro. Dans les projets de ChatGPT, avec l’abonnement d’une vingtaine de dollars de l’époque, j’ai posé la base de mon cabinet : une construction organisée, figée, enfin. Quarante ans de métier versés en fichiers ordonnés, écrits en clair : les fondations d’abord, ce que je crois et ce que je refuse ; puis le cadre de travail ; puis les protocoles, domaine par domaine, la cuisine et ses chiffres, la carte et sa lecture, le marché autour, les prix, les travaux, l’accompagnement. Près de quarante pièces, chacune posée sur le plan de travail quand son heure vient. La question d’origine venait de trouver son premier contenant.

Ces pièces, il faut dire comment elles se sont écrites : une méthode, qui m’a pris du temps. Le tâtonnement vérifié. On essaie, on regarde ce qui tient, on refuse de croire la machine sur parole. Ce qui survit à l’essai s’écrit ; ce qui est écrit devient une règle, rejouée à l’essai suivant ; la règle qui tient l’épreuve se fige. Des boucles d’apprentissage internes, grossies par accumulation vérifiée. Cette méthode a grandi au rythme des machines : le chat par tâtonnement, puis le chat par exercice ; le projet par tâtonnement, puis le projet plein, quand on a pu enfin y poser bien davantage. À chaque étage de l’outil, le même geste, sur une surface plus grande.

Ce qu’il a fallu désapprendre : garder le métier dans la tête.

5. Sourcer

Coupée du web, la machine inventait des sources parfaitement plausibles.

Un fil court sous tout ce texte, le plus important peut-être : le sourçage. Les produits ont fini par brancher la machine sur le web : sur demande, un outil part chercher les pages et les pose sur le plan de travail avant qu’elle réponde. Le modèle n’a pas changé de nature, il prolonge toujours ; mais il prolonge désormais des pièces réelles, datées, citables. Travailler pour de vrai avec la machine, c’est renoncer à lui demander ce qu’elle « sait », et l’envoyer chercher. Les rapports officiels, les données publiques, les études, les conférences. Au lieu d’une réponse plausible tirée d’une bibliothèque figée, une statistique construite sur des pièces vérifiables. Le réflexe du tout début (exiger des sources, puis les vérifier soi-même) est devenu, geste après geste, une organisation entière. C’est comme ça qu’une machine qui devine se transforme en machine qui documente.

Pendant que la machine apprend à lire le monde, une autre question grandit : que garde-t-elle de vous ? Trois étages. Le modèle : il ne retient rien. Votre historique : il vit sur les serveurs de la maison, se recharge à la réouverture, et s’efface sur demande, avec un délai d’une trentaine de jours chez plusieurs grands. Et ce que la maison en garde : ça dépend de vos réglages, de son règlement, et parfois d’un juge. Au printemps 2025, dans un procès de presse contre OpenAI, la justice américaine a un temps imposé la conservation de toutes les conversations, y compris supprimées, avant de lever l’obligation à l’automne. « Supprimé » est une promesse du fournisseur ; le droit peut la suspendre.

Reste cette ligne qu’on coche sans la lire : « utiliser mes conversations pour améliorer les modèles ». Concrètement ? Le modèle qui vous parle n’apprend rien, il est figé. Mais vos échanges peuvent être versés à la bibliothèque qui servira à régler son successeur. La mécanique est celle du dressage raconté au début de ce texte : pour apprendre à un modèle à mieux converser, il faut des exemples de vrais dialogues, des questions réelles, des reformulations réelles, des malentendus réels. Vos conversations sont cette matière première, précieuse parce qu’elle s’invente mal. Le gratuit la collecte donc par défaut chez plusieurs acteurs. Fermer le réglage ferme exactement cela : votre prose ne rejoindra pas la bibliothèque du prochain.

Ce qu’il a fallu désapprendre : croire que supprimé voulait dire disparu.

Sources : l’épisode de conservation forcée est documenté, ordonnance du 13 mai 2025 dans le procès du New York Times contre OpenAI (conservation de toutes les conversations, y compris supprimées), obligation levée à effet du 26 septembre 2025 (ordonnance du 9 octobre 2025) ; communication publique d’OpenAI, « Response to NYT data demands ».

6. L’addition

Tout ce que la machine lit et écrit se compte, se borne et se facture. Voici l’addition.

Deux symptômes attendaient encore leur explication : le document qu’on lui confie, lu par bouts ; le quota qui tombe, et les réponses qui deviennent plates, sans prévenir. Leur mécanique est une affaire d’argent.

La machine ne lit pas des mots : elle lit des morceaux, plus petits que le mot, les tokens. Comme une cuisine ne compte pas en plats mais en grammes, l’unité de la maison n’est pas la vôtre. Le document collé dans le chat est découpé en tokens ; tout se compte, se borne et se facture dans cette unité, y compris la surface du plan de travail. S’il n’en lit parfois que des bouts, c’est que le compte s’arrête avant la fin.

Et chaque assiette coûte. Produire une réponse, c’est faire tourner le modèle entier une fois par morceau généré, sur des machines réelles, avec de l’électricité réelle. L’entraînement, c’est construire le restaurant : on paie une fois. L’inférence, c’est chaque assiette qui part : on paie à chaque message, pour toujours. D’où les quotas. D’où aussi un mécanisme peu repéré : au plafond, plusieurs produits gratuits basculent en silence vers un modèle plus petit. Vos réponses plates de fin de session viennent souvent de là.

Pourquoi c’est gratuit, alors ? Le menu découverte : la maison le sert à perte pour que vous preniez vos habitudes chez elle. Le premier moteur est la conversion vers l’abonnement. Le deuxième, vos conversations comme matière du prochain entraînement, selon vos réglages. Le troisième est arrivé : la publicité, lancée début 2026 chez le plus grand acteur, accompagne déjà ses réponses gratuites aux États-Unis. Et la salle regarde ce que vous commandez.

Voilà le heurt, et c’est le mien. Mon cahier des charges disait : quarante ans d’expérience, un métier entier. Le plan de travail offrait : des pages comptées, effaçables, relues à chaque tour, un carnet de notes pour la fiche client, des fichiers préchargés au mieux. Le jour où j’ai compris ces parois, j’ai cessé de me battre contre elles. Ma façon de travailler avec la machine a changé ce jour-là, de fond en comble.

Ce qu’il a fallu désapprendre : croire que gratuit voulait dire sans coût.

Sources : la publicité dans les offres gratuites est annoncée par OpenAI le 16 janvier 2026 (« Our approach to advertising and expanding access ») et déployée aux États-Unis depuis le 9 février 2026, étendue depuis à d’autres marchés ; la personnalisation publicitaire chez Meta AI est effective depuis décembre 2025.

7. Demander

J’avais cessé de me battre contre les parois. Restait à construire avec elles.

Quand on veut vraiment quelque chose de la machine, on cesse de lui parler comme à un devin. Le mécanisme du début commande tout : elle prolonge votre texte. Ce qui améliore sa réponse, c’est ce que votre texte contient. Alors la demande, le prompt comme dit le métier, s’écrit comme une fiche technique. Donner les faits, la situation, les contraintes : chaque fait fourni remplace une devinette. Montrer un exemple du résultat attendu : la machine reproduit les régularités qu’elle voit. Dire la forme voulue, la longueur, le ton. Demander les étapes avant la conclusion : les machines récentes brouillonnent d’elles-mêmes, le geste garde son prix pour rendre le chemin visible, pas seulement l’arrivée. Donner un rôle, enfin, qui règle le registre et l’angle du regard : le relecteur ne lit pas comme le vendeur.

En face, le folklore : les formules magiques, les packs de demandes toutes prêtes qu’on vend à ceux qui débutent. La mécanique les dégonfle d’elle-même. Une demande vaut par le contexte précis qu’elle apporte. Une formule générique contient, par définition, ce que tout le monde y met : rien de vous.

La cuisine m’avait préparé à la deuxième leçon : on n’encombre pas un plan de travail. Dans cette machine, le bavardage est tout sauf neutre. Chaque phrase inutile est lue, calculée, facturée, et brouille la vue sur ce qui compte ; les chercheurs l’ont mesuré, le hors-sujet dégrade la réponse. J’ai appris à nettoyer mes demandes comme on nettoie un poste entre deux services : du signal, pas du bruit. Une consigne par phrase, dire ce qu’on veut, dire ce qu’on refuse, et se taire.

Poser deux fois la même question, recevoir deux réponses différentes : la découverte déroute jusqu’aux plus sérieux. C’est un réglage, pas une panne. La machine tire au sort parmi les suites les plus probables, parce que le texte toujours le plus probable est répétitif et plat ; le hasard y est dosé comme un assaisonnement, le réglage se nomme la température, et il est ouvert d’origine. La conséquence est un geste d’artisan : on ne conclut rien sur un essai. On rejoue, on compare, on garde ce qui tient deux fois. Les fabricants eux-mêmes évaluent leurs machines ainsi, à essais multiples, parce qu’un coup unique ne prouve rien.

Bien demander, c’est le premier geste du métier, et il porte loin. Il bute pourtant sur trois murs. Rien ne dure : la demande la mieux écrite meurt avec la conversation. Tout est borné : quarante ans d’expérience ne tiennent pas sur un plan de travail. Rien n’agit : le chat produit du texte, il ne fait rien. Pour durer, il faut des fichiers. Pour dépasser le plan de travail, il faut un dépôt. Pour agir, il faut autre chose que soi. Les trois réponses sont arrivées, avec un point commun : elles sortent du chat.

Ce qu’il a fallu désapprendre : croire que le secret était dans la phrase.

Sources : la grande synthèse académique du domaine (The Prompt Report, Schulhoff et al., 2024, plus de 1 500 papiers analysés : l’efficacité tient à la structure et au contexte, pas aux formules) ; le rôle règle le ton, pas la justesse (étude systématique de 162 rôles, Zheng et al., 2023-2024) ; le hors-sujet dégrade la réponse (Shi et al., ICML 2023) ; le hasard est choisi pour la qualité du texte (Holtzman et al., ICLR 2020, le papier fondateur de l’échantillonnage moderne) ; les fabricants eux-mêmes évaluent leurs machines à essais multiples (Anthropic, janvier 2026).

8. Durer

Une nouvelle famille d’outils est apparue, et elle a tout changé pour moi : la machine est sortie de la messagerie pour entrer dans le dossier.

Elle lit les fichiers, les écrit, lance des commandes, mène une tâche de bout en bout, sous les yeux de celui qui la dirige. Les grands fournisseurs proposent chacun le leur, sous des formes voisines, du terminal d’informaticien à l’application posée sur le bureau. Le mien s’appelle Claude Code. Le jour où je l’ai ouvert, l’écran a cessé de ressembler à une conversation. C’était un établi. Mes dossiers d’un côté, la machine dedans, et moi au poste de commande.

Le premier fichier de l’atelier tient en un principe : à la racine du dossier vit un texte que la machine relit à chaque démarrage. On y pose les règles une fois : qui elle est dans ce projet, ce qu’elle fait, ce qu’elle refuse, où vivent les choses. Fini de répéter le brief à chaque conversation. C’est le patron qui écrit sa consigne au tableau avant le service : l’équipe change, le tableau reste. Chez moi ce fichier se nomme CLAUDE.md ; la version commune au métier s’appelle AGENTS.md, le mode d’emploi pour agents, un standard que la plupart des outils lisent désormais, quel que soit leur drapeau.

Le fait central de l’atelier, le fabricant du mien l’écrit noir sur blanc : chaque session démarre vide. La machine n’arrive avec rien, l’atelier rouvre nu chaque matin. Ce qui dure, c’est ce qui est écrit dans le dossier : le manifeste qu’elle relit en entrant, les notes qu’elle range en partant, l’index court qui dit où tout se trouve. J’ai appris à fermer une session comme on ferme une cuisine : on range, on consigne, on laisse le poste propre pour celui qui ouvre demain, même si celui qui ouvre demain est la même machine, amnésique. La continuité ne vit pas dans la machine. Elle vit dans le dossier. Le chat est jetable ; les fichiers durent. C’est ainsi que ma maison retient chacun de ses audits, chaque leçon de terrain, chaque règle éprouvée : rien ne repart de zéro, parce que tout est écrit.

Ces fichiers s’écrivent dans une langue commune. Un format de texte brut à peine marqué, inventé voilà une vingtaine d’années pour écrire des pages web sans outillage : lisible tel quel par un humain, structurable par une machine. Le markdown. Les manifestes, les index, les notes de la machine : tout s’écrit là, partout. Un fichier que je peux ouvrir, lire et corriger à la main, et que la machine lit aussi bien. La langue commune de l’homme et de l’outil est du texte nu. Pour quelqu’un dont la pensée est faite de mots, c’était une bonne nouvelle : le système entier s’écrit en clair.

Ce qu’il a fallu désapprendre : croire que le travail vivait dans la conversation.

Sources : le markdown est créé par John Gruber en décembre 2004 ; les outils qui font travailler la machine dans les dossiers arrivent en 2025 (Claude Code en février, disponibilité générale en mai) ; le standard AGENTS.md est publié en août 2025 et versé, avec d’autres briques du domaine, à une fondation neutre sous la Linux Foundation en décembre 2025 ; « chaque session démarre avec une fenêtre de contexte vierge » est la formulation de la documentation officielle d’Anthropic (traduite).

9. Déléguer

Vient le mot que tout le monde emploie et que peu définissent : l’agent.

La recherche web nous avait donné le mot outil, une capacité qu’on branche. Entre l’outil et l’agent, la frontière est nette : l’outil exécute un geste, l’agent conduit la tâche. Un agent perçoit, décide, agit avec ses outils, vérifie le résultat contre le réel, recommence jusqu’au but ou s’arrête pour rendre la main. Cette définition est celle du domaine entier, les fabricants la publient en termes voisins.

Leur conseil commun surprendra ceux qui imaginent des essaims : un seul agent d’abord. Plusieurs agents coûtent un multiple, se marchent dessus, et aident seulement quand la tâche se découpe en pistes vraiment indépendantes. La brigade se mérite : on embauche quand le travail l’exige.

Restait à brancher les agents sur le monde réel : les dossiers, l’agenda, la messagerie, les données. Chaque branchement était un bricolage, jusqu’à ce qu’un standard émerge. Il se nomme le Model Context Protocol, le MCP, et sa propre documentation le compare à la prise USB-C : une façon unique de connecter la machine à des outils et des sources, quel que soit le fabricant. Né chez Anthropic, la maison de mon propre atelier, adopté par ses concurrents directs, puis versé à une fondation neutre pour appartenir à tout le monde. Les rivaux se battent sur tout, sauf sur la prise. Pour l’artisan, ce qu’on construit se branche, et ce qu’on apprend se garde.

Un agent qui lit le web et tient vos dossiers est aussi une cible, et l’enseigner commence par le dire. La menace se nomme l’injection de prompt, et elle passe par les mots : des instructions cachées dans une page ou un document tentent de détourner la mission d’un lecteur trop obéissant. Le problème est structurel, la machine distingue mal ce qu’elle doit lire de ce qu’elle doit faire ; les spécialistes le classent premier risque du domaine, et l’état honnête tient en quatre mots : non résolu, se gère.

Les gestes qui le gèrent sont des gestes de patron : donner peu de clés, séparer ce qui vient du dehors, et garder la signature humaine sur tout ce qui est irréversible. La machine propose, l’homme engage.

Ce qu’il a fallu désapprendre : croire que déléguer, c’était perdre la main.

Sources : les définitions convergentes publiées par les fabricants (Google, septembre 2024 ; Anthropic, décembre 2024 ; OpenAI, 2025) ; le Model Context Protocol est publié par Anthropic le 25 novembre 2024, adopté par OpenAI et Google au printemps 2025, puis versé à l’Agentic AI Foundation (fonds dirigé sous la Linux Foundation) le 9 décembre 2025 ; un système multi-agents consomme environ quinze fois les tokens d’un chat (Anthropic, juin 2025) ; l’injection de prompt est le premier risque du classement OWASP des applications de modèles de langage (liste 2025), et l’image du lecteur trop obéissant décrit un problème documenté comme non résolu par les spécialistes du domaine.

10. Vérifier

Voici le plus important de tout ce que j’ai construit, et la science l’avait mesuré avant moi.

Employer un modèle pour juger les sorties d’un autre porte un nom : LLM-as-a-judge, le modèle pris pour juge. Les chercheurs ont mesuré ses défauts : le biais de position (la première présentée gagne), le biais de verbosité (la plus longue gagne), et surtout le biais d’auto-préférence, self-preference bias : un modèle note mieux ce qu’il a écrit lui-même, et plus il reconnaît sa propre écriture, plus il l’aime. Valider demande un regard venu d’ailleurs. Gödel l’avait établi pour les systèmes formels près d’un siècle avant nos machines : un système cohérent ne démontre pas sa propre cohérence de l’intérieur.

J’ai donc construit un contradicteur. La pratique se nomme la vérification adverse : une autre instance, séparée, briefée pour contredire, qui attaque ce que la première affirme, fait par fait, source par source. Ce texte même est passé sous ce regard : chaque marche a été examinée par l’Expert de série, présenté à la première marche, qui a bloqué des affirmations, exigé des dates, dégonflé des simplifications trop belles. Ce que vous lisez a survécu à un agent briefé pour le démolir.

Reste le paradoxe, et il est réel : ce contradicteur, je l’ai construit avec le même modèle. Le même moteur des deux côtés de la table. Les études sont formelles : même séparé, un modèle reconnaît sa patte jusque dans les textes d’une autre instance.

Ce qui change la donne est ailleurs. D’abord la tâche : le contradicteur confronte chaque affirmation à des pièces extérieures, sources, dates, documents ; le biais mesuré porte sur le jugement d’appréciation, la vérification sur pièces lui laisse peu de prise. Ensuite la consigne : chercher la faute est un autre métier que donner son avis. En cuisine, le cuisinier goûte son plat, bien sûr ; mais l’assiette part seulement après le palais d’un autre au passe, même s’il sort de la même école. Le paradoxe garde pourtant sa part de vérité : deux instances du même moteur partagent des angles morts. C’est pourquoi le dernier regard reste dehors, chez le patron. Gödel tient jusqu’au bout : la validation finale vient de l’extérieur du système.

Alors, la question d’origine. Quarante ans d’expérience sont entrés dans ma maison, construite autour de la machine : des fichiers en clair qui durent, un manifeste qui fixe les règles, des agents bornés qui conduisent chacun leur tâche, un vérificateur qui contredit, une prise qui branche le tout sur le réel, et un patron qui goûte, tranche et signe. Au centre, un modèle qui ne retient rien, invente avec aplomb et se préfère lui-même. Autour, une organisation qui retient, vérifie et apprend. La machine n’est pas devenue experte. La maison, si.

Ce qu’il a fallu désapprendre : croire que l’expérience entrerait dans la machine.

Sources : les biais du modèle pris pour juge sont mesurés par Zheng et al. (NeurIPS 2023 : biais de position, de verbosité, complaisance envers ses propres réponses) ; le biais d’auto-préférence et son lien à l’auto-reconnaissance sont établis par Panickssery et al. (avril 2024 : plus un modèle reconnaît ses propres textes, plus il les favorise, y compris d’une instance à l’autre) ; le théorème invoqué est le second théorème d’incomplétude de Gödel (1931), cité comme analogie bornée aux systèmes formels.