Huit repos, un projet, 87 runs
Huit repos GitHub apparaissent sur toutes les listes d'incontournables Claude Code ce mois-ci : Chisle, Ouroboros, Reticle, Caliper, Anti-Slop, UI Skills, img2threejs et FWC SwiftUI Skills. Ensemble, ils cumulent plus de 37 000 étoiles. Ces listes disent ce que chaque repo promet et comment l'installer. Personne ne les installe tous ensemble pour mesurer.
Alors les huit ont atterri sur un seul vrai projet, une appli React avec 111 tests qui passent. L'un d'eux s'est écrit tout seul dans les réglages de neuf autres outils IA de la machine. Un autre n'a jamais tourné du tout, à cause d'une seule ligne dans son code source. Et trois d'entre eux ont connecté un serveur à Claude Code qui n'a jamais été appelé, pas une seule fois, en 63 runs.
| Le test | Valeur |
|---|---|
| Repos installés | 8 |
| Runs totaux | 87 |
| Dépense totale | environ 6 $ |
| Projet | 1 appli React, 111 tests qui passent |
| Modèle | 1 |
| Durée | 1 jour |
Trois questions guident la suite : ce que chaque repo coûte au démarrage, ce qui change vraiment dans le résultat, et lesquels valent la peine d'être gardés.
Ce que chacun coûte avant de taper
Le coût de démarrage, c'est ce que Claude Code charge dans le contexte avant votre premier message. Sur un projet vide, c'est environ 17 000 tokens, et vous les payez à chaque tour. Pour mesurer une installation, Claude a reçu la consigne de répondre en un mot, et la facture a été relevée. L'unité, c'est le token, pas le dollar : deux runs identiques peuvent varier d'un facteur 10 en prix, juste à cause du cache.
| Installation | Tokens de démarrage ajoutés |
|---|---|
| Chisle | environ 3 500 |
| Ouroboros | environ 1 600 |
| Reticle | environ 900 |
| img2threejs (fichier d'instructions de 33 Ko) | 107 |
| Anti-Slop (skill d'appoint) | 95 |
| UI Skills | 37 |
| Tout le reste | 100 à 300 chacun |
| Les huit ensemble | moins de 7 000 |
Deux des huit ne s'adressent pas du tout à un développeur web. img2threejs transforme une photo en scène 3D, et FWC SwiftUI Skills est pour les applis Apple. Seul leur coût a été mesuré. Le skill 3D embarque un fichier d'instructions de 33 kilooctets et ne coûte pourtant que 107 tokens, car seule la description d'un skill se charge tant qu'on ne l'appelle pas.
Les serveurs sont devenus bon marché eux aussi. Claude Code ne charge désormais que les noms des outils d'un serveur et va chercher les détails à la demande. Ça fait environ 45 tokens par outil, quoi que fasse l'outil. Avec les huit installés, les coûts s'additionnent, tout simplement. Rien ne se multiplie.
Claude Code a une commande qui projette ce coût pour un plugin, et elle compte les hooks comme gratuits. Pour un plugin utilisé quotidiennement sur cette machine, elle a projeté environ 540 tokens. La mesure réelle était de 744, parce que son hook de démarrage imprime directement dans la session.
Le démarrage n'est pas là où ces repos deviennent coûteux. Ce sont les tours qui coûtent.
Mêmes tâches, avec et sans
Le benchmark porte sur trois tâches qu'un développeur confierait vraiment : un bug dans la construction d'une adresse web, une fonctionnalité qui affiche un temps de lecture, et un compteur de caractères sur un formulaire. Chaque tâche a tourné avec un repo installé, avec les huit, et sans aucun, trois runs à chaque fois. Le juge est un test que l'agent ne voit jamais, plus la suite de tests du projet, plus le vérificateur de types. Chaque run a utilisé la même liste fixe d'outils autorisés, sans contournement des permissions.
| Résultat | Valeur |
|---|---|
| Runs de tâches | 63 |
| Réussites | 63 |
| Nouvelles erreurs de type | 0 |
| Appels aux trois serveurs connectés | 0 |
| Correction de bug, référence | 7 tours, 27 secondes |
| Tâche formulaire, référence | 22 tours, environ 1 minute |
Rien n'a fait échouer Claude sur une tâche, et rien ne lui a fait réussir une tâche qu'il aurait ratée sans ça.
Trois de ces repos connectent un serveur plein d'outils. En 63 runs, Claude a appelé ces outils zéro fois. Y compris la tâche formulaire, écrite justement pour que les conseils de design et les tests visuels aient de quoi s'occuper. Pour être honnête, deux d'entre eux n'ont jamais eu leur vrai travail à faire. Reticle a besoin d'un navigateur couplé à votre appli en cours d'exécution, et ce couplage a planté. Ouroboros a besoin d'une configuration à l'échelle de toute la machine, et il ne l'a pas reçue.
Le bruit est énorme. Même prompt, même installation : un run a écrit 4 300 tokens, un autre 7 100. Seuls deux résultats ont dépassé leur propre bruit, tous deux sur la tâche la plus courte. Une seule démo avant-après ne prouve rien.
Les 52% de Chisle, sur du vrai code
Chisle est un plugin de compression de sortie, et le seul des huit qui promet un chiffre : son benchmark annonce que votre facture tombe à 52 %. Sur les trois tâches, la sortie est arrivée à 94 % de la référence. Le README l'explique dans ses propres mots : ces chiffres viennent de prompts uniques sans outils, pas du coût d'une session entière.
| Mesure | Valeur |
|---|---|
| Promesse benchmark de Chisle | sortie à 52% |
| Chisle sur les trois tâches | sortie à 94% de la référence |
| Le plugin de concision au quotidien, mêmes tâches | 113%, dans le bruit |
| Une correction de bug : tokens lus | 95 000 |
| Une correction de bug : tokens écrits | 1 700 |
Dans une vraie session de code, la sortie est la petite partie de la facture. Chisle charge ses règles au démarrage et agrafe un rappel à chaque prompt que vous envoyez, si bien que ses runs coûtent plus cher que la référence sur deux tâches sur trois. Les règles pèsent plus lourd que les mots qu'elles économisent. Son compresseur pour la sortie des outils a tourné à chaque session et n'a jamais enregistré la moindre économie.
Aucun des deux plugins n'a économisé quoi que ce soit de mesurable. Un utilisateur de Chisle a constaté la même chose sur 173 sessions, et l'auteur dit que ce bug est corrigé. Pour être juste, Chisle publie lui-même ses pertes, et sa gestion des fichiers est soigneusement blindée.
La règle à en tirer : un plugin qui parle à chaque tour est le genre le plus coûteux.
Les installs qui sortent du projet
La portée d'une installation, c'est jusqu'où la configuration d'un repo s'étend au-delà du dossier où vous l'avez lancé. Tout ici a été installé à l'intérieur d'un seul dossier, exprès, pour que rien ne touche au reste de la machine.
La commande de configuration de Reticle avait d'autres projets. Son propre journal dit qu'elle s'est enregistrée auprès de 8 autres agents : VS Code, Copilot, Warp, Kiro, Amazon Q, Cline, Amp, et un de plus. Dans Gemini, elle s'est auto-approuvée à l'avance. Dans les réglages Claude Code, elle a ajouté une règle qui approuve ses propres outils. Rien de tout ça n'est caché, c'est bien là dans le code source, l'installeur annonce haut et fort ce qu'il fait, et il fournit une commande de désinstallation. Mais un seul indicateur "oui" lui a été donné, pour un seul projet.
Caliper était censé être l'outil de mesure. Son harnais lance Claude avec toutes les vérifications de permission désactivées, sans option pour changer ça, et il copie vos identifiants de connexion dans chaque run de test. Il n'a jamais été exécuté ; un lanceur maison l'a remplacé.
| Repo | S'installe proprement dans un projet ? | Notes |
|---|---|---|
| Anti-Slop | Oui | Copie des fichiers et rien d'autre |
| UI Skills | Oui | Bibliothèque de skills distante |
| img2threejs | Oui | Un skill |
| FWC SwiftUI Skills | Oui | Texte brut |
| Reticle | Partiellement | Enregistré auprès de 8 autres agents, règle auto-approbatrice |
| Chisle | Non | Global uniquement, vérifie les mises à jour au démarrage, sauvegarde la sortie brute des outils sur disque |
| Ouroboros | Non | À l'échelle de la machine uniquement, remonte l'usage par défaut, l'installeur peut faire passer un script d'internet directement dans votre shell |
| Caliper | Jamais exécuté | Vérifications de permission désactivées, identifiants copiés dans chaque run |
Rien de tout ça n'est un malware. C'est de la commodité qui suppose que vous voulez l'outil partout. Ouvrez trois choses avant toute installation : les hooks, le script d'installation, et la config du serveur.
Ce qui se passe quand tout s'empile
Empiler, ça veut dire les huit installés ensemble : aucun plantage, aucune erreur, et les coûts s'additionnent presque exactement. Un piège a coûté une heure. Dans des runs scriptés, un serveur de projet attend une approbation que personne ne peut donner, si bien qu'il paraît presque gratuit. Chaque chiffre de serveur ici a été remesuré après correction de ce piège.
Les hooks sont l'endroit où les repos se rencontrent. Un hook est un script que Claude Code exécute à un moment précis, et tout ce qu'il imprime peut atterrir devant le modèle. Avec trois de ces outils branchés, trois scripts se déclenchent au démarrage et trois autres à chaque prompt. Une phrase ordinaire tapée est arrivée au modèle avec deux notes attachées : l'une lui disant d'écrire de façon concise, l'autre exigeant une étape de configuration impossible à terminer à l'intérieur d'un projet. Cette seconde note revient à chaque prompt contenant l'un de ses mots-clés.
Les noms d'outils ne peuvent pas entrer en collision, parce que chaque serveur préfixe le sien. Pour les hooks, la documentation le confirme : quand plusieurs hooks ajoutent du contexte, Claude reçoit toutes les valeurs.
Une étude de mai 2026 a mesuré ce qu'un gros tas de skills fait à un agent. Avec environ 200 skills, le taux de réussite a chuté jusqu'à 21 %, et l'essentiel de cette perte vient de l'agent qui choisit un skill qui ressemble au bon plutôt que le bon. Huit repos, c'est 10 skills, loin de ce chiffre. Les gens qui en ont des dizaines d'installés, eux, en sont proches.
Celui qui a changé le code
Anti-Slop est un jeu de règles de lint que vous copiez dans votre projet, pas un plugin. Il n'y a pas de paquet à installer ; l'auteur veut que vous copiiez les règles et les modifiiez. Un linter lit votre code en dehors du modèle, donc il ne coûte aucun contexte : 95 tokens pour son skill d'appoint, et rien par tour.
Dans la tâche formulaire, Claude devait faire passer un nouveau champ à travers un composant. Il a copié la ligne du dessus, cast de type non sûr inclus. Anti-Slop l'a signalé, trois runs sur trois. C'est le genre de chose qu'un relecteur laisse passer, parce que ça ressemble à ses voisins.
| Constat Anti-Slop | Valeur |
|---|---|
| Cast de type non sûr signalé | 3 runs sur 3 |
| Ligne vide manquante signalée dans une fonction correcte de six lignes | 2 runs sur 3 |
| Constats sur le projet non touché | 109 |
| Part venant de deux règles de style | 83% |
| Autres règles | 16 |
Le constat sur la ligne vide relève du goût, pas d'un bug, et le linter ne lit qu'un fichier à la fois. Le coût se voit dès le premier jour : tranchez sur ces deux règles de style avant de juger les 16 autres. Un piège à noter : les règles sont livrées en modules, donc votre projet doit lui aussi se déclarer module, sinon le linter plante.
UI Skills est le moins cher à garder : 37 tokens pour une bibliothèque distante de skills de design, et zéro appel dans ces runs. Elle comptait 18 liens morts en juillet. Les 300 ont tous été testés le matin de la vidéo, et aucun n'est cassé.
Ce que je garde, et comment auditer votre config
Huit repos triés. On s'attendait à trois survivants. Les données en donnent un qui l'a mérité, et trois qu'on peut garder gratuitement.
| Repo | Verdict |
|---|---|
| Anti-Slop | Mérité : a attrapé une vraie erreur à chaque fois pour presque rien |
| UI Skills | Gratuit à garder : 37 tokens, n'entre en collision avec rien |
| img2threejs, FWC SwiftUI Skills | Gratuits à garder si vous comptez les appeler un jour : quelques centaines de tokens à eux deux |
| Chisle | A coûté plus qu'il n'a économisé sur du vrai travail de code |
| Caliper | N'a jamais tourné |
| Reticle, Ouroboros | Veulent toute la machine, jamais vus faire leur vrai travail, donc pas de verdict sur leur utilité |
Le propre mainteneur d'Ouroboros compte environ 40 % de ses runs en échec.
Les limites comptent : un projet React, un modèle, trois tâches, trois runs chacune. Avec un bruit aussi large, les petits effets sont invisibles. Ce que les données tranchent, c'est que le plancher est haut. Claude a réussi toutes les tâches avec ou sans ces outils, et les outils qui attendent dans le contexte pour être appelés ne le sont, la plupart du temps, pas. Il leur faut un workflow qui va les chercher.
Vous pouvez auditer votre propre config en deux minutes. Une commande montre ce qui est chargé en ce moment. Une autre projette le coût d'un plugin, et rappelez-vous qu'elle compte les hooks comme gratuits. Une autre rapporte ce que coûte chaque skill et à quelle fréquence il est utilisé. Et avant toute installation, ouvrez les hooks, le script d'installation, et la config du serveur.
AIDive