Agentic Experience : le journal des erreurs des agents est le plan de votre CLI

J’ai un agent de code —Claude Code— qui interagit avec Linear, mon gestionnaire de tickets, environ 800 fois par mois : il liste des tâches, crée des tickets, change des statuts, ajoute des commentaires. J’ai analysé 165 de ses sessions et compté plus de 500 erreurs et plus de 370 tentatives réitérées. Aucun de ces échecs n’était dû à une erreur de l’API de Linear. Toutes ces erreurs étaient liées à l’interface : l’agent communiquait avec la ligne de commande, mais cette dernière ne comprenait pas sa demande. ...

22 mai 2026 · Fernando

Bridge Async Swift vers Sync C : quatre fonctions pour utiliser le LLM d'Apple depuis n'importe quel langage

Le framework Foundation Models d’Apple (macOS 26) expose un LLM d’environ 3 milliards de paramètres qui fonctionne directement sur l’appareil, gratuitement, sans clé API. Voici le problème : il ne parle que Swift. Et pas n’importe quel Swift — Swift async. Votre outil tourne avec Python ? Aucun binding. Avec Rust ? Rien non plus. Avec un script shell ? Pas possible. Le LLM le moins cher du marché (gratos, littéralement) est enfermé derrière deux barrières : le langage et le modèle de concurrence. ...

5 avril 2026 · Fernando

Je paie $15 par million de tokens pour écrire 'fix: typo'

Hier, j’ai écrit un message de commit avec Claude Code. Le diff contenait un changement d’une seule ligne : une faute de frappe dans un commentaire. Claude Opus a analysé le diff, réfléchi pendant deux secondes, et généré fix: correct typo in auth comment. Pour cela, il a consommé environ 800 tokens en entrée et 30 en sortie, à $15 et $75 par million respectivement. Coût : une fraction de centime. Mais multipliez cela par 40 commits par jour, 250 jours par an, dans une entreprise comptant 200 développeurs utilisant les coding agents, et cette fraction de centime se transforme en milliers de dollars dépensés pour réaliser une tâche intellectuelle équivalente à appliquer des pansements. ...

5 avril 2026 · Fernando

TurboQuant, un mois plus tard : implémentations, controverse et ce qui marche vraiment

Google a publié TurboQuant le 24 mars. En 48 heures, le papier avait 575 points sur Hacker News, les actions de Micron chutaient de 900 millions de dollars, et TechCrunch le comparait à l’algorithme de Pied Piper de Silicon Valley. Un mois plus tard, le brouillard du battage médiatique s’est suffisamment dissipé pour répondre aux seules questions qui comptent : est-ce que ça marche ? Puis-je l’utiliser aujourd’hui ? Et celle que personne ne veut poser : est-ce vraiment nouveau ? ...

5 avril 2026 · Fernando

Ton Mac dispose d'un LLM gratuit et tu ne l'utilises pas

Tu paies entre 20 et 200 dollars par mois pour avoir accès à des LLM. Claude, GPT, Gemini, peu importe. Et la majorité des requêtes que tu envoies depuis tes scripts et outils de développement ressemblent souvent à ceci : “Classe ceci en une des cinq catégories suivantes.” “Donne un nom à cette variable.” “Identifie si ce commit est un correctif, une fonctionnalité ou un refactoring.” “Résume ce bloc de texte en deux phrases.” Pendant ce temps, ton Mac avec Apple Silicon possède un modèle de langage de 3 milliards de paramètres, intégré directement dans le système d’exploitation, sans frais, sans réseau, sans clé API, sans latence de réseau. Et probablement, tu ne l’as jamais utilisé pour quoi que ce soit. ...

4 avril 2026 · Fernando

150 lignes d'excuses supprimées

TL;DR : Mon agent IA avait un fichier d’instructions de 246 lignes pour gérer les issues dans Linear. 150 de ces lignes étaient des contournements : UUIDs codés en dur, fallbacks vers curl, notes de « la CLI ne supporte pas X ». Je ne les ai pas réécrites — j’ai construit un outil qui les a rendues inutiles. Ces 150 lignes sont maintenant à zéro. As-tu déjà écrit un document d’instructions si long que sa propre longueur démontre que quelque chose cloche ? ...

26 mars 2026 · Fernando

Madness Driven Design : Don Quijote, Sancho Panza et ton copilote IA

TL;DR : Un LLM est comme Don Quijote — tu ne peux pas le corriger, il est stochastique par nature. La solution n’est pas de guérir le fou, mais de placer un Sancho Panza déterministe à ses côtés. MDD se compose de deux couches : d’abord, tu étudies ses erreurs pour concevoir des outils qui les absorbent, puis tu le testes avec ces outils pour vérifier que tu n’as rien laissé passer. Conçois pour la folie, pas contre elle. ...

26 mars 2026 · Fernando

Pourquoi la sortie de mon CLI n’est pas en XML (et comment j’ai réinventé TOON sans le savoir)

TL;DR : Quand votre principal consommateur est un LLM, XML et JSON gaspillent des jetons en répétant la structure à chaque élément. Un format compact et positionnel réduit la consommation de 50 %. Il s’avère que cette idée avait déjà un nom : TOON (Token-Oriented Object Notation). Même pression sélective — jetons précieux et clés répétitives — même solution. Anthropic utilise XML pour tout. Leurs system prompts sont enveloppés dans <instructions>, leurs exemples dans <example>, leurs outils dans <function>. Si vous travaillez avec Claude, vous vivez entouré de balises. ...

26 mars 2026 · Fernando

Programmation Adversariale : quand ton copilote IA invente une API

TL;DR : Ton IA va inventer des champs d’API qui semblent parfaits mais qui n’existent pas. La solution n’est pas de croiser les doigts pour qu’elle tombe juste : c’est de télécharger le schéma réel avant d’écrire, capturer des réponses réelles comme fixtures, et séparer fetch du traitement pour pouvoir tester hors réseau. Programmation adversariale : programme en supposant que ton copilote ment. As-tu déjà écrit du code pour une API et tout compilait, les tests passaient, la logique semblait correcte… mais quand tu te connectes à l’API réelle, plus rien ne fonctionne ? ...

26 mars 2026 · Fernando

Transforme et vous vaincrez : comment Google compresse les LLMs 6x en changeant de coordonnées

Multiplier est difficile. Additionner est facile. Tous les écoliers savent cela dès le primaire. Ce qu’ils ignorent, cependant, c’est que les logarithmes existent précisément pour exploiter cette asymétrie : transformer une multiplication en une addition, travailler dans un monde plus simple, puis annuler la transformation. Le résultat est correct et l’effort, une fraction. Ce modèle — transformer un problème dans un espace où le résoudre est trivial, le résoudre, puis revenir — est l’un des principes les plus puissants de toute l’ingénierie. La FFT le fait avec les signaux. Les logarithmes le font avec les produits. Et aujourd’hui, Google vient de publier un article scientifique qui l’applique à la compression des modèles de langage. ...

25 mars 2026 · Fernando