Agentic Experience: o log de erros do agente é o plano da sua CLI

Eu tenho um agente de código —Claude Code— que interage com o Linear, meu gerenciador de incidentes, cerca de 800 vezes por mês: lista tarefas, cria incidentes, altera estados, comenta. Eu revisei 165 de suas sessões e contei mais de 500 erros e mais de 370 tentativas de correção. Nenhum desses casos foi causado por falhas na API do Linear. Todos foram erros de interface: o agente conversava com a linha de comando e a linha de comando não entendia. ...

22 de maio de 2026 · Fernando

Bridgeando async Swift para sync C: quatro funções para usar o LLM da Apple a partir de qualquer linguagem

O framework Foundation Models da Apple (macOS 26) expõe um LLM de ~3B parâmetros que roda on-device, de graça, sem necessidade de API key. Mas tem um problema: ele só trabalha com Swift. E não qualquer Swift — Swift async. Seu tooling está em Python? Não tem binding. Em Rust? Também não. Um script de shell? Sem chance. O LLM mais barato do mundo (literalmente gratuito) está preso atrás de duas barreiras: o idioma e o modelo de concorrência. ...

5 de abril de 2026 · Fernando

Estou pagando $15 por milhão de tokens para escrever 'fix: typo'

Ontem, escrevi uma mensagem de commit com o Claude Code. O diff era uma alteração de uma linha: um erro de digitação em um comentário. Claude Opus leu o diff, pensou por dois segundos e gerou fix: correct typo in auth comment. Para isso, consumiu cerca de 800 tokens de entrada e 30 de saída, a $15 e $75 por milhão, respectivamente. Custo: uma fração de centavo. Mas multiplique isso por 40 commits por dia, 250 dias por ano, em uma empresa com 200 desenvolvedores usando agentes de codificação, e a fração de centavo se transforma em milhares de dólares gastos em uma tarefa intelectual equivalente a colocar band-aids. ...

5 de abril de 2026 · Fernando

TurboQuant, um mês depois: implementações, controvérsia e o que realmente funciona

O Google publicou o TurboQuant em 24 de março. Em 48 horas o paper tinha 575 pontos no Hacker News, as ações da Micron caíram 900 milhões de dólares, e a TechCrunch o comparava com o algoritmo da Pied Piper de Silicon Valley. Um mês depois, a névoa do hype se dissipou o suficiente para responder as únicas perguntas que importam: funciona? Posso usar hoje? E a que ninguém quer fazer: é realmente novo? ...

5 de abril de 2026 · Fernando

Seu Mac tem um LLM gratuito e você não está usando

Você está pagando entre 20 e 200 dólares por mês para acessar LLMs. Claude, GPT, Gemini, o que seja. E a maioria das consultas feitas a partir de seus scripts e ferramentas de desenvolvimento é uma variação disto: “Classifique este erro em uma dessas cinco categorias.” “Dê um nome para essa variável.” “Diga se este commit é um fix, feat ou refactor.” “Resuma este bloco de texto em duas frases.” Enquanto isso, seu Mac com Apple Silicon tem um modelo de linguagem com 3 bilhões de parâmetros, integrado ao sistema operacional, sem custo, sem necessidade de conexão à internet, sem chave de API e sem latência de rede. E provavelmente você não está aproveitando isso. ...

4 de abril de 2026 · Fernando

150 linhas de desculpas eliminadas

TL;DR: Meu agente de IA tinha um arquivo de instruções com 246 linhas para gerenciar issues no Linear. Dentre elas, 150 eram gambiarras: UUIDs hardcoded, alternativas com curl, notas explicando “a CLI não suporta X”. Em vez de reescrevê-las, criei uma ferramenta que tornou essas linhas desnecessárias. Agora, essas 150 linhas se reduziram a zero. Você já escreveu um documento de instruções tão longo que a própria extensão dele é prova de que algo está errado? ...

26 de março de 2026 · Fernando

Madness Driven Design: Don Quijote, Sancho Panza e seu copiloto IA

TL;DR: Um modelo LLM é como Don Quijote — você não pode curá-lo, ele é estocástico por natureza. A solução não é corrigir o louco, mas colocar um Sancho Panza determinista ao lado. MDD tem duas camadas: primeiro você estuda os erros que ele comete para projetar ferramentas que os absorvam, e depois o solta com essas ferramentas para garantir que nenhuma brecha foi deixada. Projete para a loucura, não contra ela. ...

26 de março de 2026 · Fernando

Por que a saída da minha CLI não é XML (e como acabei reinventando o TOON sem saber disso)

TL;DR: Quando seu consumidor principal é um LLM, XML e JSON desperdiçam tokens repetindo estrutura em cada elemento. Um formato posicional compacto reduz o consumo em 50%. Descobri que essa ideia já tinha nome: TOON (Token-Oriented Object Notation). Mesma pressão seletiva — tokens caros e chaves repetitivas — mesma solução. Anthropic usa XML para tudo. Seus system prompts são envoltos em <instructions>, seus exemplos em <example>, suas ferramentas em <function>. Quem trabalha com o Claude está cercado por tags. ...

26 de março de 2026 · Fernando

Programação Adversarial: quando seu copiloto IA inventa a API

TL;DR: Sua IA vai inventar campos de API que parecem perfeitos, mas não existem. A solução não é cruzar os dedos para que funcione: é baixar o schema real antes de escrever o código, capturar respostas reais como fixtures e separar o fetch do processamento para poder testar sem dependência de rede. Programação adversarial: programe assumindo que seu copiloto mente. Você já escreveu código para uma API, tudo compilou, os testes passaram, a lógica fazia sentido… e ao conectar com a API real, nada funcionava? ...

26 de março de 2026 · Fernando

Transforme e conquiste: como o Google comprime LLMs 6x mudando de coordenadas

Multiplicar é difícil. Somar é fácil. Todo mundo aprende isso na escola. O que quase ninguém sabe é que os logaritmos existem precisamente para explorar essa assimetria: eles transformam uma multiplicação em uma soma, processam o problema no mundo fácil e depois desfazem a transformação. O resultado é correto. O esforço, muito menor. Esse padrão — transformar o problema para um espaço onde resolvê-lo seja trivial, resolver e voltar ao original — é um dos mais poderosos em toda a engenharia. A transformada FFT faz isso com sinais. Os logaritmos fazem isso com produtos. Agora, o Google acaba de publicar um artigo mostrando como fazer isso com a compressão de modelos de linguagem. ...

25 de março de 2026 · Fernando