TL;DR: Depois de 165 sessões com Claude Code e 27 com Codex CLI, o padrão é claro: Claude para o trabalho interativo em que você precisa pensar em voz alta, Codex para tarefas autônomas que você delega e esquece. Não é sobre qual é melhor, mas sobre quando usar cada um. Meus dados mostram que a combinação é mais eficiente do que qualquer um isoladamente.
São nove da manhã, café na mão, e eu tenho uma ideia ainda meio-formada sobre como reestruturar um módulo. Não sei exatamente o que quero. Só sei que o estado atual não me agrada.
Abro o Claude Code.
Não porque ele seja “o melhor” — mas porque preciso pensar em voz alta com alguém que compreenda o contexto. Digo: “esse serviço tem muitas responsabilidades, me ajude a dividi-lo”. E começa o diálogo. Ele propõe uma separação, discutimos, peço que explore outra opção, ele me mostra o diff antes de alterar qualquer coisa. É uma conversa.
Três horas depois, o módulo está dividido, os testes passam e o design melhorou. Mas já usei 40% da cota. E agora tenho uma lista de tarefas mecânicas que surgiram: atualizar os testes de integração, limpar imports não utilizados, reorganizar um diretório.
Abro o Codex.
Passo a tarefa, digo para ele trabalhar no modo autônomo, e vou almoçar.
Os dados que revelaram o padrão
Passei meses monitorando meu próprio uso com um aplicativo na barra de menus que registra sessões, tokens e horas. Eis o que os números mostram:
Claude Code: 165 sessões, 160.893 mensagens, 28.052 tool calls. Modelos usados: Opus 4.5 e Opus 4.6. 5,6 bilhões de tokens lidos do cache.
Codex CLI: 27 sessões. Modelo: GPT-5.4. Modo danger-full-access, política de aprovação never.
O que mais me surpreendeu foi a distribuição horária do Claude Code:
09:00 1 ▏
10:00 5 ██
11:00 10 ████▌
12:00 14 ██████▎
13:00 7 ███
14:00 16 ███████▏
15:00 21 █████████▍
16:00 15 ██████▋
17:00 18 ████████
18:00 13 █████▊
19:00 14 ██████▎
20:00 9 ████
21:00 10 ████▌
22:00 8 ███▌
70% das minhas sessões com Claude Code acontecem à tarde. Apenas 22% são pela manhã.
Quando vi isso, pensei que minha tese de “Claude de manhã” não se sustentava. Mas ao analisar o quê eu fazia em cada período, tudo fez sentido.
A manhã é para explorar, a tarde para executar
As sessões matutinas com Claude Code são poucas, mas longas. São sessões de design: “como isso deveria funcionar?”, “revise este plano”, “proponha alternativas”. São conversas de ida e volta onde mudo de ideia três vezes antes de decidir.
As sessões à tarde são mais curtas e em maior número. Implementar o que foi decidido pela manhã. Corrigir bugs. Ajustar testes. Trabalho onde a direção já está definida e só falta executar.
E é aí que entra o Codex.
Por que Codex para o trabalho autônomo
Codex CLI com GPT-5.4 em modo approval_policy = "never" é, para simplificar, um agente que você solta sem pedir licença pra nada. Ele lê sua base de código, executa comandos, modifica arquivos. Sem diálogo.
Isso assusta se você usá-lo para design — justamente porque ele não pergunta: “tem certeza disso?”. Mas é exatamente o que você quer para tarefas bem definidas:
- “Adicione testes unitários para todos os métodos públicos deste módulo.”
- “Reorganize estes arquivos seguindo a estrutura descrita em
ARCHITECTURE.md.” - “Revise este
plan.mde procure falhas.”
O segredo é que a tarefa precisa ser completa e verificável. Se você diz “melhore o desempenho”, ele vai fazer algo. Mas você não sabe se esse algo é o que precisava. Se você diz “reduza o tempo desta consulta de 200ms para menos de 50ms e adicione um benchmark que confirme isso”, pode ir almoçar tranquilo.
O turno da tarde: delegue e esqueça
Meu fluxo real nas últimas semanas:
09:00–13:00 — Claude Code interativo. Design, exploração, decisões de arquitetura. É minha sessão de “pensar acompanhado”. Gasto entre 30% e 50% da cota de Claude aqui.
13:00–14:00 — Pausa. Anoto as tarefas mecânicas que surgiram pela manhã.
14:00–15:00 — Lanço o Codex com as tarefas do meio-dia. Modo autônomo. Enquanto isso, começo outro trabalho (ou continuo com o Claude Code, que já começa a recuperar cota).
15:00 em diante — Revisão do que o Codex fez. Caso precise iterar, uso o Claude para revisão de código, já que ele fornece um feedback qualitativo melhor. As tarefas pendentes executo com o Claude no modo de implementação (sessões curtas e diretas).
Atenção: não é que o Codex seja pior pela manhã, nem o Claude pior à tarde. É que o tipo de trabalho muda ao longo do dia, e cada ferramenta funciona melhor para cada situação.
O que os benchmarks dizem (e o que não dizem)
Os comparativos públicos mostram que o Codex lidera no Terminal-Bench 2.0 (77,3% contra 65,4% do Claude Code). Mas em avaliações cegas de qualidade de código, os desenvolvedores preferem o código do Claude em 67% dos casos.
Ou seja: o Codex é melhor fazendo coisas no terminal. O Claude é melhor escrevendo código elegante. Eles não competem — se complementam.
Um dado que me surpreendeu: o Claude Code consome cerca de 4 vezes mais tokens por tarefa. Em uma assinatura Max, isso significa que a cota se esgota mais rápido. Combinar o Claude para o que requer qualidade com o Codex para o que demanda volume é pura gestão de recursos.
A regra que sigo
Antes de abrir qualquer um dos dois, me faço a seguinte pergunta:
“Eu vou mudar de ideia no meio da tarefa?”
- Se a resposta for sim → Claude Code. Preciso de diálogo, ida e volta, “espera, melhor assim”.
- Se a resposta for não → Codex. A tarefa está definida, os critérios de sucesso já claros — então que ele faça o trabalho.
É a mesma lógica que você aplicaria com pessoas. Para o colega com bom senso, você pede conselho. Para o rápido e confiável, delega a execução. Não faz sentido pedir conselhos ao executor ou delegar ao conselheiro.
A cota como recurso compartilhado
Uma vantagem inesperada de usar dois agentes: a cota de cada um é independente. Enquanto o Claude recupera cota após uma manhã intensa, o Codex pode estar trabalhando sem consumir um único token da Anthropic. E vice-versa.
No meu uso diário — cerca de 4.500 mensagens em média no Claude Code — a cota começa a apertar por volta das 14:00 se minha manhã foi produtiva. Ter o Codex como segundo agente transforma essa limitação em um não-problema.
Não é trapaça. É diversificar fornecedores. O mesmo que você faria com CDNs ou bancos de dados.
O que ainda não funciona (por enquanto)
A transição entre os dois ainda é manual. Abro um terminal, lanço o Codex e passo o contexto copiando do outro. Não há um protocolo padrão para “ei Claude, passe esta tarefa ao Codex com todo o contexto”.
Eles também não compartilham memória. O que o Claude sabe sobre seu projeto (via CLAUDE.md, memory/, skills) precisa ser replicado em AGENTS.md e nas instruções do Codex. Duas fontes de verdade. Dois lugares para atualizar.
Além disso, o Codex, por ser mais agressivo com permissões por padrão, às vezes exagera. Já tive sessões em que ele reorganizou quase todo o projeto sem que eu pedisse. Com o Claude isso não acontece porque o fluxo conversacional age como um freio natural.
A conclusão que me surpreendeu
Eu comecei achando que era uma questão de horário. Claude pela manhã, Codex à tarde. Os dados mostraram que não — é uma questão de modo de trabalho.
O trabalho criativo e iterativo pede um agente conversacional. O trabalho mecânico e bem definido pede um agente autônomo. Por coincidência, as manhãs geralmente são mais criativas e as tardes mais mecânicas, mas isso é um padrão do cérebro humano, não da ferramenta.
Se você usa apenas um agente, é como usar uma chave de fenda para todas as tarefas — até mesmo para pregar um prego. Trabalhar com dois agentes tem um custo inicial de configuração, sim. Mas depois de três meses combinando os dois, eu não voltaria atrás.
O melhor copiloto não é o Claude nem o Codex. É saber quando usar cada um.
Este artigo foi publicado originalmente em espanhol e traduzido com a ajuda de IA.