TL;DR: Depois de 165 sessões com Claude Code e 27 com Codex CLI, o padrão é claro: Claude para o trabalho interativo em que você precisa pensar em voz alta, Codex para tarefas autônomas que você delega e esquece. Não é sobre qual é melhor, mas sobre quando usar cada um. Meus dados mostram que a combinação é mais eficiente do que qualquer um isoladamente.


São nove da manhã, café na mão, e eu tenho uma ideia ainda meio-formada sobre como reestruturar um módulo. Não sei exatamente o que quero. Só sei que o estado atual não me agrada.

Abro o Claude Code.

Não porque ele seja “o melhor” — mas porque preciso pensar em voz alta com alguém que compreenda o contexto. Digo: “esse serviço tem muitas responsabilidades, me ajude a dividi-lo”. E começa o diálogo. Ele propõe uma separação, discutimos, peço que explore outra opção, ele me mostra o diff antes de alterar qualquer coisa. É uma conversa.

Três horas depois, o módulo está dividido, os testes passam e o design melhorou. Mas já usei 40% da cota. E agora tenho uma lista de tarefas mecânicas que surgiram: atualizar os testes de integração, limpar imports não utilizados, reorganizar um diretório.

Abro o Codex.

Passo a tarefa, digo para ele trabalhar no modo autônomo, e vou almoçar.

Os dados que revelaram o padrão

Passei meses monitorando meu próprio uso com um aplicativo na barra de menus que registra sessões, tokens e horas. Eis o que os números mostram:

Claude Code: 165 sessões, 160.893 mensagens, 28.052 tool calls. Modelos usados: Opus 4.5 e Opus 4.6. 5,6 bilhões de tokens lidos do cache.

Codex CLI: 27 sessões. Modelo: GPT-5.4. Modo danger-full-access, política de aprovação never.

O que mais me surpreendeu foi a distribuição horária do Claude Code:

09:00    1 ▏
10:00    5 ██
11:00   10 ████▌
12:00   14 ██████▎
13:00    7 ███
14:00   16 ███████▏
15:00   21 █████████▍
16:00   15 ██████▋
17:00   18 ████████
18:00   13 █████▊
19:00   14 ██████▎
20:00    9 ████
21:00   10 ████▌
22:00    8 ███▌

70% das minhas sessões com Claude Code acontecem à tarde. Apenas 22% são pela manhã.

Quando vi isso, pensei que minha tese de “Claude de manhã” não se sustentava. Mas ao analisar o quê eu fazia em cada período, tudo fez sentido.

A manhã é para explorar, a tarde para executar

As sessões matutinas com Claude Code são poucas, mas longas. São sessões de design: “como isso deveria funcionar?”, “revise este plano”, “proponha alternativas”. São conversas de ida e volta onde mudo de ideia três vezes antes de decidir.

As sessões à tarde são mais curtas e em maior número. Implementar o que foi decidido pela manhã. Corrigir bugs. Ajustar testes. Trabalho onde a direção já está definida e só falta executar.

E é aí que entra o Codex.

Por que Codex para o trabalho autônomo

Codex CLI com GPT-5.4 em modo approval_policy = "never" é, para simplificar, um agente que você solta sem pedir licença pra nada. Ele lê sua base de código, executa comandos, modifica arquivos. Sem diálogo.

Isso assusta se você usá-lo para design — justamente porque ele não pergunta: “tem certeza disso?”. Mas é exatamente o que você quer para tarefas bem definidas:

  • “Adicione testes unitários para todos os métodos públicos deste módulo.”
  • “Reorganize estes arquivos seguindo a estrutura descrita em ARCHITECTURE.md.”
  • “Revise este plan.md e procure falhas.”

O segredo é que a tarefa precisa ser completa e verificável. Se você diz “melhore o desempenho”, ele vai fazer algo. Mas você não sabe se esse algo é o que precisava. Se você diz “reduza o tempo desta consulta de 200ms para menos de 50ms e adicione um benchmark que confirme isso”, pode ir almoçar tranquilo.

O turno da tarde: delegue e esqueça

Meu fluxo real nas últimas semanas:

  1. 09:00–13:00 — Claude Code interativo. Design, exploração, decisões de arquitetura. É minha sessão de “pensar acompanhado”. Gasto entre 30% e 50% da cota de Claude aqui.

  2. 13:00–14:00 — Pausa. Anoto as tarefas mecânicas que surgiram pela manhã.

  3. 14:00–15:00 — Lanço o Codex com as tarefas do meio-dia. Modo autônomo. Enquanto isso, começo outro trabalho (ou continuo com o Claude Code, que já começa a recuperar cota).

  4. 15:00 em diante — Revisão do que o Codex fez. Caso precise iterar, uso o Claude para revisão de código, já que ele fornece um feedback qualitativo melhor. As tarefas pendentes executo com o Claude no modo de implementação (sessões curtas e diretas).

Atenção: não é que o Codex seja pior pela manhã, nem o Claude pior à tarde. É que o tipo de trabalho muda ao longo do dia, e cada ferramenta funciona melhor para cada situação.

O que os benchmarks dizem (e o que não dizem)

Os comparativos públicos mostram que o Codex lidera no Terminal-Bench 2.0 (77,3% contra 65,4% do Claude Code). Mas em avaliações cegas de qualidade de código, os desenvolvedores preferem o código do Claude em 67% dos casos.

Ou seja: o Codex é melhor fazendo coisas no terminal. O Claude é melhor escrevendo código elegante. Eles não competem — se complementam.

Um dado que me surpreendeu: o Claude Code consome cerca de 4 vezes mais tokens por tarefa. Em uma assinatura Max, isso significa que a cota se esgota mais rápido. Combinar o Claude para o que requer qualidade com o Codex para o que demanda volume é pura gestão de recursos.

A regra que sigo

Antes de abrir qualquer um dos dois, me faço a seguinte pergunta:

“Eu vou mudar de ideia no meio da tarefa?”

  • Se a resposta for sim → Claude Code. Preciso de diálogo, ida e volta, “espera, melhor assim”.
  • Se a resposta for não → Codex. A tarefa está definida, os critérios de sucesso já claros — então que ele faça o trabalho.

É a mesma lógica que você aplicaria com pessoas. Para o colega com bom senso, você pede conselho. Para o rápido e confiável, delega a execução. Não faz sentido pedir conselhos ao executor ou delegar ao conselheiro.

A cota como recurso compartilhado

Uma vantagem inesperada de usar dois agentes: a cota de cada um é independente. Enquanto o Claude recupera cota após uma manhã intensa, o Codex pode estar trabalhando sem consumir um único token da Anthropic. E vice-versa.

No meu uso diário — cerca de 4.500 mensagens em média no Claude Code — a cota começa a apertar por volta das 14:00 se minha manhã foi produtiva. Ter o Codex como segundo agente transforma essa limitação em um não-problema.

Não é trapaça. É diversificar fornecedores. O mesmo que você faria com CDNs ou bancos de dados.

O que ainda não funciona (por enquanto)

A transição entre os dois ainda é manual. Abro um terminal, lanço o Codex e passo o contexto copiando do outro. Não há um protocolo padrão para “ei Claude, passe esta tarefa ao Codex com todo o contexto”.

Eles também não compartilham memória. O que o Claude sabe sobre seu projeto (via CLAUDE.md, memory/, skills) precisa ser replicado em AGENTS.md e nas instruções do Codex. Duas fontes de verdade. Dois lugares para atualizar.

Além disso, o Codex, por ser mais agressivo com permissões por padrão, às vezes exagera. Já tive sessões em que ele reorganizou quase todo o projeto sem que eu pedisse. Com o Claude isso não acontece porque o fluxo conversacional age como um freio natural.

A conclusão que me surpreendeu

Eu comecei achando que era uma questão de horário. Claude pela manhã, Codex à tarde. Os dados mostraram que não — é uma questão de modo de trabalho.

O trabalho criativo e iterativo pede um agente conversacional. O trabalho mecânico e bem definido pede um agente autônomo. Por coincidência, as manhãs geralmente são mais criativas e as tardes mais mecânicas, mas isso é um padrão do cérebro humano, não da ferramenta.

Se você usa apenas um agente, é como usar uma chave de fenda para todas as tarefas — até mesmo para pregar um prego. Trabalhar com dois agentes tem um custo inicial de configuração, sim. Mas depois de três meses combinando os dois, eu não voltaria atrás.

O melhor copiloto não é o Claude nem o Codex. É saber quando usar cada um.

Este artigo foi publicado originalmente em espanhol e traduzido com a ajuda de IA.