Jogar o contexto de todos os trabalhos em cada agente é uma forma ruim de delegar. Em 17 de junho de 2026, reclamei justamente dessa ideia. Quero agentes colaborando, mas continuo querendo saber qual trabalho cada um recebeu. Misturar tudo por precaução só empurra a decisão sobre o que importa pro próximo executor.
No dia seguinte, o anúncio do Record & Replay do Codex trouxe a proposta de gerar skills reutilizáveis a partir de demonstrações. Pra mim, isso coloca uma escolha concreta na mesa: o que deve acompanhar a capacidade quando ela sai da primeira execução? Repetir um procedimento não exige necessariamente carregar cada conversa que levou à descoberta daquele procedimento.
Penso numa conferência de entrega, como exemplo hipotético. A forma de verificar pode servir em outras tarefas. Já o histórico que explica uma decisão específica pertence àquele caso. Se os dois viram um pacote inseparável, o próximo agente precisa descobrir sozinho qual trecho é instrução geral e qual só fazia sentido na tarefa anterior. Depois a gente reclama que ele se perdeu. Complicado.
Quero separar a descrição da capacidade do material da execução atual. A skill explica quando se aplica e qual critério orienta o trabalho. A tarefa fornece o contexto necessário pra usar aquilo agora. Essa separação deixa mais fácil conferir se a resposta veio do pedido atual ou de alguma informação antiga que viajou junto sem motivo.
Histórico pode ser necessário. Uma decisão anterior pode impedir uma solução que parece boa olhando apenas o pedido recente. Nesse caso, quero levar a decisão e explicar sua consequência. Cortar contexto a qualquer custo também causa retrabalho: o agente investiga de novo o que já foi resolvido ou sugere algo incompatível com uma restrição conhecida.
O limite que proponho é simples de cobrar: cada parte relevante precisa ter uma razão pra acompanhar a tarefa. Quando faltar informação, o agente deve identificar a dúvida concreta. Quando o material não mudar nenhuma decisão, posso retirá-lo numa próxima comparação mantendo o mesmo resultado esperado. Assim descubro a fronteira pelo trabalho, em vez de escolher um tamanho de pacote por superstição.
Vou organizar a passagem de contexto em torno do objetivo delegado e deixar o histórico consultável quando houver motivo. A skill deve carregar conhecimento reaproveitável; cada execução recebe o que precisa pra agir e conferir. Se pra usar uma capacidade eu tiver que entregar todas as conversas de todos os trabalhos, a fronteira ainda tá mal definida.