Um modelo melhor precisa melhorar o trabalho que chega até mim. Gosto de ver avanço de capacidade, mas fico impaciente quando a ferramenta deixa esse avanço parado atrás de uma integração ruim. A promessa de completar tarefas aumenta essa cobrança, porque entregar o objetivo inteiro é justamente o que estou tentando delegar.
Em 3 de setembro de 2026, a OpenAI apresentou GPT-6 Astra para programação, uso de computador e trabalho profissional. A distribuição começou com um grupo limitado de organizações. Estou revisitando esse anúncio com uma percepção posterior: em 15 de setembro de 2026, eu disse que os modelos estavam muito melhores.
Naquele mesmo dia, a conversa sobre minha mudança de Claude para Codex mostrou a frustração concreta. Eu considerava o modelo do Codex melhor, mas Claude já fazia coisas que Codex ainda tinha dificuldade pra fazer naquela experiência. Pedi uma investigação. Quando a capacidade parece superior e o fluxo anda pior, quero descobrir onde ela está se perdendo.
O agente pode entender a tarefa e receber contexto insuficiente. Pode saber qual hipótese verificar e não alcançar o ambiente necessário. Da minha cadeira, essas diferenças chegam na forma de trabalho incompleto. Pra corrigir, preciso localizar o obstáculo. Trocar o modelo sem saber qual parte falhou pode deixar a mesma dificuldade esperando na próxima execução.
Uma limitação precisa aparecer antes de contaminar a conclusão. Se o agente não abriu um arquivo necessário, quero saber disso enquanto ainda dá pra decidir como seguir. Raciocinar por mais tempo não recupera uma instrução que a ferramenta deixou de enviar. O produto tem que tornar essa falta visível, sem me obrigar a adivinhar pelo tom da resposta.
Por isso, a comparação que me interessa acompanha uma tarefa comum do contexto inicial até uma entrega revisável. Quero ver o que acontece quando entra informação nova e se o agente preserva o que ainda vale do pedido. Uma demonstração ampla fica menos útil quando esconde exatamente essas passagens. Prefiro um conjunto menor de tarefas cujo funcionamento eu consiga conferir.
Minha impressão positiva sobre os modelos continua de pé. A cobrança agora é fazer a capacidade chegar ao fluxo cotidiano. Vou avaliar a próxima ferramenta pela tarefa que ela consegue conduzir, incluindo o ponto em que realmente precisa de mim. A intervenção deve resolver uma decisão localizada e deixar o restante seguir; voltar a coordenar cada etapa seria pagar por autonomia e continuar fazendo o despacho.