Um lançamento novo precisa resolver alguma dificuldade antes de ganhar o lugar do meu padrão. O gráfico pode ser ótimo e a configuração de ontem continuar adequada. Quero uma razão ligada ao trabalho pra trocar, principalmente depois de sentir a distância entre gostar de um modelo e gostar da ferramenta.
A OpenAI lançou GPT-6.1 Sol em 29 de setembro de 2026, com entrada a US$2 e saída a US$10 por milhão de tokens, além de entrada em cache a US$0,10. A empresa o posicionou perto de Astra em avaliações selecionadas, por preços menores. Essa comparação precisa carregar as tarefas e condições das avaliações. Perto de Astra sozinho diz pouco sobre o pedido que está na minha fila.
Eu queria comparar modelos desde junho. Em 15 de setembro, ao falar da mudança de Claude para Codex, considerava o modelo do Codex melhor, mas via Claude fazendo coisas que Codex ainda encontrava dificuldade pra fazer naquela experiência. Foi uma cobrança por resultado prático: esperava que a capacidade percebida chegasse ao trabalho.
Essa cena define uma parte da próxima comparação. Se eu mudar modelo e ferramenta ao mesmo tempo, posso preferir a entrega sem saber qual mudança ajudou. Pra escolher um fluxo, o conjunto importa. Pra corrigir o que travou, preciso separar as partes. Vou registrar ambos, porque um diagnóstico ruim pode mandar mexer no modelo quando a dificuldade estava no acesso ao contexto.
Também pedi escolha de modelo conforme a tarefa. Quero observar se o agente chega a uma mudança revisável e se explica uma limitação antes de construir em cima dela. Quando uma instrução muda, precisa preservar o que ainda vale. Esses comportamentos aparecem durante a execução; uma pontuação isolada deixa muita coisa de fora.
O custo inclui as correções até o resultado que aceito. Uma tentativa barata pode pedir várias outras, e uma opção mais cara pode exigir menos intervenção. Vou contar esse caminho inteiro, mantendo disponíveis o pedido original e o critério de conclusão. Isso permite reler a escolha quando a ferramenta muda ou chega outro tipo de tarefa.
GPT-6.1 Sol entra como candidato numa demanda recorrente e verificável, com as mesmas informações iniciais pros modelos comparados. Minha decisão vai ficar ligada ao que cada execução entrega e às condições registradas. Quero sair com uma escolha explicável pro próximo trabalho. O anúncio merece investigação; a troca do padrão vai depender de uma vantagem que eu consiga apontar na tarefa.