Uma queda de preço por token muda a economia da IA, mas não garante que toda automação fique 50% mais barata. Nesta semana, OpenAI e Anthropic anunciaram reduções em modelos voltados a trabalho e programação. A leitura mais útil está nos detalhes: qual preço serviu de comparação, quanto cada tarefa consome e que parte da conta vem de ferramentas, contexto e tentativas repetidas.

A OpenAI diz que GPT-6 Sol e GPT-6 Luna chegam com preços de API 50% menores que os preços promocionais anteriores do GPT-5.6 Sol e Luna. Na tabela divulgada, Sol cai de US$ 4 para US$ 2 por milhão de tokens de entrada e de US$ 20 para US$ 10 por milhão de saída. Luna cai de US$ 0,20 para US$ 0,10 na entrada e de US$ 1,20 para US$ 0,50 na saída. A comparação é explicitamente com a tabela promocional do GPT-5.6 — não com qualquer preço histórico da indústria.

A Anthropic anunciou o Claude Opus 5.5 por US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, ante US$ 5 e US$ 25 do Opus 5. Isso representa 20% menos por token nessas categorias. Para leitura de tokens em cache, a empresa informa queda de US$ 0,50 para US$ 0,20 por milhão, ou 60%. A Anthropic também afirma que, em seus testes, o Opus 5.5 custa 40% menos por tarefa típica que o Opus 5, combinando preço menor e menor consumo de tokens.

O preço unitário é só uma parte da conta

Para visualizar a diferença, imagine uma chamada com 1 milhão de tokens de entrada e 100 mil de saída, sem cache e sem ferramentas. Pelas tarifas publicadas, isso daria aproximadamente US$ 3 no GPT-6 Sol, US$ 0,15 no GPT-6 Luna, US$ 6 no Opus 5.5 e US$ 7,50 no Opus 5. É uma conta ilustrativa de API: não compara qualidade, não inclui processamento especial, chamadas de busca, execução de código ou repetições.

O custo operacional real depende de quanto contexto é enviado, quantas tentativas o agente precisa, se o cache é reaproveitado, quais ferramentas são chamadas e se alguém precisa revisar ou corrigir o resultado. Um modelo mais barato que consome cinco vezes mais tokens ou exige retrabalho pode custar mais no fluxo completo. E um modelo mais caro pode sair mais em conta se resolver uma tarefa longa com menos passos.

O que está por trás da queda

As duas empresas apontam ganhos de eficiência no serviço dos modelos. A OpenAI atribui parte da redução a melhorias de inferência e cache; também diz que o cache de prompt pode reduzir em 90% o preço de leitura de tokens armazenados. A Anthropic destaca que Opus 5.5 usa menos tokens em tarefas típicas, além de custar menos por token que Opus 5. São explicações das próprias empresas, e os resultados de eficiência publicados são avaliações internas ou benchmarks específicos, não uma promessa para todo uso.

A queda também revela uma mudança de competição: o diferencial comercial não é apenas lançar um modelo mais capaz, mas entregar uma combinação útil de capacidade, velocidade e custo por resultado. Preços menores ampliam os casos em que vale testar agentes — desde que a empresa acompanhe a qualidade e o esforço humano que ainda ficam fora da fatura da API.

O que equipes deveriam medir

Antes de trocar de modelo ou liberar mais automações, vale rodar os mesmos casos com uma amostra realista e medir quatro dimensões:

  • Custo por tarefa concluída: inclua tokens, chamadas de ferramentas, tentativas e revisão humana.
  • Qualidade e taxa de correção: defina o que significa “pronto” e conte falhas, retrabalho e escalonamentos.
  • Tempo até o resultado: uma tarifa menor pode vir acompanhada de mais latência ou de mais etapas.
  • Variação por tipo de trabalho: um modelo pode ser econômico em classificação e caro em análise longa, ou vice-versa.

O teste precisa comparar modelos na mesma tarefa, com instruções, dados e critérios de aceite equivalentes. Também deve separar os casos em que o preço publicado é promocional, o uso de cache e qualquer multiplicador regional ou de processamento. Sem essa disciplina, a equipe compara números que parecem semelhantes, mas não representam o mesmo serviço.

Tokens mais baratos não encerram a discussão

Se a tendência continuar, mais aplicações poderão justificar o custo de inferência. Mas isso não significa custo zero nem substituição automática de trabalho. O próximo gargalo pode estar em dados desorganizados, permissões, integrações frágeis, validação ou responsabilidade por decisões. A economia do modelo ajuda; a operação ainda precisa estar pronta.

A pergunta para gestores, portanto, deixa de ser apenas “quanto custa um milhão de tokens?” e passa a ser: quanto custa entregar um resultado confiável, com o nível de supervisão que o processo exige? A disputa de preços é uma boa notícia para quem constrói com IA. O ganho concreto aparece quando a redução chega ao custo por tarefa — sem queda de qualidade e sem esconder despesas que ficaram fora da conta.

Fontes