|
EDIÇÃO #192 | NEWSLETTER SEMANAL DA ANÁLISE MACRO Tokens: o custo de pensar com IAFala, Reader, bora pra mais uma semana? Domingo aqui em casa, café na mão, pensando em como te explicar uma coisa que vejo gente competente errar toda semana: a conta da IA. Não é trivial. E ficou ainda mais urgente nos últimos dias. O Google anunciou que processa hoje 3,2 quadrilhões de tokens por mês — sete vezes mais que há um ano. A Anthropic gasta US$ 1,25 bilhão por mês só alugando capacidade computacional. E o Sam Altman ofereceu US$ 2 milhões em tokens da OpenAI a cada startup da turma do YC em troca de 2% de equity. Token virou moeda. E como toda moeda, precisa ser precificada direito. O problema é que quase ninguém faz essa conta de cabeça. Pior: muita gente confunde dois regimes de cobrança que não se comparam — e erra por ordens de magnitude. Bora desembaraçar isso. 🧩 Primeiro, dois termosAntes de qualquer conta, dois conceitos — rápido, porque o resto depende deles. Token é a unidade que o modelo lê e escreve. Não é bem uma palavra: é um pedaço dela. "Casa" é 1 token; "macroeconomia" pode virar 3 ou 4. A regra de bolso: 1.000 tokens ≈ 750 palavras em inglês (~600-650 em português). E o ponto que importa pro bolso: todo modelo cobra por token — pelos que você manda (o input) e pelos que ele responde (o output). É unidade de medida e unidade de cobrança ao mesmo tempo. FinOps (de Financial Operations) é a disciplina de tratar gasto com tecnologia — antes a nuvem, agora a IA — como decisão de engenharia, não como fatura que chega de surpresa no fim do mês. É botar quem constrói e quem paga a conta na mesma mesa, pra que cada chamada de modelo seja uma escolha consciente de custo-benefício. Nasceu no mundo cloud; com IA virou urgente, porque agora o custo escala token a token, em tempo real. Com os dois na mão, bora à conta. 🎯 A tese em uma fraseCusto por token é a métrica errada. O que importa é custo por tarefa concluída — e antes disso, é preciso entender que o mesmo modelo tem dois regimes de cobrança radicalmente diferentes: API (paga por uso) e assinatura (paga pacote fixo). Confundir os dois é o erro #1 de FinOps de IA. 📊 Os preços de referência (família 4.5 da Anthropic, 31/05/2026)Antes de calcular qualquer coisa, a tabela. Esses são preços por milhão de tokens (MTok). Os números exatos mudam entre versões — o que não muda é a mecânica.
Três coisas saltam aos olhos:
Voltando à régua lá de cima: em português, conte mais ou menos 1,3-1,5 token por palavra. Serve pra estimar qualquer conta de cabeça. ⚙️ Calculando na unha — uma chamada de Opus 4.5Vamos fazer uma chamada simples. 10.000 tokens de entrada (um documento médio mais o prompt) e 2.000 tokens de saída (uma resposta razoável). Input: 10.000 / 1.000.000 × US$ 5 = US$ 0,05 Dez centavos de dólar. Parece desprezível. Mas custo de IA é sobre escala. Multiplica por 10 mil chamadas por dia (volume modesto pra qualquer produto sério): US$ 0,10 × 10.000 = US$ 1.000/dia ≈ US$ 30.000/mês Agora a brincadeira: a mesma carga em Sonnet 4.5 (input 3 / output 15) sai por US$ 0,03 + US$ 0,03 = US$ 0,06/chamada. Ou seja, US$ 18.000/mês. Escolher o modelo certo para a tarefa certa corta 40% da conta sem tocar em mais nada. Sem reescrever prompt, sem otimizar contexto, sem nada. Só escolher direito. 🔓 O erro clássico: API ≠ Claude CodeAgora a parte que vejo gente errando toda semana. Existem dois regimes de cobrança para os mesmos modelos:
O erro clássico: "rodei 40 milhões de tokens esse mês — na API isso seria US$ X mil!". Não seria. Porque você não estava na API. Quem programa o dia inteiro com Claude Code pode consumir um volume que, na API, custaria centenas de dólares por dia — mas paga uma assinatura de US$ 100-200/mês. A comparação correta NÃO é token a token. É assinatura fixa vs. o que aquele volume custaria na API. Cada um serve pra uma coisa. A mini-tabela:
🛢️ As três alavancas de economiaPra quem roda API de verdade, três alavancas resolvem 80% do problema: 1. Modelo certo para a tarefa certa. Não use Opus pra classificar e-mail. Haiku faz por 1/5 do preço. O exemplo de US$ 30k → US$ 18k acima é só trocar Opus por Sonnet — sem mexer em mais nada. 2. Prompt caching. Contexto fixo (instruções, documentos de referência, exemplos) lido do cache custa ~1/10 do input normal. O agente que gera este boletim usa 3. Engenharia de contexto. Todo token enviado é pago. Mandar só o necessário é a economia mais barata de todas — e lembra da assimetria: cortar output rende 5x mais que cortar input. 🧠 Insight finalFinOps maduro não persegue o menor custo por token. Persegue o menor custo por tarefa concluída. É o paradoxo que economista entende de imediato: às vezes o modelo mais caro é o mais barato, porque resolve em uma chamada o que o barato erra em cinco. Isso é custo marginal e custo de oportunidade aplicados a tokens — ferramental que você já domina há anos, só que com nome novo. A pergunta nunca foi "qual o modelo mais barato?". É "qual a forma mais eficiente de chegar ao resultado?". Quem aprende a fazer essa conta — de cabeça, na unha, com lápis e papel — sai na frente. O resto vai continuar pagando Opus pra resumir e-mail. Um abraço, A verdade está nos dados. |
Receba todo domingo à noite em seu e-mail nossa newsletter com exercícios reais de análise de dados econômicos e financeiros, envolvendo muito estatística, econometria, machine learning e inteligência artificial em R e Python. Tudo o que você precisa saber para estar antenado no mundo dos dados!
EDIÇÃO #201 | NEWSLETTER SEMANAL DA ANÁLISE MACRO 58,1% dos empregos em risco? Fui atrás do número. Fala, Reader, tudo bem por aí? Essa semana esbarrei num site novo — o Profissões.org.br, um "atlas do trabalho brasileiro" — e logo na capa, o número que virou manchete no Brasil inteiro: 58,1% dos empregos no país correm alto risco de automação. Fui atrás. Porque quando um número se repete tanto, ele deixa de ser dado e vira slogan. Spoiler: o número existe, é sério, tem autor e DOI. Mas ele...
EDIÇÃO #200 | NEWSLETTER SEMANAL DA ANÁLISE MACRO Como tirar projeto do papel com IA (a escada de 4 degraus) Fala, Reader, tudo bem por aí? Edição 200. E, depois de duzentas edições escrevendo sobre análise de dados e IA, eu quero usar esta edição especial para te ajudar a tirar as coisas do papel. Tem uma coisa que eu venho notando há meses, conversando com alunos e leitores: quase todo mundo está travado no mesmo degrau. Abre o chat, faz pergunta, copia a resposta, cola no documento. Ganha...
EDIÇÃO #199 | NEWSLETTER SEMANAL DA ANÁLISE MACRO A Macroeconomia da Inteligência Artificial Fala, Reader, vamos para mais uma semana? Domingo passado eu fechei a edição com uma frase solta, quase de rodapé. Falei que a IA realoca renda do trabalho pro capital. E que isso tinha uma implicação política óbvia — e tributária. Essa semana caiu na minha mesa um paper que pega exatamente esse fio e puxa até o fim. Um paper que fala em uma coisa que parece contradição: recessão causada pela IA. Não...