|
EDIÇÃO #205 | NEWSLETTER SEMANAL DA ANÁLISE MACRO Claude, GPT ou Gemini? Você está fazendo a pergunta errada.Fala, Reader, tudo bem por aí? Se eu tivesse que listar as perguntas que mais recebo de aluno, leitor, cliente e amigo nos últimos doze meses, o pódio teria uma campeã absoluta: "Vítor, qual modelo você usa? Claude, GPT ou Gemini?" A pergunta é honesta. E eu entendo de onde ela vem: quem está começando quer saber onde apostar a assinatura de US$ 20 por mês. Só que quanto mais eu construo coisa que funciona, mais eu tenho certeza de que essa é a pergunta errada. E este mês saiu uma coisa que me deu, finalmente, o gancho para explicar isso com número e com código aberto na mesa. Bora? 🎯 Por que a pergunta está erradaLembra da edição #203? O paper do NBER mediu, com 1.890 runs, uma coisa simples: o que acontece com a taxa de sucesso quando você troca o modelo versus quando você troca a agência em volta dele. O número foi +21,3 p.p. só saindo de chatbot para agente restrito. Com o mesmo modelo. Trocar de modelo mexe pouco. Trocar de andaime muda o jogo. É aí que mora a tese desta edição: o modelo é a parte que você escolhe num menu. O harness é a parte que você constrói. E é ele que decide o resultado. Ninguém quer ouvir isso porque escolher no menu é fácil e construir andaime dá trabalho. Mas os dados são os dados. 🔧 O que é um harness (e por que você nunca ouviu falar)Harness, em português torto, é andaime. É a camada de infraestrutura que fica entre você e o modelo: o que ele lê, quais ferramentas ele chama, como as sessões são guardadas, como o sandbox executa código, como o loop de decisão fecha, como tudo isso é logado. Até este mês, harness era artefato interno de laboratório. Cada empresa tinha o seu, e ninguém publicava. Aí, no dia 13 de agosto, a DeepSeek soltou no GitHub o deepseek-harness, licença MIT, com uma descrição que é quase um manifesto: "Everything is a Plugin." Em 17 dias, o repositório passou de 200 mil estrelas e 23 mil forks. Não é hype gratuito. É desenvolvedor sério olhando por dentro, pela primeira vez, o que separa demonstração de sistema. O QUE O HARNESS TRATA COMO PLUGIN Modelos: Claude, GPT, Gemini, DeepSeek local — tudo virou adapter. Ferramentas: registries plugáveis, entram e saem sem tocar no core. Sessões: logadas do começo ao fim, resumíveis, forkáveis, replayáveis. Sandbox, storage, loops, scheduling, UI: tudo desacoplado. Kernel: um micro-kernel chamado Cordis segura o show. Traduzindo o que isso significa na prática: no deepseek-harness, você troca de Claude para GPT alterando uma linha de configuração. O modelo virou um arquivo YAML. Se o modelo é um arquivo YAML, ele não pode ser a coisa mais importante da sua stack. É matemática. A frase que o The Batch usou para descrever o lançamento é a tese desta edição, com todas as letras: "Agentic performance is a joint function of the model and its scaffolding, so a published harness is the difference between numbers that a developer can only read and those they can reproduce." Desempenho de agente é função conjunta do modelo e do andaime. Publicar o andaime é o que separa número que você lê de número que você reproduz. 🧭 O que o Ng diz que sobra para vocêNa mesma edição do The Batch que cobriu o harness, o Andrew Ng publicou uma carta cuja abertura já vale o clique: "How have software engineering fundamentals changed with agentic coding?" A resposta dele é dura, e eu concordo integralmente: "A novice who vibe codes without understanding software fundamentals can create simple applications, but this often leads to the coding agent making bad tradeoffs in latency, availability, consistency, reliability, maintainability, simplicity, and/or cost." E o diagnóstico que fecha: "In most cases, the developer didn't know such tradeoffs even existed and therefore did not steer the agent to make the right decisions for their application context." Ou seja: o agente escreve código. Mas ele decide entre latência e custo, entre consistência e disponibilidade, entre simplicidade e escala — com base no que você conseguiu especificar. Se você não sabe que o tradeoff existe, ele decide por você. E decide mal. Os cinco fundamentos que o Ng lista como imprescindíveis:
Repare no que ele não listou: qual API de LLM assinar. Porque isso não importa. O que importa é o andaime — do lado da infra (o harness) e do lado do desenvolvedor (os fundamentos que te permitem conduzir o agente). 📊 Como as pessoas estão realmente usando IASe a tese é essa, a evidência de campo tinha que aparecer. E apareceu. O paper "How Organizations Use AI: Evidence from ChatGPT" (Chatterji, Holtz, Rakholia, Tambe & Weeratunga, arXiv 2608.12236) cruzou registros de contas ChatGPT Enterprise com dados de função, tarefa e balanço público, até março de 2026. A AMOSTRA Organizações: mais de 1.500, em 6 meses de adoção. Mensagens: mais de 17 milhões, no nível do trabalhador. Perfil de empresa: adoção concentrada nas maiores, mais valiosas, mais intensivas em P&D e SG&A. Perfil de trabalhador: atravessa funções e senioridade, com engajamento maior em início de carreira. Usos: writing, technical work, communication, information synthesis. O achado que interessa aqui: as organizações variam enormemente em velocidade e propósito de adoção. Muitas ainda estão aprendendo a integrar a ferramenta ao fluxo. Vamos ler isso com calma. Todas essas empresas têm acesso ao mesmo modelo. É o mesmo GPT rodando para todo mundo. E ainda assim os resultados variam de forma gigantesca. Se fosse o modelo, a variação seria pequena. Não é. A diferença está no que cada empresa constrói em volta — no harness organizacional, se quiser me acompanhar na analogia. Quem tem processo, quem loga, quem revisa, quem itera, entrega. Quem só distribui licença, não. 📄 Papers da semanaReordenados por proximidade à tese:
📊 Modelo da semana — Regra de TaylorDeixa eu forçar uma analogia que pode parecer estranha à primeira leitura, mas que fecha o argumento. A regra de Taylor é um harness de política monetária. Ela não substitui o julgamento do Copom — o "modelo" inteligente, se quiser. Ela é o andaime que torna a decisão sistemática, inspecionável e reproduzível. Sem ela, cada reunião é uma decisão discricionária que você pode até defender, mas não pode replicar. Você não consegue medir desvio, não consegue explicar terceiro, não consegue rodar o contrafactual. Cada decisão vira opinião com boa intenção. É a mesma diferença entre um agente que roda solto e um agente rodando dentro do deepseek-harness: um você lê, o outro você reproduz. 📘 Livros da semana — Estatística bayesianaE o elo com bayes fecha o ciclo. Bayesiano é, no fundo, isso: atualizar crença com evidência nova. Prior, likelihood, posterior. É exatamente o que um harness com log completo permite fazer com o próprio sistema — medir, revisar, reexecutar, recalibrar. Sem instrumentação, não existe posterior. Existe achismo com data.
🧠 Insight finalA pergunta "Claude, GPT ou Gemini?" pressupõe que existe uma resposta que resolve o problema. Não existe. Os três são bons. Todos os três, com o andaime errado, entregam o mesmo resultado medíocre. Todos os três, com o andaime certo, entregam algo próximo do estado da arte. O que separa quem tira resultado de IA de quem não tira é a mesma coisa que sempre separou quem tira resultado de ferramenta boa: o processo em volta. Fundamentos de engenharia (o que o Ng defende), infraestrutura plugável (o que a DeepSeek publicou), instrumentação e iteração (o que o método bayesiano exige). O modelo é commodity. E ficou mais commodity ainda neste mês, quando alguém publicou o andaime. Agora eu te devolvo uma pergunta, e essa aqui eu quero mesmo que você me responda no e-mail: como você tem usado IA no seu trabalho? Está mexendo no modelo ou está construindo o andaime? Está iterando com log e revisão, ou está caprichando no prompt e torcendo? Aperte o "responder" e me conta. Eu leio todas. 📎 Material da semana 📄 Resumo da semana (PDF) — o digest completo das newsletters que embasou esta edição. 🎧 Ouça em podcast — esta edição em áudio. Um abraço, A VERDADE ESTÁ NOS DADOS. |
Receba todo domingo à noite em seu e-mail nossa newsletter com exercícios reais de análise de dados econômicos e financeiros, envolvendo muito estatística, econometria, machine learning e inteligência artificial em R e Python. Tudo o que você precisa saber para estar antenado no mundo dos dados!
EDIÇÃO #210 | NEWSLETTER SEMANAL DA ANÁLISE MACRO Ovos são perigosos? Fala, Reader, posso te contratar como perito? Essa foi, mais ou menos, a primeira questão de um trabalho de Econometria do Doutorado, há poucos dias. O enunciado me colocava no papel de consultor técnico num caso real dos anos 1970 nos Estados Unidos: produtores de ovos, reunidos na National Commission on Egg Nutrition, publicaram anúncios dizendo que não havia evidência científica de que comer ovo aumentasse o risco de...
EDIÇÃO #209 | NEWSLETTER SEMANAL DA ANÁLISE MACRO O agente ficou com o trabalho. Quem ficou com o dinheiro? Fala, Reader, você viu a manchete do "hedge fund que trocou US$ 5 milhões de folha por 4 agentes de IA"? Ela rodou a semana inteira. Eu fui atrás da fonte, li a entrevista original na CNBC e descobri que a história é real — mas está sendo contada errada. E aí, ao arrumar o caso, apareceu uma pergunta bem maior que "a IA vai tirar meu emprego?". Bora lá. 🎯 O que a manchete não conta...
EDIÇÃO #208 | NEWSLETTER SEMANAL DA ANÁLISE MACRO Por que querem parar a IA? Estão querendo parar o desenvolvimento da IA, você viu, Reader? Fiquei pensando nisso e no que temos conversado por aqui, em outros boletins. E eu tenho uma hipótese que gostaria de compartilhar com você. Primeiro, deixa eu te mostrar uma conta que apareceu esta semana no 8-K da Oracle, referente ao trimestre encerrado em 31 de agosto de 2026. Receita do trimestre: US$ 19,3 bilhões. Capex do mesmo trimestre: US$ 28,5...