Livro executivo · Guia completo

Marketing Mix Modeling, do problema à implementação.

Em média, 10–30% do budget de marketing é desperdiçado em canais que não geram retorno incremental, e o GA4, o Meta e o last-click não te dizem em quais. Este guia mostra, do zero, como o Marketing Mix Modeling mede o impacto causal real de cada canal, qual a metodologia técnica por trás do Google Meridian e como a Precisian implementa isso em operações de e-commerce no Brasil.

10 capítulos · 4 partes · ~25 min · Conteúdo human-written
Opção 1
Continue o scroll para ver o conteúdo na íntegra
Começar leitura
Sumário

10 capítulos. 4 partes.

Parte I · Por que MMM
O contexto que torna o MMM urgente
Parte II · Como funciona
A mecânica técnica por baixo do capô
Parte III · Na prática
Implementação com o Google Meridian
Parte IV · A plataforma
Como a Precisian operacionaliza tudo isso
Versão em áudio · Podcast

A matemática do marketing sem cookies

Prefere ouvir? O guia completo está disponível em formato de podcast, ideal para escutar no carro, na academia ou enquanto trabalha em outras tarefas.

Narração executiva · ~25 min · AAC · 42 MB
Baixar áudio
Capítulo 01 · Parte I

O problema: por que mensurar marketing continua sendo difícil

A evolução dos indicadores, a ascensão e os limites do Multi-Touch Attribution e a chegada da era cookieless.

1.1 A evolução dos indicadores de performance

Durante décadas, a mensuração de marketing esteve ancorada em indicadores de alcance e awareness, GRPs, impressões, frequência média e recall de marca. Métricas úteis para dimensionar exposição, mas sempre com a mesma lacuna: a incapacidade de ligar diretamente o investimento em mídia ao resultado financeiro da empresa.

O marketing digital prometeu resolver esse gap. Surgiram CTR, CPC, CPA, ROAS, métricas com rastreabilidade end-to-end. Mas essa granularidade criou um novo problema: a fragmentação da visão estratégica. Cada canal passou a operar com seus próprios KPIs e suas próprias narrativas de sucesso, frequentemente inflacionando sua contribuição real.

1.2 A ascensão e os limites do MTA

O modelo dominante na década de 2010 foi o last-click attribution, 100% do crédito para o último touchpoint. Surgiram variantes (first-click, linear, time-decay), mas todas baseadas em regras heurísticas, não em evidência estatística.

A evolução natural foi o Multi-Touch Attribution (MTA), prometendo distribuir crédito entre todos os touchpoints via modelos estatísticos ou de machine learning. Na prática, o MTA enfrentou obstáculos estruturais:

  • Restrições de rastreamento: menos de 30% das jornadas são rastreáveis end-to-end em desktop; abaixo de 15% em mobile iOS.
  • Walled gardens: Meta, Google, Amazon e TikTok operam como ecossistemas fechados, atribuição cross-platform impraticável.
  • Baixa taxa de match: raramente excede 40–50%, criando viés de seleção significativo.
  • Ausência de canais offline: TV, rádio e OOH (30–60% do budget em grandes empresas) são invisíveis para o MTA.

1.3 A era cookieless e suas implicações

A partir de 2024–2025, o ecossistema entrou na era cookieless:

  • Apple ATT: opt-in entre 15–35%, reduzindo atribuição em iOS.
  • Deprecação de cookies 3P: o Chrome (~65% de market share) elimina cookies de terceiros.
  • LGPD / GDPR: consentimento explícito para coleta e processamento.
  • Walled gardens: restrição crescente de dados cross-platform.

O MMM, ao trabalhar com dados agregados (investimento semanal por canal, receita total), é nativamente privacy-compliant e não sofre com essas restrições. É por isso que, após décadas na sombra, voltou ao centro das decisões.

Com fragmentação, double counting e colapso do rastreamento individual, precisamos de uma metodologia que transcenda o rastreamento e forneça respostas baseadas em evidência estatística.
Capítulo 02 · Parte I

A solução: Marketing Mix Modeling bayesiano

O que é MMM, por que voltou ao centro das decisões e por que o Google Meridian é a referência open-source.

2.1 O que é MMM

Marketing Mix Modeling é uma técnica estatística que utiliza dados agregados de séries temporais para estimar a contribuição de cada variável de marketing ao KPI de negócio. O modelo decompõe a receita em componentes atribuíveis a cada fator: mídia paga, preço, distribuição, sazonalidade, fatores macroeconômicos, concorrência e uma baseline orgânica.

Y(t) = β0 + Σ βi · f(Xi(t)) + Σ γj · Zj(t) + ε(t)

Onde Y(t) é o KPI no período t, Xi são variáveis de mídia transformadas (adstock + saturação), Zj são variáveis de controle, β e γ são os coeficientes estimados, e ε é o termo de erro.

O MMM bayesiano moderno, como o Google Meridian, incorpora conhecimento prévio (priors), gera distribuições de probabilidade completas para cada estimativa e quantifica incerteza rigorosamente. Em vez de "o ROI do canal X é 2.5", diz "o ROI tem 90% de probabilidade de estar entre 1.8 e 3.2, com mediana em 2.5".

2.2 Os três pilares de utilidade

Diagnóstico

Responde "o que aconteceu?", decompõe a receita total nos componentes que a geraram. Identifica baseline, contribuição de cada canal e fatores externos.

Predição

Responde "o que acontecerá?", simula cenários futuros. Se aumentar TV em 20% e reduzir search em 10%, qual o impacto projetado?

Prescrição

Responde "o que devemos fazer?", otimiza alocação de budget entre canais para maximizar retorno total, usando as curvas de saturação estimadas.

2.3 Por que o Google Meridian

Lançado em 2024 como evolução do LightweightMMM, o Meridian é o estado da arte em MMM open-source:

  • NumPyro/JAX: NUTS sampler com aceleração GPU para inferência rápida e convergente.
  • Reach & Frequency: modela diretamente dados de reach/frequência, não apenas spend.
  • Modelo hierárquico geográfico: compartilha informação entre regiões, melhorando estimação em geos com dados escassos.
  • Calibração experimental: integra resultados de geo-lift e conversion lift como priors informados.
  • Otimizador de budget: módulo integrado para recomendação de alocação ótima entre canais.
Para construir um MMM robusto, o primeiro passo é garantir dados de qualidade. Nenhum algoritmo, por mais sofisticado, compensa dados ruins.
Capítulo 03 · Parte II

Os dados: o que coletar, como validar, como preparar

Os três pilares de dados, o formato esperado pelo Meridian e os tratamentos obrigatórios antes do treinamento.

3.1 Os três pilares de dados

Todo MMM é construído sobre três categorias: (1) a variável dependente (KPI de negócio), (2) variáveis de mídia (investimentos e métricas de exposição) e (3) variáveis de controle (fatores não-marketing que influenciam o KPI). A qualidade e completude desses dados determinam o teto de qualidade do modelo.

CategoriaExemplosFrequência
KPIReceita, vendas (unidades), leadsSemanal
Mídia offlineTV (GRP/spend), rádio, OOHSemanal
Mídia onlineSearch, display, social, videoSemanal
PreçoPreço médio, desconto, promoçõesSemanal
MacroPIB, IPCA, câmbioMensal
SazonalidadeFeriados, estações, datas comemorativasSemanal

3.2 Volume mínimo de dados

Na prática bayesiana, priors informativos relaxam a exigência de volume. O Meridian funciona razoavelmente com 2 anos (104 semanas), especialmente quando há dimensão geográfica. Com 27 geos × 39 semanas = 1.053 observações, o modelo tem dados suficientes.

Mídia com pouco investimento: canais ativos em menos de 20% das semanas (flight skewness > 80%) são difíceis de modelar e frequentemente devem ser excluídos ou agrupados.

3.3 Limpeza e tratamento

Valores ausentes têm tratamentos específicos: zero para mídia inativa, interpolação linear para gaps curtos (1–2 semanas) e exclusão para gaps longos. Multicolinearidade é diagnosticada via VIF (Variance Inflation Factor), VIF > 5 é preocupante; VIF > 10 é severo. A solução pode ser merge de canais correlacionados, exclusão da variável menos importante ou uso de priors informativos.

Com dados preparados e validados, vamos agora entender como o modelo transforma esses inputs em insights acionáveis.
Capítulo 04 · Parte II

O modelo: adstock, saturação e estimação bayesiana

As duas transformações fundamentais (adstock e saturação), priors, posteriors e o que acontece dentro do MCMC.

4.1 Curvas de resposta (saturação)

A curva de resposta modela os retornos decrescentes do investimento em mídia. Os primeiros reais investidos geram mais impacto; conforme o investimento aumenta, a contribuição marginal diminui.

Duas famílias dominam: a côncava (exponencial), sem ponto de inflexão, adequada para search paid e retargeting; e a Hill function (S-shape), com ponto de inflexão, mais realista para TV e branding. O Meridian usa Hill por padrão.

f(X) = XS / (KS + XS)

4.2 Adstock (efeito de carryover)

O efeito de publicidade não desaparece instantaneamente, um comercial visto na segunda ainda influencia compras na quarta. O adstock modela esse decaimento temporal:

At = Xt + λ · At−1   com   λ ∈ [0, 1]

λ = 0.9 significa efeito persistente por muitas semanas (TV). λ = 0.3 significa decaimento rápido (search). No Meridian, a ordem é adstock primeiro, saturação depois: acumula o efeito ao longo do tempo e depois aplica saturação ao total acumulado.

4.3 Estimação bayesiana

A estimação bayesiana incorpora conhecimento prévio (priors) e atualiza essa crença com base nos dados, gerando posteriors completas. A intuição central é:

P(θ | D) ∝ P(D | θ) · P(θ)

Posterior = Likelihood × Prior. Em vez de point estimates, o output é uma distribuição completa de probabilidade, o que permite quantificar incerteza com intervalos de credibilidade.

4.4 MCMC na prática

Como a posterior é analiticamente intratável, usamos Markov Chain Monte Carlo para amostrar dela. O Meridian usa o NUTS (No-U-Turn Sampler), variante eficiente do HMC que utiliza gradientes para navegar o espaço de parâmetros, convergindo mais rápido que Metropolis-Hastings.

Um modelo estimado não é automaticamente confiável. Antes de tomar qualquer decisão, precisamos validar rigorosamente.
Capítulo 05 · Parte II

A validação: 9 checkpoints obrigatórios

Sem aprovação nos 9 checkpoints, o modelo não vai para produção. Esse é o filtro entre "MMM bonito" e "MMM acionável".

1

Convergência MCMC

R-hat < 1.1 para todos os parâmetros. Trace plots tipo "lagarta peluda". ESS > 400. Zero divergências.

2

Acurácia preditiva

R² > 0.80 é bom, > 0.90 excelente. MAPE < 10%. Durbin-Watson ~2.0 indica sem autocorrelação nos resíduos.

3

Comparação prior vs posterior

Posteriors devem ser mais estreitas que priors. Se posterior ≈ prior, os dados são pouco informativos para aquele parâmetro.

4

Curvas de resposta plausíveis

As curvas fazem sentido de negócio? Um canal com budget de R$ 10K/semana não deveria ter half-saturation em R$ 500K.

5

Decaimento adstock razoável

TV: 2–4 semanas. Display/social: 1–2 semanas. Search: efeito quase imediato (decay < 0.3). Outros padrões merecem investigação.

6

Estimação de ROI/ROAS

Calcular ROI com intervalos credíveis de 90%. IC incluindo negativos pede revisão. P(ROI > 0) deve ser > 70%.

7

Share de spend vs efetividade

Comparar % do budget vs % da contribuição. Grandes discrepâncias = oportunidade de otimização.

8

Decomposição temporal

Stacked area chart: baseline + contribuição de cada canal ao longo do tempo. A soma acompanha o KPI real? Sazonalidade capturada?

9

Comparação de múltiplos modelos

Rodar mais de uma especificação e comparar. Seleção combina critérios estatísticos e de negócio.

Impacto financeiro do ModelReviewer: sem revisão automatizada, um R-hat de 1.35 passaria despercebido, resultando em decisões com ROI incorreto. Em um cliente com R$ 500K/mês em ads, isso pode significar R$ 55K/mês em prejuízo evitável.

Além da qualidade estatística, a estrutura causal do modelo determina se os resultados estão certos.
Capítulo 06 · Parte II

A estrutura causal: DAGs e quando single-layer falha

Um modelo com bom R² pode produzir ROIs completamente errados se a estrutura causal for inadequada.

6.1 Três checkpoints de adequação estrutural

  • Relação cronológica: a causa precede o efeito. Nenhuma variável de mídia tem coeficiente significativo em t-1 relativo ao KPI em t.
  • Não-inclusão lógica: evitar variáveis logicamente inclusivas. Não incluir "total digital spend" E "search spend + display spend", colinearidade perfeita.
  • Identificabilidade: o modelo determina unicamente cada parâmetro. Representar como DAG (Directed Acyclic Graph) ajuda a diagnosticar.

6.2 Impacto da estrutura na análise

Existe um exemplo clássico: o Click Route (Ad → Click → Conversão) é capturado bem por single-layer, com erro abaixo de 5%. O Search Route (Ad → Awareness → Search → Conversão) é uma rota indireta, single-layer não distingue efeito direto do indireto, e o erro pode chegar a 880%.

Implicação prática: se search representa mais de 15–20% das conversões, considere modelo de dois estágios ou inclua controles para organic search. O search "rouba" crédito de mídias de upper-funnel quando o modelo não está estruturado adequadamente.

6.3 Critérios de inferência causal

Single Door

Existe uma única "porta" não-confundida entre tratamento e resultado. Bloquear todos os outros caminhos condicionando em intermediárias.

Back Door

Bloquear caminhos espúrios condicionando nos confounders (causa comum de X e Y). Não condicionar em mediadores.

Front Door

Usar variável intermediária Z: estimar X→Z e Z→Y separadamente. Funciona mesmo com confounders não-observados.

Regra de ouro: o melhor modelo não é o mais complexo, é o mais simples que captura adequadamente a estrutura causal. Complexidade sem justificativa leva a overfitting e resultados difíceis de comunicar.

Entendidos os fundamentos, vamos implementar na prática com o Google Meridian.
Capítulo 07 · Parte III

O framework: Google Meridian na prática

Instalação, InputData, ModelSpec, treinamento MCMC e calibração com priors informativos.

7.1 Arquitetura modular

O Meridian é organizado em três módulos principais: meridian.data (processamento de dados, InputData, DataFrameBuilder), meridian.model (modelo bayesiano, Meridian, ModelSpec, fit/sample) e meridian.analysis (análise de resultados, Analyzer, optimize, summary_metrics).

7.2 InputData e ModelSpec

O InputData espera arrays com shape específico: KPI em (n_geos × n_times), mídia em (n_geos × n_times × n_channels). O Meridian faz escalonamento interno automaticamente (mean scaling para mídia), o que simplifica o pipeline em relação a frameworks anteriores como o LightweightMMM.

7.3 Treinamento MCMC

O fluxo padrão de treinamento usa três fases: n_adapt (2000 amostras de adaptação, ajuste do step size, descartadas), n_burnin (500 amostras de aquecimento, descartadas) e n_keep (1000 amostras finais, usadas na inferência). Com 2 ou 4 chains em paralelo, o output é uma posterior com 2.000 a 4.000 amostras por parâmetro.

7.4 Priors e calibração

Resultados de geo-lift tests ou conversion lift tests podem ser convertidos em priors LogNormal informados, um experimento com ROI = 2.0 e CI 95% [1.0, 3.0] vira um prior com μ = ln(2.0) e σ derivado do CI. Essa ponte entre evidência experimental e observacional é uma das principais vantagens do Meridian sobre frameworks puramente frequentistas.

Com o modelo treinado, o próximo passo é extrair e interpretar os resultados.
Capítulo 08 · Parte III

A análise: ROI, mROI, credible intervals e Reach & Frequency

Como ler os outputs do modelo e por que credible intervals importam mais do que médias.

8.1 Métricas fundamentais

MétricaDefiniçãoCálculo
ROIReturn on InvestmentReceita incremental / gasto total
mROIMarginal ROIΔReceita / ΔGasto (derivada no ponto atual)
ContribuiçãoEfeito incrementalReceita atribuída ao canal
BaselineLinha de baseReceita esperada sem marketing

8.2 Credible intervals

O modelo MCMC com 4 chains × 1000 amostras gera 4.000 estimativas para cada parâmetro. Mostrar apenas a média desperdiça informação crucial. Credible intervals mostram a faixa de incerteza:

CenárioSem CICom CI
TikTok ROI = 0.9"Corta! ROI < 1""42% de chance de ROI > 1. Teste mais 4 semanas."
Google ROI = 2.8"Investe mais!""IC [2.5, 3.1], alta confiança. Aumentar budget."

8.3 Reach & Frequency

Plataformas como Meta e YouTube fornecem Reach (pessoas únicas) e Frequency (vezes por pessoa). O efeito marginal satura com frequência alta, a primeira exposição entrega 100% do impacto, a terceira já está em 50%, a quinta em 12%, e da sétima em diante é desperdício.

Sem RF modelado: 1M impressões viram um ROI "médio" 1.5, invisível para o anunciante. Com RF: o modelo detecta saturação por exposição e recomenda redistribuir frequency cap.

Os insights de ROI e curvas de saturação nos levam à pergunta natural: como realocar budget?
Capítulo 09 · Parte III

A otimização: budget optimizer, cenários e gap analysis

Transformando insights em ação: das curvas de saturação à recomendação de alocação ótima.

9.1 Budget optimizer

O otimizador resolve: dada uma verba total fixa, como distribuí-la entre N canais para maximizar o KPI total? A solução utiliza as curvas de saturação estimadas, canais com ROI marginal alto recebem mais budget; canais saturados cedem budget. Restrições operacionais (min/max change por canal) garantem que a recomendação seja executável.

Erro comum: chamar analyzer.optimize() sem passar o parâmetro budget retorna None silenciosamente. Sempre passar o budget total explicitamente.

9.2 Cenários estratégicos vs táticos vs operacionais

Estratégico

Predição de KPI · Gap analysis (target vs forecast → investimento necessário) · Planejamento anual.

Tático

ROI por categoria/marca/região · Simulação de cenários ("e se aumentarmos TV em 20%?").

Operacional

Otimização de budget por canal · Recomendação de realocação · Maximizar KPI para budget fixo.

9.3 Gap analysis

Processo inverso: dado um target de receita, qual o investimento total necessário e como distribuí-lo? O modelo projeta a receita baseline (orgânica + sazonalidade) e calcula a receita incremental necessária de mídia. Depois otimiza a distribuição para atingir o gap com mínimo investimento.

Para operacionalizar tudo isso, coleta, treinamento, análise, otimização, a plataforma Precisian orquestra o processo end-to-end.
Capítulo 10 · Parte IV

A plataforma Precisian: arquitetura, API e lições aprendidas

Como a Precisian operacionaliza MMM em produção: 5 containers Docker, processamento assíncrono e relatórios automatizados.

10.1 Arquitetura Docker

Cinco containers orquestrados por docker-compose: Frontend (Next.js + TypeScript), Backend (FastAPI + Python, API REST e geração de relatórios), Worker (Celery + Meridian + GPU RTX 2060, MCMC e NumPyro/JAX), PostgreSQL (dados persistentes: runs, configs, results) e Redis (message broker do Celery e progress tracking).

10.2 API e endpoints

A API expõe ciclo de vida completo: POST /api/runs/ para criar execução, GET /api/runs/{id}/progress para acompanhar via Redis, POST /api/runs/{id}/analyze para análise por LLM, e três tipos de relatório: report (stakeholder), report-dashboard (marketing, 5 abas) e report-pitchdeck (C-suite, 11 slides).

10.3 Lições aprendidas

  • Painel balanceado: todas as regiões com o mesmo número de períodos. Validar antes de rodar.
  • Ponto decimal: vírgula causa erro de tipo. Sempre normalizar para ponto.
  • inference_data obrigatório: Analyzer sem inference_data=model.inference_data resulta em NoneType has no attribute 'posterior'.
  • budget obrigatório no optimizer: chamar sem o parâmetro retorna None silenciosamente.
  • Confiar em credible intervals, não em médias: a média esconde a incerteza que importa para a decisão.

Diferencial de operacionalização: consultorias tradicionais entregam o modelo em PDF. A Precisian entrega o modelo rodando em produção, com pipeline mensal automatizado, dashboard executivo e API para integração com BI do cliente.

A verdade dos seus dados

Pronto para implementar MMM
na sua operação?

A Precisian é um time de dados dedicado. Operamos na intersecção de marketing, tecnologia e negócio, transformando dados fragmentados em decisões confiáveis. Implementamos MMM com Google Meridian em e-commerces brasileiros, sem conflito de interesse com mídia, com transparência total e contexto de negócio que consultorias tradicionais não oferecem.

01
Já temos seus dados
02
Contexto de negócio
03
Sem conflito de interesse
04
Open-source auditável
Falar com um especialista em MMM
Conversa de 30 minutos · Sem compromisso · Diagnóstico do seu mix atual