Entre as plataformas de dados que construí e modernizei, três resultados se destacam: quatro vezes mais throughput, 34% menos custo no Snowflake e 72% menos incidentes de dados. Esses números não vieram de uma única consulta inteligente. Vieram de mudar como a plataforma move, mede e assume responsabilidade pelos dados.

Parar de recalcular o que não mudou

Pipelines batch grandes frequentemente pagam para redescobrir o mesmo estado. Migrar para CDC e modelos incrementais reduz dados varridos, encurta o feedback e transforma atualização em capacidade do produto. O trabalho importante não é apenas habilitar uma stream; é definir chaves, ordenação, deduplicação e replay.

Projetar Spark em torno do movimento de dados

Throughput melhora quando partições combinam com o workload, joins evitam shuffles desnecessários, skew é visível e fronteiras de serialização são deliberadas. Planos físicos de execução fazem parte da aplicação; não são detalhe do engine.

Ciclo de otimização
medir(tempo_da_etapa, shuffle, skew)
  → isolar o movimento dominante
  → ajustar particionamento ou limite do modelo
  → validar com dados representativos
  → comparar custo e latência
  → manter ou reverter

Tornar o custo do warehouse atribuível

Otimização no Snowflake se sustenta quando consumo pode ser associado a workload, responsável e nível de serviço. Tamanho do warehouse, auto-suspend, modelos incrementais no dbt, clustering e formato das consultas se tornam decisões de produto com trade-offs visíveis.

Tratar confiabilidade como contrato

A redução de incidentes veio de antecipar verificações e tornar ownership explícito: schema, atualização, volume, unicidade, integridade referencial e invariantes de negócio. Um pipeline deve falhar com diagnóstico útil antes que dados ruins cheguem a um modelo usado por clientes.

Atualização: definir atraso em termos de negócio.
Replay: tornar reprocessamento seguro, limitado e observável.
Ownership: todo produto de dados tem equipe responsável e escalonamento.
Custo: uso é mensurável na mesma fronteira do valor.

O efeito composto

Processamento incremental reduz custo e latência. Observabilidade revela gargalos físicos e contratos ruins. Ownership claro encurta resposta. Replay seguro reduz o medo de mudar. Essas melhorias se reforçam.

Uma plataforma de dados sênior não é a que tem mais ferramentas. É a que torna atualização, custo e comportamento de falha intencionais.

As métricas importam porque mostram que a arquitetura mudou a experiência do negócio: dados mais rápidos, menor custo operacional e menos interrupções para quem depende deles.