Entre as plataformas de dados que construí e modernizei, três resultados se destacam: quatro vezes mais throughput, 34% menos custo no Snowflake e 72% menos incidentes de dados. Esses números não vieram de uma única consulta inteligente. Vieram de mudar como a plataforma move, mede e assume responsabilidade pelos dados.
Parar de recalcular o que não mudou
Pipelines batch grandes frequentemente pagam para redescobrir o mesmo estado. Migrar para CDC e modelos incrementais reduz dados varridos, encurta o feedback e transforma atualização em capacidade do produto. O trabalho importante não é apenas habilitar uma stream; é definir chaves, ordenação, deduplicação e replay.
Projetar Spark em torno do movimento de dados
Throughput melhora quando partições combinam com o workload, joins evitam shuffles desnecessários, skew é visível e fronteiras de serialização são deliberadas. Planos físicos de execução fazem parte da aplicação; não são detalhe do engine.
medir(tempo_da_etapa, shuffle, skew)
→ isolar o movimento dominante
→ ajustar particionamento ou limite do modelo
→ validar com dados representativos
→ comparar custo e latência
→ manter ou reverter
Tornar o custo do warehouse atribuível
Otimização no Snowflake se sustenta quando consumo pode ser associado a workload, responsável e nível de serviço. Tamanho do warehouse, auto-suspend, modelos incrementais no dbt, clustering e formato das consultas se tornam decisões de produto com trade-offs visíveis.
Tratar confiabilidade como contrato
A redução de incidentes veio de antecipar verificações e tornar ownership explícito: schema, atualização, volume, unicidade, integridade referencial e invariantes de negócio. Um pipeline deve falhar com diagnóstico útil antes que dados ruins cheguem a um modelo usado por clientes.
O efeito composto
Processamento incremental reduz custo e latência. Observabilidade revela gargalos físicos e contratos ruins. Ownership claro encurta resposta. Replay seguro reduz o medo de mudar. Essas melhorias se reforçam.
Uma plataforma de dados sênior não é a que tem mais ferramentas. É a que torna atualização, custo e comportamento de falha intencionais.
As métricas importam porque mostram que a arquitetura mudou a experiência do negócio: dados mais rápidos, menor custo operacional e menos interrupções para quem depende deles.