São Paulo, Brasil

Olá, eu sou o Victor. Engenheiro de Dados.

Engenheiro de Dados com 5+ anos de experiência construindo pipelines robustos em arquiteturas cloud. Especializado em migração de sistemas legados, processamento ETL/ELT com Spark, e infraestrutura de dados em AWS/GCP. Foco em qualidade, integridade e disponibilidade dos dados usando tecnologias open source como Spark, Kafka e Airflow.

Experiência

  1. 2025 — Hoje

    Especialista de Dados · Serasa Experian (pela ACT Digital)

    Liderou migração complexa de pipeline mainframe (Cobol/DB2) para AWS processando ingestão massiva de arquivos posicionais diários. Implementou validação e qualidade de dados com geração de tabelas consolidadas (bronze/silver/gold) para ML e outros produtos. Deploy em produção com dual-running entre ambientes, integrações via EventBridge, APIs REST e IaC com CloudFormation.

    Spark (Scala/Python)DuckDBPandasPolarsPySparkEMREC2LambdaSQSMSKMWAAS3IcebergDeltaLakeAthenaRDS/AuroraDynamoDBDocumentDBGlueCatalogDatadogGrafanaCloudWatch
  2. 2025 — 2026

    Engenheiro de Dados III · Vert Capital (pela Stech Soluções)

    Manteve ecossistema Databricks com DLT, Unity Catalog e Delta Lake garantindo SLA de 90% de disponibilidade. Otimizou pipelines batch PySpark, reduzindo tempo de processamento em 40% através de query optimization. Implementou novo pipeline end-to-end utilizando PySpark, Kafka e APIs, colaborando com o time de Analytics para confiabilidade de dados.

    DatabricksDLTUnityCatalogPySparkDeltaLakeKafkaPostgreSQLDjangoMetabasePowerBI
  3. 2024 — 2025

    Engenheiro de Dados II · Stech Soluções

    Desenvolveu pipeline GCP end-to-end focado em ingestão de dados de múltiplas fontes. Implementou validações de qualidade de dados com DuckDB em Cloud Functions, e automatizou processos com Composer (Apache Airflow), reduzindo intervenções manuais.

    GCPCloud StorageBigQueryCompute EngineCloud FunctionsComposerPythonDuckDB
  4. 2022 — 2025

    Engenheiro de Dados I · SPC Brasil

    Arquiteto de Data Lake em Hadoop/AWS (20+ TB diários) liderando a migração on-premise para AWS. Entregou projetos de qualidade de dados, geração de leads, pipelines de crédito e alimentação de ML. Processamento incremental de arquivos XML/CSV on-premise e em AWS, com orquestração robusta de 100+ jobs diários e APIs REST.

    Spark (Scala/PySpark/Java)HadoopAirflowKafkaNiFiCtrlMRabbitMQAWS (EC2, EMR, Glue, S3, Athena)HiveImpalaSqoopTerraformMySQLMongoDBOraclePowerBIElasticSearch
  5. 2021 — 2022

    Estagiário em Engenharia de Dados · SPC Brasil

    Manteve Data Lake em Hadoop com limpeza de dados e compactação de partições. Desenvolveu scripts Python/Scala para validação de integridade e reprocessamento histórico, e deu suporte à infraestrutura de Spark em ambientes staging e produção.

    HadoopPythonScalaSpark

Projetos

Sparquet

4

Framework open source de engenharia de dados para Apache Spark. Cada pipeline é um único contrato JSON declarativo: escreva na mão, gere com qualquer LLM, ou desenhe visualmente no Sparquet Studio.

TypeScriptapache-sparkdata-engineeringdatabricks

Sparquet Cola

3

Qualidade de dados para Spark que roda onde seus dados já estão. Checks de métricas estilo SODA, regras em SQL, contratos de schema — mais uma separação válido/inválido que mostra qual regra rejeitou cada linha. PySpark puro, sem serviços extras.

Pythonapache-sparkdata-qualitydata-validation

Pulse

Um dashboard de finanças pessoais que lê a planilha que você já mantém no OneDrive. Receitas e despesas por mês, gastos por categoria e por semana, cartão de crédito, e uma tela só para investimentos — aportes não contam como gasto, rendimentos não contam como receita. Sem banco de dados, sem formato novo: ele mapeia as colunas que você já usa.

TypeScriptnextjsreacttailwindcss

Trader Bot

Um projeto pessoal para executar trades reais na Binance e ajudar a gerar uma renda extra.

Projeto em estágio inicial — poucos detalhes públicos ainda.

Skills

Linguagens

Python (PySpark, Pandas, Polars, DuckDB)ScalaJavaSQLCobolRust

ETL / ELT

Spark (Batch/Streaming)GlueEMREC2 (spot)LambdaSqoopDataFusion CometDatabricksSnowflakeCompute EngineCloud FunctionsIncrementalCDC

Mensageria

KafkaSQSMSKRabbitMQRedpanda

Orquestração

AirflowMWAAEventBridgeStep FunctionsComposerCtrlMNiFiDatabricks DLTDatabricks Workflows

Storage e Lakehouse

S3GlueCatalogIcebergHadoopKuduBigQueryCloud StorageDeltaLakeUnityCatalogArquitetura Medalhão

Banco de Dados

RDS/AuroraPostgreSQLMySQLDynamoDBMongoDBDocumentDBOracleDB2

Infra

TerraformTerragruntCloudFormation

Analytics e Observabilidade

DatadogGrafanaMetabasePowerBIHiveImpalaElasticSearchCloudWatchAthena

Outros

CI/CD (Cockpit)Git (GitLab, Bitbucket)Linux (Shell/Bash Script)

Formação Acadêmica

  • 2025 – 2026

    Inbix Academy

    MBA - IA para Inovação

  • 2024 – 2025

    FIAP

    MBA - Engenharia de Dados

  • 2020 – 2022

    FATEC São Paulo

    Tecnólogo, Análise e Desenvolvimento de Sistemas

  • 2017 – 2019

    ETEC Jardim Ângela

    Técnico de Informática Integrado ao Médio

Contato

Estou aberto a novas oportunidades e colaborações — fique à vontade para entrar em contato.