Sparquet
★ 4Framework open source de engenharia de dados para Apache Spark. Cada pipeline é um único contrato JSON declarativo: escreva na mão, gere com qualquer LLM, ou desenhe visualmente no Sparquet Studio.
São Paulo, Brasil
Engenheiro de Dados com 5+ anos de experiência construindo pipelines robustos em arquiteturas cloud. Especializado em migração de sistemas legados, processamento ETL/ELT com Spark, e infraestrutura de dados em AWS/GCP. Foco em qualidade, integridade e disponibilidade dos dados usando tecnologias open source como Spark, Kafka e Airflow.
2025 — Hoje
Liderou migração complexa de pipeline mainframe (Cobol/DB2) para AWS processando ingestão massiva de arquivos posicionais diários. Implementou validação e qualidade de dados com geração de tabelas consolidadas (bronze/silver/gold) para ML e outros produtos. Deploy em produção com dual-running entre ambientes, integrações via EventBridge, APIs REST e IaC com CloudFormation.
2025 — 2026
Manteve ecossistema Databricks com DLT, Unity Catalog e Delta Lake garantindo SLA de 90% de disponibilidade. Otimizou pipelines batch PySpark, reduzindo tempo de processamento em 40% através de query optimization. Implementou novo pipeline end-to-end utilizando PySpark, Kafka e APIs, colaborando com o time de Analytics para confiabilidade de dados.
2024 — 2025
Desenvolveu pipeline GCP end-to-end focado em ingestão de dados de múltiplas fontes. Implementou validações de qualidade de dados com DuckDB em Cloud Functions, e automatizou processos com Composer (Apache Airflow), reduzindo intervenções manuais.
2022 — 2025
Arquiteto de Data Lake em Hadoop/AWS (20+ TB diários) liderando a migração on-premise para AWS. Entregou projetos de qualidade de dados, geração de leads, pipelines de crédito e alimentação de ML. Processamento incremental de arquivos XML/CSV on-premise e em AWS, com orquestração robusta de 100+ jobs diários e APIs REST.
2021 — 2022
Manteve Data Lake em Hadoop com limpeza de dados e compactação de partições. Desenvolveu scripts Python/Scala para validação de integridade e reprocessamento histórico, e deu suporte à infraestrutura de Spark em ambientes staging e produção.
Framework open source de engenharia de dados para Apache Spark. Cada pipeline é um único contrato JSON declarativo: escreva na mão, gere com qualquer LLM, ou desenhe visualmente no Sparquet Studio.
Qualidade de dados para Spark que roda onde seus dados já estão. Checks de métricas estilo SODA, regras em SQL, contratos de schema — mais uma separação válido/inválido que mostra qual regra rejeitou cada linha. PySpark puro, sem serviços extras.
Um dashboard de finanças pessoais que lê a planilha que você já mantém no OneDrive. Receitas e despesas por mês, gastos por categoria e por semana, cartão de crédito, e uma tela só para investimentos — aportes não contam como gasto, rendimentos não contam como receita. Sem banco de dados, sem formato novo: ele mapeia as colunas que você já usa.
Um projeto pessoal para executar trades reais na Binance e ajudar a gerar uma renda extra.
Projeto em estágio inicial — poucos detalhes públicos ainda.
2025 – 2026
Inbix Academy
MBA - IA para Inovação
2024 – 2025
FIAP
MBA - Engenharia de Dados
2020 – 2022
FATEC São Paulo
Tecnólogo, Análise e Desenvolvimento de Sistemas
2017 – 2019
ETEC Jardim Ângela
Técnico de Informática Integrado ao Médio
Estou aberto a novas oportunidades e colaborações — fique à vontade para entrar em contato.