Back to search
Caju Gupy · Posted 2d ago

Pessoa Engenheira de Dados Sênior

Brasil Full-time Remote

remote Brasil Gupy
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi

Benefícios

, Solução em Despesas Corporativas, Premiações e Caju Ciclos.

Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!

São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.

Inscreva-se e conheça mais sobre nosso time 🧡

Responsabilidades e atribuições

Integração, Ingestão e Orquestração Multi-Source:

Projetar e manter pipelines de integração heterogênea utilizando ferramentas como

Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.

Otimização de Performance, I/O e Custo (AWS & Databricks):

Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no

Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.

Arquitetura Event-Driven & Streaming:

Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).

Automação de Engenharia com IA:

Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).

Pipelines End-to-End e Modelagem:

Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura

Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.

Governança, Segurança e Qualidade:

Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.

Alinhamento e Documentação:

Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.

Requisitos e qualificações

Tempo de Experiência:

Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.

Otimização de I/O, Particionamento e Performance:

Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação,

Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.

Orquestração e Ingestão Heterogênea:

Experiência prática na integração e orquestração de dados utilizando

Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.

Event-Driven & Ingestão por Tópicos:

Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.

Stack Principal:

Domínio avançado de

Python,

PySpark e

SQL otimizado para processamento massivo e distribuído.

Plataforma Databricks & Lakehouse:

Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).

Nuvem AWS:

Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).

Automação com IA:

Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.

Engenharia de Software:

Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.

Modelagem e Governança:

Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).

Diferenciais:IA/GenAI para Dados:

Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).

Governança Avançada & IaC:

Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).

Data Contracts & Data Quality:

Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).

FinOps e Observabilidade:

Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.

Pipelines Financeiros:

Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.

Setores Regulados:

Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.

Informações adicionais

💳 Cartão Caju, com mais liberdade para usar seus

benefícios

(Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);🧘🏿‍♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;🏋🏿‍♀️ Wellhub;🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;💆🏽 Dia de recarregar - day off; 🧑🏿‍⚕️ Conexa Saúde - consulta médica online;👶🏿 Auxílio Creche;📚 Parceria com Alura;👨🏿‍💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;💻 Oferecemos equipamento de trabalho;🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!

A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.

Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas) Se interessou? #VemSerCaju 🧡

Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search