Pessoa Engenheira de Dados Sênior
Indexed description
A Caju é uma empresa brasileira de tecnologia, que busca dar mais sabor à vida profissional, transformando a relação entre empresas e colaboradores por meio de soluções mais inovadoras e seguras como o Cartão Multi
Benefícios
, Solução em Despesas Corporativas, Premiações e Caju Ciclos.
Aqui na Caju, aprendemos sempre, e nos tornamos cada vez melhores em um ambiente colaborativo e divertido!
São muito bem-vindas candidaturas de pessoas negras/pretas, mulheres, indígenas, LGBTQIA+, ou outros grupos minorizados.
Inscreva-se e conheça mais sobre nosso time 🧡
Responsabilidades e atribuições
Integração, Ingestão e Orquestração Multi-Source:
Projetar e manter pipelines de integração heterogênea utilizando ferramentas como
Apache Airflow, Dagster, Airbyte, AWS DMS, DBT, Kubernetes, APIs REST, SFTP e conectores diversos para ingestão contínua.
Otimização de Performance, I/O e Custo (AWS & Databricks):
Aplicar técnicas avançadas de particionamento, indexação (Z-Ordering/Liquid Clustering), otimização de layout de arquivos e estratégias de escrita/leitura no
Amazon S3, Databricks e dbt, visando eliminar varreduras excessivas (full table scans), diminuir custos de requisições S3 (GET/LIST) e acelerar o consumo de consultas.
Arquitetura Event-Driven & Streaming:
Projetar e implementar ingestão de dados em tempo real por tópicos e eventos (ex: Apache Kafka, AWS Kinesis, Event Hubs), eliminando a dependência direta de consultas e cargas massivas em bancos relacionais (PostgreSQL, MySQL).
Automação de Engenharia com IA:
Implementar ferramentas, agentes e pipelines de GenAI/LLMs para automatizar tarefas operacionais da engenharia (ex: geração automática de documentação, pipelines, data quality checks, tradução/refatoração de SQL, análise de causa raiz de falhas, PRs).
Pipelines End-to-End e Modelagem:
Projetar, construir e manter pipelines robustos, aplicando modelagem dimensional e arquitetura
Medallion para entregar dados limpos, agregados e otimizados tanto no processo de ingestão quanto no de consumo.
Governança, Segurança e Qualidade:
Garantir compliance (LGPD/GDPR), mascaramento de dados sensíveis, lineage, controle de acesso granular e monitoramento proativo de data freshness e data quality.
Alinhamento e Documentação:
Realizar levantamento de necessidades junto às áreas de negócio, documentar arquiteturas, definir data contracts e assegurar a governança e manutenibilidade dos pipelines.
Requisitos e qualificações
Tempo de Experiência:
Experiência sólida em engenharia de dados, atuando em ambientes de produção de grande volume e alta criticidade.
Otimização de I/O, Particionamento e Performance:
Domínio prático de estratégias de particionamento, otimização de layouts de dados (Small File Problem, compactação,
Z-Ordering) e otimização de consultas para prevenir leituras excessivas no Amazon S3 e garantir baixo tempo de resposta no Databricks e dbt.
Orquestração e Ingestão Heterogênea:
Experiência prática na integração e orquestração de dados utilizando
Airflow, Dagster, Airbyte, AWS DMS, dbt, Kubernetes, APIs REST, SFTP e conectores customizados.
Event-Driven & Ingestão por Tópicos:
Vivência prática na arquitetura de ingestão baseada em eventos/tópicos (Kafka, Kinesis, Pulsar, RabbitMQ) para substituir a dependência de bancos relacionais.
Stack Principal:
Domínio avançado de
Python,
PySpark e
SQL otimizado para processamento massivo e distribuído.
Plataforma Databricks & Lakehouse:
Experiência profunda no ecossistema Databricks (Delta Lake, Auto Loader, Structured Streaming, Jobs/Workflows, Medallion Architecture).
Nuvem AWS:
Vivência em serviços AWS voltados a dados (S3, IAM, Redshift, DynamoDB, Data Catalog, AWS DMS).
Automação com IA:
Conhecimento prático ou forte interesse em utilizar ferramentas/LLMs para automação de tarefas de desenvolvimento e engenharia de dados.
Engenharia de Software:
Vivência com testes automatizados, controle de versão (Git/GitHub), revisão de PRs e pipelines de CI/CD.
Modelagem e Governança:
Domínio em modelagem de dados (Dimensional, Star/Snowflake) e diretrizes de segurança e privacidade (LGPD/GDPR).
Diferenciais:IA/GenAI para Dados:
Experiência com pipelines para suporte a IA (ingestão, chunking e embeddings para Vector Search, Feature Stores, governança via Unity Catalog).
Governança Avançada & IaC:
Experiência com Unity Catalog, Terraform e Databricks Asset Bundles (DAB).
Data Contracts & Data Quality:
Implementação de contratos de dados na origem e uso de frameworks de qualidade/observabilidade (Great Expectations, Soda, dbt tests, Datadog).
FinOps e Observabilidade:
Gestão proativa e alertas de anomalias de custos em nuvem/Databricks por tabela e pipeline, alinhada à detecção estatística de data drift.
Pipelines Financeiros:
Vivência em idempotência, conciliação de saldos e reprocessamento financeiro.
Setores Regulados:
Experiência prévia em ambientes fintech, meios de pagamento ou saúde, lidando com compliance e auditorias de dados.
Informações adicionais
💳 Cartão Caju, com mais liberdade para usar seus
benefícios
(Refeição, Alimentação, Mobilidade, Saúde, Home Office, Cultura e Educação);🏥 Plano de Saúde sem coparticipação (Unimed, Sulamerica ou Alice);🧘🏿♀️ Zenklub, com consultas onlines com terapeutas e coaches para cuidar da sua saúde mental;🏋🏿♀️ Wellhub;🗣️ Aqui também estimulamos o aprendizado de idiomas, com a parceria da Rosetta Stone;💆🏽 Dia de recarregar - day off; 🧑🏿⚕️ Conexa Saúde - consulta médica online;👶🏿 Auxílio Creche;📚 Parceria com Alura;👨🏿💻 Trabalho Remoto, para você trabalhar de onde quiser dentro do Brasil;💻 Oferecemos equipamento de trabalho;🚀 Muitas possibilidades de crescimento - temos muito a crescer e esperamos fortemente que você nos ajude com isso!
A Caju é uma empresa brasileira e aceita pessoas de todas as regiões do país.
Trabalhamos em um modelo 100% remoto(quem tiver interesse de conhecer ou trabalhar no escritório, localizado em São Paulo, estaremos de portas abertas) Se interessou? #VemSerCaju 🧡
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search