Data Engineer (Databricks) | Specialist (Remoto)
Indexed description
.
Responsabilidades e atribuições
Construção e manutenção de pipelines de dados escaláveis e confiáveis, utilizando tecnologias modernas de processamento distribuído para garantir a ingestão, transformação e disponibilização de dados com qualidade e performance. Organização das tabelas em Delta Lake e Unity Catalog;
Implementação de uma esteira automatizada de MLOps nativa em Databricks on GCP, cobrindo o ciclo de vida completo dos modelos; Preparação de dados, geração de features, treinamento, validação, registro, deploy, serving, monitoramento e retreino automático; Atuação desde o discovery técnico com inventário dos modelos existentes, até a construção de um template padrão de pipeline validado em um piloto e migração progressiva dos modelos em ondas organizadas por criticidade. Atuação no modelo ágil, com sprints, rituais de refinamento, review e retrospectiva;
Requisitos e qualificações
Experiência com Databricks;
Experiência com PySpark e Apache Spark;
Experiência com Apache Airflow;
Experiência com BigQuery;
Experiência com integração e utilização do MLflow;
Conhecimento em AWS Glue;
Experiência com bancos de dados SQL e NoSQL, como PostgreSQL, MongoDB e Cassandra;
Requisitos Desejáveis:Desejável conhecimento em Apache Kafka;
Desejável conhecimento em dbt.
Create a free Caio profile to unlock more results and save your role and location preferences.
Unlock free search