Back to search
Getnet Platforms Linkedin · Posted 4d ago

Data Engineer - Streaming & Batch Pipelines

Spain

Linkedin
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

SE REQUIERE

Experiencia

  • 3+ años de experiencia como Data Engineer en entornos productivos de gran volumen, con experiencia sólida en Apache Spark, tanto en procesamiento batch como en Spark Structured Streaming, utilizando PySpark o Scala.

Estudios

  • Technical degree-level education: Bachelor's degree in Engineering, Technology Sciences, Mathematics, Economics, Physics, Chemistry, Statistics, or similar.

Technical skills

  • Apache Spark con PySpark o Scala: batch y Spark Structured Streaming.
  • Delta Lake: MERGE, upserts, time travel, optimización de ficheros y gestión de esquemas.
  • Apache Kafka y Confluent: productores y consumidores, particionado, Schema Registry y CDC mediante Debezium.
  • Ecosistema de datos de AWS: Glue, Data Catalog, ETL, Lambda, S3, EMR y EMR Serverless.
  • AWS Lake Formation: permisos a nivel de tabla y columna y gobierno de acceso.
  • Amazon SageMaker: integración de pipelines de datos con flujos de Machine Learning.
  • SQL avanzado y modelado de datos dimensional.
  • Change Data Capture y Slowly Changing Dimensions.
  • Git, CI/CD y buenas prácticas de testing en proyectos de datos.

Otras informaciones

Se valorará:

  • Experiencia con Kafka Streams o ksqlDB.
  • Experiencia con arquitecturas de lookup tables a gran escala, incluyendo point lookup, bucketing y Bloom Filters.
  • Conocimientos de Terraform o CloudFormation para infraestructura como código.
  • Experiencia en sectores regulados, especialmente en el sector financiero o de medios de pago.
  • Certificaciones AWS, como Data Analytics Specialty o Solutions Architect.
  • Buscamos un perfil con capacidad para realizar debugging profundo en sistemas distribuidos, autonomía y mentalidad "you build it, you run it".

RESPONSABILIDADES CLAVE

  • Diseñar, construir y operar pipelines de ingesta y transformación de datos en tiempo real y por lotes sobre una plataforma AWS nativa de streaming basada en Kafka/Confluent, Spark Structured Streaming y Delta Lake, con foco en fiabilidad, rendimiento y escalabilidad.

Actividades principales

  • Diseñar, desarrollar y mantener pipelines de streaming con Spark Structured Streaming y procesos batch sobre AWS.
  • Implementar lógica CDC, joins de enriquecimiento, gestión de checkpoints y offsets, y tratamiento de DLQ.
  • Integrar y mantener conectores y componentes de Confluent Kafka, incluyendo topics, Schema Registry, particionado y optimización del throughput.
  • Construir y optimizar tablas Delta Lake mediante particionado, Z-Ordering o Liquid Clustering, compactación, operaciones MERGE/upsert y gestión de esquemas.
  • Desarrollar y mantener jobs en AWS Glue, incluyendo crawlers, catálogo y procesos ETL, así como funciones AWS Lambda para orquestación y procesamiento event-driven.
  • Operar y optimizar cargas Spark en EMR y EMR Serverless mediante tuning de memoria, particionado, shuffle, Adaptive Query Execution y resolución de cuellos de botella.
  • Colaborar con los equipos de Data Science y Machine Learning en la preparación de datasets y pipelines de features para SageMaker.
  • Diseñar estrategias para gestionar tablas de referencia o lookup a gran escala, utilizando point lookup, caching y particionado para realizar joins de enriquecimiento eficientes.
  • Implementar monitorización, alertado y mecanismos de resiliencia para pipelines 24/7, incluyendo heartbeats, reintentos y checkpointing.
  • Evolucionar el framework interno de ETL basado en YAML y Spark, aplicando CI/CD, testing e infraestructura como código.
Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search