Back to search
Lisit Getonbrd · Posted yesterday

Ingeniero ML / Data Scientist

Remote Remote

Machine Learning & AI fully_remote lang_not_specified remote_full
Continue to application Add your email once, then Caio opens the original posting.

Indexed description

Requisitos excluyentes

Excluyente
  • Python sólido (pandas, scikit-learn) y experiencia real llevando un modelo a producción en NLP en español.
  • Experiencia con tokenización, normalización de texto y manejo de errores ortográficos.
  • Experiencia con Transformers / Hugging Face para fine-tuning de BERT (ideal BETO u otro BERT en español) orientado a NER.
  • Etiquetado programático / weak supervision: construir datasets de entrenamiento sin etiquetado manual masivo.
  • Evaluación rigurosa: precision/recall/F1, conjuntos held-out y control de fuga de datos.
Cómo evaluamos el enfoque: necesitamos que puedas explicar de forma clara cómo construirías el dataset de entrenamiento cuando no existe corpus etiquetado y hay 1,8 M de pares históricos; y qué significa que un modelo esté calibrado y cómo lo comprobarías.We valoramos además una forma de trabajo ordenada y comunicable: foco en reproducibilidad, pensamiento crítico sobre métricas (held-out y fuga de datos) y mentalidad de transferencia hacia el cliente.

Projects

Lisit creamos, desarrollamos e implementamos servicios de software con foco constante en innovación y pasión por los desafíos. En este rol, trabajamos en la automatización y optimización de procesos mediante soluciones de NLP en español con impacto directo en la eficacia operativa de nuestros clientes. La misión del proyecto es construir y hacer evolucionar un pipeline reproducible a partir de 1,8 millones de pares históricos, transformándolo en un dataset de entrenamiento, entrenar y evaluar un modelo NER en español, calibrar el score de confianza y habilitar la transferencia del conocimiento y la solución al cliente para su adopción sostenida.

Misión

Misión: construir el corpus de entrenamiento a partir de 1,8 millones de pares históricos; hacer fine-tuning de un modelo NER en español; calibrar el score de confianza; y dejar el pipeline reproducible y traspasable al cliente.
  • Construir el dataset de entrenamiento sin etiquetado manual masivo (etiquetado programático / weak supervision).
  • Realizar tokenización y normalización de texto para NLP en español.
  • Entrenar y ajustar un modelo para NER en español (idealmente BERT en español, como BETO u otro BERT en español) con Transformers / Hugging Face.
  • Gestionar errores ortográficos y robustez del preprocesamiento.
  • Evaluar rigurosamente el desempeño con precision/recall/F1 usando conjuntos held-out y control de fuga de datos.
  • Calibrar probabilidades para que el umbral de confianza sea interpretable (score calibrado con métodos como Platt o isotónica).
  • Garantizar reproducibilidad: documentación del pipeline, trazabilidad de experimentos y empaquetado para que el cliente pueda replicarlo y operarlo.

Beneficios

100% remotoSi te interesa construir un pipeline reproducible, entrenar NER en español con enfoque en weak supervision y evaluar/calibrar con rigor, te invitamos a postular.

Deseable (suma puntos)

  • XGBoost y calibración de probabilidades (Platt / isotónica): el umbral de 0,82 debe significar probabilidad real.
  • Embeddings y búsqueda vectorial (pgvector, HNSW, sentence-transformers).
  • Fuzzy matching: distancias de edición, algoritmos fonéticos, pg_trgm.
  • MLflow para gestión de experimentos y despliegue.
  • ONNX y cuantización INT8 para inferencia eficiente en CPU (sin GPU).
  • libpostal.
  • Experiencia con direcciones postales, geocodificación o datos geográficos.
Free. 20 seconds. No password. See every match in this search.

Create a free Caio profile to unlock more results and save your role and location preferences.

Unlock free search
Want help applying to roles like this? Search Caio for free. If repetitive applications get heavy, Managed Job Search adds supervised execution for $99/month.
View Managed Job Search