AWS Data Engineer
AGREGAR UN RESUMEN ATRACTIVO Y FRESCO DEL RETO QUE ES LA POSICIÓN
Normalmente respondemos en un plazo de tres días
No solo buscamos talento, buscamos mentes curiosas que disfruten aprender y transformar el futuro.
Somos tech, somos exigentes y sí, vamos rápido. Pero nadie compite solo. Trabajamos en equipo y si buscas retos que te saquen de la zona cómoda (porque ahí no crece nadie), estás en el lugar correcto. Aquí aprenderás con expertos, participarás en proyectos de alto impacto y estarás siempre un paso adelante en tecnología.
Buscamos un Data Engineer con más de 3 años de experiencia en el desarrollo y mantenimiento de pipelines de datos en entornos cloud (AWS). El candidato será responsable de construir procesos ETL/ELT robustos, aplicar buenas prácticas de calidad de datos y colaborar con el equipo técnico para asegurar que la información esté disponible, limpia y optimizada para los productos analíticos.
1. Experiencia y Requisitos Generales
Experiencia Profesional: 3+ años de experiencia profesional trabajando como Data Engineer, construyendo y operando data pipelines en la nube con volúmenes de datos medianos y grandes.
Trabajo en Equipo: Experiencia colaborando en equipos multidisciplinarios bajo metodologías ágiles y capacidad para entender requerimientos técnicos brindados por arquitectos o líderes de equipo.
Idiomas: Inglés Intermedio (capacidad para leer documentación técnica y participar en comunicaciones escritas/reuniones de equipo).
2. Hard Skills (Competencias Técnicas)
1) Servicios AWS y Conceptos de Data Mesh
Descripción: Manejo práctico de servicios de almacenamiento, cómputo y bases de datos en AWS, interactuando con arquitecturas orientadas a productos de datos.
Nivel Mínimo: Experiencia operativa y de desarrollo en AWS usando Amazon S3, AWS Glue, Amazon Redshift, Athena, AWS Lambda y Step Functions.
Nivel Ideal: Capacidad para desplegar y configurar componentes de datos en AWS siguiendo las arquitecturas y patrones definidos por el equipo.
Nivel Ideal Plus: Familiaridad con conceptos de Data Mesh, uso de AWS Lake Formation y nociones de optimización de costos en la nube.
2) Data Pipelines y Procesamiento Distribuido
Descripción: Construcción, orquestación y monitoreo de data pipelines (ETL/ELT) para la ingestión, transformación y carga de datos.
Nivel Mínimo: Experiencia creando pipelines productivos con procesos batch e incrementales, manejo de dependencias y control de errores.
Nivel Ideal: Dominio de Python y PySpark/Spark para transformaciones distribuidas; experiencia con AWS Glue o EMR, manejo de particiones y reintentos.
Nivel Ideal Plus: Experiencia optimizando el rendimiento de jobs en Spark y consumo en pipelines near real-time o guiados por eventos (event-driven).
3) SQL Avanzado y Consultas
Descripción: Escritura y optimización de consultas SQL para transformación, validación y análisis de datos.
Nivel Mínimo: Dominio de SQL intermedio-avanzado (joins, CTEs, window functions, agregaciones) y experiencia trabajando con Amazon Redshift u otros data warehouses.
Nivel Ideal: Habilidad para diagnosticar consultas lentas, entender planes de ejecución simples y aplicar buenas prácticas de modelado y particionamiento.
Nivel Ideal Plus: Optimización activa de sort/distribution keys en Redshift y sintonización de consultas para reducción de tiempos de ejecución.
4) Data Quality y Monitoreo
Descripción: Implementación de validaciones y controles para garantizar la calidad y consistencia de la información en los pipelines.
Nivel Mínimo: Experiencia aplicando reglas de validación de calidad de datos (duplicados, nulos, formatos) dentro de los flujos de transformación.
Nivel Ideal: Implementación de alertas automatizadas y registro de métricas de calidad para la detección oportuna de fallos.
Nivel Ideal Plus: Uso e integración de frameworks de Data Quality (ej. Great Expectations, Deequ) y seguimiento de linaje de datos.
5) GitHub y Prácticas de Desarrollo (CI/CD)
Descripción: Aplicación de buenas prácticas de desarrollo de software para el control de versiones y despliegue de código.
Nivel Mínimo: Manejo cotidiano de Git/GitHub (branching, pull requests, resolución de conflictos) y documentación de código.
Nivel Ideal: Participación activa en revisiones de código (code reviews) e integración de pipelines de datos en flujos básicos de CI/CD.
Nivel Ideal Plus: Creación y mantenimiento de scripts de automatización para pruebas y despliegues en distintos ambientes (Dev/QA/Prod).4. Responsabilidades Principales
Desarrollo de Pipelines: Construir, probar y mantener pipelines ETL/ELT en AWS utilizando Python, PySpark y SQL.
Transformación y Optimización: Implementar transformaciones de datos eficientes asegurando el correcto particionamiento y manejo de errores.
Calidad de Datos: Aplicar reglas de validación y monitoreo para asegurar la integridad y exactitud de las tablas y Data Products.
Mantenimiento y Soporte: Investigar y resolver fallos o incidencias en los pipelines de producción de manera oportuna.
Buenas Prácticas: Versionar el código en GitHub, participar en revisiones de código y documentar los flujos desarrollados.
Colaboración: Trabajar de la mano con analistas de datos, científicos de datos y arquitectos para entender las necesidades de integración.
¿Qué tenemos para ti?
Apoyamos tu crecimiento personal y profesional con planes de desarrollo individual, donde tu eres dueñ@ de tu carrera y hasta dónde quieres llegar.
Días de descanso superiores a los de la ley: No es necesario esperar un año para disfrutar de tus días de vacaiones, además de días adicionales por tipos de eventos especiales y festividades.
Beneficios económicos adicionales a tu salario: Vales de despensa, fondo de ahorro, bolsa de capacitación, bono de bienestar, convenios y descuentos.
Apoyo emocional, queremos tu estabilidad en salud fisica y mental, por ello tenemos diversos beneficios que cubren aspectos de equilibrio personal para ti y salud para tu familia. ¡Queremos cuidar de ti y los tuyos!
Aquí hay espacio para gente buena… como tú, ¡Queremos conocerte!
- Departamento
- Talent Discovery México
- Puesto
- Data Engineer
- Ubicaciones
- Ciudad de México
- Estado remoto
- Híbrido
Acerca de Bluetab, an IBM Company
Bluetab forma parte de IBM Consulting, empoderando a las empresas líderes de EMEA y LATAM para desbloquear todo su potencial de datos. Con un equipo de más de 1,600 especialistas en Data, Analytics e Inteligencia Artificial, creamos y ejecutamos soluciones transformadoras que potencian decisiones estratégicas, optimizan operaciones y generan resultados de alto impacto.