Preguntas de entrevista para ingeniero de datos, por ronda
Por Aaron Cao · Actualizado el

Los procesos de ingeniero de datos cubren SQL avanzado, modelado de datos, diseño de pipelines y ETL, procesamiento distribuido y rondas conductuales. La ronda de diseño de pipelines decide la mayoría de los resultados: pregunta cómo manejas datos tardíos, reintentos y fallos, no qué herramienta prefieres.
¿Qué rondas incluye un proceso de ingeniero de datos?
Puede que te estés preparando igual que para un proceso de ingeniería de software, preguntándote qué cambia. Esta sección mapea las rondas que reutilizan estas entrevistas, para que dediques tu tiempo a las dos que realmente separan a los candidatos. El filtro técnico rara vez es donde se pierden las ofertas.
- SQL. Funciones de ventana, deduplicación y rendimiento de consultas, casi siempre en vivo.
- Modelado de datos. Diseñar tablas para un negocio descrito, y defender la granularidad elegida.
- Diseño de pipelines y ETL. Una ronda de diseño de sistemas abierta, acotada al movimiento de datos.
- Procesamiento distribuido. Cómo ejecuta realmente tu trabajo un framework, y por qué es lento.
- Programación. Python o Scala, a menudo más ligera que una ronda de ingeniería de software.
- Conductual. Incidentes de guardia, dashboards rotos y stakeholders que querían el número ayer.
Los títulos se solapan mucho con analytics engineering y roles de plataforma, así que la mezcla varía. Los bancos de roles relacionados están en el hub de preguntas de entrevista por rol.
¿Qué preguntas de SQL y modelado de datos aparecen?
SQL
- Deduplica una tabla conservando solo la fila más reciente por clave.
- Escribe una consulta que devuelva el número de sesiones de cada usuario usando un vacío de inactividad de 30 minutos.
- Calcula un total acumulado y una variación mes contra mes en una sola consulta.
- Encuentra filas presentes en el snapshot de ayer pero ausentes en el de hoy.
- ¿Qué hace
QUALIFY, y qué escribirías sin él? - Esta consulta escanea mil millones de filas y tarda veinte minutos. ¿Cómo la diagnosticas?
- Explica la diferencia entre particionar y agrupar (clustering), y cuándo ayuda cada una.
Modelado de datos
- Diseña las tablas para el historial de pedidos de un marketplace online. ¿Cuál es la granularidad de tu tabla de hechos?
- Explica un esquema en estrella, y cuándo desnormalizarías deliberadamente aún más.
- ¿Qué es una dimensión de cambio lento, y cómo implementas el tipo dos?
- Un stakeholder quiere que los reportes históricos reflejen la región actual de un cliente. ¿Qué se rompe?
- ¿Cómo modelarías un flujo de eventos que llega desordenado?
- ¿Cuándo elegirías una tabla ancha sobre un modelo normalizado?
La ronda de modelado premia comprometerse con una granularidad y defenderla. Los candidatos que describen tres diseños posibles sin elegir uno puntúan peor que quienes eligen un diseño razonable y nombran su debilidad.
¿Qué preguntas de pipelines y procesamiento distribuido aparecen?
Diseño de pipelines y ETL
- Diseña un pipeline que cargue las transacciones diarias en un warehouse para reportes.
- La fuente upstream vuelve a enviar los datos de ayer. ¿Qué le pasa a tu trabajo?
- ¿Cómo haces idempotente un pipeline, y por qué importa para los reruns?
- ¿Cómo harías un backfill de dos años de historial sin interrumpir la carga diaria?
- Datos que llegan tarde aparecen tres días después de cerrada la partición. ¿Qué haces?
- ¿Cómo detectarías que un pipeline tuvo éxito pero produjo datos incorrectos?
- ¿Qué monitoreas, y qué alerta a alguien a las tres de la mañana?
Procesamiento distribuido y streaming
- ¿Qué causa un shuffle, y por qué es costoso?
- Tu trabajo va lento y una tarea tarda mucho más que el resto. ¿Qué está pasando?
- Explica el data skew y dos formas de manejarlo.
- ¿Cuándo elegirías streaming sobre un job batch programado?
- ¿Qué garantiza realmente el procesamiento exactly once, y dónde no se cumple?
- ¿Cómo manejan los watermarks los eventos desordenados en una agregación con ventanas?
Fíjate en qué pocas de estas te piden nombrar una herramienta. Nombrar una es el inicio de la respuesta, no la respuesta. La repregunta siempre es por qué, y qué se rompe.
¿Cómo deberías practicar esto?
Leer estas listas genera reconocimiento. Las rondas de diseño evalúan otra cosa: sostener un sistema en tu cabeza mientras alguien te interrumpe con un caso de fallo. Eso solo se logra diciendo los diseños en voz alta.
- Dibuja y narra un pipeline en quince minutos. Fuente, landing, transformación, servicio, más cómo falla cada etapa.
- Ataca tu propio diseño. Después de cada práctica, pregunta qué pasa en un rerun, con datos tardíos y con un cambio de esquema.
- Ten un número listo para la escala. Filas por día, tamaño, presupuesto de latencia. Indicar tu escala asumida primero puntúa.
- Escribe SQL a mano. Las rondas en vivo suelen usar un editor plano sin autocompletado ni ejecución.
- Ensaya bien una historia de incidente. Qué se rompió, cómo lo descubriste, qué cambiaste para que no pudiera repetirse.
Una ingeniera de datos con seis años en pipelines batch se preparó repasando los internals del framework, y luego se trabó en "la fuente upstream reenvió el archivo de ayer" porque solo lo había manejado a mano, nunca lo había explicado. El conocimiento estaba; la respuesta hablada no. Practicar la ronda de diseño con repreguntas es justo para lo que está hecho el modo entrevista simulada.
FAQ
¿En qué se diferencia una entrevista de ingeniero de datos de una de ingeniero de software?
¿Necesito Spark específicamente, o basta con el concepto?
¿Cuánto modelado de datos evalúan estas entrevistas?
¿Cuál es la razón más común por la que fallan los procesos de ingeniero de datos?
¿Cómo practico las rondas de diseño solo?
Preguntas relacionadas
- ¿Qué preguntas se hacen en una entrevista de data scientist?
- ¿Qué preguntas se hacen en una entrevista para analista de datos?
- ¿Qué preguntas se hacen en una entrevista de product manager?
- ¿Qué preguntas sobre Copilot y asistentes de código reciben los desarrolladores en las entrevistas?
- ¿Qué preguntas se hacen en una segunda entrevista?
- ¿Qué preguntas se hacen en una entrevista con IA?