Preguntas de entrevista para ingeniero de datos, por ronda

Por Aaron Cao · Actualizado el

Preguntas de entrevista para ingeniero de datos, por ronda
Los procesos de ingeniero de datos cubren SQL avanzado, modelado de datos, diseño de pipelines y ETL, procesamiento distribuido y rondas conductuales. La ronda de diseño de pipelines decide la mayoría de los resultados: pregunta cómo manejas datos tardíos, reintentos y fallos, no qué herramienta prefieres.

Los procesos de ingeniero de datos cubren SQL avanzado, modelado de datos, diseño de pipelines y ETL, procesamiento distribuido y rondas conductuales. La ronda de diseño de pipelines decide la mayoría de los resultados: pregunta cómo manejas datos tardíos, reintentos y fallos, no qué herramienta prefieres.

¿Qué rondas incluye un proceso de ingeniero de datos?

Puede que te estés preparando igual que para un proceso de ingeniería de software, preguntándote qué cambia. Esta sección mapea las rondas que reutilizan estas entrevistas, para que dediques tu tiempo a las dos que realmente separan a los candidatos. El filtro técnico rara vez es donde se pierden las ofertas.

  • SQL. Funciones de ventana, deduplicación y rendimiento de consultas, casi siempre en vivo.
  • Modelado de datos. Diseñar tablas para un negocio descrito, y defender la granularidad elegida.
  • Diseño de pipelines y ETL. Una ronda de diseño de sistemas abierta, acotada al movimiento de datos.
  • Procesamiento distribuido. Cómo ejecuta realmente tu trabajo un framework, y por qué es lento.
  • Programación. Python o Scala, a menudo más ligera que una ronda de ingeniería de software.
  • Conductual. Incidentes de guardia, dashboards rotos y stakeholders que querían el número ayer.

Los títulos se solapan mucho con analytics engineering y roles de plataforma, así que la mezcla varía. Los bancos de roles relacionados están en el hub de preguntas de entrevista por rol.

¿Qué preguntas de SQL y modelado de datos aparecen?

SQL

  • Deduplica una tabla conservando solo la fila más reciente por clave.
  • Escribe una consulta que devuelva el número de sesiones de cada usuario usando un vacío de inactividad de 30 minutos.
  • Calcula un total acumulado y una variación mes contra mes en una sola consulta.
  • Encuentra filas presentes en el snapshot de ayer pero ausentes en el de hoy.
  • ¿Qué hace QUALIFY, y qué escribirías sin él?
  • Esta consulta escanea mil millones de filas y tarda veinte minutos. ¿Cómo la diagnosticas?
  • Explica la diferencia entre particionar y agrupar (clustering), y cuándo ayuda cada una.

Modelado de datos

  • Diseña las tablas para el historial de pedidos de un marketplace online. ¿Cuál es la granularidad de tu tabla de hechos?
  • Explica un esquema en estrella, y cuándo desnormalizarías deliberadamente aún más.
  • ¿Qué es una dimensión de cambio lento, y cómo implementas el tipo dos?
  • Un stakeholder quiere que los reportes históricos reflejen la región actual de un cliente. ¿Qué se rompe?
  • ¿Cómo modelarías un flujo de eventos que llega desordenado?
  • ¿Cuándo elegirías una tabla ancha sobre un modelo normalizado?

La ronda de modelado premia comprometerse con una granularidad y defenderla. Los candidatos que describen tres diseños posibles sin elegir uno puntúan peor que quienes eligen un diseño razonable y nombran su debilidad.

¿Qué preguntas de pipelines y procesamiento distribuido aparecen?

Diseño de pipelines y ETL

  • Diseña un pipeline que cargue las transacciones diarias en un warehouse para reportes.
  • La fuente upstream vuelve a enviar los datos de ayer. ¿Qué le pasa a tu trabajo?
  • ¿Cómo haces idempotente un pipeline, y por qué importa para los reruns?
  • ¿Cómo harías un backfill de dos años de historial sin interrumpir la carga diaria?
  • Datos que llegan tarde aparecen tres días después de cerrada la partición. ¿Qué haces?
  • ¿Cómo detectarías que un pipeline tuvo éxito pero produjo datos incorrectos?
  • ¿Qué monitoreas, y qué alerta a alguien a las tres de la mañana?

Procesamiento distribuido y streaming

  • ¿Qué causa un shuffle, y por qué es costoso?
  • Tu trabajo va lento y una tarea tarda mucho más que el resto. ¿Qué está pasando?
  • Explica el data skew y dos formas de manejarlo.
  • ¿Cuándo elegirías streaming sobre un job batch programado?
  • ¿Qué garantiza realmente el procesamiento exactly once, y dónde no se cumple?
  • ¿Cómo manejan los watermarks los eventos desordenados en una agregación con ventanas?

Fíjate en qué pocas de estas te piden nombrar una herramienta. Nombrar una es el inicio de la respuesta, no la respuesta. La repregunta siempre es por qué, y qué se rompe.

¿Cómo deberías practicar esto?

Leer estas listas genera reconocimiento. Las rondas de diseño evalúan otra cosa: sostener un sistema en tu cabeza mientras alguien te interrumpe con un caso de fallo. Eso solo se logra diciendo los diseños en voz alta.

  • Dibuja y narra un pipeline en quince minutos. Fuente, landing, transformación, servicio, más cómo falla cada etapa.
  • Ataca tu propio diseño. Después de cada práctica, pregunta qué pasa en un rerun, con datos tardíos y con un cambio de esquema.
  • Ten un número listo para la escala. Filas por día, tamaño, presupuesto de latencia. Indicar tu escala asumida primero puntúa.
  • Escribe SQL a mano. Las rondas en vivo suelen usar un editor plano sin autocompletado ni ejecución.
  • Ensaya bien una historia de incidente. Qué se rompió, cómo lo descubriste, qué cambiaste para que no pudiera repetirse.

Una ingeniera de datos con seis años en pipelines batch se preparó repasando los internals del framework, y luego se trabó en "la fuente upstream reenvió el archivo de ayer" porque solo lo había manejado a mano, nunca lo había explicado. El conocimiento estaba; la respuesta hablada no. Practicar la ronda de diseño con repreguntas es justo para lo que está hecho el modo entrevista simulada.

FAQ

¿En qué se diferencia una entrevista de ingeniero de datos de una de ingeniero de software?

La ronda de programación suele ser más ligera y la ronda de diseño está acotada al movimiento de datos en vez de a servicios. Las preguntas se centran en la corrección ante reruns, datos tardíos y cambios de esquema, algo que rara vez aparece en una ronda general de diseño de software.

¿Necesito Spark específicamente, o basta con el concepto?

Los conceptos cargan la mayor parte de la ronda: shuffles, skew, particionado y por qué un trabajo va lento. Si la descripción del puesto nombra un framework, espera al menos una pregunta sobre su modelo de ejecución, así que sé capaz de explicar qué pasa cuando tu trabajo se ejecuta.

¿Cuánto modelado de datos evalúan estas entrevistas?

Más de lo que esperan la mayoría de los candidatos. Los esquemas en estrella, la granularidad de la tabla de hechos y las dimensiones de cambio lento aparecen con regularidad, y los entrevistadores presionan sobre las consecuencias de tu elección en vez de pedir la definición de libro de texto.

¿Cuál es la razón más común por la que fallan los procesos de ingeniero de datos?

Diseñar un pipeline que solo funciona en el camino feliz. Los entrevistadores introducen deliberadamente reruns, entregas duplicadas y datos tardíos, y un diseño sin respuesta para eso es el modo de fallo habitual.

¿Cómo practico las rondas de diseño solo?

Elige un negocio descrito, diseña el pipeline en voz alta con un cronómetro, y luego interroga tu propio diseño con casos de fallo. Un entrevistador simulado con IA también puede llevar la ronda e interrumpir con repreguntas, algo más cercano a la presión real.

Preguntas relacionadas

← Más sobre Preguntas de entrevista por puesto y tema