Entrevista de diseño de sistemas para ingeniero de IA: guía práctica
Por Aaron Cao · Actualizado el
Te pide diseñar un sistema de machine learning de extremo a extremo: datos y features, entrenamiento y evaluación, serving y latencia, monitoreo y drift. Las rondas recientes se apoyan mucho en la generación aumentada por recuperación (RAG) y el serving de modelos. La evaluación se basa en los trade-offs que puedas defender, no en una única arquitectura correcta.
Lo que la ronda realmente evalúa
La primera vez que la escuchas, la pregunta suena imposiblemente amplia: diseña un sistema de recomendación, o diseña un chatbot sobre documentos internos de la empresa. Esta sección explica qué está evaluando realmente el entrevistador, para que esa amplitud deje de ser el problema. En resumen, evalúan si puedes convertir una petición de producto vaga en un sistema con números asociados.
Cuatro cosas determinan la mayor parte de la nota:
- El scoping.¿Preguntas quiénes son los usuarios, cuántas consultas por segundo hay, y qué umbral de calidad cuenta como éxito, antes de dibujar nada?
- El criterio sobre los datos.¿De dónde vienen los datos de entrenamiento, cómo se etiquetan, y qué se filtra entre el entrenamiento y el serving?
- La evaluación.Métricas offline más un guardrail online. Una respuesta sin plan de evaluación suena junior sin importar lo buena que sea la arquitectura.
- El criterio de producción.El presupuesto de latencia, el costo por solicitud, la cadencia de reentrenamiento, y qué ocurre cuando el modelo se equivoca.
Las preguntas que siguen apareciendo
Cinco preguntas cubren la mayoría de las entrevistas de diseño de sistemas para ingeniero de IA:
- Generación aumentada por recuperación sobre documentos privados.Estrategia de chunking, elección del modelo de embedding, índice vectorial, reranking, y qué haces cuando la recuperación no devuelve nada relevante.
- Serving de modelos a gran escala.Batching, quantization, mantener las GPU ocupadas, caching, y el objetivo de latencia p99 al que te comprometiste durante el scoping.
- Recomendación o ranking.Generación de candidatos y luego ranking, un feature store, el skew entre entrenamiento y serving, el cold start.
- Un pipeline de features.Streaming frente a batch, corrección point-in-time, backfills.
- Un workflow agéntico.Llamadas a herramientas, límites de pasos, techos de costo, y cómo interviene un humano. Un banco de preguntas más completo está en la sección de tipos de entrevista.
Cada una de estas tiene una parte difícil que el entrevistador está esperando. Para la recuperación es la evaluación, porque cualquiera puede nombrar una base de datos vectorial y pocos pueden decir cómo medirían si la recuperación mejoró. Para el serving es el trade-off entre costo y latencia frente al tamaño del modelo.
Una estructura que aguanta 45 minutos
Dedica los primeros cinco minutos a los requisitos y los números, y escríbelos donde el entrevistador pueda verlos: consultas por segundo, latencia aceptable, umbral de calidad, presupuesto. Todo lo que sigue remite a esos cuatro números, y eso es lo que hace que la respuesta suene a ingeniería y no a un recorrido por herramientas.
Después, procede en amplitud primero: un diagrama con las fuentes de datos, el entrenamiento offline, un artifact store, una ruta de serving y un bucle de feedback. Solo una vez que existe el panorama completo profundizas, y dejas que el entrevistador elija el componente. Cierra nombrando dos modos de fallo y qué monitorearías para detectar cada uno.
Una ingeniera de machine learning que entrevistaba para un puesto senior en una empresa de búsqueda tuvo que diseñar búsqueda semántica sobre tickets de soporte. Pasó cuatro minutos en el scoping, se comprometió a 200 milisegundos en p95 y un presupuesto de inferencia mensual fijo, y luego usó ambos números para descartar un reranker grande a favor de un cross-encoder pequeño sobre los 50 mejores candidatos. Lo que se evaluó fue el trade-off, no la elección del modelo.
Dónde ayuda un asistente en vivo en una ronda de diseño
El diseño de sistemas es hablado y visual, así que un asistente ayuda menos aquí que en otras rondas. Lo que puede hacer es mantener la checklist frente a ti. SubcueAI escucha el audio de la reunión y coloca una estructura en un overlay local: preguntas de scoping que aún no has hecho, la sección de evaluación que te saltaste, los modos de fallo que vale la pena nombrar. La app de escritorio en macOS y Windows captura el audio del sistema más tu micrófono; el panel lateral de la extensión de navegador captura solo el audio de la pestaña de la reunión, así que oye al entrevistador sin transcribirte a ti. Ningún bot se une a la llamada.
Los límites importan más en esta ronda que en la mayoría. Si estás compartiendo tu pantalla para dibujar un diagrama, el overlay está dentro de lo que compartes. Las evaluaciones supervisadas y las máquinas gestionadas por la empresa quedan fuera de alcance, y ninguna herramienta es indetectable de forma universal. Un asistente tampoco puede inventar el criterio arquitectónico que se está evaluando. Practicar estas preguntas contra un entrevistador de IA en la página de entrevista simulada construye eso; el overlay solo evita que olvides la evaluación en el minuto 30.
FAQ
¿Necesito conocer el nombre de una base de datos vectorial específica?
¿Cuánta matemática esperan estas rondas?
¿Una ronda de diseño de sistemas para ingeniero de IA es diferente de una clásica?
¿Puede ayudarme SubcueAI mientras dibujo un diagrama?
Preguntas relacionadas
- ¿Qué preguntas de entrevista de contabilidad debo esperar?
- ¿Qué preguntas aparecen en una entrevista de BarRaiser?
- ¿Qué preguntas de entrevista de codificación en Java debería esperar?
- ¿Qué ocurre después de una entrevista de BarRaiser?
- ¿Qué son las preguntas de entrevista basadas en el desempeño y cómo prepararte para ellas?
- ¿Cuál es la diferencia entre una entrevista virtual y una entrevista presencial?