Entretien de conception de systèmes pour ingénieur IA : guide pratique

Par Aaron Cao · Mis à jour le

On vous demande de concevoir un système de machine learning de bout en bout : données et features, entraînement et évaluation, mise en service (serving) et latence, monitoring et drift. Les entretiens récents s'appuient fortement sur la génération augmentée par récupération (RAG) et le model serving. La notation porte sur les compromis que vous pouvez défendre, pas sur une architecture unique et correcte.

Ce que l'entretien évalue réellement

La première fois qu'on l'entend, la question semble incroyablement large : concevez un système de recommandation, ou concevez un chatbot sur les documents internes de l'entreprise. Cette section explique ce que l'examinateur note réellement, pour que cette largeur cesse d'être le problème. En résumé, il évalue si vous savez transformer une demande produit vague en un système assorti de chiffres.

Quatre éléments déterminent l'essentiel de la note :

  • Le cadrage (scoping).Demandez-vous qui sont les utilisateurs, combien de requêtes par seconde, et quel seuil de qualité compte comme un succès, avant de dessiner quoi que ce soit ?
  • Le jugement sur les données.D'où viennent les données d'entraînement, comment sont-elles labellisées, et qu'est-ce qui fuit entre l'entraînement et le serving ?
  • L'évaluation.Des métriques offline plus un garde-fou online. Une réponse sans plan d'évaluation sonne junior, quelle que soit la qualité de l'architecture.
  • Le sens de la production.Le budget de latence, le coût par requête, la cadence de réentraînement, et ce qui se passe quand le modèle se trompe.

Les questions qui reviennent sans cesse

Cinq questions couvrent la plupart des entretiens de conception de systèmes pour ingénieur IA :

  • La génération augmentée par récupération sur des documents privés.Stratégie de chunking, choix du modèle d'embedding, index vectoriel, reranking, et ce que vous faites quand la récupération ne renvoie rien de pertinent.
  • Le model serving à grande échelle.Le batching, la quantization, le fait de garder les GPU occupés, le caching, et l'objectif de latence p99 que vous avez fixé pendant le cadrage.
  • La recommandation ou le ranking.Génération de candidats puis ranking, un feature store, le skew entre entraînement et serving, le cold start.
  • Un pipeline de features.Le streaming face au batch, la correction point-in-time, les backfills.
  • Un workflow agentique.L'appel d'outils, les limites d'étapes, les plafonds de coût, et comment un humain intervient. Une banque de questions plus complète se trouve dans la section types d'entretiens.

Chacune de ces questions a un point difficile que l'examinateur attend. Pour la récupération, c'est l'évaluation, car tout le monde peut citer une base de données vectorielle et peu de gens savent dire comment ils mesureraient si la récupération s'est améliorée. Pour le serving, c'est l'arbitrage entre le coût et la latence face à la taille du modèle.

Une structure qui tient 45 minutes

Passez les cinq premières minutes sur les exigences et les chiffres, et écrivez-les là où l'examinateur peut les voir : requêtes par seconde, latence acceptable, seuil de qualité, budget. Tout ce qui suit se réfère à ces quatre chiffres, ce qui donne à la réponse une allure d'ingénierie plutôt qu'une visite guidée d'outils.

Ensuite, procédez en largeur d'abord : un diagramme avec les sources de données, l'entraînement offline, un artifact store, un chemin de serving et une boucle de feedback. Ce n'est qu'une fois l'ensemble du tableau posé que vous approfondissez, et vous laissez l'examinateur choisir le composant. Terminez en nommant deux modes de défaillance et ce que vous surveilleriez pour détecter chacun.

Une ingénieure en machine learning qui passait un entretien pour un poste senior dans une entreprise de recherche a dû concevoir une recherche sémantique sur des tickets de support. Elle a passé quatre minutes sur le cadrage, s'est engagée sur 200 millisecondes en p95 et un budget d'inférence mensuel fixe, puis a utilisé ces deux chiffres pour rejeter un grand reranker au profit d'un petit cross-encoder sur les 50 meilleurs candidats. C'est le compromis, pas le choix du modèle, qui a été noté.

Où un assistant en temps réel aide lors d'un entretien de conception

La conception de systèmes est orale et visuelle, donc un assistant aide moins ici que dans d'autres entretiens. Ce qu'il peut faire, c'est garder la checklist sous vos yeux. SubcueAI écoute l'audio de la réunion et affiche une structure sur un overlay local : les questions de cadrage que vous n'avez pas encore posées, la section évaluation que vous avez sautée, les modes de défaillance à mentionner. L'application de bureau sur macOS et Windows capture l'audio système ainsi que votre microphone ; le panneau latéral de l'extension navigateur ne capture que l'audio de l'onglet de la réunion, si bien qu'il entend l'examinateur sans vous transcrire. Aucun bot ne rejoint l'appel.

Les limites comptent plus dans cet entretien que dans la plupart des autres. Si vous partagez votre écran pour dessiner un diagramme, l'overlay fait partie de ce que vous partagez. Les évaluations surveillées et les machines gérées par l'entreprise sont hors périmètre, et aucun outil n'est universellement indétectable. Un assistant ne peut pas non plus inventer le jugement architectural qui est noté. S'entraîner sur ces questions face à un examinateur IA sur la page entretien simulé construit cela ; l'overlay ne fait que vous empêcher d'oublier l'évaluation à la 30e minute.

FAQ

Dois-je connaître le nom d'une base de données vectorielle en particulier ?

En citer une est acceptable, savoir défendre ce choix compte davantage. Les examinateurs demandent pourquoi cet index, quel est le compromis sur le recall, et comment vous réindexeriez sans interruption de service.

Quel niveau de maths ces entretiens attendent-ils ?

Juste assez pour dimensionner les choses : les dimensions d'embedding face à la mémoire de l'index, les tokens face au coût, la taille de batch face à la latence. Les dérivations sont rares, un calcul mental que vous pouvez faire à voix haute est courant.

Un entretien de conception de systèmes pour ingénieur IA diffère-t-il d'un entretien classique ?

Le cadre est le même. La différence est que les données, l'évaluation et le cycle de vie du modèle portent le poids que les entretiens classiques accordent au sharding et à la cohérence.

SubcueAI peut-il m'aider pendant que je dessine un diagramme ?

Il peut vous signaler les parties du cadre que vous n'avez pas encore couvertes. Si le diagramme est sur un écran partagé, n'oubliez pas que l'overlay fait partie de ce que vous partagez.

Questions liées

← Plus sur Types d’entretien