AI engineer system design-interview: een praktische gids
Door Aaron Cao · Bijgewerkt op
Je moet een machine-learning-systeem end-to-end ontwerpen: data en features, training en evaluatie, serving en latency, monitoring en drift. Recente rondes leunen zwaar op retrieval augmented generation en model serving. Er wordt beoordeeld op trade-offs die je kunt verdedigen, niet op één juiste architectuur.
Wat de ronde eigenlijk test
De opdracht klinkt de eerste keer onmogelijk breed: ontwerp een aanbevelingssysteem, of ontwerp een chatbot over interne bedrijfsdocumenten. Deze sectie legt uit wat de interviewer beoordeelt, zodat de breedte geen probleem meer is. Kort gezegd: er wordt beoordeeld of je een vage productvraag kunt omzetten in een systeem met cijfers eraan verbonden.
Vier dingen bepalen het grootste deel van de score:
- Scoping. Vraag je wie de gebruikers zijn, hoeveel queries per seconde, en welke kwaliteitslat telt als succes voordat je iets tekent?
- Datainzicht. Waar komen trainingsdata vandaan, hoe worden ze gelabeld, en wat lekt er tussen training en serving?
- Evaluatie. Offline metrics plus een online guardrail. Een antwoord zonder evaluatieplan komt junior over, hoe goed de architectuur ook is.
- Productiegevoel. Latencybudget, kosten per request, hertrainingscadans, en wat er gebeurt als het model het mis heeft.
De opdrachten die steeds terugkomen
Vijf opdrachten dekken de meeste system design-rondes voor AI engineers:
- Retrieval augmented generation over privédocumenten. Chunking-strategie, keuze van embeddingmodel, vector-index, reranking, en wat je doet als retrieval niets relevants oplevert.
- Model serving op schaal. Batching, quantization, de GPU's aan het werk houden, caching, en het p99-latencydoel waar je je tijdens scoping aan hebt gecommitteerd.
- Aanbeveling of ranking. Kandidaatgeneratie gevolgd door ranking, een feature store, scheeftrekking tussen training en serving, cold start.
- Een feature-pipeline. Streaming versus batch, point-in-time correctheid, backfills.
- Een agentic workflow. Tool calling, staplimieten, kostenplafonds, en hoe een mens ingrijpt. Een uitgebreidere vragenbank staat in de sectie interviewtypes.
Elk van deze heeft één lastig onderdeel waar de interviewer op wacht. Voor retrieval is dat evaluatie, omdat iedereen een vectordatabase kan noemen maar weinigen kunnen zeggen hoe ze zouden meten of retrieval verbeterd is. Voor serving is dat de afweging tussen kosten en latency tegenover modelgrootte.
Een structuur die 45 minuten overleeft
Besteed de eerste vijf minuten aan requirements en cijfers, en schrijf ze op waar de interviewer ze kan zien: queries per seconde, acceptabele latency, kwaliteitslat, budget. Alles daarna verwijst terug naar die vier cijfers, en dat is wat een antwoord laat klinken als engineering in plaats van een rondleiding langs tools.
Ga daarna breedte-eerst te werk: een diagram met databronnen, offline training, een artifact store, een serving-pad, en een feedback loop. Pas nadat het hele plaatje er staat, ga je de diepte in, en laat je de interviewer het onderdeel kiezen. Sluit af door twee faalmodi te benoemen en wat je zou monitoren om elk daarvan op te vangen.
Een ML engineer die solliciteerde voor een seniorfunctie bij een zoekbedrijf kreeg de opdracht om semantisch zoeken over supporttickets te ontwerpen. Ze besteedde vier minuten aan scoping, committeerde zich aan 200 milliseconden bij p95 en een vast maandelijks inferentiebudget, en gebruikte beide cijfers vervolgens om een grote reranker af te wijzen ten gunste van een kleine cross-encoder over de top 50 kandidaten. De trade-off, niet de modelkeuze, is wat werd beoordeeld.
Waar een live assistant helpt in een design-ronde
System design is mondeling en visueel, dus een assistant helpt hier minder dan in andere rondes. Wat het wel kan, is de checklist voor je houden. SubcueAI luistert mee met de meetingaudio en zet een structuur op een lokale overlay: scopingvragen die je nog niet hebt gesteld, het evaluatieonderdeel dat je hebt overgeslagen, de faalmodi die het waard zijn om te benoemen. De desktop-app op macOS en Windows legt systeemaudio plus je microfoon vast; het side panel van de browserextensie legt alleen de audio van de meetingtab vast, waardoor het de interviewer hoort zonder jou te transcriberen. Er sluit geen bot aan bij de call.
De beperkingen wegen zwaarder in deze ronde dan in de meeste andere. Als je je scherm deelt om een diagram te tekenen, valt de overlay binnen wat je deelt. Proctored assessments en door het bedrijf beheerde machines vallen buiten bereik, en geen enkele tool is universeel ondetecteerbaar. Een assistant kan ook niet het architectuuroordeel bedenken dat beoordeeld wordt. Het oefenen van deze opdrachten tegen een AI-interviewer op de proefinterview-pagina bouwt dat op; de overlay zorgt er alleen voor dat je evaluatie niet vergeet op minuut 30.
FAQ
Moet ik een specifieke vectordatabase bij naam kennen?
Hoeveel wiskunde verwachten deze rondes?
Verschilt een AI engineer system design-ronde van een klassieke ronde?
Kan SubcueAI helpen terwijl ik een diagram teken?
Gerelateerde vragen
- Welke sollicitatievragen over boekhouding moet ik verwachten?
- Welke vragen komen aan bod in een BarRaiser-sollicitatiegesprek?
- Welke Java-coderingsvragen kan ik verwachten tijdens een sollicitatiegesprek?
- Wat gebeurt er na een BarRaiser-interview?
- Wat zijn prestatiegerichte sollicitatievragen en hoe bereid je je erop voor?
- Wat is het verschil tussen een virtueel sollicitatiegesprek en een persoonlijk sollicitatiegesprek?