Pohovor o systémovém návrhu pro AI inženýry: Praktický průvodce

Autor: Aaron Cao · Aktualizováno

Žádá po vás, abyste navrhli systém strojového učení od začátku do konce: data a features, trénování a evaluaci, nasazení a latenci, monitoring a drift. Poslední kola se silně opírají o retrieval augmented generation a nasazení modelů. Hodnotí se kompromisy, které dokážete obhájit, ne jedna správná architektura.

Co toto kolo skutečně testuje

Když to zadání slyšíte poprvé, zní neuvěřitelně široce: navrhněte doporučovací systém, nebo navrhněte chatbota nad interními firemními dokumenty. Tato část vysvětluje, co hodnotitel bodovaně sleduje, aby šířka zadání přestala být problémem. Stručně řečeno, hodnotí, jestli dokážete vágní produktový požadavek proměnit v systém s čísly, která se k němu vážou.

Většinu bodů tvoří čtyři věci:

  • Scoping. Ptáte se, kdo jsou uživatelé, kolik dotazů za sekundu, a jaká laťka kvality se počítá jako úspěch, než začnete cokoli kreslit?
  • Úsudek o datech. Odkud pocházejí trénovací data, jak jsou označkovaná, a co uniká mezi trénováním a nasazením?
  • Evaluace. Offline metriky plus online guardrail. Odpověď bez plánu evaluace působí juniorsky, ať je architektura sebelepší.
  • Cit pro produkci. Rozpočet latence, náklady na požadavek, četnost přetrénování, a co se stane, když se model zmýlí.

Zadání, která se stále opakují

Většinu kol systémového návrhu pro AI inženýry pokrývá pět zadání:

  • Retrieval augmented generation nad soukromými dokumenty. Strategie chunkování, volba embedding modelu, vektorový index, reranking, a co uděláte, když retrieval nevrátí nic relevantního.
  • Nasazení modelu ve velkém měřítku. Batching, kvantizace, udržení GPU vytížených, cachování, a cíl latence p99, ke kterému jste se zavázali během scopingu.
  • Doporučování nebo ranking. Nejprve generování kandidátů, pak ranking, feature store, rozdíl mezi trénováním a nasazením, cold start.
  • Pipeline pro features. Streaming versus dávkové zpracování, point-in-time korektnost, backfilly.
  • Agentní workflow. Volání nástrojů, limity kroků, stropy nákladů, a jak zasahuje člověk. Bohatší banku otázek najdete v sekci typy pohovorů.

Každé z nich má jednu obtížnou část, na kterou hodnotitel čeká. U retrievalu je to evaluace, protože každý umí pojmenovat vektorovou databázi, ale málokdo dokáže říct, jak by změřil, jestli se retrieval zlepšil. U nasazení je to kompromis mezi náklady a latencí proti velikosti modelu.

Struktura, která přežije 45 minut

Prvních pět minut věnujte požadavkům a číslům a napište je tak, aby je hodnotitel viděl: dotazy za sekundu, přijatelná latence, laťka kvality, rozpočet. Všechno, co následuje, se k těmto čtyřem číslům vrací, a právě to dělá z odpovědi inženýrství místo prohlídky nástrojů.

Pak postupujte nejdřív do šířky: diagram se zdroji dat, offline trénováním, úložištěm artefaktů, cestou nasazení a zpětnovazební smyčkou. Teprve když existuje celý obrázek, ponořte se do detailu, a nechte hodnotitele vybrat komponentu. Zakončete pojmenováním dvou způsobů selhání a toho, co byste monitorovali, abyste každý z nich zachytili.

ML inženýrka, která se ucházela o seniorní roli ve vyhledávací firmě, dostala za úkol navrhnout sémantické vyhledávání nad podpůrnými tikety. Čtyři minuty věnovala scopingu, zavázala se k 200 milisekundám na p95 a pevnému měsíčnímu rozpočtu na inferenci, a pak obě čísla použila k tomu, aby zamítla velký reranker ve prospěch malého cross-encoderu nad top 50 kandidáty. Bodoval se kompromis, ne volba modelu.

Kde živý asistent pomáhá v kole systémového návrhu

Systémový návrh je mluvený a vizuální, takže tady asistent pomáhá méně než v jiných kolech. Co dokáže, je držet vám checklist před očima. SubcueAI poslouchá zvuk z meetingu a zobrazuje strukturu na lokální překryvné vrstvě: scopingové otázky, které jste ještě nepoložili, sekci evaluace, kterou jste přeskočili, způsoby selhání, které stojí za zmínku. Desktopová aplikace na macOS a Windows zachytává systémový zvuk plus váš mikrofon; boční panel v prohlížečovém rozšíření zachytává jen zvuk karty s meetingem, takže slyší tazatele, aniž by přepisoval vás. Do hovoru se nepřipojuje žádný bot.

V tomto kole záleží na limitech víc než ve většině ostatních. Pokud sdílíte obrazovku, abyste nakreslili diagram, překryvná vrstva je součástí toho, co sdílíte. Hlídané testy a firemně spravované počítače jsou mimo rozsah a žádný nástroj není univerzálně nezjistitelný. Asistent také nedokáže vymyslet architektonický úsudek, který se hodnotí. Trénink těchto zadání proti AI tazateli na stránce mock interview tohle buduje; překryvná vrstva vás jen chrání před tím, abyste v minutě 30 zapomněli na evaluaci.

Časté dotazy

Musím znát konkrétní vektorovou databázi jménem?

Pojmenovat nějakou je v pořádku, důležitější je obhájit volbu. Tazatelé se ptají, proč zrovna tento index, jaký je kompromis v recallu, a jak byste reindexovali bez výpadku.

Kolik matematiky tato kola očekávají?

Tolik, abyste dokázali věci odhadnout: dimenze embeddingů proti paměti indexu, tokeny proti nákladům, velikost dávky proti latenci. Odvození jsou vzácná, běžná je aritmetika, kterou zvládnete nahlas.

Liší se kolo systémového návrhu pro AI inženýry od klasického kola?

Rámec je stejný. Rozdíl je v tom, že data, evaluace a životní cyklus modelu nesou váhu, kterou klasické kolo dává shardingu a konzistenci.

Může mi SubcueAI pomoct, když kreslím diagram?

Může vám napovědět části rámce, které jste ještě nepokryli. Pokud je diagram na sdílené obrazovce, pamatujte, že překryvná vrstva je součástí toho, co sdílíte.

Související otázky

← Více o Typy pohovorů