Zgradite Wiki

Zgradite Wiki

Referenčna serija o gradnji, mreženju, napajanju in upravljanju računalništva z umetno inteligenco – za kupce in integratorje, ki dimenzionirajo svojo naslednjo napravo s 4 grafičnimi procesorji, strežnik z 8 grafičnimi procesorji ali robotski laboratorij.

Vsak članek je napisan na podlagi resničnih Kentino konstrukcij. Brez nepotrebnega polnila. Izraža svoje mnenje, kjer to zahteva inženiring. Iskreno glede omejitev.

49članki objavljeni 9tematske skladbe 2novo na teden · tor + čet

Temeljni strežnik umetne inteligence Serija W

Če načrtujete računalnik z več grafičnimi procesorji, najprej preberite te informacije: pomnilnik, PCIe, napajanje, temperatura, shranjevanje in ožji izbor grafičnih procesorjev.

W01RAM in VRAM: Kako se nanašata v strežniku z umetno inteligencoŠtirigrafični računalnik s 192 GB VRAM-a in 32 GB RAM-a ne deluje. Pravilno razmerje je odvisno od tega, kaj dejansko uporabljate.
W02PCIe linije in topologija v strežniku z umetno inteligenco z več grafičnimi procesorji»PCIe x8 proti x16 ni pomemben za sklepanje« je večinoma pravilno – in ljudje, ki to ponavljajo, običajno ne vedo, zakaj.
W03Dvigovalniki grafičnih procesorjev: kdaj jih potrebujete in kaj se pokvariKjer integriteta signala tiho umre, se povezave tiho preusmerijo na Gen3, klopi, ki uspejo, pa začnejo izgubljati en GPU na dan.
W04Velikost napajalnika in konfiguracije z dvema napajalnikomaMatematika, realnost oblikovnega faktorja in pošten okvir za napajanje s 4 in 8 grafičnimi procesorji.
W05Termični sistemi in pretok zraka v večgrafičnih strežnikih z umetno inteligencoŠtiri grafične kartice s po 450 W proizvedejo 1.8 kW toplote v škatli. Pretok zraka od spredaj nazaj, statični tlak in zakaj "ima ventilatorje" ni hladilni načrt.
W06Stopnje shranjevanja v strežniku umetne inteligenceModel, nabor podatkov, začetni podatki, kontrolna točka – štiri delovne obremenitve s štirimi vzorci dostopa. Ena plast NVMe ne služi dobro nobeni od njih.
W07Izbira grafične kartice: 5090, 4090, RTX Pro 6000, L40, L4Iskrena primerjava z dejanskimi številkami uspešnosti, kompromisi in potekom odločanja, ki ga dejansko uporabljamo pri klicih strank.

Tokenska ekonomija T serija

Denarna matematika. Žetoni na evro, stroški na lokaciji v primerjavi z oblačnimi naročninami na milijon žetonov in kdaj kateri model dejansko zmaga.

T01Žetoni na sekundo na evroEdina metrika vrednosti GPU-ja, ki je pomembna za sklepanje. Dejanski žetoni/sekundo na evro za 5090, 4090, RTX Pro 6000, L40, L4.
T02Cena na milijon žetonov: na lokaciji v primerjavi z oblačno platformoLokalno v primerjavi z oblakom, izračunano v evrih. Kje je križanje in zakaj račun za oblak zmaga, dokler nenadoma ne preneha.
T03Ekonomija sklepanja o vztrajni in sunkovitih gibanjihStalno sklepanje 24 ur na dan, 7 dni v tednu, in neenakomerna paketna opravila imajo nasprotne ekonomske koristi. Kdaj zmaga lokalna rešitev in kdaj vas reši oblak.

Linux / Operacijski sistem / Programska oprema L serija

Programski sklad pod grafičnimi procesorji. Pripenjanje gonilnikov, nastavitev CUDA, uglaševanje jedra, datotečni sistemi in spremljanje.

L01Pripenjanje v Ubuntuju in upravljanje gonilnikov NVIDIAPripnite jedro, pripnite gonilnik ali pa opazujte, kako nadgradnja apt izklopi vaše grafične procesorje. Upravljanje gonilnikov, ki preživi ponovne zagone.
L02CUDA, cuDNN in komplet orodij za kontejnerje NVIDIARazumna pot nastavitve. Različice CUDA v primerjavi z gonilniki v primerjavi z orodji in pot vsebnika, ki preprečuje pekel odvisnosti.
L03Uglaševanje jedra Linuxa za strežnike umetne inteligenceKaj dejansko premika meje pri delovnih obremenitvah umetne inteligence – ogromne strani, NUMA, afiniteta IRQ – in kaj je cargo-cul.
L04Izbira datotečnega sistema za strežnike umetne inteligenceXFS, ZFS, ext4 – in zakaj Btrfs ni na seznamu za strežnike umetne inteligence. Povežite datotečni sistem z vzorcem dostopa.
L05Spremljevalni sklad: Prometej, Grafana, DCGM, LokiOglejte si temperature grafične kartice, VRAM, napake ECC in neuspehe opravil, preden vas bodo stale vadbenega zagona.

Mreža N serija

Realnost NVLink, topologije gruč (listna hrbtenica, debelo drevo, kačji pastir, brezstikalna), analiza latence, usmerjanje in nastavitev RDMA v praksi.

N03NVLink in NVSwitch: Ko je pomembnoTrženje DGX se hvali s terabajti na sekundo pasovne širine NVLink. Za večino delovnih obremenitev Kentina tega sploh ne potrebujete.
N04Preklopljene topologije: debelo drevo, listna hrbtenica, kačji pastir, tesseractVsak diagram grozda se začne na enak način. Prava izbira je, katera topologija, koliko prenaročenosti in kakšna hitrost na vrata.
N05Topologije brez preklopnikov: mrežasta, obročasta, neposredna povezava32-vratno 400 GbE stikalo bo sredi leta 2026 stalo od 40 do 80 evrov. Za 2 do 4 vozlišča ga ne potrebujete.
N06Disekcija latence: Kam gre vsaka mikrosekundaLjudje ocenjujejo omrežja z grafikoni pasovne širine. Nato njihov merilo allreduce izpiše številko, ki niti približno ne dosega hitrosti linije.
N07Usmerjanje: ECMP, prilagodljivo usmerjanje, DCQCNKaj se dogaja nad kabli, omrežnimi karticami in stikali: kako paketi najdejo pot in kaj preprečuje, da bi se tkanina pri all-reduce zrušila.
N08Nastavitev RDMA v praksi + načrtovanje gruče uplinkPraktični del: namestitev gonilnikov, preverjanje poti, vklop GPUDirect, preverjanje NCCL, nato pa nadaljujte in načrtujte povezavo celotnega grozda.

Grozdenje K serija

Ko eno vozlišče ni dovolj. Odločitev z enim ali več vozlišči, porazdeljeno učenje, sklepne gruče, skupno shranjevanje, razporejanje in obravnavanje napak.

K01Večvozliščni sistem z enim vozliščem v primerjavi z večvozliščnim sistemom: kdaj je treba zmanjšati obseg delovanjaNajdražja napaka je razdelitev proračuna grafičnega procesorja med dve vozlišči, ko bi delo opravilo eno večje vozlišče.
K02Distribuirano usposabljanje v letu 2026: DDP, FSDP2, DeepSpeed, MegatronŠtirje odprtokodni skladi, pet osi vzporednosti in katero dejansko izbrati za katero delo.
K03Inferenčni grozdi: vLLM Tensor Parallel, Pipeline ParallelModel 70B ne ustreza enemu grafičnemu procesorju z uporabnim predpomnilnikom KV. Model 405B ne ustreza enemu vozlišču. Kako model razrežete, določa, koliko bo stal.
K04Shranjevanje v gruči: NFS, BeeGFS, Lustre, shrambe objektovDeljeno shranjevanje je del porazdeljenega grozda, na katerega nihče ne pomisli, dokler grafični procesorji ne dosežejo 40-odstotne izkoriščenosti.
K05Razporejanje dela: SLURM, Kubernetes, RaySLURM, Kubernetes, Ray – in vedeti, kdaj ne potrebujete nobenega od njih. Prilagodite razporejevalnik velikosti ekipe.
K06Obravnavanje napak v gručah umetne inteligenceKaj dejansko povzroči okvaro v gruči GPU in kako jo obnoviti – kontrolne točke, pregledi zdravja in praznjenje poškodovanih vozlišč.

CBCT Serija I

Združevanje vsega skupaj – nastavitev strežnika za sklepanje, laboratorijsko omrežje in proračuni za napajanje, referenčna gradnja in uvedba flote.

I01Arhitektura robne umetne inteligence: robot ↔ strežnik za sklepanje na lokacijiČlanek zlatega standarda. Humanoid, ki ste ga kupili, je le polovica sistema; to je druga polovica in kako sta obe polovici povezani skupaj.
I02Nastavitev strežnika za sklepanje: vLLM, llama.cpp, SGLangNamestitev, strežba in primerjalna analiza. Kateri motor za kateri model in ciljna zakasnitev.
I03Topologija omrežja za računalniški laboratorij za robotiko in umetno inteligencoOžičenje laboratorija za robotiko in umetno inteligenco – povezave robotov, povezave med strežniki za sklepanje in kje se skriva latenca.
I04Proračun za napajanje in hlajenje za laboratorij za robotiko in umetno inteligencoPred podpisom najemne pogodbe določite velikost napajanja in hlajenja za mešani laboratorij za robotiko in umetno inteligenco.
I05Referenčna konstrukcija: Laboratorij za robotiko in umetno inteligenco v enem stojaluPopoln laboratorij za robotiko in umetno inteligenco v enem samem stojalu – kosovnica, postavitev in kompromisi, ki bi jih dejansko poslali.
I06Uvajanje voznega parka: Več robotov, skupno računanjeVeč robotov, skupno računanje. Kako določiti velikost in načrtovati sklepanje za floto, ne za demo.

Dostava energije Serije P

Dovajanje čiste energije v omaro. Faze, PDU-ji, uravnoteženje, odklopniki, UPS in generatorji za računalništvo z umetno inteligenco.

P01Enofazna v primerjavi s trifazno močjoKo škatla s 4 grafičnimi procesorji preraste en sam 16-amperski tokokrog in kaj trifaznega dejansko dobite v omari z umetno inteligenco.
P02Vrste PDU-jev: osnovni, merjeni, preklopni, ATSKaj počne vsak in kaj dejansko potrebujete za rack GPU.
P03Fazno uravnoteženje med AI stojaliEnakomerno obremenite tri faze ali pa v najslabšem možnem času sprožite odklopnik. Kako deluje uravnoteženje med AI regali.
P04Velikost odklopnika in vklopni tokNeprekinjena obremenitev, vklopni tok in pravilo 80 %. Odklopniki za strežnike z grafičnimi procesorji, ki ne povzročajo motečih izklopov.
P05Velikost UPS-a za računalništvo z umetno inteligencoTopologija, kemija baterije, čas delovanja in past kVA v primerjavi z kW, ki podcenjuje polovico nakupov UPS-jev, kupljenih v laboratorijih z umetno inteligenco.
P06Generator in preklopno stikaloKo čas delovanja baterije ni dovolj. Dimenzioniranje generatorja in osnove preklopnega stikala za laboratorije umetne inteligence.

Robotika Serija R · blog

Sodobni humanoid je sestavljen iz šestih ali sedmih inženirskih disciplin, združenih skupaj. Anatomija, senzorji, postavitev računalnikov, SDK-ji, mreženje, nakup in najsodobnejši sklad modelov sveta VLM.

R01Anatomija sodobnega humanoidaŠest ali sedem inženirskih disciplin, združenih skupaj. Kaj se pravzaprav skriva v sodobnem humanoidu.
R02Anatomija štirinožnega robotaŠtirinožci žrtvujejo doseg za stabilnost in življenjsko dobo baterije. Mehanska in računalniška anatomija delovnega konja.
R03Sklad senzorjev robotaKamere, globina, LiDAR, IMU, sila-navor – kaj vsak senzor kupi in koliko stane v računskem smislu.
R04Računanje na napravi v primerjavi z računanjem zunaj naprave za roboteKaj deluje na robotu v primerjavi s strežnikom. Razlika med zakasnitvijo in zmogljivostjo, ki jo mora doseči vsaka namestitev.
R05SDK-ji za robote, ROS 2 in simulacijaROS 2, SDK-ji proizvajalcev in simulacijska okolja – programska oprema, s katero se razvija, preden prispe strojna oprema.
R06Robotsko mreženje: Wi-Fi, Tetherji, 5GWi-Fi, tetherji, 5G – in zakaj je zakasnitev, ne pasovna širina, tista, ki odloča o tem, kaj lahko prenesete iz robota.
R07Nakup robota: Dobavni roki, carina, podporaNakup robotske strojne opreme v EU ni kot nakup delovne postaje. Kako dejansko izgledajo dobavni roki, carinjenje in poprodajna podpora.
R08Zakaj roboti potrebujejo namensko robno računalništvoArgument zakasnitve. Zakaj namestitev vašega modela za oblačni API krši primer uporabe, ki si ga stranka dejansko želi.
R09Samodejno označevanje z modeli sveta, ki jih poganja VLMNajsodobnejši sklad zaznavanja – Qwen2.5-VL, Grounded-SAM 2, Florence-2, NVIDIA Cosmos – uporabljen za resničnost v robotiki.

Primeri dobre prakse Serija C · blog

Pravi Kentino gradi z resničnimi izmerjenimi številkami. Fotografije, kosovnice, primerjalne vrednosti in pošteni obdukcije.

C01Študija primera: 4× delovna postaja z umetno inteligenco RTX 4090EPYC 7542, 512 GB DDR4 ECC, 4× RTX 4090. Izmerjenih 651.6 TFLOPS. 179.3 taktov/s vzdržno na vLLM. Najvišja temperatura 73 °C. Realne številke iz dobavljene različice.

Novi članki vsak torek in četrtek

Ta wiki je rastoča knjižnica – novi članki o gradnji, mreženju, gručenju, energiji in robotiki bodo objavljeni do leta 2026, vsak pa bo povzet iz prave gradnje Kentina. Če želite, da se določeni temi dodeli prednost, pišite na info@kentino.com.