Co je to datové centrum s umělou inteligencí?

Co je to datové centrum s umělou inteligencí? [Video a kvíz]

Stručná odpověď: Datové centrum s umělou inteligencí je s vysokou hustotou , kde se napájení, chlazení, fabric a úložiště soustředí na tréninkové a servisní modely, nikoli na serverovnu s extra GPU. Čipy si získávají slávu; budova rozhoduje o tom, zda budou fungovat. Pokud se obrazy nemohou přenášet, je třeba dovybavit malou buňku; většina týmů by si měla pronajmout.

Klíčové poznatky:

Čipy vs. konstrukce: O tom, zda akcelerátory fungují, rozhodují napájení, chlazení, fabric a úložiště.

Místa, ne paláce: Dovybavte dva stojany, když data nemohou odejít; nekupujte kampus.

Průměr vs. medián: Po osmi měřeních se medián znovu vynuluje; použijte 18hodinový průměr.

Odolnost proti zneužití: Neuvádějte PUE pro dva regály ve smíšené hale.

Ilustrativní výsledky: Osm běhů je malá mapa, ne 50% úspora produkce.

Články, které byste si mohli po tomto přečíst:

🔗 Je umělá inteligence spolehlivá? Video a kvíz
Prozkoumejte spolehlivost umělé inteligence prostřednictvím poutavého videa a interaktivního kvízu.

🔗 Jak používat umělou inteligenci v každodenním životě
Objevte praktické způsoby, jak může umělá inteligence zjednodušit každodenní úkoly a rutiny.

🔗 Jak používat umělou inteligenci v práci
Naučte se praktické způsoby, jak využít umělou inteligenci pro inteligentnější produktivitu na pracovišti.

🔗 Dokáže umělá inteligence myslet sama za sebe?
Zjistěte, zda umělá inteligence skutečně dokáže myslet samostatně nebo uvažovat.

Jak se liší od „běžného“ datového centra

Tradiční haly se optimalizují pro smíšené pracovní zatížení a provozuschopnost napříč mnoha malými službami. Jistě, záleží vám na redundanci a na konceptu PUE – dodatečné energii, kterou budova spotřebuje k dodání wattu výpočetního výkonu. Obvykle nenavrhujete každou chodbu kolem racku, který se chová jako přenosná ohřívací farma.

Stránky s umělou inteligencí obracejí poměry. Hustota se zvyšuje. Síť se stává strukturou, bez které se tréninková práce nemůže obejít. Úložiště musí udržovat kontrolní body v pohybu nebo akcelerátory nečinně stát jako dostihoví koně v dopravní zácpě.

Existuje i kulturní rozdíl. Podnikové operace myslí v ticketech a časech pro změnu. Operace umělé inteligence myslí v frontách úloh a v nevolnosti, když uzel dlouhodobě odejde pozdě. Myslím, že by se oběma dalo stále říkat „datová centra“, protože jimi jsou. Označení jen skrývá potrubí.

Typ K čemu je postaven Vynikající hardware Charakter výkonu / chlazení Komu to vyhovuje Proč existuje
Tradiční podnikové datové centrum Smíšené IT: databáze, virtuální počítače, e-mail, soubory CPU, běžné servery, známé úložiště Vzduchem vedené; mírná hustota; PUE jako téma k diskusi Společnosti provozující každodenní systémy Udržujte firemní aplikace aktivní
Trénovací klastr pro umělou inteligenci Dlouhé, úzce propojené školicí úkoly Husté akcelerační racky; propojení GPU Vysoká hustota; kapalinové chlazení nebo [výměníky tepla v zadních dveřích] (https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laboratoře a modeláři žijící ve frontách na zakázky Dokončete běh bez vyhladovění chipsů
Zařízení pro odvozování od umělé inteligence Poskytování modelu; odpovědi v reálném čase a dávkové odpovědi Akcelerátory; vyvažovače zátěže, na kterých záleží Pořád žhavé, jen... méně teatrální; latence nad hrubou hustotou Produkty, které musí nyní odpovědět Umístěte model blízko uživatele
Hybridní hala s umělou inteligencí Výcvik a služba pod jednou střechou; no - tak nějak Smíšené stojany; oplocené bazény; sdílená látka Dvě skvělé osobnosti v jedné rostlinné místnosti;; je to trapné Týmy, které si nemohou dovolit dva kampusy Kapitál je konečný; život je neuspořádaný

Není to morální hodnocení. Různé stroje, stejné příjmení.

GPU, akcelerátory a rack, který spotřebovává energii

Projděte se po tradiční vyvýšené podlaze a regály vypadají téměř slušně. Projděte se po řadě s umělou inteligencí a vypadají, jako by chtěly spolknout budovu.

Vynikajícím hardwarem není chytrý procesor. Je to akcelerační zásobník: GPU nebo jiné čipy umělé inteligence, zabalené v serverech, pak v raccích a pak v řadách, které sdílejí vysokorychlostní strukturu. GPU propojuje čipy do něčeho, co může předstírat, že je jedním obrovským akcelerátorem; struktura clusteru dělá stejný trik v řádkovém měřítku. Paralelní trénování funguje pouze tehdy, pokud tyto vazby zůstanou silné a předvídatelné. Pokud o to přijdete, váš „cluster“ se stane hromadou drahých pracovních stanic sdílejících PSČ.

Energie následuje čipy. Žádná mohutná kancelářská PDU. Megawatty IT zátěže, jakmile se hala zaplní - číslo si nevymýšlím. Hustota na rack je dějový zvrat. Méně racků. Každý z nich je malá pec. Limitujícím faktorem je často rozvodna, nikoli seznam přání ohledně GPU. Víte, jak to chodí: zadávání veřejných zakázek chce více akcelerátorů; dodavatel energií chce dlouhý rozhovor a velmi vysoký šek.

Jedna trochu hloupá metafora, které se nemůžu zbavit: vězeň je hladové zvíře. Můžete vychovat rychlejší. Pořád ho musíte krmit a pořád musíte uhasit horko. Pokud vynecháte kterékoli z nich, stane se z něj velmi drahé těžítko na papír.

Problém s elektřinou, teplem a chlazením

Elektřina dovnitř. Teplo ven. To je celé náboženství.

Stojany s vysokou hustotou odvádějí teplo způsobem, o který se od vzduchu nikdy nežádalo. Můžete tlak vzduchu zvýšit – výměníky tepla v zadních dveřích, teplejší uličky, chytré uzavření – a to funguje do určité míry. Pak se objeví kapalina:

  • Chlazení přímo na čip

  • Chladicí smyčky, díky kterým strojovna vypadá jako chemická továrna

  • Ponoření se do několika návrhů, které stále překvapuje lidi, kteří si myslí, že voda a servery by neměly být součástí jedné věty

Nic z toho není okouzlující. Všechno je to produkt, protože plynový pedál, který škrtí, je takový, za který jste si už zaplatili a nemůžete ho plně využít.

Na PUE stále záleží. Je to poměr, ne osobnost. Provozovatelé se za ním honí, protože každý watt vynaložený na ventilátory a čerpadla je watt, který nešel do GPU. Nebudu citovat „typické“ číslo; klima a způsob, jakým se vytyčí hranice, to ovlivňují, a falešná přesnost je horší než žádná. V příběhu je také voda. Některé rostliny usrkávají. Některé hltají. Odpařovací chlazení je efektivní, dokud ho řeka nebo sucho neudělají politickým problémem.

Networking: proč je na tkanině stejně důležité jako na čipech

Lidé fotografují grafické karty. Měli by fotografovat přepínače.

Trénink je konverzace. Tisíce akcelerátorů si vyměňují gradienty, parametry, úlomky modelu v těsné synchronizaci. Pokud se fabric chvěje, celá úloha čeká na nejpomalejší skok. Proto se haly umělé inteligence posedle zaměřují na vysokorychlostní sítě, nízkou latenci a topologie, které se při selhání spojení nerozdělí na polovinu. Fabric ve stylu InfiniBand, Ethernet ve stejné roli, propojení GPU uvnitř krabice, kabeláž, která musí být správná hned napoprvé.

Inference je jiná věc. Obsluha modelu se zajímá o latenci ocasu – pomalou odpověď, ne průměrnou. Dávková vs. reálná odpověď rozděluje osobnost. Trénovací cluster chce hustý, kolektivní pohyb typu „všechny na všechny“. Obsluhující flotila chce mnoho menších požadavků a izolaci bez dopravní zácpy u vyrovnávače zátěže.

Co se týče toho, když už jsem tady: lidé berou síť jako vodovodní potrubí a čipy jako restauraci. V této budově je vodovodní potrubí restaurací. Pokud tohle přehlédnete, koupíte si kuchyň, která nezvládne rozvoz jídla.

Trénování vs. inference: dvě budovy, někdy doslova

Trénink je kampaň. Sestavíte cluster, dodáte mu data, pravidelně provádíte kontrolní kontroly, běžíte hodiny nebo týdny a modlíte se, aby fabric zůstal bez problémů. Dávkově náročný, hladový po šířce pásma, tiše trpělivý – dokud selhávající uzel neudělá chybu. Jeden nefunkční akcelerátor v úzce propojené úloze může zastavit celý sbor.

Inference je jako výkladní skříň. Modely, které jsou již natrénované, nyní odpovídají na otázky, klasifikují obrázky, generují text. Latence je důležitá. O něco starší akcelerátor poblíž zákazníka může porazit okouzlující akcelerátor na vzdáleném kontinentu.

Takže máte rozdělení. Tréninkové kampusy se honí za mocí, pozemky a hustotou. Inferenční místa se honí za latencí a přítomností. Existují i ​​hybridní haly, protože kapitál není nekonečný. No – ne vždy dvě budovy. Někdy jedna hala se sametovým lanem a dvěma chladicími smyčkami.

Právě zde se také rozvíjí kolokace, hyperškálované kampusy a on-premise systémy. Hyperškálovatelné systémy budují v takových měřítcích, že my ostatní vypadáme, jako bychom si jen aranžovali nábytek. Kolokace prodávají hustotu po regálech. On-premise systémy stále existují, i když data nemohou odejít.

Propustnost úložiště, kontrolní body a náročné čipy

Nikdo neuvádí paralelní souborový systém na obálku brožury.

Trénovací data musí přicházet dostatečně rychle, aby GPU neklepaly nohama. Musí dojít k prodlevám, aby havárie nezahodila týden. Váhy modelů se musí načíst před spuštěním obsluhující repliky. Propustnost úložiště – nejen kapacita – je tichým úzkým hrdlem. Můžete utratit jmění za akcelerátory a vyhladovět je pomocí zdvořilého pole určeného pro virtuální stroje.

Vzorec je známý: lesklý cluster, fronta úloh a čekací doba na I/O, které zírají zpět jako hrubá faktura. Clusterování výpočetních operací bez clusterování datové cesty je způsob, jak získat velmi drahý nečinný provoz. Buď udržíte čipy napájené, nebo si přiznejte, že jste si koupili sochu.

Software, orchestrace a nenápadná operační vrstva

Hardware je celebrita. Plánovače odvedou práci.

Datové centrum s umělou inteligencí je k ničemu, pokud úlohy nemohou najít GPU, pokud dva týmy nemohou sdílet cluster bez pěstní rvačky, pokud nelze nahradit neúspěšnou hodnost, pokud se firmware mění, dokud se fabrica nerozpadne ve zpomaleném záběru. Orchestrace, pozorovatelnost, omezení výkonu – nenápadná operační vrstva, díky které víte, že na ní záleží.

Pro tuto vrstvu mám slabost. Také když špatně nakonfigurovaná síťová karta celé odpoledne zosobňuje problém s chlazením... to zjistíte tvrdě.

Když uzel uprostřed běhu odumře

Uzel odejde. Okna změn stále kolidují s trénovacími běhy, které se nestarají o váš kalendář. Skupinově plánujete velké úlohy, ohradujete inferenční fondy, píšete runbooky pro selhání, která vypadají jako „úloha je pomalá“, dokud nevypadají jako „úloha je mrtvá“. Redundance stále záleží – napájení, chlazení, cesty, úložiště – ale režim selhání je méně přehledný než starý snímek s devíti minutami provozuschopnosti. Inference: replikace, vyprázdnění nemocného uzlu, průběžné odpovídání. Trénování chce kontrolní body, ne optimismus.

Poloha, voda, síť a sousedé

Kvůli výhledu jeden z nich nenecháte vedle chaty.

Připojení k rozvodné síti je často skutečným procesem výběru lokality. Pozemek je snadný ve srovnání s rozvodnou a dodavatelem energií, který má i jiné zákazníky. Voda na chlazení, pokud ji používáte, se stává problémem sousedů, jakmile je srážky nepříjemné. Hluk. Vizuální mohutnost. Teplo u hraničního plotu. Plánovací komise zjišťují názory na „oblak“ v okamžiku, kdy potřebuje pole a řeku.

Latence táhne opačným směrem. Inference má ráda blízko uživatelů a propojení. Školení se může skrývat na levnějších trzích s elektřinou a v chladnějším podnebí. Průmysl mluví, jako by existovalo jedno dokonalé místo. Neexistuje. Existuje kompromis v podobě tiskové zprávy.

Zbytkové teplo a nezvaná pec

Brožury tuhle část milují. Odvádět odpadní teplo do domů, bazénů, skleníků; je to krásná věta. Někdy je okruh okresu skutečný. Někdy je kampus na špatném místě a teplo se stejně dostává do vzduchu. Jsem skeptický k verzi v brožuře; nejsem skeptický k fyzice.

Kdo ho potřebuje (a kdo by si ho měl raději pronajmout)

Většina lidí nemusí vlastnit jednu z těchto hal.

Stručný seznam:

  • Hyperškálovatelné systémy, protože produktem je flotila

  • Laboratoře, když je úzkým hrdlem doba čekání ve frontě nebo data nemohou odejít

  • Banka, nemocniční skupina, vláda nebo výrobce s tajnou datovou sadou – on-premise nebo soukromá kolo klec – může být racionální, i když je to jen průšvih

Všichni ostatní by si měli pronajmout. Kolokace s hustotou připravenou pro umělou inteligenci. Rezervace v cloudu. Spravovaný cluster. Získáte urychlovače, aniž byste se zároveň stali provozovatelem elektrárny. Romantika vyprchá, když se někdo poprvé zeptá, kdo má ve 3 hodiny ráno službu pro chladicí okruh.

Přiznávám, že je v tom něco jako hrdost. Vlastnictví clusteru je jako vlastnictví prostředků pro predikci. Pak přijde faktura za elektřinu a hrdost pomine.

K čemu je budova určena

Co je tedy datové centrum s umělou inteligencí? Specializovaný kampus s vysokou hustotou zástavby, kde jsou akcelerátory, napájení, chlazení, fabric a úložiště organizovány kolem modelů pro školení a obsluhu – ne univerzální IT s GPU v rohu. Vypadá to jako sklad. Chová se to jako elektrárna, která počítá.

Pokud si nepamatujete nic jiného: čipy získávají slávu; rozvodna, chladivo a síť rozhodují o tom, zda tyto čipy byly dobrý nápad. Školení a inference mohou sdílet jednu střechu; stále chtějí různé způsoby. Většina organizací by si měla pronajímat. Některé by měly stavět. Sousedé si toho všimnou tak či onak.

Cloud vždycky měl budovu. V dnešní době má budova názory.

Příklad z reálného světa: Dvoustojanová tréninková buňka, když obrazy nemohou opustit

Scénář

Tomos je vedoucím infrastruktury ve společnosti Kestrel Precision, továrně se 400 zaměstnanci v regionu West Midlands. Už mají malou vlastní halu: ERP, sdílení souborů, virtuální stroje, smíšená komunita, o které tento článek začal. Vzduchové chlazení. Obyčejný Ethernet. SAN, která se dokonale hodí pro kancelářské disky.

Tým strojového vidění potřebuje natrénovat inspekční model na továrních fotografiích. Fotografie nemohou opustit provozovnu. Ukazují proces, který společnost neuloží na cloudový disk, ani na soukromý. Řešením oddělení nákupu jsou čtyři servery s dvojitým akcelerátorem a snímek s názvem „naše datové centrum s umělou inteligencí“. Servery se umístí do dvou stávajících racků, protože je tam místo a místo se zdálo být omezením.

Není. Během čtrnácti dnů se GPU zdají být zaneprázdněné a pak se tiše zpomalí. Úlohy se zastaví, když kontrolní bod narazí na SAN. Uzel odejde v jedenáct hodin a běh je prostě... pryč. Tomos nezapomněl nakoupit čipy. Koupil hromadu drahých pracovních stanic se společným PSČ. Budova byla stále podnikovou halou.

Nepotřebují kampus, novou rozvodnu ani řeku. Potřebují malou buňku, která se chová jako datové centrum umělé inteligence v miniatuře: energii, kterou racky skutečně pojmou, teplo, které odchází, aniž by se ohřály čipy, fabricu, přes kterou může tréninková úloha komunikovat, úložiště, které může obsadit kontrolní bod, a runbook pro případ, že uzel selže. Protože obrazy nemohou odejít, pronájem kolo klece čtyřicet minut daleko není řešením. Dodatečná montáž dvou racků ano.

Co buňka potřebuje

  • Naměřený rozpočet na energii v daném řádku, z PDU, ne ze seznamu přání GPU. Pokud volná kapacita nedokáže při tréninkové zátěži napájet čtyři servery, konverzace se tím zastaví a zaměří se na hustší kolo, ne na zázrak

  • Chlazení vzduchu při této hustotě nebylo nikdy požadováno: výměníky tepla v zadních dveřích, pokud je hala zvládne, nebo malý okruh kapaliny, pokud to zvládne. Pokud ani jedno, servery se dovnitř neinstalují

  • Vyhrazená vysokorychlostní síťová struktura mezi čtyřmi uzly, nikoli kancelářský Ethernet. Pokud má dodavatel v katalogu pouze 10Gb přepínač, nejedná se o cluster

  • Lokální rychlé úložiště pro kontrolní body a tréninkové shardy, nikoli pro síť SAN virtuálních počítačů

  • Plánovač, interval kontrolních bodů a písemná cesta restartu. Hardware je celebritou. Tato vrstva je úkolem

  • Oplocený inferenční box pro tovární linku, oddělený od trénovacího chatování, protože obsluha vyžaduje latenci ocasu a izolaci, nikoli kolektivní

  • Povolení k zaznamenávání napájení, hodin GPU, událostí škrticí klapky a nástěnných hodin úlohy. Pokud je nemohou zkontrolovat, vyfotografují GPU a přepážky přehlédnou

Příklad instrukce

Tomos to v popisu zařízení uvádí běžným jazykem:

Neříkejte tomu kampus umělé inteligence. Postavte v existující hale dvourackovou školicí buňku pro čtyři servery se dvěma akcelerátory. Tovární obrazy zůstanou na místě. Úspěch je v tom, že čtyři uzly dokončí 12-epochový recept pro inspekci a školení bez tepelného omezení, zapíší kontrolní bod během několika minut, ne desítek minut, a obnoví práci od tohoto kontrolního bodu, když schválně zničíme rank. Chlazení musí udržovat GPU na jejich školicích taktech. Síť musí být fabric, kterou tyto čtyři boxy sdílejí, ne cesta skrz kancelářský stack. Úložiště musí zásobovat čipy. Pokud se vám nevejdou tepelné výměníky v zadních dveřích, řekněte to a přestaňte. Neuvádějte PUE pro dva racky ve smíšené hale. To číslo by bylo divadlo.

Pak tohle vloží do samotného tréninkového úkolu:

Kontrolní bod každých 30 minut k místnímu rychlému poolu. Pokud zemře hráč na určité hodnosti, restartujte od posledního kompletního kontrolního bodu. Nečekejte na SAN. Nepokračujte v tréninku, dokud hodiny neklesnou z horka. Zaznamenejte to a zastavte, abychom viděli stání.

Dobrá hodina vypadá takto: všech osm GPU je na tréninkových taktech, soubor s kontrolními body je připojen, úloha stále v synchronizaci. Špatná hodina vypadá takto: ventilátory běží na plný výkon, takty dole, po deseti minutách je zaznamenáno 2 % kontrolního bodu a někdo v kanceláři říká, že „cluster je v provozu“. Zapnutí není trénink.

Jak to otestovat

Test napíšou před modernizací, což je celý důvod, proč nedůvěřovat demu.

  • Stejný recept z 12 epoch, stejných 120 000 inspekčních snímků, osm běhů

  • Časování je vázáno na nástěnné hodiny pro dokončení receptu, včetně případného restartu, měřeno od odeslání úlohy do posledního kontrolního bodu epochy 12

  • Překročení limitu pro přehřátí: Takty GPU zůstávají po celou dobu běhu na trénovacím cíli. Událost throttle je selháním, i když je úloha nakonec dokončena

  • Úložiště s předáním: doba zápisu kontrolního bodu, medián a nejhorší, z protokolu úlohy

  • Přeskočení struktury: úloha nečeká kolektivně, dokud je hodnost v pořádku. Pokud toto čekání nevidí, instrumentace není hotová

  • Dva z osmi běhů jsou záměrně zabiti v určitém kroku, aby se otestovala cesta k restartu

  • Inference je samostatný test s 200 snímky od tovární linky až po oplocenou servírovací krabici. Úspěch v tréninku se nepočítá jako úspěšný servis

  • Zaznamenávají výkon racku z PDU v 15minutových vzorcích, takže nikdo nemusí vymýšlet megawatt

Přijetí označení buňky jako „připravené pro AI“: 8 z 8 receptů dokončeno; 0 z 8 ukazuje tepelný škrticí klapku; oba zastavené běhy se obnoví; kontrolní body zůstávají v minutách. Pokud to zmeškají, stále mají serverovnu s luxusními grafickými kartami.

Výsledek

Ilustrativní výsledek z osminásobného vymyšleného testu, nikoli publikovaný obrázek o poštolce.

Předpoklady: čtyři servery s dvojitým akcelerátorem ve dvou raccích; jeden inspekční model; 120 000 statických snímků; osm běhů fixního 12epochálního receptu; nástěnné hodiny zahrnují restarty, dokud není recept dokončen; omezení znamená zaznamenaný pokles tréninkových hodin; kontrolní čas je zápis, nikoli přání; výkon racku jsou vzorky PDU, nikoli PUE kampusu.

Před modernizací, grafické karty v běžných vzduchem chlazených raccích na kancelářském ethernetu a VM SAN:

  • 5 z 8 běhů skončilo na první pokus. Medián nástěnných hodin mezi těmito pěti: 14 hodin

  • 3 z 8 musely začít znovu po zablokování přibližně v 11. hodině (dva poté, co uzel odešel se zastaralým kontrolním bodem, jeden poté, co kontrolní bod zaplnil SAN). Okamžitý opakování, žádné čekání přes noc v hodinách: 11 promarněných hodin plus 14hodinový druhý pokus, neboli 25 hodin do dokončení receptu na tyto tři

  • Průměrná doba do dokončení receptu u všech osmi, včetně restartů: 18 hodin. (Pět po 14, tři po 25. Medián všech osmi je stále 14, což by skrylo restarty. Proto je zde průměr základní hodnotou.)

  • Tepelné omezení bylo zaznamenáno v 7 z 8 pokusů. Medián doby při snížených hodinách: 3 hodiny při 14hodinovém pokusu

  • Zápis kontrolního bodu: medián 22 minut

  • Zlobit na základě hodnosti nebyl test, kterým by mohli projít. Neměli k dispozici runbook. Dvě náhodná úmrtí byla zjištěním

  • Špičkové IT zatížení obou stojanů během tréninku: přibližně 18 kW. Řada měla dostatečný výkon. Neměla chlazení ani tkaninu

Po výměnících tepla na zadních dvířkách těchto dvou racků, vyhrazené struktuře (fabric) mezi čtyřmi uzly, malém fondu NVMe pro kontrolní body, 30minutovém kontrolním bodování a runbooku pro restart:

  • 8 z 8 dokončilo na první pokus. Medián nástěnných hodin: 9 hodin

  • Tepelná škrticí klapka: 0 z 8

  • Kontrolní bod zápisu: medián 90 sekund. Nejhorší v sadě: 3 minuty

  • Dva úmyslné útoky na vyšší pozice byly obnoveny od posledního 30minutového kontrolního bodu. Prodloužené hodiny na těchto dvou kolech: přibližně 40 minut na každé, včetně diagnózy, takže oba seděli téměř 9 hodin a 40 minut. Průměr z osmi kol v klidu je 9 hodin

  • Špičkové IT zatížení stále okolo 18 kW. Stejné čipy. Jiné chování budovy

V tomto vzorku se průměrná doba do dokončení receptu snížila z 18 hodin na 9 hodin, neboli o 9 hodin v každém běhu, tedy 72 hodin v osmi běhech. Dokončeno napoprvé se zvýšilo z 5 z 8 na 8 z 8. Účinek Throttle se zvýšil ze 7 z 8 na 0 z 8. Toto poslední číslo určuje, zda si koupili urychlovače nebo těžítka na papír. Změnu času nenazvou 50% úsporou produkce. Osm běhů je malá a snadná sada.

Tato čísla jsou pouze odhadem založeným na uvedeném testu, malém vzorku, jednom modelu a jedné smíšené hale. Nejedná se o PUE, nejde o megawatt kampusu a ani o důkaz, že by Kestrel měl postavit školicí středisko na poli. Kontrola protokolů se odehrála v rámci 9 hodin; neskrývali to. Číslo 18 kW je zaokrouhlený údaj PDU, nikoli faktura za energie. Nepřevedli 72 hodin na náklady, protože smíšená sazba elektřiny továrny by vytvořila falešný obchodní případ.

Kontrola podávání byla oddělená a menší: 200 řádkových obrázků do oploceného boxu, vše na místě. To je inference, ne trénink. Smíchání obou by byla chyba hybridní haly v miniatuře.

Co se může pokazit

  • Nákupní oddělení neustále označuje čtyři servery za „datové centrum s umělou inteligencí“. Označení skrývá rozvody a dalším nákupem jsou další grafické karty pro stejnou nemocnou uličku

  • Zadní výměníky se zapojují a nikdo neuvádí do provozu vodní stranu. Ventilátory stále křičí. Hodiny stále jdou

  • Fabric je jeden přepínač bez náhradní cesty. Jeden neúspěšný odkaz a „cluster“ je opět o čtyřech pracovních stanicích

  • Kontrolní body zůstávají v síti SAN, protože fond NVMe byl ve „fáze dva“. Fáze dva nedorazí před dalším nefunkčním uzlem

  • Uvádějí PUE pro dva regály ve smíšené hale. Klima, hranice a zbytek řádku ERP dělají z tohoto poměru kostým

  • Trénink a obsluha sdílejí strukturu. Záplava kontrolních bodů nutí tovární linku čekat. Latence ocasu je tam produkt, nikoli hustota

  • Uzel odejde a někdo to považuje za tiket dostupnosti místo restartu kontrolního bodu. Podnikoví operátoři a operátoři umělé inteligence se celé odpoledne baví

  • Mohli si pronajmout klec, ale obrazy nemohou odejít. Zapomenutí na toto omezení je posílá do konverzace v oblaku, kterou si budou muset odpočinout

Praktické ponaučení

Datové centrum umělé inteligence v této podobě není sklad ani faktura za GPU. Je to buňka, která umožňuje akcelerátorům dokončit běh: energii, kterou mohou pojmout, teplo, které odchází, fabricu, kontrolní bod a někoho, kdo bude zodpovědný, když zemře člen dané pozice. Kestrel nepotřeboval kampus. Potřebovali dva racky, aby přestali předstírat. Většina týmů by si toto chování měla pronajmout. Několik jich, s tajnou datovou sadou a halou, která snese teplo, by si mělo postavit buňku a odmítnout sklouznutí.

Často kladené otázky

Co je to datové centrum s umělou inteligencí?

Vysokohustotní výpočetní pracoviště, kde se napájení, chlazení, síťování a úložiště soustředí na paralelní trénování a obsluhu modelů, nikoli na úhledné řady univerzálních serverů. Je navrženo tak, aby obrovské množství akcelerátorů mohlo trénovat a obsluhovat modely, aniž by docházelo k jejich „tavení“, zasekávání v síti nebo čekání na disku. Běžná podniková hala je smíšená čtvrť. Hala s umělou inteligencí je monokultura, jejíž jednotkou hodnoty je akcelerátor, jako jsou GPU nebo čipy ve stylu TPU. Vypadá jako sklad a chová se jako elektrárna, která provádí výpočty.

Jak se datové centrum s umělou inteligencí liší od běžného datového centra?

Tradiční datová centra se optimalizují pro smíšené pracovní zatížení a provozuschopnost napříč mnoha malými službami. Lokality s umělou inteligencí obracejí poměry: hustota se zvyšuje, síť se stává strukturou, bez které se školicí úloha neobejde, a úložiště musí udržovat kontrolní body v pohybu nebo akcelerátory nečinně stojí. Podnikové operace myslí v ticketech a měnících se oknech. Operace s umělou inteligencí myslí ve frontách úloh a nepříjemném pocitu, když uzel v dlouhodobém horizontu odejde pozdě. Stále byste mohli volat na obě datová centra. Označení jen skrývá potrubí.

Proč datová centra s umělou inteligencí spotřebovávají tolik energie?

Vynikajícím hardwarem není chytrý procesor. Je to akcelerační modul: GPU nebo jiné čipy umělé inteligence, zabalené v serverech, pak v racích a pak v řadách, které sdílejí síťovou strukturu s vysokou šířkou pásma. Hustota na rack je dějovým zvratem: méně racků, každý z nich je malá pec. Megawatty IT zátěže se objeví, jakmile se hala zaplní, i když vymýšlet typické číslo se nevyplatí. Limitujícím faktorem je často rozvodna, nikoli seznam přání ohledně GPU.

Jak jsou chlazena datová centra s umělou inteligencí?

Racky s vysokou hustotou odvádějí teplo způsobem, o který se od vzduchu nikdy ve skutečnosti nežádalo. Díky výměníkům tepla se zadními dveřmi, teplejším uličkám a chytrému zadržování vzduchu můžete vzduch posouvat silněji. Pak se objeví kapalina: chlazení přímo na čip, chladicí smyčky a v některých provedeních imerze. Za akcelerátor, který škrtí, jste už zaplatili a nemůžete jej plně využít. Energetická třída PUE (PUE) stále záleží, protože každý watt vynaložený na ventilátory a čerpadla je watt, který nešel do GPU. V tomto příběhu hraje roli i voda: některé elektrárny usrkávají, jiné hltají.

Proč je síťování stejně důležité jako grafické karty?

Trénink je konverzace: tisíce akcelerátorů si vyměňují gradienty, parametry a úlomky modelu v těsné synchronizaci. Pokud se struktura fabric chvěje, celá úloha čeká na nejpomalejší skok. Proto se haly umělé inteligence zaměřují na vysokorychlostní sítě, nízkou latenci, fabric podobné InfiniBand nebo Ethernet ve stejné roli a topologie, které se při selhání spojení nepřeloží na polovinu. Inference se zajímá o latenci ocasu, mnoho menších požadavků a izolaci. V této budově je potrubí restaurací.

K čemu se používá datové centrum umělé inteligence: k trénování nebo inferenci?

Školení je kampaň: sestavte cluster, zadejte do něj data, pravidelně provádějte kontrolní kontroly a běžte hodiny nebo týdny. Inference je výkladní skříň: modely již natrénované, nyní odpovídají, s latencí, na které záleží. Školicí kampusy se honí za výkonem, pozemky a hustotou. Inferenční pracoviště se honí za latencí a přítomností. Hybridní haly existují, protože kapitál není nekonečný, někdy jedna hala se dvěma chladicími smyčkami. O něco starší akcelerátor poblíž zákazníka může porazit okouzlující akcelerátor na vzdáleném kontinentu.

Proč je úložiště v datovém centru s umělou inteligencí důležité?

Trénovací data musí přicházet dostatečně rychle, aby GPU neklepaly nohama. Musí dojít k prodlevám, aby havárie nezahodila týden. Váhy modelů se musí načíst před spuštěním obsluhující repliky. Propustnost úložiště, nejen kapacita, je tichým úzkým hrdlem. Můžete utratit jmění za akcelerátory a vyhladovět je pomocí zdvořilého pole určeného pro virtuální stroje.

Co se stane, když uzel odumře uprostřed běhu?

Jeden nefunkční akcelerátor v úzce propojeném tréninkovém úkolu může zastavit celý refrén. Trénink potřebuje kontrolní body, ne optimismus. Inference vyčerpává nemocný uzel, udržuje repliku v odpovědi a zůstává aktivní. Okna změn stále kolidují s tréninkovými běhy, které se nestarají o váš kalendář. Redundance je stále důležitá pro napájení, chlazení, cesty a úložiště, ale režim selhání je méně přehledný než starý snímek s devíti minutami provozuschopnosti.

Jaký je dopad datového centra s umělou inteligencí na rozvodnou síť, vodu a sousedy?

Připojení k rozvodné síti je často skutečným procesem výběru lokality. Pozemek je snadný ve srovnání s rozvodnou a dodavatelem energií, který má i jiné zákazníky. Voda pro chlazení, pokud ji používáte, se stává problémem sousedů, jakmile jsou srážky nepříjemné, spolu s hlukem, vizuální mohutností a teplem u hraničního plotu. Školení se může skrývat v levnějších trzích s elektřinou a chladnějším podnebí. Inference má ráda blízko uživatelů. Neexistuje jedno dokonalé místo. Existuje kompromis s tiskovou zprávou.

Musím vlastnit datové centrum s umělou inteligencí, nebo si ho mám pronajmout?

Většina lidí nepotřebuje vlastnit jednu z těchto hal. Hyperscalery staví, protože produktem je vozový park. Laboratoře staví, když je doba čekání ve frontě úzkým hrdlem nebo data nemohou odejít. Banka, nemocnice, vláda nebo výrobce s tajnou datovou sadou mohou racionálně využít on-premise nebo soukromou kolokaci. Všichni ostatní by si měli pronajmout: kolokaci připravenou pro umělou inteligenci, cloudovou rezervaci nebo spravovaný cluster. Akcelerátory získáte, aniž byste se stali provozovatelem elektrárny.

Reference

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. Zelená mřížka - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Institut dostupnosti - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Clouddocs.cloud.google.com

Najděte nejnovější AI v oficiálním obchodě s AI asistenty

O nás

Kvíz
1. Co je podle článku datové centrum s umělou inteligencí?

2. Co by měl tým jako Kestrel ve verzi „místa, ne paláce“ dělat, když tovární obrazy nemohou opustit web?

3. Proč článek používá jako výchozí hodnotu před modernizací 18hodinový průměr, nikoli 14hodinový medián?

4. Co se změnilo po modernizaci dvou stojanů v ilustrativním osmicyklovém testu?

5. Co článek říká o uvádění PUE pro tuto dvourackovou buňku?


Zpět na blog