Hybrydowa architektura AI dla centrów danych przedsiębiorstw

Hybrydowa architektura AI dla centrów danych przedsiębiorstw

Kontekst hybrydowej sztucznej inteligencji dla przedsiębiorstw

Kontekst hybrydowej sztucznej inteligencji dla przedsiębiorstw
  • Sztuczna inteligencja przedsiębiorstw przechodzi z odizolowanych projektów pilotażowych do usług o znaczeniu krytycznym dla biznesu, które muszą obejmować chmurę, centra danych i lokalizacje brzegowe. Dyrektorzy ds. informatyki (CIO) stoją przed presją dostosowania wnioskowania i szkolenia AI do grawitacji danych, zasad zgodności i nieprzewidywalnego zapotrzebowania na GPU, unikając jednocześnie uzależnienia od dostawcy i niekontrolowanych kosztów chmury. Rozdrobniona mieszanka serwerów AI, wysp GPU i przełączania starszych systemów często blokuje przejście na skalowalną, hybrydową architekturę AI.

    W tej sekcji opisano, jak zbudować hybrydową architekturę AI, która równoważy zasoby lokalne i chmurowe, wykorzystując spójne zasady projektowania. Skupiono się na tym, gdzie umieścić szkolenie i wnioskowanie AI, jak połączyć klastry GPU z infrastrukturami centrów danych o wysokiej przepustowości oraz jak etapowo inwestować w serwery AI, platformy GPU i przełączniki, aby każdy etap był dostosowany do konkretnych obciążeń i punktów decyzyjnych przedsiębiorstwa.

Kluczowe czynniki wpływające na projektowanie hybrydowej architektury AI

Znalezienie równowagi między obliczeniami AI w siedzibie klienta, infrastrukturą centrum danych i skalowalnością GPU a ograniczeniami związanymi z kosztami, opóźnieniami i cyklem życia wcale nie jest takie proste.

Kluczowe czynniki wpływające na projektowanie hybrydowej architektury AI
  • Określanie wielkości pojemności AI lokalnej i w chmurze

    Trudno zdecydować, jakie szkolenia i wnioskowania AI zachować lokalnie, a jakie w chmurze, bez nadmiernej rozbudowy, niewystarczającego udostępniania lub przywiązywania się do sztywnych jednostek SKU.

  • Budowanie nieblokującej struktury centrum danych AI

    Klastry AI wymagają infrastruktury wschód-zachód o niskim opóźnieniu i dużej przepustowości; słaba konstrukcja przełączników szybko prowadzi do powstawania punktów aktywnych i braku wydajności procesora GPU.

  • Integracja heterogenicznych platform AI

    Łączenie starszej architektury x86, nowych serwerów AI i węzłów GPU komplikuje cykl życia, narzędzia i ścieżki aktualizacji, zwiększając ryzyko związane z integracją oraz O&M.

Potrzebujesz pomocy? Eksperci techniczni dostępni od zaraz.

  • +1-626-655-0998 (Stany Zjednoczone)
    UTC 15:00-00:00
  • +852-2592-5389 (Hongkong)
    UTC 00:00-09:00
  • +852-2592-5411 (Hongkong)
    UTC 06:00-15:00
Potrzebujesz pomocy? Eksperci techniczni dostępni od zaraz.

Przykłady zastosowań hybrydowej sztucznej inteligencji w przedsiębiorstwach

Gdzie hybrydowe architektury sztucznej inteligencji najlepiej sprawdzają się w rzeczywistych środowiskach przedsiębiorstw w centrach danych, oddziałach i regulowanych domenach.

Centrum danych przedsiębiorstwa, hybrydowy hub AI

Centrum danych przedsiębiorstwa, hybrydowy hub AI

  • Przeprowadzaj szkolenie podstawowych modeli, ponowne szkolenie i wnioskowanie na dużą skalę w lokalnych klastrach AI, korzystając z serwerów AI i akceleratorów GPU, jednocześnie przenosząc złożone eksperymenty do chmury publicznej, gdy pojemność jest ograniczona.
  • Hostuj wrażliwe na opóźnienia usługi sztucznej inteligencji, takie jak silniki rekomendacji, wyszukiwanie wiedzy i potoki przetwarzania obrazu komputerowego, na przełącznikach centrów danych zoptymalizowanych pod kątem ruchu wschód-zachód o dużej przepustowości.
  • Konsoliduj zróżnicowane obciążenia AI, w tym VDI, dzięki udoskonaleniom AI, analityce i obsłudze modeli w ramach współdzielonej puli serwerów GPU z opartym na zasadach routingiem między prywatnymi i publicznymi punktami końcowymi AI.
Regulowane i suwerenne środowiska AI

Regulowane i suwerenne środowiska AI

  • Wdrażaj serwery AI lokalnie w sektorach objętych ścisłymi regulacjami, aby wrażliwe dane szkoleniowe, wagi modeli i dzienniki wnioskowania pozostały w kraju, podczas gdy zewnętrzne modele bazowe będą selektywnie wykorzystywane za pośrednictwem bezpiecznych interfejsów API.
  • Użyj serwerów GPU do precyzyjnego dostrojenia i przekształcenia dużych modeli publicznych w mniejsze wersje specyficzne dla danej domeny, które można w pełni obsługiwać w zgodnych z przepisami centrach danych z audytowalnymi potokami sztucznej inteligencji.
  • Segmentuj krytyczny ruch AI na dedykowanych przełącznikach centrów danych, wymuszając mikrosegmentację i QoS, aby obciążenia AI w obszarze klinicznym, finansowym lub rządowym nigdy nie przechodziły przez niezaufane ścieżki sieciowe, nawet w konfiguracjach hybrydowych.
Hybrydowa sztuczna inteligencja uwzględniająca oddziały i brzegi

Hybrydowa sztuczna inteligencja uwzględniająca oddziały i brzegi

  • Umieść kompaktowe węzły wnioskowania AI w lokalizacjach regionalnych lub oddziałach, aby lokalnie uruchamiać prognozy w czasie rzeczywistym, przetwarzanie dokumentów lub przetwarzanie obrazu komputerowego, jednocześnie synchronizując modele z centralnymi klastrami centrów danych, gdy dostępne są łącza.
  • Przesyła zagregowany ruch AI oddziałów przez przełączniki centrów danych do klastrów procesorów GPU w celu okresowego wnioskowania wsadowego, uczenia się w trybie offline lub przeprowadzania bardziej zaawansowanych analiz przekraczających lokalne limity obliczeniowe.
  • Wykorzystaj hybrydowe wzorce projektowania sztucznej inteligencji, które kierują mniej istotne wnioski do punktów końcowych w chmurze, jednocześnie rezerwując lokalne serwery AI na potrzeby aplikacji brzegowych wrażliwych na opóźnienia lub prywatność, takich jak monitoring przemysłowy lub inteligentny handel detaliczny.
Aplikacje biznesowe i VDI oparte na sztucznej inteligencji

Aplikacje biznesowe i VDI oparte na sztucznej inteligencji

  • Hostuj środowiska VDI wzbogacone o sztuczną inteligencję na serwerach GPU, aby projektanci, inżynierowie i analitycy mogli uzyskiwać dostęp do przyspieszonych narzędzi wizualizacyjnych, projektowania generatywnego lub wspomagania kodowania z dowolnego miejsca, zachowując przy tym stałą wydajność.
  • Obsługuj korporacyjnych pilotów, chatboty i asystentów wiedzy z lokalnych serwerów AI zintegrowanych z systemami wewnętrznymi, jednocześnie przenosząc ciężkie zadania związane z szkoleniem wstępnym i wnioskowaniem w dużym kontekście na dostawców usług w chmurze.
  • Użyj przełączników centrów danych do budowy infrastruktury o niskich opóźnieniach między serwerami aplikacji, pamięcią masową i węzłami GPU, zapewniając responsywne środowisko użytkownika dla obciążeń biurowych, CRM, ERP i współpracy wspomaganych przez sztuczną inteligencję.
Skalowalna struktura AI dla klastrów GPU

Skalowalna struktura AI dla klastrów GPU

  • Projektuj struktury typu spine-leaf z przełącznikami centrów danych o wysokiej przepustowości, aby łączyć serwery AI i węzły GPU na potrzeby rozproszonego szkolenia, architektur serwerów parametrów i obciążeń modeli równoległych.
  • Wdrażaj hybrydowe potoki danych, w których surowe dane trafiają na serwery lokalne, są wstępnie przetwarzane na lokalnych serwerach obliczeniowych, a następnie selektywnie przekazywane do usług sztucznej inteligencji w chmurze lub klastrów GPU obsługujących wiele dzierżaw w celu przeprowadzania szkoleń na dużą skalę.
  • Stopniowo zwiększaj możliwości sztucznej inteligencji, dodając serwery GPU i porty sieciowe w miarę uruchamiania nowych projektów, jednocześnie utrzymując ujednolicony model operacyjny do monitorowania, planowania i inżynierii ruchu w domenach hybrydowych.

Najczęściej zadawane pytania

Jak wybrać między serwerami AI i serwerami GPU w przypadku hybrydowej architektury AI?

  • W większości korporacyjnych projektów hybrydowych rozwiązań AI serwery AI, takie jak rodziny HW-AT600W / HW-AT800 / HW-AT9508-G3 / HW-AT3500-G3, są pozycjonowane jako główne węzły szkoleniowe i wnioskowania o wysokiej przepustowości, podczas gdy serwery GPU i akceleratory (CIS:HCI-GPU-A30-M6, CIS:HCI-GPU-A100-80M6, NVI:A30 itp.) są używane do skalowania specjalistycznych obciążeń, takich jak obsługa modeli, VDI AI lub wydajność szczytowa dla określonych jednostek biznesowych.
  • Praktyczna zasada podejmowania decyzji jest następująca: jeśli potrzebujesz ściśle zintegrowanego przetwarzania, przechowywania i sieci z przewidywalnym cyklem życia dla klastrów klasy centrum danych, nadaj priorytet serwerom AI; jeśli potrzebujesz bardziej elastycznego, przyrostowego przyspieszenia istniejącej infrastruktury x86 lub stosów VDI, kładź nacisk na serwery GPU i jednostki SKU akceleratorów.
  • W przypadku złożonych, mieszanych scenariuszy (na przykład łączenia szkolenia lokalnego z wnioskowaniem brzegowym i odciążaniem chmury publicznej) nasz zespół rozwiązań może mapować przypadki użycia biznesowego na zalecany podział między serwerami AI i akceleratorami GPU, w tym planowanie portów i przepustowości w kierunku przełączników AI Fabric.

Co należy sprawdzić pod kątem kompatybilności sieciowej podczas podłączania serwerów AI do przełączników centrów danych w ramach infrastruktury AI?

  • Należy zacząć od docelowej topologii struktury AI i przepustowości na węzeł: serwery AI i serwery GPU powinny być tak skalowane, aby odpowiadały połączeniom uplink na przełącznikach centrów danych, takich jak CIS:HCI-FI-64108-M6, CIS:HCI-FI-6454-M6, HW:6857-EI-F-B01/B0B/B02 lub HW:CR5D0LAXFE72, w tym liczbie portów 25G/100G/400G i współczynnikom nadsubskrypcji.
  • Potwierdź zgodność transceivera i okablowania między kartami sieciowymi serwera i portami przełącznika (na przykład listy DAC/AOC QSFP28 lub QSFP56, obsługiwane tryby podziału i współdziałanie różnych dostawców) oraz zweryfikuj funkcje wymagane dla obciążeń AI, takie jak RDMA, ECN i zarządzanie przeciążeniem w planie rozwoju systemu operacyjnego przełącznika.
  • Jeśli planujesz rozszerzyć tę infrastrukturę na centra danych lub na bramę hybrydowej łączności w chmurze, weź pod uwagę możliwości routingu i konstrukcję bufora na przełącznikach rdzeniowych, takich jak HW:CR5D0LAXFE72, aby uniknąć wąskich gardeł w ruchu wschód-zachód i synchronizacji między regionami.
  • Nasz zespół może pomóc w sprawdzeniu kompletnego zestawienia materiałów (serwerów, przełączników, optyki, kabli) oraz przeprowadzeniu kontroli interoperacyjności przed sfinalizowaniem zakupu, co zmniejsza ryzyko wystąpienia problemów na poziomie łącza w czasie wdrażania.

Jak określić rozmiar lokalnych węzłów AI w porównaniu z zasobami w chmurze w hybrydowym wdrożeniu AI?

  • W przypadku hybrydowych rozwiązań AI dla przedsiębiorstw węzły lokalne (na przykład serwery szkoleniowe HW-AT600W-2/HW-AT800-2 oraz węzły GPU, takie jak CIS:HCI-GPU-A100-80M6) są zazwyczaj zarezerwowane dla obciążeń wrażliwych na dane lub krytycznych pod względem opóźnień, podczas gdy chmura jest wykorzystywana do elastycznych lub eksperymentalnych obciążeń z mniej rygorystycznymi wymaganiami dotyczącymi przechowywania danych.
  • Praktycznym podejściem jest ustalenie bazowego zapotrzebowania w stanie ustalonym (modele podstawowe, usługi wnioskowania krytycznego, wewnętrzni piloci zapasowi) i dostosowanie go do klastrów lokalnych, a następnie przydzielenie pewnego współczynnika zapasu (często 20–40% w zależności od zmienności firmy), który można obsłużyć za pomocą dodatkowych serwerów GPU lokalnych lub za pomocą krótkoterminowych wybuchów chmury.
  • Kluczowym ograniczeniem jest sieć: należy się upewnić, że przełączniki w centrum danych, takie jak CIS:HCI-FI-64108-M6 / HW:6857-EI-F-B0B, mogą obsłużyć ruch wschód-zachód rozproszonego szkolenia, podczas gdy brama WAN lub DC może obsługiwać synchronizację modelu i replikację zestawu danych do/z chmury bez przeciążania łączy produkcyjnych.
  • Jeśli udostępnisz swoje modele docelowe, współbieżność i przepływy danych, możemy pomóc Ci stworzyć plan o odpowiedniej wielkości, który zrównoważy serwery CapEx AI z chmurą OpEx oraz dostosuje liczbę portów, moc i przestrzeń w szafie.

Jakich zagrożeń wdrożeniowych należy być świadomym, wdrażając hybrydową infrastrukturę AI z tymi przełącznikami i serwerami?

  • Do typowych zagrożeń zalicza się niedoszacowanie poboru mocy i chłodzenia w przypadku serwerów AI o dużej gęstości (na przykład obudów HW-AT9508-G3-2 lub węzłów z dużą liczbą procesorów GPU), błędną konfigurację funkcji transportu bezstratnego na przełącznikach w centrach danych oraz brak planu wycofania zmian przy wprowadzaniu nowych struktur AI do istniejącej sieci produkcyjnej.
  • Wiele struktur AI wymaga spójnych zasad QoS, PFC i ECN we wszystkich wykorzystywanych przełącznikach (CIS:HCI-FI-6454-M6, HW:seria 6857-EI-F itd.); niedopasowane oprogramowanie sprzętowe lub częściowo skonfigurowane węzły mogą powodować mikroprzerwy, opóźnienia ogonowe lub okresową utratę pakietów, które pojawiają się tylko podczas obciążenia treningowego.
  • Z perspektywy architektury niewystarczająca segmentacja między klastrami AI a resztą sieci przedsiębiorstwa może stwarzać zagrożenia dla bezpieczeństwa i zasięgu; projekty sieci VLAN/VXLAN i zasady dostępu powinny zostać zweryfikowane przed uruchomieniem, szczególnie w środowiskach AI obsługujących wielu użytkowników.
  • Zalecamy etapowe wdrażanie z syntetycznymi testami obciążenia i ćwiczeniami w poszukiwaniu awarii, a także szablonami konfiguracji i zarządzaniem poza pasmem, aby uniknąć nieplanowanych przestojów po zintegrowaniu hybrydowej infrastruktury AI z głównym centrum danych.

Co powinienem wiedzieć o gwarancji, wsparciu technicznym i planowaniu cyklu życia tych hybrydowych produktów AI?

  • Infrastruktura AI charakteryzuje się szybszym cyklem innowacji niż tradycyjny sprzęt korporacyjny, dlatego ważne jest, aby dostosować warunki gwarancji i wsparcia do strategii odświeżania modelu serwerów AI (rodziny HW-AT600W / HW-AT800 / HW-AT9508-G3 / HW-AT3500-G3), serwerów GPU i przełączników centrów danych.
  • Zalecamy wczesne sprawdzenie statusu cyklu życia sprzętu przy użyciu narzędzi takich jak nasze Sprawdzanie EOL/EOSL dzięki temu unikniesz projektowania nowych struktur AI na platformach, które osiągną koniec wsparcia w trakcie trwania Twojego projektu.
  • Do wdrażania i rozwiązywania problemów ze złożonymi topologiami hybrydowej sztucznej inteligencji możesz również wykorzystać nasze bezpłatne wsparcie CCIE w celu walidacji projektów, przeglądu konfiguracji i ograniczenia ryzyka wdrożenia w środowiskach obejmujących wielu dostawców.
  • Aby uzyskać szczegółowe informacje na temat zakresu, procesu RMA i opcji okresów gwarancji dla konkretnych jednostek magazynowych, zapoznaj się z naszą Polityka gwarancyjna i potwierdź dokładny poziom usług odpowiadający Twoim wymaganiom dotyczącym zgodności i dostępności.
  • Uwaga: Szczegółowe warunki gwarancji i usługi wsparcia mogą się różnić w zależności od produktu i regionu. Dokładne informacje można znaleźć w oficjalnych informacjach. W celu uzyskania dalszych informacji prosimy o kontakt: router-switch.com.

W jaki sposób obsługiwana jest wysyłka, podatki i potencjalne zwroty w przypadku zamówień na sprzęt AI klasy centrów danych?

  • W przypadku serwerów AI, serwerów GPU i przełączników centrów danych opcje wysyłki i terminy realizacji zależą od dostępności produktu, konfiguracji (na przykład w pełni wyposażony HW-AT9508-G3-2 w porównaniu z przełącznikami o stałym formacie) oraz kraju przeznaczenia; w przypadku artykułów dostępnych w magazynie terminy dostawy nadal będą zależeć od warunków logistycznych i lokalnych procesów importowych i nie mogą być zagwarantowane z góry.
  • Dostępne opcje logistyczne i warunki można sprawdzić w naszym metody wysyłki przegląd i sprawdź, jak cła i podatek VAT mogą obowiązywać w Twojej jurysdykcji, korzystając z naszego przewodnika podatki i cła przed sfinalizowaniem zakupu dużej infrastruktury AI.
  • Jeśli musisz zwrócić wadliwe towary odkryte podczas testów wstępnych lub pilotażowych wdrożenia hybrydowej sztucznej inteligencji, postępuj zgodnie z procesem krok po kroku opisanym w naszym instrukcje zwrotu; pomaga to zapewnić, że wartościowe komponenty AI są prawidłowo pakowane, dokumentowane i przetwarzane.

Więcej rozwiązań

GPU Cluster Networking Solutions for AI Scale-Out

Rozwiązania sieciowe klastrów GPU do skalowania AI

Projektuj wydajne struktury Ethernet dla klastrów GPU AI z uwzględnieniem skalowalnej topologii, przełączania o niskich opóźnieniach i architektury gotowej do wdrożenia.

Sieciowanie klastrów GPU AI
Ethernet vs InfiniBand for AI & HPC Networks

Ethernet kontra InfiniBand dla sieci AI i HPC

Szczegółowe porównanie technologii Ethernet i InfiniBand dla infrastruktury AI/HPC — opóźnienia, skalowalność, RDMA i kompromisy dotyczące kosztów.

Sieci AI i HPC
Data Center Power & Cooling Planning

Planowanie zasilania i chłodzenia centrum danych

Kluczowe punkty planowania sieci o dużej gęstości — zasilanie szafy, przepływ powietrza, redundancja i gotowość chłodzenia na potrzeby skalowania.

Zasilanie i chłodzenie centrów danych