Mwongozo wa Usambazaji na Utangamano wa NVIDIA ConnectX-7 MCX755106AS-HEAT

Kufuata Us:

Unapopanga kundi la GPU la nodi nyingi kwa ajili ya mafunzo ya Large Language Model (LLM) na kugundua kusimama ghafla kwa enzi ya mafunzo au kushuka kwa pakiti za microburst wakati wa awamu za mawasiliano ya pamoja ya All-Reduce, kikwazo mara chache huwa GPU yenyewe—karibu kila mara ni kutoweza kwa kadi ya kiolesura cha mtandao kushughulikia uwekaji wa mfuatano wa kiwango cha mstari katika latencies ndogo za microsecond. Katika kompyuta ya utendaji wa juu (HPC) na vitambaa vya AI, upotevu wa pakiti ndio muuaji mkuu wa utendaji. Adapta za kawaida za mtandao hazina upakiaji wa kiwango cha vifaa na ustahimilivu wa joto unaohitajika ili kudumisha upitishaji wa pande mbili wa 200Gbps chini ya mzigo unaoendelea. NVIDIA ConnectX-7 MCX755106AS-HEAT imeundwa mahsusi ili kutatua vikwazo hivi vya muunganisho kwa kuchanganya muda wa kusubiri wa chini sana, upakiaji wa vifaa vya hali ya juu, na muundo thabiti wa joto.

Mwongozo huu unatoa uchambuzi wa kina wa kiufundi wa usanifu wa ConnectX-7, mahitaji ya utangamano wa kimwili na kimantiki, usanidi wa hatua kwa hatua wa CLI, na mbinu za kimkakati za kutafuta vyanzo ili kuboresha mfumo wako wa kompyuta wenye utendaji wa hali ya juu.

 NVIDIA ConnectX-7 MCX755106AS-HEAT

Sehemu ya 1: Muhtasari wa Usanifu na ASIC

Katika msingi wa NVIDIA ConnectX-7 MCX755106AS-HEAT Ipo ConnectX ASIC ya kizazi cha 7, maajabu ya uhandisi wa usindikaji wa mtandao iliyoundwa kupakua itifaki za safu ya usafirishaji moja kwa moja kutoka kwa CPU mwenyeji. Kwa mzigo wa kazi wa kisasa wa akili bandia (AI), kutegemea mrundikano wa TCP/IP wa mfumo endeshi wa mwenyeji huanzisha ucheleweshaji usiokubalika na uendeshaji wa CPU. ConnectX-7 ASIC hupita kizuizi hiki kupitia Ufikiaji wa Kumbukumbu ya Mbali ya Moja kwa Moja (RDMA) inayotekelezwa na vifaa kupitia itifaki za usafiri za Converged Ethernet (RoCEv2) na InfiniBand.

Vifaa vya Kuongeza Kasi ASAP2 na GPUDirect RDMA

ASIC ina teknolojia ya Kubadilisha na Kuchakata Pakiti kwa Kasi (ASAP2), ambayo hupakia njia ya data ya swichi pepe (swichi pepe) hadi kwenye maunzi ya NIC. Hii inaruhusu usambazaji wa pakiti kwa kiwango cha mstari, usanidi/uondoaji wa kapsuli wa VXLAN, na shughuli za NAT bila kutumia mizunguko ya CPU mwenyeji.

Kwa AI na mazingira ya kujifunza kwa kina, Usanidi wa GPUDirect RDMA ni nguzo muhimu ya usanifu. GPUDirect RDMA inaruhusu GPU katika seva tofauti kuandika moja kwa moja kwenye nafasi za kumbukumbu za kila mmoja kwenye mtandao, ikipita kabisa CPU mwenyeji, kumbukumbu ya mfumo, na nakala za ziada za bafa. Hii hupunguza ucheleweshaji wa mwisho hadi mwisho hadi safu ndogo ya microsecond na kuongeza ufanisi wa maktaba za mawasiliano ya pamoja kama vile NCCL (Maktaba ya Mawasiliano ya Pamoja ya NVIDIA).

Injini za Kupakua Fedha za Kidijitali

Usalama katika vituo vya data vya wapangaji wengi hudumishwa kwa kiwango cha laini. ConnectX-7 ASIC huunganisha injini za usimbaji fiche wa maunzi na usimbaji fiche wa ndani kwa IPsec na TLS. Kwa kupakia shughuli za usimbaji fiche kwenye ConnectX-7 200GbE SmartNIC, makampuni yanaweza kupata data ndani ya usafirishaji bila kupata adhabu ya kawaida ya 30-40% inayohusiana na usimbaji fiche unaotegemea programu.

Ili kusanidi na kuthibitisha vipengele hivi vya hali ya juu vya ASIC, wasimamizi wa mfumo hutumia seti ya NVIDIA Firmware Tools (MFT). Hapa chini kuna kizuizi cha usanidi wa CLI kinachoonyesha jinsi ya kuanzisha kadi, kuwezesha SR-IOV, kulazimisha kasi ya kiungo cha PCIe Gen 5.0, na kuthibitisha itifaki ya kiungo kinachofanya kazi.

# Step 1: Query the current configuration of the ConnectX-7 adapter
mst start
mst status -v
# Assuming the device is identified as mt4129_pciconf0

# Step 2: Enable SR-IOV and allocate 8 Virtual Functions (VFs)
mlxconfig -d mt4129_pciconf0 set SRIOV_EN=1 NUM_OF_VFS=8

# Step 3: Configure the link type to Ethernet (Force Ethernet mode)
mlxconfig -d mt4129_pciconf0 set LINK_TYPE_P1=2

# Step 4: Force PCIe Gen 5.0 link speed (Link Speed Generation 4 corresponds to Gen 5 in MFT)
mlxconfig -d mt4129_pciconf0 set FORCE_PCI_SPEED=4

# Step 5: Apply changes and reboot the host server
echo "Configuration updated. Please perform a cold reboot of the host server to apply PCIe changes."

# Step 6: Post-reboot verification of link status, speed, and FEC mode
mlxlink -d mt4129_pciconf0 -p 1 --show_fec

Sehemu ya 2: Vipimo vya Vifaa na Mwongozo wa Ukubwa wa Utendaji

Kupeleka NVIDIA ConnectX-7 MCX755106AS-HEAT inahitaji uelewa sahihi wa sifa zake za kimwili, umeme, na joto. Kiambishi tamati cha "-HEAT" kinaashiria muundo maalum wa heatsink tulivu ulioboreshwa kwa seva za 1U na 2U zenye msongamano mkubwa ambapo mwelekeo wa mtiririko wa hewa na ujazo hudhibitiwa vikali. Bila mtiririko wa hewa wa mstari wa kutosha (kawaida ni angalau 350 LFM katika mazingira ya 35°C), kadi itapata msongamano wa joto, na kusababisha kushuka kwa pakiti na kupigwa kwa kiungo.

Utangamano wa PCIe Gen 5.0 na Bifurcation

Kadi hutumia kiolesura halisi cha PCIe Gen 5.0 x16, kinachotoa kipimo data cha kinadharia cha mwelekeo-mbili cha hadi 128 GB/s. Ili kufikia utendaji kamili wa kiwango cha mstari cha 200Gbps, kadi lazima isakinishwe katika nafasi asilia ya PCIe Gen 5.0 iliyounganishwa moja kwa moja kwenye mfumo mkuu wa CPU. Kusakinisha kadi katika nafasi ya PCIe Gen 4.0 kutapunguza kiwango cha juu cha upitishaji hadi takriban 128Gbps kutokana na mapungufu ya kipimo data cha basi. Zaidi ya hayo, hakikisha kwamba BIOS ya seva imeundwa ili kusaidia ugawaji wa PCIe ikiwa nafasi imeshirikiwa, ingawa nafasi ya kawaida ya x16 inapendekezwa sana.

Tofauti za Lango la Kimwili na FEC

MCX755106AS-HEAT ina lango moja la QSFP112 linalounga mkono kasi ya 200Gb/s kwa kutumia ishara ya PAM4 (Pulse Amplitude Modulation 4-level). Sehemu ya kawaida ya maumivu ya uwasilishaji wa ulimwengu halisi ni kugongana kwa lango kunakosababishwa na kutolingana kwa Marekebisho ya Makosa ya Mbele (FEC) kati ya SmartNIC na swichi ya juu. Ishara ya PAM4 inahitaji FEC kudumisha Kiwango cha Makosa ya Biti (BER) kinachokubalika. Wahandisi lazima wahakikishe kwamba lango la ConnectX-7 na lango la swichi vimeundwa waziwazi kutumia hali sawa ya FEC (kawaida RS-FEC au Firecode, kulingana na urefu na aina ya kebo).

Jedwali lifuatalo linaelezea vipimo vya kiufundi vya MCX755106AS-HEAT ikilinganishwa na adapta zingine za kawaida za mtandao katika darasa lake:

Param ya Uainisho NVIDIA ConnectX-7 MCX755106AS-HEAT NVIDIA ConnectX-6 Dx (Ulinganisho)
Kizazi cha ASIC ConnectX-7 ConnectX-6 Dx
Kasi ya Juu ya Bandari 200 Gb/s (Lango Moja) 100 Gb/s (Bandari Mbili) / 200 Gb/s
interface Aina QSFP112 QSFP56
Interface Host PCIe Mwa 5.0 x16 PCIe Mwa 4.0 x16
Suluhisho la joto Sinki ya Joto Isiyopitisha Joto Nrefu (-JOTO) Sinki ya Joto ya Kawaida Isiyopitisha Joto
Usaidizi wa GPUDirect RDMA Asili (Imeboreshwa kwa ajili ya Hopper/Blackwell) Asili (Imeboreshwa kwa Ampea)
Matumizi ya Nguvu ya kawaida ~ 19.3W ~ 17.5W

Wakati wa kupanga yako Utangamano wa NVIDIA MCX755106AS-HEAT matrix, thibitisha kwamba chassis ya seva yako inaweza kutoa mtiririko wa hewa unaohitajika kwa nafasi za PCIe. Katika seva zenye 1U GPU zenye wingi, nafasi za kawaida za hali ya chini zinaweza kuzuia mtiririko wa hewa, na kuhitaji matumizi ya feni zenye shinikizo la juu au vifuniko maalum vya hewa ili kuzuia SmartNIC kuzidi halijoto yake ya juu ya makutano ya uendeshaji ya 105°C.

Sehemu ya 3: Utafutaji, Uboreshaji wa BOM, na Kupunguza Hatari

Kutafuta vifaa vya mitandao vya hali ya juu kama vile NVIDIA ConnectX-7 MCX755106AS-HEAT hutoa changamoto kubwa za mnyororo wa ugavi. Njia za usambazaji za kitamaduni mara nyingi hunukuu muda wa kuongoza wa wiki 6 hadi 12, ambao unaweza kusimamisha upelekaji muhimu wa nguzo za AI na kusababisha adhabu kali za kucheleweshwa kwa mradi. Ili kupunguza hatari hizi, waunganishaji wa mifumo na idara za IT za biashara lazima zishirikiane na wasambazaji wepesi na waliojaa vifaa vingi.

Kushinda Nyakati za Wakurugenzi na Mapato ya Wafanyakazi wa Kati

Kibadilishaji cha Router hushughulikia vikwazo hivi vya mnyororo wa ugavi kwa kudumisha zaidi ya dola milioni 20 katika hesabu ya ghala nyingi, iliyo kwenye rafu. Wasifu huu mpana wa hisa huruhusu usambazaji wa kimataifa wa wiki moja, na kubadilisha ucheleweshaji unaowezekana wa miezi mingi kuwa usambazaji wa haraka na unaotabirika. Zaidi ya hayo, kwa kutumia mnyororo wa ugavi wa moja kwa moja, Kibadilishaji cha Router hupita tabaka nyingi za alama za kati za kikanda. Hii inawezesha biashara ndogo hadi za kati (SMEs) na viunganishi vya mifumo mikubwa kupata punguzo la moja kwa moja la ununuzi wa wingi, na kuboresha kwa kiasi kikubwa Muswada wa Vifaa (BOM) kwa usambazaji wa makundi makubwa.

Ili kuboresha mchakato wako wa ununuzi na kuthibitisha bei ya sasa, unaweza kuchunguza Bei na Upatikanaji wa Hisa za NVIDIA ConnectX-7 MCX755106AS-HEAT moja kwa moja kwenye jukwaa letu.

Usaidizi wa Uhandisi na Kupunguza Hatari

Kupeleka a Adapta ya mtandao ya PCIe Gen 5.0 katika usanifu wa seva za zamani au maalum zinaweza kuleta changamoto zisizotarajiwa za ujumuishaji, kama vile kutolingana kwa BIOS au migogoro ya kiendeshi cha OS. Kibadilishaji cha kipanga njia hupunguza hatari hizi za baada ya ununuzi kwa kutoa:

  • Ushauri wa Kiufundi wa CCIE/CCDE wa Bure: Timu yetu ya uhandisi ya hali ya juu husaidia katika kuthibitisha utangamano wa seva, utendakazi wa transceiver, na mpangilio wa kiendeshi cha mfumo wa uendeshaji kabla ya vifaa kusafirishwa.
  • Dhamana ya Bure ya Huduma ya RS ya Miaka 3: Dhamana hii kamili hutoa amani ya akili, ikilinda uwekezaji wako zaidi ya dhamana za kawaida za mtengenezaji.
  • Ubadilishaji wa RMA ya Haraka kwa Muda Uliopangwa: Katika tukio la nadra la hitilafu ya vifaa, Kibadilishaji cha Kipanga Njia hupunguza Muda wako wa Kurekebisha (MTTR) kwa kusafirisha kifaa kingine. kwanza, kuhakikisha mafunzo yako ya AI yanapata muda mfupi wa kutofanya kazi.
  • Dhamana Halisi ya 100%: Kila SmartNIC inayosafirishwa ina nambari ya serial inayoweza kuthibitishwa kikamilifu (S/N) ambayo inaweza kuthibitishwa moja kwa moja kwenye hifadhidata rasmi ya muuzaji, na kuhakikisha uadilifu kamili wa vifaa.

 

Sehemu ya 4: Maswali Yanayoulizwa Mara Kwa Mara (FAQ)

Swali la 1: Je, faida kuu ya kiambishi tamati cha "-HEAT" kwenye modeli ya MCX755106AS-HEAT ni ipi?

Kiambishi tamati cha "-HEAT" kinaonyesha kwamba kadi ina vifaa maalum vya kupokanzwa visivyo na joto. Muundo huu umeundwa ili kuongeza utengamano wa joto katika seva za raki za 1U na 2U zenye msongamano mkubwa ambazo zina mtiririko wa hewa wa kasi ya juu na mwelekeo. Huzuia msongamano wa joto chini ya mzigo wa kazi wa pande mbili wa 200Gbps unaoendelea, ambao ni muhimu kwa kudumisha utendaji thabiti katika makundi ya mafunzo ya AI.

Swali la 2: Je, NVIDIA ConnectX-7 MCX755106AS-HEAT inaweza kutumika kwenye nafasi ya PCIe Gen 4.0?

Ndiyo, kadi hiyo inaendana kikamilifu na nafasi za PCIe Gen 4.0 na Gen 3.0. Hata hivyo, kusakinisha hii Adapta ya mtandao ya PCIe Gen 5.0 Katika nafasi ya PCIe Gen 4.0 x16 itapunguza kipimo data cha juu cha basi halisi hadi takriban 128Gbps, na kuzuia kadi kufikia uwezo wake kamili wa kiwango cha mstari cha 200Gbps. Kwa utendaji wa juu zaidi, nafasi asilia ya PCIe Gen 5.0 x16 inapendekezwa sana.

Q3: Ninawezaje kutatua matatizo ya kufungia milango yanayosababishwa na kutolingana kwa FEC?

Uashiriaji wa PAM4 kwa kasi ya 200G unahitaji Urekebishaji wa Hitilafu ya Mbele (FEC) ili kudumisha uthabiti wa kiungo. Ikiwa swichi ya juu na ConnectX-7 SmartNIC vimewekwa kwenye hali tofauti za FEC (km, moja imewekwa kwenye RS-FEC na nyingine kwenye No-FEC), kiungo kitashindwa kuimarika au kitapepea kila mara. Tumia NVIDIA mlxlink chombo cha kuuliza hali ya FEC na kusanidi waziwazi ncha zote mbili za kiungo ili zilingane:

mlxlink -d mt4129_pciconf0 -p 1 --fec_speed 200G --set_fec RS

Swali la 4: Je, kadi hii inasaidia itifaki za InfiniBand na Ethernet?

Vifaa vya ConnectX-7 vina uwezo wa kuunga mkono itifaki zote mbili, lakini uwezo maalum hutegemea programu dhibiti na OPN. MCX755106AS-HEAT kimsingi imeboreshwa kama ConnectX-7 200GbE SmartNIC kwa mazingira ya Ethernet. Unaweza kuuliza na kubadilisha itifaki za viungo vinavyoungwa mkono kwa kutumia mlxconfig chombo (LINK_TYPE_P1 kigezo) ili kukidhi mahitaji yako maalum ya kitambaa.

Swali la 5: Je, GPUDirect RDMA inaboreshaje ufanisi wa mafunzo ya LLM?

Katika mitandao ya kawaida, data iliyohamishwa kutoka kwa GPU ya mbali lazima inakiliwe kwenye kumbukumbu ya mfumo mwenyeji, kusindika na CPU mwenyeji, na kisha kunakiliwa kwenye GPU ya ndani. Usanidi wa GPUDirect RDMA Hupita CPU mwenyeji na RAM ya mfumo kabisa, na kuruhusu GPU kusoma na kuandika moja kwa moja kwenye kumbukumbu ya GPU ya mbali kupitia mtandao. Hii hupunguza muda wa kusubiri, huondoa gharama za uendeshaji za CPU, na huzuia vikwazo wakati wa awamu muhimu za ulandanishi katika mafunzo ya AI yaliyosambazwa.

mtaalam

Utaalamu Hujenga Uaminifu

Miaka 20+ • Nchi 200+ • Wateja/Miradi 21500+
CCIE · JNCIE · NSE7 · ACDX · HPE Master ASE · Dell Server/AI Mtaalamu