Unafanya utumaji wa usiku wa manane wa kundi la GPU lenye nodi nyingi linaloendesha vituo vya ukaguzi vya mafunzo ya LLM, na ghafla viungo vyako vya 100G vinaanza kupepea, kutupa Rx Fault makosa, au sasisho lako la programu dhibiti husimama na Can not obtain Flash semaphore hitilafu. Katika mazingira ya hesabu yenye msongamano mkubwa, kadi ya kiolesura cha mtandao si bomba rahisi la I/O tena; ni kikwazo muhimu kinachoamua kama GPU zako hutumia mizunguko yao ya kompyuta au kusubiri data. Kuchagua kati ya NVIDIA ConnectX-6 Dx na ConnectX-7 kunahitaji uchunguzi wa kina katika mabomba ya ASIC, urekebishaji wa SerDes, kipimo data cha basi mwenyeji, na uwezo wa kupakua data.
Usanifu wa Kiwango cha Silicon: ConnectX-6 Dx dhidi ya ConnectX-7 ASIC Bomba
Katika moyo wa NVIDIA ConnectX-6 Dx dhidi ya ConnectX-7 Mgawanyiko wa usanifu upo katika mabadiliko ya msingi katika teknolojia ya SerDes (Serializer/Deserializer) na upitishaji wa basi la mwenyeji. ConnectX-6 Dx imejengwa juu ya SerDes za zamani za 50Gb/s (PAM4) na 25/10 Gb/s (NRZ) za Mellanox, zikitoa hadi milango miwili ya 100Gb/s au mlango mmoja wa muunganisho wa Ethernet wa 200Gb/s kupitia kiolesura cha mwenyeji cha PCIe Gen4 x16.
Kwa upande mwingine, ConnectX-7 hutumia teknolojia ya kizazi kijacho ya PAM4 SerDes ya 100Gb/s, ikiwezesha hadi milango minne ya muunganisho na 400Gb/s kubwa ya upitishaji jumla. Upitishaji huu unaungwa mkono na kiolesura asilia cha mwenyeji wa PCIe Gen5 x16, na kuongeza maradufu kipimo data cha basi cha mwelekeo mmoja kutoka 32 GB/s (PCIe Gen4) hadi 64 GB/s (PCIe Gen5). Upanuzi huu wa kipimo data ni muhimu ili kuzuia vikwazo vya mwenyeji hadi NIC wakati wa kulisha GPU zenye utendaji wa hali ya juu.
Adapta zote mbili zina injini ya Kubadilisha na Kuchakata Pakiti kwa Kasi (ASAP²), ambayo hupakua njia za data za swichi pepe (vSwitch) na kipanga njia pepe (vRouter) (kama vile OVS, OVN, na VirtIO) moja kwa moja kwenye silikoni. Hata hivyo, ConnectX-7 ASIC huboresha bomba zaidi kwa kupunguza muda wa kusubiri kwa hadi 50% ikilinganishwa na msingi wa ConnectX-6 Dx. Zaidi ya hayo, ConnectX-7 inaleta injini za maunzi zilizoboreshwa kwa ajili ya Hifadhi ya GPUDirect (GDS) na RoCE ya hali ya juu (RDMA kupitia Ethernet Iliyounganishwa), ikiruhusu ufikiaji wa moja kwa moja wa kumbukumbu kati ya kumbukumbu ya GPU na hifadhi ya mbali bila kuingilia kati kwa CPU. Kwa wasanifu wanaotafuta kuboresha vitambaa vya 100G/200G, unaweza kuchunguza Kwingineko na Bei ya NVIDIA ConnectX-6 Dx SmartNIC ili kupata vifaa vya kuaminika na vyenye msongamano mkubwa.
Ukubwa wa Mizigo ya Kazi: AI Superclusters dhidi ya Enterprise Private Clouds
Wakati wa kuchagua SmartNICs kwa Seva za AI, uamuzi unategemea ukubwa wa trafiki yako ya mashariki-magharibi na uzalishaji wa CPU za seva yako.
ConnectX-6 Dx: Mfanyakazi wa Wingu Binafsi wa Biashara
ConnectX-6 Dx inabaki kuwa chaguo bora kwa uboreshaji wa kawaida, hifadhi iliyoainishwa na programu (vSAN, Ceph), na makundi ya wastani ya makadirio ya kujifunza kwa mashine. Inasaidia hadi sheria milioni 8 za mtiririko katika vifaa, na kuifanya iwe na ufanisi mkubwa kwa mazingira ya wingu ya wapangaji wengi yanayohitaji utengano mkali wa vifaa na usimamizi wa ubora wa juu wa Huduma (QoS). Ikiwa nodi zako za kompyuta zimejengwa kwenye usanifu wa PCIe Gen4 (kama vile AMD EPYC Rome/Milan au Intel Ice Lake), kutumia ConnectX-7 kutasababisha kipimo data kilichokwama, kwani basi mwenyeji haliwezi kujaza kiwango cha laini cha 400G. Kwa undani zaidi katika mabadiliko ya usanifu, soma yetu Uchambuzi wa Uteuzi wa NVIDIA ConnectX-6 Dx, ConnectX-7.
ConnectX-7: Sharti la AI Supercluster
Kwa makundi ya mafunzo ya AI ya raki nyingi yanayotumia NVIDIA H100, H200, au Blackwell GPU, ConnectX-7 ni sharti kali. Mzigo huu wa kazi unahitaji kipimo data kikubwa cha kitambaa kisichozuia ili kushughulikia shughuli za mawasiliano ya pamoja (kama vile Kupunguza Yote na Kupunguza Yote). GPUDirect RDMA ConnectX-7 uwezo hupita CPU mwenyeji na kumbukumbu ya mfumo kabisa, kuandika data moja kwa moja kwenye kumbukumbu ya GPU kwenye mtandao wote kwa kutumia latency ndogo ya microsecond. Zaidi ya hayo, asili ya ConnectX-7 PCIe Gen5 SmartNIC Muundo unalingana na uwezo wa PCIe Gen5 wa mifumo ya kisasa ya seva (AMD EPYC Genoa/Bergamo na Intel Sapphire Rapids), kuhakikisha kwamba kiolesura cha mtandao hakizuii kitambaa cha GPU-hadi-GPU.
Vipimo vya Vifaa na Matrix ya Ukubwa
Jedwali lifuatalo linaelezea vipimo muhimu vya vifaa vya familia zote mbili za SmartNIC ili kusaidia katika kupanga uwezo kwa usahihi.
| Vipimo | NVIDIA ConnectX-6 Dx | NVIDIA ConnectX-7 |
|---|---|---|
| Kiwango cha Juu cha Upitishaji | Hadi 200 Gb/s (1x 200G au 2x 100G) | Hadi 400 Gb/s (1x 400G, 2x 200G, au 4x 100G) |
| Interface Host | PCIe Gen3 / Gen4 x16 | PCIe Gen5 x16 (Inaoana na Gen4 kwa nyuma) |
| Teknolojia ya SerDes | 50Gb/s PAM4 na 25/10Gb/s NRZ | 100Gb/s PAM4 na 50/25/10Gb/s njia za zamani |
| Kupunguza Kuchelewa | Msingi (RoCE ya Kawaida v2) | Hadi ucheleweshaji wa chini wa hadi 50% dhidi ya CX6 Dx |
| Upakiaji wa maunzi | ASAP², SR-IOV, VirtIO, IPsec, TLS, VXLAN, NVGRE | ASAP², SR-IOV, VirtIO, TLS/IPsec/MACsec ya ndani, Hifadhi ya GPUDirect (GDS) |
| Mambo ya Fomu | PCIe yenye Profaili ya Chini, OCP 3.0 SFF, OCP 2.0 | PCIe yenye Profaili ya Chini, OCP 3.0 SFF |
| Mchoro wa Nguvu wa Kawaida | 15W - 22W (Kulingana na aina ya kipitisha sauti) | 24W - 35W (Inahitaji upangaji makini wa joto/mtiririko wa hewa) |
Angalia hisa, linganisha chaguo, au zungumza na timu yetu.
Utatuzi wa Matatizo ya Sehemu: Kutatua Vikwazo vya Viungo, Kutolingana kwa FEC, na Kufungwa kwa Programu Firmware
Kutumia SmartNIC za kasi ya juu mara nyingi hufichua masuala ya msingi ya utangamano wa tabaka la kimwili na programu dhibiti. Masuala mawili ya kawaida yanayoripotiwa katika Jukwaa la Wasanidi Programu la Cisco Support na NVIDIA ni kushindwa kwa mazungumzo ya viungo na swichi za zamani na kufuli za flash semaphore wakati wa masasisho ya programu dhibiti.
Toleo la 1: Hali ya Kupunguza Kiungo / Kura (Kutolingana kwa FEC)
Unapounganisha ConnectX-6 Dx au ConnectX-7 kwenye swichi ya zamani (kama vile jani la Cisco Nexus 5624Q au la zamani la ACI), kiungo kinaweza kubaki bila kufanya kazi huku hali halisi ikiwa imekwama ndani. ETH_AN_FSM_ENABLE or PollingHii kwa kawaida husababishwa na kutolingana kwa Marekebisho ya Hitilafu ya Mbele (FEC) au hitilafu ya mazungumzo otomatiki kupitia nyaya za Direct Attach Copper (DAC). Ili kutatua hili, lazima uzime mazungumzo otomatiki mwenyewe na ulazimishe hali sahihi ya FEC (km. Reed-Solomon FEC rs au Msimbo wa Moto fc) kwenye seva pangishi na swichi.
Tatizo la 2: Kushindwa kwa Sasisho la Programu dhibiti (Haiwezi kupata semaphore ya Flash)
Wakati wa kusambaza programu dhibiti kwa wingi kwa kutumia mstflint, kidhibiti cha kumbukumbu ya flash kinaweza kufungwa, na kusababisha hitilafu kama vile Fail : Can not obtain Flash semaphore or MFE_CR_ERRORHii hutokea wakati mchakato wa awali wa hoja au sasisho unaisha isivyo kawaida, na kuacha alama ya semaphore ya maunzi ikiwa imewekwa.
Kizuizi kifuatacho cha CLI kinaonyesha jinsi ya kugundua hali za viungo, mipangilio ya kasi ya nguvu/FEC, na kufuli za semaphore za flash kwenye seva za Linux:
Uboreshaji wa Mnyororo wa Ununuzi wa Kimkakati na Ugavi
Katika mazingira ya sasa ya vifaa vya AI vinavyohitajiwa sana, kutafuta SmartNIC za kiwango cha biashara kunaweza kuleta hatari kubwa za mradi. Njia za usambazaji za kitamaduni mara nyingi hunukuu muda wa kuongoza wa wiki 6 hadi 8 kwa adapta za mtandao zenye msongamano mkubwa, ambazo zinaweza kusimamisha upelekaji wa makundi ya GPU ya mamilioni ya dola na kupata adhabu ya kucheleweshwa kwa mradi.
Kibadilishaji cha kipanga njia hushughulikia vikwazo hivi vya mnyororo wa ugavi kwa kudumisha zaidi ya dola milioni 20 katika hesabu iliyopo kwenye rafu katika maghala ya kimataifa, na kuwezesha utumaji wa wiki moja kwa masoko muhimu ikiwa ni pamoja na Marekani, Ufaransa, na Korea Kusini. Kwa kuepuka alama za wasambazaji wa kikanda zenye ngazi nyingi, waunganishaji wa mifumo na idara za TEHAMA za biashara wanaweza kuboresha Bill of Materials (BOM) zao na kupata punguzo la moja kwa moja la ununuzi wa wingi.
Kila adapta ya NVIDIA inayopatikana kupitia Router-switch ina dhamana halisi ya 100%, huku nambari za mfululizo zikithibitishwa kikamilifu katika hifadhidata rasmi za wauzaji kabla ya usafirishaji. Ili kupunguza hatari za baada ya kusambazwa, Router-switch hutoa ushauri wa uhandisi wa kiwango cha 1-on-1 wa CCIE bila malipo kwa muundo wa awali wa kitambaa, pamoja na udhamini wa bure wa Huduma ya RS ya Miaka 3. Udhamini huu unajumuisha huduma ya uingizwaji wa Rapid RMA, kusafirisha vifaa vya uingizwaji kwanza ili kupunguza Mean Time to Repair (MTTR) katika mazingira muhimu ya misheni. Ili kuhakikisha nodi zako za GPU zenye msongamano mkubwa zinabaki thabiti kwa joto, kagua Mwongozo wa NVIDIA ConnectX-7 MCX755106AS wa Joto na Utangamano.













































































































































