NVIDIA Mellanox MCX631432AN-ADAB σε δράση: RDMA/RoCE χαμηλής καθυστέρησης μεταφοράς και βελτιστοποίηση της απόδοσης του διακομιστή

July 28, 2026

τα τελευταία νέα της εταιρείας για NVIDIA Mellanox MCX631432AN-ADAB σε δράση: RDMA/RoCE χαμηλής καθυστέρησης μεταφοράς και βελτιστοποίηση της απόδοσης του διακομιστή

NVIDIA Mellanox MCX631432AN-ADAB σε Δράση: Μεταφορά Χαμηλής Καθυστέρησης RDMA/RoCE και Βελτιστοποίηση Απόδοσης Διακομιστή

Υπόβαθρο & Προκλήσεις: Το Σημείο Συμφόρησης Δικτύου σε ένα Συστάδα Εκπαίδευσης AI

Μια κορυφαία εταιρεία fintech ανέπτυξε πρόσφατα μια συστάδα AI βασισμένη σε GPU 64 κόμβων, σχεδιασμένη για εκπαίδευση στρατηγικών συναλλαγών υψηλής συχνότητας, με κάθε διακομιστή εξοπλισμένο με αποθηκευτικό χώρο NVMe υψηλής απόδοσης. Ωστόσο, μετά την έναρξη λειτουργίας, η πραγματική απόδοση εκπαίδευσης έπεσε σημαντικά κάτω από τις προσδοκίες. Η ανάλυση μετά την ανάπτυξη αποκάλυψε ότι το δίκτυο επικοινωνίας μεταξύ κόμβων βασισμένο σε 10GbE TCP/IP είχε γίνει το κύριο σημείο συμφόρησης. Οι λειτουργίες συλλογικής επικοινωνίας All-Reduce παρουσίασαν καθυστέρηση έως και 4-5 χιλιοστά του δευτερολέπτου, ενώ η επιβάρυνση της CPU για την επεξεργασία πρωτοκόλλων δικτύου ξεπέρασε το 40% — στερώντας σοβαρά τις γραμμές προεπεξεργασίας δεδομένων των GPU. Η ομάδα χρειαζόταν επειγόντως μια λύση δικτύωσης που θα μπορούσε τόσο να μειώσει δραματικά την καθυστέρηση επικοινωνίας όσο και να ανακτήσει την υπολογιστική ικανότητα της CPU.

Λύση & Ανάπτυξη: Δημιουργία Δικτύου RoCE Χωρίς Απώλειες με το MCX631432AN-ADAB

Μετά από μια ολοκληρωμένη τεχνική αξιολόγηση, η ομάδα επέλεξε το NVIDIA Mellanox MCX631432AN-ADAB ως τη βάση για την αναβάθμιση του δικτύου της. Κάθε διακομιστής εξοπλίστηκε με έναν προσαρμογέα MCX631432AN-ADAB ConnectX-6 Lx dual-port 25GbE SFP28, με τις δύο θύρες SFP28 συνδεδεμένες σε εφεδρικούς διακόπτες NVIDIA Spectrum-3 για τη δημιουργία μιας αρχιτεκτονικής υψηλής διαθεσιμότητας.

Η ανάπτυξη εκτελέστηκε σε τρεις διακριτές φάσεις:

  • Φάση 1 — Πιλοτική (8 κόμβοι): Η ομάδα εγκατέστησε την κάρτα προσαρμογέα Ethernet MCX631432AN-ADAB σε ένα υποσύνολο διακομιστών GPU, διαμορφώνοντας το RoCEv2 με Priority Flow Control (PFC) και Explicit Congestion Notification (ECN) για τη δημιουργία ενός δικτύου Ethernet χωρίς απώλειες. Το NCCL (NVIDIA Collective Communications Library) επαναμεταγλωττίστηκε με υποστήριξη RDMA.
  • Φάση 2 — Ρύθμιση & Επικύρωση: Χρησιμοποιώντας τα δεδομένα τηλεμετρίας που αναλύονται λεπτομερώς στο φύλλο δεδομένων MCX631432AN-ADAB, η ομάδα ρύθμισε με ακρίβεια τις παραμέτρους DCB και τα όρια των buffers για την εξάλειψη των διακοπών PFC, διατηρώντας παράλληλα σχεδόν μηδενικές απώλειες πακέτων. Οι προδιαγραφές MCX631432AN-ADAB καθοδήγησαν τη βελτιστοποίηση της τροποποίησης διακοπών και των βάθους ουρών για το συγκεκριμένο προφίλ φόρτου εργασίας.
  • Φάση 3 — Πλήρης Εφαρμογή Παραγωγής (64 κόμβοι): Μετά την επιτυχή επικύρωση, οι υπόλοιποι κόμβοι μεταφέρθηκαν στον νέο προσαρμογέα. Οι προγράμματα οδήγησης συμβατά με MCX631432AN-ADAB ενσωματώθηκαν απρόσκοπτα στο υπάρχον περιβάλλον που βασίζεται σε Ubuntu και στη στοίβα Mellanox OFED.

Η ομάδα σημείωσε ότι η λύση προσαρμογέα Ethernet MCX631432AN-ADAB παρείχε μια απλή διαδρομή μετάβασης, καθώς οι προσαρμογείς ήταν πλήρως συμβατοί με την υπάρχουσα καλωδίωση SFP28 και την υποδομή διακοπτών, εξαλείφοντας την ανάγκη για δαπανηρές συμπληρωματικές αναβαθμίσεις.

Αποτελέσματα & Οφέλη: Μετρήσιμος Μετασχηματισμός στην Καθυστέρηση και την Απόδοση

Τα κέρδη απόδοσης που επιτεύχθηκαν μέσω της ανάπτυξης NVIDIA Mellanox MCX631432AN-ADAB ήταν άμεσα και ουσιαστικά. Ο παρακάτω πίνακας συνοψίζει τις βασικές μετρήσεις πριν και μετά την αναβάθμιση:

Μετρική Πριν την Αναβάθμιση (10GbE TCP/IP) Μετά την Αναβάθμιση (MCX631432AN-ADAB με RoCE) Βελτίωση
Καθυστέρηση All-Reduce (μέση) 4,7 ms 0,32 ms Μείωση 14,7×
Χρήση CPU Δικτύου (ανά κόμβο) 42% 9% 33 π.μ. ελεύθερα
Χρήση GPU (φάση φόρτωσης δεδομένων) 61% 89% +28%
Απόδοση Εκπαίδευσης Συστάδας 1,8x βασική γραμμή 4,3x βασική γραμμή Αύξηση 2,4×

Πέρα από αυτά τα ποσοτικά κέρδη, η ομάδα παρατήρησε λειτουργικές βελτιώσεις που επηρέασαν άμεσα την παραγωγικότητα των προγραμματιστών. Οι εκτελέσεις εκπαίδευσης μοντέλων που προηγουμένως απαιτούσαν 36 ώρες ολοκληρώθηκαν σε μόλις 15 ώρες, επιτρέποντας συχνότερους κύκλους επανάληψης. Η αποφόρτιση NVMe-oF βασισμένη σε υλικό μείωσε επίσης την καθυστέρηση πρόσβασης στον αποθηκευτικό χώρο κατά 35%, επιταχύνοντας περαιτέρω τις εντατικές σε δεδομένα λειτουργίες checkpoint. Για οργανισμούς που αξιολογούν την επιχειρηματική υπόθεση, η τιμή MCX631432AN-ADAB αποδείχθηκε εξαιρετικά ανταγωνιστική όταν μετρήθηκε σε σύγκριση με την αύξηση απόδοσης 2,4× και τη δυνατότητα αναβολής πρόσθετων αποκτήσεων διακομιστών GPU. Η ομάδα σημείωσε επίσης ότι οι MCX631432AN-ADAB προς πώληση σε συνδυασμό με διακόπτες NVIDIA Spectrum προσέφεραν την πιο οικονομικά αποδοτική διαδρομή για μελλοντική κλιμάκωση.

Σύνοψη & Προοπτικές: Μια Βάση για Μελλοντική Καινοτομία Φόρτου Εργασίας

Αυτή η ανάπτυξη παραγωγής αποδεικνύει ότι το NVIDIA Mellanox MCX631432AN-ADAB είναι πολύ περισσότερο από μια τυπική ανανέωση δικτύου — είναι ένα μετασχηματιστικό στοιχείο υποδομής που ξεκλειδώνει το πλήρες δυναμικό του σύγχρονου υπολογιστικού συστήματος με επιτάχυνση GPU. Ο συνδυασμός εύρους ζώνης 50 Gb/s, καθυστέρησης συλλογικής επικοινωνίας κάτω από 0,4 ms και δραματικών δυνατοτήτων αποφόρτισης CPU καθιστά αυτόν τον προσαρμογέα ιδανική επιλογή για οργανισμούς που εκτελούν κατανεμημένα AI, HPC και αναλύσεις σε πραγματικό χρόνο.

Κοιτάζοντας προς το μέλλον, η ομάδα fintech διερευνά την ενσωμάτωση με το NVIDIA DOCA για την περαιτέρω επιτάχυνση του προγραμματισμού της διαδρομής δεδομένων και την υλοποίηση παροχής μηδενικής επαφής για μελλοντικές επεκτάσεις συστάδων. Αξιολογούν επίσης τις δυνατότητες τηλεμετρίας του προσαρμογέα — που αναλύονται εκτενώς στο φύλλο δεδομένων MCX631432AN-ADAB — για τη δημιουργία μοντέλων προγνωστικής διαχείρισης συμφόρησης. Καθώς η λύση προσαρμογέα Ethernet MCX631432AN-ADAB συνεχίζει να αποδεικνύει την αξία της, η εταιρεία σχεδιάζει να τυποποιήσει αυτήν την πλατφόρμα για όλες τις μελλοντικές επενδύσεις υποδομής, με την πεποίθηση ότι παρέχει μια ισχυρή και επεκτάσιμη βάση για την επόμενη γενιά χρηματοοικονομικών εφαρμογών που βασίζονται σε AI.