NVIDIA Mellanox MCX623106AN-CDAT Server Adapter σε Δράση | RDMA/RoCE Μεταφορά Χαμηλής Καθυστέρησης & Κέρδη Απόδοσης Διακομιστή

July 22, 2026

τα τελευταία νέα της εταιρείας για NVIDIA Mellanox MCX623106AN-CDAT Server Adapter σε Δράση | RDMA/RoCE Μεταφορά Χαμηλής Καθυστέρησης & Κέρδη Απόδοσης Διακομιστή

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter σε δράση.

Προηγούμενο & Η πρόκληση: Όταν το 200GbE συναντά το τείχος κλιμάκωσης AI

Ένας ταχέως αναπτυσσόμενος ερευνητικός οργανισμός τεχνητής νοημοσύνης, ας τους ονομάσουμε "DeepCore Labs", αντιμετώπιζε ένα κρίσιμο μειονεκτικό μπουκάλιο.που περιλαμβάνει 512 GPU NVIDIA H100 κατανεμημένες σε 128 κόμβουςΤο πρόβλημα δεν ήταν υπολογιστής ή μνήμη, αλλά το δίκτυο.Οι βαθμίδες συγχρονισμού μειώθηκαν κατά 15 δευτερόλεπτα ανά επανάληψη.Η υφιστάμενη υποδομή 100GbE, βασισμένη σε λογισμικό TCP/IP, δεν μπορούσε να χειριστεί την έκρηξη.τα πρότυπα επικοινωνίας ευαίσθητων στην καθυστέρηση της κατανεμημένης κατάρτισηςΗ ομάδα χρειαζόταν μια λύση που θα μπορούσε να προσφέρει ταχύτητα γραμμής 200GbE με καθοριστική καθυστέρηση σε επίπεδο μικροδευτερόλεπτου.

Η αξιολόγησή τους τους οδήγησε στηνNVIDIA Mellanox MCX623106AN-CDATΗ ερευνητική ομάδα αναγνώρισε ότι ηMCX623106AN-CDAT ConnectX προσαρμογέα κάρτα δικτύου PCIeπροσφέρουν τις προηγμένες δυνατότητες εκφόρτωσης και GPUDirect που απαιτούνται για την εξάλειψη του μεικτού κόλπου του δικτύου και τη μεγιστοποίηση της χρήσης της GPU.

Η λύση: Εφαρμογή της κάρτας MCX623106AN-CDAT Ethernet Adapter

Η DeepCore Labs χρησιμοποίησε τοΠίνακας προσαρμογής Ethernet MCX623106AN-CDATσε όλους τους 128 κόμβους εκπαίδευσης, με κάθε διακομιστή εξοπλισμένο με έναν προσαρμογέα QSFP112 διπλής θύρας συνδεδεμένο με ένα υλικό φύλλου-αστέρας που είναι κατασκευασμένο με διακόπτες NVIDIA Spectrum-4.Η ανάπτυξη αξιοποιεί την εγγενή υποστήριξη RoCE v2 του προσαρμογέα για να επιτρέψει την μεταφορά Ethernet χωρίς απώλειεςΤο κλειδί για την λύση ήταν η δυνατότητα GPUDirect RDMA του προσαρμοστή,που επέτρεψε την άμεση μετακίνηση δεδομένων μεταξύ GPUs σε όλο το δίκτυο χωρίς παρέμβαση της CPU ∙ ένα κρίσιμο χαρακτηριστικό για τη μείωση των γενικών δαπανών συγχρονισμού.

Η ομάδα διαμόρφωσε το PFC (Προτεραιότητα Ελέγχου ροής) και το ECN (Εκφραστική Ενημέρωση Συγκέντρωσης) στο επίπεδο του διακόπτη,σχετικά με τη θέσπιση προτεραιότητας 3 για τη συλλογική κυκλοφορία επικοινωνιών και προτεραιότητας 4 για την αποθήκευση I/OΕπίσης, εφάρμοσαν την προσαρμοστική τεχνολογία δρομολόγησης της NVIDIA για να διανέμουν τη κυκλοφορία δυναμικά σε πολλαπλές διαδρομές, ελαχιστοποιώντας τα hotspots.Όλο το εκπαιδευτικό υλικό λειτουργούσε με RDMA., με όλες τις 512 GPU να επικοινωνούν απρόσκοπτα μέσω RoCE.Συνεργαζόμενη με MCX623106AN-CDATΤο οικοσύστημα αποδείχθηκε ισχυρό ∙ οι κάρτες ενσωματώθηκαν άψογα με τους διακομιστές που βασίζονται στο H100 και την NCCL της NVIDIA (NVIDIA Collective Communications Library) χωρίς καμία τροποποίηση.

Η ομάδα αναφέρθηκε στοΔελτίο δεδομένων MCX623106AN-CDATγια τη βελτίωση των παραμέτρων κατανομής των αποθηκών και ελέγχου της συμφόρησης,την επίτευξη βέλτιστων επιδόσεων για το περιβάλλον μικτού φόρτου εργασίας ̇ που περιελάμβανε τόσο συγχρονισμένη εκπαίδευση (καθώς κυριαρχούν όλα τα ελαττώματα) όσο και ασυγχρονισμένη ελέγχουση..

Μετρήσιμα αποτελέσματα: Αποδοτικότητα κλιμάκωσης, απόδοση και χρήση GPU

Η αύξηση της απόδοσης ήταν μετασχηματιστική.NVIDIA Mellanox MCX623106AN-CDATΗ ελαχιστοποίηση της καθυστέρησης συγχρονισμού μειώθηκε από κατά μέσο όρο 15,2 δευτερόλεπτα σε μόλις 1,8 δευτερόλεπτα ανά επανάληψη, μια βελτίωση 8,4 φορές.Ο συνολικός χρόνος εκπαίδευσης για το μοντέλο 70B μειώθηκε από 42 ημέρες σε 19 ημέρες, επιταχύνοντας τον ερευνητικό τους κύκλο κατά περισσότερο από 50%.

Η αξιοποίηση της GPU, η οποία είχε υποχωρήσει στο 62% λόγω των διακοπών του δικτύου, αυξήθηκε στο 94% μετά την αναβάθμιση, μια βελτίωση της αποτελεσματικής χωρητικότητας υπολογιστών κατά 52%.Η προηγμένη τοποθέτηση δεδομένων εκτός σειράς του προσαρμοστή και η ταχύτητα πακέτου εξάλειψαν τις μικρο-εκρήξεις που προκαλούσαν αιχμές καθυστέρησης ουράς., εξασφαλίζοντας συνεπή απόδοση σε όλους τους κόμβους.

Πέρα από τις επιδόσεις εκπαίδευσης, τα κέρδη απόδοσης του διακομιστή ήταν εξίσου συναρπαστικά.και επιτάχυνση RoCE μειωμένη χρήση CPU για επεξεργασία δικτύου από 38% σε λιγότερο από 4% σε όλους τους κόμβουςΑυτό απελευθέρωσε σημαντική χωρητικότητα CPU για την προεπεξεργασία δεδομένων, συμπίεση σημείων ελέγχου και άλλες βοηθητικές εργασίες που είχαν περιοριστεί προηγουμένως.

Μετρική Πριν (Legacy 100GbE NIC) Μετά (MCX623106AN-CDAT) Βελτίωση
Όλο-μείωση της καθυστέρησης (ανά επανάληψη) 15.2 s 1.8 s 8.4 φορές πιο γρήγορα
Χρήση GPU 62% 94% 52% υψηλότερη
Χρόνος εκπαίδευσης υποδείγματος (70B παραμέτρους) 42 ημέρες 19 ημέρες 55% πιο γρήγορα.
Επεξεργασία δικτύου CPU 38% < 4% 89% χαμηλότερα
NVMe-oF Διαβάστε καθυστέρηση (αποθήκευση) 185 μs 12 μs 15 φορές πιο γρήγορα.

Επιχειρησιακά οφέλη: TCO και αποδοτικότητα υποδομής

Ενώ τα κέρδη απόδοση ήταν δραματικά, τα λειτουργικά και οικονομικά οφέλη ήταν εξίσου αξιοσημείωτα.MCX623106AN-CDAT Ethernet λύση κάρτας προσαρμογέαμειώθηκε το συνολικό κόστος ιδιοκτησίας με την εξάλειψη της ανάγκης για ένα ξεχωριστό InfiniBand υλικό, εξοικονομώντας πάνω από 500 χιλιάδες δολάρια σε κόστη υποδομής διακόπτη.Ο ενεργειακά αποδοτικός σχεδιασμός του προσαρμογέα (κάτω από 20W ανά κάρτα) συνέβαλε σε μετρήσιμη εξοικονόμηση ενέργειας σε όλο το σύνολο των 128 κόμβων, μειώνοντας ετήσιες δαπάνες ψύξης κατά περίπου 18%.

Για τους διαχειριστές πληροφορικής που αξιολογούν τηνMCX623106AN-CDAT τιμήέναντι των εναλλακτικών λύσεων, ο διευθυντής υποδομών της DeepCore σημείωσε ότι η περίοδος αποπληρωμής ήταν μικρότερη των έξι μηνών, κυρίως λόγω της μείωσης του χρόνου κατάρτισης,που άμεσα επιτάχυνε τον αγωγό ανάπτυξης προϊόντωνΗ ομάδα αξιολόγησε επίσης το μέλλον του προσαρμογέα:MCX623106AN-CDAT προς πώλησηΣήμερα υποστηρίζει 200GbE, αλλά είναι επίσης συμβατό με οπτική 100GbE και 50GbE, παρέχοντας ευελιξία για περιβάλλοντα υβριδικής ταχύτητας και σταδιακές αναβαθμίσεις.

Σύμφωνα με τηνΕιδικότητες MCX623106AN-CDATΗ DeepCore ενσωμάτωσε αυτές τις μετρήσεις στο Prometheus / Grafana stack της.,Η ομάδα χρησιμοποίησε επίσης τους αλγόριθμους ελέγχου συμφόρησης του προσαρμογέα για τη δυναμική προσαρμογή των ορίων ECN,διατήρηση της συμπεριφοράς χωρίς απώλειες ακόμη και κατά τη διάρκεια των εργασιών ελέγχου σημείων ελέγχου που δημιούργησαν πρόσθετο φόρτο δικτύου.

Συνοπτική & Προοπτικές: Ένα σχέδιο για τη δικτύωση σε κλίμακα AI

Το ταξίδι της DeepCore Labs με τοNVIDIA Mellanox MCX623106AN-CDATΗ τεχνολογία αυτή, που χρησιμοποιείται για την κατασκευή ή την κλιμάκωση υποδομών τεχνητής νοημοσύνης (AI), συνδυάζει διπλή διάδοση 200GbE, διεπαφή host PCIe 5.0 και RDMA με δυνατότητα GPUDirect.Πίνακας προσαρμογής Ethernet MCX623106AN-CDATΜεταμορφώνει το δίκτυο από ένα μπουκάλιο κλιμάκωσης σε πολλαπλασιαστή απόδοσης.και 55% ταχύτεροι κύκλοι κατάρτισης ̇ δείχνουν την ικανότητα του προσαρμογέα να προσφέρει απτά επιχειρηματικά αποτελέσματα στα πιο απαιτητικά περιβάλλοντα υπολογιστών.

Το πρόγραμμα αυτό θα πρέπει να έχει ως στόχο να ενισχύσει τη συνεργασία μεταξύ των ερευνητών και τωνMCX623106AN-CDAT ConnectX προσαρμογέα κάρτα δικτύου PCIeΓια τους αρχιτέκτονες και τους ηγέτες πληροφορικής που σχεδιάζουν την επόμενη επένδυση υποδομής τεχνητής νοημοσύνης, αυτός ο προσαρμογός δεν αποτελεί απλώς ένα συστατικό,αλλά ένας στρατηγικός παράγοντας για την ανταγωνιστική διαφοροποίησηΛεπτομερείς παραμέτρους προσαρμογής, σενάρια ανάπτυξης και αναφορές αναφοράς απόδοσης είναι διαθέσιμες στο επίσημοΔελτίο δεδομένων MCX623106AN-CDAT∆ημιουργία και εφαρμογή της τεχνολογίας