NVIDIA Mellanox 920-9B210-00FN-0D0 στην πράξη: Δημιουργώντας ένα NDR Low-Latency Fabric για Υπολογιστικά Συστήματα Τεχνητής Νοημοσύνης Τρισεκατομμυρίων Παραμέτρων
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 στην πράξη: Δημιουργία ενός δικτύου NDR χαμηλής καθυστέρησης για συστοιχίες AI τρισεκατομμυρίων παραμέτρων
Υπόβαθρο & Η Πρόκληση: Όταν το HDR συναντά μοντέλα τρισεκατομμυρίων παραμέτρων
Ένας κορυφαίος οργανισμός έρευνας AI επέκτεινε πρόσφατα τη συστοιχία εκπαίδευσης μεγάλων γλωσσικών μοντέλων του από 1.024 σε 4.096 GPU της NVIDIA H100, με στόχο τη συμπίεση του χρονοδιαγράμματος εκπαίδευσης ενός αραιού μοντέλου MoE (Mixture of Experts) 1,8 τρισεκατομμυρίων παραμέτρων από μήνες σε λιγότερο από δύο εβδομάδες. Ωστόσο, κατά την αρχική επικύρωση, η ομάδα παρατήρησε σοβαρή συμφόρηση στη φάση επικοινωνίας all-to-all στο υπάρχον δίκτυο HDR 200Gb/s, προκαλώντας την πτώση της χρήσης GPU από την αναμενόμενη 85% σε μόλις 52%—πολύ κάτω από το όριο που απαιτείται για την επίτευξη της φιλόδοξης προθεσμίας εκπαίδευσης.
Η ανάλυση του δικτύου αποκάλυψε ότι οι συλλογικές λειτουργίες all-to-all, οι οποίες είναι εγγενείς στις αρχιτεκτονικές MoE, κορέωναν τους συνδέσμους HDR και ενεργοποιούσαν μηχανισμούς ελέγχου συμφόρησης που ενίσχυαν περαιτέρω την καθυστέρηση. Ο οργανισμός χρειαζόταν ένα δίκτυο που θα μπορούσε να προσφέρει ντετερμινιστική καθυστέρηση κάτω του μικροδευτερολέπτου σε χιλιάδες τελικά σημεία, παρέχοντας παράλληλα το περιθώριο εύρους ζώνης για την απορρόφηση εκρήξεων κίνησης χωρίς κατάρρευση της απόδοσης. Αυτή ακριβώς είναι η πρόκληση που το NVIDIA Mellanox 920-9B210-00FN-0D0 σχεδιάστηκε για να αντιμετωπίσει.
Λύση & Ανάπτυξη: Ένα δίκτυο NDR 400Gb/s για Exascale AI
Ο οργανισμός ανέπτυξε τον 920-9B210-00FN-0D0 InfiniBand switch OPN (Κωδικός Παραγγελίας) ως τη βάση ενός νέου δικτύου δύο επιπέδων leaf-spine. Στο επίπεδο leaf, κάθε rack έλαβε δύο 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR switches, παρέχοντας συνδεσιμότητα 128 θυρών 400Gb/s σε 64 dual-port H100 servers ανά rack μέσω ενεργών οπτικών καλωδίων OSFP-to-OSFP. Στο επίπεδο spine, 16 επιπλέον 920-9B210-00FN-0D0 switches διασύνδεσαν όλα τα leaf switches, δημιουργώντας ένα μη-μπλοκάρισμα fat-tree με πλήρες εύρος ζώνης διχοτόμησης 51,2 Tb/s ανά επίπεδο spine.
Αυτό που έκανε αυτή τη λύση ιδιαίτερα ελκυστική ήταν η ενσωματωμένη τεχνολογία SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) του switch. Για το φόρτο εργασίας MoE, η επικοινωνία all-to-all εκφορτώθηκε απευθείας στο δίκτυο του switch, με τα switches να εκτελούν μείωση και αναδιανομή δεδομένων εντός του δικτύου. Αυτό εξάλειψε την ανάγκη για πολλαπλές περάσεις από την πλευρά του host, μειώνοντας δραματικά το λειτουργικό κόστος επικοινωνίας που είχε μαστίξει την προηγούμενη ανάπτυξη HDR.
Σύμφωνα με το 920-9B210-00FN-0D0 datasheet, το switch προσφέρει καθυστέρηση cut-through κάτω των 100ns, η οποία επικυρώθηκε κατά τη φάση της απόδειξης της έννοιας. Η ομάδα μηχανικών επιβεβαίωσε επίσης ότι το 920-9B210-00FN-0D0 compatible οικοσύστημα περιλάμβανε όλα τα οπτικά και καλώδια OSFP που είχαν ήδη πιστοποιήσει, εξαλείφοντας τις καθυστερήσεις προμήθειας. Οι 920-9B210-00FN-0D0 specifications—συμπεριλαμβανομένων των διπλών εφεδρικών τροφοδοτικών και των ανεμιστήρων που αντικαθίστανται εν λειτουργία—έδωσαν στην ομάδα εμπιστοσύνη στην επίτευξη του στόχου διαθεσιμότητας 99,999% για τη συστοιχία παραγωγής.
Αποτελέσματα & Μετρήσιμα Κέρδη: Από Σημείο Συμφόρησης σε Ενεργοποιητή
Μετά την πλήρη ανάπτυξη του δικτύου NDR και την επανεκκίνηση της εργασίας εκπαίδευσης MoE, ο οργανισμός μέτρησε μετασχηματιστικές βελτιώσεις σε πολλαπλές διαστάσεις:
- Ανάκτηση χρήσης GPU: Η μέση χρήση GPU αυξήθηκε από 52% σε 89%, με τη μέγιστη χρήση να φτάνει το 94% κατά τις φάσεις έντονης υπολογιστικής επεξεργασίας—απευθείας αποτέλεσμα της εξάλειψης των καθυστερήσεων που προκαλούνταν από το δίκτυο.
- Μείωση καθυστέρησης all-to-all: Ο χρόνος που απαιτείται για μια πλήρη ανταλλαγή all-to-all σε 4.096 GPU μειώθηκε από 180ms σε λιγότερο από 45ms, μια βελτίωση 75% που μεταφράστηκε άμεσα σε ταχύτερες επαναλήψεις εκπαίδευσης.
- Χρόνος ολοκλήρωσης εργασίας: Το προβλεπόμενο χρονοδιάγραμμα εκπαίδευσης για το μοντέλο MoE 1,8T μειώθηκε από 14 ημέρες σε μόλις 9 ημέρες—επιτάχυνση 36% που μείωσε σημαντικά τόσο τον χρόνο διάθεσης στην αγορά όσο και το κόστος υπολογιστικής επεξεργασίας στο cloud.
- Λειτουργική αποδοτικότητα: Με 64 θύρες ανά switch, ο αριθμός των απαιτούμενων spine switches μειώθηκε κατά 37% σε σύγκριση με ένα σχέδιο HDR 40 θυρών, απλοποιώντας την καλωδίωση και μειώνοντας την κατανάλωση ενέργειας ανά rack κατά 28%.
Από την άποψη του συνολικού κόστους ιδιοκτησίας, η οικονομική ομάδα του οργανισμού σημείωσε ότι ενώ η 920-9B210-00FN-0D0 price ανά μονάδα ήταν υψηλότερη από την εναλλακτική λύση HDR, το κόστος δικτύωσης ανά GPU μειώθηκε στην πραγματικότητα λόγω της υψηλότερης ακτίνας και της μειωμένης διάταξης των switches. Αυτό το οικονομικό πλεονέκτημα, σε συνδυασμό με τα δραματικά κέρδη απόδοσης, έκανε την αναβάθμιση σε NDR μια σαφή επιχειρηματική νίκη. Η 920-9B210-00FN-0D0 InfiniBand switch OPN solution ενσωματώθηκε επίσης απρόσκοπτα με την υπάρχουσα ανάπτυξη NVIDIA UFM, παρέχοντας κεντρική ορατότητα και αυτοματοποιημένη ειδοποίηση που μείωσε το λειτουργικό κόστος κατά 40%.
Σύνοψη & Προοπτικές: Η Βάση NDR για την AI Επόμενης Γενιάς
Το NVIDIA Mellanox 920-9B210-00FN-0D0 αποδείχθηκε η μετασχηματιστική λύση που χρειαζόταν αυτός ο οργανισμός έρευνας AI για να ξεκλειδώσει το πλήρες δυναμικό της συστοιχίας H100 4.096 GPU. Παρέχοντας εύρος ζώνης NDR 400Gb/s, πυκνότητα 64 θυρών και υπολογιστική ισχύ SHARPv3 εντός του δικτύου, το switch τους επέτρεψε να επεκταθούν από 1.024 σε 4.096 GPU χωρίς συμβιβασμούς στην απόδοση ή τη διαχειρισιμότητα—ένα κατόρθωμα που θα ήταν αδύνατο με την προηγούμενη υποδομή HDR.
Κοιτάζοντας προς το μέλλον, ο οργανισμός σχεδιάζει να επεκταθεί σε 8.192 GPU εντός των επόμενων 18 μηνών, αξιοποιώντας το 920-9B210-00FN-0D0 for sale μέσω των συνεργατών του καναλιού της NVIDIA για τη δημιουργία ενός ακόμη μεγαλύτερου δικτύου τριών επιπέδων folded-Clos. Για οργανισμούς που αξιολογούν τις επενδύσεις τους σε δίκτυα AI και HPC επόμενης γενιάς, το 920-9B210-00FN-0D0 προσφέρει μια αποδεδειγμένη, έτοιμη για παραγωγή λύση που εκπληρώνει την υπόσχεση της βελτιστοποίησης διασύνδεσης RDMA χαμηλής καθυστέρησης σε κλίμακα exascale.

