Senior Cloud Infrastructure and Network Operations Solutions Architect
NVIDIANVIDIA cerca una figura esperta di reti per data center da inserire nel gruppo Infrastructure Specialist, per seguire a fianco di clienti e partner le fabric su cui girano alcuni dei più grandi sistemi AI e HPC al mondo. È un ruolo a metà tra consulenza e lavoro tecnico sul campo, con la responsabilità della parte di rete nel modello operativo dei Cloud Partner NVIDIA (NCP), dalla consegna del cluster fino all'esercizio in produzione.
Ruolo
La persona scelta gestisce le operazioni Day 2 sulle fabric delle flotte NCP: partizioni NVLink/NVSwitch su sistemi di classe NVL72, isolamento delle partizioni in manutenzione e procedure sicure di modifica in ambienti multi-tenant. Cura il ciclo di vita di software e firmware degli switch, pianificando aggiornamenti graduali e testati che non interrompano i carichi in produzione. Supporta la validazione e l'accettazione Day 1: avvio di InfiniBand e UFM, configurazione Ethernet Spectrum-X/RoCE, verifica di cablaggi e stato dei link, validazione di routing e congestion control, burn-in su più rack rispetto a obiettivi concordati di MTBI e goodput. Lavora sull'affidabilità a livello di flotta con telemetria, rilevamento e risoluzione dei guasti e analisi delle cause dei job falliti per problemi di rete. Fa da riferimento tecnico per i clienti assegnati, con attività di troubleshooting, trasferimento di conoscenze e stesura di runbook, e presenta revisioni architetturali anche a interlocutori di livello executive. Sono richiesti almeno 5 anni di esperienza in reti per data center, fabric engineering o operations di rete su larga scala, oltre a una laurea in ambito tecnico-scientifico o esperienza equivalente.
Tecnologie
InfiniBand e UFM, Spectrum-X Ethernet, RoCE, Cumulus Linux, SONiC, NIC e DPU ConnectX e BlueField, NVLink/NVSwitch con NMX-C e NMX-M. Linux (RedHat, Ubuntu), Python e Bash, Ansible, Terraform, GitOps, Grafana, Loki e Prometheus. Sono un valore aggiunto l'esperienza con il networking di Kubernetes nei cluster GPU (CNI, SR-IOV, RDMA device plugin, NVIDIA Network Operator e GPU Operator), DOCA, DCGM, NCCL e la segmentazione multi-tenant con VRF, VLAN ed EVPN.
Condividi annuncio
Informazioni su NVIDIA
NVIDIA è un'azienda tecnologica statunitense fondata nel 1993 e con sede a Santa Clara, in California. Nata come produttrice di processori grafici per il gaming, ha inventato la GPU nel 1999 e da allora ha esteso il proprio raggio d'azione ben oltre la grafica: oggi le sue piattaforme di calcolo accelerato sono alla base di gran parte dell'addestramento e dell'esecuzione dei modelli di intelligenza artificiale, del calcolo ad alte prestazioni, della simulazione scientifica, della robotica e della guida autonoma. Accanto all'hardware, l'azienda sviluppa un ampio ecosistema software, da CUDA alle librerie per il machine learning, fino agli strumenti per la gestione di cluster e data center.
Con l'acquisizione di Mellanox, NVIDIA ha aggiunto al proprio catalogo le tecnologie di rete ad alte prestazioni, come InfiniBand ed Ethernet Spectrum-X, i DPU BlueField e le schede ConnectX, diventando un fornitore completo per le cosiddette AI factory: infrastrutture su larga scala in cui calcolo, rete e storage sono progettati insieme. Università, centri di ricerca, cloud provider e grandi imprese in tutto il mondo usano i suoi sistemi per costruire alcuni dei supercomputer più veloci in circolazione.
L'azienda conta decine di migliaia di dipendenti distribuiti in numerosi paesi e affianca ai team di ricerca e sviluppo gruppi di specialisti che lavorano a stretto contatto con clienti e partner, seguendo la progettazione, la messa in opera e l'esercizio delle infrastrutture. La cultura interna punta su autonomia, rigore tecnico e apprendimento continuo, con un'attenzione dichiarata a diversità e inclusione.
