Network Engineer (Data Center | ML/AI Infrastructure) @ Square One Resources
Summary
Maintain and expand a high-performance data-center network for AI/ML GPU clusters, automating with Ansible/Terraform and scripting in Bash/Python.
Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI. Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.
Wymagania
- Praktyczne doświadczenie w administracji lub projektowaniu sieci Data Center.
- Bardzo dobra znajomość technologii VXLAN, EVPN oraz BGP.
- Doświadczenie z automatyzacją infrastruktury przy użyciu Ansible i Terraform.
- Dobra znajomość systemów Linux w obszarze konfiguracji sieci.
- Umiejętność tworzenia skryptów w Bash i/lub Python.
- Doświadczenie z narzędziami monitoringu, takimi jak Zabbix, Prometheus lub Grafana.
- Znajomość SONiC lub Cumulus Linux.
- Doświadczenie z infrastrukturą GPU oraz środowiskami AI/ML.
- Wiedza z zakresu NVIDIA AI Enterprise, AIaaS lub GPUaaS.
- Doświadczenie we współpracy z zespołami DevOps lub R&D.
Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI. Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.
,(Utrzymanie i rozwój infrastruktury sieciowej Data Center. , Projektowanie oraz optymalizacja środowisk sieciowych dla klastrów GPU wykorzystywanych w projektach AI/ML. , Automatyzacja konfiguracji i zarządzania infrastrukturą z wykorzystaniem Ansible i Terraform. , Konfiguracja oraz administracja środowiskami Linux w zakresie sieci. , Tworzenie i rozwój skryptów automatyzujących w Bash lub Python. , Monitorowanie wydajności i dostępności infrastruktury z wykorzystaniem narzędzi takich jak Zabbix, Prometheus i Grafana. , Współpraca z zespołami AI/ML, DevOps oraz R&D przy rozwoju nowoczesnej infrastruktury obliczeniowej. ) Requirements: AI, Machine learning, GPU, DevOps, R, Ansible, Terraform, Linux, Bash, Python, Zabbix, Prometheus, Grafana, BGP