freehire launches on Product Hunt on 26 August.

Follow →

Network Engineer (Data Center | ML/AI Infrastructure) @ Square One Resources

Summary

Maintain and expand a high-performance data-center network for AI/ML GPU clusters, automating with Ansible/Terraform and scripting in Bash/Python.

Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI. Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.



    Wymagania
    • Praktyczne doświadczenie w administracji lub projektowaniu sieci Data Center.
    • Bardzo dobra znajomość technologii VXLAN, EVPN oraz BGP.
    • Doświadczenie z automatyzacją infrastruktury przy użyciu Ansible i Terraform.
    • Dobra znajomość systemów Linux w obszarze konfiguracji sieci.
    • Umiejętność tworzenia skryptów w Bash i/lub Python.
    • Doświadczenie z narzędziami monitoringu, takimi jak Zabbix, Prometheus lub Grafana.
    Mile widziane
    • Znajomość SONiC lub Cumulus Linux.
    • Doświadczenie z infrastrukturą GPU oraz środowiskami AI/ML.
    • Wiedza z zakresu NVIDIA AI Enterprise, AIaaS lub GPUaaS.
    • Doświadczenie we współpracy z zespołami DevOps lub R&D.

    Dołącz do projektu skoncentrowanego na utrzymaniu, rozwoju i optymalizacji nowoczesnej infrastruktury sieciowej Data Center wspierającej środowiska Machine Learning i AI. Będziesz pracować nad rozwiązaniami zapewniającymi wysoką wydajność sieci dla klastrów GPU oraz rozwijać automatyzację infrastruktury we współpracy z zespołami AI/ML, DevOps i R&D.


      ,(Utrzymanie i rozwój infrastruktury sieciowej Data Center. , Projektowanie oraz optymalizacja środowisk sieciowych dla klastrów GPU wykorzystywanych w projektach AI/ML. , Automatyzacja konfiguracji i zarządzania infrastrukturą z wykorzystaniem Ansible i Terraform. , Konfiguracja oraz administracja środowiskami Linux w zakresie sieci. , Tworzenie i rozwój skryptów automatyzujących w Bash lub Python. , Monitorowanie wydajności i dostępności infrastruktury z wykorzystaniem narzędzi takich jak Zabbix, Prometheus i Grafana. , Współpraca z zespołami AI/ML, DevOps oraz R&D przy rozwoju nowoczesnej infrastruktury obliczeniowej. ) Requirements: AI, Machine learning, GPU, DevOps, R, Ansible, Terraform, Linux, Bash, Python, Zabbix, Prometheus, Grafana, BGP

      See also