freehire launches on Product Hunt on 26 August.

Follow →

Technical Program Manager

Summary

Technical Program Manager at an AI-infra startup coordinating capacity planning, SLA design, and cross-team execution for GPU clusters used in training and inference workloads.

About

AI 인프라 스타트업, VESSL AI

수많은 AI 워크로드가 하나의 플랫폼에서 유기적으로 움직이는 세상을 꿈꿉니다.
우리는 파편화된 글로벌 GPU 인프라를 하나로 연결해, 복잡성은 최소화하고 연구와 제품 혁신에만 몰입할 수 있는 환경을 만들어갑니다.

VESSL AI는 국내외 주요 아카데미아와 현대자동차, 티맵모빌리티, 그리고 범정부 초거대 AI 공통기반·데이터센터(B2G) 사업까지 확장하며 기술력을 검증받았습니다. 2026년 VESSL Cloud 런칭을 기점으로 전 세계 GPU를 연결하는 Infrastructure Interface로 새로운 성장에 진입합니다. CB Insights ‘2025 AI Agent Tech Stack’ 등재와 글로벌 빅테크 파트너십을 발판으로, 글로벌 시장으로의 확장을 본격화하고 있습니다.

가장 난해한 문제를 가장 단순한 실행으로 풀어 전 세계 AI 팀의 혁신 속도를 높이는 것,
이러한 우리의 비전에 공감하고 미래를 만들어갈 동료를 적극적으로 찾고 있어요. 빠르게 성장하는 AI인프라 시장에서 의미있는 도전에 함께 하세요!
>> VESSL Cloud 더 알아보기 : https://blog.vessl.ai/ko/posts/vesslcloud-kr

<About the Role>
VESSL AI의 Technical Program Manager는 Product Division 소속으로 Capacity & Infra Team에서 Supply 조직의 신규 용량 확보·온보딩 일정과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 실행 계획으로 전환합니다.
SRE가 정의한 SLI/SLO 데이터를 근거로 고객에게 제시 가능한 Demand-side SLA 수준을 설계하고,
SRE·Product·Sales Leadership 간의 협의를 주도해 최종 합의를 이끌어냅니다.
정기 Capacity Review를 운영하며 배분 현황과 리스크를 관련 조직과 공유합니다.
또한 팀 내 SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트를 이끌며, VESSL AI 플랫폼 전반의 안정적 운영을 책임집니다.

GPU는 유한하고 값비싼 자원입니다.
하나의 클러스터는 온디맨드·예약형(RI) 등 여러 판매 방식으로, 그리고 Training부터 Inference까지 다양한 워크로드 형태로 동시에 여러 고객에게 활용됩니다.
이 자원을 실제로 확보하는 조직(신규 클러스터 조달·구축을 담당하는 Supply 조직), 이를 운영하고 실제 가용 용량을 책임지는 조직(SRE/Infra), 그리고 이를 판매하고 고객에게 커밋하는 조직(Sales/CS) 간에는 지속적인 정보 동기화와 우선순위 정렬이 필요합니다.
Capacity Plan 수립, 배분 현황 추적, 공급 지연이나 수요 급증에 따른 리스크 관리를 위해서는 이 세 조직으로부터 데이터를 취합하고 의사결정을 조율해나갑니다.

Responsibilities

• Capacity Plan 통합: Supply 조직의 신규 용량 확보 계획과 Demand 조직의 수요 예측을 통합해 중장기 Capacity Plan을 관리하고 지속적으로 업데이트
• 신규 Supply 온보딩 조율: Supply 조직이 확보한 신규 클러스터가 검증, 네트워크·스케줄러 연동을 거쳐 플랫폼에서 실제로 판매 가능한 상태가 되기까지의 일정을 SRE/Infra와 조율하고 추적
• Demand-side SLA 설계 및 협의 주도: SRE의 SLI/SLO 데이터를 기반으로 고객에게 제시 가능한 SLA 수준을 설계하고, SRE·Product·Sales Leadership과의 협의를 주도해 최종 합의를 이끌어냄
• Capacity Allocation Governance: 온디맨드·예약형(RI)·스팟 등 판매 유형별 용량 배분 정책을 수립하고, 실제 배분 현황을 추적·리포팅
• Infra Program 리딩: SRE/SWE/Security Engineer와 협업하여 Site Reliability, Compliance 등 인프라 전반의 프로젝트 우선순위를 정하고 실행을 조율
• Program Cadence & Reporting: Capacity Review 등 정기 운영 회의체를 설계·운영하고, 팀 내 SWE와 함께 공급-수요 가시화 도구를 기획·구축하며, 경영진 및 유관 조직을 위한 대시보드·리포팅 체계를 구축
• Risk & Escalation: 공급 지연, 온보딩 지연, 수요 급증, 인프라 장애 등으로 인한 리스크를 조기에 포착해 관련 조직에 에스컬레이션하고 완화 계획을 함께 수립

Requirements

• 컴퓨터공학, 산업공학 등 관련 전공 학사 이상 학위 보유
• TPM/Product Manager/Project Manager로서 6년 이상의 경험
• 클라우드/데이터센터/GPU 인프라의 기술적 구조(컴퓨팅, 네트워크, 스토리지)에 대한 기본적 이해
• SLI/SLO 데이터를 근거로 대고객 SLA를 설계하고, 여러 조직 간 합의를 이끌어낸 경험
• SRE, SWE, Security Engineer 등 엔지니어 직군과 직접 협업하며 기술적 우선순위를 조율해 본 경험
• 엔지니어링, 세일즈, 경영진 등 서로 다른 배경의 이해관계자 간 데이터를 취합해 의사결정을 이끌어낸 경험
• 복잡한 프로그램의 리스크와 디펜던시를 구조화하고 관리해 본 경험
• SQL 등을 활용해 데이터를 분석하고 대시보드를 구축할 수 있는 분
• 비즈니스 레벨의 영어 커뮤니케이션 역량 보유

Preferred

• 대규모 GPU/HPC 클러스터를 운영하는 조직 또는 CSP에서의 Capacity Planning Program의 관리 경력
• Site Reliability Engineering 프랙티스(SLO/SLA, On-call, Incident Management/Postmortem)에 대한 이해
• SOC2 등 보안/컴플라이언스 프레임워크 관련 프로젝트 참여 경험
• CSP/데이터센터와의 조달·계약 프로세스에 대한 이해
• Kubernetes, Slurm 등 스케줄링/오케스트레이션 환경에 대한 이해
• 스타트업/하이퍼그로스 환경에서 프로세스를 처음부터 설계해 본 경험
• 정해진 스코프에 갇히지 않고 다양한 조직을 넘나들며 문제를 해결하는 것에 익숙하신 분
• 애매하고 답이 정해지지 않은 문제를 스스로 구조화해서 풀어나가는 것에 익숙하신 분

Benefits

함께 변화를 만들어갈 수 있도록, 도전과 성장을 지원
• 연간 최대 120만원 한도 내 온/오프라인 자기계발 지원
• 연 1회 미국 시장 경험 기회 제공 (Global Exposure pass)
• 성장에 필요한 도서 실물 구매 지원 또는 전자도서관 이용
• 구성원 간의 1on1 음료 지원

업무 생산성을 높여 몰입할 수 있는 환경
• 오전 8시~11시 사이 선택하는 시차출퇴근제 운영
• 이니셔티브 중심의 조직 목표와 Align되어 몰입하는 협업 방식
• 월 1회 Allhands + Team Gathering 통한 업무 공유
• 늦은 시간까지 근무 시, 야근식대/택시비 지원
• 구성원 간의 1on1 음료 지원

몰입한 만큼 휴식과 생활 편의 지원
• 개인 간식비 지원 (월 한도)
• 장기근속자 리프레시 휴가 제공
• 종합건강검진비 및 휴가 지원 (연 1회)
• 입사 N주년 축하 선물 제공
• 명절 선물, 각종 휴가 및 경조금 지원
• 본인 및 배우자 출산휴가비 지원

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available