freehire launches on Product Hunt on 26 August.

Follow →

[인턴] [NetsPresso] R&D AI Research Engineer (XPU Enabler팀)

Summary

Research and develop quantization, pruning, and inference optimizations for LLM/VLM and MoE models to run efficiently on GPUs and NPUs.

About

[Nota AI] 2026 R&D Internship

• 노타와 함께 실제 AI 제품과 기술을 만들어갈 R&D 인턴을 모집합니다.

AI for everyone, everywhere
AI를 누구에게나, 어디에서나

노타는 AI 최적화 기술을 통해 AI의 일상화를 선도하는 기업입니다.

우리는 다양한 디바이스와 산업 전반에 걸쳐, 누구나 어디서나 AI를 사용할 수 있는 세상을 만들고자 합니다.

노타의 핵심 제품인 넷츠프레소(NetsPresso)는 하드웨어의 특성을 이해하는 AI 모델 최적화 플랫폼입니다. 또한, 차세대 영상 관제 솔루션 (NVA: Nota Vision Agent), 지능형 교통 시스템(ITS) 등 온디바이스 생성형 AI 솔루션을 통해 실제 산업 현장에서의 AI 실현 가능성을 넓히고 있습니다.

국내 스타트업으로는 최초로 삼성과 LG의 투자 유치 기록을 보유하고 있으며, 네이버 DS2F의 첫 투자 기업이기도 합니다. 최근에는 두바이 교통국과의 AI 솔루션 공급 계약을 체결하고, CB Insights AI 100에도 선정되는 등 글로벌 무대에서의 성과를 이어가고 있습니다.

노타는 빠르게 성장하는 조직과 함께할 다양한 직군의 노타 크루를 찾고 있습니다. 직급과 경력에 관계없이 누구나 동등한 입장에서 의견을 나눌 수 있는 수평적인 문화 속에서, 공동의 목표를 향해 자율적으로 일할 수 있는 분과 함께하고 싶습니다.

누구나, 어디에서나 AI의 가치를 경험할 수 있도록 하는 여정, 지금 노타에서 함께하세요.

Responsibilities

업스테이지 컨소시엄을 통해 개발되는 LLM/VLM Foundation Model의 경량화 및 추론 최적화를 담당합니다.
• 대규모 MoE 모델의 Quantization 기술 연구·개발
• Post-Training Quantization(PTQ)
• Quantization-Aware Training(QAT)
• 구조적·비구조적 Pruning 및 Sparsity 기술 연구·개발
• Quantization·Pruning 과정에서 발생하는 모델 성능 저하를 최소화하기 위한 Calibration, Reconstruction 및 Fine-tuning 방법론 개발
• TensorRT-LLM, vLLM, SGLang, ONNX Runtime 등 Inference Framework 기반 최적화
• CUDA, Triton 또는 NPU Vendor SDK를 활용한 고성능 Operator 및 Kernel 개발
• KV Cache Optimization, Continuous/Dynamic Batching, Speculative Decoding 등 추론 가속 기술 개발
• LLM/VLM의 Accuracy, Latency, Throughput, Memory Footprint 평가
• 최적화된 LLM/VLM의 NVIDIA GPU 및 다양한 국내외 NPU·AI Accelerator 탑재
• Hardware 특성을 고려한 Model Optimization
• 모델 변환, Compile, Runtime 연동 및 실제 Device 성능 검증
• LLM/VLM 및 MoE 모델 경량화·추론 최적화 관련 최신 연구 분석
• 신규 Quantization, Pruning 및 Inference Optimization 방법론 연구
• 연구 결과의 특허 출원, 논문 작성 및 국내외 학술대회 발표

Requirements

• LLM, VLM 또는 Transformer 기반 모델에 대한 깊은 이해를 보유하신 분
• MoE 모델의 Quantization, Pruning, Sparsity 또는 Inference Optimization 기술을 실제 프로젝트에 적용할 수 있으신 분
• 아래 분야 중 하나 이상에서 실질적인 연구 또는 개발 경험을 보유하신 분
• LLM/VLM Quantization
• Model Pruning 및 Sparsity
• MoE Compression 및 Routing Optimization
• Efficient Transformer
• LLM/VLM Inference Optimization
• 모델 정확도뿐 아니라 Latency, Throughput, Memory 및 연산량을 종합적으로 분석할 수 있으신 분
• 연구 방법론을 실제 추론 시스템 및 Hardware 환경에 구현할 수 있으신 분
• 독립적으로 문제를 정의하고 실험을 설계·수행할 수 있으신 분
• 해외 출장 및 여행에 결격 사유가 없는 분

Preferred

• NeurIPS, ICML, ICLR, ACL, EMNLP, NAACL, CVPR, ICCV, ECCV 등 Top-tier AI/ML 학술대회 논문 게재 경험이 있으신 분
• LLM/VLM 또는 MoE 모델 Quantization·Pruning 관련 논문, 특허 또는 Open Source 실적이 있으신 분
• GPTQ, AWQ, SmoothQuant, OmniQuant, AutoRound, SparseGPT 등 Model Compression 기술 구현 또는 확장 경험이 있으신 분
• TensorRT-LLM, vLLM, SGLang, DeepSpeed, Megatron-LM 등 대규모 모델 추론 시스템 개발 경험이 있으신 분
• CUDA 또는 Triton 기반 GPU Kernel Optimization 경험이 있으신 분
• 국내외 NPU, ASIC 또는 Edge AI Accelerator 대상 모델 Porting·Optimization 경험이 있으신 분
• NPU Vendor SDK, Compiler 또는 Runtime을 이용한 모델 변환 및 배포 경험이 있으신 분
• Custom Operator 또는 Custom Kernel 개발 경험이 있으신 분
• MoE 모델의 Expert Routing, Expert Load Balancing, Expert Parallelism 또는 통신 최적화 경험이 있으신 분

Benefits

[근무지]
서울특별시 강남구 테헤란로 521 (삼성동, 파르나스타워) 16층 Nota

See also

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available