Soniox
1 job
10 hours ago
Software Engineer, LLM Inference
HybridEuropeSenior
Slovenia
Optimize the vLLM-based LLM inference stack for low latency and high GPU utilization, writing CUDA/Triton kernels, tuning distributed execution, and profiling GPUs for a voice AI platform.
ai cuda distributed-systems llm pytorch +4 skills