Site Reliability Engineer - Machine Learning Systems (Singapore)
Summary
Maintain and optimize machine-learning infrastructure for a global AI platform, ensuring uptime, cost efficiency, and disaster recovery for offline and online services.
- Ensure ML systems operate efficiently
- Ensure stability of offline tasks and services
- Implement disaster recovery for global systems
- Manage resource planning cost and budget
- Monitor and manage ML infrastructure and services
- Provide on call support for system and business