Synthetic Data Engineer (AI Data/Training)
Summary
Design and build synthetic data pipelines for AI model training using prompt engineering and quality scoring to generate high-quality training data.
Hong Kong
We are seeking a talented and innovative Synthetic Data Engineer. In this role, you will design and implement domain-specific synthetic data generation pipelines, ensuring high-quality data management for training loops. Your expertise will drive the success of data processing and model training within the organization.
Responsibilities
- Design domain-specific synthetic data generation (SDG) pipelines via self-instruct and constitutional prompting.
- Implement automated quality scoring and de-duplication systems.
- Manage data pipelines that feed directly into SFT and DPO training loops.
Qualifications
- Deep knowledge of prompt engineering for data generation.
- Familiarity with dataset distillation and bias mitigation.