Data Scientist
Summary
Designs and transforms enterprise databases into AI-ready structures, ensuring data quality and reliability for machine learning workflows using SQL, Python, and cloud data tools.
About
"AI의 성능을 넘어, 실제 비즈니스 현장에서 완벽하게 작동할 수 있도록 데이터의 새로운 표준을 만듭니다."
대부분의 기업이 AI 모델에 집중할 때, CUBIG은 AI가 실패하는 진짜 이유인 '데이터 상태'에 집중합니다. CUBIG은 기업이 보유한 데이터를 AI가 즉시 학습하고 활용할 수 있는 최상의 상태(AI-Ready)로 가공하며, 운영 과정에서 데이터가 변하더라도 AI 결과가 흔들리지 않도록 실행 상태를 견고하게 고정하고 관리합니다.
CUBIG은 단순히 데이터를 안전하게 만드는 것을 넘어, 데이터 보안과 규제라는 장벽에 가로막혀 AI 도입을 망설였던 전 세계 기업들이 '즉시 비즈니스 성과'를 낼 수 있도록 돕습니다. 글로벌 보안 표준을 충족하는 독보적인 기술력을 바탕으로, 국내를 넘어 미국과 유럽 시장에서 데이터 중심 AI(Data-centric AI)의 새로운 표준을 세우고 있습니다.
모델 경쟁의 시대를 지나 데이터로 승부하는 AI 운영의 시대,
CUBIG과 함께 AI 혁신의 토대를 완성할 동료를 기다립니다.
[팀 문화]
01. 스타트업다운 실행력, 그리고 명확한 속도
우리는 유연함과 빠른 실행력을 바탕으로 움직이는 팀입니다.
하지만 단순히 빠르기만 한 속도보다는, 올바른 방향으로의 속도를 중요하게 생각합니다.
CUBIG은 불필요한 과정을 줄이고, 더 효율적인 방법을 찾으며 움직입니다.
빠르게 시도하고, 문제를 정확히 짚고, 필요할 땐 방향을 바꾸는 데에도 망설이지 않습니다.
실제로 일이 되게 만드는 것, 그게 우리의 기준입니다.
02. 목표는 높게, 문제는 깊게
우리는 '할 수 있는 목표'보다는, '꼭 해야만 하는 목표'를 세웁니다.
기존의 방식으로는 풀 수 없던 문제들에도 한 걸음 더 깊이 들어가고, 새로운 방식으로 답을 찾아갑니다.
CUBIG의 기술은 이런 도전과 고민에서 시작됩니다.
03. 성과는 결국, 사람이 만든다
우리는 팀의 성과가 결국 사람에서 시작된다고 믿습니다.
각자의 전문성과 몰입이 모여 하나의 성과가 되고, 그 성과는 다시 개인에게 공정하게 돌아갑니다.
노력과 결과에 맞는 기회와 보상은 항상 준비되어 있습니다.
04. 온전한 효율 중심으로
우리는 단순히 바쁘게 일하기보다, 처음부터 구조적으로 효율적인 방법을 고민합니다.
불필요한 절차나 반복은 줄이고, 작은 리소스로도 더 나은 결과를 만드는 방식에 집중합니다.
속도와 완성도 모두를 지키는 일, 그것이 CUBIG의 일하는 방식입니다.
05. 결국, 함께 성장할 사람들과 CUBIG은 기술로 데이터의 경계를 허물고 있습니다.
이 여정을 함께하는 우리는, 문제를 깊이 이해하고 기술로 풀어내며, 그 과정 속에서 끊임없이 성장해 나갑니다.
기술을 좋아하고, 스스로 배움을 확장할 줄 아는 사람. 우리는 그런 동료와 함께 더 멀리 가고 싶습니다.
Responsibilities
1 데이터 구조 분석 및 모델링
• PostgreSQL, MySQL, Aurora, RDS, Redshift 등 고객 데이터 소스를 분석 후 AI 활용이 가능한 구조로 설계
• 대용량 SQL 데이터를 row/table 중심에서 object/document/feature/metadata 중심 구조로 변환하는 데이터 모델링
2 데이터 수집 및 저장 전략
• Snapshot, CDC, batch 등 수집 방식 요구사항 정의 및 데이터 정합성 검증 로직 설계
• Parquet, Iceberg, object storage 기반 저장 구조 및 partitioning 전략 수립
3 데이터 신뢰성 및 품질 관리
• 원본 데이터의 PK, FK, schema, lineage, provenance, timestamp, operation log 등을 활용해서 추적 가능한 데이터 구조 설계
• AI-ready dataset 생성을 위한 정제, 스키마 매핑, semantic enrichment, entity relationship 보존 전략 수립
• 품질 검증, reconciliation, duplicate detection, null/type/timezone/schema drift 검증 기준 정의
4 협업 및 프로젝트 수행
• 백엔드, 데이터 엔지니어, AI 엔지니어와 협업하여 SynTitan ingestion pipeline 및 AI-ready data layer 고도화
• PoC/Demo/실제 구축 프로젝트에서 데이터 변환 전략 수립 및 검증 리포트 작성
Requirements
• 데이터 사이언스/엔지니어링/백엔드 데이터 처리 경력 3년 이상
• SQL 및 관계형 데이터베이스 구조에 대한 깊은 이해
• PostgreSQL, MySQL 등 RDBMS의 table, schema, index, PK/FK, join 구조 분석 가능한 분
• Python 기반 데이터 처리, 변환, 검증 자동화 경험
• Pandas, PySpark, SQLAlchemy, dbt, Airflow 중 1개 이상 활용 경험
• 대용량 데이터 처리시 발생하는 성능, 정합성, 중복, schema drift 문제에 대한 이해
• 정형 데이터를 AI/LLM/RAG/Agent 활용 가능 형태로의 전환에 관심도, 이해도 높은 분
• 데이터 품질, 재현성, 감사 추적성, lineage 관리의 중요성을 이해하는 분
• 백엔드/AI/인프라 팀과 협업해 요구사항을 구조화, 문서화하는 역량 보유
Preferred
1 데이터 인프라 및 아키텍처 경험
• CDC, Debezium, Kafka, AWS DMS, logical replication 등 변경 데이터 수집 구조 이해·경험
• Parquet, Iceberg, Delta Lake 등 데이터레이크 설계 또는 운영 경험
• Lineage, metadata catalog, schema registry, data quality framework 구축 경험
2 대용량 데이터 처리 경험
• Spark, PySpark, Trino, DuckDB 등을 활용한 대용량 데이터 처리 경험
• AWS 환경(S3, RDS, Aurora, Redshift, Glue, Athena, EMR) 활용 경험
3 데이터 변환 및 AI 활용 경험
• RDB 데이터를 JSON, document, key-value, feature store, vector DB 등으로 변환한 경험
• LLM/RAG/Agent 서비스용 데이터 전처리, chunking, metadata 설계 경험
• 개인정보·민감정보 비식별화, synthetic data, differential privacy 관련 경험
4 유관 실무 경험
• 고객사 데이터 구조 분석 및 PoC/구축 프로젝트 수행 경험
• Claude Code, Cursor 등 AI 코딩 도구로 데이터 처리 코드 생산성을 높인 경험
5 이런 분을 찾고 있어요
• 모델 학습보다 기업 데이터를 AI가 쓸 수 있는 구조로 바꾸는 일에 관심있는 분
• "데이터가 있다" 와 "AI가 사용할 수 있는 데이터다" 의 차이를 이해하는 분
• SQL table, schema, business context, metadata, lineage를 연결해 사고할 수 있는 분
• 데이터 정합성, 재현성, 감사 추적성을 중요하게 생각하는 분
• 고객마다 다른 데이터 구조를 공통 프레임워크로 흡수하는 문제에 흥미를 느끼는 분
• 연구형보다 제품형, 분석형보다 플랫폼형 문제 해결에 강점이 있는 분
Benefits
[혜택 및 복지]
• NAVER 1784 사옥 내 조식 자판기, 사내식당(중, 석식) 이용
• 명절 선물 지급
• 업무 연관 도서, 교육, 컨퍼런스 등 학습비 조건부 지원
• 성과, 역할, 기여에 따른 명확한 보상 지향함