그룹바이
그룹바이
리소리우스 로고
리소리우스
서울 종로구10인 ‧ Pre-A의료기기 ‧ 바이오
정신 건강도 객관적으로 진단하고 효과적으로 치료할 수 있도록, 우리는 기술과 데이터로 길을 만들어갑니다.
정신 건강도 객관적으로 진단하고 효과적으로 치료할 수 있도록, 우리는 기술과 데이터로 길을 만들어갑니다.
식대 지원
스낵바 제공
교통비 지급

[리소리우스] ML Data Engineer 채용 (O명)

포지션데이터 엔지니어
경력 구분경력 전체
특이사항원격근무 없음

스킬

Python
Pytorch
Spark
Tensorflow
Docker
SQL
Pandas
NumPy
Scikit-learn
Obviously AI
Vision ML
Datasets

주요업무

데이터셋 구축·검증 및 제공

  1. 연구 질문과 활용 목적을 코호트 조건, 필요 변수, 가공 규칙, 산출물과 완료 기준이 정의된 태스크로 구체화하고 Dataset 구축
  2. Researcher 및 Domain Expert와 함께 Label, Outcome, Prediction Target과 Feature 구성을 정의하고, 라벨링 지침·검수 기준 및 작업 결과를 데이터셋에 반영
  3. 평가 목적에 맞는 환자·기관·시간 기준의 Sampling 및 Train / Validation / Test Split 설계와 Data Leakage·Label Leakage 검증
  4. 동일 환자의 방문·검체·모달리티 간 중복 및 예측 시점 이후 정보 유입 등 태스크별 누수 위험 점검
  5. Longitudinal / Temporal Patient Dataset 구축 및 EHR/EMR, Imaging, Pathology, Omics 등 Multi-modal Dataset Alignment
  6. 결측·중복, 라벨 오류, 데이터 분포 및 코호트 선택 편향을 점검하는 Dataset Quality / Distribution Validation Pipeline 구축
  7. 태스크별 추출·가공·검증 과정의 자동화와 Dataset 갱신·재생성 파이프라인 운영
  8. 입력 데이터 버전, 가공 코드·설정, 라벨·검수 이력 및 Split 정보를 연결한 Dataset Versioning, Snapshot 및 Benchmark 관리
  9. 사용·제공 가능한 범위와 제공 규격에 맞춰 Dataset을 구성하고, 코호트·라벨 정의, 데이터 사전, 품질 검증 결과, 이용 범위와 버전별 변경 내역을 포함한 제공 패키지 제작

연구 과제별 학습 데이터 확장

  1. Model Error, Failure Case, Hard Example 및 평가 결과를 분석하여 Dataset 개선 과제 도출
  2. AI Agent의 Reasoning / Tool-use / Research Trajectory 기록 수집·정제 및 검수
  3. AI/ML Engineer 및 Researcher와 협업하여 SFT, Preference Learning, RL 및 Post-training Dataset 구축과 Feedback Data Loop 운영


자격요건

  1. Python을 활용해 데이터를 추출·가공·검증하고, ML 학습·평가용 Dataset을 구축한 경험이 있으신 분
  2. ML Task에 맞는 Sampling, Train / Validation / Test Split 및 Validation 방법을 이해하고 적용할 수 있으신 분
  3. 데이터 분포, Bias, Leakage 및 Dataset Quality가 모델 성능과 평가에 미치는 영향을 이해하고, 관련 문제를 점검할 수 있으신 분
  4. 가공 코드·설정, 라벨, 데이터 버전을 관리하여 Dataset과 ML Experiment를 재현할 수 있으신 분
  5. 반복적인 데이터 처리·검증 과정을 재사용 가능한 코드나 파이프라인으로 구현할 수 있으신 분
  6. AI/ML Engineer, Researcher 및 Domain Expert와 협업하여 요구사항을 구체적인 가공·검수 기준과 데이터 산출물로 구현할 수 있으신 분


우대사항

  1. Clinical, EHR/EMR, Imaging, Pathology, Omics 중 하나 이상의 Biomedical Data 처리 경험
  2. Patient Cohort Definition, Clinical Outcome 또는 Longitudinal / Temporal Patient Dataset 구축 경험
  3. Multi-modal ML Dataset 구축 경험
  4. SQL을 활용한 코호트 추출 및 데이터 가공 경험
  5. 라벨링 지침·검수 기준을 정리하고, 라벨 품질과 수정 이력을 관리한 경험
  6. Spark, Ray 등 대규모 데이터 처리 Framework 활용 경험
  7. MLflow, DVC, Weights & Biases 등을 활용한 Dataset / Experiment Versioning 경험
  8. ML Benchmark 또는 Evaluation Dataset 구축 경험
  9. LLM/Agent Trajectory, Instruction / SFT Dataset 구축 경험
  10. Preference, Reward Model, RLHF/RLAIF 등 Post-training Dataset 관련 경험
  11. Model Failure Case Mining, Hard Example Mining, Active Learning 또는 평가 결과를 활용한 Dataset 개선 경험
  12. 외부 고객이나 연구 협력자에게 제공할 Dataset의 패키징, 품질 검수 및 문서화 경험


채용절차

1차: 대표자 커피챗

2차: 실무자 커피챗

(필요 시) 기술 면접 → 레퍼런스 체크

근무지

서울 종로구 대학로 116, 4층 (서울, 종로구)
이 채용 공고, 나랑 맞을까요?프로필을 등록하면, 이 공고와의 FIT을 진단해 드려요
내 구직 조건 만족도
83%
일치
프론트엔드React, TypeScript 외 2경력 4년서울 강남구전체 20명 이하CTO 있음
x
그룹바이에서 합격하면 취업축하금 30만원을 드려요!
✨ 그룹바이로 만난 기업에 합격하면 취업축하금 30만원을 드려요!
취업축하금 신청하기

관련 채용 공고

AI 솔루션 개발 엔지니어 채용 · 경력 2년 이상
C
Python
MySQL
Docker
Github
AWS
Git
Figma
SQL
NLP
Linux
NumPy
Scikit-learn
인트 로고
인트
서울 마포구4인 ‧ SeedAI
기업용 AI 운영의 표준을 만들어 가는 회사입니다.
기업용 AI 운영의 표준을 만들어 가는 회사입니다.
[리소리우스] Data Ingestion Engineer 채용 (○명) · 경력 전체
성실 검토
Python
PostgreSQL
Airflow
Spark
AWS
SQL
Pandas
리소리우스 로고
리소리우스
서울 종로구10인 ‧ Pre-A의료기기 ‧ 바이오
정신 건강도 객관적으로 진단하고 효과적으로 치료할 수 있도록, 우리는 기술과 데이터로 길을 만들어갑니다.
정신 건강도 객관적으로 진단하고 효과적으로 치료할 수 있도록, 우리는 기술과 데이터로 길을 만들어갑니다.
식대 지원
스낵바 제공
교통비 지급
FDE (Forward Deployed Engineer) · 경력 3~10년
빠른 응답
성실 검토
Python
Git
SQL
LLM
아이지에이웍스(IGAWorks) 로고
아이지에이웍스(IGAWorks)
51.0도
서울 용산구75인 ‧ Series D 이상AI ‧ SaaS ‧ 빅데이터 ‧ B2B
아이지에이웍스는 AI · 머신러닝 기술을 활용해 마케팅과 비즈니스 혁신을 가능하게 하는 데이터 기업입니다.
아이지에이웍스는 AI · 머신러닝 기술을 활용해 마케팅과 비즈니스 혁신을 가능하게 하는 데이터 기업입니다.
시차 출퇴근제
리프레시 휴가
해피 런치
사내 카페테리아
힐링룸
리프레시 룸
도서 구매 지원
자녀 특별 휴가
피지컬 AI / 디지털 트윈 엔지니어 경력자 · 경력 5년 이상
Python
Unity
Pytorch
페블러스(Pebblous) 로고
페블러스(Pebblous)
49.5도
세종 반곡동22인 ‧ Pre-AAI ‧ SaaS ‧ 빅데이터 ‧ B2B
데이터셋 품질 평가와 개선을 위한 B2B SaaS 'Data Clinic'
데이터셋 품질 평가와 개선을 위한 B2B SaaS 'Data Clinic'
스톡옵션
유연근무제
창립일휴무
데이터 사이언티스트 (Data Scientist) · 경력 3~10년
Python
R
SQL
Machine Learning
아이지에이웍스(IGAWorks) 로고
아이지에이웍스(IGAWorks)
51.0도
서울 용산구75인 ‧ Series D 이상AI ‧ SaaS ‧ 빅데이터 ‧ B2B
아이지에이웍스는 AI · 머신러닝 기술을 활용해 마케팅과 비즈니스 혁신을 가능하게 하는 데이터 기업입니다.
아이지에이웍스는 AI · 머신러닝 기술을 활용해 마케팅과 비즈니스 혁신을 가능하게 하는 데이터 기업입니다.
시차 출퇴근제
리프레시 휴가
해피 런치
사내 카페테리아
힐링룸
리프레시 룸
도서 구매 지원
자녀 특별 휴가
AI 엔지니어 · 무관
빠른 응답
성실 검토
Python
Computer Vision
Deep Research
라스커 로고
라스커
83.3도
서울 강남구5인AI ‧ SaaS ‧ SW/App ‧ 영상제작 외 3
유튜브 크리에이터의 영상 편집 시간을 1/3로 줄여주는 AI 영상 편집 에이전트 PREPIX를 개발하고 있습니다.
유튜브 크리에이터의 영상 편집 시간을 1/3로 줄여주는 AI 영상 편집 에이전트 PREPIX를 개발하고 있습니다.
선택적 근로시간제
직무능력향상 지원
고사양 장비 지원
무제한 스낵바
생일 유급 반차
스톡옵션 제도
(주)그룹바이HR | 서울특별시 영등포구 영등포로 150 C동 907, 908호대표 : 임진하 / 박상민사업자등록 : 333-88-02226유료직업소개업 등록번호 : 제 2005-3180270-14-5-00019호직업정보제공사업 신고번호 : J1200020230023문의 : hello_world@groupby.biz
instagramkakaotalkyoutube