[미리디] Data Engineer
스킬
주요업무
| 팀 소개
데이터 엔지니어링 팀이 어떤 문제를 풀고 있는지 궁금하다면?
Data Engineering 파트는 Kafka/Debezium 기반 CDC 스트리밍 파이프라인과 Airflow·Databricks·DuckDB(Arrow) 기반 배치 파이프라인으로 사내 여러 서비스의 데이터를 수집하고, 256TB 이상 규모의 Databricks Delta Lake 기반 데이터 레이크하우스에 적재·운영합니다.
이를 통해 전사가 신뢰하고 즉시 활용할 수 있는 분석 데이터의 기반을 만들어 가고 있습니다.
현재는 Silver·Gold 레이어의 마트 테이블과 워크플로를 재설계해 마트 데이터의 접근성과 신뢰도를 높이고 있습니다. 마트의 변환·검증·배포 과정을 CI/CD로 표준화해 품질 문제를 배포 전에 선제적으로 걸러내고, 정합성·freshness 지표를 상시 모니터링하는 품질 관리 체계를 갖춰 가고 있습니다.
동시에 Unity Catalog 기반 접근 제어와 개인정보 마스킹, 메타데이터·데이터 리니지 관리를 통해 데이터 거버넌스를 강화하고 있습니다. 이렇게 정비한 마트와 메타데이터는 사람뿐 아니라 Agent도 정확히 이해하고 활용할 수 있는 분석 기반이 됩니다.
이를 바탕으로 미리디 구성원 누구나 Agent를 통해 쉽게 데이터를 분석할 수 있는 환경을 만들고, Agent 기반 마트 생성 자동화와 셀프 서비스 환경도 함께 구성하고 있습니다.
데이터 플랫폼의 활용 범위도 넓혀 가고 있습니다. 미리캔버스에서 매일 2억 건 이상 발생하는 사용자 행동 로그를 수집하기 위해 Server-side GTM 기반 스트리밍 수집 인프라를 구축하고, 실시간으로 수집된 데이터를 분석하는 실시간 분석 시스템을 개발하고 있습니다.
또한 80억 건 이상 적재된 비정형 디자인 에셋 데이터를 AI/ML 모델 학습과 디자인 데이터 분석에 쉽고 빠르게 활용할 수 있도록 비정형 데이터 레이크를 구성하는 것도 중요한 미션입니다.
Data Engineering 파트는 수집부터 적재, 모델링, 품질, 거버넌스, 서빙까지 데이터가 흐르는 전 과정을 설계·운영하며, 미리디 구성원 누구나 믿고 쓸 수 있는 데이터 기반을 책임지는 팀입니다.
| 입사 후 3개월 성장 목표
[1개월 차]
• 데이터 플랫폼, 수집 파이프라인, 거버넌스 운영에 필요한 지식을 익힙니다. 수집 지연·장애 같은 운영 이슈에 직접 1차 대응할 수 있는 수준이 됩니다.
[2개월 차]
• 신규 데이터 소스의 수집 파이프라인과 필요한 인프라를 혼자 설계하고 구현합니다. 리뷰를 거쳐 운영 환경에 배포하고 안정적으로 운영합니다.
[3개월 차]
• 담당 도메인의 수집부터 마트, 품질, 메타데이터까지 전 과정을 책임지고 운영합니다. 운영 중 발견한 문제 한 가지를 스스로 정의하고 개선합니다.
| 주요 업무
"미리디에서 이런 일들을 함께 하고 싶어요"
• 데이터 수집 파이프라인: CDC 스트리밍·배치 수집 파이프라인을 구축·운영하고, 신규 소스 연동과 수집 장애에 대응합니다.
• 데이터 레이크하우스 및 마트 모델링: Bronze·Silver·Gold 계층을 운영하고, 모델링 표준에 따라 마트를 설계·이관하며 변환·배포 CI/CD를 개선합니다.
• 데이터 품질 관리: 정합성·freshness·schema drift 지표를 모니터링해 데이터 문제를 소비 단계 이전에 탐지합니다.
• 데이터 거버넌스: Unity Catalog 기반 접근 제어와 개인정보 마스킹, 메타데이터·리니지를 관리하고 ISMS-P 요건에 맞는 데이터 환경을 운영합니다.
• 실시간 수집·분석 및 비정형 데이터 레이크: 사용자 행동 로그의 실시간 수집·분석 시스템과 디자인 에셋용 비정형 데이터 레이크를 구축합니다.
• Agent 기반 분석 환경 및 플랫폼 운영: 구성원이 Agent로 데이터를 분석하는 환경과 마트 생성 자동화를 개발하고, EKS 기반 데이터 플랫폼을 운영합니다.
자격요건
| 자격요건
"이런 분이라면 목표 달성에 확신을 얻을 것 같아요"
• 데이터 엔지니어링 또는 관련 분야에서 3년 이상의 경력 혹은 이에 준하는 역량을 갖추신 분
• 배치 또는 스트리밍 데이터 파이프라인을 직접 구축하고 운영해 보신 분
• Spark 등 분산 처리 프레임워크와 Airflow 등 워크플로 오케스트레이션 도구를 다뤄 보신 분
• 차원 모델링(grain, fact/dimension, SCD 등)을 바탕으로 데이터 웨어하우스/마트를 설계해 보신 분
• 파이프라인 장애나 데이터 이상을 원인까지 추적해 해결해 보신 분
• 현업의 데이터 요청을 요구사항으로 정리해 테이블·마트로 구현해 보신 분
우대사항
| 우대 사항
"이런 분이라면 장기적으로 서로에게 더 긍정적일 것 같아요!"
• Kafka, Debezium 등으로 CDC 기반 실시간 수집 파이프라인을 구축·운영해 보신 분
• Databricks·Delta Lake 또는 Iceberg 등 Open Table Format 기반 레이크하우스를 설계·운영해 보신 분
• ClickHouse, StarRocks 등 OLAP 엔진으로 대규모 로그 데이터의 실시간 분석 환경을 구축해 보신 분
• 이미지 등 대용량 비정형 데이터를 AI/ML 학습과 분석에 활용할 수 있도록 데이터 레이크를 구축해 보신 분
• 데이터 품질 검증 도구를 도입해 정합성·freshness·schema drift를 지표화하고 모니터링해 보신 분
• Unity Catalog, DataHub 등으로 데이터 거버넌스를 구성하거나 ISMS-P 요건에 맞춘 데이터 환경을 운영해 보신 분
• Kubernetes 환경에서 데이터 파이프라인과 관련 워크로드를 운영해 보신 분
• 팀과 적극적으로 소통하며 어려운 문제를 함께 풀어가시는 분
• 새로운 기술을 빠르게 익히고, 문제에 맞는 방법을 찾아 적용하시는 분
채용절차
| 기타 사항
- [서류 전형] - [기술 스크리닝] - [기술 및 역량 인터뷰] - [처우 협의] - [입사] 의 프로세스로 진행됩니다.
- 기술 스크리닝 : 1차 인터뷰 전, 직무와 관련된 실무 경험과 지식을 간단히 확인합니다. (온라인, 30분 내외)
- 서류는 원활한 검토를 위해 PDF 형식으로 제출 부탁 드립니다.
- 직급에 따라 인터뷰 후 레퍼런스 체크 전형이 추가될 수 있습니다.
- 입사 후 3개월의 수습 기간 및 수습 평가가 진행됩니다. (급여 100%)
- 서류 전형 결과 안내까지는 최대 2주, 인터뷰 결과 안내까지는 최대 3주가 소요됩니다.
- 여러 포지션에 동시에 지원해주시는 것은 가능하지만 동일한 포지션의 경우 최종 결과 안내를 받은 시점으로부터 6개월 후에 재지원이 가능합니다.