Skip to content

[Feat]: 모델 성능 모니터링 기반 자동 재학습 파이프라인 구축 #38

Description

@simGPT

📝 기능 설명

모델 서빙 중 예측 분포 변화(드리프트)를 Prometheus로 감지하고, 성능 저하 시 자동으로 재학습
→ EC2 MLflow 등록까지 이어지는 파이프라인 구축

🛠️ 작업 상세 내용

  • model-api /metrics 엔드포인트에 수집 메트릭 추가
    • 입력 피쳐 평균값
    • 응답 지연 시간
  • Prometheus AlertRule 설정 (성능 저하 임계값 정의)
  • Alertmanager → GitHub Actions 연결 브릿지 파드 구현
    • Alertmanager webhook 수신
    • GitHub API repository_dispatch 호출
  • GitHub Actions 자동 재학습 워크플로우 작성
    • repository_dispatch 이벤트 트리거
    • train.py 실행 → EC2 MLflow에 새 버전 등록
  • 전체 파이프라인 정상작동 테스트

🔗 고려 사항 (선택)

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions