Airflow 해부 (6) 운영: 컨테이너 구동, executor, 멱등성
공식 Docker Compose 기반 구동, PostgreSQL metadata DB, 규모별 executor 선택, 그리고 재시도와 backfill을 안전하게 만드는 멱등성 원칙과 운영 함정을 정리합니다.
공식 Docker Compose 기반 구동, PostgreSQL metadata DB, 규모별 executor 선택, 그리고 재시도와 backfill을 안전하게 만드는 멱등성 원칙과 운영 함정을 정리합니다.
PythonOperator와 BashOperator 등 주요 Operator의 위치, 접속 정보를 코드 밖으로 빼는 Connection과 Variable, 조건을 기다리는 Sensor와 deferrable의 개념을 정리합니다.
실행 시각과 데이터 기준 시각이 다른 logical date 모델, 켜자마자 과거 실행이 쏟아지는 catchup, 과거 구간을 의도적으로 다시 채우는 backfill까지 Airflow 시간 개념을 정리합니다.
TaskFlow API로 DAG를 작성하고, 함수 호출로 의존성이 만들어지는 방식, XCom의 동작과 한계, retry와 알림 설정까지 DAG 작성의 기본을 정리합니다.
모델을 실제로 돌릴 때 필요한 실무 감각 — device로 GPU 쓰기, model.train()과 eval()의 차이, state_dict로 체크포인트 저장·로드, 시드 고정으로 재현성 확보, 그리고 흔한 실수들 — 을 정리하며 PyTorch 기초 시리즈를 마무리하는 (5)편입니다.
constraint 파일을 붙인 설치가 왜 필수인지, airflow standalone이 무엇을 해주는지, 예제 DAG를 UI에서 실행하고 로그를 확인하는 첫 동선까지 정리합니다.
cron의 한계에서 출발해 Airflow의 구성요소인 scheduler, executor, metadata DB, web UI의 역할과 DAG, task, task instance의 세 층 개념을 정리합니다.
Airflow를 기초부터 운영까지 정리하는 시리즈입니다. scheduler와 executor 구조, DAG 작성, logical date와 catchup, Operator와 Connection, 컨테이너 운영, 재학습 DAG까지 일곱 편의 진행 순서를 정리한 0편입니다.
MLflow 3.x의 tracing으로 LLM 호출의 입력, 출력, 지연 시간을 trace와 span 단위로 기록합니다. autolog 연동과 커스텀 함수 추적, 실험 추적과의 관계를 정리하며 시리즈를 마칩니다.
데이터를 통째로 넣던 방식의 한계에서 출발해, 샘플 하나를 정의하는 Dataset(__len__·__getitem__)과 그것을 미니배치로 묶고 섞어 공급하는 DataLoader, 그리고 학습 루프가 배치 순회로 바뀌는 과정을 정리한 PyTorch 기초 (4)편입니다.