포스트

머신러닝 기초 (0) - Introduction

머신러닝 기초 시리즈 소개와 실습 환경 준비를 다룹니다.

머신러닝 기초 (0) - Introduction

머신러닝의 기초 개념을 정리하는 시리즈의 0편입니다. 시리즈 소개와 진행 순서를 다루며, 본문은 1편부터 시작합니다.

누구를 위한 시리즈인가

이 시리즈는 다음에 해당하는 분들을 대상으로 작성한 글입니다.

  • 머신러닝의 수학적 과정에 대해 이해가 필요한 분
  • scikit-learn으로 model.fit()은 돌려봤지만 그 안에서 무슨 일이 일어나는지는 설명하지 못하는 사람
  • 데이터는 다룰 줄 알지만(numpy, pandas) “그래서 모델은 무엇을 배우는가”가 흐릿한 사람
  • 라이브러리 사용법보다 개념의 뼈대를 먼저 잡고 싶은 사람

반대로 Python 문법이나 데이터 다루기 자체가 처음이라면, NumPy, Pandas 기초 시리즈를 먼저 보고 오는 것을 권합니다.

이 시리즈는 개념 설명에 필요한 수학을 포함하고 있습니다. 미분과 선형대수의 기초를 알고 있다는 전제로 진행하니, 낯설다면 해당 내용을 먼저 정리하고 오시길 권합니다.

이 시리즈의 위치

이 블로그의 데이터 관련 글은 세 층으로 나뉩니다.

  • 데이터 다루기: NumPy, Pandas 기초. 배열과 표를 빠르고 정확하게 다루는 도구.
  • 머신러닝 기초: 이 시리즈. 모델이 데이터에서 무엇을, 어떻게 배우는가.
  • 적용: NYC 택시 수요 예측 파이프라인. 개념을 실제 파이프라인으로 옮긴 프로젝트.

이 시리즈는 가운데 층입니다. 도구(pandas)와 적용(파이프라인) 사이에서, 모델을 블랙박스로 두지 않기 위한 개념을 정리합니다.

어떻게 진행하는가

열일곱 편으로 진행하며, 순서는 아래와 같습니다.

주제
(1)머신러닝의 전체 지도
(2)지도학습이란: 회귀와 분류
(3)손실 함수: 모델이 최소화하는 것
(4)경사하강법: 손실을 줄이는 법
(5)과대적합과 일반화: train/valid/test와 편향-분산
(6)교차검증과 하이퍼파라미터 튜닝
(7)규제: Ridge와 Lasso
(8)분류 평가: 혼동행렬과 ROC-AUC
(9)회귀 평가: RMSE, R², 잔차
(10)선형 모델: 선형 회귀와 로지스틱 회귀
(11)결정트리
(12)앙상블: 랜덤포레스트와 부스팅
(13)전처리: 스케일링, 인코딩, 결측치
(14)데이터 누수와 파이프라인
(15)군집화: K-means와 계층군집
(16)차원축소: PCA
(17)이상치 탐지

크게 여섯 묶음입니다. 전체 지도(1), 지도학습의 뼈대(2~4), 잘 배우게 만들기(5~7), 평가(8~9), 모델과 실전(10~14), 비지도학습(15~17). 각 편은 개념을 먼저 세우고 최소한의 코드로 확인하는 방식으로 진행하며, 위 표의 편 번호를 누르면 해당 글로 이동합니다.

실습 환경

실습 환경은 앞선 시리즈와 동일하게 Google Colab으로 통일합니다. 별도 설치 없이 브라우저만으로 실행할 수 있고, numpy, pandas, scikit-learn이 이미 설치되어 있습니다. 환경 준비가 처음이라면 NumPy, Pandas 기초 0편의 실습 환경 절을 참고하세요.

준비가 됐으면 1편부터 시작합니다.

다음 글: 머신러닝 기초 (1) - The Map of Machine Learning

이 기사는 저작권자의 CC BY 4.0 라이센스를 따릅니다.