머신러닝 기초 (3) - Loss Functions: What the Model Minimizes
학습이란 결국 손실 함수를 최소화하는 일입니다. 손실이 왜 필요한지, 회귀의 MSE와 이진분류의 로그손실이 무엇을 재는지를 numpy와 sklearn으로 직접 확인한 3편입니다.
학습이란 결국 손실 함수를 최소화하는 일입니다. 손실이 왜 필요한지, 회귀의 MSE와 이진분류의 로그손실이 무엇을 재는지를 numpy와 sklearn으로 직접 확인한 3편입니다.
Matplotlib 기초 시리즈가 누구를 위한 글인지, NumPy와 Pandas 기초 위에서 어떻게 이어지는지, 세 편의 진행 순서와 실습 환경을 정리한 0편입니다.
Supervised Learning의 두 축인 Regression과 Classification을 배우는 2편입니다.
에러 없이 결과만 틀리는 사고들 — 결측치 처리의 판단 기준, NaN이 일으키는 dtype 승격, 뷰·복사와 Copy-on-Write, 그리고 계속 업데이트되는 NumPy·pandas와 함께 사는 법으로 시리즈를 마무리합니다.
머신러닝 기본 개념을 간략하게 배우는 1편입니다.
머신러닝 기초 시리즈 소개와 실습 환경 준비를 다룹니다.
split-apply-combine으로 이해하는 groupby, 없는 조합을 데이터로 만드는 reindex, SQL join에 대응하는 merge와 조용히 일어나는 행 증가·소실 사고까지, 집계와 결합의 핵심 개념을 정리했습니다.
loc과 iloc의 차이, boolean mask로 행을 거르는 표준 패턴, 선택과 대입을 한 번에 하는 이유, datetime과 문자열을 벡터화로 다루는 .dt·.str 접근자, 그리고 apply를 최후의 수단으로 미뤄야 하는 이유를 정리했습니다.
CSV와 Parquet을 읽는 법, read_csv의 필수 옵션과 자동 결측치 변환이라는 함정, 데이터를 받자마자 실행해야 할 다섯 줄의 점검 루틴, 그리고 category dtype과 저장 관용구까지 정리했습니다.
pandas의 두 자료구조인 Series와 DataFrame의 구조, 열 선택 문법, 연산마다 따라붙는 인덱스 정렬이라는 숨은 동작, 그리고 인덱스를 올리고 내리는 set_index와 reset_index를 정리했습니다.