Pandas 기초 (0) - Introduction
Pandas 기초 시리즈가 누구를 위한 글인지, NumPy 기초 위에서 어떻게 이어지는지, 다섯 편의 진행 순서와 실습 환경을 정리한 0편입니다.
Pandas 기초 (0) - Introduction
데이터를 다루는 표준 도구인 pandas를 정리하는 시리즈의 0편입니다. 시리즈 소개와 진행 순서를 다루며, 본문은 1편부터 시작합니다.
누구를 위한 시리즈인가
이 시리즈는 다음에 해당하는 분들을 대상으로 작성한 글입니다.
pd.read_csv로 파일을 읽어는 봤지만 그 뒤에 무엇부터 해야 할지 막막한 사람loc과iloc,groupby,merge를 그때그때 검색해 쓰지만 언제 무엇을 쓰는지 흐릿한 사람- 데이터가 “에러 없이 조용히 틀리는” 경험을 해봤거나, 그게 무섭다는 걸 아는 사람
Python Numpy 다루기 자체가 처음이라면 NumPy 기초 시리즈를 먼저 보고 오는 것을 권합니다. 또, Python 문법 자체가 처음이라면, 기초 문법을 먼저 공부하고 오는 것을 권합니다.
어떻게 진행하는가
데이터 분석의 기초는 크게 Numpy, Pandas, Matplotlib 편으로 진행이 됩니다. 그 중 이 시리즈는 Pandas를 기준으로 진행합니다.
NumPy 기초
| 편 | 주제 |
|---|---|
| (0) | 시리즈 소개 |
| (1) | Why we use NumPy: vectorization과 dtype |
| (2) | Basic Grammar: ndarray 생성, indexing, 연산, NaN 처리 |
Pandas 기초 (이 시리즈)
| 편 | 주제 |
|---|---|
| (0) | 시리즈 소개 (이 글) |
| (1) | 왜 배열로는 안 되는가: 라벨과 표 데이터 |
| (2) | Series와 DataFrame |
| (3) | 데이터 읽기와 첫 점검 |
| (4) | 원하는 데이터만 골라 바꾸기: loc, 마스크, 접근자 |
| (5) | 쪼개고 세고 합치기: groupby, reindex, merge |
| (6) | 조용히 틀리는 것들: 결측치, dtype 함정, 버전 관리 |
1편이 “왜 쓰는가”라면 2편부터 5편은 “어떻게 하는가”이고, 마지막 6편은 “어떻게 틀리는가”를 모아 방어법을 정리합니다.
Matplotlib 기초
표로 확인한 데이터를 그림으로 보는 시각화 도구를 다룹니다.
실습 환경
실습 환경과 예제 데이터는 NumPy 기초 시리즈와 같습니다. Google Colab에서 새 노트북을 만들면 pandas가 이미 설치되어 있고, 아래 코드가 에러 없이 돌면 준비가 끝난 것입니다.
1
2
3
4
import pandas as pd
pd.__version__ # '2.x.x'
df = pd.read_csv("https://blog.hoseunggg.com/assets/data/grades.csv")
예제는 한 학생의 대학교 성적 CSV 하나를 계속 씁니다. 데이터의 구조와 실습 환경 준비가 처음이라면 NumPy 기초 0편의 실습 환경 절을 참고하세요. 준비가 됐으면 1편부터 시작합니다.
이 기사는 저작권자의 CC BY 4.0 라이센스를 따릅니다.