CSV 읽어오기
지난 시간엔 표를 손으로 만들었지? 그런데 데이터가 100줄이면 손으로 칠 수 없다냥. 다행히 데이터는 보통 파일에 저장돼 있다냥. 오늘은 그 파일을 통째로 읽어오는 법을 배운다냥. 진짜 데이터 분석의 시작이라냥!
오늘의 학습 목표
- CSV 파일이 무엇인지 안다.
pd.read_csv로 파일을 표로 읽어온다.- 표의 일부만 보거나 요약 정보를 확인한다.
pandas2.2 이상표(DataFrame)로 데이터를 다루기streamlit1.40 이상파이썬 코드로 웹 화면 만들기
설치하기 — 터미널에 그대로 붙여넣기
pip install "pandas>=2.2" "streamlit>=1.40"설치 확인 — 버전 번호가 찍히면 성공
python -c "import pandas; print(pandas.__version__)"
python -c "import streamlit; print(streamlit.__version__)"위 버전은 최소 기준이라, 더 높은 버전이 깔려 있으면 그대로 써도 된다냥. 버전이 안 찍히고 에러가 나면 설치가 안 된 거라 설치 명령을 다시 실행해보자냥.
1단계 · CSV 가 뭐냥
CSV 는 콤마로 값을 구분한 아주 간단한 표 파일이다냥. 엑셀로도 열 수 있지만, 사실 속은 그냥 글자라냥. 아래처럼 생겼다냥.
이름,나이,간식
코딩냥,3,참치
노랑이,5,닭가슴살
까망이,2,츄르첫 줄은 열 이름이라냥
맨 윗줄(이름,나이,간식)은 열의 제목이라냥. 그 아래 줄들이 실제
데이터다냥. pandas 는 이 구조를 알아서 이해한다냥!
2단계 · 파일 읽어오기 — read_csv
app.py 와 같은 폴더에 cats.csv 파일을 만들어두고, 아래 코드로 읽어
오면 된다냥. 딱 한 줄이라냥!
import streamlit as st
import pandas as pd
df = pd.read_csv("cats.csv")
st.dataframe(df)"파일을 찾을 수 없다" 에러가 나면?
cats.csv 가 app.py 와 같은 폴더에 있는지 확인한다냥. 폴더가
다르면 못 찾는다냥. 1강에서 배운 "폴더 확인" 이 여기서도 통한다냥!
3단계 · 표를 살펴보기
데이터가 많으면 전부 보기 전에 일부만 훑어보는 게 좋다냥. pandas 는 그런 함수를 여럿 준다냥.
st.write("맨 위 3줄만 보기")
st.dataframe(df.head(3))
st.write("표의 크기 (행, 열)")
st.write(df.shape)
st.write("숫자 열 요약 (평균·최대·최소 등)")
st.dataframe(df.describe())처음엔 이 세 개면 충분하다냥
df.head(3): 맨 위 몇 줄만 미리보기df.shape: 행과 열이 몇 개인지df.describe(): 숫자 열의 평균·최대·최소 등 요약
데이터를 받으면 일단 이 셋으로 "어떻게 생겼나" 부터 확인한다냥!
4단계 · 열 하나만 꺼내기
표에서 특정 열 하나만 꺼낼 수도 있다냥. 딕셔너리에서 열쇠로 값을 꺼내던 거랑 똑같이 대괄호를 쓴다냥.
st.write("나이 열만 보기")
st.write(df["나이"])
st.write("나이 평균")
st.write(df["나이"].mean())df["열이름"] 은 그 열 전체라냥
대괄호 안에 열 이름을 넣으면 그 열이 통째로 나온다냥. 거기에 .mean()
(평균), .max()(최대), .sum()(합계) 같은 걸 붙여 계산할 수 있다냥!
복습 퀴즈
파일에서 진짜 데이터를 읽어올 수 있게 됐다냥! 그런데 데이터가 많으면 원하는 것만 골라 보고 싶어진다냥. 다음 시간엔 입력 위젯과 표를 연결해서, 검색하고 걸러내는 법을 배워보자냥.
