pandas read_csv가 파일 크기의 3배를 먹는 이유와 해결법
pandas read_csv가 파일 크기의 3배씩 메모리를 먹는 이유가 궁금해서 검색하셨다면, 원인은 크게 두 가지입니다. 문자열 컬럼이 object dtype으로 저장되면서 파이썬 객체 오버헤드가 그대로 붙고, 숫자 컬럼도 실제 필요한 범위보다 훨씬 큰 int64·float64로 자동 지정되기 때문입니다. dtype을 미리 지정하고 필요하면 chunksize로 나눠 읽으면 이 부풀림을 상당 부분 줄일 수 있습니다. 이 글은 pandas 2.x, CPython 3.10 … Read more