기본 콘텐츠로 건너뛰기

라벨이 메모리 관리인 게시물 표시

Python에서 파일 I/O 효율적으로 처리하는 방법 (with gzip, pathlib 등)

안녕하세요! 백엔드 개발하면서 늘 골치 아팠던 게 바로 대용량 파일 처리였어요. 데이터 분석이나 로그 처리할 때 엄청난 크기의 파일을 다루다 보면, 프로그램이 멈춰버리거나 메모리가 터져버리는 경험, 한 번쯤은 다들 해보셨죠? 저도 그랬거든요. 그래서 오늘은 제가 터득한 파이썬 파일 I/O 효율적으로 처리하는 팁들을 공유하려고 합니다. gzip , pathlib 같은 멋진 도구들을 활용하는 방법, 그리고 제가 직접 겪었던 시행착오까지! 우선, 기본적인 파이썬 파일 입출력은 간단하긴 하지만, 대용량 파일에는 역부족이에요. 그냥 open() 하고 read() 하면 메모리가 순식간에 꽉 차버리거든요. 마치 엄청난 양의 빨랫감을 한꺼번에 세탁기에 넣은 것 같은 느낌이랄까요? 그래서 효율적인 방법이 필요해요! 핵심은 세 가지입니다. 첫째, with 문 을 꼭 사용하세요. 파일 열고 닫는 걸 자동으로 해줘서, 자원 누수를 막아줍니다. try...except...finally 보다 훨씬 깔끔하고 안전해요. 이건 마치 자동차 시동 끄는 것과 같은 거죠. 안 끄면 연료 낭비잖아요? 둘째, 압축 파일을 다룬다면 gzip 모듈 이 최고입니다. .gz 파일을 쉽게 처리할 수 있어요. 대용량 파일은 압축해서 처리하는 게 메모리와 시간을 엄청나게 절약해줍니다. 저는 한번은 압축 안 하고 처리하다가 프로그램이 뻗어버린 적이 있어요… 정말 끔찍했죠. 셋째, pathlib 모듈 은 파일 경로를 객체처럼 다뤄서 코드를 훨씬 깔끔하게 만들어줍니다. 다양한 운영체제에서도 잘 돌아가고요. 예전에는 파일 경로를 문자열로 직접 조작했는데, pathlib 를 쓰니 코드가 얼마나 보기 좋아졌는지 몰라요. 마치 정리가 잘 된 서랍장 같은 느낌이랄까요? 그리고 중요한 게 하나 더 있는데, 바로 버퍼링 이에요. 데이터를 조금씩 모아서 한꺼번에 입출력하는 방식인데, 대용량 파일 처리에 효과적입니다. 그리고 rea...

Python 메모리 관리: 참조 카운트, GC, 메모리 누수 방지

파이썬으로 코딩하다 보면, 가끔 메모리 관리 때문에 골치 아픈 적 있으시죠? 저도 처음엔 몰랐는데, 파이썬이 알아서 메모리 관리를 해준다고 해서 마냥 믿었다가 낭패를 본 적이 한두 번이 아니에요. 그래서 파이썬의 메모리 관리 원리를 제대로 파악해보려고 이것저것 찾아보고 실험도 해봤습니다. 오늘은 제가 깨달은 내용을 여러분과 나눠볼까 합니다. 파이썬은 참조 카운트라는 방식을 주로 써요. 쉽게 말해서, 어떤 데이터를 사용하는 변수가 몇 개인지 계속 세고 있다는 거죠. 쓰는 변수가 없어지면, 그 데이터를 차지하고 있던 메모리도 자동으로 해제됩니다. 마치 도서관 책처럼, 아무도 빌리지 않으면 다시 서가에 정리되는 것과 비슷하다고 생각하면 쉬워요. 근데 문제는 '순환 참조'라는 함정이 있다는 거죠. A라는 데이터가 B를 참조하고, B가 다시 A를 참조하는 경우를 말해요. 이럴 때는 둘 다 참조 카운트가 0이 안 되니까 메모리가 계속 잡혀있게 되죠. 마치 서로 빌리고 빌려서 책을 제대로 반납하지 못하는 상황과 같다고 할까요? 이런 문제를 해결하기 위해 파이썬은 가비지 컬렉터(GC)라는 청소부를 두고 있어요. GC는 주기적으로 메모리를 돌아다니며 이런 순환 참조를 찾아서 메모리를 비워줍니다. 마치 도서관 사서가 책을 정리하는 것과 같다고 할 수 있겠죠. 실제 코드를 보면 더 이해가 쉬울 거예요. 예를 들어, Node라는 클래스를 만들어서 서로 연결하는 코드를 짜봤는데, 순환 참조가 발생하면 objgraph 라이브러리를 이용해서 시각적으로 확인해 볼 수 있었어요. (이 라이브러리는 pip install objgraph 로 설치하면 됩니다). 그런데, weakref 라는 강력한 도구를 사용하면 이 순환 참조 문제를 해결할 수 있더라고요! weakref 는 객체를 참조하면서도 참조 카운트에는 영향을 주지 않아요. 정말 신기하죠? 마치 책을 잠깐 훑어보고 다시 제자리에 두는 것과 같은 느낌이랄...