PyTorch 모델을 ONNX로 바꿔 FastAPI 추론 2~3배 빠르게 (변환 코드 + 에러 잡기)
FastAPI로 PyTorch 모델을 서빙하다 보면 추론 지연 시간 때문에 곤란해질 때가 많습니다. 특히 CPU 서버에서는 torch.no_grad()만으로 버티기 힘든 경우가 있는데, 이럴 때 PyTorch 모델을 ONNX로 변환해서 ONNX Runtime으로 추론하면 별도의 모델 재학습 없이도 체감 속도가 눈에 띄게 좋아집니다. 이 글에서는 실제로 동작하는 변환 코드, FastAPI 연동 방식, 그리고 변환 과정에서 자주 만나는 에러와 해결법을 정리합니다. … Read more