우리 팀은 GPT-3.5를 사용하여 주소 해석 비용을 62% 절감했을 뿐만 아니라, 대규모 프로모션 기간 동안의 트래픽 제한 문제도 해결했습니다.
지난달 블랙프라이데이 세일 기간 동안, 네덜란드에 있는 우리 3인 규모의 국경 간 소포 물류 백엔드 팀은 처음으로 서버 옆에서 밤새도록 일하지 않았습니다. 작년 이맘때만 해도, 우리가 직접 개발한 주소 오류 수정 모델의 정확도가 80%도 되지 않았고, 오류 로그를 24시간 내내 모니터링하기 위해 별도의 인원을 배정해야 했습니다. 주소를 잘못 기재해서 발생하는 소포 반송률만 11%에 달했습니다.
GPT-3.5는 인공지능(AI) 기술을 기반으로 한 자연어 처리(NLP) 모델로, 사용자가 입력한 텍스트를 이해하고 해당 텍스트에 기반한 다양한 작업을 수행할 수 있습니다. 예를 들어, 질문에 답하거나, 글을 작성하거나, 이야기를 생성하는 등의 작업을 할 수 있습니다. GPT-3.5는 매우 강력한 모델로, 많은 분야에서 활용되고 있습니다.
2022년에 OpenAI가 출시한 이 대형 언어 모델은 2026년에도 계속 업데이트되고 있으며, 현재 안정된 버전으로 최대 16,000개의 컨텍스트 창을 지원합니다. 비스트리밍 방식의 구조화된 출력 요청에 대한 응답 속도는 일반적으로 200ms 이내이므로, 온라인에서의 고병렬성을 요구하는 경량 언어 처리 작업을 충분히 지원할 수 있습니다.
우리는 주소 해석 문제를 해결하기 위해 이것을 선택했으며, 그 과정에서 실질적으로 세 가지 이점을 얻었습니다.

- 첫 번째는 바로 사용할 수 있는 높은 정확도입니다: 수백만 개에 달하는 각국의 주소 데이터를 직접 레이블링하여 훈련할 필요가 없습니다. 우리는 단지 200개의 역사적인 이상 주소 샘플만을 사용하여 훈련을 진행했으며, 그 결과 해석 정확도가 즉시 향상되었습니다.98.7%잘못된 물품의 비율이 1% 미만으로 직접 감소했습니다.
- 두 번째로, 비용이 자체 개발한 시스템보다 훨씬 저렴합니다. 이전에는 자체 개발한 모델과 3대의 GPU 서버를 유지보수하는 데 매달 1200유로가 소요되었지만, 이제 GPT-3.5를 사용하여 하루에 평균 50만 건의 요청을 처리하는 데 매달 450유로만 듭니다. 이로 인해 비용이 62%나 줄었습니다.
- 세 번째로, 확장 작업에 대해 전혀 신경 쓸 필요가 없습니다. 블랙프라이데이 기간 동안 저희의 요청량이 3배로 증가했지만, 이전에 자체적으로 개발한 모델은 최대 1.5배의 트래픽만 견딜 수 있었고 그 이상이 되면 시스템이 다운되었습니다. 이번에는 OpenAI의 백엔드에 사전에 임시로 용량 증가를 요청했을 뿐이며, 전 과정에서 단 한 번도 429 오류가 발생하지 않았습니다.
이점만 보지 마세요. 지난 3개월 동안 우리가 겪은 문제들이 얻은 수익보다 더 많았어요.
처음에는 원본 주소 필드를 그대로 모델에 입력했는데, 유럽의 작은 마을 주소가 미국의 도시로 잘못 인식되는 문제가 자주 발생했습니다. 일주일 동안 고민한 끝에, 기본 프롬프트(Prompt)에 “물류 요청에 포함된 목적지 국가 필드를 우선적으로 매칭하는” 규칙이 추가되어 있지 않다는 것을 발견했습니다.
또 다른 경우에 우리가 실수로 스트리밍 출력을 활성화시켰는데, 그로 인해 모든 파싱 결과의 반환 시간이 3배로 증가했습니다. 피크 시간에는 2만 개의 요청이 초과되어 처리되지 못했고, 문제가 무엇인지 알아내는 데 반나절이 걸렸습니다. 알고 보니 동료가 파라미터를 수정한 후 다시 원래 설정으로 돌리는 것을 깜빡한 것이었습니다.
가장 문제가 되었던 것은 결제 관련 문제였습니다: 처음에는 사용자가 주소를 입력할 때 함께 입력한 불필요한 메모들도 모두 모델에 전달되었기 때문에, 매달 말에 나오는 청구서 금액이 예상보다 30%나 더 많았습니다. 그 후에 우리는 100자를 초과하는 문자들을 자동으로 잘라내는 규칙을 추가했고, 그 다음 달의 청구서 금액은 다시 정상으로 돌아왔습니다.
결국 GPT-3.5는 만능의 해결책이 아니니, 이 두 가지 유형의 팀에 대해서는 무분별하게 참여하지 않는 것이 좋습니다.

만약 여러분의 팀이 의료 기록이나 결제 정보와 같이 매우 민감한 개인 정보를 다룬다면, 공개 버전의 GPT-3.5를 사용하지 마세요. 아무리 저렴하고 사용하기 편리하더라도, 데이터 보안 및 규정 준수의 위험을 감수할 수는 없습니다.
만약 당신이 수만 자 분량의 전문 문서를 생성하거나 복잡한 논리 추론을 해야 한다면, GPT-4o나 Claude 3를 사용하는 것이 좋습니다. GPT-3.5의 경우 이러한 작업에서의 정확도가 상당히 낮아서, 아무리 돈을 절약하려고 해도 그 절약액은 사소할 뿐입니다.
반대로, 사용자 의도 분류, 짧은 텍스트의 오류 수정, 구조화된 정보 추출과 같은 경량 의미 처리 작업을 수행해야 하며 극단적인 추론이 필요하지 않다면, GPT-3.5는 2026년까지도 가장 비용 효율적인 선택지일 것입니다. 다른 대안은 없습니다.
처음 사용하는 분들을 위한 3가지 실용적인 팁입니다. 모두 저희가 실제로 경험하며 배운 내용들입니다.
- 온라인에 올리기 전에 7일 동안 시범 트래픽을 운영해 보세요: 기존 솔루션과 GPT-3.5에 동시에 요청을 보내서 결과만 비교하세요. 트래픽을 전환하기 전에 정확도와 속도가 모두 기대에 부합하는지 확인한 후에 전환하세요. 갑자기 전체를 대체하지 마세요.
- 모든 입력에 전처리 필터를 적용하세요: 불필요한 공백, 관련 없는 주석, 특수 문자를 미리 제거하면 최소 20%의 토큰 사용량을 절약할 수 있으며, 모델의 오류 판단 확률도 줄일 수 있습니다.
- 반드시 대체 계획을 마련해야 합니다. OpenAI 인터페이스에 문제가 생겼을 경우, 정확도가 조금 낮더라도 최소한의 기능을 제공할 수 있는 저사양 대체 솔루션이 있어야 합니다. 그렇게 하면 서비스가 완전히 사용 불가능해지는 것보다는 낫습니다.
FAQ
이제 2026년이 되었는데, 새로운 모델들이 이렇게 많은데도 GPT-3.5를 사용할 필요가 있을까요?
"""경량 작업에 있어서는 이것이 매우 필수적입니다. 동일한 가격대의 오픈소스 모델들과 비교해보았을 때, GPT-3.5의 정확도가 적어도 5퍼센트 포인트는 더 높았으며, 별도로 운영이나 배포를 할 필요도 없어서 전체 비용이 오히려 더 저렴해집니다."
호출할 때 제한률(limit rate)에 대해 걱정해야 할까요?
일반적인 트래픽량이 갑자기 10배 이상 증가하지 않는 이상, 기본 할당량으로도 충분히 사용할 수 있습니다. 대규모 프로모션의 경우 3일 전에 요청서를 제출하면 추가 할당을 받을 수 있습니다. 저희는 이미 3번 요청했는데, 가장 빠른 경우 2시간 만에 승인을 받았습니다.
도움이 되었나요?