우리는 GPT-4 Turbo를 사용하여 프로모션 시즌 동안의 요청 오류율을 0.2%로 줄였습니다. 이 3가지 실수를 반복하지 마세요.
지난달 블랙프라이데이 세일 기간 동안, 우리 3명으로 구성된 유럽 국경 간 물류 팀은 처음으로 고객의 주소 검증 요청으로 인해 모두가 밤새도록 일해야 하는 상황에 처하지 않았습니다.
지난해 같은 기간에는 일반 GPT-4를 사용하여 주소 표준화 작업을 했는데, 피크 시간대에는 13%의 요청이 429 오류로 직접 반환되었으며, 고객 불만 처리에만 36시간이 소요되었습니다. 올해는 GPT-4 Turbo로 전환한 후에는 한 번도 제한 조치가 발동되지 않았으며, 오류율도 크게 줄었습니다.0.2%。
먼저 이해해야 할 것은: GPT-4 Turbo가 도대체 무엇인가요?
간단히 말해, OpenAI가 GPT-4를 기반으로 개선한 고처리량 버전으로, 핵심 파라미터의 기준점(앵커 포인트)이 있습니다.한 계정당 분당 지원되는 요청량은 일반 GPT-4의 6배입니다.,동시에 단일 토큰의 비용도 절반으로 줄었으며, 이는 고병렬 처리 시나리오에 특화된 최적화입니다.
중소 기술 팀에게 3가지 실질적인 이점
가장 직접적인 이점은 더 이상 제한 설정에 대해 고민할 필요가 없다는 것입니다. 우리는 하루에 평균 50만 건의 주소 해석 요청을 처리하는데, 이전에는 3개의 다른 플랫폼에서 제공하는 대형 모델을 사용하여 부하 분산을 구현해야 했으며, 그에 맞춰 게이트웨이를 설정하는 데만 1000줄이 넘는 코드를 작성해야 했습니다. 하지만 이제는 GPT-4 Turbo만으로도 프로모션 시즌에 발생하는 3배의 피크 트래픽을 처리할 수 있습니다.
두 번째로, 장문 처리 효율이 매우 높습니다. 우리는 종종 한 페이지 분량의 국경 간 세관 신고서 전체를 입력하여 정보를 추출해야 하는데, 이전에는 일반적인 GPT-4가 문맥 길이가 충분하지 않아서 3번에 나누어 요청해야 했습니다. 하지만 이제는 한 번에 처리가 가능해져서, 단일 작업에 소요되는 시간이 3분의 2로 줄었습니다.
세 번째로, 비용이 정말 절약됩니다. 지난달의 청구서를 계산해보니, 동일한 요청량에서 GPT-4 Turbo의 비용이 이전의 다중 모델 혼합 방식의 28%에 불과했습니다. 절약된 돈은 팀의 성과급으로 사용되어 두 달 분량이 추가되었습니다.
장점만 보지 마세요, 이 3가지 문제점은 우리가 이미 경험해봤습니다.

첫 번째 문제점은 낮은 복잡도의 작업이 오히려 비효율적이라는 것입니다. 처음에는 모든 주소 검증 요청을 그대로 처리했지만, 나중에 “주소가 유럽 연합에 속하는지 판단하는”과 같은 간단한 작업의 경우 GPT-4 Turbo를 사용하는 것이 경량 모델을 사용하는 것보다 3배 더 비쌌다는 것을 발견했습니다. 그래서 이제는 이러한 간단한 요청들을 더 작은 모델로 전환하여 처리하고 있습니다.
두 번째 문제점은 기본 응답 시간이 일반 GPT-4보다 약간 더 길다는 것입니다. 처음에 전환했을 때 일부 요청이 200ms 이상 기다려야 한다는 것을 발견했는데, 나중에 고처리량 모드에서는 요청이 거절되지 않도록 우선적으로 처리된다는 것을 알게 되었습니다. 즉, 극도로 낮은 지연 시간을 보장하는 것이 아니라요. 이 문제를 해결하기 위해 빠른 응답이 필요한 프론트엔드 쿼리 요청에 대해서는 별도로 저지연 설정을 적용했습니다.
세 번째 문제점은 세밀한 수준에서의 권한 제어가 더 제한적이라는 것입니다. 일반적인 GPT-4는 모델의 ‘온도’(temperature), ‘top_p’ 등과 같은 파라미터를 매우 정밀한 범위 내에서 설정할 수 있지만, GPT-4 Turbo의 조정 가능한 범위는 훨씬 좁아졌습니다. 따라서 출력 스타일을 정확하게 제어해야 하는 상황(예를 들어, 고객에게 제공하는 통관 통지문 작성과 같은 경우)에서는 일반 버전으로 돌아가야 합니다.
누가 사용해야 할까요? 누구에게는 이런 소란에 참여할 필요가 없을까요?
만약 여러분이 중소규모 팀이라면, 이 세 가지 조건에 모두 해당된다면 바로 진행하세요:
- 하루에 10만 회 이상의 대규모 모델 고병렬 요청이 발생합니다.
- 자주 8k를 초과하는 긴 텍스트를 다루는 작업을 해야 합니다.
- 이전에는 제한된 트래픽량을 처리하기 위해 모델 간의 부하 분산을 자주 해야 했습니다.
만약 여러분의 팀의 일일 요청량이 1만 건 미만이거나, 단순한 분류나 추출 작업만 수행한다면, 모델을 교체할 필요가 전혀 없습니다. 경량 모델로도 충분하며, 비용도 더 저렴합니다.
초보자를 위한 2가지 구체적인 조언
첫 주에는 전체를 한 번에 전환하지 마세요. 먼저 고부하의 장문 텍스트 요청의 10%만을 전환하여 그레이스케일 방식으로 테스트해 보세요. 일주일간의 모니터링 데이터를 분석한 후에 점차적으로 전환 비율을 늘려가세요. 저희는 첫날에 30%를 전환했는데, 설정 파라미터를 제대로 조정하지 못해 일부 세관 신고서의 추출에 오류가 발생할 뻔했습니다.
GPT-4 Turbo의 128k 컨텍스트는 대부분의 엔터프라이즈급 시나리오에 충분히 적합합니다. 30페이지 분량의 물류 계약 전체를 입력하여 조항을 검증해 본 결과, 출력 정확도와 분할 처리에 차이가 없었습니다. 따라서 사전에 너무 긴 컨텍스트를 준비할 필요가 없습니다.
대부분의 사람들이 자주 묻는 2가지 질문
Q: 일반 GPT-4의 출력 품질보다 낮을까요?
A: 우리는 1000개의 주소 검증 테스트 세트를 실행했으며, 정확도는 98.7%였습니다. 이는 일반 GPT-4의 98.9%와 거의 차이가 없어 기업용 시나리오에서 충분히 사용할 수 있습니다.
Q: 프롬프트 프로젝트를 다시 만들어야 할까요?
A: 우리는 이전에 일반 GPT-4에 사용했던 모든 프롬프트를 그대로 재사용했으며, 아무런 조정도 하지 않았습니다. 그 결과는 예상대로 완전히 맞았습니다.
도움이 되었나요?