GPT-4를 사용하여 수백만 건의 애프터서비스 요청을 처리함으로써 32%의 인력을 절약했습니다. 이러한 3가지 실수는 반드시 피해야 합니다.
지난달 블랙프라이데이 프로모션의 피크 기간 동안, 우리 팀 3명은 모니터링 패널을 지켜보며 애프터서비스 요청의 429 오류율이 1%에서 12%로 급증하는 것을 목격했습니다. 이전에 사용하던 소규모 모델은 하루에 120만 건에 달하는 다국어 문의량을 감당할 수 없었고, 고객 불만 건수는 24시간 만에 4배로 증가했습니다. 결국 긴급히 GPT-4의 리소스를 사용하여 오류율을 0.3% 이하로 낮출 수 있었습니다.
먼저 이해해야 할 것은: GPT-4가 중소규모 팀에게 어떤 도움을 줄 수 있는지입니다.

간단히 말해, 이 모델은 OpenAI가 현재 기업에 제공하는 능력이 가장 균형 잡힌 대형 모델입니다. 최대 128k의 상황 정보를 입력으로 받을 수 있으며, 다양한 언어에 대한 이해 정확도가 대부분의 전문화된 소형 모델보다 40% 이상 높습니다. 따라서 별도의 미세 조정 없이도 복잡한 상황을 직접 처리할 수 있습니다.
국가 간 가전제품 소매업을 하는 20명 규모의 소팀으로서, 가장 직접적인 세 가지 이점은 복잡한 ROI 계산조차 필요 없을 정도로 명확합니다:
- 먼저, 다국어 티켓의 경우 더 이상 전용 번역 인력을 배치할 필요가 없습니다. 스페인어, 프랑스어, 폴란드어로 된 고객 지원 문의를 직접 이해할 수 있으며, 해당 언어에 맞는 표준 답변을 제공할 수 있습니다.우리의 애프터서비스 인력 비용이 직접적으로 32% 절감되었습니다.
- 이전에 사용하던 소형 모델보다 복잡한 장애를 정확하게 판단하는 비율이 훨씬 높아졌습니다. 이전에는 17%의 작업 요청이 사람의 추가 확인이 필요했지만, 이제 그 비율이 4% 미만으로 줄었습니다.
- 미세 조정이 필요한 훈련 데이터를 많이 보유할 필요가 없습니다. 새로 출시된 제품 설명서를 그대로 사용하면 2시간 만에 해당 제품에 대한 고객 문의에 대응할 수 있게 됩니다. 대규모 프로모션 기간에는 효율성이 특히 눈에 띄게 향상됩니다.
장점만 보지 말고, 우리가 실제로 겪었던 몇 가지 문제점들도 살펴보세요.
첫 번째 문제는 비용이 통제 불능이 되는 것이었습니다. GPT-4로 전환할 때 입력 데이터를 자르지 않아서 사용자가 업로드한 수십 페이지 분량의 오류 스크린샷을 그대로 처리했더니, 하루 동안의 토큰 사용량이 이전 일주일보다도 더 많아졌습니다. 그 후에 불필요한 중복 정보를 먼저 걸러내는 전처리 단계를 추가한 결과, 비용이 절반으로 줄었습니다.
두 번째로, 트래픽 제한은 정말 골칫거리입니다. 만약 임시적인 대규모 프로모션으로 인해 트래픽이 급격히 증가할 경우, 공식 API를 사용하면 쉽게 동시 접속 제한에 부딪힐 수 있습니다. 저희는 블랙프라이데이 당일에 10분 동안 트래픽 제한을 경험했는데, 이 문제를 해결하기 위해 고객 관리자에게 3일 전에 미리 임시 확장 요청을 했습니다. 절대 트래픽이 증가한 후에야 요청을 하지 마세요.
세 번째 문제는 민감한 콘텐츠의 오진입니다. 어떤 사용자가 “오븐을 가열할 때 외부가 조금 뜨거워서 폭발할까 봐 걱정된다”고 말했는데, 콘텐츠 보안 시스템에 의해 바로 차단되어 오류 메시지가 반환되었습니다. 그 후에 민감한 단어에 대한 사전 검증을 추가하여 정상적인 고장 문의 키워드들을 먼저 걸러내자, 오진률이 받아들일 수 있는 수준으로 줄었습니다.
지금 GPT-4로 교체할지 말지 고민 중인데, 먼저 이 두 가지 기준을 살펴보자.

사용 시:만약 여러 언어의 콘텐츠를 처리하거나, 복잡한 장문 텍스트의 요약 작업(예: 수십 페이지 분량의 문서 요약), 다단계의 고객 서비스 상담, 코드 디버깅 등을 해야 하거나, 팀에 소규모 모델을 미세 조정할 수 있는 전문 알고리즘 개발자가 없다면, GPT-4를 직접 사용하는 것이 자체적으로 모델을 개발하는 것보다 훨씬 더 경제적이고 효율적입니다.
사용해서는 안 되는 경우:만약 당신의 시나리오가 매우 간단하다면, 예를 들어 키워드에 기반한 답변을 제공하거나 고정된 템플릿의 문자 메시지를 생성하는 것뿐이거나, 모든 데이터가 외부로 나가서는 안 된다면, 굳이 그럴 필요가 없습니다. 저렴한 소형 모델이나 규칙 기반의 엔진으로도 충분히 처리할 수 있으니까요. 그런데도 돈을 쓴다면 그건 순전히 낭비일 뿐입니다.
처음 시작하는 팀을 위한 두 가지 구체적인 조언

첫째로, 10%의 트래픽을 사용하여 그레이스케일 테스트를 실시하고 7일 동안 실제 정확도, 비용, 응답 속도가 예상에 부합하는지 확인하세요. 처음부터 전체 트래픽을 전환하지 마세요. 저희도 처음에 전체 트래픽을 전환했을 때 제한이 발생하는 문제에 부딪혔습니다. 이제 그레이스케일 테스트는 모델을 교체할 때의 고정된 절차가 되었습니다.
둘째, 반드시 전단 트래픽 스케줄링 계층을 추가해야 합니다. 간단한 요청들은 저렴한 소형 모델에게 전달하고, 소형 모델로는 처리할 수 없는 복잡한 요청만 GPT-4에게 보냅니다. 이렇게 하면 전체 모델 비용이 28% 더 절감되었으며, 성능에는 아무런 손실이 없었습니다.
흔히 발생하는 두 가지 작은 문제
질문: 데이터 유출이 발생할 수 있나요? 답변: 기업용 API를 선택한 경우, OpenAI는 사용자의 입력 데이터를 모델 훈련에 사용하지 않는다고 명확히 밝혔습니다. 저희는 컴플라이언스 검토를 거쳤으며, 유럽 연합의 GDPR 요구사항을 준수하고 있으니 안심하고 사용하셔도 됩니다.
질문: 응답 속도가 느릴까요? 답변: 일반적인 티켓 문의 요청은 대부분 150ms 이내에 반환됩니다. 특별히 긴 텍스트의 처리는 1초가 걸릴 수 있지만, 애프터서비스 시나리오에는 충분히 빠릅니다.
도움이 되었나요?