메뉴

우리는 Claude 3을 사용하여 고객의 애프터서비스 요청 처리 효율을 3배로 향상시켰지만, 예상치 못한 두 가지 문제에 부딪혔습니다.

지난주 블랙프라이데이가 끝나고 보고서를 작성할 때, 우리 동남아시아 전자상거래 SaaS 팀의 3명의 개발자들이 백엔드 데이터를 보며 깜짝 놀랐습니다. 예전에는 고객 서비스 팀이 3일 동안 연속으로 일해야만 처리할 수 있었던 애프터서비스 요청들이 올해는 대부분 자동으로 처리되었으며, 고객 불만 건수가 42%나 감소했습니다. 핵심적인 변경 사항은 단 하나뿐이었습니다: 기존의 요청 의미 인식 로직을 모두 Claude 3 Opus로 바꾼 것입니다.

"""먼저, 이 분야에 처음 접하는 분들께 솔직히 말씀드리자면...""

그것은 Anthropic이 2024년에 출시한 세 번째 세대의 대형 언어 모델입니다. 우리가 실제로 사용한 핵심 파라미터는 매우 간단합니다: 200k의 컨텍스트 창 내에서 3장의 상품 스크린샷이 포함된 애프터서비스 티켓을 처리할 때, 이전에 사용했던 동일한 파라미터 수준의 모델보다 정확도가 18% 더 높았습니다.

우리 같은 소규모 팀에게 있어서, 이 세 가지 이점은 실질적인 혜택입니다.

Abstract black and white graphic featuring a multimodal model pattern with various shapes.

첫 번째는 더 이상 별도로 다중 모달 전처리를 할 필요가 없다는 것입니다. 이전에 사용자가 업로드한 손상된 상품 이미지나 물류 스크린샷의 경우, 먼저 OCR 모델을 사용하여 텍스트로 변환한 다음, 그 텍스트를 텍스트 작업 티켓과 함께 대형 모델에 입력해야 했습니다. 이러한 프로세스의 유지보수만으로도 백엔드 리소스의 절반 이상이 소모되었습니다. Claude 3을 도입한 후에는 이미지와 텍스트를 함께 전송하기 때문에, 인식 오류가 오히려 줄어들었습니다.

두 번째로, 거절률이 거의 무시할 수 있을 정도로 낮습니다. 이전 모델은 사용자가 너무 혼란스럽게 작성한 티켓(예: 반영어 반현지 언어, 인터넷 약어가 섞여 있음)을 만나면 종종 인식할 수 없어서 수동으로 처리해야 했습니다. 우리가 통계를 낸 결과, 그 시기에 수동 처리 비율은 27%였는데, 지금은 그 수치가 4%입니다.

세 번째로, 호출 비용이 우리가 예상했던 것보다 훨씬 저렴했습니다. 우리는 실제 사용량에 따라 비용을 지불했는데, 블랙프라이데이 피크 날에는 하루에 평균 12,000건의 고객 요청을 처리했고, 총 비용은 800달러 미만이었습니다. 이는 10명의 임시 고객 서비스 직원을 고용하는 비용보다 90%를 절약한 것입니다.

하지만 서두르지 마세요. 우리가 건너든 두 가지 문제 때문에 일주일 동안 헛수고할 수도 있어요.

첫 번째 문제는 다국어 정렬의 문제였습니다. 사용자의 절반은 인도네시아어를 사용하는데, 처음에는 세부 조정을 하지 않고 바로 서비스를 시작했습니다. 그 결과 현지 고유의 속어가 나타날 때 모델이 “상품의 색상을 잘못 보냈다”를 “고객이 수령 주소를 변경하고 싶다”로 잘못 인식하여 일주일 동안 17건의 고객 불만이 발생했습니다. 이후 3000개의 현지 언어로 된 레이블이 달린 작업 항목을 제공하여 모델을 조정한 후에야 문제가 해결되었습니다.

두 번째 문제는 긴 상황에서 정보가 누락되는 것입니다. 만약 티켓에 5장 이상의 이미지가 첨부되어 있다면, 모델이 가끔 중간의 이미지 정보를 놓칠 수 있습니다. 예를 들어, 사용자가 포장이 손상되었고 상품도 손상되었다는 두 장의 이미지를 찍었을 때, 모델은 포장 문제만 인식할 수 있습니다. 그래서 우리는 간단한 검증 규칙을 추가했습니다: 이미지가 3장을 초과하면, 모델이 먼저 각 이미지에 대한 인식 결과를 순차적으로 출력한 다음에 종합적으로 처리하도록 했고, 그 이후로는 더 이상 문제가 발생하지 않았습니다.

솔직히 말해서, 모든 팀이 이 방법을 사용하기에 적합한 것은 아닙니다.

Abstract representation of a multimodal model with dots and lines on a white background.

당신이 사용해야 할 상황:

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

  • 귀하의 비즈니스는 텍스트와 이미지/짧은 오디오를 동시에 처리해야 하며, 여러 모델 체인을 설정하고 싶지 않으신 것 같습니다.
  • 당신은 출력의 정확도에 매우 높은 요구를 하고 있습니다, 예를 들어 고객 문의 처리나 계약 검토와 같이 오류가 발생하면 비용이 많이 드는 상황에서 말이죠.
  • 당신의 팀은 인력이 부족해서 복잡한 모델 전처리 과정을 유지보수할 에너지가 없습니다.

돈을 낭비하지 않는 상황:

  • 당신은 단순한 키워드 답변을 제공하거나 마케팅 콘텐츠를 생성하는 같은 가벼운 작업만을 해야 하니, 저렴한 소형 모델로도 충분합니다.
  • 귀사의 비즈니스 데이터에는 엄격한 현지화 저장 요구사항이 있어서, 데이터를 제3자 모델 인터페이스로 전송할 수 없습니다.
  • 귀하의 요청량이 매우 적어서, 매달 1000건도 되지 않습니다. 모델을 교체하는 개발 비용이 수익보다 더 높습니다.

처음 사용하는 분들을 위한 두 가지 실습 팁입니다.

첫 번째 단계는 먼저边缘 시나리오에서 7일간 테스트를 진행한 후에 핵심 라인에 적용하는 것입니다. 처음에는 지난 3개월간의 역사적인 작업 티켓을 사용하여 오프라인 테스트를 수행했으며, 정확도가 95% 이상에 도달한 후에야 온라인 트래픽의 10%를 점차 적용하기 시작했습니다. 그 후에 점차 전체 온라인 트래픽으로 확대했지만, 심각한 온라인 사고는 발생하지 않았습니다.

두 번째로, 처음부터 가장 비싼 Opus 버전을 선택할 필요는 없습니다. 우리가 테스트해본 결과, 이미지가 없는 일반적인 문의 사항을 처리할 때 Sonnet 버전의 정확도는 Opus와 거의 차이가 없으면서 비용은 절반에 불과하므로 충분히 사용할 수 있습니다.

마지막으로 많이들 묻는 질문입니다: 차세대 모델을 기다릴 것인가요? 저희의 답변은, 만약 여러분의 비즈니스가 이미 다중 모달 처리나 정확도 부족으로 인해 효율성이 저하되고 있다면, 지금 바로 사용하는 것이 좋습니다. 어차피 빨리 사용할수록 절약되는 인력 비용이 차세대 모델의 호출 비용보다 훨씬 크기 때문입니다.

도움이 되었나요?

기술 지원온라인 상담
侧栏
맨 위로
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR