GPT-4o를 사용하여 다중 모달 고객 서비스의 정확도를 92%까지 끌어올렸지만, 이 과정에서 세 가지 큰 문제에 부딪혔습니다.
지난달 우리 동남아시아의 국경 간 전자상거래 기술 팀 3명은 3일 밤을 새우며 지능형 고객 서비스 시스템을 기존의 대형 텍스트 모델에서 GPT-4o로 전환했습니다. 원래는 이미지 인식 기능만 추가하는 것이었는데, 예상보다 훨씬 큰 변화가 있었고 예상치 못한 문제들도 많이 발생했습니다.
GPT-4o는 인공지능(AI) 분야의 최신 기술로, 대규모의 텍스트 데이터를 학습하여 자연스럽고 유창한 언어 표현을 생성할 수 있는 모델입니다. 즉, GPT-4o는 인간의 언어를 이해하고 사용할 수 있는 능력을 가지고 있어, 사용자와 자연스러운 대화를 나누거나, 글을 작성하거나, 문제를 해결하는 데 도움을 줄 수 있습니다.
본질적으로는 OpenAI의 다중 모달 생성 모델이며, 이전 버전들과 비교했을 때 가장 핵심적인 차이점은한 번의 처리 과정에서 텍스트, 이미지, 오디오 세 가지 유형의 입력을 동시에 처리할 수 있으며, 요청을 분리하여 각기 다른 모델을 호출할 필요가 없습니다.입력 포맷의 사전 처리를 직접 할 필요가 없으며, 인터페이스 매개변수가 복합 호출에 비해 거의 60% 줄었습니다.
왜 우리는 2026년이라는 시점에 꼭 그것을 바꿔야 할까요?
이전에 우리의 고객 서비스 시스템은 텍스트 상담만을 처리할 수 있었습니다. 사용자가 상품이 파손되었거나 잘못 배송된 사진을 찍어도, 먼저 사람이 그 사진을 텍스트로 변환한 후에 모델에 입력해야 했습니다. 이 과정 때문에 세일 기간 동안 작업 요청의 약 20%가 지연되었고, 사용자 불만율도 두 배로 증가했습니다. 우리는 이미지 인식 모델과 텍스트 모델을 결합한 솔루션도 시도해봤지만, 정확도는 76%에 불과했습니다. 잘못 판단된 애프터서비스 요청으로 인한 손실이 모델 비용보다 더 컸습니다.
변경 후 가장 눈에 띄는 3가지 이점은 우리의 초기 예상을 훨씬 뛰어넘었습니다.

- 애프터서비스 고객 요청의 자동 처리율이 47%에서 92%로 급격히 증가했습니다. 원래 사진을 변환하는 업무를 담당하던 두 명의 파트타임 고객 서비스 직원이 더 복잡한 고객 불만 처리 업무로 전환하게 되었고, 이로 인해 매월 인건비가 약 1,800달러 절감되었습니다.
- 사용자가 보낸 방언 음성 상담은 더 이상 별도의 ASR(자동 음성 인식) 인터페이스를 거치지 않고 모델에 직접 전달되어 인식되고 답변을 받을 수 있습니다. 대부분의 요청은 15ms 이내에 처리되며, 전체 응답 속도가 3배 빨라졌습니다.
- 동일한 이미지와 텍스트가 포함된 애프터서비스 요청을 처리할 때, 토큰 소비량이 이미지 인식 모델과 텍스트 모델을 개별적으로 호출하는 것보다 32% 줄었습니다. 이로 인해 대규모 프로모션 기간 동안의 모델 비용이 이전보다 더 저렴해졌습니다.
이점만 보지 말고, 이 3가지 숨겨진 문제점들 때문에 우리가 겪은 손실들은 모두 실제로 발생한 것입니다.
첫 번째 문제점은 다중 모드 입력의 제한 임계값이 순수 텍스트 요청보다 훨씬 엄격하다는 것입니다. 서비스를 시작한 첫날, 동남아시아 지역 사이트의 매장 기념일 이벤트와 겹쳐서 이미지가 포함된 요청의 17%가 바로 429 오류를 보였습니다. 사용자 측에서는 응답을 받지 못해 고객 서비스가 문제를 일으켰다고 생각하여 그날 하루에만 300건이 넘는 부정적인 평가가 올라왔습니다. 결국 우리는 이미지가 포함된 요청에 대해 별도의 하위 처리 대기열을 추가할 수밖에 없었고, 피크 시간에는 “이미지를 받았으며 처리 중입니다”라는 메시지를 먼저 반환함으로써 문제를 해결할 수 있었습니다.
두 번째 문제점은 이 모델이 영어가 아닌 소수 언어의 이미지 내 텍스트 인식 정확도가 광고된 수준에 미치지 못한다는 것입니다. 인도네시아어로 작성된 수기 택배 영수증을 받았을 때, 모델이 3개의 주소 문자를 잘못 인식하여 사용자에게 잘못된 반품/교환 주소를 안내해 주었고, 그로 인해 왕복 운송비로 약 200달러의 손실이 발생했습니다. 이제는 소수 언어의 이미지 인식에 로컬 OCR(광학 문자 인식) 인터페이스를 추가하여 검증을 거치도록 했으며, 그 결과 오류율을 수용 가능한 수준으로 낮출 수 있었습니다.
세 번째 문제점은 다중 모드 출력의 토큰 계수 규칙이 순수 텍스트와 완전히 다르기 때문에 이전의 공식을 사용하여 비용을 예측할 수 없다는 것입니다. 서비스가 시작된 첫 주에는 예산 경고 임계값을 변경하지 않았기 때문에 주말 하루의 비용이 월간 예산의 40%를 초과했는데, 재무팀이 알림을 보내주기 전까지는 이를 발견하지 못했습니다.
지금 바로 바꿔야 할까요? 우리는 명확한 판단 기준을 마련했습니다.
직접 돌진할 수 있는 상황입니다:

- 당신의 비즈니스 자체가 텍스트, 이미지, 오디오 중 두 가지 이상의 입력을 동시에 처리해야 합니다.
- 이전에는 여러 모델을 결합하여 다중 모달 처리를 수행했지만, 통합 비용이 높고 정확도가 충분하지 않았습니다.
- """당신의 사용자는 주로 영어를 사용하거나, GPT-4o가 비교적 잘 지원하는 주류 언어들을 사용합니다."
돈을 전혀 낭비할 필요가 없는 상황들:
- 귀사의 비즈니스는 순수 텍스트 처리만 필요로 하며, 이전 모델도 이미 정확도 요구사항을 충족시킬 수 있었습니다.
- 당신의 비즈니스는 주로 소수 언어 시장을 대상으로 하며, 다양한 형태의 현지 수기 텍스트와 방언 음성 인식 서비스를 제공합니다.
- 귀하의 팀에는 업그레이드 전략을 수립하거나 비용을 모니터링하는 데 필요한 추가 인력이 없습니다.
새로 시작하는 팀을 위한 2가지 실용적인 조언
첫째, 서비스를 온라인으로 출시하기 전에 7일 동안 시범 트래픽을 운영해 보세요. 즉시 100%의 요청을 새 시스템으로 전환하지 마세요. 실제 사용자의 요청을 기존 시스템과 GPT-4o에 동시에 보내서 두 시스템의 정확도와 비용을 비교한 후, 기대에 부합하는지 확인한 다음에 서서히 트래픽을 전환하세요. 우리가 당시 이 단계를 건너뛴 바람에 큰 손실을 입었습니다.
둘째, 다중 모드 요청에 대해 별도의 예산 경고를 설정하십시오. 경고 임계값은 예상 비용의 120%로 설정할 수 있으며, 이를 통해 비용 초과를 방지할 수 있습니다.
FAQ
질문: 다음 세대 모델이 나올 때까지 기다렸다가 교체해야 할까요?
답변: 적어도 다중 모달 통합과 같은 시나리오에서는 GPT-4o의 현재 성숙도가 실제 문제를 해결하기에 충분합니다. 차세대 모델은 적어도 1년 이상은 더 걸릴 것이므로, 불확실한 업그레이드를 위해 지금 절약할 수 있는 비용을 낭비할 필요는 없습니다.
질문: 오픈소스의 다중 모달 모델들과 비교했을 때 가성비는 어떻습니까?
답변: 만약 여러분의 팀이 오픈소스 모델을 자체적으로 미세 조정하고 배포할 수 있는 능력이 있으며, 데이터 프라이버시에 대한 요구 사항이 높다면 오픈소스 모델을 사용하는 것이 더 경제적입니다. 그렇지 않다면 GPT-4o를 사용하는 것이 서버를 직접 구축하고 운영하는 비용보다 훨씬 저렴합니다.
도움이 되었나요?