메뉴

우리는 OpenAI o1을 사용하여 물류 주소의 일치 정확도를 최대한 높였지만, 예상치 못한 세 가지 문제에 부딪혔습니다.

지난주 블랙프라이데이 피크가 지난 후, 우리 유럽의 3인 백엔드 팀은 마침내 안도의 한숨을 쉬었습니다. 작년 대규모 프로모션 기간 동안 주소 해석 요청의 13%가 단일 모델의 제한으로 인해 429 오류를 보였지만, 올해는 단 한 번도 제한이 발생하지 않았을 뿐만 아니라 주소 일치 오류율도 82%나 감소했습니다. 핵심적인 변화는 우리가 주요 추론 모델을 o1로 교체한 것입니다.

처음 접하는 분들을 위해 명확히 설명드리자면, o1이란 무엇일까요?

OpenAI가 출시한 추론 강화형 대형 모델로, 이전의 GPT-4o와는 다르게 복잡한 논리 문제를 “생각”하는 데 더 많은 시간을 소요합니다. 공식적으로 제공된 기본 추론 능력 테스트 점수가 GPT-4o보다 무려 87% 더 높았습니다. 우리는 처음부터 이 점수를 기준으로 이 모델을 선택했습니다.

우리 같은 중소 규모 팀에게 o1의 장점은 정말 실질적입니다.

첫 번째 장점은 우리가 가장 골치 아파하던 주소 매칭 문제를 바로 해결해줍니다. 이전에 GPT-4o를 사용할 때는 유럽의 다른 국가에 있는 같은 이름의 거리나 중복된 우편번호를 자주 혼동했는데, 특히 사용자가 철자가 잘못된 주소를 입력할 경우 3단계의 규칙 검증을 거쳐야 겨우 92%의 정확도를 얻을 수 있었습니다. 하지만 이제 o1을 사용하면 정확도가 98.7%로 향상되었으며, 그 모든 규칙 코드는 지난주에 이미 삭제했습니다.

두 번째로, 더 이상 복잡한 프롬프트工程设计을 할 필요가 없습니다. 이전에는 모델이 우리 백엔드 형식에 맞는 결과를 출력하도록 하기 위해 거의 2000자에 달하는 프롬프트를 작성해야 했으며, 종종 출력 형식이 엉망이 되는 경우도 있었습니다. 하지만 이제는 단 한 줄의 지시만으로 모든 것을 해결할 수 있어서 프롬프트 유지보수 비용이 0으로 줄었습니다.

세 번째로, 병렬 요청의 안정성이 예상보다 좋았습니다. 우리는 추론 시간이 길어져 대기열이 생길까 봐 걱정했지만, 모니터링 결과 대부분의 요청이 15ms 이내에 완료되었으며, 극히 일부 복잡한 국가 간 주소 조회만 200ms 이상 걸렸습니다. 이는 우리가 허용할 수 있는 범위 내입니다.

하지만 그 함정들은 정말로 당신을 당황하게 만들 수 있어요.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

첫 번째 문제는 토큰 소비량이 GPT-4o보다 훨씬 높다는 것입니다. 우리가 갓 전환한 지 3일 동안 추론 비용이 2.3배로 급증했는데, 나중에야 o1이 자신의 추론 과정도 토큰 소비에 포함시킨다는 것을 알게 되었습니다. 만약 추론 로직을 확인할 필요가 없다면, 반드시 호출 매개변수에서 추론 과정의 출력을 비활성화해야 합니다. 그렇게 하자마자 비용이 이전의 1.2배로 바로 줄어들어 완전히 수용 가능한 수준이 되었습니다.

두 번째 문제점은 간단하고 자주 발생하는 요청에 적합하지 않다는 것입니다. 처음에는 모든 주소 조회 요청을 o1로 전달하여 작업을 간소화하려고 했지만, 철자 오류가 전혀 없고 형식이 표준인 주소들에 대해서는 o1을 사용하든 GPT-4o를 사용하든 정확도에 차이가 없었으며, 오히려 비용만 더 많이 들었습니다. 그래서 이제는 간단한 사전 검증을 추가하여 형식이 표준에 맞지 않는 요청만 o1로 전달하도록 했고, 그 결과 비용이 30% 더 절감되었습니다.

세 번째 문제점은 중국어, 아랍어와 같은 비라틴 문자계 언어에 대한 지원이 아직 충분히 안정적이지 않다는 것입니다. 중동 지역의 사용자들이 아랍어로 주소를 입력할 때 가끔 해석 오류가 발생하는데, 이 문제를 OpenAI에 보고한 후 현재까지 수정을 기다리고 있는 중입니다. 그래서 당분간은 로컬 규칙을 사용하여 추가적인 검증을 진행하고 있습니다.

누가 o1을 사용해야 할까요? 지금은 아무도 건드리지 마세요.

만약 당신이 논리적 추론이 필요한 작업을 처리해야 한다면——예를 들어 복잡한 규칙 매칭, 다중 조건 검증, 간단한 코드 생성 등이며, 이전에 GPT-4o를 사용했을 때 정확도의 한계에 부딪혔다면, 그냥 o1로 바꾸는 것이 좋습니다. 그러면 투자 대비 수익률이 매우 높을 것입니다.

하지만 당신이 하는 일이 간단한 텍스트 분류, 콘텐츠 생성, 또는 자주 발생하는 표준화된 요청이라면 o1을 사용할 필요가 전혀 없습니다. 그건 그냥 돈의 낭비일 뿐이죠. GPT-4o나 GPT-3.5만으로도 충분히 처리할 수 있습니다.

처음 사용하는 분들을 위한 2가지 팁

  • 먼저, 이전에 구형 모델로 처리했던 1000개의 역사적 데이터를 사용해 테스트를 해보세요. 전체 데이터를 한 번에 바꾸지 말고요. 그렇게 하면 정확도의 향상이 비용 증가를 상쇄할 수 있는지 빠르게 확인할 수 있을 거예요. 우리는 당시 2일 만에 모델을 교체해야 한다고 결정했습니다.
  • 호출할 때는 o1-mini 버전을 우선적으로 선택합니다. 90%의 중소규모 팀에게는 o1-mini의 기능도 충분히 만족스럽으며, 가격도 정식 버전(o1)보다 60% 저렴합니다.

마지막으로 여러분이 가장 많이 묻는 질문에 대해 답변드리겠습니다: o1이 곧 다른 모델들에 의해 대체될까요? 적어도 우리가 작업하는 주소 해석 시나리오에서는, 현재 시장에 나와 있는 모든 추론형 대형 모델들을 테스트해봤지만, o1보다 높은 정확도를 가진 모델은 없었습니다. 적어도 향후 6개월 동안은 o1이 여전히 우리의 첫 번째 선택이 될 것입니다.

도움이 되었나요?

기술 지원온라인 상담
侧栏
맨 위로
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR