o1-mini를 사용하여 공급망 예측을 실행했습니다: 추론 비용을 62% 절감했지만, 두 개의 치명적인 문제에 부딪혔습니다.
지난달 블랙프라이데이에 우리 팀이 거의 망했어요.
이전에는 대형 모델을 사용하여 북미 지역의 창고 배송 수요 예측을 진행했는데, 피크 기간 동안 3일 연속으로 18% 이상의 요청이 429 오류로 직접 반환되었습니다. 그 결과 운영 측의 재고 계획이 엉망이 되어 3개 주의 베스트셀러 제품이 48시간 지연되어 배송되었습니다.
모델을 교체해야 한다는 요구가 있었을 때 바로 P0을 선택했고, 7일 동안 4개의 대안 모델을 테스트한 끝에 o1-mini를 최종적으로 선택했습니다. 그 후 22일이 지났고, 모든 문제가 해결되었지만 예상치 못한 문제들도 겪었습니다.
먼저 들어보지 못한 분들께 설명드리자면, o1-mini란 무엇인가요?
OpenAI가 출시한 경량 추론 모델로, 논리적이고 계산적인 작업의 처리 속도를 특별히 최적화했습니다.기본 추론 능력은 주력 대형 모델에 비해 8% 이내의 차이가 있으며, 개별 토큰의 비용은 주력 모델의 1/7에 불과합니다.。
우리는 처음부터 이 비용 차이를 염두에 두고 시작했습니다. 결국 우리의 예측 작업에는 3000개가 넘는 토큰의 과거 주문 데이터, 날씨 정보, 공휴일 데이터가 필요하며, 이 데이터를 매일 거의 2만 번이나 처리해야 합니다.
가장 직관적인 3가지 이점은 우리가 실제로 얻은 것들입니다.
- 먼저, 제한률 문제가 완전히 해결되었습니다. o1-mini의 단일 계정 제한률 임계값은 이전에 사용했던 모델의 12배이며, 블랙프라이데이 당일에 피크 사용량이 발생했음에도 불구하고 429 오류가 단 한 번도 발생하지 않았습니다. 운영 측의 계획은 0 지연으로 실행되었습니다.
- 비용이 크게 절감되었습니다: 저희 백엔드의 청구 데이터에 따르면, 동일한 예측 작업을 수행할 때 비용이 많이 줄었습니다.한 달 동안의 추론 비용이 12,000달러에서 4,500달러로 감소했습니다.,절약한 돈으로 우리는 실시간 데이터 포인트가 3개 더 추가되었습니다.
- 속도가 매우 빠르서 실시간으로 조정이 가능합니다: 이전 모델은 예측을 한 번 실행하는 데 20초 이상 걸렸지만, 이제 대부분의 요청이 15밀리초 이내에 완료됩니다. 우리는 예측 데이터를 이전의 하루에 한 번 업데이트하는 방식에서 2시간마다 업데이트하는 방식으로 변경했으며, 그 결과 재고 부족률이 4퍼센트 포인트나 감소했습니다.
하지만 두 가지 문제가 있었고, 우리가 그 문제들을 처리하다가 거의 바로 시스템을 이전 상태로 되돌려야 할 뻔했습니다.

첫 번째 문제점은 비구조화된 데이터를 처리하는 능력이 매우 떨어진다는 것입니다.
우리 이전의 입력 데이터에는 소셜 플랫폼에서 사용자들이 논의하는 키워드들이 섞여 있었는데, 이를 수요 변동의 참고 자료로 사용하려고 했습니다. 그런데 o1-mini는 이러한 내용들을 모두 무효한 정보로 간주했고, 그 결과 지난 3일 동안 예측된 데이터가 실제 수요보다 20% 낮았습니다. 다행히도 우리에게는 교차 검증 메커니즘이 있어서 실제로 재고를 준비하지는 않았습니다.
마지막으로 우리는 작은 텍스트 분석 모델을 별도로 실행하여 이 데이터를 먼저 처리해야 합니다. 처리된 데이터를 구조화된 점수로 변환한 후에 o1-mini에 입력해야 문제가 해결됩니다.
두 번째 문제점은 그 제품의 다국어 처리에 숨겨진 편향이 있다는 것입니다.
캐나다 지역의 예측 데이터에는 프랑스어로 된 지명과 상품명이 포함되어 있었습니다. o1-mini는 기본적으로 일부 프랑스어 카테고리를 영어의 유사한 카테고리로 자동으로 매핑하는데, 이로 인해 퀘벡 지역의 스키 장비 예측값이 절반으로 줄어들었습니다. 이 문제를 해결하기 위해 프롬프트에 원어 표기를 강제로 유지하는 규칙을 추가했습니다. 하지만 공식 문서에서는 이 문제에 대해 전혀 언급하지 않고 있습니다.
누가 사용해야 하고 누가 사용해서는 안 되는지, 우리가 이미 구분해 놓았습니다.
만약 당신도 우리와 같이 일을 한다면,논리적 추론, 수치 계산, 규칙 기반의 의사결정json { "task": "The task requires high-level processing of structured data, with significant demands on both cost and concurrent performance. In this case, the o1-mini solution can be considered a reliable choice without much consideration." }
하지만 만약 당신이 해야 할 일이 콘텐츠 생성, 다중 모달 이해, 복잡한 다국어 처리라면, 그건 피하는 게 좋습니다. 그런 작업을 하면 예상치 못한 오류가 많이 발생할 수 있고, 문제를 해결하는 데 드는 비용이 절약한 돈보다 더 많을 수 있습니다.
처음 사용하는 분들을 위한 2가지 구체적인 조언
첫째, 서비스를 온라인에 출시하기 전에 반드시 최소 7일간 병렬 검증을 실시해야 하며, 트래픽을 바로 전환해서는 안 됩니다.
처음에는 일을 간단히 하려고 3일만만에 프로젝트를 진행했는데, 우연히 프랑스어 입력이 필요한 상황에 부딪혀서 큰 문제가 날 뻔했습니다. 7일의 주기면 여러분의 비즈니스에서 발생할 수 있는 대부분의 예외적인 상황을 커버할 수 있을 것입니다.
둘째, 온도 설정 값을 함부로 변경하지 마세요.
처음에는 결과를 더 유연하게 만들기 위해 온도를 0.7로 설정했지만, 예측 데이터의 변동이 너무 심해서 사용할 수 없었습니다. 그래서 공식적으로 추천하는 0.1-0.3 범위로 다시 조정한 후에야 안정적이 되었습니다. 이 모델의 역할은 확정적인 추론을 하는 것이기 때문에, 창의성이 필요하다면 그냥 대형 모델을 사용하는 것이 더 나을 것입니다.
마지막으로 자주 묻는 질문에 대해 말씀드리겠습니다: 다음 버전이 나올 때까지 기다려야 할까요?
적어도 공급망 예측과 같은 시나리오에서는 현재의 o1-mini가 충분히 사용할 수 있습니다. 우리가 계산해보니, 다음 세대 제품이 20% 더 저렴해진다고 해도 지금 절약하는 인력 비용과 장애 발생 비용을 상쇄할 수 없습니다. 일찍 사용하면 일찍 이익을 얻을 수 있습니다.
도움이 되었나요?