Menu

Usando o o1-mini para fazer previsões da cadeia de suprimentos: economizamos 62% dos custos de inferência, mas caímos em 2 armadilhas fatais.

No último Black Friday, nosso time quase falhou.
Anteriormente, usávamos grandes modelos para prever as necessidades de armazenamento e distribuição na região norte-americana, e durante o período de pico, por três dias consecutivos, mais de 18% das solicitações retornaram o código de erro 429. Como resultado, o plano de estoque da equipe operacional ficou desorganizado, fazendo com que os produtos mais vendidos em três estados fossem enviados com 48 horas de atraso.
A necessidade de trocar o modelo foi marcada diretamente como P0 na época; gastamos 7 dias testando 4 opções alternativas e, no final, escolhemos o o1-mini. Desde então, já se passaram 22 dias, e todos os problemas foram resolvidos. No entanto, também encontramos alguns obstáculos que ninguém havia mencionado com antecedência.

Para quem nunca ouviu falar: o que é exatamente o o1-mini?

É o modelo de inferência leve lançado pela OpenAI, que foi otimizado especificamente para acelerar o processamento de tarefas lógicas e computacionais.A capacidade de raciocínio básico difere em no máximo 8% em comparação com os grandes modelos principais, e o custo por token é apenas 1/7 do custo dos modelos principais.。
Nós começamos com o foco nessa diferença de custo, afinal, nossa tarefa de previsão requer a inserção de mais de 3000 tokens de pedidos históricos, dados meteorológicos e de feriados de uma só vez, e o sistema é executado quase 20.000 vezes por dia.

Os 3 benefícios mais óbvios, nós realmente conseguimos.

  • Primeiro, o problema de limitação de tráfego foi completamente resolvido: o limiar de limitação de conta para o o1-mini é 12 vezes maior do que o usado pelo modelo anterior, e nem mesmo no pico do Black Friday ocorreu nenhum erro de tipo 429; a saída de dados do lado operacional foi sem nenhum atraso.
  • Os custos foram reduzidos significativamente: de acordo com os dados dos nossos relatórios de contas, ao executar a mesma tarefa de previsão,O custo de raciocínio mensal caiu de 12.000 dólares para 4.500 dólares.Com o dinheiro economizado, adicionamos diretamente 3 pontos de dados em tempo real para os armazéns.
  • A velocidade é tão alta que permite ajustes em tempo real: os modelos anteriores levavam mais de 20 segundos para fazer uma previsão, enquanto agora a maioria das solicitações é concluída em menos de 15 milissegundos. Mudamos o sistema para atualizar os dados de previsão a cada 2 horas, em vez de uma vez por dia, o que resultou em uma redução direta de 4 pontos percentuais na taxa de falta de produtos.

Mas havia dois problemas, e quando os enfrentamos, quase tivemos que voltar ao estado anterior (reverter as alterações).

Abstract representation of a multimodal model with dots and lines on a white background.

O primeiro problema é que sua capacidade de processar dados não estruturados é extremamente fraca.
Em nossas entradas anteriores, havia algumas palavras-chave de discussão dos usuários em plataformas sociais, usadas como referência para as flutuações de demanda. No entanto, o o1-mini tratou esses dados como informações inválidas, e os dados de previsão gerados nos últimos 3 dias foram 20% menores do que a demanda real. Felizmente, temos um mecanismo de verificação cruzada, então não realizamos o pedido de estoque com base nessas previsões.
No final, só nos resta executar um pequeno modelo de análise de texto separadamente para processar essa parte de dados, convertê-los em pontuações estruturadas e então fornecê-las ao o1-mini, a fim de resolver o problema.

O segundo problema é que o seu processamento de múltiplas línguas tem vieses ocultos.
Nossas previsões para a região do Canadá contêm nomes de lugares e produtos em francês. O o1-mini, por padrão, mapeia algumas categorias em francês para categorias semelhantes em inglês, o que resultou em uma redução de 50% nos valores previstos para equipamentos de esqui na região de Quebec. Mais tarde, corrigimos esse problema adicionando uma regra que obriga a manutenção do idioma original nos prompts. Este problema não foi mencionado nem sequer em um único trecho dos documentos oficiais.

Quem deve usar e quem não deve usar, nós ajudamos a esclarecer isso para você.

Se você for como nós, fazendo o que fazemos...Raciocínio lógico, cálculos numéricos, decisões baseadas em regrasPara tarefas que exigem um alto nível de estruturação dos dados, custos significativos e concorrência, o o1-mini é praticamente a escolha óbvia sem muita deliberação.
Mas se o que você quer fazer é geração de conteúdo, compreensão multimodal ou processamento de múltiplas línguas complexas, então não tente usar isso; os resultados podem ser cheios de erros inesperados, e o custo de resolução desses problemas pode ser maior do que o dinheiro que você economizou.

2 dicas específicas para quem está começando

Primeiro, antes de lançar o produto, é necessário realizar pelo menos 7 dias de verificação paralela antes de começar a distribuir o tráfego oficialmente. Não é aconselhável mudar o canal de distribuição do tráfego de forma direta.
No início, queríamos economizar tempo e só testamos por 3 dias, o que por acaso não nos deu a chance de encontrar cenários que envolviam a entrada de texto em francês, o que poderia ter causado grandes problemas. Um ciclo de 7 dias geralmente cobre a maioria dos cenários marginais do seu negócio.

Em segundo lugar, não altere arbitrariamente seus parâmetros de temperatura.
No início, tentamos tornar o resultado mais flexível, ajustando a temperatura para 0,7. No entanto, os dados de previsão gerados apresentavam grandes flutuações, tornando-os inutilizáveis. Depois de ajustá-la de volta para o intervalo recomendado oficialmente, de 0,1 a 0,3, a situação se estabilizou. A função desse sistema é realizar raciocínios determinísticos; se você precisa de criatividade, é melhor usar modelos maiores diretamente.

Finalmente, uma pergunta que muitos fazem: devemos esperar pela próxima versão?
Pelo menos no cenário de previsão da cadeia de suprimentos, o o1-mini atual já é suficiente. Nós calculamos que, mesmo que a próxima versão seja 20% mais barata, não compensaria o custo de mão de obra e as falhas que estamos economizando agora. Quanto mais cedo o utilizarmos, mais cedo começaremos a ganhar.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR