Menu

Nossa equipe conseguiu reduzir os custos de resolução de endereços em 62% com o GPT-3.5 e, ao mesmo tempo, resolvemos o problema de limitação de tráfego durante as grandes promoções.

No mês passado, durante a promoção do Black Friday, nossa equipe de três pessoas responsável pelo backend de logística de pequenos pacotes transfronteiriços na Holanda não passou a noite toda ao lado dos servidores, como de costume. No ano passado, nessa mesma época, a precisão do nosso modelo de correção de endereços desenvolvido internamente era inferior a 80%, e tínhamos que designar uma pessoa para monitorar os logs de erros 24 horas por dia. Apenas devido a endereços incorretos, a taxa de devolução de pacotes era de 11%.

Para quem nunca ouviu falar, vamos explicar em poucas palavras o que é o GPT-3.5:

É um grande modelo de linguagem lançado pela OpenAI em 2022, e a versão estável, que ainda está em iteração em 2026, suporta janelas de contexto de até 16 mil palavras. A velocidade de resposta para solicitações de saída estruturada não em fluxo é geralmente inferior a 200 ms, o que é mais do que suficiente para atender às necessidades de processamento semântico leve em ambientes online com alta concorrência.

Nós escolhemos essa solução para resolver o problema de resolução de endereços, e ela traz três benefícios concretos.

Stunning view of the Bosphorus Bridge and Istanbul cityscape, showcasing historic architecture.

  • Primeiro é a precisão imediata ao abrir a caixa: não é necessário rotular milhões de endereços de vários países para treinamento; usamos apenas 200 exemplos de endereços anormais históricos para o método few-shot, e a precisão de análise aumenta significativamente.98.7%A taxa de erros caiu diretamente para menos de 1%.
  • O segundo ponto é que o custo é muito menor do que o de desenvolvimento próprio: antes, a manutenção do nosso modelo próprio, mais 3 servidores GPU, custava 1200 euros por mês. Agora, ao usar o GPT-3.5 para processar 500.000 solicitações diárias, o custo mensal é de apenas 450 euros, o que representa uma redução direta de 62% nos custos.
  • O terceiro ponto é que a expansão da capacidade não requer nenhum esforço adicional por parte de nós: durante o Black Friday, o volume de solicitações aumentou em três vezes. Antes, nosso modelo próprio só conseguia suportar até 1,5 vezes o volume normal de tráfego antes de sofrer colapsos; desta vez, apenas solicitamos um aumento temporário no limite de uso ao OpenAI com antecedência, e não houve nenhum erro do tipo 429 durante todo o processo.

Não olhe apenas para os benefícios; nos primeiros 3 meses, cometemos mais erros do que tivemos lucros.

No início, simplesmente passávamos os campos de endereço originais para o modelo, e frequentemente ocorria o problema de endereços de vilarejos em pequenos países europeus serem reconhecidos como cidades nos Estados Unidos. Demoramos uma semana para descobrir que a regra de “priorizar a correspondência com o campo do país de destino incluído no pedido de logística” não estava definida no prompt padrão.

Outra vez, acionamos acidentalmente a saída em fluxo, o que fez com que o tempo de retorno de todos os resultados da análise aumentasse em três vezes. No pico, houve mais de vinte mil solicitações que expiraram devido a timeout. Demorou meio dia para descobrir que um colega esqueceu de reverter as alterações nos parâmetros.

O problema mais complicado foi com as contas: no início, não tínhamos um mecanismo para cortar os dados inseridos pelos usuários, então todos os comentários irrelevantes que eles incluíam ao preencher o endereço também eram enviados para o modelo. Como resultado, a conta do final do mês foi 30% mais alta do que o esperado. Mais tarde, adicionamos uma regra de corte que cortava os primeiros 100 caracteres dos dados inseridos, e a conta do segundo mês voltou ao normal.

No final das contas, o GPT-3.5 não é uma solução mágica para todos os problemas; aconselho você a não tentar misturar esses dois tipos de equipes de forma aleatória ou sem um bom planejamento.

Aerial photo capturing Kwai Tsing Container Terminals, showing vibrant shipping activity in Hong Kong.

Se a sua equipe precisa lidar com dados de alta privacidade, como registros médicos ou informações de pagamento, não use a versão pública do GPT-3.5, por mais barata e conveniente que seja. Você não pode se dar ao luxo de correr riscos de não conformidade com as regulamentações de proteção de dados.

Se sua necessidade é gerar documentos profissionais de dezenas de milhas de palavras ou realizar raciocínios lógicos complexos, escolha diretamente o GPT-4o ou o Claude 3. A precisão do GPT-3.5 nesses tipos de tarefas é bastante baixa, então economizar um pouco de dinheiro não vale a pena.

Por outro lado, se o que você precisa fazer é classificar a intenção dos usuários, corrigir textos curtos, extrair informações estruturadas ou realizar outras tarefas semânticas leves, e não há necessidade de um raciocínio extremamente avançado, o GPT-3.5 continuará sendo a escolha com o melhor custo-benefício até 2026, sem dúvida alguma.

3 dicas práticas para quem usa pela primeira vez, todas baseadas em erros que nós cometemos

  • Antes de lançar, execute o tráfego de teste por 7 dias: envie as solicitações tanto para sua solução atual quanto para o GPT-3.5, e compare apenas os resultados, sem distribuir o tráfego. Certifique-se de que a precisão e a velocidade estejam de acordo com as expectativas antes de fazer a substituição completa.
  • Adicione um filtro prévio a todos os dados de entrada: elimine todos os espaços em excesso, observações irrelevantes e caracteres especiais, o que pode economizar pelo menos 20% do consumo de tokens e também reduzir a probabilidade de erros no modelo.
  • É essencial ter um plano de contingência: no caso de o serviço da OpenAI ficar indisponível, você precisa ter uma solução alternativa de menor qualidade para garantir o funcionamento do sistema. Mesmo que a precisão seja menor, é melhor do que ter todo o serviço inutilizável.

FAQ

Já estamos em 2026, com tantos novos modelos disponíveis, ainda há necessidade de usar o GPT-3.5?
É completamente necessário para tarefas leves; comparamos modelos open-source de mesmo custo, e o GPT-3.5 tem uma precisão pelo menos 5 pontos percentuais maior. Além disso, não é necessário operá-lo ou implantá-lo você mesmo, o que acaba reduzindo o custo total.

Preciso me preocupar com o throttling quando fazer a chamada?
O tráfego diário, desde que não aumente repentinamente em mais de 10 vezes, geralmente é suficiente com a cota padrão. Para pedir um aumento da cota durante uma promoção, basta enviar uma solicitação 3 dias antes. Já pedimos o aumento 3 vezes, e a aprovação foi feita em até 2 horas.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR