Nossa equipe conseguiu reduzir os custos de resolução de endereços em 62% com o GPT-3.5 e, ao mesmo tempo, resolvemos o problema de limitação de tráfego durante as grandes promoções.
No mês passado, durante a promoção do Black Friday, nossa equipe de três pessoas responsável pelo backend de logística de pequenos pacotes transfronteiriços na Holanda não passou a noite toda ao lado dos servidores, como de costume. No ano passado, nessa mesma época, a precisão do nosso modelo de correção de endereços desenvolvido internamente era inferior a 80%, e tínhamos que designar uma pessoa para monitorar os logs de erros 24 horas por dia. Apenas devido a endereços incorretos, a taxa de devolução de pacotes era de 11%.
Para quem nunca ouviu falar, vamos explicar em poucas palavras o que é o GPT-3.5:
É um grande modelo de linguagem lançado pela OpenAI em 2022, e a versão estável, que ainda está em iteração em 2026, suporta janelas de contexto de até 16 mil palavras. A velocidade de resposta para solicitações de saída estruturada não em fluxo é geralmente inferior a 200 ms, o que é mais do que suficiente para atender às necessidades de processamento semântico leve em ambientes online com alta concorrência.
Nós escolhemos essa solução para resolver o problema de resolução de endereços, e ela traz três benefícios concretos.

- Primeiro é a precisão imediata ao abrir a caixa: não é necessário rotular milhões de endereços de vários países para treinamento; usamos apenas 200 exemplos de endereços anormais históricos para o método few-shot, e a precisão de análise aumenta significativamente.98.7%A taxa de erros caiu diretamente para menos de 1%.
- O segundo ponto é que o custo é muito menor do que o de desenvolvimento próprio: antes, a manutenção do nosso modelo próprio, mais 3 servidores GPU, custava 1200 euros por mês. Agora, ao usar o GPT-3.5 para processar 500.000 solicitações diárias, o custo mensal é de apenas 450 euros, o que representa uma redução direta de 62% nos custos.
- O terceiro ponto é que a expansão da capacidade não requer nenhum esforço adicional por parte de nós: durante o Black Friday, o volume de solicitações aumentou em três vezes. Antes, nosso modelo próprio só conseguia suportar até 1,5 vezes o volume normal de tráfego antes de sofrer colapsos; desta vez, apenas solicitamos um aumento temporário no limite de uso ao OpenAI com antecedência, e não houve nenhum erro do tipo 429 durante todo o processo.
Não olhe apenas para os benefícios; nos primeiros 3 meses, cometemos mais erros do que tivemos lucros.
No início, simplesmente passávamos os campos de endereço originais para o modelo, e frequentemente ocorria o problema de endereços de vilarejos em pequenos países europeus serem reconhecidos como cidades nos Estados Unidos. Demoramos uma semana para descobrir que a regra de “priorizar a correspondência com o campo do país de destino incluído no pedido de logística” não estava definida no prompt padrão.
Outra vez, acionamos acidentalmente a saída em fluxo, o que fez com que o tempo de retorno de todos os resultados da análise aumentasse em três vezes. No pico, houve mais de vinte mil solicitações que expiraram devido a timeout. Demorou meio dia para descobrir que um colega esqueceu de reverter as alterações nos parâmetros.
O problema mais complicado foi com as contas: no início, não tínhamos um mecanismo para cortar os dados inseridos pelos usuários, então todos os comentários irrelevantes que eles incluíam ao preencher o endereço também eram enviados para o modelo. Como resultado, a conta do final do mês foi 30% mais alta do que o esperado. Mais tarde, adicionamos uma regra de corte que cortava os primeiros 100 caracteres dos dados inseridos, e a conta do segundo mês voltou ao normal.
No final das contas, o GPT-3.5 não é uma solução mágica para todos os problemas; aconselho você a não tentar misturar esses dois tipos de equipes de forma aleatória ou sem um bom planejamento.

Se a sua equipe precisa lidar com dados de alta privacidade, como registros médicos ou informações de pagamento, não use a versão pública do GPT-3.5, por mais barata e conveniente que seja. Você não pode se dar ao luxo de correr riscos de não conformidade com as regulamentações de proteção de dados.
Se sua necessidade é gerar documentos profissionais de dezenas de milhas de palavras ou realizar raciocínios lógicos complexos, escolha diretamente o GPT-4o ou o Claude 3. A precisão do GPT-3.5 nesses tipos de tarefas é bastante baixa, então economizar um pouco de dinheiro não vale a pena.
Por outro lado, se o que você precisa fazer é classificar a intenção dos usuários, corrigir textos curtos, extrair informações estruturadas ou realizar outras tarefas semânticas leves, e não há necessidade de um raciocínio extremamente avançado, o GPT-3.5 continuará sendo a escolha com o melhor custo-benefício até 2026, sem dúvida alguma.
3 dicas práticas para quem usa pela primeira vez, todas baseadas em erros que nós cometemos
- Antes de lançar, execute o tráfego de teste por 7 dias: envie as solicitações tanto para sua solução atual quanto para o GPT-3.5, e compare apenas os resultados, sem distribuir o tráfego. Certifique-se de que a precisão e a velocidade estejam de acordo com as expectativas antes de fazer a substituição completa.
- Adicione um filtro prévio a todos os dados de entrada: elimine todos os espaços em excesso, observações irrelevantes e caracteres especiais, o que pode economizar pelo menos 20% do consumo de tokens e também reduzir a probabilidade de erros no modelo.
- É essencial ter um plano de contingência: no caso de o serviço da OpenAI ficar indisponível, você precisa ter uma solução alternativa de menor qualidade para garantir o funcionamento do sistema. Mesmo que a precisão seja menor, é melhor do que ter todo o serviço inutilizável.
FAQ
Já estamos em 2026, com tantos novos modelos disponíveis, ainda há necessidade de usar o GPT-3.5?
É completamente necessário para tarefas leves; comparamos modelos open-source de mesmo custo, e o GPT-3.5 tem uma precisão pelo menos 5 pontos percentuais maior. Além disso, não é necessário operá-lo ou implantá-lo você mesmo, o que acaba reduzindo o custo total.
Preciso me preocupar com o throttling quando fazer a chamada?
O tráfego diário, desde que não aumente repentinamente em mais de 10 vezes, geralmente é suficiente com a cota padrão. Para pedir um aumento da cota durante uma promoção, basta enviar uma solicitação 3 dias antes. Já pedimos o aumento 3 vezes, e a aprovação foi feita em até 2 horas.
Link do artigo:https://airai.cc/pt/ai-news/32/
Isso foi útil?