Após transferirmos o reconhecimento de endereços para o GPT-5, o erro 429 caiu de 13% para 0,2%, mas encontramos 2 problemas inesperados.
No mês passado, a grande promoção da Black Friday acabou de terminar, e nós, os três desenvolvedores de backend, ficamos de olho no painel de monitoramento por um total de 72 horas. No ano passado, durante a promoção, 13% das solicitações de resolução de endereços geraram o problema de limitação de taxa de resposta (429), o que foi um grande problema. Este ano, isso finalmente não aconteceu. A única alteração importante foi substituir todos os modelos gerais que estávamos usando por GPT-5 para o processamento estruturado dos endereços.
Para quem ainda não tentou: o que exatamente é o GPT-5 para cenários como o nosso?
É o grande modelo multimodal atualizado pela OpenAI este ano, e o único parâmetro que é mais útil para nós é o seguinte:O limite máximo de solicitações de processamento estruturado por conta por minuto é 12 vezes maior do que no modelo anterior.Além disso, a taxa de reconhecimento de entradas não padrão aumentou significativamente.
Nós trabalhamos com logística transfronteiriça na Europa e lidamos com 500.000 endereços fornecidos pelos usuários todos os dias. Muitas pessoas misturam ruas, códigos postais e cidades, e até adicionam emojis ou cometem erros de ortografia. Os modelos anteriores ou não reconheciam corretamente esses endereços ou precisavam chamar a interface três vezes para obter um resultado. Quando o tráfego aumenta durante as promoções, o sistema é imediatamente limitado em sua capacidade de processamento.
Após a transição para o GPT-5, os três benefícios reais que obtivemos foram...
O primeiro e mais óbvio: o problema do throttling é resolvido diretamente.Durante o pico da promoção, a taxa de erros 429 caiu para 0,2%.Nós nem precisamos adicionar uma fila de modelos de reserva, o que economiza 30% do tempo de operação e manutenção que antes era gasto com o balanceamento de carga.
O segundo ponto é o aumento da precisão no reconhecimento de endereços: antes, cerca de 8% dos endereços precisavam de verificação manual adicional, e agora essa proporção caiu para menos de 1%. Como resultado, a equipe de atendimento ao cliente precisa lidar com 2000 menos pedidos de correção de endereços por semana.
O terceiro recurso, no entanto, não foi muito mencionado: ele permite o upload direto de fotos de recibos manuscritos para reconhecimento, eliminando a necessidade de usar serviços de OCR separadamente para converter as imagens em texto. Isso economiza dois passos no processo, e a maioria das solicitações recebe resultados em menos de 15 milissegundos. Apenas em casos muito raros, quando as fotos estão desfocadas, o processo pode demorar um pouco mais.
Não olhe apenas para os benefícios; os dois problemas que encontramos, com alta probabilidade, vocês também vão enfrentar.

O primeiro problema é a inadequação na adaptação da ortografia dos dialetos das regiões de línguas menores. Pensávamos que a capacidade multilíngue do sistema fosse suficientemente forte, mas na semana passada a taxa de erro no reconhecimento de endereços em basco na Espanha subiu repentinamente para 12%. Ao investigar, descobrimos que havia poucos exemplos de endereços desses dialetos minoritários nos dados de treinamento. Agora, só nos resta adicionar regras locais como solução temporária para esse problema.
O segundo problema é o custo. Antes, calculamos que o custo do token por solicitação seria apenas 20% mais alto do que na geração anterior, mas esquecemos que o número de campos estruturados retornados por padrão havia aumentado em 3, o que levou a um aumento real no custo do token de 40%. Mais tarde, restringimos os campos retornados no prompt para apenas os 5 necessários, conseguindo reduzir o custo para um aumento de 10% em relação à geração anterior.
Quais equipes devem agir imediatamente e quais não precisam se envolver de forma alguma
- O que é necessário: Existem mais de 100.000 solicitações diárias de processamento estruturado de texto/imagens não padronizado. Equipes que já enfrentaram problemas de limitação de taxa de transferência de dados e baixa precisão devido aos modelos, como as de empresas de comércio eletrônico, logística e atendimento ao cliente de pequeno e médio porte, verão um retorno sobre o investimento (ROI) muito claro após a implementação desta solução.
- O que não deve ser usado: para equipes que apenas realizam perguntas e respostas simples, geração de conteúdo, ou que têm menos de 10.000 solicitações por dia, não há necessidade alguma de gastar esse dinheiro. O modelo anterior é suficiente e pode economizar bastante dinheiro.
Duas dicas específicas para quem está começando pela primeira vez
Primeiro, use os seus pedidos reais dos últimos 7 dias como um conjunto de teste. Não se limite apenas aos exemplos fornecidos oficialmente; especialmente no que diz respeito a conteúdos em línguas menores ou regiões menos populares, é essencial executar o teste primeiro para verificar a precisão. Caso contrário, descobrir erros após a lançamento do produto pode ser muito problemático.
Em segundo lugar, na primeira chamada, especifique diretamente nos campos de prompt os campos de retorno que você precisa. Não deixe que o sistema escolha aleatoriamente, pois o conteúdo gerado adicional pode consumir uma quantidade desnecessária de tokens.
Alguém perguntou: Ainda é necessário fazer fila para solicitar o uso do GPT-5 atualmente?
Somos contas de desenvolvedores empresariais; o prazo para aprovação após o envio dos documentos é de 3 dias. Para desenvolvedores individuais, pode levar de 1 a 2 semanas. No entanto, em casos de urgência, é possível utilizar o canal verde empresarial, que permite a ativação no mesmo dia.
Link do artigo:https://airai.cc/pt/ai-news/33/
Isso foi útil?