Menu

Utilizamos o GPT-4 Turbo para reduzir a taxa de erros nas solicitações da temporada promocional para 0,2%; evite cair nestes 3 erros comuns.

No mês passado, durante a promoção Black Friday, nosso pequeno time de três pessoas responsável pelo transporte transfronteiriço na Europa não teve que passar a noite toda trabalhando devido a pedidos de verificação de endereços dos clientes, como acontecia antes.

No mesmo período do ano passado, ainda estávamos usando o GPT-4 comum para a padronização de endereços. Durante os horários de pico, 13% das solicitações retornavam o erro 429, e somente o atendimento às reclamações dos clientes levou 36 horas. Este ano, mudamos para o GPT-4 Turbo, e não houve nenhuma ocasião de limitação de taxa de solicitações; a taxa de erros foi reduzida significativamente.0.2%。

Primeiro, vamos entender: o que é exatamente o GPT-4 Turbo?

Em resumo, é uma versão de OpenAI com maior taxa de transferência de dados, otimizada com base no GPT-4, e o ponto de ancoragem dos parâmetros principais é...A quantidade de solicitações suportadas por conta única por minuto é 6 vezes maior do que a do GPT-4 comum.O custo de cada token também foi reduzido pela metade, uma otimização feita especificamente para cenários de alta concorrência.

3 benefícios reais para equipes técnicas de pequeno e médio porte

A primeira coisa mais direta é não ter mais que se preocupar com o controle de tráfego (throttling). Temos uma média diária de 500.000 solicitações de resolução de endereços. Antes, tínhamos que usar três grandes modelos de diferentes plataformas para balancear o carga, e apenas para adaptar os gateways, escrevemos mais de 1.000 linhas de código. Agora, com apenas o GPT-4 Turbo, conseguimos suportar o tráfego pico três vezes maior durante as temporadas de promoção.

O segundo ponto é a alta eficiência no processamento de textos longos. Frequentemente precisamos inserir uma página inteira de documentos de declaração aduaneira transfronteiriça para extrair informações. Antes, o GPT-4 comum costumava dividir o processo em três solicitações devido à insuficiência do contexto, mas agora é possível processar tudo de uma só vez, reduzindo o tempo gasto em uma única tarefa em dois terços.

O terceiro ponto é que realmente economiza custos. Calculamos as contas do mês passado e vimos que, com a mesma quantidade de solicitações, o custo do GPT-4 Turbo foi apenas 28% do que o custo do antigo sistema de combinação de vários modelos. O dinheiro economizado foi usado para aumentar o salário da equipe por dois meses.

Não olhe apenas para os benefícios; esses 3 problemas nós já enfrentamos.

Blue and yellow shipping containers aligned on a sandy beach with the ocean and sky in the background.

O primeiro problema é que tarefas de baixa complexidade podem acabar não sendo rentáveis. No início, transferimos todos os pedidos de verificação de endereços para essas tarefas, mas descobrimos que, para tarefas simples como determinar se um endereço pertence à União Europeia, usar o GPT-4 Turbo custava três vezes mais do que usar um modelo mais leve. Agora, estamos redirecionando esses pedidos para modelos mais adequados.

O segundo problema é que o tempo de resposta padrão é um pouco maior do que o do GPT-4 comum. Quando mudamos para o novo sistema, percebemos que algumas solicitações demoravam mais de 200 milissegundos para serem atendidas. Mais tarde descobrimos que, no modo de alta taxa de transferência de dados, a prioridade é garantir que as solicitações não sejam rejeitadas, em vez de alcançar um delay mínimo absoluto. Para resolver esse problema, configuramos parâmetros de baixo delay especificamente para as solicitações de consulta do front-end que precisavam de resposta rápida.

O terceiro problema é que o controle de permissões em detalhes é menor. O GPT-4 comum permite personalizar parâmetros como a “temperatura” do modelo e o “top_p” em uma faixa muito precisa, mas a faixa de ajuste do GPT-4 Turbo foi muito reduzida. Para cenários que exigem um controle preciso do estilo de saída (como os textos de notificação de despacho aduaneiro que geramos para os clientes), ainda é necessário voltar para a versão comum.

Quem deve usar? Quem não precisa se envolver nessa agitação?

Se você for uma equipe pequena ou média e atender a essas três condições, aja diretamente:

  • Diariamente, há mais de 100.000 solicitações de alta concorrência de grandes modelos por dia.
  • Muitas vezes é necessário lidar com tarefas de texto longo que contêm mais de 8 mil contextos.
  • Antes, era comum realizar balanceamento de carga entre modelos devido a restrições de taxa de solicitações.

Se a quantidade de solicitações do seu time for inferior a 10 mil por dia, ou se todas as tarefas envolverem apenas classificação e extração de dados simples, não há necessidade alguma de trocar o modelo. Um modelo mais leve é suficiente e, além disso, custa menos.

2 dicas práticas para começar

Na primeira semana, não faça a migração completa. Primeiro, transfira 10% das solicitações de texto longo com alto tráfego para o novo sistema em modo de teste (grayscale), e analise os dados de monitoramento por uma semana antes de aumentar gradualmente a quantidade de solicitações. Naquela época, no primeiro dia, migramos 30% do tráfego e quase tivemos problemas com a extração de alguns documentos de despacho aduaneiro devido à inadequada configuração dos parâmetros.

Não é necessário preparar um contexto muito extenso com antecedência; o contexto de 128k do GPT-4 Turbo é suficiente para lidar com a maioria das situações empresariais. Testamos inserir um contrato de logística de 30 páginas inteiro para verificar as cláusulas, e a taxa de precisão não diferiu em nada em comparação com o processamento em blocos.

Duas perguntas que as pessoas costumam fazer

P: Será que a qualidade do output será pior do que a do GPT-4 comum?
A: Nós executamos um conjunto de testes com 1000 endereços e a taxa de acerto foi de 98,7%, o que é quase indistinguível dos 98,9% do GPT-4 comum. Isso é mais do que suficiente para cenários empresariais.

P: É necessário refazer o projeto Prompt?
A: Nós simplesmente reutilizamos todos os prompts que escrevemos anteriormente para o GPT-4 comum, sem fazer nenhuma alteração, e o resultado da saída foi exatamente o esperado.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR