Menu

Implantação de gateway de inferência de LLM em nível empresarial: Reduzimos os erros do tipo 429 de 13% para 0 e também economizamos 28% nos custos.

No mês passado, durante a promoção Black Friday, a nossa equipe de tecnologia de comércio eletrônico internacional em Cingapura ficou acordada por 36 horas seguidas na sala de monitoramento, trabalhando com três servidores de backend. No final, ficamos tão ansiosos que quase pulamos de alegria ao ver a curva de taxa de sucesso das solicitações subir drasticamente. No mesmo período do ano passado, tivemos problemas devido à limitação de tráfego por parte de um único fornecedor de LLM (Large Language Model).13% das solicitações para geração de descrições de produtos retornam o erro 429.O sistema de gestão do comerciante está fora de funcionamento há quase 4 horas, e já recebemos mais de 2000 queixas dos clientes.

Primeiro, vamos entender o que é um gateway de raciocínio de deploy empresarial.

Não é nenhum novo framework sofisticado; na verdade, é apenas uma camada de agendamento de tráfego que funciona entre os seus serviços de negócios e as interfaces dos vários LLMs (Large Language Models). Os parâmetros centrais são muito simples.Under normal load, the scheduling delay must not exceed 10 milliseconds.Se exceder, isso é como estar a atrasar o progresso dos negócios.

3 benefícios reais que resumimos após superarmos os desafios

Asian woman presenting a business infographic on global market trends in an office setting.

  • Primeiro, eliminamos completamente o risco de limitação de tráfego: agora estamos conectados simultaneamente a três dos principais fornecedores de LLMs (Large Language Models). O gateway distribui automaticamente as solicitações para o nó que tem a cota atualmente suficiente e responde mais rapidamente. O pico de QPS (Quantidade de Solicitações por Segundo) durante o Black Friday deste ano foi 2,3 vezes maior do que no ano passado, e não houve nenhum caso de erro tipo 429 (erro de serviço) em massa durante todo o processo.
  • Em segundo lugar, há uma redução significativa nos custos: geramos solicitações de rótulos de produtos de baixa prioridade e as roteamos automaticamente para modelos menores que oferecem uma melhor relação custo-benefício, sem a necessidade de alterar o código do negócio. Em apenas 7 dias, conseguimos economizar 28% nos custos com tokens.
  • Finalmente, isso economizou o trabalho de repetição no lado do backend: antes, toda vez que mudávamos de modelo ou adicionávamos um novo provedor de serviços, tínhamos que ajustar as interfaces de 3 módulos de negócios um por um. Agora, tudo é configurado no nível do gateway, e podemos resolver o problema em meia hora.

Não olhe apenas para os benefícios; esses 3 problemas nós realmente enfrentamos de perto.

Visual abstraction of neural networks in AI technology, featuring data flow and algorithms.

Nossa primeira semana de operação já teve um acidente: após ativar a função de fallback automático, o gateway direcionou um grupo de solicitações de conteúdo personalizado de alta prioridade que deveriam usar o GPT-4 para um modelo menor e de desempenho inferior, resultando em mais de 200 anúncios de lojistas não qualificados. Isso nos custou um pouco mais de dez mil cupons de promoção. Só mais tarde percebemos que nem todas as solicitações são adequadas para essa redução automática de qualidade, e que em cenários de alta sensibilidade é necessário adicionar regras de verificação de segurança adicionais.

Ainda há muitos problemas de custo que não foram mencionados: se o seu QPS (Quantidade de Pedidos por Segundo) for inferior a 10 por um longo período de tempo, os custos de servidor e manutenção do próprio gateway podem ser mais altos do que os pacotes de quantidades mais altas dos fornecedores de LLM (Large Language Models), então não há necessidade alguma de insistir nisso.

Além disso, não acreditem em promessas de “funcionalidades completas prontas para uso”. Testamos 3 gateways open-source, e as regras padrão de distribuição de tráfego simplesmente não se adequavam ao contexto do comércio eletrônico. Apenas ajustar as regras de peso levou dois dias inteiros.

Quem deve ir? Quem realmente não precisa desperdiçar tempo?

Diretamente para o critério de julgamento, sem enredar:

  • Qualquer uma das seguintes condições pode ser considerada: mais de 10.000 solicitações de LLM por dia, uso de mais de 2 modelos simultaneamente, ou requisitos de disponibilidade do serviço acima de 99,9%;
  • Se a sua equipe é uma pequena startup com menos de 5 pessoas, o negócio central não está fortemente vinculado ao uso de grandes modelos, e o custo mensal do LLM não é superior ao salário de um engenheiro de backend, não tente implementar uma solução de deploy empresarial. É mais vantajoso usar diretamente as interfaces nativas dos fornecedores de serviços.

2 dicas práticas para quem está começando

Não faça a mudança completa de uma vez; comece com 10% do tráfego de baixa prioridade por uma semana em modo de teste (grayscale). Concentre-se em dois indicadores: verifique se há solicitações sendo enviadas repetidamente e se o atraso causado pelo agendamento está realmente dentro dos limites aceitáveis. Nós começamos testando o tráfego de respostas automáticas pós-venda por 3 dias e só mudamos para os serviços principais depois de confirmar que não havia problemas.

Pergunta: Vale a pena montar um gateway do zero? Resposta: A menos que sua equipe tenha pessoas disponíveis e ociosas, é melhor usar uma versão open-source madura e adaptá-la, o que economiza pelo menos 2 meses em tempo e oferece maior estabilidade.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR