Utilizamos o GPT-4o para aumentar a precisão do atendimento ao cliente multimodal para 92%, mas esses três problemas foram realmente dolorosos de resolver.
No mês passado, nosso pequeno time técnico de três pessoas responsável pelo comércio eletrônico transfronteiriço no Sudeste Asiático ficou acordado por três dias e noites para migrar o sistema de atendimento ao cliente inteligente de um modelo de texto antigo para o GPT-4o. Originalmente, pensávamos que seria apenas uma adição de uma função de reconhecimento de imagens, mas as mudanças foram muito maiores do que esperávamos, e também encontramos vários problemas inesperados.
Para quem nunca ouviu falar: o que é exatamente o GPT-4o?
Essencialmente, é um modelo de geração multimodal da OpenAI, e a principal diferença em relação às gerações anteriores é...Uma única rodada pode processar simultaneamente textos, imagens e áudio como tipos de entrada, sem a necessidade de dividir as solicitações para chamar modelos diferentes.Sem a necessidade de realizar nenhum processamento prévio no formato de entrada, os parâmetros da interface são quase 60% menores do que os necessários para chamadas combinadas.
Por que precisamos mudá-lo exatamente no ano de 2026?
Anteriormente, nosso sistema de atendimento ao cliente só conseguia processar consultas em texto. Quando os usuários enviavam fotos de produtos danificados ou entregues erradamente, era necessário converter essas fotos em descrições em texto manualmente antes de alimentá-las ao modelo. Durante as promoções, esse processo bloqueou quase 20% dos pedidos de suporte, e a taxa de reclamações dos usuários aumentou em dobro. Também tentamos uma solução que combinava um modelo de reconhecimento de imagens com um modelo de texto, mas a precisão era de apenas 76%. Os custos de reparos causados por erros de julgamento foram maiores do que o custo do próprio modelo.
Os três benefícios mais evidentes superaram completamente nossas expectativas iniciais.

- A taxa de automação no processamento de pedidos de pós-venda aumentou diretamente de 47% para 92%. Os dois funcionários de atendimento ao cliente que antes eram contratados temporariamente para transcrever imagens foram realocados para lidar com reclamações mais complexas, o que economizou quase 1800 dólares por mês em custos de mão de obra.
- As consultas de voz em dialeto enviadas pelos usuários não precisam mais passar por uma interface ASR (Automatic Speech Recognition) separada; elas podem ser diretamente enviadas para o modelo, que as reconhece e fornece uma resposta. A maioria dos pedidos é processada em menos de 15 milissegundos, o que significa que a velocidade geral de resposta aumentou em três vezes.
- Ao processar o mesmo pedido de pós-venda com imagem e texto, o consumo de tokens foi 32% menor do que o necessário para chamar separadamente os modelos de reconhecimento de imagem e texto. Isso significa que, durante os períodos de pico das promoções, o custo do modelo é ainda mais baixo do que antes.
Não se concentre apenas nos benefícios; esses 3 problemas ocultos causaram perdas reais quando os enfrentamos.
O primeiro problema é que o limiar de throttling para solicitações de entrada multimodal é muito mais rigoroso do que para solicitações de texto puro. No primeiro dia de lançamento, coincidiu com um evento de aniversário da loja no site da Ásia do Sudeste, e 17% das solicitações que continham imagens receberam um erro 429, o que fez com que os usuários não vissem nenhuma resposta e pensassem que o atendimento ao cliente havia desistido. Como resultado, houve mais de 300 avaliações negativas naquele dia. Mais tarde, tivemos que criar uma fila de espera separada para as solicitações com imagens, retornando uma mensagem de “A imagem foi recebida, estamos processando” durante os períodos de pico, o que resolveu o problema.
O segundo problema é que a precisão do reconhecimento de texto em imagens em línguas menores que o inglês não é tão alta quanto é promovido. Encontramos um caso em que um usuário enviou um rascunho de nota de entrega em indonésio, e o modelo errou em 3 caracteres de endereço, o que resultou em um endereço de devolução ou troca incorreto sendo fornecido ao usuário, causando uma perda de quase 200 dólares em custos de envio. Agora, adicionamos uma camada de interface OCR local para verificar o reconhecimento de imagens em línguas menores, o que reduziu a taxa de erros para um nível aceitável.
O terceiro problema é que as regras de contagem de tokens para a saída multimodal são completamente diferentes das do texto puro, o que impede o uso das fórmulas anteriores para estimar os custos. Na primeira semana em que o serviço foi lançado, não alteramos os valores de alerta do orçamento, e as despesas de um único fim de semana ultrapassaram 40% do orçamento mensal. Só percebemos isso quando o departamento financeiro nos enviou um aviso.
Devo mudar agora ou não? Nós elaboramos critérios claros para tomar a decisão.
Situações em que você pode agir diretamente:

- Seu próprio negócio precisa lidar simultaneamente com dois ou mais tipos de entradas, incluindo texto, imagens e áudio.
- Já estávamos utilizando a combinação de vários modelos para o processamento multimodal, mas o custo de integração é alto e a precisão não é suficiente.
- Seus usuários utilizam principalmente o inglês, ou as línguas principais são aquelas que o GPT-4o suporta de forma bastante completa.
Situações em que você realmente não precisa desperdiçar dinheiro:
- Seu negócio tem apenas necessidades de processamento de texto puro, e o modelo anterior já era capaz de atender aos requisitos de precisão.
- Seu negócio é voltado principalmente para mercados de línguas minoritárias, envolvendo a necessidade de reconhecimento de grandes quantidades de textos escritos à mão em línguas locais e sons de dialetos.
- Sua equipe não tem recursos extras para desenvolver estratégias de downgrade ou sistemas de monitoramento de custos.
2 dicas práticas para equipes que estão começando
Primeiro, antes de lançar o produto, execute o teste com tráfego simulado (shadow traffic) por 7 dias. Não direcione 100% das solicitações para o novo sistema imediatamente. Envie as solicitações dos usuários reais para tanto o seu sistema atual quanto para o GPT-4o, e compare a precisão e os custos de ambos. Somente após confirmar que os resultados atendem às expectativas, comece a transferir gradualmente o tráfego para o novo sistema. Foi por não seguirmos esse passo que sofremos grandes perdas.
Em segundo lugar, configure alertas de orçamento separadamente para solicitações multimodais, com um limiar definido como 120% do custo estimado, para evitar ultrapassagens de orçamento.
Perguntas frequentes
Pergunta: Devemos esperar até que o próximo modelo seja lançado para fazer a troca?
Pelo menos no cenário da integração multimodal, o nível de maturidade do GPT-4o já é suficiente para resolver problemas práticos. O próximo modelo levará pelo menos mais de um ano para ser desenvolvido, então não há necessidade de desperdiçar os custos que podem ser economizados agora em espera por atualizações incertas.
Pergunta: Qual é a relação de custo-benefício em comparação com os modelos multimodais open-source?
Se a sua equipe tiver a capacidade de ajustar e implantar modelos open-source por conta própria, e as exigências de privacidade dos dados forem altas, então os modelos open-source são mais vantajosos. Caso contrário, o custo de usar o GPT-4o é muito menor do que o custo de montar e operar seus próprios servidores.
Link do artigo:https://airai.cc/pt/ai-news/30/
Isso foi útil?