Menu

Usamos o o3-mini para gerar 1,2 milhão de solicitações de descrição de produtos, economizando 62% dos custos de raciocínio.

No mês passado, antes do Black Friday, nosso serviço de geração de conteúdo quase falhou: o modelo geral que estávamos usando subiu de preço em 20% de repente, e ao mesmo tempo, o limiar de limitação de tráfego foi reduzido pela metade. Durante o pico dos testes, 17% das solicitações receberam o erro 429. A equipe de operações ficou pressionando para saber se as descrições dos 12.000 produtos com desconto que deveriam ser lançados naquele dia poderiam ser entregues a tempo. Com uma atitude de tentar, transferimos 30% do tráfego para o o3-mini, e no final não só conseguimos suportar todo o período promocional, como também os custos ficaram muito abaixo do esperado.

Primeiro, vamos esclarecer: o que é exatamente o o3-mini?

É o modelo de raciocínio leve lançado pela OpenAI em Q1 em 2026, que se concentra na geração de conteúdo estruturado e tarefas de raciocínio simples de baixa latência. A janela de contexto máxima é de 128k e a taxa de token é apenas 1 / 8 da GPT-4o.

Os 3 benefícios mais concretos que obtivemos

Red traffic light set against a bright, cloudy sky. Perfect for themes of travel, technology, and safety.

  • Durante o Black Friday, foram geradas 1,2 milhão de solicitações para a criação de descrições de produtos.O custo total de raciocínio diminuiu em 62% em comparação com o uso anterior do GPT-4o.Nenhum limite de taxa de solicitações foi acionado, nem mesmo durante o pico de pedidos uma hora antes do início da promoção; todos os pedidos foram atendidos.
  • A maioria das solicitações recebe resultados em menos de 18 milissegundos. Antes, com o uso de modelos maiores, ocasionalmente havia atrasos de algumas centenas de milissegundos. Nós eliminamos completamente os avisos de espera para o carregamento do conteúdo na parte frontal do aplicativo, e a taxa de conversão dos usuários aumentou em 0,8 pontos percentuais.
  • A capacidade de geração de conteúdo em vários idiomas integrada não requer nenhum ajuste adicional de nossa parte; a precisão da geração de descrições em português e espanhol para o site da América Latina aumentou em 21% em comparação com os modelos menores que ajustávamos manualmente antes. Isso elimina a necessidade de o time de operações gastar tempo com revisões adicionais.

Não se apresse em fazer a migração completa; já passamos por esses problemas.

A yellow traffic light showing red against a clear blue sky background.

Não use isso para fazer raciocínios complexos de lógica de recomendação de produtos. No início, tentamos alimentar o sistema com a sequência de navegação dos usuários para gerar textos de recomendação personalizados, e em 3 das 10 vezes ocorreram erros de associação, como por exemplo, recomendar barracas para uso ao ar livre junto com lanternas para acampamento. No final, decidimos remover essa parte do sistema e voltar a usar o modelo maior (o “grande modelo”).

Além disso, se o seu negócio precisar utilizar ferramentas, elas atualmente suportam apenas até 3 chamadas em paralelo. Se houver mais do que isso, algumas chamadas podem não ser executadas ou os parâmetros retornados podem estar incorretos. Já tivemos vários problemas com a exibição incorreta dos preços quando realizávamos mais de 2 consultas de estoque. Agora, se houver mais do que 2 chamadas a ferramenta, elas são automaticamente redirecionadas para um modelo geral mais abrangente.

Quem está adequado para usar isso, não precisa nem sequer cogitar em tocar nisso.

Se o seu cenário de negócios envolve a geração em massa de conteúdo estruturado, a identificação simples de intenções dos usuários ou a resposta a perguntas frequentes (FAQs), especialmente para pequenas e médias empresas que não dispõem de recursos computacionais suficientes para ajustar modelos de forma personalizada, o o3-mini é definitivamente a escolha mais econômica.

Mas se você precisar realizar depuração de código complexo, raciocínio lógico em várias etapas ou análise aprofundada de documentos extensos, é melhor escolher um modelo geral de grande porte. Nesse caso, a precisão do output do o3-mini diminui significativamente, e você terá que gastar mais tempo verificando os resultados.

2 dicas práticas para quem usa pela primeira vez

Abstract representation of a multimodal model with dots and lines on a white background.

Primeiro, realizaremos um teste de graduação do tráfego por 7 dias, sem fazer a mudança completa de uma só vez. No início, transferimos apenas as cenários relacionados às etiquetas de produtos não essenciais e testamos por 3 dias, para confirmar que a taxa de erros estava dentro dos limites aceitáveis. Somente depois disso começamos a transferir gradualmente para as cenários essenciais que envolvem as descrições dos produtos, a fim de evitar problemas que pudessem afetar os negócios online.

É possível criar uma camada de roteamento simples para classificar as solicitações de acordo com seu nível de complexidade: as solicitações mais simples são processadas pelo o3-mini, enquanto as mais complexas são automaticamente direcionadas para o modelo maior. Isso permite economizar custos sem afetar o desempenho em cenários mais exigentes. É exatamente o que estamos fazendo atualmente – 90% das solicitações são processadas pelo o3-mini e os 10% restantes, que são mais complexas, são encaminhadas para o modelo maior. Como resultado, o custo total foi reduzido em mais da metade.

Problemas comuns

Pergunta: Será necessário fazer algum ajuste fino (micro-tuning) no o3-mini? Resposta: Se o seu cenário envolve a geração de conteúdo geral, não é necessário de forma alguma; o efeito nativo já é suficiente. No entanto, se o cenário contém muitos termos específicos de uma determinada indústria, você pode fornecer algumas centenas de exemplos para realizar um micro-tuning. Após o ajuste, a precisão das descrições dos produtos de peças automotivas aumentou em 14%, e o custo aumentou apenas em 5%.

Pergunta: A segurança dos dados é garantida? Resposta: Por padrão, os modelos não são treinados com dados fornecidos pelos usuários. Se você tiver requisitos de conformidade, pode escolher uma instância exclusiva para implantação, o que custará 30% a mais, mas os dados serão completamente isolados, o que é adequado para o processamento de conteúdos relacionados à privacidade dos usuários.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR