Меню

Корпоративное развертывание гибких логических моделей (LLM) с использованием интеллектуальных шлюзов: мы снизили количество ошибок типа 429 с 13% до 0 и также сэкономили 28% затрат.

В прошлом месяце, во время акции Black Friday, три сотрудника нашей технической команды по интернет-торговле из Сингапура провели 36 часов в комнате мониторинга, не отходя от экранов. Концовка акции была настолько напряженной, что мы чуть не подпрыгнули от восторга, увидев кривую процента успешных запросов. В прошлом году в тот же период мы столкнулись с ограничениями со стороны одного из поставщиков сервисов LLM (Large Language Models), из-за которых возникли проблемы с обработкой запросов.13% запросов на генерацию описаний товаров возвращают ошибку 429.База данных магазина не работает уже почти 4 часа, и только жалоб от клиентов накопилось более 2000.

Сначала нужно понять: что такое корпоративное развертывание интеллектуальных решений на основе рассуждений (интеллектуальных гейтвейнов).

Это не какой-то сложный или новый фреймворк; по сути, это просто слой распределения трафика, находящийся между вашими бизнес-сервисами и интерфейсами различных ИИ-моделей (LLM – Large Language Models). Основные параметры этого слоя очень просты в использовании.При нормальной нагрузке задержка расписания не должна превышать 10 мс.Если это превышается, это равносильно тому, что мы тормозим развитие бизнеса.

Три реальных преимущества, которые мы получили после того, как преодолели все трудности:

Asian woman presenting a business infographic on global market trends in an office setting.

  • Во-первых, мы полностью устранили риск ограничений по объему запросов: сейчас мы сотрудничаем с тремя ведущими поставщиками сервисов на основе технологии LLM (Large Language Models). Гейтвейк автоматически распределяет запросы между узлами, у которых достаточно квот и которые отвечают быстрее всего. В пиковый период праздника Черная пятница объем запросов (QPS) увеличился в 2,3 раза по сравнению с прошлым годом, и ни разу не возникло ситуаций, когда система не справлялась с обработкой запросов (синдром 429).
  • Во-вторых, затраты снижаются наглядно: мы автоматически перенаправляем запросы на генерацию меток для товаров с низким приоритетом на более эффективные (с точки зрения соотношения цены и качества) малые модели, без необходимости изменения бизнес-кода. За 7 дней расходы на токены сократились на 28%.
  • В конце концов, это сокращает объем работы, связанной с повторными изменениями на серверной стороне: раньше при смене модели или добавлении нового поставщика услуг необходимо было отдельно настраивать интерфейсы в трех бизнес-модулях, а теперь все это делается на уровне шлюза (гейта), и всё решается за полдня.

Не смотрите только на преимущества, мы уже неоднократно сталкивались с этими тремя проблемами.

Visual abstraction of neural networks in AI technology, featuring data flow and algorithms.

В первую же неделю после запуска произошел инцидент: после включения функции автоматического переключения на резервный вариант обработки запросов, гейтвейк перенаправил ряд запросов с высоким приоритетом на более простые (менее эффективные) модели, предназначенные для работы с GPT-4. В результате более 200 рекламных текстов для продавцов оказались некачественными, и компания была вынуждена выплатить компенсацию в размере десяти тысяч юаней в виде рекламных купонов. Позже мы поняли, что не все запросы подходят для автоматического снижения уровня обработки; в критически важных ситуациях необходимо вводить дополнительные правила проверки.

Есть ещё много нерассмотренных вопросов, связанных с затратами: если ваш уровень обработки запросов в секунду (QPS) долгосрочно остаётся ниже 10, стоимость серверов и обслуживания самого гейта окажется выше, чем стоимость пакетов с более высокими лимитами услуг у поставщиков LLM (глубоких обучающих моделей), поэтому нет никакой необходимости настаивать на использовании этого решения.

Кроме того, не верьте тем утверждениям о том, что продукт является «полностью функциональным и готовым к использованию сразу после распаковки». Мы протестировали три open-source шлюза, и стандартные правила распределения трафика совершенно не подходят для электронной коммерции. Только на настройку правил распределения нагрузки ушло целых два дня.

Кто должен выступить? Кто вообще не теряет времени зря?

Прямо предоставьте критерии оценки, не теряйте времени на раздумья:

  • Для рассмотрения следующих условий достаточно, чтобы хотя бы одно из них было выполнено: ежедневное количество запросов к LLM превышало 10 000 раз, использовалось более двух моделей одновременно, и требования к доступности сервиса составляли более 99,9%.
  • Если ваша команда — это небольшая стартап-компания с менее чем пятью сотрудниками, ваш основной бизнес не тесно связан с использованием крупных моделей, и расходы на LLM за месяц не превышают зарплату одного инженера-программиста, то лучше не стоит заниматься корпоративным развертыванием. Просто используйте нативные интерфейсы поставщиков сервисов — это будет наиболее экономически выгодно.

Два практических совета для тех, кто впервые берется за это дело

Не начинайте полную переключение сразу – сначала запустите градационную версию системы с 10% трафика низкого приоритета в течение недели. Особое внимание уделите двум показателям: не происходит ли повторного отправления запросов, и находится ли задержка, вызванная распределением работы, в приемлемых пределах. Мы сначала тестировали систему на трафике автоматических ответов после продаж в течение 3 дней, и только после того, как убедились, что нет проблем, переключили ее на основной бизнес.

Вопрос: Стоит ли создавать собственный гейтвейт с нуля? Ответ: Если у вашей команды нет специально выделенных сотрудников, у которых есть свободное время, то использование готовых открытых исходных кодов сэкономит как минимум два месяца времени и обеспечит большую стабильность работы системы.

Было ли это полезно?

Техническая поддержкаОнлайн-поддержка
侧栏
Наверх
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR