Меню

Мы использовали GPT-4o, чтобы довести точность работы мультимодальной службы поддержки клиентов до 92%, но при этом столкнулись с тремя серьезными проблемами, которые принесли нам много хлопот.

В прошлом месяце наша техническая команда из трех человек, занимающаяся интернет-торговлей в Юго-Восточной Азии, работала три ночи подряд, чтобы перевести систему интеллектуального обслуживания клиентов с старой большой текстовой модели на GPT-4o. Изначально мы думали, что это будет всего лишь добавление функции распознавания изображений, но изменения, которые это принесло, оказались гораздо более значительными, чем мы ожидали, и мы столкнулись с множеством непредвиденных проблем.

Для тех, кто ещё не сталкивался с этим: что же такое GPT-4o?

Суть в том, что это мультимодальная генеративная модель от OpenAI, и самое существенное отличие от предыдущих версий заключается в...Однократный запуск может обрабатывать текст, изображения и аудио одновременно, без необходимости разделять запросы и вызывать разные модели.Без необходимости предварительной обработки формата вводных данных количество параметров интерфейса уменьшено почти на 60% по сравнению с комбинированными вызовами.

Почему мы должны его заменить именно в 2026 году?

Ранее наша система обслуживания клиентов могла обрабатывать только текстовые запросы. Когда пользователи отправляли фотографии поврежденных товаров или неправильно доставленных заказов, необходимо было сначала вручную преобразовывать эти фотографии в текстовые описания, а затем передавать их в модель для обработки. Во время акций с большими скидками именно этот этап приводил к задержкам в обработке почти на 20% всех заявок, а уровень жалоб пользователей удвоился. Мы также пробовали использовать схему, сочетающую модели распознавания изображений и текстового анализа, но точность такого подхода составляла всего 76%. Частота неправильных решений в рамках послепродажного обслуживания приводила к убыткам, превышающим стоимость самых моделей.

Три наиболее заметных преимущества после изменений полностью превзошли наши первоначальные ожидания.

Chart displaying global export goods data, highlighting key countries and trends.

  • Эффективность автоматической обработки послепродажных заявок увеличилась с 47% до 92%. Ранее два сотрудника службы поддержки, занимавшихся конвертацией изображений на текст, были переведены на более сложные задачи по решению клиентских жалоб. Это позволило сэкономить почти 1800 долларов в месяц на затратах на трудовые ресурсы.
  • Консультации пользователя на диалектном языке теперь могут быть обработаны непосредственно через модель, без использования отдельного интерфейса ASR (Automatic Speech Recognition). Большинство запросов обрабатываются менее чем за 15 миллисекунд, что в три раза увеличивает общую скорость ответов.
  • При обработке одного и того же запроса на послепродажное обслуживание с использованием изображений и текста потребление токенов сократилось на 32% по сравнению с отдельным вызовами моделей распознавания изображений и текста. В результате стоимость моделей в периоды пиковых акций оказалась даже ниже, чем раньше.

Не смотрите только на преимущества, эти 3 скрытых недостатка привели к реальным потерям, когда мы с ними столкнулись.

Первая проблема заключалась в том, что порог ограничения объема данных для мультимодальных запросов был значительно строже, чем для запросов в формате чистого текста. В первый же день после запуска проекта мы столкнулись с акцией по празднованию дня основания сайта на сайте в Юго-Восточной Азии: 17% запросов с изображениями привели к ошибке 429, и пользователи не получали ответов, что заставило их подумать, что служба поддержки прекратила свою работу. В результате в тот день появилось более 300 негативных отзывов. Впоследствии нам пришлось создать отдельную очередь для обработки запросов с изображениями, в которой в период пиков мы начали возвращать сообщение “Изображение получено, обработка ведется”, что позволило решить проблему.

Вторая проблема заключается в том, что точность распознавания текста на изображениях на языках, отличных от английского, значительно ниже, чем заявляется в рекламе. Мы столкнулись с случаем, когда пользователь прислал рукописный индонезийский заказ на доставку, и модель неправильно распознала три символа адреса, в результате чего пользователю был предложен неверный адрес для возврата или обмена товара. Это привело к потере почти 200 долларов на транспортных расходах. Теперь мы добавили дополнительный этап обработки в виде локального OCR-интерфейса для проверки результатов распознавания текста на изображениях на языках меньшинств, благодаря чему уровень ошибок снизился до приемлемого уровня.

Третья проблема заключается в том, что правила подсчета токенов для мультимодального вывода совершенно отличаются от правил для чистого текста, поэтому невозможно использовать предыдущие формулы для оценки затрат. В первую неделю после запуска мы не изменили пороговые значения предупреждений по бюджету, и стоимость работы за выходные превысила месячный бюджет на 40%; мы об этом узнали только после того, как финансовый отдел напомнил нам об этом.

Действительно ли стоит менять что-то сейчас? Мы разработали четкие критерии для принятия решения.

Ситуации, в которых вы можете действовать напрямую:

Smartphone displaying AI app with book on AI technology in background.

  • Ваш бизнес сам по себе требует одновременной обработки двух и более типов входных данных: текста, изображений и аудио.
  • Ранее уже использовались несколько моделей для совместной обработки данных в рамках мультимодальных подходов, но затраты на интеграцию были высокими, а точность результатов недостаточной.
  • Ваши пользователи в основном используют английский язык, или основными языками, для которых GPT-4o обеспечивает хорошую поддержку, являются такие языки, как...

Ситуации, когда у вас совершенно нет необходимости тратить деньги:

  • Ваш бизнес требует только обработки текстового формата, и предыдущая версия модели уже обеспечивала необходимый уровень точности.
  • Ваш бизнес в основном ориентирован на рынки с малым количеством носителей языка и включает в себя работу с большим количеством образцов рукописного текста на местных языках, а также распознавание диалектного речи.
  • Ваша команда не располагает дополнительными ресурсами для разработки мер по снижению уровня сложности системы и мониторинга затрат.

Два практических совета для команды, которая собирается начать работу

Во-первых, перед запуском системы необходимо тестировать её в режиме “теневого трафика” в течение 7 дней, не переключая сразу 100% запросов на новую систему. Одновременно отправляйте запросы реальных пользователей как на вашу старую систему, так и на GPT-4o, сравнивайте точность и затраты обеих систем, и только после того, как убедитесь, что результаты соответствуют ожиданиям, постепенно переключайте трафик на новую систему. Мы именно из-за того, что не сделали этого, понесли большие убытки.

Во-вторых, необходимо отдельно настроить бюджетные предупреждения для мультимодальных запросов, причем порог можно установить на уровне 120% от ожидаемых затрат, чтобы избежать перерасходов.

Часто задаваемые вопросы и ответы

Вопрос: Стоит ли ждать появления следующей версии модели, прежде чем делать замену?

Ответ: По крайней мере, в сценарии интеграции множественных модалитетов, текущий уровень зрелости GPT-4o уже достаточен для решения практических задач. До появления следующего поколения моделей пройдет как минимум год, поэтому нет смысла тратить сейчас средства на неопределенные обновления.

Вопрос: Каково соотношение цены и качества по сравнению с открытыми мультимодальными моделями?

Ответ: Если ваша команда способна самостоятельно настраивать и развертывать открытые исходные модели, и при этом требования к конфиденциальности данных высоки, то использование открытых моделей является более экономически выгодным вариантом. В противном случае стоимость использования GPT-4o значительно ниже, чем затраты на обслуживание собственных серверов.

Было ли это полезно?

Техническая поддержкаОнлайн-поддержка
侧栏
Наверх
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR