Меню

Мы в три раза повысили эффективность обработки заказов клиентов с помощью Claude 3, но наступили на две ямы, которые не следует наступить

На прошлой неделе, когда черная пятница закончилась, три разработчики нашей команды SaaS электронной коммерции в Юго-Восточной Азии смотрели на фоновые данные полдень: в предыдущих годах для всей группы обслуживания клиентов потребовалось три дня, чтобы обработать послепродажные заказы, в этом году большинство были обработаны автоматически, и количество жалоб клиентов упало на 42%.Основное изменение - замена логики семантического распознавания заказчиков на Claude 3 Opus

Сначала скажите правду тем, кто не был в контакте.

Это третье поколение большой языковой модели, выпущенной Anthropic в 2024 году, мы действительно использовали основные параметры привязки очень просто: 200k контекстного окна для обработки послепродажных заказов с тремя скриншотами товаров, точность на 18% выше, чем предыдущая модель уровня параметров.

Для такой маленькой команды, как мы, три выигрыша - это настоящие деньги.

Abstract black and white graphic featuring a multimodal model pattern with various shapes.

Во-первых, больше не нужно проводить отдельную мультимодальную предварительную обработку.Ранее пользователи загружали поврежденную товарную карту, скриншоты логистики, мы должны сначала соединить модель OCR для текста, а затем составить вместе с текстовым заказом для кормления большой модели, только обслуживание этого набора ссылок занимает половину энергии задней части.После замены Claude 3, когда изображения и текст передаются непосредственно, случаев выявления ошибок реже.

Во-вторых, уровень отказов настолько низкий, что практически ничтожно.Предыдущие модели столкнулись с заказами, написанными пользователями слишком беспорядочно (например, наполовину английского, наполовину местного языка, со смешанными веб-сокращениями), часто возвращались непосредственно, не узнаваемыми, и приходилось переходить вручную.Мы подсчитали, что в то время доля переработанных работников составляла 27%, а сейчас эта цифра составляет 4%.

В-третьих, стоимость звонков намного ниже, чем мы ожидали.Мы платили за фактическое использование, и в день «черных пяти» мы обрабатывали в среднем 12 000 заказов на работу в день, что стоило менее 800 долларов США, что на 90% меньше, чем нанять 10 временных сотрудников по обслуживанию клиентов.

Но не спеши, две ямы, которые мы наступили, достаточно, чтобы ты проработал неделю.

Первая яма - это вопрос о многоязычном выравнивании.Половина наших пользователей говорят на индонезийском языке, и они сразу же выходят в интернет без тонкой настройки, и в результате, когда они сталкиваются с местным сленгом, модель часто идентифицирует «неправильный цвет товара» как «пользователь хочет изменить адрес доставки», и 17 жалоб клиентов в неделю.Затем мы направили 3000 записей на местном языке, и проблема была решена.

Вторая яма - это пропуск информации в длинном контексте.Если к заказу приложены более пяти изображений, модель иногда упускает информацию о том, что в середине, например, пользователь сделал две картины поврежденной упаковки и поврежденного товара, и она выявила только проблемы с упаковкой.Позже мы добавили простое правило проверки: если изображения превышают три, то модели должны выводить результаты идентификации по каждой из них, а затем суммировать их, чтобы больше не было ошибок.

Но, честно говоря, не все команды подходят.

Abstract representation of a multimodal model with dots and lines on a white background.

В ситуациях, когда вы должны использовать:

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

  • Ваш бизнес нуждается в одновременной обработке текста и изображений / коротких аудиовидеров, не хотите иметь несколько моделей ссылок
  • Вы требуете высокой точности вывода, например, в случае дорогостоящих ошибок, таких как обработка заказов на работу и проверка контрактов.
  • Ваша команда не располагает достаточными ресурсами для поддержания сложной предварительной обработки модели.

Не тратьте деньги:

  • Вам просто нужно выполнять легкие задачи, такие как ответы на ключевые слова, создание маркетинговых копий, достаточно дешевых малых моделей.
  • Ваши бизнес-данные имеют строгие требования к локализации хранилища данных, поэтому они не могут быть переданы на сторонние интерфейсы модели.
  • У вас небольшой объем запросов, менее 1000 в месяц, и затраты на разработку больше, чем выгоды.

Два практических совета для тех, кто впервые занимается.

Первая из них - это семь дней от краевой сцены до основного ссылки.Сначала мы использовали исторические заказы за последние три месяца для проведения офлайн-тестов, точность более 95%, прежде чем мы сократили 10% онлайн-трафика, медленно увеличились до полного объема, не имея больших инцидентов в Интернете.

Во-вторых, не стоит выбирать самую дорогую версию Opus.Мы проверили, что при обработке обычных запросов на консультации без изображений версия Sonnet была менее точной на 2% по сравнению с версией Opus, а стоимость была вдвое меньше, что достаточно.

В заключение я хотел бы задать вопрос: стоит ли ждать следующего поколения?Наш ответ заключается в том, что если ваш бизнес уже застрял в эффективности из-за мультимодальной обработки и недостаточной точности, то сейчас это идеально, потому что экономия на рабочей силе будет гораздо выше, чем в то время, когда модель следующего поколения снизится.

Было ли это полезно?

Техническая поддержкаОнлайн-поддержка
侧栏
Наверх
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR