В Юго-Восточной Азии свежие товары электронной коммерции используют Claude для проверки качества заказов, экономя 3 должности обслуживания клиентов, но ступать на 2 смертельные ямы
На прошлой неделе наша команда справилась с неожиданным инцидентом: 18% заказов на послепродажу в день рекламы были прямо застряли в очереди для обработки из-за ошибочного формата вывода Клода, а оплата свежих плохих фруктов, запрошенных пользователями, затянулась на 4 часа, прежде чем откликнулась, и процент отмены заказов в тот день увеличился на 2 процентных пункта.
Сначала расскажите людям, которые не были связаны: что такое Клод?
Это большая языковая модель, разработанная Anthropic, в настоящее время последняя версия 3.5 Sonnet может загрузить 200k токенов, около 150 000 китайских слов, мы выбрали его из-за того, что он может загружать полный поток заказов, результаты OCR пользовательской демонстрации и правила оплаты платформы за один раз, без разделения на несколько раундов запросов.
Три реальных преимущества, которые мы получаем от этого.

Наиболее непосредственным является снижение затрат на рабочую силу: из шести сотрудников службы обслуживания клиентов, которые раньше отвечали за проверку качества заказов, теперь нужно оставить только три, чтобы справиться с аномалиями, что позволяет сэкономить 4200 долларов в месяц на затратах на рабочую силу.
Во-вторых, скорость обработки улучшилась: ранее на рассмотрение запроса вручную занималось в среднем 2 минуты, а теперь большинство запросов выполняются в течение 15 мс, результаты могут быть получены в течение 5 секунд после подачи запроса на компенсацию, и удовлетворенность пользователей увеличилась на 17%.
В-третьих, это более унифицированное применение правил: ранее ручной проверки часто встречались те же плохие результаты, кто-то получал полную компенсацию, кто-то получал только 30% компенсации, пользователи жаловались на несправедливое наказание десятки случаев в месяц, после применения единого правила питания Клода, такие жалобы прямо сократились до менее чем трех в месяц.
Не смотреть только на хорошие вещи. Мы почти остановились на этих двух ямах.
Первая - это яма для ограничения потока: официальный API, с которым мы начали напрямую связываться, не делали многоуровневого снижения, объем запросов в тот день увеличился в три раза, официальный непосредственно возвращал 429, и мы не сделали механизм триггера вручную, в результате тысячи заказов напрямую застряли.Позже мы добавили малую модель с тем же эффектом в качестве плана снижения уровня, если запрос неудачно 3 раза подряд, автоматически перерезать на малую модель, а затем перейти вручную, теперь больше не возникает ситуации с пакетной карточкой.
Второй - это яма с нестабильностью вывода: сначала мы попросили его вернуть штраф в формате JSON, и примерно в 2% случаев он добавлял множество объяснительных слов вне JSON, что привело к тому, что наш сценарий анализа непосредственно выводил ошибку.Позже мы добавили в конце запроса «Если ваш вывод не является чистым JSON, вы будете закрыты», и частота возникновения этой проблемы снизилась до уровня ниже 0,1%.
Кто подходит для использования?Кого не трогать?

Если ваша команда обычно занимается многочисленными повторяющимися работами с четкими правилами и большим объемом текста, такими как проверка заказов в электронной коммерции, классификация заказов на обслуживание клиентов, предварительная проверка условий контрактов, и готова потратить 1 - 2 недели на настройку prompt и механизм снижения уровня, Claude может сэкономить вам много денег и времени.
Если у вас сценарий, требующий 100% точности результатов, например, медицинская диагностика, финансовая проверка, или у вашей команды нет специалистов по эксплуатации / разработчикам, и вы хотите использовать нулевую отладку, не трогайтесь, вероятность ошибки гораздо выше, чем вы думаете.
Два практических рекомендации для тех, кто впервые использует
Во-первых, не сразу на производство, сначала запустить 7-дневный режим тени: все запросы одновременно вручную и Claude, сравнить результаты обоих согласованности, когда согласованность стабилизируется более чем на 95%, а затем сократить трафик, мы запустили 10-дневную тени, обнаружили отклонения в понимании трех правил, изменили prompt заранее, чтобы не было проблем.
Во-вторых, не загружайте все запросы в наиболее подходящую версию, не используйте Sonnet, если вы можете использовать сценарий Haiku: позже мы перевели простые запросы на классификацию заказов на Haiku, и стоимость токенов снизилась на 60%, вдвое быстрее, и это неплохо.
Часто задаваемые вопросы
- Есть ли проблемы с утечкой данных?Если ваши данные являются конфиденциальными, покупайте корпоративную версию и подпишите соглашение об обработке данных, Anthropic не будет брать корпоративную версию запроса данных для обучения модели, и мы не имели проблем с данными в течение восьми месяцев.
- Что лучше, чем GPT?Если вы хотите работать с длинным текстом и понимать контекст, выберите Claude; если вы хотите создать мультимодальную генерацию, например, рисунок, выберите GPT, мы используем обе эти сцены, каждая из которых выполняет разные сцены.
Ссылка на статью:https://airai.cc/ru/ai-news/40/
Было ли это полезно?