Мы смогли снизить ошибочность запросов во время сезона распродаж с помощью GPT-4 Turbo до 0,2%. Избегайте этих трех ошибок, чтобы не повторить их.
В прошлом месяце, во время акции Black Friday, наш небольшой команды из трех человек, занимающийся европейскими трансграничными логистическими перевозками, впервые не столкнулся с проблемами, связанными с проверкой адресов клиентов, которые заставили всех нас работать всю ночь.
В прошлом году мы использовали обычный GPT-4 для стандартизации адресов, и в периоды пиков 13% запросов возвращали ошибку 429; на обработку жалоб клиентов ушло 36 часов. В этом году мы перешли на GPT-4 Turbo, и за весь период не было ни одного случая ограничения пропускной способности системы; уровень ошибок снизился до нуля.0.2%。
Сначала давайте разберемся: что же такое GPT-4 Turbo?
Проще говоря, OpenAI создал улучшенную версию GPT-4 с более высокой пропускной способностью; ключевым параметром этой версии является…Количество запросов, которые один аккаунт может обрабатывать в минуту, в 6 раз превышает показатель обычного GPT-4.Кроме того, стоимость одного токена снизилась вдвое, что является оптимизацией, специально разработанной для сценариев с высокой конкурентностью.
Три реальных преимущества для небольших и средних технических команд
Первое и самое очевидное преимущество – это отсутствие необходимости беспокоиться о проблемах с лимитированием трафика. У нас ежедневно происходит около 500 тысяч запросов на разрешение адресов. Раньше для обеспечения равномерного распределения нагрузки использовались три разных больших модели на разных платформах, и для настройки гейтвеев пришлось написать более 1000 строк кода. Теперь же один только GPT-4 Turbo способен справиться с трехкратным пиковым объемом трафика во время сезона распродаж.
Во-вторых, эффективность обработки длинных текстов значительно повысилась. Часто нам приходится загружать целые страницы трансграничных таможенных деклараций для извлечения информации. Раньше модель GPT-4 из-за недостаточной длины контекста требовала разделения на три запроса, но теперь все можно обработать за один раз, что сокращает время выполнения задачи на две трети.
Третье преимущество — это реальная экономия затрат. Мы проанализировали счет за прошлый месяц и обнаружили, что при одинаковом объеме запросов расходы на использование GPT-4 Turbo составили всего 28% от затрат на предыдущий многомодельный гибридный подход. Сэкономленные средства были использованы для увеличения зарплаты команды на два месяца.
Не смотрите только на плюсы, мы уже сталкивались с этими тремя проблемами.

Первая проблема заключается в том, что задачи с низкой сложностью могут оказаться неэкономически выгодными. Изначально мы перенаправляли все запросы на проверку адресов, но затем обнаружили, что для выполнения простых задач, таких как определение принадлежности адреса к Евросоюзу, использование модели GPT-4 Turbo оказалось в три раза дороже, чем использование более легкой модели. Теперь мы перенаправляем такие запросы на более простые модели.
Вторая проблема заключается в том, что время ответа по умолчанию на некоторые запросы оказывается даже длиннее, чем у обычного GPT-4. Когда мы только начали использовать этот новый инструмент, мы заметили, что некоторые запросы выполняются более чем за 200 мс. Позже мы поняли, что в режиме высокой пропускной способности приоритет отдается предотвращению отклонений запросов, а не достижению минимальной задержки. Чтобы решить эту проблему, мы отдельно настроили параметры низкой задержки для фронтенд-запросов, которые требуют быстрого ответа.
Третья проблема заключается в том, что возможности для детального контроля прав доступа ограничены. Обычная версия GPT-4 позволяет настраивать такие параметры, как температура работы модели (temperature) и количество наиболее вероятных ответов (top_p), в очень узких диапазонах. Однако в версии GPT-4 Turbo диапазоны настроек значительно сузились. Поэтому в сценариях, где необходимо точно контролировать стиль вывода информации (например, при создании текстов для таможенных уведомлений для клиентов), лучше использовать обычную версию GPT-4.
Кому это нужно? А кому вообще не стоит вмешиваться в это?
Если вы работаете в небольшой или средней команде и соответствуете следующим трем условиям, действуйте немедленно:
- Ежедневно более 100 тысяч одновременных запросов к крупным моделям
- Часто возникает необходимость работать с текстовыми задачами, объем которых превышает 8 тысяч символов (8k).
- Раньше часто приходилось использовать межмодельное балансирование нагрузки из-за ограничений на количество запросов.
Если количество запросов вашей команды менее 10 тысяч в день, или если все задачи сводятся к простым операциям классификации и извлечения данных, то нет абсолютной необходимости в замене текущей системы на более сложную. Легкие модели подойдут идеально, к тому же они обойдутся дешевле.
Два конкретных совета для начинающих
В первую неделю не переключайте всё сразу на новую систему – сначала перенесите 10% запросов с высокой конкурентностью и длинными текстовыми данными на новую систему для тестирования. После анализа данных, полученных в течение недели, постепенно увеличивайте объём работы. Мы в первый же день переключили 30% запросов, и чуть не столкнулись с проблемами из-за неправильной настройки параметров, что привело к ошибкам при извлечении некоторых таможенных деклараций.
Не нужно заранее создавать слишком длинный контекст – 128 кбайт контекста для GPT-4 Turbo достаточно для большинства корпоративных сценариев. Мы пробовали ввести целый 30-страничный логистический контракт для проверки условий, и результаты были одинаковыми как при полном вводе, так и при разделении на части для обработки.
Два вопроса, которые часто задают
Вопрос: Будет ли качество ответа хуже, чем у обычного GPT-4?
А: Мы провели тестирование на 1000 примерах адресов с точностью 98.7%, что практически не отличается от 98.9% у обычного GPT-4. Для корпоративных сценариев это вполне достаточно.
Вопрос: Необходимо ли заново создавать проект Prompt?
А: Мы просто воспользовались всеми теми же подсказками (Prompt), которые ранее использовались для обычного GPT-4, без каких-либо изменений, и результаты полностью соответствовали нашим ожиданиям.
Ссылка на статью:https://airai.cc/ru/ai-news/31/
Было ли это полезно?