Меню

Мы довели точность сопоставления логистических адресов с помощью OpenAI o1 до максимума, но столкнулись с тремя неожиданными проблемами.

Прошло всего несколько дней с пиковых показателей пятницы черной пятницы, и наша европейская команда из трех человек, работающих с серверной частью системы, наконец смогла вздохнуть с облегчением: в прошлом году из-за ограничений, связанных с использованием одной модели обработки запросов, 13% запросов на разрешение адресов приводили к ошибке 429. В этом году таких случаев не произошло ни одного, а коэффициент ошибок при сопоставлении адресов снизился на 82%. Основная причина этого изменения в том, что мы заменили основную модель обработки на модель o1.

Для тех, кто с этим не сталкивался раньше: что же такое o1?

Это большая модель OpenAI для усиленного решения логических задач, отличающаяся от предыдущей версии GPT-4o тем, что она тратит больше времени на обдумывание сложных логических проблем. Официальные результаты тестов базовых рассуждательных способностей этой модели на 87% выше, чем у GPT-4o, и именно по этому показателю мы и выбрали её в первую очередь.

Для нас, малых и средних команд, преимущества o1 действительно очевидны.

Первое преимущество напрямую решает нашу самую большую проблему — сопоставления адресов. Раньше, при использовании GPT-4o, часто возникали ошибки при сопоставлении улиц с одинаковыми названиями и почтовых индексов в разных европейских странах, особенно когда пользователи вводили адреса с орфографическими ошибками. Нам приходилось применять три уровня проверок, чтобы добиться точности около 92%. Теперь, с использованием o1, точность увеличилась до 98,7%, и весь тот код проверок мы удалили на прошлой неделе.

Во-вторых, больше не нужно создавать сложные системы генерации промптов (prompt systems). Раньше, чтобы модель выдавала результаты в формате, соответствующем нашему бэкенду, нам приходилось писать промпты общей длиной почти 2000 символов, и часто возникали проблемы с соблюдением формата вывода. Теперь же достаточно одной строки команды, и затраты на обслуживание системы генерации промптов снизились до нуля.

Третье: стабильность одновременных запросов оказалась лучше, чем мы ожидали. Мы боялись, что длительное время обработки запросов приведет к образованию очередей, но по данным мониторинга большинство запросов выполняются менее чем за 15 мс, а лишь очень редкие, сложные запросы на поиск адресов по нескольким странам занимают более 200 мс, что полностью в пределах наших допустимых ограничений.

Но его недостатки действительно могут застать врасплох.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

Первая проблема заключается в том, что потребление токенов у этого инструмента намного выше, чем у GPT-4o. В первые три дня после перехода на этот инструмент затраты на выполнение задач увеличились в 2,3 раза. Позже мы обнаружили, что инструмент o1 автоматически включает в расчет потребление токенов и результаты своего процесса размышлений. Если вам не нужно видеть логику его работы, обязательно укажите в параметрах вызова, чтобы результаты этих размышлений не учитывались. После того как мы это сделали, затраты снова снизились до уровня, характерного для GPT-4o (1,2 раза), что считается вполне приемлемым.

Вторая проблема заключается в том, что этот подход не подходит для простых, часто выполняемых запросов. Сначала, чтобы упростить процесс, мы перенаправили все запросы на поиск адресов через систему o1. Однако выяснилось, что для адресов без ошибок в написании и со стандартной форматизацией точность ответов при использовании системы o1 не отличается от точности, получаемой с использованием GPT-4o, при этом мы тратили дополнительные средства. Теперь мы ввели простую предварительную проверку: запросы, не соответствующие стандартному формату, направляются через систему o1, что позволило снизить затраты на 30%.

Третья проблема заключается в том, что поддержка ввода текста на языках, не относящихся к латинской группе (например, китайском и арабском), еще не достаточно стабильна. У нас есть небольшое количество пользователей из Ближнего Востока, и иногда возникают ошибки при обработке адресов, введенных на арабском языке. Мы сообщили об этой проблеме OpenAI, и в настоящее время ожидаем их исправления. Пока что мы используем дополнительные проверки на основе местных правил.

Кто должен использовать o1? Кто сейчас не должен его трогать?

Если вы сталкиваетесь с задачами, требующими логического анализа — например, сопоставления сложных правил, множественной проверки условий или генерации простого кода — и ранее использование GPT-4o приводило к ограничениям в точности результатов, то переход на GPT-4o1 может оказаться очень выгодным решением с точки зрения соотношения затрат и выгод.

Но если вы занимаетесь простым текстовым классификационным анализом, генерацией контента или выполнением частых стандартизированных запросов, то использование инструмента o1 совершенно необоснованно — это просто трата денег. Для этих задач вполне подойдут модели GPT-4o или даже GPT-3.5.

Два совета для тех, кто использует это впервые:

  • Сначала используйте 1000 записей из исторических данных, которые вы уже обработали с помощью старой модели, для тестирования. Не делайте полную замену данных сразу – так вы сможете быстро увидеть, может ли повышение точности покрыть увеличение затрат. Мы тестировали в течение двух дней и тогда решили, что нужно использовать новую модель.
  • При вызове предпочтительная версия o1-mini, для 90% сценариев малых и средних команд, возможности o1-mini вполне достаточны, и цена на 60% дешевле, чем полная версия o1.

В заключение, давайте рассмотрим вопрос, который задают чаще всего: будет ли o1 скоро заменен другими моделями? По крайней мере, в сценарии адресного разрешения, который мы используем, мы протестировали все существующие на рынке большие модели для интеллектуального анализа, и ни одна из них не смогла превзойти точность o1. По крайней мере, в ближайшие полгода она останется нашим предпочтительным вариантом.

Было ли это полезно?

Техническая поддержкаОнлайн-поддержка
侧栏
Наверх
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR