Мы использовали Claude 3 Opus для обработки трансграничных таможенных деклараций, что позволило сэкономить 60% затрат на ручную проверку, но мы столкнулись с тремя проблемами.
В прошлом месяце, во время крупной распродажи на европейском сайте, наша группа из трех человек, занимающаяся таможенным оформлением, работала на пределе своих возможностей: новые нормативные требования предписывают, чтобы каждая партия товаров соответствовала коду товара, сертификату происхождения и налоговому идентификационному номеру ЕС. Ранее использовавшаяся малая модель имела точность распознавания менее 70%, в результате чего за неделю накопилось 1200 документов с ошибками, требующих проверки, что замедлило весь процесс таможенного оформления на два дня.
Что такое Claude 3 Opus?
Это наиболее мощная на данный момент большая языковая модель от Anthropic.В один раз можно ввести до 2 миллионов токенов, что эквивалентно тому, что можно напрямую использовать целый справочник по торговому соблюдению в 1500 страницах в качестве контекста для анализа.Не требуется разделять содержимое на отдельные запросы для обработки.
Три основных дохода, которые мы получили в результате наших испытаний:

Первое — это повышение точности распознавания сложных документов до максимально возможного уровня. Ранние модели часто путали рукописные примечания в многопагинных таможенных декларациях и коды происхождения приложенных листов. После перехода на систему Opus мы включили в алгоритм 3 года накопленных компанией правил соблюдения нормативов, а также список всех товаров данной партии.Показатель точности распознавания достиг 98%, а количество работы, необходимой для ручной проверки, сократилось на 60%.В прошлой неделе, во время пиковой акции скидок, также не было никаких аномалий, связанных с накоплением заказов.
Во-вторых, нет необходимости заниматься сложными проектами по разработке подсказок. Раньше, чтобы маленькие модели выдавали структурированные данные, соответствующие требованиям таможни, мы тратили полмесяца на настройку подсказок и добавление нескольких уровней проверок правил; теперь же достаточно предоставить Opus три правильных примера формата, и выходные данные сразу могут быть использованы в нашей системе таможенной декларации, что экономит не менее недели работы над разработкой.
Третьим преимуществом является более простой и надежный обработка конфиденциальных данных. При ведении трансграничных бизнес-операций мы особенно боимся утечки налоговой информации пользователей и данных о квалификации компаний. Система Opus поддерживает обработку данных без предварительной подготовки (zero-shot data processing): нет необходимости использовать конфиденциальные данные для доработки алгоритмов. Достаточно добавить соответствующее правило обработки в запрос, и система вернет результат, что полностью соответствует требованиям GDPR. Таким образом, не требуется дополнительная проверка на соответствие нормам обработки данных.
Не спешите садиться в машину, мы уже проехали через эти ямы.

Во-первых, затраты действительно немалые. Раньше, используя обычные модели для обработки 1000 таможенных деклараций, стоимость составляла примерно 2 доллара, но после перехода на систему Opus она увеличилась до 15 долларов. Если количество документов, которые вы обрабатываете ежедневно, меньше 100, такие затраты даже превышают стоимость найма сотрудника на временную работу для проверки.
Во-вторых, проблема перегружения системы в часы пик оказалась серьезнее, чем мы ожидали. В день акции мы увеличили количество одновременных запросов до 10, и сразу 12% из них возвращали ошибку 429. В итоге нам пришлось добавить дополнительную очередь задач для обработки, чтобы отложить несрочные запросы на утро, что помогло снизить нагрузку на систему.
Еще одна маленькая проблема: система показывает снижение точности распознавания рукописного текста на очень редких языках. У нас был случай с португальским рукописным сертификатом происхождения, и программа Opus неправильно распознала содержащийся в нем код. В итоге пришлось вмешаться и проверить данные вручную. Если ваш бизнес связан с рукописными документами на многих нестандартных языках, лучше сначала протестировать точность работы системы на собственном наборе данных.
Кому это нужно? Кому совсем не обязательно это использовать?
Сценарии применения очень ясны: если вам необходимо работать с длинными документами, сложным мультимодальным контентом, например, с проверкой юридических контрактов, распознаванием многополосных форм, отладкой больших кодовых библиотек, и при этом требуется высокая точность результатов, а стоимость ошибок значительно превышает стоимость вызовов моделей, то Opus определенно сможет существенно сэкономить ваше время и усилия.
Если вы используете это только для обслуживания клиентов, генерации обычного текста или извлечения ключевых слов, то на самом деле нет необходимости в использовании таких сложных систем. Обычные малые модели полностью могут удовлетворить эти потребности, причем стоимость их использования может быть снижена более чем на 80%.
Два практических совета для команды, которая впервые занимается этим делом:
Во-первых, не стоит сразу заменять все запросы. Начните с 10% самых сложных запросов в вашем бизнесе, которые приводят к наибольшим затратам на ошибки, и переведите их на технологию Opus. Проработайте данные в течение недели, чтобы оценить возврат инвестиций (ROI), а затем постепенно увеличивайте долю таких запросов. Мы сначала тестировали многоязычные декларации, в которых наиболее часто возникают ошибки, и только после подтверждения положительных результатов решили провести полную замену.
Во-вторых, обязательно необходимо внедрить стратегию деградации. В случае ограничения пропускной способности или когда уровень надежности распознавания менее 90%, автоматически переключаться на более экономичную модель или на процесс ручной обработки. Не стоит связывать все бизнес-процессы только с одной моделью.
В конце концов мы решили вопрос, над которым наша команда долго ломала голову: стоит ли ждать более дешевой новой версии? Мы пришли к выводу, что если ваш бизнес сейчас сталкивается с проблемами из-за низкой эффективности обработки сложных документов, то раннее внедрение нового решения позволит сэкономить на затратах на персонал. За тот месяц, что мы используем это новое решение, мы уже сэкономили на затратах на проверку данных, и эти средства уже достаточны для покрытия расходов на вызовы моделей в течение следующих полугода.
Ссылка на статью:https://airai.cc/ru/daily-life/43/
Было ли это полезно?