Kami menggunakan Claude 3 Opus untuk memproses pengenalan dokumen pengiriman lintas negara, yang menghemat 60% dari biaya pemeriksaan manual, tetapi kami menemui 3 masalah (atau “pitfall”) selama prosesnya.
Bulan lalu, selama promosi besar di situs web Eropa, tim kami yang terdiri dari 3 orang yang bertanggung jawab atas proses pengiriman lintas negara hampir tidak punya waktu untuk beristirahat: kebijakan kompatibilitas baru mewajibkan setiap dokumen pengiriman untuk sesuai dengan kode barang, sertifikat asal usul, dan nomor identifikasi pajak Uni Eropa. Model kecil yang kami gunakan sebelumnya memiliki tingkat akurasi pengenalan kurang dari 70%, sehingga dalam seminggu terakumulasi 1200 dokumen yang perlu diperiksa kembali, yang memperlambat seluruh proses pengiriman hingga 2 hari.
Apa itu Claude 3 Opus?
Ini adalah model bahasa besar dengan kemampuan terkuat saat ini dari Anthropic,Dukungan untuk memasukkan hingga 2 juta token pada satu waktu, yang setara dengan dapat memproses seluruh isi buku panduan kepatuhan perdagangan yang berisi 1500 halaman sekaligus sebagai referensi konteks.Tidak perlu membagi konten menjadi permintaan segmentasi.
Tiga manfaat utama yang kami temukan melalui pengujian:

Yang pertama adalah peningkatan yang signifikan dalam akurasi pengenalan dokumen kompleks. Model sebelumnya sering kali bingung dengan catatan tulisan tangan di dalam formulir pengiriman yang terdiri dari beberapa halaman atau kode asal usul pada lampiran dokumen. Setelah beralih menggunakan Opus, kami memasukkan aturan kepatuhan yang telah terakumulasi selama 3 tahun oleh perusahaan, beserta daftar barang untuk setiap batch barang tersebut ke dalam sistem.Ketepatan pengenalan mencapai 98%, dan jumlah pemeriksaan manual langsung berkurang sebesar 60%.Pada puncak promosi minggu lalu, juga tidak terjadi penumpukan pesanan yang tidak normal.
Yang kedua adalah tidak perlu repot-repot dengan proyek pengembangan kata-kata petunjuk (prompt words) yang rumit. Sebelumnya, untuk membuat model kecil menghasilkan data terstruktur yang memenuhi persyaratan bea cukai, kami menghabiskan setengah bulan hanya untuk menyesuaikan kata-kata petunjuk tersebut, dan masih perlu menambahkan beberapa lapisan verifikasi aturan; sedangkan dengan Opus, cukup dengan memberikan 3 contoh format yang benar, hasilnya langsung dapat diintegrasikan ke sistem pengajuan bea cukai kami, sehingga menghemat setidaknya satu minggu waktu pengembangan.
Yang ketiga adalah pengelolaan data sensitif yang lebih mudah. Dalam bisnis lintas negara, kami sangat khawatir tentang kebocoran informasi pajak pengguna dan data kualifikasi perusahaan. Opus mendukung pengolahan data tanpa data pelatihan awal (zero-shot data processing), sehingga tidak perlu menggunakan data sensitif untuk melakukan penyesuaian kecil (fine-tuning). Cukup tambahkan aturan pengolahan dalam permintaan, dan hasilnya akan langsung dikembalikan, yang sepenuhnya memenuhi persyaratan GDPR. Tidak perlu melalui proses persetujuan kepatuhan data tambahan.
Jangan terburu-buru naik mobil, kita sudah melewati beberapa lubang di jalan ini dulu.

Yang pertama, biayanya memang tidak rendah. Sebelumnya, menggunakan model biasa untuk memproses 1000 dokumen pengiriman barang, biayanya sekitar 2 dolar Amerika. Setelah beralih ke Opus, biayanya langsung naik menjadi 15 dolar Amerika. Jika jumlah dokumen yang Anda proses setiap hari kurang dari 100 dokumen, biaya ini lebih mahal daripada mempekerjakan seorang pemeriksa paruh waktu.
Selanjutnya, masalah dengan rasio penyelesaian permintaan (throughput) saat puncak penjualan lebih parah dari yang kami duga. Pada hari promosi besar, kami meningkatkan jumlah permintaan konkuren hingga 10, dan langsung 12% dari permintaan tersebut menghasilkan kesalahan kode 429. Akhirnya, kami terpaksa menambahkan lapisan antrian tugas (task queue) untuk menunda pemrosesan permintaan yang tidak mendesak hingga dini hari, sehingga masalah tersebut dapat teratasi.
Mas ada satu masalah kecil lagi: tingkat pengenalan tulisan tangan dalam bahasa-bahasa kecil yang sangat jarang digunakan cenderung menurun drastis. Kami pernah mengalami kasus di mana sertifikat asli yang ditulis dalam bahasa Portugis diidentifikasi dengan salah oleh sistem Opus, dan akhirnya harus diperiksa secara manual untuk memastikan keakuratannya. Jika bisnis Anda melibatkan banyak dokumen tulisan tangan dalam bahasa-bahasa non-populer, sebaiknya Anda menguji tingkat akurasi sistem tersebut terlebih dahulu menggunakan data Anda sendiri.
Siapa yang seharusnya menggunakannya? Dan siapa yang sama sekali tidak perlu menyentuhnya?
Situasi yang cocok untuk menggunakan Opus sangat jelas: jika Anda perlu menangani dokumen panjang, konten kompleks yang bersifat multimodal, seperti pemeriksaan kontrak hukum, pengenalan formulir berjumlah banyak halaman, atau debugging kode yang panjang, dan Anda mengharapkan tingkat akurasi yang sangat tinggi, di mana biaya kesalahan jauh lebih besar daripada biaya pemanggilan model, maka Opus pasti dapat membantu Anda menghemat banyak waktu dan usaha.
Jika Anda hanya membutuhkannya untuk melakukan pertanyaan dan jawaban layanan pelanggan, generasi teks umum, atau ekstraksi kata kunci sederhana, maka sebenarnya tidak perlu menggunakan model yang lebih canggih; model kecil biasa saja sudah cukup untuk memenuhi kebutuhan tersebut, dan biayanya bisa dihemat lebih dari 80%.
Dua saran praktis untuk tim yang baru memulai:
Pertama, jangan langsung melakukan penggantian secara menyeluruh. Mulailah dengan 10% permintaan yang paling kompleks dan memiliki biaya kesalahan yang paling tinggi dalam bisnis Anda, lalu gunakan Opus untuk menganalisis data selama seminggu untuk mengetahui ROI (Return on Investment). Setelah itu, perlahan-lahan tingkatkan proporsinya. Kami akan menguji fitur tersebut terlebih dahulu pada formulir pengajuan bea cukai berbahasa asing yang paling rentan terhadap kesalahan, dan hanya setelah kami yakin dengan manfaatnya, barulah kami akan beralih ke penggunaan Opus secara menyeluruh.
Kedua, pastikan untuk menambahkan strategi penurunan kualitas (degradation strategy). Ketika terjadi pembatasan lalu lintas data (traffic throttling) atau tingkat kepercayaan (confidence level) dalam proses pengenalan lebih rendah dari 90%, secara otomatis beralih ke model dengan biaya yang lebih rendah atau proses penanganan manual. Jangan terlalu bergantung pada satu model saja untuk semua kebutuhan bisnis.
Pertama-tama, mari kita jawab pertanyaan yang telah lama membingungkan tim kami: apakah kita harus menunggu versi baru yang lebih murah? Kesimpulan kami adalah, jika bisnis Anda saat ini mengalami keterlambatan karena kesulitan dalam memproses dokumen yang kompleks, maka menggunakan versi baru lebih awal akan menghemat biaya tenaga kerja. Biaya tenaga kerja yang kami hemat selama satu bulan ini sudah cukup untuk menutupi biaya pemanggilan model selama setengah tahun ke depan.
Tautan artikel:https://airai.cc/id/daily-life/43/
Apakah ini membantu?