Kami meningkatkan efisiensi penanganan tiket purna jual pelanggan dengan menggunakan Claude 3 hingga tiga kali lipat, tetapi kami juga menemukan dua kesalahan yang seharusnya tidak terjadi.
Pada akhir Black Friday minggu lalu, saat kami menyelesaikan laporan, tiga pengembang dari tim SaaS e-commerce kami di Asia Tenggara terkejut melihat data di backend: jumlah pesanan after-sales yang biasanya memerlukan bantuan seluruh tim layanan pelanggan selama 3 hari untuk diselesaikan, tahun ini sebagian besar telah ditangani secara otomatis, dan jumlah keluhan pelanggan langsung turun sebesar 42%. Perubahan utama yang kami lakukan hanyalah mengganti logika pengenalan semantik pesanan lama dengan Claude 3 Opus.
Untuk yang belum pernah mengenalinya, izinkan saya mengatakan sesuatu yang jujur…
Ini adalah model bahasa besar generasi ketiga yang diluncurkan oleh Anthropic pada tahun 2024. Parameter inti yang kami gunakan sangat sederhana: dengan jendela konteks sekitar 200.000 kata, model ini mampu menangani tiket layanan purna jual yang berisi 3 gambar produk, dan tingkat akurasinya 18% lebih tinggi dibandingkan dengan model sebelumnya yang menggunakan parameter serupa.
Bagi tim kecil seperti kami, tiga manfaat tersebut sangat berharga (dalam bentuk uang tunai).

Yang pertama adalah tidak perlu lagi melakukan pemrosesan pra-modalitas (pre-modal processing) secara terpisah. Sebelumnya, untuk gambar barang yang rusak atau tangkapan layar proses logistik yang diunggah oleh pengguna, kami harus menggunakan model OCR untuk mengonversi gambar menjadi teks terlebih dahulu, lalu menggabungkannya dengan data tiket pelanggan (ticket data) sebelum memberikannya ke model besar (big model). Pemeliharaan rantai proses ini saja sudah menghabiskan separuh dari sumber daya backend kami. Setelah beralih ke Claude 3, kami langsung mengirimkan gambar dan teks bersama-sama, dan jumlah kesalahan dalam proses pengenalan (recognition errors) justru berkurang.
Yang kedua adalah tingkat penolakan yang sangat rendah, hampir bisa diabaikan. Model sebelumnya seringkali tidak dapat mengenali tiket yang ditulis oleh pengguna dengan cara yang sangat kacau (misalnya, campuran antara bahasa Inggris dan bahasa setempat, serta singkatan internet), sehingga harus dialihkan ke proses manual. Kami telah menghitung bahwa selama periode tersebut, persentase tiket yang dialihkan ke proses manual adalah 27%, sedangkan sekarang angkanya adalah 4%.
Yang ketiga adalah biaya pemanggilan (cost of invocation) jauh lebih rendah dari yang kami perkirakan. Kami membayar berdasarkan penggunaan aktual; pada hari puncak Black Friday, kami berhasil menangani rata-rata 12.000 permintaan pelanggan per hari, dengan total biaya kurang dari 800 dolar Amerika, yang merupakan penghematan sebesar 90% dibandingkan dengan biaya mempekerjakan 10 staf layanan pelanggan sementara.
Tapi jangan terburu-buru bertindak, dua kesalahan yang kita lakukan sudah cukup membuatmu repot selama seminggu.
Pertama-tama, masalah yang muncul adalah soal penyesuaian teks dalam berbagai bahasa. Setengah dari pengguna kami menggunakan bahasa Indonesia, dan kami langsung meluncurkan produk tersebut tanpa melakukan penyesuaian terlebih dahulu. Akibatnya, ketika model mengenali ungkapan-ungkapan slanga khas setempat, misalnya “produk dikirim dengan warna yang salah” sebagai “pengguna ingin mengganti alamat penerimaan”, terjadi 17 keluhan dari pelanggan dalam seminggu. Setelah itu, kami memberikan data berupa 3000 contoh pesan yang telah diberi label dalam bahasa setempat untuk melatih model, dan masalah tersebut akhirnya teratasi.
Kesalahan kedua adalah hilangnya informasi dalam konteks yang panjang. Jika sebuah tiket kerja (ticket) dilengkapi dengan lebih dari 5 gambar, model terkadang akan melewatkan informasi dari salah satu gambar tersebut. Misalnya, jika pengguna mengirimkan dua gambar, yaitu gambar kondisi kemasan yang rusak dan gambar barang yang rusak, model hanya akan mengenali masalah pada kemasan. Kami kemudian menambahkan aturan verifikasi yang sederhana: jika ada lebih dari 3 gambar, model diinstruksikan untuk menghasilkan hasil pengenalan untuk masing-masing gambar terlebih dahulu, lalu merangkumnya bersama-sama, dan sejak itu tidak ada lagi kesalahan yang terjadi.
Sejujurnya, tidak semua tim cocok untuk menggunakan…

Kondisi yang seharusnya Anda gunakan:

- Bisnis Anda memerlukan pemrosesan teks sekaligus gambar/audio pendek, dan Anda tidak ingin membangun beberapa rangkaian model (model chains) yang terpisah.
- Anda memiliki persyaratan yang sangat tinggi terhadap akurasi hasil output, terutama dalam situasi-situasi seperti penanganan tiket pelanggan atau peninjauan kontrak yang memiliki biaya kesalahan yang tinggi.
- Tim Anda kekurangan sumber daya manusia, sehingga tidak memiliki energi untuk memelihara rantai pemrosesan pra-model yang kompleks.
Situasi di mana Anda tidak sebaiknya membuang-buang uang:
- Anda hanya perlu melakukan tugas-tugas ringan seperti memberikan respons berdasarkan kata kunci, membuat konten pemasaran, dan sejenisnya; model kecil yang murah sudah cukup untuk itu.
- Data bisnis Anda memiliki persyaratan penyimpanan lokalisasi yang ketat, sehingga tidak memungkinkan untuk mengirimkan data ke antarmuka model pihak ketiga.
- Permintaan Anda sangat rendah, kurang dari 1000 kali per bulan, sehingga biaya pengembangan model baru lebih tinggi daripada keuntungannya.
Dua saran praktis untuk orang yang pertama kali mencobanya
Yang pertama adalah melakukan pengujian selama 7 hari dari skenario tepi (edge scenarios) terlebih dahulu, kemudian baru diterapkan ke jalur utama (core links). Pada awalnya, kami menggunakan data tiket kerja (work tickets) dari 3 bulan terakhir untuk melakukan pengujian offline, dan setelah tingkat akurasi mencapai lebih dari 95%, baru kami mulai mengalihkan 10% lalu lintas online, dan secara bertahap meningkatkannya hingga mencakup seluruh lalu lintas online. Selama proses tersebut, tidak terjadi kecelakaan besar di lingkungan online.
Yang kedua adalah tidak perlu memilih versi Opus yang paling mahal dari awal. Kami telah menguji bahwa untuk menangani tiket pertanyaan biasa yang tidak berisi gambar, versi Sonnet memiliki tingkat akurasi yang hampir tidak berbeda dengan versi Opus (kurang dari 2%), dan biayanya hanya setengahnya, yang sudah cukup.
Pertanyaan yang sering diajukan oleh banyak orang: Haruskah kita menunggu model generasi berikutnya? Jawaban kami adalah, jika bisnis Anda saat ini terhambat oleh masalah pemrosesan berbasis multi-modal dan tingkat akurasi yang tidak memadai, maka menggunakan model yang ada saat ini sudah cukup. Lagipula, semakin cepat Anda mulai menggunakannya, semakin banyak biaya tenaga kerja yang dapat Anda hemat, yang jauh lebih besar daripada biaya panggilan (call cost) yang akan berkurang ketika model generasi berikutnya dirilis.
Tautan artikel:https://airai.cc/id/ai-news/41/
Apakah ini membantu?