E-commerce produk segar di Asia Tenggara menggunakan Claude untuk pemeriksaan kualitas pesanan, menghemat 3 posisi staf layanan pelanggan, tetapi menemui 2 masalah serius.
Pekan lalu, tim kami menghadapi sebuah insiden mendadak: Pada hari promosi besar, 18% dari permintaan layanan purna jual terjebak di antrian penungguan karena kesalahan format output dari Claude, sehingga penanganan permintaan penggantian buah segar yang rusak oleh pelanggan tertunda selama 4 jam. Akibatnya, tingkat pengembalian barang pada hari itu meningkat sebesar 2 persentase poin.
Untuk yang belum pernah mendengarnya: Apa sebenarnya Claude itu?
Ini adalah model bahasa besar yang dikembangkan oleh Anthropic, dan versi terbaru yaitu 3.5 Sonnet memiliki jendela konteks tunggal yang dapat menampung hingga 200.000 token, yang setara dengan sekitar 150.000 kata dalam bahasa Cina. Alasan kami memilihnya pertama kali adalah karena model ini dapat memproses seluruh data secara langsung, termasuk riwayat pesanan lengkap, hasil OCR dari gambar bukti pengguna, dan aturan kompensasi platform, tanpa perlu membaginya menjadi beberapa permintaan.
Tiga keuntungan nyata yang kami peroleh darinya

Yang paling langsung terlihat adalah penurunan biaya tenaga kerja: dari 6 staf layanan pelanggan yang sebelumnya bertanggung jawab untuk pemeriksaan kualitas pesanan, kini hanya perlu menyisakan 3 staf untuk menangani kasus-kasus yang tidak terduga. Dengan demikian, pengeluaran biaya tenaga kerja saja dapat dihemat sebesar 4200 dolar per bulan.
Yang kedua adalah peningkatan kecepatan pemrosesan: sebelumnya, waktu rata-rata untuk meninjau satu permintaan secara manual adalah 2 menit, tetapi sekarang sebagian besar permintaan diselesaikan dalam waktu 15 milidetik. Setelah pengguna mengajukan aplikasi ganti rugi, hasilnya dapat diperoleh dalam waktu kurang dari 5 detik. Kami melihat bahwa tingkat kepuasan pengguna meningkat secara langsung sebesar 17%.
Yang ketiga adalah pelaksanaan aturan yang lebih terpadu: sebelumnya, saat pemeriksaan manual, sering terjadi kasus-kasus buruk yang sama, di mana ada yang mendapatkan ganti rugi penuh dan ada yang hanya mendapatkan 30%. Pengaduan dari pengguna tentang ketidakadilan dalam penilaian terjadi puluhan kali setiap bulan. Setelah menggunakan Claude untuk mengatur aturan secara terpadu, jumlah pengaduan tersebut langsung turun menjadi kurang dari 3 kali per bulan.
Jangan hanya melihat keuntungannya saja; kami hampir saja mengalami masalah serius karena kedua kesalahan ini, sampai-sampai layanan kami hampir terhenti.
Pertama adalah masalah dengan mekanisme pembatasan lalu lintas (traffic throttling): Awalnya kami langsung terhubung ke API resmi tanpa melakukan beberapa tingkatan penyesuaian (degradation). Pada hari promosi besar, jumlah permintaan meningkat tiga kali lipat, dan API resmi langsung mengembalikan kode kesalahan 429. Karena kami tidak memiliki mekanisme penggantian otomatis, ribuan tiket pelanggan terjebak dalam proses penanganan. Kemudian kami menambahkan model kecil yang memiliki fungsi serupa sebagai cadangan; jika ada tiga kali kegagalan berturut-turut dalam proses permintaan, sistem akan secara otomatis beralih ke model kecil tersebut, dan hanya jika masih gagal, barulah proses akan diteruskan oleh staf manusia. Sejak saat itu, tidak pernah lagi terjadi kasus di mana banyak tiket pelanggan terjebak dalam proses penanganan secara bersamaan.
Kedua adalah masalah ketidakstabilan output struktural: Awalnya kami meminta sistem untuk mengembalikan hasil penilaian dalam format JSON, dan dalam sekitar 2% kasus, sistem menambahkan sejumlah teks penjelasan di luar struktur JSON, yang menyebabkan skrip pemrosesan kami langsung mengalami kesalahan. Kemudian kami menambahkan kalimat di akhir prompt yang berbunyi “Jika output Anda bukan dalam format JSON murni, Anda akan ditutup”, dan tingkat kejadian masalah ini langsung turun di bawah 0,1%.
Siapa yang cocok menggunakannya? Dan siapa yang sebaiknya tidak mencobanya?

Jika tim Anda sering kali harus menangani pekerjaan yang berulang dengan aturan yang jelas dan jumlah teks yang cukup besar, seperti peninjauan pesanan e-commerce, klasifikasi tiket pelanggan, atau pemeriksaan awal ketentuan kontrak, dan bersedia menghabiskan waktu 1-2 minggu untuk menyesuaikan prompt dan mengembangkan mekanisme penurunan kualitas (degradation mechanisms), maka Claude dapat membantu Anda menghemat banyak uang dan waktu.
Jika skenario Anda mengharuskan tingkat akurasi hasil yang mencapai 100%, seperti dalam diagnosis medis, peninjauan akhir transaksi keuangan, atau jika tim Anda tidak memiliki staf khusus untuk operasional dan pengembangan, dan Anda ingin menggunakannya tanpa perlu melakukan penyesuaian apa pun, maka sebaiknya jangan mencobanya. Kemungkinan terjadinya masalah jauh lebih tinggi dari yang Anda bayangkan.
Dua saran praktis untuk pengguna pertama:
Pertama, saat memulai, jangan langsung beralih ke mode produksi. Mulailah dengan mode shadow selama 7 hari: semua permintaan akan diproses baik oleh manusia maupun oleh Claude secara bersamaan. Bandingkan hasil dari kedua metode tersebut untuk memastikan tingkat konsistensinya. Setelah tingkat konsistensi mencapai lebih dari 95%, barulah alihkan lalu lintas ke mode produksi. Kami sendiri menjalankan mode shadow selama 10 hari dan menemukan 3 kesalahan dalam pemahaman aturan. Kami segera memperbaiki prompt-nya sehingga tidak terjadi masalah.
Kedua, jangan selalu memberikan semua permintaan ke versi dengan spesifikasi tertinggi; gunakan Haiku saja untuk kasus-kasus yang memang membutuhkannya. Kami kemudian memindahkan permintaan klasifikasi tiket kerja yang sederhana ke Haiku, dan biaya token langsung turun sebesar 60%, sementara kecepatannya meningkat dua kali lipat, namun kualitasnya tidak berkurang sama sekali.
Pertanyaan Umum
- Apakah ada risiko kebocoran data?Jika data Anda bersifat sensitif, lebih baik langsung membeli versi perusahaan (enterprise version) dan menandatangani perjanjian pengolahan data. Anthropic tidak akan menggunakan data permintaan dari versi perusahaan untuk melatih modelnya. Kami telah menggunakannya selama 8 bulan dan belum pernah mengalami masalah dengan data.
- Mana yang lebih baik, GPT atau yang lainnya?Jika skenario Anda memerlukan pemrosesan teks yang panjang dan pemahaman konteks yang tinggi, pilih Claude; jika Anda memerlukan generasi berbasis multi-modal seperti menggambar, pilih GPT. Saat ini kami menggunakan keduanya, masing-masing untuk skenario yang berbeda.
Tautan artikel:https://airai.cc/id/ai-news/40/
Apakah ini membantu?