Kami berhasil meningkatkan akurasi layanan pelanggan multimodal menggunakan GPT-4o hingga 92%, tetapi ada 3 masalah yang sangat mengganggu dalam prosesnya.
Bulan lalu, tim teknis kami yang terdiri dari 3 orang yang bekerja di bidang perdagangan elektronik lintas negara di Asia Tenggara bekerja selama 3 hari berturut-turut untuk mengonversi sistem layanan pelanggan cerdas (smart customer service) dari model teks besar yang lama ke GPT-4o. Awalnya kami hanya berpikir bahwa penambahan fitur pengenalan gambar akan menjadi perubahan yang signifikan, tetapi ternyata dampaknya jauh lebih besar dari yang kami duga, dan kami juga menemui banyak masalah yang tidak terduga.
Untuk yang belum pernah mendengarnya sebelumnya: Apa sebenarnya GPT-4o itu?
Pada dasarnya, ini adalah model generatif multimodal dari OpenAI, dan perbedaan terbesar dibandingkan dengan versi sebelumnya adalah...Satu putaran dapat memproses tiga jenis input sekaligus, yaitu teks, gambar, dan audio, tanpa perlu membagi permintaan dan memanggil model yang berbeda-beda.Tanpa perlu melakukan pemrosesan awal terhadap format masukan sendiri, parameter antarmuka mengurangi hampir 60% dibandingkan dengan pemanggilan kombinasi.
Mengapa kita harus menggantinya pada tahun 2026?
Sebelumnya, sistem layanan pelanggan kami hanya dapat menangani pertanyaan dalam bentuk teks. Ketika pengguna mengirimkan foto barang yang rusak atau barang yang dikirimkan salah, kami perlu mengonversi foto tersebut menjadi deskripsi teks secara manual sebelum memasukkannya ke dalam model. Selama periode promosi besar, proses ini menyumbang hampir 20% dari total kasus yang tertunda, dan tingkat keluhan pengguna langsung meningkat dua kali lipat. Kami juga telah mencoba solusi yang menggabungkan model pengenalan gambar dengan model teks, namun tingkat akurasinya hanya mencapai 76%. Kerugian akibat penilaian yang salah dalam proses after-sales jauh lebih tinggi daripada biaya penggunaan model tersebut.
Tiga manfaat utama yang paling langsung terlihat setelah perubahan tersebut benar-benar melampaui ekspektasi kami sejak awal.

- Tingkat penanganan otomatis pesanan purna jual meningkat secara langsung dari 47% menjadi 92%. Dua staf layanan pelanggan paruh waktu yang sebelumnya bertanggung jawab untuk mengonversi gambar, kini dialihkan untuk menangani keluhan pelanggan yang lebih kompleks, sehingga biaya tenaga kerja bulanan dapat dihemat hampir 1800 dolar Amerika.
- Konsultasi suara dalam dialek yang dikirim oleh pengguna tidak perlu lagi melalui antarmuka ASR (Automatic Speech Recognition) yang terpisah; cukup dikirim langsung ke model untuk diidentifikasi dan diberikan tanggapan. Sebagian besar permintaan dapat diselesaikan dalam waktu 15 milidetik, sehingga kecepatan respons secara keseluruhan meningkat tiga kali lipat.
- Dalam menangani permintaan purna jual yang sama yang mencakup gambar dan teks, konsumsi token berkurang sebesar 32% dibandingkan dengan memanggil model pengenalan gambar dan model teks secara terpisah. Dengan demikian, biaya model selama periode puncak promosi justru lebih rendah daripada sebelumnya.
Jangan hanya melihat keuntungannya saja; ketiga “perangkap” tersembunyi ini benar-benar menyebabkan kerugian yang nyata saat kita mengalaminya.
Pertama-tama, masalah yang muncul adalah ambang batas pengendalian lalu lintas (throttling) untuk input berbasis multimodal jauh lebih ketat dibandingkan dengan permintaan teks murni. Pada hari pertama sistem kami diluncurkan, tepatnya saat ada acara perayaan toko di situs web di Asia Tenggara, 17% dari permintaan yang mengandung gambar langsung mengalami kesalahan (error code 429), sehingga pengguna tidak mendapatkan respons dan mengira bahwa layanan pelanggan tidak berfungsi. Akibatnya, pada hari itu terdapat lebih dari 300 ulasan negatif. Kemudian, kami terpaksa membuat antrian khusus untuk permintaan yang mengandung gambar, di mana pesan “Gambar telah diterima, sedang diproses” ditampilkan terlebih dahulu selama masa puncak, sehingga masalah tersebut dapat diatasi.
Kesalahan kedua adalah tingkat akurasi pengenalan teks pada gambar berbahasa non-Inggris jauh lebih rendah daripada yang diiklankan. Kami pernah mengalami kasus di mana model mengenali dengan salah 3 karakter alamat pada label paket yang ditulis tangan dalam bahasa Indonesia, sehingga kami mengirimkan alamat pengembalian/penggantian yang salah kepada pelanggan, yang menyebabkan kerugian biaya pengiriman hampir 200 dolar Amerika. Sekarang, kami telah menambahkan lapisan interface OCR lokal untuk memverifikasi hasil pengenalan teks pada gambar berbahasa non-Inggris, sehingga tingkat kesalahan dapat ditekan ke tingkat yang dapat diterima.
Kesalahan ketiga adalah aturan penghitungan token untuk output multimodal sangat berbeda dengan teks biasa, sehingga Anda tidak dapat menggunakan rumus sebelumnya untuk memperkirakan biayanya. Pada minggu pertama peluncuran, kami tidak mengubah ambang peringatan anggaran, dan biaya untuk satu hari akhir pekan saja telah melebihi 40% dari anggaran bulanan, sampai akhirnya bagian keuangan mengingatkan kami.
Haruskah kita menggantinya sekarang? Kami telah menyusun kriteria penilaian yang jelas.
Situasi di mana Anda bisa langsung bertindak:

- Bisnis Anda sendiri memerlukan pemrosesan simultan dari dua atau lebih jenis input, yaitu teks, gambar, dan audio.
- Sebelumnya, kita sudah menggunakan beberapa model untuk melakukan pemrosesan multimodal, tetapi biaya integrasinya tinggi dan tingkat akurasi yang dihasilkan belum memuaskan.
- Pengguna Anda sebagian besar menggunakan bahasa Inggris, atau bahasa-bahasa utama yang didukung dengan baik oleh GPT-4o.
Situasi di mana Anda sama sekali tidak perlu membuang-buang uang:
- Kebutuhan bisnis Anda hanya terkait pada pemrosesan teks murni, dan model generasi sebelumnya sudah mampu memenuhi persyaratan akurasi yang dibutuhkan.
- Bisnis Anda terutama berfokus pada pasar bahasa minoritas, yang melibatkan kebutuhan dalam mengenali teks tulisan tangan lokal dalam jumlah besar serta suara dialek.
- Tim Anda tidak memiliki sumber daya manusia tambahan untuk mengembangkan strategi penurunan kualitas (downgrading) atau sistem pemantauan biaya (cost monitoring).
2 saran praktis untuk tim yang baru ingin memulai
Pertama, sebelum meluncurkan sistem, jalankan dulu aliran data “shadow traffic” selama 7 hari, jangan langsung beralih 100% permintaan ke sistem baru. Kirimkan permintaan dari pengguna asli ke sistem lama Anda sekaligus ke GPT-4o, bandingkan tingkat akurasi dan biaya di kedua sisi, dan pastikan semuanya sesuai harapan sebelum perlahan-lahan beralih aliran data. Kami mengalami kerugian besar karena tidak melakukan langkah ini.
Kedua, atur peringatan anggaran secara terpisah untuk permintaan multimodal, dengan ambang batas yang dapat ditetapkan sebesar 120% dari biaya yang Anda perkirakan, untuk menghindari terjadinya kelebihan pengeluaran.
Pertanyaan Umum dan Jawabannya
Pertanyaan: Apakah kita harus menunggu model generasi berikutnya keluar sebelum beralih ke model tersebut?
Jawaban: Setidaknya dalam skenario integrasi multimodal, tingkat kematangan GPT-4o saat ini sudah cukup untuk menyelesaikan masalah-masalah praktis. Model generasi berikutnya masih membutuhkan waktu setidaknya lebih dari satu tahun untuk dikembangkan, sehingga tidak perlu membuang-buang biaya yang bisa dihemat saat ini demi peningkatan yang belum pasti.
Pertanyaan: Bagaimana perbandingannya dari segi harga dan kualitas dibandingkan dengan model multimodal yang bersifat open source?
Jika tim Anda mampu melakukan penyesuaian dan pengimplementasian model terbuka (open-source) secara mandiri, serta memiliki kebutuhan yang tinggi terkait privasi data, maka menggunakan model terbuka akan lebih menguntungkan. Namun, jika tidak, biaya menggunakan GPT-4o secara langsung akan jauh lebih rendah dibandingkan dengan biaya membangun dan mengoperasikan server sendiri.
Tautan artikel:https://airai.cc/id/ai-news/30/
Apakah ini membantu?