Kami menggunakan GPT-5.5 di sistem layanan pelanggan e-commerce Eropa, yang menghemat 62% tenaga kerja, tetapi kami menemukan 2 masalah serius.
Bulan lalu, saat Black Friday, tim layanan pelanggan e-commerce kami di Belanda hampir kewalahan—tiga operator harus menangani 30.000 pertanyaan dari pelanggan. Sebelumnya, kami menggunakan GPT-4o, dan 18% dari permintaan verifikasi alamat purna jual langsung gagal karena waktu yang terbatas, sehingga tingkat keluhan pelanggan meningkat tiga kali lipat dari biasanya. Kami segera beralih ke GPT-5.5 dan menggunakannya selama tiga hari, dan masalah tersebut langsung teratasi. Namun, kami juga menemukan dua masalah yang sama sekali tidak terduga sebelumnya.
Mari kita jelaskan terlebih dahulu apa itu GPT-5.5.
Jangan dengarkan apa yang dikatakan media tentang "genera AGI generasi berikutnya." Bagi kami yang melakukan bisnis, itu adalah versi yang dioptimalkan multi-modalitas yang dirilis oleh OpenAI pada Q1 2026. Titik jangkar parameter terbesar adalahDengan kemampuan penalaran yang setara, konsumsi token pada GPT-4o lebih rendah sebesar 40% dibandingkan dengan GPT-4.Dan mendukung penyisipan konteks berbahasa ganda sekaligus hingga 128k data, sehingga tidak perlu dibagi menjadi beberapa permintaan.
Tiga keuntungan nyata yang telah kami ukur:
- Pertama-tama, tingkat akurasi multibahasa telah meningkat secara signifikan. Sebelumnya, saat kami memproses alamat yang terdiri dari campuran bahasa Belanda, Prancis, dan Jerman, GPT-4o sering kali mengenali alamat dari wilayah Prancis di Belgia sebagai alamat di Prancis, dengan tingkat kesalahan sekitar 8%. Setelah beralih ke GPT-5.5, kami mengumpulkan data dari sistem backend selama 7 hari, dan…Ketidakakuratan pengenalan alamat telah turun menjadi 0,7%.Tidak perlu lagi mengatur orang khusus untuk memeriksa informasi alamat.
- Kemudian, proses pemrosesan multimodal tidak perlu lagi dibagi menjadi beberapa tahap. Untuk gambar pengembalian barang yang dikirim oleh pengguna sebelumnya, kita perlu menjalankan model pengenalan gambar terlebih dahulu untuk mengekstrak informasi kerusakan, lalu hasilnya digunakan untuk menghasilkan tanggapan dari model besar. Sekarang, kita cukup memasukkan gambar dan permintaan teks dari pengguna langsung ke GPT-5.5, dan hasilnya bisa diperoleh dalam satu langkah saja. Dengan perubahan ini, waktu pemrosesan setiap permintaan telah berkurang dari rata-rata 2 detik menjadi hanya 400 milidetik.
- Yang terakhir adalah hal yang paling banyak dibahas oleh semua orang, yaitu biaya. Sebelumnya, biaya terkait model besar kami per bulan sekitar 12.000 euro, tetapi setelah beralih ke GPT-5.5, untuk jumlah permintaan yang sama, kami hanya menghabiskan 4.500 euro, yang berarti kami menghemat 62% dari biaya tersebut. Hematannya setara dengan gaji satu staf operasional paruh waktu tambahan.
Dua masalah tersembunyi yang kemungkinan besar akan Anda hadapi:

Jangan hanya melihat keuntungannya saja, pada hari pertama kami meluncurkan produk, kami sudah mengalami masalah: GPT-5.5 memiliki keinginan yang sangat kuat untuk melengkapi “permintaan yang tidak jelas”. Ada seorang pengguna yang hanya mengatakan “Saya ingin mengembalikan barang, alamatnya di jalan utama Amsterdam”, dan GPT-5.5 langsung menambahkan nomor rumah yang tidak ada, sehingga tag pengembalian barang yang dihasilkan salah, dan pengguna mengirimkannya ke gudang yang salah. Kami harus membayar ganti rugi sebesar 80 euro untuk biaya pengiriman.
Kesalahan kedua adalah biaya penyesuaian (tuning) khusus (custom tuning) yang digunakan lebih tinggi, sekitar 3 kali lipat dibandingkan dengan GPT-4o. Kami awalnya berencana untuk memasukkan data percakapan sejarah layanan pelanggan selama 2 tahun terakhir ke dalam proses penyesuaian tersebut, tetapi setelah menghitung biayanya, ternyata mencapai 2700 euro, yang jauh lebih mahal daripada 800 euro untuk GPT-4o. Akhirnya kami memutuskan untuk tidak melanjutkan proses penyesuaian tersebut dan beralih ke pendekatan pengoptimalan menggunakan prompt (prompt engineering), dan hasilnya juga tidak jauh berbeda.
Siapa yang seharusnya menggunakannya dan siapa yang tidak boleh, saya akan memberikan garis pemisah yang jelas untuk Anda.
Jika Anda merupakan tim kecil atau menengah yang bergerak di bidang bisnis lintas bahasa dan menghadapi banyak permintaan campuran berbagai format (seperti teks, gambar, dan audio pendek), terutama di industri e-commerce, logistik, atau layanan lokal, GPT-5.5 dapat membantu Anda menghemat banyak biaya dan tenaga kerja.
Tetapi jika bisnis Anda berfokus pada bahasa Mandarin saja, dan Anda memerlukan tingkat akurasi penalaran yang sangat tinggi (misalnya dalam diagnosis medis atau pengelolaan risiko keuangan), atau jika logika bisnis Anda dapat diatasi dengan menggunakan model terbuka dengan parameter yang sedikit, maka tidak ada alasan untuk beralih ke sistem lain; kemampuan tambahan dari sistem tersebut tidak akan berguna sama sekali bagi Anda.
3 saran spesifik untuk orang-orang yang ingin memulai
- Lakukan uji coba skala abu-abu (grayscale testing) selama 7 hari terlebih dahulu, jangan langsung mengimplementasikannya secara penuh. Alihkan 10% dari permintaan ke GPT-5.5 dan bandingkan hasilnya dengan model yang Anda gunakan saat ini. Fokuskan perhatian pada proporsi output yang tidak normal. Jangan seperti kami, yang baru saja mengalami masalah dengan fitur pengisian alamat (address completion) setelah sistem diluncurkan.
- Jika bisnis Anda melibatkan proses pengisian informasi, pastikan untuk menambahkan kalimat berikut ke dalam prompt: “Jika informasinya tidak lengkap, mintalah pengguna untuk melengkapi sendiri, jangan membuat kesimpulan secara sembarangan.” Hal ini dapat menghindari 90% dari masalah yang mungkin timbul akibat kesalahpahaman.
- Kecuali jika Anda memiliki lebih dari satu juta data annotasi, sebaiknya jangan mencoba teknik fine-tuning. Menggunakan pendekatan berbasis prompt engineering dan pemanggilan fungsi sudah cukup untuk menyelesaikan sebagian besar masalah, dan ini jauh lebih menguntungkan dari segi biaya.
Pertanyaan-pertanyaan kecil yang umum dan jawabannya
Pertanyaan: Apakah akan lebih mudah terkena pembatasan penggunaan (rate limiting) dibandingkan dengan GPT-4o? Jawaban: Kami telah menggunakannya selama sebulan, dengan puncak permintaan mencapai 120 permintaan per detik, dan tidak pernah mengalami masalah seperti kode kesalahan 429. Kuota yang diberikan oleh OpenAI untuk versi ini jauh lebih longgar dibandingkan dengan GPT-4o.
Pertanyaan: Apakah dukungan untuk panggilan multimodal setelah fine-tuning tersedia? Jawaban: Saat ini sudah didukung, tetapi konsumsi token model setelah fine-tuning akan meningkat sebesar 20%. Hitunglah biayanya dengan matang.
Tautan artikel:https://airai.cc/id/ai-news/34/
Apakah ini membantu?