Menu

Setelah tim kami beralih menggunakan teknologi GPT-5 untuk pengenalan alamat, tingkat kesalahan (error rate) jenis 429 turun dari 13% menjadi 0,2%, namun kami menemui 2 masalah yang tidak terduga.

Bulan lalu, promosi besar Black Friday baru saja berakhir, dan kami, tim pengembangan backend, menghabiskan waktu selama 72 jam penuh memantau panel pemantauan. Tahun lalu, selama promosi besar, 13% dari permintaan pemrosesan alamat mengalami masalah dengan batasan bandwidth (429 error), dan tahun ini masalah tersebut akhirnya tidak terjadi lagi. Ada hanya satu perubahan utama yang kami lakukan: kami mengganti semua model umum yang digunakan sebelumnya dengan GPT-5 untuk memproses struktur alamat secara terstruktur.

Untuk yang belum mencobanya, mari jelaskan terlebih dahulu: Apa sebenarnya GPT-5 itu bagi kita dalam skenario seperti ini?

Itu adalah model besar berbasis multi-modal yang diperbarui oleh OpenAI tahun ini, dan hanya ada satu parameter penjagaan (parameter anchor) yang paling berguna bagi kita:Batas maksimum jumlah permintaan pemrosesan terstruktur yang dapat didukung oleh satu akun per menit adalah 12 kali lebih tinggi dibandingkan dengan model generasi sebelumnya.Dan tingkat akurasi dalam mengenali input yang tidak standar meningkat secara signifikan.

Kami menangani logistik lintas negara di Eropa, dan setiap hari kami harus memproses 500.000 alamat yang diisi oleh pengguna. Banyak orang sering mencampuradukkan nama jalan, kode pos, dan nama kota, bahkan menambahkan emoji secara sembarangan atau mengeja setengah dari alamat tersebut dengan salah. Model yang digunakan sebelumnya entah tidak dapat mengenali alamat tersebut dengan benar atau memerlukan 3 kali pemanggilan antarmuka (API) untuk mendapatkan hasil. Ketika terjadi lonjakan lalu lintas selama promosi besar, sistem langsung terbatas dalam kemampuannya untuk menangani permintaan.

Setelah beralih ke GPT-5, inilah 3 manfaat nyata yang kami dapatkan:

Yang paling langsung terlihat: masalah pembatasan lalu lintas (throttling) langsung teratasi,Selama puncak promosi, tingkat kesalahan 429 turun menjadi 0,2%.Kita bahkan tidak perlu menambahkan antrian model cadangan, sehingga menghemat 30% waktu operasional yang sebelumnya dihabiskan untuk penyeimbangan beban (load balancing).

Yang kedua adalah peningkatan akurasi pengenalan alamat; sebelumnya, sekitar 8% dari alamat perlu diverifikasi secara manual sekali lagi, dan sekarang persentasen tersebut telah turun ke di bawah 1%. Tim layanan pelanggan perlu menangani 2000 lebih sedikit permintaan koreksi alamat setiap minggunya.

Yang ketiga justru tidak banyak yang membicarakannya: fitur ini mendukung pengunggahan langsung foto formulir tulisan tangan untuk proses pengenalan (recognition), sehingga kita tidak perlu menggunakan layanan OCR terpisah untuk mengonversi foto tersebut menjadi teks. Dengan demikian, prosesnya menjadi lebih efisien karena menghilangkan dua langkah. Sebagian besar permintaan akan mendapatkan hasil dalam waktu kurang dari 15 detik, hanya formulir yang sangat kabur yang membutuhkan waktu lebih lama untuk diproses.

Jangan hanya melihat keuntungannya saja; dua kesalahan yang kami alami ini kemungkinan besar juga akan Anda hadapi juga.

Detailed view of programming code in a dark theme on a computer screen.

Masalah pertama adalah ketidakcocokan dalam penyesuaian ejaan dialek untuk wilayah berbahasa minoritas. Kami mengira kemampuan multibahasa sistem ini cukup baik, tetapi minggu lalu tingkat kesalahan pengenalan alamat dalam bahasa Basque di wilayah Spanyol tiba-tiba meningkat menjadi 12%. Setelah diteliti, kami menemukan bahwa jumlah sampel alamat dalam dialek minoritas seperti itu di data pelatihan sangat sedikit. Saat ini, kami hanya bisa menambahkan aturan lokal sebagai solusi sementara untuk alamat-alamat tersebut.

Kesalahan kedua adalah terkait biaya. Sebelumnya, kami menghitung bahwa biaya token per permintaan hanya naik 20% dibandingkan dengan generasi sebelumnya, tetapi kami lupa bahwa jumlah field struktural yang dikembalikan secara default telah bertambah sebanyak 3. Akibatnya, total biaya token justru meningkat menjadi 40%. Setelah itu, kami membatasi jumlah field yang dikembalikan dalam prompt hanya kepada yang benar-benar diperlukan, yaitu 5 field, sehingga biaya kembali ke level yang hanya naik 10% dibandingkan dengan generasi sebelumnya.

Tim mana yang sebaiknya langsung melanjutkan pekerjaannya, dan tim mana yang sama sekali tidak perlu disentuh?

  • Yang dibutuhkan: Setiap hari ada lebih dari 100.000 permintaan pemrosesan teks dan gambar yang tidak terstandarisasi. Tim-tim yang sebelumnya mengalami kendala karena batasan kapasitas model dan akurasi yang rendah, seperti perusahaan kecil dan menengah yang bergerak di bidang e-commerce, logistik, atau penanganan tiket pelanggan, akan melihat peningkatan ROI (Return on Investment) yang sangat signifikan setelah beralih menggunakan sistem ini.
  • Yang tidak seharusnya digunakan: Hanya untuk melakukan pertanyaan dan jawaban sederhana, atau untuk tim dengan jumlah permintaan kurang dari 10.000 per hari, sama sekali tidak perlu mengeluarkan uang untuk ini. Model generasi sebelumnya sudah cukup baik, dan bahkan bisa menghemat banyak biaya.

Dua saran spesifik untuk orang yang baru memulai:

Pertama, gunakan data permintaan historis Anda selama 7 hari terakhir sebagai kumpulan data uji coba. Jangan hanya menguji contoh yang diberikan oleh pihak resmi, terutama untuk konten yang berkaitan dengan bahasa minoritas atau wilayah yang jarang dijangkau. Pastikan untuk menguji terlebih dahulu untuk melihat tingkat akurasi sistem. Jika tidak, Anda akan menemukan masalah seperti penilaian yang salah setelah sistem diimplementasikan, dan itu akan sangat merepotkan.

Kedua, saat pemanggilan pertama, tuliskan langsung field hasil yang Anda butuhkan di dalam prompt, jangan biarkan sistem beroperasi secara acak. Jika tidak, konten tambahan yang dihasilkan akan menghabiskan banyak token yang tidak diperlukan.

Ada yang bertanya: Apakah saat ini masih perlu mengantri untuk mengajukan permohonan menggunakan GPT-5?

Kami adalah akun pengembang perusahaan, dan masa berlaku untuk pengajuan kualifikasi kami berakhir dalam 3 hari. Pengembang individu mungkin perlu menunggu 1-2 minggu. Namun, jika ada kebutuhan mendesak, kami dapat menggunakan jalur khusus perusahaan (green channel) sehingga dapat diaktifkan pada hari yang sama.

Apakah ini membantu?

Dukungan teknisDukungan langsung
侧栏
Kembali ke atas
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR