Menu

Kami berhasil menurunkan tingkat kesalahan permintaan selama musim promosi menjadi 0,2% dengan menggunakan GPT-4 Turbo. Jangan lagi melakukan kesalahan-kesalahan ini.

Pada promosi Black Friday bulan lalu, tim kecil kami yang terdiri dari 3 orang yang berkecimpung dalam logistik lintas negara di Eropa, untuk pertama kalinya tidak mengalami masalah serius akibat permintaan verifikasi alamat pelanggan yang membuat kami semua harus bekerja sampai larut malam.

Pada periode yang sama tahun lalu, kami masih menggunakan GPT-4 biasa untuk proses standarisasi alamat. Pada saat puncak aktivitas, 13% dari permintaan mengalami kesalahan (kode error 429), dan kami menghabiskan waktu 36 jam hanya untuk menangani keluhan pelanggan. Tahun ini, setelah beralih ke GPT-4 Turbo, tidak ada satu kali pun terjadi pembatasan jumlah permintaan (throttling), dan tingkat kesalahan langsung turun drastis.0.2%。

Pertama-tama, mari kita pahami: Apa sebenarnya GPT-4 Turbo itu?

Singkatnya, OpenAI adalah versi dengan kapasitas pemrosesan yang lebih tinggi (high throughput) yang dikembangkan berdasarkan GPT-4, dan parameter kunci (core parameters) utamanya adalah…Jumlah permintaan yang dapat ditangani oleh satu akun per menit adalah 6 kali lebih banyak daripada GPT-4 biasa.Biaya per token juga telah berkurang setengahnya, dan ini merupakan optimisasi khusus untuk skenario dengan tingkat konvergensi yang tinggi.

3 Keuntungan Nyata bagi Tim Teknis Kecil dan Menengah

Yang paling langsung terasa adalah tidak perlu lagi repot dengan masalah pembatasan lalu lintas (traffic throttling). Kami memiliki rata-rata 500.000 permintaan pemecahan alamat (address resolution) per hari, dan sebelumnya kami perlu menggunakan tiga model besar dari platform yang berbeda untuk melakukan load balancing. Hanya untuk menyesuaikan gateway saja, kami perlu menulis lebih dari 1.000 baris kode. Sekarang, dengan hanya menggunakan GPT-4 Turbo, kami sudah mampu menangani lonjakan lalu lintas yang tiga kali lebih tinggi selama musim promosi.

Yang kedua adalah efisiensi pemrosesan teks panjang yang lebih tinggi. Kita seringkali perlu memasukkan seluruh halaman dokumen pengiriman lintas negara untuk melakukan ekstraksi informasi. Sebelumnya, GPT-4 biasanya perlu dibagi menjadi 3 permintaan karena panjang konteks yang tidak cukup, tetapi sekarang semuanya dapat diproses sekaligus, sehingga waktu yang dibutuhkan untuk satu tugas berkurang hingga dua pertiga.

Yang ketiga adalah penghematan biaya yang signifikan. Kami telah menghitung tagihan bulan lalu, dan untuk jumlah permintaan yang sama, biaya penggunaan GPT-4 Turbo hanya 28% dari solusi campuran model sebelumnya. Uang yang dihemat tersebut langsung digunakan untuk meningkatkan bonus kinerja tim selama dua bulan.

Jangan hanya melihat keuntungannya saja, kami sudah pernah mengalami 3 masalah (atau “kutukan”) ini.

Blue and yellow shipping containers aligned on a sandy beach with the ocean and sky in the background.

Pertama-tama, kesalahan yang kita buat adalah menganggap tugas dengan tingkat kompleksitas rendah sebagai hal yang tidak menguntungkan. Awalnya, kita mengerjakan semua permintaan verifikasi alamat, tetapi kemudian kami menemukan bahwa untuk tugas-tugas sederhana seperti memeriksa apakah sebuah alamat termasuk dalam Uni Eropa, penggunaan GPT-4 Turbo justru lebih mahal (3 kali lebih mahal) dibandingkan dengan model yang lebih ringan. Sekarang, kami telah mengalihkan permintaan-permintaan sederhana tersebut ke model yang lebih ringan.

Kesalahan kedua adalah bahwa durasi respons defaultnya justru sedikit lebih lama dibandingkan dengan GPT-4 biasa. Saat pertama kali beralih, kami menemukan bahwa sebagian kecil permintaan membutuhkan waktu lebih dari 200 milidetik untuk dijawab. Setelah itu, kami menyadari bahwa dalam mode throughput tinggi, prioritas diberikan kepada penghindaran penolakan permintaan, bukan kepada pencapaian latensi yang sangat rendah. Kami menyelesaikan masalah ini dengan mengatur parameter latensi rendah secara khusus untuk permintaan permukaan (frontend) yang membutuhkan respons cepat.

Kesalahan ketiga adalah kontrol tingkat detail terhadap akses hak (permissions) yang lebih terbatas. GPT-4 biasa memungkinkan pengguna untuk menyesuaikan parameter seperti ‘temperature’ dan ‘top_p’ model hingga rentang yang sangat presisi, namun rentang penyesuaian pada GPT-4 Turbo jauh lebih sempit. Untuk skenario yang memerlukan kontrol ketat terhadap gaya output (misalnya, saat kami membuat naskah pemberitahuan pengiriman barang untuk klien), kita masih harus kembali menggunakan versi GPT-4 biasa.

Siapa yang seharusnya menggunakannya? Dan siapa yang tidak perlu ikut-ikutan dalam keramaian ini?

Jika Anda adalah tim kecil atau menengah, dan memenuhi ketiga kondisi ini, langsung saja lakukan:

  • Setiap hari, terdapat lebih dari 100.000 permintaan konkuren dari model besar.
  • Seringkali diperlukan untuk menangani tugas teks panjang dengan konteks lebih dari 8k karakter.
  • Sebelumnya, seringkali perlu melakukan load balancing antar-model karena adanya batasan penggunaan (rate limiting).

Jika jumlah permintaan dari tim Anda kurang dari 10.000 per hari, atau semuanya merupakan tugas klasifikasi dan ekstraksi yang sederhana, maka tidak perlu mengganti model tersebut. Model ringan sudah cukup untuk digunakan, dan biayanya juga lebih rendah.

Dua saran praktis untuk memulai:

Pada minggu pertama, jangan langsung melakukan peralihan secara penuh. Awalnya, alihkan 10% dari permintaan teks panjang dengan tingkat konvensi yang tinggi ke sistem baru untuk uji coba (grayscale testing). Setelah melihat data pemantauan selama seminggu, barulah tingkatkan jumlah permintaan secara bertahap. Pada hari pertama, kami melakukan peralihan sebesar 30%, dan hampir saja terjadi kesalahan saat mengekstrak beberapa dokumen pengiriman karena parameter yang tidak disesuaikan dengan sistem baru.

Tidak perlu menyimpan terlalu banyak konteks terlebih dahulu; konteks sebesar 128k dari GPT-4 Turbo sudah cukup untuk mengatasi sebagian besar skenario tingkat perusahaan. Kami telah mencoba memasukkan seluruh isi kontrak logistik yang berisi 30 halaman ke dalam sistem untuk melakukan verifikasi ketentuan, dan hasilnya menunjukkan bahwa tingkat akurasi tidak berbeda, baik dengan metode pemrosesan secara keseluruhan maupun secara bertahap.

Dua pertanyaan yang sering diajukan oleh orang-orang

Q: Apakah kualitas outputnya akan lebih buruk dibandingkan dengan GPT-4 biasa?
A: Kami telah menjalankan 1000 tes pengverifikasi alamat, dengan tingkat akurasi sebesar 98,7%, yang hampir tidak berbeda dengan 98,9% dari GPT-4 biasa, sehingga cukup memadai untuk skenario perusahaan.

Q: Apakah perlu membuat ulang proyek Prompt?
A: Kami langsung menggunakan semua Prompt yang sebelumnya ditulis untuk GPT-4 biasa, tanpa melakukan perubahan apa pun, dan hasil yang dihasilkan sepenuhnya sesuai dengan harapan.

Apakah ini membantu?

Dukungan teknisDukungan langsung
侧栏
Kembali ke atas
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR