Menu

Kami telah meningkatkan tingkat akurasi pencocokan alamat logistik menggunakan OpenAI o1 hingga maksimal, namun kami menemukan 3 masalah yang tidak terduga.

Baru saja puncak penjualan Black Friday berlalu, tim backend kami yang terdiri dari 3 orang di Eropa akhirnya bisa bernapas lega: Tahun lalu, selama promo besar, ada 13% permintaan pemrosesan alamat yang mengalami error 429 akibat batasan penggunaan model tunggal. Tahun ini, tidak hanya tidak ada satu pun kasus pembatasan penggunaan model tersebut, tetapi tingkat kesalahan dalam pemetaan alamat juga turun sebesar 82%. Perubahan utama yang kami lakukan adalah mengganti model pemrosesan utama kami dengan model o1.

Untuk yang belum pernah mendengarnya sebelumnya: Apa sebenarnya itu o1?

Ini adalah model besar berbasis reinforcement learning yang dikembangkan oleh OpenAI, yang berbeda dari GPT-4o sebelumnya. Model ini akan menghabiskan lebih banyak waktu untuk “memikirkan” masalah logis yang kompleks. Skor tes kemampuan penalaran dasar yang diberikan oleh pihak resmi lebih tinggi sebesar 87% dibandingkan dengan GPT-4o, dan itulah alasan utama kami memilih model ini.

Bagi tim kecil dan menengah seperti kami, keuntungan dari o1 sangat nyata.

Manfaat pertama langsung menyelesaikan masalah pencocokan alamat yang paling mengganggu kami. Sebelum menggunakan GPT-4o, sering kali terjadi kekeliruan dalam mengenali jalan-jalan dengan nama yang sama atau kode pos yang sama di berbagai negara di Eropa, terutama ketika pengguna memasukkan alamat dengan ejaan yang salah. Kami perlu menambahkan tiga lapisan verifikasi aturan untuk mencapai tingkat akurasi sekitar 92%. Sekarang, dengan o1, tingkat akurasi telah meningkat menjadi 98,7%, dan kami sudah menghapus semua kode aturan tersebut minggu lalu.

Yang kedua adalah tidak perlu lagi membuat proyek prompt yang rumit. Sebelumnya, untuk membuat model menghasilkan hasil analisis yang sesuai dengan format backend kami, kami menulis prompt sepanjang hampir 2000 kata, dan sering kali terjadi masalah dengan format output yang tidak sesuai. Sekarang, hanya dengan satu baris instruksi saja, semuanya bisa diatasi, sehingga biaya pemeliharaan prompt langsung menjadi nol.

Yang ketiga adalah stabilitas permintaan konkuren (parallel requests) lebih baik dari yang kami duga. Kami awalnya khawatir bahwa waktu penyelesaian proses penalaran yang lama akan menyebabkan antrian, tetapi dari pemantauan, sebagian besar permintaan diselesaikan dalam waktu 15 detik. Hanya sebagian kecil permintaan yang sangat kompleks, terkait pencarian alamat lintas negara, yang membutuhkan waktu lebih dari 200 detik, dan itu masih dalam batas yang dapat diterima oleh kami.

Tapi celah-celahnya juga benar-benar bisa membuatmu terkejut dan tidak siap.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

Pertama-tama, masalah yang muncul adalah konsumsi token pada model ini jauh lebih tinggi dibandingkan dengan GPT-4o. Dalam tiga hari pertama setelah kami beralih ke model ini, biaya komputasi untuk proses penalaran langsung meningkat sebesar 2,3 kali. Setelah itu, kami menyadari bahwa model o1 secara otomatis juga menghitung proses pemikirannya ke dalam konsumsi token. Jika Anda tidak memerlukan informasi tentang logika penalarannya, pastikan untuk menonaktifkan output dari proses pemikiran tersebut dalam parameter pemanggilan model. Setelah kami menonaktifkannya, biaya komputasi langsung turun kembali ke tingkat sebelumnya, yaitu 1,2 kali, yang sudah cukup dapat diterima.

Kesalahan kedua adalah bahwa pendekatan tersebut tidak cocok untuk permintaan yang sederhana dan sering terjadi (high-frequency requests). Awalnya, untuk memudahkan, kami mengarahkan semua permintaan pencarian alamat ke o1. Namun, kami menemukan bahwa untuk alamat-alamat yang tidak memiliki kesalahan ejaan dan memiliki format yang standar, tingkat akurasi menggunakan o1 tidak berbeda dengan menggunakan GPT-4o, bahkan malah menghabiskan lebih banyak biaya. Sekarang kami telah menambahkan verifikasi awal yang sederhana, sehingga hanya permintaan yang tidak memenuhi format standar yang akan diarahkan ke o1, dan biayanya pun turun sebesar 30%.

Kesalahan ketiga adalah dukungan untuk input dalam bahasa non-Latin seperti bahasa Cina dan Arab masih belum stabil. Kami memiliki sejumlah kecil pengguna dari wilayah Timur Tengah, dan terkadang terjadi kesalahan pemrosesan alamat yang dikirim dalam bahasa Arab. Setelah kami melaporkan masalah ini kepada OpenAI, kami masih menunggu perbaikannya. Untuk sementara waktu, kami menggunakan aturan lokal sebagai tambahan untuk pemeriksaan.

Siapa yang seharusnya menggunakan o1? Siapa yang tidak boleh menyentuhnya sekarang?

Jika tugas yang Anda hadapi memerlukan penalaran logis—seperti pencocokan aturan yang kompleks, pemeriksaan berbagai kondisi, atau generasi kode sederhana—dan Anda sebelumnya mengalami batasan dalam akurasi saat menggunakan GPT-4o, maka menggantinya dengan GPT-1o bisa menjadi pilihan yang sangat menguntungkan dari segi rasio input terhadap output.

Tetapi jika yang Anda lakukan hanyalah klasifikasi teks sederhana, generasi konten, atau permintaan standarisasi yang sering terjadi, maka tidak perlu menggunakan o1 sama sekali; itu hanya pemborosan uang. GPT-4o atau bahkan GPT-3.5 sudah cukup untuk menyelesaikannya.

2 saran untuk pemula yang menggunakan produk ini untuk pertama kalinya

  • Mari kita gunakan 1000 data historis yang sebelumnya telah diproses dengan model lama untuk melakukan pengujian. Jangan langsung mengganti seluruh data, karena dengan cara ini kita bisa dengan cepat melihat apakah peningkatan akurasi dapat menutupi kenaikan biaya. Kami menguji selama 2 hari dan kemudian memutuskan untuk beralih ke model baru.
  • Ketika dipanggil, versi o1-mini akan dipilih terlebih dahulu. Untuk 90% skenario tim kecil dan menengah, kemampuan o1-mini sudah lebih dari cukup, dan harganya juga 60% lebih murah dibandingkan dengan versi o1 yang lengkap.

Pertanyaan terakhir yang sering diajukan oleh banyak orang: Apakah o1 akan segera digantikan oleh model lain? Setidaknya dalam skenario pemecahan alamat yang kami kerjakan, kami telah menguji semua model besar berbasis penalaran yang ada di pasaran saat ini, dan tidak ada satupun yang mampu melampaui akurasi o1. Setidaknya dalam enam bulan ke depan, o1 masih akan menjadi pilihan utama kami.

Apakah ini membantu?

Dukungan teknisDukungan langsung
侧栏
Kembali ke atas
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR