Kami menggunakan o3-mini untuk menangani generasi permintaan deskripsi produk sebanyak 1,2 juta kali selama periode Black Friday, dan dengan ini kami menghemat 62% dari biaya penalaran (reasoning costs).
Bulan lalu, tepat sebelum Black Friday, layanan generasi konten kami hampir tidak berfungsi: model umum yang kami gunakan tiba-tiba mengalami kenaikan harga sebesar 20%, dan batas penggunaan (throttling threshold) juga dipotong menjadi setengahnya. Pada saat puncak pengujian, sebanyak 17% permintaan mengalami kesalahan (error code 429). Tim operasional terus menanyakan apakah deskripsi produk diskon sebanyak 12.000 yang harus dipublikasikan pada hari itu dapat selesai tepat waktu. Dengan sikap mencoba, kami memindahkan 30% dari beban kerja ke sistem o3-mini, dan akhirnya tidak hanya berhasil menangani seluruh promosi tersebut, tetapi biayanya juga jauh lebih rendah dari yang kami perkirakan.
Pertama-tama, kita harus memahami apa itu o3-mini.
Ini adalah model penalaran ringan yang baru saja diluncurkan oleh OpenAI pada tahun 2026 oleh Q1. Ini berfokus pada pembuatan konten terstruktur dan tugas penalaran sederhana dengan latensi rendah. Jendela konteks maksimum adalah 128k, dan biaya token hanya 1 / 8 dari GPT-4o.
3 keuntungan terbesar yang telah kami peroleh hingga saat ini

- Selama periode Black Friday, terdapat 1,2 juta permintaan untuk generasi deskripsi produk.Biaya keseluruhan untuk proses penalaran telah turun sebesar 62% dibandingkan dengan penggunaan GPT-4o sebelumnya.Tidak pernah ada satu kali pun pelanggaran batas penggunaan (throttling) yang terjadi, bahkan permintaan puncak yang muncul 1 jam sebelum promosi dimulai pun semuanya berhasil ditangani.
- Sebagian besar permintaan mendapatkan hasil dalam waktu 18 milidetik, sedangkan sebelumnya menggunakan model besar terkadang ada keterlambatan hingga beberapa ratus milidetik. Kami telah menghilangkan tampilan pesan penungguan saat konten frontend dimuat, dan hasilnya adalah tingkat konversi pengguna meningkat sebesar 0,8 persentase poin.
- Kemampuan generasi berbahasa multibahasa yang sudah terintegrasi tidak memerlukan penyesuaian tambahan dari kami; tingkat akurasi generasi deskripsi dalam bahasa Portugis dan Spanyol untuk situs di Amerika Latin telah meningkat sebesar 21% dibandingkan dengan model kecil yang sebelumnya kami sesuaikan secara manual. Dengan demikian, tidak perlu lagi waktu dari tim operasional untuk melakukan koreksi kedua.
Jangan terburu-buru untuk melakukan konversi secara penuh; kami sudah mengalami beberapa masalah yang serupa sebelumnya.

Jangan gunakan algoritma tersebut untuk melakukan penalaran logis yang kompleks dalam rekomendasi produk. Awalnya kami mencoba memberikan urutan halaman yang dibuka oleh pengguna ke algoritma tersebut untuk menghasilkan teks rekomendasi yang personalisasi, dan dari 10 kali percobaan, terjadi 3 kali kesalahan koneksi, seperti mengirimkan teks rekomendasi untuk tenda luar ruangan ke bagian yang berisi informasi tentang lampu berkemah. Akhirnya, kami memutuskan untuk kembali menggunakan model besar (model utama) untuk proses rekomendasi tersebut.
Jika bisnis Anda memerlukan pemanggilan alat (tools), saat ini hanya mendukung pemanggilan alat secara paralel hingga 3 alat saja. Jika melebihi batas tersebut, entah pemanggilan tersebut akan terlewat atau akan mengembalikan kesalahan parameter. Kami pernah mengalami masalah beberapa kali di mana harga yang ditampilkan tidak akurat ketika melakukan pemanggilan kueri inventaris lebih dari 2 kali. Sekarang, sistem telah diubah sehingga jika ada lebih dari 2 alat yang dipanggil, pemanggilan tersebut akan secara otomatis dialihkan ke model besar yang umum digunakan.
Siapa yang cocok untuk menggunakannya, dan siapa yang sama sekali tidak perlu menyentuhnya
Jika skenario bisnis Anda adalah menghasilkan konten terstruktur dalam jumlah besar, melakukan pemetaan niat pengguna yang sederhana, atau memberikan jawaban untuk pertanyaan umum (FAQ) secara rutin, terutama bagi perusahaan kecil dan menengah yang tidak memiliki sumber daya komputasi tambahan untuk menyesuaikan model kecil secara mandiri, o3-mini pasti merupakan pilihan dengan nilai terbaik untuk uang yang dikeluarkan.
Namun, jika Anda perlu melakukan debugging kode yang kompleks, penalaran logis yang melibatkan beberapa langkah, atau analisis mendalam terhadap dokumen yang panjang, lebih baik memilih model umum yang lebih besar. Dalam hal ini, tingkat akurasi output dari o3-mini akan menurun secara signifikan, dan Anda akan menghabiskan lebih banyak waktu untuk memverifikasi hasilnya.
2 saran praktis untuk pengguna pertama

Mulailah dengan melakukan uji coba penggunaan fitur tersebut secara bertahap selama 7 hari, tanpa langsung menerapkannya secara penuh. Pada awalnya, kami menerapkan fitur tersebut pada skenario penggunaan tag produk yang tidak esensial selama 3 hari, dan setelah memastikan tingkat kesalahan berada dalam batas yang dapat diterima, barulah kami secara bertahap menerapkannya pada skenario penggunaan deskripsi produk yang lebih penting, untuk menghindari masalah yang dapat mempengaruhi operasional bisnis secara langsung.
Kita bisa membuat lapisan routing yang sederhana sendiri untuk mengklasifikasikan permintaan berdasarkan tingkat kompleksitasnya; permintaan yang sederhana akan diarahkan ke o3-mini, sedangkan permintaan yang kompleks akan secara otomatis dialihkan ke model besar. Dengan cara ini, kita dapat menghemat biaya tanpa mengorbankan kualitas hasil untuk skenario yang lebih rumit. Itulah yang kita lakukan sekarang—90% permintaan diarahkan ke o3-mini, dan sisanya (10% permintaan yang kompleks) diarahkan ke model besar, sehingga total biaya kami berkurang lebih dari setengah.
Masalah Kecil yang Umum Terjadi
Pertanyaan: Apakah perlu melakukan penyesuaian kecil (fine-tuning) pada o3-mini? Jawaban: Jika skenario Anda adalah generasi konten umum, maka tidak perlu sama sekali; efek aslinya sudah cukup baik. Namun, jika skenario Anda melibatkan banyak istilah khusus industri, Anda bisa memberikan beberapa ratus contoh data untuk melakukan penyesuaian. Setelah melakukan penyesuaian pada deskripsi produk peralatan otomotif, tingkat akurasi meningkat sebesar 14%, sementara biayanya hanya naik sebesar 5%.
Pertanyaan: Apakah data aman? Jawaban: Secara default, model tidak dilatih menggunakan data yang dimasukkan oleh pengguna. Jika Anda memiliki kebutuhan terkait kepatuhan, Anda dapat memilih untuk menggunakan instance khusus, yang biayanya akan lebih mahal sebesar 30%, tetapi data akan sepenuhnya terisolasi, cocok untuk pemrosesan konten yang berkaitan dengan privasi pengguna.
Tautan artikel:https://airai.cc/id/ai-news/37/
Apakah ini membantu?