Chúng tôi đã sử dụng công cụ o3-mini để xử lý 1,2 triệu yêu cầu tạo mô tả sản phẩm, giúp tiết kiệm 62% chi phí suy luận.
Trước Lễ Đen tháng trước, dịch vụ tạo nội dung của chúng tôi suýt nữa bị sập: mô hình lớn chung mà chúng tôi đang sử dụng đột nhiên tăng giá 20%, đồng thời ngưỡng giới hạn lưu lượng cũng giảm đi một nửa. Trong thời gian cao điểm của việc kiểm thử, có tới 17% yêu cầu gặp lỗi 429. Nhóm vận hành liên tục hỏi liệu 12.000 mô tả sản phẩm giảm giá cần được đăng vào ngày hôm đó có thể hoàn thành đúng hạn hay không. Chúng tôi đã quyết định chuyển 30% lưu lượng sang hệ thống o3-mini, và cuối cùng không chỉ vượt qua được đợt khuyến mãi lớn này mà chi phí còn thấp hơn nhiều so với dự kiến.
Trước hết, hãy làm rõ xem o3-mini thực sự là gì.
Đó chính là mô hình suy luận nhẹ do OpenAI phát hành vào năm 2026 (Q1), tập trung vào việc tạo nội dung có cấu trúc và thực hiện các nhiệm vụ suy luận đơn giản với độ trễ thấp. Cửa sổ ngữ cảnh tối đa của nó là 128k, và chi phí cho mỗi token chỉ bằng 1/8 so với GPT-4o.
3 khoản lợi nhuận thiết thực nhất mà chúng ta đã đạt được

- Trong thời gian Black Friday, có 1,2 triệu yêu cầu được gửi để tạo mô tả sản phẩm.Chi phí lý luận tổng thể giảm 62% so với trước đây với GPT-4oKhông có kích hoạt một lần giới hạn dòng, ngay cả khi đó là yêu cầu cao điểm 1 giờ trước khi bắt đầu khuyến mãi cũng nhận được tất cả.
- Hầu hết các yêu cầu đều nhận được kết quả trong vòng 18 mili giây; trước đây, khi sử dụng các mô hình lớn, đôi khi có sự chậm trễ lên đến vài trăm mili giây. Chúng tôi đã loại bỏ hoàn toàn thông báo chờ đợi khi nội dung trang front-end được tải, và tỷ lệ chuyển đổi của người dùng đã tăng thêm 0,8 phần trăm.
- Khả năng tạo nội dung đa ngôn ngữ tích hợp sẵn không yêu cầu chúng tôi phải thực hiện bất kỳ điều chỉnh nào thêm; tỷ lệ chính xác khi tạo nội dung bằng tiếng Bồ Đào Nha và tiếng Tây Ban Nha cho trang web tại khu vực Mỹ Latinh đã tăng lên 21% so với các mô hình nhỏ mà chúng tôi tự điều chỉnh trước đây. Điều này giúp nhân viên vận hành không cần phải dành thời gian để kiểm tra lại nội dung.
Đừng vội vàng thực hiện việc chuyển đổi toàn bộ ngay lập tức; chúng tôi đã từng gặp phải những vấn đề tương tự trước đây rồi.

Đừng sử dụng nó để thực hiện các logic phức tạp trong việc đề xuất sản phẩm. Ban đầu, chúng tôi đã thử cho dữ liệu trình duyệt của người dùng vào hệ thống để tạo ra nội dung đề xuất cá nhân hóa, nhưng trong 10 lần thử nghiệm, có 3 lần xảy ra sai lầm liên quan đến sự kết hợp các sản phẩm không phù hợp; ví dụ, đoạn văn đề xuất về lều ngoài trời lại được hiển thị dưới mục đèn cắm trại. Cuối cùng, chúng tôi đã quyết định loại bỏ phần này và trở lại sử dụng mô hình lớn (big model) để tạo ra nội dung đề xuất.
Ngoài ra, nếu doanh nghiệp của bạn cần sử dụng các công cụ hỗ trợ, hiện tại chúng chỉ hỗ trợ tối đa 3 lần gọi công cụ song song. Nếu vượt quá con số này, có thể xảy ra tình trạng một số công cụ không được thực thi hoặc trả về dữ liệu sai. Chúng tôi đã gặp phải vài trường hợp giá cả được hiển thị không chính xác khi thực hiện truy vấn kho hàng quá 2 lần. Giờ đây, hệ thống đã được cập nhật để tự động chuyển hướng các yêu cầu gọi công cụ vượt quá 2 lần sang mô hình máy học tổng quát (general large model).
Ai phù hợp với nó thì nên sử dụng, còn ai thì hoàn toàn không cần phải đụng vào nó.
Nếu scénario kinh doanh của bạn là tạo ra nội dung có cấu trúc theo lô, thực hiện nhận diện ý định người dùng một cách đơn giản, hoặc trả lời các câu hỏi thường gặp (FAQ) một cách tự động, đặc biệt là đối với các doanh nghiệp vừa và nhỏ không có nguồn lực tính toán dư thừa để tự điều chỉnh các mô hình nhỏ, thì o3-mini chắc chắn là lựa chọn có giá trị nhất về mặt tỷ lệ giá cả so với chất lượng.
Nhưng nếu bạn cần gỡ lỗi mã phức tạp, suy luận logic qua nhiều bước, hoặc phân tích sâu rộng các tài liệu dài, thì tốt hơn hết nên chọn các mô hình tổng quát (general models). Trong trường hợp đó, tỷ lệ đáp án chính xác của o3-mini sẽ giảm đáng kể, và bạn sẽ mất nhiều thời gian hơn để kiểm tra kết quả.
2 lời khuyên thực hành dành cho người sử dụng lần đầu

Trước tiên, hãy thực hiện việc triển khai dần dần (grayscale) trên lưu lượng truy cập trong vòng 7 ngày, đừng thực hiện thay đổi toàn bộ ngay lập tức. Ban đầu, chúng tôi đã triển khai các tính năng liên quan đến nhãn sản phẩm không quan trọng trong 3 ngày để xác nhận rằng tỷ lệ lỗi nằm trong phạm vi chấp nhận được, sau đó mới từ từ chuyển sang các tính năng liên quan đến mô tả sản phẩm – những tính năng quan trọng hơn – để tránh gây ảnh hưởng đến hoạt động kinh doanh trực tuyến.
Chúng ta có thể tự xây dựng một lớp định tuyến đơn giản để phân loại các yêu cầu theo mức độ phức tạp: những yêu cầu đơn giản sẽ được xử lý bởi o3-mini, trong khi những yêu cầu phức tạp sẽ tự động được chuyển đến các mô hình lớn. Cách này không chỉ giúp tiết kiệm chi phí mà còn không ảnh hưởng đến hiệu quả xử lý trong các trường hợp phức tạp. Đó chính là những gì chúng ta đang làm hiện nay – 90% yêu cầu được xử lý bởi o3-mini, và 10% yêu cầu phức tạp còn lại được xử lý bởi các mô hình lớn, giúp giảm chi phí tổng thể hơn một nửa.
Các vấn đề nhỏ thường gặp
Câu hỏi: Có nên điều chỉnh nhỏ cho o3-mini không? Trả lời: Nếu bạn đang sử dụng nó cho việc tạo nội dung tổng quát, thì hoàn toàn không cần thiết; hiệu quả ban đầu đã rất tốt rồi. Tuy nhiên, nếu bạn đang làm việc với nội dung chứa nhiều thuật ngữ chuyên ngành cụ thể của từng ngành, bạn có thể cung cấp vài trăm mẫu dữ liệu để thực hiện việc điều chỉnh. Sau khi điều chỉnh, độ chính xác của mô tả sản phẩm trong lĩnh vực phụ tùng ô tô của chúng tôi đã tăng lên 14%, trong khi chi phí chỉ tăng thêm 5%.
Câu hỏi: Dữ liệu có an toàn không? Trả lời: Theo mặc định, dữ liệu do người dùng nhập vào sẽ không được sử dụng để huấn luyện mô hình. Nếu bạn có yêu cầu về tuân thủ quy định, bạn có thể chọn phiên bản dịch vụ dành riêng, với chi phí cao hơn 30%, nhưng dữ liệu sẽ được cô lập hoàn toàn, phù hợp cho việc xử lý nội dung liên quan đến quyền riêng tư của người dùng.
Liên kết bài viết:https://airai.cc/vi/ai-news/37/
Thông tin này có hữu ích không?