Sử dụng o1-mini để dự đoán chuỗi cung ứng: Chúng tôi đã tiết kiệm được 62% chi phí suy luận, nhưng cũng vấp phải 2 sai lầm nghiêm trọng.
Tháng trước, trong dịp Black Friday, nhóm của chúng tôi suýt nữa thì gặp rắc rối lớn.
Trước đây, chúng tôi luôn sử dụng các mô hình lớn để dự đoán nhu cầu phân phối hàng hóa tại khu vực Bắc Mỹ. Trong thời gian cao điểm, có tới hơn 18% yêu cầu được trả về kết quả “429” trong liên tục 3 ngày, khiến kế hoạch dự trữ hàng hóa của bộ phận vận hành trở nên hỗn loạn; sản phẩm bán chạy tại 3 tiểu bang đã bị trì hoãn giao hàng đến 48 giờ.
Nhu cầu thay đổi mô hình đã được ghi rõ là P0 ngay từ đầu; chúng tôi đã dành 7 ngày để thử nghiệm 4 phương án thay thế, và cuối cùng chọn phương án o1-mini. Đến nay, sau 22 ngày vận hành, mọi vấn đề đều đã được giải quyết, nhưng chúng tôi cũng gặp phải những trở ngại mà không ai nói trước.
Để giải thích cho những người chưa từng nghe về nó: o1-mini thực chất là gì?
Đó chính là mô hình suy luận nhẹ (lightweight inference model) do OpenAI phát triển, được tối ưu hóa đặc biệt để nâng cao tốc độ xử lý các nhiệm vụ liên quan đến logic và tính toán.Khả năng suy luận cơ bản chỉ kém các mô hình lớn chính khoảng 8% trở xuống, và chi phí cho mỗi token chỉ bằng 1/7 so với các mô hình lớn đó.。
Chúng tôi ban đầu đã tập trung vào sự chênh lệch về chi phí này, bởi vì nhiệm vụ dự đoán của chúng tôi yêu cầu phải xử lý hơn 3000 token dữ liệu đơn hàng lịch sử, thông tin thời tiết, và dữ liệu ngày lễ mỗi lần thực hiện, và quá trình này diễn ra gần 20.000 lần mỗi ngày.
Ba lợi ích trực quan nhất mà chúng tôi đã thực sự nhận được
- Đầu tiên, vấn đề về giới hạn lưu lượng đã được giải quyết hoàn toàn: Ngưỡng giới hạn lưu lượng cho một tài khoản trên o1-mini cao gấp 12 lần so với mô hình mà chúng tôi đã sử dụng trước đây; ngay cả trong ngày lễ Black Friday, khi lưu lượng đạt đỉnh, chúng tôi cũng không gặp phải tình trạng trang web bị “429” (không thể truy cập được). Kế hoạch vận hành đảm bảo không có độ trễ nào cả.
- Chi phí đã giảm đáng kể: Dựa trên dữ liệu hóa đơn của chúng tôi từ hệ thống nền tảng, khi thực hiện cùng một nhiệm vụ dự đoán,Chi phí suy luận hàng tháng đã giảm từ 12.000 đô la Mỹ xuống còn 4.500 đô la Mỹ.Tiền tiết kiệm được, chúng tôi đã sử dụng để bổ sung thêm 3 điểm dữ liệu thời gian thực cho các kho lưu trữ.
- Tốc độ nhanh đến mức có thể thực hiện các điều chỉnh theo thời gian thực: Trước đây, mô hình cần đợi hơn 20 giây để thực hiện một lần dự đoán, nhưng bây giờ hầu hết các yêu cầu được xử lý trong vòng 15 mili giây. Chúng tôi đã thay đổi cách cập nhật dữ liệu dự đoán từ mỗi ngày một lần thành mỗi 2 giờ một lần, và tỷ lệ hàng hóa không có sẵn đã giảm ngay 4 phần trăm.
Nhưng có hai trở ngại lớn; khi chúng ta gặp phải chúng, chúng ta suýt nữa phải quay lại trạng thái ban đầu (roll back).

Lỗi đầu tiên là khả năng xử lý dữ liệu không có cấu trúc của nó kém đến mức khủng khiếp.
Trong các đầu vào trước đây của chúng ta, có một phần chứa các từ khóa thảo luận của người dùng trên các nền tảng mạng xã hội, được sử dụng làm tham khảo cho sự biến động nhu cầu. Kết quả là hệ thống o1-mini đã coi những nội dung này là thông tin không hợp lệ, và dữ liệu dự báo trong 3 ngày đầu tiên thấp hơn nhu cầu thực tế tới 20%. May mắn thay, chúng ta có cơ chế kiểm tra chéo, nên không hề thực hiện việc chuẩn bị hàng hóa dựa trên những dữ liệu đó.
Cuối cùng, chúng ta chỉ có thể chạy một mô hình phân tích văn bản nhỏ để xử lý phần dữ liệu này trước, chuyển đổi nó thành các điểm số có cấu trúc rồi đưa vào o1-mini, như vậy mới có thể giải quyết vấn đề.
Lỗi thứ hai là cơ chế xử lý đa ngôn ngữ của nó có sự thiên vị ẩn.
Trong dự báo của khu vực Canada của chúng tôi, có các tên địa danh và tên sản phẩm bằng tiếng Pháp. Theo mặc định, hệ thống o1-mini sẽ tự động chuyển đổi một số danh mục bằng tiếng Pháp thành các danh mục tương đương bằng tiếng Anh, dẫn đến việc giá trị dự báo cho thiết bị trượt tuyết ở khu vực Quebec giảm đi một nửa. Chúng tôi đã khắc phục vấn đề này bằng cách thêm quy tắc bắt buộc phải giữ nguyên ngôn ngữ gốc trong các thông báo (prompt). Điều này hoàn toàn không được đề cập đến trong tài liệu chính thức của hệ thống.
Ai nên sử dụng và ai không nên sử dụng, chúng tôi đã giúp bạn phân định rõ ràng rồi.
Nếu bạn cũng giống như chúng tôi, làm công việc đó...Luận lý suy luận, tính toán số học, quyết định dựa trên quy tắcNếu nhiệm vụ đó yêu cầu xử lý dữ liệu với cấu trúc phức tạp, có yêu cầu cao về chi phí và khả năng xử lý đồng thời (concurrency), thì o1-mini gần như là lựa chọn lý tưởng không cần phải suy nghĩ nhiều.
Nhưng nếu bạn đang làm việc với việc tạo nội dung, hiểu biết đa phương thức, hoặc xử lý nhiều ngôn ngữ phức tạp, thì đừng dùng nó. Kết quả mà nó đưa ra có thể gây ra rất nhiều lỗi bất ngờ, và chi phí để khắc phục những lỗi đó sẽ còn cao hơn cả số tiền bạn tiết kiệm được.
Dưới đây là 2 lời khuyên cụ thể dành cho những người mới bắt đầu:
Trước hết, trước khi triển khai sản phẩm, bạn phải thực hiện ít nhất 7 ngày kiểm tra song song (parallel verification) trước khi chuyển toàn bộ lưu lượng truy cập (traffic) sang hệ thống mới. Đừng vội vàng chuyển toàn bộ lưu lượng ngay lập tức.
Ban đầu chúng tôi muốn tiết kiệm thời gian nên chỉ thực hiện việc này trong 3 ngày, và may mắn thay chúng tôi không gặp phải trường hợp nào cần nhập dữ liệu bằng tiếng Pháp, nếu không chúng tôi có thể gặp rất nhiều vấn đề. Chu kỳ 7 ngày có thể đủ để bao phủ hầu hết các trường hợp ngoại lệ trong hoạt động kinh doanh của bạn.
Thứ hai, đừng thay đổi các thông số nhiệt độ của nó một cách tùy tiện.
Ban đầu, chúng tôi muốn kết quả trở nên linh hoạt hơn nên đã điều chỉnh nhiệt độ xuống mức 0.7, nhưng dữ liệu dự đoán thu được có sự biến động lớn đến mức không thể sử dụng được. Sau đó, khi chúng tôi quay trở lại với khoảng giá trị được khuyến nghị chính thức là 0.1-0.3, mọi thứ mới trở nên ổn định. Vì bản chất của nó là thực hiện các nhiệm vụ suy luận mang tính chắc chắn, nếu bạn cần sự sáng tạo thì tốt hơn hết nên sử dụng các mô hình lớn (big models) thay vì nó.
Cuối cùng, xin trả lời một câu hỏi mà mọi người thường đặt: Liệu chúng ta có nên đợi đến phiên bản tiếp theo không?
Ít nhất trong tình huống dự báo chuỗi cung ứng, phiên bản o1-mini hiện tại đã đủ tốt rồi. Chúng tôi đã tính toán rằng ngay cả nếu phiên bản tiếp theo rẻ hơn 20%, thì cũng không thể bù đắp được chi phí nhân lực và sự cố mà chúng ta tiết kiệm được ngay bây giờ. Càng sử dụng sớm thì càng có lợi nhuận.
Liên kết bài viết:https://airai.cc/vi/ai-news/36/
Thông tin này có hữu ích không?