Menu

Chúng tôi đã nâng cao tỷ lệ độ chính xác trong việc ghép đôi địa chỉ logistics bằng công cụ OpenAI o1, nhưng lại gặp phải 3 vấn đề không ngờ tới.

Cuối tuần trước, ngay sau khi đỉnh điểm của ngày Black Friday qua đi, nhóm phát triển phần mềm backend gồm 3 người tại châu Âu của chúng tôi đã thở phào nhẹ nhõm: Năm ngoái, trong đợt khuyến mãi lớn, có 13% yêu cầu giải quyết địa chỉ bị từ chối do giới hạn lưu lượng của mô hình duy nhất, dẫn đến lỗi 429. Năm nay, không chỉ không xảy ra trường hợp nào về giới hạn lưu lượng, mà tỷ lệ lỗi trong việc phân tích địa chỉ còn giảm xuống 82%. Thay đổi chính là chúng tôi đã thay thế mô hình suy luận chính bằng mô hình o1.

Để giải thích cho những người chưa từng tiếp xúc trước đây: o1 thực chất là gì?

Đó chính là mô hình lớn được tăng cường khả năng suy luận do OpenAI phát triển, khác với GPT-4o trước đây. Nó sẽ dành nhiều thời gian hơn để “suy nghĩ” về các vấn đề logic phức tạp, và điểm số trong bài kiểm tra khả năng suy luận cơ bản mà nhà phát triển đưa ra cao hơn GPT-4o đến 87%. Chúng tôi đã chọn nó ngay từ đầu dựa trên chỉ số này.

Đối với những đội ngũ nhỏ và vừa như chúng tôi, lợi ích của o1 thực sự rất rõ ràng.

Lợi ích đầu tiên giải quyết trực tiếp vấn đề khó chịu nhất của chúng tôi, đó là vấn đề phân tích địa chỉ. Khi sử dụng GPT-4o trước đây, chúng tôi thường xuyên gặp phải tình trạng nhầm lẫn giữa các con phố có cùng tên ở các quốc gia khác nhau ở châu Âu và các mã bưu chính trùng lặp, đặc biệt là khi người dùng nhập địa chỉ có lỗi chính tả. Chúng tôi phải áp dụng tới 3 lớp quy tắc kiểm tra để đạt được tỷ lệ chính xác khoảng 92%. Giờ đây, với phiên bản o1, tỷ lệ chính xác đã được nâng lên tới 98.7%, và chúng tôi đã xóa toàn bộ đoạn mã quy tắc đó vào tuần trước.

Thứ hai là không cần phải thực hiện các công việc phức tạp liên quan đến việc xây dựng hệ thống prompt nữa. Trước đây, để cho mô hình đưa ra kết quả phân tích phù hợp với định dạng của hệ thống chúng tôi, chúng tôi đã viết mã cho hệ thống prompt dài gần 2000 từ, và thường xuyên gặp phải tình trạng định dạng đầu ra bị lệch. Bây giờ, chỉ cần một dòng lệnh là có thể giải quyết được vấn đề, giúp giảm chi phí bảo trì hệ thống prompt xuống mức 0.

Điểm thứ ba là độ ổn định của các yêu cầu đồng thời tốt hơn chúng ta tưởng tượng. Ban đầu chúng tôi lo lắng rằng thời gian xử lý dài sẽ dẫn đến tình trạng xếp hàng, nhưng theo dõi thì hầu hết các yêu cầu được hoàn thành trong vòng 15ms, chỉ có một số ít trường hợp đặc biệt phức tạp liên quan đến việc tìm kiếm địa chỉ xuyên quốc gia mà thời gian xử lý vượt quá 200ms, và điều này hoàn toàn nằm trong phạm vi chấp nhận được của chúng tôi.

Nhưng những “cạm bẫy” của nó thực sự có thể khiến bạn bị bất ngờ đến mức không kịp phản ứng.

Scrabble tiles spelling "CHATGPT" on wooden surface, emphasizing AI language models.

Lỗi đầu tiên là mức tiêu thụ token cao hơn nhiều so với GPT-4o. Trong 3 ngày đầu tiên chúng tôi chuyển sang sử dụng GPT-4o, chi phí suy luận tăng thẳng lên gấp 2,3 lần. Sau đó chúng tôi mới phát hiện ra rằng GPT-4o tự động tính cả quá trình suy luận của nó vào tổng số token được tiêu thụ. Nếu bạn không cần xem quá trình suy luận đó, bạn nhất định phải tắt tính năng hiển thị kết quả suy luận trong các tham số được truyền vào hệ thống. Khi chúng tôi tắt tính năng này, chi phí suy luận giảm xuống còn mức 1,2 lần so với trước, và điều đó hoàn toàn chấp nhận được.

Lỗi thứ hai là phương pháp này không phù hợp với những yêu cầu đơn giản và có tần suất cao. Ban đầu, để tiết kiệm công sức, chúng tôi đã chuyển tất cả các yêu cầu truy vấn địa chỉ sang hệ thống o1. Sau đó, chúng tôi nhận thấy rằng đối với những địa chỉ không có lỗi chính tả và có định dạng chuẩn, tỷ lệ chính xác khi sử dụng o1 và GPT-4o không khác nhau gì, thậm chí còn tốn kém hơn. Hiện tại, chúng tôi đã thêm một bước kiểm tra đầu vào đơn giản; chỉ những yêu cầu không tuân thủ định dạng chuẩn mới được chuyển đến hệ thống o1, và chi phí đã giảm thêm 30%.

Lỗi thứ ba là sự hỗ trợ cho các ngôn ngữ không thuộc hệ Latinh như tiếng Trung và tiếng Ả Rập vẫn chưa đủ ổn định. Chúng tôi có một số người dùng từ khu vực Trung Đông, và đôi khi xảy ra lỗi khi họ nhập địa chỉ bằng tiếng Ả Rập. Sau khi chúng tôi báo cáo vấn đề này cho OpenAI, chúng tôi vẫn đang chờ sự khắc phục. Hiện tại, chúng tôi vẫn sử dụng các quy tắc địa phương để thực hiện kiểm tra bổ sung.

Ai nên sử dụng o1? Ai đang không được phép chạm vào nó bây giờ?

Nếu bạn đang đối mặt với những nhiệm vụ đòi hỏi khả năng suy luận logic – chẳng hạn như phân tích các quy tắc phức tạp, kiểm tra đa điều kiện, hoặc tạo ra mã nguồn đơn giản – và bạn đã gặp phải giới hạn về độ chính xác khi sử dụng GPT-4o, thì việc chuyển sang sử dụng o1 sẽ mang lại tỷ lệ lợi nhuận rất cao.

Nhưng nếu bạn chỉ thực hiện các công việc như phân loại văn bản đơn giản, tạo nội dung, hoặc xử lý các yêu cầu tiêu chuẩn hóa thường xuyên, thì hoàn toàn không cần phải sử dụng công cụ o1; đó chỉ là sự lãng phí tiền bạc mà thôi. Các mô hình như GPT-4o hoặc thậm chí GPT-3.5 cũng có thể đáp ứng tốt những nhu cầu đó.

2 lời khuyên dành cho người mới sử dụng lần đầu

  • Trước hết, hãy sử dụng 1000 dữ liệu lịch sử mà bạn đã xử lý bằng mô hình cũ để thử nghiệm. Đừng thay đổi toàn bộ dữ liệu một lúc; bạn có thể nhanh chóng nhận thấy liệu sự cải thiện về độ chính xác có đủ để bù đắp cho chi phí tăng lên hay không. Chúng tôi đã thử nghiệm trong 2 ngày và quyết định rằng cần phải thay đổi mô hình.
  • Khi gọi dịch vụ, phiên bản o1-mini sẽ được ưu tiên lựa chọn. Đối với 90% các đội ngũ vừa và nhỏ, khả năng của o1-mini hoàn toàn đáp ứng được nhu cầu, và giá cả của nó còn rẻ hơn 60% so với phiên bản o1 đầy đủ.

Cuối cùng, xin trả lời một câu hỏi mà mọi người thường hỏi nhất: Liệu o1 có sẽ bị thay thế bởi các mô hình khác trong thời gian ngắn không? Ít nhất trong tình huống giải quyết địa chỉ mà chúng tôi đang thực hiện, chúng tôi đã kiểm tra tất cả các mô hình trí tuệ nhân tạo lớn hiện có trên thị trường, và không có mô hình nào có độ chính xác vượt qua được o1. Ít nhất trong nửa năm tới, o1 vẫn sẽ là lựa chọn hàng đầu của chúng tôi.

Thông tin này có hữu ích không?

Hỗ trợ kỹ thuậtHỗ trợ trực tuyến
侧栏
Về đầu trang
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR