Chúng tôi đã giảm tỷ lệ lỗi trong các yêu cầu mùa khuyến mãi xuống còn 0.2% nhờ vào GPT-4 Turbo; đừng mắc phải 3 sai lầm này nữa.
Trong chương trình khuyến mãi Black Friday tháng trước, nhóm chúng tôi gồm 3 người chuyên về logistics xuyên biên giới châu Âu lần đầu tiên không phải thức trắng đêm vì các yêu cầu kiểm tra địa chỉ khách hàng.
Năm ngoái, chúng tôi vẫn sử dụng GPT-4 thông thường để tiêu chuẩn hóa địa chỉ; trong giờ cao điểm, 13% yêu cầu bị trả về lỗi 429, và chỉ riêng việc xử lý khiếu nại từ khách hàng đã mất tới 36 giờ. Năm nay, sau khi chuyển sang sử dụng GPT-4 Turbo, chúng tôi không gặp phải bất kỳ trường hợp nào bị giới hạn lưu lượng, và tỷ lệ lỗi đã giảm xuống mức thấp.0.2%。
Trước hết, hãy tìm hiểu xem GPT-4 Turbo thực sự là gì?
Nói một cách đơn giản, đây là phiên bản OpenAI với tốc độ xử lý cao hơn, được cải tiến dựa trên GPT-4, và điểm định tâm (anchor point) của các tham số cốt lõi là...Mỗi tài khoản hỗ trợ số lượng yêu cầu mỗi phút gấp 6 lần so với GPT-4 thông thường.Đồng thời, chi phí cho mỗi token cũng giảm một nửa, đây là một tối ưu hóa được thực hiện đặc biệt cho các scénario có mật độ xử lý cao (high-concurrency scenarios).
3 lợi ích thực tế cho các nhóm kỹ thuật nhỏ và vừa
Điều trực tiếp nhất là chúng tôi không còn phải lo lắng về vấn đề giới hạn lưu lượng nữa. Chúng tôi có khoảng 500.000 yêu cầu giải mã địa chỉ mỗi ngày, và trước đây chúng tôi đã sử dụng 3 mô hình lớn từ các nền tảng khác nhau để thực hiện công tác phân bổ tải (load balancing). Chỉ riêng việc điều chỉnh cổng (gateway) đã đòi hỏi việc viết hơn 1000 dòng mã. Bây giờ, chỉ cần sử dụng GPT-4 Turbo, chúng tôi có thể đáp ứng được lưu lượng cao gấp ba lần trong mùa khuyến mãi.
Điểm thứ hai là hiệu suất xử lý văn bản dài rất cao. Chúng tôi thường xuyên cần nhập toàn bộ nội dung của một trang hồ sơ khai báo hải quan xuyên biên giới để trích xuất thông tin, và trước đây GPT-4 thường phải chia thành 3 lần yêu cầu do độ dài ngữ cảnh không đủ. Giờ đây, chúng ta có thể xử lý hết tất cả trong một lần, giúp giảm thời gian thực hiện mỗi nhiệm vụ xuống còn khoảng hai phần ba.
Điểm thứ ba là chi phí thực sự được tiết kiệm. Chúng tôi đã tính toán hóa đơn của tháng trước và thấy rằng với cùng lượng yêu cầu, chi phí sử dụng GPT-4 Turbo chỉ bằng 28% so với giải pháp kết hợp nhiều mô hình trước đây; số tiền tiết kiệm được đã được dùng để tăng lương cho đội ngũ trong vòng hai tháng.
Đừng chỉ nhìn vào những mặt tích cực, chúng ta đã từng gặp phải 3 rắc rối này.

Lỗi thứ nhất là việc sử dụng các tác vụ có độ phức tạp thấp lại không mang lại lợi ích như mong đợi. Ban đầu, chúng tôi chuyển tất cả yêu cầu kiểm tra địa chỉ sang các hệ thống tương ứng, nhưng sau đó nhận thấy rằng việc sử dụng GPT-4 Turbo để thực hiện những tác vụ đơn giản như “xác định xem địa chỉ có thuộc về Liên minh Châu Âu hay không” tốn kém gấp ba lần so với việc sử dụng các mô hình nhẹ hơn. Hiện tại, chúng tôi đã chuyển những yêu cầu đơn giản này sang các mô hình có khả năng xử lý tốt hơn.
Lỗi thứ hai là thời gian phản hồi mặc định lại dài hơn một chút so với GPT-4 thông thường. Khi chúng tôi mới chuyển đổi, chúng tôi nhận thấy một số yêu cầu phải chờ hơn 200ms, sau đó mới biết rằng trong chế độ xử lý cao (high throughput), ưu tiên được đặt vào việc đảm bảo rằng các yêu cầu không bị từ chối, chứ không phải là đạt được độ trễ thấp nhất. Chúng tôi đã giải quyết vấn đề này bằng cách thiết lập các tham số độ trễ thấp riêng biệt cho những yêu cầu truy vấn phía trước cần được xử lý nhanh chóng.
Lỗi thứ ba là việc kiểm soát quyền truy cập ở mức độ chi tiết (fine-grained control) bị hạn chế hơn. GPT-4 thông thường cho phép người dùng tự định các tham số như “temperature” và “top_p” trong mô hình ở một phạm vi rất chính xác, nhưng với GPT-4 Turbo, phạm vi điều chỉnh bị thu hẹp đáng kể. Điều này khiến việc kiểm soát chính xác phong cách đầu ra trở nên khó khăn hơn, đặc biệt trong những trường hợp cần sự chính xác cao (chẳng hạn như việc tạo văn bản thông báo hải quan cho khách hàng). Trong những trường hợp như vậy, chúng ta vẫn phải sử dụng phiên bản GPT-4 thông thường.
Ai nên sử dụng nó? Ai lại không cần phải tham gia vào sự huyên náo này?
Nếu bạn là một nhóm nhỏ hoặc vừa, và bạn đáp ứng đủ ba điều kiện này, hãy thực hiện ngay:
- Mỗi ngày có hơn 100.000 yêu cầu đồng thời từ các mô hình lớn
- Thường xuyên cần xử lý các nhiệm vụ với văn bản dài có độ dài vượt quá 8k từ.
- Trước đây, thường xuyên phải thực hiện phân bổ tải giữa các mô hình khác nhau để đáp ứng yêu cầu giới hạn lưu lượng truy cập.
Nếu lượng yêu cầu mỗi ngày của đội bạn dưới 10.000, hoặc tất cả đều là các nhiệm vụ phân loại, trích xuất đơn giản, thì hoàn toàn không cần phải thay đổi; mô hình nhẹ là đủ sử dụng, và chi phí cũng thấp hơn nhiều.
2 lời khuyên cụ thể để bắt đầu
Trong tuần đầu tiên, đừng chuyển toàn bộ hệ thống ngay lập tức; hãy chuyển 10% lượng yêu cầu văn bản dài với mức độ đồng thời cao sang hệ thống mới để thực hiện việc triển khai dần dần (phương thức “grayscale”). Sau đó, dựa trên dữ liệu giám sát trong một tuần, hãy tăng lượng yêu cầu từng bước. Lần đầu tiên chúng tôi thực hiện việc chuyển đổi, chúng tôi đã chuyển 30% lượng yêu cầu, và suýt nữa gây ra lỗi trong việc trích xuất một số hồ sơ khai báo hải quan do không điều chỉnh các tham số phù hợp.
Không cần phải chuẩn bị quá nhiều thông tin ngữ cảnh trước, bộ nhớ ngữ cảnh 128k của GPT-4 Turbo đã đủ để xử lý hầu hết các tình huống ở cấp độ doanh nghiệp. Chúng tôi đã thử đưa toàn bộ nội dung hợp đồng vận chuyển dài 30 trang vào để kiểm tra các điều khoản, và kết quả cho thấy tỷ lệ chính xác không khác biệt so với việc xử lý từng phần riêng lẻ.
Hai câu hỏi mà mọi người thường đặt ra
Câu hỏi: Liệu chất lượng đầu ra có kém hơn so với GPT-4 thông thường không?
A: Chúng tôi đã thực hiện 1000 bài kiểm tra trên tập dữ liệu địa chỉ và đạt tỷ lệ chính xác là 98.7%, gần như không khác biệt so với 98.9% của GPT-4 thông thường; điều này hoàn toàn đủ để sử dụng trong các scénario doanh nghiệp.
Câu hỏi: Có cần phải thiết lập lại dự án Prompt không?
A: Chúng tôi đã trực tiếp sử dụng lại tất cả các Prompt mà trước đây đã viết cho GPT-4 thông thường, không thực hiện bất kỳ điều chỉnh nào, và kết quả đầu ra hoàn toàn đáp ứng mong đợi.
Liên kết bài viết:https://airai.cc/vi/ai-news/31/
Thông tin này có hữu ích không?