Triển khai LLM (Large Language Model) ở cấp độ doanh nghiệp thông qua các gateway trí tuệ nhân tạo: Chúng tôi đã giảm tỷ lệ lỗi 429 từ 13% xuống còn 0, đồng thời tiết kiệm được 28% chi phí.
Trong chương trình khuyến mãi Black Friday tháng trước, nhóm kỹ thuật thương mại điện tử xuyên biên giới của chúng tôi ở Singapore đã làm việc liên tục trong 36 giờ tại phòng giám sát. Chúng tôi theo dõi biểu đồ tỷ lệ thành công của các yêu cầu và suýt nữa thì “nhảy lên vì phấn khích”. Năm ngoái, vào cùng thời điểm khuyến mãi lớn đó, chúng tôi gặp sự cố do một nhà cung cấp dịch vụ LLM (Large Language Model) hạn chế lượng yêu cầu được xử lý.13% số yêu cầu tạo mô tả sản phẩm gặp lỗi 429.Nền tảng quản lý của các cửa hàng đã sập hơn 4 giờ rồi, và chỉ riêng các khiếu nại từ khách hàng đã tăng lên hơn 2000 bản.
Trước hết, hãy hiểu rõ: Một gateway suy luận cấp doanh nghiệp (enterprise-level inference gateway) là gì.
Đây không phải là một framework mới và tuyệt vời gì cả; về bản chất, nó chỉ là một lớp điều phối lưu lượng nằm giữa dịch vụ kinh doanh của bạn và các giao diện LLM (Large Language Models). Các tham số cốt lõi của nó khá đơn giản.Dưới tải trọng bình thường, độ trễ lập lịch không được vượt quá 10ms.Nếu vượt quá giới hạn, điều đó sẽ chỉ khiến công việc kinh doanh trở nên chậm trễ hơn.
Ba lợi ích thực tế mà chúng tôi rút ra sau khi trải qua những khó khăn:

- Đầu tiên, chúng tôi đã loại bỏ hoàn toàn rủi ro liên quan đến việc giới hạn lưu lượng truy cập: hiện tại chúng tôi đang kết nối với cùng lúc với 3 nhà cung cấp dịch vụ LLM (Large Language Model) hàng đầu. Hệ thống gateway sẽ tự động phân phối yêu cầu đến nút có nguồn lực đủ và phản hồi nhanh nhất. Mức QPS (Number of Requests Per Second) trong thời gian cao điểm của sự kiện Black Friday năm nay cao hơn 2,3 lần so với năm ngoái, và không hề xảy ra tình trạng lỗi 429 (server down) trong suốt quá trình.
- Tiếp theo là sự giảm chi phí một cách rõ rệt: Chúng tôi chuyển các yêu cầu tạo nhãn sản phẩm có độ ưu tiên thấp tự động sang các mô hình nhỏ có hiệu suất tốt hơn về mặt giá cả, mà không cần phải thay đổi mã nguồn của ứng dụng. Chỉ trong vòng 7 ngày, chi phí sử dụng các token đã giảm trực tiếp 28%.
- Cuối cùng là việc giảm bớt công việc lặp đi lặp lại ở phía máy chủ: trước đây, mỗi khi thay đổi mô hình hoặc thêm nhà cung cấp dịch vụ mới, chúng tôi phải điều chỉnh giao diện của 3 mô-đun kinh doanh một cách riêng lẻ, nhưng bây giờ tất cả đều được thực hiện ở tầng gateway, và chỉ mất nửa ngày là xong.
Đừng chỉ nhìn vào những mặt tốt, chúng ta đã gặp phải 3 rắc rối lớn do những điều này gây ra.

Chỉ trong tuần đầu tiên sau khi sản phẩm được ra mắt, chúng tôi đã gặp một sự cố: sau khi kích hoạt chức năng tự động thay thế (automatic fallback), gateway đã chuyển một số yêu cầu văn bản tùy chỉnh có độ ưu tiên cao, vốn dĩ cần sử dụng GPT-4, sang một mô hình nhỏ có hiệu quả kém hơn nhiều. Điều này dẫn đến việc hơn 200 nội dung quảng cáo của các doanh nghiệp không đạt tiêu chuẩn, và chúng tôi đã phải bồi thường một khoản tiền lên đến mười nghìn đồng. Sau đó chúng tôi mới nhận ra rằng không phải tất cả các yêu cầu đều phù hợp để tự động giảm cấp; đối với các tình huống nhạy cảm, cần phải thêm các quy tắc kiểm tra dự phòng.
Còn có rất nhiều vấn đề về chi phí mà không ai đề cập đến: Nếu tốc độ xử lý yêu cầu (QPS) của bạn thấp hơn 10 trong thời gian dài, chi phí cho máy chủ và bảo trì của chính gateway sẽ cao hơn cả chi phí mua gói dịch vụ cao cấp từ nhà cung cấp LLM, vì vậy hoàn toàn không cần thiết phải sử dụng gateway đó.
Ngoài ra, đừng tin vào những lời quảng cáo rằng “tất cả các tính năng đều sẵn sàng sử dụng ngay khi mở hộp”. Chúng tôi đã thử 3 loại gateway mã nguồn mở, và quy tắc phân bổ lưu lượng mặc định hoàn toàn không phù hợp với môi trường thương mại điện tử. Chỉ việc điều chỉnh các quy tắc trọng số đã mất tận 2 ngày.
Ai nên lên? Ai thực sự không cần phải lãng phí thời gian?
Đưa ra tiêu chí đánh giá ngay thôi, đừng phải mất nhiều thời gian suy nghĩ:
- Bạn có thể xem xét việc sử dụng dịch vụ này nếu đáp ứng bất kỳ một trong những điều kiện sau: Lượng yêu cầu từ LLM (Large Language Model) vượt quá 10.000 lần mỗi ngày, sử dụng cùng lúc hai loại mô hình trở lên, hoặc yêu cầu độ sẵn sàng phục vụ của dịch vụ cao hơn 99,9%;
- Nếu đội ngũ của bạn là một công ty khởi nghiệp nhỏ với ít hơn 5 người, hoạt động trong lĩnh vực cốt lõi và việc sử dụng các mô hình lớn (large models) không có mối liên kết chặt chẽ, và chi phí vận hành các mô hình LLM trong một tháng còn không bằng một tháng lương của một kỹ sư phần mềm, thì đừng nên cân nhắc đến việc triển khai ở cấp độ doanh nghiệp. Thay vào đó, sử dụng các giao diện nguyên bản của nhà cung cấp dịch vụ sẽ là lựa chọn tiết kiệm chi phí nhất.
2 lời khuyên thực hành dành cho người mới bắt đầu
Đừng vội vàng thực hiện việc chuyển đổi toàn bộ ngay từ đầu; hãy thử nghiệm với 10% lưu lượng có độ ưu tiên thấp trong một tuần để kiểm tra. Hãy tập trung vào hai chỉ số chính: xem có xảy ra tình trạng yêu cầu được gửi đi nhiều lần không, và xem độ trễ do quá trình lập lịch xử lý có nằm trong phạm vi chấp nhận được hay không. Chúng tôi đã bắt đầu bằng việc kiểm tra lưu lượng dành cho các phản hồi tự động sau bán hàng trong 3 ngày, và chỉ sau khi chắc chắn không có vấn đề gì mới chuyển sang các dịch vụ cốt lõi.
Câu hỏi: Có nên tự mình xây dựng một gateway từ đầu không? Trả lời: Trừ khi nhóm của bạn có những người rảnh rỗi và có kinh nghiệm, nếu không thì việc sử dụng các phiên bản mã nguồn mở đã được phát triển sẵn sẽ tiết kiệm ít nhất 2 tháng thời gian và đảm bảo độ ổn định cao hơn so với việc tự viết.
Liên kết bài viết:https://airai.cc/vi/ai-news/24/
Thông tin này có hữu ích không?