อีคอมเมิร์ซสดในเอเชียตะวันออกเฉียงใต้ใช้ Claude ในการตรวจสอบคุณภาพการสั่งซื้อประหยัดโพสต์บริการลูกค้า 3 แห่ง แต่เหยียบหลุมร้ายแรง 2 แห่ง
เมื่อสัปดาห์ที่แล้วทีมงานของเราจัดการกับอุบัติเหตุฉับพลัน: 18% ของใบสั่งงานหลังการขายในวันโปรโมชั่นถูกติดอยู่ในคิวที่รอดําเนินการโดยตรงเนื่องจากรูปแบบการส่งออกที่ผิดพลาดของ Claude การชดเชยผลไม้สดและไม่ดีที่ผู้ใช้สมัครล่าช้าเป็นเวลา 4 ชั่วโมงก่อนที่จะตอบสนองอัตราการคืนเงินเพิ่มขึ้นโดยตรง 2% ในวันเดียวกัน
เริ่มต้นด้วยการให้ความชัดเจนกับคนที่ไม่ได้สัมผัส: คลอดคืออะไร?
มันเป็นรูปแบบภาษาขนาดใหญ่ที่พัฒนาโดย Anthropic ในปัจจุบันหน้าต่างบริบทรายการ Sonnet รุ่น 3.5 ล่าสุดสามารถโหลดโทเค็น 200k ซึ่งประมาณ 150,000 คําภาษาจีน เราเลือกมันครั้งแรกเพราะเราสามารถยัดกระแสคําสั่งซื้อที่สมบูรณ์ผลลัพธ์ OCR ของแผนภูมิหลักฐานของผู้ใช้และกฎการชดเชยของแพลตฟอร์มได้ในครั้งเดียวโดยไม่ต้องแยกออกเป็นคําขอหลายรอบ
สามประโยชน์ที่แท้จริงที่เราได้รับจากมัน

โดยตรงที่สุดคือการลดต้นทุนแรงงาน: เดิมหกโพสต์บริการลูกค้าที่รับผิดชอบในการตรวจสอบคุณภาพของคําสั่งซื้อตอนนี้เพียงสามต้องเหลือสําหรับความผิดปกติด้านล่างประหยัด $ 4,200 ต่อเดือนสําหรับค่าใช้จ่ายแรงงานเท่านั้น
ประการที่สองคือความเร็วในการประมวลผลที่เพิ่มขึ้น: เดิมใช้เวลาเฉลี่ย 2 นาทีในการตรวจสอบใบสั่งซื้อด้วยตนเอง ตอนนี้คําขอส่วนใหญ่เสร็จสมบูรณ์ภายใน 15ms ผลลัพธ์สามารถส่งได้ภายใน 5 วินาทีหลังจากที่ผู้ใช้ส่งคําขอชดเชย เรามองไปที่ความพึงพอใจของผู้ใช้หลังเวทีโดยตรงเพิ่มขึ้น 17%
ประการที่สามคือการดําเนินการตามกฎระเบียบอย่างสม่ําเสมอมากขึ้น: ก่อนที่จะมีการตรวจสอบด้วยตนเองมักจะปรากฏสถานการณ์ผลที่ไม่ดีเดียวกันบางคนให้ค่าชดเชยเต็มจํานวนและบางคนให้ค่าชดเชยเพียง 30% ผู้ใช้บ่นว่ามีการลงโทษที่ไม่เป็นธรรมหลายสิบกรณีต่อเดือน หลังจากที่ Claude ป้อนกฎระเบียบแบบครบวงจรการร้องเรียนดังกล่าวลดลงโดยตรงเป็นน้อยกว่า 3 ต่อเดือน
อย่าเพิ่งมองไปที่สิ่งที่ดี เราเกือบจะหยุดเหยียบหลุมสองแห่งนี้
ประการแรกคือหลุม จํากัด ปัจจุบัน: API อย่างเป็นทางการที่เราเชื่อมต่อโดยตรงในตอนแรกไม่ได้ทําการลดระดับหลายชั้นปริมาณการร้องขอในวันโปรโมชั่นเพิ่มขึ้น 3 เท่าอย่างเป็นทางการกลับไปที่ 429 โดยตรงและเราไม่ได้ทํากลไกการเรียกใช้งานด้านล่างด้วยตนเองส่งผลให้คําสั่งงานหลายพันคําสั่งติดอยู่โดยตรงต่อมาเราได้เพิ่มแบบจําลองขนาดเล็กที่มีผลเดียวกันเป็นแผนการลดระดับ ตราบใดที่คําขอ 3 ครั้งติดต่อกันล้มเหลวจะตัดเป็นแบบจําลองขนาดเล็กโดยอัตโนมัติและเปลี่ยนด้วยตนเองก่อนที่จะล้มเหลว ตอนนี้ไม่มีการแสดงบัตรจํานวนมากอีกต่อไป
ประการที่สองคือหลุมที่ไม่เสถียรของผลลัพธ์ที่มีโครงสร้าง: เราขอให้มันส่งคืนการตัดสินในรูปแบบ JSON ในประมาณ 2% ของกรณีมันจะเพิ่มคําอธิบายที่อยู่นอก JSON ทําให้สคริปต์การวิเคราะห์ของเราส่งข้อผิดพลาดโดยตรงต่อมาเราเพิ่มข้อความ "ถ้าเอาต์พุตของคุณไม่ได้เป็น JSON บริสุทธิ์คุณจะถูกปิด" ในตอนท้ายของข้อเสนอแนะและอัตราการเกิดขึ้นของปัญหานี้ลดลงโดยตรงต่ํากว่า 0.1%
ใครเหมาะสําหรับการใช้งาน?ใครอย่าแตะต้องมัน

หากทีมงานของคุณมักจะจัดการกับงานซ้ํา ๆ ที่มีกฎระเบียบที่ชัดเจนและมีข้อความจํานวนมากเช่นการตรวจสอบคําสั่งซื้ออีคอมเมิร์ซการจัดหมวดหมู่ใบสั่งงานการบริการลูกค้าการตรวจสอบเงื่อนไขสัญญาเบื้องต้นและยินดีที่จะใช้เวลา 1-2 สัปดาห์ในการปรับปรุงพร้อมท์และกลไกการลดอัพเกรด Claude สามารถช่วยคุณประหยัดเงินและเวลา
หากสถานการณ์ของคุณต้องการความถูกต้อง 100% สําหรับผลลัพธ์เช่นการวินิจฉัยทางการแพทย์การตรวจสอบการทําธุรกรรมทางการเงินขั้นสุดท้ายหรือทีมงานของคุณไม่มีนักพัฒนา / พัฒนาที่เฉพาะเจาะจงใช้การดีบัคเป็นศูนย์หากคุณต้องการใช้มันอย่าแตะต้องความเป็นไปได้ที่จะเกิดปัญหาสูงกว่าที่คุณคิด
สองคําแนะนําการออกกําลังกายสําหรับผู้ใช้ครั้งแรก
ประการแรกอย่าขึ้นไปผลิตโดยตรงให้เรียกใช้โหมดเงา 7 วันก่อน: คําขอทั้งหมดไปพร้อมกันด้วยตนเองและ Claude เปรียบเทียบความสอดคล้องของผลลัพธ์ทั้งสองเมื่อความสอดคล้องมีเสถียรภาพมากกว่า 95% แล้วตัดปริมาณการจราจร ในเวลานั้นเรากําลังทํางานเงา 10 วันพบความเบี่ยงเบนของความเข้าใจกฎ 3 ข้อเปลี่ยน prompt ล่วงหน้าก่อนที่จะมีปัญหา
ประการที่สองอย่าอัดคําขอทั้งหมดลงในเวอร์ชันที่มีคุณสมบัติสูงสุด อย่าใช้ Sonnet ในสถานการณ์ที่คุณสามารถใช้ Haiku ได้: ต่อมาเราตัดคําขอจัดหมวดหมู่ใบสั่งงานง่ายๆ ไปยัง Haiku ค่าใช้จ่ายโทเค็นลดลงโดยตรง 60% เร็วขึ้นเป็นสองเท่าและผลลัพธ์ไม่เลวร้ายเลย
คําถามที่พบบ่อย
- จะมีปัญหาการรั่วไหลของข้อมูลหรือไม่?หากข้อมูลของคุณมีความละเอียดอ่อนให้ซื้อโดยตรงและลงนามในข้อตกลงการประมวลผลข้อมูล Anthropic จะไม่ใช้แบบจําลองการฝึกอบรมข้อมูลคําขอสําหรับเวอร์ชันองค์กร เราใช้มันมา 8 เดือนแล้วโดยไม่มีปัญหาเกี่ยวกับข้อมูล
- อะไรดีกว่า GPT?ถ้าฉากของคุณต้องจัดการกับข้อความยาวและต้องการความเข้าใจในบริบทสูงให้เลือก Claude หากคุณต้องการการสร้างแบบมัลติโหมดเช่นการวาดภาพให้เลือก GPT เรากําลังใช้ทั้งสองฉากในขณะนี้ แต่ละฉากทํางานที่แตกต่างกัน
มีประโยชน์หรือไม่?