Menu

L'e-commerce di prodotti freschi del Sud-est asiatico utilizza Claude per il controllo della qualità degli ordini, risparmiando 3 posti di lavoro per il servizio clienti, ma ha inciampato in 2 problemi critici.

La scorsa settimana il nostro team ha dovuto affrontare un incidente imprevisto: il 18% delle richieste di assistenza post-vendita, nel giorno dell’evento promozionale, è rimasto bloccato nella coda in attesa di elaborazione a causa di un errore nel formato di output di Claude. Di conseguenza, le richieste di risarcimento per frutta fresca danneggiata da parte degli utenti hanno richiesto 4 ore per essere gestite, causando un aumento della percentuale di rimborsi dello stesso giorno del 2 punti percentuali.

Per chi non ne ha mai sentito parlare: cos’è esattamente Claude?

È un modello di linguaggio di grandi dimensioni sviluppato da Anthropic; l’ultima versione, 3.5 Sonnet, supporta una finestra di contesto unica che può contenere fino a 200.000 token, il che corrisponde a circa 150.000 parole in cinese. Abbiamo scelto questo modello fin dall’inizio perché permette di inserire in una sola volta l’intero flusso di ordini, i risultati dell’OCR delle immagini fornite dagli utenti e le regole di risarcimento del platform, senza dover effettuare più richieste separate.

I tre benefici concreti che abbiamo ottenuto utilizzandolo

Smartphone displaying AI app with book on AI technology in background.

La riduzione più diretta riguarda i costi del personale: dai 6 dipendenti addetti al controllo della qualità degli ordini, ora ne servono solo 3 per gestire eventuali anomalie, il che permette di risparmiare 4200 dollari al mese in spese per il personale.

Il secondo aspetto positivo è l’aumento della velocità di elaborazione: in precedenza, la revisione manuale di una richiesta richiedeva in media 2 minuti, mentre ora la maggior parte delle richieste viene completata in meno di 15 millisecondi. Dopo che l’utente invia la richiesta di risarcimento, i risultati vengono forniti in circa 5 secondi. Secondo i dati del nostro sistema di monitoraggio, il livello di soddisfazione degli utenti è aumentato del 17%.

Il terzo aspetto riguarda l’uniformità nell’esecuzione delle regole: in precedenza, durante le revisioni manuali, si verificavano spesso situazioni simili di ingiustizia, dove alcune persone ricevevano un risarcimento completo mentre altre solo il 30%. Ci furono decine di lamentele da parte degli utenti ogni mese per tali decisioni ingiuste. Dopo l’introduzione di Claude per l’automazione delle regole, il numero di queste lamentele è diminuito drasticamente, arrivando a meno di 3 all’anno.

Non guardare solo i vantaggi: a causa di questi due problemi, abbiamo rischiato davvero di dover interrompere il servizio.

Il primo problema riguardava il limitazione del traffico: all’inizio ci siamo collegati direttamente all’API ufficiale senza implementare alcun meccanismo di riduzione del carico. Nel giorno delle promozioni, il numero di richieste è aumentato di tre volte e l’API ha restituito un errore 429; inoltre, non avevamo un meccanismo di intervento manuale per gestire tali situazioni, il che ha causato l’accumulo di migliaia di ticket non risolti. In seguito abbiamo aggiunto un modello di machine learning più semplice come soluzione di backup: se tre richieste consecutive fallivano, il sistema passava automaticamente al modello di machine learning, e solo in caso di ulteriori fallimenti interveniva il personale. Da allora non si sono più verificati casi di blocco massiccio dei servizi.

Il secondo problema riguarda l’instabilità dell’output strutturato: all’inizio richiedevamo che restituisse i risultati delle valutazioni in formato JSON, ma in circa il 2% dei casi aggiungeva un insieme di informazioni esplicative al di fuori del formato JSON, causando errori nei nostri script di analisi. Successivamente, abbiamo aggiunto una frase alla fine del prompt che recitava “Se il tuo output non è in formato JSON puro, verrai disattivato”, e la frequenza di questo problema è scesa al di sotto dello 0,1%.

Chi è adatto a usarlo? E a chi non conviene assolutamente provarlo?

Hand holding a smartphone with AI chatbot app, emphasizing artificial intelligence and technology.

Se il tuo team deve affrontare regolarmente un gran numero di lavori ripetitivi con regole ben definite e un volume di testo considerevole, come l’approvazione degli ordini elettronici, la classificazione delle richieste di assistenza clienti o la revisione preliminare delle clausole dei contratti, e sei disposto a dedicare 1-2 settimane per ottimizzare i prompt e implementare meccanismi di degradazione, allora Claude può aiutarti a risparmiare molto denaro e tempo.

Se la tua situazione richiede un’accuratezza del 100% nei risultati, come in diagnosi mediche, revisioni finali di transazioni finanziarie, o se il tuo team non dispone di personale specializzato per l’operazione e lo sviluppo e vuoi utilizzare il sistema senza alcuna configurazione o debug, allora non provarci: le probabilità di incorrere in problemi sono molto più alte di quanto tu possa immaginare.

Due suggerimenti pratici per chi lo utilizza per la prima volta

Prima di tutto, non passare direttamente alla modalità di produzione: avvia il sistema in modalità “shadow” per 7 giorni. In questo periodo, tutte le richieste vengono elaborate sia manualmente che tramite il sistema Claude. Confronta i risultati ottenuti per verificare la loro coerenza; quando questa coerenza raggiunge oltre il 95%, puoi iniziare a trasferire il traffico al sistema Claude. Noi abbiamo eseguito questa procedura per 10 giorni e abbiamo individuato tre discrepanze nella comprensione delle regole. Grazie al fatto che abbiamo modificato i prompt in anticipo, non si sono verificati problemi.

In secondo luogo, non cercare di utilizzare sempre la versione più potente per tutte le richieste; utilizza Haiku solo nei casi in cui è effettivamente necessario. Dopo aver separato le richieste di classificazione semplici da quelle più complicate e averle assegnate a Haiku, il costo legato all’utilizzo dei token è diminuito del 60% e la velocità di esecuzione è raddoppiata, senza alcuna perdita di efficacia.

Domande frequenti

  • Ci potrebbero essere problemi di perdita di dati?Se i tuoi dati sono sensibili, acquista direttamente la versione aziendale e firma l’accordo di trattamento dei dati: Anthropic non utilizzerà i dati delle richieste della versione aziendale per addestrare i modelli. Noi l’abbiamo usata per 8 mesi senza alcun problema legato ai dati.
  • Qual è migliore rispetto a GPT?Se la tua situazione richiede la gestione di testi lunghi o una comprensione approfondita del contesto, scegli Claude; se invece hai bisogno di generazioni multimediali, come ad esempio la creazione di immagini, scegli GPT. Attualmente stiamo utilizzando entrambi in scenari diversi.

È stato utile?

Supporto tecnicoAssistenza online
侧栏
Torna in alto
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR