Il settore dell’AI vocale, in rapida crescita, ha visto l’emergere di una nuova startup chiamata Hojo.
Voice AI rappresenta un’altra linea di sviluppo, diversa da quella dei modelli generici di grandi dimensioni. Mentre tutti sono concentrati sui modelli generici, anche nel campo relativamente più tranquillo dell’AI vocale iniziano ad emergere nuovi modelli degni di nota. La tastiera sta perdendo il suo “dominio”. Negli ultimi due anni, OpenAI ha lanciato il Realtime API, Google ha creato Gemini Live, e quasi tutte le aziende cinesi che si occupano di modelli di grandi dimensioni hanno iniziato a investire nell’AI vocale. Sempre più persone credono che, una volta che gli agenti intelligenti entreranno davvero nei flussi di lavoro, la voce diventerà un’interfaccia più naturale rispetto alla tastiera. Se un agente intelligente vuole davvero integrarsi nei flussi di lavoro, deve prima imparare a comprendere i suoni umani. La prima capacità necessaria per questo è l’ASR (riconoscimento vocale automatico). Per misurare il livello di un sistema ASR, nell’industria si utilizza comunemente la classifica Open ASR di Hugging Face, la cui metrica principale è il tasso di errore di parola (WER): più basso è questo valore, più precisa è la riconoscibilità del linguaggio vocale.
Da tempo, questa classifica è dominata dalle grandi aziende e dai laboratori di punta: i dati di addestramento, le risorse computazionali e l’esperienza ingegneristica richiesti per partecipare presentano barriere abbastanza elevate, rendendo difficile per le piccole squadre competere direttamente in questo ambito. Di recente, un team di startup chiamato Hojo ha reso pubblici i risultati di alcuni test di riconoscimento vocale, mostrando segni di poter diventare una “cavallina nera” nel settore. Secondo i dati ufficialmente pubblicati, Hojo-ASR-V1 ha ottenuto buoni risultati su diversi set di dati di riconoscimento vocale in inglese disponibili al pubblico.
Nel test LibriSpeech Clean, il tasso di errore di parole (WER) è stato di soli il 1,74%, e anche su dataset più vicini a scenari reali come GigaSpeech e VoxPopuli, il tasso di errore è stato ridotto al di sotto dell’8%. Non hanno presentato i loro risultati in una classifica, ma se i dati fossero stati inseriti nella Open ASR Leaderboard, sicuramente si posizionerebbero tra i primi. In generale, si tratta di un modello di riconoscimento vocale (ASR) che dimostra competitività nei test pubblici. Inoltre, è stato reso open source su GitHub e Hugging Face, sotto licenza Apache-2.0, il che significa che non ci sono grandi restrizioni per il suo riutilizzo. 🚥 Quindi, abbiamo deciso di implementare Hojo-ASR-V1 per sperimentarne personalmente e scoprire a che livello sia questo modello vocale creato da questo team imprenditoriale poco conosciuto, e di approfondire anche la nuova tendenza in rapida crescita nel campo dell’AI vocale: l’uso di agenti intelligenti (Voice AI). Cosa è esattamente Hojo-ASR? Abbiamo effettuato dei test pratici. Innanzitutto, Hojo-ASR-V1 è stato reso open source su HuggingFace e GitHub: Link Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Link GitHub: https://github.com/HojoAI/Hojo-ASR[2] Per chiarire, Hojo-ASR-V1 è un modello diverso dai tradizionali modelli di riconoscimento vocale: dopo aver esaminato il suo codice e le sue configurazioni, abbiamo notato che la sua struttura è unica.
L'audio viene prima elaborato con l'estrattore di caratteristiche di Whisper per convertirlo in caratteristiche acustiche utilizzabili dal modello, e successivamente viene inserito nell'encoder audio di Qwen3-Omni. Durante questo processo, viene utilizzata una struttura chiamata Conformer per l'adattamento e la compressione dei dati.
Infine, il risultato viene passato a un modello linguistico Qwen3-4B, che produce il testo finale. In altre parole: Hojo-ASR-V1 è una combinazione di “encoder”, “adattatore” e “modello linguistico di grandi dimensioni”. L’idea di utilizzare un modello linguistico per il decodifico dell’ASR non è esclusiva di Hojo; rappresenta infatti la direzione principale attualmente dominante nella classifica di OpenASR. Alcuni dei modelli che occupano posizioni elevate nella classifica, come il Canary-Qwen-2.5B di NVIDIA, il Granite-Speech-3.3-8B di IBM e il Phi-4-Multimodal di Microsoft, integrano le capacità dei modelli linguistici nel riconoscimento vocale, riducendo in media il WER (Word Error Rate) tra il 5,6% e il 5,9%. Il vantaggio di utilizzare un modello linguistico è che il riconoscimento non si limita a “sentire quali suoni e scrivere quali parole”: il modello può anche utilizzare il significato per fare delle inferenze. In presenza di rumore, espressioni colloquiali, mescolanze di italiano e inglese, o termini tecnici specifici di un determinato settore, un modello in grado di comprendere il significato è più in grado di capire ciò che l’interlocutore intende esprimere. Di seguito viene presentato il risultato delle prove pratiche: abbiamo deployato il modello localmente e abbiamo eseguito molti cicli di test.
Casi di utilizzo effettivo, divisi in due livelli: 【1】Le capacità di riconoscimento vocale (ASR) del modello Hojo-ASR-V1. 【2】Hojo-TTS. ASR (Automatic Speech Recognition) è il processo di conversione del suono in testo e rappresenta il primo passo nell’intera catena dell’intelligenza artificiale vocale. Sia che si tratti di tastiere di input vocale per smartphone, trascrizioni di riunioni, sottotitoli in tempo reale o degli sempre più popolari agenti AI, tutti questi servizi sono basati sull’ASR. In precedenza, utilizzavo strumenti di input vocale AI come Wispr Flow e Typeless. Questi prodotti offrivano un’esperienza positiva, ma a volte presentavano ritardi a causa di condizioni di rete instabili, e c’era ancora margine di miglioramento nell’adattamento alle esigenze del linguaggio cinese. In seguito, ho iniziato a utilizzare soluzioni distribuite localmente, tra cui Whisper, open source di OpenAI. Dopo il rilascio di Hojo-ASR-V1, ho deciso di sostituire Whisper con Hojo-ASR-V1 per un’esperienza pratica. L’intera esperienza è stata positiva: la velocità di riconoscimento e l’accuratezza sono state soddisfacenti, rendendo l’input vocale quotidiano abbastanza fluido. Tuttavia, questo richiede risorse hardware locali e impone requisiti specifici per la memoria. L’intero approccio non è complesso: fondamentalmente, Hojo-ASR-V1 funge da motore di riconoscimento di base, mentre i sistemi di input vocale utilizzano i suoi strumenti attraverso autorizzazioni a livello di sistema. Dopo la configurazione, Hojo-ASR-V1 può essere utilizzato in quasi tutti gli ambienti di input di testo, come browser, ChatGPT, Claude, Notion, ecc. Durante il test, ho fornito un resoconto orale su un “incrocio”, includendo informazioni sulla posizione dei vari elementi, la direzione del contenuto e l’origine del nome. Non ho preparato il testo in anticipo né ho rallentato intenzionalmente il mio ritmo di parlato. Cosa trovo interessante è che questo tipo di flusso di lavoro può essere ulteriormente esteso: dopo il riconoscimento vocale, è possibile integrare modelli come DeepSeek o GPT per perfezionare il testo, organizzarne la formattazione, correggere gli errori di battitura e ottimizzarne la struttura.
Il processo complessivo è probabilmente questo: Input audio → Trascrizione ASR → Ottimizzazione del modello di grandi dimensioni → Passare direttamente al flusso di lavoro. Questa esperienza è molto più confortevole per chi scrive, partecipa a riunioni o lavora con un agente rispetto ai metodi di input tradizionali. Oltre a Hojo-ASR - V1, abbiamo notato che Hojo è anche impegnato nella direzione di TTS. Questa volta abbiamo sperimentato il suo modello di sintesi vocale TTS, e il team ha anche aperto una versione più leggera, Hojo-TTS - Light. Insieme, questi elementi costituiscono la risposta di Hojo al flusso di lavoro orientato all 'agente. Un altro pezzo del puzzle per Voice AI: TTS Il nostro percorso per sperimentare le capacità del modello TTS è il suo sito web ufficiale: Hojoai. Com Sintesi vocale multilingue - Femmine veloci Il primo test è stato la sintesi vocale multilingue, che è una funzione più comune del modello TTS. Di recente la Coppa del Mondo stava per iniziare, ho fatto che con una voce femminile più leggera, ho letto un commento che presentava i giocatori della squadra giapponese della Coppa del Mondo: Questo segmento di circa 30 secondi di cinese suona abbastanza liscio, morso di parole e alcuni dettagli sono trattati bene, il senso di AI non è molto evidente. Il tono della voce, il tono leggero, si può sentire. In realtà, di solito giudichiamo un suono non naturale, generalmente ascoltiamo il suo morso di parole, e il tono di ogni parola alla fine, questo stile di base e all 'inizio è in grado di allineare. Hojo supporta molte lingue, giapponese, francese, cantonese sono disponibili. Di seguito è lo stesso testo di introduzione della squadra giapponese, cambiato in giapponese per leggere, l'effetto può anche essere, suono davvero un po 'come NHK trasmissione, è abbastanza visivo: Sintesi vocale multilingue - Magnetico stabile maschio Questo modello TTS può anche cambiare il tono del ruolo diverso, la voce maschile può essere ascoltata. Il paragrafo seguente presenta la Coppa del Mondo 2026 e ho impostato il tono della voce in una voce maschile magnetica e stabile. Questo punto è in linea con quello che ho detto nel testo. Soluzione vocale multicolore - Libro audio Il modello TTS consente di utilizzare più colori. Questa volta lo faccio leggere con il suono del libro. Questo testo è un 'introduzione di Naruto, sintetizzato con la voce maschile di un libro audio. Ascolto abbastanza naturale. Quando si legge la parola "giovane ", il suono finale è stato trattato per rendere la connessione molto liscia. E come "e" questo tipo di solito parliamo connessioni, la pausa è anche bloccata più accuratamente, che è anche l'intero paragrafo di ascolto una delle ragioni. Sintesi vocale multicolore - sussurro C'è un altro suono che voglio dire da solo, il sussurro. Ecco il film che ho letto con un sussurro femminile: Il silenzioso agnello: Puoi sentire quello che si dice, ma simula anche il flusso d'aria leggero, il suono del respiro sottile e il suono leggero che si sta mettendo all 'orecchio. Ascoltare, il sussurro del modello TTS non è semplicemente ridurre il volume, il tono, il ritmo e l'umore sono buoni. Questo tono di voce è più adatto per il suspense, la narrazione della storia, ASMR. Oltre ai toni di trasmissione standard, ho anche testato alcuni toni di personaggio più riconoscibili. Il Congresso Recentemente è la stagione degli esami di entrata in college, TV, radio e video brevi, si possono sentire molti auguri e notizie trasmesse. La voce dell 'ancora CCTV nella trasmissione cinese è più rappresentativa, standard di pronuncia, parole chiare. Quindi questa volta ho scelto un audio di Kang Hui come riferimento, qui sotto è l'audio originale di Kang Hui. Copia del timbro vocale del file – Kanghui Ho inviato questo audio originale al modello TTS affinché ne replicasse il timbro vocale e leggesse un testo di circa 40 secondi, in cui auguro buona fortuna agli studenti che stanno sostenendo l’esame di ammissione all’università.
L'effetto complessivo è che il modello TTS mantiene abbastanza bene le caratteristiche della voce originale, soprattutto il tono, le pause e il ritmo di conduzione di Kang Hui. Non appena si sente la prima frase, si capisce che assomiglia molto a Kang Hui in persona. Quando recita frasi come "Non deludere la gioventù, correre verso il futuro", si percepisce chiaramente il suo familiare modo di presentare le notizie e la sensazione di essere un presentatore di eventi importanti. **Nezha** La riproduzione del timbro vocale è una delle capacità più rappresentative del modello TTS. Ho utilizzato il modello per ricreare la voce di alcuni personaggi famosi, iniziando con Nezha da "Nezha: The Demonic Child's Birth". La voce risultante è molto simile all'atteggiamento ribelle e pigro di Nezha, e anche le pause sono esattamente come quelle del personaggio. **Peppa Pig** Il modello TTS ha riprodotto abbastanza bene anche il timbro vocale dei personaggi dei cartoni animati. Tuttavia, la voce dei personaggi dei cartoni animati è diversa da quella delle persone reali o dei personaggi dei film, quindi c'è stata una certa differenza nel trattamento del suono. Ecco un esempio di Peppa Pig sintetizzato dal modello TTS: **MacArthur** Ho persino registrato appositamente una voce di commento molto popolare su TikTok di "MacArthur" per farglielo recitare: "Crossroads" è un media tecnologico cinese che si concentra sulla tendenza dell'AI; la sua forma principale è un podcast, ma si estende anche a video, versioni testuali su WeChat pubblici e eventi di comunità offline. "Crossroads" è una metafora di Steve Jobs per la Apple Company, descrivendola come posta all'incrocio tra tecnologia e umanità, dove spesso nascono prodotti straordinari. Il media segue i cambiamenti e le opportunità che l'AI porta in vari settori, cerca, intervista e riunisce "attivisti positivi" dell'era dell'AI, per esplorare e abbracciare insieme nuove possibilità. **Chi è il team Hojo?** Tornando al team Hojo, non si tratta di un'azienda che si occupa esclusivamente di modelli vocali.
Hojo è stato fondato circa due anni fa e, prima di questa divulgazione di informazioni, era poco conosciuto al pubblico. Tuttavia, abbiamo contattato il suo team per ottenere alcune informazioni dirette. Secondo la propria posizione, Hojo mira a creare un Personal Agent OS rivolto ai lavoratori del settore del knowledge work. In altre parole, l’obiettivo è far sì che gli agenti digitali entrino veramente nei flussi di lavoro quotidiano, come ufficio, comunicazione, creazione e collaborazione, con l’ASR (Automatic Speech Recognition) e il TTS (Text-to-Speech) come due componenti chiave di questo sistema. Questo è anche fondamentale per comprendere il funzionamento di Hojo: l’ASR rappresenta soltanto la prima fase per permettere all’agente di comprendere correttamente le situazioni lavorative reali. Solo dopo aver ricevuto in modo affidabile informazioni da riunioni, telefonate, appunti vocali e discussioni tra più persone, è possibile passare alla comprensione, pianificazione ed esecuzione dei compiti. Un aspetto particolare del team di Hojo è che i suoi membri hanno molta esperienza nel lavorare con “situazioni vocali reali”. Molti di loro provengono da team impegnati in tecnologie di voce per veicoli, cabine intelligenti e interazioni vocali, tra cui Xpeng, NIO Nomi e SenseTime. Per essere più precisi, il fondatore Zhao Hengyi ha lavorato in precedenza in aziende come LeEco, Xpeng, NIO e SenseTime su progetti legati a interazioni vocali, cabine intelligenti, AgentOS, nonché su applicazioni di controllo autonomo tramite intelligenza artificiale e servizi tra dispositivi diversi. Il Chief Product Officer Li Ou ha ricoperto ruoli in SenseTime e NIO, occupandosi della pianificazione di prodotti digitali e di AgentOS, concentrandosi su come le capacità vocali possano essere integrate in un’esperienza di utilizzo completa, e non solo su singoli modelli tecnologici. Il COO Sun Xiaogang ha esperienza nella commercializzazione di soluzioni basate su agenti digitali e nell’implementazione di interazioni vocali in settori come veicoli, ristorazione e trasporti. Considerando insieme queste esperienze, il team di Hojo ha una solida base per affrontare in modo efficace i problemi legati alla voce in contesti reali. Questo è dovuto al fatto che i suoi membri si sono concentrati su ambienti in cui l’ASR deve funzionare in condizioni reali, molto diverse da quelle di un laboratorio: veicoli con rumori, dialetti, più persone che parlano contemporaneamente, interruzioni improvvisate, e un linguaggio spesso non formale o incompleto.
Gli utenti non parlano secondo i prompt standard, né aspettano che il sistema reagisca lentamente. Chi ha già lavorato in scenari del genere capisce meglio le vere difficoltà dei modelli di riconoscimento vocale: l’ASR (Automatic Speech Recognition) deve essere in grado di comprendere in modo affidabile le intenzioni umane in ambienti complessi. Anche l’esperienza di Sudan, il principale scienziato di Hojo, è più facile da comprendere in questo contesto. Negli anni passati ha partecipato allo sviluppo del riconoscimento vocale presso Baidu, assistendo alla commercializzazione dell’ASR grazie all’applicazione dell’apprendimento profondo; in seguito, presso il Tencent AI Lab, ha lavorato su tecnologie legate al riconoscimento vocale, proprio nel periodo in cui i grandi modelli hanno rivoluzionato l’interazione vocale. Il valore di questa esperienza risiede nel fatto che Sudan ha vissuto direttamente i cambiamenti nella tecnologia del riconoscimento vocale: dalla competizione basata sulla precisione del riconoscimento, all’implementazione in scenari reali, fino alla riorganizzazione dell’interazione vocale nell’era dei grandi modelli. Per un’azienda che vuole sviluppare un Personal Agent OS, questa esperienza è fondamentale per non considerare la voce semplicemente come un componente di input, ma per rinnovarne completamente il design all’interno dei flussi di lavoro reali. A livello di finanziamento, Hojo ha raccolto quasi 100 milioni di yuan in quattro round di investimenti, anche prima che il prodotto fosse ufficialmente lanciato sul mercato, e attualmente sta procedendo con il round Pre-A. Queste informazioni non garantiscono necessariamente il successo del prodotto, ma dimostrano comunque che il mercato ha iniziato a prestare attenzione alle competenze tecnologiche dell’azienda nel campo dell’AI vocale e degli Agent OS. Per quanto riguarda la commercializzazione, secondo Hojo, la combinazione di “grandi modelli” e “Agentic OS” sviluppata dall’azienda ha già fornito funzionalità di riconoscimento vocale a decine di milioni di dispositivi AI. Se questi dati sono veri, significa che l’azienda non si limita a pubblicazioni accademiche, demo o classifiche, ma è già presente in scenari reali con utenti reali. Secondo i piani di Hojo, l’ASR rappresenta solo il primo passo: l’azienda sta anche lavorando al TTS (Text-to-Speech) e prevede di lanciare un modello di comunicazione vocale full-duplex entro la fine di giugno. Il vero obiettivo è costruire un insieme completo di funzionalità di interazione vocale per il Personal Agent OS, in modo che l’agente possa ascoltare, comprendere e rispondere, integrandosi completamente nei flussi di lavoro dei lavoratori. Se questi piani si realizzeranno o meno, dovrà essere verificato dai prossimi prodotti. Tuttavia, già il risultato ottenuto con Hojo-ASR-V1 dimostra che l’azienda ha ottenuto risultati significativi nel primo passo del processo di sviluppo dell’AI vocale. Allora, perché i dati rivelati da Hojo-ASR hanno attirato così tanta attenzione? In quale contesto si colloca Hojo-ASR? L’AI vocale rappresenta un’altra linea di sviluppo, parallela a quella dei grandi modelli generali. Quando gli agenti iniziano a essere integrati nei flussi di lavoro reali, i contesti da gestire diventano sempre più complessi: discussioni in riunioni, richieste al telefono, suoni nell’ambiente circostante, aggiunte improvvisate da parte degli utenti, nonché istruzioni in continua evoluzione durante la collaborazione tra più persone. In passato, queste informazioni venivano inserite principalmente tramite la tastiera, ma in molti contesti di lavoro, le informazioni veramente importanti vengono comunicate a voce.
Questo è anche il motivo per cui le grandi aziende hanno aumentato gli investimenti nell’AI vocale negli ultimi due anni. OpenAI ha lanciato il Realtime API, Google ha sviluppato Gemini Live, mentre in Cina aziende come iTech, DouBao, MiniMax e JieYue stanno investendo molto in questo settore. L’entusiasmo per questa tecnologia negli ultimi due anni può essere misurato dal flusso di capitali. Secondo AssemblyAI, nel 2025 le startup nell’AI vocale hanno ricevuto circa 2,1 miliardi di dollari in investimenti di rischio; dal giugno 2025 al maggio 2026 ci sono state 36 operazioni di finanziamento pubblicamente annunciate nel settore dell’AI conversazionale, per un totale di circa 2,58 miliardi di dollari. In poche parole, il settore è estremamente attivo. Per quanto riguarda le singole aziende, ElevenLabs, che si occupa di sintesi vocale, ha raccolto 500 milioni di dollari nel suo quarto round di finanziamento, con una valutazione di 11 miliardi di dollari; PolyAI, specializzata in assistenza clienti telefonica vocale, ha ottenuto 86 milioni di dollari nel quarto round; Retell AI, che gestisce chiamate AI in tempo reale, gestisce più di 40 milioni di chiamate al mese, con un aumento trimestrale del 300%. Ci sono anche aziende come Cartesia, che si impegnano a ridurre il ritardo nella trasmissione della voce a meno di 100 millisecondi, rendendo le conversazioni più fluide. Anche le grandi aziende stanno facendo molti progressi: OpenAI ha lanciato il Realtime API, offrendo una soluzione end-to-end per la comunicazione vocale, che elimina la necessità di passaggi intermedi come la conversione del testo in voce, l’elaborazione del modello e la sintesi della voce. Il concetto di Gemini Live di Google è simile: permette di continuare a rispondere anche quando si viene interrotti durante una conversazione. Negli ultimi giorni è stato anche rilasciato Gamma4, un ulteriore strumento di AI vocale. È evidente che la voce sta diventando un modo di interazione “più naturale” per gli agenti intelligenti per ottenere contesto. Questa tendenza è ancora più evidente nel contesto del popolare Vibe Working: non è necessario organizzare ogni richiesta in un prompt completo; è possibile pensare, parlare e modificare simultaneamente, permettendo all’agente di comprendere le intenzioni, completare il contesto e avanzare nell’esecuzione delle attività in modo più naturale. In questo processo, l’ASR (Automatic Speech Recognition) rappresenta la prima fase fondamentale: determina se l’agente può comprendere correttamente il mondo reale. Se non riesce a riconoscere correttamente il linguaggio parlato, tutte le fasi successive di comprensione, pianificazione ed esecuzione saranno errate; solo un riconoscimento accurato può rendere la voce davvero parte del flusso di lavoro. In sintesi, quando gli agenti intelligenti inizieranno ad essere integrati nella vita di tutti i giorni, la voce, ovvero l’AI vocale, sarà probabilmente il primo canale attraverso cui interagiranno con le persone. Ci sono molti modi per collegarsi ad un’IA: digitare, interagire con interfacce grafiche, scrivere codice per richiamare API, ma il modo più simile alle conversazioni quotidiane tra persone è ancora parlare ad alta voce. Ecco perché sempre più persone definiscono la voce l’“ingresso al contesto” per gli agenti intelligenti. Se i grandi modelli sono responsabili della comprensione del mondo, allora la voce rappresenta il canale attraverso cui le informazioni del mondo reale fluiscono continuamente nel modello. In questo contesto, l’ASR svolge un ruolo cruciale: determina se l’agente può catturare correttamente le informazioni dall’ambiente esterno e trasformare i suoni del mondo reale in un contesto comprensibile e utilizzabile dal modello. Da questo punto di vista, la competizione nell’ASR si è elevata a un livello più alto: si tratta di conquistare l’ingresso che collega la prossima generazione di agenti intelligenti al mondo reale. Questo è anche il motivo per cui i dati divulgati da Hojo-ASR-V1 meritano maggiore attenzione: ciò che si nasconde dietro di essi non è semplicemente un cambiamento nei risultati di un modello.
La voce AI sta passando da una funzione ausiliaria a un’infrastruttura fondamentale, diventando una base sempre più importante nell’era degli agenti. 🚥 Tornando alla voce AI: mentre la maggior parte dei produttori si concentra sui modelli generici di grandi dimensioni, il settore della riconoscimento vocale, che sembra più tranquillo, sta in realtà evolvendo rapidamente. Anche in un campo come il riconoscimento vocale automatico (ASR), da tempo dominato da aziende come OpenAI, Microsoft, NVIDIA e IBM, stanno emergendo startup che ottengono risultati competitivi. L’arrivo di Hojo-ASR-V1 potrebbe non significare ancora un cambiamento radicale nella situazione attuale, ma indica comunque che la voce AI sta assumendo un ruolo più importante e attira sempre più attenzione da parte degli esperti. Il riconoscimento vocale è solo il primo passo: dopo che la macchina ha capito ciò che viene detto, è fondamentale che sia in grado di comprendere il significato e di rispondere in modo simile a quello umano. Questo rappresenta una fase più lunga, più preziosa e con maggior potenziale. Riferimenti: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR L’articolo è stato pubblicato sul WeChat account “Crossing”, scritto da “Crossing”.
Link dell’articolo:https://airai.cc/it/news/6/
È stato utile?