Auf dem sich erwärmenden Markt für Sprachkünstliche Intelligenz ist ein Start-up namens Hojo aufgetaucht.
Voice AI ist eine weitere Entwicklungslinie neben den allgemeinen Großmodellen. Während alle ihre Aufmerksamkeit auf die allgemeinen Großmodelle richten, zeigen sich auch auf dem relativ ruhigen Gebiet der Voice AI einige bemerkenswerte neue Modelle. Die Tastatur verliert allmählich ihre „Herrschaft“. In den letzten zwei Jahren hat OpenAI die Realtime API eingeführt, Google hat Gemini Live entwickelt, und auch die großen Modelleunternehmen in China haben begonnen, sich auf die Entwicklung von Voice AI zu konzentrieren. Immer mehr Menschen glauben, dass Sprache, sobald Agenten tatsächlich in die Arbeitsabläufe integriert werden, eine natürlichere Eingabemethode als die Tastatur darstellen wird. Wenn Agenten wirklich in die Arbeitsabläufe integriert werden sollen, müssen sie zunächst lernen, diese Stimmen zu verstehen. Die grundlegende Fähigkeit dafür ist die ASR (Automatische Spracherkennung). Um das Niveau der ASR zu bewerten, wird am häufigsten die Open ASR Leaderboard von Hugging Face herangezogen. Der zentrale Indikator ist die Wortfehlerrate (WER); je niedriger diese Rate, desto genauer ist die Erkennung.
Seit langer Zeit ist diese Liste hauptsächlich das Spielfeld großer Unternehmen und renommierter Forschungslabore – Trainingsdaten, Rechenleistung und technische Erfahrung stellen alle hohe Hürden dar, weshalb nur wenige kleine Teams es wagen, in diesem Bereich direkt mit ihnen zu konkurrieren. Kürzlich hat ein Startup namens Hojo die Ergebnisse von Spracherkennungstests veröffentlicht und scheint dabei das Potenzial zu haben, zum „Außenseiter“ zu werden. Laut den offiziell veröffentlichten Daten hat Hojo-ASR-V1 gute Ergebnisse in mehreren öffentlichen englischsprachigen Spracherkennungsdatensätzen erzielt.
Unter den genannten Modellen hat LibriSpeech Clean eine Fehlerrate bei der Worterkennung (WER) von nur 1,74%. Auch auf Datensätzen wie GigaSpeech und VoxPopuli, die realeren Szenarien näherkommen, konnte diese Rate auf unter 8% reduziert werden. Sie haben die Ergebnisse nicht in die offizielle Rangliste eingereicht, aber wenn die Daten in die Open ASR Leaderboard verglichen würden, würden sie sicherlich zu den Spitzenplätzen gehören. Insgesamt zeigt sich, dass es sich um ein ASR-Modell handelt, das in offenen Benchtests wettbewerbsfähig ist. Zudem ist es tatsächlich unter der Apache-2.0-Lizenz auf GitHub und Hugging Face open source veröffentlicht worden, wodurch die Weiterverwendung kaum eingeschränkt ist. 🚥 Daher haben wir Hojo-ASR-V1 implementiert, um es selbst auszuprobieren und zu sehen, welches Niveau dieses zurückhaltend agierenden Start-ups mit seinem Sprachmodell erreicht hat. Gleichzeitig möchten wir auch die schnell wachsende Entwicklungslinie im Bereich der Voice AI besprechen. Was genau Hojo-ASR ist, haben wir selbst getestet. Zunächst wurde Hojo-ASR-V1 unter der Lizenz Apache-2.0 auf Hugging Face und GitHub veröffentlicht: Hugging Face-Link: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] GitHub-Link: https://github.com/HojoAI/Hojo-ASR[2] Zunächst sollten wir klarstellen, was für ein Modell Hojo-ASR-V1 ist. Nachdem wir seinen Code und seine Konfiguration genauer betrachtet haben, stellten wir fest, dass seine Struktur sich von herkömmlichen Spracherkennungsmodellen unterscheidet.
Der Audioinhalt wird zunächst mit dem Feature-Extraktor von Whisper verarbeitet, um akustische Merkmale zu erzeugen, die vom Modell verwendet werden können. Anschließend werden diese Merkmale in den Audio-Encoder von Qwen3-Omni eingegeben. Dazwischen wird eine Conformer-Struktur verwendet, um die Daten anzupassen und zu komprimieren.
Schließlich wird das Ergebnis an ein Sprachmodell mit dem Namen Qwen3-4B übergeben, das die endgültige Textformulierung erstellt. Mit anderen Worten: Hojo-ASR-V1 ist eine Kombination aus „Encoder“, „Adapter“ und einem „großen Sprachmodell“. Die Idee, Sprachmodelle für die ASR-Decodierung zu verwenden, ist nicht nur bei Hojo üblich. Dies ist der aktuelle Mainstream auf der OpenASR-Liste. Einige der am höchsten platzierten Modelle auf der Liste, wie Nvidias Canary-Qwen-2.5B, IBMs Granite-Speech-3.3-8B und Microsofts Phi-4-Multimodal, integrieren die Fähigkeiten von Sprachmodellen in die Spracherkennung und senken dadurch die durchschnittliche WER (Word Error Rate) auf einen Wert zwischen 5,6% und 5,9%. Der Vorteil der Verwendung von Sprachmodellen besteht darin, dass die Erkennung nicht nur darin besteht, „was für Töne gehört werden und was geschrieben wird“, sondern das Modell auch semantische Informationen nutzen kann, um die Absicht des Sprechers zu verstehen. Bei Rauschen, gesprochenen Ausdrücken, gemischten Sprachen (Deutsch und Englisch) oder Fachbegriffen aus bestimmten Bereichen fällt es einem semantisch verständlichen Modell leichter, herauszufinden, was der Sprecher ausdrücken möchte. Im Folgenden finden Sie die Ergebnisse von Tests, bei denen wir das Modell lokal eingesetzt und mehrere Durchgänge durchgeführt haben.
Praktische Fallstudien, die in zwei Schichten unterteilt sind: 【1】Die ASR-Fähigkeit des Modells Hojo-ASR-V1. 【2】Hojo-TTS. ASR (Automatic Speech Recognition) ASR steht für automatische Spracherkennung. Es ist dafür verantwortlich, Sprache in Text umzuwandeln und stellt den ersten Schritt in der gesamten Voice AI-Kette dar. Egal ob es sich um Spracheingabefunktionen auf Smartphones, Protokolle von Meetings, Echtzeit-Untertitel oder die immer beliebteren AI-Agenten handelt – all diese Funktionen basieren auf ASR. Früher nutzte ich hauptsächlich AI-Spracheingabetools wie Wispr Flow und Typeless. Diese Produkte bieten eine gute Benutzererfahrung, aber bei instabiler Netzwerkverbindung kann es zu Verzögerungen kommen, und die Anpassung an chinesische Sprachumgebungen könnte noch verbessert werden. Später wechselte ich zu lokalen Lösungen, wobei OpenAI’s Open-Source-Tool Whisper am häufigsten verwendet wurde. Nach der Veröffentlichung von Hojo-ASR-V1 habe ich Whisper durch Hojo-ASR-V1 ersetzt, um die Leistung selbst auszuprobieren. Insgesamt war die Erkennungsgeschwindigkeit und Genauigkeit zufriedenstellend, und für die tägliche Spracheingabe reicht es vollkommen aus. Allerdings sind dafür bestimmte lokale Hardwareressourcen erforderlich, insbesondere was den Speicher betrifft. Die gesamte Lösung ist nicht kompliziert – im Grunde genommen wird Hojo-ASR-V1 als unterliegender Erkennungsmotor verwendet, der die Spracheingabe über systemweite Berechtigungen steuert. Nach der Konfiguration kann es in nahezu allen Texteingabeszenarien wie Browsern, ChatGPT, Claude und Notion eingesetzt werden. Während des Tests habe ich direkt eine Beschreibung eines „Kreuzungspunkts“ vorgetragen, einschließlich der Positionierung der Spalte, der inhaltlichen Ausrichtung und der Herkunft des Namens. Dabei habe ich den Text nicht im Voraus vorbereitet und meine Sprechgeschwindigkeit auch nicht absichtlich verlangsamt. Was mir besonders interessant erscheint, ist, dass dieser Arbeitsablauf weiter erweitert werden kann. Nach der Erkennung kann der Text anschließend an DeepSeek, GPT oder andere Modelle weitergeleitet werden, um die Textqualität zu verbessern, die Formatierung zu optimieren, Rechtschreibfehler zu korrigieren und die Struktur zu optimieren.
Der allgemeine Ablauf ist folgender: Klangeingabe → ASR-Umwandlung → Optimierung durch Großmodelle → Direkte Einbindung in den Arbeitsfluss. Für Personen, die häufig schreiben, Meetings abhalten oder mit Agenten zusammenarbeiten, ist diese Erfahrung komfortabler als die mit herkömmlichen Eingabemethoden. Neben Hojo-ASR-V1 haben wir auch festgestellt, dass Hojo sich in Richtung TTS (Text-to-Speech) engagiert hat. Dieses Mal haben wir ihr TTS-Sprachsynthesemodell ausprobiert, und das Team hat außerdem eine leichtere Version namens Hojo-TTS-Light open-sourced. All dies zusammen bildet die Antwortmöglichkeiten von Hojo für den Agenten-Arbeitsfluss. Ein weiterer Teil von Voice AI ist TTS. Den Weg zur Erforschung der Fähigkeiten des TTS-Modells finden Sie auf ihrer offiziellen Website: hojoai.com **Mehrsprachige Sprachsynthese – Fröhliche Frauenstimme** Zuerst haben wir die Mehrsprachige Sprachsynthese getestet, eine der häufig genutzten Funktionen eines TTS-Modells. Da die Fußball-Weltmeisterschaft kurz bevorsteht, ließ ich das Modell mit einer fröhlichen Frauenstimme einen Kommentar zum japanischen Fußballteam vorlesen: Der etwa 30 Sekunden lange Text klingt ziemlich fließend, die Aussprache und einige Details wurden gut umgesetzt – der AI-Einfluss ist kaum wahrnehmbar. Die Tonhöhe der Frauenstimme sowie der fröhliche Tonfall sind deutlich zu hören. Normalerweise beurteilen wir, ob eine Stimme unnatürlich klingt, anhand der Aussprache und der Tonhöhe am Ende jedes Wortes; in diesem Fall stimmt alles im Großen und Ganzen mit dem zu Beginn festgelegten Stil überein. Hojo unterstützt viele Sprachen, darunter Japanisch, Französisch und Kantonesisch. Im nächsten Beispiel wird derselbe Text auf Japanisch vorgelesen – das Ergebnis ist ebenfalls zufriedenstellend und erinnert tatsächlich an die Art und Weise, wie NHK berichtet. **Mehrsprachige Sprachsynthese – Magnetische, seriöse Männerstimme** Auch dieses TTS-Modell kann verschiedene Rollenstimmen verwenden; die Männerstimme klingt ebenfalls gut. Im nächsten Beispiel wird wieder der gleiche Text über die Fußball-Weltmeisterschaft 2026 vorgelesen, diesmal mit einer magnetischen, seriösen Männerstimme. Der Klang entspricht in etwa dem, was ich im Vorschlag festgelegt hatte. **Mehrsprachige Sprachsynthese – Hörbücher** Das TTS-Modell kann eine Vielzahl von Stimmen verwenden. Dieses Mal ließ ich es mit einer Stimme, die für Hörbücher geeignet ist, einen Text vorlesen. Der Text ist eine Einleitung zu „Naruto“ und wurde mit einer Stimme aus einem Hörbuch synchronisiert. Der Klang ist sehr natürlich; bei Wörtern wie „Jugendliche“ wird die Endtonung so gestaltet, dass der Übergang zwischen den Wörtern fließend ist. Auch Verbindungen wie „und“ werden genau richtig ausgesprochen, was dazu beiträgt, dass der gesamte Text angenehm zu hören ist. **Mehrsprachige Sprachsynthese – Flüstern** Beim Testen haben wir auch eine besondere Stimme ausprobiert: das Flüstern. Im nächsten Beispiel verwende ich eine Frauenstimme, die wie ein Flüstern klingt, um eine Einleitung zum Film „Das schweigende Lamm“ vorzulesen: Man kann deutlich verstehen, was gesagt wird, und gleichzeitig werden die leisen Luftströme, das leise Atmen sowie die leisen Töne, die man hört, wenn jemand einem ins Ohr flüstert, gut nachgeahmt. Der Flüsterton des TTS-Modells ist nicht einfach nur eine reduzierte Lautstärke – auch Tonfall, Rhythmus und Stimmung sind sehr gut. Diese Stimme eignet sich besonders gut für Spannungsberichte, Erzählungen als Untertitel oder ASMR. Neben den Standard-Sprechstimmen habe ich auch einige charakteristischere Rollenstimmen getestet. **Kang Hui** Da die Hochschulzugangsprüfungen bevorstehen, hört man in Fernsehen, Radio und auf Kurzvideos viele Glückwünsche und Nachrichtenberichte. Die Stimme des CCTV-Moderators ist in chinesischen Berichten sehr repräsentativ – die Aussprache ist standardisiert und die Wörter werden klar ausgesprochen. Deshalb habe ich ein Audio von Kang Hui als Referenz verwendet; das folgende Beispiel ist das Originalaudio von Kang Hui. Datei-Kopierfunktion für Klangfarben – Kanghui Ich sende dieses Original-Audio an das TTS-Modell, damit es die darin enthaltenen Klangfarben nachahmt und einen etwa 40 Sekunden langen Text vorliest, in dem den Schülern der Hochschulzugangsprüfung viel Erfolg gewünscht wird.
Von der Effektseite her hat das TTS-Modell die Merkmale der ursprünglichen Stimme ziemlich gut beibehalten, insbesondere Kanghuis Tonfall, Pausen und Sprechrhythmus. Schon in der ersten Aussage ist zu hören, dass es Kanghui sehr ähnlich ist. Wenn es Sätze wie „Unser Jugend nicht verschwenden, in die Zukunft eilen“ ausspricht, ist der vertraute Nachrichtensprecherstil sowie das Gefühl des Moderators bei großen Veranstaltungen deutlich zu erkennen. **Nezha** Die Nachbildung der Stimme ist eine der repräsentativen Fähigkeiten des TTS-Modells. Ich habe damit die Stimmen einiger IP-Charaktere nachgebildet, angefangen mit Nezha aus „Nezha: The Demonic Child’s Birth“. Der Klang kommt dem ungebundenen, lässigen Charakter von Nezha sehr nahe, und auch die Pausen entsprechen genau diesem Zustand. **Peppa Pig** Die Stimme von Cartoons wird vom TTS-Modell ebenfalls ziemlich gut nachgebildet. Die Stimmen von Cartoons unterscheiden sich von denen von echten Menschen oder Filmfiguren, und die Verarbeitung ist daher etwas anders. Hier ist ein Beispiel für die von mir mit dem TTS-Modell erstellte Stimme von Peppa Pig: **MacArthur** Ich habe sogar eine sehr beliebte Kommentarstimme von „MacArthur“ von TikTok aufgenommen und sie dazu bringen lassen, Folgendes zu sagen: „Crossroads“ ist ein in China ansässiges Technologie-Medienunternehmen, das sich auf die AI-Welle konzentriert. Seine Kernform ist ein Podcast, der sich aber auch auf Videos, Textversionen auf öffentlichen Accounts und Offline-Community-Aktivitäten erstreckt. „Crossroads“ ist ein Vergleich, den Steve Jobs für das Apple-Unternehmen verwendet hat – es steht an der Kreuzung von Technologie und Kultur, und große Produkte entstehen oft dort. Wir verfolgen die Veränderungen und Chancen, die AI für verschiedene Branchen mit sich bringt, suchen, interviewen und vernetzen „aktive Akteure“ der AI-Ära, um gemeinsam neue Möglichkeiten zu erkunden und zu umarmen. **Wer ist das Hojo-Team?** Zurück zum Hojo-Team selbst: Es handelt sich nicht um ein Unternehmen, das ausschließlich große Sprachmodelle entwickelt.
Hojo wurde vor etwa zwei Jahren gegründet, und vor dieser Enthüllung wusste die Öffentlichkeit kaum etwas über das Unternehmen. Wir haben mit seinem Team Kontakt aufgenommen, um einige erste Informationen zu erhalten. Nach der eigenen Definition von Hojo möchte das Unternehmen eher ein Personal Agent OS für Wissensarbeiter entwickeln. Einfach ausgedrückt: Es geht darum, dass der Agent tatsächlich in alltägliche Arbeitsabläufe wie Büroarbeit, Kommunikation, Kreation und Zusammenarbeit eingebunden wird, wobei ASR (Automatic Speech Recognition) und TTS (Text-to-Speech) zwei Schlüsselkomponenten dieses Systems sind. Das ist auch der Schlüssel, um Hojo zu verstehen: ASR ist eigentlich nur die erste Grundlage dafür, dass der Agent reale Arbeitssituationen verstehen kann. Erst wenn Informationen aus Meetings, Telefonaten, Sprachnotizen und Mehrpersonendiskussionen zuverlässig aufgenommen werden, ist es möglich, weitere Schritte wie Verständnis, Planung und Ausführung durchzuführen. Was das Team betrifft, so ist Hojo insofern besonders, als seine Kernmitglieder seit langer Zeit mit „realen Sprachsituationen“ zu tun haben. Die Teammitglieder stammen größtenteils aus Teams, die sich mit Fahrzeugsprachsystemen, intelligenten Fahrerhäusern und Sprachinteraktionen beschäftigen, darunter Xpeng, NIO Nomi und SenseTime. Genauer gesagt: Der Gründer Zhao Hengyi war zuvor bei Unternehmen wie LeEco, Xpeng, NIO und SenseTime für Sprachinteraktionen, intelligente Fahrerhäuser und AgentOS zuständig und hat Erfahrung in Bereichen wie Fahrzeugsprachsysteme, intelligente Fahrerhäuser, Mehrsprachige Interaktionen, selbstständig steuerbare AI-Anwendungen und crossgerätebasierte Dienste gesammelt. Der Chief Product Officer Li Ou war zuvor bei SenseTime und NIO für AgentOS, intelligente Fahrerhäuser und digitale Produktplanung verantwortlich und konzentrierte sich darauf, wie Sprachfähigkeiten zu einem vollständigen Produkterlebnis zusammengeführt werden können – und nicht nur auf einzelne Modellfähigkeiten. Der COO Sun Xiaogang verfügt über Erfahrung in der Kommerzialisierung von Agent-Lösungen und der Umsetzung von Sprachinteraktionen in verschiedenen Branchen, unter anderem in Bereichen wie Fahrzeugtechnik, Gastronomie und Mobilität. Wenn man all diese Erfahrungen zusammen betrachtet, dann hat das Team von Hojo eine solide Grundlage, um langfristig Probleme im Bereich Sprachverarbeitung in realen Situationen zu lösen. Das liegt hauptsächlich daran, dass sich die Teammitglieder auf Umgebungen konzentrieren, in denen ASR tatsächlich eingesetzt wird – und diese Umgebungen unterscheiden sich stark von den sauberen Audiodaten in Laboren. In Autos gibt es Geräusche, Dialekte, mehrere Sprecher, Unterbrechungen sowie viele unvollständige und mündliche Ausdrücke.
Die Nutzer sprechen nicht nach standardisierten Anweisungen und warten auch nicht darauf, dass das System langsam reagiert. Diejenigen, die bereits mit solchen Szenarien gearbeitet haben, verstehen besser, wo die wirklichen Herausforderungen bei Sprachmodellen liegen: Die automatische Spracherkennung (ASR) muss in komplexen Umgebungen zuverlässig die Absichten der Menschen verstehen. Die Erfahrungen von Sudans, dem Chefwissenschaftler von Hojo, lassen sich ebenfalls in diesem Kontext leichter nachvollziehen. In seinen frühen Jahren war er bei Baidu an der Entwicklung von Spracherkennungstechnologien beteiligt und erlebte, wie das Deep Learning die kommerzielle Umsetzung von ASR vorantrieb; später leitete er bei Tencent AI Lab die Abteilung für Sprachtechnologien und erlebte die Ära der großen Modelle, die die Sprachinteraktionen neu gestalteten. Der Wert seiner Erfahrung liegt darin, dass er persönlich mehrere Veränderungen in der Sprachtechnologie miterlebt hat – von der Konkurrenz um die Erkennungsgenauigkeit über die Anwendung in realen Szenarien bis hin zur Neugestaltung der Sprachinteraktionen durch große Modelle. Für ein Unternehmen, das einen Personal Agent OS entwickeln möchte, bedeutet diese Erfahrung, dass Sprache nicht nur als einfaches Eingabekomponent angesehen werden darf, sondern dass eine umfassende Neugestaltung in den tatsächlichen Arbeitsabläufen notwendig ist. Auf der Kapitalseite hat Hojo, obwohl das Produkt noch nicht offiziell auf den Markt gebracht wurde, in vier Finanzierungsrunden fast 100 Millionen Yuan eingeworben und befindet sich derzeit in der Pre-A-Runde. Solche Informationen beweisen zwar nicht unbedingt den Erfolg des Produkts, zeigen jedoch zumindest, dass die Primärmarktteilnehmer das technische Potenzial des Unternehmens in den Bereichen Voice AI und Agent OS erkennen. Was die Kommerzialisierung betrifft, so bietet das von Hojo entwickelte „Großmodell + Agentic OS“-Kombination bereits Sprachfunktionen für Millionen von AI-Geräten. Wenn diese Zahl zutrifft, bedeutet das, dass das Unternehmen nicht nur in der Theorie oder in Demo-Versionen existiert, sondern bereits in echten Geräten und Anwendungsszenarien eingesetzt wird. Laut den Plänen von Hojo ist die ASR erst der erste Schritt. Gleichzeitig arbeitet das Unternehmen auch an der Entwicklung von TTS (Text-to-Speech)-Technologien und plant, Ende Juni ein vollständig bidirektes Sprachmodell zu veröffentlichen. Das eigentliche Ziel ist es, um einen umfassenden Rahmen für Sprachinteraktionen für Personal Agent OS zu schaffen – Agenten, die hören, verstehen und reagieren können und schließlich in die tatsächlichen Arbeitsabläufe von Fachkräften integriert werden. Ob diese Pläne umgesetzt werden können, muss noch durch die folgenden Produkte bewiesen werden. Aber allein die Leistung von Hojo-ASR-V1 zeigt, dass Hojo bereits in der ersten Phase der Voice AI-Werkzeugkette bemerkenswerte Ergebnisse erzielt hat. Warum haben die von Hojo-ASR veröffentlichten Daten dann so viel Interesse verursacht? Oder mit anderen Worten: In welchem Kontext steht Hojo-ASR? Voice AI ist eine weitere Entwicklungslinie neben den allgemeinen Großmodellen. Wenn Agenten in die tatsächlichen Arbeitsabläufe eintreten, wird der Kontext, den sie erhalten, immer komplexer: Diskussionen in Meetings, Anfragen am Telefon, Geräusche in der Umgebung, spontane Ergänzungen der Nutzer – sogar ständig wechselnde Anweisungen bei der Zusammenarbeit mehrerer Personen. Früher wurden diese Informationen hauptsächlich durch Eingabe per Tastatur übertragen, aber in vielen Arbeitssituationen entstehen die relevanten Informationen nicht durch Schreiben, sondern durch Sprechen.
Das ist auch der Grund, warum die großen Unternehmen in den letzten zwei Jahren ihre Investitionen in Voice AI deutlich erhöht haben. OpenAI hat die Realtime API eingeführt, Google arbeitet an Gemini Live, und in China haben Unternehmen wie iFlytek, DouBao, MiniMax und JieYue ebenfalls viel in die Entwicklung von Sprachtechnologien investiert. Die Popularität dieses Bereichs in den letzten Jahren lässt sich an der Menge des investierten Kapitals ablesen. Laut Statistiken von AssemblyAI erhielten Sprach-AI-Start-ups im Jahr 2025 insgesamt etwa 2,1 Milliarden US-Dollar an Risikokapital; allein vom Juni 2025 bis Mai 2026 wurden 36 Finanzierungen im Bereich des dialogbasierten AI mit einem Gesamtvolumen von etwa 2,58 Milliarden US-Dollar bekannt gegeben. Mit einem Wort: Es ist sehr heiß um diese Technologie. Konkret gesehen hat das Unternehmen ElevenLabs in der D-Runde 500 Millionen US-Dollar erhalten und wurde auf einen Wert von 11 Milliarden US-Dollar geschätzt; PolyAI, das sich auf Sprachdienste für Telefonkundenbetreuung spezialisiert hat, erhielt 86 Millionen US-Dollar in der D-Runde; Retell AI, das sich auf Echtzeit-Telefongespräche konzentriert, bearbeitet jeden Monat mehr als 40 Millionen AI-Gespräche und verzeichnet einen Quartalswachstum von über 300%. Es gibt auch Teams wie Cartesia, die darauf abzielen, die Sprachverzögerung auf unter 100 Millisekunden zu reduzieren, um ein besseres Gesprächserlebnis zu schaffen. Auch die großen Unternehmen sind sehr aktiv: OpenAI hat die Realtime API eingeführt, die eine end-to-end-Lösung für Sprachverarbeitung bietet – der Ton wird direkt von der Eingabe zur Ausgabe geleitet, ohne dass er zuerst in Text umgewandelt, durch ein Modell verarbeitet und dann wieder synthetisiert wird. Googles Gemini Live folgt diesem Konzept und kann auch dann weiterreagieren, wenn man mitten im Satz unterbrochen wird. In den letzten Tagen wurde auch eine neue Funktion namens Gamma4 für Voice AI hinzugefügt: Man kann erkennen, dass Sprache sich von einer „natürlicheren Interaktionsmethode“ zu einem Einstiegspunkt für Agenten entwickelt, um Kontext zu erhalten. Dieser Trend wird besonders in den aktuellen Trends wie dem Vibe Working deutlich. Man muss nicht jedes Anliegen in einen vollständigen Prompt aufteilen; man kann während des Denkens sprechen und Anpassungen vornehmen, sodass der Agent die Absichten verstehen, den Kontext ergänzen und die Aufgabe fortsetzen kann – das erscheint natürlicher. In diesem Prozess ist ASR (Automatic Speech Recognition) die erste Stufe der Fähigkeiten. Es entscheidet, ob der Agent die reale Welt richtig verstehen kann. Wenn die Sprache nicht richtig erkannt wird, werden die folgenden Schritte der Verständnisbildung, Planung und Ausführung verzerrt; nur wenn die Sprache korrekt erfasst wird, kann sie wirklich Teil des Arbeitsflusses werden. Zusammenfassend: Wenn Agenten allmählich in den Alltag einziehen, wird Sprache – also Voice AI – wahrscheinlich der erste Kontaktpunkt zwischen Menschen und AI sein. Es gibt viele Möglichkeiten, mit AI zu interagieren, wie das Tippen von Texten, das Bedienen von Benutzeroberflächen oder das Schreiben von Code zur Anrufung von APIs, aber der natürlichste Weg ist es, einfach zu sprechen. Deshalb wird Sprache immer häufig als „Context Entry“ für Agenten bezeichnet – als Einstiegspunkt zum Verständnis des Kontextes. Wenn man sagt, dass große Modelle dafür verantwortlich sind, die Welt zu verstehen, dann ist Sprache der Kanal, über den kontinuierlich Informationen in das Modell fließen. In diesem Kanal spielt ASR eine entscheidende Rolle als Wahrnehmungsschicht: Es bestimmt, ob der Agent die Informationen aus der Umwelt genau erfassen und die Geräusche der realen Welt in einen für das Modell verständlichen Kontext umwandeln kann. Aus dieser Sicht hat sich der Wettbewerb um ASR auf eine höhere Ebene erhoben – es geht darum, den Zugang zur Verbindung zwischen der nächsten Generation von Agenten und der realen Welt zu gewinnen. Das ist auch der Grund, warum die von Hojo-ASR-V1 veröffentlichten Daten besonders interessant sind. Hinter ihnen steckt mehr als nur eine Veränderung in den Leistungen eines Modells.
Voice AI entwickelt sich von einer unterstützenden Funktion zu einer grundlegenden Infrastruktur und wird zu einer immer wichtigeren Basis für die Ära der Agenten. 🚥 Zurück zu Voice AI: Während die meisten Unternehmen ihre Aufmerksamkeit auf allgemeine Großmodelle richten, hat sich der relativ ruhige Bereich der Spracherkennung tatsächlich schnell weiterentwickelt. Selbst in einem Bereich wie der automatischen Sprachverarbeitung (ASR), der lange Zeit von großen Unternehmen wie OpenAI, Microsoft, Nvidia und IBM dominiert wurde, zeigen nun Start-up-Teams durchaus konkurrenzfähige Ergebnisse. Das Auftreten von Hojo-ASR-V1 bedeutet vielleicht nicht unbedingt, dass sich das Machtgleichgewicht bereits verändert hat, aber es zeigt zumindest, dass Voice AI von einer Randfunktion zu einer wichtigeren Rolle aufsteigt und immer mehr Interesse weckt. Spracherkennung ist nur der erste Schritt in der Entwicklung von Voice AI. Entscheidend ist, ob die Maschinen die Sprache richtig verstehen und in einer für Menschen verständlichen Weise darauf reagieren können – das ist eine viel längere, wertvollere und vielversprechendere Entwicklung. Referenzen: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR Der Artikel stammt vom WeChat-Kanal „Crossing“ und wurde von „Crossing“ verfasst.
Artikellink:https://airai.cc/de/news/6/
War das hilfreich?