El creciente mercado de la IA de voz ha visto la aparición de una nueva startup llamada Hojo.
Voice AI es otra línea de desarrollo aparte de los grandes modelos generales. Mientras todos están centrados en estos modelos generales, en el campo relativamente tranquilo de la IA de voz también comienzan a aparecer algunos modelos nuevos que merecen atención. El teclado está perdiendo su “dominio”. En los últimos dos años, OpenAI lanzó la API Realtime, Google desarrolló Gemini Live, y casi todas las compañías chinas dedicadas a modelos grandes también han comenzado a invertir en IA de voz. Cada vez más personas creen que, una vez que los agentes inteligentes (agents) se integren realmente en los flujos de trabajo, el sonido se convertirá en una entrada al contexto más natural que el teclado. Si un agente inteligente quiere integrarse de verdad en los flujos de trabajo, primero debe aprender a comprender estos sonidos. Y la primera capacidad necesaria para ello es la ASR (Reconocimiento Automático de Voz). Para medir el nivel de ASR, la industria suele utilizar la tabla de líderes Open ASR de Hugging Face, cuyo indicador clave es la tasa de errores de palabras (WER); cuanto más baja sea esta tasa, más precisa es la reconocimiento de voz.
Durante mucho tiempo, esta lista ha sido dominada por grandes empresas y laboratorios de renombre. Los requisitos para obtener datos de entrenamiento, capacidad de cálculo y experiencia en ingeniería son bastante elevados, por lo que pocos equipos pequeños se atreven a competir abiertamente en este ámbito. Recientemente, un equipo de startups llamado Hojo ha revelado los resultados de sus pruebas de reconocimiento de voz, y parece que tienen la tendencia de convertirse en un “caballo negro” en el mercado. Según los datos publicados oficialmente, Hojo-ASR-V1 ha obtenido buenos resultados en varios conjuntos de datos de reconocimiento de voz en inglés.
En este texto, se menciona que el índice de errores de palabras (WER, Word Error Rate) en LibriSpeech Clean es de solo el 1.74%, y en conjuntos de datos más cercanos a escenarios reales como GigaSpeech y VoxPopuli, también se ha reducido a menos del 8%. Aunque no han presentado sus resultados en la lista oficial, si se compararan con los datos de la Open ASR Leaderboard, estarían entre los mejores. En general, se trata de un modelo de ASR (Automatic Speech Recognition) que demuestra su competitividad en pruebas de referencia públicas. Además, está disponible de código abierto en GitHub y Hugging Face, bajo la licencia Apache-2.0, lo que significa que no hay muchas restricciones para su reutilización. Por lo tanto, decidimos implementar Hojo-ASR-V1 para experimentarlo en persona y ver qué nivel de calidad tiene este modelo de reconocimiento de voz creado por este equipo emprendedor discreto. También aprovechamos la oportunidad para hablar sobre una nueva tendencia en ascenso en el campo de la IA de voz: Voice AI. ¿Qué es exactamente Hojo-ASR? Hemos realizado pruebas para entenderlo mejor. En primer lugar, Hojo-ASR-V1 está disponible de código abierto en HuggingFace y GitHub: Enlace de Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] Enlace de GitHub: https://github.com/HojoAI/Hojo-ASR[2] Para comenzar, es importante aclarar qué tipo de modelo es Hojo-ASR-V1. Después de examinar su código y configuración, hemos observado que su estructura es diferente de los modelos tradicionales de reconocimiento de voz.
El audio primero se procesa con el extractor de características de Whisper para convertirlo en características acústicas que el modelo pueda utilizar, y luego se introduce en el codificador de audio Qwen3-Omni. En el proceso, se utiliza una estructura llamada Conformer para adaptar y comprimir el audio.
Finalmente, el resultado se entrega a un modelo de lenguaje Qwen3-4B, que es el que escribe el texto final. En otras palabras: Hojo-ASR-V1 es una combinación de «codificador + adaptador + modelo de lenguaje de gran capacidad». La idea de utilizar un modelo de lenguaje de gran capacidad para la decodificación del ASR no es exclusiva de Hojo. Esta es precisamente la dirección principal en la cima de la lista OpenASR en la actualidad. Algunos de los modelos que ocupan posiciones destacadas en la lista, como el Canary-Qwen-2.5B de NVIDIA, el Granite-Speech-3.3-8B de IBM y el Phi-4-Multimodal de Microsoft, integran la capacidad del modelo de lenguaje en el reconocimiento de voz, lo que ha reducido el promedio de WER (Error Rate) entre el 5.6% y el 5.9%. La ventaja de incorporar un modelo de lenguaje es que el reconocimiento no se limita a «escuchar los sonidos y escribir las palabras»; el modelo también puede utilizar el significado para hacer juicios. Cuando se enfrenta a ruido, expresiones coloquiales, mezclas de español e inglés o términos especializados de un campo determinado, un modelo que entiende el significado puede entender más fácilmente lo que el hablante intenta comunicar. A continuación, se presenta la parte de las pruebas reales: desplegamos el modelo localmente y ejecutamos muchas rondas de pruebas.
Caso de prueba, dividido en dos partes: 【1】Capacidad de reconocimiento de voz (ASR) del modelo Hojo-ASR-V1. 【2】Hojo-TTS. Reconocimiento de Voz (ASR) El nombre completo de ASR es Automatic Speech Recognition, es decir, reconocimiento automático de voz. Está encargado de convertir el sonido en texto y es el primer paso en toda la cadena de inteligencia artificial de voz. Ya sea en los teclados de voz de los teléfonos, las transcripciones de reuniones, los subtítulos en tiempo real o los agentes de IA que son cada vez más populares hoy en día, todo depende del ASR. Anteriormente, era usuario de herramientas de entrada de voz de IA como Wispr Flow y Typeless. Estos productos tenían una buena experiencia de uso, pero a veces había retrasos cuando la conexión a Internet no era estable, y también había espacio para mejorar la adaptación a escenarios en chino. Más tarde, comencé a utilizar soluciones de implementación local, entre las cuales la más utilizada era Whisper, que es open source de OpenAI. Después del lanzamiento de Hojo-ASR-V1, para probarlo en la práctica, reemplacé Whisper por Hojo-ASR-V1. En general, la velocidad de reconocimiento y la precisión son buenas, y es lo suficientemente fluido para la entrada de voz diaria. Por supuesto, esto implica la necesidad de ciertos recursos de hardware locales y requiere cierta cantidad de memoria. La solución en sí no es compleja; esencialmente, se utiliza Hojo-ASR-V1 como motor de reconocimiento subyacente y luego se toma el control de la entrada de voz a través de permisos a nivel de sistema. Una vez configurado, puede funcionar en casi todos los escenarios de entrada de texto, como navegadores, ChatGPT, Claude, Notion, etc. Durante la prueba, dicté directamente una descripción sobre un "cruce de caminos", incluyendo la ubicación de las secciones, la dirección del contenido y el origen del nombre, entre otros. Todo el proceso se realizó sin organizar el texto de antemano ni intentar ralentizar el ritmo del habla: Lo que encuentro interesante es que este tipo de flujo de trabajo puede seguir expandiéndose. Después del reconocimiento, se puede conectar con modelos como DeepSeek, GPT u otros para mejorar el texto, organizar su formato, corregir errores de ortografía y optimizar su estructura.
El proceso general es más o menos el siguiente: Entrada de voz → Transcripción ASR (Automatic Speech Recognition) → Optimización por un gran modelo → Acceso directo al flujo de trabajo. Para personas que escriben con frecuencia, asisten a reuniones o colaboran con agentes, esta experiencia es más cómoda que los métodos de entrada tradicionales. Además de Hojo-ASR-V1, también hemos notado que Hojo ha invertido esfuerzos en el área de TTS (Text-to-Speech). Esta vez hemos probado su modelo de síntesis de voz TTS, y el equipo también ha lanzado una versión más ligera llamada Hojo-TTS-Light. Todo esto forma parte de la solución de Hojo para flujos de trabajo con agentes. Otro componente de Voice AI es el TTS. Puedes probar las capacidades del modelo TTS en su sitio web oficial: [hojoai.com](hojoai.com). **Síntesis de voz en múltiples idiomas – Voz femenina alegre** Lo primero que probamos fue la síntesis de voz en múltiples idiomas, una función bastante común en los modelos TTS. Con la Copa del Mundo a punto de comenzar, le pedimos que leyera un texto de presentación de los jugadores del equipo japonés en un tono de voz femenino más alegre: El texto de aproximadamente 30 segundos en chino suena bastante fluido; la pronunciación y algunos detalles están bien gestionados, y no se nota mucho la presencia de la IA. El tono de voz femenino y su enfoque alegre son evidentes. Generalmente, juzgamos si una voz suena artificial basándonos en la pronunciación y el tono al final de cada palabra, y en este caso, el resultado se ajusta bastante al estilo establecido al principio. Hojo soporta varios idiomas, como japonés, francés y cantonés. El mismo texto de presentación del equipo japonés, leído en japonés, también tiene un buen resultado; suena bastante similar a las transmisiones de NHK. **Síntesis de voz en múltiples idiomas – Voz masculina atractiva y estable** Este modelo TTS también puede cambiar de tono de voz según el personaje; la voz masculina también suena bastante bien. El siguiente texto es una presentación de la Copa del Mundo de 2026, y elegimos un tono de voz masculino atractivo y estable. El resultado es bastante consistente con lo que habíamos especificado. **Síntesis de voz en múltiples tonos – Libros de audio** El modelo TTS puede utilizar varios tonos de voz. Esta vez le pedimos que leyera un texto de presentación de *Naruto* en un tono de voz de libro de audio. Suena bastante natural. Al pronunciar palabras como “joven”, el final de las palabras se maneja de manera que la transición entre ellas es fluida. Además, palabras como “y” (que usamos en el habla cotidiana) se detienen de manera precisa, lo que también contribuye a que el texto suene coherente. **Síntesis de voz en múltiples tonos – Susurro** Durante las pruebas, quisimos destacar un tono en particular: el susurro. En este caso, utilizamos un tono de voz femenino para susurrar una presentación de la película *El Cordero Silencioso*. Puedes entender claramente lo que se dice, y el modelo también simula el flujo de aire suave, los sonidos de respiración sutiles y los tonos bajos que se producirían si alguien hablara al oído de uno. El susurro generado por el modelo TTS no es simplemente una reducción del volumen; el tono, el ritmo y la emoción también son bastante buenos. Este tipo de tono es adecuado para comentarios de misterio, narraciones de historias o contenido ASMR. Además de los tonos de voz estándar, también probamos algunos tonos de personajes con mayor reconocimiento público, como el de Kang Hui. Actualmente es la temporada de los exámenes de ingreso a la universidad, y se escuchan muchos mensajes de deseo y noticias en la televisión, la radio y los videos cortos. La voz del presentador de CCTV es bastante representativa en las transmisiones en chino, ya que su pronunciación es precisa y clara. Por lo tanto, elegimos un audio de Kang Hui como referencia; el siguiente fragmento es el audio original de Kang Hui. Copiar el timbre de un archivo de audio: Kanghui Envío este audio original al modelo TTS para que lo reproduzca utilizando el mismo timbre y lea un texto de aproximadamente 40 segundos de duración, deseando éxito a los estudiantes que están preparándose para los exámenes de ingreso a la universidad.
En términos de resultados, el modelo de TTS ha conservado bastante bien las características de la voz original, especialmente el tono, las pausas y el ritmo de narración de Kang Hui. Tan pronto como se escucha la primera frase, se puede notar que se parece mucho a Kang Hui en persona. Cuando dice frases como “No desperdiciar la juventud, correr hacia el futuro”, se puede reconocer su familiar estilo de presentación de noticias y su sensación de presentador de eventos importantes. **Nezha** La capacidad del modelo de TTS para replicar el timbre de voz es bastante representativa. Usé este modelo para reproducir la voz de varios personajes de IP, comenzando por Nezha de “Nezha: The Demonic Child’s Birth”. El resultado suena bastante cercano a la sensación de rebeldía y pereza de Nezha, y las pausas también son bastante acertadas. **Peppa Pig** El modelo de TTS también ha reproducido bastante bien el timbre de voz de los personajes de dibujos animados. Las voces de los personajes de dibujos animados son diferentes de las de personas reales o de personajes de películas, por lo que requieren un enfoque un poco distinto al procesarlas. A continuación, escucharás a Peppa Pig sintetizada por el modelo de TTS: **MacArthur** Incluso grabé un audio de comentario muy popular en TikTok de “MacArthur” para que lo leyera en voz alta: “Crossroads” es una publicación de tecnología autónoma en China que se centra en la ola de la IA. Su formato principal es un podcast, pero también incluye videos, versiones en texto para sus cuentas oficiales en redes sociales y eventos en persona. “Crossroads” es una metáfora utilizada por Steve Jobs para describir a Apple como una empresa que se encuentra en la encrucijada entre la tecnología y la humanidad; los productos más grandes a menudo nacen allí. Nos centramos en los cambios y oportunidades que la IA trae a diversos sectores, buscamos, entrevistamos y reunimos a “actores positivos” de la era de la IA para explorar y abrazar nuevas posibilidades juntos. **¿Quién es el equipo Hojo?** Volviendo al equipo Hojo en sí, no es una empresa que solo se dedica a desarrollar modelos de voz.
Hojo fue fundada hace aproximadamente dos años, y antes de esta revelación de información, muy poca gente sabía sobre ella. Hemos contactado a su equipo para obtener algunos datos de primera mano. Según la propia definición de Hojo, su objetivo principal es desarrollar un sistema operativo personal (Personal Agent OS) dirigido a los trabajadores del conocimiento. En otras palabras, su objetivo es que los agentes digitales se integren de manera efectiva en los flujos de trabajo diarios, como la oficina, la comunicación, la creación y la colaboración. El reconocimiento de voz (ASR) y la generación de voz en texto (TTS) son dos piezas clave de este sistema. Esta es también la clave para comprender el enfoque de Hojo: el ASR es solo la primera capa para que el agente entienda las situaciones de trabajo reales. Solo después de recibir de manera fiable la información de reuniones, llamadas, notas de voz y discusiones grupales es posible que los procesos de comprensión, planificación y ejecución tengan lugar. Un aspecto especial del equipo de Hojo es que sus miembros principales han trabajado durante mucho tiempo con “situaciones de voz reales”. Muchos de ellos provienen de equipos relacionados con la voz en vehículos, cabinas inteligentes e interacción vocal, incluyendo Xpeng, NIO Nomi y SenseTime. Más específicamente, el fundador, Zhao Hengyi, ha trabajado anteriormente en equipos de LeEco, Xpeng, NIO y SenseTime en áreas como interacción vocal, cabinas inteligentes, AgentOS, así como aplicaciones de operación autónoma por IA y servicios entre dispositivos. El director de producto, Li Ou, ha estado a cargo de la planificación de AgentOS, cabinas inteligentes y productos digitales en equipos como SenseTime y NIO, centrándose en cómo las capacidades de voz se pueden integrar en una experiencia de producto completa, y no simplemente en capacidades de modelos individuales. El director de operaciones, Sun Xiaogang, tiene experiencia en la comercialización de soluciones de agentes y la implementación de interacción vocal en industrias como la automoción, la restauración y los servicios de transporte. Al considerar estos antecedentes juntos, la experiencia común del equipo de Hojo proporciona una base sólida para abordar de manera efectiva los problemas de voz en situaciones reales a largo plazo. Esto se debe principalmente a que los miembros del equipo se han centrado en entornos reales donde el ASR debe funcionar de manera práctica, lo que es muy diferente de los audio limpios utilizados en los laboratorios. En los vehículos hay ruido, dialectos, múltiples personas hablando al mismo tiempo, interrupciones repentinas, y una gran cantidad de expresiones orales e incompletas.
Los usuarios no hablan de acuerdo con el prompt estándar y no esperan que el sistema responda lentamente. Las personas que han hecho este tipo de escenarios tienen más facilidad para entender dónde es realmente difícil el modelo de voz, y ASR necesita una comprensión estable de las intenciones de las personas en entornos complejos. La experiencia de Sudán, el científico jefe de Hojo, también se puede entender más fácilmente en este contexto. Participó en la I + D relacionada con el reconocimiento de voz en Baidu en sus primeros años, y experimentó la etapa de aprendizaje profundo que empujó ASR a la etapa de comercialización; más tarde, se hizo cargo de la dirección relacionada con la voz en Tencent AI Lab y se puso al día con la etapa de reescribir la interacción de voz del modelo grande. El valor de este currículo es que él mismo ha experimentado varios cambios en la tecnología de voz desde la competencia de precisión de reconocimiento hasta el aterrizaje de escenas reales y luego la reconstrucción de la interacción de voz en la era del modelo grande. Para una empresa que quiere hacer un sistema operativo de agente personal, esta experiencia determina que no solo ve la voz como un componente de entrada, sino que es clave rediseñarla en el flujo de trabajo real. A nivel de capital, Hojo ha completado cuatro rondas de financiamiento de cerca de 100 millones de yuanes desde su establecimiento, y actualmente está llevando a cabo la ronda Pre-A, bajo la condición de que el producto no se haya lanzado oficialmente a gran escala. Este tipo de información no puede demostrar directamente que el producto debe tener éxito, pero al menos indica que el mercado primario ha comenzado a prestar atención a la acumulación de tecnología de la compañía en la dirección de Voice AI y Agent OS. En términos de comercialización, según Hojo, su propia combinación de "modelo grande + sistema operativo Agentic" ha proporcionado capacidades de voz subyacentes para dispositivos de sonido de IA del orden de diez millones. Si este número es cierto, significa que no se queda solo en el documento, la demostración o la lista, sino que ha entrado en el dispositivo real y el escenario de usuario real. A juzgar por la propia planificación de Hojo, ASR es sólo el primer paso. También está haciendo TTS al mismo tiempo y planea lanzar un modelo de voz full-duplex a finales de junio. La historia que realmente quería contar es construir una base de interacción de voz en torno al sistema operativo de agente personal: permitir que el agente escuche, entienda, responda y, finalmente, entre en el flujo de trabajo real de los trabajadores del conocimiento. Si estos planes se pueden cumplir, todavía necesitan productos de seguimiento para verificar. Pero al menos a juzgar por el rendimiento de Hojo-ASR-V1 esta vez, ya está en el primer bucle del flujo de trabajo de Voice AI y ha entregado un resultado lo suficientemente notable. Entonces, ¿por qué este conjunto de datos de divulgación de Hojo-ASR ha atraído la atención?¿O en qué contexto se encuentra el Hojo-ASR? Voice AI, otra historia más allá del gran modelo de GM A medida que el agente comienza a entrar en el flujo de trabajo real, los contextos que necesita recibir se vuelven cada vez más complejos: discusiones en una reunión, solicitudes en un teléfono, voces en un entorno de campo, oraciones agregadas por un usuario, o incluso instrucciones cambiantes cuando varias personas colaboran al mismo tiempo. En el pasado, esta información se ingresa principalmente por mecanografía, pero en muchas situaciones de trabajo, la información que realmente ocurre no se escribe, sino que se dice.
Esto también explica por qué las grandes empresas han estado aumentando sus inversiones en IA de voz en los últimos dos años. OpenAI lanzó la API en tiempo real (Realtime API), Google desarrolló Gemini Live, y empresas chinas como iFlytek, DouBao, MiniMax y JieYue también han invertido en este campo. El entusiasmo por esta tecnología en estos años se puede medir por la cantidad de capital que se ha invertido en ella. Según las estadísticas de AssemblyAI, en 2025, las empresas de IA de voz recibieron aproximadamente 2100 millones de dólares en inversiones de riesgo; desde junio de 2025 hasta mayo de 2026, se anunciaron 36 rondas de financiación en el sector de la IA de diálogo, por un total de unos 2580 millones de dólares. En resumen, la situación es muy dinámica. En cuanto a las empresas, ElevenLabs, que se dedica a la síntesis de voz, recaudó 500 millones de dólares en su cuarta ronda de financiación y su valor se estimó en 11 mil millones de dólares; PolyAI, que se especializa en servicios de atención al cliente por voz, recibió 86 millones de dólares en su cuarta ronda; Retell AI, que se encarga de las llamadas en tiempo real, maneja más de 40 millones de llamadas de IA al mes, con un aumento trimestral de más del 300%. También hay equipos como Cartesia, que se dedican a reducir la latencia de la voz a menos de 100 milisegundos para que las conversaciones suenen más fluidas. Las grandes empresas también están muy activas en este ámbito. OpenAI lanzó la API en tiempo real, ofreciendo una solución integral para la voz que abarca desde la entrada del sonido hasta su salida, sin necesidad de dividir el proceso en tres etapas (conversión a texto, procesamiento por modelo y síntesis). Google’s Gemini Live funciona de manera similar: permite continuar respondiendo incluso si la conversación es interrumpida. En los últimos días, también se lanzó una nueva versión de Voice AI que utiliza Gamma4. Se puede observar que la voz se está convirtiendo en una forma de interacción «más natural» y en una entrada para que los agentes (Agentes) obtengan contexto. Esta tendencia es aún más evidente en servicios como Vibe Working, que son muy populares en la actualidad. No es necesario organizar cada solicitud en forma de un prompt completo; se puede pensar, hablar y ajustar en el proceso, permitiendo que el agente capture la intención, complete el contexto y avance en la tarea de manera más natural. En esta cadena, el ASR (Automatic Speech Recognition) es la primera capa de capacidad, ya que determina si el agente puede comprender el mundo real. Si no se escucha con precisión, el entendimiento, la planificación y la ejecución posterior serán defectuosos; solo si se escucha con exactitud, la voz podrá convertirse realmente en parte del flujo de trabajo. En resumen, cuando los agentes comiencen a formar parte de la vida diaria, la voz, es decir, la IA de voz, es probablemente la primera forma en que interactúan con las personas. Hay muchas maneras de conectar a las personas con la IA, como escribir, usar interfaces o llamar a APIs, pero la forma más cercana a la conversación diaria entre personas es hablar. Por eso cada vez más personas denominan a la voz la «entrada de contexto» para los agentes. Si se dice que los grandes modelos son responsables de comprender el mundo, entonces la voz es el canal a través del cual el mundo continúa fluyendo hacia el modelo. Y en este canal, el ASR desempeña un papel crucial, ya que determina si el agente puede capturar con precisión la información del entorno exterior y convertir los sonidos del mundo real en contexto que el modelo pueda comprender y utilizar. Desde este punto de vista, la competencia en el campo del ASR ha subido de nivel: se trata de luchar por la entrada que conectará la próxima generación de agentes con el mundo real. Esto también es la razón por la cual los datos revelados por Hojo-ASR-V1 son aún más dignos de atención. Lo que se refleja detrás de ellos no es simplemente un cambio en el rendimiento de un modelo.
La IA de voz está pasando de ser una capacidad auxiliar a convertirse en una infraestructura esencial, convirtiéndose en una base cada vez más importante en la era de los agentes. 🚥 Volviendo a la IA de voz, mientras que la mayoría de los fabricantes se centran en los modelos generales, este campo relativamente tranquilo de la tecnología está evolucionando rápidamente. Incluso en áreas lideradas durante mucho tiempo por empresas como OpenAI, Microsoft, NVIDIA e IBM (como el reconocimiento de voz automático, ASR), ya hay equipos de startups que están logrando resultados muy competitivos. La aparición de Hojo-ASR-V1 puede no significar que el panorama haya cambiado completamente, pero al menos indica que la IA de voz está pasando de ser una capacidad periférica a ocupar un lugar más central, atrayendo cada vez más atención. El reconocimiento de voz es solo el primer paso en el camino de la IA de voz. Lo realmente importante es si las máquinas pueden entender lo que escuchan y responder de una manera similar a la humana; eso es un proceso más largo, valioso y con mayor potencial. Referencias: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR El artículo proviene de la cuenta WeChat oficial “Crossing”, escrito por “Crossing”.
Enlace del artículo:https://airai.cc/es/news/6/
¿Te ha resultado útil?