Menu

No crescente cenário da IA de Voz, surgiu uma startup chamada Hojo.

Voice AI é uma outra linha de desenvolvimento, além dos grandes modelos universais. Enquanto todos estão de olho nos grandes modelos universais, também começam a surgir novos modelos notáveis no campo relativamente tranquilo da Voice AI. O teclado está perdendo o seu “domínio”. Nos últimos dois anos, a OpenAI lançou o Realtime API, a Google criou o Gemini Live, e as empresas chinesas que trabalham com grandes modelos também começaram a se concentrar na área da Voice AI. Cada vez mais pessoas acreditam que, quando os agentes (programas que auxiliam no trabalho) realmente entrarem nos fluxos de trabalho, a voz se tornará uma entrada de contexto mais natural do que o teclado. Se um agente quiser realmente fazer parte dos fluxos de trabalho, primeiro precisa aprender a entender essas vozes. E a primeira habilidade necessária para isso é a ASR (Reconhecimento Automático de Voz). Para medir o nível de ASR, o mais comum é usar o Hugging Face Open ASR Leaderboard, cujo indicador principal é a taxa de erros de palavra (WER – Word Error Rate); quanto menor o número, mais precisa é o reconhecimento.

Há muito tempo, essa lista tem sido dominada por grandes empresas e laboratórios de ponta. Os dados de treinamento, a capacidade de processamento e a experiência em engenharia representam barreiras significativas, o que faz com que poucas equipes pequenas ousem competir diretamente nesse campo. Recentemente, uma startup chamada Hojo divulgou os resultados de seus testes de reconhecimento de voz, mostrando sinais de que podem se tornar uma “surpresa” no mercado. De acordo com os dados oficiais, o Hojo-ASR-V1 alcançou bons resultados em vários conjuntos de dados públicos de reconhecimento de voz em inglês.

No texto fornecido, há informações sobre um modelo de reconhecimento de fala (ASR - Automatic Speech Recognition) chamado Hojo-ASR-V1, que se destacou em testes de benchmark públicos. Os principais pontos destacados são: 1. A taxa de erros de palavras (WER - Word Error Rate) no LibriSpeech Clean foi de apenas 1,74%, e em conjuntos de dados mais próximos de cenários reais, como GigaSpeech e VoxPopuli, a taxa de erro também foi reduzida para menos de 8%. 2. Embora o modelo não tenha sido oficialmente listado em tabelas de classificação, seu desempenho seria muito bom se comparado no Open ASR Leaderboard. 3. O modelo é open-source e está disponível para download no GitHub e na plataforma Hugging Face, sob a licença Apache-2.0, o que significa que há poucas restrições para seu reuso. 4. Foi decidido implementar o Hojo-ASR-V1 para experimentar pessoalmente e entender o nível desse modelo de fala desenvolvido por uma startup discreta. 5. Além disso, o texto menciona uma nova tendência no campo da IA de voz (Voice AI) que está ganhando popularidade rapidamente. A seguir, são fornecidos links para o código do Hojo-ASR-V1 no GitHub e na Hugging Face: - Link da Hugging Face: [https://huggingface.co/HojoAI/Hojo-ASR-V1[1]] - Link do GitHub: [https://github.com/HojoAI/Hojo-ASR[2]] É importante ressaltar que, após analisar o código e a configuração do Hojo-ASR-V1, foi observado que sua estrutura é diferente dos modelos de reconhecimento de fala tradicionais.

O áudio é primeiro processado pelo extractor de características do Whisper, transformando-o em características acústicas utilizáveis pelo modelo, e em seguida é inserido no codificador de áudio do Qwen3-Omni. Durante esse processo, uma estrutura chamada Conformer é utilizada para adaptação e compressão do áudio.

Finalmente, o resultado é entregue a um modelo de linguagem Qwen3-4B, que é responsável por gerar o texto final. Em outras palavras: O Hojo-ASR-V1 é uma combinação de “codificador + adaptador + modelo de linguagem de grande porte”. A ideia de usar modelos de linguagem de grande porte para a decodificação do ASR não é exclusiva da empresa Hojo. Este é exatamente o caminho principal no topo da lista OpenASR atualmente. Vários dos modelos que estão no topo da lista, como o Canary-Qwen-2.5B da NVIDIA, o Granite-Speech-3.3-8B da IBM e o Phi-4-Multimodal da Microsoft, integram a capacidade dos modelos de linguagem no reconhecimento de fala, reduzindo a média do WER (Word Error Rate) para uma faixa de 5,6% a 5,9%. A vantagem de incorporar modelos de linguagem é que o reconhecimento não se limita a “ouvir sons e escrever palavras”; o modelo também pode usar o significado para fazer julgamentos. Em situações com ruído, expressões coloquiais, mistura de línguas (português e inglês) ou termos técnicos de um determinado campo, um modelo que entende o significado consegue entender melhor o que o falante quer dizer. A seguir, apresentamos os resultados de testes reais: implementamos o modelo localmente e executamos muitas rodadas de teste.

Caso de teste, dividido em duas partes: 【1】Capacidades de reconhecimento de fala (ASR) do modelo Hojo-ASR-V1. 【2】Hojo-TTS. Reconhecimento de Fala (ASR) O nome completo de ASR é Automatic Speech Recognition, que significa reconhecimento automático de fala. Ele é responsável por converter voz em texto e é o primeiro passo em toda a cadeia de inteligência artificial de voz. Seja no teclado de voz do celular, em transcrições de reuniões, em legendas em tempo real ou nos cada vez mais populares agentes de inteligência artificial, o ASR é essencial. Antes, eu usava ferramentas de entrada de voz de inteligência artificial como Wispr Flow e Typeless. Esses produtos oferecem uma boa experiência, mas ocasionalmente há atrasos quando a conexão de internet não é estável, e ainda há espaço para melhorias no reconhecimento de textos em chinês. Mais tarde, comecei a me voltar para soluções de implantação local, sendo o Whisper, de código aberto da OpenAI, o mais utilizado. Após o lançamento do Hojo-ASR-V1, para testá-lo de perto, substituí o Whisper pelo Hojo-ASR-V1. No geral, a velocidade e a precisão do reconhecimento são boas, o que é suficiente para uma utilização diária de entrada de voz. Claro, isso requer certos recursos de hardware local e exige uma quantidade razoável de memória. O conjunto completo de soluções não é complexo; essencialmente, o Hojo-ASR-V1 é usado como o motor de reconhecimento de base, e a entrada de voz é controlada através de permissões de nível de sistema. Após a configuração, ele pode funcionar em praticamente todos os cenários de entrada de texto, como navegadores, ChatGPT, Claude, Notion, etc. Durante o teste, eu narrei diretamente uma descrição sobre um “cruzamento”, incluindo a localização dos elementos, a direção do conteúdo e a origem do nome. Todo o processo foi feito sem organizar o texto previamente, e eu também não diminuí a velocidade da fala de propósito. O que eu acho interessante é que esse tipo de fluxo de trabalho pode ser ainda mais expandido. Após o reconhecimento, é possível conectar modelos como DeepSeek, GPT ou outros para aprimorar o texto, organizar a formatação, corrigir erros de digitação e otimizar a estrutura.

O processo geral é mais ou menos o seguinte: Entrada de voz → Transcrição por ASR (Automatic Speech Recognition) → Otimização pelo grande modelo → Entrada direta no fluxo de trabalho. Para pessoas que escrevem com frequência, participam de reuniões ou colaboram com agentes, essa experiência é mais confortável do que os métodos de entrada tradicionais. Além do Hojo-ASR-V1, também notamos que a Hojo está investindo no campo do TTS (Text-to-Speech). Desta vez, experimentamos seu modelo de síntese de voz TTS e, além disso, a equipe lançou uma versão mais leve, chamada Hojo-TTS-Light. Juntos, esses componentes compõem a solução da Hojo para fluxos de trabalho com agentes. Outra peça do quebra-cabeça da Voice AI é o TTS. O caminho para experimentar as capacidades do modelo TTS é através do seu site oficial: hojoai.com. **Síntese de Voz Multilíngue – Feminina Descontraída** Primeiro testamos a função de síntese de voz multilíngue, que é uma das mais comuns nos modelos TTS. Com a Copa do Mundo prestes a começar, pedimos que o modelo utilizasse uma voz feminina mais leve para ler um trecho de narração sobre os jogadores da seleção japonesa: O trecho de cerca de 30 segundos em chinês soou bastante fluente; a pronúncia e alguns detalhes foram bem tratados, e a presença da AI não era muito notável. O tom da voz feminina e o tom descontraído eram facilmente reconhecíveis. Geralmente, julgamos se uma voz soa artificial pela pronúncia e pelo tom ao final de cada palavra, e neste caso, o resultado estava alinhado com o estilo definido inicialmente. O Hojo suporta vários idiomas, incluindo japonês, francês e cantonês. O mesmo trecho de narração, lido em japonês, também teve um bom resultado, soando bastante parecido com as transmissões da NHK. **Síntese de Voz Multilíngue – Masculino Atraente e Sólido** O modelo TTS também permite mudar o tom de voz do personagem; a voz masculina soou satisfatória. O mesmo trecho sobre a Copa do Mundo de 2026, lido com um tom masculino atraente e sólido, correspondeu bem ao que foi definido no início. **Síntese de Voz Multilíngue – Livros Audio** O modelo TTS suporta uma variedade de tons de voz. Desta vez, pedimos que o modelo lesse um trecho em um tom de livro audio. O texto era uma introdução ao anime “Naruto”, e a leitura soou bastante natural. A pronúncia de palavras como “jovem” foi bem feita, garantindo uma transição suave entre as frases. Além disso, pausas em palavras comuns, como “com”, foram feitas de forma precisa, o que também contribuiu para a fluidez da leitura. **Síntese de Voz Multilíngue – Sussurro** Durante os testes, notamos um tom de voz especial, o sussurro. Neste trecho, usamos um tom de sussurro feminino para ler uma introdução ao filme “The Silent Lamb”. Foi possível entender claramente o que estava sendo dito, e o modelo também simulou com precisão o sopro suave da voz ao falar próximo ao ouvido, bem como os sons de respiração e tons leves. O sussurro gerado pelo modelo não é apenas uma simples redução no volume; o tom, o ritmo e a emoção também foram bem capturados. Esse tipo de tom é adequado para narrações de suspense, legendas de histórias ou conteúdo ASMR. Além dos tons padrão de transmissão, também testamos tons de voz mais característicos de personagens. **Kang Hui** Atualmente é a temporada do vestibular, e é comum ouvir mensagens de boas-vindas e notícias na televisão, rádio e vídeos curtos. A voz do apresentador da CCTV é bastante representativa em transmissões em chinês, com pronúncia padrão e articulação clara. Por isso, usamos um áudio de Kang Hui como referência; o trecho seguinte é o áudio original de Kang Hui. Cópia do timbre do arquivo - Kanghui Eu enviei este áudio original para o modelo TTS para que ele replicasse o timbre e lesse um texto de aproximadamente 40 segundos, desejando sucesso aos estudantes que estão prestes a fazer o vestibular.

Em termos de qualidade, o modelo TTS conseguiu preservar bem as características da voz original, especialmente o tom, as pausas e o ritmo de narração de Kang Hui. Assim que a primeira frase é pronunciada, é possível notar que soa muito parecido com Kang Hui em pessoa. Quando ele diz frases como “Não desperdiçar a juventude, correr em direção ao futuro”, é possível reconhecer o seu estilo familiar de narração de notícias e a sensação de apresentador de grandes eventos. **Nezha** A capacidade do modelo TTS de reproduzir com precisão a voz de personagens é bastante representativa. Eu usei o modelo para recriar a voz de Nezha do filme “Nezha: The Demonic Child’s Birth”. O resultado soa bastante próximo da personalidade desregrada e preguiçosa de Nezha, e as pausas também são muito parecidas com as originais. **Peppa Pig** O modelo TTS também conseguiu reproduzir com sucesso a voz de personagens de desenhos animados. As vozes de personagens de desenhos animados são diferentes das de pessoas reais ou de personagens de filmes, e isso exige um tratamento um pouco especial. A seguir, você pode ouvir uma versão de Peppa Pig sintetizada pelo modelo TTS: **MacArthur** Além disso, eu até gravei uma versão do comentário de “MacArthur” que está muito popular no TikTok e pedi que ele a lesse: “Crossroads” é uma mídia tecnológica autônoma chinesa que se concentra na onda de IA. Sua forma principal é um podcast, mas também inclui vídeos, versões em texto para o seu canal oficial no WeChat e eventos presenciais. “Crossroads” é uma metáfora usada por Steve Jobs para descrever a Apple como uma empresa que está no cruzamento entre tecnologia e humanidades; grandes produtos geralmente nascem nesse ponto. Nossa missão é acompanhar as mudanças e oportunidades que a IA traz para vários setores, encontrar, entrevistar e reunir “agentes ativos” da era da IA, e juntos explorar e abraçar novas possibilidades. **Quem é a equipe Hojo?** Voltando à equipe Hojo, ela não é apenas uma empresa que se dedica ao desenvolvimento de modelos de voz.

A Hojo foi fundada há cerca de dois anos, e antes dessa divulgação de informações, o conhecimento externo sobre ela era muito limitado. Por isso, entramos em contato com sua equipe para obter algumas informações de primeira mão. De acordo com a própria visão da Hojo, o que eles querem realmente é criar um Personal Agent OS (Sistema Operacional de Agentes Pessoais) voltado para profissionais do conhecimento. Em outras palavras, o objetivo é fazer com que os agentes se integrem de verdade aos fluxos de trabalho diários, como escritório, comunicação, criação e colaboração, sendo que o ASR (Reconhecimento de Voz em Texto) e o TTS (Síntese de Voz em Texto) são duas peças-chave desse sistema. Isso também é fundamental para entender a natureza da Hojo. O ASR é, na verdade, apenas a primeira camada para que o agente consiga entender as situações de trabalho reais. Só é possível entender, planejar e executar ações corretamente após receber de forma confiável as informações de reuniões, chamadas telefônicas, anotações de voz e discussões em grupo. Um ponto interessante sobre a equipe da Hojo é que seus membros principais têm longa experiência no trabalho com “cenários de voz reais”. Muitos deles vêm de equipes relacionadas a voz em veículos, cockpits inteligentes e interação vocal, incluindo empresas como Xpeng, NIO Nomi e SenseTime. Mais especificamente, o fundador, Zhao Hengyi, já trabalhou em empresas como LeEco, Xpeng, NIO e SenseTime com projetos relacionados a interação vocal, cockpits inteligentes, AgentOS, voz em veículos, cockpits inteligentes, interação multilíngue, aplicativos operados por inteligência artificial e serviços entre dispositivos. O Chief Product Officer (CPO), Li Ou, também teve experiência em empresas como SenseTime e NIO com o planejamento de AgentOS, cockpits inteligentes e produtos digitais, focando em como as capacidades de voz podem ser integradas em uma experiência de produto completa, e não apenas em modelos isolados. O COO, Sun Xiaogang, tem experiência em soluções de agentes, comercialização da interação vocal e implementação em diferentes setores, tendo participado de projetos de interação vocal em áreas como veículos, restaurantes e transporte. Considerando essas experiências coletivas, a equipe da Hojo tem uma base sólida para lidar com problemas de voz em cenários reais. Isso se deve principalmente ao fato de que esses membros da equipe se concentraram em ambientes reais, onde a qualidade do áudio é muito diferente daquela encontrada em laboratórios. Em veículos, há ruídos, dialetos, várias pessoas falando ao mesmo tempo, interrupções e muitas expressões não completas ou coloquiais.

Os usuários não falam de acordo com os prompts padrão, nem esperam que o sistema responda lentamente. Aqueles que já trabalharam com cenários semelhantes entendem melhor as verdadeiras dificuldades dos modelos de reconhecimento de voz (ASR – Automatic Speech Recognition): é necessário que o ASR compreenda de forma estável as intenções das pessoas em ambientes complexos. A experiência de Sudhan, o cientista-chefe da Hojo, também se encaixa nesse contexto. Ele participou do desenvolvimento de tecnologias de reconhecimento de voz na Baidu nos primeiros anos de sua carreira e testemunhou a comercialização do ASR graças ao aprendizado profundo. Mais tarde, na Tencent AI Lab, ele liderou o desenvolvimento de soluções de voz e acompanhou a fase em que os grandes modelos revolucionaram a interação vocal. O valor de seu currículo reside no fato de que ele vivenciou várias mudanças na tecnologia de voz: da competição por precisão de reconhecimento até a implementação em cenários reais e, depois, à reconstrução da interação vocal na era dos grandes modelos. Para uma empresa que deseja desenvolver um Personal Agent OS (sistema operacional de agentes pessoais), essa experiência é crucial, pois mostra que não se trata apenas de considerar a voz como um componente de entrada, mas sim de integrá-la de forma significativa em um fluxo de trabalho real. Do ponto de vista do capital, a Hojo já levantou quase 100 milhões de yuan em quatro rodadas de financiamento antes mesmo do lançamento oficial do produto e atualmente está em uma rodada pré-A. Essas informações não garantem o sucesso do produto, mas indicam que o mercado já está prestando atenção à acumulação de tecnologia da empresa em áreas como Voice AI e Agent OS. Em termos de comercialização, segundo a Hojo, sua combinação de “grandes modelos + Agentic OS” fornece capacidades de voz para milhões de dispositivos inteligentes. Se esse número for verdadeiro, significa que a tecnologia não se limita a artigos acadêmicos, demonstrações ou listas de melhores práticas, mas já está sendo utilizada em dispositivos reais e em cenários de uso real. De acordo com os planos da própria Hojo, o ASR é apenas o primeiro passo. Eles também estão trabalhando no TTS (Text-to-Speech) e planejam lançar um modelo de voz full-duplex no final de junho. O objetivo final é construir uma plataforma de interação vocal completa em torno do Personal Agent OS, permitindo que o agente ouça, entenda e responda, integrando-se assim no fluxo de trabalho dos profissionais. Se esses planos serão concretizados ainda precisa ser verificado pelos produtos futuros. No entanto, com base no desempenho do Hojo-ASR-V1, já é possível observar que a empresa está alcançando resultados significativos no primeiro estágio do fluxo de trabalho de Voice AI. Então, por que esses dados divulgados pelo Hojo-ASR chamaram a atenção? Ou, em outras palavras, em que contexto o Hojo-ASR se encontra? A Voice AI representa uma outra linha de desenvolvimento, além dos grandes modelos universais. À medida que os agentes começam a ser integrados em fluxos de trabalho reais, o contexto que eles precisam processar se torna cada vez mais complexo: discussões em reuniões, solicitações por telefone, sons no ambiente, frases adicionais ditas pelos usuários em tempo real e instruções que mudam constantemente durante a colaboração entre várias pessoas. No passado, essa informação era principalmente fornecida por meio da digitação, mas em muitos contextos de trabalho, as informações reais são transmitidas verbalmente, não por escrito.

É também por isso que as grandes empresas têm aumentado seus investimentos em IA de Voz nos últimos dois anos. A OpenAI lançou o Realtime API, o Google desenvolveu o Gemini Live, e empresas chinesas como iFlytek, DouBao, MiniMax e JieYue também estão investindo no campo da voz. O entusiasmo por este setor nos últimos dois anos pode ser medido pelo volume de capital investido. De acordo com as estatísticas da AssemblyAI, as empresas de IA de voz receberam cerca de 2,1 bilhões de dólares em investimentos de risco em 2025; de junho de 2025 a maio de 2026, houve 36 financiamentos divulgados no setor de IA de diálogo, totalizando aproximadamente 2,58 bilhões de dólares. Em uma palavra, é um mercado muito aquecido. Quanto às empresas específicas, a ElevenLabs, que se dedica à síntese de voz, recebeu 500 milhões de dólares no seu quarto round de financiamento, com uma avaliação de 11 bilhões de dólares; a PolyAI, que trabalha com atendimento ao cliente por telefone, levantou 86 milhões de dólares no mesmo round; a Retell AI, que lida com chamadas em tempo real, processa mais de 40 milhões de chamadas por mês, com um crescimento trimestral de mais de 300%. Há também equipes como a Cartesia, que se dedicam a reduzir o atraso na transmissão de voz para menos de 100 milissegundos, tornando as conversas mais fluídas. As grandes empresas também estão muito ativas nesse campo. A OpenAI lançou o Realtime API, oferecendo uma solução completa para a voz, que processa o áudio do início ao fim sem dividir o processo em "conversão em texto, aplicação do modelo e síntese". O Google's Gemini Live segue essa mesma lógica, permitindo que a resposta seja dada mesmo quando a conversa é interrompida. Nos últimos dias, foi lançado também o Voice AI compatível com o Gamma4: Pode-se ver que a voz está se tornando uma forma de interação "mais natural", uma entrada para que os agentes (Agentes) obtenham contexto. Esse tendência fica ainda mais evidente no popular Vibe Working. Não é necessário organizar cada requisito em um prompt completo; é possível pensar, falar e ajustar ao mesmo tempo, permitindo que o agente capture a intenção, complete o contexto e avance na tarefa durante a conversa, o que torna a interação mais natural. Neste processo, o ASR (Automatic Speech Recognition) é a primeira camada de capacidade. Ele determina se o agente consegue entender o mundo real. Se a compreensão do áudio for imprecisa, toda a sequência de entendimento, planejamento e execução será distorcida; se for precisa, a voz poderá realmente se tornar parte do fluxo de trabalho. Em resumo: À medida que os agentes começam a fazer parte do dia a dia das pessoas, a voz, ou seja, a IA de Voz, provavelmente será a primeira forma de interação com eles. Existem muitas maneiras de conectar pessoas à IA, como digitar, usar interfaces ou escrever código para chamar APIs, mas a forma mais próxima de uma conversa cotidiana entre humanos ainda é falar. É por isso que cada vez mais pessoas chamam a voz de "context entry" dos agentes, ou seja, a entrada para o contexto. Se os grandes modelos são responsáveis por entender o mundo, então a voz é o canal pelo qual informações do mundo real fluem continuamente para o modelo. E nesse canal, o ASR desempenha um papel crucial na percepção: ele determina se o agente consegue capturar corretamente as informações do ambiente externo e transformar os sons do mundo real em contexto que o modelo possa entender e utilizar. Desse ponto de vista, a competição no campo do ASR aumentou de nível: A luta pelo acesso da próxima geração de agentes ao mundo real está em andamento. Esta é também a razão pela qual os dados divulgados pelo Hojo-ASR-V1 são ainda mais dignos de atenção. O que está por trás disso não é apenas uma mudança no desempenho de um modelo.

Voice AI está passando de uma capacidade auxiliar para uma infraestrutura essencial, tornando-se uma base cada vez mais importante na era dos Agentes. 🚥 Voltando ao assunto do Voice AI, enquanto a maioria das empresas está focada em modelos gerais de grande escala, o campo da reconhecimento de voz, que pode parecer menos promissor, está na verdade evoluindo rapidamente. Mesmo em áreas como o ASR (Automatic Speech Recognition), que por muito tempo foi dominado por grandes empresas como OpenAI, Microsoft, NVIDIA e IBM, startups estão começando a apresentar resultados competitivos. O surgimento do Hojo-ASR-V1 pode não significar que o cenário tenha mudado completamente, mas ao menos indica que o Voice AI está ganhando mais importância e atraiendo a atenção de mais pessoas. O reconhecimento de voz é apenas o primeiro passo no desenvolvimento do Voice AI. O verdadeiro desafio é saber se as máquinas conseguem entender o que é dito e responder de uma maneira semelhante à humana – isso representa uma jornada mais longa, mais valiosa e com maior potencial. Referências: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR O artigo foi publicado no WeChat oficial “Crossing”, escrito pelo autor “Crossing”.

Isso foi útil?

Suporte técnicoAtendimento online
侧栏
Voltar ao topo
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR