急成長しているVoice AIの分野に、スタートアップ企業Hojoが登場しました。
Voice AIは、汎用大モデルとは別の物語の流れです。 皆が汎用大モデルに注目している中で、比較的静かなVoice AIの分野でも、注目に値する新しいモデルが登場し始めています。 キーボードはその「支配的地位」を失いつつあります。 過去2年間で、OpenAIはRealtime APIを発表し、GoogleはGemini Liveをリリースしました。国内の大規模モデル企業もほとんどがVoice AIに注力し始めています。ますます多くの人々が、エージェントが実際にワークフローに組み込まれるようになると、音声がキーボードよりも自然なコンテキストの入り口になると信じるようになりました。 エージェントが本当にワークフローに組み込まれるためには、まずこれらの音声を理解することを学ばなければなりません。そして、そのための最初の能力がASR(自動音声認識)です。 ASRのレベルを測るために、業界ではHugging FaceのOpen ASR Leaderboardがよく引用されます。重要な指標はWER(単語誤り率)で、数値が低いほど認識精度が高いことを意味します。