เมนู

ในสนามแข่งขัน Voice AI ที่กำลังร้อนแรงขึ้นเรื่อยๆ มีสตาร์ทอัพชื่อ Hojo ปรากฏตัวขึ้น

Voice AI เป็นอีกหนึ่งเรื่องราวนอกเหนือจากรุ่นใหญ่ของ ในขณะที่ทุกคนกําลังจ้องมองรุ่นใหญ่ของ Voice AI รุ่นใหม่ที่น่าสังเกตเริ่มปรากฏขึ้นในสนามที่ค่อนข้างเงียบสงบ แป้นพิมพ์กําลังสูญเสียการปกครองของมัน ในช่วงสองปีที่ผ่านมา OpenAI เปิดตัว API แบบ Realtime Google ทํา Gemini Live และ บริษัท โมเดลใหญ่ ๆ ในประเทศเกือบจะเริ่มวางรูปแบบ Voice AIมีความเชื่อมากขึ้นว่าเมื่อตัวแทนเข้ามาในเวิร์กโฟลว์เสียงจะกลายเป็นทางเข้าบริบทที่เป็นธรรมชาติมากกว่าแป้นพิมพ์ ถ้าตัวแทนต้องการเข้าสู่กระแสงานจริงๆ มันต้องเรียนรู้ที่จะเข้าใจเสียงเหล่านี้ก่อนและความสามารถชั้นแรกที่อยู่เบื้องหลังนี้คือ ASR (การจดจําเสียงอัตโนมัติ) สําหรับการวัดระดับ ASR ที่อุตสาหกรรมนิยมอ้างถึงมากที่สุดคือ Open ASR Leaderboard ของ Hugging Face ตัวชี้วัดหลักคืออัตราข้อผิดพลาดของคํา (WER) ยิ่งตัวเลขต่ําเท่าไหร่การระบุก็ยิ่งถูกต้องมากขึ้นเท่านั้น

เป็นเวลานานรายการนี้เป็นพื้นบ้านของโรงงานขนาดใหญ่และห้องปฏิบัติการดาว ข้อมูลการฝึกอบรมพลังคํานวณการสะสมวิศวกรรมแต่ละรายการมีเกณฑ์ที่ค่อนข้างใหญ่มีทีมเล็กน้อยกล้าที่จะแข่งขันในเชิงบวกในมิตินี้ เมื่อเร็วๆนี้ทีมสตาร์ทอัพชื่อ Hojo ได้เปิดเผยผลการทดสอบการจดจําเสียงชุดต่อสาธารณชนซึ่งดูเหมือนจะมีแนวโน้มที่จะกลายเป็น "ม้ามืด" จากข้อมูลอย่างเป็นทางการ Hojo-ASR-V1 ได้ทําคะแนนที่ดีในชุดข้อมูลการจดจําเสียงภาษาอังกฤษสาธารณะหลายชุด

ในบรรดานั้น LibriSpeech Clean มีอัตราความผิดพลาดในการจดจำคำ (Word Error Rate หรือ WER) เพียง 1.74% เท่านั้น และในชุดข้อมูลอื่นๆ ที่ใกล้เคียงกับสถานการณ์จริงมากขึ้น เช่น GigaSpeech และ VoxPopuli ก็สามารถลดอัตราความผิดพลาดนี้ลงได้ให้อยู่ในระดับต่ำกว่า 8% พวกเขาไม่ได้ส่งชื่อเข้าร่วมการแข่งขัน แต่ถ้านำข้อมูลเหล่านั้นไปเปรียบเทียบใน Open ASR Leaderboard ก็จะเป็นข้อมูลที่อยู่ในอันดับต้นๆ อย่างแน่นอน โดยรวมแล้ว นี่เป็นโมเดล ASR ที่แสดงให้เห็นถึงความสามารถในการแข่งขันได้ในการทดสอบมาตรฐานสาธารณะ และยังเปิดแหล่งโค้ดให้ดูบน GitHub และ Hugging Face ภายใต้ใบอนุญาต Apache-2.0 ซึ่งไม่มีข้อจำกัดมากนักสำหรับการนำไปใช้ซ้ำ 🚥 ดังนั้น เราจึงได้นำ Hojo-ASR-V1 ไปใช้งานจริงเพื่อดูว่าโมเดลเสียงที่ทีมสตาร์ทอัพที่ไม่ค่อยมีใครรู้จักนี้สร้างขึ้นมาได้ดีแค่ไหน และยังได้พูดคุยเกี่ยวกับเรื่องราวใหม่ๆ ที่กำลังเติบโตอย่างรวดเร็วในยุคของ Agent นั่นคือ Voice AI เราได้ทดสอบ Hojo-ASR ดูแล้ว ก่อนอื่น เราต้องบอกว่า Hojo-ASR-V1 ได้ถูกเปิดแหล่งโค้ดให้ดูบน Hugging Face และ GitHub: ลิงก์ Hugging Face: https://huggingface.co/HojoAI/Hojo-ASR-V1[1] ลิงก์ GitHub: https://github.com/HojoAI/Hojo-ASR[2] มาเริ่มต้นด้วยการอธิบายว่า Hojo-ASR-V1 เป็นโมเดลแบบไหนกันดี หลังจากที่เราได้ดูโค้ดและการตั้งค่าของมันแล้ว เราพบว่าโครงสร้างของมันแตกต่างจากโมเดลการรู้จำเสียงแบบดั้งเดิม

เสียงจะถูกประมวลผลด้วยตัวดึงคุณสมบัติ (feature extractor) ของ Whisper ก่อน จากนั้นจะถูกแปลงเป็นคุณสมบัติทางเสียง (acoustic features) ที่ระบบสามารถใช้งานได้ หลังจากนั้นจึงจะถูกส่งเข้าไปยังตัวเข้ารหัสเสียง (audio encoder) ที่ Qwen3-Omni โดยมีโครงสร้าง Conformer อยู่ตรงกลางเพื่อทำการปรับแต่งและบีบอัดข้อมูลเสียง;

ในที่สุดก็ถูกมอบให้เป็นแบบจําลองภาษา Qwen3-4B ซึ่งจะเขียนข้อความสุดท้าย ในคําอื่น ๆ: Hojo-ASR-V1 คือการรวมกันของ "ตัวเข้ารหัส + อะแดปเตอร์ + โมเดลภาษาขนาดใหญ่" แนวคิดในการถอดรหัส ASR โดยใช้แบบจําลองภาษาขนาดใหญ่ไม่ได้เป็นเอกลักษณ์ของ Hojoนี่คือทิศทางหลักที่อยู่ด้านบนของรายการ OpenASR ในขณะนี้หลายรุ่นที่ได้รับการจัดอันดับสูงสุดในรายการเช่น Canary-Qwen-2.5B ของ , Granite-Speech-3.3-8B ของ IBM และ Phi-4-Multimodal ของ ไมโครซอฟท์รวมความสามารถของรูปแบบภาษาเข้ากับการจดจําเสียงโดยลด WER เฉลี่ยลงเหลือช่วง 5.6% ถึง 5.9% ข้อดีของการใส่แบบจําลองภาษาคือการจดจําไม่เพียง แต่ "สิ่งที่ได้ยินและเขียน" แต่ยังสามารถตัดสินได้โดยใช้ความหมายเมื่อเผชิญกับเสียงรบกวนการแสดงออกทางปากการพูดภาษาจีนและภาษาอังกฤษผสมหรือคําเฉพาะทางในสาขาใดสาขาหนึ่งรูปแบบที่เข้าใจความหมายจะช่วยให้ง่ายต่อการตัดสินว่าผู้พูดต้องการแสดงอะไร นี่คือส่วนที่ได้รับการทดสอบ เราปรับใช้แบบจําลองในท้องถิ่นและวิ่งไปและกลับหลายรอบ

กรณีทดสอบจริง แบ่งออกเป็นสองส่วน: 【1】ความสามารถในการรู้จำเสียง (ASR) ของโมเดล Hojo-ASR-V1 【2】Hojo-TTS ASR (Automatic Speech Recognition) คือระบบที่สามารถแปลงเสียงให้กลายเป็นข้อความโดยอัตโนมัติ ระบบนี้ทำหน้าที่เป็นขั้นตอนแรกในกระบวนการ AI ด้านเสียง ไม่ว่าจะเป็นแป้นพิมพ์ด้วยเสียงบนโทรศัพท์มือถือ บันทึกการประชุม คำบรรยายแบบเรียลไทม์ หรือ AI Agent ที่กำลังได้รับความนิยมในปัจจุบัน ล้วนต้องอาศัย ASR เป็นพื้นฐาน ก่อนหน้านี้ฉันใช้เครื่องมือรับข้อความด้วยเสียงจาก AI เช่น Wispr Flow และ Typeless ผลิตภัณฑ์เหล่านี้ให้ประสบการณ์ที่ดี แต่อาจมีความล่าช้าเมื่อสภาพเครือข่ายไม่คงที่ และยังมีโอกาสในการปรับปรุงการรองรับภาษาจีนให้ดีขึ้น ต่อมาฉันเริ่มหันมาใช้วิธีการติดตั้งซอฟต์แวร์ในเครื่อง (on-premise) โดยใช้ Whisper ซึ่งเป็นซอฟต์แวร์โอเพนซอร์สจาก OpenAI มากที่สุด หลังจากที่ Hojo-ASR-V1 ถูกเปิดตัว ฉันจึงเปลี่ยนจาก Whisper เดิมมาใช้ Hojo-ASR-V1 เพื่อทดสอบการใช้งานจริง โดยรวมแล้ว ความเร็วในการรู้จำเสียงและความแม่นยำนั้นดีมาก สำหรับการใช้งานประจำวันในการพิมพ์ด้วยเสียงถือว่าเพียงพอแล้ว แต่ต้องใช้ทรัพยากรฮาร์ดแวร์ในเครื่องบ้าง และมีข้อกำหนดเกี่ยวกับหน่วยความจำ โดยรวมแล้ว วิธีการนี้ไม่ซับซ้อน โดยใช้ Hojo-ASR-V1 เป็นเครื่องมือรู้จำเสียงพื้นฐาน และใช้สิทธิ์ระดับระบบเพื่อควบคุมการรับข้อความด้วยเสียง หลังจากการตั้งค่าเสร็จสิ้น มันสามารถทำงานได้ในทุกสภาพแวดล้อมการพิมพ์ข้อความ เช่น เบราว์เซอร์, ChatGPT, Claude, Notion และอื่นๆ ในระหว่างการทดสอบ ฉันพูดคุยเกี่ยวกับ “สี่แยก” โดยรวมถึงตำแหน่งของแต่ละส่วน ทิศทางของเนื้อหา และที่มาของชื่อ โดยไม่ได้เตรียมข้อความล่วงหน้า และไม่ได้พยายามพูดช้าลง สิ่งที่ฉันคิดว่าน่าสนใจคือ วิธีการนี้สามารถขยายได้อีก หลังจากการรู้จำเสียงเสร็จสิ้น สามารถเชื่อมต่อกับ DeepSeek, GPT หรือโมเดลอื่นๆ เพื่อปรับปรุงข้อความ จัดรูปแบบ แก้ไขคำผิด และปรับโครงสร้างให้ดีขึ้น

กระบวนการโดยรวมมีลักษณะเช่นนี้: อินพุตเสียง → การถ่ายทอด ASR → การเพิ่มประสิทธิภาพแบบจําลองขนาดใหญ่ → ไปยังเวิร์กโฟลว์โดยตรงประสบการณ์นี้สะดวกสบายกว่าวิธีการป้อนข้อมูลแบบดั้งเดิมสําหรับผู้ที่เขียนประชุมหรือทํางานร่วมกับตัวแทนเป็นประจํานอกเหนือจาก Hojo-ASR-V1 แล้วเรายังสังเกตเห็นว่า Hojo มีการลงทุนในทิศทางของ TTS เช่นกันเราได้สัมผัสกับรุ่นการสังเคราะห์เสียง TTS ในครั้งนี้ นอกจากนี้ทีมงานยังเปิดซอร์สเวอร์ชันที่มีน้ําหนักเบากว่า Hojo-TTS-Lightเหล่านี้รวมกันเป็นคําตอบของ Hojo สําหรับเวิร์กโฟลว์ตัวแทนอีกชิ้นหนึ่งของปริศนาสําหรับ Voice AI: TTS เส้นทางที่เราจะได้สัมผัสกับความสามารถของ TTS คือเว็บไซต์อย่างเป็นทางการ: โฮโจอายคอมพิวเตอร์ การสังเคราะห์เสียงหลายภาษา - ผู้หญิงที่สดใส การทดสอบครั้งแรกคือการสังเคราะห์เสียงหลายภาษาซึ่งเป็นฟังก์ชั่นที่ใช้กันทั่วไปของแบบจําลอง TTSเมื่อเร็วๆนี้เมื่อฟุตบอลโลกกําลังจะเริ่มขึ้นฉันขอให้เขาอ่านคําอธิบายเกี่ยวกับผู้เล่นของญี่ปุ่นในฟุตบอลโลกด้วยเสียงหญิงที่เบา ๆ: ภาษาจีนประมาณ 30 วินาทีนี้ฟังดูค่อนข้างราบรื่นคํากัดและรายละเอียดบางส่วนได้รับการจัดการที่ดีความรู้สึกของ AI ไม่ชัดเจนเสียงของผู้หญิงเสียงเบา ๆ สามารถได้ยินได้ในความเป็นจริงเรามักจะตัดสินเสียงไม่เป็นธรรมชาติโดยทั่วไปฟังคํากัดของมันและเสียงในตอนท้ายของแต่ละคํานี้พื้นฐานและรูปแบบที่ตั้งไว้ในตอนแรกสามารถจัดตําแหน่งได้การทดสอบพบว่า Hojo สนับสนุนภาษาหลายภาษา ญี่ปุ่น ฝรั่งเศส กวางตุ้งด้านล่างนี้ยังคงเป็นบทแนะนําของทีมญี่ปุ่นเดียวกัน เปลี่ยนเป็นภาษาญี่ปุ่นเพื่ออ่านผลก็โอเค ฟังดูเหมือนการออกอากาศของ NHK ค่อนข้างมีความรู้สึกของภาพ: การสังเคราะห์เสียงหลายภาษา - แม่เหล็กที่มั่นคงชาย รุ่น TTS นี้ยังสามารถเปลี่ยนเสียงของตัวละครที่แตกต่างกันเสียงชายฟังก็โอเคย่อหน้าต่อไปนี้ยังคงแนะนําการเขียนฟุตบอลโลก 2026 ฉันตั้งค่าสีเสียงเป็นแม่เหล็กเสียงชายที่มั่นคงย่อหน้านี้ฟังดูตรงกับคําแนะนําของฉันโดยทั่วไปการสังเคราะห์เสียง - หนังสือเสียง รุ่น TTS สามารถใช้สีเสียงได้มากกว่าคราวนี้ฉันขอให้มันอ่านในเสียงหนังสือข้อความนี้เป็นบทแนะนําของนารูโตะที่สังเคราะห์ด้วยเสียงชายของหนังสือเสียงมันฟังดูเป็นธรรมชาติเมื่อคุณอ่านคําว่า "วัยรุ่น" เสียงปลายจะถูกประมวลผลเพื่อให้การเชื่อมต่อเป็นเรื่องที่ราบรื่นนอกจากนี้ยังมีคําเชื่อมโยงเช่น "และ" ซึ่งเราใช้ในการพูดคุยโดยปกติซึ่งหยุดชั่วคราวได้อย่างถูกต้องซึ่งเป็นเหตุผลหนึ่งที่ฟังได้อย่างราบรื่นการสังเคราะห์เสียงแบบมัลติโทน - กระซิบ - เมื่อทดสอบยังมีสีเสียงที่ฉันต้องการพูดแยกต่างหากคือกระซิบต่อไปนี้ผมใช้เสียงกระซิบของผู้หญิงอ่านบทแนะนําของภาพยนตร์เรื่อง : คุณสามารถได้ยินสิ่งที่กําลังพูดได้อย่างชัดเจน แต่ยังจําลองการไหลของอากาศที่เบา ๆ การหายใจที่ละเอียดอ่อนและเสียงเบา ๆ ในขณะที่ผู้คนพูดที่หูของพวกเขาการกระซิบของ TTS ไม่ได้เป็นเพียงการลดระดับเสียง แต่ยังเป็นเสียงจังหวะและอารมณ์ที่ดีสีเสียงนี้เหมาะสําหรับการบรรยายเรื่องราวการบรรยาย ASMRนอกเหนือจากโทนสีมาตรฐานแล้วฉันยังทดสอบโทนสีตัวละครที่จดจําได้มากขึ้นคัง ฮุย เมื่อเร็วๆนี้เป็นฤดูกาลสอบเข้าวิทยาลัยโทรทัศน์วิทยุและวิดีโอสั้น ๆ คุณสามารถได้ยินคําอวยพรและข่าวจํานวนมากเสียงของสมอกล้องวงจรปิดในการออกอากาศภาษาจีนถือว่าเป็นตัวแทนค่อนข้างมาตรฐานการออกเสียงคายคําชัดเจนดังนั้นคราวนี้ผมจึงเลือกเสียงของ เพื่ออ้างอิง ส่วนต่อไปนี้คือเสียงต้นฉบับของ การคัดลอกเสียงของไฟล์ - Kanghui ฉันส่งไฟล์เสียงต้นฉบับนี้ไปยังโมเดล TTS เพื่อให้มันคัดลอกเสียงตามที่มีอยู่ในไฟล์ และอ่านข้อความที่มีความยาวประมาณ 40 วินาที ซึ่งเป็นข้อความที่อวยพรให้นักเรียนที่สอบเข้ามหาวิทยาลัยประสบความสำเร็จ

ในแง่ของผลแบบจําลอง TTS ยังคงรักษาลักษณะของเส้นเสียงเดิมไว้ได้ดีโดยเฉพาะอย่างยิ่งโทนเสียงการหยุดชั่วคราวและจังหวะการออกอากาศของทันทีที่ประโยคแรกออกมาคุณสามารถได้ยินว่ามันคล้ายกับตัวเองมากเมื่อคุณอ่านคําพูดเช่น "ความเป็นเยาวชนและมุ่งหน้าไปสู่อนาคต" คุณสามารถได้ยินเสียงข่าวที่คุ้นเคยและความรู้สึกของการเป็นเจ้าภาพกิจกรรมขนาดใหญ่ นีจา การทําซ้ําสีเสียงถือว่าเป็นความสามารถที่เป็นตัวแทนของแบบจําลอง TTSฉันใช้มันเพื่อทําซ้ําเสียงของตัวละคร IP หลายตัวแรกคือ ใน ฟังค่อนข้างใกล้เคียงกับความรู้สึกที่ไม่ยับยั้งชั่งใจการหยุดชะงักก็เกือบจะเป็นสถานะนี้ หมูเปจ เสียงของตัวละครการ์ตูนแบบจําลอง TTS ยังไม่เป็นไรเสียงของตัวละครการ์ตูนไม่เหมือนกับตัวละครจริงและภาพยนตร์มากนักและการจัดการก็แตกต่างกันเล็กน้อย ต่อไปนี้คือหน้าหมูตัวเล็ก ๆ ที่ฉันสังเคราะห์ด้วยแบบจําลอง TTS: แมคอาร์เธอร์ แม้กระทั่งการสั่นสะเทือนฉันได้บันทึกเสียงที่ร้อนแรงของ "แมคอาร์เธอร์" และให้เขาอ่านอีกครั้ง: "สี่แยก" เป็นสื่อทางเทคโนโลยีที่มุ่งเน้นไปที่คลื่น AI ในประเทศจีน รูปแบบหลักคือพอดคาสต์ ขยายวิดีโอเวอร์ชันข้อความของบัญชีสาธารณะและกิจกรรมชุมชนออฟไลน์"สี่แยก" เป็นคําอุปมาของจ๊อบส์เกี่ยวกับแอปเปิ้ลซึ่งยืนอยู่ที่สี่แยกของเทคโนโลยีและมนุษยศาสตร์ซึ่งผลิตภัณฑ์ที่ยอดเยี่ยมมักจะเกิดขึ้นติดตามการเปลี่ยนแปลงและโอกาสที่ AI นํามาสู่อุตสาหกรรมต่างๆ ค้นหา สัมภาษณ์ และรวบรวม "นักแสดงในเชิงบวก" ในยุค AI เพื่อสํารวจและโอบกอดความเป็นไปได้ใหม่ ๆ กับพวกเขา ทีมนี้คือใคร? กลับไปที่ทีมงาน Hojo เอง ไม่ใช่ บริษัท ที่ทําเพียงแบบจําลองเสียงขนาดใหญ่เท่านั้น

Hojo ก่อตั้งขึ้นประมาณสองปีและมีเพียงเล็กน้อยที่รู้จักกันก่อนที่จะมีการเปิดเผยข้อมูลครั้งนี้เพราะเราติดต่อทีมงานและได้รับข้อมูลโดยตรง ตามตําแหน่งของ Hojo มันต้องการที่จะทําเป็นระบบปฏิบัติการตัวแทนส่วนบุคคลสําหรับคนงานความรู้พูดง่ายๆก็คือการให้ตัวแทนเข้าสู่เวิร์กโฟลว์ประจําวันอย่างแท้จริงในการทํางานการสื่อสารการสร้างสรรค์และการทํางานร่วมกัน ASR และ TTS เป็นสองชิ้นปริศนาที่สําคัญในระบบนี้ และนี่คือกุญแจสําคัญในการทําความเข้าใจของ Hojo ASR เป็นเพียงพื้นฐานชั้นแรกสําหรับตัวแทนที่จะเข้าใจสถานการณ์การทํางานที่แท้จริงความเข้าใจการวางแผนและการดําเนินการในภายหลังจะเป็นไปได้เฉพาะเมื่อข้อมูลจากการประชุมการโทรศัพท์บันทึกเสียงและการอภิปรายหลายคนได้รับการยอมรับอย่างมั่นคง จากภูมิหลังของทีมสิ่งที่พิเศษของ Hojo คือสมาชิกหลักได้จัดการกับ "ฉากเสียงจริง" มาเป็นเวลานานสมาชิกในทีมส่วนใหญ่มาจากเสียงในรถยนต์ห้องนักบินอัจฉริยะและทีมงานที่เกี่ยวข้องกับการโต้ตอบด้วยเสียงรวมถึง เสี่ยวเป็ง, Nomi, ฯลฯ โดยเฉพาะอย่างยิ่ง ผู้ก่อตั้ง เคยรับผิดชอบการโต้ตอบด้วยเสียงห้องนักบินอัจฉริยะและงานที่เกี่ยวข้องกับ Agent OS ในทีมอื่น ๆ และได้ทํางานเกี่ยวกับเสียงในรถยนต์ห้องนักบินอัจฉริยะการโต้ตอบหลายภาษาแอปพลิเคชันการดําเนินงานอิสระของ AI และบริการข้ามอุปกรณ์ ประธานเจ้าหน้าที่ฝ่ายผลิตภัณฑ์ ก่อนหน้านี้รับผิดชอบในการวางแผน Agent OS ห้องนักบินอัจฉริยะและผลิตภัณฑ์ดิจิทัลที่ และทีมอื่น ๆ โดยมุ่งเน้นไปที่วิธีการจัดระเบียบความสามารถของเสียงให้เป็นประสบการณ์ผลิตภัณฑ์ที่สมบูรณ์แทนที่จะอยู่ในความสามารถของแบบจําลองจุดเดียวCOO มีประสบการณ์ในโซลูชันตัวแทนการโต้ตอบด้วยเสียงในเชิงพาณิชย์และการเชื่อมโยงไปถึงในอุตสาหกรรมและมีส่วนร่วมในโซลูชันการโต้ตอบด้วยเสียงในรถยนต์การจัดเลี้ยงการเดินทางและฉากอื่น ๆ เมื่อนําประวัติส่วนตัวเหล่านี้มารวมกันประสบการณ์ร่วมกันของทีม Hojo ได้รับการรับรองในระยะยาวสําหรับการจัดการกับปัญหาเสียงในสถานการณ์จริง ส่วนใหญ่เป็นเพราะสมาชิกในทีมมุ่งเน้นไปที่สภาพแวดล้อมที่สมจริงของ ASR ซึ่งแตกต่างจากเสียงที่สะอาดในห้องปฏิบัติการมีเสียงรบกวนในรถมีภาษาถิ่นหลายคนพูดการขัดจังหวะชั่วคราวและการแสดงออกที่ไม่สมบูรณ์และเป็นภาษาพูดจํานวนมาก

ผู้ใช้จะไม่พูดตามคําพร้อมท์มาตรฐานและจะไม่รอให้ระบบตอบสนองช้าคนที่ทําสถานการณ์นี้จะเข้าใจง่ายขึ้นว่ารูปแบบการพูดเป็นเรื่องยากจริงๆและ ASR ต้องเข้าใจความตั้งใจของมนุษย์อย่างมั่นคงในสภาพแวดล้อมที่ซับซ้อน ประสบการณ์ของซัลตานหัวหน้านักวิทยาศาสตร์ของ Hojo ก็เข้าใจได้ง่ายขึ้นในบริบทนี้ในปีแรก ๆ ของเขาเขามีส่วนร่วมในการวิจัยและพัฒนาที่เกี่ยวข้องกับการจดจําเสียงที่ และผ่านขั้นตอนของการเรียนรู้ลึกเพื่อผลักดัน ASR ไปสู่การเชื่อมโยงไปถึงเชิงพาณิชย์ ต่อมาเขารับผิดชอบทิศทางที่เกี่ยวข้องกับเสียงใน AI Lab และจับขั้นตอนของการเขียนปฏิสัมพันธ์เสียงใหม่ของแบบจําลองขนาดใหญ่ คุณค่าของประวัติส่วนตัวนี้คือเขาเองได้ผ่านการเปลี่ยนแปลงหลายครั้งอย่างต่อเนื่องในเทคโนโลยีเสียงจากการแข่งขันความถูกต้องในการจดจําไปจนถึงการเชื่อมโยงไปถึงฉากจริงและการฟื้นฟูปฏิสัมพันธ์ทางเสียงในยุคแบบจําลองขนาดใหญ่สําหรับ บริษัท ที่ต้องการเป็นระบบปฏิบัติการตัวแทนส่วนบุคคลประสบการณ์นี้กําหนดว่าการออกแบบใหม่ในเวิร์กโฟลว์ที่แท้จริงเป็นกุญแจสําคัญแทนที่จะมองไปที่เสียงเป็นเพียงส่วนประกอบการป้อนข้อมูลเท่านั้น ในระดับเงินทุน Hojo ได้เสร็จสิ้นการจัดหาเงินทุน 4 รอบเกือบ 100 ล้านหยวนตั้งแต่ก่อตั้งขึ้นในกรณีที่ผลิตภัณฑ์ยังไม่ได้เปิดตัวอย่างเป็นทางการและกําลังอยู่ในรอบ Pre-Aข้อมูลประเภทนี้ไม่ได้เป็นหลักฐานโดยตรงว่าผลิตภัณฑ์ประสบความสําเร็จ แต่อย่างน้อยก็แสดงให้เห็นว่าตลาดหลักได้เริ่มให้ความสนใจกับการสะสมเทคโนโลยีของ บริษัท ในทิศทางของ Voice AI และ Agent OS ในเชิงพาณิชย์ตาม Hojo การผสมผสานของ "โมเดลขนาดใหญ่ + Agentic OS" ที่พัฒนาขึ้นเองได้ให้ความสามารถด้านเสียงพื้นฐานสําหรับอุปกรณ์เสียง AI ล้านลําดับหากตัวเลขนี้เป็นความจริงมันไม่ได้อยู่ในกระดาษการสาธิตหรือรายการ แต่ได้เข้าสู่อุปกรณ์จริงและสถานการณ์ผู้ใช้จริงแล้ว จากการวางแผนของ Hojo ASR เป็นเพียงก้าวแรกมันยังคงทํา TTS ในขณะเดียวกันและวางแผนที่จะเปิดตัวรูปแบบเสียง ในช่วงปลายเดือนมิถุนายนเรื่องราวที่แท้จริงคือการสร้างพื้นฐานการโต้ตอบด้วยเสียงรอบระบบปฏิบัติการตัวแทนส่วนบุคคล: ช่วยให้ตัวแทนได้ยินเข้าใจตอบสนองและในที่สุดก็เข้าสู่กระแสงานที่แท้จริงของคนงานความรู้ ผลิตภัณฑ์ติดตามผลจะต้องได้รับการตรวจสอบว่าแผนเหล่านี้จะสามารถตอบสนองได้หรือไม่แต่อย่างน้อยในครั้งนี้ Hojo-ASR-V1 ได้ส่งมอบผลลัพธ์ที่น่าสังเกตพอในลิงค์แรกของเวิร์กโฟลว์ Voice AI ดังนั้นทําไมการเปิดเผยข้อมูลของ Hojo-ASR จึงดึงดูดความสนใจ?หรือสิ่งที่ Hojo-ASR อยู่ในบริบท? Voice AI อีกเรื่องหนึ่ง นอกเหนือจากรุ่นใหญ่ของ เมื่อตัวแทนเริ่มเข้าสู่เวิร์กโฟลว์จริงบริบทที่จําเป็นต้องได้รับจะซับซ้อนมากขึ้น: การอภิปรายในการประชุมความต้องการทางโทรศัพท์เสียงในสถานที่ประโยคที่เพิ่มขึ้นโดยผู้ใช้ชั่วคราวหรือแม้กระทั่งคําสั่งที่เปลี่ยนแปลงไปเมื่อหลายคนทํางานร่วมกันพร้อมกัน ในอดีตข้อมูลเหล่านี้ส่วนใหญ่จะพิมพ์ แต่ในหลายสถานการณ์การทํางานข้อมูลที่เกิดขึ้นจริงไม่ได้เขียน แต่พูด

นี่คือเหตุผลที่โรงงานขนาดใหญ่ได้เพิ่ม Voice AI ในช่วงสองปีที่แล้วOpenAI เปิดตัว API แบบเรียลไทม์ Google ทํา Gemini Live ในประเทศ , MiniMax และ ยังลงทุนในทิศทางเสียงความร้อนของสนามแข่งในช่วงสองปีที่ผ่านมาสามารถวัดได้ด้วยเงินร้อนจากสถิติของ Assembly AI ระบุว่า บริษัท ที่เพิ่งเริ่มต้นด้วยเสียง AI ได้รับเงินทุนร่วมประมาณ 2.1 พันล้านเหรียญในปี 2025 จากเดือนมิถุนายน 2025 ถึงเดือนพฤษภาคม 2026 มีการเปิดเผยต่อสาธารณชนเกี่ยวกับการระดมทุน 36 ครั้งรวมเป็นประมาณ 25 800 ล้านเหรียญสหรัฐสรุปได้ด้วยคําเดียว คือ ร้อนมากๆโดยเฉพาะอย่างยิ่งสําหรับ บริษัท Eleven Labs ซึ่งทําการสังเคราะห์เสียงได้รับ $ 500 ล้านดอลลาร์ในรอบ D มูลค่า 11 พันล้านดอลลาร์ PolyAI ซึ่งทําเสียงบริการลูกค้าทางโทรศัพท์ได้รับ $ 86 ล้านดอลลาร์ในรอบ D และ Retell AI ซึ่งมุ่งเน้นการโทรแบบเรียลไทม์จัดการโทรศัพท์ AI มากกว่า 40 ล้านครั้งต่อเดือนเพิ่มขึ้นมากกว่า 300% เมื่อเทียบกับไตรมาสที่ผ่านมามีทีมงานเช่น Cartesia ที่เชี่ยวชาญในการลดความล่าช้าของเสียงลงภายใน 100 มิลลิวินาทีเพื่อให้การสนทนาฟังดูลดลงนอกจากนี้ยังมีการเคลื่อนไหวมากมายในโรงงานขนาดใหญ่OpenAI เปิดตัว API แบบเรียลไทม์ ทําให้เสียงเป็นโครงการแบบ end-to-end เสียงเข้า เสียงออก ตรงกลางไม่ได้แบ่งออกเป็นสามส่วนอีกต่อไป "แปลงข้อความ ผ่านโมเดล และสังเคราะห์ใหม่" โดยดําเนินการอย่างสมบูรณ์ในครั้งเดียวGemini Live ของ Google มีแนวคิดที่คล้ายกัน สามารถถูกขัดจังหวะเมื่อคุณพูดครึ่งหนึ่งแล้วตอบสนองต่อ ได้รับการเปิดตัว Voice AI ใหม่ที่สนับสนุนโดย Gamma4 ในสองวันนี้: คุณสามารถเห็นได้ว่าเสียงกําลังเปลี่ยนจาก "การโต้ตอบที่เป็นธรรมชาติมากขึ้น" เป็นทางเข้าสําหรับตัวแทนที่จะได้รับบริบทเทรนด์นี้จะเห็นได้ชัดยิ่งขึ้นเมื่อนําไปใช้ใน Vibe Working ที่ได้รับความนิยมเมื่อเร็วๆนี้คนไม่จําเป็นต้องจัดเรียงความต้องการทุกขั้นตอนให้เป็นคําพร้อมท์ที่สมบูรณ์คุณสามารถคิดพูดและปรับแต่งในขณะที่ตัวแทนสามารถจับความตั้งใจในการสนทนาเติมบริบทและก้าวไปข้างหน้างานได้ตามธรรมชาติมากขึ้นในการเชื่อมโยงนี้ ASR เป็นความสามารถชั้นแรกมันกําหนดว่าตัวแทนจะเข้าใจโลกแห่งความเป็นจริงก่อนหรือไม่ถ้าคุณไม่ได้ฟังเสียงของคุณจะบิดเบือนความเข้าใจการวางแผนและการดําเนินการ แต่ถ้าคุณไม่ได้ฟังเสียงของคุณจะกลายเป็นส่วนหนึ่งของเวิร์กโฟลว์โดยทั่วไป: เมื่อตัวแทนเริ่มเข้าสู่ชีวิตประจําวันเสียงหรือ Voice AI อาจเป็นทางเข้าแรกสําหรับการเข้าถึงผู้คนการเชื่อมต่อระหว่างมนุษย์และ AI มีหลายวิธี เช่น การพิมพ์ การแตะอินเตอร์เฟซ การเขียนโค้ดเพื่อปรับ API แต่สิ่งที่ใกล้เคียงกับการสนทนาประจําวันระหว่างมนุษย์มากที่สุดคือการเปิดปากพูดคุยนั่นเป็นเหตุผลว่าทําไมผู้คนจึงเรียกเสียงมากขึ้นว่าเป็นรายการบริบทของตัวแทนถ้าแบบจําลองขนาดใหญ่มีความรับผิดชอบในการทําความเข้าใจโลกเสียงเป็นช่องทางที่โลกจะไหลเข้าสู่แบบจําลองอย่างต่อเนื่องและในช่องนี้ ASR มีบทบาทเป็นชั้นการรับรู้มันกําหนดว่าตัวแทนสามารถจับภาพข้อมูลในสภาพแวดล้อมภายนอกได้อย่างถูกต้องหรือไม่และสามารถเปลี่ยนเสียงในโลกแห่งความเป็นจริงเป็นบริบทที่โมเดลสามารถเข้าใจและใช้ประโยชน์ได้หรือไม่จากมุมมองนี้จุดแข่งขันของ ASR ได้รับการยกระดับ: แข่งขันเพื่อประตูสู่การเชื่อมต่อกับโลกแห่งความเป็นจริงสําหรับตัวแทนรุ่นต่อไป นี่ก็เป็นเหตุผลว่าทำไมข้อมูลที่เปิดเผยโดย Hojo-ASR-V1 จึงน่าสนใจมากขึ้น เพราะมันสะท้อนให้เห็นไม่เพียงแค่การเปลี่ยนแปลงของผลลัพธ์จากโมเดลเท่านั้น

Voice AI กำลังเปลี่ยนจากเป็นเพียงเทคโนโลยีเสริมมาเป็นส่วนหนึ่งของโครงสร้างพื้นฐาน และกลายเป็นรากฐานที่สำคัญยิ่งขึ้นในยุคของ Agent 🚥 กลับมาที่ Voice AI ในขณะที่ผู้ผลิตส่วนใหญ่มุ่งความสนใจไปที่โมเดลขนาดใหญ่ที่ใช้ได้ทั่วไป แต่แวดวงของเทคโนโลยีการรับรู้เสียง (Voice Recognition หรือ ASR) ซึ่งดูเหมือนจะเงียบสงบกว่า ก็กำลังพัฒนาอย่างรวดเร็ว แม้แต่ในสาขาที่มีผู้นำระดับโลกอย่าง OpenAI, Microsoft, NVIDIA, IBM และบริษัทอื่นๆ เช่นกัน ก็เริ่มมีทีมสตาร์ทอัพที่สามารถสร้างผลงานที่น่าประทับใจได้ การปรากฏตัวของ Hojo-ASR-V1 อาจไม่ได้หมายความว่าโครงสร้างการแข่งขันจะเปลี่ยนแปลงไป แต่อย่างน้อยก็แสดงให้เห็นว่า Voice AI กำลังเคลื่อนตัวจากเทคโนโลยีรองมาสู่บทบาทที่สำคัญกว่า และดึงดูดความสนใจจากผู้คนมากขึ้นเรื่อยๆ การรับรู้เสียงเป็นเพียงขั้นตอนแรกของ Voice AI เท่านั้น สิ่งที่สำคัญกว่าคือเครื่องจักรสามารถเข้าใจเสียงได้อย่างแม่นยำ และสามารถตอบสนองได้ในรูปแบบที่ใกล้เคียงกับมนุษย์หรือไม่ นั่นคือเรื่องราวที่ยาวนานกว่า มีคุณค่ามากกว่า และมีศักยภาพมากกว่า แหล่งข้อมูลอ้างอิง: [1] https://huggingface.co/HojoAI/Hojo-ASR-V1: https://huggingface.co/HojoAI/Hojo-ASR-V1 [2] https://github.com/HojoAI/Hojo-ASR: https://github.com/HojoAI/Hojo-ASR บทความนี้มาจาก WeChat Official Account “十字路口Crossing” โดยผู้เขียน “十字路口Crossing”

มีประโยชน์หรือไม่?

ฝ่ายสนับสนุนด้านเทคนิคบริการลูกค้าออนไลน์
侧栏
กลับไปด้านบน
简体中文ZH-CNDefault繁體中文ZH-TWEnglishEN日本語JA한국어KOภาษาไทยTHTiếng ViệtVIBahasa IndonesiaIDEspañolESFrançaisFRDeutschDEРусскийRUPortuguêsPTItalianoITالعربيةAR