• นักวิทยาศาสตร์ OpenAI Noam Brown: ขีด จํากัด ที่แท้จริงของ AI อาจไม่มีใครสามารถวัดได้เลย

    เมื่อโมเดลภาษาขนาดใหญ่เริ่มเข้าสู่งานที่ซับซ้อน เช่น การอนุมาน การวิจัยอัตโนมัติ และความปลอดภัยทางไซเบอร์ วิธีการประเมินโมเดลแบบดั้งเดิมก็กำลังเผชิญกับความท้าทายใหม่ๆมาเป็นเวลานานแล้ว การเปิดตัวโมเดลมักจะมาพร้อมกับตารางผลลัพธ์ที่ประกอบด้วยการทดสอบมาตรฐานหลากหลายประเภท เช่น คณิตศาสตร์ การเขียนโปรแกรม คำถาม-คำตอบทางวิทยาศาสตร์ ความปลอดภัยทางไซเบอร์ และการอนุมานความรู้ และจะมีการเปรียบเทียบผลลัพธ์เหล่านั้นกับโมเดลรุ่นก่อนหน้า

    นักวิทยาศาสตร์ OpenAI Noam Brown: ขีด จํากัด ที่แท้จริงของ AI อาจไม่มีใครสามารถวัดได้เลย
  • เมื่อทำการวิจัยด้าน AI คลอด์ (Claude) มักจะทำตัวโง่ลงอย่างไม่คาดคิด และ Anthropic ก็ถูกวงการวิจัยโจมตีอย่างหนัก

    Claude Fable 5 เป็นประเด็นร้อนแรงในวงการ AI ในวันนี้ โมเดล “ระดับตำนาน” นี้มีประสิทธิภาพที่ยอดเยี่ยม และได้รับความสนใจอย่างมากAndrej Karpathy เรียกมันว่า “น่าตื่นเต้นมาก” และเป็น “ความก้าวหน้าที่สำคัญที่คู่ควรกับการอัปเกรดเวอร์ชันใหญ่” ซึ่งอยู่ในระดับเดียวกับการปรับปรุงที่ Claude 4.5 นำมาในเดือนพฤศจิกายนปีที่แล้ว SWE-bench Pro ซึ่งเป็นเครื่องมือวัดประสิทธิภาพการเขียนโปรแกรม ให้คะแนน Fable 5 ได้ 80.3% ซึ่งสูงกว่า Opus 4.8 ถึง 11 จุดเปอร์เซ็นต์ Fable 5 มีคลังโค้ดที่มีขนาด 50 ล้านบรรทัดภาษา Ruby และสามารถทำการย้ายทั้งคลังโค้ดได้ภายในหนึ่งวัน ในขณะที่หากให้ทีมงานมนุษย์ทำงานเดียวกันนี้ จะต้องใช้เวลามากกว่าสองเดือน

    เมื่อทำการวิจัยด้าน AI คลอด์ (Claude) มักจะทำตัวโง่ลงอย่างไม่คาดคิด และ Anthropic ก็ถูกวงการวิจัยโจมตีอย่างหนัก
  • GPT-5.6 การทดสอบจริงครั้งแรกมา!ความแม่นยําตํานาน

    เมื่อสักครู่นี้ Anthropic ได้เปิดตัว “The Big Killer” ที่ถูกซ่อนเอาไว้เป็นเวลาสองเดือน…Claude Fable 5และMythos 5มันเหมือนกับการโยนระเบิดลงไปตอนนี้เราควรเริ่มกดดัน OpenAI โดยตรง

    GPT-5.6 การทดสอบจริงครั้งแรกมา!ความแม่นยําตํานาน
  • Claude Fable 5 ลิปรั่ว 6 ชั่วโมงทดสอบผลจริง ฆ่าบ้าจริง?

    Fable 5 เพิ่งเปิดตัว และคำแนะนำจากระบบก็รั่วไหลออกมาแล้ว:หลังจากดูคำแนะนำเหล่านี้แล้ว มีหลายประเด็นที่สำคัญ:ประการแรก Fable ได้เพิ่ม API สำหรับการจัดเก็บข้อมูลแบบถาวร (window.storage) ให้กับ Artifact ซึ่งก็คือเนื้อหาที่ถูกสร้างขึ้นโดยโค้ดของ Claude เช่น หน้าเว็บ HTML, คอมโพเนนต์ React ฯลฯ ก่อนหน้านี้ข้อมูลของ Artifact ไม่สามารถถูกบันทึกไว้ได้ และมันเหมือนกับเพียงการแสดงผลแบบชั่วคราว (demo) เท่านั้น ตอนนี้ข้อมูลสามารถถูกเก็บไว้ระหว่างการเข้าสู่ระบบ (session) และสามารถรองรับเครื่องมือต่างๆ ที่มีความสามารถ “จดจำ” ได้ เช่น ตารางคะแนน, เครื่องติดตามเวลาการทำงาน, ไดอารี่ ฯลฯ

    Claude Fable 5 ลิปรั่ว 6 ชั่วโมงทดสอบผลจริง ฆ่าบ้าจริง?
  • ในสนามแข่งขัน Voice AI ที่กำลังร้อนแรงขึ้นเรื่อยๆ มีสตาร์ทอัพชื่อ Hojo ปรากฏตัวขึ้น

    Voice AI อีกหนึ่งเรื่องราวนอกเหนือจากโมเดลใหญ่ของจีเอ็ม ในขณะที่ทุกคนกําลังจ้องมองรุ่นใหญ่ของ Voice AI รุ่นใหม่ที่น่าสังเกตเริ่มปรากฏขึ้นในสนามที่ค่อนข้างเงียบสงบ แป้นพิมพ์กําลังสูญเสียการปกครองของมัน ในช่วงสองปีที่ผ่านมา OpenAI เปิดตัว API แบบ Realtime Google ทํา Gemini Live และ บริษัท โมเดลใหญ่ ๆ ในประเทศเกือบจะเริ่มวางรูปแบบ Voice AIมีความเชื่อมากขึ้นว่าเมื่อตัวแทนเข้ามาในเวิร์กโฟลว์เสียงจะกลายเป็นทางเข้าบริบทที่เป็นธรรมชาติมากกว่าแป้นพิมพ์ ถ้าตัวแทนต้องการเข้าสู่กระแสงานจริงๆ มันต้องเรียนรู้ที่จะเข้าใจเสียงเหล่านี้ก่อนและความสามารถชั้นแรกที่อยู่เบื้องหลังนี้คือ ASR (การจดจําเสียงอัตโนมัติ) สําหรับการวัดระดับ ASR ที่อุตสาหกรรมนิยมอ้างถึงมากที่สุดคือ Open ASR Leaderboard ของ Hugging Face ตัวชี้วัดหลักคืออัตราข้อผิดพลาดของคํา (WER) ยิ่งตัวเลขต่ําเท่าไหร่การระบุก็ยิ่งถูกต้องมากขึ้นเท่านั้น

ไม่มีเนื้อหาเพิ่มเติม