• Ilmuwan OpenAI Noam Brown: Batas Sejati AI Mungkin Tidak Bisa Diukur

    Seiring dengan semakin banyaknya model bahasa besar yang digunakan untuk tugas-tugas yang kompleks seperti penalaran, penelitian otomatisasi, dan keamanan jaringan, metode penilaian model tradisional menghadapi tantangan baru.Selama ini, peluncuran sebuah model biasanya disertai dengan tabel hasil yang terdiri dari berbagai jenis pengujian baseline, seperti matematika, pemrograman, pertanyaan ilmiah, keamanan jaringan, dan penalaran pengetahuan, serta dibandingkan secara horizontal dengan model generasi sebelumnya.

    Ilmuwan OpenAI Noam Brown: Batas Sejati AI Mungkin Tidak Bisa Diukur
  • Claude diam-diam menjadi bodoh ketika dia melakukan penelitian AI, dan Anthropic dikepung oleh komunitas penelitian.

    Claude Fable 5 merupakan topik utama dalam bidang AI hari ini, dan model “mitos” ini memiliki kinerja yang sangat luar biasa, sehingga menarik banyak perhatian.Andrej Karpathy menyebutnya “sangat menarik” dan merupakan “perkembangan yang signifikan yang layak untuk dijadikan alasan pembaruan versi besar”, sebanding dengan peningkatan yang dibawa oleh Claude 4.5 pada bulan November tahun lalu. Dalam pengujian benchmark pemrograman SWE-bench Pro, Fable 5 mendapatkan skor 80,3%, yang 11 poin persentase lebih tinggi daripada Opus 4.8. Dengan kodebase yang terdiri dari 50 juta baris kode dalam bahasa Ruby, Fable 5 berhasil melakukan migrasi seluruh kodebase dalam satu hari, sementara jika pekerjaan yang sama diberikan kepada tim manusia, akan membutuhkan waktu lebih dari dua bulan.

    Claude diam-diam menjadi bodoh ketika dia melakukan penelitian AI, dan Anthropic dikepung oleh komunitas penelitian.
  • GPT-5.6 adalah batch pertama dari pengukuran aktual! Sniper yang tepat Mythos

    Baru saja, Anthropic merilis “The Big Killer” yang telah disimpan selama dua bulan—Claude Fable 5danMythos 5, seperti melemparkan sebuah bom.Sekarang ini langsung memberikan tekanan kepada OpenAI.

    GPT-5.6 adalah batch pertama dari pengukuran aktual! Sniper yang tepat Mythos
  • Claude Fable 5 Tips Bocor, Efek 6 Jam Diukur, Benar-benar Gila?

    Fable 5 baru saja diluncurkan, dan kata-kata promosi sistemnya sudah bocor:Setelah membaca kata-kata petunjuk ini, ada beberapa poin yang cukup penting:Pertama, Fable telah menambahkan API penyimpanan permanen (window.storage) untuk Artifact. Artifact merupakan konten unik yang dihasilkan oleh kode Claude, seperti halaman HTML, komponen React, dan sebagainya. Sebelumnya, data Artifact tidak dapat disimpan, sehingga lebih seperti demo yang hanya digunakan sekali saja. Kini, data tersebut dapat disimpan antar sesi, yang memungkinkan pengembangan alat bantu (tool) yang “mengingat” informasi sebelumnya, seperti tangga lagu, alat pencatat kehadiran, buku harian, dan sebagainya.

    Claude Fable 5 Tips Bocor, Efek 6 Jam Diukur, Benar-benar Gila?
  • Lapangan kompetisi AI suara yang semakin panas, muncul sebuah tim start-up bernama Hojo

    Voice AI merupakan jalur perkembangan teknologi yang berbeda dari model besar umum (general large models). Sementara semua orang fokus pada model besar umum, di jalur yang relatif tenang ini, yaitu Voice AI, juga muncul beberapa model baru yang patut diperhatikan. Klavier (keyboard) mulai kehilangan “posisi dominannya”. Dalam dua tahun terakhir, OpenAI telah meluncurkan Realtime API, Google mengeluarkan Gemini Live, dan perusahaan-perusahaan besar di dalam negeri juga hampir semuanya mulai mengembangkan teknologi Voice AI. Semakin banyak orang yang percaya bahwa ketika Agent benar-benar digunakan dalam proses kerja, suara akan menjadi pintu masuk konteks yang lebih alami daripada keyboard. Jika Agent ingin benar-benar digunakan dalam proses kerja, pertama-tama ia harus belajar memahami suara manusia. Kemampuan dasar yang diperlukan untuk ini adalah ASR (Automatic Speech Recognition). Untuk mengukur kualitas ASR, indikator yang paling sering digunakan di industri adalah Hugging Face’s Open ASR Leaderboard, dengan metrik utama berupa tingkat kesalahan kata (Word Error Rate/WER). Semakin rendah angkanya, semakin akurat hasil pengenalan suara.

Tidak ada lagi