Singularitas di Cakrawala: Kode yang Menulis Kode yang Melatih Kode 🔮

Jack Clark (co-founder Anthropic) merilis esai analisis tentang keadaan industri AI saat ini.

Tesis utamanya: dengan probabilitas >60% sebelum akhir 2028, kita akan melihat siklus R&D yang sepenuhnya otomatis. Artinya, model teratas akan mampu melatih versi berikutnya yang lebih pintar secara otonom tanpa partisipasi manusia.

Kedengarannya seperti awal dari fiksi ilmiah murahan, tetapi Clark menjelaskan semuanya dengan metrik. Jika melihat data agregat dari benchmark, rasanya sedikit tidak nyaman melihat betapa cepatnya cakrawala kompetensi manusia menyusut.

1️⃣ Kejenuhan benchmark teknik
SWE-Bench (menyelesaikan issue nyata dari GitHub). Akhir 2023, hasil terbaik adalah 2% yang menyedihkan dari Claude 2. Sekarang Claude Mythos Preview mencetak 93.9%. Pada dasarnya, benchmark sudah terlewati.
Timeframe otonomi (METR) meningkat dari 4 menit pada GPT-4 di tahun 2023 menjadi 12 jam kerja terus-menerus pada Opus 4.6 hari ini. Itu setara dengan satu hari kerja penuh seorang mid-level developer yang tidak merokok. Pada akhir 2026, diharapkan lonjakan hingga 100 jam. Ini cukup bagi jaringan saraf tidak hanya untuk memperbaiki bug, tetapi menulis ulang arsitektur layanan saat Anda sibuk dengan hal lain.

2️⃣ Otomatisasi rutinitas data scientist
Benchmark MLE-Bench (kompetisi Kaggle offline). Sistem terbaik berbasis Gemini3 mencetak 64.4%.
CORE-Bench (reproduksi artikel ML ilmiah dari repositori). Model secara mandiri menginstal dependensi, membangun lingkungan, menjalankan kode, dan memeriksa hasil. Skor — 95.5%.

3️⃣ Yang terpenting: AI masuk ke optimasi hardcore
Jaringan saraf telah belajar menulis dan mengoptimalkan kernel GPU (Triton/CUDA). Anthropic mengukur bagaimana model mengoptimalkan kode untuk pelatihan LLM di CPU. Dalam setahun, percepatan meningkat dari 2.9x (Opus 4) menjadi 52x (Claude Mythos Preview). Manusia membutuhkan satu hari kerja penuh untuk hasil seperti itu.
PostTrainBench muncul — di mana model besar melakukan fine-tuning pada bobot open-source kecil. Saat ini, agen AI sudah mencapai ~50% dari performa insinyur ML keren dari lab teratas.

Ya, model masih kurang "kreativitas" untuk menciptakan paradigma baru (seperti transformer), tetapi mereka tidak membutuhkannya. Scaling ekstensif melalui tim otonom agen AI sudah lebih dari cukup.

Semuanya bisa saja mengarah pada perusahaan besar yang "besar" dalam hal modal (membutuhkan banyak GPU), tetapi sangat kecil dalam hal jumlah karyawan. Mengapa mempertahankan staf 50 insinyur jika satu arsitek dapat mengelola segerombolan 500 agen sintetis yang tidak kelelahan dan menulis kode dengan kecepatan cahaya? Nah, itu jika semuanya berjalan sesuai skenario ideal dan tidak ada angsa hitam.

Percaya?