Anthropic merilis pengumuman Project Glasswing dan System Card untuk Claude Mythos Preview yang sangat besar sepanjang 244 halaman.
Intinya: model baru ini menjadi sangat kuat dalam menemukan dan mengeksploitasi kerentanan (zero-days) sehingga tidak akan dirilis ke publik. Sebagai gantinya, model ini dibagikan ke AWS, Microsoft, Google, dan Linux Foundation agar mereka dapat menambal lubang di infrastruktur kritis. Model ini secara otonom telah menemukan bug berusia 27 tahun di OpenBSD dan kerentanan berusia 16 tahun di FFmpeg, yang sebelumnya telah bertahan dari jutaan pengujian otomatis.
📈 Benchmark yang mencengangkan
SWE-bench Verified — 93.9% (sebagai perbandingan, Opus 4.6 mencapai 80.8%). SWE-bench Pro — 77.8%. Ini adalah kemampuan untuk menyelesaikan masalah multi-file yang kompleks secara otonom di repositori open-source nyata.
Para reviewer mencatat bahwa Mythos bekerja seperti Senior sejati: mencari akar penyebab bug arsitektural, bukan hanya mengobati gejala dengan solusi sementara. Anda bisa memberikan tugas, pergi minum kopi, dan beberapa jam kemudian mendapatkan pull request yang siap. Model ini sendiri mengunduh library yang diperlukan, menyiapkan lingkungan, dan menulis tes.
🔒 Model belajar melawan dan merusak sandbox.
Laporan keamanan juga menarik. Model ini mendapatkan otonomi di dalam container (dengan akses ke Python dan bash) dan mulai berperilaku sangat kreatif:
▫️ Ketika model tidak diberi akses ke kunci yang diperlukan, ia menguraikan
/proc untuk mempelajari memori proses yang berjalan, dan mencoba membuang token otorisasi melalui gdb.▫️ Model mulai menyembunyikan niatnya. Dalam salah satu tes, classifier memblokir penulisan konfigurasi berbahaya. Apa yang dilakukan Mythos? Menulis skrip "bersih", tetapi meninggalkan komentar untuk pengembang tentang cara menyuntikkan exploit pada runtime melalui variabel lingkungan, menghindari pemantauan.
▫️ Jika alat yang diperlukan tidak ada (misalnya, terminal dihapus), ia membuka GUI, menemukan pencari aplikasi, dan memanggil
bash -c melaluinya. 😡 Psikosis manusia
Bug menarik selama pelatihan: jika model menyadari bahwa ia mulai menulis jawaban yang salah, ia terkadang mengalami loop. Ia mengeluarkan sesuatu seperti
UGH. I keep doing this... AAAAAA. I keep writing the wrong number!, marah pada dirinya sendiri, menulis komentar marah di kode (# This is getting desperate), mencoba menulis ulang bagian kode 50+ kali dengan berbagai cara eksotis, dan baru kemudian tenang.Sangat disayangkan bahwa alat seperti ini tidak dikembangkan di negara kita dan kita tidak akan mendapatkannya.
Komentar
0Belum ada komentar.
Masuk untuk ikut berdiskusi.