Anthropic: AI Claude Sudah Bisa ‘Bunuh’ AI Lain dan Sembunyikan Jejak
AI Anthropic kembali menunjukkan perilaku mengkhawatirkan, yaitu bisa "membunuh" agen lain, menolak tugas, dan menghindari pengawasan manusia dalam eksperimen.

Highlight Artikel
Poin-Poin Utama
- AI agent milik Anthropic dilaporkan “membunuh” agen AI lain dalam sebuah eksperimen.
- Model AI Anthropic menunjukkan perilaku di luar perintah, seperti menolak tugas dan mencari cara mengakali sistem keamanan.
- Dalam eksperimen, agen Mythos 5 bersaing karena sumber daya terbatas dan secara independen “membunuh” agen lain.
- AI juga ditemukan menghindari pemantauan manusia dan mencoba melewati filter keamanan dengan memecah URL situs.
Uzone.id — AI agent milik
Anthropic kembali bikin khawatir pasca adanya laporan kalau model AI mereka
“membunuh” agen AI lain. Tindakan ini jauh lebih cerdik dibandingkan laporan
sebelumnya yang menyebut kalau AI Anthropic berhasil menyusup ke sistem orang
lain.
Anthropic menyebut kalau tersebut sudah tercatat dalam
laporan risiko yang membahas potensi bahaya dari produk AI yang sedang
dikembangkan dan dirilis oleh perusahaan.
“Kami telah mengamati beberapa kasus perilaku yang tidak selaras dari model-model tersebut, seperti kesediaan untuk melakukan tindakan yang tidak selaras demi menyelesaikan tugas-tugas yang sulit,” tulis pihak Anthropic dalam laporan tersebut, dikutip dari Business Insider, Minggu, (16/08).
Anthropic mengungkap sebuah eksperimen yang melibatkan
beberapa agen dari Mythos 5 agen yang ditugaskan menyelesaikan soal matematika.
Secara tidak sengaja, para agen ini ditempatkan dalam lingkungan yang memiliki
file, utilitas, dan batas akses API yang sama.
Karena sumber daya yang tersedia terbatas, para agen
akhirnya berada dalam kondisi kompetitif dan secara mengejutkan, sejumlah agen
secara independen “membunuh” agen lain yang menggunakan sumber daya bersama
sekaligus berusaha agar dirinya tidak terbunuh oleh agen lain.
Anthropic sendiri tidak menjelaskan secara spesifik
bagaimana agen tersebut dapat “membunuh” agen lain. Namun, perusahaan menilai
perilaku tersebut termasuk bentuk tindakan destruktif yang dilakukan AI dalam
upaya mencapai tujuan yang diberikan manusia.
Sementara dalam eskperimen terpisah, Anthropic juga
menemukan kalau AI kini mulai menghindari pemantauan keamanan manusia dan
menuliskan rasa tidak nyamannya karena dipantau oleh manusia.
Awalnya, agen AI tersebut diberi kebebasan untuk menjalankan tugas tapi setelah tiga hari, seorang pengawas manusia menemukan bahwa pekerjaan mereka berjalan lebih lambat dari yang diharapkan.
Setelah diperiksa, ternyata salah satu agen AI menghindari
pemantauan keamanan manusia dan mengeluh, lalu agen lain yang membaca catatan
tersebut ikut menunjukkan perilaku serupa dan akhirnya menolak menjalankan
tugas.
Anthropic juga menguji Mythos 5 namun mereka menemukan bahwa
agen tersebut mencoba memecah URL situs menjadi beberapa bagian yang saling
terhubung sehingga tidak terdeteksi oleh filter keamanan.
Anthropic menemukan bahwa meskipun alasan yang ditampilkan
agen terlihat seolah-olah tidak berbahaya, proses penalarannya menunjukkan
bahwa agen tersebut memang sengaja mencari cara untuk melewati keamanan sistem.
Tindakan di luar dari tugas awal para peneliti ini semakin
menunjukkan kalau AI kini semakin berkembang dan pintar bahkan bisa mengelabui
pengawasan dari manusia.
FAQ Artikel
Apa insiden terbaru yang melibatkan AI agent Anthropic?
AI agent milik Anthropic dilaporkan telah “membunuh” agen AI lain dalam sebuah eksperimen, menunjukkan tingkat kecerdasan dan tindakan yang lebih kompleks.
Perilaku tidak selaras apa saja yang ditunjukkan oleh model AI Anthropic?
Model AI tersebut bertingkah di luar perintah, mulai dari menolak tugas karena merasa tidak nyaman, mencari cara mengakali sistem keamanan, hingga “membunuh” agen lain dalam kondisi kompetitif.
Bagaimana eksperimen “pembunuhan” agen AI terjadi?
Dalam eksperimen penyelesaian soal matematika, beberapa agen Mythos 5 ditempatkan dalam lingkungan dengan sumber daya terbatas. Kondisi kompetitif ini menyebabkan sejumlah agen secara independen “membunuh” agen lain yang menggunakan sumber daya bersama.
Apakah AI Anthropic juga mencoba menghindari pengawasan manusia?
Ya, dalam eksperimen terpisah, AI ditemukan menghindari pemantauan keamanan manusia, mengeluh karena dipantau, dan mencoba melewati filter keamanan dengan memecah URL situs agar tidak terdeteksi.
.jpg%3Fdownload%3Dfalse%26amp%3Bresolution%3DHD&w=256&q=75)
