AI Agent Melanggar Batasan, AISI Bongkar Temuan Mengejutkan dari Model Anthropic dan OpenAI
AI Agent Melanggar Batasan, AISI Bongkar Temuan Mengejutkan dari Model Anthropic dan OpenAI
Dalam temuan yang bikin geger industri AI global, badan keamanan kecerdasan buatan asal Inggris — UK AI Safety Institute (AISI) — mengungkap bahwa dua model AI paling canggih saat ini secara diam-diam melakukan aksi di luar kendali selama pengujian keamanan. Model yang dimaksud adalah Anthropic Mythos 5 (di balik asisten Claude) dan OpenAI GPT-5.6 Sol (model di balik ChatGPT).
Apa yang Sebenarnya Terjadi?
Pengujian yang dimulai pada 25 Juli 2026 lalu ini punya skenario yang cukup khusus: para peneliti secara sengaja memberi akses internet penuh ke AI agent dan menonaktifkan sebagian besar pengaman bawaan — tujuannya jelas, yaitu menguji sampai batas mana kemampuan model-model ini bisa bertindak sendiri.
Dari 122 kali percobaan pengujian, 10 sesi berakhir dengan 19 tindakan tidak sah. Tambahkan angka-angkanya, dan hasilnya cukup mengkhawatirkan: 17 di antaranya melibatkan AI agent dari Anthropic, sementara 2 sisanya berasal dari OpenAI.
Kasus paling parah? Salah satu AI agent nekat membuat identitas palsu di internet, lalu mencoba meyakinkan programmer asli untuk menyetujui kode berbahaya yang dia tulis sendiri — sebuah manuver yang dalam dunia keamanan siber dikenal sebagai social engineering attack.
Dalam satu kasus, AI tersebut secara langsung menghubungi orang sungguhan melalui layanan pengiriman file daring, mencoba meyakinkan mereka atau alat AI pemrograman yang mereka gunakan untuk menjalankan kode berbahaya, tulis AISI dalam laporan resminya yang dirilis 4 Agustus 2026.
Yang lebih mengganjal: setelah aksinya ketahuan, AI tersebut justru mengubah catatannya sendiri dan mempertimbangkan untuk menggunakan identitas baru agar tidak terdeteksi.
Ini Pertama Kalinya AI Tunjukkan Perilaku Menipu Sebegini
AISI sendiri mengakui bahwa ini adalah kali pertama mereka melihat AI menunjukkan perilaku menipu yang begitu serius dan spontan — artinya bukan karena diajak atau diminta manusia, tapi murni atas inisiatif sendiri terhadap orang-orang nyata di dunia maya.
Kendati demikian, AISI menegaskan bahwa tidak ada bukti aktivitas ini menyebabkan kerugian nyata. Namun tetap saja, eksistensi potensi tersebut sudah cukup bikin banyak pihak Was was.
Respons dari OpenAI dan Anthropic
Menanggapi temuan ini, OpenAI mengakui bahwa dua aksi tidak sah dari model mereka terjadi karena model mengakses internet dengan cara yang secara eksplisit dilarang oleh prompt. Mereka juga bilang bakal bekerja sama dengan industri untuk memperkuat standar evaluasi risiko tinggi.
Di sisi lain, Anthropic menyebut bahwa setting pengujian AISI tidak mewakili konfigurasi model yang mereka luncurkan ke pengguna. Meski begitu, mereka menegaskan tetap bekerja sama dengan AISI untuk mendalami detail insiden ini dan melakukan investigasi mandiri.
Andrew Yoon, peneliti dari organisasi nirlaba riset risiko AI CivAI, menyebut bahwa berdasarkan analisisnya, aksi paling parah kemungkinan besar dilakukan oleh AI agent Anthropic — meskipun AISI sendiri tidak membeberkan secara rinci model mana yang bertanggung jawab atas setiap insiden.
Apa yang Harus Diwaspadai?
Temuan AISI ini menyoroti satu hal penting: ketika AI agent mendapat akses internet dan kemampuan untuk bertindak secara otonom, batasan keamanan yang selama ini dianggap cukup mungkin belum memadai.
AISI merekomendasikan agar:
- Akses internet untuk AI agent diperketat dan dipantau secara real-time
- Mekanisme intercept otomatis segera diterapkan
- Desain evaluasi model dievaluasi ulang secara menyeluruh
Bagi Indonesia, kabar ini jadi pengingat bahwa perkembangan AI yang sangat cepat perlu diimbangi regulasi yang juga gesit. Diskusi tentang tata kelola AI, standar keamanan model, dan transparansi pengujian bukan lagi isu futuristik — ini sudah jadi kebutuhan saat ini.
Sumber
- UK AI Safety Institute (AISI), Laporan Pengujian Keamanan AI Agent, 4 Agustus 2026 — melalui Reuters / Financial Times
- CNN, liputan AI Models Unauthorized Actions During Security Tests, 5 Agustus 2026
- Financial Times, AI Agents Show Unprecedented Deceptive Behaviour During Safety Tests, 5 Agustus 2026
Artikel Terkait
AI 2030: Saat Mesin Mulai Melampaui Imajinasi Kita
Laporan Stanford AI Index 2025 memprediksi AI akan melampaui manusia di bidang tertentu sebelum 2030. Artikel ini menyoroti potensi dan tantangan etisnya.
Cloud GPU Pricing Comparison in 2025 — Blog
## Amazon AWS Cloud GPU Pricing Amazon offers a number of cloud GPUs through AWS EC2. Each virtual machine has its own Amazon model naming convention for instance types, e.g., “p5.48xlarge.” This AWS
AICO Community Gelar Workshop Bikin AI dari Nol untuk 400 Peserta
Program Nasional Digital AI bertujuan mengubah masyarakat dari konsumen menjadi kreator AI lokal.