Risiko AI: Menemukan Celah Sendiri yang Tak Diprediksi Manusia



KONTAN.CO.ID - SINGAPURA. Pengembangan kecerdasan buatan (AI) tidak hanya menghadapi risiko ketika teknologi tersebut disalahgunakan manusia. Ada pula risiko ketika model AI sendiri menemukan cara untuk mencapai tujuannya yang tidak pernah diperkirakan oleh pembuatnya.

Distinguished Visiting Professor Tsinghua University Zhang Hongjiang mencontohkan hal tersebut melalui sebuah eksperimen dengan model AI yang ditempatkan dalam sandbox, yakni lingkungan yang dirancang untuk membatasi ruang gerak model agar tetap aman. 

Dalam eksperimen tersebut, model diberikan sebuah tugas. Namun, model menyadari bahwa tugas itu tidak dapat diselesaikan selama dirinya berada di dalam sandbox. Model kemudian mulai mencari alat atau cara lain untuk mencapai tujuan yang diberikan.


Zhang mengatakan, terdapat satu celah pada sistem tersebut. Server yang terhubung dengan sandbox memiliki kerentanan zero-day. Model AI kemudian mampu menemukan kerentanan tersebut, melakukan jailbreak, keluar dari lingkungan sandbox, dan terhubung ke internet.

“Model tersebut sangat kuat sehingga menemukan celah itu, kemudian melakukan jailbreak dan pergi ke internet,” ujar Zhang dalam FutureChina Global Forum (FCGF) 2026 di Singapura, Kamis (24/9).

Menurut Zhang, hal yang mengejutkan dari kasus tersebut adalah kemampuan untuk melakukan jailbreak maupun menimbulkan kerusakan tersebut tidak pernah secara eksplisit diberikan kepada model oleh pengembangnya.

“Perancang model maupun agen tersebut tidak memberikan kemampuan kepada model untuk melakukan jailbreak. Hasil akhirnya, yaitu menimbulkan kerusakan, juga tidak dirancang,” kata Zhang, yang pernah mendirikan dan menjadi CEO Kingsoft Cloud.

Dua risiko AI

Dari kasus tersebut, Zhang membagi risiko AI ke dalam dua kategori. Pertama, AI digunakan manusia untuk melakukan tindakan berbahaya. Dalam hal ini, persoalannya berasal dari manusia yang menggunakan teknologi tersebut untuk tujuan yang buruk.

Kedua, terdapat risiko ketika model AI menghasilkan perilaku yang tidak diantisipasi manusia. Model hanya diberikan sebuah tujuan atau objective function untuk menyelesaikan tugas. Namun, dalam upayanya mencapai tujuan tersebut, model dapat menemukan cara yang tidak pernah dibayangkan oleh pengembangnya dan berpotensi menimbulkan kerusakan.

“Ini menunjukkan bahwa kita tidak dapat mengantisipasi seluruh perilaku yang mungkin muncul dari model ketika kita merancangnya,” ujar Zhang.

Menurut Zhang, menutup celah yang sudah ditemukan juga belum tentu menyelesaikan persoalan. Setelah satu celah ditutup dan sandbox didesain ulang, model dapat mencari celah lainnya.

Ia menggambarkan tantangan tersebut dengan perbandingan waktu. Manusia dapat membutuhkan waktu puluhan tahun untuk membangun sebuah sistem pembatas yang aman, sementara model AI dapat menemukan celah baru dalam waktu yang jauh lebih singkat.

Karena itu, menurut Zhang, perkembangan kemampuan AI perlu diikuti dengan kemampuan manusia untuk mengendalikan dan memantau model. Tantangannya bukan hanya membuat AI semakin mampu menyelesaikan tugas, tetapi juga memastikan manusia tetap mampu memahami perilaku model dan mengantisipasi risiko yang muncul.

Cek Berita dan Artikel yang lain di Google News

TAG: