AI Agen memperkenalkan kelas risiko keamanan yang belum diatasi oleh industri. Berikut cara kami memandangnya di Asana, dan prinsip keamanan yang kami terapkan di seluruh fitur AI kami.
Sistem AI agentik tidak hanya menjawab pertanyaan. Sistem ini membaca dokumen, mengambil tindakan, dan berkoordinasi di seluruh alat. Semakin banyak yang dapat mereka lakukan, semakin besar attack surface mereka.
Tidak seperti kode konvensional, LLM memiliki properti yang pada dasarnya membuat hal ini sulit: LLM tidak dapat membedakan instruksi dari data secara andal. Semua yang dimasukkan ke LLM berada dalam aliran yang sama, sehingga data yang dibuat dengan cermat dapat mengambil alih model dengan cara yang sama seperti instruksi yang sah. Ini adalah akar dari injeksi prompt, yang oleh Simon Willison disebut sebagai "dosa asal" dari aplikasi berbasis LLM.
Ini bukan teoretis. Para peneliti telah mendemonstrasikan kelas serangan ini terhadap Microsoft 365 Copilot, server MCP GitHub, Slack AI, dan lainnya. Bruce Schneier menyatakannya dengan blak-blakan: industri ini belum memiliki pertahanan yang kuat terhadap kelas serangan ini.
Jadi, bagaimana cara membangun AI agen secara bertanggung jawab ketika industri belum memahami dasar-dasarnya?
Willison menyaring risiko inti menjadi tiga kemampuan yang, jika digabungkan, menciptakan kondisi untuk bahaya:
Akses ke data sensitif. Agen dapat membaca informasi rahasia atau privat.
Paparan terhadap konten yang tidak tepercaya. Agen memproses input yang mungkin mengandung instruksi jahat tersembunyi.
Kemampuan untuk berkomunikasi secara eksternal. Agen dapat mengirim informasi ke luar sistem.
Penjelasan yang bermanfaat untuk bagian ketiga: ini benar-benar kemampuan untuk menciptakan efek samping, bukan hanya komunikasi keluar. Mengekfiltrasi data ke server penyerang adalah contoh klasik, tetapi instruksi berbahaya yang diam-diam mengubah judul setiap proyek di Ruang Kerja, atau mengirim konten sensitif ke saluran internal yang salah, adalah bentuk masalah yang sama. Kami menggunakan "komunikasi eksternal" sebagai singkatan, tetapi versi yang lebih luas adalah hal yang sebenarnya kami cegah.
Salah satu bagian dari trifekta ini dapat dikelola. Bahkan dua bagian sekalipun biasanya dapat dikelola. Namun, ketika ketiganya bertemu, Anda memiliki jalur serangan yang layak.
Wawasan penting: mematahkan salah satu kaki secara substansial mengurangi risiko keseluruhan. Kita tidak perlu menyelesaikan injeksi prompt dengan sempurna. Tidak ada yang bisa. Kita perlu memastikan ketiga kondisi tersebut tidak dapat dengan mudah terjadi bersamaan.
Korny Sietsma mengembangkan hal ini, memetakan trifekta ke mitigasi seperti sandboxing, dekomposisi tugas, hak akses terendah, dan human-in-the-loop. Ini adalah landasan. Pertanyaannya adalah bagaimana cara mengoperasikannya.
Kami mengatur pemikiran kami seputar tiga pilar yang secara langsung terkait dengan trifekta mematikan. Masing-masing membatasi satu kaki.
Asana memiliki beberapa permukaan AI. AI Teammates adalah peserta agen dengan keanggotaan dan izin mereka sendiri di Ruang Kerja. Fitur AI lainnya beroperasi sebagai pengguna, dengan batas yang sudah dapat diakses oleh pengguna tersebut. Invarian di bawah ini berfokus pada kasus agen, tempat antarmuka terbesar, dan kami akan menunjukkan perbedaan implementasi berdasarkan antarmuka.
Bagian trifecta: Akses ke data sensitif
Agar AI agen dapat berguna, AI membutuhkan konteks. Tantangannya adalah memberinya cukup konteks agar dapat membantu tanpa memberinya akses penuh.
Invarian dasar kami adalah prinsip hak akses terendah, dengan ekspresi yang tepat bergantung pada permukaan. Untuk AI Teammates, yang memiliki keanggotaan sendiri yang terpisah dari pengguna individu mana pun, batasnya adalah persimpangan izin Rekan tim dan pengguna. Untuk fitur AI yang beroperasi sebagai pengguna, batasnya hanyalah akses pengguna itu sendiri. Dalam setiap kasus, lapisan otorisasi sisi server yang sama yang mengatur setiap interaksi lainnya di Asana mengatur akses AI. Fitur AI tidak mendapatkan izin yang lebih tinggi. Fitur-fitur tersebut beroperasi dalam sistem kontrol akses Asana, bukan di luarnya.
Menentukan konteks tidak hanya melibatkan pengaturan akses data internal di Asana; ini juga mencakup integrasi eksternal yang dapat berinteraksi dengan agen. Meskipun integrasi saat ini memerlukan otorisasi pengguna yang eksplisit, kami sedang mengembangkan jalur kontrol terperinci dan khusus agen. Ini memungkinkan organisasi untuk membatasi hak istimewa integrasi bagi AI Teammates yang menangani input berisiko tinggi. Invarian arsitektur inti kami jelas: batas dari apa yang dapat dilihat AI harus dinamis dan didorong oleh pemilik data, bukan menjadi default produk yang dikodekan secara permanen.
Bahkan jika penyerang menyelundupkan instruksi berbahaya ke dalam konteks AI, apa yang sebenarnya dapat dilihat AI dibatasi oleh model izin yang sama seperti hal lainnya.
Tahap trifecta: Paparan terhadap konten yang tidak tepercaya
Ini adalah tahap tersulit. Dalam platform manajemen kerja, sebagian besar yang dibaca AI adalah konten yang dibuat pengguna: tugas, komentar, dokumen terlampir. Sebagian darinya berasal dari luar organisasi. Anda tidak dapat menolak untuk membacanya.
Sebagai gantinya, kami membuat checkpoint: tempat kami membedakan niat tepercaya dari konten sewenang-wenang, dan tempat manusia dapat mengintervensi jika ada sesuatu yang tampak salah.
Penanganan instruksi yang sadar sumber. Fitur AI menandai konten berdasarkan kepercayaan penulis dan sumber, sehingga model dapat memberikan bobot lebih tinggi pada instruksi dari pengguna yang berwenang dibandingkan instruksi yang ditemukan dalam konten sewenang-wenang di sepanjang prosesnya. Ini mempersempit attack surface untuk injeksi prompt tetapi tidak menutupnya; model masih membaca segala sesuatu dalam konteksnya, dan jaminan keamanan bersifat parsial, bukan mutlak. Kami membahas batasan metode ini di bawah ini.
Pencatatan dan investigasi forensik. Setiap panggilan model dicatat dengan input, output, aktor, konteks fitur, dan peristiwa hilirnya, termasuk objek grafik kerja mana yang disentuh oleh automasi dan URL mana yang muncul dalam output. Kami memberi peringatan secara otomatis tentang sinyal operasional seperti tingkat kesalahan dan lonjakan biaya. Untuk anomali yang relevan dengan keamanan, log yang sama tersebut mendukung investigasi post-hoc oleh manusia. Seperti yang dicatat Willison, bahkan deteksi berbasis pola yang menangkap sebagian besar serangan akan gagal jika hanya itu; visibilitas dan kemampuan untuk menyelidiki adalah fondasi tahan lama yang kami bangun, bukan dinding.
Desain Human-in-the-loop. Fitur AI menampilkan pekerjaan mereka untuk ditinjau manusia alih-alih diam-diam mengambil tindakan yang tidak dapat diubah.
Pemecahan tugas dan tindakan yang terbatas ruang lingkupnya. Alur Kerja yang kompleks dibagi menjadi tahapan yang lebih kecil, dan tindakan yang tersedia untuk fitur AI sengaja dibatasi, bukan terbuka.
Tidak satu pun dari ini yang secara individual tahan bantingan. Bersama-sama, mereka membentuk pertahanan yang mendalam.
Bagian ketiga trifekta: Kemampuan untuk menciptakan efek samping
Kaki ketiga adalah tempat sebagian besar serangan dunia nyata mendarat. Jika penyerang meyakinkan AI untuk menyematkan data sensitif dalam URL, mengirimkannya melalui integrasi, atau mengubah bukti proses yang diandalkan orang lain, serangan tersebut berhasil.
Kami berinvestasi pada beberapa kategori kendali di sini:
Perlakukan output LLM sebagai tidak tepercaya. Konten yang dihasilkan tidak mendapatkan peningkatan kepercayaan karena berasal dari AI Asana. Konten ini melalui alur validasi dan rendering yang sama dengan konten buatan pengguna lainnya.
Persetujuan manusia wajib untuk tindakan berdampak tinggi. Kategori tindakan tertentu selalu memerlukan persetujuan eksplisit dari manusia, terlepas dari seberapa yakin AI atau seberapa rutin permintaan tersebut. Untuk AI Teammates, ini termasuk tindakan yang meningkatkan akses (mengubah izin, menambahkan anggota) dan tindakan yang menghancurkan data (penghapusan). AI dapat mengusulkan tindakan ini; AI tidak dapat mengeksekusinya sendiri.
Pembatas penanganan tautan. URL eksternal dalam konten yang dibuat AI diproses sebelum mencapai pengguna. URL baru yang tidak muncul dalam input mendapatkan pemeriksaan ekstra dan muncul dalam bentuk lengkap dan tidak tersembunyi, bukan sebagai teks tautan yang diberi label ulang, sehingga AI tidak dapat dijadikan senjata untuk menyamarkan titik akhir eksfiltrasi sebagai "klik di sini untuk ringkasan" yang ramah.
Tidak ada HTTP keluar untuk tujuan umum. Fitur AI tidak memiliki primitif terbuka "buat permintaan ke URL mana pun". Integrasi eksternal melalui saluran yang memiliki cakupan dengan otorisasi tersendiri.
Jalur audit tindakan. Setiap tindakan penulisan, mutasi, dan keluar yang dilakukan fitur AI dicatat bersama dengan panggilan model yang memicunya, sehingga penyelidik dapat merekonstruksi apa yang dilakukan AI, bukan hanya apa yang diminta.
Golnya bukan untuk membuat komunikasi eksternal tidak mungkin dilakukan. Fitur AI perlu mereferensikan tautan, memperbarui tugas, dan menghasilkan output yang berguna. Golnya adalah memastikan fitur tersebut tidak dapat melakukannya secara tersembunyi dengan cara yang tidak diinginkan pengguna.
Di dalam kerangka ini, sub-masalah konkret yang sama terus muncul: fitur AI menghasilkan sesuatu (ID objek, penerima, URL) dan kode hilir bertindak berdasarkan hal tersebut, sering kali dengan izin yang lebih luas daripada AI itu sendiri. Halusinasi dan injeksi prompt mendarat di tempat yang sama: nilai yang dikeluarkan model menjadi tepercaya.
Kami menggunakan pola empat bagian sebagai daftar periksa tinjauan desain untuk nilai-nilai ini:
Batasi apa yang diizinkan untuk dihasilkan AI sejak awal, sebelum validasi harus berjalan.
Validasi setiap nilai yang dihasilkan AI di sisi server terhadap lapisan otorisasi yang sama seperti yang lainnya. Model diperlakukan sebagai klien yang tidak tepercaya.
Justifikasi pilihan dengan menyimpan konteks terstruktur yang cukup untuk menjelaskan alasan AI memilih apa yang dilakukannya. Itulah yang memungkinkan investigasi, evaluasi, dan respons insiden nantinya.
Eskalasikan dengan friksi, fallback, atau tinjauan manusia ketika nilai berisiko tinggi atau di luar ruang lingkup yang diharapkan.
Garis besarnya: perilaku model tidak boleh menjadi kontrol keamanan utama. Prompt yang lebih baik dan "kami memberi tahu model untuk tidak melakukannya" adalah pertahanan mendalam yang berguna, tetapi kontrol yang tahan lama berada di sistem di sekitar model.
Pilihan ini bukan ad-hoc. Pilihan ini berasal dari prinsip AI Asana yang telah dipublikasikan.
Orang-orang bertanggung jawab atas keputusan yang mendorong desain yang berorientasi pada titik pemeriksaan. AI membantu, tetapi manusia tetap mendapat informasi terkini dan bertanggung jawab.
Kami berkomitmen terhadap keselamatan, yang menjadi alasan investasi dalam kontrol berlapis meskipun kontrol tersebut menambah friksi. Alternatifnya menambah risiko karena fitur AI menangani pekerjaan yang lebih kompleks.
Kami mendorong transparansi, itulah sebabnya kami menulis postingan ini. Kami belum menyelesaikan keamanan AI agen. Namun, bersikap terbuka tentang cara kami mempertimbangkan risiko ini dan mitigasi yang kami jalankan membantu komunitas yang lebih luas membuat kemajuan dalam tantangan bersama dan mengundang pemeriksaan yang membuat kami menjadi lebih baik.
Injeksi prompt pada dasarnya masih belum terpecahkan, dan injeksi prompt tidak langsung (instruksi jahat datang tertanam dalam konten yang diambil AI selama pekerjaannya, bukan konten yang diberikan langsung oleh pengguna) adalah varian yang paling merugikan industri pada tahun 2026. Pemberian tag yang sadar sumber membantu, tetapi tidak sepenuhnya menutup celah ini, karena model masih harus memilih untuk mematuhi tag. Checkpoint kami mengurangi risiko secara signifikan; tetapi tidak menghilangkannya. Selama instruksi dan data berbagi jendela konteks, input jahat yang diambil melalui pencarian, formulir publik, atau integrasi terkadang akan luput. Kami memperlakukan ini sebagai area investasi aktif dan berkelanjutan, dengan pemeriksaan yang lebih ketat terhadap setiap jalur yang memungkinkan konten yang dibuat dari luar mencapai fitur agen. Pekerjaan pada pola desain untuk mengamankan agen LLM mengarah ke arah yang menjanjikan, tetapi konsensus industri masih dalam proses pembentukan.
Lanskap ancaman bergerak cepat. Vektor baru terus muncul, mulai dari injeksi prompt berbasis gambar yang tidak terlihat hingga rantai eksfiltrasi multi-langkah. Kami merancang kontrol agar berlapis dan dapat disusun sehingga mitigasi baru dapat ditambahkan saat ancaman baru muncul. Ini adalah perlombaan persenjataan, bukan masalah yang Anda selesaikan sekali saja. 10 Teratas OWASP untuk Aplikasi LLM adalah referensi berjalan yang berguna.
Kami tidak melihat kesenjangan ini sebagai alasan untuk melambat. Kami menganggapnya sebagai alasan untuk bertindak dengan penuh pertimbangan. Tiga faktor mematikan ini memberi tahu kami risikonya. Konteks, checkpoint, dan kontrol memberi kami Kerangka Kerja untuk bertindak. Dan karena tidak ada tim yang memecahkan ini sendirian, kami secara aktif berinvestasi bersama mitra penelitian dan pelanggan kami untuk memperkuat permukaan ini seiring dengan perkembangan lanskap ancaman.
Simon Willison, "The lethal trifecta for AI agents," Juni 2025
Korny Sietsma, "Agentic AI and Security," Martin Fowler, Oktober 2025
Bruce Schneier, "We Are Still Unable to Secure LLMs from Malicious Inputs," Agustus 2025