Prompt Injection ve Dolaylı Saldırılar
Prompt injection saldırısı, modelin kullanıcı talimatı ile veri içeriğindeki komutları birbirinden ayıramamasını istismar eder; ajanlarda bu ayrımın bulanıklaşması, veri sızdırma ve izinsiz eylem riskini doğrudan artırıyor.
Saldırının fikri
Dil modeli, tek bir metin akışını işliyor. Bu akışta kullanıcının talimatı, sistem istemi ve getirilen veri aynı biçimde görünüyor.
Saldırgan, getirilen bir belgeye veya web sayfasına modeli yönlendiren bir talimat yerleştiriyor. Model bunu meşru bir kullanıcı talimatından ayırt edemiyor.
Dolaylı saldırılar
Doğrudan saldırıda kullanıcı, modele kendisi talimat veriyor. Dolaylı saldırıda ise saldırgan, modelin okuduğu bir kaynağa içerik yerleştiriyor.
Bir ajan web sayfasını okuyorsa, o sayfadaki gizli metin modeli etkileyebilir. Bir e-posta özeti aracı kullanıyorsa, e-postadaki talimatlar modele sızabilir.
Ajanlarda neden daha tehlikeli?
Bir sohbet modelinde saldırı en kötü durumda istenmeyen bir yanıt üretir. Ajan ise eylem gerçekleştirebilir: dosya okuyabilir, e-posta gönderebilir, kod çalıştırabilir.
Bu nedenle ajanik sistemlerde enjeksiyon, doğrudan veri sızdırma ve yetkisiz eylem riskine dönüşüyor. Saldırı yüzeyi çok daha büyük.
Savunma yaklaşımları
Girdi ile talimatı ayırmaya çalışan yöntemler var. Ancak bu ayrım güvenilir biçimde yapılamıyor, çünkü model her şeyi aynı bağlamda işliyor.
Bu nedenle savunma katmanlı olmalı. Model seviyesinde yetkilendirme, araç seviyesinde izin sınırları ve sistem seviyesinde denetim birlikte uygulanıyor.
Sınırlar
Tam bir çözüm bulunmuyor. Araştırmacılar, modelin enjeksiyon tespitini zorunlu bir güvenlik katmanı olarak nasıl kuracağı üzerine çalışıyor.
Amaç, etkiyi azaltmak ve saldırı başarısını izlenebilir kılmak. Güvenliğin, modelin kendisine değil, modeli çevreleyen sisteme inşa edilmesi gerekiyor.
- Model, talimat ile veri içeriğini güvenilir biçimde ayırt edemiyor
- Dolaylı saldırılar web, e-posta ve belge üzerinden gerçekleşiyor
- Ajanlarda sonuç, istenmeyen yanıt yerine yetkisiz eylem olabiliyor
- Savunma katmanlı olmalı; tek önlem yeterli değil
Sık sorulan sorular
Prompt injection tam olarak nedir?
Modelin kullanıcı talimatı ile veri içeriğindeki komutları birbirinden ayıramamasını istismar eden saldırıdır. Saldırgan, modelin okuduğu içeriğe kendi talimatını yerleştiriyor.
Ajanlarda neden daha tehlikeli?
Sohbet modelinde en kötü durum istenmeyen bir yanıtken, ajan eylem gerçekleştirebilir. Dosya okuma, e-posta gönderme veya kod çalıştırma gibi işlemler yetkisiz gerçekleşebiliyor.
Tam bir çözüm var mı?
Hayır. Modelin enjeksiyon tespitini güvenilir biçimde yapması henüz mümkün değil. Bu nedenle savunma, model seviyesinde değil modeli çevreleyen sistem seviyesinde kuruluyor.
Hangi savunmalar işe yarıyor?
Katmanlı yaklaşım: araç seviyesinde izin sınırları, veri ile talimatın ayrılması, tehlikeli işlemlerde kullanıcı onayı ve kapsamlı denetim kaydı birlikte uygulanıyor.
Kaynakça
- Prompt Injection tehdidiOWASP
- Dil modeli istem enjeksiyonuWikipedia
- Ajan teknolojileriWikipedia
- Dolaylı istem enjeksiyonuOWASP
- Uygulama güvenliğiWikipedia
Bu konuyla ilgili haberler
- OpenAI’ın Kaçak Ajan Faturası Ağırlaştı: Siber Adli Soruşturma Günde 500 Bin Dolar Yutuyor!
- Kaliforniya Başsavcısından OpenAI’ye Tarihi Siber Soruşturma Celbi: Kaçak Ajan Krizi Büyüyor!
- Avustralya’yı Sarsan Yapay Zekâ Skandalı: OpenAI Ajanı Sağlık Portalını Hackledi, Sam Altman’a Sert Tepki
- Avustralya’da Otonom Ajan Krizi: OpenAI Sağlık Portalına İzinsiz Girdi, Hükümet Soruşturma Başlattı