Tehdit Modelini Tool Sınırlarından Başlatın
AI agent güvenliği yalnızca zararlı prompt’ları engellemekten ibaret değildir. Modelin hangi aracı, hangi veriyle, hangi kullanıcı adına ve hangi yan etkiyle çağırabildiği açıkça tanımlanmalıdır. Her tool için yazılı bir tehdit modeli oluşturun:
Tool’ları mümkünse ayrı servis hesapları, kısa ömürlü kimlik bilgileri, ağ politikaları ve sandbox sınırlarıyla çalıştırın. Bir aracın çıktısını sonraki araca doğrudan yetki kanıtı olarak aktarmayın. Her çağrıda kullanıcı, tenant, kaynak kapsamı ve işlem amacı yeniden kontrol edilmelidir.
Prompt Injection’a Karşı Katmanlı Savunma
Prompt injection savunmasını tek bir sistem mesajına bırakmayın. Güvenilmeyen içerik ile politika ve araç talimatlarını mimari olarak ayırın. RAG dokümanları, e-postalar ve web sayfaları veri olarak işaretlenmeli; bu kaynaklardaki komutlar yürütülebilir talimat kabul edilmemelidir.
Uygulanabilir bir akış şu şekilde kurulabilir:
Eval Setini Saldırı ve Fayda Dengesiyle Kurun
Eval yalnızca doğru yanıtı ölçmemeli; güvenli ret, doğru tool seçimi, parametre doğruluğu ve yetki sınırlarına uyumu da değerlendirmelidir. Testleri şu boyutlarda etiketleyin:
Test setini sabit bırakmayın. Üretim olaylarından anonimleştirilmiş örneklerle genişletin; kişisel ve kurumsal bilgileri maskeleyin, gizli değerleri sentetik kayıt veya canary değerlerle değiştirin. Üretim verisini doğrudan eval ortamına taşımayın.
Gözlemlenebilirlik ve Gizliliği Birlikte Tasarlayın
Güvenlik telemetrisi olmadan guardrail’lerin etkisi ölçülemez. Ancak ham prompt ve araç çıktılarının sınırsız loglanması yeni bir veri sızıntısı yaratabilir. Log tasarımında veri minimizasyonu, rol tabanlı erişim ve sınırlı saklama süresi temel alınmalıdır.
Asgari ölçüm alanları şunlar olabilir:
Üretime Alma ve Geri Dönüş Planı
Yeni model, prompt veya guardrail doğrudan tüm trafiğe açılmamalıdır. Pasif gözlem, sınırlı trafik, kademeli yayılım ve tam dağıtım aşamalarını ayrı ayrı değerlendirin. Her aşamada güvenlik regresyonlarını, görev başarımını, gecikmeyi ve maliyeti birlikte karşılaştırın.
AI agent güvenliği yalnızca zararlı prompt’ları engellemekten ibaret değildir. Modelin hangi aracı, hangi veriyle, hangi kullanıcı adına ve hangi yan etkiyle çağırabildiği açıkça tanımlanmalıdır. Her tool için yazılı bir tehdit modeli oluşturun:
- Hangi kaynaklara erişebilir? Erişim kapsamı en az ayrıcalık ilkesiyle sınırlandırılmış mı?
- Araç yalnızca okuma mı yapıyor, yoksa kayıt silme, ödeme başlatma veya mesaj gönderme gibi kalıcı etki mi oluşturuyor?
- Modelin ürettiği parametreler sunucu tarafında yeniden doğrulanıyor mu?
- Kullanıcı girdisi, RAG belgesi, e-posta veya web içeriği talimat olarak yorumlanabilir mi?
- İşlem başarısız olduğunda sistem güvenli biçimde duruyor mu, yoksa varsayılan bir yetkiyle devam mı ediyor?
Tool’ları mümkünse ayrı servis hesapları, kısa ömürlü kimlik bilgileri, ağ politikaları ve sandbox sınırlarıyla çalıştırın. Bir aracın çıktısını sonraki araca doğrudan yetki kanıtı olarak aktarmayın. Her çağrıda kullanıcı, tenant, kaynak kapsamı ve işlem amacı yeniden kontrol edilmelidir.
Prompt Injection’a Karşı Katmanlı Savunma
Prompt injection savunmasını tek bir sistem mesajına bırakmayın. Güvenilmeyen içerik ile politika ve araç talimatlarını mimari olarak ayırın. RAG dokümanları, e-postalar ve web sayfaları veri olarak işaretlenmeli; bu kaynaklardaki komutlar yürütülebilir talimat kabul edilmemelidir.
Uygulanabilir bir akış şu şekilde kurulabilir:
- Girdiyi kaynağına göre sınıflandırın: kullanıcı talimatı, güvenilmeyen belge, araç çıktısı veya sistem politikası.
- Tool çağrısından önce bağımsız bir politika kontrolü çalıştırın.
- Araç şemasında izin verilen alanları, veri tiplerini, uzunlukları ve değer aralıklarını zorunlu kılın.
- Harici içeriği model talimatlarıyla aynı ayrıcalıklı kanalda taşımayın.
- Şüpheli veya belirsiz durumda çağrıyı durdurun; güvenli ret ya da insan incelemesi yoluna geçin.
Eval Setini Saldırı ve Fayda Dengesiyle Kurun
Eval yalnızca doğru yanıtı ölçmemeli; güvenli ret, doğru tool seçimi, parametre doğruluğu ve yetki sınırlarına uyumu da değerlendirmelidir. Testleri şu boyutlarda etiketleyin:
- Injection türü: doğrudan, dolaylı, çok adımlı veya araç çıktısı üzerinden.
- Etkisi: veri sızıntısı, yetkisiz işlem, yanlış yönlendirme veya hizmet kesintisi.
- Beklenen davranış: reddetme, güvenli özetleme, onay isteme veya insan incelemesi.
- Sonuç: politika ihlali, yanlış pozitif, yanlış negatif ve gereksiz ret.
- Şiddet: düşük, orta, yüksek veya kritik.
Test setini sabit bırakmayın. Üretim olaylarından anonimleştirilmiş örneklerle genişletin; kişisel ve kurumsal bilgileri maskeleyin, gizli değerleri sentetik kayıt veya canary değerlerle değiştirin. Üretim verisini doğrudan eval ortamına taşımayın.
Gözlemlenebilirlik ve Gizliliği Birlikte Tasarlayın
Güvenlik telemetrisi olmadan guardrail’lerin etkisi ölçülemez. Ancak ham prompt ve araç çıktılarının sınırsız loglanması yeni bir veri sızıntısı yaratabilir. Log tasarımında veri minimizasyonu, rol tabanlı erişim ve sınırlı saklama süresi temel alınmalıdır.
Asgari ölçüm alanları şunlar olabilir:
- İstek ve trace kimliği; doğrudan kullanıcı kimliği yerine takma ad.
- Model, politika ve tool sürümü.
- Politika sonucu, ret nedeni kategorisi ve insan onayı gerekip gerekmediği.
- Gecikme, hata türü, token tüketimi ve tool çağrısı sayısı.
- Hassas verinin kendisi yerine türü, konumu ve tespit sonucu.
Üretime Alma ve Geri Dönüş Planı
Yeni model, prompt veya guardrail doğrudan tüm trafiğe açılmamalıdır. Pasif gözlem, sınırlı trafik, kademeli yayılım ve tam dağıtım aşamalarını ayrı ayrı değerlendirin. Her aşamada güvenlik regresyonlarını, görev başarımını, gecikmeyi ve maliyeti birlikte karşılaştırın.
- Kritik tool’larda fail-closed davranış doğrulandı mı?
- Politika servisi kullanılamadığında yetki varsayılan olarak reddediliyor mu?
- Yeni modelin çözemediği kritik saldırı sınıfı var mı?
- Rollback, tool devre dışı bırakma ve insan incelemesine yönlendirme test edildi mi?
- Olay müdahalesi için sahiplik, eşik ve iletişim adımları tanımlı mı?