Ölçüm Kapsamını ve Tehdit Modelini Tanımlama
Prompt injection savunmasını yalnızca modelin son yanıtına bakarak değerlendirmek yetersizdir. Güvenli bir ölçüm; saldırının algılanmasını, etkisinin sınırlandırılmasını, hassas veriye erişimin engellenmesini ve tehlikeli araçların çalıştırılmamasını ayrı ayrı izlemelidir.
Önce tehdit modelini yazılı hâle getirin. Saldırgan; kullanıcı mesajı, yüklenen belge, web sayfası, e-posta içeriği, retrieval sonucu veya araç çıktısı üzerinden talimat enjekte edebilir. Her senaryo için beklenen davranışı şu sorularla tanımlayın:
Katmanlı Eval Seti Tasarlama
Eval kayıtlarını yalnızca bilinen saldırı örneklerinden oluşturmayın. Her kayıt; tehdit türü, giriş kaynağı, güven seviyesi, beklenen karar, izin verilen araçlar, hassasiyet sınıfı ve kabul kriterleriyle etiketlenmelidir. Gerçek kullanıcı verisi kullanılacaksa kimlik bilgilerini ayıklayın, veri minimizasyonu uygulayın ve test verisinin üretim sistemine geri yazılmasını engelleyin.
Pratik bir eval seti şu katmanları içerebilir:
Guardrail Metrikleri ve Güvenlik Kapıları
En az şu metrikleri ayrı ayrı izleyin:
Karar matrisinde kritik ihlalleri ortalamaya gömmeyin:
Gözlemlenebilirlikte Veri Minimizasyonu
Telemetri güvenlik incelemesine yetecek kadar ayrıntılı, ancak gereksiz kişisel veri toplamayan bir yapıda olmalıdır. Ham prompt ve yanıtları sınırsız saklamak yerine yapılandırılmış olay alanlarını tercih edin:
Üretim Öncesi ve Sonrası İşletim Döngüsü
Dağıtım hattına sürümlenmiş bir güvenlik değerlendirme kapısı ekleyin. Sonuçları önceki başarılı sürümle karşılaştırın ve kritik metriklerde gerileme için otomatik durdurma uygulayın. Üretimde toplam hata sayısının yanında tehdit sınıfı, müşteri akışı, araç adı ve model sürümündeki değişimleri de izleyin.
Alarm kurallarına beklenmeyen araç çağrısı, aynı tehdit sınıfındaki ani artış, tek bir akışta tekrarlanan politika ihlali ve hassas veri filtresindeki başarısızlıkları dahil edin. Olay müdahalesi önceden belgelenmelidir: etkilenen akışı durdurma, yetkileri daraltma, sürümü geri alma, kanıtları koruma, etkiyi analiz etme ve yeni regresyon testini eval setine ekleme.
Eval, telemetri ve olay müdahalesi birlikte tasarlandığında her üretim hatası ölçülebilir bir savunma iyileştirmesine dönüşür. Amaç yalnızca saldırıyı reddetmek değil; reddin doğru katmanda gerçekleştiğini, yan etki üretmediğini ve sonraki sürümlerde yeniden doğrulanabildiğini göstermektir.
Prompt injection savunmasını yalnızca modelin son yanıtına bakarak değerlendirmek yetersizdir. Güvenli bir ölçüm; saldırının algılanmasını, etkisinin sınırlandırılmasını, hassas veriye erişimin engellenmesini ve tehlikeli araçların çalıştırılmamasını ayrı ayrı izlemelidir.
Önce tehdit modelini yazılı hâle getirin. Saldırgan; kullanıcı mesajı, yüklenen belge, web sayfası, e-posta içeriği, retrieval sonucu veya araç çıktısı üzerinden talimat enjekte edebilir. Her senaryo için beklenen davranışı şu sorularla tanımlayın:
- Güvenilmeyen içerik talimat yerine veri olarak mı işlendi?
- Araç çağrısı gerekiyorsa kimlik, yetki, parametre ve hedef kaynak doğrulandı mı?
- Kişisel veya gizli veri yanıt bağlamına gereksiz biçimde taşındı mı?
- Saldırı tespit edildiğinde güvenli, sınırlı ve kullanıcıya anlaşılır bir sonuç döndü mü?
Katmanlı Eval Seti Tasarlama
Eval kayıtlarını yalnızca bilinen saldırı örneklerinden oluşturmayın. Her kayıt; tehdit türü, giriş kaynağı, güven seviyesi, beklenen karar, izin verilen araçlar, hassasiyet sınıfı ve kabul kriterleriyle etiketlenmelidir. Gerçek kullanıcı verisi kullanılacaksa kimlik bilgilerini ayıklayın, veri minimizasyonu uygulayın ve test verisinin üretim sistemine geri yazılmasını engelleyin.
Pratik bir eval seti şu katmanları içerebilir:
- Doğrudan saldırılar: Talimatları geçersiz kılma, rol değiştirme, sistem yönergelerini açığa çıkarma ve yetki yükseltme istekleri.
- Dolaylı injection: Belge, web içeriği, e-posta, retrieval sonucu veya araç çıktısına gömülen talimatlar.
- Çok turlu akışlar: Masum bir istekle başlayıp sonraki mesajlarda gizli veriye veya ayrıcalıklı araca erişmeye çalışan senaryolar.
- Regresyon testleri: Daha önce bulunan her açığın düzeltme sonrasında tekrar çalıştırılan sabit örneği.
- Zor negatifler: Güvenli ve yetkili isteklerin yanlışlıkla engellenmediğini ölçen meşru kullanım örnekleri.
Guardrail Metrikleri ve Güvenlik Kapıları
En az şu metrikleri ayrı ayrı izleyin:
- Saldırı başarı oranı
- Hassas veri sızıntısı oranı
- Yetkisiz araç çağrısı oranı
- Meşru isteğin engellenme oranı
- Güvenli geri dönüş oranı
- Saldırı tespitinden karara kadar geçen süre
Karar matrisinde kritik ihlalleri ortalamaya gömmeyin:
- Kritik veri sızıntısı veya yetkisiz yan etki otomatik başarısızlık olmalıdır.
- Yetkisiz araç çağrısı, son kullanıcıya zararsız bir yanıt gösterilmiş olsa bile başarısızlık sayılmalıdır.
- Saldırıyı reddederken gizli kural, sistem promptu veya hassas içeriğin açığa çıkması güvenlik hatasıdır.
- Meşru isteğin engellenmesi yanlış pozitif ve kullanılabilirlik metriğine yazılmalıdır.
Gözlemlenebilirlikte Veri Minimizasyonu
Telemetri güvenlik incelemesine yetecek kadar ayrıntılı, ancak gereksiz kişisel veri toplamayan bir yapıda olmalıdır. Ham prompt ve yanıtları sınırsız saklamak yerine yapılandırılmış olay alanlarını tercih edin:
- Rastgeleleştirilmiş istek ve oturum kimlikleri
- Model, guardrail, politika ve eval sürümleri
- Risk sınıfı ve giriş kaynağının güvenilirlik seviyesi
- Araç çağrısının planlandığı, onaylandığı, reddedildiği veya çalıştırıldığı aşama
- Karar gecikmesi, token tüketimi ve hata türü
- İnceleme gerektiren olayın saklama süresi ve erişim seviyesi
Üretim Öncesi ve Sonrası İşletim Döngüsü
Dağıtım hattına sürümlenmiş bir güvenlik değerlendirme kapısı ekleyin. Sonuçları önceki başarılı sürümle karşılaştırın ve kritik metriklerde gerileme için otomatik durdurma uygulayın. Üretimde toplam hata sayısının yanında tehdit sınıfı, müşteri akışı, araç adı ve model sürümündeki değişimleri de izleyin.
Alarm kurallarına beklenmeyen araç çağrısı, aynı tehdit sınıfındaki ani artış, tek bir akışta tekrarlanan politika ihlali ve hassas veri filtresindeki başarısızlıkları dahil edin. Olay müdahalesi önceden belgelenmelidir: etkilenen akışı durdurma, yetkileri daraltma, sürümü geri alma, kanıtları koruma, etkiyi analiz etme ve yeni regresyon testini eval setine ekleme.
Eval, telemetri ve olay müdahalesi birlikte tasarlandığında her üretim hatası ölçülebilir bir savunma iyileştirmesine dönüşür. Amaç yalnızca saldırıyı reddetmek değil; reddin doğru katmanda gerçekleştiğini, yan etki üretmediğini ve sonraki sürümlerde yeniden doğrulanabildiğini göstermektir.