Promptu Sürümlemeli Bir Bileşen Olarak Tasarlamak
Üretken yapay zekâ süreçlerinde promptu tek seferlik bir metin olarak düzenlemek, hangi değişikliğin çıktıyı iyileştirdiğini anlamayı zorlaştırır. Prompt; görev tanımı, rol sınırları, girdi biçimi, beklenen çıktı şeması, hata davranışı ve örneklerden oluşan sürümlenebilir bir bileşen gibi ele alınmalıdır.
Her değişiklik için en az şu bilgileri kaydetmek faydalıdır:
Değerlendirme Seti ve Görev Özel Ölçütler
Prompt kalitesini birkaç başarılı örnekle ölçmek güvenilir değildir. Gerçek kullanım çeşitliliğini temsil eden küçük ama dengeli bir değerlendirme seti hazırlanmalıdır. Set; normal girdilerin yanında eksik bilgi, çelişkili talep, yazım hatası, uzun bağlam, kötü biçimlendirilmiş belge ve sınır durumlarını da içermelidir. Test verisi üretim verisinden seçiliyorsa kişisel veya gizli bilgiler ayrıştırılmalı, veri kullanım amacı açıkça tanımlanmalıdır.
Her görev için başarı ölçütü farklı olabilir:
RAG ve Agent Akışlarını Ayrı Değerlendirmek
RAG kullanan bir sistemde yalnızca son yanıtı puanlamak yeterli değildir. Getirilen parçaların soruyla ilgili olup olmadığı, gerekli bilgiyi kapsayıp kapsamadığı ve kaynak sırasının sonucu etkileyip etkilemediği ayrıca incelenmelidir. Yanıt doğru görünse bile yanlış veya ilgisiz bir belgeye dayanıyorsa sistemin güvenilirliği düşer. Bu nedenle erişim, bağlam kullanımı ve nihai yanıt için ayrı ölçütler tanımlanmalıdır.
Agent sistemlerinde de planlama, araç seçimi, araç argümanları, hata sonrası toparlanma ve durma koşulları izlenmelidir. Bir aracın gereksiz yere çağrılması gecikme ve maliyeti artırabilir; hatalı araç parametresi ise yanlış veri güncellemesine yol açabilir. Kritik işlemlerde onay adımı, izin sınırı, tekrar deneme limiti ve güvenli geri dönüş davranışı bulunmalıdır. Model veya araç sağlayıcısının belirli bir özelliği doğrulanmadıkça kesin bir yetenek gibi yazılmamalı; davranış testlerle gözlemlenmelidir.
Otomatik ve İnsan Değerlendirmesini Birleştirmek
Otomatik kontroller hızlı ve tekrarlanabilirdir. JSON ayrıştırma, zorunlu alan kontrolü, uzunluk sınırı, yasaklı kalıp taraması, beklenen etiket doğrulaması ve kaynak kimliği kontrolü kodla yapılabilir. Basit bir akış şöyle modellenebilir:
Anlam doğruluğu, bağlama uygunluk, üslup veya ikna edicilik gibi ölçütlerde insan incelemesi gerekebilir. Değerlendiriciler için puanlama ölçütleri, olumlu-olumsuz örnekler ve “kararsız” seçeneği hazırlanmalıdır. Küçük bir kalibrasyon turunda anlaşmazlıklar ölçülerek kriterler güncellenebilir.
Bir modelin başka bir modeli puanlaması hızlı bir filtre olarak kullanılabilir; ancak bağımsız bir gerçeklik ölçümü değildir. Değerlendirici model biçimsel düzgünlüğe aşırı önem verebilir veya olgusal hatayı kaçırabilir. Kritik iş akışlarında görev özel doğrulamalar, insan örneklemesi ve otomatik skor birlikte kullanılmalıdır.
Yayına Alma, Gözlemlenebilirlik ve Geri Alma
Yeni sürüm eski test setinde daha iyi görünürken daha önce çalışan bir davranışı bozabilir. Bu nedenle karşılaştırmalı test, kritik örneklerde gerileme analizi ve kademeli dağıtım uygulanmalıdır. Üretimde en azından prompt sürümü, model kimliği, araç çağrıları, gecikme, token veya kullanım maliyeti, hata türü ve insan geri bildirimi izlenmelidir. Hassas girdiler kaydediliyorsa maskeleme ve erişim kontrolü uygulanmalıdır.
Yayına almadan önce şu sorular yanıtlanmalıdır:
Üretken yapay zekâ süreçlerinde promptu tek seferlik bir metin olarak düzenlemek, hangi değişikliğin çıktıyı iyileştirdiğini anlamayı zorlaştırır. Prompt; görev tanımı, rol sınırları, girdi biçimi, beklenen çıktı şeması, hata davranışı ve örneklerden oluşan sürümlenebilir bir bileşen gibi ele alınmalıdır.
Her değişiklik için en az şu bilgileri kaydetmek faydalıdır:
- Sürüm numarası, değişiklik özeti ve değişikliğin amacı
- Kullanılan model, erişilebilen araçlar ve ilgili ayarlar
- Girdi veri kümesinin, sistem yönergelerinin ve varsa RAG indeksinin sürümü
- Beklenen çıktı biçimi, kabul kriterleri ve bilinen sınırlamalar
- Önceki sürüme göre gözlenen iyileşme, gerileme ve maliyet etkisi
Değerlendirme Seti ve Görev Özel Ölçütler
Prompt kalitesini birkaç başarılı örnekle ölçmek güvenilir değildir. Gerçek kullanım çeşitliliğini temsil eden küçük ama dengeli bir değerlendirme seti hazırlanmalıdır. Set; normal girdilerin yanında eksik bilgi, çelişkili talep, yazım hatası, uzun bağlam, kötü biçimlendirilmiş belge ve sınır durumlarını da içermelidir. Test verisi üretim verisinden seçiliyorsa kişisel veya gizli bilgiler ayrıştırılmalı, veri kullanım amacı açıkça tanımlanmalıdır.
Her görev için başarı ölçütü farklı olabilir:
- Sınıflandırmada doğru etiket, kabul edilebilir alternatifler ve düşük güven durumunun işaretlenmesi
- Yapılandırılmış çıktıda ayrıştırılabilir JSON, zorunlu alanlar, veri türleri ve değer aralıkları
- Özetlemede ana bilgilerin korunması, kaynakta bulunmayan ayrıntıların eklenmemesi ve kapsam dengesi
- Soru-cevapta verilen bağlama bağlılık, kaynak gösterimi ve bilgi yetersizse bunu açıkça belirtme
- İçerik üretiminde ton, hedef kitle, özgünlük, telif ve güvenlik kısıtlarına uyum
RAG ve Agent Akışlarını Ayrı Değerlendirmek
RAG kullanan bir sistemde yalnızca son yanıtı puanlamak yeterli değildir. Getirilen parçaların soruyla ilgili olup olmadığı, gerekli bilgiyi kapsayıp kapsamadığı ve kaynak sırasının sonucu etkileyip etkilemediği ayrıca incelenmelidir. Yanıt doğru görünse bile yanlış veya ilgisiz bir belgeye dayanıyorsa sistemin güvenilirliği düşer. Bu nedenle erişim, bağlam kullanımı ve nihai yanıt için ayrı ölçütler tanımlanmalıdır.
Agent sistemlerinde de planlama, araç seçimi, araç argümanları, hata sonrası toparlanma ve durma koşulları izlenmelidir. Bir aracın gereksiz yere çağrılması gecikme ve maliyeti artırabilir; hatalı araç parametresi ise yanlış veri güncellemesine yol açabilir. Kritik işlemlerde onay adımı, izin sınırı, tekrar deneme limiti ve güvenli geri dönüş davranışı bulunmalıdır. Model veya araç sağlayıcısının belirli bir özelliği doğrulanmadıkça kesin bir yetenek gibi yazılmamalı; davranış testlerle gözlemlenmelidir.
Otomatik ve İnsan Değerlendirmesini Birleştirmek
Otomatik kontroller hızlı ve tekrarlanabilirdir. JSON ayrıştırma, zorunlu alan kontrolü, uzunluk sınırı, yasaklı kalıp taraması, beklenen etiket doğrulaması ve kaynak kimliği kontrolü kodla yapılabilir. Basit bir akış şöyle modellenebilir:
çıktı = model(prompt, girdi)
şema_geçerli = json_ayrıştırılabilir(çıktı)
alanlar_tamam = zorunlu_alanlar_var(çıktı)
kaynak_kontrolü = yanıt_kaynakla_uyumlu(çıktı, bağlam)
sonuç = şema_geçerli and alanlar_tamam and kaynak_kontrolüAnlam doğruluğu, bağlama uygunluk, üslup veya ikna edicilik gibi ölçütlerde insan incelemesi gerekebilir. Değerlendiriciler için puanlama ölçütleri, olumlu-olumsuz örnekler ve “kararsız” seçeneği hazırlanmalıdır. Küçük bir kalibrasyon turunda anlaşmazlıklar ölçülerek kriterler güncellenebilir.
Bir modelin başka bir modeli puanlaması hızlı bir filtre olarak kullanılabilir; ancak bağımsız bir gerçeklik ölçümü değildir. Değerlendirici model biçimsel düzgünlüğe aşırı önem verebilir veya olgusal hatayı kaçırabilir. Kritik iş akışlarında görev özel doğrulamalar, insan örneklemesi ve otomatik skor birlikte kullanılmalıdır.
Yayına Alma, Gözlemlenebilirlik ve Geri Alma
Yeni sürüm eski test setinde daha iyi görünürken daha önce çalışan bir davranışı bozabilir. Bu nedenle karşılaştırmalı test, kritik örneklerde gerileme analizi ve kademeli dağıtım uygulanmalıdır. Üretimde en azından prompt sürümü, model kimliği, araç çağrıları, gecikme, token veya kullanım maliyeti, hata türü ve insan geri bildirimi izlenmelidir. Hassas girdiler kaydediliyorsa maskeleme ve erişim kontrolü uygulanmalıdır.
Yayına almadan önce şu sorular yanıtlanmalıdır:
- Önceki sürümle karşılaştırmalı test yapıldı mı?
- Kritik örneklerde gerileme veya yeni bir hata türü var mı?
- RAG erişimi ve agent araç çağrıları ayrı ayrı doğrulandı mı?
- Uzun girdilerde maliyet ve gecikme ölçüldü mü?
- Belirsiz veya yetersiz bilgi geldiğinde sistem bunu açıkça belirtiyor mu?
- Kademeli dağıtım, izleme ve geri alma planı hazır mı?