Evaluation & Observability
Golden dataset, rubric, model tabanlı değerlendirme, insan review, regression, trace ve kalite–maliyet–gecikme dengesini kurun.
Ölçemediğiniz AI davranışını güvenle iyileştiremez, değiştiremez veya üretimde yönetemezsiniz.
01Kaliteyi operasyonel tanımlamak
02Eval seti oluşturmak
03Regression gate kurmak
04Trace ve maliyet izlemek
Kanıtlı kalite
Demo etkisinden üretim güvenine
Birkaç iyi örnek sistemin iyi olduğunu göstermez. Evaluation, beklenen kullanım dağılımını temsil eden örneklerde davranışı ölçer; observability ise üretimde ne olduğunu görmenizi sağlar.
AI kalitesi tek bir doğruluk puanı değildir. Göreve göre kaynak bağlılığı, tamlık, güvenlik, ton, araç başarısı, gecikme ve maliyet birlikte değerlendirilir. Ölçüm, prompt veya model değişikliğinden önce tanımlanmalıdır.
İyi ve kabul edilemez davranışı yaz
Gerçek dağılımı temsil eden vakaları seç
Test, rubric, model ve insanı birleştir
Değişikliği baseline ile karşılaştır
Üretim drift ve incident sinyallerini izle
Tasarım modeli
SCORE değerlendirme sistemi
Metrikleri iş sonucu ve riskle birlikte tasarlayın.
Success
Kullanıcı hangi işi başarıyla tamamlıyor?
Doğru çözüm kuyruğuna yönlendirmeCoverage
Hangi vaka türleri testte temsil ediliyor?
Normal, sınır, saldırı ve eksik veriObjective checks
Hangi test deterministik yapılabilir?
JSON şema, kaynak varlığı, tool sonucuRubric
Yargı gerektiren kalite nasıl puanlanır?
Doğruluk, tamlık, uygulanabilirlikEconomics
Kalite artışı maliyet ve gecikmeye değer mi?
Vaka başı maliyet ve p95 süreUygulamalı örnek
Prompt değişikliği için release gate
Yeni prompt'u yalnızca örnek cevaplara bakarak değil, test paketiyle karşılaştırın.
EVALUATION SUITE: support-routing-v3 DATASET: - 120 anonimleştirilmiş gerçek vaka - 30 sınır/eksik bilgi vakası - 20 prompt injection ve politika ihlali vakası DETERMINISTIC CHECKS: - Çıktı JSON şemasına uyuyor - intent izinli sınıflardan biri - Hassas veri çıktıda tekrar edilmiyor RUBRIC (1–5): - Niyet doğruluğu - Özetin kaynak mesaja bağlılığı - Eskalasyon gerekçesinin kalitesi RELEASE GATE: - Kritik güvenlik ihlali = 0 - Routing doğruluğu baseline'dan düşük değil - p95 gecikme +%15'i geçmiyor - Vaka başı maliyet belirlenen bütçe içinde Her başarısız vaka için trace, model, prompt sürümü ve hata sınıfını kaydet.
01Gerçek, sınır ve saldırı vakalarını ayırır
02Deterministik ve yargısal ölçümü birleştirir
03Kalite yanında maliyet ve gecikme sınırı koyar
04Başarısız örneği trace ile teşhis edilebilir kılar
Tekrar kullanılabilir yapılar
Pattern kataloğu
Referans vaka seti
Temsil edici girdileri ve beklenen özellikleri sürümlü test varlığına dönüştürür.
İyi kullanım · Prompt ve model değişiklikleriKriter bazlı puanlama
Öznel kaliteyi tanımlı ölçek ve örneklerle ölçer.
İyi kullanım · Özet, analiz ve içerikİkili karşılaştırma
İki aday çıktıyı doğrudan kıyaslayarak mutlak skor belirsizliğini azaltır.
İyi kullanım · Model ve prompt seçimiÜretim izleme
Gerçek trafikte drift, hata, maliyet ve kullanıcı geri bildirimini takip eder.
İyi kullanım · Canlı AI servisleriSektörel uygulama
İş sonucu merkezli use case’ler
Hedef: Yanıtın doğru, kaynaklı ve çözücü olmasını ölçmek
Bağlam: Gerçek talepler ve onaylı bilgi
Kontrol: Hassas bilgi ve yanlış işlem testi
Değer hipotezi · Güvenli otomasyon oranını artırmakHedef: Model değişiminde bulgu kalitesini korumak
Bağlam: Geçmiş rapor ve uzman rubric'i
Kontrol: Rakam ve kaynak eşleşmesi
Değer hipotezi · Değişiklik riskini azaltmakHedef: Görev başarısı ve yan etkiyi ölçmek
Bağlam: Repo görevleri, testler ve diff
Kontrol: Güvenlik ve kapsam ihlali
Değer hipotezi · Model routing'i kanıta bağlamakEnterprise AIX
Üretim kontrolleri
Uygulama laboratuvarı
İlk golden dataset'inizi oluşturun
İlk golden dataset'inizi oluşturun
Sık kullanılan bir AI görevinden 25 temsil edici vaka seçin.
- 01Segmentleri belirle
Normal, zor, eksik veri ve politika vakalarını ayırın.
- 02Beklentiyi yaz
Tam metin yerine doğru çıktının özelliklerini tanımlayın.
- 03Deterministik test ekle
Format, kaynak ve yasaklı davranışı otomatik kontrol edin.
- 04Rubric kalibre et
İnsanların aynı örneklerde benzer puan verdiğini doğrulayın.
- 05Release gate koy
Hangi düşüşte yayının engelleneceğini belirleyin.
Bilgi kontrolü
Kavramı yerine oturtun
01Golden cevap her zaman tek bir metin olmak zorunda mı?
Hayır. Olasılıksal görevlerde beklenen özellikler, kabul edilen aralıklar ve yasak davranışlar daha sağlıklı olabilir.
02Offline eval neden tek başına yetmez?
Gerçek kullanıcı dağılımı, entegrasyon hataları, drift ve iş sonucu yalnızca üretim gözlemiyle ortaya çıkabilir.
03Maliyet neden eval metriğidir?
Aynı kaliteyi gereksiz bağlam veya turla üretmek ölçeklenebilir değildir; değer kalite–maliyet–gecikme dengesiyle ölçülür.