Enterprise AIXAI Engineering Resource
AI Engineering Path801/1001
Modül · v1.0
801Uzman75 dakika

Evaluation & Observability

Golden dataset, rubric, model tabanlı değerlendirme, insan review, regression, trace ve kalite–maliyet–gecikme dengesini kurun.

Ölçemediğiniz AI davranışını güvenle iyileştiremez, değiştiremez veya üretimde yönetemezsiniz.
Bu modülün sonunda

01Kaliteyi operasyonel tanımlamak

02Eval seti oluşturmak

03Regression gate kurmak

04Trace ve maliyet izlemek

01

Kanıtlı kalite

Demo etkisinden üretim güvenine

Birkaç iyi örnek sistemin iyi olduğunu göstermez. Evaluation, beklenen kullanım dağılımını temsil eden örneklerde davranışı ölçer; observability ise üretimde ne olduğunu görmenizi sağlar.

AI kalitesi tek bir doğruluk puanı değildir. Göreve göre kaynak bağlılığı, tamlık, güvenlik, ton, araç başarısı, gecikme ve maliyet birlikte değerlendirilir. Ölçüm, prompt veya model değişikliğinden önce tanımlanmalıdır.

01Define

İyi ve kabul edilemez davranışı yaz

02Sample

Gerçek dağılımı temsil eden vakaları seç

03Measure

Test, rubric, model ve insanı birleştir

04Compare

Değişikliği baseline ile karşılaştır

05Monitor

Üretim drift ve incident sinyallerini izle

YAYGIN YANILGITek bir LLM-as-judge skoru kaliteyi kanıtlar.
TASARIM PRENSİBİDeğerlendirme yöntemi, ölçtüğü risk kadar çeşitli ve bağımsız olmalıdır.
02

Tasarım modeli

SCORE değerlendirme sistemi

Metrikleri iş sonucu ve riskle birlikte tasarlayın.

01

Success

Kullanıcı hangi işi başarıyla tamamlıyor?

Doğru çözüm kuyruğuna yönlendirme
02

Coverage

Hangi vaka türleri testte temsil ediliyor?

Normal, sınır, saldırı ve eksik veri
03

Objective checks

Hangi test deterministik yapılabilir?

JSON şema, kaynak varlığı, tool sonucu
04

Rubric

Yargı gerektiren kalite nasıl puanlanır?

Doğruluk, tamlık, uygulanabilirlik
05

Economics

Kalite artışı maliyet ve gecikmeye değer mi?

Vaka başı maliyet ve p95 süre
03

Uygulamalı örnek

Prompt değişikliği için release gate

Yeni prompt'u yalnızca örnek cevaplara bakarak değil, test paketiyle karşılaştırın.

801_801-EVALUATION-OBSERVABILITY.md
EVALUATION SUITE: support-routing-v3

DATASET:
- 120 anonimleştirilmiş gerçek vaka
- 30 sınır/eksik bilgi vakası
- 20 prompt injection ve politika ihlali vakası

DETERMINISTIC CHECKS:
- Çıktı JSON şemasına uyuyor
- intent izinli sınıflardan biri
- Hassas veri çıktıda tekrar edilmiyor

RUBRIC (1–5):
- Niyet doğruluğu
- Özetin kaynak mesaja bağlılığı
- Eskalasyon gerekçesinin kalitesi

RELEASE GATE:
- Kritik güvenlik ihlali = 0
- Routing doğruluğu baseline'dan düşük değil
- p95 gecikme +%15'i geçmiyor
- Vaka başı maliyet belirlenen bütçe içinde

Her başarısız vaka için trace, model, prompt sürümü ve hata sınıfını kaydet.
NEDEN ÇALIŞIR?

01Gerçek, sınır ve saldırı vakalarını ayırır

02Deterministik ve yargısal ölçümü birleştirir

03Kalite yanında maliyet ve gecikme sınırı koyar

04Başarısız örneği trace ile teşhis edilebilir kılar

04

Tekrar kullanılabilir yapılar

Pattern kataloğu

GOLDEN DATASET

Referans vaka seti

Temsil edici girdileri ve beklenen özellikleri sürümlü test varlığına dönüştürür.

İyi kullanım · Prompt ve model değişiklikleri
RUBRIC EVAL

Kriter bazlı puanlama

Öznel kaliteyi tanımlı ölçek ve örneklerle ölçer.

İyi kullanım · Özet, analiz ve içerik
PAIRWISE

İkili karşılaştırma

İki aday çıktıyı doğrudan kıyaslayarak mutlak skor belirsizliğini azaltır.

İyi kullanım · Model ve prompt seçimi
ONLINE MONITORING

Üretim izleme

Gerçek trafikte drift, hata, maliyet ve kullanıcı geri bildirimini takip eder.

İyi kullanım · Canlı AI servisleri
05

Sektörel uygulama

İş sonucu merkezli use case’ler

Çağrı MerkeziÇözüm kalitesi eval'i

Hedef: Yanıtın doğru, kaynaklı ve çözücü olmasını ölçmek

Bağlam: Gerçek talepler ve onaylı bilgi

Kontrol: Hassas bilgi ve yanlış işlem testi

Değer hipotezi · Güvenli otomasyon oranını artırmak
FinansRapor analizi regression'ı

Hedef: Model değişiminde bulgu kalitesini korumak

Bağlam: Geçmiş rapor ve uzman rubric'i

Kontrol: Rakam ve kaynak eşleşmesi

Değer hipotezi · Değişiklik riskini azaltmak
YazılımKod agent benchmark'ı

Hedef: Görev başarısı ve yan etkiyi ölçmek

Bağlam: Repo görevleri, testler ve diff

Kontrol: Güvenlik ve kapsam ihlali

Değer hipotezi · Model routing'i kanıta bağlamak
06

Enterprise AIX

Üretim kontrolleri

Kontrol alanıSorulacak soruBeklenen önlem
TemsilEval seti gerçek trafiği temsil ediyor mu?Segment ve edge-case kapsamı
SızıntıModel test cevaplarını öğrenmiş olabilir mi?Taze ve gizli holdout set
Judge biasDeğerlendirici model tercihi sonucu etkiliyor mu?Kalibrasyon ve insan örneği
RegressionYeni kalite eski yeteneği bozuyor mu?Sürüm karşılaştırma gate'i
TelemetryHata hangi adımda oluştu?Uçtan uca trace ve event
PrivacyLog ve dataset hassas veri içeriyor mu?Anonimleştirme ve retention
07

Uygulama laboratuvarı

İlk golden dataset'inizi oluşturun

UYGULAMA

İlk golden dataset'inizi oluşturun

Sık kullanılan bir AI görevinden 25 temsil edici vaka seçin.

  1. 01
    Segmentleri belirle

    Normal, zor, eksik veri ve politika vakalarını ayırın.

  2. 02
    Beklentiyi yaz

    Tam metin yerine doğru çıktının özelliklerini tanımlayın.

  3. 03
    Deterministik test ekle

    Format, kaynak ve yasaklı davranışı otomatik kontrol edin.

  4. 04
    Rubric kalibre et

    İnsanların aynı örneklerde benzer puan verdiğini doğrulayın.

  5. 05
    Release gate koy

    Hangi düşüşte yayının engelleneceğini belirleyin.

TAMAMLAMA KONTROLÜ
08

Bilgi kontrolü

Kavramı yerine oturtun

01Golden cevap her zaman tek bir metin olmak zorunda mı?

Hayır. Olasılıksal görevlerde beklenen özellikler, kabul edilen aralıklar ve yasak davranışlar daha sağlıklı olabilir.

02Offline eval neden tek başına yetmez?

Gerçek kullanıcı dağılımı, entegrasyon hataları, drift ve iş sonucu yalnızca üretim gözlemiyle ortaya çıkabilir.

03Maliyet neden eval metriğidir?

Aynı kaliteyi gereksiz bağlam veya turla üretmek ölçeklenebilir değildir; değer kalite–maliyet–gecikme dengesiyle ölçülür.