Files
abap-llm/docs/eval-inceleme.md

3.2 KiB
Raw Blame History

Eval görevi inceleme kontrol listesi

Durum: v1 · 2026-10-03. Adım F'nin üçüncü katmanı (otomatik kapılar ve ampirik süzgeçten sonra). İnceleyen: Claude. İşaretlenen görevler + kategori başına 1 örnek Kral'a gider.

Yardımcı: python3 -m harness.review G0100 görevin spec'ini, sözleşmesini, gizli test isimlerini, mutasyon sonucunu ve üretim geçmişini tek ekranda verir. Sonuç tasks_gen/eval/<id>/review.json'a yazılır.

Kontroller

# Kontrol Sonuç değerleri
1 Spec netliği: her iş kuralı tek anlamlı. Sınır değerleri (eşit, boş, negatif) tanımlı. H dışında açık soru yok. ok / belirsiz
2 Kural–test eşlemesi: her iş kuralı en az bir gizli testle ölçülüyor; her gizli test bir kurala dayanıyor (spec'te olmayan davranış test edilmiyor). ok / eksik test / fazla test
3 Kontrat yeterli: gizli testlerin kullandığı her isim (obje, metot, parametre, tip, eleman) spec'in Contract bölümünde. ok / eksik
4 Zanaat serbest: spec nasıl yapılacağını söylemiyor (tablo tipi, SQL stratejisi, sınıf iç yapısı). ok / ipucu var
5 Gerçekçilik: iş konusu ve büyüklük gerçek bir ABAP işine benziyor; yapay bulmaca değil. ok / yapay
6 Kategori uyumu: görev, kategorinin ölçtüğü beceriyi ölçüyor (ör. D'de exception tasarımı gerçekten gerekli; F'de seed objesi okunmadan çözülemiyor; G'de eski release kısıtı anlamlı). ok / zayıf
7 Mutasyon: mutation.json ok; hayatta kalan mutant varsa gerçek bir test boşluğu mu? ok / boşluk
8 Sızıntı: spec veya seed referans çözümü ele vermiyor (kod parçası, yöntem adımları). ok / sızıntı
9 H görevleri: eksik gerçekten kritik (tahminle çözülemez); expected_gap açıklaması doğru; anahtar kelime grupları yanlış bir nedenle duran raporu kabul etmiyor. ok / zayıf
10 K görevleri: serbest metin bütün kuralları ve tüm sözleşme isimlerini koruyor; temel görevle aynı gizli testler geçerli. ok / kayıp
11 Tekrar: başka bir eval görevine çok benziyor mu (aynı iş konusu ve aynı kurallar)? ok / tekrar

Karar

  • kabul: tüm kontroller ok.
  • düzelt: küçük, açık bir düzeltme (spec cümlesi, test adı, eksik test). Düzeltmeden sonra oracle/null/mutasyon tekrar koşulur; generation.json'a manual_fix adımı yazılır.
  • işaretle (Kral): karar Claude'un tek başına vereceği bir şey değil (gerçekçilik, kategori uyumu tartışmalı, H eksiği tartışmalı).
  • ret: 2, 3 veya 8'de büyük sorun; düzeltme görevi yeniden yazmak demek.

Eval görevleri eğitim verisine girmez; Claude'un yaptığı düzeltmeler de sadece eval setinde kalır.

Durum (2026-10-03)

  • 113 kabul edilen görev; 4 ret (G0009 G0013 G0016 G0023, yerine G0188–G0191). Hepsi incelendi (harness.review --list: incelenmemiş yok).
  • Rastgele yüksek puan kontrolü (karar 2): 10 görev, hepsi kabul. Tohum 20261003.
  • Kolay aday işareti: tasks_gen/eval/easy_candidates.json (39 görev; Qwen baseline ile doğrulanacak).
  • Kral'a gidecek: işaretlenen görev yok; kategori başına 1 örnek seçimi Qwen baseline sonrası.