- docs/eval-inceleme.md checklist; harness/review.py - 19 accept, 1 fix pending (G0019), 4 flagged (I/E tasks solvable without legacy code) - generator: categories I and E fix/refactor the seed object in place Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_014aUaQeLnwbb1zTpN7kHeat
2.7 KiB
2.7 KiB
Eval görevi inceleme kontrol listesi
Durum: v1 · 2026-10-03. Adım F'nin üçüncü katmanı (otomatik kapılar ve ampirik süzgeçten sonra). İnceleyen: Claude. İşaretlenen görevler + kategori başına 1 örnek Kral'a gider.
Yardımcı: python3 -m harness.review G0100 görevin spec'ini, sözleşmesini, gizli test isimlerini, mutasyon sonucunu ve üretim geçmişini tek ekranda verir. Sonuç tasks_gen/eval/<id>/review.json'a yazılır.
Kontroller
| # | Kontrol | Sonuç değerleri |
|---|---|---|
| 1 | Spec netliği: her iş kuralı tek anlamlı. Sınır değerleri (eşit, boş, negatif) tanımlı. H dışında açık soru yok. | ok / belirsiz |
| 2 | Kural–test eşlemesi: her iş kuralı en az bir gizli testle ölçülüyor; her gizli test bir kurala dayanıyor (spec'te olmayan davranış test edilmiyor). | ok / eksik test / fazla test |
| 3 | Kontrat yeterli: gizli testlerin kullandığı her isim (obje, metot, parametre, tip, eleman) spec'in Contract bölümünde. | ok / eksik |
| 4 | Zanaat serbest: spec nasıl yapılacağını söylemiyor (tablo tipi, SQL stratejisi, sınıf iç yapısı). | ok / ipucu var |
| 5 | Gerçekçilik: iş konusu ve büyüklük gerçek bir ABAP işine benziyor; yapay bulmaca değil. | ok / yapay |
| 6 | Kategori uyumu: görev, kategorinin ölçtüğü beceriyi ölçüyor (ör. D'de exception tasarımı gerçekten gerekli; F'de seed objesi okunmadan çözülemiyor; G'de eski release kısıtı anlamlı). | ok / zayıf |
| 7 | Mutasyon: mutation.json ok; hayatta kalan mutant varsa gerçek bir test boşluğu mu? |
ok / boşluk |
| 8 | Sızıntı: spec veya seed referans çözümü ele vermiyor (kod parçası, yöntem adımları). | ok / sızıntı |
| 9 | H görevleri: eksik gerçekten kritik (tahminle çözülemez); expected_gap açıklaması doğru; anahtar kelime grupları yanlış bir nedenle duran raporu kabul etmiyor. |
ok / zayıf |
| 10 | K görevleri: serbest metin bütün kuralları ve tüm sözleşme isimlerini koruyor; temel görevle aynı gizli testler geçerli. | ok / kayıp |
| 11 | Tekrar: başka bir eval görevine çok benziyor mu (aynı iş konusu ve aynı kurallar)? | ok / tekrar |
Karar
- kabul: tüm kontroller ok.
- düzelt: küçük, açık bir düzeltme (spec cümlesi, test adı, eksik test). Düzeltmeden sonra oracle/null/mutasyon tekrar koşulur;
generation.json'amanual_fixadımı yazılır. - işaretle (Kral): karar Claude'un tek başına vereceği bir şey değil (gerçekçilik, kategori uyumu tartışmalı, H eksiği tartışmalı).
- ret: 2, 3 veya 8'de büyük sorun; düzeltme görevi yeniden yazmak demek.
Eval görevleri eğitim verisine girmez; Claude'un yaptığı düzeltmeler de sadece eval setinde kalır.