Files
abap-llm/docs/eval-inceleme.md
Kral 3550f0b651 Eval review v1: checklist, review helper, 24 tasks reviewed; G0002/G0022 tests fixed; I/E generator definitions
- docs/eval-inceleme.md checklist; harness/review.py
- 19 accept, 1 fix pending (G0019), 4 flagged (I/E tasks solvable without legacy code)
- generator: categories I and E fix/refactor the seed object in place

Co-Authored-By: Claude Opus 5.5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_014aUaQeLnwbb1zTpN7kHeat
2026-10-03 06:23:38 +02:00

2.7 KiB
Raw Blame History

Eval görevi inceleme kontrol listesi

Durum: v1 · 2026-10-03. Adım F'nin üçüncü katmanı (otomatik kapılar ve ampirik süzgeçten sonra). İnceleyen: Claude. İşaretlenen görevler + kategori başına 1 örnek Kral'a gider.

Yardımcı: python3 -m harness.review G0100 görevin spec'ini, sözleşmesini, gizli test isimlerini, mutasyon sonucunu ve üretim geçmişini tek ekranda verir. Sonuç tasks_gen/eval/<id>/review.json'a yazılır.

Kontroller

# Kontrol Sonuç değerleri
1 Spec netliği: her iş kuralı tek anlamlı. Sınır değerleri (eşit, boş, negatif) tanımlı. H dışında açık soru yok. ok / belirsiz
2 Kural–test eşlemesi: her iş kuralı en az bir gizli testle ölçülüyor; her gizli test bir kurala dayanıyor (spec'te olmayan davranış test edilmiyor). ok / eksik test / fazla test
3 Kontrat yeterli: gizli testlerin kullandığı her isim (obje, metot, parametre, tip, eleman) spec'in Contract bölümünde. ok / eksik
4 Zanaat serbest: spec nasıl yapılacağını söylemiyor (tablo tipi, SQL stratejisi, sınıf iç yapısı). ok / ipucu var
5 Gerçekçilik: iş konusu ve büyüklük gerçek bir ABAP işine benziyor; yapay bulmaca değil. ok / yapay
6 Kategori uyumu: görev, kategorinin ölçtüğü beceriyi ölçüyor (ör. D'de exception tasarımı gerçekten gerekli; F'de seed objesi okunmadan çözülemiyor; G'de eski release kısıtı anlamlı). ok / zayıf
7 Mutasyon: mutation.json ok; hayatta kalan mutant varsa gerçek bir test boşluğu mu? ok / boşluk
8 Sızıntı: spec veya seed referans çözümü ele vermiyor (kod parçası, yöntem adımları). ok / sızıntı
9 H görevleri: eksik gerçekten kritik (tahminle çözülemez); expected_gap açıklaması doğru; anahtar kelime grupları yanlış bir nedenle duran raporu kabul etmiyor. ok / zayıf
10 K görevleri: serbest metin bütün kuralları ve tüm sözleşme isimlerini koruyor; temel görevle aynı gizli testler geçerli. ok / kayıp
11 Tekrar: başka bir eval görevine çok benziyor mu (aynı iş konusu ve aynı kurallar)? ok / tekrar

Karar

  • kabul: tüm kontroller ok.
  • düzelt: küçük, açık bir düzeltme (spec cümlesi, test adı, eksik test). Düzeltmeden sonra oracle/null/mutasyon tekrar koşulur; generation.json'a manual_fix adımı yazılır.
  • işaretle (Kral): karar Claude'un tek başına vereceği bir şey değil (gerçekçilik, kategori uyumu tartışmalı, H eksiği tartışmalı).
  • ret: 2, 3 veya 8'de büyük sorun; düzeltme görevi yeniden yazmak demek.

Eval görevleri eğitim verisine girmez; Claude'un yaptığı düzeltmeler de sadece eval setinde kalır.