Files
abap-llm/docs/eval-spotcheck-new-kinds.md

3.6 KiB
Raw Blame History

Eval seti: yeni türler için slot planı ve Kral'ın kontrol sayfası

Durum: hazırlık (2026-10-06). Üretim 12 Ekim sıfırlamasından sonra, eğitim görevlerinden önce (docs/restart-12-oktober.md, adım 0). Amaç: eğitimden sonra INTF, TABL, STRU, MSAG ve istisna sınıfı görevlerini ölçebilmek. Şu an eval adaylarında (130 kabul) sadece CLAS, FUNC, DDLS, PROG var.

1. Slotlar (python3 -m harness.evalset plan-new)

Eğitim karışımıyla aynı paylar (110 görevlik sette INTF 8, TABL 9, STRU 2, MSAG 3, istisna 3); %30 fazla aday, çünkü ret ve ampirik süzgeç göreve göre eler.

tür kategori slot kimlikler not
INTF A 10 G0200–G0209 arayüz: sabitler, tipler, metotlar; gizli test arayüzü uygulayan yerel sınıf kullanır
TABL B 11 G0210–G0220 tablo: alanlar, anahtar, not null; gizli test RTTI + cl_osql_test_environment
STRU B 3 G0221–G0223 yapı: alanlar, tipler; RTTI
MSAG D 4 G0224–G0227 mesaj sınıfı: numara, metin, yer tutucu; MESSAGE ... INTO
istisna (CLAS) D 4 G0228–G0231 CX_ sınıfı: öznitelik, metin, zincir
K (serbest metin) K 5 G0232–G0236 INTF 1, TABL 2, MSAG 1, istisna 1; evalset run-new-k, tool isimleri EPOD'daki gibi (generic_v0 kullanılmıyor, varsayım: bunu Kral onaylar)

Her ikinci-üçüncü slot zor (zorluk 3). Her slot eğitim havuzuyla örtüşme kontrolünden geçer (eğitimdeki görevlere çok benziyorsa model yeniden yazar). Maliyet tahmini: 32 slot x yaklaşık 0,15 ledger = 5 ledger, yaklaşık 2 usage; K varyantları 1 ledger'dan az.

2. Otomatik kapılar (Claude, senin işin değil)

oracle 100 ve null 0, mutasyon denetimi (INTF/TABL/STRU/MSAG/istisna için yeni mutantlar), eğitim havuzuyla örtüşme, ampirik süzgeç (DeepSeek ve yerel Qwen: seri A düzeneği eval görevlerini de koşturur), sonra docs/eval-inceleme.md kontrol listesiyle Claude incelemesi (python3 -m harness.review G0200).

3. Senin kontrolün (yaklaşık 10 görev, yaklaşık 45 dakika)

Kimler: Claude'un işaretlediği görevler + her yeni türden 1 örnek (5 görev) + 1 K varyantı. Her görev için python3 -m harness.review <id> tek ekranda spec, sözleşme, gizli test isimleri, mutasyon sonucu ve üretim geçmişini gösterir. Kararın: python3 -m harness.review <id> --set accept|fix|flag|reject --note "...".

Genel sorular (listedeki 1–11): spec belirsiz mi, her kuralın testi var mı, kontrat yeterli mi, zanaat serbest mi, gerçekçi mi, sızıntı var mı. Yeni türlere özel sorular (12–16):

# Soru tür
12 Spec her alanı, uzunluğu, anahtarı ve not-null'ı tek anlamlı veriyor mu? Gizli test bayt/karakter karışıklığına düşmüyor mu (RTTI length bayttır)? TABL, STRU
13 Tablo testi gerçek davranışı ölçüyor mu (aynı anahtarla ikinci INSERT sy-subrc 4), yoksa sadece alan adlarına mı bakıyor? TABL
14 Arayüz testi imza uyuşmazlığını yakalıyor mu (uygulayan yerel sınıf yalnızca imza doğruysa derlenir) ve sabit değerlerini okuyor mu? INTF
15 Mesaj metinleri, numaralar ve yer tutucular spec'te birebir yazılı mı; test MESSAGE ID ... INTO ile son metni mi karşılaştırıyor? MSAG
16 İstisna: öznitelik, metin ve (varsa) önceki istisna zinciri spec'te tanımlı mı; test fırlat-yakala ile ölçüyor mu? Gerçekten "istisna tasarımı" mı gerekiyor? istisna

4. Sonuç tablosu (üretimden sonra doldurulur)

id tür otomatik kapılar Claude incelemesi Kral not