3.6 KiB
Eval seti: yeni türler için slot planı ve Kral'ın kontrol sayfası
Durum: hazırlık (2026-10-06). Üretim 12 Ekim sıfırlamasından sonra, eğitim görevlerinden önce (docs/restart-12-oktober.md, adım 0).
Amaç: eğitimden sonra INTF, TABL, STRU, MSAG ve istisna sınıfı görevlerini ölçebilmek. Şu an eval adaylarında (130 kabul) sadece CLAS, FUNC, DDLS, PROG var.
1. Slotlar (python3 -m harness.evalset plan-new)
Eğitim karışımıyla aynı paylar (110 görevlik sette INTF 8, TABL 9, STRU 2, MSAG 3, istisna 3); %30 fazla aday, çünkü ret ve ampirik süzgeç göreve göre eler.
| tür | kategori | slot | kimlikler | not |
|---|---|---|---|---|
| INTF | A | 10 | G0200–G0209 | arayüz: sabitler, tipler, metotlar; gizli test arayüzü uygulayan yerel sınıf kullanır |
| TABL | B | 11 | G0210–G0220 | tablo: alanlar, anahtar, not null; gizli test RTTI + cl_osql_test_environment |
| STRU | B | 3 | G0221–G0223 | yapı: alanlar, tipler; RTTI |
| MSAG | D | 4 | G0224–G0227 | mesaj sınıfı: numara, metin, yer tutucu; MESSAGE ... INTO |
| istisna (CLAS) | D | 4 | G0228–G0231 | CX_ sınıfı: öznitelik, metin, zincir |
| K (serbest metin) | K | 5 | G0232–G0236 | INTF 1, TABL 2, MSAG 1, istisna 1; evalset run-new-k, tool isimleri EPOD'daki gibi (generic_v0 kullanılmıyor, varsayım: bunu Kral onaylar) |
Her ikinci-üçüncü slot zor (zorluk 3). Her slot eğitim havuzuyla örtüşme kontrolünden geçer (eğitimdeki görevlere çok benziyorsa model yeniden yazar). Maliyet tahmini: 32 slot x yaklaşık 0,15 ledger = 5 ledger, yaklaşık 2 usage; K varyantları 1 ledger'dan az.
2. Otomatik kapılar (Claude, senin işin değil)
oracle 100 ve null 0, mutasyon denetimi (INTF/TABL/STRU/MSAG/istisna için yeni mutantlar), eğitim havuzuyla örtüşme, ampirik süzgeç (DeepSeek ve yerel Qwen: seri A düzeneği eval görevlerini de koşturur),
sonra docs/eval-inceleme.md kontrol listesiyle Claude incelemesi (python3 -m harness.review G0200).
3. Senin kontrolün (yaklaşık 10 görev, yaklaşık 45 dakika)
Kimler: Claude'un işaretlediği görevler + her yeni türden 1 örnek (5 görev) + 1 K varyantı. Her görev için python3 -m harness.review <id> tek ekranda spec, sözleşme, gizli test isimleri, mutasyon sonucu ve üretim geçmişini gösterir.
Kararın: python3 -m harness.review <id> --set accept|fix|flag|reject --note "...".
Genel sorular (listedeki 1–11): spec belirsiz mi, her kuralın testi var mı, kontrat yeterli mi, zanaat serbest mi, gerçekçi mi, sızıntı var mı. Yeni türlere özel sorular (12–16):
| # | Soru | tür |
|---|---|---|
| 12 | Spec her alanı, uzunluğu, anahtarı ve not-null'ı tek anlamlı veriyor mu? Gizli test bayt/karakter karışıklığına düşmüyor mu (RTTI length bayttır)? |
TABL, STRU |
| 13 | Tablo testi gerçek davranışı ölçüyor mu (aynı anahtarla ikinci INSERT sy-subrc 4), yoksa sadece alan adlarına mı bakıyor? |
TABL |
| 14 | Arayüz testi imza uyuşmazlığını yakalıyor mu (uygulayan yerel sınıf yalnızca imza doğruysa derlenir) ve sabit değerlerini okuyor mu? | INTF |
| 15 | Mesaj metinleri, numaralar ve yer tutucular spec'te birebir yazılı mı; test MESSAGE ID ... INTO ile son metni mi karşılaştırıyor? |
MSAG |
| 16 | İstisna: öznitelik, metin ve (varsa) önceki istisna zinciri spec'te tanımlı mı; test fırlat-yakala ile ölçüyor mu? Gerçekten "istisna tasarımı" mı gerekiyor? | istisna |
4. Sonuç tablosu (üretimden sonra doldurulur)
| id | tür | otomatik kapılar | Claude incelemesi | Kral | not |
|---|---|---|---|---|---|