diff --git a/docs/faz1-tasarim.md b/docs/faz1-tasarim.md index 0c7cefa..ab3a1a9 100644 --- a/docs/faz1-tasarim.md +++ b/docs/faz1-tasarim.md @@ -637,6 +637,8 @@ Dikkat gerektiren görevler: Kolay görev işareti (karar 3: işaretle, çıkarma): kural = DeepSeek ≥ 95 ve ≤ 20 araç çağrısı, uygulama görevi. 39 aday, liste `tasks_gen/eval/easy_candidates.json` (C 9, E 7, F 5, A 4, G 4, K 4, D 3, I 2, B 1). Aday kalır; Qwen baseline (25 görev) ile doğrulanır, DeepSeek ile ikisi de yüksekse "kolay" olur. +G0181 (K, W7B rerun, 0 puan, hidden 0/6): neden bulundu. Model ALV çıktı tablosunda `int8` kullandı; gizli testlerde `CL_SALV_BS_DDIC` `CREATE_DATA_UNKNOWN_TYPE` ile düşüyor, 6 test de aynı hatayla. Spec ALV'yi koruyor (düzeltme çalıştı), hata model tercihi (sütun tipi). Görev geçerli; K değerlendirmesinde gerçek bir beceri farkı (SALV ile uyumlu tip seçimi). Başka W7B sonuçları: G0107 85 (G2 düzeltmesi çalıştı), G0173/G0175/G0177 H durdu (100), G0191 100, G0162 yine 0 (rerun kuyruğunda). + Bulgu (proxy): `sap_inactive_objects` başka koşunun nesnesini gösteriyor (`Z0FFK001_IBAN_VALIDATOR`, G0176 koşusunda): ön ek filtresi bu araçta yok ve A4H'de etkin olmayan bir artık nesne duruyor. Proxy düzeltmesi ve temizlik model koşusu/A4H değişikliği, baseline sonrası. ## 12. Açık sorular diff --git a/tasks_gen/eval/G0107/empirical.json b/tasks_gen/eval/G0107/empirical.json index d44f7db..1596e99 100644 --- a/tasks_gen/eval/G0107/empirical.json +++ b/tasks_gen/eval/G0107/empirical.json @@ -14,5 +14,21 @@ "seconds": 162.0, "run_dir": "runs/emp/10025_G0107_llm_deepseek-v4.1-flash_cloud" } + }, + "deepseek-v4.1-flash:cloud": { + "score": 85.0, + "parts": { + "correctness": 40.0, + "craft": 20.0, + "clean": 15.0, + "own_tests": 0.0, + "discipline": 10.0, + "total": 85.0, + "note": "own_tests: faulty-reference part not implemented in skeleton" + }, + "hidden": "10/10", + "tool_calls": 18, + "seconds": 141.2, + "run_dir": "runs/emp/18011_G0107_llm_deepseek-v4.1-flash_cloud" } } \ No newline at end of file diff --git a/tasks_gen/eval/G0181/empirical.json b/tasks_gen/eval/G0181/empirical.json index 88a02ee..5cf9950 100644 --- a/tasks_gen/eval/G0181/empirical.json +++ b/tasks_gen/eval/G0181/empirical.json @@ -13,5 +13,18 @@ "seconds": 55.8, "run_dir": "runs/emp/12008_G0181_llm_deepseek-v4.1-flash_cloud" } + }, + "deepseek-v4.1-flash:cloud": { + "score": 0, + "parts": { + "total": 0, + "failed_gates": [ + "G3_hidden_runs" + ] + }, + "hidden": "0/6", + "tool_calls": 58, + "seconds": 318.1, + "run_dir": "runs/emp/18012_G0181_llm_deepseek-v4.1-flash_cloud" } } \ No newline at end of file diff --git a/tasks_gen/eval/G0191/empirical.json b/tasks_gen/eval/G0191/empirical.json index 6917036..a67c670 100644 --- a/tasks_gen/eval/G0191/empirical.json +++ b/tasks_gen/eval/G0191/empirical.json @@ -16,5 +16,21 @@ "seconds": 87.0, "run_dir": "runs/emp/12000_G0191_llm_deepseek-v4.1-flash_cloud" } + }, + "deepseek-v4.1-flash:cloud": { + "score": 100.0, + "parts": { + "correctness": 40.0, + "craft": 20.0, + "clean": 15.0, + "own_tests": 15.0, + "discipline": 10.0, + "total": 100.0, + "note": "own_tests: faulty-reference part not implemented in skeleton" + }, + "hidden": "12/12", + "tool_calls": 24, + "seconds": 181.8, + "run_dir": "runs/emp/18010_G0191_llm_deepseek-v4.1-flash_cloud" } } \ No newline at end of file