// runner GPU w drodze — na razie zgłoś model na Discordzie
| Model | Generatywny | MCQ | Guardy | Data | Suite |
|---|---|---|---|---|---|
11B · instruct | 81.6+1.9 | 78.3+1.7 | 2026-06-19 | open-pl-v1 | |
9B · adapter · qwen35_9b_dpo_balanced_v1_after_sft_cpt500_lora | 80.8+1.1 | 79.1+2.5 | 2026-06-19 | open-pl-v1 | |
9B · base | 79.7 | 76.6 | 2026-06-19 | open-pl-v1 |
Tylko benchmarki na publicznych datasetach. Ranking wg agregatu generatywnego (oficjalna miara jakości), Δ liczone vs Qwen3.5-9B. Dwa protokoły — generatywny (exact_match) i MCQ (acc) — są niezależne i nieporównywalne między sobą. metodologia →
⚠ Liczby bazy (Qwen3.5-9B) i Bielika oraz guardów EN to dane poglądowe — placeholder do czasu realnego runu na GPU. Liczby kandydata pochodzą z realnego pomiaru.