BENCHMARK RUNNER — modele × Open PL Suite

Wrzuć model, dostań wyniki

PROTOTYP

// runner GPU w drodze — na razie zgłoś model na Discordzie

ModelGeneratywnyMCQGuardyDataSuite
11B · instruct
81.6+1.978.3+1.72026-06-19open-pl-v1
9B · adapter · qwen35_9b_dpo_balanced_v1_after_sft_cpt500_lora
80.8+1.179.1+2.52026-06-19open-pl-v1
9B · base
79.776.62026-06-19open-pl-v1

Tylko benchmarki na publicznych datasetach. Ranking wg agregatu generatywnego (oficjalna miara jakości), Δ liczone vs Qwen3.5-9B. Dwa protokoły — generatywny (exact_match) i MCQ (acc) — są niezależne i nieporównywalne między sobą. metodologia →
⚠ Liczby bazy (Qwen3.5-9B) i Bielika oraz guardów EN to dane poglądowe — placeholder do czasu realnego runu na GPU. Liczby kandydata pochodzą z realnego pomiaru.