← benchmark runner
SLAYER PROTOCOL · RAPORT RUNqwen3.5-9b-balanced-v1-dpo

Qwen3.5-9B-Base + balanced_v1 DPO


ADAPTERqwen35_9b_dpo_balanced_v1_after_sft_cpt500_lora
HOSTlem (H100)
DATA2026-06-19
SUITEOpen PL Suite v1 · provisional
Generatywny (exact_match)
80.8
+1.1 vs baza
MCQ (acc)
79.1
+2.5 vs baza

// dwa niezależne protokoły — generatywny i MCQ nie są porównywalne między sobą

⚠ dane poglądowe — baza/Bielik oraz guardy EN to placeholder do czasu realnego runu na GPU

EN regresja: OK

Wyniki per zadanie

TaskGeneratywnyΔMCQΔ
psc96.9+1.891.2+1.2
belebele89.9−0.589.6+0.6
dyk87.5+3.388.1+3.1
polemo2_in86.7+3.784.8+2.7
cbd79.4+2.463.0+2.5
8tags78.3+1.477.6+2.6
ppc78.2−0.978.7+1.7
polemo2_out75.7+1.775.9+1.1
klej_ner54.7−3.350.9−2.1
polqa (reranking MC)82.7+2.7
polqa_closed_bookbroken0.0 ±0.0
polqa_open_bookbroken0.0 ±0.0
poquad_open_bookbroken0.0 ±0.0

9 działających zadań w agregacie. Zepsute (3): polqa_closed_book, polqa_open_book, poquad_open_book. Zadania ze statusem renderują się jawnie (0.0), ale są wyłączone z agregatu — transparentność jest cechą, nie błędem.