← benchmark runner
SLAYER PROTOCOL · RAPORT RUNqwen3.5-9b

Qwen3.5-9B


ADAPTER
HOSTlem (H100)
DATA2026-06-19
SUITEOpen PL Suite v1 · provisional
Generatywny (exact_match)
79.7
model bazowy — Δ = 0
MCQ (acc)
76.6
model bazowy — Δ = 0

// dwa niezależne protokoły — generatywny i MCQ nie są porównywalne między sobą

⚠ dane poglądowe — baza/Bielik oraz guardy EN to placeholder do czasu realnego runu na GPU

EN regresja: OK

Wyniki per zadanie

TaskGeneratywnyΔMCQΔ
psc95.190.0
belebele90.489.0
dyk84.285.0
polemo2_in83.082.1
cbd77.060.5
8tags76.975.0
ppc79.177.0
polemo2_out74.074.8
klej_ner58.053.0
polqa (reranking MC)80.0
polqa_closed_bookbroken0.0
polqa_open_bookbroken0.0
poquad_open_bookbroken0.0

9 działających zadań w agregacie. Zepsute (3): polqa_closed_book, polqa_open_book, poquad_open_book. Zadania ze statusem renderują się jawnie (0.0), ale są wyłączone z agregatu — transparentność jest cechą, nie błędem.