← benchmark runner
SLAYER PROTOCOL · RAPORT RUNbielik-11b-v3

Bielik-11B-v3.0


ADAPTER
HOSTlem (H100)
DATA2026-06-19
SUITEOpen PL Suite v1 · provisional
Generatywny (exact_match)
81.6
+1.9 vs baza
MCQ (acc)
78.3
+1.7 vs baza

// dwa niezależne protokoły — generatywny i MCQ nie są porównywalne między sobą

⚠ dane poglądowe — baza/Bielik oraz guardy EN to placeholder do czasu realnego runu na GPU

EN regresja: OK

Wyniki per zadanie

TaskGeneratywnyΔMCQΔ
psc95.5+0.490.5+0.5
belebele91.0+0.690.2+1.2
dyk86.0+1.886.5+1.5
polemo2_in85.5+2.583.0+0.9
cbd80.1+3.164.0+3.5
8tags79.0+2.176.5+1.5
ppc80.5+1.479.5+2.5
polemo2_out76.5+2.576.0+1.2
klej_ner60.0+2.055.5+2.5
polqa (reranking MC)81.5+1.5
polqa_closed_bookbroken0.0 ±0.0
polqa_open_bookbroken0.0 ±0.0
poquad_open_bookbroken0.0 ±0.0

9 działających zadań w agregacie. Zepsute (3): polqa_closed_book, polqa_open_book, poquad_open_book. Zadania ze statusem renderują się jawnie (0.0), ale są wyłączone z agregatu — transparentność jest cechą, nie błędem.