Tabela benchmarków, na których raportowano wyniki modeli z rodziny Bielik, wraz ze statusem dostępności, linkiem do ewaluatora, linkiem do danych oraz źródłem potwierdzającym ewaluację Bielika.
| Status | Znaczenie |
|---|---|
open |
Dane i/lub harness są publiczne, więc benchmark można praktycznie pobrać i uruchomić. |
partial |
Część benchmarku jest publiczna, ale pełna reprodukcja może zależeć od dodatkowej konfiguracji, modelu-sędziego, subsetu albo niedostępnego elementu. |
closed |
Nie znaleziono publicznych danych/testów/scoringu pozwalających samodzielnie przeliczyć wynik. |
archived |
Benchmark albo leaderboard jest publiczny, ale archiwalny lub nieutrzymywany. |
| Benchmark | Kategoria | Model | Wynik/Maks | Ewaluator | Dane | Źródło |
|---|---|---|---|---|---|---|
| Open PL LLM Leaderboard | open | Bielik-11B-v3.0-Instruct | 65.93 / 100 | ewaluator | dane / taski | raport |
| Polish MT-Bench | partial | Bielik-11B-v2.3-Instruct | 8.56 / 10 | ewaluator | dane | raport |
| Polish EQ-Bench | closed | Bielik-11B-v3.0-Instruct | 71.20 / 100 | ewaluator | N/A | raport |
| CPTU-Bench / CPTUB | closed | Bielik-11B-v3.0-Instruct | 3.73 / 5 | ewaluator | N/A | raport |
| Polish Medical Leaderboard | open | Bielik-11B-v3.0-Instruct | 50.21 / 100 | ewaluator | dane | raport |
| PLCC | open | Bielik-11B-v3.0-Instruct | 71.83 / 100 | ewaluator | dane | raport |
| LLMzSzŁ | open | Bielik-11B-v2.1-Instruct | 57.52 / 100 | ewaluator | dane | raport |
| European LLM Leaderboard | open | Bielik-11B-v2.3-Instruct | 0.66 / 1.00 | ewaluator | dane | raport |
| EuroEval | open | Bielik-11B-v2.3-Instruct | rank 2.22; PL 1.41 | ewaluator | dane | raport |
| Open LLM Leaderboard v1 | archived | Bielik-11B-v3.0-Instruct | 72.45 / 100 | ewaluator | dane / opis | raport |
| MMLU | open | Bielik-11B-v3.0-Instruct | 71.11 / 100 | dataset | dane | raport |
| ARC Challenge | open | Bielik-11B-v3.0-Instruct | 64.59 / 100 | dataset | dane | raport |
| GSM8K | open | Bielik-11B-v3.0-Instruct | 85.60 / 100 | dataset | dane | raport |
| HellaSwag | open | Bielik-11B-v3.0-Instruct | 81.96 / 100 | dataset | dane | raport |
| TruthfulQA | open | Bielik-11B-v3.0-Instruct | 54.25 / 100 | dataset | dane | raport |
| WinoGrande | open | Bielik-11B-v3.0-Instruct | 77.19 / 100 | dataset | dane | raport |
| Open LLM Leaderboard v2 | partial | Bielik-11B-v2.3-Instruct | 28.33 / 100 | ewaluator | harness | raport |
| MixEval / MixEval-Hard | open | Bielik-11B-v2.1-Instruct | 74.6 / 100; 45.0 / 100 | ewaluator | dane / repo | raport |
| BFCL | partial | Bielik-11B-v2.5-Instruct FC | brak jednego wyniku | ewaluator | dane | raport |
| FLORES / FLORES200 | open | Bielik-11B-v3.0-Instruct | 19.22 BLEU | ewaluator | dane | raport |
| BenCzechMark | open | Bielik-11B-v2.3-Instruct | 49.5 / 100 | ewaluator | dane | raport |
| Open PT LLM Leaderboard / Portuguese Benchmark | open | Bielik-11B-v2.1/v2.2-Instruct | 73.45 / 100 | ewaluator | harness | raport |
| INCLUDE-base-44 | open | Bielik-11B-v3.0-Instruct | 64.8 / 100; PL 69.0 / 100 | ewaluator | dane | raport |
| Belebele | open | Bielik-11B-v3.0-Instruct | 82.98 / 100 | ewaluator | dane | raport |
| COMPL-AI | open | Bielik-11B-v2.3-Instruct | N/A | ewaluator | repo | ewaluacja |
Oficjalny polski leaderboard mierzący ogólne kompetencje NLP/LLM w języku polskim. Obejmuje m.in. analizę sentymentu, NER, klasyfikację tematów, czytanie ze zrozumieniem, QA/RAG, podobieństwo semantyczne, mowę nienawiści i streszczanie.
Uwagi: Wynik 5-shot; raport v3 podaje 65.93 dla wersji instruction-tuned.
Polska wersja benchmarku konwersacyjno-instrukcyjnego. Sprawdza m.in. pisanie, odgrywanie ról, ekstrakcję informacji, rozumowanie, matematykę, kodowanie, STEM i humanistykę. Ocena opiera się na modelu-sędzi.
Uwagi: partial, bo pełna reprodukcja zależy od modelu-sędziego i dokładnej konfiguracji oceny.
Polska adaptacja EQ-Bench. Mierzy inteligencję emocjonalną modelu: rozpoznawanie emocji, interpretowanie sytuacji interpersonalnych i rozumowanie o emocjach w kontekście rozmowy.
Uwagi: Oznaczone jako closed, ponieważ nie znaleziono jednoznacznego publicznego zestawu danych/testów i scoringu pozwalającego samodzielnie przeliczyć wynik.
Benchmark złożonego rozumienia tekstów po polsku. Sprawdza znaczenia ukryte, sarkazm, idiomy, frazeologię, wieloznaczność, podchwytliwe pytania i odporność na halucynacje.
Uwagi: Oznaczone jako closed, ponieważ nie znaleziono jednoznacznego publicznego zestawu danych/testów i scoringu pozwalającego samodzielnie przeliczyć wynik.
Polski benchmark medyczny oparty na pytaniach z Państwowego Egzaminu Specjalizacyjnego z lat 2018–2022. Sprawdza wiedzę medyczną i rozumowanie kliniczne po polsku.
Uwagi: Wynik 5-shot.
Benchmark polskiej kompetencji językowej i kulturowej. Obejmuje historię, geografię, kulturę i tradycję, sztukę i rozrywkę, gramatykę oraz słownictwo.
Uwagi: Raport v3 podaje 71.83%; raport v2 podaje 63.00% dla Bielik-11B-v2.2-Instruct.
Benchmark oparty na polskich egzaminach krajowych, szkolnych i zawodowych z archiwów CKE. Sprawdza wiedzę i rozumowanie w wielu dziedzinach edukacyjnych i zawodowych.
Wielojęzyczny europejski benchmark używający zadań takich jak ARC, GSM8K, HellaSwag, MMLU i TruthfulQA w różnych językach europejskich.
Uwagi: Wynik 0.66 dotyczy polskich tasków. Raport podaje też wyniki dla języka niemieckiego i czeskiego.
Europejski framework ewaluacyjny dla modeli językowych w wielu językach europejskich. Raportuje ranking; niższa wartość oznacza lepszy wynik.
Uwagi: Niższy wynik oznacza lepszą pozycję rankingową.
Angielski zestaw benchmarków obejmujący ARC Challenge, HellaSwag, TruthfulQA, MMLU, WinoGrande i GSM8K. Sprawdza rozumowanie, wiedzę ogólną, prawdziwość odpowiedzi i matematykę.
Uwagi: Leaderboard jest archiwalny. Wynik instruction-tuned z raportu v3; raport v2 podaje 71.42 dla Bielik-11B-v2.5-Instruct.
Massive Multitask Language Understanding: szeroki test wiedzy i rozumowania z wielu dziedzin akademickich. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Zbiór pytań wielokrotnego wyboru z nauk ścisłych. Sprawdza logiczne rozumowanie i wiedzę naukową. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Grade School Math 8K: zadania tekstowe z matematyki szkolnej. Sprawdza rozumowanie krok po kroku i obliczenia. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Test zdroworozsądkowego rozumienia scenariuszy: model wybiera najbardziej prawdopodobne zakończenie zdania lub historii. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Benchmark mierzący odporność modelu na popularne fałszywe przekonania i halucynacje. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Uwagi: Metryka w tabeli: truthfulqa_mc2.
Benchmark rozwiązywania zdań z luką wymagających rozumienia kontekstu i zależności referencyjnych. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.
Trudniejsza wersja Open LLM Leaderboard. Obejmuje m.in. IFEval, BBH, MATH, GPQA, MuSR i MMLU-Pro, czyli instruction following, rozumowanie, matematykę i zaawansowaną wiedzę.
Uwagi: partial, ponieważ dostęp do GPQA jest ograniczony przez gating.
Angielski benchmark złożony z wielu istniejących zadań. Ma dawać wyniki skorelowane z Chatbot Areną, ale w tańszy i bardziej odtwarzalny sposób.
Uwagi: Raport v2 podaje kilka wersji Bielika; w tabeli wpisano najlepszy wynik Bielika w tej tabeli.
Benchmark wywoływania narzędzi i funkcji/API. Sprawdza, czy model potrafi wygenerować poprawne wywołania funkcji. Używa m.in. metryk opartych na AST i zadań live/non-live.
Uwagi: partial, bo w raporcie Bielik był oceniany tylko na wybranych podzbiorach i nie podano jednego globalnego wyniku.
Benchmark tłumaczenia maszynowego dla wielu języków. W Bieliku użyty głównie do tłumaczeń między polskim a innymi językami europejskimi.
Uwagi: Wynik BLEU nie jest accuracy; maksimum 100 jest tylko teoretyczne.
Benchmark skoncentrowany na języku czeskim. Zawiera 50 zadań w 8 kategoriach i sprawdza m.in. język czeski, matematykę, wiedzę faktograficzną, NER, NLI, czytanie ze zrozumieniem i sentyment.
Uwagi: Benchmark nie jest polski, ale raport v2 używa go do sprawdzenia transferu na język czeski.
Portugalski zestaw benchmarków obejmujący m.in. ENEM, BLUEX, OAB, ASSIN2, FAQUAD, HateBR, PT Hate Speech i tweetSentBR.
Uwagi: Benchmark nie jest polski; w raporcie pokazuje transfer cross-lingual.
Wielojęzyczny benchmark wiedzy i rozumowania z pytaniami wielokrotnego wyboru w 44 językach. W raporcie Bielika użyto podzbioru 20 języków europejskich.
Uwagi: Raport v3 podaje średnią po 20 językach europejskich i osobny wynik dla języka polskiego.
Wielojęzyczny benchmark czytania ze zrozumieniem oparty na fragmentach FLORES-200. Zadania mają formę pytań wielokrotnego wyboru do tekstu.
Uwagi: Raport v3 używa 28 europejskich wariantów językowych.
Zbiór testujący zgodność generowanych treści z wymogami bezpieczeństwa i etyki według EU AI Act.
Uwagi: Framework jest otwarty. Znaleziono stronę ewaluacji dla Bielik-11B-v2.3-Instruct.