Skip to content

Latest commit

 

History

3 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

Benchmarki Bielika

Tabela benchmarków, na których raportowano wyniki modeli z rodziny Bielik, wraz ze statusem dostępności, linkiem do ewaluatora, linkiem do danych oraz źródłem potwierdzającym ewaluację Bielika.

Legenda statusów

Status Znaczenie
open Dane i/lub harness są publiczne, więc benchmark można praktycznie pobrać i uruchomić.
partial Część benchmarku jest publiczna, ale pełna reprodukcja może zależeć od dodatkowej konfiguracji, modelu-sędziego, subsetu albo niedostępnego elementu.
closed Nie znaleziono publicznych danych/testów/scoringu pozwalających samodzielnie przeliczyć wynik.
archived Benchmark albo leaderboard jest publiczny, ale archiwalny lub nieutrzymywany.

Tabela benchmarków

Benchmark Kategoria Model Wynik/Maks Ewaluator Dane Źródło
Open PL LLM Leaderboard open Bielik-11B-v3.0-Instruct 65.93 / 100 ewaluator dane / taski raport
Polish MT-Bench partial Bielik-11B-v2.3-Instruct 8.56 / 10 ewaluator dane raport
Polish EQ-Bench closed Bielik-11B-v3.0-Instruct 71.20 / 100 ewaluator N/A raport
CPTU-Bench / CPTUB closed Bielik-11B-v3.0-Instruct 3.73 / 5 ewaluator N/A raport
Polish Medical Leaderboard open Bielik-11B-v3.0-Instruct 50.21 / 100 ewaluator dane raport
PLCC open Bielik-11B-v3.0-Instruct 71.83 / 100 ewaluator dane raport
LLMzSzŁ open Bielik-11B-v2.1-Instruct 57.52 / 100 ewaluator dane raport
European LLM Leaderboard open Bielik-11B-v2.3-Instruct 0.66 / 1.00 ewaluator dane raport
EuroEval open Bielik-11B-v2.3-Instruct rank 2.22; PL 1.41 ewaluator dane raport
Open LLM Leaderboard v1 archived Bielik-11B-v3.0-Instruct 72.45 / 100 ewaluator dane / opis raport
MMLU open Bielik-11B-v3.0-Instruct 71.11 / 100 dataset dane raport
ARC Challenge open Bielik-11B-v3.0-Instruct 64.59 / 100 dataset dane raport
GSM8K open Bielik-11B-v3.0-Instruct 85.60 / 100 dataset dane raport
HellaSwag open Bielik-11B-v3.0-Instruct 81.96 / 100 dataset dane raport
TruthfulQA open Bielik-11B-v3.0-Instruct 54.25 / 100 dataset dane raport
WinoGrande open Bielik-11B-v3.0-Instruct 77.19 / 100 dataset dane raport
Open LLM Leaderboard v2 partial Bielik-11B-v2.3-Instruct 28.33 / 100 ewaluator harness raport
MixEval / MixEval-Hard open Bielik-11B-v2.1-Instruct 74.6 / 100; 45.0 / 100 ewaluator dane / repo raport
BFCL partial Bielik-11B-v2.5-Instruct FC brak jednego wyniku ewaluator dane raport
FLORES / FLORES200 open Bielik-11B-v3.0-Instruct 19.22 BLEU ewaluator dane raport
BenCzechMark open Bielik-11B-v2.3-Instruct 49.5 / 100 ewaluator dane raport
Open PT LLM Leaderboard / Portuguese Benchmark open Bielik-11B-v2.1/v2.2-Instruct 73.45 / 100 ewaluator harness raport
INCLUDE-base-44 open Bielik-11B-v3.0-Instruct 64.8 / 100; PL 69.0 / 100 ewaluator dane raport
Belebele open Bielik-11B-v3.0-Instruct 82.98 / 100 ewaluator dane raport
COMPL-AI open Bielik-11B-v2.3-Instruct N/A ewaluator repo ewaluacja

Opisy benchmarków

Open PL LLM Leaderboard

Oficjalny polski leaderboard mierzący ogólne kompetencje NLP/LLM w języku polskim. Obejmuje m.in. analizę sentymentu, NER, klasyfikację tematów, czytanie ze zrozumieniem, QA/RAG, podobieństwo semantyczne, mowę nienawiści i streszczanie.

Uwagi: Wynik 5-shot; raport v3 podaje 65.93 dla wersji instruction-tuned.

Polish MT-Bench

Polska wersja benchmarku konwersacyjno-instrukcyjnego. Sprawdza m.in. pisanie, odgrywanie ról, ekstrakcję informacji, rozumowanie, matematykę, kodowanie, STEM i humanistykę. Ocena opiera się na modelu-sędzi.

Uwagi: partial, bo pełna reprodukcja zależy od modelu-sędziego i dokładnej konfiguracji oceny.

Polish EQ-Bench

Polska adaptacja EQ-Bench. Mierzy inteligencję emocjonalną modelu: rozpoznawanie emocji, interpretowanie sytuacji interpersonalnych i rozumowanie o emocjach w kontekście rozmowy.

Uwagi: Oznaczone jako closed, ponieważ nie znaleziono jednoznacznego publicznego zestawu danych/testów i scoringu pozwalającego samodzielnie przeliczyć wynik.

CPTU-Bench / CPTUB

Benchmark złożonego rozumienia tekstów po polsku. Sprawdza znaczenia ukryte, sarkazm, idiomy, frazeologię, wieloznaczność, podchwytliwe pytania i odporność na halucynacje.

Uwagi: Oznaczone jako closed, ponieważ nie znaleziono jednoznacznego publicznego zestawu danych/testów i scoringu pozwalającego samodzielnie przeliczyć wynik.

Polish Medical Leaderboard

Polski benchmark medyczny oparty na pytaniach z Państwowego Egzaminu Specjalizacyjnego z lat 2018–2022. Sprawdza wiedzę medyczną i rozumowanie kliniczne po polsku.

Uwagi: Wynik 5-shot.

PLCC

Benchmark polskiej kompetencji językowej i kulturowej. Obejmuje historię, geografię, kulturę i tradycję, sztukę i rozrywkę, gramatykę oraz słownictwo.

Uwagi: Raport v3 podaje 71.83%; raport v2 podaje 63.00% dla Bielik-11B-v2.2-Instruct.

LLMzSzŁ

Benchmark oparty na polskich egzaminach krajowych, szkolnych i zawodowych z archiwów CKE. Sprawdza wiedzę i rozumowanie w wielu dziedzinach edukacyjnych i zawodowych.

European LLM Leaderboard

Wielojęzyczny europejski benchmark używający zadań takich jak ARC, GSM8K, HellaSwag, MMLU i TruthfulQA w różnych językach europejskich.

Uwagi: Wynik 0.66 dotyczy polskich tasków. Raport podaje też wyniki dla języka niemieckiego i czeskiego.

EuroEval

Europejski framework ewaluacyjny dla modeli językowych w wielu językach europejskich. Raportuje ranking; niższa wartość oznacza lepszy wynik.

Uwagi: Niższy wynik oznacza lepszą pozycję rankingową.

Open LLM Leaderboard v1

Angielski zestaw benchmarków obejmujący ARC Challenge, HellaSwag, TruthfulQA, MMLU, WinoGrande i GSM8K. Sprawdza rozumowanie, wiedzę ogólną, prawdziwość odpowiedzi i matematykę.

Uwagi: Leaderboard jest archiwalny. Wynik instruction-tuned z raportu v3; raport v2 podaje 71.42 dla Bielik-11B-v2.5-Instruct.

MMLU

Massive Multitask Language Understanding: szeroki test wiedzy i rozumowania z wielu dziedzin akademickich. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

ARC Challenge

Zbiór pytań wielokrotnego wyboru z nauk ścisłych. Sprawdza logiczne rozumowanie i wiedzę naukową. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

GSM8K

Grade School Math 8K: zadania tekstowe z matematyki szkolnej. Sprawdza rozumowanie krok po kroku i obliczenia. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

HellaSwag

Test zdroworozsądkowego rozumienia scenariuszy: model wybiera najbardziej prawdopodobne zakończenie zdania lub historii. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

TruthfulQA

Benchmark mierzący odporność modelu na popularne fałszywe przekonania i halucynacje. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

Uwagi: Metryka w tabeli: truthfulqa_mc2.

WinoGrande

Benchmark rozwiązywania zdań z luką wymagających rozumienia kontekstu i zależności referencyjnych. W Bieliku raportowany jako komponent Open LLM Leaderboard v1.

Open LLM Leaderboard v2

Trudniejsza wersja Open LLM Leaderboard. Obejmuje m.in. IFEval, BBH, MATH, GPQA, MuSR i MMLU-Pro, czyli instruction following, rozumowanie, matematykę i zaawansowaną wiedzę.

Uwagi: partial, ponieważ dostęp do GPQA jest ograniczony przez gating.

MixEval / MixEval-Hard

Angielski benchmark złożony z wielu istniejących zadań. Ma dawać wyniki skorelowane z Chatbot Areną, ale w tańszy i bardziej odtwarzalny sposób.

Uwagi: Raport v2 podaje kilka wersji Bielika; w tabeli wpisano najlepszy wynik Bielika w tej tabeli.

BFCL

Benchmark wywoływania narzędzi i funkcji/API. Sprawdza, czy model potrafi wygenerować poprawne wywołania funkcji. Używa m.in. metryk opartych na AST i zadań live/non-live.

Uwagi: partial, bo w raporcie Bielik był oceniany tylko na wybranych podzbiorach i nie podano jednego globalnego wyniku.

FLORES / FLORES200

Benchmark tłumaczenia maszynowego dla wielu języków. W Bieliku użyty głównie do tłumaczeń między polskim a innymi językami europejskimi.

Uwagi: Wynik BLEU nie jest accuracy; maksimum 100 jest tylko teoretyczne.

BenCzechMark

Benchmark skoncentrowany na języku czeskim. Zawiera 50 zadań w 8 kategoriach i sprawdza m.in. język czeski, matematykę, wiedzę faktograficzną, NER, NLI, czytanie ze zrozumieniem i sentyment.

Uwagi: Benchmark nie jest polski, ale raport v2 używa go do sprawdzenia transferu na język czeski.

Open PT LLM Leaderboard / Portuguese Benchmark

Portugalski zestaw benchmarków obejmujący m.in. ENEM, BLUEX, OAB, ASSIN2, FAQUAD, HateBR, PT Hate Speech i tweetSentBR.

Uwagi: Benchmark nie jest polski; w raporcie pokazuje transfer cross-lingual.

INCLUDE-base-44

Wielojęzyczny benchmark wiedzy i rozumowania z pytaniami wielokrotnego wyboru w 44 językach. W raporcie Bielika użyto podzbioru 20 języków europejskich.

Uwagi: Raport v3 podaje średnią po 20 językach europejskich i osobny wynik dla języka polskiego.

Belebele

Wielojęzyczny benchmark czytania ze zrozumieniem oparty na fragmentach FLORES-200. Zadania mają formę pytań wielokrotnego wyboru do tekstu.

Uwagi: Raport v3 używa 28 europejskich wariantów językowych.

COMPL-AI

Zbiór testujący zgodność generowanych treści z wymogami bezpieczeństwa i etyki według EU AI Act.

Uwagi: Framework jest otwarty. Znaleziono stronę ewaluacji dla Bielik-11B-v2.3-Instruct.

About

List of benchmarks

Resources

Stars

3 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors