NorEval is a 24-dataset Norwegian language evaluation benchmark integrated into lm-evaluation-harness.
unassessed
| Category | composite |
|---|---|
| Subcategory | Norwegian language evaluation |
| Page status | active |
| Direction | higher_is_better |
| Dataset size | 24 |
| Publisher | NorEval / EleutherAI lm-evaluation-harness integration |
NorEval groups Norwegian-language tasks across nine categories, including grammar correction, commonsense, Belebele, idioms, OpenBookQA, reading comprehension, summarization, and generation. It is a suite rather than one item-level evaluation.
Varies by member task; text classification, question answering, and generation tasks are represented.
No model card in ModelSpec reports this benchmark yet.