NorEval

NorEval is a 24-dataset Norwegian language evaluation benchmark integrated into lm-evaluation-harness.

unassessed

This page is a discovery lead. Nobody has yet assessed it against the catalogue contract, so it carries no disposition. Absence of evidence here is not evidence of staleness.
Categorycomposite
SubcategoryNorwegian language evaluation
Page statusactive
Directionhigher_is_better
Dataset size24
PublisherNorEval / EleutherAI lm-evaluation-harness integration

What it measures

NorEval groups Norwegian-language tasks across nine categories, including grammar correction, commonsense, Belebele, idioms, OpenBookQA, reading comprehension, summarization, and generation. It is a suite rather than one item-level evaluation.

Task format

Varies by member task; text classification, question answering, and generation tasks are represented.

Models reporting this benchmark

No model card in ModelSpec reports this benchmark yet.

Data

This page as JSON · Edit on GitHub