MIRACL

Monolingual ad hoc retrieval over Wikipedia passages in 18 languages, built from native-speaker queries and relevance judgments.

Also known as: Making a MIRACL, Multilingual Information Retrieval Across a Continuum of Languages, MIRACL: A Multilingual Retrieval Dataset Covering 18 Diverse Languages

unassessed

This page is a discovery lead. Nobody has yet assessed it against the catalogue contract, so it carries no disposition. Absence of evidence here is not evidence of staleness.
Categoryembedding
Subcategorymultilingual retrieval
Page statusactive
MetricnDCG@10
Directionhigher_is_better
Unit%
Dataset size18
Dataset licenceApache-2.0 for the project-miracl/miracl toolkit and repository code; MTEB's task metadata lists the dataset content itself as CC BY-SA 4.0, consistent with the licence of the Wikipedia text the passage collections are built from.
PublisherDavid R. Cheriton School of Computer Science, University of Waterloo, with Huawei Noah's Ark Lab

What it measures

MIRACL tests whether a retrieval or embedding system can rank passages by relevance to a query within the same language, across 18 typologically diverse languages, most of them under-served by earlier retrieval benchmarks built mainly for English. For each language, the corpus is that language's Wikipedia, split into passages; native speakers of the language wrote the queries and judged which passages were relevant, rather than translating an English query set. It is monolingual retrieval (query and corpus share a language), not cross-lingual retrieval, and it is text-only, covering Arabic, Bengali, German, English, Spanish, Persian, Finnish, French, Hindi, Indonesian, Japanese, Korean, Russian, Swahili, Telugu, Thai, Yoruba and Chinese.

Task format

Given a query in one language, rank a passage corpus drawn from that language's Wikipedia by relevance to the query; relevance judgments were produced by native-speaker annotators per language, not machine-translated from a single source language.

Models reporting this benchmark

These figures come from the model cards, which carry one collection date per card and no per-score attribution. They are shown as reported, not as verified evidence.
ModelProviderScoreCard as of
bge m3BAAI67.82026-04
colnomic embed multimodal 7BNomic AI65.82026-04
nomic embed multimodal 7BNomic AI65.82026-04
nomic embed text v2 moeNomic AI65.82026-04
nomic embed text v2 moe GGUFNomic AI65.82026-04
snowflake arctic embed l v2.0Snowflake64.92026-04
jina embeddings v4Jina AI63.52026-04
jina embeddings v4 vllm retrievalJina AI63.52026-04
jina embeddings v5 text nanoJina AI63.52026-04
jina embeddings v5 text smallJina AI63.52026-04
jina embeddings v5 text small retrievalJina AI63.52026-04
jina clip v2Jina AI61.22026-04
jina code embeddings 1.5BJina AI61.22026-04
jina embeddings v3Jina AI61.22026-04
Qwen3 Embedding 8BAlibaba / Qwen Team60.02026-04
Qwen3 VL Embedding 8BAlibaba / Qwen Team60.02026-04
snowflake arctic embed m v2.0Snowflake59.22026-04
bge multilingual gemma2BAAI59.02026-04
Voyage 3Voyage AI58.52026-04
multilingual e5 large instructintfloat58.22026-04
Qwen3 Embedding 4BAlibaba / Qwen Team57.02026-04
Voyage Multilingual 2Voyage AI57.02026-04
e5 mistral 7B instructintfloat56.52026-04
Gemini Embedding 001Google DeepMind56.22026-04
NV Embed v2NVIDIA55.52026-04
multilingual e5 largeintfloat55.12026-04
text-embedding-3-largeOpenAI54.92026-04
granite embedding 278M multilingualIBM54.02026-04
multilingual e5 baseintfloat52.52026-04
snowflake arctic embed lSnowflake52.02026-04
Qwen3 Embedding 0.6BAlibaba / Qwen Team51.02026-04
Qwen3 VL Embedding 2BAlibaba / Qwen Team51.02026-04
snowflake arctic embed m v1.5Snowflake50.52026-04
granite embedding 107M multilingualIBM50.02026-04
modernbert embed baseNomic AI50.02026-04
multilingual e5 smallintfloat50.02026-04
nomic embed text v1.5Nomic AI50.02026-04
nomic embed text v1.5 GGUFNomic AI50.02026-04
SFR Embedding 2 RSalesforce50.02026-04
snowflake arctic embed mSnowflake48.52026-04
snowflake arctic embed m longSnowflake48.02026-04
Voyage 3 LiteVoyage AI48.02026-04
nomic embed text v1Nomic AI47.52026-04
granite embedding english r2IBM46.02026-04
granite embedding small english r2IBM46.02026-04
Voyage Finance 2Voyage AI45.52026-04
LaBSESentence Transformers45.02026-04
Mistral EmbedMistral AI45.02026-04
snowflake arctic embed sSnowflake44.02026-04
Voyage Law 2Voyage AI44.02026-04
paraphrase multilingual mpnet base v2Sentence Transformers43.52026-04
bge large en v1.5BAAI42.52026-04
paraphrase multilingual MiniLM L12 v2Sentence Transformers42.02026-04
text-embedding-3-smallOpenAI42.02026-04
Voyage Code 3Voyage AI42.02026-04
bge large enBAAI41.02026-04
e5 large v2intfloat40.02026-04
snowflake arctic embed xsSnowflake40.02026-04
bge base en v1.5BAAI39.02026-04
e5 largeintfloat38.52026-04
distiluse base multilingual cased v2Sentence Transformers38.02026-04
granite embedding 125M englishIBM38.02026-04
bge base enBAAI37.52026-04
e5 base v2intfloat37.02026-04
e5 large unsupervisedintfloat37.02026-04
distiluse base multilingual cased v1Sentence Transformers36.02026-04
bge small en v1.5BAAI35.52026-04
text-embedding-ada-002OpenAI35.52026-04
e5 baseintfloat35.02026-04
SFR Embedding Code 400M RSalesforce35.02026-04
e5 small v2intfloat34.52026-04
bge small enBAAI33.52026-04
e5 smallintfloat32.52026-04
granite embedding 30M englishIBM32.02026-04
granite embedding 30M sparseIBM32.02026-04
multi qa mpnet base dot v1Sentence Transformers32.02026-04
multi qa mpnet base cos v1Sentence Transformers31.52026-04
paraphrase mpnet base v2Sentence Transformers30.52026-04
all mpnet base v2Sentence Transformers30.02026-04
multi qa MiniLM L6 cos v1Sentence Transformers30.02026-04
all MiniLM L12 v2Sentence Transformers29.02026-04
msmarco bert base dot v5Sentence Transformers29.02026-04
all roberta large v1Sentence Transformers28.52026-04
all MiniLM L6 v2Sentence Transformers28.02026-04
msmarco MiniLM L12 cos v5Sentence Transformers28.02026-04
msmarco MiniLM L6 v3Sentence Transformers27.52026-04
all distilroberta v1Sentence Transformers27.02026-04
paraphrase MiniLM L12 v2Sentence Transformers27.02026-04
paraphrase MiniLM L6 v2Sentence Transformers26.52026-04
paraphrase MiniLM L3 v2Sentence Transformers24.02026-04

Data

This page as JSON · Edit on GitHub