BEIR

A suite of 18 public retrieval datasets across 9 task types used to test whether a search or embedding model generalises to new domains without fine-tuning.

Also known as: BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models

unassessed

This page is a discovery lead. Nobody has yet assessed it against the catalogue contract, so it carries no disposition. Absence of evidence here is not evidence of staleness.
Categoryembedding
Subcategoryzero-shot information retrieval
Page statusactive
MetricnDCG@10
Directionhigher_is_better
Dataset size18
Dataset licenceApache-2.0
PublisherUKP Lab, TU Darmstadt

What it measures

BEIR gathers 18 pre-existing retrieval datasets spanning nine task types, including fact-checking, question answering, biomedical IR, news retrieval, argument retrieval, duplicate-question detection, citation prediction, tweet retrieval and entity retrieval, and evaluates one retrieval system across all of them without per-dataset fine-tuning. Given a query, a system ranks a corpus of passages or documents by relevance, scored against human relevance judgments. The premise is that a good retriever should generalise zero-shot to a new domain rather than needing supervised training data from each one, so BEIR is most informative when compared against what the system was actually trained on.

Task format

Zero-shot passage/document retrieval and ranking across 18 datasets and 9 task types; corpora range from thousands to millions of documents

Models reporting this benchmark

These figures come from the model cards, which carry one collection date per card and no per-score attribution. They are shown as reported, not as verified evidence.
ModelProviderScoreCard as of
NV Embed v2NVIDIA58.52026-04
Qwen3 Embedding 8BAlibaba / Qwen Team57.52026-04
Qwen3 VL Embedding 8BAlibaba / Qwen Team57.52026-04
jina embeddings v4Jina AI57.02026-04
jina embeddings v4 vllm retrievalJina AI57.02026-04
Voyage 3Voyage AI56.52026-04
e5 mistral 7B instructintfloat56.22026-04
snowflake arctic embed l v2.0Snowflake56.02026-04
jina embeddings v3Jina AI55.82026-04
Gemini Embedding 001Google DeepMind55.52026-04
text-embedding-3-largeOpenAI55.12026-04
nomic embed text v2 moeNomic AI55.02026-04
nomic embed text v2 moe GGUFNomic AI55.02026-04
Qwen3 Embedding 4BAlibaba / Qwen Team55.02026-04
SFR Embedding 2 RSalesforce55.02026-04
bge m3BAAI54.82026-04
snowflake arctic embed lSnowflake53.82026-04
granite embedding english r2IBM53.52026-04
granite embedding small english r2IBM53.52026-04
multilingual e5 large instructintfloat53.52026-04
snowflake arctic embed m v2.0Snowflake53.02026-04
Voyage Code 3Voyage AI52.52026-04
nomic embed text v1.5Nomic AI52.32026-04
nomic embed text v1.5 GGUFNomic AI52.32026-04
bge large en v1.5BAAI52.12026-04
Voyage Multilingual 2Voyage AI52.02026-04
e5 large v2intfloat51.52026-04
snowflake arctic embed m v1.5Snowflake51.52026-04
Voyage 3 LiteVoyage AI51.22026-04
bge large enBAAI51.02026-04
snowflake arctic embed m longSnowflake51.02026-04
multilingual e5 largeintfloat50.82026-04
nomic embed text v1Nomic AI50.82026-04
e5 largeintfloat50.52026-04
snowflake arctic embed mSnowflake50.52026-04
bge base en v1.5BAAI50.22026-04
e5 large unsupervisedintfloat49.82026-04
jina embeddings v2 base enJina AI49.52026-04
Qwen3 Embedding 0.6BAlibaba / Qwen Team49.52026-04
Qwen3 VL Embedding 2BAlibaba / Qwen Team49.52026-04
Mistral EmbedMistral AI49.22026-04
bge base enBAAI49.02026-04
e5 base v2intfloat48.82026-04
multilingual e5 baseintfloat48.52026-04
granite embedding 125M englishIBM48.02026-04
bge small en v1.5BAAI47.52026-04
e5 baseintfloat47.52026-04
snowflake arctic embed sSnowflake47.22026-04
jina embeddings v2 small enJina AI472026-04
text-embedding-3-smallOpenAI46.82026-04
e5 small v2intfloat46.52026-04
multilingual e5 smallintfloat46.22026-04
bge small enBAAI45.82026-04
e5 smallintfloat45.22026-04
snowflake arctic embed xsSnowflake44.52026-04
all mpnet base v2Sentence Transformers44.22026-04
text-embedding-ada-002OpenAI43.52026-04
all MiniLM L12 v2Sentence Transformers43.22026-04
granite embedding 30M englishIBM43.02026-04
granite embedding 30M sparseIBM43.02026-04
multi qa mpnet base dot v1Sentence Transformers43.02026-04
all MiniLM L6 v2Sentence Transformers42.82026-04
multi qa mpnet base cos v1Sentence Transformers42.82026-04
all roberta large v1Sentence Transformers42.02026-04
all distilroberta v1Sentence Transformers41.52026-04
multi qa MiniLM L6 cos v1Sentence Transformers41.02026-04
msmarco bert base dot v5Sentence Transformers40.52026-04
msmarco MiniLM L12 cos v5Sentence Transformers40.02026-04
msmarco MiniLM L6 v3Sentence Transformers39.02026-04

Data

This page as JSON · Edit on GitHub