Skip to main content
Benchmarking allows you to measure and compare retrieval quality across different vector databases, embedding models, and pipeline configurations. VectorDB provides standardized evaluation utilities and datasets to support rigorous, reproducible benchmarking.

Evaluation metrics

VectorDB includes five core retrieval metrics:

Metric formulas

Supported datasets

VectorDB includes loaders for five benchmark datasets:
Open-domain question-answer pairs for general knowledge retrieval.
Use case: General knowledge QA systems, broad domain retrieval
Science reasoning questions requiring multi-hop inference.
Use case: Scientific and educational content retrieval
Factoid questions about popular entities.
Use case: Entity-focused retrieval, celebrity and popular culture
Atomic facts for verification and hallucination detection.
Use case: Fact verification, hallucination detection
Financial transcript Q&A for domain-specific RAG.
Use case: Financial domain, long-form transcripts

Running evaluations

Basic evaluation

Evaluate a single pipeline configuration:

Cross-database comparison

Compare the same configuration across multiple databases:

Comparing retrieval strategies

Benchmark different retrieval approaches:

Evaluation with reranking metrics

When using reranking, track additional quality metrics:
These metrics evaluate:
  • Contextual Recall: Do retrieved chunks contain information needed for the answer?
  • Contextual Precision: Are retrieved chunks relevant to the question?
  • Answer Relevancy: Does the generated answer address the question?
  • Faithfulness: Is the answer grounded in the retrieved context?

Cost-quality tradeoffs

Evaluate cost alongside quality for production deployments:

Benchmark configuration best practices

Use the same evaluation queries across all runs:
Run warm-up queries before timing measurements:
Average metrics over multiple runs:
Set random seeds for reproducibility:

Interpreting results

When to optimize each metric

Recall

Optimize when missing relevant documents is costly. Medical diagnosis, legal research, and safety-critical applications.

Precision

Optimize when showing irrelevant results harms UX. Consumer search, recommendation systems.

MRR

Optimize when users only examine top results. Web search, autocomplete.

NDCG

Optimize when ranking quality matters more than binary relevance. E-commerce, content discovery.

Typical metric ranges

These ranges assume well-tuned configurations on standard benchmarks like TriviaQA or ARC.

Advanced benchmarking

Per-query analysis

Identify queries where the pipeline struggles:

Ablation studies

Measure the impact of individual components:

Next steps

Configuration

Tune pipeline settings based on benchmark results

Production deployment

Deploy your best-performing configuration

Building RAG pipelines

Learn to build complete RAG systems

Environment variables

Configure benchmarking environments