Skip to main content
VectorDB uses YAML configuration files to define pipeline behavior. This reference documents all available configuration sections and options.

Configuration file structure

A complete configuration file includes these sections:

Environment variable substitution

VectorDB supports two environment variable syntaxes:
See environment variables for the complete list of supported variables.

Dataloader configuration

Controls dataset loading and preprocessing.

Supported datasets

Open-domain question-answering dataset.
AI2 Reasoning Challenge for science questions.
Popular entity factoid questions.
Atomic facts for verification.
Financial transcript Q&A.

Embeddings configuration

Defines the embedding models for vector generation.

Dense embeddings

Model aliases

VectorDB provides convenient aliases for common models:

Hybrid embeddings (dense + sparse)

Vector database configuration

Each database has specific connection and indexing settings.
Namespaces for multi-tenancy:
Multi-tenancy:
Partition-based multi-tenancy:
With quantization:

Search configuration

Controls retrieval behavior.

Metadata filtering

RAG configuration

Controls answer generation with LLMs.

Groq configuration

OpenAI configuration

Reranking configuration

Improves precision with cross-encoder models.

Cohere reranking

Evaluation metrics

Advanced features

Query enhancement

Generate multiple query variations for better recall.
Methods:
  • multi_query: Generate N paraphrases of the query
  • hyde: Generate hypothetical answer, then search for similar documents
  • step_back: Generate broader conceptual query

Parent document retrieval

Index small chunks, return large context.
Retrieval modes:
  • children_only: Return only child chunks
  • with_parents: Return full parent documents
  • context_window: Return parent with surrounding context

Contextual compression

Reduce retrieved context to save LLM tokens.

Agentic RAG

Iterative retrieval with self-reflection.

Cost optimization

Balance quality and cost.

Chunking configuration

Logging configuration

Control logging output.

Log levels by environment

Collection configuration

Defines collection metadata (used by some features).

Complete configuration examples

Loading configurations in code

VectorDB provides multiple ways to load configurations:

From YAML file

From dictionary

With pipeline classes

Next steps

Environment variables

Reference for all environment variables

Building RAG pipelines

Step-by-step tutorial using these configurations

Benchmarking

Evaluate different configurations

Production deployment

Deploy your configured pipelines