Skip to content

Architecture Reference Blueprint

Enterprise RAG Pipeline: Hybrid Search & Re-ranking

A production architecture for enterprise document Q&A that eliminates hallucinations, retrieves verified citations, and respects document access permissions.

System Constraints

Non-Negotiable Architecture Constraints

Sub-2s end-to-end response generation including retrieval and streaming
Zero cross-department unauthorized document retrieval
Exact source citation (document name, page number, bounding box) on every claim
High recall over complex multi-page tables and financial filings

Component Topology

System Components & Technologies

Modular subsystems designed with decoupled responsibilities, clear contracts, and scalable storage layers.

3D Isometric Architecture

Enterprise RAG Pipeline: Hybrid Search & Re-ranking Stack Topology

Live Telemetry Active
Tier 1: DocumentTier 2: EmbeddingTier 3: SparseTier 4: Cross-Encoder
01

Document Ingestion Engine

< 15ms
Role: OCR, layout-aware PDF parsing, and semantic chunkingLlamaIndex + Unstructured.io
02

Embedding & Vector Store

< 35ms
Role: Dense vector indexing with metadata permission filteringQdrant / PostgreSQL pgvector
03

Sparse Keyword Engine

< 5ms
Role: Lexical BM25 search for exact acronym and code retrievalElasticsearch / OpenSearch
04

Cross-Encoder Re-ranker

< 1ms
Role: Contextual re-ranking of top 50 retrieved candidates down to top 5Cohere Rerank / ColBERT
Subsystem 01

Document Ingestion Engine

OCR, layout-aware PDF parsing, and semantic chunking

Production Stack:

LlamaIndex + Unstructured.io

Subsystem 02

Embedding & Vector Store

Dense vector indexing with metadata permission filtering

Production Stack:

Qdrant / PostgreSQL pgvector

Subsystem 03

Sparse Keyword Engine

Lexical BM25 search for exact acronym and code retrieval

Production Stack:

Elasticsearch / OpenSearch

Subsystem 04

Cross-Encoder Re-ranker

Contextual re-ranking of top 50 retrieved candidates down to top 5

Production Stack:

Cohere Rerank / ColBERT

Subsystem 05

LLM Generation & Guardrail

Context grounding, citation synthesis, and PII redaction

Production Stack:

vLLM / Anthropic Claude 3.5 Sonnet

Data Lifecycle

End-to-End Data Flow Sequence

1

User submits a query along with their enterprise identity and group permissions token.

2

Query is converted into dense vector embedding and sparse BM25 keyword tokens in parallel.

3

Hybrid search queries vector store and lexical engine, filtering candidates strictly by user's group permissions.

4

Reciprocal Rank Fusion (RRF) merges results, passing top 40 candidate chunks to the ColBERT cross-encoder.

5

Re-ranked top 5 chunks are injected into the system prompt with strict citation instructions; LLM streams answer.

Reliability & Resilience

Failure modes & automated mitigations

Failure Mode 01

Context Window Saturation with Irrelevant Noise

Mitigation Architecture

Apply semantic chunking and strict score cutoff thresholds on the cross-encoder re-ranker.

Failure Mode 02

Hallucination of Unsupported Statistics

Mitigation Architecture

Implement an automated validator (DeepEval) that cross-checks all generated numbers against retrieved chunks.

Failure Mode 03

High Embedding API Latency

Mitigation Architecture

Cache embedding vectors for frequent queries in Redis and run local embedding models (BGE-Large) on dedicated inference GPUs.

Architecture FAQs

Frequently asked blueprint questions

Dense embeddings excel at conceptual meaning but frequently fail on exact part numbers, acronyms, and names. Combining dense vectors with BM25 keyword search achieves 95%+ retrieval recall.

Document permission ACLs are stored as metadata attributes on each vector chunk and evaluated dynamically at query time against the user's active session roles.

Senior engineering teams that build for long-term production health

Schedule an architecture session to review your requirements, cloud budget, and implementation timeline.