Production RAG – Evidence-Grounded Modular Architecture
Production-grade, modular, evidence-grounded Retrieval-Augmented Generation platform built on a custom architecture. Features structure-aware multi-format ingestion (16+ formats), Qdrant + BM25 hybrid indexing, Reciprocal Rank Fusion, cross-encoder reranking, evidence gating with false-premise abstention, and bidirectional citation validation.
Standard naive RAG demos blindly embed queries and retrieve top-k chunks, suffering from hallucinations, poor retrieval on exact terms, noisy context, unsupported claims, vulnerability to prompt injection, and zero ability to abstain when faced with false-premise questions.
Engineered an enterprise-grade additive retrieval & generation cascade: (1) Structure-aware multi-format ingestion supporting 16+ file types with configurable OCR, (2) Specialized chunking (prose parent-child, code, markdown, repeated-header tables), (3) Dual indexing with Qdrant vector DB and BM25 lexical search, (4) Adaptive Query Planning routing across 7 query classes, (5) Reciprocal Rank Fusion (RRF) candidate merging, (6) Cross-encoder neural reranking, (7) Strict Evidence Gate calculating context coverage and abstaining on ungrounded premises, (8) Grounded generation enforcing passive DATA status for injection defense, and (9) Bidirectional citation validator verifying every bracketed reference against real physical chunks.
- →32/32 Pytest test suite (100% pass) spanning adversarial injection, evidence citations, API, and retrieval
- →24/24 document ingestion test suite validating multi-format parsing across 16+ document types
- →Measured ablation: Recall@5 of 0.9000 and Precision@5 of 0.6775 across diverse query archetypes
- →MRR score of 0.8500 ensuring relevant context is surfaced in top candidate slots
- →Citation Accuracy of 95.0% verified by bidirectional physical chunk grounding
- →Abstention Accuracy of 95.0% reliably refusing false-premise and unanswerable queries
- →Sub-16ms fast-path retrieval latency with complete production REST API & CLI interface
- 01Dynamic query planning with hybrid retrieval (Dense + BM25 + RRF) drastically outperforms single-strategy vector search on exact terms and code
- 02Parent-child chunking decouples retrieval granularity from generation context, eliminating context starvation
- 03An explicit Evidence Gate is far more reliable for preventing hallucinations than post-hoc prompt instructions
- 04Treating retrieved context strictly as passive data with bidirectional chunk validation neutralizes document prompt injections