EnterpriseRAG - Document Q&A
LangChain + Qdrant + Claude
Developed production-ready RAG (Retrieval-Augmented Generation) system for intelligent document Q&A using LangChain orchestration framework, Qdrant vector database, and Claude 3.5 API. System ingests multi-format documents (PDF, DOCX, Markdown), chunks intelligently with overlap strategies, generates embeddings via sentence-transformers, performs hybrid search (semantic + keyword), retrieves relevant context, generates answers with source citations. Implements conversation history, query rewriting for better retrieval, context caching for cost optimization. Deployed with FastAPI backend, React frontend, Docker Compose orchestration.
The Challenge
Knowledge scattered across multiple document formats (PDF, DOCX, Markdown). Traditional keyword search misses semantic matches. LLMs without context give generic answers. Need retrieval system finding relevant chunks, then generating accurate answers with source citations. Context window limits require smart chunking strategies.
The Solution
Built RAG pipeline using LangChain for orchestration, Qdrant vector database for embeddings storage, Claude 3.5 for generation. Intelligent document chunking with overlap prevents context loss. Hybrid search combines semantic similarity (Qdrant) with keyword matching. Context caching reduces API costs. Query rewriting improves retrieval accuracy.
Technology Stack
Architecture
- RAG pipeline: ingestion → chunking → embedding → indexing → retrieval → generation
- sentence-transformers embeddings (all-MiniLM-L6-v2, 384 dimensions)
- Qdrant 1.8 vector database for semantic similarity search
- Hybrid search: Qdrant semantic + BM25 keyword matching
- Document chunking: 512 tokens with 50 token overlap
- LangChain orchestration for multi-stage retrieval
- Query rewriting via LLM for disambiguation
- Context caching reducing Claude API costs 40%
- FastAPI async endpoints with streaming SSE responses
- Docker Compose deployment: FastAPI + Qdrant + PostgreSQL + Redis
Key Features
Results & Impact
- Multi-format document ingestion: PDF, DOCX, Markdown, HTML, TXT
- Indexed 1,000+ documents with intelligent chunking (512 tokens, 50 overlap)
- Hybrid search: semantic similarity (Qdrant) + keyword matching (BM25)
- Achieved <3s response time for Q&A with source citations
- Context caching reduced API costs 40% via LangChain cache layer
- Query rewriting improved retrieval precision 25% for ambiguous questions
- Conversation history support for multi-turn dialogues
- React 18 frontend with streaming responses via Server-Sent Events