Automated Quality Benchmark

LLM Judge RAG Evaluation

Run automated Gemini LLM Judge evaluations to benchmark relevance, accuracy, and completeness across documents.

--
Overall RAG Score
--
Relevance Score
--
Faithfulness
--
Completeness

Benchmark Question Results

Benchmark QueryRAG Answer PreviewScores (Rel / Acc / Comp)Overall ScoreJudge Feedback

No evaluation data for this session yet.

Select a session above and click "Run Evaluation" to generate benchmark scores.

LLM Judge Evaluation Methodology

The evaluation engine executes gold-standard benchmark queries against your uploaded documents using AskDoc RAG retrieval (Pinecone + Supabase Postgres full-text search + FlashRank reranking). Gemini acts as an independent judge, scoring faithfulness to source documents, relevance to the query, and completeness.