Automated Quality Benchmark
LLM Judge RAG Evaluation
Run automated Gemini LLM Judge evaluations to benchmark relevance, accuracy, and completeness across documents.
--
Overall RAG Score
--
Relevance Score
--
Faithfulness
--
Completeness
Benchmark Question Results
| Benchmark Query | RAG Answer Preview | Scores (Rel / Acc / Comp) | Overall Score | Judge Feedback |
|---|---|---|---|---|
No evaluation data for this session yet. Select a session above and click "Run Evaluation" to generate benchmark scores. | ||||
LLM Judge Evaluation Methodology
The evaluation engine executes gold-standard benchmark queries against your uploaded documents using AskDoc RAG retrieval (Pinecone + Supabase Postgres full-text search + FlashRank reranking). Gemini acts as an independent judge, scoring faithfulness to source documents, relevance to the query, and completeness.