A production-grade framework for evaluating Large Language Model (LLM) responses using multiple metrics, including classical NLP metrics, semantic similarity, RAG-specific metrics, and LLM-as-a-Judge evaluations.
natural-language-processing framework metrics evaluation cli-interface cli-tool large-language-models llm-as-a-judge rag-metrics
-
Updated
Mar 27, 2026 - Python