Evaluation API
Modules to score pipeline outputs.
Evaluation Result
maticlib.core.evaluation.models.EvaluationResult
Bases: BaseModel
Standardized schema returned by all evaluators.
Context Relevance Evaluator
maticlib.core.evaluation.evaluator.ContextRelevanceEvaluator
Bases: BaseEvaluator
Evaluates context relevance to a question using basic keyword/token overlap or an optional LLM.
Initializes the ContextRelevanceEvaluator.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
llm_client
|
Optional[Any]
|
Optional LLM client to use as a judge. |
None
|
Source code in maticlib/core/evaluation/evaluator.py
evaluate
Calculates context relevance score.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
question
|
str
|
The natural language question to test. |
required |
contexts
|
List[str]
|
A list of text context segments. |
required |
Returns:
| Type | Description |
|---|---|
EvaluationResult
|
An EvaluationResult containing score and reasoning. |
Source code in maticlib/core/evaluation/evaluator.py
Answer Accuracy Evaluator
maticlib.core.evaluation.evaluator.AnswerAccuracyEvaluator
Bases: BaseEvaluator
Evaluates answer accuracy by comparing against a ground truth answer.
Initializes the AnswerAccuracyEvaluator.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
llm_client
|
Optional[Any]
|
Optional LLM client to use as a judge. |
None
|
Source code in maticlib/core/evaluation/evaluator.py
evaluate
Calculates answer accuracy against ground truth.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
answer
|
str
|
Generated text answer string. |
required |
ground_truth
|
str
|
Ground truth reference text answer string. |
required |
Returns:
| Type | Description |
|---|---|
EvaluationResult
|
An EvaluationResult containing score and reasoning. |