> For the complete documentation index, see [llms.txt](https://docs.datumo.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.datumo.com/documentation/evaluation/editor.md).

# 핵심 개념과 구조

## Core Concept: Task·Benchmark set· Metric

Datumo Evaluation에서 가장 먼저 익혀야 할 세 가지 기본 단위입니다.&#x20;

***

## Evaluation 구조

한 개의 **Task**는 여러 개의 를 **Benchmarkset**을 가질 수 있고, 각 **Benchmark set**은 그것을 측정할 **Metric** 하나와 짝지어집니다.

<figure><img src="/files/8wjGgoHZ182CfcHB3pAm" alt=""><figcaption></figcaption></figure>

<table><thead><tr><th width="156.53125">개념</th><th>답하는 질문</th><th>한 단어로</th></tr></thead><tbody><tr><td><strong>Task</strong></td><td>AI가 무엇을 하는가?</td><td><strong>What</strong></td></tr><tr><td><strong>Benchmark set</strong></td><td>어디에 평가를 진행할 것인가?</td><td><strong>Where</strong></td></tr><tr><td><strong>Metric</strong></td><td>그 관점을 어떻게 점수화하는가?</td><td><strong>How</strong> </td></tr></tbody></table>

### 개념 정의

**Task: 평가할 능력**

Task는 평가하고자 하는 능력이나 작업을 정의하는 단위입니다.

* 예: 금융 상품 정보 검색, 질문 의도 기반 문서 검색, 답변 완결성 평가
* 하나의 Task는 다수의 Metric을 가질 수 있습니다.
* 하나의 Task는 1개의 Benchmark Set과 연결됩니다.

***

**Benchmark Set: 평가할 데이터**

Benchmark Set은 Task 평가에 사용되는 기준 데이터 모음입니다.

* 평가 목적에 맞는 다수의 데이터로 구성됩니다.
* Input, Reference, Metadata 등의 컬럼 정보를 가질 수 있습니다.
* 평가용 데이터가 대표성을 가지는 경우 Dataset이 아닌 Benchmark Set이라는 표현을 사용합니다.

***

**Metric: 평가의 방법**

Metric은 평가 결과를 어떤 방식으로 계산하거나 판정할지 정의하는 단위입니다.

* 예: LLM-as-a-Judge, Exact Match, Pass/Fail, Similarity Score
* 하나의 Task에는 여러 Metric이 연결될 수 있습니다.
* 같은 Benchmark Set을 사용하더라도 Metric에 따라 평가 결과의 의미가 달라질 수 있습니다.

***

## 평가 Framework 예시

Evaluation Framework는 Benchmark Set의 데이터를 Application 또는 Module에 입력하고, 생성된 Output을 평가하여 Eval Result를 산출하는 구조입니다.

### 1. 공통 Evaluation Framework

Benchmark Set의 Input을 Application 또는 Module에 전달하고, 생성된 Output을 Metric으로 평가하여 Eval Result를 산출하는 기본 평가 구조입니다.

<figure><img src="/files/kZgSqXobnyzYgmG76Y2f" alt=""><figcaption></figcaption></figure>

### **2. Retriever 지표별 평가 예시**

Retriever 평가는 Query에 대해 적절한 Context를 검색했는지 확인하는 평가입니다.

<figure><img src="/files/iHO50vEOdYQLvkowloj4" alt=""><figcaption></figcaption></figure>

검색 결과를 기준으로 아래 Metric을 적용할 수 있습니다.

* Context Relevancy
* Context Precision
* Precision\@K

### **3. Generator 지표별 평가 예시**

Generator 평가는 Query와 Reference Context를 기반으로 생성된 Response의 품질을 확인하는 평가입니다.

<figure><img src="/files/8dV3l9MN630aWIHL80mh" alt=""><figcaption></figcaption></figure>

생성된 응답을 기준으로 아래 Metric을 적용할 수 있습니다.

* Response Relevancy
* Faithfulness
* Precision

***

## Evaluation 작업

* E-1. Criteria 생성 및 관리 — Criteria, Subgroup, Task 구성 방법
* E-2. Task 관리 — Task 기본 정보, Schema, Metric, Benchmark Set 관리 방법
* E-3. Benchmark Set 관리 — Benchmark Set 업로드 및 AI 기반 데이터 생성 방법
* E-4. Metric 추가 및 관리 — Metric 생성, Key Mapping, Preview 설정 방법
* E-5. Run Eval — 평가 Run 실행 및 이력 확인 방법
* E-6. Eval Result — 평가 결과 확인, Error, Retry 관리 방법
* E-7. Dashboard — 평가 결과 시각화 및 분석 방법
