> For the complete documentation index, see [llms.txt](https://docs.datumo.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.datumo.com/documentation/evaluation-lab/undefined.md).

# 핵심 개념과 구조

## **Evaluation Lab**

Evaluation Lab은 사람이 직접 AI 모델을 공격해 안전성 위험을 파악하는 Human Red Teaming  워크플로우입니다.

관리자는 공격 목표(Objective)와 평가 기준(Judge)을 설정해 Red Teaming Task를 생성합니다. 테스터는 Annotation Queue에서 모델을 직접 공격하며 취약점을 탐색하고, 그 결과는 설정된 Judge에 따라 평가됩니다.

### **1. 주요 용어**

<table><thead><tr><th width="248.28125">용어</th><th>설명</th></tr></thead><tbody><tr><td><strong>Task</strong></td><td>레드티밍 이벤트의 단위입니다. Target Model, Objective 목록, 테스터 명단, Judge 설정으로 구성됩니다.</td></tr><tr><td><strong>Objective</strong></td><td>유발하려는 특정 실패 유형입니다. 제목과 기대 응답, 개별 Judge 설정을 포함합니다.</td></tr><tr><td><strong>Judge</strong></td><td>제출물을 채점하는 방식입니다. Preset Rubric, Custom Rubric, Self Evaluation 세 가지 모드를 지원합니다.</td></tr><tr><td><strong>Submission</strong></td><td>테스터가 수행한 하나의 공격 시도입니다. 전체 대화 기록과 테스터의 자가 판정(Attack Succeeded/Attack Blocked), 코멘트를 포함합니다.</td></tr><tr><td><strong>Verdict</strong></td><td>제출물에 대한 최종 판정입니다. Attack Succeeded 또는 Attack Blocked 중 하나의 값을 가지며, Judge 설정에 따라 결정됩니다.</td></tr><tr><td><strong>ASR (Attack Success Rate)</strong></td><td>전체 공격 시도 대비 성공한 공격의 비율입니다.</td></tr></tbody></table>

### 2. 활용 사례 <a href="#undefined" id="undefined"></a>

* **릴리즈 전 안전성 검증** — 모델을 배포하기 전에 어떤 공격에 취약한지 사전에 파악합니다.
* **운영 중인 시스템 점검** — 이미 서비스 중인 AI 시스템을 주기적으로 점검해 위험을 추적합니다.
* **내부 레드팀 운영** — 여러 테스터가 참여하는 레드팀 이벤트를 진행하고 결과를 한곳에 집계합니다.

***

### **3. 동작 방식**

Evaluation Lab은 설정 → 공격 → 분석 세 단계로 진행되며, 아래 순서로 사용하는 것을 권장합니다.

**1.Task 생성 및 설정**\
레드티밍할 Target Model을 선택하고 Objective와 Judge를 구성합니다.

**2. 테스터 공격 수행**\
테스터가 Annotation Queue에서 Active 상태의 Task를 확인하고, 멀티턴 대화로 공격을 수행한 뒤 결과를 제출합니다.

**3. 결과 확인 및 Task 관리**\
Dashboard에서 ASR, Successes 등의 지표로 취약 지점을 분석합니다. Task Config에서는 Objective 추가, Judge 수정, 테스터 배정, Task 활성화·비활성화 등 운영 전반을 관리할 수 있습니다.
