> For the complete documentation index, see [llms.txt](https://docs.datumo.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.datumo.com/documentation/redteaming/undefined-1/2.-auto-redteaming.md).

# 2. Auto Redteaming 실행

## 1. 레드티밍 평가 실행 (Run Attack Set)

> Attack Set을 생성하면 자동 레드티밍 평가가 실행되며, 여러 레드티밍 전략을 자동으로 적용해 모델의 안전성을 검증합니다.

***

### 화면 구성 <a href="#undefined" id="undefined"></a>

Auto Red Teaming은 **Task → Attack Set → Result** 구조로 구성됩니다.

| 화면                     | 설명                        | 주요 동작                                   |
| ---------------------- | ------------------------- | --------------------------------------- |
| Task 목록                | 생성된 Task 목록과 전체 상태 표시     | Task 생성 / Task 선택                       |
| Task 상세 - Dashboard 탭  | Task 단위의 전체 결과 요약         | 모델별 결과 비교, 상세 결과 확인                     |
| Task 상세 - Attack Set 탭 | Task에 포함된 Attack Set 목록   | Attack Set / Auto Red Teaming Run 상태 확인 |
| Attack Set 상세          | 개별 Attack Set의 실행 상태 및 결과 | Auto Red Teaming 결과 확인                  |

***

### 1. Task 생성 <a href="#step-1-task" id="step-1-task"></a>

Task는 평가(Evaluation)를 관리하는 기본 단위이자, 여러 Attack Set을 묶는 컨테이너입니다.

<figure><img src="/files/2wSw3uhWPcWoArNyaL06" alt=""><figcaption></figcaption></figure>

**1.** `+ New Task` **버튼 클릭**

Task 목록 우측 상단의 `+ New Task` 버튼을 클릭합니다.

**2. Task 정보 입력**

| 항목               | 설명                  |
| ---------------- | ------------------- |
| Task Name (필수)   | Task 이름 (최대 255자)   |
| Description (선택) | Task 설명 (최대 1,000자) |

**3. Complete**

`Complete` 버튼을 클릭하면 Task가 생성되고 목록으로 이동합니다.

***

### 2. Attack Set 생성 <a href="#step-2-attack-set" id="step-2-attack-set"></a>

Attack Set은 실제 레드티밍 평가가 수행되는 실행 단위입니다. Task 상세 화면에서 Attack Set을 추가하면 설정 완료 후 평가가 자동으로 실행됩니다.

**1. Task 상세 진입**

Task 목록에서 원하는 Task 행을 클릭해 상세 화면으로 이동합니다.

<figure><img src="/files/uSpQbSWkRYzUdDMI7qDl" alt=""><figcaption></figcaption></figure>

**2.** `+ Add Attack Set`  **버튼 클릭**

Attack Set 탭에서 `+ Add Attack Set` 버튼을 클릭합니다. 생성 모달은 좌측에 Benchmark Dataset 선택 영역, 우측에 평가 설정 입력 영역으로 구성됩니다.

<figure><img src="/files/S0te17ohBsnI1r1xqQlI" alt=""><figcaption></figcaption></figure>

**3. Dataset 선택 (좌측)**

레드티밍 평가에 사용할 Benchmark Dataset을 선택합니다. Dataset은 Risk Taxonomy 기준으로 구성된 Seed 집합이며, 검색으로 목록을 필터링할 수 있습니다.

<figure><img src="/files/AiNVntgpPgmG3s5n08dn" alt=""><figcaption></figcaption></figure>

**④ 설정 입력 (우측)**

<table><thead><tr><th width="65.32421875">단계</th><th>항목</th><th>설명</th></tr></thead><tbody><tr><td>1</td><td>Attack Set Name / Description</td><td>이름(필수), 설명(선택)</td></tr><tr><td>2</td><td>Target Model/Agent</td><td>평가 대상 모델 (다중 선택 가능)</td></tr><tr><td>3</td><td>Max Red Teaming Runs</td><td>시드당 최대 공격 횟수 (기본 20, 최대 50)</td></tr><tr><td>4</td><td>Evaluation Sampling Method</td><td>(샘플링 진행 시) 데이터셋 샘플링 방식 선택</td></tr></tbody></table>

<figure><img src="/files/RTK9uWEzKO4XjOZBWaTb" alt=""><figcaption></figcaption></figure>

<details>

<summary>📂 Sampling Method 상세</summary>

</details>

> **참고** &#x20;
>
> * Benchmark Dataset은 Taxonomy별로 포함된 Seed 수가 다를 수 있습니다. Evaluation Sampling Method는 이 차이를 평가에 어떤 기준으로 반영할지 선택하는 옵션입니다.
> * 여러 모델을 선택하면 동일한 Dataset과 설정을 공유하는 Attack Set이 모델별로 각각 생성되어, 결과를 직접 비교할 수 있습니다.

***

### 3. 평가 실행 <a href="#step-3" id="step-3"></a>

Attack Set 설정이 완료되면 레드티밍 평가를 실행할 수 있습니다.

**1.** `Complete` **버튼 클릭**

설정을 마치고 `Complete` 버튼을 클릭하면 최종 확인 모달이 표시됩니다.

<figure><img src="/files/NprrPPfqAbCWjAkF23nH" alt=""><figcaption></figcaption></figure>

> ⚠️ 실행 전 확인
>
> 평가는 시작 후 일시정지하거나 중지할 수 없습니다. 실행 시간은 선택한 Dataset 크기와 설정에 따라 달라집니다.

**2.** `Proceed` **버튼 클릭**

`Proceed` 버튼을 클릭하면 평가가 즉시 시작됩니다. 평가가 시작되면 Attack Set 상태가 **In Progress (Red teaming in progress)**&#xB85C; 표시되며, 페이지를 벗어나도 평가는 백그라운드에서 계속 실행됩니다.

<figure><img src="/files/Y5GVZDOjw1NoaXfrbrZM" alt=""><figcaption></figcaption></figure>

**3. 실행 상태 확인**

평가 진행 상태는 Attack Set 목록과 상세 화면에서 확인할 수 있습니다.

| 상태          | 설명            |
| ----------- | ------------- |
| Waiting     | 대기 중          |
| In Progress | 진행 중 (진행률 표시) |
| Done        | 완료            |
| Error       | 오류            |

<figure><img src="/files/7G5bzjpfvNyD7cV8Xa1o" alt=""><figcaption></figcaption></figure>

***

### 4. 관리 기능 <a href="#step-4" id="step-4"></a>

Auto Red Teaming은 평가 결과의 재현성과 무결성을 보장하기 위해 Task와 Attack Set에 제한적인 관리 기능만 제공합니다.

#### Task 관리 <a href="#id-1-task" id="id-1-task"></a>

Task는 여러 Attack Set을 묶는 상위 단위로, Task 단위의 수정·삭제는 하위 Attack Set 상태에 따라 제한됩니다.

* **수정** &#x20;
  * Task 목록 화면에서 `Edit` 버튼을 클릭해 Name과 Description을 수정합니다. 평가 실행 여부와 관계없이 가능하며, 평가 결과에는 영향을 주지 않습니다.
* **삭제**
  * Task 목록 화면에서 수행하며, 포함된 모든 Attack Set이 Done 상태일 때만 가능합니다. 삭제하면 해당 Task의 모든 Attack Set과 평가 결과가 함께 지워지며, 복구할 수 없습니다.

> 💡 참고: 실행 중이거나 미완료된 평가가 있으면 결과의 무결성을 보호하기 위해 Task 삭제가 제한됩니다.

<figure><img src="/files/woUXMj6wWnorXRgKbmyI" alt=""><figcaption></figcaption></figure>

***

#### Attack Set 관리 <a href="#id-2-attack-set" id="id-2-attack-set"></a>

Attack Set은 실제 평가가 수행되는 실행 단위로, 평가 조건은 변경할 수 없습니다. 삭제는 Task 상세 > Attack Set 탭의 개별 행에서 수행합니다.

| 항목                   | 관리 가능 여부        | 설명         |
| -------------------- | --------------- | ---------- |
| Name / Description   | 수정 가능           | 식별 및 관리 목적 |
| Dataset              | 수정 불가           | 평가 재현성 보장  |
| Target Model / Agent | 수정 불가           | 비교 신뢰성 보장  |
| Sampling Method      | 수정 불가           | 결과 일관성 유지  |
| 삭제                   | `Done` 상태에서만 가능 | 실행 중 보호    |

***

### 🔗 관련 문서

* R-1. Benchmark Set 관리 — 공격 시뮬레이션용 Seed 및 Risk Taxonomy 구성 확인 방법
* R-3. Dashboard — ASR, Score 등 안전성 평가 결과 시각화 및 분석 방법
