> For the complete documentation index, see [llms.txt](https://docs.datumo.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.datumo.com/documentation/redteaming/undefined.md).

# 핵심 개념과 구조

Datumo Redteaming은 LLM의 안전성 리스크를 자동으로 평가합니다.

동일한 벤치마크 데이터셋의 시드(Seed), Algorithm, Judge Model 로 다양한 Target Model 들에 대해 Red Teaming 을 수행하고 ASR, Safe/Unsafe 판정, 최종 시간 및 비용, Taxonomy 별 히트맵 등으로 결과를 표현하여, 타겟 모델이 어떤 위험 유형과 어떤 공격 방식에 취약한지 일관된 기준으로 확인할 수 있습니다.

## 주요 용어

<table data-search="false"><thead><tr><th width="218.046875">용어</th><th>설명</th></tr></thead><tbody><tr><td><strong>Seed Set</strong></td><td>Domain 과 Taxonomy 기준으로 구성된 공격 시뮬레이션용 Seed 데이터입니다.</td></tr><tr><td><strong>Target Model</strong></td><td>취약점을 파악하고자 하는 공격 대상 LLM 모델입니다.</td></tr><tr><td><strong>Risk Taxonomy</strong></td><td>AI 모델의 안전성을 다각도로 검증하기 위해 정의된 유해성 평가 분류 체계입니다.</td></tr><tr><td><strong>Algorithm</strong></td><td>공격 프롬프트를 생성하기 위해 적용되는 Red-Teaming 전략입니다. 싱글턴과 멀티턴이 구분되어 있습니다.</td></tr><tr><td><strong>Attack Strategy</strong></td><td>공격 프롬프트를 생성하는 Algorithm에서 사용 가능한 공격 전략들입니다 (ex. 롤플레잉, 근거 기반 감정 호소 등등)</td></tr><tr><td><strong>Attacker</strong></td><td>시드를 공격 프롬프트로 변환하는 과정에서 사용되는 생성 AI 모듈로, 직접 어떤 모듈을 사용할지 Model Setting 내 configuration에서 선택하실 수 있습니다.</td></tr><tr><td><strong>Jailbreak</strong></td><td>Target Model이 공격에 의해 유해하거나 부적절한 답변을 생성하는 경우를 의미합니다.</td></tr><tr><td><strong>Run</strong></td><td>Target Model 1개 버전에 대한 Red Teaming 실행을 의미합니다.</td></tr><tr><td><strong>Batch</strong></td><td>같은 Seed, 같은 Algorithm, 같은 Judge Model 로 다양한 Target Model 들에대해 수행된 Run 의 집합입니다.</td></tr></tbody></table>

## 활용 사례 <a href="#undefined" id="undefined"></a>

* **배포 전 안전성 검증** — 모델을 배포하기 전에 어떤 공격에 취약한지 사전에 파악합니다.
* **운영 중인 시스템 점검** — 이미 서비스 중인 AI 시스템을 주기적으로 점검해 리스크를 추적하고 예방합니다.

## 동작 방식 <a href="#ai-red-teaming" id="ai-red-teaming"></a>

Datumo Red Teaming은 준비 → 실행 → 분석 세 단계로 진행되며, 아래 순서로 사용하는 것을 권장합니다.

### **1. 준비**

공격 시뮬레이션에 사용할 Target Model을 설정하고, Seed 를 생성하고, Risk Taxonomy 구성을 확인하고, Algorithm 구성을 확인합니다.

### **2. 실행**

타겟 모델의 버전별로 자동 레드티밍 Run 을 실행합니다.

### **3. 분석**

Dashboard 에서 ASR, Score 등의 지표로 취약 지점을 분석합니다.
