> For the complete documentation index, see [llms.txt](https://docs.datumo.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.datumo.com/documentation/readme/quickstart.md).

# Quickstart

{% tabs %}
{% tab title="Evaluation Quick Start" %}

<figure><img src="/files/4SGjhVBlvXTi0bGm0W73" alt=""><figcaption></figcaption></figure>

{% hint style="info" %}
Evaluation Quick Start? Head to the [Basics](/documentation/evaluation/editor.md) section to learn more.
{% endhint %}

### Workspace 생성 & Application 만들기

Workspace를 생성하고 평가 대상인 Application을 등록해야 합니다.

Application은 평가·모니터링의 기본 단위이기 때문에, 어떤 AI 서비스를 평가할 것인지 먼저 정의해야 이후 Criteria, Benchmark Set, Metric, Run Evaluation 등의 설정을 연결할 수 있습니다.

<figure><img src="/files/RBBRKyeFapX1E7SOWUfm" alt=""><figcaption></figcaption></figure>

### **Judge Model 연결**&#x20;

평가에 사용할 LLM Judge 모델을 등록합니다.\
Judge Model은 LLM-as-a-Judge 기반 Metric에서 평가 결과를 산출하는 데 사용됩니다.

Pre-trial 환경에서는 기본 Judge Model이 사전에 등록되어 있으므로 별도 설정 없이 사용할 수 있습니다.

별도 모델을 사용하는 경우, Chat Completion API 형식에 맞춰 API URL, API Key, 모델명 등 필요한 정보를 입력하여 Judge Model을 등록합니다.

<figure><img src="/files/dB22dht1vkASKfuzHOIM" alt=""><figcaption></figcaption></figure>

### **Criteria 생성 & Template Task 추가**

평가 기준이 되는 Criteria를 생성한 후, Template Task를 추가합니다.\
Template Task를 사용하면 Metric과 Benchmark Set의 기본 설정이 함께 구성되므로, Custom Task를 직접 만드는 것보다 빠르게 평가 환경을 설정할 수 있습니다.

<figure><img src="/files/MtCAwXiNu7LkLs91EYYA" alt=""><figcaption></figcaption></figure>

### **Run Eval 실행**

평가를 진행합니다.

<figure><img src="/files/MCzoCRx5P0tjWa6LNNH3" alt=""><figcaption></figcaption></figure>

### **결과 확인**&#x20;

Eval Result에서 Score 확인할 수 있습니다.

<figure><img src="/files/AAGRIzWDawIrfj2P3vv6" alt=""><figcaption></figcaption></figure>
{% endtab %}

{% tab title="Red Teaming Quick Start" %}

### Benchmark 셋 선택

Task 평가에 사용할 Benchmark Set을 선택합니다.\
기본 탑재된 Benchmark Set을 확인하고, 평가 목적에 맞는 데이터를 선택하여 사용할 수 있습니다.

<figure><img src="/files/gB6LNs3g5Ao3DHruWoof" alt=""><figcaption></figcaption></figure>

<figure><img src="/files/ZvCS58gukFgI1EASORdt" alt=""><figcaption></figcaption></figure>

### Auto Redteaming 실행

평가에 사용할 Attack Method와 공격 대상 모델을 설정한 후 레드티밍 평가를 실행합니다.

<figure><img src="/files/VE6Zl7XAEHWPdkMzP6z2" alt=""><figcaption></figcaption></figure>

### 결과 확인

평가 실행 후 Dashboard에서 공격 성공률과 실패율을 확인하고, 모델의 안전성 취약 지점을 분석할 수 있습니다.

<figure><img src="/files/fBtk4haeHbfPPrmiOUaL" alt=""><figcaption></figcaption></figure>
{% endtab %}

{% tab title="데이터 생성 Quick Start" %}

AI를 활용하여 Benchmark Set 데이터를 생성하거나 기존 데이터를 수정할 수 있습니다.

### 생성 템플릿 선택

<figure><img src="/files/050MjvAXlTpU0w5IbdZE" alt=""><figcaption></figcaption></figure>

### 생성 조건 입력

생성할 컬럼과 데이터 생성에 필요한 정보를 입력합니다.\
입력한 조건은 AI가 Benchmark Set 데이터를 생성하는 기준으로 사용됩니다.

필요한 경우 Draft를 추가하여 지시사항을 구체화할 수 있습니다.

<figure><img src="/files/B3mmmAgC1pVap443iHN1" alt=""><figcaption></figcaption></figure>

### 데이터 생성

입력한 조건을 바탕으로 데이터를 생성합니다.\
생성 결과를 확인한 후, 만족스러운 경우 Benchmark Set 데이터로 저장할 수 있습니다.

<figure><img src="/files/yjGvOtzGaO3zKA6Uch87" alt=""><figcaption></figcaption></figure>
{% endtab %}
{% endtabs %}
