File size: 3,631 Bytes
68f5f5e
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
# Benchmark 데이터셋 배포 ꡬ성

Hugging Face Dataset μ €μž₯μ†Œλ₯Ό μ•„λž˜ λ‹¨μœ„λ‘œ κ΄€λ¦¬ν•©λ‹ˆλ‹€. 개인 κ³„μ •μ—μ„œ λ¨Όμ € λ°°ν¬ν•˜κ³ 
κ²€μ¦ν•œ λ’€, ν•„μš”ν•˜λ©΄ 각 μ €μž₯μ†Œλ₯Ό `KETI-NLP` 쑰직으둜 μ΄μ „ν•©λ‹ˆλ‹€.
μ•„λž˜ μ €μž₯μ†Œ ID와 κ²½λ‘œλŠ” 배포할 λ•Œ μ‚¬μš©ν•  μ œμ•ˆμ΄λ©°, 아직 μƒμ„±λœ μ €μž₯μ†Œλ₯Ό μ˜λ―Έν•˜μ§€ μ•ŠμŠ΅λ‹ˆλ‹€.

| ν‘œμ‹œ 이름 | 개인 μ €μž₯μ†Œ ID μ œμ•ˆ | 포함 데이터셋 |
| --- | --- | --- |
| μ§„μ‹€μ„± Benchmark | `DoolyKim22/Truthfulness-Benchmark` | 일반 상식, 수치 정보, 팩트 체크, λ©€ν‹° λͺ¨λ‹¬ |
| μ†Œλ²„λ¦° Benchmark | `DoolyKim22/Sovereign-Benchmark` | μ†Œλ²„λ¦° |
| K-Prism | `DoolyKim22/K-Prism` | K-Prism Text / Image νŠΈλž™ |

μ§„μ‹€μ„±μ˜ λ„€ ν•­λͺ©μ€ ν•˜λ‚˜μ˜ μ €μž₯μ†Œ μ•ˆμ—μ„œ λ³„λ„μ˜ configuration으둜 μ œκ³΅ν•©λ‹ˆλ‹€.
각 ν•­λͺ©μ˜ 원본 ν•„λ“œμ™€ μ •λ‹΅ μ²΄κ³„λŠ” μœ μ§€ν•˜λ©°, ν•˜λ‚˜μ˜ JSON으둜 ν•©μΉ˜μ§€ μ•ŠμŠ΅λ‹ˆλ‹€.
이 ꡬ성은 데이터 배포 λ‹¨μœ„μ΄λ©°, λ¦¬λ”λ³΄λ“œμ˜ 평가 ν•­λͺ©μ΄λ‚˜ 평균 계산은 λ³€κ²½ν•˜μ§€ μ•ŠμŠ΅λ‹ˆλ‹€.

## μ§„μ‹€μ„± Benchmark

λ‹€μŒμ€ JSON ν˜•μ‹μ˜ 평가 데이터λ₯Ό μ‚¬μš©ν•˜λŠ” 폴더 ꡬ쑰 μ˜ˆμ‹œμž…λ‹ˆλ‹€.
μ‹€μ œ 파일λͺ…κ³Ό ν˜•μ‹μ€ 원본을 ν™•μΈν•œ ν›„ λ°˜μ˜ν•©λ‹ˆλ‹€.

```text
truthfulness-benchmark/
β”œβ”€β”€ README.md
β”œβ”€β”€ general-knowledge/
β”‚   └── test.json
β”œβ”€β”€ numerical/
β”‚   └── test.json
β”œβ”€β”€ fact-check/
β”‚   └── test.json
└── multimodal/
    β”œβ”€β”€ test.json
    └── images/
```

ν•΄λ‹Ή ν΄λ”μ˜ README 상단에 μ•„λž˜ 섀정을 λ„£μœΌλ©΄ λ„€ ν•­λͺ©μ„ λ”°λ‘œ 선택할 수 μžˆμŠ΅λ‹ˆλ‹€.
κ²½λ‘œλŠ” μœ„ μ˜ˆμ‹œμ— ν•΄λ‹Ήν•˜λ©°, μ‹€μ œ 파일 κ²½λ‘œμ™€ μΌμΉ˜μ‹œμΌœμ•Ό ν•©λ‹ˆλ‹€.

```yaml
---
language:
- ko
configs:
- config_name: general_knowledge
  data_files:
  - split: test
    path: general-knowledge/test.json
- config_name: numerical
  data_files:
  - split: test
    path: numerical/test.json
- config_name: fact_check
  data_files:
  - split: test
    path: fact-check/test.json
- config_name: multimodal
  data_files:
  - split: test
    path: multimodal/test.json
---
```

## μ†Œλ²„λ¦° Benchmark

```text
sovereign-benchmark/
β”œβ”€β”€ README.md
└── test.json
```

원본이 μ—¬λŸ¬ 파일 λ˜λŠ” ν•˜μœ„ 평가 ν•­λͺ©μœΌλ‘œ λ‚˜λ‰˜μ–΄ μžˆλ‹€λ©΄ κ·Έ ꡬ쑰λ₯Ό μœ μ§€ν•˜κ³ ,
ν•„μš”μ— 따라 μ†Œλ²„λ¦° μ €μž₯μ†Œ μ•ˆμ—λ„ configurationsλ₯Ό μ •μ˜ν•©λ‹ˆλ‹€.

## μ—…λ‘œλ“œ

1. <https://huggingface.co/new-dataset>μ—μ„œ 각 Dataset μ €μž₯μ†Œλ₯Ό μƒμ„±ν•©λ‹ˆλ‹€.
2. κ³΅κ°œν•  원본 데이터와 데이터 μ„€λͺ… READMEλ₯Ό 각각의 배포 폴더에 μ€€λΉ„ν•©λ‹ˆλ‹€.
   READMEμ—λŠ” ν•­λͺ©λ³„ 좜처, ν•„λ“œ, 평가 방식, λΌμ΄μ„ μŠ€λ₯Ό κΈ°μž¬ν•©λ‹ˆλ‹€.
3. λ‹€μŒ λͺ…λ Ήμ˜ `/μ‹€μ œ/경둜/` 뢀뢄을 μ€€λΉ„ν•œ 폴더 경둜둜 λ°”κΏ” μ‹€ν–‰ν•©λ‹ˆλ‹€.

```bash
hf upload DoolyKim22/Truthfulness-Benchmark \
  "/μ‹€μ œ/경둜/truthfulness-benchmark" . --repo-type dataset

hf upload DoolyKim22/Sovereign-Benchmark \
  "/μ‹€μ œ/경둜/sovereign-benchmark" . --repo-type dataset
```

μ΄λ―Έμ§€λŠ” annotationμ—μ„œ μ°Έμ‘°ν•˜λŠ” μƒλŒ€ 경둜λ₯Ό μœ μ§€ν•˜μ—¬ ν•¨κ»˜ μ—…λ‘œλ“œν•©λ‹ˆλ‹€.
`static-space/front/data/benchmark.json`은 λͺ¨λΈλ³„ 점수 파일이며 평가 원본이 μ•„λ‹™λ‹ˆλ‹€.
ν˜„μž¬ 이 μž‘μ—… ν΄λ”μ—μ„œ λ‹€μ„― ν•­λͺ©μ˜ 원본 μœ„μΉ˜λŠ” ν™•μΈλ˜μ§€ μ•Šμ•˜μŠ΅λ‹ˆλ‹€.
원본 경둜λ₯Ό ν™•μΈν•œ λ’€ 배포 폴더λ₯Ό κ΅¬μ„±ν•˜κ³  이미지 참쑰와 데이터 ν˜•μ‹μ„ 검증해야 ν•©λ‹ˆλ‹€.

μ°Έκ³ : [데이터셋 μ—…λ‘œλ“œ](https://huggingface.co/docs/hub/datasets-adding),
[μ—¬λŸ¬ 데이터셋 ꡬ성](https://huggingface.co/docs/hub/datasets-data-files-configuration).