File size: 4,575 Bytes
878a3d0
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
---
license: apache-2.0
language:
- ko
base_model:
- LGAI-EXAONE/EXAONE-4.0-1.2B
tags:
- speech-to-text
- korean
- audio
- voice
- bigdefence
- EXAONE
- LG
pipeline_tag: audio-text-to-text
---

## 🎧 Bigvox

- **Bigvox**은 한국어 음성 인식에 특화된 고성능, 저지연 음성 언어 멀티모달 모델입니다. [LGAI-EXAONE/EXAONE-4.0-1.2B](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-1.2B) 기반으로 구축되었습니다. 🚀
- **End-to-End** 음성 멀티모달 구조를 채택하여 음성 입력부터 텍스트 출력까지 하나의 파이프라인에서 처리하며, 추가적인 중간 모델 없이 자연스럽게 멀티모달 처리를 지원합니다.


![image/png](https://cdn-uploads.huggingface.co/production/uploads/653494138bde2fae198fe89e/d7YWXLrfOnuVSjn_ndIon.png)


### 📂 모델 접근
- **GitHub**: [bigdefence/bigvox-exaone](https://github.com/bigdefence/bigvox-exaone) 🌐
- **HuggingFace**: [bigdefence/Bigvox-Exaone4-Audio](https://huggingface.co/bigdefence/Bigvox-Exaone4-Audio) 🤗
- **모델 크기**: 2B 파라미터 📊

## 🌟 주요 특징

- **🇰🇷 한국어 특화**: 한국어 음성 패턴과 언어적 특성에 최적화
- **⚡ 경량화**: 2B 파라미터로 효율적인 추론 성능
- **🎯 고정확도**: 다양한 한국어 음성 환경에서 우수한 성능
- **🔧 실용성**: 실시간 음성 인식 애플리케이션에 적합

## 📋 모델 정보

| 항목 | 세부사항 |
|------|----------|
| **기반 모델** | LGAI-EXAONE/EXAONE-4.0-1.2B |
| **언어** | 한국어 (Korean) |
| **모델 크기** | ~2B 파라미터 |
| **작업 유형** | Speech-to-Text 음성 멀티모달 |
| **라이선스** | Apache 2.0 |

### 🔧 레포지토리 다운로드 및 환경 설정

**Bigvox**을 시작하려면 다음과 같이 레포지토리를 클론하고 환경을 설정하세요. 🛠️

1. **레포지토리 클론**:
   ```bash
   git clone https://github.com/bigdefence/bigvox-exaone
   cd bigvox-exaone
   ```

2. **의존성 설치**:
   ```bash
   bash setting.sh
   ```

### 📥 다운로드 방법

**Huggingface CLI 사용**:
```bash
pip install -U huggingface_hub
huggingface-cli download bigdefence/Bigvox-Exaone4-Audio --local-dir ./checkpoints
```

**Snapshot Download 사용**:
```bash
pip install -U huggingface_hub
```
```python
from huggingface_hub import snapshot_download
snapshot_download(
  repo_id="bigdefence/Bigvox-Exaone4-Audio",
  local_dir="./checkpoints",
  resume_download=True
)
```

**Git 사용**:
```bash
git lfs install
git clone https://huggingface.co/bigdefence/Bigvox-Exaone4-Audio
```

### 🛠️ 의존성 모델
- **Speech Encoder**: [Whisper-large-v3](https://huggingface.co/openai/whisper-large-v3) 🎤

### 🔄 로컬 추론

**Bigvox**으로 추론을 수행하려면 다음 단계를 따라 모델을 설정하고 로컬에서 실행하세요. 📡

1. **모델 준비**:
   - [HuggingFace](https://huggingface.co/bigdefence/Bigvox-Exaone4-Audio)에서 **Bigvox** 다운로드 📦
   - [HuggingFace](https://huggingface.co/openai/whisper-large-v3)에서 **Whisper-large-v3** 음성 인코더를 다운로드하여 `./models/speech_encoder/` 디렉토리에 배치 🎤

2. **추론 실행**:
   - **음성-텍스트(S2T)** 추론:<br>
     - **Non-streaming**
     ```bash
     python3 omni_speech/infer/bigvox.py --query_audio test_audio.wav
     ```
     - **Streaming**
     ```bash
     python3 omni_speech/infer/bigvox_streaming.py --query_audio test_audio.wav
     ```

## 🔧 훈련 세부사항

### 훈련 설정
- **Base Model**: LGAI-EXAONE/EXAONE-4.0-1.2B
- **Hardware**: 1x NVIDIA RTX 6000A GPU
- **Training Time**: 4시간

## ⚠️ 제한사항

- 배경 소음이 심한 환경에서는 성능이 저하될 수 있습니다
- 매우 빠른 발화나 중얼거리는 말투에 대해서는 인식률이 떨어질 수 있습니다
- 전문 용어나 고유명사에 대한 인식률은 도메인에 따라 차이가 있을 수 있습니다

## 📞 문의사항

- **개발**: BigDefence

## 📈 업데이트 로그

### v1.0.0 (2024.12)
- 🎉 **초기 모델 릴리즈**: Bigvox 공개
- 🇰🇷 **한국어 특화**: LGAI-EXAONE/EXAONE-4.0-1.2B 기반 한국어 음성-텍스트 음성 멀티모달 모델
---

## 🤝 기여하기

**Bigvox** 프로젝트에 기여하고 싶으시다면:
---

**BigDefence**와 함께 한국어 AI 음성 인식의 미래를 만들어가세요! 🚀🇰🇷

*"Every voice matters, every word counts - 모든 목소리가 중요하고, 모든 말이 가치 있습니다"*