Update README.md
Browse files
README.md
CHANGED
|
@@ -1,4 +1,11 @@
|
|
| 1 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 2 |
|
| 3 |
Speech-to-Text model combining:
|
| 4 |
- **Audio Encoder**: Qwen3-Omni-30B-A3B-Instruct (pretrained weights)
|
|
@@ -20,12 +27,12 @@ import torchaudio
|
|
| 20 |
|
| 21 |
# Load model
|
| 22 |
model = SoriSpeechForConditionalGeneration.from_pretrained(
|
| 23 |
-
"Seungyoun/
|
| 24 |
torch_dtype=torch.bfloat16,
|
| 25 |
device_map="auto",
|
| 26 |
trust_remote_code=True,
|
| 27 |
)
|
| 28 |
-
tokenizer = AutoTokenizer.from_pretrained("Seungyoun/
|
| 29 |
|
| 30 |
# Process audio
|
| 31 |
audio, sr = torchaudio.load("speech.wav")
|
|
@@ -44,4 +51,4 @@ mel_spec = torch.log(mel_transform(audio) + 1e-6)
|
|
| 44 |
|
| 45 |
## License
|
| 46 |
|
| 47 |
-
Apache 2.0 (following Qwen3-Omni and Qwen3 licenses)
|
|
|
|
| 1 |
+
---
|
| 2 |
+
language:
|
| 3 |
+
- ko
|
| 4 |
+
- en
|
| 5 |
+
base_model:
|
| 6 |
+
- Qwen/Qwen3-4B-Instruct-2507
|
| 7 |
+
---
|
| 8 |
+
# Sori-4B
|
| 9 |
|
| 10 |
Speech-to-Text model combining:
|
| 11 |
- **Audio Encoder**: Qwen3-Omni-30B-A3B-Instruct (pretrained weights)
|
|
|
|
| 27 |
|
| 28 |
# Load model
|
| 29 |
model = SoriSpeechForConditionalGeneration.from_pretrained(
|
| 30 |
+
"Seungyoun/Sori-4B",
|
| 31 |
torch_dtype=torch.bfloat16,
|
| 32 |
device_map="auto",
|
| 33 |
trust_remote_code=True,
|
| 34 |
)
|
| 35 |
+
tokenizer = AutoTokenizer.from_pretrained("Seungyoun/Sori-4B")
|
| 36 |
|
| 37 |
# Process audio
|
| 38 |
audio, sr = torchaudio.load("speech.wav")
|
|
|
|
| 51 |
|
| 52 |
## License
|
| 53 |
|
| 54 |
+
Apache 2.0 (following Qwen3-Omni and Qwen3 licenses)
|