FireRedASR-AED / README.md
Axera's picture
unify documentation into README.md
1303e53
|
Raw
History Blame Contribute Delete
2.11 kB
---
license: apache-2.0
pipeline_tag: audio-to-audio
tags:
- axmodel
- axera
- FireRedASR-AED
---
# FireRedASR-AED
小红书 ASR AED-L 在 AX650N 上的 NPU 部署(原项目:
[FireRedTeam/FireRedASR](https://github.com/FireRedTeam/FireRedASR))。
支持中文、英文,最长 10s 输入,超长音频自动 VAD 切分。
## 模型
| 文件 | 说明 |
|------|------|
| `axmodel/encoder.axmodel` / `axmodel/decoder_loop.axmodel` | Pulsar2 7.0-lite 重转换(encoder U16 + decoder U8 密集校准) |
| `fsmn_vad/fsmn_vad_10s_fp32.axmodel` + `fsmn_vad/am.mvn` | FSMN-VAD(FunASR)NPU 语音门控 |
## VAD 说明(2026-08-24)
- 超长音频按 10s 块处理;每块用 FSMN-VAD 判断是否含语音,
检出语音 ≥ 1s 才整块送 ASR,静音/噪声块直接返回空。
- 适配远场/低信噪比录音:3 分钟立体声录音可输出完整转写,
同时静音/噪声不产生幻觉。
## 指标(AX650N,4 条测试语音)
- CER:3.37%
- RTF:约 0.3(Python),0.225(C++ SDK)
## 使用
```bash
conda create -n fireredasr python=3.12
conda activate fireredasr
pip install -r requirements.txt
pip install axengine-0.1.3-py3-none-any.whl # pyaxengine
python openai/openai_server.py \
--encoder axmodel/encoder.axmodel \
--decoder axmodel/decoder_loop.axmodel \
--fsmn-vad fsmn_vad/fsmn_vad_10s_fp32.axmodel \
--fsmn-cmvn fsmn_vad/am.mvn \
--cmvn axmodel/cmvn.ark --dict axmodel/dict.txt \
--pe axmodel/pe.npy --max-dur 10 --max-steps 128
```
## OpenAI API
- C++ 预编译:`cpp/bin/firered_openai_server``cpp/bin/firered_openai_client`
(用法见 `cpp/bin/README.md`
- Python:`openai/openai_server.py``openai/openai_client.py`(stdlib,零额外依赖)
- Python ASR 核心:`openai/firered_asr.py` + `openai/fsmn_vad_post.py`
(numpy + pyaxengine + kaldi-native-fbank,无 torch/onnxruntime)
- 端点:`POST /v1/audio/transcriptions`(multipart `file`)、`GET /v1/models`
7.0 重转换、C++ SDK 源码与构建说明见
[GitHub](https://github.com/ml-inory/FireRedASR.axera)(`cpp/``reports/`)。