metadata
license: apache-2.0
pipeline_tag: audio-to-audio
tags:
- axmodel
- axera
- FireRedASR-AED
FireRedASR-AED
小红书 ASR AED-L 在 AX650N 上的 NPU 部署(原项目: FireRedTeam/FireRedASR)。 支持中文、英文,最长 10s 输入,超长音频自动 VAD 切分。
模型
| 文件 | 说明 |
|---|---|
axmodel/encoder.axmodel / axmodel/decoder_loop.axmodel |
Pulsar2 7.0-lite 重转换(encoder U16 + decoder U8 密集校准) |
fsmn_vad/fsmn_vad_10s_fp32.axmodel + fsmn_vad/am.mvn |
FSMN-VAD(FunASR)NPU 语音门控 |
VAD 说明(2026-08-24)
- 超长音频按 10s 块处理;每块用 FSMN-VAD 判断是否含语音, 检出语音 ≥ 1s 才整块送 ASR,静音/噪声块直接返回空。
- 适配远场/低信噪比录音:3 分钟立体声录音可输出完整转写, 同时静音/噪声不产生幻觉。
指标(AX650N,4 条测试语音)
- CER:3.37%
- RTF:约 0.3(Python),0.225(C++ SDK)
使用
conda create -n fireredasr python=3.12
conda activate fireredasr
pip install -r requirements.txt
pip install axengine-0.1.3-py3-none-any.whl # pyaxengine
python openai/openai_server.py \
--encoder axmodel/encoder.axmodel \
--decoder axmodel/decoder_loop.axmodel \
--fsmn-vad fsmn_vad/fsmn_vad_10s_fp32.axmodel \
--fsmn-cmvn fsmn_vad/am.mvn \
--cmvn axmodel/cmvn.ark --dict axmodel/dict.txt \
--pe axmodel/pe.npy --max-dur 10 --max-steps 128
OpenAI API
- C++ 预编译:
cpp/bin/firered_openai_server、cpp/bin/firered_openai_client(用法见cpp/bin/README.md) - Python:
openai/openai_server.py、openai/openai_client.py(stdlib,零额外依赖) - Python ASR 核心:
openai/firered_asr.py+openai/fsmn_vad_post.py(numpy + pyaxengine + kaldi-native-fbank,无 torch/onnxruntime) - 端点:
POST /v1/audio/transcriptions(multipartfile)、GET /v1/models
7.0 重转换、C++ SDK 源码与构建说明见
GitHub(cpp/、reports/)。