PT-BR Omni Tucano2 + Mimi
Export do prototipo Omni PT-BR modular:
audio PT-BR -> Whisper medium PT encoder -> projector -> Tucano2 Q4/MLX
-> hidden states contextuais -> Talker diagonal 8-codebooks -> Mimi decoder -> audio
O checkpoint promovido nesta versao e o Talker MLX-aligned v1. A continuacao v2 foi treinada e validada, mas nao foi promovida porque manteve a mesma qualidade e ficou mais lenta no gate local Core ML.
Status
Funcionando no gate local em Mac/Core ML:
- Core ML Talker + Mimi + Whisper medium:
50/50passou. - Audio vazio:
0. - Mistura de idioma:
0. - WER medio vs resposta:
0.0633. - CER medio vs resposta:
0.0307. - Talker Core ML medio:
0.0863s. - Mimi decode local medio:
0.0403s.
Gate end-to-end 50Q:
- Pipeline: audio -> Whisper encoder -> projector -> Tucano2 Q4 -> Talker -> Mimi -> WAV.
- Passed:
50/50. Entrada -> 1o audiomedio:0.7702s.- Apos 3 warmups: medio
0.7563s, p950.9134s, max0.9686s. - Observacao: o gate e nao-streaming; o primeiro chunk foi medido como WAV completo nesse harness.
Checkpoints
Checkpoint principal:
checkpoints/mlx_tucano_talker_alignment/talker.pt
checkpoints/mlx_tucano_talker_alignment/config.json
checkpoints/mlx_tucano_talker_alignment/tokenizer/
Checkpoint legado gate10:
checkpoints/tucano_bridge_diagonal_gate10_q4_exact_ss_lr5e5_ptbr/talker.pt
Core ML
Export Core ML promovido:
coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage
coreml/coreml_mlx_aligned_parts/WhisperTucanoProjector.mlpackage
coreml/coreml_mlx_aligned_parts/manifest.json
O Mimi decoder continua congelado. Este pacote nao treina nem altera o Mimi; ele usa o Mimi como codec neural.
Avaliacao Incluida
eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac/
eval/projector_mimi_e2e_50q_cycle04/
eval/talker_audio_repair_agents_50q_status.json
Os WAVs gerados nos gates estao incluidos para auditoria com Whisper/escuta manual.
O Que Foi Treinado
Foi treinado/ajustado o Talker/adapter:
Tucano2 hidden states contextuais -> 8 tokens Mimi
Nao e um fine-tune completo do Tucano2. O Tucano2 e o Mimi decoder ficam congelados.
Reproducao Do Gate Core ML
TRANSFORMERS_NO_TORCHVISION=1 python3.11 tools_ptbr/talker_text_mimi/run_coreml_talker_mimi_50q_gate.py \
--hidden-npz eval_ptbr/mlx_tucano_hidden_50q_mac/mlx_tucano_hidden_50q_fp32.npz \
--talker-mlpackage coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage \
--mimi-path model/mimi \
--out-dir eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac \
--frames 24
Escopo
Este e um pipeline Omni modular para PT-BR, nao um unico transformer nativo de audio. A meta atual e iPhone/latencia com 8 codebooks Mimi. A versao de 16 codebooks fica para outra fase.
- Downloads last month
- 6