PT-BR Omni Tucano2 + Mimi

Export do prototipo Omni PT-BR modular:

audio PT-BR -> Whisper medium PT encoder -> projector -> Tucano2 Q4/MLX
-> hidden states contextuais -> Talker diagonal 8-codebooks -> Mimi decoder -> audio

O checkpoint promovido nesta versao e o Talker MLX-aligned v1. A continuacao v2 foi treinada e validada, mas nao foi promovida porque manteve a mesma qualidade e ficou mais lenta no gate local Core ML.

Status

Funcionando no gate local em Mac/Core ML:

  • Core ML Talker + Mimi + Whisper medium: 50/50 passou.
  • Audio vazio: 0.
  • Mistura de idioma: 0.
  • WER medio vs resposta: 0.0633.
  • CER medio vs resposta: 0.0307.
  • Talker Core ML medio: 0.0863s.
  • Mimi decode local medio: 0.0403s.

Gate end-to-end 50Q:

  • Pipeline: audio -> Whisper encoder -> projector -> Tucano2 Q4 -> Talker -> Mimi -> WAV.
  • Passed: 50/50.
  • Entrada -> 1o audio medio: 0.7702s.
  • Apos 3 warmups: medio 0.7563s, p95 0.9134s, max 0.9686s.
  • Observacao: o gate e nao-streaming; o primeiro chunk foi medido como WAV completo nesse harness.

Checkpoints

Checkpoint principal:

checkpoints/mlx_tucano_talker_alignment/talker.pt
checkpoints/mlx_tucano_talker_alignment/config.json
checkpoints/mlx_tucano_talker_alignment/tokenizer/

Checkpoint legado gate10:

checkpoints/tucano_bridge_diagonal_gate10_q4_exact_ss_lr5e5_ptbr/talker.pt

Core ML

Export Core ML promovido:

coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage
coreml/coreml_mlx_aligned_parts/WhisperTucanoProjector.mlpackage
coreml/coreml_mlx_aligned_parts/manifest.json

O Mimi decoder continua congelado. Este pacote nao treina nem altera o Mimi; ele usa o Mimi como codec neural.

Avaliacao Incluida

eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac/
eval/projector_mimi_e2e_50q_cycle04/
eval/talker_audio_repair_agents_50q_status.json

Os WAVs gerados nos gates estao incluidos para auditoria com Whisper/escuta manual.

O Que Foi Treinado

Foi treinado/ajustado o Talker/adapter:

Tucano2 hidden states contextuais -> 8 tokens Mimi

Nao e um fine-tune completo do Tucano2. O Tucano2 e o Mimi decoder ficam congelados.

Reproducao Do Gate Core ML

TRANSFORMERS_NO_TORCHVISION=1 python3.11 tools_ptbr/talker_text_mimi/run_coreml_talker_mimi_50q_gate.py \
  --hidden-npz eval_ptbr/mlx_tucano_hidden_50q_mac/mlx_tucano_hidden_50q_fp32.npz \
  --talker-mlpackage coreml/coreml_mlx_aligned_parts/TucanoMimiTalkerStep.mlpackage \
  --mimi-path model/mimi \
  --out-dir eval/mlx_tucano_coreml_aligned_talker_mimi_50q_mac \
  --frames 24

Escopo

Este e um pipeline Omni modular para PT-BR, nao um unico transformer nativo de audio. A meta atual e iPhone/latencia com 8 codebooks Mimi. A versao de 16 codebooks fica para outra fase.

Downloads last month
6
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support