AEON-7 commited on
Commit
eae4916
·
verified ·
1 Parent(s): d662d81

Restore base Qwen 3.6 pre_tokenizer (\p{M}) + trim_offsets:false; keep AEON's audio/TTS added tokens. Fixes multilingual tokenization regression flagged in BF16 discussion #5; matches what the base was trained with so combining-mark languages (Hindi, Arabic, Vietnamese, etc.) tokenize correctly. English/code unchanged.

Browse files
Files changed (1) hide show
  1. tokenizer.json +2 -2
tokenizer.json CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6f32ce20dc35f57a7f9ad1eac03525bd7d30f9df8cea6507e958279cc3657706
3
- size 19989492
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:530dc3d0de71a4d102af7d2f92a2a9178f430b489b1d5b48feb56d9c37e6a54e
3
+ size 11071634