Spaces:
Running on Zero
Running on Zero
Revert unhelpful TF32 latency candidate
Browse files- README.md +0 -1
- app.py +2 -5
- tests/test_release_pins.py +2 -2
README.md
CHANGED
|
@@ -50,7 +50,6 @@ Mamba2 所需的 Triton runtime 以
|
|
| 50 |
|---|---:|
|
| 51 |
| CFG | fixed per-chunk schedule: row ordinal 0/even = 3.0, positive odd = 2.0; UI primary CFG is locked |
|
| 52 |
| NFE steps | fixed at the validated value 10 |
|
| 53 |
-
| CUDA matmul | deterministic TF32 on the pinned A10G runtime; cuBLAS workspace, cuDNN deterministic mode and runtime versions remain frozen |
|
| 54 |
| Target pace | 4.0 speech units/sec |
|
| 55 |
| Initial whole-trajectory policy | base: 5.2 CJK / 4.6 ASCII-mixed units/sec + 1 latent step |
|
| 56 |
| Low-coverage chunk-refill policy | safe duration: 4.6 CJK / 4.0 ASCII-mixed units/sec + 1 latent step |
|
|
|
|
| 50 |
|---|---:|
|
| 51 |
| CFG | fixed per-chunk schedule: row ordinal 0/even = 3.0, positive odd = 2.0; UI primary CFG is locked |
|
| 52 |
| NFE steps | fixed at the validated value 10 |
|
|
|
|
| 53 |
| Target pace | 4.0 speech units/sec |
|
| 54 |
| Initial whole-trajectory policy | base: 5.2 CJK / 4.6 ASCII-mixed units/sec + 1 latent step |
|
| 55 |
| Low-coverage chunk-refill policy | safe duration: 4.6 CJK / 4.0 ASCII-mixed units/sec + 1 latent step |
|
app.py
CHANGED
|
@@ -21,11 +21,8 @@ CUBLAS_WORKSPACE_CONFIG = ":4096:8"
|
|
| 21 |
MAMBA_DETERMINISTIC = "1"
|
| 22 |
CUDNN_BENCHMARK = False
|
| 23 |
CUDNN_DETERMINISTIC = True
|
| 24 |
-
|
| 25 |
-
|
| 26 |
-
# tensor-core work on the hosted A10G.
|
| 27 |
-
CUDA_MATMUL_ALLOW_TF32 = True
|
| 28 |
-
CUDNN_ALLOW_TF32 = True
|
| 29 |
EXPECTED_TORCH_VERSION = "2.11.0+cu130"
|
| 30 |
EXPECTED_TORCH_CUDA_VERSION = "13.0"
|
| 31 |
EXPECTED_CUDNN_VERSION = 91900
|
|
|
|
| 21 |
MAMBA_DETERMINISTIC = "1"
|
| 22 |
CUDNN_BENCHMARK = False
|
| 23 |
CUDNN_DETERMINISTIC = True
|
| 24 |
+
CUDA_MATMUL_ALLOW_TF32 = False
|
| 25 |
+
CUDNN_ALLOW_TF32 = False
|
|
|
|
|
|
|
|
|
|
| 26 |
EXPECTED_TORCH_VERSION = "2.11.0+cu130"
|
| 27 |
EXPECTED_TORCH_CUDA_VERSION = "13.0"
|
| 28 |
EXPECTED_CUDNN_VERSION = 91900
|
tests/test_release_pins.py
CHANGED
|
@@ -221,8 +221,8 @@ def test_cuda_runtime_is_pinned_deterministic_before_model_import():
|
|
| 221 |
assert constants["MAMBA_DETERMINISTIC"] == "1"
|
| 222 |
assert constants["CUDNN_BENCHMARK"] is False
|
| 223 |
assert constants["CUDNN_DETERMINISTIC"] is True
|
| 224 |
-
assert constants["CUDA_MATMUL_ALLOW_TF32"] is
|
| 225 |
-
assert constants["CUDNN_ALLOW_TF32"] is
|
| 226 |
assert constants["EXPECTED_TORCH_VERSION"] == "2.11.0+cu130"
|
| 227 |
assert constants["EXPECTED_TORCH_CUDA_VERSION"] == "13.0"
|
| 228 |
assert constants["EXPECTED_CUDNN_VERSION"] == 91900
|
|
|
|
| 221 |
assert constants["MAMBA_DETERMINISTIC"] == "1"
|
| 222 |
assert constants["CUDNN_BENCHMARK"] is False
|
| 223 |
assert constants["CUDNN_DETERMINISTIC"] is True
|
| 224 |
+
assert constants["CUDA_MATMUL_ALLOW_TF32"] is False
|
| 225 |
+
assert constants["CUDNN_ALLOW_TF32"] is False
|
| 226 |
assert constants["EXPECTED_TORCH_VERSION"] == "2.11.0+cu130"
|
| 227 |
assert constants["EXPECTED_TORCH_CUDA_VERSION"] == "13.0"
|
| 228 |
assert constants["EXPECTED_CUDNN_VERSION"] == 91900
|