voidful commited on
Commit
8474679
·
verified ·
1 Parent(s): efdeca6

Revert unhelpful TF32 latency candidate

Browse files
Files changed (3) hide show
  1. README.md +0 -1
  2. app.py +2 -5
  3. tests/test_release_pins.py +2 -2
README.md CHANGED
@@ -50,7 +50,6 @@ Mamba2 所需的 Triton runtime 以
50
  |---|---:|
51
  | CFG | fixed per-chunk schedule: row ordinal 0/even = 3.0, positive odd = 2.0; UI primary CFG is locked |
52
  | NFE steps | fixed at the validated value 10 |
53
- | CUDA matmul | deterministic TF32 on the pinned A10G runtime; cuBLAS workspace, cuDNN deterministic mode and runtime versions remain frozen |
54
  | Target pace | 4.0 speech units/sec |
55
  | Initial whole-trajectory policy | base: 5.2 CJK / 4.6 ASCII-mixed units/sec + 1 latent step |
56
  | Low-coverage chunk-refill policy | safe duration: 4.6 CJK / 4.0 ASCII-mixed units/sec + 1 latent step |
 
50
  |---|---:|
51
  | CFG | fixed per-chunk schedule: row ordinal 0/even = 3.0, positive odd = 2.0; UI primary CFG is locked |
52
  | NFE steps | fixed at the validated value 10 |
 
53
  | Target pace | 4.0 speech units/sec |
54
  | Initial whole-trajectory policy | base: 5.2 CJK / 4.6 ASCII-mixed units/sec + 1 latent step |
55
  | Low-coverage chunk-refill policy | safe duration: 4.6 CJK / 4.0 ASCII-mixed units/sec + 1 latent step |
app.py CHANGED
@@ -21,11 +21,8 @@ CUBLAS_WORKSPACE_CONFIG = ":4096:8"
21
  MAMBA_DETERMINISTIC = "1"
22
  CUDNN_BENCHMARK = False
23
  CUDNN_DETERMINISTIC = True
24
- # The pinned Ampere ZeroGPU runtime uses deterministic TF32 kernels. This
25
- # preserves the deterministic release path while avoiding emulated full-FP32
26
- # tensor-core work on the hosted A10G.
27
- CUDA_MATMUL_ALLOW_TF32 = True
28
- CUDNN_ALLOW_TF32 = True
29
  EXPECTED_TORCH_VERSION = "2.11.0+cu130"
30
  EXPECTED_TORCH_CUDA_VERSION = "13.0"
31
  EXPECTED_CUDNN_VERSION = 91900
 
21
  MAMBA_DETERMINISTIC = "1"
22
  CUDNN_BENCHMARK = False
23
  CUDNN_DETERMINISTIC = True
24
+ CUDA_MATMUL_ALLOW_TF32 = False
25
+ CUDNN_ALLOW_TF32 = False
 
 
 
26
  EXPECTED_TORCH_VERSION = "2.11.0+cu130"
27
  EXPECTED_TORCH_CUDA_VERSION = "13.0"
28
  EXPECTED_CUDNN_VERSION = 91900
tests/test_release_pins.py CHANGED
@@ -221,8 +221,8 @@ def test_cuda_runtime_is_pinned_deterministic_before_model_import():
221
  assert constants["MAMBA_DETERMINISTIC"] == "1"
222
  assert constants["CUDNN_BENCHMARK"] is False
223
  assert constants["CUDNN_DETERMINISTIC"] is True
224
- assert constants["CUDA_MATMUL_ALLOW_TF32"] is True
225
- assert constants["CUDNN_ALLOW_TF32"] is True
226
  assert constants["EXPECTED_TORCH_VERSION"] == "2.11.0+cu130"
227
  assert constants["EXPECTED_TORCH_CUDA_VERSION"] == "13.0"
228
  assert constants["EXPECTED_CUDNN_VERSION"] == 91900
 
221
  assert constants["MAMBA_DETERMINISTIC"] == "1"
222
  assert constants["CUDNN_BENCHMARK"] is False
223
  assert constants["CUDNN_DETERMINISTIC"] is True
224
+ assert constants["CUDA_MATMUL_ALLOW_TF32"] is False
225
+ assert constants["CUDNN_ALLOW_TF32"] is False
226
  assert constants["EXPECTED_TORCH_VERSION"] == "2.11.0+cu130"
227
  assert constants["EXPECTED_TORCH_CUDA_VERSION"] == "13.0"
228
  assert constants["EXPECTED_CUDNN_VERSION"] == 91900