mlnomad commited on
Commit
4dd4b4f
·
verified ·
1 Parent(s): 8a6af7d

Fix: lazy non-persistent RoPE buffers — HF from_pretrained's meta-init was leaving persistent rope_cos/rope_sin uninitialised, producing NaN logits. Buffers are now computed on first forward.

Browse files
Files changed (1) hide show
  1. yatnmn_gpt.py +2 -2
yatnmn_gpt.py CHANGED
@@ -26,12 +26,12 @@ import torch.nn as nn
26
  import torch.nn.functional as F
27
 
28
  try:
29
- from torch_port.torch_gpt import (
30
  rms_norm, precompute_rotary_embeddings, apply_rotary_emb,
31
  has_ve, compute_window_sizes,
32
  )
33
  except ImportError:
34
- from torch_gpt import ( # type: ignore
35
  rms_norm, precompute_rotary_embeddings, apply_rotary_emb,
36
  has_ve, compute_window_sizes,
37
  )
 
26
  import torch.nn.functional as F
27
 
28
  try:
29
+ from .torch_gpt import (
30
  rms_norm, precompute_rotary_embeddings, apply_rotary_emb,
31
  has_ve, compute_window_sizes,
32
  )
33
  except ImportError:
34
+ from torch_port.torch_gpt import (
35
  rms_norm, precompute_rotary_embeddings, apply_rotary_emb,
36
  has_ve, compute_window_sizes,
37
  )