mrs83 commited on
Commit
5398959
·
verified ·
1 Parent(s): 6d0567c

sync modules: block padding tokens in non-causal attention (no-op under vLLM)

Browse files
Files changed (1) hide show
  1. modeling_embedding.py +1 -0
modeling_embedding.py CHANGED
@@ -118,6 +118,7 @@ class EchoModelForSentenceEmbedding(EchoPreTrainedModel):
118
  past_key_values=past_key_values,
119
  inputs_embeds=inputs_embeds,
120
  position_ids=position_ids,
 
121
  output_attentions=output_attentions,
122
  output_hidden_states=output_hidden_states,
123
  return_dict=True,
 
118
  past_key_values=past_key_values,
119
  inputs_embeds=inputs_embeds,
120
  position_ids=position_ids,
121
+ attention_mask=attention_mask,
122
  output_attentions=output_attentions,
123
  output_hidden_states=output_hidden_states,
124
  return_dict=True,