ModelCloud
/

DeepSeek-V3-0324-BF16

Text Generation

text-generation-inference

Model card Files Files and versions

Qubitium commited on Mar 27

Commit

be8d061

·

verified ·

1 Parent(s): 0ed44b2

sync modeling_deepseek.py with upstream

Files changed (1) hide show

modeling_deepseek.py +2 -3

modeling_deepseek.py CHANGED Viewed

@@ -398,7 +398,6 @@ class MoEGate(nn.Module):
         self.n_routed_experts = config.n_routed_experts
         self.routed_scaling_factor = config.routed_scaling_factor
         self.scoring_func = config.scoring_func
-        self.seq_aux = config.seq_aux
         self.topk_method = config.topk_method
         self.n_group = config.n_group
         self.topk_group = config.topk_group
@@ -455,7 +454,7 @@ class MoEGate(nn.Module):
                 )
                 .reshape(bsz * seq_len, -1)
             )  # [n, e]
-            tmp_scores = scores_for_choice.masked_fill(~score_mask.bool(), 0.0)  # [n, e]
             _, topk_idx = torch.topk(
                 tmp_scores, k=self.top_k, dim=-1, sorted=False
             )
@@ -1846,4 +1845,4 @@ class DeepseekV3ForSequenceClassification(DeepseekV3PreTrainedModel):
             past_key_values=transformer_outputs.past_key_values,
             hidden_states=transformer_outputs.hidden_states,
             attentions=transformer_outputs.attentions,
-        )

         self.n_routed_experts = config.n_routed_experts
         self.routed_scaling_factor = config.routed_scaling_factor
         self.scoring_func = config.scoring_func
         self.topk_method = config.topk_method
         self.n_group = config.n_group
         self.topk_group = config.topk_group
                 )
                 .reshape(bsz * seq_len, -1)
             )  # [n, e]
+            tmp_scores = scores_for_choice.masked_fill(~score_mask.bool(), float("-inf"))  # [n, e]
             _, topk_idx = torch.topk(
                 tmp_scores, k=self.top_k, dim=-1, sorted=False
             )
             past_key_values=transformer_outputs.past_key_values,
             hidden_states=transformer_outputs.hidden_states,
             attentions=transformer_outputs.attentions,
+        )