Hoglet-33 commited on
Commit
6719ea5
·
verified ·
1 Parent(s): 2d607b1

Update configuration_pebble.py

Browse files
Files changed (1) hide show
  1. configuration_pebble.py +29 -28
configuration_pebble.py CHANGED
@@ -6,35 +6,36 @@ class PebbleConfig(PretrainedConfig):
6
  def __init__(
7
  self,
8
  vocab_size=2048,
9
- d_model=608,
10
- n_blocks=8,
11
- n_heads=8,
12
- att_hidden=2432,
13
- rope_theta=10000.0,
14
- seq_len=2048,
15
- mamba_d_state=128,
16
- mamba_d_conv=4,
17
- mamba_expand=2,
18
- mamba_headdim=64,
19
- block_pattern="3:1 mamba:attn",
20
- bos_token_id=1,
21
- eos_token_id=1,
22
  **kwargs,
23
  ):
24
  self.vocab_size = vocab_size
25
- self.d_model = d_model
26
- self.n_blocks = n_blocks
27
- self.n_heads = n_heads
28
- self.att_hidden = att_hidden
29
- self.rope_theta = rope_theta
30
- self.seq_len = seq_len
31
- self.mamba_d_state = mamba_d_state
32
- self.mamba_d_conv = mamba_d_conv
33
- self.mamba_expand = mamba_expand
34
- self.mamba_headdim = mamba_headdim
35
  self.block_pattern = block_pattern
36
- super().__init__(
37
- bos_token_id=bos_token_id,
38
- eos_token_id=eos_token_id,
39
- **kwargs,
40
- )
 
 
 
 
 
 
 
 
 
 
6
  def __init__(
7
  self,
8
  vocab_size=2048,
9
+ hidden_size=608,
10
+ intermediate_size=2432,
11
+ num_hidden_layers=8,
12
+ num_attention_heads=8,
13
+ block_pattern="mmma|mmma",
14
+ hybrid_ratio="3:1 mamba2:attention",
15
+ max_position_embeddings=2048,
16
+ rms_norm_eps=1e-6,
17
+ tie_word_embeddings=True,
18
+ mamba2=None,
19
+ attention=None,
 
 
20
  **kwargs,
21
  ):
22
  self.vocab_size = vocab_size
23
+ self.hidden_size = hidden_size
24
+ self.intermediate_size = intermediate_size
25
+ self.num_hidden_layers = num_hidden_layers
26
+ self.num_attention_heads = num_attention_heads
 
 
 
 
 
 
27
  self.block_pattern = block_pattern
28
+ self.hybrid_ratio = hybrid_ratio
29
+ self.max_position_embeddings = max_position_embeddings
30
+ self.rms_norm_eps = rms_norm_eps
31
+ self.tie_word_embeddings = tie_word_embeddings
32
+
33
+ # Default dictionaries if not provided in config.json
34
+ self.mamba2 = mamba2 or {
35
+ "d_state": 128, "d_conv": 4, "expand": 2,
36
+ "headdim": 64, "use_mem_eff_path": True
37
+ }
38
+ self.attention = attention or {
39
+ "rope_theta": 10000.0, "is_causal": True
40
+ }
41
+ super().__init__(**kwargs)