asastyy commited on
Commit
a0e8901
·
verified ·
1 Parent(s): 20e3af6

Push model using huggingface_hub.

Browse files
Files changed (3) hide show
  1. README.md +6 -115
  2. config.json +5 -5
  3. model.safetensors +2 -2
README.md CHANGED
@@ -1,119 +1,10 @@
1
  ---
2
- language: ru
3
  tags:
4
- - causal-lm
5
- - byte-level-bpe
6
- - transformer
7
- - rope
8
- - mla
9
  ---
10
 
11
- # llm-course-hw1
12
-
13
- Небольшая causal language model для генерации русских анекдотов. В работе реализованы byte-level BPE tokenizer, Transformer LM с RMSNorm, GQA, ALiBi и SwiGLU, а также дополнительные варианты внимания с RoPE и MLA.
14
-
15
- ## Dataset
16
-
17
- Используется `IgorVolochay/russian_jokes`, файл `dataset.txt`.
18
-
19
- ## Short Conclusions
20
-
21
- - `nano`: val loss около 3.62, но генерация часто теряет синтаксис и смысл; модель слишком маленькая.
22
- - `mini`: лучший короткий прогон был с более агрессивным режимом `lr=5e-4`, `weight_decay=0.05`, `dropout=0.15`; текст живее, но шумнее.
23
- - `small`: лучше с более спокойным режимом `lr=3e-4`, `weight_decay=0.01`, `dropout=0.10`; `lr=5e-4` для него оказался слишком агрессивным.
24
- - В бонусном коротком сравнении `MLA` оказался лучше `RoPE`, но оба варианта требуют более длинного обучения.
25
-
26
- ## Hyperparameter Search
27
-
28
- | model | class | steps | lr | wd | dropout | val_loss |
29
- |---|---|---:|---:|---:|---:|---:|
30
- | mini | TransformerForCausalLM | 700 | 2.0e-04 | 0.01 | 0.10 | 4.3444 |
31
- | mini | TransformerForCausalLM | 700 | 3.0e-04 | 0.01 | 0.10 | 4.1069 |
32
- | mini | TransformerForCausalLM | 700 | 5.0e-04 | 0.05 | 0.15 | 4.0272 |
33
- | small | TransformerForCausalLM | 700 | 2.0e-04 | 0.01 | 0.10 | 4.1350 |
34
- | small | TransformerForCausalLM | 700 | 3.0e-04 | 0.01 | 0.10 | 4.0462 |
35
- | small | TransformerForCausalLM | 700 | 5.0e-04 | 0.05 | 0.15 | 4.3985 |
36
-
37
- ## Refined Hyperparameter Search
38
-
39
- | model | class | steps | lr | wd | dropout | val_loss |
40
- |---|---|---:|---:|---:|---:|---:|
41
- | mini | TransformerForCausalLM | 3000 | 4.0e-04 | 0.03 | 0.12 | 3.2428 |
42
- | mini | TransformerForCausalLM | 3000 | 5.0e-04 | 0.03 | 0.12 | 3.2085 |
43
- | mini | TransformerForCausalLM | 3000 | 6.0e-04 | 0.05 | 0.15 | 3.2324 |
44
- | small | TransformerForCausalLM | 3000 | 2.5e-04 | 0.01 | 0.10 | 3.2166 |
45
- | small | TransformerForCausalLM | 3000 | 3.0e-04 | 0.01 | 0.12 | 3.2327 |
46
- | small | TransformerForCausalLM | 3000 | 3.5e-04 | 0.02 | 0.12 | 3.2388 |
47
-
48
- ## Bonus Experiments
49
-
50
- | model | class | steps | lr | wd | dropout | val_loss |
51
- |---|---|---:|---:|---:|---:|---:|
52
- | nano | TransformerForCausalLMRoPE | 700 | 3.0e-04 | 0.01 | 0.10 | 5.0737 |
53
- | nano | TransformerForCausalLMMLA | 700 | 3.0e-04 | 0.01 | 0.10 | 4.9573 |
54
-
55
- ## Generation Examples
56
-
57
- ### mini
58
-
59
- **Prompt:** Заходит в бар
60
-
61
- Заходит в бар, видит. Потом сидит на кухне. Дедушка снимит, и всякий, пьяный и говорит: - Помимся, как я тебе говори! Другой: - Папа, я тебе папа, я пьянка на кухню. Сталиной, погоди, что ты не пришла в гости и выражает. - Да, но ты не знаешь, я не знаю. - Дедушка, это я, сынок! - Опять!
62
-
63
- **Prompt:** Штирлиц пришел домой
64
-
65
- Штирлиц пришел домой с работы, в ней котов и говорит: - Папа, я не хочу, чтобы ты согласна в школу! А я и с ним, что я пойму в кафе...
66
-
67
- **Prompt:** Студент на экзамене
68
-
69
- Студент на экзамене:- У тебя что-то вечером встречаются с денег.- Они не привлекают.
70
-
71
- ### small
72
-
73
- **Prompt:** Заходит в бар
74
-
75
- Заходит в бар. Компания, смотрит и говорит: "Абрам, как это за рубашку в кинуле!" Все в порядке воскресенье, наверно, весь вниз, достает рабочий ванной в сторону. Сидят двое и толпатных, встречает одна и говорит: - Вовочка, ты кем? - Я, блин, куда?
76
-
77
- **Prompt:** Штирлиц пришел домой
78
-
79
- Штирлиц пришел домой. Жена:- Слушай, а ты знаешь, что я таки даже не хочу.Муж:- Ты что, дорогая, ты не волнуйся, я не могу.
80
-
81
- **Prompt:** Студент на экзамене
82
-
83
- Студент на экзамене:- Сколько у вас в школе?- Да.- Ага, как я вышла!
84
-
85
- ## Decoding Search
86
-
87
- ### mini
88
-
89
- temperature=0.8, top_k=20
90
-
91
- Заходит в бар, видит - улыбается на работу, а жена спрашивает: - Мужик, что это вы делаете? - Да вот, не волнуйтесь, какой ты здесь волосы плохо!
92
-
93
- temperature=0.9, top_k=30
94
-
95
- Заходит в бар и кричит: - Сара, а зачем тебе так устроился? Мимо доказывает: - Тогда, кем ты был на работу? - Ну, пусть же я плачу.
96
-
97
- temperature=0.95, top_k=40
98
-
99
- Заходит в бар, смотрит, значит, по пустым метро стоит за окном. Мы ему лжично раздражать в туалете - и шо, у вас там, наверное, дорогая, ну на хлеб поездце. Представляешь, что я такое в этой камере. Там некогда нет. Бедно превращается, а я рыба - чушью и кладут с ней уже в кварт
100
-
101
- ### small
102
-
103
- temperature=0.8, top_k=20
104
-
105
- Заходит в бар с барменом, а там в баре с папой падают. - Чего, сюда едешь? - Да я знаю, что ты на почту упала.
106
-
107
- temperature=0.9, top_k=30
108
-
109
- Заходит в бар. Подходит маленькая девушка:- Товарищ мерседес...Девушка:- У вас есть базар, пиво?- Нет, солнцы!
110
-
111
- temperature=0.95, top_k=40
112
-
113
- Заходит в бар к своему суду и говорит: - Ну сколько будет? - Да поймать. - ? - Да, да. - А вы?
114
-
115
- ## References
116
-
117
- - RoFormer: Enhanced Transformer with Rotary Position Embedding: https://arxiv.org/abs/2104.09864
118
- - DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model: https://arxiv.org/abs/2405.04434
119
- - Hugging Face Hub upload guide: https://huggingface.co/docs/huggingface_hub/guides/upload
 
1
  ---
 
2
  tags:
3
+ - model_hub_mixin
4
+ - pytorch_model_hub_mixin
 
 
 
5
  ---
6
 
7
+ This model has been pushed to the Hub using the [PytorchModelHubMixin](https://huggingface.co/docs/huggingface_hub/package_reference/mixins#huggingface_hub.PyTorchModelHubMixin) integration:
8
+ - Code: [More Information Needed]
9
+ - Paper: [More Information Needed]
10
+ - Docs: [More Information Needed]
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
config.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
  "dropout": 0.1,
3
- "hidden_dim": 768,
4
- "intermediate_dim": 2048,
5
  "max_seq_len": 128,
6
- "n_head": 12,
7
- "n_kv_head": 6,
8
- "n_layer": 12,
9
  "vocab_size": 1024
10
  }
 
1
  {
2
  "dropout": 0.1,
3
+ "hidden_dim": 96,
4
+ "intermediate_dim": 256,
5
  "max_seq_len": 128,
6
+ "n_head": 4,
7
+ "n_kv_head": 2,
8
+ "n_layer": 3,
9
  "vocab_size": 1024
10
  }
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:97721758fd964f4a4ab9bd3810a1ab035cfc26df6e1c9411d74043d70482e1c1
3
- size 318003248
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2dc5e7b39708572ce7a2c8f40d80bbe279485cad2d235e42e4c5d371547f75b5
3
+ size 2057520