miguelcsx commited on
Commit
496dea6
·
verified ·
1 Parent(s): 1e8274a

main chck_100M

Browse files
.complete.json CHANGED
@@ -1,14 +1,14 @@
1
  {
2
  "files": {
3
  "config.json": "f8e07831e548977373f0af54823e9a27f7ed3cb2aeb9214287364d94273b0150",
4
- "factor_readout.safetensors": "969bb0628ce1e1c46f118616d05b0d1785ee68daa388f7eed6d0baaa4a3bb751",
5
- "model.safetensors": "2ef65b19001b036872e8a27ec13a7d1b1a329a4f1a9096c7927a2dc976cf8755",
6
  "special_tokens_map.json": "2be97b602cd0e4a6c2874cbf03c0d1025b3af5474666da931bc04f6c23a9a39d",
7
  "tokenizer.json": "2b8d1b3f51c0d8f276a64ea6a69efa50b4d9899780f1b282b4d0dcb7be5bbb0f",
8
  "tokenizer_config.json": "8f4a998564d87fc85b27652f0b295677a1e03744bf400bfacc342b700cc3653a",
9
  "tolm.py": "a9c9469b58e93b7f0228e0c00442735bd0304278e549af37fd3766a902bb1d13",
10
- "training_manifest.json": "2411ce896be15f6e2c1f3675053023a100fd7e3c15c582c9eaedb1f25fbd580d"
11
  },
12
  "schema_version": 1,
13
- "words_seen": 88000000
14
  }
 
1
  {
2
  "files": {
3
  "config.json": "f8e07831e548977373f0af54823e9a27f7ed3cb2aeb9214287364d94273b0150",
4
+ "factor_readout.safetensors": "cd016840fb7d3e10279689d4ecd3057f086232a953e82ddfff3aeab4e34ad806",
5
+ "model.safetensors": "70e1e2308a9b015c924abae578ab136227c04406f5d3f78acc5a1a513a2e3674",
6
  "special_tokens_map.json": "2be97b602cd0e4a6c2874cbf03c0d1025b3af5474666da931bc04f6c23a9a39d",
7
  "tokenizer.json": "2b8d1b3f51c0d8f276a64ea6a69efa50b4d9899780f1b282b4d0dcb7be5bbb0f",
8
  "tokenizer_config.json": "8f4a998564d87fc85b27652f0b295677a1e03744bf400bfacc342b700cc3653a",
9
  "tolm.py": "a9c9469b58e93b7f0228e0c00442735bd0304278e549af37fd3766a902bb1d13",
10
+ "training_manifest.json": "6bfc40ee2b1263b3840c51674efb21f9b6ac19c9a0f92caa7789fcd176231a54"
11
  },
12
  "schema_version": 1,
13
+ "words_seen": 100000000
14
  }
factor_readout.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:969bb0628ce1e1c46f118616d05b0d1785ee68daa388f7eed6d0baaa4a3bb751
3
  size 884568
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cd016840fb7d3e10279689d4ecd3057f086232a953e82ddfff3aeab4e34ad806
3
  size 884568
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2ef65b19001b036872e8a27ec13a7d1b1a329a4f1a9096c7927a2dc976cf8755
3
  size 133365608
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:70e1e2308a9b015c924abae578ab136227c04406f5d3f78acc5a1a513a2e3674
3
  size 133365608
training_manifest.json CHANGED
@@ -45,7 +45,8 @@
45
  "auxiliary_linguistic_training_words": 2000000,
46
  "brown_training_words": 1000000,
47
  "competition_status": "strict_small_conservative_accounting",
48
- "conservative_counted_words": 99900000,
 
49
  "corpus_induced_priors": true,
50
  "corpus_limit_words": 10000000,
51
  "evaluation_holdout_words": 1000000,
@@ -54,17 +55,17 @@
54
  "generated_words": 0,
55
  "induction_corpus_disjoint_from_lm_and_holdout": true,
56
  "leaderboard_checkpoint_words": 88000000,
57
- "model_exposure_words": 88000000,
58
  "model_training_corpus_words": 8900000,
59
  "ppmi_induction_words": 1000000,
60
  "relational_corpus_fraction": 0.025,
61
  "same_run_checkpoint_distribution": false,
62
  "signals_derived_from_current_model_input": false,
63
- "strict_small_status": "within_both_books_without_baseline_precedent",
64
  "syntax_training_words": 0,
65
  "teacher_queries": 0,
66
  "tokenizer_training_words": 8900000,
67
- "total_exposure_words": 99900000,
68
  "track": "strict-small",
69
  "unique_corpus_words": 10000000,
70
  "within_100m_conservative_budget": true,
@@ -220,7 +221,7 @@
220
  "ema_decay": 0.9998,
221
  "epsilon": 1e-08,
222
  "exact_word_checkpoints": true,
223
- "exposure_words": 88000000,
224
  "final_lr_ratio": 0.1,
225
  "frequency_aware_masking": {
226
  "enabled": false,
@@ -286,7 +287,9 @@
286
  60000000,
287
  70000000,
288
  80000000,
289
- 88000000
 
 
290
  ],
291
  "schedule_total_words": 100000000,
292
  "span_max_length": 3,
@@ -309,5 +312,5 @@
309
  "z_loss_weight": 0.0001
310
  },
311
  "variant": "factorized_allocation",
312
- "words_seen": 88000000
313
  }
 
45
  "auxiliary_linguistic_training_words": 2000000,
46
  "brown_training_words": 1000000,
47
  "competition_status": "strict_small_conservative_accounting",
48
+ "conservative_corpus_accounting_words": 10000000,
49
+ "conservative_counted_words": 100000000,
50
  "corpus_induced_priors": true,
51
  "corpus_limit_words": 10000000,
52
  "evaluation_holdout_words": 1000000,
 
55
  "generated_words": 0,
56
  "induction_corpus_disjoint_from_lm_and_holdout": true,
57
  "leaderboard_checkpoint_words": 88000000,
58
+ "model_exposure_words": 100000000,
59
  "model_training_corpus_words": 8900000,
60
  "ppmi_induction_words": 1000000,
61
  "relational_corpus_fraction": 0.025,
62
  "same_run_checkpoint_distribution": false,
63
  "signals_derived_from_current_model_input": false,
64
+ "strict_small_status": "corpus_10m_model_views_100m",
65
  "syntax_training_words": 0,
66
  "teacher_queries": 0,
67
  "tokenizer_training_words": 8900000,
68
+ "total_exposure_words": 100000000,
69
  "track": "strict-small",
70
  "unique_corpus_words": 10000000,
71
  "within_100m_conservative_budget": true,
 
221
  "ema_decay": 0.9998,
222
  "epsilon": 1e-08,
223
  "exact_word_checkpoints": true,
224
+ "exposure_words": 100000000,
225
  "final_lr_ratio": 0.1,
226
  "frequency_aware_masking": {
227
  "enabled": false,
 
287
  60000000,
288
  70000000,
289
  80000000,
290
+ 88000000,
291
+ 90000000,
292
+ 100000000
293
  ],
294
  "schedule_total_words": 100000000,
295
  "span_max_length": 3,
 
312
  "z_loss_weight": 0.0001
313
  },
314
  "variant": "factorized_allocation",
315
+ "words_seen": 100000000
316
  }