ipeksnmz commited on
Commit
a3dad7e
·
verified ·
1 Parent(s): cb5d192

Training in progress, epoch 5

Browse files
Files changed (41) hide show
  1. model.safetensors +1 -1
  2. run-0/checkpoint-156/model.safetensors +1 -1
  3. run-0/checkpoint-156/optimizer.pt +1 -1
  4. run-0/checkpoint-156/rng_state.pth +1 -1
  5. run-0/checkpoint-156/scheduler.pt +1 -1
  6. run-0/checkpoint-156/trainer_state.json +25 -16
  7. run-0/checkpoint-156/training_args.bin +1 -1
  8. run-1/checkpoint-156/model.safetensors +1 -1
  9. run-1/checkpoint-156/optimizer.pt +1 -1
  10. run-1/checkpoint-156/scheduler.pt +1 -1
  11. run-1/checkpoint-156/trainer_state.json +18 -18
  12. run-1/checkpoint-156/training_args.bin +1 -1
  13. run-1/checkpoint-234/model.safetensors +1 -1
  14. run-1/checkpoint-234/optimizer.pt +1 -1
  15. run-1/checkpoint-234/scheduler.pt +1 -1
  16. run-1/checkpoint-234/trainer_state.json +24 -24
  17. run-1/checkpoint-234/training_args.bin +1 -1
  18. run-1/checkpoint-312/model.safetensors +1 -1
  19. run-1/checkpoint-312/optimizer.pt +1 -1
  20. run-1/checkpoint-312/scheduler.pt +1 -1
  21. run-1/checkpoint-312/trainer_state.json +30 -30
  22. run-1/checkpoint-312/training_args.bin +1 -1
  23. run-1/checkpoint-390/config.json +26 -0
  24. run-1/checkpoint-390/model.safetensors +3 -0
  25. run-1/checkpoint-390/optimizer.pt +3 -0
  26. run-1/checkpoint-390/rng_state.pth +3 -0
  27. run-1/checkpoint-390/scheduler.pt +3 -0
  28. run-1/checkpoint-390/special_tokens_map.json +7 -0
  29. run-1/checkpoint-390/tokenizer.json +0 -0
  30. run-1/checkpoint-390/tokenizer_config.json +56 -0
  31. run-1/checkpoint-390/trainer_state.json +85 -0
  32. run-1/checkpoint-390/training_args.bin +3 -0
  33. run-1/checkpoint-390/vocab.txt +0 -0
  34. run-1/checkpoint-78/model.safetensors +1 -1
  35. run-1/checkpoint-78/optimizer.pt +1 -1
  36. run-1/checkpoint-78/scheduler.pt +1 -1
  37. run-1/checkpoint-78/trainer_state.json +12 -12
  38. run-1/checkpoint-78/training_args.bin +1 -1
  39. runs/Apr07_19-56-35_578d22db0b7b/events.out.tfevents.1744056061.578d22db0b7b.632.2 +2 -2
  40. runs/Apr07_19-56-35_578d22db0b7b/events.out.tfevents.1744056114.578d22db0b7b.632.3 +3 -0
  41. training_args.bin +1 -1
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:42d8daf1b874324c2aefeee1741d59a150d57b33f584c0ca529dfbb17879a6df
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9450339a1256a7f65408fccfa93da8092b70410f46fcf240249530e47cf663dc
3
  size 437958648
run-0/checkpoint-156/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a1f699a4500d83bd49198c2ec27e9069aedfa46bffe8f4bf3d4830a07dfce651
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:268e324626ead859a5717640c217ec1a58afa1b6223e1394285edd8ca94f6049
3
  size 437958648
run-0/checkpoint-156/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:295356e020c5c4025bea134b15438244e207902bb05d6afca5950909107c1135
3
  size 876038394
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:80ba6b65c1c6838558e588fb8e93783b2c60516c4c066cdb92c334691b4d28c5
3
  size 876038394
run-0/checkpoint-156/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6a764c8fbd65482b3f8f8bebeef4f213015cd8ce9bbf6f431f02795e508eff51
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf55ba021d2ab0b1c833e29f9931dd901a0d951d01051cb520710fec2f7666a1
3
  size 14244
run-0/checkpoint-156/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:66083bd427a0320529e85945962bea0c9d3e6973888578ed308de4852137d8d9
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0db06fd8aedb1a8f657c269367821e07cf5324875e6df7daca6e395783e4e8a8
3
  size 1064
run-0/checkpoint-156/trainer_state.json CHANGED
@@ -1,8 +1,8 @@
1
  {
2
  "best_global_step": 156,
3
- "best_metric": 0.4693140794223827,
4
  "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-0/checkpoint-156",
5
- "epoch": 1.0,
6
  "eval_steps": 500,
7
  "global_step": 156,
8
  "is_hyper_param_search": true,
@@ -11,18 +11,27 @@
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
- "eval_accuracy": 0.4693140794223827,
15
- "eval_loss": 0.699053943157196,
16
- "eval_runtime": 0.4695,
17
- "eval_samples_per_second": 589.993,
18
- "eval_steps_per_second": 19.169,
 
 
 
 
 
 
 
 
 
19
  "step": 156
20
  }
21
  ],
22
  "logging_steps": 500,
23
- "max_steps": 468,
24
  "num_input_tokens_seen": 0,
25
- "num_train_epochs": 3,
26
  "save_steps": 500,
27
  "stateful_callbacks": {
28
  "TrainerControl": {
@@ -31,19 +40,19 @@
31
  "should_evaluate": false,
32
  "should_log": false,
33
  "should_save": true,
34
- "should_training_stop": false
35
  },
36
  "attributes": {}
37
  }
38
  },
39
  "total_flos": 0,
40
- "train_batch_size": 16,
41
  "trial_name": null,
42
  "trial_params": {
43
- "dropout": 0.30000000000000004,
44
- "learning_rate": 2.5054631352782984e-06,
45
- "max_length": 64,
46
- "num_train_epochs": 3,
47
- "per_device_train_batch_size": 16
48
  }
49
  }
 
1
  {
2
  "best_global_step": 156,
3
+ "best_metric": 0.6028880866425993,
4
  "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-0/checkpoint-156",
5
+ "epoch": 2.0,
6
  "eval_steps": 500,
7
  "global_step": 156,
8
  "is_hyper_param_search": true,
 
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
+ "eval_accuracy": 0.5523465703971119,
15
+ "eval_loss": 0.6833646297454834,
16
+ "eval_runtime": 0.4719,
17
+ "eval_samples_per_second": 586.955,
18
+ "eval_steps_per_second": 19.071,
19
+ "step": 78
20
+ },
21
+ {
22
+ "epoch": 2.0,
23
+ "eval_accuracy": 0.6028880866425993,
24
+ "eval_loss": 0.6620543003082275,
25
+ "eval_runtime": 0.4769,
26
+ "eval_samples_per_second": 580.811,
27
+ "eval_steps_per_second": 18.871,
28
  "step": 156
29
  }
30
  ],
31
  "logging_steps": 500,
32
+ "max_steps": 156,
33
  "num_input_tokens_seen": 0,
34
+ "num_train_epochs": 2,
35
  "save_steps": 500,
36
  "stateful_callbacks": {
37
  "TrainerControl": {
 
40
  "should_evaluate": false,
41
  "should_log": false,
42
  "should_save": true,
43
+ "should_training_stop": true
44
  },
45
  "attributes": {}
46
  }
47
  },
48
  "total_flos": 0,
49
+ "train_batch_size": 32,
50
  "trial_name": null,
51
  "trial_params": {
52
+ "dropout": 0.1,
53
+ "learning_rate": 1.7341011381436835e-05,
54
+ "max_length": 128,
55
+ "num_train_epochs": 2,
56
+ "per_device_train_batch_size": 32
57
  }
58
  }
run-0/checkpoint-156/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:167dd6b1d252f469d257b60344256a8138ce1405f5f872dfecf7ec74cb41b083
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6aa5fb35f2884c4c92bbd41be63a3fb0f251b310d74b4b00f29d9c870755bdf0
3
  size 5432
run-1/checkpoint-156/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:08be3f64d7de66395ed978099f2684517bc51212562f1f8436368f4103938239
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6a52225dea7aa41ee214e5149bf4e614a2a7a542d34672479cabcd34c8589303
3
  size 437958648
run-1/checkpoint-156/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:10463be93c1ae153151a01b364af470811cfc5a99d963876479ef416761e809a
3
  size 876038394
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2bfbf02921a0bbf2c20c54ab7f66d339ea9ac7a305b0926e00759f67174dfab8
3
  size 876038394
run-1/checkpoint-156/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:53b394fe2766e510535f1f93062088570a895be9326379bb9ea02c6bd024b139
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fea054f05f7a552f2e1073c5acf1c681a22ef354b0cfd2e6d11a7d6a2dbf3df3
3
  size 1064
run-1/checkpoint-156/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 78,
3
  "best_metric": 0.4693140794223827,
4
- "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-78",
5
  "epoch": 2.0,
6
  "eval_steps": 500,
7
  "global_step": 156,
@@ -11,27 +11,27 @@
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
- "eval_accuracy": 0.4693140794223827,
15
- "eval_loss": 0.7096340656280518,
16
- "eval_runtime": 0.4626,
17
- "eval_samples_per_second": 598.83,
18
- "eval_steps_per_second": 19.457,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
- "eval_accuracy": 0.4620938628158845,
24
- "eval_loss": 0.7008238434791565,
25
- "eval_runtime": 0.4652,
26
- "eval_samples_per_second": 595.501,
27
- "eval_steps_per_second": 19.348,
28
  "step": 156
29
  }
30
  ],
31
  "logging_steps": 500,
32
- "max_steps": 312,
33
  "num_input_tokens_seen": 0,
34
- "num_train_epochs": 4,
35
  "save_steps": 500,
36
  "stateful_callbacks": {
37
  "TrainerControl": {
@@ -49,10 +49,10 @@
49
  "train_batch_size": 32,
50
  "trial_name": null,
51
  "trial_params": {
52
- "dropout": 0.2,
53
- "learning_rate": 1.829932921064966e-06,
54
- "max_length": 512,
55
- "num_train_epochs": 4,
56
  "per_device_train_batch_size": 32
57
  }
58
  }
 
1
  {
2
+ "best_global_step": 156,
3
  "best_metric": 0.4693140794223827,
4
+ "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-156",
5
  "epoch": 2.0,
6
  "eval_steps": 500,
7
  "global_step": 156,
 
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
+ "eval_accuracy": 0.4657039711191336,
15
+ "eval_loss": 0.7084336876869202,
16
+ "eval_runtime": 0.468,
17
+ "eval_samples_per_second": 591.925,
18
+ "eval_steps_per_second": 19.232,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
+ "eval_accuracy": 0.4693140794223827,
24
+ "eval_loss": 0.6987703442573547,
25
+ "eval_runtime": 0.4711,
26
+ "eval_samples_per_second": 588.001,
27
+ "eval_steps_per_second": 19.105,
28
  "step": 156
29
  }
30
  ],
31
  "logging_steps": 500,
32
+ "max_steps": 390,
33
  "num_input_tokens_seen": 0,
34
+ "num_train_epochs": 5,
35
  "save_steps": 500,
36
  "stateful_callbacks": {
37
  "TrainerControl": {
 
49
  "train_batch_size": 32,
50
  "trial_name": null,
51
  "trial_params": {
52
+ "dropout": 0.30000000000000004,
53
+ "learning_rate": 1.7468082611997119e-06,
54
+ "max_length": 128,
55
+ "num_train_epochs": 5,
56
  "per_device_train_batch_size": 32
57
  }
58
  }
run-1/checkpoint-156/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb0ce7b8d9b3515ccbe463d87ca2d46108b5ce74f85b2822691b1dc95f8f7102
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
  size 5432
run-1/checkpoint-234/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:43dd3b90ca629b5e6aef6fdbaa1d7516c88c91c3de488da06334c6bb4dc24e0d
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db4693a0f87cce1c2f1994874814eca1ce114c5bdcd56a7919707329a3254606
3
  size 437958648
run-1/checkpoint-234/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8b08c184fb50cddf2a1bce80b7e5d239bafcc693f93801fc1f115b8c5351e5c4
3
  size 876038394
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7596fa43fe26d1e494032ccac0494269704a7f9ef5cdc4a34004729117cf3344
3
  size 876038394
run-1/checkpoint-234/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c2c7d078863c16c32aff544f2d8e926b6fb7defbac52b6d82c5f74b68871c778
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07b52ef4e0eb2d95e16f19bcfeb977824fb39661504fbf59327a418ae7231583
3
  size 1064
run-1/checkpoint-234/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 78,
3
- "best_metric": 0.4693140794223827,
4
- "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-78",
5
  "epoch": 3.0,
6
  "eval_steps": 500,
7
  "global_step": 234,
@@ -11,36 +11,36 @@
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
- "eval_accuracy": 0.4693140794223827,
15
- "eval_loss": 0.7096340656280518,
16
- "eval_runtime": 0.4626,
17
- "eval_samples_per_second": 598.83,
18
- "eval_steps_per_second": 19.457,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
- "eval_accuracy": 0.4620938628158845,
24
- "eval_loss": 0.7008238434791565,
25
- "eval_runtime": 0.4652,
26
- "eval_samples_per_second": 595.501,
27
- "eval_steps_per_second": 19.348,
28
  "step": 156
29
  },
30
  {
31
  "epoch": 3.0,
32
- "eval_accuracy": 0.4693140794223827,
33
- "eval_loss": 0.6976528763771057,
34
- "eval_runtime": 0.4739,
35
- "eval_samples_per_second": 584.486,
36
- "eval_steps_per_second": 18.991,
37
  "step": 234
38
  }
39
  ],
40
  "logging_steps": 500,
41
- "max_steps": 312,
42
  "num_input_tokens_seen": 0,
43
- "num_train_epochs": 4,
44
  "save_steps": 500,
45
  "stateful_callbacks": {
46
  "TrainerControl": {
@@ -58,10 +58,10 @@
58
  "train_batch_size": 32,
59
  "trial_name": null,
60
  "trial_params": {
61
- "dropout": 0.2,
62
- "learning_rate": 1.829932921064966e-06,
63
- "max_length": 512,
64
- "num_train_epochs": 4,
65
  "per_device_train_batch_size": 32
66
  }
67
  }
 
1
  {
2
+ "best_global_step": 234,
3
+ "best_metric": 0.49097472924187724,
4
+ "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-234",
5
  "epoch": 3.0,
6
  "eval_steps": 500,
7
  "global_step": 234,
 
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
+ "eval_accuracy": 0.4657039711191336,
15
+ "eval_loss": 0.7084336876869202,
16
+ "eval_runtime": 0.468,
17
+ "eval_samples_per_second": 591.925,
18
+ "eval_steps_per_second": 19.232,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
+ "eval_accuracy": 0.4693140794223827,
24
+ "eval_loss": 0.6987703442573547,
25
+ "eval_runtime": 0.4711,
26
+ "eval_samples_per_second": 588.001,
27
+ "eval_steps_per_second": 19.105,
28
  "step": 156
29
  },
30
  {
31
  "epoch": 3.0,
32
+ "eval_accuracy": 0.49097472924187724,
33
+ "eval_loss": 0.6952642798423767,
34
+ "eval_runtime": 0.4696,
35
+ "eval_samples_per_second": 589.866,
36
+ "eval_steps_per_second": 19.165,
37
  "step": 234
38
  }
39
  ],
40
  "logging_steps": 500,
41
+ "max_steps": 390,
42
  "num_input_tokens_seen": 0,
43
+ "num_train_epochs": 5,
44
  "save_steps": 500,
45
  "stateful_callbacks": {
46
  "TrainerControl": {
 
58
  "train_batch_size": 32,
59
  "trial_name": null,
60
  "trial_params": {
61
+ "dropout": 0.30000000000000004,
62
+ "learning_rate": 1.7468082611997119e-06,
63
+ "max_length": 128,
64
+ "num_train_epochs": 5,
65
  "per_device_train_batch_size": 32
66
  }
67
  }
run-1/checkpoint-234/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb0ce7b8d9b3515ccbe463d87ca2d46108b5ce74f85b2822691b1dc95f8f7102
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
  size 5432
run-1/checkpoint-312/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c5d0979af48b0b0cdc6d54030593e295b265e66f177c8b30a73a32a73c33c512
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:84d27f2c56be7b4d08b18c48c636d64d76a9b5b14bdfdc7acbdf6865cc7b5307
3
  size 437958648
run-1/checkpoint-312/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fdfb6f16fc9a736dcb34471d1fe0694fa6288ae054af540c2f04c72fd82e5024
3
  size 876038394
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ff873d618558c577f76aa01ce9c53dc04ec94c729415787dae45d22f5ac0d9e1
3
  size 876038394
run-1/checkpoint-312/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:975d759b7a34c8e3ac6afb8ab839b099a11fffcb797ae2c94dd4b468018ca075
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8c6d7eb63fe5628a506bc7effcd014a3106981b7268d62b9bbad10c0120da92d
3
  size 1064
run-1/checkpoint-312/trainer_state.json CHANGED
@@ -1,7 +1,7 @@
1
  {
2
- "best_global_step": 312,
3
- "best_metric": 0.48375451263537905,
4
- "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-312",
5
  "epoch": 4.0,
6
  "eval_steps": 500,
7
  "global_step": 312,
@@ -11,45 +11,45 @@
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
- "eval_accuracy": 0.4693140794223827,
15
- "eval_loss": 0.7096340656280518,
16
- "eval_runtime": 0.4626,
17
- "eval_samples_per_second": 598.83,
18
- "eval_steps_per_second": 19.457,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
- "eval_accuracy": 0.4620938628158845,
24
- "eval_loss": 0.7008238434791565,
25
- "eval_runtime": 0.4652,
26
- "eval_samples_per_second": 595.501,
27
- "eval_steps_per_second": 19.348,
28
  "step": 156
29
  },
30
  {
31
  "epoch": 3.0,
32
- "eval_accuracy": 0.4693140794223827,
33
- "eval_loss": 0.6976528763771057,
34
- "eval_runtime": 0.4739,
35
- "eval_samples_per_second": 584.486,
36
- "eval_steps_per_second": 18.991,
37
  "step": 234
38
  },
39
  {
40
  "epoch": 4.0,
41
- "eval_accuracy": 0.48375451263537905,
42
- "eval_loss": 0.6963386535644531,
43
- "eval_runtime": 0.4635,
44
- "eval_samples_per_second": 597.578,
45
- "eval_steps_per_second": 19.416,
46
  "step": 312
47
  }
48
  ],
49
  "logging_steps": 500,
50
- "max_steps": 312,
51
  "num_input_tokens_seen": 0,
52
- "num_train_epochs": 4,
53
  "save_steps": 500,
54
  "stateful_callbacks": {
55
  "TrainerControl": {
@@ -58,7 +58,7 @@
58
  "should_evaluate": false,
59
  "should_log": false,
60
  "should_save": true,
61
- "should_training_stop": true
62
  },
63
  "attributes": {}
64
  }
@@ -67,10 +67,10 @@
67
  "train_batch_size": 32,
68
  "trial_name": null,
69
  "trial_params": {
70
- "dropout": 0.2,
71
- "learning_rate": 1.829932921064966e-06,
72
- "max_length": 512,
73
- "num_train_epochs": 4,
74
  "per_device_train_batch_size": 32
75
  }
76
  }
 
1
  {
2
+ "best_global_step": 234,
3
+ "best_metric": 0.49097472924187724,
4
+ "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-234",
5
  "epoch": 4.0,
6
  "eval_steps": 500,
7
  "global_step": 312,
 
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
+ "eval_accuracy": 0.4657039711191336,
15
+ "eval_loss": 0.7084336876869202,
16
+ "eval_runtime": 0.468,
17
+ "eval_samples_per_second": 591.925,
18
+ "eval_steps_per_second": 19.232,
19
  "step": 78
20
  },
21
  {
22
  "epoch": 2.0,
23
+ "eval_accuracy": 0.4693140794223827,
24
+ "eval_loss": 0.6987703442573547,
25
+ "eval_runtime": 0.4711,
26
+ "eval_samples_per_second": 588.001,
27
+ "eval_steps_per_second": 19.105,
28
  "step": 156
29
  },
30
  {
31
  "epoch": 3.0,
32
+ "eval_accuracy": 0.49097472924187724,
33
+ "eval_loss": 0.6952642798423767,
34
+ "eval_runtime": 0.4696,
35
+ "eval_samples_per_second": 589.866,
36
+ "eval_steps_per_second": 19.165,
37
  "step": 234
38
  },
39
  {
40
  "epoch": 4.0,
41
+ "eval_accuracy": 0.47653429602888087,
42
+ "eval_loss": 0.6933764219284058,
43
+ "eval_runtime": 0.4714,
44
+ "eval_samples_per_second": 587.575,
45
+ "eval_steps_per_second": 19.091,
46
  "step": 312
47
  }
48
  ],
49
  "logging_steps": 500,
50
+ "max_steps": 390,
51
  "num_input_tokens_seen": 0,
52
+ "num_train_epochs": 5,
53
  "save_steps": 500,
54
  "stateful_callbacks": {
55
  "TrainerControl": {
 
58
  "should_evaluate": false,
59
  "should_log": false,
60
  "should_save": true,
61
+ "should_training_stop": false
62
  },
63
  "attributes": {}
64
  }
 
67
  "train_batch_size": 32,
68
  "trial_name": null,
69
  "trial_params": {
70
+ "dropout": 0.30000000000000004,
71
+ "learning_rate": 1.7468082611997119e-06,
72
+ "max_length": 128,
73
+ "num_train_epochs": 5,
74
  "per_device_train_batch_size": 32
75
  }
76
  }
run-1/checkpoint-312/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb0ce7b8d9b3515ccbe463d87ca2d46108b5ce74f85b2822691b1dc95f8f7102
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
  size 5432
run-1/checkpoint-390/config.json ADDED
@@ -0,0 +1,26 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "BertForSequenceClassification"
4
+ ],
5
+ "attention_probs_dropout_prob": 0.1,
6
+ "classifier_dropout": null,
7
+ "gradient_checkpointing": false,
8
+ "hidden_act": "gelu",
9
+ "hidden_dropout_prob": 0.1,
10
+ "hidden_size": 768,
11
+ "initializer_range": 0.02,
12
+ "intermediate_size": 3072,
13
+ "layer_norm_eps": 1e-12,
14
+ "max_position_embeddings": 512,
15
+ "model_type": "bert",
16
+ "num_attention_heads": 12,
17
+ "num_hidden_layers": 12,
18
+ "pad_token_id": 0,
19
+ "position_embedding_type": "absolute",
20
+ "problem_type": "single_label_classification",
21
+ "torch_dtype": "float32",
22
+ "transformers_version": "4.50.3",
23
+ "type_vocab_size": 2,
24
+ "use_cache": true,
25
+ "vocab_size": 30522
26
+ }
run-1/checkpoint-390/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9450339a1256a7f65408fccfa93da8092b70410f46fcf240249530e47cf663dc
3
+ size 437958648
run-1/checkpoint-390/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4cbdc2a099637ef5ae7c5a8696dfa0cd1c7691dee9956c562bee3a9d73d5b8e7
3
+ size 876038394
run-1/checkpoint-390/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76a8aa99cfb869cdb24ed6c316b7322ead9ce276701656976d91be3bb13ae827
3
+ size 14244
run-1/checkpoint-390/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5dccf43b6a19e7e79f323f369de8234eb5ff6bb95f0a12bd9368d35fcedbb7df
3
+ size 1064
run-1/checkpoint-390/special_tokens_map.json ADDED
@@ -0,0 +1,7 @@
 
 
 
 
 
 
 
 
1
+ {
2
+ "cls_token": "[CLS]",
3
+ "mask_token": "[MASK]",
4
+ "pad_token": "[PAD]",
5
+ "sep_token": "[SEP]",
6
+ "unk_token": "[UNK]"
7
+ }
run-1/checkpoint-390/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
run-1/checkpoint-390/tokenizer_config.json ADDED
@@ -0,0 +1,56 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "added_tokens_decoder": {
3
+ "0": {
4
+ "content": "[PAD]",
5
+ "lstrip": false,
6
+ "normalized": false,
7
+ "rstrip": false,
8
+ "single_word": false,
9
+ "special": true
10
+ },
11
+ "100": {
12
+ "content": "[UNK]",
13
+ "lstrip": false,
14
+ "normalized": false,
15
+ "rstrip": false,
16
+ "single_word": false,
17
+ "special": true
18
+ },
19
+ "101": {
20
+ "content": "[CLS]",
21
+ "lstrip": false,
22
+ "normalized": false,
23
+ "rstrip": false,
24
+ "single_word": false,
25
+ "special": true
26
+ },
27
+ "102": {
28
+ "content": "[SEP]",
29
+ "lstrip": false,
30
+ "normalized": false,
31
+ "rstrip": false,
32
+ "single_word": false,
33
+ "special": true
34
+ },
35
+ "103": {
36
+ "content": "[MASK]",
37
+ "lstrip": false,
38
+ "normalized": false,
39
+ "rstrip": false,
40
+ "single_word": false,
41
+ "special": true
42
+ }
43
+ },
44
+ "clean_up_tokenization_spaces": false,
45
+ "cls_token": "[CLS]",
46
+ "do_lower_case": true,
47
+ "extra_special_tokens": {},
48
+ "mask_token": "[MASK]",
49
+ "model_max_length": 512,
50
+ "pad_token": "[PAD]",
51
+ "sep_token": "[SEP]",
52
+ "strip_accents": null,
53
+ "tokenize_chinese_chars": true,
54
+ "tokenizer_class": "BertTokenizer",
55
+ "unk_token": "[UNK]"
56
+ }
run-1/checkpoint-390/trainer_state.json ADDED
@@ -0,0 +1,85 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 234,
3
+ "best_metric": 0.49097472924187724,
4
+ "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-234",
5
+ "epoch": 5.0,
6
+ "eval_steps": 500,
7
+ "global_step": 390,
8
+ "is_hyper_param_search": true,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 1.0,
14
+ "eval_accuracy": 0.4657039711191336,
15
+ "eval_loss": 0.7084336876869202,
16
+ "eval_runtime": 0.468,
17
+ "eval_samples_per_second": 591.925,
18
+ "eval_steps_per_second": 19.232,
19
+ "step": 78
20
+ },
21
+ {
22
+ "epoch": 2.0,
23
+ "eval_accuracy": 0.4693140794223827,
24
+ "eval_loss": 0.6987703442573547,
25
+ "eval_runtime": 0.4711,
26
+ "eval_samples_per_second": 588.001,
27
+ "eval_steps_per_second": 19.105,
28
+ "step": 156
29
+ },
30
+ {
31
+ "epoch": 3.0,
32
+ "eval_accuracy": 0.49097472924187724,
33
+ "eval_loss": 0.6952642798423767,
34
+ "eval_runtime": 0.4696,
35
+ "eval_samples_per_second": 589.866,
36
+ "eval_steps_per_second": 19.165,
37
+ "step": 234
38
+ },
39
+ {
40
+ "epoch": 4.0,
41
+ "eval_accuracy": 0.47653429602888087,
42
+ "eval_loss": 0.6933764219284058,
43
+ "eval_runtime": 0.4714,
44
+ "eval_samples_per_second": 587.575,
45
+ "eval_steps_per_second": 19.091,
46
+ "step": 312
47
+ },
48
+ {
49
+ "epoch": 5.0,
50
+ "eval_accuracy": 0.48014440433212996,
51
+ "eval_loss": 0.693021297454834,
52
+ "eval_runtime": 0.4693,
53
+ "eval_samples_per_second": 590.18,
54
+ "eval_steps_per_second": 19.176,
55
+ "step": 390
56
+ }
57
+ ],
58
+ "logging_steps": 500,
59
+ "max_steps": 390,
60
+ "num_input_tokens_seen": 0,
61
+ "num_train_epochs": 5,
62
+ "save_steps": 500,
63
+ "stateful_callbacks": {
64
+ "TrainerControl": {
65
+ "args": {
66
+ "should_epoch_stop": false,
67
+ "should_evaluate": false,
68
+ "should_log": false,
69
+ "should_save": true,
70
+ "should_training_stop": true
71
+ },
72
+ "attributes": {}
73
+ }
74
+ },
75
+ "total_flos": 0,
76
+ "train_batch_size": 32,
77
+ "trial_name": null,
78
+ "trial_params": {
79
+ "dropout": 0.30000000000000004,
80
+ "learning_rate": 1.7468082611997119e-06,
81
+ "max_length": 128,
82
+ "num_train_epochs": 5,
83
+ "per_device_train_batch_size": 32
84
+ }
85
+ }
run-1/checkpoint-390/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
+ size 5432
run-1/checkpoint-390/vocab.txt ADDED
The diff for this file is too large to render. See raw diff
 
run-1/checkpoint-78/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c370c816dcc2dea3a3c0829d8e3570df1658434ec7731db50ace850ed15f90e0
3
  size 437958648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6a811ffca90a45a55c25e77bad0e528bc5ad9e092d7d4e99e31913ba47cab1a9
3
  size 437958648
run-1/checkpoint-78/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:69085989d6575e69bfc70f2c0b948dafb1cbb6f0a1b5abf8004452ec6ef35d30
3
  size 876038394
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:50b31eb1b33680ffa93160db1ca48b73c530c7d7bd41789c919eb3feb1afd2e2
3
  size 876038394
run-1/checkpoint-78/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:37d9b1613ff6d2300b11f879cecc8f2dd698468e92f72087b5afbcd58a93d4c3
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7cb80c6482a4558788abedcba2be734f7fdb0ad575053421d615a6a0f859a7f9
3
  size 1064
run-1/checkpoint-78/trainer_state.json CHANGED
@@ -1,6 +1,6 @@
1
  {
2
  "best_global_step": 78,
3
- "best_metric": 0.4693140794223827,
4
  "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-78",
5
  "epoch": 1.0,
6
  "eval_steps": 500,
@@ -11,18 +11,18 @@
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
- "eval_accuracy": 0.4693140794223827,
15
- "eval_loss": 0.7096340656280518,
16
- "eval_runtime": 0.4626,
17
- "eval_samples_per_second": 598.83,
18
- "eval_steps_per_second": 19.457,
19
  "step": 78
20
  }
21
  ],
22
  "logging_steps": 500,
23
- "max_steps": 312,
24
  "num_input_tokens_seen": 0,
25
- "num_train_epochs": 4,
26
  "save_steps": 500,
27
  "stateful_callbacks": {
28
  "TrainerControl": {
@@ -40,10 +40,10 @@
40
  "train_batch_size": 32,
41
  "trial_name": null,
42
  "trial_params": {
43
- "dropout": 0.2,
44
- "learning_rate": 1.829932921064966e-06,
45
- "max_length": 512,
46
- "num_train_epochs": 4,
47
  "per_device_train_batch_size": 32
48
  }
49
  }
 
1
  {
2
  "best_global_step": 78,
3
+ "best_metric": 0.4657039711191336,
4
  "best_model_checkpoint": "bert-base-uncased-finetuned-rte-run_3/run-1/checkpoint-78",
5
  "epoch": 1.0,
6
  "eval_steps": 500,
 
11
  "log_history": [
12
  {
13
  "epoch": 1.0,
14
+ "eval_accuracy": 0.4657039711191336,
15
+ "eval_loss": 0.7084336876869202,
16
+ "eval_runtime": 0.468,
17
+ "eval_samples_per_second": 591.925,
18
+ "eval_steps_per_second": 19.232,
19
  "step": 78
20
  }
21
  ],
22
  "logging_steps": 500,
23
+ "max_steps": 390,
24
  "num_input_tokens_seen": 0,
25
+ "num_train_epochs": 5,
26
  "save_steps": 500,
27
  "stateful_callbacks": {
28
  "TrainerControl": {
 
40
  "train_batch_size": 32,
41
  "trial_name": null,
42
  "trial_params": {
43
+ "dropout": 0.30000000000000004,
44
+ "learning_rate": 1.7468082611997119e-06,
45
+ "max_length": 128,
46
+ "num_train_epochs": 5,
47
  "per_device_train_batch_size": 32
48
  }
49
  }
run-1/checkpoint-78/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fb0ce7b8d9b3515ccbe463d87ca2d46108b5ce74f85b2822691b1dc95f8f7102
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
  size 5432
runs/Apr07_19-56-35_578d22db0b7b/events.out.tfevents.1744056061.578d22db0b7b.632.2 CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:62b3a7c1cddc963ff9ade1c071d34bcf6a8c4880916a89d6a3eabe9b52b9a739
3
- size 5454
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8b4d235087424be0b9ccc6eb02386b0154c5ce8ab86a5e04e44b2e63ced0534f
3
+ size 6131
runs/Apr07_19-56-35_578d22db0b7b/events.out.tfevents.1744056114.578d22db0b7b.632.3 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:75ac05a2d48768e9ab10d598a3d0bf950470cb773e0e599479ad69749eeea10e
3
+ size 7065
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6aa5fb35f2884c4c92bbd41be63a3fb0f251b310d74b4b00f29d9c870755bdf0
3
  size 5432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cf1a2c38974b3913363ed96a22cfc21c27686e2010b13382fd797e03a5f8e573
3
  size 5432