checkpoint step 7000
Browse files- model.safetensors +1 -1
- trainer_state.json +503 -3
model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 16381517208
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:862a42ccc7a81655eadd8b2c4b910cf7d7796580b5efffad24d875e84e58a724
|
| 3 |
size 16381517208
|
trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 0.
|
| 6 |
"eval_steps": 500,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -6508,6 +6508,506 @@
|
|
| 6508 |
"mean_token_accuracy": 0.8217171192169189,
|
| 6509 |
"num_tokens": 29752904.0,
|
| 6510 |
"step": 6500
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 6511 |
}
|
| 6512 |
],
|
| 6513 |
"logging_steps": 10,
|
|
@@ -6527,7 +7027,7 @@
|
|
| 6527 |
"attributes": {}
|
| 6528 |
}
|
| 6529 |
},
|
| 6530 |
-
"total_flos": 1.
|
| 6531 |
"train_batch_size": 1,
|
| 6532 |
"trial_name": null,
|
| 6533 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 0.6600582265649863,
|
| 6 |
"eval_steps": 500,
|
| 7 |
+
"global_step": 7000,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 6508 |
"mean_token_accuracy": 0.8217171192169189,
|
| 6509 |
"num_tokens": 29752904.0,
|
| 6510 |
"step": 6500
|
| 6511 |
+
},
|
| 6512 |
+
{
|
| 6513 |
+
"entropy": 0.5653758386150003,
|
| 6514 |
+
"epoch": 0.6138541507054373,
|
| 6515 |
+
"grad_norm": 0.43359375,
|
| 6516 |
+
"learning_rate": 1.4348191985720905e-06,
|
| 6517 |
+
"loss": 0.5112238883972168,
|
| 6518 |
+
"mean_token_accuracy": 0.8314279425889254,
|
| 6519 |
+
"num_tokens": 29791019.0,
|
| 6520 |
+
"step": 6510
|
| 6521 |
+
},
|
| 6522 |
+
{
|
| 6523 |
+
"entropy": 0.6899514342658222,
|
| 6524 |
+
"epoch": 0.6147970910291015,
|
| 6525 |
+
"grad_norm": 0.44140625,
|
| 6526 |
+
"learning_rate": 1.4274996313819093e-06,
|
| 6527 |
+
"loss": 0.5467896461486816,
|
| 6528 |
+
"mean_token_accuracy": 0.8154542069882155,
|
| 6529 |
+
"num_tokens": 29837978.0,
|
| 6530 |
+
"step": 6520
|
| 6531 |
+
},
|
| 6532 |
+
{
|
| 6533 |
+
"entropy": 0.7366321623325348,
|
| 6534 |
+
"epoch": 0.6157400313527658,
|
| 6535 |
+
"grad_norm": 0.439453125,
|
| 6536 |
+
"learning_rate": 1.4201913142130953e-06,
|
| 6537 |
+
"loss": 0.5235143661499023,
|
| 6538 |
+
"mean_token_accuracy": 0.797525929659605,
|
| 6539 |
+
"num_tokens": 29885619.0,
|
| 6540 |
+
"step": 6530
|
| 6541 |
+
},
|
| 6542 |
+
{
|
| 6543 |
+
"entropy": 0.7723901643417775,
|
| 6544 |
+
"epoch": 0.61668297167643,
|
| 6545 |
+
"grad_norm": 0.5625,
|
| 6546 |
+
"learning_rate": 1.4128943237264397e-06,
|
| 6547 |
+
"loss": 0.6222280502319336,
|
| 6548 |
+
"mean_token_accuracy": 0.7883600037544966,
|
| 6549 |
+
"num_tokens": 29929441.0,
|
| 6550 |
+
"step": 6540
|
| 6551 |
+
},
|
| 6552 |
+
{
|
| 6553 |
+
"entropy": 0.7317868547514081,
|
| 6554 |
+
"epoch": 0.6176259120000943,
|
| 6555 |
+
"grad_norm": 0.28515625,
|
| 6556 |
+
"learning_rate": 1.4056087364639177e-06,
|
| 6557 |
+
"loss": 0.6348618984222412,
|
| 6558 |
+
"mean_token_accuracy": 0.7977587293833495,
|
| 6559 |
+
"num_tokens": 29980994.0,
|
| 6560 |
+
"step": 6550
|
| 6561 |
+
},
|
| 6562 |
+
{
|
| 6563 |
+
"entropy": 0.6215764599852264,
|
| 6564 |
+
"epoch": 0.6185688523237586,
|
| 6565 |
+
"grad_norm": 0.30859375,
|
| 6566 |
+
"learning_rate": 1.3983346288478934e-06,
|
| 6567 |
+
"loss": 0.46146564483642577,
|
| 6568 |
+
"mean_token_accuracy": 0.8226776365190744,
|
| 6569 |
+
"num_tokens": 30036423.0,
|
| 6570 |
+
"step": 6560
|
| 6571 |
+
},
|
| 6572 |
+
{
|
| 6573 |
+
"entropy": 0.7115271213464439,
|
| 6574 |
+
"epoch": 0.6195117926474228,
|
| 6575 |
+
"grad_norm": 0.6171875,
|
| 6576 |
+
"learning_rate": 1.3910720771803138e-06,
|
| 6577 |
+
"loss": 0.5262360572814941,
|
| 6578 |
+
"mean_token_accuracy": 0.815481587126851,
|
| 6579 |
+
"num_tokens": 30083567.0,
|
| 6580 |
+
"step": 6570
|
| 6581 |
+
},
|
| 6582 |
+
{
|
| 6583 |
+
"entropy": 0.6607028277590871,
|
| 6584 |
+
"epoch": 0.6204547329710871,
|
| 6585 |
+
"grad_norm": 0.546875,
|
| 6586 |
+
"learning_rate": 1.3838211576419084e-06,
|
| 6587 |
+
"loss": 0.6297407627105713,
|
| 6588 |
+
"mean_token_accuracy": 0.8033003844320774,
|
| 6589 |
+
"num_tokens": 30123282.0,
|
| 6590 |
+
"step": 6580
|
| 6591 |
+
},
|
| 6592 |
+
{
|
| 6593 |
+
"entropy": 0.8542975519783795,
|
| 6594 |
+
"epoch": 0.6213976732947514,
|
| 6595 |
+
"grad_norm": 0.380859375,
|
| 6596 |
+
"learning_rate": 1.3765819462913935e-06,
|
| 6597 |
+
"loss": 0.6734577655792237,
|
| 6598 |
+
"mean_token_accuracy": 0.7789794001728296,
|
| 6599 |
+
"num_tokens": 30175834.0,
|
| 6600 |
+
"step": 6590
|
| 6601 |
+
},
|
| 6602 |
+
{
|
| 6603 |
+
"entropy": 0.6683274048380554,
|
| 6604 |
+
"epoch": 0.6223406136184156,
|
| 6605 |
+
"grad_norm": 0.2578125,
|
| 6606 |
+
"learning_rate": 1.3693545190646687e-06,
|
| 6607 |
+
"loss": 0.5290188312530517,
|
| 6608 |
+
"mean_token_accuracy": 0.8123727187514305,
|
| 6609 |
+
"num_tokens": 30230839.0,
|
| 6610 |
+
"step": 6600
|
| 6611 |
+
},
|
| 6612 |
+
{
|
| 6613 |
+
"entropy": 0.8296206023544073,
|
| 6614 |
+
"epoch": 0.6232835539420799,
|
| 6615 |
+
"grad_norm": 0.376953125,
|
| 6616 |
+
"learning_rate": 1.3621389517740278e-06,
|
| 6617 |
+
"loss": 0.6783339023590088,
|
| 6618 |
+
"mean_token_accuracy": 0.772437755856663,
|
| 6619 |
+
"num_tokens": 30276477.0,
|
| 6620 |
+
"step": 6610
|
| 6621 |
+
},
|
| 6622 |
+
{
|
| 6623 |
+
"entropy": 0.7358615064062178,
|
| 6624 |
+
"epoch": 0.6242264942657442,
|
| 6625 |
+
"grad_norm": 0.55078125,
|
| 6626 |
+
"learning_rate": 1.354935320107355e-06,
|
| 6627 |
+
"loss": 0.7653596878051758,
|
| 6628 |
+
"mean_token_accuracy": 0.7917595565319061,
|
| 6629 |
+
"num_tokens": 30322719.0,
|
| 6630 |
+
"step": 6620
|
| 6631 |
+
},
|
| 6632 |
+
{
|
| 6633 |
+
"entropy": 0.6063522500917315,
|
| 6634 |
+
"epoch": 0.6251694345894084,
|
| 6635 |
+
"grad_norm": 0.421875,
|
| 6636 |
+
"learning_rate": 1.3477436996273391e-06,
|
| 6637 |
+
"loss": 0.493528938293457,
|
| 6638 |
+
"mean_token_accuracy": 0.8317346017807722,
|
| 6639 |
+
"num_tokens": 30366460.0,
|
| 6640 |
+
"step": 6630
|
| 6641 |
+
},
|
| 6642 |
+
{
|
| 6643 |
+
"entropy": 0.6097435717936606,
|
| 6644 |
+
"epoch": 0.6261123749130727,
|
| 6645 |
+
"grad_norm": 0.265625,
|
| 6646 |
+
"learning_rate": 1.340564165770677e-06,
|
| 6647 |
+
"loss": 0.5172214508056641,
|
| 6648 |
+
"mean_token_accuracy": 0.8287797518074512,
|
| 6649 |
+
"num_tokens": 30413005.0,
|
| 6650 |
+
"step": 6640
|
| 6651 |
+
},
|
| 6652 |
+
{
|
| 6653 |
+
"entropy": 0.7791145509108901,
|
| 6654 |
+
"epoch": 0.627055315236737,
|
| 6655 |
+
"grad_norm": 0.330078125,
|
| 6656 |
+
"learning_rate": 1.3333967938472791e-06,
|
| 6657 |
+
"loss": 0.6306872844696045,
|
| 6658 |
+
"mean_token_accuracy": 0.7808555860072375,
|
| 6659 |
+
"num_tokens": 30452797.0,
|
| 6660 |
+
"step": 6650
|
| 6661 |
+
},
|
| 6662 |
+
{
|
| 6663 |
+
"entropy": 0.7186586172319949,
|
| 6664 |
+
"epoch": 0.6279982555604012,
|
| 6665 |
+
"grad_norm": 0.2060546875,
|
| 6666 |
+
"learning_rate": 1.326241659039488e-06,
|
| 6667 |
+
"loss": 0.7230193614959717,
|
| 6668 |
+
"mean_token_accuracy": 0.8053840888664127,
|
| 6669 |
+
"num_tokens": 30501667.0,
|
| 6670 |
+
"step": 6660
|
| 6671 |
+
},
|
| 6672 |
+
{
|
| 6673 |
+
"entropy": 0.713790905289352,
|
| 6674 |
+
"epoch": 0.6289411958840655,
|
| 6675 |
+
"grad_norm": 0.36328125,
|
| 6676 |
+
"learning_rate": 1.3190988364012798e-06,
|
| 6677 |
+
"loss": 0.664982271194458,
|
| 6678 |
+
"mean_token_accuracy": 0.8036589544266463,
|
| 6679 |
+
"num_tokens": 30546332.0,
|
| 6680 |
+
"step": 6670
|
| 6681 |
+
},
|
| 6682 |
+
{
|
| 6683 |
+
"entropy": 0.7191013899631798,
|
| 6684 |
+
"epoch": 0.6298841362077298,
|
| 6685 |
+
"grad_norm": 1.1640625,
|
| 6686 |
+
"learning_rate": 1.3119684008574854e-06,
|
| 6687 |
+
"loss": 0.6084727287292481,
|
| 6688 |
+
"mean_token_accuracy": 0.7926711194217205,
|
| 6689 |
+
"num_tokens": 30592915.0,
|
| 6690 |
+
"step": 6680
|
| 6691 |
+
},
|
| 6692 |
+
{
|
| 6693 |
+
"entropy": 0.7162378825247288,
|
| 6694 |
+
"epoch": 0.630827076531394,
|
| 6695 |
+
"grad_norm": 0.51171875,
|
| 6696 |
+
"learning_rate": 1.3048504272029983e-06,
|
| 6697 |
+
"loss": 0.6665098190307617,
|
| 6698 |
+
"mean_token_accuracy": 0.7999292813241482,
|
| 6699 |
+
"num_tokens": 30630783.0,
|
| 6700 |
+
"step": 6690
|
| 6701 |
+
},
|
| 6702 |
+
{
|
| 6703 |
+
"entropy": 0.6918003332801164,
|
| 6704 |
+
"epoch": 0.6317700168550583,
|
| 6705 |
+
"grad_norm": 0.44140625,
|
| 6706 |
+
"learning_rate": 1.297744990101995e-06,
|
| 6707 |
+
"loss": 0.7901312828063964,
|
| 6708 |
+
"mean_token_accuracy": 0.8032176718115807,
|
| 6709 |
+
"num_tokens": 30684178.0,
|
| 6710 |
+
"step": 6700
|
| 6711 |
+
},
|
| 6712 |
+
{
|
| 6713 |
+
"entropy": 0.6030714954715222,
|
| 6714 |
+
"epoch": 0.6327129571787226,
|
| 6715 |
+
"grad_norm": 0.470703125,
|
| 6716 |
+
"learning_rate": 1.2906521640871492e-06,
|
| 6717 |
+
"loss": 0.5561746597290039,
|
| 6718 |
+
"mean_token_accuracy": 0.8341683767735958,
|
| 6719 |
+
"num_tokens": 30729882.0,
|
| 6720 |
+
"step": 6710
|
| 6721 |
+
},
|
| 6722 |
+
{
|
| 6723 |
+
"entropy": 0.616637565754354,
|
| 6724 |
+
"epoch": 0.6336558975023868,
|
| 6725 |
+
"grad_norm": 0.310546875,
|
| 6726 |
+
"learning_rate": 1.2835720235588475e-06,
|
| 6727 |
+
"loss": 0.572420072555542,
|
| 6728 |
+
"mean_token_accuracy": 0.8205343771725893,
|
| 6729 |
+
"num_tokens": 30779139.0,
|
| 6730 |
+
"step": 6720
|
| 6731 |
+
},
|
| 6732 |
+
{
|
| 6733 |
+
"entropy": 0.6006744123529643,
|
| 6734 |
+
"epoch": 0.6345988378260511,
|
| 6735 |
+
"grad_norm": 0.3984375,
|
| 6736 |
+
"learning_rate": 1.2765046427844157e-06,
|
| 6737 |
+
"loss": 0.521686601638794,
|
| 6738 |
+
"mean_token_accuracy": 0.8351531434804201,
|
| 6739 |
+
"num_tokens": 30826518.0,
|
| 6740 |
+
"step": 6730
|
| 6741 |
+
},
|
| 6742 |
+
{
|
| 6743 |
+
"entropy": 0.7569279128685593,
|
| 6744 |
+
"epoch": 0.6355417781497154,
|
| 6745 |
+
"grad_norm": 0.4609375,
|
| 6746 |
+
"learning_rate": 1.2694500958973327e-06,
|
| 6747 |
+
"loss": 0.6009937286376953,
|
| 6748 |
+
"mean_token_accuracy": 0.789092281088233,
|
| 6749 |
+
"num_tokens": 30881879.0,
|
| 6750 |
+
"step": 6740
|
| 6751 |
+
},
|
| 6752 |
+
{
|
| 6753 |
+
"entropy": 0.5884561772458256,
|
| 6754 |
+
"epoch": 0.6364847184733796,
|
| 6755 |
+
"grad_norm": 0.412109375,
|
| 6756 |
+
"learning_rate": 1.262408456896458e-06,
|
| 6757 |
+
"loss": 0.520009183883667,
|
| 6758 |
+
"mean_token_accuracy": 0.8386049326509237,
|
| 6759 |
+
"num_tokens": 30927036.0,
|
| 6760 |
+
"step": 6750
|
| 6761 |
+
},
|
| 6762 |
+
{
|
| 6763 |
+
"entropy": 0.5804953049868345,
|
| 6764 |
+
"epoch": 0.6374276587970439,
|
| 6765 |
+
"grad_norm": 0.65234375,
|
| 6766 |
+
"learning_rate": 1.2553797996452504e-06,
|
| 6767 |
+
"loss": 0.42743620872497556,
|
| 6768 |
+
"mean_token_accuracy": 0.8361934781074524,
|
| 6769 |
+
"num_tokens": 30973950.0,
|
| 6770 |
+
"step": 6760
|
| 6771 |
+
},
|
| 6772 |
+
{
|
| 6773 |
+
"entropy": 0.651206433866173,
|
| 6774 |
+
"epoch": 0.6383705991207081,
|
| 6775 |
+
"grad_norm": 0.28125,
|
| 6776 |
+
"learning_rate": 1.2483641978710023e-06,
|
| 6777 |
+
"loss": 0.5765644550323487,
|
| 6778 |
+
"mean_token_accuracy": 0.8276426322758198,
|
| 6779 |
+
"num_tokens": 31027156.0,
|
| 6780 |
+
"step": 6770
|
| 6781 |
+
},
|
| 6782 |
+
{
|
| 6783 |
+
"entropy": 0.7943007486872375,
|
| 6784 |
+
"epoch": 0.6393135394443724,
|
| 6785 |
+
"grad_norm": 0.2109375,
|
| 6786 |
+
"learning_rate": 1.2413617251640538e-06,
|
| 6787 |
+
"loss": 0.6862638473510743,
|
| 6788 |
+
"mean_token_accuracy": 0.7906891793012619,
|
| 6789 |
+
"num_tokens": 31081926.0,
|
| 6790 |
+
"step": 6780
|
| 6791 |
+
},
|
| 6792 |
+
{
|
| 6793 |
+
"entropy": 0.7911325155757367,
|
| 6794 |
+
"epoch": 0.6402564797680367,
|
| 6795 |
+
"grad_norm": 0.53125,
|
| 6796 |
+
"learning_rate": 1.2343724549770311e-06,
|
| 6797 |
+
"loss": 0.7334757328033448,
|
| 6798 |
+
"mean_token_accuracy": 0.7799281593412161,
|
| 6799 |
+
"num_tokens": 31123520.0,
|
| 6800 |
+
"step": 6790
|
| 6801 |
+
},
|
| 6802 |
+
{
|
| 6803 |
+
"entropy": 0.6264763680286706,
|
| 6804 |
+
"epoch": 0.641199420091701,
|
| 6805 |
+
"grad_norm": 0.404296875,
|
| 6806 |
+
"learning_rate": 1.2273964606240718e-06,
|
| 6807 |
+
"loss": 0.5062834739685058,
|
| 6808 |
+
"mean_token_accuracy": 0.813581820204854,
|
| 6809 |
+
"num_tokens": 31169681.0,
|
| 6810 |
+
"step": 6800
|
| 6811 |
+
},
|
| 6812 |
+
{
|
| 6813 |
+
"entropy": 0.6135468325577677,
|
| 6814 |
+
"epoch": 0.6421423604153652,
|
| 6815 |
+
"grad_norm": 0.388671875,
|
| 6816 |
+
"learning_rate": 1.220433815280054e-06,
|
| 6817 |
+
"loss": 0.4851649284362793,
|
| 6818 |
+
"mean_token_accuracy": 0.8191511053591967,
|
| 6819 |
+
"num_tokens": 31215610.0,
|
| 6820 |
+
"step": 6810
|
| 6821 |
+
},
|
| 6822 |
+
{
|
| 6823 |
+
"entropy": 0.8527200820855796,
|
| 6824 |
+
"epoch": 0.6430853007390295,
|
| 6825 |
+
"grad_norm": 0.404296875,
|
| 6826 |
+
"learning_rate": 1.2134845919798346e-06,
|
| 6827 |
+
"loss": 0.9052200317382812,
|
| 6828 |
+
"mean_token_accuracy": 0.7757729774340987,
|
| 6829 |
+
"num_tokens": 31256328.0,
|
| 6830 |
+
"step": 6820
|
| 6831 |
+
},
|
| 6832 |
+
{
|
| 6833 |
+
"entropy": 0.6696253786794841,
|
| 6834 |
+
"epoch": 0.6440282410626937,
|
| 6835 |
+
"grad_norm": 0.330078125,
|
| 6836 |
+
"learning_rate": 1.2065488636174761e-06,
|
| 6837 |
+
"loss": 0.4900521755218506,
|
| 6838 |
+
"mean_token_accuracy": 0.81925327219069,
|
| 6839 |
+
"num_tokens": 31303360.0,
|
| 6840 |
+
"step": 6830
|
| 6841 |
+
},
|
| 6842 |
+
{
|
| 6843 |
+
"entropy": 0.7389580006711185,
|
| 6844 |
+
"epoch": 0.644971181386358,
|
| 6845 |
+
"grad_norm": 0.6171875,
|
| 6846 |
+
"learning_rate": 1.1996267029454882e-06,
|
| 6847 |
+
"loss": 0.6637410640716552,
|
| 6848 |
+
"mean_token_accuracy": 0.7897630255669356,
|
| 6849 |
+
"num_tokens": 31356452.0,
|
| 6850 |
+
"step": 6840
|
| 6851 |
+
},
|
| 6852 |
+
{
|
| 6853 |
+
"entropy": 0.7582534276880324,
|
| 6854 |
+
"epoch": 0.6459141217100223,
|
| 6855 |
+
"grad_norm": 0.314453125,
|
| 6856 |
+
"learning_rate": 1.1927181825740598e-06,
|
| 6857 |
+
"loss": 0.6377841472625733,
|
| 6858 |
+
"mean_token_accuracy": 0.78179000467062,
|
| 6859 |
+
"num_tokens": 31402638.0,
|
| 6860 |
+
"step": 6850
|
| 6861 |
+
},
|
| 6862 |
+
{
|
| 6863 |
+
"entropy": 0.7765328639186919,
|
| 6864 |
+
"epoch": 0.6468570620336865,
|
| 6865 |
+
"grad_norm": 1.4765625,
|
| 6866 |
+
"learning_rate": 1.1858233749703008e-06,
|
| 6867 |
+
"loss": 0.7192119121551513,
|
| 6868 |
+
"mean_token_accuracy": 0.7862007327377796,
|
| 6869 |
+
"num_tokens": 31441999.0,
|
| 6870 |
+
"step": 6860
|
| 6871 |
+
},
|
| 6872 |
+
{
|
| 6873 |
+
"entropy": 0.6889529786072671,
|
| 6874 |
+
"epoch": 0.6478000023573508,
|
| 6875 |
+
"grad_norm": 0.455078125,
|
| 6876 |
+
"learning_rate": 1.1789423524574816e-06,
|
| 6877 |
+
"loss": 0.5516982555389405,
|
| 6878 |
+
"mean_token_accuracy": 0.8100367560982704,
|
| 6879 |
+
"num_tokens": 31496439.0,
|
| 6880 |
+
"step": 6870
|
| 6881 |
+
},
|
| 6882 |
+
{
|
| 6883 |
+
"entropy": 0.5635810997337103,
|
| 6884 |
+
"epoch": 0.6487429426810151,
|
| 6885 |
+
"grad_norm": 0.333984375,
|
| 6886 |
+
"learning_rate": 1.1720751872142708e-06,
|
| 6887 |
+
"loss": 0.512902307510376,
|
| 6888 |
+
"mean_token_accuracy": 0.8280544430017471,
|
| 6889 |
+
"num_tokens": 31543724.0,
|
| 6890 |
+
"step": 6880
|
| 6891 |
+
},
|
| 6892 |
+
{
|
| 6893 |
+
"entropy": 0.6845852768979966,
|
| 6894 |
+
"epoch": 0.6496858830046793,
|
| 6895 |
+
"grad_norm": 0.361328125,
|
| 6896 |
+
"learning_rate": 1.1652219512739838e-06,
|
| 6897 |
+
"loss": 0.5510530471801758,
|
| 6898 |
+
"mean_token_accuracy": 0.8120139855891466,
|
| 6899 |
+
"num_tokens": 31594284.0,
|
| 6900 |
+
"step": 6890
|
| 6901 |
+
},
|
| 6902 |
+
{
|
| 6903 |
+
"entropy": 0.6481620660051703,
|
| 6904 |
+
"epoch": 0.6506288233283436,
|
| 6905 |
+
"grad_norm": 0.5390625,
|
| 6906 |
+
"learning_rate": 1.1583827165238206e-06,
|
| 6907 |
+
"loss": 0.5910237789154053,
|
| 6908 |
+
"mean_token_accuracy": 0.8181051228195428,
|
| 6909 |
+
"num_tokens": 31635062.0,
|
| 6910 |
+
"step": 6900
|
| 6911 |
+
},
|
| 6912 |
+
{
|
| 6913 |
+
"entropy": 0.6908615042455495,
|
| 6914 |
+
"epoch": 0.6515717636520079,
|
| 6915 |
+
"grad_norm": 0.84375,
|
| 6916 |
+
"learning_rate": 1.15155755470412e-06,
|
| 6917 |
+
"loss": 0.6882299423217774,
|
| 6918 |
+
"mean_token_accuracy": 0.8048533439636231,
|
| 6919 |
+
"num_tokens": 31678473.0,
|
| 6920 |
+
"step": 6910
|
| 6921 |
+
},
|
| 6922 |
+
{
|
| 6923 |
+
"entropy": 0.7044286559335887,
|
| 6924 |
+
"epoch": 0.6525147039756721,
|
| 6925 |
+
"grad_norm": 0.609375,
|
| 6926 |
+
"learning_rate": 1.1447465374075975e-06,
|
| 6927 |
+
"loss": 0.7313314437866211,
|
| 6928 |
+
"mean_token_accuracy": 0.8019507348537445,
|
| 6929 |
+
"num_tokens": 31729255.0,
|
| 6930 |
+
"step": 6920
|
| 6931 |
+
},
|
| 6932 |
+
{
|
| 6933 |
+
"entropy": 0.6504749067127704,
|
| 6934 |
+
"epoch": 0.6534576442993364,
|
| 6935 |
+
"grad_norm": 0.490234375,
|
| 6936 |
+
"learning_rate": 1.137949736078603e-06,
|
| 6937 |
+
"loss": 0.5372074604034424,
|
| 6938 |
+
"mean_token_accuracy": 0.8073802709579467,
|
| 6939 |
+
"num_tokens": 31768907.0,
|
| 6940 |
+
"step": 6930
|
| 6941 |
+
},
|
| 6942 |
+
{
|
| 6943 |
+
"entropy": 0.7473512006923556,
|
| 6944 |
+
"epoch": 0.6544005846230007,
|
| 6945 |
+
"grad_norm": 0.423828125,
|
| 6946 |
+
"learning_rate": 1.1311672220123664e-06,
|
| 6947 |
+
"loss": 0.6788872241973877,
|
| 6948 |
+
"mean_token_accuracy": 0.7935893721878529,
|
| 6949 |
+
"num_tokens": 31812183.0,
|
| 6950 |
+
"step": 6940
|
| 6951 |
+
},
|
| 6952 |
+
{
|
| 6953 |
+
"entropy": 0.7024919440969825,
|
| 6954 |
+
"epoch": 0.6553435249466649,
|
| 6955 |
+
"grad_norm": 0.40625,
|
| 6956 |
+
"learning_rate": 1.1243990663542497e-06,
|
| 6957 |
+
"loss": 0.6041145324707031,
|
| 6958 |
+
"mean_token_accuracy": 0.8105067923665047,
|
| 6959 |
+
"num_tokens": 31862178.0,
|
| 6960 |
+
"step": 6950
|
| 6961 |
+
},
|
| 6962 |
+
{
|
| 6963 |
+
"entropy": 0.6629848030395806,
|
| 6964 |
+
"epoch": 0.6562864652703292,
|
| 6965 |
+
"grad_norm": 0.828125,
|
| 6966 |
+
"learning_rate": 1.1176453400990049e-06,
|
| 6967 |
+
"loss": 0.676570463180542,
|
| 6968 |
+
"mean_token_accuracy": 0.8191709652543068,
|
| 6969 |
+
"num_tokens": 31907853.0,
|
| 6970 |
+
"step": 6960
|
| 6971 |
+
},
|
| 6972 |
+
{
|
| 6973 |
+
"entropy": 0.6834048548713326,
|
| 6974 |
+
"epoch": 0.6572294055939935,
|
| 6975 |
+
"grad_norm": 0.921875,
|
| 6976 |
+
"learning_rate": 1.1109061140900224e-06,
|
| 6977 |
+
"loss": 0.5216798305511474,
|
| 6978 |
+
"mean_token_accuracy": 0.8132496692240239,
|
| 6979 |
+
"num_tokens": 31952569.0,
|
| 6980 |
+
"step": 6970
|
| 6981 |
+
},
|
| 6982 |
+
{
|
| 6983 |
+
"entropy": 0.6860712924972177,
|
| 6984 |
+
"epoch": 0.6581723459176577,
|
| 6985 |
+
"grad_norm": 0.421875,
|
| 6986 |
+
"learning_rate": 1.104181459018596e-06,
|
| 6987 |
+
"loss": 0.5502390384674072,
|
| 6988 |
+
"mean_token_accuracy": 0.8120945893228054,
|
| 6989 |
+
"num_tokens": 32000914.0,
|
| 6990 |
+
"step": 6980
|
| 6991 |
+
},
|
| 6992 |
+
{
|
| 6993 |
+
"entropy": 0.6751578035764396,
|
| 6994 |
+
"epoch": 0.659115286241322,
|
| 6995 |
+
"grad_norm": 0.6640625,
|
| 6996 |
+
"learning_rate": 1.0974714454231738e-06,
|
| 6997 |
+
"loss": 0.5092285633087158,
|
| 6998 |
+
"mean_token_accuracy": 0.8091344766318798,
|
| 6999 |
+
"num_tokens": 32047882.0,
|
| 7000 |
+
"step": 6990
|
| 7001 |
+
},
|
| 7002 |
+
{
|
| 7003 |
+
"entropy": 0.6862224272452295,
|
| 7004 |
+
"epoch": 0.6600582265649863,
|
| 7005 |
+
"grad_norm": 0.265625,
|
| 7006 |
+
"learning_rate": 1.0907761436886238e-06,
|
| 7007 |
+
"loss": 0.4828913688659668,
|
| 7008 |
+
"mean_token_accuracy": 0.8198781322687865,
|
| 7009 |
+
"num_tokens": 32093189.0,
|
| 7010 |
+
"step": 7000
|
| 7011 |
}
|
| 7012 |
],
|
| 7013 |
"logging_steps": 10,
|
|
|
|
| 7027 |
"attributes": {}
|
| 7028 |
}
|
| 7029 |
},
|
| 7030 |
+
"total_flos": 1.4573656096110735e+18,
|
| 7031 |
"train_batch_size": 1,
|
| 7032 |
"trial_name": null,
|
| 7033 |
"trial_params": null
|