sunshineNew commited on
Commit
772f6bd
·
verified ·
1 Parent(s): 21356d7

checkpoint step 7000

Browse files
Files changed (2) hide show
  1. model.safetensors +1 -1
  2. trainer_state.json +503 -3
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:931023b9348347b316738e46131c283de1ed8fcb7709a2469a7605098359bd93
3
  size 16381517208
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:862a42ccc7a81655eadd8b2c4b910cf7d7796580b5efffad24d875e84e58a724
3
  size 16381517208
trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.612911210381773,
6
  "eval_steps": 500,
7
- "global_step": 6500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -6508,6 +6508,506 @@
6508
  "mean_token_accuracy": 0.8217171192169189,
6509
  "num_tokens": 29752904.0,
6510
  "step": 6500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
6511
  }
6512
  ],
6513
  "logging_steps": 10,
@@ -6527,7 +7027,7 @@
6527
  "attributes": {}
6528
  }
6529
  },
6530
- "total_flos": 1.3510922543615017e+18,
6531
  "train_batch_size": 1,
6532
  "trial_name": null,
6533
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.6600582265649863,
6
  "eval_steps": 500,
7
+ "global_step": 7000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
6508
  "mean_token_accuracy": 0.8217171192169189,
6509
  "num_tokens": 29752904.0,
6510
  "step": 6500
6511
+ },
6512
+ {
6513
+ "entropy": 0.5653758386150003,
6514
+ "epoch": 0.6138541507054373,
6515
+ "grad_norm": 0.43359375,
6516
+ "learning_rate": 1.4348191985720905e-06,
6517
+ "loss": 0.5112238883972168,
6518
+ "mean_token_accuracy": 0.8314279425889254,
6519
+ "num_tokens": 29791019.0,
6520
+ "step": 6510
6521
+ },
6522
+ {
6523
+ "entropy": 0.6899514342658222,
6524
+ "epoch": 0.6147970910291015,
6525
+ "grad_norm": 0.44140625,
6526
+ "learning_rate": 1.4274996313819093e-06,
6527
+ "loss": 0.5467896461486816,
6528
+ "mean_token_accuracy": 0.8154542069882155,
6529
+ "num_tokens": 29837978.0,
6530
+ "step": 6520
6531
+ },
6532
+ {
6533
+ "entropy": 0.7366321623325348,
6534
+ "epoch": 0.6157400313527658,
6535
+ "grad_norm": 0.439453125,
6536
+ "learning_rate": 1.4201913142130953e-06,
6537
+ "loss": 0.5235143661499023,
6538
+ "mean_token_accuracy": 0.797525929659605,
6539
+ "num_tokens": 29885619.0,
6540
+ "step": 6530
6541
+ },
6542
+ {
6543
+ "entropy": 0.7723901643417775,
6544
+ "epoch": 0.61668297167643,
6545
+ "grad_norm": 0.5625,
6546
+ "learning_rate": 1.4128943237264397e-06,
6547
+ "loss": 0.6222280502319336,
6548
+ "mean_token_accuracy": 0.7883600037544966,
6549
+ "num_tokens": 29929441.0,
6550
+ "step": 6540
6551
+ },
6552
+ {
6553
+ "entropy": 0.7317868547514081,
6554
+ "epoch": 0.6176259120000943,
6555
+ "grad_norm": 0.28515625,
6556
+ "learning_rate": 1.4056087364639177e-06,
6557
+ "loss": 0.6348618984222412,
6558
+ "mean_token_accuracy": 0.7977587293833495,
6559
+ "num_tokens": 29980994.0,
6560
+ "step": 6550
6561
+ },
6562
+ {
6563
+ "entropy": 0.6215764599852264,
6564
+ "epoch": 0.6185688523237586,
6565
+ "grad_norm": 0.30859375,
6566
+ "learning_rate": 1.3983346288478934e-06,
6567
+ "loss": 0.46146564483642577,
6568
+ "mean_token_accuracy": 0.8226776365190744,
6569
+ "num_tokens": 30036423.0,
6570
+ "step": 6560
6571
+ },
6572
+ {
6573
+ "entropy": 0.7115271213464439,
6574
+ "epoch": 0.6195117926474228,
6575
+ "grad_norm": 0.6171875,
6576
+ "learning_rate": 1.3910720771803138e-06,
6577
+ "loss": 0.5262360572814941,
6578
+ "mean_token_accuracy": 0.815481587126851,
6579
+ "num_tokens": 30083567.0,
6580
+ "step": 6570
6581
+ },
6582
+ {
6583
+ "entropy": 0.6607028277590871,
6584
+ "epoch": 0.6204547329710871,
6585
+ "grad_norm": 0.546875,
6586
+ "learning_rate": 1.3838211576419084e-06,
6587
+ "loss": 0.6297407627105713,
6588
+ "mean_token_accuracy": 0.8033003844320774,
6589
+ "num_tokens": 30123282.0,
6590
+ "step": 6580
6591
+ },
6592
+ {
6593
+ "entropy": 0.8542975519783795,
6594
+ "epoch": 0.6213976732947514,
6595
+ "grad_norm": 0.380859375,
6596
+ "learning_rate": 1.3765819462913935e-06,
6597
+ "loss": 0.6734577655792237,
6598
+ "mean_token_accuracy": 0.7789794001728296,
6599
+ "num_tokens": 30175834.0,
6600
+ "step": 6590
6601
+ },
6602
+ {
6603
+ "entropy": 0.6683274048380554,
6604
+ "epoch": 0.6223406136184156,
6605
+ "grad_norm": 0.2578125,
6606
+ "learning_rate": 1.3693545190646687e-06,
6607
+ "loss": 0.5290188312530517,
6608
+ "mean_token_accuracy": 0.8123727187514305,
6609
+ "num_tokens": 30230839.0,
6610
+ "step": 6600
6611
+ },
6612
+ {
6613
+ "entropy": 0.8296206023544073,
6614
+ "epoch": 0.6232835539420799,
6615
+ "grad_norm": 0.376953125,
6616
+ "learning_rate": 1.3621389517740278e-06,
6617
+ "loss": 0.6783339023590088,
6618
+ "mean_token_accuracy": 0.772437755856663,
6619
+ "num_tokens": 30276477.0,
6620
+ "step": 6610
6621
+ },
6622
+ {
6623
+ "entropy": 0.7358615064062178,
6624
+ "epoch": 0.6242264942657442,
6625
+ "grad_norm": 0.55078125,
6626
+ "learning_rate": 1.354935320107355e-06,
6627
+ "loss": 0.7653596878051758,
6628
+ "mean_token_accuracy": 0.7917595565319061,
6629
+ "num_tokens": 30322719.0,
6630
+ "step": 6620
6631
+ },
6632
+ {
6633
+ "entropy": 0.6063522500917315,
6634
+ "epoch": 0.6251694345894084,
6635
+ "grad_norm": 0.421875,
6636
+ "learning_rate": 1.3477436996273391e-06,
6637
+ "loss": 0.493528938293457,
6638
+ "mean_token_accuracy": 0.8317346017807722,
6639
+ "num_tokens": 30366460.0,
6640
+ "step": 6630
6641
+ },
6642
+ {
6643
+ "entropy": 0.6097435717936606,
6644
+ "epoch": 0.6261123749130727,
6645
+ "grad_norm": 0.265625,
6646
+ "learning_rate": 1.340564165770677e-06,
6647
+ "loss": 0.5172214508056641,
6648
+ "mean_token_accuracy": 0.8287797518074512,
6649
+ "num_tokens": 30413005.0,
6650
+ "step": 6640
6651
+ },
6652
+ {
6653
+ "entropy": 0.7791145509108901,
6654
+ "epoch": 0.627055315236737,
6655
+ "grad_norm": 0.330078125,
6656
+ "learning_rate": 1.3333967938472791e-06,
6657
+ "loss": 0.6306872844696045,
6658
+ "mean_token_accuracy": 0.7808555860072375,
6659
+ "num_tokens": 30452797.0,
6660
+ "step": 6650
6661
+ },
6662
+ {
6663
+ "entropy": 0.7186586172319949,
6664
+ "epoch": 0.6279982555604012,
6665
+ "grad_norm": 0.2060546875,
6666
+ "learning_rate": 1.326241659039488e-06,
6667
+ "loss": 0.7230193614959717,
6668
+ "mean_token_accuracy": 0.8053840888664127,
6669
+ "num_tokens": 30501667.0,
6670
+ "step": 6660
6671
+ },
6672
+ {
6673
+ "entropy": 0.713790905289352,
6674
+ "epoch": 0.6289411958840655,
6675
+ "grad_norm": 0.36328125,
6676
+ "learning_rate": 1.3190988364012798e-06,
6677
+ "loss": 0.664982271194458,
6678
+ "mean_token_accuracy": 0.8036589544266463,
6679
+ "num_tokens": 30546332.0,
6680
+ "step": 6670
6681
+ },
6682
+ {
6683
+ "entropy": 0.7191013899631798,
6684
+ "epoch": 0.6298841362077298,
6685
+ "grad_norm": 1.1640625,
6686
+ "learning_rate": 1.3119684008574854e-06,
6687
+ "loss": 0.6084727287292481,
6688
+ "mean_token_accuracy": 0.7926711194217205,
6689
+ "num_tokens": 30592915.0,
6690
+ "step": 6680
6691
+ },
6692
+ {
6693
+ "entropy": 0.7162378825247288,
6694
+ "epoch": 0.630827076531394,
6695
+ "grad_norm": 0.51171875,
6696
+ "learning_rate": 1.3048504272029983e-06,
6697
+ "loss": 0.6665098190307617,
6698
+ "mean_token_accuracy": 0.7999292813241482,
6699
+ "num_tokens": 30630783.0,
6700
+ "step": 6690
6701
+ },
6702
+ {
6703
+ "entropy": 0.6918003332801164,
6704
+ "epoch": 0.6317700168550583,
6705
+ "grad_norm": 0.44140625,
6706
+ "learning_rate": 1.297744990101995e-06,
6707
+ "loss": 0.7901312828063964,
6708
+ "mean_token_accuracy": 0.8032176718115807,
6709
+ "num_tokens": 30684178.0,
6710
+ "step": 6700
6711
+ },
6712
+ {
6713
+ "entropy": 0.6030714954715222,
6714
+ "epoch": 0.6327129571787226,
6715
+ "grad_norm": 0.470703125,
6716
+ "learning_rate": 1.2906521640871492e-06,
6717
+ "loss": 0.5561746597290039,
6718
+ "mean_token_accuracy": 0.8341683767735958,
6719
+ "num_tokens": 30729882.0,
6720
+ "step": 6710
6721
+ },
6722
+ {
6723
+ "entropy": 0.616637565754354,
6724
+ "epoch": 0.6336558975023868,
6725
+ "grad_norm": 0.310546875,
6726
+ "learning_rate": 1.2835720235588475e-06,
6727
+ "loss": 0.572420072555542,
6728
+ "mean_token_accuracy": 0.8205343771725893,
6729
+ "num_tokens": 30779139.0,
6730
+ "step": 6720
6731
+ },
6732
+ {
6733
+ "entropy": 0.6006744123529643,
6734
+ "epoch": 0.6345988378260511,
6735
+ "grad_norm": 0.3984375,
6736
+ "learning_rate": 1.2765046427844157e-06,
6737
+ "loss": 0.521686601638794,
6738
+ "mean_token_accuracy": 0.8351531434804201,
6739
+ "num_tokens": 30826518.0,
6740
+ "step": 6730
6741
+ },
6742
+ {
6743
+ "entropy": 0.7569279128685593,
6744
+ "epoch": 0.6355417781497154,
6745
+ "grad_norm": 0.4609375,
6746
+ "learning_rate": 1.2694500958973327e-06,
6747
+ "loss": 0.6009937286376953,
6748
+ "mean_token_accuracy": 0.789092281088233,
6749
+ "num_tokens": 30881879.0,
6750
+ "step": 6740
6751
+ },
6752
+ {
6753
+ "entropy": 0.5884561772458256,
6754
+ "epoch": 0.6364847184733796,
6755
+ "grad_norm": 0.412109375,
6756
+ "learning_rate": 1.262408456896458e-06,
6757
+ "loss": 0.520009183883667,
6758
+ "mean_token_accuracy": 0.8386049326509237,
6759
+ "num_tokens": 30927036.0,
6760
+ "step": 6750
6761
+ },
6762
+ {
6763
+ "entropy": 0.5804953049868345,
6764
+ "epoch": 0.6374276587970439,
6765
+ "grad_norm": 0.65234375,
6766
+ "learning_rate": 1.2553797996452504e-06,
6767
+ "loss": 0.42743620872497556,
6768
+ "mean_token_accuracy": 0.8361934781074524,
6769
+ "num_tokens": 30973950.0,
6770
+ "step": 6760
6771
+ },
6772
+ {
6773
+ "entropy": 0.651206433866173,
6774
+ "epoch": 0.6383705991207081,
6775
+ "grad_norm": 0.28125,
6776
+ "learning_rate": 1.2483641978710023e-06,
6777
+ "loss": 0.5765644550323487,
6778
+ "mean_token_accuracy": 0.8276426322758198,
6779
+ "num_tokens": 31027156.0,
6780
+ "step": 6770
6781
+ },
6782
+ {
6783
+ "entropy": 0.7943007486872375,
6784
+ "epoch": 0.6393135394443724,
6785
+ "grad_norm": 0.2109375,
6786
+ "learning_rate": 1.2413617251640538e-06,
6787
+ "loss": 0.6862638473510743,
6788
+ "mean_token_accuracy": 0.7906891793012619,
6789
+ "num_tokens": 31081926.0,
6790
+ "step": 6780
6791
+ },
6792
+ {
6793
+ "entropy": 0.7911325155757367,
6794
+ "epoch": 0.6402564797680367,
6795
+ "grad_norm": 0.53125,
6796
+ "learning_rate": 1.2343724549770311e-06,
6797
+ "loss": 0.7334757328033448,
6798
+ "mean_token_accuracy": 0.7799281593412161,
6799
+ "num_tokens": 31123520.0,
6800
+ "step": 6790
6801
+ },
6802
+ {
6803
+ "entropy": 0.6264763680286706,
6804
+ "epoch": 0.641199420091701,
6805
+ "grad_norm": 0.404296875,
6806
+ "learning_rate": 1.2273964606240718e-06,
6807
+ "loss": 0.5062834739685058,
6808
+ "mean_token_accuracy": 0.813581820204854,
6809
+ "num_tokens": 31169681.0,
6810
+ "step": 6800
6811
+ },
6812
+ {
6813
+ "entropy": 0.6135468325577677,
6814
+ "epoch": 0.6421423604153652,
6815
+ "grad_norm": 0.388671875,
6816
+ "learning_rate": 1.220433815280054e-06,
6817
+ "loss": 0.4851649284362793,
6818
+ "mean_token_accuracy": 0.8191511053591967,
6819
+ "num_tokens": 31215610.0,
6820
+ "step": 6810
6821
+ },
6822
+ {
6823
+ "entropy": 0.8527200820855796,
6824
+ "epoch": 0.6430853007390295,
6825
+ "grad_norm": 0.404296875,
6826
+ "learning_rate": 1.2134845919798346e-06,
6827
+ "loss": 0.9052200317382812,
6828
+ "mean_token_accuracy": 0.7757729774340987,
6829
+ "num_tokens": 31256328.0,
6830
+ "step": 6820
6831
+ },
6832
+ {
6833
+ "entropy": 0.6696253786794841,
6834
+ "epoch": 0.6440282410626937,
6835
+ "grad_norm": 0.330078125,
6836
+ "learning_rate": 1.2065488636174761e-06,
6837
+ "loss": 0.4900521755218506,
6838
+ "mean_token_accuracy": 0.81925327219069,
6839
+ "num_tokens": 31303360.0,
6840
+ "step": 6830
6841
+ },
6842
+ {
6843
+ "entropy": 0.7389580006711185,
6844
+ "epoch": 0.644971181386358,
6845
+ "grad_norm": 0.6171875,
6846
+ "learning_rate": 1.1996267029454882e-06,
6847
+ "loss": 0.6637410640716552,
6848
+ "mean_token_accuracy": 0.7897630255669356,
6849
+ "num_tokens": 31356452.0,
6850
+ "step": 6840
6851
+ },
6852
+ {
6853
+ "entropy": 0.7582534276880324,
6854
+ "epoch": 0.6459141217100223,
6855
+ "grad_norm": 0.314453125,
6856
+ "learning_rate": 1.1927181825740598e-06,
6857
+ "loss": 0.6377841472625733,
6858
+ "mean_token_accuracy": 0.78179000467062,
6859
+ "num_tokens": 31402638.0,
6860
+ "step": 6850
6861
+ },
6862
+ {
6863
+ "entropy": 0.7765328639186919,
6864
+ "epoch": 0.6468570620336865,
6865
+ "grad_norm": 1.4765625,
6866
+ "learning_rate": 1.1858233749703008e-06,
6867
+ "loss": 0.7192119121551513,
6868
+ "mean_token_accuracy": 0.7862007327377796,
6869
+ "num_tokens": 31441999.0,
6870
+ "step": 6860
6871
+ },
6872
+ {
6873
+ "entropy": 0.6889529786072671,
6874
+ "epoch": 0.6478000023573508,
6875
+ "grad_norm": 0.455078125,
6876
+ "learning_rate": 1.1789423524574816e-06,
6877
+ "loss": 0.5516982555389405,
6878
+ "mean_token_accuracy": 0.8100367560982704,
6879
+ "num_tokens": 31496439.0,
6880
+ "step": 6870
6881
+ },
6882
+ {
6883
+ "entropy": 0.5635810997337103,
6884
+ "epoch": 0.6487429426810151,
6885
+ "grad_norm": 0.333984375,
6886
+ "learning_rate": 1.1720751872142708e-06,
6887
+ "loss": 0.512902307510376,
6888
+ "mean_token_accuracy": 0.8280544430017471,
6889
+ "num_tokens": 31543724.0,
6890
+ "step": 6880
6891
+ },
6892
+ {
6893
+ "entropy": 0.6845852768979966,
6894
+ "epoch": 0.6496858830046793,
6895
+ "grad_norm": 0.361328125,
6896
+ "learning_rate": 1.1652219512739838e-06,
6897
+ "loss": 0.5510530471801758,
6898
+ "mean_token_accuracy": 0.8120139855891466,
6899
+ "num_tokens": 31594284.0,
6900
+ "step": 6890
6901
+ },
6902
+ {
6903
+ "entropy": 0.6481620660051703,
6904
+ "epoch": 0.6506288233283436,
6905
+ "grad_norm": 0.5390625,
6906
+ "learning_rate": 1.1583827165238206e-06,
6907
+ "loss": 0.5910237789154053,
6908
+ "mean_token_accuracy": 0.8181051228195428,
6909
+ "num_tokens": 31635062.0,
6910
+ "step": 6900
6911
+ },
6912
+ {
6913
+ "entropy": 0.6908615042455495,
6914
+ "epoch": 0.6515717636520079,
6915
+ "grad_norm": 0.84375,
6916
+ "learning_rate": 1.15155755470412e-06,
6917
+ "loss": 0.6882299423217774,
6918
+ "mean_token_accuracy": 0.8048533439636231,
6919
+ "num_tokens": 31678473.0,
6920
+ "step": 6910
6921
+ },
6922
+ {
6923
+ "entropy": 0.7044286559335887,
6924
+ "epoch": 0.6525147039756721,
6925
+ "grad_norm": 0.609375,
6926
+ "learning_rate": 1.1447465374075975e-06,
6927
+ "loss": 0.7313314437866211,
6928
+ "mean_token_accuracy": 0.8019507348537445,
6929
+ "num_tokens": 31729255.0,
6930
+ "step": 6920
6931
+ },
6932
+ {
6933
+ "entropy": 0.6504749067127704,
6934
+ "epoch": 0.6534576442993364,
6935
+ "grad_norm": 0.490234375,
6936
+ "learning_rate": 1.137949736078603e-06,
6937
+ "loss": 0.5372074604034424,
6938
+ "mean_token_accuracy": 0.8073802709579467,
6939
+ "num_tokens": 31768907.0,
6940
+ "step": 6930
6941
+ },
6942
+ {
6943
+ "entropy": 0.7473512006923556,
6944
+ "epoch": 0.6544005846230007,
6945
+ "grad_norm": 0.423828125,
6946
+ "learning_rate": 1.1311672220123664e-06,
6947
+ "loss": 0.6788872241973877,
6948
+ "mean_token_accuracy": 0.7935893721878529,
6949
+ "num_tokens": 31812183.0,
6950
+ "step": 6940
6951
+ },
6952
+ {
6953
+ "entropy": 0.7024919440969825,
6954
+ "epoch": 0.6553435249466649,
6955
+ "grad_norm": 0.40625,
6956
+ "learning_rate": 1.1243990663542497e-06,
6957
+ "loss": 0.6041145324707031,
6958
+ "mean_token_accuracy": 0.8105067923665047,
6959
+ "num_tokens": 31862178.0,
6960
+ "step": 6950
6961
+ },
6962
+ {
6963
+ "entropy": 0.6629848030395806,
6964
+ "epoch": 0.6562864652703292,
6965
+ "grad_norm": 0.828125,
6966
+ "learning_rate": 1.1176453400990049e-06,
6967
+ "loss": 0.676570463180542,
6968
+ "mean_token_accuracy": 0.8191709652543068,
6969
+ "num_tokens": 31907853.0,
6970
+ "step": 6960
6971
+ },
6972
+ {
6973
+ "entropy": 0.6834048548713326,
6974
+ "epoch": 0.6572294055939935,
6975
+ "grad_norm": 0.921875,
6976
+ "learning_rate": 1.1109061140900224e-06,
6977
+ "loss": 0.5216798305511474,
6978
+ "mean_token_accuracy": 0.8132496692240239,
6979
+ "num_tokens": 31952569.0,
6980
+ "step": 6970
6981
+ },
6982
+ {
6983
+ "entropy": 0.6860712924972177,
6984
+ "epoch": 0.6581723459176577,
6985
+ "grad_norm": 0.421875,
6986
+ "learning_rate": 1.104181459018596e-06,
6987
+ "loss": 0.5502390384674072,
6988
+ "mean_token_accuracy": 0.8120945893228054,
6989
+ "num_tokens": 32000914.0,
6990
+ "step": 6980
6991
+ },
6992
+ {
6993
+ "entropy": 0.6751578035764396,
6994
+ "epoch": 0.659115286241322,
6995
+ "grad_norm": 0.6640625,
6996
+ "learning_rate": 1.0974714454231738e-06,
6997
+ "loss": 0.5092285633087158,
6998
+ "mean_token_accuracy": 0.8091344766318798,
6999
+ "num_tokens": 32047882.0,
7000
+ "step": 6990
7001
+ },
7002
+ {
7003
+ "entropy": 0.6862224272452295,
7004
+ "epoch": 0.6600582265649863,
7005
+ "grad_norm": 0.265625,
7006
+ "learning_rate": 1.0907761436886238e-06,
7007
+ "loss": 0.4828913688659668,
7008
+ "mean_token_accuracy": 0.8198781322687865,
7009
+ "num_tokens": 32093189.0,
7010
+ "step": 7000
7011
  }
7012
  ],
7013
  "logging_steps": 10,
 
7027
  "attributes": {}
7028
  }
7029
  },
7030
+ "total_flos": 1.4573656096110735e+18,
7031
  "train_batch_size": 1,
7032
  "trial_name": null,
7033
  "trial_params": null