azeddinShr's picture
Complete Spark-TTS with Arabic fine-tuned LLM
03401b7 verified
Raw
History Blame Contribute Delete
9.15 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.998891762098264,
"eval_steps": 339,
"global_step": 1016,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 11.850272178649902,
"eval_runtime": 7.1659,
"eval_samples_per_second": 19.956,
"eval_steps_per_second": 19.956,
"memory/device_reserved (GiB)": 3.2,
"memory/max_active (GiB)": 3.1,
"memory/max_allocated (GiB)": 3.1,
"step": 0
},
{
"epoch": 0.1477650535648319,
"grad_norm": 9.9116792678833,
"learning_rate": 0.00019925925947187668,
"loss": 7.2742,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 50,
"tokens_per_second_per_gpu": 2082.96,
"total_tokens": 164572
},
{
"epoch": 0.2955301071296638,
"grad_norm": 12.538771629333496,
"learning_rate": 0.0001961624298837552,
"loss": 5.6623,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 100,
"tokens_per_second_per_gpu": 1546.73,
"total_tokens": 287922
},
{
"epoch": 0.44329516069449576,
"grad_norm": 25.31467628479004,
"learning_rate": 0.00019072586525126637,
"loss": 5.3752,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 150,
"tokens_per_second_per_gpu": 1524.55,
"total_tokens": 410915
},
{
"epoch": 0.5910602142593276,
"grad_norm": 25.589689254760742,
"learning_rate": 0.00018308184302213046,
"loss": 5.0362,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 200,
"tokens_per_second_per_gpu": 1390.99,
"total_tokens": 533959
},
{
"epoch": 0.7388252678241596,
"grad_norm": 26.41189956665039,
"learning_rate": 0.00017341635045468791,
"loss": 4.8371,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 250,
"tokens_per_second_per_gpu": 1552.5,
"total_tokens": 656838
},
{
"epoch": 0.8865903213889915,
"grad_norm": 23.636552810668945,
"learning_rate": 0.00016196455934844978,
"loss": 4.7248,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 300,
"tokens_per_second_per_gpu": 1489.9,
"total_tokens": 779045
},
{
"epoch": 1.0,
"eval_loss": 4.642312526702881,
"eval_runtime": 7.0402,
"eval_samples_per_second": 20.312,
"eval_steps_per_second": 20.312,
"memory/device_reserved (GiB)": 7.67,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 339
},
{
"epoch": 1.032508311784263,
"grad_norm": 29.976333618164062,
"learning_rate": 0.00014900510406201564,
"loss": 4.6412,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 350,
"tokens_per_second_per_gpu": 346.62,
"total_tokens": 945548
},
{
"epoch": 1.1802733653490949,
"grad_norm": 28.489376068115234,
"learning_rate": 0.00013485330204031937,
"loss": 4.4916,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 400,
"tokens_per_second_per_gpu": 1511.66,
"total_tokens": 1067762
},
{
"epoch": 1.328038418913927,
"grad_norm": 25.01222038269043,
"learning_rate": 0.0001198534818030452,
"loss": 4.4404,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 450,
"tokens_per_second_per_gpu": 1375.01,
"total_tokens": 1188747
},
{
"epoch": 1.4758034724787588,
"grad_norm": 19.93057632446289,
"learning_rate": 0.00010437060506248341,
"loss": 4.4182,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 500,
"tokens_per_second_per_gpu": 1540.13,
"total_tokens": 1312791
},
{
"epoch": 1.6235685260435906,
"grad_norm": 20.955829620361328,
"learning_rate": 8.878138681368239e-05,
"loss": 4.3869,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 550,
"tokens_per_second_per_gpu": 1544.52,
"total_tokens": 1437766
},
{
"epoch": 1.7713335796084226,
"grad_norm": 27.51922035217285,
"learning_rate": 7.346512945462767e-05,
"loss": 4.359,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 600,
"tokens_per_second_per_gpu": 1525.07,
"total_tokens": 1560469
},
{
"epoch": 1.9190986331732547,
"grad_norm": 18.944068908691406,
"learning_rate": 5.879449395213175e-05,
"loss": 4.3688,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 650,
"tokens_per_second_per_gpu": 1526.23,
"total_tokens": 1681459
},
{
"epoch": 2.0,
"eval_loss": 4.463651657104492,
"eval_runtime": 6.8792,
"eval_samples_per_second": 20.787,
"eval_steps_per_second": 20.787,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 678
},
{
"epoch": 2.065016623568526,
"grad_norm": 18.91043472290039,
"learning_rate": 4.512643260086751e-05,
"loss": 4.294,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 700,
"tokens_per_second_per_gpu": 492.11,
"total_tokens": 1847089
},
{
"epoch": 2.212781677133358,
"grad_norm": 22.407855987548828,
"learning_rate": 3.279350399124066e-05,
"loss": 4.2329,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 750,
"tokens_per_second_per_gpu": 1508.42,
"total_tokens": 1969141
},
{
"epoch": 2.3605467306981898,
"grad_norm": 22.668535232543945,
"learning_rate": 2.209578150224645e-05,
"loss": 4.2312,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 800,
"tokens_per_second_per_gpu": 1531.3,
"total_tokens": 2090972
},
{
"epoch": 2.5083117842630216,
"grad_norm": 18.202590942382812,
"learning_rate": 1.3293552194358238e-05,
"loss": 4.222,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 850,
"tokens_per_second_per_gpu": 1544.96,
"total_tokens": 2213097
},
{
"epoch": 2.656076837827854,
"grad_norm": 18.34627914428711,
"learning_rate": 6.600983746212319e-06,
"loss": 4.2271,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 900,
"tokens_per_second_per_gpu": 1515.29,
"total_tokens": 2335026
},
{
"epoch": 2.8038418913926857,
"grad_norm": 21.71125030517578,
"learning_rate": 2.1809135253115565e-06,
"loss": 4.2248,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 950,
"tokens_per_second_per_gpu": 1450.1,
"total_tokens": 2458575
},
{
"epoch": 2.9516069449575175,
"grad_norm": 16.12077522277832,
"learning_rate": 1.4088658024622448e-07,
"loss": 4.2186,
"memory/device_reserved (GiB)": 7.62,
"memory/max_active (GiB)": 7.2,
"memory/max_allocated (GiB)": 7.2,
"step": 1000,
"tokens_per_second_per_gpu": 1481.33,
"total_tokens": 2582586
}
],
"logging_steps": 50,
"max_steps": 1016,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.7850881269039104e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}