ZhangYuchi's picture
Upload Qwen2.5-Omni-7B SFT (with_obs, ckpt-150) for OmniGAIA
4f19ff2 verified
Raw
History Blame Contribute Delete
7.69 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.282051282051282,
"eval_steps": 50.0,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.008547008547008548,
"grad_norm": 13.935976028442383,
"learning_rate": 1.25e-06,
"loss": 1.2302496433258057,
"step": 1,
"token_acc": 0.7555120910384068
},
{
"epoch": 0.042735042735042736,
"grad_norm": 12.733538627624512,
"learning_rate": 6.25e-06,
"loss": 1.1761837005615234,
"step": 5,
"token_acc": 0.7647914645974782
},
{
"epoch": 0.08547008547008547,
"grad_norm": 3.3333914279937744,
"learning_rate": 9.998067787472772e-06,
"loss": 0.896819019317627,
"step": 10,
"token_acc": 0.7896966517032977
},
{
"epoch": 0.1282051282051282,
"grad_norm": 3.5416104793548584,
"learning_rate": 9.976347543410487e-06,
"loss": 0.7495913505554199,
"step": 15,
"token_acc": 0.8130858441520439
},
{
"epoch": 0.17094017094017094,
"grad_norm": 3.1907875537872314,
"learning_rate": 9.930597024496933e-06,
"loss": 0.6861935615539551,
"step": 20,
"token_acc": 0.8265455118441095
},
{
"epoch": 0.21367521367521367,
"grad_norm": 3.0737252235412598,
"learning_rate": 9.861037155322777e-06,
"loss": 0.6162723064422607,
"step": 25,
"token_acc": 0.8381843560978132
},
{
"epoch": 0.2564102564102564,
"grad_norm": 3.321166753768921,
"learning_rate": 9.768003833403278e-06,
"loss": 0.5933701515197753,
"step": 30,
"token_acc": 0.8392482419056003
},
{
"epoch": 0.29914529914529914,
"grad_norm": 2.5869693756103516,
"learning_rate": 9.651946307163417e-06,
"loss": 0.6245723724365234,
"step": 35,
"token_acc": 0.8400627408615442
},
{
"epoch": 0.3418803418803419,
"grad_norm": 3.3702032566070557,
"learning_rate": 9.51342500656308e-06,
"loss": 0.5320750713348389,
"step": 40,
"token_acc": 0.8597009626829829
},
{
"epoch": 0.38461538461538464,
"grad_norm": 2.5714972019195557,
"learning_rate": 9.353108836837907e-06,
"loss": 0.6000706672668457,
"step": 45,
"token_acc": 0.8455385915790586
},
{
"epoch": 0.42735042735042733,
"grad_norm": 2.7259583473205566,
"learning_rate": 9.171771948424138e-06,
"loss": 0.4976496696472168,
"step": 50,
"token_acc": 0.8652953087066456
},
{
"epoch": 0.4700854700854701,
"grad_norm": 1.6538729667663574,
"learning_rate": 8.970289998665083e-06,
"loss": 0.5108413696289062,
"step": 55,
"token_acc": 0.8643437786086937
},
{
"epoch": 0.5128205128205128,
"grad_norm": 1.9930307865142822,
"learning_rate": 8.749635923351108e-06,
"loss": 0.5116062164306641,
"step": 60,
"token_acc": 0.8584137276609205
},
{
"epoch": 0.5555555555555556,
"grad_norm": 1.778527021408081,
"learning_rate": 8.510875238511911e-06,
"loss": 0.4901996612548828,
"step": 65,
"token_acc": 0.8642093487261697
},
{
"epoch": 0.5982905982905983,
"grad_norm": 2.789698362350464,
"learning_rate": 8.255160895148263e-06,
"loss": 0.49276137351989746,
"step": 70,
"token_acc": 0.8632728710522414
},
{
"epoch": 0.6410256410256411,
"grad_norm": 2.4906489849090576,
"learning_rate": 7.983727711749194e-06,
"loss": 0.46578373908996584,
"step": 75,
"token_acc": 0.8713921087941244
},
{
"epoch": 0.6837606837606838,
"grad_norm": 2.1418581008911133,
"learning_rate": 7.697886411479422e-06,
"loss": 0.46045923233032227,
"step": 80,
"token_acc": 0.8719648648325216
},
{
"epoch": 0.7264957264957265,
"grad_norm": 1.8900772333145142,
"learning_rate": 7.399017292830848e-06,
"loss": 0.49722442626953123,
"step": 85,
"token_acc": 0.861450770602471
},
{
"epoch": 0.7692307692307693,
"grad_norm": 9.884895324707031,
"learning_rate": 7.088563564301874e-06,
"loss": 0.4920672416687012,
"step": 90,
"token_acc": 0.8587491425333293
},
{
"epoch": 0.811965811965812,
"grad_norm": 2.0830328464508057,
"learning_rate": 6.768024375290747e-06,
"loss": 0.5075239181518555,
"step": 95,
"token_acc": 0.8566905419232774
},
{
"epoch": 0.8547008547008547,
"grad_norm": 2.6918821334838867,
"learning_rate": 6.4389475768559675e-06,
"loss": 0.4198714256286621,
"step": 100,
"token_acc": 0.8777022792164509
},
{
"epoch": 0.8974358974358975,
"grad_norm": 2.4037363529205322,
"learning_rate": 6.1029222473013705e-06,
"loss": 0.44579553604125977,
"step": 105,
"token_acc": 0.8723411714183048
},
{
"epoch": 0.9401709401709402,
"grad_norm": 2.708740234375,
"learning_rate": 5.761571018679025e-06,
"loss": 0.46126999855041506,
"step": 110,
"token_acc": 0.8693372368665406
},
{
"epoch": 0.9829059829059829,
"grad_norm": 1.4541316032409668,
"learning_rate": 5.416542241264524e-06,
"loss": 0.41992721557617185,
"step": 115,
"token_acc": 0.8794615180232043
},
{
"epoch": 1.0256410256410255,
"grad_norm": 1.3620638847351074,
"learning_rate": 5.069502023841576e-06,
"loss": 0.37786569595336916,
"step": 120,
"token_acc": 0.890482741876745
},
{
"epoch": 1.0683760683760684,
"grad_norm": 1.4797122478485107,
"learning_rate": 4.722126188232586e-06,
"loss": 0.2962369441986084,
"step": 125,
"token_acc": 0.911854977939766
},
{
"epoch": 1.1111111111111112,
"grad_norm": 1.6938647031784058,
"learning_rate": 4.3760921769259585e-06,
"loss": 0.26640729904174804,
"step": 130,
"token_acc": 0.9200576903265685
},
{
"epoch": 1.1538461538461537,
"grad_norm": 1.6591416597366333,
"learning_rate": 4.033070952877362e-06,
"loss": 0.32262775897979734,
"step": 135,
"token_acc": 0.9023160952065692
},
{
"epoch": 1.1965811965811965,
"grad_norm": 1.874250054359436,
"learning_rate": 3.694718930600012e-06,
"loss": 0.2847463607788086,
"step": 140,
"token_acc": 0.913816095518685
},
{
"epoch": 1.2393162393162394,
"grad_norm": 3.5652880668640137,
"learning_rate": 3.3626699775078884e-06,
"loss": 0.3009438753128052,
"step": 145,
"token_acc": 0.9092695643455156
},
{
"epoch": 1.282051282051282,
"grad_norm": 2.1268937587738037,
"learning_rate": 3.0385275241365965e-06,
"loss": 0.27616229057312014,
"step": 150,
"token_acc": 0.9170621396948753
}
],
"logging_steps": 5,
"max_steps": 234,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.8955203096294195e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}