sanigec-phase1 / checkpoint-20000 /trainer_state.json
oza75's picture
Training in progress, step 20000, checkpoint
6f62613 verified
Raw
History Blame Contribute Delete
15.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.7592870294793189,
"eval_steps": 2500,
"global_step": 20000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01898217573698297,
"grad_norm": 2.8858866691589355,
"learning_rate": 4.735843087630496e-05,
"loss": 6.00573583984375,
"step": 500
},
{
"epoch": 0.03796435147396594,
"grad_norm": 0.22312745451927185,
"learning_rate": 9.481176842771275e-05,
"loss": 1.7886568603515625,
"step": 1000
},
{
"epoch": 0.05694652721094892,
"grad_norm": 0.3883834183216095,
"learning_rate": 0.0001422651059791205,
"loss": 1.4103663330078124,
"step": 1500
},
{
"epoch": 0.07592870294793189,
"grad_norm": 0.28461548686027527,
"learning_rate": 0.0001897184435305283,
"loss": 1.2999722900390625,
"step": 2000
},
{
"epoch": 0.09491087868491487,
"grad_norm": 0.3026827871799469,
"learning_rate": 0.00023717178108193608,
"loss": 1.27368310546875,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_correction_accuracy": 0.9691768119898284,
"eval_detection_f1": 0.5029481803464545,
"eval_loss": 1.2979440689086914,
"eval_runtime": 60.3464,
"eval_samples_per_second": 371.886,
"eval_steps_per_second": 2.916,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_edit_f0_5": 0.8420576085111199,
"eval_edit_f0_5_m0": 0.8057950832842375,
"eval_edit_f0_5_m0.1": 0.8175929454030809,
"eval_edit_f0_5_m0.2": 0.8316255884796455,
"eval_edit_f0_5_m0.3": 0.8420576085111199,
"step": 2500
},
{
"epoch": 0.09491087868491487,
"eval_real_f0_5": 0.42910447761194037,
"eval_real_f0_5_m0": 0.3888400702987698,
"eval_real_f0_5_m0.1": 0.4028041825095057,
"eval_real_f0_5_m0.2": 0.4175050301810866,
"eval_real_f0_5_m0.3": 0.42910447761194037,
"step": 2500
},
{
"epoch": 0.11389305442189784,
"grad_norm": 0.27056726813316345,
"learning_rate": 0.00028462511863334386,
"loss": 1.2630726318359375,
"step": 3000
},
{
"epoch": 0.1328752301588808,
"grad_norm": 0.2008272260427475,
"learning_rate": 0.00029996551748314967,
"loss": 1.2586767578125,
"step": 3500
},
{
"epoch": 0.15185740589586377,
"grad_norm": 0.23608435690402985,
"learning_rate": 0.00029978808195120705,
"loss": 1.2485474853515626,
"step": 4000
},
{
"epoch": 0.17083958163284677,
"grad_norm": 0.17198926210403442,
"learning_rate": 0.00029945995039741313,
"loss": 1.2438245849609375,
"step": 4500
},
{
"epoch": 0.18982175736982973,
"grad_norm": 0.20551930367946625,
"learning_rate": 0.00029898145294228977,
"loss": 1.2398516845703125,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_correction_accuracy": 0.9716923312269569,
"eval_detection_f1": 0.5269904148108618,
"eval_loss": 1.2654461860656738,
"eval_runtime": 59.8792,
"eval_samples_per_second": 374.788,
"eval_steps_per_second": 2.939,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_edit_f0_5": 0.872664843158936,
"eval_edit_f0_5_m0": 0.8547840106743758,
"eval_edit_f0_5_m0.1": 0.8604271144418775,
"eval_edit_f0_5_m0.2": 0.8685822219678324,
"eval_edit_f0_5_m0.3": 0.872664843158936,
"step": 5000
},
{
"epoch": 0.18982175736982973,
"eval_real_f0_5": 0.46151439299123903,
"eval_real_f0_5_m0": 0.4191919191919192,
"eval_real_f0_5_m0.1": 0.4297297297297297,
"eval_real_f0_5_m0.2": 0.445906432748538,
"eval_real_f0_5_m0.3": 0.46151439299123903,
"step": 5000
},
{
"epoch": 0.2088039331068127,
"grad_norm": 0.20124033093452454,
"learning_rate": 0.00029835307098370265,
"loss": 1.2357362060546875,
"step": 5500
},
{
"epoch": 0.2277861088437957,
"grad_norm": 0.23115237057209015,
"learning_rate": 0.0002975754367125453,
"loss": 1.2375308837890624,
"step": 6000
},
{
"epoch": 0.24676828458077865,
"grad_norm": 0.1954943835735321,
"learning_rate": 0.00029664933247671615,
"loss": 1.2349964599609375,
"step": 6500
},
{
"epoch": 0.2657504603177616,
"grad_norm": 0.17400752007961273,
"learning_rate": 0.0002955756899940283,
"loss": 1.2303714599609374,
"step": 7000
},
{
"epoch": 0.2847326360547446,
"grad_norm": 0.17888489365577698,
"learning_rate": 0.00029435558941484435,
"loss": 1.2309805908203124,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_correction_accuracy": 0.9723985228660039,
"eval_detection_f1": 0.5397412768051171,
"eval_loss": 1.2546594142913818,
"eval_runtime": 60.3599,
"eval_samples_per_second": 371.803,
"eval_steps_per_second": 2.916,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_edit_f0_5": 0.8861485517636936,
"eval_edit_f0_5_m0": 0.8749653451621846,
"eval_edit_f0_5_m0.1": 0.8788065728226123,
"eval_edit_f0_5_m0.2": 0.8814529381764608,
"eval_edit_f0_5_m0.3": 0.8861485517636936,
"step": 7500
},
{
"epoch": 0.2847326360547446,
"eval_real_f0_5": 0.47371638141809297,
"eval_real_f0_5_m0": 0.4501055966209081,
"eval_real_f0_5_m0.1": 0.4613259668508288,
"eval_real_f0_5_m0.2": 0.47164351851851855,
"eval_real_f0_5_m0.3": 0.47371638141809297,
"step": 7500
},
{
"epoch": 0.30371481179172755,
"grad_norm": 0.1810256987810135,
"learning_rate": 0.0002929902582353787,
"loss": 1.227394775390625,
"step": 8000
},
{
"epoch": 0.32269698752871057,
"grad_norm": 0.18248461186885834,
"learning_rate": 0.00029148107006276056,
"loss": 1.22420361328125,
"step": 8500
},
{
"epoch": 0.34167916326569353,
"grad_norm": 0.1456211358308792,
"learning_rate": 0.0002898295432331011,
"loss": 1.22528125,
"step": 9000
},
{
"epoch": 0.3606613390026765,
"grad_norm": 0.1682305634021759,
"learning_rate": 0.0002880373392839537,
"loss": 1.2209486083984376,
"step": 9500
},
{
"epoch": 0.37964351473965946,
"grad_norm": 0.1455032080411911,
"learning_rate": 0.00028610626128270495,
"loss": 1.222905029296875,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_correction_accuracy": 0.9729365736386112,
"eval_detection_f1": 0.5878967328292231,
"eval_loss": 1.2507761716842651,
"eval_runtime": 60.7194,
"eval_samples_per_second": 369.602,
"eval_steps_per_second": 2.899,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_edit_f0_5": 0.8773855767606823,
"eval_edit_f0_5_m0": 0.8642143753752115,
"eval_edit_f0_5_m0.1": 0.871961638097338,
"eval_edit_f0_5_m0.2": 0.8739938939772413,
"eval_edit_f0_5_m0.3": 0.8773855767606823,
"step": 10000
},
{
"epoch": 0.37964351473965946,
"eval_real_f0_5": 0.43992027334851935,
"eval_real_f0_5_m0": 0.4214697406340058,
"eval_real_f0_5_m0.1": 0.42792792792792794,
"eval_real_f0_5_m0.2": 0.42728237791932056,
"eval_real_f0_5_m0.3": 0.43992027334851935,
"step": 10000
},
{
"epoch": 0.3986256904766424,
"grad_norm": 0.20864084362983704,
"learning_rate": 0.0002840382520125783,
"loss": 1.22280712890625,
"step": 10500
},
{
"epoch": 0.4176078662136254,
"grad_norm": 0.19003528356552124,
"learning_rate": 0.0002818353920180744,
"loss": 1.221659423828125,
"step": 11000
},
{
"epoch": 0.43659004195060835,
"grad_norm": 0.1750059872865677,
"learning_rate": 0.0002794998975118153,
"loss": 1.2191646728515626,
"step": 11500
},
{
"epoch": 0.4555722176875914,
"grad_norm": 0.13223567605018616,
"learning_rate": 0.00027703411814489855,
"loss": 1.216736328125,
"step": 12000
},
{
"epoch": 0.47455439342457434,
"grad_norm": 0.10733171552419662,
"learning_rate": 0.00027444053464300346,
"loss": 1.2142664794921876,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_correction_accuracy": 0.9733371445263059,
"eval_detection_f1": 0.5704304192239259,
"eval_loss": 1.2477121353149414,
"eval_runtime": 60.6105,
"eval_samples_per_second": 370.266,
"eval_steps_per_second": 2.904,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_edit_f0_5": 0.8926609218668673,
"eval_edit_f0_5_m0": 0.8845489496851842,
"eval_edit_f0_5_m0.1": 0.8883563574851988,
"eval_edit_f0_5_m0.2": 0.89086859688196,
"eval_edit_f0_5_m0.3": 0.8926609218668673,
"step": 12500
},
{
"epoch": 0.47455439342457434,
"eval_real_f0_5": 0.4787581699346405,
"eval_real_f0_5_m0": 0.43419633225458465,
"eval_real_f0_5_m0.1": 0.44776119402985065,
"eval_real_f0_5_m0.2": 0.46760391198044005,
"eval_real_f0_5_m0.3": 0.4787581699346405,
"step": 12500
},
{
"epoch": 0.4935365691615573,
"grad_norm": 0.1579447090625763,
"learning_rate": 0.0002717217563106287,
"loss": 1.21451904296875,
"step": 13000
},
{
"epoch": 0.5125187448985403,
"grad_norm": 0.13867036998271942,
"learning_rate": 0.00026888051840597135,
"loss": 1.2117508544921876,
"step": 13500
},
{
"epoch": 0.5315009206355232,
"grad_norm": 0.11431417614221573,
"learning_rate": 0.00026591967938908897,
"loss": 1.2146973876953124,
"step": 14000
},
{
"epoch": 0.5504830963725063,
"grad_norm": 0.14605163037776947,
"learning_rate": 0.00026284221804611323,
"loss": 1.211010498046875,
"step": 14500
},
{
"epoch": 0.5694652721094892,
"grad_norm": 0.13300460577011108,
"learning_rate": 0.0002596512304924075,
"loss": 1.2157716064453126,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_correction_accuracy": 0.9736186980555992,
"eval_detection_f1": 0.6009406304526895,
"eval_loss": 1.2431864738464355,
"eval_runtime": 60.2876,
"eval_samples_per_second": 372.249,
"eval_steps_per_second": 2.919,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_edit_f0_5": 0.8888329698596432,
"eval_edit_f0_5_m0": 0.8778231292517006,
"eval_edit_f0_5_m0.1": 0.8819654131210541,
"eval_edit_f0_5_m0.2": 0.8855925167432335,
"eval_edit_f0_5_m0.3": 0.8888329698596432,
"step": 15000
},
{
"epoch": 0.5694652721094892,
"eval_real_f0_5": 0.4537767756482525,
"eval_real_f0_5_m0": 0.4154693486590038,
"eval_real_f0_5_m0.1": 0.42251755265797397,
"eval_real_f0_5_m0.2": 0.4458512931034483,
"eval_real_f0_5_m0.3": 0.4537767756482525,
"step": 15000
},
{
"epoch": 0.5884474478464722,
"grad_norm": 0.16023032367229462,
"learning_rate": 0.0002563499270576846,
"loss": 1.21418017578125,
"step": 15500
},
{
"epoch": 0.6074296235834551,
"grad_norm": 0.14038224518299103,
"learning_rate": 0.0002529416290562178,
"loss": 1.2102242431640624,
"step": 16000
},
{
"epoch": 0.6264117993204381,
"grad_norm": 0.19150033593177795,
"learning_rate": 0.00024942976544539404,
"loss": 1.21311474609375,
"step": 16500
},
{
"epoch": 0.6453939750574211,
"grad_norm": 0.13594546914100647,
"learning_rate": 0.0002458178693759725,
"loss": 1.2101019287109376,
"step": 17000
},
{
"epoch": 0.664376150794404,
"grad_norm": 0.0971856564283371,
"learning_rate": 0.00024210957463751702,
"loss": 1.2085975341796875,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_correction_accuracy": 0.9739441000853563,
"eval_detection_f1": 0.6041727242827385,
"eval_loss": 1.2378469705581665,
"eval_runtime": 60.7237,
"eval_samples_per_second": 369.575,
"eval_steps_per_second": 2.898,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_edit_f0_5": 0.8950703830407717,
"eval_edit_f0_5_m0": 0.8823850308221047,
"eval_edit_f0_5_m0.1": 0.8891276795062545,
"eval_edit_f0_5_m0.2": 0.891679139641887,
"eval_edit_f0_5_m0.3": 0.8950703830407717,
"step": 17500
},
{
"epoch": 0.664376150794404,
"eval_real_f0_5": 0.45221843003412976,
"eval_real_f0_5_m0": 0.4207080504364695,
"eval_real_f0_5_m0.1": 0.4268916155419223,
"eval_real_f0_5_m0.2": 0.43951612903225806,
"eval_real_f0_5_m0.3": 0.45221843003412976,
"step": 17500
},
{
"epoch": 0.6833583265313871,
"grad_norm": 0.23436909914016724,
"learning_rate": 0.00023830861200258084,
"loss": 1.2103984375,
"step": 18000
},
{
"epoch": 0.70234050226837,
"grad_norm": 0.10302391648292542,
"learning_rate": 0.00023441880547331984,
"loss": 1.209429443359375,
"step": 18500
},
{
"epoch": 0.721322678005353,
"grad_norm": 0.16614890098571777,
"learning_rate": 0.00023044406843431085,
"loss": 1.210209228515625,
"step": 19000
},
{
"epoch": 0.7403048537423359,
"grad_norm": 0.12630845606327057,
"learning_rate": 0.00022638839971544675,
"loss": 1.2063096923828125,
"step": 19500
},
{
"epoch": 0.7592870294793189,
"grad_norm": 0.16276787221431732,
"learning_rate": 0.00022225587956886718,
"loss": 1.20748486328125,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_correction_accuracy": 0.974335110021822,
"eval_detection_f1": 0.6143125770798066,
"eval_loss": 1.234763264656067,
"eval_runtime": 60.5996,
"eval_samples_per_second": 370.332,
"eval_steps_per_second": 2.904,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_edit_f0_5": 0.9024403864410565,
"eval_edit_f0_5_m0": 0.8842469830618539,
"eval_edit_f0_5_m0.1": 0.8886223627541842,
"eval_edit_f0_5_m0.2": 0.8945219837810999,
"eval_edit_f0_5_m0.3": 0.9024403864410565,
"step": 20000
},
{
"epoch": 0.7592870294793189,
"eval_real_f0_5": 0.4630195599022005,
"eval_real_f0_5_m0": 0.44520547945205474,
"eval_real_f0_5_m0.1": 0.4467213114754099,
"eval_real_f0_5_m0.2": 0.4604503464203233,
"eval_real_f0_5_m0.3": 0.4630195599022005,
"step": 20000
}
],
"logging_steps": 500,
"max_steps": 52682,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 2500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.6519904481356275e+17,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}
Free AI Image Generator No sign-up. Instant results. Open Now