{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.7592870294793189, "eval_steps": 2500, "global_step": 20000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01898217573698297, "grad_norm": 2.8858866691589355, "learning_rate": 4.735843087630496e-05, "loss": 6.00573583984375, "step": 500 }, { "epoch": 0.03796435147396594, "grad_norm": 0.22312745451927185, "learning_rate": 9.481176842771275e-05, "loss": 1.7886568603515625, "step": 1000 }, { "epoch": 0.05694652721094892, "grad_norm": 0.3883834183216095, "learning_rate": 0.0001422651059791205, "loss": 1.4103663330078124, "step": 1500 }, { "epoch": 0.07592870294793189, "grad_norm": 0.28461548686027527, "learning_rate": 0.0001897184435305283, "loss": 1.2999722900390625, "step": 2000 }, { "epoch": 0.09491087868491487, "grad_norm": 0.3026827871799469, "learning_rate": 0.00023717178108193608, "loss": 1.27368310546875, "step": 2500 }, { "epoch": 0.09491087868491487, "eval_correction_accuracy": 0.9691768119898284, "eval_detection_f1": 0.5029481803464545, "eval_loss": 1.2979440689086914, "eval_runtime": 60.3464, "eval_samples_per_second": 371.886, "eval_steps_per_second": 2.916, "step": 2500 }, { "epoch": 0.09491087868491487, "eval_edit_f0_5": 0.8420576085111199, "eval_edit_f0_5_m0": 0.8057950832842375, "eval_edit_f0_5_m0.1": 0.8175929454030809, "eval_edit_f0_5_m0.2": 0.8316255884796455, "eval_edit_f0_5_m0.3": 0.8420576085111199, "step": 2500 }, { "epoch": 0.09491087868491487, "eval_real_f0_5": 0.42910447761194037, "eval_real_f0_5_m0": 0.3888400702987698, "eval_real_f0_5_m0.1": 0.4028041825095057, "eval_real_f0_5_m0.2": 0.4175050301810866, "eval_real_f0_5_m0.3": 0.42910447761194037, "step": 2500 }, { "epoch": 0.11389305442189784, "grad_norm": 0.27056726813316345, "learning_rate": 0.00028462511863334386, "loss": 1.2630726318359375, "step": 3000 }, { "epoch": 0.1328752301588808, "grad_norm": 0.2008272260427475, "learning_rate": 0.00029996551748314967, "loss": 1.2586767578125, "step": 3500 }, { "epoch": 0.15185740589586377, "grad_norm": 0.23608435690402985, "learning_rate": 0.00029978808195120705, "loss": 1.2485474853515626, "step": 4000 }, { "epoch": 0.17083958163284677, "grad_norm": 0.17198926210403442, "learning_rate": 0.00029945995039741313, "loss": 1.2438245849609375, "step": 4500 }, { "epoch": 0.18982175736982973, "grad_norm": 0.20551930367946625, "learning_rate": 0.00029898145294228977, "loss": 1.2398516845703125, "step": 5000 }, { "epoch": 0.18982175736982973, "eval_correction_accuracy": 0.9716923312269569, "eval_detection_f1": 0.5269904148108618, "eval_loss": 1.2654461860656738, "eval_runtime": 59.8792, "eval_samples_per_second": 374.788, "eval_steps_per_second": 2.939, "step": 5000 }, { "epoch": 0.18982175736982973, "eval_edit_f0_5": 0.872664843158936, "eval_edit_f0_5_m0": 0.8547840106743758, "eval_edit_f0_5_m0.1": 0.8604271144418775, "eval_edit_f0_5_m0.2": 0.8685822219678324, "eval_edit_f0_5_m0.3": 0.872664843158936, "step": 5000 }, { "epoch": 0.18982175736982973, "eval_real_f0_5": 0.46151439299123903, "eval_real_f0_5_m0": 0.4191919191919192, "eval_real_f0_5_m0.1": 0.4297297297297297, "eval_real_f0_5_m0.2": 0.445906432748538, "eval_real_f0_5_m0.3": 0.46151439299123903, "step": 5000 }, { "epoch": 0.2088039331068127, "grad_norm": 0.20124033093452454, "learning_rate": 0.00029835307098370265, "loss": 1.2357362060546875, "step": 5500 }, { "epoch": 0.2277861088437957, "grad_norm": 0.23115237057209015, "learning_rate": 0.0002975754367125453, "loss": 1.2375308837890624, "step": 6000 }, { "epoch": 0.24676828458077865, "grad_norm": 0.1954943835735321, "learning_rate": 0.00029664933247671615, "loss": 1.2349964599609375, "step": 6500 }, { "epoch": 0.2657504603177616, "grad_norm": 0.17400752007961273, "learning_rate": 0.0002955756899940283, "loss": 1.2303714599609374, "step": 7000 }, { "epoch": 0.2847326360547446, "grad_norm": 0.17888489365577698, "learning_rate": 0.00029435558941484435, "loss": 1.2309805908203124, "step": 7500 }, { "epoch": 0.2847326360547446, "eval_correction_accuracy": 0.9723985228660039, "eval_detection_f1": 0.5397412768051171, "eval_loss": 1.2546594142913818, "eval_runtime": 60.3599, "eval_samples_per_second": 371.803, "eval_steps_per_second": 2.916, "step": 7500 }, { "epoch": 0.2847326360547446, "eval_edit_f0_5": 0.8861485517636936, "eval_edit_f0_5_m0": 0.8749653451621846, "eval_edit_f0_5_m0.1": 0.8788065728226123, "eval_edit_f0_5_m0.2": 0.8814529381764608, "eval_edit_f0_5_m0.3": 0.8861485517636936, "step": 7500 }, { "epoch": 0.2847326360547446, "eval_real_f0_5": 0.47371638141809297, "eval_real_f0_5_m0": 0.4501055966209081, "eval_real_f0_5_m0.1": 0.4613259668508288, "eval_real_f0_5_m0.2": 0.47164351851851855, "eval_real_f0_5_m0.3": 0.47371638141809297, "step": 7500 }, { "epoch": 0.30371481179172755, "grad_norm": 0.1810256987810135, "learning_rate": 0.0002929902582353787, "loss": 1.227394775390625, "step": 8000 }, { "epoch": 0.32269698752871057, "grad_norm": 0.18248461186885834, "learning_rate": 0.00029148107006276056, "loss": 1.22420361328125, "step": 8500 }, { "epoch": 0.34167916326569353, "grad_norm": 0.1456211358308792, "learning_rate": 0.0002898295432331011, "loss": 1.22528125, "step": 9000 }, { "epoch": 0.3606613390026765, "grad_norm": 0.1682305634021759, "learning_rate": 0.0002880373392839537, "loss": 1.2209486083984376, "step": 9500 }, { "epoch": 0.37964351473965946, "grad_norm": 0.1455032080411911, "learning_rate": 0.00028610626128270495, "loss": 1.222905029296875, "step": 10000 }, { "epoch": 0.37964351473965946, "eval_correction_accuracy": 0.9729365736386112, "eval_detection_f1": 0.5878967328292231, "eval_loss": 1.2507761716842651, "eval_runtime": 60.7194, "eval_samples_per_second": 369.602, "eval_steps_per_second": 2.899, "step": 10000 }, { "epoch": 0.37964351473965946, "eval_edit_f0_5": 0.8773855767606823, "eval_edit_f0_5_m0": 0.8642143753752115, "eval_edit_f0_5_m0.1": 0.871961638097338, "eval_edit_f0_5_m0.2": 0.8739938939772413, "eval_edit_f0_5_m0.3": 0.8773855767606823, "step": 10000 }, { "epoch": 0.37964351473965946, "eval_real_f0_5": 0.43992027334851935, "eval_real_f0_5_m0": 0.4214697406340058, "eval_real_f0_5_m0.1": 0.42792792792792794, "eval_real_f0_5_m0.2": 0.42728237791932056, "eval_real_f0_5_m0.3": 0.43992027334851935, "step": 10000 }, { "epoch": 0.3986256904766424, "grad_norm": 0.20864084362983704, "learning_rate": 0.0002840382520125783, "loss": 1.22280712890625, "step": 10500 }, { "epoch": 0.4176078662136254, "grad_norm": 0.19003528356552124, "learning_rate": 0.0002818353920180744, "loss": 1.221659423828125, "step": 11000 }, { "epoch": 0.43659004195060835, "grad_norm": 0.1750059872865677, "learning_rate": 0.0002794998975118153, "loss": 1.2191646728515626, "step": 11500 }, { "epoch": 0.4555722176875914, "grad_norm": 0.13223567605018616, "learning_rate": 0.00027703411814489855, "loss": 1.216736328125, "step": 12000 }, { "epoch": 0.47455439342457434, "grad_norm": 0.10733171552419662, "learning_rate": 0.00027444053464300346, "loss": 1.2142664794921876, "step": 12500 }, { "epoch": 0.47455439342457434, "eval_correction_accuracy": 0.9733371445263059, "eval_detection_f1": 0.5704304192239259, "eval_loss": 1.2477121353149414, "eval_runtime": 60.6105, "eval_samples_per_second": 370.266, "eval_steps_per_second": 2.904, "step": 12500 }, { "epoch": 0.47455439342457434, "eval_edit_f0_5": 0.8926609218668673, "eval_edit_f0_5_m0": 0.8845489496851842, "eval_edit_f0_5_m0.1": 0.8883563574851988, "eval_edit_f0_5_m0.2": 0.89086859688196, "eval_edit_f0_5_m0.3": 0.8926609218668673, "step": 12500 }, { "epoch": 0.47455439342457434, "eval_real_f0_5": 0.4787581699346405, "eval_real_f0_5_m0": 0.43419633225458465, "eval_real_f0_5_m0.1": 0.44776119402985065, "eval_real_f0_5_m0.2": 0.46760391198044005, "eval_real_f0_5_m0.3": 0.4787581699346405, "step": 12500 }, { "epoch": 0.4935365691615573, "grad_norm": 0.1579447090625763, "learning_rate": 0.0002717217563106287, "loss": 1.21451904296875, "step": 13000 }, { "epoch": 0.5125187448985403, "grad_norm": 0.13867036998271942, "learning_rate": 0.00026888051840597135, "loss": 1.2117508544921876, "step": 13500 }, { "epoch": 0.5315009206355232, "grad_norm": 0.11431417614221573, "learning_rate": 0.00026591967938908897, "loss": 1.2146973876953124, "step": 14000 }, { "epoch": 0.5504830963725063, "grad_norm": 0.14605163037776947, "learning_rate": 0.00026284221804611323, "loss": 1.211010498046875, "step": 14500 }, { "epoch": 0.5694652721094892, "grad_norm": 0.13300460577011108, "learning_rate": 0.0002596512304924075, "loss": 1.2157716064453126, "step": 15000 }, { "epoch": 0.5694652721094892, "eval_correction_accuracy": 0.9736186980555992, "eval_detection_f1": 0.6009406304526895, "eval_loss": 1.2431864738464355, "eval_runtime": 60.2876, "eval_samples_per_second": 372.249, "eval_steps_per_second": 2.919, "step": 15000 }, { "epoch": 0.5694652721094892, "eval_edit_f0_5": 0.8888329698596432, "eval_edit_f0_5_m0": 0.8778231292517006, "eval_edit_f0_5_m0.1": 0.8819654131210541, "eval_edit_f0_5_m0.2": 0.8855925167432335, "eval_edit_f0_5_m0.3": 0.8888329698596432, "step": 15000 }, { "epoch": 0.5694652721094892, "eval_real_f0_5": 0.4537767756482525, "eval_real_f0_5_m0": 0.4154693486590038, "eval_real_f0_5_m0.1": 0.42251755265797397, "eval_real_f0_5_m0.2": 0.4458512931034483, "eval_real_f0_5_m0.3": 0.4537767756482525, "step": 15000 }, { "epoch": 0.5884474478464722, "grad_norm": 0.16023032367229462, "learning_rate": 0.0002563499270576846, "loss": 1.21418017578125, "step": 15500 }, { "epoch": 0.6074296235834551, "grad_norm": 0.14038224518299103, "learning_rate": 0.0002529416290562178, "loss": 1.2102242431640624, "step": 16000 }, { "epoch": 0.6264117993204381, "grad_norm": 0.19150033593177795, "learning_rate": 0.00024942976544539404, "loss": 1.21311474609375, "step": 16500 }, { "epoch": 0.6453939750574211, "grad_norm": 0.13594546914100647, "learning_rate": 0.0002458178693759725, "loss": 1.2101019287109376, "step": 17000 }, { "epoch": 0.664376150794404, "grad_norm": 0.0971856564283371, "learning_rate": 0.00024210957463751702, "loss": 1.2085975341796875, "step": 17500 }, { "epoch": 0.664376150794404, "eval_correction_accuracy": 0.9739441000853563, "eval_detection_f1": 0.6041727242827385, "eval_loss": 1.2378469705581665, "eval_runtime": 60.7237, "eval_samples_per_second": 369.575, "eval_steps_per_second": 2.898, "step": 17500 }, { "epoch": 0.664376150794404, "eval_edit_f0_5": 0.8950703830407717, "eval_edit_f0_5_m0": 0.8823850308221047, "eval_edit_f0_5_m0.1": 0.8891276795062545, "eval_edit_f0_5_m0.2": 0.891679139641887, "eval_edit_f0_5_m0.3": 0.8950703830407717, "step": 17500 }, { "epoch": 0.664376150794404, "eval_real_f0_5": 0.45221843003412976, "eval_real_f0_5_m0": 0.4207080504364695, "eval_real_f0_5_m0.1": 0.4268916155419223, "eval_real_f0_5_m0.2": 0.43951612903225806, "eval_real_f0_5_m0.3": 0.45221843003412976, "step": 17500 }, { "epoch": 0.6833583265313871, "grad_norm": 0.23436909914016724, "learning_rate": 0.00023830861200258084, "loss": 1.2103984375, "step": 18000 }, { "epoch": 0.70234050226837, "grad_norm": 0.10302391648292542, "learning_rate": 0.00023441880547331984, "loss": 1.209429443359375, "step": 18500 }, { "epoch": 0.721322678005353, "grad_norm": 0.16614890098571777, "learning_rate": 0.00023044406843431085, "loss": 1.210209228515625, "step": 19000 }, { "epoch": 0.7403048537423359, "grad_norm": 0.12630845606327057, "learning_rate": 0.00022638839971544675, "loss": 1.2063096923828125, "step": 19500 }, { "epoch": 0.7592870294793189, "grad_norm": 0.16276787221431732, "learning_rate": 0.00022225587956886718, "loss": 1.20748486328125, "step": 20000 }, { "epoch": 0.7592870294793189, "eval_correction_accuracy": 0.974335110021822, "eval_detection_f1": 0.6143125770798066, "eval_loss": 1.234763264656067, "eval_runtime": 60.5996, "eval_samples_per_second": 370.332, "eval_steps_per_second": 2.904, "step": 20000 }, { "epoch": 0.7592870294793189, "eval_edit_f0_5": 0.9024403864410565, "eval_edit_f0_5_m0": 0.8842469830618539, "eval_edit_f0_5_m0.1": 0.8886223627541842, "eval_edit_f0_5_m0.2": 0.8945219837810999, "eval_edit_f0_5_m0.3": 0.9024403864410565, "step": 20000 }, { "epoch": 0.7592870294793189, "eval_real_f0_5": 0.4630195599022005, "eval_real_f0_5_m0": 0.44520547945205474, "eval_real_f0_5_m0.1": 0.4467213114754099, "eval_real_f0_5_m0.2": 0.4604503464203233, "eval_real_f0_5_m0.3": 0.4630195599022005, "step": 20000 } ], "logging_steps": 500, "max_steps": 52682, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 2500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.6519904481356275e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }