{ "best_global_step": 1006, "best_metric": 0.24770455062389374, "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/text2sql/checkpoint-1006", "epoch": 2.0, "eval_steps": 500, "global_step": 1006, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.1253886640071868, "epoch": 0.01990049751243781, "grad_norm": 2.338360548019409, "learning_rate": 7.142857142857143e-06, "loss": 1.4502812385559083, "mean_token_accuracy": 0.6671988122165203, "num_tokens": 68027.0, "step": 10 }, { "entropy": 1.0893175967037678, "epoch": 0.03980099502487562, "grad_norm": 1.6519114971160889, "learning_rate": 1.5079365079365079e-05, "loss": 1.1673696517944336, "mean_token_accuracy": 0.698525931686163, "num_tokens": 135033.0, "step": 20 }, { "entropy": 1.0583932913839817, "epoch": 0.05970149253731343, "grad_norm": 1.202163815498352, "learning_rate": 2.3015873015873015e-05, "loss": 1.0070637702941894, "mean_token_accuracy": 0.7307960025966167, "num_tokens": 201643.0, "step": 30 }, { "entropy": 0.8722786333411932, "epoch": 0.07960199004975124, "grad_norm": 1.3554679155349731, "learning_rate": 3.095238095238095e-05, "loss": 0.749023151397705, "mean_token_accuracy": 0.8074305906891823, "num_tokens": 267572.0, "step": 40 }, { "entropy": 0.6009022377431392, "epoch": 0.09950248756218906, "grad_norm": 1.4063202142715454, "learning_rate": 3.888888888888889e-05, "loss": 0.5123498916625977, "mean_token_accuracy": 0.8385950662195683, "num_tokens": 333673.0, "step": 50 }, { "entropy": 0.4164533382281661, "epoch": 0.11940298507462686, "grad_norm": 1.8205658197402954, "learning_rate": 4.682539682539683e-05, "loss": 0.4625075340270996, "mean_token_accuracy": 0.8584991104900837, "num_tokens": 399397.0, "step": 60 }, { "entropy": 0.4577839931473136, "epoch": 0.13930348258706468, "grad_norm": 1.393362283706665, "learning_rate": 5.4761904761904766e-05, "loss": 0.4174641609191895, "mean_token_accuracy": 0.8803921975195408, "num_tokens": 465864.0, "step": 70 }, { "entropy": 0.41640141475945713, "epoch": 0.15920398009950248, "grad_norm": 2.2472920417785645, "learning_rate": 6.26984126984127e-05, "loss": 0.417645263671875, "mean_token_accuracy": 0.8779219165444374, "num_tokens": 534817.0, "step": 80 }, { "entropy": 0.3839787464588881, "epoch": 0.1791044776119403, "grad_norm": 1.300377368927002, "learning_rate": 7.063492063492065e-05, "loss": 0.38586442470550536, "mean_token_accuracy": 0.8903462648391723, "num_tokens": 600614.0, "step": 90 }, { "entropy": 0.3429916022345424, "epoch": 0.19900497512437812, "grad_norm": 1.5014147758483887, "learning_rate": 7.857142857142858e-05, "loss": 0.33204805850982666, "mean_token_accuracy": 0.9070690087974072, "num_tokens": 665888.0, "step": 100 }, { "entropy": 0.36409866753965614, "epoch": 0.21890547263681592, "grad_norm": 1.417038083076477, "learning_rate": 8.650793650793651e-05, "loss": 0.3376448631286621, "mean_token_accuracy": 0.8962906174361706, "num_tokens": 732400.0, "step": 110 }, { "entropy": 0.263674839399755, "epoch": 0.23880597014925373, "grad_norm": 1.2735201120376587, "learning_rate": 9.444444444444444e-05, "loss": 0.270894718170166, "mean_token_accuracy": 0.9201160937547683, "num_tokens": 799887.0, "step": 120 }, { "entropy": 0.30584911033511164, "epoch": 0.25870646766169153, "grad_norm": 1.2719416618347168, "learning_rate": 0.00010238095238095237, "loss": 0.27406151294708253, "mean_token_accuracy": 0.9204320795834064, "num_tokens": 866147.0, "step": 130 }, { "entropy": 0.28959042597562074, "epoch": 0.27860696517412936, "grad_norm": 2.2021138668060303, "learning_rate": 0.00011031746031746033, "loss": 0.32373068332672117, "mean_token_accuracy": 0.8983257927000523, "num_tokens": 933129.0, "step": 140 }, { "entropy": 0.29785235710442065, "epoch": 0.29850746268656714, "grad_norm": 0.9740720987319946, "learning_rate": 0.00011825396825396826, "loss": 0.2523745775222778, "mean_token_accuracy": 0.9215191625058651, "num_tokens": 997739.0, "step": 150 }, { "entropy": 0.28159743677824733, "epoch": 0.31840796019900497, "grad_norm": 1.025788426399231, "learning_rate": 0.0001261904761904762, "loss": 0.27993102073669435, "mean_token_accuracy": 0.9143906190991402, "num_tokens": 1064807.0, "step": 160 }, { "entropy": 0.282751829456538, "epoch": 0.3383084577114428, "grad_norm": 1.149941086769104, "learning_rate": 0.00013412698412698412, "loss": 0.289961838722229, "mean_token_accuracy": 0.9160969875752926, "num_tokens": 1130310.0, "step": 170 }, { "entropy": 0.30801400616765023, "epoch": 0.3582089552238806, "grad_norm": 1.1288280487060547, "learning_rate": 0.00014206349206349208, "loss": 0.2773977518081665, "mean_token_accuracy": 0.9185432456433773, "num_tokens": 1197192.0, "step": 180 }, { "entropy": 0.24713189490139484, "epoch": 0.3781094527363184, "grad_norm": 0.9636886119842529, "learning_rate": 0.00015000000000000001, "loss": 0.26672122478485105, "mean_token_accuracy": 0.9264318533241749, "num_tokens": 1263466.0, "step": 190 }, { "entropy": 0.287679692171514, "epoch": 0.39800995024875624, "grad_norm": 1.137581467628479, "learning_rate": 0.00015793650793650795, "loss": 0.2587902069091797, "mean_token_accuracy": 0.9211024351418018, "num_tokens": 1330385.0, "step": 200 }, { "entropy": 0.2620579367503524, "epoch": 0.417910447761194, "grad_norm": 1.3906782865524292, "learning_rate": 0.0001658730158730159, "loss": 0.25291283130645753, "mean_token_accuracy": 0.922594179213047, "num_tokens": 1399272.0, "step": 210 }, { "entropy": 0.24558336716145276, "epoch": 0.43781094527363185, "grad_norm": 1.1515614986419678, "learning_rate": 0.00017380952380952383, "loss": 0.23645257949829102, "mean_token_accuracy": 0.9315326489508152, "num_tokens": 1466197.0, "step": 220 }, { "entropy": 0.23100281171500683, "epoch": 0.4577114427860697, "grad_norm": 1.0060856342315674, "learning_rate": 0.00018174603174603177, "loss": 0.21004528999328614, "mean_token_accuracy": 0.9294509522616863, "num_tokens": 1533135.0, "step": 230 }, { "entropy": 0.2551280764862895, "epoch": 0.47761194029850745, "grad_norm": 0.8229029178619385, "learning_rate": 0.0001896825396825397, "loss": 0.23107924461364746, "mean_token_accuracy": 0.9292825579643249, "num_tokens": 1600905.0, "step": 240 }, { "entropy": 0.2424938028678298, "epoch": 0.4975124378109453, "grad_norm": 1.199968695640564, "learning_rate": 0.00019761904761904763, "loss": 0.25817849636077883, "mean_token_accuracy": 0.9277816534042358, "num_tokens": 1666956.0, "step": 250 }, { "entropy": 0.27997240191325545, "epoch": 0.5174129353233831, "grad_norm": 0.6602728962898254, "learning_rate": 0.0001999989408126818, "loss": 0.25299272537231443, "mean_token_accuracy": 0.926287354528904, "num_tokens": 1734782.0, "step": 260 }, { "entropy": 0.20782412360422314, "epoch": 0.5373134328358209, "grad_norm": 0.7651694416999817, "learning_rate": 0.0001999937530104439, "loss": 0.20403761863708497, "mean_token_accuracy": 0.9310354895889759, "num_tokens": 1800055.0, "step": 270 }, { "entropy": 0.2172251005657017, "epoch": 0.5572139303482587, "grad_norm": 1.2643989324569702, "learning_rate": 0.00019998424227267588, "loss": 0.20663719177246093, "mean_token_accuracy": 0.9364220850169659, "num_tokens": 1866900.0, "step": 280 }, { "entropy": 0.19974687648937106, "epoch": 0.5771144278606966, "grad_norm": 0.9468103051185608, "learning_rate": 0.00019997040901054646, "loss": 0.20071234703063964, "mean_token_accuracy": 0.9412682101130485, "num_tokens": 1934548.0, "step": 290 }, { "entropy": 0.1886322578880936, "epoch": 0.5970149253731343, "grad_norm": 0.8480322360992432, "learning_rate": 0.000199952253822096, "loss": 0.18384914398193358, "mean_token_accuracy": 0.948433005809784, "num_tokens": 2001379.0, "step": 300 }, { "entropy": 0.21811659364029765, "epoch": 0.6169154228855721, "grad_norm": 0.8029792308807373, "learning_rate": 0.00019992977749221064, "loss": 0.20460138320922852, "mean_token_accuracy": 0.9401800245046615, "num_tokens": 2070001.0, "step": 310 }, { "entropy": 0.18392337979748846, "epoch": 0.6368159203980099, "grad_norm": 0.8735001087188721, "learning_rate": 0.0001999029809925883, "loss": 0.17823137044906617, "mean_token_accuracy": 0.9488276831805706, "num_tokens": 2135350.0, "step": 320 }, { "entropy": 0.18473064368590714, "epoch": 0.6567164179104478, "grad_norm": 0.7449737787246704, "learning_rate": 0.00019987186548169682, "loss": 0.16862742900848388, "mean_token_accuracy": 0.9462769009172917, "num_tokens": 2203472.0, "step": 330 }, { "entropy": 0.16661408836953343, "epoch": 0.6766169154228856, "grad_norm": 0.8586801290512085, "learning_rate": 0.0001998364323047236, "loss": 0.16848835945129395, "mean_token_accuracy": 0.9531193666160107, "num_tokens": 2269601.0, "step": 340 }, { "entropy": 0.1743609025143087, "epoch": 0.6965174129353234, "grad_norm": 0.7884849309921265, "learning_rate": 0.00019979668299351783, "loss": 0.17167186737060547, "mean_token_accuracy": 0.9482224509119987, "num_tokens": 2335815.0, "step": 350 }, { "entropy": 0.1952204409521073, "epoch": 0.7164179104477612, "grad_norm": 0.941378116607666, "learning_rate": 0.00019975261926652392, "loss": 0.18604878187179566, "mean_token_accuracy": 0.942904282361269, "num_tokens": 2404130.0, "step": 360 }, { "entropy": 0.19471225845627488, "epoch": 0.736318407960199, "grad_norm": 0.7770227789878845, "learning_rate": 0.00019970424302870739, "loss": 0.1847616672515869, "mean_token_accuracy": 0.9433550946414471, "num_tokens": 2470744.0, "step": 370 }, { "entropy": 0.19339222041890025, "epoch": 0.7562189054726368, "grad_norm": 1.1318728923797607, "learning_rate": 0.00019965155637147243, "loss": 0.18451868295669555, "mean_token_accuracy": 0.9457193531095982, "num_tokens": 2537581.0, "step": 380 }, { "entropy": 0.17824228820391, "epoch": 0.7761194029850746, "grad_norm": 0.8256890773773193, "learning_rate": 0.0001995945615725716, "loss": 0.17818082571029664, "mean_token_accuracy": 0.9509255833923816, "num_tokens": 2604045.0, "step": 390 }, { "entropy": 0.17659657467156648, "epoch": 0.7960199004975125, "grad_norm": 0.7419007420539856, "learning_rate": 0.00019953326109600728, "loss": 0.15658079385757445, "mean_token_accuracy": 0.9504644252359867, "num_tokens": 2669475.0, "step": 400 }, { "entropy": 0.16667078505270183, "epoch": 0.8159203980099502, "grad_norm": 0.8381772041320801, "learning_rate": 0.00019946765759192497, "loss": 0.16461316347122193, "mean_token_accuracy": 0.9532247520983219, "num_tokens": 2735709.0, "step": 410 }, { "entropy": 0.1525796527042985, "epoch": 0.835820895522388, "grad_norm": 0.7996618747711182, "learning_rate": 0.00019939775389649916, "loss": 0.15512030124664306, "mean_token_accuracy": 0.9544322639703751, "num_tokens": 2804586.0, "step": 420 }, { "entropy": 0.16498080925084652, "epoch": 0.8557213930348259, "grad_norm": 0.6151495575904846, "learning_rate": 0.00019932355303181026, "loss": 0.1559414744377136, "mean_token_accuracy": 0.956156824529171, "num_tokens": 2871824.0, "step": 430 }, { "entropy": 0.20550905396230518, "epoch": 0.8756218905472637, "grad_norm": 0.7512227892875671, "learning_rate": 0.00019924505820571425, "loss": 0.17734644412994385, "mean_token_accuracy": 0.9471527449786663, "num_tokens": 2937826.0, "step": 440 }, { "entropy": 0.1697809119708836, "epoch": 0.8955223880597015, "grad_norm": 0.762320339679718, "learning_rate": 0.0001991622728117038, "loss": 0.15445693731307983, "mean_token_accuracy": 0.9543316774070263, "num_tokens": 3006135.0, "step": 450 }, { "entropy": 0.17613516801502554, "epoch": 0.9154228855721394, "grad_norm": 0.6466898918151855, "learning_rate": 0.00019907520042876172, "loss": 0.16953592300415038, "mean_token_accuracy": 0.950883662700653, "num_tokens": 3073150.0, "step": 460 }, { "entropy": 0.15535307771060616, "epoch": 0.9353233830845771, "grad_norm": 1.1007940769195557, "learning_rate": 0.00019898384482120614, "loss": 0.15585366487503052, "mean_token_accuracy": 0.9595168434083462, "num_tokens": 3138638.0, "step": 470 }, { "entropy": 0.1557972011389211, "epoch": 0.9552238805970149, "grad_norm": 0.6533820629119873, "learning_rate": 0.0001988882099385278, "loss": 0.15293551683425904, "mean_token_accuracy": 0.9572585269808769, "num_tokens": 3206372.0, "step": 480 }, { "entropy": 0.13091885023750366, "epoch": 0.9751243781094527, "grad_norm": 0.5975553393363953, "learning_rate": 0.00019878829991521935, "loss": 0.1253079891204834, "mean_token_accuracy": 0.9635655723512173, "num_tokens": 3274281.0, "step": 490 }, { "entropy": 0.1669132244773209, "epoch": 0.9950248756218906, "grad_norm": 0.8513726592063904, "learning_rate": 0.00019868411907059645, "loss": 0.17081425189971924, "mean_token_accuracy": 0.9505244322121144, "num_tokens": 3340159.0, "step": 500 }, { "epoch": 1.0, "eval_entropy": 0.23721536022024842, "eval_loss": 0.24836121499538422, "eval_mean_token_accuracy": 0.9339753162676764, "eval_num_tokens": 3356986.0, "eval_runtime": 67.6123, "eval_samples_per_second": 15.308, "eval_steps_per_second": 7.661, "step": 503 }, { "entropy": 0.1568159531605871, "epoch": 1.0139303482587065, "grad_norm": 0.5372758507728577, "learning_rate": 0.00019857567190861126, "loss": 0.1242946743965149, "mean_token_accuracy": 0.9635580613424903, "num_tokens": 3404334.0, "step": 510 }, { "entropy": 0.1316974400077015, "epoch": 1.0338308457711443, "grad_norm": 0.7160713076591492, "learning_rate": 0.00019846296311765754, "loss": 0.1351562261581421, "mean_token_accuracy": 0.9581282936036587, "num_tokens": 3471525.0, "step": 520 }, { "entropy": 0.14656153018586338, "epoch": 1.053731343283582, "grad_norm": 0.5991392731666565, "learning_rate": 0.00019834599757036803, "loss": 0.12300963401794433, "mean_token_accuracy": 0.9646149106323719, "num_tokens": 3538338.0, "step": 530 }, { "entropy": 0.15197489713318646, "epoch": 1.07363184079602, "grad_norm": 0.9330605864524841, "learning_rate": 0.00019822478032340387, "loss": 0.12765015363693238, "mean_token_accuracy": 0.9586149267852306, "num_tokens": 3606642.0, "step": 540 }, { "entropy": 0.11335502485744656, "epoch": 1.0935323383084576, "grad_norm": 0.8762836456298828, "learning_rate": 0.0001980993166172358, "loss": 0.11172252893447876, "mean_token_accuracy": 0.9656657867133618, "num_tokens": 3674420.0, "step": 550 }, { "entropy": 0.12588824331760406, "epoch": 1.1134328358208956, "grad_norm": 0.8866952061653137, "learning_rate": 0.00019796961187591781, "loss": 0.10862302780151367, "mean_token_accuracy": 0.9648959740996361, "num_tokens": 3741381.0, "step": 560 }, { "entropy": 0.11430091026704758, "epoch": 1.1333333333333333, "grad_norm": 0.6481871604919434, "learning_rate": 0.00019783567170685262, "loss": 0.11582423448562622, "mean_token_accuracy": 0.9628987669944763, "num_tokens": 3808318.0, "step": 570 }, { "entropy": 0.11517859897576273, "epoch": 1.153233830845771, "grad_norm": 0.5650383234024048, "learning_rate": 0.00019769750190054905, "loss": 0.1037294864654541, "mean_token_accuracy": 0.9702431283891201, "num_tokens": 3874410.0, "step": 580 }, { "entropy": 0.10291576159652323, "epoch": 1.173134328358209, "grad_norm": 0.5433067083358765, "learning_rate": 0.00019755510843037191, "loss": 0.10045719146728516, "mean_token_accuracy": 0.9618785113096238, "num_tokens": 3941134.0, "step": 590 }, { "entropy": 0.11075262987287715, "epoch": 1.1930348258706467, "grad_norm": 0.7597805261611938, "learning_rate": 0.00019740849745228367, "loss": 0.12216674089431763, "mean_token_accuracy": 0.9657749280333519, "num_tokens": 4008097.0, "step": 600 }, { "entropy": 0.12675938094034792, "epoch": 1.2129353233830846, "grad_norm": 0.6820019483566284, "learning_rate": 0.00019725767530457837, "loss": 0.11509623527526855, "mean_token_accuracy": 0.9657132118940354, "num_tokens": 4073570.0, "step": 610 }, { "entropy": 0.13302950132638217, "epoch": 1.2328358208955223, "grad_norm": 0.5021085739135742, "learning_rate": 0.00019710264850760756, "loss": 0.10812582969665527, "mean_token_accuracy": 0.9639534369111061, "num_tokens": 4140207.0, "step": 620 }, { "entropy": 0.12266454068012536, "epoch": 1.25273631840796, "grad_norm": 0.7293747067451477, "learning_rate": 0.00019694342376349835, "loss": 0.12314709424972534, "mean_token_accuracy": 0.9629024133086205, "num_tokens": 4206997.0, "step": 630 }, { "entropy": 0.12240176484920084, "epoch": 1.272636815920398, "grad_norm": 0.9365243911743164, "learning_rate": 0.00019678000795586386, "loss": 0.117351496219635, "mean_token_accuracy": 0.96337865665555, "num_tokens": 4277152.0, "step": 640 }, { "entropy": 0.11147555778734386, "epoch": 1.292537313432836, "grad_norm": 0.7311879396438599, "learning_rate": 0.00019661240814950536, "loss": 0.11279709339141845, "mean_token_accuracy": 0.9658049061894417, "num_tokens": 4344652.0, "step": 650 }, { "entropy": 0.11891384413465858, "epoch": 1.3124378109452737, "grad_norm": 0.6283079981803894, "learning_rate": 0.00019644063159010716, "loss": 0.09745638966560363, "mean_token_accuracy": 0.9698325954377651, "num_tokens": 4411916.0, "step": 660 }, { "entropy": 0.12134865028783678, "epoch": 1.3323383084577114, "grad_norm": 0.6160532832145691, "learning_rate": 0.00019626468570392298, "loss": 0.1158707618713379, "mean_token_accuracy": 0.9658548943698406, "num_tokens": 4478621.0, "step": 670 }, { "entropy": 0.10654389052651822, "epoch": 1.3522388059701491, "grad_norm": 0.43357354402542114, "learning_rate": 0.00019608457809745537, "loss": 0.09168269634246826, "mean_token_accuracy": 0.9723479963839055, "num_tokens": 4544168.0, "step": 680 }, { "entropy": 0.109538364992477, "epoch": 1.372139303482587, "grad_norm": 0.7618773579597473, "learning_rate": 0.00019590031655712631, "loss": 0.11080507040023804, "mean_token_accuracy": 0.9682544745504856, "num_tokens": 4610518.0, "step": 690 }, { "entropy": 0.11043523394037039, "epoch": 1.392039800995025, "grad_norm": 0.8631065487861633, "learning_rate": 0.00019571190904894115, "loss": 0.09991470575332642, "mean_token_accuracy": 0.9694355696439743, "num_tokens": 4676248.0, "step": 700 }, { "entropy": 0.1043223840300925, "epoch": 1.4119402985074627, "grad_norm": 1.0989038944244385, "learning_rate": 0.00019551936371814375, "loss": 0.10194973945617676, "mean_token_accuracy": 0.9693835198879241, "num_tokens": 4742628.0, "step": 710 }, { "entropy": 0.10138569427654147, "epoch": 1.4318407960199004, "grad_norm": 0.9169466495513916, "learning_rate": 0.0001953226888888647, "loss": 0.10495258569717407, "mean_token_accuracy": 0.970366296172142, "num_tokens": 4809419.0, "step": 720 }, { "entropy": 0.11472290018573403, "epoch": 1.4517412935323384, "grad_norm": 0.49399080872535706, "learning_rate": 0.00019512189306376118, "loss": 0.11099306344985962, "mean_token_accuracy": 0.9688441671431065, "num_tokens": 4877119.0, "step": 730 }, { "entropy": 0.11205615981016308, "epoch": 1.471641791044776, "grad_norm": 0.61200350522995, "learning_rate": 0.0001949169849236496, "loss": 0.10629711151123047, "mean_token_accuracy": 0.966337724775076, "num_tokens": 4944433.0, "step": 740 }, { "entropy": 0.11642576553858816, "epoch": 1.491542288557214, "grad_norm": 0.6224406361579895, "learning_rate": 0.00019470797332713012, "loss": 0.11089148521423339, "mean_token_accuracy": 0.9659203454852104, "num_tokens": 5011634.0, "step": 750 }, { "entropy": 0.11514911148697138, "epoch": 1.5114427860696518, "grad_norm": 0.7650023698806763, "learning_rate": 0.0001944948673102038, "loss": 0.10163601636886596, "mean_token_accuracy": 0.9675627797842026, "num_tokens": 5077156.0, "step": 760 }, { "entropy": 0.10764023282099515, "epoch": 1.5313432835820895, "grad_norm": 0.49794143438339233, "learning_rate": 0.00019427767608588183, "loss": 0.098751300573349, "mean_token_accuracy": 0.9677646860480309, "num_tokens": 5143991.0, "step": 770 }, { "entropy": 0.1094623792450875, "epoch": 1.5512437810945272, "grad_norm": 0.6449922323226929, "learning_rate": 0.0001940564090437875, "loss": 0.11413514614105225, "mean_token_accuracy": 0.9680206254124641, "num_tokens": 5211604.0, "step": 780 }, { "entropy": 0.12053416313137859, "epoch": 1.5711442786069652, "grad_norm": 0.8340095281600952, "learning_rate": 0.00019383107574974984, "loss": 0.10809429883956909, "mean_token_accuracy": 0.9674052610993386, "num_tokens": 5277697.0, "step": 790 }, { "entropy": 0.10000467539066449, "epoch": 1.591044776119403, "grad_norm": 0.7644860744476318, "learning_rate": 0.00019360168594539055, "loss": 0.08709208965301514, "mean_token_accuracy": 0.9731013409793376, "num_tokens": 5342978.0, "step": 800 }, { "entropy": 0.10800170768052339, "epoch": 1.6109452736318408, "grad_norm": 0.6640422344207764, "learning_rate": 0.0001933682495477024, "loss": 0.09788179397583008, "mean_token_accuracy": 0.9665102422237396, "num_tokens": 5410289.0, "step": 810 }, { "entropy": 0.10117872587870806, "epoch": 1.6308457711442785, "grad_norm": 0.6755411624908447, "learning_rate": 0.00019313077664862092, "loss": 0.09605536460876465, "mean_token_accuracy": 0.972070074826479, "num_tokens": 5475880.0, "step": 820 }, { "entropy": 0.1069639899302274, "epoch": 1.6507462686567163, "grad_norm": 0.890627384185791, "learning_rate": 0.00019288927751458766, "loss": 0.10400503873825073, "mean_token_accuracy": 0.9711074873805046, "num_tokens": 5541606.0, "step": 830 }, { "entropy": 0.11311845399904996, "epoch": 1.6706467661691542, "grad_norm": 0.5509929656982422, "learning_rate": 0.0001926437625861068, "loss": 0.10754516124725341, "mean_token_accuracy": 0.9695759303867817, "num_tokens": 5608065.0, "step": 840 }, { "entropy": 0.12085098770912736, "epoch": 1.6905472636815921, "grad_norm": 0.6879218816757202, "learning_rate": 0.00019239424247729345, "loss": 0.12257307767868042, "mean_token_accuracy": 0.9648775070905685, "num_tokens": 5674308.0, "step": 850 }, { "entropy": 0.11081431191414595, "epoch": 1.7104477611940299, "grad_norm": 0.4920276999473572, "learning_rate": 0.0001921407279754149, "loss": 0.10849488973617553, "mean_token_accuracy": 0.9698534436523915, "num_tokens": 5742414.0, "step": 860 }, { "entropy": 0.0929627066012472, "epoch": 1.7303482587064676, "grad_norm": 0.7228904366493225, "learning_rate": 0.00019188323004042435, "loss": 0.0802489161491394, "mean_token_accuracy": 0.9730034552514553, "num_tokens": 5809827.0, "step": 870 }, { "entropy": 0.0936126358807087, "epoch": 1.7502487562189055, "grad_norm": 0.6558980345726013, "learning_rate": 0.00019162175980448688, "loss": 0.1109757661819458, "mean_token_accuracy": 0.9671767763793468, "num_tokens": 5875172.0, "step": 880 }, { "entropy": 0.11744439310859889, "epoch": 1.7701492537313432, "grad_norm": 0.5792869925498962, "learning_rate": 0.0001913563285714984, "loss": 0.09240159988403321, "mean_token_accuracy": 0.9710902646183968, "num_tokens": 5942033.0, "step": 890 }, { "entropy": 0.10555630044545979, "epoch": 1.7900497512437812, "grad_norm": 0.8990387320518494, "learning_rate": 0.0001910869478165969, "loss": 0.12259334325790405, "mean_token_accuracy": 0.9644198954105377, "num_tokens": 6007977.0, "step": 900 }, { "entropy": 0.10993905747309327, "epoch": 1.809950248756219, "grad_norm": 0.7768874168395996, "learning_rate": 0.00019081362918566618, "loss": 0.10547571182250977, "mean_token_accuracy": 0.9728645481169224, "num_tokens": 6074057.0, "step": 910 }, { "entropy": 0.10362131035653874, "epoch": 1.8298507462686566, "grad_norm": 0.4525396525859833, "learning_rate": 0.00019053638449483259, "loss": 0.10611696243286133, "mean_token_accuracy": 0.9724654078483581, "num_tokens": 6141345.0, "step": 920 }, { "entropy": 0.11784212745260447, "epoch": 1.8497512437810946, "grad_norm": 0.7492642998695374, "learning_rate": 0.0001902552257299542, "loss": 0.11176036596298218, "mean_token_accuracy": 0.9628825642168521, "num_tokens": 6209124.0, "step": 930 }, { "entropy": 0.11072989953681826, "epoch": 1.8696517412935323, "grad_norm": 0.5748555064201355, "learning_rate": 0.00018997016504610246, "loss": 0.10774084329605102, "mean_token_accuracy": 0.9646185263991356, "num_tokens": 6276485.0, "step": 940 }, { "entropy": 0.10556984411086887, "epoch": 1.8895522388059702, "grad_norm": 0.5937514305114746, "learning_rate": 0.00018968121476703678, "loss": 0.08848418593406678, "mean_token_accuracy": 0.9734670996665955, "num_tokens": 6342957.0, "step": 950 }, { "entropy": 0.09428299731807784, "epoch": 1.909452736318408, "grad_norm": 1.0715358257293701, "learning_rate": 0.00018938838738467184, "loss": 0.10269320011138916, "mean_token_accuracy": 0.9720249362289906, "num_tokens": 6408918.0, "step": 960 }, { "entropy": 0.10850229405332357, "epoch": 1.9293532338308457, "grad_norm": 0.5169550180435181, "learning_rate": 0.00018909169555853743, "loss": 0.0899561107158661, "mean_token_accuracy": 0.9714486353099346, "num_tokens": 6475062.0, "step": 970 }, { "entropy": 0.1026058561168611, "epoch": 1.9492537313432836, "grad_norm": 0.7642938494682312, "learning_rate": 0.00018879115211523117, "loss": 0.09649609923362731, "mean_token_accuracy": 0.9703472301363945, "num_tokens": 6542465.0, "step": 980 }, { "entropy": 0.09136548589449375, "epoch": 1.9691542288557216, "grad_norm": 0.3874703347682953, "learning_rate": 0.0001884867700478641, "loss": 0.09067035913467407, "mean_token_accuracy": 0.9718083783984184, "num_tokens": 6608985.0, "step": 990 }, { "entropy": 0.11761876428499818, "epoch": 1.9890547263681593, "grad_norm": 0.693695604801178, "learning_rate": 0.00018817856251549867, "loss": 0.09239903688430787, "mean_token_accuracy": 0.9674227833747864, "num_tokens": 6676885.0, "step": 1000 }, { "epoch": 2.0, "eval_entropy": 0.13267684354209502, "eval_loss": 0.24770455062389374, "eval_mean_token_accuracy": 0.9410935246806347, "eval_num_tokens": 6713972.0, "eval_runtime": 67.3665, "eval_samples_per_second": 15.364, "eval_steps_per_second": 7.689, "step": 1006 } ], "logging_steps": 10, "max_steps": 5030, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.3957721650888704e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }