bhavanikambhampati's picture
Publish text2sql adapter (v3)
21394e2 verified
Raw
History Blame Contribute Delete
32.1 kB
{
"best_global_step": 1006,
"best_metric": 0.24770455062389374,
"best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/text2sql/checkpoint-1006",
"epoch": 2.0,
"eval_steps": 500,
"global_step": 1006,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.1253886640071868,
"epoch": 0.01990049751243781,
"grad_norm": 2.338360548019409,
"learning_rate": 7.142857142857143e-06,
"loss": 1.4502812385559083,
"mean_token_accuracy": 0.6671988122165203,
"num_tokens": 68027.0,
"step": 10
},
{
"entropy": 1.0893175967037678,
"epoch": 0.03980099502487562,
"grad_norm": 1.6519114971160889,
"learning_rate": 1.5079365079365079e-05,
"loss": 1.1673696517944336,
"mean_token_accuracy": 0.698525931686163,
"num_tokens": 135033.0,
"step": 20
},
{
"entropy": 1.0583932913839817,
"epoch": 0.05970149253731343,
"grad_norm": 1.202163815498352,
"learning_rate": 2.3015873015873015e-05,
"loss": 1.0070637702941894,
"mean_token_accuracy": 0.7307960025966167,
"num_tokens": 201643.0,
"step": 30
},
{
"entropy": 0.8722786333411932,
"epoch": 0.07960199004975124,
"grad_norm": 1.3554679155349731,
"learning_rate": 3.095238095238095e-05,
"loss": 0.749023151397705,
"mean_token_accuracy": 0.8074305906891823,
"num_tokens": 267572.0,
"step": 40
},
{
"entropy": 0.6009022377431392,
"epoch": 0.09950248756218906,
"grad_norm": 1.4063202142715454,
"learning_rate": 3.888888888888889e-05,
"loss": 0.5123498916625977,
"mean_token_accuracy": 0.8385950662195683,
"num_tokens": 333673.0,
"step": 50
},
{
"entropy": 0.4164533382281661,
"epoch": 0.11940298507462686,
"grad_norm": 1.8205658197402954,
"learning_rate": 4.682539682539683e-05,
"loss": 0.4625075340270996,
"mean_token_accuracy": 0.8584991104900837,
"num_tokens": 399397.0,
"step": 60
},
{
"entropy": 0.4577839931473136,
"epoch": 0.13930348258706468,
"grad_norm": 1.393362283706665,
"learning_rate": 5.4761904761904766e-05,
"loss": 0.4174641609191895,
"mean_token_accuracy": 0.8803921975195408,
"num_tokens": 465864.0,
"step": 70
},
{
"entropy": 0.41640141475945713,
"epoch": 0.15920398009950248,
"grad_norm": 2.2472920417785645,
"learning_rate": 6.26984126984127e-05,
"loss": 0.417645263671875,
"mean_token_accuracy": 0.8779219165444374,
"num_tokens": 534817.0,
"step": 80
},
{
"entropy": 0.3839787464588881,
"epoch": 0.1791044776119403,
"grad_norm": 1.300377368927002,
"learning_rate": 7.063492063492065e-05,
"loss": 0.38586442470550536,
"mean_token_accuracy": 0.8903462648391723,
"num_tokens": 600614.0,
"step": 90
},
{
"entropy": 0.3429916022345424,
"epoch": 0.19900497512437812,
"grad_norm": 1.5014147758483887,
"learning_rate": 7.857142857142858e-05,
"loss": 0.33204805850982666,
"mean_token_accuracy": 0.9070690087974072,
"num_tokens": 665888.0,
"step": 100
},
{
"entropy": 0.36409866753965614,
"epoch": 0.21890547263681592,
"grad_norm": 1.417038083076477,
"learning_rate": 8.650793650793651e-05,
"loss": 0.3376448631286621,
"mean_token_accuracy": 0.8962906174361706,
"num_tokens": 732400.0,
"step": 110
},
{
"entropy": 0.263674839399755,
"epoch": 0.23880597014925373,
"grad_norm": 1.2735201120376587,
"learning_rate": 9.444444444444444e-05,
"loss": 0.270894718170166,
"mean_token_accuracy": 0.9201160937547683,
"num_tokens": 799887.0,
"step": 120
},
{
"entropy": 0.30584911033511164,
"epoch": 0.25870646766169153,
"grad_norm": 1.2719416618347168,
"learning_rate": 0.00010238095238095237,
"loss": 0.27406151294708253,
"mean_token_accuracy": 0.9204320795834064,
"num_tokens": 866147.0,
"step": 130
},
{
"entropy": 0.28959042597562074,
"epoch": 0.27860696517412936,
"grad_norm": 2.2021138668060303,
"learning_rate": 0.00011031746031746033,
"loss": 0.32373068332672117,
"mean_token_accuracy": 0.8983257927000523,
"num_tokens": 933129.0,
"step": 140
},
{
"entropy": 0.29785235710442065,
"epoch": 0.29850746268656714,
"grad_norm": 0.9740720987319946,
"learning_rate": 0.00011825396825396826,
"loss": 0.2523745775222778,
"mean_token_accuracy": 0.9215191625058651,
"num_tokens": 997739.0,
"step": 150
},
{
"entropy": 0.28159743677824733,
"epoch": 0.31840796019900497,
"grad_norm": 1.025788426399231,
"learning_rate": 0.0001261904761904762,
"loss": 0.27993102073669435,
"mean_token_accuracy": 0.9143906190991402,
"num_tokens": 1064807.0,
"step": 160
},
{
"entropy": 0.282751829456538,
"epoch": 0.3383084577114428,
"grad_norm": 1.149941086769104,
"learning_rate": 0.00013412698412698412,
"loss": 0.289961838722229,
"mean_token_accuracy": 0.9160969875752926,
"num_tokens": 1130310.0,
"step": 170
},
{
"entropy": 0.30801400616765023,
"epoch": 0.3582089552238806,
"grad_norm": 1.1288280487060547,
"learning_rate": 0.00014206349206349208,
"loss": 0.2773977518081665,
"mean_token_accuracy": 0.9185432456433773,
"num_tokens": 1197192.0,
"step": 180
},
{
"entropy": 0.24713189490139484,
"epoch": 0.3781094527363184,
"grad_norm": 0.9636886119842529,
"learning_rate": 0.00015000000000000001,
"loss": 0.26672122478485105,
"mean_token_accuracy": 0.9264318533241749,
"num_tokens": 1263466.0,
"step": 190
},
{
"entropy": 0.287679692171514,
"epoch": 0.39800995024875624,
"grad_norm": 1.137581467628479,
"learning_rate": 0.00015793650793650795,
"loss": 0.2587902069091797,
"mean_token_accuracy": 0.9211024351418018,
"num_tokens": 1330385.0,
"step": 200
},
{
"entropy": 0.2620579367503524,
"epoch": 0.417910447761194,
"grad_norm": 1.3906782865524292,
"learning_rate": 0.0001658730158730159,
"loss": 0.25291283130645753,
"mean_token_accuracy": 0.922594179213047,
"num_tokens": 1399272.0,
"step": 210
},
{
"entropy": 0.24558336716145276,
"epoch": 0.43781094527363185,
"grad_norm": 1.1515614986419678,
"learning_rate": 0.00017380952380952383,
"loss": 0.23645257949829102,
"mean_token_accuracy": 0.9315326489508152,
"num_tokens": 1466197.0,
"step": 220
},
{
"entropy": 0.23100281171500683,
"epoch": 0.4577114427860697,
"grad_norm": 1.0060856342315674,
"learning_rate": 0.00018174603174603177,
"loss": 0.21004528999328614,
"mean_token_accuracy": 0.9294509522616863,
"num_tokens": 1533135.0,
"step": 230
},
{
"entropy": 0.2551280764862895,
"epoch": 0.47761194029850745,
"grad_norm": 0.8229029178619385,
"learning_rate": 0.0001896825396825397,
"loss": 0.23107924461364746,
"mean_token_accuracy": 0.9292825579643249,
"num_tokens": 1600905.0,
"step": 240
},
{
"entropy": 0.2424938028678298,
"epoch": 0.4975124378109453,
"grad_norm": 1.199968695640564,
"learning_rate": 0.00019761904761904763,
"loss": 0.25817849636077883,
"mean_token_accuracy": 0.9277816534042358,
"num_tokens": 1666956.0,
"step": 250
},
{
"entropy": 0.27997240191325545,
"epoch": 0.5174129353233831,
"grad_norm": 0.6602728962898254,
"learning_rate": 0.0001999989408126818,
"loss": 0.25299272537231443,
"mean_token_accuracy": 0.926287354528904,
"num_tokens": 1734782.0,
"step": 260
},
{
"entropy": 0.20782412360422314,
"epoch": 0.5373134328358209,
"grad_norm": 0.7651694416999817,
"learning_rate": 0.0001999937530104439,
"loss": 0.20403761863708497,
"mean_token_accuracy": 0.9310354895889759,
"num_tokens": 1800055.0,
"step": 270
},
{
"entropy": 0.2172251005657017,
"epoch": 0.5572139303482587,
"grad_norm": 1.2643989324569702,
"learning_rate": 0.00019998424227267588,
"loss": 0.20663719177246093,
"mean_token_accuracy": 0.9364220850169659,
"num_tokens": 1866900.0,
"step": 280
},
{
"entropy": 0.19974687648937106,
"epoch": 0.5771144278606966,
"grad_norm": 0.9468103051185608,
"learning_rate": 0.00019997040901054646,
"loss": 0.20071234703063964,
"mean_token_accuracy": 0.9412682101130485,
"num_tokens": 1934548.0,
"step": 290
},
{
"entropy": 0.1886322578880936,
"epoch": 0.5970149253731343,
"grad_norm": 0.8480322360992432,
"learning_rate": 0.000199952253822096,
"loss": 0.18384914398193358,
"mean_token_accuracy": 0.948433005809784,
"num_tokens": 2001379.0,
"step": 300
},
{
"entropy": 0.21811659364029765,
"epoch": 0.6169154228855721,
"grad_norm": 0.8029792308807373,
"learning_rate": 0.00019992977749221064,
"loss": 0.20460138320922852,
"mean_token_accuracy": 0.9401800245046615,
"num_tokens": 2070001.0,
"step": 310
},
{
"entropy": 0.18392337979748846,
"epoch": 0.6368159203980099,
"grad_norm": 0.8735001087188721,
"learning_rate": 0.0001999029809925883,
"loss": 0.17823137044906617,
"mean_token_accuracy": 0.9488276831805706,
"num_tokens": 2135350.0,
"step": 320
},
{
"entropy": 0.18473064368590714,
"epoch": 0.6567164179104478,
"grad_norm": 0.7449737787246704,
"learning_rate": 0.00019987186548169682,
"loss": 0.16862742900848388,
"mean_token_accuracy": 0.9462769009172917,
"num_tokens": 2203472.0,
"step": 330
},
{
"entropy": 0.16661408836953343,
"epoch": 0.6766169154228856,
"grad_norm": 0.8586801290512085,
"learning_rate": 0.0001998364323047236,
"loss": 0.16848835945129395,
"mean_token_accuracy": 0.9531193666160107,
"num_tokens": 2269601.0,
"step": 340
},
{
"entropy": 0.1743609025143087,
"epoch": 0.6965174129353234,
"grad_norm": 0.7884849309921265,
"learning_rate": 0.00019979668299351783,
"loss": 0.17167186737060547,
"mean_token_accuracy": 0.9482224509119987,
"num_tokens": 2335815.0,
"step": 350
},
{
"entropy": 0.1952204409521073,
"epoch": 0.7164179104477612,
"grad_norm": 0.941378116607666,
"learning_rate": 0.00019975261926652392,
"loss": 0.18604878187179566,
"mean_token_accuracy": 0.942904282361269,
"num_tokens": 2404130.0,
"step": 360
},
{
"entropy": 0.19471225845627488,
"epoch": 0.736318407960199,
"grad_norm": 0.7770227789878845,
"learning_rate": 0.00019970424302870739,
"loss": 0.1847616672515869,
"mean_token_accuracy": 0.9433550946414471,
"num_tokens": 2470744.0,
"step": 370
},
{
"entropy": 0.19339222041890025,
"epoch": 0.7562189054726368,
"grad_norm": 1.1318728923797607,
"learning_rate": 0.00019965155637147243,
"loss": 0.18451868295669555,
"mean_token_accuracy": 0.9457193531095982,
"num_tokens": 2537581.0,
"step": 380
},
{
"entropy": 0.17824228820391,
"epoch": 0.7761194029850746,
"grad_norm": 0.8256890773773193,
"learning_rate": 0.0001995945615725716,
"loss": 0.17818082571029664,
"mean_token_accuracy": 0.9509255833923816,
"num_tokens": 2604045.0,
"step": 390
},
{
"entropy": 0.17659657467156648,
"epoch": 0.7960199004975125,
"grad_norm": 0.7419007420539856,
"learning_rate": 0.00019953326109600728,
"loss": 0.15658079385757445,
"mean_token_accuracy": 0.9504644252359867,
"num_tokens": 2669475.0,
"step": 400
},
{
"entropy": 0.16667078505270183,
"epoch": 0.8159203980099502,
"grad_norm": 0.8381772041320801,
"learning_rate": 0.00019946765759192497,
"loss": 0.16461316347122193,
"mean_token_accuracy": 0.9532247520983219,
"num_tokens": 2735709.0,
"step": 410
},
{
"entropy": 0.1525796527042985,
"epoch": 0.835820895522388,
"grad_norm": 0.7996618747711182,
"learning_rate": 0.00019939775389649916,
"loss": 0.15512030124664306,
"mean_token_accuracy": 0.9544322639703751,
"num_tokens": 2804586.0,
"step": 420
},
{
"entropy": 0.16498080925084652,
"epoch": 0.8557213930348259,
"grad_norm": 0.6151495575904846,
"learning_rate": 0.00019932355303181026,
"loss": 0.1559414744377136,
"mean_token_accuracy": 0.956156824529171,
"num_tokens": 2871824.0,
"step": 430
},
{
"entropy": 0.20550905396230518,
"epoch": 0.8756218905472637,
"grad_norm": 0.7512227892875671,
"learning_rate": 0.00019924505820571425,
"loss": 0.17734644412994385,
"mean_token_accuracy": 0.9471527449786663,
"num_tokens": 2937826.0,
"step": 440
},
{
"entropy": 0.1697809119708836,
"epoch": 0.8955223880597015,
"grad_norm": 0.762320339679718,
"learning_rate": 0.0001991622728117038,
"loss": 0.15445693731307983,
"mean_token_accuracy": 0.9543316774070263,
"num_tokens": 3006135.0,
"step": 450
},
{
"entropy": 0.17613516801502554,
"epoch": 0.9154228855721394,
"grad_norm": 0.6466898918151855,
"learning_rate": 0.00019907520042876172,
"loss": 0.16953592300415038,
"mean_token_accuracy": 0.950883662700653,
"num_tokens": 3073150.0,
"step": 460
},
{
"entropy": 0.15535307771060616,
"epoch": 0.9353233830845771,
"grad_norm": 1.1007940769195557,
"learning_rate": 0.00019898384482120614,
"loss": 0.15585366487503052,
"mean_token_accuracy": 0.9595168434083462,
"num_tokens": 3138638.0,
"step": 470
},
{
"entropy": 0.1557972011389211,
"epoch": 0.9552238805970149,
"grad_norm": 0.6533820629119873,
"learning_rate": 0.0001988882099385278,
"loss": 0.15293551683425904,
"mean_token_accuracy": 0.9572585269808769,
"num_tokens": 3206372.0,
"step": 480
},
{
"entropy": 0.13091885023750366,
"epoch": 0.9751243781094527,
"grad_norm": 0.5975553393363953,
"learning_rate": 0.00019878829991521935,
"loss": 0.1253079891204834,
"mean_token_accuracy": 0.9635655723512173,
"num_tokens": 3274281.0,
"step": 490
},
{
"entropy": 0.1669132244773209,
"epoch": 0.9950248756218906,
"grad_norm": 0.8513726592063904,
"learning_rate": 0.00019868411907059645,
"loss": 0.17081425189971924,
"mean_token_accuracy": 0.9505244322121144,
"num_tokens": 3340159.0,
"step": 500
},
{
"epoch": 1.0,
"eval_entropy": 0.23721536022024842,
"eval_loss": 0.24836121499538422,
"eval_mean_token_accuracy": 0.9339753162676764,
"eval_num_tokens": 3356986.0,
"eval_runtime": 67.6123,
"eval_samples_per_second": 15.308,
"eval_steps_per_second": 7.661,
"step": 503
},
{
"entropy": 0.1568159531605871,
"epoch": 1.0139303482587065,
"grad_norm": 0.5372758507728577,
"learning_rate": 0.00019857567190861126,
"loss": 0.1242946743965149,
"mean_token_accuracy": 0.9635580613424903,
"num_tokens": 3404334.0,
"step": 510
},
{
"entropy": 0.1316974400077015,
"epoch": 1.0338308457711443,
"grad_norm": 0.7160713076591492,
"learning_rate": 0.00019846296311765754,
"loss": 0.1351562261581421,
"mean_token_accuracy": 0.9581282936036587,
"num_tokens": 3471525.0,
"step": 520
},
{
"entropy": 0.14656153018586338,
"epoch": 1.053731343283582,
"grad_norm": 0.5991392731666565,
"learning_rate": 0.00019834599757036803,
"loss": 0.12300963401794433,
"mean_token_accuracy": 0.9646149106323719,
"num_tokens": 3538338.0,
"step": 530
},
{
"entropy": 0.15197489713318646,
"epoch": 1.07363184079602,
"grad_norm": 0.9330605864524841,
"learning_rate": 0.00019822478032340387,
"loss": 0.12765015363693238,
"mean_token_accuracy": 0.9586149267852306,
"num_tokens": 3606642.0,
"step": 540
},
{
"entropy": 0.11335502485744656,
"epoch": 1.0935323383084576,
"grad_norm": 0.8762836456298828,
"learning_rate": 0.0001980993166172358,
"loss": 0.11172252893447876,
"mean_token_accuracy": 0.9656657867133618,
"num_tokens": 3674420.0,
"step": 550
},
{
"entropy": 0.12588824331760406,
"epoch": 1.1134328358208956,
"grad_norm": 0.8866952061653137,
"learning_rate": 0.00019796961187591781,
"loss": 0.10862302780151367,
"mean_token_accuracy": 0.9648959740996361,
"num_tokens": 3741381.0,
"step": 560
},
{
"entropy": 0.11430091026704758,
"epoch": 1.1333333333333333,
"grad_norm": 0.6481871604919434,
"learning_rate": 0.00019783567170685262,
"loss": 0.11582423448562622,
"mean_token_accuracy": 0.9628987669944763,
"num_tokens": 3808318.0,
"step": 570
},
{
"entropy": 0.11517859897576273,
"epoch": 1.153233830845771,
"grad_norm": 0.5650383234024048,
"learning_rate": 0.00019769750190054905,
"loss": 0.1037294864654541,
"mean_token_accuracy": 0.9702431283891201,
"num_tokens": 3874410.0,
"step": 580
},
{
"entropy": 0.10291576159652323,
"epoch": 1.173134328358209,
"grad_norm": 0.5433067083358765,
"learning_rate": 0.00019755510843037191,
"loss": 0.10045719146728516,
"mean_token_accuracy": 0.9618785113096238,
"num_tokens": 3941134.0,
"step": 590
},
{
"entropy": 0.11075262987287715,
"epoch": 1.1930348258706467,
"grad_norm": 0.7597805261611938,
"learning_rate": 0.00019740849745228367,
"loss": 0.12216674089431763,
"mean_token_accuracy": 0.9657749280333519,
"num_tokens": 4008097.0,
"step": 600
},
{
"entropy": 0.12675938094034792,
"epoch": 1.2129353233830846,
"grad_norm": 0.6820019483566284,
"learning_rate": 0.00019725767530457837,
"loss": 0.11509623527526855,
"mean_token_accuracy": 0.9657132118940354,
"num_tokens": 4073570.0,
"step": 610
},
{
"entropy": 0.13302950132638217,
"epoch": 1.2328358208955223,
"grad_norm": 0.5021085739135742,
"learning_rate": 0.00019710264850760756,
"loss": 0.10812582969665527,
"mean_token_accuracy": 0.9639534369111061,
"num_tokens": 4140207.0,
"step": 620
},
{
"entropy": 0.12266454068012536,
"epoch": 1.25273631840796,
"grad_norm": 0.7293747067451477,
"learning_rate": 0.00019694342376349835,
"loss": 0.12314709424972534,
"mean_token_accuracy": 0.9629024133086205,
"num_tokens": 4206997.0,
"step": 630
},
{
"entropy": 0.12240176484920084,
"epoch": 1.272636815920398,
"grad_norm": 0.9365243911743164,
"learning_rate": 0.00019678000795586386,
"loss": 0.117351496219635,
"mean_token_accuracy": 0.96337865665555,
"num_tokens": 4277152.0,
"step": 640
},
{
"entropy": 0.11147555778734386,
"epoch": 1.292537313432836,
"grad_norm": 0.7311879396438599,
"learning_rate": 0.00019661240814950536,
"loss": 0.11279709339141845,
"mean_token_accuracy": 0.9658049061894417,
"num_tokens": 4344652.0,
"step": 650
},
{
"entropy": 0.11891384413465858,
"epoch": 1.3124378109452737,
"grad_norm": 0.6283079981803894,
"learning_rate": 0.00019644063159010716,
"loss": 0.09745638966560363,
"mean_token_accuracy": 0.9698325954377651,
"num_tokens": 4411916.0,
"step": 660
},
{
"entropy": 0.12134865028783678,
"epoch": 1.3323383084577114,
"grad_norm": 0.6160532832145691,
"learning_rate": 0.00019626468570392298,
"loss": 0.1158707618713379,
"mean_token_accuracy": 0.9658548943698406,
"num_tokens": 4478621.0,
"step": 670
},
{
"entropy": 0.10654389052651822,
"epoch": 1.3522388059701491,
"grad_norm": 0.43357354402542114,
"learning_rate": 0.00019608457809745537,
"loss": 0.09168269634246826,
"mean_token_accuracy": 0.9723479963839055,
"num_tokens": 4544168.0,
"step": 680
},
{
"entropy": 0.109538364992477,
"epoch": 1.372139303482587,
"grad_norm": 0.7618773579597473,
"learning_rate": 0.00019590031655712631,
"loss": 0.11080507040023804,
"mean_token_accuracy": 0.9682544745504856,
"num_tokens": 4610518.0,
"step": 690
},
{
"entropy": 0.11043523394037039,
"epoch": 1.392039800995025,
"grad_norm": 0.8631065487861633,
"learning_rate": 0.00019571190904894115,
"loss": 0.09991470575332642,
"mean_token_accuracy": 0.9694355696439743,
"num_tokens": 4676248.0,
"step": 700
},
{
"entropy": 0.1043223840300925,
"epoch": 1.4119402985074627,
"grad_norm": 1.0989038944244385,
"learning_rate": 0.00019551936371814375,
"loss": 0.10194973945617676,
"mean_token_accuracy": 0.9693835198879241,
"num_tokens": 4742628.0,
"step": 710
},
{
"entropy": 0.10138569427654147,
"epoch": 1.4318407960199004,
"grad_norm": 0.9169466495513916,
"learning_rate": 0.0001953226888888647,
"loss": 0.10495258569717407,
"mean_token_accuracy": 0.970366296172142,
"num_tokens": 4809419.0,
"step": 720
},
{
"entropy": 0.11472290018573403,
"epoch": 1.4517412935323384,
"grad_norm": 0.49399080872535706,
"learning_rate": 0.00019512189306376118,
"loss": 0.11099306344985962,
"mean_token_accuracy": 0.9688441671431065,
"num_tokens": 4877119.0,
"step": 730
},
{
"entropy": 0.11205615981016308,
"epoch": 1.471641791044776,
"grad_norm": 0.61200350522995,
"learning_rate": 0.0001949169849236496,
"loss": 0.10629711151123047,
"mean_token_accuracy": 0.966337724775076,
"num_tokens": 4944433.0,
"step": 740
},
{
"entropy": 0.11642576553858816,
"epoch": 1.491542288557214,
"grad_norm": 0.6224406361579895,
"learning_rate": 0.00019470797332713012,
"loss": 0.11089148521423339,
"mean_token_accuracy": 0.9659203454852104,
"num_tokens": 5011634.0,
"step": 750
},
{
"entropy": 0.11514911148697138,
"epoch": 1.5114427860696518,
"grad_norm": 0.7650023698806763,
"learning_rate": 0.0001944948673102038,
"loss": 0.10163601636886596,
"mean_token_accuracy": 0.9675627797842026,
"num_tokens": 5077156.0,
"step": 760
},
{
"entropy": 0.10764023282099515,
"epoch": 1.5313432835820895,
"grad_norm": 0.49794143438339233,
"learning_rate": 0.00019427767608588183,
"loss": 0.098751300573349,
"mean_token_accuracy": 0.9677646860480309,
"num_tokens": 5143991.0,
"step": 770
},
{
"entropy": 0.1094623792450875,
"epoch": 1.5512437810945272,
"grad_norm": 0.6449922323226929,
"learning_rate": 0.0001940564090437875,
"loss": 0.11413514614105225,
"mean_token_accuracy": 0.9680206254124641,
"num_tokens": 5211604.0,
"step": 780
},
{
"entropy": 0.12053416313137859,
"epoch": 1.5711442786069652,
"grad_norm": 0.8340095281600952,
"learning_rate": 0.00019383107574974984,
"loss": 0.10809429883956909,
"mean_token_accuracy": 0.9674052610993386,
"num_tokens": 5277697.0,
"step": 790
},
{
"entropy": 0.10000467539066449,
"epoch": 1.591044776119403,
"grad_norm": 0.7644860744476318,
"learning_rate": 0.00019360168594539055,
"loss": 0.08709208965301514,
"mean_token_accuracy": 0.9731013409793376,
"num_tokens": 5342978.0,
"step": 800
},
{
"entropy": 0.10800170768052339,
"epoch": 1.6109452736318408,
"grad_norm": 0.6640422344207764,
"learning_rate": 0.0001933682495477024,
"loss": 0.09788179397583008,
"mean_token_accuracy": 0.9665102422237396,
"num_tokens": 5410289.0,
"step": 810
},
{
"entropy": 0.10117872587870806,
"epoch": 1.6308457711442785,
"grad_norm": 0.6755411624908447,
"learning_rate": 0.00019313077664862092,
"loss": 0.09605536460876465,
"mean_token_accuracy": 0.972070074826479,
"num_tokens": 5475880.0,
"step": 820
},
{
"entropy": 0.1069639899302274,
"epoch": 1.6507462686567163,
"grad_norm": 0.890627384185791,
"learning_rate": 0.00019288927751458766,
"loss": 0.10400503873825073,
"mean_token_accuracy": 0.9711074873805046,
"num_tokens": 5541606.0,
"step": 830
},
{
"entropy": 0.11311845399904996,
"epoch": 1.6706467661691542,
"grad_norm": 0.5509929656982422,
"learning_rate": 0.0001926437625861068,
"loss": 0.10754516124725341,
"mean_token_accuracy": 0.9695759303867817,
"num_tokens": 5608065.0,
"step": 840
},
{
"entropy": 0.12085098770912736,
"epoch": 1.6905472636815921,
"grad_norm": 0.6879218816757202,
"learning_rate": 0.00019239424247729345,
"loss": 0.12257307767868042,
"mean_token_accuracy": 0.9648775070905685,
"num_tokens": 5674308.0,
"step": 850
},
{
"entropy": 0.11081431191414595,
"epoch": 1.7104477611940299,
"grad_norm": 0.4920276999473572,
"learning_rate": 0.0001921407279754149,
"loss": 0.10849488973617553,
"mean_token_accuracy": 0.9698534436523915,
"num_tokens": 5742414.0,
"step": 860
},
{
"entropy": 0.0929627066012472,
"epoch": 1.7303482587064676,
"grad_norm": 0.7228904366493225,
"learning_rate": 0.00019188323004042435,
"loss": 0.0802489161491394,
"mean_token_accuracy": 0.9730034552514553,
"num_tokens": 5809827.0,
"step": 870
},
{
"entropy": 0.0936126358807087,
"epoch": 1.7502487562189055,
"grad_norm": 0.6558980345726013,
"learning_rate": 0.00019162175980448688,
"loss": 0.1109757661819458,
"mean_token_accuracy": 0.9671767763793468,
"num_tokens": 5875172.0,
"step": 880
},
{
"entropy": 0.11744439310859889,
"epoch": 1.7701492537313432,
"grad_norm": 0.5792869925498962,
"learning_rate": 0.0001913563285714984,
"loss": 0.09240159988403321,
"mean_token_accuracy": 0.9710902646183968,
"num_tokens": 5942033.0,
"step": 890
},
{
"entropy": 0.10555630044545979,
"epoch": 1.7900497512437812,
"grad_norm": 0.8990387320518494,
"learning_rate": 0.0001910869478165969,
"loss": 0.12259334325790405,
"mean_token_accuracy": 0.9644198954105377,
"num_tokens": 6007977.0,
"step": 900
},
{
"entropy": 0.10993905747309327,
"epoch": 1.809950248756219,
"grad_norm": 0.7768874168395996,
"learning_rate": 0.00019081362918566618,
"loss": 0.10547571182250977,
"mean_token_accuracy": 0.9728645481169224,
"num_tokens": 6074057.0,
"step": 910
},
{
"entropy": 0.10362131035653874,
"epoch": 1.8298507462686566,
"grad_norm": 0.4525396525859833,
"learning_rate": 0.00019053638449483259,
"loss": 0.10611696243286133,
"mean_token_accuracy": 0.9724654078483581,
"num_tokens": 6141345.0,
"step": 920
},
{
"entropy": 0.11784212745260447,
"epoch": 1.8497512437810946,
"grad_norm": 0.7492642998695374,
"learning_rate": 0.0001902552257299542,
"loss": 0.11176036596298218,
"mean_token_accuracy": 0.9628825642168521,
"num_tokens": 6209124.0,
"step": 930
},
{
"entropy": 0.11072989953681826,
"epoch": 1.8696517412935323,
"grad_norm": 0.5748555064201355,
"learning_rate": 0.00018997016504610246,
"loss": 0.10774084329605102,
"mean_token_accuracy": 0.9646185263991356,
"num_tokens": 6276485.0,
"step": 940
},
{
"entropy": 0.10556984411086887,
"epoch": 1.8895522388059702,
"grad_norm": 0.5937514305114746,
"learning_rate": 0.00018968121476703678,
"loss": 0.08848418593406678,
"mean_token_accuracy": 0.9734670996665955,
"num_tokens": 6342957.0,
"step": 950
},
{
"entropy": 0.09428299731807784,
"epoch": 1.909452736318408,
"grad_norm": 1.0715358257293701,
"learning_rate": 0.00018938838738467184,
"loss": 0.10269320011138916,
"mean_token_accuracy": 0.9720249362289906,
"num_tokens": 6408918.0,
"step": 960
},
{
"entropy": 0.10850229405332357,
"epoch": 1.9293532338308457,
"grad_norm": 0.5169550180435181,
"learning_rate": 0.00018909169555853743,
"loss": 0.0899561107158661,
"mean_token_accuracy": 0.9714486353099346,
"num_tokens": 6475062.0,
"step": 970
},
{
"entropy": 0.1026058561168611,
"epoch": 1.9492537313432836,
"grad_norm": 0.7642938494682312,
"learning_rate": 0.00018879115211523117,
"loss": 0.09649609923362731,
"mean_token_accuracy": 0.9703472301363945,
"num_tokens": 6542465.0,
"step": 980
},
{
"entropy": 0.09136548589449375,
"epoch": 1.9691542288557216,
"grad_norm": 0.3874703347682953,
"learning_rate": 0.0001884867700478641,
"loss": 0.09067035913467407,
"mean_token_accuracy": 0.9718083783984184,
"num_tokens": 6608985.0,
"step": 990
},
{
"entropy": 0.11761876428499818,
"epoch": 1.9890547263681593,
"grad_norm": 0.693695604801178,
"learning_rate": 0.00018817856251549867,
"loss": 0.09239903688430787,
"mean_token_accuracy": 0.9674227833747864,
"num_tokens": 6676885.0,
"step": 1000
},
{
"epoch": 2.0,
"eval_entropy": 0.13267684354209502,
"eval_loss": 0.24770455062389374,
"eval_mean_token_accuracy": 0.9410935246806347,
"eval_num_tokens": 6713972.0,
"eval_runtime": 67.3665,
"eval_samples_per_second": 15.364,
"eval_steps_per_second": 7.689,
"step": 1006
}
],
"logging_steps": 10,
"max_steps": 5030,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.3957721650888704e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}