Instructions to use codegenstudio/codegen-350M-text2sql-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use codegenstudio/codegen-350M-text2sql-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/kaggle/working/models/base/Salesforce__codegen-350M-multi") model = PeftModel.from_pretrained(base_model, "codegenstudio/codegen-350M-text2sql-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1006, | |
| "best_metric": 0.24770455062389374, | |
| "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/text2sql/checkpoint-1006", | |
| "epoch": 2.0, | |
| "eval_steps": 500, | |
| "global_step": 1006, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.1253886640071868, | |
| "epoch": 0.01990049751243781, | |
| "grad_norm": 2.338360548019409, | |
| "learning_rate": 7.142857142857143e-06, | |
| "loss": 1.4502812385559083, | |
| "mean_token_accuracy": 0.6671988122165203, | |
| "num_tokens": 68027.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.0893175967037678, | |
| "epoch": 0.03980099502487562, | |
| "grad_norm": 1.6519114971160889, | |
| "learning_rate": 1.5079365079365079e-05, | |
| "loss": 1.1673696517944336, | |
| "mean_token_accuracy": 0.698525931686163, | |
| "num_tokens": 135033.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.0583932913839817, | |
| "epoch": 0.05970149253731343, | |
| "grad_norm": 1.202163815498352, | |
| "learning_rate": 2.3015873015873015e-05, | |
| "loss": 1.0070637702941894, | |
| "mean_token_accuracy": 0.7307960025966167, | |
| "num_tokens": 201643.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.8722786333411932, | |
| "epoch": 0.07960199004975124, | |
| "grad_norm": 1.3554679155349731, | |
| "learning_rate": 3.095238095238095e-05, | |
| "loss": 0.749023151397705, | |
| "mean_token_accuracy": 0.8074305906891823, | |
| "num_tokens": 267572.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.6009022377431392, | |
| "epoch": 0.09950248756218906, | |
| "grad_norm": 1.4063202142715454, | |
| "learning_rate": 3.888888888888889e-05, | |
| "loss": 0.5123498916625977, | |
| "mean_token_accuracy": 0.8385950662195683, | |
| "num_tokens": 333673.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.4164533382281661, | |
| "epoch": 0.11940298507462686, | |
| "grad_norm": 1.8205658197402954, | |
| "learning_rate": 4.682539682539683e-05, | |
| "loss": 0.4625075340270996, | |
| "mean_token_accuracy": 0.8584991104900837, | |
| "num_tokens": 399397.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.4577839931473136, | |
| "epoch": 0.13930348258706468, | |
| "grad_norm": 1.393362283706665, | |
| "learning_rate": 5.4761904761904766e-05, | |
| "loss": 0.4174641609191895, | |
| "mean_token_accuracy": 0.8803921975195408, | |
| "num_tokens": 465864.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.41640141475945713, | |
| "epoch": 0.15920398009950248, | |
| "grad_norm": 2.2472920417785645, | |
| "learning_rate": 6.26984126984127e-05, | |
| "loss": 0.417645263671875, | |
| "mean_token_accuracy": 0.8779219165444374, | |
| "num_tokens": 534817.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.3839787464588881, | |
| "epoch": 0.1791044776119403, | |
| "grad_norm": 1.300377368927002, | |
| "learning_rate": 7.063492063492065e-05, | |
| "loss": 0.38586442470550536, | |
| "mean_token_accuracy": 0.8903462648391723, | |
| "num_tokens": 600614.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.3429916022345424, | |
| "epoch": 0.19900497512437812, | |
| "grad_norm": 1.5014147758483887, | |
| "learning_rate": 7.857142857142858e-05, | |
| "loss": 0.33204805850982666, | |
| "mean_token_accuracy": 0.9070690087974072, | |
| "num_tokens": 665888.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.36409866753965614, | |
| "epoch": 0.21890547263681592, | |
| "grad_norm": 1.417038083076477, | |
| "learning_rate": 8.650793650793651e-05, | |
| "loss": 0.3376448631286621, | |
| "mean_token_accuracy": 0.8962906174361706, | |
| "num_tokens": 732400.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.263674839399755, | |
| "epoch": 0.23880597014925373, | |
| "grad_norm": 1.2735201120376587, | |
| "learning_rate": 9.444444444444444e-05, | |
| "loss": 0.270894718170166, | |
| "mean_token_accuracy": 0.9201160937547683, | |
| "num_tokens": 799887.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.30584911033511164, | |
| "epoch": 0.25870646766169153, | |
| "grad_norm": 1.2719416618347168, | |
| "learning_rate": 0.00010238095238095237, | |
| "loss": 0.27406151294708253, | |
| "mean_token_accuracy": 0.9204320795834064, | |
| "num_tokens": 866147.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.28959042597562074, | |
| "epoch": 0.27860696517412936, | |
| "grad_norm": 2.2021138668060303, | |
| "learning_rate": 0.00011031746031746033, | |
| "loss": 0.32373068332672117, | |
| "mean_token_accuracy": 0.8983257927000523, | |
| "num_tokens": 933129.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.29785235710442065, | |
| "epoch": 0.29850746268656714, | |
| "grad_norm": 0.9740720987319946, | |
| "learning_rate": 0.00011825396825396826, | |
| "loss": 0.2523745775222778, | |
| "mean_token_accuracy": 0.9215191625058651, | |
| "num_tokens": 997739.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.28159743677824733, | |
| "epoch": 0.31840796019900497, | |
| "grad_norm": 1.025788426399231, | |
| "learning_rate": 0.0001261904761904762, | |
| "loss": 0.27993102073669435, | |
| "mean_token_accuracy": 0.9143906190991402, | |
| "num_tokens": 1064807.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.282751829456538, | |
| "epoch": 0.3383084577114428, | |
| "grad_norm": 1.149941086769104, | |
| "learning_rate": 0.00013412698412698412, | |
| "loss": 0.289961838722229, | |
| "mean_token_accuracy": 0.9160969875752926, | |
| "num_tokens": 1130310.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.30801400616765023, | |
| "epoch": 0.3582089552238806, | |
| "grad_norm": 1.1288280487060547, | |
| "learning_rate": 0.00014206349206349208, | |
| "loss": 0.2773977518081665, | |
| "mean_token_accuracy": 0.9185432456433773, | |
| "num_tokens": 1197192.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.24713189490139484, | |
| "epoch": 0.3781094527363184, | |
| "grad_norm": 0.9636886119842529, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 0.26672122478485105, | |
| "mean_token_accuracy": 0.9264318533241749, | |
| "num_tokens": 1263466.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.287679692171514, | |
| "epoch": 0.39800995024875624, | |
| "grad_norm": 1.137581467628479, | |
| "learning_rate": 0.00015793650793650795, | |
| "loss": 0.2587902069091797, | |
| "mean_token_accuracy": 0.9211024351418018, | |
| "num_tokens": 1330385.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.2620579367503524, | |
| "epoch": 0.417910447761194, | |
| "grad_norm": 1.3906782865524292, | |
| "learning_rate": 0.0001658730158730159, | |
| "loss": 0.25291283130645753, | |
| "mean_token_accuracy": 0.922594179213047, | |
| "num_tokens": 1399272.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.24558336716145276, | |
| "epoch": 0.43781094527363185, | |
| "grad_norm": 1.1515614986419678, | |
| "learning_rate": 0.00017380952380952383, | |
| "loss": 0.23645257949829102, | |
| "mean_token_accuracy": 0.9315326489508152, | |
| "num_tokens": 1466197.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.23100281171500683, | |
| "epoch": 0.4577114427860697, | |
| "grad_norm": 1.0060856342315674, | |
| "learning_rate": 0.00018174603174603177, | |
| "loss": 0.21004528999328614, | |
| "mean_token_accuracy": 0.9294509522616863, | |
| "num_tokens": 1533135.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.2551280764862895, | |
| "epoch": 0.47761194029850745, | |
| "grad_norm": 0.8229029178619385, | |
| "learning_rate": 0.0001896825396825397, | |
| "loss": 0.23107924461364746, | |
| "mean_token_accuracy": 0.9292825579643249, | |
| "num_tokens": 1600905.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.2424938028678298, | |
| "epoch": 0.4975124378109453, | |
| "grad_norm": 1.199968695640564, | |
| "learning_rate": 0.00019761904761904763, | |
| "loss": 0.25817849636077883, | |
| "mean_token_accuracy": 0.9277816534042358, | |
| "num_tokens": 1666956.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.27997240191325545, | |
| "epoch": 0.5174129353233831, | |
| "grad_norm": 0.6602728962898254, | |
| "learning_rate": 0.0001999989408126818, | |
| "loss": 0.25299272537231443, | |
| "mean_token_accuracy": 0.926287354528904, | |
| "num_tokens": 1734782.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.20782412360422314, | |
| "epoch": 0.5373134328358209, | |
| "grad_norm": 0.7651694416999817, | |
| "learning_rate": 0.0001999937530104439, | |
| "loss": 0.20403761863708497, | |
| "mean_token_accuracy": 0.9310354895889759, | |
| "num_tokens": 1800055.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.2172251005657017, | |
| "epoch": 0.5572139303482587, | |
| "grad_norm": 1.2643989324569702, | |
| "learning_rate": 0.00019998424227267588, | |
| "loss": 0.20663719177246093, | |
| "mean_token_accuracy": 0.9364220850169659, | |
| "num_tokens": 1866900.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.19974687648937106, | |
| "epoch": 0.5771144278606966, | |
| "grad_norm": 0.9468103051185608, | |
| "learning_rate": 0.00019997040901054646, | |
| "loss": 0.20071234703063964, | |
| "mean_token_accuracy": 0.9412682101130485, | |
| "num_tokens": 1934548.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.1886322578880936, | |
| "epoch": 0.5970149253731343, | |
| "grad_norm": 0.8480322360992432, | |
| "learning_rate": 0.000199952253822096, | |
| "loss": 0.18384914398193358, | |
| "mean_token_accuracy": 0.948433005809784, | |
| "num_tokens": 2001379.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.21811659364029765, | |
| "epoch": 0.6169154228855721, | |
| "grad_norm": 0.8029792308807373, | |
| "learning_rate": 0.00019992977749221064, | |
| "loss": 0.20460138320922852, | |
| "mean_token_accuracy": 0.9401800245046615, | |
| "num_tokens": 2070001.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.18392337979748846, | |
| "epoch": 0.6368159203980099, | |
| "grad_norm": 0.8735001087188721, | |
| "learning_rate": 0.0001999029809925883, | |
| "loss": 0.17823137044906617, | |
| "mean_token_accuracy": 0.9488276831805706, | |
| "num_tokens": 2135350.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.18473064368590714, | |
| "epoch": 0.6567164179104478, | |
| "grad_norm": 0.7449737787246704, | |
| "learning_rate": 0.00019987186548169682, | |
| "loss": 0.16862742900848388, | |
| "mean_token_accuracy": 0.9462769009172917, | |
| "num_tokens": 2203472.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.16661408836953343, | |
| "epoch": 0.6766169154228856, | |
| "grad_norm": 0.8586801290512085, | |
| "learning_rate": 0.0001998364323047236, | |
| "loss": 0.16848835945129395, | |
| "mean_token_accuracy": 0.9531193666160107, | |
| "num_tokens": 2269601.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.1743609025143087, | |
| "epoch": 0.6965174129353234, | |
| "grad_norm": 0.7884849309921265, | |
| "learning_rate": 0.00019979668299351783, | |
| "loss": 0.17167186737060547, | |
| "mean_token_accuracy": 0.9482224509119987, | |
| "num_tokens": 2335815.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.1952204409521073, | |
| "epoch": 0.7164179104477612, | |
| "grad_norm": 0.941378116607666, | |
| "learning_rate": 0.00019975261926652392, | |
| "loss": 0.18604878187179566, | |
| "mean_token_accuracy": 0.942904282361269, | |
| "num_tokens": 2404130.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.19471225845627488, | |
| "epoch": 0.736318407960199, | |
| "grad_norm": 0.7770227789878845, | |
| "learning_rate": 0.00019970424302870739, | |
| "loss": 0.1847616672515869, | |
| "mean_token_accuracy": 0.9433550946414471, | |
| "num_tokens": 2470744.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.19339222041890025, | |
| "epoch": 0.7562189054726368, | |
| "grad_norm": 1.1318728923797607, | |
| "learning_rate": 0.00019965155637147243, | |
| "loss": 0.18451868295669555, | |
| "mean_token_accuracy": 0.9457193531095982, | |
| "num_tokens": 2537581.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.17824228820391, | |
| "epoch": 0.7761194029850746, | |
| "grad_norm": 0.8256890773773193, | |
| "learning_rate": 0.0001995945615725716, | |
| "loss": 0.17818082571029664, | |
| "mean_token_accuracy": 0.9509255833923816, | |
| "num_tokens": 2604045.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.17659657467156648, | |
| "epoch": 0.7960199004975125, | |
| "grad_norm": 0.7419007420539856, | |
| "learning_rate": 0.00019953326109600728, | |
| "loss": 0.15658079385757445, | |
| "mean_token_accuracy": 0.9504644252359867, | |
| "num_tokens": 2669475.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.16667078505270183, | |
| "epoch": 0.8159203980099502, | |
| "grad_norm": 0.8381772041320801, | |
| "learning_rate": 0.00019946765759192497, | |
| "loss": 0.16461316347122193, | |
| "mean_token_accuracy": 0.9532247520983219, | |
| "num_tokens": 2735709.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.1525796527042985, | |
| "epoch": 0.835820895522388, | |
| "grad_norm": 0.7996618747711182, | |
| "learning_rate": 0.00019939775389649916, | |
| "loss": 0.15512030124664306, | |
| "mean_token_accuracy": 0.9544322639703751, | |
| "num_tokens": 2804586.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.16498080925084652, | |
| "epoch": 0.8557213930348259, | |
| "grad_norm": 0.6151495575904846, | |
| "learning_rate": 0.00019932355303181026, | |
| "loss": 0.1559414744377136, | |
| "mean_token_accuracy": 0.956156824529171, | |
| "num_tokens": 2871824.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.20550905396230518, | |
| "epoch": 0.8756218905472637, | |
| "grad_norm": 0.7512227892875671, | |
| "learning_rate": 0.00019924505820571425, | |
| "loss": 0.17734644412994385, | |
| "mean_token_accuracy": 0.9471527449786663, | |
| "num_tokens": 2937826.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.1697809119708836, | |
| "epoch": 0.8955223880597015, | |
| "grad_norm": 0.762320339679718, | |
| "learning_rate": 0.0001991622728117038, | |
| "loss": 0.15445693731307983, | |
| "mean_token_accuracy": 0.9543316774070263, | |
| "num_tokens": 3006135.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.17613516801502554, | |
| "epoch": 0.9154228855721394, | |
| "grad_norm": 0.6466898918151855, | |
| "learning_rate": 0.00019907520042876172, | |
| "loss": 0.16953592300415038, | |
| "mean_token_accuracy": 0.950883662700653, | |
| "num_tokens": 3073150.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.15535307771060616, | |
| "epoch": 0.9353233830845771, | |
| "grad_norm": 1.1007940769195557, | |
| "learning_rate": 0.00019898384482120614, | |
| "loss": 0.15585366487503052, | |
| "mean_token_accuracy": 0.9595168434083462, | |
| "num_tokens": 3138638.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.1557972011389211, | |
| "epoch": 0.9552238805970149, | |
| "grad_norm": 0.6533820629119873, | |
| "learning_rate": 0.0001988882099385278, | |
| "loss": 0.15293551683425904, | |
| "mean_token_accuracy": 0.9572585269808769, | |
| "num_tokens": 3206372.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.13091885023750366, | |
| "epoch": 0.9751243781094527, | |
| "grad_norm": 0.5975553393363953, | |
| "learning_rate": 0.00019878829991521935, | |
| "loss": 0.1253079891204834, | |
| "mean_token_accuracy": 0.9635655723512173, | |
| "num_tokens": 3274281.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.1669132244773209, | |
| "epoch": 0.9950248756218906, | |
| "grad_norm": 0.8513726592063904, | |
| "learning_rate": 0.00019868411907059645, | |
| "loss": 0.17081425189971924, | |
| "mean_token_accuracy": 0.9505244322121144, | |
| "num_tokens": 3340159.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_entropy": 0.23721536022024842, | |
| "eval_loss": 0.24836121499538422, | |
| "eval_mean_token_accuracy": 0.9339753162676764, | |
| "eval_num_tokens": 3356986.0, | |
| "eval_runtime": 67.6123, | |
| "eval_samples_per_second": 15.308, | |
| "eval_steps_per_second": 7.661, | |
| "step": 503 | |
| }, | |
| { | |
| "entropy": 0.1568159531605871, | |
| "epoch": 1.0139303482587065, | |
| "grad_norm": 0.5372758507728577, | |
| "learning_rate": 0.00019857567190861126, | |
| "loss": 0.1242946743965149, | |
| "mean_token_accuracy": 0.9635580613424903, | |
| "num_tokens": 3404334.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.1316974400077015, | |
| "epoch": 1.0338308457711443, | |
| "grad_norm": 0.7160713076591492, | |
| "learning_rate": 0.00019846296311765754, | |
| "loss": 0.1351562261581421, | |
| "mean_token_accuracy": 0.9581282936036587, | |
| "num_tokens": 3471525.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.14656153018586338, | |
| "epoch": 1.053731343283582, | |
| "grad_norm": 0.5991392731666565, | |
| "learning_rate": 0.00019834599757036803, | |
| "loss": 0.12300963401794433, | |
| "mean_token_accuracy": 0.9646149106323719, | |
| "num_tokens": 3538338.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.15197489713318646, | |
| "epoch": 1.07363184079602, | |
| "grad_norm": 0.9330605864524841, | |
| "learning_rate": 0.00019822478032340387, | |
| "loss": 0.12765015363693238, | |
| "mean_token_accuracy": 0.9586149267852306, | |
| "num_tokens": 3606642.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.11335502485744656, | |
| "epoch": 1.0935323383084576, | |
| "grad_norm": 0.8762836456298828, | |
| "learning_rate": 0.0001980993166172358, | |
| "loss": 0.11172252893447876, | |
| "mean_token_accuracy": 0.9656657867133618, | |
| "num_tokens": 3674420.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.12588824331760406, | |
| "epoch": 1.1134328358208956, | |
| "grad_norm": 0.8866952061653137, | |
| "learning_rate": 0.00019796961187591781, | |
| "loss": 0.10862302780151367, | |
| "mean_token_accuracy": 0.9648959740996361, | |
| "num_tokens": 3741381.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.11430091026704758, | |
| "epoch": 1.1333333333333333, | |
| "grad_norm": 0.6481871604919434, | |
| "learning_rate": 0.00019783567170685262, | |
| "loss": 0.11582423448562622, | |
| "mean_token_accuracy": 0.9628987669944763, | |
| "num_tokens": 3808318.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.11517859897576273, | |
| "epoch": 1.153233830845771, | |
| "grad_norm": 0.5650383234024048, | |
| "learning_rate": 0.00019769750190054905, | |
| "loss": 0.1037294864654541, | |
| "mean_token_accuracy": 0.9702431283891201, | |
| "num_tokens": 3874410.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.10291576159652323, | |
| "epoch": 1.173134328358209, | |
| "grad_norm": 0.5433067083358765, | |
| "learning_rate": 0.00019755510843037191, | |
| "loss": 0.10045719146728516, | |
| "mean_token_accuracy": 0.9618785113096238, | |
| "num_tokens": 3941134.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.11075262987287715, | |
| "epoch": 1.1930348258706467, | |
| "grad_norm": 0.7597805261611938, | |
| "learning_rate": 0.00019740849745228367, | |
| "loss": 0.12216674089431763, | |
| "mean_token_accuracy": 0.9657749280333519, | |
| "num_tokens": 4008097.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.12675938094034792, | |
| "epoch": 1.2129353233830846, | |
| "grad_norm": 0.6820019483566284, | |
| "learning_rate": 0.00019725767530457837, | |
| "loss": 0.11509623527526855, | |
| "mean_token_accuracy": 0.9657132118940354, | |
| "num_tokens": 4073570.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.13302950132638217, | |
| "epoch": 1.2328358208955223, | |
| "grad_norm": 0.5021085739135742, | |
| "learning_rate": 0.00019710264850760756, | |
| "loss": 0.10812582969665527, | |
| "mean_token_accuracy": 0.9639534369111061, | |
| "num_tokens": 4140207.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.12266454068012536, | |
| "epoch": 1.25273631840796, | |
| "grad_norm": 0.7293747067451477, | |
| "learning_rate": 0.00019694342376349835, | |
| "loss": 0.12314709424972534, | |
| "mean_token_accuracy": 0.9629024133086205, | |
| "num_tokens": 4206997.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.12240176484920084, | |
| "epoch": 1.272636815920398, | |
| "grad_norm": 0.9365243911743164, | |
| "learning_rate": 0.00019678000795586386, | |
| "loss": 0.117351496219635, | |
| "mean_token_accuracy": 0.96337865665555, | |
| "num_tokens": 4277152.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.11147555778734386, | |
| "epoch": 1.292537313432836, | |
| "grad_norm": 0.7311879396438599, | |
| "learning_rate": 0.00019661240814950536, | |
| "loss": 0.11279709339141845, | |
| "mean_token_accuracy": 0.9658049061894417, | |
| "num_tokens": 4344652.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.11891384413465858, | |
| "epoch": 1.3124378109452737, | |
| "grad_norm": 0.6283079981803894, | |
| "learning_rate": 0.00019644063159010716, | |
| "loss": 0.09745638966560363, | |
| "mean_token_accuracy": 0.9698325954377651, | |
| "num_tokens": 4411916.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.12134865028783678, | |
| "epoch": 1.3323383084577114, | |
| "grad_norm": 0.6160532832145691, | |
| "learning_rate": 0.00019626468570392298, | |
| "loss": 0.1158707618713379, | |
| "mean_token_accuracy": 0.9658548943698406, | |
| "num_tokens": 4478621.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.10654389052651822, | |
| "epoch": 1.3522388059701491, | |
| "grad_norm": 0.43357354402542114, | |
| "learning_rate": 0.00019608457809745537, | |
| "loss": 0.09168269634246826, | |
| "mean_token_accuracy": 0.9723479963839055, | |
| "num_tokens": 4544168.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.109538364992477, | |
| "epoch": 1.372139303482587, | |
| "grad_norm": 0.7618773579597473, | |
| "learning_rate": 0.00019590031655712631, | |
| "loss": 0.11080507040023804, | |
| "mean_token_accuracy": 0.9682544745504856, | |
| "num_tokens": 4610518.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.11043523394037039, | |
| "epoch": 1.392039800995025, | |
| "grad_norm": 0.8631065487861633, | |
| "learning_rate": 0.00019571190904894115, | |
| "loss": 0.09991470575332642, | |
| "mean_token_accuracy": 0.9694355696439743, | |
| "num_tokens": 4676248.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.1043223840300925, | |
| "epoch": 1.4119402985074627, | |
| "grad_norm": 1.0989038944244385, | |
| "learning_rate": 0.00019551936371814375, | |
| "loss": 0.10194973945617676, | |
| "mean_token_accuracy": 0.9693835198879241, | |
| "num_tokens": 4742628.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.10138569427654147, | |
| "epoch": 1.4318407960199004, | |
| "grad_norm": 0.9169466495513916, | |
| "learning_rate": 0.0001953226888888647, | |
| "loss": 0.10495258569717407, | |
| "mean_token_accuracy": 0.970366296172142, | |
| "num_tokens": 4809419.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.11472290018573403, | |
| "epoch": 1.4517412935323384, | |
| "grad_norm": 0.49399080872535706, | |
| "learning_rate": 0.00019512189306376118, | |
| "loss": 0.11099306344985962, | |
| "mean_token_accuracy": 0.9688441671431065, | |
| "num_tokens": 4877119.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.11205615981016308, | |
| "epoch": 1.471641791044776, | |
| "grad_norm": 0.61200350522995, | |
| "learning_rate": 0.0001949169849236496, | |
| "loss": 0.10629711151123047, | |
| "mean_token_accuracy": 0.966337724775076, | |
| "num_tokens": 4944433.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.11642576553858816, | |
| "epoch": 1.491542288557214, | |
| "grad_norm": 0.6224406361579895, | |
| "learning_rate": 0.00019470797332713012, | |
| "loss": 0.11089148521423339, | |
| "mean_token_accuracy": 0.9659203454852104, | |
| "num_tokens": 5011634.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.11514911148697138, | |
| "epoch": 1.5114427860696518, | |
| "grad_norm": 0.7650023698806763, | |
| "learning_rate": 0.0001944948673102038, | |
| "loss": 0.10163601636886596, | |
| "mean_token_accuracy": 0.9675627797842026, | |
| "num_tokens": 5077156.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.10764023282099515, | |
| "epoch": 1.5313432835820895, | |
| "grad_norm": 0.49794143438339233, | |
| "learning_rate": 0.00019427767608588183, | |
| "loss": 0.098751300573349, | |
| "mean_token_accuracy": 0.9677646860480309, | |
| "num_tokens": 5143991.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.1094623792450875, | |
| "epoch": 1.5512437810945272, | |
| "grad_norm": 0.6449922323226929, | |
| "learning_rate": 0.0001940564090437875, | |
| "loss": 0.11413514614105225, | |
| "mean_token_accuracy": 0.9680206254124641, | |
| "num_tokens": 5211604.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.12053416313137859, | |
| "epoch": 1.5711442786069652, | |
| "grad_norm": 0.8340095281600952, | |
| "learning_rate": 0.00019383107574974984, | |
| "loss": 0.10809429883956909, | |
| "mean_token_accuracy": 0.9674052610993386, | |
| "num_tokens": 5277697.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.10000467539066449, | |
| "epoch": 1.591044776119403, | |
| "grad_norm": 0.7644860744476318, | |
| "learning_rate": 0.00019360168594539055, | |
| "loss": 0.08709208965301514, | |
| "mean_token_accuracy": 0.9731013409793376, | |
| "num_tokens": 5342978.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.10800170768052339, | |
| "epoch": 1.6109452736318408, | |
| "grad_norm": 0.6640422344207764, | |
| "learning_rate": 0.0001933682495477024, | |
| "loss": 0.09788179397583008, | |
| "mean_token_accuracy": 0.9665102422237396, | |
| "num_tokens": 5410289.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.10117872587870806, | |
| "epoch": 1.6308457711442785, | |
| "grad_norm": 0.6755411624908447, | |
| "learning_rate": 0.00019313077664862092, | |
| "loss": 0.09605536460876465, | |
| "mean_token_accuracy": 0.972070074826479, | |
| "num_tokens": 5475880.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.1069639899302274, | |
| "epoch": 1.6507462686567163, | |
| "grad_norm": 0.890627384185791, | |
| "learning_rate": 0.00019288927751458766, | |
| "loss": 0.10400503873825073, | |
| "mean_token_accuracy": 0.9711074873805046, | |
| "num_tokens": 5541606.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.11311845399904996, | |
| "epoch": 1.6706467661691542, | |
| "grad_norm": 0.5509929656982422, | |
| "learning_rate": 0.0001926437625861068, | |
| "loss": 0.10754516124725341, | |
| "mean_token_accuracy": 0.9695759303867817, | |
| "num_tokens": 5608065.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.12085098770912736, | |
| "epoch": 1.6905472636815921, | |
| "grad_norm": 0.6879218816757202, | |
| "learning_rate": 0.00019239424247729345, | |
| "loss": 0.12257307767868042, | |
| "mean_token_accuracy": 0.9648775070905685, | |
| "num_tokens": 5674308.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.11081431191414595, | |
| "epoch": 1.7104477611940299, | |
| "grad_norm": 0.4920276999473572, | |
| "learning_rate": 0.0001921407279754149, | |
| "loss": 0.10849488973617553, | |
| "mean_token_accuracy": 0.9698534436523915, | |
| "num_tokens": 5742414.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.0929627066012472, | |
| "epoch": 1.7303482587064676, | |
| "grad_norm": 0.7228904366493225, | |
| "learning_rate": 0.00019188323004042435, | |
| "loss": 0.0802489161491394, | |
| "mean_token_accuracy": 0.9730034552514553, | |
| "num_tokens": 5809827.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.0936126358807087, | |
| "epoch": 1.7502487562189055, | |
| "grad_norm": 0.6558980345726013, | |
| "learning_rate": 0.00019162175980448688, | |
| "loss": 0.1109757661819458, | |
| "mean_token_accuracy": 0.9671767763793468, | |
| "num_tokens": 5875172.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.11744439310859889, | |
| "epoch": 1.7701492537313432, | |
| "grad_norm": 0.5792869925498962, | |
| "learning_rate": 0.0001913563285714984, | |
| "loss": 0.09240159988403321, | |
| "mean_token_accuracy": 0.9710902646183968, | |
| "num_tokens": 5942033.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.10555630044545979, | |
| "epoch": 1.7900497512437812, | |
| "grad_norm": 0.8990387320518494, | |
| "learning_rate": 0.0001910869478165969, | |
| "loss": 0.12259334325790405, | |
| "mean_token_accuracy": 0.9644198954105377, | |
| "num_tokens": 6007977.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.10993905747309327, | |
| "epoch": 1.809950248756219, | |
| "grad_norm": 0.7768874168395996, | |
| "learning_rate": 0.00019081362918566618, | |
| "loss": 0.10547571182250977, | |
| "mean_token_accuracy": 0.9728645481169224, | |
| "num_tokens": 6074057.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.10362131035653874, | |
| "epoch": 1.8298507462686566, | |
| "grad_norm": 0.4525396525859833, | |
| "learning_rate": 0.00019053638449483259, | |
| "loss": 0.10611696243286133, | |
| "mean_token_accuracy": 0.9724654078483581, | |
| "num_tokens": 6141345.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.11784212745260447, | |
| "epoch": 1.8497512437810946, | |
| "grad_norm": 0.7492642998695374, | |
| "learning_rate": 0.0001902552257299542, | |
| "loss": 0.11176036596298218, | |
| "mean_token_accuracy": 0.9628825642168521, | |
| "num_tokens": 6209124.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.11072989953681826, | |
| "epoch": 1.8696517412935323, | |
| "grad_norm": 0.5748555064201355, | |
| "learning_rate": 0.00018997016504610246, | |
| "loss": 0.10774084329605102, | |
| "mean_token_accuracy": 0.9646185263991356, | |
| "num_tokens": 6276485.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.10556984411086887, | |
| "epoch": 1.8895522388059702, | |
| "grad_norm": 0.5937514305114746, | |
| "learning_rate": 0.00018968121476703678, | |
| "loss": 0.08848418593406678, | |
| "mean_token_accuracy": 0.9734670996665955, | |
| "num_tokens": 6342957.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.09428299731807784, | |
| "epoch": 1.909452736318408, | |
| "grad_norm": 1.0715358257293701, | |
| "learning_rate": 0.00018938838738467184, | |
| "loss": 0.10269320011138916, | |
| "mean_token_accuracy": 0.9720249362289906, | |
| "num_tokens": 6408918.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.10850229405332357, | |
| "epoch": 1.9293532338308457, | |
| "grad_norm": 0.5169550180435181, | |
| "learning_rate": 0.00018909169555853743, | |
| "loss": 0.0899561107158661, | |
| "mean_token_accuracy": 0.9714486353099346, | |
| "num_tokens": 6475062.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.1026058561168611, | |
| "epoch": 1.9492537313432836, | |
| "grad_norm": 0.7642938494682312, | |
| "learning_rate": 0.00018879115211523117, | |
| "loss": 0.09649609923362731, | |
| "mean_token_accuracy": 0.9703472301363945, | |
| "num_tokens": 6542465.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.09136548589449375, | |
| "epoch": 1.9691542288557216, | |
| "grad_norm": 0.3874703347682953, | |
| "learning_rate": 0.0001884867700478641, | |
| "loss": 0.09067035913467407, | |
| "mean_token_accuracy": 0.9718083783984184, | |
| "num_tokens": 6608985.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.11761876428499818, | |
| "epoch": 1.9890547263681593, | |
| "grad_norm": 0.693695604801178, | |
| "learning_rate": 0.00018817856251549867, | |
| "loss": 0.09239903688430787, | |
| "mean_token_accuracy": 0.9674227833747864, | |
| "num_tokens": 6676885.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_entropy": 0.13267684354209502, | |
| "eval_loss": 0.24770455062389374, | |
| "eval_mean_token_accuracy": 0.9410935246806347, | |
| "eval_num_tokens": 6713972.0, | |
| "eval_runtime": 67.3665, | |
| "eval_samples_per_second": 15.364, | |
| "eval_steps_per_second": 7.689, | |
| "step": 1006 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5030, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3957721650888704e+16, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |