Instructions to use codegenstudio/codegen-350M-text2sql-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use codegenstudio/codegen-350M-text2sql-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/kaggle/working/models/base/Salesforce__codegen-350M-multi") model = PeftModel.from_pretrained(base_model, "codegenstudio/codegen-350M-text2sql-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "task": "text2sql", | |
| "model_name": "Salesforce/codegen-350M-multi", | |
| "device": "cuda:0", | |
| "checkpoint_run": "v4", | |
| "adapter_path": "/kaggle/working/models/checkpoints/v4/text2sql", | |
| "train_rows": 8040, | |
| "eval_rows": 1035, | |
| "train_loss": 0.10587940257242612, | |
| "eval_loss": 0.24770455062389374, | |
| "best_eval_loss": 0.24770455062389374, | |
| "train_runtime_seconds": 8534.0451, | |
| "mlflow_run_id": null, | |
| "filter_stats": { | |
| "input_rows": 8040, | |
| "kept_rows": 8040, | |
| "skipped_rows": 0, | |
| "skip_reasons": {} | |
| }, | |
| "token_stats": { | |
| "rows": 8040, | |
| "avg_prompt_tokens": 377.37, | |
| "avg_target_tokens": 39.17, | |
| "avg_total_tokens": 416.54, | |
| "max_total_tokens": 1098, | |
| "skipped_too_long_target": 0, | |
| "skipped_too_long_prompt": 0 | |
| }, | |
| "log_history": [ | |
| { | |
| "loss": 1.4502812385559083, | |
| "grad_norm": 2.338360548019409, | |
| "learning_rate": 7.142857142857143e-06, | |
| "entropy": 1.1253886640071868, | |
| "num_tokens": 68027.0, | |
| "mean_token_accuracy": 0.6671988122165203, | |
| "epoch": 0.01990049751243781, | |
| "step": 10 | |
| }, | |
| { | |
| "loss": 1.1673696517944336, | |
| "grad_norm": 1.6519114971160889, | |
| "learning_rate": 1.5079365079365079e-05, | |
| "entropy": 1.0893175967037678, | |
| "num_tokens": 135033.0, | |
| "mean_token_accuracy": 0.698525931686163, | |
| "epoch": 0.03980099502487562, | |
| "step": 20 | |
| }, | |
| { | |
| "loss": 1.0070637702941894, | |
| "grad_norm": 1.202163815498352, | |
| "learning_rate": 2.3015873015873015e-05, | |
| "entropy": 1.0583932913839817, | |
| "num_tokens": 201643.0, | |
| "mean_token_accuracy": 0.7307960025966167, | |
| "epoch": 0.05970149253731343, | |
| "step": 30 | |
| }, | |
| { | |
| "loss": 0.749023151397705, | |
| "grad_norm": 1.3554679155349731, | |
| "learning_rate": 3.095238095238095e-05, | |
| "entropy": 0.8722786333411932, | |
| "num_tokens": 267572.0, | |
| "mean_token_accuracy": 0.8074305906891823, | |
| "epoch": 0.07960199004975124, | |
| "step": 40 | |
| }, | |
| { | |
| "loss": 0.5123498916625977, | |
| "grad_norm": 1.4063202142715454, | |
| "learning_rate": 3.888888888888889e-05, | |
| "entropy": 0.6009022377431392, | |
| "num_tokens": 333673.0, | |
| "mean_token_accuracy": 0.8385950662195683, | |
| "epoch": 0.09950248756218906, | |
| "step": 50 | |
| }, | |
| { | |
| "loss": 0.4625075340270996, | |
| "grad_norm": 1.8205658197402954, | |
| "learning_rate": 4.682539682539683e-05, | |
| "entropy": 0.4164533382281661, | |
| "num_tokens": 399397.0, | |
| "mean_token_accuracy": 0.8584991104900837, | |
| "epoch": 0.11940298507462686, | |
| "step": 60 | |
| }, | |
| { | |
| "loss": 0.4174641609191895, | |
| "grad_norm": 1.393362283706665, | |
| "learning_rate": 5.4761904761904766e-05, | |
| "entropy": 0.4577839931473136, | |
| "num_tokens": 465864.0, | |
| "mean_token_accuracy": 0.8803921975195408, | |
| "epoch": 0.13930348258706468, | |
| "step": 70 | |
| }, | |
| { | |
| "loss": 0.417645263671875, | |
| "grad_norm": 2.2472920417785645, | |
| "learning_rate": 6.26984126984127e-05, | |
| "entropy": 0.41640141475945713, | |
| "num_tokens": 534817.0, | |
| "mean_token_accuracy": 0.8779219165444374, | |
| "epoch": 0.15920398009950248, | |
| "step": 80 | |
| }, | |
| { | |
| "loss": 0.38586442470550536, | |
| "grad_norm": 1.300377368927002, | |
| "learning_rate": 7.063492063492065e-05, | |
| "entropy": 0.3839787464588881, | |
| "num_tokens": 600614.0, | |
| "mean_token_accuracy": 0.8903462648391723, | |
| "epoch": 0.1791044776119403, | |
| "step": 90 | |
| }, | |
| { | |
| "loss": 0.33204805850982666, | |
| "grad_norm": 1.5014147758483887, | |
| "learning_rate": 7.857142857142858e-05, | |
| "entropy": 0.3429916022345424, | |
| "num_tokens": 665888.0, | |
| "mean_token_accuracy": 0.9070690087974072, | |
| "epoch": 0.19900497512437812, | |
| "step": 100 | |
| }, | |
| { | |
| "loss": 0.3376448631286621, | |
| "grad_norm": 1.417038083076477, | |
| "learning_rate": 8.650793650793651e-05, | |
| "entropy": 0.36409866753965614, | |
| "num_tokens": 732400.0, | |
| "mean_token_accuracy": 0.8962906174361706, | |
| "epoch": 0.21890547263681592, | |
| "step": 110 | |
| }, | |
| { | |
| "loss": 0.270894718170166, | |
| "grad_norm": 1.2735201120376587, | |
| "learning_rate": 9.444444444444444e-05, | |
| "entropy": 0.263674839399755, | |
| "num_tokens": 799887.0, | |
| "mean_token_accuracy": 0.9201160937547683, | |
| "epoch": 0.23880597014925373, | |
| "step": 120 | |
| }, | |
| { | |
| "loss": 0.27406151294708253, | |
| "grad_norm": 1.2719416618347168, | |
| "learning_rate": 0.00010238095238095237, | |
| "entropy": 0.30584911033511164, | |
| "num_tokens": 866147.0, | |
| "mean_token_accuracy": 0.9204320795834064, | |
| "epoch": 0.25870646766169153, | |
| "step": 130 | |
| }, | |
| { | |
| "loss": 0.32373068332672117, | |
| "grad_norm": 2.2021138668060303, | |
| "learning_rate": 0.00011031746031746033, | |
| "entropy": 0.28959042597562074, | |
| "num_tokens": 933129.0, | |
| "mean_token_accuracy": 0.8983257927000523, | |
| "epoch": 0.27860696517412936, | |
| "step": 140 | |
| }, | |
| { | |
| "loss": 0.2523745775222778, | |
| "grad_norm": 0.9740720987319946, | |
| "learning_rate": 0.00011825396825396826, | |
| "entropy": 0.29785235710442065, | |
| "num_tokens": 997739.0, | |
| "mean_token_accuracy": 0.9215191625058651, | |
| "epoch": 0.29850746268656714, | |
| "step": 150 | |
| }, | |
| { | |
| "loss": 0.27993102073669435, | |
| "grad_norm": 1.025788426399231, | |
| "learning_rate": 0.0001261904761904762, | |
| "entropy": 0.28159743677824733, | |
| "num_tokens": 1064807.0, | |
| "mean_token_accuracy": 0.9143906190991402, | |
| "epoch": 0.31840796019900497, | |
| "step": 160 | |
| }, | |
| { | |
| "loss": 0.289961838722229, | |
| "grad_norm": 1.149941086769104, | |
| "learning_rate": 0.00013412698412698412, | |
| "entropy": 0.282751829456538, | |
| "num_tokens": 1130310.0, | |
| "mean_token_accuracy": 0.9160969875752926, | |
| "epoch": 0.3383084577114428, | |
| "step": 170 | |
| }, | |
| { | |
| "loss": 0.2773977518081665, | |
| "grad_norm": 1.1288280487060547, | |
| "learning_rate": 0.00014206349206349208, | |
| "entropy": 0.30801400616765023, | |
| "num_tokens": 1197192.0, | |
| "mean_token_accuracy": 0.9185432456433773, | |
| "epoch": 0.3582089552238806, | |
| "step": 180 | |
| }, | |
| { | |
| "loss": 0.26672122478485105, | |
| "grad_norm": 0.9636886119842529, | |
| "learning_rate": 0.00015000000000000001, | |
| "entropy": 0.24713189490139484, | |
| "num_tokens": 1263466.0, | |
| "mean_token_accuracy": 0.9264318533241749, | |
| "epoch": 0.3781094527363184, | |
| "step": 190 | |
| }, | |
| { | |
| "loss": 0.2587902069091797, | |
| "grad_norm": 1.137581467628479, | |
| "learning_rate": 0.00015793650793650795, | |
| "entropy": 0.287679692171514, | |
| "num_tokens": 1330385.0, | |
| "mean_token_accuracy": 0.9211024351418018, | |
| "epoch": 0.39800995024875624, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 0.25291283130645753, | |
| "grad_norm": 1.3906782865524292, | |
| "learning_rate": 0.0001658730158730159, | |
| "entropy": 0.2620579367503524, | |
| "num_tokens": 1399272.0, | |
| "mean_token_accuracy": 0.922594179213047, | |
| "epoch": 0.417910447761194, | |
| "step": 210 | |
| }, | |
| { | |
| "loss": 0.23645257949829102, | |
| "grad_norm": 1.1515614986419678, | |
| "learning_rate": 0.00017380952380952383, | |
| "entropy": 0.24558336716145276, | |
| "num_tokens": 1466197.0, | |
| "mean_token_accuracy": 0.9315326489508152, | |
| "epoch": 0.43781094527363185, | |
| "step": 220 | |
| }, | |
| { | |
| "loss": 0.21004528999328614, | |
| "grad_norm": 1.0060856342315674, | |
| "learning_rate": 0.00018174603174603177, | |
| "entropy": 0.23100281171500683, | |
| "num_tokens": 1533135.0, | |
| "mean_token_accuracy": 0.9294509522616863, | |
| "epoch": 0.4577114427860697, | |
| "step": 230 | |
| }, | |
| { | |
| "loss": 0.23107924461364746, | |
| "grad_norm": 0.8229029178619385, | |
| "learning_rate": 0.0001896825396825397, | |
| "entropy": 0.2551280764862895, | |
| "num_tokens": 1600905.0, | |
| "mean_token_accuracy": 0.9292825579643249, | |
| "epoch": 0.47761194029850745, | |
| "step": 240 | |
| }, | |
| { | |
| "loss": 0.25817849636077883, | |
| "grad_norm": 1.199968695640564, | |
| "learning_rate": 0.00019761904761904763, | |
| "entropy": 0.2424938028678298, | |
| "num_tokens": 1666956.0, | |
| "mean_token_accuracy": 0.9277816534042358, | |
| "epoch": 0.4975124378109453, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 0.25299272537231443, | |
| "grad_norm": 0.6602728962898254, | |
| "learning_rate": 0.0001999989408126818, | |
| "entropy": 0.27997240191325545, | |
| "num_tokens": 1734782.0, | |
| "mean_token_accuracy": 0.926287354528904, | |
| "epoch": 0.5174129353233831, | |
| "step": 260 | |
| }, | |
| { | |
| "loss": 0.20403761863708497, | |
| "grad_norm": 0.7651694416999817, | |
| "learning_rate": 0.0001999937530104439, | |
| "entropy": 0.20782412360422314, | |
| "num_tokens": 1800055.0, | |
| "mean_token_accuracy": 0.9310354895889759, | |
| "epoch": 0.5373134328358209, | |
| "step": 270 | |
| }, | |
| { | |
| "loss": 0.20663719177246093, | |
| "grad_norm": 1.2643989324569702, | |
| "learning_rate": 0.00019998424227267588, | |
| "entropy": 0.2172251005657017, | |
| "num_tokens": 1866900.0, | |
| "mean_token_accuracy": 0.9364220850169659, | |
| "epoch": 0.5572139303482587, | |
| "step": 280 | |
| }, | |
| { | |
| "loss": 0.20071234703063964, | |
| "grad_norm": 0.9468103051185608, | |
| "learning_rate": 0.00019997040901054646, | |
| "entropy": 0.19974687648937106, | |
| "num_tokens": 1934548.0, | |
| "mean_token_accuracy": 0.9412682101130485, | |
| "epoch": 0.5771144278606966, | |
| "step": 290 | |
| }, | |
| { | |
| "loss": 0.18384914398193358, | |
| "grad_norm": 0.8480322360992432, | |
| "learning_rate": 0.000199952253822096, | |
| "entropy": 0.1886322578880936, | |
| "num_tokens": 2001379.0, | |
| "mean_token_accuracy": 0.948433005809784, | |
| "epoch": 0.5970149253731343, | |
| "step": 300 | |
| }, | |
| { | |
| "loss": 0.20460138320922852, | |
| "grad_norm": 0.8029792308807373, | |
| "learning_rate": 0.00019992977749221064, | |
| "entropy": 0.21811659364029765, | |
| "num_tokens": 2070001.0, | |
| "mean_token_accuracy": 0.9401800245046615, | |
| "epoch": 0.6169154228855721, | |
| "step": 310 | |
| }, | |
| { | |
| "loss": 0.17823137044906617, | |
| "grad_norm": 0.8735001087188721, | |
| "learning_rate": 0.0001999029809925883, | |
| "entropy": 0.18392337979748846, | |
| "num_tokens": 2135350.0, | |
| "mean_token_accuracy": 0.9488276831805706, | |
| "epoch": 0.6368159203980099, | |
| "step": 320 | |
| }, | |
| { | |
| "loss": 0.16862742900848388, | |
| "grad_norm": 0.7449737787246704, | |
| "learning_rate": 0.00019987186548169682, | |
| "entropy": 0.18473064368590714, | |
| "num_tokens": 2203472.0, | |
| "mean_token_accuracy": 0.9462769009172917, | |
| "epoch": 0.6567164179104478, | |
| "step": 330 | |
| }, | |
| { | |
| "loss": 0.16848835945129395, | |
| "grad_norm": 0.8586801290512085, | |
| "learning_rate": 0.0001998364323047236, | |
| "entropy": 0.16661408836953343, | |
| "num_tokens": 2269601.0, | |
| "mean_token_accuracy": 0.9531193666160107, | |
| "epoch": 0.6766169154228856, | |
| "step": 340 | |
| }, | |
| { | |
| "loss": 0.17167186737060547, | |
| "grad_norm": 0.7884849309921265, | |
| "learning_rate": 0.00019979668299351783, | |
| "entropy": 0.1743609025143087, | |
| "num_tokens": 2335815.0, | |
| "mean_token_accuracy": 0.9482224509119987, | |
| "epoch": 0.6965174129353234, | |
| "step": 350 | |
| }, | |
| { | |
| "loss": 0.18604878187179566, | |
| "grad_norm": 0.941378116607666, | |
| "learning_rate": 0.00019975261926652392, | |
| "entropy": 0.1952204409521073, | |
| "num_tokens": 2404130.0, | |
| "mean_token_accuracy": 0.942904282361269, | |
| "epoch": 0.7164179104477612, | |
| "step": 360 | |
| }, | |
| { | |
| "loss": 0.1847616672515869, | |
| "grad_norm": 0.7770227789878845, | |
| "learning_rate": 0.00019970424302870739, | |
| "entropy": 0.19471225845627488, | |
| "num_tokens": 2470744.0, | |
| "mean_token_accuracy": 0.9433550946414471, | |
| "epoch": 0.736318407960199, | |
| "step": 370 | |
| }, | |
| { | |
| "loss": 0.18451868295669555, | |
| "grad_norm": 1.1318728923797607, | |
| "learning_rate": 0.00019965155637147243, | |
| "entropy": 0.19339222041890025, | |
| "num_tokens": 2537581.0, | |
| "mean_token_accuracy": 0.9457193531095982, | |
| "epoch": 0.7562189054726368, | |
| "step": 380 | |
| }, | |
| { | |
| "loss": 0.17818082571029664, | |
| "grad_norm": 0.8256890773773193, | |
| "learning_rate": 0.0001995945615725716, | |
| "entropy": 0.17824228820391, | |
| "num_tokens": 2604045.0, | |
| "mean_token_accuracy": 0.9509255833923816, | |
| "epoch": 0.7761194029850746, | |
| "step": 390 | |
| }, | |
| { | |
| "loss": 0.15658079385757445, | |
| "grad_norm": 0.7419007420539856, | |
| "learning_rate": 0.00019953326109600728, | |
| "entropy": 0.17659657467156648, | |
| "num_tokens": 2669475.0, | |
| "mean_token_accuracy": 0.9504644252359867, | |
| "epoch": 0.7960199004975125, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 0.16461316347122193, | |
| "grad_norm": 0.8381772041320801, | |
| "learning_rate": 0.00019946765759192497, | |
| "entropy": 0.16667078505270183, | |
| "num_tokens": 2735709.0, | |
| "mean_token_accuracy": 0.9532247520983219, | |
| "epoch": 0.8159203980099502, | |
| "step": 410 | |
| }, | |
| { | |
| "loss": 0.15512030124664306, | |
| "grad_norm": 0.7996618747711182, | |
| "learning_rate": 0.00019939775389649916, | |
| "entropy": 0.1525796527042985, | |
| "num_tokens": 2804586.0, | |
| "mean_token_accuracy": 0.9544322639703751, | |
| "epoch": 0.835820895522388, | |
| "step": 420 | |
| }, | |
| { | |
| "loss": 0.1559414744377136, | |
| "grad_norm": 0.6151495575904846, | |
| "learning_rate": 0.00019932355303181026, | |
| "entropy": 0.16498080925084652, | |
| "num_tokens": 2871824.0, | |
| "mean_token_accuracy": 0.956156824529171, | |
| "epoch": 0.8557213930348259, | |
| "step": 430 | |
| }, | |
| { | |
| "loss": 0.17734644412994385, | |
| "grad_norm": 0.7512227892875671, | |
| "learning_rate": 0.00019924505820571425, | |
| "entropy": 0.20550905396230518, | |
| "num_tokens": 2937826.0, | |
| "mean_token_accuracy": 0.9471527449786663, | |
| "epoch": 0.8756218905472637, | |
| "step": 440 | |
| }, | |
| { | |
| "loss": 0.15445693731307983, | |
| "grad_norm": 0.762320339679718, | |
| "learning_rate": 0.0001991622728117038, | |
| "entropy": 0.1697809119708836, | |
| "num_tokens": 3006135.0, | |
| "mean_token_accuracy": 0.9543316774070263, | |
| "epoch": 0.8955223880597015, | |
| "step": 450 | |
| }, | |
| { | |
| "loss": 0.16953592300415038, | |
| "grad_norm": 0.6466898918151855, | |
| "learning_rate": 0.00019907520042876172, | |
| "entropy": 0.17613516801502554, | |
| "num_tokens": 3073150.0, | |
| "mean_token_accuracy": 0.950883662700653, | |
| "epoch": 0.9154228855721394, | |
| "step": 460 | |
| }, | |
| { | |
| "loss": 0.15585366487503052, | |
| "grad_norm": 1.1007940769195557, | |
| "learning_rate": 0.00019898384482120614, | |
| "entropy": 0.15535307771060616, | |
| "num_tokens": 3138638.0, | |
| "mean_token_accuracy": 0.9595168434083462, | |
| "epoch": 0.9353233830845771, | |
| "step": 470 | |
| }, | |
| { | |
| "loss": 0.15293551683425904, | |
| "grad_norm": 0.6533820629119873, | |
| "learning_rate": 0.0001988882099385278, | |
| "entropy": 0.1557972011389211, | |
| "num_tokens": 3206372.0, | |
| "mean_token_accuracy": 0.9572585269808769, | |
| "epoch": 0.9552238805970149, | |
| "step": 480 | |
| }, | |
| { | |
| "loss": 0.1253079891204834, | |
| "grad_norm": 0.5975553393363953, | |
| "learning_rate": 0.00019878829991521935, | |
| "entropy": 0.13091885023750366, | |
| "num_tokens": 3274281.0, | |
| "mean_token_accuracy": 0.9635655723512173, | |
| "epoch": 0.9751243781094527, | |
| "step": 490 | |
| }, | |
| { | |
| "loss": 0.17081425189971924, | |
| "grad_norm": 0.8513726592063904, | |
| "learning_rate": 0.00019868411907059645, | |
| "entropy": 0.1669132244773209, | |
| "num_tokens": 3340159.0, | |
| "mean_token_accuracy": 0.9505244322121144, | |
| "epoch": 0.9950248756218906, | |
| "step": 500 | |
| }, | |
| { | |
| "eval_loss": 0.24836121499538422, | |
| "eval_runtime": 67.6123, | |
| "eval_samples_per_second": 15.308, | |
| "eval_steps_per_second": 7.661, | |
| "eval_entropy": 0.23721536022024842, | |
| "eval_num_tokens": 3356986.0, | |
| "eval_mean_token_accuracy": 0.9339753162676764, | |
| "epoch": 1.0, | |
| "step": 503 | |
| }, | |
| { | |
| "loss": 0.1242946743965149, | |
| "grad_norm": 0.5372758507728577, | |
| "learning_rate": 0.00019857567190861126, | |
| "entropy": 0.1568159531605871, | |
| "num_tokens": 3404334.0, | |
| "mean_token_accuracy": 0.9635580613424903, | |
| "epoch": 1.0139303482587065, | |
| "step": 510 | |
| }, | |
| { | |
| "loss": 0.1351562261581421, | |
| "grad_norm": 0.7160713076591492, | |
| "learning_rate": 0.00019846296311765754, | |
| "entropy": 0.1316974400077015, | |
| "num_tokens": 3471525.0, | |
| "mean_token_accuracy": 0.9581282936036587, | |
| "epoch": 1.0338308457711443, | |
| "step": 520 | |
| }, | |
| { | |
| "loss": 0.12300963401794433, | |
| "grad_norm": 0.5991392731666565, | |
| "learning_rate": 0.00019834599757036803, | |
| "entropy": 0.14656153018586338, | |
| "num_tokens": 3538338.0, | |
| "mean_token_accuracy": 0.9646149106323719, | |
| "epoch": 1.053731343283582, | |
| "step": 530 | |
| }, | |
| { | |
| "loss": 0.12765015363693238, | |
| "grad_norm": 0.9330605864524841, | |
| "learning_rate": 0.00019822478032340387, | |
| "entropy": 0.15197489713318646, | |
| "num_tokens": 3606642.0, | |
| "mean_token_accuracy": 0.9586149267852306, | |
| "epoch": 1.07363184079602, | |
| "step": 540 | |
| }, | |
| { | |
| "loss": 0.11172252893447876, | |
| "grad_norm": 0.8762836456298828, | |
| "learning_rate": 0.0001980993166172358, | |
| "entropy": 0.11335502485744656, | |
| "num_tokens": 3674420.0, | |
| "mean_token_accuracy": 0.9656657867133618, | |
| "epoch": 1.0935323383084576, | |
| "step": 550 | |
| }, | |
| { | |
| "loss": 0.10862302780151367, | |
| "grad_norm": 0.8866952061653137, | |
| "learning_rate": 0.00019796961187591781, | |
| "entropy": 0.12588824331760406, | |
| "num_tokens": 3741381.0, | |
| "mean_token_accuracy": 0.9648959740996361, | |
| "epoch": 1.1134328358208956, | |
| "step": 560 | |
| }, | |
| { | |
| "loss": 0.11582423448562622, | |
| "grad_norm": 0.6481871604919434, | |
| "learning_rate": 0.00019783567170685262, | |
| "entropy": 0.11430091026704758, | |
| "num_tokens": 3808318.0, | |
| "mean_token_accuracy": 0.9628987669944763, | |
| "epoch": 1.1333333333333333, | |
| "step": 570 | |
| }, | |
| { | |
| "loss": 0.1037294864654541, | |
| "grad_norm": 0.5650383234024048, | |
| "learning_rate": 0.00019769750190054905, | |
| "entropy": 0.11517859897576273, | |
| "num_tokens": 3874410.0, | |
| "mean_token_accuracy": 0.9702431283891201, | |
| "epoch": 1.153233830845771, | |
| "step": 580 | |
| }, | |
| { | |
| "loss": 0.10045719146728516, | |
| "grad_norm": 0.5433067083358765, | |
| "learning_rate": 0.00019755510843037191, | |
| "entropy": 0.10291576159652323, | |
| "num_tokens": 3941134.0, | |
| "mean_token_accuracy": 0.9618785113096238, | |
| "epoch": 1.173134328358209, | |
| "step": 590 | |
| }, | |
| { | |
| "loss": 0.12216674089431763, | |
| "grad_norm": 0.7597805261611938, | |
| "learning_rate": 0.00019740849745228367, | |
| "entropy": 0.11075262987287715, | |
| "num_tokens": 4008097.0, | |
| "mean_token_accuracy": 0.9657749280333519, | |
| "epoch": 1.1930348258706467, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 0.11509623527526855, | |
| "grad_norm": 0.6820019483566284, | |
| "learning_rate": 0.00019725767530457837, | |
| "entropy": 0.12675938094034792, | |
| "num_tokens": 4073570.0, | |
| "mean_token_accuracy": 0.9657132118940354, | |
| "epoch": 1.2129353233830846, | |
| "step": 610 | |
| }, | |
| { | |
| "loss": 0.10812582969665527, | |
| "grad_norm": 0.5021085739135742, | |
| "learning_rate": 0.00019710264850760756, | |
| "entropy": 0.13302950132638217, | |
| "num_tokens": 4140207.0, | |
| "mean_token_accuracy": 0.9639534369111061, | |
| "epoch": 1.2328358208955223, | |
| "step": 620 | |
| }, | |
| { | |
| "loss": 0.12314709424972534, | |
| "grad_norm": 0.7293747067451477, | |
| "learning_rate": 0.00019694342376349835, | |
| "entropy": 0.12266454068012536, | |
| "num_tokens": 4206997.0, | |
| "mean_token_accuracy": 0.9629024133086205, | |
| "epoch": 1.25273631840796, | |
| "step": 630 | |
| }, | |
| { | |
| "loss": 0.117351496219635, | |
| "grad_norm": 0.9365243911743164, | |
| "learning_rate": 0.00019678000795586386, | |
| "entropy": 0.12240176484920084, | |
| "num_tokens": 4277152.0, | |
| "mean_token_accuracy": 0.96337865665555, | |
| "epoch": 1.272636815920398, | |
| "step": 640 | |
| }, | |
| { | |
| "loss": 0.11279709339141845, | |
| "grad_norm": 0.7311879396438599, | |
| "learning_rate": 0.00019661240814950536, | |
| "entropy": 0.11147555778734386, | |
| "num_tokens": 4344652.0, | |
| "mean_token_accuracy": 0.9658049061894417, | |
| "epoch": 1.292537313432836, | |
| "step": 650 | |
| }, | |
| { | |
| "loss": 0.09745638966560363, | |
| "grad_norm": 0.6283079981803894, | |
| "learning_rate": 0.00019644063159010716, | |
| "entropy": 0.11891384413465858, | |
| "num_tokens": 4411916.0, | |
| "mean_token_accuracy": 0.9698325954377651, | |
| "epoch": 1.3124378109452737, | |
| "step": 660 | |
| }, | |
| { | |
| "loss": 0.1158707618713379, | |
| "grad_norm": 0.6160532832145691, | |
| "learning_rate": 0.00019626468570392298, | |
| "entropy": 0.12134865028783678, | |
| "num_tokens": 4478621.0, | |
| "mean_token_accuracy": 0.9658548943698406, | |
| "epoch": 1.3323383084577114, | |
| "step": 670 | |
| }, | |
| { | |
| "loss": 0.09168269634246826, | |
| "grad_norm": 0.43357354402542114, | |
| "learning_rate": 0.00019608457809745537, | |
| "entropy": 0.10654389052651822, | |
| "num_tokens": 4544168.0, | |
| "mean_token_accuracy": 0.9723479963839055, | |
| "epoch": 1.3522388059701491, | |
| "step": 680 | |
| }, | |
| { | |
| "loss": 0.11080507040023804, | |
| "grad_norm": 0.7618773579597473, | |
| "learning_rate": 0.00019590031655712631, | |
| "entropy": 0.109538364992477, | |
| "num_tokens": 4610518.0, | |
| "mean_token_accuracy": 0.9682544745504856, | |
| "epoch": 1.372139303482587, | |
| "step": 690 | |
| }, | |
| { | |
| "loss": 0.09991470575332642, | |
| "grad_norm": 0.8631065487861633, | |
| "learning_rate": 0.00019571190904894115, | |
| "entropy": 0.11043523394037039, | |
| "num_tokens": 4676248.0, | |
| "mean_token_accuracy": 0.9694355696439743, | |
| "epoch": 1.392039800995025, | |
| "step": 700 | |
| }, | |
| { | |
| "loss": 0.10194973945617676, | |
| "grad_norm": 1.0989038944244385, | |
| "learning_rate": 0.00019551936371814375, | |
| "entropy": 0.1043223840300925, | |
| "num_tokens": 4742628.0, | |
| "mean_token_accuracy": 0.9693835198879241, | |
| "epoch": 1.4119402985074627, | |
| "step": 710 | |
| }, | |
| { | |
| "loss": 0.10495258569717407, | |
| "grad_norm": 0.9169466495513916, | |
| "learning_rate": 0.0001953226888888647, | |
| "entropy": 0.10138569427654147, | |
| "num_tokens": 4809419.0, | |
| "mean_token_accuracy": 0.970366296172142, | |
| "epoch": 1.4318407960199004, | |
| "step": 720 | |
| }, | |
| { | |
| "loss": 0.11099306344985962, | |
| "grad_norm": 0.49399080872535706, | |
| "learning_rate": 0.00019512189306376118, | |
| "entropy": 0.11472290018573403, | |
| "num_tokens": 4877119.0, | |
| "mean_token_accuracy": 0.9688441671431065, | |
| "epoch": 1.4517412935323384, | |
| "step": 730 | |
| }, | |
| { | |
| "loss": 0.10629711151123047, | |
| "grad_norm": 0.61200350522995, | |
| "learning_rate": 0.0001949169849236496, | |
| "entropy": 0.11205615981016308, | |
| "num_tokens": 4944433.0, | |
| "mean_token_accuracy": 0.966337724775076, | |
| "epoch": 1.471641791044776, | |
| "step": 740 | |
| }, | |
| { | |
| "loss": 0.11089148521423339, | |
| "grad_norm": 0.6224406361579895, | |
| "learning_rate": 0.00019470797332713012, | |
| "entropy": 0.11642576553858816, | |
| "num_tokens": 5011634.0, | |
| "mean_token_accuracy": 0.9659203454852104, | |
| "epoch": 1.491542288557214, | |
| "step": 750 | |
| }, | |
| { | |
| "loss": 0.10163601636886596, | |
| "grad_norm": 0.7650023698806763, | |
| "learning_rate": 0.0001944948673102038, | |
| "entropy": 0.11514911148697138, | |
| "num_tokens": 5077156.0, | |
| "mean_token_accuracy": 0.9675627797842026, | |
| "epoch": 1.5114427860696518, | |
| "step": 760 | |
| }, | |
| { | |
| "loss": 0.098751300573349, | |
| "grad_norm": 0.49794143438339233, | |
| "learning_rate": 0.00019427767608588183, | |
| "entropy": 0.10764023282099515, | |
| "num_tokens": 5143991.0, | |
| "mean_token_accuracy": 0.9677646860480309, | |
| "epoch": 1.5313432835820895, | |
| "step": 770 | |
| }, | |
| { | |
| "loss": 0.11413514614105225, | |
| "grad_norm": 0.6449922323226929, | |
| "learning_rate": 0.0001940564090437875, | |
| "entropy": 0.1094623792450875, | |
| "num_tokens": 5211604.0, | |
| "mean_token_accuracy": 0.9680206254124641, | |
| "epoch": 1.5512437810945272, | |
| "step": 780 | |
| }, | |
| { | |
| "loss": 0.10809429883956909, | |
| "grad_norm": 0.8340095281600952, | |
| "learning_rate": 0.00019383107574974984, | |
| "entropy": 0.12053416313137859, | |
| "num_tokens": 5277697.0, | |
| "mean_token_accuracy": 0.9674052610993386, | |
| "epoch": 1.5711442786069652, | |
| "step": 790 | |
| }, | |
| { | |
| "loss": 0.08709208965301514, | |
| "grad_norm": 0.7644860744476318, | |
| "learning_rate": 0.00019360168594539055, | |
| "entropy": 0.10000467539066449, | |
| "num_tokens": 5342978.0, | |
| "mean_token_accuracy": 0.9731013409793376, | |
| "epoch": 1.591044776119403, | |
| "step": 800 | |
| }, | |
| { | |
| "loss": 0.09788179397583008, | |
| "grad_norm": 0.6640422344207764, | |
| "learning_rate": 0.0001933682495477024, | |
| "entropy": 0.10800170768052339, | |
| "num_tokens": 5410289.0, | |
| "mean_token_accuracy": 0.9665102422237396, | |
| "epoch": 1.6109452736318408, | |
| "step": 810 | |
| }, | |
| { | |
| "loss": 0.09605536460876465, | |
| "grad_norm": 0.6755411624908447, | |
| "learning_rate": 0.00019313077664862092, | |
| "entropy": 0.10117872587870806, | |
| "num_tokens": 5475880.0, | |
| "mean_token_accuracy": 0.972070074826479, | |
| "epoch": 1.6308457711442785, | |
| "step": 820 | |
| }, | |
| { | |
| "loss": 0.10400503873825073, | |
| "grad_norm": 0.890627384185791, | |
| "learning_rate": 0.00019288927751458766, | |
| "entropy": 0.1069639899302274, | |
| "num_tokens": 5541606.0, | |
| "mean_token_accuracy": 0.9711074873805046, | |
| "epoch": 1.6507462686567163, | |
| "step": 830 | |
| }, | |
| { | |
| "loss": 0.10754516124725341, | |
| "grad_norm": 0.5509929656982422, | |
| "learning_rate": 0.0001926437625861068, | |
| "entropy": 0.11311845399904996, | |
| "num_tokens": 5608065.0, | |
| "mean_token_accuracy": 0.9695759303867817, | |
| "epoch": 1.6706467661691542, | |
| "step": 840 | |
| }, | |
| { | |
| "loss": 0.12257307767868042, | |
| "grad_norm": 0.6879218816757202, | |
| "learning_rate": 0.00019239424247729345, | |
| "entropy": 0.12085098770912736, | |
| "num_tokens": 5674308.0, | |
| "mean_token_accuracy": 0.9648775070905685, | |
| "epoch": 1.6905472636815921, | |
| "step": 850 | |
| }, | |
| { | |
| "loss": 0.10849488973617553, | |
| "grad_norm": 0.4920276999473572, | |
| "learning_rate": 0.0001921407279754149, | |
| "entropy": 0.11081431191414595, | |
| "num_tokens": 5742414.0, | |
| "mean_token_accuracy": 0.9698534436523915, | |
| "epoch": 1.7104477611940299, | |
| "step": 860 | |
| }, | |
| { | |
| "loss": 0.0802489161491394, | |
| "grad_norm": 0.7228904366493225, | |
| "learning_rate": 0.00019188323004042435, | |
| "entropy": 0.0929627066012472, | |
| "num_tokens": 5809827.0, | |
| "mean_token_accuracy": 0.9730034552514553, | |
| "epoch": 1.7303482587064676, | |
| "step": 870 | |
| }, | |
| { | |
| "loss": 0.1109757661819458, | |
| "grad_norm": 0.6558980345726013, | |
| "learning_rate": 0.00019162175980448688, | |
| "entropy": 0.0936126358807087, | |
| "num_tokens": 5875172.0, | |
| "mean_token_accuracy": 0.9671767763793468, | |
| "epoch": 1.7502487562189055, | |
| "step": 880 | |
| }, | |
| { | |
| "loss": 0.09240159988403321, | |
| "grad_norm": 0.5792869925498962, | |
| "learning_rate": 0.0001913563285714984, | |
| "entropy": 0.11744439310859889, | |
| "num_tokens": 5942033.0, | |
| "mean_token_accuracy": 0.9710902646183968, | |
| "epoch": 1.7701492537313432, | |
| "step": 890 | |
| }, | |
| { | |
| "loss": 0.12259334325790405, | |
| "grad_norm": 0.8990387320518494, | |
| "learning_rate": 0.0001910869478165969, | |
| "entropy": 0.10555630044545979, | |
| "num_tokens": 6007977.0, | |
| "mean_token_accuracy": 0.9644198954105377, | |
| "epoch": 1.7900497512437812, | |
| "step": 900 | |
| }, | |
| { | |
| "loss": 0.10547571182250977, | |
| "grad_norm": 0.7768874168395996, | |
| "learning_rate": 0.00019081362918566618, | |
| "entropy": 0.10993905747309327, | |
| "num_tokens": 6074057.0, | |
| "mean_token_accuracy": 0.9728645481169224, | |
| "epoch": 1.809950248756219, | |
| "step": 910 | |
| }, | |
| { | |
| "loss": 0.10611696243286133, | |
| "grad_norm": 0.4525396525859833, | |
| "learning_rate": 0.00019053638449483259, | |
| "entropy": 0.10362131035653874, | |
| "num_tokens": 6141345.0, | |
| "mean_token_accuracy": 0.9724654078483581, | |
| "epoch": 1.8298507462686566, | |
| "step": 920 | |
| }, | |
| { | |
| "loss": 0.11176036596298218, | |
| "grad_norm": 0.7492642998695374, | |
| "learning_rate": 0.0001902552257299542, | |
| "entropy": 0.11784212745260447, | |
| "num_tokens": 6209124.0, | |
| "mean_token_accuracy": 0.9628825642168521, | |
| "epoch": 1.8497512437810946, | |
| "step": 930 | |
| }, | |
| { | |
| "loss": 0.10774084329605102, | |
| "grad_norm": 0.5748555064201355, | |
| "learning_rate": 0.00018997016504610246, | |
| "entropy": 0.11072989953681826, | |
| "num_tokens": 6276485.0, | |
| "mean_token_accuracy": 0.9646185263991356, | |
| "epoch": 1.8696517412935323, | |
| "step": 940 | |
| }, | |
| { | |
| "loss": 0.08848418593406678, | |
| "grad_norm": 0.5937514305114746, | |
| "learning_rate": 0.00018968121476703678, | |
| "entropy": 0.10556984411086887, | |
| "num_tokens": 6342957.0, | |
| "mean_token_accuracy": 0.9734670996665955, | |
| "epoch": 1.8895522388059702, | |
| "step": 950 | |
| }, | |
| { | |
| "loss": 0.10269320011138916, | |
| "grad_norm": 1.0715358257293701, | |
| "learning_rate": 0.00018938838738467184, | |
| "entropy": 0.09428299731807784, | |
| "num_tokens": 6408918.0, | |
| "mean_token_accuracy": 0.9720249362289906, | |
| "epoch": 1.909452736318408, | |
| "step": 960 | |
| }, | |
| { | |
| "loss": 0.0899561107158661, | |
| "grad_norm": 0.5169550180435181, | |
| "learning_rate": 0.00018909169555853743, | |
| "entropy": 0.10850229405332357, | |
| "num_tokens": 6475062.0, | |
| "mean_token_accuracy": 0.9714486353099346, | |
| "epoch": 1.9293532338308457, | |
| "step": 970 | |
| }, | |
| { | |
| "loss": 0.09649609923362731, | |
| "grad_norm": 0.7642938494682312, | |
| "learning_rate": 0.00018879115211523117, | |
| "entropy": 0.1026058561168611, | |
| "num_tokens": 6542465.0, | |
| "mean_token_accuracy": 0.9703472301363945, | |
| "epoch": 1.9492537313432836, | |
| "step": 980 | |
| }, | |
| { | |
| "loss": 0.09067035913467407, | |
| "grad_norm": 0.3874703347682953, | |
| "learning_rate": 0.0001884867700478641, | |
| "entropy": 0.09136548589449375, | |
| "num_tokens": 6608985.0, | |
| "mean_token_accuracy": 0.9718083783984184, | |
| "epoch": 1.9691542288557216, | |
| "step": 990 | |
| }, | |
| { | |
| "loss": 0.09239903688430787, | |
| "grad_norm": 0.693695604801178, | |
| "learning_rate": 0.00018817856251549867, | |
| "entropy": 0.11761876428499818, | |
| "num_tokens": 6676885.0, | |
| "mean_token_accuracy": 0.9674227833747864, | |
| "epoch": 1.9890547263681593, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_loss": 0.24770455062389374, | |
| "eval_runtime": 67.3665, | |
| "eval_samples_per_second": 15.364, | |
| "eval_steps_per_second": 7.689, | |
| "eval_entropy": 0.13267684354209502, | |
| "eval_num_tokens": 6713972.0, | |
| "eval_mean_token_accuracy": 0.9410935246806347, | |
| "epoch": 2.0, | |
| "step": 1006 | |
| }, | |
| { | |
| "loss": 0.08439697623252869, | |
| "grad_norm": 0.41609451174736023, | |
| "learning_rate": 0.00018786654284258034, | |
| "entropy": 0.09164438765545033, | |
| "num_tokens": 6740189.0, | |
| "mean_token_accuracy": 0.9744413871514169, | |
| "epoch": 2.007960199004975, | |
| "step": 1010 | |
| }, | |
| { | |
| "loss": 0.06379352807998658, | |
| "grad_norm": 0.7209794521331787, | |
| "learning_rate": 0.00018755072451836097, | |
| "entropy": 0.06243965101893991, | |
| "num_tokens": 6806511.0, | |
| "mean_token_accuracy": 0.9806746728718281, | |
| "epoch": 2.027860696517413, | |
| "step": 1020 | |
| }, | |
| { | |
| "loss": 0.07251286506652832, | |
| "grad_norm": 0.4035630524158478, | |
| "learning_rate": 0.00018723112119631608, | |
| "entropy": 0.06880665038479492, | |
| "num_tokens": 6874726.0, | |
| "mean_token_accuracy": 0.9811282232403755, | |
| "epoch": 2.047761194029851, | |
| "step": 1030 | |
| }, | |
| { | |
| "loss": 0.05488339066505432, | |
| "grad_norm": 0.6395288705825806, | |
| "learning_rate": 0.00018690774669355442, | |
| "entropy": 0.07282297083875164, | |
| "num_tokens": 6940725.0, | |
| "mean_token_accuracy": 0.9807328015565873, | |
| "epoch": 2.0676616915422885, | |
| "step": 1040 | |
| }, | |
| { | |
| "loss": 0.06734220385551452, | |
| "grad_norm": 0.7077370882034302, | |
| "learning_rate": 0.00018658061499022055, | |
| "entropy": 0.07170078799827025, | |
| "num_tokens": 7008850.0, | |
| "mean_token_accuracy": 0.9810515813529491, | |
| "epoch": 2.0875621890547262, | |
| "step": 1050 | |
| }, | |
| { | |
| "loss": 0.062459665536880496, | |
| "grad_norm": 1.220231294631958, | |
| "learning_rate": 0.0001862497402288906, | |
| "entropy": 0.05807271180674434, | |
| "num_tokens": 7074982.0, | |
| "mean_token_accuracy": 0.981388358771801, | |
| "epoch": 2.107462686567164, | |
| "step": 1060 | |
| }, | |
| { | |
| "loss": 0.046548599004745485, | |
| "grad_norm": 0.5530555248260498, | |
| "learning_rate": 0.0001859151367139608, | |
| "entropy": 0.06504726539133117, | |
| "num_tokens": 7140914.0, | |
| "mean_token_accuracy": 0.984452311694622, | |
| "epoch": 2.127363184079602, | |
| "step": 1070 | |
| }, | |
| { | |
| "loss": 0.05819639563560486, | |
| "grad_norm": 0.7002009749412537, | |
| "learning_rate": 0.000185576818911029, | |
| "entropy": 0.050316512072458866, | |
| "num_tokens": 7206800.0, | |
| "mean_token_accuracy": 0.985405495017767, | |
| "epoch": 2.14726368159204, | |
| "step": 1080 | |
| }, | |
| { | |
| "loss": 0.0601584792137146, | |
| "grad_norm": 0.540239691734314, | |
| "learning_rate": 0.00018523480144626948, | |
| "entropy": 0.07835423464421183, | |
| "num_tokens": 7273522.0, | |
| "mean_token_accuracy": 0.9818796373903751, | |
| "epoch": 2.1671641791044776, | |
| "step": 1090 | |
| }, | |
| { | |
| "loss": 0.04493230581283569, | |
| "grad_norm": 0.5114269256591797, | |
| "learning_rate": 0.00018488909910580037, | |
| "entropy": 0.05474828036967665, | |
| "num_tokens": 7340979.0, | |
| "mean_token_accuracy": 0.9857458151876927, | |
| "epoch": 2.1870646766169153, | |
| "step": 1100 | |
| }, | |
| { | |
| "loss": 0.054016536474227904, | |
| "grad_norm": 0.6734052300453186, | |
| "learning_rate": 0.00018453972683504466, | |
| "entropy": 0.05471267879474908, | |
| "num_tokens": 7407885.0, | |
| "mean_token_accuracy": 0.9807157158851624, | |
| "epoch": 2.206965174129353, | |
| "step": 1110 | |
| }, | |
| { | |
| "loss": 0.06644362211227417, | |
| "grad_norm": 1.0557215213775635, | |
| "learning_rate": 0.00018418669973808386, | |
| "entropy": 0.07309502450516447, | |
| "num_tokens": 7476921.0, | |
| "mean_token_accuracy": 0.9793836884200573, | |
| "epoch": 2.226865671641791, | |
| "step": 1120 | |
| }, | |
| { | |
| "loss": 0.06655114293098449, | |
| "grad_norm": 0.5192980170249939, | |
| "learning_rate": 0.00018383003307700525, | |
| "entropy": 0.06608295071637257, | |
| "num_tokens": 7543462.0, | |
| "mean_token_accuracy": 0.9790004834532737, | |
| "epoch": 2.246766169154229, | |
| "step": 1130 | |
| }, | |
| { | |
| "loss": 0.06803213357925415, | |
| "grad_norm": 0.4396572709083557, | |
| "learning_rate": 0.0001834697422712419, | |
| "entropy": 0.06500887103029526, | |
| "num_tokens": 7610642.0, | |
| "mean_token_accuracy": 0.980684906244278, | |
| "epoch": 2.2666666666666666, | |
| "step": 1140 | |
| }, | |
| { | |
| "loss": 0.05774785876274109, | |
| "grad_norm": 0.8334233164787292, | |
| "learning_rate": 0.00018310584289690608, | |
| "entropy": 0.058826766291167586, | |
| "num_tokens": 7676890.0, | |
| "mean_token_accuracy": 0.9823732137680053, | |
| "epoch": 2.2865671641791043, | |
| "step": 1150 | |
| }, | |
| { | |
| "loss": 0.05890558958053589, | |
| "grad_norm": 0.6917388439178467, | |
| "learning_rate": 0.0001827383506861159, | |
| "entropy": 0.0589894114760682, | |
| "num_tokens": 7743110.0, | |
| "mean_token_accuracy": 0.9807198375463486, | |
| "epoch": 2.306467661691542, | |
| "step": 1160 | |
| }, | |
| { | |
| "loss": 0.04957199692726135, | |
| "grad_norm": 0.351596862077713, | |
| "learning_rate": 0.00018236728152631526, | |
| "entropy": 0.05655237181927077, | |
| "num_tokens": 7809971.0, | |
| "mean_token_accuracy": 0.9838769190013409, | |
| "epoch": 2.32636815920398, | |
| "step": 1170 | |
| }, | |
| { | |
| "loss": 0.07587432265281677, | |
| "grad_norm": 0.4856368899345398, | |
| "learning_rate": 0.00018199265145958678, | |
| "entropy": 0.06457642229506746, | |
| "num_tokens": 7876231.0, | |
| "mean_token_accuracy": 0.974904265254736, | |
| "epoch": 2.346268656716418, | |
| "step": 1180 | |
| }, | |
| { | |
| "loss": 0.057352250814437865, | |
| "grad_norm": 0.6313260197639465, | |
| "learning_rate": 0.00018161447668195858, | |
| "entropy": 0.07011734971310943, | |
| "num_tokens": 7942463.0, | |
| "mean_token_accuracy": 0.9822526164352894, | |
| "epoch": 2.3661691542288557, | |
| "step": 1190 | |
| }, | |
| { | |
| "loss": 0.07296563386917114, | |
| "grad_norm": 0.6475229263305664, | |
| "learning_rate": 0.00018123277354270372, | |
| "entropy": 0.07394456524634734, | |
| "num_tokens": 8008529.0, | |
| "mean_token_accuracy": 0.9783020555973053, | |
| "epoch": 2.3860696517412934, | |
| "step": 1200 | |
| }, | |
| { | |
| "loss": 0.06899880170822144, | |
| "grad_norm": 0.5311662554740906, | |
| "learning_rate": 0.00018084755854363377, | |
| "entropy": 0.06762066348455846, | |
| "num_tokens": 8075331.0, | |
| "mean_token_accuracy": 0.9800443604588509, | |
| "epoch": 2.405970149253731, | |
| "step": 1210 | |
| }, | |
| { | |
| "loss": 0.04785624444484711, | |
| "grad_norm": 0.47831037640571594, | |
| "learning_rate": 0.00018045884833838512, | |
| "entropy": 0.052969011454842986, | |
| "num_tokens": 8140043.0, | |
| "mean_token_accuracy": 0.9850305773317813, | |
| "epoch": 2.4258706467661693, | |
| "step": 1220 | |
| }, | |
| { | |
| "loss": 0.057527285814285276, | |
| "grad_norm": 0.4341302216053009, | |
| "learning_rate": 0.00018006665973169911, | |
| "entropy": 0.058878783753607424, | |
| "num_tokens": 8206439.0, | |
| "mean_token_accuracy": 0.9826890744268895, | |
| "epoch": 2.445771144278607, | |
| "step": 1230 | |
| }, | |
| { | |
| "loss": 0.06314617991447449, | |
| "grad_norm": 0.6121116876602173, | |
| "learning_rate": 0.0001796710096786956, | |
| "entropy": 0.06802375400438905, | |
| "num_tokens": 8274350.0, | |
| "mean_token_accuracy": 0.9803676478564739, | |
| "epoch": 2.4656716417910447, | |
| "step": 1240 | |
| }, | |
| { | |
| "loss": 0.06138876676559448, | |
| "grad_norm": 0.485624760389328, | |
| "learning_rate": 0.0001792719152841398, | |
| "entropy": 0.06864131800248288, | |
| "num_tokens": 8342676.0, | |
| "mean_token_accuracy": 0.9821898102760315, | |
| "epoch": 2.4855721393034824, | |
| "step": 1250 | |
| }, | |
| { | |
| "loss": 0.05479460954666138, | |
| "grad_norm": 0.7229267358779907, | |
| "learning_rate": 0.0001788693938017029, | |
| "entropy": 0.06992838233709335, | |
| "num_tokens": 8408688.0, | |
| "mean_token_accuracy": 0.9806355632841587, | |
| "epoch": 2.50547263681592, | |
| "step": 1260 | |
| }, | |
| { | |
| "loss": 0.05725674629211426, | |
| "grad_norm": 0.6357669234275818, | |
| "learning_rate": 0.00017846346263321623, | |
| "entropy": 0.05212859932216816, | |
| "num_tokens": 8475857.0, | |
| "mean_token_accuracy": 0.982030725479126, | |
| "epoch": 2.5253731343283583, | |
| "step": 1270 | |
| }, | |
| { | |
| "loss": 0.05330604910850525, | |
| "grad_norm": 0.48565125465393066, | |
| "learning_rate": 0.00017805413932791875, | |
| "entropy": 0.0598757246916648, | |
| "num_tokens": 8542007.0, | |
| "mean_token_accuracy": 0.9829342268407345, | |
| "epoch": 2.545273631840796, | |
| "step": 1280 | |
| }, | |
| { | |
| "loss": 0.0662715494632721, | |
| "grad_norm": 0.47484299540519714, | |
| "learning_rate": 0.00017764144158169856, | |
| "entropy": 0.07917212916072458, | |
| "num_tokens": 8609409.0, | |
| "mean_token_accuracy": 0.9773714534938336, | |
| "epoch": 2.5651741293532337, | |
| "step": 1290 | |
| }, | |
| { | |
| "loss": 0.06932964324951171, | |
| "grad_norm": 0.7906941175460815, | |
| "learning_rate": 0.00017722538723632773, | |
| "entropy": 0.0599730534479022, | |
| "num_tokens": 8676488.0, | |
| "mean_token_accuracy": 0.9792346425354481, | |
| "epoch": 2.585074626865672, | |
| "step": 1300 | |
| }, | |
| { | |
| "loss": 0.08003131747245788, | |
| "grad_norm": 0.5393727421760559, | |
| "learning_rate": 0.000176805994278691, | |
| "entropy": 0.07814967349986546, | |
| "num_tokens": 8744553.0, | |
| "mean_token_accuracy": 0.9784729719161988, | |
| "epoch": 2.604975124378109, | |
| "step": 1310 | |
| }, | |
| { | |
| "loss": 0.051309889554977416, | |
| "grad_norm": 0.8460810780525208, | |
| "learning_rate": 0.0001763832808400082, | |
| "entropy": 0.06959494983311743, | |
| "num_tokens": 8812013.0, | |
| "mean_token_accuracy": 0.9829349182546139, | |
| "epoch": 2.6248756218905474, | |
| "step": 1320 | |
| }, | |
| { | |
| "loss": 0.05681629776954651, | |
| "grad_norm": 0.5110874176025391, | |
| "learning_rate": 0.00017595726519505043, | |
| "entropy": 0.06371988009777851, | |
| "num_tokens": 8879275.0, | |
| "mean_token_accuracy": 0.9808239601552486, | |
| "epoch": 2.644776119402985, | |
| "step": 1330 | |
| }, | |
| { | |
| "loss": 0.06473686695098876, | |
| "grad_norm": 0.45770350098609924, | |
| "learning_rate": 0.00017552796576134985, | |
| "entropy": 0.06574244437506423, | |
| "num_tokens": 8946437.0, | |
| "mean_token_accuracy": 0.9830326803028584, | |
| "epoch": 2.664676616915423, | |
| "step": 1340 | |
| }, | |
| { | |
| "loss": 0.05621873736381531, | |
| "grad_norm": 0.47769930958747864, | |
| "learning_rate": 0.00017509540109840365, | |
| "entropy": 0.06558069243910722, | |
| "num_tokens": 9013311.0, | |
| "mean_token_accuracy": 0.9796665169298648, | |
| "epoch": 2.684577114427861, | |
| "step": 1350 | |
| }, | |
| { | |
| "loss": 0.05615652799606323, | |
| "grad_norm": 0.48142921924591064, | |
| "learning_rate": 0.00017465958990687156, | |
| "entropy": 0.059144589549396186, | |
| "num_tokens": 9078260.0, | |
| "mean_token_accuracy": 0.9777877710759639, | |
| "epoch": 2.7044776119402982, | |
| "step": 1360 | |
| }, | |
| { | |
| "loss": 0.07301256060600281, | |
| "grad_norm": 0.6959577798843384, | |
| "learning_rate": 0.0001742205510277674, | |
| "entropy": 0.0731184652308002, | |
| "num_tokens": 9143896.0, | |
| "mean_token_accuracy": 0.9792239956557751, | |
| "epoch": 2.7243781094527364, | |
| "step": 1370 | |
| }, | |
| { | |
| "loss": 0.05728998184204102, | |
| "grad_norm": 0.4535721242427826, | |
| "learning_rate": 0.00017377830344164464, | |
| "entropy": 0.06650992162758484, | |
| "num_tokens": 9210455.0, | |
| "mean_token_accuracy": 0.9824736349284648, | |
| "epoch": 2.744278606965174, | |
| "step": 1380 | |
| }, | |
| { | |
| "loss": 0.05624777674674988, | |
| "grad_norm": 0.9010443687438965, | |
| "learning_rate": 0.00017333286626777564, | |
| "entropy": 0.06068479290697724, | |
| "num_tokens": 9278223.0, | |
| "mean_token_accuracy": 0.9795115493237972, | |
| "epoch": 2.764179104477612, | |
| "step": 1390 | |
| }, | |
| { | |
| "loss": 0.04648939669132233, | |
| "grad_norm": 0.5129737257957458, | |
| "learning_rate": 0.00017288425876332527, | |
| "entropy": 0.05758373744320124, | |
| "num_tokens": 9346259.0, | |
| "mean_token_accuracy": 0.9854638859629631, | |
| "epoch": 2.78407960199005, | |
| "step": 1400 | |
| }, | |
| { | |
| "loss": 0.07454426288604736, | |
| "grad_norm": 1.081714153289795, | |
| "learning_rate": 0.00017243250032251823, | |
| "entropy": 0.07305689085042104, | |
| "num_tokens": 9411960.0, | |
| "mean_token_accuracy": 0.9747657172381878, | |
| "epoch": 2.8039800995024877, | |
| "step": 1410 | |
| }, | |
| { | |
| "loss": 0.052061259746551514, | |
| "grad_norm": 0.668654203414917, | |
| "learning_rate": 0.00017197761047580082, | |
| "entropy": 0.05686979314778, | |
| "num_tokens": 9479728.0, | |
| "mean_token_accuracy": 0.9826227888464928, | |
| "epoch": 2.8238805970149254, | |
| "step": 1420 | |
| }, | |
| { | |
| "loss": 0.061662870645523074, | |
| "grad_norm": 0.6690983772277832, | |
| "learning_rate": 0.00017151960888899627, | |
| "entropy": 0.06015237307874486, | |
| "num_tokens": 9544970.0, | |
| "mean_token_accuracy": 0.9811851166188716, | |
| "epoch": 2.843781094527363, | |
| "step": 1430 | |
| }, | |
| { | |
| "loss": 0.05701953172683716, | |
| "grad_norm": 0.7326856255531311, | |
| "learning_rate": 0.00017105851536245492, | |
| "entropy": 0.07333141873823479, | |
| "num_tokens": 9611720.0, | |
| "mean_token_accuracy": 0.9832665704190731, | |
| "epoch": 2.863681592039801, | |
| "step": 1440 | |
| }, | |
| { | |
| "loss": 0.07263015508651734, | |
| "grad_norm": 0.7834051251411438, | |
| "learning_rate": 0.0001705943498301979, | |
| "entropy": 0.06394668611465022, | |
| "num_tokens": 9679831.0, | |
| "mean_token_accuracy": 0.9781429409980774, | |
| "epoch": 2.883582089552239, | |
| "step": 1450 | |
| }, | |
| { | |
| "loss": 0.05510892271995545, | |
| "grad_norm": 0.6546643972396851, | |
| "learning_rate": 0.00017012713235905547, | |
| "entropy": 0.06291348003433087, | |
| "num_tokens": 9745899.0, | |
| "mean_token_accuracy": 0.9804500080645084, | |
| "epoch": 2.9034825870646768, | |
| "step": 1460 | |
| }, | |
| { | |
| "loss": 0.05505146384239197, | |
| "grad_norm": 0.5361804962158203, | |
| "learning_rate": 0.00016965688314779956, | |
| "entropy": 0.06303218469838612, | |
| "num_tokens": 9814519.0, | |
| "mean_token_accuracy": 0.9801669403910637, | |
| "epoch": 2.9233830845771145, | |
| "step": 1470 | |
| }, | |
| { | |
| "loss": 0.04610788822174072, | |
| "grad_norm": 0.6162955164909363, | |
| "learning_rate": 0.00016918362252627036, | |
| "entropy": 0.0545346099184826, | |
| "num_tokens": 9878812.0, | |
| "mean_token_accuracy": 0.9822937592864036, | |
| "epoch": 2.943283582089552, | |
| "step": 1480 | |
| }, | |
| { | |
| "loss": 0.06813795566558838, | |
| "grad_norm": 0.8021186590194702, | |
| "learning_rate": 0.00016870737095449754, | |
| "entropy": 0.06529987451503985, | |
| "num_tokens": 9946556.0, | |
| "mean_token_accuracy": 0.9782890357077122, | |
| "epoch": 2.96318407960199, | |
| "step": 1490 | |
| }, | |
| { | |
| "loss": 0.05245916843414307, | |
| "grad_norm": 0.6037353277206421, | |
| "learning_rate": 0.00016822814902181583, | |
| "entropy": 0.06525841613765807, | |
| "num_tokens": 10014536.0, | |
| "mean_token_accuracy": 0.9829807795584202, | |
| "epoch": 2.983084577114428, | |
| "step": 1500 | |
| }, | |
| { | |
| "eval_loss": 0.26412370800971985, | |
| "eval_runtime": 67.3621, | |
| "eval_samples_per_second": 15.365, | |
| "eval_steps_per_second": 7.69, | |
| "eval_entropy": 0.10301580357465993, | |
| "eval_num_tokens": 10070958.0, | |
| "eval_mean_token_accuracy": 0.9438181870462351, | |
| "epoch": 3.0, | |
| "step": 1509 | |
| }, | |
| { | |
| "loss": 0.05833644866943359, | |
| "grad_norm": 0.29880842566490173, | |
| "learning_rate": 0.00016774597744597457, | |
| "entropy": 0.053184559752576445, | |
| "num_tokens": 10077424.0, | |
| "mean_token_accuracy": 0.9848840275877401, | |
| "epoch": 3.0019900497512437, | |
| "step": 1510 | |
| }, | |
| { | |
| "loss": 0.03773494362831116, | |
| "grad_norm": 0.5901796817779541, | |
| "learning_rate": 0.00016726087707224236, | |
| "entropy": 0.04916581161960494, | |
| "num_tokens": 10143828.0, | |
| "mean_token_accuracy": 0.9888612225651741, | |
| "epoch": 3.0218905472636814, | |
| "step": 1520 | |
| }, | |
| { | |
| "loss": 0.04334467053413391, | |
| "grad_norm": 0.4549998342990875, | |
| "learning_rate": 0.00016677286887250572, | |
| "entropy": 0.04599970751442015, | |
| "num_tokens": 10210498.0, | |
| "mean_token_accuracy": 0.9884389974176884, | |
| "epoch": 3.0417910447761196, | |
| "step": 1530 | |
| }, | |
| { | |
| "loss": 0.031511181592941286, | |
| "grad_norm": 0.41420701146125793, | |
| "learning_rate": 0.00016628197394436247, | |
| "entropy": 0.03852141368552111, | |
| "num_tokens": 10275990.0, | |
| "mean_token_accuracy": 0.9884374618530274, | |
| "epoch": 3.0616915422885573, | |
| "step": 1540 | |
| }, | |
| { | |
| "loss": 0.029081150889396667, | |
| "grad_norm": 0.3844093978404999, | |
| "learning_rate": 0.00016578821351020964, | |
| "entropy": 0.032692909514298665, | |
| "num_tokens": 10342514.0, | |
| "mean_token_accuracy": 0.9907526269555091, | |
| "epoch": 3.081592039800995, | |
| "step": 1550 | |
| }, | |
| { | |
| "loss": 0.037613070011138915, | |
| "grad_norm": 0.3342166244983673, | |
| "learning_rate": 0.00016529160891632597, | |
| "entropy": 0.03535493408198818, | |
| "num_tokens": 10408828.0, | |
| "mean_token_accuracy": 0.9882513448596001, | |
| "epoch": 3.1014925373134328, | |
| "step": 1560 | |
| }, | |
| { | |
| "loss": 0.03288332223892212, | |
| "grad_norm": 0.5369789600372314, | |
| "learning_rate": 0.00016479218163194904, | |
| "entropy": 0.038720946523244495, | |
| "num_tokens": 10475303.0, | |
| "mean_token_accuracy": 0.9900217793881894, | |
| "epoch": 3.1213930348258705, | |
| "step": 1570 | |
| }, | |
| { | |
| "loss": 0.03281024694442749, | |
| "grad_norm": 0.3687148094177246, | |
| "learning_rate": 0.00016428995324834723, | |
| "entropy": 0.03382732793106698, | |
| "num_tokens": 10543012.0, | |
| "mean_token_accuracy": 0.9898124732077122, | |
| "epoch": 3.1412935323383087, | |
| "step": 1580 | |
| }, | |
| { | |
| "loss": 0.032737156748771666, | |
| "grad_norm": 0.40983688831329346, | |
| "learning_rate": 0.00016378494547788613, | |
| "entropy": 0.04149121846421622, | |
| "num_tokens": 10609348.0, | |
| "mean_token_accuracy": 0.9896206237375736, | |
| "epoch": 3.1611940298507464, | |
| "step": 1590 | |
| }, | |
| { | |
| "loss": 0.04040493667125702, | |
| "grad_norm": 0.6384645104408264, | |
| "learning_rate": 0.00016327718015308998, | |
| "entropy": 0.04162978534004651, | |
| "num_tokens": 10676433.0, | |
| "mean_token_accuracy": 0.987835768610239, | |
| "epoch": 3.181094527363184, | |
| "step": 1600 | |
| }, | |
| { | |
| "loss": 0.03527785539627075, | |
| "grad_norm": 0.7771252989768982, | |
| "learning_rate": 0.0001627666792256977, | |
| "entropy": 0.0402049986703787, | |
| "num_tokens": 10744880.0, | |
| "mean_token_accuracy": 0.9879353500902652, | |
| "epoch": 3.200995024875622, | |
| "step": 1610 | |
| }, | |
| { | |
| "loss": 0.027459162473678588, | |
| "grad_norm": 0.7088900208473206, | |
| "learning_rate": 0.00016225346476571396, | |
| "entropy": 0.03322969185537659, | |
| "num_tokens": 10811704.0, | |
| "mean_token_accuracy": 0.9915633283555507, | |
| "epoch": 3.2208955223880595, | |
| "step": 1620 | |
| }, | |
| { | |
| "loss": 0.04761128127574921, | |
| "grad_norm": 0.5046206712722778, | |
| "learning_rate": 0.00016173755896045506, | |
| "entropy": 0.04271038012811914, | |
| "num_tokens": 10877771.0, | |
| "mean_token_accuracy": 0.9852734059095383, | |
| "epoch": 3.2407960199004977, | |
| "step": 1630 | |
| }, | |
| { | |
| "loss": 0.040560868382453916, | |
| "grad_norm": 0.5330039262771606, | |
| "learning_rate": 0.00016121898411358966, | |
| "entropy": 0.056298443174455315, | |
| "num_tokens": 10946056.0, | |
| "mean_token_accuracy": 0.9860941573977471, | |
| "epoch": 3.2606965174129354, | |
| "step": 1640 | |
| }, | |
| { | |
| "loss": 0.038580065965652464, | |
| "grad_norm": 0.3763498067855835, | |
| "learning_rate": 0.00016069776264417463, | |
| "entropy": 0.040748245036229494, | |
| "num_tokens": 11014117.0, | |
| "mean_token_accuracy": 0.9879476867616177, | |
| "epoch": 3.280597014925373, | |
| "step": 1650 | |
| }, | |
| { | |
| "loss": 0.031229573488235473, | |
| "grad_norm": 0.5975865721702576, | |
| "learning_rate": 0.00016017391708568563, | |
| "entropy": 0.04134431722341105, | |
| "num_tokens": 11080721.0, | |
| "mean_token_accuracy": 0.9899743214249611, | |
| "epoch": 3.300497512437811, | |
| "step": 1660 | |
| }, | |
| { | |
| "loss": 0.04345620274543762, | |
| "grad_norm": 0.5342262387275696, | |
| "learning_rate": 0.00015964747008504325, | |
| "entropy": 0.03906176597811282, | |
| "num_tokens": 11147441.0, | |
| "mean_token_accuracy": 0.98561105504632, | |
| "epoch": 3.3203980099502486, | |
| "step": 1670 | |
| }, | |
| { | |
| "loss": 0.042844048142433165, | |
| "grad_norm": 0.4553395211696625, | |
| "learning_rate": 0.00015911844440163371, | |
| "entropy": 0.043423575052293016, | |
| "num_tokens": 11212240.0, | |
| "mean_token_accuracy": 0.9864377163350582, | |
| "epoch": 3.3402985074626868, | |
| "step": 1680 | |
| }, | |
| { | |
| "loss": 0.029976919293403625, | |
| "grad_norm": 0.7629397511482239, | |
| "learning_rate": 0.00015858686290632493, | |
| "entropy": 0.04001676997286267, | |
| "num_tokens": 11277138.0, | |
| "mean_token_accuracy": 0.9910943493247032, | |
| "epoch": 3.3601990049751245, | |
| "step": 1690 | |
| }, | |
| { | |
| "loss": 0.03644349873065948, | |
| "grad_norm": 0.5027875304222107, | |
| "learning_rate": 0.0001580527485804779, | |
| "entropy": 0.037145845251507124, | |
| "num_tokens": 11343926.0, | |
| "mean_token_accuracy": 0.9864401429891586, | |
| "epoch": 3.380099502487562, | |
| "step": 1700 | |
| }, | |
| { | |
| "loss": 0.030204242467880248, | |
| "grad_norm": 0.3141781687736511, | |
| "learning_rate": 0.00015751612451495313, | |
| "entropy": 0.03934923965134658, | |
| "num_tokens": 11411256.0, | |
| "mean_token_accuracy": 0.9906957238912583, | |
| "epoch": 3.4, | |
| "step": 1710 | |
| }, | |
| { | |
| "loss": 0.03447907567024231, | |
| "grad_norm": 0.2602730989456177, | |
| "learning_rate": 0.00015697701390911218, | |
| "entropy": 0.03915706583939027, | |
| "num_tokens": 11477632.0, | |
| "mean_token_accuracy": 0.9882164128124714, | |
| "epoch": 3.4199004975124376, | |
| "step": 1720 | |
| }, | |
| { | |
| "loss": 0.03258863389492035, | |
| "grad_norm": 0.5404685735702515, | |
| "learning_rate": 0.00015643544006981505, | |
| "entropy": 0.04417289613047615, | |
| "num_tokens": 11542182.0, | |
| "mean_token_accuracy": 0.9894180931150913, | |
| "epoch": 3.439800995024876, | |
| "step": 1730 | |
| }, | |
| { | |
| "loss": 0.03976099193096161, | |
| "grad_norm": 0.4809146821498871, | |
| "learning_rate": 0.0001558914264104122, | |
| "entropy": 0.039228807145264, | |
| "num_tokens": 11608358.0, | |
| "mean_token_accuracy": 0.9867617316544056, | |
| "epoch": 3.4597014925373135, | |
| "step": 1740 | |
| }, | |
| { | |
| "loss": 0.03436765670776367, | |
| "grad_norm": 0.7439927458763123, | |
| "learning_rate": 0.00015534499644973267, | |
| "entropy": 0.03574614835088141, | |
| "num_tokens": 11675284.0, | |
| "mean_token_accuracy": 0.9876792296767235, | |
| "epoch": 3.4796019900497512, | |
| "step": 1750 | |
| }, | |
| { | |
| "loss": 0.038963159918785094, | |
| "grad_norm": 1.2817922830581665, | |
| "learning_rate": 0.00015479617381106711, | |
| "entropy": 0.04119858265621588, | |
| "num_tokens": 11743101.0, | |
| "mean_token_accuracy": 0.9876352168619633, | |
| "epoch": 3.499502487562189, | |
| "step": 1760 | |
| }, | |
| { | |
| "loss": 0.031986075639724734, | |
| "grad_norm": 0.5344582796096802, | |
| "learning_rate": 0.00015424498222114662, | |
| "entropy": 0.039489572704769674, | |
| "num_tokens": 11811048.0, | |
| "mean_token_accuracy": 0.9890580669045448, | |
| "epoch": 3.5194029850746267, | |
| "step": 1770 | |
| }, | |
| { | |
| "loss": 0.043090081214904784, | |
| "grad_norm": 0.3375915288925171, | |
| "learning_rate": 0.00015369144550911678, | |
| "entropy": 0.039671140746213494, | |
| "num_tokens": 11879773.0, | |
| "mean_token_accuracy": 0.9859576515853405, | |
| "epoch": 3.539303482587065, | |
| "step": 1780 | |
| }, | |
| { | |
| "loss": 0.03574670851230621, | |
| "grad_norm": 0.5646845698356628, | |
| "learning_rate": 0.0001531355876055078, | |
| "entropy": 0.04234636231994955, | |
| "num_tokens": 11946882.0, | |
| "mean_token_accuracy": 0.9891765132546425, | |
| "epoch": 3.5592039800995026, | |
| "step": 1790 | |
| }, | |
| { | |
| "loss": 0.03617365062236786, | |
| "grad_norm": 0.5281543731689453, | |
| "learning_rate": 0.00015257743254119973, | |
| "entropy": 0.03838658424501773, | |
| "num_tokens": 12014198.0, | |
| "mean_token_accuracy": 0.9879163481295109, | |
| "epoch": 3.5791044776119403, | |
| "step": 1800 | |
| }, | |
| { | |
| "loss": 0.02715664207935333, | |
| "grad_norm": 0.4327303171157837, | |
| "learning_rate": 0.00015201700444638348, | |
| "entropy": 0.035956174423336054, | |
| "num_tokens": 12080056.0, | |
| "mean_token_accuracy": 0.9888209789991379, | |
| "epoch": 3.599004975124378, | |
| "step": 1810 | |
| }, | |
| { | |
| "loss": 0.03283187747001648, | |
| "grad_norm": 0.6245374083518982, | |
| "learning_rate": 0.00015145432754951784, | |
| "entropy": 0.03530628806038294, | |
| "num_tokens": 12146900.0, | |
| "mean_token_accuracy": 0.9889325089752674, | |
| "epoch": 3.6189054726368157, | |
| "step": 1820 | |
| }, | |
| { | |
| "loss": 0.03508978486061096, | |
| "grad_norm": 0.8539674878120422, | |
| "learning_rate": 0.000150889426176282, | |
| "entropy": 0.03957471833855379, | |
| "num_tokens": 12213024.0, | |
| "mean_token_accuracy": 0.9876590810716153, | |
| "epoch": 3.638805970149254, | |
| "step": 1830 | |
| }, | |
| { | |
| "loss": 0.0289535254240036, | |
| "grad_norm": 0.44117090106010437, | |
| "learning_rate": 0.00015032232474852371, | |
| "entropy": 0.03894171481369994, | |
| "num_tokens": 12278205.0, | |
| "mean_token_accuracy": 0.9898740701377392, | |
| "epoch": 3.6587064676616916, | |
| "step": 1840 | |
| }, | |
| { | |
| "loss": 0.03545762598514557, | |
| "grad_norm": 0.5383766889572144, | |
| "learning_rate": 0.00014975304778320364, | |
| "entropy": 0.04185012882517185, | |
| "num_tokens": 12346281.0, | |
| "mean_token_accuracy": 0.987272110581398, | |
| "epoch": 3.6786069651741293, | |
| "step": 1850 | |
| }, | |
| { | |
| "loss": 0.036569598317146304, | |
| "grad_norm": 0.43862003087997437, | |
| "learning_rate": 0.00014918161989133552, | |
| "entropy": 0.039183757436694576, | |
| "num_tokens": 12416040.0, | |
| "mean_token_accuracy": 0.9884304039180278, | |
| "epoch": 3.698507462686567, | |
| "step": 1860 | |
| }, | |
| { | |
| "loss": 0.046497902274131774, | |
| "grad_norm": 0.24663235247135162, | |
| "learning_rate": 0.0001486080657769219, | |
| "entropy": 0.04875118255149573, | |
| "num_tokens": 12483739.0, | |
| "mean_token_accuracy": 0.9872626729309559, | |
| "epoch": 3.7184079601990048, | |
| "step": 1870 | |
| }, | |
| { | |
| "loss": 0.0350829690694809, | |
| "grad_norm": 0.27893203496932983, | |
| "learning_rate": 0.00014803241023588637, | |
| "entropy": 0.039400185630074705, | |
| "num_tokens": 12550264.0, | |
| "mean_token_accuracy": 0.9897375635802745, | |
| "epoch": 3.738308457711443, | |
| "step": 1880 | |
| }, | |
| { | |
| "loss": 0.048194342851638795, | |
| "grad_norm": 0.5404137372970581, | |
| "learning_rate": 0.00014745467815500157, | |
| "entropy": 0.045675123430555686, | |
| "num_tokens": 12615635.0, | |
| "mean_token_accuracy": 0.9822327814996242, | |
| "epoch": 3.7582089552238807, | |
| "step": 1890 | |
| }, | |
| { | |
| "loss": 0.041299638152122495, | |
| "grad_norm": 0.22043873369693756, | |
| "learning_rate": 0.0001468748945108131, | |
| "entropy": 0.0417529508471489, | |
| "num_tokens": 12682762.0, | |
| "mean_token_accuracy": 0.9876552060246467, | |
| "epoch": 3.7781094527363184, | |
| "step": 1900 | |
| }, | |
| { | |
| "loss": 0.03528775572776795, | |
| "grad_norm": 0.38801971077919006, | |
| "learning_rate": 0.00014629308436856, | |
| "entropy": 0.0380144338007085, | |
| "num_tokens": 12749704.0, | |
| "mean_token_accuracy": 0.988120187819004, | |
| "epoch": 3.798009950248756, | |
| "step": 1910 | |
| }, | |
| { | |
| "loss": 0.028483673930168152, | |
| "grad_norm": 0.7580603957176208, | |
| "learning_rate": 0.0001457092728810909, | |
| "entropy": 0.036843240825692194, | |
| "num_tokens": 12815360.0, | |
| "mean_token_accuracy": 0.9913376808166504, | |
| "epoch": 3.817910447761194, | |
| "step": 1920 | |
| }, | |
| { | |
| "loss": 0.034877949953079225, | |
| "grad_norm": 0.41240543127059937, | |
| "learning_rate": 0.00014512348528777675, | |
| "entropy": 0.03646660551312379, | |
| "num_tokens": 12883173.0, | |
| "mean_token_accuracy": 0.991103533655405, | |
| "epoch": 3.837810945273632, | |
| "step": 1930 | |
| }, | |
| { | |
| "loss": 0.02729986608028412, | |
| "grad_norm": 0.431193470954895, | |
| "learning_rate": 0.00014453574691341957, | |
| "entropy": 0.03418905301514315, | |
| "num_tokens": 12949048.0, | |
| "mean_token_accuracy": 0.9920941665768623, | |
| "epoch": 3.8577114427860697, | |
| "step": 1940 | |
| }, | |
| { | |
| "loss": 0.03583741784095764, | |
| "grad_norm": 0.8341835737228394, | |
| "learning_rate": 0.00014394608316715764, | |
| "entropy": 0.0317019106762018, | |
| "num_tokens": 13017021.0, | |
| "mean_token_accuracy": 0.9879241831600666, | |
| "epoch": 3.8776119402985074, | |
| "step": 1950 | |
| }, | |
| { | |
| "loss": 0.04165915548801422, | |
| "grad_norm": 0.54258793592453, | |
| "learning_rate": 0.00014335451954136712, | |
| "entropy": 0.04781383575173095, | |
| "num_tokens": 13084247.0, | |
| "mean_token_accuracy": 0.9850596696138382, | |
| "epoch": 3.897512437810945, | |
| "step": 1960 | |
| }, | |
| { | |
| "loss": 0.023919902741909027, | |
| "grad_norm": 1.1518906354904175, | |
| "learning_rate": 0.00014276108161055977, | |
| "entropy": 0.03323271934641525, | |
| "num_tokens": 13149886.0, | |
| "mean_token_accuracy": 0.9917417526245117, | |
| "epoch": 3.917412935323383, | |
| "step": 1970 | |
| }, | |
| { | |
| "loss": 0.041414502263069156, | |
| "grad_norm": 0.4409993588924408, | |
| "learning_rate": 0.00014216579503027748, | |
| "entropy": 0.04212225944211241, | |
| "num_tokens": 13216848.0, | |
| "mean_token_accuracy": 0.987069496512413, | |
| "epoch": 3.937313432835821, | |
| "step": 1980 | |
| }, | |
| { | |
| "loss": 0.026138466596603394, | |
| "grad_norm": 0.4671242833137512, | |
| "learning_rate": 0.000141568685535983, | |
| "entropy": 0.03499636381748132, | |
| "num_tokens": 13282491.0, | |
| "mean_token_accuracy": 0.9915538854897022, | |
| "epoch": 3.9572139303482587, | |
| "step": 1990 | |
| }, | |
| { | |
| "loss": 0.03617530465126038, | |
| "grad_norm": 0.6693828105926514, | |
| "learning_rate": 0.00014096977894194741, | |
| "entropy": 0.03698443787143333, | |
| "num_tokens": 13351431.0, | |
| "mean_token_accuracy": 0.9893846169114113, | |
| "epoch": 3.9771144278606965, | |
| "step": 2000 | |
| }, | |
| { | |
| "loss": 0.04186029434204101, | |
| "grad_norm": 0.6782835721969604, | |
| "learning_rate": 0.0001403691011401342, | |
| "entropy": 0.04769496822264045, | |
| "num_tokens": 13418199.0, | |
| "mean_token_accuracy": 0.9833127044141292, | |
| "epoch": 3.997014925373134, | |
| "step": 2010 | |
| }, | |
| { | |
| "eval_loss": 0.29686856269836426, | |
| "eval_runtime": 67.8045, | |
| "eval_samples_per_second": 15.264, | |
| "eval_steps_per_second": 7.64, | |
| "eval_entropy": 0.08914197777698184, | |
| "eval_num_tokens": 13427944.0, | |
| "eval_mean_token_accuracy": 0.9404666641274014, | |
| "epoch": 4.0, | |
| "step": 2012 | |
| }, | |
| { | |
| "loss": 0.022541260719299315, | |
| "grad_norm": 0.330778032541275, | |
| "learning_rate": 0.00013976667809907967, | |
| "entropy": 0.03496060195673061, | |
| "num_tokens": 13480426.0, | |
| "mean_token_accuracy": 0.992155635827466, | |
| "epoch": 4.01592039800995, | |
| "step": 2020 | |
| }, | |
| { | |
| "loss": 0.020323292911052705, | |
| "grad_norm": 0.6635566353797913, | |
| "learning_rate": 0.00013916253586277046, | |
| "entropy": 0.025642355805030093, | |
| "num_tokens": 13548017.0, | |
| "mean_token_accuracy": 0.9932406023144722, | |
| "epoch": 4.035820895522388, | |
| "step": 2030 | |
| }, | |
| { | |
| "loss": 0.018497467041015625, | |
| "grad_norm": 0.3545978367328644, | |
| "learning_rate": 0.00013855670054951764, | |
| "entropy": 0.02235944996937178, | |
| "num_tokens": 13615907.0, | |
| "mean_token_accuracy": 0.9940000854432582, | |
| "epoch": 4.055721393034826, | |
| "step": 2040 | |
| }, | |
| { | |
| "loss": 0.016379858553409576, | |
| "grad_norm": 0.333023339509964, | |
| "learning_rate": 0.00013794919835082733, | |
| "entropy": 0.02085629914072342, | |
| "num_tokens": 13682334.0, | |
| "mean_token_accuracy": 0.9944917172193527, | |
| "epoch": 4.075621890547263, | |
| "step": 2050 | |
| }, | |
| { | |
| "loss": 0.025261417031288147, | |
| "grad_norm": 0.4259703457355499, | |
| "learning_rate": 0.00013734005553026863, | |
| "entropy": 0.022779430758964735, | |
| "num_tokens": 13750009.0, | |
| "mean_token_accuracy": 0.9915114663541317, | |
| "epoch": 4.095522388059702, | |
| "step": 2060 | |
| }, | |
| { | |
| "loss": 0.020985141396522522, | |
| "grad_norm": 0.5059815645217896, | |
| "learning_rate": 0.00013672929842233807, | |
| "entropy": 0.030157123084063642, | |
| "num_tokens": 13816528.0, | |
| "mean_token_accuracy": 0.9944588914513588, | |
| "epoch": 4.115422885572139, | |
| "step": 2070 | |
| }, | |
| { | |
| "loss": 0.019122378528118135, | |
| "grad_norm": 0.27580463886260986, | |
| "learning_rate": 0.00013611695343132118, | |
| "entropy": 0.023731828895688523, | |
| "num_tokens": 13883127.0, | |
| "mean_token_accuracy": 0.9933131754398346, | |
| "epoch": 4.135323383084577, | |
| "step": 2080 | |
| }, | |
| { | |
| "loss": 0.018794278800487518, | |
| "grad_norm": 0.4173099994659424, | |
| "learning_rate": 0.00013550304703015083, | |
| "entropy": 0.02200460991152795, | |
| "num_tokens": 13949694.0, | |
| "mean_token_accuracy": 0.993462772667408, | |
| "epoch": 4.155223880597015, | |
| "step": 2090 | |
| }, | |
| { | |
| "loss": 0.022590236365795137, | |
| "grad_norm": 0.2273045778274536, | |
| "learning_rate": 0.000134887605759263, | |
| "entropy": 0.028880356659647076, | |
| "num_tokens": 14016869.0, | |
| "mean_token_accuracy": 0.9921673700213433, | |
| "epoch": 4.1751243781094525, | |
| "step": 2100 | |
| }, | |
| { | |
| "loss": 0.028038790822029112, | |
| "grad_norm": 0.3150612413883209, | |
| "learning_rate": 0.00013427065622544914, | |
| "entropy": 0.029227956954855472, | |
| "num_tokens": 14082895.0, | |
| "mean_token_accuracy": 0.9920774199068546, | |
| "epoch": 4.195024875621891, | |
| "step": 2110 | |
| }, | |
| { | |
| "loss": 0.02197175920009613, | |
| "grad_norm": 0.4716366231441498, | |
| "learning_rate": 0.0001336522251007061, | |
| "entropy": 0.026419853966217488, | |
| "num_tokens": 14148483.0, | |
| "mean_token_accuracy": 0.9921677350997925, | |
| "epoch": 4.214925373134328, | |
| "step": 2120 | |
| }, | |
| { | |
| "loss": 0.019603276252746583, | |
| "grad_norm": 0.6820113062858582, | |
| "learning_rate": 0.00013303233912108283, | |
| "entropy": 0.023932285644696093, | |
| "num_tokens": 14214410.0, | |
| "mean_token_accuracy": 0.9929466463625432, | |
| "epoch": 4.234825870646766, | |
| "step": 2130 | |
| }, | |
| { | |
| "loss": 0.02161734998226166, | |
| "grad_norm": 0.5260307788848877, | |
| "learning_rate": 0.00013241102508552475, | |
| "entropy": 0.023090845490514766, | |
| "num_tokens": 14281433.0, | |
| "mean_token_accuracy": 0.9935616083443165, | |
| "epoch": 4.254726368159204, | |
| "step": 2140 | |
| }, | |
| { | |
| "loss": 0.020520062744617464, | |
| "grad_norm": 0.5381481051445007, | |
| "learning_rate": 0.00013178830985471505, | |
| "entropy": 0.0253336504829349, | |
| "num_tokens": 14347059.0, | |
| "mean_token_accuracy": 0.9924183614552021, | |
| "epoch": 4.2746268656716415, | |
| "step": 2150 | |
| }, | |
| { | |
| "loss": 0.02292156219482422, | |
| "grad_norm": 0.4821164906024933, | |
| "learning_rate": 0.00013116422034991347, | |
| "entropy": 0.023389648927695815, | |
| "num_tokens": 14412949.0, | |
| "mean_token_accuracy": 0.9910940513014793, | |
| "epoch": 4.29452736318408, | |
| "step": 2160 | |
| }, | |
| { | |
| "loss": 0.020588286221027374, | |
| "grad_norm": 0.314314067363739, | |
| "learning_rate": 0.00013053878355179244, | |
| "entropy": 0.028456786752212793, | |
| "num_tokens": 14479732.0, | |
| "mean_token_accuracy": 0.9933287680149079, | |
| "epoch": 4.314427860696517, | |
| "step": 2170 | |
| }, | |
| { | |
| "loss": 0.022340704500675202, | |
| "grad_norm": 0.1762777715921402, | |
| "learning_rate": 0.00012991202649927056, | |
| "entropy": 0.024215608432132284, | |
| "num_tokens": 14547229.0, | |
| "mean_token_accuracy": 0.993473107367754, | |
| "epoch": 4.334328358208955, | |
| "step": 2180 | |
| }, | |
| { | |
| "loss": 0.01929643303155899, | |
| "grad_norm": 0.5308461785316467, | |
| "learning_rate": 0.00012928397628834395, | |
| "entropy": 0.022466996918956282, | |
| "num_tokens": 14615321.0, | |
| "mean_token_accuracy": 0.9933658391237259, | |
| "epoch": 4.354228855721393, | |
| "step": 2190 | |
| }, | |
| { | |
| "loss": 0.01675943285226822, | |
| "grad_norm": 0.2166927307844162, | |
| "learning_rate": 0.0001286546600709144, | |
| "entropy": 0.02382153325015679, | |
| "num_tokens": 14681484.0, | |
| "mean_token_accuracy": 0.9929957866668702, | |
| "epoch": 4.374129353233831, | |
| "step": 2200 | |
| }, | |
| { | |
| "loss": 0.01616147756576538, | |
| "grad_norm": 0.31190088391304016, | |
| "learning_rate": 0.00012802410505361592, | |
| "entropy": 0.021566898842866066, | |
| "num_tokens": 14748246.0, | |
| "mean_token_accuracy": 0.9953425668179989, | |
| "epoch": 4.394029850746269, | |
| "step": 2210 | |
| }, | |
| { | |
| "loss": 0.020143616199493408, | |
| "grad_norm": 0.5401660799980164, | |
| "learning_rate": 0.0001273923384966383, | |
| "entropy": 0.019891528951120563, | |
| "num_tokens": 14815008.0, | |
| "mean_token_accuracy": 0.9928821548819542, | |
| "epoch": 4.413930348258706, | |
| "step": 2220 | |
| }, | |
| { | |
| "loss": 0.023275299370288847, | |
| "grad_norm": 0.5358554720878601, | |
| "learning_rate": 0.00012675938771254872, | |
| "entropy": 0.027829346724320202, | |
| "num_tokens": 14880257.0, | |
| "mean_token_accuracy": 0.9924751475453377, | |
| "epoch": 4.433830845771144, | |
| "step": 2230 | |
| }, | |
| { | |
| "loss": 0.018383045494556428, | |
| "grad_norm": 0.30791008472442627, | |
| "learning_rate": 0.00012612528006511093, | |
| "entropy": 0.01990911388711538, | |
| "num_tokens": 14946824.0, | |
| "mean_token_accuracy": 0.9936320453882217, | |
| "epoch": 4.453731343283582, | |
| "step": 2240 | |
| }, | |
| { | |
| "loss": 0.018728886544704438, | |
| "grad_norm": 0.4665677547454834, | |
| "learning_rate": 0.0001254900429681023, | |
| "entropy": 0.02076636096899165, | |
| "num_tokens": 15012580.0, | |
| "mean_token_accuracy": 0.9947231650352478, | |
| "epoch": 4.47363184079602, | |
| "step": 2250 | |
| }, | |
| { | |
| "loss": 0.02189120650291443, | |
| "grad_norm": 0.22175736725330353, | |
| "learning_rate": 0.0001248537038841285, | |
| "entropy": 0.025514183560881067, | |
| "num_tokens": 15078417.0, | |
| "mean_token_accuracy": 0.9927590176463127, | |
| "epoch": 4.493532338308458, | |
| "step": 2260 | |
| }, | |
| { | |
| "loss": 0.018778012692928316, | |
| "grad_norm": 0.37904441356658936, | |
| "learning_rate": 0.0001242162903234365, | |
| "entropy": 0.024176929768873378, | |
| "num_tokens": 15145267.0, | |
| "mean_token_accuracy": 0.9923839196562767, | |
| "epoch": 4.513432835820895, | |
| "step": 2270 | |
| }, | |
| { | |
| "loss": 0.021106557548046113, | |
| "grad_norm": 0.4318683445453644, | |
| "learning_rate": 0.00012357782984272504, | |
| "entropy": 0.017634534194803562, | |
| "num_tokens": 15211816.0, | |
| "mean_token_accuracy": 0.9937898091971874, | |
| "epoch": 4.533333333333333, | |
| "step": 2280 | |
| }, | |
| { | |
| "loss": 0.015814051032066345, | |
| "grad_norm": 0.24642682075500488, | |
| "learning_rate": 0.0001229383500439534, | |
| "entropy": 0.020605951044126415, | |
| "num_tokens": 15278462.0, | |
| "mean_token_accuracy": 0.9958261914551259, | |
| "epoch": 4.553233830845771, | |
| "step": 2290 | |
| }, | |
| { | |
| "loss": 0.01898970454931259, | |
| "grad_norm": 0.3638794422149658, | |
| "learning_rate": 0.00012229787857314801, | |
| "entropy": 0.020515447400248375, | |
| "num_tokens": 15346966.0, | |
| "mean_token_accuracy": 0.9943824775516987, | |
| "epoch": 4.573134328358209, | |
| "step": 2300 | |
| }, | |
| { | |
| "loss": 0.01712157726287842, | |
| "grad_norm": 0.287197470664978, | |
| "learning_rate": 0.00012165644311920741, | |
| "entropy": 0.019921001550392246, | |
| "num_tokens": 15414059.0, | |
| "mean_token_accuracy": 0.9939340233802796, | |
| "epoch": 4.593034825870647, | |
| "step": 2310 | |
| }, | |
| { | |
| "loss": 0.029004442691802978, | |
| "grad_norm": 0.613610565662384, | |
| "learning_rate": 0.000121014071412705, | |
| "entropy": 0.03135428504901938, | |
| "num_tokens": 15479736.0, | |
| "mean_token_accuracy": 0.9910656772553921, | |
| "epoch": 4.612935323383084, | |
| "step": 2320 | |
| }, | |
| { | |
| "loss": 0.02000347375869751, | |
| "grad_norm": 0.5387656092643738, | |
| "learning_rate": 0.00012037079122469044, | |
| "entropy": 0.02796420800877968, | |
| "num_tokens": 15546436.0, | |
| "mean_token_accuracy": 0.9945271402597428, | |
| "epoch": 4.632835820895522, | |
| "step": 2330 | |
| }, | |
| { | |
| "loss": 0.02363658994436264, | |
| "grad_norm": 0.3635019361972809, | |
| "learning_rate": 0.00011972663036548884, | |
| "entropy": 0.022651451456476936, | |
| "num_tokens": 15612938.0, | |
| "mean_token_accuracy": 0.9910245075821876, | |
| "epoch": 4.65273631840796, | |
| "step": 2340 | |
| }, | |
| { | |
| "loss": 0.023246921598911285, | |
| "grad_norm": 0.25204190611839294, | |
| "learning_rate": 0.0001190816166834985, | |
| "entropy": 0.027166575644514523, | |
| "num_tokens": 15681309.0, | |
| "mean_token_accuracy": 0.9916775986552239, | |
| "epoch": 4.672636815920398, | |
| "step": 2350 | |
| }, | |
| { | |
| "loss": 0.020346690714359284, | |
| "grad_norm": 0.37856990098953247, | |
| "learning_rate": 0.00011843577806398705, | |
| "entropy": 0.025465619296301156, | |
| "num_tokens": 15749150.0, | |
| "mean_token_accuracy": 0.9934266820549965, | |
| "epoch": 4.692537313432836, | |
| "step": 2360 | |
| }, | |
| { | |
| "loss": 0.022995509207248688, | |
| "grad_norm": 0.3728092610836029, | |
| "learning_rate": 0.00011778914242788588, | |
| "entropy": 0.02361324623489054, | |
| "num_tokens": 15815098.0, | |
| "mean_token_accuracy": 0.9924490824341774, | |
| "epoch": 4.712437810945273, | |
| "step": 2370 | |
| }, | |
| { | |
| "loss": 0.024149328470230103, | |
| "grad_norm": 0.44309478998184204, | |
| "learning_rate": 0.00011714173773058304, | |
| "entropy": 0.023943239758955313, | |
| "num_tokens": 15882589.0, | |
| "mean_token_accuracy": 0.9915248282253742, | |
| "epoch": 4.732338308457711, | |
| "step": 2380 | |
| }, | |
| { | |
| "loss": 0.02506372332572937, | |
| "grad_norm": 0.4280659556388855, | |
| "learning_rate": 0.00011649359196071459, | |
| "entropy": 0.027685758270672524, | |
| "num_tokens": 15947514.0, | |
| "mean_token_accuracy": 0.9927876427769661, | |
| "epoch": 4.7522388059701495, | |
| "step": 2390 | |
| }, | |
| { | |
| "loss": 0.01892734318971634, | |
| "grad_norm": 0.1368793547153473, | |
| "learning_rate": 0.00011584473313895483, | |
| "entropy": 0.02604678466304904, | |
| "num_tokens": 16015196.0, | |
| "mean_token_accuracy": 0.9935356914997101, | |
| "epoch": 4.772139303482587, | |
| "step": 2400 | |
| }, | |
| { | |
| "loss": 0.022761589288711546, | |
| "grad_norm": 0.2650626301765442, | |
| "learning_rate": 0.00011519518931680463, | |
| "entropy": 0.02288266723626293, | |
| "num_tokens": 16084048.0, | |
| "mean_token_accuracy": 0.9923152230679989, | |
| "epoch": 4.792039800995025, | |
| "step": 2410 | |
| }, | |
| { | |
| "loss": 0.02219443619251251, | |
| "grad_norm": 0.28764352202415466, | |
| "learning_rate": 0.00011454498857537893, | |
| "entropy": 0.021520700085238785, | |
| "num_tokens": 16151465.0, | |
| "mean_token_accuracy": 0.9929785504937172, | |
| "epoch": 4.811940298507462, | |
| "step": 2420 | |
| }, | |
| { | |
| "loss": 0.01702689528465271, | |
| "grad_norm": 0.265876442193985, | |
| "learning_rate": 0.00011389415902419251, | |
| "entropy": 0.022896296047838403, | |
| "num_tokens": 16219886.0, | |
| "mean_token_accuracy": 0.9943966299295426, | |
| "epoch": 4.8318407960199, | |
| "step": 2430 | |
| }, | |
| { | |
| "loss": 0.02124347984790802, | |
| "grad_norm": 0.4632825255393982, | |
| "learning_rate": 0.00011324272879994509, | |
| "entropy": 0.024235972843598574, | |
| "num_tokens": 16286732.0, | |
| "mean_token_accuracy": 0.9925971522927284, | |
| "epoch": 4.8517412935323385, | |
| "step": 2440 | |
| }, | |
| { | |
| "loss": 0.02112184017896652, | |
| "grad_norm": 0.7702906131744385, | |
| "learning_rate": 0.00011259072606530452, | |
| "entropy": 0.02376203608873766, | |
| "num_tokens": 16353324.0, | |
| "mean_token_accuracy": 0.9932762250304222, | |
| "epoch": 4.871641791044776, | |
| "step": 2450 | |
| }, | |
| { | |
| "loss": 0.020696014165878296, | |
| "grad_norm": 0.43466606736183167, | |
| "learning_rate": 0.0001119381790076896, | |
| "entropy": 0.020602873369352893, | |
| "num_tokens": 16420045.0, | |
| "mean_token_accuracy": 0.9940371952950955, | |
| "epoch": 4.891542288557214, | |
| "step": 2460 | |
| }, | |
| { | |
| "loss": 0.02507336139678955, | |
| "grad_norm": 0.7223814725875854, | |
| "learning_rate": 0.00011128511583805122, | |
| "entropy": 0.026875402212681365, | |
| "num_tokens": 16487489.0, | |
| "mean_token_accuracy": 0.9920289881527424, | |
| "epoch": 4.911442786069652, | |
| "step": 2470 | |
| }, | |
| { | |
| "loss": 0.026432156562805176, | |
| "grad_norm": 0.47006839513778687, | |
| "learning_rate": 0.00011063156478965293, | |
| "entropy": 0.03200415483734105, | |
| "num_tokens": 16556385.0, | |
| "mean_token_accuracy": 0.9915605559945107, | |
| "epoch": 4.931343283582089, | |
| "step": 2480 | |
| }, | |
| { | |
| "loss": 0.019228325784206392, | |
| "grad_norm": 0.6098710298538208, | |
| "learning_rate": 0.00010997755411685022, | |
| "entropy": 0.021561289162491448, | |
| "num_tokens": 16622218.0, | |
| "mean_token_accuracy": 0.9942485235631466, | |
| "epoch": 4.951243781094528, | |
| "step": 2490 | |
| }, | |
| { | |
| "loss": 0.02225508540868759, | |
| "grad_norm": 0.6580213904380798, | |
| "learning_rate": 0.0001093231120938692, | |
| "entropy": 0.025235205114586278, | |
| "num_tokens": 16688229.0, | |
| "mean_token_accuracy": 0.992252241820097, | |
| "epoch": 4.971144278606965, | |
| "step": 2500 | |
| }, | |
| { | |
| "loss": 0.02393328994512558, | |
| "grad_norm": 0.2273155003786087, | |
| "learning_rate": 0.000108668267013584, | |
| "entropy": 0.02115868393520941, | |
| "num_tokens": 16755861.0, | |
| "mean_token_accuracy": 0.9941031068563462, | |
| "epoch": 4.991044776119403, | |
| "step": 2510 | |
| }, | |
| { | |
| "eval_loss": 0.3079036474227905, | |
| "eval_runtime": 67.1765, | |
| "eval_samples_per_second": 15.407, | |
| "eval_steps_per_second": 7.711, | |
| "eval_entropy": 0.07137546143402403, | |
| "eval_num_tokens": 16784930.0, | |
| "eval_mean_token_accuracy": 0.9430849159776474, | |
| "epoch": 5.0, | |
| "step": 2515 | |
| }, | |
| { | |
| "train_runtime": 8534.0451, | |
| "train_samples_per_second": 9.421, | |
| "train_steps_per_second": 0.589, | |
| "total_flos": 3.4880192385122304e+16, | |
| "train_loss": 0.10587940257242612, | |
| "epoch": 5.0, | |
| "step": 2515 | |
| }, | |
| { | |
| "eval_loss": 0.24770455062389374, | |
| "eval_runtime": 67.4582, | |
| "eval_samples_per_second": 15.343, | |
| "eval_steps_per_second": 7.679, | |
| "eval_entropy": 0.13267684354209502, | |
| "eval_num_tokens": 16784930.0, | |
| "eval_mean_token_accuracy": 0.9410935246806347, | |
| "epoch": 5.0, | |
| "step": 2515 | |
| } | |
| ] | |
| } |