Instructions to use codegenstudio/codegen-350M-sql2nosql-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use codegenstudio/codegen-350M-sql2nosql-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("/kaggle/working/models/base/Salesforce__codegen-350M-multi") model = PeftModel.from_pretrained(base_model, "codegenstudio/codegen-350M-sql2nosql-lora") - Notebooks
- Google Colab
- Kaggle
| { | |
| "task": "sql2nosql", | |
| "model_name": "Salesforce/codegen-350M-multi", | |
| "device": "cuda:0", | |
| "checkpoint_run": "v4", | |
| "adapter_path": "/kaggle/working/models/checkpoints/v4/sql2nosql", | |
| "train_rows": 7998, | |
| "eval_rows": 1035, | |
| "train_loss": 0.04043002005169789, | |
| "eval_loss": 0.03645886108279228, | |
| "best_eval_loss": 0.03645886108279228, | |
| "train_runtime_seconds": 10605.5798, | |
| "mlflow_run_id": null, | |
| "filter_stats": { | |
| "input_rows": 8040, | |
| "kept_rows": 8040, | |
| "skipped_rows": 42, | |
| "skip_reasons": { | |
| "sequence_too_long": 42 | |
| } | |
| }, | |
| "token_stats": { | |
| "rows": 7998, | |
| "avg_prompt_tokens": 319.43, | |
| "avg_target_tokens": 75.03, | |
| "avg_total_tokens": 394.45, | |
| "max_total_tokens": 1328, | |
| "skipped_too_long_target": 42, | |
| "skipped_too_long_prompt": 0 | |
| }, | |
| "log_history": [ | |
| { | |
| "loss": 1.3475940704345704, | |
| "grad_norm": 1.7302765846252441, | |
| "learning_rate": 7.2e-06, | |
| "entropy": 1.1209821447730064, | |
| "num_tokens": 65756.0, | |
| "mean_token_accuracy": 0.6775479473173618, | |
| "epoch": 0.020005001250312578, | |
| "step": 10 | |
| }, | |
| { | |
| "loss": 1.1782958984375, | |
| "grad_norm": 1.598680853843689, | |
| "learning_rate": 1.52e-05, | |
| "entropy": 1.0718491852283478, | |
| "num_tokens": 127350.0, | |
| "mean_token_accuracy": 0.6978455670177937, | |
| "epoch": 0.040010002500625155, | |
| "step": 20 | |
| }, | |
| { | |
| "loss": 0.9067621231079102, | |
| "grad_norm": 1.7650020122528076, | |
| "learning_rate": 2.32e-05, | |
| "entropy": 0.9551009342074395, | |
| "num_tokens": 191970.0, | |
| "mean_token_accuracy": 0.7337856531143189, | |
| "epoch": 0.06001500375093773, | |
| "step": 30 | |
| }, | |
| { | |
| "loss": 0.6462621212005615, | |
| "grad_norm": 1.2754874229431152, | |
| "learning_rate": 3.12e-05, | |
| "entropy": 0.7395371329039335, | |
| "num_tokens": 257775.0, | |
| "mean_token_accuracy": 0.815752174705267, | |
| "epoch": 0.08002000500125031, | |
| "step": 40 | |
| }, | |
| { | |
| "loss": 0.4761983871459961, | |
| "grad_norm": 1.6131094694137573, | |
| "learning_rate": 3.9200000000000004e-05, | |
| "entropy": 0.5132245156913996, | |
| "num_tokens": 319507.0, | |
| "mean_token_accuracy": 0.8625759541988373, | |
| "epoch": 0.1000250062515629, | |
| "step": 50 | |
| }, | |
| { | |
| "loss": 0.34327900409698486, | |
| "grad_norm": 1.9517418146133423, | |
| "learning_rate": 4.72e-05, | |
| "entropy": 0.35333055444061756, | |
| "num_tokens": 380952.0, | |
| "mean_token_accuracy": 0.9010166764259339, | |
| "epoch": 0.12003000750187547, | |
| "step": 60 | |
| }, | |
| { | |
| "loss": 0.25612337589263917, | |
| "grad_norm": 1.8101425170898438, | |
| "learning_rate": 5.520000000000001e-05, | |
| "entropy": 0.2581108913756907, | |
| "num_tokens": 443849.0, | |
| "mean_token_accuracy": 0.9237508125603199, | |
| "epoch": 0.14003500875218805, | |
| "step": 70 | |
| }, | |
| { | |
| "loss": 0.20029537677764891, | |
| "grad_norm": 1.4003955125808716, | |
| "learning_rate": 6.32e-05, | |
| "entropy": 0.23392133321613073, | |
| "num_tokens": 505868.0, | |
| "mean_token_accuracy": 0.940458069741726, | |
| "epoch": 0.16004001000250062, | |
| "step": 80 | |
| }, | |
| { | |
| "loss": 0.1597532272338867, | |
| "grad_norm": 1.2149077653884888, | |
| "learning_rate": 7.12e-05, | |
| "entropy": 0.1773814239539206, | |
| "num_tokens": 570792.0, | |
| "mean_token_accuracy": 0.9488845877349377, | |
| "epoch": 0.1800450112528132, | |
| "step": 90 | |
| }, | |
| { | |
| "loss": 0.15449292659759523, | |
| "grad_norm": 1.4650107622146606, | |
| "learning_rate": 7.920000000000001e-05, | |
| "entropy": 0.16433264631778002, | |
| "num_tokens": 634476.0, | |
| "mean_token_accuracy": 0.9529499627649785, | |
| "epoch": 0.2000500125031258, | |
| "step": 100 | |
| }, | |
| { | |
| "loss": 0.14979339838027955, | |
| "grad_norm": 1.2412768602371216, | |
| "learning_rate": 8.72e-05, | |
| "entropy": 0.1567419718950987, | |
| "num_tokens": 697928.0, | |
| "mean_token_accuracy": 0.9547351159155368, | |
| "epoch": 0.22005501375343836, | |
| "step": 110 | |
| }, | |
| { | |
| "loss": 0.15537588596343993, | |
| "grad_norm": 1.0941258668899536, | |
| "learning_rate": 9.52e-05, | |
| "entropy": 0.14790078573860227, | |
| "num_tokens": 761970.0, | |
| "mean_token_accuracy": 0.9548502139747143, | |
| "epoch": 0.24006001500375093, | |
| "step": 120 | |
| }, | |
| { | |
| "loss": 0.12376174926757813, | |
| "grad_norm": 1.3730136156082153, | |
| "learning_rate": 0.0001032, | |
| "entropy": 0.14068418610841035, | |
| "num_tokens": 827125.0, | |
| "mean_token_accuracy": 0.9643007285892964, | |
| "epoch": 0.26006501625406353, | |
| "step": 130 | |
| }, | |
| { | |
| "loss": 0.10419689416885376, | |
| "grad_norm": 0.859259843826294, | |
| "learning_rate": 0.00011120000000000002, | |
| "entropy": 0.10366909941658378, | |
| "num_tokens": 890387.0, | |
| "mean_token_accuracy": 0.9708971530199051, | |
| "epoch": 0.2800700175043761, | |
| "step": 140 | |
| }, | |
| { | |
| "loss": 0.09227448105812072, | |
| "grad_norm": 0.9888283610343933, | |
| "learning_rate": 0.0001192, | |
| "entropy": 0.10762261427007616, | |
| "num_tokens": 956032.0, | |
| "mean_token_accuracy": 0.9713370814919472, | |
| "epoch": 0.30007501875468867, | |
| "step": 150 | |
| }, | |
| { | |
| "loss": 0.1083062767982483, | |
| "grad_norm": 0.9545535445213318, | |
| "learning_rate": 0.0001272, | |
| "entropy": 0.1130900933407247, | |
| "num_tokens": 1020072.0, | |
| "mean_token_accuracy": 0.9707557298243046, | |
| "epoch": 0.32008002000500124, | |
| "step": 160 | |
| }, | |
| { | |
| "loss": 0.07606152892112732, | |
| "grad_norm": 0.9866153597831726, | |
| "learning_rate": 0.0001352, | |
| "entropy": 0.0895556318340823, | |
| "num_tokens": 1083781.0, | |
| "mean_token_accuracy": 0.973467419296503, | |
| "epoch": 0.3400850212553138, | |
| "step": 170 | |
| }, | |
| { | |
| "loss": 0.10022411346435547, | |
| "grad_norm": 1.0180600881576538, | |
| "learning_rate": 0.0001432, | |
| "entropy": 0.09170240506064146, | |
| "num_tokens": 1145466.0, | |
| "mean_token_accuracy": 0.9705780848860741, | |
| "epoch": 0.3600900225056264, | |
| "step": 180 | |
| }, | |
| { | |
| "loss": 0.10711104869842529, | |
| "grad_norm": 1.129612684249878, | |
| "learning_rate": 0.00015120000000000002, | |
| "entropy": 0.11426927694119512, | |
| "num_tokens": 1208095.0, | |
| "mean_token_accuracy": 0.9698869682848453, | |
| "epoch": 0.380095023755939, | |
| "step": 190 | |
| }, | |
| { | |
| "loss": 0.08630093932151794, | |
| "grad_norm": 0.6177782416343689, | |
| "learning_rate": 0.00015920000000000002, | |
| "entropy": 0.09287996906787158, | |
| "num_tokens": 1273403.0, | |
| "mean_token_accuracy": 0.977255067974329, | |
| "epoch": 0.4001000250062516, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 0.07393635511398315, | |
| "grad_norm": 0.766137957572937, | |
| "learning_rate": 0.0001672, | |
| "entropy": 0.0744264661334455, | |
| "num_tokens": 1334848.0, | |
| "mean_token_accuracy": 0.9792576834559441, | |
| "epoch": 0.42010502625656415, | |
| "step": 210 | |
| }, | |
| { | |
| "loss": 0.09994233846664428, | |
| "grad_norm": 0.6585826277732849, | |
| "learning_rate": 0.0001752, | |
| "entropy": 0.10690853425767273, | |
| "num_tokens": 1400976.0, | |
| "mean_token_accuracy": 0.972873219102621, | |
| "epoch": 0.4401100275068767, | |
| "step": 220 | |
| }, | |
| { | |
| "loss": 0.06631548404693603, | |
| "grad_norm": 0.7318869233131409, | |
| "learning_rate": 0.0001832, | |
| "entropy": 0.06925062141381204, | |
| "num_tokens": 1462530.0, | |
| "mean_token_accuracy": 0.9832681395113468, | |
| "epoch": 0.4601150287571893, | |
| "step": 230 | |
| }, | |
| { | |
| "loss": 0.09161096215248107, | |
| "grad_norm": 0.46499672532081604, | |
| "learning_rate": 0.0001912, | |
| "entropy": 0.08352572850417346, | |
| "num_tokens": 1523663.0, | |
| "mean_token_accuracy": 0.9757984310388566, | |
| "epoch": 0.48012003000750186, | |
| "step": 240 | |
| }, | |
| { | |
| "loss": 0.05958831310272217, | |
| "grad_norm": 0.6253766417503357, | |
| "learning_rate": 0.00019920000000000002, | |
| "entropy": 0.06921031260862946, | |
| "num_tokens": 1588657.0, | |
| "mean_token_accuracy": 0.982395163923502, | |
| "epoch": 0.5001250312578145, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 0.06900651454925537, | |
| "grad_norm": 0.6349820494651794, | |
| "learning_rate": 0.00019999822839757118, | |
| "entropy": 0.06543620774755254, | |
| "num_tokens": 1653260.0, | |
| "mean_token_accuracy": 0.9801992796361446, | |
| "epoch": 0.5201300325081271, | |
| "step": 260 | |
| }, | |
| { | |
| "loss": 0.06709518432617187, | |
| "grad_norm": 0.6046717166900635, | |
| "learning_rate": 0.00019999210442038162, | |
| "entropy": 0.06953847317490727, | |
| "num_tokens": 1718687.0, | |
| "mean_token_accuracy": 0.9797540627419948, | |
| "epoch": 0.5401350337584396, | |
| "step": 270 | |
| }, | |
| { | |
| "loss": 0.09603813290596008, | |
| "grad_norm": 0.7929577231407166, | |
| "learning_rate": 0.00019998160646461522, | |
| "entropy": 0.08993639135733247, | |
| "num_tokens": 1779338.0, | |
| "mean_token_accuracy": 0.9745012931525707, | |
| "epoch": 0.5601400350087522, | |
| "step": 280 | |
| }, | |
| { | |
| "loss": 0.06412749290466309, | |
| "grad_norm": 0.3916383683681488, | |
| "learning_rate": 0.00019996673498948658, | |
| "entropy": 0.06307904429268092, | |
| "num_tokens": 1842872.0, | |
| "mean_token_accuracy": 0.9828441753983498, | |
| "epoch": 0.5801450362590648, | |
| "step": 290 | |
| }, | |
| { | |
| "loss": 0.051730161905288695, | |
| "grad_norm": 0.38883084058761597, | |
| "learning_rate": 0.00019994749064552214, | |
| "entropy": 0.05729433842934668, | |
| "num_tokens": 1904154.0, | |
| "mean_token_accuracy": 0.9857619300484657, | |
| "epoch": 0.6001500375093773, | |
| "step": 300 | |
| }, | |
| { | |
| "loss": 0.042625024914741516, | |
| "grad_norm": 0.6382091045379639, | |
| "learning_rate": 0.0001999238742745319, | |
| "entropy": 0.03964498438872397, | |
| "num_tokens": 1966060.0, | |
| "mean_token_accuracy": 0.9874393172562123, | |
| "epoch": 0.6201550387596899, | |
| "step": 310 | |
| }, | |
| { | |
| "loss": 0.06732727885246277, | |
| "grad_norm": 0.6905948519706726, | |
| "learning_rate": 0.00019989588690957249, | |
| "entropy": 0.05733265266753733, | |
| "num_tokens": 2031939.0, | |
| "mean_token_accuracy": 0.982555440813303, | |
| "epoch": 0.6401600400100025, | |
| "step": 320 | |
| }, | |
| { | |
| "loss": 0.058036553859710696, | |
| "grad_norm": 0.4337286949157715, | |
| "learning_rate": 0.0001998635297749018, | |
| "entropy": 0.07143733124248683, | |
| "num_tokens": 2095271.0, | |
| "mean_token_accuracy": 0.9844090364873409, | |
| "epoch": 0.660165041260315, | |
| "step": 330 | |
| }, | |
| { | |
| "loss": 0.053340816497802736, | |
| "grad_norm": 0.3526521921157837, | |
| "learning_rate": 0.00019982680428592584, | |
| "entropy": 0.04944599290611222, | |
| "num_tokens": 2158321.0, | |
| "mean_token_accuracy": 0.9839612312614918, | |
| "epoch": 0.6801700425106276, | |
| "step": 340 | |
| }, | |
| { | |
| "loss": 0.051858377456665036, | |
| "grad_norm": 0.5422689318656921, | |
| "learning_rate": 0.00019978571204913638, | |
| "entropy": 0.06322509178426117, | |
| "num_tokens": 2225062.0, | |
| "mean_token_accuracy": 0.9867838315665722, | |
| "epoch": 0.7001750437609402, | |
| "step": 350 | |
| }, | |
| { | |
| "loss": 0.05608519911766052, | |
| "grad_norm": 0.7101793885231018, | |
| "learning_rate": 0.000199740254862041, | |
| "entropy": 0.046866965352091935, | |
| "num_tokens": 2291157.0, | |
| "mean_token_accuracy": 0.9851541951298713, | |
| "epoch": 0.7201800450112528, | |
| "step": 360 | |
| }, | |
| { | |
| "loss": 0.056741136312484744, | |
| "grad_norm": 0.6186705827713013, | |
| "learning_rate": 0.00019969043471308436, | |
| "entropy": 0.06618997184559702, | |
| "num_tokens": 2353621.0, | |
| "mean_token_accuracy": 0.9844918318092823, | |
| "epoch": 0.7401850462615653, | |
| "step": 370 | |
| }, | |
| { | |
| "loss": 0.05278732180595398, | |
| "grad_norm": 0.9665183424949646, | |
| "learning_rate": 0.00019963625378156114, | |
| "entropy": 0.052203354140510784, | |
| "num_tokens": 2415518.0, | |
| "mean_token_accuracy": 0.9863728702068328, | |
| "epoch": 0.760190047511878, | |
| "step": 380 | |
| }, | |
| { | |
| "loss": 0.044900187849998476, | |
| "grad_norm": 0.45738333463668823, | |
| "learning_rate": 0.00019957771443752083, | |
| "entropy": 0.04799637275282294, | |
| "num_tokens": 2477716.0, | |
| "mean_token_accuracy": 0.9872696734964848, | |
| "epoch": 0.7801950487621906, | |
| "step": 390 | |
| }, | |
| { | |
| "loss": 0.043438228964805606, | |
| "grad_norm": 0.4040285646915436, | |
| "learning_rate": 0.00019951481924166396, | |
| "entropy": 0.045062902639620005, | |
| "num_tokens": 2540807.0, | |
| "mean_token_accuracy": 0.9878960207104683, | |
| "epoch": 0.8002000500125032, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 0.04615793526172638, | |
| "grad_norm": 0.4411618411540985, | |
| "learning_rate": 0.0001994475709452301, | |
| "entropy": 0.036265855759847906, | |
| "num_tokens": 2603019.0, | |
| "mean_token_accuracy": 0.9870041370391845, | |
| "epoch": 0.8202050512628157, | |
| "step": 410 | |
| }, | |
| { | |
| "loss": 0.045778676867485046, | |
| "grad_norm": 0.31862467527389526, | |
| "learning_rate": 0.0001993759724898777, | |
| "entropy": 0.05851077587576583, | |
| "num_tokens": 2667216.0, | |
| "mean_token_accuracy": 0.9873291261494159, | |
| "epoch": 0.8402100525131283, | |
| "step": 420 | |
| }, | |
| { | |
| "loss": 0.03828286230564117, | |
| "grad_norm": 0.29344919323921204, | |
| "learning_rate": 0.00019930002700755507, | |
| "entropy": 0.03860169492545538, | |
| "num_tokens": 2729805.0, | |
| "mean_token_accuracy": 0.988411296159029, | |
| "epoch": 0.8602150537634409, | |
| "step": 430 | |
| }, | |
| { | |
| "loss": 0.038545310497283936, | |
| "grad_norm": 0.4283672571182251, | |
| "learning_rate": 0.00019921973782036366, | |
| "entropy": 0.03951184251927771, | |
| "num_tokens": 2793292.0, | |
| "mean_token_accuracy": 0.9878928653895855, | |
| "epoch": 0.8802200550137534, | |
| "step": 440 | |
| }, | |
| { | |
| "loss": 0.03233465254306793, | |
| "grad_norm": 0.7173567414283752, | |
| "learning_rate": 0.0001991351084404126, | |
| "entropy": 0.028071055363398045, | |
| "num_tokens": 2855909.0, | |
| "mean_token_accuracy": 0.9912850938737392, | |
| "epoch": 0.900225056264066, | |
| "step": 450 | |
| }, | |
| { | |
| "loss": 0.040875044465065, | |
| "grad_norm": 0.3380762040615082, | |
| "learning_rate": 0.00019904614256966512, | |
| "entropy": 0.04781279567687306, | |
| "num_tokens": 2916597.0, | |
| "mean_token_accuracy": 0.9889427930116653, | |
| "epoch": 0.9202300575143786, | |
| "step": 460 | |
| }, | |
| { | |
| "loss": 0.04227911233901978, | |
| "grad_norm": 0.21747978031635284, | |
| "learning_rate": 0.0001989528440997767, | |
| "entropy": 0.045654052757890896, | |
| "num_tokens": 2977012.0, | |
| "mean_token_accuracy": 0.987830163538456, | |
| "epoch": 0.9402350587646912, | |
| "step": 470 | |
| }, | |
| { | |
| "loss": 0.03866271674633026, | |
| "grad_norm": 0.3250534236431122, | |
| "learning_rate": 0.00019885521711192453, | |
| "entropy": 0.039897680119611326, | |
| "num_tokens": 3039866.0, | |
| "mean_token_accuracy": 0.9888145305216313, | |
| "epoch": 0.9602400600150037, | |
| "step": 480 | |
| }, | |
| { | |
| "loss": 0.030780380964279173, | |
| "grad_norm": 0.5867555141448975, | |
| "learning_rate": 0.00019875326587662941, | |
| "entropy": 0.0344677664746996, | |
| "num_tokens": 3102450.0, | |
| "mean_token_accuracy": 0.9910528786480427, | |
| "epoch": 0.9802450612653163, | |
| "step": 490 | |
| }, | |
| { | |
| "loss": 0.04189955592155457, | |
| "grad_norm": 0.19166764616966248, | |
| "learning_rate": 0.00019864699485356866, | |
| "entropy": 0.03601513006665473, | |
| "num_tokens": 3162838.0, | |
| "mean_token_accuracy": 0.989976388744161, | |
| "epoch": 1.0, | |
| "step": 500 | |
| }, | |
| { | |
| "eval_loss": 0.04872545599937439, | |
| "eval_runtime": 69.4136, | |
| "eval_samples_per_second": 14.911, | |
| "eval_steps_per_second": 7.463, | |
| "eval_entropy": 0.051686967685315256, | |
| "eval_num_tokens": 3162838.0, | |
| "eval_mean_token_accuracy": 0.9849747346865164, | |
| "epoch": 1.0, | |
| "step": 500 | |
| }, | |
| { | |
| "loss": 0.03468368649482727, | |
| "grad_norm": 0.2645007371902466, | |
| "learning_rate": 0.00019853640869138103, | |
| "entropy": 0.04407569046597928, | |
| "num_tokens": 3228763.0, | |
| "mean_token_accuracy": 0.990016209334135, | |
| "epoch": 1.0200050012503126, | |
| "step": 510 | |
| }, | |
| { | |
| "loss": 0.03389493525028229, | |
| "grad_norm": 0.40270644426345825, | |
| "learning_rate": 0.00019842151222746357, | |
| "entropy": 0.035535094334045426, | |
| "num_tokens": 3293010.0, | |
| "mean_token_accuracy": 0.9887583516538143, | |
| "epoch": 1.0400100025006251, | |
| "step": 520 | |
| }, | |
| { | |
| "loss": 0.030898410081863403, | |
| "grad_norm": 0.2681713104248047, | |
| "learning_rate": 0.00019830231048775977, | |
| "entropy": 0.028601143200648948, | |
| "num_tokens": 3354919.0, | |
| "mean_token_accuracy": 0.9903686709702015, | |
| "epoch": 1.0600150037509377, | |
| "step": 530 | |
| }, | |
| { | |
| "loss": 0.03407395482063293, | |
| "grad_norm": 0.23451267182826996, | |
| "learning_rate": 0.00019817880868653993, | |
| "entropy": 0.034907517378451304, | |
| "num_tokens": 3415784.0, | |
| "mean_token_accuracy": 0.9890573389828206, | |
| "epoch": 1.0800200050012503, | |
| "step": 540 | |
| }, | |
| { | |
| "loss": 0.029421544075012206, | |
| "grad_norm": 0.23950988054275513, | |
| "learning_rate": 0.0001980510122261729, | |
| "entropy": 0.033313815778819846, | |
| "num_tokens": 3480364.0, | |
| "mean_token_accuracy": 0.9916689246892929, | |
| "epoch": 1.1000250062515629, | |
| "step": 550 | |
| }, | |
| { | |
| "loss": 0.020369285345077516, | |
| "grad_norm": 0.4551165997982025, | |
| "learning_rate": 0.00019791892669688988, | |
| "entropy": 0.02486751726246439, | |
| "num_tokens": 3542678.0, | |
| "mean_token_accuracy": 0.9940513521432877, | |
| "epoch": 1.1200300075018754, | |
| "step": 560 | |
| }, | |
| { | |
| "loss": 0.02770337164402008, | |
| "grad_norm": 0.20443572103977203, | |
| "learning_rate": 0.00019778255787653978, | |
| "entropy": 0.029150180192664264, | |
| "num_tokens": 3609086.0, | |
| "mean_token_accuracy": 0.9897698886692524, | |
| "epoch": 1.140035008752188, | |
| "step": 570 | |
| }, | |
| { | |
| "loss": 0.025546741485595704, | |
| "grad_norm": 0.3653818368911743, | |
| "learning_rate": 0.00019764191173033663, | |
| "entropy": 0.031121585314394906, | |
| "num_tokens": 3670310.0, | |
| "mean_token_accuracy": 0.9925875566899777, | |
| "epoch": 1.1600400100025006, | |
| "step": 580 | |
| }, | |
| { | |
| "loss": 0.027299800515174867, | |
| "grad_norm": 0.4811317026615143, | |
| "learning_rate": 0.00019749699441059843, | |
| "entropy": 0.02902457951568067, | |
| "num_tokens": 3735307.0, | |
| "mean_token_accuracy": 0.9906462356448174, | |
| "epoch": 1.1800450112528131, | |
| "step": 590 | |
| }, | |
| { | |
| "loss": 0.02665548324584961, | |
| "grad_norm": 0.21709105372428894, | |
| "learning_rate": 0.00019734781225647828, | |
| "entropy": 0.030135014103143475, | |
| "num_tokens": 3797213.0, | |
| "mean_token_accuracy": 0.9932463668286801, | |
| "epoch": 1.2000500125031257, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 0.03535972833633423, | |
| "grad_norm": 0.631148636341095, | |
| "learning_rate": 0.00019719437179368688, | |
| "entropy": 0.03371675145754125, | |
| "num_tokens": 3859400.0, | |
| "mean_token_accuracy": 0.9895499177277088, | |
| "epoch": 1.2200550137534383, | |
| "step": 610 | |
| }, | |
| { | |
| "loss": 0.027658408880233763, | |
| "grad_norm": 0.42123743891716003, | |
| "learning_rate": 0.00019703667973420706, | |
| "entropy": 0.028748418507166206, | |
| "num_tokens": 3920848.0, | |
| "mean_token_accuracy": 0.9910015679895878, | |
| "epoch": 1.2400600150037508, | |
| "step": 620 | |
| }, | |
| { | |
| "loss": 0.028230640292167663, | |
| "grad_norm": 0.23473748564720154, | |
| "learning_rate": 0.00019687474297600045, | |
| "entropy": 0.029886699473718182, | |
| "num_tokens": 3984529.0, | |
| "mean_token_accuracy": 0.9922301307320595, | |
| "epoch": 1.2600650162540634, | |
| "step": 630 | |
| }, | |
| { | |
| "loss": 0.027012214064598083, | |
| "grad_norm": 0.2611916661262512, | |
| "learning_rate": 0.00019670856860270542, | |
| "entropy": 0.03151440276997164, | |
| "num_tokens": 4048411.0, | |
| "mean_token_accuracy": 0.9917375601828098, | |
| "epoch": 1.280070017504376, | |
| "step": 640 | |
| }, | |
| { | |
| "loss": 0.023584455251693726, | |
| "grad_norm": 0.12378375232219696, | |
| "learning_rate": 0.0001965381638833274, | |
| "entropy": 0.027149295064737088, | |
| "num_tokens": 4112116.0, | |
| "mean_token_accuracy": 0.9936468034982682, | |
| "epoch": 1.3000750187546886, | |
| "step": 650 | |
| }, | |
| { | |
| "loss": 0.025832393765449525, | |
| "grad_norm": 0.18841037154197693, | |
| "learning_rate": 0.00019636353627192082, | |
| "entropy": 0.028390987019520253, | |
| "num_tokens": 4175458.0, | |
| "mean_token_accuracy": 0.9933209784328938, | |
| "epoch": 1.3200800200050011, | |
| "step": 660 | |
| }, | |
| { | |
| "loss": 0.032191649079322815, | |
| "grad_norm": 0.292369544506073, | |
| "learning_rate": 0.00019618469340726319, | |
| "entropy": 0.032682666774780954, | |
| "num_tokens": 4236466.0, | |
| "mean_token_accuracy": 0.9895716637372971, | |
| "epoch": 1.3400850212553137, | |
| "step": 670 | |
| }, | |
| { | |
| "loss": 0.02866535782814026, | |
| "grad_norm": 0.2205415517091751, | |
| "learning_rate": 0.00019600164311252068, | |
| "entropy": 0.032574003856279884, | |
| "num_tokens": 4299775.0, | |
| "mean_token_accuracy": 0.991417796164751, | |
| "epoch": 1.3600900225056263, | |
| "step": 680 | |
| }, | |
| { | |
| "loss": 0.03524776101112366, | |
| "grad_norm": 0.3276292681694031, | |
| "learning_rate": 0.00019581439339490624, | |
| "entropy": 0.04169052811048459, | |
| "num_tokens": 4365609.0, | |
| "mean_token_accuracy": 0.9886757604777813, | |
| "epoch": 1.380095023755939, | |
| "step": 690 | |
| }, | |
| { | |
| "loss": 0.035996857285499576, | |
| "grad_norm": 0.4103780686855316, | |
| "learning_rate": 0.0001956229524453291, | |
| "entropy": 0.03188371795695275, | |
| "num_tokens": 4432330.0, | |
| "mean_token_accuracy": 0.9892666183412075, | |
| "epoch": 1.4001000250062516, | |
| "step": 700 | |
| }, | |
| { | |
| "loss": 0.02328706532716751, | |
| "grad_norm": 0.24775762856006622, | |
| "learning_rate": 0.00019542732863803662, | |
| "entropy": 0.02871296225930564, | |
| "num_tokens": 4496465.0, | |
| "mean_token_accuracy": 0.9937438026070595, | |
| "epoch": 1.4201050262565642, | |
| "step": 710 | |
| }, | |
| { | |
| "loss": 0.03300818204879761, | |
| "grad_norm": 0.25881657004356384, | |
| "learning_rate": 0.00019522753053024787, | |
| "entropy": 0.03388670613931026, | |
| "num_tokens": 4560755.0, | |
| "mean_token_accuracy": 0.9890970505774022, | |
| "epoch": 1.4401100275068768, | |
| "step": 720 | |
| }, | |
| { | |
| "loss": 0.03214167952537537, | |
| "grad_norm": 0.23787066340446472, | |
| "learning_rate": 0.00019502356686177926, | |
| "entropy": 0.03670836841047276, | |
| "num_tokens": 4625202.0, | |
| "mean_token_accuracy": 0.9903383336961269, | |
| "epoch": 1.4601150287571893, | |
| "step": 730 | |
| }, | |
| { | |
| "loss": 0.031187814474105836, | |
| "grad_norm": 0.31929901242256165, | |
| "learning_rate": 0.00019481544655466245, | |
| "entropy": 0.03299383492558263, | |
| "num_tokens": 4692174.0, | |
| "mean_token_accuracy": 0.9905215993523597, | |
| "epoch": 1.480120030007502, | |
| "step": 740 | |
| }, | |
| { | |
| "loss": 0.025655516982078554, | |
| "grad_norm": 0.24006661772727966, | |
| "learning_rate": 0.00019460317871275394, | |
| "entropy": 0.023855643330898603, | |
| "num_tokens": 4753192.0, | |
| "mean_token_accuracy": 0.9913376875221729, | |
| "epoch": 1.5001250312578145, | |
| "step": 750 | |
| }, | |
| { | |
| "loss": 0.03126271665096283, | |
| "grad_norm": 0.2834339737892151, | |
| "learning_rate": 0.00019438677262133668, | |
| "entropy": 0.033190094074234365, | |
| "num_tokens": 4817884.0, | |
| "mean_token_accuracy": 0.9907064586877823, | |
| "epoch": 1.520130032508127, | |
| "step": 760 | |
| }, | |
| { | |
| "loss": 0.033395078778266904, | |
| "grad_norm": 0.4165857136249542, | |
| "learning_rate": 0.00019416623774671425, | |
| "entropy": 0.03176074127841275, | |
| "num_tokens": 4879601.0, | |
| "mean_token_accuracy": 0.9902952447533607, | |
| "epoch": 1.5401350337584396, | |
| "step": 770 | |
| }, | |
| { | |
| "loss": 0.02917470932006836, | |
| "grad_norm": 0.5297831296920776, | |
| "learning_rate": 0.00019394158373579645, | |
| "entropy": 0.03441936054150574, | |
| "num_tokens": 4946026.0, | |
| "mean_token_accuracy": 0.9917018190026283, | |
| "epoch": 1.5601400350087522, | |
| "step": 780 | |
| }, | |
| { | |
| "loss": 0.02672044336795807, | |
| "grad_norm": 0.3761133849620819, | |
| "learning_rate": 0.00019371282041567752, | |
| "entropy": 0.029212182367336935, | |
| "num_tokens": 5009097.0, | |
| "mean_token_accuracy": 0.9930847369134426, | |
| "epoch": 1.5801450362590648, | |
| "step": 790 | |
| }, | |
| { | |
| "loss": 0.0338908702135086, | |
| "grad_norm": 0.2545328438282013, | |
| "learning_rate": 0.0001934799577932062, | |
| "entropy": 0.03556556548574008, | |
| "num_tokens": 5076314.0, | |
| "mean_token_accuracy": 0.990411739051342, | |
| "epoch": 1.6001500375093773, | |
| "step": 800 | |
| }, | |
| { | |
| "loss": 0.022386419773101806, | |
| "grad_norm": 0.3428667187690735, | |
| "learning_rate": 0.0001932430060545479, | |
| "entropy": 0.02515874128730502, | |
| "num_tokens": 5135522.0, | |
| "mean_token_accuracy": 0.9932228110730648, | |
| "epoch": 1.62015503875969, | |
| "step": 810 | |
| }, | |
| { | |
| "loss": 0.02211230844259262, | |
| "grad_norm": 0.19730041921138763, | |
| "learning_rate": 0.00019300197556473936, | |
| "entropy": 0.021622967024450192, | |
| "num_tokens": 5198651.0, | |
| "mean_token_accuracy": 0.993052315711975, | |
| "epoch": 1.6401600400100025, | |
| "step": 820 | |
| }, | |
| { | |
| "loss": 0.021593029797077178, | |
| "grad_norm": 0.24043497443199158, | |
| "learning_rate": 0.00019275687686723497, | |
| "entropy": 0.022755468662944624, | |
| "num_tokens": 5258441.0, | |
| "mean_token_accuracy": 0.9927247293293476, | |
| "epoch": 1.660165041260315, | |
| "step": 830 | |
| }, | |
| { | |
| "loss": 0.02743455469608307, | |
| "grad_norm": 0.22126108407974243, | |
| "learning_rate": 0.0001925077206834458, | |
| "entropy": 0.02988760783628095, | |
| "num_tokens": 5323635.0, | |
| "mean_token_accuracy": 0.9924947433173656, | |
| "epoch": 1.6801700425106276, | |
| "step": 840 | |
| }, | |
| { | |
| "loss": 0.01915370374917984, | |
| "grad_norm": 0.2528051435947418, | |
| "learning_rate": 0.00019225451791227052, | |
| "entropy": 0.022633779112948105, | |
| "num_tokens": 5388098.0, | |
| "mean_token_accuracy": 0.9935295671224594, | |
| "epoch": 1.7001750437609402, | |
| "step": 850 | |
| }, | |
| { | |
| "loss": 0.025216898322105406, | |
| "grad_norm": 0.35426992177963257, | |
| "learning_rate": 0.00019199727962961852, | |
| "entropy": 0.024347139010205864, | |
| "num_tokens": 5450303.0, | |
| "mean_token_accuracy": 0.9927972495555878, | |
| "epoch": 1.7201800450112528, | |
| "step": 860 | |
| }, | |
| { | |
| "loss": 0.022424712777137756, | |
| "grad_norm": 0.2603664994239807, | |
| "learning_rate": 0.00019173601708792566, | |
| "entropy": 0.02343553317186888, | |
| "num_tokens": 5513723.0, | |
| "mean_token_accuracy": 0.9926920354366302, | |
| "epoch": 1.7401850462615653, | |
| "step": 870 | |
| }, | |
| { | |
| "loss": 0.03777352273464203, | |
| "grad_norm": 0.21528302133083344, | |
| "learning_rate": 0.0001914707417156619, | |
| "entropy": 0.03952418522676453, | |
| "num_tokens": 5575942.0, | |
| "mean_token_accuracy": 0.9895162962377071, | |
| "epoch": 1.7601900475118781, | |
| "step": 880 | |
| }, | |
| { | |
| "loss": 0.02916957139968872, | |
| "grad_norm": 0.39761167764663696, | |
| "learning_rate": 0.00019120146511683142, | |
| "entropy": 0.037056630512233825, | |
| "num_tokens": 5640243.0, | |
| "mean_token_accuracy": 0.9906649015843868, | |
| "epoch": 1.7801950487621907, | |
| "step": 890 | |
| }, | |
| { | |
| "loss": 0.023631574213504793, | |
| "grad_norm": 0.43694376945495605, | |
| "learning_rate": 0.00019092819907046493, | |
| "entropy": 0.022086267481790857, | |
| "num_tokens": 5702162.0, | |
| "mean_token_accuracy": 0.9936031945049763, | |
| "epoch": 1.8002000500125033, | |
| "step": 900 | |
| }, | |
| { | |
| "loss": 0.025940075516700745, | |
| "grad_norm": 0.4214474558830261, | |
| "learning_rate": 0.00019065095553010458, | |
| "entropy": 0.028572715594782493, | |
| "num_tokens": 5764127.0, | |
| "mean_token_accuracy": 0.9905624501407146, | |
| "epoch": 1.8202050512628158, | |
| "step": 910 | |
| }, | |
| { | |
| "loss": 0.027613845467567445, | |
| "grad_norm": 0.40316465497016907, | |
| "learning_rate": 0.00019036974662328096, | |
| "entropy": 0.028239472245331854, | |
| "num_tokens": 5827235.0, | |
| "mean_token_accuracy": 0.991669587045908, | |
| "epoch": 1.8402100525131284, | |
| "step": 920 | |
| }, | |
| { | |
| "loss": 0.03177001476287842, | |
| "grad_norm": 0.524972677230835, | |
| "learning_rate": 0.0001900845846509827, | |
| "entropy": 0.028241146955406294, | |
| "num_tokens": 5890040.0, | |
| "mean_token_accuracy": 0.9903169378638268, | |
| "epoch": 1.860215053763441, | |
| "step": 930 | |
| }, | |
| { | |
| "loss": 0.02139996737241745, | |
| "grad_norm": 0.43904051184654236, | |
| "learning_rate": 0.00018979548208711817, | |
| "entropy": 0.03260187199921347, | |
| "num_tokens": 5953149.0, | |
| "mean_token_accuracy": 0.9935068063437938, | |
| "epoch": 1.8802200550137536, | |
| "step": 940 | |
| }, | |
| { | |
| "loss": 0.02489333599805832, | |
| "grad_norm": 0.25154390931129456, | |
| "learning_rate": 0.00018950245157797014, | |
| "entropy": 0.025593279630993494, | |
| "num_tokens": 6014655.0, | |
| "mean_token_accuracy": 0.9933448024094105, | |
| "epoch": 1.9002250562640661, | |
| "step": 950 | |
| }, | |
| { | |
| "loss": 0.02543329894542694, | |
| "grad_norm": 0.2318635731935501, | |
| "learning_rate": 0.00018920550594164238, | |
| "entropy": 0.025231685642211232, | |
| "num_tokens": 6078667.0, | |
| "mean_token_accuracy": 0.9929649449884892, | |
| "epoch": 1.9202300575143787, | |
| "step": 960 | |
| }, | |
| { | |
| "loss": 0.03582499623298645, | |
| "grad_norm": 0.2020518183708191, | |
| "learning_rate": 0.00018890465816749896, | |
| "entropy": 0.0415392193797743, | |
| "num_tokens": 6139688.0, | |
| "mean_token_accuracy": 0.9897747471928596, | |
| "epoch": 1.9402350587646913, | |
| "step": 970 | |
| }, | |
| { | |
| "loss": 0.023522551357746124, | |
| "grad_norm": 0.25302180647850037, | |
| "learning_rate": 0.00018859992141559615, | |
| "entropy": 0.026439224516798275, | |
| "num_tokens": 6203193.0, | |
| "mean_token_accuracy": 0.9931276544928551, | |
| "epoch": 1.9602400600150038, | |
| "step": 980 | |
| }, | |
| { | |
| "loss": 0.023089873790740966, | |
| "grad_norm": 0.37129050493240356, | |
| "learning_rate": 0.00018829130901610667, | |
| "entropy": 0.02257391346647637, | |
| "num_tokens": 6265353.0, | |
| "mean_token_accuracy": 0.9930807471275329, | |
| "epoch": 1.9802450612653164, | |
| "step": 990 | |
| }, | |
| { | |
| "loss": 0.020879687368869783, | |
| "grad_norm": 0.1416839361190796, | |
| "learning_rate": 0.00018797883446873662, | |
| "entropy": 0.024826381788765894, | |
| "num_tokens": 6325676.0, | |
| "mean_token_accuracy": 0.9931328839893583, | |
| "epoch": 2.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_loss": 0.042340315878391266, | |
| "eval_runtime": 69.2562, | |
| "eval_samples_per_second": 14.945, | |
| "eval_steps_per_second": 7.479, | |
| "eval_entropy": 0.028477752043098808, | |
| "eval_num_tokens": 6325676.0, | |
| "eval_mean_token_accuracy": 0.988268693211456, | |
| "epoch": 2.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "loss": 0.0183292493224144, | |
| "grad_norm": 0.33506715297698975, | |
| "learning_rate": 0.00018766251144213504, | |
| "entropy": 0.021088267347658986, | |
| "num_tokens": 6391016.0, | |
| "mean_token_accuracy": 0.9939773567020893, | |
| "epoch": 2.0200050012503126, | |
| "step": 1010 | |
| }, | |
| { | |
| "loss": 0.016541089117527007, | |
| "grad_norm": 0.10510263592004776, | |
| "learning_rate": 0.00018734235377329582, | |
| "entropy": 0.021377279089938382, | |
| "num_tokens": 6455040.0, | |
| "mean_token_accuracy": 0.9943198271095752, | |
| "epoch": 2.040010002500625, | |
| "step": 1020 | |
| }, | |
| { | |
| "loss": 0.017676208913326264, | |
| "grad_norm": 0.25538530945777893, | |
| "learning_rate": 0.0001870183754669526, | |
| "entropy": 0.01835900279111229, | |
| "num_tokens": 6517983.0, | |
| "mean_token_accuracy": 0.9943479098379612, | |
| "epoch": 2.0600150037509377, | |
| "step": 1030 | |
| }, | |
| { | |
| "loss": 0.018231543898582458, | |
| "grad_norm": 0.1953907310962677, | |
| "learning_rate": 0.00018669059069496594, | |
| "entropy": 0.024707998137455434, | |
| "num_tokens": 6582155.0, | |
| "mean_token_accuracy": 0.9940299488604069, | |
| "epoch": 2.0800200050012503, | |
| "step": 1040 | |
| }, | |
| { | |
| "loss": 0.015705856680870055, | |
| "grad_norm": 0.23519866168498993, | |
| "learning_rate": 0.00018635901379570377, | |
| "entropy": 0.016339628079731484, | |
| "num_tokens": 6644403.0, | |
| "mean_token_accuracy": 0.9944866336882114, | |
| "epoch": 2.100025006251563, | |
| "step": 1050 | |
| }, | |
| { | |
| "loss": 0.0239964097738266, | |
| "grad_norm": 0.7782704830169678, | |
| "learning_rate": 0.00018602365927341375, | |
| "entropy": 0.021186151236179285, | |
| "num_tokens": 6709057.0, | |
| "mean_token_accuracy": 0.9942199148237705, | |
| "epoch": 2.1200300075018754, | |
| "step": 1060 | |
| }, | |
| { | |
| "loss": 0.0214329332113266, | |
| "grad_norm": 0.25117242336273193, | |
| "learning_rate": 0.0001856845417975891, | |
| "entropy": 0.02400836138986051, | |
| "num_tokens": 6772040.0, | |
| "mean_token_accuracy": 0.99395372569561, | |
| "epoch": 2.140035008752188, | |
| "step": 1070 | |
| }, | |
| { | |
| "loss": 0.01707075983285904, | |
| "grad_norm": 0.24927817285060883, | |
| "learning_rate": 0.0001853416762023268, | |
| "entropy": 0.01854798578133341, | |
| "num_tokens": 6835866.0, | |
| "mean_token_accuracy": 0.9950113117694854, | |
| "epoch": 2.1600400100025006, | |
| "step": 1080 | |
| }, | |
| { | |
| "loss": 0.014785376191139222, | |
| "grad_norm": 0.24353672564029694, | |
| "learning_rate": 0.00018499507748567873, | |
| "entropy": 0.019260429358109833, | |
| "num_tokens": 6899725.0, | |
| "mean_token_accuracy": 0.9959283553063869, | |
| "epoch": 2.180045011252813, | |
| "step": 1090 | |
| }, | |
| { | |
| "loss": 0.019350311160087584, | |
| "grad_norm": 0.288215309381485, | |
| "learning_rate": 0.00018464476080899559, | |
| "entropy": 0.02487965851032641, | |
| "num_tokens": 6963141.0, | |
| "mean_token_accuracy": 0.9941258184611798, | |
| "epoch": 2.2000500125031257, | |
| "step": 1100 | |
| }, | |
| { | |
| "loss": 0.017427970468997956, | |
| "grad_norm": 0.0646059513092041, | |
| "learning_rate": 0.00018429074149626363, | |
| "entropy": 0.01580278711626306, | |
| "num_tokens": 7028325.0, | |
| "mean_token_accuracy": 0.9952689491212368, | |
| "epoch": 2.2200550137534383, | |
| "step": 1110 | |
| }, | |
| { | |
| "loss": 0.01726052612066269, | |
| "grad_norm": 0.160948246717453, | |
| "learning_rate": 0.0001839330350334345, | |
| "entropy": 0.020199327028240077, | |
| "num_tokens": 7092920.0, | |
| "mean_token_accuracy": 0.9933249458670617, | |
| "epoch": 2.240060015003751, | |
| "step": 1120 | |
| }, | |
| { | |
| "loss": 0.01608244627714157, | |
| "grad_norm": 0.2359917163848877, | |
| "learning_rate": 0.00018357165706774767, | |
| "entropy": 0.021389624777657445, | |
| "num_tokens": 7160997.0, | |
| "mean_token_accuracy": 0.9940837919712067, | |
| "epoch": 2.2600650162540634, | |
| "step": 1130 | |
| }, | |
| { | |
| "loss": 0.020376379787921905, | |
| "grad_norm": 0.07118914276361465, | |
| "learning_rate": 0.00018320662340704609, | |
| "entropy": 0.02022790874907514, | |
| "num_tokens": 7226007.0, | |
| "mean_token_accuracy": 0.9942706093192101, | |
| "epoch": 2.280070017504376, | |
| "step": 1140 | |
| }, | |
| { | |
| "loss": 0.01612715721130371, | |
| "grad_norm": 0.25310513377189636, | |
| "learning_rate": 0.00018283795001908457, | |
| "entropy": 0.01867675751855131, | |
| "num_tokens": 7287986.0, | |
| "mean_token_accuracy": 0.9942055746912957, | |
| "epoch": 2.3000750187546886, | |
| "step": 1150 | |
| }, | |
| { | |
| "loss": 0.016605789959430694, | |
| "grad_norm": 0.2142266184091568, | |
| "learning_rate": 0.0001824656530308315, | |
| "entropy": 0.015577676898101345, | |
| "num_tokens": 7349421.0, | |
| "mean_token_accuracy": 0.9948085315525532, | |
| "epoch": 2.320080020005001, | |
| "step": 1160 | |
| }, | |
| { | |
| "loss": 0.018196111917495726, | |
| "grad_norm": 0.07947535812854767, | |
| "learning_rate": 0.00018208974872776322, | |
| "entropy": 0.020357475349737798, | |
| "num_tokens": 7411941.0, | |
| "mean_token_accuracy": 0.993843074887991, | |
| "epoch": 2.3400850212553137, | |
| "step": 1170 | |
| }, | |
| { | |
| "loss": 0.016091108322143555, | |
| "grad_norm": 0.19202570617198944, | |
| "learning_rate": 0.00018171025355315164, | |
| "entropy": 0.017023067966511006, | |
| "num_tokens": 7474356.0, | |
| "mean_token_accuracy": 0.9953217662870883, | |
| "epoch": 2.3600900225056263, | |
| "step": 1180 | |
| }, | |
| { | |
| "loss": 0.015425822138786316, | |
| "grad_norm": 0.24460658431053162, | |
| "learning_rate": 0.00018132718410734515, | |
| "entropy": 0.01825423450791277, | |
| "num_tokens": 7536565.0, | |
| "mean_token_accuracy": 0.9943965286016464, | |
| "epoch": 2.380095023755939, | |
| "step": 1190 | |
| }, | |
| { | |
| "loss": 0.013514925539493561, | |
| "grad_norm": 0.24659694731235504, | |
| "learning_rate": 0.00018094055714704225, | |
| "entropy": 0.015542891589575447, | |
| "num_tokens": 7599751.0, | |
| "mean_token_accuracy": 0.9943179704248906, | |
| "epoch": 2.4001000250062514, | |
| "step": 1200 | |
| }, | |
| { | |
| "loss": 0.012726837396621704, | |
| "grad_norm": 0.2550601065158844, | |
| "learning_rate": 0.0001805503895845587, | |
| "entropy": 0.015307287167524919, | |
| "num_tokens": 7661520.0, | |
| "mean_token_accuracy": 0.9962130591273308, | |
| "epoch": 2.420105026256564, | |
| "step": 1210 | |
| }, | |
| { | |
| "loss": 0.012257835268974305, | |
| "grad_norm": 0.15603283047676086, | |
| "learning_rate": 0.00018015669848708767, | |
| "entropy": 0.01749844834121177, | |
| "num_tokens": 7726291.0, | |
| "mean_token_accuracy": 0.9954387851059436, | |
| "epoch": 2.4401100275068766, | |
| "step": 1220 | |
| }, | |
| { | |
| "loss": 0.018561355769634247, | |
| "grad_norm": 0.22746174037456512, | |
| "learning_rate": 0.0001797595010759531, | |
| "entropy": 0.019737370508664753, | |
| "num_tokens": 7788766.0, | |
| "mean_token_accuracy": 0.9940820440649987, | |
| "epoch": 2.460115028757189, | |
| "step": 1230 | |
| }, | |
| { | |
| "loss": 0.013849316537380219, | |
| "grad_norm": 0.3152976334095001, | |
| "learning_rate": 0.0001793588147258565, | |
| "entropy": 0.015929855390277227, | |
| "num_tokens": 7851396.0, | |
| "mean_token_accuracy": 0.9952766291797162, | |
| "epoch": 2.4801200300075017, | |
| "step": 1240 | |
| }, | |
| { | |
| "loss": 0.019299986958503722, | |
| "grad_norm": 0.2762889862060547, | |
| "learning_rate": 0.00017895465696411692, | |
| "entropy": 0.02108022033935413, | |
| "num_tokens": 7915421.0, | |
| "mean_token_accuracy": 0.9940553769469261, | |
| "epoch": 2.5001250312578147, | |
| "step": 1250 | |
| }, | |
| { | |
| "loss": 0.020875005424022673, | |
| "grad_norm": 0.24086585640907288, | |
| "learning_rate": 0.00017854704546990408, | |
| "entropy": 0.020866505106096157, | |
| "num_tokens": 7977133.0, | |
| "mean_token_accuracy": 0.9940896175801754, | |
| "epoch": 2.520130032508127, | |
| "step": 1260 | |
| }, | |
| { | |
| "loss": 0.018643879890441896, | |
| "grad_norm": 0.23781460523605347, | |
| "learning_rate": 0.0001781359980734653, | |
| "entropy": 0.020857046739547514, | |
| "num_tokens": 8040191.0, | |
| "mean_token_accuracy": 0.9929048053920269, | |
| "epoch": 2.54013503375844, | |
| "step": 1270 | |
| }, | |
| { | |
| "loss": 0.017947974801063537, | |
| "grad_norm": 0.2054099142551422, | |
| "learning_rate": 0.0001777215327553452, | |
| "entropy": 0.021198420476866885, | |
| "num_tokens": 8100152.0, | |
| "mean_token_accuracy": 0.9934561550617218, | |
| "epoch": 2.560140035008752, | |
| "step": 1280 | |
| }, | |
| { | |
| "loss": 0.0151192307472229, | |
| "grad_norm": 0.469458669424057, | |
| "learning_rate": 0.00017730366764559955, | |
| "entropy": 0.018285114454920405, | |
| "num_tokens": 8162591.0, | |
| "mean_token_accuracy": 0.9951836079359054, | |
| "epoch": 2.580145036259065, | |
| "step": 1290 | |
| }, | |
| { | |
| "loss": 0.0184975802898407, | |
| "grad_norm": 0.2882782518863678, | |
| "learning_rate": 0.00017688242102300192, | |
| "entropy": 0.018374070005665998, | |
| "num_tokens": 8225224.0, | |
| "mean_token_accuracy": 0.9948060251772404, | |
| "epoch": 2.600150037509377, | |
| "step": 1300 | |
| }, | |
| { | |
| "loss": 0.023296315968036652, | |
| "grad_norm": 0.21924524009227753, | |
| "learning_rate": 0.00017645781131424423, | |
| "entropy": 0.022974171601526906, | |
| "num_tokens": 8290274.0, | |
| "mean_token_accuracy": 0.9924322210252285, | |
| "epoch": 2.62015503875969, | |
| "step": 1310 | |
| }, | |
| { | |
| "loss": 0.017917373776435853, | |
| "grad_norm": 0.354758620262146, | |
| "learning_rate": 0.00017602985709313073, | |
| "entropy": 0.02169415617827326, | |
| "num_tokens": 8354370.0, | |
| "mean_token_accuracy": 0.9948078036308289, | |
| "epoch": 2.6401600400100023, | |
| "step": 1320 | |
| }, | |
| { | |
| "loss": 0.012286465615034103, | |
| "grad_norm": 0.4151551127433777, | |
| "learning_rate": 0.00017559857707976536, | |
| "entropy": 0.016268294051405972, | |
| "num_tokens": 8415022.0, | |
| "mean_token_accuracy": 0.9961770802736283, | |
| "epoch": 2.6601650412603153, | |
| "step": 1330 | |
| }, | |
| { | |
| "loss": 0.01499750316143036, | |
| "grad_norm": 0.4065402150154114, | |
| "learning_rate": 0.0001751639901397331, | |
| "entropy": 0.0170176492218161, | |
| "num_tokens": 8478286.0, | |
| "mean_token_accuracy": 0.9952280893921852, | |
| "epoch": 2.6801700425106274, | |
| "step": 1340 | |
| }, | |
| { | |
| "loss": 0.015018537640571594, | |
| "grad_norm": 0.1335880309343338, | |
| "learning_rate": 0.0001747261152832746, | |
| "entropy": 0.018367627350380646, | |
| "num_tokens": 8541154.0, | |
| "mean_token_accuracy": 0.9949840374290944, | |
| "epoch": 2.7001750437609404, | |
| "step": 1350 | |
| }, | |
| { | |
| "loss": 0.019237272441387177, | |
| "grad_norm": 0.20553363859653473, | |
| "learning_rate": 0.00017428497166445452, | |
| "entropy": 0.019403737914399245, | |
| "num_tokens": 8605361.0, | |
| "mean_token_accuracy": 0.9930156201124192, | |
| "epoch": 2.7201800450112525, | |
| "step": 1360 | |
| }, | |
| { | |
| "loss": 0.019147740304470064, | |
| "grad_norm": 0.31576329469680786, | |
| "learning_rate": 0.00017384057858032393, | |
| "entropy": 0.02298831292137038, | |
| "num_tokens": 8669155.0, | |
| "mean_token_accuracy": 0.9930574476718903, | |
| "epoch": 2.7401850462615656, | |
| "step": 1370 | |
| }, | |
| { | |
| "loss": 0.017152118682861327, | |
| "grad_norm": 0.21389739215373993, | |
| "learning_rate": 0.00017339295547007594, | |
| "entropy": 0.01718737747578416, | |
| "num_tokens": 8735019.0, | |
| "mean_token_accuracy": 0.995334691554308, | |
| "epoch": 2.760190047511878, | |
| "step": 1380 | |
| }, | |
| { | |
| "loss": 0.019429606199264527, | |
| "grad_norm": 0.26539650559425354, | |
| "learning_rate": 0.00017294212191419547, | |
| "entropy": 0.019683032816101332, | |
| "num_tokens": 8800972.0, | |
| "mean_token_accuracy": 0.9936951123178005, | |
| "epoch": 2.7801950487621907, | |
| "step": 1390 | |
| }, | |
| { | |
| "loss": 0.01909356415271759, | |
| "grad_norm": 0.2084941565990448, | |
| "learning_rate": 0.00017248809763360277, | |
| "entropy": 0.018636453218641692, | |
| "num_tokens": 8867596.0, | |
| "mean_token_accuracy": 0.9940625011920929, | |
| "epoch": 2.8002000500125033, | |
| "step": 1400 | |
| }, | |
| { | |
| "loss": 0.018046848475933075, | |
| "grad_norm": 0.21403200924396515, | |
| "learning_rate": 0.0001720309024887907, | |
| "entropy": 0.023316194582730532, | |
| "num_tokens": 8927516.0, | |
| "mean_token_accuracy": 0.9939217306673527, | |
| "epoch": 2.820205051262816, | |
| "step": 1410 | |
| }, | |
| { | |
| "loss": 0.018755699694156646, | |
| "grad_norm": 0.33148443698883057, | |
| "learning_rate": 0.000171570556478956, | |
| "entropy": 0.01655098560877377, | |
| "num_tokens": 8989089.0, | |
| "mean_token_accuracy": 0.9942230053246022, | |
| "epoch": 2.8402100525131284, | |
| "step": 1420 | |
| }, | |
| { | |
| "loss": 0.024141687154769897, | |
| "grad_norm": 0.18521511554718018, | |
| "learning_rate": 0.00017110707974112447, | |
| "entropy": 0.02549898542056326, | |
| "num_tokens": 9054435.0, | |
| "mean_token_accuracy": 0.9930150359869003, | |
| "epoch": 2.860215053763441, | |
| "step": 1430 | |
| }, | |
| { | |
| "loss": 0.020157690346240997, | |
| "grad_norm": 0.23067928850650787, | |
| "learning_rate": 0.0001706404925492701, | |
| "entropy": 0.01900827525241766, | |
| "num_tokens": 9114274.0, | |
| "mean_token_accuracy": 0.9943146407604218, | |
| "epoch": 2.8802200550137536, | |
| "step": 1440 | |
| }, | |
| { | |
| "loss": 0.014147150516510009, | |
| "grad_norm": 0.5235961079597473, | |
| "learning_rate": 0.00017017081531342813, | |
| "entropy": 0.01623811650206335, | |
| "num_tokens": 9174841.0, | |
| "mean_token_accuracy": 0.9944271765649318, | |
| "epoch": 2.900225056264066, | |
| "step": 1450 | |
| }, | |
| { | |
| "loss": 0.022856634855270386, | |
| "grad_norm": 0.11377973109483719, | |
| "learning_rate": 0.00016969806857880241, | |
| "entropy": 0.023971330239146483, | |
| "num_tokens": 9239456.0, | |
| "mean_token_accuracy": 0.9932261377573013, | |
| "epoch": 2.9202300575143787, | |
| "step": 1460 | |
| }, | |
| { | |
| "loss": 0.02486345320940018, | |
| "grad_norm": 0.12835904955863953, | |
| "learning_rate": 0.00016922227302486667, | |
| "entropy": 0.02552748184389202, | |
| "num_tokens": 9305144.0, | |
| "mean_token_accuracy": 0.9918816141784191, | |
| "epoch": 2.9402350587646913, | |
| "step": 1470 | |
| }, | |
| { | |
| "loss": 0.018220885097980498, | |
| "grad_norm": 0.18033206462860107, | |
| "learning_rate": 0.00016874344946445974, | |
| "entropy": 0.019867337332107125, | |
| "num_tokens": 9365854.0, | |
| "mean_token_accuracy": 0.9945706635713577, | |
| "epoch": 2.960240060015004, | |
| "step": 1480 | |
| }, | |
| { | |
| "loss": 0.01618766337633133, | |
| "grad_norm": 0.2495020180940628, | |
| "learning_rate": 0.00016826161884287533, | |
| "entropy": 0.01948691344150575, | |
| "num_tokens": 9427287.0, | |
| "mean_token_accuracy": 0.9956672258675099, | |
| "epoch": 2.9802450612653164, | |
| "step": 1490 | |
| }, | |
| { | |
| "loss": 0.024902991950511932, | |
| "grad_norm": 0.2727943956851959, | |
| "learning_rate": 0.00016777680223694575, | |
| "entropy": 0.022937397798228586, | |
| "num_tokens": 9488514.0, | |
| "mean_token_accuracy": 0.9909723401069641, | |
| "epoch": 3.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "eval_loss": 0.03645886108279228, | |
| "eval_runtime": 69.2921, | |
| "eval_samples_per_second": 14.937, | |
| "eval_steps_per_second": 7.476, | |
| "eval_entropy": 0.02839457441272365, | |
| "eval_num_tokens": 9488514.0, | |
| "eval_mean_token_accuracy": 0.9902446437986661, | |
| "epoch": 3.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "loss": 0.014892478287220002, | |
| "grad_norm": 0.26308536529541016, | |
| "learning_rate": 0.00016728902085411996, | |
| "entropy": 0.02168392370658694, | |
| "num_tokens": 9553582.0, | |
| "mean_token_accuracy": 0.9945793129503727, | |
| "epoch": 3.0200050012503126, | |
| "step": 1510 | |
| }, | |
| { | |
| "loss": 0.009397410601377488, | |
| "grad_norm": 0.20036503672599792, | |
| "learning_rate": 0.0001667982960315358, | |
| "entropy": 0.012075830744288396, | |
| "num_tokens": 9617281.0, | |
| "mean_token_accuracy": 0.9964840039610863, | |
| "epoch": 3.040010002500625, | |
| "step": 1520 | |
| }, | |
| { | |
| "loss": 0.015942367911338805, | |
| "grad_norm": 0.3861319124698639, | |
| "learning_rate": 0.00016630464923508677, | |
| "entropy": 0.014315767139487434, | |
| "num_tokens": 9681345.0, | |
| "mean_token_accuracy": 0.9952807635068893, | |
| "epoch": 3.0600150037509377, | |
| "step": 1530 | |
| }, | |
| { | |
| "loss": 0.01565181165933609, | |
| "grad_norm": 0.23598027229309082, | |
| "learning_rate": 0.00016580810205848288, | |
| "entropy": 0.01963768747918948, | |
| "num_tokens": 9743616.0, | |
| "mean_token_accuracy": 0.9945429727435112, | |
| "epoch": 3.0800200050012503, | |
| "step": 1540 | |
| }, | |
| { | |
| "loss": 0.01511429101228714, | |
| "grad_norm": 0.3226635754108429, | |
| "learning_rate": 0.0001653086762223063, | |
| "entropy": 0.01306593646404508, | |
| "num_tokens": 9808581.0, | |
| "mean_token_accuracy": 0.995248269289732, | |
| "epoch": 3.100025006251563, | |
| "step": 1550 | |
| }, | |
| { | |
| "loss": 0.009530831128358841, | |
| "grad_norm": 0.09154416620731354, | |
| "learning_rate": 0.00016480639357306098, | |
| "entropy": 0.013261715146654751, | |
| "num_tokens": 9873666.0, | |
| "mean_token_accuracy": 0.9966560050845146, | |
| "epoch": 3.1200300075018754, | |
| "step": 1560 | |
| }, | |
| { | |
| "loss": 0.009393466264009475, | |
| "grad_norm": 0.21701541543006897, | |
| "learning_rate": 0.00016430127608221714, | |
| "entropy": 0.011822419746022206, | |
| "num_tokens": 9937438.0, | |
| "mean_token_accuracy": 0.9964691713452339, | |
| "epoch": 3.140035008752188, | |
| "step": 1570 | |
| }, | |
| { | |
| "loss": 0.011047683656215668, | |
| "grad_norm": 0.2678857743740082, | |
| "learning_rate": 0.00016379334584525025, | |
| "entropy": 0.012122366849507672, | |
| "num_tokens": 9999440.0, | |
| "mean_token_accuracy": 0.9967051848769188, | |
| "epoch": 3.1600400100025006, | |
| "step": 1580 | |
| }, | |
| { | |
| "loss": 0.013723762333393097, | |
| "grad_norm": 0.324455201625824, | |
| "learning_rate": 0.00016328262508067431, | |
| "entropy": 0.012699224287644029, | |
| "num_tokens": 10061600.0, | |
| "mean_token_accuracy": 0.9955959998071193, | |
| "epoch": 3.180045011252813, | |
| "step": 1590 | |
| }, | |
| { | |
| "loss": 0.014421728253364564, | |
| "grad_norm": 0.18887697160243988, | |
| "learning_rate": 0.00016276913612907007, | |
| "entropy": 0.020439925385289825, | |
| "num_tokens": 10126520.0, | |
| "mean_token_accuracy": 0.9959282651543617, | |
| "epoch": 3.2000500125031257, | |
| "step": 1600 | |
| }, | |
| { | |
| "loss": 0.01239979937672615, | |
| "grad_norm": 0.1129460483789444, | |
| "learning_rate": 0.00016225290145210772, | |
| "entropy": 0.012199809608864598, | |
| "num_tokens": 10191553.0, | |
| "mean_token_accuracy": 0.995978644490242, | |
| "epoch": 3.2200550137534383, | |
| "step": 1610 | |
| }, | |
| { | |
| "loss": 0.014834728837013245, | |
| "grad_norm": 0.20427951216697693, | |
| "learning_rate": 0.00016173394363156444, | |
| "entropy": 0.016009513070457615, | |
| "num_tokens": 10258289.0, | |
| "mean_token_accuracy": 0.9960135422647, | |
| "epoch": 3.240060015003751, | |
| "step": 1620 | |
| }, | |
| { | |
| "loss": 0.014402203261852264, | |
| "grad_norm": 0.25807589292526245, | |
| "learning_rate": 0.00016121228536833645, | |
| "entropy": 0.015858568061958067, | |
| "num_tokens": 10324281.0, | |
| "mean_token_accuracy": 0.9963105775415897, | |
| "epoch": 3.2600650162540634, | |
| "step": 1630 | |
| }, | |
| { | |
| "loss": 0.014248587191104889, | |
| "grad_norm": 0.13609230518341064, | |
| "learning_rate": 0.00016068794948144617, | |
| "entropy": 0.015872705554647835, | |
| "num_tokens": 10385122.0, | |
| "mean_token_accuracy": 0.9952699325978756, | |
| "epoch": 3.280070017504376, | |
| "step": 1640 | |
| }, | |
| { | |
| "loss": 0.013415993750095367, | |
| "grad_norm": 0.21917292475700378, | |
| "learning_rate": 0.00016016095890704387, | |
| "entropy": 0.010807368888345081, | |
| "num_tokens": 10447821.0, | |
| "mean_token_accuracy": 0.9959428884088993, | |
| "epoch": 3.3000750187546886, | |
| "step": 1650 | |
| }, | |
| { | |
| "loss": 0.008242987841367722, | |
| "grad_norm": 0.2698808014392853, | |
| "learning_rate": 0.0001596313366974045, | |
| "entropy": 0.012187929065839853, | |
| "num_tokens": 10507896.0, | |
| "mean_token_accuracy": 0.9972235180437565, | |
| "epoch": 3.320080020005001, | |
| "step": 1660 | |
| }, | |
| { | |
| "loss": 0.013128173351287842, | |
| "grad_norm": 0.20612332224845886, | |
| "learning_rate": 0.00015909910601991922, | |
| "entropy": 0.013906099726591492, | |
| "num_tokens": 10569117.0, | |
| "mean_token_accuracy": 0.9961497314274311, | |
| "epoch": 3.3400850212553137, | |
| "step": 1670 | |
| }, | |
| { | |
| "loss": 0.01361977458000183, | |
| "grad_norm": 0.13489088416099548, | |
| "learning_rate": 0.00015856429015608209, | |
| "entropy": 0.013951514207292348, | |
| "num_tokens": 10630981.0, | |
| "mean_token_accuracy": 0.9956404089927673, | |
| "epoch": 3.3600900225056263, | |
| "step": 1680 | |
| }, | |
| { | |
| "loss": 0.014680840075016022, | |
| "grad_norm": 0.2713385820388794, | |
| "learning_rate": 0.00015802691250047153, | |
| "entropy": 0.013167628296650946, | |
| "num_tokens": 10693173.0, | |
| "mean_token_accuracy": 0.9950266376137733, | |
| "epoch": 3.380095023755939, | |
| "step": 1690 | |
| }, | |
| { | |
| "loss": 0.013400137424468994, | |
| "grad_norm": 0.1426415741443634, | |
| "learning_rate": 0.00015748699655972708, | |
| "entropy": 0.017778589528461453, | |
| "num_tokens": 10753429.0, | |
| "mean_token_accuracy": 0.9946111224591732, | |
| "epoch": 3.4001000250062514, | |
| "step": 1700 | |
| }, | |
| { | |
| "loss": 0.008509327471256257, | |
| "grad_norm": 0.16599993407726288, | |
| "learning_rate": 0.00015694456595152106, | |
| "entropy": 0.013743974023964257, | |
| "num_tokens": 10819863.0, | |
| "mean_token_accuracy": 0.9970920436084271, | |
| "epoch": 3.420105026256564, | |
| "step": 1710 | |
| }, | |
| { | |
| "loss": 0.01316998302936554, | |
| "grad_norm": 0.20159605145454407, | |
| "learning_rate": 0.0001563996444035255, | |
| "entropy": 0.01153940933654667, | |
| "num_tokens": 10882060.0, | |
| "mean_token_accuracy": 0.9955882236361504, | |
| "epoch": 3.4401100275068766, | |
| "step": 1720 | |
| }, | |
| { | |
| "loss": 0.011991073936223983, | |
| "grad_norm": 0.23580631613731384, | |
| "learning_rate": 0.00015585225575237427, | |
| "entropy": 0.012680305907269939, | |
| "num_tokens": 10945979.0, | |
| "mean_token_accuracy": 0.9958546876907348, | |
| "epoch": 3.460115028757189, | |
| "step": 1730 | |
| }, | |
| { | |
| "loss": 0.012041158974170685, | |
| "grad_norm": 0.33789604902267456, | |
| "learning_rate": 0.00015530242394262017, | |
| "entropy": 0.013596625554055209, | |
| "num_tokens": 11008355.0, | |
| "mean_token_accuracy": 0.9955416478216648, | |
| "epoch": 3.4801200300075017, | |
| "step": 1740 | |
| }, | |
| { | |
| "loss": 0.01627572178840637, | |
| "grad_norm": 0.2994728982448578, | |
| "learning_rate": 0.00015475017302568782, | |
| "entropy": 0.019999047268356662, | |
| "num_tokens": 11071934.0, | |
| "mean_token_accuracy": 0.9931987822055817, | |
| "epoch": 3.5001250312578147, | |
| "step": 1750 | |
| }, | |
| { | |
| "loss": 0.011943073570728302, | |
| "grad_norm": 0.09841946512460709, | |
| "learning_rate": 0.00015419552715882138, | |
| "entropy": 0.01364866496878676, | |
| "num_tokens": 11132456.0, | |
| "mean_token_accuracy": 0.9967477336525917, | |
| "epoch": 3.520130032508127, | |
| "step": 1760 | |
| }, | |
| { | |
| "loss": 0.0153175488114357, | |
| "grad_norm": 0.22312118113040924, | |
| "learning_rate": 0.00015363851060402783, | |
| "entropy": 0.016219895507674664, | |
| "num_tokens": 11194782.0, | |
| "mean_token_accuracy": 0.9945069424808025, | |
| "epoch": 3.54013503375844, | |
| "step": 1770 | |
| }, | |
| { | |
| "loss": 0.00787808895111084, | |
| "grad_norm": 0.16057588160037994, | |
| "learning_rate": 0.0001530791477270158, | |
| "entropy": 0.012033771253481974, | |
| "num_tokens": 11259307.0, | |
| "mean_token_accuracy": 0.9970344088971614, | |
| "epoch": 3.560140035008752, | |
| "step": 1780 | |
| }, | |
| { | |
| "loss": 0.013948053121566772, | |
| "grad_norm": 0.2074371874332428, | |
| "learning_rate": 0.0001525174629961296, | |
| "entropy": 0.01175229620130267, | |
| "num_tokens": 11321733.0, | |
| "mean_token_accuracy": 0.9959047585725784, | |
| "epoch": 3.580145036259065, | |
| "step": 1790 | |
| }, | |
| { | |
| "loss": 0.012327873706817627, | |
| "grad_norm": 0.15074662864208221, | |
| "learning_rate": 0.00015195348098127895, | |
| "entropy": 0.014628350256680278, | |
| "num_tokens": 11384586.0, | |
| "mean_token_accuracy": 0.9950341537594796, | |
| "epoch": 3.600150037509377, | |
| "step": 1800 | |
| }, | |
| { | |
| "loss": 0.012766703963279724, | |
| "grad_norm": 0.2124103605747223, | |
| "learning_rate": 0.00015138722635286422, | |
| "entropy": 0.018070634140167387, | |
| "num_tokens": 11448156.0, | |
| "mean_token_accuracy": 0.9958022043108941, | |
| "epoch": 3.62015503875969, | |
| "step": 1810 | |
| }, | |
| { | |
| "loss": 0.011698020249605178, | |
| "grad_norm": 0.4769149124622345, | |
| "learning_rate": 0.0001508187238806973, | |
| "entropy": 0.01308420468485565, | |
| "num_tokens": 11511882.0, | |
| "mean_token_accuracy": 0.9961448684334755, | |
| "epoch": 3.6401600400100023, | |
| "step": 1820 | |
| }, | |
| { | |
| "loss": 0.014116832613945007, | |
| "grad_norm": 0.25340843200683594, | |
| "learning_rate": 0.00015024799843291802, | |
| "entropy": 0.012517862502500065, | |
| "num_tokens": 11575526.0, | |
| "mean_token_accuracy": 0.9950296327471733, | |
| "epoch": 3.6601650412603153, | |
| "step": 1830 | |
| }, | |
| { | |
| "loss": 0.014804676175117493, | |
| "grad_norm": 0.21997588872909546, | |
| "learning_rate": 0.00014967507497490635, | |
| "entropy": 0.016702812965377234, | |
| "num_tokens": 11637521.0, | |
| "mean_token_accuracy": 0.9941891603171825, | |
| "epoch": 3.6801700425106274, | |
| "step": 1840 | |
| }, | |
| { | |
| "loss": 0.008088278025388718, | |
| "grad_norm": 0.1356344372034073, | |
| "learning_rate": 0.00014909997856819032, | |
| "entropy": 0.01380894306494156, | |
| "num_tokens": 11700080.0, | |
| "mean_token_accuracy": 0.9972025558352471, | |
| "epoch": 3.7001750437609404, | |
| "step": 1850 | |
| }, | |
| { | |
| "loss": 0.014773441851139069, | |
| "grad_norm": 0.2926776707172394, | |
| "learning_rate": 0.00014852273436934986, | |
| "entropy": 0.013712721945921658, | |
| "num_tokens": 11761687.0, | |
| "mean_token_accuracy": 0.9959305942058563, | |
| "epoch": 3.7201800450112525, | |
| "step": 1860 | |
| }, | |
| { | |
| "loss": 0.011582046002149581, | |
| "grad_norm": 0.13980428874492645, | |
| "learning_rate": 0.00014794336762891623, | |
| "entropy": 0.014661396172596142, | |
| "num_tokens": 11823454.0, | |
| "mean_token_accuracy": 0.9961862593889237, | |
| "epoch": 3.7401850462615656, | |
| "step": 1870 | |
| }, | |
| { | |
| "loss": 0.012114252895116806, | |
| "grad_norm": 0.2284947633743286, | |
| "learning_rate": 0.00014736190369026754, | |
| "entropy": 0.01451311390119372, | |
| "num_tokens": 11884267.0, | |
| "mean_token_accuracy": 0.9961981892585754, | |
| "epoch": 3.760190047511878, | |
| "step": 1880 | |
| }, | |
| { | |
| "loss": 0.007772183418273926, | |
| "grad_norm": 0.255247563123703, | |
| "learning_rate": 0.0001467783679885201, | |
| "entropy": 0.010285129089606927, | |
| "num_tokens": 11948880.0, | |
| "mean_token_accuracy": 0.9978563249111175, | |
| "epoch": 3.7801950487621907, | |
| "step": 1890 | |
| }, | |
| { | |
| "loss": 0.013219112157821655, | |
| "grad_norm": 0.21494613587856293, | |
| "learning_rate": 0.00014619278604941603, | |
| "entropy": 0.01082497325114673, | |
| "num_tokens": 12012547.0, | |
| "mean_token_accuracy": 0.9958216808736324, | |
| "epoch": 3.8002000500125033, | |
| "step": 1900 | |
| }, | |
| { | |
| "loss": 0.012468833476305008, | |
| "grad_norm": 0.28526443243026733, | |
| "learning_rate": 0.00014560518348820625, | |
| "entropy": 0.013233061737264507, | |
| "num_tokens": 12078372.0, | |
| "mean_token_accuracy": 0.9958592697978019, | |
| "epoch": 3.820205051262816, | |
| "step": 1910 | |
| }, | |
| { | |
| "loss": 0.018085935711860658, | |
| "grad_norm": 0.1471295952796936, | |
| "learning_rate": 0.00014501558600853035, | |
| "entropy": 0.015974047601775964, | |
| "num_tokens": 12142500.0, | |
| "mean_token_accuracy": 0.9947570398449898, | |
| "epoch": 3.8402100525131284, | |
| "step": 1920 | |
| }, | |
| { | |
| "loss": 0.013111139833927154, | |
| "grad_norm": 0.2544702887535095, | |
| "learning_rate": 0.0001444240194012922, | |
| "entropy": 0.01969735559250694, | |
| "num_tokens": 12206205.0, | |
| "mean_token_accuracy": 0.9956923462450504, | |
| "epoch": 3.860215053763441, | |
| "step": 1930 | |
| }, | |
| { | |
| "loss": 0.013215355575084686, | |
| "grad_norm": 0.14971140027046204, | |
| "learning_rate": 0.00014383050954353154, | |
| "entropy": 0.01610187725018477, | |
| "num_tokens": 12269828.0, | |
| "mean_token_accuracy": 0.9956071071326733, | |
| "epoch": 3.8802200550137536, | |
| "step": 1940 | |
| }, | |
| { | |
| "loss": 0.00939919427037239, | |
| "grad_norm": 0.08307329565286636, | |
| "learning_rate": 0.00014323508239729232, | |
| "entropy": 0.01351477519783657, | |
| "num_tokens": 12331919.0, | |
| "mean_token_accuracy": 0.99660724401474, | |
| "epoch": 3.900225056264066, | |
| "step": 1950 | |
| }, | |
| { | |
| "loss": 0.011213938146829605, | |
| "grad_norm": 0.12744051218032837, | |
| "learning_rate": 0.00014263776400848678, | |
| "entropy": 0.011691810854972572, | |
| "num_tokens": 12394410.0, | |
| "mean_token_accuracy": 0.9957682631909848, | |
| "epoch": 3.9202300575143787, | |
| "step": 1960 | |
| }, | |
| { | |
| "loss": 0.014179202914237975, | |
| "grad_norm": 0.30811241269111633, | |
| "learning_rate": 0.00014203858050575632, | |
| "entropy": 0.013546516641508789, | |
| "num_tokens": 12458473.0, | |
| "mean_token_accuracy": 0.9955927409231663, | |
| "epoch": 3.9402350587646913, | |
| "step": 1970 | |
| }, | |
| { | |
| "loss": 0.014471597969532013, | |
| "grad_norm": 0.1450197547674179, | |
| "learning_rate": 0.00014143755809932845, | |
| "entropy": 0.016499465111701285, | |
| "num_tokens": 12523348.0, | |
| "mean_token_accuracy": 0.9954880520701408, | |
| "epoch": 3.960240060015004, | |
| "step": 1980 | |
| }, | |
| { | |
| "loss": 0.010644648969173432, | |
| "grad_norm": 0.14227765798568726, | |
| "learning_rate": 0.0001408347230798702, | |
| "entropy": 0.013392421180469682, | |
| "num_tokens": 12588443.0, | |
| "mean_token_accuracy": 0.9969804167747498, | |
| "epoch": 3.9802450612653164, | |
| "step": 1990 | |
| }, | |
| { | |
| "loss": 0.015882152318954467, | |
| "grad_norm": 0.12858586013317108, | |
| "learning_rate": 0.00014023010181733826, | |
| "entropy": 0.01455020939060369, | |
| "num_tokens": 12651352.0, | |
| "mean_token_accuracy": 0.9946769113782086, | |
| "epoch": 4.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_loss": 0.0426219180226326, | |
| "eval_runtime": 69.3664, | |
| "eval_samples_per_second": 14.921, | |
| "eval_steps_per_second": 7.468, | |
| "eval_entropy": 0.03254893434532418, | |
| "eval_num_tokens": 12651352.0, | |
| "eval_mean_token_accuracy": 0.9884336234059573, | |
| "epoch": 4.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "loss": 0.00863734856247902, | |
| "grad_norm": 0.4523090422153473, | |
| "learning_rate": 0.00013962372075982543, | |
| "entropy": 0.01400298816661234, | |
| "num_tokens": 12710379.0, | |
| "mean_token_accuracy": 0.9968750610947609, | |
| "epoch": 4.020005001250313, | |
| "step": 2010 | |
| }, | |
| { | |
| "loss": 0.007897177338600158, | |
| "grad_norm": 0.10824855417013168, | |
| "learning_rate": 0.0001390156064324035, | |
| "entropy": 0.008752083206127281, | |
| "num_tokens": 12774117.0, | |
| "mean_token_accuracy": 0.9971247158944607, | |
| "epoch": 4.040010002500625, | |
| "step": 2020 | |
| }, | |
| { | |
| "loss": 0.008237957209348678, | |
| "grad_norm": 0.3647105097770691, | |
| "learning_rate": 0.00013840578543596315, | |
| "entropy": 0.008517850490170531, | |
| "num_tokens": 12838463.0, | |
| "mean_token_accuracy": 0.9974852904677391, | |
| "epoch": 4.060015003750938, | |
| "step": 2030 | |
| }, | |
| { | |
| "loss": 0.010357823967933655, | |
| "grad_norm": 0.1849185675382614, | |
| "learning_rate": 0.00013779428444605035, | |
| "entropy": 0.011237980193618569, | |
| "num_tokens": 12906031.0, | |
| "mean_token_accuracy": 0.9965578347444535, | |
| "epoch": 4.08002000500125, | |
| "step": 2040 | |
| }, | |
| { | |
| "loss": 0.00867396593093872, | |
| "grad_norm": 0.17338383197784424, | |
| "learning_rate": 0.0001371811302116994, | |
| "entropy": 0.00913453484463389, | |
| "num_tokens": 12968016.0, | |
| "mean_token_accuracy": 0.9973611943423748, | |
| "epoch": 4.100025006251563, | |
| "step": 2050 | |
| }, | |
| { | |
| "loss": 0.012893503904342652, | |
| "grad_norm": 0.1852918565273285, | |
| "learning_rate": 0.0001365663495542628, | |
| "entropy": 0.012978466165077408, | |
| "num_tokens": 13032518.0, | |
| "mean_token_accuracy": 0.99602395221591, | |
| "epoch": 4.120030007501875, | |
| "step": 2060 | |
| }, | |
| { | |
| "loss": 0.010699793696403503, | |
| "grad_norm": 0.2881818115711212, | |
| "learning_rate": 0.00013594996936623814, | |
| "entropy": 0.015379714348819106, | |
| "num_tokens": 13096744.0, | |
| "mean_token_accuracy": 0.9955209918320179, | |
| "epoch": 4.140035008752188, | |
| "step": 2070 | |
| }, | |
| { | |
| "loss": 0.009091087430715562, | |
| "grad_norm": 0.32742437720298767, | |
| "learning_rate": 0.0001353320166100917, | |
| "entropy": 0.009939568623667582, | |
| "num_tokens": 13162095.0, | |
| "mean_token_accuracy": 0.9969943076372146, | |
| "epoch": 4.160040010002501, | |
| "step": 2080 | |
| }, | |
| { | |
| "loss": 0.009758947789669037, | |
| "grad_norm": 0.2090802937746048, | |
| "learning_rate": 0.00013471251831707884, | |
| "entropy": 0.010461670262520784, | |
| "num_tokens": 13228156.0, | |
| "mean_token_accuracy": 0.9968024276196956, | |
| "epoch": 4.180045011252814, | |
| "step": 2090 | |
| }, | |
| { | |
| "loss": 0.008040308952331543, | |
| "grad_norm": 0.21466973423957825, | |
| "learning_rate": 0.0001340915015860618, | |
| "entropy": 0.011725931792898336, | |
| "num_tokens": 13291512.0, | |
| "mean_token_accuracy": 0.9968237906694413, | |
| "epoch": 4.200050012503126, | |
| "step": 2100 | |
| }, | |
| { | |
| "loss": 0.00803126096725464, | |
| "grad_norm": 0.24069944024085999, | |
| "learning_rate": 0.0001334689935823243, | |
| "entropy": 0.011084824410500006, | |
| "num_tokens": 13353896.0, | |
| "mean_token_accuracy": 0.997739101946354, | |
| "epoch": 4.220055013753439, | |
| "step": 2110 | |
| }, | |
| { | |
| "loss": 0.008842091262340545, | |
| "grad_norm": 0.06226912513375282, | |
| "learning_rate": 0.00013284502153638295, | |
| "entropy": 0.010992687013640534, | |
| "num_tokens": 13416743.0, | |
| "mean_token_accuracy": 0.996946869045496, | |
| "epoch": 4.240060015003751, | |
| "step": 2120 | |
| }, | |
| { | |
| "loss": 0.010905887186527252, | |
| "grad_norm": 0.11721836030483246, | |
| "learning_rate": 0.00013221961274279654, | |
| "entropy": 0.011237628920207498, | |
| "num_tokens": 13481284.0, | |
| "mean_token_accuracy": 0.9970996268093586, | |
| "epoch": 4.260065016254064, | |
| "step": 2130 | |
| }, | |
| { | |
| "loss": 0.012466417998075486, | |
| "grad_norm": 0.3521440327167511, | |
| "learning_rate": 0.00013159279455897166, | |
| "entropy": 0.010562418565677944, | |
| "num_tokens": 13543678.0, | |
| "mean_token_accuracy": 0.9958751887083054, | |
| "epoch": 4.280070017504376, | |
| "step": 2140 | |
| }, | |
| { | |
| "loss": 0.011747314780950546, | |
| "grad_norm": 0.26293885707855225, | |
| "learning_rate": 0.0001309645944039663, | |
| "entropy": 0.014598401125113014, | |
| "num_tokens": 13608112.0, | |
| "mean_token_accuracy": 0.9962641790509223, | |
| "epoch": 4.300075018754689, | |
| "step": 2150 | |
| }, | |
| { | |
| "loss": 0.007845200598239899, | |
| "grad_norm": 0.16723529994487762, | |
| "learning_rate": 0.00013033503975729035, | |
| "entropy": 0.011412217889301246, | |
| "num_tokens": 13667979.0, | |
| "mean_token_accuracy": 0.99744006767869, | |
| "epoch": 4.320080020005001, | |
| "step": 2160 | |
| }, | |
| { | |
| "loss": 0.010894352942705155, | |
| "grad_norm": 0.21131186187267303, | |
| "learning_rate": 0.0001297041581577035, | |
| "entropy": 0.010380906579666772, | |
| "num_tokens": 13730034.0, | |
| "mean_token_accuracy": 0.9965024016797542, | |
| "epoch": 4.340085021255314, | |
| "step": 2170 | |
| }, | |
| { | |
| "loss": 0.00956823006272316, | |
| "grad_norm": 0.10813307017087936, | |
| "learning_rate": 0.00012907197720201071, | |
| "entropy": 0.009887772376168868, | |
| "num_tokens": 13792366.0, | |
| "mean_token_accuracy": 0.9968511998653412, | |
| "epoch": 4.360090022505626, | |
| "step": 2180 | |
| }, | |
| { | |
| "loss": 0.009695110470056533, | |
| "grad_norm": 0.21164672076702118, | |
| "learning_rate": 0.00012843852454385497, | |
| "entropy": 0.011902359123632777, | |
| "num_tokens": 13853048.0, | |
| "mean_token_accuracy": 0.9974331922829152, | |
| "epoch": 4.380095023755939, | |
| "step": 2190 | |
| }, | |
| { | |
| "loss": 0.008793818950653075, | |
| "grad_norm": 0.4802285432815552, | |
| "learning_rate": 0.00012780382789250762, | |
| "entropy": 0.009543133205443154, | |
| "num_tokens": 13917884.0, | |
| "mean_token_accuracy": 0.997763866186142, | |
| "epoch": 4.400100025006251, | |
| "step": 2200 | |
| }, | |
| { | |
| "loss": 0.009752951562404633, | |
| "grad_norm": 0.3032193183898926, | |
| "learning_rate": 0.00012716791501165634, | |
| "entropy": 0.01140449561207788, | |
| "num_tokens": 13982842.0, | |
| "mean_token_accuracy": 0.9972191534936428, | |
| "epoch": 4.420105026256564, | |
| "step": 2210 | |
| }, | |
| { | |
| "loss": 0.005666728690266609, | |
| "grad_norm": 0.394113153219223, | |
| "learning_rate": 0.00012653081371819064, | |
| "entropy": 0.008245287769386777, | |
| "num_tokens": 14045445.0, | |
| "mean_token_accuracy": 0.998167161643505, | |
| "epoch": 4.4401100275068766, | |
| "step": 2220 | |
| }, | |
| { | |
| "loss": 0.010289490967988969, | |
| "grad_norm": 0.5735944509506226, | |
| "learning_rate": 0.00012589255188098498, | |
| "entropy": 0.008848439441499068, | |
| "num_tokens": 14105270.0, | |
| "mean_token_accuracy": 0.996202427148819, | |
| "epoch": 4.46011502875719, | |
| "step": 2230 | |
| }, | |
| { | |
| "loss": 0.006267648935317993, | |
| "grad_norm": 0.0710088387131691, | |
| "learning_rate": 0.00012525315741967978, | |
| "entropy": 0.010472280244721332, | |
| "num_tokens": 14166955.0, | |
| "mean_token_accuracy": 0.9972212843596935, | |
| "epoch": 4.480120030007502, | |
| "step": 2240 | |
| }, | |
| { | |
| "loss": 0.010307309031486512, | |
| "grad_norm": 0.23172006011009216, | |
| "learning_rate": 0.00012461265830346018, | |
| "entropy": 0.008165620337967994, | |
| "num_tokens": 14231397.0, | |
| "mean_token_accuracy": 0.996221523731947, | |
| "epoch": 4.500125031257815, | |
| "step": 2250 | |
| }, | |
| { | |
| "loss": 0.010486914217472077, | |
| "grad_norm": 0.1562025099992752, | |
| "learning_rate": 0.00012397108254983243, | |
| "entropy": 0.01140070731707965, | |
| "num_tokens": 14293502.0, | |
| "mean_token_accuracy": 0.9965781837701797, | |
| "epoch": 4.520130032508127, | |
| "step": 2260 | |
| }, | |
| { | |
| "loss": 0.008283475786447525, | |
| "grad_norm": 0.09583538770675659, | |
| "learning_rate": 0.00012332845822339846, | |
| "entropy": 0.011921767683816142, | |
| "num_tokens": 14355038.0, | |
| "mean_token_accuracy": 0.9969584576785564, | |
| "epoch": 4.54013503375844, | |
| "step": 2270 | |
| }, | |
| { | |
| "loss": 0.00834668129682541, | |
| "grad_norm": 0.18446850776672363, | |
| "learning_rate": 0.000122684813434628, | |
| "entropy": 0.010264168232242809, | |
| "num_tokens": 14420148.0, | |
| "mean_token_accuracy": 0.9971672594547272, | |
| "epoch": 4.560140035008752, | |
| "step": 2280 | |
| }, | |
| { | |
| "loss": 0.009413036704063415, | |
| "grad_norm": 0.11777894198894501, | |
| "learning_rate": 0.00012204017633862932, | |
| "entropy": 0.011230875192995881, | |
| "num_tokens": 14482015.0, | |
| "mean_token_accuracy": 0.9962861262261867, | |
| "epoch": 4.580145036259065, | |
| "step": 2290 | |
| }, | |
| { | |
| "loss": 0.0066015787422657015, | |
| "grad_norm": 0.14621251821517944, | |
| "learning_rate": 0.00012139457513391732, | |
| "entropy": 0.007982138471561484, | |
| "num_tokens": 14546515.0, | |
| "mean_token_accuracy": 0.9983268916606903, | |
| "epoch": 4.600150037509377, | |
| "step": 2300 | |
| }, | |
| { | |
| "loss": 0.010532976686954498, | |
| "grad_norm": 0.2948937714099884, | |
| "learning_rate": 0.00012074803806118016, | |
| "entropy": 0.011228621992995614, | |
| "num_tokens": 14610218.0, | |
| "mean_token_accuracy": 0.9960615806281566, | |
| "epoch": 4.62015503875969, | |
| "step": 2310 | |
| }, | |
| { | |
| "loss": 0.012350869178771973, | |
| "grad_norm": 0.25452813506126404, | |
| "learning_rate": 0.0001201005934020439, | |
| "entropy": 0.0075275591014360545, | |
| "num_tokens": 14673523.0, | |
| "mean_token_accuracy": 0.9973488107323647, | |
| "epoch": 4.640160040010002, | |
| "step": 2320 | |
| }, | |
| { | |
| "loss": 0.015287771821022034, | |
| "grad_norm": 0.24262821674346924, | |
| "learning_rate": 0.00011945226947783532, | |
| "entropy": 0.012186212290544063, | |
| "num_tokens": 14734854.0, | |
| "mean_token_accuracy": 0.995884881913662, | |
| "epoch": 4.660165041260315, | |
| "step": 2330 | |
| }, | |
| { | |
| "loss": 0.010069895535707474, | |
| "grad_norm": 0.24241459369659424, | |
| "learning_rate": 0.00011880309464834317, | |
| "entropy": 0.014627664355066372, | |
| "num_tokens": 14796717.0, | |
| "mean_token_accuracy": 0.9970944046974182, | |
| "epoch": 4.680170042510627, | |
| "step": 2340 | |
| }, | |
| { | |
| "loss": 0.007354290783405304, | |
| "grad_norm": 0.24272984266281128, | |
| "learning_rate": 0.00011815309731057752, | |
| "entropy": 0.00997849061677698, | |
| "num_tokens": 14857558.0, | |
| "mean_token_accuracy": 0.9976357862353324, | |
| "epoch": 4.70017504376094, | |
| "step": 2350 | |
| }, | |
| { | |
| "loss": 0.01080884262919426, | |
| "grad_norm": 0.16180723905563354, | |
| "learning_rate": 0.00011750230589752762, | |
| "entropy": 0.011729113181354478, | |
| "num_tokens": 14918129.0, | |
| "mean_token_accuracy": 0.9959106191992759, | |
| "epoch": 4.7201800450112525, | |
| "step": 2360 | |
| }, | |
| { | |
| "loss": 0.0070034988224506375, | |
| "grad_norm": 0.14300037920475006, | |
| "learning_rate": 0.00011685074887691815, | |
| "entropy": 0.010010966495974572, | |
| "num_tokens": 14981742.0, | |
| "mean_token_accuracy": 0.9970420770347118, | |
| "epoch": 4.740185046261566, | |
| "step": 2370 | |
| }, | |
| { | |
| "loss": 0.006338100135326386, | |
| "grad_norm": 0.31339094042778015, | |
| "learning_rate": 0.00011619845474996396, | |
| "entropy": 0.007486376102315262, | |
| "num_tokens": 15044749.0, | |
| "mean_token_accuracy": 0.998369050770998, | |
| "epoch": 4.760190047511878, | |
| "step": 2380 | |
| }, | |
| { | |
| "loss": 0.0088754341006279, | |
| "grad_norm": 0.2821660339832306, | |
| "learning_rate": 0.0001155454520501233, | |
| "entropy": 0.0094100816793798, | |
| "num_tokens": 15107356.0, | |
| "mean_token_accuracy": 0.9967978030443192, | |
| "epoch": 4.780195048762191, | |
| "step": 2390 | |
| }, | |
| { | |
| "loss": 0.0074894212186336516, | |
| "grad_norm": 0.20098550617694855, | |
| "learning_rate": 0.00011489176934184966, | |
| "entropy": 0.011058530519949272, | |
| "num_tokens": 15170161.0, | |
| "mean_token_accuracy": 0.9970949165523052, | |
| "epoch": 4.800200050012503, | |
| "step": 2400 | |
| }, | |
| { | |
| "loss": 0.006931519508361817, | |
| "grad_norm": 0.2597576379776001, | |
| "learning_rate": 0.00011423743521934239, | |
| "entropy": 0.009024496493293555, | |
| "num_tokens": 15233166.0, | |
| "mean_token_accuracy": 0.9981255434453488, | |
| "epoch": 4.820205051262816, | |
| "step": 2410 | |
| }, | |
| { | |
| "loss": 0.007713411748409271, | |
| "grad_norm": 0.07438832521438599, | |
| "learning_rate": 0.00011358247830529572, | |
| "entropy": 0.008874563317294814, | |
| "num_tokens": 15294745.0, | |
| "mean_token_accuracy": 0.997540271282196, | |
| "epoch": 4.840210052513128, | |
| "step": 2420 | |
| }, | |
| { | |
| "loss": 0.010046067833900451, | |
| "grad_norm": 0.15564411878585815, | |
| "learning_rate": 0.00011292692724964684, | |
| "entropy": 0.01154620652741869, | |
| "num_tokens": 15360934.0, | |
| "mean_token_accuracy": 0.9968956887722016, | |
| "epoch": 4.860215053763441, | |
| "step": 2430 | |
| }, | |
| { | |
| "loss": 0.007103031873703003, | |
| "grad_norm": 0.13080066442489624, | |
| "learning_rate": 0.00011227081072832264, | |
| "entropy": 0.009648629953153432, | |
| "num_tokens": 15423505.0, | |
| "mean_token_accuracy": 0.9975046671926975, | |
| "epoch": 4.880220055013753, | |
| "step": 2440 | |
| }, | |
| { | |
| "loss": 0.011635245382785797, | |
| "grad_norm": 0.1020200327038765, | |
| "learning_rate": 0.00011161415744198529, | |
| "entropy": 0.01059294661572494, | |
| "num_tokens": 15488354.0, | |
| "mean_token_accuracy": 0.996422378718853, | |
| "epoch": 4.900225056264066, | |
| "step": 2450 | |
| }, | |
| { | |
| "loss": 0.00895947739481926, | |
| "grad_norm": 0.5128690600395203, | |
| "learning_rate": 0.00011095699611477672, | |
| "entropy": 0.01126530086476123, | |
| "num_tokens": 15551047.0, | |
| "mean_token_accuracy": 0.9972493521869182, | |
| "epoch": 4.920230057514378, | |
| "step": 2460 | |
| }, | |
| { | |
| "loss": 0.007447101175785065, | |
| "grad_norm": 0.1531531810760498, | |
| "learning_rate": 0.00011029935549306236, | |
| "entropy": 0.009639624001283664, | |
| "num_tokens": 15614133.0, | |
| "mean_token_accuracy": 0.9972159087657928, | |
| "epoch": 4.940235058764691, | |
| "step": 2470 | |
| }, | |
| { | |
| "loss": 0.009513139724731445, | |
| "grad_norm": 0.109550341963768, | |
| "learning_rate": 0.00010964126434417348, | |
| "entropy": 0.011513816034130287, | |
| "num_tokens": 15681338.0, | |
| "mean_token_accuracy": 0.9967059269547462, | |
| "epoch": 4.960240060015003, | |
| "step": 2480 | |
| }, | |
| { | |
| "loss": 0.014146287739276887, | |
| "grad_norm": 0.2227025330066681, | |
| "learning_rate": 0.00010898275145514878, | |
| "entropy": 0.012698486276713083, | |
| "num_tokens": 15750237.0, | |
| "mean_token_accuracy": 0.9964324481785297, | |
| "epoch": 4.980245061265316, | |
| "step": 2490 | |
| }, | |
| { | |
| "loss": 0.011340580135583877, | |
| "grad_norm": 0.26418933272361755, | |
| "learning_rate": 0.00010832384563147539, | |
| "entropy": 0.012120508169607979, | |
| "num_tokens": 15814190.0, | |
| "mean_token_accuracy": 0.9962437522562244, | |
| "epoch": 5.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "eval_loss": 0.036649439483881, | |
| "eval_runtime": 68.931, | |
| "eval_samples_per_second": 15.015, | |
| "eval_steps_per_second": 7.515, | |
| "eval_entropy": 0.01951373018991628, | |
| "eval_num_tokens": 15814190.0, | |
| "eval_mean_token_accuracy": 0.990988754052453, | |
| "epoch": 5.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "loss": 0.00565112940967083, | |
| "grad_norm": 0.24155987799167633, | |
| "learning_rate": 0.00010766457569582855, | |
| "entropy": 0.008389830897795037, | |
| "num_tokens": 15876304.0, | |
| "mean_token_accuracy": 0.9987288475036621, | |
| "epoch": 5.020005001250313, | |
| "step": 2510 | |
| }, | |
| { | |
| "loss": 0.004657933115959167, | |
| "grad_norm": 0.17384299635887146, | |
| "learning_rate": 0.000107004970486811, | |
| "entropy": 0.0063808045721089005, | |
| "num_tokens": 15939328.0, | |
| "mean_token_accuracy": 0.9986095182597637, | |
| "epoch": 5.040010002500625, | |
| "step": 2520 | |
| }, | |
| { | |
| "loss": 0.009442869573831558, | |
| "grad_norm": 0.07942040264606476, | |
| "learning_rate": 0.00010634505885769134, | |
| "entropy": 0.008581503613459062, | |
| "num_tokens": 16001585.0, | |
| "mean_token_accuracy": 0.9973239652812481, | |
| "epoch": 5.060015003750938, | |
| "step": 2530 | |
| }, | |
| { | |
| "loss": 0.007105500251054764, | |
| "grad_norm": 0.1442539244890213, | |
| "learning_rate": 0.00010568486967514218, | |
| "entropy": 0.008049002460029441, | |
| "num_tokens": 16066250.0, | |
| "mean_token_accuracy": 0.9976261213421822, | |
| "epoch": 5.08002000500125, | |
| "step": 2540 | |
| }, | |
| { | |
| "loss": 0.006882892549037933, | |
| "grad_norm": 0.05469922348856926, | |
| "learning_rate": 0.00010502443181797697, | |
| "entropy": 0.008640473794366698, | |
| "num_tokens": 16131511.0, | |
| "mean_token_accuracy": 0.9982132039964199, | |
| "epoch": 5.100025006251563, | |
| "step": 2550 | |
| }, | |
| { | |
| "loss": 0.007951027154922486, | |
| "grad_norm": 0.08848944306373596, | |
| "learning_rate": 0.00010436377417588714, | |
| "entropy": 0.007696686122289975, | |
| "num_tokens": 16194361.0, | |
| "mean_token_accuracy": 0.998307142406702, | |
| "epoch": 5.120030007501875, | |
| "step": 2560 | |
| }, | |
| { | |
| "loss": 0.005469654873013497, | |
| "grad_norm": 0.1663186103105545, | |
| "learning_rate": 0.0001037029256481782, | |
| "entropy": 0.008428349181485828, | |
| "num_tokens": 16257949.0, | |
| "mean_token_accuracy": 0.9982100896537304, | |
| "epoch": 5.140035008752188, | |
| "step": 2570 | |
| }, | |
| { | |
| "loss": 0.007561860978603363, | |
| "grad_norm": 0.1089382916688919, | |
| "learning_rate": 0.00010304191514250559, | |
| "entropy": 0.00860111919027986, | |
| "num_tokens": 16319368.0, | |
| "mean_token_accuracy": 0.9977700248360634, | |
| "epoch": 5.160040010002501, | |
| "step": 2580 | |
| }, | |
| { | |
| "loss": 0.006244239956140518, | |
| "grad_norm": 0.29137757420539856, | |
| "learning_rate": 0.00010238077157361021, | |
| "entropy": 0.006166888629377354, | |
| "num_tokens": 16382222.0, | |
| "mean_token_accuracy": 0.9981474541127682, | |
| "epoch": 5.180045011252814, | |
| "step": 2590 | |
| }, | |
| { | |
| "loss": 0.004823794960975647, | |
| "grad_norm": 0.09055764973163605, | |
| "learning_rate": 0.00010171952386205354, | |
| "entropy": 0.007182681497215526, | |
| "num_tokens": 16442713.0, | |
| "mean_token_accuracy": 0.9988246329128743, | |
| "epoch": 5.200050012503126, | |
| "step": 2600 | |
| }, | |
| { | |
| "loss": 0.004676086083054543, | |
| "grad_norm": 0.041668012738227844, | |
| "learning_rate": 0.00010105820093295268, | |
| "entropy": 0.007433413605031092, | |
| "num_tokens": 16507336.0, | |
| "mean_token_accuracy": 0.9984147787094116, | |
| "epoch": 5.220055013753439, | |
| "step": 2610 | |
| }, | |
| { | |
| "loss": 0.007142329961061478, | |
| "grad_norm": 0.3844437897205353, | |
| "learning_rate": 0.00010039683171471493, | |
| "entropy": 0.006547862391016679, | |
| "num_tokens": 16573852.0, | |
| "mean_token_accuracy": 0.9983086295425891, | |
| "epoch": 5.240060015003751, | |
| "step": 2620 | |
| }, | |
| { | |
| "loss": 0.0057931594550609585, | |
| "grad_norm": 0.12350230664014816, | |
| "learning_rate": 9.973544513777245e-05, | |
| "entropy": 0.007999910078433458, | |
| "num_tokens": 16636798.0, | |
| "mean_token_accuracy": 0.998402901738882, | |
| "epoch": 5.260065016254064, | |
| "step": 2630 | |
| }, | |
| { | |
| "loss": 0.006187746301293373, | |
| "grad_norm": 0.10715912282466888, | |
| "learning_rate": 9.907407013331663e-05, | |
| "entropy": 0.007076963333383901, | |
| "num_tokens": 16702698.0, | |
| "mean_token_accuracy": 0.9976529404520988, | |
| "epoch": 5.280070017504376, | |
| "step": 2640 | |
| }, | |
| { | |
| "loss": 0.004311095550656318, | |
| "grad_norm": 0.3015357255935669, | |
| "learning_rate": 9.841273563203277e-05, | |
| "entropy": 0.005494680403353413, | |
| "num_tokens": 16765527.0, | |
| "mean_token_accuracy": 0.9985795192420482, | |
| "epoch": 5.300075018754689, | |
| "step": 2650 | |
| }, | |
| { | |
| "loss": 0.005706357955932617, | |
| "grad_norm": 0.06844376027584076, | |
| "learning_rate": 9.77514705628344e-05, | |
| "entropy": 0.008315026501077228, | |
| "num_tokens": 16828006.0, | |
| "mean_token_accuracy": 0.9986971832811833, | |
| "epoch": 5.320080020005001, | |
| "step": 2660 | |
| }, | |
| { | |
| "loss": 0.00420297309756279, | |
| "grad_norm": 0.15605595707893372, | |
| "learning_rate": 9.709030385159785e-05, | |
| "entropy": 0.007199513514206046, | |
| "num_tokens": 16891023.0, | |
| "mean_token_accuracy": 0.9988421566784382, | |
| "epoch": 5.340085021255314, | |
| "step": 2670 | |
| }, | |
| { | |
| "loss": 0.00714726448059082, | |
| "grad_norm": 0.19374419748783112, | |
| "learning_rate": 9.642926441989696e-05, | |
| "entropy": 0.005838291899635806, | |
| "num_tokens": 16956668.0, | |
| "mean_token_accuracy": 0.9979994632303715, | |
| "epoch": 5.360090022505626, | |
| "step": 2680 | |
| }, | |
| { | |
| "loss": 0.005109471827745437, | |
| "grad_norm": 0.1971459686756134, | |
| "learning_rate": 9.57683811837379e-05, | |
| "entropy": 0.009764070269011427, | |
| "num_tokens": 17020153.0, | |
| "mean_token_accuracy": 0.9985188752412796, | |
| "epoch": 5.380095023755939, | |
| "step": 2690 | |
| }, | |
| { | |
| "loss": 0.006213615462183952, | |
| "grad_norm": 0.2851213216781616, | |
| "learning_rate": 9.510768305229441e-05, | |
| "entropy": 0.008533979691856075, | |
| "num_tokens": 17084832.0, | |
| "mean_token_accuracy": 0.9977529622614384, | |
| "epoch": 5.400100025006251, | |
| "step": 2700 | |
| }, | |
| { | |
| "loss": 0.0061513490974903105, | |
| "grad_norm": 0.10104754567146301, | |
| "learning_rate": 9.444719892664311e-05, | |
| "entropy": 0.007165478614842869, | |
| "num_tokens": 17149790.0, | |
| "mean_token_accuracy": 0.9975666105747223, | |
| "epoch": 5.420105026256564, | |
| "step": 2710 | |
| }, | |
| { | |
| "loss": 0.005662607401609421, | |
| "grad_norm": 0.09378691017627716, | |
| "learning_rate": 9.378695769849931e-05, | |
| "entropy": 0.007089314765835297, | |
| "num_tokens": 17213202.0, | |
| "mean_token_accuracy": 0.9981832534074784, | |
| "epoch": 5.4401100275068766, | |
| "step": 2720 | |
| }, | |
| { | |
| "loss": 0.006653358787298202, | |
| "grad_norm": 0.12766185402870178, | |
| "learning_rate": 9.312698824895328e-05, | |
| "entropy": 0.006666196065634722, | |
| "num_tokens": 17278955.0, | |
| "mean_token_accuracy": 0.9976298168301583, | |
| "epoch": 5.46011502875719, | |
| "step": 2730 | |
| }, | |
| { | |
| "loss": 0.006521254032850266, | |
| "grad_norm": 0.02992381900548935, | |
| "learning_rate": 9.246731944720675e-05, | |
| "entropy": 0.007897612718807068, | |
| "num_tokens": 17344058.0, | |
| "mean_token_accuracy": 0.9974993944168091, | |
| "epoch": 5.480120030007502, | |
| "step": 2740 | |
| }, | |
| { | |
| "loss": 0.0059999067336320875, | |
| "grad_norm": 0.1317594200372696, | |
| "learning_rate": 9.180798014931006e-05, | |
| "entropy": 0.006773643911219551, | |
| "num_tokens": 17404192.0, | |
| "mean_token_accuracy": 0.9978866256773472, | |
| "epoch": 5.500125031257815, | |
| "step": 2750 | |
| }, | |
| { | |
| "loss": 0.00612783133983612, | |
| "grad_norm": 0.2199675589799881, | |
| "learning_rate": 9.11489991969001e-05, | |
| "entropy": 0.00654012646737101, | |
| "num_tokens": 17467965.0, | |
| "mean_token_accuracy": 0.9980414494872093, | |
| "epoch": 5.520130032508127, | |
| "step": 2760 | |
| }, | |
| { | |
| "loss": 0.007611159235239029, | |
| "grad_norm": 0.15056708455085754, | |
| "learning_rate": 9.049040541593854e-05, | |
| "entropy": 0.006149375334643992, | |
| "num_tokens": 17528827.0, | |
| "mean_token_accuracy": 0.9979180261492729, | |
| "epoch": 5.54013503375844, | |
| "step": 2770 | |
| }, | |
| { | |
| "loss": 0.007264629751443863, | |
| "grad_norm": 0.1319355070590973, | |
| "learning_rate": 8.98322276154509e-05, | |
| "entropy": 0.008627775539207506, | |
| "num_tokens": 17589448.0, | |
| "mean_token_accuracy": 0.9976452924311161, | |
| "epoch": 5.560140035008752, | |
| "step": 2780 | |
| }, | |
| { | |
| "loss": 0.003955654054880142, | |
| "grad_norm": 0.20958350598812103, | |
| "learning_rate": 8.917449458626636e-05, | |
| "entropy": 0.005277934976766119, | |
| "num_tokens": 17652540.0, | |
| "mean_token_accuracy": 0.9986450515687466, | |
| "epoch": 5.580145036259065, | |
| "step": 2790 | |
| }, | |
| { | |
| "loss": 0.004750333726406097, | |
| "grad_norm": 0.14845848083496094, | |
| "learning_rate": 8.85172350997584e-05, | |
| "entropy": 0.005947213277613628, | |
| "num_tokens": 17719311.0, | |
| "mean_token_accuracy": 0.9983809232711792, | |
| "epoch": 5.600150037509377, | |
| "step": 2800 | |
| }, | |
| { | |
| "loss": 0.006387320905923843, | |
| "grad_norm": 0.025019152089953423, | |
| "learning_rate": 8.786047790658619e-05, | |
| "entropy": 0.006668693362371414, | |
| "num_tokens": 17783740.0, | |
| "mean_token_accuracy": 0.9980740129947663, | |
| "epoch": 5.62015503875969, | |
| "step": 2810 | |
| }, | |
| { | |
| "loss": 0.003687459230422974, | |
| "grad_norm": 0.12704399228096008, | |
| "learning_rate": 8.720425173543694e-05, | |
| "entropy": 0.006505226148146903, | |
| "num_tokens": 17848561.0, | |
| "mean_token_accuracy": 0.9982961259782315, | |
| "epoch": 5.640160040010002, | |
| "step": 2820 | |
| }, | |
| { | |
| "loss": 0.004726226255297661, | |
| "grad_norm": 0.35164615511894226, | |
| "learning_rate": 8.654858529176926e-05, | |
| "entropy": 0.006050794995826436, | |
| "num_tokens": 17911026.0, | |
| "mean_token_accuracy": 0.9985501445829869, | |
| "epoch": 5.660165041260315, | |
| "step": 2830 | |
| }, | |
| { | |
| "loss": 0.007286908477544785, | |
| "grad_norm": 0.10387425869703293, | |
| "learning_rate": 8.589350725655745e-05, | |
| "entropy": 0.006026100756207598, | |
| "num_tokens": 17973473.0, | |
| "mean_token_accuracy": 0.9979210302233696, | |
| "epoch": 5.680170042510627, | |
| "step": 2840 | |
| }, | |
| { | |
| "loss": 0.0033504638820886614, | |
| "grad_norm": 0.26233962178230286, | |
| "learning_rate": 8.523904628503695e-05, | |
| "entropy": 0.005752308326191269, | |
| "num_tokens": 18037116.0, | |
| "mean_token_accuracy": 0.9988096967339516, | |
| "epoch": 5.70017504376094, | |
| "step": 2850 | |
| }, | |
| { | |
| "loss": 0.005085382983088494, | |
| "grad_norm": 0.10810191929340363, | |
| "learning_rate": 8.458523100545077e-05, | |
| "entropy": 0.006968487899939646, | |
| "num_tokens": 18102687.0, | |
| "mean_token_accuracy": 0.99852888956666, | |
| "epoch": 5.7201800450112525, | |
| "step": 2860 | |
| }, | |
| { | |
| "loss": 0.005646209418773651, | |
| "grad_norm": 0.14457252621650696, | |
| "learning_rate": 8.393209001779736e-05, | |
| "entropy": 0.007342068195430329, | |
| "num_tokens": 18165237.0, | |
| "mean_token_accuracy": 0.9982465572655201, | |
| "epoch": 5.740185046261566, | |
| "step": 2870 | |
| }, | |
| { | |
| "loss": 0.004496878013014793, | |
| "grad_norm": 0.2686709463596344, | |
| "learning_rate": 8.327965189257937e-05, | |
| "entropy": 0.006458067610947182, | |
| "num_tokens": 18224314.0, | |
| "mean_token_accuracy": 0.9987071558833123, | |
| "epoch": 5.760190047511878, | |
| "step": 2880 | |
| }, | |
| { | |
| "loss": 0.006712660938501358, | |
| "grad_norm": 0.08530271798372269, | |
| "learning_rate": 8.262794516955404e-05, | |
| "entropy": 0.005851120350780547, | |
| "num_tokens": 18289806.0, | |
| "mean_token_accuracy": 0.9982900738716125, | |
| "epoch": 5.780195048762191, | |
| "step": 2890 | |
| }, | |
| { | |
| "loss": 0.005763013660907745, | |
| "grad_norm": 0.11492389440536499, | |
| "learning_rate": 8.197699835648463e-05, | |
| "entropy": 0.006107417472230736, | |
| "num_tokens": 18353047.0, | |
| "mean_token_accuracy": 0.99817396402359, | |
| "epoch": 5.800200050012503, | |
| "step": 2900 | |
| }, | |
| { | |
| "loss": 0.0040702011436223985, | |
| "grad_norm": 0.07547246664762497, | |
| "learning_rate": 8.132683992789355e-05, | |
| "entropy": 0.0047601460755686276, | |
| "num_tokens": 18415963.0, | |
| "mean_token_accuracy": 0.9987201415002346, | |
| "epoch": 5.820205051262816, | |
| "step": 2910 | |
| }, | |
| { | |
| "loss": 0.00443207286298275, | |
| "grad_norm": 0.1101204976439476, | |
| "learning_rate": 8.067749832381666e-05, | |
| "entropy": 0.005160802143291221, | |
| "num_tokens": 18479175.0, | |
| "mean_token_accuracy": 0.998711721599102, | |
| "epoch": 5.840210052513128, | |
| "step": 2920 | |
| }, | |
| { | |
| "loss": 0.004888338595628738, | |
| "grad_norm": 0.05996391549706459, | |
| "learning_rate": 8.002900194855932e-05, | |
| "entropy": 0.006708003048152023, | |
| "num_tokens": 18541817.0, | |
| "mean_token_accuracy": 0.9980212546885013, | |
| "epoch": 5.860215053763441, | |
| "step": 2930 | |
| }, | |
| { | |
| "loss": 0.005104029551148415, | |
| "grad_norm": 0.03507474064826965, | |
| "learning_rate": 7.938137916945379e-05, | |
| "entropy": 0.006489402653096476, | |
| "num_tokens": 18604352.0, | |
| "mean_token_accuracy": 0.9984742797911167, | |
| "epoch": 5.880220055013753, | |
| "step": 2940 | |
| }, | |
| { | |
| "loss": 0.0060115944594144825, | |
| "grad_norm": 0.09188883751630783, | |
| "learning_rate": 7.873465831561846e-05, | |
| "entropy": 0.008611295364971738, | |
| "num_tokens": 18667858.0, | |
| "mean_token_accuracy": 0.9980850018560886, | |
| "epoch": 5.900225056264066, | |
| "step": 2950 | |
| }, | |
| { | |
| "loss": 0.004057048261165619, | |
| "grad_norm": 0.1732291430234909, | |
| "learning_rate": 7.808886767671858e-05, | |
| "entropy": 0.004953707786262385, | |
| "num_tokens": 18732898.0, | |
| "mean_token_accuracy": 0.9984007500112057, | |
| "epoch": 5.920230057514378, | |
| "step": 2960 | |
| }, | |
| { | |
| "loss": 0.006230469048023224, | |
| "grad_norm": 0.1265515387058258, | |
| "learning_rate": 7.744403550172874e-05, | |
| "entropy": 0.005422774016551557, | |
| "num_tokens": 18795336.0, | |
| "mean_token_accuracy": 0.9979394488036633, | |
| "epoch": 5.940235058764691, | |
| "step": 2970 | |
| }, | |
| { | |
| "loss": 0.004861463233828545, | |
| "grad_norm": 0.005209980066865683, | |
| "learning_rate": 7.680018999769723e-05, | |
| "entropy": 0.00592723750633013, | |
| "num_tokens": 18856243.0, | |
| "mean_token_accuracy": 0.9985147505998612, | |
| "epoch": 5.960240060015003, | |
| "step": 2980 | |
| }, | |
| { | |
| "loss": 0.007229304313659668, | |
| "grad_norm": 0.30895116925239563, | |
| "learning_rate": 7.615735932851223e-05, | |
| "entropy": 0.006106495862695738, | |
| "num_tokens": 18915043.0, | |
| "mean_token_accuracy": 0.9970440402626991, | |
| "epoch": 5.980245061265316, | |
| "step": 2990 | |
| }, | |
| { | |
| "loss": 0.004291977360844612, | |
| "grad_norm": 0.042590148746967316, | |
| "learning_rate": 7.551557161366962e-05, | |
| "entropy": 0.0063692813067213645, | |
| "num_tokens": 18977028.0, | |
| "mean_token_accuracy": 0.9986839317068269, | |
| "epoch": 6.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_loss": 0.03871263563632965, | |
| "eval_runtime": 68.9977, | |
| "eval_samples_per_second": 15.0, | |
| "eval_steps_per_second": 7.507, | |
| "eval_entropy": 0.014805409190175079, | |
| "eval_num_tokens": 18977028.0, | |
| "eval_mean_token_accuracy": 0.9913663707644783, | |
| "epoch": 6.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "train_runtime": 10605.5798, | |
| "train_samples_per_second": 7.541, | |
| "train_steps_per_second": 0.471, | |
| "total_flos": 4.254846998151168e+16, | |
| "train_loss": 0.04043002005169789, | |
| "epoch": 6.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_loss": 0.03645886108279228, | |
| "eval_runtime": 69.2159, | |
| "eval_samples_per_second": 14.953, | |
| "eval_steps_per_second": 7.484, | |
| "eval_entropy": 0.02839457441272365, | |
| "eval_num_tokens": 18977028.0, | |
| "eval_mean_token_accuracy": 0.9902446437986661, | |
| "epoch": 6.0, | |
| "step": 3000 | |
| } | |
| ] | |
| } |