{ "task": "sql2nosql", "model_name": "Salesforce/codegen-350M-multi", "device": "cuda:0", "checkpoint_run": "v4", "adapter_path": "/kaggle/working/models/checkpoints/v4/sql2nosql", "train_rows": 7998, "eval_rows": 1035, "train_loss": 0.04043002005169789, "eval_loss": 0.03645886108279228, "best_eval_loss": 0.03645886108279228, "train_runtime_seconds": 10605.5798, "mlflow_run_id": null, "filter_stats": { "input_rows": 8040, "kept_rows": 8040, "skipped_rows": 42, "skip_reasons": { "sequence_too_long": 42 } }, "token_stats": { "rows": 7998, "avg_prompt_tokens": 319.43, "avg_target_tokens": 75.03, "avg_total_tokens": 394.45, "max_total_tokens": 1328, "skipped_too_long_target": 42, "skipped_too_long_prompt": 0 }, "log_history": [ { "loss": 1.3475940704345704, "grad_norm": 1.7302765846252441, "learning_rate": 7.2e-06, "entropy": 1.1209821447730064, "num_tokens": 65756.0, "mean_token_accuracy": 0.6775479473173618, "epoch": 0.020005001250312578, "step": 10 }, { "loss": 1.1782958984375, "grad_norm": 1.598680853843689, "learning_rate": 1.52e-05, "entropy": 1.0718491852283478, "num_tokens": 127350.0, "mean_token_accuracy": 0.6978455670177937, "epoch": 0.040010002500625155, "step": 20 }, { "loss": 0.9067621231079102, "grad_norm": 1.7650020122528076, "learning_rate": 2.32e-05, "entropy": 0.9551009342074395, "num_tokens": 191970.0, "mean_token_accuracy": 0.7337856531143189, "epoch": 0.06001500375093773, "step": 30 }, { "loss": 0.6462621212005615, "grad_norm": 1.2754874229431152, "learning_rate": 3.12e-05, "entropy": 0.7395371329039335, "num_tokens": 257775.0, "mean_token_accuracy": 0.815752174705267, "epoch": 0.08002000500125031, "step": 40 }, { "loss": 0.4761983871459961, "grad_norm": 1.6131094694137573, "learning_rate": 3.9200000000000004e-05, "entropy": 0.5132245156913996, "num_tokens": 319507.0, "mean_token_accuracy": 0.8625759541988373, "epoch": 0.1000250062515629, "step": 50 }, { "loss": 0.34327900409698486, "grad_norm": 1.9517418146133423, "learning_rate": 4.72e-05, "entropy": 0.35333055444061756, "num_tokens": 380952.0, "mean_token_accuracy": 0.9010166764259339, "epoch": 0.12003000750187547, "step": 60 }, { "loss": 0.25612337589263917, "grad_norm": 1.8101425170898438, "learning_rate": 5.520000000000001e-05, "entropy": 0.2581108913756907, "num_tokens": 443849.0, "mean_token_accuracy": 0.9237508125603199, "epoch": 0.14003500875218805, "step": 70 }, { "loss": 0.20029537677764891, "grad_norm": 1.4003955125808716, "learning_rate": 6.32e-05, "entropy": 0.23392133321613073, "num_tokens": 505868.0, "mean_token_accuracy": 0.940458069741726, "epoch": 0.16004001000250062, "step": 80 }, { "loss": 0.1597532272338867, "grad_norm": 1.2149077653884888, "learning_rate": 7.12e-05, "entropy": 0.1773814239539206, "num_tokens": 570792.0, "mean_token_accuracy": 0.9488845877349377, "epoch": 0.1800450112528132, "step": 90 }, { "loss": 0.15449292659759523, "grad_norm": 1.4650107622146606, "learning_rate": 7.920000000000001e-05, "entropy": 0.16433264631778002, "num_tokens": 634476.0, "mean_token_accuracy": 0.9529499627649785, "epoch": 0.2000500125031258, "step": 100 }, { "loss": 0.14979339838027955, "grad_norm": 1.2412768602371216, "learning_rate": 8.72e-05, "entropy": 0.1567419718950987, "num_tokens": 697928.0, "mean_token_accuracy": 0.9547351159155368, "epoch": 0.22005501375343836, "step": 110 }, { "loss": 0.15537588596343993, "grad_norm": 1.0941258668899536, "learning_rate": 9.52e-05, "entropy": 0.14790078573860227, "num_tokens": 761970.0, "mean_token_accuracy": 0.9548502139747143, "epoch": 0.24006001500375093, "step": 120 }, { "loss": 0.12376174926757813, "grad_norm": 1.3730136156082153, "learning_rate": 0.0001032, "entropy": 0.14068418610841035, "num_tokens": 827125.0, "mean_token_accuracy": 0.9643007285892964, "epoch": 0.26006501625406353, "step": 130 }, { "loss": 0.10419689416885376, "grad_norm": 0.859259843826294, "learning_rate": 0.00011120000000000002, "entropy": 0.10366909941658378, "num_tokens": 890387.0, "mean_token_accuracy": 0.9708971530199051, "epoch": 0.2800700175043761, "step": 140 }, { "loss": 0.09227448105812072, "grad_norm": 0.9888283610343933, "learning_rate": 0.0001192, "entropy": 0.10762261427007616, "num_tokens": 956032.0, "mean_token_accuracy": 0.9713370814919472, "epoch": 0.30007501875468867, "step": 150 }, { "loss": 0.1083062767982483, "grad_norm": 0.9545535445213318, "learning_rate": 0.0001272, "entropy": 0.1130900933407247, "num_tokens": 1020072.0, "mean_token_accuracy": 0.9707557298243046, "epoch": 0.32008002000500124, "step": 160 }, { "loss": 0.07606152892112732, "grad_norm": 0.9866153597831726, "learning_rate": 0.0001352, "entropy": 0.0895556318340823, "num_tokens": 1083781.0, "mean_token_accuracy": 0.973467419296503, "epoch": 0.3400850212553138, "step": 170 }, { "loss": 0.10022411346435547, "grad_norm": 1.0180600881576538, "learning_rate": 0.0001432, "entropy": 0.09170240506064146, "num_tokens": 1145466.0, "mean_token_accuracy": 0.9705780848860741, "epoch": 0.3600900225056264, "step": 180 }, { "loss": 0.10711104869842529, "grad_norm": 1.129612684249878, "learning_rate": 0.00015120000000000002, "entropy": 0.11426927694119512, "num_tokens": 1208095.0, "mean_token_accuracy": 0.9698869682848453, "epoch": 0.380095023755939, "step": 190 }, { "loss": 0.08630093932151794, "grad_norm": 0.6177782416343689, "learning_rate": 0.00015920000000000002, "entropy": 0.09287996906787158, "num_tokens": 1273403.0, "mean_token_accuracy": 0.977255067974329, "epoch": 0.4001000250062516, "step": 200 }, { "loss": 0.07393635511398315, "grad_norm": 0.766137957572937, "learning_rate": 0.0001672, "entropy": 0.0744264661334455, "num_tokens": 1334848.0, "mean_token_accuracy": 0.9792576834559441, "epoch": 0.42010502625656415, "step": 210 }, { "loss": 0.09994233846664428, "grad_norm": 0.6585826277732849, "learning_rate": 0.0001752, "entropy": 0.10690853425767273, "num_tokens": 1400976.0, "mean_token_accuracy": 0.972873219102621, "epoch": 0.4401100275068767, "step": 220 }, { "loss": 0.06631548404693603, "grad_norm": 0.7318869233131409, "learning_rate": 0.0001832, "entropy": 0.06925062141381204, "num_tokens": 1462530.0, "mean_token_accuracy": 0.9832681395113468, "epoch": 0.4601150287571893, "step": 230 }, { "loss": 0.09161096215248107, "grad_norm": 0.46499672532081604, "learning_rate": 0.0001912, "entropy": 0.08352572850417346, "num_tokens": 1523663.0, "mean_token_accuracy": 0.9757984310388566, "epoch": 0.48012003000750186, "step": 240 }, { "loss": 0.05958831310272217, "grad_norm": 0.6253766417503357, "learning_rate": 0.00019920000000000002, "entropy": 0.06921031260862946, "num_tokens": 1588657.0, "mean_token_accuracy": 0.982395163923502, "epoch": 0.5001250312578145, "step": 250 }, { "loss": 0.06900651454925537, "grad_norm": 0.6349820494651794, "learning_rate": 0.00019999822839757118, "entropy": 0.06543620774755254, "num_tokens": 1653260.0, "mean_token_accuracy": 0.9801992796361446, "epoch": 0.5201300325081271, "step": 260 }, { "loss": 0.06709518432617187, "grad_norm": 0.6046717166900635, "learning_rate": 0.00019999210442038162, "entropy": 0.06953847317490727, "num_tokens": 1718687.0, "mean_token_accuracy": 0.9797540627419948, "epoch": 0.5401350337584396, "step": 270 }, { "loss": 0.09603813290596008, "grad_norm": 0.7929577231407166, "learning_rate": 0.00019998160646461522, "entropy": 0.08993639135733247, "num_tokens": 1779338.0, "mean_token_accuracy": 0.9745012931525707, "epoch": 0.5601400350087522, "step": 280 }, { "loss": 0.06412749290466309, "grad_norm": 0.3916383683681488, "learning_rate": 0.00019996673498948658, "entropy": 0.06307904429268092, "num_tokens": 1842872.0, "mean_token_accuracy": 0.9828441753983498, "epoch": 0.5801450362590648, "step": 290 }, { "loss": 0.051730161905288695, "grad_norm": 0.38883084058761597, "learning_rate": 0.00019994749064552214, "entropy": 0.05729433842934668, "num_tokens": 1904154.0, "mean_token_accuracy": 0.9857619300484657, "epoch": 0.6001500375093773, "step": 300 }, { "loss": 0.042625024914741516, "grad_norm": 0.6382091045379639, "learning_rate": 0.0001999238742745319, "entropy": 0.03964498438872397, "num_tokens": 1966060.0, "mean_token_accuracy": 0.9874393172562123, "epoch": 0.6201550387596899, "step": 310 }, { "loss": 0.06732727885246277, "grad_norm": 0.6905948519706726, "learning_rate": 0.00019989588690957249, "entropy": 0.05733265266753733, "num_tokens": 2031939.0, "mean_token_accuracy": 0.982555440813303, "epoch": 0.6401600400100025, "step": 320 }, { "loss": 0.058036553859710696, "grad_norm": 0.4337286949157715, "learning_rate": 0.0001998635297749018, "entropy": 0.07143733124248683, "num_tokens": 2095271.0, "mean_token_accuracy": 0.9844090364873409, "epoch": 0.660165041260315, "step": 330 }, { "loss": 0.053340816497802736, "grad_norm": 0.3526521921157837, "learning_rate": 0.00019982680428592584, "entropy": 0.04944599290611222, "num_tokens": 2158321.0, "mean_token_accuracy": 0.9839612312614918, "epoch": 0.6801700425106276, "step": 340 }, { "loss": 0.051858377456665036, "grad_norm": 0.5422689318656921, "learning_rate": 0.00019978571204913638, "entropy": 0.06322509178426117, "num_tokens": 2225062.0, "mean_token_accuracy": 0.9867838315665722, "epoch": 0.7001750437609402, "step": 350 }, { "loss": 0.05608519911766052, "grad_norm": 0.7101793885231018, "learning_rate": 0.000199740254862041, "entropy": 0.046866965352091935, "num_tokens": 2291157.0, "mean_token_accuracy": 0.9851541951298713, "epoch": 0.7201800450112528, "step": 360 }, { "loss": 0.056741136312484744, "grad_norm": 0.6186705827713013, "learning_rate": 0.00019969043471308436, "entropy": 0.06618997184559702, "num_tokens": 2353621.0, "mean_token_accuracy": 0.9844918318092823, "epoch": 0.7401850462615653, "step": 370 }, { "loss": 0.05278732180595398, "grad_norm": 0.9665183424949646, "learning_rate": 0.00019963625378156114, "entropy": 0.052203354140510784, "num_tokens": 2415518.0, "mean_token_accuracy": 0.9863728702068328, "epoch": 0.760190047511878, "step": 380 }, { "loss": 0.044900187849998476, "grad_norm": 0.45738333463668823, "learning_rate": 0.00019957771443752083, "entropy": 0.04799637275282294, "num_tokens": 2477716.0, "mean_token_accuracy": 0.9872696734964848, "epoch": 0.7801950487621906, "step": 390 }, { "loss": 0.043438228964805606, "grad_norm": 0.4040285646915436, "learning_rate": 0.00019951481924166396, "entropy": 0.045062902639620005, "num_tokens": 2540807.0, "mean_token_accuracy": 0.9878960207104683, "epoch": 0.8002000500125032, "step": 400 }, { "loss": 0.04615793526172638, "grad_norm": 0.4411618411540985, "learning_rate": 0.0001994475709452301, "entropy": 0.036265855759847906, "num_tokens": 2603019.0, "mean_token_accuracy": 0.9870041370391845, "epoch": 0.8202050512628157, "step": 410 }, { "loss": 0.045778676867485046, "grad_norm": 0.31862467527389526, "learning_rate": 0.0001993759724898777, "entropy": 0.05851077587576583, "num_tokens": 2667216.0, "mean_token_accuracy": 0.9873291261494159, "epoch": 0.8402100525131283, "step": 420 }, { "loss": 0.03828286230564117, "grad_norm": 0.29344919323921204, "learning_rate": 0.00019930002700755507, "entropy": 0.03860169492545538, "num_tokens": 2729805.0, "mean_token_accuracy": 0.988411296159029, "epoch": 0.8602150537634409, "step": 430 }, { "loss": 0.038545310497283936, "grad_norm": 0.4283672571182251, "learning_rate": 0.00019921973782036366, "entropy": 0.03951184251927771, "num_tokens": 2793292.0, "mean_token_accuracy": 0.9878928653895855, "epoch": 0.8802200550137534, "step": 440 }, { "loss": 0.03233465254306793, "grad_norm": 0.7173567414283752, "learning_rate": 0.0001991351084404126, "entropy": 0.028071055363398045, "num_tokens": 2855909.0, "mean_token_accuracy": 0.9912850938737392, "epoch": 0.900225056264066, "step": 450 }, { "loss": 0.040875044465065, "grad_norm": 0.3380762040615082, "learning_rate": 0.00019904614256966512, "entropy": 0.04781279567687306, "num_tokens": 2916597.0, "mean_token_accuracy": 0.9889427930116653, "epoch": 0.9202300575143786, "step": 460 }, { "loss": 0.04227911233901978, "grad_norm": 0.21747978031635284, "learning_rate": 0.0001989528440997767, "entropy": 0.045654052757890896, "num_tokens": 2977012.0, "mean_token_accuracy": 0.987830163538456, "epoch": 0.9402350587646912, "step": 470 }, { "loss": 0.03866271674633026, "grad_norm": 0.3250534236431122, "learning_rate": 0.00019885521711192453, "entropy": 0.039897680119611326, "num_tokens": 3039866.0, "mean_token_accuracy": 0.9888145305216313, "epoch": 0.9602400600150037, "step": 480 }, { "loss": 0.030780380964279173, "grad_norm": 0.5867555141448975, "learning_rate": 0.00019875326587662941, "entropy": 0.0344677664746996, "num_tokens": 3102450.0, "mean_token_accuracy": 0.9910528786480427, "epoch": 0.9802450612653163, "step": 490 }, { "loss": 0.04189955592155457, "grad_norm": 0.19166764616966248, "learning_rate": 0.00019864699485356866, "entropy": 0.03601513006665473, "num_tokens": 3162838.0, "mean_token_accuracy": 0.989976388744161, "epoch": 1.0, "step": 500 }, { "eval_loss": 0.04872545599937439, "eval_runtime": 69.4136, "eval_samples_per_second": 14.911, "eval_steps_per_second": 7.463, "eval_entropy": 0.051686967685315256, "eval_num_tokens": 3162838.0, "eval_mean_token_accuracy": 0.9849747346865164, "epoch": 1.0, "step": 500 }, { "loss": 0.03468368649482727, "grad_norm": 0.2645007371902466, "learning_rate": 0.00019853640869138103, "entropy": 0.04407569046597928, "num_tokens": 3228763.0, "mean_token_accuracy": 0.990016209334135, "epoch": 1.0200050012503126, "step": 510 }, { "loss": 0.03389493525028229, "grad_norm": 0.40270644426345825, "learning_rate": 0.00019842151222746357, "entropy": 0.035535094334045426, "num_tokens": 3293010.0, "mean_token_accuracy": 0.9887583516538143, "epoch": 1.0400100025006251, "step": 520 }, { "loss": 0.030898410081863403, "grad_norm": 0.2681713104248047, "learning_rate": 0.00019830231048775977, "entropy": 0.028601143200648948, "num_tokens": 3354919.0, "mean_token_accuracy": 0.9903686709702015, "epoch": 1.0600150037509377, "step": 530 }, { "loss": 0.03407395482063293, "grad_norm": 0.23451267182826996, "learning_rate": 0.00019817880868653993, "entropy": 0.034907517378451304, "num_tokens": 3415784.0, "mean_token_accuracy": 0.9890573389828206, "epoch": 1.0800200050012503, "step": 540 }, { "loss": 0.029421544075012206, "grad_norm": 0.23950988054275513, "learning_rate": 0.0001980510122261729, "entropy": 0.033313815778819846, "num_tokens": 3480364.0, "mean_token_accuracy": 0.9916689246892929, "epoch": 1.1000250062515629, "step": 550 }, { "loss": 0.020369285345077516, "grad_norm": 0.4551165997982025, "learning_rate": 0.00019791892669688988, "entropy": 0.02486751726246439, "num_tokens": 3542678.0, "mean_token_accuracy": 0.9940513521432877, "epoch": 1.1200300075018754, "step": 560 }, { "loss": 0.02770337164402008, "grad_norm": 0.20443572103977203, "learning_rate": 0.00019778255787653978, "entropy": 0.029150180192664264, "num_tokens": 3609086.0, "mean_token_accuracy": 0.9897698886692524, "epoch": 1.140035008752188, "step": 570 }, { "loss": 0.025546741485595704, "grad_norm": 0.3653818368911743, "learning_rate": 0.00019764191173033663, "entropy": 0.031121585314394906, "num_tokens": 3670310.0, "mean_token_accuracy": 0.9925875566899777, "epoch": 1.1600400100025006, "step": 580 }, { "loss": 0.027299800515174867, "grad_norm": 0.4811317026615143, "learning_rate": 0.00019749699441059843, "entropy": 0.02902457951568067, "num_tokens": 3735307.0, "mean_token_accuracy": 0.9906462356448174, "epoch": 1.1800450112528131, "step": 590 }, { "loss": 0.02665548324584961, "grad_norm": 0.21709105372428894, "learning_rate": 0.00019734781225647828, "entropy": 0.030135014103143475, "num_tokens": 3797213.0, "mean_token_accuracy": 0.9932463668286801, "epoch": 1.2000500125031257, "step": 600 }, { "loss": 0.03535972833633423, "grad_norm": 0.631148636341095, "learning_rate": 0.00019719437179368688, "entropy": 0.03371675145754125, "num_tokens": 3859400.0, "mean_token_accuracy": 0.9895499177277088, "epoch": 1.2200550137534383, "step": 610 }, { "loss": 0.027658408880233763, "grad_norm": 0.42123743891716003, "learning_rate": 0.00019703667973420706, "entropy": 0.028748418507166206, "num_tokens": 3920848.0, "mean_token_accuracy": 0.9910015679895878, "epoch": 1.2400600150037508, "step": 620 }, { "loss": 0.028230640292167663, "grad_norm": 0.23473748564720154, "learning_rate": 0.00019687474297600045, "entropy": 0.029886699473718182, "num_tokens": 3984529.0, "mean_token_accuracy": 0.9922301307320595, "epoch": 1.2600650162540634, "step": 630 }, { "loss": 0.027012214064598083, "grad_norm": 0.2611916661262512, "learning_rate": 0.00019670856860270542, "entropy": 0.03151440276997164, "num_tokens": 4048411.0, "mean_token_accuracy": 0.9917375601828098, "epoch": 1.280070017504376, "step": 640 }, { "loss": 0.023584455251693726, "grad_norm": 0.12378375232219696, "learning_rate": 0.0001965381638833274, "entropy": 0.027149295064737088, "num_tokens": 4112116.0, "mean_token_accuracy": 0.9936468034982682, "epoch": 1.3000750187546886, "step": 650 }, { "loss": 0.025832393765449525, "grad_norm": 0.18841037154197693, "learning_rate": 0.00019636353627192082, "entropy": 0.028390987019520253, "num_tokens": 4175458.0, "mean_token_accuracy": 0.9933209784328938, "epoch": 1.3200800200050011, "step": 660 }, { "loss": 0.032191649079322815, "grad_norm": 0.292369544506073, "learning_rate": 0.00019618469340726319, "entropy": 0.032682666774780954, "num_tokens": 4236466.0, "mean_token_accuracy": 0.9895716637372971, "epoch": 1.3400850212553137, "step": 670 }, { "loss": 0.02866535782814026, "grad_norm": 0.2205415517091751, "learning_rate": 0.00019600164311252068, "entropy": 0.032574003856279884, "num_tokens": 4299775.0, "mean_token_accuracy": 0.991417796164751, "epoch": 1.3600900225056263, "step": 680 }, { "loss": 0.03524776101112366, "grad_norm": 0.3276292681694031, "learning_rate": 0.00019581439339490624, "entropy": 0.04169052811048459, "num_tokens": 4365609.0, "mean_token_accuracy": 0.9886757604777813, "epoch": 1.380095023755939, "step": 690 }, { "loss": 0.035996857285499576, "grad_norm": 0.4103780686855316, "learning_rate": 0.0001956229524453291, "entropy": 0.03188371795695275, "num_tokens": 4432330.0, "mean_token_accuracy": 0.9892666183412075, "epoch": 1.4001000250062516, "step": 700 }, { "loss": 0.02328706532716751, "grad_norm": 0.24775762856006622, "learning_rate": 0.00019542732863803662, "entropy": 0.02871296225930564, "num_tokens": 4496465.0, "mean_token_accuracy": 0.9937438026070595, "epoch": 1.4201050262565642, "step": 710 }, { "loss": 0.03300818204879761, "grad_norm": 0.25881657004356384, "learning_rate": 0.00019522753053024787, "entropy": 0.03388670613931026, "num_tokens": 4560755.0, "mean_token_accuracy": 0.9890970505774022, "epoch": 1.4401100275068768, "step": 720 }, { "loss": 0.03214167952537537, "grad_norm": 0.23787066340446472, "learning_rate": 0.00019502356686177926, "entropy": 0.03670836841047276, "num_tokens": 4625202.0, "mean_token_accuracy": 0.9903383336961269, "epoch": 1.4601150287571893, "step": 730 }, { "loss": 0.031187814474105836, "grad_norm": 0.31929901242256165, "learning_rate": 0.00019481544655466245, "entropy": 0.03299383492558263, "num_tokens": 4692174.0, "mean_token_accuracy": 0.9905215993523597, "epoch": 1.480120030007502, "step": 740 }, { "loss": 0.025655516982078554, "grad_norm": 0.24006661772727966, "learning_rate": 0.00019460317871275394, "entropy": 0.023855643330898603, "num_tokens": 4753192.0, "mean_token_accuracy": 0.9913376875221729, "epoch": 1.5001250312578145, "step": 750 }, { "loss": 0.03126271665096283, "grad_norm": 0.2834339737892151, "learning_rate": 0.00019438677262133668, "entropy": 0.033190094074234365, "num_tokens": 4817884.0, "mean_token_accuracy": 0.9907064586877823, "epoch": 1.520130032508127, "step": 760 }, { "loss": 0.033395078778266904, "grad_norm": 0.4165857136249542, "learning_rate": 0.00019416623774671425, "entropy": 0.03176074127841275, "num_tokens": 4879601.0, "mean_token_accuracy": 0.9902952447533607, "epoch": 1.5401350337584396, "step": 770 }, { "loss": 0.02917470932006836, "grad_norm": 0.5297831296920776, "learning_rate": 0.00019394158373579645, "entropy": 0.03441936054150574, "num_tokens": 4946026.0, "mean_token_accuracy": 0.9917018190026283, "epoch": 1.5601400350087522, "step": 780 }, { "loss": 0.02672044336795807, "grad_norm": 0.3761133849620819, "learning_rate": 0.00019371282041567752, "entropy": 0.029212182367336935, "num_tokens": 5009097.0, "mean_token_accuracy": 0.9930847369134426, "epoch": 1.5801450362590648, "step": 790 }, { "loss": 0.0338908702135086, "grad_norm": 0.2545328438282013, "learning_rate": 0.0001934799577932062, "entropy": 0.03556556548574008, "num_tokens": 5076314.0, "mean_token_accuracy": 0.990411739051342, "epoch": 1.6001500375093773, "step": 800 }, { "loss": 0.022386419773101806, "grad_norm": 0.3428667187690735, "learning_rate": 0.0001932430060545479, "entropy": 0.02515874128730502, "num_tokens": 5135522.0, "mean_token_accuracy": 0.9932228110730648, "epoch": 1.62015503875969, "step": 810 }, { "loss": 0.02211230844259262, "grad_norm": 0.19730041921138763, "learning_rate": 0.00019300197556473936, "entropy": 0.021622967024450192, "num_tokens": 5198651.0, "mean_token_accuracy": 0.993052315711975, "epoch": 1.6401600400100025, "step": 820 }, { "loss": 0.021593029797077178, "grad_norm": 0.24043497443199158, "learning_rate": 0.00019275687686723497, "entropy": 0.022755468662944624, "num_tokens": 5258441.0, "mean_token_accuracy": 0.9927247293293476, "epoch": 1.660165041260315, "step": 830 }, { "loss": 0.02743455469608307, "grad_norm": 0.22126108407974243, "learning_rate": 0.0001925077206834458, "entropy": 0.02988760783628095, "num_tokens": 5323635.0, "mean_token_accuracy": 0.9924947433173656, "epoch": 1.6801700425106276, "step": 840 }, { "loss": 0.01915370374917984, "grad_norm": 0.2528051435947418, "learning_rate": 0.00019225451791227052, "entropy": 0.022633779112948105, "num_tokens": 5388098.0, "mean_token_accuracy": 0.9935295671224594, "epoch": 1.7001750437609402, "step": 850 }, { "loss": 0.025216898322105406, "grad_norm": 0.35426992177963257, "learning_rate": 0.00019199727962961852, "entropy": 0.024347139010205864, "num_tokens": 5450303.0, "mean_token_accuracy": 0.9927972495555878, "epoch": 1.7201800450112528, "step": 860 }, { "loss": 0.022424712777137756, "grad_norm": 0.2603664994239807, "learning_rate": 0.00019173601708792566, "entropy": 0.02343553317186888, "num_tokens": 5513723.0, "mean_token_accuracy": 0.9926920354366302, "epoch": 1.7401850462615653, "step": 870 }, { "loss": 0.03777352273464203, "grad_norm": 0.21528302133083344, "learning_rate": 0.0001914707417156619, "entropy": 0.03952418522676453, "num_tokens": 5575942.0, "mean_token_accuracy": 0.9895162962377071, "epoch": 1.7601900475118781, "step": 880 }, { "loss": 0.02916957139968872, "grad_norm": 0.39761167764663696, "learning_rate": 0.00019120146511683142, "entropy": 0.037056630512233825, "num_tokens": 5640243.0, "mean_token_accuracy": 0.9906649015843868, "epoch": 1.7801950487621907, "step": 890 }, { "loss": 0.023631574213504793, "grad_norm": 0.43694376945495605, "learning_rate": 0.00019092819907046493, "entropy": 0.022086267481790857, "num_tokens": 5702162.0, "mean_token_accuracy": 0.9936031945049763, "epoch": 1.8002000500125033, "step": 900 }, { "loss": 0.025940075516700745, "grad_norm": 0.4214474558830261, "learning_rate": 0.00019065095553010458, "entropy": 0.028572715594782493, "num_tokens": 5764127.0, "mean_token_accuracy": 0.9905624501407146, "epoch": 1.8202050512628158, "step": 910 }, { "loss": 0.027613845467567445, "grad_norm": 0.40316465497016907, "learning_rate": 0.00019036974662328096, "entropy": 0.028239472245331854, "num_tokens": 5827235.0, "mean_token_accuracy": 0.991669587045908, "epoch": 1.8402100525131284, "step": 920 }, { "loss": 0.03177001476287842, "grad_norm": 0.524972677230835, "learning_rate": 0.0001900845846509827, "entropy": 0.028241146955406294, "num_tokens": 5890040.0, "mean_token_accuracy": 0.9903169378638268, "epoch": 1.860215053763441, "step": 930 }, { "loss": 0.02139996737241745, "grad_norm": 0.43904051184654236, "learning_rate": 0.00018979548208711817, "entropy": 0.03260187199921347, "num_tokens": 5953149.0, "mean_token_accuracy": 0.9935068063437938, "epoch": 1.8802200550137536, "step": 940 }, { "loss": 0.02489333599805832, "grad_norm": 0.25154390931129456, "learning_rate": 0.00018950245157797014, "entropy": 0.025593279630993494, "num_tokens": 6014655.0, "mean_token_accuracy": 0.9933448024094105, "epoch": 1.9002250562640661, "step": 950 }, { "loss": 0.02543329894542694, "grad_norm": 0.2318635731935501, "learning_rate": 0.00018920550594164238, "entropy": 0.025231685642211232, "num_tokens": 6078667.0, "mean_token_accuracy": 0.9929649449884892, "epoch": 1.9202300575143787, "step": 960 }, { "loss": 0.03582499623298645, "grad_norm": 0.2020518183708191, "learning_rate": 0.00018890465816749896, "entropy": 0.0415392193797743, "num_tokens": 6139688.0, "mean_token_accuracy": 0.9897747471928596, "epoch": 1.9402350587646913, "step": 970 }, { "loss": 0.023522551357746124, "grad_norm": 0.25302180647850037, "learning_rate": 0.00018859992141559615, "entropy": 0.026439224516798275, "num_tokens": 6203193.0, "mean_token_accuracy": 0.9931276544928551, "epoch": 1.9602400600150038, "step": 980 }, { "loss": 0.023089873790740966, "grad_norm": 0.37129050493240356, "learning_rate": 0.00018829130901610667, "entropy": 0.02257391346647637, "num_tokens": 6265353.0, "mean_token_accuracy": 0.9930807471275329, "epoch": 1.9802450612653164, "step": 990 }, { "loss": 0.020879687368869783, "grad_norm": 0.1416839361190796, "learning_rate": 0.00018797883446873662, "entropy": 0.024826381788765894, "num_tokens": 6325676.0, "mean_token_accuracy": 0.9931328839893583, "epoch": 2.0, "step": 1000 }, { "eval_loss": 0.042340315878391266, "eval_runtime": 69.2562, "eval_samples_per_second": 14.945, "eval_steps_per_second": 7.479, "eval_entropy": 0.028477752043098808, "eval_num_tokens": 6325676.0, "eval_mean_token_accuracy": 0.988268693211456, "epoch": 2.0, "step": 1000 }, { "loss": 0.0183292493224144, "grad_norm": 0.33506715297698975, "learning_rate": 0.00018766251144213504, "entropy": 0.021088267347658986, "num_tokens": 6391016.0, "mean_token_accuracy": 0.9939773567020893, "epoch": 2.0200050012503126, "step": 1010 }, { "loss": 0.016541089117527007, "grad_norm": 0.10510263592004776, "learning_rate": 0.00018734235377329582, "entropy": 0.021377279089938382, "num_tokens": 6455040.0, "mean_token_accuracy": 0.9943198271095752, "epoch": 2.040010002500625, "step": 1020 }, { "loss": 0.017676208913326264, "grad_norm": 0.25538530945777893, "learning_rate": 0.0001870183754669526, "entropy": 0.01835900279111229, "num_tokens": 6517983.0, "mean_token_accuracy": 0.9943479098379612, "epoch": 2.0600150037509377, "step": 1030 }, { "loss": 0.018231543898582458, "grad_norm": 0.1953907310962677, "learning_rate": 0.00018669059069496594, "entropy": 0.024707998137455434, "num_tokens": 6582155.0, "mean_token_accuracy": 0.9940299488604069, "epoch": 2.0800200050012503, "step": 1040 }, { "loss": 0.015705856680870055, "grad_norm": 0.23519866168498993, "learning_rate": 0.00018635901379570377, "entropy": 0.016339628079731484, "num_tokens": 6644403.0, "mean_token_accuracy": 0.9944866336882114, "epoch": 2.100025006251563, "step": 1050 }, { "loss": 0.0239964097738266, "grad_norm": 0.7782704830169678, "learning_rate": 0.00018602365927341375, "entropy": 0.021186151236179285, "num_tokens": 6709057.0, "mean_token_accuracy": 0.9942199148237705, "epoch": 2.1200300075018754, "step": 1060 }, { "loss": 0.0214329332113266, "grad_norm": 0.25117242336273193, "learning_rate": 0.0001856845417975891, "entropy": 0.02400836138986051, "num_tokens": 6772040.0, "mean_token_accuracy": 0.99395372569561, "epoch": 2.140035008752188, "step": 1070 }, { "loss": 0.01707075983285904, "grad_norm": 0.24927817285060883, "learning_rate": 0.0001853416762023268, "entropy": 0.01854798578133341, "num_tokens": 6835866.0, "mean_token_accuracy": 0.9950113117694854, "epoch": 2.1600400100025006, "step": 1080 }, { "loss": 0.014785376191139222, "grad_norm": 0.24353672564029694, "learning_rate": 0.00018499507748567873, "entropy": 0.019260429358109833, "num_tokens": 6899725.0, "mean_token_accuracy": 0.9959283553063869, "epoch": 2.180045011252813, "step": 1090 }, { "loss": 0.019350311160087584, "grad_norm": 0.288215309381485, "learning_rate": 0.00018464476080899559, "entropy": 0.02487965851032641, "num_tokens": 6963141.0, "mean_token_accuracy": 0.9941258184611798, "epoch": 2.2000500125031257, "step": 1100 }, { "loss": 0.017427970468997956, "grad_norm": 0.0646059513092041, "learning_rate": 0.00018429074149626363, "entropy": 0.01580278711626306, "num_tokens": 7028325.0, "mean_token_accuracy": 0.9952689491212368, "epoch": 2.2200550137534383, "step": 1110 }, { "loss": 0.01726052612066269, "grad_norm": 0.160948246717453, "learning_rate": 0.0001839330350334345, "entropy": 0.020199327028240077, "num_tokens": 7092920.0, "mean_token_accuracy": 0.9933249458670617, "epoch": 2.240060015003751, "step": 1120 }, { "loss": 0.01608244627714157, "grad_norm": 0.2359917163848877, "learning_rate": 0.00018357165706774767, "entropy": 0.021389624777657445, "num_tokens": 7160997.0, "mean_token_accuracy": 0.9940837919712067, "epoch": 2.2600650162540634, "step": 1130 }, { "loss": 0.020376379787921905, "grad_norm": 0.07118914276361465, "learning_rate": 0.00018320662340704609, "entropy": 0.02022790874907514, "num_tokens": 7226007.0, "mean_token_accuracy": 0.9942706093192101, "epoch": 2.280070017504376, "step": 1140 }, { "loss": 0.01612715721130371, "grad_norm": 0.25310513377189636, "learning_rate": 0.00018283795001908457, "entropy": 0.01867675751855131, "num_tokens": 7287986.0, "mean_token_accuracy": 0.9942055746912957, "epoch": 2.3000750187546886, "step": 1150 }, { "loss": 0.016605789959430694, "grad_norm": 0.2142266184091568, "learning_rate": 0.0001824656530308315, "entropy": 0.015577676898101345, "num_tokens": 7349421.0, "mean_token_accuracy": 0.9948085315525532, "epoch": 2.320080020005001, "step": 1160 }, { "loss": 0.018196111917495726, "grad_norm": 0.07947535812854767, "learning_rate": 0.00018208974872776322, "entropy": 0.020357475349737798, "num_tokens": 7411941.0, "mean_token_accuracy": 0.993843074887991, "epoch": 2.3400850212553137, "step": 1170 }, { "loss": 0.016091108322143555, "grad_norm": 0.19202570617198944, "learning_rate": 0.00018171025355315164, "entropy": 0.017023067966511006, "num_tokens": 7474356.0, "mean_token_accuracy": 0.9953217662870883, "epoch": 2.3600900225056263, "step": 1180 }, { "loss": 0.015425822138786316, "grad_norm": 0.24460658431053162, "learning_rate": 0.00018132718410734515, "entropy": 0.01825423450791277, "num_tokens": 7536565.0, "mean_token_accuracy": 0.9943965286016464, "epoch": 2.380095023755939, "step": 1190 }, { "loss": 0.013514925539493561, "grad_norm": 0.24659694731235504, "learning_rate": 0.00018094055714704225, "entropy": 0.015542891589575447, "num_tokens": 7599751.0, "mean_token_accuracy": 0.9943179704248906, "epoch": 2.4001000250062514, "step": 1200 }, { "loss": 0.012726837396621704, "grad_norm": 0.2550601065158844, "learning_rate": 0.0001805503895845587, "entropy": 0.015307287167524919, "num_tokens": 7661520.0, "mean_token_accuracy": 0.9962130591273308, "epoch": 2.420105026256564, "step": 1210 }, { "loss": 0.012257835268974305, "grad_norm": 0.15603283047676086, "learning_rate": 0.00018015669848708767, "entropy": 0.01749844834121177, "num_tokens": 7726291.0, "mean_token_accuracy": 0.9954387851059436, "epoch": 2.4401100275068766, "step": 1220 }, { "loss": 0.018561355769634247, "grad_norm": 0.22746174037456512, "learning_rate": 0.0001797595010759531, "entropy": 0.019737370508664753, "num_tokens": 7788766.0, "mean_token_accuracy": 0.9940820440649987, "epoch": 2.460115028757189, "step": 1230 }, { "loss": 0.013849316537380219, "grad_norm": 0.3152976334095001, "learning_rate": 0.0001793588147258565, "entropy": 0.015929855390277227, "num_tokens": 7851396.0, "mean_token_accuracy": 0.9952766291797162, "epoch": 2.4801200300075017, "step": 1240 }, { "loss": 0.019299986958503722, "grad_norm": 0.2762889862060547, "learning_rate": 0.00017895465696411692, "entropy": 0.02108022033935413, "num_tokens": 7915421.0, "mean_token_accuracy": 0.9940553769469261, "epoch": 2.5001250312578147, "step": 1250 }, { "loss": 0.020875005424022673, "grad_norm": 0.24086585640907288, "learning_rate": 0.00017854704546990408, "entropy": 0.020866505106096157, "num_tokens": 7977133.0, "mean_token_accuracy": 0.9940896175801754, "epoch": 2.520130032508127, "step": 1260 }, { "loss": 0.018643879890441896, "grad_norm": 0.23781460523605347, "learning_rate": 0.0001781359980734653, "entropy": 0.020857046739547514, "num_tokens": 8040191.0, "mean_token_accuracy": 0.9929048053920269, "epoch": 2.54013503375844, "step": 1270 }, { "loss": 0.017947974801063537, "grad_norm": 0.2054099142551422, "learning_rate": 0.0001777215327553452, "entropy": 0.021198420476866885, "num_tokens": 8100152.0, "mean_token_accuracy": 0.9934561550617218, "epoch": 2.560140035008752, "step": 1280 }, { "loss": 0.0151192307472229, "grad_norm": 0.469458669424057, "learning_rate": 0.00017730366764559955, "entropy": 0.018285114454920405, "num_tokens": 8162591.0, "mean_token_accuracy": 0.9951836079359054, "epoch": 2.580145036259065, "step": 1290 }, { "loss": 0.0184975802898407, "grad_norm": 0.2882782518863678, "learning_rate": 0.00017688242102300192, "entropy": 0.018374070005665998, "num_tokens": 8225224.0, "mean_token_accuracy": 0.9948060251772404, "epoch": 2.600150037509377, "step": 1300 }, { "loss": 0.023296315968036652, "grad_norm": 0.21924524009227753, "learning_rate": 0.00017645781131424423, "entropy": 0.022974171601526906, "num_tokens": 8290274.0, "mean_token_accuracy": 0.9924322210252285, "epoch": 2.62015503875969, "step": 1310 }, { "loss": 0.017917373776435853, "grad_norm": 0.354758620262146, "learning_rate": 0.00017602985709313073, "entropy": 0.02169415617827326, "num_tokens": 8354370.0, "mean_token_accuracy": 0.9948078036308289, "epoch": 2.6401600400100023, "step": 1320 }, { "loss": 0.012286465615034103, "grad_norm": 0.4151551127433777, "learning_rate": 0.00017559857707976536, "entropy": 0.016268294051405972, "num_tokens": 8415022.0, "mean_token_accuracy": 0.9961770802736283, "epoch": 2.6601650412603153, "step": 1330 }, { "loss": 0.01499750316143036, "grad_norm": 0.4065402150154114, "learning_rate": 0.0001751639901397331, "entropy": 0.0170176492218161, "num_tokens": 8478286.0, "mean_token_accuracy": 0.9952280893921852, "epoch": 2.6801700425106274, "step": 1340 }, { "loss": 0.015018537640571594, "grad_norm": 0.1335880309343338, "learning_rate": 0.0001747261152832746, "entropy": 0.018367627350380646, "num_tokens": 8541154.0, "mean_token_accuracy": 0.9949840374290944, "epoch": 2.7001750437609404, "step": 1350 }, { "loss": 0.019237272441387177, "grad_norm": 0.20553363859653473, "learning_rate": 0.00017428497166445452, "entropy": 0.019403737914399245, "num_tokens": 8605361.0, "mean_token_accuracy": 0.9930156201124192, "epoch": 2.7201800450112525, "step": 1360 }, { "loss": 0.019147740304470064, "grad_norm": 0.31576329469680786, "learning_rate": 0.00017384057858032393, "entropy": 0.02298831292137038, "num_tokens": 8669155.0, "mean_token_accuracy": 0.9930574476718903, "epoch": 2.7401850462615656, "step": 1370 }, { "loss": 0.017152118682861327, "grad_norm": 0.21389739215373993, "learning_rate": 0.00017339295547007594, "entropy": 0.01718737747578416, "num_tokens": 8735019.0, "mean_token_accuracy": 0.995334691554308, "epoch": 2.760190047511878, "step": 1380 }, { "loss": 0.019429606199264527, "grad_norm": 0.26539650559425354, "learning_rate": 0.00017294212191419547, "entropy": 0.019683032816101332, "num_tokens": 8800972.0, "mean_token_accuracy": 0.9936951123178005, "epoch": 2.7801950487621907, "step": 1390 }, { "loss": 0.01909356415271759, "grad_norm": 0.2084941565990448, "learning_rate": 0.00017248809763360277, "entropy": 0.018636453218641692, "num_tokens": 8867596.0, "mean_token_accuracy": 0.9940625011920929, "epoch": 2.8002000500125033, "step": 1400 }, { "loss": 0.018046848475933075, "grad_norm": 0.21403200924396515, "learning_rate": 0.0001720309024887907, "entropy": 0.023316194582730532, "num_tokens": 8927516.0, "mean_token_accuracy": 0.9939217306673527, "epoch": 2.820205051262816, "step": 1410 }, { "loss": 0.018755699694156646, "grad_norm": 0.33148443698883057, "learning_rate": 0.000171570556478956, "entropy": 0.01655098560877377, "num_tokens": 8989089.0, "mean_token_accuracy": 0.9942230053246022, "epoch": 2.8402100525131284, "step": 1420 }, { "loss": 0.024141687154769897, "grad_norm": 0.18521511554718018, "learning_rate": 0.00017110707974112447, "entropy": 0.02549898542056326, "num_tokens": 9054435.0, "mean_token_accuracy": 0.9930150359869003, "epoch": 2.860215053763441, "step": 1430 }, { "loss": 0.020157690346240997, "grad_norm": 0.23067928850650787, "learning_rate": 0.0001706404925492701, "entropy": 0.01900827525241766, "num_tokens": 9114274.0, "mean_token_accuracy": 0.9943146407604218, "epoch": 2.8802200550137536, "step": 1440 }, { "loss": 0.014147150516510009, "grad_norm": 0.5235961079597473, "learning_rate": 0.00017017081531342813, "entropy": 0.01623811650206335, "num_tokens": 9174841.0, "mean_token_accuracy": 0.9944271765649318, "epoch": 2.900225056264066, "step": 1450 }, { "loss": 0.022856634855270386, "grad_norm": 0.11377973109483719, "learning_rate": 0.00016969806857880241, "entropy": 0.023971330239146483, "num_tokens": 9239456.0, "mean_token_accuracy": 0.9932261377573013, "epoch": 2.9202300575143787, "step": 1460 }, { "loss": 0.02486345320940018, "grad_norm": 0.12835904955863953, "learning_rate": 0.00016922227302486667, "entropy": 0.02552748184389202, "num_tokens": 9305144.0, "mean_token_accuracy": 0.9918816141784191, "epoch": 2.9402350587646913, "step": 1470 }, { "loss": 0.018220885097980498, "grad_norm": 0.18033206462860107, "learning_rate": 0.00016874344946445974, "entropy": 0.019867337332107125, "num_tokens": 9365854.0, "mean_token_accuracy": 0.9945706635713577, "epoch": 2.960240060015004, "step": 1480 }, { "loss": 0.01618766337633133, "grad_norm": 0.2495020180940628, "learning_rate": 0.00016826161884287533, "entropy": 0.01948691344150575, "num_tokens": 9427287.0, "mean_token_accuracy": 0.9956672258675099, "epoch": 2.9802450612653164, "step": 1490 }, { "loss": 0.024902991950511932, "grad_norm": 0.2727943956851959, "learning_rate": 0.00016777680223694575, "entropy": 0.022937397798228586, "num_tokens": 9488514.0, "mean_token_accuracy": 0.9909723401069641, "epoch": 3.0, "step": 1500 }, { "eval_loss": 0.03645886108279228, "eval_runtime": 69.2921, "eval_samples_per_second": 14.937, "eval_steps_per_second": 7.476, "eval_entropy": 0.02839457441272365, "eval_num_tokens": 9488514.0, "eval_mean_token_accuracy": 0.9902446437986661, "epoch": 3.0, "step": 1500 }, { "loss": 0.014892478287220002, "grad_norm": 0.26308536529541016, "learning_rate": 0.00016728902085411996, "entropy": 0.02168392370658694, "num_tokens": 9553582.0, "mean_token_accuracy": 0.9945793129503727, "epoch": 3.0200050012503126, "step": 1510 }, { "loss": 0.009397410601377488, "grad_norm": 0.20036503672599792, "learning_rate": 0.0001667982960315358, "entropy": 0.012075830744288396, "num_tokens": 9617281.0, "mean_token_accuracy": 0.9964840039610863, "epoch": 3.040010002500625, "step": 1520 }, { "loss": 0.015942367911338805, "grad_norm": 0.3861319124698639, "learning_rate": 0.00016630464923508677, "entropy": 0.014315767139487434, "num_tokens": 9681345.0, "mean_token_accuracy": 0.9952807635068893, "epoch": 3.0600150037509377, "step": 1530 }, { "loss": 0.01565181165933609, "grad_norm": 0.23598027229309082, "learning_rate": 0.00016580810205848288, "entropy": 0.01963768747918948, "num_tokens": 9743616.0, "mean_token_accuracy": 0.9945429727435112, "epoch": 3.0800200050012503, "step": 1540 }, { "loss": 0.01511429101228714, "grad_norm": 0.3226635754108429, "learning_rate": 0.0001653086762223063, "entropy": 0.01306593646404508, "num_tokens": 9808581.0, "mean_token_accuracy": 0.995248269289732, "epoch": 3.100025006251563, "step": 1550 }, { "loss": 0.009530831128358841, "grad_norm": 0.09154416620731354, "learning_rate": 0.00016480639357306098, "entropy": 0.013261715146654751, "num_tokens": 9873666.0, "mean_token_accuracy": 0.9966560050845146, "epoch": 3.1200300075018754, "step": 1560 }, { "loss": 0.009393466264009475, "grad_norm": 0.21701541543006897, "learning_rate": 0.00016430127608221714, "entropy": 0.011822419746022206, "num_tokens": 9937438.0, "mean_token_accuracy": 0.9964691713452339, "epoch": 3.140035008752188, "step": 1570 }, { "loss": 0.011047683656215668, "grad_norm": 0.2678857743740082, "learning_rate": 0.00016379334584525025, "entropy": 0.012122366849507672, "num_tokens": 9999440.0, "mean_token_accuracy": 0.9967051848769188, "epoch": 3.1600400100025006, "step": 1580 }, { "loss": 0.013723762333393097, "grad_norm": 0.324455201625824, "learning_rate": 0.00016328262508067431, "entropy": 0.012699224287644029, "num_tokens": 10061600.0, "mean_token_accuracy": 0.9955959998071193, "epoch": 3.180045011252813, "step": 1590 }, { "loss": 0.014421728253364564, "grad_norm": 0.18887697160243988, "learning_rate": 0.00016276913612907007, "entropy": 0.020439925385289825, "num_tokens": 10126520.0, "mean_token_accuracy": 0.9959282651543617, "epoch": 3.2000500125031257, "step": 1600 }, { "loss": 0.01239979937672615, "grad_norm": 0.1129460483789444, "learning_rate": 0.00016225290145210772, "entropy": 0.012199809608864598, "num_tokens": 10191553.0, "mean_token_accuracy": 0.995978644490242, "epoch": 3.2200550137534383, "step": 1610 }, { "loss": 0.014834728837013245, "grad_norm": 0.20427951216697693, "learning_rate": 0.00016173394363156444, "entropy": 0.016009513070457615, "num_tokens": 10258289.0, "mean_token_accuracy": 0.9960135422647, "epoch": 3.240060015003751, "step": 1620 }, { "loss": 0.014402203261852264, "grad_norm": 0.25807589292526245, "learning_rate": 0.00016121228536833645, "entropy": 0.015858568061958067, "num_tokens": 10324281.0, "mean_token_accuracy": 0.9963105775415897, "epoch": 3.2600650162540634, "step": 1630 }, { "loss": 0.014248587191104889, "grad_norm": 0.13609230518341064, "learning_rate": 0.00016068794948144617, "entropy": 0.015872705554647835, "num_tokens": 10385122.0, "mean_token_accuracy": 0.9952699325978756, "epoch": 3.280070017504376, "step": 1640 }, { "loss": 0.013415993750095367, "grad_norm": 0.21917292475700378, "learning_rate": 0.00016016095890704387, "entropy": 0.010807368888345081, "num_tokens": 10447821.0, "mean_token_accuracy": 0.9959428884088993, "epoch": 3.3000750187546886, "step": 1650 }, { "loss": 0.008242987841367722, "grad_norm": 0.2698808014392853, "learning_rate": 0.0001596313366974045, "entropy": 0.012187929065839853, "num_tokens": 10507896.0, "mean_token_accuracy": 0.9972235180437565, "epoch": 3.320080020005001, "step": 1660 }, { "loss": 0.013128173351287842, "grad_norm": 0.20612332224845886, "learning_rate": 0.00015909910601991922, "entropy": 0.013906099726591492, "num_tokens": 10569117.0, "mean_token_accuracy": 0.9961497314274311, "epoch": 3.3400850212553137, "step": 1670 }, { "loss": 0.01361977458000183, "grad_norm": 0.13489088416099548, "learning_rate": 0.00015856429015608209, "entropy": 0.013951514207292348, "num_tokens": 10630981.0, "mean_token_accuracy": 0.9956404089927673, "epoch": 3.3600900225056263, "step": 1680 }, { "loss": 0.014680840075016022, "grad_norm": 0.2713385820388794, "learning_rate": 0.00015802691250047153, "entropy": 0.013167628296650946, "num_tokens": 10693173.0, "mean_token_accuracy": 0.9950266376137733, "epoch": 3.380095023755939, "step": 1690 }, { "loss": 0.013400137424468994, "grad_norm": 0.1426415741443634, "learning_rate": 0.00015748699655972708, "entropy": 0.017778589528461453, "num_tokens": 10753429.0, "mean_token_accuracy": 0.9946111224591732, "epoch": 3.4001000250062514, "step": 1700 }, { "loss": 0.008509327471256257, "grad_norm": 0.16599993407726288, "learning_rate": 0.00015694456595152106, "entropy": 0.013743974023964257, "num_tokens": 10819863.0, "mean_token_accuracy": 0.9970920436084271, "epoch": 3.420105026256564, "step": 1710 }, { "loss": 0.01316998302936554, "grad_norm": 0.20159605145454407, "learning_rate": 0.0001563996444035255, "entropy": 0.01153940933654667, "num_tokens": 10882060.0, "mean_token_accuracy": 0.9955882236361504, "epoch": 3.4401100275068766, "step": 1720 }, { "loss": 0.011991073936223983, "grad_norm": 0.23580631613731384, "learning_rate": 0.00015585225575237427, "entropy": 0.012680305907269939, "num_tokens": 10945979.0, "mean_token_accuracy": 0.9958546876907348, "epoch": 3.460115028757189, "step": 1730 }, { "loss": 0.012041158974170685, "grad_norm": 0.33789604902267456, "learning_rate": 0.00015530242394262017, "entropy": 0.013596625554055209, "num_tokens": 11008355.0, "mean_token_accuracy": 0.9955416478216648, "epoch": 3.4801200300075017, "step": 1740 }, { "loss": 0.01627572178840637, "grad_norm": 0.2994728982448578, "learning_rate": 0.00015475017302568782, "entropy": 0.019999047268356662, "num_tokens": 11071934.0, "mean_token_accuracy": 0.9931987822055817, "epoch": 3.5001250312578147, "step": 1750 }, { "loss": 0.011943073570728302, "grad_norm": 0.09841946512460709, "learning_rate": 0.00015419552715882138, "entropy": 0.01364866496878676, "num_tokens": 11132456.0, "mean_token_accuracy": 0.9967477336525917, "epoch": 3.520130032508127, "step": 1760 }, { "loss": 0.0153175488114357, "grad_norm": 0.22312118113040924, "learning_rate": 0.00015363851060402783, "entropy": 0.016219895507674664, "num_tokens": 11194782.0, "mean_token_accuracy": 0.9945069424808025, "epoch": 3.54013503375844, "step": 1770 }, { "loss": 0.00787808895111084, "grad_norm": 0.16057588160037994, "learning_rate": 0.0001530791477270158, "entropy": 0.012033771253481974, "num_tokens": 11259307.0, "mean_token_accuracy": 0.9970344088971614, "epoch": 3.560140035008752, "step": 1780 }, { "loss": 0.013948053121566772, "grad_norm": 0.2074371874332428, "learning_rate": 0.0001525174629961296, "entropy": 0.01175229620130267, "num_tokens": 11321733.0, "mean_token_accuracy": 0.9959047585725784, "epoch": 3.580145036259065, "step": 1790 }, { "loss": 0.012327873706817627, "grad_norm": 0.15074662864208221, "learning_rate": 0.00015195348098127895, "entropy": 0.014628350256680278, "num_tokens": 11384586.0, "mean_token_accuracy": 0.9950341537594796, "epoch": 3.600150037509377, "step": 1800 }, { "loss": 0.012766703963279724, "grad_norm": 0.2124103605747223, "learning_rate": 0.00015138722635286422, "entropy": 0.018070634140167387, "num_tokens": 11448156.0, "mean_token_accuracy": 0.9958022043108941, "epoch": 3.62015503875969, "step": 1810 }, { "loss": 0.011698020249605178, "grad_norm": 0.4769149124622345, "learning_rate": 0.0001508187238806973, "entropy": 0.01308420468485565, "num_tokens": 11511882.0, "mean_token_accuracy": 0.9961448684334755, "epoch": 3.6401600400100023, "step": 1820 }, { "loss": 0.014116832613945007, "grad_norm": 0.25340843200683594, "learning_rate": 0.00015024799843291802, "entropy": 0.012517862502500065, "num_tokens": 11575526.0, "mean_token_accuracy": 0.9950296327471733, "epoch": 3.6601650412603153, "step": 1830 }, { "loss": 0.014804676175117493, "grad_norm": 0.21997588872909546, "learning_rate": 0.00014967507497490635, "entropy": 0.016702812965377234, "num_tokens": 11637521.0, "mean_token_accuracy": 0.9941891603171825, "epoch": 3.6801700425106274, "step": 1840 }, { "loss": 0.008088278025388718, "grad_norm": 0.1356344372034073, "learning_rate": 0.00014909997856819032, "entropy": 0.01380894306494156, "num_tokens": 11700080.0, "mean_token_accuracy": 0.9972025558352471, "epoch": 3.7001750437609404, "step": 1850 }, { "loss": 0.014773441851139069, "grad_norm": 0.2926776707172394, "learning_rate": 0.00014852273436934986, "entropy": 0.013712721945921658, "num_tokens": 11761687.0, "mean_token_accuracy": 0.9959305942058563, "epoch": 3.7201800450112525, "step": 1860 }, { "loss": 0.011582046002149581, "grad_norm": 0.13980428874492645, "learning_rate": 0.00014794336762891623, "entropy": 0.014661396172596142, "num_tokens": 11823454.0, "mean_token_accuracy": 0.9961862593889237, "epoch": 3.7401850462615656, "step": 1870 }, { "loss": 0.012114252895116806, "grad_norm": 0.2284947633743286, "learning_rate": 0.00014736190369026754, "entropy": 0.01451311390119372, "num_tokens": 11884267.0, "mean_token_accuracy": 0.9961981892585754, "epoch": 3.760190047511878, "step": 1880 }, { "loss": 0.007772183418273926, "grad_norm": 0.255247563123703, "learning_rate": 0.0001467783679885201, "entropy": 0.010285129089606927, "num_tokens": 11948880.0, "mean_token_accuracy": 0.9978563249111175, "epoch": 3.7801950487621907, "step": 1890 }, { "loss": 0.013219112157821655, "grad_norm": 0.21494613587856293, "learning_rate": 0.00014619278604941603, "entropy": 0.01082497325114673, "num_tokens": 12012547.0, "mean_token_accuracy": 0.9958216808736324, "epoch": 3.8002000500125033, "step": 1900 }, { "loss": 0.012468833476305008, "grad_norm": 0.28526443243026733, "learning_rate": 0.00014560518348820625, "entropy": 0.013233061737264507, "num_tokens": 12078372.0, "mean_token_accuracy": 0.9958592697978019, "epoch": 3.820205051262816, "step": 1910 }, { "loss": 0.018085935711860658, "grad_norm": 0.1471295952796936, "learning_rate": 0.00014501558600853035, "entropy": 0.015974047601775964, "num_tokens": 12142500.0, "mean_token_accuracy": 0.9947570398449898, "epoch": 3.8402100525131284, "step": 1920 }, { "loss": 0.013111139833927154, "grad_norm": 0.2544702887535095, "learning_rate": 0.0001444240194012922, "entropy": 0.01969735559250694, "num_tokens": 12206205.0, "mean_token_accuracy": 0.9956923462450504, "epoch": 3.860215053763441, "step": 1930 }, { "loss": 0.013215355575084686, "grad_norm": 0.14971140027046204, "learning_rate": 0.00014383050954353154, "entropy": 0.01610187725018477, "num_tokens": 12269828.0, "mean_token_accuracy": 0.9956071071326733, "epoch": 3.8802200550137536, "step": 1940 }, { "loss": 0.00939919427037239, "grad_norm": 0.08307329565286636, "learning_rate": 0.00014323508239729232, "entropy": 0.01351477519783657, "num_tokens": 12331919.0, "mean_token_accuracy": 0.99660724401474, "epoch": 3.900225056264066, "step": 1950 }, { "loss": 0.011213938146829605, "grad_norm": 0.12744051218032837, "learning_rate": 0.00014263776400848678, "entropy": 0.011691810854972572, "num_tokens": 12394410.0, "mean_token_accuracy": 0.9957682631909848, "epoch": 3.9202300575143787, "step": 1960 }, { "loss": 0.014179202914237975, "grad_norm": 0.30811241269111633, "learning_rate": 0.00014203858050575632, "entropy": 0.013546516641508789, "num_tokens": 12458473.0, "mean_token_accuracy": 0.9955927409231663, "epoch": 3.9402350587646913, "step": 1970 }, { "loss": 0.014471597969532013, "grad_norm": 0.1450197547674179, "learning_rate": 0.00014143755809932845, "entropy": 0.016499465111701285, "num_tokens": 12523348.0, "mean_token_accuracy": 0.9954880520701408, "epoch": 3.960240060015004, "step": 1980 }, { "loss": 0.010644648969173432, "grad_norm": 0.14227765798568726, "learning_rate": 0.0001408347230798702, "entropy": 0.013392421180469682, "num_tokens": 12588443.0, "mean_token_accuracy": 0.9969804167747498, "epoch": 3.9802450612653164, "step": 1990 }, { "loss": 0.015882152318954467, "grad_norm": 0.12858586013317108, "learning_rate": 0.00014023010181733826, "entropy": 0.01455020939060369, "num_tokens": 12651352.0, "mean_token_accuracy": 0.9946769113782086, "epoch": 4.0, "step": 2000 }, { "eval_loss": 0.0426219180226326, "eval_runtime": 69.3664, "eval_samples_per_second": 14.921, "eval_steps_per_second": 7.468, "eval_entropy": 0.03254893434532418, "eval_num_tokens": 12651352.0, "eval_mean_token_accuracy": 0.9884336234059573, "epoch": 4.0, "step": 2000 }, { "loss": 0.00863734856247902, "grad_norm": 0.4523090422153473, "learning_rate": 0.00013962372075982543, "entropy": 0.01400298816661234, "num_tokens": 12710379.0, "mean_token_accuracy": 0.9968750610947609, "epoch": 4.020005001250313, "step": 2010 }, { "loss": 0.007897177338600158, "grad_norm": 0.10824855417013168, "learning_rate": 0.0001390156064324035, "entropy": 0.008752083206127281, "num_tokens": 12774117.0, "mean_token_accuracy": 0.9971247158944607, "epoch": 4.040010002500625, "step": 2020 }, { "loss": 0.008237957209348678, "grad_norm": 0.3647105097770691, "learning_rate": 0.00013840578543596315, "entropy": 0.008517850490170531, "num_tokens": 12838463.0, "mean_token_accuracy": 0.9974852904677391, "epoch": 4.060015003750938, "step": 2030 }, { "loss": 0.010357823967933655, "grad_norm": 0.1849185675382614, "learning_rate": 0.00013779428444605035, "entropy": 0.011237980193618569, "num_tokens": 12906031.0, "mean_token_accuracy": 0.9965578347444535, "epoch": 4.08002000500125, "step": 2040 }, { "loss": 0.00867396593093872, "grad_norm": 0.17338383197784424, "learning_rate": 0.0001371811302116994, "entropy": 0.00913453484463389, "num_tokens": 12968016.0, "mean_token_accuracy": 0.9973611943423748, "epoch": 4.100025006251563, "step": 2050 }, { "loss": 0.012893503904342652, "grad_norm": 0.1852918565273285, "learning_rate": 0.0001365663495542628, "entropy": 0.012978466165077408, "num_tokens": 13032518.0, "mean_token_accuracy": 0.99602395221591, "epoch": 4.120030007501875, "step": 2060 }, { "loss": 0.010699793696403503, "grad_norm": 0.2881818115711212, "learning_rate": 0.00013594996936623814, "entropy": 0.015379714348819106, "num_tokens": 13096744.0, "mean_token_accuracy": 0.9955209918320179, "epoch": 4.140035008752188, "step": 2070 }, { "loss": 0.009091087430715562, "grad_norm": 0.32742437720298767, "learning_rate": 0.0001353320166100917, "entropy": 0.009939568623667582, "num_tokens": 13162095.0, "mean_token_accuracy": 0.9969943076372146, "epoch": 4.160040010002501, "step": 2080 }, { "loss": 0.009758947789669037, "grad_norm": 0.2090802937746048, "learning_rate": 0.00013471251831707884, "entropy": 0.010461670262520784, "num_tokens": 13228156.0, "mean_token_accuracy": 0.9968024276196956, "epoch": 4.180045011252814, "step": 2090 }, { "loss": 0.008040308952331543, "grad_norm": 0.21466973423957825, "learning_rate": 0.0001340915015860618, "entropy": 0.011725931792898336, "num_tokens": 13291512.0, "mean_token_accuracy": 0.9968237906694413, "epoch": 4.200050012503126, "step": 2100 }, { "loss": 0.00803126096725464, "grad_norm": 0.24069944024085999, "learning_rate": 0.0001334689935823243, "entropy": 0.011084824410500006, "num_tokens": 13353896.0, "mean_token_accuracy": 0.997739101946354, "epoch": 4.220055013753439, "step": 2110 }, { "loss": 0.008842091262340545, "grad_norm": 0.06226912513375282, "learning_rate": 0.00013284502153638295, "entropy": 0.010992687013640534, "num_tokens": 13416743.0, "mean_token_accuracy": 0.996946869045496, "epoch": 4.240060015003751, "step": 2120 }, { "loss": 0.010905887186527252, "grad_norm": 0.11721836030483246, "learning_rate": 0.00013221961274279654, "entropy": 0.011237628920207498, "num_tokens": 13481284.0, "mean_token_accuracy": 0.9970996268093586, "epoch": 4.260065016254064, "step": 2130 }, { "loss": 0.012466417998075486, "grad_norm": 0.3521440327167511, "learning_rate": 0.00013159279455897166, "entropy": 0.010562418565677944, "num_tokens": 13543678.0, "mean_token_accuracy": 0.9958751887083054, "epoch": 4.280070017504376, "step": 2140 }, { "loss": 0.011747314780950546, "grad_norm": 0.26293885707855225, "learning_rate": 0.0001309645944039663, "entropy": 0.014598401125113014, "num_tokens": 13608112.0, "mean_token_accuracy": 0.9962641790509223, "epoch": 4.300075018754689, "step": 2150 }, { "loss": 0.007845200598239899, "grad_norm": 0.16723529994487762, "learning_rate": 0.00013033503975729035, "entropy": 0.011412217889301246, "num_tokens": 13667979.0, "mean_token_accuracy": 0.99744006767869, "epoch": 4.320080020005001, "step": 2160 }, { "loss": 0.010894352942705155, "grad_norm": 0.21131186187267303, "learning_rate": 0.0001297041581577035, "entropy": 0.010380906579666772, "num_tokens": 13730034.0, "mean_token_accuracy": 0.9965024016797542, "epoch": 4.340085021255314, "step": 2170 }, { "loss": 0.00956823006272316, "grad_norm": 0.10813307017087936, "learning_rate": 0.00012907197720201071, "entropy": 0.009887772376168868, "num_tokens": 13792366.0, "mean_token_accuracy": 0.9968511998653412, "epoch": 4.360090022505626, "step": 2180 }, { "loss": 0.009695110470056533, "grad_norm": 0.21164672076702118, "learning_rate": 0.00012843852454385497, "entropy": 0.011902359123632777, "num_tokens": 13853048.0, "mean_token_accuracy": 0.9974331922829152, "epoch": 4.380095023755939, "step": 2190 }, { "loss": 0.008793818950653075, "grad_norm": 0.4802285432815552, "learning_rate": 0.00012780382789250762, "entropy": 0.009543133205443154, "num_tokens": 13917884.0, "mean_token_accuracy": 0.997763866186142, "epoch": 4.400100025006251, "step": 2200 }, { "loss": 0.009752951562404633, "grad_norm": 0.3032193183898926, "learning_rate": 0.00012716791501165634, "entropy": 0.01140449561207788, "num_tokens": 13982842.0, "mean_token_accuracy": 0.9972191534936428, "epoch": 4.420105026256564, "step": 2210 }, { "loss": 0.005666728690266609, "grad_norm": 0.394113153219223, "learning_rate": 0.00012653081371819064, "entropy": 0.008245287769386777, "num_tokens": 14045445.0, "mean_token_accuracy": 0.998167161643505, "epoch": 4.4401100275068766, "step": 2220 }, { "loss": 0.010289490967988969, "grad_norm": 0.5735944509506226, "learning_rate": 0.00012589255188098498, "entropy": 0.008848439441499068, "num_tokens": 14105270.0, "mean_token_accuracy": 0.996202427148819, "epoch": 4.46011502875719, "step": 2230 }, { "loss": 0.006267648935317993, "grad_norm": 0.0710088387131691, "learning_rate": 0.00012525315741967978, "entropy": 0.010472280244721332, "num_tokens": 14166955.0, "mean_token_accuracy": 0.9972212843596935, "epoch": 4.480120030007502, "step": 2240 }, { "loss": 0.010307309031486512, "grad_norm": 0.23172006011009216, "learning_rate": 0.00012461265830346018, "entropy": 0.008165620337967994, "num_tokens": 14231397.0, "mean_token_accuracy": 0.996221523731947, "epoch": 4.500125031257815, "step": 2250 }, { "loss": 0.010486914217472077, "grad_norm": 0.1562025099992752, "learning_rate": 0.00012397108254983243, "entropy": 0.01140070731707965, "num_tokens": 14293502.0, "mean_token_accuracy": 0.9965781837701797, "epoch": 4.520130032508127, "step": 2260 }, { "loss": 0.008283475786447525, "grad_norm": 0.09583538770675659, "learning_rate": 0.00012332845822339846, "entropy": 0.011921767683816142, "num_tokens": 14355038.0, "mean_token_accuracy": 0.9969584576785564, "epoch": 4.54013503375844, "step": 2270 }, { "loss": 0.00834668129682541, "grad_norm": 0.18446850776672363, "learning_rate": 0.000122684813434628, "entropy": 0.010264168232242809, "num_tokens": 14420148.0, "mean_token_accuracy": 0.9971672594547272, "epoch": 4.560140035008752, "step": 2280 }, { "loss": 0.009413036704063415, "grad_norm": 0.11777894198894501, "learning_rate": 0.00012204017633862932, "entropy": 0.011230875192995881, "num_tokens": 14482015.0, "mean_token_accuracy": 0.9962861262261867, "epoch": 4.580145036259065, "step": 2290 }, { "loss": 0.0066015787422657015, "grad_norm": 0.14621251821517944, "learning_rate": 0.00012139457513391732, "entropy": 0.007982138471561484, "num_tokens": 14546515.0, "mean_token_accuracy": 0.9983268916606903, "epoch": 4.600150037509377, "step": 2300 }, { "loss": 0.010532976686954498, "grad_norm": 0.2948937714099884, "learning_rate": 0.00012074803806118016, "entropy": 0.011228621992995614, "num_tokens": 14610218.0, "mean_token_accuracy": 0.9960615806281566, "epoch": 4.62015503875969, "step": 2310 }, { "loss": 0.012350869178771973, "grad_norm": 0.25452813506126404, "learning_rate": 0.0001201005934020439, "entropy": 0.0075275591014360545, "num_tokens": 14673523.0, "mean_token_accuracy": 0.9973488107323647, "epoch": 4.640160040010002, "step": 2320 }, { "loss": 0.015287771821022034, "grad_norm": 0.24262821674346924, "learning_rate": 0.00011945226947783532, "entropy": 0.012186212290544063, "num_tokens": 14734854.0, "mean_token_accuracy": 0.995884881913662, "epoch": 4.660165041260315, "step": 2330 }, { "loss": 0.010069895535707474, "grad_norm": 0.24241459369659424, "learning_rate": 0.00011880309464834317, "entropy": 0.014627664355066372, "num_tokens": 14796717.0, "mean_token_accuracy": 0.9970944046974182, "epoch": 4.680170042510627, "step": 2340 }, { "loss": 0.007354290783405304, "grad_norm": 0.24272984266281128, "learning_rate": 0.00011815309731057752, "entropy": 0.00997849061677698, "num_tokens": 14857558.0, "mean_token_accuracy": 0.9976357862353324, "epoch": 4.70017504376094, "step": 2350 }, { "loss": 0.01080884262919426, "grad_norm": 0.16180723905563354, "learning_rate": 0.00011750230589752762, "entropy": 0.011729113181354478, "num_tokens": 14918129.0, "mean_token_accuracy": 0.9959106191992759, "epoch": 4.7201800450112525, "step": 2360 }, { "loss": 0.0070034988224506375, "grad_norm": 0.14300037920475006, "learning_rate": 0.00011685074887691815, "entropy": 0.010010966495974572, "num_tokens": 14981742.0, "mean_token_accuracy": 0.9970420770347118, "epoch": 4.740185046261566, "step": 2370 }, { "loss": 0.006338100135326386, "grad_norm": 0.31339094042778015, "learning_rate": 0.00011619845474996396, "entropy": 0.007486376102315262, "num_tokens": 15044749.0, "mean_token_accuracy": 0.998369050770998, "epoch": 4.760190047511878, "step": 2380 }, { "loss": 0.0088754341006279, "grad_norm": 0.2821660339832306, "learning_rate": 0.0001155454520501233, "entropy": 0.0094100816793798, "num_tokens": 15107356.0, "mean_token_accuracy": 0.9967978030443192, "epoch": 4.780195048762191, "step": 2390 }, { "loss": 0.0074894212186336516, "grad_norm": 0.20098550617694855, "learning_rate": 0.00011489176934184966, "entropy": 0.011058530519949272, "num_tokens": 15170161.0, "mean_token_accuracy": 0.9970949165523052, "epoch": 4.800200050012503, "step": 2400 }, { "loss": 0.006931519508361817, "grad_norm": 0.2597576379776001, "learning_rate": 0.00011423743521934239, "entropy": 0.009024496493293555, "num_tokens": 15233166.0, "mean_token_accuracy": 0.9981255434453488, "epoch": 4.820205051262816, "step": 2410 }, { "loss": 0.007713411748409271, "grad_norm": 0.07438832521438599, "learning_rate": 0.00011358247830529572, "entropy": 0.008874563317294814, "num_tokens": 15294745.0, "mean_token_accuracy": 0.997540271282196, "epoch": 4.840210052513128, "step": 2420 }, { "loss": 0.010046067833900451, "grad_norm": 0.15564411878585815, "learning_rate": 0.00011292692724964684, "entropy": 0.01154620652741869, "num_tokens": 15360934.0, "mean_token_accuracy": 0.9968956887722016, "epoch": 4.860215053763441, "step": 2430 }, { "loss": 0.007103031873703003, "grad_norm": 0.13080066442489624, "learning_rate": 0.00011227081072832264, "entropy": 0.009648629953153432, "num_tokens": 15423505.0, "mean_token_accuracy": 0.9975046671926975, "epoch": 4.880220055013753, "step": 2440 }, { "loss": 0.011635245382785797, "grad_norm": 0.1020200327038765, "learning_rate": 0.00011161415744198529, "entropy": 0.01059294661572494, "num_tokens": 15488354.0, "mean_token_accuracy": 0.996422378718853, "epoch": 4.900225056264066, "step": 2450 }, { "loss": 0.00895947739481926, "grad_norm": 0.5128690600395203, "learning_rate": 0.00011095699611477672, "entropy": 0.01126530086476123, "num_tokens": 15551047.0, "mean_token_accuracy": 0.9972493521869182, "epoch": 4.920230057514378, "step": 2460 }, { "loss": 0.007447101175785065, "grad_norm": 0.1531531810760498, "learning_rate": 0.00011029935549306236, "entropy": 0.009639624001283664, "num_tokens": 15614133.0, "mean_token_accuracy": 0.9972159087657928, "epoch": 4.940235058764691, "step": 2470 }, { "loss": 0.009513139724731445, "grad_norm": 0.109550341963768, "learning_rate": 0.00010964126434417348, "entropy": 0.011513816034130287, "num_tokens": 15681338.0, "mean_token_accuracy": 0.9967059269547462, "epoch": 4.960240060015003, "step": 2480 }, { "loss": 0.014146287739276887, "grad_norm": 0.2227025330066681, "learning_rate": 0.00010898275145514878, "entropy": 0.012698486276713083, "num_tokens": 15750237.0, "mean_token_accuracy": 0.9964324481785297, "epoch": 4.980245061265316, "step": 2490 }, { "loss": 0.011340580135583877, "grad_norm": 0.26418933272361755, "learning_rate": 0.00010832384563147539, "entropy": 0.012120508169607979, "num_tokens": 15814190.0, "mean_token_accuracy": 0.9962437522562244, "epoch": 5.0, "step": 2500 }, { "eval_loss": 0.036649439483881, "eval_runtime": 68.931, "eval_samples_per_second": 15.015, "eval_steps_per_second": 7.515, "eval_entropy": 0.01951373018991628, "eval_num_tokens": 15814190.0, "eval_mean_token_accuracy": 0.990988754052453, "epoch": 5.0, "step": 2500 }, { "loss": 0.00565112940967083, "grad_norm": 0.24155987799167633, "learning_rate": 0.00010766457569582855, "entropy": 0.008389830897795037, "num_tokens": 15876304.0, "mean_token_accuracy": 0.9987288475036621, "epoch": 5.020005001250313, "step": 2510 }, { "loss": 0.004657933115959167, "grad_norm": 0.17384299635887146, "learning_rate": 0.000107004970486811, "entropy": 0.0063808045721089005, "num_tokens": 15939328.0, "mean_token_accuracy": 0.9986095182597637, "epoch": 5.040010002500625, "step": 2520 }, { "loss": 0.009442869573831558, "grad_norm": 0.07942040264606476, "learning_rate": 0.00010634505885769134, "entropy": 0.008581503613459062, "num_tokens": 16001585.0, "mean_token_accuracy": 0.9973239652812481, "epoch": 5.060015003750938, "step": 2530 }, { "loss": 0.007105500251054764, "grad_norm": 0.1442539244890213, "learning_rate": 0.00010568486967514218, "entropy": 0.008049002460029441, "num_tokens": 16066250.0, "mean_token_accuracy": 0.9976261213421822, "epoch": 5.08002000500125, "step": 2540 }, { "loss": 0.006882892549037933, "grad_norm": 0.05469922348856926, "learning_rate": 0.00010502443181797697, "entropy": 0.008640473794366698, "num_tokens": 16131511.0, "mean_token_accuracy": 0.9982132039964199, "epoch": 5.100025006251563, "step": 2550 }, { "loss": 0.007951027154922486, "grad_norm": 0.08848944306373596, "learning_rate": 0.00010436377417588714, "entropy": 0.007696686122289975, "num_tokens": 16194361.0, "mean_token_accuracy": 0.998307142406702, "epoch": 5.120030007501875, "step": 2560 }, { "loss": 0.005469654873013497, "grad_norm": 0.1663186103105545, "learning_rate": 0.0001037029256481782, "entropy": 0.008428349181485828, "num_tokens": 16257949.0, "mean_token_accuracy": 0.9982100896537304, "epoch": 5.140035008752188, "step": 2570 }, { "loss": 0.007561860978603363, "grad_norm": 0.1089382916688919, "learning_rate": 0.00010304191514250559, "entropy": 0.00860111919027986, "num_tokens": 16319368.0, "mean_token_accuracy": 0.9977700248360634, "epoch": 5.160040010002501, "step": 2580 }, { "loss": 0.006244239956140518, "grad_norm": 0.29137757420539856, "learning_rate": 0.00010238077157361021, "entropy": 0.006166888629377354, "num_tokens": 16382222.0, "mean_token_accuracy": 0.9981474541127682, "epoch": 5.180045011252814, "step": 2590 }, { "loss": 0.004823794960975647, "grad_norm": 0.09055764973163605, "learning_rate": 0.00010171952386205354, "entropy": 0.007182681497215526, "num_tokens": 16442713.0, "mean_token_accuracy": 0.9988246329128743, "epoch": 5.200050012503126, "step": 2600 }, { "loss": 0.004676086083054543, "grad_norm": 0.041668012738227844, "learning_rate": 0.00010105820093295268, "entropy": 0.007433413605031092, "num_tokens": 16507336.0, "mean_token_accuracy": 0.9984147787094116, "epoch": 5.220055013753439, "step": 2610 }, { "loss": 0.007142329961061478, "grad_norm": 0.3844437897205353, "learning_rate": 0.00010039683171471493, "entropy": 0.006547862391016679, "num_tokens": 16573852.0, "mean_token_accuracy": 0.9983086295425891, "epoch": 5.240060015003751, "step": 2620 }, { "loss": 0.0057931594550609585, "grad_norm": 0.12350230664014816, "learning_rate": 9.973544513777245e-05, "entropy": 0.007999910078433458, "num_tokens": 16636798.0, "mean_token_accuracy": 0.998402901738882, "epoch": 5.260065016254064, "step": 2630 }, { "loss": 0.006187746301293373, "grad_norm": 0.10715912282466888, "learning_rate": 9.907407013331663e-05, "entropy": 0.007076963333383901, "num_tokens": 16702698.0, "mean_token_accuracy": 0.9976529404520988, "epoch": 5.280070017504376, "step": 2640 }, { "loss": 0.004311095550656318, "grad_norm": 0.3015357255935669, "learning_rate": 9.841273563203277e-05, "entropy": 0.005494680403353413, "num_tokens": 16765527.0, "mean_token_accuracy": 0.9985795192420482, "epoch": 5.300075018754689, "step": 2650 }, { "loss": 0.005706357955932617, "grad_norm": 0.06844376027584076, "learning_rate": 9.77514705628344e-05, "entropy": 0.008315026501077228, "num_tokens": 16828006.0, "mean_token_accuracy": 0.9986971832811833, "epoch": 5.320080020005001, "step": 2660 }, { "loss": 0.00420297309756279, "grad_norm": 0.15605595707893372, "learning_rate": 9.709030385159785e-05, "entropy": 0.007199513514206046, "num_tokens": 16891023.0, "mean_token_accuracy": 0.9988421566784382, "epoch": 5.340085021255314, "step": 2670 }, { "loss": 0.00714726448059082, "grad_norm": 0.19374419748783112, "learning_rate": 9.642926441989696e-05, "entropy": 0.005838291899635806, "num_tokens": 16956668.0, "mean_token_accuracy": 0.9979994632303715, "epoch": 5.360090022505626, "step": 2680 }, { "loss": 0.005109471827745437, "grad_norm": 0.1971459686756134, "learning_rate": 9.57683811837379e-05, "entropy": 0.009764070269011427, "num_tokens": 17020153.0, "mean_token_accuracy": 0.9985188752412796, "epoch": 5.380095023755939, "step": 2690 }, { "loss": 0.006213615462183952, "grad_norm": 0.2851213216781616, "learning_rate": 9.510768305229441e-05, "entropy": 0.008533979691856075, "num_tokens": 17084832.0, "mean_token_accuracy": 0.9977529622614384, "epoch": 5.400100025006251, "step": 2700 }, { "loss": 0.0061513490974903105, "grad_norm": 0.10104754567146301, "learning_rate": 9.444719892664311e-05, "entropy": 0.007165478614842869, "num_tokens": 17149790.0, "mean_token_accuracy": 0.9975666105747223, "epoch": 5.420105026256564, "step": 2710 }, { "loss": 0.005662607401609421, "grad_norm": 0.09378691017627716, "learning_rate": 9.378695769849931e-05, "entropy": 0.007089314765835297, "num_tokens": 17213202.0, "mean_token_accuracy": 0.9981832534074784, "epoch": 5.4401100275068766, "step": 2720 }, { "loss": 0.006653358787298202, "grad_norm": 0.12766185402870178, "learning_rate": 9.312698824895328e-05, "entropy": 0.006666196065634722, "num_tokens": 17278955.0, "mean_token_accuracy": 0.9976298168301583, "epoch": 5.46011502875719, "step": 2730 }, { "loss": 0.006521254032850266, "grad_norm": 0.02992381900548935, "learning_rate": 9.246731944720675e-05, "entropy": 0.007897612718807068, "num_tokens": 17344058.0, "mean_token_accuracy": 0.9974993944168091, "epoch": 5.480120030007502, "step": 2740 }, { "loss": 0.0059999067336320875, "grad_norm": 0.1317594200372696, "learning_rate": 9.180798014931006e-05, "entropy": 0.006773643911219551, "num_tokens": 17404192.0, "mean_token_accuracy": 0.9978866256773472, "epoch": 5.500125031257815, "step": 2750 }, { "loss": 0.00612783133983612, "grad_norm": 0.2199675589799881, "learning_rate": 9.11489991969001e-05, "entropy": 0.00654012646737101, "num_tokens": 17467965.0, "mean_token_accuracy": 0.9980414494872093, "epoch": 5.520130032508127, "step": 2760 }, { "loss": 0.007611159235239029, "grad_norm": 0.15056708455085754, "learning_rate": 9.049040541593854e-05, "entropy": 0.006149375334643992, "num_tokens": 17528827.0, "mean_token_accuracy": 0.9979180261492729, "epoch": 5.54013503375844, "step": 2770 }, { "loss": 0.007264629751443863, "grad_norm": 0.1319355070590973, "learning_rate": 8.98322276154509e-05, "entropy": 0.008627775539207506, "num_tokens": 17589448.0, "mean_token_accuracy": 0.9976452924311161, "epoch": 5.560140035008752, "step": 2780 }, { "loss": 0.003955654054880142, "grad_norm": 0.20958350598812103, "learning_rate": 8.917449458626636e-05, "entropy": 0.005277934976766119, "num_tokens": 17652540.0, "mean_token_accuracy": 0.9986450515687466, "epoch": 5.580145036259065, "step": 2790 }, { "loss": 0.004750333726406097, "grad_norm": 0.14845848083496094, "learning_rate": 8.85172350997584e-05, "entropy": 0.005947213277613628, "num_tokens": 17719311.0, "mean_token_accuracy": 0.9983809232711792, "epoch": 5.600150037509377, "step": 2800 }, { "loss": 0.006387320905923843, "grad_norm": 0.025019152089953423, "learning_rate": 8.786047790658619e-05, "entropy": 0.006668693362371414, "num_tokens": 17783740.0, "mean_token_accuracy": 0.9980740129947663, "epoch": 5.62015503875969, "step": 2810 }, { "loss": 0.003687459230422974, "grad_norm": 0.12704399228096008, "learning_rate": 8.720425173543694e-05, "entropy": 0.006505226148146903, "num_tokens": 17848561.0, "mean_token_accuracy": 0.9982961259782315, "epoch": 5.640160040010002, "step": 2820 }, { "loss": 0.004726226255297661, "grad_norm": 0.35164615511894226, "learning_rate": 8.654858529176926e-05, "entropy": 0.006050794995826436, "num_tokens": 17911026.0, "mean_token_accuracy": 0.9985501445829869, "epoch": 5.660165041260315, "step": 2830 }, { "loss": 0.007286908477544785, "grad_norm": 0.10387425869703293, "learning_rate": 8.589350725655745e-05, "entropy": 0.006026100756207598, "num_tokens": 17973473.0, "mean_token_accuracy": 0.9979210302233696, "epoch": 5.680170042510627, "step": 2840 }, { "loss": 0.0033504638820886614, "grad_norm": 0.26233962178230286, "learning_rate": 8.523904628503695e-05, "entropy": 0.005752308326191269, "num_tokens": 18037116.0, "mean_token_accuracy": 0.9988096967339516, "epoch": 5.70017504376094, "step": 2850 }, { "loss": 0.005085382983088494, "grad_norm": 0.10810191929340363, "learning_rate": 8.458523100545077e-05, "entropy": 0.006968487899939646, "num_tokens": 18102687.0, "mean_token_accuracy": 0.99852888956666, "epoch": 5.7201800450112525, "step": 2860 }, { "loss": 0.005646209418773651, "grad_norm": 0.14457252621650696, "learning_rate": 8.393209001779736e-05, "entropy": 0.007342068195430329, "num_tokens": 18165237.0, "mean_token_accuracy": 0.9982465572655201, "epoch": 5.740185046261566, "step": 2870 }, { "loss": 0.004496878013014793, "grad_norm": 0.2686709463596344, "learning_rate": 8.327965189257937e-05, "entropy": 0.006458067610947182, "num_tokens": 18224314.0, "mean_token_accuracy": 0.9987071558833123, "epoch": 5.760190047511878, "step": 2880 }, { "loss": 0.006712660938501358, "grad_norm": 0.08530271798372269, "learning_rate": 8.262794516955404e-05, "entropy": 0.005851120350780547, "num_tokens": 18289806.0, "mean_token_accuracy": 0.9982900738716125, "epoch": 5.780195048762191, "step": 2890 }, { "loss": 0.005763013660907745, "grad_norm": 0.11492389440536499, "learning_rate": 8.197699835648463e-05, "entropy": 0.006107417472230736, "num_tokens": 18353047.0, "mean_token_accuracy": 0.99817396402359, "epoch": 5.800200050012503, "step": 2900 }, { "loss": 0.0040702011436223985, "grad_norm": 0.07547246664762497, "learning_rate": 8.132683992789355e-05, "entropy": 0.0047601460755686276, "num_tokens": 18415963.0, "mean_token_accuracy": 0.9987201415002346, "epoch": 5.820205051262816, "step": 2910 }, { "loss": 0.00443207286298275, "grad_norm": 0.1101204976439476, "learning_rate": 8.067749832381666e-05, "entropy": 0.005160802143291221, "num_tokens": 18479175.0, "mean_token_accuracy": 0.998711721599102, "epoch": 5.840210052513128, "step": 2920 }, { "loss": 0.004888338595628738, "grad_norm": 0.05996391549706459, "learning_rate": 8.002900194855932e-05, "entropy": 0.006708003048152023, "num_tokens": 18541817.0, "mean_token_accuracy": 0.9980212546885013, "epoch": 5.860215053763441, "step": 2930 }, { "loss": 0.005104029551148415, "grad_norm": 0.03507474064826965, "learning_rate": 7.938137916945379e-05, "entropy": 0.006489402653096476, "num_tokens": 18604352.0, "mean_token_accuracy": 0.9984742797911167, "epoch": 5.880220055013753, "step": 2940 }, { "loss": 0.0060115944594144825, "grad_norm": 0.09188883751630783, "learning_rate": 7.873465831561846e-05, "entropy": 0.008611295364971738, "num_tokens": 18667858.0, "mean_token_accuracy": 0.9980850018560886, "epoch": 5.900225056264066, "step": 2950 }, { "loss": 0.004057048261165619, "grad_norm": 0.1732291430234909, "learning_rate": 7.808886767671858e-05, "entropy": 0.004953707786262385, "num_tokens": 18732898.0, "mean_token_accuracy": 0.9984007500112057, "epoch": 5.920230057514378, "step": 2960 }, { "loss": 0.006230469048023224, "grad_norm": 0.1265515387058258, "learning_rate": 7.744403550172874e-05, "entropy": 0.005422774016551557, "num_tokens": 18795336.0, "mean_token_accuracy": 0.9979394488036633, "epoch": 5.940235058764691, "step": 2970 }, { "loss": 0.004861463233828545, "grad_norm": 0.005209980066865683, "learning_rate": 7.680018999769723e-05, "entropy": 0.00592723750633013, "num_tokens": 18856243.0, "mean_token_accuracy": 0.9985147505998612, "epoch": 5.960240060015003, "step": 2980 }, { "loss": 0.007229304313659668, "grad_norm": 0.30895116925239563, "learning_rate": 7.615735932851223e-05, "entropy": 0.006106495862695738, "num_tokens": 18915043.0, "mean_token_accuracy": 0.9970440402626991, "epoch": 5.980245061265316, "step": 2990 }, { "loss": 0.004291977360844612, "grad_norm": 0.042590148746967316, "learning_rate": 7.551557161366962e-05, "entropy": 0.0063692813067213645, "num_tokens": 18977028.0, "mean_token_accuracy": 0.9986839317068269, "epoch": 6.0, "step": 3000 }, { "eval_loss": 0.03871263563632965, "eval_runtime": 68.9977, "eval_samples_per_second": 15.0, "eval_steps_per_second": 7.507, "eval_entropy": 0.014805409190175079, "eval_num_tokens": 18977028.0, "eval_mean_token_accuracy": 0.9913663707644783, "epoch": 6.0, "step": 3000 }, { "train_runtime": 10605.5798, "train_samples_per_second": 7.541, "train_steps_per_second": 0.471, "total_flos": 4.254846998151168e+16, "train_loss": 0.04043002005169789, "epoch": 6.0, "step": 3000 }, { "eval_loss": 0.03645886108279228, "eval_runtime": 69.2159, "eval_samples_per_second": 14.953, "eval_steps_per_second": 7.484, "eval_entropy": 0.02839457441272365, "eval_num_tokens": 18977028.0, "eval_mean_token_accuracy": 0.9902446437986661, "epoch": 6.0, "step": 3000 } ] }