codegen-350M-sql2nosql-lora / run_metadata.json
bhavanikambhampati's picture
Publish sql2nosql adapter (v3)
b31ec90 verified
Raw
History Blame Contribute Delete
95.1 kB
{
"task": "sql2nosql",
"model_name": "Salesforce/codegen-350M-multi",
"device": "cuda:0",
"checkpoint_run": "v4",
"adapter_path": "/kaggle/working/models/checkpoints/v4/sql2nosql",
"train_rows": 7998,
"eval_rows": 1035,
"train_loss": 0.04043002005169789,
"eval_loss": 0.03645886108279228,
"best_eval_loss": 0.03645886108279228,
"train_runtime_seconds": 10605.5798,
"mlflow_run_id": null,
"filter_stats": {
"input_rows": 8040,
"kept_rows": 8040,
"skipped_rows": 42,
"skip_reasons": {
"sequence_too_long": 42
}
},
"token_stats": {
"rows": 7998,
"avg_prompt_tokens": 319.43,
"avg_target_tokens": 75.03,
"avg_total_tokens": 394.45,
"max_total_tokens": 1328,
"skipped_too_long_target": 42,
"skipped_too_long_prompt": 0
},
"log_history": [
{
"loss": 1.3475940704345704,
"grad_norm": 1.7302765846252441,
"learning_rate": 7.2e-06,
"entropy": 1.1209821447730064,
"num_tokens": 65756.0,
"mean_token_accuracy": 0.6775479473173618,
"epoch": 0.020005001250312578,
"step": 10
},
{
"loss": 1.1782958984375,
"grad_norm": 1.598680853843689,
"learning_rate": 1.52e-05,
"entropy": 1.0718491852283478,
"num_tokens": 127350.0,
"mean_token_accuracy": 0.6978455670177937,
"epoch": 0.040010002500625155,
"step": 20
},
{
"loss": 0.9067621231079102,
"grad_norm": 1.7650020122528076,
"learning_rate": 2.32e-05,
"entropy": 0.9551009342074395,
"num_tokens": 191970.0,
"mean_token_accuracy": 0.7337856531143189,
"epoch": 0.06001500375093773,
"step": 30
},
{
"loss": 0.6462621212005615,
"grad_norm": 1.2754874229431152,
"learning_rate": 3.12e-05,
"entropy": 0.7395371329039335,
"num_tokens": 257775.0,
"mean_token_accuracy": 0.815752174705267,
"epoch": 0.08002000500125031,
"step": 40
},
{
"loss": 0.4761983871459961,
"grad_norm": 1.6131094694137573,
"learning_rate": 3.9200000000000004e-05,
"entropy": 0.5132245156913996,
"num_tokens": 319507.0,
"mean_token_accuracy": 0.8625759541988373,
"epoch": 0.1000250062515629,
"step": 50
},
{
"loss": 0.34327900409698486,
"grad_norm": 1.9517418146133423,
"learning_rate": 4.72e-05,
"entropy": 0.35333055444061756,
"num_tokens": 380952.0,
"mean_token_accuracy": 0.9010166764259339,
"epoch": 0.12003000750187547,
"step": 60
},
{
"loss": 0.25612337589263917,
"grad_norm": 1.8101425170898438,
"learning_rate": 5.520000000000001e-05,
"entropy": 0.2581108913756907,
"num_tokens": 443849.0,
"mean_token_accuracy": 0.9237508125603199,
"epoch": 0.14003500875218805,
"step": 70
},
{
"loss": 0.20029537677764891,
"grad_norm": 1.4003955125808716,
"learning_rate": 6.32e-05,
"entropy": 0.23392133321613073,
"num_tokens": 505868.0,
"mean_token_accuracy": 0.940458069741726,
"epoch": 0.16004001000250062,
"step": 80
},
{
"loss": 0.1597532272338867,
"grad_norm": 1.2149077653884888,
"learning_rate": 7.12e-05,
"entropy": 0.1773814239539206,
"num_tokens": 570792.0,
"mean_token_accuracy": 0.9488845877349377,
"epoch": 0.1800450112528132,
"step": 90
},
{
"loss": 0.15449292659759523,
"grad_norm": 1.4650107622146606,
"learning_rate": 7.920000000000001e-05,
"entropy": 0.16433264631778002,
"num_tokens": 634476.0,
"mean_token_accuracy": 0.9529499627649785,
"epoch": 0.2000500125031258,
"step": 100
},
{
"loss": 0.14979339838027955,
"grad_norm": 1.2412768602371216,
"learning_rate": 8.72e-05,
"entropy": 0.1567419718950987,
"num_tokens": 697928.0,
"mean_token_accuracy": 0.9547351159155368,
"epoch": 0.22005501375343836,
"step": 110
},
{
"loss": 0.15537588596343993,
"grad_norm": 1.0941258668899536,
"learning_rate": 9.52e-05,
"entropy": 0.14790078573860227,
"num_tokens": 761970.0,
"mean_token_accuracy": 0.9548502139747143,
"epoch": 0.24006001500375093,
"step": 120
},
{
"loss": 0.12376174926757813,
"grad_norm": 1.3730136156082153,
"learning_rate": 0.0001032,
"entropy": 0.14068418610841035,
"num_tokens": 827125.0,
"mean_token_accuracy": 0.9643007285892964,
"epoch": 0.26006501625406353,
"step": 130
},
{
"loss": 0.10419689416885376,
"grad_norm": 0.859259843826294,
"learning_rate": 0.00011120000000000002,
"entropy": 0.10366909941658378,
"num_tokens": 890387.0,
"mean_token_accuracy": 0.9708971530199051,
"epoch": 0.2800700175043761,
"step": 140
},
{
"loss": 0.09227448105812072,
"grad_norm": 0.9888283610343933,
"learning_rate": 0.0001192,
"entropy": 0.10762261427007616,
"num_tokens": 956032.0,
"mean_token_accuracy": 0.9713370814919472,
"epoch": 0.30007501875468867,
"step": 150
},
{
"loss": 0.1083062767982483,
"grad_norm": 0.9545535445213318,
"learning_rate": 0.0001272,
"entropy": 0.1130900933407247,
"num_tokens": 1020072.0,
"mean_token_accuracy": 0.9707557298243046,
"epoch": 0.32008002000500124,
"step": 160
},
{
"loss": 0.07606152892112732,
"grad_norm": 0.9866153597831726,
"learning_rate": 0.0001352,
"entropy": 0.0895556318340823,
"num_tokens": 1083781.0,
"mean_token_accuracy": 0.973467419296503,
"epoch": 0.3400850212553138,
"step": 170
},
{
"loss": 0.10022411346435547,
"grad_norm": 1.0180600881576538,
"learning_rate": 0.0001432,
"entropy": 0.09170240506064146,
"num_tokens": 1145466.0,
"mean_token_accuracy": 0.9705780848860741,
"epoch": 0.3600900225056264,
"step": 180
},
{
"loss": 0.10711104869842529,
"grad_norm": 1.129612684249878,
"learning_rate": 0.00015120000000000002,
"entropy": 0.11426927694119512,
"num_tokens": 1208095.0,
"mean_token_accuracy": 0.9698869682848453,
"epoch": 0.380095023755939,
"step": 190
},
{
"loss": 0.08630093932151794,
"grad_norm": 0.6177782416343689,
"learning_rate": 0.00015920000000000002,
"entropy": 0.09287996906787158,
"num_tokens": 1273403.0,
"mean_token_accuracy": 0.977255067974329,
"epoch": 0.4001000250062516,
"step": 200
},
{
"loss": 0.07393635511398315,
"grad_norm": 0.766137957572937,
"learning_rate": 0.0001672,
"entropy": 0.0744264661334455,
"num_tokens": 1334848.0,
"mean_token_accuracy": 0.9792576834559441,
"epoch": 0.42010502625656415,
"step": 210
},
{
"loss": 0.09994233846664428,
"grad_norm": 0.6585826277732849,
"learning_rate": 0.0001752,
"entropy": 0.10690853425767273,
"num_tokens": 1400976.0,
"mean_token_accuracy": 0.972873219102621,
"epoch": 0.4401100275068767,
"step": 220
},
{
"loss": 0.06631548404693603,
"grad_norm": 0.7318869233131409,
"learning_rate": 0.0001832,
"entropy": 0.06925062141381204,
"num_tokens": 1462530.0,
"mean_token_accuracy": 0.9832681395113468,
"epoch": 0.4601150287571893,
"step": 230
},
{
"loss": 0.09161096215248107,
"grad_norm": 0.46499672532081604,
"learning_rate": 0.0001912,
"entropy": 0.08352572850417346,
"num_tokens": 1523663.0,
"mean_token_accuracy": 0.9757984310388566,
"epoch": 0.48012003000750186,
"step": 240
},
{
"loss": 0.05958831310272217,
"grad_norm": 0.6253766417503357,
"learning_rate": 0.00019920000000000002,
"entropy": 0.06921031260862946,
"num_tokens": 1588657.0,
"mean_token_accuracy": 0.982395163923502,
"epoch": 0.5001250312578145,
"step": 250
},
{
"loss": 0.06900651454925537,
"grad_norm": 0.6349820494651794,
"learning_rate": 0.00019999822839757118,
"entropy": 0.06543620774755254,
"num_tokens": 1653260.0,
"mean_token_accuracy": 0.9801992796361446,
"epoch": 0.5201300325081271,
"step": 260
},
{
"loss": 0.06709518432617187,
"grad_norm": 0.6046717166900635,
"learning_rate": 0.00019999210442038162,
"entropy": 0.06953847317490727,
"num_tokens": 1718687.0,
"mean_token_accuracy": 0.9797540627419948,
"epoch": 0.5401350337584396,
"step": 270
},
{
"loss": 0.09603813290596008,
"grad_norm": 0.7929577231407166,
"learning_rate": 0.00019998160646461522,
"entropy": 0.08993639135733247,
"num_tokens": 1779338.0,
"mean_token_accuracy": 0.9745012931525707,
"epoch": 0.5601400350087522,
"step": 280
},
{
"loss": 0.06412749290466309,
"grad_norm": 0.3916383683681488,
"learning_rate": 0.00019996673498948658,
"entropy": 0.06307904429268092,
"num_tokens": 1842872.0,
"mean_token_accuracy": 0.9828441753983498,
"epoch": 0.5801450362590648,
"step": 290
},
{
"loss": 0.051730161905288695,
"grad_norm": 0.38883084058761597,
"learning_rate": 0.00019994749064552214,
"entropy": 0.05729433842934668,
"num_tokens": 1904154.0,
"mean_token_accuracy": 0.9857619300484657,
"epoch": 0.6001500375093773,
"step": 300
},
{
"loss": 0.042625024914741516,
"grad_norm": 0.6382091045379639,
"learning_rate": 0.0001999238742745319,
"entropy": 0.03964498438872397,
"num_tokens": 1966060.0,
"mean_token_accuracy": 0.9874393172562123,
"epoch": 0.6201550387596899,
"step": 310
},
{
"loss": 0.06732727885246277,
"grad_norm": 0.6905948519706726,
"learning_rate": 0.00019989588690957249,
"entropy": 0.05733265266753733,
"num_tokens": 2031939.0,
"mean_token_accuracy": 0.982555440813303,
"epoch": 0.6401600400100025,
"step": 320
},
{
"loss": 0.058036553859710696,
"grad_norm": 0.4337286949157715,
"learning_rate": 0.0001998635297749018,
"entropy": 0.07143733124248683,
"num_tokens": 2095271.0,
"mean_token_accuracy": 0.9844090364873409,
"epoch": 0.660165041260315,
"step": 330
},
{
"loss": 0.053340816497802736,
"grad_norm": 0.3526521921157837,
"learning_rate": 0.00019982680428592584,
"entropy": 0.04944599290611222,
"num_tokens": 2158321.0,
"mean_token_accuracy": 0.9839612312614918,
"epoch": 0.6801700425106276,
"step": 340
},
{
"loss": 0.051858377456665036,
"grad_norm": 0.5422689318656921,
"learning_rate": 0.00019978571204913638,
"entropy": 0.06322509178426117,
"num_tokens": 2225062.0,
"mean_token_accuracy": 0.9867838315665722,
"epoch": 0.7001750437609402,
"step": 350
},
{
"loss": 0.05608519911766052,
"grad_norm": 0.7101793885231018,
"learning_rate": 0.000199740254862041,
"entropy": 0.046866965352091935,
"num_tokens": 2291157.0,
"mean_token_accuracy": 0.9851541951298713,
"epoch": 0.7201800450112528,
"step": 360
},
{
"loss": 0.056741136312484744,
"grad_norm": 0.6186705827713013,
"learning_rate": 0.00019969043471308436,
"entropy": 0.06618997184559702,
"num_tokens": 2353621.0,
"mean_token_accuracy": 0.9844918318092823,
"epoch": 0.7401850462615653,
"step": 370
},
{
"loss": 0.05278732180595398,
"grad_norm": 0.9665183424949646,
"learning_rate": 0.00019963625378156114,
"entropy": 0.052203354140510784,
"num_tokens": 2415518.0,
"mean_token_accuracy": 0.9863728702068328,
"epoch": 0.760190047511878,
"step": 380
},
{
"loss": 0.044900187849998476,
"grad_norm": 0.45738333463668823,
"learning_rate": 0.00019957771443752083,
"entropy": 0.04799637275282294,
"num_tokens": 2477716.0,
"mean_token_accuracy": 0.9872696734964848,
"epoch": 0.7801950487621906,
"step": 390
},
{
"loss": 0.043438228964805606,
"grad_norm": 0.4040285646915436,
"learning_rate": 0.00019951481924166396,
"entropy": 0.045062902639620005,
"num_tokens": 2540807.0,
"mean_token_accuracy": 0.9878960207104683,
"epoch": 0.8002000500125032,
"step": 400
},
{
"loss": 0.04615793526172638,
"grad_norm": 0.4411618411540985,
"learning_rate": 0.0001994475709452301,
"entropy": 0.036265855759847906,
"num_tokens": 2603019.0,
"mean_token_accuracy": 0.9870041370391845,
"epoch": 0.8202050512628157,
"step": 410
},
{
"loss": 0.045778676867485046,
"grad_norm": 0.31862467527389526,
"learning_rate": 0.0001993759724898777,
"entropy": 0.05851077587576583,
"num_tokens": 2667216.0,
"mean_token_accuracy": 0.9873291261494159,
"epoch": 0.8402100525131283,
"step": 420
},
{
"loss": 0.03828286230564117,
"grad_norm": 0.29344919323921204,
"learning_rate": 0.00019930002700755507,
"entropy": 0.03860169492545538,
"num_tokens": 2729805.0,
"mean_token_accuracy": 0.988411296159029,
"epoch": 0.8602150537634409,
"step": 430
},
{
"loss": 0.038545310497283936,
"grad_norm": 0.4283672571182251,
"learning_rate": 0.00019921973782036366,
"entropy": 0.03951184251927771,
"num_tokens": 2793292.0,
"mean_token_accuracy": 0.9878928653895855,
"epoch": 0.8802200550137534,
"step": 440
},
{
"loss": 0.03233465254306793,
"grad_norm": 0.7173567414283752,
"learning_rate": 0.0001991351084404126,
"entropy": 0.028071055363398045,
"num_tokens": 2855909.0,
"mean_token_accuracy": 0.9912850938737392,
"epoch": 0.900225056264066,
"step": 450
},
{
"loss": 0.040875044465065,
"grad_norm": 0.3380762040615082,
"learning_rate": 0.00019904614256966512,
"entropy": 0.04781279567687306,
"num_tokens": 2916597.0,
"mean_token_accuracy": 0.9889427930116653,
"epoch": 0.9202300575143786,
"step": 460
},
{
"loss": 0.04227911233901978,
"grad_norm": 0.21747978031635284,
"learning_rate": 0.0001989528440997767,
"entropy": 0.045654052757890896,
"num_tokens": 2977012.0,
"mean_token_accuracy": 0.987830163538456,
"epoch": 0.9402350587646912,
"step": 470
},
{
"loss": 0.03866271674633026,
"grad_norm": 0.3250534236431122,
"learning_rate": 0.00019885521711192453,
"entropy": 0.039897680119611326,
"num_tokens": 3039866.0,
"mean_token_accuracy": 0.9888145305216313,
"epoch": 0.9602400600150037,
"step": 480
},
{
"loss": 0.030780380964279173,
"grad_norm": 0.5867555141448975,
"learning_rate": 0.00019875326587662941,
"entropy": 0.0344677664746996,
"num_tokens": 3102450.0,
"mean_token_accuracy": 0.9910528786480427,
"epoch": 0.9802450612653163,
"step": 490
},
{
"loss": 0.04189955592155457,
"grad_norm": 0.19166764616966248,
"learning_rate": 0.00019864699485356866,
"entropy": 0.03601513006665473,
"num_tokens": 3162838.0,
"mean_token_accuracy": 0.989976388744161,
"epoch": 1.0,
"step": 500
},
{
"eval_loss": 0.04872545599937439,
"eval_runtime": 69.4136,
"eval_samples_per_second": 14.911,
"eval_steps_per_second": 7.463,
"eval_entropy": 0.051686967685315256,
"eval_num_tokens": 3162838.0,
"eval_mean_token_accuracy": 0.9849747346865164,
"epoch": 1.0,
"step": 500
},
{
"loss": 0.03468368649482727,
"grad_norm": 0.2645007371902466,
"learning_rate": 0.00019853640869138103,
"entropy": 0.04407569046597928,
"num_tokens": 3228763.0,
"mean_token_accuracy": 0.990016209334135,
"epoch": 1.0200050012503126,
"step": 510
},
{
"loss": 0.03389493525028229,
"grad_norm": 0.40270644426345825,
"learning_rate": 0.00019842151222746357,
"entropy": 0.035535094334045426,
"num_tokens": 3293010.0,
"mean_token_accuracy": 0.9887583516538143,
"epoch": 1.0400100025006251,
"step": 520
},
{
"loss": 0.030898410081863403,
"grad_norm": 0.2681713104248047,
"learning_rate": 0.00019830231048775977,
"entropy": 0.028601143200648948,
"num_tokens": 3354919.0,
"mean_token_accuracy": 0.9903686709702015,
"epoch": 1.0600150037509377,
"step": 530
},
{
"loss": 0.03407395482063293,
"grad_norm": 0.23451267182826996,
"learning_rate": 0.00019817880868653993,
"entropy": 0.034907517378451304,
"num_tokens": 3415784.0,
"mean_token_accuracy": 0.9890573389828206,
"epoch": 1.0800200050012503,
"step": 540
},
{
"loss": 0.029421544075012206,
"grad_norm": 0.23950988054275513,
"learning_rate": 0.0001980510122261729,
"entropy": 0.033313815778819846,
"num_tokens": 3480364.0,
"mean_token_accuracy": 0.9916689246892929,
"epoch": 1.1000250062515629,
"step": 550
},
{
"loss": 0.020369285345077516,
"grad_norm": 0.4551165997982025,
"learning_rate": 0.00019791892669688988,
"entropy": 0.02486751726246439,
"num_tokens": 3542678.0,
"mean_token_accuracy": 0.9940513521432877,
"epoch": 1.1200300075018754,
"step": 560
},
{
"loss": 0.02770337164402008,
"grad_norm": 0.20443572103977203,
"learning_rate": 0.00019778255787653978,
"entropy": 0.029150180192664264,
"num_tokens": 3609086.0,
"mean_token_accuracy": 0.9897698886692524,
"epoch": 1.140035008752188,
"step": 570
},
{
"loss": 0.025546741485595704,
"grad_norm": 0.3653818368911743,
"learning_rate": 0.00019764191173033663,
"entropy": 0.031121585314394906,
"num_tokens": 3670310.0,
"mean_token_accuracy": 0.9925875566899777,
"epoch": 1.1600400100025006,
"step": 580
},
{
"loss": 0.027299800515174867,
"grad_norm": 0.4811317026615143,
"learning_rate": 0.00019749699441059843,
"entropy": 0.02902457951568067,
"num_tokens": 3735307.0,
"mean_token_accuracy": 0.9906462356448174,
"epoch": 1.1800450112528131,
"step": 590
},
{
"loss": 0.02665548324584961,
"grad_norm": 0.21709105372428894,
"learning_rate": 0.00019734781225647828,
"entropy": 0.030135014103143475,
"num_tokens": 3797213.0,
"mean_token_accuracy": 0.9932463668286801,
"epoch": 1.2000500125031257,
"step": 600
},
{
"loss": 0.03535972833633423,
"grad_norm": 0.631148636341095,
"learning_rate": 0.00019719437179368688,
"entropy": 0.03371675145754125,
"num_tokens": 3859400.0,
"mean_token_accuracy": 0.9895499177277088,
"epoch": 1.2200550137534383,
"step": 610
},
{
"loss": 0.027658408880233763,
"grad_norm": 0.42123743891716003,
"learning_rate": 0.00019703667973420706,
"entropy": 0.028748418507166206,
"num_tokens": 3920848.0,
"mean_token_accuracy": 0.9910015679895878,
"epoch": 1.2400600150037508,
"step": 620
},
{
"loss": 0.028230640292167663,
"grad_norm": 0.23473748564720154,
"learning_rate": 0.00019687474297600045,
"entropy": 0.029886699473718182,
"num_tokens": 3984529.0,
"mean_token_accuracy": 0.9922301307320595,
"epoch": 1.2600650162540634,
"step": 630
},
{
"loss": 0.027012214064598083,
"grad_norm": 0.2611916661262512,
"learning_rate": 0.00019670856860270542,
"entropy": 0.03151440276997164,
"num_tokens": 4048411.0,
"mean_token_accuracy": 0.9917375601828098,
"epoch": 1.280070017504376,
"step": 640
},
{
"loss": 0.023584455251693726,
"grad_norm": 0.12378375232219696,
"learning_rate": 0.0001965381638833274,
"entropy": 0.027149295064737088,
"num_tokens": 4112116.0,
"mean_token_accuracy": 0.9936468034982682,
"epoch": 1.3000750187546886,
"step": 650
},
{
"loss": 0.025832393765449525,
"grad_norm": 0.18841037154197693,
"learning_rate": 0.00019636353627192082,
"entropy": 0.028390987019520253,
"num_tokens": 4175458.0,
"mean_token_accuracy": 0.9933209784328938,
"epoch": 1.3200800200050011,
"step": 660
},
{
"loss": 0.032191649079322815,
"grad_norm": 0.292369544506073,
"learning_rate": 0.00019618469340726319,
"entropy": 0.032682666774780954,
"num_tokens": 4236466.0,
"mean_token_accuracy": 0.9895716637372971,
"epoch": 1.3400850212553137,
"step": 670
},
{
"loss": 0.02866535782814026,
"grad_norm": 0.2205415517091751,
"learning_rate": 0.00019600164311252068,
"entropy": 0.032574003856279884,
"num_tokens": 4299775.0,
"mean_token_accuracy": 0.991417796164751,
"epoch": 1.3600900225056263,
"step": 680
},
{
"loss": 0.03524776101112366,
"grad_norm": 0.3276292681694031,
"learning_rate": 0.00019581439339490624,
"entropy": 0.04169052811048459,
"num_tokens": 4365609.0,
"mean_token_accuracy": 0.9886757604777813,
"epoch": 1.380095023755939,
"step": 690
},
{
"loss": 0.035996857285499576,
"grad_norm": 0.4103780686855316,
"learning_rate": 0.0001956229524453291,
"entropy": 0.03188371795695275,
"num_tokens": 4432330.0,
"mean_token_accuracy": 0.9892666183412075,
"epoch": 1.4001000250062516,
"step": 700
},
{
"loss": 0.02328706532716751,
"grad_norm": 0.24775762856006622,
"learning_rate": 0.00019542732863803662,
"entropy": 0.02871296225930564,
"num_tokens": 4496465.0,
"mean_token_accuracy": 0.9937438026070595,
"epoch": 1.4201050262565642,
"step": 710
},
{
"loss": 0.03300818204879761,
"grad_norm": 0.25881657004356384,
"learning_rate": 0.00019522753053024787,
"entropy": 0.03388670613931026,
"num_tokens": 4560755.0,
"mean_token_accuracy": 0.9890970505774022,
"epoch": 1.4401100275068768,
"step": 720
},
{
"loss": 0.03214167952537537,
"grad_norm": 0.23787066340446472,
"learning_rate": 0.00019502356686177926,
"entropy": 0.03670836841047276,
"num_tokens": 4625202.0,
"mean_token_accuracy": 0.9903383336961269,
"epoch": 1.4601150287571893,
"step": 730
},
{
"loss": 0.031187814474105836,
"grad_norm": 0.31929901242256165,
"learning_rate": 0.00019481544655466245,
"entropy": 0.03299383492558263,
"num_tokens": 4692174.0,
"mean_token_accuracy": 0.9905215993523597,
"epoch": 1.480120030007502,
"step": 740
},
{
"loss": 0.025655516982078554,
"grad_norm": 0.24006661772727966,
"learning_rate": 0.00019460317871275394,
"entropy": 0.023855643330898603,
"num_tokens": 4753192.0,
"mean_token_accuracy": 0.9913376875221729,
"epoch": 1.5001250312578145,
"step": 750
},
{
"loss": 0.03126271665096283,
"grad_norm": 0.2834339737892151,
"learning_rate": 0.00019438677262133668,
"entropy": 0.033190094074234365,
"num_tokens": 4817884.0,
"mean_token_accuracy": 0.9907064586877823,
"epoch": 1.520130032508127,
"step": 760
},
{
"loss": 0.033395078778266904,
"grad_norm": 0.4165857136249542,
"learning_rate": 0.00019416623774671425,
"entropy": 0.03176074127841275,
"num_tokens": 4879601.0,
"mean_token_accuracy": 0.9902952447533607,
"epoch": 1.5401350337584396,
"step": 770
},
{
"loss": 0.02917470932006836,
"grad_norm": 0.5297831296920776,
"learning_rate": 0.00019394158373579645,
"entropy": 0.03441936054150574,
"num_tokens": 4946026.0,
"mean_token_accuracy": 0.9917018190026283,
"epoch": 1.5601400350087522,
"step": 780
},
{
"loss": 0.02672044336795807,
"grad_norm": 0.3761133849620819,
"learning_rate": 0.00019371282041567752,
"entropy": 0.029212182367336935,
"num_tokens": 5009097.0,
"mean_token_accuracy": 0.9930847369134426,
"epoch": 1.5801450362590648,
"step": 790
},
{
"loss": 0.0338908702135086,
"grad_norm": 0.2545328438282013,
"learning_rate": 0.0001934799577932062,
"entropy": 0.03556556548574008,
"num_tokens": 5076314.0,
"mean_token_accuracy": 0.990411739051342,
"epoch": 1.6001500375093773,
"step": 800
},
{
"loss": 0.022386419773101806,
"grad_norm": 0.3428667187690735,
"learning_rate": 0.0001932430060545479,
"entropy": 0.02515874128730502,
"num_tokens": 5135522.0,
"mean_token_accuracy": 0.9932228110730648,
"epoch": 1.62015503875969,
"step": 810
},
{
"loss": 0.02211230844259262,
"grad_norm": 0.19730041921138763,
"learning_rate": 0.00019300197556473936,
"entropy": 0.021622967024450192,
"num_tokens": 5198651.0,
"mean_token_accuracy": 0.993052315711975,
"epoch": 1.6401600400100025,
"step": 820
},
{
"loss": 0.021593029797077178,
"grad_norm": 0.24043497443199158,
"learning_rate": 0.00019275687686723497,
"entropy": 0.022755468662944624,
"num_tokens": 5258441.0,
"mean_token_accuracy": 0.9927247293293476,
"epoch": 1.660165041260315,
"step": 830
},
{
"loss": 0.02743455469608307,
"grad_norm": 0.22126108407974243,
"learning_rate": 0.0001925077206834458,
"entropy": 0.02988760783628095,
"num_tokens": 5323635.0,
"mean_token_accuracy": 0.9924947433173656,
"epoch": 1.6801700425106276,
"step": 840
},
{
"loss": 0.01915370374917984,
"grad_norm": 0.2528051435947418,
"learning_rate": 0.00019225451791227052,
"entropy": 0.022633779112948105,
"num_tokens": 5388098.0,
"mean_token_accuracy": 0.9935295671224594,
"epoch": 1.7001750437609402,
"step": 850
},
{
"loss": 0.025216898322105406,
"grad_norm": 0.35426992177963257,
"learning_rate": 0.00019199727962961852,
"entropy": 0.024347139010205864,
"num_tokens": 5450303.0,
"mean_token_accuracy": 0.9927972495555878,
"epoch": 1.7201800450112528,
"step": 860
},
{
"loss": 0.022424712777137756,
"grad_norm": 0.2603664994239807,
"learning_rate": 0.00019173601708792566,
"entropy": 0.02343553317186888,
"num_tokens": 5513723.0,
"mean_token_accuracy": 0.9926920354366302,
"epoch": 1.7401850462615653,
"step": 870
},
{
"loss": 0.03777352273464203,
"grad_norm": 0.21528302133083344,
"learning_rate": 0.0001914707417156619,
"entropy": 0.03952418522676453,
"num_tokens": 5575942.0,
"mean_token_accuracy": 0.9895162962377071,
"epoch": 1.7601900475118781,
"step": 880
},
{
"loss": 0.02916957139968872,
"grad_norm": 0.39761167764663696,
"learning_rate": 0.00019120146511683142,
"entropy": 0.037056630512233825,
"num_tokens": 5640243.0,
"mean_token_accuracy": 0.9906649015843868,
"epoch": 1.7801950487621907,
"step": 890
},
{
"loss": 0.023631574213504793,
"grad_norm": 0.43694376945495605,
"learning_rate": 0.00019092819907046493,
"entropy": 0.022086267481790857,
"num_tokens": 5702162.0,
"mean_token_accuracy": 0.9936031945049763,
"epoch": 1.8002000500125033,
"step": 900
},
{
"loss": 0.025940075516700745,
"grad_norm": 0.4214474558830261,
"learning_rate": 0.00019065095553010458,
"entropy": 0.028572715594782493,
"num_tokens": 5764127.0,
"mean_token_accuracy": 0.9905624501407146,
"epoch": 1.8202050512628158,
"step": 910
},
{
"loss": 0.027613845467567445,
"grad_norm": 0.40316465497016907,
"learning_rate": 0.00019036974662328096,
"entropy": 0.028239472245331854,
"num_tokens": 5827235.0,
"mean_token_accuracy": 0.991669587045908,
"epoch": 1.8402100525131284,
"step": 920
},
{
"loss": 0.03177001476287842,
"grad_norm": 0.524972677230835,
"learning_rate": 0.0001900845846509827,
"entropy": 0.028241146955406294,
"num_tokens": 5890040.0,
"mean_token_accuracy": 0.9903169378638268,
"epoch": 1.860215053763441,
"step": 930
},
{
"loss": 0.02139996737241745,
"grad_norm": 0.43904051184654236,
"learning_rate": 0.00018979548208711817,
"entropy": 0.03260187199921347,
"num_tokens": 5953149.0,
"mean_token_accuracy": 0.9935068063437938,
"epoch": 1.8802200550137536,
"step": 940
},
{
"loss": 0.02489333599805832,
"grad_norm": 0.25154390931129456,
"learning_rate": 0.00018950245157797014,
"entropy": 0.025593279630993494,
"num_tokens": 6014655.0,
"mean_token_accuracy": 0.9933448024094105,
"epoch": 1.9002250562640661,
"step": 950
},
{
"loss": 0.02543329894542694,
"grad_norm": 0.2318635731935501,
"learning_rate": 0.00018920550594164238,
"entropy": 0.025231685642211232,
"num_tokens": 6078667.0,
"mean_token_accuracy": 0.9929649449884892,
"epoch": 1.9202300575143787,
"step": 960
},
{
"loss": 0.03582499623298645,
"grad_norm": 0.2020518183708191,
"learning_rate": 0.00018890465816749896,
"entropy": 0.0415392193797743,
"num_tokens": 6139688.0,
"mean_token_accuracy": 0.9897747471928596,
"epoch": 1.9402350587646913,
"step": 970
},
{
"loss": 0.023522551357746124,
"grad_norm": 0.25302180647850037,
"learning_rate": 0.00018859992141559615,
"entropy": 0.026439224516798275,
"num_tokens": 6203193.0,
"mean_token_accuracy": 0.9931276544928551,
"epoch": 1.9602400600150038,
"step": 980
},
{
"loss": 0.023089873790740966,
"grad_norm": 0.37129050493240356,
"learning_rate": 0.00018829130901610667,
"entropy": 0.02257391346647637,
"num_tokens": 6265353.0,
"mean_token_accuracy": 0.9930807471275329,
"epoch": 1.9802450612653164,
"step": 990
},
{
"loss": 0.020879687368869783,
"grad_norm": 0.1416839361190796,
"learning_rate": 0.00018797883446873662,
"entropy": 0.024826381788765894,
"num_tokens": 6325676.0,
"mean_token_accuracy": 0.9931328839893583,
"epoch": 2.0,
"step": 1000
},
{
"eval_loss": 0.042340315878391266,
"eval_runtime": 69.2562,
"eval_samples_per_second": 14.945,
"eval_steps_per_second": 7.479,
"eval_entropy": 0.028477752043098808,
"eval_num_tokens": 6325676.0,
"eval_mean_token_accuracy": 0.988268693211456,
"epoch": 2.0,
"step": 1000
},
{
"loss": 0.0183292493224144,
"grad_norm": 0.33506715297698975,
"learning_rate": 0.00018766251144213504,
"entropy": 0.021088267347658986,
"num_tokens": 6391016.0,
"mean_token_accuracy": 0.9939773567020893,
"epoch": 2.0200050012503126,
"step": 1010
},
{
"loss": 0.016541089117527007,
"grad_norm": 0.10510263592004776,
"learning_rate": 0.00018734235377329582,
"entropy": 0.021377279089938382,
"num_tokens": 6455040.0,
"mean_token_accuracy": 0.9943198271095752,
"epoch": 2.040010002500625,
"step": 1020
},
{
"loss": 0.017676208913326264,
"grad_norm": 0.25538530945777893,
"learning_rate": 0.0001870183754669526,
"entropy": 0.01835900279111229,
"num_tokens": 6517983.0,
"mean_token_accuracy": 0.9943479098379612,
"epoch": 2.0600150037509377,
"step": 1030
},
{
"loss": 0.018231543898582458,
"grad_norm": 0.1953907310962677,
"learning_rate": 0.00018669059069496594,
"entropy": 0.024707998137455434,
"num_tokens": 6582155.0,
"mean_token_accuracy": 0.9940299488604069,
"epoch": 2.0800200050012503,
"step": 1040
},
{
"loss": 0.015705856680870055,
"grad_norm": 0.23519866168498993,
"learning_rate": 0.00018635901379570377,
"entropy": 0.016339628079731484,
"num_tokens": 6644403.0,
"mean_token_accuracy": 0.9944866336882114,
"epoch": 2.100025006251563,
"step": 1050
},
{
"loss": 0.0239964097738266,
"grad_norm": 0.7782704830169678,
"learning_rate": 0.00018602365927341375,
"entropy": 0.021186151236179285,
"num_tokens": 6709057.0,
"mean_token_accuracy": 0.9942199148237705,
"epoch": 2.1200300075018754,
"step": 1060
},
{
"loss": 0.0214329332113266,
"grad_norm": 0.25117242336273193,
"learning_rate": 0.0001856845417975891,
"entropy": 0.02400836138986051,
"num_tokens": 6772040.0,
"mean_token_accuracy": 0.99395372569561,
"epoch": 2.140035008752188,
"step": 1070
},
{
"loss": 0.01707075983285904,
"grad_norm": 0.24927817285060883,
"learning_rate": 0.0001853416762023268,
"entropy": 0.01854798578133341,
"num_tokens": 6835866.0,
"mean_token_accuracy": 0.9950113117694854,
"epoch": 2.1600400100025006,
"step": 1080
},
{
"loss": 0.014785376191139222,
"grad_norm": 0.24353672564029694,
"learning_rate": 0.00018499507748567873,
"entropy": 0.019260429358109833,
"num_tokens": 6899725.0,
"mean_token_accuracy": 0.9959283553063869,
"epoch": 2.180045011252813,
"step": 1090
},
{
"loss": 0.019350311160087584,
"grad_norm": 0.288215309381485,
"learning_rate": 0.00018464476080899559,
"entropy": 0.02487965851032641,
"num_tokens": 6963141.0,
"mean_token_accuracy": 0.9941258184611798,
"epoch": 2.2000500125031257,
"step": 1100
},
{
"loss": 0.017427970468997956,
"grad_norm": 0.0646059513092041,
"learning_rate": 0.00018429074149626363,
"entropy": 0.01580278711626306,
"num_tokens": 7028325.0,
"mean_token_accuracy": 0.9952689491212368,
"epoch": 2.2200550137534383,
"step": 1110
},
{
"loss": 0.01726052612066269,
"grad_norm": 0.160948246717453,
"learning_rate": 0.0001839330350334345,
"entropy": 0.020199327028240077,
"num_tokens": 7092920.0,
"mean_token_accuracy": 0.9933249458670617,
"epoch": 2.240060015003751,
"step": 1120
},
{
"loss": 0.01608244627714157,
"grad_norm": 0.2359917163848877,
"learning_rate": 0.00018357165706774767,
"entropy": 0.021389624777657445,
"num_tokens": 7160997.0,
"mean_token_accuracy": 0.9940837919712067,
"epoch": 2.2600650162540634,
"step": 1130
},
{
"loss": 0.020376379787921905,
"grad_norm": 0.07118914276361465,
"learning_rate": 0.00018320662340704609,
"entropy": 0.02022790874907514,
"num_tokens": 7226007.0,
"mean_token_accuracy": 0.9942706093192101,
"epoch": 2.280070017504376,
"step": 1140
},
{
"loss": 0.01612715721130371,
"grad_norm": 0.25310513377189636,
"learning_rate": 0.00018283795001908457,
"entropy": 0.01867675751855131,
"num_tokens": 7287986.0,
"mean_token_accuracy": 0.9942055746912957,
"epoch": 2.3000750187546886,
"step": 1150
},
{
"loss": 0.016605789959430694,
"grad_norm": 0.2142266184091568,
"learning_rate": 0.0001824656530308315,
"entropy": 0.015577676898101345,
"num_tokens": 7349421.0,
"mean_token_accuracy": 0.9948085315525532,
"epoch": 2.320080020005001,
"step": 1160
},
{
"loss": 0.018196111917495726,
"grad_norm": 0.07947535812854767,
"learning_rate": 0.00018208974872776322,
"entropy": 0.020357475349737798,
"num_tokens": 7411941.0,
"mean_token_accuracy": 0.993843074887991,
"epoch": 2.3400850212553137,
"step": 1170
},
{
"loss": 0.016091108322143555,
"grad_norm": 0.19202570617198944,
"learning_rate": 0.00018171025355315164,
"entropy": 0.017023067966511006,
"num_tokens": 7474356.0,
"mean_token_accuracy": 0.9953217662870883,
"epoch": 2.3600900225056263,
"step": 1180
},
{
"loss": 0.015425822138786316,
"grad_norm": 0.24460658431053162,
"learning_rate": 0.00018132718410734515,
"entropy": 0.01825423450791277,
"num_tokens": 7536565.0,
"mean_token_accuracy": 0.9943965286016464,
"epoch": 2.380095023755939,
"step": 1190
},
{
"loss": 0.013514925539493561,
"grad_norm": 0.24659694731235504,
"learning_rate": 0.00018094055714704225,
"entropy": 0.015542891589575447,
"num_tokens": 7599751.0,
"mean_token_accuracy": 0.9943179704248906,
"epoch": 2.4001000250062514,
"step": 1200
},
{
"loss": 0.012726837396621704,
"grad_norm": 0.2550601065158844,
"learning_rate": 0.0001805503895845587,
"entropy": 0.015307287167524919,
"num_tokens": 7661520.0,
"mean_token_accuracy": 0.9962130591273308,
"epoch": 2.420105026256564,
"step": 1210
},
{
"loss": 0.012257835268974305,
"grad_norm": 0.15603283047676086,
"learning_rate": 0.00018015669848708767,
"entropy": 0.01749844834121177,
"num_tokens": 7726291.0,
"mean_token_accuracy": 0.9954387851059436,
"epoch": 2.4401100275068766,
"step": 1220
},
{
"loss": 0.018561355769634247,
"grad_norm": 0.22746174037456512,
"learning_rate": 0.0001797595010759531,
"entropy": 0.019737370508664753,
"num_tokens": 7788766.0,
"mean_token_accuracy": 0.9940820440649987,
"epoch": 2.460115028757189,
"step": 1230
},
{
"loss": 0.013849316537380219,
"grad_norm": 0.3152976334095001,
"learning_rate": 0.0001793588147258565,
"entropy": 0.015929855390277227,
"num_tokens": 7851396.0,
"mean_token_accuracy": 0.9952766291797162,
"epoch": 2.4801200300075017,
"step": 1240
},
{
"loss": 0.019299986958503722,
"grad_norm": 0.2762889862060547,
"learning_rate": 0.00017895465696411692,
"entropy": 0.02108022033935413,
"num_tokens": 7915421.0,
"mean_token_accuracy": 0.9940553769469261,
"epoch": 2.5001250312578147,
"step": 1250
},
{
"loss": 0.020875005424022673,
"grad_norm": 0.24086585640907288,
"learning_rate": 0.00017854704546990408,
"entropy": 0.020866505106096157,
"num_tokens": 7977133.0,
"mean_token_accuracy": 0.9940896175801754,
"epoch": 2.520130032508127,
"step": 1260
},
{
"loss": 0.018643879890441896,
"grad_norm": 0.23781460523605347,
"learning_rate": 0.0001781359980734653,
"entropy": 0.020857046739547514,
"num_tokens": 8040191.0,
"mean_token_accuracy": 0.9929048053920269,
"epoch": 2.54013503375844,
"step": 1270
},
{
"loss": 0.017947974801063537,
"grad_norm": 0.2054099142551422,
"learning_rate": 0.0001777215327553452,
"entropy": 0.021198420476866885,
"num_tokens": 8100152.0,
"mean_token_accuracy": 0.9934561550617218,
"epoch": 2.560140035008752,
"step": 1280
},
{
"loss": 0.0151192307472229,
"grad_norm": 0.469458669424057,
"learning_rate": 0.00017730366764559955,
"entropy": 0.018285114454920405,
"num_tokens": 8162591.0,
"mean_token_accuracy": 0.9951836079359054,
"epoch": 2.580145036259065,
"step": 1290
},
{
"loss": 0.0184975802898407,
"grad_norm": 0.2882782518863678,
"learning_rate": 0.00017688242102300192,
"entropy": 0.018374070005665998,
"num_tokens": 8225224.0,
"mean_token_accuracy": 0.9948060251772404,
"epoch": 2.600150037509377,
"step": 1300
},
{
"loss": 0.023296315968036652,
"grad_norm": 0.21924524009227753,
"learning_rate": 0.00017645781131424423,
"entropy": 0.022974171601526906,
"num_tokens": 8290274.0,
"mean_token_accuracy": 0.9924322210252285,
"epoch": 2.62015503875969,
"step": 1310
},
{
"loss": 0.017917373776435853,
"grad_norm": 0.354758620262146,
"learning_rate": 0.00017602985709313073,
"entropy": 0.02169415617827326,
"num_tokens": 8354370.0,
"mean_token_accuracy": 0.9948078036308289,
"epoch": 2.6401600400100023,
"step": 1320
},
{
"loss": 0.012286465615034103,
"grad_norm": 0.4151551127433777,
"learning_rate": 0.00017559857707976536,
"entropy": 0.016268294051405972,
"num_tokens": 8415022.0,
"mean_token_accuracy": 0.9961770802736283,
"epoch": 2.6601650412603153,
"step": 1330
},
{
"loss": 0.01499750316143036,
"grad_norm": 0.4065402150154114,
"learning_rate": 0.0001751639901397331,
"entropy": 0.0170176492218161,
"num_tokens": 8478286.0,
"mean_token_accuracy": 0.9952280893921852,
"epoch": 2.6801700425106274,
"step": 1340
},
{
"loss": 0.015018537640571594,
"grad_norm": 0.1335880309343338,
"learning_rate": 0.0001747261152832746,
"entropy": 0.018367627350380646,
"num_tokens": 8541154.0,
"mean_token_accuracy": 0.9949840374290944,
"epoch": 2.7001750437609404,
"step": 1350
},
{
"loss": 0.019237272441387177,
"grad_norm": 0.20553363859653473,
"learning_rate": 0.00017428497166445452,
"entropy": 0.019403737914399245,
"num_tokens": 8605361.0,
"mean_token_accuracy": 0.9930156201124192,
"epoch": 2.7201800450112525,
"step": 1360
},
{
"loss": 0.019147740304470064,
"grad_norm": 0.31576329469680786,
"learning_rate": 0.00017384057858032393,
"entropy": 0.02298831292137038,
"num_tokens": 8669155.0,
"mean_token_accuracy": 0.9930574476718903,
"epoch": 2.7401850462615656,
"step": 1370
},
{
"loss": 0.017152118682861327,
"grad_norm": 0.21389739215373993,
"learning_rate": 0.00017339295547007594,
"entropy": 0.01718737747578416,
"num_tokens": 8735019.0,
"mean_token_accuracy": 0.995334691554308,
"epoch": 2.760190047511878,
"step": 1380
},
{
"loss": 0.019429606199264527,
"grad_norm": 0.26539650559425354,
"learning_rate": 0.00017294212191419547,
"entropy": 0.019683032816101332,
"num_tokens": 8800972.0,
"mean_token_accuracy": 0.9936951123178005,
"epoch": 2.7801950487621907,
"step": 1390
},
{
"loss": 0.01909356415271759,
"grad_norm": 0.2084941565990448,
"learning_rate": 0.00017248809763360277,
"entropy": 0.018636453218641692,
"num_tokens": 8867596.0,
"mean_token_accuracy": 0.9940625011920929,
"epoch": 2.8002000500125033,
"step": 1400
},
{
"loss": 0.018046848475933075,
"grad_norm": 0.21403200924396515,
"learning_rate": 0.0001720309024887907,
"entropy": 0.023316194582730532,
"num_tokens": 8927516.0,
"mean_token_accuracy": 0.9939217306673527,
"epoch": 2.820205051262816,
"step": 1410
},
{
"loss": 0.018755699694156646,
"grad_norm": 0.33148443698883057,
"learning_rate": 0.000171570556478956,
"entropy": 0.01655098560877377,
"num_tokens": 8989089.0,
"mean_token_accuracy": 0.9942230053246022,
"epoch": 2.8402100525131284,
"step": 1420
},
{
"loss": 0.024141687154769897,
"grad_norm": 0.18521511554718018,
"learning_rate": 0.00017110707974112447,
"entropy": 0.02549898542056326,
"num_tokens": 9054435.0,
"mean_token_accuracy": 0.9930150359869003,
"epoch": 2.860215053763441,
"step": 1430
},
{
"loss": 0.020157690346240997,
"grad_norm": 0.23067928850650787,
"learning_rate": 0.0001706404925492701,
"entropy": 0.01900827525241766,
"num_tokens": 9114274.0,
"mean_token_accuracy": 0.9943146407604218,
"epoch": 2.8802200550137536,
"step": 1440
},
{
"loss": 0.014147150516510009,
"grad_norm": 0.5235961079597473,
"learning_rate": 0.00017017081531342813,
"entropy": 0.01623811650206335,
"num_tokens": 9174841.0,
"mean_token_accuracy": 0.9944271765649318,
"epoch": 2.900225056264066,
"step": 1450
},
{
"loss": 0.022856634855270386,
"grad_norm": 0.11377973109483719,
"learning_rate": 0.00016969806857880241,
"entropy": 0.023971330239146483,
"num_tokens": 9239456.0,
"mean_token_accuracy": 0.9932261377573013,
"epoch": 2.9202300575143787,
"step": 1460
},
{
"loss": 0.02486345320940018,
"grad_norm": 0.12835904955863953,
"learning_rate": 0.00016922227302486667,
"entropy": 0.02552748184389202,
"num_tokens": 9305144.0,
"mean_token_accuracy": 0.9918816141784191,
"epoch": 2.9402350587646913,
"step": 1470
},
{
"loss": 0.018220885097980498,
"grad_norm": 0.18033206462860107,
"learning_rate": 0.00016874344946445974,
"entropy": 0.019867337332107125,
"num_tokens": 9365854.0,
"mean_token_accuracy": 0.9945706635713577,
"epoch": 2.960240060015004,
"step": 1480
},
{
"loss": 0.01618766337633133,
"grad_norm": 0.2495020180940628,
"learning_rate": 0.00016826161884287533,
"entropy": 0.01948691344150575,
"num_tokens": 9427287.0,
"mean_token_accuracy": 0.9956672258675099,
"epoch": 2.9802450612653164,
"step": 1490
},
{
"loss": 0.024902991950511932,
"grad_norm": 0.2727943956851959,
"learning_rate": 0.00016777680223694575,
"entropy": 0.022937397798228586,
"num_tokens": 9488514.0,
"mean_token_accuracy": 0.9909723401069641,
"epoch": 3.0,
"step": 1500
},
{
"eval_loss": 0.03645886108279228,
"eval_runtime": 69.2921,
"eval_samples_per_second": 14.937,
"eval_steps_per_second": 7.476,
"eval_entropy": 0.02839457441272365,
"eval_num_tokens": 9488514.0,
"eval_mean_token_accuracy": 0.9902446437986661,
"epoch": 3.0,
"step": 1500
},
{
"loss": 0.014892478287220002,
"grad_norm": 0.26308536529541016,
"learning_rate": 0.00016728902085411996,
"entropy": 0.02168392370658694,
"num_tokens": 9553582.0,
"mean_token_accuracy": 0.9945793129503727,
"epoch": 3.0200050012503126,
"step": 1510
},
{
"loss": 0.009397410601377488,
"grad_norm": 0.20036503672599792,
"learning_rate": 0.0001667982960315358,
"entropy": 0.012075830744288396,
"num_tokens": 9617281.0,
"mean_token_accuracy": 0.9964840039610863,
"epoch": 3.040010002500625,
"step": 1520
},
{
"loss": 0.015942367911338805,
"grad_norm": 0.3861319124698639,
"learning_rate": 0.00016630464923508677,
"entropy": 0.014315767139487434,
"num_tokens": 9681345.0,
"mean_token_accuracy": 0.9952807635068893,
"epoch": 3.0600150037509377,
"step": 1530
},
{
"loss": 0.01565181165933609,
"grad_norm": 0.23598027229309082,
"learning_rate": 0.00016580810205848288,
"entropy": 0.01963768747918948,
"num_tokens": 9743616.0,
"mean_token_accuracy": 0.9945429727435112,
"epoch": 3.0800200050012503,
"step": 1540
},
{
"loss": 0.01511429101228714,
"grad_norm": 0.3226635754108429,
"learning_rate": 0.0001653086762223063,
"entropy": 0.01306593646404508,
"num_tokens": 9808581.0,
"mean_token_accuracy": 0.995248269289732,
"epoch": 3.100025006251563,
"step": 1550
},
{
"loss": 0.009530831128358841,
"grad_norm": 0.09154416620731354,
"learning_rate": 0.00016480639357306098,
"entropy": 0.013261715146654751,
"num_tokens": 9873666.0,
"mean_token_accuracy": 0.9966560050845146,
"epoch": 3.1200300075018754,
"step": 1560
},
{
"loss": 0.009393466264009475,
"grad_norm": 0.21701541543006897,
"learning_rate": 0.00016430127608221714,
"entropy": 0.011822419746022206,
"num_tokens": 9937438.0,
"mean_token_accuracy": 0.9964691713452339,
"epoch": 3.140035008752188,
"step": 1570
},
{
"loss": 0.011047683656215668,
"grad_norm": 0.2678857743740082,
"learning_rate": 0.00016379334584525025,
"entropy": 0.012122366849507672,
"num_tokens": 9999440.0,
"mean_token_accuracy": 0.9967051848769188,
"epoch": 3.1600400100025006,
"step": 1580
},
{
"loss": 0.013723762333393097,
"grad_norm": 0.324455201625824,
"learning_rate": 0.00016328262508067431,
"entropy": 0.012699224287644029,
"num_tokens": 10061600.0,
"mean_token_accuracy": 0.9955959998071193,
"epoch": 3.180045011252813,
"step": 1590
},
{
"loss": 0.014421728253364564,
"grad_norm": 0.18887697160243988,
"learning_rate": 0.00016276913612907007,
"entropy": 0.020439925385289825,
"num_tokens": 10126520.0,
"mean_token_accuracy": 0.9959282651543617,
"epoch": 3.2000500125031257,
"step": 1600
},
{
"loss": 0.01239979937672615,
"grad_norm": 0.1129460483789444,
"learning_rate": 0.00016225290145210772,
"entropy": 0.012199809608864598,
"num_tokens": 10191553.0,
"mean_token_accuracy": 0.995978644490242,
"epoch": 3.2200550137534383,
"step": 1610
},
{
"loss": 0.014834728837013245,
"grad_norm": 0.20427951216697693,
"learning_rate": 0.00016173394363156444,
"entropy": 0.016009513070457615,
"num_tokens": 10258289.0,
"mean_token_accuracy": 0.9960135422647,
"epoch": 3.240060015003751,
"step": 1620
},
{
"loss": 0.014402203261852264,
"grad_norm": 0.25807589292526245,
"learning_rate": 0.00016121228536833645,
"entropy": 0.015858568061958067,
"num_tokens": 10324281.0,
"mean_token_accuracy": 0.9963105775415897,
"epoch": 3.2600650162540634,
"step": 1630
},
{
"loss": 0.014248587191104889,
"grad_norm": 0.13609230518341064,
"learning_rate": 0.00016068794948144617,
"entropy": 0.015872705554647835,
"num_tokens": 10385122.0,
"mean_token_accuracy": 0.9952699325978756,
"epoch": 3.280070017504376,
"step": 1640
},
{
"loss": 0.013415993750095367,
"grad_norm": 0.21917292475700378,
"learning_rate": 0.00016016095890704387,
"entropy": 0.010807368888345081,
"num_tokens": 10447821.0,
"mean_token_accuracy": 0.9959428884088993,
"epoch": 3.3000750187546886,
"step": 1650
},
{
"loss": 0.008242987841367722,
"grad_norm": 0.2698808014392853,
"learning_rate": 0.0001596313366974045,
"entropy": 0.012187929065839853,
"num_tokens": 10507896.0,
"mean_token_accuracy": 0.9972235180437565,
"epoch": 3.320080020005001,
"step": 1660
},
{
"loss": 0.013128173351287842,
"grad_norm": 0.20612332224845886,
"learning_rate": 0.00015909910601991922,
"entropy": 0.013906099726591492,
"num_tokens": 10569117.0,
"mean_token_accuracy": 0.9961497314274311,
"epoch": 3.3400850212553137,
"step": 1670
},
{
"loss": 0.01361977458000183,
"grad_norm": 0.13489088416099548,
"learning_rate": 0.00015856429015608209,
"entropy": 0.013951514207292348,
"num_tokens": 10630981.0,
"mean_token_accuracy": 0.9956404089927673,
"epoch": 3.3600900225056263,
"step": 1680
},
{
"loss": 0.014680840075016022,
"grad_norm": 0.2713385820388794,
"learning_rate": 0.00015802691250047153,
"entropy": 0.013167628296650946,
"num_tokens": 10693173.0,
"mean_token_accuracy": 0.9950266376137733,
"epoch": 3.380095023755939,
"step": 1690
},
{
"loss": 0.013400137424468994,
"grad_norm": 0.1426415741443634,
"learning_rate": 0.00015748699655972708,
"entropy": 0.017778589528461453,
"num_tokens": 10753429.0,
"mean_token_accuracy": 0.9946111224591732,
"epoch": 3.4001000250062514,
"step": 1700
},
{
"loss": 0.008509327471256257,
"grad_norm": 0.16599993407726288,
"learning_rate": 0.00015694456595152106,
"entropy": 0.013743974023964257,
"num_tokens": 10819863.0,
"mean_token_accuracy": 0.9970920436084271,
"epoch": 3.420105026256564,
"step": 1710
},
{
"loss": 0.01316998302936554,
"grad_norm": 0.20159605145454407,
"learning_rate": 0.0001563996444035255,
"entropy": 0.01153940933654667,
"num_tokens": 10882060.0,
"mean_token_accuracy": 0.9955882236361504,
"epoch": 3.4401100275068766,
"step": 1720
},
{
"loss": 0.011991073936223983,
"grad_norm": 0.23580631613731384,
"learning_rate": 0.00015585225575237427,
"entropy": 0.012680305907269939,
"num_tokens": 10945979.0,
"mean_token_accuracy": 0.9958546876907348,
"epoch": 3.460115028757189,
"step": 1730
},
{
"loss": 0.012041158974170685,
"grad_norm": 0.33789604902267456,
"learning_rate": 0.00015530242394262017,
"entropy": 0.013596625554055209,
"num_tokens": 11008355.0,
"mean_token_accuracy": 0.9955416478216648,
"epoch": 3.4801200300075017,
"step": 1740
},
{
"loss": 0.01627572178840637,
"grad_norm": 0.2994728982448578,
"learning_rate": 0.00015475017302568782,
"entropy": 0.019999047268356662,
"num_tokens": 11071934.0,
"mean_token_accuracy": 0.9931987822055817,
"epoch": 3.5001250312578147,
"step": 1750
},
{
"loss": 0.011943073570728302,
"grad_norm": 0.09841946512460709,
"learning_rate": 0.00015419552715882138,
"entropy": 0.01364866496878676,
"num_tokens": 11132456.0,
"mean_token_accuracy": 0.9967477336525917,
"epoch": 3.520130032508127,
"step": 1760
},
{
"loss": 0.0153175488114357,
"grad_norm": 0.22312118113040924,
"learning_rate": 0.00015363851060402783,
"entropy": 0.016219895507674664,
"num_tokens": 11194782.0,
"mean_token_accuracy": 0.9945069424808025,
"epoch": 3.54013503375844,
"step": 1770
},
{
"loss": 0.00787808895111084,
"grad_norm": 0.16057588160037994,
"learning_rate": 0.0001530791477270158,
"entropy": 0.012033771253481974,
"num_tokens": 11259307.0,
"mean_token_accuracy": 0.9970344088971614,
"epoch": 3.560140035008752,
"step": 1780
},
{
"loss": 0.013948053121566772,
"grad_norm": 0.2074371874332428,
"learning_rate": 0.0001525174629961296,
"entropy": 0.01175229620130267,
"num_tokens": 11321733.0,
"mean_token_accuracy": 0.9959047585725784,
"epoch": 3.580145036259065,
"step": 1790
},
{
"loss": 0.012327873706817627,
"grad_norm": 0.15074662864208221,
"learning_rate": 0.00015195348098127895,
"entropy": 0.014628350256680278,
"num_tokens": 11384586.0,
"mean_token_accuracy": 0.9950341537594796,
"epoch": 3.600150037509377,
"step": 1800
},
{
"loss": 0.012766703963279724,
"grad_norm": 0.2124103605747223,
"learning_rate": 0.00015138722635286422,
"entropy": 0.018070634140167387,
"num_tokens": 11448156.0,
"mean_token_accuracy": 0.9958022043108941,
"epoch": 3.62015503875969,
"step": 1810
},
{
"loss": 0.011698020249605178,
"grad_norm": 0.4769149124622345,
"learning_rate": 0.0001508187238806973,
"entropy": 0.01308420468485565,
"num_tokens": 11511882.0,
"mean_token_accuracy": 0.9961448684334755,
"epoch": 3.6401600400100023,
"step": 1820
},
{
"loss": 0.014116832613945007,
"grad_norm": 0.25340843200683594,
"learning_rate": 0.00015024799843291802,
"entropy": 0.012517862502500065,
"num_tokens": 11575526.0,
"mean_token_accuracy": 0.9950296327471733,
"epoch": 3.6601650412603153,
"step": 1830
},
{
"loss": 0.014804676175117493,
"grad_norm": 0.21997588872909546,
"learning_rate": 0.00014967507497490635,
"entropy": 0.016702812965377234,
"num_tokens": 11637521.0,
"mean_token_accuracy": 0.9941891603171825,
"epoch": 3.6801700425106274,
"step": 1840
},
{
"loss": 0.008088278025388718,
"grad_norm": 0.1356344372034073,
"learning_rate": 0.00014909997856819032,
"entropy": 0.01380894306494156,
"num_tokens": 11700080.0,
"mean_token_accuracy": 0.9972025558352471,
"epoch": 3.7001750437609404,
"step": 1850
},
{
"loss": 0.014773441851139069,
"grad_norm": 0.2926776707172394,
"learning_rate": 0.00014852273436934986,
"entropy": 0.013712721945921658,
"num_tokens": 11761687.0,
"mean_token_accuracy": 0.9959305942058563,
"epoch": 3.7201800450112525,
"step": 1860
},
{
"loss": 0.011582046002149581,
"grad_norm": 0.13980428874492645,
"learning_rate": 0.00014794336762891623,
"entropy": 0.014661396172596142,
"num_tokens": 11823454.0,
"mean_token_accuracy": 0.9961862593889237,
"epoch": 3.7401850462615656,
"step": 1870
},
{
"loss": 0.012114252895116806,
"grad_norm": 0.2284947633743286,
"learning_rate": 0.00014736190369026754,
"entropy": 0.01451311390119372,
"num_tokens": 11884267.0,
"mean_token_accuracy": 0.9961981892585754,
"epoch": 3.760190047511878,
"step": 1880
},
{
"loss": 0.007772183418273926,
"grad_norm": 0.255247563123703,
"learning_rate": 0.0001467783679885201,
"entropy": 0.010285129089606927,
"num_tokens": 11948880.0,
"mean_token_accuracy": 0.9978563249111175,
"epoch": 3.7801950487621907,
"step": 1890
},
{
"loss": 0.013219112157821655,
"grad_norm": 0.21494613587856293,
"learning_rate": 0.00014619278604941603,
"entropy": 0.01082497325114673,
"num_tokens": 12012547.0,
"mean_token_accuracy": 0.9958216808736324,
"epoch": 3.8002000500125033,
"step": 1900
},
{
"loss": 0.012468833476305008,
"grad_norm": 0.28526443243026733,
"learning_rate": 0.00014560518348820625,
"entropy": 0.013233061737264507,
"num_tokens": 12078372.0,
"mean_token_accuracy": 0.9958592697978019,
"epoch": 3.820205051262816,
"step": 1910
},
{
"loss": 0.018085935711860658,
"grad_norm": 0.1471295952796936,
"learning_rate": 0.00014501558600853035,
"entropy": 0.015974047601775964,
"num_tokens": 12142500.0,
"mean_token_accuracy": 0.9947570398449898,
"epoch": 3.8402100525131284,
"step": 1920
},
{
"loss": 0.013111139833927154,
"grad_norm": 0.2544702887535095,
"learning_rate": 0.0001444240194012922,
"entropy": 0.01969735559250694,
"num_tokens": 12206205.0,
"mean_token_accuracy": 0.9956923462450504,
"epoch": 3.860215053763441,
"step": 1930
},
{
"loss": 0.013215355575084686,
"grad_norm": 0.14971140027046204,
"learning_rate": 0.00014383050954353154,
"entropy": 0.01610187725018477,
"num_tokens": 12269828.0,
"mean_token_accuracy": 0.9956071071326733,
"epoch": 3.8802200550137536,
"step": 1940
},
{
"loss": 0.00939919427037239,
"grad_norm": 0.08307329565286636,
"learning_rate": 0.00014323508239729232,
"entropy": 0.01351477519783657,
"num_tokens": 12331919.0,
"mean_token_accuracy": 0.99660724401474,
"epoch": 3.900225056264066,
"step": 1950
},
{
"loss": 0.011213938146829605,
"grad_norm": 0.12744051218032837,
"learning_rate": 0.00014263776400848678,
"entropy": 0.011691810854972572,
"num_tokens": 12394410.0,
"mean_token_accuracy": 0.9957682631909848,
"epoch": 3.9202300575143787,
"step": 1960
},
{
"loss": 0.014179202914237975,
"grad_norm": 0.30811241269111633,
"learning_rate": 0.00014203858050575632,
"entropy": 0.013546516641508789,
"num_tokens": 12458473.0,
"mean_token_accuracy": 0.9955927409231663,
"epoch": 3.9402350587646913,
"step": 1970
},
{
"loss": 0.014471597969532013,
"grad_norm": 0.1450197547674179,
"learning_rate": 0.00014143755809932845,
"entropy": 0.016499465111701285,
"num_tokens": 12523348.0,
"mean_token_accuracy": 0.9954880520701408,
"epoch": 3.960240060015004,
"step": 1980
},
{
"loss": 0.010644648969173432,
"grad_norm": 0.14227765798568726,
"learning_rate": 0.0001408347230798702,
"entropy": 0.013392421180469682,
"num_tokens": 12588443.0,
"mean_token_accuracy": 0.9969804167747498,
"epoch": 3.9802450612653164,
"step": 1990
},
{
"loss": 0.015882152318954467,
"grad_norm": 0.12858586013317108,
"learning_rate": 0.00014023010181733826,
"entropy": 0.01455020939060369,
"num_tokens": 12651352.0,
"mean_token_accuracy": 0.9946769113782086,
"epoch": 4.0,
"step": 2000
},
{
"eval_loss": 0.0426219180226326,
"eval_runtime": 69.3664,
"eval_samples_per_second": 14.921,
"eval_steps_per_second": 7.468,
"eval_entropy": 0.03254893434532418,
"eval_num_tokens": 12651352.0,
"eval_mean_token_accuracy": 0.9884336234059573,
"epoch": 4.0,
"step": 2000
},
{
"loss": 0.00863734856247902,
"grad_norm": 0.4523090422153473,
"learning_rate": 0.00013962372075982543,
"entropy": 0.01400298816661234,
"num_tokens": 12710379.0,
"mean_token_accuracy": 0.9968750610947609,
"epoch": 4.020005001250313,
"step": 2010
},
{
"loss": 0.007897177338600158,
"grad_norm": 0.10824855417013168,
"learning_rate": 0.0001390156064324035,
"entropy": 0.008752083206127281,
"num_tokens": 12774117.0,
"mean_token_accuracy": 0.9971247158944607,
"epoch": 4.040010002500625,
"step": 2020
},
{
"loss": 0.008237957209348678,
"grad_norm": 0.3647105097770691,
"learning_rate": 0.00013840578543596315,
"entropy": 0.008517850490170531,
"num_tokens": 12838463.0,
"mean_token_accuracy": 0.9974852904677391,
"epoch": 4.060015003750938,
"step": 2030
},
{
"loss": 0.010357823967933655,
"grad_norm": 0.1849185675382614,
"learning_rate": 0.00013779428444605035,
"entropy": 0.011237980193618569,
"num_tokens": 12906031.0,
"mean_token_accuracy": 0.9965578347444535,
"epoch": 4.08002000500125,
"step": 2040
},
{
"loss": 0.00867396593093872,
"grad_norm": 0.17338383197784424,
"learning_rate": 0.0001371811302116994,
"entropy": 0.00913453484463389,
"num_tokens": 12968016.0,
"mean_token_accuracy": 0.9973611943423748,
"epoch": 4.100025006251563,
"step": 2050
},
{
"loss": 0.012893503904342652,
"grad_norm": 0.1852918565273285,
"learning_rate": 0.0001365663495542628,
"entropy": 0.012978466165077408,
"num_tokens": 13032518.0,
"mean_token_accuracy": 0.99602395221591,
"epoch": 4.120030007501875,
"step": 2060
},
{
"loss": 0.010699793696403503,
"grad_norm": 0.2881818115711212,
"learning_rate": 0.00013594996936623814,
"entropy": 0.015379714348819106,
"num_tokens": 13096744.0,
"mean_token_accuracy": 0.9955209918320179,
"epoch": 4.140035008752188,
"step": 2070
},
{
"loss": 0.009091087430715562,
"grad_norm": 0.32742437720298767,
"learning_rate": 0.0001353320166100917,
"entropy": 0.009939568623667582,
"num_tokens": 13162095.0,
"mean_token_accuracy": 0.9969943076372146,
"epoch": 4.160040010002501,
"step": 2080
},
{
"loss": 0.009758947789669037,
"grad_norm": 0.2090802937746048,
"learning_rate": 0.00013471251831707884,
"entropy": 0.010461670262520784,
"num_tokens": 13228156.0,
"mean_token_accuracy": 0.9968024276196956,
"epoch": 4.180045011252814,
"step": 2090
},
{
"loss": 0.008040308952331543,
"grad_norm": 0.21466973423957825,
"learning_rate": 0.0001340915015860618,
"entropy": 0.011725931792898336,
"num_tokens": 13291512.0,
"mean_token_accuracy": 0.9968237906694413,
"epoch": 4.200050012503126,
"step": 2100
},
{
"loss": 0.00803126096725464,
"grad_norm": 0.24069944024085999,
"learning_rate": 0.0001334689935823243,
"entropy": 0.011084824410500006,
"num_tokens": 13353896.0,
"mean_token_accuracy": 0.997739101946354,
"epoch": 4.220055013753439,
"step": 2110
},
{
"loss": 0.008842091262340545,
"grad_norm": 0.06226912513375282,
"learning_rate": 0.00013284502153638295,
"entropy": 0.010992687013640534,
"num_tokens": 13416743.0,
"mean_token_accuracy": 0.996946869045496,
"epoch": 4.240060015003751,
"step": 2120
},
{
"loss": 0.010905887186527252,
"grad_norm": 0.11721836030483246,
"learning_rate": 0.00013221961274279654,
"entropy": 0.011237628920207498,
"num_tokens": 13481284.0,
"mean_token_accuracy": 0.9970996268093586,
"epoch": 4.260065016254064,
"step": 2130
},
{
"loss": 0.012466417998075486,
"grad_norm": 0.3521440327167511,
"learning_rate": 0.00013159279455897166,
"entropy": 0.010562418565677944,
"num_tokens": 13543678.0,
"mean_token_accuracy": 0.9958751887083054,
"epoch": 4.280070017504376,
"step": 2140
},
{
"loss": 0.011747314780950546,
"grad_norm": 0.26293885707855225,
"learning_rate": 0.0001309645944039663,
"entropy": 0.014598401125113014,
"num_tokens": 13608112.0,
"mean_token_accuracy": 0.9962641790509223,
"epoch": 4.300075018754689,
"step": 2150
},
{
"loss": 0.007845200598239899,
"grad_norm": 0.16723529994487762,
"learning_rate": 0.00013033503975729035,
"entropy": 0.011412217889301246,
"num_tokens": 13667979.0,
"mean_token_accuracy": 0.99744006767869,
"epoch": 4.320080020005001,
"step": 2160
},
{
"loss": 0.010894352942705155,
"grad_norm": 0.21131186187267303,
"learning_rate": 0.0001297041581577035,
"entropy": 0.010380906579666772,
"num_tokens": 13730034.0,
"mean_token_accuracy": 0.9965024016797542,
"epoch": 4.340085021255314,
"step": 2170
},
{
"loss": 0.00956823006272316,
"grad_norm": 0.10813307017087936,
"learning_rate": 0.00012907197720201071,
"entropy": 0.009887772376168868,
"num_tokens": 13792366.0,
"mean_token_accuracy": 0.9968511998653412,
"epoch": 4.360090022505626,
"step": 2180
},
{
"loss": 0.009695110470056533,
"grad_norm": 0.21164672076702118,
"learning_rate": 0.00012843852454385497,
"entropy": 0.011902359123632777,
"num_tokens": 13853048.0,
"mean_token_accuracy": 0.9974331922829152,
"epoch": 4.380095023755939,
"step": 2190
},
{
"loss": 0.008793818950653075,
"grad_norm": 0.4802285432815552,
"learning_rate": 0.00012780382789250762,
"entropy": 0.009543133205443154,
"num_tokens": 13917884.0,
"mean_token_accuracy": 0.997763866186142,
"epoch": 4.400100025006251,
"step": 2200
},
{
"loss": 0.009752951562404633,
"grad_norm": 0.3032193183898926,
"learning_rate": 0.00012716791501165634,
"entropy": 0.01140449561207788,
"num_tokens": 13982842.0,
"mean_token_accuracy": 0.9972191534936428,
"epoch": 4.420105026256564,
"step": 2210
},
{
"loss": 0.005666728690266609,
"grad_norm": 0.394113153219223,
"learning_rate": 0.00012653081371819064,
"entropy": 0.008245287769386777,
"num_tokens": 14045445.0,
"mean_token_accuracy": 0.998167161643505,
"epoch": 4.4401100275068766,
"step": 2220
},
{
"loss": 0.010289490967988969,
"grad_norm": 0.5735944509506226,
"learning_rate": 0.00012589255188098498,
"entropy": 0.008848439441499068,
"num_tokens": 14105270.0,
"mean_token_accuracy": 0.996202427148819,
"epoch": 4.46011502875719,
"step": 2230
},
{
"loss": 0.006267648935317993,
"grad_norm": 0.0710088387131691,
"learning_rate": 0.00012525315741967978,
"entropy": 0.010472280244721332,
"num_tokens": 14166955.0,
"mean_token_accuracy": 0.9972212843596935,
"epoch": 4.480120030007502,
"step": 2240
},
{
"loss": 0.010307309031486512,
"grad_norm": 0.23172006011009216,
"learning_rate": 0.00012461265830346018,
"entropy": 0.008165620337967994,
"num_tokens": 14231397.0,
"mean_token_accuracy": 0.996221523731947,
"epoch": 4.500125031257815,
"step": 2250
},
{
"loss": 0.010486914217472077,
"grad_norm": 0.1562025099992752,
"learning_rate": 0.00012397108254983243,
"entropy": 0.01140070731707965,
"num_tokens": 14293502.0,
"mean_token_accuracy": 0.9965781837701797,
"epoch": 4.520130032508127,
"step": 2260
},
{
"loss": 0.008283475786447525,
"grad_norm": 0.09583538770675659,
"learning_rate": 0.00012332845822339846,
"entropy": 0.011921767683816142,
"num_tokens": 14355038.0,
"mean_token_accuracy": 0.9969584576785564,
"epoch": 4.54013503375844,
"step": 2270
},
{
"loss": 0.00834668129682541,
"grad_norm": 0.18446850776672363,
"learning_rate": 0.000122684813434628,
"entropy": 0.010264168232242809,
"num_tokens": 14420148.0,
"mean_token_accuracy": 0.9971672594547272,
"epoch": 4.560140035008752,
"step": 2280
},
{
"loss": 0.009413036704063415,
"grad_norm": 0.11777894198894501,
"learning_rate": 0.00012204017633862932,
"entropy": 0.011230875192995881,
"num_tokens": 14482015.0,
"mean_token_accuracy": 0.9962861262261867,
"epoch": 4.580145036259065,
"step": 2290
},
{
"loss": 0.0066015787422657015,
"grad_norm": 0.14621251821517944,
"learning_rate": 0.00012139457513391732,
"entropy": 0.007982138471561484,
"num_tokens": 14546515.0,
"mean_token_accuracy": 0.9983268916606903,
"epoch": 4.600150037509377,
"step": 2300
},
{
"loss": 0.010532976686954498,
"grad_norm": 0.2948937714099884,
"learning_rate": 0.00012074803806118016,
"entropy": 0.011228621992995614,
"num_tokens": 14610218.0,
"mean_token_accuracy": 0.9960615806281566,
"epoch": 4.62015503875969,
"step": 2310
},
{
"loss": 0.012350869178771973,
"grad_norm": 0.25452813506126404,
"learning_rate": 0.0001201005934020439,
"entropy": 0.0075275591014360545,
"num_tokens": 14673523.0,
"mean_token_accuracy": 0.9973488107323647,
"epoch": 4.640160040010002,
"step": 2320
},
{
"loss": 0.015287771821022034,
"grad_norm": 0.24262821674346924,
"learning_rate": 0.00011945226947783532,
"entropy": 0.012186212290544063,
"num_tokens": 14734854.0,
"mean_token_accuracy": 0.995884881913662,
"epoch": 4.660165041260315,
"step": 2330
},
{
"loss": 0.010069895535707474,
"grad_norm": 0.24241459369659424,
"learning_rate": 0.00011880309464834317,
"entropy": 0.014627664355066372,
"num_tokens": 14796717.0,
"mean_token_accuracy": 0.9970944046974182,
"epoch": 4.680170042510627,
"step": 2340
},
{
"loss": 0.007354290783405304,
"grad_norm": 0.24272984266281128,
"learning_rate": 0.00011815309731057752,
"entropy": 0.00997849061677698,
"num_tokens": 14857558.0,
"mean_token_accuracy": 0.9976357862353324,
"epoch": 4.70017504376094,
"step": 2350
},
{
"loss": 0.01080884262919426,
"grad_norm": 0.16180723905563354,
"learning_rate": 0.00011750230589752762,
"entropy": 0.011729113181354478,
"num_tokens": 14918129.0,
"mean_token_accuracy": 0.9959106191992759,
"epoch": 4.7201800450112525,
"step": 2360
},
{
"loss": 0.0070034988224506375,
"grad_norm": 0.14300037920475006,
"learning_rate": 0.00011685074887691815,
"entropy": 0.010010966495974572,
"num_tokens": 14981742.0,
"mean_token_accuracy": 0.9970420770347118,
"epoch": 4.740185046261566,
"step": 2370
},
{
"loss": 0.006338100135326386,
"grad_norm": 0.31339094042778015,
"learning_rate": 0.00011619845474996396,
"entropy": 0.007486376102315262,
"num_tokens": 15044749.0,
"mean_token_accuracy": 0.998369050770998,
"epoch": 4.760190047511878,
"step": 2380
},
{
"loss": 0.0088754341006279,
"grad_norm": 0.2821660339832306,
"learning_rate": 0.0001155454520501233,
"entropy": 0.0094100816793798,
"num_tokens": 15107356.0,
"mean_token_accuracy": 0.9967978030443192,
"epoch": 4.780195048762191,
"step": 2390
},
{
"loss": 0.0074894212186336516,
"grad_norm": 0.20098550617694855,
"learning_rate": 0.00011489176934184966,
"entropy": 0.011058530519949272,
"num_tokens": 15170161.0,
"mean_token_accuracy": 0.9970949165523052,
"epoch": 4.800200050012503,
"step": 2400
},
{
"loss": 0.006931519508361817,
"grad_norm": 0.2597576379776001,
"learning_rate": 0.00011423743521934239,
"entropy": 0.009024496493293555,
"num_tokens": 15233166.0,
"mean_token_accuracy": 0.9981255434453488,
"epoch": 4.820205051262816,
"step": 2410
},
{
"loss": 0.007713411748409271,
"grad_norm": 0.07438832521438599,
"learning_rate": 0.00011358247830529572,
"entropy": 0.008874563317294814,
"num_tokens": 15294745.0,
"mean_token_accuracy": 0.997540271282196,
"epoch": 4.840210052513128,
"step": 2420
},
{
"loss": 0.010046067833900451,
"grad_norm": 0.15564411878585815,
"learning_rate": 0.00011292692724964684,
"entropy": 0.01154620652741869,
"num_tokens": 15360934.0,
"mean_token_accuracy": 0.9968956887722016,
"epoch": 4.860215053763441,
"step": 2430
},
{
"loss": 0.007103031873703003,
"grad_norm": 0.13080066442489624,
"learning_rate": 0.00011227081072832264,
"entropy": 0.009648629953153432,
"num_tokens": 15423505.0,
"mean_token_accuracy": 0.9975046671926975,
"epoch": 4.880220055013753,
"step": 2440
},
{
"loss": 0.011635245382785797,
"grad_norm": 0.1020200327038765,
"learning_rate": 0.00011161415744198529,
"entropy": 0.01059294661572494,
"num_tokens": 15488354.0,
"mean_token_accuracy": 0.996422378718853,
"epoch": 4.900225056264066,
"step": 2450
},
{
"loss": 0.00895947739481926,
"grad_norm": 0.5128690600395203,
"learning_rate": 0.00011095699611477672,
"entropy": 0.01126530086476123,
"num_tokens": 15551047.0,
"mean_token_accuracy": 0.9972493521869182,
"epoch": 4.920230057514378,
"step": 2460
},
{
"loss": 0.007447101175785065,
"grad_norm": 0.1531531810760498,
"learning_rate": 0.00011029935549306236,
"entropy": 0.009639624001283664,
"num_tokens": 15614133.0,
"mean_token_accuracy": 0.9972159087657928,
"epoch": 4.940235058764691,
"step": 2470
},
{
"loss": 0.009513139724731445,
"grad_norm": 0.109550341963768,
"learning_rate": 0.00010964126434417348,
"entropy": 0.011513816034130287,
"num_tokens": 15681338.0,
"mean_token_accuracy": 0.9967059269547462,
"epoch": 4.960240060015003,
"step": 2480
},
{
"loss": 0.014146287739276887,
"grad_norm": 0.2227025330066681,
"learning_rate": 0.00010898275145514878,
"entropy": 0.012698486276713083,
"num_tokens": 15750237.0,
"mean_token_accuracy": 0.9964324481785297,
"epoch": 4.980245061265316,
"step": 2490
},
{
"loss": 0.011340580135583877,
"grad_norm": 0.26418933272361755,
"learning_rate": 0.00010832384563147539,
"entropy": 0.012120508169607979,
"num_tokens": 15814190.0,
"mean_token_accuracy": 0.9962437522562244,
"epoch": 5.0,
"step": 2500
},
{
"eval_loss": 0.036649439483881,
"eval_runtime": 68.931,
"eval_samples_per_second": 15.015,
"eval_steps_per_second": 7.515,
"eval_entropy": 0.01951373018991628,
"eval_num_tokens": 15814190.0,
"eval_mean_token_accuracy": 0.990988754052453,
"epoch": 5.0,
"step": 2500
},
{
"loss": 0.00565112940967083,
"grad_norm": 0.24155987799167633,
"learning_rate": 0.00010766457569582855,
"entropy": 0.008389830897795037,
"num_tokens": 15876304.0,
"mean_token_accuracy": 0.9987288475036621,
"epoch": 5.020005001250313,
"step": 2510
},
{
"loss": 0.004657933115959167,
"grad_norm": 0.17384299635887146,
"learning_rate": 0.000107004970486811,
"entropy": 0.0063808045721089005,
"num_tokens": 15939328.0,
"mean_token_accuracy": 0.9986095182597637,
"epoch": 5.040010002500625,
"step": 2520
},
{
"loss": 0.009442869573831558,
"grad_norm": 0.07942040264606476,
"learning_rate": 0.00010634505885769134,
"entropy": 0.008581503613459062,
"num_tokens": 16001585.0,
"mean_token_accuracy": 0.9973239652812481,
"epoch": 5.060015003750938,
"step": 2530
},
{
"loss": 0.007105500251054764,
"grad_norm": 0.1442539244890213,
"learning_rate": 0.00010568486967514218,
"entropy": 0.008049002460029441,
"num_tokens": 16066250.0,
"mean_token_accuracy": 0.9976261213421822,
"epoch": 5.08002000500125,
"step": 2540
},
{
"loss": 0.006882892549037933,
"grad_norm": 0.05469922348856926,
"learning_rate": 0.00010502443181797697,
"entropy": 0.008640473794366698,
"num_tokens": 16131511.0,
"mean_token_accuracy": 0.9982132039964199,
"epoch": 5.100025006251563,
"step": 2550
},
{
"loss": 0.007951027154922486,
"grad_norm": 0.08848944306373596,
"learning_rate": 0.00010436377417588714,
"entropy": 0.007696686122289975,
"num_tokens": 16194361.0,
"mean_token_accuracy": 0.998307142406702,
"epoch": 5.120030007501875,
"step": 2560
},
{
"loss": 0.005469654873013497,
"grad_norm": 0.1663186103105545,
"learning_rate": 0.0001037029256481782,
"entropy": 0.008428349181485828,
"num_tokens": 16257949.0,
"mean_token_accuracy": 0.9982100896537304,
"epoch": 5.140035008752188,
"step": 2570
},
{
"loss": 0.007561860978603363,
"grad_norm": 0.1089382916688919,
"learning_rate": 0.00010304191514250559,
"entropy": 0.00860111919027986,
"num_tokens": 16319368.0,
"mean_token_accuracy": 0.9977700248360634,
"epoch": 5.160040010002501,
"step": 2580
},
{
"loss": 0.006244239956140518,
"grad_norm": 0.29137757420539856,
"learning_rate": 0.00010238077157361021,
"entropy": 0.006166888629377354,
"num_tokens": 16382222.0,
"mean_token_accuracy": 0.9981474541127682,
"epoch": 5.180045011252814,
"step": 2590
},
{
"loss": 0.004823794960975647,
"grad_norm": 0.09055764973163605,
"learning_rate": 0.00010171952386205354,
"entropy": 0.007182681497215526,
"num_tokens": 16442713.0,
"mean_token_accuracy": 0.9988246329128743,
"epoch": 5.200050012503126,
"step": 2600
},
{
"loss": 0.004676086083054543,
"grad_norm": 0.041668012738227844,
"learning_rate": 0.00010105820093295268,
"entropy": 0.007433413605031092,
"num_tokens": 16507336.0,
"mean_token_accuracy": 0.9984147787094116,
"epoch": 5.220055013753439,
"step": 2610
},
{
"loss": 0.007142329961061478,
"grad_norm": 0.3844437897205353,
"learning_rate": 0.00010039683171471493,
"entropy": 0.006547862391016679,
"num_tokens": 16573852.0,
"mean_token_accuracy": 0.9983086295425891,
"epoch": 5.240060015003751,
"step": 2620
},
{
"loss": 0.0057931594550609585,
"grad_norm": 0.12350230664014816,
"learning_rate": 9.973544513777245e-05,
"entropy": 0.007999910078433458,
"num_tokens": 16636798.0,
"mean_token_accuracy": 0.998402901738882,
"epoch": 5.260065016254064,
"step": 2630
},
{
"loss": 0.006187746301293373,
"grad_norm": 0.10715912282466888,
"learning_rate": 9.907407013331663e-05,
"entropy": 0.007076963333383901,
"num_tokens": 16702698.0,
"mean_token_accuracy": 0.9976529404520988,
"epoch": 5.280070017504376,
"step": 2640
},
{
"loss": 0.004311095550656318,
"grad_norm": 0.3015357255935669,
"learning_rate": 9.841273563203277e-05,
"entropy": 0.005494680403353413,
"num_tokens": 16765527.0,
"mean_token_accuracy": 0.9985795192420482,
"epoch": 5.300075018754689,
"step": 2650
},
{
"loss": 0.005706357955932617,
"grad_norm": 0.06844376027584076,
"learning_rate": 9.77514705628344e-05,
"entropy": 0.008315026501077228,
"num_tokens": 16828006.0,
"mean_token_accuracy": 0.9986971832811833,
"epoch": 5.320080020005001,
"step": 2660
},
{
"loss": 0.00420297309756279,
"grad_norm": 0.15605595707893372,
"learning_rate": 9.709030385159785e-05,
"entropy": 0.007199513514206046,
"num_tokens": 16891023.0,
"mean_token_accuracy": 0.9988421566784382,
"epoch": 5.340085021255314,
"step": 2670
},
{
"loss": 0.00714726448059082,
"grad_norm": 0.19374419748783112,
"learning_rate": 9.642926441989696e-05,
"entropy": 0.005838291899635806,
"num_tokens": 16956668.0,
"mean_token_accuracy": 0.9979994632303715,
"epoch": 5.360090022505626,
"step": 2680
},
{
"loss": 0.005109471827745437,
"grad_norm": 0.1971459686756134,
"learning_rate": 9.57683811837379e-05,
"entropy": 0.009764070269011427,
"num_tokens": 17020153.0,
"mean_token_accuracy": 0.9985188752412796,
"epoch": 5.380095023755939,
"step": 2690
},
{
"loss": 0.006213615462183952,
"grad_norm": 0.2851213216781616,
"learning_rate": 9.510768305229441e-05,
"entropy": 0.008533979691856075,
"num_tokens": 17084832.0,
"mean_token_accuracy": 0.9977529622614384,
"epoch": 5.400100025006251,
"step": 2700
},
{
"loss": 0.0061513490974903105,
"grad_norm": 0.10104754567146301,
"learning_rate": 9.444719892664311e-05,
"entropy": 0.007165478614842869,
"num_tokens": 17149790.0,
"mean_token_accuracy": 0.9975666105747223,
"epoch": 5.420105026256564,
"step": 2710
},
{
"loss": 0.005662607401609421,
"grad_norm": 0.09378691017627716,
"learning_rate": 9.378695769849931e-05,
"entropy": 0.007089314765835297,
"num_tokens": 17213202.0,
"mean_token_accuracy": 0.9981832534074784,
"epoch": 5.4401100275068766,
"step": 2720
},
{
"loss": 0.006653358787298202,
"grad_norm": 0.12766185402870178,
"learning_rate": 9.312698824895328e-05,
"entropy": 0.006666196065634722,
"num_tokens": 17278955.0,
"mean_token_accuracy": 0.9976298168301583,
"epoch": 5.46011502875719,
"step": 2730
},
{
"loss": 0.006521254032850266,
"grad_norm": 0.02992381900548935,
"learning_rate": 9.246731944720675e-05,
"entropy": 0.007897612718807068,
"num_tokens": 17344058.0,
"mean_token_accuracy": 0.9974993944168091,
"epoch": 5.480120030007502,
"step": 2740
},
{
"loss": 0.0059999067336320875,
"grad_norm": 0.1317594200372696,
"learning_rate": 9.180798014931006e-05,
"entropy": 0.006773643911219551,
"num_tokens": 17404192.0,
"mean_token_accuracy": 0.9978866256773472,
"epoch": 5.500125031257815,
"step": 2750
},
{
"loss": 0.00612783133983612,
"grad_norm": 0.2199675589799881,
"learning_rate": 9.11489991969001e-05,
"entropy": 0.00654012646737101,
"num_tokens": 17467965.0,
"mean_token_accuracy": 0.9980414494872093,
"epoch": 5.520130032508127,
"step": 2760
},
{
"loss": 0.007611159235239029,
"grad_norm": 0.15056708455085754,
"learning_rate": 9.049040541593854e-05,
"entropy": 0.006149375334643992,
"num_tokens": 17528827.0,
"mean_token_accuracy": 0.9979180261492729,
"epoch": 5.54013503375844,
"step": 2770
},
{
"loss": 0.007264629751443863,
"grad_norm": 0.1319355070590973,
"learning_rate": 8.98322276154509e-05,
"entropy": 0.008627775539207506,
"num_tokens": 17589448.0,
"mean_token_accuracy": 0.9976452924311161,
"epoch": 5.560140035008752,
"step": 2780
},
{
"loss": 0.003955654054880142,
"grad_norm": 0.20958350598812103,
"learning_rate": 8.917449458626636e-05,
"entropy": 0.005277934976766119,
"num_tokens": 17652540.0,
"mean_token_accuracy": 0.9986450515687466,
"epoch": 5.580145036259065,
"step": 2790
},
{
"loss": 0.004750333726406097,
"grad_norm": 0.14845848083496094,
"learning_rate": 8.85172350997584e-05,
"entropy": 0.005947213277613628,
"num_tokens": 17719311.0,
"mean_token_accuracy": 0.9983809232711792,
"epoch": 5.600150037509377,
"step": 2800
},
{
"loss": 0.006387320905923843,
"grad_norm": 0.025019152089953423,
"learning_rate": 8.786047790658619e-05,
"entropy": 0.006668693362371414,
"num_tokens": 17783740.0,
"mean_token_accuracy": 0.9980740129947663,
"epoch": 5.62015503875969,
"step": 2810
},
{
"loss": 0.003687459230422974,
"grad_norm": 0.12704399228096008,
"learning_rate": 8.720425173543694e-05,
"entropy": 0.006505226148146903,
"num_tokens": 17848561.0,
"mean_token_accuracy": 0.9982961259782315,
"epoch": 5.640160040010002,
"step": 2820
},
{
"loss": 0.004726226255297661,
"grad_norm": 0.35164615511894226,
"learning_rate": 8.654858529176926e-05,
"entropy": 0.006050794995826436,
"num_tokens": 17911026.0,
"mean_token_accuracy": 0.9985501445829869,
"epoch": 5.660165041260315,
"step": 2830
},
{
"loss": 0.007286908477544785,
"grad_norm": 0.10387425869703293,
"learning_rate": 8.589350725655745e-05,
"entropy": 0.006026100756207598,
"num_tokens": 17973473.0,
"mean_token_accuracy": 0.9979210302233696,
"epoch": 5.680170042510627,
"step": 2840
},
{
"loss": 0.0033504638820886614,
"grad_norm": 0.26233962178230286,
"learning_rate": 8.523904628503695e-05,
"entropy": 0.005752308326191269,
"num_tokens": 18037116.0,
"mean_token_accuracy": 0.9988096967339516,
"epoch": 5.70017504376094,
"step": 2850
},
{
"loss": 0.005085382983088494,
"grad_norm": 0.10810191929340363,
"learning_rate": 8.458523100545077e-05,
"entropy": 0.006968487899939646,
"num_tokens": 18102687.0,
"mean_token_accuracy": 0.99852888956666,
"epoch": 5.7201800450112525,
"step": 2860
},
{
"loss": 0.005646209418773651,
"grad_norm": 0.14457252621650696,
"learning_rate": 8.393209001779736e-05,
"entropy": 0.007342068195430329,
"num_tokens": 18165237.0,
"mean_token_accuracy": 0.9982465572655201,
"epoch": 5.740185046261566,
"step": 2870
},
{
"loss": 0.004496878013014793,
"grad_norm": 0.2686709463596344,
"learning_rate": 8.327965189257937e-05,
"entropy": 0.006458067610947182,
"num_tokens": 18224314.0,
"mean_token_accuracy": 0.9987071558833123,
"epoch": 5.760190047511878,
"step": 2880
},
{
"loss": 0.006712660938501358,
"grad_norm": 0.08530271798372269,
"learning_rate": 8.262794516955404e-05,
"entropy": 0.005851120350780547,
"num_tokens": 18289806.0,
"mean_token_accuracy": 0.9982900738716125,
"epoch": 5.780195048762191,
"step": 2890
},
{
"loss": 0.005763013660907745,
"grad_norm": 0.11492389440536499,
"learning_rate": 8.197699835648463e-05,
"entropy": 0.006107417472230736,
"num_tokens": 18353047.0,
"mean_token_accuracy": 0.99817396402359,
"epoch": 5.800200050012503,
"step": 2900
},
{
"loss": 0.0040702011436223985,
"grad_norm": 0.07547246664762497,
"learning_rate": 8.132683992789355e-05,
"entropy": 0.0047601460755686276,
"num_tokens": 18415963.0,
"mean_token_accuracy": 0.9987201415002346,
"epoch": 5.820205051262816,
"step": 2910
},
{
"loss": 0.00443207286298275,
"grad_norm": 0.1101204976439476,
"learning_rate": 8.067749832381666e-05,
"entropy": 0.005160802143291221,
"num_tokens": 18479175.0,
"mean_token_accuracy": 0.998711721599102,
"epoch": 5.840210052513128,
"step": 2920
},
{
"loss": 0.004888338595628738,
"grad_norm": 0.05996391549706459,
"learning_rate": 8.002900194855932e-05,
"entropy": 0.006708003048152023,
"num_tokens": 18541817.0,
"mean_token_accuracy": 0.9980212546885013,
"epoch": 5.860215053763441,
"step": 2930
},
{
"loss": 0.005104029551148415,
"grad_norm": 0.03507474064826965,
"learning_rate": 7.938137916945379e-05,
"entropy": 0.006489402653096476,
"num_tokens": 18604352.0,
"mean_token_accuracy": 0.9984742797911167,
"epoch": 5.880220055013753,
"step": 2940
},
{
"loss": 0.0060115944594144825,
"grad_norm": 0.09188883751630783,
"learning_rate": 7.873465831561846e-05,
"entropy": 0.008611295364971738,
"num_tokens": 18667858.0,
"mean_token_accuracy": 0.9980850018560886,
"epoch": 5.900225056264066,
"step": 2950
},
{
"loss": 0.004057048261165619,
"grad_norm": 0.1732291430234909,
"learning_rate": 7.808886767671858e-05,
"entropy": 0.004953707786262385,
"num_tokens": 18732898.0,
"mean_token_accuracy": 0.9984007500112057,
"epoch": 5.920230057514378,
"step": 2960
},
{
"loss": 0.006230469048023224,
"grad_norm": 0.1265515387058258,
"learning_rate": 7.744403550172874e-05,
"entropy": 0.005422774016551557,
"num_tokens": 18795336.0,
"mean_token_accuracy": 0.9979394488036633,
"epoch": 5.940235058764691,
"step": 2970
},
{
"loss": 0.004861463233828545,
"grad_norm": 0.005209980066865683,
"learning_rate": 7.680018999769723e-05,
"entropy": 0.00592723750633013,
"num_tokens": 18856243.0,
"mean_token_accuracy": 0.9985147505998612,
"epoch": 5.960240060015003,
"step": 2980
},
{
"loss": 0.007229304313659668,
"grad_norm": 0.30895116925239563,
"learning_rate": 7.615735932851223e-05,
"entropy": 0.006106495862695738,
"num_tokens": 18915043.0,
"mean_token_accuracy": 0.9970440402626991,
"epoch": 5.980245061265316,
"step": 2990
},
{
"loss": 0.004291977360844612,
"grad_norm": 0.042590148746967316,
"learning_rate": 7.551557161366962e-05,
"entropy": 0.0063692813067213645,
"num_tokens": 18977028.0,
"mean_token_accuracy": 0.9986839317068269,
"epoch": 6.0,
"step": 3000
},
{
"eval_loss": 0.03871263563632965,
"eval_runtime": 68.9977,
"eval_samples_per_second": 15.0,
"eval_steps_per_second": 7.507,
"eval_entropy": 0.014805409190175079,
"eval_num_tokens": 18977028.0,
"eval_mean_token_accuracy": 0.9913663707644783,
"epoch": 6.0,
"step": 3000
},
{
"train_runtime": 10605.5798,
"train_samples_per_second": 7.541,
"train_steps_per_second": 0.471,
"total_flos": 4.254846998151168e+16,
"train_loss": 0.04043002005169789,
"epoch": 6.0,
"step": 3000
},
{
"eval_loss": 0.03645886108279228,
"eval_runtime": 69.2159,
"eval_samples_per_second": 14.953,
"eval_steps_per_second": 7.484,
"eval_entropy": 0.02839457441272365,
"eval_num_tokens": 18977028.0,
"eval_mean_token_accuracy": 0.9902446437986661,
"epoch": 6.0,
"step": 3000
}
]
}