{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 5542, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00036088054853843375, "grad_norm": 3584.0, "learning_rate": 0.0, "loss": 20.713645935058594, "num_input_tokens_seen": 131072, "step": 1, "train_runtime": 53.7767, "train_tokens_per_second": 2437.338 }, { "epoch": 0.003608805485384338, "grad_norm": 2040.0, "learning_rate": 4.0540540540540545e-06, "loss": 16.10942925347222, "num_input_tokens_seen": 1310720, "step": 10, "train_runtime": 70.8433, "train_tokens_per_second": 18501.673 }, { "epoch": 0.007217610970768676, "grad_norm": 220.0, "learning_rate": 8.558558558558558e-06, "loss": 9.052794647216796, "num_input_tokens_seen": 2621440, "step": 20, "train_runtime": 89.7838, "train_tokens_per_second": 29197.249 }, { "epoch": 0.010826416456153013, "grad_norm": 20.75, "learning_rate": 1.3063063063063064e-05, "loss": 5.4977569580078125, "num_input_tokens_seen": 3932160, "step": 30, "train_runtime": 108.725, "train_tokens_per_second": 36166.091 }, { "epoch": 0.014435221941537351, "grad_norm": 13.375, "learning_rate": 1.756756756756757e-05, "loss": 4.952135848999023, "num_input_tokens_seen": 5242880, "step": 40, "train_runtime": 127.6323, "train_tokens_per_second": 41078.011 }, { "epoch": 0.01804402742692169, "grad_norm": 19.0, "learning_rate": 2.2072072072072073e-05, "loss": 4.788348388671875, "num_input_tokens_seen": 6553600, "step": 50, "train_runtime": 146.5809, "train_tokens_per_second": 44709.796 }, { "epoch": 0.021652832912306026, "grad_norm": 16.125, "learning_rate": 2.6576576576576577e-05, "loss": 4.393115997314453, "num_input_tokens_seen": 7864320, "step": 60, "train_runtime": 165.505, "train_tokens_per_second": 47517.102 }, { "epoch": 0.025261638397690366, "grad_norm": 22.875, "learning_rate": 3.108108108108108e-05, "loss": 3.7790504455566407, "num_input_tokens_seen": 9175040, "step": 70, "train_runtime": 184.4419, "train_tokens_per_second": 49744.868 }, { "epoch": 0.028870443883074703, "grad_norm": 9.3125, "learning_rate": 3.558558558558558e-05, "loss": 3.2834922790527346, "num_input_tokens_seen": 10485760, "step": 80, "train_runtime": 203.3708, "train_tokens_per_second": 51559.816 }, { "epoch": 0.03247924936845904, "grad_norm": 4.5, "learning_rate": 4.0090090090090096e-05, "loss": 3.2390235900878905, "num_input_tokens_seen": 11796480, "step": 90, "train_runtime": 222.3126, "train_tokens_per_second": 53062.568 }, { "epoch": 0.03608805485384338, "grad_norm": 3.515625, "learning_rate": 4.4594594594594596e-05, "loss": 3.119455337524414, "num_input_tokens_seen": 13107200, "step": 100, "train_runtime": 241.2122, "train_tokens_per_second": 54338.874 }, { "epoch": 0.039696860339227716, "grad_norm": 17.375, "learning_rate": 4.90990990990991e-05, "loss": 3.0860061645507812, "num_input_tokens_seen": 14417920, "step": 110, "train_runtime": 262.9315, "train_tokens_per_second": 54835.264 }, { "epoch": 0.04330566582461205, "grad_norm": 123.0, "learning_rate": 4.999973231172336e-05, "loss": 3.074770927429199, "num_input_tokens_seen": 15728640, "step": 120, "train_runtime": 281.8581, "train_tokens_per_second": 55803.404 }, { "epoch": 0.04691447130999639, "grad_norm": 9.4375, "learning_rate": 4.999864483792435e-05, "loss": 3.045380401611328, "num_input_tokens_seen": 17039360, "step": 130, "train_runtime": 300.7857, "train_tokens_per_second": 56649.496 }, { "epoch": 0.05052327679538073, "grad_norm": 5.46875, "learning_rate": 4.9996720884445644e-05, "loss": 3.0239139556884767, "num_input_tokens_seen": 18350080, "step": 140, "train_runtime": 319.7041, "train_tokens_per_second": 57397.078 }, { "epoch": 0.05413208228076507, "grad_norm": 2.34375, "learning_rate": 4.999396051566465e-05, "loss": 3.0160009384155275, "num_input_tokens_seen": 19660800, "step": 150, "train_runtime": 338.6262, "train_tokens_per_second": 58060.485 }, { "epoch": 0.057740887766149405, "grad_norm": 7.71875, "learning_rate": 4.999036382394608e-05, "loss": 2.998691368103027, "num_input_tokens_seen": 20971520, "step": 160, "train_runtime": 357.5421, "train_tokens_per_second": 58654.682 }, { "epoch": 0.06134969325153374, "grad_norm": 6.6875, "learning_rate": 4.998593092963883e-05, "loss": 2.978720474243164, "num_input_tokens_seen": 22282240, "step": 170, "train_runtime": 376.4809, "train_tokens_per_second": 59185.573 }, { "epoch": 0.06495849873691809, "grad_norm": 2.40625, "learning_rate": 4.9980661981071995e-05, "loss": 2.927627944946289, "num_input_tokens_seen": 23592960, "step": 180, "train_runtime": 395.4258, "train_tokens_per_second": 59664.691 }, { "epoch": 0.06856730422230242, "grad_norm": 3.640625, "learning_rate": 4.997455715454986e-05, "loss": 2.8903242111206056, "num_input_tokens_seen": 24903680, "step": 190, "train_runtime": 414.3547, "train_tokens_per_second": 60102.321 }, { "epoch": 0.07217610970768676, "grad_norm": 3.515625, "learning_rate": 4.9967616654346026e-05, "loss": 2.8748184204101563, "num_input_tokens_seen": 26214400, "step": 200, "train_runtime": 433.2497, "train_tokens_per_second": 60506.45 }, { "epoch": 0.0757849151930711, "grad_norm": 3.9375, "learning_rate": 4.995984071269658e-05, "loss": 2.8495594024658204, "num_input_tokens_seen": 27525120, "step": 210, "train_runtime": 454.5473, "train_tokens_per_second": 60555.019 }, { "epoch": 0.07939372067845543, "grad_norm": 2.953125, "learning_rate": 4.995122958979232e-05, "loss": 2.8382701873779297, "num_input_tokens_seen": 28835840, "step": 220, "train_runtime": 473.4338, "train_tokens_per_second": 60907.867 }, { "epoch": 0.08300252616383977, "grad_norm": 4.46875, "learning_rate": 4.994178357377003e-05, "loss": 2.7890663146972656, "num_input_tokens_seen": 30146560, "step": 230, "train_runtime": 492.3498, "train_tokens_per_second": 61229.967 }, { "epoch": 0.0866113316492241, "grad_norm": 2.640625, "learning_rate": 4.993150298070286e-05, "loss": 2.761903762817383, "num_input_tokens_seen": 31457280, "step": 240, "train_runtime": 511.2816, "train_tokens_per_second": 61526.33 }, { "epoch": 0.09022013713460844, "grad_norm": 4.03125, "learning_rate": 4.9920388154589745e-05, "loss": 2.697579574584961, "num_input_tokens_seen": 32768000, "step": 250, "train_runtime": 530.223, "train_tokens_per_second": 61800.416 }, { "epoch": 0.09382894261999278, "grad_norm": 5.78125, "learning_rate": 4.99084394673439e-05, "loss": 2.681498146057129, "num_input_tokens_seen": 34078720, "step": 260, "train_runtime": 549.1723, "train_tokens_per_second": 62054.701 }, { "epoch": 0.09743774810537711, "grad_norm": 3.984375, "learning_rate": 4.989565731878036e-05, "loss": 2.61673526763916, "num_input_tokens_seen": 35389440, "step": 270, "train_runtime": 568.1055, "train_tokens_per_second": 62293.782 }, { "epoch": 0.10104655359076146, "grad_norm": 2.421875, "learning_rate": 4.988204213660261e-05, "loss": 2.589625358581543, "num_input_tokens_seen": 36700160, "step": 280, "train_runtime": 587.0148, "train_tokens_per_second": 62519.994 }, { "epoch": 0.1046553590761458, "grad_norm": 2.921875, "learning_rate": 4.986759437638828e-05, "loss": 2.60888729095459, "num_input_tokens_seen": 38010880, "step": 290, "train_runtime": 605.9421, "train_tokens_per_second": 62730.223 }, { "epoch": 0.10826416456153014, "grad_norm": 3.453125, "learning_rate": 4.985231452157387e-05, "loss": 2.6144739151000977, "num_input_tokens_seen": 39321600, "step": 300, "train_runtime": 624.8504, "train_tokens_per_second": 62929.624 }, { "epoch": 0.11187297004691447, "grad_norm": 3.125, "learning_rate": 4.9836203083438624e-05, "loss": 2.538804817199707, "num_input_tokens_seen": 40632320, "step": 310, "train_runtime": 646.2695, "train_tokens_per_second": 62872.104 }, { "epoch": 0.11548177553229881, "grad_norm": 5.09375, "learning_rate": 4.98192606010874e-05, "loss": 2.564370346069336, "num_input_tokens_seen": 41943040, "step": 320, "train_runtime": 665.1402, "train_tokens_per_second": 63058.949 }, { "epoch": 0.11909058101768315, "grad_norm": 3.28125, "learning_rate": 4.980148764143261e-05, "loss": 2.5560630798339843, "num_input_tokens_seen": 43253760, "step": 330, "train_runtime": 684.0334, "train_tokens_per_second": 63233.407 }, { "epoch": 0.12269938650306748, "grad_norm": 2.484375, "learning_rate": 4.978288479917528e-05, "loss": 2.5639411926269533, "num_input_tokens_seen": 44564480, "step": 340, "train_runtime": 702.9146, "train_tokens_per_second": 63399.565 }, { "epoch": 0.12630819198845183, "grad_norm": 2.578125, "learning_rate": 4.9763452696785126e-05, "loss": 2.513383483886719, "num_input_tokens_seen": 45875200, "step": 350, "train_runtime": 721.7893, "train_tokens_per_second": 63557.608 }, { "epoch": 0.12991699747383617, "grad_norm": 3.703125, "learning_rate": 4.974319198447974e-05, "loss": 2.518290328979492, "num_input_tokens_seen": 47185920, "step": 360, "train_runtime": 740.6903, "train_tokens_per_second": 63705.334 }, { "epoch": 0.1335258029592205, "grad_norm": 2.65625, "learning_rate": 4.972210334020285e-05, "loss": 2.542829132080078, "num_input_tokens_seen": 48496640, "step": 370, "train_runtime": 759.5697, "train_tokens_per_second": 63847.52 }, { "epoch": 0.13713460844460484, "grad_norm": 5.90625, "learning_rate": 4.97001874696016e-05, "loss": 2.5011875152587892, "num_input_tokens_seen": 49807360, "step": 380, "train_runtime": 778.4416, "train_tokens_per_second": 63983.429 }, { "epoch": 0.14074341392998918, "grad_norm": 2.90625, "learning_rate": 4.967744510600295e-05, "loss": 2.4976362228393554, "num_input_tokens_seen": 51118080, "step": 390, "train_runtime": 797.2713, "train_tokens_per_second": 64116.289 }, { "epoch": 0.14435221941537352, "grad_norm": 3.25, "learning_rate": 4.9653877010389164e-05, "loss": 2.507686805725098, "num_input_tokens_seen": 52428800, "step": 400, "train_runtime": 816.1018, "train_tokens_per_second": 64242.967 }, { "epoch": 0.14796102490075785, "grad_norm": 2.203125, "learning_rate": 4.962948397137229e-05, "loss": 2.474226951599121, "num_input_tokens_seen": 53739520, "step": 410, "train_runtime": 836.4537, "train_tokens_per_second": 64246.857 }, { "epoch": 0.1515698303861422, "grad_norm": 3.390625, "learning_rate": 4.960426680516786e-05, "loss": 2.504658508300781, "num_input_tokens_seen": 55050240, "step": 420, "train_runtime": 855.3633, "train_tokens_per_second": 64358.895 }, { "epoch": 0.15517863587152653, "grad_norm": 3.375, "learning_rate": 4.9578226355567474e-05, "loss": 2.453939437866211, "num_input_tokens_seen": 56360960, "step": 430, "train_runtime": 874.2501, "train_tokens_per_second": 64467.776 }, { "epoch": 0.15878744135691086, "grad_norm": 3.4375, "learning_rate": 4.955136349391065e-05, "loss": 2.46431941986084, "num_input_tokens_seen": 57671680, "step": 440, "train_runtime": 893.1411, "train_tokens_per_second": 64571.744 }, { "epoch": 0.1623962468422952, "grad_norm": 5.78125, "learning_rate": 4.9523679119055635e-05, "loss": 2.451584243774414, "num_input_tokens_seen": 58982400, "step": 450, "train_runtime": 912.0215, "train_tokens_per_second": 64672.161 }, { "epoch": 0.16600505232767954, "grad_norm": 4.25, "learning_rate": 4.949517415734932e-05, "loss": 2.4436901092529295, "num_input_tokens_seen": 60293120, "step": 460, "train_runtime": 930.9065, "train_tokens_per_second": 64768.183 }, { "epoch": 0.16961385781306387, "grad_norm": 3.5, "learning_rate": 4.9465849562596245e-05, "loss": 2.4572980880737303, "num_input_tokens_seen": 61603840, "step": 470, "train_runtime": 949.7891, "train_tokens_per_second": 64860.544 }, { "epoch": 0.1732226632984482, "grad_norm": 3.234375, "learning_rate": 4.943570631602672e-05, "loss": 2.4464738845825194, "num_input_tokens_seen": 62914560, "step": 480, "train_runtime": 968.6781, "train_tokens_per_second": 64948.885 }, { "epoch": 0.17683146878383255, "grad_norm": 3.265625, "learning_rate": 4.9404745426263945e-05, "loss": 2.413909912109375, "num_input_tokens_seen": 64225280, "step": 490, "train_runtime": 987.5714, "train_tokens_per_second": 65033.559 }, { "epoch": 0.18044027426921688, "grad_norm": 4.4375, "learning_rate": 4.937296792929027e-05, "loss": 2.425960350036621, "num_input_tokens_seen": 65536000, "step": 500, "train_runtime": 1006.4538, "train_tokens_per_second": 65115.753 }, { "epoch": 0.18404907975460122, "grad_norm": 2.6875, "learning_rate": 4.934037488841257e-05, "loss": 2.4214879989624025, "num_input_tokens_seen": 66846720, "step": 510, "train_runtime": 1030.6607, "train_tokens_per_second": 64858.126 }, { "epoch": 0.18765788523998556, "grad_norm": 3.53125, "learning_rate": 4.9306967394226613e-05, "loss": 2.4362627029418946, "num_input_tokens_seen": 68157440, "step": 520, "train_runtime": 1049.5437, "train_tokens_per_second": 64940.069 }, { "epoch": 0.1912666907253699, "grad_norm": 5.15625, "learning_rate": 4.927274656458059e-05, "loss": 2.4367109298706056, "num_input_tokens_seen": 69468160, "step": 530, "train_runtime": 1068.4149, "train_tokens_per_second": 65019.837 }, { "epoch": 0.19487549621075423, "grad_norm": 3.671875, "learning_rate": 4.923771354453771e-05, "loss": 2.375163459777832, "num_input_tokens_seen": 70778880, "step": 540, "train_runtime": 1087.2978, "train_tokens_per_second": 65096.13 }, { "epoch": 0.19848430169613857, "grad_norm": 4.3125, "learning_rate": 4.920186950633791e-05, "loss": 2.4392827987670898, "num_input_tokens_seen": 72089600, "step": 550, "train_runtime": 1106.1535, "train_tokens_per_second": 65171.423 }, { "epoch": 0.20209310718152293, "grad_norm": 3.34375, "learning_rate": 4.9165215649358574e-05, "loss": 2.420306396484375, "num_input_tokens_seen": 73400320, "step": 560, "train_runtime": 1125.0201, "train_tokens_per_second": 65243.561 }, { "epoch": 0.20570191266690727, "grad_norm": 5.0, "learning_rate": 4.912775320007445e-05, "loss": 2.3969913482666017, "num_input_tokens_seen": 74711040, "step": 570, "train_runtime": 1143.88, "train_tokens_per_second": 65313.706 }, { "epoch": 0.2093107181522916, "grad_norm": 4.34375, "learning_rate": 4.90894834120166e-05, "loss": 2.3971323013305663, "num_input_tokens_seen": 76021760, "step": 580, "train_runtime": 1162.7459, "train_tokens_per_second": 65381.231 }, { "epoch": 0.21291952363767594, "grad_norm": 3.984375, "learning_rate": 4.905040756573042e-05, "loss": 2.4156164169311523, "num_input_tokens_seen": 77332480, "step": 590, "train_runtime": 1181.6028, "train_tokens_per_second": 65447.101 }, { "epoch": 0.21652832912306028, "grad_norm": 4.125, "learning_rate": 4.901052696873286e-05, "loss": 2.38603515625, "num_input_tokens_seen": 78643200, "step": 600, "train_runtime": 1200.4661, "train_tokens_per_second": 65510.556 }, { "epoch": 0.2201371346084446, "grad_norm": 5.125, "learning_rate": 4.8969842955468596e-05, "loss": 2.3919803619384767, "num_input_tokens_seen": 79953920, "step": 610, "train_runtime": 1222.526, "train_tokens_per_second": 65400.59 }, { "epoch": 0.22374594009382895, "grad_norm": 2.65625, "learning_rate": 4.892835688726546e-05, "loss": 2.4279273986816405, "num_input_tokens_seen": 81264640, "step": 620, "train_runtime": 1241.4138, "train_tokens_per_second": 65461.362 }, { "epoch": 0.22735474557921329, "grad_norm": 3.984375, "learning_rate": 4.88860701522888e-05, "loss": 2.3708824157714843, "num_input_tokens_seen": 82575360, "step": 630, "train_runtime": 1260.2633, "train_tokens_per_second": 65522.307 }, { "epoch": 0.23096355106459762, "grad_norm": 2.71875, "learning_rate": 4.884298416549512e-05, "loss": 2.399201583862305, "num_input_tokens_seen": 83886080, "step": 640, "train_runtime": 1279.1242, "train_tokens_per_second": 65580.87 }, { "epoch": 0.23457235654998196, "grad_norm": 2.921875, "learning_rate": 4.879910036858464e-05, "loss": 2.3736968994140626, "num_input_tokens_seen": 85196800, "step": 650, "train_runtime": 1297.9757, "train_tokens_per_second": 65638.211 }, { "epoch": 0.2381811620353663, "grad_norm": 3.25, "learning_rate": 4.875442022995315e-05, "loss": 2.3272987365722657, "num_input_tokens_seen": 86507520, "step": 660, "train_runtime": 1316.835, "train_tokens_per_second": 65693.518 }, { "epoch": 0.24178996752075063, "grad_norm": 3.25, "learning_rate": 4.8708945244642814e-05, "loss": 2.366088104248047, "num_input_tokens_seen": 87818240, "step": 670, "train_runtime": 1335.7017, "train_tokens_per_second": 65746.897 }, { "epoch": 0.24539877300613497, "grad_norm": 4.4375, "learning_rate": 4.8662676934292145e-05, "loss": 2.3694658279418945, "num_input_tokens_seen": 89128960, "step": 680, "train_runtime": 1354.5738, "train_tokens_per_second": 65798.526 }, { "epoch": 0.2490075784915193, "grad_norm": 4.875, "learning_rate": 4.861561684708513e-05, "loss": 2.370319938659668, "num_input_tokens_seen": 90439680, "step": 690, "train_runtime": 1373.4498, "train_tokens_per_second": 65848.55 }, { "epoch": 0.25261638397690367, "grad_norm": 4.09375, "learning_rate": 4.85677665576994e-05, "loss": 2.353267860412598, "num_input_tokens_seen": 91750400, "step": 700, "train_runtime": 1392.3268, "train_tokens_per_second": 65897.171 }, { "epoch": 0.256225189462288, "grad_norm": 2.921875, "learning_rate": 4.851912766725354e-05, "loss": 2.3250946044921874, "num_input_tokens_seen": 93061120, "step": 710, "train_runtime": 1413.3943, "train_tokens_per_second": 65842.29 }, { "epoch": 0.25983399494767234, "grad_norm": 3.265625, "learning_rate": 4.8469701803253484e-05, "loss": 2.3694339752197267, "num_input_tokens_seen": 94371840, "step": 720, "train_runtime": 1432.2376, "train_tokens_per_second": 65891.188 }, { "epoch": 0.2634428004330567, "grad_norm": 5.28125, "learning_rate": 4.8419490619538145e-05, "loss": 2.356003189086914, "num_input_tokens_seen": 95682560, "step": 730, "train_runtime": 1451.105, "train_tokens_per_second": 65937.723 }, { "epoch": 0.267051605918441, "grad_norm": 3.046875, "learning_rate": 4.8368495796223977e-05, "loss": 2.354664993286133, "num_input_tokens_seen": 96993280, "step": 740, "train_runtime": 1469.9628, "train_tokens_per_second": 65983.495 }, { "epoch": 0.27066041140382535, "grad_norm": 3.75, "learning_rate": 4.8316719039648816e-05, "loss": 2.372145652770996, "num_input_tokens_seen": 98304000, "step": 750, "train_runtime": 1488.8219, "train_tokens_per_second": 66028.046 }, { "epoch": 0.2742692168892097, "grad_norm": 3.40625, "learning_rate": 4.826416208231477e-05, "loss": 2.388836669921875, "num_input_tokens_seen": 99614720, "step": 760, "train_runtime": 1507.6902, "train_tokens_per_second": 66071.082 }, { "epoch": 0.277878022374594, "grad_norm": 2.96875, "learning_rate": 4.821082668283023e-05, "loss": 2.347779083251953, "num_input_tokens_seen": 100925440, "step": 770, "train_runtime": 1526.5377, "train_tokens_per_second": 66113.951 }, { "epoch": 0.28148682785997836, "grad_norm": 3.4375, "learning_rate": 4.815671462585106e-05, "loss": 2.340774154663086, "num_input_tokens_seen": 102236160, "step": 780, "train_runtime": 1545.3818, "train_tokens_per_second": 66155.925 }, { "epoch": 0.2850956333453627, "grad_norm": 3.46875, "learning_rate": 4.810182772202085e-05, "loss": 2.335291862487793, "num_input_tokens_seen": 103546880, "step": 790, "train_runtime": 1564.2273, "train_tokens_per_second": 66196.825 }, { "epoch": 0.28870443883074703, "grad_norm": 3.609375, "learning_rate": 4.8046167807910336e-05, "loss": 2.34542293548584, "num_input_tokens_seen": 104857600, "step": 800, "train_runtime": 1583.1024, "train_tokens_per_second": 66235.515 }, { "epoch": 0.29231324431613137, "grad_norm": 3.140625, "learning_rate": 4.798973674595597e-05, "loss": 2.357075881958008, "num_input_tokens_seen": 106168320, "step": 810, "train_runtime": 1604.6829, "train_tokens_per_second": 66161.559 }, { "epoch": 0.2959220498015157, "grad_norm": 3.59375, "learning_rate": 4.793253642439757e-05, "loss": 2.3224910736083983, "num_input_tokens_seen": 107479040, "step": 820, "train_runtime": 1623.514, "train_tokens_per_second": 66201.488 }, { "epoch": 0.29953085528690004, "grad_norm": 3.25, "learning_rate": 4.7874568757215156e-05, "loss": 2.3438846588134767, "num_input_tokens_seen": 108789760, "step": 830, "train_runtime": 1642.3671, "train_tokens_per_second": 66239.614 }, { "epoch": 0.3031396607722844, "grad_norm": 3.21875, "learning_rate": 4.781583568406488e-05, "loss": 2.357133674621582, "num_input_tokens_seen": 110100480, "step": 840, "train_runtime": 1661.2058, "train_tokens_per_second": 66277.448 }, { "epoch": 0.3067484662576687, "grad_norm": 3.46875, "learning_rate": 4.775633917021417e-05, "loss": 2.3187433242797852, "num_input_tokens_seen": 111411200, "step": 850, "train_runtime": 1680.0526, "train_tokens_per_second": 66314.114 }, { "epoch": 0.31035727174305305, "grad_norm": 2.5625, "learning_rate": 4.769608120647595e-05, "loss": 2.3682619094848634, "num_input_tokens_seen": 112721920, "step": 860, "train_runtime": 1698.8993, "train_tokens_per_second": 66349.972 }, { "epoch": 0.3139660772284374, "grad_norm": 3.8125, "learning_rate": 4.763506380914199e-05, "loss": 2.319541168212891, "num_input_tokens_seen": 114032640, "step": 870, "train_runtime": 1717.748, "train_tokens_per_second": 66384.963 }, { "epoch": 0.3175748827138217, "grad_norm": 4.46875, "learning_rate": 4.7573289019915477e-05, "loss": 2.335500717163086, "num_input_tokens_seen": 115343360, "step": 880, "train_runtime": 1736.5953, "train_tokens_per_second": 66419.253 }, { "epoch": 0.32118368819920606, "grad_norm": 3.0, "learning_rate": 4.75107589058427e-05, "loss": 2.282669448852539, "num_input_tokens_seen": 116654080, "step": 890, "train_runtime": 1755.439, "train_tokens_per_second": 66452.938 }, { "epoch": 0.3247924936845904, "grad_norm": 4.09375, "learning_rate": 4.744747555924387e-05, "loss": 2.335264778137207, "num_input_tokens_seen": 117964800, "step": 900, "train_runtime": 1774.2872, "train_tokens_per_second": 66485.743 }, { "epoch": 0.32840129916997474, "grad_norm": 3.078125, "learning_rate": 4.7383441097643115e-05, "loss": 2.3090591430664062, "num_input_tokens_seen": 119275520, "step": 910, "train_runtime": 1795.3767, "train_tokens_per_second": 66434.815 }, { "epoch": 0.3320101046553591, "grad_norm": 3.75, "learning_rate": 4.7318657663697606e-05, "loss": 2.3304624557495117, "num_input_tokens_seen": 120586240, "step": 920, "train_runtime": 1814.2347, "train_tokens_per_second": 66466.727 }, { "epoch": 0.3356189101407434, "grad_norm": 3.484375, "learning_rate": 4.725312742512591e-05, "loss": 2.3250059127807616, "num_input_tokens_seen": 121896960, "step": 930, "train_runtime": 1833.0853, "train_tokens_per_second": 66498.246 }, { "epoch": 0.33922771562612775, "grad_norm": 2.828125, "learning_rate": 4.7186852574635374e-05, "loss": 2.333821105957031, "num_input_tokens_seen": 123207680, "step": 940, "train_runtime": 1851.9408, "train_tokens_per_second": 66528.95 }, { "epoch": 0.3428365211115121, "grad_norm": 3.3125, "learning_rate": 4.711983532984887e-05, "loss": 2.338519477844238, "num_input_tokens_seen": 124518400, "step": 950, "train_runtime": 1870.7786, "train_tokens_per_second": 66559.666 }, { "epoch": 0.3464453265968964, "grad_norm": 5.09375, "learning_rate": 4.705207793323047e-05, "loss": 2.3416236877441405, "num_input_tokens_seen": 125829120, "step": 960, "train_runtime": 1889.6299, "train_tokens_per_second": 66589.295 }, { "epoch": 0.35005413208228076, "grad_norm": 2.796875, "learning_rate": 4.6983582652010495e-05, "loss": 2.3152448654174806, "num_input_tokens_seen": 127139840, "step": 970, "train_runtime": 1908.4704, "train_tokens_per_second": 66618.712 }, { "epoch": 0.3536629375676651, "grad_norm": 2.625, "learning_rate": 4.6914351778109624e-05, "loss": 2.3523880004882813, "num_input_tokens_seen": 128450560, "step": 980, "train_runtime": 1927.2914, "train_tokens_per_second": 66648.23 }, { "epoch": 0.35727174305304943, "grad_norm": 3.0625, "learning_rate": 4.6844387628062184e-05, "loss": 2.3372316360473633, "num_input_tokens_seen": 129761280, "step": 990, "train_runtime": 1946.1498, "train_tokens_per_second": 66675.894 }, { "epoch": 0.36088054853843377, "grad_norm": 3.84375, "learning_rate": 4.6773692542938674e-05, "loss": 2.354751777648926, "num_input_tokens_seen": 131072000, "step": 1000, "train_runtime": 1964.9866, "train_tokens_per_second": 66703.762 }, { "epoch": 0.3644893540238181, "grad_norm": 2.578125, "learning_rate": 4.670226888826742e-05, "loss": 2.3818334579467773, "num_input_tokens_seen": 132382720, "step": 1010, "train_runtime": 1987.7787, "train_tokens_per_second": 66598.32 }, { "epoch": 0.36809815950920244, "grad_norm": 2.171875, "learning_rate": 4.663011905395538e-05, "loss": 2.3537199020385744, "num_input_tokens_seen": 133693440, "step": 1020, "train_runtime": 2006.614, "train_tokens_per_second": 66626.388 }, { "epoch": 0.3717069649945868, "grad_norm": 2.25, "learning_rate": 4.655724545420826e-05, "loss": 2.310554313659668, "num_input_tokens_seen": 135004160, "step": 1030, "train_runtime": 2025.4588, "train_tokens_per_second": 66653.621 }, { "epoch": 0.3753157704799711, "grad_norm": 4.21875, "learning_rate": 4.648365052744962e-05, "loss": 2.2933753967285155, "num_input_tokens_seen": 136314880, "step": 1040, "train_runtime": 2044.3059, "train_tokens_per_second": 66680.276 }, { "epoch": 0.37892457596535545, "grad_norm": 3.0625, "learning_rate": 4.640933673623939e-05, "loss": 2.312954902648926, "num_input_tokens_seen": 137625600, "step": 1050, "train_runtime": 2063.1496, "train_tokens_per_second": 66706.553 }, { "epoch": 0.3825333814507398, "grad_norm": 4.28125, "learning_rate": 4.633430656719143e-05, "loss": 2.3173431396484374, "num_input_tokens_seen": 138936320, "step": 1060, "train_runtime": 2081.9779, "train_tokens_per_second": 66732.85 }, { "epoch": 0.3861421869361241, "grad_norm": 2.984375, "learning_rate": 4.625856253089028e-05, "loss": 2.2680578231811523, "num_input_tokens_seen": 140247040, "step": 1070, "train_runtime": 2100.8155, "train_tokens_per_second": 66758.379 }, { "epoch": 0.38975099242150846, "grad_norm": 3.1875, "learning_rate": 4.618210716180722e-05, "loss": 2.310435104370117, "num_input_tokens_seen": 141557760, "step": 1080, "train_runtime": 2119.6597, "train_tokens_per_second": 66783.249 }, { "epoch": 0.3933597979068928, "grad_norm": 3.21875, "learning_rate": 4.610494301821543e-05, "loss": 2.3136465072631838, "num_input_tokens_seen": 142868480, "step": 1090, "train_runtime": 2138.482, "train_tokens_per_second": 66808.362 }, { "epoch": 0.39696860339227713, "grad_norm": 3.265625, "learning_rate": 4.60270726821044e-05, "loss": 2.3062191009521484, "num_input_tokens_seen": 144179200, "step": 1100, "train_runtime": 2157.298, "train_tokens_per_second": 66833.233 }, { "epoch": 0.40057740887766147, "grad_norm": 3.46875, "learning_rate": 4.594849875909351e-05, "loss": 2.311140251159668, "num_input_tokens_seen": 145489920, "step": 1110, "train_runtime": 2178.7661, "train_tokens_per_second": 66776.292 }, { "epoch": 0.40418621436304586, "grad_norm": 2.96875, "learning_rate": 4.586922387834489e-05, "loss": 2.275248336791992, "num_input_tokens_seen": 146800640, "step": 1120, "train_runtime": 2197.586, "train_tokens_per_second": 66800.864 }, { "epoch": 0.4077950198484302, "grad_norm": 2.59375, "learning_rate": 4.5789250692475396e-05, "loss": 2.3349634170532227, "num_input_tokens_seen": 148111360, "step": 1130, "train_runtime": 2216.4069, "train_tokens_per_second": 66824.986 }, { "epoch": 0.41140382533381453, "grad_norm": 3.046875, "learning_rate": 4.5708581877467884e-05, "loss": 2.297293853759766, "num_input_tokens_seen": 149422080, "step": 1140, "train_runtime": 2235.2207, "train_tokens_per_second": 66848.914 }, { "epoch": 0.41501263081919887, "grad_norm": 3.515625, "learning_rate": 4.5627220132581646e-05, "loss": 2.3298309326171873, "num_input_tokens_seen": 150732800, "step": 1150, "train_runtime": 2254.0417, "train_tokens_per_second": 66872.231 }, { "epoch": 0.4186214363045832, "grad_norm": 2.515625, "learning_rate": 4.554516818026212e-05, "loss": 2.3104930877685548, "num_input_tokens_seen": 152043520, "step": 1160, "train_runtime": 2272.8631, "train_tokens_per_second": 66895.152 }, { "epoch": 0.42223024178996754, "grad_norm": 2.765625, "learning_rate": 4.546242876604976e-05, "loss": 2.2972536087036133, "num_input_tokens_seen": 153354240, "step": 1170, "train_runtime": 2291.6783, "train_tokens_per_second": 66917.875 }, { "epoch": 0.4258390472753519, "grad_norm": 2.78125, "learning_rate": 4.5379004658488175e-05, "loss": 2.274612617492676, "num_input_tokens_seen": 154664960, "step": 1180, "train_runtime": 2310.5193, "train_tokens_per_second": 66939.481 }, { "epoch": 0.4294478527607362, "grad_norm": 2.125, "learning_rate": 4.5294898649031515e-05, "loss": 2.28421630859375, "num_input_tokens_seen": 155975680, "step": 1190, "train_runtime": 2329.3618, "train_tokens_per_second": 66960.694 }, { "epoch": 0.43305665824612055, "grad_norm": 3.171875, "learning_rate": 4.521011355195106e-05, "loss": 2.290935516357422, "num_input_tokens_seen": 157286400, "step": 1200, "train_runtime": 2348.186, "train_tokens_per_second": 66982.087 }, { "epoch": 0.4366654637315049, "grad_norm": 2.78125, "learning_rate": 4.5124652204241016e-05, "loss": 2.308019828796387, "num_input_tokens_seen": 158597120, "step": 1210, "train_runtime": 2369.5346, "train_tokens_per_second": 66931.759 }, { "epoch": 0.4402742692168892, "grad_norm": 2.5, "learning_rate": 4.503851746552362e-05, "loss": 2.3127092361450194, "num_input_tokens_seen": 159907840, "step": 1220, "train_runtime": 2388.3658, "train_tokens_per_second": 66952.827 }, { "epoch": 0.44388307470227356, "grad_norm": 3.0625, "learning_rate": 4.4951712217953454e-05, "loss": 2.3049333572387694, "num_input_tokens_seen": 161218560, "step": 1230, "train_runtime": 2407.1991, "train_tokens_per_second": 66973.506 }, { "epoch": 0.4474918801876579, "grad_norm": 3.484375, "learning_rate": 4.486423936612101e-05, "loss": 2.2997787475585936, "num_input_tokens_seen": 162529280, "step": 1240, "train_runtime": 2426.0318, "train_tokens_per_second": 66993.878 }, { "epoch": 0.45110068567304223, "grad_norm": 3.875, "learning_rate": 4.477610183695543e-05, "loss": 2.3207189559936525, "num_input_tokens_seen": 163840000, "step": 1250, "train_runtime": 2444.8663, "train_tokens_per_second": 67013.89 }, { "epoch": 0.45470949115842657, "grad_norm": 2.71875, "learning_rate": 4.4687302579626706e-05, "loss": 2.2699203491210938, "num_input_tokens_seen": 165150720, "step": 1260, "train_runtime": 2463.704, "train_tokens_per_second": 67033.508 }, { "epoch": 0.4583182966438109, "grad_norm": 3.703125, "learning_rate": 4.459784456544685e-05, "loss": 2.281772994995117, "num_input_tokens_seen": 166461440, "step": 1270, "train_runtime": 2482.5216, "train_tokens_per_second": 67053.37 }, { "epoch": 0.46192710212919524, "grad_norm": 2.65625, "learning_rate": 4.4507730787770575e-05, "loss": 2.280086898803711, "num_input_tokens_seen": 167772160, "step": 1280, "train_runtime": 2501.3419, "train_tokens_per_second": 67072.862 }, { "epoch": 0.4655359076145796, "grad_norm": 2.296875, "learning_rate": 4.441696426189508e-05, "loss": 2.304541015625, "num_input_tokens_seen": 169082880, "step": 1290, "train_runtime": 2520.1698, "train_tokens_per_second": 67091.859 }, { "epoch": 0.4691447130999639, "grad_norm": 1.9375, "learning_rate": 4.432554802495917e-05, "loss": 2.3161603927612306, "num_input_tokens_seen": 170393600, "step": 1300, "train_runtime": 2538.9965, "train_tokens_per_second": 67110.609 }, { "epoch": 0.47275351858534825, "grad_norm": 2.4375, "learning_rate": 4.423348513584166e-05, "loss": 2.3051275253295898, "num_input_tokens_seen": 171704320, "step": 1310, "train_runtime": 2560.6455, "train_tokens_per_second": 67055.093 }, { "epoch": 0.4763623240707326, "grad_norm": 3.046875, "learning_rate": 4.414077867505895e-05, "loss": 2.2651365280151365, "num_input_tokens_seen": 173015040, "step": 1320, "train_runtime": 2579.4505, "train_tokens_per_second": 67074.378 }, { "epoch": 0.4799711295561169, "grad_norm": 2.671875, "learning_rate": 4.4047431744662035e-05, "loss": 2.270708465576172, "num_input_tokens_seen": 174325760, "step": 1330, "train_runtime": 2598.2436, "train_tokens_per_second": 67093.694 }, { "epoch": 0.48357993504150126, "grad_norm": 2.296875, "learning_rate": 4.395344746813263e-05, "loss": 2.3111730575561524, "num_input_tokens_seen": 175636480, "step": 1340, "train_runtime": 2617.0378, "train_tokens_per_second": 67112.704 }, { "epoch": 0.4871887405268856, "grad_norm": 2.96875, "learning_rate": 4.3858828990278725e-05, "loss": 2.2733327865600588, "num_input_tokens_seen": 176947200, "step": 1350, "train_runtime": 2635.8228, "train_tokens_per_second": 67131.675 }, { "epoch": 0.49079754601226994, "grad_norm": 3.390625, "learning_rate": 4.376357947712929e-05, "loss": 2.228657531738281, "num_input_tokens_seen": 178257920, "step": 1360, "train_runtime": 2654.6177, "train_tokens_per_second": 67150.129 }, { "epoch": 0.4944063514976543, "grad_norm": 2.828125, "learning_rate": 4.366770211582837e-05, "loss": 2.281584358215332, "num_input_tokens_seen": 179568640, "step": 1370, "train_runtime": 2673.4148, "train_tokens_per_second": 67168.267 }, { "epoch": 0.4980151569830386, "grad_norm": 2.8125, "learning_rate": 4.357120011452846e-05, "loss": 2.324570083618164, "num_input_tokens_seen": 180879360, "step": 1380, "train_runtime": 2692.2055, "train_tokens_per_second": 67186.312 }, { "epoch": 0.501623962468423, "grad_norm": 2.578125, "learning_rate": 4.347407670228312e-05, "loss": 2.3087745666503907, "num_input_tokens_seen": 182190080, "step": 1390, "train_runtime": 2710.9858, "train_tokens_per_second": 67204.366 }, { "epoch": 0.5052327679538073, "grad_norm": 2.578125, "learning_rate": 4.337633512893893e-05, "loss": 2.241712760925293, "num_input_tokens_seen": 183500800, "step": 1400, "train_runtime": 2729.7708, "train_tokens_per_second": 67222.053 }, { "epoch": 0.5088415734391917, "grad_norm": 3.546875, "learning_rate": 4.3277978665026785e-05, "loss": 2.327380561828613, "num_input_tokens_seen": 184811520, "step": 1410, "train_runtime": 2751.2471, "train_tokens_per_second": 67173.727 }, { "epoch": 0.512450378924576, "grad_norm": 2.796875, "learning_rate": 4.3179010601652424e-05, "loss": 2.29742431640625, "num_input_tokens_seen": 186122240, "step": 1420, "train_runtime": 2770.0302, "train_tokens_per_second": 67191.412 }, { "epoch": 0.5160591844099603, "grad_norm": 3.5, "learning_rate": 4.30794342503863e-05, "loss": 2.2658599853515624, "num_input_tokens_seen": 187432960, "step": 1430, "train_runtime": 2788.8469, "train_tokens_per_second": 67208.05 }, { "epoch": 0.5196679898953447, "grad_norm": 2.796875, "learning_rate": 4.2979252943152815e-05, "loss": 2.249949073791504, "num_input_tokens_seen": 188743680, "step": 1440, "train_runtime": 2807.6459, "train_tokens_per_second": 67224.887 }, { "epoch": 0.523276795380729, "grad_norm": 2.4375, "learning_rate": 4.287847003211878e-05, "loss": 2.2962003707885743, "num_input_tokens_seen": 190054400, "step": 1450, "train_runtime": 2826.4466, "train_tokens_per_second": 67241.462 }, { "epoch": 0.5268856008661134, "grad_norm": 2.375, "learning_rate": 4.27770888895813e-05, "loss": 2.2966489791870117, "num_input_tokens_seen": 191365120, "step": 1460, "train_runtime": 2845.2424, "train_tokens_per_second": 67257.931 }, { "epoch": 0.5304944063514977, "grad_norm": 1.9453125, "learning_rate": 4.267511290785485e-05, "loss": 2.2982467651367187, "num_input_tokens_seen": 192675840, "step": 1470, "train_runtime": 2864.0538, "train_tokens_per_second": 67273.82 }, { "epoch": 0.534103211836882, "grad_norm": 2.640625, "learning_rate": 4.257254549915789e-05, "loss": 2.310243606567383, "num_input_tokens_seen": 193986560, "step": 1480, "train_runtime": 2882.8542, "train_tokens_per_second": 67289.757 }, { "epoch": 0.5377120173222664, "grad_norm": 2.453125, "learning_rate": 4.246939009549856e-05, "loss": 2.3411497116088866, "num_input_tokens_seen": 195297280, "step": 1490, "train_runtime": 2901.6511, "train_tokens_per_second": 67305.569 }, { "epoch": 0.5413208228076507, "grad_norm": 2.859375, "learning_rate": 4.2365650148559946e-05, "loss": 2.2888193130493164, "num_input_tokens_seen": 196608000, "step": 1500, "train_runtime": 2920.4506, "train_tokens_per_second": 67321.118 }, { "epoch": 0.544929628293035, "grad_norm": 2.625, "learning_rate": 4.2261329129584495e-05, "loss": 2.278774452209473, "num_input_tokens_seen": 197918720, "step": 1510, "train_runtime": 2944.0498, "train_tokens_per_second": 67226.689 }, { "epoch": 0.5485384337784194, "grad_norm": 2.359375, "learning_rate": 4.215643052925795e-05, "loss": 2.2698015213012694, "num_input_tokens_seen": 199229440, "step": 1520, "train_runtime": 2962.8554, "train_tokens_per_second": 67242.376 }, { "epoch": 0.5521472392638037, "grad_norm": 2.65625, "learning_rate": 4.2050957857592456e-05, "loss": 2.319766044616699, "num_input_tokens_seen": 200540160, "step": 1530, "train_runtime": 2981.6581, "train_tokens_per_second": 67257.934 }, { "epoch": 0.555756044749188, "grad_norm": 3.484375, "learning_rate": 4.194491464380919e-05, "loss": 2.2656042098999025, "num_input_tokens_seen": 201850880, "step": 1540, "train_runtime": 3000.4623, "train_tokens_per_second": 67273.26 }, { "epoch": 0.5593648502345724, "grad_norm": 2.75, "learning_rate": 4.1838304436220246e-05, "loss": 2.31202392578125, "num_input_tokens_seen": 203161600, "step": 1550, "train_runtime": 3019.2523, "train_tokens_per_second": 67288.712 }, { "epoch": 0.5629736557199567, "grad_norm": 2.953125, "learning_rate": 4.1731130802109863e-05, "loss": 2.211695098876953, "num_input_tokens_seen": 204472320, "step": 1560, "train_runtime": 3038.0539, "train_tokens_per_second": 67303.718 }, { "epoch": 0.5665824612053411, "grad_norm": 2.5625, "learning_rate": 4.162339732761514e-05, "loss": 2.27321720123291, "num_input_tokens_seen": 205783040, "step": 1570, "train_runtime": 3056.8504, "train_tokens_per_second": 67318.65 }, { "epoch": 0.5701912666907254, "grad_norm": 2.71875, "learning_rate": 4.151510761760597e-05, "loss": 2.234796142578125, "num_input_tokens_seen": 207093760, "step": 1580, "train_runtime": 3075.6457, "train_tokens_per_second": 67333.424 }, { "epoch": 0.5738000721761097, "grad_norm": 3.15625, "learning_rate": 4.140626529556444e-05, "loss": 2.2829927444458007, "num_input_tokens_seen": 208404480, "step": 1590, "train_runtime": 3094.4579, "train_tokens_per_second": 67347.654 }, { "epoch": 0.5774088776614941, "grad_norm": 2.59375, "learning_rate": 4.12968740034636e-05, "loss": 2.2796735763549805, "num_input_tokens_seen": 209715200, "step": 1600, "train_runtime": 3113.2505, "train_tokens_per_second": 67362.135 }, { "epoch": 0.5810176831468784, "grad_norm": 2.578125, "learning_rate": 4.118693740164558e-05, "loss": 2.2237993240356446, "num_input_tokens_seen": 211025920, "step": 1610, "train_runtime": 3135.5028, "train_tokens_per_second": 67302.099 }, { "epoch": 0.5846264886322627, "grad_norm": 1.953125, "learning_rate": 4.107645916869913e-05, "loss": 2.297933578491211, "num_input_tokens_seen": 212336640, "step": 1620, "train_runtime": 3154.2925, "train_tokens_per_second": 67316.725 }, { "epoch": 0.5882352941176471, "grad_norm": 2.625, "learning_rate": 4.09654430013365e-05, "loss": 2.2486343383789062, "num_input_tokens_seen": 213647360, "step": 1630, "train_runtime": 3173.0663, "train_tokens_per_second": 67331.515 }, { "epoch": 0.5918440996030314, "grad_norm": 2.9375, "learning_rate": 4.085389261426979e-05, "loss": 2.2843048095703127, "num_input_tokens_seen": 214958080, "step": 1640, "train_runtime": 3191.834, "train_tokens_per_second": 67346.258 }, { "epoch": 0.5954529050884158, "grad_norm": 3.15625, "learning_rate": 4.07418117400866e-05, "loss": 2.2387674331665037, "num_input_tokens_seen": 216268800, "step": 1650, "train_runtime": 3210.6231, "train_tokens_per_second": 67360.383 }, { "epoch": 0.5990617105738001, "grad_norm": 2.125, "learning_rate": 4.062920412912517e-05, "loss": 2.281134033203125, "num_input_tokens_seen": 217579520, "step": 1660, "train_runtime": 3229.3938, "train_tokens_per_second": 67374.726 }, { "epoch": 0.6026705160591844, "grad_norm": 2.359375, "learning_rate": 4.05160735493489e-05, "loss": 2.233013725280762, "num_input_tokens_seen": 218890240, "step": 1670, "train_runtime": 3248.1617, "train_tokens_per_second": 67388.961 }, { "epoch": 0.6062793215445688, "grad_norm": 3.328125, "learning_rate": 4.040242378622021e-05, "loss": 2.2088239669799803, "num_input_tokens_seen": 220200960, "step": 1680, "train_runtime": 3266.937, "train_tokens_per_second": 67402.879 }, { "epoch": 0.6098881270299531, "grad_norm": 2.390625, "learning_rate": 4.0288258642573956e-05, "loss": 2.2553569793701174, "num_input_tokens_seen": 221511680, "step": 1690, "train_runtime": 3285.7066, "train_tokens_per_second": 67416.756 }, { "epoch": 0.6134969325153374, "grad_norm": 2.46875, "learning_rate": 4.017358193849011e-05, "loss": 2.280741500854492, "num_input_tokens_seen": 222822400, "step": 1700, "train_runtime": 3304.4697, "train_tokens_per_second": 67430.608 }, { "epoch": 0.6171057380007218, "grad_norm": 2.421875, "learning_rate": 4.005839751116599e-05, "loss": 2.289920425415039, "num_input_tokens_seen": 224133120, "step": 1710, "train_runtime": 3325.6911, "train_tokens_per_second": 67394.45 }, { "epoch": 0.6207145434861061, "grad_norm": 2.609375, "learning_rate": 3.994270921478783e-05, "loss": 2.268573760986328, "num_input_tokens_seen": 225443840, "step": 1720, "train_runtime": 3344.471, "train_tokens_per_second": 67407.922 }, { "epoch": 0.6243233489714904, "grad_norm": 2.75, "learning_rate": 3.982652092040182e-05, "loss": 2.285994529724121, "num_input_tokens_seen": 226754560, "step": 1730, "train_runtime": 3363.2536, "train_tokens_per_second": 67421.191 }, { "epoch": 0.6279321544568748, "grad_norm": 2.09375, "learning_rate": 3.97098365157846e-05, "loss": 2.289227294921875, "num_input_tokens_seen": 228065280, "step": 1740, "train_runtime": 3382.0456, "train_tokens_per_second": 67434.123 }, { "epoch": 0.6315409599422591, "grad_norm": 2.703125, "learning_rate": 3.959265990531317e-05, "loss": 2.2562992095947267, "num_input_tokens_seen": 229376000, "step": 1750, "train_runtime": 3400.853, "train_tokens_per_second": 67446.609 }, { "epoch": 0.6351497654276435, "grad_norm": 2.265625, "learning_rate": 3.947499500983417e-05, "loss": 2.248988151550293, "num_input_tokens_seen": 230686720, "step": 1760, "train_runtime": 3419.6339, "train_tokens_per_second": 67459.479 }, { "epoch": 0.6387585709130278, "grad_norm": 2.890625, "learning_rate": 3.9356845766532805e-05, "loss": 2.262241744995117, "num_input_tokens_seen": 231997440, "step": 1770, "train_runtime": 3438.4228, "train_tokens_per_second": 67472.051 }, { "epoch": 0.6423673763984121, "grad_norm": 2.796875, "learning_rate": 3.923821612880102e-05, "loss": 2.247925567626953, "num_input_tokens_seen": 233308160, "step": 1780, "train_runtime": 3457.2112, "train_tokens_per_second": 67484.498 }, { "epoch": 0.6459761818837965, "grad_norm": 2.328125, "learning_rate": 3.911911006610525e-05, "loss": 2.256356048583984, "num_input_tokens_seen": 234618880, "step": 1790, "train_runtime": 3475.9969, "train_tokens_per_second": 67496.862 }, { "epoch": 0.6495849873691808, "grad_norm": 2.59375, "learning_rate": 3.899953156385355e-05, "loss": 2.3100183486938475, "num_input_tokens_seen": 235929600, "step": 1800, "train_runtime": 3494.7778, "train_tokens_per_second": 67509.185 }, { "epoch": 0.6531937928545651, "grad_norm": 2.640625, "learning_rate": 3.8879484623262335e-05, "loss": 2.2395404815673827, "num_input_tokens_seen": 237240320, "step": 1810, "train_runtime": 3517.2255, "train_tokens_per_second": 67450.983 }, { "epoch": 0.6568025983399495, "grad_norm": 2.40625, "learning_rate": 3.8758973261222385e-05, "loss": 2.284636878967285, "num_input_tokens_seen": 238551040, "step": 1820, "train_runtime": 3536.0096, "train_tokens_per_second": 67463.346 }, { "epoch": 0.6604114038253338, "grad_norm": 2.1875, "learning_rate": 3.863800151016451e-05, "loss": 2.2737716674804687, "num_input_tokens_seen": 239861760, "step": 1830, "train_runtime": 3554.7927, "train_tokens_per_second": 67475.598 }, { "epoch": 0.6640202093107181, "grad_norm": 2.671875, "learning_rate": 3.851657341792458e-05, "loss": 2.3030860900878904, "num_input_tokens_seen": 241172480, "step": 1840, "train_runtime": 3573.5693, "train_tokens_per_second": 67487.842 }, { "epoch": 0.6676290147961025, "grad_norm": 2.875, "learning_rate": 3.839469304760813e-05, "loss": 2.274905204772949, "num_input_tokens_seen": 242483200, "step": 1850, "train_runtime": 3592.357, "train_tokens_per_second": 67499.751 }, { "epoch": 0.6712378202814868, "grad_norm": 3.28125, "learning_rate": 3.8272364477454344e-05, "loss": 2.2486251831054687, "num_input_tokens_seen": 243793920, "step": 1860, "train_runtime": 3611.1487, "train_tokens_per_second": 67511.46 }, { "epoch": 0.6748466257668712, "grad_norm": 2.53125, "learning_rate": 3.814959180069962e-05, "loss": 2.3203054428100587, "num_input_tokens_seen": 245104640, "step": 1870, "train_runtime": 3629.9298, "train_tokens_per_second": 67523.246 }, { "epoch": 0.6784554312522555, "grad_norm": 2.03125, "learning_rate": 3.802637912544063e-05, "loss": 2.275309371948242, "num_input_tokens_seen": 246415360, "step": 1880, "train_runtime": 3648.7165, "train_tokens_per_second": 67534.805 }, { "epoch": 0.6820642367376398, "grad_norm": 2.71875, "learning_rate": 3.7902730574496804e-05, "loss": 2.259540557861328, "num_input_tokens_seen": 247726080, "step": 1890, "train_runtime": 3667.5018, "train_tokens_per_second": 67546.274 }, { "epoch": 0.6856730422230242, "grad_norm": 2.984375, "learning_rate": 3.777865028527245e-05, "loss": 2.2632009506225588, "num_input_tokens_seen": 249036800, "step": 1900, "train_runtime": 3686.2853, "train_tokens_per_second": 67557.658 }, { "epoch": 0.6892818477084085, "grad_norm": 2.671875, "learning_rate": 3.765414240961824e-05, "loss": 2.2605398178100584, "num_input_tokens_seen": 250347520, "step": 1910, "train_runtime": 3708.6088, "train_tokens_per_second": 67504.428 }, { "epoch": 0.6928906531937928, "grad_norm": 2.3125, "learning_rate": 3.7529211113692316e-05, "loss": 2.2630123138427733, "num_input_tokens_seen": 251658240, "step": 1920, "train_runtime": 3727.3827, "train_tokens_per_second": 67516.072 }, { "epoch": 0.6964994586791772, "grad_norm": 2.765625, "learning_rate": 3.7403860577820906e-05, "loss": 2.2614559173583983, "num_input_tokens_seen": 252968960, "step": 1930, "train_runtime": 3746.1659, "train_tokens_per_second": 67527.432 }, { "epoch": 0.7001082641645615, "grad_norm": 2.4375, "learning_rate": 3.727809499635841e-05, "loss": 2.271468162536621, "num_input_tokens_seen": 254279680, "step": 1940, "train_runtime": 3764.9463, "train_tokens_per_second": 67538.726 }, { "epoch": 0.7037170696499458, "grad_norm": 2.28125, "learning_rate": 3.715191857754707e-05, "loss": 2.259329414367676, "num_input_tokens_seen": 255590400, "step": 1950, "train_runtime": 3783.7308, "train_tokens_per_second": 67549.837 }, { "epoch": 0.7073258751353302, "grad_norm": 2.28125, "learning_rate": 3.702533554337618e-05, "loss": 2.255583381652832, "num_input_tokens_seen": 256901120, "step": 1960, "train_runtime": 3802.5028, "train_tokens_per_second": 67561.059 }, { "epoch": 0.7109346806207145, "grad_norm": 2.109375, "learning_rate": 3.6898350129440745e-05, "loss": 2.227895164489746, "num_input_tokens_seen": 258211840, "step": 1970, "train_runtime": 3821.2826, "train_tokens_per_second": 67572.034 }, { "epoch": 0.7145434861060989, "grad_norm": 2.6875, "learning_rate": 3.6770966584799845e-05, "loss": 2.2536853790283202, "num_input_tokens_seen": 259522560, "step": 1980, "train_runtime": 3840.0617, "train_tokens_per_second": 67582.914 }, { "epoch": 0.7181522915914832, "grad_norm": 2.078125, "learning_rate": 3.664318917183438e-05, "loss": 2.2597951889038086, "num_input_tokens_seen": 260833280, "step": 1990, "train_runtime": 3858.8425, "train_tokens_per_second": 67593.658 }, { "epoch": 0.7217610970768675, "grad_norm": 2.84375, "learning_rate": 3.651502216610451e-05, "loss": 2.2733741760253907, "num_input_tokens_seen": 262144000, "step": 2000, "train_runtime": 3877.6418, "train_tokens_per_second": 67603.976 }, { "epoch": 0.7253699025622519, "grad_norm": 3.203125, "learning_rate": 3.638646985620652e-05, "loss": 2.277943801879883, "num_input_tokens_seen": 263454720, "step": 2010, "train_runtime": 3901.0148, "train_tokens_per_second": 67534.919 }, { "epoch": 0.7289787080476362, "grad_norm": 2.3125, "learning_rate": 3.625753654362939e-05, "loss": 2.316669464111328, "num_input_tokens_seen": 264765440, "step": 2020, "train_runtime": 3919.7696, "train_tokens_per_second": 67546.174 }, { "epoch": 0.7325875135330205, "grad_norm": 2.171875, "learning_rate": 3.612822654261083e-05, "loss": 2.228474807739258, "num_input_tokens_seen": 266076160, "step": 2030, "train_runtime": 3938.527, "train_tokens_per_second": 67557.278 }, { "epoch": 0.7361963190184049, "grad_norm": 2.625, "learning_rate": 3.5998544179992887e-05, "loss": 2.28963623046875, "num_input_tokens_seen": 267386880, "step": 2040, "train_runtime": 3957.2799, "train_tokens_per_second": 67568.352 }, { "epoch": 0.7398051245037892, "grad_norm": 2.15625, "learning_rate": 3.586849379507725e-05, "loss": 2.310571479797363, "num_input_tokens_seen": 268697600, "step": 2050, "train_runtime": 3976.0438, "train_tokens_per_second": 67579.134 }, { "epoch": 0.7434139299891735, "grad_norm": 2.078125, "learning_rate": 3.573807973947996e-05, "loss": 2.256072235107422, "num_input_tokens_seen": 270008320, "step": 2060, "train_runtime": 3994.787, "train_tokens_per_second": 67590.167 }, { "epoch": 0.7470227354745579, "grad_norm": 2.390625, "learning_rate": 3.5607306376985874e-05, "loss": 2.2760551452636717, "num_input_tokens_seen": 271319040, "step": 2070, "train_runtime": 4013.5355, "train_tokens_per_second": 67601.007 }, { "epoch": 0.7506315409599422, "grad_norm": 2.015625, "learning_rate": 3.547617808340259e-05, "loss": 2.2873741149902345, "num_input_tokens_seen": 272629760, "step": 2080, "train_runtime": 4032.283, "train_tokens_per_second": 67611.762 }, { "epoch": 0.7542403464453266, "grad_norm": 2.140625, "learning_rate": 3.534469924641408e-05, "loss": 2.279720687866211, "num_input_tokens_seen": 273940480, "step": 2090, "train_runtime": 4051.0412, "train_tokens_per_second": 67622.239 }, { "epoch": 0.7578491519307109, "grad_norm": 2.0, "learning_rate": 3.521287426543384e-05, "loss": 2.284140396118164, "num_input_tokens_seen": 275251200, "step": 2100, "train_runtime": 4069.7944, "train_tokens_per_second": 67632.704 }, { "epoch": 0.7614579574160952, "grad_norm": 2.3125, "learning_rate": 3.508070755145767e-05, "loss": 2.2155914306640625, "num_input_tokens_seen": 276561920, "step": 2110, "train_runtime": 4092.2481, "train_tokens_per_second": 67581.904 }, { "epoch": 0.7650667629014796, "grad_norm": 1.9375, "learning_rate": 3.494820352691615e-05, "loss": 2.2498100280761717, "num_input_tokens_seen": 277872640, "step": 2120, "train_runtime": 4111.0288, "train_tokens_per_second": 67591.995 }, { "epoch": 0.7686755683868639, "grad_norm": 2.53125, "learning_rate": 3.481536662552655e-05, "loss": 2.250745391845703, "num_input_tokens_seen": 279183360, "step": 2130, "train_runtime": 4129.81, "train_tokens_per_second": 67601.986 }, { "epoch": 0.7722843738722482, "grad_norm": 2.140625, "learning_rate": 3.4682201292144565e-05, "loss": 2.253221321105957, "num_input_tokens_seen": 280494080, "step": 2140, "train_runtime": 4148.5896, "train_tokens_per_second": 67611.913 }, { "epoch": 0.7758931793576326, "grad_norm": 2.234375, "learning_rate": 3.454871198261556e-05, "loss": 2.2065752029418944, "num_input_tokens_seen": 281804800, "step": 2150, "train_runtime": 4167.3782, "train_tokens_per_second": 67621.604 }, { "epoch": 0.7795019848430169, "grad_norm": 2.359375, "learning_rate": 3.441490316362544e-05, "loss": 2.259677696228027, "num_input_tokens_seen": 283115520, "step": 2160, "train_runtime": 4186.1418, "train_tokens_per_second": 67631.613 }, { "epoch": 0.7831107903284013, "grad_norm": 2.125, "learning_rate": 3.428077931255123e-05, "loss": 2.291699981689453, "num_input_tokens_seen": 284426240, "step": 2170, "train_runtime": 4204.908, "train_tokens_per_second": 67641.489 }, { "epoch": 0.7867195958137856, "grad_norm": 3.0625, "learning_rate": 3.4146344917311246e-05, "loss": 2.212661552429199, "num_input_tokens_seen": 285736960, "step": 2180, "train_runtime": 4223.6825, "train_tokens_per_second": 67651.146 }, { "epoch": 0.7903284012991699, "grad_norm": 2.4375, "learning_rate": 3.401160447621492e-05, "loss": 2.2563989639282225, "num_input_tokens_seen": 287047680, "step": 2190, "train_runtime": 4242.4789, "train_tokens_per_second": 67660.367 }, { "epoch": 0.7939372067845543, "grad_norm": 2.703125, "learning_rate": 3.387656249781228e-05, "loss": 2.292235565185547, "num_input_tokens_seen": 288358400, "step": 2200, "train_runtime": 4261.2417, "train_tokens_per_second": 67670.041 }, { "epoch": 0.7975460122699386, "grad_norm": 2.296875, "learning_rate": 3.374122350074312e-05, "loss": 2.186331367492676, "num_input_tokens_seen": 289669120, "step": 2210, "train_runtime": 4283.2186, "train_tokens_per_second": 67628.843 }, { "epoch": 0.8011548177553229, "grad_norm": 2.234375, "learning_rate": 3.360559201358573e-05, "loss": 2.268985557556152, "num_input_tokens_seen": 290979840, "step": 2220, "train_runtime": 4301.9788, "train_tokens_per_second": 67638.604 }, { "epoch": 0.8047636232407073, "grad_norm": 2.546875, "learning_rate": 3.3469672574705444e-05, "loss": 2.2512365341186524, "num_input_tokens_seen": 292290560, "step": 2230, "train_runtime": 4320.7387, "train_tokens_per_second": 67648.284 }, { "epoch": 0.8083724287260917, "grad_norm": 2.203125, "learning_rate": 3.333346973210276e-05, "loss": 2.2132787704467773, "num_input_tokens_seen": 293601280, "step": 2240, "train_runtime": 4339.4961, "train_tokens_per_second": 67657.919 }, { "epoch": 0.811981234211476, "grad_norm": 2.578125, "learning_rate": 3.31969880432611e-05, "loss": 2.219511032104492, "num_input_tokens_seen": 294912000, "step": 2250, "train_runtime": 4358.2565, "train_tokens_per_second": 67667.426 }, { "epoch": 0.8155900396968604, "grad_norm": 2.140625, "learning_rate": 3.306023207499439e-05, "loss": 2.2744468688964843, "num_input_tokens_seen": 296222720, "step": 2260, "train_runtime": 4377.0289, "train_tokens_per_second": 67676.665 }, { "epoch": 0.8191988451822447, "grad_norm": 2.3125, "learning_rate": 3.292320640329426e-05, "loss": 2.2337514877319338, "num_input_tokens_seen": 297533440, "step": 2270, "train_runtime": 4395.8065, "train_tokens_per_second": 67685.746 }, { "epoch": 0.8228076506676291, "grad_norm": 2.3125, "learning_rate": 3.27859156131768e-05, "loss": 2.217744064331055, "num_input_tokens_seen": 298844160, "step": 2280, "train_runtime": 4414.5824, "train_tokens_per_second": 67694.775 }, { "epoch": 0.8264164561530134, "grad_norm": 2.4375, "learning_rate": 3.2648364298529294e-05, "loss": 2.2992366790771483, "num_input_tokens_seen": 300154880, "step": 2290, "train_runtime": 4433.3466, "train_tokens_per_second": 67703.906 }, { "epoch": 0.8300252616383977, "grad_norm": 2.28125, "learning_rate": 3.2510557061956424e-05, "loss": 2.265240287780762, "num_input_tokens_seen": 301465600, "step": 2300, "train_runtime": 4452.1281, "train_tokens_per_second": 67712.697 }, { "epoch": 0.8336340671237821, "grad_norm": 2.390625, "learning_rate": 3.2372498514626255e-05, "loss": 2.257766532897949, "num_input_tokens_seen": 302776320, "step": 2310, "train_runtime": 4474.0527, "train_tokens_per_second": 67673.838 }, { "epoch": 0.8372428726091664, "grad_norm": 2.125, "learning_rate": 3.223419327611599e-05, "loss": 2.2734552383422852, "num_input_tokens_seen": 304087040, "step": 2320, "train_runtime": 4492.8568, "train_tokens_per_second": 67682.335 }, { "epoch": 0.8408516780945507, "grad_norm": 2.015625, "learning_rate": 3.209564597425734e-05, "loss": 2.240528106689453, "num_input_tokens_seen": 305397760, "step": 2330, "train_runtime": 4511.6404, "train_tokens_per_second": 67691.069 }, { "epoch": 0.8444604835799351, "grad_norm": 2.25, "learning_rate": 3.1956861244981714e-05, "loss": 2.2675090789794923, "num_input_tokens_seen": 306708480, "step": 2340, "train_runtime": 4530.4269, "train_tokens_per_second": 67699.686 }, { "epoch": 0.8480692890653194, "grad_norm": 2.421875, "learning_rate": 3.181784373216507e-05, "loss": 2.2498952865600588, "num_input_tokens_seen": 308019200, "step": 2350, "train_runtime": 4549.215, "train_tokens_per_second": 67708.208 }, { "epoch": 0.8516780945507038, "grad_norm": 2.078125, "learning_rate": 3.1678598087472564e-05, "loss": 2.2409832000732424, "num_input_tokens_seen": 309329920, "step": 2360, "train_runtime": 4567.9867, "train_tokens_per_second": 67716.904 }, { "epoch": 0.8552869000360881, "grad_norm": 1.8671875, "learning_rate": 3.153912897020283e-05, "loss": 2.2946495056152343, "num_input_tokens_seen": 310640640, "step": 2370, "train_runtime": 4586.7663, "train_tokens_per_second": 67725.413 }, { "epoch": 0.8588957055214724, "grad_norm": 2.3125, "learning_rate": 3.139944104713214e-05, "loss": 2.2439815521240236, "num_input_tokens_seen": 311951360, "step": 2380, "train_runtime": 4605.5614, "train_tokens_per_second": 67733.623 }, { "epoch": 0.8625045110068568, "grad_norm": 2.234375, "learning_rate": 3.1259538992358226e-05, "loss": 2.274890327453613, "num_input_tokens_seen": 313262080, "step": 2390, "train_runtime": 4624.3548, "train_tokens_per_second": 67741.791 }, { "epoch": 0.8661133164922411, "grad_norm": 2.125, "learning_rate": 3.11194274871439e-05, "loss": 2.311928367614746, "num_input_tokens_seen": 314572800, "step": 2400, "train_runtime": 4643.1261, "train_tokens_per_second": 67750.217 }, { "epoch": 0.8697221219776254, "grad_norm": 2.109375, "learning_rate": 3.097911121976035e-05, "loss": 2.2456386566162108, "num_input_tokens_seen": 315883520, "step": 2410, "train_runtime": 4665.7859, "train_tokens_per_second": 67702.103 }, { "epoch": 0.8733309274630098, "grad_norm": 1.953125, "learning_rate": 3.083859488533036e-05, "loss": 2.2625568389892576, "num_input_tokens_seen": 317194240, "step": 2420, "train_runtime": 4684.5371, "train_tokens_per_second": 67710.904 }, { "epoch": 0.8769397329483941, "grad_norm": 2.015625, "learning_rate": 3.069788318567113e-05, "loss": 2.242539978027344, "num_input_tokens_seen": 318504960, "step": 2430, "train_runtime": 4703.3144, "train_tokens_per_second": 67719.257 }, { "epoch": 0.8805485384337784, "grad_norm": 1.9140625, "learning_rate": 3.055698082913697e-05, "loss": 2.241316795349121, "num_input_tokens_seen": 319815680, "step": 2440, "train_runtime": 4722.0855, "train_tokens_per_second": 67727.634 }, { "epoch": 0.8841573439191628, "grad_norm": 2.125, "learning_rate": 3.0415892530461776e-05, "loss": 2.2707977294921875, "num_input_tokens_seen": 321126400, "step": 2450, "train_runtime": 4740.8653, "train_tokens_per_second": 67735.82 }, { "epoch": 0.8877661494045471, "grad_norm": 2.25, "learning_rate": 3.0274623010601267e-05, "loss": 2.2340885162353517, "num_input_tokens_seen": 322437120, "step": 2460, "train_runtime": 4759.626, "train_tokens_per_second": 67744.213 }, { "epoch": 0.8913749548899315, "grad_norm": 2.109375, "learning_rate": 3.0133176996574963e-05, "loss": 2.1937400817871096, "num_input_tokens_seen": 323747840, "step": 2470, "train_runtime": 4779.0775, "train_tokens_per_second": 67742.747 }, { "epoch": 0.8949837603753158, "grad_norm": 1.9921875, "learning_rate": 2.999155922130809e-05, "loss": 2.2225208282470703, "num_input_tokens_seen": 325058560, "step": 2480, "train_runtime": 4797.8483, "train_tokens_per_second": 67750.904 }, { "epoch": 0.8985925658607001, "grad_norm": 1.9140625, "learning_rate": 2.9849774423473176e-05, "loss": 2.2455957412719725, "num_input_tokens_seen": 326369280, "step": 2490, "train_runtime": 4816.6232, "train_tokens_per_second": 67758.939 }, { "epoch": 0.9022013713460845, "grad_norm": 2.046875, "learning_rate": 2.970782734733146e-05, "loss": 2.258774757385254, "num_input_tokens_seen": 327680000, "step": 2500, "train_runtime": 4835.399, "train_tokens_per_second": 67766.899 }, { "epoch": 0.9058101768314688, "grad_norm": 2.1875, "learning_rate": 2.956572274257422e-05, "loss": 2.2699337005615234, "num_input_tokens_seen": 328990720, "step": 2510, "train_runtime": 4858.431, "train_tokens_per_second": 67715.425 }, { "epoch": 0.9094189823168531, "grad_norm": 2.5, "learning_rate": 2.9423465364163772e-05, "loss": 2.2766401290893556, "num_input_tokens_seen": 330301440, "step": 2520, "train_runtime": 4877.191, "train_tokens_per_second": 67723.703 }, { "epoch": 0.9130277878022375, "grad_norm": 2.03125, "learning_rate": 2.928105997217438e-05, "loss": 2.2700592041015626, "num_input_tokens_seen": 331612160, "step": 2530, "train_runtime": 4895.9497, "train_tokens_per_second": 67731.937 }, { "epoch": 0.9166365932876218, "grad_norm": 2.359375, "learning_rate": 2.913851133163302e-05, "loss": 2.2220373153686523, "num_input_tokens_seen": 332922880, "step": 2540, "train_runtime": 4914.7219, "train_tokens_per_second": 67739.923 }, { "epoch": 0.9202453987730062, "grad_norm": 1.96875, "learning_rate": 2.8995824212359895e-05, "loss": 2.2467634201049806, "num_input_tokens_seen": 334233600, "step": 2550, "train_runtime": 4933.5018, "train_tokens_per_second": 67747.741 }, { "epoch": 0.9238542042583905, "grad_norm": 2.203125, "learning_rate": 2.8853003388808836e-05, "loss": 2.245954704284668, "num_input_tokens_seen": 335544320, "step": 2560, "train_runtime": 4952.2584, "train_tokens_per_second": 67755.818 }, { "epoch": 0.9274630097437748, "grad_norm": 1.96875, "learning_rate": 2.871005363990757e-05, "loss": 2.262437438964844, "num_input_tokens_seen": 336855040, "step": 2570, "train_runtime": 4971.0339, "train_tokens_per_second": 67763.577 }, { "epoch": 0.9310718152291592, "grad_norm": 2.328125, "learning_rate": 2.8566979748897782e-05, "loss": 2.306426429748535, "num_input_tokens_seen": 338165760, "step": 2580, "train_runtime": 4989.8069, "train_tokens_per_second": 67771.312 }, { "epoch": 0.9346806207145435, "grad_norm": 2.21875, "learning_rate": 2.8423786503175083e-05, "loss": 2.2506465911865234, "num_input_tokens_seen": 339476480, "step": 2590, "train_runtime": 5008.578, "train_tokens_per_second": 67779.015 }, { "epoch": 0.9382894261999278, "grad_norm": 2.640625, "learning_rate": 2.8280478694128804e-05, "loss": 2.249863052368164, "num_input_tokens_seen": 340787200, "step": 2600, "train_runtime": 5027.3701, "train_tokens_per_second": 67786.376 }, { "epoch": 0.9418982316853122, "grad_norm": 2.1875, "learning_rate": 2.8137061116981693e-05, "loss": 2.2413703918457033, "num_input_tokens_seen": 342097920, "step": 2610, "train_runtime": 5049.0415, "train_tokens_per_second": 67755.022 }, { "epoch": 0.9455070371706965, "grad_norm": 2.4375, "learning_rate": 2.799353857062944e-05, "loss": 2.236385154724121, "num_input_tokens_seen": 343408640, "step": 2620, "train_runtime": 5067.8245, "train_tokens_per_second": 67762.535 }, { "epoch": 0.9491158426560808, "grad_norm": 2.203125, "learning_rate": 2.7849915857480103e-05, "loss": 2.2933725357055663, "num_input_tokens_seen": 344719360, "step": 2630, "train_runtime": 5086.5939, "train_tokens_per_second": 67770.175 }, { "epoch": 0.9527246481414652, "grad_norm": 2.078125, "learning_rate": 2.770619778329344e-05, "loss": 2.244718551635742, "num_input_tokens_seen": 346030080, "step": 2640, "train_runtime": 5105.4095, "train_tokens_per_second": 67777.145 }, { "epoch": 0.9563334536268495, "grad_norm": 2.28125, "learning_rate": 2.756238915702007e-05, "loss": 2.2527402877807616, "num_input_tokens_seen": 347340800, "step": 2650, "train_runtime": 5124.1871, "train_tokens_per_second": 67784.566 }, { "epoch": 0.9599422591122339, "grad_norm": 1.859375, "learning_rate": 2.7418494790640576e-05, "loss": 2.250338554382324, "num_input_tokens_seen": 348651520, "step": 2660, "train_runtime": 5142.973, "train_tokens_per_second": 67791.824 }, { "epoch": 0.9635510645976182, "grad_norm": 2.078125, "learning_rate": 2.7274519499004497e-05, "loss": 2.231460380554199, "num_input_tokens_seen": 349962240, "step": 2670, "train_runtime": 5161.7907, "train_tokens_per_second": 67798.611 }, { "epoch": 0.9671598700830025, "grad_norm": 2.5625, "learning_rate": 2.7130468099669204e-05, "loss": 2.257509231567383, "num_input_tokens_seen": 351272960, "step": 2680, "train_runtime": 5180.5654, "train_tokens_per_second": 67805.912 }, { "epoch": 0.9707686755683869, "grad_norm": 1.75, "learning_rate": 2.6986345412738717e-05, "loss": 2.2456037521362306, "num_input_tokens_seen": 352583680, "step": 2690, "train_runtime": 5199.3394, "train_tokens_per_second": 67813.168 }, { "epoch": 0.9743774810537712, "grad_norm": 2.03125, "learning_rate": 2.684215626070241e-05, "loss": 2.220039176940918, "num_input_tokens_seen": 353894400, "step": 2700, "train_runtime": 5218.1178, "train_tokens_per_second": 67820.317 }, { "epoch": 0.9779862865391555, "grad_norm": 2.171875, "learning_rate": 2.6697905468273638e-05, "loss": 2.2261730194091798, "num_input_tokens_seen": 355205120, "step": 2710, "train_runtime": 5240.1257, "train_tokens_per_second": 67785.61 }, { "epoch": 0.9815950920245399, "grad_norm": 2.15625, "learning_rate": 2.6553597862228306e-05, "loss": 2.2150230407714844, "num_input_tokens_seen": 356515840, "step": 2720, "train_runtime": 5258.914, "train_tokens_per_second": 67792.673 }, { "epoch": 0.9852038975099242, "grad_norm": 2.125, "learning_rate": 2.6409238271243374e-05, "loss": 2.26368408203125, "num_input_tokens_seen": 357826560, "step": 2730, "train_runtime": 5277.6776, "train_tokens_per_second": 67800.003 }, { "epoch": 0.9888127029953085, "grad_norm": 1.984375, "learning_rate": 2.6264831525735245e-05, "loss": 2.280439758300781, "num_input_tokens_seen": 359137280, "step": 2740, "train_runtime": 5296.4537, "train_tokens_per_second": 67807.121 }, { "epoch": 0.9924215084806929, "grad_norm": 2.0625, "learning_rate": 2.612038245769818e-05, "loss": 2.2530561447143556, "num_input_tokens_seen": 360448000, "step": 2750, "train_runtime": 5315.2093, "train_tokens_per_second": 67814.45 }, { "epoch": 0.9960303139660772, "grad_norm": 2.484375, "learning_rate": 2.5975895900542596e-05, "loss": 2.2372438430786135, "num_input_tokens_seen": 361758720, "step": 2760, "train_runtime": 5333.9785, "train_tokens_per_second": 67821.556 }, { "epoch": 0.9996391194514616, "grad_norm": 2.296875, "learning_rate": 2.5831376688933305e-05, "loss": 2.229551315307617, "num_input_tokens_seen": 363069440, "step": 2770, "train_runtime": 5352.7536, "train_tokens_per_second": 67828.535 }, { "epoch": 1.003247924936846, "grad_norm": 2.078125, "learning_rate": 2.5686829658627814e-05, "loss": 2.193307113647461, "num_input_tokens_seen": 364331008, "step": 2780, "train_runtime": 5371.326, "train_tokens_per_second": 67828.877 }, { "epoch": 1.0068567304222302, "grad_norm": 1.9765625, "learning_rate": 2.5542259646314425e-05, "loss": 2.221421241760254, "num_input_tokens_seen": 365641728, "step": 2790, "train_runtime": 5390.0707, "train_tokens_per_second": 67836.166 }, { "epoch": 1.0104655359076147, "grad_norm": 1.75, "learning_rate": 2.539767148945048e-05, "loss": 2.2600011825561523, "num_input_tokens_seen": 366952448, "step": 2800, "train_runtime": 5408.8177, "train_tokens_per_second": 67843.375 }, { "epoch": 1.014074341392999, "grad_norm": 2.328125, "learning_rate": 2.5253070026100428e-05, "loss": 2.1858745574951173, "num_input_tokens_seen": 368263168, "step": 2810, "train_runtime": 5430.762, "train_tokens_per_second": 67810.588 }, { "epoch": 1.0176831468783833, "grad_norm": 2.234375, "learning_rate": 2.5108460094773984e-05, "loss": 2.232530975341797, "num_input_tokens_seen": 369573888, "step": 2820, "train_runtime": 5449.5183, "train_tokens_per_second": 67817.717 }, { "epoch": 1.0212919523637676, "grad_norm": 2.359375, "learning_rate": 2.4963846534264197e-05, "loss": 2.2220739364624023, "num_input_tokens_seen": 370884608, "step": 2830, "train_runtime": 5468.2804, "train_tokens_per_second": 67824.724 }, { "epoch": 1.024900757849152, "grad_norm": 2.0625, "learning_rate": 2.4819234183485572e-05, "loss": 2.225343132019043, "num_input_tokens_seen": 372195328, "step": 2840, "train_runtime": 5487.0445, "train_tokens_per_second": 67831.658 }, { "epoch": 1.0285095633345362, "grad_norm": 1.9375, "learning_rate": 2.4674627881312103e-05, "loss": 2.255137252807617, "num_input_tokens_seen": 373506048, "step": 2850, "train_runtime": 5505.7991, "train_tokens_per_second": 67838.663 }, { "epoch": 1.0321183688199207, "grad_norm": 2.09375, "learning_rate": 2.4530032466415428e-05, "loss": 2.248682975769043, "num_input_tokens_seen": 374816768, "step": 2860, "train_runtime": 5524.5617, "train_tokens_per_second": 67845.521 }, { "epoch": 1.035727174305305, "grad_norm": 2.34375, "learning_rate": 2.438545277710285e-05, "loss": 2.166554832458496, "num_input_tokens_seen": 376127488, "step": 2870, "train_runtime": 5543.3218, "train_tokens_per_second": 67852.364 }, { "epoch": 1.0393359797906894, "grad_norm": 1.9140625, "learning_rate": 2.4240893651155515e-05, "loss": 2.2574790954589843, "num_input_tokens_seen": 377438208, "step": 2880, "train_runtime": 5562.0818, "train_tokens_per_second": 67859.162 }, { "epoch": 1.0429447852760736, "grad_norm": 2.015625, "learning_rate": 2.4096359925666478e-05, "loss": 2.206853675842285, "num_input_tokens_seen": 378748928, "step": 2890, "train_runtime": 5580.8539, "train_tokens_per_second": 67865.767 }, { "epoch": 1.046553590761458, "grad_norm": 2.5, "learning_rate": 2.395185643687885e-05, "loss": 2.2421005249023436, "num_input_tokens_seen": 380059648, "step": 2900, "train_runtime": 5599.6107, "train_tokens_per_second": 67872.512 }, { "epoch": 1.0501623962468423, "grad_norm": 1.875, "learning_rate": 2.380738802002403e-05, "loss": 2.2542638778686523, "num_input_tokens_seen": 381370368, "step": 2910, "train_runtime": 5622.0304, "train_tokens_per_second": 67834.988 }, { "epoch": 1.0537712017322267, "grad_norm": 2.59375, "learning_rate": 2.366295950915985e-05, "loss": 2.248210144042969, "num_input_tokens_seen": 382681088, "step": 2920, "train_runtime": 5640.7541, "train_tokens_per_second": 67842.186 }, { "epoch": 1.057380007217611, "grad_norm": 2.46875, "learning_rate": 2.3518575737008867e-05, "loss": 2.2071243286132813, "num_input_tokens_seen": 383991808, "step": 2930, "train_runtime": 5659.5048, "train_tokens_per_second": 67849.012 }, { "epoch": 1.0609888127029954, "grad_norm": 2.265625, "learning_rate": 2.3374241534796602e-05, "loss": 2.2425615310668947, "num_input_tokens_seen": 385302528, "step": 2940, "train_runtime": 5678.2419, "train_tokens_per_second": 67855.956 }, { "epoch": 1.0645976181883796, "grad_norm": 2.140625, "learning_rate": 2.3229961732089973e-05, "loss": 2.219411277770996, "num_input_tokens_seen": 386613248, "step": 2950, "train_runtime": 5696.9934, "train_tokens_per_second": 67862.681 }, { "epoch": 1.068206423673764, "grad_norm": 2.140625, "learning_rate": 2.308574115663556e-05, "loss": 2.201869583129883, "num_input_tokens_seen": 387923968, "step": 2960, "train_runtime": 5715.7762, "train_tokens_per_second": 67868.992 }, { "epoch": 1.0718152291591483, "grad_norm": 2.0625, "learning_rate": 2.2941584634198217e-05, "loss": 2.235122871398926, "num_input_tokens_seen": 389234688, "step": 2970, "train_runtime": 5734.5443, "train_tokens_per_second": 67875.435 }, { "epoch": 1.0754240346445327, "grad_norm": 3.015625, "learning_rate": 2.279749698839946e-05, "loss": 2.2270109176635744, "num_input_tokens_seen": 390545408, "step": 2980, "train_runtime": 5753.3138, "train_tokens_per_second": 67881.819 }, { "epoch": 1.079032840129917, "grad_norm": 2.078125, "learning_rate": 2.2653483040556157e-05, "loss": 2.229469871520996, "num_input_tokens_seen": 391856128, "step": 2990, "train_runtime": 5772.0918, "train_tokens_per_second": 67888.062 }, { "epoch": 1.0826416456153014, "grad_norm": 1.7890625, "learning_rate": 2.250954760951916e-05, "loss": 2.199754333496094, "num_input_tokens_seen": 393166848, "step": 3000, "train_runtime": 5790.8659, "train_tokens_per_second": 67894.311 }, { "epoch": 1.0862504511006856, "grad_norm": 2.140625, "learning_rate": 2.2365695511512075e-05, "loss": 2.1993585586547852, "num_input_tokens_seen": 394477568, "step": 3010, "train_runtime": 5814.6634, "train_tokens_per_second": 67841.858 }, { "epoch": 1.08985925658607, "grad_norm": 2.328125, "learning_rate": 2.2221931559970076e-05, "loss": 2.249158477783203, "num_input_tokens_seen": 395788288, "step": 3020, "train_runtime": 5833.4374, "train_tokens_per_second": 67848.21 }, { "epoch": 1.0934680620714543, "grad_norm": 1.75, "learning_rate": 2.2078260565378913e-05, "loss": 2.2337362289428713, "num_input_tokens_seen": 397099008, "step": 3030, "train_runtime": 5852.2209, "train_tokens_per_second": 67854.412 }, { "epoch": 1.0970768675568388, "grad_norm": 2.234375, "learning_rate": 2.193468733511386e-05, "loss": 2.2763225555419924, "num_input_tokens_seen": 398409728, "step": 3040, "train_runtime": 5870.9916, "train_tokens_per_second": 67860.722 }, { "epoch": 1.100685673042223, "grad_norm": 1.890625, "learning_rate": 2.179121667327893e-05, "loss": 2.2377885818481444, "num_input_tokens_seen": 399720448, "step": 3050, "train_runtime": 5889.7662, "train_tokens_per_second": 67866.947 }, { "epoch": 1.1042944785276074, "grad_norm": 2.1875, "learning_rate": 2.164785338054607e-05, "loss": 2.224856948852539, "num_input_tokens_seen": 401031168, "step": 3060, "train_runtime": 5908.5456, "train_tokens_per_second": 67873.076 }, { "epoch": 1.1079032840129917, "grad_norm": 2.109375, "learning_rate": 2.1504602253994572e-05, "loss": 2.2104814529418944, "num_input_tokens_seen": 402341888, "step": 3070, "train_runtime": 5927.3145, "train_tokens_per_second": 67879.288 }, { "epoch": 1.111512089498376, "grad_norm": 2.03125, "learning_rate": 2.1361468086950505e-05, "loss": 2.22839298248291, "num_input_tokens_seen": 403652608, "step": 3080, "train_runtime": 5946.1084, "train_tokens_per_second": 67885.174 }, { "epoch": 1.1151208949837603, "grad_norm": 1.765625, "learning_rate": 2.1218455668826394e-05, "loss": 2.199458122253418, "num_input_tokens_seen": 404963328, "step": 3090, "train_runtime": 5964.9101, "train_tokens_per_second": 67890.936 }, { "epoch": 1.1187297004691448, "grad_norm": 2.265625, "learning_rate": 2.10755697849609e-05, "loss": 2.200012969970703, "num_input_tokens_seen": 406274048, "step": 3100, "train_runtime": 5983.7215, "train_tokens_per_second": 67896.551 }, { "epoch": 1.122338505954529, "grad_norm": 2.28125, "learning_rate": 2.0932815216458712e-05, "loss": 2.2353172302246094, "num_input_tokens_seen": 407584768, "step": 3110, "train_runtime": 6006.3211, "train_tokens_per_second": 67859.304 }, { "epoch": 1.1259473114399134, "grad_norm": 1.796875, "learning_rate": 2.07901967400306e-05, "loss": 2.2090152740478515, "num_input_tokens_seen": 408895488, "step": 3120, "train_runtime": 6025.1377, "train_tokens_per_second": 67864.919 }, { "epoch": 1.1295561169252977, "grad_norm": 2.03125, "learning_rate": 2.0647719127833536e-05, "loss": 2.1954586029052736, "num_input_tokens_seen": 410206208, "step": 3130, "train_runtime": 6043.9279, "train_tokens_per_second": 67870.798 }, { "epoch": 1.1331649224106821, "grad_norm": 2.15625, "learning_rate": 2.0505387147311057e-05, "loss": 2.226312828063965, "num_input_tokens_seen": 411516928, "step": 3140, "train_runtime": 6062.7198, "train_tokens_per_second": 67876.62 }, { "epoch": 1.1367737278960663, "grad_norm": 2.453125, "learning_rate": 2.036320556103368e-05, "loss": 2.17757568359375, "num_input_tokens_seen": 412827648, "step": 3150, "train_runtime": 6081.5285, "train_tokens_per_second": 67882.218 }, { "epoch": 1.1403825333814508, "grad_norm": 1.890625, "learning_rate": 2.0221179126539636e-05, "loss": 2.235516357421875, "num_input_tokens_seen": 414138368, "step": 3160, "train_runtime": 6100.3197, "train_tokens_per_second": 67887.978 }, { "epoch": 1.143991338866835, "grad_norm": 2.125, "learning_rate": 2.0079312596175563e-05, "loss": 2.219258499145508, "num_input_tokens_seen": 415449088, "step": 3170, "train_runtime": 6119.0789, "train_tokens_per_second": 67894.056 }, { "epoch": 1.1476001443522195, "grad_norm": 2.109375, "learning_rate": 1.9937610716937595e-05, "loss": 2.2164329528808593, "num_input_tokens_seen": 416759808, "step": 3180, "train_runtime": 6137.8386, "train_tokens_per_second": 67900.092 }, { "epoch": 1.1512089498376037, "grad_norm": 2.515625, "learning_rate": 1.9796078230312438e-05, "loss": 2.214109420776367, "num_input_tokens_seen": 418070528, "step": 3190, "train_runtime": 6156.6084, "train_tokens_per_second": 67905.98 }, { "epoch": 1.1548177553229881, "grad_norm": 2.03125, "learning_rate": 1.9654719872118775e-05, "loss": 2.223517417907715, "num_input_tokens_seen": 419381248, "step": 3200, "train_runtime": 6175.3896, "train_tokens_per_second": 67911.706 }, { "epoch": 1.1584265608083724, "grad_norm": 1.9375, "learning_rate": 1.951354037234876e-05, "loss": 2.2522729873657226, "num_input_tokens_seen": 420691968, "step": 3210, "train_runtime": 6198.4055, "train_tokens_per_second": 67870.998 }, { "epoch": 1.1620353662937568, "grad_norm": 2.140625, "learning_rate": 1.937254445500979e-05, "loss": 2.194486618041992, "num_input_tokens_seen": 422002688, "step": 3220, "train_runtime": 6217.15, "train_tokens_per_second": 67877.192 }, { "epoch": 1.165644171779141, "grad_norm": 2.15625, "learning_rate": 1.9231736837966384e-05, "loss": 2.242540740966797, "num_input_tokens_seen": 423313408, "step": 3230, "train_runtime": 6235.9087, "train_tokens_per_second": 67883.195 }, { "epoch": 1.1692529772645255, "grad_norm": 1.96875, "learning_rate": 1.909112223278236e-05, "loss": 2.2135072708129884, "num_input_tokens_seen": 424624128, "step": 3240, "train_runtime": 6254.6817, "train_tokens_per_second": 67889.006 }, { "epoch": 1.1728617827499097, "grad_norm": 2.21875, "learning_rate": 1.895070534456316e-05, "loss": 2.252424430847168, "num_input_tokens_seen": 425934848, "step": 3250, "train_runtime": 6273.4441, "train_tokens_per_second": 67894.898 }, { "epoch": 1.1764705882352942, "grad_norm": 2.078125, "learning_rate": 1.881049087179842e-05, "loss": 2.216765594482422, "num_input_tokens_seen": 427245568, "step": 3260, "train_runtime": 6292.2219, "train_tokens_per_second": 67900.588 }, { "epoch": 1.1800793937206784, "grad_norm": 1.921875, "learning_rate": 1.8670483506204745e-05, "loss": 2.2357194900512694, "num_input_tokens_seen": 428556288, "step": 3270, "train_runtime": 6310.9899, "train_tokens_per_second": 67906.35 }, { "epoch": 1.1836881992060628, "grad_norm": 1.71875, "learning_rate": 1.8530687932568753e-05, "loss": 2.248133087158203, "num_input_tokens_seen": 429867008, "step": 3280, "train_runtime": 6329.8002, "train_tokens_per_second": 67911.624 }, { "epoch": 1.187297004691447, "grad_norm": 1.828125, "learning_rate": 1.8391108828590244e-05, "loss": 2.214917755126953, "num_input_tokens_seen": 431177728, "step": 3290, "train_runtime": 6348.5929, "train_tokens_per_second": 67917.054 }, { "epoch": 1.1909058101768315, "grad_norm": 1.8828125, "learning_rate": 1.8251750864725782e-05, "loss": 2.179270935058594, "num_input_tokens_seen": 432488448, "step": 3300, "train_runtime": 6367.3551, "train_tokens_per_second": 67922.778 }, { "epoch": 1.1945146156622157, "grad_norm": 1.9140625, "learning_rate": 1.8112618704032325e-05, "loss": 2.2112674713134766, "num_input_tokens_seen": 433799168, "step": 3310, "train_runtime": 6389.3478, "train_tokens_per_second": 67894.124 }, { "epoch": 1.1981234211476002, "grad_norm": 1.9140625, "learning_rate": 1.7973717002011226e-05, "loss": 2.2106258392333986, "num_input_tokens_seen": 435109888, "step": 3320, "train_runtime": 6408.1106, "train_tokens_per_second": 67899.871 }, { "epoch": 1.2017322266329844, "grad_norm": 1.8828125, "learning_rate": 1.783505040645249e-05, "loss": 2.197174072265625, "num_input_tokens_seen": 436420608, "step": 3330, "train_runtime": 6426.8536, "train_tokens_per_second": 67905.796 }, { "epoch": 1.2053410321183688, "grad_norm": 2.015625, "learning_rate": 1.76966235572792e-05, "loss": 2.216184616088867, "num_input_tokens_seen": 437731328, "step": 3340, "train_runtime": 6445.594, "train_tokens_per_second": 67911.713 }, { "epoch": 1.208949837603753, "grad_norm": 2.046875, "learning_rate": 1.7558441086392305e-05, "loss": 2.179450798034668, "num_input_tokens_seen": 439042048, "step": 3350, "train_runtime": 6464.3436, "train_tokens_per_second": 67917.499 }, { "epoch": 1.2125586430891375, "grad_norm": 1.78125, "learning_rate": 1.742050761751558e-05, "loss": 2.254531478881836, "num_input_tokens_seen": 440352768, "step": 3360, "train_runtime": 6483.0846, "train_tokens_per_second": 67923.342 }, { "epoch": 1.2161674485745217, "grad_norm": 2.265625, "learning_rate": 1.7282827766040982e-05, "loss": 2.186991882324219, "num_input_tokens_seen": 441663488, "step": 3370, "train_runtime": 6501.8258, "train_tokens_per_second": 67929.148 }, { "epoch": 1.2197762540599062, "grad_norm": 1.9140625, "learning_rate": 1.714540613887415e-05, "loss": 2.190296173095703, "num_input_tokens_seen": 442974208, "step": 3380, "train_runtime": 6520.563, "train_tokens_per_second": 67934.963 }, { "epoch": 1.2233850595452904, "grad_norm": 1.84375, "learning_rate": 1.7008247334280292e-05, "loss": 2.233493614196777, "num_input_tokens_seen": 444284928, "step": 3390, "train_runtime": 6539.3093, "train_tokens_per_second": 67940.651 }, { "epoch": 1.2269938650306749, "grad_norm": 2.03125, "learning_rate": 1.6871355941730295e-05, "loss": 2.224575996398926, "num_input_tokens_seen": 445595648, "step": 3400, "train_runtime": 6558.0392, "train_tokens_per_second": 67946.476 }, { "epoch": 1.230602670516059, "grad_norm": 2.0625, "learning_rate": 1.6734736541747192e-05, "loss": 2.2136987686157226, "num_input_tokens_seen": 446906368, "step": 3410, "train_runtime": 6580.298, "train_tokens_per_second": 67915.825 }, { "epoch": 1.2342114760014435, "grad_norm": 1.59375, "learning_rate": 1.6598393705752843e-05, "loss": 2.2252714157104494, "num_input_tokens_seen": 448217088, "step": 3420, "train_runtime": 6599.0501, "train_tokens_per_second": 67921.456 }, { "epoch": 1.2378202814868278, "grad_norm": 2.421875, "learning_rate": 1.6462331995915042e-05, "loss": 2.2220790863037108, "num_input_tokens_seen": 449527808, "step": 3430, "train_runtime": 6617.8017, "train_tokens_per_second": 67927.06 }, { "epoch": 1.2414290869722122, "grad_norm": 1.921875, "learning_rate": 1.632655596499478e-05, "loss": 2.19171142578125, "num_input_tokens_seen": 450838528, "step": 3440, "train_runtime": 6636.5497, "train_tokens_per_second": 67932.668 }, { "epoch": 1.2450378924575964, "grad_norm": 1.671875, "learning_rate": 1.6191070156193973e-05, "loss": 2.2106775283813476, "num_input_tokens_seen": 452149248, "step": 3450, "train_runtime": 6655.3073, "train_tokens_per_second": 67938.148 }, { "epoch": 1.2486466979429809, "grad_norm": 1.75, "learning_rate": 1.6055879103003393e-05, "loss": 2.2294937133789063, "num_input_tokens_seen": 453459968, "step": 3460, "train_runtime": 6674.058, "train_tokens_per_second": 67943.666 }, { "epoch": 1.2522555034283651, "grad_norm": 2.171875, "learning_rate": 1.5920987329051016e-05, "loss": 2.257633018493652, "num_input_tokens_seen": 454770688, "step": 3470, "train_runtime": 6692.8111, "train_tokens_per_second": 67949.13 }, { "epoch": 1.2558643089137496, "grad_norm": 1.9140625, "learning_rate": 1.5786399347950607e-05, "loss": 2.2481691360473635, "num_input_tokens_seen": 456081408, "step": 3480, "train_runtime": 6711.5556, "train_tokens_per_second": 67954.649 }, { "epoch": 1.259473114399134, "grad_norm": 1.5625, "learning_rate": 1.5652119663150755e-05, "loss": 2.25321102142334, "num_input_tokens_seen": 457392128, "step": 3490, "train_runtime": 6730.3387, "train_tokens_per_second": 67959.749 }, { "epoch": 1.2630819198845182, "grad_norm": 1.96875, "learning_rate": 1.551815276778411e-05, "loss": 2.201145553588867, "num_input_tokens_seen": 458702848, "step": 3500, "train_runtime": 6749.0904, "train_tokens_per_second": 67965.137 }, { "epoch": 1.2666907253699025, "grad_norm": 1.9296875, "learning_rate": 1.5384503144517105e-05, "loss": 2.2279090881347656, "num_input_tokens_seen": 460013568, "step": 3510, "train_runtime": 6772.1939, "train_tokens_per_second": 67926.816 }, { "epoch": 1.270299530855287, "grad_norm": 1.8984375, "learning_rate": 1.5251175265399909e-05, "loss": 2.2312782287597654, "num_input_tokens_seen": 461324288, "step": 3520, "train_runtime": 6791.1594, "train_tokens_per_second": 67930.122 }, { "epoch": 1.2739083363406714, "grad_norm": 2.140625, "learning_rate": 1.5118173591716812e-05, "loss": 2.2547531127929688, "num_input_tokens_seen": 462635008, "step": 3530, "train_runtime": 6809.949, "train_tokens_per_second": 67935.165 }, { "epoch": 1.2775171418260556, "grad_norm": 1.734375, "learning_rate": 1.4985502573836957e-05, "loss": 2.2237892150878906, "num_input_tokens_seen": 463945728, "step": 3540, "train_runtime": 6828.7257, "train_tokens_per_second": 67940.308 }, { "epoch": 1.2811259473114398, "grad_norm": 1.8671875, "learning_rate": 1.4853166651065396e-05, "loss": 2.2387939453125, "num_input_tokens_seen": 465256448, "step": 3550, "train_runtime": 6847.4866, "train_tokens_per_second": 67945.58 }, { "epoch": 1.2847347527968243, "grad_norm": 1.671875, "learning_rate": 1.4721170251494587e-05, "loss": 2.2387521743774412, "num_input_tokens_seen": 466567168, "step": 3560, "train_runtime": 6866.2656, "train_tokens_per_second": 67950.644 }, { "epoch": 1.2883435582822087, "grad_norm": 2.375, "learning_rate": 1.4589517791856167e-05, "loss": 2.2455513000488283, "num_input_tokens_seen": 467877888, "step": 3570, "train_runtime": 6885.0262, "train_tokens_per_second": 67955.862 }, { "epoch": 1.291952363767593, "grad_norm": 1.9453125, "learning_rate": 1.4458213677373245e-05, "loss": 2.2595149993896486, "num_input_tokens_seen": 469188608, "step": 3580, "train_runtime": 6903.7905, "train_tokens_per_second": 67961.014 }, { "epoch": 1.2955611692529772, "grad_norm": 2.015625, "learning_rate": 1.4327262301612886e-05, "loss": 2.225126838684082, "num_input_tokens_seen": 470499328, "step": 3590, "train_runtime": 6922.5486, "train_tokens_per_second": 67966.201 }, { "epoch": 1.2991699747383616, "grad_norm": 1.90625, "learning_rate": 1.4196668046339251e-05, "loss": 2.197856903076172, "num_input_tokens_seen": 471810048, "step": 3600, "train_runtime": 6941.3026, "train_tokens_per_second": 67971.399 }, { "epoch": 1.302778780223746, "grad_norm": 1.7109375, "learning_rate": 1.4066435281366814e-05, "loss": 2.2238494873046877, "num_input_tokens_seen": 473120768, "step": 3610, "train_runtime": 6962.6928, "train_tokens_per_second": 67950.832 }, { "epoch": 1.3063875857091303, "grad_norm": 1.71875, "learning_rate": 1.3936568364414254e-05, "loss": 2.215565299987793, "num_input_tokens_seen": 474431488, "step": 3620, "train_runtime": 6981.4678, "train_tokens_per_second": 67955.837 }, { "epoch": 1.3099963911945145, "grad_norm": 1.953125, "learning_rate": 1.380707164095862e-05, "loss": 2.229986572265625, "num_input_tokens_seen": 475742208, "step": 3630, "train_runtime": 7000.2328, "train_tokens_per_second": 67960.913 }, { "epoch": 1.313605196679899, "grad_norm": 1.8046875, "learning_rate": 1.3677949444089907e-05, "loss": 2.273609924316406, "num_input_tokens_seen": 477052928, "step": 3640, "train_runtime": 7019.0256, "train_tokens_per_second": 67965.691 }, { "epoch": 1.3172140021652834, "grad_norm": 1.609375, "learning_rate": 1.3549206094366045e-05, "loss": 2.212572479248047, "num_input_tokens_seen": 478363648, "step": 3650, "train_runtime": 7037.7829, "train_tokens_per_second": 67970.788 }, { "epoch": 1.3208228076506676, "grad_norm": 2.0, "learning_rate": 1.3420845899668425e-05, "loss": 2.2558984756469727, "num_input_tokens_seen": 479674368, "step": 3660, "train_runtime": 7056.5456, "train_tokens_per_second": 67975.805 }, { "epoch": 1.3244316131360518, "grad_norm": 1.796875, "learning_rate": 1.3292873155057616e-05, "loss": 2.2416217803955076, "num_input_tokens_seen": 480985088, "step": 3670, "train_runtime": 7075.3311, "train_tokens_per_second": 67980.577 }, { "epoch": 1.3280404186214363, "grad_norm": 1.578125, "learning_rate": 1.3165292142629771e-05, "loss": 2.219058799743652, "num_input_tokens_seen": 482295808, "step": 3680, "train_runtime": 7094.1126, "train_tokens_per_second": 67985.361 }, { "epoch": 1.3316492241068207, "grad_norm": 1.6640625, "learning_rate": 1.3038107131373267e-05, "loss": 2.240825080871582, "num_input_tokens_seen": 483606528, "step": 3690, "train_runtime": 7112.88, "train_tokens_per_second": 67990.256 }, { "epoch": 1.335258029592205, "grad_norm": 1.7890625, "learning_rate": 1.2911322377025903e-05, "loss": 2.1871011734008787, "num_input_tokens_seen": 484917248, "step": 3700, "train_runtime": 7131.662, "train_tokens_per_second": 67994.985 }, { "epoch": 1.3388668350775892, "grad_norm": 2.078125, "learning_rate": 1.2784942121932436e-05, "loss": 2.187872886657715, "num_input_tokens_seen": 486227968, "step": 3710, "train_runtime": 7152.9267, "train_tokens_per_second": 67976.087 }, { "epoch": 1.3424756405629736, "grad_norm": 2.046875, "learning_rate": 1.2658970594902753e-05, "loss": 2.25146369934082, "num_input_tokens_seen": 487538688, "step": 3720, "train_runtime": 7171.733, "train_tokens_per_second": 67980.597 }, { "epoch": 1.346084446048358, "grad_norm": 1.921875, "learning_rate": 1.2533412011070223e-05, "loss": 2.2136253356933593, "num_input_tokens_seen": 488849408, "step": 3730, "train_runtime": 7190.5443, "train_tokens_per_second": 67985.036 }, { "epoch": 1.3496932515337423, "grad_norm": 2.1875, "learning_rate": 1.2408270571750725e-05, "loss": 2.2115272521972655, "num_input_tokens_seen": 490160128, "step": 3740, "train_runtime": 7209.3456, "train_tokens_per_second": 67989.545 }, { "epoch": 1.3533020570191265, "grad_norm": 1.7734375, "learning_rate": 1.2283550464302118e-05, "loss": 2.2137119293212892, "num_input_tokens_seen": 491470848, "step": 3750, "train_runtime": 7228.1812, "train_tokens_per_second": 67993.709 }, { "epoch": 1.356910862504511, "grad_norm": 1.640625, "learning_rate": 1.2159255861984018e-05, "loss": 2.266486930847168, "num_input_tokens_seen": 492781568, "step": 3760, "train_runtime": 7247.0792, "train_tokens_per_second": 67997.266 }, { "epoch": 1.3605196679898954, "grad_norm": 2.34375, "learning_rate": 1.2035390923818243e-05, "loss": 2.1991031646728514, "num_input_tokens_seen": 494092288, "step": 3770, "train_runtime": 7265.8955, "train_tokens_per_second": 68001.568 }, { "epoch": 1.3641284734752797, "grad_norm": 1.9765625, "learning_rate": 1.1911959794449613e-05, "loss": 2.2052324295043944, "num_input_tokens_seen": 495403008, "step": 3780, "train_runtime": 7284.703, "train_tokens_per_second": 68005.931 }, { "epoch": 1.3677372789606639, "grad_norm": 1.609375, "learning_rate": 1.1788966604007276e-05, "loss": 2.2269506454467773, "num_input_tokens_seen": 496713728, "step": 3790, "train_runtime": 7303.501, "train_tokens_per_second": 68010.359 }, { "epoch": 1.3713460844460483, "grad_norm": 1.7578125, "learning_rate": 1.1666415467966477e-05, "loss": 2.2677322387695313, "num_input_tokens_seen": 498024448, "step": 3800, "train_runtime": 7322.3167, "train_tokens_per_second": 68014.601 }, { "epoch": 1.3749548899314328, "grad_norm": 1.8828125, "learning_rate": 1.1544310487010932e-05, "loss": 2.25917911529541, "num_input_tokens_seen": 499335168, "step": 3810, "train_runtime": 7343.6783, "train_tokens_per_second": 67995.24 }, { "epoch": 1.378563695416817, "grad_norm": 1.7890625, "learning_rate": 1.1422655746895508e-05, "loss": 2.1915868759155273, "num_input_tokens_seen": 500645888, "step": 3820, "train_runtime": 7362.4631, "train_tokens_per_second": 67999.783 }, { "epoch": 1.3821725009022015, "grad_norm": 1.671875, "learning_rate": 1.1301455318309586e-05, "loss": 2.1912534713745115, "num_input_tokens_seen": 501956608, "step": 3830, "train_runtime": 7381.2253, "train_tokens_per_second": 68004.51 }, { "epoch": 1.3857813063875857, "grad_norm": 1.78125, "learning_rate": 1.1180713256740835e-05, "loss": 2.268548583984375, "num_input_tokens_seen": 503267328, "step": 3840, "train_runtime": 7400.018, "train_tokens_per_second": 68008.933 }, { "epoch": 1.3893901118729701, "grad_norm": 1.796875, "learning_rate": 1.1060433602339502e-05, "loss": 2.223955535888672, "num_input_tokens_seen": 504578048, "step": 3850, "train_runtime": 7418.8214, "train_tokens_per_second": 68013.236 }, { "epoch": 1.3929989173583543, "grad_norm": 1.6484375, "learning_rate": 1.0940620379783195e-05, "loss": 2.2536026000976563, "num_input_tokens_seen": 505888768, "step": 3860, "train_runtime": 7437.601, "train_tokens_per_second": 68017.735 }, { "epoch": 1.3966077228437388, "grad_norm": 1.9453125, "learning_rate": 1.082127759814231e-05, "loss": 2.245090103149414, "num_input_tokens_seen": 507199488, "step": 3870, "train_runtime": 7456.3604, "train_tokens_per_second": 68022.394 }, { "epoch": 1.400216528329123, "grad_norm": 1.875, "learning_rate": 1.0702409250745751e-05, "loss": 2.2549039840698244, "num_input_tokens_seen": 508510208, "step": 3880, "train_runtime": 7475.13, "train_tokens_per_second": 68026.939 }, { "epoch": 1.4038253338145075, "grad_norm": 1.8359375, "learning_rate": 1.0584019315047423e-05, "loss": 2.2847557067871094, "num_input_tokens_seen": 509820928, "step": 3890, "train_runtime": 7493.8996, "train_tokens_per_second": 68031.46 }, { "epoch": 1.4074341392998917, "grad_norm": 1.890625, "learning_rate": 1.0466111752493077e-05, "loss": 2.2113019943237306, "num_input_tokens_seen": 511131648, "step": 3900, "train_runtime": 7512.6698, "train_tokens_per_second": 68035.953 }, { "epoch": 1.4110429447852761, "grad_norm": 1.6953125, "learning_rate": 1.034869050838779e-05, "loss": 2.2435705184936525, "num_input_tokens_seen": 512442368, "step": 3910, "train_runtime": 7534.829, "train_tokens_per_second": 68009.821 }, { "epoch": 1.4146517502706604, "grad_norm": 1.65625, "learning_rate": 1.0231759511763902e-05, "loss": 2.2892152786254885, "num_input_tokens_seen": 513753088, "step": 3920, "train_runtime": 7553.6258, "train_tokens_per_second": 68014.104 }, { "epoch": 1.4182605557560448, "grad_norm": 2.171875, "learning_rate": 1.0115322675249642e-05, "loss": 2.216525077819824, "num_input_tokens_seen": 515063808, "step": 3930, "train_runtime": 7572.4038, "train_tokens_per_second": 68018.534 }, { "epoch": 1.421869361241429, "grad_norm": 1.828125, "learning_rate": 9.999383894938086e-06, "loss": 2.2413888931274415, "num_input_tokens_seen": 516374528, "step": 3940, "train_runtime": 7591.1718, "train_tokens_per_second": 68023.033 }, { "epoch": 1.4254781667268135, "grad_norm": 1.796875, "learning_rate": 9.883947050256884e-06, "loss": 2.204883575439453, "num_input_tokens_seen": 517685248, "step": 3950, "train_runtime": 7609.9505, "train_tokens_per_second": 68027.413 }, { "epoch": 1.4290869722121977, "grad_norm": 1.8984375, "learning_rate": 9.769016003838421e-06, "loss": 2.215869140625, "num_input_tokens_seen": 518995968, "step": 3960, "train_runtime": 7628.7261, "train_tokens_per_second": 68031.8 }, { "epoch": 1.4326957776975822, "grad_norm": 1.6953125, "learning_rate": 9.654594601390534e-06, "loss": 2.277448844909668, "num_input_tokens_seen": 520306688, "step": 3970, "train_runtime": 7647.5178, "train_tokens_per_second": 68036.021 }, { "epoch": 1.4363045831829664, "grad_norm": 1.8046875, "learning_rate": 9.5406866715679e-06, "loss": 2.23470516204834, "num_input_tokens_seen": 521617408, "step": 3980, "train_runtime": 7666.2817, "train_tokens_per_second": 68040.47 }, { "epoch": 1.4399133886683508, "grad_norm": 1.7265625, "learning_rate": 9.427296025843862e-06, "loss": 2.2300508499145506, "num_input_tokens_seen": 522928128, "step": 3990, "train_runtime": 7685.0659, "train_tokens_per_second": 68044.716 }, { "epoch": 1.443522194153735, "grad_norm": 1.7421875, "learning_rate": 9.314426458382938e-06, "loss": 2.254155731201172, "num_input_tokens_seen": 524238848, "step": 4000, "train_runtime": 7703.8585, "train_tokens_per_second": 68048.867 }, { "epoch": 1.4471309996391195, "grad_norm": 1.9453125, "learning_rate": 9.20208174591383e-06, "loss": 2.233040618896484, "num_input_tokens_seen": 525549568, "step": 4010, "train_runtime": 7727.4509, "train_tokens_per_second": 68010.729 }, { "epoch": 1.4507398051245037, "grad_norm": 1.9453125, "learning_rate": 9.090265647603083e-06, "loss": 2.220596122741699, "num_input_tokens_seen": 526860288, "step": 4020, "train_runtime": 7746.2345, "train_tokens_per_second": 68015.019 }, { "epoch": 1.4543486106098882, "grad_norm": 1.796875, "learning_rate": 8.97898190492926e-06, "loss": 2.231102180480957, "num_input_tokens_seen": 528171008, "step": 4030, "train_runtime": 7765.0306, "train_tokens_per_second": 68019.18 }, { "epoch": 1.4579574160952724, "grad_norm": 1.5390625, "learning_rate": 8.868234241557788e-06, "loss": 2.213207244873047, "num_input_tokens_seen": 529481728, "step": 4040, "train_runtime": 7783.8347, "train_tokens_per_second": 68023.249 }, { "epoch": 1.4615662215806569, "grad_norm": 1.7734375, "learning_rate": 8.758026363216345e-06, "loss": 2.2278326034545897, "num_input_tokens_seen": 530792448, "step": 4050, "train_runtime": 7802.6402, "train_tokens_per_second": 68027.287 }, { "epoch": 1.465175027066041, "grad_norm": 2.109375, "learning_rate": 8.648361957570859e-06, "loss": 2.2364572525024413, "num_input_tokens_seen": 532103168, "step": 4060, "train_runtime": 7821.428, "train_tokens_per_second": 68031.46 }, { "epoch": 1.4687838325514255, "grad_norm": 1.5859375, "learning_rate": 8.539244694102107e-06, "loss": 2.2006353378295898, "num_input_tokens_seen": 533413888, "step": 4070, "train_runtime": 7840.2057, "train_tokens_per_second": 68035.7 }, { "epoch": 1.4723926380368098, "grad_norm": 1.71875, "learning_rate": 8.430678223982969e-06, "loss": 2.2076269149780274, "num_input_tokens_seen": 534724608, "step": 4080, "train_runtime": 7858.9877, "train_tokens_per_second": 68039.883 }, { "epoch": 1.4760014435221942, "grad_norm": 1.671875, "learning_rate": 8.322666179956188e-06, "loss": 2.2272457122802733, "num_input_tokens_seen": 536035328, "step": 4090, "train_runtime": 7877.7613, "train_tokens_per_second": 68044.119 }, { "epoch": 1.4796102490075784, "grad_norm": 1.7578125, "learning_rate": 8.21521217621288e-06, "loss": 2.2090341567993166, "num_input_tokens_seen": 537346048, "step": 4100, "train_runtime": 7896.5448, "train_tokens_per_second": 68048.25 }, { "epoch": 1.4832190544929629, "grad_norm": 1.6640625, "learning_rate": 8.10831980827158e-06, "loss": 2.2423015594482423, "num_input_tokens_seen": 538656768, "step": 4110, "train_runtime": 7917.941, "train_tokens_per_second": 68029.904 }, { "epoch": 1.486827859978347, "grad_norm": 1.6953125, "learning_rate": 8.001992652857912e-06, "loss": 2.2490259170532227, "num_input_tokens_seen": 539967488, "step": 4120, "train_runtime": 7936.7037, "train_tokens_per_second": 68034.225 }, { "epoch": 1.4904366654637315, "grad_norm": 1.7421875, "learning_rate": 7.896234267784927e-06, "loss": 2.231982421875, "num_input_tokens_seen": 541278208, "step": 4130, "train_runtime": 7955.4671, "train_tokens_per_second": 68038.52 }, { "epoch": 1.4940454709491158, "grad_norm": 1.84375, "learning_rate": 7.791048191834065e-06, "loss": 2.2456960678100586, "num_input_tokens_seen": 542588928, "step": 4140, "train_runtime": 7974.2373, "train_tokens_per_second": 68042.736 }, { "epoch": 1.4976542764345002, "grad_norm": 1.5546875, "learning_rate": 7.686437944636699e-06, "loss": 2.2039539337158205, "num_input_tokens_seen": 543899648, "step": 4150, "train_runtime": 7993.0139, "train_tokens_per_second": 68046.878 }, { "epoch": 1.5012630819198844, "grad_norm": 1.546875, "learning_rate": 7.582407026556423e-06, "loss": 2.240394401550293, "num_input_tokens_seen": 545210368, "step": 4160, "train_runtime": 8011.786, "train_tokens_per_second": 68051.04 }, { "epoch": 1.504871887405269, "grad_norm": 1.71875, "learning_rate": 7.478958918571899e-06, "loss": 2.2381542205810545, "num_input_tokens_seen": 546521088, "step": 4170, "train_runtime": 8030.5448, "train_tokens_per_second": 68055.294 }, { "epoch": 1.5084806928906533, "grad_norm": 1.7578125, "learning_rate": 7.376097082160344e-06, "loss": 2.263725471496582, "num_input_tokens_seen": 547831808, "step": 4180, "train_runtime": 8049.3053, "train_tokens_per_second": 68059.514 }, { "epoch": 1.5120894983760376, "grad_norm": 1.640625, "learning_rate": 7.273824959181805e-06, "loss": 2.261068916320801, "num_input_tokens_seen": 549142528, "step": 4190, "train_runtime": 8068.0708, "train_tokens_per_second": 68063.672 }, { "epoch": 1.5156983038614218, "grad_norm": 1.6328125, "learning_rate": 7.172145971763858e-06, "loss": 2.2464086532592775, "num_input_tokens_seen": 550453248, "step": 4200, "train_runtime": 8086.8528, "train_tokens_per_second": 68067.673 }, { "epoch": 1.5193071093468062, "grad_norm": 1.7421875, "learning_rate": 7.071063522187218e-06, "loss": 2.190806198120117, "num_input_tokens_seen": 551763968, "step": 4210, "train_runtime": 8108.814, "train_tokens_per_second": 68044.965 }, { "epoch": 1.5229159148321907, "grad_norm": 1.59375, "learning_rate": 6.970580992771828e-06, "loss": 2.264400291442871, "num_input_tokens_seen": 553074688, "step": 4220, "train_runtime": 8127.6062, "train_tokens_per_second": 68048.903 }, { "epoch": 1.526524720317575, "grad_norm": 1.609375, "learning_rate": 6.870701745763708e-06, "loss": 2.209558868408203, "num_input_tokens_seen": 554385408, "step": 4230, "train_runtime": 8146.3988, "train_tokens_per_second": 68052.82 }, { "epoch": 1.5301335258029591, "grad_norm": 1.8203125, "learning_rate": 6.771429123222433e-06, "loss": 2.247188377380371, "num_input_tokens_seen": 555696128, "step": 4240, "train_runtime": 8165.1848, "train_tokens_per_second": 68056.773 }, { "epoch": 1.5337423312883436, "grad_norm": 2.046875, "learning_rate": 6.672766446909326e-06, "loss": 2.1808168411254885, "num_input_tokens_seen": 557006848, "step": 4250, "train_runtime": 8183.9739, "train_tokens_per_second": 68060.683 }, { "epoch": 1.537351136773728, "grad_norm": 1.5078125, "learning_rate": 6.574717018176299e-06, "loss": 2.2411041259765625, "num_input_tokens_seen": 558317568, "step": 4260, "train_runtime": 8202.7537, "train_tokens_per_second": 68064.651 }, { "epoch": 1.5409599422591123, "grad_norm": 1.8671875, "learning_rate": 6.477284117855381e-06, "loss": 2.2084012985229493, "num_input_tokens_seen": 559628288, "step": 4270, "train_runtime": 8221.5449, "train_tokens_per_second": 68068.507 }, { "epoch": 1.5445687477444965, "grad_norm": 1.671875, "learning_rate": 6.380471006148953e-06, "loss": 2.2226863861083985, "num_input_tokens_seen": 560939008, "step": 4280, "train_runtime": 8240.3269, "train_tokens_per_second": 68072.422 }, { "epoch": 1.548177553229881, "grad_norm": 1.6015625, "learning_rate": 6.284280922520644e-06, "loss": 2.2183189392089844, "num_input_tokens_seen": 562249728, "step": 4290, "train_runtime": 8259.111, "train_tokens_per_second": 68076.301 }, { "epoch": 1.5517863587152654, "grad_norm": 1.796875, "learning_rate": 6.188717085586923e-06, "loss": 2.2236093521118163, "num_input_tokens_seen": 563560448, "step": 4300, "train_runtime": 8277.9212, "train_tokens_per_second": 68079.948 }, { "epoch": 1.5553951642006496, "grad_norm": 1.5234375, "learning_rate": 6.0937826930094425e-06, "loss": 2.2661991119384766, "num_input_tokens_seen": 564871168, "step": 4310, "train_runtime": 8301.5548, "train_tokens_per_second": 68044.021 }, { "epoch": 1.5590039696860338, "grad_norm": 1.7265625, "learning_rate": 5.999480921388001e-06, "loss": 2.2453027725219727, "num_input_tokens_seen": 566181888, "step": 4320, "train_runtime": 8320.3497, "train_tokens_per_second": 68047.847 }, { "epoch": 1.5626127751714183, "grad_norm": 1.8125, "learning_rate": 5.90581492615428e-06, "loss": 2.22461051940918, "num_input_tokens_seen": 567492608, "step": 4330, "train_runtime": 8339.1504, "train_tokens_per_second": 68051.609 }, { "epoch": 1.5662215806568027, "grad_norm": 1.671875, "learning_rate": 5.812787841466233e-06, "loss": 2.2348844528198244, "num_input_tokens_seen": 568803328, "step": 4340, "train_runtime": 8357.927, "train_tokens_per_second": 68055.551 }, { "epoch": 1.569830386142187, "grad_norm": 1.7265625, "learning_rate": 5.7204027801032404e-06, "loss": 2.2349353790283204, "num_input_tokens_seen": 570114048, "step": 4350, "train_runtime": 8376.7006, "train_tokens_per_second": 68059.499 }, { "epoch": 1.5734391916275712, "grad_norm": 1.875, "learning_rate": 5.6286628333619196e-06, "loss": 2.2075759887695314, "num_input_tokens_seen": 571424768, "step": 4360, "train_runtime": 8395.4768, "train_tokens_per_second": 68063.409 }, { "epoch": 1.5770479971129556, "grad_norm": 1.7890625, "learning_rate": 5.537571070952727e-06, "loss": 2.206249809265137, "num_input_tokens_seen": 572735488, "step": 4370, "train_runtime": 8414.2644, "train_tokens_per_second": 68067.208 }, { "epoch": 1.58065680259834, "grad_norm": 1.6875, "learning_rate": 5.4471305408972215e-06, "loss": 2.2273490905761717, "num_input_tokens_seen": 574046208, "step": 4380, "train_runtime": 8433.0466, "train_tokens_per_second": 68071.034 }, { "epoch": 1.5842656080837243, "grad_norm": 1.640625, "learning_rate": 5.357344269426046e-06, "loss": 2.2429645538330076, "num_input_tokens_seen": 575356928, "step": 4390, "train_runtime": 8451.8411, "train_tokens_per_second": 68074.745 }, { "epoch": 1.5878744135691085, "grad_norm": 1.65625, "learning_rate": 5.268215260877749e-06, "loss": 2.268222427368164, "num_input_tokens_seen": 576667648, "step": 4400, "train_runtime": 8470.6315, "train_tokens_per_second": 68078.472 }, { "epoch": 1.591483219054493, "grad_norm": 1.609375, "learning_rate": 5.179746497598154e-06, "loss": 2.2321073532104494, "num_input_tokens_seen": 577978368, "step": 4410, "train_runtime": 8492.2709, "train_tokens_per_second": 68059.342 }, { "epoch": 1.5950920245398774, "grad_norm": 1.6328125, "learning_rate": 5.091940939840639e-06, "loss": 2.2371564865112306, "num_input_tokens_seen": 579289088, "step": 4420, "train_runtime": 8511.0351, "train_tokens_per_second": 68063.295 }, { "epoch": 1.5987008300252616, "grad_norm": 1.578125, "learning_rate": 5.004801525667063e-06, "loss": 2.235270690917969, "num_input_tokens_seen": 580599808, "step": 4430, "train_runtime": 8529.8242, "train_tokens_per_second": 68067.031 }, { "epoch": 1.6023096355106459, "grad_norm": 1.5859375, "learning_rate": 4.918331170849458e-06, "loss": 2.210706901550293, "num_input_tokens_seen": 581910528, "step": 4440, "train_runtime": 8548.5848, "train_tokens_per_second": 68070.978 }, { "epoch": 1.6059184409960303, "grad_norm": 1.7265625, "learning_rate": 4.832532768772427e-06, "loss": 2.240275573730469, "num_input_tokens_seen": 583221248, "step": 4450, "train_runtime": 8567.3411, "train_tokens_per_second": 68074.942 }, { "epoch": 1.6095272464814148, "grad_norm": 1.5546875, "learning_rate": 4.747409190336419e-06, "loss": 2.208348274230957, "num_input_tokens_seen": 584531968, "step": 4460, "train_runtime": 8586.1174, "train_tokens_per_second": 68078.73 }, { "epoch": 1.613136051966799, "grad_norm": 1.578125, "learning_rate": 4.662963283861552e-06, "loss": 2.232676315307617, "num_input_tokens_seen": 585842688, "step": 4470, "train_runtime": 8604.862, "train_tokens_per_second": 68082.752 }, { "epoch": 1.6167448574521832, "grad_norm": 1.546875, "learning_rate": 4.579197874992397e-06, "loss": 2.217829704284668, "num_input_tokens_seen": 587153408, "step": 4480, "train_runtime": 8623.6217, "train_tokens_per_second": 68086.638 }, { "epoch": 1.6203536629375677, "grad_norm": 1.6953125, "learning_rate": 4.496115766603381e-06, "loss": 2.230474853515625, "num_input_tokens_seen": 588464128, "step": 4490, "train_runtime": 8642.3776, "train_tokens_per_second": 68090.537 }, { "epoch": 1.623962468422952, "grad_norm": 1.6640625, "learning_rate": 4.413719738705022e-06, "loss": 2.259794998168945, "num_input_tokens_seen": 589774848, "step": 4500, "train_runtime": 8661.1385, "train_tokens_per_second": 68094.379 }, { "epoch": 1.6275712739083363, "grad_norm": 1.4609375, "learning_rate": 4.332012548350869e-06, "loss": 2.2199661254882814, "num_input_tokens_seen": 591085568, "step": 4510, "train_runtime": 8683.6098, "train_tokens_per_second": 68069.107 }, { "epoch": 1.6311800793937206, "grad_norm": 1.765625, "learning_rate": 4.250996929545328e-06, "loss": 2.2052333831787108, "num_input_tokens_seen": 592396288, "step": 4520, "train_runtime": 8702.383, "train_tokens_per_second": 68072.882 }, { "epoch": 1.634788884879105, "grad_norm": 1.5859375, "learning_rate": 4.170675593152084e-06, "loss": 2.22857780456543, "num_input_tokens_seen": 593707008, "step": 4530, "train_runtime": 8721.1218, "train_tokens_per_second": 68076.908 }, { "epoch": 1.6383976903644895, "grad_norm": 1.59375, "learning_rate": 4.091051226803455e-06, "loss": 2.2302345275878905, "num_input_tokens_seen": 595017728, "step": 4540, "train_runtime": 8739.8538, "train_tokens_per_second": 68080.97 }, { "epoch": 1.6420064958498737, "grad_norm": 1.6171875, "learning_rate": 4.012126494810442e-06, "loss": 2.2529813766479494, "num_input_tokens_seen": 596328448, "step": 4550, "train_runtime": 8758.5938, "train_tokens_per_second": 68084.953 }, { "epoch": 1.645615301335258, "grad_norm": 1.5703125, "learning_rate": 3.933904038073591e-06, "loss": 2.236446571350098, "num_input_tokens_seen": 597639168, "step": 4560, "train_runtime": 8777.3287, "train_tokens_per_second": 68088.958 }, { "epoch": 1.6492241068206424, "grad_norm": 1.6953125, "learning_rate": 3.856386473994586e-06, "loss": 2.2221988677978515, "num_input_tokens_seen": 598949888, "step": 4570, "train_runtime": 8796.0733, "train_tokens_per_second": 68092.871 }, { "epoch": 1.6528329123060268, "grad_norm": 1.578125, "learning_rate": 3.7795763963887285e-06, "loss": 2.2259494781494142, "num_input_tokens_seen": 600260608, "step": 4580, "train_runtime": 8814.8099, "train_tokens_per_second": 68096.829 }, { "epoch": 1.656441717791411, "grad_norm": 1.71875, "learning_rate": 3.703476375398102e-06, "loss": 2.192581367492676, "num_input_tokens_seen": 601571328, "step": 4590, "train_runtime": 8833.5575, "train_tokens_per_second": 68100.686 }, { "epoch": 1.6600505232767953, "grad_norm": 1.734375, "learning_rate": 3.6280889574055705e-06, "loss": 2.192411422729492, "num_input_tokens_seen": 602882048, "step": 4600, "train_runtime": 8852.2952, "train_tokens_per_second": 68104.603 }, { "epoch": 1.6636593287621797, "grad_norm": 2.1875, "learning_rate": 3.5534166649496214e-06, "loss": 2.221910095214844, "num_input_tokens_seen": 604192768, "step": 4610, "train_runtime": 8873.4058, "train_tokens_per_second": 68090.289 }, { "epoch": 1.6672681342475641, "grad_norm": 1.5, "learning_rate": 3.4794619966398933e-06, "loss": 2.2242570877075196, "num_input_tokens_seen": 605503488, "step": 4620, "train_runtime": 8892.1416, "train_tokens_per_second": 68094.224 }, { "epoch": 1.6708769397329484, "grad_norm": 2.0, "learning_rate": 3.4062274270736188e-06, "loss": 2.250449371337891, "num_input_tokens_seen": 606814208, "step": 4630, "train_runtime": 8910.8743, "train_tokens_per_second": 68098.167 }, { "epoch": 1.6744857452183326, "grad_norm": 1.6015625, "learning_rate": 3.333715406752802e-06, "loss": 2.212891387939453, "num_input_tokens_seen": 608124928, "step": 4640, "train_runtime": 8929.6138, "train_tokens_per_second": 68102.042 }, { "epoch": 1.678094550703717, "grad_norm": 1.671875, "learning_rate": 3.261928362002237e-06, "loss": 2.264537239074707, "num_input_tokens_seen": 609435648, "step": 4650, "train_runtime": 8948.3657, "train_tokens_per_second": 68105.805 }, { "epoch": 1.6817033561891015, "grad_norm": 1.7734375, "learning_rate": 3.190868694888277e-06, "loss": 2.2667461395263673, "num_input_tokens_seen": 610746368, "step": 4660, "train_runtime": 8967.1058, "train_tokens_per_second": 68109.642 }, { "epoch": 1.6853121616744857, "grad_norm": 1.6484375, "learning_rate": 3.120538783138538e-06, "loss": 2.1905519485473635, "num_input_tokens_seen": 612057088, "step": 4670, "train_runtime": 8985.8457, "train_tokens_per_second": 68113.465 }, { "epoch": 1.68892096715987, "grad_norm": 1.671875, "learning_rate": 3.050940980062253e-06, "loss": 2.1842899322509766, "num_input_tokens_seen": 613367808, "step": 4680, "train_runtime": 9004.585, "train_tokens_per_second": 68117.276 }, { "epoch": 1.6925297726452544, "grad_norm": 1.484375, "learning_rate": 2.982077614471579e-06, "loss": 2.238359260559082, "num_input_tokens_seen": 614678528, "step": 4690, "train_runtime": 9023.3179, "train_tokens_per_second": 68121.121 }, { "epoch": 1.6961385781306388, "grad_norm": 1.46875, "learning_rate": 2.913950990603667e-06, "loss": 2.265069770812988, "num_input_tokens_seen": 615989248, "step": 4700, "train_runtime": 9042.0664, "train_tokens_per_second": 68124.831 }, { "epoch": 1.699747383616023, "grad_norm": 1.484375, "learning_rate": 2.8465633880435465e-06, "loss": 2.24379825592041, "num_input_tokens_seen": 617299968, "step": 4710, "train_runtime": 9062.9577, "train_tokens_per_second": 68112.418 }, { "epoch": 1.7033561891014073, "grad_norm": 1.4921875, "learning_rate": 2.779917061647841e-06, "loss": 2.1853158950805662, "num_input_tokens_seen": 618610688, "step": 4720, "train_runtime": 9081.7043, "train_tokens_per_second": 68116.145 }, { "epoch": 1.7069649945867917, "grad_norm": 1.5546875, "learning_rate": 2.714014241469362e-06, "loss": 2.2281778335571287, "num_input_tokens_seen": 619921408, "step": 4730, "train_runtime": 9100.4405, "train_tokens_per_second": 68119.934 }, { "epoch": 1.7105738000721762, "grad_norm": 1.734375, "learning_rate": 2.6488571326824253e-06, "loss": 2.202262115478516, "num_input_tokens_seen": 621232128, "step": 4740, "train_runtime": 9119.1797, "train_tokens_per_second": 68123.685 }, { "epoch": 1.7141826055575604, "grad_norm": 1.7890625, "learning_rate": 2.5844479155091194e-06, "loss": 2.1780315399169923, "num_input_tokens_seen": 622542848, "step": 4750, "train_runtime": 9137.9257, "train_tokens_per_second": 68127.37 }, { "epoch": 1.7177914110429446, "grad_norm": 1.5625, "learning_rate": 2.5207887451463243e-06, "loss": 2.200862693786621, "num_input_tokens_seen": 623853568, "step": 4760, "train_runtime": 9156.6728, "train_tokens_per_second": 68131.032 }, { "epoch": 1.721400216528329, "grad_norm": 1.7890625, "learning_rate": 2.457881751693608e-06, "loss": 2.237129974365234, "num_input_tokens_seen": 625164288, "step": 4770, "train_runtime": 9175.4262, "train_tokens_per_second": 68134.632 }, { "epoch": 1.7250090220137135, "grad_norm": 1.578125, "learning_rate": 2.395729040081926e-06, "loss": 2.252490234375, "num_input_tokens_seen": 626475008, "step": 4780, "train_runtime": 9194.161, "train_tokens_per_second": 68138.355 }, { "epoch": 1.7286178274990978, "grad_norm": 1.5546875, "learning_rate": 2.3343326900032353e-06, "loss": 2.231769561767578, "num_input_tokens_seen": 627785728, "step": 4790, "train_runtime": 9212.9018, "train_tokens_per_second": 68142.019 }, { "epoch": 1.732226632984482, "grad_norm": 1.578125, "learning_rate": 2.273694755840866e-06, "loss": 2.228584098815918, "num_input_tokens_seen": 629096448, "step": 4800, "train_runtime": 9231.6555, "train_tokens_per_second": 68145.572 }, { "epoch": 1.7358354384698664, "grad_norm": 1.6953125, "learning_rate": 2.213817266600779e-06, "loss": 2.1512102127075194, "num_input_tokens_seen": 630407168, "step": 4810, "train_runtime": 9253.1307, "train_tokens_per_second": 68129.068 }, { "epoch": 1.7394442439552509, "grad_norm": 1.6796875, "learning_rate": 2.1547022258437242e-06, "loss": 2.2559492111206056, "num_input_tokens_seen": 631717888, "step": 4820, "train_runtime": 9271.8937, "train_tokens_per_second": 68132.564 }, { "epoch": 1.743053049440635, "grad_norm": 1.703125, "learning_rate": 2.096351611618122e-06, "loss": 2.210666465759277, "num_input_tokens_seen": 633028608, "step": 4830, "train_runtime": 9290.6467, "train_tokens_per_second": 68136.119 }, { "epoch": 1.7466618549260193, "grad_norm": 1.578125, "learning_rate": 2.038767376393938e-06, "loss": 2.2592681884765624, "num_input_tokens_seen": 634339328, "step": 4840, "train_runtime": 9309.4019, "train_tokens_per_second": 68139.644 }, { "epoch": 1.7502706604114038, "grad_norm": 1.453125, "learning_rate": 1.981951446997324e-06, "loss": 2.220474624633789, "num_input_tokens_seen": 635650048, "step": 4850, "train_runtime": 9328.1684, "train_tokens_per_second": 68143.072 }, { "epoch": 1.7538794658967882, "grad_norm": 1.7734375, "learning_rate": 1.9259057245461538e-06, "loss": 2.2094629287719725, "num_input_tokens_seen": 636960768, "step": 4860, "train_runtime": 9346.9304, "train_tokens_per_second": 68146.518 }, { "epoch": 1.7574882713821725, "grad_norm": 1.4609375, "learning_rate": 1.8706320843863866e-06, "loss": 2.202382469177246, "num_input_tokens_seen": 638271488, "step": 4870, "train_runtime": 9365.6906, "train_tokens_per_second": 68149.966 }, { "epoch": 1.7610970768675567, "grad_norm": 1.53125, "learning_rate": 1.8161323760293725e-06, "loss": 2.229145050048828, "num_input_tokens_seen": 639582208, "step": 4880, "train_runtime": 9384.4542, "train_tokens_per_second": 68153.373 }, { "epoch": 1.7647058823529411, "grad_norm": 1.5625, "learning_rate": 1.7624084230898924e-06, "loss": 2.223577880859375, "num_input_tokens_seen": 640892928, "step": 4890, "train_runtime": 9403.2096, "train_tokens_per_second": 68156.826 }, { "epoch": 1.7683146878383256, "grad_norm": 1.671875, "learning_rate": 1.7094620232251946e-06, "loss": 2.228153038024902, "num_input_tokens_seen": 642203648, "step": 4900, "train_runtime": 9421.9676, "train_tokens_per_second": 68160.248 }, { "epoch": 1.7719234933237098, "grad_norm": 1.78125, "learning_rate": 1.6572949480748113e-06, "loss": 2.235420036315918, "num_input_tokens_seen": 643514368, "step": 4910, "train_runtime": 9443.3216, "train_tokens_per_second": 68144.917 }, { "epoch": 1.7755322988090942, "grad_norm": 1.609375, "learning_rate": 1.6059089432013064e-06, "loss": 2.2352012634277343, "num_input_tokens_seen": 644825088, "step": 4920, "train_runtime": 9462.075, "train_tokens_per_second": 68148.381 }, { "epoch": 1.7791411042944785, "grad_norm": 1.53125, "learning_rate": 1.5553057280318251e-06, "loss": 2.2525297164916993, "num_input_tokens_seen": 646135808, "step": 4930, "train_runtime": 9480.8219, "train_tokens_per_second": 68151.877 }, { "epoch": 1.782749909779863, "grad_norm": 1.6171875, "learning_rate": 1.5054869958006174e-06, "loss": 2.228093910217285, "num_input_tokens_seen": 647446528, "step": 4940, "train_runtime": 9499.558, "train_tokens_per_second": 68155.437 }, { "epoch": 1.7863587152652474, "grad_norm": 2.15625, "learning_rate": 1.456454413492317e-06, "loss": 2.2367706298828125, "num_input_tokens_seen": 648757248, "step": 4950, "train_runtime": 9518.3108, "train_tokens_per_second": 68158.863 }, { "epoch": 1.7899675207506316, "grad_norm": 1.5703125, "learning_rate": 1.4082096217862162e-06, "loss": 2.2130949020385744, "num_input_tokens_seen": 650067968, "step": 4960, "train_runtime": 9537.0656, "train_tokens_per_second": 68162.263 }, { "epoch": 1.7935763262360158, "grad_norm": 1.8828125, "learning_rate": 1.360754235001338e-06, "loss": 2.201351356506348, "num_input_tokens_seen": 651378688, "step": 4970, "train_runtime": 9555.8186, "train_tokens_per_second": 68165.661 }, { "epoch": 1.7971851317214003, "grad_norm": 1.9609375, "learning_rate": 1.314089841042429e-06, "loss": 2.2226787567138673, "num_input_tokens_seen": 652689408, "step": 4980, "train_runtime": 9574.564, "train_tokens_per_second": 68169.1 }, { "epoch": 1.8007939372067847, "grad_norm": 1.5703125, "learning_rate": 1.268218001346816e-06, "loss": 2.2285099029541016, "num_input_tokens_seen": 654000128, "step": 4990, "train_runtime": 9593.3228, "train_tokens_per_second": 68172.43 }, { "epoch": 1.804402742692169, "grad_norm": 1.546875, "learning_rate": 1.223140250832172e-06, "loss": 2.202241134643555, "num_input_tokens_seen": 655310848, "step": 5000, "train_runtime": 9612.0872, "train_tokens_per_second": 68175.708 }, { "epoch": 1.8080115481775532, "grad_norm": 1.546875, "learning_rate": 1.1788580978451563e-06, "loss": 2.2288558959960936, "num_input_tokens_seen": 656621568, "step": 5010, "train_runtime": 9634.3299, "train_tokens_per_second": 68154.358 }, { "epoch": 1.8116203536629376, "grad_norm": 1.5703125, "learning_rate": 1.1353730241109306e-06, "loss": 2.193297576904297, "num_input_tokens_seen": 657932288, "step": 5020, "train_runtime": 9653.1015, "train_tokens_per_second": 68157.606 }, { "epoch": 1.815229159148322, "grad_norm": 1.734375, "learning_rate": 1.0926864846835971e-06, "loss": 2.177206039428711, "num_input_tokens_seen": 659243008, "step": 5030, "train_runtime": 9671.8746, "train_tokens_per_second": 68160.831 }, { "epoch": 1.8188379646337063, "grad_norm": 1.6171875, "learning_rate": 1.0507999078974845e-06, "loss": 2.1820747375488283, "num_input_tokens_seen": 660553728, "step": 5040, "train_runtime": 9690.6417, "train_tokens_per_second": 68164.085 }, { "epoch": 1.8224467701190905, "grad_norm": 2.03125, "learning_rate": 1.009714695319386e-06, "loss": 2.227157974243164, "num_input_tokens_seen": 661864448, "step": 5050, "train_runtime": 9709.4146, "train_tokens_per_second": 68167.286 }, { "epoch": 1.826055575604475, "grad_norm": 1.6953125, "learning_rate": 9.694322217016356e-07, "loss": 2.228900337219238, "num_input_tokens_seen": 663175168, "step": 5060, "train_runtime": 9728.1932, "train_tokens_per_second": 68170.436 }, { "epoch": 1.8296643810898594, "grad_norm": 1.6640625, "learning_rate": 9.299538349361259e-07, "loss": 2.2359861373901366, "num_input_tokens_seen": 664485888, "step": 5070, "train_runtime": 9746.9578, "train_tokens_per_second": 68173.671 }, { "epoch": 1.8332731865752436, "grad_norm": 1.6015625, "learning_rate": 8.912808560091967e-07, "loss": 2.2222143173217774, "num_input_tokens_seen": 665796608, "step": 5080, "train_runtime": 9765.7217, "train_tokens_per_second": 68176.897 }, { "epoch": 1.8368819920606279, "grad_norm": 1.6484375, "learning_rate": 8.534145789574371e-07, "loss": 2.2080410003662108, "num_input_tokens_seen": 667107328, "step": 5090, "train_runtime": 9784.5016, "train_tokens_per_second": 68180.001 }, { "epoch": 1.8404907975460123, "grad_norm": 1.8203125, "learning_rate": 8.163562708243727e-07, "loss": 2.211821746826172, "num_input_tokens_seen": 668418048, "step": 5100, "train_runtime": 9803.3054, "train_tokens_per_second": 68182.926 }, { "epoch": 1.8440996030313968, "grad_norm": 1.734375, "learning_rate": 7.801071716180942e-07, "loss": 2.2246419906616213, "num_input_tokens_seen": 669728768, "step": 5110, "train_runtime": 9824.067, "train_tokens_per_second": 68172.252 }, { "epoch": 1.847708408516781, "grad_norm": 1.6171875, "learning_rate": 7.446684942697429e-07, "loss": 2.250296974182129, "num_input_tokens_seen": 671039488, "step": 5120, "train_runtime": 9842.8864, "train_tokens_per_second": 68175.072 }, { "epoch": 1.8513172140021652, "grad_norm": 1.453125, "learning_rate": 7.100414245929387e-07, "loss": 2.2182559967041016, "num_input_tokens_seen": 672350208, "step": 5130, "train_runtime": 9861.7076, "train_tokens_per_second": 68177.869 }, { "epoch": 1.8549260194875496, "grad_norm": 1.53125, "learning_rate": 6.762271212440968e-07, "loss": 2.2014060974121095, "num_input_tokens_seen": 673660928, "step": 5140, "train_runtime": 9880.5279, "train_tokens_per_second": 68180.662 }, { "epoch": 1.858534824972934, "grad_norm": 1.671875, "learning_rate": 6.432267156836536e-07, "loss": 2.208943176269531, "num_input_tokens_seen": 674971648, "step": 5150, "train_runtime": 9899.3276, "train_tokens_per_second": 68183.585 }, { "epoch": 1.8621436304583183, "grad_norm": 1.5625, "learning_rate": 6.11041312138208e-07, "loss": 2.259289360046387, "num_input_tokens_seen": 676282368, "step": 5160, "train_runtime": 9918.1504, "train_tokens_per_second": 68186.339 }, { "epoch": 1.8657524359437025, "grad_norm": 1.578125, "learning_rate": 5.79671987563582e-07, "loss": 2.1752920150756836, "num_input_tokens_seen": 677593088, "step": 5170, "train_runtime": 9936.975, "train_tokens_per_second": 68189.071 }, { "epoch": 1.869361241429087, "grad_norm": 1.6796875, "learning_rate": 5.491197916087793e-07, "loss": 2.2144365310668945, "num_input_tokens_seen": 678903808, "step": 5180, "train_runtime": 9955.7814, "train_tokens_per_second": 68191.916 }, { "epoch": 1.8729700469144714, "grad_norm": 1.6015625, "learning_rate": 5.193857465808583e-07, "loss": 2.2590240478515624, "num_input_tokens_seen": 680214528, "step": 5190, "train_runtime": 9974.5773, "train_tokens_per_second": 68194.822 }, { "epoch": 1.8765788523998557, "grad_norm": 1.40625, "learning_rate": 4.904708474107261e-07, "loss": 2.255119514465332, "num_input_tokens_seen": 681525248, "step": 5200, "train_runtime": 9993.386, "train_tokens_per_second": 68197.631 }, { "epoch": 1.88018765788524, "grad_norm": 1.796875, "learning_rate": 4.623760616198569e-07, "loss": 2.1574798583984376, "num_input_tokens_seen": 682835968, "step": 5210, "train_runtime": 10014.7601, "train_tokens_per_second": 68182.958 }, { "epoch": 1.8837964633706243, "grad_norm": 1.703125, "learning_rate": 4.3510232928790084e-07, "loss": 2.2060054779052733, "num_input_tokens_seen": 684146688, "step": 5220, "train_runtime": 10033.5706, "train_tokens_per_second": 68185.765 }, { "epoch": 1.8874052688560088, "grad_norm": 1.515625, "learning_rate": 4.086505630212456e-07, "loss": 2.207899284362793, "num_input_tokens_seen": 685457408, "step": 5230, "train_runtime": 10052.3542, "train_tokens_per_second": 68188.744 }, { "epoch": 1.891014074341393, "grad_norm": 1.625, "learning_rate": 3.8302164792246853e-07, "loss": 2.236598587036133, "num_input_tokens_seen": 686768128, "step": 5240, "train_runtime": 10071.1601, "train_tokens_per_second": 68191.561 }, { "epoch": 1.8946228798267772, "grad_norm": 1.6015625, "learning_rate": 3.5821644156071865e-07, "loss": 2.226085090637207, "num_input_tokens_seen": 688078848, "step": 5250, "train_runtime": 10089.9449, "train_tokens_per_second": 68194.51 }, { "epoch": 1.8982316853121617, "grad_norm": 1.515625, "learning_rate": 3.342357739430396e-07, "loss": 2.2597679138183593, "num_input_tokens_seen": 689389568, "step": 5260, "train_runtime": 10108.7258, "train_tokens_per_second": 68197.474 }, { "epoch": 1.9018404907975461, "grad_norm": 1.7265625, "learning_rate": 3.1108044748656694e-07, "loss": 2.1886007308959963, "num_input_tokens_seen": 690700288, "step": 5270, "train_runtime": 10127.4997, "train_tokens_per_second": 68200.475 }, { "epoch": 1.9054492962829304, "grad_norm": 1.6640625, "learning_rate": 2.887512369917023e-07, "loss": 2.2221187591552733, "num_input_tokens_seen": 692011008, "step": 5280, "train_runtime": 10146.266, "train_tokens_per_second": 68203.515 }, { "epoch": 1.9090581017683146, "grad_norm": 1.6953125, "learning_rate": 2.6724888961618397e-07, "loss": 2.243001174926758, "num_input_tokens_seen": 693321728, "step": 5290, "train_runtime": 10165.0258, "train_tokens_per_second": 68206.588 }, { "epoch": 1.912666907253699, "grad_norm": 1.59375, "learning_rate": 2.4657412485007967e-07, "loss": 2.205171012878418, "num_input_tokens_seen": 694632448, "step": 5300, "train_runtime": 10183.8138, "train_tokens_per_second": 68209.461 }, { "epoch": 1.9162757127390835, "grad_norm": 1.640625, "learning_rate": 2.2672763449170799e-07, "loss": 2.2328046798706054, "num_input_tokens_seen": 695943168, "step": 5310, "train_runtime": 10204.819, "train_tokens_per_second": 68197.502 }, { "epoch": 1.9198845182244677, "grad_norm": 1.640625, "learning_rate": 2.0771008262450707e-07, "loss": 2.2248144149780273, "num_input_tokens_seen": 697253888, "step": 5320, "train_runtime": 10223.5749, "train_tokens_per_second": 68200.595 }, { "epoch": 1.923493323709852, "grad_norm": 1.734375, "learning_rate": 1.8952210559479432e-07, "loss": 2.2253623962402345, "num_input_tokens_seen": 698564608, "step": 5330, "train_runtime": 10242.3298, "train_tokens_per_second": 68203.682 }, { "epoch": 1.9271021291952364, "grad_norm": 1.6640625, "learning_rate": 1.7216431199049145e-07, "loss": 2.2415798187255858, "num_input_tokens_seen": 699875328, "step": 5340, "train_runtime": 10261.0809, "train_tokens_per_second": 68206.784 }, { "epoch": 1.9307109346806208, "grad_norm": 1.78125, "learning_rate": 1.556372826207464e-07, "loss": 2.24045352935791, "num_input_tokens_seen": 701186048, "step": 5350, "train_runtime": 10279.8347, "train_tokens_per_second": 68209.856 }, { "epoch": 1.934319740166005, "grad_norm": 1.4765625, "learning_rate": 1.3994157049650737e-07, "loss": 2.2292993545532225, "num_input_tokens_seen": 702496768, "step": 5360, "train_runtime": 10298.5974, "train_tokens_per_second": 68212.859 }, { "epoch": 1.9379285456513893, "grad_norm": 1.59375, "learning_rate": 1.2507770081200964e-07, "loss": 2.2077713012695312, "num_input_tokens_seen": 703807488, "step": 5370, "train_runtime": 10317.363, "train_tokens_per_second": 68215.831 }, { "epoch": 1.9415373511367737, "grad_norm": 1.7265625, "learning_rate": 1.1104617092720926e-07, "loss": 2.202245330810547, "num_input_tokens_seen": 705118208, "step": 5380, "train_runtime": 10336.1259, "train_tokens_per_second": 68218.81 }, { "epoch": 1.9451461566221582, "grad_norm": 1.6015625, "learning_rate": 9.784745035114895e-08, "loss": 2.1991958618164062, "num_input_tokens_seen": 706428928, "step": 5390, "train_runtime": 10354.8973, "train_tokens_per_second": 68221.722 }, { "epoch": 1.9487549621075424, "grad_norm": 2.484375, "learning_rate": 8.548198072622637e-08, "loss": 2.215988349914551, "num_input_tokens_seen": 707739648, "step": 5400, "train_runtime": 10373.6656, "train_tokens_per_second": 68224.644 }, { "epoch": 1.9523637675929266, "grad_norm": 1.5625, "learning_rate": 7.395017581343366e-08, "loss": 2.194872283935547, "num_input_tokens_seen": 709050368, "step": 5410, "train_runtime": 10394.6889, "train_tokens_per_second": 68212.755 }, { "epoch": 1.955972573078311, "grad_norm": 1.65625, "learning_rate": 6.325242147850463e-08, "loss": 2.2129005432128905, "num_input_tokens_seen": 710361088, "step": 5420, "train_runtime": 10413.4478, "train_tokens_per_second": 68215.744 }, { "epoch": 1.9595813785636955, "grad_norm": 1.5859375, "learning_rate": 5.3389075679011194e-08, "loss": 2.2185943603515623, "num_input_tokens_seen": 711671808, "step": 5430, "train_runtime": 10432.2116, "train_tokens_per_second": 68218.69 }, { "epoch": 1.9631901840490797, "grad_norm": 1.5625, "learning_rate": 4.436046845237574e-08, "loss": 2.235332489013672, "num_input_tokens_seen": 712982528, "step": 5440, "train_runtime": 10450.986, "train_tokens_per_second": 68221.556 }, { "epoch": 1.966798989534464, "grad_norm": 1.5625, "learning_rate": 3.616690190482996e-08, "loss": 2.244569778442383, "num_input_tokens_seen": 714293248, "step": 5450, "train_runtime": 10469.7706, "train_tokens_per_second": 68224.346 }, { "epoch": 1.9704077950198484, "grad_norm": 2.15625, "learning_rate": 2.88086502013174e-08, "loss": 2.259345817565918, "num_input_tokens_seen": 715603968, "step": 5460, "train_runtime": 10488.5418, "train_tokens_per_second": 68227.212 }, { "epoch": 1.9740166005052329, "grad_norm": 1.5703125, "learning_rate": 2.2285959556303525e-08, "loss": 2.2066539764404296, "num_input_tokens_seen": 716914688, "step": 5470, "train_runtime": 10507.3044, "train_tokens_per_second": 68230.124 }, { "epoch": 1.977625405990617, "grad_norm": 1.4765625, "learning_rate": 1.6599048225546253e-08, "loss": 2.25235538482666, "num_input_tokens_seen": 718225408, "step": 5480, "train_runtime": 10526.0756, "train_tokens_per_second": 68232.971 }, { "epoch": 1.9812342114760013, "grad_norm": 1.6796875, "learning_rate": 1.1748106498793433e-08, "loss": 2.246954345703125, "num_input_tokens_seen": 719536128, "step": 5490, "train_runtime": 10544.842, "train_tokens_per_second": 68235.838 }, { "epoch": 1.9848430169613858, "grad_norm": 1.453125, "learning_rate": 7.733296693407388e-09, "loss": 2.253096008300781, "num_input_tokens_seen": 720846848, "step": 5500, "train_runtime": 10563.6145, "train_tokens_per_second": 68238.655 }, { "epoch": 1.9884518224467702, "grad_norm": 1.453125, "learning_rate": 4.5547531489442685e-09, "loss": 2.2080196380615233, "num_input_tokens_seen": 722157568, "step": 5510, "train_runtime": 10586.1595, "train_tokens_per_second": 68217.144 }, { "epoch": 1.9920606279321544, "grad_norm": 1.6796875, "learning_rate": 2.212582222652082e-09, "loss": 2.1899511337280275, "num_input_tokens_seen": 723468288, "step": 5520, "train_runtime": 10604.922, "train_tokens_per_second": 68220.048 }, { "epoch": 1.9956694334175387, "grad_norm": 1.640625, "learning_rate": 7.068622859179864e-10, "loss": 2.250523567199707, "num_input_tokens_seen": 724779008, "step": 5530, "train_runtime": 10623.69, "train_tokens_per_second": 68222.907 }, { "epoch": 1.999278238902923, "grad_norm": 1.6484375, "learning_rate": 3.764372163428398e-11, "loss": 2.2255619049072264, "num_input_tokens_seen": 726089728, "step": 5540, "train_runtime": 10642.4512, "train_tokens_per_second": 68225.798 }, { "epoch": 2.0, "num_input_tokens_seen": 726302720, "step": 5542, "total_flos": 4.372023498453811e+17, "train_loss": 2.3499925993530812, "train_runtime": 10647.232, "train_samples_per_second": 16.654, "train_steps_per_second": 0.521 } ], "logging_steps": 10, "max_steps": 5542, "num_input_tokens_seen": 726302720, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.372023498453811e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }