{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3163444639718805, "eval_steps": 500, "global_step": 300, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001054481546572935, "grad_norm": 0.9715927243232727, "learning_rate": 0.0, "loss": 11.2459, "num_input_tokens_seen": 2425848, "step": 1 }, { "epoch": 0.00210896309314587, "grad_norm": 1.3177887201309204, "learning_rate": 5e-06, "loss": 11.8548, "num_input_tokens_seen": 4956204, "step": 2 }, { "epoch": 0.003163444639718805, "grad_norm": 1.0477056503295898, "learning_rate": 1e-05, "loss": 10.8702, "num_input_tokens_seen": 7504132, "step": 3 }, { "epoch": 0.00421792618629174, "grad_norm": 0.8938190340995789, "learning_rate": 1.5e-05, "loss": 10.9133, "num_input_tokens_seen": 9828964, "step": 4 }, { "epoch": 0.005272407732864675, "grad_norm": 1.3546967506408691, "learning_rate": 2e-05, "loss": 11.9831, "num_input_tokens_seen": 12166228, "step": 5 }, { "epoch": 0.00632688927943761, "grad_norm": 0.9909083843231201, "learning_rate": 2.5e-05, "loss": 11.8687, "num_input_tokens_seen": 14513162, "step": 6 }, { "epoch": 0.007381370826010545, "grad_norm": 1.127426266670227, "learning_rate": 3e-05, "loss": 12.2052, "num_input_tokens_seen": 16999606, "step": 7 }, { "epoch": 0.00843585237258348, "grad_norm": 1.065547227859497, "learning_rate": 3.5000000000000004e-05, "loss": 11.4018, "num_input_tokens_seen": 19495694, "step": 8 }, { "epoch": 0.009490333919156414, "grad_norm": 1.1734977960586548, "learning_rate": 4e-05, "loss": 11.2021, "num_input_tokens_seen": 21885690, "step": 9 }, { "epoch": 0.01054481546572935, "grad_norm": 1.4789940118789673, "learning_rate": 4.4999999999999996e-05, "loss": 11.5736, "num_input_tokens_seen": 24390702, "step": 10 }, { "epoch": 0.011599297012302284, "grad_norm": 0.9825775623321533, "learning_rate": 5e-05, "loss": 12.1355, "num_input_tokens_seen": 26861992, "step": 11 }, { "epoch": 0.01265377855887522, "grad_norm": 1.5725144147872925, "learning_rate": 5.5e-05, "loss": 11.3955, "num_input_tokens_seen": 29193680, "step": 12 }, { "epoch": 0.013708260105448155, "grad_norm": 1.456314206123352, "learning_rate": 6e-05, "loss": 11.9303, "num_input_tokens_seen": 31664596, "step": 13 }, { "epoch": 0.01476274165202109, "grad_norm": 0.9546123743057251, "learning_rate": 6.500000000000001e-05, "loss": 10.8114, "num_input_tokens_seen": 34036374, "step": 14 }, { "epoch": 0.015817223198594025, "grad_norm": 1.2968882322311401, "learning_rate": 7.000000000000001e-05, "loss": 11.6615, "num_input_tokens_seen": 36512920, "step": 15 }, { "epoch": 0.01687170474516696, "grad_norm": 0.9044846892356873, "learning_rate": 7.5e-05, "loss": 12.026, "num_input_tokens_seen": 38907186, "step": 16 }, { "epoch": 0.017926186291739893, "grad_norm": 0.9072983860969543, "learning_rate": 8e-05, "loss": 11.4538, "num_input_tokens_seen": 41485262, "step": 17 }, { "epoch": 0.01898066783831283, "grad_norm": 1.5409631729125977, "learning_rate": 8.5e-05, "loss": 12.0379, "num_input_tokens_seen": 43786674, "step": 18 }, { "epoch": 0.020035149384885764, "grad_norm": 1.1517468690872192, "learning_rate": 8.999999999999999e-05, "loss": 11.1949, "num_input_tokens_seen": 46102944, "step": 19 }, { "epoch": 0.0210896309314587, "grad_norm": 0.6707425117492676, "learning_rate": 9.5e-05, "loss": 12.1884, "num_input_tokens_seen": 48591602, "step": 20 }, { "epoch": 0.022144112478031636, "grad_norm": 1.4621737003326416, "learning_rate": 0.0001, "loss": 12.5171, "num_input_tokens_seen": 50987434, "step": 21 }, { "epoch": 0.023198594024604568, "grad_norm": 1.3107916116714478, "learning_rate": 0.000105, "loss": 9.2395, "num_input_tokens_seen": 53372194, "step": 22 }, { "epoch": 0.024253075571177504, "grad_norm": 1.1481292247772217, "learning_rate": 0.00011, "loss": 11.0781, "num_input_tokens_seen": 55826644, "step": 23 }, { "epoch": 0.02530755711775044, "grad_norm": 1.3331198692321777, "learning_rate": 0.000115, "loss": 11.9342, "num_input_tokens_seen": 58227112, "step": 24 }, { "epoch": 0.026362038664323375, "grad_norm": 0.9532589912414551, "learning_rate": 0.00012, "loss": 10.8832, "num_input_tokens_seen": 60837186, "step": 25 }, { "epoch": 0.02741652021089631, "grad_norm": 1.4355679750442505, "learning_rate": 0.000125, "loss": 8.6828, "num_input_tokens_seen": 63230980, "step": 26 }, { "epoch": 0.028471001757469243, "grad_norm": 1.2025192975997925, "learning_rate": 0.00013000000000000002, "loss": 10.4431, "num_input_tokens_seen": 65610708, "step": 27 }, { "epoch": 0.02952548330404218, "grad_norm": 0.988655149936676, "learning_rate": 0.000135, "loss": 11.0779, "num_input_tokens_seen": 68080890, "step": 28 }, { "epoch": 0.030579964850615114, "grad_norm": 1.0818135738372803, "learning_rate": 0.00014000000000000001, "loss": 13.0595, "num_input_tokens_seen": 70585882, "step": 29 }, { "epoch": 0.03163444639718805, "grad_norm": 1.0979222059249878, "learning_rate": 0.000145, "loss": 11.1297, "num_input_tokens_seen": 73104506, "step": 30 }, { "epoch": 0.032688927943760986, "grad_norm": 1.0198029279708862, "learning_rate": 0.00015, "loss": 11.4949, "num_input_tokens_seen": 75511970, "step": 31 }, { "epoch": 0.03374340949033392, "grad_norm": 0.8834076523780823, "learning_rate": 0.000155, "loss": 11.0135, "num_input_tokens_seen": 78038336, "step": 32 }, { "epoch": 0.03479789103690686, "grad_norm": 1.10096275806427, "learning_rate": 0.00016, "loss": 11.2872, "num_input_tokens_seen": 80369394, "step": 33 }, { "epoch": 0.035852372583479786, "grad_norm": 1.176360011100769, "learning_rate": 0.000165, "loss": 10.7974, "num_input_tokens_seen": 82753120, "step": 34 }, { "epoch": 0.03690685413005272, "grad_norm": 0.9229934215545654, "learning_rate": 0.00017, "loss": 10.8117, "num_input_tokens_seen": 85056206, "step": 35 }, { "epoch": 0.03796133567662566, "grad_norm": 1.377319574356079, "learning_rate": 0.000175, "loss": 12.7367, "num_input_tokens_seen": 87639648, "step": 36 }, { "epoch": 0.03901581722319859, "grad_norm": 1.0206114053726196, "learning_rate": 0.00017999999999999998, "loss": 11.8548, "num_input_tokens_seen": 89969532, "step": 37 }, { "epoch": 0.04007029876977153, "grad_norm": 1.196964144706726, "learning_rate": 0.000185, "loss": 11.772, "num_input_tokens_seen": 92389948, "step": 38 }, { "epoch": 0.041124780316344464, "grad_norm": 1.0182139873504639, "learning_rate": 0.00019, "loss": 12.2716, "num_input_tokens_seen": 94893746, "step": 39 }, { "epoch": 0.0421792618629174, "grad_norm": 1.1761435270309448, "learning_rate": 0.00019500000000000002, "loss": 11.2837, "num_input_tokens_seen": 97286502, "step": 40 }, { "epoch": 0.043233743409490336, "grad_norm": 0.6700538396835327, "learning_rate": 0.0002, "loss": 12.2248, "num_input_tokens_seen": 99689044, "step": 41 }, { "epoch": 0.04428822495606327, "grad_norm": 1.307807207107544, "learning_rate": 0.000205, "loss": 10.7634, "num_input_tokens_seen": 102250738, "step": 42 }, { "epoch": 0.04534270650263621, "grad_norm": 1.1823184490203857, "learning_rate": 0.00021, "loss": 12.4119, "num_input_tokens_seen": 104683216, "step": 43 }, { "epoch": 0.046397188049209136, "grad_norm": 1.0091804265975952, "learning_rate": 0.000215, "loss": 12.0439, "num_input_tokens_seen": 107261470, "step": 44 }, { "epoch": 0.04745166959578207, "grad_norm": 1.2117910385131836, "learning_rate": 0.00022, "loss": 11.6827, "num_input_tokens_seen": 109842334, "step": 45 }, { "epoch": 0.04850615114235501, "grad_norm": 1.0678317546844482, "learning_rate": 0.00022500000000000002, "loss": 11.4376, "num_input_tokens_seen": 112206494, "step": 46 }, { "epoch": 0.04956063268892794, "grad_norm": 1.1838268041610718, "learning_rate": 0.00023, "loss": 10.6156, "num_input_tokens_seen": 114594098, "step": 47 }, { "epoch": 0.05061511423550088, "grad_norm": 0.9946988821029663, "learning_rate": 0.000235, "loss": 11.5055, "num_input_tokens_seen": 116970602, "step": 48 }, { "epoch": 0.051669595782073814, "grad_norm": 0.9280380010604858, "learning_rate": 0.00024, "loss": 11.2752, "num_input_tokens_seen": 119606816, "step": 49 }, { "epoch": 0.05272407732864675, "grad_norm": 1.0243436098098755, "learning_rate": 0.000245, "loss": 12.5145, "num_input_tokens_seen": 121995176, "step": 50 }, { "epoch": 0.053778558875219686, "grad_norm": 0.8426516056060791, "learning_rate": 0.00025, "loss": 11.5149, "num_input_tokens_seen": 124419224, "step": 51 }, { "epoch": 0.05483304042179262, "grad_norm": 0.9479583501815796, "learning_rate": 0.000255, "loss": 10.9152, "num_input_tokens_seen": 126831556, "step": 52 }, { "epoch": 0.05588752196836556, "grad_norm": 1.192730188369751, "learning_rate": 0.00026000000000000003, "loss": 10.1095, "num_input_tokens_seen": 129215044, "step": 53 }, { "epoch": 0.056942003514938486, "grad_norm": 0.8085720539093018, "learning_rate": 0.00026500000000000004, "loss": 11.3386, "num_input_tokens_seen": 131708150, "step": 54 }, { "epoch": 0.05799648506151142, "grad_norm": 0.9331195950508118, "learning_rate": 0.00027, "loss": 10.548, "num_input_tokens_seen": 134191794, "step": 55 }, { "epoch": 0.05905096660808436, "grad_norm": 0.9635204672813416, "learning_rate": 0.000275, "loss": 10.785, "num_input_tokens_seen": 136613856, "step": 56 }, { "epoch": 0.06010544815465729, "grad_norm": 1.088985800743103, "learning_rate": 0.00028000000000000003, "loss": 11.0651, "num_input_tokens_seen": 139052346, "step": 57 }, { "epoch": 0.06115992970123023, "grad_norm": 1.0904672145843506, "learning_rate": 0.000285, "loss": 12.6632, "num_input_tokens_seen": 141458664, "step": 58 }, { "epoch": 0.062214411247803164, "grad_norm": 0.9067728519439697, "learning_rate": 0.00029, "loss": 11.2291, "num_input_tokens_seen": 143985770, "step": 59 }, { "epoch": 0.0632688927943761, "grad_norm": 0.8951049447059631, "learning_rate": 0.000295, "loss": 10.9248, "num_input_tokens_seen": 146472938, "step": 60 }, { "epoch": 0.06432337434094904, "grad_norm": 0.8976070284843445, "learning_rate": 0.0003, "loss": 12.2781, "num_input_tokens_seen": 148907744, "step": 61 }, { "epoch": 0.06537785588752197, "grad_norm": 1.090478777885437, "learning_rate": 0.000305, "loss": 11.9668, "num_input_tokens_seen": 151448294, "step": 62 }, { "epoch": 0.0664323374340949, "grad_norm": 0.8273966908454895, "learning_rate": 0.00031, "loss": 11.9769, "num_input_tokens_seen": 153917584, "step": 63 }, { "epoch": 0.06748681898066784, "grad_norm": 0.9453766345977783, "learning_rate": 0.000315, "loss": 10.5521, "num_input_tokens_seen": 156591012, "step": 64 }, { "epoch": 0.06854130052724078, "grad_norm": 0.9743331074714661, "learning_rate": 0.00032, "loss": 10.9769, "num_input_tokens_seen": 158975418, "step": 65 }, { "epoch": 0.06959578207381371, "grad_norm": 0.8688381314277649, "learning_rate": 0.00032500000000000004, "loss": 11.7594, "num_input_tokens_seen": 161420368, "step": 66 }, { "epoch": 0.07065026362038665, "grad_norm": 0.9749491810798645, "learning_rate": 0.00033, "loss": 11.722, "num_input_tokens_seen": 163923386, "step": 67 }, { "epoch": 0.07170474516695957, "grad_norm": 1.0640383958816528, "learning_rate": 0.000335, "loss": 10.076, "num_input_tokens_seen": 166570580, "step": 68 }, { "epoch": 0.07275922671353251, "grad_norm": 0.8262693881988525, "learning_rate": 0.00034, "loss": 11.4312, "num_input_tokens_seen": 169085496, "step": 69 }, { "epoch": 0.07381370826010544, "grad_norm": 0.8046846389770508, "learning_rate": 0.000345, "loss": 11.5264, "num_input_tokens_seen": 171510744, "step": 70 }, { "epoch": 0.07486818980667838, "grad_norm": 0.8855931758880615, "learning_rate": 0.00035, "loss": 11.3249, "num_input_tokens_seen": 173889198, "step": 71 }, { "epoch": 0.07592267135325131, "grad_norm": 0.8355636596679688, "learning_rate": 0.000355, "loss": 11.1966, "num_input_tokens_seen": 176486654, "step": 72 }, { "epoch": 0.07697715289982425, "grad_norm": 0.8339463472366333, "learning_rate": 0.00035999999999999997, "loss": 11.4988, "num_input_tokens_seen": 178783436, "step": 73 }, { "epoch": 0.07803163444639719, "grad_norm": 0.9186501502990723, "learning_rate": 0.000365, "loss": 11.9924, "num_input_tokens_seen": 181065054, "step": 74 }, { "epoch": 0.07908611599297012, "grad_norm": 0.8586037158966064, "learning_rate": 0.00037, "loss": 11.5861, "num_input_tokens_seen": 183491460, "step": 75 }, { "epoch": 0.08014059753954306, "grad_norm": 0.8457223773002625, "learning_rate": 0.000375, "loss": 10.4982, "num_input_tokens_seen": 185871790, "step": 76 }, { "epoch": 0.08119507908611599, "grad_norm": 0.9979950785636902, "learning_rate": 0.00038, "loss": 11.2212, "num_input_tokens_seen": 188255230, "step": 77 }, { "epoch": 0.08224956063268893, "grad_norm": 0.7799087762832642, "learning_rate": 0.00038500000000000003, "loss": 11.6828, "num_input_tokens_seen": 190823556, "step": 78 }, { "epoch": 0.08330404217926186, "grad_norm": 0.8413819670677185, "learning_rate": 0.00039000000000000005, "loss": 11.7884, "num_input_tokens_seen": 193241694, "step": 79 }, { "epoch": 0.0843585237258348, "grad_norm": 0.9957459568977356, "learning_rate": 0.000395, "loss": 10.9958, "num_input_tokens_seen": 195610918, "step": 80 }, { "epoch": 0.08541300527240774, "grad_norm": 0.9195905923843384, "learning_rate": 0.0004, "loss": 10.5817, "num_input_tokens_seen": 197988346, "step": 81 }, { "epoch": 0.08646748681898067, "grad_norm": 0.7436060905456543, "learning_rate": 0.00040500000000000003, "loss": 11.3973, "num_input_tokens_seen": 200427190, "step": 82 }, { "epoch": 0.0875219683655536, "grad_norm": 0.6289843916893005, "learning_rate": 0.00041, "loss": 10.6944, "num_input_tokens_seen": 202809982, "step": 83 }, { "epoch": 0.08857644991212654, "grad_norm": 1.1031980514526367, "learning_rate": 0.000415, "loss": 9.3328, "num_input_tokens_seen": 205157580, "step": 84 }, { "epoch": 0.08963093145869948, "grad_norm": 1.117293357849121, "learning_rate": 0.00042, "loss": 10.7368, "num_input_tokens_seen": 207687796, "step": 85 }, { "epoch": 0.09068541300527241, "grad_norm": 1.0667115449905396, "learning_rate": 0.000425, "loss": 11.7286, "num_input_tokens_seen": 209997718, "step": 86 }, { "epoch": 0.09173989455184535, "grad_norm": 0.831766664981842, "learning_rate": 0.00043, "loss": 12.5704, "num_input_tokens_seen": 212407844, "step": 87 }, { "epoch": 0.09279437609841827, "grad_norm": 0.7932964563369751, "learning_rate": 0.000435, "loss": 11.0015, "num_input_tokens_seen": 215008632, "step": 88 }, { "epoch": 0.09384885764499121, "grad_norm": 0.8345858454704285, "learning_rate": 0.00044, "loss": 10.693, "num_input_tokens_seen": 217393470, "step": 89 }, { "epoch": 0.09490333919156414, "grad_norm": 0.8093012571334839, "learning_rate": 0.00044500000000000003, "loss": 11.7683, "num_input_tokens_seen": 219847368, "step": 90 }, { "epoch": 0.09595782073813708, "grad_norm": 0.7983007431030273, "learning_rate": 0.00045000000000000004, "loss": 12.1621, "num_input_tokens_seen": 222195586, "step": 91 }, { "epoch": 0.09701230228471001, "grad_norm": 0.8151090741157532, "learning_rate": 0.000455, "loss": 10.6503, "num_input_tokens_seen": 224689946, "step": 92 }, { "epoch": 0.09806678383128295, "grad_norm": 0.8428967595100403, "learning_rate": 0.00046, "loss": 11.032, "num_input_tokens_seen": 227147082, "step": 93 }, { "epoch": 0.09912126537785589, "grad_norm": 0.7828782200813293, "learning_rate": 0.000465, "loss": 11.3009, "num_input_tokens_seen": 229639860, "step": 94 }, { "epoch": 0.10017574692442882, "grad_norm": 0.7996600866317749, "learning_rate": 0.00047, "loss": 10.4206, "num_input_tokens_seen": 232075288, "step": 95 }, { "epoch": 0.10123022847100176, "grad_norm": 0.7270877361297607, "learning_rate": 0.000475, "loss": 11.8104, "num_input_tokens_seen": 234546596, "step": 96 }, { "epoch": 0.10228471001757469, "grad_norm": 0.8223890662193298, "learning_rate": 0.00048, "loss": 11.0354, "num_input_tokens_seen": 237127696, "step": 97 }, { "epoch": 0.10333919156414763, "grad_norm": 0.6856156587600708, "learning_rate": 0.00048499999999999997, "loss": 10.5128, "num_input_tokens_seen": 239595852, "step": 98 }, { "epoch": 0.10439367311072056, "grad_norm": 0.75257807970047, "learning_rate": 0.00049, "loss": 10.3306, "num_input_tokens_seen": 242124460, "step": 99 }, { "epoch": 0.1054481546572935, "grad_norm": 0.8604240417480469, "learning_rate": 0.000495, "loss": 11.7441, "num_input_tokens_seen": 244549536, "step": 100 }, { "epoch": 0.10650263620386644, "grad_norm": 0.7984803318977356, "learning_rate": 0.0005, "loss": 11.4844, "num_input_tokens_seen": 246899676, "step": 101 }, { "epoch": 0.10755711775043937, "grad_norm": 0.9181137084960938, "learning_rate": 0.0004999922894119685, "loss": 11.1044, "num_input_tokens_seen": 249263792, "step": 102 }, { "epoch": 0.1086115992970123, "grad_norm": 0.719553530216217, "learning_rate": 0.0004999691581234994, "loss": 11.1713, "num_input_tokens_seen": 251764084, "step": 103 }, { "epoch": 0.10966608084358524, "grad_norm": 0.9228735566139221, "learning_rate": 0.0004999306075614394, "loss": 9.0385, "num_input_tokens_seen": 254190814, "step": 104 }, { "epoch": 0.11072056239015818, "grad_norm": 0.7710055112838745, "learning_rate": 0.0004998766401037688, "loss": 10.3265, "num_input_tokens_seen": 256625058, "step": 105 }, { "epoch": 0.11177504393673111, "grad_norm": 0.6903572678565979, "learning_rate": 0.0004998072590794548, "loss": 11.4626, "num_input_tokens_seen": 259008258, "step": 106 }, { "epoch": 0.11282952548330404, "grad_norm": 0.7966758012771606, "learning_rate": 0.0004997224687682457, "loss": 10.8277, "num_input_tokens_seen": 261428048, "step": 107 }, { "epoch": 0.11388400702987697, "grad_norm": 0.9058545827865601, "learning_rate": 0.000499622274400407, "loss": 10.7112, "num_input_tokens_seen": 263817432, "step": 108 }, { "epoch": 0.11493848857644991, "grad_norm": 0.7410884499549866, "learning_rate": 0.0004995066821563998, "loss": 10.9133, "num_input_tokens_seen": 266228540, "step": 109 }, { "epoch": 0.11599297012302284, "grad_norm": 0.7807892560958862, "learning_rate": 0.0004993756991664976, "loss": 10.6102, "num_input_tokens_seen": 268491920, "step": 110 }, { "epoch": 0.11704745166959578, "grad_norm": 0.9086952805519104, "learning_rate": 0.0004992293335103487, "loss": 10.5466, "num_input_tokens_seen": 271003672, "step": 111 }, { "epoch": 0.11810193321616871, "grad_norm": 0.8595651984214783, "learning_rate": 0.0004990675942164759, "loss": 10.8544, "num_input_tokens_seen": 273280584, "step": 112 }, { "epoch": 0.11915641476274165, "grad_norm": 0.6959360241889954, "learning_rate": 0.0004988904912617209, "loss": 10.8134, "num_input_tokens_seen": 275653910, "step": 113 }, { "epoch": 0.12021089630931459, "grad_norm": 0.6293642520904541, "learning_rate": 0.000498698035570628, "loss": 10.9262, "num_input_tokens_seen": 278191980, "step": 114 }, { "epoch": 0.12126537785588752, "grad_norm": 0.6851038336753845, "learning_rate": 0.0004984902390147711, "loss": 10.6058, "num_input_tokens_seen": 280577286, "step": 115 }, { "epoch": 0.12231985940246046, "grad_norm": 0.5610032677650452, "learning_rate": 0.0004982671144120202, "loss": 11.7788, "num_input_tokens_seen": 283062546, "step": 116 }, { "epoch": 0.12337434094903339, "grad_norm": 0.592146098613739, "learning_rate": 0.000498028675525752, "loss": 11.8272, "num_input_tokens_seen": 285359532, "step": 117 }, { "epoch": 0.12442882249560633, "grad_norm": 0.6767431497573853, "learning_rate": 0.000497774937064, "loss": 10.7975, "num_input_tokens_seen": 287755300, "step": 118 }, { "epoch": 0.12548330404217925, "grad_norm": 0.7958774566650391, "learning_rate": 0.0004975059146785479, "loss": 10.2351, "num_input_tokens_seen": 290138596, "step": 119 }, { "epoch": 0.1265377855887522, "grad_norm": 0.6161935925483704, "learning_rate": 0.0004972216249639638, "loss": 10.9129, "num_input_tokens_seen": 292503656, "step": 120 }, { "epoch": 0.12759226713532512, "grad_norm": 0.7886815667152405, "learning_rate": 0.000496922085456576, "loss": 10.3267, "num_input_tokens_seen": 294918832, "step": 121 }, { "epoch": 0.12864674868189807, "grad_norm": 0.5889380574226379, "learning_rate": 0.0004966073146333924, "loss": 11.578, "num_input_tokens_seen": 297328590, "step": 122 }, { "epoch": 0.129701230228471, "grad_norm": 0.6609049439430237, "learning_rate": 0.0004962773319109604, "loss": 11.0731, "num_input_tokens_seen": 299705308, "step": 123 }, { "epoch": 0.13075571177504394, "grad_norm": 0.6637356281280518, "learning_rate": 0.0004959321576441683, "loss": 10.449, "num_input_tokens_seen": 302143056, "step": 124 }, { "epoch": 0.13181019332161686, "grad_norm": 0.5731056332588196, "learning_rate": 0.0004955718131249909, "loss": 10.5012, "num_input_tokens_seen": 304570734, "step": 125 }, { "epoch": 0.1328646748681898, "grad_norm": 0.7307013869285583, "learning_rate": 0.0004951963205811756, "loss": 10.557, "num_input_tokens_seen": 306918736, "step": 126 }, { "epoch": 0.13391915641476274, "grad_norm": 0.4749371111392975, "learning_rate": 0.0004948057031748712, "loss": 12.2914, "num_input_tokens_seen": 309461984, "step": 127 }, { "epoch": 0.13497363796133569, "grad_norm": 0.8126282095909119, "learning_rate": 0.0004943999850011993, "loss": 10.0878, "num_input_tokens_seen": 311925540, "step": 128 }, { "epoch": 0.1360281195079086, "grad_norm": 0.5017863512039185, "learning_rate": 0.0004939791910867678, "loss": 12.0397, "num_input_tokens_seen": 314443604, "step": 129 }, { "epoch": 0.13708260105448156, "grad_norm": 0.5224993228912354, "learning_rate": 0.0004935433473881276, "loss": 12.0857, "num_input_tokens_seen": 316817696, "step": 130 }, { "epoch": 0.13813708260105448, "grad_norm": 0.4489041566848755, "learning_rate": 0.0004930924807901711, "loss": 10.8638, "num_input_tokens_seen": 319389504, "step": 131 }, { "epoch": 0.13919156414762743, "grad_norm": 0.6408200263977051, "learning_rate": 0.0004926266191044738, "loss": 11.0014, "num_input_tokens_seen": 321932538, "step": 132 }, { "epoch": 0.14024604569420035, "grad_norm": 0.5280624628067017, "learning_rate": 0.0004921457910675788, "loss": 11.3467, "num_input_tokens_seen": 324411930, "step": 133 }, { "epoch": 0.1413005272407733, "grad_norm": 0.5165160894393921, "learning_rate": 0.0004916500263392243, "loss": 11.0076, "num_input_tokens_seen": 326731560, "step": 134 }, { "epoch": 0.14235500878734622, "grad_norm": 0.5510214567184448, "learning_rate": 0.000491139355500514, "loss": 10.9273, "num_input_tokens_seen": 329243246, "step": 135 }, { "epoch": 0.14340949033391914, "grad_norm": 0.6016185283660889, "learning_rate": 0.0004906138100520309, "loss": 10.7259, "num_input_tokens_seen": 331831630, "step": 136 }, { "epoch": 0.1444639718804921, "grad_norm": 0.6088196635246277, "learning_rate": 0.0004900734224118936, "loss": 10.6628, "num_input_tokens_seen": 334302218, "step": 137 }, { "epoch": 0.14551845342706501, "grad_norm": 0.6214354634284973, "learning_rate": 0.0004895182259137573, "loss": 11.8801, "num_input_tokens_seen": 336913326, "step": 138 }, { "epoch": 0.14657293497363796, "grad_norm": 0.422093003988266, "learning_rate": 0.0004889482548047572, "loss": 12.4677, "num_input_tokens_seen": 339358906, "step": 139 }, { "epoch": 0.14762741652021089, "grad_norm": 0.5529237389564514, "learning_rate": 0.0004883635442433959, "loss": 10.4447, "num_input_tokens_seen": 341933644, "step": 140 }, { "epoch": 0.14868189806678384, "grad_norm": 0.5171710848808289, "learning_rate": 0.0004877641302973755, "loss": 10.9242, "num_input_tokens_seen": 344324576, "step": 141 }, { "epoch": 0.14973637961335676, "grad_norm": 0.49143025279045105, "learning_rate": 0.00048715004994137124, "loss": 10.0709, "num_input_tokens_seen": 346908972, "step": 142 }, { "epoch": 0.1507908611599297, "grad_norm": 0.7775588035583496, "learning_rate": 0.0004865213410547524, "loss": 11.0975, "num_input_tokens_seen": 349386838, "step": 143 }, { "epoch": 0.15184534270650263, "grad_norm": 0.6548316478729248, "learning_rate": 0.0004858780424192443, "loss": 11.7805, "num_input_tokens_seen": 351755336, "step": 144 }, { "epoch": 0.15289982425307558, "grad_norm": 0.4432781934738159, "learning_rate": 0.0004852201937165372, "loss": 11.3553, "num_input_tokens_seen": 354150620, "step": 145 }, { "epoch": 0.1539543057996485, "grad_norm": 0.6089203953742981, "learning_rate": 0.0004845478355258377, "loss": 10.295, "num_input_tokens_seen": 356645140, "step": 146 }, { "epoch": 0.15500878734622145, "grad_norm": 0.5045962929725647, "learning_rate": 0.00048386100932136614, "loss": 11.6037, "num_input_tokens_seen": 358928648, "step": 147 }, { "epoch": 0.15606326889279437, "grad_norm": 0.4435243606567383, "learning_rate": 0.00048315975746979797, "loss": 11.9737, "num_input_tokens_seen": 361553144, "step": 148 }, { "epoch": 0.15711775043936732, "grad_norm": 0.5178308486938477, "learning_rate": 0.0004824441232276507, "loss": 11.3986, "num_input_tokens_seen": 364124878, "step": 149 }, { "epoch": 0.15817223198594024, "grad_norm": 0.5703669190406799, "learning_rate": 0.0004817141507386153, "loss": 11.407, "num_input_tokens_seen": 366451036, "step": 150 }, { "epoch": 0.1592267135325132, "grad_norm": 0.5979743599891663, "learning_rate": 0.0004809698850308334, "loss": 10.9108, "num_input_tokens_seen": 368799018, "step": 151 }, { "epoch": 0.16028119507908611, "grad_norm": 0.4265318214893341, "learning_rate": 0.0004802113720141196, "loss": 11.0061, "num_input_tokens_seen": 371286512, "step": 152 }, { "epoch": 0.16133567662565906, "grad_norm": 0.6489496231079102, "learning_rate": 0.00047943865847712965, "loss": 10.3601, "num_input_tokens_seen": 373790542, "step": 153 }, { "epoch": 0.16239015817223199, "grad_norm": 0.3896006941795349, "learning_rate": 0.0004786517920844744, "loss": 11.7572, "num_input_tokens_seen": 376164786, "step": 154 }, { "epoch": 0.1634446397188049, "grad_norm": 0.48660165071487427, "learning_rate": 0.00047785082137377936, "loss": 11.2828, "num_input_tokens_seen": 378668934, "step": 155 }, { "epoch": 0.16449912126537786, "grad_norm": 0.8149150609970093, "learning_rate": 0.000477035795752691, "loss": 10.8224, "num_input_tokens_seen": 380982868, "step": 156 }, { "epoch": 0.16555360281195078, "grad_norm": 0.3987499475479126, "learning_rate": 0.0004762067654958286, "loss": 11.302, "num_input_tokens_seen": 383412848, "step": 157 }, { "epoch": 0.16660808435852373, "grad_norm": 0.48311105370521545, "learning_rate": 0.0004753637817416835, "loss": 11.1952, "num_input_tokens_seen": 385890530, "step": 158 }, { "epoch": 0.16766256590509665, "grad_norm": 0.460369348526001, "learning_rate": 0.0004745068964894645, "loss": 10.6698, "num_input_tokens_seen": 388331186, "step": 159 }, { "epoch": 0.1687170474516696, "grad_norm": 0.7765836119651794, "learning_rate": 0.00047363616259589025, "loss": 10.34, "num_input_tokens_seen": 390722478, "step": 160 }, { "epoch": 0.16977152899824252, "grad_norm": 0.5638030171394348, "learning_rate": 0.00047275163377192886, "loss": 10.3372, "num_input_tokens_seen": 393128528, "step": 161 }, { "epoch": 0.17082601054481547, "grad_norm": 0.3865327537059784, "learning_rate": 0.0004718533645794847, "loss": 12.1565, "num_input_tokens_seen": 395710636, "step": 162 }, { "epoch": 0.1718804920913884, "grad_norm": 0.46866747736930847, "learning_rate": 0.0004709414104280326, "loss": 11.4228, "num_input_tokens_seen": 398179608, "step": 163 }, { "epoch": 0.17293497363796134, "grad_norm": 0.5363028049468994, "learning_rate": 0.00047001582757120054, "loss": 10.9585, "num_input_tokens_seen": 400581072, "step": 164 }, { "epoch": 0.17398945518453426, "grad_norm": 0.4994870722293854, "learning_rate": 0.00046907667310329887, "loss": 10.8748, "num_input_tokens_seen": 403057566, "step": 165 }, { "epoch": 0.1750439367311072, "grad_norm": 0.6035915017127991, "learning_rate": 0.0004681240049557991, "loss": 10.9428, "num_input_tokens_seen": 405479554, "step": 166 }, { "epoch": 0.17609841827768014, "grad_norm": 0.5696356892585754, "learning_rate": 0.00046715788189375995, "loss": 11.4068, "num_input_tokens_seen": 407921128, "step": 167 }, { "epoch": 0.17715289982425309, "grad_norm": 0.5532790422439575, "learning_rate": 0.0004661783635122028, "loss": 11.0868, "num_input_tokens_seen": 410550558, "step": 168 }, { "epoch": 0.178207381370826, "grad_norm": 0.43119895458221436, "learning_rate": 0.0004651855102324352, "loss": 11.4107, "num_input_tokens_seen": 412953064, "step": 169 }, { "epoch": 0.17926186291739896, "grad_norm": 0.9992315769195557, "learning_rate": 0.0004641793832983245, "loss": 9.5065, "num_input_tokens_seen": 415501368, "step": 170 }, { "epoch": 0.18031634446397188, "grad_norm": 0.5675984621047974, "learning_rate": 0.0004631600447725189, "loss": 11.4787, "num_input_tokens_seen": 417838436, "step": 171 }, { "epoch": 0.18137082601054483, "grad_norm": 0.4894881546497345, "learning_rate": 0.0004621275575326206, "loss": 11.05, "num_input_tokens_seen": 420236388, "step": 172 }, { "epoch": 0.18242530755711775, "grad_norm": 0.5870826244354248, "learning_rate": 0.00046108198526730563, "loss": 11.1987, "num_input_tokens_seen": 422659540, "step": 173 }, { "epoch": 0.1834797891036907, "grad_norm": 0.5805984139442444, "learning_rate": 0.0004600233924723966, "loss": 10.3112, "num_input_tokens_seen": 425004762, "step": 174 }, { "epoch": 0.18453427065026362, "grad_norm": 0.5345659852027893, "learning_rate": 0.0004589518444468836, "loss": 10.6756, "num_input_tokens_seen": 427453028, "step": 175 }, { "epoch": 0.18558875219683654, "grad_norm": 0.4662725627422333, "learning_rate": 0.000457867407288896, "loss": 11.9868, "num_input_tokens_seen": 429911724, "step": 176 }, { "epoch": 0.1866432337434095, "grad_norm": 0.4901849329471588, "learning_rate": 0.0004567701478916261, "loss": 12.0078, "num_input_tokens_seen": 432286308, "step": 177 }, { "epoch": 0.18769771528998241, "grad_norm": 0.4592384994029999, "learning_rate": 0.00045566013393920205, "loss": 11.7783, "num_input_tokens_seen": 434795636, "step": 178 }, { "epoch": 0.18875219683655536, "grad_norm": 0.4543682336807251, "learning_rate": 0.0004545374339025129, "loss": 11.9031, "num_input_tokens_seen": 437315386, "step": 179 }, { "epoch": 0.18980667838312829, "grad_norm": 0.5531622767448425, "learning_rate": 0.0004534021170349856, "loss": 10.913, "num_input_tokens_seen": 439795046, "step": 180 }, { "epoch": 0.19086115992970124, "grad_norm": 0.4865996539592743, "learning_rate": 0.000452254253368312, "loss": 10.9763, "num_input_tokens_seen": 442280862, "step": 181 }, { "epoch": 0.19191564147627416, "grad_norm": 0.5476157665252686, "learning_rate": 0.0004510939137081302, "loss": 11.3704, "num_input_tokens_seen": 444878730, "step": 182 }, { "epoch": 0.1929701230228471, "grad_norm": 0.7855698466300964, "learning_rate": 0.00044992116962965623, "loss": 11.4159, "num_input_tokens_seen": 447229276, "step": 183 }, { "epoch": 0.19402460456942003, "grad_norm": 0.5010231137275696, "learning_rate": 0.00044873609347326866, "loss": 12.1404, "num_input_tokens_seen": 449598746, "step": 184 }, { "epoch": 0.19507908611599298, "grad_norm": 0.7411155104637146, "learning_rate": 0.0004475387583400473, "loss": 9.5508, "num_input_tokens_seen": 452111232, "step": 185 }, { "epoch": 0.1961335676625659, "grad_norm": 0.678528904914856, "learning_rate": 0.00044632923808726293, "loss": 11.2098, "num_input_tokens_seen": 454483758, "step": 186 }, { "epoch": 0.19718804920913885, "grad_norm": 0.49200311303138733, "learning_rate": 0.0004451076073238223, "loss": 11.6097, "num_input_tokens_seen": 456962194, "step": 187 }, { "epoch": 0.19824253075571177, "grad_norm": 0.44871610403060913, "learning_rate": 0.0004438739414056651, "loss": 11.005, "num_input_tokens_seen": 459290608, "step": 188 }, { "epoch": 0.19929701230228472, "grad_norm": 0.42474889755249023, "learning_rate": 0.0004426283164311162, "loss": 12.443, "num_input_tokens_seen": 461679768, "step": 189 }, { "epoch": 0.20035149384885764, "grad_norm": 0.553240180015564, "learning_rate": 0.00044137080923619174, "loss": 10.8901, "num_input_tokens_seen": 464264660, "step": 190 }, { "epoch": 0.2014059753954306, "grad_norm": 0.688330888748169, "learning_rate": 0.0004401014973898586, "loss": 10.2717, "num_input_tokens_seen": 466692112, "step": 191 }, { "epoch": 0.2024604569420035, "grad_norm": 0.5714016556739807, "learning_rate": 0.0004388204591892506, "loss": 10.0244, "num_input_tokens_seen": 469183024, "step": 192 }, { "epoch": 0.20351493848857646, "grad_norm": 0.5069180727005005, "learning_rate": 0.00043752777365483816, "loss": 11.5811, "num_input_tokens_seen": 471674424, "step": 193 }, { "epoch": 0.20456942003514939, "grad_norm": 0.5883907675743103, "learning_rate": 0.0004362235205255541, "loss": 10.2173, "num_input_tokens_seen": 473839978, "step": 194 }, { "epoch": 0.2056239015817223, "grad_norm": 0.59784996509552, "learning_rate": 0.0004349077802538751, "loss": 10.8403, "num_input_tokens_seen": 476332186, "step": 195 }, { "epoch": 0.20667838312829526, "grad_norm": 0.39995861053466797, "learning_rate": 0.0004335806340008587, "loss": 11.1878, "num_input_tokens_seen": 478785370, "step": 196 }, { "epoch": 0.20773286467486818, "grad_norm": 0.33949345350265503, "learning_rate": 0.00043224216363113723, "loss": 11.6166, "num_input_tokens_seen": 481219648, "step": 197 }, { "epoch": 0.20878734622144113, "grad_norm": 0.5417101979255676, "learning_rate": 0.0004308924517078678, "loss": 11.326, "num_input_tokens_seen": 483719790, "step": 198 }, { "epoch": 0.20984182776801405, "grad_norm": 0.38530680537223816, "learning_rate": 0.00042953158148763975, "loss": 11.3671, "num_input_tokens_seen": 486326140, "step": 199 }, { "epoch": 0.210896309314587, "grad_norm": 0.5097330808639526, "learning_rate": 0.0004281596369153384, "loss": 11.0896, "num_input_tokens_seen": 488789092, "step": 200 }, { "epoch": 0.21195079086115992, "grad_norm": 0.5015902519226074, "learning_rate": 0.0004267767026189673, "loss": 12.1989, "num_input_tokens_seen": 491188440, "step": 201 }, { "epoch": 0.21300527240773287, "grad_norm": 0.5227989554405212, "learning_rate": 0.00042538286390442833, "loss": 10.9501, "num_input_tokens_seen": 493543466, "step": 202 }, { "epoch": 0.2140597539543058, "grad_norm": 0.5817456245422363, "learning_rate": 0.00042397820675025866, "loss": 10.7432, "num_input_tokens_seen": 496149784, "step": 203 }, { "epoch": 0.21511423550087874, "grad_norm": 0.5026383399963379, "learning_rate": 0.0004225628178023283, "loss": 10.6559, "num_input_tokens_seen": 498838520, "step": 204 }, { "epoch": 0.21616871704745166, "grad_norm": 0.6414695382118225, "learning_rate": 0.00042113678436849454, "loss": 10.5973, "num_input_tokens_seen": 501399136, "step": 205 }, { "epoch": 0.2172231985940246, "grad_norm": 0.5009418725967407, "learning_rate": 0.0004197001944132168, "loss": 11.3261, "num_input_tokens_seen": 503776514, "step": 206 }, { "epoch": 0.21827768014059754, "grad_norm": 0.4332464635372162, "learning_rate": 0.0004182531365521305, "loss": 11.6269, "num_input_tokens_seen": 506130888, "step": 207 }, { "epoch": 0.21933216168717048, "grad_norm": 0.4053120017051697, "learning_rate": 0.0004167957000465808, "loss": 11.353, "num_input_tokens_seen": 508565728, "step": 208 }, { "epoch": 0.2203866432337434, "grad_norm": 0.5031690001487732, "learning_rate": 0.00041532797479811636, "loss": 11.5352, "num_input_tokens_seen": 511010390, "step": 209 }, { "epoch": 0.22144112478031636, "grad_norm": 0.662989616394043, "learning_rate": 0.00041385005134294417, "loss": 10.9617, "num_input_tokens_seen": 513483182, "step": 210 }, { "epoch": 0.22249560632688928, "grad_norm": 0.40385428071022034, "learning_rate": 0.00041236202084634466, "loss": 11.2634, "num_input_tokens_seen": 515869144, "step": 211 }, { "epoch": 0.22355008787346223, "grad_norm": 0.4567122459411621, "learning_rate": 0.0004108639750970481, "loss": 10.5655, "num_input_tokens_seen": 518419596, "step": 212 }, { "epoch": 0.22460456942003515, "grad_norm": 0.38430649042129517, "learning_rate": 0.00040935600650157265, "loss": 11.2328, "num_input_tokens_seen": 520915978, "step": 213 }, { "epoch": 0.22565905096660807, "grad_norm": 0.3853931725025177, "learning_rate": 0.00040783820807852457, "loss": 10.8903, "num_input_tokens_seen": 523288654, "step": 214 }, { "epoch": 0.22671353251318102, "grad_norm": 0.5151433348655701, "learning_rate": 0.00040631067345285994, "loss": 10.5469, "num_input_tokens_seen": 525939782, "step": 215 }, { "epoch": 0.22776801405975394, "grad_norm": 0.5899290442466736, "learning_rate": 0.0004047734968501098, "loss": 10.6225, "num_input_tokens_seen": 528213108, "step": 216 }, { "epoch": 0.2288224956063269, "grad_norm": 0.5515417456626892, "learning_rate": 0.0004032267730905678, "loss": 11.1403, "num_input_tokens_seen": 530690074, "step": 217 }, { "epoch": 0.22987697715289981, "grad_norm": 0.6135182976722717, "learning_rate": 0.00040167059758344114, "loss": 9.9438, "num_input_tokens_seen": 533032048, "step": 218 }, { "epoch": 0.23093145869947276, "grad_norm": 0.4371633529663086, "learning_rate": 0.00040010506632096537, "loss": 11.5981, "num_input_tokens_seen": 535625558, "step": 219 }, { "epoch": 0.23198594024604569, "grad_norm": 0.3425651490688324, "learning_rate": 0.0003985302758724831, "loss": 11.0162, "num_input_tokens_seen": 538342358, "step": 220 }, { "epoch": 0.23304042179261863, "grad_norm": 0.3134062886238098, "learning_rate": 0.000396946323378487, "loss": 12.1684, "num_input_tokens_seen": 540629126, "step": 221 }, { "epoch": 0.23409490333919156, "grad_norm": 0.5026021003723145, "learning_rate": 0.0003953533065446281, "loss": 11.837, "num_input_tokens_seen": 543221254, "step": 222 }, { "epoch": 0.2351493848857645, "grad_norm": 0.5490946769714355, "learning_rate": 0.00039375132363568836, "loss": 11.0225, "num_input_tokens_seen": 545592750, "step": 223 }, { "epoch": 0.23620386643233743, "grad_norm": 0.5616098642349243, "learning_rate": 0.00039214047346951974, "loss": 11.3559, "num_input_tokens_seen": 547974264, "step": 224 }, { "epoch": 0.23725834797891038, "grad_norm": 0.44445741176605225, "learning_rate": 0.00039052085541094823, "loss": 11.3691, "num_input_tokens_seen": 550455212, "step": 225 }, { "epoch": 0.2383128295254833, "grad_norm": 0.3331153690814972, "learning_rate": 0.0003888925693656447, "loss": 11.1528, "num_input_tokens_seen": 552934874, "step": 226 }, { "epoch": 0.23936731107205625, "grad_norm": 0.33000198006629944, "learning_rate": 0.00038725571577396254, "loss": 12.5381, "num_input_tokens_seen": 555415658, "step": 227 }, { "epoch": 0.24042179261862917, "grad_norm": 0.4085153341293335, "learning_rate": 0.0003856103956047413, "loss": 11.2043, "num_input_tokens_seen": 557910548, "step": 228 }, { "epoch": 0.24147627416520212, "grad_norm": 0.7109001278877258, "learning_rate": 0.0003839567103490793, "loss": 10.1943, "num_input_tokens_seen": 560400606, "step": 229 }, { "epoch": 0.24253075571177504, "grad_norm": 0.6416913866996765, "learning_rate": 0.0003822947620140726, "loss": 10.3457, "num_input_tokens_seen": 562814866, "step": 230 }, { "epoch": 0.243585237258348, "grad_norm": 0.43772706389427185, "learning_rate": 0.0003806246531165231, "loss": 12.1498, "num_input_tokens_seen": 565068902, "step": 231 }, { "epoch": 0.2446397188049209, "grad_norm": 0.4833686053752899, "learning_rate": 0.0003789464866766144, "loss": 10.6826, "num_input_tokens_seen": 567518434, "step": 232 }, { "epoch": 0.24569420035149384, "grad_norm": 0.37340158224105835, "learning_rate": 0.0003772603662115575, "loss": 11.1719, "num_input_tokens_seen": 569850658, "step": 233 }, { "epoch": 0.24674868189806679, "grad_norm": 0.5298442244529724, "learning_rate": 0.0003755663957292048, "loss": 9.6292, "num_input_tokens_seen": 572340312, "step": 234 }, { "epoch": 0.2478031634446397, "grad_norm": 0.48673802614212036, "learning_rate": 0.00037386467972163516, "loss": 10.7159, "num_input_tokens_seen": 574771196, "step": 235 }, { "epoch": 0.24885764499121266, "grad_norm": 0.6027830839157104, "learning_rate": 0.00037215532315870774, "loss": 11.0987, "num_input_tokens_seen": 577234360, "step": 236 }, { "epoch": 0.24991212653778558, "grad_norm": 0.47889307141304016, "learning_rate": 0.00037043843148158696, "loss": 10.5865, "num_input_tokens_seen": 579677372, "step": 237 }, { "epoch": 0.2509666080843585, "grad_norm": 0.46011844277381897, "learning_rate": 0.0003687141105962389, "loss": 11.7296, "num_input_tokens_seen": 582233734, "step": 238 }, { "epoch": 0.25202108963093145, "grad_norm": 0.39201974868774414, "learning_rate": 0.000366982466866898, "loss": 12.3676, "num_input_tokens_seen": 584774048, "step": 239 }, { "epoch": 0.2530755711775044, "grad_norm": 0.5027074813842773, "learning_rate": 0.00036524360710950624, "loss": 11.0958, "num_input_tokens_seen": 587165168, "step": 240 }, { "epoch": 0.25413005272407735, "grad_norm": 0.6349440217018127, "learning_rate": 0.0003634976385851242, "loss": 9.6468, "num_input_tokens_seen": 589531588, "step": 241 }, { "epoch": 0.25518453427065024, "grad_norm": 0.47264474630355835, "learning_rate": 0.00036174466899331484, "loss": 10.3429, "num_input_tokens_seen": 591851982, "step": 242 }, { "epoch": 0.2562390158172232, "grad_norm": 0.6780998706817627, "learning_rate": 0.0003599848064654995, "loss": 9.8026, "num_input_tokens_seen": 594293620, "step": 243 }, { "epoch": 0.25729349736379614, "grad_norm": 0.45961129665374756, "learning_rate": 0.000358218159558289, "loss": 11.1722, "num_input_tokens_seen": 596810748, "step": 244 }, { "epoch": 0.2583479789103691, "grad_norm": 0.5620695352554321, "learning_rate": 0.0003564448372467859, "loss": 11.2163, "num_input_tokens_seen": 599497050, "step": 245 }, { "epoch": 0.259402460456942, "grad_norm": 0.4004107713699341, "learning_rate": 0.0003546649489178636, "loss": 11.6294, "num_input_tokens_seen": 601846484, "step": 246 }, { "epoch": 0.26045694200351494, "grad_norm": 0.5842926502227783, "learning_rate": 0.00035287860436341824, "loss": 10.2072, "num_input_tokens_seen": 604339142, "step": 247 }, { "epoch": 0.2615114235500879, "grad_norm": 0.5138064026832581, "learning_rate": 0.0003510859137735964, "loss": 11.1892, "num_input_tokens_seen": 606890192, "step": 248 }, { "epoch": 0.26256590509666083, "grad_norm": 0.4497654139995575, "learning_rate": 0.00034928698772999787, "loss": 11.39, "num_input_tokens_seen": 609336404, "step": 249 }, { "epoch": 0.26362038664323373, "grad_norm": 0.47480809688568115, "learning_rate": 0.0003474819371988549, "loss": 10.8002, "num_input_tokens_seen": 611867684, "step": 250 }, { "epoch": 0.2646748681898067, "grad_norm": 0.49315816164016724, "learning_rate": 0.00034567087352418665, "loss": 9.7913, "num_input_tokens_seen": 614297542, "step": 251 }, { "epoch": 0.2657293497363796, "grad_norm": 0.532971978187561, "learning_rate": 0.0003438539084209315, "loss": 8.7019, "num_input_tokens_seen": 616909048, "step": 252 }, { "epoch": 0.2667838312829525, "grad_norm": 0.49788665771484375, "learning_rate": 0.0003420311539680557, "loss": 10.8312, "num_input_tokens_seen": 619209032, "step": 253 }, { "epoch": 0.26783831282952547, "grad_norm": 0.5600563883781433, "learning_rate": 0.00034020272260163977, "loss": 10.4957, "num_input_tokens_seen": 621491468, "step": 254 }, { "epoch": 0.2688927943760984, "grad_norm": 0.46124720573425293, "learning_rate": 0.0003383687271079432, "loss": 11.2727, "num_input_tokens_seen": 623952608, "step": 255 }, { "epoch": 0.26994727592267137, "grad_norm": 0.4204480051994324, "learning_rate": 0.0003365292806164468, "loss": 10.2706, "num_input_tokens_seen": 626508340, "step": 256 }, { "epoch": 0.27100175746924426, "grad_norm": 0.35226359963417053, "learning_rate": 0.00033468449659287486, "loss": 11.4452, "num_input_tokens_seen": 628924044, "step": 257 }, { "epoch": 0.2720562390158172, "grad_norm": 0.4208810329437256, "learning_rate": 0.0003328344888321955, "loss": 11.8004, "num_input_tokens_seen": 631424656, "step": 258 }, { "epoch": 0.27311072056239016, "grad_norm": 0.42234763503074646, "learning_rate": 0.0003309793714516019, "loss": 10.2814, "num_input_tokens_seen": 634003722, "step": 259 }, { "epoch": 0.2741652021089631, "grad_norm": 0.7364934086799622, "learning_rate": 0.00032911925888347234, "loss": 9.4588, "num_input_tokens_seen": 636266230, "step": 260 }, { "epoch": 0.275219683655536, "grad_norm": 0.595302164554596, "learning_rate": 0.00032725426586831203, "loss": 11.3085, "num_input_tokens_seen": 638937762, "step": 261 }, { "epoch": 0.27627416520210896, "grad_norm": 0.5097643136978149, "learning_rate": 0.0003253845074476749, "loss": 10.8575, "num_input_tokens_seen": 641424216, "step": 262 }, { "epoch": 0.2773286467486819, "grad_norm": 0.4542533755302429, "learning_rate": 0.00032351009895706785, "loss": 11.126, "num_input_tokens_seen": 643924398, "step": 263 }, { "epoch": 0.27838312829525486, "grad_norm": 0.5408210158348083, "learning_rate": 0.00032163115601883583, "loss": 10.62, "num_input_tokens_seen": 646442606, "step": 264 }, { "epoch": 0.27943760984182775, "grad_norm": 0.3929187059402466, "learning_rate": 0.0003197477945350297, "loss": 10.8365, "num_input_tokens_seen": 648807396, "step": 265 }, { "epoch": 0.2804920913884007, "grad_norm": 0.4019918739795685, "learning_rate": 0.0003178601306802573, "loss": 11.0141, "num_input_tokens_seen": 651255882, "step": 266 }, { "epoch": 0.28154657293497365, "grad_norm": 0.41171419620513916, "learning_rate": 0.00031596828089451703, "loss": 11.1608, "num_input_tokens_seen": 653500404, "step": 267 }, { "epoch": 0.2826010544815466, "grad_norm": 0.4173177480697632, "learning_rate": 0.00031407236187601487, "loss": 11.8302, "num_input_tokens_seen": 656044100, "step": 268 }, { "epoch": 0.2836555360281195, "grad_norm": 0.5411896109580994, "learning_rate": 0.0003121724905739666, "loss": 10.1021, "num_input_tokens_seen": 658675374, "step": 269 }, { "epoch": 0.28471001757469244, "grad_norm": 0.37198469042778015, "learning_rate": 0.0003102687841813832, "loss": 11.3138, "num_input_tokens_seen": 661142718, "step": 270 }, { "epoch": 0.2857644991212654, "grad_norm": 0.4196586608886719, "learning_rate": 0.00030836136012784226, "loss": 10.5025, "num_input_tokens_seen": 663510590, "step": 271 }, { "epoch": 0.2868189806678383, "grad_norm": 0.3854670226573944, "learning_rate": 0.00030645033607224425, "loss": 11.4875, "num_input_tokens_seen": 666115430, "step": 272 }, { "epoch": 0.28787346221441124, "grad_norm": 0.4818483591079712, "learning_rate": 0.0003045358298955546, "loss": 11.0228, "num_input_tokens_seen": 668556982, "step": 273 }, { "epoch": 0.2889279437609842, "grad_norm": 0.4966771900653839, "learning_rate": 0.0003026179596935324, "loss": 10.1303, "num_input_tokens_seen": 671126456, "step": 274 }, { "epoch": 0.28998242530755713, "grad_norm": 0.30973878502845764, "learning_rate": 0.00030069684376944573, "loss": 11.1264, "num_input_tokens_seen": 673578434, "step": 275 }, { "epoch": 0.29103690685413003, "grad_norm": 0.6031095385551453, "learning_rate": 0.000298772600626774, "loss": 11.2413, "num_input_tokens_seen": 675988320, "step": 276 }, { "epoch": 0.292091388400703, "grad_norm": 0.4558941423892975, "learning_rate": 0.00029684534896189834, "loss": 11.4214, "num_input_tokens_seen": 678558982, "step": 277 }, { "epoch": 0.2931458699472759, "grad_norm": 0.46561217308044434, "learning_rate": 0.0002949152076567795, "loss": 10.6133, "num_input_tokens_seen": 681075438, "step": 278 }, { "epoch": 0.2942003514938489, "grad_norm": 0.4388117790222168, "learning_rate": 0.0002929822957716248, "loss": 12.1676, "num_input_tokens_seen": 683571248, "step": 279 }, { "epoch": 0.29525483304042177, "grad_norm": 0.4060705006122589, "learning_rate": 0.00029104673253754456, "loss": 10.7931, "num_input_tokens_seen": 685872324, "step": 280 }, { "epoch": 0.2963093145869947, "grad_norm": 0.3648971915245056, "learning_rate": 0.00028910863734919615, "loss": 11.5947, "num_input_tokens_seen": 688269678, "step": 281 }, { "epoch": 0.29736379613356767, "grad_norm": 0.5417793393135071, "learning_rate": 0.00028716812975741995, "loss": 9.7931, "num_input_tokens_seen": 690789842, "step": 282 }, { "epoch": 0.2984182776801406, "grad_norm": 0.47309672832489014, "learning_rate": 0.00028522532946186486, "loss": 10.8822, "num_input_tokens_seen": 693146222, "step": 283 }, { "epoch": 0.2994727592267135, "grad_norm": 0.566740870475769, "learning_rate": 0.0002832803563036046, "loss": 10.9888, "num_input_tokens_seen": 695527010, "step": 284 }, { "epoch": 0.30052724077328646, "grad_norm": 0.4325026869773865, "learning_rate": 0.00028133333025774524, "loss": 11.0045, "num_input_tokens_seen": 697890080, "step": 285 }, { "epoch": 0.3015817223198594, "grad_norm": 0.5596818923950195, "learning_rate": 0.0002793843714260245, "loss": 10.0578, "num_input_tokens_seen": 700327360, "step": 286 }, { "epoch": 0.30263620386643236, "grad_norm": 0.7821861505508423, "learning_rate": 0.0002774336000294035, "loss": 12.0288, "num_input_tokens_seen": 702777350, "step": 287 }, { "epoch": 0.30369068541300526, "grad_norm": 0.49740836024284363, "learning_rate": 0.0002754811364006511, "loss": 11.6109, "num_input_tokens_seen": 705184528, "step": 288 }, { "epoch": 0.3047451669595782, "grad_norm": 0.5511218309402466, "learning_rate": 0.0002735271009769208, "loss": 9.9996, "num_input_tokens_seen": 707551254, "step": 289 }, { "epoch": 0.30579964850615116, "grad_norm": 0.36505043506622314, "learning_rate": 0.00027157161429232173, "loss": 10.6945, "num_input_tokens_seen": 709824754, "step": 290 }, { "epoch": 0.30685413005272405, "grad_norm": 0.5768591165542603, "learning_rate": 0.00026961479697048385, "loss": 10.4752, "num_input_tokens_seen": 712236092, "step": 291 }, { "epoch": 0.307908611599297, "grad_norm": 0.3299911916255951, "learning_rate": 0.00026765676971711704, "loss": 11.6405, "num_input_tokens_seen": 714627792, "step": 292 }, { "epoch": 0.30896309314586995, "grad_norm": 0.44536301493644714, "learning_rate": 0.00026569765331256536, "loss": 11.4152, "num_input_tokens_seen": 716881324, "step": 293 }, { "epoch": 0.3100175746924429, "grad_norm": 0.3655878007411957, "learning_rate": 0.000263737568604357, "loss": 11.6348, "num_input_tokens_seen": 719423592, "step": 294 }, { "epoch": 0.3110720562390158, "grad_norm": 0.5900895595550537, "learning_rate": 0.00026177663649974936, "loss": 10.2198, "num_input_tokens_seen": 721913756, "step": 295 }, { "epoch": 0.31212653778558874, "grad_norm": 0.7902632355690002, "learning_rate": 0.00025981497795827174, "loss": 9.868, "num_input_tokens_seen": 724446930, "step": 296 }, { "epoch": 0.3131810193321617, "grad_norm": 0.4470077455043793, "learning_rate": 0.0002578527139842631, "loss": 10.5506, "num_input_tokens_seen": 726932626, "step": 297 }, { "epoch": 0.31423550087873464, "grad_norm": 0.45410841703414917, "learning_rate": 0.00025588996561940846, "loss": 11.0545, "num_input_tokens_seen": 729377678, "step": 298 }, { "epoch": 0.31528998242530754, "grad_norm": 0.6242054104804993, "learning_rate": 0.0002539268539352723, "loss": 10.1522, "num_input_tokens_seen": 731835522, "step": 299 }, { "epoch": 0.3163444639718805, "grad_norm": 0.49581339955329895, "learning_rate": 0.00025196350002583027, "loss": 11.9984, "num_input_tokens_seen": 734212212, "step": 300 } ], "logging_steps": 1.0, "max_steps": 500, "num_input_tokens_seen": 734212212, "num_train_epochs": 1, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.14219679856119e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }