{ "best_metric": 0.29087916016578674, "best_model_checkpoint": "miner_id_24/checkpoint-450", "epoch": 0.1380473962727203, "eval_steps": 50, "global_step": 450, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003067719917171562, "eval_loss": 0.42013826966285706, "eval_runtime": 763.0051, "eval_samples_per_second": 7.195, "eval_steps_per_second": 1.799, "step": 1 }, { "epoch": 0.0030677199171715622, "grad_norm": 0.12315841019153595, "learning_rate": 0.0001, "loss": 0.3099, "step": 10 }, { "epoch": 0.0061354398343431244, "grad_norm": 0.10838135331869125, "learning_rate": 9.987260573051269e-05, "loss": 0.3765, "step": 20 }, { "epoch": 0.009203159751514686, "grad_norm": 0.11101564764976501, "learning_rate": 9.949107209404665e-05, "loss": 0.3504, "step": 30 }, { "epoch": 0.012270879668686249, "grad_norm": 0.11831510066986084, "learning_rate": 9.885734329855798e-05, "loss": 0.2782, "step": 40 }, { "epoch": 0.015338599585857812, "grad_norm": 0.35711294412612915, "learning_rate": 9.797464868072488e-05, "loss": 0.2235, "step": 50 }, { "epoch": 0.015338599585857812, "eval_loss": 0.3108671307563782, "eval_runtime": 766.1358, "eval_samples_per_second": 7.166, "eval_steps_per_second": 1.792, "step": 50 }, { "epoch": 0.018406319503029372, "grad_norm": 0.10238589346408844, "learning_rate": 9.68474862499881e-05, "loss": 0.2815, "step": 60 }, { "epoch": 0.021474039420200937, "grad_norm": 0.11004552245140076, "learning_rate": 9.548159976772592e-05, "loss": 0.3691, "step": 70 }, { "epoch": 0.024541759337372498, "grad_norm": 0.10997151583433151, "learning_rate": 9.388394947836279e-05, "loss": 0.357, "step": 80 }, { "epoch": 0.02760947925454406, "grad_norm": 0.1159084290266037, "learning_rate": 9.206267664155907e-05, "loss": 0.2697, "step": 90 }, { "epoch": 0.030677199171715623, "grad_norm": 0.3277042508125305, "learning_rate": 9.002706204621803e-05, "loss": 0.2269, "step": 100 }, { "epoch": 0.030677199171715623, "eval_loss": 0.313243567943573, "eval_runtime": 766.9783, "eval_samples_per_second": 7.158, "eval_steps_per_second": 1.79, "step": 100 }, { "epoch": 0.03374491908888719, "grad_norm": 0.09407459944486618, "learning_rate": 8.778747871771292e-05, "loss": 0.2725, "step": 110 }, { "epoch": 0.036812639006058745, "grad_norm": 0.1076802909374237, "learning_rate": 8.535533905932738e-05, "loss": 0.3743, "step": 120 }, { "epoch": 0.03988035892323031, "grad_norm": 0.11247926205396652, "learning_rate": 8.274303669726426e-05, "loss": 0.3612, "step": 130 }, { "epoch": 0.042948078840401874, "grad_norm": 0.13004067540168762, "learning_rate": 7.996388332556735e-05, "loss": 0.2636, "step": 140 }, { "epoch": 0.04601579875757343, "grad_norm": 0.41083377599716187, "learning_rate": 7.703204087277988e-05, "loss": 0.2176, "step": 150 }, { "epoch": 0.04601579875757343, "eval_loss": 0.30073416233062744, "eval_runtime": 765.9106, "eval_samples_per_second": 7.168, "eval_steps_per_second": 1.793, "step": 150 }, { "epoch": 0.049083518674744996, "grad_norm": 0.09948628395795822, "learning_rate": 7.396244933600285e-05, "loss": 0.28, "step": 160 }, { "epoch": 0.05215123859191656, "grad_norm": 0.10903914272785187, "learning_rate": 7.077075065009433e-05, "loss": 0.3643, "step": 170 }, { "epoch": 0.05521895850908812, "grad_norm": 0.11725682765245438, "learning_rate": 6.747320897995493e-05, "loss": 0.3636, "step": 180 }, { "epoch": 0.05828667842625968, "grad_norm": 0.10994742065668106, "learning_rate": 6.408662784207149e-05, "loss": 0.2732, "step": 190 }, { "epoch": 0.061354398343431246, "grad_norm": 0.251674085855484, "learning_rate": 6.062826447764883e-05, "loss": 0.2081, "step": 200 }, { "epoch": 0.061354398343431246, "eval_loss": 0.295357346534729, "eval_runtime": 767.7606, "eval_samples_per_second": 7.151, "eval_steps_per_second": 1.788, "step": 200 }, { "epoch": 0.0644221182606028, "grad_norm": 0.09594530612230301, "learning_rate": 5.7115741913664264e-05, "loss": 0.2597, "step": 210 }, { "epoch": 0.06748983817777437, "grad_norm": 0.10894957929849625, "learning_rate": 5.3566959159961615e-05, "loss": 0.3608, "step": 220 }, { "epoch": 0.07055755809494593, "grad_norm": 0.103450708091259, "learning_rate": 5e-05, "loss": 0.3554, "step": 230 }, { "epoch": 0.07362527801211749, "grad_norm": 0.1029270738363266, "learning_rate": 4.643304084003839e-05, "loss": 0.282, "step": 240 }, { "epoch": 0.07669299792928906, "grad_norm": 0.35574325919151306, "learning_rate": 4.288425808633575e-05, "loss": 0.2095, "step": 250 }, { "epoch": 0.07669299792928906, "eval_loss": 0.29382532835006714, "eval_runtime": 766.7704, "eval_samples_per_second": 7.16, "eval_steps_per_second": 1.791, "step": 250 }, { "epoch": 0.07976071784646062, "grad_norm": 0.08866327255964279, "learning_rate": 3.937173552235117e-05, "loss": 0.2725, "step": 260 }, { "epoch": 0.08282843776363218, "grad_norm": 0.10799609124660492, "learning_rate": 3.591337215792852e-05, "loss": 0.3543, "step": 270 }, { "epoch": 0.08589615768080375, "grad_norm": 0.10899989306926727, "learning_rate": 3.2526791020045086e-05, "loss": 0.3616, "step": 280 }, { "epoch": 0.0889638775979753, "grad_norm": 0.1085992082953453, "learning_rate": 2.9229249349905684e-05, "loss": 0.292, "step": 290 }, { "epoch": 0.09203159751514686, "grad_norm": 0.2433381974697113, "learning_rate": 2.603755066399718e-05, "loss": 0.2056, "step": 300 }, { "epoch": 0.09203159751514686, "eval_loss": 0.2922627031803131, "eval_runtime": 766.4427, "eval_samples_per_second": 7.163, "eval_steps_per_second": 1.791, "step": 300 }, { "epoch": 0.09509931743231843, "grad_norm": 0.0941392332315445, "learning_rate": 2.296795912722014e-05, "loss": 0.275, "step": 310 }, { "epoch": 0.09816703734948999, "grad_norm": 0.11052852123975754, "learning_rate": 2.0036116674432654e-05, "loss": 0.3692, "step": 320 }, { "epoch": 0.10123475726666155, "grad_norm": 0.10507681220769882, "learning_rate": 1.725696330273575e-05, "loss": 0.3476, "step": 330 }, { "epoch": 0.10430247718383312, "grad_norm": 0.10875732451677322, "learning_rate": 1.4644660940672627e-05, "loss": 0.2607, "step": 340 }, { "epoch": 0.10737019710100468, "grad_norm": 0.23030522465705872, "learning_rate": 1.2212521282287092e-05, "loss": 0.1934, "step": 350 }, { "epoch": 0.10737019710100468, "eval_loss": 0.29142311215400696, "eval_runtime": 765.9528, "eval_samples_per_second": 7.168, "eval_steps_per_second": 1.793, "step": 350 }, { "epoch": 0.11043791701817623, "grad_norm": 0.10388277471065521, "learning_rate": 9.972937953781986e-06, "loss": 0.2745, "step": 360 }, { "epoch": 0.1135056369353478, "grad_norm": 0.10279553383588791, "learning_rate": 7.937323358440935e-06, "loss": 0.3599, "step": 370 }, { "epoch": 0.11657335685251936, "grad_norm": 0.10545451194047928, "learning_rate": 6.116050521637218e-06, "loss": 0.3421, "step": 380 }, { "epoch": 0.11964107676969092, "grad_norm": 0.11335179954767227, "learning_rate": 4.5184002322740785e-06, "loss": 0.2616, "step": 390 }, { "epoch": 0.12270879668686249, "grad_norm": 0.22902686893939972, "learning_rate": 3.1525137500119207e-06, "loss": 0.1961, "step": 400 }, { "epoch": 0.12270879668686249, "eval_loss": 0.29096364974975586, "eval_runtime": 767.6702, "eval_samples_per_second": 7.152, "eval_steps_per_second": 1.789, "step": 400 }, { "epoch": 0.12577651660403405, "grad_norm": 0.09514732658863068, "learning_rate": 2.0253513192751373e-06, "loss": 0.2589, "step": 410 }, { "epoch": 0.1288442365212056, "grad_norm": 0.10798075050115585, "learning_rate": 1.1426567014420297e-06, "loss": 0.3551, "step": 420 }, { "epoch": 0.13191195643837716, "grad_norm": 0.10427014529705048, "learning_rate": 5.089279059533658e-07, "loss": 0.3446, "step": 430 }, { "epoch": 0.13497967635554875, "grad_norm": 0.1093059629201889, "learning_rate": 1.2739426948732424e-07, "loss": 0.2696, "step": 440 }, { "epoch": 0.1380473962727203, "grad_norm": 0.2530665993690491, "learning_rate": 0.0, "loss": 0.1993, "step": 450 }, { "epoch": 0.1380473962727203, "eval_loss": 0.29087916016578674, "eval_runtime": 766.9955, "eval_samples_per_second": 7.158, "eval_steps_per_second": 1.79, "step": 450 } ], "logging_steps": 10, "max_steps": 450, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 150, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2833863064239473e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }