{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9962426194310252, "eval_steps": 400, "global_step": 116, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008588298443370907, "grad_norm": 4.210139685065214, "learning_rate": 4.166666666666666e-08, "logits/chosen": -0.8864150643348694, "logits/rejected": -0.7702733874320984, "logps/chosen": -321.8031005859375, "logps/rejected": -323.9952087402344, "loss": 0.6931, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.04294149221685454, "grad_norm": 4.284081084574684, "learning_rate": 2.0833333333333333e-07, "logits/chosen": -0.9348078966140747, "logits/rejected": -0.7443727254867554, "logps/chosen": -266.3022766113281, "logps/rejected": -279.5313415527344, "loss": 0.6932, "rewards/accuracies": 0.4296875, "rewards/chosen": 0.0018327628495171666, "rewards/margins": 0.0009310221648775041, "rewards/rejected": 0.0009017407428473234, "step": 5 }, { "epoch": 0.08588298443370908, "grad_norm": 4.158001828009968, "learning_rate": 4.1666666666666667e-07, "logits/chosen": -0.8552933931350708, "logits/rejected": -0.8034487962722778, "logps/chosen": -293.23590087890625, "logps/rejected": -292.0088195800781, "loss": 0.6931, "rewards/accuracies": 0.5062500238418579, "rewards/chosen": 9.959501767298207e-05, "rewards/margins": 0.0007206935551948845, "rewards/rejected": -0.0006210985593497753, "step": 10 }, { "epoch": 0.1288244766505636, "grad_norm": 4.567637855948643, "learning_rate": 4.989741394042727e-07, "logits/chosen": -0.8358424305915833, "logits/rejected": -0.8925448656082153, "logps/chosen": -268.2622985839844, "logps/rejected": -271.18145751953125, "loss": 0.6918, "rewards/accuracies": 0.550000011920929, "rewards/chosen": -0.006006752140820026, "rewards/margins": 0.0014937935629859567, "rewards/rejected": -0.007500545121729374, "step": 15 }, { "epoch": 0.17176596886741816, "grad_norm": 4.336157984201086, "learning_rate": 4.92735454356513e-07, "logits/chosen": -0.8938239812850952, "logits/rejected": -0.5865119695663452, "logps/chosen": -275.62078857421875, "logps/rejected": -298.15277099609375, "loss": 0.6891, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -0.013274839147925377, "rewards/margins": 0.009074670262634754, "rewards/rejected": -0.022349510341882706, "step": 20 }, { "epoch": 0.2147074610842727, "grad_norm": 4.73918028422008, "learning_rate": 4.809698831278217e-07, "logits/chosen": -0.9047508239746094, "logits/rejected": -0.6394493579864502, "logps/chosen": -275.29339599609375, "logps/rejected": -297.6326599121094, "loss": 0.6853, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.02425473928451538, "rewards/margins": 0.013508354313671589, "rewards/rejected": -0.037763092666864395, "step": 25 }, { "epoch": 0.2576489533011272, "grad_norm": 4.98992654294951, "learning_rate": 4.639453180753619e-07, "logits/chosen": -1.0131752490997314, "logits/rejected": -0.882045567035675, "logps/chosen": -287.7568359375, "logps/rejected": -295.9369201660156, "loss": 0.6783, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.04366759583353996, "rewards/margins": 0.02451903559267521, "rewards/rejected": -0.06818662583827972, "step": 30 }, { "epoch": 0.30059044551798175, "grad_norm": 6.74883481459733, "learning_rate": 4.420493945100701e-07, "logits/chosen": -1.1297965049743652, "logits/rejected": -0.8051716089248657, "logps/chosen": -283.3311767578125, "logps/rejected": -296.3681640625, "loss": 0.6635, "rewards/accuracies": 0.75, "rewards/chosen": -0.08790449798107147, "rewards/margins": 0.05067775398492813, "rewards/rejected": -0.1385822594165802, "step": 35 }, { "epoch": 0.3435319377348363, "grad_norm": 7.118144640608333, "learning_rate": 4.157806645601988e-07, "logits/chosen": -1.247629165649414, "logits/rejected": -0.979712963104248, "logps/chosen": -301.14276123046875, "logps/rejected": -353.21771240234375, "loss": 0.6335, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.286587655544281, "rewards/margins": 0.22871723771095276, "rewards/rejected": -0.5153048634529114, "step": 40 }, { "epoch": 0.3864734299516908, "grad_norm": 13.12122119454871, "learning_rate": 3.857372455503697e-07, "logits/chosen": -1.5229122638702393, "logits/rejected": -1.1764552593231201, "logps/chosen": -345.91534423828125, "logps/rejected": -407.24066162109375, "loss": 0.6141, "rewards/accuracies": 0.637499988079071, "rewards/chosen": -0.7616133689880371, "rewards/margins": 0.3301664888858795, "rewards/rejected": -1.0917798280715942, "step": 45 }, { "epoch": 0.4294149221685454, "grad_norm": 18.143106745211465, "learning_rate": 3.5260320136318924e-07, "logits/chosen": -1.5299081802368164, "logits/rejected": -1.3491729497909546, "logps/chosen": -368.72589111328125, "logps/rejected": -479.5186462402344, "loss": 0.5696, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -0.9761147499084473, "rewards/margins": 0.8148883581161499, "rewards/rejected": -1.7910032272338867, "step": 50 }, { "epoch": 0.4723564143853999, "grad_norm": 9.672140306041474, "learning_rate": 3.171329668685942e-07, "logits/chosen": -1.4694689512252808, "logits/rejected": -1.2700998783111572, "logps/chosen": -350.7314758300781, "logps/rejected": -428.7144470214844, "loss": 0.5966, "rewards/accuracies": 0.731249988079071, "rewards/chosen": -0.8904134631156921, "rewards/margins": 0.5776315331459045, "rewards/rejected": -1.4680449962615967, "step": 55 }, { "epoch": 0.5152979066022544, "grad_norm": 16.049279259784857, "learning_rate": 2.801341700638307e-07, "logits/chosen": -1.3077186346054077, "logits/rejected": -1.2475168704986572, "logps/chosen": -362.92901611328125, "logps/rejected": -411.95428466796875, "loss": 0.5849, "rewards/accuracies": 0.71875, "rewards/chosen": -0.8330501317977905, "rewards/margins": 0.4124886393547058, "rewards/rejected": -1.2455389499664307, "step": 60 }, { "epoch": 0.558239398819109, "grad_norm": 16.305327082053815, "learning_rate": 2.424492430497778e-07, "logits/chosen": -1.4747767448425293, "logits/rejected": -1.241782784461975, "logps/chosen": -405.95556640625, "logps/rejected": -510.70086669921875, "loss": 0.5521, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -1.151323914527893, "rewards/margins": 0.7965081334114075, "rewards/rejected": -1.9478321075439453, "step": 65 }, { "epoch": 0.6011808910359635, "grad_norm": 30.25189747787338, "learning_rate": 2.0493624054652355e-07, "logits/chosen": -1.4809482097625732, "logits/rejected": -1.3973617553710938, "logps/chosen": -421.712158203125, "logps/rejected": -529.5582275390625, "loss": 0.5511, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -1.5525481700897217, "rewards/margins": 0.9345462918281555, "rewards/rejected": -2.4870944023132324, "step": 70 }, { "epoch": 0.644122383252818, "grad_norm": 12.13048083848699, "learning_rate": 1.6844930269478273e-07, "logits/chosen": -1.485026240348816, "logits/rejected": -1.31827974319458, "logps/chosen": -404.7787780761719, "logps/rejected": -519.0001220703125, "loss": 0.5537, "rewards/accuracies": 0.706250011920929, "rewards/chosen": -1.2742478847503662, "rewards/margins": 0.9946924448013306, "rewards/rejected": -2.2689404487609863, "step": 75 }, { "epoch": 0.6870638754696726, "grad_norm": 19.993984457337294, "learning_rate": 1.3381920698905784e-07, "logits/chosen": -1.5141922235488892, "logits/rejected": -1.3948736190795898, "logps/chosen": -392.6872253417969, "logps/rejected": -493.94085693359375, "loss": 0.5418, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -1.184427261352539, "rewards/margins": 0.8116995096206665, "rewards/rejected": -1.9961267709732056, "step": 80 }, { "epoch": 0.7300053676865271, "grad_norm": 15.617751610633638, "learning_rate": 1.0183445215899584e-07, "logits/chosen": -1.5283777713775635, "logits/rejected": -1.4817469120025635, "logps/chosen": -363.037109375, "logps/rejected": -422.297119140625, "loss": 0.5335, "rewards/accuracies": 0.8125, "rewards/chosen": -1.0216243267059326, "rewards/margins": 0.589500367641449, "rewards/rejected": -1.6111247539520264, "step": 85 }, { "epoch": 0.7729468599033816, "grad_norm": 16.7994475116355, "learning_rate": 7.322330470336313e-08, "logits/chosen": -1.5346717834472656, "logits/rejected": -1.3320344686508179, "logps/chosen": -413.17919921875, "logps/rejected": -525.8975830078125, "loss": 0.5305, "rewards/accuracies": 0.7124999761581421, "rewards/chosen": -1.471152663230896, "rewards/margins": 0.8769656419754028, "rewards/rejected": -2.348118543624878, "step": 90 }, { "epoch": 0.8158883521202361, "grad_norm": 20.19718725994838, "learning_rate": 4.863721686226349e-08, "logits/chosen": -1.5738106966018677, "logits/rejected": -1.5511492490768433, "logps/chosen": -401.5107116699219, "logps/rejected": -516.931396484375, "loss": 0.5372, "rewards/accuracies": 0.75, "rewards/chosen": -1.5206449031829834, "rewards/margins": 1.0285980701446533, "rewards/rejected": -2.549243211746216, "step": 95 }, { "epoch": 0.8588298443370908, "grad_norm": 23.0050132141915, "learning_rate": 2.863599358669755e-08, "logits/chosen": -1.6378017663955688, "logits/rejected": -1.387136459350586, "logps/chosen": -416.60064697265625, "logps/rejected": -553.6375122070312, "loss": 0.5366, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -1.478453278541565, "rewards/margins": 1.1283727884292603, "rewards/rejected": -2.606826066970825, "step": 100 }, { "epoch": 0.9017713365539453, "grad_norm": 29.77073926919972, "learning_rate": 1.3675046241339916e-08, "logits/chosen": -1.5992728471755981, "logits/rejected": -1.38992440700531, "logps/chosen": -445.1702575683594, "logps/rejected": -546.2207641601562, "loss": 0.5465, "rewards/accuracies": 0.8500000238418579, "rewards/chosen": -1.518192172050476, "rewards/margins": 0.8614376187324524, "rewards/rejected": -2.379629611968994, "step": 105 }, { "epoch": 0.9447128287707998, "grad_norm": 16.350013471631545, "learning_rate": 4.0950232632141205e-09, "logits/chosen": -1.6481338739395142, "logits/rejected": -1.5471255779266357, "logps/chosen": -409.4878845214844, "logps/rejected": -507.89337158203125, "loss": 0.5493, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -1.5026577711105347, "rewards/margins": 0.8497708439826965, "rewards/rejected": -2.352428436279297, "step": 110 }, { "epoch": 0.9876543209876543, "grad_norm": 12.603737187447198, "learning_rate": 1.1405387761664887e-10, "logits/chosen": -1.5979018211364746, "logits/rejected": -1.3727319240570068, "logps/chosen": -421.73486328125, "logps/rejected": -511.76763916015625, "loss": 0.504, "rewards/accuracies": 0.7562500238418579, "rewards/chosen": -1.4940106868743896, "rewards/margins": 0.8006712794303894, "rewards/rejected": -2.294682025909424, "step": 115 }, { "epoch": 0.9962426194310252, "step": 116, "total_flos": 0.0, "train_loss": 0.5965934328991791, "train_runtime": 5224.8748, "train_samples_per_second": 2.852, "train_steps_per_second": 0.022 } ], "logging_steps": 5, "max_steps": 116, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 1000000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }