End of training

Browse files

Files changed (7) hide show

README.md +4 -3
adapter_config.json +39 -0
adapter_model.safetensors +3 -0
all_results.json +5 -5
train_results.json +5 -5
trainer_state.json +124 -124
training_args.bin +2 -2

README.md CHANGED Viewed

@@ -1,5 +1,5 @@
 ---
-base_model: Gensyn/Qwen2.5-0.5B-Instruct
 library_name: transformers
 model_name: gensyn-checkpoints-stocky_regal_coral
 tags:
@@ -8,13 +8,14 @@ tags:
 - grpo
 - gensyn
 - I am stocky regal coral
 - trl
 licence: license
 ---
 # Model Card for gensyn-checkpoints-stocky_regal_coral
-This model is a fine-tuned version of [Gensyn/Qwen2.5-0.5B-Instruct](https://huggingface.co/Gensyn/Qwen2.5-0.5B-Instruct).
 It has been trained using [TRL](https://github.com/huggingface/trl).
 ## Quick start
@@ -39,7 +40,7 @@ This model was trained with GRPO, a method introduced in [DeepSeekMath: Pushing
 - TRL: 0.15.2
 - Transformers: 4.51.3
-- Pytorch: 2.5.1
 - Datasets: 3.5.0
 - Tokenizers: 0.21.1

 ---
+base_model: Gensyn/Qwen2.5-1.5B-Instruct
 library_name: transformers
 model_name: gensyn-checkpoints-stocky_regal_coral
 tags:
 - grpo
 - gensyn
 - I am stocky regal coral
+- unsloth
 - trl
 licence: license
 ---
 # Model Card for gensyn-checkpoints-stocky_regal_coral
+This model is a fine-tuned version of [Gensyn/Qwen2.5-1.5B-Instruct](https://huggingface.co/Gensyn/Qwen2.5-1.5B-Instruct).
 It has been trained using [TRL](https://github.com/huggingface/trl).
 ## Quick start
 - TRL: 0.15.2
 - Transformers: 4.51.3
+- Pytorch: 2.6.0
 - Datasets: 3.5.0
 - Tokenizers: 0.21.1

adapter_config.json ADDED Viewed

	@@ -0,0 +1,39 @@

+{
+  "alpha_pattern": {},
+  "auto_mapping": null,
+  "base_model_name_or_path": "Gensyn/Qwen2.5-1.5B-Instruct",
+  "bias": "none",
+  "corda_config": null,
+  "eva_config": null,
+  "exclude_modules": null,
+  "fan_in_fan_out": false,
+  "inference_mode": true,
+  "init_lora_weights": true,
+  "layer_replication": null,
+  "layers_pattern": null,
+  "layers_to_transform": null,
+  "loftq_config": {},
+  "lora_alpha": 16,
+  "lora_bias": false,
+  "lora_dropout": 0,
+  "megatron_config": null,
+  "megatron_core": "megatron.core",
+  "modules_to_save": null,
+  "peft_type": "LORA",
+  "r": 16,
+  "rank_pattern": {},
+  "revision": null,
+  "target_modules": [
+    "q_proj",
+    "o_proj",
+    "k_proj",
+    "down_proj",
+    "v_proj",
+    "up_proj",
+    "gate_proj"
+  ],
+  "task_type": "CAUSAL_LM",
+  "trainable_token_indices": null,
+  "use_dora": false,
+  "use_rslora": false
+}

adapter_model.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c8b4d683e0259c0b5f054643de17b6c90bebe2264746ce6a6756aba805d36d86
+size 73911112

all_results.json CHANGED Viewed

@@ -1,8 +1,8 @@
 {
     "total_flos": 0.0,
-    "train_loss": 1.5345588326454163e-05,
-    "train_runtime": 186.0778,
-    "train_samples": 28,
-    "train_samples_per_second": 1.72,
-    "train_steps_per_second": 0.107
 }

 {
     "total_flos": 0.0,
+    "train_loss": 6.60325480339452e-07,
+    "train_runtime": 1662.7616,
+    "train_samples": 11,
+    "train_samples_per_second": 0.192,
+    "train_steps_per_second": 0.012
 }

train_results.json CHANGED Viewed

@@ -1,8 +1,8 @@
 {
     "total_flos": 0.0,
-    "train_loss": 1.5345588326454163e-05,
-    "train_runtime": 186.0778,
-    "train_samples": 28,
-    "train_samples_per_second": 1.72,
-    "train_steps_per_second": 0.107
 }

 {
     "total_flos": 0.0,
+    "train_loss": 6.60325480339452e-07,
+    "train_runtime": 1662.7616,
+    "train_samples": 11,
+    "train_samples_per_second": 0.192,
+    "train_steps_per_second": 0.012
 }

trainer_state.json CHANGED Viewed

@@ -2,7 +2,7 @@
   "best_global_step": null,
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 5.0,
   "eval_steps": 500,
   "global_step": 20,
   "is_hyper_param_search": false,
@@ -10,209 +10,209 @@
   "is_world_process_zero": true,
   "log_history": [
     {
-      "completion_length": 241.1875,
-      "epoch": 0.5714285714285714,
-      "grad_norm": 8.503501892089844,
-      "kl": 0.0,
       "learning_rate": 5e-07,
-      "loss": -0.0,
-      "reward": 1.489977477118373,
-      "reward_std": 0.9155122159281746,
-      "rewards/concensus_correctness_reward_func": 0.18056249991059303,
       "rewards/consensus_reward_func": 0.125,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.1875,
-      "rewards/question_recreation_reward_func": 0.44560248544439673,
       "rewards/soft_format_reward_func": 0.0,
-      "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.5513125089928508,
       "step": 2
     },
     {
-      "completion_length": 173.625,
-      "epoch": 1.0,
-      "grad_norm": 11.55927562713623,
-      "kl": 0.003464061524330949,
       "learning_rate": 4.864543104251586e-07,
       "loss": 0.0,
-      "reward": 1.540897677342097,
-      "reward_std": 0.5160543769598007,
-      "rewards/concensus_correctness_reward_func": 0.0503333310286204,
-      "rewards/consensus_reward_func": 0.08333333333333333,
       "rewards/cumulative_reward_2": 0.0,
       "rewards/final_correctness_reward_func": 0.0,
-      "rewards/question_recreation_reward_func": 0.5737726578178505,
-      "rewards/soft_format_reward_func": 0.0,
-      "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.8334583342075348,
       "step": 4
     },
     {
-      "completion_length": 176.03125,
-      "epoch": 1.5714285714285714,
-      "grad_norm": 7.549230098724365,
-      "kl": 0.006556663851370104,
       "learning_rate": 4.472851273490984e-07,
       "loss": 0.0,
-      "reward": 1.971242893487215,
-      "reward_std": 1.369354895039578,
-      "rewards/concensus_correctness_reward_func": 0.53575000166893,
-      "rewards/consensus_reward_func": 0.375,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.0625,
-      "rewards/question_recreation_reward_func": 0.413930396316573,
       "rewards/soft_format_reward_func": 0.0,
-      "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.584062498062849,
       "step": 6
     },
     {
-      "completion_length": 191.875,
-      "epoch": 2.0,
-      "grad_norm": 7.489903926849365,
-      "kl": 0.008484401817743977,
       "learning_rate": 3.867370395306068e-07,
       "loss": 0.0,
-      "reward": 2.7487063656250634,
-      "reward_std": 1.0709232110530138,
-      "rewards/concensus_correctness_reward_func": 0.549750010172526,
-      "rewards/consensus_reward_func": 0.5,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.4166666666666667,
-      "rewards/question_recreation_reward_func": 0.5391230415552855,
       "rewards/soft_format_reward_func": 0.0,
-      "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.7431666528185209,
       "step": 8
     },
     {
-      "completion_length": 202.375,
-      "epoch": 2.571428571428571,
-      "grad_norm": 10.167320251464844,
-      "kl": 0.013743098577833734,
       "learning_rate": 3.1137137178519977e-07,
       "loss": 0.0,
-      "reward": 1.5999224437400699,
-      "reward_std": 0.8269358775578439,
-      "rewards/concensus_correctness_reward_func": 0.1863749995827675,
-      "rewards/consensus_reward_func": 0.1875,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.125,
-      "rewards/question_recreation_reward_func": 0.3886724393814802,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.712375009432435,
       "step": 10
     },
     {
-      "completion_length": 187.70833333333334,
-      "epoch": 3.0,
-      "grad_norm": 5.543355941772461,
-      "kl": 0.03392461900754521,
       "learning_rate": 2.2935516363191693e-07,
       "loss": 0.0,
-      "reward": 3.602676714460055,
-      "reward_std": 2.3583224962155023,
-      "rewards/concensus_correctness_reward_func": 1.3790833701690037,
-      "rewards/consensus_reward_func": 0.5,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.16666666666666666,
-      "rewards/question_recreation_reward_func": 0.5984267567594846,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.9584999680519104,
       "step": 12
     },
     {
-      "completion_length": 215.75,
-      "epoch": 3.571428571428571,
-      "grad_norm": 8.53206729888916,
-      "kl": 0.05182240842259489,
       "learning_rate": 1.4957614383675767e-07,
-      "loss": 0.0001,
-      "reward": 2.0001366659998894,
-      "reward_std": 1.3096730313263834,
-      "rewards/concensus_correctness_reward_func": 0.3738125078380108,
-      "rewards/consensus_reward_func": 0.4375,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.0625,
-      "rewards/question_recreation_reward_func": 0.40176167245954275,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.724562500603497,
       "step": 14
     },
     {
-      "completion_length": 167.625,
-      "epoch": 4.0,
-      "grad_norm": 6.399363994598389,
-      "kl": 0.015622085076756775,
       "learning_rate": 8.067960709356478e-08,
       "loss": 0.0,
-      "reward": 2.192226921518644,
-      "reward_std": 1.3540961171189945,
-      "rewards/concensus_correctness_reward_func": 0.3948333313067754,
-      "rewards/consensus_reward_func": 0.3333333333333333,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.08333333333333333,
-      "rewards/question_recreation_reward_func": 0.4708102932199836,
-      "rewards/soft_format_reward_func": 0.0,
-      "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.9099166691303253,
       "step": 16
     },
     {
-      "completion_length": 159.125,
-      "epoch": 4.571428571428571,
-      "grad_norm": 18.8550968170166,
-      "kl": 0.02504031316493638,
       "learning_rate": 3.013156219837776e-08,
       "loss": 0.0,
-      "reward": 2.1071279235184193,
-      "reward_std": 1.0606713661400136,
-      "rewards/concensus_correctness_reward_func": 0.29612500593066216,
-      "rewards/consensus_reward_func": 0.3125,
       "rewards/cumulative_reward_2": 0.0,
-      "rewards/final_correctness_reward_func": 0.1875,
-      "rewards/question_recreation_reward_func": 0.40919047803618014,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.9018124938011169,
       "step": 18
     },
     {
-      "completion_length": 205.95833333333334,
-      "epoch": 5.0,
-      "grad_norm": 5.739038944244385,
-      "kl": 0.01997669351597627,
       "learning_rate": 3.4096741493194193e-09,
       "loss": 0.0,
-      "reward": 2.0862623304128647,
-      "reward_std": 0.9388213828206062,
-      "rewards/concensus_correctness_reward_func": 0.5483333269755045,
-      "rewards/consensus_reward_func": 0.3333333333333333,
       "rewards/cumulative_reward_2": 0.0,
       "rewards/final_correctness_reward_func": 0.0,
-      "rewards/question_recreation_reward_func": 0.5659290192027887,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
-      "rewards/xmlcount_reward_func": 0.6386666645606359,
       "step": 20
     },
     {
-      "epoch": 5.0,
       "step": 20,
       "total_flos": 0.0,
-      "train_loss": 1.5345588326454163e-05,
-      "train_runtime": 186.0778,
-      "train_samples_per_second": 1.72,
-      "train_steps_per_second": 0.107
     }
   ],
   "logging_steps": 2,
   "max_steps": 20,
   "num_input_tokens_seen": 0,
-  "num_train_epochs": 7,
   "save_steps": 25,
   "stateful_callbacks": {
     "TrainerControl": {
@@ -227,7 +227,7 @@
     }
   },
   "total_flos": 0.0,
-  "train_batch_size": 2,
   "trial_name": null,
   "trial_params": null
 }

   "best_global_step": null,
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 6.7272727272727275,
   "eval_steps": 500,
   "global_step": 20,
   "is_hyper_param_search": false,
   "is_world_process_zero": true,
   "log_history": [
     {
+      "completion_length": 506.375,
+      "epoch": 0.7272727272727273,
+      "grad_norm": 1.4820094108581543,
+      "kl": 0.0008027831609069835,
       "learning_rate": 5e-07,
+      "loss": 0.0,
+      "reward": 1.035042181611061,
+      "reward_std": 0.8421451970934868,
+      "rewards/concensus_correctness_reward_func": 0.036375001072883606,
       "rewards/consensus_reward_func": 0.125,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.46988590620458126,
       "rewards/soft_format_reward_func": 0.0,
+      "rewards/strict_format_reward_func": 0.015625,
+      "rewards/xmlcount_reward_func": 0.38815625198185444,
       "step": 2
     },
     {
+      "completion_length": 513.3571428571429,
+      "epoch": 1.3636363636363638,
+      "grad_norm": 0.445872038602829,
+      "kl": 0.0006397852225096098,
       "learning_rate": 4.864543104251586e-07,
       "loss": 0.0,
+      "reward": 0.7346837137426648,
+      "reward_std": 0.8450689358370644,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.14285714285714285,
       "rewards/cumulative_reward_2": 0.0,
       "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.37075512749808176,
+      "rewards/soft_format_reward_func": 0.017857142857142856,
+      "rewards/strict_format_reward_func": 0.017857142857142856,
+      "rewards/xmlcount_reward_func": 0.18535713532141276,
       "step": 4
     },
     {
+      "completion_length": 560.1428571428571,
+      "epoch": 2.0,
+      "grad_norm": 0.38747185468673706,
+      "kl": 0.0007191316191373127,
       "learning_rate": 4.472851273490984e-07,
       "loss": 0.0,
+      "reward": 0.5699776453631265,
+      "reward_std": 0.9944636523723602,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.0,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.5647633586611066,
       "rewards/soft_format_reward_func": 0.0,
+      "rewards/strict_format_reward_func": 0.017857142857142856,
+      "rewards/xmlcount_reward_func": -0.012642858283860343,
       "step": 6
     },
     {
+      "completion_length": 473.28125,
+      "epoch": 2.7272727272727275,
+      "grad_norm": 0.30954426527023315,
+      "kl": 0.0006844959243608173,
       "learning_rate": 3.867370395306068e-07,
       "loss": 0.0,
+      "reward": 0.9583013541996479,
+      "reward_std": 0.7450565788894892,
+      "rewards/concensus_correctness_reward_func": 0.018187500536441803,
+      "rewards/consensus_reward_func": 0.125,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.4160201190970838,
       "rewards/soft_format_reward_func": 0.0,
+      "rewards/strict_format_reward_func": 0.015625,
+      "rewards/xmlcount_reward_func": 0.38346873549744487,
       "step": 8
     },
     {
+      "completion_length": 471.2857142857143,
+      "epoch": 3.3636363636363638,
+      "grad_norm": 0.5266454219818115,
+      "kl": 0.000670341109590871,
       "learning_rate": 3.1137137178519977e-07,
       "loss": 0.0,
+      "reward": 0.32737854548863005,
+      "reward_std": 0.7675705594675881,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.0,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.4784499683550426,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
+      "rewards/xmlcount_reward_func": -0.15107143563883646,
       "step": 10
     },
     {
+      "completion_length": 539.25,
+      "epoch": 4.0,
+      "grad_norm": 0.25759485363960266,
+      "kl": 0.0006850463562711541,
       "learning_rate": 2.2935516363191693e-07,
       "loss": 0.0,
+      "reward": 0.7588136685746056,
+      "reward_std": 1.0656214441571916,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.2857142857142857,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.4308851105826242,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
+      "rewards/xmlcount_reward_func": 0.04221428717885699,
       "step": 12
     },
     {
+      "completion_length": 489.9375,
+      "epoch": 4.7272727272727275,
+      "grad_norm": 0.3439454138278961,
+      "kl": 0.0007117958957678638,
       "learning_rate": 1.4957614383675767e-07,
+      "loss": 0.0,
+      "reward": 0.8863358050584793,
+      "reward_std": 0.8433153182268143,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.1875,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.47583583649247885,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
+      "rewards/xmlcount_reward_func": 0.22300000116229057,
       "step": 14
     },
     {
+      "completion_length": 523.2857142857143,
+      "epoch": 5.363636363636363,
+      "grad_norm": 0.38085728883743286,
+      "kl": 0.0006335535435937345,
       "learning_rate": 8.067960709356478e-08,
       "loss": 0.0,
+      "reward": 0.7580059724194663,
+      "reward_std": 0.7936756866318839,
+      "rewards/concensus_correctness_reward_func": 0.0,
+      "rewards/consensus_reward_func": 0.07142857142857142,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.509327403136662,
+      "rewards/soft_format_reward_func": 0.017857142857142856,
+      "rewards/strict_format_reward_func": 0.017857142857142856,
+      "rewards/xmlcount_reward_func": 0.1415357163974217,
       "step": 16
     },
     {
+      "completion_length": 508.42857142857144,
+      "epoch": 6.0,
+      "grad_norm": 0.2788238227367401,
+      "kl": 0.0007832092316155988,
       "learning_rate": 3.013156219837776e-08,
       "loss": 0.0,
+      "reward": 0.6740405261516571,
+      "reward_std": 0.8816355466842651,
+      "rewards/concensus_correctness_reward_func": 0.020785714898790632,
+      "rewards/consensus_reward_func": 0.07142857142857142,
       "rewards/cumulative_reward_2": 0.0,
+      "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.45243336047445026,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
+      "rewards/xmlcount_reward_func": 0.12939287509237016,
       "step": 18
     },
     {
+      "completion_length": 431.5,
+      "epoch": 6.7272727272727275,
+      "grad_norm": 0.5755950212478638,
+      "kl": 0.0006934339544386603,
       "learning_rate": 3.4096741493194193e-09,
       "loss": 0.0,
+      "reward": 1.1830952167510986,
+      "reward_std": 0.8285410469397902,
+      "rewards/concensus_correctness_reward_func": 0.03462500125169754,
+      "rewards/consensus_reward_func": 0.1875,
       "rewards/cumulative_reward_2": 0.0,
       "rewards/final_correctness_reward_func": 0.0,
+      "rewards/question_recreation_reward_func": 0.5105639984831214,
       "rewards/soft_format_reward_func": 0.0,
       "rewards/strict_format_reward_func": 0.0,
+      "rewards/xmlcount_reward_func": 0.4504062533378601,
       "step": 20
     },
     {
+      "epoch": 6.7272727272727275,
       "step": 20,
       "total_flos": 0.0,
+      "train_loss": 6.60325480339452e-07,
+      "train_runtime": 1662.7616,
+      "train_samples_per_second": 0.192,
+      "train_steps_per_second": 0.012
     }
   ],
   "logging_steps": 2,
   "max_steps": 20,
   "num_input_tokens_seen": 0,
+  "num_train_epochs": 10,
   "save_steps": 25,
   "stateful_callbacks": {
     "TrainerControl": {
     }
   },
   "total_flos": 0.0,
+  "train_batch_size": 4,
   "trial_name": null,
   "trial_params": null
 }

training_args.bin CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f264bcdecf67f93bdb8f57b4681f2cd51842e1a844b7017ced9c38a7aaf0b6cf
-size 5880

 version https://git-lfs.github.com/spec/v1
+oid sha256:f91437d5a844284fbd14ce549d0615f017fc8dbf6115a0aa555681b96f229874
+size 5944