Ben10x commited on
Commit
78e15bb
·
verified ·
1 Parent(s): 816ae0e

End of training

Browse files
README.md CHANGED
@@ -4,6 +4,8 @@ license: mit
4
  base_model: EleutherAI/gpt-neo-1.3B
5
  tags:
6
  - generated_from_trainer
 
 
7
  metrics:
8
  - precision
9
  - recall
@@ -11,7 +13,26 @@ metrics:
11
  - accuracy
12
  model-index:
13
  - name: gpt-medmentions
14
- results: []
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
15
  ---
16
 
17
  <!-- This model card has been generated automatically according to the information the Trainer had access to. You
@@ -19,13 +40,13 @@ should probably proofread and complete it, then remove this comment. -->
19
 
20
  # gpt-medmentions
21
 
22
- This model is a fine-tuned version of [EleutherAI/gpt-neo-1.3B](https://huggingface.co/EleutherAI/gpt-neo-1.3B) on an unknown dataset.
23
  It achieves the following results on the evaluation set:
24
- - Loss: 1.0743
25
- - Precision: 0.4822
26
- - Recall: 0.5298
27
- - F1: 0.5049
28
- - Accuracy: 0.8531
29
 
30
  ## Model description
31
 
 
4
  base_model: EleutherAI/gpt-neo-1.3B
5
  tags:
6
  - generated_from_trainer
7
+ datasets:
8
+ - Ben10x/MedMentions-MTI881-NER
9
  metrics:
10
  - precision
11
  - recall
 
13
  - accuracy
14
  model-index:
15
  - name: gpt-medmentions
16
+ results:
17
+ - task:
18
+ name: Token Classification
19
+ type: token-classification
20
+ dataset:
21
+ name: Ben10x/MedMentions-MTI881-NER
22
+ type: Ben10x/MedMentions-MTI881-NER
23
+ metrics:
24
+ - name: Precision
25
+ type: precision
26
+ value: 0.44823898474262086
27
+ - name: Recall
28
+ type: recall
29
+ value: 0.546458061712299
30
+ - name: F1
31
+ type: f1
32
+ value: 0.4924993145587718
33
+ - name: Accuracy
34
+ type: accuracy
35
+ value: 0.846457800511509
36
  ---
37
 
38
  <!-- This model card has been generated automatically according to the information the Trainer had access to. You
 
40
 
41
  # gpt-medmentions
42
 
43
+ This model is a fine-tuned version of [EleutherAI/gpt-neo-1.3B](https://huggingface.co/EleutherAI/gpt-neo-1.3B) on the Ben10x/MedMentions-MTI881-NER dataset.
44
  It achieves the following results on the evaluation set:
45
+ - Loss: 0.5086
46
+ - Precision: 0.4482
47
+ - Recall: 0.5465
48
+ - F1: 0.4925
49
+ - Accuracy: 0.8465
50
 
51
  ## Model description
52
 
all_results.json CHANGED
@@ -1,26 +1,26 @@
1
  {
2
  "epoch": 5.0,
3
- "eval_accuracy": 0.4323785166240409,
4
- "eval_f1": 0.5087636106612745,
5
- "eval_loss": 1.1892178058624268,
6
- "eval_precision": 0.4233535341503,
7
- "eval_recall": 0.6373458865725173,
8
- "eval_runtime": 11.4272,
9
  "eval_samples": 2916,
10
- "eval_samples_per_second": 255.18,
11
- "eval_steps_per_second": 16.014,
12
- "predict_accuracy": 0.43058697235747423,
13
- "predict_f1": 0.5080028955199871,
14
- "predict_loss": 1.1675766706466675,
15
- "predict_precision": 0.4175039661554733,
16
- "predict_recall": 0.6485931402752105,
17
- "predict_runtime": 11.8661,
18
- "predict_samples_per_second": 245.995,
19
- "predict_steps_per_second": 15.422,
20
- "total_flos": 4.924675837027942e+16,
21
- "train_loss": 0.9773399162096319,
22
- "train_runtime": 7734.8885,
23
  "train_samples": 23334,
24
- "train_samples_per_second": 15.084,
25
- "train_steps_per_second": 1.886
26
  }
 
1
  {
2
  "epoch": 5.0,
3
+ "eval_accuracy": 0.846457800511509,
4
+ "eval_f1": 0.4924993145587718,
5
+ "eval_loss": 0.5086450576782227,
6
+ "eval_precision": 0.44823898474262086,
7
+ "eval_recall": 0.546458061712299,
8
+ "eval_runtime": 33.7698,
9
  "eval_samples": 2916,
10
+ "eval_samples_per_second": 86.349,
11
+ "eval_steps_per_second": 10.808,
12
+ "predict_accuracy": 0.8543495763524135,
13
+ "predict_f1": 0.5065875370919882,
14
+ "predict_loss": 0.49107736349105835,
15
+ "predict_precision": 0.4661763635039685,
16
+ "predict_recall": 0.5546699012302894,
17
+ "predict_runtime": 32.7017,
18
+ "predict_samples_per_second": 89.262,
19
+ "predict_steps_per_second": 11.162,
20
+ "total_flos": 4.62662533103459e+16,
21
+ "train_loss": 0.2550947672543478,
22
+ "train_runtime": 8451.3725,
23
  "train_samples": 23334,
24
+ "train_samples_per_second": 13.805,
25
+ "train_steps_per_second": 3.452
26
  }
eval_results.json CHANGED
@@ -1,12 +1,12 @@
1
  {
2
  "epoch": 5.0,
3
- "eval_accuracy": 0.4323785166240409,
4
- "eval_f1": 0.5087636106612745,
5
- "eval_loss": 1.1892178058624268,
6
- "eval_precision": 0.4233535341503,
7
- "eval_recall": 0.6373458865725173,
8
- "eval_runtime": 11.4272,
9
  "eval_samples": 2916,
10
- "eval_samples_per_second": 255.18,
11
- "eval_steps_per_second": 16.014
12
  }
 
1
  {
2
  "epoch": 5.0,
3
+ "eval_accuracy": 0.846457800511509,
4
+ "eval_f1": 0.4924993145587718,
5
+ "eval_loss": 0.5086450576782227,
6
+ "eval_precision": 0.44823898474262086,
7
+ "eval_recall": 0.546458061712299,
8
+ "eval_runtime": 33.7698,
9
  "eval_samples": 2916,
10
+ "eval_samples_per_second": 86.349,
11
+ "eval_steps_per_second": 10.808
12
  }
predict_results.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "predict_accuracy": 0.43058697235747423,
3
- "predict_f1": 0.5080028955199871,
4
- "predict_loss": 1.1675766706466675,
5
- "predict_precision": 0.4175039661554733,
6
- "predict_recall": 0.6485931402752105,
7
- "predict_runtime": 11.8661,
8
- "predict_samples_per_second": 245.995,
9
- "predict_steps_per_second": 15.422
10
  }
 
1
  {
2
+ "predict_accuracy": 0.8543495763524135,
3
+ "predict_f1": 0.5065875370919882,
4
+ "predict_loss": 0.49107736349105835,
5
+ "predict_precision": 0.4661763635039685,
6
+ "predict_recall": 0.5546699012302894,
7
+ "predict_runtime": 32.7017,
8
+ "predict_samples_per_second": 89.262,
9
+ "predict_steps_per_second": 11.162
10
  }
predictions.txt CHANGED
The diff for this file is too large to render. See raw diff
 
train_results.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "epoch": 5.0,
3
- "total_flos": 4.924675837027942e+16,
4
- "train_loss": 0.9773399162096319,
5
- "train_runtime": 7734.8885,
6
  "train_samples": 23334,
7
- "train_samples_per_second": 15.084,
8
- "train_steps_per_second": 1.886
9
  }
 
1
  {
2
  "epoch": 5.0,
3
+ "total_flos": 4.62662533103459e+16,
4
+ "train_loss": 0.2550947672543478,
5
+ "train_runtime": 8451.3725,
6
  "train_samples": 23334,
7
+ "train_samples_per_second": 13.805,
8
+ "train_steps_per_second": 3.452
9
  }
trainer_state.json CHANGED
@@ -1,289 +1,492 @@
1
  {
2
- "best_global_step": 5834,
3
- "best_metric": 1.1892178058624268,
4
- "best_model_checkpoint": "./output/gpt-medmentions/checkpoint-5834",
5
  "epoch": 5.0,
6
  "eval_steps": 500,
7
- "global_step": 14585,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.17140898183064793,
14
- "grad_norm": 6.046237468719482,
15
- "learning_rate": 4.830305107987659e-05,
16
- "loss": 1.6106,
17
  "step": 500
18
  },
19
  {
20
- "epoch": 0.34281796366129585,
21
- "grad_norm": 3.7044713497161865,
22
- "learning_rate": 4.658896126157011e-05,
23
- "loss": 1.357,
24
  "step": 1000
25
  },
26
  {
27
- "epoch": 0.5142269454919438,
28
- "grad_norm": 4.646540641784668,
29
- "learning_rate": 4.487487144326363e-05,
30
- "loss": 1.2963,
31
  "step": 1500
32
  },
33
  {
34
- "epoch": 0.6856359273225917,
35
- "grad_norm": 3.9113590717315674,
36
- "learning_rate": 4.316078162495715e-05,
37
- "loss": 1.2696,
38
  "step": 2000
39
  },
40
  {
41
- "epoch": 0.8570449091532396,
42
- "grad_norm": 3.3376991748809814,
43
- "learning_rate": 4.145011998628728e-05,
44
- "loss": 1.2514,
45
  "step": 2500
46
  },
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
47
  {
48
  "epoch": 1.0,
49
- "eval_accuracy": 0.4190537084398977,
50
- "eval_f1": 0.3933049606443347,
51
- "eval_loss": 1.219216227531433,
52
- "eval_precision": 0.40163091733258566,
53
- "eval_recall": 0.3853171934543824,
54
- "eval_runtime": 11.561,
55
- "eval_samples_per_second": 252.228,
56
- "eval_steps_per_second": 15.829,
57
- "step": 2917
58
  },
59
  {
60
  "epoch": 1.0284538909838876,
61
- "grad_norm": 3.143263339996338,
62
- "learning_rate": 3.9736030167980805e-05,
63
- "loss": 1.2128,
64
- "step": 3000
 
 
 
 
 
 
 
65
  },
66
  {
67
  "epoch": 1.1998628728145355,
68
- "grad_norm": 3.8394646644592285,
69
- "learning_rate": 3.802194034967432e-05,
70
- "loss": 1.1019,
71
- "step": 3500
 
 
 
 
 
 
 
72
  },
73
  {
74
  "epoch": 1.3712718546451834,
75
- "grad_norm": 5.761228561401367,
76
- "learning_rate": 3.631127871100446e-05,
77
- "loss": 1.0983,
78
- "step": 4000
 
 
 
 
 
 
 
79
  },
80
  {
81
  "epoch": 1.5426808364758313,
82
- "grad_norm": 5.090176105499268,
83
- "learning_rate": 3.459718889269798e-05,
84
- "loss": 1.0921,
85
- "step": 4500
 
 
 
 
 
 
 
86
  },
87
  {
88
  "epoch": 1.7140898183064792,
89
- "grad_norm": 2.638284683227539,
90
- "learning_rate": 3.2883099074391496e-05,
91
- "loss": 1.0912,
92
- "step": 5000
 
 
 
 
 
 
 
93
  },
94
  {
95
  "epoch": 1.8854988001371273,
96
- "grad_norm": 3.342958927154541,
97
- "learning_rate": 3.116900925608502e-05,
98
- "loss": 1.0825,
99
- "step": 5500
 
 
 
 
 
 
 
100
  },
101
  {
102
  "epoch": 2.0,
103
- "eval_accuracy": 0.4323785166240409,
104
- "eval_f1": 0.5087636106612745,
105
- "eval_loss": 1.1892178058624268,
106
- "eval_precision": 0.4233535341503,
107
- "eval_recall": 0.6373458865725173,
108
- "eval_runtime": 12.713,
109
- "eval_samples_per_second": 229.371,
110
- "eval_steps_per_second": 14.395,
111
- "step": 5834
112
  },
113
  {
114
  "epoch": 2.0569077819677752,
115
- "grad_norm": 4.2739949226379395,
116
- "learning_rate": 2.945491943777854e-05,
117
- "loss": 1.0325,
118
- "step": 6000
 
 
 
 
 
 
 
119
  },
120
  {
121
  "epoch": 2.228316763798423,
122
- "grad_norm": 4.253600120544434,
123
- "learning_rate": 2.7740829619472064e-05,
124
- "loss": 0.9113,
125
- "step": 6500
 
 
 
 
 
 
 
126
  },
127
  {
128
  "epoch": 2.399725745629071,
129
- "grad_norm": 7.081674575805664,
130
- "learning_rate": 2.6026739801165584e-05,
131
- "loss": 0.9134,
132
- "step": 7000
 
 
 
 
 
 
 
133
  },
134
  {
135
  "epoch": 2.571134727459719,
136
- "grad_norm": 4.441311836242676,
137
- "learning_rate": 2.4312649982859104e-05,
138
- "loss": 0.9096,
139
- "step": 7500
 
 
 
 
 
 
 
140
  },
141
  {
142
  "epoch": 2.742543709290367,
143
- "grad_norm": 3.3464174270629883,
144
- "learning_rate": 2.2601988344189238e-05,
145
- "loss": 0.9105,
146
- "step": 8000
 
 
 
 
 
 
 
147
  },
148
  {
149
  "epoch": 2.9139526911210147,
150
- "grad_norm": 5.6599249839782715,
151
- "learning_rate": 2.0887898525882758e-05,
152
- "loss": 0.9093,
153
- "step": 8500
 
 
 
 
 
 
 
154
  },
155
  {
156
  "epoch": 3.0,
157
- "eval_accuracy": 0.4308056265984655,
158
- "eval_f1": 0.4445563583666506,
159
- "eval_loss": 1.241865634918213,
160
- "eval_precision": 0.4104807637557652,
161
- "eval_recall": 0.48480161398789506,
162
- "eval_runtime": 12.7077,
163
- "eval_samples_per_second": 229.468,
164
- "eval_steps_per_second": 14.401,
165
- "step": 8751
166
  },
167
  {
168
  "epoch": 3.0853616729516626,
169
- "grad_norm": 2.9584298133850098,
170
- "learning_rate": 1.9173808707576275e-05,
171
- "loss": 0.8498,
172
- "step": 9000
 
 
 
 
 
 
 
173
  },
174
  {
175
  "epoch": 3.2567706547823105,
176
- "grad_norm": 3.0139501094818115,
177
- "learning_rate": 1.74597188892698e-05,
178
- "loss": 0.7977,
179
- "step": 9500
 
 
 
 
 
 
 
180
  },
181
  {
182
  "epoch": 3.4281796366129584,
183
- "grad_norm": 3.6295053958892822,
184
- "learning_rate": 1.5749057250599933e-05,
185
- "loss": 0.796,
186
- "step": 10000
 
 
 
 
 
 
 
187
  },
188
  {
189
  "epoch": 3.5995886184436063,
190
- "grad_norm": 7.977433681488037,
191
- "learning_rate": 1.4034967432293453e-05,
192
- "loss": 0.7948,
193
- "step": 10500
 
 
 
 
 
 
 
194
  },
195
  {
196
  "epoch": 3.7709976002742542,
197
- "grad_norm": 2.8351268768310547,
198
- "learning_rate": 1.2320877613986975e-05,
199
- "loss": 0.7915,
200
- "step": 11000
 
 
 
 
 
 
 
201
  },
202
  {
203
  "epoch": 3.942406582104902,
204
- "grad_norm": 4.2413434982299805,
205
- "learning_rate": 1.0606787795680493e-05,
206
- "loss": 0.7938,
207
- "step": 11500
208
  },
209
  {
210
  "epoch": 4.0,
211
- "eval_accuracy": 0.43006393861892583,
212
- "eval_f1": 0.35603718836975184,
213
- "eval_loss": 1.365502953529358,
214
- "eval_precision": 0.37742623979912115,
215
- "eval_recall": 0.3369423895987447,
216
- "eval_runtime": 12.6489,
217
- "eval_samples_per_second": 230.534,
218
- "eval_steps_per_second": 14.468,
219
- "step": 11668
 
 
 
 
 
 
 
220
  },
221
  {
222
  "epoch": 4.1138155639355505,
223
- "grad_norm": 2.2926316261291504,
224
- "learning_rate": 8.896126157010627e-06,
225
- "loss": 0.7627,
226
- "step": 12000
 
 
 
 
 
 
 
227
  },
228
  {
229
  "epoch": 4.285224545766198,
230
- "grad_norm": 2.511692762374878,
231
- "learning_rate": 7.182036338704148e-06,
232
- "loss": 0.7492,
233
- "step": 12500
 
 
 
 
 
 
 
234
  },
235
  {
236
  "epoch": 4.456633527596846,
237
- "grad_norm": 2.3968722820281982,
238
- "learning_rate": 5.467946520397669e-06,
239
- "loss": 0.7507,
240
- "step": 13000
 
 
 
 
 
 
 
241
  },
242
  {
243
  "epoch": 4.628042509427494,
244
- "grad_norm": 3.8909912109375,
245
- "learning_rate": 3.75385670209119e-06,
246
- "loss": 0.7523,
247
- "step": 13500
 
 
 
 
 
 
 
248
  },
249
  {
250
  "epoch": 4.799451491258142,
251
- "grad_norm": 3.9493815898895264,
252
- "learning_rate": 2.0431950634213233e-06,
253
- "loss": 0.7447,
254
- "step": 14000
 
 
 
 
 
 
 
255
  },
256
  {
257
  "epoch": 4.9708604730887895,
258
- "grad_norm": 4.034415245056152,
259
- "learning_rate": 3.2910524511484403e-07,
260
- "loss": 0.746,
261
- "step": 14500
262
  },
263
  {
264
  "epoch": 5.0,
265
- "eval_accuracy": 0.43336317135549873,
266
- "eval_f1": 0.45325477104993267,
267
- "eval_loss": 1.451188325881958,
268
- "eval_precision": 0.4109656480198381,
269
- "eval_recall": 0.5052454606590451,
270
- "eval_runtime": 11.736,
271
- "eval_samples_per_second": 248.467,
272
- "eval_steps_per_second": 15.593,
273
- "step": 14585
274
  },
275
  {
276
  "epoch": 5.0,
277
- "step": 14585,
278
- "total_flos": 4.924675837027942e+16,
279
- "train_loss": 0.9773399162096319,
280
- "train_runtime": 7734.8885,
281
- "train_samples_per_second": 15.084,
282
- "train_steps_per_second": 1.886
283
  }
284
  ],
285
  "logging_steps": 500,
286
- "max_steps": 14585,
287
  "num_input_tokens_seen": 0,
288
  "num_train_epochs": 5,
289
  "save_steps": 500,
@@ -299,7 +502,7 @@
299
  "attributes": {}
300
  }
301
  },
302
- "total_flos": 4.924675837027942e+16,
303
  "train_batch_size": 4,
304
  "trial_name": null,
305
  "trial_params": null
 
1
  {
2
+ "best_global_step": 11668,
3
+ "best_metric": 0.5086450576782227,
4
+ "best_model_checkpoint": "./output/gpt-medmentions/checkpoint-11668",
5
  "epoch": 5.0,
6
  "eval_steps": 500,
7
+ "global_step": 29170,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.08570449091532396,
14
+ "grad_norm": 7.563724040985107,
15
+ "learning_rate": 4.914295509084677e-05,
16
+ "loss": 0.8639,
17
  "step": 500
18
  },
19
  {
20
+ "epoch": 0.17140898183064793,
21
+ "grad_norm": 4.639763832092285,
22
+ "learning_rate": 4.828591018169352e-05,
23
+ "loss": 0.674,
24
  "step": 1000
25
  },
26
  {
27
+ "epoch": 0.2571134727459719,
28
+ "grad_norm": 4.49621057510376,
29
+ "learning_rate": 4.7428865272540284e-05,
30
+ "loss": 0.6427,
31
  "step": 1500
32
  },
33
  {
34
+ "epoch": 0.34281796366129585,
35
+ "grad_norm": 4.740731239318848,
36
+ "learning_rate": 4.657182036338704e-05,
37
+ "loss": 0.6284,
38
  "step": 2000
39
  },
40
  {
41
+ "epoch": 0.4285224545766198,
42
+ "grad_norm": 3.477789878845215,
43
+ "learning_rate": 4.57147754542338e-05,
44
+ "loss": 0.5904,
45
  "step": 2500
46
  },
47
+ {
48
+ "epoch": 0.5142269454919438,
49
+ "grad_norm": 5.801304340362549,
50
+ "learning_rate": 4.485773054508056e-05,
51
+ "loss": 0.592,
52
+ "step": 3000
53
+ },
54
+ {
55
+ "epoch": 0.5999314364072678,
56
+ "grad_norm": 3.1393306255340576,
57
+ "learning_rate": 4.4000685635927325e-05,
58
+ "loss": 0.5751,
59
+ "step": 3500
60
+ },
61
+ {
62
+ "epoch": 0.6856359273225917,
63
+ "grad_norm": 2.137924909591675,
64
+ "learning_rate": 4.314364072677409e-05,
65
+ "loss": 0.5647,
66
+ "step": 4000
67
+ },
68
+ {
69
+ "epoch": 0.7713404182379157,
70
+ "grad_norm": 4.005846977233887,
71
+ "learning_rate": 4.228659581762084e-05,
72
+ "loss": 0.5525,
73
+ "step": 4500
74
+ },
75
+ {
76
+ "epoch": 0.8570449091532396,
77
+ "grad_norm": 2.6204190254211426,
78
+ "learning_rate": 4.142955090846761e-05,
79
+ "loss": 0.5499,
80
+ "step": 5000
81
+ },
82
+ {
83
+ "epoch": 0.9427494000685636,
84
+ "grad_norm": 2.9211952686309814,
85
+ "learning_rate": 4.0572505999314365e-05,
86
+ "loss": 0.5389,
87
+ "step": 5500
88
+ },
89
  {
90
  "epoch": 1.0,
91
+ "eval_accuracy": 0.8351150895140665,
92
+ "eval_f1": 0.4352736750651607,
93
+ "eval_loss": 0.5593962669372559,
94
+ "eval_precision": 0.435084672166739,
95
+ "eval_recall": 0.43546284224250326,
96
+ "eval_runtime": 34.7107,
97
+ "eval_samples_per_second": 84.009,
98
+ "eval_steps_per_second": 10.515,
99
+ "step": 5834
100
  },
101
  {
102
  "epoch": 1.0284538909838876,
103
+ "grad_norm": 2.6330394744873047,
104
+ "learning_rate": 3.9715461090161124e-05,
105
+ "loss": 0.4835,
106
+ "step": 6000
107
+ },
108
+ {
109
+ "epoch": 1.1141583818992116,
110
+ "grad_norm": 7.3211798667907715,
111
+ "learning_rate": 3.885841618100788e-05,
112
+ "loss": 0.3699,
113
+ "step": 6500
114
  },
115
  {
116
  "epoch": 1.1998628728145355,
117
+ "grad_norm": 4.461019515991211,
118
+ "learning_rate": 3.800137127185465e-05,
119
+ "loss": 0.3823,
120
+ "step": 7000
121
+ },
122
+ {
123
+ "epoch": 1.2855673637298595,
124
+ "grad_norm": 3.2148802280426025,
125
+ "learning_rate": 3.7144326362701406e-05,
126
+ "loss": 0.3817,
127
+ "step": 7500
128
  },
129
  {
130
  "epoch": 1.3712718546451834,
131
+ "grad_norm": 6.220280170440674,
132
+ "learning_rate": 3.6287281453548164e-05,
133
+ "loss": 0.3725,
134
+ "step": 8000
135
+ },
136
+ {
137
+ "epoch": 1.4569763455605074,
138
+ "grad_norm": 2.2955079078674316,
139
+ "learning_rate": 3.543023654439493e-05,
140
+ "loss": 0.38,
141
+ "step": 8500
142
  },
143
  {
144
  "epoch": 1.5426808364758313,
145
+ "grad_norm": 4.852652072906494,
146
+ "learning_rate": 3.457319163524169e-05,
147
+ "loss": 0.3705,
148
+ "step": 9000
149
+ },
150
+ {
151
+ "epoch": 1.6283853273911553,
152
+ "grad_norm": 3.233278751373291,
153
+ "learning_rate": 3.3716146726088446e-05,
154
+ "loss": 0.3745,
155
+ "step": 9500
156
  },
157
  {
158
  "epoch": 1.7140898183064792,
159
+ "grad_norm": 3.185788154602051,
160
+ "learning_rate": 3.285910181693521e-05,
161
+ "loss": 0.3738,
162
+ "step": 10000
163
+ },
164
+ {
165
+ "epoch": 1.7997943092218032,
166
+ "grad_norm": 2.9877729415893555,
167
+ "learning_rate": 3.200205690778197e-05,
168
+ "loss": 0.3733,
169
+ "step": 10500
170
  },
171
  {
172
  "epoch": 1.8854988001371273,
173
+ "grad_norm": 2.5933837890625,
174
+ "learning_rate": 3.114501199862873e-05,
175
+ "loss": 0.3559,
176
+ "step": 11000
177
+ },
178
+ {
179
+ "epoch": 1.971203291052451,
180
+ "grad_norm": 2.8704030513763428,
181
+ "learning_rate": 3.0287967089475487e-05,
182
+ "loss": 0.3762,
183
+ "step": 11500
184
  },
185
  {
186
  "epoch": 2.0,
187
+ "eval_accuracy": 0.846457800511509,
188
+ "eval_f1": 0.4924993145587718,
189
+ "eval_loss": 0.5086450576782227,
190
+ "eval_precision": 0.44823898474262086,
191
+ "eval_recall": 0.546458061712299,
192
+ "eval_runtime": 34.716,
193
+ "eval_samples_per_second": 83.996,
194
+ "eval_steps_per_second": 10.514,
195
+ "step": 11668
196
  },
197
  {
198
  "epoch": 2.0569077819677752,
199
+ "grad_norm": 2.7803287506103516,
200
+ "learning_rate": 2.9430922180322252e-05,
201
+ "loss": 0.2413,
202
+ "step": 12000
203
+ },
204
+ {
205
+ "epoch": 2.142612272883099,
206
+ "grad_norm": 2.0437328815460205,
207
+ "learning_rate": 2.8573877271169007e-05,
208
+ "loss": 0.1788,
209
+ "step": 12500
210
  },
211
  {
212
  "epoch": 2.228316763798423,
213
+ "grad_norm": 1.26553213596344,
214
+ "learning_rate": 2.7716832362015772e-05,
215
+ "loss": 0.1809,
216
+ "step": 13000
217
+ },
218
+ {
219
+ "epoch": 2.314021254713747,
220
+ "grad_norm": 2.584317922592163,
221
+ "learning_rate": 2.6859787452862534e-05,
222
+ "loss": 0.1759,
223
+ "step": 13500
224
  },
225
  {
226
  "epoch": 2.399725745629071,
227
+ "grad_norm": 15.791213989257812,
228
+ "learning_rate": 2.600274254370929e-05,
229
+ "loss": 0.1818,
230
+ "step": 14000
231
+ },
232
+ {
233
+ "epoch": 2.4854302365443948,
234
+ "grad_norm": 1.3076903820037842,
235
+ "learning_rate": 2.5145697634556054e-05,
236
+ "loss": 0.1749,
237
+ "step": 14500
238
  },
239
  {
240
  "epoch": 2.571134727459719,
241
+ "grad_norm": 1.6942801475524902,
242
+ "learning_rate": 2.4288652725402813e-05,
243
+ "loss": 0.1767,
244
+ "step": 15000
245
+ },
246
+ {
247
+ "epoch": 2.656839218375043,
248
+ "grad_norm": 3.2078938484191895,
249
+ "learning_rate": 2.3431607816249575e-05,
250
+ "loss": 0.1737,
251
+ "step": 15500
252
  },
253
  {
254
  "epoch": 2.742543709290367,
255
+ "grad_norm": 2.383434295654297,
256
+ "learning_rate": 2.2574562907096333e-05,
257
+ "loss": 0.1771,
258
+ "step": 16000
259
+ },
260
+ {
261
+ "epoch": 2.8282482002056906,
262
+ "grad_norm": 1.1726810932159424,
263
+ "learning_rate": 2.171751799794309e-05,
264
+ "loss": 0.1783,
265
+ "step": 16500
266
  },
267
  {
268
  "epoch": 2.9139526911210147,
269
+ "grad_norm": 8.384498596191406,
270
+ "learning_rate": 2.0860473088789853e-05,
271
+ "loss": 0.1775,
272
+ "step": 17000
273
+ },
274
+ {
275
+ "epoch": 2.999657182036339,
276
+ "grad_norm": 2.227762222290039,
277
+ "learning_rate": 2.0003428179636612e-05,
278
+ "loss": 0.1736,
279
+ "step": 17500
280
  },
281
  {
282
  "epoch": 3.0,
283
+ "eval_accuracy": 0.8486956521739131,
284
+ "eval_f1": 0.4947288251092316,
285
+ "eval_loss": 0.6310177445411682,
286
+ "eval_precision": 0.4590834697217676,
287
+ "eval_recall": 0.5363754889178618,
288
+ "eval_runtime": 34.7382,
289
+ "eval_samples_per_second": 83.942,
290
+ "eval_steps_per_second": 10.507,
291
+ "step": 17502
292
  },
293
  {
294
  "epoch": 3.0853616729516626,
295
+ "grad_norm": 0.670129120349884,
296
+ "learning_rate": 1.9146383270483374e-05,
297
+ "loss": 0.0719,
298
+ "step": 18000
299
+ },
300
+ {
301
+ "epoch": 3.171066163866987,
302
+ "grad_norm": 1.9619492292404175,
303
+ "learning_rate": 1.8289338361330135e-05,
304
+ "loss": 0.0725,
305
+ "step": 18500
306
  },
307
  {
308
  "epoch": 3.2567706547823105,
309
+ "grad_norm": 0.24141933023929596,
310
+ "learning_rate": 1.7432293452176894e-05,
311
+ "loss": 0.0724,
312
+ "step": 19000
313
+ },
314
+ {
315
+ "epoch": 3.3424751456976347,
316
+ "grad_norm": 2.3773982524871826,
317
+ "learning_rate": 1.6575248543023656e-05,
318
+ "loss": 0.0777,
319
+ "step": 19500
320
  },
321
  {
322
  "epoch": 3.4281796366129584,
323
+ "grad_norm": 1.7786751985549927,
324
+ "learning_rate": 1.5718203633870414e-05,
325
+ "loss": 0.0774,
326
+ "step": 20000
327
+ },
328
+ {
329
+ "epoch": 3.5138841275282826,
330
+ "grad_norm": 3.449632167816162,
331
+ "learning_rate": 1.4861158724717176e-05,
332
+ "loss": 0.0786,
333
+ "step": 20500
334
  },
335
  {
336
  "epoch": 3.5995886184436063,
337
+ "grad_norm": 4.504425048828125,
338
+ "learning_rate": 1.4004113815563934e-05,
339
+ "loss": 0.0763,
340
+ "step": 21000
341
+ },
342
+ {
343
+ "epoch": 3.6852931093589305,
344
+ "grad_norm": 2.4624173641204834,
345
+ "learning_rate": 1.3147068906410698e-05,
346
+ "loss": 0.0726,
347
+ "step": 21500
348
  },
349
  {
350
  "epoch": 3.7709976002742542,
351
+ "grad_norm": 2.6595826148986816,
352
+ "learning_rate": 1.2290023997257456e-05,
353
+ "loss": 0.0766,
354
+ "step": 22000
355
+ },
356
+ {
357
+ "epoch": 3.8567020911895784,
358
+ "grad_norm": 0.6136459708213806,
359
+ "learning_rate": 1.1432979088104218e-05,
360
+ "loss": 0.072,
361
+ "step": 22500
362
  },
363
  {
364
  "epoch": 3.942406582104902,
365
+ "grad_norm": 3.4279706478118896,
366
+ "learning_rate": 1.0575934178950978e-05,
367
+ "loss": 0.0777,
368
+ "step": 23000
369
  },
370
  {
371
  "epoch": 4.0,
372
+ "eval_accuracy": 0.8520971867007673,
373
+ "eval_f1": 0.49943597242531856,
374
+ "eval_loss": 0.9267778992652893,
375
+ "eval_precision": 0.480852775543041,
376
+ "eval_recall": 0.5195132551064754,
377
+ "eval_runtime": 34.7136,
378
+ "eval_samples_per_second": 84.002,
379
+ "eval_steps_per_second": 10.515,
380
+ "step": 23336
381
+ },
382
+ {
383
+ "epoch": 4.028111073020226,
384
+ "grad_norm": 1.2734886407852173,
385
+ "learning_rate": 9.718889269797737e-06,
386
+ "loss": 0.0573,
387
+ "step": 23500
388
  },
389
  {
390
  "epoch": 4.1138155639355505,
391
+ "grad_norm": 3.2875871658325195,
392
+ "learning_rate": 8.861844360644498e-06,
393
+ "loss": 0.039,
394
+ "step": 24000
395
+ },
396
+ {
397
+ "epoch": 4.199520054850874,
398
+ "grad_norm": 13.373528480529785,
399
+ "learning_rate": 8.004799451491259e-06,
400
+ "loss": 0.0401,
401
+ "step": 24500
402
  },
403
  {
404
  "epoch": 4.285224545766198,
405
+ "grad_norm": 0.31780633330345154,
406
+ "learning_rate": 7.147754542338019e-06,
407
+ "loss": 0.0391,
408
+ "step": 25000
409
+ },
410
+ {
411
+ "epoch": 4.370929036681522,
412
+ "grad_norm": 1.2009053230285645,
413
+ "learning_rate": 6.29070963318478e-06,
414
+ "loss": 0.0416,
415
+ "step": 25500
416
  },
417
  {
418
  "epoch": 4.456633527596846,
419
+ "grad_norm": 1.145856261253357,
420
+ "learning_rate": 5.43366472403154e-06,
421
+ "loss": 0.0386,
422
+ "step": 26000
423
+ },
424
+ {
425
+ "epoch": 4.5423380185121704,
426
+ "grad_norm": 1.447941780090332,
427
+ "learning_rate": 4.5766198148783e-06,
428
+ "loss": 0.0387,
429
+ "step": 26500
430
  },
431
  {
432
  "epoch": 4.628042509427494,
433
+ "grad_norm": 2.3324902057647705,
434
+ "learning_rate": 3.71957490572506e-06,
435
+ "loss": 0.0434,
436
+ "step": 27000
437
+ },
438
+ {
439
+ "epoch": 4.713747000342818,
440
+ "grad_norm": 1.5352897644042969,
441
+ "learning_rate": 2.8625299965718206e-06,
442
+ "loss": 0.037,
443
+ "step": 27500
444
  },
445
  {
446
  "epoch": 4.799451491258142,
447
+ "grad_norm": 0.3736858069896698,
448
+ "learning_rate": 2.0054850874185807e-06,
449
+ "loss": 0.0347,
450
+ "step": 28000
451
+ },
452
+ {
453
+ "epoch": 4.885155982173466,
454
+ "grad_norm": 0.8886938095092773,
455
+ "learning_rate": 1.148440178265341e-06,
456
+ "loss": 0.0379,
457
+ "step": 28500
458
  },
459
  {
460
  "epoch": 4.9708604730887895,
461
+ "grad_norm": 1.5339548587799072,
462
+ "learning_rate": 2.913952691121015e-07,
463
+ "loss": 0.0394,
464
+ "step": 29000
465
  },
466
  {
467
  "epoch": 5.0,
468
+ "eval_accuracy": 0.8531202046035805,
469
+ "eval_f1": 0.5048873426110007,
470
+ "eval_loss": 1.0743063688278198,
471
+ "eval_precision": 0.4822375187910436,
472
+ "eval_recall": 0.5297696653628857,
473
+ "eval_runtime": 34.8878,
474
+ "eval_samples_per_second": 83.582,
475
+ "eval_steps_per_second": 10.462,
476
+ "step": 29170
477
  },
478
  {
479
  "epoch": 5.0,
480
+ "step": 29170,
481
+ "total_flos": 4.62662533103459e+16,
482
+ "train_loss": 0.2550947672543478,
483
+ "train_runtime": 8451.3725,
484
+ "train_samples_per_second": 13.805,
485
+ "train_steps_per_second": 3.452
486
  }
487
  ],
488
  "logging_steps": 500,
489
+ "max_steps": 29170,
490
  "num_input_tokens_seen": 0,
491
  "num_train_epochs": 5,
492
  "save_steps": 500,
 
502
  "attributes": {}
503
  }
504
  },
505
+ "total_flos": 4.62662533103459e+16,
506
  "train_batch_size": 4,
507
  "trial_name": null,
508
  "trial_params": null