bhavanikambhampati commited on
Commit
21394e2
·
verified ·
1 Parent(s): 29afefb

Publish text2sql adapter (v3)

Browse files
README.md CHANGED
@@ -1,20 +1,18 @@
1
  ---
2
- library_name: peft
3
  base_model: Salesforce/codegen-350M-multi
4
- tags:
5
- - lora
6
- - peft
7
- - code
8
- - text2sql
9
- - codegen
10
  pipeline_tag: text-generation
 
 
 
 
11
  ---
12
 
13
  # codegenstudio/codegen-350M-text2sql-lora
14
 
15
- LoRA adapter for **text2sql** on [Salesforce/codegen-350M-multi](https://huggingface.co/Salesforce/codegen-350M-multi).
16
 
17
- - Checkpoint version: `v2`
18
  - Task: `text2sql`
19
 
20
  ## Usage
@@ -31,4 +29,4 @@ model = AutoModelForCausalLM.from_pretrained(base)
31
  model = PeftModel.from_pretrained(model, adapter)
32
  ```
33
 
34
- Or use the multi-adapter API in this project's `hf-deploy/` package.
 
1
  ---
 
2
  base_model: Salesforce/codegen-350M-multi
3
+ library_name: peft
 
 
 
 
 
4
  pipeline_tag: text-generation
5
+ tags:
6
+ - lora
7
+ - peft
8
+ - text2sql
9
  ---
10
 
11
  # codegenstudio/codegen-350M-text2sql-lora
12
 
13
+ LoRA adapter for text2sql on Salesforce/codegen-350M-multi.
14
 
15
+ - Checkpoint version: `v3`
16
  - Task: `text2sql`
17
 
18
  ## Usage
 
29
  model = PeftModel.from_pretrained(model, adapter)
30
  ```
31
 
32
+ Or use the multi-adapter API in this project's `fastapi-deploy/` package.
adapter_config.json CHANGED
@@ -1,43 +1,45 @@
1
- {
2
- "alora_invocation_tokens": null,
3
- "alpha_pattern": {},
4
- "arrow_config": null,
5
- "auto_mapping": null,
6
- "base_model_name_or_path": "Salesforce/codegen-350M-multi",
7
- "bias": "none",
8
- "corda_config": null,
9
- "ensure_weight_tying": false,
10
- "eva_config": null,
11
- "exclude_modules": null,
12
- "fan_in_fan_out": false,
13
- "inference_mode": true,
14
- "init_lora_weights": true,
15
- "layer_replication": null,
16
- "layers_pattern": null,
17
- "layers_to_transform": null,
18
- "loftq_config": {},
19
- "lora_alpha": 32,
20
- "lora_bias": false,
21
- "lora_dropout": 0.05,
22
- "lora_ga_config": null,
23
- "megatron_config": null,
24
- "megatron_core": "megatron.core",
25
- "modules_to_save": null,
26
- "peft_type": "LORA",
27
- "peft_version": "0.19.1",
28
- "qalora_group_size": 16,
29
- "r": 16,
30
- "rank_pattern": {},
31
- "revision": null,
32
- "target_modules": [
33
- "qkv_proj",
34
- "out_proj"
35
- ],
36
- "target_parameters": null,
37
- "task_type": "CAUSAL_LM",
38
- "trainable_token_indices": null,
39
- "use_bdlora": null,
40
- "use_dora": false,
41
- "use_qalora": false,
42
- "use_rslora": false
43
- }
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "/kaggle/working/models/base/Salesforce__codegen-350M-multi",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 64,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "lora_ga_config": null,
23
+ "megatron_config": null,
24
+ "megatron_core": "megatron.core",
25
+ "modules_to_save": null,
26
+ "peft_type": "LORA",
27
+ "peft_version": "0.19.1",
28
+ "qalora_group_size": 16,
29
+ "r": 32,
30
+ "rank_pattern": {},
31
+ "revision": null,
32
+ "target_modules": [
33
+ "qkv_proj",
34
+ "out_proj",
35
+ "fc_in",
36
+ "fc_out"
37
+ ],
38
+ "target_parameters": null,
39
+ "task_type": "CAUSAL_LM",
40
+ "trainable_token_indices": null,
41
+ "use_bdlora": null,
42
+ "use_dora": false,
43
+ "use_qalora": false,
44
+ "use_rslora": false
45
+ }
adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3123afdfba0bd36d6e30834e76d296cbc4f60f1e1ca77b532470d0e881037c9a
3
- size 7874776
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bd79cf6b9b17bd9e9a5fdbd0fb0bf0d349afdb5f32323796739e15c6c17d8831
3
+ size 41963912
checkpoint-1006/README.md ADDED
@@ -0,0 +1,209 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ base_model: /kaggle/working/models/base/Salesforce__codegen-350M-multi
3
+ library_name: peft
4
+ pipeline_tag: text-generation
5
+ tags:
6
+ - base_model:adapter:/kaggle/working/models/base/Salesforce__codegen-350M-multi
7
+ - lora
8
+ - sft
9
+ - transformers
10
+ - trl
11
+ ---
12
+
13
+ # Model Card for Model ID
14
+
15
+ <!-- Provide a quick summary of what the model is/does. -->
16
+
17
+
18
+
19
+ ## Model Details
20
+
21
+ ### Model Description
22
+
23
+ <!-- Provide a longer summary of what this model is. -->
24
+
25
+
26
+
27
+ - **Developed by:** [More Information Needed]
28
+ - **Funded by [optional]:** [More Information Needed]
29
+ - **Shared by [optional]:** [More Information Needed]
30
+ - **Model type:** [More Information Needed]
31
+ - **Language(s) (NLP):** [More Information Needed]
32
+ - **License:** [More Information Needed]
33
+ - **Finetuned from model [optional]:** [More Information Needed]
34
+
35
+ ### Model Sources [optional]
36
+
37
+ <!-- Provide the basic links for the model. -->
38
+
39
+ - **Repository:** [More Information Needed]
40
+ - **Paper [optional]:** [More Information Needed]
41
+ - **Demo [optional]:** [More Information Needed]
42
+
43
+ ## Uses
44
+
45
+ <!-- Address questions around how the model is intended to be used, including the foreseeable users of the model and those affected by the model. -->
46
+
47
+ ### Direct Use
48
+
49
+ <!-- This section is for the model use without fine-tuning or plugging into a larger ecosystem/app. -->
50
+
51
+ [More Information Needed]
52
+
53
+ ### Downstream Use [optional]
54
+
55
+ <!-- This section is for the model use when fine-tuned for a task, or when plugged into a larger ecosystem/app -->
56
+
57
+ [More Information Needed]
58
+
59
+ ### Out-of-Scope Use
60
+
61
+ <!-- This section addresses misuse, malicious use, and uses that the model will not work well for. -->
62
+
63
+ [More Information Needed]
64
+
65
+ ## Bias, Risks, and Limitations
66
+
67
+ <!-- This section is meant to convey both technical and sociotechnical limitations. -->
68
+
69
+ [More Information Needed]
70
+
71
+ ### Recommendations
72
+
73
+ <!-- This section is meant to convey recommendations with respect to the bias, risk, and technical limitations. -->
74
+
75
+ Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
76
+
77
+ ## How to Get Started with the Model
78
+
79
+ Use the code below to get started with the model.
80
+
81
+ [More Information Needed]
82
+
83
+ ## Training Details
84
+
85
+ ### Training Data
86
+
87
+ <!-- This should link to a Dataset Card, perhaps with a short stub of information on what the training data is all about as well as documentation related to data pre-processing or additional filtering. -->
88
+
89
+ [More Information Needed]
90
+
91
+ ### Training Procedure
92
+
93
+ <!-- This relates heavily to the Technical Specifications. Content here should link to that section when it is relevant to the training procedure. -->
94
+
95
+ #### Preprocessing [optional]
96
+
97
+ [More Information Needed]
98
+
99
+
100
+ #### Training Hyperparameters
101
+
102
+ - **Training regime:** [More Information Needed] <!--fp32, fp16 mixed precision, bf16 mixed precision, bf16 non-mixed precision, fp16 non-mixed precision, fp8 mixed precision -->
103
+
104
+ #### Speeds, Sizes, Times [optional]
105
+
106
+ <!-- This section provides information about throughput, start/end time, checkpoint size if relevant, etc. -->
107
+
108
+ [More Information Needed]
109
+
110
+ ## Evaluation
111
+
112
+ <!-- This section describes the evaluation protocols and provides the results. -->
113
+
114
+ ### Testing Data, Factors & Metrics
115
+
116
+ #### Testing Data
117
+
118
+ <!-- This should link to a Dataset Card if possible. -->
119
+
120
+ [More Information Needed]
121
+
122
+ #### Factors
123
+
124
+ <!-- These are the things the evaluation is disaggregating by, e.g., subpopulations or domains. -->
125
+
126
+ [More Information Needed]
127
+
128
+ #### Metrics
129
+
130
+ <!-- These are the evaluation metrics being used, ideally with a description of why. -->
131
+
132
+ [More Information Needed]
133
+
134
+ ### Results
135
+
136
+ [More Information Needed]
137
+
138
+ #### Summary
139
+
140
+
141
+
142
+ ## Model Examination [optional]
143
+
144
+ <!-- Relevant interpretability work for the model goes here -->
145
+
146
+ [More Information Needed]
147
+
148
+ ## Environmental Impact
149
+
150
+ <!-- Total emissions (in grams of CO2eq) and additional considerations, such as electricity usage, go here. Edit the suggested text below accordingly -->
151
+
152
+ Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
153
+
154
+ - **Hardware Type:** [More Information Needed]
155
+ - **Hours used:** [More Information Needed]
156
+ - **Cloud Provider:** [More Information Needed]
157
+ - **Compute Region:** [More Information Needed]
158
+ - **Carbon Emitted:** [More Information Needed]
159
+
160
+ ## Technical Specifications [optional]
161
+
162
+ ### Model Architecture and Objective
163
+
164
+ [More Information Needed]
165
+
166
+ ### Compute Infrastructure
167
+
168
+ [More Information Needed]
169
+
170
+ #### Hardware
171
+
172
+ [More Information Needed]
173
+
174
+ #### Software
175
+
176
+ [More Information Needed]
177
+
178
+ ## Citation [optional]
179
+
180
+ <!-- If there is a paper or blog post introducing the model, the APA and Bibtex information for that should go in this section. -->
181
+
182
+ **BibTeX:**
183
+
184
+ [More Information Needed]
185
+
186
+ **APA:**
187
+
188
+ [More Information Needed]
189
+
190
+ ## Glossary [optional]
191
+
192
+ <!-- If relevant, include terms and calculations in this section that can help readers understand the model or model card. -->
193
+
194
+ [More Information Needed]
195
+
196
+ ## More Information [optional]
197
+
198
+ [More Information Needed]
199
+
200
+ ## Model Card Authors [optional]
201
+
202
+ [More Information Needed]
203
+
204
+ ## Model Card Contact
205
+
206
+ [More Information Needed]
207
+ ### Framework versions
208
+
209
+ - PEFT 0.19.1
checkpoint-1006/adapter_config.json ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alora_invocation_tokens": null,
3
+ "alpha_pattern": {},
4
+ "arrow_config": null,
5
+ "auto_mapping": null,
6
+ "base_model_name_or_path": "/kaggle/working/models/base/Salesforce__codegen-350M-multi",
7
+ "bias": "none",
8
+ "corda_config": null,
9
+ "ensure_weight_tying": false,
10
+ "eva_config": null,
11
+ "exclude_modules": null,
12
+ "fan_in_fan_out": false,
13
+ "inference_mode": true,
14
+ "init_lora_weights": true,
15
+ "layer_replication": null,
16
+ "layers_pattern": null,
17
+ "layers_to_transform": null,
18
+ "loftq_config": {},
19
+ "lora_alpha": 64,
20
+ "lora_bias": false,
21
+ "lora_dropout": 0.05,
22
+ "lora_ga_config": null,
23
+ "megatron_config": null,
24
+ "megatron_core": "megatron.core",
25
+ "modules_to_save": null,
26
+ "peft_type": "LORA",
27
+ "peft_version": "0.19.1",
28
+ "qalora_group_size": 16,
29
+ "r": 32,
30
+ "rank_pattern": {},
31
+ "revision": null,
32
+ "target_modules": [
33
+ "qkv_proj",
34
+ "out_proj",
35
+ "fc_in",
36
+ "fc_out"
37
+ ],
38
+ "target_parameters": null,
39
+ "task_type": "CAUSAL_LM",
40
+ "trainable_token_indices": null,
41
+ "use_bdlora": null,
42
+ "use_dora": false,
43
+ "use_qalora": false,
44
+ "use_rslora": false
45
+ }
checkpoint-1006/adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bd79cf6b9b17bd9e9a5fdbd0fb0bf0d349afdb5f32323796739e15c6c17d8831
3
+ size 41963912
checkpoint-1006/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ecfc8a4189800760f4908770a0fe06c314be80407500263c8605aef1ab433402
3
+ size 84023435
checkpoint-1006/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:551ce85c4ee7b14573962088b61a4edc00d45e62de2605ca353dd2b2da06b286
3
+ size 14645
checkpoint-1006/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d5734fc5864fa0cf60d0b4b406a8aa9ae252f5431d8cb9b26e34057c079f216b
3
+ size 1465
checkpoint-1006/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoint-1006/tokenizer_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "is_local": true,
7
+ "model_max_length": 2048,
8
+ "pad_token": "<|endoftext|>",
9
+ "tokenizer_class": "TokenizersBackend",
10
+ "unk_token": "<|endoftext|>"
11
+ }
checkpoint-1006/trainer_state.json ADDED
@@ -0,0 +1,1065 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": 1006,
3
+ "best_metric": 0.24770455062389374,
4
+ "best_model_checkpoint": "/kaggle/working/models/checkpoints/v4/text2sql/checkpoint-1006",
5
+ "epoch": 2.0,
6
+ "eval_steps": 500,
7
+ "global_step": 1006,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "entropy": 1.1253886640071868,
14
+ "epoch": 0.01990049751243781,
15
+ "grad_norm": 2.338360548019409,
16
+ "learning_rate": 7.142857142857143e-06,
17
+ "loss": 1.4502812385559083,
18
+ "mean_token_accuracy": 0.6671988122165203,
19
+ "num_tokens": 68027.0,
20
+ "step": 10
21
+ },
22
+ {
23
+ "entropy": 1.0893175967037678,
24
+ "epoch": 0.03980099502487562,
25
+ "grad_norm": 1.6519114971160889,
26
+ "learning_rate": 1.5079365079365079e-05,
27
+ "loss": 1.1673696517944336,
28
+ "mean_token_accuracy": 0.698525931686163,
29
+ "num_tokens": 135033.0,
30
+ "step": 20
31
+ },
32
+ {
33
+ "entropy": 1.0583932913839817,
34
+ "epoch": 0.05970149253731343,
35
+ "grad_norm": 1.202163815498352,
36
+ "learning_rate": 2.3015873015873015e-05,
37
+ "loss": 1.0070637702941894,
38
+ "mean_token_accuracy": 0.7307960025966167,
39
+ "num_tokens": 201643.0,
40
+ "step": 30
41
+ },
42
+ {
43
+ "entropy": 0.8722786333411932,
44
+ "epoch": 0.07960199004975124,
45
+ "grad_norm": 1.3554679155349731,
46
+ "learning_rate": 3.095238095238095e-05,
47
+ "loss": 0.749023151397705,
48
+ "mean_token_accuracy": 0.8074305906891823,
49
+ "num_tokens": 267572.0,
50
+ "step": 40
51
+ },
52
+ {
53
+ "entropy": 0.6009022377431392,
54
+ "epoch": 0.09950248756218906,
55
+ "grad_norm": 1.4063202142715454,
56
+ "learning_rate": 3.888888888888889e-05,
57
+ "loss": 0.5123498916625977,
58
+ "mean_token_accuracy": 0.8385950662195683,
59
+ "num_tokens": 333673.0,
60
+ "step": 50
61
+ },
62
+ {
63
+ "entropy": 0.4164533382281661,
64
+ "epoch": 0.11940298507462686,
65
+ "grad_norm": 1.8205658197402954,
66
+ "learning_rate": 4.682539682539683e-05,
67
+ "loss": 0.4625075340270996,
68
+ "mean_token_accuracy": 0.8584991104900837,
69
+ "num_tokens": 399397.0,
70
+ "step": 60
71
+ },
72
+ {
73
+ "entropy": 0.4577839931473136,
74
+ "epoch": 0.13930348258706468,
75
+ "grad_norm": 1.393362283706665,
76
+ "learning_rate": 5.4761904761904766e-05,
77
+ "loss": 0.4174641609191895,
78
+ "mean_token_accuracy": 0.8803921975195408,
79
+ "num_tokens": 465864.0,
80
+ "step": 70
81
+ },
82
+ {
83
+ "entropy": 0.41640141475945713,
84
+ "epoch": 0.15920398009950248,
85
+ "grad_norm": 2.2472920417785645,
86
+ "learning_rate": 6.26984126984127e-05,
87
+ "loss": 0.417645263671875,
88
+ "mean_token_accuracy": 0.8779219165444374,
89
+ "num_tokens": 534817.0,
90
+ "step": 80
91
+ },
92
+ {
93
+ "entropy": 0.3839787464588881,
94
+ "epoch": 0.1791044776119403,
95
+ "grad_norm": 1.300377368927002,
96
+ "learning_rate": 7.063492063492065e-05,
97
+ "loss": 0.38586442470550536,
98
+ "mean_token_accuracy": 0.8903462648391723,
99
+ "num_tokens": 600614.0,
100
+ "step": 90
101
+ },
102
+ {
103
+ "entropy": 0.3429916022345424,
104
+ "epoch": 0.19900497512437812,
105
+ "grad_norm": 1.5014147758483887,
106
+ "learning_rate": 7.857142857142858e-05,
107
+ "loss": 0.33204805850982666,
108
+ "mean_token_accuracy": 0.9070690087974072,
109
+ "num_tokens": 665888.0,
110
+ "step": 100
111
+ },
112
+ {
113
+ "entropy": 0.36409866753965614,
114
+ "epoch": 0.21890547263681592,
115
+ "grad_norm": 1.417038083076477,
116
+ "learning_rate": 8.650793650793651e-05,
117
+ "loss": 0.3376448631286621,
118
+ "mean_token_accuracy": 0.8962906174361706,
119
+ "num_tokens": 732400.0,
120
+ "step": 110
121
+ },
122
+ {
123
+ "entropy": 0.263674839399755,
124
+ "epoch": 0.23880597014925373,
125
+ "grad_norm": 1.2735201120376587,
126
+ "learning_rate": 9.444444444444444e-05,
127
+ "loss": 0.270894718170166,
128
+ "mean_token_accuracy": 0.9201160937547683,
129
+ "num_tokens": 799887.0,
130
+ "step": 120
131
+ },
132
+ {
133
+ "entropy": 0.30584911033511164,
134
+ "epoch": 0.25870646766169153,
135
+ "grad_norm": 1.2719416618347168,
136
+ "learning_rate": 0.00010238095238095237,
137
+ "loss": 0.27406151294708253,
138
+ "mean_token_accuracy": 0.9204320795834064,
139
+ "num_tokens": 866147.0,
140
+ "step": 130
141
+ },
142
+ {
143
+ "entropy": 0.28959042597562074,
144
+ "epoch": 0.27860696517412936,
145
+ "grad_norm": 2.2021138668060303,
146
+ "learning_rate": 0.00011031746031746033,
147
+ "loss": 0.32373068332672117,
148
+ "mean_token_accuracy": 0.8983257927000523,
149
+ "num_tokens": 933129.0,
150
+ "step": 140
151
+ },
152
+ {
153
+ "entropy": 0.29785235710442065,
154
+ "epoch": 0.29850746268656714,
155
+ "grad_norm": 0.9740720987319946,
156
+ "learning_rate": 0.00011825396825396826,
157
+ "loss": 0.2523745775222778,
158
+ "mean_token_accuracy": 0.9215191625058651,
159
+ "num_tokens": 997739.0,
160
+ "step": 150
161
+ },
162
+ {
163
+ "entropy": 0.28159743677824733,
164
+ "epoch": 0.31840796019900497,
165
+ "grad_norm": 1.025788426399231,
166
+ "learning_rate": 0.0001261904761904762,
167
+ "loss": 0.27993102073669435,
168
+ "mean_token_accuracy": 0.9143906190991402,
169
+ "num_tokens": 1064807.0,
170
+ "step": 160
171
+ },
172
+ {
173
+ "entropy": 0.282751829456538,
174
+ "epoch": 0.3383084577114428,
175
+ "grad_norm": 1.149941086769104,
176
+ "learning_rate": 0.00013412698412698412,
177
+ "loss": 0.289961838722229,
178
+ "mean_token_accuracy": 0.9160969875752926,
179
+ "num_tokens": 1130310.0,
180
+ "step": 170
181
+ },
182
+ {
183
+ "entropy": 0.30801400616765023,
184
+ "epoch": 0.3582089552238806,
185
+ "grad_norm": 1.1288280487060547,
186
+ "learning_rate": 0.00014206349206349208,
187
+ "loss": 0.2773977518081665,
188
+ "mean_token_accuracy": 0.9185432456433773,
189
+ "num_tokens": 1197192.0,
190
+ "step": 180
191
+ },
192
+ {
193
+ "entropy": 0.24713189490139484,
194
+ "epoch": 0.3781094527363184,
195
+ "grad_norm": 0.9636886119842529,
196
+ "learning_rate": 0.00015000000000000001,
197
+ "loss": 0.26672122478485105,
198
+ "mean_token_accuracy": 0.9264318533241749,
199
+ "num_tokens": 1263466.0,
200
+ "step": 190
201
+ },
202
+ {
203
+ "entropy": 0.287679692171514,
204
+ "epoch": 0.39800995024875624,
205
+ "grad_norm": 1.137581467628479,
206
+ "learning_rate": 0.00015793650793650795,
207
+ "loss": 0.2587902069091797,
208
+ "mean_token_accuracy": 0.9211024351418018,
209
+ "num_tokens": 1330385.0,
210
+ "step": 200
211
+ },
212
+ {
213
+ "entropy": 0.2620579367503524,
214
+ "epoch": 0.417910447761194,
215
+ "grad_norm": 1.3906782865524292,
216
+ "learning_rate": 0.0001658730158730159,
217
+ "loss": 0.25291283130645753,
218
+ "mean_token_accuracy": 0.922594179213047,
219
+ "num_tokens": 1399272.0,
220
+ "step": 210
221
+ },
222
+ {
223
+ "entropy": 0.24558336716145276,
224
+ "epoch": 0.43781094527363185,
225
+ "grad_norm": 1.1515614986419678,
226
+ "learning_rate": 0.00017380952380952383,
227
+ "loss": 0.23645257949829102,
228
+ "mean_token_accuracy": 0.9315326489508152,
229
+ "num_tokens": 1466197.0,
230
+ "step": 220
231
+ },
232
+ {
233
+ "entropy": 0.23100281171500683,
234
+ "epoch": 0.4577114427860697,
235
+ "grad_norm": 1.0060856342315674,
236
+ "learning_rate": 0.00018174603174603177,
237
+ "loss": 0.21004528999328614,
238
+ "mean_token_accuracy": 0.9294509522616863,
239
+ "num_tokens": 1533135.0,
240
+ "step": 230
241
+ },
242
+ {
243
+ "entropy": 0.2551280764862895,
244
+ "epoch": 0.47761194029850745,
245
+ "grad_norm": 0.8229029178619385,
246
+ "learning_rate": 0.0001896825396825397,
247
+ "loss": 0.23107924461364746,
248
+ "mean_token_accuracy": 0.9292825579643249,
249
+ "num_tokens": 1600905.0,
250
+ "step": 240
251
+ },
252
+ {
253
+ "entropy": 0.2424938028678298,
254
+ "epoch": 0.4975124378109453,
255
+ "grad_norm": 1.199968695640564,
256
+ "learning_rate": 0.00019761904761904763,
257
+ "loss": 0.25817849636077883,
258
+ "mean_token_accuracy": 0.9277816534042358,
259
+ "num_tokens": 1666956.0,
260
+ "step": 250
261
+ },
262
+ {
263
+ "entropy": 0.27997240191325545,
264
+ "epoch": 0.5174129353233831,
265
+ "grad_norm": 0.6602728962898254,
266
+ "learning_rate": 0.0001999989408126818,
267
+ "loss": 0.25299272537231443,
268
+ "mean_token_accuracy": 0.926287354528904,
269
+ "num_tokens": 1734782.0,
270
+ "step": 260
271
+ },
272
+ {
273
+ "entropy": 0.20782412360422314,
274
+ "epoch": 0.5373134328358209,
275
+ "grad_norm": 0.7651694416999817,
276
+ "learning_rate": 0.0001999937530104439,
277
+ "loss": 0.20403761863708497,
278
+ "mean_token_accuracy": 0.9310354895889759,
279
+ "num_tokens": 1800055.0,
280
+ "step": 270
281
+ },
282
+ {
283
+ "entropy": 0.2172251005657017,
284
+ "epoch": 0.5572139303482587,
285
+ "grad_norm": 1.2643989324569702,
286
+ "learning_rate": 0.00019998424227267588,
287
+ "loss": 0.20663719177246093,
288
+ "mean_token_accuracy": 0.9364220850169659,
289
+ "num_tokens": 1866900.0,
290
+ "step": 280
291
+ },
292
+ {
293
+ "entropy": 0.19974687648937106,
294
+ "epoch": 0.5771144278606966,
295
+ "grad_norm": 0.9468103051185608,
296
+ "learning_rate": 0.00019997040901054646,
297
+ "loss": 0.20071234703063964,
298
+ "mean_token_accuracy": 0.9412682101130485,
299
+ "num_tokens": 1934548.0,
300
+ "step": 290
301
+ },
302
+ {
303
+ "entropy": 0.1886322578880936,
304
+ "epoch": 0.5970149253731343,
305
+ "grad_norm": 0.8480322360992432,
306
+ "learning_rate": 0.000199952253822096,
307
+ "loss": 0.18384914398193358,
308
+ "mean_token_accuracy": 0.948433005809784,
309
+ "num_tokens": 2001379.0,
310
+ "step": 300
311
+ },
312
+ {
313
+ "entropy": 0.21811659364029765,
314
+ "epoch": 0.6169154228855721,
315
+ "grad_norm": 0.8029792308807373,
316
+ "learning_rate": 0.00019992977749221064,
317
+ "loss": 0.20460138320922852,
318
+ "mean_token_accuracy": 0.9401800245046615,
319
+ "num_tokens": 2070001.0,
320
+ "step": 310
321
+ },
322
+ {
323
+ "entropy": 0.18392337979748846,
324
+ "epoch": 0.6368159203980099,
325
+ "grad_norm": 0.8735001087188721,
326
+ "learning_rate": 0.0001999029809925883,
327
+ "loss": 0.17823137044906617,
328
+ "mean_token_accuracy": 0.9488276831805706,
329
+ "num_tokens": 2135350.0,
330
+ "step": 320
331
+ },
332
+ {
333
+ "entropy": 0.18473064368590714,
334
+ "epoch": 0.6567164179104478,
335
+ "grad_norm": 0.7449737787246704,
336
+ "learning_rate": 0.00019987186548169682,
337
+ "loss": 0.16862742900848388,
338
+ "mean_token_accuracy": 0.9462769009172917,
339
+ "num_tokens": 2203472.0,
340
+ "step": 330
341
+ },
342
+ {
343
+ "entropy": 0.16661408836953343,
344
+ "epoch": 0.6766169154228856,
345
+ "grad_norm": 0.8586801290512085,
346
+ "learning_rate": 0.0001998364323047236,
347
+ "loss": 0.16848835945129395,
348
+ "mean_token_accuracy": 0.9531193666160107,
349
+ "num_tokens": 2269601.0,
350
+ "step": 340
351
+ },
352
+ {
353
+ "entropy": 0.1743609025143087,
354
+ "epoch": 0.6965174129353234,
355
+ "grad_norm": 0.7884849309921265,
356
+ "learning_rate": 0.00019979668299351783,
357
+ "loss": 0.17167186737060547,
358
+ "mean_token_accuracy": 0.9482224509119987,
359
+ "num_tokens": 2335815.0,
360
+ "step": 350
361
+ },
362
+ {
363
+ "entropy": 0.1952204409521073,
364
+ "epoch": 0.7164179104477612,
365
+ "grad_norm": 0.941378116607666,
366
+ "learning_rate": 0.00019975261926652392,
367
+ "loss": 0.18604878187179566,
368
+ "mean_token_accuracy": 0.942904282361269,
369
+ "num_tokens": 2404130.0,
370
+ "step": 360
371
+ },
372
+ {
373
+ "entropy": 0.19471225845627488,
374
+ "epoch": 0.736318407960199,
375
+ "grad_norm": 0.7770227789878845,
376
+ "learning_rate": 0.00019970424302870739,
377
+ "loss": 0.1847616672515869,
378
+ "mean_token_accuracy": 0.9433550946414471,
379
+ "num_tokens": 2470744.0,
380
+ "step": 370
381
+ },
382
+ {
383
+ "entropy": 0.19339222041890025,
384
+ "epoch": 0.7562189054726368,
385
+ "grad_norm": 1.1318728923797607,
386
+ "learning_rate": 0.00019965155637147243,
387
+ "loss": 0.18451868295669555,
388
+ "mean_token_accuracy": 0.9457193531095982,
389
+ "num_tokens": 2537581.0,
390
+ "step": 380
391
+ },
392
+ {
393
+ "entropy": 0.17824228820391,
394
+ "epoch": 0.7761194029850746,
395
+ "grad_norm": 0.8256890773773193,
396
+ "learning_rate": 0.0001995945615725716,
397
+ "loss": 0.17818082571029664,
398
+ "mean_token_accuracy": 0.9509255833923816,
399
+ "num_tokens": 2604045.0,
400
+ "step": 390
401
+ },
402
+ {
403
+ "entropy": 0.17659657467156648,
404
+ "epoch": 0.7960199004975125,
405
+ "grad_norm": 0.7419007420539856,
406
+ "learning_rate": 0.00019953326109600728,
407
+ "loss": 0.15658079385757445,
408
+ "mean_token_accuracy": 0.9504644252359867,
409
+ "num_tokens": 2669475.0,
410
+ "step": 400
411
+ },
412
+ {
413
+ "entropy": 0.16667078505270183,
414
+ "epoch": 0.8159203980099502,
415
+ "grad_norm": 0.8381772041320801,
416
+ "learning_rate": 0.00019946765759192497,
417
+ "loss": 0.16461316347122193,
418
+ "mean_token_accuracy": 0.9532247520983219,
419
+ "num_tokens": 2735709.0,
420
+ "step": 410
421
+ },
422
+ {
423
+ "entropy": 0.1525796527042985,
424
+ "epoch": 0.835820895522388,
425
+ "grad_norm": 0.7996618747711182,
426
+ "learning_rate": 0.00019939775389649916,
427
+ "loss": 0.15512030124664306,
428
+ "mean_token_accuracy": 0.9544322639703751,
429
+ "num_tokens": 2804586.0,
430
+ "step": 420
431
+ },
432
+ {
433
+ "entropy": 0.16498080925084652,
434
+ "epoch": 0.8557213930348259,
435
+ "grad_norm": 0.6151495575904846,
436
+ "learning_rate": 0.00019932355303181026,
437
+ "loss": 0.1559414744377136,
438
+ "mean_token_accuracy": 0.956156824529171,
439
+ "num_tokens": 2871824.0,
440
+ "step": 430
441
+ },
442
+ {
443
+ "entropy": 0.20550905396230518,
444
+ "epoch": 0.8756218905472637,
445
+ "grad_norm": 0.7512227892875671,
446
+ "learning_rate": 0.00019924505820571425,
447
+ "loss": 0.17734644412994385,
448
+ "mean_token_accuracy": 0.9471527449786663,
449
+ "num_tokens": 2937826.0,
450
+ "step": 440
451
+ },
452
+ {
453
+ "entropy": 0.1697809119708836,
454
+ "epoch": 0.8955223880597015,
455
+ "grad_norm": 0.762320339679718,
456
+ "learning_rate": 0.0001991622728117038,
457
+ "loss": 0.15445693731307983,
458
+ "mean_token_accuracy": 0.9543316774070263,
459
+ "num_tokens": 3006135.0,
460
+ "step": 450
461
+ },
462
+ {
463
+ "entropy": 0.17613516801502554,
464
+ "epoch": 0.9154228855721394,
465
+ "grad_norm": 0.6466898918151855,
466
+ "learning_rate": 0.00019907520042876172,
467
+ "loss": 0.16953592300415038,
468
+ "mean_token_accuracy": 0.950883662700653,
469
+ "num_tokens": 3073150.0,
470
+ "step": 460
471
+ },
472
+ {
473
+ "entropy": 0.15535307771060616,
474
+ "epoch": 0.9353233830845771,
475
+ "grad_norm": 1.1007940769195557,
476
+ "learning_rate": 0.00019898384482120614,
477
+ "loss": 0.15585366487503052,
478
+ "mean_token_accuracy": 0.9595168434083462,
479
+ "num_tokens": 3138638.0,
480
+ "step": 470
481
+ },
482
+ {
483
+ "entropy": 0.1557972011389211,
484
+ "epoch": 0.9552238805970149,
485
+ "grad_norm": 0.6533820629119873,
486
+ "learning_rate": 0.0001988882099385278,
487
+ "loss": 0.15293551683425904,
488
+ "mean_token_accuracy": 0.9572585269808769,
489
+ "num_tokens": 3206372.0,
490
+ "step": 480
491
+ },
492
+ {
493
+ "entropy": 0.13091885023750366,
494
+ "epoch": 0.9751243781094527,
495
+ "grad_norm": 0.5975553393363953,
496
+ "learning_rate": 0.00019878829991521935,
497
+ "loss": 0.1253079891204834,
498
+ "mean_token_accuracy": 0.9635655723512173,
499
+ "num_tokens": 3274281.0,
500
+ "step": 490
501
+ },
502
+ {
503
+ "entropy": 0.1669132244773209,
504
+ "epoch": 0.9950248756218906,
505
+ "grad_norm": 0.8513726592063904,
506
+ "learning_rate": 0.00019868411907059645,
507
+ "loss": 0.17081425189971924,
508
+ "mean_token_accuracy": 0.9505244322121144,
509
+ "num_tokens": 3340159.0,
510
+ "step": 500
511
+ },
512
+ {
513
+ "epoch": 1.0,
514
+ "eval_entropy": 0.23721536022024842,
515
+ "eval_loss": 0.24836121499538422,
516
+ "eval_mean_token_accuracy": 0.9339753162676764,
517
+ "eval_num_tokens": 3356986.0,
518
+ "eval_runtime": 67.6123,
519
+ "eval_samples_per_second": 15.308,
520
+ "eval_steps_per_second": 7.661,
521
+ "step": 503
522
+ },
523
+ {
524
+ "entropy": 0.1568159531605871,
525
+ "epoch": 1.0139303482587065,
526
+ "grad_norm": 0.5372758507728577,
527
+ "learning_rate": 0.00019857567190861126,
528
+ "loss": 0.1242946743965149,
529
+ "mean_token_accuracy": 0.9635580613424903,
530
+ "num_tokens": 3404334.0,
531
+ "step": 510
532
+ },
533
+ {
534
+ "entropy": 0.1316974400077015,
535
+ "epoch": 1.0338308457711443,
536
+ "grad_norm": 0.7160713076591492,
537
+ "learning_rate": 0.00019846296311765754,
538
+ "loss": 0.1351562261581421,
539
+ "mean_token_accuracy": 0.9581282936036587,
540
+ "num_tokens": 3471525.0,
541
+ "step": 520
542
+ },
543
+ {
544
+ "entropy": 0.14656153018586338,
545
+ "epoch": 1.053731343283582,
546
+ "grad_norm": 0.5991392731666565,
547
+ "learning_rate": 0.00019834599757036803,
548
+ "loss": 0.12300963401794433,
549
+ "mean_token_accuracy": 0.9646149106323719,
550
+ "num_tokens": 3538338.0,
551
+ "step": 530
552
+ },
553
+ {
554
+ "entropy": 0.15197489713318646,
555
+ "epoch": 1.07363184079602,
556
+ "grad_norm": 0.9330605864524841,
557
+ "learning_rate": 0.00019822478032340387,
558
+ "loss": 0.12765015363693238,
559
+ "mean_token_accuracy": 0.9586149267852306,
560
+ "num_tokens": 3606642.0,
561
+ "step": 540
562
+ },
563
+ {
564
+ "entropy": 0.11335502485744656,
565
+ "epoch": 1.0935323383084576,
566
+ "grad_norm": 0.8762836456298828,
567
+ "learning_rate": 0.0001980993166172358,
568
+ "loss": 0.11172252893447876,
569
+ "mean_token_accuracy": 0.9656657867133618,
570
+ "num_tokens": 3674420.0,
571
+ "step": 550
572
+ },
573
+ {
574
+ "entropy": 0.12588824331760406,
575
+ "epoch": 1.1134328358208956,
576
+ "grad_norm": 0.8866952061653137,
577
+ "learning_rate": 0.00019796961187591781,
578
+ "loss": 0.10862302780151367,
579
+ "mean_token_accuracy": 0.9648959740996361,
580
+ "num_tokens": 3741381.0,
581
+ "step": 560
582
+ },
583
+ {
584
+ "entropy": 0.11430091026704758,
585
+ "epoch": 1.1333333333333333,
586
+ "grad_norm": 0.6481871604919434,
587
+ "learning_rate": 0.00019783567170685262,
588
+ "loss": 0.11582423448562622,
589
+ "mean_token_accuracy": 0.9628987669944763,
590
+ "num_tokens": 3808318.0,
591
+ "step": 570
592
+ },
593
+ {
594
+ "entropy": 0.11517859897576273,
595
+ "epoch": 1.153233830845771,
596
+ "grad_norm": 0.5650383234024048,
597
+ "learning_rate": 0.00019769750190054905,
598
+ "loss": 0.1037294864654541,
599
+ "mean_token_accuracy": 0.9702431283891201,
600
+ "num_tokens": 3874410.0,
601
+ "step": 580
602
+ },
603
+ {
604
+ "entropy": 0.10291576159652323,
605
+ "epoch": 1.173134328358209,
606
+ "grad_norm": 0.5433067083358765,
607
+ "learning_rate": 0.00019755510843037191,
608
+ "loss": 0.10045719146728516,
609
+ "mean_token_accuracy": 0.9618785113096238,
610
+ "num_tokens": 3941134.0,
611
+ "step": 590
612
+ },
613
+ {
614
+ "entropy": 0.11075262987287715,
615
+ "epoch": 1.1930348258706467,
616
+ "grad_norm": 0.7597805261611938,
617
+ "learning_rate": 0.00019740849745228367,
618
+ "loss": 0.12216674089431763,
619
+ "mean_token_accuracy": 0.9657749280333519,
620
+ "num_tokens": 4008097.0,
621
+ "step": 600
622
+ },
623
+ {
624
+ "entropy": 0.12675938094034792,
625
+ "epoch": 1.2129353233830846,
626
+ "grad_norm": 0.6820019483566284,
627
+ "learning_rate": 0.00019725767530457837,
628
+ "loss": 0.11509623527526855,
629
+ "mean_token_accuracy": 0.9657132118940354,
630
+ "num_tokens": 4073570.0,
631
+ "step": 610
632
+ },
633
+ {
634
+ "entropy": 0.13302950132638217,
635
+ "epoch": 1.2328358208955223,
636
+ "grad_norm": 0.5021085739135742,
637
+ "learning_rate": 0.00019710264850760756,
638
+ "loss": 0.10812582969665527,
639
+ "mean_token_accuracy": 0.9639534369111061,
640
+ "num_tokens": 4140207.0,
641
+ "step": 620
642
+ },
643
+ {
644
+ "entropy": 0.12266454068012536,
645
+ "epoch": 1.25273631840796,
646
+ "grad_norm": 0.7293747067451477,
647
+ "learning_rate": 0.00019694342376349835,
648
+ "loss": 0.12314709424972534,
649
+ "mean_token_accuracy": 0.9629024133086205,
650
+ "num_tokens": 4206997.0,
651
+ "step": 630
652
+ },
653
+ {
654
+ "entropy": 0.12240176484920084,
655
+ "epoch": 1.272636815920398,
656
+ "grad_norm": 0.9365243911743164,
657
+ "learning_rate": 0.00019678000795586386,
658
+ "loss": 0.117351496219635,
659
+ "mean_token_accuracy": 0.96337865665555,
660
+ "num_tokens": 4277152.0,
661
+ "step": 640
662
+ },
663
+ {
664
+ "entropy": 0.11147555778734386,
665
+ "epoch": 1.292537313432836,
666
+ "grad_norm": 0.7311879396438599,
667
+ "learning_rate": 0.00019661240814950536,
668
+ "loss": 0.11279709339141845,
669
+ "mean_token_accuracy": 0.9658049061894417,
670
+ "num_tokens": 4344652.0,
671
+ "step": 650
672
+ },
673
+ {
674
+ "entropy": 0.11891384413465858,
675
+ "epoch": 1.3124378109452737,
676
+ "grad_norm": 0.6283079981803894,
677
+ "learning_rate": 0.00019644063159010716,
678
+ "loss": 0.09745638966560363,
679
+ "mean_token_accuracy": 0.9698325954377651,
680
+ "num_tokens": 4411916.0,
681
+ "step": 660
682
+ },
683
+ {
684
+ "entropy": 0.12134865028783678,
685
+ "epoch": 1.3323383084577114,
686
+ "grad_norm": 0.6160532832145691,
687
+ "learning_rate": 0.00019626468570392298,
688
+ "loss": 0.1158707618713379,
689
+ "mean_token_accuracy": 0.9658548943698406,
690
+ "num_tokens": 4478621.0,
691
+ "step": 670
692
+ },
693
+ {
694
+ "entropy": 0.10654389052651822,
695
+ "epoch": 1.3522388059701491,
696
+ "grad_norm": 0.43357354402542114,
697
+ "learning_rate": 0.00019608457809745537,
698
+ "loss": 0.09168269634246826,
699
+ "mean_token_accuracy": 0.9723479963839055,
700
+ "num_tokens": 4544168.0,
701
+ "step": 680
702
+ },
703
+ {
704
+ "entropy": 0.109538364992477,
705
+ "epoch": 1.372139303482587,
706
+ "grad_norm": 0.7618773579597473,
707
+ "learning_rate": 0.00019590031655712631,
708
+ "loss": 0.11080507040023804,
709
+ "mean_token_accuracy": 0.9682544745504856,
710
+ "num_tokens": 4610518.0,
711
+ "step": 690
712
+ },
713
+ {
714
+ "entropy": 0.11043523394037039,
715
+ "epoch": 1.392039800995025,
716
+ "grad_norm": 0.8631065487861633,
717
+ "learning_rate": 0.00019571190904894115,
718
+ "loss": 0.09991470575332642,
719
+ "mean_token_accuracy": 0.9694355696439743,
720
+ "num_tokens": 4676248.0,
721
+ "step": 700
722
+ },
723
+ {
724
+ "entropy": 0.1043223840300925,
725
+ "epoch": 1.4119402985074627,
726
+ "grad_norm": 1.0989038944244385,
727
+ "learning_rate": 0.00019551936371814375,
728
+ "loss": 0.10194973945617676,
729
+ "mean_token_accuracy": 0.9693835198879241,
730
+ "num_tokens": 4742628.0,
731
+ "step": 710
732
+ },
733
+ {
734
+ "entropy": 0.10138569427654147,
735
+ "epoch": 1.4318407960199004,
736
+ "grad_norm": 0.9169466495513916,
737
+ "learning_rate": 0.0001953226888888647,
738
+ "loss": 0.10495258569717407,
739
+ "mean_token_accuracy": 0.970366296172142,
740
+ "num_tokens": 4809419.0,
741
+ "step": 720
742
+ },
743
+ {
744
+ "entropy": 0.11472290018573403,
745
+ "epoch": 1.4517412935323384,
746
+ "grad_norm": 0.49399080872535706,
747
+ "learning_rate": 0.00019512189306376118,
748
+ "loss": 0.11099306344985962,
749
+ "mean_token_accuracy": 0.9688441671431065,
750
+ "num_tokens": 4877119.0,
751
+ "step": 730
752
+ },
753
+ {
754
+ "entropy": 0.11205615981016308,
755
+ "epoch": 1.471641791044776,
756
+ "grad_norm": 0.61200350522995,
757
+ "learning_rate": 0.0001949169849236496,
758
+ "loss": 0.10629711151123047,
759
+ "mean_token_accuracy": 0.966337724775076,
760
+ "num_tokens": 4944433.0,
761
+ "step": 740
762
+ },
763
+ {
764
+ "entropy": 0.11642576553858816,
765
+ "epoch": 1.491542288557214,
766
+ "grad_norm": 0.6224406361579895,
767
+ "learning_rate": 0.00019470797332713012,
768
+ "loss": 0.11089148521423339,
769
+ "mean_token_accuracy": 0.9659203454852104,
770
+ "num_tokens": 5011634.0,
771
+ "step": 750
772
+ },
773
+ {
774
+ "entropy": 0.11514911148697138,
775
+ "epoch": 1.5114427860696518,
776
+ "grad_norm": 0.7650023698806763,
777
+ "learning_rate": 0.0001944948673102038,
778
+ "loss": 0.10163601636886596,
779
+ "mean_token_accuracy": 0.9675627797842026,
780
+ "num_tokens": 5077156.0,
781
+ "step": 760
782
+ },
783
+ {
784
+ "entropy": 0.10764023282099515,
785
+ "epoch": 1.5313432835820895,
786
+ "grad_norm": 0.49794143438339233,
787
+ "learning_rate": 0.00019427767608588183,
788
+ "loss": 0.098751300573349,
789
+ "mean_token_accuracy": 0.9677646860480309,
790
+ "num_tokens": 5143991.0,
791
+ "step": 770
792
+ },
793
+ {
794
+ "entropy": 0.1094623792450875,
795
+ "epoch": 1.5512437810945272,
796
+ "grad_norm": 0.6449922323226929,
797
+ "learning_rate": 0.0001940564090437875,
798
+ "loss": 0.11413514614105225,
799
+ "mean_token_accuracy": 0.9680206254124641,
800
+ "num_tokens": 5211604.0,
801
+ "step": 780
802
+ },
803
+ {
804
+ "entropy": 0.12053416313137859,
805
+ "epoch": 1.5711442786069652,
806
+ "grad_norm": 0.8340095281600952,
807
+ "learning_rate": 0.00019383107574974984,
808
+ "loss": 0.10809429883956909,
809
+ "mean_token_accuracy": 0.9674052610993386,
810
+ "num_tokens": 5277697.0,
811
+ "step": 790
812
+ },
813
+ {
814
+ "entropy": 0.10000467539066449,
815
+ "epoch": 1.591044776119403,
816
+ "grad_norm": 0.7644860744476318,
817
+ "learning_rate": 0.00019360168594539055,
818
+ "loss": 0.08709208965301514,
819
+ "mean_token_accuracy": 0.9731013409793376,
820
+ "num_tokens": 5342978.0,
821
+ "step": 800
822
+ },
823
+ {
824
+ "entropy": 0.10800170768052339,
825
+ "epoch": 1.6109452736318408,
826
+ "grad_norm": 0.6640422344207764,
827
+ "learning_rate": 0.0001933682495477024,
828
+ "loss": 0.09788179397583008,
829
+ "mean_token_accuracy": 0.9665102422237396,
830
+ "num_tokens": 5410289.0,
831
+ "step": 810
832
+ },
833
+ {
834
+ "entropy": 0.10117872587870806,
835
+ "epoch": 1.6308457711442785,
836
+ "grad_norm": 0.6755411624908447,
837
+ "learning_rate": 0.00019313077664862092,
838
+ "loss": 0.09605536460876465,
839
+ "mean_token_accuracy": 0.972070074826479,
840
+ "num_tokens": 5475880.0,
841
+ "step": 820
842
+ },
843
+ {
844
+ "entropy": 0.1069639899302274,
845
+ "epoch": 1.6507462686567163,
846
+ "grad_norm": 0.890627384185791,
847
+ "learning_rate": 0.00019288927751458766,
848
+ "loss": 0.10400503873825073,
849
+ "mean_token_accuracy": 0.9711074873805046,
850
+ "num_tokens": 5541606.0,
851
+ "step": 830
852
+ },
853
+ {
854
+ "entropy": 0.11311845399904996,
855
+ "epoch": 1.6706467661691542,
856
+ "grad_norm": 0.5509929656982422,
857
+ "learning_rate": 0.0001926437625861068,
858
+ "loss": 0.10754516124725341,
859
+ "mean_token_accuracy": 0.9695759303867817,
860
+ "num_tokens": 5608065.0,
861
+ "step": 840
862
+ },
863
+ {
864
+ "entropy": 0.12085098770912736,
865
+ "epoch": 1.6905472636815921,
866
+ "grad_norm": 0.6879218816757202,
867
+ "learning_rate": 0.00019239424247729345,
868
+ "loss": 0.12257307767868042,
869
+ "mean_token_accuracy": 0.9648775070905685,
870
+ "num_tokens": 5674308.0,
871
+ "step": 850
872
+ },
873
+ {
874
+ "entropy": 0.11081431191414595,
875
+ "epoch": 1.7104477611940299,
876
+ "grad_norm": 0.4920276999473572,
877
+ "learning_rate": 0.0001921407279754149,
878
+ "loss": 0.10849488973617553,
879
+ "mean_token_accuracy": 0.9698534436523915,
880
+ "num_tokens": 5742414.0,
881
+ "step": 860
882
+ },
883
+ {
884
+ "entropy": 0.0929627066012472,
885
+ "epoch": 1.7303482587064676,
886
+ "grad_norm": 0.7228904366493225,
887
+ "learning_rate": 0.00019188323004042435,
888
+ "loss": 0.0802489161491394,
889
+ "mean_token_accuracy": 0.9730034552514553,
890
+ "num_tokens": 5809827.0,
891
+ "step": 870
892
+ },
893
+ {
894
+ "entropy": 0.0936126358807087,
895
+ "epoch": 1.7502487562189055,
896
+ "grad_norm": 0.6558980345726013,
897
+ "learning_rate": 0.00019162175980448688,
898
+ "loss": 0.1109757661819458,
899
+ "mean_token_accuracy": 0.9671767763793468,
900
+ "num_tokens": 5875172.0,
901
+ "step": 880
902
+ },
903
+ {
904
+ "entropy": 0.11744439310859889,
905
+ "epoch": 1.7701492537313432,
906
+ "grad_norm": 0.5792869925498962,
907
+ "learning_rate": 0.0001913563285714984,
908
+ "loss": 0.09240159988403321,
909
+ "mean_token_accuracy": 0.9710902646183968,
910
+ "num_tokens": 5942033.0,
911
+ "step": 890
912
+ },
913
+ {
914
+ "entropy": 0.10555630044545979,
915
+ "epoch": 1.7900497512437812,
916
+ "grad_norm": 0.8990387320518494,
917
+ "learning_rate": 0.0001910869478165969,
918
+ "loss": 0.12259334325790405,
919
+ "mean_token_accuracy": 0.9644198954105377,
920
+ "num_tokens": 6007977.0,
921
+ "step": 900
922
+ },
923
+ {
924
+ "entropy": 0.10993905747309327,
925
+ "epoch": 1.809950248756219,
926
+ "grad_norm": 0.7768874168395996,
927
+ "learning_rate": 0.00019081362918566618,
928
+ "loss": 0.10547571182250977,
929
+ "mean_token_accuracy": 0.9728645481169224,
930
+ "num_tokens": 6074057.0,
931
+ "step": 910
932
+ },
933
+ {
934
+ "entropy": 0.10362131035653874,
935
+ "epoch": 1.8298507462686566,
936
+ "grad_norm": 0.4525396525859833,
937
+ "learning_rate": 0.00019053638449483259,
938
+ "loss": 0.10611696243286133,
939
+ "mean_token_accuracy": 0.9724654078483581,
940
+ "num_tokens": 6141345.0,
941
+ "step": 920
942
+ },
943
+ {
944
+ "entropy": 0.11784212745260447,
945
+ "epoch": 1.8497512437810946,
946
+ "grad_norm": 0.7492642998695374,
947
+ "learning_rate": 0.0001902552257299542,
948
+ "loss": 0.11176036596298218,
949
+ "mean_token_accuracy": 0.9628825642168521,
950
+ "num_tokens": 6209124.0,
951
+ "step": 930
952
+ },
953
+ {
954
+ "entropy": 0.11072989953681826,
955
+ "epoch": 1.8696517412935323,
956
+ "grad_norm": 0.5748555064201355,
957
+ "learning_rate": 0.00018997016504610246,
958
+ "loss": 0.10774084329605102,
959
+ "mean_token_accuracy": 0.9646185263991356,
960
+ "num_tokens": 6276485.0,
961
+ "step": 940
962
+ },
963
+ {
964
+ "entropy": 0.10556984411086887,
965
+ "epoch": 1.8895522388059702,
966
+ "grad_norm": 0.5937514305114746,
967
+ "learning_rate": 0.00018968121476703678,
968
+ "loss": 0.08848418593406678,
969
+ "mean_token_accuracy": 0.9734670996665955,
970
+ "num_tokens": 6342957.0,
971
+ "step": 950
972
+ },
973
+ {
974
+ "entropy": 0.09428299731807784,
975
+ "epoch": 1.909452736318408,
976
+ "grad_norm": 1.0715358257293701,
977
+ "learning_rate": 0.00018938838738467184,
978
+ "loss": 0.10269320011138916,
979
+ "mean_token_accuracy": 0.9720249362289906,
980
+ "num_tokens": 6408918.0,
981
+ "step": 960
982
+ },
983
+ {
984
+ "entropy": 0.10850229405332357,
985
+ "epoch": 1.9293532338308457,
986
+ "grad_norm": 0.5169550180435181,
987
+ "learning_rate": 0.00018909169555853743,
988
+ "loss": 0.0899561107158661,
989
+ "mean_token_accuracy": 0.9714486353099346,
990
+ "num_tokens": 6475062.0,
991
+ "step": 970
992
+ },
993
+ {
994
+ "entropy": 0.1026058561168611,
995
+ "epoch": 1.9492537313432836,
996
+ "grad_norm": 0.7642938494682312,
997
+ "learning_rate": 0.00018879115211523117,
998
+ "loss": 0.09649609923362731,
999
+ "mean_token_accuracy": 0.9703472301363945,
1000
+ "num_tokens": 6542465.0,
1001
+ "step": 980
1002
+ },
1003
+ {
1004
+ "entropy": 0.09136548589449375,
1005
+ "epoch": 1.9691542288557216,
1006
+ "grad_norm": 0.3874703347682953,
1007
+ "learning_rate": 0.0001884867700478641,
1008
+ "loss": 0.09067035913467407,
1009
+ "mean_token_accuracy": 0.9718083783984184,
1010
+ "num_tokens": 6608985.0,
1011
+ "step": 990
1012
+ },
1013
+ {
1014
+ "entropy": 0.11761876428499818,
1015
+ "epoch": 1.9890547263681593,
1016
+ "grad_norm": 0.693695604801178,
1017
+ "learning_rate": 0.00018817856251549867,
1018
+ "loss": 0.09239903688430787,
1019
+ "mean_token_accuracy": 0.9674227833747864,
1020
+ "num_tokens": 6676885.0,
1021
+ "step": 1000
1022
+ },
1023
+ {
1024
+ "epoch": 2.0,
1025
+ "eval_entropy": 0.13267684354209502,
1026
+ "eval_loss": 0.24770455062389374,
1027
+ "eval_mean_token_accuracy": 0.9410935246806347,
1028
+ "eval_num_tokens": 6713972.0,
1029
+ "eval_runtime": 67.3665,
1030
+ "eval_samples_per_second": 15.364,
1031
+ "eval_steps_per_second": 7.689,
1032
+ "step": 1006
1033
+ }
1034
+ ],
1035
+ "logging_steps": 10,
1036
+ "max_steps": 5030,
1037
+ "num_input_tokens_seen": 0,
1038
+ "num_train_epochs": 10,
1039
+ "save_steps": 500,
1040
+ "stateful_callbacks": {
1041
+ "EarlyStoppingCallback": {
1042
+ "args": {
1043
+ "early_stopping_patience": 3,
1044
+ "early_stopping_threshold": 0.0
1045
+ },
1046
+ "attributes": {
1047
+ "early_stopping_patience_counter": 0
1048
+ }
1049
+ },
1050
+ "TrainerControl": {
1051
+ "args": {
1052
+ "should_epoch_stop": false,
1053
+ "should_evaluate": false,
1054
+ "should_log": false,
1055
+ "should_save": true,
1056
+ "should_training_stop": false
1057
+ },
1058
+ "attributes": {}
1059
+ }
1060
+ },
1061
+ "total_flos": 1.3957721650888704e+16,
1062
+ "train_batch_size": 2,
1063
+ "trial_name": null,
1064
+ "trial_params": null
1065
+ }
checkpoint-1006/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2350592d6176e1137e9e5000ddaae8bcace4a32263a7e4abe5cae8ea3d5bbe86
3
+ size 5841
run_metadata.json ADDED
@@ -0,0 +1,2616 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "task": "text2sql",
3
+ "model_name": "Salesforce/codegen-350M-multi",
4
+ "device": "cuda:0",
5
+ "checkpoint_run": "v4",
6
+ "adapter_path": "/kaggle/working/models/checkpoints/v4/text2sql",
7
+ "train_rows": 8040,
8
+ "eval_rows": 1035,
9
+ "train_loss": 0.10587940257242612,
10
+ "eval_loss": 0.24770455062389374,
11
+ "best_eval_loss": 0.24770455062389374,
12
+ "train_runtime_seconds": 8534.0451,
13
+ "mlflow_run_id": null,
14
+ "filter_stats": {
15
+ "input_rows": 8040,
16
+ "kept_rows": 8040,
17
+ "skipped_rows": 0,
18
+ "skip_reasons": {}
19
+ },
20
+ "token_stats": {
21
+ "rows": 8040,
22
+ "avg_prompt_tokens": 377.37,
23
+ "avg_target_tokens": 39.17,
24
+ "avg_total_tokens": 416.54,
25
+ "max_total_tokens": 1098,
26
+ "skipped_too_long_target": 0,
27
+ "skipped_too_long_prompt": 0
28
+ },
29
+ "log_history": [
30
+ {
31
+ "loss": 1.4502812385559083,
32
+ "grad_norm": 2.338360548019409,
33
+ "learning_rate": 7.142857142857143e-06,
34
+ "entropy": 1.1253886640071868,
35
+ "num_tokens": 68027.0,
36
+ "mean_token_accuracy": 0.6671988122165203,
37
+ "epoch": 0.01990049751243781,
38
+ "step": 10
39
+ },
40
+ {
41
+ "loss": 1.1673696517944336,
42
+ "grad_norm": 1.6519114971160889,
43
+ "learning_rate": 1.5079365079365079e-05,
44
+ "entropy": 1.0893175967037678,
45
+ "num_tokens": 135033.0,
46
+ "mean_token_accuracy": 0.698525931686163,
47
+ "epoch": 0.03980099502487562,
48
+ "step": 20
49
+ },
50
+ {
51
+ "loss": 1.0070637702941894,
52
+ "grad_norm": 1.202163815498352,
53
+ "learning_rate": 2.3015873015873015e-05,
54
+ "entropy": 1.0583932913839817,
55
+ "num_tokens": 201643.0,
56
+ "mean_token_accuracy": 0.7307960025966167,
57
+ "epoch": 0.05970149253731343,
58
+ "step": 30
59
+ },
60
+ {
61
+ "loss": 0.749023151397705,
62
+ "grad_norm": 1.3554679155349731,
63
+ "learning_rate": 3.095238095238095e-05,
64
+ "entropy": 0.8722786333411932,
65
+ "num_tokens": 267572.0,
66
+ "mean_token_accuracy": 0.8074305906891823,
67
+ "epoch": 0.07960199004975124,
68
+ "step": 40
69
+ },
70
+ {
71
+ "loss": 0.5123498916625977,
72
+ "grad_norm": 1.4063202142715454,
73
+ "learning_rate": 3.888888888888889e-05,
74
+ "entropy": 0.6009022377431392,
75
+ "num_tokens": 333673.0,
76
+ "mean_token_accuracy": 0.8385950662195683,
77
+ "epoch": 0.09950248756218906,
78
+ "step": 50
79
+ },
80
+ {
81
+ "loss": 0.4625075340270996,
82
+ "grad_norm": 1.8205658197402954,
83
+ "learning_rate": 4.682539682539683e-05,
84
+ "entropy": 0.4164533382281661,
85
+ "num_tokens": 399397.0,
86
+ "mean_token_accuracy": 0.8584991104900837,
87
+ "epoch": 0.11940298507462686,
88
+ "step": 60
89
+ },
90
+ {
91
+ "loss": 0.4174641609191895,
92
+ "grad_norm": 1.393362283706665,
93
+ "learning_rate": 5.4761904761904766e-05,
94
+ "entropy": 0.4577839931473136,
95
+ "num_tokens": 465864.0,
96
+ "mean_token_accuracy": 0.8803921975195408,
97
+ "epoch": 0.13930348258706468,
98
+ "step": 70
99
+ },
100
+ {
101
+ "loss": 0.417645263671875,
102
+ "grad_norm": 2.2472920417785645,
103
+ "learning_rate": 6.26984126984127e-05,
104
+ "entropy": 0.41640141475945713,
105
+ "num_tokens": 534817.0,
106
+ "mean_token_accuracy": 0.8779219165444374,
107
+ "epoch": 0.15920398009950248,
108
+ "step": 80
109
+ },
110
+ {
111
+ "loss": 0.38586442470550536,
112
+ "grad_norm": 1.300377368927002,
113
+ "learning_rate": 7.063492063492065e-05,
114
+ "entropy": 0.3839787464588881,
115
+ "num_tokens": 600614.0,
116
+ "mean_token_accuracy": 0.8903462648391723,
117
+ "epoch": 0.1791044776119403,
118
+ "step": 90
119
+ },
120
+ {
121
+ "loss": 0.33204805850982666,
122
+ "grad_norm": 1.5014147758483887,
123
+ "learning_rate": 7.857142857142858e-05,
124
+ "entropy": 0.3429916022345424,
125
+ "num_tokens": 665888.0,
126
+ "mean_token_accuracy": 0.9070690087974072,
127
+ "epoch": 0.19900497512437812,
128
+ "step": 100
129
+ },
130
+ {
131
+ "loss": 0.3376448631286621,
132
+ "grad_norm": 1.417038083076477,
133
+ "learning_rate": 8.650793650793651e-05,
134
+ "entropy": 0.36409866753965614,
135
+ "num_tokens": 732400.0,
136
+ "mean_token_accuracy": 0.8962906174361706,
137
+ "epoch": 0.21890547263681592,
138
+ "step": 110
139
+ },
140
+ {
141
+ "loss": 0.270894718170166,
142
+ "grad_norm": 1.2735201120376587,
143
+ "learning_rate": 9.444444444444444e-05,
144
+ "entropy": 0.263674839399755,
145
+ "num_tokens": 799887.0,
146
+ "mean_token_accuracy": 0.9201160937547683,
147
+ "epoch": 0.23880597014925373,
148
+ "step": 120
149
+ },
150
+ {
151
+ "loss": 0.27406151294708253,
152
+ "grad_norm": 1.2719416618347168,
153
+ "learning_rate": 0.00010238095238095237,
154
+ "entropy": 0.30584911033511164,
155
+ "num_tokens": 866147.0,
156
+ "mean_token_accuracy": 0.9204320795834064,
157
+ "epoch": 0.25870646766169153,
158
+ "step": 130
159
+ },
160
+ {
161
+ "loss": 0.32373068332672117,
162
+ "grad_norm": 2.2021138668060303,
163
+ "learning_rate": 0.00011031746031746033,
164
+ "entropy": 0.28959042597562074,
165
+ "num_tokens": 933129.0,
166
+ "mean_token_accuracy": 0.8983257927000523,
167
+ "epoch": 0.27860696517412936,
168
+ "step": 140
169
+ },
170
+ {
171
+ "loss": 0.2523745775222778,
172
+ "grad_norm": 0.9740720987319946,
173
+ "learning_rate": 0.00011825396825396826,
174
+ "entropy": 0.29785235710442065,
175
+ "num_tokens": 997739.0,
176
+ "mean_token_accuracy": 0.9215191625058651,
177
+ "epoch": 0.29850746268656714,
178
+ "step": 150
179
+ },
180
+ {
181
+ "loss": 0.27993102073669435,
182
+ "grad_norm": 1.025788426399231,
183
+ "learning_rate": 0.0001261904761904762,
184
+ "entropy": 0.28159743677824733,
185
+ "num_tokens": 1064807.0,
186
+ "mean_token_accuracy": 0.9143906190991402,
187
+ "epoch": 0.31840796019900497,
188
+ "step": 160
189
+ },
190
+ {
191
+ "loss": 0.289961838722229,
192
+ "grad_norm": 1.149941086769104,
193
+ "learning_rate": 0.00013412698412698412,
194
+ "entropy": 0.282751829456538,
195
+ "num_tokens": 1130310.0,
196
+ "mean_token_accuracy": 0.9160969875752926,
197
+ "epoch": 0.3383084577114428,
198
+ "step": 170
199
+ },
200
+ {
201
+ "loss": 0.2773977518081665,
202
+ "grad_norm": 1.1288280487060547,
203
+ "learning_rate": 0.00014206349206349208,
204
+ "entropy": 0.30801400616765023,
205
+ "num_tokens": 1197192.0,
206
+ "mean_token_accuracy": 0.9185432456433773,
207
+ "epoch": 0.3582089552238806,
208
+ "step": 180
209
+ },
210
+ {
211
+ "loss": 0.26672122478485105,
212
+ "grad_norm": 0.9636886119842529,
213
+ "learning_rate": 0.00015000000000000001,
214
+ "entropy": 0.24713189490139484,
215
+ "num_tokens": 1263466.0,
216
+ "mean_token_accuracy": 0.9264318533241749,
217
+ "epoch": 0.3781094527363184,
218
+ "step": 190
219
+ },
220
+ {
221
+ "loss": 0.2587902069091797,
222
+ "grad_norm": 1.137581467628479,
223
+ "learning_rate": 0.00015793650793650795,
224
+ "entropy": 0.287679692171514,
225
+ "num_tokens": 1330385.0,
226
+ "mean_token_accuracy": 0.9211024351418018,
227
+ "epoch": 0.39800995024875624,
228
+ "step": 200
229
+ },
230
+ {
231
+ "loss": 0.25291283130645753,
232
+ "grad_norm": 1.3906782865524292,
233
+ "learning_rate": 0.0001658730158730159,
234
+ "entropy": 0.2620579367503524,
235
+ "num_tokens": 1399272.0,
236
+ "mean_token_accuracy": 0.922594179213047,
237
+ "epoch": 0.417910447761194,
238
+ "step": 210
239
+ },
240
+ {
241
+ "loss": 0.23645257949829102,
242
+ "grad_norm": 1.1515614986419678,
243
+ "learning_rate": 0.00017380952380952383,
244
+ "entropy": 0.24558336716145276,
245
+ "num_tokens": 1466197.0,
246
+ "mean_token_accuracy": 0.9315326489508152,
247
+ "epoch": 0.43781094527363185,
248
+ "step": 220
249
+ },
250
+ {
251
+ "loss": 0.21004528999328614,
252
+ "grad_norm": 1.0060856342315674,
253
+ "learning_rate": 0.00018174603174603177,
254
+ "entropy": 0.23100281171500683,
255
+ "num_tokens": 1533135.0,
256
+ "mean_token_accuracy": 0.9294509522616863,
257
+ "epoch": 0.4577114427860697,
258
+ "step": 230
259
+ },
260
+ {
261
+ "loss": 0.23107924461364746,
262
+ "grad_norm": 0.8229029178619385,
263
+ "learning_rate": 0.0001896825396825397,
264
+ "entropy": 0.2551280764862895,
265
+ "num_tokens": 1600905.0,
266
+ "mean_token_accuracy": 0.9292825579643249,
267
+ "epoch": 0.47761194029850745,
268
+ "step": 240
269
+ },
270
+ {
271
+ "loss": 0.25817849636077883,
272
+ "grad_norm": 1.199968695640564,
273
+ "learning_rate": 0.00019761904761904763,
274
+ "entropy": 0.2424938028678298,
275
+ "num_tokens": 1666956.0,
276
+ "mean_token_accuracy": 0.9277816534042358,
277
+ "epoch": 0.4975124378109453,
278
+ "step": 250
279
+ },
280
+ {
281
+ "loss": 0.25299272537231443,
282
+ "grad_norm": 0.6602728962898254,
283
+ "learning_rate": 0.0001999989408126818,
284
+ "entropy": 0.27997240191325545,
285
+ "num_tokens": 1734782.0,
286
+ "mean_token_accuracy": 0.926287354528904,
287
+ "epoch": 0.5174129353233831,
288
+ "step": 260
289
+ },
290
+ {
291
+ "loss": 0.20403761863708497,
292
+ "grad_norm": 0.7651694416999817,
293
+ "learning_rate": 0.0001999937530104439,
294
+ "entropy": 0.20782412360422314,
295
+ "num_tokens": 1800055.0,
296
+ "mean_token_accuracy": 0.9310354895889759,
297
+ "epoch": 0.5373134328358209,
298
+ "step": 270
299
+ },
300
+ {
301
+ "loss": 0.20663719177246093,
302
+ "grad_norm": 1.2643989324569702,
303
+ "learning_rate": 0.00019998424227267588,
304
+ "entropy": 0.2172251005657017,
305
+ "num_tokens": 1866900.0,
306
+ "mean_token_accuracy": 0.9364220850169659,
307
+ "epoch": 0.5572139303482587,
308
+ "step": 280
309
+ },
310
+ {
311
+ "loss": 0.20071234703063964,
312
+ "grad_norm": 0.9468103051185608,
313
+ "learning_rate": 0.00019997040901054646,
314
+ "entropy": 0.19974687648937106,
315
+ "num_tokens": 1934548.0,
316
+ "mean_token_accuracy": 0.9412682101130485,
317
+ "epoch": 0.5771144278606966,
318
+ "step": 290
319
+ },
320
+ {
321
+ "loss": 0.18384914398193358,
322
+ "grad_norm": 0.8480322360992432,
323
+ "learning_rate": 0.000199952253822096,
324
+ "entropy": 0.1886322578880936,
325
+ "num_tokens": 2001379.0,
326
+ "mean_token_accuracy": 0.948433005809784,
327
+ "epoch": 0.5970149253731343,
328
+ "step": 300
329
+ },
330
+ {
331
+ "loss": 0.20460138320922852,
332
+ "grad_norm": 0.8029792308807373,
333
+ "learning_rate": 0.00019992977749221064,
334
+ "entropy": 0.21811659364029765,
335
+ "num_tokens": 2070001.0,
336
+ "mean_token_accuracy": 0.9401800245046615,
337
+ "epoch": 0.6169154228855721,
338
+ "step": 310
339
+ },
340
+ {
341
+ "loss": 0.17823137044906617,
342
+ "grad_norm": 0.8735001087188721,
343
+ "learning_rate": 0.0001999029809925883,
344
+ "entropy": 0.18392337979748846,
345
+ "num_tokens": 2135350.0,
346
+ "mean_token_accuracy": 0.9488276831805706,
347
+ "epoch": 0.6368159203980099,
348
+ "step": 320
349
+ },
350
+ {
351
+ "loss": 0.16862742900848388,
352
+ "grad_norm": 0.7449737787246704,
353
+ "learning_rate": 0.00019987186548169682,
354
+ "entropy": 0.18473064368590714,
355
+ "num_tokens": 2203472.0,
356
+ "mean_token_accuracy": 0.9462769009172917,
357
+ "epoch": 0.6567164179104478,
358
+ "step": 330
359
+ },
360
+ {
361
+ "loss": 0.16848835945129395,
362
+ "grad_norm": 0.8586801290512085,
363
+ "learning_rate": 0.0001998364323047236,
364
+ "entropy": 0.16661408836953343,
365
+ "num_tokens": 2269601.0,
366
+ "mean_token_accuracy": 0.9531193666160107,
367
+ "epoch": 0.6766169154228856,
368
+ "step": 340
369
+ },
370
+ {
371
+ "loss": 0.17167186737060547,
372
+ "grad_norm": 0.7884849309921265,
373
+ "learning_rate": 0.00019979668299351783,
374
+ "entropy": 0.1743609025143087,
375
+ "num_tokens": 2335815.0,
376
+ "mean_token_accuracy": 0.9482224509119987,
377
+ "epoch": 0.6965174129353234,
378
+ "step": 350
379
+ },
380
+ {
381
+ "loss": 0.18604878187179566,
382
+ "grad_norm": 0.941378116607666,
383
+ "learning_rate": 0.00019975261926652392,
384
+ "entropy": 0.1952204409521073,
385
+ "num_tokens": 2404130.0,
386
+ "mean_token_accuracy": 0.942904282361269,
387
+ "epoch": 0.7164179104477612,
388
+ "step": 360
389
+ },
390
+ {
391
+ "loss": 0.1847616672515869,
392
+ "grad_norm": 0.7770227789878845,
393
+ "learning_rate": 0.00019970424302870739,
394
+ "entropy": 0.19471225845627488,
395
+ "num_tokens": 2470744.0,
396
+ "mean_token_accuracy": 0.9433550946414471,
397
+ "epoch": 0.736318407960199,
398
+ "step": 370
399
+ },
400
+ {
401
+ "loss": 0.18451868295669555,
402
+ "grad_norm": 1.1318728923797607,
403
+ "learning_rate": 0.00019965155637147243,
404
+ "entropy": 0.19339222041890025,
405
+ "num_tokens": 2537581.0,
406
+ "mean_token_accuracy": 0.9457193531095982,
407
+ "epoch": 0.7562189054726368,
408
+ "step": 380
409
+ },
410
+ {
411
+ "loss": 0.17818082571029664,
412
+ "grad_norm": 0.8256890773773193,
413
+ "learning_rate": 0.0001995945615725716,
414
+ "entropy": 0.17824228820391,
415
+ "num_tokens": 2604045.0,
416
+ "mean_token_accuracy": 0.9509255833923816,
417
+ "epoch": 0.7761194029850746,
418
+ "step": 390
419
+ },
420
+ {
421
+ "loss": 0.15658079385757445,
422
+ "grad_norm": 0.7419007420539856,
423
+ "learning_rate": 0.00019953326109600728,
424
+ "entropy": 0.17659657467156648,
425
+ "num_tokens": 2669475.0,
426
+ "mean_token_accuracy": 0.9504644252359867,
427
+ "epoch": 0.7960199004975125,
428
+ "step": 400
429
+ },
430
+ {
431
+ "loss": 0.16461316347122193,
432
+ "grad_norm": 0.8381772041320801,
433
+ "learning_rate": 0.00019946765759192497,
434
+ "entropy": 0.16667078505270183,
435
+ "num_tokens": 2735709.0,
436
+ "mean_token_accuracy": 0.9532247520983219,
437
+ "epoch": 0.8159203980099502,
438
+ "step": 410
439
+ },
440
+ {
441
+ "loss": 0.15512030124664306,
442
+ "grad_norm": 0.7996618747711182,
443
+ "learning_rate": 0.00019939775389649916,
444
+ "entropy": 0.1525796527042985,
445
+ "num_tokens": 2804586.0,
446
+ "mean_token_accuracy": 0.9544322639703751,
447
+ "epoch": 0.835820895522388,
448
+ "step": 420
449
+ },
450
+ {
451
+ "loss": 0.1559414744377136,
452
+ "grad_norm": 0.6151495575904846,
453
+ "learning_rate": 0.00019932355303181026,
454
+ "entropy": 0.16498080925084652,
455
+ "num_tokens": 2871824.0,
456
+ "mean_token_accuracy": 0.956156824529171,
457
+ "epoch": 0.8557213930348259,
458
+ "step": 430
459
+ },
460
+ {
461
+ "loss": 0.17734644412994385,
462
+ "grad_norm": 0.7512227892875671,
463
+ "learning_rate": 0.00019924505820571425,
464
+ "entropy": 0.20550905396230518,
465
+ "num_tokens": 2937826.0,
466
+ "mean_token_accuracy": 0.9471527449786663,
467
+ "epoch": 0.8756218905472637,
468
+ "step": 440
469
+ },
470
+ {
471
+ "loss": 0.15445693731307983,
472
+ "grad_norm": 0.762320339679718,
473
+ "learning_rate": 0.0001991622728117038,
474
+ "entropy": 0.1697809119708836,
475
+ "num_tokens": 3006135.0,
476
+ "mean_token_accuracy": 0.9543316774070263,
477
+ "epoch": 0.8955223880597015,
478
+ "step": 450
479
+ },
480
+ {
481
+ "loss": 0.16953592300415038,
482
+ "grad_norm": 0.6466898918151855,
483
+ "learning_rate": 0.00019907520042876172,
484
+ "entropy": 0.17613516801502554,
485
+ "num_tokens": 3073150.0,
486
+ "mean_token_accuracy": 0.950883662700653,
487
+ "epoch": 0.9154228855721394,
488
+ "step": 460
489
+ },
490
+ {
491
+ "loss": 0.15585366487503052,
492
+ "grad_norm": 1.1007940769195557,
493
+ "learning_rate": 0.00019898384482120614,
494
+ "entropy": 0.15535307771060616,
495
+ "num_tokens": 3138638.0,
496
+ "mean_token_accuracy": 0.9595168434083462,
497
+ "epoch": 0.9353233830845771,
498
+ "step": 470
499
+ },
500
+ {
501
+ "loss": 0.15293551683425904,
502
+ "grad_norm": 0.6533820629119873,
503
+ "learning_rate": 0.0001988882099385278,
504
+ "entropy": 0.1557972011389211,
505
+ "num_tokens": 3206372.0,
506
+ "mean_token_accuracy": 0.9572585269808769,
507
+ "epoch": 0.9552238805970149,
508
+ "step": 480
509
+ },
510
+ {
511
+ "loss": 0.1253079891204834,
512
+ "grad_norm": 0.5975553393363953,
513
+ "learning_rate": 0.00019878829991521935,
514
+ "entropy": 0.13091885023750366,
515
+ "num_tokens": 3274281.0,
516
+ "mean_token_accuracy": 0.9635655723512173,
517
+ "epoch": 0.9751243781094527,
518
+ "step": 490
519
+ },
520
+ {
521
+ "loss": 0.17081425189971924,
522
+ "grad_norm": 0.8513726592063904,
523
+ "learning_rate": 0.00019868411907059645,
524
+ "entropy": 0.1669132244773209,
525
+ "num_tokens": 3340159.0,
526
+ "mean_token_accuracy": 0.9505244322121144,
527
+ "epoch": 0.9950248756218906,
528
+ "step": 500
529
+ },
530
+ {
531
+ "eval_loss": 0.24836121499538422,
532
+ "eval_runtime": 67.6123,
533
+ "eval_samples_per_second": 15.308,
534
+ "eval_steps_per_second": 7.661,
535
+ "eval_entropy": 0.23721536022024842,
536
+ "eval_num_tokens": 3356986.0,
537
+ "eval_mean_token_accuracy": 0.9339753162676764,
538
+ "epoch": 1.0,
539
+ "step": 503
540
+ },
541
+ {
542
+ "loss": 0.1242946743965149,
543
+ "grad_norm": 0.5372758507728577,
544
+ "learning_rate": 0.00019857567190861126,
545
+ "entropy": 0.1568159531605871,
546
+ "num_tokens": 3404334.0,
547
+ "mean_token_accuracy": 0.9635580613424903,
548
+ "epoch": 1.0139303482587065,
549
+ "step": 510
550
+ },
551
+ {
552
+ "loss": 0.1351562261581421,
553
+ "grad_norm": 0.7160713076591492,
554
+ "learning_rate": 0.00019846296311765754,
555
+ "entropy": 0.1316974400077015,
556
+ "num_tokens": 3471525.0,
557
+ "mean_token_accuracy": 0.9581282936036587,
558
+ "epoch": 1.0338308457711443,
559
+ "step": 520
560
+ },
561
+ {
562
+ "loss": 0.12300963401794433,
563
+ "grad_norm": 0.5991392731666565,
564
+ "learning_rate": 0.00019834599757036803,
565
+ "entropy": 0.14656153018586338,
566
+ "num_tokens": 3538338.0,
567
+ "mean_token_accuracy": 0.9646149106323719,
568
+ "epoch": 1.053731343283582,
569
+ "step": 530
570
+ },
571
+ {
572
+ "loss": 0.12765015363693238,
573
+ "grad_norm": 0.9330605864524841,
574
+ "learning_rate": 0.00019822478032340387,
575
+ "entropy": 0.15197489713318646,
576
+ "num_tokens": 3606642.0,
577
+ "mean_token_accuracy": 0.9586149267852306,
578
+ "epoch": 1.07363184079602,
579
+ "step": 540
580
+ },
581
+ {
582
+ "loss": 0.11172252893447876,
583
+ "grad_norm": 0.8762836456298828,
584
+ "learning_rate": 0.0001980993166172358,
585
+ "entropy": 0.11335502485744656,
586
+ "num_tokens": 3674420.0,
587
+ "mean_token_accuracy": 0.9656657867133618,
588
+ "epoch": 1.0935323383084576,
589
+ "step": 550
590
+ },
591
+ {
592
+ "loss": 0.10862302780151367,
593
+ "grad_norm": 0.8866952061653137,
594
+ "learning_rate": 0.00019796961187591781,
595
+ "entropy": 0.12588824331760406,
596
+ "num_tokens": 3741381.0,
597
+ "mean_token_accuracy": 0.9648959740996361,
598
+ "epoch": 1.1134328358208956,
599
+ "step": 560
600
+ },
601
+ {
602
+ "loss": 0.11582423448562622,
603
+ "grad_norm": 0.6481871604919434,
604
+ "learning_rate": 0.00019783567170685262,
605
+ "entropy": 0.11430091026704758,
606
+ "num_tokens": 3808318.0,
607
+ "mean_token_accuracy": 0.9628987669944763,
608
+ "epoch": 1.1333333333333333,
609
+ "step": 570
610
+ },
611
+ {
612
+ "loss": 0.1037294864654541,
613
+ "grad_norm": 0.5650383234024048,
614
+ "learning_rate": 0.00019769750190054905,
615
+ "entropy": 0.11517859897576273,
616
+ "num_tokens": 3874410.0,
617
+ "mean_token_accuracy": 0.9702431283891201,
618
+ "epoch": 1.153233830845771,
619
+ "step": 580
620
+ },
621
+ {
622
+ "loss": 0.10045719146728516,
623
+ "grad_norm": 0.5433067083358765,
624
+ "learning_rate": 0.00019755510843037191,
625
+ "entropy": 0.10291576159652323,
626
+ "num_tokens": 3941134.0,
627
+ "mean_token_accuracy": 0.9618785113096238,
628
+ "epoch": 1.173134328358209,
629
+ "step": 590
630
+ },
631
+ {
632
+ "loss": 0.12216674089431763,
633
+ "grad_norm": 0.7597805261611938,
634
+ "learning_rate": 0.00019740849745228367,
635
+ "entropy": 0.11075262987287715,
636
+ "num_tokens": 4008097.0,
637
+ "mean_token_accuracy": 0.9657749280333519,
638
+ "epoch": 1.1930348258706467,
639
+ "step": 600
640
+ },
641
+ {
642
+ "loss": 0.11509623527526855,
643
+ "grad_norm": 0.6820019483566284,
644
+ "learning_rate": 0.00019725767530457837,
645
+ "entropy": 0.12675938094034792,
646
+ "num_tokens": 4073570.0,
647
+ "mean_token_accuracy": 0.9657132118940354,
648
+ "epoch": 1.2129353233830846,
649
+ "step": 610
650
+ },
651
+ {
652
+ "loss": 0.10812582969665527,
653
+ "grad_norm": 0.5021085739135742,
654
+ "learning_rate": 0.00019710264850760756,
655
+ "entropy": 0.13302950132638217,
656
+ "num_tokens": 4140207.0,
657
+ "mean_token_accuracy": 0.9639534369111061,
658
+ "epoch": 1.2328358208955223,
659
+ "step": 620
660
+ },
661
+ {
662
+ "loss": 0.12314709424972534,
663
+ "grad_norm": 0.7293747067451477,
664
+ "learning_rate": 0.00019694342376349835,
665
+ "entropy": 0.12266454068012536,
666
+ "num_tokens": 4206997.0,
667
+ "mean_token_accuracy": 0.9629024133086205,
668
+ "epoch": 1.25273631840796,
669
+ "step": 630
670
+ },
671
+ {
672
+ "loss": 0.117351496219635,
673
+ "grad_norm": 0.9365243911743164,
674
+ "learning_rate": 0.00019678000795586386,
675
+ "entropy": 0.12240176484920084,
676
+ "num_tokens": 4277152.0,
677
+ "mean_token_accuracy": 0.96337865665555,
678
+ "epoch": 1.272636815920398,
679
+ "step": 640
680
+ },
681
+ {
682
+ "loss": 0.11279709339141845,
683
+ "grad_norm": 0.7311879396438599,
684
+ "learning_rate": 0.00019661240814950536,
685
+ "entropy": 0.11147555778734386,
686
+ "num_tokens": 4344652.0,
687
+ "mean_token_accuracy": 0.9658049061894417,
688
+ "epoch": 1.292537313432836,
689
+ "step": 650
690
+ },
691
+ {
692
+ "loss": 0.09745638966560363,
693
+ "grad_norm": 0.6283079981803894,
694
+ "learning_rate": 0.00019644063159010716,
695
+ "entropy": 0.11891384413465858,
696
+ "num_tokens": 4411916.0,
697
+ "mean_token_accuracy": 0.9698325954377651,
698
+ "epoch": 1.3124378109452737,
699
+ "step": 660
700
+ },
701
+ {
702
+ "loss": 0.1158707618713379,
703
+ "grad_norm": 0.6160532832145691,
704
+ "learning_rate": 0.00019626468570392298,
705
+ "entropy": 0.12134865028783678,
706
+ "num_tokens": 4478621.0,
707
+ "mean_token_accuracy": 0.9658548943698406,
708
+ "epoch": 1.3323383084577114,
709
+ "step": 670
710
+ },
711
+ {
712
+ "loss": 0.09168269634246826,
713
+ "grad_norm": 0.43357354402542114,
714
+ "learning_rate": 0.00019608457809745537,
715
+ "entropy": 0.10654389052651822,
716
+ "num_tokens": 4544168.0,
717
+ "mean_token_accuracy": 0.9723479963839055,
718
+ "epoch": 1.3522388059701491,
719
+ "step": 680
720
+ },
721
+ {
722
+ "loss": 0.11080507040023804,
723
+ "grad_norm": 0.7618773579597473,
724
+ "learning_rate": 0.00019590031655712631,
725
+ "entropy": 0.109538364992477,
726
+ "num_tokens": 4610518.0,
727
+ "mean_token_accuracy": 0.9682544745504856,
728
+ "epoch": 1.372139303482587,
729
+ "step": 690
730
+ },
731
+ {
732
+ "loss": 0.09991470575332642,
733
+ "grad_norm": 0.8631065487861633,
734
+ "learning_rate": 0.00019571190904894115,
735
+ "entropy": 0.11043523394037039,
736
+ "num_tokens": 4676248.0,
737
+ "mean_token_accuracy": 0.9694355696439743,
738
+ "epoch": 1.392039800995025,
739
+ "step": 700
740
+ },
741
+ {
742
+ "loss": 0.10194973945617676,
743
+ "grad_norm": 1.0989038944244385,
744
+ "learning_rate": 0.00019551936371814375,
745
+ "entropy": 0.1043223840300925,
746
+ "num_tokens": 4742628.0,
747
+ "mean_token_accuracy": 0.9693835198879241,
748
+ "epoch": 1.4119402985074627,
749
+ "step": 710
750
+ },
751
+ {
752
+ "loss": 0.10495258569717407,
753
+ "grad_norm": 0.9169466495513916,
754
+ "learning_rate": 0.0001953226888888647,
755
+ "entropy": 0.10138569427654147,
756
+ "num_tokens": 4809419.0,
757
+ "mean_token_accuracy": 0.970366296172142,
758
+ "epoch": 1.4318407960199004,
759
+ "step": 720
760
+ },
761
+ {
762
+ "loss": 0.11099306344985962,
763
+ "grad_norm": 0.49399080872535706,
764
+ "learning_rate": 0.00019512189306376118,
765
+ "entropy": 0.11472290018573403,
766
+ "num_tokens": 4877119.0,
767
+ "mean_token_accuracy": 0.9688441671431065,
768
+ "epoch": 1.4517412935323384,
769
+ "step": 730
770
+ },
771
+ {
772
+ "loss": 0.10629711151123047,
773
+ "grad_norm": 0.61200350522995,
774
+ "learning_rate": 0.0001949169849236496,
775
+ "entropy": 0.11205615981016308,
776
+ "num_tokens": 4944433.0,
777
+ "mean_token_accuracy": 0.966337724775076,
778
+ "epoch": 1.471641791044776,
779
+ "step": 740
780
+ },
781
+ {
782
+ "loss": 0.11089148521423339,
783
+ "grad_norm": 0.6224406361579895,
784
+ "learning_rate": 0.00019470797332713012,
785
+ "entropy": 0.11642576553858816,
786
+ "num_tokens": 5011634.0,
787
+ "mean_token_accuracy": 0.9659203454852104,
788
+ "epoch": 1.491542288557214,
789
+ "step": 750
790
+ },
791
+ {
792
+ "loss": 0.10163601636886596,
793
+ "grad_norm": 0.7650023698806763,
794
+ "learning_rate": 0.0001944948673102038,
795
+ "entropy": 0.11514911148697138,
796
+ "num_tokens": 5077156.0,
797
+ "mean_token_accuracy": 0.9675627797842026,
798
+ "epoch": 1.5114427860696518,
799
+ "step": 760
800
+ },
801
+ {
802
+ "loss": 0.098751300573349,
803
+ "grad_norm": 0.49794143438339233,
804
+ "learning_rate": 0.00019427767608588183,
805
+ "entropy": 0.10764023282099515,
806
+ "num_tokens": 5143991.0,
807
+ "mean_token_accuracy": 0.9677646860480309,
808
+ "epoch": 1.5313432835820895,
809
+ "step": 770
810
+ },
811
+ {
812
+ "loss": 0.11413514614105225,
813
+ "grad_norm": 0.6449922323226929,
814
+ "learning_rate": 0.0001940564090437875,
815
+ "entropy": 0.1094623792450875,
816
+ "num_tokens": 5211604.0,
817
+ "mean_token_accuracy": 0.9680206254124641,
818
+ "epoch": 1.5512437810945272,
819
+ "step": 780
820
+ },
821
+ {
822
+ "loss": 0.10809429883956909,
823
+ "grad_norm": 0.8340095281600952,
824
+ "learning_rate": 0.00019383107574974984,
825
+ "entropy": 0.12053416313137859,
826
+ "num_tokens": 5277697.0,
827
+ "mean_token_accuracy": 0.9674052610993386,
828
+ "epoch": 1.5711442786069652,
829
+ "step": 790
830
+ },
831
+ {
832
+ "loss": 0.08709208965301514,
833
+ "grad_norm": 0.7644860744476318,
834
+ "learning_rate": 0.00019360168594539055,
835
+ "entropy": 0.10000467539066449,
836
+ "num_tokens": 5342978.0,
837
+ "mean_token_accuracy": 0.9731013409793376,
838
+ "epoch": 1.591044776119403,
839
+ "step": 800
840
+ },
841
+ {
842
+ "loss": 0.09788179397583008,
843
+ "grad_norm": 0.6640422344207764,
844
+ "learning_rate": 0.0001933682495477024,
845
+ "entropy": 0.10800170768052339,
846
+ "num_tokens": 5410289.0,
847
+ "mean_token_accuracy": 0.9665102422237396,
848
+ "epoch": 1.6109452736318408,
849
+ "step": 810
850
+ },
851
+ {
852
+ "loss": 0.09605536460876465,
853
+ "grad_norm": 0.6755411624908447,
854
+ "learning_rate": 0.00019313077664862092,
855
+ "entropy": 0.10117872587870806,
856
+ "num_tokens": 5475880.0,
857
+ "mean_token_accuracy": 0.972070074826479,
858
+ "epoch": 1.6308457711442785,
859
+ "step": 820
860
+ },
861
+ {
862
+ "loss": 0.10400503873825073,
863
+ "grad_norm": 0.890627384185791,
864
+ "learning_rate": 0.00019288927751458766,
865
+ "entropy": 0.1069639899302274,
866
+ "num_tokens": 5541606.0,
867
+ "mean_token_accuracy": 0.9711074873805046,
868
+ "epoch": 1.6507462686567163,
869
+ "step": 830
870
+ },
871
+ {
872
+ "loss": 0.10754516124725341,
873
+ "grad_norm": 0.5509929656982422,
874
+ "learning_rate": 0.0001926437625861068,
875
+ "entropy": 0.11311845399904996,
876
+ "num_tokens": 5608065.0,
877
+ "mean_token_accuracy": 0.9695759303867817,
878
+ "epoch": 1.6706467661691542,
879
+ "step": 840
880
+ },
881
+ {
882
+ "loss": 0.12257307767868042,
883
+ "grad_norm": 0.6879218816757202,
884
+ "learning_rate": 0.00019239424247729345,
885
+ "entropy": 0.12085098770912736,
886
+ "num_tokens": 5674308.0,
887
+ "mean_token_accuracy": 0.9648775070905685,
888
+ "epoch": 1.6905472636815921,
889
+ "step": 850
890
+ },
891
+ {
892
+ "loss": 0.10849488973617553,
893
+ "grad_norm": 0.4920276999473572,
894
+ "learning_rate": 0.0001921407279754149,
895
+ "entropy": 0.11081431191414595,
896
+ "num_tokens": 5742414.0,
897
+ "mean_token_accuracy": 0.9698534436523915,
898
+ "epoch": 1.7104477611940299,
899
+ "step": 860
900
+ },
901
+ {
902
+ "loss": 0.0802489161491394,
903
+ "grad_norm": 0.7228904366493225,
904
+ "learning_rate": 0.00019188323004042435,
905
+ "entropy": 0.0929627066012472,
906
+ "num_tokens": 5809827.0,
907
+ "mean_token_accuracy": 0.9730034552514553,
908
+ "epoch": 1.7303482587064676,
909
+ "step": 870
910
+ },
911
+ {
912
+ "loss": 0.1109757661819458,
913
+ "grad_norm": 0.6558980345726013,
914
+ "learning_rate": 0.00019162175980448688,
915
+ "entropy": 0.0936126358807087,
916
+ "num_tokens": 5875172.0,
917
+ "mean_token_accuracy": 0.9671767763793468,
918
+ "epoch": 1.7502487562189055,
919
+ "step": 880
920
+ },
921
+ {
922
+ "loss": 0.09240159988403321,
923
+ "grad_norm": 0.5792869925498962,
924
+ "learning_rate": 0.0001913563285714984,
925
+ "entropy": 0.11744439310859889,
926
+ "num_tokens": 5942033.0,
927
+ "mean_token_accuracy": 0.9710902646183968,
928
+ "epoch": 1.7701492537313432,
929
+ "step": 890
930
+ },
931
+ {
932
+ "loss": 0.12259334325790405,
933
+ "grad_norm": 0.8990387320518494,
934
+ "learning_rate": 0.0001910869478165969,
935
+ "entropy": 0.10555630044545979,
936
+ "num_tokens": 6007977.0,
937
+ "mean_token_accuracy": 0.9644198954105377,
938
+ "epoch": 1.7900497512437812,
939
+ "step": 900
940
+ },
941
+ {
942
+ "loss": 0.10547571182250977,
943
+ "grad_norm": 0.7768874168395996,
944
+ "learning_rate": 0.00019081362918566618,
945
+ "entropy": 0.10993905747309327,
946
+ "num_tokens": 6074057.0,
947
+ "mean_token_accuracy": 0.9728645481169224,
948
+ "epoch": 1.809950248756219,
949
+ "step": 910
950
+ },
951
+ {
952
+ "loss": 0.10611696243286133,
953
+ "grad_norm": 0.4525396525859833,
954
+ "learning_rate": 0.00019053638449483259,
955
+ "entropy": 0.10362131035653874,
956
+ "num_tokens": 6141345.0,
957
+ "mean_token_accuracy": 0.9724654078483581,
958
+ "epoch": 1.8298507462686566,
959
+ "step": 920
960
+ },
961
+ {
962
+ "loss": 0.11176036596298218,
963
+ "grad_norm": 0.7492642998695374,
964
+ "learning_rate": 0.0001902552257299542,
965
+ "entropy": 0.11784212745260447,
966
+ "num_tokens": 6209124.0,
967
+ "mean_token_accuracy": 0.9628825642168521,
968
+ "epoch": 1.8497512437810946,
969
+ "step": 930
970
+ },
971
+ {
972
+ "loss": 0.10774084329605102,
973
+ "grad_norm": 0.5748555064201355,
974
+ "learning_rate": 0.00018997016504610246,
975
+ "entropy": 0.11072989953681826,
976
+ "num_tokens": 6276485.0,
977
+ "mean_token_accuracy": 0.9646185263991356,
978
+ "epoch": 1.8696517412935323,
979
+ "step": 940
980
+ },
981
+ {
982
+ "loss": 0.08848418593406678,
983
+ "grad_norm": 0.5937514305114746,
984
+ "learning_rate": 0.00018968121476703678,
985
+ "entropy": 0.10556984411086887,
986
+ "num_tokens": 6342957.0,
987
+ "mean_token_accuracy": 0.9734670996665955,
988
+ "epoch": 1.8895522388059702,
989
+ "step": 950
990
+ },
991
+ {
992
+ "loss": 0.10269320011138916,
993
+ "grad_norm": 1.0715358257293701,
994
+ "learning_rate": 0.00018938838738467184,
995
+ "entropy": 0.09428299731807784,
996
+ "num_tokens": 6408918.0,
997
+ "mean_token_accuracy": 0.9720249362289906,
998
+ "epoch": 1.909452736318408,
999
+ "step": 960
1000
+ },
1001
+ {
1002
+ "loss": 0.0899561107158661,
1003
+ "grad_norm": 0.5169550180435181,
1004
+ "learning_rate": 0.00018909169555853743,
1005
+ "entropy": 0.10850229405332357,
1006
+ "num_tokens": 6475062.0,
1007
+ "mean_token_accuracy": 0.9714486353099346,
1008
+ "epoch": 1.9293532338308457,
1009
+ "step": 970
1010
+ },
1011
+ {
1012
+ "loss": 0.09649609923362731,
1013
+ "grad_norm": 0.7642938494682312,
1014
+ "learning_rate": 0.00018879115211523117,
1015
+ "entropy": 0.1026058561168611,
1016
+ "num_tokens": 6542465.0,
1017
+ "mean_token_accuracy": 0.9703472301363945,
1018
+ "epoch": 1.9492537313432836,
1019
+ "step": 980
1020
+ },
1021
+ {
1022
+ "loss": 0.09067035913467407,
1023
+ "grad_norm": 0.3874703347682953,
1024
+ "learning_rate": 0.0001884867700478641,
1025
+ "entropy": 0.09136548589449375,
1026
+ "num_tokens": 6608985.0,
1027
+ "mean_token_accuracy": 0.9718083783984184,
1028
+ "epoch": 1.9691542288557216,
1029
+ "step": 990
1030
+ },
1031
+ {
1032
+ "loss": 0.09239903688430787,
1033
+ "grad_norm": 0.693695604801178,
1034
+ "learning_rate": 0.00018817856251549867,
1035
+ "entropy": 0.11761876428499818,
1036
+ "num_tokens": 6676885.0,
1037
+ "mean_token_accuracy": 0.9674227833747864,
1038
+ "epoch": 1.9890547263681593,
1039
+ "step": 1000
1040
+ },
1041
+ {
1042
+ "eval_loss": 0.24770455062389374,
1043
+ "eval_runtime": 67.3665,
1044
+ "eval_samples_per_second": 15.364,
1045
+ "eval_steps_per_second": 7.689,
1046
+ "eval_entropy": 0.13267684354209502,
1047
+ "eval_num_tokens": 6713972.0,
1048
+ "eval_mean_token_accuracy": 0.9410935246806347,
1049
+ "epoch": 2.0,
1050
+ "step": 1006
1051
+ },
1052
+ {
1053
+ "loss": 0.08439697623252869,
1054
+ "grad_norm": 0.41609451174736023,
1055
+ "learning_rate": 0.00018786654284258034,
1056
+ "entropy": 0.09164438765545033,
1057
+ "num_tokens": 6740189.0,
1058
+ "mean_token_accuracy": 0.9744413871514169,
1059
+ "epoch": 2.007960199004975,
1060
+ "step": 1010
1061
+ },
1062
+ {
1063
+ "loss": 0.06379352807998658,
1064
+ "grad_norm": 0.7209794521331787,
1065
+ "learning_rate": 0.00018755072451836097,
1066
+ "entropy": 0.06243965101893991,
1067
+ "num_tokens": 6806511.0,
1068
+ "mean_token_accuracy": 0.9806746728718281,
1069
+ "epoch": 2.027860696517413,
1070
+ "step": 1020
1071
+ },
1072
+ {
1073
+ "loss": 0.07251286506652832,
1074
+ "grad_norm": 0.4035630524158478,
1075
+ "learning_rate": 0.00018723112119631608,
1076
+ "entropy": 0.06880665038479492,
1077
+ "num_tokens": 6874726.0,
1078
+ "mean_token_accuracy": 0.9811282232403755,
1079
+ "epoch": 2.047761194029851,
1080
+ "step": 1030
1081
+ },
1082
+ {
1083
+ "loss": 0.05488339066505432,
1084
+ "grad_norm": 0.6395288705825806,
1085
+ "learning_rate": 0.00018690774669355442,
1086
+ "entropy": 0.07282297083875164,
1087
+ "num_tokens": 6940725.0,
1088
+ "mean_token_accuracy": 0.9807328015565873,
1089
+ "epoch": 2.0676616915422885,
1090
+ "step": 1040
1091
+ },
1092
+ {
1093
+ "loss": 0.06734220385551452,
1094
+ "grad_norm": 0.7077370882034302,
1095
+ "learning_rate": 0.00018658061499022055,
1096
+ "entropy": 0.07170078799827025,
1097
+ "num_tokens": 7008850.0,
1098
+ "mean_token_accuracy": 0.9810515813529491,
1099
+ "epoch": 2.0875621890547262,
1100
+ "step": 1050
1101
+ },
1102
+ {
1103
+ "loss": 0.062459665536880496,
1104
+ "grad_norm": 1.220231294631958,
1105
+ "learning_rate": 0.0001862497402288906,
1106
+ "entropy": 0.05807271180674434,
1107
+ "num_tokens": 7074982.0,
1108
+ "mean_token_accuracy": 0.981388358771801,
1109
+ "epoch": 2.107462686567164,
1110
+ "step": 1060
1111
+ },
1112
+ {
1113
+ "loss": 0.046548599004745485,
1114
+ "grad_norm": 0.5530555248260498,
1115
+ "learning_rate": 0.0001859151367139608,
1116
+ "entropy": 0.06504726539133117,
1117
+ "num_tokens": 7140914.0,
1118
+ "mean_token_accuracy": 0.984452311694622,
1119
+ "epoch": 2.127363184079602,
1120
+ "step": 1070
1121
+ },
1122
+ {
1123
+ "loss": 0.05819639563560486,
1124
+ "grad_norm": 0.7002009749412537,
1125
+ "learning_rate": 0.000185576818911029,
1126
+ "entropy": 0.050316512072458866,
1127
+ "num_tokens": 7206800.0,
1128
+ "mean_token_accuracy": 0.985405495017767,
1129
+ "epoch": 2.14726368159204,
1130
+ "step": 1080
1131
+ },
1132
+ {
1133
+ "loss": 0.0601584792137146,
1134
+ "grad_norm": 0.540239691734314,
1135
+ "learning_rate": 0.00018523480144626948,
1136
+ "entropy": 0.07835423464421183,
1137
+ "num_tokens": 7273522.0,
1138
+ "mean_token_accuracy": 0.9818796373903751,
1139
+ "epoch": 2.1671641791044776,
1140
+ "step": 1090
1141
+ },
1142
+ {
1143
+ "loss": 0.04493230581283569,
1144
+ "grad_norm": 0.5114269256591797,
1145
+ "learning_rate": 0.00018488909910580037,
1146
+ "entropy": 0.05474828036967665,
1147
+ "num_tokens": 7340979.0,
1148
+ "mean_token_accuracy": 0.9857458151876927,
1149
+ "epoch": 2.1870646766169153,
1150
+ "step": 1100
1151
+ },
1152
+ {
1153
+ "loss": 0.054016536474227904,
1154
+ "grad_norm": 0.6734052300453186,
1155
+ "learning_rate": 0.00018453972683504466,
1156
+ "entropy": 0.05471267879474908,
1157
+ "num_tokens": 7407885.0,
1158
+ "mean_token_accuracy": 0.9807157158851624,
1159
+ "epoch": 2.206965174129353,
1160
+ "step": 1110
1161
+ },
1162
+ {
1163
+ "loss": 0.06644362211227417,
1164
+ "grad_norm": 1.0557215213775635,
1165
+ "learning_rate": 0.00018418669973808386,
1166
+ "entropy": 0.07309502450516447,
1167
+ "num_tokens": 7476921.0,
1168
+ "mean_token_accuracy": 0.9793836884200573,
1169
+ "epoch": 2.226865671641791,
1170
+ "step": 1120
1171
+ },
1172
+ {
1173
+ "loss": 0.06655114293098449,
1174
+ "grad_norm": 0.5192980170249939,
1175
+ "learning_rate": 0.00018383003307700525,
1176
+ "entropy": 0.06608295071637257,
1177
+ "num_tokens": 7543462.0,
1178
+ "mean_token_accuracy": 0.9790004834532737,
1179
+ "epoch": 2.246766169154229,
1180
+ "step": 1130
1181
+ },
1182
+ {
1183
+ "loss": 0.06803213357925415,
1184
+ "grad_norm": 0.4396572709083557,
1185
+ "learning_rate": 0.0001834697422712419,
1186
+ "entropy": 0.06500887103029526,
1187
+ "num_tokens": 7610642.0,
1188
+ "mean_token_accuracy": 0.980684906244278,
1189
+ "epoch": 2.2666666666666666,
1190
+ "step": 1140
1191
+ },
1192
+ {
1193
+ "loss": 0.05774785876274109,
1194
+ "grad_norm": 0.8334233164787292,
1195
+ "learning_rate": 0.00018310584289690608,
1196
+ "entropy": 0.058826766291167586,
1197
+ "num_tokens": 7676890.0,
1198
+ "mean_token_accuracy": 0.9823732137680053,
1199
+ "epoch": 2.2865671641791043,
1200
+ "step": 1150
1201
+ },
1202
+ {
1203
+ "loss": 0.05890558958053589,
1204
+ "grad_norm": 0.6917388439178467,
1205
+ "learning_rate": 0.0001827383506861159,
1206
+ "entropy": 0.0589894114760682,
1207
+ "num_tokens": 7743110.0,
1208
+ "mean_token_accuracy": 0.9807198375463486,
1209
+ "epoch": 2.306467661691542,
1210
+ "step": 1160
1211
+ },
1212
+ {
1213
+ "loss": 0.04957199692726135,
1214
+ "grad_norm": 0.351596862077713,
1215
+ "learning_rate": 0.00018236728152631526,
1216
+ "entropy": 0.05655237181927077,
1217
+ "num_tokens": 7809971.0,
1218
+ "mean_token_accuracy": 0.9838769190013409,
1219
+ "epoch": 2.32636815920398,
1220
+ "step": 1170
1221
+ },
1222
+ {
1223
+ "loss": 0.07587432265281677,
1224
+ "grad_norm": 0.4856368899345398,
1225
+ "learning_rate": 0.00018199265145958678,
1226
+ "entropy": 0.06457642229506746,
1227
+ "num_tokens": 7876231.0,
1228
+ "mean_token_accuracy": 0.974904265254736,
1229
+ "epoch": 2.346268656716418,
1230
+ "step": 1180
1231
+ },
1232
+ {
1233
+ "loss": 0.057352250814437865,
1234
+ "grad_norm": 0.6313260197639465,
1235
+ "learning_rate": 0.00018161447668195858,
1236
+ "entropy": 0.07011734971310943,
1237
+ "num_tokens": 7942463.0,
1238
+ "mean_token_accuracy": 0.9822526164352894,
1239
+ "epoch": 2.3661691542288557,
1240
+ "step": 1190
1241
+ },
1242
+ {
1243
+ "loss": 0.07296563386917114,
1244
+ "grad_norm": 0.6475229263305664,
1245
+ "learning_rate": 0.00018123277354270372,
1246
+ "entropy": 0.07394456524634734,
1247
+ "num_tokens": 8008529.0,
1248
+ "mean_token_accuracy": 0.9783020555973053,
1249
+ "epoch": 2.3860696517412934,
1250
+ "step": 1200
1251
+ },
1252
+ {
1253
+ "loss": 0.06899880170822144,
1254
+ "grad_norm": 0.5311662554740906,
1255
+ "learning_rate": 0.00018084755854363377,
1256
+ "entropy": 0.06762066348455846,
1257
+ "num_tokens": 8075331.0,
1258
+ "mean_token_accuracy": 0.9800443604588509,
1259
+ "epoch": 2.405970149253731,
1260
+ "step": 1210
1261
+ },
1262
+ {
1263
+ "loss": 0.04785624444484711,
1264
+ "grad_norm": 0.47831037640571594,
1265
+ "learning_rate": 0.00018045884833838512,
1266
+ "entropy": 0.052969011454842986,
1267
+ "num_tokens": 8140043.0,
1268
+ "mean_token_accuracy": 0.9850305773317813,
1269
+ "epoch": 2.4258706467661693,
1270
+ "step": 1220
1271
+ },
1272
+ {
1273
+ "loss": 0.057527285814285276,
1274
+ "grad_norm": 0.4341302216053009,
1275
+ "learning_rate": 0.00018006665973169911,
1276
+ "entropy": 0.058878783753607424,
1277
+ "num_tokens": 8206439.0,
1278
+ "mean_token_accuracy": 0.9826890744268895,
1279
+ "epoch": 2.445771144278607,
1280
+ "step": 1230
1281
+ },
1282
+ {
1283
+ "loss": 0.06314617991447449,
1284
+ "grad_norm": 0.6121116876602173,
1285
+ "learning_rate": 0.0001796710096786956,
1286
+ "entropy": 0.06802375400438905,
1287
+ "num_tokens": 8274350.0,
1288
+ "mean_token_accuracy": 0.9803676478564739,
1289
+ "epoch": 2.4656716417910447,
1290
+ "step": 1240
1291
+ },
1292
+ {
1293
+ "loss": 0.06138876676559448,
1294
+ "grad_norm": 0.485624760389328,
1295
+ "learning_rate": 0.0001792719152841398,
1296
+ "entropy": 0.06864131800248288,
1297
+ "num_tokens": 8342676.0,
1298
+ "mean_token_accuracy": 0.9821898102760315,
1299
+ "epoch": 2.4855721393034824,
1300
+ "step": 1250
1301
+ },
1302
+ {
1303
+ "loss": 0.05479460954666138,
1304
+ "grad_norm": 0.7229267358779907,
1305
+ "learning_rate": 0.0001788693938017029,
1306
+ "entropy": 0.06992838233709335,
1307
+ "num_tokens": 8408688.0,
1308
+ "mean_token_accuracy": 0.9806355632841587,
1309
+ "epoch": 2.50547263681592,
1310
+ "step": 1260
1311
+ },
1312
+ {
1313
+ "loss": 0.05725674629211426,
1314
+ "grad_norm": 0.6357669234275818,
1315
+ "learning_rate": 0.00017846346263321623,
1316
+ "entropy": 0.05212859932216816,
1317
+ "num_tokens": 8475857.0,
1318
+ "mean_token_accuracy": 0.982030725479126,
1319
+ "epoch": 2.5253731343283583,
1320
+ "step": 1270
1321
+ },
1322
+ {
1323
+ "loss": 0.05330604910850525,
1324
+ "grad_norm": 0.48565125465393066,
1325
+ "learning_rate": 0.00017805413932791875,
1326
+ "entropy": 0.0598757246916648,
1327
+ "num_tokens": 8542007.0,
1328
+ "mean_token_accuracy": 0.9829342268407345,
1329
+ "epoch": 2.545273631840796,
1330
+ "step": 1280
1331
+ },
1332
+ {
1333
+ "loss": 0.0662715494632721,
1334
+ "grad_norm": 0.47484299540519714,
1335
+ "learning_rate": 0.00017764144158169856,
1336
+ "entropy": 0.07917212916072458,
1337
+ "num_tokens": 8609409.0,
1338
+ "mean_token_accuracy": 0.9773714534938336,
1339
+ "epoch": 2.5651741293532337,
1340
+ "step": 1290
1341
+ },
1342
+ {
1343
+ "loss": 0.06932964324951171,
1344
+ "grad_norm": 0.7906941175460815,
1345
+ "learning_rate": 0.00017722538723632773,
1346
+ "entropy": 0.0599730534479022,
1347
+ "num_tokens": 8676488.0,
1348
+ "mean_token_accuracy": 0.9792346425354481,
1349
+ "epoch": 2.585074626865672,
1350
+ "step": 1300
1351
+ },
1352
+ {
1353
+ "loss": 0.08003131747245788,
1354
+ "grad_norm": 0.5393727421760559,
1355
+ "learning_rate": 0.000176805994278691,
1356
+ "entropy": 0.07814967349986546,
1357
+ "num_tokens": 8744553.0,
1358
+ "mean_token_accuracy": 0.9784729719161988,
1359
+ "epoch": 2.604975124378109,
1360
+ "step": 1310
1361
+ },
1362
+ {
1363
+ "loss": 0.051309889554977416,
1364
+ "grad_norm": 0.8460810780525208,
1365
+ "learning_rate": 0.0001763832808400082,
1366
+ "entropy": 0.06959494983311743,
1367
+ "num_tokens": 8812013.0,
1368
+ "mean_token_accuracy": 0.9829349182546139,
1369
+ "epoch": 2.6248756218905474,
1370
+ "step": 1320
1371
+ },
1372
+ {
1373
+ "loss": 0.05681629776954651,
1374
+ "grad_norm": 0.5110874176025391,
1375
+ "learning_rate": 0.00017595726519505043,
1376
+ "entropy": 0.06371988009777851,
1377
+ "num_tokens": 8879275.0,
1378
+ "mean_token_accuracy": 0.9808239601552486,
1379
+ "epoch": 2.644776119402985,
1380
+ "step": 1330
1381
+ },
1382
+ {
1383
+ "loss": 0.06473686695098876,
1384
+ "grad_norm": 0.45770350098609924,
1385
+ "learning_rate": 0.00017552796576134985,
1386
+ "entropy": 0.06574244437506423,
1387
+ "num_tokens": 8946437.0,
1388
+ "mean_token_accuracy": 0.9830326803028584,
1389
+ "epoch": 2.664676616915423,
1390
+ "step": 1340
1391
+ },
1392
+ {
1393
+ "loss": 0.05621873736381531,
1394
+ "grad_norm": 0.47769930958747864,
1395
+ "learning_rate": 0.00017509540109840365,
1396
+ "entropy": 0.06558069243910722,
1397
+ "num_tokens": 9013311.0,
1398
+ "mean_token_accuracy": 0.9796665169298648,
1399
+ "epoch": 2.684577114427861,
1400
+ "step": 1350
1401
+ },
1402
+ {
1403
+ "loss": 0.05615652799606323,
1404
+ "grad_norm": 0.48142921924591064,
1405
+ "learning_rate": 0.00017465958990687156,
1406
+ "entropy": 0.059144589549396186,
1407
+ "num_tokens": 9078260.0,
1408
+ "mean_token_accuracy": 0.9777877710759639,
1409
+ "epoch": 2.7044776119402982,
1410
+ "step": 1360
1411
+ },
1412
+ {
1413
+ "loss": 0.07301256060600281,
1414
+ "grad_norm": 0.6959577798843384,
1415
+ "learning_rate": 0.0001742205510277674,
1416
+ "entropy": 0.0731184652308002,
1417
+ "num_tokens": 9143896.0,
1418
+ "mean_token_accuracy": 0.9792239956557751,
1419
+ "epoch": 2.7243781094527364,
1420
+ "step": 1370
1421
+ },
1422
+ {
1423
+ "loss": 0.05728998184204102,
1424
+ "grad_norm": 0.4535721242427826,
1425
+ "learning_rate": 0.00017377830344164464,
1426
+ "entropy": 0.06650992162758484,
1427
+ "num_tokens": 9210455.0,
1428
+ "mean_token_accuracy": 0.9824736349284648,
1429
+ "epoch": 2.744278606965174,
1430
+ "step": 1380
1431
+ },
1432
+ {
1433
+ "loss": 0.05624777674674988,
1434
+ "grad_norm": 0.9010443687438965,
1435
+ "learning_rate": 0.00017333286626777564,
1436
+ "entropy": 0.06068479290697724,
1437
+ "num_tokens": 9278223.0,
1438
+ "mean_token_accuracy": 0.9795115493237972,
1439
+ "epoch": 2.764179104477612,
1440
+ "step": 1390
1441
+ },
1442
+ {
1443
+ "loss": 0.04648939669132233,
1444
+ "grad_norm": 0.5129737257957458,
1445
+ "learning_rate": 0.00017288425876332527,
1446
+ "entropy": 0.05758373744320124,
1447
+ "num_tokens": 9346259.0,
1448
+ "mean_token_accuracy": 0.9854638859629631,
1449
+ "epoch": 2.78407960199005,
1450
+ "step": 1400
1451
+ },
1452
+ {
1453
+ "loss": 0.07454426288604736,
1454
+ "grad_norm": 1.081714153289795,
1455
+ "learning_rate": 0.00017243250032251823,
1456
+ "entropy": 0.07305689085042104,
1457
+ "num_tokens": 9411960.0,
1458
+ "mean_token_accuracy": 0.9747657172381878,
1459
+ "epoch": 2.8039800995024877,
1460
+ "step": 1410
1461
+ },
1462
+ {
1463
+ "loss": 0.052061259746551514,
1464
+ "grad_norm": 0.668654203414917,
1465
+ "learning_rate": 0.00017197761047580082,
1466
+ "entropy": 0.05686979314778,
1467
+ "num_tokens": 9479728.0,
1468
+ "mean_token_accuracy": 0.9826227888464928,
1469
+ "epoch": 2.8238805970149254,
1470
+ "step": 1420
1471
+ },
1472
+ {
1473
+ "loss": 0.061662870645523074,
1474
+ "grad_norm": 0.6690983772277832,
1475
+ "learning_rate": 0.00017151960888899627,
1476
+ "entropy": 0.06015237307874486,
1477
+ "num_tokens": 9544970.0,
1478
+ "mean_token_accuracy": 0.9811851166188716,
1479
+ "epoch": 2.843781094527363,
1480
+ "step": 1430
1481
+ },
1482
+ {
1483
+ "loss": 0.05701953172683716,
1484
+ "grad_norm": 0.7326856255531311,
1485
+ "learning_rate": 0.00017105851536245492,
1486
+ "entropy": 0.07333141873823479,
1487
+ "num_tokens": 9611720.0,
1488
+ "mean_token_accuracy": 0.9832665704190731,
1489
+ "epoch": 2.863681592039801,
1490
+ "step": 1440
1491
+ },
1492
+ {
1493
+ "loss": 0.07263015508651734,
1494
+ "grad_norm": 0.7834051251411438,
1495
+ "learning_rate": 0.0001705943498301979,
1496
+ "entropy": 0.06394668611465022,
1497
+ "num_tokens": 9679831.0,
1498
+ "mean_token_accuracy": 0.9781429409980774,
1499
+ "epoch": 2.883582089552239,
1500
+ "step": 1450
1501
+ },
1502
+ {
1503
+ "loss": 0.05510892271995545,
1504
+ "grad_norm": 0.6546643972396851,
1505
+ "learning_rate": 0.00017012713235905547,
1506
+ "entropy": 0.06291348003433087,
1507
+ "num_tokens": 9745899.0,
1508
+ "mean_token_accuracy": 0.9804500080645084,
1509
+ "epoch": 2.9034825870646768,
1510
+ "step": 1460
1511
+ },
1512
+ {
1513
+ "loss": 0.05505146384239197,
1514
+ "grad_norm": 0.5361804962158203,
1515
+ "learning_rate": 0.00016965688314779956,
1516
+ "entropy": 0.06303218469838612,
1517
+ "num_tokens": 9814519.0,
1518
+ "mean_token_accuracy": 0.9801669403910637,
1519
+ "epoch": 2.9233830845771145,
1520
+ "step": 1470
1521
+ },
1522
+ {
1523
+ "loss": 0.04610788822174072,
1524
+ "grad_norm": 0.6162955164909363,
1525
+ "learning_rate": 0.00016918362252627036,
1526
+ "entropy": 0.0545346099184826,
1527
+ "num_tokens": 9878812.0,
1528
+ "mean_token_accuracy": 0.9822937592864036,
1529
+ "epoch": 2.943283582089552,
1530
+ "step": 1480
1531
+ },
1532
+ {
1533
+ "loss": 0.06813795566558838,
1534
+ "grad_norm": 0.8021186590194702,
1535
+ "learning_rate": 0.00016870737095449754,
1536
+ "entropy": 0.06529987451503985,
1537
+ "num_tokens": 9946556.0,
1538
+ "mean_token_accuracy": 0.9782890357077122,
1539
+ "epoch": 2.96318407960199,
1540
+ "step": 1490
1541
+ },
1542
+ {
1543
+ "loss": 0.05245916843414307,
1544
+ "grad_norm": 0.6037353277206421,
1545
+ "learning_rate": 0.00016822814902181583,
1546
+ "entropy": 0.06525841613765807,
1547
+ "num_tokens": 10014536.0,
1548
+ "mean_token_accuracy": 0.9829807795584202,
1549
+ "epoch": 2.983084577114428,
1550
+ "step": 1500
1551
+ },
1552
+ {
1553
+ "eval_loss": 0.26412370800971985,
1554
+ "eval_runtime": 67.3621,
1555
+ "eval_samples_per_second": 15.365,
1556
+ "eval_steps_per_second": 7.69,
1557
+ "eval_entropy": 0.10301580357465993,
1558
+ "eval_num_tokens": 10070958.0,
1559
+ "eval_mean_token_accuracy": 0.9438181870462351,
1560
+ "epoch": 3.0,
1561
+ "step": 1509
1562
+ },
1563
+ {
1564
+ "loss": 0.05833644866943359,
1565
+ "grad_norm": 0.29880842566490173,
1566
+ "learning_rate": 0.00016774597744597457,
1567
+ "entropy": 0.053184559752576445,
1568
+ "num_tokens": 10077424.0,
1569
+ "mean_token_accuracy": 0.9848840275877401,
1570
+ "epoch": 3.0019900497512437,
1571
+ "step": 1510
1572
+ },
1573
+ {
1574
+ "loss": 0.03773494362831116,
1575
+ "grad_norm": 0.5901796817779541,
1576
+ "learning_rate": 0.00016726087707224236,
1577
+ "entropy": 0.04916581161960494,
1578
+ "num_tokens": 10143828.0,
1579
+ "mean_token_accuracy": 0.9888612225651741,
1580
+ "epoch": 3.0218905472636814,
1581
+ "step": 1520
1582
+ },
1583
+ {
1584
+ "loss": 0.04334467053413391,
1585
+ "grad_norm": 0.4549998342990875,
1586
+ "learning_rate": 0.00016677286887250572,
1587
+ "entropy": 0.04599970751442015,
1588
+ "num_tokens": 10210498.0,
1589
+ "mean_token_accuracy": 0.9884389974176884,
1590
+ "epoch": 3.0417910447761196,
1591
+ "step": 1530
1592
+ },
1593
+ {
1594
+ "loss": 0.031511181592941286,
1595
+ "grad_norm": 0.41420701146125793,
1596
+ "learning_rate": 0.00016628197394436247,
1597
+ "entropy": 0.03852141368552111,
1598
+ "num_tokens": 10275990.0,
1599
+ "mean_token_accuracy": 0.9884374618530274,
1600
+ "epoch": 3.0616915422885573,
1601
+ "step": 1540
1602
+ },
1603
+ {
1604
+ "loss": 0.029081150889396667,
1605
+ "grad_norm": 0.3844093978404999,
1606
+ "learning_rate": 0.00016578821351020964,
1607
+ "entropy": 0.032692909514298665,
1608
+ "num_tokens": 10342514.0,
1609
+ "mean_token_accuracy": 0.9907526269555091,
1610
+ "epoch": 3.081592039800995,
1611
+ "step": 1550
1612
+ },
1613
+ {
1614
+ "loss": 0.037613070011138915,
1615
+ "grad_norm": 0.3342166244983673,
1616
+ "learning_rate": 0.00016529160891632597,
1617
+ "entropy": 0.03535493408198818,
1618
+ "num_tokens": 10408828.0,
1619
+ "mean_token_accuracy": 0.9882513448596001,
1620
+ "epoch": 3.1014925373134328,
1621
+ "step": 1560
1622
+ },
1623
+ {
1624
+ "loss": 0.03288332223892212,
1625
+ "grad_norm": 0.5369789600372314,
1626
+ "learning_rate": 0.00016479218163194904,
1627
+ "entropy": 0.038720946523244495,
1628
+ "num_tokens": 10475303.0,
1629
+ "mean_token_accuracy": 0.9900217793881894,
1630
+ "epoch": 3.1213930348258705,
1631
+ "step": 1570
1632
+ },
1633
+ {
1634
+ "loss": 0.03281024694442749,
1635
+ "grad_norm": 0.3687148094177246,
1636
+ "learning_rate": 0.00016428995324834723,
1637
+ "entropy": 0.03382732793106698,
1638
+ "num_tokens": 10543012.0,
1639
+ "mean_token_accuracy": 0.9898124732077122,
1640
+ "epoch": 3.1412935323383087,
1641
+ "step": 1580
1642
+ },
1643
+ {
1644
+ "loss": 0.032737156748771666,
1645
+ "grad_norm": 0.40983688831329346,
1646
+ "learning_rate": 0.00016378494547788613,
1647
+ "entropy": 0.04149121846421622,
1648
+ "num_tokens": 10609348.0,
1649
+ "mean_token_accuracy": 0.9896206237375736,
1650
+ "epoch": 3.1611940298507464,
1651
+ "step": 1590
1652
+ },
1653
+ {
1654
+ "loss": 0.04040493667125702,
1655
+ "grad_norm": 0.6384645104408264,
1656
+ "learning_rate": 0.00016327718015308998,
1657
+ "entropy": 0.04162978534004651,
1658
+ "num_tokens": 10676433.0,
1659
+ "mean_token_accuracy": 0.987835768610239,
1660
+ "epoch": 3.181094527363184,
1661
+ "step": 1600
1662
+ },
1663
+ {
1664
+ "loss": 0.03527785539627075,
1665
+ "grad_norm": 0.7771252989768982,
1666
+ "learning_rate": 0.0001627666792256977,
1667
+ "entropy": 0.0402049986703787,
1668
+ "num_tokens": 10744880.0,
1669
+ "mean_token_accuracy": 0.9879353500902652,
1670
+ "epoch": 3.200995024875622,
1671
+ "step": 1610
1672
+ },
1673
+ {
1674
+ "loss": 0.027459162473678588,
1675
+ "grad_norm": 0.7088900208473206,
1676
+ "learning_rate": 0.00016225346476571396,
1677
+ "entropy": 0.03322969185537659,
1678
+ "num_tokens": 10811704.0,
1679
+ "mean_token_accuracy": 0.9915633283555507,
1680
+ "epoch": 3.2208955223880595,
1681
+ "step": 1620
1682
+ },
1683
+ {
1684
+ "loss": 0.04761128127574921,
1685
+ "grad_norm": 0.5046206712722778,
1686
+ "learning_rate": 0.00016173755896045506,
1687
+ "entropy": 0.04271038012811914,
1688
+ "num_tokens": 10877771.0,
1689
+ "mean_token_accuracy": 0.9852734059095383,
1690
+ "epoch": 3.2407960199004977,
1691
+ "step": 1630
1692
+ },
1693
+ {
1694
+ "loss": 0.040560868382453916,
1695
+ "grad_norm": 0.5330039262771606,
1696
+ "learning_rate": 0.00016121898411358966,
1697
+ "entropy": 0.056298443174455315,
1698
+ "num_tokens": 10946056.0,
1699
+ "mean_token_accuracy": 0.9860941573977471,
1700
+ "epoch": 3.2606965174129354,
1701
+ "step": 1640
1702
+ },
1703
+ {
1704
+ "loss": 0.038580065965652464,
1705
+ "grad_norm": 0.3763498067855835,
1706
+ "learning_rate": 0.00016069776264417463,
1707
+ "entropy": 0.040748245036229494,
1708
+ "num_tokens": 11014117.0,
1709
+ "mean_token_accuracy": 0.9879476867616177,
1710
+ "epoch": 3.280597014925373,
1711
+ "step": 1650
1712
+ },
1713
+ {
1714
+ "loss": 0.031229573488235473,
1715
+ "grad_norm": 0.5975865721702576,
1716
+ "learning_rate": 0.00016017391708568563,
1717
+ "entropy": 0.04134431722341105,
1718
+ "num_tokens": 11080721.0,
1719
+ "mean_token_accuracy": 0.9899743214249611,
1720
+ "epoch": 3.300497512437811,
1721
+ "step": 1660
1722
+ },
1723
+ {
1724
+ "loss": 0.04345620274543762,
1725
+ "grad_norm": 0.5342262387275696,
1726
+ "learning_rate": 0.00015964747008504325,
1727
+ "entropy": 0.03906176597811282,
1728
+ "num_tokens": 11147441.0,
1729
+ "mean_token_accuracy": 0.98561105504632,
1730
+ "epoch": 3.3203980099502486,
1731
+ "step": 1670
1732
+ },
1733
+ {
1734
+ "loss": 0.042844048142433165,
1735
+ "grad_norm": 0.4553395211696625,
1736
+ "learning_rate": 0.00015911844440163371,
1737
+ "entropy": 0.043423575052293016,
1738
+ "num_tokens": 11212240.0,
1739
+ "mean_token_accuracy": 0.9864377163350582,
1740
+ "epoch": 3.3402985074626868,
1741
+ "step": 1680
1742
+ },
1743
+ {
1744
+ "loss": 0.029976919293403625,
1745
+ "grad_norm": 0.7629397511482239,
1746
+ "learning_rate": 0.00015858686290632493,
1747
+ "entropy": 0.04001676997286267,
1748
+ "num_tokens": 11277138.0,
1749
+ "mean_token_accuracy": 0.9910943493247032,
1750
+ "epoch": 3.3601990049751245,
1751
+ "step": 1690
1752
+ },
1753
+ {
1754
+ "loss": 0.03644349873065948,
1755
+ "grad_norm": 0.5027875304222107,
1756
+ "learning_rate": 0.0001580527485804779,
1757
+ "entropy": 0.037145845251507124,
1758
+ "num_tokens": 11343926.0,
1759
+ "mean_token_accuracy": 0.9864401429891586,
1760
+ "epoch": 3.380099502487562,
1761
+ "step": 1700
1762
+ },
1763
+ {
1764
+ "loss": 0.030204242467880248,
1765
+ "grad_norm": 0.3141781687736511,
1766
+ "learning_rate": 0.00015751612451495313,
1767
+ "entropy": 0.03934923965134658,
1768
+ "num_tokens": 11411256.0,
1769
+ "mean_token_accuracy": 0.9906957238912583,
1770
+ "epoch": 3.4,
1771
+ "step": 1710
1772
+ },
1773
+ {
1774
+ "loss": 0.03447907567024231,
1775
+ "grad_norm": 0.2602730989456177,
1776
+ "learning_rate": 0.00015697701390911218,
1777
+ "entropy": 0.03915706583939027,
1778
+ "num_tokens": 11477632.0,
1779
+ "mean_token_accuracy": 0.9882164128124714,
1780
+ "epoch": 3.4199004975124376,
1781
+ "step": 1720
1782
+ },
1783
+ {
1784
+ "loss": 0.03258863389492035,
1785
+ "grad_norm": 0.5404685735702515,
1786
+ "learning_rate": 0.00015643544006981505,
1787
+ "entropy": 0.04417289613047615,
1788
+ "num_tokens": 11542182.0,
1789
+ "mean_token_accuracy": 0.9894180931150913,
1790
+ "epoch": 3.439800995024876,
1791
+ "step": 1730
1792
+ },
1793
+ {
1794
+ "loss": 0.03976099193096161,
1795
+ "grad_norm": 0.4809146821498871,
1796
+ "learning_rate": 0.0001558914264104122,
1797
+ "entropy": 0.039228807145264,
1798
+ "num_tokens": 11608358.0,
1799
+ "mean_token_accuracy": 0.9867617316544056,
1800
+ "epoch": 3.4597014925373135,
1801
+ "step": 1740
1802
+ },
1803
+ {
1804
+ "loss": 0.03436765670776367,
1805
+ "grad_norm": 0.7439927458763123,
1806
+ "learning_rate": 0.00015534499644973267,
1807
+ "entropy": 0.03574614835088141,
1808
+ "num_tokens": 11675284.0,
1809
+ "mean_token_accuracy": 0.9876792296767235,
1810
+ "epoch": 3.4796019900497512,
1811
+ "step": 1750
1812
+ },
1813
+ {
1814
+ "loss": 0.038963159918785094,
1815
+ "grad_norm": 1.2817922830581665,
1816
+ "learning_rate": 0.00015479617381106711,
1817
+ "entropy": 0.04119858265621588,
1818
+ "num_tokens": 11743101.0,
1819
+ "mean_token_accuracy": 0.9876352168619633,
1820
+ "epoch": 3.499502487562189,
1821
+ "step": 1760
1822
+ },
1823
+ {
1824
+ "loss": 0.031986075639724734,
1825
+ "grad_norm": 0.5344582796096802,
1826
+ "learning_rate": 0.00015424498222114662,
1827
+ "entropy": 0.039489572704769674,
1828
+ "num_tokens": 11811048.0,
1829
+ "mean_token_accuracy": 0.9890580669045448,
1830
+ "epoch": 3.5194029850746267,
1831
+ "step": 1770
1832
+ },
1833
+ {
1834
+ "loss": 0.043090081214904784,
1835
+ "grad_norm": 0.3375915288925171,
1836
+ "learning_rate": 0.00015369144550911678,
1837
+ "entropy": 0.039671140746213494,
1838
+ "num_tokens": 11879773.0,
1839
+ "mean_token_accuracy": 0.9859576515853405,
1840
+ "epoch": 3.539303482587065,
1841
+ "step": 1780
1842
+ },
1843
+ {
1844
+ "loss": 0.03574670851230621,
1845
+ "grad_norm": 0.5646845698356628,
1846
+ "learning_rate": 0.0001531355876055078,
1847
+ "entropy": 0.04234636231994955,
1848
+ "num_tokens": 11946882.0,
1849
+ "mean_token_accuracy": 0.9891765132546425,
1850
+ "epoch": 3.5592039800995026,
1851
+ "step": 1790
1852
+ },
1853
+ {
1854
+ "loss": 0.03617365062236786,
1855
+ "grad_norm": 0.5281543731689453,
1856
+ "learning_rate": 0.00015257743254119973,
1857
+ "entropy": 0.03838658424501773,
1858
+ "num_tokens": 12014198.0,
1859
+ "mean_token_accuracy": 0.9879163481295109,
1860
+ "epoch": 3.5791044776119403,
1861
+ "step": 1800
1862
+ },
1863
+ {
1864
+ "loss": 0.02715664207935333,
1865
+ "grad_norm": 0.4327303171157837,
1866
+ "learning_rate": 0.00015201700444638348,
1867
+ "entropy": 0.035956174423336054,
1868
+ "num_tokens": 12080056.0,
1869
+ "mean_token_accuracy": 0.9888209789991379,
1870
+ "epoch": 3.599004975124378,
1871
+ "step": 1810
1872
+ },
1873
+ {
1874
+ "loss": 0.03283187747001648,
1875
+ "grad_norm": 0.6245374083518982,
1876
+ "learning_rate": 0.00015145432754951784,
1877
+ "entropy": 0.03530628806038294,
1878
+ "num_tokens": 12146900.0,
1879
+ "mean_token_accuracy": 0.9889325089752674,
1880
+ "epoch": 3.6189054726368157,
1881
+ "step": 1820
1882
+ },
1883
+ {
1884
+ "loss": 0.03508978486061096,
1885
+ "grad_norm": 0.8539674878120422,
1886
+ "learning_rate": 0.000150889426176282,
1887
+ "entropy": 0.03957471833855379,
1888
+ "num_tokens": 12213024.0,
1889
+ "mean_token_accuracy": 0.9876590810716153,
1890
+ "epoch": 3.638805970149254,
1891
+ "step": 1830
1892
+ },
1893
+ {
1894
+ "loss": 0.0289535254240036,
1895
+ "grad_norm": 0.44117090106010437,
1896
+ "learning_rate": 0.00015032232474852371,
1897
+ "entropy": 0.03894171481369994,
1898
+ "num_tokens": 12278205.0,
1899
+ "mean_token_accuracy": 0.9898740701377392,
1900
+ "epoch": 3.6587064676616916,
1901
+ "step": 1840
1902
+ },
1903
+ {
1904
+ "loss": 0.03545762598514557,
1905
+ "grad_norm": 0.5383766889572144,
1906
+ "learning_rate": 0.00014975304778320364,
1907
+ "entropy": 0.04185012882517185,
1908
+ "num_tokens": 12346281.0,
1909
+ "mean_token_accuracy": 0.987272110581398,
1910
+ "epoch": 3.6786069651741293,
1911
+ "step": 1850
1912
+ },
1913
+ {
1914
+ "loss": 0.036569598317146304,
1915
+ "grad_norm": 0.43862003087997437,
1916
+ "learning_rate": 0.00014918161989133552,
1917
+ "entropy": 0.039183757436694576,
1918
+ "num_tokens": 12416040.0,
1919
+ "mean_token_accuracy": 0.9884304039180278,
1920
+ "epoch": 3.698507462686567,
1921
+ "step": 1860
1922
+ },
1923
+ {
1924
+ "loss": 0.046497902274131774,
1925
+ "grad_norm": 0.24663235247135162,
1926
+ "learning_rate": 0.0001486080657769219,
1927
+ "entropy": 0.04875118255149573,
1928
+ "num_tokens": 12483739.0,
1929
+ "mean_token_accuracy": 0.9872626729309559,
1930
+ "epoch": 3.7184079601990048,
1931
+ "step": 1870
1932
+ },
1933
+ {
1934
+ "loss": 0.0350829690694809,
1935
+ "grad_norm": 0.27893203496932983,
1936
+ "learning_rate": 0.00014803241023588637,
1937
+ "entropy": 0.039400185630074705,
1938
+ "num_tokens": 12550264.0,
1939
+ "mean_token_accuracy": 0.9897375635802745,
1940
+ "epoch": 3.738308457711443,
1941
+ "step": 1880
1942
+ },
1943
+ {
1944
+ "loss": 0.048194342851638795,
1945
+ "grad_norm": 0.5404137372970581,
1946
+ "learning_rate": 0.00014745467815500157,
1947
+ "entropy": 0.045675123430555686,
1948
+ "num_tokens": 12615635.0,
1949
+ "mean_token_accuracy": 0.9822327814996242,
1950
+ "epoch": 3.7582089552238807,
1951
+ "step": 1890
1952
+ },
1953
+ {
1954
+ "loss": 0.041299638152122495,
1955
+ "grad_norm": 0.22043873369693756,
1956
+ "learning_rate": 0.0001468748945108131,
1957
+ "entropy": 0.0417529508471489,
1958
+ "num_tokens": 12682762.0,
1959
+ "mean_token_accuracy": 0.9876552060246467,
1960
+ "epoch": 3.7781094527363184,
1961
+ "step": 1900
1962
+ },
1963
+ {
1964
+ "loss": 0.03528775572776795,
1965
+ "grad_norm": 0.38801971077919006,
1966
+ "learning_rate": 0.00014629308436856,
1967
+ "entropy": 0.0380144338007085,
1968
+ "num_tokens": 12749704.0,
1969
+ "mean_token_accuracy": 0.988120187819004,
1970
+ "epoch": 3.798009950248756,
1971
+ "step": 1910
1972
+ },
1973
+ {
1974
+ "loss": 0.028483673930168152,
1975
+ "grad_norm": 0.7580603957176208,
1976
+ "learning_rate": 0.0001457092728810909,
1977
+ "entropy": 0.036843240825692194,
1978
+ "num_tokens": 12815360.0,
1979
+ "mean_token_accuracy": 0.9913376808166504,
1980
+ "epoch": 3.817910447761194,
1981
+ "step": 1920
1982
+ },
1983
+ {
1984
+ "loss": 0.034877949953079225,
1985
+ "grad_norm": 0.41240543127059937,
1986
+ "learning_rate": 0.00014512348528777675,
1987
+ "entropy": 0.03646660551312379,
1988
+ "num_tokens": 12883173.0,
1989
+ "mean_token_accuracy": 0.991103533655405,
1990
+ "epoch": 3.837810945273632,
1991
+ "step": 1930
1992
+ },
1993
+ {
1994
+ "loss": 0.02729986608028412,
1995
+ "grad_norm": 0.431193470954895,
1996
+ "learning_rate": 0.00014453574691341957,
1997
+ "entropy": 0.03418905301514315,
1998
+ "num_tokens": 12949048.0,
1999
+ "mean_token_accuracy": 0.9920941665768623,
2000
+ "epoch": 3.8577114427860697,
2001
+ "step": 1940
2002
+ },
2003
+ {
2004
+ "loss": 0.03583741784095764,
2005
+ "grad_norm": 0.8341835737228394,
2006
+ "learning_rate": 0.00014394608316715764,
2007
+ "entropy": 0.0317019106762018,
2008
+ "num_tokens": 13017021.0,
2009
+ "mean_token_accuracy": 0.9879241831600666,
2010
+ "epoch": 3.8776119402985074,
2011
+ "step": 1950
2012
+ },
2013
+ {
2014
+ "loss": 0.04165915548801422,
2015
+ "grad_norm": 0.54258793592453,
2016
+ "learning_rate": 0.00014335451954136712,
2017
+ "entropy": 0.04781383575173095,
2018
+ "num_tokens": 13084247.0,
2019
+ "mean_token_accuracy": 0.9850596696138382,
2020
+ "epoch": 3.897512437810945,
2021
+ "step": 1960
2022
+ },
2023
+ {
2024
+ "loss": 0.023919902741909027,
2025
+ "grad_norm": 1.1518906354904175,
2026
+ "learning_rate": 0.00014276108161055977,
2027
+ "entropy": 0.03323271934641525,
2028
+ "num_tokens": 13149886.0,
2029
+ "mean_token_accuracy": 0.9917417526245117,
2030
+ "epoch": 3.917412935323383,
2031
+ "step": 1970
2032
+ },
2033
+ {
2034
+ "loss": 0.041414502263069156,
2035
+ "grad_norm": 0.4409993588924408,
2036
+ "learning_rate": 0.00014216579503027748,
2037
+ "entropy": 0.04212225944211241,
2038
+ "num_tokens": 13216848.0,
2039
+ "mean_token_accuracy": 0.987069496512413,
2040
+ "epoch": 3.937313432835821,
2041
+ "step": 1980
2042
+ },
2043
+ {
2044
+ "loss": 0.026138466596603394,
2045
+ "grad_norm": 0.4671242833137512,
2046
+ "learning_rate": 0.000141568685535983,
2047
+ "entropy": 0.03499636381748132,
2048
+ "num_tokens": 13282491.0,
2049
+ "mean_token_accuracy": 0.9915538854897022,
2050
+ "epoch": 3.9572139303482587,
2051
+ "step": 1990
2052
+ },
2053
+ {
2054
+ "loss": 0.03617530465126038,
2055
+ "grad_norm": 0.6693828105926514,
2056
+ "learning_rate": 0.00014096977894194741,
2057
+ "entropy": 0.03698443787143333,
2058
+ "num_tokens": 13351431.0,
2059
+ "mean_token_accuracy": 0.9893846169114113,
2060
+ "epoch": 3.9771144278606965,
2061
+ "step": 2000
2062
+ },
2063
+ {
2064
+ "loss": 0.04186029434204101,
2065
+ "grad_norm": 0.6782835721969604,
2066
+ "learning_rate": 0.0001403691011401342,
2067
+ "entropy": 0.04769496822264045,
2068
+ "num_tokens": 13418199.0,
2069
+ "mean_token_accuracy": 0.9833127044141292,
2070
+ "epoch": 3.997014925373134,
2071
+ "step": 2010
2072
+ },
2073
+ {
2074
+ "eval_loss": 0.29686856269836426,
2075
+ "eval_runtime": 67.8045,
2076
+ "eval_samples_per_second": 15.264,
2077
+ "eval_steps_per_second": 7.64,
2078
+ "eval_entropy": 0.08914197777698184,
2079
+ "eval_num_tokens": 13427944.0,
2080
+ "eval_mean_token_accuracy": 0.9404666641274014,
2081
+ "epoch": 4.0,
2082
+ "step": 2012
2083
+ },
2084
+ {
2085
+ "loss": 0.022541260719299315,
2086
+ "grad_norm": 0.330778032541275,
2087
+ "learning_rate": 0.00013976667809907967,
2088
+ "entropy": 0.03496060195673061,
2089
+ "num_tokens": 13480426.0,
2090
+ "mean_token_accuracy": 0.992155635827466,
2091
+ "epoch": 4.01592039800995,
2092
+ "step": 2020
2093
+ },
2094
+ {
2095
+ "loss": 0.020323292911052705,
2096
+ "grad_norm": 0.6635566353797913,
2097
+ "learning_rate": 0.00013916253586277046,
2098
+ "entropy": 0.025642355805030093,
2099
+ "num_tokens": 13548017.0,
2100
+ "mean_token_accuracy": 0.9932406023144722,
2101
+ "epoch": 4.035820895522388,
2102
+ "step": 2030
2103
+ },
2104
+ {
2105
+ "loss": 0.018497467041015625,
2106
+ "grad_norm": 0.3545978367328644,
2107
+ "learning_rate": 0.00013855670054951764,
2108
+ "entropy": 0.02235944996937178,
2109
+ "num_tokens": 13615907.0,
2110
+ "mean_token_accuracy": 0.9940000854432582,
2111
+ "epoch": 4.055721393034826,
2112
+ "step": 2040
2113
+ },
2114
+ {
2115
+ "loss": 0.016379858553409576,
2116
+ "grad_norm": 0.333023339509964,
2117
+ "learning_rate": 0.00013794919835082733,
2118
+ "entropy": 0.02085629914072342,
2119
+ "num_tokens": 13682334.0,
2120
+ "mean_token_accuracy": 0.9944917172193527,
2121
+ "epoch": 4.075621890547263,
2122
+ "step": 2050
2123
+ },
2124
+ {
2125
+ "loss": 0.025261417031288147,
2126
+ "grad_norm": 0.4259703457355499,
2127
+ "learning_rate": 0.00013734005553026863,
2128
+ "entropy": 0.022779430758964735,
2129
+ "num_tokens": 13750009.0,
2130
+ "mean_token_accuracy": 0.9915114663541317,
2131
+ "epoch": 4.095522388059702,
2132
+ "step": 2060
2133
+ },
2134
+ {
2135
+ "loss": 0.020985141396522522,
2136
+ "grad_norm": 0.5059815645217896,
2137
+ "learning_rate": 0.00013672929842233807,
2138
+ "entropy": 0.030157123084063642,
2139
+ "num_tokens": 13816528.0,
2140
+ "mean_token_accuracy": 0.9944588914513588,
2141
+ "epoch": 4.115422885572139,
2142
+ "step": 2070
2143
+ },
2144
+ {
2145
+ "loss": 0.019122378528118135,
2146
+ "grad_norm": 0.27580463886260986,
2147
+ "learning_rate": 0.00013611695343132118,
2148
+ "entropy": 0.023731828895688523,
2149
+ "num_tokens": 13883127.0,
2150
+ "mean_token_accuracy": 0.9933131754398346,
2151
+ "epoch": 4.135323383084577,
2152
+ "step": 2080
2153
+ },
2154
+ {
2155
+ "loss": 0.018794278800487518,
2156
+ "grad_norm": 0.4173099994659424,
2157
+ "learning_rate": 0.00013550304703015083,
2158
+ "entropy": 0.02200460991152795,
2159
+ "num_tokens": 13949694.0,
2160
+ "mean_token_accuracy": 0.993462772667408,
2161
+ "epoch": 4.155223880597015,
2162
+ "step": 2090
2163
+ },
2164
+ {
2165
+ "loss": 0.022590236365795137,
2166
+ "grad_norm": 0.2273045778274536,
2167
+ "learning_rate": 0.000134887605759263,
2168
+ "entropy": 0.028880356659647076,
2169
+ "num_tokens": 14016869.0,
2170
+ "mean_token_accuracy": 0.9921673700213433,
2171
+ "epoch": 4.1751243781094525,
2172
+ "step": 2100
2173
+ },
2174
+ {
2175
+ "loss": 0.028038790822029112,
2176
+ "grad_norm": 0.3150612413883209,
2177
+ "learning_rate": 0.00013427065622544914,
2178
+ "entropy": 0.029227956954855472,
2179
+ "num_tokens": 14082895.0,
2180
+ "mean_token_accuracy": 0.9920774199068546,
2181
+ "epoch": 4.195024875621891,
2182
+ "step": 2110
2183
+ },
2184
+ {
2185
+ "loss": 0.02197175920009613,
2186
+ "grad_norm": 0.4716366231441498,
2187
+ "learning_rate": 0.0001336522251007061,
2188
+ "entropy": 0.026419853966217488,
2189
+ "num_tokens": 14148483.0,
2190
+ "mean_token_accuracy": 0.9921677350997925,
2191
+ "epoch": 4.214925373134328,
2192
+ "step": 2120
2193
+ },
2194
+ {
2195
+ "loss": 0.019603276252746583,
2196
+ "grad_norm": 0.6820113062858582,
2197
+ "learning_rate": 0.00013303233912108283,
2198
+ "entropy": 0.023932285644696093,
2199
+ "num_tokens": 14214410.0,
2200
+ "mean_token_accuracy": 0.9929466463625432,
2201
+ "epoch": 4.234825870646766,
2202
+ "step": 2130
2203
+ },
2204
+ {
2205
+ "loss": 0.02161734998226166,
2206
+ "grad_norm": 0.5260307788848877,
2207
+ "learning_rate": 0.00013241102508552475,
2208
+ "entropy": 0.023090845490514766,
2209
+ "num_tokens": 14281433.0,
2210
+ "mean_token_accuracy": 0.9935616083443165,
2211
+ "epoch": 4.254726368159204,
2212
+ "step": 2140
2213
+ },
2214
+ {
2215
+ "loss": 0.020520062744617464,
2216
+ "grad_norm": 0.5381481051445007,
2217
+ "learning_rate": 0.00013178830985471505,
2218
+ "entropy": 0.0253336504829349,
2219
+ "num_tokens": 14347059.0,
2220
+ "mean_token_accuracy": 0.9924183614552021,
2221
+ "epoch": 4.2746268656716415,
2222
+ "step": 2150
2223
+ },
2224
+ {
2225
+ "loss": 0.02292156219482422,
2226
+ "grad_norm": 0.4821164906024933,
2227
+ "learning_rate": 0.00013116422034991347,
2228
+ "entropy": 0.023389648927695815,
2229
+ "num_tokens": 14412949.0,
2230
+ "mean_token_accuracy": 0.9910940513014793,
2231
+ "epoch": 4.29452736318408,
2232
+ "step": 2160
2233
+ },
2234
+ {
2235
+ "loss": 0.020588286221027374,
2236
+ "grad_norm": 0.314314067363739,
2237
+ "learning_rate": 0.00013053878355179244,
2238
+ "entropy": 0.028456786752212793,
2239
+ "num_tokens": 14479732.0,
2240
+ "mean_token_accuracy": 0.9933287680149079,
2241
+ "epoch": 4.314427860696517,
2242
+ "step": 2170
2243
+ },
2244
+ {
2245
+ "loss": 0.022340704500675202,
2246
+ "grad_norm": 0.1762777715921402,
2247
+ "learning_rate": 0.00012991202649927056,
2248
+ "entropy": 0.024215608432132284,
2249
+ "num_tokens": 14547229.0,
2250
+ "mean_token_accuracy": 0.993473107367754,
2251
+ "epoch": 4.334328358208955,
2252
+ "step": 2180
2253
+ },
2254
+ {
2255
+ "loss": 0.01929643303155899,
2256
+ "grad_norm": 0.5308461785316467,
2257
+ "learning_rate": 0.00012928397628834395,
2258
+ "entropy": 0.022466996918956282,
2259
+ "num_tokens": 14615321.0,
2260
+ "mean_token_accuracy": 0.9933658391237259,
2261
+ "epoch": 4.354228855721393,
2262
+ "step": 2190
2263
+ },
2264
+ {
2265
+ "loss": 0.01675943285226822,
2266
+ "grad_norm": 0.2166927307844162,
2267
+ "learning_rate": 0.0001286546600709144,
2268
+ "entropy": 0.02382153325015679,
2269
+ "num_tokens": 14681484.0,
2270
+ "mean_token_accuracy": 0.9929957866668702,
2271
+ "epoch": 4.374129353233831,
2272
+ "step": 2200
2273
+ },
2274
+ {
2275
+ "loss": 0.01616147756576538,
2276
+ "grad_norm": 0.31190088391304016,
2277
+ "learning_rate": 0.00012802410505361592,
2278
+ "entropy": 0.021566898842866066,
2279
+ "num_tokens": 14748246.0,
2280
+ "mean_token_accuracy": 0.9953425668179989,
2281
+ "epoch": 4.394029850746269,
2282
+ "step": 2210
2283
+ },
2284
+ {
2285
+ "loss": 0.020143616199493408,
2286
+ "grad_norm": 0.5401660799980164,
2287
+ "learning_rate": 0.0001273923384966383,
2288
+ "entropy": 0.019891528951120563,
2289
+ "num_tokens": 14815008.0,
2290
+ "mean_token_accuracy": 0.9928821548819542,
2291
+ "epoch": 4.413930348258706,
2292
+ "step": 2220
2293
+ },
2294
+ {
2295
+ "loss": 0.023275299370288847,
2296
+ "grad_norm": 0.5358554720878601,
2297
+ "learning_rate": 0.00012675938771254872,
2298
+ "entropy": 0.027829346724320202,
2299
+ "num_tokens": 14880257.0,
2300
+ "mean_token_accuracy": 0.9924751475453377,
2301
+ "epoch": 4.433830845771144,
2302
+ "step": 2230
2303
+ },
2304
+ {
2305
+ "loss": 0.018383045494556428,
2306
+ "grad_norm": 0.30791008472442627,
2307
+ "learning_rate": 0.00012612528006511093,
2308
+ "entropy": 0.01990911388711538,
2309
+ "num_tokens": 14946824.0,
2310
+ "mean_token_accuracy": 0.9936320453882217,
2311
+ "epoch": 4.453731343283582,
2312
+ "step": 2240
2313
+ },
2314
+ {
2315
+ "loss": 0.018728886544704438,
2316
+ "grad_norm": 0.4665677547454834,
2317
+ "learning_rate": 0.0001254900429681023,
2318
+ "entropy": 0.02076636096899165,
2319
+ "num_tokens": 15012580.0,
2320
+ "mean_token_accuracy": 0.9947231650352478,
2321
+ "epoch": 4.47363184079602,
2322
+ "step": 2250
2323
+ },
2324
+ {
2325
+ "loss": 0.02189120650291443,
2326
+ "grad_norm": 0.22175736725330353,
2327
+ "learning_rate": 0.0001248537038841285,
2328
+ "entropy": 0.025514183560881067,
2329
+ "num_tokens": 15078417.0,
2330
+ "mean_token_accuracy": 0.9927590176463127,
2331
+ "epoch": 4.493532338308458,
2332
+ "step": 2260
2333
+ },
2334
+ {
2335
+ "loss": 0.018778012692928316,
2336
+ "grad_norm": 0.37904441356658936,
2337
+ "learning_rate": 0.0001242162903234365,
2338
+ "entropy": 0.024176929768873378,
2339
+ "num_tokens": 15145267.0,
2340
+ "mean_token_accuracy": 0.9923839196562767,
2341
+ "epoch": 4.513432835820895,
2342
+ "step": 2270
2343
+ },
2344
+ {
2345
+ "loss": 0.021106557548046113,
2346
+ "grad_norm": 0.4318683445453644,
2347
+ "learning_rate": 0.00012357782984272504,
2348
+ "entropy": 0.017634534194803562,
2349
+ "num_tokens": 15211816.0,
2350
+ "mean_token_accuracy": 0.9937898091971874,
2351
+ "epoch": 4.533333333333333,
2352
+ "step": 2280
2353
+ },
2354
+ {
2355
+ "loss": 0.015814051032066345,
2356
+ "grad_norm": 0.24642682075500488,
2357
+ "learning_rate": 0.0001229383500439534,
2358
+ "entropy": 0.020605951044126415,
2359
+ "num_tokens": 15278462.0,
2360
+ "mean_token_accuracy": 0.9958261914551259,
2361
+ "epoch": 4.553233830845771,
2362
+ "step": 2290
2363
+ },
2364
+ {
2365
+ "loss": 0.01898970454931259,
2366
+ "grad_norm": 0.3638794422149658,
2367
+ "learning_rate": 0.00012229787857314801,
2368
+ "entropy": 0.020515447400248375,
2369
+ "num_tokens": 15346966.0,
2370
+ "mean_token_accuracy": 0.9943824775516987,
2371
+ "epoch": 4.573134328358209,
2372
+ "step": 2300
2373
+ },
2374
+ {
2375
+ "loss": 0.01712157726287842,
2376
+ "grad_norm": 0.287197470664978,
2377
+ "learning_rate": 0.00012165644311920741,
2378
+ "entropy": 0.019921001550392246,
2379
+ "num_tokens": 15414059.0,
2380
+ "mean_token_accuracy": 0.9939340233802796,
2381
+ "epoch": 4.593034825870647,
2382
+ "step": 2310
2383
+ },
2384
+ {
2385
+ "loss": 0.029004442691802978,
2386
+ "grad_norm": 0.613610565662384,
2387
+ "learning_rate": 0.000121014071412705,
2388
+ "entropy": 0.03135428504901938,
2389
+ "num_tokens": 15479736.0,
2390
+ "mean_token_accuracy": 0.9910656772553921,
2391
+ "epoch": 4.612935323383084,
2392
+ "step": 2320
2393
+ },
2394
+ {
2395
+ "loss": 0.02000347375869751,
2396
+ "grad_norm": 0.5387656092643738,
2397
+ "learning_rate": 0.00012037079122469044,
2398
+ "entropy": 0.02796420800877968,
2399
+ "num_tokens": 15546436.0,
2400
+ "mean_token_accuracy": 0.9945271402597428,
2401
+ "epoch": 4.632835820895522,
2402
+ "step": 2330
2403
+ },
2404
+ {
2405
+ "loss": 0.02363658994436264,
2406
+ "grad_norm": 0.3635019361972809,
2407
+ "learning_rate": 0.00011972663036548884,
2408
+ "entropy": 0.022651451456476936,
2409
+ "num_tokens": 15612938.0,
2410
+ "mean_token_accuracy": 0.9910245075821876,
2411
+ "epoch": 4.65273631840796,
2412
+ "step": 2340
2413
+ },
2414
+ {
2415
+ "loss": 0.023246921598911285,
2416
+ "grad_norm": 0.25204190611839294,
2417
+ "learning_rate": 0.0001190816166834985,
2418
+ "entropy": 0.027166575644514523,
2419
+ "num_tokens": 15681309.0,
2420
+ "mean_token_accuracy": 0.9916775986552239,
2421
+ "epoch": 4.672636815920398,
2422
+ "step": 2350
2423
+ },
2424
+ {
2425
+ "loss": 0.020346690714359284,
2426
+ "grad_norm": 0.37856990098953247,
2427
+ "learning_rate": 0.00011843577806398705,
2428
+ "entropy": 0.025465619296301156,
2429
+ "num_tokens": 15749150.0,
2430
+ "mean_token_accuracy": 0.9934266820549965,
2431
+ "epoch": 4.692537313432836,
2432
+ "step": 2360
2433
+ },
2434
+ {
2435
+ "loss": 0.022995509207248688,
2436
+ "grad_norm": 0.3728092610836029,
2437
+ "learning_rate": 0.00011778914242788588,
2438
+ "entropy": 0.02361324623489054,
2439
+ "num_tokens": 15815098.0,
2440
+ "mean_token_accuracy": 0.9924490824341774,
2441
+ "epoch": 4.712437810945273,
2442
+ "step": 2370
2443
+ },
2444
+ {
2445
+ "loss": 0.024149328470230103,
2446
+ "grad_norm": 0.44309478998184204,
2447
+ "learning_rate": 0.00011714173773058304,
2448
+ "entropy": 0.023943239758955313,
2449
+ "num_tokens": 15882589.0,
2450
+ "mean_token_accuracy": 0.9915248282253742,
2451
+ "epoch": 4.732338308457711,
2452
+ "step": 2380
2453
+ },
2454
+ {
2455
+ "loss": 0.02506372332572937,
2456
+ "grad_norm": 0.4280659556388855,
2457
+ "learning_rate": 0.00011649359196071459,
2458
+ "entropy": 0.027685758270672524,
2459
+ "num_tokens": 15947514.0,
2460
+ "mean_token_accuracy": 0.9927876427769661,
2461
+ "epoch": 4.7522388059701495,
2462
+ "step": 2390
2463
+ },
2464
+ {
2465
+ "loss": 0.01892734318971634,
2466
+ "grad_norm": 0.1368793547153473,
2467
+ "learning_rate": 0.00011584473313895483,
2468
+ "entropy": 0.02604678466304904,
2469
+ "num_tokens": 16015196.0,
2470
+ "mean_token_accuracy": 0.9935356914997101,
2471
+ "epoch": 4.772139303482587,
2472
+ "step": 2400
2473
+ },
2474
+ {
2475
+ "loss": 0.022761589288711546,
2476
+ "grad_norm": 0.2650626301765442,
2477
+ "learning_rate": 0.00011519518931680463,
2478
+ "entropy": 0.02288266723626293,
2479
+ "num_tokens": 16084048.0,
2480
+ "mean_token_accuracy": 0.9923152230679989,
2481
+ "epoch": 4.792039800995025,
2482
+ "step": 2410
2483
+ },
2484
+ {
2485
+ "loss": 0.02219443619251251,
2486
+ "grad_norm": 0.28764352202415466,
2487
+ "learning_rate": 0.00011454498857537893,
2488
+ "entropy": 0.021520700085238785,
2489
+ "num_tokens": 16151465.0,
2490
+ "mean_token_accuracy": 0.9929785504937172,
2491
+ "epoch": 4.811940298507462,
2492
+ "step": 2420
2493
+ },
2494
+ {
2495
+ "loss": 0.01702689528465271,
2496
+ "grad_norm": 0.265876442193985,
2497
+ "learning_rate": 0.00011389415902419251,
2498
+ "entropy": 0.022896296047838403,
2499
+ "num_tokens": 16219886.0,
2500
+ "mean_token_accuracy": 0.9943966299295426,
2501
+ "epoch": 4.8318407960199,
2502
+ "step": 2430
2503
+ },
2504
+ {
2505
+ "loss": 0.02124347984790802,
2506
+ "grad_norm": 0.4632825255393982,
2507
+ "learning_rate": 0.00011324272879994509,
2508
+ "entropy": 0.024235972843598574,
2509
+ "num_tokens": 16286732.0,
2510
+ "mean_token_accuracy": 0.9925971522927284,
2511
+ "epoch": 4.8517412935323385,
2512
+ "step": 2440
2513
+ },
2514
+ {
2515
+ "loss": 0.02112184017896652,
2516
+ "grad_norm": 0.7702906131744385,
2517
+ "learning_rate": 0.00011259072606530452,
2518
+ "entropy": 0.02376203608873766,
2519
+ "num_tokens": 16353324.0,
2520
+ "mean_token_accuracy": 0.9932762250304222,
2521
+ "epoch": 4.871641791044776,
2522
+ "step": 2450
2523
+ },
2524
+ {
2525
+ "loss": 0.020696014165878296,
2526
+ "grad_norm": 0.43466606736183167,
2527
+ "learning_rate": 0.0001119381790076896,
2528
+ "entropy": 0.020602873369352893,
2529
+ "num_tokens": 16420045.0,
2530
+ "mean_token_accuracy": 0.9940371952950955,
2531
+ "epoch": 4.891542288557214,
2532
+ "step": 2460
2533
+ },
2534
+ {
2535
+ "loss": 0.02507336139678955,
2536
+ "grad_norm": 0.7223814725875854,
2537
+ "learning_rate": 0.00011128511583805122,
2538
+ "entropy": 0.026875402212681365,
2539
+ "num_tokens": 16487489.0,
2540
+ "mean_token_accuracy": 0.9920289881527424,
2541
+ "epoch": 4.911442786069652,
2542
+ "step": 2470
2543
+ },
2544
+ {
2545
+ "loss": 0.026432156562805176,
2546
+ "grad_norm": 0.47006839513778687,
2547
+ "learning_rate": 0.00011063156478965293,
2548
+ "entropy": 0.03200415483734105,
2549
+ "num_tokens": 16556385.0,
2550
+ "mean_token_accuracy": 0.9915605559945107,
2551
+ "epoch": 4.931343283582089,
2552
+ "step": 2480
2553
+ },
2554
+ {
2555
+ "loss": 0.019228325784206392,
2556
+ "grad_norm": 0.6098710298538208,
2557
+ "learning_rate": 0.00010997755411685022,
2558
+ "entropy": 0.021561289162491448,
2559
+ "num_tokens": 16622218.0,
2560
+ "mean_token_accuracy": 0.9942485235631466,
2561
+ "epoch": 4.951243781094528,
2562
+ "step": 2490
2563
+ },
2564
+ {
2565
+ "loss": 0.02225508540868759,
2566
+ "grad_norm": 0.6580213904380798,
2567
+ "learning_rate": 0.0001093231120938692,
2568
+ "entropy": 0.025235205114586278,
2569
+ "num_tokens": 16688229.0,
2570
+ "mean_token_accuracy": 0.992252241820097,
2571
+ "epoch": 4.971144278606965,
2572
+ "step": 2500
2573
+ },
2574
+ {
2575
+ "loss": 0.02393328994512558,
2576
+ "grad_norm": 0.2273155003786087,
2577
+ "learning_rate": 0.000108668267013584,
2578
+ "entropy": 0.02115868393520941,
2579
+ "num_tokens": 16755861.0,
2580
+ "mean_token_accuracy": 0.9941031068563462,
2581
+ "epoch": 4.991044776119403,
2582
+ "step": 2510
2583
+ },
2584
+ {
2585
+ "eval_loss": 0.3079036474227905,
2586
+ "eval_runtime": 67.1765,
2587
+ "eval_samples_per_second": 15.407,
2588
+ "eval_steps_per_second": 7.711,
2589
+ "eval_entropy": 0.07137546143402403,
2590
+ "eval_num_tokens": 16784930.0,
2591
+ "eval_mean_token_accuracy": 0.9430849159776474,
2592
+ "epoch": 5.0,
2593
+ "step": 2515
2594
+ },
2595
+ {
2596
+ "train_runtime": 8534.0451,
2597
+ "train_samples_per_second": 9.421,
2598
+ "train_steps_per_second": 0.589,
2599
+ "total_flos": 3.4880192385122304e+16,
2600
+ "train_loss": 0.10587940257242612,
2601
+ "epoch": 5.0,
2602
+ "step": 2515
2603
+ },
2604
+ {
2605
+ "eval_loss": 0.24770455062389374,
2606
+ "eval_runtime": 67.4582,
2607
+ "eval_samples_per_second": 15.343,
2608
+ "eval_steps_per_second": 7.679,
2609
+ "eval_entropy": 0.13267684354209502,
2610
+ "eval_num_tokens": 16784930.0,
2611
+ "eval_mean_token_accuracy": 0.9410935246806347,
2612
+ "epoch": 5.0,
2613
+ "step": 2515
2614
+ }
2615
+ ]
2616
+ }
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,11 @@
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "backend": "tokenizers",
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "is_local": true,
7
+ "model_max_length": 2048,
8
+ "pad_token": "<|endoftext|>",
9
+ "tokenizer_class": "TokenizersBackend",
10
+ "unk_token": "<|endoftext|>"
11
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2350592d6176e1137e9e5000ddaae8bcace4a32263a7e4abe5cae8ea3d5bbe86
3
+ size 5841