Video-Text-to-Text
Transformers
Safetensors
qwen3_vl
image-text-to-text
llama-factory
full
Generated from Trainer
video-language-model
video-captioning
Instructions to use chancharikm/CHAI_SFT_model_8b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use chancharikm/CHAI_SFT_model_8b with Transformers:
# Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("chancharikm/CHAI_SFT_model_8b") model = AutoModelForMultimodalLM.from_pretrained("chancharikm/CHAI_SFT_model_8b", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Training in progress, step 700, checkpoint
Browse files- last-checkpoint/global_step700/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_0_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_1_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_2_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_3_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_4_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_5_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_6_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/global_step700/zero_pp_rank_7_mp_rank_00_model_states.pt +3 -0
- last-checkpoint/latest +1 -1
- last-checkpoint/model-00001-of-00004.safetensors +1 -1
- last-checkpoint/model-00002-of-00004.safetensors +1 -1
- last-checkpoint/model-00003-of-00004.safetensors +1 -1
- last-checkpoint/model-00004-of-00004.safetensors +1 -1
- last-checkpoint/scheduler.pt +1 -1
- last-checkpoint/trainer_state.json +353 -3
last-checkpoint/global_step700/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f671189f043ff1359c6b1522944efdf619a75bd011b8cf9826473294fe6e49aa
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7c826a4ea99a48baddbc314f16ba6b70d80111819aab8145b26ec4260d1980fa
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:dc6bfcdc42ef72b382081f00b50c227d8cabdca9da51c1219d36787e188b069b
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:00d9c95d60c06442da594c838a052a7bc698d7a38e661ab52cdfabe3fb62d1ec
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3144ac0c1babd6fbbe170f3e6d128aacc4491e99b9f0f1a46b5b9e7f1042ec8a
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bf61ba4ab10f1c2685fadc20811d95641609c43ce3b1a28cd5137816056e8280
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7dc59e4f594616e8bef878142b6fed63783b5c160810632ec96d9ba408f4bf77
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:25b10de9dc9a124bc3a55e9f1ef7e5434d1864532564341c6a8fd98bc9b3e035
|
| 3 |
+
size 1558836997
|
last-checkpoint/global_step700/zero_pp_rank_0_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f7d2eaa495a913f2ac0fcd672b9e2fedc63b98d0f3f97a2d8de29bf4b4448792
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_1_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4d8622b17db5b6b5090bdf619dc710bc677d4700741b7a2aa5b481eefb0f6ac0
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_2_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:6a2f523cfb96bb252882d9a93a1236cc688c608c91e6461cc7d39122be9f362e
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_3_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:febdc81882b2fe5a999a7b4b2c72bc5c9eb727548767173cc21b3a95a41c008c
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_4_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e276d0a64d79ee69a68864870dff9a102dd9e4376a1ef01b92bb819e76d299d3
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_5_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:198803e0763e11b2f8160d537de3208ff9c60705918517559aa735b16406f0ca
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_6_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f03bca29f89637e2505c9d8d358a7ef4ffdd25a8fea9cd296667e2f4d2206e18
|
| 3 |
+
size 14663005
|
last-checkpoint/global_step700/zero_pp_rank_7_mp_rank_00_model_states.pt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bf140a92bb60bda69a13d477f905ac1a1e43cf1d211fc3115e9fdfc7b1773a71
|
| 3 |
+
size 14663005
|
last-checkpoint/latest
CHANGED
|
@@ -1 +1 @@
|
|
| 1 |
-
|
|
|
|
| 1 |
+
global_step700
|
last-checkpoint/model-00001-of-00004.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 4998056552
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4801dfb1de5603d9fd86e66233f71fd69b7514a405be533d0560a10ac2232701
|
| 3 |
size 4998056552
|
last-checkpoint/model-00002-of-00004.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 4915962464
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ae2e98b4e0719324774a26fb6680623e8fc7671467315c0748ef1e7d0b4119ba
|
| 3 |
size 4915962464
|
last-checkpoint/model-00003-of-00004.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 4915962496
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:65839ff8d08fd3e1453b2209252309b7ea1b5d1d54c3d0005a4d9ff668c67d99
|
| 3 |
size 4915962496
|
last-checkpoint/model-00004-of-00004.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 2704357976
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e606573eedf3be0faded56cd50dd9d1206aada29ef5973f67584c3bbf371fc0d
|
| 3 |
size 2704357976
|
last-checkpoint/scheduler.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 1465
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:52c60310c79aedc98d1b85ec51f9670b286af151f72286d16d7d60189e2aebd3
|
| 3 |
size 1465
|
last-checkpoint/trainer_state.json
CHANGED
|
@@ -2,9 +2,9 @@
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
-
"epoch": 2.
|
| 6 |
"eval_steps": 500,
|
| 7 |
-
"global_step":
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
@@ -4558,6 +4558,356 @@
|
|
| 4558 |
"learning_rate": 1.2499710658584296e-06,
|
| 4559 |
"loss": 0.0108,
|
| 4560 |
"step": 650
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 4561 |
}
|
| 4562 |
],
|
| 4563 |
"logging_steps": 1,
|
|
@@ -4577,7 +4927,7 @@
|
|
| 4577 |
"attributes": {}
|
| 4578 |
}
|
| 4579 |
},
|
| 4580 |
-
"total_flos":
|
| 4581 |
"train_batch_size": 10,
|
| 4582 |
"trial_name": null,
|
| 4583 |
"trial_params": null
|
|
|
|
| 2 |
"best_global_step": null,
|
| 3 |
"best_metric": null,
|
| 4 |
"best_model_checkpoint": null,
|
| 5 |
+
"epoch": 2.8356997971602436,
|
| 6 |
"eval_steps": 500,
|
| 7 |
+
"global_step": 700,
|
| 8 |
"is_hyper_param_search": false,
|
| 9 |
"is_local_process_zero": true,
|
| 10 |
"is_world_process_zero": true,
|
|
|
|
| 4558 |
"learning_rate": 1.2499710658584296e-06,
|
| 4559 |
"loss": 0.0108,
|
| 4560 |
"step": 650
|
| 4561 |
+
},
|
| 4562 |
+
{
|
| 4563 |
+
"epoch": 2.636916835699797,
|
| 4564 |
+
"grad_norm": 0.31247533393817645,
|
| 4565 |
+
"learning_rate": 1.2233190101337644e-06,
|
| 4566 |
+
"loss": 0.0126,
|
| 4567 |
+
"step": 651
|
| 4568 |
+
},
|
| 4569 |
+
{
|
| 4570 |
+
"epoch": 2.640973630831643,
|
| 4571 |
+
"grad_norm": 0.23703695879461487,
|
| 4572 |
+
"learning_rate": 1.1969420812583603e-06,
|
| 4573 |
+
"loss": 0.0113,
|
| 4574 |
+
"step": 652
|
| 4575 |
+
},
|
| 4576 |
+
{
|
| 4577 |
+
"epoch": 2.6450304259634887,
|
| 4578 |
+
"grad_norm": 0.29797798103465356,
|
| 4579 |
+
"learning_rate": 1.1708408059919901e-06,
|
| 4580 |
+
"loss": 0.0139,
|
| 4581 |
+
"step": 653
|
| 4582 |
+
},
|
| 4583 |
+
{
|
| 4584 |
+
"epoch": 2.6490872210953347,
|
| 4585 |
+
"grad_norm": 3.139650970793164,
|
| 4586 |
+
"learning_rate": 1.145015705589491e-06,
|
| 4587 |
+
"loss": 0.0112,
|
| 4588 |
+
"step": 654
|
| 4589 |
+
},
|
| 4590 |
+
{
|
| 4591 |
+
"epoch": 2.6531440162271807,
|
| 4592 |
+
"grad_norm": 0.2405246638894348,
|
| 4593 |
+
"learning_rate": 1.119467295790363e-06,
|
| 4594 |
+
"loss": 0.011,
|
| 4595 |
+
"step": 655
|
| 4596 |
+
},
|
| 4597 |
+
{
|
| 4598 |
+
"epoch": 2.6572008113590266,
|
| 4599 |
+
"grad_norm": 0.24093581404167375,
|
| 4600 |
+
"learning_rate": 1.0941960868084549e-06,
|
| 4601 |
+
"loss": 0.0108,
|
| 4602 |
+
"step": 656
|
| 4603 |
+
},
|
| 4604 |
+
{
|
| 4605 |
+
"epoch": 2.661257606490872,
|
| 4606 |
+
"grad_norm": 1.4166321141255014,
|
| 4607 |
+
"learning_rate": 1.06920258332179e-06,
|
| 4608 |
+
"loss": 0.0092,
|
| 4609 |
+
"step": 657
|
| 4610 |
+
},
|
| 4611 |
+
{
|
| 4612 |
+
"epoch": 2.665314401622718,
|
| 4613 |
+
"grad_norm": 0.2516080027548331,
|
| 4614 |
+
"learning_rate": 1.0444872844624804e-06,
|
| 4615 |
+
"loss": 0.0091,
|
| 4616 |
+
"step": 658
|
| 4617 |
+
},
|
| 4618 |
+
{
|
| 4619 |
+
"epoch": 2.6693711967545637,
|
| 4620 |
+
"grad_norm": 0.27372507155820414,
|
| 4621 |
+
"learning_rate": 1.0200506838067558e-06,
|
| 4622 |
+
"loss": 0.0161,
|
| 4623 |
+
"step": 659
|
| 4624 |
+
},
|
| 4625 |
+
{
|
| 4626 |
+
"epoch": 2.6734279918864097,
|
| 4627 |
+
"grad_norm": 0.22462772010565904,
|
| 4628 |
+
"learning_rate": 9.958932693651168e-07,
|
| 4629 |
+
"loss": 0.0085,
|
| 4630 |
+
"step": 660
|
| 4631 |
+
},
|
| 4632 |
+
{
|
| 4633 |
+
"epoch": 2.6774847870182557,
|
| 4634 |
+
"grad_norm": 0.19482170746221347,
|
| 4635 |
+
"learning_rate": 9.720155235725753e-07,
|
| 4636 |
+
"loss": 0.0077,
|
| 4637 |
+
"step": 661
|
| 4638 |
+
},
|
| 4639 |
+
{
|
| 4640 |
+
"epoch": 2.6815415821501016,
|
| 4641 |
+
"grad_norm": 0.21706494083610625,
|
| 4642 |
+
"learning_rate": 9.484179232790391e-07,
|
| 4643 |
+
"loss": 0.0071,
|
| 4644 |
+
"step": 662
|
| 4645 |
+
},
|
| 4646 |
+
{
|
| 4647 |
+
"epoch": 2.685598377281947,
|
| 4648 |
+
"grad_norm": 0.2700405708098266,
|
| 4649 |
+
"learning_rate": 9.251009397397663e-07,
|
| 4650 |
+
"loss": 0.0096,
|
| 4651 |
+
"step": 663
|
| 4652 |
+
},
|
| 4653 |
+
{
|
| 4654 |
+
"epoch": 2.689655172413793,
|
| 4655 |
+
"grad_norm": 0.20416894288766446,
|
| 4656 |
+
"learning_rate": 9.020650386059731e-07,
|
| 4657 |
+
"loss": 0.0084,
|
| 4658 |
+
"step": 664
|
| 4659 |
+
},
|
| 4660 |
+
{
|
| 4661 |
+
"epoch": 2.6937119675456387,
|
| 4662 |
+
"grad_norm": 0.2977765225079465,
|
| 4663 |
+
"learning_rate": 8.793106799155187e-07,
|
| 4664 |
+
"loss": 0.0122,
|
| 4665 |
+
"step": 665
|
| 4666 |
+
},
|
| 4667 |
+
{
|
| 4668 |
+
"epoch": 2.6977687626774847,
|
| 4669 |
+
"grad_norm": 0.39111551936936895,
|
| 4670 |
+
"learning_rate": 8.568383180837369e-07,
|
| 4671 |
+
"loss": 0.0061,
|
| 4672 |
+
"step": 666
|
| 4673 |
+
},
|
| 4674 |
+
{
|
| 4675 |
+
"epoch": 2.7018255578093306,
|
| 4676 |
+
"grad_norm": 0.23369929762822697,
|
| 4677 |
+
"learning_rate": 8.346484018943429e-07,
|
| 4678 |
+
"loss": 0.0071,
|
| 4679 |
+
"step": 667
|
| 4680 |
+
},
|
| 4681 |
+
{
|
| 4682 |
+
"epoch": 2.7058823529411766,
|
| 4683 |
+
"grad_norm": 0.2529908334984344,
|
| 4684 |
+
"learning_rate": 8.127413744904805e-07,
|
| 4685 |
+
"loss": 0.0109,
|
| 4686 |
+
"step": 668
|
| 4687 |
+
},
|
| 4688 |
+
{
|
| 4689 |
+
"epoch": 2.709939148073022,
|
| 4690 |
+
"grad_norm": 0.19978914969994244,
|
| 4691 |
+
"learning_rate": 7.911176733658709e-07,
|
| 4692 |
+
"loss": 0.0071,
|
| 4693 |
+
"step": 669
|
| 4694 |
+
},
|
| 4695 |
+
{
|
| 4696 |
+
"epoch": 2.713995943204868,
|
| 4697 |
+
"grad_norm": 0.35516946776094027,
|
| 4698 |
+
"learning_rate": 7.697777303560699e-07,
|
| 4699 |
+
"loss": 0.0076,
|
| 4700 |
+
"step": 670
|
| 4701 |
+
},
|
| 4702 |
+
{
|
| 4703 |
+
"epoch": 2.718052738336714,
|
| 4704 |
+
"grad_norm": 0.32064994090406973,
|
| 4705 |
+
"learning_rate": 7.487219716298643e-07,
|
| 4706 |
+
"loss": 0.0078,
|
| 4707 |
+
"step": 671
|
| 4708 |
+
},
|
| 4709 |
+
{
|
| 4710 |
+
"epoch": 2.7221095334685597,
|
| 4711 |
+
"grad_norm": 0.17610583979954028,
|
| 4712 |
+
"learning_rate": 7.279508176807259e-07,
|
| 4713 |
+
"loss": 0.007,
|
| 4714 |
+
"step": 672
|
| 4715 |
+
},
|
| 4716 |
+
{
|
| 4717 |
+
"epoch": 2.7261663286004056,
|
| 4718 |
+
"grad_norm": 0.1879019239049559,
|
| 4719 |
+
"learning_rate": 7.074646833184495e-07,
|
| 4720 |
+
"loss": 0.0077,
|
| 4721 |
+
"step": 673
|
| 4722 |
+
},
|
| 4723 |
+
{
|
| 4724 |
+
"epoch": 2.7302231237322516,
|
| 4725 |
+
"grad_norm": 0.2508655898096489,
|
| 4726 |
+
"learning_rate": 6.872639776608464e-07,
|
| 4727 |
+
"loss": 0.012,
|
| 4728 |
+
"step": 674
|
| 4729 |
+
},
|
| 4730 |
+
{
|
| 4731 |
+
"epoch": 2.7342799188640976,
|
| 4732 |
+
"grad_norm": 0.20939981063074065,
|
| 4733 |
+
"learning_rate": 6.673491041255874e-07,
|
| 4734 |
+
"loss": 0.0072,
|
| 4735 |
+
"step": 675
|
| 4736 |
+
},
|
| 4737 |
+
{
|
| 4738 |
+
"epoch": 2.738336713995943,
|
| 4739 |
+
"grad_norm": 0.2524661562844755,
|
| 4740 |
+
"learning_rate": 6.477204604221298e-07,
|
| 4741 |
+
"loss": 0.0089,
|
| 4742 |
+
"step": 676
|
| 4743 |
+
},
|
| 4744 |
+
{
|
| 4745 |
+
"epoch": 2.742393509127789,
|
| 4746 |
+
"grad_norm": 0.18123227676882245,
|
| 4747 |
+
"learning_rate": 6.283784385437963e-07,
|
| 4748 |
+
"loss": 0.0074,
|
| 4749 |
+
"step": 677
|
| 4750 |
+
},
|
| 4751 |
+
{
|
| 4752 |
+
"epoch": 2.7464503042596347,
|
| 4753 |
+
"grad_norm": 0.28169632716010695,
|
| 4754 |
+
"learning_rate": 6.093234247599317e-07,
|
| 4755 |
+
"loss": 0.0115,
|
| 4756 |
+
"step": 678
|
| 4757 |
+
},
|
| 4758 |
+
{
|
| 4759 |
+
"epoch": 2.7505070993914806,
|
| 4760 |
+
"grad_norm": 0.24112096399796779,
|
| 4761 |
+
"learning_rate": 5.905557996081906e-07,
|
| 4762 |
+
"loss": 0.0104,
|
| 4763 |
+
"step": 679
|
| 4764 |
+
},
|
| 4765 |
+
{
|
| 4766 |
+
"epoch": 2.7545638945233266,
|
| 4767 |
+
"grad_norm": 1.891213001719549,
|
| 4768 |
+
"learning_rate": 5.720759378869455e-07,
|
| 4769 |
+
"loss": 0.0108,
|
| 4770 |
+
"step": 680
|
| 4771 |
+
},
|
| 4772 |
+
{
|
| 4773 |
+
"epoch": 2.7586206896551726,
|
| 4774 |
+
"grad_norm": 0.2143920645162132,
|
| 4775 |
+
"learning_rate": 5.538842086477891e-07,
|
| 4776 |
+
"loss": 0.0073,
|
| 4777 |
+
"step": 681
|
| 4778 |
+
},
|
| 4779 |
+
{
|
| 4780 |
+
"epoch": 2.762677484787018,
|
| 4781 |
+
"grad_norm": 0.3298995677537989,
|
| 4782 |
+
"learning_rate": 5.359809751881834e-07,
|
| 4783 |
+
"loss": 0.0114,
|
| 4784 |
+
"step": 682
|
| 4785 |
+
},
|
| 4786 |
+
{
|
| 4787 |
+
"epoch": 2.766734279918864,
|
| 4788 |
+
"grad_norm": 0.18127821937547067,
|
| 4789 |
+
"learning_rate": 5.18366595044184e-07,
|
| 4790 |
+
"loss": 0.0059,
|
| 4791 |
+
"step": 683
|
| 4792 |
+
},
|
| 4793 |
+
{
|
| 4794 |
+
"epoch": 2.77079107505071,
|
| 4795 |
+
"grad_norm": 0.3580659253774967,
|
| 4796 |
+
"learning_rate": 5.010414199833097e-07,
|
| 4797 |
+
"loss": 0.0134,
|
| 4798 |
+
"step": 684
|
| 4799 |
+
},
|
| 4800 |
+
{
|
| 4801 |
+
"epoch": 2.7748478701825556,
|
| 4802 |
+
"grad_norm": 0.20714170407676127,
|
| 4803 |
+
"learning_rate": 4.840057959975169e-07,
|
| 4804 |
+
"loss": 0.0072,
|
| 4805 |
+
"step": 685
|
| 4806 |
+
},
|
| 4807 |
+
{
|
| 4808 |
+
"epoch": 2.7789046653144016,
|
| 4809 |
+
"grad_norm": 0.2277337899414502,
|
| 4810 |
+
"learning_rate": 4.6726006329629645e-07,
|
| 4811 |
+
"loss": 0.0101,
|
| 4812 |
+
"step": 686
|
| 4813 |
+
},
|
| 4814 |
+
{
|
| 4815 |
+
"epoch": 2.7829614604462476,
|
| 4816 |
+
"grad_norm": 0.19613471713041244,
|
| 4817 |
+
"learning_rate": 4.5080455629986475e-07,
|
| 4818 |
+
"loss": 0.0047,
|
| 4819 |
+
"step": 687
|
| 4820 |
+
},
|
| 4821 |
+
{
|
| 4822 |
+
"epoch": 2.7870182555780936,
|
| 4823 |
+
"grad_norm": 0.2823039689966462,
|
| 4824 |
+
"learning_rate": 4.3463960363249286e-07,
|
| 4825 |
+
"loss": 0.0115,
|
| 4826 |
+
"step": 688
|
| 4827 |
+
},
|
| 4828 |
+
{
|
| 4829 |
+
"epoch": 2.791075050709939,
|
| 4830 |
+
"grad_norm": 0.20345163681925613,
|
| 4831 |
+
"learning_rate": 4.187655281159536e-07,
|
| 4832 |
+
"loss": 0.0074,
|
| 4833 |
+
"step": 689
|
| 4834 |
+
},
|
| 4835 |
+
{
|
| 4836 |
+
"epoch": 2.795131845841785,
|
| 4837 |
+
"grad_norm": 0.29840307095638663,
|
| 4838 |
+
"learning_rate": 4.031826467630545e-07,
|
| 4839 |
+
"loss": 0.01,
|
| 4840 |
+
"step": 690
|
| 4841 |
+
},
|
| 4842 |
+
{
|
| 4843 |
+
"epoch": 2.7991886409736306,
|
| 4844 |
+
"grad_norm": 0.1860689908066093,
|
| 4845 |
+
"learning_rate": 3.8789127077132336e-07,
|
| 4846 |
+
"loss": 0.0055,
|
| 4847 |
+
"step": 691
|
| 4848 |
+
},
|
| 4849 |
+
{
|
| 4850 |
+
"epoch": 2.8032454361054766,
|
| 4851 |
+
"grad_norm": 0.3478181689879201,
|
| 4852 |
+
"learning_rate": 3.7289170551678633e-07,
|
| 4853 |
+
"loss": 0.0118,
|
| 4854 |
+
"step": 692
|
| 4855 |
+
},
|
| 4856 |
+
{
|
| 4857 |
+
"epoch": 2.8073022312373226,
|
| 4858 |
+
"grad_norm": 0.22939108780939063,
|
| 4859 |
+
"learning_rate": 3.581842505478744e-07,
|
| 4860 |
+
"loss": 0.0112,
|
| 4861 |
+
"step": 693
|
| 4862 |
+
},
|
| 4863 |
+
{
|
| 4864 |
+
"epoch": 2.8113590263691686,
|
| 4865 |
+
"grad_norm": 0.3032587745992294,
|
| 4866 |
+
"learning_rate": 3.437691995794301e-07,
|
| 4867 |
+
"loss": 0.0124,
|
| 4868 |
+
"step": 694
|
| 4869 |
+
},
|
| 4870 |
+
{
|
| 4871 |
+
"epoch": 2.815415821501014,
|
| 4872 |
+
"grad_norm": 0.2094386636776182,
|
| 4873 |
+
"learning_rate": 3.2964684048685523e-07,
|
| 4874 |
+
"loss": 0.0073,
|
| 4875 |
+
"step": 695
|
| 4876 |
+
},
|
| 4877 |
+
{
|
| 4878 |
+
"epoch": 2.81947261663286,
|
| 4879 |
+
"grad_norm": 0.24925291522480858,
|
| 4880 |
+
"learning_rate": 3.15817455300354e-07,
|
| 4881 |
+
"loss": 0.01,
|
| 4882 |
+
"step": 696
|
| 4883 |
+
},
|
| 4884 |
+
{
|
| 4885 |
+
"epoch": 2.8235294117647056,
|
| 4886 |
+
"grad_norm": 0.22927354124709365,
|
| 4887 |
+
"learning_rate": 3.022813201993041e-07,
|
| 4888 |
+
"loss": 0.0103,
|
| 4889 |
+
"step": 697
|
| 4890 |
+
},
|
| 4891 |
+
{
|
| 4892 |
+
"epoch": 2.8275862068965516,
|
| 4893 |
+
"grad_norm": 0.24523657497451284,
|
| 4894 |
+
"learning_rate": 2.890387055067412e-07,
|
| 4895 |
+
"loss": 0.0092,
|
| 4896 |
+
"step": 698
|
| 4897 |
+
},
|
| 4898 |
+
{
|
| 4899 |
+
"epoch": 2.8316430020283976,
|
| 4900 |
+
"grad_norm": 0.2375204245523175,
|
| 4901 |
+
"learning_rate": 2.7608987568395306e-07,
|
| 4902 |
+
"loss": 0.0116,
|
| 4903 |
+
"step": 699
|
| 4904 |
+
},
|
| 4905 |
+
{
|
| 4906 |
+
"epoch": 2.8356997971602436,
|
| 4907 |
+
"grad_norm": 0.2066202436946509,
|
| 4908 |
+
"learning_rate": 2.6343508932521243e-07,
|
| 4909 |
+
"loss": 0.0086,
|
| 4910 |
+
"step": 700
|
| 4911 |
}
|
| 4912 |
],
|
| 4913 |
"logging_steps": 1,
|
|
|
|
| 4927 |
"attributes": {}
|
| 4928 |
}
|
| 4929 |
},
|
| 4930 |
+
"total_flos": 4740780390875136.0,
|
| 4931 |
"train_batch_size": 10,
|
| 4932 |
"trial_name": null,
|
| 4933 |
"trial_params": null
|