IntMeGroup commited on May 19

Commit

4a1ca9e

verified ·

1 Parent(s): fce77d4

Upload folder using huggingface_hub

Browse files

Files changed (18) hide show

.gitattributes +1 -0
added_tokens.json +11 -0
config.json +228 -0
generation_config.json +4 -0
model-00001-of-00004.safetensors +3 -0
model-00002-of-00004.safetensors +3 -0
model-00003-of-00004.safetensors +3 -0
model-00004-of-00004.safetensors +3 -0
model.safetensors.index.json +891 -0
mos2_metrics.txt +36 -0
mos2_results.csv +0 -0
runs/Apr23_19-32-00_amax/events.out.tfevents.1745407931.amax.1703561.0 +3 -0
special_tokens_map.json +63 -0
tokenization_internlm3.py +294 -0
tokenizer.model +3 -0
tokenizer_config.json +330 -0
training_args.bin +3 -0
training_log.txt +3 -0

.gitattributes CHANGED Viewed

@@ -33,3 +33,4 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text

 *.zip filter=lfs diff=lfs merge=lfs -text
 *.zst filter=lfs diff=lfs merge=lfs -text
 *tfevents* filter=lfs diff=lfs merge=lfs -text
+training_log.txt filter=lfs diff=lfs merge=lfs -text

added_tokens.json ADDED Viewed

	@@ -0,0 +1,11 @@

+{
+  "</box>": 128141,
+  "</img>": 128134,
+  "</quad>": 128137,
+  "</ref>": 128139,
+  "<IMG_CONTEXT>": 128135,
+  "<box>": 128140,
+  "<img>": 128133,
+  "<quad>": 128136,
+  "<ref>": 128138
+}

config.json ADDED Viewed

	@@ -0,0 +1,228 @@

+{
+  "_commit_hash": null,
+  "_name_or_path": "/media/amax/e1efc3d3-8977-4b90-9121-3f956ab56974/huiyu/wjr/wjr/AIGI_2025n/InternVL3-9B",
+  "architectures": [
+    "InternVLChatModel"
+  ],
+  "auto_map": {
+    "AutoConfig": "configuration_internvl_chat.InternVLChatConfig",
+    "AutoModel": "modeling_internvl_chat.InternVLChatModel",
+    "AutoModelForCausalLM": "modeling_internvl_chat.InternVLChatModel"
+  },
+  "downsample_ratio": 0.5,
+  "dynamic_image_size": true,
+  "force_image_size": 448,
+  "hidden_size": 4096,
+  "image_fold": null,
+  "llm_config": {
+    "_attn_implementation_autoset": true,
+    "_name_or_path": "/mnt/petrelfs/share_data/wangweiyun/share_ckpt/hf_home/internlm2-chat-7b",
+    "add_cross_attention": false,
+    "architectures": [
+      "InternLM2ForCausalLM"
+    ],
+    "attn_implementation": "flash_attention_2",
+    "auto_map": {
+      "AutoConfig": "configuration_internlm2.InternLM2Config",
+      "AutoModel": "modeling_internlm2.InternLM2ForCausalLM",
+      "AutoModelForCausalLM": "modeling_internlm2.InternLM2ForCausalLM"
+    },
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bias": false,
+    "bos_token_id": 1,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": 2,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "silu",
+    "hidden_size": 4096,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_range": 0.02,
+    "intermediate_size": 10240,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "max_position_embeddings": 32768,
+    "min_length": 0,
+    "model_type": "internlm2",
+    "moe_config": null,
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": 32,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_hidden_layers": 48,
+    "num_key_value_heads": 2,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": 2,
+    "prefix": null,
+    "pretraining_tp": 1,
+    "problem_type": null,
+    "pruned_heads": {},
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "rms_norm_eps": 1e-05,
+    "rope_scaling": {
+      "factor": 2.0,
+      "type": "dynamic"
+    },
+    "rope_theta": 50000000,
+    "sep_token_id": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": false,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": "bfloat16",
+    "torchscript": false,
+    "transformers_version": "4.48.3",
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "use_cache": false,
+    "vocab_size": 128142
+  },
+  "max_dynamic_patch": 6,
+  "min_dynamic_patch": 1,
+  "model_type": "internvl_chat",
+  "pad2square": false,
+  "ps_version": "v2",
+  "select_layer": -1,
+  "system_message": null,
+  "template": "internlm2-chat",
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": null,
+  "use_backbone_lora": 0,
+  "use_img_start_end_token": true,
+  "use_llm_lora": 0,
+  "use_thumbnail": true,
+  "vision_config": {
+    "_attn_implementation_autoset": true,
+    "_name_or_path": "pretrained/intern_vit_6b_448px_v1_2/",
+    "add_cross_attention": false,
+    "architectures": [
+      "InternVisionModel"
+    ],
+    "attention_dropout": 0.0,
+    "auto_map": {
+      "AutoConfig": "configuration_intern_vit.InternVisionConfig",
+      "AutoModel": "modeling_intern_vit.InternVisionModel"
+    },
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": null,
+    "capacity_factor": 1.2,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "drop_path_rate": 0.1,
+    "dropout": 0.0,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": null,
+    "eval_capacity_factor": 1.4,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "gelu",
+    "hidden_size": 1024,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "image_size": 448,
+    "initializer_factor": 0.1,
+    "initializer_range": 1e-10,
+    "intermediate_size": 4096,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "laux_allreduce": "all_nodes",
+    "layer_norm_eps": 1e-06,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "min_length": 0,
+    "model_type": "intern_vit_6b",
+    "moe_coeff_ratio": 0.5,
+    "moe_intermediate_size": 768,
+    "moe_output_scale": 4.0,
+    "no_repeat_ngram_size": 0,
+    "noisy_gate_policy": "RSample_before",
+    "norm_type": "layer_norm",
+    "num_attention_heads": 16,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_channels": 3,
+    "num_experts": 8,
+    "num_hidden_layers": 24,
+    "num_return_sequences": 1,
+    "num_routed_experts": 4,
+    "num_shared_experts": 4,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "patch_size": 14,
+    "prefix": null,
+    "problem_type": null,
+    "pruned_heads": {},
+    "qk_normalization": false,
+    "qkv_bias": true,
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "shared_expert_intermediate_size": 3072,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": "bfloat16",
+    "torchscript": false,
+    "transformers_version": "4.48.3",
+    "typical_p": 1.0,
+    "use_bfloat16": false,
+    "use_flash_attn": true,
+    "use_moe": false,
+    "use_residual": true,
+    "use_rts": false,
+    "use_weighted_residual": false
+  }
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "_from_model_config": true,
+  "transformers_version": "4.48.3"
+}

model-00001-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:441580304d8aa0f4ec313febbf45b9f19c4c9f8f6de8747cb3641d597da9d7bf
+size 4958894224

model-00002-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c7fd993d115f46f92a53fbb79bf62a525b9bc3e8794fd9660ce2915221f3e9d0
+size 4928566648

model-00003-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8ee0ba959a9527247042d5181d4e39d3fd5278813163b5cf3c04932574f822ca
+size 4928566648

model-00004-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:553d80f8b557746ea00be9e0fde944e6983e491fccfd35159263c7dc36d69ff6
+size 3572444152

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,891 @@

+{
+  "metadata": {
+    "total_size": 18388361272
+  },
+  "weight_map": {
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.0.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.blocks.1.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.downsample.norm.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.downsample.norm.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.0.downsample.reduction.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.0.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.blocks.1.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.downsample.norm.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.downsample.norm.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.1.downsample.reduction.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.0.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.1.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.2.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.3.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.4.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.fragment_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.blocks.5.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.downsample.norm.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.downsample.norm.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.2.downsample.reduction.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.0.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.proj.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.qkv.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.qkv.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.relative_position_bias_table": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.attn.relative_position_index": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.mlp.fc1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.mlp.fc1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.mlp.fc2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.mlp.fc2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.norm1.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.norm1.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.norm2.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.layers.3.blocks.1.norm2.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.norm.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.norm.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.patch_embed.norm.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.patch_embed.norm.weight": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.patch_embed.proj.bias": "model-00004-of-00004.safetensors",
+    "evaluator.fragments_backbone.patch_embed.proj.weight": "model-00004-of-00004.safetensors",
+    "fast_mlp.0.bias": "model-00004-of-00004.safetensors",
+    "fast_mlp.0.weight": "model-00004-of-00004.safetensors",
+    "fast_mlp.1.bias": "model-00004-of-00004.safetensors",
+    "fast_mlp.1.weight": "model-00004-of-00004.safetensors",
+    "fast_mlp.3.bias": "model-00004-of-00004.safetensors",
+    "fast_mlp.3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.0.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.0.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.1.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.10.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.10.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.10.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.10.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.10.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.10.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.10.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.11.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.12.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.13.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.14.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.15.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.16.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.17.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.18.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.19.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.2.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.2.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.20.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.20.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.21.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.22.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.23.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.attention_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.feed_forward.w2.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.feed_forward.w3.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.24.ffn_norm.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.25.attention.wo.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.25.attention.wqkv.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.25.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.25.feed_forward.w1.weight": "model-00002-of-00004.safetensors",
+    "language_model.model.layers.25.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.25.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.25.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.26.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.27.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.28.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.29.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.3.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.3.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.30.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.30.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.31.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.32.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.33.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.34.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.35.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.36.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.37.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.38.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.attention_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.feed_forward.w2.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.39.ffn_norm.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.4.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.4.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.40.attention.wo.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.40.attention.wqkv.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.40.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.40.feed_forward.w1.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.40.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.40.feed_forward.w3.weight": "model-00003-of-00004.safetensors",
+    "language_model.model.layers.40.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.41.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.42.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.43.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.44.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.45.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.46.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.attention.wo.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.attention.wqkv.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.attention_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.feed_forward.w1.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.feed_forward.w2.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.feed_forward.w3.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.47.ffn_norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.layers.5.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.5.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.6.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.7.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.8.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.attention.wo.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.attention.wqkv.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.attention_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.feed_forward.w1.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.feed_forward.w2.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.feed_forward.w3.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.layers.9.ffn_norm.weight": "model-00001-of-00004.safetensors",
+    "language_model.model.norm.weight": "model-00004-of-00004.safetensors",
+    "language_model.model.tok_embeddings.weight": "model-00001-of-00004.safetensors",
+    "language_model.output.weight": "model-00004-of-00004.safetensors",
+    "mlp1.0.bias": "model-00004-of-00004.safetensors",
+    "mlp1.0.weight": "model-00004-of-00004.safetensors",
+    "mlp1.1.bias": "model-00004-of-00004.safetensors",
+    "mlp1.1.weight": "model-00004-of-00004.safetensors",
+    "mlp1.3.bias": "model-00004-of-00004.safetensors",
+    "mlp1.3.weight": "model-00004-of-00004.safetensors",
+    "vision_model.embeddings.class_embedding": "model-00001-of-00004.safetensors",
+    "vision_model.embeddings.patch_embedding.bias": "model-00001-of-00004.safetensors",
+    "vision_model.embeddings.patch_embedding.weight": "model-00001-of-00004.safetensors",
+    "vision_model.embeddings.position_embedding": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.0.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.1.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.10.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.11.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.12.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.13.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.14.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.15.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.16.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.17.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.18.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.19.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.2.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.20.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.21.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.22.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.23.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.3.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.4.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.5.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.6.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.7.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.8.norm2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.attn.proj.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.attn.proj.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.attn.qkv.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.attn.qkv.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.ls1": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.ls2": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.norm1.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.norm1.weight": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.norm2.bias": "model-00001-of-00004.safetensors",
+    "vision_model.encoder.layers.9.norm2.weight": "model-00001-of-00004.safetensors"
+  }
+}

mos2_metrics.txt ADDED Viewed

	@@ -0,0 +1,36 @@

+Accuracy: 0.00011111111111111112
+SRCC: 0.6926555307894924
+PLCC: 0.7095715746195425
+KRCC: 0.5665830132455586
+Accuracy: 0.00011111111111111112
+SRCC: 0.6926555307894924
+PLCC: 0.7095715746195425
+KRCC: 0.5665830132455586
+Accuracy: 0.00011111111111111112
+SRCC: 0.6926555307894924
+PLCC: 0.7095715746195425
+KRCC: 0.5665830132455586
+Accuracy: 0.00011111111111111112
+SRCC: 0.6931909180036439
+PLCC: 0.7100735156898511
+KRCC: 0.5668195962017428
+Accuracy: 0.00011111111111111112
+SRCC: 0.6931909180036439
+PLCC: 0.7100735156898511
+KRCC: 0.5668195962017428
+Accuracy: 0.00011111111111111112
+SRCC: 0.6931909180036439
+PLCC: 0.7100735156898511
+KRCC: 0.5668195962017428
+Accuracy: 0.0007777777777777777
+SRCC: 0.7234150036980409
+PLCC: 0.7354250671184984
+KRCC: 0.5842951609750242
+Accuracy: 0.0007777777777777777
+SRCC: 0.7234150036980409
+PLCC: 0.7354250671184984
+KRCC: 0.5842951609750242
+Accuracy: 0.0007777777777777777
+SRCC: 0.7234150036980409
+PLCC: 0.7354250671184984
+KRCC: 0.5842951609750242

mos2_results.csv ADDED Viewed

The diff for this file is too large to render. See raw diff

runs/Apr23_19-32-00_amax/events.out.tfevents.1745407931.amax.1703561.0 ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e0269a6b9124eff71542978a5c7bcaec5b2054be97473d0b4ba3f1f2af538307
+size 1751260

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,63 @@

+{
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|action_start|>",
+    "<|action_end|>",
+    "<|interpreter|>",
+    "<|plugin|>",
+    "<restate>",
+    "</restate>",
+    "<planning>",
+    "</planning>",
+    "<recollect>",
+    "</recollect>",
+    "<execution>",
+    "</execution>",
+    "<review>",
+    "</review>",
+    "<summarize>",
+    "</summarize>",
+    "<retry>",
+    "</retry>",
+    "<conclude>",
+    "</conclude>",
+    "<img>",
+    "</img>",
+    "<IMG_CONTEXT>",
+    "<quad>",
+    "</quad>",
+    "<ref>",
+    "</ref>",
+    "<box>",
+    "</box>"
+  ],
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenization_internlm3.py ADDED Viewed

	@@ -0,0 +1,294 @@

+import os
+from shutil import copyfile
+from typing import TYPE_CHECKING, Any, Dict, List, Optional, Tuple
+import sentencepiece as spm
+from transformers.tokenization_utils import AddedToken, PreTrainedTokenizer
+from transformers.utils import logging
+if TYPE_CHECKING:
+    from transformers.tokenization_utils_base import TextInput
+logger = logging.get_logger(__name__)
+VOCAB_FILES_NAMES = {"vocab_file": "tokenizer.model"}
+SPIECE_UNDERLINE = "▁"
+class InternLM3Tokenizer(PreTrainedTokenizer):
+    """
+    Construct a InternLM3 tokenizer. Based on byte-level Byte-Pair-Encoding. The default padding token is unset as there is
+    no padding token in the original model.
+    Args:
+        vocab_file (`str`):
+            Path to the vocabulary file.
+        unk_token (`str` or `tokenizers.AddedToken`, *optional*, defaults to `"<unk>"`):
+            The unknown token. A token that is not in the vocabulary cannot be converted to an ID and is set to be this
+            token instead.
+        bos_token (`str` or `tokenizers.AddedToken`, *optional*, defaults to `"<s>"`):
+            The beginning of sequence token that was used during pretraining. Can be used a sequence classifier token.
+        eos_token (`str` or `tokenizers.AddedToken`, *optional*, defaults to `"</s>"`):
+            The end of sequence token.
+        pad_token (`str` or `tokenizers.AddedToken`, *optional*):
+            A special token used to make arrays of tokens the same size for batching purpose. Will then be ignored by
+            attention mechanisms or loss computation.
+        sp_model_kwargs (`Dict[str, Any]`, `Optional`, *optional*):
+            Will be passed to the `SentencePieceProcessor.__init__()` method. The [Python wrapper for
+            SentencePiece](https://github.com/google/sentencepiece/tree/master/python) can be used, among other things,
+            to set:
+            - `enable_sampling`: Enable subword regularization.
+            - `nbest_size`: Sampling parameters for unigram. Invalid for BPE-Dropout.
+              - `nbest_size = {0,1}`: No sampling is performed.
+              - `nbest_size > 1`: samples from the nbest_size results.
+              - `nbest_size < 0`: assuming that nbest_size is infinite and samples from the all hypothesis (lattice)
+                using forward-filtering-and-backward-sampling algorithm.
+            - `alpha`: Smoothing parameter for unigram sampling, and dropout probability of merge operations for
+              BPE-dropout.
+        add_bos_token (`bool`, *optional*, defaults to `True`):
+            Whether or not to add an `bos_token` at the start of sequences.
+        add_eos_token (`bool`, *optional*, defaults to `False`):
+            Whether or not to add an `eos_token` at the end of sequences.
+        clean_up_tokenization_spaces (`bool`, *optional*, defaults to `False`):
+            Whether or not to cleanup spaces after decoding, cleanup consists in removing potential artifacts like
+            extra spaces.
+        use_default_system_prompt (`bool`, *optional*, defaults to `False`):
+            Whether or not the default system prompt for InternLM3 should be used.
+        spaces_between_special_tokens (`bool`, *optional*, defaults to `False`):
+            Whether or not to add spaces between special tokens.
+        spaces_for_interleaved_special_tokens (`bool`, *optional*, defaults to `False`):
+           Whether or not to add spaces between special tokens that are interleaved with normal tokens.
+        add_prefix_space (`bool`, *optional*, defaults to `True`):
+            Whether or not to add an initial space to the input. This allows to treat the leading word just as any
+            other word. Again, this should be set with `from_slow=True` to make sure it's taken into account.
+    """
+    vocab_files_names = VOCAB_FILES_NAMES
+    model_input_names = ["input_ids", "attention_mask"]
+    def __init__(
+        self,
+        vocab_file,
+        unk_token="<unk>",
+        bos_token="<s>",
+        eos_token="</s>",
+        pad_token=None,
+        sp_model_kwargs: Optional[Dict[str, Any]] = None,
+        add_bos_token=True,
+        add_eos_token=False,
+        clean_up_tokenization_spaces=False,
+        use_default_system_prompt=False,
+        spaces_between_special_tokens=False,
+        spaces_for_interleaved_special_tokens=False,
+        add_prefix_space=True,
+        **kwargs,
+    ):
+        self.sp_model_kwargs = {} if sp_model_kwargs is None else sp_model_kwargs
+        bos_token = AddedToken(bos_token, normalized=False, special=True) if isinstance(bos_token, str) else bos_token
+        eos_token = AddedToken(eos_token, normalized=False, special=True) if isinstance(eos_token, str) else eos_token
+        unk_token = AddedToken(unk_token, normalized=False, special=True) if isinstance(unk_token, str) else unk_token
+        pad_token = AddedToken(pad_token, normalized=False, special=True) if isinstance(pad_token, str) else pad_token
+        self.vocab_file = vocab_file
+        self.add_bos_token = add_bos_token
+        self.add_eos_token = add_eos_token
+        self.use_default_system_prompt = use_default_system_prompt
+        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
+        self.sp_model.Load(vocab_file)
+        self.add_prefix_space = add_prefix_space
+        self.spaces_for_interleaved_special_tokens = spaces_for_interleaved_special_tokens
+        vocab_size = self.sp_model.get_piece_size()
+        self.decoder = {i: self.sp_model.id_to_piece(i) for i in range(vocab_size)}
+        super().__init__(
+            bos_token=bos_token,
+            eos_token=eos_token,
+            unk_token=unk_token,
+            pad_token=pad_token,
+            add_bos_token=add_bos_token,
+            add_eos_token=add_eos_token,
+            sp_model_kwargs=sp_model_kwargs,
+            clean_up_tokenization_spaces=clean_up_tokenization_spaces,
+            use_default_system_prompt=use_default_system_prompt,
+            spaces_between_special_tokens=spaces_between_special_tokens,
+            add_prefix_space=add_prefix_space,
+            **kwargs,
+        )
+    def __getstate__(self):
+        state = self.__dict__.copy()
+        state["sp_model"] = None
+        state["sp_model_proto"] = self.sp_model.serialized_model_proto()
+        return state
+    def __setstate__(self, d):
+        self.__dict__.update(d)
+        self.sp_model = spm.SentencePieceProcessor(**self.sp_model_kwargs)
+        self.sp_model.LoadFromSerializedProto(self.sp_model_proto)
+    @property
+    def vocab_size(self):
+        """Returns vocab size"""
+        return self.sp_model.get_piece_size()
+    def get_vocab(self):
+        """Returns vocab as a dict"""
+        vocab = {self.convert_ids_to_tokens(i): i for i in range(self.vocab_size)}
+        vocab.update(self.added_tokens_encoder)
+        return vocab
+    def tokenize(self, text: "TextInput", **kwargs) -> List[str]:
+        """
+        Args:
+            text: TextInput
+        Simply calls PreTrainedTokenizer's method
+        """
+        return super().tokenize(text, **kwargs)
+    def _tokenize(self, text, **kwargs):
+        """
+        Args:
+            text: TextInput
+        Returns a tokenized string. The Gemma tokenizer never adds a prefix space.
+        """
+        return self.sp_model.encode(text, out_type=str)
+    def _convert_token_to_id(self, token):
+        """Converts a token (str) in an id using the vocab."""
+        return self.sp_model.piece_to_id(token)
+    def _convert_id_to_token(self, index):
+        """Converts an index (integer) in a token (str) using the vocab."""
+        return self.decoder.get(index, "")
+    def convert_tokens_to_string(self, tokens):
+        """Converts a sequence of tokens (string) in a single string."""
+        # since we manually add the prefix space, we have to remove it when decoding
+        if tokens[0].startswith(SPIECE_UNDERLINE) and self.add_prefix_space:
+            tokens[0] = tokens[0][1:]
+        current_sub_tokens = []
+        out_string = ""
+        prev_is_special = False
+        for i, token in enumerate(tokens):
+            # make sure that special tokens are not decoded using sentencepiece model
+            if token in self.all_special_tokens:
+                if not prev_is_special and i != 0 and self.spaces_for_interleaved_special_tokens:
+                    out_string += " "
+                out_string += self.sp_model.decode(current_sub_tokens) + token
+                prev_is_special = True
+                current_sub_tokens = []
+            else:
+                if (
+                    prev_is_special
+                    and i == 1
+                    and self.add_prefix_space
+                    and not token.startswith(SPIECE_UNDERLINE)
+                    and self.spaces_for_interleaved_special_tokens
+                ):
+                    out_string += " "
+                current_sub_tokens.append(token)
+                prev_is_special = False
+        out_string += self.sp_model.decode(current_sub_tokens)
+        return out_string
+    def save_vocabulary(self, save_directory, filename_prefix: Optional[str] = None) -> Tuple[str]:
+        """
+        Save the vocabulary and special tokens file to a directory.
+        Args:
+            save_directory (`str`):
+                The directory in which to save the vocabulary.
+        Returns:
+            `Tuple(str)`: Paths to the files saved.
+        """
+        if not os.path.isdir(save_directory):
+            logger.error(f"Vocabulary path ({save_directory}) should be a directory")
+            return
+        out_vocab_file = os.path.join(save_directory, (filename_prefix + "-" if filename_prefix else "") + VOCAB_FILES_NAMES["vocab_file"])
+        if os.path.abspath(self.vocab_file) != os.path.abspath(out_vocab_file) and os.path.isfile(self.vocab_file):
+            copyfile(self.vocab_file, out_vocab_file)
+        elif not os.path.isfile(self.vocab_file):
+            with open(out_vocab_file, "wb") as fi:
+                content_spiece_model = self.sp_model.serialized_model_proto()
+                fi.write(content_spiece_model)
+        return (out_vocab_file,)
+    def build_inputs_with_special_tokens(self, token_ids_0, token_ids_1=None):
+        bos_token_id = [self.bos_token_id] if self.add_bos_token else []
+        eos_token_id = [self.eos_token_id] if self.add_eos_token else []
+        output = bos_token_id + token_ids_0 + eos_token_id
+        if token_ids_1 is not None:
+            output = output + bos_token_id + token_ids_1 + eos_token_id
+        return output
+    def get_special_tokens_mask(
+        self, token_ids_0: List[int], token_ids_1: Optional[List[int]] = None, already_has_special_tokens: bool = False
+    ) -> List[int]:
+        """
+        Retrieve sequence ids from a token list that has no special tokens added. This method is called when adding
+        special tokens using the tokenizer `prepare_for_model` method.
+        Args:
+            token_ids_0 (`List[int]`):
+                List of IDs.
+            token_ids_1 (`List[int]`, *optional*):
+                Optional second list of IDs for sequence pairs.
+            already_has_special_tokens (`bool`, *optional*, defaults to `False`):
+                Whether or not the token list is already formatted with special tokens for the model.
+        Returns:
+            `List[int]`: A list of integers in the range [0, 1]: 1 for a special token, 0 for a sequence token.
+        """
+        if already_has_special_tokens:
+            return super().get_special_tokens_mask(token_ids_0=token_ids_0, token_ids_1=token_ids_1, already_has_special_tokens=True)
+        bos_token_id = [1] if self.add_bos_token else []
+        eos_token_id = [1] if self.add_eos_token else []
+        if token_ids_1 is None:
+            return bos_token_id + ([0] * len(token_ids_0)) + eos_token_id
+        return bos_token_id + ([0] * len(token_ids_0)) + eos_token_id + bos_token_id + ([0] * len(token_ids_1)) + eos_token_id
+    def create_token_type_ids_from_sequences(self, token_ids_0: List[int], token_ids_1: Optional[List[int]] = None) -> List[int]:
+        """
+        Creates a mask from the two sequences passed to be used in a sequence-pair classification task. An ALBERT
+        sequence pair mask has the following format:
+        ```
+        0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1
+        | first sequence    | second sequence |
+        ```
+        if token_ids_1 is None, only returns the first portion of the mask (0s).
+        Args:
+            token_ids_0 (`List[int]`):
+                List of ids.
+            token_ids_1 (`List[int]`, *optional*):
+                Optional second list of IDs for sequence pairs.
+        Returns:
+            `List[int]`: List of [token type IDs](../glossary#token-type-ids) according to the given sequence(s).
+        """
+        bos_token_id = [self.bos_token_id] if self.add_bos_token else []
+        eos_token_id = [self.eos_token_id] if self.add_eos_token else []
+        output = [0] * len(bos_token_id + token_ids_0 + eos_token_id)
+        if token_ids_1 is not None:
+            output += [1] * len(bos_token_id + token_ids_1 + eos_token_id)
+        return output

tokenizer.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:bcacff3229854f5103ee7a85473a30ca9a8b3a68f3aae9b7479574b23ac2256b
+size 2475075

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,330 @@

+{
+  "add_bos_token": true,
+  "add_eos_token": false,
+  "add_prefix_space": true,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128111": {
+      "content": "<restate>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128112": {
+      "content": "</restate>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128113": {
+      "content": "<planning>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128114": {
+      "content": "</planning>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128115": {
+      "content": "<recollect>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128116": {
+      "content": "</recollect>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128117": {
+      "content": "<execution>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128118": {
+      "content": "</execution>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128119": {
+      "content": "<review>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128120": {
+      "content": "</review>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128121": {
+      "content": "<summarize>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128122": {
+      "content": "</summarize>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128123": {
+      "content": "<retry>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128124": {
+      "content": "</retry>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128125": {
+      "content": "<conclude>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128126": {
+      "content": "</conclude>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128127": {
+      "content": "<|plugin|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128128": {
+      "content": "<|interpreter|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128129": {
+      "content": "<|action_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128130": {
+      "content": "<|action_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128131": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128132": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128133": {
+      "content": "<img>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128134": {
+      "content": "</img>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128135": {
+      "content": "<IMG_CONTEXT>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128136": {
+      "content": "<quad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128137": {
+      "content": "</quad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128138": {
+      "content": "<ref>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128139": {
+      "content": "</ref>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128140": {
+      "content": "<box>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128141": {
+      "content": "</box>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|action_start|>",
+    "<|action_end|>",
+    "<|interpreter|>",
+    "<|plugin|>",
+    "<restate>",
+    "</restate>",
+    "<planning>",
+    "</planning>",
+    "<recollect>",
+    "</recollect>",
+    "<execution>",
+    "</execution>",
+    "<review>",
+    "</review>",
+    "<summarize>",
+    "</summarize>",
+    "<retry>",
+    "</retry>",
+    "<conclude>",
+    "</conclude>",
+    "<img>",
+    "</img>",
+    "<IMG_CONTEXT>",
+    "<quad>",
+    "</quad>",
+    "<ref>",
+    "</ref>",
+    "<box>",
+    "</box>"
+  ],
+  "auto_map": {
+    "AutoTokenizer": [
+      "tokenization_internlm3.InternLM3Tokenizer",
+      null
+    ]
+  },
+  "bos_token": "<s>",
+  "chat_template": "{{ bos_token }}{% for message in messages %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "extra_special_tokens": {},
+  "model_max_length": 4096,
+  "pad_token": "</s>",
+  "sp_model_kwargs": {},
+  "spaces_between_special_tokens": false,
+  "tokenizer_class": "InternLM3Tokenizer",
+  "unk_token": "<unk>",
+  "use_default_system_prompt": false
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d34e0546c4f4010953c48a6661eed3c33fda840b71b8d16c01287f48ec032e6c
+size 7224

training_log.txt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:6501f8f940862dfa18d67a842fa26f663507a6dbb4e0bba6cee2e33bbfb8e123
+size 20872712