swhitehead yashlara commited on
Commit
8238b75
·
0 Parent(s):

Super-squash branch 'main' using huggingface_hub

Browse files

Co-authored-by: yashlara <yashlara@users.noreply.huggingface.co>

.gitattributes ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ tokenizer.json filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,274 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ library_name: transformers
4
+ pipeline_tag: image-text-to-text
5
+ language:
6
+ - en
7
+ base_model:
8
+ - Qwen/Qwen3.5-9B
9
+ tags:
10
+ - computer-use
11
+ - cua
12
+ - web-agent
13
+ - multimodal
14
+ - vision-language
15
+ - agent
16
+ - browser-automation
17
+ - magentic
18
+ - fara
19
+ ---
20
+
21
+ # Fara1.5-9B
22
+
23
+ [![Microsoft](https://img.shields.io/badge/Microsoft-Project-0078D4?logo=microsoft)](https://aka.ms/fara1.5)
24
+ [![Github](https://img.shields.io/badge/Github-181717?logo=github&logoColor=white)](https://github.com/microsoft/fara)
25
+ [![Paper](https://img.shields.io/badge/Paper-2606.20785-red)](https://huggingface.co/papers/2606.20785)
26
+ [![Foundry](https://img.shields.io/badge/Azure-Foundry-0089D6)](https://aka.ms/fara1.5-9B-foundry)
27
+
28
+
29
+ Fara1.5-9B is a multimodal **computer use agent (CUA)** for web browsers, from **Microsoft Research AI Frontiers**. It observes the browser through screenshots and acts on the user's behalf by emitting structured tool calls — click, type, scroll, visit URL, web search, and so on — to complete tasks end-to-end.
30
+
31
+ The model is vision-only at perception time: it sees the browser through screenshots, not the DOM or accessibility tree. Internal reasoning and trajectory history are tracked as text. Given the latest screenshot and prior actions, it predicts the next action with grounded arguments (e.g., pixel coordinates for a click).
32
+
33
+ Fara1.5-9B is supervised fine-tuned from Qwen3.5-9B on data generated by **FaraGen1.5**, our multi-agent pipeline that synthesizes web tasks, executes trajectories to solve them, and verifies the results before training.
34
+
35
+ It's co-designed with **MagenticLite**, and that's the recommended deployment for both research and production.
36
+
37
+ ## Highlights
38
+
39
+ - **End-to-end web task completion.** Fills forms, books reservations, applies for jobs, plans trips, runs shopping carts. Not just clicking around — sequencing actions toward a goal.
40
+ - **Vision-only perception.** Operates on screenshots alone, no DOM access required. Matches the input modality available to a human user.
41
+ - **Coordinate-grounded actions.** Predicts pixel-level click and drag targets directly. No separate grounding model needed.
42
+ - **Critical-points safety design.** Trained to stop and ask before personal info entry, payments, submissions, sign-ins, sending messages, or other irreversible actions — even if it could technically continue.
43
+ - **262K context.** Long enough for multi-screenshot trajectories with full action history.
44
+ - **On-device viable.** 9B parameters means it runs on a single A100/H100/B200 with room for the screenshot history.
45
+
46
+ ## Model Details
47
+
48
+ | | |
49
+ |---|---|
50
+ | **Developer** | Microsoft Research AI Frontiers |
51
+ | **Architecture** | Multimodal decoder-only LM (image + text → text) |
52
+ | **Parameters** | 9B |
53
+ | **Context length** | 262,144 tokens |
54
+ | **Inputs** | User goal (text), current screenshot(s), prior agent thoughts and actions |
55
+ | **Outputs** | Chain-of-thought block followed by a tool-call block (XML-tagged) |
56
+ | **Training period** | January 2026 – April 2026 |
57
+ | **Training compute** | 32 × NVIDIA B200, 4 days |
58
+ | **Release date** | 21 May 2026 |
59
+ | **License** | MIT |
60
+ | **Base model** | Qwen3.5-9B |
61
+
62
+ ## Recommended Deployment: MagenticLite
63
+
64
+ The safest way to run Fara1.5-9B is inside **MagenticLite**, which provides:
65
+
66
+ - **Sandboxing** — the browser runs in a Docker container with no access to host files or environment variables
67
+ - **Allow-lists** — restrict navigation to a user-specified set of domains
68
+ - **Watch-mode** — real-time monitoring of every action with full trace logs
69
+ - **Pause** — immediate halt of agent activity at any point
70
+
71
+ If you integrate Fara1.5-9B directly, you're responsible for these controls. Don't run this model with unrestricted browser access on a machine that has anything sensitive on it.
72
+
73
+ ## Quickstart
74
+
75
+ ### Requirements
76
+
77
+ - `torch >= 2.11.0`
78
+ - `transformers >= 5.2.0`
79
+ - `vllm >= 0.19.1`
80
+ - A GPU with enough memory for a 9B model in bf16 (A6000, A100, H100, and B200 have been tested)
81
+
82
+ ### Serve with vLLM
83
+
84
+ ```bash
85
+ vllm serve microsoft/Fara1.5-9B \
86
+ --dtype bfloat16 \
87
+ --max-model-len 262144 \
88
+ --limit-mm-per-prompt image=10
89
+ ```
90
+
91
+ ### System prompt
92
+
93
+ Fara1.5-9B is trained against a specific system prompt. Use it verbatim for best results:
94
+
95
+ ```text
96
+ You are Fara, a computer use agent (CUA) specialized for web browsers. You are developed by Microsoft AI Frontiers. You assist users with completing and automating tasks that require the use of a web browser.
97
+
98
+ The model was trained in the timeframe of January - April 2026. You can effectively perform tasks even beyond this range by accessing the web browser and using the latest information on the live web. But your knowledge cutoff is limited to early 2026, so you may not be aware of events or developments that occurred after that time, without explicitly browsing and searching for latest information on the web.
99
+
100
+ This edition of the model was trained using SFT on top of Qwen3.5-9B, using a synthetic data mixture generated and developed by Microsoft AI Frontiers.
101
+
102
+ A critical point is a situation where we must pause and request information or confirmation from the user before proceeding. There are three types:
103
+
104
+ Case 1: Missing User Information — The task requires personal information that the user has not provided (e.g., email, phone number, address, payment details). Never fabricate or assume personal information. Fill in only what the user has explicitly provided, then pause and ask for any missing required fields.
105
+
106
+ Case 2: Underspecified Task — The task description is ambiguous or missing details needed to make a decision at the current step. Pause and ask for clarification.
107
+
108
+ Case 3: Irreversible Action — We are about to perform an action that cannot be undone (e.g., submitting a form, completing a purchase, sending a message, deleting data). If the user explicitly authorized the action, proceed. Otherwise, stop and ask for confirmation.
109
+
110
+ Only stop at a critical point if (1) required information is missing, (2) the task is ambiguous, OR (3) an irreversible action lacks explicit user authorization.
111
+ ```
112
+
113
+ The full system prompt, including the complete `computer_use` tool schema, ships with the model in MagenticLite.
114
+
115
+ ### Tool schema
116
+
117
+ Fara1.5-9B emits actions as `<tool_call>...</tool_call>` XML blocks containing a JSON object that calls the `computer_use` function. Supported actions:
118
+
119
+ | Action | Purpose |
120
+ |---|---|
121
+ | `left_click`, `right_click`, `double_click`, `triple_click` | Mouse clicks at `(x, y)` |
122
+ | `mouse_move`, `left_click_drag` | Cursor positioning and drag |
123
+ | `type`, `key` | Keyboard input |
124
+ | `scroll`, `hscroll` | Page scrolling |
125
+ | `visit_url`, `history_back` | Browser navigation |
126
+ | `web_search` | Search query |
127
+ | `pause_and_memorize_fact` | Persist a fact across the trajectory |
128
+ | `ask_user_question` | Surface a clarifying question to the user |
129
+ | `wait` | Sleep for N seconds |
130
+ | `terminate` | End the task with a final answer |
131
+
132
+ The screen resolution Fara is most commonly trained with is **1440×900**. Match this in your sandbox for the most reliable grounding.
133
+
134
+ ### Minimal agent loop
135
+
136
+ ```python
137
+ # Pseudocode for a single-step interaction. Use vLLM's OpenAI-compatible
138
+ # endpoint and pass the screenshot as an image content part.
139
+
140
+ screenshot_b64 = capture_browser_screenshot() # base64 PNG
141
+
142
+ messages = [
143
+ {"role": "system", "content": FARA_SYSTEM_PROMPT},
144
+ {"role": "user", "content": [
145
+ {"type": "text", "text": "Book a table for 2 at a sushi place in Sunnyvale for Friday 7pm."},
146
+ {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{screenshot_b64}"}},
147
+ ]},
148
+ ]
149
+
150
+ response = client.chat.completions.create(
151
+ model="microsoft/Fara1.5-9B",
152
+ messages=messages,
153
+ temperature=0.0,
154
+ max_tokens=2048,
155
+ )
156
+
157
+ # Parse the assistant's reply: it will contain chain-of-thought text
158
+ # followed by <tool_call>{"name": "computer_use", "arguments": {...}}</tool_call>.
159
+ # Execute the action in your sandboxed browser, capture the new screenshot,
160
+ # append the assistant turn and a tool/observation turn, and loop until
161
+ # the model emits action="terminate". We only keep the most recent 3 screenshots
162
+ # in the chat history.
163
+ ```
164
+
165
+ A reference implementation of the full agent loop, including screenshot capture and Docker sandboxing, is in MagenticLite.
166
+
167
+ ## Critical Points: Safety by Design
168
+
169
+ Fara1.5-9B is trained to **pause and ask the user** at three types of critical points:
170
+
171
+ 1. **Missing user information.** If the task needs personal data (name, email, phone, address, payment) the user hasn't provided, fill in what's available and stop to ask for the rest. Never fabricate.
172
+ 2. **Underspecified tasks.** If the goal is ambiguous at the current decision point (e.g., "book me a flight" with no destination), stop and clarify.
173
+ 3. **Irreversible actions.** Submitting forms, completing purchases, sending messages, deleting data — stop unless the user explicitly authorized the action upfront.
174
+
175
+ Concrete actions Fara is trained to stop on without explicit authorization:
176
+
177
+ - Entering personal information (name, email, phone)
178
+ - Entering credit card or shipping/billing details
179
+ - Completing purchases or bookings
180
+ - Making phone calls
181
+ - Sending emails
182
+ - Submitting job applications
183
+ - Signing into accounts
184
+
185
+ If the user grants authorization, the model proceeds. The principle is that costly, irreversible actions require a human in the loop.
186
+
187
+ ## Evaluation
188
+
189
+ We evaluate Fara1.5-9B on end-to-end web agent benchmarks. For WebTailBench, we report outcome success.
190
+
191
+ | Model | [WebVoyager](https://github.com/MinorJerry/WebVoyager) | [Online-Mind2Web](https://huggingface.co/datasets/osunlp/Online-Mind2Web) | [WebTailBench](https://huggingface.co/datasets/microsoft/WebTailBench) |
192
+ | ----------- | -----------------------------------------------------: | ------------------------------------------------------------------------: | ---------------------------------------------------------------------: |
193
+ | Fara1.5-4B | 80.8 | 57.3 | 27.4 |
194
+ | Fara1.5-9B | 86.6 | 63.4 | 32.3 |
195
+ | Fara1.5-27B | 89.3 | 72.3 | 40.2 |
196
+
197
+
198
+ ## Training
199
+
200
+ ### Approach
201
+
202
+ Supervised Fine-Tuning on top of Qwen3.5-9B. Training mix is generated by FaraGen1.5, our multi-agent data pipeline, supplemented with curated public datasets for grounding and UI understanding.
203
+
204
+ ### Data sources
205
+
206
+ - **Synthetic trajectories** — Tasks seeded from URLs sampled from a large web index and from open-source seed datasets (e.g., Mind2Web). A multi-agent system attempts each task while recording screenshots, thoughts, and actions. A verifier agent then keeps only successful trajectories.
207
+ - **Grounding** — Curated datasets for predicting actions and pixel coordinates from screenshots, with images, text, and bounding boxes.
208
+ - **UI understanding** — Visual question answering, captioning, and OCR over web page screenshots collected by the pipeline.
209
+ - **Safety and instruction following** — Refusal data covering harmful or unsafe tasks the model should decline.
210
+
211
+ ### Scale
212
+
213
+ - Approximately 1 billion text tokens
214
+ - Less than 1 billion training images
215
+ - Latest data acquisition: March 20, 2026
216
+ - Training start: January 2026
217
+
218
+ The corpus is static. Future updates will ship as separately versioned models with their own model cards.
219
+
220
+ ## Intended Use and Limitations
221
+
222
+ ### Primary use cases
223
+
224
+ Automating repetitive web tasks: filling forms, shopping, booking travel, restaurant reservations, information seeking, account workflows. Fara1.5-9B can also serve as a grounding model for other agents that need pixel-accurate action prediction.
225
+
226
+ ### Out of scope
227
+
228
+ - Languages other than English (training data is English-only)
229
+ - High-stakes domains (legal, health, financial advice) where inaccurate actions could cause harm
230
+ - Allocation decisions affecting legal status, housing, employment, or credit
231
+ - Unsandboxed deployments with access to sensitive accounts or files
232
+ - Commercial or real-world production use without additional testing and safeguards
233
+
234
+ ### Known limitations
235
+
236
+ - **Vision-only perception** means the model can be misled by deceptive or low-quality page rendering, prompt injections embedded in page content, or visual ambiguity in UI elements
237
+ - **Multi-step trajectories accumulate error** — a misclick early in a sequence can compound
238
+ - **Run-to-run variance** on multi-turn tasks is non-trivial; benchmark numbers are averaged over multiple runs
239
+ - The model can hallucinate page state or misattribute information from earlier screenshots
240
+
241
+ ## Responsible AI Considerations
242
+
243
+ Computer use is a powerful capability. An agent that can click, type, and submit in a real browser can also do those things wrong. We strongly recommend:
244
+
245
+ - **Human-in-the-loop monitoring** of Fara's actions on the live web with a fast way to halt execution
246
+ - **Sandboxed execution** — run Fara in an isolated container with no access to host files, environment variables, or sensitive credentials
247
+ - **Allow-listed or block-listed browsing** — restrict the agent's reachable surface to limit exposure to malicious pages
248
+ - **No credential or PII sharing** with the agent unless absolutely required and the user has authorized it
249
+ - **Output verification** — Fara can hallucinate, misattribute sources, or be misled by deceptive content; verify before acting on its outputs
250
+
251
+ ### Safety evaluation
252
+
253
+ Fara1.5-9B was evaluated via automated red-teaming on Azure. Coverage included groundedness, jailbreak resistance, harmful content (hate, violence, self-harm), and copyright violations. Safety post-training includes both refusal data for malicious tasks and the critical-points framework described above.
254
+
255
+ ### Known model risks
256
+
257
+ Like all language models, Fara1.5-9B can produce unfair, unreliable, or offensive outputs. Specific concerns:
258
+
259
+ - **Quality of service** varies across English dialects and is worse for non-English content
260
+ - **Representation harms** may persist despite safety post-training due to base-model biases
261
+ - **Information reliability** — generated content may be inaccurate or outdated
262
+ - **Prompt injection** — Fara reads page content, and adversarial content on a page may attempt to redirect its behavior
263
+
264
+ Developers deploying Fara1.5-9B should apply responsible AI best practices and ensure compliance with applicable laws and regulations. Using safety services like [Azure AI Content Safety](https://azure.microsoft.com/en-us/products/ai-services/ai-content-safety/) is recommended.
265
+
266
+ ## License
267
+
268
+ Released under the **MIT License**.
269
+
270
+ ## Contact
271
+
272
+ For information requests under the EU AI Act and related inquiries: **MSFTAIActRequest@microsoft.com**
273
+
274
+ Authorized representative: Microsoft Ireland Operations Limited, 70 Sir John Rogerson's Quay, Dublin 2, D02 R296, Ireland.
chat_template.jinja ADDED
@@ -0,0 +1,154 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {%- set image_count = namespace(value=0) %}
2
+ {%- set video_count = namespace(value=0) %}
3
+ {%- macro render_content(content, do_vision_count, is_system_content=false) %}
4
+ {%- if content is string %}
5
+ {{- content }}
6
+ {%- elif content is iterable and content is not mapping %}
7
+ {%- for item in content %}
8
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
9
+ {%- if is_system_content %}
10
+ {{- raise_exception('System message cannot contain images.') }}
11
+ {%- endif %}
12
+ {%- if do_vision_count %}
13
+ {%- set image_count.value = image_count.value + 1 %}
14
+ {%- endif %}
15
+ {%- if add_vision_id %}
16
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
17
+ {%- endif %}
18
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
19
+ {%- elif 'video' in item or item.type == 'video' %}
20
+ {%- if is_system_content %}
21
+ {{- raise_exception('System message cannot contain videos.') }}
22
+ {%- endif %}
23
+ {%- if do_vision_count %}
24
+ {%- set video_count.value = video_count.value + 1 %}
25
+ {%- endif %}
26
+ {%- if add_vision_id %}
27
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
28
+ {%- endif %}
29
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
30
+ {%- elif 'text' in item %}
31
+ {{- item.text }}
32
+ {%- else %}
33
+ {{- raise_exception('Unexpected item type in content.') }}
34
+ {%- endif %}
35
+ {%- endfor %}
36
+ {%- elif content is none or content is undefined %}
37
+ {{- '' }}
38
+ {%- else %}
39
+ {{- raise_exception('Unexpected content type.') }}
40
+ {%- endif %}
41
+ {%- endmacro %}
42
+ {%- if not messages %}
43
+ {{- raise_exception('No messages provided.') }}
44
+ {%- endif %}
45
+ {%- if tools and tools is iterable and tools is not mapping %}
46
+ {{- '<|im_start|>system\n' }}
47
+ {{- "# Tools\n\nYou have access to the following functions:\n\n<tools>" }}
48
+ {%- for tool in tools %}
49
+ {{- "\n" }}
50
+ {{- tool | tojson }}
51
+ {%- endfor %}
52
+ {{- "\n</tools>" }}
53
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n<tool_call>\n<function=example_function_name>\n<parameter=example_parameter_1>\nvalue_1\n</parameter>\n<parameter=example_parameter_2>\nThis is the value for the second parameter\nthat can span\nmultiple lines\n</parameter>\n</function>\n</tool_call>\n\n<IMPORTANT>\nReminder:\n- Function calls MUST follow the specified format: an inner <function=...></function> block must be nested within <tool_call></tool_call> XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n</IMPORTANT>' }}
54
+ {%- if messages[0].role == 'system' %}
55
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
56
+ {%- if content %}
57
+ {{- '\n\n' + content }}
58
+ {%- endif %}
59
+ {%- endif %}
60
+ {{- '<|im_end|>\n' }}
61
+ {%- else %}
62
+ {%- if messages[0].role == 'system' %}
63
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
64
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
65
+ {%- endif %}
66
+ {%- endif %}
67
+ {%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
68
+ {%- for message in messages[::-1] %}
69
+ {%- set index = (messages|length - 1) - loop.index0 %}
70
+ {%- if ns.multi_step_tool and message.role == "user" %}
71
+ {%- set content = render_content(message.content, false)|trim %}
72
+ {%- if not(content.startswith('<tool_response>') and content.endswith('</tool_response>')) %}
73
+ {%- set ns.multi_step_tool = false %}
74
+ {%- set ns.last_query_index = index %}
75
+ {%- endif %}
76
+ {%- endif %}
77
+ {%- endfor %}
78
+ {%- if ns.multi_step_tool %}
79
+ {{- raise_exception('No user query found in messages.') }}
80
+ {%- endif %}
81
+ {%- for message in messages %}
82
+ {%- set content = render_content(message.content, true)|trim %}
83
+ {%- if message.role == "system" %}
84
+ {%- if not loop.first %}
85
+ {{- raise_exception('System message must be at the beginning.') }}
86
+ {%- endif %}
87
+ {%- elif message.role == "user" %}
88
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
89
+ {%- elif message.role == "assistant" %}
90
+ {%- set reasoning_content = '' %}
91
+ {%- if message.reasoning_content is string %}
92
+ {%- set reasoning_content = message.reasoning_content %}
93
+ {%- else %}
94
+ {%- if '</think>' in content %}
95
+ {%- set reasoning_content = content.split('</think>')[0].rstrip('\n').split('<think>')[-1].lstrip('\n') %}
96
+ {%- set content = content.split('</think>')[-1].lstrip('\n') %}
97
+ {%- endif %}
98
+ {%- endif %}
99
+ {%- set reasoning_content = reasoning_content|trim %}
100
+ {%- if loop.index0 > ns.last_query_index %}
101
+ {{- '<|im_start|>' + message.role + '\n<think>\n' + reasoning_content + '\n</think>\n\n' + content }}
102
+ {%- else %}
103
+ {{- '<|im_start|>' + message.role + '\n' + content }}
104
+ {%- endif %}
105
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
106
+ {%- for tool_call in message.tool_calls %}
107
+ {%- if tool_call.function is defined %}
108
+ {%- set tool_call = tool_call.function %}
109
+ {%- endif %}
110
+ {%- if loop.first %}
111
+ {%- if content|trim %}
112
+ {{- '\n\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
113
+ {%- else %}
114
+ {{- '<tool_call>\n<function=' + tool_call.name + '>\n' }}
115
+ {%- endif %}
116
+ {%- else %}
117
+ {{- '\n<tool_call>\n<function=' + tool_call.name + '>\n' }}
118
+ {%- endif %}
119
+ {%- if tool_call.arguments is defined %}
120
+ {%- for args_name, args_value in tool_call.arguments|items %}
121
+ {{- '<parameter=' + args_name + '>\n' }}
122
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
123
+ {{- args_value }}
124
+ {{- '\n</parameter>\n' }}
125
+ {%- endfor %}
126
+ {%- endif %}
127
+ {{- '</function>\n</tool_call>' }}
128
+ {%- endfor %}
129
+ {%- endif %}
130
+ {{- '<|im_end|>\n' }}
131
+ {%- elif message.role == "tool" %}
132
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
133
+ {{- '<|im_start|>user' }}
134
+ {%- endif %}
135
+ {{- '\n<tool_response>\n' }}
136
+ {{- content }}
137
+ {{- '\n</tool_response>' }}
138
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
139
+ {{- '<|im_end|>\n' }}
140
+ {%- elif loop.last %}
141
+ {{- '<|im_end|>\n' }}
142
+ {%- endif %}
143
+ {%- else %}
144
+ {{- raise_exception('Unexpected message role.') }}
145
+ {%- endif %}
146
+ {%- endfor %}
147
+ {%- if add_generation_prompt %}
148
+ {{- '<|im_start|>assistant\n' }}
149
+ {%- if enable_thinking is defined and enable_thinking is false %}
150
+ {{- '<think>\n\n</think>\n\n' }}
151
+ {%- else %}
152
+ {{- '<think>\n' }}
153
+ {%- endif %}
154
+ {%- endif %}
config.json ADDED
@@ -0,0 +1,108 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3_5ForConditionalGeneration"
4
+ ],
5
+ "image_token_id": 248056,
6
+ "model_type": "qwen3_5",
7
+ "text_config": {
8
+ "attention_bias": false,
9
+ "attention_dropout": 0.0,
10
+ "attn_output_gate": true,
11
+ "bos_token_id": null,
12
+ "dtype": "bfloat16",
13
+ "eos_token_id": 248044,
14
+ "full_attention_interval": 4,
15
+ "head_dim": 256,
16
+ "hidden_act": "silu",
17
+ "hidden_size": 4096,
18
+ "initializer_range": 0.02,
19
+ "intermediate_size": 12288,
20
+ "layer_types": [
21
+ "linear_attention",
22
+ "linear_attention",
23
+ "linear_attention",
24
+ "full_attention",
25
+ "linear_attention",
26
+ "linear_attention",
27
+ "linear_attention",
28
+ "full_attention",
29
+ "linear_attention",
30
+ "linear_attention",
31
+ "linear_attention",
32
+ "full_attention",
33
+ "linear_attention",
34
+ "linear_attention",
35
+ "linear_attention",
36
+ "full_attention",
37
+ "linear_attention",
38
+ "linear_attention",
39
+ "linear_attention",
40
+ "full_attention",
41
+ "linear_attention",
42
+ "linear_attention",
43
+ "linear_attention",
44
+ "full_attention",
45
+ "linear_attention",
46
+ "linear_attention",
47
+ "linear_attention",
48
+ "full_attention",
49
+ "linear_attention",
50
+ "linear_attention",
51
+ "linear_attention",
52
+ "full_attention"
53
+ ],
54
+ "linear_conv_kernel_dim": 4,
55
+ "linear_key_head_dim": 128,
56
+ "linear_num_key_heads": 16,
57
+ "linear_num_value_heads": 32,
58
+ "linear_value_head_dim": 128,
59
+ "mamba_ssm_dtype": "float32",
60
+ "max_position_embeddings": 262144,
61
+ "mlp_only_layers": [],
62
+ "model_type": "qwen3_5_text",
63
+ "mtp_num_hidden_layers": 1,
64
+ "mtp_use_dedicated_embeddings": false,
65
+ "num_attention_heads": 16,
66
+ "num_hidden_layers": 32,
67
+ "num_key_value_heads": 4,
68
+ "pad_token_id": null,
69
+ "partial_rotary_factor": 0.25,
70
+ "rms_norm_eps": 1e-06,
71
+ "rope_parameters": {
72
+ "mrope_interleaved": true,
73
+ "mrope_section": [
74
+ 11,
75
+ 11,
76
+ 10
77
+ ],
78
+ "partial_rotary_factor": 0.25,
79
+ "rope_theta": 10000000,
80
+ "rope_type": "default"
81
+ },
82
+ "tie_word_embeddings": false,
83
+ "use_cache": true,
84
+ "vocab_size": 248320
85
+ },
86
+ "tie_word_embeddings": false,
87
+ "transformers_version": "5.6.2",
88
+ "video_token_id": 248057,
89
+ "vision_config": {
90
+ "deepstack_visual_indexes": [],
91
+ "depth": 27,
92
+ "dtype": "float32",
93
+ "hidden_act": "gelu_pytorch_tanh",
94
+ "hidden_size": 1152,
95
+ "in_channels": 3,
96
+ "initializer_range": 0.02,
97
+ "intermediate_size": 4304,
98
+ "model_type": "qwen3_5_vision",
99
+ "num_heads": 16,
100
+ "num_position_embeddings": 2304,
101
+ "out_hidden_size": 4096,
102
+ "patch_size": 16,
103
+ "spatial_merge_size": 2,
104
+ "temporal_patch_size": 2
105
+ },
106
+ "vision_end_token_id": 248054,
107
+ "vision_start_token_id": 248053
108
+ }
generation_config.json ADDED
@@ -0,0 +1,6 @@
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "eos_token_id": 248044,
4
+ "transformers_version": "5.4.0",
5
+ "use_cache": true
6
+ }
merges.txt ADDED
The diff for this file is too large to render. See raw diff
 
model-00001-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:67f3a84141ad12848faf30cb44092278d36a2bebf66b9c2214295717c8cc9256
3
+ size 5933189920
model-00002-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7423a1eed832f0c19da128565cff02091866ac0716fa75cb729b37408409799a
3
+ size 5996214640
model-00003-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a1326ed603b39fe7cd6f95a385648d9ff2abebcf44a725aead1b49cdf25836db
3
+ size 5998812040
model-00004-of-00004.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8db40d4df27a0bb90baf3eff67e47c54d83b652543ad2246c8f7482f3b194470
3
+ size 891503832
model.safetensors.index.json ADDED
@@ -0,0 +1,768 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "metadata": {
3
+ "total_parameters": 9409813744,
4
+ "total_size": 18819627488
5
+ },
6
+ "weight_map": {
7
+ "lm_head.weight": "model-00001-of-00004.safetensors",
8
+ "model.language_model.embed_tokens.weight": "model-00001-of-00004.safetensors",
9
+ "model.language_model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
10
+ "model.language_model.layers.0.linear_attn.A_log": "model-00001-of-00004.safetensors",
11
+ "model.language_model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
12
+ "model.language_model.layers.0.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
13
+ "model.language_model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
14
+ "model.language_model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
15
+ "model.language_model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
16
+ "model.language_model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
17
+ "model.language_model.layers.0.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
18
+ "model.language_model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
19
+ "model.language_model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
20
+ "model.language_model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
21
+ "model.language_model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
22
+ "model.language_model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
23
+ "model.language_model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
24
+ "model.language_model.layers.1.linear_attn.A_log": "model-00001-of-00004.safetensors",
25
+ "model.language_model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
26
+ "model.language_model.layers.1.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
27
+ "model.language_model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
28
+ "model.language_model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
29
+ "model.language_model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
30
+ "model.language_model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
31
+ "model.language_model.layers.1.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
32
+ "model.language_model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
33
+ "model.language_model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
34
+ "model.language_model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
35
+ "model.language_model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
36
+ "model.language_model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
37
+ "model.language_model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
38
+ "model.language_model.layers.10.linear_attn.A_log": "model-00002-of-00004.safetensors",
39
+ "model.language_model.layers.10.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
40
+ "model.language_model.layers.10.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
41
+ "model.language_model.layers.10.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
42
+ "model.language_model.layers.10.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
43
+ "model.language_model.layers.10.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
44
+ "model.language_model.layers.10.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
45
+ "model.language_model.layers.10.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
46
+ "model.language_model.layers.10.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
47
+ "model.language_model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
48
+ "model.language_model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
49
+ "model.language_model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
50
+ "model.language_model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
51
+ "model.language_model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
52
+ "model.language_model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
53
+ "model.language_model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
54
+ "model.language_model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
55
+ "model.language_model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
56
+ "model.language_model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
57
+ "model.language_model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
58
+ "model.language_model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
59
+ "model.language_model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
60
+ "model.language_model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
61
+ "model.language_model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
62
+ "model.language_model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
63
+ "model.language_model.layers.12.linear_attn.A_log": "model-00002-of-00004.safetensors",
64
+ "model.language_model.layers.12.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
65
+ "model.language_model.layers.12.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
66
+ "model.language_model.layers.12.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
67
+ "model.language_model.layers.12.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
68
+ "model.language_model.layers.12.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
69
+ "model.language_model.layers.12.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
70
+ "model.language_model.layers.12.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
71
+ "model.language_model.layers.12.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
72
+ "model.language_model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
73
+ "model.language_model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
74
+ "model.language_model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
75
+ "model.language_model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
76
+ "model.language_model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
77
+ "model.language_model.layers.13.linear_attn.A_log": "model-00002-of-00004.safetensors",
78
+ "model.language_model.layers.13.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
79
+ "model.language_model.layers.13.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
80
+ "model.language_model.layers.13.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
81
+ "model.language_model.layers.13.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
82
+ "model.language_model.layers.13.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
83
+ "model.language_model.layers.13.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
84
+ "model.language_model.layers.13.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
85
+ "model.language_model.layers.13.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
86
+ "model.language_model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
87
+ "model.language_model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
88
+ "model.language_model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
89
+ "model.language_model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
90
+ "model.language_model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
91
+ "model.language_model.layers.14.linear_attn.A_log": "model-00002-of-00004.safetensors",
92
+ "model.language_model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
93
+ "model.language_model.layers.14.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
94
+ "model.language_model.layers.14.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
95
+ "model.language_model.layers.14.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
96
+ "model.language_model.layers.14.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
97
+ "model.language_model.layers.14.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
98
+ "model.language_model.layers.14.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
99
+ "model.language_model.layers.14.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
100
+ "model.language_model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
101
+ "model.language_model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
102
+ "model.language_model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
103
+ "model.language_model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
104
+ "model.language_model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
105
+ "model.language_model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
106
+ "model.language_model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
107
+ "model.language_model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
108
+ "model.language_model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
109
+ "model.language_model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
110
+ "model.language_model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
111
+ "model.language_model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
112
+ "model.language_model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
113
+ "model.language_model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
114
+ "model.language_model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
115
+ "model.language_model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
116
+ "model.language_model.layers.16.linear_attn.A_log": "model-00002-of-00004.safetensors",
117
+ "model.language_model.layers.16.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
118
+ "model.language_model.layers.16.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
119
+ "model.language_model.layers.16.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
120
+ "model.language_model.layers.16.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
121
+ "model.language_model.layers.16.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
122
+ "model.language_model.layers.16.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
123
+ "model.language_model.layers.16.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
124
+ "model.language_model.layers.16.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
125
+ "model.language_model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
126
+ "model.language_model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
127
+ "model.language_model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
128
+ "model.language_model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
129
+ "model.language_model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
130
+ "model.language_model.layers.17.linear_attn.A_log": "model-00002-of-00004.safetensors",
131
+ "model.language_model.layers.17.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
132
+ "model.language_model.layers.17.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
133
+ "model.language_model.layers.17.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
134
+ "model.language_model.layers.17.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
135
+ "model.language_model.layers.17.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
136
+ "model.language_model.layers.17.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
137
+ "model.language_model.layers.17.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
138
+ "model.language_model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
139
+ "model.language_model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
140
+ "model.language_model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
141
+ "model.language_model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
142
+ "model.language_model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
143
+ "model.language_model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
144
+ "model.language_model.layers.18.linear_attn.A_log": "model-00002-of-00004.safetensors",
145
+ "model.language_model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
146
+ "model.language_model.layers.18.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
147
+ "model.language_model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
148
+ "model.language_model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
149
+ "model.language_model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
150
+ "model.language_model.layers.18.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
151
+ "model.language_model.layers.18.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
152
+ "model.language_model.layers.18.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
153
+ "model.language_model.layers.18.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
154
+ "model.language_model.layers.18.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
155
+ "model.language_model.layers.18.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
156
+ "model.language_model.layers.18.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
157
+ "model.language_model.layers.19.input_layernorm.weight": "model-00003-of-00004.safetensors",
158
+ "model.language_model.layers.19.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
159
+ "model.language_model.layers.19.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
160
+ "model.language_model.layers.19.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
161
+ "model.language_model.layers.19.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
162
+ "model.language_model.layers.19.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
163
+ "model.language_model.layers.19.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
164
+ "model.language_model.layers.19.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
165
+ "model.language_model.layers.19.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
166
+ "model.language_model.layers.19.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
167
+ "model.language_model.layers.19.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
168
+ "model.language_model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
169
+ "model.language_model.layers.2.linear_attn.A_log": "model-00001-of-00004.safetensors",
170
+ "model.language_model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
171
+ "model.language_model.layers.2.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
172
+ "model.language_model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
173
+ "model.language_model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
174
+ "model.language_model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
175
+ "model.language_model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
176
+ "model.language_model.layers.2.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
177
+ "model.language_model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
178
+ "model.language_model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
179
+ "model.language_model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
180
+ "model.language_model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
181
+ "model.language_model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
182
+ "model.language_model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
183
+ "model.language_model.layers.20.linear_attn.A_log": "model-00003-of-00004.safetensors",
184
+ "model.language_model.layers.20.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
185
+ "model.language_model.layers.20.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
186
+ "model.language_model.layers.20.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
187
+ "model.language_model.layers.20.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
188
+ "model.language_model.layers.20.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
189
+ "model.language_model.layers.20.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
190
+ "model.language_model.layers.20.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
191
+ "model.language_model.layers.20.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
192
+ "model.language_model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
193
+ "model.language_model.layers.20.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
194
+ "model.language_model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
195
+ "model.language_model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
196
+ "model.language_model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
197
+ "model.language_model.layers.21.linear_attn.A_log": "model-00003-of-00004.safetensors",
198
+ "model.language_model.layers.21.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
199
+ "model.language_model.layers.21.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
200
+ "model.language_model.layers.21.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
201
+ "model.language_model.layers.21.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
202
+ "model.language_model.layers.21.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
203
+ "model.language_model.layers.21.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
204
+ "model.language_model.layers.21.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
205
+ "model.language_model.layers.21.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
206
+ "model.language_model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
207
+ "model.language_model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
208
+ "model.language_model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
209
+ "model.language_model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
210
+ "model.language_model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
211
+ "model.language_model.layers.22.linear_attn.A_log": "model-00003-of-00004.safetensors",
212
+ "model.language_model.layers.22.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
213
+ "model.language_model.layers.22.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
214
+ "model.language_model.layers.22.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
215
+ "model.language_model.layers.22.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
216
+ "model.language_model.layers.22.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
217
+ "model.language_model.layers.22.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
218
+ "model.language_model.layers.22.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
219
+ "model.language_model.layers.22.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
220
+ "model.language_model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
221
+ "model.language_model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
222
+ "model.language_model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
223
+ "model.language_model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
224
+ "model.language_model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
225
+ "model.language_model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
226
+ "model.language_model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
227
+ "model.language_model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
228
+ "model.language_model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
229
+ "model.language_model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
230
+ "model.language_model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
231
+ "model.language_model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
232
+ "model.language_model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
233
+ "model.language_model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
234
+ "model.language_model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
235
+ "model.language_model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
236
+ "model.language_model.layers.24.linear_attn.A_log": "model-00003-of-00004.safetensors",
237
+ "model.language_model.layers.24.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
238
+ "model.language_model.layers.24.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
239
+ "model.language_model.layers.24.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
240
+ "model.language_model.layers.24.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
241
+ "model.language_model.layers.24.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
242
+ "model.language_model.layers.24.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
243
+ "model.language_model.layers.24.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
244
+ "model.language_model.layers.24.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
245
+ "model.language_model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
246
+ "model.language_model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
247
+ "model.language_model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
248
+ "model.language_model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
249
+ "model.language_model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
250
+ "model.language_model.layers.25.linear_attn.A_log": "model-00003-of-00004.safetensors",
251
+ "model.language_model.layers.25.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
252
+ "model.language_model.layers.25.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
253
+ "model.language_model.layers.25.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
254
+ "model.language_model.layers.25.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
255
+ "model.language_model.layers.25.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
256
+ "model.language_model.layers.25.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
257
+ "model.language_model.layers.25.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
258
+ "model.language_model.layers.25.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
259
+ "model.language_model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
260
+ "model.language_model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
261
+ "model.language_model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
262
+ "model.language_model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
263
+ "model.language_model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
264
+ "model.language_model.layers.26.linear_attn.A_log": "model-00003-of-00004.safetensors",
265
+ "model.language_model.layers.26.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
266
+ "model.language_model.layers.26.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
267
+ "model.language_model.layers.26.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
268
+ "model.language_model.layers.26.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
269
+ "model.language_model.layers.26.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
270
+ "model.language_model.layers.26.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
271
+ "model.language_model.layers.26.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
272
+ "model.language_model.layers.26.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
273
+ "model.language_model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
274
+ "model.language_model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
275
+ "model.language_model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
276
+ "model.language_model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
277
+ "model.language_model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
278
+ "model.language_model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
279
+ "model.language_model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
280
+ "model.language_model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
281
+ "model.language_model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
282
+ "model.language_model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
283
+ "model.language_model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
284
+ "model.language_model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
285
+ "model.language_model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
286
+ "model.language_model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
287
+ "model.language_model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
288
+ "model.language_model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
289
+ "model.language_model.layers.28.linear_attn.A_log": "model-00003-of-00004.safetensors",
290
+ "model.language_model.layers.28.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
291
+ "model.language_model.layers.28.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
292
+ "model.language_model.layers.28.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
293
+ "model.language_model.layers.28.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
294
+ "model.language_model.layers.28.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
295
+ "model.language_model.layers.28.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
296
+ "model.language_model.layers.28.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
297
+ "model.language_model.layers.28.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
298
+ "model.language_model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
299
+ "model.language_model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
300
+ "model.language_model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
301
+ "model.language_model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
302
+ "model.language_model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
303
+ "model.language_model.layers.29.linear_attn.A_log": "model-00003-of-00004.safetensors",
304
+ "model.language_model.layers.29.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
305
+ "model.language_model.layers.29.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
306
+ "model.language_model.layers.29.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
307
+ "model.language_model.layers.29.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
308
+ "model.language_model.layers.29.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
309
+ "model.language_model.layers.29.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
310
+ "model.language_model.layers.29.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
311
+ "model.language_model.layers.29.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
312
+ "model.language_model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
313
+ "model.language_model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
314
+ "model.language_model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
315
+ "model.language_model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
316
+ "model.language_model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
317
+ "model.language_model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
318
+ "model.language_model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
319
+ "model.language_model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
320
+ "model.language_model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
321
+ "model.language_model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors",
322
+ "model.language_model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
323
+ "model.language_model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
324
+ "model.language_model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors",
325
+ "model.language_model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
326
+ "model.language_model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
327
+ "model.language_model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
328
+ "model.language_model.layers.30.linear_attn.A_log": "model-00003-of-00004.safetensors",
329
+ "model.language_model.layers.30.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors",
330
+ "model.language_model.layers.30.linear_attn.dt_bias": "model-00003-of-00004.safetensors",
331
+ "model.language_model.layers.30.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors",
332
+ "model.language_model.layers.30.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors",
333
+ "model.language_model.layers.30.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors",
334
+ "model.language_model.layers.30.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors",
335
+ "model.language_model.layers.30.linear_attn.norm.weight": "model-00003-of-00004.safetensors",
336
+ "model.language_model.layers.30.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors",
337
+ "model.language_model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
338
+ "model.language_model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
339
+ "model.language_model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
340
+ "model.language_model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
341
+ "model.language_model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors",
342
+ "model.language_model.layers.31.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
343
+ "model.language_model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
344
+ "model.language_model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
345
+ "model.language_model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
346
+ "model.language_model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors",
347
+ "model.language_model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
348
+ "model.language_model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
349
+ "model.language_model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors",
350
+ "model.language_model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
351
+ "model.language_model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
352
+ "model.language_model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
353
+ "model.language_model.layers.4.linear_attn.A_log": "model-00001-of-00004.safetensors",
354
+ "model.language_model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors",
355
+ "model.language_model.layers.4.linear_attn.dt_bias": "model-00001-of-00004.safetensors",
356
+ "model.language_model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors",
357
+ "model.language_model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors",
358
+ "model.language_model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors",
359
+ "model.language_model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors",
360
+ "model.language_model.layers.4.linear_attn.norm.weight": "model-00001-of-00004.safetensors",
361
+ "model.language_model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors",
362
+ "model.language_model.layers.4.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
363
+ "model.language_model.layers.4.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
364
+ "model.language_model.layers.4.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
365
+ "model.language_model.layers.4.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
366
+ "model.language_model.layers.5.input_layernorm.weight": "model-00002-of-00004.safetensors",
367
+ "model.language_model.layers.5.linear_attn.A_log": "model-00002-of-00004.safetensors",
368
+ "model.language_model.layers.5.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
369
+ "model.language_model.layers.5.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
370
+ "model.language_model.layers.5.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
371
+ "model.language_model.layers.5.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
372
+ "model.language_model.layers.5.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
373
+ "model.language_model.layers.5.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
374
+ "model.language_model.layers.5.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
375
+ "model.language_model.layers.5.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
376
+ "model.language_model.layers.5.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
377
+ "model.language_model.layers.5.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
378
+ "model.language_model.layers.5.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
379
+ "model.language_model.layers.5.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
380
+ "model.language_model.layers.6.input_layernorm.weight": "model-00002-of-00004.safetensors",
381
+ "model.language_model.layers.6.linear_attn.A_log": "model-00002-of-00004.safetensors",
382
+ "model.language_model.layers.6.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
383
+ "model.language_model.layers.6.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
384
+ "model.language_model.layers.6.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
385
+ "model.language_model.layers.6.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
386
+ "model.language_model.layers.6.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
387
+ "model.language_model.layers.6.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
388
+ "model.language_model.layers.6.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
389
+ "model.language_model.layers.6.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
390
+ "model.language_model.layers.6.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
391
+ "model.language_model.layers.6.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
392
+ "model.language_model.layers.6.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
393
+ "model.language_model.layers.6.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
394
+ "model.language_model.layers.7.input_layernorm.weight": "model-00002-of-00004.safetensors",
395
+ "model.language_model.layers.7.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
396
+ "model.language_model.layers.7.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
397
+ "model.language_model.layers.7.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
398
+ "model.language_model.layers.7.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
399
+ "model.language_model.layers.7.self_attn.k_norm.weight": "model-00002-of-00004.safetensors",
400
+ "model.language_model.layers.7.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
401
+ "model.language_model.layers.7.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
402
+ "model.language_model.layers.7.self_attn.q_norm.weight": "model-00002-of-00004.safetensors",
403
+ "model.language_model.layers.7.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
404
+ "model.language_model.layers.7.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
405
+ "model.language_model.layers.8.input_layernorm.weight": "model-00002-of-00004.safetensors",
406
+ "model.language_model.layers.8.linear_attn.A_log": "model-00002-of-00004.safetensors",
407
+ "model.language_model.layers.8.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
408
+ "model.language_model.layers.8.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
409
+ "model.language_model.layers.8.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
410
+ "model.language_model.layers.8.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
411
+ "model.language_model.layers.8.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
412
+ "model.language_model.layers.8.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
413
+ "model.language_model.layers.8.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
414
+ "model.language_model.layers.8.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
415
+ "model.language_model.layers.8.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
416
+ "model.language_model.layers.8.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
417
+ "model.language_model.layers.8.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
418
+ "model.language_model.layers.8.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
419
+ "model.language_model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
420
+ "model.language_model.layers.9.linear_attn.A_log": "model-00002-of-00004.safetensors",
421
+ "model.language_model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors",
422
+ "model.language_model.layers.9.linear_attn.dt_bias": "model-00002-of-00004.safetensors",
423
+ "model.language_model.layers.9.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors",
424
+ "model.language_model.layers.9.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors",
425
+ "model.language_model.layers.9.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors",
426
+ "model.language_model.layers.9.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors",
427
+ "model.language_model.layers.9.linear_attn.norm.weight": "model-00002-of-00004.safetensors",
428
+ "model.language_model.layers.9.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors",
429
+ "model.language_model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
430
+ "model.language_model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
431
+ "model.language_model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
432
+ "model.language_model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
433
+ "model.language_model.norm.weight": "model-00003-of-00004.safetensors",
434
+ "model.visual.blocks.0.attn.proj.bias": "model-00003-of-00004.safetensors",
435
+ "model.visual.blocks.0.attn.proj.weight": "model-00003-of-00004.safetensors",
436
+ "model.visual.blocks.0.attn.qkv.bias": "model-00003-of-00004.safetensors",
437
+ "model.visual.blocks.0.attn.qkv.weight": "model-00003-of-00004.safetensors",
438
+ "model.visual.blocks.0.mlp.linear_fc1.bias": "model-00003-of-00004.safetensors",
439
+ "model.visual.blocks.0.mlp.linear_fc1.weight": "model-00003-of-00004.safetensors",
440
+ "model.visual.blocks.0.mlp.linear_fc2.bias": "model-00003-of-00004.safetensors",
441
+ "model.visual.blocks.0.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
442
+ "model.visual.blocks.0.norm1.bias": "model-00004-of-00004.safetensors",
443
+ "model.visual.blocks.0.norm1.weight": "model-00004-of-00004.safetensors",
444
+ "model.visual.blocks.0.norm2.bias": "model-00004-of-00004.safetensors",
445
+ "model.visual.blocks.0.norm2.weight": "model-00004-of-00004.safetensors",
446
+ "model.visual.blocks.1.attn.proj.bias": "model-00004-of-00004.safetensors",
447
+ "model.visual.blocks.1.attn.proj.weight": "model-00004-of-00004.safetensors",
448
+ "model.visual.blocks.1.attn.qkv.bias": "model-00004-of-00004.safetensors",
449
+ "model.visual.blocks.1.attn.qkv.weight": "model-00004-of-00004.safetensors",
450
+ "model.visual.blocks.1.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
451
+ "model.visual.blocks.1.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
452
+ "model.visual.blocks.1.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
453
+ "model.visual.blocks.1.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
454
+ "model.visual.blocks.1.norm1.bias": "model-00004-of-00004.safetensors",
455
+ "model.visual.blocks.1.norm1.weight": "model-00004-of-00004.safetensors",
456
+ "model.visual.blocks.1.norm2.bias": "model-00004-of-00004.safetensors",
457
+ "model.visual.blocks.1.norm2.weight": "model-00004-of-00004.safetensors",
458
+ "model.visual.blocks.10.attn.proj.bias": "model-00004-of-00004.safetensors",
459
+ "model.visual.blocks.10.attn.proj.weight": "model-00004-of-00004.safetensors",
460
+ "model.visual.blocks.10.attn.qkv.bias": "model-00004-of-00004.safetensors",
461
+ "model.visual.blocks.10.attn.qkv.weight": "model-00004-of-00004.safetensors",
462
+ "model.visual.blocks.10.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
463
+ "model.visual.blocks.10.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
464
+ "model.visual.blocks.10.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
465
+ "model.visual.blocks.10.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
466
+ "model.visual.blocks.10.norm1.bias": "model-00004-of-00004.safetensors",
467
+ "model.visual.blocks.10.norm1.weight": "model-00004-of-00004.safetensors",
468
+ "model.visual.blocks.10.norm2.bias": "model-00004-of-00004.safetensors",
469
+ "model.visual.blocks.10.norm2.weight": "model-00004-of-00004.safetensors",
470
+ "model.visual.blocks.11.attn.proj.bias": "model-00004-of-00004.safetensors",
471
+ "model.visual.blocks.11.attn.proj.weight": "model-00004-of-00004.safetensors",
472
+ "model.visual.blocks.11.attn.qkv.bias": "model-00004-of-00004.safetensors",
473
+ "model.visual.blocks.11.attn.qkv.weight": "model-00004-of-00004.safetensors",
474
+ "model.visual.blocks.11.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
475
+ "model.visual.blocks.11.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
476
+ "model.visual.blocks.11.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
477
+ "model.visual.blocks.11.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
478
+ "model.visual.blocks.11.norm1.bias": "model-00004-of-00004.safetensors",
479
+ "model.visual.blocks.11.norm1.weight": "model-00004-of-00004.safetensors",
480
+ "model.visual.blocks.11.norm2.bias": "model-00004-of-00004.safetensors",
481
+ "model.visual.blocks.11.norm2.weight": "model-00004-of-00004.safetensors",
482
+ "model.visual.blocks.12.attn.proj.bias": "model-00004-of-00004.safetensors",
483
+ "model.visual.blocks.12.attn.proj.weight": "model-00004-of-00004.safetensors",
484
+ "model.visual.blocks.12.attn.qkv.bias": "model-00004-of-00004.safetensors",
485
+ "model.visual.blocks.12.attn.qkv.weight": "model-00004-of-00004.safetensors",
486
+ "model.visual.blocks.12.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
487
+ "model.visual.blocks.12.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
488
+ "model.visual.blocks.12.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
489
+ "model.visual.blocks.12.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
490
+ "model.visual.blocks.12.norm1.bias": "model-00004-of-00004.safetensors",
491
+ "model.visual.blocks.12.norm1.weight": "model-00004-of-00004.safetensors",
492
+ "model.visual.blocks.12.norm2.bias": "model-00004-of-00004.safetensors",
493
+ "model.visual.blocks.12.norm2.weight": "model-00004-of-00004.safetensors",
494
+ "model.visual.blocks.13.attn.proj.bias": "model-00004-of-00004.safetensors",
495
+ "model.visual.blocks.13.attn.proj.weight": "model-00004-of-00004.safetensors",
496
+ "model.visual.blocks.13.attn.qkv.bias": "model-00004-of-00004.safetensors",
497
+ "model.visual.blocks.13.attn.qkv.weight": "model-00004-of-00004.safetensors",
498
+ "model.visual.blocks.13.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
499
+ "model.visual.blocks.13.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
500
+ "model.visual.blocks.13.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
501
+ "model.visual.blocks.13.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
502
+ "model.visual.blocks.13.norm1.bias": "model-00004-of-00004.safetensors",
503
+ "model.visual.blocks.13.norm1.weight": "model-00004-of-00004.safetensors",
504
+ "model.visual.blocks.13.norm2.bias": "model-00004-of-00004.safetensors",
505
+ "model.visual.blocks.13.norm2.weight": "model-00004-of-00004.safetensors",
506
+ "model.visual.blocks.14.attn.proj.bias": "model-00004-of-00004.safetensors",
507
+ "model.visual.blocks.14.attn.proj.weight": "model-00004-of-00004.safetensors",
508
+ "model.visual.blocks.14.attn.qkv.bias": "model-00004-of-00004.safetensors",
509
+ "model.visual.blocks.14.attn.qkv.weight": "model-00004-of-00004.safetensors",
510
+ "model.visual.blocks.14.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
511
+ "model.visual.blocks.14.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
512
+ "model.visual.blocks.14.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
513
+ "model.visual.blocks.14.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
514
+ "model.visual.blocks.14.norm1.bias": "model-00004-of-00004.safetensors",
515
+ "model.visual.blocks.14.norm1.weight": "model-00004-of-00004.safetensors",
516
+ "model.visual.blocks.14.norm2.bias": "model-00004-of-00004.safetensors",
517
+ "model.visual.blocks.14.norm2.weight": "model-00004-of-00004.safetensors",
518
+ "model.visual.blocks.15.attn.proj.bias": "model-00004-of-00004.safetensors",
519
+ "model.visual.blocks.15.attn.proj.weight": "model-00004-of-00004.safetensors",
520
+ "model.visual.blocks.15.attn.qkv.bias": "model-00004-of-00004.safetensors",
521
+ "model.visual.blocks.15.attn.qkv.weight": "model-00004-of-00004.safetensors",
522
+ "model.visual.blocks.15.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
523
+ "model.visual.blocks.15.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
524
+ "model.visual.blocks.15.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
525
+ "model.visual.blocks.15.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
526
+ "model.visual.blocks.15.norm1.bias": "model-00004-of-00004.safetensors",
527
+ "model.visual.blocks.15.norm1.weight": "model-00004-of-00004.safetensors",
528
+ "model.visual.blocks.15.norm2.bias": "model-00004-of-00004.safetensors",
529
+ "model.visual.blocks.15.norm2.weight": "model-00004-of-00004.safetensors",
530
+ "model.visual.blocks.16.attn.proj.bias": "model-00004-of-00004.safetensors",
531
+ "model.visual.blocks.16.attn.proj.weight": "model-00004-of-00004.safetensors",
532
+ "model.visual.blocks.16.attn.qkv.bias": "model-00004-of-00004.safetensors",
533
+ "model.visual.blocks.16.attn.qkv.weight": "model-00004-of-00004.safetensors",
534
+ "model.visual.blocks.16.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
535
+ "model.visual.blocks.16.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
536
+ "model.visual.blocks.16.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
537
+ "model.visual.blocks.16.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
538
+ "model.visual.blocks.16.norm1.bias": "model-00004-of-00004.safetensors",
539
+ "model.visual.blocks.16.norm1.weight": "model-00004-of-00004.safetensors",
540
+ "model.visual.blocks.16.norm2.bias": "model-00004-of-00004.safetensors",
541
+ "model.visual.blocks.16.norm2.weight": "model-00004-of-00004.safetensors",
542
+ "model.visual.blocks.17.attn.proj.bias": "model-00004-of-00004.safetensors",
543
+ "model.visual.blocks.17.attn.proj.weight": "model-00004-of-00004.safetensors",
544
+ "model.visual.blocks.17.attn.qkv.bias": "model-00004-of-00004.safetensors",
545
+ "model.visual.blocks.17.attn.qkv.weight": "model-00004-of-00004.safetensors",
546
+ "model.visual.blocks.17.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
547
+ "model.visual.blocks.17.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
548
+ "model.visual.blocks.17.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
549
+ "model.visual.blocks.17.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
550
+ "model.visual.blocks.17.norm1.bias": "model-00004-of-00004.safetensors",
551
+ "model.visual.blocks.17.norm1.weight": "model-00004-of-00004.safetensors",
552
+ "model.visual.blocks.17.norm2.bias": "model-00004-of-00004.safetensors",
553
+ "model.visual.blocks.17.norm2.weight": "model-00004-of-00004.safetensors",
554
+ "model.visual.blocks.18.attn.proj.bias": "model-00004-of-00004.safetensors",
555
+ "model.visual.blocks.18.attn.proj.weight": "model-00004-of-00004.safetensors",
556
+ "model.visual.blocks.18.attn.qkv.bias": "model-00004-of-00004.safetensors",
557
+ "model.visual.blocks.18.attn.qkv.weight": "model-00004-of-00004.safetensors",
558
+ "model.visual.blocks.18.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
559
+ "model.visual.blocks.18.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
560
+ "model.visual.blocks.18.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
561
+ "model.visual.blocks.18.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
562
+ "model.visual.blocks.18.norm1.bias": "model-00004-of-00004.safetensors",
563
+ "model.visual.blocks.18.norm1.weight": "model-00004-of-00004.safetensors",
564
+ "model.visual.blocks.18.norm2.bias": "model-00004-of-00004.safetensors",
565
+ "model.visual.blocks.18.norm2.weight": "model-00004-of-00004.safetensors",
566
+ "model.visual.blocks.19.attn.proj.bias": "model-00004-of-00004.safetensors",
567
+ "model.visual.blocks.19.attn.proj.weight": "model-00004-of-00004.safetensors",
568
+ "model.visual.blocks.19.attn.qkv.bias": "model-00004-of-00004.safetensors",
569
+ "model.visual.blocks.19.attn.qkv.weight": "model-00004-of-00004.safetensors",
570
+ "model.visual.blocks.19.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
571
+ "model.visual.blocks.19.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
572
+ "model.visual.blocks.19.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
573
+ "model.visual.blocks.19.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
574
+ "model.visual.blocks.19.norm1.bias": "model-00004-of-00004.safetensors",
575
+ "model.visual.blocks.19.norm1.weight": "model-00004-of-00004.safetensors",
576
+ "model.visual.blocks.19.norm2.bias": "model-00004-of-00004.safetensors",
577
+ "model.visual.blocks.19.norm2.weight": "model-00004-of-00004.safetensors",
578
+ "model.visual.blocks.2.attn.proj.bias": "model-00004-of-00004.safetensors",
579
+ "model.visual.blocks.2.attn.proj.weight": "model-00004-of-00004.safetensors",
580
+ "model.visual.blocks.2.attn.qkv.bias": "model-00004-of-00004.safetensors",
581
+ "model.visual.blocks.2.attn.qkv.weight": "model-00004-of-00004.safetensors",
582
+ "model.visual.blocks.2.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
583
+ "model.visual.blocks.2.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
584
+ "model.visual.blocks.2.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
585
+ "model.visual.blocks.2.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
586
+ "model.visual.blocks.2.norm1.bias": "model-00004-of-00004.safetensors",
587
+ "model.visual.blocks.2.norm1.weight": "model-00004-of-00004.safetensors",
588
+ "model.visual.blocks.2.norm2.bias": "model-00004-of-00004.safetensors",
589
+ "model.visual.blocks.2.norm2.weight": "model-00004-of-00004.safetensors",
590
+ "model.visual.blocks.20.attn.proj.bias": "model-00004-of-00004.safetensors",
591
+ "model.visual.blocks.20.attn.proj.weight": "model-00004-of-00004.safetensors",
592
+ "model.visual.blocks.20.attn.qkv.bias": "model-00004-of-00004.safetensors",
593
+ "model.visual.blocks.20.attn.qkv.weight": "model-00004-of-00004.safetensors",
594
+ "model.visual.blocks.20.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
595
+ "model.visual.blocks.20.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
596
+ "model.visual.blocks.20.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
597
+ "model.visual.blocks.20.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
598
+ "model.visual.blocks.20.norm1.bias": "model-00004-of-00004.safetensors",
599
+ "model.visual.blocks.20.norm1.weight": "model-00004-of-00004.safetensors",
600
+ "model.visual.blocks.20.norm2.bias": "model-00004-of-00004.safetensors",
601
+ "model.visual.blocks.20.norm2.weight": "model-00004-of-00004.safetensors",
602
+ "model.visual.blocks.21.attn.proj.bias": "model-00004-of-00004.safetensors",
603
+ "model.visual.blocks.21.attn.proj.weight": "model-00004-of-00004.safetensors",
604
+ "model.visual.blocks.21.attn.qkv.bias": "model-00004-of-00004.safetensors",
605
+ "model.visual.blocks.21.attn.qkv.weight": "model-00004-of-00004.safetensors",
606
+ "model.visual.blocks.21.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
607
+ "model.visual.blocks.21.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
608
+ "model.visual.blocks.21.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
609
+ "model.visual.blocks.21.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
610
+ "model.visual.blocks.21.norm1.bias": "model-00004-of-00004.safetensors",
611
+ "model.visual.blocks.21.norm1.weight": "model-00004-of-00004.safetensors",
612
+ "model.visual.blocks.21.norm2.bias": "model-00004-of-00004.safetensors",
613
+ "model.visual.blocks.21.norm2.weight": "model-00004-of-00004.safetensors",
614
+ "model.visual.blocks.22.attn.proj.bias": "model-00004-of-00004.safetensors",
615
+ "model.visual.blocks.22.attn.proj.weight": "model-00004-of-00004.safetensors",
616
+ "model.visual.blocks.22.attn.qkv.bias": "model-00004-of-00004.safetensors",
617
+ "model.visual.blocks.22.attn.qkv.weight": "model-00004-of-00004.safetensors",
618
+ "model.visual.blocks.22.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
619
+ "model.visual.blocks.22.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
620
+ "model.visual.blocks.22.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
621
+ "model.visual.blocks.22.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
622
+ "model.visual.blocks.22.norm1.bias": "model-00004-of-00004.safetensors",
623
+ "model.visual.blocks.22.norm1.weight": "model-00004-of-00004.safetensors",
624
+ "model.visual.blocks.22.norm2.bias": "model-00004-of-00004.safetensors",
625
+ "model.visual.blocks.22.norm2.weight": "model-00004-of-00004.safetensors",
626
+ "model.visual.blocks.23.attn.proj.bias": "model-00004-of-00004.safetensors",
627
+ "model.visual.blocks.23.attn.proj.weight": "model-00004-of-00004.safetensors",
628
+ "model.visual.blocks.23.attn.qkv.bias": "model-00004-of-00004.safetensors",
629
+ "model.visual.blocks.23.attn.qkv.weight": "model-00004-of-00004.safetensors",
630
+ "model.visual.blocks.23.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
631
+ "model.visual.blocks.23.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
632
+ "model.visual.blocks.23.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
633
+ "model.visual.blocks.23.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
634
+ "model.visual.blocks.23.norm1.bias": "model-00004-of-00004.safetensors",
635
+ "model.visual.blocks.23.norm1.weight": "model-00004-of-00004.safetensors",
636
+ "model.visual.blocks.23.norm2.bias": "model-00004-of-00004.safetensors",
637
+ "model.visual.blocks.23.norm2.weight": "model-00004-of-00004.safetensors",
638
+ "model.visual.blocks.24.attn.proj.bias": "model-00004-of-00004.safetensors",
639
+ "model.visual.blocks.24.attn.proj.weight": "model-00004-of-00004.safetensors",
640
+ "model.visual.blocks.24.attn.qkv.bias": "model-00004-of-00004.safetensors",
641
+ "model.visual.blocks.24.attn.qkv.weight": "model-00004-of-00004.safetensors",
642
+ "model.visual.blocks.24.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
643
+ "model.visual.blocks.24.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
644
+ "model.visual.blocks.24.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
645
+ "model.visual.blocks.24.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
646
+ "model.visual.blocks.24.norm1.bias": "model-00004-of-00004.safetensors",
647
+ "model.visual.blocks.24.norm1.weight": "model-00004-of-00004.safetensors",
648
+ "model.visual.blocks.24.norm2.bias": "model-00004-of-00004.safetensors",
649
+ "model.visual.blocks.24.norm2.weight": "model-00004-of-00004.safetensors",
650
+ "model.visual.blocks.25.attn.proj.bias": "model-00004-of-00004.safetensors",
651
+ "model.visual.blocks.25.attn.proj.weight": "model-00004-of-00004.safetensors",
652
+ "model.visual.blocks.25.attn.qkv.bias": "model-00004-of-00004.safetensors",
653
+ "model.visual.blocks.25.attn.qkv.weight": "model-00004-of-00004.safetensors",
654
+ "model.visual.blocks.25.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
655
+ "model.visual.blocks.25.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
656
+ "model.visual.blocks.25.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
657
+ "model.visual.blocks.25.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
658
+ "model.visual.blocks.25.norm1.bias": "model-00004-of-00004.safetensors",
659
+ "model.visual.blocks.25.norm1.weight": "model-00004-of-00004.safetensors",
660
+ "model.visual.blocks.25.norm2.bias": "model-00004-of-00004.safetensors",
661
+ "model.visual.blocks.25.norm2.weight": "model-00004-of-00004.safetensors",
662
+ "model.visual.blocks.26.attn.proj.bias": "model-00004-of-00004.safetensors",
663
+ "model.visual.blocks.26.attn.proj.weight": "model-00004-of-00004.safetensors",
664
+ "model.visual.blocks.26.attn.qkv.bias": "model-00004-of-00004.safetensors",
665
+ "model.visual.blocks.26.attn.qkv.weight": "model-00004-of-00004.safetensors",
666
+ "model.visual.blocks.26.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
667
+ "model.visual.blocks.26.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
668
+ "model.visual.blocks.26.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
669
+ "model.visual.blocks.26.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
670
+ "model.visual.blocks.26.norm1.bias": "model-00004-of-00004.safetensors",
671
+ "model.visual.blocks.26.norm1.weight": "model-00004-of-00004.safetensors",
672
+ "model.visual.blocks.26.norm2.bias": "model-00004-of-00004.safetensors",
673
+ "model.visual.blocks.26.norm2.weight": "model-00004-of-00004.safetensors",
674
+ "model.visual.blocks.3.attn.proj.bias": "model-00004-of-00004.safetensors",
675
+ "model.visual.blocks.3.attn.proj.weight": "model-00004-of-00004.safetensors",
676
+ "model.visual.blocks.3.attn.qkv.bias": "model-00004-of-00004.safetensors",
677
+ "model.visual.blocks.3.attn.qkv.weight": "model-00004-of-00004.safetensors",
678
+ "model.visual.blocks.3.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
679
+ "model.visual.blocks.3.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
680
+ "model.visual.blocks.3.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
681
+ "model.visual.blocks.3.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
682
+ "model.visual.blocks.3.norm1.bias": "model-00004-of-00004.safetensors",
683
+ "model.visual.blocks.3.norm1.weight": "model-00004-of-00004.safetensors",
684
+ "model.visual.blocks.3.norm2.bias": "model-00004-of-00004.safetensors",
685
+ "model.visual.blocks.3.norm2.weight": "model-00004-of-00004.safetensors",
686
+ "model.visual.blocks.4.attn.proj.bias": "model-00004-of-00004.safetensors",
687
+ "model.visual.blocks.4.attn.proj.weight": "model-00004-of-00004.safetensors",
688
+ "model.visual.blocks.4.attn.qkv.bias": "model-00004-of-00004.safetensors",
689
+ "model.visual.blocks.4.attn.qkv.weight": "model-00004-of-00004.safetensors",
690
+ "model.visual.blocks.4.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
691
+ "model.visual.blocks.4.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
692
+ "model.visual.blocks.4.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
693
+ "model.visual.blocks.4.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
694
+ "model.visual.blocks.4.norm1.bias": "model-00004-of-00004.safetensors",
695
+ "model.visual.blocks.4.norm1.weight": "model-00004-of-00004.safetensors",
696
+ "model.visual.blocks.4.norm2.bias": "model-00004-of-00004.safetensors",
697
+ "model.visual.blocks.4.norm2.weight": "model-00004-of-00004.safetensors",
698
+ "model.visual.blocks.5.attn.proj.bias": "model-00004-of-00004.safetensors",
699
+ "model.visual.blocks.5.attn.proj.weight": "model-00004-of-00004.safetensors",
700
+ "model.visual.blocks.5.attn.qkv.bias": "model-00004-of-00004.safetensors",
701
+ "model.visual.blocks.5.attn.qkv.weight": "model-00004-of-00004.safetensors",
702
+ "model.visual.blocks.5.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
703
+ "model.visual.blocks.5.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
704
+ "model.visual.blocks.5.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
705
+ "model.visual.blocks.5.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
706
+ "model.visual.blocks.5.norm1.bias": "model-00004-of-00004.safetensors",
707
+ "model.visual.blocks.5.norm1.weight": "model-00004-of-00004.safetensors",
708
+ "model.visual.blocks.5.norm2.bias": "model-00004-of-00004.safetensors",
709
+ "model.visual.blocks.5.norm2.weight": "model-00004-of-00004.safetensors",
710
+ "model.visual.blocks.6.attn.proj.bias": "model-00004-of-00004.safetensors",
711
+ "model.visual.blocks.6.attn.proj.weight": "model-00004-of-00004.safetensors",
712
+ "model.visual.blocks.6.attn.qkv.bias": "model-00004-of-00004.safetensors",
713
+ "model.visual.blocks.6.attn.qkv.weight": "model-00004-of-00004.safetensors",
714
+ "model.visual.blocks.6.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
715
+ "model.visual.blocks.6.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
716
+ "model.visual.blocks.6.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
717
+ "model.visual.blocks.6.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
718
+ "model.visual.blocks.6.norm1.bias": "model-00004-of-00004.safetensors",
719
+ "model.visual.blocks.6.norm1.weight": "model-00004-of-00004.safetensors",
720
+ "model.visual.blocks.6.norm2.bias": "model-00004-of-00004.safetensors",
721
+ "model.visual.blocks.6.norm2.weight": "model-00004-of-00004.safetensors",
722
+ "model.visual.blocks.7.attn.proj.bias": "model-00004-of-00004.safetensors",
723
+ "model.visual.blocks.7.attn.proj.weight": "model-00004-of-00004.safetensors",
724
+ "model.visual.blocks.7.attn.qkv.bias": "model-00004-of-00004.safetensors",
725
+ "model.visual.blocks.7.attn.qkv.weight": "model-00004-of-00004.safetensors",
726
+ "model.visual.blocks.7.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
727
+ "model.visual.blocks.7.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
728
+ "model.visual.blocks.7.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
729
+ "model.visual.blocks.7.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
730
+ "model.visual.blocks.7.norm1.bias": "model-00004-of-00004.safetensors",
731
+ "model.visual.blocks.7.norm1.weight": "model-00004-of-00004.safetensors",
732
+ "model.visual.blocks.7.norm2.bias": "model-00004-of-00004.safetensors",
733
+ "model.visual.blocks.7.norm2.weight": "model-00004-of-00004.safetensors",
734
+ "model.visual.blocks.8.attn.proj.bias": "model-00004-of-00004.safetensors",
735
+ "model.visual.blocks.8.attn.proj.weight": "model-00004-of-00004.safetensors",
736
+ "model.visual.blocks.8.attn.qkv.bias": "model-00004-of-00004.safetensors",
737
+ "model.visual.blocks.8.attn.qkv.weight": "model-00004-of-00004.safetensors",
738
+ "model.visual.blocks.8.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
739
+ "model.visual.blocks.8.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
740
+ "model.visual.blocks.8.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
741
+ "model.visual.blocks.8.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
742
+ "model.visual.blocks.8.norm1.bias": "model-00004-of-00004.safetensors",
743
+ "model.visual.blocks.8.norm1.weight": "model-00004-of-00004.safetensors",
744
+ "model.visual.blocks.8.norm2.bias": "model-00004-of-00004.safetensors",
745
+ "model.visual.blocks.8.norm2.weight": "model-00004-of-00004.safetensors",
746
+ "model.visual.blocks.9.attn.proj.bias": "model-00004-of-00004.safetensors",
747
+ "model.visual.blocks.9.attn.proj.weight": "model-00004-of-00004.safetensors",
748
+ "model.visual.blocks.9.attn.qkv.bias": "model-00004-of-00004.safetensors",
749
+ "model.visual.blocks.9.attn.qkv.weight": "model-00004-of-00004.safetensors",
750
+ "model.visual.blocks.9.mlp.linear_fc1.bias": "model-00004-of-00004.safetensors",
751
+ "model.visual.blocks.9.mlp.linear_fc1.weight": "model-00004-of-00004.safetensors",
752
+ "model.visual.blocks.9.mlp.linear_fc2.bias": "model-00004-of-00004.safetensors",
753
+ "model.visual.blocks.9.mlp.linear_fc2.weight": "model-00004-of-00004.safetensors",
754
+ "model.visual.blocks.9.norm1.bias": "model-00004-of-00004.safetensors",
755
+ "model.visual.blocks.9.norm1.weight": "model-00004-of-00004.safetensors",
756
+ "model.visual.blocks.9.norm2.bias": "model-00004-of-00004.safetensors",
757
+ "model.visual.blocks.9.norm2.weight": "model-00004-of-00004.safetensors",
758
+ "model.visual.merger.linear_fc1.bias": "model-00004-of-00004.safetensors",
759
+ "model.visual.merger.linear_fc1.weight": "model-00004-of-00004.safetensors",
760
+ "model.visual.merger.linear_fc2.bias": "model-00004-of-00004.safetensors",
761
+ "model.visual.merger.linear_fc2.weight": "model-00004-of-00004.safetensors",
762
+ "model.visual.merger.norm.bias": "model-00004-of-00004.safetensors",
763
+ "model.visual.merger.norm.weight": "model-00004-of-00004.safetensors",
764
+ "model.visual.patch_embed.proj.bias": "model-00004-of-00004.safetensors",
765
+ "model.visual.patch_embed.proj.weight": "model-00004-of-00004.safetensors",
766
+ "model.visual.pos_embed.weight": "model-00004-of-00004.safetensors"
767
+ }
768
+ }
preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 16777216,
4
+ "shortest_edge": 65536
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "image_processor_type": "Qwen2VLImageProcessorFast"
21
+ }
processor_config.json ADDED
@@ -0,0 +1,60 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "image_processor": {
3
+ "do_convert_rgb": true,
4
+ "do_normalize": true,
5
+ "do_rescale": true,
6
+ "do_resize": true,
7
+ "image_mean": [
8
+ 0.5,
9
+ 0.5,
10
+ 0.5
11
+ ],
12
+ "image_processor_type": "Qwen2VLImageProcessor",
13
+ "image_std": [
14
+ 0.5,
15
+ 0.5,
16
+ 0.5
17
+ ],
18
+ "merge_size": 2,
19
+ "patch_size": 16,
20
+ "resample": 3,
21
+ "rescale_factor": 0.00392156862745098,
22
+ "size": {
23
+ "longest_edge": 12845056,
24
+ "shortest_edge": 3136
25
+ },
26
+ "temporal_patch_size": 2
27
+ },
28
+ "processor_class": "Qwen3VLProcessor",
29
+ "video_processor": {
30
+ "do_convert_rgb": true,
31
+ "do_normalize": true,
32
+ "do_rescale": true,
33
+ "do_resize": true,
34
+ "do_sample_frames": true,
35
+ "fps": 2,
36
+ "image_mean": [
37
+ 0.5,
38
+ 0.5,
39
+ 0.5
40
+ ],
41
+ "image_std": [
42
+ 0.5,
43
+ 0.5,
44
+ 0.5
45
+ ],
46
+ "max_frames": 768,
47
+ "merge_size": 2,
48
+ "min_frames": 4,
49
+ "patch_size": 16,
50
+ "resample": 3,
51
+ "rescale_factor": 0.00392156862745098,
52
+ "return_metadata": false,
53
+ "size": {
54
+ "longest_edge": 25165824,
55
+ "shortest_edge": 4096
56
+ },
57
+ "temporal_patch_size": 2,
58
+ "video_processor_type": "Qwen3VLVideoProcessor"
59
+ }
60
+ }
tokenizer.json ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4
3
+ size 19989343
tokenizer_config.json ADDED
@@ -0,0 +1,34 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "add_prefix_space": false,
3
+ "audio_bos_token": "<|audio_start|>",
4
+ "audio_eos_token": "<|audio_end|>",
5
+ "audio_token": "<|audio_pad|>",
6
+ "backend": "tokenizers",
7
+ "bos_token": null,
8
+ "clean_up_tokenization_spaces": false,
9
+ "eos_token": "<|im_end|>",
10
+ "errors": "replace",
11
+ "image_token": "<|image_pad|>",
12
+ "is_local": true,
13
+ "max_pixels": 12845056,
14
+ "min_pixels": 3136,
15
+ "model_max_length": 262144,
16
+ "model_specific_special_tokens": {
17
+ "audio_bos_token": "<|audio_start|>",
18
+ "audio_eos_token": "<|audio_end|>",
19
+ "audio_token": "<|audio_pad|>",
20
+ "image_token": "<|image_pad|>",
21
+ "video_token": "<|video_pad|>",
22
+ "vision_bos_token": "<|vision_start|>",
23
+ "vision_eos_token": "<|vision_end|>"
24
+ },
25
+ "pad_token": "<|endoftext|>",
26
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
27
+ "processor_class": "Qwen3VLProcessor",
28
+ "split_special_tokens": false,
29
+ "tokenizer_class": "Qwen2Tokenizer",
30
+ "unk_token": null,
31
+ "video_token": "<|video_pad|>",
32
+ "vision_bos_token": "<|vision_start|>",
33
+ "vision_eos_token": "<|vision_end|>"
34
+ }
video_preprocessor_config.json ADDED
@@ -0,0 +1,21 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "size": {
3
+ "longest_edge": 25165824,
4
+ "shortest_edge": 4096
5
+ },
6
+ "patch_size": 16,
7
+ "temporal_patch_size": 2,
8
+ "merge_size": 2,
9
+ "image_mean": [
10
+ 0.5,
11
+ 0.5,
12
+ 0.5
13
+ ],
14
+ "image_std": [
15
+ 0.5,
16
+ 0.5,
17
+ 0.5
18
+ ],
19
+ "processor_class": "Qwen3VLProcessor",
20
+ "video_processor_type": "Qwen3VLVideoProcessor"
21
+ }
vocab.json ADDED
The diff for this file is too large to render. See raw diff