Text Generation
Transformers
Safetensors
qwen3
openeurollm
long-context
256k
multilingual
instruction-tuning
sft
conversational
text-generation-inference
oellm-9b-256k-sft / export_validation.json
birgermoell's picture
Mirror validated OELLM 9B 256K SFT model and evaluations
ef8dc42 verified
Raw
History Blame Contribute Delete
360 Bytes
{
"source_checkpoint": "oellm9b-256k-sft",
"base_model": "openeurollm/oellm-9b-256k-theta64m-prelude",
"dtype": "bfloat16",
"max_position_embeddings": 262144,
"rope_theta": 64000000,
"eos_token": "<end_of_turn>",
"eos_token_id": 4,
"pad_token_id": 262144,
"shards": 4,
"tensors": 399,
"bf16_tensors": 399,
"weight_bytes": 18203941840
}