HuggingFaceH4/ultrachat_200k
Viewer • Updated • 515k • 89.8k • 1.13k
A LoRA fine-tune of mistralai/Mistral-7B-Instruct-v0.3 tuned for direct, practical assistant responses with a side of
grounded character roleplay. Built on a curated seed of hand-written technical Q&A and dialogue, then balanced against general-purpose and conversational sets so the model keeps its
broad capabilities.
| Folder | Bits | Size | Quality | Load |
|---|---|---|---|---|
mlx-4bit-dwq/ |
4 | ~4.1 GB | best at 4-bit | mlx_lm.generate --model darthcrawl/mistral-7b-instruct-v0.3-artisan/mlx-4bit-dwq |
mlx-4bit/ |
4 | ~4.1 GB | vanilla 4-bit | mlx_lm.generate --model darthcrawl/mistral-7b-instruct-v0.3-artisan/mlx-4bit |
mlx-6bit/ |
6 | ~6.0 GB | near-lossless | mlx_lm.generate --model darthcrawl/mistral-7b-instruct-v0.3-artisan/mlx-6bit |
mlx-8bit/ |
8 | ~7.5 GB | effectively FP16 | mlx_lm.generate --model darthcrawl/mistral-7b-instruct-v0.3-artisan/mlx-8bit |
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "darthcrawl/mistral-7b-instruct-v0.3-artisan"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="auto", device_map="auto")
messages = [
{"role": "user", "content": "Explain consistent hashing in two paragraphs."},
]
inputs = tokenizer.apply_chat_template(messages, return_tensors="pt", add_generation_prompt=True).to(model.device)
out = model.generate(inputs, max_new_tokens=512, temperature=0.7)
print(tokenizer.decode(out[0][inputs.shape[-1]:], skip_special_tokens=True))
MLX quants (Apple Silicon)
Quantized variants for mlx-lm:
Training
| Category | Notes |
|---|---|
| Method | QLoRA — 4-bit base + LoRA r=16, alpha=32, dropout=0.05 |
| Targets | q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj |
| Data mix | ~3% curated artisan, ~14% character RP, ~83% general-purpose |
| Schedule | 2 epochs, cosine, lr 2e-4, warmup 50, effective batch 16 |
| Hardware | Single H100 80GB |
Limitations
License
Apache 2.0, inherited from the base model.