Instructions to use djelia/bm-mistral-7b-transcription-correction with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use djelia/bm-mistral-7b-transcription-correction with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="djelia/bm-mistral-7b-transcription-correction")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("djelia/bm-mistral-7b-transcription-correction") model = AutoModelForCausalLM.from_pretrained("djelia/bm-mistral-7b-transcription-correction", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use djelia/bm-mistral-7b-transcription-correction with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "djelia/bm-mistral-7b-transcription-correction" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "djelia/bm-mistral-7b-transcription-correction", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/djelia/bm-mistral-7b-transcription-correction
- SGLang
How to use djelia/bm-mistral-7b-transcription-correction with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "djelia/bm-mistral-7b-transcription-correction" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "djelia/bm-mistral-7b-transcription-correction", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "djelia/bm-mistral-7b-transcription-correction" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "djelia/bm-mistral-7b-transcription-correction", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Unsloth Desktop
- Docker Model Runner
How to use djelia/bm-mistral-7b-transcription-correction with Docker Model Runner:
docker model run hf.co/djelia/bm-mistral-7b-transcription-correction
bm-mistral-7b-transcription-correction
Bambara ASR post-correction: djelia/bm-mistral-7b-v1 specialised on rewriting raw
speech-recognition output into correct Bambara. It repairs split words, wrongly merged words,
mis-transliterated French loanwords, and dropped words or characters, while preserving meaning
and orthography.
MistralForCausalLM, bfloat16 — 32 layers, hidden size 4096, 32 heads with 8 KV heads (GQA),
32,768-token vocabulary and context.
Usage
Load the merged weights with AutoModelForCausalLM; the repo also ships the LoRA adapter. There
is no chat template — the instruction goes under ### ɲɛfɔli:, the raw transcript under
### Donnafɛnw:, and generation starts after ### Jaabi:.
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "djelia/bm-mistral-7b-transcription-correction"
tokenizer = AutoTokenizer.from_pretrained(model_id)
tokenizer.padding_side = "left" # repo ships "right"; left is required for batched generation
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16, device_map="auto"
)
INSTRUCTION = """I ye Bambara sɛbɛnni kɔrɔsibaga ye min bɛ ASR Bambara sɛbɛnni ɲɛnabɔ. I ka baara ye ka Bambara sɛbɛnni fili minnu bɛ ASR la, olu yɛlɛma ka kɛ Bambara sɛbɛnni ɲuman ye, ka kɔrɔ bɛɛ to a cogo la. I ka kan ka fili suguyaw ninnu ɲɛnabɔ:
Daɲɛw Tilili: Tuma dɔw la, ASR bɛ daɲɛ kelen tila ka kɛ daɲɛ fitini caman ye. I ka kan ka olu fara ɲɔgɔn kan ka kɛ daɲɛ ɲuman kelen ye.
Daɲɛw Farali: Tuma dɔw la, daɲɛ fla bɛ fara ɲɔgɔn kan ka kɛ kelen ye. I ka kan ka olu tila ka Bambara sɛbɛnni cogo ɲuman bato.
Tubabukan Yɛlɛmali Fili: Tubabukan kumaw bɛ se ka yɛlɛma Bambara la ni kanfɔ suguya wɛrɛ ye min tɛ a ɲuman ye (misali la, "cette fois-ci" bɛ se ka kɛ "se ti fassi si" ye walima "à travers" bɛ kɛ "a taara were" ye). I ka kan ka olu sɛbɛn cogo ɲuman na.
Daɲɛw walima Sɛbɛndenw Tununi: Tuma dɔw la, daɲɛw walima sɛbɛnden kelenkelenna dɔw bɛ bɔ sɛbɛnni na.
Ni i bɛ Bambara kumakan dɔ ɲɛnabɔ, i ka kan ka fili suguyaw ninnu bɛɛ ɲɛnabɔ ka sɔrɔ ka kɛ Bambara sɛbɛnni ɲuman ye, nka ka kanfɔcogo bato walasa ka bɛn ni fɔcogo ye.
I ka labaaraw ka kan ka kɛ Bambara sɛbɛnni ɲɛnabɔlen ye, ni daɲɛw danw, tomi, ani daɲɛ sugandilen ɲumanw ye minnu bɛ bɛn ni kanfɔcogo ye. I ka jija ka kɔrɔ fɔlen to a cogo la ka sɔrɔ ka a ɲɛfɔ ka ɲɛ ani ka a kɛ sɛbɛnni ɲuman ye."""
ALPACA_PROMPT = """Nin ye baara dɔ ɲɛfɔli ye, min bɛ donnafɛnw ni sigidaw fara ɲɔgɔn kan. I ka kan ka jaabi sɛbɛn min bɛ ɲinini dafa ka ɲɛ.
### ɲɛfɔli:
{}
### Donnafɛnw:
{}
### Jaabi:
"""
prompt = ALPACA_PROMPT.format(INSTRUCTION, "<raw Bambara ASR output>")
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
output = model.generate(**inputs, max_new_tokens=300, pad_token_id=tokenizer.pad_token_id)
print(tokenizer.decode(output[0], skip_special_tokens=True).split("Jaabi:")[-1].strip())
Greedy decoding is the sensible default — this is constrained rewriting, not open generation.
- Downloads last month
- -
Model tree for djelia/bm-mistral-7b-transcription-correction
Base model
mistralai/Mistral-7B-v0.3