Text Generation
Transformers
Safetensors
llama
finetuned
chat
conversational
text-generation-inference
Instructions to use trillionlabs/Trillion-7B-preview with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use trillionlabs/Trillion-7B-preview with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="trillionlabs/Trillion-7B-preview") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("trillionlabs/Trillion-7B-preview") model = AutoModelForCausalLM.from_pretrained("trillionlabs/Trillion-7B-preview", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use trillionlabs/Trillion-7B-preview with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "trillionlabs/Trillion-7B-preview" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "trillionlabs/Trillion-7B-preview", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/trillionlabs/Trillion-7B-preview
- SGLang
How to use trillionlabs/Trillion-7B-preview with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "trillionlabs/Trillion-7B-preview" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "trillionlabs/Trillion-7B-preview", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "trillionlabs/Trillion-7B-preview" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "trillionlabs/Trillion-7B-preview", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use trillionlabs/Trillion-7B-preview with Docker Model Runner:
docker model run hf.co/trillionlabs/Trillion-7B-preview
| { | |
| "additional_special_tokens": [ | |
| "<|reserved_token_1|>", | |
| "<|reserved_token_2|>", | |
| "<|reserved_token_3|>", | |
| "<|reserved_token_4|>", | |
| "<|reserved_token_5|>", | |
| "<|reserved_token_6|>", | |
| "<|reserved_token_7|>", | |
| "<|reserved_token_8|>", | |
| "<|reserved_token_9|>", | |
| "<|reserved_token_10|>", | |
| "<|reserved_token_11|>", | |
| "<|reserved_token_12|>", | |
| "<|reserved_token_13|>", | |
| "<|reserved_token_14|>", | |
| "<|reserved_token_15|>", | |
| "<|reserved_token_16|>", | |
| "<|reserved_token_17|>", | |
| "<|reserved_token_18|>", | |
| "<|reserved_token_19|>", | |
| "<|reserved_token_20|>", | |
| "<|reserved_token_21|>", | |
| "<|reserved_token_22|>", | |
| "<|reserved_token_23|>", | |
| "<|reserved_token_24|>", | |
| "<|reserved_token_25|>", | |
| "<|reserved_token_26|>", | |
| "<|reserved_token_27|>", | |
| "<|reserved_token_28|>", | |
| "<|reserved_token_29|>", | |
| "<|reserved_token_30|>", | |
| "<|reserved_token_31|>", | |
| "<|reserved_token_32|>", | |
| "<|reserved_token_33|>", | |
| "<|reserved_token_34|>", | |
| "<|reserved_token_35|>", | |
| "<|reserved_token_36|>", | |
| "<|reserved_token_37|>", | |
| "<|reserved_token_38|>", | |
| "<|reserved_token_39|>", | |
| "<|reserved_token_40|>", | |
| "<|reserved_token_41|>", | |
| "<|reserved_token_42|>", | |
| "<|reserved_token_43|>", | |
| "<|reserved_token_44|>", | |
| "<|reserved_token_45|>", | |
| "<|reserved_token_46|>", | |
| "<|reserved_token_47|>", | |
| "<|reserved_token_48|>", | |
| "<|reserved_token_49|>", | |
| "<|reserved_token_50|>", | |
| "<|reserved_token_51|>", | |
| "<|reserved_token_52|>", | |
| "<|reserved_token_53|>", | |
| "<|reserved_token_54|>", | |
| "<|reserved_token_55|>", | |
| "<|reserved_token_56|>", | |
| "<|reserved_token_57|>", | |
| "<|reserved_token_58|>", | |
| "<|reserved_token_59|>", | |
| "<|reserved_token_60|>", | |
| "<|reserved_token_61|>", | |
| "<|reserved_token_62|>", | |
| "<|reserved_token_63|>", | |
| "<|reserved_token_64|>", | |
| "<|reserved_token_65|>", | |
| "<|reserved_token_66|>", | |
| "<|reserved_token_67|>", | |
| "<|reserved_token_68|>", | |
| "<|reserved_token_69|>", | |
| "<|reserved_token_70|>", | |
| "<|reserved_token_71|>", | |
| "<|reserved_token_72|>", | |
| "<|reserved_token_73|>", | |
| "<|reserved_token_74|>", | |
| "<|reserved_token_75|>", | |
| "<|reserved_token_76|>", | |
| "<|reserved_token_77|>", | |
| "<|reserved_token_78|>", | |
| "<|reserved_token_79|>", | |
| "<|reserved_token_80|>", | |
| "<|reserved_token_81|>", | |
| "<|reserved_token_82|>", | |
| "<|reserved_token_83|>", | |
| "<|reserved_token_84|>", | |
| "<|reserved_token_85|>", | |
| "<|reserved_token_86|>", | |
| "<|reserved_token_87|>", | |
| "<|reserved_token_88|>", | |
| "<|reserved_token_89|>", | |
| "<|reserved_token_90|>", | |
| "<|reserved_token_91|>", | |
| "<|reserved_token_92|>", | |
| "<|reserved_token_93|>", | |
| "<|reserved_token_94|>", | |
| "<|reserved_token_95|>", | |
| "<|reserved_token_96|>", | |
| "<|reserved_token_97|>", | |
| "<|reserved_token_98|>", | |
| "<|reserved_token_99|>", | |
| "<|reserved_token_100|>", | |
| "<|reserved_token_101|>", | |
| "<|reserved_token_102|>", | |
| "<|reserved_token_103|>", | |
| "<|reserved_token_104|>", | |
| "<|reserved_token_105|>", | |
| "<|reserved_token_106|>", | |
| "<|reserved_token_107|>", | |
| "<|reserved_token_108|>", | |
| "<|reserved_token_109|>", | |
| "<|reserved_token_110|>", | |
| "<|reserved_token_111|>", | |
| "<|reserved_token_112|>", | |
| "<|reserved_token_113|>", | |
| "<|reserved_token_114|>", | |
| "<|reserved_token_115|>", | |
| "<|reserved_token_116|>", | |
| "<|reserved_token_117|>", | |
| "<|reserved_token_118|>", | |
| "<|reserved_token_119|>", | |
| "<|reserved_token_120|>", | |
| "<|reserved_token_121|>" | |
| ], | |
| "bos_token": { | |
| "content": "<|endoftext|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| }, | |
| "eos_token": { | |
| "content": "<|im_end|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| }, | |
| "pad_token": { | |
| "content": "<|pad|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| }, | |
| "unk_token": { | |
| "content": "<|endoftext|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| } | |
| } | |