Instructions to use latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0") model = AutoModelForCausalLM.from_pretrained("latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0
- SGLang
How to use latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0 with Docker Model Runner:
docker model run hf.co/latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0
Bug loop de repetición de token "assistant" al usar el modelo via API
Hola equipo de LatamGPT,
Me comunico para reportar un bug que encontré al intentar usar el modelo Llama-3.1-70B-LatamGPT-SFT-1.0 tanto desde el widget de demostración de Hugging Face como desde llamadas directas a la API.
No soy desarrollador, pero sí entusiasta y he desarrollado desde mi Consultora soluciones basadas en IA. Me interesa mucho el proyecto y usar LatamGPT como modelo latinoamericano en esas soluciones. Intenté integrar el modelo en una aplicación Python sencilla usando el Inference Provider de Featherless AI a través del router de Hugging Face, pero el modelo no genera respuestas coherentes. En lugar de responder, entra en un loop infinito repitiendo el token assistant. El problema se reproduce de forma consistente en dos entornos distintos:
Widget de demo en Hugging Face — visible públicamente en la página del modelo. Al enviar el prompt "explica los cambios en el gobierno de Chile desde el año 2000", el modelo colapsa inmediatamente en la repetición.
Llamada directa a la API — usando tanto la librería openai con base_url="https://router.huggingface.co/v1" como el InferenceClient nativo de huggingface_hub, con el proveedor featherless-ai. Ambos producen el mismo resultado.
Ejemplo de output obtenido:
El español riassistant
El español riopassistant
El español rioplatassistant
assistant
assistant
Código usado:
pythonfrom huggingface_hub import InferenceClient
client = InferenceClient(
provider="featherless-ai",
api_key="HF_TOKEN",
)
respuesta = client.chat.completions.create(
model="latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0",
messages=[
{"role": "system", "content": "Eres un asistente útil con foco en América Latina."},
{"role": "user", "content": "¿Qué diferencias hay entre el español rioplatense y el mexicano?"}
],
max_tokens=512,
temperature=0.6,
top_p=0.9,
)
Me encantaría que pudieran revisar las opciones para acceder al modelo para aquellos que no somos desarrolladores y no tenemos actualmente el hardware para correrlo. Es muy importante probar un modelo tuneado con nuestro idioma y cultura.
Muchas gracias!
Diego Rodríguez
Hola Diego!
En primer lugar, que alegría ver tu interés por probar nuestro modelo. Estamos muy agradecidos. 🤗
El error que observas ocurre ya que el proveedor del modelo no está aplicando el formato de chat correspondiente (mencionado aquí). Lamentablemente no podemos corregir esto por nuestro lado, razón por la que hemos contactado tanto a HuggingFace como también Featherless para informarles de la situación.
Muchas gracias por avisarnos. Te haremos saber apenas corrijan esto.
Muchas gracias, estaré pendiente.