Bug loop de repetición de token "assistant" al usar el modelo via API

#1
by DeltagramCo - opened

Hola equipo de LatamGPT,
Me comunico para reportar un bug que encontré al intentar usar el modelo Llama-3.1-70B-LatamGPT-SFT-1.0 tanto desde el widget de demostración de Hugging Face como desde llamadas directas a la API.

No soy desarrollador, pero sí entusiasta y he desarrollado desde mi Consultora soluciones basadas en IA. Me interesa mucho el proyecto y usar LatamGPT como modelo latinoamericano en esas soluciones. Intenté integrar el modelo en una aplicación Python sencilla usando el Inference Provider de Featherless AI a través del router de Hugging Face, pero el modelo no genera respuestas coherentes. En lugar de responder, entra en un loop infinito repitiendo el token assistant. El problema se reproduce de forma consistente en dos entornos distintos:

Widget de demo en Hugging Face — visible públicamente en la página del modelo. Al enviar el prompt "explica los cambios en el gobierno de Chile desde el año 2000", el modelo colapsa inmediatamente en la repetición.

Llamada directa a la API — usando tanto la librería openai con base_url="https://router.huggingface.co/v1" como el InferenceClient nativo de huggingface_hub, con el proveedor featherless-ai. Ambos producen el mismo resultado.

Ejemplo de output obtenido:
El español riassistant
El español riopassistant
El español rioplatassistant
assistant
assistant

Código usado:
pythonfrom huggingface_hub import InferenceClient

client = InferenceClient(
provider="featherless-ai",
api_key="HF_TOKEN",
)

respuesta = client.chat.completions.create(
model="latam-gpt/Llama-3.1-70B-LatamGPT-SFT-1.0",
messages=[
{"role": "system", "content": "Eres un asistente útil con foco en América Latina."},
{"role": "user", "content": "¿Qué diferencias hay entre el español rioplatense y el mexicano?"}
],
max_tokens=512,
temperature=0.6,
top_p=0.9,
)

Me encantaría que pudieran revisar las opciones para acceder al modelo para aquellos que no somos desarrolladores y no tenemos actualmente el hardware para correrlo. Es muy importante probar un modelo tuneado con nuestro idioma y cultura.

Muchas gracias!
Diego Rodríguez

LatamGPT org

Hola Diego!

En primer lugar, que alegría ver tu interés por probar nuestro modelo. Estamos muy agradecidos. 🤗

El error que observas ocurre ya que el proveedor del modelo no está aplicando el formato de chat correspondiente (mencionado aquí). Lamentablemente no podemos corregir esto por nuestro lado, razón por la que hemos contactado tanto a HuggingFace como también Featherless para informarles de la situación.

Muchas gracias por avisarnos. Te haremos saber apenas corrijan esto.

Muchas gracias, estaré pendiente.

Sign up or log in to comment