FP8 · 31.3B parameters · text + vision
Gemma 4 Heretic
Refusal-reduced Gemma 4, served from a pre-quantized checkpoint.
"""
)
with gr.Accordion("Generation settings", open=False):
system_prompt = gr.Textbox(
value=default_system,
label="System prompt",
lines=2,
)
with gr.Row():
thinking = gr.Checkbox(
value=DEFAULTS["thinking"],
label="Thinking mode",
info="Can increase latency and output length.",
)
max_new_tokens = gr.Slider(
128,
1536,
value=DEFAULTS["max_new_tokens"],
step=128,
label="Maximum new tokens",
info="Longer answers use more of your ZeroGPU quota.",
)
with gr.Row():
temperature = gr.Slider(
0,
1.5,
value=DEFAULTS["temperature"],
step=0.05,
label="Temperature",
)
top_p = gr.Slider(
0.1,
1,
value=DEFAULTS["top_p"],
step=0.05,
label="Top-p",
)
top_k = gr.Slider(
1,
128,
value=DEFAULTS["top_k"],
step=1,
label="Top-k",
)
repetition_penalty = gr.Slider(
1,
1.3,
value=DEFAULTS["repetition_penalty"],
step=0.01,
label="Repetition penalty",
)
chatbot = gr.Chatbot(
height=590,
layout="bubble",
placeholder=(
"