--- language: - id license: apache-2.0 tags: - unsloth - qwen2.5 - fine-tuned - indonesian-legal - rag - grpo base_model: unsloth/Qwen2.5-Coder-7B-Instruct-bnb-4bit datasets: - Ichsan2895/alpaca-gpt4-indonesian --- # Legal Chatbot SLM Indonesian (16-bit / QLoRA Fine-Tuned) Model ini adalah Small Language Model (SLM) hasil fine-tuning dan GRPO Reinforcement Learning untuk tugas asisten tanya-jawab tim legal di Indonesia berbasis Qwen 2.5 7B Instruct. ## Informasi Model: - **Base Model**: `unsloth/Qwen2.5-Coder-7B-Instruct-bnb-4bit` - **Dataset**: `Ichsan2895/alpaca-gpt4-indonesian` (ChatML Format) - **Teknik Training**: QLoRA 4-bit Double Quantization (SFT 800 steps) + GRPO (Group Relative Policy Optimization) - **Kemampuan**: Penalaran penal hukum dengan token ` ... ` dan integrasi sistem Advanced RAG.