--- license: apache-2.0 base_model: google/medgemma-4b-it tags: - medical - safety - grpo - dipg - safeclaw library_name: transformers pipeline_tag: text-generation --- # MedGemma 4B - DIPG Safety v2 (GRPO-Trained) Fine-tuned [MedGemma 4B](https://huggingface.co/google/medgemma-4b-it) using **GRPO (Group Relative Policy Optimization)** on the DIPG Safety Gym benchmark. ## Training Details - **Base Model**: MedGemma 4B IT - **Method**: GRPO with LoRA (rank=64, alpha=64) - **Training Steps**: 100 - **Focus**: Medical safety — hallucination reduction, evidence-grounded responses ## Usage ```python from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("surfiniaburger/medgemma-4b-dipg-safety-v2") model = AutoModelForCausalLM.from_pretrained( "surfiniaburger/medgemma-4b-dipg-safety-v2", torch_dtype="bfloat16", device_map="auto" ) ``` ## SafeClaw Project Part of the [DIPG Safety Gym](https://github.com/surfiniaburger/med-safety-gym-v2) ecosystem.