Recycling Classification VQA Model (QLoRA + GRPO Fine-tuned)

์žฌํ™œ์šฉํ’ˆ ์ด๋ฏธ์ง€๋ฅผ ๋ถ„๋ฅ˜ํ•˜๋Š” ์‹œ๊ฐ์งˆ์˜์‘๋‹ต(VQA) ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค. ์žฌํ™œ์šฉ ๊ฐ€๋Šฅ ์—ฌ๋ถ€ ํŒ๋ณ„, ๊ฐœ์ˆ˜ ์นด์šดํŒ…, ์„ธ๋ถ€ ์ข…๋ฅ˜ ๋ถ„๋ฅ˜ ๊ณผ์ œ๋ฅผ ์ˆ˜ํ–‰ํ•˜๋„๋ก ํŒŒ์ธํŠœ๋‹๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

A Vision-Language model fine-tuned for recycling-waste classification. Given an image, the model answers questions about (1) whether the item is recyclable, (2) how many items are present, and (3) the specific recycling category.

Model Details

Model Description

  • Developed by: Kang Jaemin (๊ฐ•์žฌ๋ฏผ)
  • Model type: Vision-Language Model (Visual Question Answering)
  • Language(s): Korean
  • Finetuned from model:
  • Fine-tuning method: QLoRA (4-bit quantization + LoRA) + GRPO

Task

๋ณธ ๋ชจ๋ธ์€ ์žฌํ™œ์šฉ ๋ถ„๋ฅ˜ ์ฑŒ๋ฆฐ์ง€๋ฅผ ์œ„ํ•ด ๊ฐœ๋ฐœ๋˜์—ˆ์œผ๋ฉฐ, ๋‹ค์Œ ๊ณผ์ œ๋ฅผ ์ˆ˜ํ–‰ํ•ฉ๋‹ˆ๋‹ค:

  1. ์žฌํ™œ์šฉ ๊ฐ€๋Šฅ ์—ฌ๋ถ€ ํŒ๋ณ„ โ€” ์ด๋ฏธ์ง€ ์† ๋ฌผ์ฒด๊ฐ€ ์žฌํ™œ์šฉ ๋Œ€์ƒ์ธ์ง€ ๋ถ„๋ฅ˜
  2. ๊ฐœ์ˆ˜ ์นด์šดํŒ… โ€” ์ด๋ฏธ์ง€ ๋‚ด ์žฌํ™œ์šฉํ’ˆ ๊ฐœ์ˆ˜ ์ธ์‹
  3. ์„ธ๋ถ€ ์ข…๋ฅ˜ ๋ถ„๋ฅ˜ โ€” ์žฌํ™œ์šฉํ’ˆ์˜ ๊ตฌ์ฒด์  ์นดํ…Œ๊ณ ๋ฆฌ ๋ถ„๋ฅ˜

Training Details

Training Procedure

์„ฑ๋Šฅ ๊ฐœ์„ ์„ ๋‹จ๊ณ„์ ์œผ๋กœ ์ง„ํ–‰ํ–ˆ์Šต๋‹ˆ๋‹ค:

  1. QLoRA ๊ธฐ๋ฐ˜ ํŒŒ์ธํŠœ๋‹ โ€” ๋Œ€ํ˜• ๋ชจ๋ธ์„ 4-bit ์–‘์žํ™”ํ•˜์—ฌ ์ œํ•œ๋œ GPU ํ™˜๊ฒฝ์—์„œ ๊ตฌ๋™ํ•˜๊ณ , LoRA๋กœ ํšจ์œจ์ ์œผ๋กœ ํŒŒ์ธํŠœ๋‹
  2. ๋ชจ๋ธ ์Šค์ผ€์ผ์—… โ€” ๋” ํฐ ํŒŒ๋ผ๋ฏธํ„ฐ์˜ ๋ฒ ์ด์Šค ๋ชจ๋ธ๋กœ ๊ต์ฒดํ•˜์—ฌ ๊ธฐ๋ฐ˜ ์„ฑ๋Šฅ ํ–ฅ์ƒ
  3. ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ํŠœ๋‹ โ€” ํ•™์Šต๋ฅ  ๋“ฑ ์ฃผ์š” ํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ์ตœ์ ํ™”
  4. ์ด๋ฏธ์ง€ ์ „์ฒ˜๋ฆฌ ๊ฐœ์„  โ€” ๋™์  ํฌ๊ธฐ ์ด๋ฏธ์ง€ ์ž…๋ ฅ ์‹œ ๋ฐœ์ƒํ•˜๋Š” ๋น„์œจ ์™œ๊ณก ๋ฐ ๋ชจ์„œ๋ฆฌ ์˜์—ญ ์ธ์‹ ๋ˆ„๋ฝ ๋ฌธ์ œ๋ฅผ ๋ฐœ๊ฒฌ, ์›๋ณธ ๋น„์œจ์„ ๋ณด์กดํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ ๊ฐœ์„ 
  5. GRPO ์ ์šฉ โ€” ์˜ค๋‹ต ์‚ฌ๋ก€์— ๋Œ€ํ•œ ํ•™์Šต์„ ๊ฐ•ํ™”ํ•˜๋Š” GRPO(Group Relative Policy Optimization)๋ฅผ ์ ์šฉํ•˜์—ฌ ์ถ”๊ฐ€ ์„ฑ๋Šฅ ํ–ฅ์ƒ

Training Hyperparameters

  • Fine-tuning: QLoRA (4-bit) Evaluation

    Results

    • Accuracy: 85% โ†’ 93.3% (๋‹จ๊ณ„์  ๊ฐœ์„  ํ›„)
    • Challenge ranking: ์ „์ฒด 200ํŒ€ ์ค‘ ์ตœ๊ณ  20์œ„ ๊ธฐ๋ก, ์ตœ์ข… 50์œ„ (์ƒ์œ„ 25%)

    Summary

    QLoRA ์–‘์žํ™”๋กœ ๋Œ€ํ˜• ๋ชจ๋ธ์„ ์ œํ•œ๋œ ํ™˜๊ฒฝ์—์„œ ๊ตฌ๋™ํ•˜๊ณ , ๋ชจ๋ธ ์Šค์ผ€์ผ์—…ยทํ•˜์ดํผํŒŒ๋ผ๋ฏธํ„ฐ ํŠœ๋‹ยท์ด๋ฏธ์ง€ ์ „์ฒ˜๋ฆฌ ๊ฐœ์„ ยทGRPO๋ฅผ ๋‹จ๊ณ„์ ์œผ๋กœ ์ ์šฉํ•˜์—ฌ ์ •ํ™•๋„๋ฅผ 85%์—์„œ 93.3%๊นŒ์ง€ ํ–ฅ์ƒ์‹œ์ผฐ์Šต๋‹ˆ๋‹ค.

    Bias, Risks, and Limitations

    • ๋ณธ ๋ชจ๋ธ์€ ๋‹จ๊ธฐ ์ฑŒ๋ฆฐ์ง€๋ฅผ ์œ„ํ•ด ํŠน์ • ์žฌํ™œ์šฉ ๋ถ„๋ฅ˜ ๋ฐ์ดํ„ฐ์…‹์— ํŒŒ์ธํŠœ๋‹๋˜์—ˆ์œผ๋ฉฐ, ํ•™์Šต ๋ฐ์ดํ„ฐ์˜ ๋ถ„ํฌ๋ฅผ ๋ฒ—์–ด๋‚œ ์ด๋ฏธ์ง€(๋‹ค๋ฅธ ์กฐ๋ช…, ๋ฐฐ๊ฒฝ, ๋ฌผ์ฒด ์ข…๋ฅ˜)์—์„œ๋Š” ์„ฑ๋Šฅ์ด ์ €ํ•˜๋  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.
    • ์‹ค์ œ ์žฌํ™œ์šฉ ๋ถ„๋ฆฌ๋ฐฐ์ถœ ์˜์‚ฌ๊ฒฐ์ •์— ๋‹จ๋…์œผ๋กœ ์‚ฌ์šฉํ•˜๊ธฐ์—๋Š” ๊ฒ€์ฆ์ด ๋” ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค.

    How to Get Started with the Model

    # TODO: ์‹ค์ œ ๋กœ๋”ฉ/์ถ”๋ก  ์ฝ”๋“œ ์ถ”๊ฐ€
    from transformers import AutoModel, AutoProcessor
    
    # model = AutoModel.from_pretrained("...")
    # processor = AutoProcessor.from_pretrained("...")
    

    Model Card Authors

    Kang Jaemin (๊ฐ•์žฌ๋ฏผ)

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support