dfine-x-obj-detection / README_HF.md
ducnhan0804's picture
Upload README_HF.md with huggingface_hub
4f62898 verified
|
Raw
History Blame
2.2 kB
metadata
license: apache-2.0
tags:
  - object-detection
  - computer-vision
  - d-fine
  - document-layout-analysis
metrics:
  - map

D-FINE Layout Detection Model (HGNetv2-X)

Model Details

Đây là mô hình nhận diện các phần tử trong tài liệu (Document Layout Analysis) được huấn luyện dựa trên kiến trúc D-FINE tiên tiến (phiên bản cấu hình X cỡ lớn sử dụng backbone HGNetv2-B5).

  • Task: Object Detection (Phát hiện vật thể)
  • Architecture: D-FINE (HGNetv2-X)
  • Epochs Trained: 80 Epochs (Gồm 72 epochs Stage 1 và 8 epochs Stage 2 tinh chỉnh)

Dataset

Mô hình được huấn luyện trên tập dữ liệu tùy chỉnh bao gồm các lớp đối tượng (classes) thường gặp trong bố cục tài liệu: 0. Object-detection (Lớp bao trùm)

  1. Figure (Hình ảnh/Hình vẽ)
  2. Icon (Biểu tượng)
  3. Table (Bảng biểu)

Evaluation Results

Kết quả đạt được trên tập Validation sau khi kết thúc Stage 2 (tinh chỉnh tọa độ mịn):

  • mAP @ [0.50:0.95]: 83.75%
  • mAP @ 0.50: 91.82%
  • mAP @ 0.75: 89.66%
  • AP (Medium Objects): 87.03%
  • AP (Large Objects): 83.84%
  • Recall (AR @ 100): 93.48%

How to Use

Để sử dụng mô hình này, bạn cần tải xuống mã nguồn của D-FINE.

Bước 1: Clone D-FINE repository

git clone https://github.com/Peterande/D-FINE.git
cd D-FINE
pip install -r requirements.txt

Bước 2: Tải file cấu hình & trọng số Tải file model.pth, dfine_hgnetv2_x_custom.yml, và custom_detection.yml từ kho lưu trữ (repository) này và đặt vào các thư mục tương ứng trong dự án của bạn.

Bước 3: Chạy Suy luận (Inference) Sử dụng script có sẵn của D-FINE để chạy nhận diện trên một tài liệu, hình ảnh hoặc video:

python tools/inference/torch_inf.py \
    -c configs/dfine/custom/dfine_hgnetv2_x_custom.yml \
    -r model.pth \
    -i path/to/your/document_image.jpg \
    -d cuda:0

Kết quả nhận diện sẽ được lưu thành tệp torch_results.jpg.