--- language: - ko tags: - korean - legal - anonymization - ner library_name: transformers pipeline_tag: token-classification license: other --- # legal-instrument-doro-ner-finetuned `legal_instrument_generation` 런타임에서 사용하는 한국어 주소/위치 비식별화 NER 모델입니다. ## 용도 법률 문서에 포함된 주소성 표현을 태깅해 비식별화에 사용합니다. 대표 label 예시는 아래와 같습니다. - `B-LOC_DO`, `B-LOC_SI`, `B-LOC_GU`, `B-LOC_DONG` - `B-ROAD`, `B-ROAD_NO` - `B-BLD_NAME`, `B-BLD_NAME_DONG`, `B-BLD_NAME_HO` 패키징된 설정 기준 label 수는 `20`개입니다. ## 기반 모델 / 구조 - architecture: `BertForTokenClassification` - hidden size: `768` - max position embeddings: `512` - vocab size: `32000` ## 학습 파라미터 - learning rate: `5e-5` - epochs: `10` - train batch size: `8` - eval batch size: `8` - weight decay: `0.01` - scheduler: `linear` - gradient accumulation: `1` - logging steps: `20` - seed: `42` - fp16: `False` - bf16: `False` ## 런타임 사용 위치 이 모델은 아래 경로로 내려받아 사용합니다. - local path: `models/anonymization/doro_ner_finetuned` 서버 코드에서는 `legal-ai-server/app/anonymization/service.py`에서 로드합니다. ## 참고 이 리포는 런타임 체크포인트 배포 목적입니다. 학습 데이터셋과 전체 실험 로그는 포함하지 않습니다.