mdeberta-v3-base microsoft
- 유형
- model
- 태스크
- fill-mask
- 프레임워크
- transformers
- 다운로드
- 5,162,793
- 좋아요
- 231
- 접근
- public
- 파일
- 0
태그
- 텍스트 분류
- 다국어
- 마스크 언어모델
- NLP
- transformers
- 파인튜닝
- 대규모 언어 모델
요약
microsoft/mdeberta-v3-base는 ELECTRA 스타일 사전학습과 Gradient Disentangled Embedding Sharing 기법으로 성능과 효율을 개선한 다국어 DeBERTa 모델입니다. 250K 어휘와 86M 백본 파라미터를 가지며 CC100 다국어 데이터(2.5T)로 학습되어 15개 언어를 지원합니다. XNLI 등 NLU 하위과제에서 XLM-R을 능가하는 성능을 보이며, 마스크 채우기 및 텍스트 분류 파인튜닝에 널리 활용됩니다.
README
--- language: - multilingual - en - ar - bg - de - el - es - fr - hi - ru - sw - th - tr - ur - vi - zh tags: - deberta - deberta-v3 - mdeberta - fill-mask thumbnail: https://huggingface.co/front/thumbnails/microsoft.png license: mit --- ## DeBERTaV3: 분리 어텐션과 기울기 분리 임베딩 공유를 통한 ELECTRA 스타일 사전 학습으로 D…