MNBVC liwu
MNBVC: Massive Never-ending BT Vast Chinese corpus
- 種別
- dataset
- ライセンス
- mit
- 言語
- zh
- ダウンロード
- 103,490
- いいね
- 650
- アクセス
- public
- ファイル
- 0
タグ
- 事前学習コーパス
- 大規模データセット
- 多言語
- テキストデータ
- コードデータ
- 言語モデリング
- 日本語コーパス
概要
MNBVCは継続的に更新される巨大な中国語インターネットコーパスデータセットです。学術論文、ブログ、書籍、コード、クローラー、フォーラム、ゲーム対話など多種多様なサブセットで構成されています。大規模言語モデルの事前学習や言語モデリング、マスク言語モデリングの訓練に適しており、streaming形式で効率的にロード可能です。
README
--- annotations_creators: - other language: - zh language_creators: - other license: - mit multilinguality: - monolingual pretty_name: MNBVC size_categories: - unknown source_datasets: - original task_categories: - text-generation - fill-mask task_ids: - language-modeling - masked-language-modeling…